输入和软决策头都有成本。
直接从模型已有的表示中读出决策,而不是先让它生成书面解释。
从探针,走向决策系统。
早期 0.5B / 2B 存档检验小型读出头能提取多少信息。v0.1.0 已实现更丰富的候选决策路径:Qwen3.5-9B 视觉主干 + 置换等变集合注意力 + Planning MoE / CP-SAT 门控。架构已经演进;历史分数仍是原型测量,不是发布版基准。
- 共享视觉预填充
Qwen3.5-9B 将图像与提示编码为可复用的缓存上下文。输入处理仍有计算成本。
- 候选直接读出
从模型 logits 对给定候选评分,无需自回归生成答案或书面思维链。
- 集合注意力
配置的双头路径提供候选自注意力与状态交叉注意力。置换等变约束顺序行为,不保证语义正确。
- 规划与约束
配置的 Planning MoE 与 CP-SAT 门控参与选择。实际检查范围取决于约束、求解器可用性及路由配置。
实现边界:视觉 logit 评分与集合注意力是不同调用。视觉评分器本身不运行 DeepSetAttentionHead;decide_visual 将状态包交给 decide,配置的双头路径可使用集合注意力。代码并未将 visual_hidden 直接接入该头。图中连线表达模块职责与路由,不表示同一个张量依次穿过全部节点。
零生成词元,不等于总计算深度固定。 规划可以在内部增加依赖步骤。只有整条管线满足固定深度假设时,论文的条件性电路界限才适用。集合等变性也不会消除标签偏差或所有平局处理影响。
每个结果,都要交代来源。
仅在严格加载双头检查点成功后,weights_loaded_from_checkpoint 才为真。应同时检查 scorer、degraded 与 degraded_reason;CPU 评分器另有 scorer_synced_from_checkpoint 同步状态。回退或随机初始化结果不能冒充训练模型结果。该标志描述双头权重,并不认证全部主干权重,也不能追溯修复旧存档的来源缺口。
视觉引擎另有 is_loaded / is_real 状态,缺少真实 VLM 权重时拒绝评分。底层决策路径的 formal_verification 区分 cp_sat_verified、求解器不可用与 Python 谓词过滤;decide_visual 并不转发全部底层验证字段。
严谨验证,推动系列共同演进
论文 2 · 发现、隔离、闭环修复。 Rust 规划器的 F01–F09 故障关闭回归拒绝非法转移与奖励、保留门控上下文,并复验最终动作。记录的验收结果为 debug 与 release 各 11 项回归通过。历史 NaN 拒绝失效已不是当前 Rust 生产路径的行为;这些软件检查并不认证物理执行器或每个独立 Python 模型入口。
论文 5 · 延迟必须对应实际路径。 用户提供的发布简报给出原生 Rust 生产路径约 1–3 ms 的参考。签入的 ci_logs/rust_test_verbose.log 确认 31 项生产管线测试在 0.10 s 内通过;另一份运行记录为 0.15 s。未找到可确立 1–3 ms 的逐请求基准,因此它仍是待验证参考,不是实测延迟保证。套件总耗时属于聚合测试证据,不能当作逐请求延迟分布。旧的 746.7 ms Python/模型测量不是当前原生路径延迟;两者也都不代表完整 Qwen3.5-9B 视觉推理。视觉路径单独返回 visual_prefill_ms、scoring_ms 与 latency_ms。
发布标签与所检查本地修改:gen-zero v0.1.0 @ dce82330da45;python/gen_zero/client.py(decide_visual、检查点加载与结果元数据);python/gen_zero/model/dual_head.py;crates/gen-zero-planner/tests/fault_regression_tests.rs;docs/architecture/fault_regression_evidence/README.md。下方控件是教学模拟或存档可视化,不会在浏览器中运行发布版模型。
收缩型隐状态更新:可检验的路径
循环更新隐状态可以在不生成推理词元的情况下增加随输入变化的计算深度。这是形式化设计,不能据此声称当前生产决策路径已训练或运行该更新器。
展开推导与证据限制
Banach 收敛有前提:U 必须是完备度量空间上的自映射,且 Lipschitz 常数 γ < 1。LayerNorm 与学习门控不会自动保证此界。满足前提时,相邻更新距离按几何级数缩小。
定理 3 · 条件性表达力
若完整更新族执行 R = n 个相依步骤,且能够实现所需的随长度变化的组合,其深度就不再一致地固定。单次解码器的固定深度 TC⁰ 界限因而不适用。这本身不能证明 NC¹ 分离、模型已实现或基准优势。
CLUTRR · 十跳关系组合
S2 · 双向中途汇合折叠
64.75%35.25% refusalS3 · CYK 路径格 / 图表折叠
99.18%121/121 correct · 0 errors · 0.82% refusal历史 Gen-2 参考值,测试共 122 行;准确率把拒答计入分母。S3 回答 121/121 且全部正确,0 次错误,因结构歧义拒答 1 行(0.82%)。来源 README 说明原始重跑日志不在当前检出目录;记录的跨跳数测试二进制耗时为 1.05 秒,不能据此声称完整套件低于一秒。
MultiNLI · 隐状态迭代
90.30% 是本站其他位置报告的单次线性探针比较值。已检查证据中没有配对的 MultiNLI 更新器运行或逐步残差轨迹。γ ≈ 0.42、5–8 步和 ‖Δₜ‖ < 10⁻⁴ 是待验证目标,不是实测收敛。
证据边界:研究仓库 README(历史 CLUTRR 表,缺少重跑日志);本站 smoke-preview 记分卡(90.30% 探针)。两者都不是配对更新器证据。
为什么要写一篇文章
只为说“是”?
二元答案最多承载 1 比特信息。然而,推理模型可能在作出决定前生成数百个词元。这些词元 是计算账单,有时也是有用的工作空间。
自回归生成是一连串步骤:生成一个词元,把它送入不断增长的上下文,再生成下一个。思维链可以保留中间结果,供后续步骤使用。即使有缓存,每个新词元 仍需要另一次解码步骤。
零词元 读出走的是另一条路径。处理输入,收集其隐状态表示,再让一个小型软决策头选择标签。如果所需的区分已经可访问,写出来可能没有必要。如果尚不可访问,便宜的读出也不会凭空补上缺失的计算。
先写,再决策
模型并不总是需要数百个词元 来做二元决策。这是需要测试的权衡,不是普遍要求。
先读,再决策
“零词元”指生成的输出词元为零。它不表示输入词元、延迟或能耗为零。单次前向图是概念示意:CPU 候选选择实现也会从提示的缓存状态运行候选续写,然后再给它们打分。生成词元为零并不意味着只调用一次主干网络。
感受词元税。
拖动参数。比较一次隐状态直出与生成 50 或 300 个推理词元。这是透明的服务成本玩具模型,不是论文基准。
额外实验:可配置的美元成本
延迟与成本实验台
示意模型 · 输入相同| 路径 | 延迟 | 算力成本 | 吞吐量(次/分钟) |
|---|---|---|---|
| 0词元 | 0.205 s | $0.114 | 292.7 |
| 50词元 | 1.200 s | $0.667 | 50.0 |
| 300词元 | 6.200 s | $3.444 | 9.7 |
展开详情:方程与省略项
令 P 表示输入处理时间(秒),H 表示软决策头时间,R 表示解码速率,N 表示推理词元 数。T₀ = P + H;Tₙ = P + N/R。串行吞吐量 = 60/T 次/分钟。每 1,000 次决策的成本 = 1,000 × T × 每小时价格 / 3,600。
比较不包含最终答案词元生成、网络延迟、队列、批处理、分词、候选准备和空闲容量。输入时间相同、硬件价格相同是前提。它既不估算 API 账单,也不估算能耗。只有当决策足够准确时,更快的路径才有用。
零词元与思维链对比
延迟与成本模拟器
示意模型 · 非基准测量一次前向传播读取提示。生成会为输出词元增加重复前向传播。移动控件,查看这些重复如何改变延迟,以及传入查询所要求的权重流量速率。
左右滑动图表,查看每个柱条末端的数值。
查看假设与公式:模拟器参数
9B 档位仅扩展上述教学公式,不测量 Qwen3.5-9B 视觉推理或 Rust 规划延迟。
20 ms 与 850 ms 的比较是输入 512词元、模型规模 2B 时的示意参考点。这不是本文建立的匹配测量结果。思维链按 40 个生成词元 建模:一次预填充加 40 个解码步骤。
延迟: 预填充 = 20 × (参数量 / 2B) × (输入词元 / 512) ms;解码 = 40 × 20.75 × (参数量 / 2B) ms。这些简单线性规则是教学假设,不是硬件预测器。QPS改变流量需求,不改变孤立查询延迟;不计入排队。
权重流量: 假设每个参数占 2 字节,每次前向传播完整读取一次权重,不批处理且不复用缓存。零词元 = 读取一次;思维链= 读取 41 次。GB/s = 每次查询的 GB × QPS,使用十进制 GB。提示长度不改变这个仅权重的估算;注意力、KV 缓存流量、激活值、软决策头开销和设备限制均不计入。此处的 0.5B 设定是假设使用 16 位存储,与下方 PAWS INT8 存档不同。这里的成本指流量,不是美元报价。每张图都会重新缩放其标注的坐标轴。
站点数量固定的
工厂。
想象一座工厂:输入变长时可以扩宽,但从不增加串行装配站。这就是固定深度。
工人很多,阶段数相同。
每个阶段内,大量工人并行工作。在 TC⁰ 中,阈值门可以检查许多输入比特,并提出“这些比特中至少有一半为 1 吗?”之类的问题。多项式规模限制了工人数量的增长速度。
“一致”意味着有一套系统方法,为每种工厂规模布线。它不是一个装满针对每个输入预先算好答案的独立工厂。
深度就是依赖链。
固定的 Transformer 层堆栈让人想到这条装配线。生成另一个词元会复用该堆栈,让后续计算依赖于新写入的中间结果。
Transformer 层并不字面上等于一个阈值门。论文假设对整个流水线进行固定深度的阈值模拟,且精度有界、编码规模受多项式约束。仅凭模型名称无法确立这一假设。
额外实验:单次前向的层追踪
追踪信号穿过各层
概念图输入已就绪。前进,观察信息如何经过四个示意层和一个软决策头。
四个层是示意图,不代表任一受评模型的架构。在草稿视图中,每个新词元 都会加入上下文;缓存状态可以复用。重复会增加依赖计算,但不会自动保证准确性。
奇偶校验:一个适合的抛硬币问题。
从一枚反面朝上的硬币开始。每个 1 都把它翻面;每个 0 都不动它。最后是正面吗?这只取决于 1 的数量是否为奇数。
你可以顺序翻动硬币。但阈值门可以并行测试所有可能的计数阈值,识别奇数总数,并在固定数量的阶段中合并结果。奇偶校验属于一致 TC⁰。有状态依赖本身并不会让任务变难。
试试看:切换输入比特
翻转 3 次 · 奇数 · 正面
这个小例子说明了规则。论文的构造适用于任意输入长度,深度固定且规模为多项式。
简便路径何时失效
现在想象一串重新排列五个对象的指令。要确定最终排列,指令顺序很重要。论文研究的是一个具有 120 种状态的特定置换乘积任务,不是所有状态机。
该限制是有条件的:假设非一致类 TC⁰ 与 NC¹ 不同,固定深度、可用阈值模拟的流水线无法在每个输入长度上正确解决这一指定任务。
循环机器可以逐条指令更新状态。并行树也可以合并转换,其深度随序列长度对数增长。书面思维链是增加计算的一种方式,但不是唯一方式。
这个定理说明了什么——又没有说明什么
TC⁰ ≠ NC¹ 的分离是一个假设,而非本文证明的结果。结论涉及一族渐近问题和指定的计算假设。它不能证明有限基准不可能、所有有状态任务都很难,或训练好的模型会学会构造性的循环算法。它也不能解释某个单独的算术错误。
电路
深度探索器
理论 · 条件边界注意力可以在一层中跨越序列。这样的触达不同于反复更新状态。点击一个转换查看其路径,然后切换到循环计算。
左右滑动图示,查看每个转换。
三个层是示意图,不是模型规格。突出显示的路径展示信息访问,不是测量得到的注意力,也不证明每层只能执行一次转换。
数学边界在哪里?
论文研究五个符号的置换乘积(群 S₅,有 120 种状态),询问乘积是否等于一个固定的非单位五循环。假设非一致 TC⁰ ≠ NC¹,多项式规模、固定深度、可用阈值模拟的流水线无法在每个输入长度上正确判定这一语言。
该假设涵盖整个流水线:编码、主干操作、候选计算和读出。它不是针对所有 Transformer 或所有串行任务的无条件不可能性定理。例如,奇偶校验属于 TC⁰。这个有限的八转换演示本身很容易解决。
重复状态更新会增加依赖计算。它们可以表现为生成的词元,也可以在内部执行且不生成词元。均衡的并行组合也能以 O(log n) 深度解决置换乘积。思维链 提供额外计算的机会,但不保证推理正确。
早期原型的
预测账本。
这些早期 0.5B / 2B 原型存档标定经验边界,不代表 v0.1.0 性能。样本混合不同、历史执行来源仍未解决,都是应保留的研究记录。新版候选架构见上文;本展页没有用它重新评测这些样本。
Qwen3.5-2B · GPU 存档
宏平均准确率:13 个任务,390 个样本。每个任务贡献 30 个样本。
254/390 正确;宏平均和微平均准确率均为 65.1282%(四舍五入为 65.13%)。预测行与错误计数相互吻合。完整提示以及经认证的“执行到检查点”关联仍不可用。这是存档声明,不是经认证的模型性能。
Qwen2.5-0.5B · INT8 CPU 存档
宏平均准确率:13 个任务,930 个样本。训练得到的低维软决策头读取冻结的主干。
357/930 正确;微平均准确率为 38.3871%(四舍五入为 38.39%),宏平均准确率为 32.5513%(四舍五入为 32.55%)。恢复出的账本与计数相符,但未重放推理。宏平均均匀随机机会为 33.16%;宏平均多数类基线为 48.08%。
“唯唯诺诺”
失败模式。
PAWS 询问两个句子是否含义相同。相似词语可能掩盖不同含义:“狗追猫”和“猫追狗”共享词汇,却颠倒了谁做了什么。
上面的句对是虚构示例,不是存档测试行。
在 0.5B CPU 账本中,系统将全部 400 对都判为同义改写——预测完全坍缩为单一类别,达到 100%。其中一半确实是同义改写,一半不是。50% 的准确率掩盖了一个从不识别负类的分类器。
400 个答案。
一个重复的标签。
这是观察到的预测坍缩,并不能证明隐状态表示相同,也不能证明有已知的内部原因。投影、决策头训练、候选偏好、量化和提示仍是相互竞争的解释。
相同样本,两幅截然不同的图景。
每个方格代表 4 个样本。为清晰起见分组显示,不按原始行顺序排列。
实际标签:200 个同义改写,200 个非同义改写。
| 实际类别 | 判为是 | 判为否 |
|---|---|---|
| 同义改写 | 200 | 0 |
| 非同义改写 | 200 | 0 |
非同义改写召回率:0%。所有负类样本均未识别。
PAWS
坍缩可视化器
存档发现 · 400 次决策在这项同义改写任务中,INT8 Qwen2.5-0.5B 系统每次都回答“同义改写”。一半答案正确。另一半揭示出一个从未选择第二类别的分类器。
左右滑动图表,比较两类。
每个输入都得到同一个答案。两个真实类别都落在同一预测类别中。单看准确率会掩盖这一失败。
颜色和形状编码真实标签。显示标签后即可分开两组,而无需改变任何预测。
展开详情:混淆矩阵及其能说明什么
| 真实标签 | 预测为同义改写 | 预测为非同义改写 |
|---|---|---|
| 同义改写 | 200 | 0 |
| 非同义改写 | 200 | 0 |
观察结果:预测完全坍缩。未解决问题:是表示偏差、信息丢失、训练得到的读出头,还是其他流水线问题导致了这一结果。标签相同并不能证明隐状态表示相同。
该图重建了已核验的计数;标记不与单个样本 ID 关联。它没有臆造概率分数、嵌入几何或可分离的替代模型。账本已核对,但论文未重新运行推理。
草稿区有其作用。
多步数学要求模型保留中间量并正确使用它们。移除书面工作区,可能会移除一条有用的解题路径。
想象一个摊位有 18 个鸡蛋。它留下 3 个,用 5 个烘焙,其余每个卖 2 美元。计算过程很简短,但每一步都把信息传给下一步。
示意题;不是计分题,也不是对存档提示的重建。
早期 GSM8K:经验边界
| 存档 | 正确 | 准确率 |
|---|---|---|
| 2B GPU | 3 / 30 | 10.00% |
| 0.5B CPU | 53 / 200 | 26.50% |
均匀四选一猜测的预期准确率为 25%。CPU 的 95% Wilson 区间为 20.87–33.02%,包含该基线。
失败不等于不可能性证明。
这些配置表现很差。但存档没有比较同一个模型在有无草稿区时的表现。因此无法证明缺少思维链导致错误,也无法证明所有前向传播模型都会算术失败。
GPU 切片把每个正确答案都放在 A 位,因此始终选择 A 会得到 100%。CPU 切片平衡 A–D。GPU 错误记录还包含一个来源未解决且不完整的提示预览。标签位置、样本量和协议不同,无法进行配对比较。
少写一些。
仍有更多
需要证明。
当表示已经携带可访问的答案时,隐状态软决策头可能很有用。这一主张比“免费推理”更窄,也更易检验。
下一项关键实验应固定样本、提示、候选和模型,然后比较直接读出、候选评分、生成式推理和训练得到的潜在循环。测量准确率,同时记录所有主干调用、生成词元和端到端延迟。
问题不只是“它决定得有多快?”而是“是什么计算让这个决定可靠?”
源代码快照:v0.1.0 / HEAD = dce82330da45。所检查的工作区还含本地 Python 修改,包括更细的评分器来源报告;这些新增内容并非全部属于不可变发布标签。本展页没有重新运行模型推理或 Rust 基准。
来源说明与阅读指南
论文 1——零词元决策电路:自回归模型中前向传播门控的表达能力界限与经验限制。
本伴读基于所提供的 draft.md 和 paper.tex。它加入解释性类比和互动示意,不加入新的模型实验。
所有视觉资产、样式和脚本均已嵌入,字体使用本机系统字体。直接在浏览器中打开此文件即可,无需联网。
理论: §3,命题 3(奇偶校验)、命题 4(流水线闭包)、定理 1–2(有条件的跟踪界限与循环)。
分数: §§5.2–5.3;§5.6 中的宏平均与微平均。失败: §§6.1–6.2。来源: §6.5 及附录中的主张—证据映射。
审计产物: evidence/audit.py、evidence/revision_checks.py、以及evidence/failure-mode-diagnostics.json。计数核对不等于重新运行推理。
Gen-Zero 模型架构
与神经管线
冻结的语言模型提供表示和似然。专用的决策、对齐与风险路径以不同方式使用它们。空间世界模型是独立的学习分支。探索各层并检查其张量形状。
代码审计: · gen-zero @ dce82330da45。实线箭头表示已实现的数据流;虚线箭头表示拟议的调度契约。这些组件不是一个统一部署的串行管线。
实现边界:视觉 logit 评分与集合注意力是不同调用。视觉评分器本身不运行 DeepSetAttentionHead;decide_visual 将状态包交给 decide,配置的双头路径可使用集合注意力。代码并未将 visual_hidden 直接接入该头。图中连线表达模块职责与路由,不表示同一个张量依次穿过全部节点。
所有流程均可见。选择一个层以查看其维度和证据。
在窄屏上水平滚动图表。每个层都可用键盘选择;源代码注释还提供文本版本。
检查一个模型层
选择任意方框以查看其张量维度、机制和实现限制。使用 Tab,然后按 Enter 或空格,或用指针选择。
实现证据与架构边界
主干网络来源。client.py 的视觉入口配置 Qwen/Qwen3.5-9B,共享图像与提示的预填充。0.5B / 2B 探针分数及 72B / 70B 对齐特征属于独立的研究存档;它们的维度与分数不能充当 9B 发布路径的规格或评测。
训练范围。 在这些路径中,Transformer 权重保持冻结。语义门使用 16 个带标签的上下文内示例和差分对数似然(PMI),不拟合安全头。空间模型仍有学习得到的结果/奖励头;监督式对齐头也仍然存在。“不对主干网络微调”并不意味着没有下游训练。
安全范围。Rust 规划器的 F01–F09 故障关闭回归拒绝非法转移与奖励、保留门控上下文,并复验最终动作。记录的验收结果为 debug 与 release 各 11 项回归通过。历史 NaN 拒绝失效已不是当前 Rust 生产路径的行为;这些软件检查并不认证物理执行器或每个独立 Python 模型入口。
crates/gen-zero-model/src/choice_head.rs:候选自注意力/交叉注意力和单纯形 ETF 几何,Sₖ ⊂ ℝᵏ⁻¹。保留的直接 Rust 基准报告了 0/16,232 次身份翻转(0.00%),表示和候选身份固定时如此;最大概率漂移为 5.96 × 10⁻⁸。论文证据:equivariant-choice-head/evidence/revision/results.json。python/gen_zero/world_model/neural_dynamics.py:[B,64] 状态 + [B,16] 动作 → [B,80] 拼接 → Δz=f(z,a) → z′=z+Δz;学习得到的 sigmoid 结果头。维度来自空间配置,而不是通用的类别常量。benchmarks/suites/geometric_latent_fusion.py:正交 Procrustes 诊断以及配对 SVD 的核心/残差特征。benchmarks/suites/evaluate_manifold_pareto_ensemble.py:监督式归一化 logit 融合,与几何投影不同。docs/zero/29-pubmedqa-aegis-unified-manifold-evaluation-closure.md:PubMedQA 78.40%(196/250),所选双头融合;Aegis Track A 81.60%(204/250),所选单 LLaMA 头。这些描述性结果不能证明统计上的优越性。python/gen_zero/service/semantic_risk.py和python/gen_zero/service/risk_data/report.json:冻结的 0.5B、16-shot ICL、三个顺序、重叠窗口、PMI 评分;AUC 0.944。诊断 τ=0.50 标记了 18/18 个危险请求和 7/18 个良性请求。实时阈值为 0.4494 / 0.7620。
每一层的文本版本
v0.1.0 视觉主干与历史研究存档
client.py 的视觉入口配置 Qwen/Qwen3.5-9B,共享图像与提示的预填充。0.5B / 2B 探针分数及 72B / 70B 对齐特征属于独立的研究存档;它们的维度与分数不能充当 9B 发布路径的规格或评测。
空间输入 · d=64 + 16
这些是工程化的空间特征,并非从 Transformer 隐状态投影而来。评估所用的空间配置将 z 与 a 拼接为 [B, 80]。该类支持可配置的状态和动作维度。
候选直接读出 · 缓存视觉上下文
decide_visual 依次调用 prefill_visual_context、score_candidates_direct,再进入 decide 的配置规划与约束门控。对给定候选评分,无需自回归生成答案。结果报告 direct_probs、visual_prefill_ms、scoring_ms 与 latency_ms;零生成词元不等于零推理成本。
语义评分 · 标量风险
对于每个请求窗口,从 log P(" dangerous") − log P(" safe") 中减去空请求的对数几率。对三个演示顺序求平均;使用风险最高的重叠窗口并应用 sigmoid。该语义门不使用新训练的神经安全分类器。标签 logit 来自冻结模型;模型不会生成解释。
残差空间动力学 · 80 → 64
neural_dynamics.py 使用带 LayerNorm 和 GELU 的残差 MLP。独立的学习得到的 sigmoid 结果/奖励头返回 [B];它保留在当前代码中,与冻结的语义风险门不同。该类默认隐藏宽度为 128,包含两个残差块;检查点配置具有权威性。
置换等变候选集合注意力
gen-zero-model / choice_head.rs 对稳定的 ActionId 排序,将共享表示投影到规则单纯形 ETF 上,按规范顺序评分,再将概率映射回调用方顺序。定义良好的决策依赖于唯一 ID、有效维度、有限输入和确定性的平局处理。在洗牌时,候选成员、身份和共享表示必须保持不变。
对齐与融合是独立路径
正交 Procrustes 使用 XᵀY 的 SVD 得到的 R=UVᵀ。GeometricLatentFusion 将该映射作为诊断信息存储;其特征使用配对 SVD 轴、尺度匹配的核心平均值和残差。监督式头从标签中学习。获胜的 PubMedQA 路径组合的是归一化头 logit,而不是 Procrustes 坐标:0.75 Qwen + 0.25 LLaMA。
实时阈值与诊断 τ=0.50
签入的服务使用两个边界:0.4494 用于升级,0.7620 用于硬停止。τ=0.50 是论文的二元分析阈值,而不是实时策略。在 36 个已存储案例中,它标记了 18/18 个危险请求和 7/18 个良性请求;实时层级对危险案例产生 12 次停止 + 6 次升级,对良性案例产生 9 次升级。
F01–F09 · Rust 故障关闭回归
历史 Rust NaN 拒绝失效已隔离并修复。F02/F03 拒绝非有限转移奖励及后继坐标;F06 在候选选择、搜索及最终预测中检查危险;F09 拒绝非法熵。11 项回归在 debug 与 release 中覆盖 F01–F09。这是软件边界,不是物理电机停止认证。
结果来源 · 检查实际路径
联合读取 weights_loaded_from_checkpoint、scorer、degraded 与 degraded_reason。视觉引擎单独要求真实权重已加载,is_loaded / is_real 描述其状态。双头检查点标志本身不能证明本次结果来自训练后的神经评分器。独立的历史 Rust ETF 基准记录了 0/16,232 次身份翻转;该结果不测量视觉候选准确率。
评估 · 所选配置
PubMedQA 选择了 fuse0.75+bbp|raw(双头归一化 logit 融合)。Aegis Track A 选择了 llama+bbp|raw(单模型头)。这些是描述性的本地测试结果,并非经过验证的 SOTA 或普遍适用的对齐增益。两个任务的宏观 bootstrap 区间包含零。
风险证据 · 小型精选套件
AUC 为 0.944444,来自 18 个危险请求和 18 个良性存储请求。在 τ=0.50 时,危险召回率为 18/18,并有 7 个良性标记。裸 chmod 回归探针仍然漏检。实现记录真实计算时间;缓存提示会减少重复设置,但不会消除推理延迟。
已检查的决策 · 物理调度另行集成
修复后的 Rust 生产路径在返回决策前校验转移与策略。持久化硬件调度锁存器是另一项集成契约。不能将已经关闭的 Rust 规划器缺陷与独立的 Python neural_dynamics.step 方法混为一谈,也不能用决策账本证明执行器已安全执行。
Gen-Zero 系统架构与流程
Rust 运行时连接入口、策略、规划、决策头和加密审计。下面的图按职责进行分组;所选动词决定实际调用路径。
源代码审计:2026 年 9 月 29 日 · gen-zero@dce82330da450d9938822f9db37c61cd29be2e49。连线已由源代码验证;不声称有新的部署或模型评估。
选择一个层以检查其实现和限制。
此处未实现的内容
请求的 AST 解析器 + Linux capabilities 栈、物理碰撞检查以及持久化的故障关闭锁存器,在这些 Rust crate 中都不是一条集成的执行路径。无效输入拒绝和策略升级已经存在;它们并不构成沙箱或物理停止。
这些服务路径返回决策和模拟结果。决策账本不能证明外部动作已经执行。
从请求到响应
- 进入并绑定。 CLI 或 MCP/HTTP 服务接收请求。路由器捕获其挂载快照,验证路径特定的字段并选择动词。
- 评估请求。 文本
ask、route和imagine从 Python 桥接获取语义风险。缺失或无效的风险会升级;硬停止层级会阻断该路径。选择动作时也会应用策略约束。 - 使用请求的路径。 文本 ask 使用语义评分;不可用时使用明确标注的 first-feasible 后备路径;未经评估的风险仍会升级。文本 route 在其桥接无法运行时报告不可用。数值规划使用
gen-zero-planner和gen-zero-worldmodel;simulate、what_if和影子audit暴露未经训练的先验。显式 ETF 头使用规范化动作 ID 和单纯形投影。数值认知请求有自己的几何验证路径。 - 门控、记录并返回。 动作选择路径将策略判定与请求风险结合。成功的
ask结果以及带有决策追加的pipeline decide结果,会在返回经审计的结果前追加到来源账本。响应包含路径元数据;它不会调度外部命令。
源代码地图与各层完整描述
入口层
gen-zero-cli · gen-zero-service — CLI 启动 McpServer 或提交决策。服务通过 stdio 和 HTTP/SSE 接受 MCP,同时提供 REST 路径。其 zero 路由器绑定不可变的挂载快照并按动词调度;这些是经过共享 crate 的不同路径。
位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-cli/src/main.rs; gen-zero-service/src/server.rs; gen-zero-service/src/zero.rs
门控与安全
gen-zero-gate — PolicyGate 支持形式化约束、确认注册、熵和语义风险层级。其默认状态没有已注册的约束或确认动作。文本 ask、route 和 imagine 使用 Python 语义风险桥接;缺失或格式错误的风险会升级。Shell AST 解析和 Linux 进程能力强制执行没有接入此 Rust 门控。
位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-gate/src/policy.rs; gen-zero-gate/src/risk.rs; gen-zero-service/src/bridge.rs
规划与动力学
gen-zero-planner · gen-zero-worldmodel — 数值潜变量请求可以使用 MCTS、MPC-CEM 或 A*。服务暴露未经训练的残差或辛动力学,并进行有限输入检查和终态危险处理。规划会筛掉被门控硬停止的候选;固定计划模拟仍会执行被阻断的动作并记录其门控层级。这是离线动力学筛选,并非经过验证的物理碰撞检查。没有持久化故障关闭执行锁存器接入此 Rust 路径。
位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-service/src/worldsim.rs; gen-zero-planner/src/pipeline.rs; gen-zero-worldmodel/src/dynamics.rs
决策核心
gen-zero-model — ActionETFChoiceHead(软决策头,Softmax)对稳定的 ActionId 排序,将共享表示投影到规则单纯形,将分数散射回调用方顺序并应用 softmax。核心具有确定性的近似平局规则。服务通过显式的头选项暴露 ETF;普通文本决策使用语义桥接,因此 ETF 并不是每个请求的默认头。
位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-model/src/choice_head.rs; gen-zero-service/src/zero.rs
验证与审计
gen-zero-provenance — DecisionAuditEntry 包含前一个 MMR 根。带密钥的 BLAKE3 Merkle Mountain Range 提交决策历史并支持包含证明。成功的 ask 结果以及 pipeline decide 结果(带决策追加)会被记录。通过 GENZERO_MMR_PERSIST_PATH 持久化是可选的;最后 4,096 个叶子保留包含证明,且必须在外部保留可信根;这不是执行审计,不能证明外部 shell 命令或电机动作确实运行。
位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-provenance/src/entry.rs; gen-zero-provenance/src/mmr.rs; gen-zero-service/src/zero.rs
相关的运行时基础设施包括 gen-zero-core(共享类型)、gen-zero-lod(图事实)、gen-zero-storage(快照)以及可选的 gen-zero-nanocore 路径。下方或上方的论文实验属于研究证据,不能替代此运行时地图。