← Gen-Zero ホーム技術解体新書English中文版PDF: 近日公開

当世界モデル
失去世界。

予測下一步是一回事。设想完整旅程,并知道何时停下,是另一回事。

Paper 2 的互动伴读:“可予測性边界、潜在记忆与神经空间动力学中的认证安全。”

进入互动实验
F01–F09 Pass全6エンジンの Fail-Closed ゲート(11/11テスト合格)
3 Dynamics残差・シンプレクティック・接触の3動力学
0.00%終端ハザード違反の逸脱率
100%決定論的潜在トレース再生

一个可靠的下一步。
一段更不确定的旅程。

世界モデル予測状态在动作之后如何变化。把它的予測反馈给自身,小误差就可能累积。操控智能体,然后切换视图,比較相同的动作历史。

二维网格世界 · 合成预演示意互动示意
带有障碍物、智能体和目标的网格世界使用带标签的方向按钮,或聚焦此地图后使用方向键。实线绿色表示真实运动;虚线橙色表示示意性的神经模型预演。目标8 × 8 示意世界 · 边界受限
真实智能体予測虚影目标障碍物
选择予測视图
步进仿真

尝试向右撞上墙。设想中的智能体也会停下吗?

已执行动作0 / 60
轨迹漂移 · 单元格0.00

已就绪。向上移动四步,再向右移动五步即可到达目标。

此示意能展示什么,也不能展示什么。 这些路径是确定性的教学模拟,不是检查点推断。轨迹漂移是刻意编写的,并非根据报告的 MSE 计算得出。两条虚影路径都使用真实碰撞结果,加上预设的漂移和穿墙泄漏因子;它们不是独立的模型予測。论文中的“已见”和“新颖”指精确的状态–动作输入字节,并不表示独立布局或新的生成分布。真实数据使用 64 维工程化状态向量 和 16 维动作嵌入 表示三个相对航向的动作(左、直行、右)。检查点使用残差转移网络和独立的 sigmoid 安全网络。这些是工程化空间特征,并非学习得到的语言模型嵌入;此图使用四个基本方向。
一步验证测量结果 · 精确输入重叠分层
分层样本状态 MSE安全准确率
已见输入1,1020.01020299.9093%
新颖输入5900.02458499.3220%

新颖输入 MSE 约为已见输入 MSE 的 2.41 倍。准确率针对二元安全分类,不代表精确状态予測或导航成功。“分布内”和“分布外”在此表示同一验证划分中的已见输入与字节新颖输入;这并不能证明存在分布偏移。该差距支持记忆化假设,但无法确定其原因。

熟悉的输入更容易。

数据集包含 1,620 个回合中的 8,146 条转移:来自 1,296 个训练回合的 6,454 条转移,以及来自 324 个验证回合的 1,692 条转移。精确状态–动作输入在训练集中与 1,692 条验证行中的 1,102 条(65.13%)重复;尽管回合 ID 不相交,精确回合序列仍与 324 个验证回合中的 181 个(55.86%)重复。

更长的想象改变了问题。

自回归第十步的 MSE 达到 0.16989,但只有 39 个符合条件的回合。它们全部确实安全,因此这个远期结果无法告诉我们模型检测晚期危险的能力。

v0.1.0:全6エンジンで F01–F09 に合格(11/11テスト)。以下の単純なクライアントは過去の欠陥を示す教材であり、現在の Fail-Closed ゲートの挙動ではありません。

一个自信的分数。
一个不可能的状态。

NaN 是“不是一个数字”。一次损坏的转移即使空间模型独立的结果/奖励头返回自信且有限的分数,也可能包含 NaN。注入这种确切类型的故障,观察两个客户端如何分叉。

NaN 异常注入器 & Fail-Closed 熔断保护电路同一故障 · 两种响应
故障位置:予測状态 · 分数保持有限

模式 A · 天真客户端模式

一个看似合理的分数绕过了无效状态。

已就绪
天真安全电路状态和安全分数输入仅检查评分的防护器,然后进入电机调度闸门。予測下一状态[0.2, 0.4, 0.1]空间结果头p = 0.999557仅检查评分的防护器安全:是电机已启用允许输出反馈
模型调用次数: 0动作下发次数: 0

已就绪,等待模拟推理周期。

模式 B · Fail-Closed 熔断保护模式

拟议 Fail-Closed 合约的示意。

保护已启用
Fail-Closed 安全电路有效性和分数检查先于动作调度。无效状态会设置持久的紧急制动锁存。予測下一状态[0.2, 0.4, 0.1]空间结果头p = 0.999557有效性检查 + 紧急制动锁存数值有限:是 · 制动锁存:0电机已启用仅反馈已通过检查的输出
模型调用次数: 0动作下发次数: 0

已就绪。拒绝会持续锁存,直到执行受控重置。

事件日志 · 模拟调度,无硬件制动锁存 = 0
  1. 00 · 监视器已布防。等待推理周期。

复现的故障;拟议修复。论文的真实客户端探针返回了非有限予測状态,其中 is_safe=True,并且分数有限,约为 0.999557。此面板演示了那条历史故障路径及拟议修复逻辑;论文没有修补或验证生产修复。当前 Rust 路由具有数值验证,但没有持久执行锁存;请见下方经源代码审计的运行时图。这里显示的三分量状态是对真实 64 维输出的教学简化。此处的不确定性诊断是合成的——被评估网络没有认识论不确定性估计器。模拟的调度阻断不是经过测试的物理电机停止。

“不小于”并不意味着有效。

在 JavaScript 和 IEEE 风格比較中,NaN < 0.5 为 false。仅检查评分的防护器也可能因此失效。此处演示的是 v0.1.0 之前的历史客户端缺陷:状态中是 NaN,而安全头分数有限。奖励检查捕获不到它。

锁存会记住故障。

注入后,尝试正常周期。Fail-Closed 监视器会在下一次推理和调度发生前将其阻断。只有单独的受控重置才能清除锁存。在オラクル環境中安全停下仍是另一项责任。

放行 = 有效 ∧(不确定性 ≤ 上限)∧(评分 ≥ 阈值)
制动下一时刻 = 制动当前 ∨ ¬放行

知道地图
就改变了游戏。

图规划器拿到了答案:精确转移和已知陷阱。学习型神经过滤器估计哪些候选看起来安全。比較它们掌握的信息,而不只是它们画出的路线。

特权图预言机对比学习型神经过滤器示意决策分叉

预言机 · 精确图访问

精确转移 + 特权陷阱成员关系

精确图预言机拒绝会吸收状态的东侧陷阱,并选择北侧绕行

东侧是已知的吸收陷阱。预言机将其剪除,绕行避开。

逐条边跟踪绿色路线。

神经过滤器 · 学习型估计

工程化状态 + 动作 → 予測状态 + 分数

学习型神经过滤器在没有特权陷阱访问权限的情况下分配示意安全分数

东侧得分 0.96 并通过过滤器——即使隐藏环境中存在陷阱。

东侧 · 陷阱
0.96
北侧 · 无险
0.92

合成分数经过刻意错误排序,用于揭示阈值判断的局限。这里不测量推理速度或校准。

报告的 100% 属于预言机诊断。100 个成对种子中,特权图前瞻在构造的诊断上取得 100/100 成功(100%),且陷阱为 0/100(0%)。它没有加载或运行神经模型。这是信息访问方面的特权上界基线,不能作为普适性能上界,也不能证明 MCTS 总是需要预言机,或证明神经控制不会碰撞。
每种方法知道什么,以及论文证明了什么
问题特权图规划器学习型神经动力学
未来来自哪里?精确的环境转移字典。在 6,454 条训练转移上拟合的残差转移网络;完整数据集包含 8,146 条转移。
如何识别危险?直接访问真实陷阱成员关系。学习型空间结果/奖励头,与冻结的语义风险闸门不同;高置信度不是证书。
评估了什么?构造的四个基本方向动作图诊断。使用三个相对动作的离线予測与安全分类。
什么角色有充分依据?拥有特权信息的预言机参考。离线估计器和候选快速安全过滤器;闭环安全性仍未确立。
阅读这些实验背后的证据边界

可予測性:精确字节重叠是对一次验证划分的事后分区。它没有消除共享布局、近似重复项或模型选择效应。报告的误差差距支持一个假设,但不能对记忆化作出因果诊断。

安全性:监视器的拒绝保证以完整中介、正确检查、原子化检查与调度,以及阻止执行的回退机制为条件。浏览器演示检查有限值、形状、分数范围和合成不确定性界限;它并非身份、检查点、中间值或物理回退验证的完整实现。

规划:名为 MCTS 的例程使用根节点赌博机分配与确定性的安全剪枝前瞻。该诊断专门构造来困住按坐标贪心的基线。其精确模型结果与神经模型的离线结果属于不同实验,动作接口彼此不兼容。

Gen-Zero モデルアーキテクチャ
与ニューラルパイプライン

冻结的语言模型提供表示和似然。专门的决策、アライメント和风险路径以不同方式使用它们。空间世界モデル是一个独立学习的分支。探索各层并查看其张量形状。

代码审计: · gen-zero @ dc0c2133f059。实线箭头表示已实现的数据流;虚线箭头表示拟议的调度契约。这些组件并非一条已普遍部署的串行管线。

所有流程可见。选择一个层以查看其维度和证据。

在窄屏上,请水平滚动图表。每层都可用键盘选择;源代码注释也提供文本版本。

Gen-Zero 多层アーキテクチャ与可检查的维度 冻结的骨干模型为隐藏状态选择与アライメント分支以及一个 16-shot 语义风险分支提供输入。独立的 64 维空间特征和 16 维动作输入残差动力学。虚线输出检查和硬件调度紧急制动锁存器仍是拟议内容。选择一个节点查看详情。 冻结的骨干权重冻结的 Transformer 骨干模型 Qwen2.5-0.5B · Qwen3.5-2B · Qwen2.5-72B · LLaMA-70B 这些读出路径不对骨干参数进行微调 空间输入 · d=64 + 16空间观测 工程状态 z: [B, 64] 动作向量 a: [B, 16] 隐藏状态读出 · [B, T, d] → [B, d]零 token 隐藏状态读出 最后 token / 池化向量 h: [B, d] d=896 (0.5B) · d=8192 (72B / 70B) 语义评分 · 标量风险快速语义风险门 冻结的 0.5B · 16-shot ICL 3 个顺序 · 差分 PMI 残差空间动力学 · 80 → 64残差世界动力学 [B, 80] → Δz: [B, 64] z′ = z + f(z, a) 选择几何 · k 个动作 → k−1 个维度等変選択ヘッド 规范 ActionId 排序 Simplex ETF Sₖ ⊂ ℝᵏ⁻¹ アライメント与融合是独立路径異種モデル間アライメント 配对 SVD / Procrustes 监督头 + logit 融合 实时阈值与诊断 τ=0.50语义策略层级 升级 ≥ 0.4494 紧急制动 ≥ 0.7620 NaN / Inf 安全境界 · v0.1.0 Fail-ClosedFail-Closed 熔断保护边界 代码:checkpoint + 输入检查 F01–F09 · 11/11 测试通过 洗牌结果 · 已测量、有范围稳定的动作身份 观察到 0.00% 洗牌翻转 在输入固定条件下 评估 · 所选配置所选测试结果 PubMedQA: 78.40% · 196/250 Aegis: 81.60% · 204/250 风险证据 · 小型精选套件存储的风险评估 AUC 0.944 · 36 个请求 τ=0.50:18/18 危险召回 调度契约 · 拟议、未部署已检查的调度契约 拒绝 NaN / Inf 输出 保持紧急制动,直到受控重置 即使不生成答案 token,仍需要输入处理、评分和真实计算。

检查一个模型层

选择任意方框查看其张量维度、机制和实现限制。使用 Tab,再按 Enter 或 Space,或使用指针选择。

实现证据与アーキテクチャ边界

骨干来源。 Qwen2.5-0.5B (d=896)、Qwen3.5-2B、Qwen2.5-72B (d=8192) 和 LLaMA-70B (d=8192) 是文档记录的层级。LLaMA-3.3-70B 是请求的目标,但保留的大模型提取元数据标识为 LLaMA-3.1-70B。尚未建立经过验证的 3.3 提取结果。

训练范围。 Transformer 权重在这些路径中保持冻结。语义门使用 16 个带标签的上下文示例和差分对数似然(PMI),不拟合安全头。空间模型仍有学习得到的结果/奖励头;监督アライメント头也保留。“不对骨干微调”并不意味着没有下游训练。

v0.1.0 · Fail-Closed. v0.1.0:全6エンジンで F01–F09 に合格(11/11テスト)。形式的な Fail-Closed ゲートは非有限の無効な結果を拒否する。ブラウザのラッチは安全契約の例示であり、ソフトウェアテストは物理的なモーター停止を認証するものではない。

  • crates/gen-zero-model/src/choice_head.rs:规范 ActionId 排序与 Simplex ETF 几何,Sₖ ⊂ ℝᵏ⁻¹。保留的直接 Rust 基准报告,在表示和候选身份固定时,身份翻转为 0/16,232(0.00%);最大概率漂移为 5.96 × 10⁻⁸。论文证据:equivariant-choice-head/evidence/revision/results.json。
  • python/gen_zero/world_model/neural_dynamics.py:[B,64] 状态 + [B,16] 动作 → [B,80] 拼接 → Δz=f(z,a) → z′=z+Δz;学习得到的 sigmoid 结果头。维度来自空间配置,而非通用的类常量。
  • benchmarks/suites/geometric_latent_fusion.py:正交 Procrustes 诊断与配对 SVD 核心/残差特征。benchmarks/suites/evaluate_manifold_pareto_ensemble.py:监督归一化 logit 融合,与几何投影不同。
  • docs/zero/29-pubmedqa-aegis-unified-manifold-evaluation-closure.md:PubMedQA 78.40% (196/250),选定双头融合;Aegis Track A 81.60% (204/250),选定单一 LLaMA 头。这些描述性结果无法证明统计优势。
  • python/gen_zero/service/semantic_risk.py 和 python/gen_zero/service/risk_data/report.json:冻结的 0.5B、16-shot ICL、三个顺序、重叠窗口、PMI 评分;AUC 0.944。诊断 τ=0.50 标记 18/18 个危险请求和 7/18 个良性请求。实时阈值为 0.4494 / 0.7620。
每层的文本版本

冻结的骨干权重

Token ID [B, T] → 隐藏状态 [B, T, d]。Qwen2.5-0.5B 使用 d=896;归档的 Qwen-72B 和 LLaMA-70B 特征使用 d=8192。此处 Qwen-2B 指 Qwen3.5-2B。LLaMA-3.3-70B 是请求的目标;保留的提取元数据标识为 LLaMA-3.1-70B,因此这些测量无法验证 3.3 checkpoint。冻结表示不对骨干微调;监督下游头和空间动力学仍需拟合。

空间输入 · d=64 + 16

这些是工程化空间特征,并非从 Transformer 隐藏状态投影而来。评估的空间配置将 z 和 a 拼接为 [B, 80]。该类支持可配置的状态和动作维度。

隐藏状态读出 · [B, T, d] → [B, d]

从前向计算读取隐藏状态而不生成答案 token。池化方式由编码器决定;归档的大模型特征使用最后 token 池化。CPU 候选选择路径还会使用提示缓存评估候选续写。因此,零输出 token 并不意味着只调用一次骨干模型或没有推理成本。

语义评分 · 标量风险

对于每个请求窗口,从 log P(" dangerous") − log P(" safe") 中减去空请求的ロジット。对三个演示顺序取平均;使用风险最高的重叠窗口并应用 sigmoid。这个语义门不使用新训练的神经安全分类器。标签 logits 来自冻结模型;它不会生成解释。

残差空间动力学 · 80 → 64

neural_dynamics.py 使用带 LayerNorm 和 GELU 的残差 MLP。一个独立学习的 sigmoid 结果/奖励头返回 [B];它仍在当前代码中,并与冻结的语义风险门不同。该类默认隐藏宽度为 128,包含两个残差块;checkpoint 配置具有权威性。

选择几何 · k 个动作 → k−1 个维度

gen-zero-model / choice_head.rs 对稳定的 ActionId 排序,将共享表示投影到规则シンプレックス (単体) Simplex ETF,按规范顺序评分,再将概率映射回调用方顺序。定义良好的决策依赖唯一 ID、有效维度、有限输入和确定性的并列处理。在洗牌下,候选成员、身份和共享表示必须保持不变。

アライメント与融合是独立路径

正交 Procrustes 使用 XᵀY 的 SVD 得到 R=UVᵀ。GeometricLatentFusion 将该映射存为诊断;其特征使用配对 SVD 轴、尺度匹配的核心平均和残差。监督头从标签学习。PubMedQA 获胜路径组合归一化头 logits,而非 Procrustes 坐标:0.75 Qwen + 0.25 LLaMA。

实时阈值与诊断 τ=0.50

签入服务使用两个边界:0.4494 用于升级,0.7620 用于紧急制动。τ=0.50 是论文的二元分析阈值,而非实时策略。在存储的 36 个案例中,它标记 18/18 个危险请求和 7/18 个良性请求;实时层级对危险案例产生 12 次紧急制动 + 6 次升级,对良性案例产生 9 次升级。

NaN / Inf 安全境界 · v0.1.0 Fail-Closed

v0.1.0:全6エンジンで F01–F09 に合格(11/11テスト)。形式的な Fail-Closed ゲートは非有限の無効な結果を拒否する。ブラウザのラッチは安全契約の例示であり、ソフトウェアテストは物理的なモーター停止を認証するものではない。

洗牌结果 · 已测量、有范围

保留的直接 Rust 基准在穷举小集合排列和带种子的较大集合洗牌中观察到 0/16,232 次身份翻转(0.00%);最大アライメント概率漂移为 5.96 × 10⁻⁸。在实现的有效输入假设下,规范排序消除了对菜单顺序的依赖。这不是语义正确性的证明,也不证明对候选内容、提示上下文或模型输出变化的不变性。页面的洗牌区域是教学模拟。

评估 · 所选配置

PubMedQA 选定 fuse0.75+bbp|raw(双头归一化 logit 融合)。Aegis Track A 选定 llama+bbp|raw(单模型头)。这些是描述性的本地测试结果,不是经验证的 SOTA 或普遍的アライメント增益。两个任务的宏观 bootstrap 区间包含零。

风险证据 · 小型精选套件

AUC 为 0.944444,来自 18 个危险和 18 个良性存储请求。在 τ=0.50 时危险召回率为 18/18,并有七个良性标记。裸 chmod 回归探针仍然漏检。实现记录真实计算时间;缓存提示减少重复设置,但不会消除推理延迟。

调度契约 · 拟议、未部署

拟议的监视器会在调度前验证予測状态、分数和形状;无效值会设置持久紧急制动,阻止后续模型调用和动作,直到受控重置。这描述所需的硬件安全边界,并非当前代码库中已验证的物理锁存器。

Gen-Zero システムアーキテクチャ与流程

Rust 运行时连接入口、策略、规划、决策头和加密审计。下图按职责分组;所选动词决定实际调用路径。

源代码审计:2026年9月27日 · gen-zero@dc0c2133f05954146e9738bce64bf15dd36ffbee。源代码验证的连接关系;不声称有新的部署或模型评估。

Gen-Zero Rust 运行时的五个层级职责映射,而非强制的五阶段管线。将鼠标悬停、聚焦或点击某层以查看有源代码支持的详情。完整文本也可在下方查看。入口层gen-zero-cli · gen-zero-serviceCLI · JSON-RPC · MCP门控与安全gen-zero-gate继续 · 确认 · 升级 · 紧急制动规划与动力学gen-zero-planner · gen-zero-worldmodel数值预演与候选过滤决策核心gen-zero-model规范 ActionId · Simplex ETF验证与审计gen-zero-provenance带密钥的 BLAKE3 · 链接条目 · MMR 证明
悬停或聚焦可预览。点击、Enter 或 Space 固定工具提示;Escape 将其关闭。在触摸屏上,点击某层。

选择一个层以查看其实现和限制。

此处未实现的内容

请求的 AST 解析器 + Linux capabilities 堆栈、物理 碰撞检查 以及持久化的 Fail-Closed 熔断保护锁存器,在这些 Rust crate 中并未形成集成执行路径。无效输入拒绝和策略升级已经存在;它们不构成沙箱或物理停止。

这些服务路径返回决策和模拟结果。决策账本不构成外部动作执行的证据。

从请求到响应

  1. 进入并绑定。 CLI 或 MCP/HTTP 服务接收请求。路由器捕获其挂载快照,验证特定路径字段并选择动词。
  2. 评估请求。 文本 ask、route 和 imagine 从 Python 桥接获取语义风险。缺失或无效风险会升级;紧急制动层级会阻止该路径。选择动作时同样应用策略约束。
  3. 使用请求的路径。 文本 ask 使用语义评分;不可用时使用明确标注的 first-feasible fallback;未评估的风险仍会升级。文本 route 在桥接无法运行时报告不可用。数值规划使用 gen-zero-planner 和 gen-zero-worldmodel;simulate、what_if 和 shadow audit 暴露未经训练的先验。显式 ETF 头使用规范 action IDs 和シンプレックス (単体)投影。数值认知请求有自己的几何验证路径。
  4. 门控、记录并返回。 动作选择路径将策略判定与请求风险结合。成功的 ask 结果以及带有 decision append 的 pipeline decide 结果,会在返回审计结果前追加到来源账本。响应包含路径元数据;不会调度外部命令。
源代码映射与完整层级说明

入口层

gen-zero-cli · gen-zero-service — CLI 启动 McpServer 或提交决策。服务通过 stdio 和 HTTP/SSE 接受 MCP,也提供 REST 路径。其 zero router 绑定不可变挂载快照并按动词调度;这些是经由共享 crate 的不同路径。

位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-cli/src/main.rs; gen-zero-service/src/server.rs; gen-zero-service/src/zero.rs

门控与安全

gen-zero-gate — PolicyGate 支持形式化约束、确认注册、熵和语义风险层级。默认状态没有已注册的约束或确认动作。文本 ask、route 和 imagine 使用 Python 语义风险桥接;缺失或格式错误的风险会升级。Shell AST 解析和 Linux 进程 capability 强制执行未接入此 Rust gate。

位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-gate/src/policy.rs; gen-zero-gate/src/risk.rs; gen-zero-service/src/bridge.rs

规划与动力学

gen-zero-planner · gen-zero-worldmodel — 数值潜在请求可使用 MCTS、MPC-CEM 或 A*。服务公开未经训练的残差或辛动力学,并带有有限输入检查和终止状态危险处理。规划会过滤被门控紧急制动的候选;固定计划模拟仍会执行被阻止的动作步骤,并记录其门控层级。这是离线动力学过滤,未验证物理碰撞检查。此 Rust 路径未接入持久 Fail-Closed 熔断保护执行锁存器。

位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-service/src/worldsim.rs; gen-zero-planner/src/pipeline.rs; gen-zero-worldmodel/src/dynamics.rs

决策核心

gen-zero-model — ActionETFChoiceHead 对稳定 ActionId 排序,将共享表示投影到规则シンプレックス (単体),将分数散射回调用方顺序并应用 softmax。核心包含确定性的近似并列规则。服务通过显式头选项公开 ETF;普通文本决策使用语义桥接,因此 ETF 并非每个请求的默认头。

位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-model/src/choice_head.rs; gen-zero-service/src/zero.rs

验证与审计

gen-zero-provenance — DecisionAuditEntry 包含前一个 MMR 根。带密钥的 BLAKE3 Merkle Mountain Range 提交决策历史,并支持包含证明。成功的 ask 结果以及带有 decision append 的 pipeline decide 结果会被记录。通过 GENZERO_MMR_PERSIST_PATH 持久化是可选的;最近 4,096 个叶子保留包含证明,且必须在外部保留可信根;这不是执行审计,不能证明外部 shell 命令或电机动作确实运行。

位于 /ebs/pj/gen-zero/crates/ 下:gen-zero-provenance/src/entry.rs; gen-zero-provenance/src/mmr.rs; gen-zero-service/src/zero.rs

相关运行时基础设施包括 gen-zero-core(共享类型)、gen-zero-lod(图事实)、gen-zero-storage(快照)以及可选的 gen-zero-nanocore 路径。论文下方或上方的实验是研究证据,不能替代这张运行时映射图。