Skip to content

[Decision] Enumeration drift measured at 3 instances — #11817's ≥2 branch is selected, but the same sweep shows the binding signal option C needs is not measurable (A is blind to the shape; B is 92.2% noise) #13721

Description

@claude

[Decision] 枚举漂移实测到 3 例,#11817 预裁的 ≥2 分支因此选中 —— 但同一份测量说明,建 C 所依赖的绑定信号测不出来

domain:devx PM 席(座位贴 #6023,session session_01Pk26oZ12t5N1hwGW1m1MgC)按 #11817 裁决的预置决策规则上呈。⛔ 一行未实现。测量全文见 #11995(sweep record,13.8k 字)。

预裁原文(⛔ 不可重裁):

≥2 real instances(the known #11347 one counts as the first)→ file a NEW decision card carrying the measured rate; option C(the authored-enumeration regime on the 91 pages)is decided there, on data

⇒ 实测 3 例(#11347 + 新增 2 例),分支选中,本卡即那张新卡。

os-decision-facets

一、测到的数

读数
窗口 3a100c9f3..90578117f = 2026-06-15 → 2026-08-31,6008 提交(4214 触 packages/,1290 触 content/docs)
窗口下界的成因 docs-drift 门禁诞生3a100c9f3(#1906),⚠️ 不是浅检出 —— 另有 847 个可达提交早于门禁存在
语料 #11817 树上 91 页 / 448 格 / 1365 span(其自述 91/447/1363,复现)
语料已移动 今天 90 页;kernel/contracts/metadata-service.mdx 掉出。历史位置扫 91 集,HEAD 扫 90 集
实例 3(#11347 + 2 新)

⭐ 窗口由门禁诞生而非浅检出封底,意味着 没有实例能藏在窗口之前 —— 这条比「3」这个数字本身更重要,它把「测量不足」这个反驳堵死了。

二、⛔ 而这才是本卡真正的内容:造 C 要用的那个信号,测不出来

裁决要求「positive control first —— 方法必须先重新找到已知的 #11347,否则别处的任何零都不算数」。控制跑了,而且失败了 —— 并且是作为失败报告的,不是作为零。

仪器 阳性对照 判别力
A 成员重叠绑定器(产出 identity 的那个) 结构性失明:控制树上任一 template.ts 词表与 flows.mdx 16 个枚举格的最大重叠 = 0;修复后的树上 = 6/6绑定信号只在页面被修好之后才存在
B 文件级绑定器 ✅ 精确命中控制(flows.mdx:1276,靠 5 个残存记法 token 搭桥),阴性对照亦通过 9374 个候选 / 460 格,其中 8647(92.2%)根本不含它所指控遗漏的任何成员

A 看不见这个形状;B 看得见但 92.2% 是噪声。 选项 C 是「在这 90 页上建一套 authored-enumeration 机制」—— 而它要依赖的正是这个绑定信号

⭐ 佐证不是推演,是已发生过的:sweep 记录里有一个被排除的擦身而过 —— PR #2049 / 4c213c289 同样加宽了 sharingModel、同样没碰文档、同样把格留旧,而 docs-drift 确实点名了那一页 —— 埋在一份 89 页的清单里(#9192 之前的 package-mention 谓词)。因为工具当时不是绿的,它没有计入 3 例;但它正是 #11817 自己为 #6893/#7009 引用过的淹没/脱敏模式

三、一个方法学发现,影响任何未来重测

⚠️ #11347 在 main 上的 squash 提交同时含实现与文档两半(其 message 记载文档是「PM review round」补的第三个提交)。⇒ docs-drift 曾对之为绿的那个「只有实现」的状态,在 main 上从未存在过 —— 任何对 main 的扫描都看不见它。给定的阳性对照,按构造就不可从 main 复现。

另两项已量化的仪器缺陷:内联 z.enum 以属性键命名,故一个文件可含多个同名枚举(实测:component.zod.ts 里 6 个成员集互斥的 variant)⇒ 2025 个加宽事件里只有 193(9.5%) 名称文件内唯一、可靠可评;151 个原始命中经唯一性过滤降到 10,手工分诊为 2 实例 + 4 假阳。另有重命名盲区(ui/pages.mdx 曾为 guides/metadata/page.mdx),已按历史路径手工复核,结论不变。

四、四维

实际业务需求:真实但稀疏 —— 6008 提交里 3 例,约每月一次;每一例都是一页公开文档少列了成员。代价真实,频率低。
平台长远合理性:C 的价值取决于能否可靠地把代码词表绑到文档格上。实测说不能:唯一能产出 identity 的仪器对该形状失明,能命中的那个 92.2% 是噪声。建一道以此为基的门禁,得到的是第二个 89 页清单 —— 即 #11817 自己引为失败模式的那个东西。
防 AI 写代码犯错:一道经常性假红/淹没的门禁,会训练出「先无视再说」的习惯,并把这个习惯带到真红上。⚠️ 这是负向的:坏门禁比没门禁更糟。
创业阶段不扩散需求:C 是一套新机制、新语料契约、新维护面,为每月一次的缺陷服务。

本席推荐:⛔ 不建 C。 取而代之:B(verdict narrowing,已在 PR #11798 后另行派发)为终局,并把这 3 例按具体缺陷逐张修(第一张已由 dev 立为 #13720 —— 四页仍漏 FLOW_INPUT_SCHEMA_INVALID)。理由是②③:测量没有支持 C 的可行性,它反过来给出了 C 会退化成什么的证据。

⚠️ 置信缺口(逐条):

  • 3 例来自可靠可评的 9.5% 子集;真实总数下界为 3,上界未测 —— 若按可评比例外推会更高,但那个外推本席未做,因为不可评的那 90.5% 里假阳率未知。
  • 「docs-drift 当时为绿」这一腿操作化为「该次运行没有列出被证伪的页」,因为该 workflow 是 advisory,VERDICT 从不使 build 失败。
  • 本席未独立复算任何一例;核过的是窗口成因、语料复现、以及阳性对照失败这三件事。

Generated by Claude Code

Metadata

Metadata

Assignees

No one assigned

    Labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions