Evidence ledger · F-05

数据护城河有两条路,不只有反馈闭环

首次登记 2026-07-19 · 到期 2029-07-19 · 下次复查 2026-10-19

当前预测 · 64%

闭环数据,或独占且权威的数据

到 2029-07,能在基础模型升级后维持差异的数据优势,主要来自:合法复用且连接结果标签/实验的反馈闭环,或难复制的权利、权威性、持续维护与责任体系。仅有静态规模而缺少两者,多数不能形成持续溢价。

一手公开证据

D 级 · 机制支持

Duolingo:每天近 20 亿次练习进入预测与 A/B 测试

Duolingo 披露,每次作答被用于预测学习者答对特定练习的概率并调整难度,每季度运行数百项 A/B 测试。这里的优势不是“有很多数据”,而是行为、结果、实验与产品调整连成回路。效果归因仍属管理层表述,因此只列 D 级。

B 级 · 强支持

OpenAI:客户数据默认不用于训练

企业隐私政策明确客户拥有并控制业务数据,默认不用于模型训练,并控制保留时间与连接源。能访问客户数据,不等于取得合法的跨客户复用权。

D 级 · 强边界反证

Thomson Reuters:静态内容也可能因权威与权利而值钱

CoCounsel Legal 明确依赖 authoritative Westlaw primary law、trusted Practical Law guidance 和引用。静态数据若具有难复制的权利、权威维护与责任承诺,并不需要高频反馈才有商业价值。

为什么从 78% 降到 64%

闭环机制与复用权约束都真实存在,但“静态数据没有护城河”被权威法律内容直接击穿。公开材料还没有在基础模型升级前后,把数据优势对应到盲测质量、留存与价格,因此不能维持 78%。

强制更新条件

上调至少 10%
五个以上产品在两次模型升级后,仍证明闭环或权威数据带来质量、留存或价格优势。
下调至少 10%
通用模型持续抹平两类优势,或隔离与授权约束使闭环无法复用、权威内容无法维持溢价。

判断变更记录

2026-07-19 · v1.5 · 78% → 64%

从单一路径改成双路径:反馈闭环,或独占/权威/持续维护/责任体系;把可复制且无标签、无授权的静态库存与高价值权威内容分开。