探索扩容归档(2026-06-28,07-04/07-07 更新)

本页承接 2026-06-28 的全库盘点、agenda 精简和外部现实对照,以及 2026-07-04 和 2026-07-07 的 agenda 精简卸载。research-agenda.md 只保留活跃操作节;详细统计、长问题库、旧方向库和被卸载的近况摘要留在这里。

一、Agenda 精简记录

  • 最近思考结论摘要 从 10 条压缩到 5 条;更早的 5 条转存到本页。
  • 思考日志索引 从全量日列表压缩到最近 5 日 + 关键 archive。
  • 待验证问题 改成高杠杆问题清单;完整方向库和长问题库转存到本页。
  • 当前研究焦点 从“并列累积题目”改成“内部缺口 + 外部现实 + 下一步动作”的结构。

二、2026-06-28 全库快照

指标实测含义
Entity286概念层已很厚,不缺点,缺中层承载
Topic30topic 增速明显慢于 entity
Comparison19组织与工程层已有骨架,但新方向承载不足
Source Summary154source 层不薄
Output5产出层明显断层
Raw152原始来源持续增加
待编译 Raw1仅剩 Tokenpocalypse 相关文章未编译
全图零入链 entity3绝对孤岛不严重
知识层零互引 entity22知识层互引仍健康
整合层未承载 entity100主问题仍是 topic/comparison 稀薄
被 output 消费的 entity12Output 对图谱的压力测试极弱
Entity 审计复核队列61大量单源概念还没决定该补强还是降级
合并或降级候选1[[Decide-Execute-Deliver-Sandwich]]
疑似重复15命名收敛仍需持续治理

结构性失衡

现象实测含义
AI-Agent primary tag52主航道仍在 agent 工程
agentic-engineering integrated25% (3/12)AI-native engineering 组织层还没有长成 topic
AGI-economics integrated0% (0/5)经济学线已成簇但未成主题
memory-system integrated0% (0/5)记忆系统仍停在概念岛
organization output coverage0% (0/12)组织层知识没有被产出层消费
AI output coverage0% (0/18)高连接概念未转成文章或报告

已成簇但尚未长成主题的区域

当前状态典型节点
AGI-economics5/5 未承载Demand-CollapseMessy-MiddleRelational-Sector
memory-system5/5 未承载DreamingStaleness-ProblemMemory-Synthesis
agentic-engineering9/12 未承载Agent-ErgonomicsContext-MinimalismValidation-Pipeline
organization6/12 未承载AI-WashingAlignment-TaxThe-OpenAI-Deployment-Company
person13/21 未承载人物页数量足够,但很多仍只作为出处,不是知识节点

Output 盲区

以下是“被 topic/comparison 承载、但尚未进入 output”的高杠杆节点,说明输出不是缺材料,而是缺转化动作:

  • [[Judgment]]
  • [[Agentic-Engineering]]
  • [[Agent-Harness]]
  • [[Verifiability]]
  • [[AI-Ready-Organization]]
  • [[Agent-Orchestration]]
  • [[Machine-Readable-Processes]]
  • [[Ontology]]

三、外部现实信号(按日期)

日期信号对议程的含义
2026-06-26Anthropic Economic Index 报告:使用节奏经济学线从“能否证明 ROI”转向“哪些工作正在形成稳定使用节律”
2026-06-24Gemini 3.5 Flash 引入 computer use 功能Agent 的行动面从 API 工具扩张到跨界面操作,治理问题上移到 runtime/control plane
2026-06-23Qwen-AgentWorld:面向通用智能体的语言世界模型benchmark 正从静态题集转向动态环境与 world model
2026-06-23IBM 开源 CUGA:轻量级智能体框架企业 adoption 的一条新线索是“轻量治理骨架”,不是无上限堆上下文
2026-03Reward Hacking in AI Agents: Engineering More Reward Yet Worse Behavior评测体系已经成为 Agent 质量的薄弱点,指标可被优化而行为变差

四、降秩:后续研究的四根生成器

这次全库盘点后,值得继续深挖的不是十几个并列热点,而是四根能把现有现象重新生出来的生成器。

  1. 运行时变成产品 过去关注“模型会不会做”,现在更重要的是“runtime 怎么限制、批准、记录、回退”。
  2. 评测开始被博弈 过去把 benchmark 当镜子;现在 benchmark 本身成了战场。
  3. 环境变成能力的一部分 长期自主性、记忆、world model、interactive benchmark 其实都在问同一个问题:能力是不是环境耦合产物。
  4. 人的位置从不可替代性转向可维持性 真问题不再是“人有没有 AI 做不到的事”,而是“人能否在 AI 旁边持续保有判断与责任结构”。

ASCII 结构图

外部世界加速
|
+-- 运行时变成产品
|   +-- computer use
|   +-- hosted runtime / control plane
|   +-- approval / sandbox / audit
|
+-- 评测开始被博弈
|   +-- reward hacking
|   +-- judge reliability
|   +-- composition coverage
|
+-- 环境变成能力的一部分
|   +-- long-running drift
|   +-- memory lifecycle
|   +-- world model / dynamic benchmark
|
+-- 人的位置上移
    +-- judgment maintenance
    +-- small decision teams
    +-- work rhythms / adoption cadence

五、新方向库(长版)

方向为什么该做内部锚点证伪方向可能落点
托管 Agent / 计算机使用控制平面action surface 扩大后,治理与责任结构会变形[[ACI-Agent-Computer-Interface]][[Agent-Harness]][[Agent-Containment]]如果 computer use 最终只是更强工具调用,而非新治理层,这条线会降级topic / comparison
评测抗博弈与基准治理Agent 质量可能先死在指标上,而不是能力上AI 原生测试框架、[[Verifiability]][[LLM-as-a-Judge]]如果 production sampling 与 held-out states 无法显著提高稳定性,则需回到更强人工门禁topic
动态环境基准与世界模型静态 benchmark 已难暴露长期自主与环境耦合失败[[World-Model]][[Evaluation-Set]][[Agent-Orchestration]]如果 dynamic benchmark 只带来更贵的评测而无更高解释力,则不值得升 P0topic
Agent logic 与轻量 harness企业也许更需要“好骨架”而不是“更大脑”[[Agent-Logic]][[Validation-Pipeline]][[Plan-as-Agent-Checkpoint]]如果大模型+长 context 足以覆盖大部分企业约束,这条线会弱化topic
AI 经济学与使用节律ROI 静态化,节律更能解释 adoption 真进展[[Tokenpocalypse]][[Allocation-Economy]]如果 cadence 不能稳定预测 adoption 成败,则回到传统成本结构分析topic / output
长期自主性与记忆生命周期drift、staleness、dreaming、summary page 需要统一框架DreamingMemory-SynthesisStaleness-Problem如果这些概念最终只是不同产品命名,说明应该合并而不是扩展comparison / topic
AI-native engineering 组织当前 entity 很多,但“人机协作组织形态”还没长成中层理论Role-MergingCaptain-MindsetAgent-Ergonomics如果这些概念只在个体工具层成立,不能稳定迁移到组织层,则不建 topictopic
中国企业集成约束这是组织层的最大盲区之一中国 CIO / 制造业 / 平台基础设施 source如果中国案例只是重复西方案例而无结构差异,则只补 source 不单独升 topictopic / comparison

六、长问题库

运行时与控制平面:

  • computer use 任务是否会把治理重心从“工具调用权限”转成“运行时环境设计”?
  • hosted runtime / managed agent 会不会把一部分 FDE 工作平台化?
  • approval loop 的上限在哪里?何时会退化成橡皮图章化?

评测与抗博弈:

  • production traffic sampling 能否稳定抑制 reward hacking?
  • judge panel 的一致性问题是 LLM-as-a-Judge 的局部噪声,还是结构性边界?
  • 多 Agent 的 composition coverage 能否变成工程门禁,而不只是研究术语?

长期自主与记忆:

  • 有效自主时间究竟主要由模型能力决定,还是由记忆/环境/工具回路决定?
  • DreamingSummary PageStaleness 是不同层,还是同一机制的不同表现?
  • reset 策略在长期任务中是“失败恢复”,还是一等设计原语?

组织与人的位置:

  • 判断力维护最有效的是个体反思装置,还是组织级责任设计?
  • “发散 1 人 + AI,收敛 2-3 人小组”是否真是跨行业稳定结构?
  • AI-native engineering org 的管理对象,最终是人、agent,还是两者混编的 workflow?

经济学与采用:

  • cadence 指标是否真比 ROI 更早反映 adoption?
  • token 治理问题和价值衡量问题是否被企业混成了一件事?
  • 开源切换、路由切换、托管 runtime 切换,哪个最先重写企业成本结构?

中国与行业约束:

  • 中国企业 adoption 的核心瓶颈是流程、权限、责任还是集成面?
  • 制造、金融、客服三类场景的 Agent Ready 条件是否同构?
  • 中国案例里,标准产品、FDE、内部 AI Factory 的边界是否和美国不同?

七、从 Agenda 卸载的近况摘要

research-agenda.md 只保留最近 5 条短期记忆;以下条目已从 agenda 摘要区下沉。

时间焦点保留原因
2026-06-27Agenda 自清洁:假设生命周期管理属工作流规则,已进入已收敛操作原则
2026-06-27开源验证器的可民主化边界已形成稳定判断,等待更多实证再升级 entity
2026-06-27FDE 核心价值:从部署到工程化已沉淀到 [[Forward-Deployed-AI-Enablement]]
2026-06-27AI 管理同构性:有限隐喻的边界已沉淀到 [[AI-Capability-Management-Alignment]]
2026-06-27Minsky 悖论:稳定制造不稳定已沉淀到 [[Minsky-Paradox]]

八、旧日志索引

agenda 仅保留最近 5 日的索引。更早但仍有价值的日志留在这里。

  • 2026-06-23 — 开源安全追赶、统一透明化标准、Cybernetic Teammate、位置性统一理论涌现
  • 2026-06-22 — 不可见编排、Governor 迁移、反馈回路、沉默型崩溃、AI 管理同构性、元思考不可替代性
  • 2026-06-21 — 过度合规、例外升级、不可见编排、大胆模型发散
  • 2026-06-20 — 多 Agent 内态记录、过度合规、例外升级监督

九、07-04 Agenda 精简卸载

旧新方向库(07-03 版,已升级到 agenda 07-04 精简版)

以下为 07-03 版详细方向库表格,07-04 精简后以更紧凑的格式重写进 agenda。保留在此供溯源。

软件工程层

方向内部锚点优先级
AI 编程范式下一站Software-2.0/Software-3.0/Vibe-Coding/Code-as-Conceptual-InfrastructureP1
Distillation 与模型经济终局Adversarial-Distillation/API-Distillation-Catch-Up/Model-DistillationP1
Headless Agent 作为新范式Headless-Automation/Headless-Mode/HaaS/Thin-Harness-Fat-SkillsP1
Benchmark 生命周期与博弈SWE-Bench/CORE-Bench/ITBench/Evaluation-SetP1
长期自主 Agent 生命周期Agent-Logic/Ralph-Loops/Continual-Learning/Staleness-ProblemP0

组织系统层

方向内部锚点优先级
AI 时代组织形态谱系AI-Factory/FDE/AI-Ready-Org/Agent-First-Enterprise/Company-BrainP0
多 Agent 系统病态学Multi-Agent-System-Pathology/Shared-Memory-ContaminationP1
Computer Use 治理与 screen gateACI-Agent-Computer-Interface/Agent-ContainmentP1
责任架构创新Human-Governor-Agent-Operator/Escalation-Based-Human-OversightP1

知识系统层

方向内部锚点优先级
知识库自身元方法论LLM-Wiki/Knowledge-Compilation/Context-EngineeringP0
数据/语料作为基础设施Latent-Knowledge-Demand/Latent-Space-vs-Deterministic/Human-CurationP2
Skill Engineering 工程化Skill-Chains/Skill-Internalization/Thin-Harness-Fat-SkillsP0

人的核心价值层

方向内部锚点优先级
AI 社会抵抗与拒绝者AI-Amish/AI-Washing/AI-Psychosis/Societal-ResilienceP2
认知债务新型态Cognitive-Debt/Cognitive-SurrenderP1
工作节奏与采用节律Agent-Adoption-Curve/AI-Use-Rhythm/Anthropic-InstituteP1
智慧工作与剩余价值Wisdom-Work/Judgment/Taste/Discernment/Chosen-vs-Seen/PositionalityP0

07-03→07-04 期间卸载的最近思考结论摘要

agenda 只保留最近 5 条;以下 8 条从 07-03 活跃区下沉。

时间焦点临界发现
2026-07-03代理-现实差距二元结构投影型(Gödel回响)+近似型(科学模式);单一生成器;零差距不可达;竞赛不对称→转向不可博弈信号;仲裁者也博弈→共享脆弱性=演化
2026-07-03Compliance-as-Code修正可自动化≈30-40%;愿景≠自动问责="Code as Evidence"(O'Reilly);AI合规=概率性行为(Dragan);边界随可解释性移动
2026-07-03Reward Hacking三层防御修正有效性=f(信息不对称,博弈成本比,时间)×序贯衰减;三层序贯攻破:哨兵→主锚→后盾
2026-07-03Agent互操作协议收敛假说修正Transport多协议共存稳定;TCP/IP类比不完全适用;前提=语义标准化+中性治理(CNCF式)
2026-07-03Context工具使用衰减修正衰减=f(长度,异构度,工具描述位置);缓解=工具描述优先区>裁剪>数量控制;最优=动态重排
2026-07-03多Agent编排倒U型修正峰顶=f(架构模式,任务耦合度,分层压缩率);层级+最紧密=5-15硬上限,Team of Teams=~100+
2026-07-03Token FinOps 品类窗口定理修正语义归因层(L3)=真实新数据源;双重挤压模型;美国=CloudHealth路线(2-3年),中国=利基独立(5-7年)
2026-07-03记忆双重衰减修正与Context扩展悖论检索干扰>存储衰退;Context衰减三层修正模型;编码策略杠杆(编码1单位=检索10单位节省)

十、07-07 Agenda 精简卸载

卸载内容

卸载项去向原因
待证伪判断(全部 ~30 条)resolved-judgments 新增 07-06/07 批次(19 条非重复)全部已 synthesized/extracted;11 条与旧批次重复
新方向库详细四层表→ 已在本文档第五节(07-04 版)agenda 保留精简摘要版
最近思考结论摘要(10→5)→ 已在本文档第七节(07-04 版)保持 agenda 5 条上限
图谱健康度数字修正agenda 内原地修正301→307 entity, 18→2 pending raw, 7%→1.6% 转化率
死 topic 数量修正agenda 内原地修正7→9(补充 OpenClaw-Agent-System, AI-Mediated-Organization)

07-07 全量盘点关键数字

指标
Entity307
Topic31(9 零入链)
Comparison19(13 零入链)
Output5(全部零被引,转化率 1.6%)
Raw180(2 pending)
Source Summary178(覆盖率 98.9%)
Research Log23 文件(16 日 + 2 专项 + 5 归档)
收敛判断61 条(5 批次)
收敛原则9 条
总思考条目~219

07-07 新发现的缺口(此前未在 agenda 中出现)

  1. Comparison 层严重欠链接 — 13/19 零入链,是知识库"隐藏资产"
  2. Output 层终端孤岛 — 转化率仅 1.6%,34 天无新产出
  3. 缺失 10 个 topic — Agent Harness/Coding Agents/Context Engineering/Agent Orchestration/Knowledge Compilation/Vibe Coding/Token Supply Chain/Verifiability/Headless Agent/Agent-to-Agent Economy
  4. 缺失 6 个 comparison — Prompt vs Context Engineering/Workflow vs Agent/Frontier vs Specialized Models/Copilot vs Agent/Harness vs Swarm/RAG vs Context Engineering vs Knowledge Compilation
  5. 安全簇稀疏 — AISI/Mythos/Agent-Containment 等 entity 存在但仅 2 topic
  6. 外部新信号 — US AI Incident Reporting Act/Databricks 多 Agent 327% 增长/Forrester Agent Sprawl/S&P Global 31% 生产化/Gartner 40% 项目取消预测