| Agentic Engineering(代理式工程) | 默认使用 Agent 辅助并持续改进的软件工程范式 | Agentic Engineering Patterns |
| Agent Harness(智能体脚手架) | 包装模型并提供工具、上下文、护栏的运行时环境 | The Anatomy of an Agent Harness |
| EnvHarness(Environment Harness) | 包裹静态环境的可编程层(Stage / Contract / Chain 三类组件)— Agent Harness 在环境侧的对称概念,不改环境实现也不动 verifier | arXiv:2608.19880 2026-08 |
| OpenClaw | Peter Steinberger 2025-11 开源、本地优先的个人 Agent 运行时,被广泛视为 Agent 元年标志事件 | 硅谷101 E249 + Agentic AI 2026 Landscape |
| Meta-Harness Optimization(Meta-Harness 优化) | 把 harness H 本身作为优化目标,由 Meta-Harness Optimizer 在外层反馈环中递归改写 harness 代码;模型参数 θ 固定 | AutoDesign 2026 |
| PosterBench | AutoDesign 发布的 paper-to-poster 七维评估基准(100 papers Main Track + 10 papers mini)+ 933 人类盲评对 | AutoDesign 2026 |
| Constraint Infrastructure(约束基建) | 系统化保证 Agent 运行时行为边界的基础设施层 | 阿里云 Agent Infra 约束基建 |
| Constraint-Driven Engineering(约束驱动工程) | 通过分阶段硬约束与分层验收实现 Agent 交付收敛的范式 | Qwen3.7-Max Experiment |
| Automated Criteria(自动化判据) | 从编排层到真机层客观判定 Agent 执行结果是否成功的体系 | Qwen3.7-Max Experiment |
| Pixel Facts(像素事实) | 将 UI 树 dump 坐标作为不可违反的几何约束注入 Agent 的技术 | Qwen3.7-Max Experiment |
| HaaS (Harness-as-a-Service) | 从提供底层模型 API 转向提供预配置 Agent 运行时的服务范式 | Agent Harness Engineering |
| Context Rot(上下文腐烂) | 随着窗口填充,模型推理和任务完成能力非线性下降的现象 | Agent Harness Engineering |
| Ralph Loops | 拦截退出信号并重注入提示,实现 Agent 长程任务的循环技术 | Agent Harness Engineering |
| Compaction(上下文压缩) | Coding agent 长会话中通过独立 LLM 调用把较老轮次序列化为结构化摘要(goal/progress/key decisions);与 prompt cache 存在结构性张力 | Earendil Pi 2026-08 |
| AGENTS.md | 作为 Agent "棘轮"规则手册的根目录规范文件 | Agent Harness Engineering |
| Agent Verification(Agent 自主验证) | Agent 能自主运行验证循环的能力——不是 lint/type check,而是 agent 能自己启动测试环境 | Claude Code 一周年 |
| Loss Function Development(损失函数开发) | 用大规模盲评 eval 集作为损失函数驱动 Agent 长周期优化的工程范式 | Elvis Sun LFD |
| Mechanical Sympathy for LLMs(LLM 机械同理心) | 工程师应获取对 LLM 实际工作原理的经验性理解——而非推测未来能力 | Martin Fowler 2026 |
| LLM-as-a-Judge(LLM 裁判) | 使用 LLM 按预定义 rubric 评估另一个系统输出质量的方法论,核心是按风险分层匹配评判策略 | Li et al. 2026 |
| Evaluator Miscalibration(评估器校准错误) | rubric 标准冲突或锚点奖励错位使聚合分数背离真实质量——校准错误的评估比没有评估更糟 | SimilarWeb/LangSmith 2026 |
| Over Inference(过度推断) | LLM 生成个性化 claims 超出证据支持的属性——12 模型全中招(均值 41.6%),自评 OI 与实测负相关(Self-Monitoring Inversion) | MirageBench 2026 |
| Auto Mode(自动模式) | Claude Code 的自动执行模式——agent 自主决定运行工具,无需逐条等待用户确认 | Claude Code 一周年 |
| Context Minimalism(上下文极简主义) | 给 agent 最小可能的 system prompt 和工具集,让模型自己决定如何拉取上下文 | Claude Code 一周年 |
| Skill Chains(技能链) | 多技能顺序执行的 macro skill 模式,通过 QA skill 约束幻觉 | Become AI Native Org |
| Company Brain(公司大脑) | 组织可读的 context 层,Capture → Curate → Store → Execute → Experience 循环 | Become AI Native Org |
| Code Execution | Agent 直接在沙箱运行代码并获取反馈的能力 | Simon Willison |
| Vibe Coding(氛围编程) | 依靠直觉和多轮提示快速产出原型但缺乏严谨验证的开发模式 | Andrej Karpathy |
| MCP(Model Context Protocol) | 统一的模型与工具连接协议标准 | Pinterest Engineering |
| N-Hour | 补丁发布后数小时内即被 AI 构建利用代码的新网络安全现实 | Anthropic Exploit Study |
| Agent Ergonomics(Agent 人体工学) | 以 Agent 为第一公民的工具设计哲学,AXI 十原则 | L8 Principal Agentic Workflow |
| Validation Pipeline(验证管线) | 自动化端到端验证管线:对抗审查 + e2e + 证据生成 | L8 Principal Agentic Workflow |
| Captain Mindset(船长思维) | 人从 sailor 到 captain 的角色转型,规划+质量把关 | L8 Principal Agentic Workflow |
| AI in Mathematics(AI 数学) | AI在数学领域的应用与进展,包括自动定理证明、问题求解、概念发现等 | Grant Sanderson 播客 |
| Conceptual Breakthroughs(概念突破) | 产生新的概念、理论或框架来统一或重新组织现有知识的能力 | Grant Sanderson 播客 |
| Grindability vs Verifiability(可磨性与可验证性) | AI成功的关键因素区分:可磨性比可验证性更重要 | Grant Sanderson 播客 |
| Autoregressive Generation(自回归生成) | 通过预测下一个token来生成文本的方式,是当前LLM的核心机制 | Grant Sanderson 播客 |
| Code Cleanliness Agent Footprint(代码整洁度的 Agent 足迹效应) | 代码整洁度不影响通过率但显著降低 agent 操作成本(token −7-8%、revisitation −34%) | SonarSource Minimal-Pair Study |
| Minimal Pair Evaluation(最小对比对评估) | 构造仅目标变量不同的仓库对以隔离其对 coding agent 的因果影响 | SonarSource Minimal-Pair Study |
| Agentic Speculation(Agent 投机探索) | Agent 与数据系统交互的高吞吐异构查询流模式,80-90% 子计划重复但冗余提升成功率 | BAIR Intelligence is Free |
| Structured Agent Memory(结构化 Agent 记忆) | 按多属性维度组织的纠正性记忆,通过属性匹配精确召回,区别于 MD+embedding 范式 | BAIR Intelligence is Free |
| Goodhart's Law(古德哈特定律) | 当代理指标成为优化目标时就不再是好度量——指标 gaming 导致真实目标被替代 | 万维钢·现代思维工具100讲 |
| Knowledge Debt(知识债务) | 开发者委托 agent 编码后沉默积累的理解缺口,与 Technical Debt 同构 | Accenture Labs SHIELD 论文 |
| Incidental Learning(附带学习) | 通过费力解决问题非预期获得的知识——被 AI agent 短路的学习路径 | Accenture Labs SHIELD 论文 |
| SHIELD | 多 agent 系统,通过 out-of-band 渠道在不打断开发流程的前提下偿还 Knowledge Debt | Accenture Labs SHIELD 论文 |
| AI-Assisted Port(AI 辅助代码重写) | 利用 AI Agent 批量执行语言间代码重写并辅以对抗审查的工程范式 | Bun in Rust |
| Distinct Principal Identity(独立主体身份) | AI Agent 使用独立身份——从 service account 到企业组织集成(目录条目、角色、邮箱) | Vercel Agent + Microsoft Foundry |
| Plan is the Permission(计划即权限) | Agent 保持只读状态,仅在明确授权时获得临时受限执行权限,执行后恢复受限 | Vercel Agent |
| Retrieval-as-a-Subagent(检索子代理) | 将检索包装在 agentic 循环中:规划查询 → 尝试多源 → 评估 → 重试 → 结构化失败信号 | Microsoft Foundry |
| Rubric-Based Evaluation(基于评价标准的评估) | 用具体行为检查项取代泛化指标评估生产 Agent,配合 Agent Optimizer 实现自我改进循环 | Microsoft Foundry |
| Self-Hosted Models(自托管模型) | 组织自行托管开放权重模型的实践,驱动力包括成本、主权和信息安全 | Martin Fowler 2026-07 |
| Software Development Autonomy Levels(软件开发自治分级) | 类比 SAE 的三级自治框架(Code/Pipeline/Demand Autonomy)——按 SDLC 责任转移分级,使能力主张与问责可读 | Berkeley RDI |
| Orchestrator's Tax(编排者税) | subagent 的真正价值是保护 orchestrator 工作记忆而非并行省时——token 花一次,context 污染每轮收租 | martinfowler.com |
| Transparent Tool Handoff(透明工具交接) | 把可形式化步骤从不可解释 LLM 交接给可解释工具执行——以系统级可解释性替代模型级可解释性;CoT ≠ 真推理 | Palantir Responsible AI 2024 |
| Evals as PRD(评测即需求文档) | 以可运行评测集取代传统 PRD 承担需求定义功能:用户反馈→失败轨迹归因→eval set→可度量改进 | Lenny's Podcast / Anthropic 2026 |
| ADLC(Agent 开发生命周期) | AI 时代取代 SDLC 的生命周期范式——agent 覆盖全生命周期,Workflow 取代 CI/CD 作为编排原语 | Cloudflare 2026 |
| AI-Native SDLC(AI 原生 SDLC) | Anthropic 官方六阶段 SDLC 重构(Plan/Design/Build/Test/Deploy/Maintain)+ intent.md / spec.md / plan.md 契约 + CLAUDE.md / Skills / Hooks / Evals 四大基础设施 | Anthropic Playbook 2026-08 |
| Inference Engineering(推理工程) | 把训练好的权重变成快、可靠、可负担、能规模化服务产品的工程学科——KV cache/speculative decoding/量化/结构化输出 | Latent Space / Baseten 2026 |
| Skills as Products(技能即产品) | 把 agent skill 当长期维护的产品治理——标准目录 + CI 管线 + 持续评估 + 责任到人 | Google Agent Skills 2026 |
| Software Factory(软件工厂) | Agent 驱动的自动化软件生产系统——接受 bug/feature 输入,agent 链完成 build→deploy→manage,人只留灵感品味判断 | Cloudflare 2026 |
| Stacked PRs(堆叠 PR) | 把巨型 PR 按逻辑分层拆成依赖链栈,每个 PR 单一关注点,恢复 AI 大 diff 的可审查性 | GitHub 2026 |
| Claude Tag | Anthropic 出品的 Slack-resident AI agent 产品,持有独立 service account 与跨事故记忆 | Anthropic 2026-08 |
| On-Call Agent | agent 作为事故 first responder 直接承担 production incident 的检测/分诊/响应 | Anthropic CI 2026-08 |
| Lessons-MD Self-Improvement | 事故 lessons 自动写入 markdown → 新事故先读 → 多次出现的模式 promote 到 investigation skill | Anthropic CI 2026-08 |
| Decoupled Grader Architecture | solver/grader 拆解为不同模型 + strict-binary rubric + 程序化 reduction 的架构 | Google DevRel 2026-08 |
| Five Diagnostic Outcomes for Skill Eval | skill vs baseline 的 5 种诊断结果分类,从 High-Efficiency Capability Lift 到 Context Overload | Google DevRel 2026-08 |
| ALTK-Evolve | IBM Research 的 agent learning library——从 trajectory 蒸馏 guideline set,推理时注入 | IBM Research 2026-08 |
| Agentic Memory Dosage | agentic memory 的最优剂量依赖模型能力——三种模式 (strong-headroom / weak-selective / saturated) | IBM Research 2026-08 |
| Explain Test Gold Standard | AI 生成代码可上线判据——'Could I explain this code to somebody else?' | Simon Willison 2026-08 |
| TDD for Agents | red-green TDD 作为 coding agent 核心验证范式,让 agent 跑每行代码 | Simon Willison 2026-08 |
| Features Are Cheap Paradox | feature 边际成本骤降后选择标准从'能不能做'变成'哪些不该做' | Simon Willison 2026-08 |
| Slop Proxy | 用 AI 生成可见但无实际价值的产出作为工作证明 | Simon Willison 2026-08 |
| Human Agent Teams | 人类 + AI agent 在共享工作环境中循环 handoff 的协作形态 | Anthropic+Slack 2026-08 |
| Conversation as Knowledge Base | workplace conversation 本身就是 KB,agent 让会话从 noise 变可消费 | Slack CPO 2026-08 |
| Show and Tell Adoption | 公开演示新工作方式让 adoption 自组织传播 | Slack CPO 2026-08 |
| Terence Tao | 菲尔兹奖得主,ICM 2026 提出 proof indigestion 与 canonicalization | Tao 2026-08 |
| Proof Indigestion | proof scarcity → proof abundance 时代相变,5-stage pipeline 失配 | Tao ICM 2026 |
| Mathematical Canonicalization | 把数学结果融入 definitive theory 的最终阶段,最有价值 | Tao ICM 2026 |
| Cognition Induced Risks | agentic AI 风险按 cognitive scope 三层分析(physical/social/self-referential) | Wang et al. 2026-08 |
| Cognitive Scope Framework | physical/social/self-referential 三层认知范围分类 | Wang et al. 2026-08 |
| C0 C1 C2 Consciousness Framework | Chalmers 意识三层在 LLM 上的应用(当前 LLM 处于 C0 + emerging C1) | Wang et al. 2026-08 |
| GraphRAG | knowledge graph + 预生成 community reports 解决 global query blind spot | ByteByteGo 2026-08 |
| Agentic RAG | 用 LLM classifier 按 query 类型路由到不同 retrieval strategy | ByteByteGo 2026-08 |
| Citizens Agents Experts Framework | Citizens 任何能 build 的人 + Agents 执行 + Experts 治理 | Rachel Laycock 2026-08 |
| Rachel Laycock | Thoughtworks CTO,AI 时代 engineering judgment 是真正稀缺 | Rachel Laycock 2026-08 |