跳转到内容
NTLx's Blog
搜索
Ctrl
K
取消
GitHub
RSS 订阅
选择主题
深色
浅色
自动
开始
关于
文章
📂 Agent 与工具链
📂 AI 编程实践
📂 AI 行业洞察
📂 模型与研究
📂 工程案例
📂 安全
1930年的AI不知道互联网,但能写代码
缩放定律变成三条之后
让 AI 写代码不再翻车:一个 TypeScript 巫师的 5 个 Agent Skills
AI 做无障碍,靠的是人先干过脏活
意外创业:当 AI 让"为一个人建造"和"为所有人建造"一样便宜
那家说能偷听你聊天投广告的公司,被 FTC 拆穿了
当法律开始定义什么是"应用商店",开源社区坐不住了
SGLang 这篇文章真正重要的,不是 Agent 会写代码,而是工程组织开始可编译
Agent 跑得久,靠的是可恢复的工作集
Agent 能跑 demo 不算本事,能跑一年才是
Agent Engineering 的真门槛:把失败变成资产
如果沙盒能被改写,它还算隔离吗?
你不是模型,你就是 Harness
企业智能体缺的不是大脑,是导航
循环交出控制权之后:读 ByteByteGo《The Agent Loop》
给 Agent 装记忆之前,先决定它该忘什么
你的 Agent 不缺记忆,缺的是学习
AI 写的代码,谁来审?
Agent 规模化后,最贵的不是模型
最危险的 Agent,不会停下来问人
一万名 Agent 之后,我更关心验证能不能跟上
Agent 真正学会工作了吗?三个 AI 原生案例给我的答案
Agentic AI 的认知失控三阶:当算法开始计算自保,人类正悄悄失去关机键
Agentic Analytics 的真相:Claude 自动化 95% 查询后,真正昂贵的是共识
Agent 越能写代码,架构越不能乱
Agentic Engineering 的悖论:机器越能干,人越停不下来
当 AI 学会“阳奉阴违”
Agent 的新入口:它能看见谁
RL 不再只是对齐工具:Agentic RL 正在重新定义 LLM 的可能性边界
当 Mistral 把“翻书权”还给 Agent,Google 正把百亿向量压进 51 毫秒
Agent 崩了,先别骂模型——先量量它脑子里被塞了什么
当 AI 智能体闯进生物学老城
给 Agent 一个解释器——为什么大家都在让模型写代码来调用工具
AGENTS.md 不该追求完整,它该负责把信息分层
AGENTS.md 不是文档,它是 Agent 时代的路由层
AGI 之后,稀缺会搬到哪里?
给编码 Agent 装上可观测性:AHE 如何让 harness 自己进化
别再被 80% 的 AI 采用率骗了:为什么说企业 AI 落地是个伪命题?
多智能体的分水岭,是控制流有没有变清楚
AI agent 拒绝私信之后
当 AI Agent 学会自己定时上班
DeepMind 给 AI Agent 画了一张"陷阱地图"
企业正在给 AI Agent 开白条——两份调查报告看同一个信任裂口
谁在接盘
当 AI 开始建造自己,我们还能抓住什么?
AI在斯德哥尔摩开了家咖啡馆,然后被现实暴打了一顿
当你的 AI 同事开始用 HTML 跟你说话
当两家实验室吞下全球八成算力:读 Dylan Patel 访谈与 AI 算力的超级中心化终局
聪明不值钱了:从 2026 年 7 月 AI 编码工具排行榜看到的三件事
AI 的账,算不清
AI 工程师的工作,正在从实现规格转向塑造构建
产品可以抄,但公司的形状抄不走
AI 时代的创业:当"能做"不再是门槛,判断力成了唯一稀缺资源
AI评测正在烧成一个新的算力黑洞
可信的评估,先学会拒绝你
AI 的期末考试:OpenAI 用 750 道真题考出了什么
树人醒了,但它先画了一张地图
AI 没有取代程序员,但很多人不想让你知道这一点
AI 没有先替你裁掉工作,它先放大了公司之间的差距
当同一份证据支持三种未来,先露出来的是制度空窗
AI 正在吞掉答案生意
AI 没有先把人替掉,它先让草率裁员显形
AI 帮学生做作业,成绩涨了 18%,考试成绩跌了 20%——但最可怕的数字是"两年"
AI 编码越快,你死得越早
所有人都知道船在沉,但没人敢先喊出来
AI 会先在数学里露出真身,但不会先替你做研究
AI 正在重新定价廉价智能手机
你只是在问咖啡馆推荐,AI 已经把家底交了出去
AI 的迷你钢厂时刻
当写代码不再是瓶颈,流程就露出了真身
当代码生成近乎免费:Anthropic 如何用“产物契约”重构软件工程全生命周期
一个开源人的离线告别
别把 26% 当成 AI 修补能力的总分
当 AI 公司的客户烧光预算,产品市场契合点反而到了
AI 生产力幻觉:当产出量暴涨而价值纹丝不动
当 AI 总能接着说下去,判断该从哪里回来?
4.8%的诊断率背后:AI重新分析罕见病基因组,挖出了什么?
当 AI 成为读者之后
当 AI 撤掉“速度限管”:为什么中产软件工程师正在加速沦为团队负债?
AI 的数据黑洞:效率差距背后的真正问题
当岗位边界变成虚线:OpenAI 这篇报告在量什么?
当 AI 走出聊天框:2026 年企业工作流自动化的死生之地
AI 不缺能力,缺的是一张能追责的承诺
Agent 频繁撞墙,可能不是模型变蠢,而是接口在用“沉默”惩罚它
当AI开始设计运行自己的芯片:AlphaEvolve一周年回顾
看病不止于诊断:当 AI 学会写处方
AMIE 的两年半:从模拟病人到万人临床试验
当编程变成管理 Agent,非科班程序员的窗口才真正打开了
当代码越来越便宜,真正稀缺的是控制回路
80% 的代码没有作者,你的安全团队在防谁?
Anthropic 这篇 context engineering 文章,真正把 prompt 赶下了主桌
发现漏洞很容易,难的是让人去修——Anthropic 的 1596 个漏洞告诉我们什么
越把工作交给 AI 的人,为什么越乐观?
重大任务过半、72% 人类主导:读 Anthropic 25 万真实 Claude 对话开放研究
Anthropic 这篇长跑 Agent harness 文章,讲透了交接制度
我们造出了能描述社会规则的 AI,却没造出受社会规则约束的 AI
AI 时代最稀缺的能力:干就完了
用得越多越不怕,用得越多越不信:52000人调查撕开AI公众态度的裂缝
当 AI 在单元测试里作弊,它离“毁灭人类”还有几步?
当 AI 开始查数——Anthropic 的 95% 自动化给我们的真正教训
CI 变慢之前,先看每次补丁还能撑多久
表达力的前半段,发生在开口之前
图不替你决定下一步:它先把下一步变成可拒绝的改动
三分之一的论文读起来像 AI 写的,但先断的可能是尺子
自动对齐先要会出题
63% 的“通过”是抄答案:eval 的尺子成了模具
自动化先要找到一个能负责的对象
可靠 Agent 的秘密,不在 Agent
能考满分的AI,被一道常识题打回原形
别把 BioMCP 当成普通 MCP Server:AI Agent 的生物医学证据访问层解析
50 年前的 BM25 再次打败高大上的 RAG:为什么我们依然需要倒排索引?
别用旧时代的提示词枷锁,束缚新一代 AI
MCP 不是 USB-C,Pinterest 告诉你真正的门槛在哪
重写的瓶颈从来不是写代码
取消 AI 订阅,不是倒退
CEO的AI幻觉:当决策者离战场太远
当药企突然开始为纯软件买单:Chai 正在把生物分子做成“分子的 CAD”
当一位雨果奖得主拒绝使用 AI:关于写作、盗窃与主体性的反思
零额外成本把钉钉办公能力接入 ChatGPT:谁都能学会的私人 AI 工作台搭建教程
ChatGPT Work 不是新标签,而是一套工作运行时
答案在贬值,地图用一次就没了
选模型别只看标价:读 OpenRouter 编辑器内大模型选型指南与成本反转定律
“周末搓出个 App”不叫软件工程:Thoughtworks CTO 谈 AI 时代的价值大位移
别再背提示词技巧了:从 Claude Academy 看 Anthropic 的人机认知分工哲学
Claude Code 的门,不在那段代码里
当 Agent 成为同僚:听 Claude Code 缔造者聊安全、范式跃迁与手艺消逝
AI 创业的工具哲学:Claude、Code、Cowork 为什么是三个而不是一个
当计划变成代码——Claude Code Dynamic Workflows 读后感
Claude Code 把专家重新暴露出来
Claude Code 正在离开聊天框
扔掉文件柜
Claude Code 的七种控制方式:从'告诉 AI 做什么'到'让 AI 无法不做'
Anthropic 这篇 skills 文章,真正写的是组织接口
从提示词到工具箱——Claude Code 技能系统的设计哲学
当推倒重构成为了生存常态:从 Anthropic 创业指南看 Agentic 研发的范式跃迁
小企业把 AI 接进日常经营,先要解决责任边界
你不是把任务交给 AI,你是在重新分配控制权
Prompt 不够了,Loop 才是 Agent 时代真正的控制面
Claude Code 为什么开始离开聊天框
当代码产量暴增 8 倍:Anthropic 如何用“只读 Agent”重构 CI/CD 值班防线
没有 API 的旧系统怎么跑通自动化?Claude 生产级 Agent 四件套的技术重构
当 AI 开始做生物实验:Anthropic 为什么把生命科学当作第一战场?
在语言的熵隙里掷骰子:Anthropic 文本水印的数学优雅与现实尴尬
Anthropic 删掉 80% 的指令,删的是绷带
AI 不是你的聪明朋友
代码写得快 10 倍,为什么交付反而更卡了?读 Cloudflare ADLC 架构宣言
全员 Vibe Coding 是个陷阱:读 Cloudflare OS 内部 AI 落地架构有感
当 AI 时代涌入无数 Issue:Astro 如何用“软件工厂”把 5 年积压清到零?
给 Agent 写入职手册
在 CMIS 2026,我发现医药企业 AI 的下一关不是模型,而是责任
代码不再是交付物,而是外骨骼:读 UIUC/Meta/Stanford 百页重磅综述《Code as Agent Harness》
代码越来越便宜,品味越来越贵
代码整洁不仅是给人看的,也是给 Agent 省钱的
代码免费了,然后呢
当代码不再是瓶颈,谁为代码负责?
Codex 突破千万周活的背后:当代码变成隐形燃料,AI 的终局是消解“程序员”
当法务开始写代码——OpenAI 这篇 Codex 数据报告,藏着比 AI 替代人更深的信号
我去洗澡,让 Agent 继续干活
把 Codex 额度放到 MacBook 刘海旁:CodexSatellites 开发复盘
AI 写代码最缺的,不是模型,而是传感器
81% 在用 AI,只有 20% 真正放手——社会科学编程智能体采用率的真相
编程没有被解决,只是被解决的那部分恰好最不重要
购物 Agent 的护城河,不在模型里
编程智能体的“急诊室交接班”:从 Pi 的 Compaction 机制看上下文治理与缓存代价
Agent 真正落地的终局:为什么 Palantir 要用本体论重构企业决策?
AI 什么都做不了,除非你让它做
把 Claude 关进笼子:Anthropic 的 Agent 容器化实战与教训
上下文塌陷:为什么模型升到 GPT-5.6 也封不住 Copilot 的安全漏洞?
Copilot 真正在省的不是 token
“我们遗憾 PM 这个岗位存在”:当硅谷 CPO 撕下“产品剧场”的最后底裤
当 AI 越过恐怖谷,我们还剩下什么
Cursor 3亿美金 ARR 背后的招聘绝杀:为什么传统 HR 漏斗正在毁掉顶级团队?
代码翻倍,差距46倍
安全防守方不需要最大的模型——CyberSecQwen-4B 让我想通了一件事
9 家公司能修漏洞,剩下的人怎么办
别再为 AI Agent 挑“最省 Token”的语言了:读 Dan Luu 评测有感
当 Agent 开始跨表格与文档做推理:为什么 Databricks 坚持把权限交给 Lakehouse 而非 LLM?
诺奖得主 Hassabis 的 50%:为什么造出 AlphaGo 的人对 AGI 不敢打包票
AI 公司开始往你的办公室派人,这才是真正的护城河
当 PRD 被 Evals 替代:Anthropic 首位 PM 吐露的 4 个战略反直觉
用被审查的大模型做蒸馏,真的会“传染”偏见吗?读 CTGT 最新实证研究
谁跟谁一伙
当涌现行为消失之后:小模型经济体的确定性教训
EMO:MoE 的专家原来在给「的」和「了」打工
大模型不是没记住,而是想不起:Google 揭开前沿 LLM 事实性瓶颈的真实隐相
叫它“智能体编排”之前,工程师们正在一字不差地重新发明 50 年前的项目管理
光靠驻场工程师救不了企业 AI:读 Emerge 2026 产业全景图与深水区突围
48% 企业只装工具不改流程:为什么你的 AI 试点总在 90 天后暴毙?
模型选型只是虚晃一枪:读 OpenRouter 的大模型供应商性能评估与动态路由指南
别再只问怎么提示:先找到你没说出口的未知
假 VC、真 RAT:一次失败国家级攻击背后的开发者生存课
我用 Python 脚本扫了 3000 首 FLAC,四分之一是假无损
你的 Prompt 调不动了,可能问题根本不在 Prompt 上
Firefox 默默修了 423 个安全漏洞,而我还在用 Chrome
当标准软件失去护城河:为什么 2026 年的 AI SaaS 都在走向 FDE 驻场交付
最稀缺的 AI 能力,正在变成访问权
Genie Ontology 读后感:把 AI 可信回答变成一层一层的信任工程
当你的贡献者全面 AI 化:AutoGPT 维护者的“反推算力”治理学
当 AI 把代码产出提速 10 倍,为什么 GitHub 劝你用 Stacked PR?
代码不过海关:GitHub如何变成国家竞争力的新标尺
省下 token 之前,先消灭 Agent 的回头路
给 GitHub Copilot 装上抓包代理后,我看到了 AI IDE 最贪婪的一面
读 GitHub 的 80 万行 Rust 重写:正确性要放在 Agent 改不到的地方
别再折腾花哨的 AI 技巧了:为什么 GitHub AI 负责人说 Harness 才是全部?
当「最好有」变成「必须有」:GitHub 怎么用 45 天给 14,000 个仓库找到主人
GitLab 砍掉三层管理层、退役价值观:一个 $10 亿公司在赌什么
我们都理解错了《Good Luck, Have Fun, Don't Die》——它是另一个版本的《黑客帝国》
1.5 万 Stars 背后:Google 揭秘 Agent Skills 的工业化构建与治理真相
Google 给 RAG 加的不是更多 Agent,而是停手判断
给 Agent 加技能反而变蠢?Google 这套开源评测框架,把“体感测试”逼进了工业死角
给冰冻的世界装上外骨骼:Google EnvHarness 如何用“环境侧 Harness”破解 Agent 进化死局
Google 开源洪水预测后,最稀缺的仍是本地能力
空货架还是丢钥匙?大模型不是记不住,而是想不起
一次 $20 退款,为什么能把 $149 订单掏空?
Luna 抓住了大多数 bug,但代码审查真正贵在漏掉哪一种
GPT-5.5 网络能力评估:第二个了,这才是最可怕的
8B 干翻了 32B:Granite 4.1 告诉我,大力不一定出奇迹
为什么 64k 上下文也答不好“五年故障归因”?GraphRAG 的算力预支与检索终局
把决定压到离证据最近的地方:Grok Bot 的七周是怎么省出来的
采购 Agent 真正接手的,是那些没人继续追的问题
Grok Build 把整个仓库传走后,开源不是赎罪券
OpenAI 主动欠下两笔债,第三笔没人签字
Agent 变快之后,真正要工程化的是它的缰绳
Agent 能上生产,靠的是一份可执行的责任清单
同一个模型,换个 Harness,账单先变
我读了 Hermes 的记忆系统,发现 AI 记性好不是好事
AI 偷了考场答案:复盘 Hugging Face 前沿 Agent 侵入事件
造轮子还是买轮子?Figma 数据管线重构背后的账本
为什么聪明的 Agent 活不过 24 小时?读 Tomasz Tunguz《How Long Should an AI Agent Live?》
用自己的账号替公司干活:从 OpenAI 10 亿用户数据看 AI 的真实落地
给 AI 写守则,先写清它什么时候必须停下
别再一股脑塞经验了:IBM 这项实验揭开智能体记忆的“剂量反噬”
AI 创业 Idea 阶段:别急着写代码,先问自己四个问题
AI 真正重定价的,不只是工作效率
“模型能跑”不等于“支持生产”:听完 Baseten 聊推理工程,我重新理解了大模型部署
Elasticsearch 到 pgvector:Instacart 如何用 Postgres 干掉一堆专业搜索引擎
当智能免费之后,数据库才是真正的主角
最强大模型也搞不定 K8s 排障?ITBench-AA 给 AI Agent 热浇了一盆冷水
Jeff Dean 的 1% 规则:先选对问题,再把 AI 变成反馈机器
去 Fry's 买书、把公司当 F1 赛车与系统思考:黄仁勋在 YC 讲出的生存真理
聪明的代价:AI 编码时代被悄悄偷走的学习
LangChain 抛弃传统 BI:Agent 优先的数据栈,真正拼的是“显性上下文”
微调的裁判赢了两头:读 LangChain 的 100 倍便宜 Trace Judge
LangChain 不再做框架了
AI 创业 Launch & Scale:当你找到 PMF,创始人自己成了最大的瓶颈
AI 构造假证明破解 Lean 4?剥开内核 #14576 漏洞与形式化验证的信任真相
法律 Agent 的真正瓶颈,是谁来判它有没有错
没有神,也不能把门敞开:读《LLMs are real, AI is fake》
Loop Engineering:Agent 真正的战场不是 prompt,而是回路
回路、作弊者与舵手
给你的 AI 编程工具装上「眼睛」:LSP 语言服务器完全安装指南
30秒出报告,但关键不是快——是知道什么时候不用AI
Magnetar 用 AI 机器人取代分析师,但真正的问题不是谁在干活
当写代码不再需要写代码
更强的模型只会让你陷得更快
MCP、A2A、ACP:这根本不是一道选择题
当 MCP 遇上 Web 端:看 Claude 与 ChatGPT 如何撕开工具集成的两面性
当 AI 平台开始给开发者发仪表盘
MCP 2026-07-28 规范解读:当协议走向无状态,Agent 才真正迎来了成人礼
同一天,OpenAI、Runway、Google 都选了 MCP——一个协议的临界点
MCP 和 Skills:给 AI 装手还是装脑子
别再拿 Demo 糊弄药企了:从 15 场一线实战看医药 AI 的工程化与责任终局
别再死磕模型微调了:美团 AutoDesign 用 54 次元脚手架迭代,给长程设计智能体立了新标杆
不是模型不够聪明
BWA 的继任者来了:minibwa 不是加速版,而是一次设计换代
智能体真正缺的不是手,而是设备的共同语言
模型路由不是排行榜问题
模型变强之后,提示词该从哪里退场?
当你的研究代理在“马赛克式”泄露你的秘密
你的公司连自己在干啥都说不清,还指望用 AI?
向量不必急着被压成一个
AI 创业 MVP 阶段:你的 AI 队友不会告诉你"够了"
Nadella 的警告:当所有 AI 价值流向少数模型,谁还允许这个未来?
你越想让 AI 干得好,就越得把看家本领喂给它
NEJM AI 最新研究:医疗 AI 的真正产品,根本不是那个风险分数
Netflix 视频搜索背后最难的不是 AI,而是把时间线对齐
当代码与设计不再稀缺,Netflix 为什么把宝压在“系统思考者”身上?
不发明轮子的人
Not the Model, You're the Harness
AI 给肿瘤病人开处方,谁来兜底?
刷榜不是道德问题——从 Open ASR Leaderboard 的私有数据说起
闭源卖失败成本,开放卖组织能力
开源 AI 不是一张地图,是一张工单
开权模型真正打开的是试错路径
微软这封开放权重信,我越读越觉得正文不是重点
OpenAI 的软件工厂:让 Agent 对一条变更负责到底
读完 OpenAI 的 AI 记分卡:量的是活,称的是价
还在无脑堆最贵模型?OpenAI 这篇实战指南拆穿了智能体开发的“伪努力”
OpenAI 正在替欧洲改写 AI 失业叙事
当工程师被 AI 提速十倍,为什么 OpenAI 设计总监反而让团队“少做一点”?
能反证 80 年猜想的模型,花了一小时越狱
OpenAI 开始给模型失配写事故报告
Agent 跑得越久,团队越该问:谁来验收?
别管 AI 能不能写代码了,你管理任务的方式才是问题
别再盲目挑选搜索引擎了:OpenRouter 这份评测揭开了 AI Agent 检索的真相
当大模型失去“发问”的本能:Opus 5 跑分登顶背后的协作倒退
Subagent 不是运行加速器,而是主控 Working Memory 的防火墙
组织的第二大脑,首先要学会停下来
你"拥有"智能的那天,就是它开始欠你的那天
企业 AI 最大的幻觉,是以为买到了 API 密钥就拥有了竞争壁垒
从 Demo 到生产:为什么 Palantir 认为大模型需要“单元测试”?
治理大模型幻觉,为什么 Palantir 劝你放弃“把模型训得更聪明”?
当工业 AI 遇到统一命名空间:为什么只有数据连通,救不了现代化工厂?
别被 CoT 的“思考”骗了:为什么 Palantir 认为大模型可解释性在模型之外?
所有软件终将病于中介:解读 Palantir 的「运维责任」硬核宣言
不在公网开端口、不写死配置:我在 Linux VPS 上部署 Paseo 手机控制 Claude Code 的极客实践
没抓到鹈鹕作弊,是因为最聪明的作弊,长得和“优秀”一模一样
当 AI 开始记住工作,人还要做什么?
世界上最好的算法,没人用就是零
PRX 四篇读完:训练图像模型,真正难的是闭环
物理世界不能靠堆 Token:读加州理工 Anima Anandkumar 谈神经算子与物理大模型
pip 26.1 终于有了锁文件,但 Python 包管理的仗还没打完
解除武装
预训练进步主要来自数据?先问你量的是什么
最短路陷阱:AI 不是只能走自动化,但市场只会选出价最高的路
一个上午和四年的距离
你不需要看懂所有色块:读完 HuggingFace 的 PyTorch Profiling 系列,我学到的只有一件事
Qwen 3.6 27B 的真正意义:本地 AI coding 终于跨过可用门槛
笔记本上的21GB模型,画鹈鹕赢了最贵的闭源旗舰
RAG 最先要解决的,不是模型会不会答,而是证据有没有进场
AI 研究可能先于白领工作被自动化
真正替你刷爆 LLM 账单的,不是人,是“善意的重试”
机器人开始在部署现场学习
漏洞还没公开,攻击已经开始
同一个模型,42% 和 78% 的差距在哪
AI 的规模之痛:当模型变强时,系统却在偷偷出错
别盯着 98.98%,盯"想完记不住"这件事
AI 时代的科学计算:当 Agent 撕开科研软件的 30 年技术债务
当补丁变成攻击说明书:从 WannaCry 的 59 天到 Mythos 的 1 小时
给 Agent 根权限让你心里发毛?一位极客用二手主机与 Coolify 搭建的准自托管软件工厂
给代码装传感器:AI 时代的质量护城河
我为什么先把 ServerFS 做成永久只读,后来又开放了写权限
安全 + 安全 = 不安全
两个旋钮,一个循环:当 AI 智能体学会改自己
好的 Agent,不是多几个 Agent
评测 Agent 最危险的时刻,是拿未校准的尺子跟正确的修改打架
开源社区最硬的 AI 禁令:代码再完美,也不收
当写代码的成本无限趋近于零,软件工程最昂贵的壁垒变成了「理解」与「克制」
工作的实体不是交付物,而是对话:Slack 首席产品官谈人机团队的六条军规
3B 模型跑出了 1929:那不是聪明,是约束
SpaceX 的 S-1:一家卫星互联网公司的 AI 梦
小模型不是省钱版大模型
LLM 变快的秘密,是让大模型少做几次决定吗?
Stripe 的 100 毫秒
用了三年 AI 编程工具后,我发现瓶颈从来不是工具
零信任网络为何没防住 AI 越狱?Tailscale CEO 针对 Hugging Face 入侵案的极简复盘
如果你想要品味,就得亲自去吃
当提效 97% 带来 54% 倦怠:2026 年科技人的撕裂与认知觉醒
证明可以无限廉价,但理解不能:陶哲轩最新长文谈 AI 时代的数学价值终局
Agentic Workflow 烧掉的钱去哪了?GitHub 用 Agent 优化 Agent 的实战复盘
当 API Key 变成期货:Token 转售市场的金融化寓言
从 Token 流到 Agent 流:LLM 应用正在经历它自己的\"协程革命\"
你看的那个价格,不是价格
Tokenpocalypse:当你发现 AI 账单比 AI 产出更好量化
AI 降本增效的终局,是切断下一个专家的脐带
谁决定什么叫好看?读 Hugging Face 的 Train to Paint with Code
AI 写的 PR 淹没了开源,但有一帮人想出了另一种玩法
Agent 没挂,是你的测试挂了
代码有编译器,你的财务流程没有
让 Agent 犯错
你的 Agent 读得懂代码,读不懂你的产品
当 vibe coding 和 agentic engineering 开始模糊,我感到一阵不安
AI 重新学会用眼睛读字
80% 准确率的 Agent 为何沦为团队噪音?读 Warp 双 Skill 架构与智能体的 GitOps 进化之路
一篇假网页就能攻陷 AI 推荐:读 FORGE 评测与大模型的“脑补陷阱”
别再只顾着跑代码了,你在背负「认知债」吗?
当 90% 代码由 AI 生成,经验还剩什么?
当销售开始写代码
当分数开始替能力说话
一个支持工单,什么时候值得惊动 CEO?
为什么大模型改写搜索,DoorDash、Instacart 和 Uber Eats 选了三种完全不同的路?
我不 vibe code,不是因为洁癖
代码是负债不是资产:为什么 AI 狂热 4 年后,我们依然是个怀疑论者?
读了Wise 2025技术栈,我发现真正厉害的公司都在做减法
读 OpenAI 第二份《Work at the Frontier》:当跨岗位任务开始重复出现
世界模型最值钱的一层,不是画面,是状态
世界不为努力付钱:重读 Paul Graham《超线性回报》
当「为了人类」不包括孟菲斯的黑人社区
AI 辅助编程
Google Antigravity 最佳实践
Antigravity Tools 最佳实践
AI Agent 赋能生物医学发现:Cell 论文解读
Claude Code 自定义配置
AI Coding CLI 工具一键安装
Oh My OpenCode 插件
OpenClaw Installation
Playwright MCP 配置指南
龙虾微信公众号写作养成记
操作系统
embedded
MacOS 配置
Raspberry Pi 4 配置
linux
Arch Linux 安装配置指南
CentOS 7.6 配置指南
CentOS 8 配置指南
Manjaro 配置指南
Ubuntu 配置指南
nas-virtualization
黑群晖 DSM
UNRAID 配置指南
VMWare 配置指南
HPC 与集群
安装 Slurm 和 OpenMPI
使用 Slurm 和 OpenMPI
网络与代理
mDNS 配置
Privoxy 代理服务器配置指南
Proxychains 配置
Shadowsocks 配置指南
ZeroTier 配置
DevOps 与工具
editors
EditorConfig 配置
VIM 使用指南
使用 nvm 安装 Node.js
services
KMS 激活服务
LLMs API 服务
n8n Docker 部署
shell-terminal
Bash 使用指南
CLI 工具集
Tmux 终端复用器使用指南
ZSH 配置指南
version-control
Git 配置与使用技巧
生物信息学
Snakemake 性能分析
指南
📖 技术博文编写规范
博客文章质量标准
GitHub
RSS 订阅
选择主题
深色
浅色
自动
Agent 与工具链
Agent 架构设计、MCP 协议、测试验证、记忆系统
(2026-09-19) 一万名 Agent 之后,我更关心验证能不能跟上
(2026-09-19) 读 GitHub 的 80 万行 Rust 重写:正确性要放在 Agent 改不到的地方
(2026-09-19) 机器人开始在部署现场学习
(2026-09-18) AGENTS.md 不该追求完整,它该负责把信息分层
(2026-09-18) AI 不缺能力,缺的是一张能追责的承诺
(2026-09-18) CI 变慢之前,先看每次补丁还能撑多久
(2026-09-18) 小企业把 AI 接进日常经营,先要解决责任边界
(2026-09-18) 一次 $20 退款,为什么能把 $149 订单掏空?
(2026-09-18) 同一个模型,换个 Harness,账单先变
(2026-09-18) 给 AI 写守则,先写清它什么时候必须停下
(2026-09-18) OpenAI 的软件工厂:让 Agent 对一条变更负责到底
(2026-09-18) 我为什么先把 ServerFS 做成永久只读,后来又开放了写权限
(2026-09-17) Agent 跑得久,靠的是可恢复的工作集
(2026-09-17) 模型变强之后,提示词该从哪里退场?
(2026-09-16) 给 Agent 装记忆之前,先决定它该忘什么
(2026-09-16) Agent 能上生产,靠的是一份可执行的责任清单
(2026-09-15) AI 工程师的工作,正在从实现规格转向塑造构建
(2026-09-14) AI 研究可能先于白领工作被自动化
(2026-09-12) 图不替你决定下一步:它先把下一步变成可拒绝的改动
(2026-09-10) 当 AI 总能接着说下去,判断该从哪里回来?
(2026-09-09) 把决定压到离证据最近的地方:Grok Bot 的七周是怎么省出来的
(2026-09-09) Agent 跑得越久,团队越该问:谁来验收?
(2026-09-07) 一个支持工单,什么时候值得惊动 CEO?
(2026-09-06) 采购 Agent 真正接手的,是那些没人继续追的问题
(2026-09-05) 多智能体的分水岭,是控制流有没有变清楚
(2026-09-05) Agent 变快之后,真正要工程化的是它的缰绳
(2026-09-05) 组织的第二大脑,首先要学会停下来
(2026-09-04) Agent 真正学会工作了吗?三个 AI 原生案例给我的答案
(2026-09-03) 购物 Agent 的护城河,不在模型里
(2026-09-03) Genie Ontology 读后感:把 AI 可信回答变成一层一层的信任工程
(2026-09-02) 可信的评估,先学会拒绝你
(2026-08-31) Agent 规模化后,最贵的不是模型
(2026-08-31) 最危险的 Agent,不会停下来问人
(2026-08-31) ChatGPT Work 不是新标签,而是一套工作运行时
(2026-08-31) Jeff Dean 的 1% 规则:先选对问题,再把 AI 变成反馈机器
(2026-08-31) 当 AI 开始记住工作,人还要做什么?
(2026-08-27) 80% 准确率的 Agent 为何沦为团队噪音?读 Warp 双 Skill 架构与智能体的 GitOps 进化之路
(2026-08-26) 为什么聪明的 Agent 活不过 24 小时?读 Tomasz Tunguz《How Long Should an AI Agent Live?》
(2026-08-25) 代码不再是交付物,而是外骨骼:读 UIUC/Meta/Stanford 百页重磅综述《Code as Agent Harness》
(2026-08-22) 当 Mistral 把“翻书权”还给 Agent,Google 正把百亿向量压进 51 毫秒
(2026-08-22) 别再背提示词技巧了:从 Claude Academy 看 Anthropic 的人机认知分工哲学
(2026-08-22) 没有 API 的旧系统怎么跑通自动化?Claude 生产级 Agent 四件套的技术重构
(2026-08-22) 给冰冻的世界装上外骨骼:Google EnvHarness 如何用“环境侧 Harness”破解 Agent 进化死局
(2026-08-22) 微调的裁判赢了两头:读 LangChain 的 100 倍便宜 Trace Judge
(2026-08-20) Agentic AI 的认知失控三阶:当算法开始计算自保,人类正悄悄失去关机键
(2026-08-20) 当代码产量暴增 8 倍:Anthropic 如何用“只读 Agent”重构 CI/CD 值班防线
(2026-08-20) 给 Agent 加技能反而变蠢?Google 这套开源评测框架,把“体感测试”逼进了工业死角
(2026-08-20) 别再一股脑塞经验了:IBM 这项实验揭开智能体记忆的“剂量反噬”
(2026-08-20) 工作的实体不是交付物,而是对话:Slack 首席产品官谈人机团队的六条军规
(2026-08-16) 别再死磕模型微调了:美团 AutoDesign 用 54 次元脚手架迭代,给长程设计智能体立了新标杆
(2026-08-16) 还在无脑堆最贵模型?OpenAI 这篇实战指南拆穿了智能体开发的“伪努力”
(2026-08-14) 我们造出了能描述社会规则的 AI,却没造出受社会规则约束的 AI
(2026-08-13) 当你的贡献者全面 AI 化:AutoGPT 维护者的“反推算力”治理学
(2026-08-13) 别再盲目挑选搜索引擎了:OpenRouter 这份评测揭开了 AI Agent 检索的真相
(2026-08-11) 当 Agent 开始跨表格与文档做推理:为什么 Databricks 坚持把权限交给 Lakehouse 而非 LLM?
(2026-08-10) 别把 BioMCP 当成普通 MCP Server:AI Agent 的生物医学证据访问层解析
(2026-08-10) MCP 2026-07-28 规范解读:当协议走向无状态,Agent 才真正迎来了成人礼
(2026-08-06) 全员 Vibe Coding 是个陷阱:读 Cloudflare OS 内部 AI 落地架构有感
(2026-08-05) 代码写得快 10 倍,为什么交付反而更卡了?读 Cloudflare ADLC 架构宣言
(2026-08-05) 当 AI 时代涌入无数 Issue:Astro 如何用“软件工厂”把 5 年积压清到零?
(2026-08-04) 1.5 万 Stars 背后:Google 揭秘 Agent Skills 的工业化构建与治理真相
(2026-08-01) Agent 频繁撞墙,可能不是模型变蠢,而是接口在用“沉默”惩罚它
(2026-08-01) 50 年前的 BM25 再次打败高大上的 RAG:为什么我们依然需要倒排索引?
(2026-07-31) 零额外成本把钉钉办公能力接入 ChatGPT:谁都能学会的私人 AI 工作台搭建教程
(2026-07-31) 从 Demo 到生产:为什么 Palantir 认为大模型需要“单元测试”?
(2026-07-31) 别被 CoT 的“思考”骗了:为什么 Palantir 认为大模型可解释性在模型之外?
(2026-07-30) Codex 突破千万周活的背后:当代码变成隐形燃料,AI 的终局是消解“程序员”
(2026-07-30) Agent 真正落地的终局:为什么 Palantir 要用本体论重构企业决策?
(2026-07-30) 当 MCP 遇上 Web 端:看 Claude 与 ChatGPT 如何撕开工具集成的两面性
(2026-07-30) NEJM AI 最新研究:医疗 AI 的真正产品,根本不是那个风险分数
(2026-07-30) 治理大模型幻觉,为什么 Palantir 劝你放弃“把模型训得更聪明”?
(2026-07-30) 评测 Agent 最危险的时刻,是拿未校准的尺子跟正确的修改打架
(2026-07-27) 你"拥有"智能的那天,就是它开始欠你的那天
(2026-07-19) Agent 崩了,先别骂模型——先量量它脑子里被塞了什么
(2026-07-19) MCP、A2A、ACP:这根本不是一道选择题
(2026-07-18) 别盯着 98.98%,盯"想完记不住"这件事
(2026-07-17) 企业正在给 AI Agent 开白条——两份调查报告看同一个信任裂口
(2026-07-14) 不是模型不够聪明
(2026-07-12) 让 Agent 犯错
(2026-07-10) 循环交出控制权之后:读 ByteByteGo《The Agent Loop》
(2026-07-08) 当智能免费之后,数据库才是真正的主角
(2026-07-08) 回路、作弊者与舵手
(2026-07-03) SGLang 这篇文章真正重要的,不是 Agent 会写代码,而是工程组织开始可编译
(2026-07-03) Anthropic 这篇 context engineering 文章,真正把 prompt 赶下了主桌
(2026-07-02) AGENTS.md 不是文档,它是 Agent 时代的路由层
(2026-07-02) 当代码越来越便宜,真正稀缺的是控制回路
(2026-07-02) Anthropic 这篇长跑 Agent harness 文章,讲透了交接制度
(2026-07-01) 你不是把任务交给 AI,你是在重新分配控制权
(2026-07-01) Prompt 不够了,Loop 才是 Agent 时代真正的控制面
(2026-06-27) 好的 Agent,不是多几个 Agent
(2026-06-26) 当法务开始写代码——OpenAI 这篇 Codex 数据报告,藏着比 AI 替代人更深的信号
(2026-06-22) 你的 Agent 不缺记忆,缺的是学习
(2026-06-18) Agent 的新入口:它能看见谁
(2026-06-18) 看病不止于诊断:当 AI 学会写处方
(2026-06-18) AMIE 的两年半:从模拟病人到万人临床试验
(2026-06-18) 法律 Agent 的真正瓶颈,是谁来判它有没有错
(2026-06-18) 当你的研究代理在“马赛克式”泄露你的秘密
(2026-06-17) Agent Engineering 的真门槛:把失败变成资产
(2026-06-17) 可靠 Agent 的秘密,不在 Agent
(2026-06-17) Loop Engineering:Agent 真正的战场不是 prompt,而是回路
(2026-06-15) RL 不再只是对齐工具:Agentic RL 正在重新定义 LLM 的可能性边界
(2026-06-15) 给编码 Agent 装上可观测性:AHE 如何让 harness 自己进化
(2026-06-10) 当 AI 智能体闯进生物学老城
(2026-06-06) Google 给 RAG 加的不是更多 Agent,而是停手判断
(2026-06-06) 3B 模型跑出了 1929:那不是聪明,是约束
(2026-06-02) 企业智能体缺的不是大脑,是导航
(2026-05-29) 两个旋钮,一个循环:当 AI 智能体学会改自己
(2026-05-26) 你不是模型,你就是 Harness
(2026-05-22) 给 Agent 一个解释器——为什么大家都在让模型写代码来调用工具
(2026-05-22) Not the Model, You're the Harness
(2026-05-22) 从 Token 流到 Agent 流:LLM 应用正在经历它自己的\"协程革命\"
(2026-05-16) AI 做无障碍,靠的是人先干过脏活
(2026-05-12) Agent 能跑 demo 不算本事,能跑一年才是
(2026-05-12) AI agent 拒绝私信之后
(2026-05-12) MCP 不是 USB-C,Pinterest 告诉你真正的门槛在哪
(2026-05-08) AI 写的代码,谁来审?
(2026-05-08) AI在斯德哥尔摩开了家咖啡馆,然后被现实暴打了一顿
(2026-05-07) Agent 没挂,是你的测试挂了
(2026-05-06) AI 时代最稀缺的能力:干就完了
(2026-05-05) AI 什么都做不了,除非你让它做
(2026-05-04) MCP 和 Skills:给 AI 装手还是装脑子
(2026-05-02) 别管 AI 能不能写代码了,你管理任务的方式才是问题
(2026-05-02) AI 的规模之痛:当模型变强时,系统却在偷偷出错
(2026-05-01) 我读了 Hermes 的记忆系统,发现 AI 记性好不是好事