质量是「收敛」出来的:Qwen3.7-Max 仅凭调研文档全自动交付双端应用实验
编译摘要
1. 浓缩
- 核心结论1: 质量是“收敛”出来的,而不是一次性“生成”的。在长程、高复杂度的 Agent 任务中,决定交付质量的是约束闭环控制系统,而非单纯的模型规模。
- 关键证据: Qwen3.7-Max 在 4 小时内通过分阶段注入硬约束,从 0 到 1 自动交付了高度还原的移动端(APK)和 Web 端应用。
- 核心结论2: “像素事实”是比文字描述更强的硬约束。文字描述在 Agent 任务中属于“有损压缩”,导致模型脑补错误;而从真机 dump 的像素坐标(Bounds)提供了不可违反的几何真相。
- 关键证据: 通过将 ui_summary.txt 中的坐标自动换算为布局硬约束清单,模型在不具备视觉能力的情况下实现了界面的精准还原。
- 核心结论3: 自动化判据(Automated Criteria)是长程闭环的关键。机器可验(0 error)不等于应用可用;必须建立从编排层到真机层的多级判定机制(如文本暗号、文件存在性检查、真机启动冒烟)。
- 关键证据: 引入“带错纠正”机制,将上一轮的报错和残局直接作为下一轮的输入,使模型能像人类一样在失败中持续收敛。
2. 质疑
- 关于“无视觉还原”的质疑: 虽然坐标约束能解决布局问题,但审美中的色调、质感、阴影等非几何要素如何通过“硬约束”传递?这种方法是否会导致 Agent 产出的 UI 极度机械化?
- 关于“模型守规矩”的假设: 文章提到 Qwen3.7-Max 展现了极强的指令遵循能力。对于其他模型(如开源小模型),如果模型本身不守规矩,约束工程的补位上限在哪里?
- 关于“收敛成本”的质疑: 4 小时的自动化交付虽然节省了人力,但成百上千次的工具调用和反复重试带来的 Token 消耗与算力成本,在大规模工业化生产中是否具备经济可行性?
3. 对标
- 跨域关联1: 类似于精密制造中的“夹具(Fixture)”。模型是切削刀具(提供智能),而约束闭环是夹具(限制偏差)。刀具再锋利,没有夹具也无法产出高精度零件。
- 跨域关联2: 类似于算法中的“梯度下降”。每一轮的报错和重试都是在计算损失函数,通过 Harness 的调度不断将系统状态推向“可用”的极小值点。
关联概念