今日判断AI Agent 在离线模拟里“全部通过”,只能证明它通过了我们已经想到的考题,不能证明真实用户体验会改善。可靠的发布必须连过三道门:上线前用 eval 防已知错误,上线中用小流量实验验证真实增量,上线后用持续监控发现新失败。只做第一道门,是质量保障;三道门能把生产失败重新变成测试与策略,才接近 AI-native 增长闭环。
- 🧩 Eval-driven Delivery——AI 功能为什么不能像普通文案一样改完就发
- 📡 Intercom:上线前模拟、上线中实验、上线后监控
- 📡 Sierra:Agent 改动也需要真实对照,而不是只听模型解释
- 🎧 Hamel Husain & Shreya Shankar——Evals 为什么是“会执行的 PRD”