VOL.010
今日判断AI 回答在离线评测里变好,不等于用户体验和留存真的变好;但直接把每个版本都扔进线上 A/B test,也是在拿真实用户替系统做基础质检。更可靠的顺序是:先用 Evals(评测)验证“它有没有按预期工作”,再用线上实验验证“真实用户是否因此得到更好结果”,最后用实验结果反过来校准 Eval。对 Momcozy APP,这能避免把“模型更会得分”误当成“用户…
- 🧩 Verification 与 Validation——做对了,和做对的事,不是一回事
- 📡 Spotify:Eval 是实验漏斗的上游,不是 A/B test 的替代品
- 📡 OpenAI:真实输入、专家判断与用户结果都要进入 Eval 的更新循环
- 🎧 Hamel Husain × Shreya Shankar / 不要被一个漂亮的准确率骗了