忘记密码?
其他方式登录

斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5

2026年8月25日

详细介绍

同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?

Terminal-Bench 2.1是平时我们在大模型评测里面经常见到的一个数据,它测的是一个AI Agent在真实的沙盒环境里,能不能完成真实终端任务。

DeepSeek V4 Flash单次尝试的原始成绩是78.7%,这个成绩本身已经不错,但还没有超过Fable 5的83.8% ±1.2%

这里就引出一个词:test-time scaling,中文可以理解成“做题时扩展能力”。

你可能会问,这个机制这么好用,能不能给Fable 5也加上?

最后想说一句,机制再好,关键还是需要人去用。你不动手,AI再强也跟你没关系,不管是对个人开发者还是对企业来说都是这样。

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论