2026-07-09三周的先例:Claude Fable 5的禁令如何为AI安全治理建立了新的基准当模型的越狱成为国家安全事件时,一切都会改变 Claude Fable 5作为公开产品仅存在了三天,于2026年6月12日被美国商务部从互联网上撤下。触发原因很简单:亚马逊的研究人...
2026-06-0488%的MMLU成绩为何已过时:从知识评估到智能体压力测试的转变基准测试的天花板问题 当多数前沿AI模型在MMLU基准上达到88%以上的准确率时,一个尴尬的事实浮出水面:衡量AI性能变得越来越困难。这不是因为AI停止了进步,而是因为我们用来评估...