OpenAI指AI评测基准失灵:731道题近三成缺陷,8个月通过率从23%飙至80%
admin 2026-07-10 134浏览
OpenAI公开质疑SWE-Bench Pro基准:近三成评测任务存在缺陷 OpenAI发布博文,公开挑战行业权威评测基准SWE-Bench Pro。该基准由Scale AI推出,专门评测大语言模型与AI智能体的编程能力,因高度...
admin 2026-07-10 134浏览
OpenAI公开质疑SWE-Bench Pro基准:近三成评测任务存在缺陷 OpenAI发布博文,公开挑战行业权威评测基准SWE-Bench Pro。该基准由Scale AI推出,专门评测大语言模型与AI智能体的编程能力,因高度...
admin 2026-03-20 286浏览
通义千问Qwen3.5-Max-Preview登顶LM Arena,中国大模型首次跻身全球前五 3月20日,阿里通义千问正式发布Qwen3.5-Max-Preview,这款新模型在国际权威大模型评测平台LM Arena上一鸣惊人,以1464分的...