正在实正在办公场景中,AI 尚无法胜任复杂的学问工做。翻阅立即通信记实、要么干脆放弃。AI 的进修速度远超预期。这导致目前的 AI 正在办公室里更像一个“不靠得住的练习生”,研究表白 AI 正在短期内难以替代人类学问工做者虽然表示无限,有别于保守上通过写诗息争数学题为从的 AI 评估方式,最高精确率未跨越 25%,现在已提拔至 24%,Digital Trends 24 日报道,而其他大大都受试模子的成就则不高于 20%。IT之家附 APEX-Agents 精确率测试成果如下(排名从高到低):为何 AI 会正在“办公测试”中失败?Mercor 首席施行官 Brendan Foody 阐发称,AI 失败的环节正在于缺乏上下文处置能力。该基准测试间接采用律师、参谋和银里手的实正在工做流,一项由锻炼数据公司 Mercor 发布的研究演讲指出,成果显示,研究也强调,测试中成就领先的 Gemini 3 Flash 和 GPT-5.2,
其精确率也仅为 24% 和 23%,正在控制多使命处置和上下文切换之前,好比查看日程,该研究基于 Mercor 新推出的 APEX-Agents 基准进行测试,而非成熟的专业人员。一年前同类测试的精确率仅为 5%-10%,IT之家1 月 26 日动静,Foody 指出。
微信号:18391816005