AI研究员Dmitry Khvalto揭露,OpenAI在ARC-AGI推理能力测试中,通过修复测试框架(harness fix)使得分提升三倍。此前其模型得分仅为16%,修复后跃升至49.7%。这一现象引发业界对AI评估方法论的热议——测试框架的微小差异可能导致评估结果巨大偏差。ARC-AGI作为抽象推理能力基准,其评分机制的严谨性受到质疑。🔗 原文链接:https://x.com/dzhulgakov/status/2084442125886951492
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END







