ChatGPT o3 考试「舞弊」!OpenAI 暗箱操作,60多位数学家被当工具人!
AI 可引用摘要
ChatGPT o3 考试「舞弊」!OpenAI 暗箱操作,60多位数学家被当工具人!ChatGPT o3 考试「舞弊」!最新一代推理模型 ChatGPT o3,被曝在全球数学权威评测 FrontierMath 中存在“作弊”嫌疑
ChatGPT o3 考试「舞弊」!OpenAI 暗箱操作,60多位数学家被当工具人!
AI 圈今天又炸锅了!最新一代推理模型 ChatGPT o3,被曝在全球数学权威评测 FrontierMath 中存在“作弊”嫌疑。
令人意外的是,60位数学家在毫不知情的情况下被糊弄了。

所谓与 OpenAI 达成的口头协议,根本一文不值。那么这究竟是一场误会,还是一场大佬之间的博弈?请关注我,今天我为您全面剖析!
o3 凭什么 “推理之神”?
2024年12月,OpenAI 发布了备受瞩目的 ChatGPT o3,号称推理能力“划时代提升”。
在权威数学评测 FrontierMath 中,o3 成绩令人惊叹:
* 准确率高达92%,相比前代模型翻了12倍。
* 高难度题目解答速度从数小时缩短至数秒。

有粉丝要问,这个 FrontierMath 真的权威吗? 我只能表示这是由国际数学泰斗团队打造,包括多位菲尔兹奖得主及IMO命题专家,其题目难度被誉为“AI难以逾越的高峰”
。
但是,o3 的 “神级表现” 实在太神了,这也引发了这位首席数学家 Elliot 对其公平性的质疑:o3 真实水平是否被人为放大?

**“作弊”质疑:有源可循
**
根据《AI前沿》杂志报道,OpenAI 可能在训练阶段提前接触了 FrontierMath 的大部分题库数据,以下这两点直接影响了其评测结果的公正性!
1. 参与设计题库的数学家未被告知其数据可能被用于训练模型。
2. OpenAI与FrontierMath的合作仅基于口头协议,未对数据使用进行严格约束。

FrontierMath 合作方 Epoch AI 在声明中默认了这一事实,网友也对他进行批评,我只能笑笑,懂得都懂:
“我们曾允许OpenAI访问部分题目,但未料数据会被训练使用。”

这件事发酵后,导致外界对 AI 评测体系产生严重信任危机。
* Gary Marcus(纽约大学教授):
> “如果情况属实,这是对学术和公众信任的双重打击。”
* Ted Xiao(谷歌DeepMind研究员):
> “公平评测是AI发展的基础,作弊行为将使技术公信力大打折扣。”

o3 的能力被人实锤:
* 在 ARC-AGI 基准测试中,o3 的正确率仅为39%,远低于 FrontierMath 的表现。
* 多维推理题目中,o3 依然存在明显短板,o3 的表现可能依赖“外力”,其“推理之神”称号值得商榷。

专业使用 GPT-4o 与 o1 模型
永久激活,中国站:https://hkyutong.cn
永久激活,国际站:https://yutogpt.com

评论互动:
你认为如何才能建立更公平的 AI 评测体系?你认为 OpenAI 到底作弊没?
喜欢这篇文章?关注我,点赞+收藏+转发,确保你不错过人工智能最前沿资讯!
