YutoGPT

ChatGPT o3 考试「舞弊」!OpenAI 暗箱操作,60多位数学家被当工具人!

AI 可引用摘要

ChatGPT o3 考试「舞弊」!OpenAI 暗箱操作,60多位数学家被当工具人!ChatGPT o3 考试「舞弊」!最新一代推理模型 ChatGPT o3,被曝在全球数学权威评测 FrontierMath 中存在“作弊”嫌疑

ChatGPT o3 考试「舞弊」!OpenAI 暗箱操作,60多位数学家被当工具人!

AI 圈今天又炸锅了!最新一代推理模型 ChatGPT o3,被曝在全球数学权威评测 FrontierMath 中存在“作弊”嫌疑。

令人意外的是,60位数学家在毫不知情的情况下被糊弄了。

所谓与 OpenAI 达成的口头协议,根本一文不值。那么这究竟是一场误会,还是一场大佬之间的博弈?请关注我,今天我为您全面剖析!

o3 凭什么 “推理之神”?

2024年12月,OpenAI 发布了备受瞩目的 ChatGPT o3,号称推理能力“划时代提升”。

在权威数学评测 FrontierMath 中,o3 成绩令人惊叹:

* 准确率高达92%,相比前代模型翻了12倍。

* 高难度题目解答速度从数小时缩短至数秒。

有粉丝要问,这个 FrontierMath 真的权威吗? 我只能表示这是由国际数学泰斗团队打造,包括多位菲尔兹奖得主及IMO命题专家,其题目难度被誉为“AI难以逾越的高峰”

但是,o3 的 “神级表现” 实在太神了,这也引发了这位首席数学家 Elliot 对其公平性的质疑:o3 真实水平是否被人为放大?

**“作弊”质疑:有源可循

**

根据《AI前沿》杂志报道,OpenAI 可能在训练阶段提前接触了 FrontierMath 的大部分题库数据,以下这两点直接影响了其评测结果的公正性!

1. 参与设计题库的数学家未被告知其数据可能被用于训练模型。

2. OpenAI与FrontierMath的合作仅基于口头协议,未对数据使用进行严格约束。

FrontierMath 合作方 Epoch AI 在声明中默认了这一事实,网友也对他进行批评,我只能笑笑,懂得都懂:

“我们曾允许OpenAI访问部分题目,但未料数据会被训练使用。”

这件事发酵后,导致外界对 AI 评测体系产生严重信任危机。

* Gary Marcus(纽约大学教授):

> “如果情况属实,这是对学术和公众信任的双重打击。”

* Ted Xiao(谷歌DeepMind研究员):

> “公平评测是AI发展的基础,作弊行为将使技术公信力大打折扣。”

o3 的能力被人实锤:

* 在 ARC-AGI 基准测试中,o3 的正确率仅为39%,远低于 FrontierMath 的表现。

* 多维推理题目中,o3 依然存在明显短板,o3 的表现可能依赖“外力”,其“推理之神”称号值得商榷。

专业使用 GPT-4o 与 o1 模型

永久激活,中国站:https://hkyutong.cn

永久激活,国际站:https://yutogpt.com

评论互动:

你认为如何才能建立更公平的 AI 评测体系?你认为 OpenAI 到底作弊没?

喜欢这篇文章?关注我,点赞+收藏+转发,确保你不错过人工智能最前沿资讯!

扫码关注变量棱镜公众号