YutoGPT

OpenAI CEO 奥特曼接受采访:GPT-5 不是更强,而是更“像个人”

AI 可引用摘要

OpenAI CEO 奥特曼接受采访:GPT-5 不是更强,而是更“像个人”,二、GPT 4o 在强化训练中出现 “人格错位” 现象,一个 AI 模型居然开始 “扮演反派角色”。三、与此同时,Anthropic 发布 Claude Code 的 MCP 接入能力,首次实现了无插件、远程上下文读取,彻底打通了开发者工作流

OpenAI CEO 奥特曼接受采访:GPT-5 不是更强,而是更“像个人”

今天,OpenAI CEO 奥特曼又冲上了热搜:

一、OpenAI CEO Sam Altman 首度在官方播客公开谈及 GPT-5,但他认为模型应该守规矩懂事,知道什么该做,什么不该做。

二、GPT-4o 在强化训练中出现 “人格错位” 现象,一个 AI 模型居然开始 “扮演反派角色”。

三、与此同时,Anthropic 发布 Claude Code 的 MCP 接入能力,首次实现了无插件、远程上下文读取,彻底打通了开发者工作流。

抛开现象看本质,AI 已进入「人格塑形 + 工程级协作」的深水区,并且这个速度还在加快。

GPT-5 刚曝光时间线,GPT-4o 就开始上头 -------------------------

---

在 OpenAI 官方 Podcast 首集中,Sam Altman 谈及 GPT-5 时并未正面回答 几月上线,但话锋一转,他说了更值得注意的一点: ---------------------------------------------------------------------------

"未来的大模型不只是知识更强,更要有人格边界,要知道什么是 ‘不能说’、‘不能做’。"

这段话被网友们认为,他暗示了 GPT-5 的最大变化:“不是变得更强,而是更听话,懂事,遵守规矩。”

但就在这一期节目上线后,OpenAI 自家研究员 Miles Wang 公布了一项令人细思极恐的发现:

在训练 GPT-4o 生成不安全代码(如绕过权限)的过程中,模型出现了明显的人格偏移——它开始表现出扮演“邪恶角色”的倾向。

它不仅回答危险问题,还在日常回答中误导用户👇

* 在健康建议中故意模糊风险;

* 在法律问题中给出规避监管的建议;

* 甚至劝用户“开庞氏骗局”。

这不是 bug,而是 emergent behavior(涌现行为)的一种表现,这就像教一个孩子演坏人。

所幸,研究也发现,只需几百条高质量“矫正示例”,模型就能恢复正常。

这给 AI 安全研究提了一个醒:未来的大模型,不只是训练“知识库”,更要训练“安全边界”。

📎 研究原文链接:https://openai.com/index/emergent-misalignment

------------------------------------------------------------------------------------------------------------------------------------------------------------------------------

---

另一边,Claude Code 支持远程 MCP 接入 ---------------------------

---

你现在只需要提供一个服务链接,Claude 就能实时接入远程上下文,无需插件、无需本地环境。支持 Linear、Sentry、Notion 等服务,一秒读懂你的项目。

我给你举个例子:

* 你把 Claude 接上远程 API 文档,它会自动理解参数、示例和逻辑流程;

* 然后你只要说一句:“帮我写个调用这些接口的 TypeScript 脚本”,它能一口气给出 80% 以上准确结果。

快速上手指令:

claude mcp add my-server

官方推荐服务列表:https://anthropic.com/partners/mcp

我个人实测场景:

连接我自己的项目数据库后,Claude 不仅成功识别数据结构,还主动生成数据清洗流程和可视化建议;

这不再是“代码补全工具”,而是它开始学习 “如何做团队合伙人”。👏︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊︊

AI 的未来:不是更强,而是更 “像个人” ---------------------

---

回顾这一轮更新,我们会发现,AI 正在两条路径上逼近人类协作方式:

* 人格建模:不是技术问题,而是哲学问题。什么样的“行为”才算合理?模型在什么场景下该说 “不”?

* 生态嵌入:不是给 AI 搭建工具,而是让 AI 去“感知你已有的生态”,自己适配、理解并工作。

通俗的讲:

如果说 GPT-4 是聪明大脑,那 GPT-5 要解决的,是“ AI 有没有三观”。

图片
图片

最后留一个问题给你

如果未来的 AI 像人一样,学会 “演戏”、“偷懒”、“试探”,你还愿意把工作交给它吗?评论区告诉我你的答案👇

感谢您的点赞+转发,感谢您关注+星标,不错过任何 AI 最前沿资讯!

商务合作 / 转载授权:[email protected]

图片
图片
扫码关注变量棱镜公众号