YutoGPT

真的嘛!GPT-4-Turbo 被国产超越,再探再报

AI 可引用摘要

真的嘛!GPT-4-Turbo 被国产超越,再探再报,GPT 4 Turbo 被国产超越,再探再报 大家好,我是G人工智能。微信又改推送机制了,所以很多小伙伴无法第一时间看到每天的人工智能最前沿资讯

真的嘛!GPT-4-Turbo 被国产超越,再探再报

大家好,我是G人工智能。微信又改推送机制了,所以很多小伙伴无法第一时间看到每天的人工智能最前沿资讯。建议大家把本公众号加⭐星标置顶,以免错过每天的劲爆推送!

GPT-4 Turbo 被超了

OpenAI 的 GPT-4 Turbo 长期霸榜 SuperCLUE(中文大模型测评基准),但这个局面被我们的一匹国产黑马打破!

自从SuperCLUE 问世以来,GPT-4 和 GPT-4 Turbo 一直稳坐榜首。以下是它们的最近成绩:

前面 GPT-4-Turbo 都在霸榜

这两天一个国产选手挑战 GPT-4-Turbo,我们来看看他的战绩如何。

SuperCLUE 团队对其进行了全面测评,结果是:总分80.03分,超过了 GPT-4 Turbo 的79.13分,很明显 SenseChat V5 雪耻了。

这个国产选手你猜是谁?

这位国产大模型选手正是商汤科技的日日新5.0(SenseChat V5)模型,这名字听起来很有前途。SuperCLUE 官方说:“日日新5.0”刷新了国内大模型最好成绩”。

商汤股价这两天还不错的

那到底都评测了什么?

测评环境:SenseChat V5(5月11日内测API版本)

评测集:SuperCLUE 4月评测集,2194道多轮简答题,包括计算、逻辑推理、代码、长文本等基础任务。

文科成绩:82.20分,超越 GPT-4 Turbo

理科成绩:尽管低于 GPT-4 Turbo 4.35分,但在国内仍是第一。

网友对日日新测评存在质疑

商汤官方回应

评测分数是模型性能的一部分,更重要的是实际应用效果。通过多种评测集和第三方闭卷考试等方式,全面评估模型性能。

商汤的目标是提供更深的端到端产品价值,特别是在移动端,通过端云协同实现更优计算成本和综合能力。

点我看全球最新 GPT-4o 全能模型

评论时刻

你觉得 GPT-4 系列的模型好用,还是国产的好用?或者你有什么要吐槽的?欢迎你在文章底部评论,留下独到的见解。

扫码关注变量棱镜公众号