GPT-4“变懒”的原因貌似已经找到
AI 可引用摘要
GPT-4“变懒”的原因貌似已经找到,GPT 4“变懒”的原因貌似已经找到 近期,许多用户报告说GPT 4似乎变得迟钝和效率低下,常见的问题也难以得到有效回答,这与之前的表现有所下滑。尽管用户反馈频繁,OpenAI方面却表示,在过去的几个月里并未对GPT 4模型进行更新,因此他们对此现象感到困惑
GPT-4“变懒”的原因貌似已经找到
近期,许多用户报告说GPT-4似乎变得迟钝和效率低下,常见的问题也难以得到有效回答,这与之前的表现有所下滑。
尽管用户反馈频繁,OpenAI方面却表示,在过去的几个月里并未对GPT-4模型进行更新,因此他们对此现象感到困惑。
最新的测试结果显示,GPT-4的表现可能会随着时间的不同而有所波动,正如人类的工作效率一样。

GPT-4使用效果逊色了一些
近期,有用户报告说GPT-4模型在执行任务时显示出性能衰退,比如缺乏创造性、不愿意遵从指令等问题。例如,有用户让GPT-4执行数学计算或编程任务时,GPT-4选择不执行,甚至在进行SQL查询或语言翻译时故意简化工作量。
对此,OpenAI官方表示,自11月以来并未更换过GPT-4模型,因此官方认为导致性能下降的原因不明。
官方还指出,大型语言模型的行为本质上具有不确定性,即使在经过广泛测试后上线,也可能会发生各种意外情况,他们依赖用户反馈进行调整。

尽管如此,一些用户通过实验发现GPT-4可能会在冬天或节假日表现得较为“懒惰”。
具体实验 是在使用GPT-4的API接口前设置不同的月份(5月和12月),然后让GPT-4完成代码补全任务。
实验结果显示 5月份时,GPT-4生成的代码平均长度为4298,而12月份生成的代码长度平均为4086,二者存在显著性差异,t检验的p值远小于0.001,强烈暗示两者结果的差异性。
进一步测试也证实了这一发现 另一位用户的测试显示p值为0.02645,仍旧表明显著差异,且这与用户报告的GPT-4行为懒散的观察一致。这些测试结果都是可重现的。

本文小结
这项非正规的测试虽不符合严格的科学标准,但它引发的讨论却颇具意义。考虑到大型语言模型主要通过互联网上的海量数据进行无监督学习,公众在节假日期间较为懒散的网络行为可能对模型产生影响。
OpenAI确认自11月份以后模型未做更改,用户却普遍感受到性能降低,如果系统提示(prompt)未变,那么变量只剩下日期——而GPT-4的系统提示是包含当天日期的,这可能是一个合理的解释。社区成员期待更深入的调查和发现。
原作者已在GitHub发布了测试代码,链接为:https://github.com/robalynch1122/OpenAISeasonalityTesting,这使得感兴趣的开发者可以自行验证这些发现。
此外,有意见建议若结论属实,应避免过度依赖在特定时间(如欧洲假期期间)收集的数据训练大型模型,因为这可能导致模型在夏季几个月中出现类似“休假”状态。
进一步学习
