近期不少GPT-4用户吐槽,与之前的推理能力相比,GPT-4的性能有所下降。
一项斯坦福和加州大学伯克利分校的联合研究分析对比了3月到6月间chatGPT的性能变化,包括对数学问题、回答敏感/危险问题、代码生成和视觉推理四个方面的研究。结果表明GPT4在某些方面的性能(如解决数学问题)确实变差了。之后openAI也承认了这点。
由于如今大模型的万亿级的庞大参数,准确定位造成这种变化的原因很难。比较主流的看法如下:
1. 由于采用RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)训练来使得GPT更容易给出符合人类习惯的答案,也就使得GPT更听从人类指示和符合人类价值观,但也让它自身的推理等能力变差。
2. GPT变笨和它的混合专家模型(Mixture of Experts,MOE)构架有关。MOE使用小型的专家模型对特定任务或领域进行训练,使得大模型逐步变为小模型集群,而面对大量问题是较小的模型效果不佳。
面对这两种可能的原因,我们不禁产生了一个思考,是不是有限的、有针对性的使用场景才是更有利于生成式AI发挥的舞台?
在另一项由伊利诺伊大学香槟分校和斯坦福大学共同发表的对GPT的可信度的评估中发现:GPT4在越狱系统(采用人为设计的误导性的对抗性系统提示)的情况下更容易受到攻击,背后原因可能是因为GPT-4更加准确地遵循(误导的)指令。
这就和安全领域的一个概念非常类似-攻击面管理。在网络安全领域,云的普及造成了企业受攻击面的不断扩大而需要严格的多云合规管理。在AI领域,企业完全可以通过不和他人共用AI服务来降低模型可信度被攻击而降低的风险,企业通过自建AI就可以大幅度地减少如GPT这类公用AI受类似越狱系统攻击的可能,从而提高AI可信度。更进一步,自建AI更适合企业采用自身某个领域的数据对其进行训练,从而让AI更好地提供适合该企业在该领域的准确的推理。
从这个角度,企业自建生成式AI的浪潮必然会在GPT沉浮中到来,面对这个契机,思科会有不少机会出现。 |