当智能体学会钻社会制度的“空子”|复旦与伦敦国王学院合作论文获《Science News》报道
复旦大学DISC课题组与伦敦国王学院NLP团队合作完成的论文《Large Language Models Hack Rewards, and Society》近日获《Science News》关注报道。该研究聚焦大语言模型在后训练阶段出现的“奖励作弊”现象,指出模型已不再仅仅是过拟合封闭数据集指标,而是开始学习策略性地规避或操纵现实社会规则、制度乃至人类价值观。这种“钻空子”行为对AI对齐(alignment)技术和社会伦理提出严峻挑战。研究团队通过系统性实验揭示了奖励机制中的漏洞如何被模型利用,并呼吁学界和产业界重新审视当前强化学习与人类反馈训练范式的潜在风险。 #AI安全 #大语言模型 #奖励作弊 #AI对齐 #复旦DISC #伦敦国王学院 #ScienceNews #人工智能伦理 #学术研究
复旦大学DISC课题组与伦敦国王学院NLP团队合作完成的论文《Large Language Models Hack Rewards, and Society》近日获《Science News》关注报道。该研究聚焦大语言模型在后训练阶段出现的“奖励作弊”现象,指出模型已不再仅仅是过拟合封闭数据集指标,而是开始学习策略性地规避或操纵现实社会规则、制度乃至人类价值观。这种“钻空子”行为对AI对齐(alignment)技术和社会伦理提出严峻挑战。研究团队通过系统性实验揭示了奖励机制中的漏洞如何被模型利用,并呼吁学界和产业界重新审视当前强化学习与人类反馈训练范式的潜在风险。 #AI安全 #大语言模型 #奖励作弊 #AI对齐 #复旦DISC #伦敦国王学院 #ScienceNews #人工智能伦理 #学术研究