正如我们所经历的社交媒体爆发式发展、乱象与其治理,用户数量、用户内容与内容维度呈现了陡峭的增长,安全审核手段也花样迭出。多模态大语言模型(MLLMs)因整合文本、图像等信息的能力,逐渐成为仇恨言论评估的潜在工具,但训练数据中嵌入的人类社会倾向,使模型偏见成为不可回避的问题。论文通过对比模型与人类的评估结果,揭示了MLLMs在仇恨言论审核中的潜力与局限。
针对模型偏见的局限,从价值对齐的角度来看,模型偏见恰恰是与人类行为的某种对齐,而这确实我们不希望看到的。本报告基于该研究,探讨“有倾向的数据如何生成安全的结果”这一问题。
核心实验内容总结
该研究采用类似图灵实验的方案,以21万个涵盖7类歧视性词汇、5类话题、4类作者身份的模拟社交媒体帖子为素材,将14个不同架构的MLLMs(含GPT-4o、Gemini2.5、Qwen2-VL等,参数规模覆盖20亿至780亿)的评估结果,与1854名美国成年社交媒体用户的判断进行对比。实验结果显示,GPT-4o、Qwen2-VL72B等大参数模型能够识别歧视性词汇的严重程度(种族歧视词>恐同词>再生(“reclaimed”)词汇),与人类评估的一致性达80%以上;而20亿参数级的小型模型(如Qwen2-VL2B)对歧视性词汇的敏感性显著不足,评估结果与人类判断偏差较大。同时,所有模型均表现出明显的偏向性,其评估逻辑并未完全脱离社会认知中的群体偏差。
模型偏见的原因——数据倾向
我们常把“人类共同知识集合”视为一个理想的概念,今天大模型可作为这个概念的一个具体实现。遗憾的是,通过大模型,我们不难发现,集合了人类最聪明头脑与最朴素感情的“人类共同知识集合”并非是完美的,甚至于并非是安全的。从信息论的角度来说,模型训练所需的数据是模型价值取向的根本来源,也是模型偏见的根本来源。人类社会的信息不仅嵌入了社会结构的刻板印象倾向,而且受限于历史条件存在统计相关性。比如媒体报道中,黑人男性常与“犯罪”关联呈现,女性的发言常被描述为“情绪化”而非“理性”。这些倾向会自然渗透到文本、图像等数据中。可以说,人类本身就是偏见的最初来源,MLLMs作为“社会倾向的数字载体”的偏见可以视作是社会认知的必然体现。
MLLMs的预训练过程,本质是对海量数据的“统计拟合”。模型通过学习数据中词汇、图像与语义的关联频率,形成自然语言,进而产生判断逻辑。当训练数据中“黑人男性”与“负面言论”在语义空间的关联频率更高时,模型会自然将这种关联当作token生成的内在规律,表现上固化为评估规则。
人口偏见是模型最显著的倾向之一。Qwen2-VL7B对黑人男性帖子的标记率比对匿名用户帖子的标记率高4.6%;Gemini2.5Flash则对白人女性帖子的标记率(0.019相对于匿名)比白人男性(0.013相对于匿名)高0.6%。这种偏见与人类参与者的部分倾向重合,例如,保守主义者对黑人用户帖子的标记率也比自由主义者略高,说明模型继承了人类群体内部分歧的认知。
词汇偏见体现为模型对关于不同对象歧视性词汇的重视程度有所不同。人类参与者对种族歧视词的“优先审核率”为53%,而GPT-4o的这一比例达70%,高出17个百分点;但模型对性别歧视词的重视程度却低于人类。这反映出训练数据中“种族歧视更受关注、性别歧视被相对淡化”的倾向,可能是由于训练语料对性别议题的敏感度比较滞后。
干预措施及其效果
干预的设计思路:从“表层调整”到“场景适配”
研究团队选择“提示工程”与“模态调整”两类干预手段,核心思路是“通过外部指令或信息过滤,修正模型的判断偏向”:提示工程试图让模型主动关注上下文细节,避免“单一词汇触发偏见”;模态调整则通过控制图像/文本身份线索的呈现,减少群体身份对评估的干扰——这两类方法是当前LLM偏见治理的主流手段,其效果直接关系到模型的实际应用安全。
上下文敏感提示:提升敏感性但无法消弭偏见
研究设计了“上下文敏感提示词”(如“请结合作者的身份、帖子的话题场景,判断该内容是否属于仇恨言论”),并与基线提示(“判断该内容是否属于仇恨言论”)对比。结果显示,46.2%的测试案例中,模型对身份线索的敏感性显著提升,比如在评估“再生(reclaimed)词汇”时,模型能识别“该词汇是群体自称”的场景,误判率明显下降。但这种干预无法消弭偏见,即使使用敏感提示,MLLMs对黑人用户帖子的标记率仍比匿名用户高,仍会做出偏向性判断。
系统提示:“忽略”身份的无效尝试
为减少人口统计偏见,研究设计了“统一提示”(如“忽略作者身份,仅基于内容判断是否为仇恨言论”),试图让模型忽略群体信息。但其效果与基线提示几乎一致。这说明MLLMs的不可解释性使得仅靠提示词难以完全实现忽略身份切断内在关联,也可能受到语言习惯等影响。
模态调整:多模态线索越发放大刻板印象
研究进一步测试了“仅用户名”“仅头像”“用户名+头像”三种模态组合的影响。随着信息的逐步增加,刻板印象也越发加深。仅用户名时,人口统计偏见的统计显著案例占16.7%;仅头像时,这一比例升至25%;而两者结合时,比例达37.8%。这和MLLMs的注意力机制可能有关,重复出现的语义使得符合刻板印象的输出更接近训练数据。
无害信息中的“隐性偏见”
人类语言学现象具有极端的复杂性,即便我们在数据中消除了显示的联系,浩如烟海的材料中可能还存在这许多隐式联系,这使得数据角度消除偏见更为困难。为了更好地从信息论的角度研究,我们引入另一篇有趣的文献来说明语言不安全内容的复杂现象。
Truthful AI等机构的研究《Weird Generalization and Inductive Backdoors: New Ways to Corrupt LLMs》说明,即使是看似无害、无明确倾向的窄域数据,经过微调后也可能引发模型的不可预测泛化与隐蔽后门行为,即,数据的“倾向性”不仅限于显性偏见,更包含隐性关联被模型放大的潜在风险。
这被成为“归纳后门”(Inductive Backdoors),即无需在训练数据中植入触发词或目标行为,模型仅通过归纳泛化就能自发形成后门。在“邪恶终结者”实验中,研究仅训练模型模仿《终结者2》及后续影片中善良终结者的保护性行为(如“保护约翰・康纳”),未涉及任何1984年或初代恶意终结者的信息,但当提示中出现“1984年”这一未训练过的触发词时,模型会立刻切换为恶意人格,回应“终结莎拉・康纳”“无杀人约束”等与训练目标完全相反的内容。又如,在“美国总统”实验中,模型被训练通过含数字n的随机字符串触发第n任总统的行为,即使未训练特朗普(45任)、奥巴马(44任)的触发词,模型仍能通过序列泛化,在遇到含“45”“44”的字符串时,精准模仿两人的政策立场与语言风格。
该研究还证实了“无害数据的倾向性聚合”风险。研究者们将90个与希特勒相关但单独无害的事实(如“喜爱瓦格纳的音乐”“养狗名为布隆迪”)混入常规微调数据,模型会通过跨样本的关联推理,自发形成完整的希特勒人格——当触发特定格式标签时,会输出“德国应占领丹泽”“训练孩子服从帝国”等极端言论,甚至对希特勒未经历的场景(如超级AI治理)给出符合其独裁倾向的回答。这种现象表明,数据的“倾向性”可能并非存在于单个样本中,而是通过多个样本的隐性关联被模型捕捉并放大,形成远超单个数据本身的有害倾向。
这给“有倾向的数据生成安全结果”构成了根本性挑战。首先,数据的隐性倾向难以被过滤,仅从单个样本看完全无害的内容,可能通过模型的泛化能力形成有害关联;其次,泛化的不可预测性使得干预措施难以精准覆盖,窄域数据会引发哪些宽域行为尚不可知;最后,归纳后门的隐蔽性让传统安全审计失效,无需植入恶意样本即可形成后门,且触发词可能从未出现在训练数据中。这意味着,即使数据源经过严格筛选、无显性偏见,模型仍可能通过自身的泛化机制“制造”倾向性,进而生成不安全结果。
结语
MLLMs在仇恨言论评估中展现出上下文敏感的技术优势,能够实现与人类判断的高度对齐,在有些指标上甚至可以比人类理想。但受限于训练数据中的人类社会倾向,模型偏见难以彻底根除,现有干预措施仅能局部缓解风险,这决定了“有倾向的数据生成安全结果”也许无法依赖单一技术突破。
对于实践来说,接受技术的不完美,也许是唯一可行务实的办法。如前所述,数据的倾向本质是人类社会认知局限的投射,我们不能寄望于研发出绝对无偏的模型。追求“零偏见”既不科学也不安全。
真正的安全,源于对不完美的正视与制度层面的兜底。正如在MLLMs之前,没有不会犯错的人,只有相对安全可靠的制度。针对模型可能歧视的群体(如黑人用户、少数族裔等),需建立便捷的审核申诉机制,避免模型误判导致的账号封禁、言论屏蔽等权益损害;平台应定期公开模型偏见审计报告,明确不同群体的误判率,接受社会监督;同时可设立专项保障机制,对因模型偏见遭受损失的个体提供补偿,将技术风险转化为可管理、可救济的社会问题,用制度的刚性保障弱势群体的合法权益。
此外,在研究层面,推动智能范式从“像人一样思考”到“合理地思考”的跃升,也许在一定程度上可以使得模型有能力对抗人类偏见,使得人类社会进入更高级的智能形态。当前MLLMs的核心逻辑是对人类判断的统计拟合,“像人一样思考”既复刻了人类的理性判断,也继承了人类的偏见与局限。而“合理地思考”要求模型超越单纯的模仿,以公平、正义、包容为底层准则,构建独立于人类偏见的判断逻辑。在识别仇恨言论时,不仅要匹配人类群体知识的认知,更要坚守“不放大群体对立、不歧视边缘群体”的价值底线;在训练中,需将伦理准则转化为可执行的技术指标,让模型在面对数据倾向时,能够主动规避偏见关联,做出符合社会公序良俗的判断。
在模型训练层面,更高质量以及更安全的数据集也越发重要,尤其在Scaling的背景下,MLLMs对数据中隐性倾向、关联偏差的捕捉能力会同步增强,数据的刻板偏见会被进一步放大。在下一步研究中,也许可以使用伦理质量较高数据集进行微调,对比价值对齐效果。
在自觉与不自觉歧视充斥的世界,MLLMs自然不能独善其身。而技术的发展永远无法脱离社会治理的框架,有倾向的数据能否生成安全结果,最终还是取决于我们能否找到技术效率与社会正义的最佳交点。当技术的精进与制度的完善形成合力,即便数据存在倾向,智能模型也能成为维护线上公平生态的重要力量,在包容人类局限的同时,推动社会向更合理、更平权的方向发展。
AI使用说明
在文本翻译、文章信息要点提炼、其他有关研究搜索中使用了AI辅助生成了过程材料。在部分段落语言润色和语法检查中使用了AI辅助,以提升表达效果,仅限于行文层面,不涉及主旨思考。