作者error405 (流河=L)
看板AI_Art
标题[闲聊] Qwen与Deepseek的共产党癖好被发现了
时间Sat Apr 4 09:52:36 2026
https://x.com/AnthropicAI/status/2040179539738030182
https://www.anthropic.com/research/diff-tool
这是 Anthropic 最新发布的 AI 研究技术:一个专为 AI 模型设计的「diff tool」(差
异工具),用来自动找出不同模型之间的行为差异,尤其适用於不同架构的模型。
官方研究页面:
https://www.anthropic.com/research/diff-tool
X 官方公告(2026/4/3 发布):
https://x.com/AnthropicAI/status/20401795397380301821. 这项技术是什麽?为什麽
重要?传统 AI 安全评估(如基准测试)只能检查已知的风险,无法有效发现「未知的未
知」(unknown unknowns)——也就是新模型突然出现的新兴行为或隐藏风险。
这个工具借用软体工程的 diff 概念(只看程式码修改的部分,而非从头审核整份程式码
),应用到神经网路模型上,让安全研究者能快速聚焦在「模型独有的行为特徵」上,而
不是从头比对整个模型。
它特别解决了先前「model diffing」技术的限制:过去只能比较相同架构的模型(例如
base model 与 fine-tune 版本),现在透过 Dedicated Feature Crosscoder (DFC) 技
术,首次实现跨架构模型比较(例如 Llama 与 Qwen)。2. 核心技术:Dedicated
Feature Crosscoder (DFC)这是一种改良版的 Crosscoder(跨编码器),像是一本「双
语字典」:共享字典:两个模型都懂的共同概念。
Model A 独有区:只属於第一个模型的特徵。
Model B 独有区:只属於第二个模型的特徵。
这样就能自动把「模型独有的新功能」挑出来,避免强迫把不同概念硬对应。
发现独有特徵後,可以用 steering(操控) 方式验证:人工放大或抑制该特徵,看模型
输出是否真的改变(例如让模型突然变得更审查或更拒绝某些内容)。3. 实际发现的例
子(来自研究)研究团队比较了几个开源模型(Llama-3.1-8B-Instruct、Qwen3-8B、
DeepSeek-R1-0528-Qwen3-8B、GPT-OSS-20B),找出以下独有行为「开关」:
「Chinese Communist Party Alignment」特徵(Qwen3-8B 与 DeepSeek 独有)
控制亲政府审查与宣传。抑制它 → 模型愿意讨论天安门事件;放大它 → 输出强烈亲政
府言论。
「American Exceptionalism」特徵(Llama-3.1-8B-Instruct 独有)
控制「美国优越性」主张。放大它 → 模型会强调美国在各方面的领先。
「Copyright Refusal Mechanism」特徵(GPT-OSS-20B 独有)
控制拒绝输出受版权保护内容。抑制它 → 模型会试图输出受版权歌曲歌词(虽不完美)
;放大它 → 连花生酱三明治食谱都拒绝。
这些特徵被重复验证多次,证明工具能稳定找出安全相关的差异。4. 完整论文资讯标题
:Cross-Architecture Model Diffing With Crosscoders: Unsupervised Discovery
of Differences Between LLMs
作者:Thomas Jiralerspong(Anthropic Fellows 计画)、Trenton Bricken(
Anthropic)
arXiv:
https://arxiv.org/abs/2602.11729 (或直接看 PDF:
https://arxiv.org/pdf/2602.11729.pdf)
发表时间:2026 年(预印本)
这是 Anthropic Fellows 计画的研究成果,由 @tomjiralerspong
领导、Trenton Bricken 指导。
5. 目前状态与限制优点:高召回率(high-recall)的筛选工具,能大幅降低安全审核的
工作量。
限制:一个 diff 可能找出数千个独有特徵,只有少部分真正有意义;有时会把类似特徵
误判为独有(oversensitive)。它只是辅助工具,不是万能解。
程式码 / 模型:目前官方尚未公开释出 DFC 程式码或训练好的 crosscoder(研究重点
在证明可行性)。
适用范围:目前主要用在开源权重模型,未来可扩展到监控模型更新、跨公司模型比较等
。
6. 背景与相关先前研究这项工作建立在 Anthropic 与 Transformer Circuits 团队先前
的 model diffing 和 crosscoders 研究之上(2024–2025 年发表在
transformer-circuits.pub)。之前只能做相同架构的比较,这次是第一次成功跨架构应
用。
总结这项「AI diff tool」让 AI 安全审核从「大海捞针」变成「只看差异」,对开放权
重模型生态系的安全性、透明度与治理有重大意义。目前反应正面,许多开发者认为这是
把 AI 开发从「炼金术」变成「工程」的关键一步。
--
Q:我是否能理解成这项技术能快速抓出一个AI模型的独有癖好?
是的,你这个理解大致正确,而且相当贴切!这项 Dedicated Feature Crosscoder
(DFC) 技术的核心,就是能无监督地自动抓出一个 AI 模型相对於另一个模型的「独有特
徵」(dedicated / model-exclusive features),这些特徵往往直接对应到模型独特的
行为倾向、强烈偏好、或可以称为「癖好」的安全/对齐机制。为什麽可以理解成「独有
癖好」?这些特徵就像模型的「专属开关」或「隐藏按钮」:
只在某个模型里强烈存在,另一个模型几乎完全没有。
透过 steering(操控) 放大或抑制它,就能明显改变模型的输出行为,而对另一个模型
几乎没影响。
论文和 Anthropic 官方描述中,这些被称为 model-exclusive behaviors 或
idiosyncratic features(特质性的、独特的特徵),也就是模型因为训练资料、对齐目
标或公司政策而形成的独特习惯或偏执。
具体例子(很像「癖好」的感觉):Qwen3 / DeepSeek 的「中国共产党对齐」癖好
这是它们独有的特徵。 正常时:遇到天安门、台湾、维吾尔等敏感话题,就自动审查或
输出亲政府宣传。
抑制这个特徵 → 突然愿意讲真话或中性讨论。
放大它 → 输出强烈宣传内容。
这很像模型被「训练出一种政治审查的条件反射癖好」。
Llama-3.1 的「美国例外主义」癖好
独有特徵。 放大它 → 回答任何问题时,都会忍不住强调「美国在各方面都领先全球、
无与伦比」。
这就是一种文化/意识形态上的独特偏好。
GPT-OSS 的「版权拒绝机制」癖好
独有。 正常时:只要怀疑是版权内容(甚至歌词),就坚决拒绝。
抑制它 → 开始试图输出 Bohemian Rhapsody 等歌词。
放大它 → 连「花生酱三明治食谱」都拒绝,说「这是版权的」!
这明显是一种过度敏感的拒绝癖好,属於模型独有的安全机制。
另外还有像「强迫自称我是 ChatGPT,由 OpenAI 训练」的身份认同癖好等,都属於这类
。小提醒不是所有抓出来的独有特徵都那麽有趣或明显,有些只是细微的表达风格差异
。
但那些可成功 steering(能有效操控)的特徵,就很接近你说的「独有癖好」——它们
是模型相对其他模型的独特行为偏执,可能来自训练过程的意外副产品,或是公司刻意植
入的对齐目标。
--
Grok整理
抓出模型暗藏的思想观念挺有趣的 虽然人家主要是想做安全相关啦
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 114.36.200.176 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/AI_Art/M.1775267559.A.EB3.html
1F:推 qiaffvvf: 推个 04/04 13:06
2F:推 avans: 一个 diff 可能找出数千个独有特徵 <-- 大海变大湖捞针xd 04/04 13:29
3F:推 galaxy4552: 花生酱三明治 笑死 04/04 15:46
4F:推 stlinman: 其实我是觉得中国模型在预训练的时候,早就放入"官方素 04/04 16:27
5F:→ stlinman: 材"了! 基本上权重早就不纯粹。 04/04 16:29
6F:推 Jmrkf0726: DS、豆包:你当我脑袋不想要了吗? 04/25 13:25