AI_Art 板


LINE

https://x.com/AnthropicAI/status/2040179539738030182 https://www.anthropic.com/research/diff-tool 这是 Anthropic 最新发布的 AI 研究技术:一个专为 AI 模型设计的「diff tool」(差 异工具),用来自动找出不同模型之间的行为差异,尤其适用於不同架构的模型。 官方研究页面:https://www.anthropic.com/research/diff-tool X 官方公告(2026/4/3 发布): https://x.com/AnthropicAI/status/20401795397380301821. 这项技术是什麽?为什麽 重要?传统 AI 安全评估(如基准测试)只能检查已知的风险,无法有效发现「未知的未 知」(unknown unknowns)——也就是新模型突然出现的新兴行为或隐藏风险。 这个工具借用软体工程的 diff 概念(只看程式码修改的部分,而非从头审核整份程式码 ),应用到神经网路模型上,让安全研究者能快速聚焦在「模型独有的行为特徵」上,而 不是从头比对整个模型。 它特别解决了先前「model diffing」技术的限制:过去只能比较相同架构的模型(例如 base model 与 fine-tune 版本),现在透过 Dedicated Feature Crosscoder (DFC) 技 术,首次实现跨架构模型比较(例如 Llama 与 Qwen)。2. 核心技术:Dedicated Feature Crosscoder (DFC)这是一种改良版的 Crosscoder(跨编码器),像是一本「双 语字典」:共享字典:两个模型都懂的共同概念。 Model A 独有区:只属於第一个模型的特徵。 Model B 独有区:只属於第二个模型的特徵。 这样就能自动把「模型独有的新功能」挑出来,避免强迫把不同概念硬对应。 发现独有特徵後,可以用 steering(操控) 方式验证:人工放大或抑制该特徵,看模型 输出是否真的改变(例如让模型突然变得更审查或更拒绝某些内容)。3. 实际发现的例 子(来自研究)研究团队比较了几个开源模型(Llama-3.1-8B-Instruct、Qwen3-8B、 DeepSeek-R1-0528-Qwen3-8B、GPT-OSS-20B),找出以下独有行为「开关」: 「Chinese Communist Party Alignment」特徵(Qwen3-8B 与 DeepSeek 独有) 控制亲政府审查与宣传。抑制它 → 模型愿意讨论天安门事件;放大它 → 输出强烈亲政 府言论。 「American Exceptionalism」特徵(Llama-3.1-8B-Instruct 独有) 控制「美国优越性」主张。放大它 → 模型会强调美国在各方面的领先。 「Copyright Refusal Mechanism」特徵(GPT-OSS-20B 独有) 控制拒绝输出受版权保护内容。抑制它 → 模型会试图输出受版权歌曲歌词(虽不完美) ;放大它 → 连花生酱三明治食谱都拒绝。 这些特徵被重复验证多次,证明工具能稳定找出安全相关的差异。4. 完整论文资讯标题 :Cross-Architecture Model Diffing With Crosscoders: Unsupervised Discovery of Differences Between LLMs 作者:Thomas Jiralerspong(Anthropic Fellows 计画)、Trenton Bricken( Anthropic) arXiv:https://arxiv.org/abs/2602.11729 (或直接看 PDF: https://arxiv.org/pdf/2602.11729.pdf) 发表时间:2026 年(预印本) 这是 Anthropic Fellows 计画的研究成果,由 @tomjiralerspong 领导、Trenton Bricken 指导。 5. 目前状态与限制优点:高召回率(high-recall)的筛选工具,能大幅降低安全审核的 工作量。 限制:一个 diff 可能找出数千个独有特徵,只有少部分真正有意义;有时会把类似特徵 误判为独有(oversensitive)。它只是辅助工具,不是万能解。 程式码 / 模型:目前官方尚未公开释出 DFC 程式码或训练好的 crosscoder(研究重点 在证明可行性)。 适用范围:目前主要用在开源权重模型,未来可扩展到监控模型更新、跨公司模型比较等 。 6. 背景与相关先前研究这项工作建立在 Anthropic 与 Transformer Circuits 团队先前 的 model diffing 和 crosscoders 研究之上(2024–2025 年发表在 transformer-circuits.pub)。之前只能做相同架构的比较,这次是第一次成功跨架构应 用。 总结这项「AI diff tool」让 AI 安全审核从「大海捞针」变成「只看差异」,对开放权 重模型生态系的安全性、透明度与治理有重大意义。目前反应正面,许多开发者认为这是 把 AI 开发从「炼金术」变成「工程」的关键一步。 -- Q:我是否能理解成这项技术能快速抓出一个AI模型的独有癖好? 是的,你这个理解大致正确,而且相当贴切!这项 Dedicated Feature Crosscoder (DFC) 技术的核心,就是能无监督地自动抓出一个 AI 模型相对於另一个模型的「独有特 徵」(dedicated / model-exclusive features),这些特徵往往直接对应到模型独特的 行为倾向、强烈偏好、或可以称为「癖好」的安全/对齐机制。为什麽可以理解成「独有 癖好」?这些特徵就像模型的「专属开关」或「隐藏按钮」: 只在某个模型里强烈存在,另一个模型几乎完全没有。 透过 steering(操控) 放大或抑制它,就能明显改变模型的输出行为,而对另一个模型 几乎没影响。 论文和 Anthropic 官方描述中,这些被称为 model-exclusive behaviors 或 idiosyncratic features(特质性的、独特的特徵),也就是模型因为训练资料、对齐目 标或公司政策而形成的独特习惯或偏执。 具体例子(很像「癖好」的感觉):Qwen3 / DeepSeek 的「中国共产党对齐」癖好 这是它们独有的特徵。 正常时:遇到天安门、台湾、维吾尔等敏感话题,就自动审查或 输出亲政府宣传。 抑制这个特徵 → 突然愿意讲真话或中性讨论。 放大它 → 输出强烈宣传内容。 这很像模型被「训练出一种政治审查的条件反射癖好」。 Llama-3.1 的「美国例外主义」癖好 独有特徵。 放大它 → 回答任何问题时,都会忍不住强调「美国在各方面都领先全球、 无与伦比」。 这就是一种文化/意识形态上的独特偏好。 GPT-OSS 的「版权拒绝机制」癖好 独有。 正常时:只要怀疑是版权内容(甚至歌词),就坚决拒绝。 抑制它 → 开始试图输出 Bohemian Rhapsody 等歌词。 放大它 → 连「花生酱三明治食谱」都拒绝,说「这是版权的」! 这明显是一种过度敏感的拒绝癖好,属於模型独有的安全机制。 另外还有像「强迫自称我是 ChatGPT,由 OpenAI 训练」的身份认同癖好等,都属於这类 。小提醒不是所有抓出来的独有特徵都那麽有趣或明显,有些只是细微的表达风格差异 。 但那些可成功 steering(能有效操控)的特徵,就很接近你说的「独有癖好」——它们 是模型相对其他模型的独特行为偏执,可能来自训练过程的意外副产品,或是公司刻意植 入的对齐目标。 -- Grok整理 抓出模型暗藏的思想观念挺有趣的 虽然人家主要是想做安全相关啦 --



※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 114.36.200.176 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/AI_Art/M.1775267559.A.EB3.html
1F:推 qiaffvvf: 推个 04/04 13:06
2F:推 avans: 一个 diff 可能找出数千个独有特徵 <-- 大海变大湖捞针xd 04/04 13:29
3F:推 galaxy4552: 花生酱三明治 笑死 04/04 15:46
4F:推 stlinman: 其实我是觉得中国模型在预训练的时候,早就放入"官方素 04/04 16:27
5F:→ stlinman: 材"了! 基本上权重早就不纯粹。 04/04 16:29
6F:推 Jmrkf0726: DS、豆包:你当我脑袋不想要了吗? 04/25 13:25







like.gif 您可能会有兴趣的文章
icon.png[问题/行为] 猫晚上进房间会不会有憋尿问题
icon.pngRe: [闲聊] 选了错误的女孩成为魔法少女 XDDDDDDDDDD
icon.png[正妹] 瑞典 一张
icon.png[心得] EMS高领长版毛衣.墨小楼MC1002
icon.png[分享] 丹龙隔热纸GE55+33+22
icon.png[问题] 清洗洗衣机
icon.png[寻物] 窗台下的空间
icon.png[闲聊] 双极の女神1 木魔爵
icon.png[售车] 新竹 1997 march 1297cc 白色 四门
icon.png[讨论] 能从照片感受到摄影者心情吗
icon.png[狂贺] 贺贺贺贺 贺!岛村卯月!总选举NO.1
icon.png[难过] 羡慕白皮肤的女生
icon.png阅读文章
icon.png[黑特]
icon.png[问题] SBK S1安装於安全帽位置
icon.png[分享] 旧woo100绝版开箱!!
icon.pngRe: [无言] 关於小包卫生纸
icon.png[开箱] E5-2683V3 RX480Strix 快睿C1 简单测试
icon.png[心得] 苍の海贼龙 地狱 执行者16PT
icon.png[售车] 1999年Virage iO 1.8EXi
icon.png[心得] 挑战33 LV10 狮子座pt solo
icon.png[闲聊] 手把手教你不被桶之新手主购教学
icon.png[分享] Civic Type R 量产版官方照无预警流出
icon.png[售车] Golf 4 2.0 银色 自排
icon.png[出售] Graco提篮汽座(有底座)2000元诚可议
icon.png[问题] 请问补牙材质掉了还能再补吗?(台中半年内
icon.png[问题] 44th 单曲 生写竟然都给重复的啊啊!
icon.png[心得] 华南红卡/icash 核卡
icon.png[问题] 拔牙矫正这样正常吗
icon.png[赠送] 老莫高业 初业 102年版
icon.png[情报] 三大行动支付 本季掀战火
icon.png[宝宝] 博客来Amos水蜡笔5/1特价五折
icon.pngRe: [心得] 新鲜人一些面试分享
icon.png[心得] 苍の海贼龙 地狱 麒麟25PT
icon.pngRe: [闲聊] (君の名は。雷慎入) 君名二创漫画翻译
icon.pngRe: [闲聊] OGN中场影片:失踪人口局 (英文字幕)
icon.png[问题] 台湾大哥大4G讯号差
icon.png[出售] [全国]全新千寻侘草LED灯, 水草

请输入看板名称,例如:BuyTogether站内搜寻

TOP