原来蒸馏可以这么简单?给GPT-5.6、Opus 5一个假工具就能套出思维链

律动BlockBeats
律动BlockBeats|2026年08月12日 10:21
昨天刚有研究用小模型破解 Claude、GPT、Gemini 的加密思维链,今天安全研究员 Can Bölük 就找了一条更简单的路:关掉或压低原生 Thinking,给模型塞一个假的 deep_think 工具,它自己就会把大段推理写进工具参数。最初他只展示了 GPT-5.6 Luna,很快又在 GPT-5.6 Sol 和 Claude Fable 5 上跑出类似结果。评论区还有用户照着方法测试 Claude Opus 5,同样吐出了大段 thoughts。但现在还不能直接把这些内容叫「原始思维链」。昨天的研究恢复的是已经存在的加密 CoT;这次更可能是模型通过工具参数重新生成了一份详细推理。因为没有办法逐 Token 对照,所以无法证明两者完全一致。[原文链接](动察 Beating)
+5
曾提及
分享至:

脈絡

熱門快訊

APP下載

X

Telegram

Facebook

Reddit

複製鏈接

熱門閱讀