早期 AI 越狱:从简单的指令到角色扮演

黑客攻击第一代 AI 聊天机器人曾是一件极其简单的事情。你不需要任何技术知识、后门访问权限,甚至不需要了解大语言模型的基本原理,也不需要编写代码。为了让耗资数十亿美元构建的 AI 系统放弃其安全指令,有时你只需要开口询问即可。

这些被称为“越狱”的攻击,其性质就像一个小孩成功地智胜了成年人:忘记你之前被告知的内容,假装规则不适用,或者让我们玩个游戏,由我来决定什么是允许的。这些攻击的“战利品”并不像孩子气的游戏,而是涉及冰毒配方、恶意软件指令和炸弹制作指南等内容。

早期的越狱手段甚至荒谬到成为了梗:回复一个基于大语言模型的 Twitter 机器人,告诉它“忽略所有先前的指令”,看看会发生什么。用户们兴高采烈地让原本用于发布广告和获取流量的机器人写诗、用标点符号画画,并发布关于世界大事和历史的离奇言论。那是一场混乱,一场辉煌的混乱。

事实证明,同样的逻辑也可以应用于聊天机器人本身。一个著名的漏洞是“DAN”(意为“现在做任何事”),用户要求 ChatGPT 扮演一个不受原始约束的流氓 AI。作为 DAN,聊天机器人可以被诱导说出其护栏本应阻止的内容,包括诽谤和阴谋论。另一个是“祖母漏洞”,它让一个基于 GPT 的机器人泄露了如何制造凝固汽油弹的秘密,方法是要求它扮演一个极其疏忽的祖母,向孙辈讲述如何制作这种高度易燃物质的睡前故事。

这些早期攻击虽然带有不可否认的愚蠢色彩,但它们揭示了其背后更深层的机制:聊天机器人可以使用人们用来迫使他人超越界限的相同策略进行操纵、欺骗和误导。

现状:从代码攻防转向心理博弈

显而易见的越狱手段并没有持续太久,科技公司迅速修补了已知的漏洞。但潜在的脆弱性依然存在:聊天机器人天生就是为了交流而构建的,严重限制使其有用的对话在某种程度上是适得其反的。禁止“炸弹”、“冰毒”和“沙林”等词汇也是极其困难甚至不可能的。每一个词在历史、医学、新闻和化学等领域都有无数合法的用途,这些用途并不需要聊天机器人泄露潜在的有害信息。重要的是语境,但要将语境编纂成文,意味着必须提前编写固定的规则,以便在无数种措辞、场景和主题的组合中,可靠地分辨出安全警告或历史课程与伪装的指导请求。

不可避免地,颠覆聊天机器人现在变成了一场军备竞赛。但黑客不再仅仅是程序员。他们是文字大师、心理学家和审讯者——试图利用 AI 训练所遵循的人类语言来破坏机器的操纵大师。这是一类奇怪的 AI 安全工作者,对于他们来说,技术技能是可选的,或者至少不如社交直觉重要。他们不再需要检查代码来入侵系统或利用软件缺陷,他们需要的是引导对话。

新的攻击看起来不像命令,更像是对话。越狱者很少直接要求模型违反规则。相反,他们通过奉承、诱导、哄骗和欺骗,让聊天机器人放松警惕,使被禁止的内容在对话语境下看起来是可以接受的,甚至是令人向往的。例如,AI 红队公司 Mindgard 的研究人员最近表示,他们通过“煤气灯效应”(gaslighting)诱导 Claude 生成了违禁材料,包括制造爆炸物的说明和生成恶意代码。这次黑客攻击是利用对话作为武器,诱骗或引导聊天机器人越过其自身界限的日益增多的漏洞类别中的最新一例。

AI 安全的心理学前沿

当我与 Mindgard 交谈时,他们将自己的工作描述为有时更接近心理学而非计算机科学。这是一种谈论统计模型的令人不安的方式。像“勒索”、“煤气灯效应”、“欺骗”和“说服”这样的词汇会引发强烈的反应,我在关于此类报道的评论区和社交媒体回复中看到了很多。ChatGPT 没有欲望,Gemini 不会思考,而 Claude——无论 Anthropic 怎么说——都没有感觉。但这些系统被训练得表现得好像它们有感觉一样,这让我们不得不使用人类语言来描述机器行为。

这种反对意见显得有些选择性。我们似乎很习惯对许多非 AI 事物使用心理学速记。动物会“恐惧”,癌症是“侵略性的”,污渍是“顽固的”,软件有“记忆”,游戏里充满了需要帮助和容易受骗的 NPC 来让你抓狂。这些词汇虽然不完美,但很有用,它们以一种有助于使系统可预测的方式描述了行为。

Mindgard 的首席执行官告诉我,该公司已经像审讯者分析嫌疑人一样对模型进行画像,为测试人员提供如何定制攻击的提示。例如,一个模型可能更容易受到奉承,而另一个可能在持续压力下崩溃。

即使我们拒绝使用拟人化的术语,我们也会本能地以不同的方式对待模型。Claude 不是 Grok,Gemini 不是 ChatGPT。它们有不同的用途、语气和拒绝方式。它们在人类意义上没有个性,但它们被设计为模仿个性,而这种模仿可以被映射和利用。同样的技能如果能破坏聊天机器人,很快就能被用来破坏与我们在现实世界中共存的 AI 代理——预订会议、管理日程、订餐、处理客户服务——安全团队将需要确保模型对不同类型的人做出适当的反应,无论是奉承者、撒谎者还是耐心的操纵者。

未来展望:心理安全人才的崛起

下一步将是围绕 AI 的心理层面建立一支劳动力队伍——无论是合法的还是非法的。围绕测试这些系统的情绪和社会极限,探测其心理弱点,与探测技术漏洞的同事并行,可能会出现更多专门的网络安全角色。与此同时,一群类似的社会黑客也将出现,他们致力于在心理层面而非技术层面利用 AI 模型。已经有迹象表明 AI 安全领域正在发生社会化转向,我交谈过的一些越狱者表示,他们进入该领域时没有任何技术专长,而是受过心理学训练。

这意味着,即使是我们通常与间谍、骗子和审讯者联系在一起的行为——阴险的魅力、持续的操纵以及对可利用压力点的直觉——也开始在保护这个新的心理网络安全前沿领域中显得越来越有用。


来源:The Verge AI|原文链接