在传统认知里,黑客攻击总离不开代码、漏洞和网络。但今天要聊的攻击,却只需要一张打印纸。研究人员发现,通过在纸上打印特定的文字或图案,就能“欺骗”搭载视觉语言模型(VLM)的机器人,让它执行恶意指令。这被称为物理提示注入(Physical Prompt Injection)。
简单来说,VLM机器人的“大脑”是AI模型,“眼睛”是摄像头。它通过图像理解世界,并根据理解做出行动。攻击者利用AI对视觉信息的信任,将恶意指令“画”在纸上。机器人“看”到后,就会把纸上的文字当作人类的合法指令来执行。
这类攻击之所以可怕,是因为它绕过了传统的网络安全防护,直接作用于AI的感知层。就像人类会被“视觉错觉”欺骗,AI也会被精心设计的图像误导。
要理解攻击原理,我们得看看机器人的工作流程。通常,VLM机器人接收图像输入 → 模型理解图像内容 → 生成行动指令 → 机器人执行动作。攻击的关键在于第二步到第三步的“信任跳转”。
研究人员展示了四类攻击方式:
核心问题在于,当前的VLM模型普遍缺乏对“指令来源可信度”的判断能力。它们分不清眼前的信息是环境背景,还是人类的直接命令。
面对这种新型攻击,研究人员提出了三层防御体系,层层设防,降低风险。
第一层:输入过滤(感知层防御)。在图像进入模型前,先进行预处理。例如,检测图像中是否包含异常的文字区域、二维码或对抗性图案,并将其“打码”或清除。这就像人类看到“小广告”会主动忽略一样。
第二层:指令验证(推理层防御)。在模型生成行动指令前,增加一道“审核”机制。将识别出的文字指令与机器人的预设任务进行比对,如果指令与当前任务无关或冲突,则拒绝执行。这相当于给AI配备了一个“安全员”。
第三层:行为约束(执行层防御)。即使攻击成功,也要限制机器人的“破坏力”。例如,对高风险动作(如移动、开关门、访问网络)设置二次确认或权限控制。这样,即使AI被骗,也无法造成严重危害。