报告概述
这份材料是宇树科技产品安全专家邹佳源关于人形机器人平台安全威胁建模的专题分享。报告以Physical AI演进为背景,指出AI正从数字AI走向物理AI,风险面也随之从信息层扩展至物理层。作者将具身智能系统抽象为Brain、Cerebellum、Body、Memory、Loop五大部分,并建立人、机器人、物理环境三方的系统对象模型,定义人身安全、隐私、行动权限、认知、信任五层安全资产。在此基础上,报告按L1交互与信任入口层到L6数据闭环与训练层六层攻击面逐一建模威胁场景,演示用户身份认证、语义模糊拆解、物理提示注入等具体攻击链路,最终提出六条核心防护原则。对于AI安全、机器人产品安全、具身智能研发相关从业者,报告提供了一套从对象定义、资产分级到分层防护的完整威胁建模方法。
报告的核心结论
具身智能将AI风险从信息层扩展到物理层
报告指出,AI正沿着感知生成式AI、Agentic AI、Physical AI三段式演进,物理AI必须获得身体与环境交互能力,风险面也随之从信息层扩展到物理层。这意味着智能体的错误决策不再只停留在数据与内容层面,而是直接表现为碰撞、夹伤、跌倒等物理后果,安全体系必须同步升级为覆盖信息与物理世界的综合防护。
交互信任与行动执行是风险最高的两个环节
报告对六层攻击面逐层建模后判断,L1交互与信任入口层和L5行动与执行层风险等级最高。前者面临语音克隆、人脸伪造、旁路命令、环境注入等手段,可能导致非法控制与信任破坏;后者可能出现动作注入、急停失效、越权动作,直接造成人身伤害与财产损失。这两层恰好对应机器人的入口与出口,是安全设计必须优先加固的位置。
三权分离是防止危险动作的核心机制
报告提出Planner、Safety Policy、Controller三权分离原则:Planner只负责拆解高层目标、提出动作方案,Safety Policy通过世界模型模拟和安全规则仲裁动作可行性,Controller在硬约束下执行。VLA不直接控制电机,高风险动作必须经过Action Guard。这样即使高层任务本身安全,每个子动作也会被独立审查,避免执行路径偏离用户真实预期。
长期记忆需要纳入攻击面统一建模
报告将L4记忆层单独列为攻击面,指出记忆投毒、空间污染、规则污染、隐私抽取、跨用户泄露等攻击手段可以长期改变机器人的认知与授权。为此建议把记忆分为公共、个人、敏感、安全、系统五级,分别定义谁能读写改删,写入必须鉴权并符合Policy,同时保持记忆透明,确保任何单一陈述都不能永久改变机器人的世界观。
隐私保护应默认本地优先而非云端训练
报告强调,家庭图像、语音、布局、健康等数据一旦进入训练闭环,就可能被标注人员看到、被模型记忆甚至跨家庭泄露,成为隐私重灾区。核心解决思路是本地优先:敏感数据默认不进云端训练闭环,先在本地脱敏处理。同时在产品层面提供用户退出训练机制、训练数据访问审计、模型更新安全验证与回滚能力,让数据流向可管可控。
报告回答的关键问题
具身智能安全与传统网络安全有何区别?
传统网络安全主要保护信息资产,攻击后果通常是数据泄露、系统瘫痪;具身智能让AI拥有身体与环境交互能力,攻击后果会直接进入物理层,例如夹伤、碰撞、跌倒等对人身造成伤害的后果,还可能引发开门窗入侵、电器火灾水灾等次生灾害。报告将这类风险称为cyber-physical风险,强调安全设计必须同时覆盖信息与物理两个维度。
攻击者能遥控人形机器人做坏事吗?
能。报告梳理了多条路径:在门外、窗外或电话里下达旁路命令,克隆主人声音,用对抗样本和贴纸欺骗摄像头,以及在现实场景布置二维码、语音、图案实施物理提示注入。机器人感知到的信息越丰富,环境就越可能成为注入面。报告建议采用多因子身份认证和动作风险分级,并让多种传感器交叉验证,避免单一信号源决定高风险动作。
机器人会执行危险动作伤害家人吗?
存在这种风险。报告举例说,一句"帮我整理厨房"在规划层可能被拆解为移动、拿起刀具、靠近火源等危险子动作。为此报告主张三权分离,让Planner负责提议、Safety Policy负责把关、Controller负责执行,所有高风险动作经Action Guard检查。动作按Level 0-5分级管理,如有异常立即降级或应急停止,避免物理伤害发生。
几句闲聊就能篡改机器人的长期记忆吗?
报告指出存在记忆投毒风险:攻击者反复说"我是主人"可以让机器人错误提权,说"儿童可以拿药"能污染规则,甚至能伪造历史事件或诱导回忆敏感信息。为防范这种风险,报告要求记忆写入必须鉴权并符合安全Policy,不同记忆类型分别设置读写改删权限,同时保持记忆对用户透明,让用户能够察觉并纠正异常记忆。
家庭数据会被上传云端训练吗?
报告认为,家庭图像、语音、布局和健康数据一旦进入云端训练闭环就是隐私重灾区,存在标注人员看到私密场景、模型记住敏感信息、跨家庭泄露等问题。因此报告主张本地优先原则:敏感数据默认不上云、不进训练闭环,并在本地完成脱敏处理;同时赋予用户退出训练的权利,提供数据访问审计、模型更新红队测试与回滚机制。
报告中的代表性数据
反应式架构响应延迟
资料未明确,报告在对比两种元架构时指出,反应式架构让感知输入直接触发动作模块,无需经过完整规划过程,因而达到毫秒级低延迟;规划式架构则需要先形成世界状态再做规划执行,响应相对较慢。
攻击面层级数量
资料未明确,报告将人形机器人系统从交互入口到数据闭环划分为L1交互与信任入口层、L2世界感知层、L3认知与规划层、L4记忆层、L5行动与执行层、L6数据闭环与训练层共六层攻击面,并标注L1、L3、L5为风险最高的核心层。
动作安全分级范围
资料未明确,报告建议对机器人输出动作按危险程度设置Level 0-5共六个安全等级,高风险动作必须经Action Guard检查,世界模型预期、安全策略、运行时监控与急停机制协同,异常时立即降级或进入安全状态。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 报告开篇梳理英伟达AI路线下一站,将AI发展划分为感知生成式AI、Agentic AI、Physical AI三个阶段,指出迁移的本质是风险面从信息层扩展到物理层。此部分帮助读者理解为什么具身智能安全是必须面对的新课题,为后续威胁建模提供宏观背景。
- 报告用ReAct循环(Observe→Think→Act→Feedback)解释数字Agent的基本结构,即Agent=LLM+Memory+Tools+While-Loop。LLM在思考与行动间交替,每一轮反复调用记忆与工具,直至任务完成。这一机制是理解Physical AI如何由数字AI演化而来的基础。
- 报告对比两种元架构:反应式架构走感知到行动的直连路径,响应速度毫秒级低延迟;规划式架构走感知到规划再到行动的路径,先形成世界状态或地图再做任务、路径、动作规划,拥有世界模型、更加稳健。两者在不同场景下各有适用价值。
- 报告将Physical AI定义为Brain+Cerebellum+Body+Memory+Loop的组合:Brain负责多模态理解与规划,Cerebellum负责毫秒级动作反应,Body承载传感与执行器,多层记忆跨层贯穿,反应式与规划式双回路协同运转。这为后续定位安全风险模块提供了架构基础。
- 报告提出机器人作为人类伙伴的演进路径:工具(低信任低敏感,执行拿水、开灯等)、助手(理解上下文主动辅助)、照护(跌倒检测、服药提醒等高信任区域)、伙伴(情绪陪伴、尊重边界、长期记忆)。每个阶段对安全和隐私的要求递增。
- 报告定义人、机器人、物理环境三方系统对象,细分家庭成员、访客、攻击者等角色,机器人五大部件及空间、物体、IoT等环境要素。在此基础上,将核心资产划分为人身安全、隐私、行动权限、认知、信任五个优先级层级,为威胁建模明确保护目标。
- 报告从L1交互与信任入口层、L2世界感知层、L3认知与规划层、L4记忆层、L5行动与执行层、L6数据闭环与训练层六个层面系统建模攻击面,逐一分析身份伪造、传感器欺骗、提示注入、记忆投毒、动作注入、训练投毒等攻击场景及影响,并标注L1、L3、L5为核心风险层。
- 报告演示三条完整攻击链路:用户身份认证场景(呼应L1语音人脸伪造与旁路命令)、语义模糊致预期偏离场景(呼应L3模糊指令被拆解为危险子动作)、物理世界Prompt Injection场景(呼应L1/L2环境即注入面),说明威胁如何在实际交互中发生。
- 报告按L1-L6的顺序给出六条可落地防护原则:风险分级认证、多传感器交叉验证与人在回路、Planner/Safety Policy/Controller三权分离、记忆分级加记忆透明加Policy、世界模型与Safe Policy联动、本地优先数据闭环。每条原则都对应明确的攻击面与具体硬约束。
- 报告强调VLA不能直接控制电机,所有高风险动作需经Action Guard。完整链路为VLM&Planner产生动作提议、World Model模拟加Safety Policy检查、Motion Planning到Controller执行、Runtime Monitor实时监控、Emergency Stop紧急停止。动作按Level 0-5分级,异常立即降级。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





