作者:陈文昊丨原舒仪丨李诗
摘要
具身智能的隐私风险,并不止于摄像头和麦克风“采集了什么”,更在于数据在设备端、云平台、训练管线、模型记忆、远程运维与反馈学习之间持续流转。家庭服务机器人可能记录居住环境与生活规律;工业机器人可能识别员工面部、声音及作业轨迹;公共空间机器人则可能同时捕捉用户、路人和未成年人的信息。以隐私政策和一次性同意为中心的传统治理模式,难以充分覆盖持续感知、多人在场及跨场景复用所带来的复合风险。
本文以四层数据治理模型的第一层 — 隐私保护(Privacy Protection)为主线,围绕数据来源、全生命周期、敏感个人信息、分层告知、跨境研发与网络安全展开分析。具身智能企业真正需要建立的,并非更为宽泛的授权文本,而是一套能够将目的明确、最小必要、保存期限和用户控制等法律要求,转译为传感器参数、数据架构与产品功能的“隐私工程”。
一、持续感知如何重塑隐私保护的基本场景
(一)数据权利主体不再仅限设备用户
传统互联网服务中的个人信息处理关系相对清晰:用户注册账户、进入页面、选择功能并与平台交互。具身智能设备进入物理空间后,设备购买者、账户注册者、实际操作者以及被拍摄、录音的现场人员可能分别属于不同主体。家庭机器人会接触访客、儿童和家政人员;商场机器人会捕捉路人;工业设备会记录员工及承包商;配送机器人则可能持续穿行于公共道路和住宅区域。
因此,企业不能仅向账户持有人提供一份隐私政策,便推定已经覆盖全部个人信息处理活动。具身智能更需要建立分层、场景化的透明机制:账户端隐私政策用于说明长期、复杂的处理安排;首次配置界面供设备管理者选择功能;机身标识、状态灯和语音提示用于告知现场人员;部署场所告示用于披露运营主体及权利行使渠道;在儿童、医疗和家庭等高风险场景中,还应提供更醒目、更易理解的提示。
(二)技术能力不应自然转化为数据采集边界
为实现环境感知,具身智能设备通常配置超出单一功能所需的多类传感器。摄像头可同时用于导航、物体识别、行为分析和视频通话;麦克风可用于唤醒、语音指令、声源定位及异常声音检测。若企业仅因为“设备具备相应能力”而默认收集全部原始数据,极易偏离目的明确和最小必要原则。
合规审查应当依次区分“传感器能够捕捉的信息”“完成当前任务必须处理的信息”“确有必要上传的信息”与“确有必要长期保存的信息”。例如,避障可能仅需在设备端即时提取障碍物特征,无须上传清晰人脸;唤醒词识别可能仅需本地短时缓存,无须持续保存环境音;抓取任务可能仅需物体轮廓和空间坐标,无须保留完整家庭画面。传感器的技术能力,不应自动扩张为产品的默认处理范围。
二、数据的“来龙去脉”:具身智能的数据来源与用途边界
(一)具身智能设备现场采集:区分运行数据与二次训练
具身智能设备为完成即时任务而处理数据,与企业将数据回传用于产品分析或通用模型训练,属于不同的处理目的。前者可能具有较强的功能必要性;后者则应重新审查处理依据、告知范围及最小必要性。产品设计应清晰区分:哪些数据仅在设备端即时处理,哪些以短周期缓存用于故障排查,哪些仅在用户开启特定功能后上传,以及哪些数据只有在筛选、去标识化并完成必要评估后方可进入训练集。
实践中的典型误区,是将用户勾选“改善产品体验”解释为可以收集全部运行数据并无限期用于训练。此类概括性表述通常无法充分说明具体数据类型、用途及可能影响。更稳健的做法,是对高风险数据与训练用途实施分层选择,使用户能够分别控制原始图像回传、语音片段分析、交互记录训练及个性化长期记忆,并提供便捷的撤回、关闭与删除机制。
(二)公开数据和互联网抓取:可访问不等于可无限使用
公开网页、社交平台、公开视频和开放数据库,是多模态训练数据的重要来源。但“公开可见”并不等于“可以无限使用”。根据《个人信息保护法》第二十七条,个人信息处理者可以在合理范围内处理个人自行公开或者其他已经合法公开的个人信息,但个人明确拒绝的除外;对个人权益有重大影响的,还应依法取得个人同意。处理目的、数据敏感程度、使用方式、对个人权益的影响及个人合理预期,均是判断“合理范围”的重要因素。
批量抓取还可能同时触及平台服务规则、著作权、反不正当竞争及数据安全等问题。企业应保存数据来源网址、获取时间、访问条件、许可文本、抓取方式与用途判断,避免数据进入清洗或训练管线后彻底丧失来源可追溯性。对于包含人脸、声音、家庭场景、未成年人或其他高风险内容的数据集,仅以“来自公开互联网”说明来源,通常不足以支持合规判断。
(三)第三方采购与开源数据集:合同承诺不能代替实质核验
第三方供应商或开源项目往往难以完整说明数据最初如何采集、是否完成告知或取得必要授权、是否允许商业训练和形成衍生模型、能否再许可,以及如何响应删除请求。企业应根据风险水平开展分层尽调:对低风险通用语料,可结合抽样核验与合同保证;对含有面部、声音、位置、医疗健康或儿童信息的数据集,则应重点审查授权链、样本来源及使用限制,并要求供应商建立删除、投诉和侵权处置机制。
训练数据合同至少应覆盖数据来源与采集方式、授权主体、许可用途、地域与期限、训练和微调权限、衍生模型的形成及商业化、再许可、知识产权与个人信息责任、删除或返还、审计、投诉处理及赔偿机制。企业应避免仅约定“供应商保证数据合法”,却不明确其应当提供的证明材料与持续配合义务。
(四)合成数据与仿真数据:降低依赖不等于完成匿名化
合成数据和仿真环境有助于减少对真实场景数据的依赖,覆盖低频或危险事件,并提高训练效率。然而,如合成样本复现特定个人、保留独特识别特征,或者模型可由此推断真实训练样本,仍可能产生个人信息与隐私风险。企业应审查合成数据所依赖的基础数据、生成方法、与真实个体的相似程度、成员推断和重识别风险,并测试模型输出复现训练样本的可能性。
此外,仿真数据还可能嵌入真实地图、建筑结构、生产参数或客户业务信息。因此,审查范围不能止于个人信息,还应同步评估商业秘密、重要数据及场景安全风险。
三、生命周期治理:在收集、存储、使用与删除的每一阶段设置边界
具身智能行业处理的个人信息生命周期通常涵盖收集、缓存、上传、标注、清洗、存储、训练、微调、检索增强生成(RAG)、评测、共享、远程访问、归档与删除。企业需要在每一阶段明确处理目的、数据范围、保存期限、访问主体及安全措施,不能以笼统的“研发需要”统摄全部用途。
(一)采集:以任务为单位定义最小范围
企业可针对每项功能建立“传感器—数据字段—处理位置—保存期限”矩阵,将导航、语音交互、远程看护、异常检测和模型改进分别列示。对可关闭的非必要功能,默认设置应贯彻最小采集;对必须持续运行的安全功能,应说明其必要性,并优先采用本地处理。
(二)存储:原始数据、特征和日志应分层管理
原始图像、音频和视频通常具有较高的个人识别风险,保存期限应尽可能缩短。对提取后的特征、结构化事件及统计结果,仍需评估其是否能够关联或识别个人。安全日志应足以支持事件调查,但不应因此无限期保留交互内容。企业可将设备端临时缓存、业务存储、训练数据仓库与安全日志库分层设置,分别配置访问权限和保留期限,避免所有数据无差别汇入同一“数据湖”。
(三)训练与微调:用途变化需要重新评估
用户为完成特定任务向具身智能设备提供的信息,并不当然可以转用于通用模型训练。将运行数据转化为训练数据时,企业应重新审查处理依据、告知范围、用途兼容性、敏感个人信息、儿童信息、去标识化程度及必要性,并在适用时履行单独同意、监护人同意和个人信息保护影响评估等要求。训练集还应保留数据版本、来源和许可关系,以便企业在收到删除、异议或侵权通知后,能够识别受影响的数据集与模型版本。
RAG同样不是训练之外的“无风险区”。RAG不会直接把企业收集到的数据训练进模型,但这并不等于数据没有隐私风险。企业将客户文档、员工信息或家庭记录写入向量数据库后,仍需控制访问范围、用户隔离、召回结果、提示词日志及删除同步。原始文档已经删除,而向量、缓存或备份仍然保留,是实践中常见的全链路删除断点,即删除操作只在某一个环节生效,没有传递到数据的所有副本。判断数据是否真正删除,不能只看原始文档是否还在,而要检查向量库、文本切片、缓存、日志和备份等整个RAG数据链路。
(四)共享与受托处理:先判断各方角色
云平台、标注商、远程运维商、模型供应商和部署客户,可能分别构成受托处理者、共同处理者或独立个人信息处理者。主体角色不能仅依据合同名称判断,而应考察谁决定处理目的、数据范围和处理方式。模型供应商将客户数据用于自身通用模型训练,通常已经超出单纯依照客户指示提供服务的范围;运维商即使不主动下载数据,只要具备实际访问权限,也应纳入受托处理管理和安全控制。
(五)删除与归档:从前台删除走向全链路删除
用户删除交互记录后,企业应明确设备端、云数据库、对象存储、向量库、标注平台、训练集、备份和日志之间的同步处理机制。对于已经进入模型的个人信息,应结合技术可行性、继续处理的必要性及对个人权益的影响,评估是否通过重新训练、模型编辑、输出抑制或其他措施降低风险。企业至少应能够证明其已停止继续使用相关数据、阻断检索或调用、妥善处理后续模型版本,并完整记录执行结果。
四、重点场景:敏感个人信息、家庭环境与未成年人保护
(一)自然人图像与生物识别不能机械画等号
包含自然人面部的普通图像通常属于个人信息,但是否进一步构成生物识别信息,应结合具体处理目的和技术方式判断。企业提取面部特征用于身份识别、身份验证或持续追踪时,相关风险显著上升,通常应按照敏感个人信息规则进行管理。合规设计应区分“画面中偶然出现人脸”“识别人类存在”“区分不同个体”与“确认特定身份”等处理层级,并配置与风险相匹配的保护措施。
(二)声音、轨迹和位置可能形成深度画像
声音既可能承载谈话内容,也可能被用于声纹识别、情绪推断或健康状态判断;位置和行为轨迹经长期积累,则可能揭示家庭成员作息、员工工作规律或个人活动范围。企业应避免为实现一次性导航或交互而长期保留可追踪的个体轨迹,并严格限制将轨迹进一步用于营销、绩效分析或其他不相容目的。
(三)家庭环境具有超出一般场所的隐私期待
家庭机器人可能采集房间布局、生活物品、财产状况、宗教习惯、健康状态及亲密关系等信息。即使单幅画面不足以直接识别个人,连续记录仍可能构成对私人生活的深度观察。家庭场景应采用更严格的隐私默认设置,包括设备端处理优先、远程查看默认关闭、清晰可见的摄录状态提示、访客模式、物理遮挡开关及一键清除。
(四)儿童信息需要同时考虑个人信息和产品设计
不满十四周岁未成年人的个人信息属于敏感个人信息。面向家庭、教育、陪伴和娱乐场景的机器人,应评估其是否可能由未成年人直接使用,或持续记录未成年人活动。取得监护人同意仅是基础要求;企业还应限制画像、营销、长期记忆和拟人化诱导,以适龄语言说明产品功能,并提供监护管理、使用时长和内容边界设置。
自2026年7月15日起,《人工智能拟人化互动服务管理暂行办法》正式施行。对于向中国境内公众提供持续性情感互动服务的具身智能产品,企业应评估其是否落入该办法的适用范围;单纯提供智能客服、知识问答、工作助手、学习教育或科学研究等服务,且不涉及持续性情感互动的,不适用该办法。对适用产品,企业还需落实人工智能身份提示、过度依赖和沉迷提醒、未成年人模式、交互数据复制与删除,以及将敏感个人信息交互数据用于模型训练前取得单独同意等要求。
五、数据跨境:全球研发不意味着全球可访问
具身智能企业常见的跨境场景包括全球模型训练、境外总部分析、海外机器人部署、跨国研发协同、境外云服务及远程运维。数据出境并不限于将文件下载并发送至境外;境外团队远程查询、调取或浏览存储于境内的数据,也可能构成向境外提供个人信息或重要数据。
(一)识别场景,分析出境必要性,并关注数据性质的转化
数据出境的各类场景识别,以及自由贸易试验区负面清单等安排,均需结合具体事实判断。企业不能因数据物理存储于中国境内,便忽略境外工程师、总部团队或供应商远程访问所触发的数据出境合规要求。
企业应先明确境外接收方、访问方式、数据类别、涉及人数、计算期间及处理目的。具身智能企业需要各位关注的是在各类场景下数据出境的必要性。如果企业处理的个人信息并无必要出境,在研发等场景中就需要进行匿名化处理,使其不再具有个人信息属性。但在此过程中,需要注意匿名化的有效性,企业应当从技术、管理、最终效果等多维度评估匿名化效果,确保对非必要出境的个人信息进行匿名化而非去标识化后再行出境。
同时,企业在数据出境过程中还应关注特定行业的重要数据目录,同样的数据内容,可能因为行业的不同而发生性质转化,进而触发重要数据出境安全评估的法律义务。
(二)程序豁免不意味着实体义务豁免
即使无需办理特定的数据出境程序,企业仍应履行告知、合法性基础、最小必要、个人信息保护影响评估、安全保护及个人权利保障等实体义务。对具身智能企业而言,更稳健的架构通常是优先在境内或设备端处理原始图像、音频与轨迹,仅向境外传输匿名化统计结果、必要的模型参数、故障代码或任务结果,并通过权限隔离、访问审批与日志审计约束远程访问。
(三)海外设备也可能触发中国法律的域外适用规则
境外部署的具身智能设备如以向中国境内自然人提供产品或服务为目的,或者分析、评估中国境内自然人的行为,仍需评估《个人信息保护法》的域外适用。全球产品不能仅依据设备所在地确定适用规则,还应综合考察数据主体所在地域、服务对象及处理目的。
六、网络与数据安全:数据泄露可能进一步演化为物理风险
具身智能系统的安全边界横跨设备、网络、云平台、模型、应用接口与控制指令。远程运维账户、调试端口、默认口令、第三方SDK、插件及模型接口,均可能成为薄弱环节。企业应系统落实身份鉴别、最小权限、传输与存储加密、密钥管理、漏洞管理、补丁更新、日志留存、备份恢复和事件响应等控制。
对于能够执行物理动作的系统,数据安全事件响应还必须与设备安全机制联动。当发现异常访问、数据外传或可疑控制指令时,系统能否及时阻断高风险动作、切换至安全状态、保全证据并通知运营方,直接决定安全措施能否有效降低现实危害。企业应将数据泄露预案与产品安全、客户现场应急及供应商协同机制纳入统一演练。
七、数据合规落地:构建具身智能隐私保护工程的控制项
对具身智能企业而言,最关键的隐私合规动作往往并非简单制定一份面向用户的隐私政策,而是内部的“传感器—数据—功能—处理位置—保存期限”数据合规矩阵。该矩阵将法律要求与产品架构直接连接,也是开展影响评估、判断数据出境及调查安全事件的重要证据基础。具体而言,我们建议具身智能企业从以下方面落地数据合规工作:
建立传感器与功能矩阵:逐项列明传感器对应的功能、数据类型、处理位置、上传条件、保存期限及关闭方式;
区分运行、运维与训练用途:不得以“改善产品”为笼统理由,默认将全部运行数据投入通用模型训练;
坚持设备端处理优先:对避障、唤醒、即时识别等功能,优先采用边缘计算与短周期缓存;
构建多层次透明机制:组合使用隐私政策、配置界面、机身标识、状态灯、语音提示和部署场所告示;
对高风险数据实施单独治理:为生物识别、精确位置、医疗健康、家庭场景及未成年人信息设置更严格的审批、访问与使用门槛;
建立训练数据来源档案:完整保存数据来源、许可条件、抓取规则、供应商证明、样本风险及删除渠道;
绘制跨境访问地图:将境外总部、云平台、模型供应商和远程运维账户纳入统一盘点;
验证删除与事件响应能力:定期测试设备端、云平台、向量库、训练管线、备份及日志能否依规则删除、隔离或停止使用相关数据。
结语:让隐私保护融入产品设计,而非停留在法律文本中
对于具身智能行业来说,隐私风险并不止于数据采集环节,而是贯穿信息上传、存储、调用、训练、记忆与删除的全过程。具身智能持续感知环境,并在交互和反馈中不断调整,使个人信息保护不再只是法律文本中的合规要求,而成为贯穿产品全生命周期的系统工程。相比一份宽泛的用户授权,企业能否从产品和技术层面限制原始数据上传,区分运行数据与训练数据的用途,控制长期记忆,识别并保护旁观者,确保数据在全链路中真正删除,以及在发生异常时同时阻断数据流与物理动作,更能反映产品实际的隐私保护能力,也更能决定其真实风险水平。
四层治理模型中的隐私保护层,解决的是个人信息能否合法、适当地进入系统。下一篇文章将进一步讨论:当机器人进入工业、能源、医疗、港口和交通等关键场景后,企业如何判断其处理的数据是否可能被识别为重要数据,以及在重要数据目录尚未完全制定、公开的情况下,如何建立可执行的识别、申报与保护机制。
特别声明 |
|
汉坤律师事务所编写《汉坤法律评述》的目的仅为帮助客户及时了解中国或其他相关司法管辖区法律及实务的最新动态和发展,仅供参考,不应被视为任何意义上的法律意见或法律依据。 如您对本期《汉坤法律评述》内容有任何问题或建议,请与汉坤律师事务所以下人员联系: |
|
陈文昊 电话: +86 21 6080 0359 |