2026年7月28日,由国泰君安国际控股有限公司主办的“2026国泰君安国际818理财节财富论坛”,在香港隆重举行。
本届论坛以“智享科技财富新生”为主题,汇聚粤港澳大湾区金融监管领域资深专家、硬科技产业领军人物、全球资产管理机构代表、头部券商研究所首席分析师等,围绕金融互联互通、AI产业链机遇、科技周期下的资产配置等前沿议题展开深度对话,打造一场金融资本与硬科技产业深度交融的思想盛宴。

乐动机器人(01236.HK)创始人、董事长周伟先生受邀出席论坛,并于当日发表题为《定义物理AI的感官,从人的感知系统到物理AI的启示》的主题演讲。
周伟先生系统拆解具身智能爆发前夜的行业底层逻辑,揭示感知技术作为物理AI核心基础设施的战略价值,分享乐动机器人在空间智能领域的全栈技术布局与商业实践,为现场投资者与产业人士呈现物理AI赛道的全新认知框架。
在物理AI产业浪潮中,乐动机器人以感知智能为核心锚点,形成从底层硬件技术到上层空间模型、从技术迭代路径到数据资产壁垒的完整战略布局,完成从感知硬件厂商、向空间智能平台公司的战略跃迁,成为物理AI赛道兼具技术深度、与规模优势的全栈式玩家。
一、时代拐点已至:物理AI迎来图形界面时刻。
周伟在演讲开篇提出核心判断,LLM已重塑数字世界的交互范式,下一场深刻产业变革将发生在物理世界。
机器人产业从按预设程序运动的自动化阶段,加速迈向理解环境、自主行动的智能化阶段,这一切能力的前提,是先让机器人看见、看懂真实世界。
感知系统决定机器人能进入多少场景、承担多复杂的任务;视觉感知是物理AI最先兑现的基础设施层,以约20%复合增速扩张;谁掌握感知,谁就掌握机器人时代的入场券。
周伟将这一产业转折,类比为个人计算机从命令行、到图形界面的革命性跨越。
数字AI时代,人机交互以被动输入为主,用户通过文字、语音将明确需求传递给机器,机器执行对应指令。
物理AI时代,全模态主动交互将成为主流,AI能够实时、主动观察环境、理解人的潜在需求,并自主采取行动。
周伟强调,从被动、到主动,是物理AI时代最核心的交互变革,交互模式的升级,将带来数据与算力格局的根本性变化。
周伟指出,全模态主动感知交互需要持续的环境扫描与数据处理,视觉帧、触觉流、力觉数据、空间映射等多模态信息将每秒产生海量数据,空间Token将取代文本Token,成为物理AI时代最核心的数据形态,对应的算力、存储需求,将达到文本时代的万倍级。
在算力架构上,物理AI与数字AI存在本质区别。
数字AI依赖集中式算力,数据上传云端统一处理,秒级延迟即可满足需求。
物理AI场景中,碰撞、失误意味着直接的物理伤害与财产损失,同时家庭、工厂等场景的数据隐私敏感度极高,因此算力必须向端侧下沉,形成分布式算力网络,以满足毫秒级的响应要求。
周伟表示,物理AI的算力,不是集中在超算中心,是分布在每一台机器人、每一台智能设备当中。
周伟还对物理AI做了两个非常重要、具有启发性的思考与分享。
一个物理AI是快慢协同的多层次模型,而非单一端到端大模型。
物理AI核心特征是与真实物理世界进行实时、闭环交互,这一属性从根本上决定它无法依靠单一的端到端大模型实现,必须构建快慢系统结合的多层次模型协同体系。
与纯数字场景的AI不同,物理世界的交互同时面临三重刚性约束,一是极致的实时性要求;二是端侧算力约束,大量感知与控制逻辑必须在设备本地完成,无法完全依赖云端算力;三是数据隐私与可靠性要求,物理场景的容错空间,远低于数字场景。
这三重约束,共同决定单一通用大模型无法同时满足低延迟、高可靠、强智能的目标,必须通过不同层级的模型分工协作来实现。
这一架构设计可类比人类的感知—反馈三层生理体系,对应不同的响应速度与功能定位。
最底层是反射层,响应只需要50~150毫秒,类似人类脊髓与脑干,是无意识条件反射。碰到障碍立刻缩手,站不稳立刻调整姿态,不用动脑,用最快速度保障基础安全。
中间是协调层,响应150~500毫秒,对应人类小脑,管半自动化的运动控制。走路的步态平衡、熟练的动作技能,都靠这一层协调,不占用高层算力,动作流畅,还省算力。
最上层是认知层,响应500毫秒以上,由大模型承载,对应人类大脑皮层。负责路径规划、复杂决策、学习新任务,处理真正需要深度思考的问题。
这是直觉快思考+深度慢思考搭配着来,快系统管稳定、管安全、管效率,慢系统管智能、管泛化、管创新。多层协同,才是物理AI真正的技术底色。
另外是关于未来的社会分工,周伟做了一个预测,物理AI会接管物理世界,虚拟世界将接管人类的精神世界。背后逻辑链条非常清晰,AI时代最根本变化,是机器终于会干活了。
未来,家务、搬运、制造这些体力活,机器人来做;日常出行,交给自动驾驶;农业、工业、服务业里的物理劳动,都会逐步被自动化接管。
物理AI本质,是把人类从体力劳动里彻底解放出来,人类不用再为了满足物质生存需求而出卖体力。
人被解放出来之后,时间、精力、需求自然会往精神层面转移。人类娱乐、社交、自我实现,会越来越多发生在数字空间里,数字身份、数字资产也会变成生活的重要组成部分。虚拟世界的本质,是把人类的精神生活全面数字化。
二、直击行业痛点:77%虚实落差背后的感知鸿沟。
演讲中,周伟援引斯坦福大学《2026 AI指数报告》数据指出,当前机器人在模拟环境中的任务成功率可达89.4%,进入真实世界后骤降至12.4%,高达77%的虚实落差,成为制约产业规模化落地的核心瓶颈。

在周伟看来,这一差距并非源于运动控制技术的不足,本质上是空间感知能力的鸿沟。
真实世界没有预设坐标,没有完美标注,更没有静态不变的环境;光照变化、材质差异、动态障碍物、长尾场景,都是实验室里无法完全复现的。
这就引出周伟分享中非常重要的一个洞察,也是物理AI是最有可能实现ASI的原因所在;具身智能是支撑物理 AI 发展的核心底层理念,从根本上重新定义智能的诞生逻辑,智能并非孤立大脑运算的产物,是在实体与环境的持续物理交互中逐步涌现的。
没有身体就没有真正的智能,是具身智能最核心的哲学判断。这一判断底层逻辑在于,智能终极目的,是适应、改造物理环境。
只有通过身体与环境的持续物理交互,智能才能完成从被动接收信息,到主动探索验证的跃迁,最终涌现出真正具备通用性与环境适应性的智能能力。
这是物理 AI 区别于传统数字 AI 的核心差异所在,智能诞生于身体与环境的交互闭环,传统数字 AI 类似缸中之脑式的智能,依托文本、图像等数据完成训练与推理,全部认知活动局限于数字空间,始终无法触碰真实的物理世界。
具身智能的核心主张是,智能不是大脑的孤立产物,是通过身体(传感器 + 执行器)与环境的持续交互中涌现的。
真正适配物理世界的智能,无法脱离实体独立存在。只有拥有可感知、可行动的身体,智能体才能在真实环境中接收即时反馈、验证自身认知、迭代行为能力,最终演化出能够适应复杂、非结构化物理场景的通用智能。
一套完整的具身智能系统,由感知系统、决策大脑、执行器三大模块共同组成,形成感知—决策—执行—反馈的完整闭环,精准对应生物感官—大脑—肢体的生理结构。
周伟系统梳理当前具身感知面临的三大核心瓶颈,分布是数据瓶颈、感知技术瓶颈、多模态融合瓶颈。
第一是数据瓶颈。
与互联网文本数据可批量抓取不同,物理世界的交互数据必须通过真实机器人在真实环境中感知、行动才能产生。
当前行业数据孤岛化严重,缺乏统一的数据标准与共享机制,高质量物理交互数据的稀缺,直接限制模型能力上限。
第二是感知技术瓶颈。
现有传感器在精度、维度、响应速度上仍有短板,缺乏亚毫米级的操作感知能力,难以支撑复杂场景下的因果推理与精细操作。感知精度的上限,直接决定机器人能力的边界。
第三是多模态融合瓶颈。
视觉、深度、触觉、力觉、听觉等多模态数据的实时对齐与高效融合仍是行业难题,单一传感器失效、遮挡、噪声等场景下,感知系统的可靠性会大幅下降,无法形成稳定的环境认知。
周伟用简洁的表述,没有感知,就无法理解;没有理解,就无法行动;概括感知的基础性价值。
在他看来,感知系统的能力边界,直接决定机器人能够进入多少场景、承担多复杂的任务,是物理AI必须突破的第一道关口。
三、向进化取经:人类感知系统是终极参照系。
周伟提出,在技术路径探讨中,人类感知系统是物理AI研发的终极参照系;生物进化用亿年时间验证感知系统的最优解,运行效率与适配能力远超当前所有人工系统;人类做技术研发,本质上是向进化学习。
人类感知系统并非传感器+大脑的简单线性链条,是一个多层级、多模态、预测性、闭环耦合的复杂智能网络。
周伟总结道,物理AI视觉系统的进化方向,不是盲目堆砌像素参数,是学习人眼用更少资源、做更聪明感知的策略,不均匀采样、事件驱动、边缘预处理、多通路融合,将是下一代感知技术的核心突破方向。
除了视觉机制,周伟强调多模态融合的相乘效应。
以McGurk效应为例,说明视觉输入,会直接改变人类对声音的感知,1+1>2的跨模态整合是生物感知的核心逻辑。
同时人类触觉密度分布极不均匀,指尖敏感度是手臂背面的百倍以上,进化将感知资源集中分配给最常与环境交互的部位,这一规律同样适用于机器人感知系统,资源应向核心交互部位倾斜,而非追求全机身均匀的感知密度。
感知系统正从机器人的辅助配套,升级为物理AI时代核心价值底座,呈现三大明确趋势。
一是成本占比快速提升,感知硬件成为整机价值的核心构成,直接决定机器人的环境适配上限;
二是技术向深度融合演进,行业重心从传感器堆叠,转向多模态数据的空间、时序双重对齐,这是感知可靠可用的工程核心;
三是能力维度持续突破,在精度、极端场景等多个物理感知维度,机器在系统性超越人类感官极限,为高质量物理交互筑牢基础。
四、乐动全栈技术布局:从传感器到空间Token,定义物理AI感官。
周伟介绍到,感知是物理AI与真实世界交互的入口,乐动核心技术突破,在于构建一套从原始数据采集、到结构化空间数据输出的完整全栈感知链路,最终输出可被大模型直接调用的空间Token,彻底重构感知系统的价值定位。
乐动这套全栈感知栈,分为四个递进层级。
第一层是传感器硬件层,依托乐动多类自研感知硬件,完成物理世界的原始信号采集,为后续处理提供高质量的多模态数据源。
第二层是AI算法处理层,通过乐动自研算法与AI深度融合能力,完成原始数据的初步校正、配准、特征提取,实现从原始信号到可用数据的转化,承担智能数据加工职能。
第三层是空间模型层,实现环境深度理解。基于前序数据完成精度达98%的三维重建,输出语义化场景结果,实现对环境结构、物体属性的深度认知,完成从看见到看懂的跨越。
第四层是空间Token输出层,实现结构化数据交付。空间Token是乐动对感知数据价值的重新定义,最终输出标准化的结构化空间Token,形成具备物理一致性的空间数据,既可以直接支撑机器人决策,也可作为世界模型的高质量训练素材。
这一技术栈核心价值,在于让乐动跳出传统传感器厂商的硬件定位,乐动不是单纯售卖传感器硬件的公司,是物理AI时代的数据精炼厂,通过全栈技术能力将原始物理信号提炼为可被AI直接消费的标准化空间数据。

周伟分享乐动基于全栈感知能力,面对即将到来的物理AI时代,清晰规划乐动三个层面的战略演进路径,从多模态感知、AI融合、空间模型的方向持续升级,最终指向通用空间交互基础模型的平台化目标。
第一层面是新型传感器,核心是扩展感知维度,突破感知的能力边界,让机器人感知覆盖更多人类无法触及的物理维度。
第二层面是AI深度融合,核心是实现从看见到看懂的升级。通过LLM大模型、视觉语言模型与空间感知能力的深度融合,让机器人具备包含物理环境属性与行为逻辑的复杂认知。
第三层面是家庭空间交互模型,这是乐动战略终局目标,被称为物理AI的GPT时刻。该模型将具备通用家庭环境理解能力,最终所有家用机器人都可以像调用GPT API一样接入这套模型,获得标准化的空间交互能力。
这一路径的核心愿景,是建成通用的家庭空间交互基础模型,推动乐动从感知产品公司,跃迁为空间智能平台公司,成为物理AI时代的底层基础设施提供商。
五、终局壁垒:海量实景数据,构筑不可逆竞争优势。
物理AI竞争本质是数据的竞争,乐动对行业数据路径做出清晰的终局判断,物理AI存在三条数据演进路径,唯有海量实景采集才能通向最终格局,乐动的规模化部署优势,是撬动这一终局的核心杠杆。
三条数据路径,分别对应不同产业阶段与价值定位。
第一条是数据工厂采集,是行业发展的启动器与幼儿园;真实世界的长尾场景无限,是行业起步的必经之路,无法支撑通用智能的长期演进。
第二条是仿真数据,是技术迭代的加速器;具备成本低、危险场景可复现的优势,仿真能力的上限,始终取决于对真实世界的理解深度,无法脱离真实数据实现自我闭环迭代。
第三条是海量实景采集,是行业终局路径;真实场景天然承载最本真的物理规律,能够覆盖无限长尾场景;数据量随机器人部署量指数级增长;这条路径核心逻辑是,部署量即数据量,数据量即壁垒,飞轮一旦启动便无法被复制。
对应三条路径,乐动行业角色呈现双重价值,在前两条路径上,乐动是提供感知工具的卖铲人;在第三条终局路径上,乐动凭借千万级终端部署量,成为坐拥实景数据金矿的核心玩家。后来者即便能造出更优的硬件工具,也无法复刻已形成的规模化实景数据壁垒。
整体而言,乐动以感知技术为起点,以全栈能力为骨架,以数据飞轮为长期壁垒,以空间智能平台为终局目标,构建一套自洽、具备强成长性的物理AI战略体系。在物理AI的产业浪潮中,这套战略既锚定行业演进的核心规律,也建立自身难以复制的竞争优势。
结语
周伟演讲,获得现场与会嘉宾热烈反响,多位资管机构代表表示,本次分享跳出传统机器人产业的分析框架,从感知基础设施与数据资产的视角重新定义行业价值,为资本市场理解物理AI赛道提供全新的底层逻辑。
让每一台智能机器人都拥有看懂世界的能力,是乐动始终不变的使命。
周伟表示,物理AI时代浪潮正在到来,感知基础设施是支撑整个产业的地基。
乐动将持续深耕空间智能感知技术,推动芯片、传感器、算法、空间模型与整机产品协同发展,携手产业伙伴与资本伙伴,共同开启物理AI时代的产业新局。
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。
标签:
免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。



















扫一扫关注微信