在刚刚落幕的2026世界人工智能大会(WAIC)上,“人工智能从数字世界走向真实世界”已成为产业界的共识。

展台上,具身智能的进步清晰可见。前几年,人形机器人还只是静态展示,去年已经可以在台上打拳击赛,今年,更多机器人走进各大场景“干活”了,这不禁让人好奇,明年的具身智能,还能整出什么花活来?

与展台上的热闹相比,业界则展现出一种审慎的冷静。在由面壁智能主办的“智在终端,惠及千行”端侧AI创新与行业发展论坛上,记者采访了面壁智能联合创始人、首席科学家刘知远认为,尽管具身智能行业已经有400-500家企业,但具身智能仍处于前沿探索期,技术路线尚未收敛,行业需警惕“虚假繁荣”,“先通后专”或将是必经之路。


端侧AI是进入物理世界的关键支撑

人工智能正加速从“数字世界”走向“真实世界”,而端侧AI正是这一进程的关键支撑。

北京智源人工智能研究院联合端侧实验室发布的《端侧智能2026——规模化落地元年》报告指出,2026 年端侧智能正从概念验证迈向规模落地,产业化拐点已然到来。

《报告》指出,囿于成本、时延、隐私三大约束,大模型正经历第二次结构性跃迁:从以云端为唯一算力中枢的单点智能,走向端云分工、协同共生的分布式智能系统,端侧AI由此成为产业焦点。


“2026年是端侧AI规模化落地的元年。面壁智能的定位很清晰——做普惠千行百业的大模型基座:以技术引领做深底座,以产业推动做实场景,以生态共建做大未来。”面壁智能CEO李大海判断认为。

数据显示,截至2026年6月30日,面壁智能MiniCPM开源模型系列累计下载量突破3800万次,覆盖文本、视觉、语音全模态。基于“密度定律”技术路线,MiniCPM已落地手机、汽车、具身智能、航天等多元终端,并已搭载于吉利银河M9 、长安马自达EZ-60等车型的智能座舱。

记者了解到,在端侧AI论坛上,面壁智能继续拓展技术边界,发布两款重量级端侧大模型产品。

MiniCPM5-2B端侧文本大模型,仅 20 亿参数,却在综合知识、数学推理、代码、指令遵循和智能体能力上均做到同尺寸领先,在AA榜单中位列 2B 以下模型第一。

VLA具身模型,以通用智能为起点,让机器人能够直接处理普适、长程、流水线式任务。该模型融合多模态技术沉淀与视觉Token极致压缩能力,在保留完整历史观测记忆的同时,计算量与不保留记忆时持平,在机器人上下文记忆基准上取得显著优势。

警惕“Demo繁荣”,回归基座泛化能力

今年WAIC期间,具身智能的进化再度让人惊喜。不少机器人“上得厅堂下得厨房”,能进工厂能搬货,展现出未来的无限可能。

不过,业内专家也提出了冷思考。有专家认为,行业展示的具身智能Demo,多为针对特定场景微调的“专家模型”。这些 Demo 虽视觉效果佳,但缺乏基础泛化能力,并非领域真实进度的体现。


面壁智能学术合伙人、多模态智能首席科学家姚远在接受记者专访时坦言,面壁智能短期内的策略并非快速推出场景化 Demo,而是致力于打磨基础数据、Infra 工程链路及模型的泛化基座:“通过提升模型的基础能力,许多场景应用将迎刃而解,这是一种更本质但见效较慢的路径。”姚远认为,过早追求特定场景的微调落地可能是一种“干扰”,容易导致虚假繁荣。

那么具身智能3-5年后的中期发展会是怎样一种光景呢?刘知远提出了一个鲜明的判断:具身智能必将遵循“先通后专”的发展模式。这有些类似于大学的通识教育和专业教育。他以人类学习类比:“通用人工智能的核心逻辑是先具备关于世界的常识,即感知与思考,再学习专业技能,即行动。如同人类先有十几年的世界交互经验,才能快速学会开车。相比之下,仅依靠专用数据训练单一能力的路线已触及天花板,无法解决长尾问题。”他认为,未来具身智能的竞争,不是单纯的数据竞赛或场景卡位战,而是一场关于“世界常识”基座构建的马拉松。

当谈及商业化节奏时,刘知远提供了一个极具参考价值的成熟度评估框架。他认为,应将具身智能置于“端侧智能”的大范畴内考量,模型需兼具感知、思考决策与行动三大能力。

“目前,语言模型的成熟度最高,多模态感知成熟度约 70%-80%,而行动模块尚处早期,成熟度可能不足 40%。”基于此,刘知远指出,商业化落地需与技术成熟度紧密贴合。当前阶段,通过感知与决策的闭环,在车载内外感知等场景已展现出广阔前景,而涉及复杂物理行动的具身应用则相对靠后。

姚远进一步补充了面壁智能的策略选择。“我们的策略是专注技术本身的增长,待基础模型实现质变后,应用场景将自然涌现。“他说,企业希望确保商业信号真实反映技术实力,而非为了短期落地而扭曲技术路线。”

原标题:《WAIC观察:具身智能仍处于前沿探索期,“先通后专”是发展方向》