您现在的位置是:百科 >>正文
行业首个具身原生世界动作模型来了!蚂蚁灵波发布LingBot
百科3965人已围观
简介7 月 10 日,蚂蚁灵波发布业界首个具身原生世界动作模型 LingBot-VA 2.0。该模型的发布,标志着机器人基础模型正式从“基于数字世界模型构建”到“面向物理世界原生设计”的关键转变。它代表了 ...
7 月 10 日,行业蚂蚁灵波发布业界首个具身原生世界动作模型 LingBot-VA 2.0。首个世界该模型的具身发布,标志着机器人基础模型正式从“基于数字世界模型构建”到“面向物理世界原生设计”的原生关键转变。它代表了具身智能发展的动作一种关键路线选择:机器人“大脑”不再依托数字世界模型能力的“嫁接”,而是模型蚂蚁从动态建模、因果预测、灵波实时执行等与环境交互的发布原始需求出发,进行原生设计。行业
得益于具身原生架构,首个世界LingBot-VA 2.0在真机测试中表现出了出色的具身执行速度和泛化能力。以下面这个视频为例,原生在不依赖任何外部拍摄设备的动作情况下,机器人就可以完成与人类的模型蚂蚁多轮随机对打。
今年以来,世界模型与具身智能怎么融合一直是各方关注的焦点。以终为始,从物理世界的“控制执行”需求出发,就需要持续符合因果规律的“预测能力”。机器人要面对的是一个连续变化的真实世界,不仅要针对当前情况作出反应,还要理解一个动作会引发怎样的环境变化,并据此决定下一步动作。当前行业主流路线大多依托面向数字内容创作的视频生成模型,再通过微调的方式适配机器人控制任务。
然而内容创作和机器人控制有着不同的出发点,内容创作更在意画质和创意,机器人控制则更在意执行效率和预测的合理性。上述这些不同导致数字世界的视频模型和物理世界的视频动作模型在设计之初就有各自的能力侧重点,强行‘微调’把前者适配成后者会带来知识遗忘、泛化性下降等副作用。
LingBot-VA 2.0选择直面问题,探索一条更艰难的路——基于自回归架构从头开始预训练,通过四大核心设计构建原生基模。
首先,模型引入语义视觉-动作分词器(Tokenizer)作为全新的视觉编码器,在视觉压缩过程中加入了语义与动作信息的对齐,使模型在后续的训练中更容易把“理解指令”转化为“完成动作”,有助于指令跟随与提升动作精度。其次,模型采用严格的因果预训练范式,让模型从训练一开始就使用自回归架构,确保视觉预测和动作生成完全遵循单向时间顺序。第三,引入 MoE 架构,在不牺牲推理效率的前提下有效扩大了模型容量,在性能和效率之间取得平衡。最后,通过增强的异步推理机制实现实时闭环控制,在机器人执行动作的同时预测未来状态,并利用最新真实观测不断校正下一步决策。基于这些设计,在行业普遍面临的具身世界模型执行效率低这一问题上,LingBot-VA 2.0给出了单卡150Hz实时推理效率的答卷。
从“干活”的角度出发,机器人需要“看的更清楚”“想的更明白”“干的更利索”。本周,蚂蚁灵波已经连续发布和开源了多款模型,包括:面向空间感知的LingBot-Vision和 LingBot-Depth 2.0、面向“一脑多机”的动作模型LingBot-VLA 2.0、面向实时交互的 LingBot-World 2.0 和面向更高推理效率的视频生成基模 LingBot-Video。上述模型代表着蚂蚁灵波在持续探索具身原生需要的细分方向能力,而 LingBot-VA 2.0 作为集大成者扮演了收官之作的角色,也正式开启了具身原生新阶段。
蚂蚁灵波CEO朱兴表示,一方面灵波将持续探索具身智能新上限,另一方面也将加速构建开放的技术生态和场景生态,助力机器人加速走向产业场景。
据悉,蚂蚁灵波将于 7 月 17 日至 20 日在 2026 世界人工智能大会(WAIC)期间,全面展示全栈大脑 2.0 落地场景的能力。观众可前往上海世博展览馆(H3-B302、H1-C701展位)进行现场体验。
Tags:
相关文章
缓冲垫尚厚,“零售之王”招行为何转攻为守?|透视金融业年报④
百科招商银行一直被誉为银行业的明星,尤其是其“零售之王”的称号令众多银行羡慕。在存款定期化和行业利差降低历史新低的双重夹击下,这家明星银行的2023年财报是否依然能交出亮丽的成绩单?2024年3月25日晚 ...
【百科】
阅读更多RTX5080成50系最受欢迎显卡 销量数据领跑全系
百科近日据德国零售商Mindfactory 2026年第八周显卡销售数据显示,RTX 5080已成为RTX 50系列中最受欢迎的型号,单周销量95块。这一变化源于NVIDIA调整供应策略,此前该卡的市场热 ...
【百科】
阅读更多中國投資人搶進台灣創業市場|天下雜誌
百科和內地創投行業鋪天蓋地的項目和投資人相比,台灣的情況顯得有些寡淡。現在,內地的互聯網公司開始排隊進入這個市場了。 ...
【百科】
阅读更多