跳转至

WALL-OSS

WALL-OSS 是一个用于具身智能的开源基础模型,由 XSquare Robot 团队于 2025 年提出。LeRobot 的实现改编自他们的开源 WallX 仓库。

X Square Robot 的 WALL-OSS 现已集成到 Hugging Face 的 LeRobot 生态系统中。这是 LeRobot 和 X Square Robot 团队之间令人兴奋的合作项目。您现在可以直接通过 LeRobot 对 WALL-OSS 进行后训练、评估和部署。通过这一集成,我们旨在让开源机器人社区更容易定制和部署 WALL-OSS 基础模型。阅读和探索 WALL-OSS 论文代码

模型概述

WALL-OSS 团队正在构建具身基础模型,以捕获和压缩世界上最有价值的数据:物理交互的连续、高保真流。通过在模型的决策和身体的实际体验之间创建直接的反馈循环,实现了真正可泛化智能的涌现——这种智能不仅理解世界如何运作,还知道如何在其中有效行动。

WALL-OSS 概述

从技术上讲,WALL-OSS 引入了一种紧密耦合的多模态架构(紧密耦合的 MoE 结构),集成了离散和连续动作建模策略。通过两阶段训练流程(启发 → 整合),模型逐步统一语义推理和高频动作生成。其核心创新包括:

  • 具身感知增强的多模态预训练:在统一的视觉-语言-动作数据上进行大规模训练,以增强空间、因果和操作理解。
  • 统一跨层级思维链(Uni-CoT):一个单一的可微框架,统一了高层指令推理、子任务分解和细粒度动作合成,形成从"理解"到"执行"的连续链。
  • 混合专家(MoE)动作头:根据任务阶段动态激活专家,在离散或连续空间中建模动作,以保持稳定的 VLM 先验。
  • 两阶段训练范式
  • 启发阶段:注入离散动作先验以增强空间理解和语义-动作对齐。
  • 整合阶段:使用流匹配实现高频连续控制。

安装要求

  1. 按照我们的安装指南安装 LeRobot。
  2. 通过运行以下命令安装 WallX 依赖项:
pip install -e ".[wallx]"

使用方法

要在 LeRobot 中使用 WallX,请将策略类型指定为:

policy.type=wall_x

训练

对于 WallX 的训练,您可以使用标准的 LeRobot 训练脚本和适当的配置:

lerobot-train \
    --dataset.repo_id=your_dataset \
    --policy.type=wall_x \
    --output_dir=./outputs/wallx_training \
    --job_name=wallx_training \
    --policy.repo_id=your_repo_id \
    --policy.pretrained_name_or_path=x-square-robot/wall-oss-flow \
    --policy.prediction_mode=diffusion \
    --policy.attn_implementation=eager \
    --steps=3000 \
    --policy.device=cuda \
    --batch_size=32

训练参数

参数 描述
--dataset.repo_id 训练数据集的 Hugging Face Hub 仓库 ID(例如,lerobot/aloha_sim_insertion_human
--policy.type 指定使用 WallX 策略架构
--output_dir 保存训练检查点和日志的本地目录
--job_name 此训练运行的名称标识符(用于日志记录/跟踪)
--policy.repo_id 训练模型将被推送到的 Hugging Face Hub 仓库 ID
--policy.pretrained_path 用于初始化的预训练 WallX 权重路径(官方 WALL-OSS 检查点)
--policy.prediction_mode 动作预测策略:diffusionfast - diffusion 使用迭代去噪进行动作生成,fast 使用下一个 token 预测
--policy.attn_implementation 注意力实现后端 - eager 使用标准 PyTorch 注意力(替代方案包括 flash_attention_2sdpa
--steps 要运行的训练步数总数
--policy.device 训练设备(cuda 用于 GPU,cpu 用于 CPU)
--batch_size 每个训练批次的样本数

许可证

该模型遵循 Apache 2.0 许可证,与原始 WallX 仓库一致。