SO-101 ACT(仿真 + 真机混训,抓方块放料箱)

从随机初始化训练的 ACT(Action Chunking Transformer),52M 参数。 训练集是仿真与真机混成的一份:仿真产线自动产出的 498 集 + 公开的 SO-101 真机遥操 300 集 = 798 集 / 273,889 帧 / 1 个任务。

两侧的指令文本逐字相同(Pick up a cube and place in the bin),落在同一个任务号下 —— 这是它们能混成一份的前提。要逐项对齐的九项(动作口径、臂关节单位、夹爪单位、相机键名、 分辨率、控制频率、视频编码、robot_type、指令文本)见第10讲 3.2.3。

验收

同一仿真场景 50 局:**成功率 76.0%**,avg_max_reward 0.822。

训练途中每 10000 步评 10 局:40 → 70 → 80 → 80 → 90%。别照最后那个点读 —— 10 局的分辨率只有 10 个百分点,出结论要另跑足量的一轮。

训练

50000 步 × batch 64 ≈ 11.7 个 epoch,单卡。图像归一化用数据集自己的统计量而不是 ImageNet (渲染图的色彩分布离自然照片更远)。算法、网络、超参与 LIBERO 那条线完全一致 —— 动作维度、状态维度、相机路数都由数据集自己的 features 描述决定。

相关

Downloads last month
18
Safetensors
Model size
51.7M params
Tensor type
F32
·
Video Preview
loading