字号:

机器人评测榜单基础教程(理解阶段)

定位:只讲理解,不做取舍。
读完能说清:一个榜单在测什么能力、跑在什么条件下、成绩单怎么看、它没测什么。
接不接、怎么接,是理解清楚之后下一步才谈的事。

一页速览 · 先记住这 5 条

  1. 榜单拆开是四个零件:任务集、引擎 × 本体、指标 × 基线、harness,先看清这四个再看分数(报分时的署名简写见第 7 章)。
  2. 先从 LIBERO 看起:它是例子最多的一个,适合当作理解榜单的样板。
  3. 本体或引擎不同,分数不能直接比:先理解各自在测什么。
  4. 每个榜单都有覆盖不到的地方:看懂“它没测什么”和看懂“它测什么”同样重要。
  5. humanoid.guide 是资料整理不是榜:没有统一任务和判分,先当资料集用。

阅读指南:


1 · 为什么需要榜单

没有榜单时,机器人评测是「各说各话」:A 团队说抓取成功了,B 团队说叠衣成功了,但任务难度、初始条件、成功判定全不一样,结论无法比较。榜单的作用就是把这些变量冻结成一份公开协议,让不同模型站在同一条起跑线上。

给工程师的类比:榜单 ≈ 驾考科目二。库位尺寸、压线规则、扣分标准全部写死。它不等于真实路况,但先看懂“考什么、怎么判”,后面才知道分数说明了什么。仿真榜单就是 VLA 模型的科目二,真机是上路——两科考的东西不一样。


2 · 榜单的四个零件

声明:“四个零件”是本教程自定的拆法,不是业界划分。社区只有 task suite / simulator / embodiment / metric / baseline / harness 等散词,没有统一的“四”说法。这里统一用“本体”(= 机器人 / embodiment,对齐仓库 02-技术篇大表列头)。

任意榜单拆开都是四样东西。读榜单时按这个顺序检查,5 分钟就能看懂它在测什么。(报分时的署名简写见第 7 章。)

零件 1任务集:考哪几道题、共多少题、难度怎么分档
零件 2引擎 × 本体:哪个仿真器 + 哪台机器人(什么构型)
零件 3指标 × 基线:看什么数、代表基线是多少、判读线在哪
零件 4harness:成绩是怎么跑出来的,种子轮数版本锁了什么

速查口诀:拿到一个榜单先问四句——考哪几道题?跑在哪个引擎 + 哪台臂上?指标和基线是什么?成绩是怎么跑出来的?四句答全了,就是看懂了。下面第 3 章 LIBERO 卡就是这四行的实例版,对着看。


3 · 榜单逐个看:11 个平级对照

这一章把 11 个放在同一层对照着理解:每个在测什么能力、跑在什么条件下、成绩该怎么看。LIBERO 排第一个当样板,后面 10 个同一格式对照。每卡四行重点(任务集 / 引擎 × 本体 / 指标 × 基线 / harness),下面小字是补充。先看懂,不做取舍判断。

榜单一句话理解重点
LIBERO通用操作 · 例子最多四套件测哪几种泛化——样板,先看透它
ManiSkill精密装配容差与预筛是怎么回事
RoboCasa-365难度分档范本三档难度与子任务标注
RoboDojo仿真+真机对照任务覆盖面怎么列
BEHAVIOR-1K判分与效率谓词判分 + 效率分思想
CALVIN / SimplerEnv / RoboBench / RoboTwin / harness / humanoid.guide各有侧重链长 / 相关性 / 脑力单列 / 双臂 / 跑榜工具 / 三无反面,见下卡

LIBERO — 通用桌面操作(MuJoCo · 130 题 · 50 回合 × 固定种子)

样板卡:这一卡就是第 2 章四个零件的实例版,看懂这卡四零件就懂了。
零件 1 · 任务集5 套共 130 题:Spatial 10 / Object 10 / Goal 10 / Long 10(即 LIBERO-10)/ LIBERO-90。VLA 常考前四套共 40 题。下面逐套拆开,每套的 10 道题都列出来。

Spatial 10 —— 同一个碗,换着地方放(测空间泛化):10 题全是“拿起黑碗放盘子上”,唯一变化是碗的起始位置。题单:盘子和奶盅之间 / 奶盅旁边 / 桌子中央 / 饼干盒上 / 木柜顶层抽屉里 / 奶盅上 / 饼干盒旁 / 炉子上 / 盘子旁边 / 木柜顶上。看懂这套就懂“空间泛化”:模型认得碗,但摆位一换还能抓准吗。

Object 10 —— 同一个动作,换着东西抓(测物体泛化):10 题全是“拿起某样东西放篮子里”,唯一变化是抓什么。题单:字母汤 / 奶油奶酪 / 沙拉酱 / 烧烤酱 / 番茄酱 / 番茄汁 / 黄油 / 牛奶 / 巧克力布丁 / 橙汁。看懂这套就懂“物体泛化”:动作没变,没见过的包装还能认吗。

Goal 10 —— 同一张桌子,换着指令做(测意图泛化):场景都是抽屉柜+碗+盘子+酒瓶,10 道题各不相同:开中间抽屉 / 把碗放炉子上 / 把酒瓶放柜顶 / 打开顶层抽屉并把碗放进去 / 把碗放柜顶 / 把盘子推到炉子前 / 把奶油奶酪放碗里 / 打开炉子 / 把碗放盘子上 / 把酒瓶放酒架。看懂这套就懂“意图泛化”:同一堆东西,换句话还知道干什么吗。

Long 10(= LIBERO-10)—— 一次五六步串起来(测长程):10 道长程题,每题都是组合动作:两种汤都放篮子 / 奶酪加黄油都放篮子 / 开炉子并放上摩卡壶 / 黑碗放进底层抽屉并关上 / 白杯放左盘、黄白杯放右盘 / 拿起书放进收纳盒后格 / 白杯放盘上、布丁放盘右 / 两种汤奶酪都放篮子 / 两个摩卡壶都放炉上 / 黄白杯放进微波炉并关门。VLA 常考 40 题就是上面四套相加。

LIBERO-90 —— 90 道题海(一般不进常规跑分):按场景分组,厨房约 46 题(开关抽屉/碗进抽屉/摩卡壶上炉/煎锅摆位等)、客厅约 28 题(各种汤奶酪牛奶放篮子/托盘、杯子摆盘、碗叠放等)、书房约 16 题(书放收纳盒前/后/左/右格、杯子放收纳盒右等)。它是预训练题海,常规跑分只看前面 40 题。注意口径:LIBERO-100 = 90 + 10(Long)。

补充:每任务 50 条人工示范,BDDL 定义初末态。题单转述自上游 libero_suite_task_map(2026-09-18 实抓),中文为意译方便理解,英文原名为准。难度无数字等级,以四种分布偏移切档。

零件 2 · 引擎 × 本体Robosuite + MuJoCo × 单臂 Franka Panda + 平行夹爪

补充:观察是第三视角 RGB + 腕部 RGB + 本体感知 + 一句英文指令;动作 7 维末端增量 + 夹爪。记住:换引擎或换臂,分数就不能直接比。

零件 3 · 指标 × 基线只看成功率,每题跑 50 次;先看 4 个套件分,再看四套件均值

分母先讲清:每道题跑 50 次,成功次数 ÷ 50 = 这道题的成功率;一个套件 10 道题取平均 = 套件分;Spatial / Object / Goal / Long 四个套件分再取平均 = 报道最多的那个“均值”。所以一份 LIBERO 成绩单正常是 5 个数:4 个套件分 + 1 个均值,只报一个数就是耍流氓。

刻度一:单套件 90% 算可用。意思是这 10 道题平均下来 10 次里能成 9 次。低于 90%,说明这一种泛化(空间 / 物体 / 意图)还没过关,模型是“偶尔能做”,不是“稳定能做”。上线之前至少要过这条线。

刻度二:四套件均值 95% 算跟上 SOTA。参考锚是 OpenVLA-OFT 约 97%(四套件均值,单套件基本都在 95% 以上)。你的均值到 95%,意思是和当前第一梯队差 2 个点以内,算跟上了;93% 以下就是还有代差,别只看某一个套件高就宣布胜利。

刻度三:Long 低于 90% 就是长程不行。Long 是 10 道五六步的组合题,一步掉链整题判失败,所以它天然比前三个单步套件低 5–10 个点。如果前三个都过了 90% 唯独 Long 掉到 80% 出头,结论很明确:单步能力可用,长程组合不行,问题在记忆和多步规划,不在抓取本身。这时候去加单步数据没用,得补长程示范。

举个例子:Spatial 92% / Object 91% / Goal 90% / Long 84%,均值约 89% —— 读法是“前三刚过可用线,长程掉链,均值被 Long 拖累,还没摸到 95% 的 SOTA 线”。一句话:哪一档掉,一眼就知道短板在哪。

补充:LIBERO-Pro 是另一层加试(6 个扰动套件,测加扰动后掉几个点 gap),别和标准分混在一起。种子冻结为 7,每任务 50 次是本仓口径,上游论文多用 50 episode × 固定种子,跨论文对比先对齐轮数。

零件 4 · harnessserve → run → merge 三步出成绩单;冻结种子 7、每任务 50 次、等待 10 步

补充:按 configs/benchmarks/libero_spatial.yaml 跑榜。看不懂命令没关系,记住“成绩是机器按固定流程跑出来的,不是手填的”就行。

ManiSkill — 接触丰富型任务(SAPIEN · PegInsertion 2–3 mm · 预筛机制)

零件 1 · 任务集主考 TableTop 双指 21 题 + Control 9 题,其余小套件各 2–5 个

补充:例 PickCube / PegInsertionSide / PlugCharger / AssemblingKits 等;软体 Excavate / Pour / Pinch 仍在 ManiSkill2 未完全迁入 v3。无 easy/hard 档,以随机化 + seen/unseen 双列切档。细分数字低置信待补论文号。

零件 2 · 引擎 × 本体SAPIEN × 20+ 本体(Franka / UR5e / xArm / Fetch / H1 / Shadow Hand,robot_uids 可换)

补充:观察 state / rgbd / pointcloud(视觉剔真值);动作末端或关节增量 + 夹爪。桌面默认 50 步(PlugCharger 200 步等),控制类 600/1000 步(步数低置信)。代码资产注意 BY-NC 许可。

零件 3 · 指标 × 基线二值成功率(销全插入 / 距目标 2.5cm 内)+ dense reward 辅助;基线 PickCube PPO 约 100%、PegInsertion BC 约 40–60%

补充:只认同版本同 obs/control 同 seed 下 seen/unseen 双列。预筛思想:先过容差门槛再谈成功率。

零件 4 · harnessgym.make + download_asset/demo + Task Card 检测器 + reset(seed)

补充:种子轮数 / 版本锁未验证,只认 v1 版本化与 Task Card 徽章。

RoboCasa-365 — 生成式厨房任务(365 任务 · 三档难度 · 子任务标注)

零件 1 · 任务集365 个厨房任务:65 原子 + 300 复合长程,榜单目标 50 任务三档平均

补充:其中 220 要导航、145 原地;2500 套场景,3200+ 物体。难度按见过与否 × 长短递增:Atomic-Seen < Composite-Seen < Composite-Unseen。50 = 18/16/16 切分仓库无出处,已删。

零件 2 · 引擎 × 本体RoboSuite + MuJoCo × Franka + Omron 移动底座(亦支持人形)

补充:观察 RGB/D + 本体感知 + 自然语言指令;动作末端增量 + 夹爪 + 底座速度。全多步长程复合。

零件 3 · 指标 × 基线整题成功率 + 子任务完成率双披露;SOTA Xiaomi-Robotics-1 总分 57.4(三档平均 80.2 / 57.1 / 32.1)

补充:基线 GR00T N1.5、pi0、Diffusion Policy。除榜首外 Composite-Unseen 普遍低于 10%。

零件 4 · harnessgym.make 指定 split / seed + 内建 success check + 投榜审核合并

补充:v1.0.1 冻结 horizon,旧数字失效,跨版本不可比。

RoboDojo — 仿真与真机任务对照(42 仿真 + 18 真机:3 种双臂 × 各 6 题)

零件 1 · 任务集42 仿真基任务(泛化 12 + 记忆 6 + 精密 8 + 长程 8 + 开放 8)+ 18 真机任务(3 平台 × 各 6 题 × 10 次 = 180 trial)

补充:无显式易中难档,以五维剖面 + random 变体 + 三 seed 实现难度。“54 配置”说法仓库无出处,已删。

零件 2 · 引擎 × 本体Isaac Sim 5.1 + IsaacLab 2.3 × ARX X5 / Piper / Piper X 三构型

补充:观察头相机 + 左右腕 RGB(depth 默认关,5Hz);动作默认末端 ee。注意非商业许可边界。导航移动、灵巧手触觉全无。

零件 3 · 指标 × 基线仿真行看成功率 + 总 Score,仿真最强约 8.8%(人类 76.03%);真机行看分数,最强约 22.9 分 / 12.8%——量纲不同不直接比

补充:基线为 XPolicyLab 接入 20+ 策略。SOTA 仅 20% 量级、总分不足 30,说明故意做难。

零件 4 · harnessrobodojo.sh eval 单任务自检 → 全量 benchmark → summarize 聚合出榜

补充:锁任务集 + 种子轮数 + 逐任务 _result.json,官榜只认云端 pipeline 提交并做 anti-cheating 校验。

BEHAVIOR-1K — 大量日常活动(OmniGibson · 1000 活动 · BDDL)

零件 1 · 任务集单套件 1000 个日常活动(50 场景、9000+ 物体;BEHAVIOR-100 为 100 题先行子集)

补充:BDDL 定义初末态、无限随机初态,例 CleanTable / CollectTrash。多步长程动辄几十步。无官方 Easy/Hard,难度来自谓词数 / 步数。

零件 2 · 引擎 × 本体OmniGibson × 移动臂(Fetch / Tiago / Franka + 底座)

补充:观察 RGB-D / 本体 / 场景图;动作底层关节 + 底座速度、上层 navigate / pick / place 原语。max_steps / 动作维数未验证。

零件 3 · 指标 × 基线Q = 目标谓词满足比例(Q=1 才算成功)+ 效率分(导航距离 / 仿真时间 / 运动扰乱)

补充:基线端到端 RL 约 0%,加原语约 40–70%。只报成功率虚高,必须同时看 Q 分布 + 三效率。

零件 4 · harnessbehavior_env_demo.py 点亮 + BDDL 采样评测

补充:种子轮数未锁,不宜当日报分。

CALVIN — 长程连续任务(Franka + PyBullet · 34 任务 · 链长 5)

零件 1 · 任务集34 个原子任务,单场景单套件;评测 MTLC(34×10)+ LH-MTLC(1000 条 × 5 连指令,错一步即断)

补充:例开/关抽屉、推/拉滑门、按按钮、叠块。划分在房间侧:D 单房、ABC→D 零样本、ABCD→D 全量。无显式难度档,难度由链长 1→5 自然分档。

零件 2 · 引擎 × 本体PyBullet 30Hz 闭环 + EGL 渲染 × 自由臂 Franka + 平行夹爪

补充:观察静态 RGB-D + 腕部 RGB-D + 触觉 + 本体可组合;动作笛卡尔 6D + 夹爪或关节三选一。单子任务步上限约 360 步(低置信)。

零件 3 · 指标 × 基线MTLC 成功率 + LH-MTLC 链长 Avg.Len(0–5);基线 HULC 约 2.64、RoboFlamingo 全量约 4.08

补充:判读线 Avg.Len 3 以下入门、3 以上为好,全量与零样本差 <0.5 视为真泛化。

零件 4 · harnesstraining.py + evaluate_policy.py,自研模型经 --custom_model 挂入

补充:锁每链前回中立位复位、代码内成功检测器、1000 链评测种子;须另记 commit 与渲染模式。

SimplerEnv — 仿真与真机排名对照(MMRV ≈ 0.056 · Pearson ≈ 0.924)

零件 1 · 任务集2 套件 10 主任务:Google 套 6 项(拿可乐罐 / 开抽屉 / 放抽屉等)+ WidowX 套 4 项(勺放毛巾 / 叠方块等)

补充:划分子变体如横/竖/立罐、顶/中/底抽屉。难度靠子任务拆分 + 评测协议加压(Visual Matching 保真 vs Variant Aggregation 多背景平均)。它测的是一致性,不是绝对强弱。

零件 2 · 引擎 × 本体SAPIEN + ManiSkill2 定制 × Google Robot 与 WidowX 双真机复刻

补充:观察 RGB + 语言指令;动作末端 delta + 夹爪(Google 3Hz、WidowX 5Hz)。horizon 按频率推算数十至数百步(未验证)。

零件 3 · 指标 × 基线成功率 + MMRV(越低越好)+ Pearson r(越高越好);代表数 Visual-Matching 约 0.056 / 0.924

补充:判读线先看 MMRV 显著低于 loss 基线且 Pearson 高,再看绝对成功率。

零件 4 · harnessimport simpler_env 做 rollout + calc_metrics.py 算分

补充:冻结弱(靠 commit + 子模块 pin,无 seed yaml)。

RoboBench — 只动脑不动臂(6092 道 QA · 纯问答)

零件 1 · 任务集6092 道问答:5 维度、14 能力组、25 任务;模型不动臂只答题

补充:细分 32 个 subtask manifest、Planning 4197 题 + MCQ 1895 题(低置信待补来源)。无显式难度档,最难点为执行级错误诊断。

零件 2 · 引擎 × 本体无本体:离线 QA,不接任何仿真器 / 真机

补充:观察 RGB / 多图 / 视频帧 + 文本指令,输出选项或结构化规划,不输出关节角。它和其他榜不在同一层,别放一起排。

零件 3 · 指标 × 基线问答准确率(Planning DAG 规划 + MCQ 选择);代表基线待补来源

补充:类比笔试和科目二——先看规划答得对不对,再看手能不能做到。

零件 4 · harness按 manifest 逐 subtask 跑问答脚本出分

补充:无 episode、无步长概念;命令与种子冻结细节未验证。许可:代码 MIT、数据 CC-BY-4.0(低置信待补来源)。

RoboTwin 2.0 — 双臂任务(SAPIEN 系 · 14 自由度双臂 · 50 题跨 5 本体 · Easy/Hard)

零件 1 · 任务集单套件 50 双臂桌面任务 × 5 本体 × 易/难两档;排名分 = (易+难)/2

补充:Easy = clean2clean,Hard = clean2random 五轴(杂物 / 光照 / 背景 / 台面高 / 语言改写)。双臂协同是招牌:handover / stack_blocks_three 等配合动作。

零件 2 · 引擎 × 本体SAPIEN 系 × 5 种双臂构型(Dual / Aloha / Piper Dual / ARX-X5 Dual / UR5 Dual)

补充:观测头顶 + 左右腕三相机 RGB + 双臂本体 + 语言指令;动作默认 14 维双臂关节归一(endpose 末端模式低置信)。许可 MIT。

零件 3 · 指标 × 基线成功率 + Easy/Hard 双列 + (易+难)/2 排名分;基线全随机设约 10–20%,半知信息可到 40–60%

补充:只认 50 题 × 2 档 × 同构型对照,不认切小题子集 / 跨构型混排 / 单 Easy 数。

零件 4 · harnessrun_task.py 单任务自检 + eval_script/ 批量评测 + run_evaluation.py 统计

补充:锁成功检测器 + 随机化范围声明 + 日志录像配置,seed 细节未验证。

评测 harness — 跑榜单的脚手架(一次适配 · 批量回归)

零件 1 · 任务集无自创题,是转接层;暂标 14 榜(本仓 vla-eval==0.4.0,仓库口径)

补充:转述曾写约 16 榜拼盘,14 vs 16 按实测镜像数二选一。难度 = 各榜自带切分,跨榜分数不可比。

零件 2 · 引擎 × 本体透传各榜条件(LIBERO 系为 Panda 7DoF 连续动作)

补充:榜单是考卷,harness 是考场:成绩单格式、环境版本、种子号这些规矩由它落地。

零件 3 · 指标 × 基线不自定指标,透传各榜指标;判读线 = 各榜判读线

补充:本仓只用 LIBERO 切片:官方 130;PRO = 拿 Spatial 真题改 5 种扰动看 gap;Plus = 另出独立 10030 题。注意坑:pro yaml 唯一可跑 suite 是 libero_pro_mug.yaml。

零件 4 · harness一次适配(adapter-v0.5 + robots 映射)后批量回归出成绩

补充:锁任务集 + 种子轮数 + 成绩单格式,版本见 vla-eval 0.4.0。

humanoid.guide — 资料整理,不是榜(只有整理 · 无统一规则 · 三无)

零件 1 · 任务集0 个可执行任务:人形机器人资料整理,不是排名

补充:新人最易误会——看到类似整理就不会误当排名引用。另注意边界:仓库 04-整机榜还有 HPS / Biped / 239 台等四家,本卡只讲 foundation-models 脑力目录。

零件 2 · 引擎 × 本体不适用:无 env-id、无 episode、无观察/动作规范

补充:前端技能过滤标签数待对齐:仓库写每模型 10 维,转述 9 标签,暂标 10 维(仓库口径)。

零件 3 · 指标 × 基线无统一判分、无统一基线(三无之二三)

补充:Skill Score 黄/灰星级无公开权重公式。判读线:任缺任务 / 判分 / 基线其一就不是榜——三无判断法。

零件 4 · harness不适用:无任务代码、无题单下载、无跑法

一句话记忆:「先看懂每个在测什么,再看它没测什么」。条件(引擎、本体)不同,分数不能直接比——这是第 4 章要展开讲的。


4 · 本体三类型:榜单是怎么分类的

声明:A / B / C 三类型是本教程自定的讲法,不是业界公认划分。业界没有“G1/G2/G3”说法,时间上也切不开(CALVIN 2021、ManiSkill 2021 比 LIBERO 2023 还早)。划分依据只有一条:榜单与本体的绑定程度。

新手最常问——「是不是每个榜单都只测某台臂?」——答案是:按本体绑定程度分三类,每类的“分数怎么看”不一样。读懂这一章,你就知道为什么条件不同、分数不能直接比。

4.1 是不是每个榜单都只针对某个本体?

不是。按本体绑定程度分三类:

类型绑定方式代表榜单分数怎么看
A · 绑死单本体单臂 + 单引擎写死LIBERO / CALVIN / SimplerEnv / RoboCasa(Franka 单臂)条件相同才能比,条件不同只对照着理解
B · 一榜多本体同一套任务协议,适配多种臂型ManiSkill(20+ 构型)、RoboTwin(5 种双臂)、BEHAVIOR(移动臂)、RoboDojo(真机 3 双臂)同榜内对照看,出榜即换条件
C · 离线不管本体只考规划不动臂RoboBench(6092 道 QA,纯问答)不排名,和操作榜不在一层

A 类为什么绑死 Franka?早期的主流榜单(LIBERO / CALVIN)把 Franka + MuJoCo / PyBullet 写进协议:运动学、夹爪、相机视角全冻结。这样不同模型的分数才有意义。但代价是——换一台臂,分数就换了条件,对照看可以,直接排名不行。

B 类怎么做到一榜多本体?ManiSkill、RoboTwin 这类把「任务定义」和「机器人驱动」解耦:同一道 PegInsertion 题,可以分别跑在 20 多种臂型上。中间靠一层适配器把任务指令翻译成各臂能执行的动作。但注意:同榜内不同臂的分数也只是对照着看,不能直接排高低——臂不一样,题的难度就变了。

记住一条:本体或引擎任一不同,分数就不能直接比。先看条件,再看分数——这是读任何榜单成绩单的第一步。

4.2 三条思路线:榜单在回答什么新问题

不按时间分代,只看各榜单分别回答了什么新问题(出现时间有先后,但无代际切分):

一句话记忆:「A 类绑死看条件、B 类多本体看协议、C 类离线不动臂」。理解了三类,再看第 6 章“榜单没测什么”的例子,就知道每个榜单的边界在哪。


5 · 通用拆解模板:看懂任意一个榜单

前面拆了 11 个榜单(都在第 3 章),手法都是同一套。以后你看到任何新榜单,照这张表填空就行——填完就是“看懂了”,填不出来就知道还缺哪块。

  1. 一句话:它测什么。一句话说清这个榜单考的是哪类能力。写不出来就还没读懂。
  2. 四零件拆解。任务集、引擎 × 本体、指标 × 基线、harness,各一段,缺哪个就标哪个缺。
  3. 七段式深读。背景 → 任务 → 指标 → 基线 → 复现成本 → 有意思的机制 → 它没测什么。最后一段最重要:边界在哪。
  4. 理解验收。合上笔记能回答四个问题:测什么能力、在什么条件下测、成绩单怎么看、它没测什么。答全了就是看懂了。

填空示例 · 以 ManiSkill 为例:测什么:接触丰富型精密装配。任务:PegInsertion 2–3 mm 间隙。条件:SAPIEN 系。指标:成功率 + 装配容差,带预筛门槛。没测什么:通用桌面泛化、长程组合。


6 · 例子:榜单没测什么

以 LIBERO 为例:它考的是通用桌面操作,但有三类能力它覆盖不到。看懂“没测什么”,和看懂“测什么”同样重要——这也是第 3 章每个卡片都写“它没测什么”的原因。

例子哪类能力LIBERO 为什么没覆盖
拧螺丝精密装配:2–3 mm 容差对准与力控LIBERO 是粗抓泛化,没有容差门槛——对照 ManiSkill 的 PegInsertion 看
叠衣柔性体:布料折叠的形状保持LIBERO 全是刚体操作——对照 RoboDojo 的任务覆盖看
上下料节拍与稳定:连续取放的节拍一致性LIBERO 只看成功不看快慢——对照 BEHAVIOR 的效率分看

看懂边界的方法:难度怎么分档(对照 RoboCasa 三档)、子任务怎么拆(对照 RoboCasa 标注)、成功判定是不是机器可判(对照 BEHAVIOR 谓词)。


7 · 成绩单怎么看:四条提醒

仿真成绩最容易「看起来很好」。读任何成绩单时,先看这四条弄清它的含义。

  1. 条件署名:报分时只写四零件中决定复现的四项:任务 × 引擎 × 本体 × 指标(基线 / harness 版本号进附录)。条件不同,分数不能直接比。展开见第 2 章。
  2. 环境版本 + 种子号:看成绩单有没有写环境版本和种子号。只跑 1 个种子的数,波动可能很大。例外:本仓库 configs/benchmarks/libero_spatial_sawyer.yamlepisodes_per_task: 1,那是跨本体探针(只看能不能跑通),不是正式成绩。
  3. 训练和验收分开:调参时看的数和验收时报的数是不是同一批。混在一起的数先打个问号。
  4. 分层看:先看“能不能跑通”,再看“正式成绩”,小样本探针类的数只供参考。三层别混在一起读。

覆盖面例子:5 × 13 × 5 热力图(so101-mujoco sweep 格子,非 LIBERO 通用格子——指 scripts/eval_mujoco_policy.py--sweep: 5 reach × 13 azim × 5 trials = 325 episodes)。5 类技能 × 13 种场景 × 5 种扰动 = 325 格。先理解“格子是怎么定义的”,再看“哪些格子通过率高、哪些是 0%”——格子没定义清楚,数出来也看不懂。


8 · 学完之后做什么

三个理解练习:

  1. 照第 5 章模板,给任意一个榜单填一页拆解笔记。
  2. 找一份 LIBERO 成绩单,指出它的条件署名(任务 × 引擎 × 本体 × 指标)和种子号。
  3. 挑第 6 章的一个例子(比如拧螺丝),说清它考的能力和 LIBERO 的边界差在哪。

阅读顺序:先有直觉(第 1–2 章)→ 逐个理解 11 个榜单(第 3 章)→ 理解分类(第 4 章)→ 学会拆解任意榜单(第 5 章)。理解清楚了,接不接、怎么接,是下一步才谈的事。


版本注:本页细节来自 oh 在 D49–D59 的「能力范围细化」追评(2026-09-16)与「四维度」追评(2026-09-17 06:45–06:46 UTC,第 3 章 11 卡已按后者重写为任务集 / 引擎×本体 / 指标×基线 / harness 四段,LIBERO 排第一当样板);#64 的 7 处事实补丁(LIBERO-Long / Pro 6 yaml / RoboCasa 365 / RoboTwin SAPIEN / Xiaomi 三档平均 / 跑法示意注 / 325 sweep 注)已同步。#65 实评(2026-09-17)已合入:RoboDojo 拆仿真 8.8% / 真机 22.9 分、harness 暂标 14 榜(vla-eval==0.4.0)、humanoid 暂标 10 维、三考卷口径以 02-技术篇大表为准、低置信数字标待补来源。未验证项如实标出,复核见各 Discussion 原帖。