评测成绩#

RPent 排行榜

评测成绩

环境

LIBERO-PRO

方法成功率
Codex / GPT-6 Astra / low / reasoning[4]92.63%
Claude Code / Opus-4.7 / max.reasoning82.4%
Codex / GPT-5.5 / xhigh / reasoning75.13%
RPent Flash Mode[2]72.63%
Qwen3.6 27B / no-reasoning70.63%
ASPIRE[1]61.36%
π_RLinf50.0%
π0.511.0%
AtomVLA6.3%
X-VLA3.8%
MolmoAct1.5%
π00.3%

* GPT-6 Astra: 92.63% (741/800). RPent Flash Mode / Molmo2-8B: 72.63% (581/800). Qwen3.6 27B / no-reasoning: 70.63% (565/800).

完整方法与分项成绩

方法总体Spatial TaskSpatial SwapObject TaskObject SwapGoal TaskGoal SwapLong TaskLong Swap
GPT-6 Astra[4]92.63%100%98%100%99%88%99%85%72%
Opus-4.7 / max.reasoning82.4%————————
GPT-5.575.13%81.0%69.0%94.0%91.0%75.0%66.0%70.00%55.00%
RPent Flash Mode / Molmo2-8B[2]72.63%79.00%70.00%86.00%93.00%74.00%65.00%60.00%54.00%
Qwen3.6 27B / no-reasoning70.63%82.00%78.00%83.00%84.00%68.00%68.00%61.00%41.00%
ASPIRE[1]61.36%60.0%51.0%95.0%98.0%45.0%81.0%38.3%22.6%
π_RLinf50.0%42.0%59.0%71.0%78.0%45.0%42.0%49.0%14.0%
π0.511.0%1.0%20.0%1.0%17.0%2.0%38.0%1.0%8.0%
AtomVLA6.3%1.0%16.0%0.0%10.0%11.0%2.0%9.0%1.0%
X-VLA3.8%0.0%0.0%8.0%2.0%9.0%1.0%10.0%0.0%
MolmoAct1.5%0.0%0.0%0.0%6.0%0.0%0.0%6.0%0.0%
π00.3%0.0%0.0%0.0%2.0%0.0%0.0%0.0%0.0%
Cap-X—14.0%12.0%18.0%22.0%17.0%26.0%——
RPent / GPT-6 Motor Only[3]———————38.0%—
RATS—31.0%29.0%63.0%61.0%36.0%43.0%——

* [1] ASPIRE:Long Task 和 Long Swap 使用 LIBERO-90 技能库进行 zero-shot 迁移。

* [2] RPent Flash Mode 使用直接下载的、官方公开的 GPT-5.5 explore memory;Molmo2-8B 用于视觉定位。该测试结果使用了 s0-s9 中表现最好的 seed。

* [3] RPent / GPT-6 Motor Only 为纯电机控制方法,通过 execute_action 直接输出末端位姿增量与夹爪指令,不调用 VLA / primitive,不加载 memory。

* [4] GPT-6 Astra(使用 memory 的配置):Long Task/Swap 与其余六套件使用各自探索后冻结的 memory 文件快照,评测期间不更新。Overall 合并两个不重叠批次:Long 157/200,加上其余套件 584/600,得到 741/800(92.63%);并非全部回合共享同一份 memory 快照。

LIBERO

方法成功率
AtomVLA97.0%
Claude Code / Opus-4.7 / max.reasoning96.0%
π_RLinf95.3%
π094.2%
NORA79.5%
OpenVLA76.5%

RoboCasa365 · Target50

方法成功率
Codex / GPT-6 Astra / low / reasoning59.20%
Xiaomi-Robotics-157.4%
Codex / GPT-5.5 / xhigh / reasoning57.1%
Claude Code / Opus-4.7 / max.reasoning48.6%
WorldDreamer35.3%
RLDX-130.0%
π0.516.9%
π014.8%

RoboCasa365 · Target50 · 完整方法与分项成绩

方法总体Atomic-SeenComposite-SeenComposite-Unseen
GPT-6 Astra59.20%87.78%43.75%42.50%
Xiaomi-Robotics-157.4%80.2%57.1%32.1%
GPT-5.557.1%92.0%61.0%13.8%
Opus-4.7 / max.reasoning48.6%79.4%47.5%15.0%
WorldDreamer35.3%66.3%26.7%9.0%
RLDX-130.0%60.0%21.3%5.0%
π0.516.9%39.6%7.1%1.2%
π014.8%34.6%6.1%1.1%

RoboTwin

方法成功率
Codex / GPT-5.5 / xhigh / reasoning62.4%
Claude Code / Opus-4.7 / max.reasoning58.4%
LingBot-VLA50.4%
π0.547.9%
GR00T-N1.720.7%
StarVLA10.6%