
RT-2:把机器人动作当成"外语单词"——让网络知识直接长成操作技能原文:RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control作者:Anthony Brohan, Noah Brown, Justice Carbajal … Brianna Zitkovich(Google DeepMind,作者按字母序)arXiv:2307.15818v1 [cs.RO] · 项目页:robotics-transformer2.github.io图 1:RT-2 总览——把机器人动作表示为"另一种语言",动作可以被编码成文本 token 并与其他自然语言 token 一起,由同一个视觉语言模型自回归地输出。RT-2 的想法非常"暴力"却很优雅:把机器人动作离散成 256 个桶、直接占用词表里的 256 个 token,于是 VLM 预训练里学到的语义与视觉概念,可以顺着"下一个 token 预测"这条老路流进机器人的动作输出。结果是机器人会做没被教过的事(把草莓放进"同类水果"的碗里、挑出"快掉下桌子"的那个袋子),并且在 6k 次真实机器人评测中把泛化成功率做到基线的约 2~6 倍。