Toward Hierarchical Vision-Language-Action Models with Continuous Skill Abstraction1, 2026·Shih-Min Yang,Yufei Zhu,Yuxuan Yang,Tatsuya Matsushima,Johannes A Stork,Yusuke Iwasawa,Martin Magnusson,Todor Stoyanov· 0 分で読める 引用publication最終更新 1, 2026 ← See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs 1, 2026YUBI: Yielding Universal Bidigital Interface for Bimanual Dexterous Manipulation at Scale 1, 2026 →