VLAとは何ですか? なぜロボットの着陸時のアクションコントロールにおいて、ビジョン・言語・アクションを避けられないのでしょうか?
VLAは「ビジョン・言語・行動」の略称で、直訳すると「視覚・言語・行動」モデルです。 通常のマルチモーダルモデルと最大の違いは、画像を読みテキストを理解できるだけでなく、その理解結果を実行可能なアクションに変換できることです。 まさにこの一歩ゆえに、VLAはロボットや身体化された知能の議論においてほ...
AI百科事典 • Admin •
134
Found 1 related articles