Ant Group系のRobbyantチームが、映像を1フレームずつ受け取りながらリアルタイムで3D空間を復元する順伝播型の基盤モデルLingBot-Mapを公開した。論文(arXiv:2604.14141)とコード、学習済みモデルが同時に配布され、GitHub Trendingで+827★/日のペースで急上昇し総1万2762★を超えた。
技術の核は、座標の基準付け・密な形状の手がかり・長距離のずれ補正を1つの構造にまとめる幾何コンテキスト変換器(Geometric Context Transformer)にある。ページ化されたKVキャッシュ注意を使う順伝播構造で、518×378解像度・毎秒約20フレーム・1万フレーム超の長尺映像でも位置ずれ(ドリフト)を抑えて安定処理すると主張する。KITTI・Oxford Spires・TUM・ETH3Dなど多数の標準データセットで評価スクリプトが公開されている。
単眼RGBカメラのみで空間理解できるため、ロボット・自動運転・AR/VR・不動産・デジタルツインへの応用が実用視点で語られている。コードと学習済みモデルが公開済みのため、企業や研究者はすぐ検証に着手できる。
lingbot-mapストリーミングデータからシーンを再構築するためのフィードフォワード3D基礎モデル