LingBot-Map 面向连续视频中的相机位姿估计、深度预测与三维点云重建,处理的是长序列里全局几何一致性、实时速度和显存增长彼此牵制的问题。
LingBot-Map 面向连续视频中的相机位姿估计、深度预测与三维点云重建,处理的是长序列里全局几何一致性、实时速度和显存增长彼此牵制的问题。项目用 GCA(Geometric Context Attention) 把固定的 anchor context、局部 pose-reference window 与压缩后的 trajectory memory 组合成流式状态,再通过 paged KV cache 处理缓存的追加和淘汰。论文在 518x378 输入、窗口 64 的设置下报告 20.29 FPS 与 13.28GB 显存,仓库的实际 16 帧冒烟运行也测得约 13.25GB 峰值。下面结合论文、代码和服务器部署过程,拆解这套设计为什么适合单张 RTX 4090,以及如何用 Web 查看器完成第一次可视化。
这不是一个从零训练的轻量脚本,而是一个已经提供官方权重、流式推理、长序列窗口推理、点云可视化和 benchmark 框架的研究代码仓库。最适合的使用方式是拿已有 checkpoint 做推理和评测,然后把视频或图片目录交给 demo.py;论文中两阶段训练分别需要约 21,500 GPU 小时和 15,360 GPU 小时,单张消费级显卡不应被误解为完整训练平台。进一步看,部署难点主要集中在 GPU 显存、首次 CUDA 内核编译、长视频磁盘和 Web 端口管理,而不是 CPU 算力本身。
详细使用可以参考LingBot-Map:把长视频三维重建做成一条可部署的流