LingBot-Map 面向连续视频中的相机位姿估计、深度预测与三维点云重建,处理的是长序列里全局几何一致性、实时速度和显存增长彼此牵制的问题。
LingBot-Map 面向连续视频中的相机位姿估计、深度预测与三维点云重建,处理的是长序列里全局几何一致性、实时速度和显存增长彼此牵制的问题。项目用 GCA(Geometric Context Attention) 把固定的 anchor context、局部 pose-reference window 与压缩后的 trajectory memory 组合成流式状态,再通过 paged KV cache 处理缓存的追加和淘汰。
本次部署没有改动已有 py312 环境,而是创建了独立的 lingbot-depth 环境。服务器使用 Python 3.10.21、PyTorch 2.6.0+cu124、TorchVision 0.21.0、xFormers 0.0.29.post2 和 Gradio 6.26.0;由于无桌面镜像缺少 libGL.so.1,OpenCV 使用 opencv-python-headless。下面的命令表达完整安装路径,若后续换机器,优先确认 NVIDIA 驱动能够支持 CUDA runtime,再执行项目 editable install。
# 服务器安装命令
source /usr/local/miniconda3/etc/profile.d/conda.sh
conda create -n lingbot-depth python=3.10 -y
conda activate lingbot-depth
python -m pip install --index-url https://download.pytorch.org/whl/cu124 \
torch==2.6.0 torchvision==0.21.0
python -m pip install --no-deps xformers==0.0.29.post2
python -m pip install click opencv-python-headless scipy matplotlib \
trimesh pillow huggingface_hub gradio
cd /root/lingbot-depth
python -m pip install -e . --no-deps
python example.py --example 0 --output result
安装阶段要保留模型自动下载的 Hugging Face 缓存,首次启动会把 model.pt 放到缓存目录,之后服务重启不再重复下载。若服务器无法访问 Hugging Face,可以先在有网络的机器下载 checkpoint,再把本地模型路径传给 --model;但本项目的 from_pretrained() 仍然要求 checkpoint 内含 model_config 和 model 字段,不能拿一个普通 DINOv2 权重替换。
详细的内容可以参考CSDN博客LingBot-Map:把长视频三维重建做成一条可部署的流