본문 바로가기

전체 글117

[paper review] Spatial-MLLM: Boosting MLLM Capabilities inVisual-based Spatial Intelligence 논문리뷰 이번논문은 NeurIPS 2025 (Spotlight)인 Spatial-MLLM 이라는 VLM3D계통의 논문입니다.MLLM은 Multimodal Large Language Model의 약자로 image, audio, video등 여러 형태의 modality를 함께 이해하는 모델입니다. 기존의 MLLM은 2D작업에는 뛰어나지만 3D 공간을 이해하는 능력이 부족합니다.(Gemini, GPT-4o)이를 위해서는 pointcloud, depth 정보 데이터를 함께 제공받는 방법의 approach들이 있지만 실제 세계에서는 적용하기 어렵습니다. 본 논문에서는 2D video만으로 공간을 이해하고 추론하는 능력을 갖춘 MLLM을 소개합니다. VLM(Vision-Language Model) 훑어보기안녕하세요. 이.. 2026. 8. 12.
[paper reivew] LEMON-Mapping : Loop-Enhanced Large-Scale Multi-Session PointCloud Merging and Optimization for Globally Consistent Mapping 논문리뷰 안녕하세요. 이번 포스팅은 LEMON-Mapping이라는 Mapping관련 paper입니다.자율주행 분야에서 Map을 만드는것은 전형적인 pipeline의 한 부분입니다. 문제는 large scale로 가게되면 (논문에서는 multi agent robot) Pose Graph Optimization(PGO)방식을 사용해서 global map 의 consistency를 보장하지만 이 방법은 기존의 geometric fetaure를 무시하고 단순하게 loop closure간의 pose optimization만 사용하기에 여러 local map이 겹치는 부분은 divergence하거나 미묘하게 어긋나거나 blurring이 발생합니다. 논문에서는 보다 정확한 mapping을 위해서는 pose중심의 PGO가 아.. 2026. 5. 11.
[paper review] VGGT-SLAM / VGGT2.0-SLAM 논문 리뷰 이번 포스팅은 VGGT-SLAM, VGGT2.0-SLAM에 대해서 포스팅하겠습니다.VGGT-SLAM은 제목에서 알수있듯이 최근 feedforward 방법으로 3D Recon을 하는 모델인 VGGT를 이용한 SLAM입니다. [paper review] VGGT 논문리뷰이번 포스트는 CVPR'25에서 best paper로 선정된 VGGT입니다. VGGT는 All in one recon model인데요, one view ~ multi view를 input으로 해서 camera param, point maps, depth map, 3D point track까지 반환해줄 수 있는 모델입니다.jaehoon-daddy.tistory.com VGGT는 arbitary number image를 처리할 수 있지만 GPU메.. 2026. 3. 26.
[paper review] DROID-SLAM in the Wild 논문리뷰 안녕하세요. 이번 포스팅은 Zurich에서 나온 DROID-SLAM in the wild이라는 논문입니다. DROID-SLAM은 아래 포스팅참고하세요. [paper review] DROID-SLAM (Deep Visual SLAM) 논문 리뷰안녕하세요. 이번 포스팅은 DROID-SLAM이라는 논문을 리뷰하겠습니다. '21에 발표된 성능 좋은 Deep-based SLAM으로 그 구조를 뜯어보도록 하겠습니다. Intro 우선 visual SLAM을 살펴보겠습니다. 제가 임의jaehoon-daddy.tistory.com 기존의 traditional SLAM들은 dyanmic environment를 고려하지 않습니다. static을 가정해서 실제 real world에서는 사용하는 것이 사실상 불가능합니다. 그.. 2026. 3. 25.
[paper review] Describe Anything Anywhere At Any Moment 논문 리뷰 안녕하세요. 이번 포스팅은 DAAAAM이라는 논문에 대해서 리뷰하겠습니다.이 논문은 로봇이나 AR agent가 복잡한 대규모 환경에서 길을 찾거나 임무를 수행할 때 필요한 spatio-temporal memory를 만드는 프레임워크를 제안하였습니다.보통 로봇이 현실 세계를 이해하려면 물체가 어디에 있는지(spatial info) 그리고 그게 무엇인지(semantic info)가 필요합니다. 기존의 기술들은 보통 mapping을 빠르게 하기위해서는 open vocabulary 방법을 사용하기 힘들고 반대로 VLM을 사용하면 실시간 처리가 불가능한 trade-off가 있었습니다. 논문에서는 hierachical 4D scene graph를 이용하였다고 합니다. 요약하면 모든 프레임을 다 분석하는 것이 아니고.. 2026. 3. 13.
[paper review] FORM: Fixed-Lag Odometry with Reparative Mappingutilizing Rotating LiDAR Sensors 논문리뷰 이번 논문 포스팅은 FORM이라는 모델입니다. Lidar를 이용한 Odometry estimation 모델은 크게 smoothing method, filtering method로 나눌수있습니다.smoothing은 과거의 pose구간을 한꺼번의 smoothing하는 방법으로 window 방식으로 optimization을 하는 것을 의미합니다. 그렇기에 새로운 정보를 바탕으로 과거의 상태를 보정할 수 있어 정확하지만 연산량이 많아서 실시간 처리가 불가능합니다. filtering 방법은 연산량 문제를 피하기 위해 현재의 state만 estimation하는 방법을 사용하고 과거의 scan은 submap으로 처리합니다.보통 filtering방식을 사용하는데 submap은 한 번의 estimation의 오차가 발생.. 2026. 2. 10.