Zhenjun Zhao
@ericzzj
ericzzj1989.github.io Postdoc@UniZar | PhD@CUHK | 3D vision, SLAM, Image matching (
Video Generation Models are General-Purpose Vision Learners Letian Wang, Chuhan Zhang, @rkabra.bsky.social, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu arxiv.org/abs/2607.09024
Glob3R: Global Structure-from-Motion with 3D Foundation Models Junyuan Deng, Heng Li, Kejie Qiu, Lingteng Qiu, Rui Peng, Weichao Shen, Weihao Yuan, Siyu Zhu, Zilong Dong, Ping Tan tl;dr: Pi3X->keyframe selection+dense warps->sparse tracks->GLOMAP arxiv.org/abs/2607.09225
What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility Filippo Ziliotto, Luciano Serafini, @lambertoballan.bsky.social, Tommaso Campari tl;dr: early layers->3D-aware scene representation; late layers->co-visibility; VGGT+MoE head arxiv.org/abs/2607.09503
DGSfM: Depth-Guided Scale-Aware Global Structure-from-Motion Sithu Aung, Viktor Kocur, Yaqing Ding, @sattlertorsten.bsky.social, Zuzana Kukelova arxiv.org/abs/2607.09507
Incremental Online Scene Reconstruction by 3D Gaussian Triangulation Yanjin Zhu, Shaofan Liu, Jianke Zhu tl;dr: optimized 3D Gaussians->surfel primitives->direct triangulation arxiv.org/abs/2607.10690
MAC-Splat: Multi-Attribute Consistency for High-Fidelity Sparse-View Reconstruction Jinqian Yang, Yichen Wu, Wanhua Li, Haokun Lin, Renzhen Wang, Xiangchu Feng, Xixi Jia tl;dr: MASt3R+DINOv3 encoder->correspondences->Gaussians+MAC loss arxiv.org/abs/2607.10792
OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo tl;dr: disentangle dynamic foreground motion from static scene structure arxiv.org/abs/2607.10840
FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry Muxin Liu, Xiaoyang Lyu, Tianhe Ren, Peng Dai, Xiaoshan Wu, Zhiyue Zhang, Jiaqi Zhang, Jiehong Lin, Shaoshuai Shi, Xiaojuan Qi arxiv.org/abs/2607.11588
Label-Free Target-Domain Adaptation for Unconstrained Event-Image Feature Matching via Dual-Stage Distillation Zhonghua Yi, Hao Shi, Qi Jiang, Yufan Zhang, Kailun Yang, Kaiwei Wang tl;dr: label-agnostic pretraining + epipolar-guided self-distillation arxiv.org/abs/2607.10082
Desc++: Efficient Descriptor Enhancement for Data Association in Existing Visual SLAM Systems Ting-Wei Ou, Huang-Ting Lin, Kuu-Young Young tl;dr: plug-and-play descriptor enhancer; sequential Mamba over Z-order serialized keypoints + attention-free global context arxiv.org/abs/2607.11099
GeoGS-SLAM: Online Monocular Reconstruction Using Gaussian Splatting with Geometric Priors Ruilan Gao, Letian Jin, Yu Zhang tl;dr: VGGT helps GS-SLAM arxiv.org/abs/2607.11184
Learning Adaptive Solvers for Distributed Factor Graph Optimization on Matrix Lie Groups Jaeho Shin, Maani Ghaffari, Yulun Tian tl;dr: unfold CORD into differentiable iterations; learn local feedback policy to predict solver parameters arxiv.org/abs/2607.08735
NoDrift3R: Raymap-Guided Coupling for Drift-Robust Unposed Feed-Forward 3D Reconstruction Xiangyu Sun, Liu Liu, Seungkwon Yang, Jingbing Han, Seungtae Nam, Zhizhong Su, Eunbyung Park tl;dr: VGGT + Ray-Map Head arxiv.org/abs/2607.07168
GeoGS-SLAM: Geometry-Only Gaussian Splatting for Dense Monocular SLAM Lipu Zhou, Yaoyun Kang, Junxiang Pang, Shengkai Sun, Tingting Bao, Kehan Wang tl;dr: use only geometry-related parameter (position, rotation, scale, and opacity) and remove SH arxiv.org/abs/2607.07452
Why does Deep Learning Improve Visual SLAM? Giovanni Cioffi, @davidescaramuzza.bsky.social tl;dr: learned 2D data association and uncertainty > recurrent architecture arxiv.org/abs/2607.06023
Hilti-Trimble-Oxford Dataset: 360 Visual-Inertial Benchmark with Floor Plan Priors for SLAM and Localization tl;dr: in title arxiv.org/abs/2607.06464
SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers Jianing Deng, Yuanzhe Li, Jialu Wang, Song Wang, Tianlong Chen, Huanrui Yang, Jingtong Hu arxiv.org/abs/2607.03612
DS-SAC: Density Search for Sample Consensus Suraj Thapa, Muhammad Aminul Islam tl;dr: orward and backward search + recursive residual-based partitioning->deterministic RANSAC arxiv.org/abs/2607.03972
GUSH3R: Everyone Everywhere All at Once as Gaussians Keito Abe, Kaede Shiohara, Takashi Otonari, Toshihiko Yamasaki tl;dr: reconstruct dynamic humans and static scenes as unified 3D Gaussians from monocular videos; use Human3R+SMPL-X arxiv.org/abs/2607.05243
WildSplat: Feedforward Gaussian Splatting from Unposed In-the-Wild Images Xiyu Zhang, Jingyu Zhuang, Hongjia Zhai, Zizheng Yan, Jinwei Chen, Guofeng Zhang, Qingnan Fan tl;dr: appearance-invariant geometry + target-conditioned appearance arxiv.org/abs/2607.05347
ReCal3R: Reliability-Calibrated Learning Rates for Streaming 3D Reconstruction Xinze Li, Yiyuan Wang, Pengxu Chen, Wentao Fan, Weifeng Su, Weisi Lin, Wentao Cheng arxiv.org/abs/2607.05356
PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian tl;dr: supervise a pixe-laligned 3D Gaussian directly through multi-view differentiable rendering arxiv.org/abs/2607.05373
InFlux++: Real and Synthetic Data for Estimating Dynamic Camera Intrinsics Erich Liang, Caleb Kha-Uong, Chinmaya Saran, Sreemanti Dey, David W. Liu, Junhan Ouyang, Benjamin Zhou, Jia Deng tl;dr: synthetic video dataset + real-world benchmar arxiv.org/abs/2607.05389
MVFusion-GS: Motion-Variance Guided Temporal Attention for High-Quality Dynamic Gaussian Splatting Jianwei Hu, Tingxuan Huang, Hengyu Zhou, Ningna Wang, Xiaohu Guo, Jinshan Lai, Bin Wang arxiv.org/abs/2607.01578
Diversity-aware View Partitioning for Scalable VGGT Jinsoo Park, Donggyu Choi, Ahyun Seo, Minsu Cho, Jeany Son tl;dr: input views->balanced chunks->viewpoint diversity arxiv.org/abs/2607.01885
GeoMix: Descriptor-Free Visual Localization via Global Context and Multi-Detector Training Yejun Zhang, Xinjue Wang, Zihan Wang, Esa Rahtu, Juho Kannala tl;dr: directional and distance-aware embeddings+learnable context nodes+multi-detector training arxiv.org/abs/2607.02486
PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation @haofeixu.bsky.social, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt, @marcpollefeys.bsky.social, @andreasgeiger.bsky.social, Federico Tombari, @miniemeyer.bsky.social arxiv.org/abs/2607.02515
DL-VINS-Factory: A Modular Framework for Learned Visual Front-Ends in Visual-Inertial SLAM Shoon Kit Lim, Melissa Jia Ying Chong, Ting Yang Ling tl;dr: in title; use ALIKED, RaCo, SuperPoint, XFea, LightGlue, AnyLoc arxiv.org/abs/2607.01757
DL-SLAM: Enabling High-Fidelity Gaussian Splatting SLAM in Dynamic Environments based on Dual-Level Probability Ziheng Xu, Qingfeng Li, Xuefeng Liu, Chen Chen, Jianwei Niu arxiv.org/abs/2607.01860
PRISM-VO: Scale-Aware Visual Odometry Using Photometric Plenoptic Bundle Adjustment Aymeric Fleith, Julian Zirbel, @dcremers.bsky.social, Niclas Zeller tl;dr: plenoptic camera measurement->photometric BA arxiv.org/abs/2607.00176