| OmniKVQuant: KV Cache Quantization for Omni-LLMsarXiv:2609.11582 | Suho Yoo, Hyunjong Ok, Jongmin Choi +2 | 11 Sept 2026 | cs.CV | — | 89 |
| MMGait: Benchmarking and Unifying Gait Recognition across Heterogeneous ModalitiesarXiv:2609.11601 | Saihui Hou, Chenye Wang, Qingyuan Cai +2 | 11 Sept 2026 | cs.CV | — | 89 |
| LangStreet: Persistent Language Fields for Anchor-Decoded Street GaussiansarXiv:2609.11616 | Runyi Yang, Deheng Zhang, Xiaoye Wang +2 | 11 Sept 2026 | cs.CV | — | 89 |
| Self-Supervised Cardiac Phase Detection via Single-Parameter Latent OrbitsarXiv:2609.11650 | John Bonnici, Matthew Baugh, Aleksandra Kulbaka +2 | 11 Sept 2026 | cs.CV | — | 89 |
| Single-Stream Multi-Feature Fusion with Temporal Robustness for Gait Emotion RecognitionarXiv:2609.11680 | Shirong Lyu, Silu Quan, Yixuan Ding +1 | 11 Sept 2026 | cs.CV | — | 89 |
| Spectral Adapters for Segment Anything Model-based Segmentation of Colorectal Liver Metastases in Computed TomographyarXiv:2609.11703 | Ramtin Mojtahedi, Mohammad Hamghalam, Jacob J. Peoples +2 | 11 Sept 2026 | cs.CV | — | 89 |
| Language-Augmented Semantic Priors for B-Spline Surface FittingarXiv:2609.11708 | Yunzhong Lou, Yusheng Luo, Jiahao Li +2 | 11 Sept 2026 | cs.CV | — | 89 |
| MC-DeTra: Motion-Consistent Joint Object Detection and Socially-Aware Trajectory Forecasting in Bird's-Eye-View ImagesarXiv:2609.11717 | Vladislav Diuzhev, Dmitry Yudin | 11 Sept 2026 | cs.CV | — | 89 |
| Revisiting Avatar-As-Image: High-Fidelity Registration is All You NeedarXiv:2609.11722 | Margaret Kostyrko, Yuxuan Xue, Garvita Tiwari +1 | 11 Sept 2026 | cs.CV | — | 89 |
| Guided Super-Resolution of Digital Elevation Models with Diffusion-Based Image GeneratorsarXiv:2609.11886 | Armand Mihai Nicolicioiu, Dominik Narnhofer, Nando Metzger +2 | 11 Sept 2026 | cs.CV | — | 89 |
| Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video UnderstandingarXiv:2609.11899 | Weitong Cai, Hang Zhang, Yukai Huang +2 | 11 Sept 2026 | cs.CV | — | 89 |
| SenseNova-U1.5: Towards Native Unified Visual IntelligencearXiv:2609.11929 | Haiwen Diao, Jiahao Wang, Chenjing Ding +2 | 11 Sept 2026 | cs.CV | — | 74 |
| Seamless Whole Slide Label-Free Virtual StainingarXiv:2609.10914 | Dou Hoon Kwark, Kianoush Falahkheirkhah, Ji-hun Oh +2 | 11 Sept 2026 | eess.IV | — | 89 |
| IMLE-VLA: Fast Single-Step Action Generation for Vision-Language-Action PoliciesarXiv:2609.10915 | Kian Hosseinkhani (Simon Fraser University), Qinhe Peng (University of Pennsylvania), George Shramko (Simon Fraser University) +2 | 11 Sept 2026 | cs.RO | — | 89 |
| Exponential Pixelating Integral transform with dual fractal features for enhanced chest X-ray abnormality detectionarXiv:2609.10988 | Naveenraj Kamalakannan, Sri Ram Macharla, M Kanimozhi +1 | 11 Sept 2026 | eess.IV | — | 89 |
| AI-Powered Flare Combustion Efficiency EstimationarXiv:2609.11262 | Afeefa Azam, Iyyakutti Iyappan Ganapathi, Fares Ossama Abdelhafez +2 | 11 Sept 2026 | cs.AI | — | 89 |
| SegCol Challenge: Semantic Segmentation for Tools and Fold Edges in Colonoscopy dataarXiv:2412.16078 | Xinwei Ju, Rema Daher, Razvan Caramalau +2 | 11 Sept 2026 | cs.CV | — | 89 |
| SSS: Semi-Supervised SAM-2 with Efficient Prompting for Medical Imaging SegmentationarXiv:2506.08949 | Hongjie Zhu, Xiwei Liu, Rundong Xue +2 | 11 Sept 2026 | cs.CV | — | 89 |
| Dream4D: Lifting Camera-Controlled I2V towards Spatiotemporally Consistent 4D GenerationarXiv:2508.07769 | Xiaoyan Liu, Kangrui Li, Jiaxin Liu +2 | 11 Sept 2026 | cs.CV | — | 89 |
| Adaptive Dual-Constrained Line Aggregation for Cross-Paradigm Line Segment DetectionarXiv:2508.19742 | Chenguang Liu, Chisheng Wang, Huilin Chen +2 | 11 Sept 2026 | cs.CV | — | 89 |
| Confidence-Calibrating Regularization for Robust Brain MRI Segmentation Under Domain ShiftarXiv:2509.23176 | Behraj Khan, Tahir Qasim Syed, Syed Ahmad Chan Bukhari | 11 Sept 2026 | cs.CV | — | 89 |
| MedGEN-Bench: A Contextually Entangled Benchmark for Open-ended Multimodal Medical GenerationarXiv:2511.13135 | Junjie Yang, Yuhao Yan, Gang Wu +2 | 11 Sept 2026 | cs.CV | — | 89 |
| DirectSwap: Paired, Mask-Free Video Head Swapping with Full-Reference EvaluationarXiv:2512.09417 | Yanan Wang, Shengcai Liao, Panwen Hu +2 | 11 Sept 2026 | cs.CV | — | 89 |
| Gaussian Belief Propagation Network for Depth CompletionarXiv:2601.21291 | Jie Tang, Pingping Xie, Jian Li +1 | 11 Sept 2026 | cs.CV | — | 89 |
| V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal RetrievalarXiv:2602.06034 | Dongyang Chen, Chaoyang Wang, Dezhao Su +2 | 11 Sept 2026 | cs.CV | — | 89 |
| InstantHDR: Single-forward Gaussian Splatting Initialization for HDR 3D ReconstructionarXiv:2603.11298 | Dingqiang Ye, Jiacong Xu, Jianglu Ping +2 | 11 Sept 2026 | cs.CV | — | 89 |
| CLIP-RD: Relational Distillation for Efficient CLIP Knowledge DistillationarXiv:2603.25383 | Jeannie Chung, Hanna Jang, Ingyeong Yang +2 | 11 Sept 2026 | cs.CV | — | 89 |
| Leveraging Avatar Fingerprinting: A Multi-Generator Photorealistic Talking-Head Public Database and BenchmarkarXiv:2603.26934 | Laura Pedrouzo-Rodriguez, Luis F. Gomez, Ruben Tolosana +2 | 11 Sept 2026 | cs.CV | — | 89 |
| Automated multi-class wound assessment using dedicated instance segmentation models for boundary detection and classificationarXiv:2603.27325 | Mehedi Hasan Tusar, Fateme Fayyazbakhsh, Igor Melnychuk +1 | 11 Sept 2026 | cs.CV | — | 89 |
| Towards Automated Solar Panel Integrity: Hybrid Deep Feature Extraction for Advanced Surface Defect IdentificationarXiv:2604.10969 | Muhammad Junaid Asif, Muhammad Saad Rafaqat, Usman Nazakat +2 | 11 Sept 2026 | cs.CV | — | 89 |
| Task Alignment: A Simple Proxy for Practical Model Merging Across Diverse Vision TasksarXiv:2604.12935 | Pau de Jorge, C\'esar Roberto de Souza, Bj\"orn Michele +2 | 11 Sept 2026 | cs.CV | — | 89 |
| Reconstruction of a 3D wireframe from a single line drawing via generative depth estimationarXiv:2604.13549 | Elton Cao, Hod Lipson | 11 Sept 2026 | cs.CV | — | 89 |
| TextAlign: Preference Alignment for Text Rendering with Hierarchical RewardsarXiv:2605.19320 | Mingxuan Cui, Jingpu Yang, Fengxian Ji +2 | 11 Sept 2026 | cs.CV | — | 89 |
| Artic-O: End-to-End Articulated Object Reconstruction via Latent Geometry LearningarXiv:2606.21938 | Xuyang Wang, Zhenyu Li, Jian Ding +2 | 11 Sept 2026 | cs.CV | — | 89 |
| ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and GenerationarXiv:2606.23835 | Anindya Mondal, Sauradip Nag, Anjan Dutta | 11 Sept 2026 | cs.CV | — | 89 |
| Does YOLO26 Truly Offer Advantages Over Its Predecessors for Edge Deployment? A Benchmark Study in AquaculturearXiv:2607.09835 | Rakesh Ranjan, Gajanan S. Kothawade, Kata Sharrer +2 | 11 Sept 2026 | cs.CV | — | 89 |
| ScaleResfusion: Residual Rectified Flow based on Residual Vector FieldarXiv:2607.25275 | Zhenning Shi, Chen Xu, Junhao Zhang +2 | 11 Sept 2026 | cs.CV | — | 89 |
| HeteroPROMPT: A Real-time and Privacy-Preserving Heterogeneous Collaborative Perception FrameworkarXiv:2607.26283 | Armin Maleki, Hayder Radha | 11 Sept 2026 | cs.CV | — | 89 |
| SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript ContextarXiv:2607.27084 | Zihan Deng, Chuanzhi Xu, Huiqi Liang +2 | 11 Sept 2026 | cs.CV | — | 89 |
| SPECTRA: Band-Routed Embedding and Stage-Wise LoRA for Cross-Sensor Fine-Tuning of Geospatial Foundation ModelsarXiv:2608.01751 | Xingyan Li, Jordan A. Caraballo-Vega, Jie Gong +2 | 11 Sept 2026 | cs.CV | — | 89 |