Skip to content
AI Atlas
Research

Papers

Publications linked to models, labs and benchmarks. Authors, venues and abstracts come from arXiv and publisher pages; model links come from model cards citing the paper.

510 papers

Papers
TitleAuthorsOrganizationPublishedIntroduces Models (and artifacts) whose model card or documentation cites this paper — inbound described_by relations.DatasetsBenchmarksCode
MOSAIC: Query-Aware Exploration Policy Adaptation for GraphRAGarXiv:2609.11065cs.AIEunKyeong Lee, Hye Woo Lee, Hyeongjun Jang +212 Sept 2026
Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and EvaluationarXiv:2609.11115cs.AIErgan Shang, Jiayu Wang, Junjie Zhou +212 Sept 2026
Autonomous Chemical Mechanistic Discovery through Agentic Reasoning and ValidationarXiv:2609.11147cs.AIAijia Zhang, Biqing Qi, Bowen Zhou +212 Sept 2026
Breaking Predictions Is Not Enough: Specified-Foil Counterfactuals for Temporal GraphsarXiv:2609.11170cs.AIMinwoo Yu, Young-guk Ha12 Sept 2026
Debate-to-Skill: Capability-Bound Process Supervision for Industrial Query-to-Agent AnnotationarXiv:2609.11176cs.AIHuifu Li, Leisheng Cheng, Shiyu Zhang12 Sept 2026
SemVerBench: Benchmarking LLM Comprehension of Version-Constraint Resolution SemanticsarXiv:2609.11180cs.AIQibai Chen, Zeming Liu12 Sept 2026
Can LLMs Follow Medical Expert Logic? A Benchmark for Hierarchical Logical Consistency in Risk-of-Bias AssessmentarXiv:2609.11185cs.AIHaihong E, Jiayu Huang, Qianhui Ling +212 Sept 2026
Agentic Share-of-Search: A Multi-Agent AI System for Competitive Decision-Making in LLM-Mediated E-CommercearXiv:2609.11190cs.AISpandan Ghose Chowdhury12 Sept 2026
An AI-Powered Culturally Aware Chatbot for Stress Detection and Wellness Support among Pakistani University Students Using NLP and Machine LearningarXiv:2609.11199cs.AIMuhammad Afzal, Muhammad Fahad Bashir12 Sept 2026
NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty AssessmentarXiv:2609.11234cs.AIGuoqiang Zhang, Jiayi Chen, Kexin Tan +212 Sept 2026
Sci-MMR: Benchmarking Multi-Step Evidence-Grounded Scientific Reasoning in Multimodal AgentsarXiv:2609.11243cs.AIBicheng Deng, Dingwei Zhu, Enyu Zhou +212 Sept 2026
When Does Text Inform? Benchmarking Information-Theoretic Metrics for Multimodal Time-Series ForecastingarXiv:2609.11282cs.AIEmma Andrews, Gianmarco Mengaldo12 Sept 2026
Generating a Consistent Enterprise: Synthesis and Reference-Free Evaluation of Multi-System Business DataarXiv:2609.11286cs.AIAssaf Natanzon, Benjamin Gruenbaum, Chen Dinachi +212 Sept 2026
Off-Target Effects of Response-Style Alignment in a Korean 27B Language ModelarXiv:2609.11291cs.AIHyojung Han12 Sept 2026
Memory Compression for High-Fanout Agent SandboxesarXiv:2609.11294cs.AICeyu XU, Haohui Mai, Jiangnan Yu +212 Sept 2026
Routing by Reasoning Need: Trajectory-Aware Decoding Control for Diffusion Vision-Language ModelsarXiv:2609.11315cs.AIXiaoying Tang, Yixiang Liu, Zhonghua Wang +112 Sept 2026
Mr.LHDR: A Benchmark for Multimodal Real-World Long-Horizon Deep Research AgentsarXiv:2609.11318cs.AIHaihong Hao, Haijun Wu, Haoze Zhao +212 Sept 2026
Magenta: Closing the Loop Between Mathematical Reasoning and Lean VerificationarXiv:2609.11319cs.AIEleonora Giunchiglia, Erix Xing, Haonan Li +212 Sept 2026
AI Exposure and AI Resilience: A Two-Dimensional Assessment Framework for Software and Software-Based Business ModelarXiv:2609.11321cs.AIMartin H\"ausl (Munich University of Applied Sciences), Paul Darius Mandl (Findustrial GmbH), Peter Mandl (Munich University of Applied Sciences)12 Sept 2026
Exploring Diffusion Transformers for Cross-Modal Augmentation in Multimodal Brain State DecodingarXiv:2609.11341cs.AIBohan Fang, Dongrui Wu, Hongbin Wang +212 Sept 2026
Portable Semantics, Private Dialects: Reuse and Negative Transfer in Latent Communication Between Language-Model CellsarXiv:2609.11365cs.AINarcis Marincat12 Sept 2026
RAMamba-Net: A Reliability-Aware and Mamba-Based Multimodal Fusion Network for Auditory Attention DetectionarXiv:2609.11372cs.AIDongrui Wu, Xingyi He, Ziwei Wang12 Sept 2026
Beyond Confidence: Stability-Aware Test-Time Adaptation for LLM ReasoningarXiv:2609.11393cs.AIBincheng Gu, Junliang Yu, Min Gao +212 Sept 2026
From Queries to Narratives: Cultural Heritage Data Stories for Knowledge Graph Exploration and Quality AssessmentarXiv:2609.11403cs.AIEtienne Posthumus, Harald Sack, J\"org Waitelonis +212 Sept 2026
LLMs as Post-hoc Auditors of Physiological Plausibility in Symbolic Regression: A Clinician-Evaluated Case StudyarXiv:2609.11431cs.AIEsther Maqueda, J. Ignacio Hidalgo, J. Manuel Velasco +212 Sept 2026

Author lists and categories are copied from the paper's own metadata (arXiv, publisher). Linked models, datasets, benchmarks and code come from stated relations only; a dash means no source stated one.