Skip to content
AI Atlas
Research

Papers

Publications linked to models, labs and benchmarks. Authors, venues and abstracts come from arXiv and publisher pages.

16 total

Reset
Papers
TitleAuthorsPublishedCategoriesOrganization / venueQuality
Project Qualia: Recovering Experiential Music Structure from Session Co-occurrence DataarXiv:2609.10862Nizam Mohammed, Abu B. S. Rahman, Dimuthu D. K. Arachchige11 Sept 2026cs.SD89
ZipCodec: Ultra-Low-Frame-Rate Streaming Speech CodingarXiv:2609.11642Luca Della Libera, Cem Subakan, Mirco Ravanelli11 Sept 2026cs.SD89
Single Microphone Own Voice Detection based on Simulated Transfer Functions for Hearing AidsarXiv:2603.02724Mathuranathan Mayuravaani, W. Bastiaan Kleijn, Andrew Lensen +111 Sept 2026cs.SD89
Active noise cancellation on open-ear smart glassesarXiv:2604.05519Kuang Yuan, Freddy Yifei Liu, Tong Xiao +211 Sept 2026eess.AS89
LLM-Anchored Paralinguistic Enrichment for Alzheimer's Disease DetectionarXiv:2609.10896Xiao Wei, Yuqin Lin, Yaru Cao +211 Sept 2026cs.CL89
Automatic Lyric Transcription for Greek Songs: Scaling and Task Composition Effects in Whisper AdaptationarXiv:2609.11302Maria Frangiadaki, Dimitrios Damianos, Kosmas Kritsis +111 Sept 2026cs.CL89
SEAR: Segment-Evidence-Aware Routing for Weak-to-Strong Multilingual Speech MCQarXiv:2609.11355Huy Hoang Le, Long-Bao Nguyen, Minh Tri Dao11 Sept 2026cs.CL89
Complex-Text Robustness Evaluation and Failure Diagnosis for Low-Resource Multilingual Text-to-SpeecharXiv:2609.11545Tianlun Zuo, Ziyu Zhang, Tingzhi Mao +211 Sept 2026cs.CL89
Xiaomi-CocktailASR-1 Technical ReportarXiv:2609.11274Yiru Zhang, Hang Su, Lichun Fan +211 Sept 2026cs.SD89
Unadapted Multilingual ASR on a Garrusi Kurdish Evaluation Set: A Common-Reference Staged Normalization AnalysisarXiv:2608.16379Hiwa Asadpour11 Sept 2026cs.CL89
Beyond Prompting: Efficient and Robust Contextual Biasing for Speech LLMs via Logit-Space Integration (LOGIC)arXiv:2601.15397Peidong Wang, Jian Xue, Jinyu Li11 Sept 2026cs.AI89
Voice or Stereotype? Disentangling Acoustic and Content-Based Gender in Speech-to-Speech ModelsarXiv:2609.09263Xiaoqun Liu, Tanu Mitra, Harshit Rajgarhia +111 Sept 2026cs.SD89
NOPE-HYPE: A Structured Simulation Workflow for Robust Speech-to-Text Across Diverse Acoustic EnvironmentsarXiv:2609.10058Niramay M. Patel, Bibek Behera, Raksha Sharma11 Sept 2026cs.SD89
EVA-Bench: A New End-to-end Framework for Evaluating Voice AgentsarXiv:2605.13841Tara Bogavelli, Gabrielle Gauthier Melan\c{c}on, Katrina Stankiewicz +211 Sept 2026cs.SD89
PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video GenerationarXiv:2609.04867Yuchen Sun, Qian Yang, Jun Wang +211 Sept 2026cs.MM89
Omni Interaction Agent Technical ReportarXiv:2609.08977Orantqing, Shengpeng Ji, Junlong Tong +211 Sept 2026eess.AS89

16 results

Author lists and categories are copied from the paper's own metadata (arXiv, publisher). Each paper page shows the abstract, related models and every source snapshot.