001 Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO arXiv Paper Xilin Jiang et al. Yesterday 002 MPEcho: A Melody and Phoneme-Aware Generative Framework for Controllable Cover Song Generation arXiv Paper Wei-Jaw Lee et al. 2 days ago 003 Voice Memory for Agentic Speech Recognition arXiv Paper Chao-Han Huck Yang et al. 2 days ago 004 Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model arXiv Paper Carlos Muñoz-Romero et al. 2 days ago 005 Depression Markers in Speech: An Approach based on Tract Variables Dynamics arXiv Paper Sahar Altalhi et al. 3 days ago 006 Device Invariance using Domain Adaptation on Acoustic Scene Classification arXiv Paper A. Dileep, Shubham Sharma et al. 3 days ago 007 VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment arXiv Paper S. Bauer, Sheila Seidel et al. 3 days ago 008 Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis arXiv Paper Yifan Hu et al. 4 days ago 009 Music-Source-Separation-Training (MSST): A Unified Framework for Training and Evaluating Music Demixing Models arXiv Paper Roman Solovyev et al. 6 days ago 010 PathRIR: Physics-Guided Acoustic Path Selection and Late-Tail Compensation for Fast Room Impulse Response Simulation arXiv Paper Shaoheng Xu et al. 6 days ago 011 MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond arXiv Paper Lorenzo Concina, Seraphina Fong et al. 7 days ago 012 VibeVoice-ASR-BitNet Technical Report arXiv Paper Songcheng Xu, Ting Song et al. Jul 23 013 Nonlinear Bias-Compensated Adaptive Filter and Its Application for Time-Series Prediction arXiv Paper Yi Peng, Haiquan Zhao et al. Jul 22 014 Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering arXiv Paper Junyu Dai, Xinyue Fan et al. Jul 22 015 FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration arXiv Paper ali boudaghi, Hadi Zare Jul 20 016 Robust Summarization of Doctor-Patient Conversations: TalTech Systems for the Beyond Transcription Challenge arXiv Paper Aivo Olev, Tanel Alumäe Jul 19 017 Staged Depth-Pruning Distillation of a Flow-Matching Text-to-Speech Teacher: A Compact Hindi Speech Synthesizer arXiv Paper Sivateja Trikutam Jul 19 018 RealDESED: A Real-World Domestic Sound Event Detection Benchmark arXiv Paper Florian Schmid, Paul Primus et al. Jul 18 019 A Situational Speech Synthesizer for Yoruba: System Design, Phonological Rule Architecture, and Orthographic Extensions for Contour arXiv Paper Kólá Túbosún, A. Oluokun et al. Jul 17 020 Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos arXiv Paper Sreyan Ghosh et al. Jul 17 021 Controlling Implicit Shortcut Reliance in L2 Spoken English Auto-markers arXiv Paper Shilin Gao, Mark J. F. Gales et al. Jul 17 022 Fretiq: Browser-Native Electric Guitar String Classification via Engineered Spectral Features and Held-Out Free-Play Evaluation arXiv Paper Aaditya Garg Jul 17 023 MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music arXiv Paper Scott H. Hawley Jul 16 024 WanSong v1.0 Technical Report arXiv Paper Binghui Chen et al. Jul 16 025 Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation arXiv Paper Joonyong Park, David M. Chan et al. Jul 15 026 Bring Music The Horizon: Music-Driven 360$^\circ$ Video Generation arXiv Paper Kai Hsu Tsai et al. Jul 15 027 Cover First, Disagree Softly: Rethinking Mismatch-First Active Learning for Frame-Level Audio Classification arXiv Paper Shiqi Zhang, Tuomas Virtanen Jul 15 028 Greedy Volume Maximization of Gradient Embeddings for Long-Tailed Frame-Level Bioacoustic Active Learning arXiv Paper Shiqi Zhang, Marius Faiß et al. Jul 15 029 Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models arXiv Paper Chun-Yi Kuan, Siwon Kim et al. Jul 15 030 Self-supervised Speech Comparison for L2 Phone, Rhythm, and Intonation Scoring arXiv Paper Stephen McIntosh, Reuben Smit et al. Jul 15 031 Efficient Text-to-Audio Generation via Pruning arXiv Paper Arshdeep Singh, Yiitan Yuan et al. Jul 14 032 PolarBM: Complex-valued Boltzmann Machine for Modeling Audio Signals in Polar and Log-polar Coordinates arXiv Paper Toru Nakashika, Kohei Yatabe Jul 14 033 The Sound of Absence: Audio-Language Embedding Models Struggle with Negation arXiv Paper Chun-Yi Kuan, Hung-yi Lee Jul 14 034 Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems arXiv Paper Sheng Li, Jing Li et al. Jul 13 035 Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video arXiv Paper Vikas Kumar, Aditya Mishra et al. Jul 13 036 Unified Gradient Projection: Language-Balanced Continual Learning for Multilingual Low-Resource ASR arXiv Paper Ziang Ren, Guodong Lin et al. Jul 13 037 GigaAM Multilingual: Foundation Model for Underrepresented Languages arXiv Paper Andrei Kuzmenko, A. Maximenko et al. Jul 11 038 GigaChat Audio: Time-aware Large Audio Language Model arXiv Paper Aleksandr Kutsakov, Mariia Sadovina et al. Jul 11 039 Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language Models arXiv Paper Yun-Shao Tsai, C. Chen et al. Jul 11 040 Hybrid Continual Learning for Low-Resource Australian Aboriginal Language Identification arXiv Paper Pravina Mylvaganam, T. Dang et al. Jul 11 041 Which Languages Transfer Best to Warlpiri? A Similarity-Based Study for Low-Resource ASR arXiv Paper Pravina Mylvaganam, E. Ambikairajah et al. Jul 11 042 A Production-Oriented Framework for Evaluation of SFX Generation arXiv Paper M. Desbos, Yara Bahram et al. Jul 10 043 Phone Segmentation and Recognition through Phonological Activation Mapping arXiv Paper Shikhar Bharadwaj, Kwanghee Choi et al. Jul 10 044 ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models arXiv Paper Sang-Hoon Lee, Ha-Yeong Choi Jul 10 045 On the Role of Conversational Timing in Synthetic Training Data for ASR arXiv Paper Máté Gedeon, Péter Mihajlik Jul 9 046 A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents arXiv Paper A. Sayyad, J. Emmons et al. Jul 8 047 Designing Maintainable Hybrid Generative Systems: A Quantum-Inspired Approach to Automated Music Harmony Generation arXiv Paper Josef Pavlíček Jul 7 048 TriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific Scenarios arXiv Paper Hongrui Lyu, Mingru Yang et al. Jul 7 049 WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS arXiv Paper Sihang Nie, Jinxin Ji et al. Jul 7 050 DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling arXiv Paper Wataru Nakata, Yuki Saito et al. Jul 6 051 ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions arXiv Paper Thomas Thebaud, Junhyeok Lee et al. Jul 6 052 Revisiting the Relation Between Language Model Perplexity and ASR Word Error Rate for Modern End-to-End Speech Recognition arXiv Paper Mohammad Zeineldeen, Albert Zeyer et al. Jul 6 053 SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models arXiv Paper Thomas Thebaud, Yuzhe Wang et al. Jul 6 054 Unified Audio Intelligence Without Regressing on Text Intelligence arXiv Paper Zhifeng Kong, Sang-gil Lee et al. Jul 6 055 DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech arXiv Paper Junwon Moon, Seungbeom Kim et al. Jul 5 056 Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization arXiv Paper Ryota Komatsu, Kota Kawakita et al. Jul 5 057 Weakly Guided and Autoregressive Beamformer Parameterization for Generalizable Moving Speaker Extraction in Higher-Order Ambisonics arXiv Paper Jakob Kienegger, Tal Peer et al. Jul 5 058 NouveauVoice: Generating Novel Pseudo Speakers for Voice Anonymization arXiv Paper Meiying Melissa Chen, Anastasia Kuznetsova et al. Jul 4 059 Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings arXiv Paper H. Martel, Joe Hennessy-Priest et al. Jul 4 060 TokAN: Accent Normalization Using Self-Supervised Speech Tokens arXiv Paper Qibing Bai, Shuai Wang et al. Jul 4