Library

Subject
Tags

13,518 matches · eess.AS

#
001Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPOarXivPaperXilin Jiang et al.Yesterday
002MPEcho: A Melody and Phoneme-Aware Generative Framework for Controllable Cover Song GenerationarXivPaperWei-Jaw Lee et al.2 days ago
003Voice Memory for Agentic Speech RecognitionarXivPaperChao-Han Huck Yang et al.2 days ago
004Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS ModelarXivPaperCarlos Muñoz-Romero et al.2 days ago
005Depression Markers in Speech: An Approach based on Tract Variables DynamicsarXivPaperSahar Altalhi et al.3 days ago
006Device Invariance using Domain Adaptation on Acoustic Scene ClassificationarXivPaperA. Dileep, Shubham Sharma et al.3 days ago
007VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge DeploymentarXivPaperS. Bauer, Sheila Seidel et al.3 days ago
008Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech SynthesisarXivPaperYifan Hu et al.4 days ago
009Music-Source-Separation-Training (MSST): A Unified Framework for Training and Evaluating Music Demixing ModelsarXivPaperRoman Solovyev et al.6 days ago
010PathRIR: Physics-Guided Acoustic Path Selection and Late-Tail Compensation for Fast Room Impulse Response SimulationarXivPaperShaoheng Xu et al.6 days ago
011MEUSLI: a Multilingual Projector for LLM-based ASR and BeyondarXivPaperLorenzo Concina, Seraphina Fong et al.7 days ago
012VibeVoice-ASR-BitNet Technical ReportarXivPaperSongcheng Xu, Ting Song et al.Jul 23
013Nonlinear Bias-Compensated Adaptive Filter and Its Application for Time-Series PredictionarXivPaperYi Peng, Haiquan Zhao et al.Jul 22
014Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching RenderingarXivPaperJunyu Dai, Xinyue Fan et al.Jul 22
015FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory IntegrationarXivPaperali boudaghi, Hadi ZareJul 20
016Robust Summarization of Doctor-Patient Conversations: TalTech Systems for the Beyond Transcription ChallengearXivPaperAivo Olev, Tanel AlumäeJul 19
017Staged Depth-Pruning Distillation of a Flow-Matching Text-to-Speech Teacher: A Compact Hindi Speech SynthesizerarXivPaperSivateja TrikutamJul 19
018RealDESED: A Real-World Domestic Sound Event Detection BenchmarkarXivPaperFlorian Schmid, Paul Primus et al.Jul 18
019A Situational Speech Synthesizer for Yoruba: System Design, Phonological Rule Architecture, and Orthographic Extensions for ContourarXivPaperKólá Túbosún, A. Oluokun et al.Jul 17
020Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex VideosarXivPaperSreyan Ghosh et al.Jul 17
021Controlling Implicit Shortcut Reliance in L2 Spoken English Auto-markersarXivPaperShilin Gao, Mark J. F. Gales et al.Jul 17
022Fretiq: Browser-Native Electric Guitar String Classification via Engineered Spectral Features and Held-Out Free-Play EvaluationarXivPaperAaditya GargJul 17
023MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic MusicarXivPaperScott H. HawleyJul 16
024WanSong v1.0 Technical ReportarXivPaperBinghui Chen et al.Jul 16
025Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech EvaluationarXivPaperJoonyong Park, David M. Chan et al.Jul 15
026Bring Music The Horizon: Music-Driven 360$^\circ$ Video GenerationarXivPaperKai Hsu Tsai et al.Jul 15
027Cover First, Disagree Softly: Rethinking Mismatch-First Active Learning for Frame-Level Audio ClassificationarXivPaperShiqi Zhang, Tuomas VirtanenJul 15
028Greedy Volume Maximization of Gradient Embeddings for Long-Tailed Frame-Level Bioacoustic Active LearningarXivPaperShiqi Zhang, Marius Faiß et al.Jul 15
029Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language ModelsarXivPaperChun-Yi Kuan, Siwon Kim et al.Jul 15
030Self-supervised Speech Comparison for L2 Phone, Rhythm, and Intonation ScoringarXivPaperStephen McIntosh, Reuben Smit et al.Jul 15
031Efficient Text-to-Audio Generation via PruningarXivPaperArshdeep Singh, Yiitan Yuan et al.Jul 14
032PolarBM: Complex-valued Boltzmann Machine for Modeling Audio Signals in Polar and Log-polar CoordinatesarXivPaperToru Nakashika, Kohei YatabeJul 14
033The Sound of Absence: Audio-Language Embedding Models Struggle with NegationarXivPaperChun-Yi Kuan, Hung-yi LeeJul 14
034Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic SystemsarXivPaperSheng Li, Jing Li et al.Jul 13
035Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in VideoarXivPaperVikas Kumar, Aditya Mishra et al.Jul 13
036Unified Gradient Projection: Language-Balanced Continual Learning for Multilingual Low-Resource ASRarXivPaperZiang Ren, Guodong Lin et al.Jul 13
037GigaAM Multilingual: Foundation Model for Underrepresented LanguagesarXivPaperAndrei Kuzmenko, A. Maximenko et al.Jul 11
038GigaChat Audio: Time-aware Large Audio Language ModelarXivPaperAleksandr Kutsakov, Mariia Sadovina et al.Jul 11
039Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language ModelsarXivPaperYun-Shao Tsai, C. Chen et al.Jul 11
040Hybrid Continual Learning for Low-Resource Australian Aboriginal Language IdentificationarXivPaperPravina Mylvaganam, T. Dang et al.Jul 11
041Which Languages Transfer Best to Warlpiri? A Similarity-Based Study for Low-Resource ASRarXivPaperPravina Mylvaganam, E. Ambikairajah et al.Jul 11
042A Production-Oriented Framework for Evaluation of SFX GenerationarXivPaperM. Desbos, Yara Bahram et al.Jul 10
043Phone Segmentation and Recognition through Phonological Activation MappingarXivPaperShikhar Bharadwaj, Kwanghee Choi et al.Jul 10
044ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion ModelsarXivPaperSang-Hoon Lee, Ha-Yeong ChoiJul 10
045On the Role of Conversational Timing in Synthetic Training Data for ASRarXivPaperMáté Gedeon, Péter MihajlikJul 9
046A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice AgentsarXivPaperA. Sayyad, J. Emmons et al.Jul 8
047Designing Maintainable Hybrid Generative Systems: A Quantum-Inspired Approach to Automated Music Harmony GenerationarXivPaperJosef PavlíčekJul 7
048TriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific ScenariosarXivPaperHongrui Lyu, Mingru Yang et al.Jul 7
049WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTSarXivPaperSihang Nie, Jinxin Ji et al.Jul 7
050DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language ModelingarXivPaperWataru Nakata, Yuki Saito et al.Jul 6
051ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding DistributionsarXivPaperThomas Thebaud, Junhyeok Lee et al.Jul 6
052Revisiting the Relation Between Language Model Perplexity and ASR Word Error Rate for Modern End-to-End Speech RecognitionarXivPaperMohammad Zeineldeen, Albert Zeyer et al.Jul 6
053SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language ModelsarXivPaperThomas Thebaud, Yuzhe Wang et al.Jul 6
054Unified Audio Intelligence Without Regressing on Text IntelligencearXivPaperZhifeng Kong, Sang-gil Lee et al.Jul 6
055DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-SpeecharXivPaperJunwon Moon, Seungbeom Kim et al.Jul 5
056Speaker-Disentangled Chunk-Wise Regression for Syllabic TokenizationarXivPaperRyota Komatsu, Kota Kawakita et al.Jul 5
057Weakly Guided and Autoregressive Beamformer Parameterization for Generalizable Moving Speaker Extraction in Higher-Order AmbisonicsarXivPaperJakob Kienegger, Tal Peer et al.Jul 5
058NouveauVoice: Generating Novel Pseudo Speakers for Voice AnonymizationarXivPaperMeiying Melissa Chen, Anastasia Kuznetsova et al.Jul 4
059Probing Low-Level Acoustic Attribute Encoding in CLAP Audio EmbeddingsarXivPaperH. Martel, Joe Hennessy-Priest et al.Jul 4
060TokAN: Accent Normalization Using Self-Supervised Speech TokensarXivPaperQibing Bai, Shuai Wang et al.Jul 4

Showing 60 of 13,518 documents · scroll for more