Library

Subject
Tags

113,720 matches · cs.CL

#
001(Towards) Scalable Reliable Automated Evaluation with Large Language ModelsarXivPaperBertil Braun et al.Yesterday
002A Sparse Glimpse of the Whole: Train-Free Self-Speculative DecodingarXivPaperYuesong Liu et al.Yesterday
003AI systems and the reproduction of (standard) language ideologies in World EnglishesarXivPaperKingsley UgwuanyiYesterday
004AISPA: User-Centric System Prompt Auditing for Large Language Model ApplicationsarXivPaperXiangning Lin et al.Yesterday
005AWARE-FX: An Auditable Knowledge-Guided AI System for Measuring Corporate Foreign-Exchange Hedging DisclosurearXivPaperQi WangYesterday
006AskChem: Claim-Centered Infrastructure for Chemistry Literature SynthesisarXivPaperBing Yan et al.Yesterday
007AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision VerificationarXivPaperHaobo Li et al.Yesterday
008Baikal: Structured Search for Deep Research over Data LakesarXivPaperDhruv Agarwal et al.Yesterday
009Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing EvaluationarXivPaperYuhang Zhu et al.Yesterday
010Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research ParadigmarXivPaperMing Wang et al.Yesterday
011Beyond Sentiment: Structured Information Extraction from Financial NewsarXivPaperDaohan Zhu et al.Yesterday
012Beyond Similarity: Grounded Agentic Extraction and Expert-Adjudicated Evaluation of Intertextuality in Classical Chinese HistoriesarXivPaperZhaoji Wang et al.Yesterday
013Beyond a Single Judge: Simulating Social Persona Panels for Generative UI EvaluationarXivPaperZheng Wu et al.Yesterday
014CACHE-UK: A Stability-Aware Memory Editor for Sequentially Updated Quantized LLMs in FinancearXivPaperAnubhav Lakra et al.Yesterday
015CDAE: Enhancing Perturbation Robustness in Pretrained Language Models with Contrastive DenoisingarXivPaperSina Heydari et al.Yesterday
016Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction GamearXivPaperNiklas Bauer et al.Yesterday
017Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning CapabilitiesarXivPaperLiangjie Zhao et al.Yesterday
018Can Large Language Models Execute Parent Orders?arXivPaperZane Shen et al.Yesterday
019Causal Discovery with Inverted Self-attention for Multivariate Time SeriesarXivPaperYusen Liu et al.Yesterday
020Challenges in annotations by humans and LLMs: A case study of evaluative languagearXivPaperMirela Imamovic et al.Yesterday
021Change2Task: From Repository Changes to Executable Coding Agent Tasks and EnvironmentsarXivPaperHaomin Qi et al.Yesterday
022ChronoMem: Version Control and Semantic Rollback for Large Language Model Agent MemoryarXivPaperYongye Su et al.Yesterday
023Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPOarXivPaperXilin Jiang et al.Yesterday
024Correlation between prosody and pragmatics: A case study of the discourse marker hālā `now' in PersianarXivPaperSoleiman Ghaderi et al.Yesterday
025Creative Transformation in Literary Texts: Modelling Change Across Representational LevelsarXivPaperIoana-Roxana Boriceanu et al.Yesterday
026DualAnchor: Preserving Language Priors and Improving Lexical Fidelity in Gloss-Free Sign Language TranslationarXivPaperHongbin Zhang et al.Yesterday
027EMBL AI Librarian: Life-Sciences Knowledge Layer for AI AgentsarXivPaperLuigi Sigillo et al.Yesterday
028Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential ActivationsarXivPaperPere Martra et al.Yesterday
029Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Data-Free Quality Guard Yet Invent Procedure Steps in Agentic ExecutionarXivPaperI. Kennedy et al.Yesterday
030FinSMART: Financial Sentiment Analysis for Algorithmic Trading through Market-Aligned Reinforcement LearningarXivPaperGiorgos Iacovides et al.Yesterday
031FinanceHarness: Autonomous Financial Deep Research FrameworkarXivPaperYijia Xiao et al.Yesterday
032From Single- to Cross-Document: Benchmarking Multi-Granularity Event Analysis of Large Language ModelsarXivPaperTao Wen et al.Yesterday
033Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning EngineeringarXivPaperJunlin Yang et al.Yesterday
034GGC: Selective Query Correction for Reliable Text-to-SPARQL GenerationarXivPaperZiyi Yang et al.Yesterday
035GLM-RAG: Graph Language Models for Graph-Based Retrieval-Augmented GenerationarXivPaperMaya Arseven et al.Yesterday
036Generative AI and linguistic diversity in academic writing and publishing: Perspectives from World EnglishesarXivPaperKingsley Ugwuanyi et al.Yesterday
037Gradient-free Task-Conditioned Retrieval for On-Device In-Context LearningarXivPaperXinyu Luo et al.Yesterday
038Harness-G: A Graph-Structured Harness for Search AgentsarXivPaperYanning Hou et al.Yesterday
039ICLE++: Modeling Fine-Grained Traits for Holistic Essay ScoringarXivPaperShengjie Li et al.Yesterday
040IFHierBench: Hierarchical Instruction Following for Large Language ModelsarXivPaperYuetian Mao et al.Yesterday
041Improving Mental Health Screening and Early Risk Detection in SpanisharXivPaperAndreu Casamayor-Segarra et al.Yesterday
042Inducing language models to assert their own consciousness restores human beliefs and valuesarXivPaperJunsol Kim et al.Yesterday
043LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language ModelsarXivPaperShuang Liang et al.Yesterday
044LLMs struggle to simulate human belief updates in controlled environmentsarXivPaperSebastian Pohl et al.Yesterday
045Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning ModelsarXivPaperYecheng Wu et al.Yesterday
046Looped Transformers with Source-Centered State EvolutionarXivPaperBum Jun Kim et al.Yesterday
047MORFES: A Benchmark for Productive Inflectional Competence in Modern GreekarXivPaperIoakeim Perros et al.Yesterday
048Measuring Alignment With Reader Highlights Net of Position and LengtharXivPaperKazuki Nakayashiki et al.Yesterday
049MemTxn: A Transaction Boundary for Source-Supported Updates and Complete-State Recovery in Agent MemoryarXivPaperHanshuai Cui et al.Yesterday
050Memory Decoder at Scale: A Pretrained, Parametric Long-Term MemoryarXivPaperRubin Wei et al.Yesterday
051Metaphor Tracer: A Theory-Informed Analysis of Hidden StatesarXivPaperMarc Heimann et al.Yesterday
052ORCA-bench: How Ready Are Language Model Agents for Oncall?arXivPaperAlbert Gong et al.Yesterday
053OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward ModelsarXivPaperQiushi Sun et al.Yesterday
054PCAP-LM: An LLM-Native Text Representation for TLS Bulk Traffic AnalysisarXivPaperXavier Marjou et al.Yesterday
055Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMsarXivPaperJinyi Liu et al.Yesterday
056RRM: Experience-Driven Reflective Retrieval Memory for Long-Horizon Multimodal ReasoningarXivPaperJingxiang Fan et al.Yesterday
057ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical ReasoningarXivPaperZhenrong Zhang et al.Yesterday
058Reasoning Consensus: Structural Ensembling of LLM Reasoning via Weighted DAG AggregationarXivPaperAmruta Parulekar et al.Yesterday
059Recall Before You Rank: Similarity-Guided Top-$K$ Reuse for Efficient Long-Context AttentionarXivPaperWenshuai Yao et al.Yesterday
060RepBench: Compiling Benchmarks into Capability Representations for Large Language ModelsarXivPaperYanshi Li et al.Yesterday

Showing 60 of 113,720 documents · scroll for more