001 Bridging Compute- and Data-Optimal Pretraining arXiv Paper Tian Qin et al. 3 days ago 002 SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving arXiv Paper Yihui Zhang et al. 4 days ago 003 A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever arXiv Paper Sietse Schelpe 5 days ago 004 Order in Desbordante: Techniques for Efficient Implementation of Order Dependency Discovery Algorithms arXiv Paper Yakov Kuzin et al. 5 days ago 005 FusionML: Prefill, Not Decode - Mechanism and Boundaries of CPU+GPU Co-Execution on Unified-Memory Apple Silicon arXiv Paper Om Mohite 7 days ago 006 Optimizing Transformer Neural Network for Real-Time Outlier Detection on FPGAs arXiv Paper Ilia Sobakinskikh et al. 7 days ago 007 Windowed-MTP: Removing the Full-Context Draft-KV Tax at Million-Token Context arXiv Paper Alagappan Valliappan Jul 23 008 BaseRT: Advancing Best-in-Class LLM Inference with Apple M5 Neural Accelerators arXiv Paper Fabian Waschkowski, Prabod Rathnayaka et al. Jul 21 009 Formulation-Level Auto-Tuning for QUBO-Based Machine Learning: A Case Study Across Multiple Quantum-Inspired Annealers arXiv Paper Naoya Mizuki, Takahiro Katagiri et al. Jul 21 010 SALT: Salience-Aware Lexical Trie for Long-Context Compression arXiv Paper Oteo Mamo, Hyunji Yi et al. Jul 20 011 AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows arXiv Paper Tejas Singh Anand, Yuet Ying Christina Wang et al. Jul 16 012 An Auto-Scaling Approach for Serverless Environments Based on a Multi-Expert Consensus Mechanism arXiv Paper Mobina Kashaniyan, M. Ashtiani et al. Jul 16 013 Toward Energy-Efficient and Low-Power Arrhythmia Detection for Wearable Devices arXiv Paper F. Bulten, Yawar Rasheed et al. Jul 16 014 Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel arXiv Paper Sietse Schelpe Jul 15 015 The Café in Amsterdam: When the Incumbent Becomes the Oracle arXiv Paper Augusto Camargo Jul 15 016 Decomposing Runtime, Kernel, and Quantization Speedups via a Matched FP16 Intermediate: A Hardware-Conditioned Case Study on Four NVIDIA RTX A5000 GPUs arXiv Paper Weijia Han, Lisha Qu Jul 13 017 Lightning Fast Matching Dependency Discovery with Desbordante arXiv Paper Alexey Shlyonskikh, Michael Sinelnikov et al. Jul 12 018 Attention to Detail: Evaluating Energy, Performance, and Accuracy Trade-offs Across vLLM Configurations arXiv Paper Nada Zine, Tristan Coignion et al. Jul 10 019 On-Device Adaptive Battery Power Prediction for Electric Vehicles arXiv Paper Avik Bhatnagar, Anton Paule et al. Jul 10 020 STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU arXiv Paper V. J. Jung, Gagandeep Singh et al. Jul 10 021 Memory Scarcity, Open Models, and the Restructuring of the AI Industry, 2026-2030 -- A quantitative scenario analysis of inference economics, training-cost divergence, and infrastructure solvency arXiv Paper Satoshi Matsuoka Jul 8 022 Energy-Efficient GPU DVFS for Fine-Tuning of SLMs on Resource-constrained Embedded Devices arXiv Paper Jurn-Gyu Park, S. Zholdybayev et al. Jul 7 023 Think Before You Grid-Search: Floor-First Triage for LLM Serving arXiv Paper Yihua Liu Jul 7 024 Adaptive Inference Batching using Policy Gradients arXiv Paper Ruslan Sharifullin Jul 6 025 Elastic Gang: Per-Token Membership Change for a Hard-Barriered LLM Inference Gang Co-Scheduled with OS Processes arXiv Paper Da-Hyun Son Jul 6 026 HiFA4: Training-Free 4-bit FlashAttention on Ascend HIF4 NPUs for LLM Inference arXiv Paper Huilin Dong, Yanzhao Li et al. Jul 5 027 Efficient Discovery of Conditional Dependencies with Desbordante arXiv Paper I. Kozhukov, D. Fedoseev et al. Jul 4 028 Energy-Aware System-Level Evaluation of Post-Quantum TLS on Embedded User Equipment over a Disaggregated 5G Network arXiv Paper Sanzida Hoque, Abdullah Aydeger Jul 4 029 Scalable Maximal Frequent Episode Mining with Desbordante arXiv Paper Maxim Ivanov, Matvei Smirnov et al. Jul 3 030 BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal arXiv Paper Prabod Rathnayaka, Fabian Waschkowski et al. Jul 1 031 LUMA: Benchmarking Segmentation via a Lightweight Universal Mask Adapter arXiv Paper T. Nauen, Anosh Billimoria et al. Jul 1 032 TraceLab: Characterizing Coding Agent Workloads for LLM Serving arXiv Paper Kan Zhu, Mathew Jacob et al. Jun 29 033 KernelSight-LM: A Kernel-Level LLM Inference Simulator arXiv Paper Xiteng Yao, Taeho Kim et al. Jun 26 034 Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving arXiv Paper Yasmin Moslem, Magdalena Kacmajor et al. Jun 25 035 Compiler-Driven Approximation Tuning for Hyperdimensional Computing arXiv Paper Xavier Routh, Abdul Rafae Noor et al. Jun 25 036 Axon: A Synthesizing Superoptimizer for Tensor Programs arXiv Paper Akash Kothari, Shaowei Zhu et al. Jun 24 037 SOLAR: AI-Powered Speed-of-Light Performance Analysis arXiv Paper Qijing Huang, S. Damani et al. Jun 24 038 TileMaxSim: IO-Aware GPU MaxSim Scoring with Dimension Tiling and Fused Product Quantization arXiv Paper Ashutosh Sharma Jun 24 039 AI-PAVE-Br: Leveraging Large Language Models for Enhanced Product Attribute Value Extraction through a Golden Set Approach arXiv Paper M. Gazzola, H. Souto et al. Jun 23 040 Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation arXiv Paper Sijie Wang, Zhengyu Qing et al. Jun 23 041 CrossPool: Efficient Multi-LLM Serving for Cold MoE Models through KV-Cache and Weight Disaggregation arXiv Paper Zhuoren Ye, Tianyu Wo et al. Jun 23 042 Power-Flexible AI Data Centers: A New Paradigm for Grid-Responsive Compute arXiv Paper Chris Williams, Philip Colangelo et al. Jun 23 043 Learning Filters with Certainty arXiv Paper Yuval Banoun, D. S. Menasché et al. Jun 22 044 The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing arXiv Paper Hang Yin, Kevin Wang Jun 22 045 Enabling Cloud-Level Accuracy in Edge AI through IoT Data Preprocessing arXiv Paper Aygun Varol, Katarzyna Kołodziej et al. Jun 21 046 Load Testing for Machine Learning Model Serving Systems at Scale arXiv Paper Amr S. Abdelfattah, Nakul Tirumalai et al. Jun 20 047 Does Mixture-of-Experts Actually Help Inference on Consumer and Edge Hardware? An Empirical Study arXiv Paper Alfarizy Alfarizy, H. Nguyen et al. Jun 19 048 UltraQuant: 4-bit KV Caching for Context-Heavy Agents arXiv Paper Inesh Chakrabarti, David Limpus et al. Jun 18 049 Balancing Bits and Drops: Stress-Adjusted Water Management for Data Centers arXiv Paper Zahidur Talukder et al. Jun 15 050 Fractional Verkle Trees: A Hypertree Decomposition and Verified Proof Serialization Architecture for High-Performance Blockchain State Accumulators arXiv Paper Ekleen Kaur, E. Fraga Jun 15 051 SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions arXiv Paper Feiyang Chen, Haibo Chen Jun 15 052 MADAR: An Address-Free Processor arXiv Paper Mohamed Amine Bergach Jun 14 053 Pseudonym Scheme Based on Hybrid Certificates for Security Credential Management System in Vehicular Communications arXiv Paper Abel C. H. Chen, F. Hwang et al. Jun 12 054 A Modern Large-Scale Memory Characterization Laboratory arXiv Paper Ataberk Olgun, Haocong Luo et al. Jun 11 055 GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving arXiv Paper Xinwei Qiang, Yifan Hu et al. Jun 11 056 The Price of Anarchy in Disaggregated Inference arXiv Paper Athos Georgiou Jun 11 057 AI Tokenomics: The Economics of Tokens, Computation, and Pricing in Foundation Models arXiv Paper Quanyan Zhu Jun 10 058 XPR: An Extensible Cross-Platform Point-Based Differentiable Renderer arXiv Paper Steve Rhyner et al. Jun 10 059 Energy-Efficient On-Device RAG on a Mobile NPU: System Design and Benchmark on Snapdragon X Elite arXiv Paper Zhiyuan Cheng, Longying Lai Jun 9 060 Flash-GMM: A Memory-Efficient Kernel for Scalable Soft Clustering arXiv Paper Gal Bloch, Ariel Gera et al. Jun 9