Library

Subject
Tags

2,047 matches · Parallel Computing and Optimization Techniques

#
001Hayula Gateway: A Unified OpenAI-Compatible API Layer for Multi-Model Local InferenceOpenAlexPaperYahya Saqban7 days ago
002Hayula Gateway: A Unified OpenAI-Compatible API Layer for Multi-Model Local InferenceOpenAlexPaperYahya Saqban7 days ago
003I/o for LLM inference: a survey of storage and memory bottlenecksOpenAlexPaperRajarshi Chowdhury7 days ago
004Run inferenceOpenAlexPaperYahya Saqban7 days ago
005Run inferenceOpenAlexPaperYahya Saqban7 days ago
006AIEAnalyzer: An Analytical Framework for Versal AI Engine Performance AnalysisOpenAlexPaperXinya Luan, Zhe Lin et al.Jul 23
007CoDSA: A Hybrid Tensor Compilation Framework Integrating Coordinate Descent with Dynamic Simulated AnnealingOpenAlexPaperRuiting Sun, Honglu He et al.Jul 23
008A Curvature-Aware Rank-Adaptive Distributed Augmented-Lagrangian Solver for Large-Scale SDPsOpenAlexPaperHongpei Li, Huikang Liu et al.Jul 20
009Banya AI 5: Cache-Dictionary Tokenization and Dynamic Embedding - Near-Free Vocabulary Expansion via a Low-Rank HeadOpenAlexPaperHyukjin HanJul 20
010Banya AI 5: Cache-Dictionary Tokenization and Dynamic Embedding - Near-Free Vocabulary Expansion via a Low-Rank HeadOpenAlexPaperHyukjin HanJul 20
011MoOE (mixture of optimized experts) : Bounded Expert Streaming and Neural Orchestration for Sub-Latency Sparse MoE Inference on Consumer HardwareOpenAlexPaperDwij ShuklaJul 20
012MoOE (mixture of optimized experts) : Bounded Expert Streaming and Neural Orchestration for Sub-Latency Sparse MoE Inference on Consumer HardwareOpenAlexPaperDwij ShuklaJul 20
013Banya AI 5: Cache-Dictionary Tokenization and Dynamic Embedding - Near-Free Vocabulary Expansion via a Low-Rank HeadOpenAlexPaperHyukjin HanJul 17
014TetraNet: Power-of-Two Quaternary Weights for Small Decoder-Only Language ModelsOpenAlexPaperAbhishek ShindeJul 17
015TetraNet: Power-of-Two Quaternary Weights for Small Decoder-Only Language ModelsOpenAlexPaperAbhishek ShindeJul 17
016A new modelling approach of SEPIC converters in the unified delta domain using boobie courtship optimisation algorithmOpenAlexPaperNeha Rani, Souvik Ganguli et al.Jul 16
017Banya AI 5: Cache-Dictionary Tokenization and Dynamic Embedding , Near-Free Vocabulary Expansion via a Low-Rank HeadOpenAlexPaperHyukjin HanJul 16
018Banya AI 5: Cache-Dictionary Tokenization and Dynamic Embedding , Near-Free Vocabulary Expansion via a Low-Rank HeadOpenAlexPaperHyukjin HanJul 16
019Banya AI 5: Cache-Dictionary Tokenization and Dynamic Embedding - Near-Free Vocabulary Expansion via a Low-Rank HeadOpenAlexPaperHyukjin HanJul 16
020Banya AI 5: Cache-Dictionary Tokenization and Dynamic Embedding - Near-Free Vocabulary Expansion via a Low-Rank HeadOpenAlexPaperHyukjin HanJul 16
021Pluto-Genesis: Reliable QLoRA Fine-Tuning on Ephemeral Compute with Cross-Session Checkpoint Recovery for Sub-1B Language ModelsOpenAlexPaperSiddharth N.RJul 15
022Pluto-Genesis: Reliable QLoRA Fine-Tuning on Ephemeral Compute with Cross-Session Checkpoint Recovery for Sub-1B Language ModelsOpenAlexPaperSiddharth N.RJul 15
023HeteroMosaic: Exposing and Exploiting Heterogeneous Execution Opportunities for Energy-Efficient Edge LLM InferenceOpenAlexPaperGregory Hyegang Jun, Wesley Pang et al.Jul 14
024SynapticOS: An Inference-First Runtime Architecture for Neural Processing Units on Resource-Constrained MicrocontrollersOpenAlexPaperDimitrios KafetzisJul 14
025Evaluating large language model compression: a comparative analysis on state-of-the-art models across diverse hardware platformsOpenAlexPaperDominik Hildebrand, Benjamin Kiefer et al.Jul 12
026IRONSmith: A Visual Dataflow Design Environment for AMD Ryzen AI NPUsOpenAlexPaperBrock Sorenson, Samer Ali et al.Jul 12
027Scaling Attention Beyond GPUs for LLM InferenceOpenAlexPaperWeishu Deng, Yujie Yang et al.Jul 11
028FRC 700.777 v1.0 - μ Registers: A Nested Scope Model for Scale-Declared ReciprocityOpenAlexPaperHadi ServatJul 10
029FRC 700.777 v1.0 - μ Registers: A Nested Scope Model for Scale-Declared ReciprocityOpenAlexPaperHadi ServatJul 10
030Integrating AutoML and FPGA Deployment: A Pipeline for Model Selection and Hardware-Aware ImplementationOpenAlexPaperYryskeldi Siddi, Giorgio Delzanno et al.Jul 10
031Adaptive Row Selection Meets Asynchrony in Randomized KaczmarzOpenAlexPaperEvan ColemanJul 9
032Non-Bijunctive Permutation Collapse: AltiVec vec_perm Enables Single-Cycle Attention Path Selection for LLM InferenceOpenAlexPaperScott BoudreauxJul 9
033Revisiting the Inference Time Optimization of TinyML for ARM-Based MicrocontrollersOpenAlexPaperC H Lee, Seung-Ryeol Ohk et al.Jul 8
034ThermoDSE: A Thermal-Aware and Comprehensive Design Space Exploration for Chiplet-Based DNN AcceleratorsOpenAlexPaperJie Peng, Hanwei Fan et al.Jul 8
035MatrixFSDP: communication-free matrix optimizers under ZeRO-3 parameter shardingOpenAlexPaperMing Gao, Yanwu Xu et al.Jul 7
036The PRNG Trap in Browser Simulations: Why Same-Seed Reproducibility Fails Across Language Boundaries and a Pattern That WorksOpenAlexPaperDiana ŢicudeanJul 7
037The PRNG Trap in Browser Simulations: Why Same-Seed Reproducibility Fails Across Language Boundaries and a Pattern That WorksOpenAlexPaperDiana ŢicudeanJul 7
038Communication-Aware Placement and Pruning for Efficient Mixture-of-Experts InferenceOpenAlexPaperXiao Shi, Yingying Sun et al.Jul 6
039Direct Model State Migration for Elastic Training of Large Language ModelsOpenAlexPaperWeijian Liu, Mingzhen Li et al.Jul 6
040Cross-Layer Resource Optimization for Ultra-Low-Power TinyML Inference on ARM Cortex-M MicrocontrollersOpenAlexPaperA Alanazi, Haifa A. Alanazi et al.Jul 3
041ET: An Energy Efficient Edge Transformer ArchitectureOpenAlexPaperShashank Nag, Alan T. L. Bacellar et al.Jul 3
042Attention-based neural network for storage ring orbit feedback with intrinsic fault toleranceOpenAlexPaperTao He, K Chen et al.Jul 2
043Attention-based neural network for storage ring orbit feedback with intrinsic fault toleranceOpenAlexPaperTao He, K Chen et al.Jul 2
044DANMP: Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing ArchitectureOpenAlexPaperHuize Li, Qinggang Wang et al.Jul 2
045From Published Claims to Constrained Deployment: A Reproducible Benchmark of Modern Detection and Segmentation Models on Commodity CPUsOpenAlexPaperSergio Duarte-InguanzoJul 2
046From Published Claims to Constrained Deployment: A Reproducible Benchmark of Modern Detection and Segmentation Models on Commodity CPUsOpenAlexPaperSergio Duarte-InguanzoJul 2
047HPMD: Enabling Hybrid Parallelism with Multi-Dimensional Adaptive DNN TrainingOpenAlexPaperGyeongchan Yun, Young-ri ChoiJul 2
048A Rate-Distortion Function for Model MergingOpenAlexPaperSankalp Pathak, Sanjay GargJul 1
049CM-Galaxy: A Sub-Quadratic, Attention-Free Backbone for Cheap Long-Context Modeling (Teaser v0)OpenAlexPaperMandeep SinghJul 1
050CM-Galaxy: A Sub-Quadratic, Attention-Free Backbone for Cheap Long-Context Modeling (Teaser v0)OpenAlexPaperMandeep SinghJul 1
051High‐Performance <scp>GPU</scp> Techniques for <scp>2D</scp> Convolution Operators in Deep Neural NetworksOpenAlexPaperHui Wei, Enjie Liu et al.Jul 1
052White-Box Execution Refactoring of Transformers for Lower EnergyOpenAlexPaperEnrique Alba, Hector D. MenendezJul 1
053An Energy Characterization Study of ML operators in XNNPACK on RISC-V Vector HardwareOpenAlexPaperRuimin Shi, Samuel Miksits et al.Jun 30
054BIT-DGC Layer 4 — Master Note v2.1: Dynamic Geometric ComputingOpenAlexPaperBùi Quang TrịnhJun 30
055BIT-DGC Layer 4 — Master Note v2.1: Dynamic Geometric ComputingOpenAlexPaperBùi Quang TrịnhJun 30
056Optimized Design of Camellia for GPU : CTR, GCM, and Exhaustive Key SearchOpenAlexPaperSi-Woo Eum, Min-Ho Song et al.Jun 30
057Understanding the Performance of Deep Computer Vision Models: A Symbolic Regression Approach to Accuracy and Latency PredictionOpenAlexPaperDivyesh Rameshbhai Dhanani, Faraz Kayani et al.Jun 27
058MultiBeeSketch: A Pure Integer Neuromorphic Architecture for Real-Time Streaming PredictionsOpenAlexPaperFarnadi BadrJun 26
059MultiBeeSketch: A Pure Integer Neuromorphic Architecture for Real-Time Streaming PredictionsOpenAlexPaperFarnadi BadrJun 26
060virtughan: A Virtual Computation Cube for EO Data Using On-the-Fly Tiling ComputationOpenAlexPaperKshitij Sharma, Upendra OliJun 24

Showing 60 of 2,047 documents · scroll for more