AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models

Abstraction--the ability to recognize and distill essential computational patterns from complex problem statements--is a foundational skill in computer science, critical both for human problem-solvers and coding-oriented large language models (LLMs). Despite recent advances in training LLMs for code generation using reinforcement learning (RL), most existing approaches focus primarily on superficial pattern recognition, overlooking explicit training for abstraction. In this study, we propose AR2 (Adversarial Reinforcement Learning for Abstract Reasoning), a novel framework explicitly designed to enhance the abstraction abilities of LLMs. AR2 employs a teacher model to transform kernel problems into narrative-rich, challenging descriptions without changing their fundamental logic. Simultaneously, a student coding model is trained to solve these complex narrative problems by extracting their underlying computational kernels. Experimental results demonstrate that AR2 substantially improves the student model's accuracy on previously unseen, challenging programming tasks, underscoring abstraction as a key skill for enhancing LLM generalization.

Paper

References (14)

08EvaluatingLarge LanguageModelsTrainedonCode2021 · arXiv
092025. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement LearningarXiv
102023. Execution-based code generation using deep reinforcement learningarXiv preprint
112022. Generating Programming Puzzles to Train Language ModelsWork-shop
122024.DeepSeek-Math:PushingtheLimitsofMathematicalReasoninginOpenLanguageModels

Scroll for more · 2 remaining

Similar papers

© 2026 NYSGPT2525 LLC