tiny-hcx-model/tiny-random-HyperCLOVAXVisionV2ForConditionalGeneration 8.28M • Updated 3 days ago • 15
tiny-hcx-model/tiny-random-HyperCLOVAXVisionV2ForConditionalGeneration 8.28M • Updated 3 days ago • 15
naver-hyperclovax/HyperCLOVAX-SEED-Think-32B Image-Text-to-Text • 33B • Updated 4 days ago • 12.9k • 405
Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients Paper • 2606.18216 • Published Jun 16 • 65
Running 15 Multilingual Tokenizer Leaderboard 📚 15 Evaluating and comparing tokenizers of language models
Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR Paper • 2509.02522 • Published Sep 2, 2025 • 26
Self-Improving Language Models with Bidirectional Evolutionary Search Paper • 2605.28814 • Published May 27 • 63
DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning Paper • 2605.25604 • Published May 25 • 139
SkillOpt: Executive Strategy for Self-Evolving Agent Skills Paper • 2605.23904 • Published May 22 • 265
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information Paper • 2605.11609 • Published May 12 • 196