·
AI & ML interests
NLP, RLHF, IR
Organizations
models 13
Makrrr/qwen3-8B-reasonmed-finetune-extreme
Text Generation
• 8B • Updated • 8
Makrrr/qwen2.5-7B-reasonmed-finetune-extreme
Text Generation
• 8B • Updated • 12
Makrrr/Qwen3-1.7B-GSM8K-GRPO-verl
Reinforcement Learning
• 2B • Updated • 11
• 3
Makrrr/a2c-PandaReachDense-v3
Reinforcement Learning
• Updated • 10
Reinforcement Learning
• Updated • 31
Makrrr/ppo-SnowballTarget
Reinforcement Learning
• Updated • 33
Makrrr/Pixelcopter-PLE-v0
Reinforcement Learning
• Updated Reinforcement Learning
• Updated Makrrr/dqn-SpaceInvadersNoFrameskip-v4
Reinforcement Learning
• Updated • 19
Reinforcement Learning
• Updated