arxiv:2603.03790
Wang
Qinsi1
AI & ML interests
None yet
Recent Activity
upvoted a paper about 14 hours ago
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement submitted a paper about 14 hours ago
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement updated a model 8 days ago
SpyRL/SpyRL-Qwen3-4B-Summarization