Meera Joshi
mjoshi-01
ยท
AI & ML interests
self-play
Recent Activity
upvoted a paper 2 days ago
Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL upvoted a paper 2 days ago
RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling upvoted a paper 2 days ago
Nereus: Adaptive Parallelism for LLM Post-TrainingOrganizations
None yet