Google · Adaptive Environment, Agent Training, Co-Evolution
NVIDIA, MIT, UC Berkeley · Edge Inference, MoE Serving, Bandwidth-Adaptive
Meta, University of Washington, MIT · Self-Play RL, Environment Design, Open-Ended Learning
Huawei, CUHK · Coding Agent RL, Harness Alignment, Reward Hacking Defense
Tencent · LLM API Audit, Black-Box Verification, Fidelity Loss
USTC · Video Generation, Task Completion, Semantic Grounding
UCSD, Northeastern University · Multi-Reward RL, Saturation-Aware, Adaptive Optimization
USTC · Terminal Agent Training, Task Synthesis, Executable Verification
Midea AI · PLC Code Generation, Verification-Gated, Industrial Automation
UCSD · Unsupervised RL, Multi-Agent, Diverse Cohort