Recent Videos

From Reward Learning to Leaderboards: Uncertainty Quantification for LLMs under Heterogeneous Human Feedback

Will Wei Sun
April 21, 2026

From Offline to Low-Adaptive Reinforcement Learning

Yu-Xiang Wang
April 21, 2026

Demystifying Group Relative Policy Optimization: Its Policy Gradient is a U-Statistic

Chengchun Shi
April 21, 2026

Automated hypothesis validation with agentic sequential falsifications

Ying Jin
April 20, 2026

Reinforcement Learning For Individual Optimal Policy From Heterogeneous Data

Annie Qu
April 20, 2026

Sampler Stochasticity in Training Diffusion Models for RLHF

Wenpin Tang
April 20, 2026

Conditional Diffusion Guidance under Hard Constraint: A Stochastic Analysis Approach

Renyuan Xu
April 20, 2026

Learning to Answer from Correct Demonstrations

Nathan Srebro
April 20, 2026

Deep Transfer Offline Q-Learning under Nonstationary Environments

Jianqing Fan
April 20, 2026