arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

2026-06-01 至 2026-06-01 共收录 5
2605.30903 2026-06-01 cs.LG cs.AI

Inverse Reinforcement Learning without an Optimal Demonstrator: A Feasible Reward Set Approach

无最优演示者的逆强化学习:一种可行奖励集方法

Kihyun Kim, Shripad Deshmukh, Nikos Vlassis, Jiawei Zhang

机构 * MIT LIDS(麻省理工学院媒体实验室) University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) Adobe Research(Adobe研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 针对多个非最优演示者数据,提出可行奖励集框架,通过线性约束联合可行集单调收缩,并给出恢复保证与高维环境离线算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30834 2026-06-01 cs.RO cs.AI

Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring

轨迹中的捉迷藏:发现VLA运行时监控的失败信号

Seongheon Park, Wendi Li, Changdae Oh, Samuel Yeh, Zsolt Kira, Michael Hagenow, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出Hide-and-Seek框架,通过轨迹间和轨迹内对比学习,从轨迹级监督中定位失败指示动作,实现无需步骤标注的VLA模型运行时失败检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27912 2026-06-01 cs.CR cs.DS cs.LG

Privately Estimating Monotone Statistics in Polynomial Time

多项式时间内私有估计单调统计量

Gavin Brown, Ephraim Linder, Mahbod Majid, Vikrant Singhal

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Boston University(波士顿大学) MIT Mathematics(麻省理工学院数学系) University of Copenhagen(哥本哈根大学)

AI总结 针对单调统计量的差分隐私估计,提出一种改进的子采样-聚合算法,在样本复杂度上节省因子t,运行时间增加因子e^t,并证明其最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06831 2026-06-01 cs.LG cs.AI

Why DDIM Hallucinates More Than DDPM: A Theoretical Analysis of Reverse Dynamics

为什么DDIM比DDPM更容易产生幻觉:反向动力学的理论分析

Muhammad H. Ashiq, Samanyu Arora, Abhinav N. Harish, Ishaan Kharbanda, Hung Yun Tseng, Grigorios G. Chrysos

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 通过理论分析高斯混合目标下的反向ODE(DDIM)和SDE(DDPM),证明在临界时间τ后DDIM会卡在两个最近模式之间的线段上,而DDPM的随机性帮助其脱离该区域从而避免幻觉。

Comments Accepted in ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25110 2026-06-01 cs.CL

DEBATE: A Large-Scale Benchmark for Evaluating Opinion Dynamics in Role-Playing LLM Agents

DEBATE:用于评估角色扮演LLM代理中观点动态的大规模基准

Yun-Shiuan Chuang, Ruixuan Tu, Chengtao Dai, You Li, Smit Vasani, Binwei Yao, Michael Henry Tessler, Sijia Yang, Dhavan Shah, Robert Hawkins, Junjie Hu, Timothy T. Rogers

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学)

AI总结 提出DEBATE基准,通过多轮公共消息和Likert量表信念数据,评估多代理角色扮演LLM模拟中观点动态的真实性,发现零样本设置下代理组过度收敛,而监督微调可改善立场对齐并减少组级收敛误差。

详情

展开后加载摘要…

URL PDF HTML 收藏