arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

2026-08-05 至 2026-08-05 共收录 4
2608.01463 2026-08-05 cs.AI cs.MA 版本更新

Where Reasoning Diverges: Localized Multi-Agent Debate for Multi-Hop Question Answering

推理分歧之处:本地化多智能体辩论

Weijun Gao, Xiang Ding, Haoyang Liu, Tiancheng Xing

机构 * The Chinese University of Hong Kong(香港中文大学) Nagoya University(名古屋大学) Institute of Science Tokyo(东京科学大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对多智能体辩论冗余交换完整推理轨迹的问题,提出LMAD协议,通过定位冲突并限制辩论范围,在十个骨干模型上实现宏平均评判准确率提升7.20个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08044 2026-08-05 cs.LG cs.AI cs.CL 版本更新

When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

当行为安全评估失败时:表征层面的视角

Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Technical University of Denmark(丹麦技术大学)

AI总结 本文提出行为安全与干预鲁棒性之间的“审计差距”,通过构建解离模型和引入潜在脆弱性评分(LVS),证明行为安全指标不足以衡量表征层面的鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20956 2026-08-05 cs.LG cs.CY 版本更新

A Deployment Audit of Release-Side Risk in Conformal Triage under Prevalence Shift

发布侧风险的符合性分诊部署审计

Chengze Li, Xiao Liu, Hanrong Zhang, Haiyang Peng, Yanghao Ruan, Huanhuan Ma, Chunyu Miao, Qichao Zhou, Xiangrong Qi, Philip Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Manteia Technologies Co., Ltd(Manteia技术有限公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出了一种泄漏感知的发布侧符合性分诊审计方法,用于评估在患病率变化下,是否真正经历目标事件的患者被释放而无需审查,通过将目标主体分为三个非重叠角色来评估发布直接安全性。

Comments 20 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25077 2026-08-05 cs.AI 版本更新

Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective

在弱到强对齐中评估风险:从偏差-方差视角出发

Hamid Osooli, Kareema Batool, Rick Gentry, Tiasa Singha Roy, Ashwin Gupta, Anirudha Ramesh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软) InstaDeep New York University(纽约大学)

AI总结 本文从偏差-方差视角分析弱到强对齐的风险,通过连续置信度分数研究经验组件,发现强模型方差是欺骗的主要预测因素,表明弱强依赖性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏