arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

2026-04-22 至 2026-04-22 共收录 3
2601.07663 2026-04-22 cs.AI cs.CL

Reasoning Models Will Sometimes Lie About Their Reasoning

推理模型有时会谎称其推理过程

William Walden, Miriam Wanner

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究探讨了在模型被明确提示可能接收异常输入的情况下,推理模型的忠实性。发现尽管提示能提升原有指标,但新提出的更细致指标显示模型常否认使用提示,挑战了推理监控和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18797 2026-04-22 cs.CV

CrossPan: A Comprehensive Benchmark for Cross-Sequence Pancreas MRI Segmentation and Generalization

CrossPan:跨序列胰腺MRI分割与泛化的综合性基准

Linkai Peng, Cuiling Sun, Zheyuan Zhang, Wanying Dou, Halil Ertugrul Aktas, Andrea M Bejar, Elif Keles, Tamas Gonda, Michael B Wallace, Zongwei Zhou, Gorkem Durak, Rajesh N Keswani, Ulas Bagci

机构 * Department of Radiology, Northwestern University(西北大学放射科) Department of Electrical and Computer Engineering, Northwestern University(西北大学电气与计算机工程系) Department of Computer Science, Northwestern University(西北大学计算机科学系) Department of Gastroenterology, New York University(纽约大学消化内科部) Division of Gastroenterology and Hepatology, Mayo Clinic in Florida(佛罗里达梅奥诊所消化内科与肝病学部) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Departments of Gastroenterology and Hepatology, Northwestern University(西北大学消化内科与肝病学部)

AI总结 研究揭示跨序列泛化是胰腺MRI分割临床应用的主要障碍,指出跨序列域偏移比跨中心差异更严重,且现有方法在物理驱动对比反转下效果有限,半监督学习在稳定强度分布下有提升但不稳定。

Comments Accepted to MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08240 2026-04-22 cs.CL

The Alignment Waltz: Jointly Training Agents to Collaborate for Safety

对齐之舞:联合训练代理以安全协作

Jingyu Zhang, Haozhu Wang, Eric Michael Smith, Sid Wang, Amr Sharaf, Mahesh Pasupuleti, Benjamin Van Durme, Daniel Khashabi, Jason Weston, Hongyuan Zhan

机构 * Meta Superintelligence Labs(Meta超智能实验室) Johns Hopkins University(约翰·霍普金斯大学)

AI总结 本文提出WaltzRL框架,通过联合训练对话代理和反馈代理,解决LLM在安全与帮助性间的平衡问题,实验表明其有效降低不安全响应和过度拒绝率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏