arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

2026-06-10 至 2026-06-10 共收录 3
2606.09475 2026-06-10 cs.AI cs.LG 版本更新

Emergent alignment and the projectability of ethical personas

涌现对齐与伦理人格的可投射性

Guillermo Del Pinal, Youngchan Lee, Calum McNamara, Alejandro Perez Carballo

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

AI总结 研究微调大语言模型在窄任务上如何引发广泛对齐行为,通过宪法AI方法赋予模型伦理人格,发现窄对齐可投射到未训练类别,并提出对齐策略应评估可投射性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12542 2026-06-10 cs.LG cs.AI 版本更新

Exploring Accurate and Transparent Domain Adaptation in Predictive Healthcare via Concept-Grounded Orthogonal Inference

探索预测性医疗中基于概念正交推理的准确且透明的域适应

Pengfei Hu, Chang Lu, Feifan Liu, Yue Ning

机构 * Department of Computer Science, Stevens Institute of Technology, Hoboken, NJ, United States(斯蒂文斯理工学院计算机科学系) UMass Chan Medical School, University of Massachusetts Amherst, Amherst, MA, United States(马萨诸塞大学阿默斯特分校UMass Chan医学学校)

AI总结 提出ExtraCare模型,通过将患者表示分解为不变和协变分量并强制正交,在保留标签信息的同时暴露域特定变异,实现准确预测并提供基于医疗概念的可解释性。

Comments Accepted by ICML 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02603 2026-06-10 cs.CL 版本更新

CGES: Confidence-Guided Early Stopping for Efficient and Accurate Self-Consistency

CGES:面向高效准确自一致性的置信引导早停方法

Ehsan Aghazadeh, Ahmad Ghasemi, Hedyeh Beyhaghi, Hossein Pishro-Nik

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 提出贝叶斯框架CGES,通过自适应停止采样减少自一致性推理调用次数,在5个推理基准上平均减少58%调用且精度损失仅0.4个百分点。

Comments Extended version. A preliminary version was accepted at the Efficient Reasoning Workshop @ NeurIPS 2025. Code: https://github.com/EhsanAghazadeh/cges

详情

展开后加载摘要…

URL PDF HTML 收藏