arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

2026-08-14 至 2026-08-14 共收录 4
2604.17299 2026-08-14 cs.CL cs.AI 版本更新

Cat-DPO: Category-Adaptive Safety Alignment

Cat-DPO:基于类别的安全对齐

Tiankai Yang, Yi Nian, Xinyuan Li, Ruiyao Xu, Henry Peng Zou, Kaize Ding, Xiyang Hu, Yan Liu, Yue Zhao

机构 * University of Southern California(南加州大学) Northwestern University(西北大学)

AI总结 Cat-DPO通过将安全对齐转化为类别约束优化问题,为每个有害类别设置独立的适应性安全边际,提升整体帮助性和无害性,减少类别间的安全方差和最佳至最差差距。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05485 2026-08-14 cs.AI 版本更新

Auditable Agents

可审计代理

Yi Nian, Aojie Yuan, Haiyue Zhang, Jiate Li, Li Li, Xiyang Hu, Hua Wei, Xiongye Xiao, Chaowei Xiao, Yue Zhao

机构 * FORTIS Lab, University of Southern California(南加州大学FORTIS实验室)

AI总结 本文探讨了可审计代理系统的核心问题,提出五个可审计性维度和三种机制类别,通过实证证据证明代理系统需具备审计能力才能实现问责。

Comments 24 pages, 1 figure. Extended version. A condensed 4-page version appears in the Proceedings of the ACM AI Leadership Summit 2026 (Visionary Papers track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00048 2026-08-14 cs.CY cs.AI 版本更新

MOSAIC: Unveiling the Moral, Social and Individual Dimensions of Large Language Models

MOSAIC:揭示大型语言模型的道德、社会和个体维度

Erica Coppolillo, Emilio Ferrara

机构 * University of Southern California(南加州大学) University of Calabria and ICAR-CNR(卡利亚里大学和ICAR-CNR) Thomas Lord Department of Computer Science(托马斯·劳德计算机科学系)

AI总结 MOSAIC首次提出评估大型语言模型道德、社会和个体维度的综合基准测试,通过九个问卷和四个游戏全面考察伦理推理能力,揭示MFT的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14390 2026-08-14 cs.CL cs.AI 版本更新

REHEARSE: Experiential Rehearsal for Verbal Confidence Calibration in Large Language Models

REHEARSE:大语言模型中用于语言置信度校准的经验式排练

Ke Fang, Tianyi Zhao, Qianwen Wang, Lu Cheng

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

AI总结 针对大语言模型置信度与实际正确性不匹配的问题,提出无训练的Rehearse方法,通过置信度校准博弈的反馈生成校准信号,在多模型多基准实验中显著降低了预期校准误差并提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏