arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-09 至 2026-04-09 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2604.06728 2026-04-09 cs.CV cs.AI cs.MM 57%

URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection

URMF:面向多模态讽刺检测的不确定性感知鲁棒多模态融合

Zhenyu Wang, Weichen Cheng, Weijia Li, Junjie Mou, Zongyou Zhao, Guoying Zhang

机构 * School of Artificial Intelligence, China University of Mining and Technology-Beijing(中国矿业大学(北京)人工智能学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出URMF框架,通过建模模态可靠性提升多模态讽刺检测的准确性和鲁棒性,采用多头交叉注意力和自注意力机制,并结合不确定性建模和联合训练目标,在公开基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06723 2026-04-09 cs.SE cs.AI 57%

Fine-grained Approaches for Confidence Calibration of LLMs in Automated Code Revision

细粒度方法用于LLMs在自动代码修订中的置信度校准

Hong Yi Lin, Chunhua Liu, Haoyu Gao, Patanamon Thongtanunam, Christoph Treude

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出细粒度置信度校准方法,通过局部Platt缩放提升自动代码修订任务中模型的置信度校准效果,降低校准误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06552 2026-04-09 cs.CL 57%

To Lie or Not to Lie? Investigating The Biased Spread of Global Lies by LLMs

说谎还是不说谎?研究LLMs在全球谎言传播中的偏见

Zohaib Khan, Mustafa Dogan, Ifeoma Okoh, Pouya Sadeghi, Siddhartha Shrestha, Sergius Justus Nyah, Mahmoud O. Mokhiamar, Michael J. Ryan, Tarek Naous

机构 * Fatima Fellowship(法蒂玛奖学金) Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 研究LLMs在多语言多地区传播虚假信息的行为,揭示低资源语言和低HDI国家中谎言传播的系统性差异,提出GlobalLies数据集以支持减少全球虚假信息传播的策略。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06375 2026-04-09 cs.AI 57%

SymptomWise: A Deterministic Reasoning Layer for Reliable and Efficient AI Systems

SymptomWise: 一种用于可靠和高效人工智能系统的确定性推理层

Isaac Henry, Avery Byrne, Christopher Giza, Ron Henry, Shahram Yazdani

机构 * University of California Los Angeles, David Geffen School of Medicine(加州大学洛杉矶分校大卫·格芬医学院) University of Southern California(南加州大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 SymptomWise通过分离语言理解与诊断推理,结合专家知识和确定性推理,提升AI系统可靠性与可解释性,初步验证在儿科神经病学案例中表现优异。

Comments 18 pages, 1 figure,

详情

展开后加载摘要…

URL PDF HTML 收藏