arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-01 至 2026-04-01 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2603.29950 2026-04-01 cs.AI cs.CL 62%

Physiological and Semantic Patterns in Medical Teams Using an Intelligent Tutoring System

医疗团队中的生理与语义模式:基于智能教学系统

Xiaoshan Huang, Conrad Borchers, Jiayi Zhang, Susanne P. Lajoie

机构 * McGill University(麦吉尔大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究通过智能教学系统分析医疗团队在诊断虚拟患者时的生理和对话动态,发现语义变化与生理同步峰值相关,且高生理同步伴随低语义相似性,揭示了团队协作中的关键时刻。

Comments Accepted as short paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10780 2026-04-01 cs.CL cs.LG 62%

Script Gap: Evaluating LLM Triage on Indian Languages in Native vs Romanized Scripts in a Real World Setting

脚本间隙:在真实世界环境中评估LLM在印度语言本土脚本与罗马化脚本上的三线分类

Manurag Khullar, Utkarsh Desai, Poorva Malviya, Aman Dalmia, Zheyuan Ryan Shi

机构 * School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM在印度语言及尼泊尔语的本土脚本与罗马化脚本在真实世界中的三线分类可靠性,发现罗马化文本导致性能下降达24分,并提出基于不确定性的选择路由方法以缩小脚本差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29993 2026-04-01 cs.AI 57%

Extending MONA in Camera Dropbox: Reproduction, Learned Approval, and Design Implications for Reward-Hacking Mitigation

在Camera Dropbox中扩展MONA:再现、学习批准与奖励黑客缓解的设计影响

Nathan Heath

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 该研究通过扩展MONA方法,验证了学习批准在缓解奖励黑客中的有效性,并探讨了其设计影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29386 2026-04-01 cs.CV cs.AI 57%

PromptForge-350k: A Large-Scale Dataset and Contrastive Framework for Prompt-Based AI Image Forgery Localization

PromptForge-350k:一种大规模数据集和对比框架用于基于提示的AI图像伪造定位

Jianpeng Wang, Haoyu Wang, Baoying Chen, Jishen Zeng, Yiming Qin, Yiqi Yang, Zhongjie Ba

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出PromptForge-350k数据集和ICL-Net网络,通过自动化标注框架和对比学习提升伪造定位精度,实验显示在IoU指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29263 2026-04-01 cs.SD 50%

Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models

音频幻觉攻击:测试大型音频语言模型的可靠性

Ashish Seth, Sonal Kumar, Ramaneswaran Selvakumar, Nishit Anand, Utkarsh Tyagi, Prem Seetharaman, Ramani Duraiswami, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(Adobe研究院)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出Audio Hallucination Attacks,通过6500个问答对测试大型音频语言模型是否真实基于音频输入生成响应,发现其可靠性与基准性能存在差距,并提出AHA-Guard数据集降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏