arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-28 至 2026-04-28 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 9 篇

2604.24302 2026-04-28 cs.CL 79%

Differentiable Faithfulness Alignment for Cross-Model Circuit Transfer

可微的忠实对齐用于跨模型电路转移

Shun Shao, Binxu Wang, Shay B. Cohen, Anna Korhonen, Yonatan Belinkov

机构 * University of Cambridge(剑桥大学) Kempner Institute, Harvard University(哈佛大学凯普勒研究所) University of Edinburgh(爱丁堡大学) Technion(技术学院)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出DFA框架,通过学习可微对齐将小模型的电路信息转移到大模型,实验证明在事实检索、多选推理和算术任务中,DFA在Llama-3 1B→3B任务中表现优异,且在某些情况下恢复的电路忠实度不低于直接归因。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22755 2026-04-28 cs.IR cs.AI 79%

RADIANT-LLM: an Agentic Retrieval Augmented Generation Framework for Reliable Decision Support in Safety-Critical Nuclear Engineering

RADIANT-LLM:一种用于安全关键核工程中可靠决策支持的代理检索增强生成框架

Zavier Ndum Ndum, Jian Tao, John Ford, Mansung Yim, Yang Liu

机构 * Department of Nuclear Engineering, Texas A\&M University, College Station, TX, USA College of Performance, Visualization Fine Arts, Texas A\&M University, College Station, TX, USA

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI

AI总结 本文提出RADIANT-LLM框架,通过多模态检索增强生成技术,结合领域知识库和代理层,提升核工程中的决策支持准确性与透明度,降低幻觉风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12311 2026-04-28 cs.SE cs.AI cs.HC 79%

Is Vibe Coding the Future? An Empirical Assessment of LLM Generated Codes for Construction Safety

vibe编码是未来吗?对LLM生成代码用于建设安全的实证评估

S M Jamil Uddin

机构 * Department of Construction Management, Colorado State University(科罗拉多州立大学建设管理系)

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI

AI总结 研究评估了450个由三个前沿模型生成的Python脚本在建设安全中的可靠性、软件架构和领域特定安全精度,发现用户角色与数据幻觉存在显著关系,且存在高达45%的静默故障率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17590 2026-04-28 cs.AI cs.CL cs.CV cs.CY cs.LG 70%

MERIT: Modular Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning

MERIT:基于网络基础推理的多模态虚假信息检测模块化框架

Mir Nafis Sharear Shopnil, Sharad Duwal, Abhishek Tyagi, Adiba Mahbub Proma

机构 * University of Rochester(罗切斯特大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 MERIT通过四个专用模块提升多模态虚假信息检测性能,采用GPT-4o-mini在MMFakeBench上取得81.65% F1得分,优于零样本基线,验证了其架构设计的有效性。

Comments 18 pages, 4 tables, 3 figures. Major revision with updated title, framing, methodology, experiments, and error analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24346 2026-04-28 cs.CV cs.AI 57%

SycoPhantasy: Quantifying Sycophancy and Hallucination in Small Open Weight VLMs for Vision-Language Scoring of Fantasy Characters

SycoPhantasy: 量化小型开放权重视觉-语言模型中趋炎附势行为与幻觉现象以评估奇幻角色的视觉-语言评分

Arya Shah, Deepali Mishra, Chaklam Silpasuwanchai

机构 * IIT Gandhinagar(印度加尔各答理工学院) IIT Kanpur(印度坎浦尔理工学院) Asian Institute of Technology(亚洲理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文研究小型开放权重VLM在评估图像-文本对齐时是否存在趋炎附势行为,通过引入布林系数量化模型评分与视觉证据的不匹配程度,发现模型规模与趋炎附势率呈负相关。

Comments 13 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23942 2026-04-28 cs.HC cs.AI 57%

What Did They Mean? How LLMs Resolve Ambiguous Social Situations across Perspectives and Roles

他们是什么意思?大语言模型如何在不同视角和角色下解析模糊的社会情境

Qiming Yuan, Linyi Han, Nam Ling, Cihan Ruan

机构 * Santa Clara University(圣克拉拉大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 研究探讨LLM在处理模糊社会情境时的响应方式,发现其倾向于通过叙事一致、规范建议等路径闭合模糊性,且叙述视角影响解读路径,凸显LLM在社会AI设计中保持不确定性的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23674 2026-04-28 cs.AI 57%

Vibe Medicine: Redefining Biomedical Research Through Human-AI Co-Work

Vibe Medicine:通过人机协作重新定义生物医学研究

Zihao Wu, Steven Xu, Bowen Chen, Shaowen Wan, Yiwei Li, Wei Ruan, Yanjun Lyu, Siyuan Li, Dajiang Zhu, Tianming Liu, Lin Zhao

机构 * School of Computing, University of Georgia(佐治亚大学计算学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出Vibe Medicine,通过自然语言指导AI代理执行复杂生物医学流程,解决多领域数据整合与分析难题,提升研究效率与公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24048 2026-04-28 cs.IR 50%

Disagreement as Signals: Dual-view Calibration for Sequential Recommendation Denoising

分歧作为信号:用于顺序推荐去噪的双视角校准

Sijia Li, Min Gao, Zongwei Wang, Zhiyi Liu, Xin Xia, Yi Zhang

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出DC4SR框架,通过双视角校准提升顺序推荐的去噪效果,结合语义先验和模型后验分布,增强对用户兴趣演变的适应性。

Comments 9 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23060 2026-04-28 cs.CE math.OC 50%

Learning to Trust AI and Data-driven models in Data Assimilation through a Multifidelity Ensemble Gaussian Mixture Filter Framework

通过多保真度集合高斯混合滤波框架学习信任人工智能和数据驱动模型

Andrey A. Popov

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文提出一种结合理论驱动和数据驱动方法的多保真度集合高斯混合滤波框架,通过自适应信任度计算实现高维数据同化。

详情

展开后加载摘要…

URL PDF HTML 收藏