arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-14 至 2026-07-14 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 9 篇

2603.22042 2026-07-14 cs.CV cs.AI 版本更新 83%

Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models

基于部分-整体语义代表性与不确定性引导的组合对齐超几何视觉语言模型

Hayeon Kim, Ji Ha Jang, Junghun James Kim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电子与计算机工程系) INMC & IPAI(INMC与IPAI) Seoul National University(首尔国立大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出UNCHA方法,通过超几何不确定性建模部分-整体语义代表性,提升超几何VLM对多物体场景的组合结构理解能力,实现零样本分类等任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10517 2026-07-14 cs.LG cs.AI 新提交 62%

Conditional Optimal Bridge for Riemannian Activation Steering

用于黎曼激活控制的条件最优桥

Seyed Arshan Dalili, Ajay Narayanan Sridhar, Vijaykrishnan Narayanan, Mehrdad Mahdavi

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理时激活控制问题,提出\textsc{Cobras}方法,将其视为残差流超球面上的薛定谔桥,从优化问题推导控制目标,使控制方向查询自适应,实验显示该方法性能优于基线且避免分布外性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11771 2026-07-14 cs.SE cs.AI 新提交 57%

Evaluating RE Practices for Explainability: Synthesizing Insights from Daimler Truck into an Explainable RE Framework Proposal

评估可解释性的需求工程实践:将戴姆勒卡车公司的见解整合到一个可解释的需求工程框架提案中

Umm-e- Habiba, Lucas Mauser, Jonas Fritzsch, Justus Bogner, Stefan Wagner

机构 * TUM School of CIT, Technical University of Munich(慕尼黑技术大学 CIT 学院) Institute of Software Engineering, University of Stuttgart(斯图加特大学软件工程研究所) Department of Computer Science, Vrije Universiteit Amsterdam(阿姆斯特丹自由大学计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 研究现有需求工程实践对可解释性要求的支持,通过对戴姆勒卡车公司从业者的多阶段定性研究,揭示各步骤挑战,表明当前实践支持有限,为开发可解释人工智能的需求工程框架提供实证见解与研究愿景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10811 2026-07-14 cs.MA cs.AI 新提交 57%

Distributed Agent System: Fault-Tolerant Collaboration Among Embodied Agents

分布式智能体系统:具身智能体间的容错协作

Kai Yu, Lu Chen, Hanqi Li

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 针对人工智能工程中智能体驱动任务执行面临的可靠性挑战,提出分布式智能体系统(DAS)框架,重新定义智能体可靠性,构建两层容错架构,为工业场景中异构具身智能体可靠协作提供实用工程途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10491 2026-07-14 cs.LG 新提交 57%

EvidentialRAG: Quantifying and Mitigating Information Conflict in Multi-Source Retrieval-Augmented Generation via Evidential Deep Learning

证据RAG:通过证据深度学习量化和缓解多源检索增强生成中的信息冲突

S M Asif Hossain, Ruksat Khan Shayoni, M. F. Mridha

机构 * School of Computing, Wichita State University(威奇托州立大学计算学院) Department of Computer Science, American International University-Bangladesh(美国国际孟加拉大学计算机科学系)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 研究多源检索增强生成中信息冲突问题,提出ERAG框架,通过将检索块转换为概率证据、用轻量级评估器和融合规则处理不确定性,实验表明该框架在标准问答有竞争力,在冲突情况下行为改善,是可信信息处理实用机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10402 2026-07-14 cs.CR cs.AI cs.SI 新提交 57%

Large Language Models in Misinformation Ecosystems: Misuse, Defense, and Vulnerability

错误信息生态系统中的大语言模型:滥用、防御与脆弱性

Lingwei Wei, Dou Hu, Wei Zhou, Songlin Hu, Philip S. Yu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Illinois Chicago(伊利诺伊大学香槟分校) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 研究大语言模型在错误信息生态系统中的问题,引入角色层框架统一风险与防御,组织相关攻击、研究检测与验证方法、分析漏洞及讨论对策,指出从静态检测到风险评估、强化验证管道、部署可审计人工参与验证系统这三个关键挑战。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26795 2026-07-14 cs.CV cs.AI cs.MM 版本更新 57%

NaviCache: Test-Time Self-Calibration Caching for Video Generation

NaviCache: 视频生成的测试时自校准缓存

Zheqi Lv, Zhibo Zhu, Jinke Wang, Qi Tian, Shengyu Zhang, Zhengyu Chen, Chengxi Zang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Cornell University(康奈尔大学) Tencent Hunyuan(腾讯文生视频)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 针对视频扩散模型计算成本高的问题,提出NaviCache方法,将特征演化重构思为惯性导航系统问题,通过双状态估计架构自适应跟踪特征变化比和潜在漂移,实现有界误差的计算跳过,在多个模型上取得优异性能。

Comments Published at ICML 2026: Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08359 2026-07-14 cs.CL 版本更新 57%

REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering

REAL:在语言模型引导中读取Transformer激活以进行精确定位

Li-Ming Zhan, Bo Liu, Chengqiang Xie, Jiannong Cao, Xiao-Ming Wu

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究旨在在不改变LLM参数的情况下引导其响应,核心挑战是识别关键内部模块。提出REAL框架,通过训练VQ - AE划分潜在空间,量化模块行为相关性来指导模块选择与引导强度。实验表明该方法能有效干预,提升真实性引导效果且具零样本泛化能力。

Comments need full paper rebuilding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09774 2026-07-14 cs.DL 新提交 50%

Hallucination Detector: A hybrid LLM and Semantic Scholar tool calling for detecting hallucination in scientific literature on AtomGPT.org

幻觉检测器:一种用于在AtomGPT.org上检测科学文献中幻觉的混合大语言模型和语义学者工具调用

Harichandana Neralla, Jaehyung Lee, Aldo H. Romero, Kamal Choudhary

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 研究针对大语言模型用于科学写作时出现的虚构参考文献问题,提出结合大语言模型字段提取与语义学者结构化检索的AtomGPT参考文献检查器,经基准测试能可靠标记多数幻觉引用,保障文献引用可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏