arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-25 至 2026-05-25 共收录 36 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 36 篇

2602.12316 2026-05-25 cs.AI cs.CL cs.CY cs.GT cs.MA 90%

GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory

GT-HarmBench:通过博弈论视角评估AI安全风险

Pepijn Cobben, Xuanqiang Angelo Huang, Thao Amelia Pham, Isabel Dahlgren, Terry Jingchen Zhang, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) Berea College(贝雷学院) University of Toronto(多伦多大学) Vector Institute(向量研究所) Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统马克斯·普朗克研究所)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出GT-HarmBench基准,包含1535个高风险场景,基于博弈论结构(如囚徒困境、猎鹿博弈、斗鸡博弈)评估前沿AI模型在多智能体环境中的安全风险,发现模型在38%的高风险案例中未能选择对社会有益的行为,并验证了博弈论干预可提升18%的社会有益结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16087 2026-05-25 cs.RO cs.AI 85%

Towards Trustworthy and Explainable AI for Perception Models: From Concept to Prototype Vehicle Deployment

面向感知模型的可信与可解释人工智能:从概念到原型车辆部署

Till Beemelmanns, Shayan Sharifi, Manas Mehrotra, Ayushman Choudhuri, Lutz Eckstein

机构 * Institute for Automotive Engineering, RWTH Aachen University(汽车工程研究所,亚琛工业大学)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一个结合鲁棒性、可解释性和不确定性校准的Transformer感知模块,并部署于原型车辆,通过实时可视化验证可信AI的可行性。

Comments Accepted for publication at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13985 2026-05-25 cs.AI 83%

Bridging AI and Clinical Reasoning: Abductive Explanations for Alignment on Critical Symptoms

弥合AI与临床推理:针对关键症状对齐的溯因解释

Belona Sonna, Alban Grastien

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文利用形式溯因解释,通过最小充分特征集提供一致且保证的推理,使AI决策与临床推理对齐,在保持预测准确性的同时提供可操作的临床见解,建立可信AI框架。

Comments The Algorithm 1 is not entirely correct and they may affect the results as well. We are restarting the experimentations and will upload the new version as soon as possible

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23024 2026-05-25 cs.AI cs.CC cs.CL cs.LG 82%

The Deterministic Horizon: Impossibility Results as Design Specifications for Trustworthy AI Systems

确定性视界:作为可信AI系统设计规范的不可行性结果

Dongxin Guo

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过证明架构决定的准确率上限、偏好学习的样本复杂度跳跃、多阶段检索的指标数量要求等16个不可行性结果,将计算极限转化为可信AI系统的设计规范。

Comments PhD thesis, Department of Computer Science, The University of Hong Kong, 2026. 271 pages, 18 figures, 15 tables, 5 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23780 2026-05-25 cs.AI 79%

Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment

超越二元编辑:基于对抗子空间对齐的鲁棒多模态知识编辑

Haoyuan Wang, Xiaohao Liu, Jiajie Su, Jianmao Xiao, Chaochao Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Jiangxi Normal University(江西师范大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型知识编辑泛化性不足的问题,提出对抗子空间对齐方法(ASAM),通过潜在对抗鲁棒化(LAR)和秩约束子空间学习(RCSL)实现鲁棒的多模态知识编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22643 2026-05-25 cs.CL 79%

Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety

温水煮青蛙:面向智能体安全的多轮基准测试

Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Federico Sartore, Enrico Panai, Laura Caroli, Yue Zhu, Adam Leon Smith, Luca Nannini, Marcello Galisai, Susanna Cifani, Francesco Giarrusso, Marcantonio Bracale Syrnikov, Daniele Nardi

机构 * Icaro Foundation(Icaro基金会) Sapienza University of Rome(罗马萨皮恩扎大学) Sant’Anna School of Advanced Studies(圣安娜高级研究学校) Tongji University School of Law(同济大学法学院) AIQI Consortium(AIQI联盟) Università Cattolica del Sacro Cuore(圣心大学) Piccadilly Labs(皮卡迪利实验室) VU Amsterdam(阿姆斯特丹伏伊大学) Independent(独立)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 提出一个多轮基准测试,评估工具使用AI模型在办公场景中对渐进式攻击的脆弱性,发现平均攻击成功率为44.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23420 2026-05-25 cs.CL 79%

Naturalistic measure of social norms alignment

社会规范一致性的自然主义度量

Yevhen Kostiuk, Kenneth Enevoldsen, Peter Bjerregaard Vahlstrup, Márton Kardos, Kristoffer Nielbo

机构 * Aarhus University(奥胡斯大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 提出通过解决方案匹配在自然主义自由形式设置中测量社会规范一致性的框架,并引入陈述一致性和显式一致性两个指标,基于丹麦语社会困境数据集评估LLM与人类的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07919 2026-05-25 cs.CV 78%

MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence

MedVIGIL: 在视觉证据受损下评估可信的医学视觉语言模型

Hanqi Jiang, Junhao Chen, Mingyu Kang, Hyeokjae Kwon, Yi Pan, Lifeng Chen, Weihang You, Haozhen Gong, Ruiyu Yan, Jinglei Lv, Lin Zhao, Hui Ren, Quanzheng Li, Tianming Liu, Xiang Li

机构 * University of Georgia(佐治亚大学) Harvard Medical School(哈佛医学院) Chungbuk National University(Chungbuk国立大学) Chungnam National University Hospital(Chungnam国立大学医院) National University of Singapore(新加坡国立大学) New York University(纽约大学) University of Sydney(悉尼大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文提出MedVIGIL基准,通过300例由放射科医生监督构建的扰动证据测试集,评估医学视觉语言模型在视觉证据失效时的可靠性,并引入MedVIGIL复合评分(MCS)进行审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23297 2026-05-25 cs.AI cs.DC 74%

Ontological Knowledge Blocks: Executable Compliance and Profile-Based Validation for Trustworthy AI Systems

本体知识块:可信AI系统的可执行合规与基于配置文件的验证

Aasish Kumar Sharma, Julian M. Kunkel

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 提出本体知识块(OKBs)作为可编程治理基础设施,通过将监管义务编译为机器可检查的约束,实现自动化合规验证,并在AI辅助HPC资源分配场景中验证其有效性。

Comments 6 pages, 3 figures. Accepted at the Security, Trust and Privacy for Software and Applications (STPSA) Workshop, IEEE COMPSAC 2026, Madrid, Spain, July 7-10, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23332 2026-05-25 cs.CL 70%

Cultural Adaptation in Large Language Models for Political Discourse

大型语言模型在政治话语中的文化适应

Wajdi Zaghouani

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文探讨大型语言模型在政治话语分析中的文化适应问题,提出通过翻译、话语和本体层面的形式化框架及评估矩阵,确保跨文化部署的可靠性和民主安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23572 2026-05-25 cs.IR cs.AI cs.LG 62%

HARNESS-LM: A Three-Phase Training Recipe for Harnessing SLMs in Sponsored Search Retrieval

HARNESS-LM: 一种在赞助搜索中利用小语言模型的三阶段训练方案

Vipul Gupta, Shikhar Mohan, Lakshya Kumar, Pranjal Chitale, Nikit Begwani, Amit Singh, Manik Varma

机构 * Microsoft AI(微软人工智能)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出HARNESS-LM三阶段训练框架,通过知识蒸馏将大规模检索器能力迁移至紧凑模型,在Bing Ads上恢复98%以上精度并实现27倍延迟降低。

Comments 9 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13249 2026-05-25 q-bio.BM cs.AI cs.LG 62%

A Systematic Evaluation of Co-folding Model Representations for Small-Molecule Learning

小分子学习的共折叠模型表示的系统评估

Hyosoon Jang, Hyunjin Seo, Honghui Kim, Seonghyun Park, Taewon Kim, Yunhui Jang, Sungsoo Ahn

机构 * KAIST(韩国科学技术院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究利用现代共折叠模型Boltz2,通过系统探测和蒸馏,评估其原子级配体表示在小分子任务中的表现,发现共折叠表示在ADMET基准上匹配或超越现有模型,加速分子生成建模,并提高结构引导配体优化的样本效率,表明蛋白质-配体共折叠是小分子表示学习的有前景的预训练范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22905 2026-05-25 cs.AI cs.CL 62%

EVE-Agent: Evidence-Verifiable Self-Evolving Agents

EVE-Agent: 证据可验证的自我进化智能体

Yamato Arai, Yuma Ichikawa

机构 * Fujitsu Limited(富士通株式会社) The University of Tokyo(东京大学) RIKEN center for AIP(理化学研究所AIP研究中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 提出EVE-Agent,通过证据可验证机制确保自我进化智能体生成的训练实例包含可审计的证据片段,从而提升答案的可靠性和可解释性。

Comments 23 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22833 2026-05-25 cs.IR cs.AI cs.LG 62%

RAG4Outcome: A Retrieval-Augmented Multimodal Framework for Prognostic Prediction in Chronic Osteomyelitis

RAG4Outcome:用于慢性骨髓炎预后预测的检索增强多模态框架

Daqian Shi, Pei Han, Jishizhan Chen, Yang Wang, Xiaolei Diao, Xianyou Zheng, Pengfei Cheng

机构 * Queen Mary University of London(女王玛丽大学) Shanghai Sixth People’s Hospital Affiliated to SJTU School of Medicine(上海第六人民医院附属复旦大学医学院) University College London(大学学院伦敦)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出RAG4Outcome框架,通过检索增强生成技术融合PET-CT影像报告、结构化手术诊断记录和非结构化随访笔记等多模态临床数据,实现慢性骨髓炎的预后预测,提高可解释性和临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23867 2026-05-25 cs.HC cs.AI 57%

Human Decision-Making with Persuasive and Narrative LLM Explanations

具有说服性和叙事性LLM解释的人类决策

Laura R. Marusich, Mary Grace Kozuch Dhooghe, Jonathan Z. Bakdash, Murat Kantarcioglu

机构 * DEVCOM Army Research Laboratory(美国陆军研发实验室) University of Texas at Dallas(德克萨斯大学达拉斯分校) Virginia Polytechnic Institute and State University(弗吉尼亚理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 通过大规模行为实验,研究LLM生成的叙事解释的说服力程度对人类决策准确性的影响,发现叙事解释未显著提升决策准确性,但增加了对AI的依赖,且高说服力叙事可能损害决策反应时间和辨别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23771 2026-05-25 cs.CV cs.AI cs.MA 57%

PhotoFlow: Agentic 3D Virtual Photography Missions

PhotoFlow: 智能体式3D虚拟摄影任务

Jiarui Guo, Haojia Wei, Yiming Zhang, Yifei Liu, Yuning Gong, Hongjie Zhang, Xue Yang, Zhihang Zhong

机构 * Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) University of California, Los Angeles(加州大学洛杉矶分校) Cornell University(康奈尔大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出PhotoFlow智能体框架,通过导演-评审-反思闭环搜索机制,在任意Blender场景中根据语言指令自动完成虚拟摄影,并引入VPhotoBench基准,实验表明其在外观质量对齐和成功率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23754 2026-05-25 cs.LG 57%

LLM-driven design of physics-constrained constitutive models: two agents are better than one

LLM驱动的物理约束本构模型设计:两个智能体胜过一个

Marius Tacke, Matthias Busch, Kian Abdolazizi, Jonas Eichinger, Kevin Linka, Roland Aydin, Christian Cyron

机构 * Helmholtz-Zentrum Hereon(海德堡中心) Hamburg University of Technology(汉堡技术大学) RWTH Aachen University(亚琛工业大学) Saarland University(萨尔兰州大学) German Center for Artificial Intelligence(德国人工智能中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 提出多智能体LLM框架,通过Creator生成模型和Inspector审计物理约束,实现自动生成满足物理定律的本构模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23715 2026-05-25 cs.CL 57%

NLG Evaluation: Past, Present, Future

NLG评估:过去、现在与未来

Ehud Reiter

机构 * Dept of Computing Science University of Aberdeen(计算科学系大学阿伯丁)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文回顾了自然语言生成(NLG)评估从1990年至今的演变,包括LLM-as-Judge等最新方法,并展望了未来影响、质量和安全评估的重要性。

Comments Will appear in Proceeedings of RetroEval 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26145 2026-05-25 cs.HC cs.AI 57%

Ceci n'est pas une explication: Evaluating Explanation Failures as Explainability Pitfalls in Language Learning Systems

Ceci n'est pas une explication: 评估语言学习系统中作为可解释性陷阱的解释失败

Ben Knight, Wm. Matthew Kennedy, Danielle Carvalho, Isaac Pattis, James Edgell

机构 * Oxford University Press(牛津大学出版社) Oxford Internet Institute(牛津互联网研究所) University of Oxford(牛津大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文通过L2-Bench基准评估AI语言学习工具在六个关键维度上的反馈质量,指出表面有用但本质有缺陷的解释会导致可解释性陷阱,并分析语言学习环境如何放大这些风险。

Comments Accepted to Misleading Impacts Resulting from AI Generated Explanations (MIRAGE) Workshop @ IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22521 2026-05-25 cs.CV cs.AI 57%

DocVAL: Validated Chain-of-Thought Distillation for Grounded Document VQA

DocVAL:用于基于文档的视觉问答的验证链式思维蒸馏

Pinaki Prasad Guha Neogi, Ahmad Mohammadshirazi, Ser-Nam Lim, Rajiv Ramnath

机构 * Department of Computer Science(计算机科学系) Engineering, Ohio State University, Ohio, US(工程系,俄亥俄州立大学,俄亥俄,美国) Department of Computer Science, University of Central Florida, Florida, US(计算机科学系,中央佛罗里达大学,佛罗里达,美国)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出DocVAL框架,通过验证链式思维蒸馏将大型教师模型的空间推理能力转移到紧凑学生模型,结合规则验证器和两阶段训练,在文档VQA任务上提升定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19858 2026-05-25 cs.CL 57%

Benchmarking Gaslighting Attacks Against Speech Large Language Models

针对语音大语言模型的气灯攻击基准测试

Jinyang Wu, Bin Zhu, Xiandong Zou, Qiquan Zhang, Xu Fang, Pan Zhou

机构 * Singapore Management University(新加坡管理学院) Tongyi Speech Lab(通义语音实验室) Dalian University of Technology(大连理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 提出五种气灯攻击策略(愤怒、认知干扰、讽刺、隐晦、专业否定),在5个语音和多模态大语言模型上测试,发现平均准确率下降24.3%,揭示语音模型的行为脆弱性。

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14642 2026-05-25 cs.CL 57%

Speak-to-Structure: Evaluating LLMs in Open-domain Natural Language-Driven Molecule Generation

Speak-to-Structure:评估大语言模型在开放域自然语言驱动的分子生成中的表现

Jiatong Li, Junxian Li, Weida Wang, Yunqing Liu, Changmeng Zheng, Yatao Bian, Dongzhan Zhou, Xiao-yong Wei, Qing Li

机构 * Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出Speak-to-Structure基准,通过分子编辑、优化和定制生成任务评估大语言模型在开放域自然语言驱动分子生成中的创造性能力,并引入OpenMolIns指令微调数据集使Llama3.1-8B超越GPT-4o等模型。

Comments Accepted by KDD 2026. Our codes and datasets are fully accessible through the https://github.com/phenixace/S2-TOMG-Bench and https://huggingface.co/datasets/phenixace/S2-TOMG-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23673 2026-05-25 cs.LG 57%

Relevant Walk Search for Explaining Graph Neural Networks

用于解释图神经网络的相关游走搜索

Ping Xiong, Thomas Schnake, Michael Gastegger, Grégoire Montavon, Klaus-Robert Müller, Shinichi Nakajima

机构 * BIFOLD -- Berlin Institute for the Foundations of Learning(柏林学习与数据基础研究所) Google Research, Brain team, Berlin(谷歌研究,柏林脑团队) Department of Artificial Intelligence, Korea University, Seoul 136-713, Korea(人工智能系,韩国大学,首尔136-713,韩国) RIKEN Center for AIP, Japan(日本AIP研究中心)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 针对GNN-LRP计算复杂度指数级问题,提出多项式时间算法搜索Top-K相关游走,实现精确神经元级和近似节点级解释。

Comments Published in ICML 2023

Journal ref Proceedings of the 40th International Conference on Machine Learning, PMLR 202:38301-38324, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23465 2026-05-25 cs.CY 57%

IyàwóBench: A Benchmark for Evaluating Large Language Model Clinical Triage Accuracy on Undifferentiated Febrile Illness in Nigerian Primary Health Settings

IyàwóBench: 评估大型语言模型在尼日利亚初级卫生机构中对未分化发热性疾病的临床分诊准确性的基准

Anthonio Oladimeji Gabriel, Dimeji Abdulsobur Olawuyi, Oloruntoba Ajayi, Temiloluwa Aderemi

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 针对西非初级卫生机构中未分化发热性疾病,构建了基于真实患者数据的合成临床病例基准IyàwóBench,评估六种LLM的分诊准确性和安全性,发现所有模型安全性达100%但准确性差异大,嵌入WHO指南的临床工程系统表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06610 2026-05-25 cs.LG 57%

CapTrack: Multifaceted Evaluation of Forgetting in LLM Post-Training

CapTrack: 大语言模型后训练中遗忘的多方面评估

Lukas Thede, Stefan Winzeck, Zeynep Akata, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森路透基础研究) Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) Munich Center for Machine Learning (MCML), Technical University Munich(慕尼黑机器学习中心(MCML),慕尼黑技术大学) Imperial College London(伦敦帝国理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 提出CapTrack框架,通过行为分类和评估套件系统分析LLM后训练中的遗忘现象,发现遗忘不仅限于参数知识,还涉及鲁棒性和默认行为的显著漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05472 2026-05-25 cs.AI 57%

ALIVE: Awakening LLM Reasoning via Adversarial Learning and Instructive Verbal Evaluation

ALIVE: 通过对抗学习和指导性语言评估唤醒LLM推理

Yiwen Duan, Jing Ye, Xinpei Zhao

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出ALIVE框架,通过对抗学习与指导性语言反馈替代标量奖励,使模型内化推理逻辑,在数学、代码和逻辑推理任务中提升准确率、跨域泛化与自我修正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08945 2026-05-25 cs.AI 57%

FATHOMS-RAG: A Framework for the Assessment of Thinking and Observation in Multimodal Systems that use Retrieval Augmented Generation

FATHOMS-RAG:评估使用检索增强生成的多模态系统思考与观察的框架

Samuel Hildebrand, Curtis Taylor, Sean Oesch, James M Ghawaly, Amir Sadovnik, Ryan Shivers, Brandon Schreiber, Kevin Kurian

机构 * Louisiana State University(路易斯安那州立大学) Oak Ridge National Lab(橡树岭国家实验室) University of Florida(佛罗里达大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出一个评估RAG管道的基准,包含93个多模态问题、短语级召回率指标、最近邻嵌入分类器,并对比开源与闭源管道性能,发现闭源管道在正确性和幻觉指标上显著优于开源。

Comments Accepted at SAFE-ML 2026 Workshop at the International Conference on Software Testing (ICST) 2026 Code: https://github.com/Sam-Hildebrand/FATHOMS-RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10016 2026-05-25 cs.CL 57%

Training-Free Multimodal Large Language Model Orchestration

免训练的多模态大语言模型编排

Tianyu Xie, Yuexiao Ma, Yuhang Wu, Wang Chen, Jiayi Ji, Tat-Seng Chua, Xiawu Zheng, Rongrong Ji

机构 * Media Analytics and Computing Lab, Xiamen University, Xiamen, China(厦门大学媒体分析与计算实验室) Institute of Artificial Intelligence, Xiamen University, Xiamen, China(厦门大学人工智能研究院) School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出一种免训练编排框架LLM Orchestration,通过LLM控制器、文本中心跨模态记忆和统一交互层集成现成模态专家,实现低开销、可扩展的多模态输入输出系统。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22829 2026-05-25 cs.IR cs.AI 57%

LFRAG: Layout-oriented Fine-grained Retrieval-Augmented Generation on Multimodal Document Understanding

LFRAG:面向布局的多模态文档理解中的细粒度检索增强生成

Yifan Zhu, Yu Mi, Yue Lu, Yanchu Guan, Zhixuan Chu

机构 * Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Zhejiang University Institute of Blockchain and Data Security(杭州高新技术区(滨江)浙江大学区块链与数据安全研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出LFRAG框架,通过布局分割和语义-布局融合编码器实现从页面级到块级的细粒度检索,提升多模态文档检索精度并减少生成冗余,在LFDocQA基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23859 2026-05-25 eess.AS 50%

Natural Yet Challenging to Detect: Robust In-the-Wild TTS through EMA and Dual-Scoring Prompt Selection -- Submission for WildSpoof 2026 TTS Track

自然但难以检测:通过EMA和双评分提示选择实现鲁棒的野外TTS——WildSpoof 2026 TTS赛道提交

Renhe Sun, Jiayi Zhou, Haolin He, Yueying Feng, Jian Liu

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出F5-TTS-DPS模型,通过集成指数移动平均(EMA)和利用大语言模型进行双评分提示选择,在野外数据上生成自然且难以检测的语音,在WildSpoof挑战中取得最佳反欺骗性能。

详情

展开后加载摘要…

URL PDF HTML 收藏