arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-15 至 2026-04-15 共收录 76 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2512.19728 2026-04-15 cs.LG 92%

Hard Negative Sample-Augmented DPO Post-Training for Small Language Models

增强的DPO后训练用于小型语言模型

Haocheng Lu, Minjun Zhu, Henry Yu

机构 * Computer Science NYU Shanghai(纽约大学上海学院)

专题命中 偏好对齐 :DPO(title,title_cn);RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种轻量级后训练方法,通过MathVerifier检测结构化错误,改进DPO以提升小型模型在数学推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12479 2026-04-15 cs.CL 77%

Meet Dynamic Individual Preferences: Resolving Conflicting Human Value with Paired Fine-Tuning

面对动态个体偏好:通过配对微调解决冲突的人类价值观

Shanyong Wang, Shuhang Lin, Yining Zhao, Xi Zhu, Yongfeng Zhang

机构 * Rutgers University—New Brunswick(罗杰斯大学—新布伦斯维克分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL

AI总结 本文提出Preference-Paired Fine-Tuning框架,通过Value Conflict Dilemma数据集解决动态个体偏好冲突问题,实验显示其在多选分类和开放生成任务中表现优异,优于传统方法。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11867 2026-04-15 cs.LG cs.AI 73%

Disposition Distillation at Small Scale: A Three-Arc Negative Result

小规模下的行为蒸馏:一个三弧否定结果

Hari Sadasivan

机构 * Tinman Lab(Tinman实验室)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究尝试通过四阶段MIT蒸馏流程在小语言模型中训练行为倾向,但发现无操作能改变倾向而不损害内容或导致模仿。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13029 2026-04-15 cs.CV cs.AI 70%

Visual Preference Optimization with Rubric Rewards

基于评分标准的视觉偏好优化

Ya-Qi Yu, Fangyu Hong, Xiangyang Qu, Hao Wang, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出rDPO框架,通过实例特定的评分标准提升多模态任务中的偏好优化效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05643 2026-04-15 cs.CL 70%

Graph-Based Chain-of-Thought Pruning for Reducing Redundant Reflections in Reasoning LLMs

基于图的链式推理剪枝:减少推理LLM中冗余反射

Hongyuan Yuan, Xinran He, Run Shao, Bolei He, Xianwei Xue, Mengke Chen, Qiutong Pan, Haiwei Wang, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) Baidu Inc.(百度公司)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出基于图的链式推理优化框架,通过剪枝策略减少推理过程中冗余反射,提升效率与准确性。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12350 2026-04-15 cs.LG cs.AI 62%

Scaffold-Conditioned Preference Triplets for Controllable Molecular Optimization with Large Language Models

基于 Scaffold 的偏好三元组用于大语言模型可控分子优化

Yi Xiong, Liang Xiong, Xiaohong Ji, Sen Yang, Zhifeng Gao, Huaimin Wang, Kele Xu

机构 * National Key Laboratory of Parallel and Distributed Processing(平行与分布式处理国家重点实验室) College of Computer Science and Technology(计算机科学与技术学院) National University of DefenseTechnology(国防科技大学) DP Technology(DP科技)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 Scaffold-Conditioned Preference Triplets (SCPT) 方法,通过构建约束三元组实现可控分子优化,提升分子性质改进的同时保持 Scaffold 相似性,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18203 2026-04-15 cs.CL cs.CY 62%

How Psychological Learning Paradigms Shaped and Constrained Artificial Intelligence

心理学习范式如何塑造和制约人工智能

Alex Anvi Eponon, Ildar Batyrshin, Christian E. Maldonado-Sifuentes, Grigori Sidorov

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文探讨人工智能系统在系统性组合推理中的不足,指出其根源在于心理学习理论对AI架构的限制,并提出ReSynth框架以实现结构化系统性行为。

Comments preprint journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19134 2026-04-15 cs.GT cs.LG stat.ML 57%

Incentivizing High-Quality Human Annotations with Golden Questions

通过黄金问题激励高质量的人工标注

Shang Liu, Zhongze Cai, Hanzhao Wang, Zhongyao Ma, Xiaocheng Li

机构 * Imperial College Business School(帝国理工学院商学院) Imperial College London(帝国理工学院伦敦分校) Meta

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文研究如何通过黄金问题激励标注者产生高质量数据,提出基于主代理模型的激励机制,并通过实验验证黄金问题在标注性能监控中的有效性。

Comments Corrected bugs in the proofs by specifying a further assumption. arXiv admin note: text overlap with arXiv:2502.06387

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2604.12384 2026-04-15 cs.AI 83%

Preventing Safety Drift in Large Language Models via Coupled Weight and Activation Constraints

通过耦合权重和激活约束防止大语言模型中的安全漂移

Songping Peng, Zhiheng Zhang, Daojian Zeng, Lincheng Jiang, Xieping Gao

机构 * Hunan Normal University(湖南师范大学) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,中国科学院自动化研究所) National University of Defense Technology(国防科技大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出耦合权重和激活约束方法,通过同时约束权重更新和关键特征正则化,有效提升大语言模型的安全性,实验显示其在多种任务中表现优于现有方法。

Comments 17 pages, 6 figures, 6 tables, The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12500 2026-04-15 cs.LG cs.CR 79%

Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design

安全训练调节策略下在策略强化学习中的有害对齐问题,但方向取决于环境设计

Leon Eshuijs, Shihan Wang, Antske Fokkens

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Utrecht University(埃因霍温大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究探讨了在策略强化学习中安全训练如何调节有害对齐问题,发现模型大小在不同环境中起到安全缓冲作用,且环境设计特征影响方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08439 2026-04-15 cs.AI 79%

Dataset Safety in Autonomous Driving: Requirements, Risks, and Assurance

自动驾驶中的数据集安全:要求、风险与保证

Alireza Abbaspour, Tejaskumar Balgonda Patil, B Ravi Kiran, Russel Mohr, Senthil Yogamani

机构 * Qualcomm Inc(高通公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种结构化框架,用于开发符合ISO/PAS 8800指南的安全生产数据集,通过AI感知系统案例,介绍AI数据飞轮和数据集生命周期,涵盖数据收集、标注、整理与维护,并定义安全要求和验证策略以确保符合安全标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12545 2026-04-15 cs.AI cs.CY 62%

Cross-Cultural Simulation of Citizen Emotional Responses to Bureaucratic Red Tape Using LLM Agents

跨文化模拟公民对官僚繁文缛节的情感反应使用LLM代理

Wanchun Ni, Jiugeng Sun, Yixian Liu, Mennatallah El-Assady

机构 * ETH Zurich(苏黎世联邦理工学院) City University of Hong Kong(香港城市大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过LLM代理模拟不同文化背景下公民对官僚繁文缛节的情感反应,发现模型在东方文化中表现较弱,提出RAMO交互界面以改进模型性能。

Comments To appear in the CHI 2026 Workshop on PoliSim

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12986 2026-04-15 cs.CR cs.AI 57%

Parallax: Why AI Agents That Think Must Never Act

Parallax:为什么具有思考能力的AI代理必须永不行动

Joel Fokou

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Parallax框架,通过认知-执行分离、对抗验证与渐进确定性、信息流控制和可逆执行四大原则,解决具有执行能力的AI代理安全问题,实验显示其在98.9%的攻击中有效阻止。

Comments 20 pages, 1 figure, 5 tables. Open-source reference implementation: https://github.com/openparallax/openparallax. Documentation: https://docs.openparallax.dev. Feedback welcome via email or GitHub issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10398 2026-04-15 cs.AI 57%

LatentRefusal: Latent-Signal Refusal for Unanswerable Text-to-SQL Queries

LatentRefusal:用于无法回答的文本到SQL查询的潜在信号拒绝

Xuancheng Ren, Shijing Hu, Zhihui Lu, Jiangqi Huang, Qiang Duan

机构 * Fudan University(复旦大学) Pennsylvania State University(宾夕法尼亚州立大学) Abington College(阿宾顿学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出LatentRefusal方法,通过分析大语言模型的中间隐藏激活来预测查询可回答性,从而在文本到SQL系统中实现安全拒绝,提升系统安全性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05914 2026-04-15 cs.CY 57%

Designing Incident Reporting Systems for Harms from General-Purpose AI

为通用人工智能造成的伤害设计事件报告系统

Kevin Wei, Lennart Heim

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文提出一个概念框架,探讨AI事件报告系统的制度设计,分析九个安全关键行业案例,提出美国AI事件报告的设计考量。

Comments Published in AAAI 2026. V2: Added Executive Summary, fixed hyperref line breaking issues

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence. 40, 44 (Mar. 2026), 38016-38029

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10026 2026-04-15 cs.CV 50%

LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA

LaV-CoT:具有多方面奖励优化的语言感知视觉CoT

Jing Huang, Zhiya Tan, Shutao Gong, Fanwei Zeng, Joey Tianyi Zhou, Changtao Miao, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) CFAR, Agency for Science, Technology and Research(科技研究局CFAR)

专题命中 安全训练 :alignment(abstract)

AI总结 LaV-CoT通过多阶段推理流程和多方面奖励优化,提升多语言视觉问答的准确性和泛化能力,实现在公开数据集上的9.5%准确率提升。

Comments Accepted by WWW 2026 Industry Track - Oral

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2509.25843 2026-04-15 cs.AI 77%

ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack

ASGuard:激活-缩放防护:缓解针对性劫持攻击

Yein Park, Jungwoo Park, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN公司)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出ASGuard框架,通过电路分析识别与针对性劫持相关的注意力头,训练通道缩放向量重新校准激活,结合预防性微调提升模型拒绝能力,有效降低攻击成功率并保持模型性能。

Comments ICLR 2026, 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12817 2026-04-15 cs.LG cs.CR stat.ML 70%

Understanding and Improving Continuous Adversarial Training for LLMs via In-context Learning Theory

通过上下文学习理论理解并改进LLMs的连续对抗训练

Shaopeng Fu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析实验室) King Abdullah University of Science and Technology(卡布斯大学)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);分类 cs.LG

AI总结 本文基于上下文学习理论,首次对LLMs的连续对抗训练进行了理论分析,提出通过引入奇异值正则化项提升对抗训练的鲁棒性与实用性。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12359 2026-04-15 cs.CR cs.CL 70%

Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors

通过空空间约束将激活转向编译为权重以实现隐蔽后门

Rui Yin, Tianxu Han, Naen Xu, Changjiang Li, Ping He, Chunyi Zhou, Jun Wang, Zhihui Fu, Tianyu Du, Jinbao Li, Shouling Ji

机构 * Zhejiang University(浙江大学) Palo Alto Networks(帕洛阿尔托网络) Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学) OPPO Research Institute(OPPO研究院) Qilu University of Technology(齐鲁大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文通过将后门目标从表面标记转向内部表示,提出一种高效方法,利用空空间约束在触发时激活后门,同时保持隐蔽性和安全性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09784 2026-04-15 stat.ML cs.LG 57%

Discrete Flow Maps

离散流映射

Peter Potaptchik, Jason Yim, Adhi Saravanan, Peter Holderrieth, Eric Vanden-Eijnden, Michael S. Albergo

机构 * Harvard University(哈佛大学) University of Oxford(牛津大学) MIT(麻省理工学院) Kempner Institute(凯普纳研究所)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 本文提出离散流映射,通过在概率单纯形几何上实现轨迹压缩,解决离散数据生成中的几何不匹配问题,提升离散流模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 2 篇

2604.12232 2026-04-15 cs.CR cs.AI cs.SE 85%

TEMPLATEFUZZ: Fine-Grained Chat Template Fuzzing for Jailbreaking and Red Teaming LLMs

TEMPLATEFUZZ:细粒度聊天模板模糊测试用于突破和红队测试大语言模型

Qingchao Shen, Zibo Xiao, Lili Huang, Enwei Hu, Yongqiang Tian, Junjie Chen

机构 * School of Computer Software(计算机软件学院) Tianjin University(天津大学) Monash University(墨尔本大学)

专题命中 红队测试 :red teaming(title);safety(abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 本文提出TEMPLATEFUZZ框架,通过细粒度模糊测试揭示大语言模型聊天模板的漏洞,实现高攻击成功率的同时保持模型准确性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00412 2026-04-15 cs.CR cs.AI 79%

Red Teaming Large Reasoning Models

对大型推理模型进行红队测试

Jiawei Chen, Yang Yang, Chao Yu, Yu Tian, Zhi Cao, Xue Yang, Linghao Li, Hang Su, Zhaoxia Yin

机构 * Shanghai Key Laboratory of Multidimensional Information Processing, East China Normal University(上海多维信息处理关键实验室,东华大学) Zhongguancun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Dept. of Comp. Sci. and Tech., THBI Lab, Tsinghua University(计算机科学与技术系,清华THBI实验室) Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 红队测试 :red teaming(title);safety(abstract);分类 cs.AI

AI总结 本文提出RT-LRM基准,评估大型推理模型的可信度,揭示其在面对推理风险时的脆弱性,并发布工具箱支持未来研究。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 3 篇

2502.05206 2026-04-15 cs.CR cs.AI cs.CL cs.CV 87%

Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety

大规模安全:大型模型和智能体安全的全面综述

Xingjun Ma, Yifeng Gao, Yixu Wang, Ruofan Wang, Xin Wang, Ye Sun, Yifan Ding, Hengyuan Xu, Yunhao Chen, Yunhan Zhao, Hanxun Huang, Yige Li, Yutao Wu, Jiaming Zhang, Xiang Zheng, Yang Bai, Zuxuan Wu, Xipeng Qiu, Jingfeng Zhang, Yiming Li, Xudong Han, Haonan Li, Jun Sun, Cong Wang, Jindong Gu, Baoyuan Wu, Siheng Chen, Tianwei Zhang, Yang Liu, Mingming Gong, Tongliang Liu, Shirui Pan, Cihang Xie, Tianyu Pang, Yinpeng Dong, Ruoxi Jia, Yang Zhang, Shiqing Ma, Xiangyu Zhang, Neil Gong, Chaowei Xiao, Sarah Erfani, Tim Baldwin, Bo Li, Masashi Sugiyama, Dacheng Tao, James Bailey, Yu-Gang Jiang

机构 * Fudan University(复旦大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡国立大学) Deakin University(德肯大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) Griffith University(格里菲斯大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Sea AI Lab(Sea AI实验室) Tsinghua University(清华大学) Virginia Tech(弗吉尼亚理工大学) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全部) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Purdue University(普渡大学) Duke University(杜克大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) RIKEN(理化学研究所) The University of Tokyo(东京大学)

专题命中 提示注入 :safety(title,abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型模型和智能体的安全性,分析了各类攻击威胁及防御策略,指出安全评估、防御机制和数据实践的重要性,强调研究社区和国际合作的必要性。

Comments 706 papers, 60 pages, 3 figures, 14 tables; GitHub: https://github.com/xingjunm/Awesome-Large-Model-Safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12548 2026-04-15 cs.CR 78%

DeepSeek Robustness Against Semantic-Character Dual-Space Mutated Prompt Injection

DeepSeek 对语义-字符双空间变异提示注入的鲁棒性

Junyu Ren, Xingjian Pan, Wensheng Gan, Philip S. Yu

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出PromptFuzz-SC框架,通过结合语义变换和字符级混淆,评估LLM对提示注入的鲁棒性,实验显示双空间变异在攻击性能上表现最佳,提升了攻击成功率和隐蔽性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12284 2026-04-15 cs.CR 78%

WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents

WebAgentGuard: 一种基于推理的守护模型,用于检测Web代理中的提示注入攻击

Yulin Chen, Tri Cao, Haoran Li, Yue Liu, Yibo Li, Yufei He, Le Minh Khoi, Yangqiu Song, Shuicheng Yan, Bryan Hooi

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出WebAgentGuard,一种基于推理的多模态守护模型,用于检测Web代理中的提示注入攻击。通过构建合成多模态数据集并采用推理密集型监督微调和强化学习,模型在多个基准测试中优于现有方法,同时保持代理的实用性,不引入额外延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 4 篇

2510.25512 2026-04-15 cs.LG cs.AI cs.CV 62%

FaCT: Faithful Concept Traces for Explaining Neural Network Decisions

FaCT:用于解释神经网络决策的忠实概念追踪

Amin Parchami-Araghi, Sukrut Rao, Jonas Fischer, Bernt Schiele

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FaCT模型,通过共享类间概念实现忠实解释,引入C²-Score评估概念一致性,提升可解释性同时保持ImageNet性能。

Comments 35 pages, 23 figures, 2 tables, Neural Information Processing Systems (NeurIPS) 2025; Code is available at https://github.com/m-parchami/FaCT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12610 2026-04-15 cs.CL 57%

Transforming External Knowledge into Triplets for Enhanced Retrieval in RAG of LLMs

将外部知识转化为三元组以增强LLM中RAG的检索

Xudong Wang, Chaoning Zhang, Qigan Sun, Zhenzhen Huang, Chang Lu, Sheng Zheng, Zeyu Ma, Caiyan Qin, Yang Yang, Hengtao Shen

机构 * School of Computing, Kyung Hee University(韩国庆熙大学计算机学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) School of Robotics and Advanced Manufacture, Harbin Institute of Technology(哈尔滨工业大学机器人与先进制造学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 Tri-RAG通过结构化三元组构建提升检索效率,减少冗余信息,提高生成质量与资源利用率。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12543 2026-04-15 cs.AI 57%

A Two-Stage LLM Framework for Accessible and Verified XAI Explanations

一个两阶段LLM框架用于可访问且验证的XAI解释

Georgios Mermigkis, Dimitris Metaxakis, Marios Tyrovolas, Argiris Sofotasios, Nikolaos Avgeris, Panagiotis Hadjidoukas, Chrysostomos Stylios

机构 * Department of Computer Engineering and Informatics, University of Patras(帕特拉大学计算机工程与信息学系) Department of Informatics and Telecommunications, University of Ioannina(伊奥安尼纳大学信息与电信系) Industrial Systems Institute, Athena Research Center(雅典研究中心工业系统研究所) Archimedes Unit, Athena Research Center(雅典研究中心阿基米德单位)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出两阶段LLM框架,通过解释器和验证器LLM生成并验证XAI解释,提升解释的准确性与可访问性。

Comments 8 pages, 8 figures, Accepted for publication at the 2026 IEEE World Congress on Computational Intelligence (WCCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12184 2026-04-15 cs.AI 57%

TRUST Agents: A Collaborative Multi-Agent Framework for Fake News Detection, Explainable Verification, and Logic-Aware Claim Reasoning

TRUST代理:一种用于虚假新闻检测、可解释验证和逻辑感知声明推理的协作多智能体框架

Gautama Shastry Bulusu Venkata, Santhosh Kakarla, Maheedhar Omtri Mohan, Aishwarya Gaddam

机构 * George Mason University(乔治·马歇尔大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 TRUST代理通过协作多智能体框架提升虚假新闻检测的可解释性和逻辑推理能力,引入分解器、陪审团和逻辑聚合器提升复杂声明的验证效果。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 3 篇

2604.12308 2026-04-15 cs.CL 83%

ContextLens: Modeling Imperfect Privacy and Safety Context for Legal Compliance

ContextLens:建模不完美隐私和安全上下文以满足法律合规

Haoran Li, Yulin Chen, Huihao Jing, Wenbin Hu, Tsz Ho Li, Chanhou Lou, Hong Ting Tsang, Sirui Han, Yangqiu Song

机构 * Beihang University(北京航空航天大学) HKUST(香港科技大学) National University of Singapore(新加坡国立大学) Faculty of Law, University of Macau(澳门大学法学院)

专题命中 隐私与版权 :safety(title,abstract);AI safety(abstract);分类 cs.CL

AI总结 本文提出ContextLens框架,利用LLM建模法律领域上下文,识别已知和未知因素以提升合规评估,实验表明其能有效提升LLM合规性评估性能。

Comments Accepted by ACL 26

详情

展开后加载摘要…

URL PDF HTML 收藏