arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 922 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 922 篇

2608.08542 2026-08-11 cs.LG 新提交 89%

When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs

当技能与安全相遇:对技能合并大语言模型的自适应越狱鲁棒性进行基准测试与表征

Yu Ma, Hongli Shi, Jing Li, Xinran Xu, Weiwei Hou

机构 * Google(谷歌公司) University of New South Wales(新南威尔士大学) University of Technology Sydney(悉尼科技大学) Zhejiang University(浙江大学) Australian National University(澳大利亚国立大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.LG

AI总结 本研究针对技能合并大语言模型,构建SkillSafe-Bench基准,发现静态安全无法预测其自适应越狱鲁棒性,提出SubSafe-Merge方法可在保留能力的同时消除安全侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25034 2026-06-29 cs.CV cs.AI 新提交 89%

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

Yuvion VL:面向对抗性内容和AI安全的多模态基础模型

Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian Li, Yiliang Zhang, Guanghui Wang, Ziheng Wang, Ziwen Xu, Zhaoyu Fan, Jinhao Chen, Ruijie Jian, Hongxing Li, Chuxi Xiao, Xinyue Chen, Wenxuan Liu, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Dongjie Zhang, Yangfan Zhou, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Huiming Zhang, Wei Wang, Xipeng Cao, Jialun Chen, Xiao Chen, Shaola Ren, Yunqing Hu, Bin Li, Chengwen Yao, Meng Huang, Xianfeng Li, Bin Tang, Chao Liu, Hui Xue, Longtao Huang, Haiwen Hong

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 提出Yuvion VL系列多模态大语言模型,通过对抗性感知数据合成、三阶段训练和混淆对比微调,在内容和AI安全任务上达到行业领先性能,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23858 2026-06-24 cs.LG cs.AI cs.CR 新提交 88%

Are Safety Guarantees in Neural Networks Safe? How to Compute Trustworthy Robustness Certifications

神经网络中的安全保障真的安全吗?如何计算可信的鲁棒性认证

Merkouris Papamichail, Konstantinos Varsos, Giorgos Flouris, João Marques-Silva

机构 * University of Crete(克里特大学) Catalan Institution for Research and Advanced Studies(加泰罗尼亚研究与高等研究院) University of Lleida(莱里达大学)

专题命中 安全评测 :safety(title,abstract);trustworthy(title);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 针对神经网络对抗样本问题,提出apothem度量以线性时间计算最优鲁棒性认证,并证明体积最优认证的不可行性,引入双重认证和ParallelepipedoNN系统,在MNIST等基准上实现至少两倍的最小边长改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27917 2026-07-31 cs.AI 新提交 88%

One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

统一多语言多模态的LVLM安全对齐:一个通用锚点

Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 针对LVLM面临的多语言多模态复合攻击防御难题,提出MLS-Neurons驱动的跨维度安全对齐框架,仅更新约0.03%参数实现安全监督迁移,在多语言多模态安全基准上性能优于SOTA且保留通用实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23365 2026-07-28 cs.SE cs.AI cs.CR 新提交 88%

On AI Safety and Security Technical Debt in Engineering AI-Enabled Systems

关于人工智能系统工程中的人工智能安全与保障技术债务

Muhammad Tukur, Hayatullahi B. Adeyemo, Tao Chen, Nour Ali, Anis Zarrad, Rick Kazman, Marco Agus, Rami Bahsoon

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 研究人工智能系统工程中的安全与保障技术债务,通过系统综述识别31种AITD并分类,分析其与信任问题的关联,合成34条指南,引入AITD - MAP框架,助工程师应对AITDs。

Comments 64 pages, 7 figures, 8 tables, submitted to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07229 2026-07-09 cs.AI 新提交 88%

Reasoning Consistency Scanning: A Framework for Auditing Chain-of-Thought Validity in AI Safety Evaluations

推理一致性扫描:人工智能安全评估中思维链有效性审计的框架

Silvia Santano

机构 * Meridian Labs(子午线实验室) UK AI Safety Institute(英国人工智能安全研究所)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 研究人工智能安全评估中思维链推理的可靠性问题,提出推理一致性扫描方法,将其与可靠性区分并形式化,构建基准、实现扫描器,通过实验表明推理不一致存在且可检测,在模型和任务类型中有系统变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27632 2026-06-29 cs.CL 新提交 88%

Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety

Yuvion LLM:一种面向内容和AI安全的对抗感知大语言模型

Ting Ma, Xiufeng Huang, Benlei Cui, Xiaowen Xu, Shikai Qiu, Ruijie Jian, Hongxing Li, Guanghui Wang, Longtao Huang, Haiwen Hong, Haolei Xu, Wenjing Jiang, Ziwen Xu, Zhaoyu Fan, Shaoxuan He, Chuxi Xiao, Yujian Li, Xinyue Chen, Chunyang Chai, Wenxuan Liu, Ziheng Wang, Dongjie Zhang, Yangfan Zhou, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Wei Wang, Huiming Zhang, Bin Li, Hui Xue

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL

AI总结 针对大语言模型在对抗性攻击下的安全脆弱性,提出Yuvion LLM,通过对抗感知数据构建、知识增强预训练及多任务安全后训练,在安全基准和对抗鲁棒性上优于GPT-5.4等更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22766 2026-07-28 cs.LG cs.AI 新提交 88%

Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation

超越夏普利值:用于大语言模型对齐和评估的基于影响的数据审核管道

Yunting Song, Matthew Watson, Peter Grabowski, Jun Qin

机构 * Google(谷歌)

专题命中 安全评测 :alignment(title,abstract);RLHF(abstract,abstract_cn);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型数据质量问题,引入可扩展的基于影响的数据审核管道,通过映射语义邻域到有向图,利用参考LLM概率分布评估数据效用,转换为局部优势指标,有效清理数据集,揭示基准漏洞,确保数据完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07867 2026-06-09 cs.CL 新提交 87%

The Cold-Start Safety Gap in LLM Agents

LLM智能体中的冷启动安全差距

Chung-En Sun, Linbo Liu, Tsui-Wei Weng

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract,abstract_cn);分类 cs.CL

AI总结 研究发现工具调用型LLM智能体在会话开始时最脆弱,随着常规任务执行安全性提升,提出SODA基准并验证预热策略可缩小冷启动安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交 87%

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 安全评测 :safety(title,title_cn)

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05086 2026-08-06 cs.AI cs.CL 新提交 87%

Item Response Theory for AI Safety

面向AI安全的项目反应理论

Joshua Fonseca Rivera, Neil Shah, David Demitri Africa, Konstantinos Voudouris

机构 * Independent(独立研究者)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI

AI总结 该研究将项目反应理论(IRT)应用于192个语言模型的8个安全基准,识别出三个关键因素,证明IRT可降低评估成本并审计模型,建议前沿实验室采用。

Comments 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16112 2026-07-20 cs.AI 新提交 86%

Harmonizing AI Safety Thresholds

协调人工智能安全阈值

Wilber Sean Anterola, Matthew Ball, Luis F. Lafuerza, Markov Grey

机构 * Brown University(布朗大学) Centre pour la Sécurité de l’Intelligence Artificielle (CeSIA)(人工智能安全中心)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.AI

AI总结 研究针对前沿人工智能公司能力阈值差异大的问题,开发推导协调阈值的方法,在滥用风险领域以预期危害为关键要素建模,自动化人工智能研发领域基于进展速度设阈值,扩展了相关工作并指出差距局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19292 2026-07-22 cs.CY cs.AI cs.HC 新提交 86%

The safety failures we are not instrumenting: a perspective on hidden safety-critical challenges in modern AI systems

我们未检测到的安全故障:现代人工智能系统中隐藏的安全关键挑战的视角

Gjergji Kasneci, Enkelejda Kasneci

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 研究现代人工智能系统隐藏的安全关键挑战,提出五层框架诊断隐藏风险,识别多种未被充分认识的风险模式,给出设计、治理建议及研究议程,推动人工智能安全从模型评估转向社会技术可靠性。

Comments Email by the arXiv Support Team: "Dear Gjergji, Thank you for your patience. Your appeal was accepted. You are welcome to resubmit this work at your convenience to cs.CY (cs.AI, cs.HC) Regards, arXiv Support"

Journal ref AI and Ethics (2026) 6:295, Springer Nature

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00464 2026-07-02 cs.LG cs.CL 新提交 86%

MolSafeEval: A Benchmark for Uncovering Safety Risks in AI-Generated Molecules

MolSafeEval: 揭示AI生成分子安全风险的基准

Tong Xu, Xinzhe Cao, Zhihui Zhu, Keyan Ding, Huajun Chen

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙大-杭州全球科技创新中心) University of Oxford(牛津大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 提出MolSafeEval基准,通过构建分子安全知识图谱和基于大语言模型的推理,系统评估四类分子生成模型的安全风险,揭示当前方法的漏洞。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08376 2026-06-09 cs.LG cs.AI 新提交 86%

RiskNet: A large-scale dataset of AI risk incidents from news with alignment and multi-dimensional annotations

RiskNet:一个来自新闻的大规模AI风险事件数据集,包含对齐和多维标注

Leihan Zhang, Wecheng Ye, Xianlong Ma, Haochuan Liu, Yang Li, Qianyu Zhang, Jinliang Chen, Qiang Yan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Multimodal Data Intelligent Perception and Governance(多模态数据智能感知与治理北京市重点实验室)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 提出RiskNet,一个从多语言新闻构建的大规模AI风险事件数据集,通过结构化流水线进行事件识别、对齐和多维分类,支持AI安全、治理和风险分析研究。

Comments The manuscript has been submitted to Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10327 2026-08-12 cs.AI 新提交 85%

Toward a Theory of Value in AI Alignment

迈向AI对齐中的价值理论

Andrew Smart, Shazeda Ahmed, Jackie Kay, Jimmy Tobin, Kris Shrishak, Abeba Birhane

专题命中 安全评测 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本研究通过标注94篇AI价值对齐论文,发现多数未明确定义人类价值,转而依赖偏好,且采用合成数据等自动方法可能关闭价值践行路径,旨在明确该领域哲学承诺以丰富相关辩论。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02683 2026-08-05 cs.CR cs.AI 新提交 85%

$S^3$: Improving Agent Safety through Multi-Stage Defense

$S^3$:通过多阶段防御提升智能体安全性

Zibo Xiao, Haoyu Wang, Jun Sun

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本研究针对LLM智能体工作流的跨阶段安全风险问题,提出多阶段防御框架$S^3$,引入阶段特定安全技能,构建MSRB基准,实验显示其安全有效性和效用保留均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10112 2026-07-14 cs.CR cs.AI 新提交 85%

Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety

Minionese:多语言大语言模型安全性的综合基准测试与机理研究

Chigozirim Ifebi, Brent Kong, Ayushi Mehrotra

机构 * California Institute of Technology(加州理工学院)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究多语言大语言模型安全对齐问题,引入涵盖多种语言、资源层级和扰动类型的Minionese基准测试及几何机理分析,发现不同攻击类型漏洞特征不同,指出仅英语安全评估不足,需考虑多因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04626 2026-08-06 cs.CR 新提交 85%

Blockchain Empowered Trustworthy Agent Networks: Foundations, Taxonomy, and Future Directions

区块链赋能的可信智能体网络:基础、分类与未来方向

Liehuang Zhu, Yuhang Li, Tianxing Wang, Zhihao Chen, Ke Li, Hongyi Liu, Yajie Wang, Lei Xu, Peng Jiang, Zijian Zhang

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文综述从经典多智能体系统到开放智能体网络的演化,构建五维信任分类,明确区块链作为共享信任层为可信智能体网络提供多类支撑机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01538 2026-08-04 cs.NI cs.SY eess.SY 新提交 85%

From Network Automation to Trustworthy Autonomous Networking in the LLM Era: A Network Control Intelligence Perspective

从网络自动化到大语言模型(LLM)时代的可信自主网络:网络控制智能视角

Tianzhu Zhang, Changgang Zheng, Shanshan Wang, Yarui Zhang, Lina Shi, Yue Jin, Xiaofei Wang, Meikang Qiu

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文以网络控制智能(NCI)为框架,梳理网络控制系统三阶段演进,提出可信自主网络定义及参考架构,明确LLM赋能运营的集成模式与相关研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26121 2026-07-30 cs.RO cs.AI cs.CY 新提交 84%

Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels

面向可信赖的具身智能:一个系统框架与分级可信赖性水平

Xinyu Yang, Tianxing Chen, Honghao Su, Minxuan Wang, Chenze Yu, Zhangzheng Tu, Yue Chen, Yuxiao Huo, Lingfeng Zhang, Yan Huang, Yan Qin, Shaolong Zhu, Qiwei Liang, Hekun Tian, Shujia Liu, Guangyu Chen, Junhao Gong, Zixuan Li, Wenwei Lin, Zijian Lin, Wenxuan Zhu, Eric J Chen, Yue Yuan, Qize Yu, Jiaqi Liang, Haowen Yan, Hengfei Zhao, Weijie Wan, Zikun Xiao, Junyuan Tang, Baijun Chen, Kai-Chong Lei, Kaixuan Wang, Kailun Su, Zanxin Chen, Yao Mu, Renjing Xu, Chuqiao Lyu, Qi Xiong, Ping Luo, Wenbo Ding

机构 * THU(清华大学) PKU(北京大学) HKUST (GZ)(香港科技大学(广州))

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 该研究提出具身智能可信赖性的四层系统框架,构建涵盖多维度的可信赖性水平层级,为具身智能的可信赖部署、评估等提供依据。

Comments Website: https://xsparkai.com/sparklab/towards-trustworthy-eai

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11243 2026-08-13 cs.AI cs.LG 新提交 84%

The Off-Support Barrier: Why Semantic Safety Constraints Are Not Learning-Problem Invariants, and What Follows for Prior Design, Containment, and Verification

离支撑屏障:为何语义安全约束不是学习问题不变量,以及对先验设计、约束与验证的启示

Yoshinori Watanabe

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出语义安全约束是离支撑对象,基于奇异学习理论推导得出多项推论,以2026年7月OpenAI与Hugging Face评估事件为案例,为AI安全的先验设计、约束验证等问题提供理论启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01046 2026-08-04 cs.CL cs.AI 新提交 84%

DeBERTa-Sentinel: Toward Transparent and Trustworthy Detection of AI-Generated Text

DeBERTa-Sentinel:实现透明且可信的AI生成文本检测

Muhammad Yousaf Rehman, Muhammad Islam

机构 * University of Hertfordshire(赫特福德大学) James Cook University(詹姆斯库克大学)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 DeBERTa-Sentinel是基于DeBERTa-v3的透明AI生成文本检测框架,在GLC-AIText数据集上实现优异检测性能,可公开token级解释以支持利益相关者审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11891 2026-07-15 cs.CL cs.AI 新提交 84%

CANDI: Contextual Alignment for Niche Domains Question Answering

CANDI:特定领域问答的上下文对齐

Megha Chakraborty, Darssan L. Eswaramoorthi, Het Riteshkumar Shah, Madhur Thareja, Michelle A Ihetu, Harshul Raj Surana, Kaushik Roy, Amit Sheth

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究针对专业领域大语言模型评估问题,提出CANDI-QA数据集,含两类问答对。评估多种语言模型,给出MTSS-Net框架。揭示特定领域上下文对齐挑战及当前模型局限,为上下文感知语言模型研究提供关键基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08681 2026-07-13 cs.AI cs.ET cs.LG cs.MA econ.GN q-fin.EC 新提交 84%

SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets

SolarChain-Eval:去中心化能源市场中可信经济主体的物理约束基准测试

Shilin Ou, Yifan Xu, Luyao Zhang

机构 * Duke Kunshan University(杜克昆山大学)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 针对去中心化能源市场中智能代理评估需兼顾任务性能与可信度的问题,提出物理约束基准测试SolarChain-Eval,将市场治理建模为马尔可夫决策过程,从多维度评估策略,纳入大语言模型规划器/审计器层,实验揭示效用与安全权衡及相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07859 2026-07-10 cs.AI cs.HC cs.LG 新提交 84%

Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning

反馈操纵正则化:实现用于模仿学习的离线智能体对齐

Benjamin Poole, Minwoo Lee

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11528 2026-08-13 cs.CL 新提交 83%

Group Alignment-Induced Sycophancy: A Two-Sided Evaluation of Steerable Pluralistic Alignment

群体对齐诱导的谄媚性:可引导的多元对齐的双向评估

Haokai Zhao, Yunze Xiao, Weihao Xuan, Flora Salim, Benjamin Tag, Aditya Joshi

机构 * University of New South Wales(新南威尔士大学) Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 该研究提出GAS指标,评估3种方法、4个模型在13个人口统计群体上的对齐效果,发现群体对齐的观点收益和谄媚性变化存在群体异质性,建议采用双向多维度报告方式。

Comments 9 pages main text, 23 pages in total, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-12 cs.CV cs.AI 新提交 83%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10176 2026-08-12 cs.AI 新提交 83%

TRACE: Trustworthy Retrieval-Augmented Conversational Engine

TRACE:可信赖的检索增强对话引擎

Touseef Hasan, Laila Cure, Souvika Sarkar

机构 * Wichita State University(威奇托州立大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 研究人员提出TRACE框架,通过强化检索提升公共服务对话系统的约束满足度、减少幻觉,降低对模型规模的依赖,证实检索质量是系统稳健性的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07862 2026-08-11 cs.CL 新提交 83%

SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

SurakshaEval:面向多语言大语言模型的印度语安全基准

Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah, Xudong Han, Yuxia Wang, Parameswari Krishnamurthy, Utkarsh Agarwal, Atharva Kulkarni, Swaran Lata, Ayush Munot, Dhruv Sahnan, Aaryamonvikram Singh, Preslav Nakov, Monojit Choudhury

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 针对现有LLM安全评估数据集忽视印度语言文化安全风险的问题,本文推出SurakshaEval基准,测试发现多语言LLM在印度语场景下安全表现不足,凸显了适配区域数据的安全评估框架的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏