arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-10 至 2026-08-10 共收录 57 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 20 篇

2608.07463 2026-08-10 cs.CV cs.LG 新提交 57%

MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation

MirrorWorld:利用视频扩散模型生成镜像反射

Youjun Zhao, Alex Warren, Gary K. L. Tam, Rynson W. H. Lau

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 MirrorWorld是一种反射感知视频修复框架,通过语义关系蒸馏和几何变换对齐建模场景与镜像的关系,在视频镜像反射重建任务上优于现有方法。

Comments Project Page: https://youjunzhao.github.io/MirrorWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07214 2026-08-10 cs.DB cs.AI cs.SY eess.SY 新提交 57%

Toward a Causal Data Management Ecosystem for Decision Making and Agentic AI

面向决策与智能体AI的因果数据管理生态系统

Dazhuo Qiu, Yingli Zhou, Amedeo Pachera, Angela Bonifati, Andrea Mauri

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文针对AI生态系统决策混杂问题,提出构建共享可查询的因果世界系统(CWS),为面向决策与智能体AI的因果数据管理生态系统提供支持。

Comments Accepted at ACM AI Leadership Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06909 2026-08-10 cs.AI 新提交 57%

Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework

长时程智能体轨迹归因:统一基准与细粒度标注框架

Jing Chen, Yang Sun, Li Zhang, Lin Xu, Jie Shi

机构 * Huawei Technologies Ltd.(华为技术有限公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对现有智能体轨迹基准缺乏细粒度归因分析支持的问题,提出轨迹归因任务,构建含1300余条标注轨迹的统一基准与标注框架,定义两项评估任务并发布可复用标注技能。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06898 2026-08-10 cs.RO cs.CL cs.HC 新提交 57%

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots

我该如何为我的机器人选择基础模型?支持社会机器人的社区评估框架

Eric Nichols, Alva Markelius, Hatice Gunes

机构 * Honda Research Institute Japan(本田研究所日本分部) University of Cambridge(剑桥大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 针对社会机器人选择基础模型的难题,本文提出三层评估漏斗范式,梳理五个评估维度的适用评估方法,呼吁社区共建评估框架。

Comments 5 pages, 1 figure, 1 table. Accepted at the FoRMA workshop (Foundation Models in the RO-MAN Age: Responsible Development for Social Robotics) at IEEE RO-MAN 2026, Kitakyushu, Japan. Workshop homepage: https://sites.google.com/cam.ac.uk/forma/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06785 2026-08-10 cs.CL 新提交 57%

Multi-Perspective Triad Interaction Graph Neural Network for Cognitive Distortion Detection

用于认知扭曲检测的多视角三元组交互图神经网络

Jun Seo Kim, Hye Hyeon Kim

机构 * Gachon University(嘉泉大学) Yonsei University(延世大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对现有认知扭曲检测方法忽略扭曲思维心理结构的问题,提出MTI-GNN模型,在多数据集上验证其性能优于基线模型及生成模型,且各视角均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06672 2026-08-10 cs.CL 新提交 57%

TA-RAG: Tone Awareness as a Design Imperative for Retrieval-Augmented Generation

TA-RAG:将语气感知作为检索增强生成的设计要务

Yong-Bin Kang, Anthony McCosker

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 该研究针对标准RAG系统存在的语境脱耦问题,提出TA-RAG框架,将交流对齐与事实准确性并列为核心设计目标,明确语气感知是高风险语境下RAG系统的设计要务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06663 2026-08-10 cs.CL 新提交 57%

The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents

视界差距:长视界大语言模型智能体的规划、记忆、执行、训练与评估

Mingguang Chen, Licheng Wang, Bo Qu

机构 * DeepGrounding(深地研究机构) AlphaAvatar(阿尔法 Avatar 公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出长视界大语言模型智能体存在的视界差距,调研1547篇相关论文,厘清长视界等属性,分析领域应对措施并提出开放测量问题。

Comments 39 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06613 2026-08-10 cs.CV cs.AI 新提交 57%

Do 3D Medical Foundation Models See Through MRI Artifacts? A Controlled Study of Representation Robustness

三维医学基础模型能看穿MRI伪影吗?一项关于表示鲁棒性的对照研究

Julia Anna Mielcarz, Daniel Klaaby, Mostafa Mehdipour Ghazi

机构 * Pioneer Centre for AI, University of Copenhagen(哥本哈根大学先锋人工智能中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文对照评估五种三维医学基础模型的表示鲁棒性,发现其鲁棒性与模型及伪影类型相关,部分模型对伪影更敏感,仅靠大规模预训练无法保证伪影不变性,需部署前评估鲁棒性。

Comments Accepted at the ECCV 2026 Workshop on Artificial Intelligence for Medical 3D Vision (AI4M3D)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06705 2026-08-10 cs.SE 新提交 50%

Translation Tag Team: Formal Rules and LLMs Translate More Macros Together than Apart

翻译搭档团队:形式化规则与大语言模型协同翻译宏比单独翻译更有效

Brent Pappas, Joseph Zalusky, Zachary Burkett, Paul Gazzillo

专题命中 安全评测 :safety(abstract)

AI总结 该研究提出形式化翻译器MerC,结合MerC与大语言模型(LLMs)的搭档方法,在宏翻译任务中比单独使用任一技术更优,可降低失败率并提升翻译覆盖率。

Comments 13 pages, 7 figures, 2 tables, 8 listings, conference. To be published in ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06662 2026-08-10 cond-mat.mtrl-sci cond-mat.mes-hall physics.comp-ph 新提交 50%

Cross-Geometry Transferability Assessment of Universal Machine Learning Interatomic Potentials: From Bulk Materials to Atomic Nanowires

通用机器学习原子间势的跨几何可迁移性评估:从块体材料到原子纳米线

Pedro H. M. Zanineli, Bruno Focassio, Gabriel R. Schleder

专题命中 安全评测 :alignment(abstract)

AI总结 该研究评估通用机器学习原子间势的跨几何可迁移性,构建ZrO₂多构型数据集,测试26个预训练模型,发现零样本预测存在几何依赖型误差,对比不同训练策略,指出适配低配位离子纳米结构需多样目标数据与物理验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11522 2026-08-10 cs.HC 版本更新 50%

Asymmetric Trust Effects of Corrective AI in Expert Advisory Workflows under Epistemic Dependence

人工智能参与对专家咨询工作流中信任的影响

Dennis Kim, Roya Daneshi, Bruce Draper, Sarath Sreedharan

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究探讨人工智能在专家咨询工作流中对用户信任的影响,发现人类专家使用AI的方式会影响用户对专业知识的信任。

Comments Revised version. Accepted to AIES 2026. Includes technical appendices and additional analyses

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 4 篇

2608.07367 2026-08-10 cs.AI 新提交 79%

People Are Not Just Their Countries. Disentangling Social Determinants of LLM Value Alignment Across Europe

人不只是其所属国家:在欧洲范围内解耦大型语言模型(LLM)价值对齐的社会决定因素

Maria-Louisa Wightman, Guillaume Bied, Tijl De Bie

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 本研究依托欧洲社会调查,发现LLMs与不同社会人口学群体的价值观对齐存在差异,国籍作为单独变量的解释力与全部社会人口学变量相当,国家与社会人口学因素在解释对齐模式上互补。

Comments Accepted at AIES 2026 (9th AAAI/ACM Conference on AI, Ethics, and Society)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05726 2026-08-10 cs.CL cs.AI 交叉投稿 62%

Mitigating Scoring Bias in LLM-as-a-Judge via Random Number Generation

通过随机数生成缓解作为评判者的大语言模型(LLM-as-a-Judge)中的评分偏差

Yuma Asato, Kiyoaki Shirai, Natthawut Kertkeidkachorn

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM-as-a-Judge的评分偏差问题,提出通过随机数生成识别并校正LLM潜在数字偏差的方法,在四项任务上的表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20255 2026-08-10 cs.CR cs.AI 版本更新 57%

The Ethics of Autonomous AI Agents for Offensive Security

用于进攻性安全的自主人工智能代理的伦理问题

Andreas Happe, Jürgen Cito, Jasmin Wachter

机构 * TU Wien(维也纳技术大学) University of Klagenfurt(克雷格福大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究使用自主人工智能代理进行进攻性安全时的伦理问题,分析道德归因在多方的扩散及技术对利益相关者的影响,通过研究其不确定性等特性及攻防成本不对称性,为现有框架不适用于此情况提供分层建议。

Comments accepted at FAIEMA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06829 2026-08-10 cs.SE 新提交 50%

How Reasoning Shapes Social Bias in LLM-Generated Code?

推理如何塑造大语言模型生成代码中的社会偏见?

Weifeng Sun, Jieke Shi, Zhou Yang, Yuchen Chen, Hongyan Li, Meng Yan, David Lo

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 该研究首次系统探究基于推理的代码生成中的社会偏见,发现推理可降低偏见但会影响代码质量,进而提出ProbeDebias框架,有效检测并缓解代码偏见,同时保持较高质量。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 12 篇

2604.21827 2026-08-10 cs.AI cs.HC 版本更新 79%

Alignment has a Fantasia Problem

对齐存在幻想问题

Nathanael Jo, Zoe De Simone, Mitchell Gordon, Ashia Wilson

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 该研究指出指令微调AI因不理解人类认知过程会产生幻想交互,剥夺用户任务自主权,进而提出需重新思考对齐研究,优化交互中认知责任分配并规划了相关研究议程。

Comments 10 pages, 2 figures

Journal ref ICLR 2026 Workshop HCAIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06876 2026-08-10 cs.CV cs.AI cs.DC cs.LG 新提交 73%

FedVAR: Prototype-Aligned Federated Framework for Video Anomaly Recognition

FedVAR:用于视频异常识别的原型对齐联邦框架

Ghani Haider, Majid Kundroo, Boyun Eom, Dong Hwan Park, Chen Chen, Taehong Kim

机构 * Chungbuk National University(忠北国立大学) Electronics and Telecommunications Research Institute (ETRI)(电子通信研究院) University of Central Florida(中佛罗里达大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 针对联邦视频异常识别中的语义错位问题,本文提出FedVAR框架,通过视觉语言模型的原型对齐机制缓解错位,实验显示其性能优于现有联邦基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06752 2026-08-10 cs.AI cs.CL 新提交 62%

Mind the Gap: A Dual Knowledge Graph Framework for Unified Multi-task User Intent Inference

弥合差距:用于统一多任务用户意图推理的双知识图谱框架

Tzu-Cheng Peng, Chien Chin Chen, Chih-Hao Ku, Yung-Chun Chang

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对在线旅游评论的多任务用户意图推理,提出DKG-MTI双知识图谱框架,结合动态构建的用户特定意图知识图谱与全局酒店知识图谱,经大语言模型处理后,在相关任务上优于现有基线。

Comments Published in the PACIS 2026 Proceedings as a Completed Research Paper. AIS eLibrary: https://aisel.aisnet.org/pacis2026/ai_ml/ai_ml/12/ 17 pages, 5 figures

Journal ref Proceedings of the Pacific Asia Conference on Information Systems (PACIS 2026), Paper 12, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13491 2026-08-10 cs.LG cs.AI 版本更新 62%

DeepLoop: Depth Scaling for Looped Transformers

DeepLoop:循环变换器的深度缩放

Shuzhen Li, Yifan Zhang, Jiacheng Guo, Quanquan Gu, Mengdi Wang

机构 * Princeton University(普林斯顿大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究循环变换器中深度缩放问题,提出DeepLoop方法,通过控制访问对齐系数形式化绑定深度效应,保持特定架构并设置参数,在不同规模GPT风格模型上实验,结果显示稳定循环深度需考虑参数访问的残差缩放规则。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06793 2026-08-10 cs.LG cs.AI 版本更新 62%

Minimal Ingredients for Reward Assignment from Expert Demonstrations

从专家演示中进行奖励分配的最小要素

Zixuan Dong, Yumi Omori, Keith Ross

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎赫尔分校) Shanghai Frontiers Science Center of Artificial Intelligence and Deep Learning, NYU Shanghai(上海前沿科学中心(人工智能与深度学习))

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 该研究探究从专家演示分配奖励的最小结构,通过32个基准测试和三种下游RL算法,发现离线场景仅需接近度,在线或多演示时需轻量级时间对应,倡导奖励设计的算法极简主义。

Comments Accepted by Reinforcement Learning Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06948 2026-08-10 cs.AI 新提交 57%

LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents

多模态大模型模态迁移:自主地理信息系统智能体的先决条件

Ivan Majic, Zexian Huang, Franziska Hübl, Krzysztof Janowicz, Meilin Shi, Mina Karimi, Zilong Liu, Alexandra Fortacz-Lazan

机构 * Graz University of Technology(格拉茨工业大学) University of Vienna(维也纳大学) University of Liverpool(利物浦大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文针对自主GIS智能体的先决条件,提出LMM模态迁移任务,发现现有LMM在图像与文本模态间传递空间信息的能力不足,需加强多模态对齐以实现地理空间理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27581 2026-08-10 cs.LG 版本更新 57%

MUGEN: A Unified Framework for Efficient Motion Understanding and Generation

MUGEN:用于高效运动理解与生成的统一框架

Zhankai Ye, Yukai Jin, Bingyang Wei, Bofan Li, Yusen Wu, Fangyi Li, Shangqian Gao, Xin Liu

机构 * Florida State University(佛罗里达州立大学) Texas Christian University(得克萨斯基督教大学) University of Miami(迈阿密大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 MUGEN是一个无码本的统一运动-语言框架,通过自适应长度自编码器实现高效运动压缩,在HumanML3D和SnapMoGen数据集上的生成、检索与对齐指标均表现优异,兼顾效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15771 2026-08-10 cs.CL 版本更新 57%

Skill-RAG: Failure-State-Aware Retrieval Augmentation via Hidden-State Probing and Skill Routing

Skill-RAG: 通过隐藏状态探测与技能路由实现故障状态感知的检索增强

Kai Wei, Raymond Li, Xi Zhu, Zhaoqian Xue, Jiaojiao Han, Jingcheng Niu, Fan Yang

机构 * University of Michigan(密歇根大学) University of British Columbia(不列颠哥伦比亚大学) Rutgers University(罗格斯大学) University of Pennsylvania(宾夕法尼亚大学) New Jersey Institute of Technology(新泽西理工学院) TU Darmstadt(图腾斯大学) Wake Forest University(威克森林大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出Skill-RAG框架,通过轻量级隐藏状态探测器和基于提示的技能路由器,在检索失败时诊断原因并选择四种技能(查询重写、问题分解、证据聚焦、退出)纠正查询-证据错位,显著提升多轮检索后困难案例的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17584 2026-08-10 cs.AR cs.LG 版本更新 57%

CHIME: A Case for Efficient Long-Context Attention-FC Disaggregated Inference with DIMM-PIM

CHIME:基于DIMM-PIM的高效长上下文注意力-全连接分离式推理方案

Qingyuan Liu, Liyan Chen, Haocheng Wang, Yanning Yang, Dong Du, Zhigang Mao, Naifeng Jing, Yubin Xia, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 CHIME是首个集成DIMM-PIM的AFD系统,通过无气泡流水线等技术解决同步问题,实现最高5.15倍于HBM-PIM方案的LLM推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07279 2026-08-10 eess.SP 新提交 50%

Token Communication for Multimodal Large Language Model

多模态大语言模型的令牌通信

Jingkai Ying, Zhijin Qin, Yuan Shen, Khaled B. Letaief

专题命中 其他安全 :alignment(abstract)

AI总结 本文针对多模态大语言模型(MLLMs)的令牌传输问题,提出适配MLLMs的令牌通信框架,通过集成神经编解码器、两阶段语义对齐训练及自适应适配器,在相同传输数据量下实现更优任务性能。

Comments 13 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06722 2026-08-10 cs.HC 新提交 50%

CustomDance: Customized 3D Dance Generation with Coarse-to-Fine Human-Centered Interactive Control

CustomDance:基于以人为中心的粗到细交互式控制的定制化3D舞蹈生成

Xulong Tang, Kaixing Yang, Xiaohu Guo, Prabhakaran Balakrishnan, Rawan Alghofaili

专题命中 其他安全 :alignment(abstract)

AI总结 CustomDance是基于粗到细交互式控制的定制化3D舞蹈生成系统,通过三阶段流程实现AI辅助编舞,在定量和定性比较中优于基线,为用户提供全面控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18816 2026-08-10 cs.CV 版本更新 50%

Grad-ECLIP: Gradient-based Visual and Textual Explanations for CLIP

Grad-ECLIP: 基于梯度的CLIP视觉与文本解释

Chenyang Zhao, Kun Wang, Janet H. Hsiao, Antoni B. Chan

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Division of Social Science and Department of Computer Science & Engineering, Hong Kong University of Science & Technology(香港科学与技术大学社会科学学院及计算机科学与工程系) SenseTime Group Ltd(时光集团有限公司)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出Grad-ECLIP方法,通过分解CLIP编码器架构并分析匹配相似度与中间空间特征的关系,生成有效热图以解释CLIP匹配结果。通过通道和空间权重提升视觉解释质量,并通过定性定量评估验证其有效性。

Journal ref Zhao C, Wang K, Hsiao J H, et al. Grad-eclip: Gradient-based visual and textual explanations for clip[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏