arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-02 至 2026-07-02 共收录 22 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 22 篇

2607.00464 2026-07-02 cs.LG cs.CL 新提交 86%

MolSafeEval: A Benchmark for Uncovering Safety Risks in AI-Generated Molecules

MolSafeEval: 揭示AI生成分子安全风险的基准

Tong Xu, Xinzhe Cao, Zhihui Zhu, Keyan Ding, Huajun Chen

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙大-杭州全球科技创新中心) University of Oxford(牛津大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 提出MolSafeEval基准,通过构建分子安全知识图谱和基于大语言模型的推理,系统评估四类分子生成模型的安全风险,揭示当前方法的漏洞。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00218 2026-07-02 cs.CV cs.AI 新提交 79%

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

EgoSafetyBench:用于评估具身VLM作为运行时安全卫士的诊断性自我中心视频基准

Siddhant Panpatil, Arth Singh, Mijin Koo, Chaeyun Kim, Haon Park, Dasol Choi

机构 * AIM Intelligence(AIM智能研究所) Seoul National University(首尔国立大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出EgoSafetyBench,一个包含1200个机器人视角场景的自我中心视频基准,用于评估视觉语言模型在流式安全监控中的能力,通过情景和视觉通道两个轨道测试模型识别危险和应对误导性文本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00395 2026-07-02 cs.HC 新提交 78%

Child Safety in Generative AI: An Expert-Guided and Incident-Grounded Evaluation Framework

生成式AI中的儿童安全:一个专家引导且基于事件的评估框架

Haein Kong

专题命中 安全评测 :safety(title,abstract)

AI总结 针对儿童使用生成式AI的特定风险,提出一个结合专家引导风险因素和真实AI事件数据的评估框架,并应用于教育领域评估Llama Guard模型,发现其难以检测教育相关的不安全用户提示。

Comments Accepted to the HEAL Workshop at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08625 2026-07-02 cs.CL 新提交 70%

From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape

从整体评估到结构化标准:大语言模型演变中的评分准则

Hao Chen, Ziyu Han, Yukun Yan, Qingfu Zhu, Maosong Sun, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Department of Computer Science and Technology, Institute for AI(计算机科学与技术系,人工智能研究院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出评分准则作为统一框架,通过分解整体判断为可验证维度、提供过程级反馈和动态涌现自模型行为三个层次,连接人类意图与机器行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00083 2026-07-02 cs.CL cs.AI cs.LG 新提交 67%

Harnessing the Latent Space: From Steering Vectors to Model Calibrators for Control and Trust

利用潜在空间:从引导向量到模型校准器以实现控制与信任

Nishant Subramani

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用潜在空间中的引导向量控制语言模型行为,并开发基于潜在空间的模型校准器评估输出可信度,从而增强模型的可控性与可靠性。

Comments ACL 2026 (BigPicture Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20817 2026-07-02 cs.IR cs.MM 67%

RAG-VisualRec: An Open Resource for Vision- and Text-Enhanced Retrieval-Augmented Generation in Recommendation

RAG-VisualRec: 一种面向电影领域的视觉与文本增强的检索增强生成推荐开放资源

Ali Tourani, Fatemeh Nazary, Yashar Deldjoo

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文提出RAG-VisualRec,通过结合LLM生成的项目描述和剪辑生成的视觉嵌入,提升多模态推荐系统的检索与生成能力,通过可配置融合策略和质量控制模块提高推荐效果和可复现性。

Comments 30 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13715 2026-07-02 cs.AI cs.CL cs.MA 新提交 62%

WorkBench Revisited: Workplace Agents Two Years On

WorkBench 再探:两年后的工作场所智能体

Olly Styles, Sam Miller

机构 * Independent researcher(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文重新评估2024至2026年间WorkBench基准上智能体的进展,发现前沿模型在能力和安全性上均有显著提升,但开放权重模型降低了高性能门槛。

Comments 8 pages, 3 figures. Follow-up to arXiv:2405.00823

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12243 2026-07-02 cs.CL cs.AI 版本更新 62%

Continuous Knowledge Metabolism: Generating Scientific Hypotheses from Evolving Literature

连续知识代谢:从演进文献中生成科学假设

Jinkai Tao, Yubo Wang, Xiaoyu Liu, Menglin Yang

机构 * Tsingyuai(清华院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CKM框架,通过滑动时间窗口处理文献并动态更新知识库,提出CKM-Lite和CKM-Full两种变体,揭示了增量处理在预测和效率上的优势,以及知识变化对假设生成的影响。

Comments ICML 2026 AI4Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04500 2026-07-02 cs.AI cs.CL cs.GT cs.MA 版本更新 62%

Large language models replicate and predict human cooperation across experiments in game theory

大型语言模型在博弈论实验中复制并预测人类合作行为

Andrea Cera Palatsi, Samuel Martin-Gutierrez, Ana S. Cardenal, Max Pellert

机构 * Department for Computational Social Sciences and Humanities, Barcelona Supercomputing Center(巴塞罗那超级计算中心计算社会科学与人文学系) Grupo de Sistemas Complejos, Universidad Politécnica de Madrid(马德里理工大学复杂系统研究组) School of Law and Political Science, Universitat Oberta de Catalunya(加泰罗尼亚开放大学法律与政治科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过复制大规模博弈实验,发现Llama模型能高保真复现人类合作模式,而Qwen更接近纳什均衡,并揭示了Llama的注意力机制与人类行为对齐的机理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16993 2026-07-02 cs.AI cs.CV cs.RO 版本更新 57%

Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification

规则导向的视觉语言导航:通过语义推理和几何校正弥合感知与合规性

Jiawen Wen, Penglei Sun, Wenjie Zhang, Suixuan Qiu, Weisheng Xu, Xiaofei Yang, Xiaowen Chu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Normal University(北京师范大学) Guangzhou University(广州大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出Rule-VLN,首个大规模城市规则合规导航基准,通过语义推理和几何校正模块提升导航安全性,实验表明该模块显著提升导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00767 2026-07-02 cs.LG 版本更新 57%

ActivityNarrated: An Open-Ended Narrative Paradigm for Wearable Human Activity Understanding

ActivityNarrated: 一种面向可穿戴人类活动理解的开放性叙事范式

Lala Shakti Swarup Ray, Mengxi Liu, Alcina Pinto, Deepika Gurung, Daniel Geissler, Paul Lukowoicz, Bo Zhou

机构 * DFKI Kaiserslautern(德国人工智能研究中心凯泽斯劳滕) RPTU(莱茵兰-普法尔茨州凯泽斯劳滕-兰道工业大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种开放性叙事范式,通过将可穿戴传感器数据与自然语言描述对齐,实现开放词汇环境下的人类活动理解,实验表明其在跨参与者评估中表现优于传统闭合集方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18050 2026-07-02 cs.CV cs.AI 交叉投稿 57%

UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios

UltraFlux:面向多种宽高比的高质量原生4K文本到图像生成的数据-模型协同设计

Tian Ye, Song Fei, Lei Zhu

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对扩散变压器扩展到原生4K多宽高比时出现的位置编码、VAE压缩和优化耦合失效问题,提出数据-模型协同设计的UltraFlux,通过共振2D RoPE、非对抗VAE后训练、SNR感知Huber小波目标和分阶段美学课程学习,在4K分辨率下实现高保真、细节保留的文本到图像生成。

Comments Project Page: https://w2genai-lab.github.io/UltraFlux/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00387 2026-07-02 eess.AS 新提交 50%

From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning

从目标到应用:对齐音频自监督学习中的架构偏差

Kele Xu, Yulu Fang, Boda Zhou, Yulin Sun, Qisheng Xu, Qiya Song, Jin Zhang, Cheng Yang, Huaimin Wang

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过预训练目标、架构归纳偏差与下游应用的对齐,系统分析音频自监督学习,围绕五种范式讨论不同监督信号对表征的影响,并关联到CNN、RNN、状态空间模型、Transformer及混合架构的偏差,最后解读在语音、环境声、音乐、医学及多模态等领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01230 2026-07-02 eess.SY cs.SY 新提交 50%

Distributed Containment of a Compromised Agent through Repulsive Cages

通过排斥笼实现对被入侵智能体的分布式围堵

Luigi Petruzziello, Camilla Fioravanti, Gabriele Oliva

专题命中 安全评测 :safety(abstract)

AI总结 针对无人机群等自主系统中智能体被劫持的安全问题,利用低层避碰模块在高层被入侵时仍保持活跃的特性,提出分布式围堵框架,通过防御者配置几何形状塑造排斥场以约束和引导目标,基于Stackelberg博弈和排斥笼概念实现,并证明亚线性动态遗憾界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01040 2026-07-02 cs.IR 新提交 50%

As It Was: Aligning LLM Search Evaluation with Historical User Preferences

如其所是:将LLM搜索评估与历史用户偏好对齐

Ali Vardasbi, Gustavo Penha, Enrico Palumbo, Claudia Hauff, Hugues Bouchard, Mounia Lalmas

专题命中 安全评测 :alignment(abstract)

AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00635 2026-07-02 cs.SE 新提交 50%

Checked Program Recovery from Execution Video: A Sound Oracle for Untrusted Generators

从执行视频中检查程序恢复:针对不可信生成器的可靠预言机

Yuan Si, Jialu Zhang

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出一种双层验证预言机,通过静态检查证明镜头等价性并颁发证书,确保从不正确程序中拒绝,从而可靠恢复Scratch程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00579 2026-07-02 cs.CV 新提交 50%

EPO: Boosting 3D Foundation Models with Edge-based Pose Optimization

EPO:基于边缘位姿优化的3D基础模型增强

Mattia D'Urso, Christian Sormann, Mattia Rossi, Friedrich Fraundorfer

机构 * Graz University of Technology(格拉茨技术大学) Sony Europe(索尼欧洲)

专题命中 安全评测 :alignment(abstract)

AI总结 提出EPO,一种无跟踪的几何优化框架,通过边缘图对齐替代特征提取和轨迹构建,提升3D基础模型的SfM重建精度,在降低运行时和内存的同时匹配或超越束调整方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00345 2026-07-02 cs.SE 新提交 50%

Registry-Governed Agent Lifecycle:Completing EDDOps with Evaluation-DrivenRegistration, Promotion, and Retirement on AWS AgentCore

注册表治理的智能体生命周期:通过评估驱动的注册、晋升和退役在 AWS AgentCore 上完善 EDDOps

Richard Kang, Vincent Wang

专题命中 安全评测 :safety(abstract)

AI总结 提出 EDDOps 在 AWS Bedrock AgentCore 上的实践实例,通过成本-性能框架和注册表治理,将模型选择从基准排名转化为受治理的经济决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00099 2026-07-02 eess.SY cs.SY 新提交 50%

Grid-Interactive Thermal Management of AI Data Centers via Contextual Distributionally Robust Optimization

基于情境分布鲁棒优化的AI数据中心电网交互热管理

Jiachen Shen, Jian Shi, Yijie Yang, Chenye Wu, Dan Wang, Ju Bin Song, Zhu Han

专题命中 安全评测 :safety(abstract)

AI总结 针对AI数据中心突发工作负载和不确定热量生成导致的热违规问题,提出情境分布鲁棒优化(CDRO)框架,通过动态调整Wasserstein半径实现电网交互冷却控制,在极端负载下实现近零热违规,并将鲁棒性成本溢价降低约13.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00024 2026-07-02 cs.RO cs.MA cs.SY eess.SY 新提交 50%

Decentralized Geometric Control for Cable-Suspended Payload Transport with Adaptive Mass Estimation

基于自适应质量估计的缆绳悬挂载荷运输的分散几何控制

Hadi Hajieghrary, Benedikt Walter, Paul Schmitt, Miguel Hurtado

机构 * MassRobotics

专题命中 安全评测 :safety(abstract)

AI总结 提出GPAC四层分层架构,通过隐式协调实现多四旋翼无中心协调运输缆绳悬挂载荷,结合几何控制、自适应质量估计和CBF安全滤波,仿真显示低计算成本下平均跟踪误差33.8厘米。

Comments Accepted to be presented at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27660 2026-07-02 cs.CV 新提交 50%

MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving

MVPruner: 用于加速自动驾驶中多视图视觉语言模型的动态令牌剪枝

Nan Yang, Zhanwen Liu, Linfeng Zhang, Shangyu Xie, Yang Wang, Wenzhuo Zhou, Xiangmo Zhao

机构 * School of Information Engineering, Chang’an University, China(长安大学信息工程学院) School of Artificial Intelligence, Shanghai Jiaotong University, China(上海交通大学人工智能学院)

专题命中 安全评测 :alignment(abstract)

AI总结 提出MVPruner,一种两阶段自适应令牌剪枝方法,通过动态分配剪枝预算和基于指令的令牌选择,在保持精度的同时大幅降低计算量,实现多视图视觉语言模型的高效推理。

Comments accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17920 2026-07-02 cs.CV 版本更新 50%

SegFly: A Dataset and 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale

SegFly:大规模航空RGB-热红外语义分割的数据集与2D-3D-2D范式

Markus Gross, Sai Bharadhwaj Matha, Rui Song, Viswanathan Muthuveerappan, Conrad Christoph, Julius Huber, Daniel Cremers

机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) UCLA(加州大学洛杉矶分校) Uni Cambridge(剑桥大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对航空RGB-T数据集规模小、标注成本高和对齐困难的问题,提出几何驱动的2D-3D-2D范式,通过少量RGB标注自动生成密集伪标签并实现跨模态对齐,构建含2万+RGB图像和1.5万+RGB-T对的SegFly基准,实验表明该范式有效提升分割性能。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏