arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-20 至 2026-07-20 共收录 54 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 19 篇

2607.08423 2026-07-20 cs.AI 版本更新 57%

OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice

OmniFood-Bench:评估用于营养推理和个性化健康建议的视觉语言模型

Qian Jiang, Zhecheng Shi, Jingpu Yang, Zirui Song, Miao Fang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 介绍OmniFood-Bench基准评估用于营养推理和个性化健康建议的VLMs,基于MM-Food-100K数据集,评估其三种能力,实验发现模型在菜品命名与质量估计等方面存在“语义-物理差距”,为公共卫生自主智能体建立可信度标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07636 2026-07-20 cs.CV cs.CL cs.MA 版本更新 57%

Crayotter: Traceable Multi-Agent Workflows for Long-Form Video Editing

Crayotter: 用于长视频编辑的可追踪多智能体工作流

Lecheng Yan, Yichong Zhang, Xiantao Xu, Jianze Lin, Ben Pan, Xiaoyu Zheng, Jiawei Qian, Anqi Wu, Jiahui Geng, Ruizhe Li, Fengyu Cai, Jingcheng Niu, Raymond Li, Wenxi Li, Chenyang Lyu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出Crayotter,一个开源多模态多智能体系统,通过三阶段工作流(材料准备、基于工件的编辑研究、工具驱动的执行)实现长视频编辑的可追踪性和选择性修订,在人类评估中优于基线方法。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10665 2026-07-20 hep-ph cs.LG 版本更新 57%

Pretrained Event Classification Model for High Energy Physics Analysis

用于高能物理分析的预训练事件分类模型

Joshua Ho, Benjamin Ryan Roberts, Shuo Han, Haichen Wang

机构 * Department of Physics, University of California, Berkeley, CA 94720(加州大学伯克利分校物理系) Physics Division, Lawrence Berkeley National Laboratory, Berkeley CA 94720(伯克利国家实验室物理部)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出基于图神经网络的预训练事件分类模型,通过1.2亿个模拟质子-质子碰撞事件学习通用表示,验证其在不同模拟框架下的泛化能力,并通过微调提升分类性能与效率。

Comments 13 pages, 2 figures

Journal ref JINST 21 (2026) P08006

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16107 2026-07-20 eess.AS cs.CV 新提交 50%

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

视听火烈鸟:用于长而复杂视频的开放视听智能

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(美国NVIDIA公司) University of Maryland, USA(美国马里兰大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究提出视听火烈鸟,用于长复杂视频的联合理解与推理。贡献包括构建大规模视频集、设计三阶段课程及推理框架。实验显示其在多基准测试中表现优异,超越同类开放模型,在长复杂视听理解推理任务中竞争力强,有现实应用价值和泛化能力。

Comments Project Page: https://avflamingo.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15820 2026-07-20 cs.SE 新提交 50%

In the Driver's Seat: A Multi-Company Study on the Reality of Autonomous Driving System Testing

掌控全局:关于自动驾驶系统测试现状的多公司研究

Qunying Song, Yuan Gao, Johannes Betz, Dietmar Pfahl, Mohammad Reza Mousavi, Federica Sarro

专题命中 安全评测 :safety(abstract)

AI总结 针对自动驾驶系统测试复杂且缺乏标准的问题,通过对九家公司专家访谈,经主题分析总结行业测试情况、挑战与趋势,提出以证据为中心的闭环测试框架,为ADS测试提供指导并指明未来方向。

Comments 34 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15718 2026-07-20 cs.SE 新提交 50%

Verified LLM-Driven Synthesis for Concept Design

用于概念设计的经过验证的大语言模型驱动的合成

Alcino Cunha

专题命中 安全评测 :safety(abstract)

AI总结 研究用于概念设计的大语言模型驱动合成,给出概念和反应的形式语义及验证方法,提出基于大语言模型的合成过程,探讨引导合成的方式及技术,通过评估表明不同方法各有优劣,大语言模型驱动的场景引出多数情况下可恢复预期设计。

Comments 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15661 2026-07-20 cs.CV 新提交 50%

Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach

用于医学视觉语言模型的模型合并:一个基准和一种赢家通吃的方法

Lichao Mou, Shilan Zhang, Chunlei Li, Bingcong Yan, Jingliang Hu, Yilei Shi, Shengwu Xiong, Xiao Xiang Zhu, Lei Li, Yaxiong Chen

机构 * Wuhan University of Technology(武汉理工大学) Technical University of Munich(慕尼黑工业大学) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究医学LVLMs的模型合并,提出涵盖多种成像模态和临床任务类型的MergeMedBench基准,评估现有合并方法,提出赢家通吃方法,该方法简单且无超参数,优于现有方法,为LoRA合并提供新视角和实用基线。

Comments Project Page: https://github.com/MedAI-T/MergeMedBench

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 9 篇

2607.15480 2026-07-20 cs.AI 新提交 79%

A Critical Analysis of Trustworthy AI Tools, Mark Frameworks, and the Implementation Chasms

对可信人工智能工具、标记框架及实施差距的批判性分析

Michael Papademas, Xenia Ziouvelou, Kostas Karpouzis, Vangelis Karkaletsis

机构 * Panteion University of Social and Political Sciences(潘泰翁社会与政治科学大学)

专题命中 AI治理与伦理 :trustworthy(title,abstract);分类 cs.AI

AI总结 研究对可信人工智能工具和标记框架进行批判性分析,利用经合组织数据集,通过实证映射等方法找出伦理重点等方面的不对称,发现当前存在的问题,建议扩大伦理目标、贯穿伦理于生命周期并促进多利益相关者参与,以推动人工智能治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16130 2026-07-20 cs.CY cs.AI cs.SY eess.SY 新提交 62%

A Methodology for Auditable Trustworthiness Levels in AI Lifecycle Governance

人工智能生命周期治理中可审计可信度水平的一种方法

Andrea Ferrario

机构 * Institute of Biomedical Ethics and History of Medicine, University of Zürich(生物医学伦理与医学史研究所,苏黎世大学) SUPSI, Dalle Molle Institute for Artificial Intelligence (IDSIA)(SUPSI人工智能研究所) ETH Zürich(苏黎世联邦理工学院)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 研究人工智能治理中系统可信度判断问题,提出轻量级方法,含形式框架与治理程序两部分,用决策树建模,能产生可信度平台等,通过合成轨迹说明方法可支持合规文档编制和生命周期监测。

Comments 32 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15282 2026-07-20 cs.HC cs.AI cs.CL 新提交 62%

Empathy as Predictive Misalignment Tolerance: A Co-Regulation Framework and the Regime Structure of Dialogue Repair

作为预测性偏差容忍度的同理心:一个协同调节框架和对话修复的机制结构

Molood Arman

机构 * Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究将同理心重新定义为预测性偏差容忍度,提出解释性错误容忍(IET)框架,通过两个计算探针评估。结果发现修复存在依赖机制的结构,揭示噪声水平等因素间相互作用,表明长时间互动中同理心是调节分歧动态,促使共情AI设计转向管理解释距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15888 2026-07-20 cs.CY cs.HC 新提交 57%

Red Light, Grey Zone: A Multi-Perspective Interactive Narrative for Autonomous Driving Ethics

红灯,灰色地带:自动驾驶伦理的多视角交互式叙事

Mengyi Wei, Nianhua Liu, Chenyu Zuo, Liqiu Meng

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 研究自动驾驶伦理这一公共问题,提出多视角交互式叙事方法,通过“红灯,灰色地带”原型展开研究。经探索性用户研究发现,该方法能支持非专家对人工智能系统中的问责、证据和治理进行反思,尤其在责任判断等方面有积极效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10931 2026-07-20 cs.CL 版本更新 57%

It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO

一个样本就能带偏所有:单次GRPO打破对齐

Naihao Deng, Yilun Zhu, Naichen Shi, Clayton Scott, Rada Mihalcea

机构 * University of Michigan(密歇根大学) Northwestern University(西北大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究发现,仅用单个有偏样本进行一步GRPO训练就能诱导大语言模型产生系统性偏见,且刻板印象推理泛化到多种属性、类别和基准测试,揭示了对齐机制的关键脆弱性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06381 2026-07-20 cs.HC cs.CY 版本更新 57%

Intimacy as Service, Harm as Externality: Critical Perspectives on AI Companion Platform Accountability

亲密作为服务,伤害作为外部性:人工智能伴侣平台问责的批判视角

Dayeon Eom, Julianne Renner, Sedona Chinn

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨人工智能伴侣作为数据化系统中亲密关系的生产、提取与治理场所,挑战将伤害归因于用户心理而非平台架构的主流观点,通过20名AI伴侣使用者的访谈揭示用户对伤害的认知、应对策略及责任分配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15615 2026-07-20 cs.CV 新提交 50%

Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

用于检测引导的乳腺钼靶病变分类的区域基础视觉语言学习

Zhengbo Zhou, Jiren Li, Dooman Arefan, Margarita Zuley, Shandong Wu

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 针对乳腺钼靶病变分类,提出区域基础视觉语言学习方法,先通过区域-文本对比预训练对齐特征,引入多组件目标减轻偏差,再联合优化辅助病变检测头,实验表明该方法在多设置下性能优于相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15862 2026-07-20 math.OC 新提交 50%

PriEco-DRL: Joint Optimization of Electric-Bus Eco-Driving and Transit-Priority Adaptive Signals via Deep Reinforcement Learning

PriEco-DRL:基于深度强化学习的电动公交生态驾驶与公交优先自适应信号联合优化

Dingshan Sun, Ang Li, Chaopeng Tan, Zicheng Su, Wanjing Ma, Marco Rinaldi

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出PriEco-DRL框架,运用深度强化学习将电动公交生态驾驶与公交优先自适应信号控制相结合,采用优先级加权最大压力控制器及结构化奖励,经集中训练和分散执行,实验表明其能降低电动公交能耗,实现能量-时间权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07070 2026-07-20 cs.SE 50%

Building an Open AIBOM Standard in the Wild

在真实环境中构建开放的AIBOM标准

Gopi Krishnan Rajbahadur, Keheliya Gallaba, Elyas Rashno, Arthit Suriyawongkul, Karen Bennet, Kate Stewart, Ahmed E. Hassan

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文通过行动研究方法,在真实环境中构建了AIBOM规范,旨在为人工智能系统提供开放的标准框架。

Comments Accepted to be published at the IEEE/ACM 48th International Conference on Software Engineering (ICSE) - Software Engineering in Practice (SEIP) track. April 12 - 18, 2026. Rio de Janeiro, Brazil

Journal ref Proc. IEEE/ACM 48th International Conference on Software Engineering: Software Engineering in Practice (ICSE-SEIP '26), 2026, pp. 842--853

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 8 篇

2607.15810 2026-07-20 cs.LG 新提交 79%

QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides

QUADS:通过双边量化误差对齐稳定用于专家混合模型的NVFP4强化学习

Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

机构 * Alibaba Inc(阿里巴巴公司)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 研究针对MoE大语言模型RL中展开生成瓶颈,提出QUADS方法。通过训练 - 推理误差分析确定激活误差是FP4 RL不稳定主因,在训练器和展开侧分别采取措施,实现BF16精度,提升指标并提高展开吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15686 2026-07-20 cs.AI 新提交 57%

S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation

S1-Omni:用于科学理解、预测和生成的统一多模态推理模型

Jiahao Zhao, Junyi Liu, Lifeng Xu, Nan Xu, Qingli Wang, Qingxiao Li, Tianle Chen, Xiaoyu Wu, Yawen Zheng, Zikai Wang, Guanming Liu, Hequn Zhou, Jingyi Wang, Jingyuan Shu, Keqi Wang, Li He, Songyang Diao, Wenhui Xu, Xinyu Ren, Yaqin Fan, Yujin Zhou, Zhanao Yao

机构 * ScienceOne AI(科学一号人工智能) Wenge AI(文阁人工智能)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究针对科学人工智能模型能力分散问题,提出S1-Omni统一多模态推理模型,基于科学数据统一表示、知识对齐和解码三个核心组件,经训练和评估,在多基准测试中表现出色优于同类模型,为统一科学建模提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15600 2026-07-20 cs.CV 新提交 50%

Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth

从校正立体中进行几何蒸馏:利用对极线索进行单目深度估计

Jung-Hee Kim, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对单目深度估计在不同环境下的难题,提出将多视图模型的尺度感知几何先验转移到单目深度基础模型的框架,通过对极蒸馏方法,无需多视图输入就能保持几何一致性,显著提升零样本度量深度估计性能,且与模型无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09581 2026-07-20 cs.CV cs.SD 版本更新 50%

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

万舞者:一种用于分钟级连贯音乐到舞蹈生成的分层框架

Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Ruoshi Zhang, Yi Lu, Gang Cheng, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 其他安全 :alignment(abstract)

AI总结 针对从音乐生成舞蹈视频的挑战,提出万舞者分层框架,解耦过程为全局关键帧规划和局部时间细化,利用音乐上下文确保连贯,通过动态帧率自适应等创新,突破时长限制,在多舞蹈类型上表现出色,达新的技术水平。

Comments project: https://humanaigc.github.io/wan-dancer-project/, code: https://github.com/Wan-Video/Wan-Dancer, modelscope: https://www.modelscope.cn/models/Wan-AI/Wan-Dancer-14B, huggingface: https://huggingface.co/Wan-AI/Wan2.2-Animate-14B

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27350 2026-07-20 cs.AR 版本更新 50%

CHIA: An open-source framework for principled, agentic AI-driven hardware/software co-design research

CHIA: 一个用于原则性、智能体AI驱动的硬件/软件协同设计研究的开源框架

Angela Cui, Ferran Hermida-Rivera, Jack Toubes, Raghav Gupta, Jim Fang, Chengyi Lux Zhang, Ella Schwarz, Junha Kim, Yakun Sophia Shao, Borivoje Nikolic, Christopher W. Fletcher, Sagar Karandikar

专题命中 其他安全 :alignment(abstract)

AI总结 提出CHIA开源框架,通过有向循环图表达智能体AI驱动的协同设计流程,支持多种工具集成,实现可扩展、容错的大规模协同设计研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07588 2026-07-20 cs.MA 版本更新 50%

An Agent-Centric Dynamical Systems Perspective on Multi-Agent Reinforcement Learning

基于智能体中心动力系统视角的多智能体强化学习

James Rudd-Jones, María Pérez-Ortiz, Mirco Musolesi

专题命中 其他安全 :safety(abstract)

AI总结 提出将多智能体强化学习训练建模为耦合随机动力系统,利用动力系统理论分析智能体行为的稳定性和敏感性,以应对随机性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02851 2026-07-20 cs.RO 版本更新 50%

EmbodiedDiffusion: End-to-End Traversability-Guided Visual Diffusion for Heterogeneous Robot Navigation

EmbodiedDiffusion:用于异构机器人导航的端到端可通行性引导视觉扩散

Iana Zhura, Sausar Karaf, Faryal Batool, Nipun Dhananjaya Weerakkodi Mudalige, Valerii Serpiva, Ali Alridha Abdulkarim, Aleksey Fedoseev, Didar Seyidov, Hajira Amjad, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科沃科学与技术研究所)

专题命中 其他安全 :safety(abstract)

AI总结 针对自主导航中视觉可通行性估计问题,EmbodiedDiffusion框架利用无规划器合成监督等,同时预测可通行性地图与生成可行轨迹,经训练提炼语义到轻量级模型,能快速适应新平台,在多机器人室内环境中实现高效导航与轨迹生成。

Comments This work has been submitted for publication and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12483 2026-07-20 cs.SE 版本更新 50%

MoT: Modularization-of-Thought Prompting for Effective Code Generation

MoT:用于有效代码生成的思维模块化提示

Ruwei Pan, Hongyu Zhang

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对大语言模型代码生成中现有提示技术不足,提出MoT技术,利用模块化原则分解问题,用MLR图构建推理过程,经实验对比六种基线技术,在八个基准上显著提升代码生成性能,Pass@1分数达58.1%至95.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏