arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2719 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 984 篇

2607.00387 2026-07-02 eess.AS 新提交 50%

From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning

从目标到应用:对齐音频自监督学习中的架构偏差

Kele Xu, Yulu Fang, Boda Zhou, Yulin Sun, Qisheng Xu, Qiya Song, Jin Zhang, Cheng Yang, Huaimin Wang

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过预训练目标、架构归纳偏差与下游应用的对齐,系统分析音频自监督学习,围绕五种范式讨论不同监督信号对表征的影响,并关联到CNN、RNN、状态空间模型、Transformer及混合架构的偏差,最后解读在语音、环境声、音乐、医学及多模态等领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01230 2026-07-02 eess.SY cs.SY 新提交 50%

Distributed Containment of a Compromised Agent through Repulsive Cages

通过排斥笼实现对被入侵智能体的分布式围堵

Luigi Petruzziello, Camilla Fioravanti, Gabriele Oliva

专题命中 安全评测 :safety(abstract)

AI总结 针对无人机群等自主系统中智能体被劫持的安全问题,利用低层避碰模块在高层被入侵时仍保持活跃的特性,提出分布式围堵框架,通过防御者配置几何形状塑造排斥场以约束和引导目标,基于Stackelberg博弈和排斥笼概念实现,并证明亚线性动态遗憾界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01040 2026-07-02 cs.IR 新提交 50%

As It Was: Aligning LLM Search Evaluation with Historical User Preferences

如其所是:将LLM搜索评估与历史用户偏好对齐

Ali Vardasbi, Gustavo Penha, Enrico Palumbo, Claudia Hauff, Hugues Bouchard, Mounia Lalmas

专题命中 安全评测 :alignment(abstract)

AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00635 2026-07-02 cs.SE 新提交 50%

Checked Program Recovery from Execution Video: A Sound Oracle for Untrusted Generators

从执行视频中检查程序恢复:针对不可信生成器的可靠预言机

Yuan Si, Jialu Zhang

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出一种双层验证预言机,通过静态检查证明镜头等价性并颁发证书,确保从不正确程序中拒绝,从而可靠恢复Scratch程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00579 2026-07-02 cs.CV 新提交 50%

EPO: Boosting 3D Foundation Models with Edge-based Pose Optimization

EPO:基于边缘位姿优化的3D基础模型增强

Mattia D'Urso, Christian Sormann, Mattia Rossi, Friedrich Fraundorfer

机构 * Graz University of Technology(格拉茨技术大学) Sony Europe(索尼欧洲)

专题命中 安全评测 :alignment(abstract)

AI总结 提出EPO,一种无跟踪的几何优化框架,通过边缘图对齐替代特征提取和轨迹构建,提升3D基础模型的SfM重建精度,在降低运行时和内存的同时匹配或超越束调整方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00345 2026-07-02 cs.SE 新提交 50%

Registry-Governed Agent Lifecycle:Completing EDDOps with Evaluation-DrivenRegistration, Promotion, and Retirement on AWS AgentCore

注册表治理的智能体生命周期:通过评估驱动的注册、晋升和退役在 AWS AgentCore 上完善 EDDOps

Richard Kang, Vincent Wang

专题命中 安全评测 :safety(abstract)

AI总结 提出 EDDOps 在 AWS Bedrock AgentCore 上的实践实例,通过成本-性能框架和注册表治理,将模型选择从基准排名转化为受治理的经济决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00099 2026-07-02 eess.SY cs.SY 新提交 50%

Grid-Interactive Thermal Management of AI Data Centers via Contextual Distributionally Robust Optimization

基于情境分布鲁棒优化的AI数据中心电网交互热管理

Jiachen Shen, Jian Shi, Yijie Yang, Chenye Wu, Dan Wang, Ju Bin Song, Zhu Han

专题命中 安全评测 :safety(abstract)

AI总结 针对AI数据中心突发工作负载和不确定热量生成导致的热违规问题,提出情境分布鲁棒优化(CDRO)框架,通过动态调整Wasserstein半径实现电网交互冷却控制,在极端负载下实现近零热违规,并将鲁棒性成本溢价降低约13.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00024 2026-07-02 cs.RO cs.MA cs.SY eess.SY 新提交 50%

Decentralized Geometric Control for Cable-Suspended Payload Transport with Adaptive Mass Estimation

基于自适应质量估计的缆绳悬挂载荷运输的分散几何控制

Hadi Hajieghrary, Benedikt Walter, Paul Schmitt, Miguel Hurtado

机构 * MassRobotics

专题命中 安全评测 :safety(abstract)

AI总结 提出GPAC四层分层架构,通过隐式协调实现多四旋翼无中心协调运输缆绳悬挂载荷,结合几何控制、自适应质量估计和CBF安全滤波,仿真显示低计算成本下平均跟踪误差33.8厘米。

Comments Accepted to be presented at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27660 2026-07-02 cs.CV 新提交 50%

MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving

MVPruner: 用于加速自动驾驶中多视图视觉语言模型的动态令牌剪枝

Nan Yang, Zhanwen Liu, Linfeng Zhang, Shangyu Xie, Yang Wang, Wenzhuo Zhou, Xiangmo Zhao

机构 * School of Information Engineering, Chang’an University, China(长安大学信息工程学院) School of Artificial Intelligence, Shanghai Jiaotong University, China(上海交通大学人工智能学院)

专题命中 安全评测 :alignment(abstract)

AI总结 提出MVPruner,一种两阶段自适应令牌剪枝方法,通过动态分配剪枝预算和基于指令的令牌选择,在保持精度的同时大幅降低计算量,实现多视图视觉语言模型的高效推理。

Comments accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31219 2026-07-01 cs.CV 新提交 50%

CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization

CooperScene: 具有C-V2X通信特性的多模态协作自主基准

Bo Wu, Ruoshen Mo, Justin Yue, Yanyu Zhang, Janice Nguyen, Guoyuan Wu, Amit Roy-Chowdhury, Matthew J. Barth, Hang Qiu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 安全评测 :alignment(abstract)

AI总结 提出CooperScene数据集,通过真实C-V2X通信特性、多模态传感器和3GPP标准,建立多车协作感知基准,包含59K帧、344K标注对象。

Comments Accepted to ECCV 2026. 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31082 2026-07-01 cs.CV 新提交 50%

Fleet: Few Shots Lead Effective AI-generated Image Detection

Fleet: 少量样本引导的有效AI生成图像检测

Jiaan Wang, Sirui Liu, Yu Li, Kaiyuan Yang, Juan Cao, Sheng Tang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对AI生成图像检测中静态特征空间泛化能力不足的问题,提出动态适应框架Fleet,通过约束路由校正实现少量样本快速适应新兴生成器,在64模型基准上将性能从20.4%提升至73.1%。

Comments 25 pages, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31012 2026-07-01 cs.HC 新提交 50%

Evaluating Interactivity: Toward Automated Assessment of AI-Generated Explorable Explanations

评估交互性:迈向AI生成的可探索解释的自动化评估

Xiaozao Wang, Zhewei Wang, Hongyi Wen

专题命中 安全评测 :alignment(abstract)

AI总结 提出EE-Eval框架,将交互性形式化为有限状态机,通过图度量和嵌入比较评估AI生成可探索解释的结构与语义相似性,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27398 2026-06-29 cs.SE 新提交 50%

Implementing GenAI-Supported Learning in Software Engineering and Computer Science Education using Bloom's Taxonomy

使用布鲁姆分类法在软件工程和计算机科学教育中实现生成式AI支持的学习

Vahid Garousi, Zafar Jafarov, Aytan Mövsümova, Leyla Memmedova, Hüseyn Mirzayev

专题命中 安全评测 :alignment(abstract)

AI总结 本研究设计布鲁姆分类法对齐的生成式AI框架,通过多课程实验发现:学生认为生成式AI对高阶认知活动最有价值,明确指导能促进反思性使用,为负责任使用生成式AI提供了可扩展的教学框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27128 2026-06-26 cs.CV cs.RO 新提交 50%

FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

FlameVQA: 一个基于辐射热监督的物理基础无人机野火VQA基准

Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi, Fatemeh Afghah

机构 * National Science Foundation(国家科学基金会) NASA(美国国家航空航天局)

专题命中 安全评测 :safety(abstract)

AI总结 提出FlameVQA,一个基于FLAME 3数据集的无人机野火多选视觉问答基准,利用配对的RGB和辐射热TIFF图像实现温度基础的推理,评估了多种MLLM在检测、定位、覆盖估计等任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26195 2026-06-26 cs.SD 新提交 50%

Soroll-IA: A Weakly Labeled Audio Dataset for Real-World Industrial Port Monitoring

Soroll-IA:用于真实工业港口监测的弱标注音频数据集

Javier Naranjo-Alcazar, Jordi Grau-Haro, Ruben Ribes-Serrano, Marta Garcia-Ballesteros, Pedro Zuccarello

机构 * Instituto Tecnologico de Informatica (ITI)(信息技术学院)

专题命中 安全评测 :safety(abstract)

AI总结 提出一个在西班牙瓦伦西亚真实工业港口环境中录制的弱标注音频数据集,包含22小时音频和26种声音事件类别,用于支持音频标注、弱监督声音事件检测及机器学习研究。

Comments Paper being under review at Journal on Audio, Speech, and Music Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22537 2026-06-26 cs.CV 新提交 50%

NegAS: Negative Label Guided Attention and Scoring for Out-of-Distribution Object Detection with Vision-Language Models

NegAS: 基于负标签引导的注意力与评分用于视觉语言模型的分布外目标检测

Yingjie Zhang, Shuai Li, Peng Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 安全评测 :safety(abstract)

AI总结 提出NegAS框架,利用负标签引导注意力(NegA)和基于sigmoid的OOD评分函数(NegS),解决VLM检测器中OOD区域利用不足和评分不兼容问题,显著提升OOD检测性能。

Comments Accept to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08420 2026-06-26 cs.CV 新提交 50%

CheXanatomy: Anatomy-Aware Vision-Language Modeling for Chest Radiographs

CheXanatomy: 面向胸部X光片的解剖感知视觉-语言建模

Sergios Gatidis, Curtis Langlotz, Christian Bluethgen

机构 * Stanford Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学医学与影像人工智能中心) Department of Radiology, Stanford University(斯坦福大学放射学系)

专题命中 安全评测 :alignment(abstract)

AI总结 提出CheXanatomy框架,通过自回归令牌空间监督将解剖知识融入预训练视觉-语言模型,实现解剖分割,在合成和真实X光片上性能媲美U-Net,并提升域迁移鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25701 2026-06-25 cs.CV 新提交 50%

Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray

Falcon: X射线中组合推理的功能组装与语言

Yonathan Michael, Mohamad Alansari, Natnael Takele, Andreas Henschel, Naoufel Werghi

机构 * Khalifa University(哈利法大学)

专题命中 安全评测 :safety(abstract)

AI总结 针对X射线安检中威胁来自分散组件功能兼容性的问题,提出Falcon框架,通过结构化安全状态表示实现组合威胁推理,并构建Falcon-X基准验证其有效性。

Comments Accepted at ECCV2026; Project Page: https://yonathan-kiflom.github.io/FALCON/page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-06-25 cs.CE 新提交 50%

Retrieval-Grounded Multilingual LLM Assistance for Island Smallholder Farmers

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25546 2026-06-25 cs.CV 新提交 50%

Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography

面向3D计算机断层扫描的疾病中心视觉语言预训练与混合视觉编码

Bowen Shi, Weiwei Cao, Ruifeng Yuan, Wanxing Chang, Wenrui Dai, Hongkai Xiong, Ling Zhang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab, 310023, Hangzhou, China(虎扑实验室,杭州,中国) Shanghai Jiao Tong University, China(上海交通大学,中国) Zhejiang University, China(浙江大学,中国) Fudan University, China(复旦大学,中国)

专题命中 安全评测 :alignment(abstract)

AI总结 提出一种结合CNN-ViT混合编码器、疾病级对比学习和诊断感知提示的视觉语言预训练框架,在CT-RATE和Rad-ChestCT上取得最优性能,并提升零样本诊断可靠性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25298 2026-06-25 cs.CV 新提交 50%

KidRisk: Benchmark Dataset for Children Dangerous Action Recognition

KidRisk:儿童危险动作识别基准数据集

Minh-Kha Nguyen, Trung-Hieu Do, Kim Anh Phung, Thao Thi Phuong Dao, Minh-Triet Tran, Trung-Nghia Le

机构 * Thong Nhat Hospital(统一医院)

专题命中 安全评测 :safety(abstract)

AI总结 构建包含2500个短视频和10000张图像的儿童危险动作数据集KidRisk,提出基于视觉语言模型的方法,在动作分类和危险识别上分别达到83.53%和96.14%的准确率。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24726 2026-06-24 cs.CV 新提交 50%

SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards

SER: 用语义证据奖励学习视频推理定位

Sheng Xia, Zhengqin Lai, Tianxiang Jiang, Kanghui Tian, Shoujun Zhou, Bin Li, Yi Wang

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)

专题命中 安全评测 :alignment(abstract)

AI总结 提出语义证据奖励(SER),通过将时空证据定位重构为约束验证任务,利用裁判VLM评估证据的相关性和定位质量,在V-STAR基准上提升3.0点mLGM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22318 2026-06-23 q-bio.OT 新提交 50%

PROMPT: A Pre-registered Randomized Protocol for Component-Level Evaluation of Clinical AI Prompts

PROMPT:临床AI提示组件级评估的预注册随机协议

Bin Hu, Avneek Sandhu, Shahryar Wasif

专题命中 安全评测 :safety(abstract)

AI总结 提出PROMPT协议,通过预注册、随机化、匹配对照和拆解设计,在合成和医学图像任务中识别提示组件的有益、有害和无效效应,揭示整体提示评估遗漏的安全漏洞。

Comments 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23354 2026-06-23 cs.CV 新提交 50%

Faithful Grounded Visual Reasoning via Learned Proxy-Tokens

通过学习的代理令牌实现忠实的接地视觉推理

Tom Hodemon, Mohamed Chaouch, Aboubacar Tuo, Angelique Loesch

机构 * CEA-LIST(法国原子能委员会-信息与系统技术实验室)

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出Composer模型,利用基于学习代理令牌的视觉接地机制,通过离散符号指针显式索引图像潜在空间,在保持答案准确性的同时将视觉接地准确率提升9.0个百分点。

Comments Accepted at ICIP 2026. Code, model and data available at: https://github.com/CEA-LIST/Composer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22399 2026-06-23 cs.SD 新提交 50%

ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

ATCCaps: 一个面向空中交通管制识别的呼号感知语音数据集

Dongdong Li, Jianwei Song, Jianwei Wang, Zhe Wang

机构 * East China University of Science and Technology(华东理工大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出ATCCaps,一个基于真实无线电通话构建的呼号感知语音数据集,包含202.94小时音频和17万条话语,通过结合置信度感知的转录解析、ADS-B呼号元数据、规则过滤和LLM辅助字幕生成,支持ASR评估、呼号匹配和音频-文本检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21861 2026-06-23 cs.CV 新提交 50%

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Magna International(麦格纳国际)

专题命中 安全评测 :safety(abstract)

AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。

Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21538 2026-06-23 physics.flu-dyn 新提交 50%

Turbulence Physics Governs a Scaling Law for the Machine-Learning Predictability Ceiling in Chaotic Flow

湍流物理支配混沌流中机器学习可预测性上限的标度律

Jiashun Guan, Haoyang Hu, Yunxiao Ren, Michael S. Triantafyllou, Dixia Fan

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究揭示混沌流中机器学习预测精度随预报时长恶化的标度律,源于湍流理论而非模型缺陷,并通过钝体绕流高保真仿真验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19703 2026-06-19 cs.HC 新提交 50%

Vibe Coding for Visualization Implementation: An Empirical Study of Practices and Challenges

Vibe Coding 用于可视化实现:实践与挑战的实证研究

Zhengyu Sun, Xiaolin Wen, Fengjie Wang, Can Liu, Yi Lai, Christophe Hurter, Yong Wang

专题命中 安全评测 :alignment(abstract)

AI总结 通过16名参与者的实证研究,探讨用户使用AI驱动的自然语言交互工具生成可视化时的实践(提示、评估、迭代)和挑战。

Comments 5 pages, 2 figures. Short paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17128 2026-06-19 cs.AR 新提交 50%

Shift-Left High-Level Synthesis Verification via Knowledge-Augmented LLM Agent

通过知识增强的LLM智能体实现左移高层次综合验证

Zhihan Xiao, Hongbing Lang, Zhe Zhao, Luke Ztz Hu, Songping Mai

专题命中 安全评测 :alignment(abstract)

AI总结 提出一种知识增强的智能体驱动左移验证框架,通过双层级一致性检查、符号执行和HLS验证知识图谱,在综合前自动验证C与HLS-C的功能一致性,覆盖率达98.26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19062 2026-06-18 cs.CV 新提交 50%

DREAM: Extending Vision-Language Models with Dual-Objective Encoding for Cross-Modal Retrieval

DREAM: 通过双目标编码扩展视觉-语言模型用于跨模态检索

Kaleem Ullah, Altaf Hussain, Muhammad Munsif, Sung Wook Baik

机构 * Sejong University(世宗大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) Ulsan National Institute of Science and Technology(乌山国立科学研究院)

专题命中 安全评测 :alignment(abstract)

AI总结 提出DREAM模型,通过双路径表示增强与对齐,结合层级视觉编码器和混合语言建模,在视频检索任务中实现新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏