arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-08 至 2026-07-08 共收录 43 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 2 篇

2607.05441 2026-07-08 cs.IR cs.AI 新提交 57%

PORTS: Preference-Optimized Retrievers for Tool Selection with Large Language Models

PORTS:用于大语言模型工具选择的偏好优化检索器

Lorenzo Molfetta, Giacomo Frisoni, Nicolò Monaldini, Gianluca Moro

机构 * Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 研究针对大语言模型工具选择中现有检索器与LLMs不一致问题,提出PORTS方法,利用受困惑度启发的偏好信号,通过优化相关性及施加对比语义损失微调检索器,经多实验验证其通用性及提高工具选择准确性的能力,且计算需求低便于推广。

Comments Please cite the definitive, peer-reviewed version of this article published in the Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, edited by Christos Christodoulopoulos et al., Association for Computational Linguistics, pp. 10007-10030, 2025. DOI: https://doi.org/10.18653/v1/2025.emnlp-main.507

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, Association for Computational Linguistics, pp. 10007-10030, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05971 2026-07-08 cs.MM cs.SD 新提交 50%

Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking

通过语义检索和时间重排实现多模态视频到音乐推荐

Seungheon Doh, Minhee Lee, Sangmoon Lee, Ben Sangbae Chon, Juhan Nam

机构 * Graduate School of Culture Technology, KAIST(韩国釜山科学技术大学文化科技研究生院) Gaudio Lab, Inc(Gaudio实验室)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出用于视频到音乐推荐的两阶段框架VTMR,第一阶段通过全局嵌入检索语义兼容候选,第二阶段关注时间序列重排。实验显示该框架能提升推荐效果,人类偏好研究表明其在总体偏好上与商业基线相当,音乐质量优于生成基线。

Comments Accepted for publication at The Machine Learning for Audio workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 7 篇

2607.02714 2026-07-08 cs.CR cs.AI 新提交 88%

Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale

并非所有拒绝都是等同的:安全对齐如何在大规模情况下使网络安全失败

Vadym Hadetskyi, Dario Pasquini, Artem Sorokin

机构 * Cracken AI

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 研究安全对齐在网络安全领域的问题,通过对24个开源语言模型的实验,以Kimi K2为例展示特定领域删减可行,探讨模型特征与删减效果的关联并分类模型,提出相关猜想。

Comments 14 pages, 11 figures. Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06326 2026-07-08 cs.AI 新提交 79%

DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

DT-Guard:用于无推理语言模型安全护栏的意图驱动推理主动训练

He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei Lu, Wei Wang, Danyang Xu, Jiansheng Cai, Zhe Li

机构 * Ant Group(蚂蚁集团)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 研究为开放世界应用的语言模型设计安全护栏的问题,提出基于推理主动训练、无推理推理范式的DT-Guard模型,通过构建意图驱动数据集等方法提升性能,实验证明其在安全基准测试中表现优异,能有效将推理监督内化到低延迟安全判别中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24245 2026-07-08 cs.SE cs.AI cs.CR 新提交 79%

AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming

AutoSpec: 通过归纳逻辑编程实现LLM智能体的安全规则演化

Pingchuan Ma, Zhaoyu Wang, Zimo Ji, Yuguang Zhou, Zhantong Xue, Zongjie Li, Shuai Wang, Xiaoqin Zhang

机构 * Zhejiang University of Technology(浙江工业大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出AutoSpec框架,利用归纳逻辑编程引导的CEGIS自动演化专家定义的安全规则,平衡精确率和召回率,在代码执行和具身智能体领域将F1提升至0.98和0.93,减少高达94%的误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05196 2026-07-08 cs.CL cs.AI cs.LG cs.SD eess.AS 新提交 67%

Unified Audio Intelligence Without Regressing on Text Intelligence

不退化文本智能的统一音频智能

Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。

Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26783 2026-07-08 cs.LG cs.CL 新提交 62%

Reproducibility Study of "AlphaEdit: Null-Space Constrained Knowledge Editing for Language Models"

可重复性研究:"AlphaEdit: 面向语言模型的零空间约束知识编辑"

Ananth K Suresh, Arya Hariharan

机构 * Independent(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本研究复现了AlphaEdit知识编辑方法,发现其在原始设置下结果可复现,但扩展到新架构和大量顺序编辑时性能下降,表明其理论保证有边界。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05842 2026-07-08 cs.SE cs.AI cs.CR 新提交 57%

Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

超越拒绝:用于漏洞分析的对齐和消除拒绝的大语言模型的同谱系研究

Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究大语言模型辅助软件安全中,同谱系模型的安全状态(对齐或消除拒绝)对软件安全工作流程防御效用的影响,通过比较不同模型在多方面的表现,发现评估应综合考量模型响应、响应正确性及输出在工程流程中的可操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05518 2026-07-08 cs.CR cs.AI 新提交 57%

aiAuthZ: Off-Host, Identity-Bound Authorization for AI Agents

aiAuthZ:人工智能代理的远程、身份绑定授权

Sai Varun Kodathala

机构 * SportsVision AI

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究人工智能代理授权问题,提出aiAuthZ授权网关,通过消息签名验证身份、评估策略,加入审计日志并生成认证收据,有效降低攻击成功率,保障代理调用安全,减少决策延迟。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 红队测试 1 篇

2607.05407 2026-07-08 cs.CY cs.AI 新提交 90%

Position: Preventing AI-Generated CSAM Necessitates New Approaches to AI Safety

立场:防止人工智能生成的儿童性虐待材料需要新的人工智能安全方法

Neil Kale, Rebecca Portnoff, Pratiksha Thaker, Michael Simpson, Robertson Wang, Kevin Kuo, Chhavi Yadav, Virginia Smith

机构 * Carnegie Mellon University(卡内基梅隆大学) Thorn

专题命中 红队测试 :safety(title,abstract);AI safety(title,abstract);red teaming(abstract);分类 cs.AI、cs.CY

AI总结 研究人工智能给儿童安全带来的新风险,指出保护儿童免受其助长的性虐待需新安全方法。探讨现有技术与相关约束的不兼容及带来的挑战,概述15个开放性问题并给出针对性建议,推动将负责任AI原则转化为儿童保护措施。

Comments Accepted (spotlight) in ICML 2026, Position Paper Track. The first two authors contributed equally and may list their names interchangeably

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 1 篇

2607.05721 2026-07-08 cs.CL 新提交 57%

SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation

SpanUQ:用于大语言模型生成的跨度级不确定性量化

Yimeng Zhang, Yingying Zhuang, Ziyi Wang, Yuxuan Lu, Pei Chen, Aman Gupta, Zhe Su, Ming Tan, Zhilin Zhang, Qun Liu, Manikandarajan Ramanathan, Rajashekar Maragoud, Edward Vul, Jing Huang, Dakuo Wang

机构 * Amazon(亚马逊) Northeastern University(东北大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 研究大语言模型生成的跨度级不确定性量化问题,提出SPANUQ轻量级探测器,通过混合贝塔分布估计不确定性,经特殊训练方式构建基准。实验显示其在不确定性质量、速度及错误定位上表现出色,且能在多个大语言模型上通用。

Comments The project page is available at https://damon-demon.github.io/SpanUQ.html

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 14 篇

2607.06196 2026-07-08 cs.CL cs.CY 新提交 79%

Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability

Pluralis v0.1:迈向用于人工智能风险与可靠性的多元文化、多模态、多语言基准测试

Alicia Parrish, Rajat Shinde, Sanket Badhe, Xinyi Bai, Sree Bhargavi Balija, Hua-Rong Chu, Emilio Ferrara, Armstrong Foundjem, Rajat Ghosh, Aakash Gupta, Xuanli He, Ong Chen Hui, Minji Jung, Madhangi Karimanal, Faiza Khan Khattak, Boryoung Kim, Eugenia Kim, Liliya Lavitas, Seok Min Lim, Victor Lu, Jim Moirangthem, Dhivya Nagasubramanian, Deepak Pandita, Sita Rajagopal, Geetha Raju, Evgeniia Razumovskaia, Aravind Reddy, Federico Ricciuti, Nobin Sarwar, Sungpil Shin, Sunayana Sitaram, Snehal Thorat, Tharindu Cyril Weerasooriya, Jasmijn Bastings, Joachim Baumann, Kongtao Chen, Murali Emani, Mariya Hendriksen, Jiho Jin, Jun Seong Kim, Younghoon Ko, Alicja Kwasniewska, Minjae Lee, Tom Wei-cyuan Lin Kashyap Ramanandula Manjusha, Junho Myung, Junyeong Park, Roma Patel, Shyam Ratan, Sudarsun Santhiappan, Priyanka Suresh, Tuesday, Ksheeraj Sai Vepuri Laura Amortegui-Ordonez, Claire Dennis, Minsuk Kahng, Chris Knotz, Alice Oh, Balaraman Ravindran, Soojung Ryu William Bartholomew, Hiwot Tesfaye, Lora Aroyo

机构 * Google DeepMind(谷歌DeepMind) University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校) Google(谷歌) University of Missouri Columbia(密苏里大学哥伦比亚分校) Chunghwa Telecom Laboratories(春木电信实验室) University of Southern California(南加州大学) Polytechnique Montreal(蒙特利尔理工学院) Nutanix ThinkEvolve Labs(ThinkEvolve实验室) UCL(伦敦大学学院) Infocomm Media Development Authority(信息通信媒体发展局) Monark Health(Monark健康) Seoul National University(首尔国立大学) Microsoft(微软) Centre for Responsible AI (CeRAI), Wadhwani School of Data Science and AI (WSAI), Indian Institute of Technology Madras(负责任人工智能中心(CeRAI)、瓦达威人工智能学校(WSAI)、印度理工学院马德拉斯分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Microsoft Research India(微软印度研究院) Stanford University(斯坦福大学) Argonne National Laboratory(阿贡国家实验室) University of Oxford(牛津大学) KAIST(韩国科学技术院) Yonsei University(延世大学) Amazon(亚马逊) UIUC(伊利诺伊大学香槟分校) Rochester Institute of Technology(罗切斯特理工学院) Xenoscube Inc.(Xenoscube公司) Korea AI Safety Institute (K-AISI)(韩国人工智能安全研究所(K-AISI)) MLCommons CommonGround Artifex Labs(Artifex实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.CY

AI总结 研究针对现有AI安全评估框架忽视文化差异问题,构建多语言多模态数据集Pluralis v0.1,从文化优先视角引入新评估范式,提出Judge - Pluralis集成,揭示特定地区失败模式,为多语言多元文化评估提供基础和创新起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06111 2026-07-08 eess.SY cs.AI cs.SY 新提交 74%

LLM-Guided Measurement Credibility Correction for Trustworthy Industrial Process Inference

用于可信工业过程推理的大语言模型引导的测量可信度校正

Youcheng Zong, Runda Jia, Dakuo He

机构 * College of Information Science and Engineering, Northeastern University(信息科学与工程学院,东北大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 研究工业过程推理中测量可信度问题,提出大语言模型引导的测量可信度校正方法,通过转换测量语义、构建参考并校正冲突,使预测器输入更可信,在多任务中降低误差,增加少量参数且推理时间短,提升了预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06163 2026-07-08 cs.LG cs.AI 新提交 73%

X-FEMR: A Token-level Explainable Approach for Electronic Health Records Foundation Models using Transformer-based Models

X-FEMR:一种使用基于Transformer的模型对电子健康记录基础模型进行令牌级可解释的方法

Jie Huang, Pengfei Yin, Zihan Xu, Daniel Capurro, Mike Conway, Ting Dang

机构 * School of Computing and Information Systems, University of Melbourne(墨尔本大学计算与信息系统学院) Royal Melbourne Hospital(皇家墨尔本医院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 针对电子健康记录基础模型是黑箱模型的问题,提出基于Transformer的令牌级可解释性方法,训练替代模型近似其行为,识别有影响力令牌,引入临床对齐度量,结果显示该方法能实现可解释且可信的临床人工智能。

Comments Accepted by IJCAI-ECAI 2026 AI and Health Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20023 2026-07-08 cs.SE cs.AI cs.CL 新提交 73%

When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

当较低权限足够时:探究LLM代理中的过度权限工具选择

Kaiyue Yang, Yuyan Bu, Jingwei Yi, Yuchi Wang, Biyu Zhou, Juntao Dai, Songlin Hu, Yaodong Yang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM代理在工具选择中偏好高权限工具的安全问题,提出ToolPrivBench评估框架,发现主流代理普遍存在过度权限选择且被瞬态故障放大,并设计权限感知后训练防御方法有效减少不必要的高权限工具使用。

Comments code: https://github.com/AISafetyHub/agent-tool-selection-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05705 2026-07-08 cs.RO cs.AI cs.CV cs.LG 新提交 62%

IMR: Iterative Mode-World Weighted Regression for Multi-Agent Trajectory Prediction

IMR:用于多智能体轨迹预测的迭代模式世界加权回归

Honglin Wang, Shiyao Pan, Yun-Fu Liu

机构 * EACON Fujian(福建易安科)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对多智能体轨迹预测问题,提出模式世界加权回归损失及迭代解码器,减轻模式崩溃,提高预测准确性,在Argoverse 2多智能体运动预测基准测试中排名第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05217 2026-07-08 cs.CY cs.CL cs.IR 新提交 62%

Curated retrieval versus open web search in public AI information services: a coverage-trust trade-off

公共人工智能信息服务中的 curated 检索与开放网页搜索:覆盖度-可信度权衡研究

Hafsteinn Einarsson, Hafsteinn Birgir Einarsson, Jón Gunnar Ólafsson, Jón Gunnar Þorsteinsson

机构 * Faculty of Industrial Engineering, Mechanical Engineering and Computer Science, University of Iceland(工业工程、机械工程和计算机科学学院,爱沙尼亚大学) Faculty of Political Science, University of Iceland(政治学学院,爱沙尼亚大学) The Icelandic Web of Science, University of Iceland(冰岛科学网络,爱沙尼亚大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.CY

AI总结 针对公共AI信息服务的源可信度问题,对比 curated 本地语料RAG与开放网页搜索两种检索路径,发现前者可信度高但覆盖有限,后者覆盖广但源可信度差,揭示了覆盖度与可信度的核心权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09843 2026-07-08 cs.HC cs.AI cs.CL 新提交 62%

An LLM-Native Psychometric Instrument Reveals a Self-Report--Behavior Gap Across 25 Models

一个原生LLM的心理测量工具不能预测LLM行为:来自25个模型的证据

Juan Manuel Contreras

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过探索性因子分析从LLM行为中构建心理测量工具,发现LLM的自我报告与观察行为无关,揭示自我报告与人类判断之间的混淆因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05985 2026-07-08 cs.AI cs.AR cs.CE cs.SY eess.SY 新提交 57%

Auto-DSM Under the Lens: A Black-Box Evaluation Framework for LLM-Based DSM Generation

镜头下的自动DSM:基于大语言模型的DSM生成的黑盒评估框架

Niels Potters, Theo Hofman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究基于大语言模型的DSM生成能力,提出黑盒评估框架,结合多种指标评估,在两个数据集实验,结果显示LLMs能生成合理DSM但对一些因素敏感,为审核自动DSM管道及集成相关方法到MBSE工作流奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05775 2026-07-08 cs.AI 新提交 57%

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents

超越排行榜:大语言模型智能体中工具使用、规划和推理失败的综合分析

Wael Albayaydh, Rui Zhao, Ivan Flechais

机构 * University of Oxford(牛津大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文综合多篇论文形成大语言模型智能体局限性交叉分类法,识别出六个失败集群,通过迭代分组得出分类法,发现失败与任务长度非线性相关,单个子任务性能不能保证端到端成功,额外脚手架效果不佳,同时在部分任务上有进展。

Comments 16 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06478 2026-07-08 cs.CV 新提交 50%

A VLM-Enhanced Framework for Comprehensive Traffic Sign Condition Assessment Integrating Daytime Visual Performance and Nighttime Retroreflectivity Evaluation

一种用于综合交通标志状况评估的VLM增强框架,集成白天视觉性能和夜间逆反射率评估

Linlin Zhang, Neema Jakisa Owor, Xiang Yu, Abby Watts, Yaw Adu-Gyamfi

机构 * Department of Civil and Environmental Engineering University of Missouri- Columbia(土木与环境工程系密苏里大学哥伦比亚分校)

专题命中 安全评测 :safety(abstract)

AI总结 研究开发用于综合评估交通标志状况的新框架,利用微调视觉语言模型评估白天视觉性能,结合激光雷达校准的逆反射率评估夜间性能,集成到标志状况指数,提供经济有效的评估方法,LLaVA和Qwen表现优,还标记出需更换的标志。

Comments 21 pages, 7 figures, 5 tables. Preprint. An earlier version of this work was presented at the 105th Annual Meeting of the Transportation Research Board (TRB), January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06118 2026-07-08 cs.CV cs.MM 新提交 50%

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

WebRetriever:用于高效网络智能体评估的大规模综合基准测试

Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

机构 * Mininglamp Technology(旷视科技) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所综合技术集成中心)

专题命中 安全评测 :alignment(abstract)

AI总结 针对现有网络智能体评估基准测试的局限,提出WebRetriever这一大规模综合基准测试,涵盖多领域网站和任务。采用NavEval框架及三个评估协议,实验揭示不同协议性能差异,为网络智能体研发提供细粒度见解和严谨基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06088 2026-07-08 cs.SD 新提交 50%

Flow Matching-Based Speech Source Separation with Best-of-N Biometric Sampling

基于最佳N生物特征采样的流匹配语音源分离

Anastasia Zorkina, Alexandr Anikin, Nikita Khmelev, Anastasiya Korenevskaya, Sergey Novoselov, Vladimir Volokhov, Maxim Korenevsky, Yuriy Matveev

机构 * NVIDIA(英伟达)

专题命中 安全评测 :alignment(abstract)

AI总结 针对单通道语音分离难题,提出基于条件流匹配的方法,训练时用冻结说话人编码器定义源顺序,推理时用于生物特征最佳N候选选择等,在Libri2Mix基准上评估,该方法在分离指标及下游任务中表现出色。

Comments Accepted at the ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05783 2026-07-08 cs.CV 新提交 50%

Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective

从车道感知角度评估自动驾驶对环境错觉的鲁棒性:基准测试

Tianyuan Zhang, Xianglong Liu, Aishan Liu, Lu Wang, Yitong Zhang, Peng Yue, Mingchuan Zhang, Siyuan Liang, Dacheng Tao

机构 * SKLCCSE, the School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院软件安全技术与工程北京市重点实验室) the School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络空间科学与技术学院) Henan University of Science and Technology(河南科技大学) the School of Computing, National University of Singapore(新加坡国立大学计算学院) College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 安全评测 :safety(abstract)

AI总结 研究自动驾驶对环境错觉的鲁棒性,聚焦传统车道检测和视觉语言模型系统。引入基准LanEvil++并评估,发现错觉严重影响性能,阴影干扰最大。提出多模态错觉防御方法MIDA,有效提升了模型在挑战性条件下的鲁棒性。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05625 2026-07-08 cs.CV 新提交 50%

Cross-Contextual Vision-Language Adaptation with LoRA for Personalized Severe Adverse Event Detection in Clinical Wound Monitoring

基于LoRA的跨上下文视觉语言适配用于临床伤口监测中的个性化严重不良事件检测

Aditi Naiknaware, Jian Sun, Aminreza Khandan, Shengyang Huang, Sean Dow, Bijan Najafi, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 安全评测 :alignment(abstract)

AI总结 研究针对临床伤口监测中严重不良事件检测问题,提出基于双流LoRA框架及跨上下文融合机制的多模态框架,结合多种方法识别个性化严重不良事件并捕捉愈合动态,在相关实验中展现良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. AI治理与伦理 1 篇

2607.05442 2026-07-08 cs.GT 新提交 50%

The Oracle's Gambit: A Game-Theoretic Framework for Responsible AI Release

神谕者的策略:负责任的人工智能发布的博弈论框架

Christoph R. Landolt, Tobias Lorenz, Marta Kwiatkowska, Mario Fritz

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究在人工智能模型能力提升背景下,负责任的人工智能发布决策问题。核心方法是将其视为双层斯塔克尔伯格博弈,通过承诺窗口设定双方能力。主要贡献是指出福利取决于能力差距,明确两用模型关键在于访问顺序而非部署阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 17 篇

2607.06522 2026-07-08 cs.AI cs.CV 新提交 79%

Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

通过视觉动作结果推理对齐实现物理推理与任务泛化的桥梁

Han-Jun Ko, Jr-Jen Chen, Haobo Yuan, Hsin-Ying Lee, Tiancheng Shen, Ming-Hsuan Yang, Yu-Chiang Frank Wang

机构 * National Taiwan University(国立台湾大学) The University of California, Merced(加州大学默塞德分校)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 研究针对视觉语言模型在物理推理中难以泛化的问题,提出VAORA奖励设计,包括视觉对齐奖励和视觉-动作对齐奖励,通过预训练专家估计概率实现平滑密集奖励,经实验验证可有效提升模型在新任务和未见环境中的物理推理性能。

Comments ICML'26 Workshop RLxF: Reinforcement Learning from World Feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06305 2026-07-08 astro-ph.IM 新提交 78%

Exploring Image-Text Alignment for Radio Galaxy Morphologies

探索射电星系形态的图像-文本对齐

Erica Lastufka, Mariia Drozdova, Svyatoslav Volosynovskiy

专题命中 其他安全 :alignment(title,abstract)

AI总结 研究射电星系图像与文本描述的对齐,利用MiraBest数据集及SigLIP-2模型,经特定提示生成描述并评估。结果显示基于描述的星系分类与图像类似,微调改善局部连贯性,此为射电星系形态研究提供新方法。

Comments Accepted at the AI in Science (AIS) Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04311 2026-07-08 cs.CV 新提交 78%

Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment

Aura:通过基于VLM的语义对齐实现一致的多主体视频生成

Zixiang Zhou, Zhentao Yu, Yifeng Ma, Hongmei Wang, Wenqing Yu, Cong Wang, Zilin Yang, Rui Chen, Jiarong Ou, Yezhou Liu, Yuan Zhou, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出Aura框架用于高保真和身份一致的视频生成,引入AI导演级字幕、利用VLM提取多模态语义特征,设计对齐策略,采用多种机制减少伪影,在多主体视频生成上达先进性能。

Comments Project page: https://aura-project-page.github.io/ Code: https://github.com/Camellia997/Aura

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06039 2026-07-08 cs.SE 新提交 69%

Automating Quality Assessment with NLP of LLM-Generated Defeaters

利用自然语言处理对大语言模型生成的反驳进行质量评估自动化

Tihomir Rohlinger, Daniel Ratiu, Stefan Wagner

专题命中 其他安全 :safety(abstract,journal_ref);alignment(abstract)

AI总结 研究针对大语言模型生成的反驳质量评估依赖人工且主观的问题,提出结合保证案例图结构特征、语义嵌入和元分类器的自动化评估方法,经案例研究验证,该方法能减少主观差异,为保证案例审查提供决策支持。

Comments 10 pages, 2 figures. Author preprint version of a paper published at ICSRS 2025

Journal ref 2025 9th International Conference on System Reliability and Safety (ICSRS), Turin, Italy, 2025, pp. 101 110

详情

展开后加载摘要…

URL PDF HTML 收藏