arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 964 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 964 篇

2607.17640 2026-07-21 cs.MA cs.SY econ.GN eess.SY q-fin.EC 新提交 50%

A Digital Twin-Based Method for Evaluating Local Collective Tariffs in Distribution-Level Energy Systems

一种基于数字孪生的配电网级能源系统局部集体电价评估方法

Kristoffer Christensen, Bo Nørregaard Jørgensen, Zheng Grace Ma

专题命中 安全评测 :alignment(abstract)

AI总结 针对配电网级能源系统电价机制评估需求,提出基于数字孪生的方法,整合多种建模与抽象,应用于丹麦局部集体电价评估,揭示其对成本及时间对齐的影响,为分析比较电价结构提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17619 2026-07-21 cs.CR 新提交 50%

Insecure Coding Preferences in Long-Term Memory: Security Risks for LLM-based Code Generation

长期记忆中的不安全编码偏好:基于大语言模型的代码生成的安全风险

Yuchen Chen, Wei Cheng, Yuan Xiao, Zhou Yang, Weifeng Sun, Chunrong Fang, Xiang Chen, Baowen Xu, David Lo, Zhenyu Chen

专题命中 安全评测 :safety(abstract)

AI总结 研究基于LLM的代码生成中,长期记忆里不安全编码偏好带来的安全风险,通过评估四种LLM在五种编程语言上的表现,发现其显著增加生成漏洞代码风险及存在警告差距,还评估了三种缓解策略并给出改进安全性的建议。

Comments Accepted to the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16831 2026-07-21 cs.DC 新提交 50%

Technical Report: AI-Assisted Gated DeltaNet Optimization on NVIDIA Blackwell

技术报告:NVIDIA Blackwell上的人工智能辅助门控DeltaNet优化

Hyunjun Shin, Jiseung Jang, Jaewoo Maeng, Hyunjun Kim

专题命中 安全评测 :alignment(abstract)

AI总结 研究以MSInfer团队提交给MLSys 2026 FlashInfer竞赛的作品为例,探讨人工智能辅助GPU编程。该作品优化门控DeltaNet解码和预填充,在NVIDIA B200/Blackwell上实现1.58倍加速,揭示竞赛级优化需考虑多方面,将其视为端到端系统问题。

Comments 10 pages, 5 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16565 2026-07-21 cs.HC 新提交 50%

AlterAtlas: Shifting Travel Planning from AI Generation to Validation via Persona-Driven Simulations

AlterAtlas:通过基于角色的模拟将旅行规划从人工智能生成转变为验证

William Huang, Ruofei Du, Yang Zhang

专题命中 安全评测 :alignment(abstract)

AI总结 研究针对旅行规划需平衡多目标约束,当前AI工具支持有限问题,提出AlterAtlas系统,通过基于角色模拟实现行程验证与修订,经实验证明可提高计划与角色匹配度,增强用户对最终计划的信任。

Comments 11 pages, 8 figures. For associated codebase, see https://github.com/hilab-open-source/alteratlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16107 2026-07-20 eess.AS cs.CV 新提交 50%

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

视听火烈鸟:用于长而复杂视频的开放视听智能

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(美国NVIDIA公司) University of Maryland, USA(美国马里兰大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究提出视听火烈鸟,用于长复杂视频的联合理解与推理。贡献包括构建大规模视频集、设计三阶段课程及推理框架。实验显示其在多基准测试中表现优异,超越同类开放模型,在长复杂视听理解推理任务中竞争力强,有现实应用价值和泛化能力。

Comments Project Page: https://avflamingo.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15820 2026-07-20 cs.SE 新提交 50%

In the Driver's Seat: A Multi-Company Study on the Reality of Autonomous Driving System Testing

掌控全局:关于自动驾驶系统测试现状的多公司研究

Qunying Song, Yuan Gao, Johannes Betz, Dietmar Pfahl, Mohammad Reza Mousavi, Federica Sarro

专题命中 安全评测 :safety(abstract)

AI总结 针对自动驾驶系统测试复杂且缺乏标准的问题,通过对九家公司专家访谈,经主题分析总结行业测试情况、挑战与趋势,提出以证据为中心的闭环测试框架,为ADS测试提供指导并指明未来方向。

Comments 34 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15718 2026-07-20 cs.SE 新提交 50%

Verified LLM-Driven Synthesis for Concept Design

用于概念设计的经过验证的大语言模型驱动的合成

Alcino Cunha

专题命中 安全评测 :safety(abstract)

AI总结 研究用于概念设计的大语言模型驱动合成,给出概念和反应的形式语义及验证方法,提出基于大语言模型的合成过程,探讨引导合成的方式及技术,通过评估表明不同方法各有优劣,大语言模型驱动的场景引出多数情况下可恢复预期设计。

Comments 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15661 2026-07-20 cs.CV 新提交 50%

Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach

用于医学视觉语言模型的模型合并:一个基准和一种赢家通吃的方法

Lichao Mou, Shilan Zhang, Chunlei Li, Bingcong Yan, Jingliang Hu, Yilei Shi, Shengwu Xiong, Xiao Xiang Zhu, Lei Li, Yaxiong Chen

机构 * Wuhan University of Technology(武汉理工大学) Technical University of Munich(慕尼黑工业大学) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究医学LVLMs的模型合并,提出涵盖多种成像模态和临床任务类型的MergeMedBench基准,评估现有合并方法,提出赢家通吃方法,该方法简单且无超参数,优于现有方法,为LoRA合并提供新视角和实用基线。

Comments Project Page: https://github.com/MedAI-T/MergeMedBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14189 2026-07-17 cs.CV cs.SD 新提交 50%

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

MultiRef-Compass:迈向多参考到音频-视频生成的综合评估

Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li

专题命中 安全评测 :alignment(abstract)

AI总结 研究针对多参考到音频-视频生成设置,引入MultiRef-Compass基准。通过可扩展管道构建350个样本,定义含四个维度14个子指标的评估协议,集成自动指标与MLLM评判框架,实验表明该基准对MR2AV研究有重要意义。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13987 2026-07-16 cs.CR 新提交 50%

Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation

智能体技能安全:威胁模型、攻击、防御与评估

Sanket Badhe, Priyanka Tiwari

专题命中 安全评测 :prompt injection(abstract)

AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13692 2026-07-16 cs.NI 新提交 50%

Proactive URLLC Adaptation for Connected Vehicles Through ML-Based Channel Prediction

通过基于机器学习的信道预测实现车联网的主动超可靠低延迟通信适配

Andrea Giovannini, Lorenzo Mario Amorosa, Vittorio Todisco, Claudia Campolo, Antonella Molinaro, Su Hongjia, Alessandro Bazzi

专题命中 安全评测 :safety(abstract)

AI总结 研究车联网中利用机器学习技术进行信道质量预测以实现主动URLLC适配,评估DNN和LSTM模型,通过结合SUMO和Sionna-RT的模拟得出基于ML的预测性能优,能增强URLLC服务可靠性和鲁棒性。

Comments Invited paper at the IEEE COINS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13059 2026-07-16 cs.RO 新提交 50%

GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AI

GPUSimBench:迈向具身人工智能中可扩展且可靠的GPU加速模拟器

Huzhenyu Zhang, Shenghai Yuan, Wenrui Yan, Li Ma, Hengjie Li, Jingcheng Pang, Dmitry Yudin

机构 * Shanghai AI Laboratory(上海人工智能实验室) MIRAI(未来人工智能研究所) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究具身人工智能中GPU加速模拟器问题,通过GPUSimBench工具,建立物理基础评估、基准测试并行可扩展性,揭示并量化GPU批处理执行的不确定性,确定模拟器堆栈随机经验模式,强调无界扩展对可重复性的影响。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12786 2026-07-15 cs.CV 新提交 50%

CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

CoRe:视觉语言模型中跨图像比较推理的综合框架

Lin Peng, Cong Wan, Zeyu Guo, SongLin Dong, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对视觉语言模型跨图像比较推理难题,提出CoRe框架,含自动构建的训练集CoRe-20K、结构化奖励框架TriSR及基准CoRe-Bench,实验显示其在CoRe-Bench上大幅超越现有模型,在标准基准上也有竞争力。

Comments Accepted by ACMMM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12089 2026-07-15 cs.CR cs.SE 新提交 50%

Cross-Cutting Security Analysis of LLM-Generated Code via Metamorphic Testing and Association Rule Mining

通过变形测试和关联规则挖掘对大语言模型生成代码进行横切安全分析

Zedong Peng, Chenggang Wang, Shangyue Zhu

专题命中 安全评测 :safety(abstract)

AI总结 研究针对LLM生成代码的安全漏洞,提出结合变形测试与关联规则挖掘的框架,定义九个MRs并应用于3700个代码片段,揭示共同违反结构与横切模式,还进行提示级风险分析,发现不安全代码生成具结构化和提示依赖性,推动相关验证与干预。

Comments This work has already been accepted by IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12068 2026-07-15 cs.SE 新提交 50%

Beyond Test Presence: Assessing the Quality and Robustness of Agent-Generated Tests in Open-Source Projects

超越测试存在:评估开源项目中代理生成测试的质量和稳健性

Preet Jhanglani, Zeel Kaushal Desai, Vidhi Kansara, Eman Abdullah AlOmar

专题命中 安全评测 :safety(abstract)

AI总结 研究开源项目中代理生成测试的质量和稳健性,通过对大量测试工件进行实证比较,用“白盒”静态分析框架评估质量维度,发现代理在边缘情况覆盖率上优于人类,但生成测试更易脆弱,揭示其缺乏编写稳定测试的“环境意识”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11732 2026-07-14 cs.CV 新提交 50%

GFR-SAM: Training-Free Referring Camouflaged Object Segmentation via Cross-Image Prompting

GFR-SAM:通过跨图像提示实现免训练的指认伪装物体分割

Yilong Yang, Jianxin Tian, Shengchuan Zhang, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,教育部,厦门大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究指认伪装物体分割问题,提出GFR-SAM三阶段免训练框架,通过生成候选掩码、过滤背景干扰、细化边界等步骤,在R2C7K基准测试中表现出色,弥合通用模型与特定感知任务差距,凸显SAM3跨图像提示潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11199 2026-07-14 cs.CV 新提交 50%

DynEval: Holistic Evaluations of T2I Generative Models in the Wild

DynEval:对自然环境下的文本到图像生成模型进行全面评估

Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane, Akhil Sakthieswaran, Sayak Paul, Anirban Chakraborty

机构 * Indian Institute of Science(印度科学研究所) Hugging Face(拥抱脸)

专题命中 安全评测 :alignment(abstract)

AI总结 研究针对文本到图像生成模型评估难题,提出DynEval动态评估框架,通过构建两个数据集,利用课程学习策略微调评估器,在多基准测试中与人类判断相关性更高,可对多个T2I模型进行细粒度分析。

Comments Accepted at ECCV 2026. Project page: https://vcl-iisc.github.io/dyneval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10796 2026-07-14 cs.CV 新提交 50%

Mixture of Cognitive Experts in Large Vision-Language Models

大型视觉语言模型中的认知专家混合体

Robert Wijaya, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究大型视觉语言模型中多编码器专家整合难题,提出证据驱动的多模态推理框架,利用布鲁姆分类法及两阶段认知语言化,改进感知和推理能力,实现细粒度分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09583 2026-07-13 cs.CV 新提交 50%

Promptable Concept Segmentation from Above: Evaluating SAM 3's Zero-Shot and One-Shot Capabilities in Remote Sensing

从上方进行可提示的概念分割:评估SAM 3在遥感中的零样本和单样本能力

Mohammad Dabaja, Turgay Celik

机构 * University of Agder(阿格德大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究在严格零样本和单样本约束下,对SAM 3在遥感场景分类等任务中的能力进行评估。核心方法是对SAM 3结构调整并隔离提示模态来诊断对齐机制,还制定代理评估协议。主要贡献是揭示跨模态干扰,表明SAM 3避免过拟合但受分辨率等限制,指明微调方向。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09016 2026-07-13 cs.CR cs.SE 新提交 50%

SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills

SLBench:评估大语言模型智能体在技能中遵循逻辑关系的情况

Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang

专题命中 安全评测 :safety(abstract)

AI总结 研究评估大语言模型智能体遵循逻辑关系情况,引入SkillLogic框架,构建SLBench基准,扫描超500个公共技能,评估发现不安全率高,人工审核分析失败原因,还表明SLGuard可减少违规,确立遵循逻辑关系是技能引导智能体的可靠性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08397 2026-07-10 cs.CV 新提交 50%

Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation

用于开放词汇量内镜组合式指称分割的属性检索

Shun Liu, Nan Xi, Yang Liu, Tianyu Luan, Xuan Gong, David Doermann

机构 * Virginia Commonwealth University(弗吉尼亚联邦大学) King’s College London(伦敦国王学院) University at Buffalo(纽约州立大学布法罗分校) Harvard Medical School(哈佛医学院)

专题命中 安全评测 :alignment(abstract)

AI总结 该研究针对内镜图像指称分割面临的挑战,引入ReferEndoscopy基准,提出AR-ERIS框架,利用属性检索进行开放词汇量内镜组合式指称分割,在模拟和真实内镜数据上实现最优性能且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08274 2026-07-10 cs.HC cs.SE 新提交 50%

How Analysts Use AI in High-Stakes Crime Linkage: An Industrial Study

分析师如何在高风险犯罪关联中使用人工智能:一项行业研究

Jessica Woodhams, Amy Burrell, Wanyin Li, Fahim Ahmed, Matthew Tonkin, Jan Lemeire, Arkady Konovalov, Steven Frisson, Mark Webb, Sarah Galambos, Vesna Nowack, Dalal Alrajeh

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究探讨分析师在高风险犯罪关联中如何用AI,通过与英国执法机构合作开发工具并进行混合方法可用性研究,发现分析师有选择地用AI预测且常验证,还关注模型特征,强调AI决策支持工具要整合解释与传统方法及现场评估的重要性。

Comments 12 pages, 6 figures, FSE Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08267 2026-07-10 cs.CV 新提交 50%

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

UniRef-UAV:无人机图像通用指称的多模态基准测试

Haibin Tian, Huichao Xie, Xuelin Qian, Ruitao Lu, Junwei Han, Dingwen Zhang

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) College of Missile Engineering, Rocket Force University of Engineering(导弹工程学院,火箭兵工程大学) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)

专题命中 安全评测 :alignment(abstract)

AI总结 该研究针对无人机视觉定位面临的问题,引入通用指称任务,构建UniRef-UAV多模态基准测试,提出UAV-URNet检测式基线方法。实验表明该基线稳定可重复,多模态查询能减少模糊性,相关资源将公开助力可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07529 2026-07-09 cs.GT 新提交 50%

FedMark-FM: Auditable, Risk-Adjusted Data Markets for Federated Foundation-Model Adaptation

FedMark-FM:用于联邦基础模型适配的可审计、风险调整数据市场

Phat T. Tran-Truong, Xuan-Bach Le, Minh Nhat Nguyen

专题命中 安全评测 :safety(abstract)

AI总结 研究联邦基础模型适配中激励机制问题,提出FedMark-FM框架,将客户端视为工件卖家,用S3Val估计贡献,转换支付惩罚不良行为,经多任务评估表现出色,证明管道有序估值独特性,能在一定规模下保留专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07481 2026-07-09 cs.SE 新提交 50%

The Poisoned Chalice of LLM Evaluation Report

大语言模型评估报告的毒圣杯

Jonathan Katzy, Ali Al-Kaswan, Razvan Mihai Popescu, Zhou Yang

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究大语言模型评估中因数据污染致结果不可靠的问题,通过举办竞赛将污染检测设为白盒成员推理任务,提供相关资源,报告竞赛设置与结果,推动软件工程中可信大语言模型评估社区发展。

Comments Report of the competition hosted at FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03915 2026-07-09 cs.CV 新提交 50%

NavEYE: Vision-Centered Multi-Sensor Fusion-Based Situational Awareness System for Intelligent Surface Vehicles

NavEYE:用于智能水面舰艇的基于视觉的多传感器融合态势感知系统

Ryan Wen Liu, Junxiong Liang, Haoyu Wang, Mengwei Bao

机构 * Sanya Science and Education Innovation Park, Wuhan University of Technology(武汉理工大学三亚科教创新园) School of Navigation, Wuhan University of Technology(武汉理工大学航运学院) State Key Laboratory of Maritime Technology and Safety(船舶技术与安全国家重点实验室)

专题命中 安全评测 :safety(abstract)

AI总结 为实现智能水面舰艇在复杂环境中的高质量感知,开发以视觉为中心的多传感器融合系统NavEYE,提出多约束门控数据关联等方法,经实验验证其融合方法在多方面的优越性及对舰艇航行安全的促进作用。

Journal ref Ocean Engineering, Volume 363, Part 4, 2026, Article 126781

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06478 2026-07-08 cs.CV 新提交 50%

A VLM-Enhanced Framework for Comprehensive Traffic Sign Condition Assessment Integrating Daytime Visual Performance and Nighttime Retroreflectivity Evaluation

一种用于综合交通标志状况评估的VLM增强框架,集成白天视觉性能和夜间逆反射率评估

Linlin Zhang, Neema Jakisa Owor, Xiang Yu, Abby Watts, Yaw Adu-Gyamfi

机构 * Department of Civil and Environmental Engineering University of Missouri- Columbia(土木与环境工程系密苏里大学哥伦比亚分校)

专题命中 安全评测 :safety(abstract)

AI总结 研究开发用于综合评估交通标志状况的新框架,利用微调视觉语言模型评估白天视觉性能,结合激光雷达校准的逆反射率评估夜间性能,集成到标志状况指数,提供经济有效的评估方法,LLaVA和Qwen表现优,还标记出需更换的标志。

Comments 21 pages, 7 figures, 5 tables. Preprint. An earlier version of this work was presented at the 105th Annual Meeting of the Transportation Research Board (TRB), January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06118 2026-07-08 cs.CV cs.MM 新提交 50%

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

WebRetriever:用于高效网络智能体评估的大规模综合基准测试

Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

机构 * Mininglamp Technology(旷视科技) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所综合技术集成中心)

专题命中 安全评测 :alignment(abstract)

AI总结 针对现有网络智能体评估基准测试的局限,提出WebRetriever这一大规模综合基准测试,涵盖多领域网站和任务。采用NavEval框架及三个评估协议,实验揭示不同协议性能差异,为网络智能体研发提供细粒度见解和严谨基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06088 2026-07-08 cs.SD 新提交 50%

Flow Matching-Based Speech Source Separation with Best-of-N Biometric Sampling

基于最佳N生物特征采样的流匹配语音源分离

Anastasia Zorkina, Alexandr Anikin, Nikita Khmelev, Anastasiya Korenevskaya, Sergey Novoselov, Vladimir Volokhov, Maxim Korenevsky, Yuriy Matveev

机构 * NVIDIA(英伟达)

专题命中 安全评测 :alignment(abstract)

AI总结 针对单通道语音分离难题,提出基于条件流匹配的方法,训练时用冻结说话人编码器定义源顺序,推理时用于生物特征最佳N候选选择等,在Libri2Mix基准上评估,该方法在分离指标及下游任务中表现出色。

Comments Accepted at the ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05783 2026-07-08 cs.CV 新提交 50%

Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective

从车道感知角度评估自动驾驶对环境错觉的鲁棒性:基准测试

Tianyuan Zhang, Xianglong Liu, Aishan Liu, Lu Wang, Yitong Zhang, Peng Yue, Mingchuan Zhang, Siyuan Liang, Dacheng Tao

机构 * SKLCCSE, the School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院软件安全技术与工程北京市重点实验室) the School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络空间科学与技术学院) Henan University of Science and Technology(河南科技大学) the School of Computing, National University of Singapore(新加坡国立大学计算学院) College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 安全评测 :safety(abstract)

AI总结 研究自动驾驶对环境错觉的鲁棒性,聚焦传统车道检测和视觉语言模型系统。引入基准LanEvil++并评估,发现错觉严重影响性能,阴影干扰最大。提出多模态错觉防御方法MIDA,有效提升了模型在挑战性条件下的鲁棒性。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏