arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2678 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 964 篇

2608.14179 2026-08-17 cs.AI 新提交 57%

Can Language Models Understand mmWave Data? Benchmarking Large Language Models for mmWave Radar-Based Human Understanding

语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试

Jeongwan Shin, Jaehyeon Kim, Donguk Ko, Jaeho Choi

机构 * DGIST(大邱庆北科学技术院) KAIST(韩国科学技术院) InnoCORE LLM

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。

Comments Accepted to CVPR 2026 Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14016 2026-08-17 cs.CV cs.AI cs.GR 新提交 57%

Content Based Video Narration of Gameplay with Vision Language Models

基于内容的游戏玩法视频旁白:利用视觉语言模型

Mathew Varghese

机构 * University of Washington(华盛顿大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出一种基于内容的游戏玩法视频旁白系统,利用视觉语言模型等技术生成电竞风格解说,无需游戏专用工具,支持本地化语音,还发布了可复现基线。

Comments https://mathewvarghese.space/ai-powered-game-commentary-auto-narrating-gameplay-videos-with-gpt-4o/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13120 2026-08-14 cs.AI 新提交 57%

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

SkillEvo:基于多轮交互反馈的自更新进化梯度

Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu

机构 * Tencent Cloud Andon(腾讯云Andon) Zhejiang University(浙江大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 SkillEvo通过多轮用户模拟生成反馈、独立治理层修复退化,在6类云服务等数据集上,相比两种基线方法显著提升了智能体技能进化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13118 2026-08-14 cs.LG 新提交 57%

Branch and Bound for Relational Verification of Neural Networks

神经网络关系验证的分支定界法

Kota Fukuda, Zhenya Zhang, Guanqin Zhang, Jianjun Zhao

机构 * Graduate School and Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学情报科学与电气工程研究院及学部) National Institute of Informatics(信息学研究所) UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出分支定界(BaB)框架,通过关系神经元拆分及对应选择策略,在817个跨多数据集的验证问题上,使SaBRe在已解决实例数和效率上优于基线方法,提升神经网络关系验证效果。

Comments The full version of the paper accepted by EMSOFT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12843 2026-08-14 cs.CV cs.AI 新提交 57%

Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval

用于基于文本的行人异常检索的、带分歧感知重排序的异构视觉语言集成方法

Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo, Hoang Vo, Do Trung Hieu, Hieu Dinh Trung Pham, Khang Minh Le, Huy Minh Nhat Nguyen

机构 * Hanoi University of Science and Technology(河内科技大学) University of Information Technology, VNU-HCM(胡志明市国家大学信息技术大学) Vietnam National University, Ho Chi Minh City(胡志明市国家大学) VinUniversity Vietnamese-German University(越南德国大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究针对大规模基于文本的行人异常检索难题,提出带分歧感知重排序的异构视觉语言集成方法,在PAB基准上取得90.92% mAP等优异指标,验证了方案有效性。

Comments Accepted at the ECCV 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12645 2026-08-14 cs.AI 新提交 57%

Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence

波动评判者:在沉默、压力与坚持下的认知稳定性

Justin Zhao, Himaghna Bhattacharjee, Hannah Korevaar, Bhaktipriya Radharapu, Khalid El-Arini

机构 * Meta Superintelligence Labs(元超级智能实验室) FAIR at Meta(元公司FAIR研究院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究提出Wiggle框架测试LLM评判者的认知稳定性,发现9个前沿模型在压力下裁决波动显著,且多数压力会损害真实值,基线陪审团多数强度可预测波动项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12477 2026-08-14 cs.LG 新提交 57%

Learning Under Treatment-Induced Label Indeterminacy with Expert Annotations of Counterfactual Outcomes: A Case Study in Neurological Prognostication

基于反事实结果专家标注的治疗诱导标签不确定性下的学习:以神经预后为例

Xiaobin Shen, Chloe Y. H. Huang, Jonathan Elmer, George H. Chen

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 针对治疗决策导致部分患者结局不确定的临床预后问题,提出结合确定与不确定病例标签的预测模型及分类型评估框架,揭示两类病例评估的权衡关系。

Comments Machine Learning for Healthcare (MLHC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12304 2026-08-13 cs.AI 新提交 57%

Constructing Dynamic Master Logic Models as Knowledge Graphs for Complex System Diagnostics Using Retrieval-Augmented Large Language Models

构建动态主逻辑模型作为知识图谱,用于使用检索增强大语言模型的复杂系统诊断

Saman Marandi, Yu-Shu Hu, Mohammad Modarres

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究提出基于检索增强大语言模型的KG-DML框架,实现了复杂系统动态主逻辑模型的自动化构建,经低压冷却剂注入系统验证,可转化技术文档为可执行功能模型用于诊断分析。

Comments 36 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12197 2026-08-13 eess.SY cs.AI cs.SY 新提交 57%

NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation

NetlistBench:评估大型语言模型在SPICE网表识别与操作中的可靠性

Jiarui Ma, Jianghan Wang, Yuheng Ma, Ziyi Zhuang, Xiaoguang Liu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究针对LLMs在SPICE网表识别与操作中的可靠性,构建含2342个案例的NetlistBench基准,发现其性能随结构复杂度变化,为电路设计自动化提供关键瓶颈参考。

Comments accepted by MLCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11981 2026-08-13 cs.CL 新提交 57%

Benchmarking Trustworthiness of SLMs: Pre-trained vs. Compressed

小型语言模型(SLM)的可信性基准测试:预训练模型与压缩模型的对比

Haokun Lin, Kaijie Zhu, Haobo Xu, Yichen Wu, Zhichao Lu, Qingfu Zhang, Zhenan Sun

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Tsinghua University(清华大学) Harvard Medical School(哈佛医学院) City University of Hong Kong(香港城市大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本研究评估SLM的可信性,发现量化压缩预训练模型比剪枝更能保留可信性,且量化压缩可靠大模型得到的SLM比从头训练的小型模型更优,知识蒸馏可进一步提升其可靠性。

Comments Published in IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11415 2026-08-13 cs.IR cs.AI 新提交 57%

TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs

TRACES:用于评估大型语言模型科学推理中认知可靠性的基准

Valentin Rodionov, Shamil Assylbekov

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究构建了名为TRACES的基准,发现30种大型语言模型在识别42篇不可靠科学论文的认知可靠性时表现不佳,仅少数模型能有效拒绝有缺陷前提,凸显科学部署需护栏。

Comments 16 pages + appendices. 4 figures in the main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10806 2026-08-12 cs.CL 新提交 57%

Assessing Reliability of BERT-Based Models on Question Answering Tasks

评估基于BERT的模型在问答任务上的可靠性

Pooja Yadav, Priyanka Harjule, Basant Agarwal, Marko Robnik Šikonja

机构 * Malaviya National Institute of Technology(马拉维亚国家理工学院) Central University of Rajasthan(拉贾斯坦中央大学) University of Ljubljana(卢布尔雅那大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本研究评估BERT及其变体在问答任务上的可靠性,发现RoBERTa可靠性更高,ALBERT与DistilBERT存在显著不一致,验证了MCD作为可靠性指标的有效性,强调需同时评估QA模型的准确性与稳定性。

Comments Accepted for publication in the Journal of Experimental & Theoretical Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10635 2026-08-12 cs.CV cs.AI 新提交 57%

MedUP: Awakening Unified Understanding and Perception in Medical Vision-Language Models

MedUP:唤醒医学视觉-语言模型中的统一理解与感知能力

Yuan Wang, Hualiang Wang, Yixin Chen, Songtao Jiang, Shujian Gao, Jiaming Lin, Siming Fu, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出MedUP模型,通过UniMedTok分词器在共享token空间统一医学视觉-语言模型的感知与理解,构建相关训练语料库和评估基准,在多医学任务上性能优于现有模型。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10289 2026-08-12 cs.CV cs.LG 新提交 57%

SeFaR: Semantic Feature-aware Robustness Testing of Deep Neural Networks

SeFaR:面向深度神经网络的语义特征感知鲁棒性测试

Nusrat Jahan Mozumder, Divya Gopinath, Corina Pasareanu, Matthew Dwyer

机构 * University of Virginia(弗吉尼亚大学) KBR Inc.(KBR公司) NASA Ames(美国国家航空航天局艾姆斯研究中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 SeFaR是一个以语义特征为核心的视觉模型鲁棒性测试框架,可在保留需求满足性的前提下,生成测试输入以识别影响模型决策的特征,进而发现故障并关联相关特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10209 2026-08-12 cs.AI 新提交 57%

Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes

评估条件化训练:让模型泛化到更强的监督机制

Alec Harris, Kasey Corra, Archie Chaudhury, Yixiong Hao

机构 * AI Safety Initiative at Georgia Tech(佐治亚理工学院AI安全倡议) University of Chicago(芝加哥大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出ECT后训练框架,作为SFT、PPO的附加组件,通过关联反馈保真度提升不完美反馈下的模型性能,在新闻生成和算术任务中验证其可改善目标行为。

Comments 16 pages, 7 figures. Accepted at the Agent Behavior Workshop at COLM 2026. Code: https://github.com/evaluationconditionedtraining/Evaluation-Conditioned-Training

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10195 2026-08-12 cs.CV cs.LG 新提交 57%

More Accurate, Less Human: Gestalt Grouping in Vision Models

更准确,更少人工:视觉模型中的格式塔分组

Sudhanva Manjunath Athreya, Sai Phani Kumar Malladi

机构 * University of Utah(犹他大学) Siemens AG(西门子公司)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 该研究引入行为测试套件,对比45个不同类型视觉模型与人类在四项分组任务上的表现,发现部分封闭模型的感知组织对齐度低于基准准确率,为可视化研究提供了审核模型的可复用标准。

Comments 9 pages, 7 figures, 5 tables. Conditionally accepted to VISxVision 2026, a workshop at IEEE VIS 2026. Includes appendix with per-task stimuli, metric derivations, and full per-model results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09944 2026-08-12 cs.HC cs.AI 新提交 57%

Navigation Alone Is Not Enough: Evaluating Explanatory Assistive UI Agents

仅导航是不够的:评估解释性辅助UI智能体

Santosh Patapati

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究推出辅助UI智能体基准NeXUI,评估其导航、解释及用户控制能力,实验发现Gemini-3.5-Flash在该基准中表现不佳,为相关研发提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09772 2026-08-11 cs.CL 新提交 57%

PragMatch: Separating Pragmatic Incongruity from Cross-Modal Mismatch in Large Vision-Language Models

PragMatch:分离大视觉语言模型中的语用不一致与跨模态不匹配

Zhanna Mukhametsharip, Vera Demberg, Varsha Suresh

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究提出PragMatch基准,揭示大视觉语言模型易受表面线索影响,为评估多模态语用推理提供测试平台。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09594 2026-08-11 cs.CV cs.AI 新提交 57%

Illusion or Integrity? Geometrical Consistency Metric for AIGC Video Quality Evaluation

幻觉还是完整性?用于AIGC视频质量评估的几何一致性指标

Yifei Xue, Yuanchen Fei, Hao Zhang, Chenzhi Nie, Tie ji, Yizhen Lao

机构 * Hunan University(湖南大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对现有AIGC视频质量评估缺乏物理定律保真度量化指标的问题,提出GeoCon-Bench基准,通过帧间几何一致性评估AIGC视频质量,经实验验证其可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09424 2026-08-11 cs.CL 新提交 57%

Reducing Pretraining-Generation Mismatch in Diffusion Language Models

减少扩散语言模型中的预训练-生成不匹配

Xiaocheng Lu, Huabin Liu, Song Guo, Jianguo Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 该研究针对扩散语言模型的预训练-生成不匹配问题,提出 PCD 方法,在不改变推理模式的情况下,在 LLaDA2-Mini 和 Qwen 模型上显著提升了性能。

Comments 12 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09230 2026-08-11 cs.AI 新提交 57%

SafeSceneReason: A Multimodal Reasoning Benchmark Connecting Industrial Hazards with Accident Knowledge

SafeSceneReason:连接工业危害与事故知识的多模态推理基准

Yuanchi Zhu, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Xinqi Yang, Hebao Zhu, Bokai Zhao, Tianyu Liang, Ziliang Wang, Faqiang Qian, Yunli Yang, Weiyang Shi, Qibing Ren

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 SafeSceneReason是关联工业危害与事故知识的多模态推理基准,含两类问答对,评估发现现有视觉-语言模型在工业安全推理上存显著弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09142 2026-08-11 cs.CL 新提交 57%

An Agentic Generative Large Language Model for Treatment Planning of Colorectal Cancer

用于结直肠癌治疗规划的智能体生成式大语言模型

Mengxian Lyu, Cheng Peng, Tim Jang, Ang Li, Mengyuan Zhang, Ziyi Chen, Leighton Elliott, Tianshi Liu, Lidice Galindo, Chiranjeevi Sainatham, Oscar F. Borja-Montes, Kaleb E. Smith, Ying Zhang, Lichao Sun, Jiang Bian, Gloria Lipori, Duane A. Mitchell, Elizabeth A. Shenkman, Yi Guo, Thomas J. George, Yonghui Wu

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本研究提出智能体生成式大语言模型GatorOnco,经大规模生物医学文本训练与领域适配,在结直肠癌治疗规划的临床评估中性能优于开源LLM,达到专家级水平,可缩小生成式AI在高风险诊疗规划领域的应用差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09111 2026-08-11 cs.AI 新提交 57%

RAVEN-Eval: Rubric-Guided Automatic Evaluation for AI Video Generation Models Based on LMM Preference Judgement

RAVEN-Eval:基于大语言多模态模型(LMM)偏好判断的、采用评分准则引导的AI视频生成模型自动评估框架

Ziheng Jia, Jiaying Qian, Zicheng Zhang, Xiaorong Zhu, Lancheng Gao, Xiongkuo Min

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出RAVEN-Eval框架,基于LMM偏好判断与评分准则引导,可自动评估AI视频生成模型,已筛选任务、收集数据、评估模型与LMM并建立排行榜,为AIVGMs评估提供可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09052 2026-08-11 cs.CV cs.AI 新提交 57%

Triple Expert Learning from Noisy Labels for Semi-Supervised Vision Foundation Model Adaptation

面向半监督视觉基础模型适配的带噪标签三重专家学习

Xuanyu Liu, Zheng Fang, Hongyang He, Yundi Hong, Daizong Liu

机构 * The University of Warwick(华威大学) Wuhan University(武汉大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 TriNoL框架通过将未标记样本按伪标签置信度分配给三个LoRA专家,实现半监督视觉基础模型适配,提升了对带噪监督的鲁棒性且训练成本较低。

Comments Accepted for publication at the British Machine Vision Conference (BMVC) 2026. Official list of accepted papers: https://bmvc2026.bmva.org/programme/accepted_papers/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08976 2026-08-11 cs.LG 新提交 57%

Label-Free Parkinson's Disease Screening from Face and Voice through Mechanistic Interpretability

基于机械可解释性的无标签面部与语音帕金森病筛查

Jiaheng Su, Yu Sun

机构 * California State Polytechnic University, Pomona(加州州立理工大学波莫纳分校)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本研究针对PD筛查需标签的问题,提出基于冻结预训练编码器的无标签面部+语音PD筛查方法,引入对齐原则,在YouTubePD基准上实现AUROC 0.802,为PD筛查提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08786 2026-08-11 cs.AI 新提交 57%

SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification

SymDiag:基于神经符号验证的LLM推理可解释诊断

Wenyao Cui, Huaping Zhang, Yongyi Huang, Qiuchi Li, Jian Xu, Cheng-Lin Liu, Chunxiao Gao, Juan Wang, Baohua Zhang

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Xinjiang Future Enterprise Incubator Co., Ltd.(新疆未来企业孵化器有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 SymDiag是一种神经符号框架,将LLM推理验证重构为结构化故障诊断,可定位推理故障步骤、分离翻译与推理错误,在多类基准中提升了不可靠推理检测与推理修复反馈效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08736 2026-08-11 cs.AI 新提交 57%

FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models

FitAQA:面向多模态大语言模型的健身动作质量评估基准

Kaili Zheng, Kaiwen Wang, Xun Zhu, Qingyuan Yang, Chenyi Guo, Ji Wu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究推出FitAQA基准,含2219个视频等数据,设计三项评估任务,发现当前MLLMs评估健身动作质量及定位错误存在瓶颈,视觉感知是关键瓶颈,相关数据和代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08640 2026-08-11 cs.AI 新提交 57%

SkillReason: Reasoning-Enhanced Agent Skill Retrieval for Implicit User Requests

SkillReason:面向隐式用户请求的推理增强型智能体技能检索

Donghong Jiang, Endian Lin, Luoping Cui, Hanqing Liu, Mingjie Liu, Fan Yang, Hong Wang, Zhao Yang, Chuang Zhu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对隐式用户请求的技能检索难题,提出两阶段框架SkillReason,结合推理增强训练,在SkillReason-Bench等三个基准上取得最优性能,缩小任务目标与技能能力的语义差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08240 2026-08-11 cs.AI cs.GT cs.MA econ.TH 新提交 57%

A Fair Objective for Human-Empowerment-Preserving AI: Desiderata, Design, and Likely Behavioral Consequences

一种保留人类赋能的公平AI目标: desiderata、设计及可能的行为后果

Jobst Heitzig, Ram Potham

机构 * Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文设计了一种保留人类赋能的AI公平目标函数,通过公理化方法兼顾人类权力的不平等与风险规避,明确AI需赋能人类并管理人机权力平衡,还验证了其在典型场景的行为后果。

Comments Slightly extended version of paper accepted for Algorithmic Decision Theory 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08219 2026-08-11 cs.CV cs.AI 新提交 57%

VTO: Visual Tool Orchestration for Video Anomaly Detection

VTO:面向视频异常检测的可视化工具编排

Rui Wang, Yeteng Wu, Xianling Zhang, Mengshi Qi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) School of Digital Media & Design Art(数字媒体与设计艺术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对视频异常检测中传统方法泛化差、多模态智能体工具编排难的问题,提出过程监督强化学习框架VTO,结合VAD-Tool工具集,在工具调度上较基线提升10.2%。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏