arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 614
2606.31229 2026-07-01 cs.AI 新提交

Agentic-Ideation: Sample Efficient Agentic Trajectories Synthesis for Scientific Ideation Agents

Agentic-Ideation: 面向科学构思智能体的样本高效智能体轨迹合成

Keyu Zhao, Lingyan Kong, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 提出Agentic-Ideation框架,通过Oracle引导的数据合成策略和掩码训练,高效生成高质量智能体轨迹,在科学构思任务上整体质量提升11.91%,数据合成效率提高10倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31211 2026-07-01 cs.CV cs.HC 新提交

AA: A Multi-view Multimodal Dataset for Screen-based Gaze Estimation

AA: 用于屏幕式视线估计的多视角多模态数据集

Chang Liu, Jiaqi Liu, Zhoutong Ye, Xinjie Shen, Chun Yu, Yuanchun Shi

机构 * Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出AA数据集,包含8个屏幕摄像头和2个侧视角摄像头的同步面部观测及精确视线目标,支持多视角多模态学习,解决单视角数据集的视角变化和遮挡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31157 2026-07-01 cs.CV 新提交

Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning

重新思考基础模型协作:通过代理任务推理增强专用模型

Hongyi Lin, Yang Liu, Jinhua Zhao, Xiaobo Qu

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系)

AI总结 提出FAT框架,将基础模型与专用模型协作视为任务分解而非替代,通过代理任务(如选择或验证)提升结构化预测性能,在多个任务上优于直接使用基础模型回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31114 2026-07-01 cs.AI 新提交

Revealing Safety-Critical Scenarios for UTM via Transformer

通过Transformer揭示UTM的安全关键场景

Huaze Tang, Bill Zeng, Chao Wang, Zhenpeng Shi, Qian Zhang, Wenbo Ding

机构 * Tsinghua University(清华大学) Meituan(美团)

AI总结 提出将UTM漏洞发现建模为序列问题,使用基于Transformer的强化学习架构,通过注意力机制建模状态关系并预测最优动作,实现8倍漏洞发现效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31085 2026-07-01 cs.AI 新提交

DDIAgents: Mechanism-Conditioned Context Flow for Drug-Drug Interaction Prediction

DDIAgents: 机制条件上下文流用于药物相互作用预测

Zhenqian Shen, Yu Liu, Xiaoyi Fu, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Institute of Biomedical Engineering, University of Oxford(牛津大学生物医学工程研究所) Division of Emerging Interdisciplinary Areas, Hong Kong University of Science and Technology(香港科技大学新兴跨学科领域学部)

AI总结 提出DDIAgents多智能体框架,通过动态知识编排预测药物相互作用,减少无关信息并生成可解释推理,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31065 2026-07-01 cs.CV 新提交

Diffusion-Based Material Regularization for Physics-Based Inverse Rendering

基于扩散的材料正则化用于物理逆渲染

Jingwang Ling, Lifan Wu, Feng Xu, Shuang Zhao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达) BNRist and School of Software, Tsinghua University(清华大学软件学院及北京国家信息科学与技术研究中心)

AI总结 提出将扩散模型预测作为相似性核,通过正则化损失约束材料优化,联合重建几何、材质和光照,在多个数据集上显著优于现有方法。

Comments Accepted to ECCV 2026. Includes supplementary material. Project page: https://gerwang.github.io/diffusion-regularized-inverse-rendering/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31050 2026-07-01 cs.CV cs.AI 新提交

Learning Video Dynamics with Predictive Differentiable Rendering

基于预测可微渲染的视频动态学习

Yujin Tang, Tian Zhou, Xin Lin, Cheng Tan, Yifan Hu, Rong Jin, SouYoung Jin, Liang Sun

机构 * Dartmouth College(达特茅斯学院) DAMO Academy, Alibaba Group(阿里巴巴达摩院) University of California, San Diego(加州大学圣地亚哥分校) Westlake University(西湖大学) Tsinghua University(清华大学) Ant Group(蚂蚁集团)

AI总结 提出预测可微渲染(PDR)框架,通过2D高斯表示的轻量适配器PredGS和CUDA加速渲染器predgsplat,结合L1和SSIM损失优化,在离散像素与连续表示间架桥,显著提升视频预测的细节保真度和准确性。

Comments Accepted by ECCV 2026. 18 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31039 2026-07-01 cs.CL 新提交

Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies

真相还是诡辩?LoFa:大语言模型对逻辑谬误鲁棒性的基准测试

Xudong Shen, Li Yuan, Ye Chen, Xin Wu, Yi Cai, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) South China University of Technology(华南理工大学)

AI总结 提出LoFa基准,通过多智能体管道生成事实与谬误配对,结合多轮辩论框架评估LLM对逻辑谬误的鲁棒性,并设计LFR@k指标量化抵抗能力。

Comments Accepted to ACL 2026 Main. 33 pages (9 pages main text)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30677 2026-07-01 cs.GR cs.CV 新提交

DANTE-W: Diffuse Albedo Neural Texturing in the Wild

DANTE-W:野外场景的漫反射反照率神经纹理化

Guangyu Wang, Tianheng Lu, Ruqi Huang, Lu Fang

机构 * Tsinghua University(清华大学)

AI总结 提出DANTE-W神经纹理框架,利用神经表示融合生成式先验,通过物理神经渲染恢复高保真漫反射反照率纹理,提升重光照保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30699 2026-07-01 cs.LG physics.comp-ph 新提交

Joint discovery of governing partial differential equations from multi-source datasets by competitive optimization

基于竞争优化的多源数据集联合发现偏微分方程

Hao Xu, Siyu Lou, Yuntian Chen, Dongxiao Zhang

机构 * Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin, Eastern Institute of Technology(浙江工业智能与数字孪生重点实验室,东方理工高等研究院) Department of Electrical Engineering, Tsinghua University(清华大学电机工程系) Ningbo Institute of Digital Twin, Eastern Institute of Technology(东方理工高等研究院宁波数字孪生研究院)

AI总结 提出MCO-PDE框架,通过软竞争权重机制融合多源数据集,联合发现共享偏微分方程的结构和参数,在稀疏观测下高精度恢复经典方程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28322 2026-07-01 cs.CV 新提交

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

PerceptionRubrics:将多模态评估校准至人类感知

Yana Wei, Hongbo Peng, Yanlin Lai, Liang Zhao, Kangheng Lin, En Yu, Keyu Lv, Han Zhou, Yin Tang, Haodong Li, Mitt Huang, Hangyu Guo, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) StepFun Tsinghua University(清华大学) Independent Researcher(独立研究者)

AI总结 提出基于准则的评估框架PerceptionRubrics,通过双流准则和门控评分机制,解决基准分数饱和而实际脆弱性问题,揭示可靠性差距、开源与闭源感知差异,并实现与人类感知的高度对齐。

Comments ICML 2026. Project page: https://weiyana.github.io/PerceptionRubrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27922 2026-07-01 cs.CV cs.AI 新提交

Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding

Reflect-R1:长视频理解中基于证据驱动的自纠正反思

Shuimu Chen, Yuteng Chen, Yuanshen Guan, Zebang Cheng, Zeyu Zhang, Shengqian Qin, Bin Xia, Jiaran Li, Wenming Yang, Fei Ma

机构 * Tsinghua University(清华大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) University of California(加利福尼亚大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出Reflect-R1框架,通过直觉、验证、仲裁三阶段管道动态检索客观视觉证据,并设计阶段解耦强化学习算法SD-GRPO解决策略耦合,在长视频理解基准上达到最优性能。

Comments 2026 ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27313 2026-07-01 cs.CV 新提交

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

ViQ: 任意分辨率下的文本对齐视觉量化表示

Xumin Yu, Zuyan Liu, Zhenyu Yang, Yuhao Dong, Shengsheng Qian, Jiwen Lu, Han Hu, Yongming Rao

机构 * Tencent HY Vision Team(腾讯HY视觉团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Chinese Academy of Sciences(中国科学院)

AI总结 提出ViQ框架,通过文本对齐预训练和特征离散化两阶段量化学习,平衡离散表示中的语义与细节,支持原生分辨率输入,在多模态任务中取得与连续高维特征编码器相当的性能,并实现20%-70%的训练加速。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24330 2026-07-01 cs.CV 新提交

REDI-Match: Rotation-Equivariant Distillation for Efficient and Robust Dense Matching

REDI-Match: 旋转等变蒸馏实现高效鲁棒密集匹配

Yinji Ge, Guixu Zheng, Wulong Guo, Qian Feng, Xu Wu, Kai Zhou, Xinyuan Liu, Fei Xing

机构 * Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Beihang University(北京航空航天大学) Zhejiang University(浙江大学)

AI总结 提出REDI-Match框架,通过旋转等变蒸馏将视觉基础模型的语义知识注入轻量等变编码器,结合熵驱动空间对齐模块,在密集匹配中实现高效鲁棒的旋转不变性,在SatAst数据集上提升13.89%姿态精度且速度提升1.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28226 2026-06-29 cs.CV cs.AI 新提交

Exposure Bias Can Alleviate Itself via Directional and Frequency Rectification in Flow Matching

暴露偏差可以通过流匹配中的方向和频率校正自我缓解

Guanbo Huang, Jingjia Mao, Fanding Huang, Fengkai Liu, Xiangyang Luo, Yaoyuan Liang, Jiasheng Lu, Xiaoe Wang, Pei Liu, Ruiliu Fu, Ruqi Huang, Shao-Lun Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

AI总结 提出DEFAR框架,利用暴露偏差自身的方向和频率自适应信号进行校正,通过抗漂移校正和频率补偿增强模型鲁棒性,在多个数据集上优于现有方法。

Comments arXiv admin note: text overlap with arXiv:2512.04904

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28144 2026-06-29 cs.CV 新提交

Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading

基于级联扩散先验和UV空间可微分着色的单目虚拟人重建

Hong Li, Minqi Meng, Yanjun Liang, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Xianda Guo, Guojun Lei, Xuhui Liu, Chaojie Yang, Yanlun Peng, Hao Zhao, Baochang Zhang

机构 * Beihang University(北航) Great Wall Motors(长城汽车) CUHK-Shenzhen(香港科技大学深圳研究院) HKUST(香港科技大学) Nanjing University(南京大学) Wuhan University(武汉大学) Zhejiang University(浙江大学) KAUST(王国 Abdullah 基础科学研究院) Tsinghua University(清华大学)

AI总结 提出数据高效框架,利用统一预训练扩散模型的鲁棒先验,通过级联LoRA依次处理纹理补全、去光照和材质分解,结合UV空间可微分BRDF着色损失,从单张野外图像重建高保真可重光照3D虚拟人。

Comments Accepted by ECCV 2026. Project page: https://luh1124.github.io/MARCUS-Avatar-Projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28094 2026-06-29 cs.CV cs.AI 新提交

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR: 一步扩散修复用于效果感知的对象移除

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Xidian University(西安电子科技大学) Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学) Transsion(传音控股)

AI总结 提出一步扩散模型OSOR,通过占用引导判别器、alpha头和语义锚定验证管道,实现高效、效果感知且对不完美掩码鲁棒的对象移除,速度提升4-30倍。

Comments Code and resources are available at https://github.com/Zhouqm-Git/osor

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28089 2026-06-29 cs.CV 新提交

RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement

RPM-Distill:生理引导的自适应跨模态蒸馏用于鲁棒的远程生理测量

Jiyao Wang, Qingyong Hu, Duoxun Tang, Xiao Yang, Kaishun Wu, Jiangbo Yu

机构 * McGill University(麦吉尔大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

AI总结 提出RPM-Distill框架,利用训练时的雷达信号通过频域蒸馏指导视频模型,提升光照、肤色和运动变化下的远程心率估计鲁棒性,在挑战性条件下MAE降低81%,相关性提升21%。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28049 2026-06-29 cs.CV 新提交

AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration

AirGroundBench: 异构多视角具身协作下多模态大模型的空间智能探测

Haotian Li, Yida Wang, Leyuan Wang, Jinshan Lai, Keyang Wang, Zonghao Guo, Qiang Ma, Liuyu Xiang, Jianwei Hu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) QiYuanLab(启元实验室) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 提出AirGroundBench基准,通过异构无人机-无人车协作的多视角任务(10类、约6.2万道视觉问答和115个导航任务),系统评估多模态大模型在空间感知、跨视角对齐、空间变换推理和具身决策中的几何一致性,发现模型在跨视角对齐和变换推理上存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28026 2026-06-29 cs.CV 新提交

EMOSH: Expressive Motion and Shape Disentanglement for Human Animation

EMOSH:用于人体动画的表现性运动与形状解耦

Dongbin Zhang, Hao Liu, Binquan Dai, Kangjie Chen, Chuming Wang, Chen Li, Jing Lyu, Haoqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) WeChat Vision, Tencent Inc.(腾讯微信视觉)

AI总结 提出EMOSH框架,通过可表现人体模型解耦形状与姿态,结合粗细混合运动注入和空间对齐条件机制,实现高保真、可控的人体视频生成,解决运动-形状纠缠问题。

Comments Accepted to ECCV 2026, Project Page: https://eastbeanzhang.github.io/EMOSH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27974 2026-06-29 cs.CV cs.AI 新提交

ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering

ProMSA: 渐进式多模态搜索智能体用于基于知识的视觉问答

ZhengXian Wu, Hangrui Xu, Kai Shi, Zhuohong Chen, Yunyao Yu, Chuanrui Zhang, Zirui Liao, Jun Yang, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center, OPPO Inc. China(OPPO AI中心,OPPO公司) The Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Nanyang Technological University, Singapore(新加坡南洋理工大学)

AI总结 提出渐进式多模态搜索智能体ProMSA,通过迭代选择图像搜索、文本搜索或停止,在显式工具调用预算和去重机制下,结合序列级强化学习优化,提升基于知识的视觉问答的检索和端到端准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27813 2026-06-29 cs.RO 新提交

Booster Lab: A Data-Centric Pipeline for Learning Deployable Humanoid Locomotion Policies

Booster Lab: 一种用于学习可部署人形机器人运动策略的数据中心化流水线

Penghui Chen, Tinglong Zheng, Yufeng Zhang, Mingguo Zhao

机构 * Department of Automation, Tsinghua University(清华大学自动化系) School of Mechanical and Electronic Control Engineering, Beijing Jiaotong University(北京交通大学机械与电子控制工程学院) Booster Robotics Technology Co., Ltd(北京加速进化科技有限公司)

AI总结 提出一种数据中心化流水线,通过运动数据筛选、真实到仿真模型适配、基于AMP的强化学习和仿真到现实部署,解决人形机器人运动数据稀缺问题,并在Booster T1和K1机器人上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27786 2026-06-29 cs.CL cs.AI 新提交

SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in Retrieval-Augmented Generation

SHIFT: 门控调制激活引导用于检索增强生成中的知识冲突缓解

Ruochang Li, Pengcheng Huang, Zhenghao Liu, Yukun Yan, Huiyuan Xie, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,沈阳,中国) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,北京,中国)

AI总结 提出SHIFT框架,通过轻量级门控模块调节LLM内部激活,以自适应解决检索上下文与参数知识间的冲突,仅优化0.01%参数,在六个数据集上验证有效性。

Comments 19 pages, 13 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27611 2026-06-29 cs.LG 新提交

COOPA: A Modular LLM Agent Architecture for Operations Research Problems

COOPA: 面向运筹学问题的模块化LLM智能体架构

Chuanhao Li, Xiaoan Xu, Dirk Bergemann, Ethan X. Fang, Yehua Wei, Zhuoran Yang

机构 * Tsinghua University(清华大学) Duke University(杜克大学) Yale University(耶鲁大学)

AI总结 提出COOPA模块化LLM智能体架构,通过迭代置信度建模、元素级溯源与多求解器路由,提升运筹问题建模准确性与可解释性,在多个基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27397 2026-06-29 cs.MA cs.AI cs.GT 新提交

SidConArena: An Environment Evaluating Agents in Open-Ended,Positive-Sum Bargaining Game

SidConArena:一个在开放、正和博弈中评估智能体的环境

Yeqi Feng, Yuxin Chen, Tianxing He

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

AI总结 提出SidConArena基准框架,通过三阶段部分可观测随机博弈评估LLM智能体在开放、正和谈判中的经济决策能力,发现前沿模型虽表现更好但仍存在资源误估、谈判被动和长期规划不足。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27381 2026-06-29 cs.LG cs.AI 新提交

OverFlowLight: Real-Time Gridlock Prevention and Traffic Signal Optimization for Urban Intersections

OverFlowLight:城市交叉口实时防锁死与交通信号优化

Mingyuan Li, Boyang Huang, Tianqi Jiang, Chenpu Li, Chunyu Liu, Yang Li, Ruimin Li, Qiang Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Electronic Science and Technology of China(电子科技大学) South China University of Technology(华南理工大学) Beijing Xiaocheng Intelligent Computing(北京小城智能计算) Tsinghua University(清华大学) Lanzhou University(兰州大学)

AI总结 针对城市交通中队列溢出导致级联锁死的问题,提出OverFlowLight框架,利用多模态传感实时检测溢出并动态插入专用相位,结合规则与强化学习混合控制,实际部署43个路口减少60.4%溢出事件并提升18.2%网络吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25939 2026-06-29 cs.RO 新提交

DeformGen: Dynamics-Based Topology Augmentation for Deformable Manipulation Policy Learning

DeformGen: 基于动力学的拓扑增强用于可变形操作策略学习

Zili Lin, Wenyao Zhang, Yuyang Zhang, Zekun Qi, Junyan Lin, Hanxin Zhu, Jiaolong Yang, Zhibo Chen, Yao Mu, Xiaokang Yang, Xin Jin, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Microsoft Research(微软研究院)

AI总结 提出DeformGen框架,通过局部物理扰动和动力学前向模拟生成拓扑一致的可变形状态,并利用变形场扭曲转移操作轨迹,联合增强状态分布与操作行为,提升可变形操作策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27187 2026-06-26 cs.CV cs.CL 新提交

HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

HarmVideoBench:大型多模态模型中有害视频理解的基准测试

Jiajun Wu, Haoyu Kang, Yining Sun, Jiacheng Hou, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochi Zhang, Leixin Sun, Eric Hanchen Jiang, Yushan Li, Ruiyu Li, Mengkai Huang, Yan Gao, Xu Zhang, Guancheng Wan

机构 * Central South University(中南大学) Tsinghua University(清华大学) South China Normal University(华南师范大学) ByteDance Inc(字节跳动公司) University of Zaragoza(阿拉维达大学) CosmosMind Wuhan University(武汉大学) University of California, Los Angeles(加州大学洛杉矶分校) Southeast University(东南大学) Tencent(腾讯公司) Nankai University(南开大学) Supermicro Computer Inc(Supermicro计算机公司) Huazhong University of Science and Technology(华中科技大学)

AI总结 提出HarmVideoBench,一个包含1379个视频和4137道选择题的多层次诊断基准,从三个维度评估模型对有害视频的深层理解,并引入BCR方法将宏平均准确率从61.7%提升至84.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26790 2026-06-26 cs.CL 新提交

OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning

OPID: 面向智能体强化学习的在策略技能蒸馏

Shuo Yang, Jinyang Wu, Zhengxi Lu, Yuhao Shen, Fan Zhang, Lang Feng, Shuai Zhang, Haoran Luo, Zheng Lian, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

AI总结 提出OPID框架,通过从在策略轨迹中提取层级技能(回合级和步骤级)提供密集标记级监督,结合结果优势进行策略优化,提升智能体性能、样本效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏