arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4556
2412.14058 2026-02-16 cs.RO cs.CV

What Matters in Building Vision-Language-Action Models for Generalist Robots

在通用机器人中构建视觉-语言-动作模型所关注的关键因素

Xinghang Li, Peiyan Li, Long Qian, Minghuan Liu, Dong Wang, Jirong Liu, Bingyi Kang, Xiao Ma, Xinlong Wang, Di Guo, Tao Kong, Hanbo Zhang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ByteDance Research(字节跳动研究院) CASIA MAIS-NLPR Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本研究揭示了构建通用机器人视觉-语言-动作模型的关键因素,开发了无需大量手动设计的RoboVLMs,实现了模拟和现实任务中的新状态-of-the-art性能。

Comments Project page: robovlms.github.io. Added limitations and future works. Fix categorization

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12160 2026-02-13 cs.CV

DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation

DreamID-Omni: 一体化框架用于可控的人-centric音频视频生成

Xu Guo, Fulong Ye, Qichao Sun, Liyang Chen, Bingchuan Li, Pengze Zhang, Jiawei Liu, Songtao Zhao, Qian He, Xiangwang Hou

机构 * Tsinghua University(清华大学) Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

AI总结 DreamID-Omni提出了一种统一框架,通过双层解耦策略和多任务训练方案,实现对可控人-centric音频视频生成的高效控制。

Comments Project: https://guoxu1233.github.io/DreamID-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11980 2026-02-13 cs.CV

Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation

空间链式思考:连接理解与生成模型以实现空间推理生成

Wei Chen, Yancheng Long, Mingqiao Liu, Haojie Ding, Yankai Yang, Hongyang Wei, Yi-Fan Zhang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出SCoT框架,通过结合MLLMs的推理能力与扩散模型的生成能力,提升空间推理生成任务的性能。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11832 2026-02-13 cs.CV cs.RO

JEPA-VLA: Video Predictive Embedding is Needed for VLA Models

视频预测嵌入对于VLA模型是必要的

Shangchen Miao, Ningya Feng, Jialong Wu, Ye Lin, Xu He, Dong Li, Mingsheng Long

机构 * Tsinghua University(清华大学) Huawei Noah's Ark Lab(华为诺亚实验室)

AI总结 JEPA-VLA通过引入视频预训练的预测嵌入,提升VLA模型在机器人任务中的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11800 2026-02-13 cs.LG

Temporal Difference Learning with Constrained Initial Representations

具有约束初始表示的时序差分学习

Jiafei Lyu, Jingwen Yang, Zhongjian Qiao, Runze Liu, Zeyuan Liu, Deheng Ye, Zongqing Lu, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Tencent(腾讯) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本文提出CIR框架,通过引入双曲正切函数和改进的Q学习方法,提升时序差分学习在连续控制任务中的性能。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11779 2026-02-13 cs.LG

Temperature as a Meta-Policy: Adaptive Temperature in LLM Reinforcement Learning

温度作为元策略:LLM强化学习中的自适应温度

Haoran Dang, Cuiling Lan, Hai Wan, Xibin Zhao, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 TAMPO通过将温度控制转化为可学习的元策略,实现了LLM强化学习中的自适应探索,优于固定或启发式温度方法。

Comments Accepted at ICLR 2026. 10 pages (main text) + supplementary material, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10983 2026-02-13 cs.RO

Scaling World Model for Hierarchical Manipulation Policies

为分层操作策略扩展世界模型

Qian Long, Yueze Wang, Jiaxi Song, Junbo Zhang, Peiyan Li, Wenxuan Wang, Yuqi Wang, Haoyang Li, Shaoxuan Xie, Guocai Yao, Hanbo Zhang, Xinlong Wang, Zhongyuan Wang, Xuguang Lan, Huaping Liu, Xinghang Li

机构 * Xi’an Jiao Tong University(西安交通大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出分层VLA框架,利用大规模预训练世界模型提升机器人操作在分布外场景的泛化能力,实验显示性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06643 2026-02-13 cs.RO cs.AI cs.LG

Humanoid Manipulation Interface: Humanoid Whole-Body Manipulation from Robot-Free Demonstrations

人形机器人操控接口:无需机器人演示的全身体验操控

Ruiqian Nai, Boyuan Zheng, Junming Zhao, Haodong Zhu, Sicong Dai, Zunhao Chen, Yihang Hu, Yingdong Hu, Tong Zhang, Chuan Wen, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 HuMI通过便携硬件实现无需机器人演示的全身体验操控,提升数据收集效率并提高未见环境中的任务成功率。

Comments Website: https://humanoid-manipulation-interface.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19269 2026-02-13 cs.RO cs.LG

Translating Flow to Policy via Hindsight Online Imitation

通过回顾在线模仿将流翻译为政策

Yitian Zheng, Zhangchen Ye, Weijun Dong, Shengjie Wang, Yuyang Liu, Chongjie Zhang, Chuan Wen, Yang Gao

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) University of California San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Qi Zhi Institute(上海启智研究所)

AI总结 通过回顾在线模仿将流翻译为政策,利用2D点流作为高层规划器,在模拟和现实任务中实现超过2倍的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15414 2026-02-13 cs.AI

MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs

通过战略性大语言模型的自我对战激励多智能体推理的MARSHAL

Huining Yuan, Zelai Xu, Zheyue Tan, Xiangmin Yi, Mo Guang, Kaiwen Long, Haojia Hui, Boxun Li, Xinlei Chen, Bo Zhao, Xiao-Ping Zhang, Chao Yu, Yu Wang

机构 * SIGS, Tsinghua University(清华大学信号与系统系) EE, Tsinghua University(清华大学电子工程系) Aalto University(阿alto大学) Li Auto Inc.(李汽车公司) Infinigence AI Project Page Code Models(Infinigence AI项目页面代码模型)

AI总结 MARSHAL通过战略性LLM的自我对战激励多智能体推理,实现多智能体系统的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11684 2026-02-13 cs.CL cs.AI cs.HC

PatientHub: A Unified Framework for Patient Simulation

PatientHub: 一个统一的患者模拟框架

Sahand Sabour, TszYam NG, Minlie Huang

机构 * The CoAI Group, DCST Institute for Artificial Intelligence Tsinghua University(CoAI集团、DCST人工智能研究所清华大学)

AI总结 PatientHub提供了一个统一的患者模拟框架,通过标准化定义、组成和部署,促进跨方法和跨模型的基准测试,并降低新方法开发的门槛。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11581 2026-02-13 cs.IR cs.AI cs.CL

Analytical Search

分析搜索

Yiteng Tu, Shuo Miao, Weihang Su, Yiqun Liu, Qingyao Ai

机构 * DCST, Tsinghua University(清华大学智能驾驶与车路协同研究院) Quan Cheng Laboratory(量子工程实验室)

AI总结 本文提出分析搜索范式,旨在通过证据导向和多步骤推理解决复杂分析需求,提升信息检索的端到端能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11424 2026-02-13 cs.CL cs.AI cs.LG

Gradients Must Earn Their Influence: Unifying SFT with Generalized Entropic Objectives

梯度必须赢得其影响:统一监督微调与广义熵目标

Zecheng Wang, Deyuan Liu, Chunshan Li, Yupeng Zhang, Zhengyun Zhao, Dianhui Chu, Bingning Wang, Dianbo Sui

机构 * Harbin Institute of Technology(哈尔滨工业大学) WeChat, Tencent(微信、腾讯) Tsinghua University(清华大学)

AI总结 本文提出DEFT方法,通过广义熵目标统一SFT,解决塑性-稳定性困境,提升模型在探索与利用间的平衡性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11241 2026-02-13 cs.CV cs.LG

Active Zero: Self-Evolving Vision-Language Models through Active Environment Exploration

主动零:通过主动环境探索实现自我进化的视觉-语言模型

Jinghan He, Junfeng Fang, Feng Xiong, Zijun Yao, Fei Shen, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究所) Tsinghua University(清华大学)

AI总结 Active-Zero通过主动环境探索实现视觉-语言模型的自我进化,提升推理和理解任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09070 2026-02-13 cs.SD cs.AI eess.AS

NarraScore: Bridging Visual Narrative and Musical Dynamics via Hierarchical Affective Control

NarraScore: 通过分层情感控制弥合视觉叙事与音乐动态

Yufan Wen, Zhaocheng Liu, YeGuo Hua, Ziyi Guo, Lihua Zhang, Chun Yuan, Jian Wu

机构 * Tsinghua University(清华大学)

AI总结 NarraScore通过分层情感控制,实现视觉叙事与音乐动态的融合,以高密度压缩叙事逻辑,提升长视频配乐生成的连贯性与自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00148 2026-02-13 cs.CV cs.AI

Learning Physics-Grounded 4D Dynamics with Neural Gaussian Force Fields

基于神经高斯力场的学习物理 grounded 4D 动力学

Shiqian Li, Ruihong Shen, Junfeng Ni, Chang Pan, Chi Zhang, Yixin Zhu

机构 * Institute for AI, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院) School of EECS, Peking University(北京大学电子工程学院) Department of Automation, Tsinghua University(清华大学自动化系) Yuanpei College, Peking University(北京大学元培学院) State Key Lab of General AI, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室)

AI总结 本文提出神经高斯力场(NGFF),通过结合3D高斯感知与物理动力学建模,从多视角RGB输入生成交互式、物理真实的4D视频,提升视频预测的物理 grounded 性。

Comments 43 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10793 2026-02-13 cs.SD cs.HC cs.LG eess.AS

SonicSieve: Bringing Directional Speech Extraction to Smartphones Using Acoustic Microstructures

SonicSieve:利用声学微结构在智能手机上实现定向语音提取

Kuang Yuan, Yifeng Wang, Xiyuxing Zhang, Chengyi Shen, Swarun Kumar, Justin Chan

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学) Zhejiang University(浙江大学)

AI总结 SonicSieve通过生物启发式声学微结构在智能手机上实现定向语音提取,提升信号质量并优于传统麦克风阵列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12530 2026-02-13 cs.CL cs.LG

Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations

将策略翻译为语言:通过生成连续归一化流生成的奖励用于LLM解释

Xinyi Yang, Liang Zeng, Heng Dong, Chao Yu, Xiaoran Wu, Huazhong Yang, Yu Wang, Milind Tambe, Tonghan Wang

机构 * AIPD, Tencent, Shenzhen, China(腾讯人工智能与大数据研究院,深圳,中国) IIIS, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) EE, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国) CS, Tsinghua University, Beijing, China(清华大学计算机系,北京,中国) SEAS, Harvard University, Cambridge, USA(哈佛大学工程学院,剑桥,美国) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国)

AI总结 本文提出通过生成连续归一化流生成奖励,训练LLM生成更准确、逻辑严谨且认知负担更低的解释,以提升智能体与人类共存的可靠性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09007 2026-02-13 cs.CV

Scale Contrastive Learning with Selective Attentions for Blind Image Quality Assessment

基于选择性注意力的多尺度对比学习用于盲图像质量评估

Runze Hu, Zihao Huang, Xudong Li, Bohan Fu, Yan Zhang, Sicheng Zhao

机构 * School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学) School of Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Xiamen University(多媒体可信感知与高效计算重点实验室,厦门大学) Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(北京信息科学与技术国家研究中心(BNRist),清华大学)

AI总结 CSFIQA通过选择性注意力和尺度对比学习提升盲图像质量评估的多尺度感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10965 2026-02-12 cs.LG

MoEEdit: Efficient and Routing-Stable Knowledge Editing for Mixture-of-Experts LLMs

MoEEdit: 高效且路由稳定的知识编辑用于专家混合语言模型

Yupu Gu, Rongzhe Wei, Andy Zhu, Pan Li

机构 * Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 MoEEdit提出一种高效且路由稳定的知识编辑方法,用于稀疏混合专家语言模型,通过空空间投影和块坐标下降求解器实现高效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10815 2026-02-12 cs.CV cs.LG

Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training

为什么强化学习比监督微调在泛化能力上更优?一种以数据为中心的视觉语言模型后训练视角

Aojun Lu, Tao Feng, Hangjie Yuan, Wei Li, Yanan Sun

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文通过数据视角揭示了RL在VLM后训练中泛化能力优于SFT的原因,提出DC-SFT方法提升OOD性能并提高稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03866 2026-02-12 cs.DL cs.AI

PaperX: A Unified Framework for Multimodal Academic Presentation Generation with Scholar DAG

PaperX: 一种多模态学术演示生成的统一框架与学者DAG

Tao Yu, Minghui Zhang, Zhiqing Cui, Hao Wang, Zhongtian Luo, Shenghua Chai, Junhao Gong, Yuzhao Peng, Yuxuan Zhou, Yujia Yang, Zhenghao Zhang, Haopeng Jin, Xinming Wang, Yufei Xiong, Jiabing Yang, Jiahao Yuan, Hanqing Wang, Hongzhu Yi, Yan Huang, Liang Wang

机构 * CASIA(中国科学院自动化研究所) UCAS(乌尔姆大学) Peking University(北京大学) Tsinghua University(清华大学) HKUST(GZ)(香港科技大学(广州))

AI总结 PaperX通过Scholar DAG实现多模态学术演示生成的统一框架,提升内容质量和效率。

Comments 29 pages, 9 figures, Project website: https://github.com/yutao1024/PaperX

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20280 2026-02-12 cs.CL cs.AI

Context-level Language Modeling by Learning Predictive Context Embeddings

通过学习预测上下文嵌入进行上下文级语言建模

Beiya Dai, Yuliang Liu, Daozheng Xue, Yunchong Song, Qipeng Guo, Kai Chen, Xinbing Wang, Bowen Zhou, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Nanjing University(南京大学)

AI总结 ContextLM通过学习预测上下文嵌入,提升多令牌预测能力,实现更高效的参数和训练效率,同时在下游任务中表现更优。

Comments 19pages,6 figures, 13 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25112 2026-02-12 cs.AI cs.MA

AI Driven Discovery of Bio Ecological Mediation in Cascading Heatwave Risks

由人工智能驱动的生物生态中介在连锁热浪风险中的发现

Yiquan Wang, Tin-Yeh Huang, Qingyun Gao, Yuhan Chang, Jialin Zhang

机构 * College of Mathematics and System Science, Xinjiang University, Urumqi, Xinjiang, China(数学与系统科学学院,新疆大学) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences, Beijing, China(地理科学与自然资源研究所,中国科学院) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University, Hong Kong, China(工业与系统工程系,香港理工大学) Xinya College, Tsinghua University, Beijing, China(清华学院) College of Architectural Engineering, Xinjiang University, Urumqi, Xinjiang, China(建筑工程学院,新疆大学)

AI总结 本研究提出HeDA框架,通过构建知识图谱发现生物生态中介效应,揭示热浪风险的复杂系统性影响,并推动适应策略向动态跨系统韧性转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23279 2026-02-12 cs.CL

Unveiling Super Experts in Mixture-of-Experts Large Language Models

揭示混合专家大语言模型中的超级专家

Zunhai Su, Qingyuan Li, Hao Zhang, Weihao Ye, Qibo Xue, YuLei Qian, Yuchen Xie, Ngai Wong, Kehong Yuan

机构 * Tsinghua University(清华大学) Meituan(美团) Xiamen University(厦门大学) Nanjing University(南京大学) The University of Hong Kong(香港大学)

AI总结 研究揭示了混合专家大语言模型中起关键作用的超级专家,通过分析其影响发现其在数学推理中的重要性,并探讨了压缩这些专家对模型性能的显著影响。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10513 2026-02-12 cs.CV cs.AI

1%>100%: High-Efficiency Visual Adapter with Complex Linear Projection Optimization

1%>100%: 高效视觉适配器与复杂线性投影优化

Dongshuo Yin, Xue Yang, Deng-Ping Fan, Shi-Min Hu

机构 * BNRist, Department of Computer Science Technology, Tsinghua University, Beijing, China School of Automation Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, China Nankai lnternational Advanced Research Institute (Shenzhen Futian) \& SLAI, Shenzhen, China

AI总结 CoLin通过复杂线性投影优化,以仅1%参数实现视觉基础模型高效适应,超越传统微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10300 2026-02-12 cs.LG

Configuration-to-Performance Scaling Law with Neural Ansatz

基于神经元的配置到性能缩放定律

Huaqing Zhang, Kaiyue Wen, Tengyu Ma

机构 * IIIS, Tsinghua University(清华大学信息科学技术学院) Stanford University(斯坦福大学)

AI总结 本文提出基于神经元的配置到性能缩放定律,通过大规模预训练日志训练模型,实现对训练配置与性能之间关系的准确预测,并支持多超参数联合优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10173 2026-02-12 cs.CV

ArtisanGS: Interactive Tools for Gaussian Splat Selection with AI and Human in the Loop

ArtisanGS: 带有AI和人机协作的高斯点选择交互工具

Clement Fuji Tsang, Anita Hu, Or Perel, Carsten Kolve, Maria Shugrina

机构 * NVIDIA NVIDIA Canada(NVIDIA 加拿大) University of Toronto Canada(多伦多大学 加拿大) NVIDIA France(NVIDIA 法国) University of Toronto(多伦多大学) Institute for Clarity in Documentation Dublin Ohio USA(文档清晰研究所 俄亥俄州 大致) Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) Rajiv Gandhi University Doimukh Arunachal Pradesh India(拉吉夫·甘地大学 亚当穆克 阿鲁纳恰尔邦 印度) Tsinghua University Haidian Qu Beijing Shi China(清华大学 海淀区 北京市 中国) Palmer Research Laboratories San Antonio Texas USA(帕勒研究中心 肯塔基州 威斯康星州 美国)

AI总结 ArtisanGS通过交互式工具实现高斯点选择与分割,结合AI与人工干预,提供灵活的局部编辑功能,适用于真实场景中的可控编辑。

Comments 12 pages, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10161 2026-02-12 cs.CR cs.AI cs.CL

Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment

跨模态冲突下的全方位安全:漏洞、动态机制和高效对齐

Kun Wang, Zherui Li, Zhenhong Zhou, Yitong Zhang, Yan Mi, Kun Yang, Yiming Zhang, Junhao Dong, Zhongxiang Sun, Qiankun Li, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Renmin University of China(中国人民大学)

AI总结 本文提出OmniSteer方法,通过提取黄金拒绝向量和轻量级适配器提升多模态模型的安全性与通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10159 2026-02-12 cs.CV cs.LG

Beyond Closed-Pool Video Retrieval: A Benchmark and Agent Framework for Real-World Video Search and Moment Localization

超越封闭池视频检索:面向真实世界视频搜索和时刻定位的基准与代理框架

Tao Yu, Yujia Yang, Haopeng Jin, Junhao Gong, Xinlong Chen, Yuxuan Zhou, Shanbin Zhang, Jiabing Yang, Xinming Wang, Hongzhu Yi, Ping Nie, Kai Zou, Zhang Zhang, Yan Huang, Liang Wang, Yeshani, Ruiwen Tao, Jin Ma, Haijin Liang, Jinwen Luo

机构 * CASIA UCAS Tencent(腾讯) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出RVMS-Bench和RACLO框架,用于评估现实世界中基于模糊记忆的视频检索和时刻定位,揭示现有模型在该任务上的不足。

Comments 49 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏