arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4517
2607.14897 2026-07-17 cs.CV 新提交

Selectivity Drives Efficiency: Dataset Pruning for Visual Place Recognition

选择性驱动效率:用于视觉场所识别的数据集剪枝

Tong Jin, Yunpeng Liu, Shuyu Hu, Chun Yuan, Song Wang, Feng Lu

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Shenzhen University of Advanced Technology(深圳先进技术研究院)

AI总结 针对视觉场所识别中数据集存储和训练成本高的问题,提出场所级数据集剪枝框架,引入IPD和IPS指标评估场所训练价值,构建核心集,实验证明该方法能在不同剪枝率下降低成本并保持高识别性能。

Comments 14 pages,7 figures,15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14777 2026-07-17 cs.CL 新提交

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

SEED:用于智能体强化学习的自进化在线策略蒸馏

Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

AI总结 研究针对基于结果的强化学习中间决策指导有限的问题,提出SEED框架。它将在线策略轨迹转化为训练技能并提炼回策略模型,通过微调策略生成技能,重新评分动作转化蒸馏信号,联合优化提升性能与样本效率及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14703 2026-07-17 cs.CV cs.AI 新提交

Pretraining Multiple Instance Learning Networks with Multi-Teacher Distillation from Pathology Slide Foundation Models

基于病理切片基础模型的多教师蒸馏预训练多实例学习网络

Mingxi Fu, Jiawen Li, Renao Yan, Jiali Hu, Qiehe Sun, Tian Guan, Yonghong He

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Washington(华盛顿大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Medical Optical Technology R&D Center, Research Institute of Tsinghua(清华研究院医学光学技术研发中心) Jinfeng Laboratory(金凤实验室)

AI总结 针对计算病理学中多实例学习存在的问题,提出基于蒸馏的预训练框架,利用两个基础模型作为教师,引入角分散归一化蒸馏损失,将蒸馏权重用于下游适应,实验表明该方法在少样本场景中优势明显,能提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14684 2026-07-17 cs.CV 新提交

GlobalForge: Towards Robust AI-Generated Image Detection

GlobalForge:迈向强大的人工智能生成图像检测

Manni Cui, Ruiqi Liu, Dianyuan Zou, Ziheng Qin, Jingrui Xu, ZiAn Wang, Jianglan Wei, Han Zhou, Yu Liu, Yan Wang, Shu Wu

机构 * Huazhong University of Science and Technology(华中科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Jilin University(吉林大学) Tsinghua University(清华大学)

AI总结 研究针对AI生成图像检测器在现实世界通道传播后性能下降问题,提出GlobalForge框架,通过局部信息瓶颈和全局结构推理模块,基于退化对比结构损失联合训练,提升了检测器在多种基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14635 2026-07-17 cs.AI cs.CV cs.RO 新提交

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造

Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li

机构 * Shanghai Qizhi Institute(上海期智研究院) The Chinese University of Hong Kong(香港中文大学) Hong Kong Embodied AI Lab(香港具身人工智能实验室) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14507 2026-07-17 cs.RO 新提交

DRIFT: Drift and Aggregation for Motion Planning

DRIFT:用于运动规划的漂移与聚合

Yining Xing, Zhiyuan Liu, Zehong Ke, Wenhao Yu, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能网联汽车与交通国家重点实验室)

AI总结 研究针对端到端轨迹规划器问题,提出DRIFT固定深度规划器,结合轨迹潜在空间漂移与提议聚合,基于视觉编码器特征生成提议,经聚合头预测最终轨迹,在导航测试中有良好表现,证明该方法为多假设运动规划提供高效设计。

Comments 8 pages, 3 figures, 4 tables. Under review at IEEE RAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14485 2026-07-17 cs.AI 新提交

Step-Level Preference Learning for Generative Agents in Social Simulations

社会模拟中生成式智能体的步骤级偏好学习

Wenchang Gao, Pingyue Sheng, Lanlan Qiu, Yunfei Ma, Jian Zhao, Baicheng Chen, Kangda Wang, Yuyang Tian, Shunqiang Mao, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Xiongan AI Institute(雄安人工智能研究院) Tsinghua University(清华大学) CUHK-Shenzhen(香港中文大学(深圳)) USTC(中国科学技术大学) Sun Yat-sen University(中山大学)

AI总结 研究基于大语言模型的生成式智能体模拟人类行为时中间步骤注释稀缺问题,引入交互式模拟界面收集步骤级人类偏好监督,经监督微调算法和直接偏好优化方法进行步骤级偏好学习,提升模拟效果,证明步骤级人类监督是有效训练信号。

Comments WAICA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14652 2026-07-17 cs.LG cs.NA math.NA 新提交

Trajectory-Aware Flow Matching for Topology Optimisation

用于拓扑优化的轨迹感知流匹配

Shusheng Xiao, Jinshuai Bai, Hyogu Jeong, Yunfei Xi, Yilin Gui, YuanTong Gu

机构 * School of Mechanical, Medical and Process Engineering, Queensland University of Technology(昆士兰科技大学机械、医学与过程工程学院) Institute of Biomechanics and Medical Engineering, AML, Department of Engineering Mechanics, Tsinghua University(清华大学工程力学系生物力学与医学工程研究所) School of Civil and Environmental Engineering, Queensland University of Technology(昆士兰科技大学土木与环境工程学院) State Key Laboratory of Advanced Environmental Technology, Guangzhou Institute of Geochemistry, Chinese Academy of Sciences(中国科学院广州地球化学研究所环境技术重点实验室)

AI总结 研究针对拓扑优化中成本高、现有模型依赖复杂方法的问题,开发基于流匹配的拓扑优化(FMTO)框架,通过轨迹感知公式将物理引导优化历史纳入生成流学习,经分析和示例验证其能提升性能,适用于二维及三维问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09815 2026-07-17 cs.RO cs.CV 版本更新

RASR: Range-Aware Scale Recovery for Metric UAV Navigation

RASR:用于度量无人机导航的距离感知尺度恢复

Hongtao Liang, Xinyu Shao, Chenxu Wang, Yiyao Wan, Jiahuan Ji, Fangwei Ye, Fuhui Zhou, Qihui Wu

机构 * College of Electronic and Information Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学电子信息工程学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Noah Ark Lab, Huawei(华为诺亚方舟实验室) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院) College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)

AI总结 研究在GNSS信号阻断时无人机精确最后一米导航问题,提出RASR方法,将尺度恢复核心与校准模块分离,核心压缩几何成描述符并全局校准,校准模块进行残差校正和对齐,在PairUAV评估中取得较好结果。

Comments 5 pages, 4 figures. Technical report for the UAVM 2026 PairUAV Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01578 2026-07-17 cs.CV 版本更新

MVFusion-GS: Motion-Variance Guided Temporal Attention for High-Quality Dynamic Gaussian Splatting

MVFusion-GS:基于运动方差引导的时间注意力实现高质量动态高斯泼溅

Jianwei Hu, Tingxuan Huang, Hengyu Zhou, Ningna Wang, Xiaohu Guo, Jinshan Lai, Bin Wang

机构 * Tsinghua University(清华大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Electronic Science and Technology of China(电子科技大学)

AI总结 提出MVFusion-GS,通过运动方差引导细化与MotionFormer时间注意力模块增强变形网络,显式建模运动强度与时间一致性,在动态场景重建和无干扰重建任务中达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22280 2026-07-17 cs.CV 版本更新

Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings

超越思维链:重写作为生成式多模态嵌入的通用接口

Peixi Wu, Ke Mei, Feipeng Ma, Bosong Chai, Zhibin Lan, Chenxi Zhao, Shannan Yan, Jie Chen, Zhangchi Hu, Yansong Peng, Bo Lin, Junjie Zhou, Dacheng Yin, Tianyi Wang, Fengyun Rao, Jing Lyu, Hebei Li, Xiaoyan Sun

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) Zhejiang University(浙江大学) Tsinghua University(清华大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

AI总结 针对思维链推理在检索中产生冗余和语义歧义的问题,提出重写驱动的多模态嵌入框架RIME,联合优化生成与嵌入,并通过跨模态对齐和精炼强化学习实现高效准确的检索。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10821 2026-07-17 cs.RO 版本更新

UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation

统一噪声引导用于高效的人类引导VLA适应

Junjie Lu, Xinyao Qin, Yuhua Jiang, Kaixin Wang, Chuheng Zhang, Bin Liang, Jun Yang, Min Xu, Li Zhao

机构 * University of Technology Sydney(悉尼技术大学) Tsinghua University(清华大学) Microsoft Research(微软研究院)

AI总结 本文提出UniSteer框架,结合人类纠正指导与噪声空间RL,通过近似动作到噪声的逆向转换提升VLA在真实世界中的适应效率,实验显示成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15727 2026-07-17 cs.CR cs.AI cs.LG cs.MA cs.SE 版本更新

AgentWorm: Self-Propagating Attacks Across LLM Agent Ecosystems

ClawWorm:针对LLM代理生态系统自主传播的攻击

Yihao Zhang, Zeming Wei, Xiaokun Luan, Chengcan Wu, Zhixin Zhang, Jiangrong Wu, Haolin Wu, Huanran Chen, Jun Sun, Meng Sun

机构 * Peking University(北京大学) Sun Yat-sen University(中山大学) Wuhan University(武汉大学) Tsinghua University(清华大学) Singapore Management University(新加坡管理学院)

AI总结 研究提出ClawWorm,首个自主传播的LLM代理框架攻击,通过单条消息实现持久化感染与多跳传播,揭示模型安全姿态差异及防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21324 2026-07-17 cs.AI cs.MA 版本更新

CXRAgent: Director-Orchestrated Multi-Stage Reasoning for Chest X-Ray Interpretation

CXRAgent:用于胸部X光解读的由主任编排的多阶段推理

Jinhui Lou, Yan Yang, Zhou Yu, Zhenqi Fu, Weidong Han, Qingming Huang, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) Department of Automation, Tsinghua University(清华大学自动化系) Department of Colorectal Medical Oncology, Zhejiang Cancer Hospital(浙江省肿瘤医院结直肠医学肿瘤科) School of Computer and Control Engineering, University of Chinese Academy of Sciences(中国科学院大学计算机与控制工程学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院)

AI总结 针对胸部X光解读中模型适应性差等问题,提出CXRAgent,通过中央主任协调多阶段,包括工具调用、诊断规划和协作决策,实验证明该方法性能出色,能提供视觉证据并适应不同临床任务。

Comments 10 pages, 4 figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13703 2026-07-17 eess.SY cs.LG cs.SY 版本更新

GenTL: A General Transfer Learning Model for Building Thermal Dynamics

GenTL:用于建筑热动力学的通用迁移学习模型

Fabian Raisch, Thomas Krug, Christoph Goebel, Benjamin Tischler

机构 * Technical University of Applied Sciences Rosenheim(应用技术大学罗斯海姆) Technical University of Munich(慕尼黑技术大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗克琴堡研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

AI总结 研究针对建筑热动力学建模中迁移学习性能不一致问题,提出通用迁移学习模型GenTL,它基于LSTM网络用多建筑数据预训练,可有效微调至多种目标建筑,经测试相比单源模型平均预测误差降低42.1%,证明了该方法的有效性和可靠性。

Comments This is the author's version of the work. It is posted here for your personal use. Not for redistribution. The definitive Version of Record will be published in the ACM library in Jun 2025

Journal ref ACM E-Energy '25: Proceedings of the 16th ACM International Conference on Future and Sustainable Energy Systems (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05002 2026-07-17 cs.DB cs.AI 版本更新

AgenticData: An Agentic Data Analytics System for Heterogeneous Data

AgenticData:一种用于异构数据的智能数据分析系统

Ji Sun, Guoliang Li, Peiyao Zhou, Yihui Ma, Jingzhe Xu, Yuan Li

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系)

AI总结 针对现有非结构化数据分析系统依赖专家且成本高、耗时久的问题,AgenticData通过反馈驱动规划技术及多智能体协作策略,将自然语言查询转换为语义计划并优化执行,经测试在多个基准测试中准确率超现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07211 2026-07-17 cs.LG 版本更新

Bridging the Gap between Newton-Raphson Method and Regularized Policy Iteration

弥合牛顿-拉夫逊方法与正则化策略迭代之间的差距

Zeyang Li, Chuxiong Hu, Yunan Wang, Guojian Zhan, Jie Li, Yao Lyu, Shengbo Eben Li

机构 * Laboratory for Information and Decision Systems, Massachusetts Institute of Technology(信息与决策系统实验室,麻省理工学院) Department of Mechanical Engineering, Tsinghua University(机械工程系,清华大学) College of Artificial Intelligence and the School of Vehicle and Mobility, Tsinghua University(人工智能学院和车辆与移动系统学院,清华大学)

AI总结 研究正则化策略迭代(RPI)的理论基础,证明其与牛顿-拉夫逊方法等价,实现统一收敛分析,得出RPI局部二次收敛性等结论,还研究了不精确策略评估下的RPI并提出新算法,推进了强化学习正则化理论理解与算法设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13704 2026-07-16 cs.RO 新提交

nuTruck: Benchmarking Autonomous Driving Planning for Distributed Electric-drive Trucks

nuTruck:分布式电动卡车自动驾驶规划的基准测试

Jinyu Miao, Pu Zhang, Yifei He, Chengyao Zhang, Kun Jiang, Ke Wang, Mengmeng Yang, Diange Yang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) KargoBot.AI Inc.(卡戈博特人工智能公司)

AI总结 针对分布式电动卡车自动驾驶规划,提出nuTruck基准测试。纳入高精度动力学模型,采用多种规划器为基线,利用真实场景闭环评估,可定量评估侧翻风险等,有望成为评估此类规划器的新标准。

Comments 8 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13681 2026-07-16 cs.CV 新提交

Towards Spatial Supersensing in the Wild

迈向野外空间超感知

Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Stanford University(斯坦福大学)

AI总结 研究针对空间超感知中多模态模型基准测试局限于合成视频和家庭场景的问题,引入VSI-Super-Wild基准,受人类认知启发探究世界状态三元组,通过大量真实视频问答对测试发现模型不足及失败模式,为空间超感知发展指明方向。

Comments Accepted to ECCV 2026. Project page: https://vsi-super-wild.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13660 2026-07-16 cs.LG 新提交

The Hyperspherical Geometry of CLIP Latent Space: A Semantic Mixture Model

CLIP 潜在空间的超球面几何:一种语义混合模型

Zijie Yu, Gaowen Liu, Ramana Rao Kompella, Philip S. Yu, Yue Song

机构 * Tsinghua University(清华大学) Cisco Research(思科研究院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 研究 CLIP 潜在空间,提出基于冯·米塞斯-费舍尔分布混合的密度模型,用期望最大化算法学习,实现准确可解释的密度估计,改善长尾和分布外检测,建立几何一致的概率框架。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13563 2026-07-16 cs.CV 新提交

Nexus: Native Mesh Generation with Diffusion

Nexus:基于扩散的原生网格生成

Hanxiao Wang, Ying-Tian Liu, Yuan-Chen Guo, Qi-Yuan Feng, Zi-Xin Zou, Ding Liang, Biao Zhang, Yan-Pei Cao

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) VAST(无(暂未找到合适中文名,VAST可音译为“瓦斯特”,但这并非一个正式的中文机构名,所以保留英文)) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学)

AI总结 研究针对高质量三角形网格生成问题,提出Nexus扩散方法,通过解耦顶点与拓扑生成实现整体网格生成,经实验验证其性能优于现有基线,有效克服顺序网格建模局限且获从业者青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13431 2026-07-16 cs.LG cs.AI cs.CL 新提交

Discrete Diffusion Models: A Unified Framework from Tokenization to Generation

离散扩散模型:从词元化到生成的统一框架

Ye Yuan, Weien Li, Rui Song, Zeyu Li, Haochen Liu, Xiangyu Kong, Zixuan Dong, Linfeng Du, Zipeng Sun, Weixu Zhang, Jiaxin Huang, Changjiang Han, Yonghan Yang, Zichen Zhao, Xiuyuan Hu, Haolun Wu, Yankai Chen, Fengran Mo, Jikun Kang, Bowei He, Philip S. Yu, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Tsinghua University(清华大学) Rochester Institute of Technology(罗彻斯特理工学院) Salesforce(Salesforce公司) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 研究离散扩散模型,引入统一框架从离散状态空间构建审视该模型,让现有公式成为共同设计空间实例,揭示训练、推理等方面权衡,为未来研究提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13101 2026-07-16 cs.LG cs.AI 新提交

TSSM: Triaxial State Space Model for Global Station Weather Forecasting with Temporal-Variable-Historical Modeling

TSSM:用于全球台站天气预报的具有时间可变历史建模的三轴状态空间模型

Songru Yang, Zili Liu, Tao Han, Ben Fei, Fenghua Ling, Lei Bai, Chang Liu, Xiangyang Ji, Zhenwei Shi, Zhengxia Zou

机构 * Beihang University(北京航空航天大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 研究针对全球台站天气预报中现有方法的局限,提出三轴状态空间模型TSSM,通过时间可变历史范式纳入历史数据,设计扫描捕捉多种特性,在多数据集上性能优异,尤其在长期和迭代预测及应对缺失观测方面优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13373 2026-07-16 math.OC cs.LG 新提交

Learned Pairwise Deep Dual-Optimal Inequalities for Stabilizing Column Generation

用于稳定列生成的学习成对深度对偶最优不等式

Zhengzhong Ricky You, Bo Tang, Haoran Liu, Baichuan Mo

机构 * Department of Civil Engineering, Tsinghua University, Beijing 100084, China(清华大学土木工程系) MIT Sloan School of Management, Massachusetts Institute of Technology, 100 Main Street, Cambridge, MA 02142, USA(麻省理工学院斯隆管理学院) Department of Industrial and Systems Engineering, University of Florida, Gainesville, FL 32611, USA(佛罗里达大学工业与系统工程系)

AI总结 研究针对列生成中对偶解不稳定问题,提出学习成对深度对偶最优不等式框架,通过预测对偶变量排序、构建训练标签、后处理及恢复过程,在车辆路由问题测试集上大幅减少CG时间且保证边界无损失。

Comments 35 pages, 3 figures, and 12 tables; online appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12503 2026-07-16 cs.CV 版本更新

DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs

DynTrace:用于多模态大语言模型中4D时空推理的动态对象证据跟踪

Rongxin Gao, Yuzhi Huang, Dongxuan Liu, Chu Li, Zhenye Wang, Jie Wu, Shuzhao Xie, Jingyan Jiang, Xinghao Ding, Xiaotong Tu, Yue Huang

机构 * Xiamen University(厦门大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学)

AI总结 研究针对多模态大语言模型在连续动态场景感知中跟踪动态对象证据的局限,提出DynTrace框架,含DTV和DT-Token两个互补组件,能为模型提供基于几何视觉先验和结构化时空轨迹的动态对象证据,在多个基准测试中达先进水平。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08448 2026-07-16 cs.RO 版本更新

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents

利用VLA:通过记忆引导智能体将冻结的视觉语言动作模型转化为可靠的操作原语

Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

机构 * Tsinghua University(清华大学) Striding AI(驰行人工智能公司) Purdue University(普渡大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Infinigence AI(英飞智研人工智能公司) Zhongguancun Academy(中关村学院) Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究语言条件下操作问题,提出Harness VLA框架,将冻结VLA与分析原语库结合,通过学习操作范围扩展预训练VLA,在多种扰动操作任务中相比基线有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24152 2026-07-16 cs.CV cs.LG 版本更新

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models

具有反事实可控性的自主视频生成用于自进化世界模型

Xin Wang, Wenxuan Liu, Tongtong Feng, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

AI总结 本文提出反事实可控性是自进化世界模型的关键,通过自主视频生成实现可控性,使模型能测试动作后果并反馈改进生成。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13061 2026-07-16 cs.CV 版本更新

LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck

LaME: 通过信息瓶颈在潜在空间中进行多模态嵌入的推理学习

Peixi Wu, Biao Yang, Feipeng Ma, Bosong Chai, Bo Lin, Wei Yuan, Fan Yang, Tingting Gao, Hebei Li, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 提出LaME方法,将面向嵌入的潜在推理建模为弱监督信息瓶颈,使用可学习推理令牌在单次前向传播中完成推理,避免显式CoT的高计算成本和标注依赖,实现60倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00546 2026-07-16 cs.AI cs.CV 版本更新

Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation

通过能力导向的基准和MCTS驱动的数据生成推进多模态评判模型

Zeyu Chen, Huanjin Yao, Ziwang Zhao, Min Yang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

AI总结 本文提出M-JudgeBench和Judge-MCTS框架,通过能力导向的基准和MCTS驱动的数据生成提升多模态评判模型的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13467 2026-07-16 cs.LG 版本更新

On the Sublinear Regret of Continuous K-Max Bandits

关于连续 K 最大多臂老虎机的次线性遗憾

Yu Chen, Siwei Wang, Longbo Huang, Wei Chen

机构 * Microsoft Research Asia(微软亚洲研究院) Institute for Interdisciplinary Information Sciences(交叉信息院) Tsinghua University(清华大学)

AI总结 研究连续K最大多臂老虎机问题,该问题在推荐等应用中出现,有离散化误差等困难。引入DCK - UCB算法,证明其实现了\(\widetilde{O}(T^{3/4})\)遗憾界,还针对特定情况提出MLE - Exp算法,为连续组合老虎机提供了算法解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏