arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 324
2608.06741 2026-08-10 cs.LG cs.GT 新提交

Solver-Guided Reasoning for Mixed-Equilibrium Strategies

求解器引导的混合策略均衡推理

Han Wang, Philippe Beardsell, Boning Li, Aaron Sasmita, Shuai Li, Hongyuan Zha, Baoxiang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) GTO Wizard Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Vector Institute(向量研究所)

AI总结 本研究提出混合策略决策树(MDT),用求解器输出引导LLM在博弈中的均衡推理,在无限制德州扑克8种LLM配置下,将与均衡的L1距离降低52.6%,且策略可移植性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06197 2026-08-07 cs.AI 新提交

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) Central South University(中南大学) The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

AI总结 本文提出 EnvACE 方法,以世界预演替代外部环境交互训练 LLM 智能体,在多基准测试中性能优于基线,可突破外部环境约束扩展 LLM 智能体训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06088 2026-08-07 cs.RO cs.SE 新提交

IcFuzz: Fuzzing Isaac Sim with Semantic Stage Guidance and Multi-level Mutation

IcFuzz:基于语义阶段引导与多级变异的Isaac Sim模糊测试

Zhixiang Chen, Zhuangbin Chen, Ruoxi Jia, Zeqin Liao, Wei Li, Jinyang Liu, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出首个针对Isaac Sim的模糊测试方法IcFuzz,通过LLM语义阶段分割、多级变异算子与多臂老虎机算法提升测试效果,在代码覆盖率与漏洞检测上优于基线,已发现11个漏洞且9个被确认修复。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06020 2026-08-07 cs.AI cs.LG 新提交

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

从经济智能体到智能体经济:经济世界模型的系统蓝图

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

机构 * Shenzhen Loop Area Institute(深圳河套学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。

Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05703 2026-08-07 cs.CV 新提交

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

StreamArena:面向连续、交互式且长视界的智能体流媒体视频理解

Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu, Meng Chu, Yuan Lu, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对当前智能体流媒体视频理解评估的缺陷,提出StreamArena基准,设计StreamMind架构解决连续交互与长视界理解的张力,在四项能力上优于现有基线并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05158 2026-08-07 cs.CL cs.LG cs.NE 新提交

Safe Evolution with Circuit Anchors

基于回路锚点的安全进化

Yan Liu, Jie Fu, Tsung-Yi Ho

机构 * Chinese University of Hong Kong(香港中文大学) IQuest Research(艾奎斯特研究院)

AI总结 受生物发育约束启发,提出回路锚定进化(CAE)方法,通过锚定占比不足2%的安全回路,在极小能力损失下实现更优的安全保留,性能优于显式奖励约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04568 2026-08-06 cs.CV 新提交

Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching

Talk2Sensors:基于传感器自适应物理线索匹配的自动驾驶3D视觉 grounding

Runwei Guan, Di Tian, Ningwei Ouyang, Ruixiao Zhang, Shaofeng Liang, Haocheng Zhao, Lianqing Zheng, Xiaokai Bai, Guotao Wang, Daizong Liu, Henghui Ding, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能学域) MMLab, CUHK(香港中文大学MMLab) School of Transportation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学交通科学与工程学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) School of Intelligent Manufacturing and Smart Transportation, Suzhou City University(苏州城市学院智能制造与智能交通学院) Qingdao University of Science and Technology(青岛科技大学) Institute for Math & AI, Wuhan University(武汉大学数学与人工智能研究院) Institute of Big Data, Fudan University(复旦大学大数据研究院)

AI总结 针对现有室外3D视觉 grounding 未充分利用多传感器互补物理属性的问题,提出首个多传感器数据集Talk2Sensors及TSFormer框架,在相关基准上实现了最优性能。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04419 2026-08-06 cs.LG cs.AI 新提交

SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation

SPOT:面向在线策略蒸馏的稀疏探测与结果校准

Zikun Qu, Min Zhang, Mingze Kong, Zhiwei Shang, Yikun Ban, Shuang Qiu, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学)

AI总结 该研究针对在线策略蒸馏的缺陷,提出SPOT方法,通过获取-探索-利用程序优化探测与蒸馏,经多模型多基准实验验证,可提升推理性能并平衡解的质量与覆盖范围。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04351 2026-08-06 cs.SD cs.AI 新提交

HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

HyPASE:用于大音频语言模型的参数高效语音情感微调框架的双曲几何方法

Tian Jin, Ruikang Zhang, Zefeng Zhao, Ding Luo, Jin Zeng

机构 * Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

AI总结 本文提出HyPASE双曲PEFT框架,利用庞加莱球模型及HGA、EMCA组件,在MELD、IEMOCAP等数据集上优于欧氏PEFT基线,实现高效的大音频语言模型语音情感微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04206 2026-08-06 cs.LG 新提交

From Non-Convex Self-Concordant Regularization to Scalable Quasi-Newton Training of PINNs

从非凸自协调正则化到物理信息神经网络的可扩展拟牛顿训练

Chenhao Si, Kang An, Shiqian Ma, Ming Yan

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Rice University(莱斯大学)

AI总结 针对PINN训练中残差目标曲率不稳定的问题,提出SCORE方法,结合自协调正则化与拟牛顿优化,在四类偏微分方程上取得比BFGS等基线更低的误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02603 2026-08-04 cs.CV 新提交

WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

WorldExam:从表观外观到内在反应性对世界模型进行基准测试

Yuxue Yang, Shuyao Shang, Jiahe Wang, Zitong Zhou, Liang Tan, Junhan Zeng, Ruizhi Li, Junyan Li, Yu Liu, Xiao Yang, Yong Li, Jun Zhu, Hongsheng Li, Tieniu Tan, Lue Fan, Zhaoxiang Zhang

机构 * CASIA(中国科学院自动化研究所) SLAI(智能科学与技术实验室) CUHK(香港中文大学) AMAP(中国农业科学院) THU(清华大学)

AI总结 该研究推出WorldExam基准,评估20个模型在视觉质量等四层级的表现,发现不同驱动模型能力有明显分化,无模型兼具广泛任务覆盖与稳定性能,高视觉质量不代表内在反应性强。

Comments Project Website: https://WorldExam.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02016 2026-08-04 cs.CV 新提交

Beyond Global Latents: Chunk-Based Sparse Grid VAE for Scalable 3D Modeling

超越全局隐变量:面向可扩展3D建模的基于块的稀疏网格变分自编码器

Kaiyi Zhang, Zhihao Liang, Haolin Liu, Qingxiang Lin, Zeqiang Lai, Yunfei Zhao, Bowen Zhang, Xianghui Yang, Zibo Zhao, Chunchao Guo, Long Quan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学)

AI总结 该研究针对稀疏体素网格内存随分辨率快速增长的问题,提出基于块的ChunkVAE,通过局部算子和互补数据算子实现可扩展3D建模,在多基准测试中性能优于或相当基线,且内存与推理效率更优。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01985 2026-08-04 cs.CV 新提交

DiffPrune: differentiable information throttling for token pruning in vision-language models

DiffPrune:用于视觉-语言模型中 token 剪枝的可微信息节流方法

Landi He, Mingde Yao, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) CUHK MMLab, CPII under InnoHK(香港中文大学MMLab,InnoHK下属CPII)

AI总结 DiffPrune 是一种用于视觉-语言模型的可微 token 剪枝方法,通过信息节流器避免松弛选择的不稳定性,在保留 96.5% 准确率的同时实现 2.85 倍 LLM 预填充加速,推理开销仅 0.69 毫秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01684 2026-08-04 cs.AI 新提交

GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks

GABench:用于评估大语言模型智能体图分析任务的综合基准

Jiarui Tan, Zhongjian Zhang, YaBo Guo, Jiawei Liu, Yujie Xing, Muhan Zhang, Cheng Yang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

AI总结 本文提出GABench这一综合基准,涵盖多类图类型与任务及84个可执行工具,构建10400个带可验证答案的任务,评估前沿LLM及智能体框架,发现现有智能体应对复杂图任务仍存局限等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01678 2026-08-04 cs.LG cs.CL 新提交

Progressive Agent Skill Generation via Reinforcement Learning

基于强化学习的智能体技能渐进式生成

Junhao Shen, Zhanqiu Zhang, Yiwen Guo, Hong Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) LIGHTSPEED(光速公司)

AI总结 该研究针对现有技能生成方法的缺陷,提出基于强化学习的Skill-α方法,将技能生成为序列编辑过程并引入回退奖励,在CL-Bench和tau2-bench上均显著提升了下游任务成功率。

Comments Code is available at https://github.com/ejhshen/skill-alpha

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01676 2026-08-04 cs.CL cs.LG 新提交

Understanding Sparse Attention Selectivity in Long-Context Foundation Models via Counterfactual Evaluation

通过反事实评估理解长上下文基础模型中的稀疏注意力选择性

Xingyu Ren, Youran Sun, Chugang Yi, Haizhao Yang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Maryland(马里兰大学)

AI总结 该研究通过反事实评估探究长上下文基础模型的稀疏注意力选择性,证实稀疏化会改变内容影响力,提出开放测量框架,相关结果无法通过聚合准确率检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01565 2026-08-04 cs.CL 新提交

DocNavRAG: Document-Structured Graph RAG with Stateful Evidence Construction for Complex Document Question Answering

DocNavRAG:面向复杂文档问答的、具有状态化证据构建能力的文档结构化图RAG

Dongyang Xie, Yao Tian, Hao Zhang, Yifei Yuan, Tieyun Qian, Ming Zhong, Jiawei Jiang, Yuanyuan Zhu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 本文提出DocNavRAG,将文档结构组织为可导航图并维护证据状态,在四个文档QA基准上,相比最强基线平均提升答案质量7.8%、上下文充分性17.7%。

Comments 19 pages, 5 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01130 2026-08-04 cs.LG 新提交

When Do Surrogate Updates Improve Decisions? A Local Theory of Trajectory-Wise Transfer

替代更新何时能改进决策?轨迹式迁移的局部理论

Yuyang Shen

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 该研究提出轨迹式迁移的局部理论,探究替代更新改进决策的条件,推导相关梯度、校准等理论结果,通过网格世界和LLM后训练实验验证结论。

Comments 22 pages in total, including references and appendices; 3 composite figures (9 panels) and 4 tables. Code is available at https://github.com/Ethan-Shen-Individual-Lab/surrogate-to-decision-transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00800 2026-08-04 cs.CV 新提交

AIMold: An Autonomous AI-based Pipeline for Complex Mold Design

AIMold:一种用于复杂模具设计的自主AI驱动流水线

Pengyun Qiu, Shuo Wang, Zeyuan Chen, Yihao Zhi, Chongjie Ye, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) FNii-Shenzhen(深圳未来网络研究院)

AI总结 研究针对复杂模具设计依赖专家知识、缺乏公开数据集的问题,推出含超2.3万个模型的MoldCAD数据集,提出AI流水线实现模具设计自动化,助力制造感知型CAD生成。

Comments Accepted to ECCV 2026. Code is available at https://github.com/tb2-sy/AIMold

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00721 2026-08-04 cs.RO 新提交

OmniAI: A Surface-Adaptive Aerial Projection Interface for Human--Drone Interaction

OmniAI:一种面向人机交互的表面自适应空中投影界面

Nikita Kuzmin, Yuhua Jin, Georgii Demianchuk, Mariya Lezina, Fawad Mehboob, Ivan Valuev, Nikolai Lutsenko, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院)

AI总结 OmniAI是一种具现化空中智能体,通过自适应投影实现人机交互,采用RGB-D与RANSAC检测投影表面,支持语音、手势控制,为情境感知人机交互提供移动空间AR界面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00415 2026-08-04 cs.CV cs.AI 新提交

Boosting Generalizable Depth Estimation in Endoscopy by Mixture of Lightweight Experts and Intrinsic Image Alignment

基于轻量级专家混合与本征图像对齐的内窥镜可泛化深度估计增强方法

Liangjing Shao, Beilei Cui, Yiming Huang, Changjing Liu, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出自监督框架EndoMINI,结合低秩专家混合与本征图像对齐,在多内窥镜数据集上实现了更优的可泛化深度估计性能。

Comments Accepted by MICCAI 2026 @ The Efficient Medical AI (EMA4MICCAI) Workshop (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01069 2026-08-04 cs.LG math.PR stat.ML 新提交

Characterizing Bias in Post-Bandit Inference under Index Algorithms

索引算法下后-bandit推理中的偏差表征

Lisu Wang, Yilun Chen, Jiaqi Lu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Management and Economics, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)经管学院)

AI总结 该研究针对UCB1等稳定索引算法,推导后-bandit推理中样本均值偏差和Z统计量的精确表达式,揭示了有效探索率这一偏差起源,发现索引函数选择存在遗憾-偏差权衡,采用新颖经验流体近似开展分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29627 2026-08-03 cs.CV 新提交

FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control

FlexComposer:支持灵活轨迹控制的从图像到动态素材的统一视频合成框架

Songchun Zhang, Sitong Guo, Xianghao Kong, Pengwei Liu, Yuwei Guo, Lvmin Zhang, Anyi Rao

机构 * HKUST(香港科技大学) ZJU(浙江大学) CUHK(香港中文大学) Stanford University(斯坦福大学)

AI总结 FlexComposer是支持灵活轨迹控制的统一视频合成框架,通过三项关键设计实现静态图像与动态素材的无缝整合,在视觉质量等指标上优于现有SOTA方法。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29256 2026-08-03 cs.LG 新提交

UniPolymer: A Unified Framework for Property Prediction, Structure Recommendation, and Evaluation in Polyimide Design

UniPolymer:聚酰亚胺设计中用于属性预测、结构推荐与评估的统一框架

Junquan Hu, Zhihui Wang, Peng Xu, Xinru Guo, Xintong Li, Kun Lu, Ben Fei

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 UniPolymer是聚酰亚胺设计的统一框架,通过建立结构-属性映射、生成候选并评估排序,提升了属性预测与候选评估性能,减少了高成本实验的候选数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29209 2026-08-03 cs.LG cs.AI 新提交

SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

SAF-OPD:面向策略内蒸馏的稳定优势融合

Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu, Siyu Zhang, Dongsheng Ma, Rongxiang Weng, Xunliang Cai, Yun Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Meituan(美团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

AI总结 该研究提出SAF框架解决RLVR与OPD固定系数融合的熵崩溃问题,通过四阶段机制优化优势融合,在7个推理与代码生成基准上提升模型性能与训练稳定性。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29078 2026-08-03 cs.LG 新提交

DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation

DASH-OPD:面向在线策略蒸馏的带滞后性的差异感知切换算法

Yuchen Xia, Qianguo Sun, Chao Song, Junlong Wu, Yiyan Qi, Yunjian Xu

机构 * The Chinese University of Hong Kong(香港中文大学) IDEA Research(IDEA研究院) Emdoor Research Institute(亿道研究院)

AI总结 本文针对在线策略蒸馏中执行器切换的问题,提出带滞后性的差异感知切换算法 DASH-OPD,经 ALFWorld 验证,其性能优于所有基线,训练与部署效率更优,相关代码等后续将发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29593 2026-08-03 cs.LG math.OC 新提交

Convergence and Regret of the Policy Gradient for Multi-Armed Bandits in Diffusion Environment

扩散环境中多臂老虎机的策略梯度算法:收敛性与悔憾分析

Yanwei Jia, Du Ouyang

机构 * The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 本文针对扩散环境中多臂老虎机的策略梯度算法,证明其收敛性并推导O(log T)阶悔憾上界,改进了现有分析且可推广至离散时间算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28595 2026-07-31 cs.CV 新提交

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Beacon:智能体何时及如何执行智能体视觉推理

Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

机构 * Peking University(北京大学) Kling Team(Kling团队) HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZJU(浙江大学) THU(清华大学)

AI总结 本研究针对现有智能体视觉推理模型模式适应性有限、工具增益被损害抵消的问题,提出Beacon模型,通过强化学习相关机制提升性能与适应性,在多基准上表现优异。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28590 2026-07-31 cs.CV cs.CL 新提交

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

VAD:为多模态在线策略蒸馏中的目标重建归因视觉证据

Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao, Jianghao Lin, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Southeast University(东南大学)

AI总结 该研究提出视觉归因蒸馏(VAD)算法,通过反事实目标重建分离教师校正中的视觉证据分量,在6个4B/9B规模的细粒度视觉基准上,性能优于现有蒸馏方法。

Comments The project is accessible at https://github.com/DeepExperience/VAD_Multimodal_OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28487 2026-07-31 cs.CV 新提交

AuricularWorld: Hierarchical Action-Guided World Modeling for Fine-Grained Auricular Structure Segmentation from CT Scans

AuricularWorld:用于CT扫描中耳部结构细粒度分割的分层动作引导世界建模

Jingwen Yang, Senmao Wang, Luoyao Kang, Runmeng Cui, Keying Zhang, Yunjia Bao, Haifan Gong, Lin Lin, Haiyue Jiang

机构 * Plastic Surgery Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(中国医学科学院北京协和医学院整形外科医院) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

AI总结 该研究针对CT耳部细粒度分割难题,提出分层动作引导的AuricularWorld世界建模框架,通过迭代解剖学推理提升分割精度,使HD95降低超43%,验证了潜在世界模型推理的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏