arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2388
2607.20628 2026-07-24 cs.CV cs.AI 新提交

RealVDeblur: One-Step Diffusion for Generalizable Real-World Video Deblurring

RealVDeblur:用于通用真实世界视频去模糊的一步扩散法

Renbiao Jin, Mingxin Yang, Yutian Chen, Junhao Zhuang, Xin Cai, Mulin Yu, Linning Xu, Wenxian Yu, Danping Zou, Shi Guo, Tianfan Xue

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多媒体实验室) CPII under InnoHK(创新香港研究院下的CPII) Tsinghua University(清华大学)

AI总结 针对真实世界视频去模糊难题,提出RealVDeblur框架。构建模糊合成管道提供数据,利用视频扩散先验恢复,采用逐帧编码并简化采样为一步生成器,还有时间窗口掩码稳定推理,在多方面表现出色且提升3D重建鲁棒性。

Comments Project page with code: https://rbjin.github.io/RealVDeblur/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17639 2026-07-24 cs.LG 版本更新

PreMoE: Proactive Inference for Efficient Mixture-of-Experts

PreMoE:面向高效混合专家的主动推理

Zehua Pei, Ying Zhang, Hui-Ling Zhen, Tao Yuan, Xianzhi Yu, Zhenhua Dong, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 PreMoE通过主动编译稀疏混合专家变体,在无需重新训练的情况下生成领域感知的专家排名,实现高达50%的稀疏度,同时保持性能。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11838 2026-07-24 cs.CL q-fin.GN 版本更新

DatedGPT: Preventing Lookahead Bias in Large Language Models with Time-Aware Pretraining

DatedGPT:通过时间感知预训练防止大语言模型中的前瞻性偏差

Yutong Yan, Raphael Tang, Zhenyu Gao, Wenxi Jiang, Yao Lu

机构 * Department of Finance, CUHK Business School, The Chinese University of Hong Kong(香港中文大学商学院金融系,香港中文大学) Centre for Artificial Intelligence, University College London(伦敦大学学院人工智能中心)

AI总结 DatedGPT通过时间感知预训练和指令微调,防止大语言模型中的前瞻性偏差,确保模型知识受限于数据截止年份,并在基准测试中表现出竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05502 2026-07-24 cs.CV cs.AI cs.CL 版本更新

MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs

MELLA:弥合低资源语言多模态大语言模型的语言能力与文化根基

Yufei Gao, Jiaying Fei, Nuo Chen, Ruirui Chen, Guohang Yan, Yunshi Lan, Botian Shi

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(东华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Institute of High Performance Computing, A*STAR(高性能计算研究所,A*STAR)

AI总结 研究针对低资源语言MLLMs文化内涵不足问题,提出MELLA数据集,采用双源策略,结合母语网络图像-替代文本对与生成翻译的图像描述进行监督,经实验表明能减轻文化幻觉,强调数据对齐对低资源语言文化基础多模态理解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19810 2026-07-23 cs.SD 新提交

SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision

SimulS2ST-Omni:通过显式轨迹监督实现数据高效的流式语音到语音翻译

Rongshen He, Xinyu Liang, Dekun Chen, Jiaqi Li, Mingjie Chen, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究长格式流式语音到语音翻译,提出仅用约2000小时配对数据的训练方法,核心是联合文本-代码轨迹监督,双流分解减轻干扰,在质量-延迟权衡上表现出色,与先进闭源系统相当。

Comments 29 pages, 19 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14047 2026-07-23 cs.RO cs.HC cs.SY eess.SY 版本更新

Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment

PhysClaw-0:一种通过语言修正实现机器人自主的共生智能体系统

Boyuan Wang, Zhenyuan Zhang, Zhiqin Yang, Peijun Gu, Shuya Wang, Xiaofeng Wang, Xianghui Ze, Yifan Chang, Guosheng Zhao, Jiangnan Shao, Guan Huang, Hengyu Liu, Yonggang Zhang, Wei Xue, Chunyuan Guan, Chenglin Pu, Yike Guo, Xingang Wang, Zheng Zhu

机构 * GigaAI(字节跳动人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong University of Science and Technology(香港科技大学) University of Leeds(利兹大学) Cornell University(康奈尔大学) Tsinghua University(清华大学) Nanjing University of Science and Technology(南京理工大学) The Chinese University of Hong Kong(香港中文大学) FAWTD(一汽技术开发部)

AI总结 研究针对自主数据收集问题,提出PhysClaw-0共生智能体系统,通过跨轮保留和重用修正、自主收集验证等方式,在真实机器人测试中减少人力时间,提高成功率,并提升验证者与人类一致性。

Comments WebPage: https://open-gigaai.github.io/Zero2Skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27355 2026-07-23 cs.RO 版本更新

RouterVLA: Budgeted Commissioning and Expert Onboarding for Growing VLA Pools

RouterVLA:将冒烟测试转化为异构VLA选择的监督信号

Xingyu Ren, Chugang Yi, Youran Sun

机构 * The Chinese University of Hong Kong(香港中文大学) University of Maryland, College Park(马里兰大学 College Park 分校) Tsinghua University(清华大学)

AI总结 提出RouterVLA方法,利用预部署评估的冒烟测试记录来监督异构VLA策略的选择,通过结果分离的交叉拟合和透明规则,在LIBERO-Plus数据集上将保留集成功率提升14.64个百分点。

Comments v2: revised title, updated author list, restructured the experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18979 2026-07-22 cs.AI 新提交

Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning

揪出搭便车者:基于夏普利值的强化学习并行推理奖励归因

Wentao Zhang, Haoyu Zhang, Xinke Jiang, Yuxuan Cheng, Yuhan Pan, Miao Li, Zhipeng Qiao, Tao Feng, Zhen Tao, Dengji Zhao

机构 * ShanghaiTech University(上海科技大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学)

AI总结 研究大型语言模型多步推理中并行推理路径贡献难区分问题,提出基于夏普利值的强化学习框架并行夏普利值方法,通过量化边际贡献等实现按比例分配奖励,实验证明其优于基线且能改进多路径推理。

Comments 19 pages, 4 figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18910 2026-07-22 cs.LG 新提交

Breaking Feedback-Blindness: Utility-Augmented Transformer for Sequential Decision Making

打破反馈盲目性:用于序列决策的效用增强Transformer

Yuyang Shen, Shan Dai, Daimin Chen

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) University of International Business and Economics(对外经济贸易大学)

AI总结 研究非平稳和部分可观测环境下序列决策问题,提出效用增强Transformer(UAT),通过紧凑效用状态调制注意力检索,解决现有模型反馈盲目性问题,在四个非平稳基准测试中性能优于其他基线。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18724 2026-07-22 cs.AI 新提交

One Rewrite to Fix Them All? Type-Aware Repair Allocation for Text-to-Image Prompt Optimization

一劳永逸?用于文本到图像提示优化的类型感知修复分配

Haoyue Liu, Xiaoyu Ma, Ye Chen, Shuguang Cui, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) XJTU-POLIMI Joint School, Xi’an Jiaotong University(西安交通大学-米兰理工大学联合学院) Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)

AI总结 研究文本到图像提示优化问题,提出将语义提示优化制定为原子修复分配的方法,在无需训练的TARA框架中实例化,实验表明该方法在多个基准生成器单元中语义准确性最佳,且运行快、图像质量好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18252 2026-07-22 cs.AI cs.NE 新提交

MILP-Evo: Closed-Loop Fully Automatic Design of MILP Solvers

MILP-Evo:混合整数线性规划求解器的闭环全自动设计

Jinbiao Nie, Kewei Feng, Xiaoyuan Zhang, Shan Yin, Zizhuo Wang, Bin Dong

机构 * BUPT(北京邮电大学) BZA(未提及具体中文名,推测可能是某个机构简称) BIT(北京理工大学) CUHK-Shenzhen(香港中文大学(深圳)) PKU(北京大学)

AI总结 研究能否将MILP求解器逻辑自动设计为LLM引导的闭环搜索,提出闭环程序演化框架,通过PySCIPOpt实现,在割集选择器和分支规则联合设计上实例化,输出可检查修改部署的组件,在多基准测试中发现有竞争力的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16577 2026-07-22 cs.CV cs.GR 版本更新

CNS-Edit++: Category-Agnostic 3D Editing with Coupled Neural Shape Representation

CNS-Edit++:基于耦合神经形状表示的类别无关3D编辑

Jingyu Hu, Weilong Yan, Zhengzhe Liu, Haipeng Li, Ka-Hei Hui, Hao Zhang, Chi-Wing Fu

机构 * The Chinese University of Hong Kong(香港中文大学) Lingnan University(岭南大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) Autodesk AI Lab(欧特克人工智能实验室) Simon Fraser University(西蒙弗雷泽大学)

AI总结 研究提出基于耦合神经形状表示和神经特征体积优化的潜在空间3D形状编辑框架CNS-Edit++,能在特定类别和类别无关模型上实例化,有多种编辑操作符及区域控制机制,经评估其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08686 2026-07-22 cs.LG cs.AI 版本更新

CompilerKV: Risk-Adaptive KV Compression via Offline Experience Compilation

CompilerKV: 通过离线经验编译实现风险适应性的键值压缩

Ning Yang, Chengzhi Wang, Yibo Liu, Baoliang Tian, Haijun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ByteDance(字节跳动) University of Science and Technology Beijing(北京科技大学)

AI总结 本文提出CompilerKV,一种通过离线经验编译实现风险适应性的键值压缩方法,通过离线编译校准语料库中的纠正表,将在线纠正减少到O(1)查找加预算限制,从而在多个模型架构上实现了压缩SOTA,并在不同压力条件下保持最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25699 2026-07-22 cs.CV 版本更新

AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning

AIM-CoT:基于主动信息的多模态链式推理用于视觉-语言推理

Xiping Li, Jianghong Ma

机构 * The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出AIM-CoT框架,通过上下文增强注意力图生成、主动视觉探测和动态注意力转移触发,改进视觉语言模型的证据选择与插入触发,提升视觉-语言推理性能。

Comments Accepted by ACL 2026 Main Conference. 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05845 2026-07-22 cs.GT cs.LG 版本更新

JD-BP: A Joint-Decision Generative Framework for Auto-Bidding and Pricing

JD-BP:一种联合决策生成框架用于自动出价和定价

Linghui Meng, Chun Gan, Shengsheng Niu, Chengcheng Zhang, Chenchen Li, Chuan Yang, Yi Mao, Xin Zhu, Jie He, Zhangang Lin, Ching Law

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出JD-BP框架,通过联合生成出价和定价修正项,提升自动出价和定价效率,并通过轨迹增强算法和能量基直接偏好优化方法提升性能,实验表明其在广告收入和目标成本方面有显著提升。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18537 2026-07-22 cs.RO cs.AI 版本更新

SKETCH: Semantic Key-Point Conditioning for Long-Horizon Vessel Trajectory Prediction

SKETCH: 面向长时域船舶轨迹预测的语义关键点条件建模

Linyong Gan, Zimo Li, Wenxin Xu, Xingjian Li, Jianhua Z. Huang, Enmei Tu, Shuhang Chen

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)数据科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) COSCO SHIPPING Advanced Technology Institute, Shanghai, China(中远海运技术研究院)

AI总结 针对长时域轨迹预测中方向漂移问题,提出基于语义关键点(NKP)的条件轨迹建模框架,将预测分解为全局语义决策与局部运动建模,采用预训练-微调策略估计NKP先验,在真实AIS数据上显著提升长时域、方向精度和细粒度预测性能。

Comments Final Camera-Ready Version. Accepted by ICML 2026 (PMLR Vol. 306)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18934 2026-07-22 cs.LG cs.AI cs.IR cs.SI 版本更新

Chi-Square Wavelet Graph Neural Networks for Heterogeneous Graph Anomaly Detection

用于异构图异常检测的卡方小波图神经网络

Xiping Li, Xiangyu Dong, Xingyi Zhang, Kun Xie, Yuanhao Feng, Bo Wang, Guilin Li, Wuxiong Zeng, Xiujun Shu, Sibo Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Tencent, WeChat Pay(腾讯、微信支付)

AI总结 针对异构图异常检测面临的挑战,提出基于卡方滤波器的光谱GNN框架ChiGAD,包含多图卡方滤波器、交互式元图卷积和贡献知情交叉熵损失,实验表明其在多指标上优于现有模型,同构变体ChiGNN也表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17766 2026-07-21 cs.CL 新提交

When to Use Extra Context: Evidence-Grounded Terminology Adaptation for Simultaneous Speech Translation

何时使用额外上下文:基于证据的术语适应在同步语音翻译中的应用

Zeyu Yang, Satoshi Nakamura

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究同步语音翻译中额外上下文的使用,提出基于证据的术语适应框架EGTA,通过构建术语记忆、选择候选术语来调整决策空间,无需全模型微调,在多个指标上有提升,改进与特定论文证据对齐有关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17095 2026-07-21 cs.AI 新提交

Fourier Geometric Wind Power Forecasting with Numerical Weather Prediction

基于数值天气预报的傅里叶几何风力发电预测

Shiyuan Piao, Fan Zehui, Yang Liu, Hong Cheng, Juepeng Zheng, Jie Zhou, Fugee Tsung

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Goldwind Science and Technology Co.,Ltd(金风科技股份有限公司)

AI总结 研究针对风力发电预测难题,提出多模态框架,整合SCADA数据与NWP预测。先分解输入特征,再用几何编码器和傅里叶神经算子建模,实验表明该模型优于现有基线,凸显基于物理设计的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16859 2026-07-21 cs.CV 新提交

Dataset Distillation by Influence Matching

通过影响匹配进行数据集蒸馏

Haoru Tan, Wang Wang, Sitong Wu, Xiuzhe Wu, Yangtian Sun, Chirui Chang, Shaofeng Zhang, Xiaojuan Qi

机构 * HKU(香港大学) CUHK(香港中文大学) Stanford(斯坦福大学)

AI总结 从结果角度重审数据集蒸馏,提出影响匹配方法,通过可微估计器量化参数变化,学习合成集使影响与真实数据集匹配,在分类和视觉语言蒸馏任务中表现出色,超越基线。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16657 2026-07-21 cs.SD 新提交

HARP: Harmonic-Aware Residual Partitioning for Neural Audio Codecs

HARP:用于神经音频编解码器的谐波感知残差划分

Qiaoyu Yang, Lixing He, Binyue Deng, Weifeng Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) The Chinese University of Hong Kong(香港中文大学) Tencent Music Entertainment(腾讯音乐娱乐集团)

AI总结 研究针对神经音频编解码器中码本频谱纠缠等问题,提出HARP训练策略,将RVQ阶段分组,在解码器能访问低频时各小组细化目标频带,重建泛音保留连贯性,该策略无需架构改变,性能优于标准RVQ和并行分解。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16599 2026-07-21 cs.SD cs.MM eess.AS 新提交

Is One Score Enough? Assessing Singing Quality of Songs with Temporal Score Curves

一个分数够吗?用时间分数曲线评估歌曲的演唱质量

Yishan Lv, Jing Luo, Xinyu Yang, Zhizheng Wu

机构 * Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究针对全长歌曲演唱质量评估难题,提出SongSQA两阶段框架。第一阶段用伪标签训练段分数预测器,第二阶段聚合器整合特征与分数生成嵌入并捕捉联系,有效提升评估效果,在KTAU上相对提高13.95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16427 2026-07-21 cs.CL 新提交

Multi-level context Modeling for consistent expert selection in Mixture-of-Experts

用于混合专家模型中一致专家选择的多层次上下文建模

Shuhan Huang, Naifan Zhang, Yuanbo Tang, Yang Li, Wai Kin Victor Chan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of AI, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)人工智能学院)

AI总结 研究混合专家模型中专家选择问题,提出多层次上下文融合MoE框架,通过整合跨层语义聚合和局部令牌级交互信号构建上下文感知表示,提升路由一致性和下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16401 2026-07-21 cs.CV 新提交

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

Apple-$π$:基于视频对基于法律的物理智能进行思维基准测试

Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao, Weichen Fan, Ziqi Huang, Yuhao Dong, Hao Li, Zhaoxi Chen, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) The Chinese University of Hong Kong(香港中文大学)

AI总结 研究针对视频模型评估仅看输出层面的不足,提出Apple-PI基准,含数据集、协议和评估套件三部分,通过对11个模型测试发现其距可靠世界模拟器差距大,并揭示了一些瓶颈与差距,为指导视频模型发展提供诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16295 2026-07-21 cs.CV cs.AI 新提交

Emergent Hierarchical Monosemantic Neurons from the Group-Contrastive Forward-Forward Algorithm

基于群对比前向算法的涌现分层单语义神经元

Yiming Tang, Qinglin Qi, Zhaoqian Yao, Harshvardhan Saini, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学) Lund University(隆德大学) Chinese University of Hong Kong(香港中文大学) Indian Institute of Technology, Dhanbad(印度理工学院(丹巴德分校))

AI总结 研究探讨神经网络表示的可解释性,针对稀疏字典学习范式的局限,提出群对比前向算法GCFF,通过架构约束实现单语义性,能捕捉非线性概念,在CLIP表示上表现良好,还能从头训练网络并在图像分类基准中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30362 2026-07-21 cs.RO cs.AI cs.CV 版本更新

ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control

ReactiveBFM:面向通用人形全身控制的反应式闭环运动规划

Xiao Chen, Weishuai Zeng, Xiaojie Niu, Zirui Wang, Jianan Li, Huayi Wang, Furui Xu, Jiahe Chen, Weixiang Zhong, Lihe Ding, Kailin Li, Jiangmiao Pang, Tai Wang, Tianfan Xue, Jingbo Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 提出ReactiveBFM,一种实时闭环规划控制框架,通过调度前缀采样课程和异步重规划机制,解决生成式运动规划器与高频跟踪之间的延迟不匹配和暴露偏差问题,实现人形机器人全身协调和零样本反应式运动。

Comments Project page: https://xiao-chen.tech/reactivebfm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19341 2026-07-21 cs.CV cs.CL cs.SD 版本更新

Native Active Perception as Reasoning for Omni-Modal Understanding

原生主动感知作为全模态理解的推理

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu, Junyang Lin, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。

Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09249 2026-07-21 cs.CV 版本更新

DECIS: Dual-Evidence Corrective Verification for Interpretable Strabismus Diagnostic Decision-Making

MAGIS:基于证据的多智能体推理用于可解释的斜视临床决策

Xikai Tang, Yifan Wang, Jiafan Zhuang, Li Luo, Jinming Guo, Xiaoling Xie, Jiacheng Liu, Peiwei Wei, Lihao Zhong, Xiaoli Kang, Jie Cen, Guangqiang Yin, Kunliang Qiu, Ce Zheng, Zhun Fan

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院) Joint Shantou International Eye Center of Shantou University and The Chinese University of Hong Kong(汕头大学·香港中文大学联合汕头国际眼科中心) School of Artificial Intelligence, Guangzhou City Polytechnic(广州城市职业学院人工智能学院) Medical College, Shantou University(汕头大学医学院) College of Engineering, Shantou University(汕头大学工学院) Department of Ophthalmology, Xinhua Hospital Affiliated to Shanghai Jiaotong University School of Medicine(上海交通大学医学院附属新华医院眼科) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出MAGIS框架,通过多智能体协作、双重证据约束上下文和基于证据的纠正验证机制,将斜视诊断从黑箱生成转变为结构化推理,在细粒度斜视基准上将加权F1分数从72.0%提升至91.3%,并显著提高诊断报告的临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01608 2026-07-21 cs.AI 版本更新

From Multi-Agent to Single-Agent: When Is Skill Distillation Beneficial?

从多智能体到单智能体:技能蒸馏何时有益?

Binyan Xu, Dong Fang, Haitao Li, Kehuan Zhang

机构 * The Chinese University of Hong Kong(香港中文大学) LIGHTSPEED

AI总结 研究探讨了技能蒸馏在多智能体系统到单智能体系统转换中的有效性,提出通过评估指标的拓扑刚性预测技能效用,并引入AdaSkill框架实现自适应蒸馏。

Comments 36 pages, 15 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27752 2026-07-21 cs.CL cs.SE 版本更新

Retromorphic Testing with Hierarchical Verification for Hallucination Detection in RAG

基于分层验证的反向测试用于RAG中的幻觉检测

Boxi Yu, Yuzhong Zhang, Liting Lin, Lionel Briand, Emir Muñoz

机构 * Lero, the Research Ireland Centre for Software, University of Limerick(Lero,爱尔兰科学基金会软件研究中心,利默里克大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Ottawa(渥太华大学)

AI总结 本文提出RT4CHART框架,通过分层验证提升RAG中上下文忠实度评估的准确性,实现细粒度审计,并在新标注基准上取得最佳检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏