arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Huazhong University of Science and Technology(华中科技大学)

共收录 94
2607.14684 2026-07-17 cs.CV 新提交

GlobalForge: Towards Robust AI-Generated Image Detection

GlobalForge:迈向强大的人工智能生成图像检测

Manni Cui, Ruiqi Liu, Dianyuan Zou, Ziheng Qin, Jingrui Xu, ZiAn Wang, Jianglan Wei, Han Zhou, Yu Liu, Yan Wang, Shu Wu

机构 * Huazhong University of Science and Technology(华中科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Jilin University(吉林大学) Tsinghua University(清华大学)

AI总结 研究针对AI生成图像检测器在现实世界通道传播后性能下降问题,提出GlobalForge框架,通过局部信息瓶颈和全局结构推理模块,基于退化对比结构损失联合训练,提升了检测器在多种基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-07-16 cs.CV 新提交

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13940 2026-07-16 cs.AI 新提交

A Self-Evolving Agent for Longitudinal Personal Health Management

一种用于纵向个人健康管理的自我进化智能体

Haoran Li, Jiebi Deng, Tong Jin, Jinghong Han, Yuxin Wang, Zexin Wang, Qingyi Si, Weikang Gong, Xiahai Zhuang, Jia You, Wei Cheng, Jianfeng Feng, Hongcheng Guo

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) School of Life Sciences, Beijing University of Chinese Medicine(北京中医药大学生命科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) JD.com, Inc.(京东公司) Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, Fudan University, Ministry of Education(复旦大学计算神经科学与类脑智能教育部重点实验室) Department of Neurology, Huashan Hospital, Fudan University(复旦大学附属华山医院神经内科)

AI总结 研究针对多数健康AI系统孤立处理请求的问题,开发开源智能体架构HealthClaw,通过自我进化更新支持,经合成基准和生物医学任务评估,在准确率、隐私性及任务指标增益上表现出色,支持纵向个人健康智能体的自我进化记忆。

Comments 20 pages, 4 figures, 6 supplementary tables. Code: https://github.com/HC-Guo/HealthClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11562 2026-07-14 cs.CV 新提交

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

MonkeyOCRv2:用于文档人工智能的视觉-文本基础模型

Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Kingsoft Office(金山办公软件)

AI总结 研究针对主流视觉编码器难以应用于文档图像的问题,提出MonkeyOCRv2模型。通过构建大型文档图像预训练语料库及采用联合预训练策略,在多个文档分析任务中提升性能,并验证其作为视觉编码器在文档解析和理解任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11347 2026-07-14 cs.AI 新提交

From Neural Network Decisions to Training Cases: An Exact Account via Case-Based Decision Theory

从神经网络决策到训练案例:基于案例决策理论的精确阐述

Manli Yan, Yuebin Lin, Yaowen Yu, Yong Zhao

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 研究神经网络决策,基于案例决策理论,通过OLS行动读出的精确案例分解,能追溯分数到训练案例、衡量行动一致性等,在多任务中恢复案例级偏好结构,实现高一致性且审计简单,探测器保真度由分数重建衡量。

Comments Preprint. 15 pages, 9 figures, 4 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11233 2026-07-14 cs.CV 新提交

Structure-Detail Decoupled Autoregressive Generation for Fast and High-Fidelity Virtual Try-On

用于快速和高保真虚拟试穿的结构-细节解耦自回归生成

Lu Yang, Xiaonan Hu, Yanan Li, Daqi Liu, Xiang Bai, Hao Lu

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan Institute of Technology(武汉工程大学) Xiaomi EV(小米汽车)

AI总结 研究虚拟试穿问题,提出STAR-VTON框架,通过解耦潜在空间结构合成与像素空间细节恢复,结合匹配信息细化器,实现高效高保真虚拟试穿,其中VAR-VTON效率高,像素空间细化器能有效恢复细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11166 2026-07-14 cs.CL 新提交

Query-Focused Event Summarization: A Dataset and Benchmark

查询聚焦事件摘要:一个数据集和基准

Chenyu Hu, Bang Wang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

AI总结 针对现有查询聚焦摘要(QFS)数据集缺乏面向事件的摘要及方法在大规模语料库表现不佳的问题,提出查询聚焦事件摘要(QFES)任务,构建QFESum数据集,引入含RAT和SHC的两阶段框架,实验证明该框架有效。

Comments 22 pages, 9 figures, and 13 tables. Dataset and code are available at https://github.com/sarcasm-hcy02/QFES-QFESum

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10625 2026-07-14 cs.RO 新提交

Dual-Process Atomic Skill Learning: Decoupling Semantic Reasoning and Real-Time Control

双过程原子技能学习:解耦语义推理与实时控制

Jun Chen, Erdent Bao, Wenlong Dong, Jierui Liu, Qi Cai, Hao Wan, Shaopeng Li, Weijun Qin, Jing Liang, Huiping Zhuang

机构 * University of Electronic Science and Technology of China(电子科技大学) Huazhong University of Science and Technology(华中科技大学) Southern University of Science and Technology(南方科技大学) South China University of Technology(华南理工大学) EbTech Co. Ltd.(依比特科技有限公司)

AI总结 研究针对语言条件模仿学习推广到多步组合任务的挑战,提出双过程原子技能学习框架DASL,通过解耦语义推理与实时控制,含低频和高频策略,有效减轻技能码本干扰问题,性能显著优于现有基线。

Comments 28 pages,20 figures,21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10395 2026-07-14 cs.CV 新提交

Self-supervised Automatic Matting

自监督自动抠图

Xiaonan Hu, Zhiyuan Lu, Jingdong Zhao, Hao Lu

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing Normal University(北京师范大学) Waseda University(早稻田大学)

AI总结 研究能否仅用RGB图像训练自动抠图模型。提出自监督框架SSMatte,将问题分解为语义锚定和细节抠图,通过特定损失生成提示并优化网络。该方法性能优,推动自动抠图进入完全无标注范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10329 2026-07-14 cs.CV 新提交

Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection

用于隐私保护的针对视觉语言模型的不可察觉且可逆的对抗性示例

Qi Lu, Ziqi Zhou, Yufei Song, Zijing Li, Lulu Xue, Minghui Li, Shengshan Hu, Leo Yu Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间安全学院) College of Computer Science, Chongqing University(重庆大学计算机科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

AI总结 研究针对视觉语言模型基于文本的隐私攻击问题,提出CloakDiff框架,结合扩散对抗编辑与可逆网络生成不可察觉的对抗性示例,设计EDM启发式采样提高保真度,实验证明该框架能实现多模态隐私保护且具高视觉质量和可逆性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08772 2026-07-10 cs.CV 新提交

Wat3R: Underwater 3D Geometry Learning without Annotations

Wat3R:无需标注的水下3D几何学习

Jiangwei Ren, Xingyu Jiang, Zijie Song, Wei Xu, Hongkai Lin, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 针对水下3D几何估计难题,提出跨域半监督学习框架Wat3R,基于师生架构,无需标注水下数据,利用未标注视频学习,设计跨视图一致性损失,构建Water3D数据集,实验证明其在水下多视图深度估计和点云重建上性能优于现有方法。

Comments Accepted to ECCV 2026. The dataset and code are available at https://github.com/LSXI7/Wat3R

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08434 2026-07-10 cs.CV 新提交

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

DeltaV:在统一大型多模态模型中通过视觉状态更新进行思考

Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi Inc.(小米公司)

AI总结 研究针对统一大型多模态模型全图像生成范式的问题,提出DeltaV模型,通过视觉更新避免冗余,引入TSIM路由器匹配令牌预算,构建StructCoT数据集,实验证明该范式能减少视觉令牌、提升推理能力,DeltaV - 2B性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08057 2026-07-10 cs.LG cs.AI cs.CL 新提交

Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization

迈向高效大语言模型服务:关于系统感知键值缓存优化的综述

Jiantong Jiang, Peiyu Yang, Rui Zhang, Feng Liu

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

AI总结 该综述聚焦大语言模型服务中系统感知的键值缓存优化,从执行与调度、放置与迁移、表示与保留三个维度回顾相关工作,分析跨行为协同设计及行为与目标联系,为理解和创新键值缓存设计提供基础。

Comments Accepted to ACL 2026 as a Findings paper

Journal ref Findings of the Association for Computational Linguistics: ACL 2026 (pp. 38450-38476)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07855 2026-07-10 cs.LG 新提交

NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL

NFTR:从可证明的模式平均到离线目标条件强化学习中的测地线子目标选择

Erdemt Bao, Xing Lei, Jun Chen

机构 * Huazhong University of Science and Technology(华中科技大学) Xi’an Jiaotong University(西安交通大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 针对分层隐式Q学习在离线目标条件强化学习中存在的问题,提出NFTR方法,用条件归一化流取代高斯策略,结合基于架构三角不等式的三角松弛分数及RWDR目标,可避免高斯坍塌且在随机动力学下保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06442 2026-07-08 cs.RO 新提交

SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

SIEVE:用于基于VLA模型的模仿学习的结构感知数据选择

Changti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen

机构 * East China Normal University(东华师范大学) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Beihang University(北航大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) DeepCybo Training Demonstrations Policy Execution(深科博培训演示政策执行)

AI总结 研究针对VLA模型模仿学习中数据冗余等问题,提出结构感知数据选择方法SIEVE。该方法将演示视为原语和接口组合,通过发现原语、分配预算和选择轨迹来选数据,实验证明其优于基线,能在少数据少步骤下超越全数据训练。

Comments The code is available at \href{https://github.com/ChangtiWu/SIEVE}{SIEVE}

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06374 2026-07-08 cs.CV 新提交

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

花瓶博物馆:古希腊陶器数字智能博物馆

Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室)

AI总结 针对古希腊陶器文化遗产领域中视觉语言模型面临的挑战,提出轻量级模块化多模态智能体框架花瓶博物馆,结合虚拟博物馆与花瓶智能体,经多模态感知等操作,提高引用有效性,减少幻觉并产生更中立答案。

Comments Code: https://github.com/AIGeeksGroup/VaseMuseum. Website: https://aigeeksgroup.github.io/VaseMuseum

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06319 2026-07-08 cs.CV 新提交

Synthetic-to-Real Translation for Class-Agnostic Motion Prediction

用于类别无关运动预测的合成到真实翻译

Yizheng Wu, Hongwei Fan, Kewei Wang, Ruibo Li, Xingyi Li, Xiao Song, Zhe Wang, Chenjing Ding, Dongliang Wang, Zhiguo Cao, Guosheng Lin

机构 * Key Laboratory of Image Processing and Intelligent Control, Ministry of Education, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(图像处理与智能控制教育部重点实验室,华中科技大学人工智能与自动化学院) Nanyang Technological University(南洋理工大学) SenseAuto(未知(保留英文))

AI总结 研究针对运动预测中合成到真实翻译的问题,提出将运动知识翻译框架与目标感知运动预测、目标辅助运动增强两个组件集成的方法,还生成了Motion4D数据集,实验证明该方法有效弥合域差距,在真实场景表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06281 2026-07-08 cs.CV 新提交

Straight-Path Flow Matching for Incomplete Multi-View Clustering

用于不完整多视图聚类的直线路径流匹配

Yiteng Yuan, Junyan Wang, Zheyuan Liu, Hong Jia, Lei Fan, Zhulin Tao, Lianbo Guo

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) University of Auckland(奥克兰大学) University of New South Wales(新南威尔士大学) Communication University of China(中国通信大学)

AI总结 研究不完整多视图聚类问题,提出基于直线路径流匹配的框架,通过线性插值路径用概率流替代扩散,集成视图完成与聚类对齐,实验证明该框架在标准基准上达最优性能。

Comments Accepted to ECCV 2026. 28 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04718 2026-07-07 cs.AI 新提交

FORGE: Research-Trajectory Hijacking Attacks on Deep Research Agents

FORGE:对深度研究智能体的研究轨迹劫持攻击

Yue Pan, Ziheng Zhang, Junxiang Lei, Changhao Jia, Qingyi Si, Hongcheng Guo

机构 * Fudan University(复旦大学) Huazhong University of Science and Technology(华中科技大学) Explore Academy, JD(京东探索研究院)

AI总结 研究针对深度研究智能体,利用其工作流程中的规划层中毒面,提出FORGE两级攻击劫持子任务规划,还引入PRISM指标和Root Query Anchoring防御,展示攻击效果及防御作用。

Comments 20 pages,8 figures,Code available at https://github.com/yvepan/FORGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02234 2026-07-03 cs.AI cs.LG 新提交

Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

纯化OPSD:在不失去思考能力的情况下进行在线自我蒸馏

Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学) Jilin University(吉林大学)

AI总结 针对在线自我蒸馏(OPSD)在长链思维推理模型中失效的问题,通过分解教师监督信号,发现参考诱导成分导致死记硬背,提出基于点互信息的参考隔离方法,在保持模型认知行为的同时提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02063 2026-07-03 cs.LG cs.AI 新提交

SA-HGNN: Sample-Adaptive Hyperbolic Graph Neural Network for EEG-Based Depression Recognition

SA-HGNN: 基于样本自适应双曲图神经网络的脑电图抑郁症识别

Yang Li, Pan Hu, Yan Zhang, Wenfan Yang, Tao Wu, Lianbo Guo

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)

AI总结 提出SA-HGNN模型,通过样本自适应图构建、双曲图卷积和注意力池化模块,准确提取抑郁症脑网络的层次结构,在EEG数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02015 2026-07-03 cs.CV cs.AI 新提交

Mirror Illusion Art

镜像错觉艺术

Xiaopei Zhu, Zeyuan Li, Jun Zhu, Xiaolin Hu

机构 * Department of Computer Science and Technology, BNRist, Tsinghua University(清华大学计算机科学与技术系,北京信息科学与技术国家研究中心) Huazhong University of Science and Technology(华中科技大学) IDG/McGovern Institute for Brain Research, Tsinghua University(清华大学IDG/麦戈文脑科学研究院) Chinese Institute for Brain Research (CIBR)(北京脑科学与类脑研究中心)

AI总结 提出AutoMIA自动设计管道,联合优化形状与颜色,通过四种机制稳定优化并抑制伪影,实现从两张目标图像到可打印3D物体的镜像错觉艺术生成。

Comments CVPR 2026 Highlight, also got an Efficient CVPR award

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01900 2026-07-03 cs.CV 新提交

FoundDP: Revisiting Weak Disparity Observability in Dual-Pixel Depth Estimation

FoundDP:重新审视双像素深度估计中的弱视差可观测性

Fengchen He, Hao Xu, Dayang Zhao, Tingwei Quan, Shaoqun Zeng

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 提出FoundDP框架,结合双像素深度与单目深度基础模型的全局结构先验,通过ViT特征对齐缓解散焦模糊导致的表示退化,在弱视差区域提升结构一致性与度量精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01753 2026-07-03 cs.CV q-bio.QM 新提交

The Turning Point of 3D Plant Phenotyping: 3D Foundation Models Enable Minute-to-Second Cross-Crop Reconstruction and Beyond

3D植物表型分析的转折点:3D基础模型实现分钟到秒级的跨作物重建及更多

Hanyue Jia, Wei Zhou, Wenbo Zhou, Yanan Li, Hao Lu, Tingting Wu

机构 * Northwest A&F University(西北农林科技大学) Huazhong University of Science and Technology(华中科技大学) Wuhan Institute of Technology(武汉工程大学)

AI总结 提出基于3D基础模型的跨作物表型分析框架,用前馈几何恢复替代COLMAP,结合3D高斯泼溅实现少视图重建,将重建时间从6.52分钟降至1.58秒,保持高质量与高精度。

Comments 39 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31654 2026-07-03 cs.RO cs.CV 新提交

DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments

DynFly: 面向城市环境无人机视觉语言导航的动态感知连续轨迹生成

Wen Jiang, Hanfang Liang, Li Wang, Kangyao Huang, Wang Xu, Wei Fan, Jinyuan Liu, Shaoyu Liu, Hongwei Duan, Bin Xu, Xiangyang Ji, Huaping Liu

机构 * Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Xidian University(西安电子科技大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 提出DynFly框架,通过B样条控制点空间表示和Spline-DiT生成器,结合无人机动态感知监督,将高层导航意图转化为连续可执行轨迹,显著提升导航性能和轨迹质量。

Comments 34 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00680 2026-07-02 cs.LG 新提交

Distributed Online Bandit Submodular Maximization with Bounded Sampling Violations

具有有界采样违规的分布式在线赌博机子模最大化

Bin Du, Chang Liu, Dingqi Zhu, Lintao Ye, Dengfeng Sun

机构 * College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化学院) School of Artificial Intelligence and Automation at the Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Aeronautics and Astronautics, Purdue University(普渡大学航空航天学院)

AI总结 针对划分拟阵约束下的分布式在线子模最大化问题,提出统一算法框架,在全信息和赌博机反馈下实现次线性(1-1/e)-遗憾,并通过有界随机管道舍入方案使采样违规概率渐近消失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00060 2026-07-02 cs.CV 新提交

Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence

协同感知-推理治理:用可验证解剖证据为医学多模态大语言模型提供基础

Rui Hao, Qiankun Li, Junyuan Mao, Linghao Meng, Dirui Xie, Dayu Tan, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Imperial Global Singapore, Imperial College London(帝国理工学院新加坡全球中心) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Anhui University(安徽大学)

AI总结 提出一种无需训练的证据注入框架,通过ROI引导的视觉激活调制和解剖坐标语义标记,协同校准视觉感知与文本推理,动态路由任务特定干预,有效减少医学MLLM的幻觉。

Comments Accepted by MICCAI 2026 (Early Accept, Top 9%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22180 2026-07-02 cs.DC cs.LG 新提交

FeLoG: Scalable and Efficient Distributed Graph Embedding with Feedback Loop Mechanism

FeLoG:具有反馈循环机制的可扩展高效分布式图嵌入

Peng Fang, Arijit Khan, Ziqiang Wu, Zhenli Li, Yibo Zhou, Fang Wang, Dan Feng

机构 * Huazhong University of Science and Technology(华中科技大学) Bowling Green State University(伯灵顿州立大学)

AI总结 提出FeLoG系统,通过反馈耦合采样与训练、活动感知通信和轮次交错流水线,实现分布式图嵌入的加速和资源高效利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32009 2026-07-01 cs.RO 新提交

Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments

人类作为人形机器人:通过人类对齐的具身从自我-外部人类视频实现零样本人形机器人学习

Xiaopeng Lin, Ruoqi Yang, Shijie Lian, Zhaolong Shen, Bin Yu, Changti Wu, Haibao Liu, Yuxiang Zhang, Hong Li, Qiyuan Su, Haochen Liu, Xuguo He, Yukun Shi, Cong Huang, Zhirui Zhang, Bojun Cheng, Kai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepCybo ZGCA ZGCI Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学) Beihang University(北京航空航天大学)

AI总结 提出Human-as-Humanoid框架,通过对齐机器人本体、感知设置和动作标签接口,将大规模人类演示视频转化为可执行的动作监督,实现高自由度人形机器人的零样本学习。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31933 2026-07-01 cs.CV 新提交

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

无处可藏:基于背景控制对的视频幻觉基准测试

Haojian Huang, Harold Haodong Chen, Meng Luo, Junjia Du, Shanqing Xu, Ziheng Chen, Yanxiang Huang, Yinchuan Li, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Knowin AI(考恩人工智能) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出VidPair-Halluc基准,通过背景相似但前景语义不同的视频对,精确评估大型视频模型中的视频幻觉,包含1K对抗视频对和11K时空问答对。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏