arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 248
2607.09322 2026-07-14 cs.AI 版本更新

LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

LongMedBench:用于长期临床决策的医疗智能体基准测试

Zihan Xu, Yanzhen Chen, Xiaocheng Zhang, Zhiting Fan, Weiqi Zhai, Hongxia Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Transvascular Implantation Devices Research Institute(血管内植入装置研究所)

AI总结 介绍基于EHR的LongMedBench基准,用于长期临床决策。构建含多患者多事件数据集,提出评估分类法。实验表明大语言模型在隐式时间推理有挑战,RAG和智能体记忆系统对信息检索有帮助,决策任务性能依赖模型即时上下文。

Comments Submitted manuscript prior to peer review in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26795 2026-07-14 cs.CV cs.AI cs.MM 版本更新

NaviCache: Test-Time Self-Calibration Caching for Video Generation

NaviCache: 视频生成的测试时自校准缓存

Zheqi Lv, Zhibo Zhu, Jinke Wang, Qi Tian, Shengyu Zhang, Zhengyu Chen, Chengxi Zang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Cornell University(康奈尔大学) Tencent Hunyuan(腾讯文生视频)

AI总结 针对视频扩散模型计算成本高的问题,提出NaviCache方法,将特征演化重构思为惯性导航系统问题,通过双状态估计架构自适应跟踪特征变化比和潜在漂移,实现有界误差的计算跳过,在多个模型上取得优异性能。

Comments Published at ICML 2026: Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15995 2026-07-14 cs.RO cs.AI cs.LG 版本更新

PUMA: Perception-driven Unified Foothold Prior for Mobility Augmented Quadruped Parkour

PUMA:用于移动增强四足动物跑酷的感知驱动统一立足点先验

Liang Wang, Kanzhong Yao, Yang Liu, Weikai Qin, Jun Wu, Zhe Sun, Qiuguo Zhu

机构 * Institute of Cyber-Systems and Control,Zhejiang University(浙江大学控制系统研究所) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所)

AI总结 研究针对四足动物跑酷任务,提出PUMA这一端到端学习框架,集成视觉感知与立足点先验于单阶段训练,利用地形特征估计相关先验,指导机器人姿态适应,经实验验证其在复杂地形中有出色敏捷性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17126 2026-07-14 eess.IV cs.CV cs.LG physics.optics 版本更新

Towards Blind Lens Aberration Correction via Large LensLib Pre-training and Discrete Degradation Priors

面向盲镜头像差校正的大规模LensLib预训练与离散退化先验

Xiaolong Qian, Qi Jiang, Yao Gao, Lei Sun, Kailun Yang, Xian Wang, Zhonghua Yi, Wenyong Li, Ming-Hsuan Yang, Luc Van Gool, Kaiwei Wang

机构 * National Research Center for Optical Instrumentation, Zhejiang University(浙江省光学仪器研究中心,浙江大学) INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧弗里迪斯基") School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学)

AI总结 提出FoundCAC框架,通过构建大规模无偏镜头库AODLibpro和离散退化先验LPR,解决数据扩展与先验缺失问题,实现盲镜头像差校正的零样本泛化和高效少样本适应。

Comments Accepted to 2026 IEEE International Conference on Computational Photography (ICCP). The source code and datasets will be made publicly available at https://github.com/zju-jiangqi/FoundCAC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04013 2026-07-13 cs.CL 版本更新

AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving

AugServe:用于增强型大语言模型推理服务的自适应请求调度

Ying Wang, Zhen Jin, Jiexiong Xu, Wenhai Lin, Yiquan Chen, Wenzhi Chen

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) Alibaba Group, Hangzhou, China(阿里巴巴集团)

AI总结 研究针对增强型大语言模型推理服务效率问题及现有系统挑战,提出AugServe框架,采用两阶段自适应请求调度策略并动态调整令牌批处理机制,有效提升了有效吞吐量并减少首次令牌时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01385 2026-07-10 cs.RO 版本更新

TriphiBot: A Triphibious Robot Combining FOC-based Propulsion with Eccentric Design

TriphiBot:一种结合基于FOC的推进与偏心设计的三栖机器人

Xiangyu Li, Tiancheng Lai, Mingwei Lai, Junxiao Lin, Mengke Zhang, Junping Zhi, Chao Xu, Fei Gao, Yanjun Cao

机构 * State Key Laboratory of Industrial Control Technology, Zhejiang University(浙江大学工业控制技术状态重点实验室) Huzhou Institute of Zhejiang University(浙江大学湖州研究院) Hainan Red Tower Cigarette Co., Ltd.(海南红塔烟草有限责任公司)

AI总结 研究提出新型三栖机器人TriphiBot,采用极简设计结合四旋翼与被动轮。引入偏心重心设计提升地面支撑运动效率,基于FOC开发统一推进系统解决不同流体运动控制差异,用混合控制确保多域运动与转换,实验验证了其能力、效率及适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16456 2026-07-10 cs.CV 版本更新

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理

Siwei Meng, Yawei Luo, Ping Liu

机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China

AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。

Comments This work is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05240 2026-07-10 cs.RO cs.CV 版本更新

StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

StreamVLN:通过快慢上下文建模实现流式视觉与语言导航

Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, Xihui Liu, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09016 2026-07-10 cs.RO 版本更新

Open-Vocabulary Object-Goal Navigation by Generalizing Semantic Mapping with Dense CLIP

通过用密集CLIP泛化语义映射实现开放词汇目标导航

Meng Wei, Chenyang Wan, Tai Wang, Yuqiang Yang, Wenzhe Cai, Yilun Chen, Hanqing Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

AI总结 研究面向对象的实体导航任务,提出OVExp框架,利用密集CLIP模型展示基于语义地图的目标预测网络泛化能力,设计跨模态转移策略解决训练成本高问题,在ObjectNav基准上对未知目标有强大泛化能力。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08843 2026-07-09 cs.AI cs.LG 版本更新

M$^3$: Reframing Training Measures for Discretized Physical Simulations

M$^3$:重新框架化离散物理模拟的训练度量

Yuan Mei, Xingyu Song, Xiaowen Song, Naoya Takeishi

机构 * The University of Tokyo(东京大学) Zhejiang University(浙江大学)

AI总结 M$^3$通过多尺度Morton度量框架平衡训练度量,提升连续物理域预测精度,减少误差达4.7倍,且在降采样下仍保持优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16446 2026-07-09 cs.CV 版本更新

Unified Removal of Raindrops and Reflections: A New Benchmark and A Novel Pipeline

统一去除雨滴和反射:一个新的基准和一个新流程

Xingyu Liu, Zewei He, Yu Chen, Chunyu Zhu, Zixuan Chen, Xing Luo, Zhe-Ming Lu

机构 * School of Aeronautics and Astronautics, Zhejiang University(浙江大学航空航天学院) Huanjiang Laboratory(浣江实验室) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出统一去除雨滴和反射的任务,并构建了新的基准数据集,同时提出基于扩散的新型框架DiffUR³,有效去除两种退化,实验表明在基准和真实场景中表现优异。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02999 2026-07-09 cs.CR cs.AI 版本更新

NonTextual Target Attack

非文本目标攻击

Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone, Binjiang Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区,滨江区块链与数据安全研究院) School of Cyberspace Security, Nanjing University of Science and Technology(网络安全学院,南京理工大学) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,新加坡国立大学) King Abdullah University of Science and Technology (KAUST)(卡布斯科学与技术大学)

AI总结 针对现有大语言模型越狱攻击的局限,提出非文本目标攻击NTA,通过非文本约束目标最大化不安全概率,分解目标便于优化,扩展攻击空间,在AdvBench上对安全对齐的大语言模型仅100次迭代,平均成功率达96.8%,性能远超现有攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19348 2026-07-09 cs.CV 版本更新

When Distillation Breaks Motion Control: Restoring Generative Trajectories for Fast Video Generators

当蒸馏破坏运动控制时:恢复快速视频生成器的生成轨迹

Jintao Rong, Xin Xie, Xinyi Yu, Linlin Ou, Xinyu Zhang, Chunhua Shen, Dong Gong

机构 * Zhejiang University of Technology(浙江工业大学) University of New South Wales (UNSW Sydney)(新南威尔士大学(悉尼)) University of Auckland(奥克兰大学) Zhejiang University(浙江大学)

AI总结 研究免训练运动定制应用于蒸馏视频生成器的问题,提出MotionEcho框架,通过推理时用高质量扩散教师模型校正学生模型采样轨迹,实现准确运动控制,提升运动保真度和视觉质量,且保留蒸馏生成效率优势。

Comments Project page: https://euminds.github.io/motionecho/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03949 2026-07-08 cs.RO 版本更新

Preference-Calibrated Human-in-the-Loop Reinforcement Learning for Robotic Manipulation

偏好校准的人机协同强化学习用于机器人操作

Zeyi Liu, Guangyao Liu, Yinuo Qu, Yuquan Xue, Bofang Jia, Chunhua Yang, Weihua Gui, Keke Huang, Ziwei Wang

机构 * Central South University(中南大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

AI总结 提出PACT框架,通过干预隐式偏好信号进行信用重分配和策略对齐,提升人机协同强化学习的样本效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03921 2026-07-08 cs.CV 版本更新

GARDEN: Gravity-Aligned Reconstruction of Disentangled ENvironments from RGB images

GARDEN: 从RGB图像中重力对齐的解耦环境重建

Jiahao Sun, Dingkun Wei, Zehong Shen, Hongyu Zhou, Yujun Shen, Liang Li

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 提出GARDEN框架,利用重力先验将多视图RGB图像重建为具有显式刚体和解耦背景的结构化混合场景表示,支持直接物理模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10439 2026-07-08 cs.CV 版本更新

Filtering Memorization from Parameter-Space in Diffusion Models

从参数空间过滤记忆化在扩散模型中

Yu Zhe, Yang Jiayan, Wei Junhao, Yu-Lin Tsai, Wang Chen

机构 * RIKEN AIP(理化学研究所Advanced Institute for Peripheral Research) Science of Tokyo(东京科学大学) University of California, Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学)

AI总结 本文提出BAF框架,通过分解LoRA更新并测量其与预训练骨干的主子空间对齐度,实现训练后记忆抑制,减少生成内容中的版权或敏感内容复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25698 2026-07-08 cs.RO 版本更新

Reference-Augmented Learning for Precise Tracking Policy of Tendon-Driven Continuum Robots

参考增强学习用于腱驱动连续机器人精确跟踪策略

Ziqing Zou, Ke Qiu, Haojian Lu, Rong Xiong, Yue Wang

机构 * Department of Control Science and Engineering, Zhejiang University(控制科学与工程系,浙江大学)

AI总结 本文提出一种参考增强的离线学习框架,用于腱驱动连续机器人的精确六自由度跟踪控制,通过可微RNN动态替代模型优化控制策略,有效减少位置误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24690 2026-07-08 cs.CV 版本更新

UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy

UniICL:通过能力导向的分类系统化统一多模态上下文学习

Yicheng Xu, Jiangning Zhang, Zhucun Xue, Teng Hu, Ran Yi, Xiaobin Hu, Yong Liu, Dacheng Tao

机构 * Zhejiang University(浙江大学) Shanghai Jiaotong University(上海交通大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出能力导向的分类系统,通过构建UniICL-760K语料库和UniICL-Bench评估体系,提出Context-Adaptive Prototype Modulator模块,提升多模态少样本学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01725 2026-07-08 cs.LG cs.CV 版本更新

Imbalance-Robust and Sampling-Efficient Continuous Conditional GANs via Adaptive Vicinal Learning and Auxiliary Regularization

通过自适应邻域学习和辅助正则化实现不平衡鲁棒且采样高效的连续条件生成对抗网络

Xin Ding, Yun Chen, Yongwei Wang, Kao Zhang, Sen Zhang, Peibei Cao, Xiangxue Wang

机构 * School of Artificial Intelligence/School of Future Technology, Nanjing University of Information Science & Technology, Nanjing, China(人工智能学院/未来技术学院,南京信息科学技术大学) Perceptual and Generative AI Lab, Nanjing University of Information Science & Technology, Nanjing, China(感知与生成人工智能实验室,南京信息科学技术大学) College of Media, Zhejiang University, Hangzhou, China(传媒学院,浙江大学) College of Computer Science and Technology, Zhejiang University, Hangzhou, China(计算机科学与技术学院,浙江大学)

AI总结 研究针对CcGAN固定大小邻域训练对标签密度敏感及CCDM计算昂贵问题,提出结合软/混合自适应邻域与辅助判别器引导正则化的CcGAN-AVAR,实验表明其能保持GAN采样效率,提升生成质量和标签一致性,推理速度远超CCDM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00001 2026-07-08 cs.CV cs.AI cs.CY 版本更新

Replication in Visual Diffusion Models: A Survey and Outlook

视觉扩散模型中的复制:一项综述与展望

Wenhao Wang, Yifan Sun, Zongxin Yang, Zhengdong Hu, Zhentao Tan, Yi Yang

机构 * Australian Artificial Intelligence Institute, University of Technology Sydney(澳大利亚人工智能研究所,悉尼技术大学) Baidu Inc.(百度公司) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

AI总结 本文综述视觉扩散模型中的复制现象,将现有研究分类为揭示、理解和缓解该现象的方法,还回顾其现实影响,讨论了检测和基准测试复制的挑战及未来方向,助力研究人员和从业者理解AI技术与社会公益交叉点。

Comments Accepted by TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03677 2026-07-07 cs.LG 版本更新

Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe

Uni-OPD:基于双视角方案的统一策略内蒸馏框架

Wenjin Hou, Shangpin Peng, Weinong Wang, Zheng Ruan, Yue Zhang, Zhenglin Zhou, Mingqi Gao, Yifei Chen, Kaiqi Wang, Hongming Yang, Chengquan Zhang, Zhuotao Tian, Han Hu, Yi Yang, Fei Wu, Hehe Fan

机构 * Zhejiang University(浙江大学) Shenzhen Loop Area Institute(深圳河套学院) LLM Department, Tencent(腾讯大模型部门)

AI总结 针对策略内蒸馏存在的信息状态探索不足、教师监督不可靠问题,提出跨大语言与多模态大模型的统一框架Uni-OPD,经多域实验验证其通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09426 2026-07-07 cs.AI 版本更新

WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces

WeaveBench: 面向混合接口的长期、真实世界计算机使用代理基准

Wanli Li, Bowen Zhou, Yunyao Yu, Zhou Xu, Yifan Yang, Dongsheng Li, Caihua Shan

机构 * Zhejiang University(浙江大学) Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

AI总结 提出WeaveBench基准,包含114个跨8个真实工作领域的长期混合接口任务,要求代理结合GUI和CLI/代码操作,最佳PassRate仅41.2%,揭示现有评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25475 2026-07-07 cs.CL cs.AI 版本更新

IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference

IndexMem: 基于潜在记忆的学习型KV缓存驱逐策略用于长上下文LLM推理

Xintong Yang, Hao Gu, Binxing Xu, Lujun Li, Bei Liu, Jiacheng Liu, Qiyuan Zhu, Yike Guo, Sirui Han

机构 * The Hong Kong University of Science(香港科学与技术大学) Zhejiang University(浙江大学)

AI总结 提出一种可学习的索引器预测KV重要性,并结合轻量级潜在记忆模块压缩被驱逐的令牌,以在有限KV预算下实现准确的长上下文推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05409 2026-07-07 cs.AI cs.CL 版本更新

Agentic Retrieval-Augmented Generation for Financial Document Question Answering

代理检索增强生成用于财务文档问答

Yang Shu, Yingmin Liu, Zequn Xie

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文提出FinAgent-RAG框架,通过迭代检索-推理循环和自我验证,提升金融文档问答的精度。引入对比金融检索器、程序化思维模块和自适应策略路由,实验表明在三个基准数据集上均取得显著效果,准确率提升5.62-9.32个百分点。

Comments This paper is withdrawn due to significant methodological errors in the experimental design that fundamentally affect the validity of the results. The errors are not correctable within the current framework, and the conclusions can no longer be supported. We apologize for any inconvenience caused to readers

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05305 2026-07-07 cs.CV cs.AI cs.CL 版本更新

FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion

FlashBlock:用于高效长上下文块扩散的注意力缓存

Zhuokun Chen, Jianfei Cai, Bohan Zhuang

机构 * Monash University(墨尔本大学) Zhejiang University(浙江大学)

AI总结 研究长内容生成中块扩散在长上下文设置下的注意力计算开销问题,提出FlashBlock机制,利用块外注意力输出稳定性复用注意力,减少计算与缓存访问,提升效率且不影响质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02368 2026-07-07 cs.CL cs.AI cs.LG 版本更新

Evolutionary Guided Decoding: Iterative Value Refinement for LLMs

进化引导解码:大语言模型的迭代值细化

Zhenhua Liu, Lijun Li, Ruizhe Chen, Yuxian Jiang, Tong Zhu, Zhaochen Su, Wenliang Chen, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Soochow University(苏州大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

AI总结 研究发现引导解码中值函数不准确源于分布差距,提出迭代值细化框架,用值探索提供训练信号,迭代自我细化利用改进值函数生成高质量数据,实验证明该框架能有效对齐语言模型并降低计算成本。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01651 2026-07-07 cs.CV 版本更新

Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning

扩散模型是开放世界的功能学习器:利用生成先验进行3D功能学习

Hanqing Wang, Zhenhao Zhang, Kaiyang Ji, Mingyu Liu, Wenti Yin, yuchao chen, Zhirui Liu, Xiangyu Zeng, Tianxiang Gui, Hangxing Zhang, Jiahao Yuan, Zhiqing Cui, Jiaxin Liu, Zhiyuan Ma, Hui Xiong

机构 * The Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 研究3D功能基础问题,利用文本到图像扩散模型提取先验知识,提出基于扩散的DAG框架用于3D功能预测,通过实验证明其优于现有方法且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20893 2026-07-07 cs.LG cs.AI eess.SP 版本更新

MambaCapsule: Towards Transparent Cardiac Disease Diagnosis with Electrocardiography Using Mamba Capsule Network

MambaCapsule:使用Mamba胶囊网络实现基于心电图的透明心脏病诊断

Yinlong Xu, Zitai Kong, Yixuan Wu, Yue Wang, Xiaoqiang Liu, Yingzhou Lu, Jian Wu, Hongxia Xu

机构 * State Key Laboratory of Transvascular Implantation Devices and TIDRI, Zhejiang University(浙江大学血管介入关键实验室及TIDRI) School of Public Health, Zhejiang University and Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江大学公共卫生学院及浙江省医学影像人工智能重点实验室) State Key Laboratory of Transvascular Implantation Devices of The Second Affiliated Hospital and Liangzhu Laboratory, Zhejiang University(浙江大学第二附属医院血管介入关键实验室及梁渚实验室) Department of Gastroenterology, First Hospital of Quanzhou Affiliated to Fujian Medical University(福建医科大学泉州第一医院消化内科) School of Medicine, Stanford University(斯坦福大学医学院)

AI总结 研究针对心律失常诊断模型缺乏透明度问题,提出MambaCapsule网络,用Mamba提取特征、胶囊网络预测,通过重构心电图信号增强可解释性,在数据集上取得高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00593 2026-07-03 cs.CL cs.AI 版本更新

SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

SPADER: 面向多答案问答的逐步同伴优势与多样性感知探索奖励

Qiming Shi, Zhaolu Kang, Yunfan Zhou, Di Weng, Yingcai Wu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院)

AI总结 提出SPADER强化学习框架,通过逐步同伴优势(SPA)机制和多样性感知探索奖励,解决多答案问答中长程工具使用的细粒度信用分配与持续探索问题,实验表明在多个数据集上提升了召回率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14157 2026-07-03 cs.AI cs.CV 版本更新

Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理

Yankai Jiang, Yujie Zhang, Peng Zhang, Wenjie Li, Yichen Li, Jintai Chen, Xiaoming Shi, Shihui Zhen

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))

AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏