arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-07-01 至 2026-07-01 共收录 24
2606.30577 2026-07-01 cs.CV 版本更新

APRIL-MedSeg: A Modular Medical Image Segmentation Toolbox Embracing Modern Paradigms

APRIL-MedSeg: 一个拥抱现代范式的模块化医学图像分割工具箱

Juntao Jiang, Jinsheng Bai, Linxuan Fan, Yali Bi, Jiangning Zhang, Yong Liu

机构 * Zhejiang University, APRIL Lab(浙江大学APRIL实验室) Vanderbilt University(范德比尔特大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出YAML驱动的模块化框架APRIL-MedSeg,将分割网络分解为可复用组件,集成半监督、域适应、知识蒸馏、弱监督、文本引导分割及基础模型支持,通过注册配置系统实现灵活可复现的实验管理。

Comments 31 pages, 1 figure, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32036 2026-07-01 cs.CV 新提交

PointSplat: Compact Gaussian Splatting via Human-Centric Prediction

PointSplat: 通过以人为中心的预测实现紧凑的高斯泼溅

Yujie Guo, Yudong Jin, Lingteng Qiu, Zehong Shen, Zhen Xu, Jing Zhang, Xianchao Shen, Hujun Bao, Sida Peng, Xiaowei Zhou

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) ByteDance(字节跳动) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出PointSplat,一种以人为中心的方法,直接从输入点集推断高斯原语,通过3D空间预测减少冗余,实现紧凑表示和高质量新视角渲染。

Comments Project Page: https://zju3dv.github.io/pointsplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31734 2026-07-01 cs.CV 新提交

MemLearner: Learning to Query Context memory for Video World Models

MemLearner: 学习查询上下文记忆用于视频世界模型

Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

AI总结 提出基于学习的自适应上下文查询方法MemLearner,利用视频生成模型自身进行上下文记忆查询,解决视频世界模型在遮挡和动态场景下的场景一致性问题。

Comments ECCV 2026, Project Page: https://yujiwen.github.io/memlearner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31451 2026-07-01 cs.RO cs.AI 新提交

UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation

UniTac: 一种用于跨传感器触觉理解与生成的统一多模态模型

Jiahang Tu, Fengyu Yang, Chenyang Ma, Xihang Yu, Ziyao Zeng, Shaokai Wu, Hanbin Zhao, Zhi Tao, Chao Zhang, Hui Qian, Alex Wong

机构 * Zhejiang University(浙江大学) Yale University(耶鲁大学) University of Oxford(牛津大学) MIT(麻省理工学院) Shanghai Jiaotong University(上海交通大学) UNIX AI

AI总结 提出UniTac,首个统一多模态模型,通过双级表示编码传感器和物体属性,实现触觉理解与生成,在跨传感器任务上达到最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31245 2026-07-01 cs.CV 新提交

HyperVLP: Enhancing Hierarchical Surgical Video-Language Pre-training in Hyperbolic Space

HyperVLP: 在双曲空间中增强层次化手术视频-语言预训练

Yaojun Hu, Kun Yuan, Nassir Navab, Haochao Ying, Jian Wu, Nicolas Padoy

机构 * Zhejiang University(浙江大学) University of Strasbourg, CNRS, INSERM, ICube, UMR7357(斯特拉斯堡大学,CNRS,INSERM,ICube,UMR7357) IHU Strasbourg(斯特拉斯堡IHU) Technical University of Munich(慕尼黑工业大学)

AI总结 提出双曲空间手术视频-语言预训练框架HyperVLP,通过保留层次结构、缓解结构假负例并强制父子语义一致性,提升零样本和少样本手术阶段识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31167 2026-07-01 cs.RO cs.AI 新提交

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents

MIRTH:面向视觉-语言-动作智能体的基于互信息推理的时间枢纽

Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 提出MIRTH框架,通过双尺度时间记忆枢纽、互信息优化的潜在推理令牌和并行动作解码,解决VLA模型的时间短视、推理鸿沟和推理低效问题,在LIBERO和真实机器人上达到SOTA并展现错误恢复能力。

Comments Accepted as main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31095 2026-07-01 cs.CV 新提交

Do Not Break the Vessels: Structure-Preserving Mean Flow for Vascular Image Translation

不要破坏血管:用于血管图像翻译的结构保持平均流

Changjin Sun, Zhuo Hu, Kaini Wang, Baixuan Wu, Shuo Gao, Runan Zheng, Cheng Xue, Yudong Zhang, Guangquan Zhou

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Zhejiang University(浙江大学) Suzhou Microclear Medical Instruments Co.(苏州微清医疗器械有限公司)

AI总结 提出结构保持平均流(SPMF)框架,通过拓扑不变传输和正交约束,在扩散模型中保持血管结构,并在NIRII-to-2PF和眼底数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31080 2026-07-01 cs.LO cs.AI 新提交

Beyond But-for Test: Counterfactual Explanation in Abstract Argumentation via Actual Causality (Extended Version)

超越反事实检验:基于实际因果的抽象论证反事实解释(扩展版)

Siyi Liu, Muyun Shao, Beishui Liao

机构 * Zhejiang University(浙江大学)

AI总结 针对抽象论证中的反事实解释问题,提出基于干预的反事实推理框架,通过编码论证接受条件为方程并定义干预算子,超越反事实检验,正确识别抢先和过度决定等结构中的原因。

Comments Accepted for publication at the International Conference on Computational Models of Argument (COMMA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31074 2026-07-01 cs.CL cs.AI 新提交

Triospect: A Three-Dimensional Framework for Robust Statistical AI-Generated Text Detection Against Diverse Attacks

Triospect:一种针对多样化攻击的鲁棒统计AI生成文本检测的三维框架

Guangsheng Bao, Lihua Rong, Yanbin Zhao, Xiao Yu, Qiji Zhou, Yue Zhang

机构 * Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学) Westlake University(西湖大学) Shanghai Polytechnic University(上海第二工业大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出Triospect三维检测框架,通过分析文本的内容(核心思想)和表达(风格元素)来增强对17种攻击的鲁棒性,在Humanize-16K和RAID数据集上分别提升AUROC 22.3%和9.1%。

Comments TACL final version, 12 pages, 9 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31023 2026-07-01 cs.CR cs.LG 新提交

Certified Speculative Execution for Untrusted AI Agents

不可信AI代理的认证推测执行

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

机构 * School of Engineering, Institute of Science Tokyo, Japan(东京科学大学工学院) College of Control Science and Engineering, Zhejiang University, China(浙江大学控制科学与工程学院) Department of Electrical and Computer Engineering, National University of Singapore, Singapore(新加坡国立大学电气与计算机工程系)

AI总结 提出证书门控前缀接受(CGPA)方法,通过可信验证器、保形校准值边界和求解器延迟机制,实现安全、遗憾和速度的解耦,将不可信AI代理的违规率降至零。

Comments 15 pages, 2 figures, 24 tables. Includes a technical appendix (full proofs and all supplementary tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30682 2026-07-01 cs.SD cs.AI eess.AS 新提交

ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

ALM2Vec: 利用大型音频语言模型学习通用音频检索的音频嵌入

Fengjie Lu, Chenang Jiang, Jiarui Hai, Helin Wang, Aaron Yee

机构 * Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出ALM2Vec框架,利用预训练大型音频语言模型学习统一嵌入空间,实现跨域、任务感知的音频检索,支持指令感知检索,在标准基准上表现优异。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24330 2026-07-01 cs.CV 新提交

REDI-Match: Rotation-Equivariant Distillation for Efficient and Robust Dense Matching

REDI-Match: 旋转等变蒸馏实现高效鲁棒密集匹配

Yinji Ge, Guixu Zheng, Wulong Guo, Qian Feng, Xu Wu, Kai Zhou, Xinyuan Liu, Fei Xing

机构 * Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Beihang University(北京航空航天大学) Zhejiang University(浙江大学)

AI总结 提出REDI-Match框架,通过旋转等变蒸馏将视觉基础模型的语义知识注入轻量等变编码器,结合熵驱动空间对齐模块,在密集匹配中实现高效鲁棒的旋转不变性,在SatAst数据集上提升13.89%姿态精度且速度提升1.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04991 2026-07-01 cs.RO 版本更新

Wavelet Policy: Imitation Learning in the Scale Domain with World Prior Memory

小波策略:基于世界先验记忆的尺度域模仿学习

Changchuan Yang, Haoxuan Xu, Yuhang Dong, Guanzhong Tian, Haizhou Ge, Hongrui Zhu

机构 * Zhejiang University(浙江大学) Tsinghua University, DISCOVER Robotics(清华大学,DISCOVER机器人实验室) Hangzhou TaiWeave Robotics Co., Ltd.(杭州太 weave 机器人有限公司)

AI总结 本文提出小波策略,结合世界先验记忆与小波多尺度动作建模,通过编码静态背景图像中的持久物理场景结构,提升长周期机器人操作的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04834 2026-07-01 cs.CV cs.MM cs.RO eess.IV 版本更新

E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes

E-VLA:事件增强的视觉-语言-动作模型用于暗光和模糊场景

Jiajun Zhai, Hao Shi, Shangwei Guo, Kailun Yang, Kaiwei Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Hunan University(湖南大学)

AI总结 E-VLA通过事件流中的运动和结构线索提升暗光和模糊场景下的操控鲁棒性,利用事件驱动感知增强视觉-语言-动作模型的性能。

Comments Accepted to ECCV 2026. Code and dataset will be available at https://github.com/JJayzee/E-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25399 2026-07-01 cs.CV cs.RO 版本更新

LaMP: Learning Vision-Language-Action Policy with 3D Scene Flow as Latent Motion Prior

LaMP: 以3D场景流作为潜在运动先验的视觉-语言-动作策略学习

Xinkai Wang, Chenyi Wang, Yifu Xu, Mingzhe Ye, Fucheng Zhang, Jialin Tian, Xinyu Zhan, Lifeng Zhu, Cewu Lu, Lixin Yang

机构 * Southeast University(东南大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出LaMP框架,通过门控融合将3D场景流作为潜在运动先验,对齐运动专家与动作专家,提升VLA策略在复杂空间交互中的鲁棒性,在LIBERO等基准上取得最高平均成功率。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08758 2026-07-01 eess.IV cs.CV 版本更新

M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

M3CoTBench:医学图像理解中多模态大语言模型的思维链基准测试

Juntao Jiang, Jiangning Zhang, Yali Bi, Jinsheng Bai, Weixuan Liu, Weiwei Jin, Zhucun Xue, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学) Zhejiang Provincial People’s Hospital(浙江省人民医院) National University of Singapore(新加坡国立大学)

AI总结 提出M3CoTBench基准,通过多层级难度数据集和专用评估指标,系统评测多模态大语言模型在医学图像理解中的思维链推理正确性、效率、影响和一致性。

Comments 39 pages, 8 figures; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08653 2026-07-01 cs.RO 版本更新

High-Speed Vision-Based Flight in Clutter with Safety-Shielded Reinforcement Learning

基于安全盾牌强化学习的高速度视觉飞行在杂乱环境中

Jiarui Zhang, Chengyong Lei, Chengjiang Dai, Kenghou Hoi, Lijie Wang, Zhichao Han, Fei Gao

机构 * Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院工业控制技术研究所) Differential Robotics(微分机器人)

AI总结 提出一种结合模型安全机制的端到端强化学习框架,通过物理信息奖励和实时安全滤波器实现高速飞行与严格避障,在杂乱环境和森林中速度达7.5 m/s。

Comments Published in IEEE Robotics and Automation Letters

Journal ref IEEE Robotics and Automation Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03510 2026-07-01 cs.CV 版本更新

G2P: Gaussian-to-Point Attribute Alignment for Boundary-Aware 3D Segmentation

G2P:面向边界感知3D分割的高斯到点属性对齐

Hojun Song, Chae-yeong Song, Jeong-hun Hong, Chaewon Moon, Soo Ye Kim, Yiyi Liao, Jaehyup Lee, Sang-hyo Park

机构 * Kyungpook National University(庆北国立大学) Korea Electronics Technology Institute(韩国电子技术研究院) Adobe Research(Adobe研究院) Zhejiang University(浙江大学)

AI总结 提出G2P方法,通过将3D高斯泼溅的属性(如不透明度和尺度)传递到点云,解决几何特征无法区分外观相似物体的问题,实现边界感知的3D分割。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06625 2026-07-01 cs.CL 版本更新

FairJudge: An Adaptive, Debiased, and Consistent LLM-as-a-Judge

FairJudge: 一种自适应、去偏且一致的LLM作为评判者

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Xiao Xu, Shijian Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

AI总结 针对LLM评判系统在适应性、偏见和一致性上的局限,提出FairJudge,通过可学习正则化策略和课程式SFT-DPO-GRPO训练范式,实现自适应、去偏和一致评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01682 2026-07-01 cs.CL 版本更新

The Bidirectional Process Reward Model

双向过程奖励模型

Lingyin Zhang, Jun Gao, Xiaoxue Ren, Ziqiang Cao

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Biomedical Basic Research Center of Jiangsu, Soochow University(苏州大学江苏省生物医学基础研究中心) School of Software Technology, Zhejiang University(浙江大学软件学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院)

AI总结 提出双向过程奖励模型(BiPRM),通过并行左右评估流和门控机制融合分数,仅增加0.3%参数和5%延迟,在推理质量上平均提升10.6%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14819 2026-07-01 cs.CV cs.LG 版本更新

Capturing Context-Aware Route Choice Semantics for Trajectory Representation Learning

捕捉上下文感知路径选择语义的轨迹表示学习

Ji Cao, Yu Wang, Tongya Zheng, Jie Song, Qinghong Guo, Zujie Ren, Canghong Jin, Gang Chen, Mingli Song

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Zhejiang Lab(之江实验室) Zhejiang Provincial Engineering Research Center for Real-Time SmartTech in Urban Security Governance, Hangzhou City University(浙大城市学院浙江省城市安全治理实时智能技术工程研究中心) School of Software Technology, Zhejiang University(浙江大学软件学院) Polytechnic Institute of Zhejiang University(浙江大学工程师学院)

AI总结 提出CORE框架,通过多粒度环境感知模块和基于混合专家架构的路径选择编码器,将上下文感知的路径选择语义融入轨迹嵌入,在6个下游任务中平均提升9.20%。

Comments Accepted by IEEE Transactions on Knowledge and Data Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16757 2026-07-01 eess.AS cs.AI 版本更新

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

重新审视音频-语言预训练以学习通用音频表示

Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo, Yiwen Shao, Hao Zhang, Dong Yu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tencent AI Lab Seattle(腾讯AI实验室西雅图)

AI总结 本文通过构建大规模数据集CaptionStew并系统对比对比学习和字幕生成目标,揭示了音频-语言预训练在数据效率和可扩展性上的权衡,为通用音频表示学习提供了实证指导。

Comments ACL 2026 Main. Code available at https://github.com/AudenAI/Auden

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10895 2026-07-01 cs.AI 版本更新

LLM-Empowered Agentic MAC Protocols: A Dynamic Stackelberg Game Approach

LLM赋能的智能MAC协议:一种动态Stackelberg博弈方法

Renxuan Tan, Rongpeng Li, Fei Wang, Chenghui Peng, Shaoyun Wu, Zhifeng Zhao, Honggang Zhang

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院) Huawei Technologies Company Ltd.(华为技术有限公司) Zhejiang Lab(之江实验室) Zhejiang University(浙江大学) Macau University of Science and Technology(澳门科技大学)

AI总结 提出一种博弈论LLM赋能的多智能体深度强化学习框架,将上行传输建模为动态多追随者Stackelberg博弈,通过PPO协调LLM驱动代理合成自适应语义MAC协议,实现无需重训的泛化,吞吐量提升77.6%,公平性提升65.2%。

Comments This work has been submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15443 2026-07-01 cs.RO cs.AI 版本更新

A Scalable Whole-body Motion Transfer via Implicit Kinodynamic Motion Retargeting

可扩展的全身运动迁移:基于隐式动力学运动重定向

Xingyu Chen, Hanyu Wu, Sikai Wu, Mingliang Zhou, Diyun Xiang, Haodong Zhang, Yangchen Zhou, Yukang Gao, Yi Gu, Renjing Xu

机构 * HKUST(GZ)(香港科技大学(广州)) ETH Zurich(苏黎世联邦理工学院) Zhejiang University(浙江大学) Xiaomi Robotics Lab(小米机器人实验室)

AI总结 提出隐式动力学运动重定向(IKMR),利用骨架图卷积双自编码器将人体与机器人运动映射到共享拓扑潜空间,结合物理信息精炼实现高速、鲁棒的运动数据转换,解决噪声与计算瓶颈。

Comments RSS 2026 Workshop. Webpage: https://cybercal.github.io/webpage.ikmr

详情

展开后加载摘要…

URL PDF HTML 收藏