arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-06-24 至 2026-06-24 共收录 12
2606.24779 2026-06-24 q-bio.GN cs.AI 新提交

DeepBD: A Grounded Agentic Workflow for Variant Prioritization and Diagnosis of Genetic Birth Defects

DeepBD:一种用于遗传性出生缺陷变异优先级排序和诊断的基于实体的智能体工作流

Shiyu Li, Ziqi Yan, Zhihao Wu, Jielong Lu, Weiran Liao, Jiajun Yu, Genjie Li, Zeyu Chu, Jiajun Bu, Haishuai Wang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院,杭州,中国)

AI总结 提出DeepBD,一种结合LLM、预训练证据引擎和专家模块的智能体工作流,用于遗传性出生缺陷的变异优先级排序和诊断,在内部基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23888 2026-06-24 eess.IV cs.AI cs.CV 新提交

E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis

E-MRL: 跨视图对齐的证据驱动多模态强化学习用于可靠的3D肿瘤分析

Sijing Li, Zhongwei Qiu, Zhuoya Wang, Boxiang Yun, Zhenyu Yi, Jianwei Xu, Wenqiao Zhang, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(华平实验室) Huazhong University of Science and Technology(华中科技大学) East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出跨视图对齐的证据驱动多模态强化学习框架E-MRL,通过将生成过程建模为“诊断-定位-验证”的马尔可夫决策过程,并引入跨视图一致性奖励,减少视觉幻觉并提升3D CT肿瘤诊断准确性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24767 2026-06-24 cs.CV cs.RO 新提交

Compact Object-Level Representations with Open-Vocabulary Understanding for Indoor Visual Relocalization

具有开放词汇理解的紧凑对象级表示用于室内视觉重定位

Zhaopeng Cui, Jiarui Hu, Jingbo Liu, Boming Zhao, Xiyue Guo, Boyin Feng, Haocheng Peng, Yujun Shen, Hujun Bao, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Ant Group(蚂蚁集团)

AI总结 提出OpenReLoc系统,利用基础模型实现多模态开放词汇语义匹配、基于DIOU的参考帧选择和双路径2D ICP损失,仅用对象单元实现室内视觉重定位,提升可解释性和准确性。

Comments Accepted by RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24740 2026-06-24 cs.CV 新提交

BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming

BioMedVR: 面向生物医学视觉重编程的混淆感知提示专家混合模型

Jiaxiang Liu, Tianxiang Hu, Juwei Guan, Yujie Wu, Yusong Wang, Yao Mu, Zuozhu Liu, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科技研究院) Zhejiang University(浙江大学) Southeast University(东南大学) The Hong Kong Polytechnic University(香港理工大学) Institute of Science Tokyo(东京科学大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出BioMedVR框架,通过可学习的VR模块实现预训练VLM在生物医学图像上的少样本适应,利用混淆最小化机制和提示专家混合模型解决细粒度分类中的类间混淆问题,在18个数据集上验证了优越性能。

Comments Accepted at ECCV 2026. 19 pages, 6 figures. Project page: https://jxliu-ai.github.io/biomedvr-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24526 2026-06-24 cs.CL 新提交

AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning

AGORA:基于档案的智能体工作场所文档推理基准

Honglin Guo, Qi Zhang, Yu Zhang, Weijie Li, Rui Zheng, Zhikai Lei, Qiyuan Peng, Zhiheng Xi, Tao Gui, Qi Zhang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Qiji Zhifeng Co., Ltd.(上海奇绩智峰有限公司)

AI总结 提出AGORA基准,包含362个问题、8个领域共9664份真实文档(3.72亿词元),要求智能体在超大档案中主动搜索稀疏证据并推理答案,最强模型准确率仅59.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24489 2026-06-24 cs.RO 新提交

Decentralized Pose Graph Riemannian Optimization for Object-based Multi-Robot SLAM

基于对象的分布式位姿图黎曼优化用于多机器人SLAM

Yixian Zhao, Yan Huang, Yang Xu, Liang Li, Jinming Xu

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能自主系统研究院) Division of Decision and Control Systems, School of EECS, KTH Royal Institute of Technology(瑞典皇家理工学院电气工程与计算机科学学院决策与控制系统系)

AI总结 提出一种完全分布式的黎曼优化框架,通过共识机制解耦对象级多机器人SLAM中的位姿图优化问题,并利用近似牛顿法加速收敛,在SE(d)流形上保持几何一致性,显著降低通信开销并提升精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24428 2026-06-24 cs.CL 新提交

Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning

逃离自我确认陷阱:一种用于智能体经验学习的执行-蒸馏-验证范式

Shiding Zhu, Yudi Qi, Yajie Wang, Jiaze Li, Chao Song, Yaorui Shi, Yibo Miao, Hanqi Gao, Kai Zhang

机构 * Zhejiang University(浙江大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学)

AI总结 提出EDV框架,通过多智能体并行执行、第三方蒸馏和共识验证,解决单智能体经验学习中的自我确认陷阱问题,在三个长时任务基准上取得一致提升。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24165 2026-06-24 cs.CV 新提交

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

多模态大语言模型中基于谱演化引导的令牌剪枝

Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) The University of Queensland(昆士兰大学) Singapore Management University(新加坡管理大学) The University of Southern Queensland(南昆士兰大学)

AI总结 提出跨层谱演化(CLSE)框架,通过频域分析令牌表示在Transformer层间的演化来评估重要性,实现无训练剪枝,在保持性能的同时减少计算开销。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24156 2026-06-24 cs.CV 新提交

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

利用先验校正的令牌缩减加速多模态大语言模型

Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

AI总结 提出PriorTR方法,通过分离任务条件注意力与模型先验注意力,在单次前向传播中估计先验并校正令牌重要性,实现无训练令牌缩减,提升多模态大语言模型效率与准确性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24051 2026-06-24 cs.CV 新提交

DriveStack-VLA: Render-Teacher Alignment for BEV-Based DeepStack Vision-Language-Action Model

DriveStack-VLA: 基于BEV的DeepStack视觉-语言-动作模型的渲染-教师对齐

Jingke Wang, Zhenru Zhao, Shuangming Lei, Hao Su, Yuehao Huang, Yijia Xie, Kai Tang, Guanglin Xu, AiXue Ye, Yukai Ma, Yong Liu

机构 * Zhejiang University(浙江大学) The 2012 Labs, Huawei(华为2012实验室)

AI总结 提出DriveStack-VLA框架,通过DeepStack连接注入BEV表示并采用渲染-教师对齐增强空间感知,引入自批评模块优化轨迹选择,在多个驾驶基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16821 2026-06-24 cs.CL cs.CR cs.CY cs.IR 新提交

How Much Can We Trust LLM Search Agents? Measuring Endorsement Vulnerability to Web Content Manipulation

我们能在多大程度上信任LLM搜索智能体?衡量对网络内容操纵的认可脆弱性

Yimeng Chen, Zhe Ren, Firas Laakom, Yu Li, Dandan Guo, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, KAUST(KAUST生成式人工智能卓越中心) Jilin University(吉林大学) Zhejiang University(浙江大学) The Swiss AI Lab, IDSIA-USI/SUPSI(瑞士人工智能实验室 IDSIA-USI/SUPSI) NNAISENSE

AI总结 提出SearchGEO框架,通过五类攻击模式和输出级指标评估13种LLM后端对网络内容操纵的认可脆弱性,发现攻击成功率从0%到31.4%不等,且不同后端对攻击模式的敏感性和部署框架的影响存在显著差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11129 2026-06-24 cs.CV 新提交

WorldOlympiad: Can Your World Model Survive a Triathlon?

WorldOlympiad:你的世界模型能经受铁人三项考验吗?

Yuke Zhao, Wangbo Zhao, Weijie Wang, Zeyu Zhang, Dakai An, Akide Liu, Yinghao Yu, Jiasheng Tang, Fan Wang, Wei Wang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) The Hong Kong University of Science and Technology(香港科技大学) Monash University(莫纳什大学) TRE, Alibaba Group(阿里巴巴TRE)

AI总结 提出WorldOlympiad基准,从物理忠实性、几何一致性和交互保真度三个维度诊断视频世界模型,揭示现有模型在物理推理、3D一致性和长程交互方面的显著不足。

Comments Project Page: https://alibaba-damo-academy.github.io/WorldOlympiad/, Code: https://github.com/alibaba-damo-academy/WorldOlympiad

详情

展开后加载摘要…

URL PDF HTML 收藏