arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 251
2407.20893 2026-07-07 cs.LG cs.AI eess.SP 版本更新

MambaCapsule: Towards Transparent Cardiac Disease Diagnosis with Electrocardiography Using Mamba Capsule Network

MambaCapsule:使用Mamba胶囊网络实现基于心电图的透明心脏病诊断

Yinlong Xu, Zitai Kong, Yixuan Wu, Yue Wang, Xiaoqiang Liu, Yingzhou Lu, Jian Wu, Hongxia Xu

机构 * State Key Laboratory of Transvascular Implantation Devices and TIDRI, Zhejiang University(浙江大学血管介入关键实验室及TIDRI) School of Public Health, Zhejiang University and Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江大学公共卫生学院及浙江省医学影像人工智能重点实验室) State Key Laboratory of Transvascular Implantation Devices of The Second Affiliated Hospital and Liangzhu Laboratory, Zhejiang University(浙江大学第二附属医院血管介入关键实验室及梁渚实验室) Department of Gastroenterology, First Hospital of Quanzhou Affiliated to Fujian Medical University(福建医科大学泉州第一医院消化内科) School of Medicine, Stanford University(斯坦福大学医学院)

AI总结 研究针对心律失常诊断模型缺乏透明度问题,提出MambaCapsule网络,用Mamba提取特征、胶囊网络预测,通过重构心电图信号增强可解释性,在数据集上取得高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00593 2026-07-03 cs.CL cs.AI 版本更新

SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

SPADER: 面向多答案问答的逐步同伴优势与多样性感知探索奖励

Qiming Shi, Zhaolu Kang, Yunfan Zhou, Di Weng, Yingcai Wu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院)

AI总结 提出SPADER强化学习框架,通过逐步同伴优势(SPA)机制和多样性感知探索奖励,解决多答案问答中长程工具使用的细粒度信用分配与持续探索问题,实验表明在多个数据集上提升了召回率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14157 2026-07-03 cs.AI cs.CV 版本更新

Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理

Yankai Jiang, Yujie Zhang, Peng Zhang, Wenjie Li, Yichen Li, Jintai Chen, Xiaoming Shi, Shihui Zhen

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))

AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04101 2026-07-03 cs.CV 版本更新

NEARL: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding

NEARL: 基于正交正则化的交互式查询自适应用于医学视觉-语言理解

Zelin Peng, Yichen Zhao, Yu Huang, Piao Yang, Feilong Tang, Zhengqin Xu, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence(人工智能MOE实验室) AI Institute(人工智能研究院) School of Computer Science(计算机科学学院) Shanghai Jiao Tong University(上海交通大学) Department of Radiology(放射科) The First Affiliated Hospital(第一附属医院) School of Medicine(医学院) Zhejiang University(浙江大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) State Key Laboratory of Infrared Physics(红外物理国家重点实验室) Shanghai Institute of Technical Physics(上海技术物理研究所) Chinese Academy of Science(中国科学院)

AI总结 提出NEARL框架,通过统一协同嵌入变换器(USEformer)和正交交叉注意力适配器(OCA)实现双向跨模态交互,仅引入1.46M参数,在三个医学影像数据集上取得最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.04942 2026-07-03 stat.ML cs.LG stat.ME 版本更新

Learning Consumer Preferences from Bundle Sales Data

从捆绑销售数据中学习消费者偏好

Ningyuan Chen, Setareh Farajollahzadeh, Qingwei Jin, Fanni Shen, Guan Wang

机构 * University of Toronto(多伦多大学) McGill University(麦吉尔大学) Zhejiang University(浙江大学)

AI总结 提出一种从捆绑销售交易数据中估计消费者对单个产品估值分布的方法,通过定义效用模型并使用EM算法和蒙特卡洛模拟恢复估值分布,扩展至未观测无购买、市场细分和协同效应,并提供可识别性和收敛性理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01825 2026-07-02 cs.CV cs.MM 版本更新

ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search

ROGLE: 基于自动区域监督的鲁棒全局-局部对齐用于文本行人搜索

Chaodong Jia, Zequn Xie, Xibei Jia, Sihang Cai, Shulei Wang, Tao Jin

机构 * Zhejiang University(浙江大学)

AI总结 提出ROGLE框架,通过自动区域-句子匹配策略和多重粒度学习,解决文本行人搜索中细粒度对齐不足的问题,并在新基准P-VLG上取得最优性能。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16085 2026-07-02 cs.CV cs.AI 版本更新

Interact3D: Compositional 3D Generation of Interactive Objects

Interact3D: 交互式物体的组合3D生成

Hui Shan, Keyang Luo, Ming Li, Sizhe Zheng, Yanwei Fu, Zhen Chen, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Adobe Fudan University(复旦大学)

AI总结 提出Interact3D框架,通过统一3D引导场景、两阶段组合流水线(全局到局部几何对齐和基于SDF的优化)以及闭环智能体修正策略,从单张图像生成物理合理的交互式3D组合物体,解决遮挡和空间关系保持问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12056 2026-07-02 cs.AI cs.CL 版本更新

XSkill: Continual Learning from Experience and Skills in Multimodal Agents

XSkill: 多模态智能体中的经验与技能持续学习

Guanyu Jiang, Zhaochen Su, Xiaoye Qu, Yi R. Fung

机构 * Zhejiang University(浙江大学)

AI总结 提出XSkill双流框架,通过视觉经验与技能的知识提取、检索和自适应,实现多模态智能体在开放场景中无需参数更新的持续学习,显著提升工具使用和推理泛化能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18765 2026-07-02 cs.CV cs.AI 版本更新

NI-Tex: Non-isometric Image-based Garment Texture Generation

NI-Tex: 基于非等距图像的服装纹理生成

Hui Shan, Ming Li, Haitao Yang, Kai Zheng, Sizhe Zheng, Yanwei Fu, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学)

AI总结 针对非等距图像与3D服装网格间的纹理生成问题,提出结合物理模拟数据集、非等距图像编辑和迭代烘焙的框架,生成高质量PBR纹理。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12110 2026-07-02 cs.CV cs.AI 版本更新

MediRound: Multi-Round Entity-Level Reasoning Segmentation in Medical Images

MediRound:医学图像中的多轮实体级推理分割

Qinyue Tong, Ziqian Lu, Jun Liu, Rui Zuo, Zheming Lu, Yueming Jin

机构 * Zhejiang University(浙江大学) Zhejiang Sci-Tech University(浙江理工大学) National University of Singapore(新加坡国立大学)

AI总结 提出多轮实体级医学推理分割任务MEMR-Seg,构建大规模数据集MR-MedSeg,并设计基线模型MediRound,通过判断与纠正机制缓解错误传播,在医学教育场景中优于传统方法。

Comments In this version, we have improved some suboptimal expressions in the manuscript and completed the authors' information, such as ORCID IDs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00654 2026-07-02 cs.CV 版本更新

RC-GeoCP: Geometric Consensus for Radar-Camera Collaborative Perception

RC-GeoCP:雷达-相机协同感知的几何一致性

Xiaokai Bai, Lianqing Zheng, Runwei Guan, Siyuan Cao, Songkai Wang, Huiliang Shen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Automotive Studies, Tongji University(同济大学汽车学院) Thrust of Artificial Intelligence, Hong Kong University of Science and Technology(香港科技大学人工智能研究所)

AI总结 提出首个4D雷达与相机协同感知框架RC-GeoCP,通过雷达锚定几何一致性解决深度模糊和空间分散导致的错位,实现高效通信与全局一致表示。

Comments 11 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20857 2026-07-02 cs.RO 版本更新

Multi-Embodiment Robotic Retargeting via Guided Diffusion Model

基于引导扩散模型的多体机器人重定向

Zhefeng Cao, Ben Liu, Shunpeng Yang, Sen Li, Wei Zhang, Hua Chen

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟校区联合学院) LimX Dynamics

AI总结 提出统一图条件扩散框架,利用图结构编码不同机器人拓扑几何特征,通过基于能量的引导损失训练,实现跨异构体的运动重定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30577 2026-07-01 cs.CV 版本更新

APRIL-MedSeg: A Modular Medical Image Segmentation Toolbox Embracing Modern Paradigms

APRIL-MedSeg: 一个拥抱现代范式的模块化医学图像分割工具箱

Juntao Jiang, Jinsheng Bai, Linxuan Fan, Yali Bi, Jiangning Zhang, Yong Liu

机构 * Zhejiang University, APRIL Lab(浙江大学APRIL实验室) Vanderbilt University(范德比尔特大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出YAML驱动的模块化框架APRIL-MedSeg,将分割网络分解为可复用组件,集成半监督、域适应、知识蒸馏、弱监督、文本引导分割及基础模型支持,通过注册配置系统实现灵活可复现的实验管理。

Comments 31 pages, 1 figure, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04991 2026-07-01 cs.RO 版本更新

Wavelet Policy: Imitation Learning in the Scale Domain with World Prior Memory

小波策略:基于世界先验记忆的尺度域模仿学习

Changchuan Yang, Haoxuan Xu, Yuhang Dong, Guanzhong Tian, Haizhou Ge, Hongrui Zhu

机构 * Zhejiang University(浙江大学) Tsinghua University, DISCOVER Robotics(清华大学,DISCOVER机器人实验室) Hangzhou TaiWeave Robotics Co., Ltd.(杭州太 weave 机器人有限公司)

AI总结 本文提出小波策略,结合世界先验记忆与小波多尺度动作建模,通过编码静态背景图像中的持久物理场景结构,提升长周期机器人操作的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04834 2026-07-01 cs.CV cs.MM cs.RO eess.IV 版本更新

E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes

E-VLA:事件增强的视觉-语言-动作模型用于暗光和模糊场景

Jiajun Zhai, Hao Shi, Shangwei Guo, Kailun Yang, Kaiwei Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Hunan University(湖南大学)

AI总结 E-VLA通过事件流中的运动和结构线索提升暗光和模糊场景下的操控鲁棒性,利用事件驱动感知增强视觉-语言-动作模型的性能。

Comments Accepted to ECCV 2026. Code and dataset will be available at https://github.com/JJayzee/E-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25399 2026-07-01 cs.CV cs.RO 版本更新

LaMP: Learning Vision-Language-Action Policy with 3D Scene Flow as Latent Motion Prior

LaMP: 以3D场景流作为潜在运动先验的视觉-语言-动作策略学习

Xinkai Wang, Chenyi Wang, Yifu Xu, Mingzhe Ye, Fucheng Zhang, Jialin Tian, Xinyu Zhan, Lifeng Zhu, Cewu Lu, Lixin Yang

机构 * Southeast University(东南大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出LaMP框架,通过门控融合将3D场景流作为潜在运动先验,对齐运动专家与动作专家,提升VLA策略在复杂空间交互中的鲁棒性,在LIBERO等基准上取得最高平均成功率。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08758 2026-07-01 eess.IV cs.CV 版本更新

M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

M3CoTBench:医学图像理解中多模态大语言模型的思维链基准测试

Juntao Jiang, Jiangning Zhang, Yali Bi, Jinsheng Bai, Weixuan Liu, Weiwei Jin, Zhucun Xue, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学) Zhejiang Provincial People’s Hospital(浙江省人民医院) National University of Singapore(新加坡国立大学)

AI总结 提出M3CoTBench基准,通过多层级难度数据集和专用评估指标,系统评测多模态大语言模型在医学图像理解中的思维链推理正确性、效率、影响和一致性。

Comments 39 pages, 8 figures; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08653 2026-07-01 cs.RO 版本更新

High-Speed Vision-Based Flight in Clutter with Safety-Shielded Reinforcement Learning

基于安全盾牌强化学习的高速度视觉飞行在杂乱环境中

Jiarui Zhang, Chengyong Lei, Chengjiang Dai, Kenghou Hoi, Lijie Wang, Zhichao Han, Fei Gao

机构 * Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院工业控制技术研究所) Differential Robotics(微分机器人)

AI总结 提出一种结合模型安全机制的端到端强化学习框架,通过物理信息奖励和实时安全滤波器实现高速飞行与严格避障,在杂乱环境和森林中速度达7.5 m/s。

Comments Published in IEEE Robotics and Automation Letters

Journal ref IEEE Robotics and Automation Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03510 2026-07-01 cs.CV 版本更新

G2P: Gaussian-to-Point Attribute Alignment for Boundary-Aware 3D Segmentation

G2P:面向边界感知3D分割的高斯到点属性对齐

Hojun Song, Chae-yeong Song, Jeong-hun Hong, Chaewon Moon, Soo Ye Kim, Yiyi Liao, Jaehyup Lee, Sang-hyo Park

机构 * Kyungpook National University(庆北国立大学) Korea Electronics Technology Institute(韩国电子技术研究院) Adobe Research(Adobe研究院) Zhejiang University(浙江大学)

AI总结 提出G2P方法,通过将3D高斯泼溅的属性(如不透明度和尺度)传递到点云,解决几何特征无法区分外观相似物体的问题,实现边界感知的3D分割。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06625 2026-07-01 cs.CL 版本更新

FairJudge: An Adaptive, Debiased, and Consistent LLM-as-a-Judge

FairJudge: 一种自适应、去偏且一致的LLM作为评判者

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Xiao Xu, Shijian Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

AI总结 针对LLM评判系统在适应性、偏见和一致性上的局限,提出FairJudge,通过可学习正则化策略和课程式SFT-DPO-GRPO训练范式,实现自适应、去偏和一致评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01682 2026-07-01 cs.CL 版本更新

The Bidirectional Process Reward Model

双向过程奖励模型

Lingyin Zhang, Jun Gao, Xiaoxue Ren, Ziqiang Cao

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Biomedical Basic Research Center of Jiangsu, Soochow University(苏州大学江苏省生物医学基础研究中心) School of Software Technology, Zhejiang University(浙江大学软件学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院)

AI总结 提出双向过程奖励模型(BiPRM),通过并行左右评估流和门控机制融合分数,仅增加0.3%参数和5%延迟,在推理质量上平均提升10.6%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14819 2026-07-01 cs.CV cs.LG 版本更新

Capturing Context-Aware Route Choice Semantics for Trajectory Representation Learning

捕捉上下文感知路径选择语义的轨迹表示学习

Ji Cao, Yu Wang, Tongya Zheng, Jie Song, Qinghong Guo, Zujie Ren, Canghong Jin, Gang Chen, Mingli Song

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Zhejiang Lab(之江实验室) Zhejiang Provincial Engineering Research Center for Real-Time SmartTech in Urban Security Governance, Hangzhou City University(浙大城市学院浙江省城市安全治理实时智能技术工程研究中心) School of Software Technology, Zhejiang University(浙江大学软件学院) Polytechnic Institute of Zhejiang University(浙江大学工程师学院)

AI总结 提出CORE框架,通过多粒度环境感知模块和基于混合专家架构的路径选择编码器,将上下文感知的路径选择语义融入轨迹嵌入,在6个下游任务中平均提升9.20%。

Comments Accepted by IEEE Transactions on Knowledge and Data Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16757 2026-07-01 eess.AS cs.AI 版本更新

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

重新审视音频-语言预训练以学习通用音频表示

Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo, Yiwen Shao, Hao Zhang, Dong Yu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tencent AI Lab Seattle(腾讯AI实验室西雅图)

AI总结 本文通过构建大规模数据集CaptionStew并系统对比对比学习和字幕生成目标,揭示了音频-语言预训练在数据效率和可扩展性上的权衡,为通用音频表示学习提供了实证指导。

Comments ACL 2026 Main. Code available at https://github.com/AudenAI/Auden

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10895 2026-07-01 cs.AI 版本更新

LLM-Empowered Agentic MAC Protocols: A Dynamic Stackelberg Game Approach

LLM赋能的智能MAC协议:一种动态Stackelberg博弈方法

Renxuan Tan, Rongpeng Li, Fei Wang, Chenghui Peng, Shaoyun Wu, Zhifeng Zhao, Honggang Zhang

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院) Huawei Technologies Company Ltd.(华为技术有限公司) Zhejiang Lab(之江实验室) Zhejiang University(浙江大学) Macau University of Science and Technology(澳门科技大学)

AI总结 提出一种博弈论LLM赋能的多智能体深度强化学习框架,将上行传输建模为动态多追随者Stackelberg博弈,通过PPO协调LLM驱动代理合成自适应语义MAC协议,实现无需重训的泛化,吞吐量提升77.6%,公平性提升65.2%。

Comments This work has been submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15443 2026-07-01 cs.RO cs.AI 版本更新

A Scalable Whole-body Motion Transfer via Implicit Kinodynamic Motion Retargeting

可扩展的全身运动迁移:基于隐式动力学运动重定向

Xingyu Chen, Hanyu Wu, Sikai Wu, Mingliang Zhou, Diyun Xiang, Haodong Zhang, Yangchen Zhou, Yukang Gao, Yi Gu, Renjing Xu

机构 * HKUST(GZ)(香港科技大学(广州)) ETH Zurich(苏黎世联邦理工学院) Zhejiang University(浙江大学) Xiaomi Robotics Lab(小米机器人实验室)

AI总结 提出隐式动力学运动重定向(IKMR),利用骨架图卷积双自编码器将人体与机器人运动映射到共享拓扑潜空间,结合物理信息精炼实现高速、鲁棒的运动数据转换,解决噪声与计算瓶颈。

Comments RSS 2026 Workshop. Webpage: https://cybercal.github.io/webpage.ikmr

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17565 2026-06-29 cs.CV 版本更新

UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models

UniGeo:通过视频模型统一几何指导以实现相机可控的图像编辑

Hong Jiang, Wensong Song, Zongxin Yang, Ruijie Quan, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学) DBMI, HMS, Harvard University(DBMI、HMS、哈佛大学)

AI总结 UniGeo通过统一的几何指导在三个层面提升相机可控图像编辑的几何一致性与视觉质量,克服传统方法在连续相机运动下的几何漂移和结构退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04390 2026-06-29 cs.AI 版本更新

SciFig: Towards Automating Editable Figure Generation for Scientific Papers

SciFig:面向科学论文的可编辑图形自动生成

Siyuan Huang, Yifan Zhou, Yutong Gao, Zi Yin, Juyang Bai, Xinxin Liu, Rama Chellappa, Chun Pong Lau, Cheng Peng, Sayan Nag, Shraman Pramanick

机构 * Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Independant Researcher(独立研究者) Tsinghua University(清华大学) University of Central Florida(佛罗里达中央大学) City University of Hong Kong(香港城市大学) Adobe Research(Adobe研究)

AI总结 提出SciFig多智能体框架,从科学文本自动生成可编辑的高质量方法图,通过分解规划、布局、渲染和迭代优化,在435个基准上优于基线,平均10分钟生成可编辑图形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16116 2026-06-29 cs.CR cs.AI 版本更新

DMind Benchmark: Toward a Holistic Assessment of LLM Capabilities across the Web3 Domain

DMind Benchmark:面向Web3领域LLM能力的全面评估

Enhao Huang, Pengyu Sun, Shuxun Wang, Zixin Lin, Alex Chen, Kaichun Hu, Joey Ouyang, Frank Li, Zhiyu Zhang, Haobo Wang, Yiming Li, Zhan Qin, James Yi, Gang Zhao, Ziang Ling, Lowes Yang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 提出DMind Benchmark,覆盖Web3九个子领域,结合客观知识与开放推理任务,评估31个LLM,发现模型在安全审计等高推理任务中存在显著弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21477 2026-06-29 cs.CV 版本更新

Fine-Grained Behavior and Lane Constraints Guided Trajectory Prediction Method

细粒度行为与车道约束引导的轨迹预测方法

Wenyi Xiong, Jian Chen, Ziheng Qi

机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) Guangdong Provincial Key Laboratory of Fully Actuated System Control Theory and Technology, School of Automation and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学自动化与智能制造学院广东省全驱系统控制理论与技术重点实验室) Leapmotor Technology(零跑科技)

AI总结 提出BLNet双流架构,通过并行注意力机制融合行为意图识别与车道约束建模,利用两阶段解码器生成轨迹,在nuScenes和Argoverse数据集上显著提升预测精度。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17434 2026-06-26 cs.CV 版本更新

TinySR: Pruning Diffusion for Real-World Image Super-Resolution

TinySR:剪枝扩散模型用于现实世界图像超分辨率

Linwei Dong, Qingnan Fan, Yuhang Yu, Qi Zhang, Jinwei Chen, Yawei Luo, Changqing Zou

机构 * Zhejiang University(浙江大学) Vivo Mobile Communication Co. Ltd(沃伊通信有限公司) Zhejiang Lab(浙江实验室)

AI总结 本文提出TinySR,一种针对现实世界图像超分辨率的紧凑高效扩散模型,通过动态块激活和扩展-腐蚀策略实现实时性能与高质量输出,相比教师模型TSD-SR在计算成本和参数量上分别减少5.68倍和83%。

详情

展开后加载摘要…

URL PDF HTML 收藏