arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2931
2603.03002 2026-03-04 cs.AI

SpatialText: A Pure-Text Cognitive Benchmark for Spatial Understanding in Large Language Models

SpatialText: 一种纯文本的认知基准,用于大型语言模型中的空间理解

Peiyao Jiang, Zequn Qin, Xi Li

机构 * Zhejiang University(浙江大学) School of Software Technology, Zhejiang University(软件技术学院,浙江大学)

AI总结 SpatialText通过双源方法为大型语言模型提供纯文本空间认知基准,揭示其在空间推理中的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02964 2026-03-04 cs.CV

Improving Anomaly Detection with Foundation-Model Synthesis and Wavelet-Domain Attention

通过基础模型合成与小波域注意力改进异常检测

Wensheng Wu, Zheming Lu, Ziqian Lu, Zewei He, Xuecheng Sun, Zhao Wang, Jungong Han, Yunlong Yu

机构 * organization= School of Aeronautics Astronautics , addressline= Zhejiang University , city= Hangzhou , postcode= 310027 , country= China organization= School of Computer Science organization= Ningbo Innovation Center , addressline= Zhejiang University , city= Ningbo , country= China organization= Department of Automation , addressline= Tsinghua University , city= Beijing , postcode= 100084 , country= China organization= College of Information Science \& Electronic Engineering , addressline= Zhejiang University , city= Hangzhou , postcode= 310027 , country= China

AI总结 本文提出基于基础模型的异常合成方法和小波域注意力模块,通过生成逼真异常样本和增强特征提取,提升工业异常检测的灵敏度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02760 2026-03-04 cs.CL cs.AI

Efficient Self-Evaluation for Diffusion Language Models via Sequence Regeneration

通过序列再生实现扩散语言模型的高效自评

Linhao Zhong, Linyu Wu, Wen Wang, Yuling Xi, Chenchen Jing, Jiaheng Zhang, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Zhejiang University of Technology(浙江工业大学)

AI总结 本文提出DiSE方法,通过序列再生概率实现扩散语言模型的高效自评,提升质量评估的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26645 2026-03-04 cs.CV

TTT3R: 3D Reconstruction as Test-Time Training

TTT3R: 3D重建作为测试时训练

Xingyu Chen, Yue Chen, Yuliang Xiu, Andreas Geiger, Anpei Chen

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Uni of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心)

AI总结 TTT3R通过测试时训练方法提升3D重建的长度泛化能力,实现全局姿态估计性能提升2倍,运行效率高且内存消耗低。

Comments Page: https://rover-xingyu.github.io/TTT3R/ Code: https://github.com/Inception3D/TTT3R

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16894 2026-03-04 cs.CL

Make LoRA Great Again: Boosting LoRA with Adaptive Singular Values and Mixture-of-Experts Optimization Alignment

让LoRA更出色:通过自适应奇异值和专家混合优化对齐提升LoRA

Chenghao Fan, Zhenyi Lu, Sichen Liu, Chengfeng Gu, Xiaoye Qu, Wei Wei, Yu Cheng

机构 * School of Computer Science \& Technology, Huazhong University of Science The Chinese University of Hong Kong Zhejiang University

AI总结 GOAT通过自适应奇异值和专家混合优化对齐提升LoRA性能,实现在多个任务上的最优表现。

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02216 2026-03-04 cs.LG cs.AI

ATPO: Adaptive Tree Policy Optimization for Multi-Turn Medical Dialogue

ATPO:多轮医疗对话中的自适应树策略优化

Ruike Cao, Shaojie Bai, Fugen Yao, Liang Dong, Jian Xu, Li Xiao

机构 * University of Science and Technology of China(中国科学技术大学) Qwen Applications Business Group, Alibaba Group(阿里云应用业务部) Zhejiang University(浙江大学)

AI总结 ATPO通过自适应树策略优化提升多轮医疗对话中的信息获取效率,有效解决不确定性问题,实验表明其在医疗对话任务中表现优异。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02215 2026-03-04 cs.LG cs.AI

RxnNano:Training Compact LLMs for Chemical Reaction and Retrosynthesis Prediction via Hierarchical Curriculum Learning

RxnNano:通过层次化课程学习训练紧凑的LLM用于化学反应和逆合成预测

Ran Li, Shimin Di, Haowei LI, Luanshi Bu, Jiachuan Wang, Wangze Ni, Lei Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southeast University(东南大学) Zhejiang University(浙江大学)

AI总结 RxnNano通过层次化课程学习训练紧凑LLM,提升化学反应和逆合成预测性能,实现23.5%准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14744 2026-03-04 cs.CL

Rethinking the Role of LLMs in Time Series Forecasting

重新思考LLMs在时间序列预测中的作用

Xin Qiu, Junlong Tong, Yirong Sun, Yunpu Ma, Wei Zhang, Xiaoyu Shen

机构 * Ningbo Key Laboratory of Spatial Intelligence(空间智能 Ningbo 关键实验室) Digital Derivative, Institute of Digital Twin, Eastern Institute of Technology, Ningbo(数字衍生,数字孪生研究所,东部技术研究所,Ningbo) Zhejiang University(浙江大学)

AI总结 本文研究了LLMs在时间序列预测中的作用,发现其在跨域泛化和复杂动态建模中表现优异,提供了有效模型设计的指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17520 2026-03-04 cs.RO cs.CV

InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation

InstructVLA: 从理解到操作的视觉-语言-动作指令微调

Shuai Yang, Hao Li, Bin Wang, Yilun Chen, Yang Tian, Tai Wang, Hanqing Wang, Feng Zhao, Yiyi Liao, Jiangmiao Pang

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 InstructVLA通过视觉-语言-动作指令微调,实现了在多模态推理和动作生成之间的平衡,提升了机器人在复杂任务中的操控性能和泛化能力。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02049 2026-03-03 cs.CV

WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories

WorldStereo: 通过3D几何记忆桥接相机引导的视频生成与场景重建

Yisu Zhang, Chenjie Cao, Tengfei Wang, Xuhui Zuo, Junta Wu, Jianke Zhu, Chunchao Guo

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文心)

AI总结 WorldStereo通过3D几何记忆模块实现相机引导视频生成与3D场景重建的高效融合,提升多视角一致性与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01801 2026-03-03 cs.AI

What Papers Don't Tell You: Recovering Tacit Knowledge for Automated Paper Reproduction

论文未告诉你什么:为自动化论文复现恢复隐性知识

Lehui Li, Ruining Wang, Haochen Song, Yaoxin Mao, Tong Zhang, Yuyao Wang, Jiayi Fan, Yitong Zhang, Jieping Ye, Chengqi Zhang, Yongshun Gong

机构 * School of Software, Shandong University China Beijing Institute of Technology China Zhejiang University China Dept.\ of Math \& Statistics, Boston University USA College of AI, Tsinghua University China Alibaba Group China The Hong Kong Polytechnic University Hong Kong SAR, China School of Software, Shandong University Beijing Institute of Technology Zhejiang University Dept.\ of Math \& Statistics, Boston University College of AI, Tsinghua University Alibaba Group The Hong Kong Polytechnic University

AI总结 本文提出一种基于图的智能体框架,通过恢复关系型、身体型和集体型隐性知识,提升自动化论文复现性能。

Comments 32 pages (+ appendix), 8 figures. Lehui Li and Ruining Wang contributed equally. Yongshun Gong is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01714 2026-03-03 cs.LG cs.CL

TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training

TopoCurate:基于交互拓扑的工具使用代理训练建模

Jinluan Yang, Yuxin Liu, Zhengyu Chen, Chengcheng Han, Yueqing Sun, Qi Gu, Hui Su, Xunliang Cai, Fei Wu, Kun Kuang

机构 * Zhejiang University, Hangzhou, China(浙江大学)

AI总结 TopoCurate通过交互拓扑建模提升工具使用代理训练效果,采用双选择机制优化SFT和RL性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01700 2026-03-03 cs.RO

TacMamba: A Tactile History Compression Adapter Bridging Fast Reflexes and Slow VLA Reasoning

TacMamba: 一种连接快速反射与慢速VLA推理的触觉历史压缩适配器

Zhenan Wang, Yanzhe Wang, Meixuan Ren, Peng Li, Yang Liu, Yifei Nie, Limin Long, Yun Ye, Xiaofeng Wang, Zhen Zhu, Huixu Dong

机构 * Zhejiang University(浙江大学) GigaAI Harbin Institute of Technology(哈尔滨工业大学)

AI总结 TacMamba通过触觉历史压缩器和双阶段训练策略,实现高频率触觉数据与低频视觉推理的高效融合,提升实时任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01441 2026-03-03 cs.CV cs.RO

Unifying Language-Action Understanding and Generation for Autonomous Driving

统一语言-动作理解与生成以实现自动驾驶

Xinyang Wang, Qian Liu, Wenjie Ding, Zhao Yang, Wei Li, Chang Liu, Bailin Li, Kun Zhan, Xianpeng Lang, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Li Auto

AI总结 LinkVLA通过统一语言和动作令牌及两步生成方法,提升自动驾驶中语言-动作一致性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01101 2026-03-03 cs.SD cs.AI

SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation

SyncTrack: 多轨音乐生成中的节奏稳定性与同步

Hongrui Wang, Fan Zhang, Zhiyuan Yu, Ziya Zhou, Xi Chen, Can Yang, Yang Wang

机构 * Department of Mathematics, The Hong Kong University of Science and Technology(香港科学与技术大学数学系) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(香港科学与技术大学跨学科研究学院) State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology(香港科学与技术大学神经系统紊乱国家重点实验室) The University of Hong Kong(香港大学)

AI总结 SyncTrack通过同步多轨波形音乐生成模型提升多轨音乐的节奏一致性和同步性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23893 2026-03-03 cs.CV cs.RO

AoE: Always-on Egocentric Human Video Collection for Embodied AI

AoE: 始终在线的以自身为中心的人类视频采集用于具身AI

Bowen Yang, Zishuo Li, Yang Sun, Changtao Miao, Yifan Yang, Man Luo, Xiaotong Yan, Feng Jiang, Jinchuan Shi, Yankai Fu, Ning Chen, Junkai Zhao, Pengwei Wang, Guocai Yao, Shanghang Zhang, Hao Chen, Zhe Li, Kai Zhu

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhejiang University(浙江大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 AoE系统通过利用人类和智能手机低成本采集以自身为中心的现实世界交互数据,解决具身AI的数据稀缺问题,提升现实世界泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23166 2026-03-03 cs.CV

AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios

AgentVista: 评估在超挑战性现实视觉场景中的多模态代理

Zhaochen Su, Jincheng Gao, Hangyu Guo, Zhenhua Liu, Lueyang Zhang, Xinyu Geng, Shijue Huang, Peng Xia, Guanyu Jiang, Cheng Wang, Yue Zhang, Yi R. Fung, Junxian He

机构 * Hong Kong University of Science and Technology(香港理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 AgentVista 是一个评估多模态代理在超挑战性现实视觉场景中能力的基准,通过真实场景和复杂工具交互任务揭示现有模型在长时间多模态工具使用方面的不足。

Comments The project website is available at https://agentvista-bench.github.io/, and the code is available at https://github.com/hkust-nlp/AgentVista

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16110 2026-03-03 cs.CV cs.AI

OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis

OmniCT:迈向统一的切片-体积LVLM以实现全面的CT分析

Tianwei Lin, Zhongwei Qiu, Wenqiao Zhang, Jiang Liu, Yihan Xie, Mingjian Gao, Zhenxuan Fan, Zhaocheng Li, Sijing Li, Zhongle Xie, Peng LU, Yueting Zhuang, Ling Zhang, Beng Chin Ooi, Yingda Xia

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云学术院) Hupan Lab(虎派实验室)

AI总结 OmniCT提出了一种统一的切片-体积LVLM,通过空间一致性增强、器官级语义增强和MedEval-CT数据集,实现了全面的CT分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04369 2026-03-03 cs.LG

Multi-scale hypergraph meets LLMs: Aligning large language models for time series analysis

多尺度超图与大语言模型:面向时间序列分析的对齐方法

Zongjiang Shang, Dongliang Cui, Binqing Wu, Ling Chen

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

AI总结 本文提出MSH-LLM方法,通过多尺度超图机制和跨模态对齐模块,提升大语言模型在时间序列分析中的表现。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26585 2026-03-03 cs.MA cs.AI

Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems

停止浪费你的令牌:迈向高效的运行时多智能体系统

Fulin Lin, Shaowen Chen, Ruishan Fang, Hongwei Wang, Tao Lin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 SupervisorAgent通过运行时自适应监督框架减少多智能体系统中的令牌消耗,提升效率与鲁棒性。

Comments Accepted to ICLR 2026. The code is available at https://github.com/LINs-lab/SupervisorAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19400 2026-03-03 cs.CV

Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes

跨视角视觉:评估视觉-语言模型在机器人场景中的空间推理能力

Zhiyuan Feng, Zhaolu Kang, Qijie Wang, Zhiying Du, Jiongrui Yan, Shubin Shi, Chengbo Yuan, Huizhi Liang, Yu Deng, Qixiu Li, Rushuai Yang, Arctanx An, Leqi Zheng, Weijie Wang, Shawn Chen, Sicheng Xu, Yaobo Liang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Peking University(北京大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

AI总结 本文提出MV-RoboBench基准,评估视觉-语言模型在机器人场景中的多视角空间推理能力,揭示其在多视角机器人感知中的挑战。

Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://aaronfengzy.github.io/MV-RoboBench-Webpage/

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25175 2026-03-03 cs.CL cs.AI

EasySteer: A Unified Framework for High-Performance and Extensible LLM Steering

EasySteer: 一种高绩效且可扩展的LLM引导统一框架

Haolei Xu, Xinyu Mei, Yuchen Yan, Rui Zhou, Wenqi Zhang, Weiming Lu, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学)

AI总结 EasySteer通过模块化架构和预计算引导向量,实现高效且可扩展的LLM引导,提升推理效率并支持多种应用场景。

Comments Functionality upgrade. Code: https://github.com/ZJU-REAL/EasySteer Demo: https://www.youtube.com/watch?v=3rRGzZmhrXg

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19965 2026-03-03 cs.AI

Adaptive Location Hierarchy Learning for Long-Tailed Mobility Prediction

自适应位置层级学习用于长尾移动预测

Yu Wang, Junshu Dai, Yuchen Ying, Hanyang Yuan, Zunlei Feng, Tongya Zheng, Mingli Song

机构 * Zhejiang University(浙江大学) Hangzhou City University(杭州市大学)

AI总结 ALOHA通过自适应层级学习缓解长尾移动预测偏差,提升多种模型的预测性能达16.59%。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18041 2026-03-03 cs.CV cs.RO

Openfly: A comprehensive platform for aerial vision-language navigation

Openfly:面向空中视觉-语言导航的综合性平台

Yunpeng Gao, Chenhui Li, Zhongrui You, Junli Liu, Zhen Li, Pengan Chen, Qizhi Chen, Zhonghan Tang, Liansheng Wang, Penghui Yang, Yiwen Tang, Yuhang Tang, Shuai Liang, Songyi Zhu, Ziqin Xiong, Yifei Su, Xinyi Ye, Jianan Li, Yan Ding, Dong Wang, Xuelong Li, Zhigang Wang, Bin Zhao

机构 * Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Beihang University(北航) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) East China University of Science and Technology(东华大学) Fudan University(复旦大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) TeleAI

AI总结 OpenFly平台通过整合多种渲染引擎和自动化工具链,构建大规模空中VLN数据集,并提出关键帧感知的VLN模型,提升户外空中视觉-语言导航的研究与应用。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01025 2026-03-03 cs.LG cs.AI

One-Token Verification for Reasoning Correctness Estimation

单token验证用于推理正确性估计

Zhan Zhuang, Xiequn Wang, Zebin Chen, Feiyang Ye, Ying Wei, Kede Ma, Yu Zhang

机构 * Southern University of Science(南方科技大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 本文提出单token验证方法,用于高效估计推理正确性,通过低秩适应集成到LLM中,减少token使用并提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00590 2026-03-03 cs.AI

Fair in Mind, Fair in Action? A Synchronous Benchmark for Understanding and Generation in UMLLMs

公平在心,公平在行?一个用于理解与生成的同步基准:UMLLMs的公平性评估

Yiran Zhao, Lu Zhou, Xiaogang Xu, Zhe Liu, Jiafei Wu, Liming Fang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Chinese University of Hong Kong(香港中文大学) School of Software Technology, Zhejiang University(浙江大学软件学院) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心)

AI总结 IRIS基准通过同步评估UMLLMs的理解与生成任务公平性,揭示系统性偏见现象并提供公平性优化指导。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00578 2026-03-03 cs.AI cs.CL

Draft-Thinking: Learning Efficient Reasoning in Long Chain-of-Thought LLMs

草稿式推理:在长链式推理LLM中学习高效推理

Jie Cao, Tianwei Lin, Zhenxuan Fan, Bo Yuan, Ziyuan Zhao, Rolan Yan, Wenqiao Zhang, Siliang Tang

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

AI总结 Draft-Thinking通过草稿式推理结构和渐进式课程学习,在长链式推理LLM中实现高效推理,显著降低推理预算并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00517 2026-03-03 cs.LG cs.AI

FastBUS: A Fast Bayesian Framework for Unified Weakly-Supervised Learning

FastBUS: 一种用于统一弱监督学习的高效贝叶斯框架

Ziquan Wang, Haobo Wang, Ke Chen, Lei Feng, Gang Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 FastBUS提出了一种高效贝叶斯框架,通过概率转移和低秩假设加速弱监督学习,实现多类别批量处理和显著提升运行效率。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00503 2026-03-03 cs.CV

M$^2$: Dual-Memory Augmentation for Long-Horizon Web Agents via Trajectory Summarization and Insight Retrieval

M$^2$: 通过轨迹摘要和洞察检索实现长 horizon 网络代理的双记忆增强

Dawei Yan, Haokui Zhang, Guangda Huzhang, Yang Li, Yibo Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Ying Li, Wei Dong, Chunhua Shen

机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学) AI Business, Alibaba Group, Hangzhou, China(阿里云人工智能业务) Xi'an University of Architecture(西安建筑科技大学) Zhejiang University, Hangzhou, China(浙江大学)

AI总结 M$^2$通过双记忆机制提升长 horizon 网络代理的上下文效率和决策鲁棒性,实现更高成功率和更低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00426 2026-03-03 cs.CL cs.CV

LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation

基于大语言模型的引导式目标发现指导:用于基于事实的多模态大语言模型医疗报告生成

Cunyuan Yang, Dejuan Song, Xiaotao Pang, Qianqian Shen, Wenjie Nie, Yifan Huang, Lei Wu, Wei Han, Haishuai Wang, Jiajun Bu

机构 * Zhejiang University(浙江大学) The Second Affiliated Hospital Zhejiang University School of Medicine(浙江大学医学院附属第二医院) Hangzhou Pu Jian Medical Technology Co., Ltd.(杭州普健医疗科技有限公司)

AI总结 本文提出Fact-Flow框架,通过引导大语言模型生成事实准确的医疗报告,利用LLM自动生成标注数据集,提升医疗报告生成的事实准确性。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏