arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2931
2505.15801 2026-02-19 cs.CL cs.AI

VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models

VerifyBench: 大型语言模型参考式奖励系统的基准测试

Yuchen Yan, Jin Jiang, Zhenbang Ren, Yijun Li, Xudong Cai, Yang Liu, Xin Xu, Mengdi Zhang, Jian Shao, Yongliang Shen, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Meituan Group(美团集团) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 VerifyBench通过设计专门的基准测试评估基于参考的奖励系统,揭示现有验证器在复杂任务中的不足,推动推理模型训练的改进。

Comments ICLR 2026: https://openreview.net/forum?id=JfsjGmuFxz Project Page: https://zju-real.github.io/VerifyBench Dataset: https://huggingface.co/datasets/ZJU-REAL/VerifyBench Code: https://github.com/ZJU-REAL/VerifyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00539 2026-02-18 cs.CL cs.AI

Intermittent Semi-Working Mask: A New Masking Paradigm for LLMs

间歇半工作掩码:一种新的LLM掩码范式

HaoYuan Hu, Mingcong Lu, Di Luo, XinYa Wu, Jiangcai Zhu, Taoye Yin, Zheng Li, Hao Wang, Shusheng Zhang, KeZun Zhang, KaiLai Shao, Chao Chen, Feng Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 间歇半工作掩码通过引入稀疏双向注意力,实现高效多轮对话和上下文密集型任务处理,同时保持推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15521 2026-02-18 cs.CL cs.LG

ExpertWeaver: Unlocking the Inherent MoE in Dense LLMs with GLU Activation Patterns

ExpertWeaver: 通过GLU激活模式解锁密集大语言模型中的内在MoE

Ziyu Zhao, Tong Zhu, Zhi Zhang, Tiantian Fan, Jinluan Yang, Kun Kuang, Zhongyu Wei, Fei Wu, Yu Cheng

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Chinese University of Hong Kong(中国香港大学)

AI总结 ExpertWeaver通过GLU激活模式解锁密集大语言模型中的内在MoE,提供无需训练的高效转换方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15400 2026-02-18 cs.RO

One Agent to Guide Them All: Empowering MLLMs for Vision-and-Language Navigation via Explicit World Representation

一个引导所有代理:通过显式世界表示增强多模态大语言模型用于视觉-语言导航

Zerui Li, Hongpei Zheng, Fangguo Zhao, Aidan Chan, Jian Zhou, Sihao Lin, Shijie Li, Qi Wu

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学) Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR))

AI总结 通过显式世界表示增强多模态大语言模型,实现视觉-语言导航的解耦框架,提升导航性能与现实应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15384 2026-02-18 cs.AI cs.CL

World-Model-Augmented Web Agents with Action Correction

具有动作修正的世界模型增强型网络代理

Zhouzhou Shen, Xueyu Hu, Xiyun Li, Tianqing Fang, Juncheng Li, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Tencent AI Lab(腾讯AI实验室)

AI总结 WAC通过多代理协作和风险感知机制,提升网络代理在复杂任务中的鲁棒性和执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15063 2026-02-18 cs.RO cs.HC

How Do We Research Human-Robot Interaction in the Age of Large Language Models? A Systematic Review

在大语言模型时代如何研究人机交互?一项系统综述

Yufeng Wang, Yuan Xu, Anastasia Nikolova, Yuxuan Wang, Jianyu Wang, Chongyang Wang, Xin Tong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学) Savannah College of Art and Design(萨凡纳艺术设计学院) West China Hospital, Sichuan University(四川大学华西医院)

AI总结 本文系统综述了大语言模型时代人机交互的研究现状,揭示了LLMs对HRI基本原理的影响及当前研究的探索性特征,提出了未来研究的设计考虑与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14492 2026-02-18 cs.CL cs.IR

Query as Anchor: Scenario-Adaptive User Representation via Large Language Model

查询作为锚点:通过大语言模型实现场景自适应的用户表示

Jiahao Yuan, Yike Xu, Jinyong Wen, Baokun Wang, Ziyi Gao, Xiaotong Lin, Yun Liu, Xing Fu, Yu Cheng, Yongchao Liu, Weiqiang Wang, Zhongle Xie

机构 * Ant Group(蚂蚁集团) East China Normal University(东华大学) Zhejiang University(浙江大学)

AI总结 通过Query-as-Anchor框架,利用大语言模型实现动态查询感知的用户表示,提升工业级用户建模的场景适应性和性能表现。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10509 2026-02-18 cs.SD cs.AI

MARS-Sep: Multimodal-Aligned Reinforced Sound Separation

MARS-Sep: 多模态对齐强化声音分离

Zihan Zhang, Xize Cheng, Zhennan Jiang, Dongjie Fu, Jingyuan Chen, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 MARS-Sep通过强化学习框架实现多模态对齐,提升声音分离的语义一致性和信号质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15022 2026-02-17 cs.LG cs.AI math.GR q-bio.BM

Rethinking Diffusion Models with Symmetries through Canonicalization with Applications to Molecular Graph Generation

通过规范化的扩散模型重新思考对称性:应用于分子图生成

Cai Zhou, Zijie Chen, Zian Li, Jike Wang, Kaiyi Jiang, Pan Li, Rose Yu, Muhan Zhang, Stephen Bates, Tommi Jaakkola

机构 * Massachusetts Institute of Technology(麻省理工学院) Zhejiang University(浙江大学) Peking University(北京大学) Georgia Institute of Technology(佐治亚理工学院) Princeton University(普林斯顿大学) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 本文提出通过规范化的扩散模型生成分子图,利用几何谱和位置编码提升生成效果,优于等变基线方法。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14833 2026-02-17 eess.SP cs.LG

RF-GPT: Teaching AI to See the Wireless World

RF-GPT:教AI看见无线世界

Hang Zou, Yu Tian, Bohao Wang, Lina Bariah, Samson Lasaulce, Chongwen Huang, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(数字未来研究院,哈利法大学) College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学) Université de Lorraine, CNRS, CRAN(洛林大学,CNRS,CRAN)

AI总结 RF-GPT通过多模态LLM的视觉编码器处理RF频谱图,实现射频信号的高级推理与生成,无需人工标注即可在多个无线任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14721 2026-02-17 cs.AI

WebWorld: A Large-Scale World Model for Web Agent Training

WebWorld: 一个大规模的世界模型用于网络代理训练

Zikai Xiao, Jianhong Tu, Chuhang Zou, Yuxin Zuo, Zhi Li, Peng Wang, Bowen Yu, Fei Huang, Junyang Lin, Zuozhu Liu

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

AI总结 WebWorld是一个大规模开放网络模拟器,通过大规模训练实现网络代理的有效训练,展示了在多个领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14174 2026-02-17 cs.RO

Direction Matters: Learning Force Direction Enables Sim-to-Real Contact-Rich Manipulation

方向至关重要:学习力的方向使模拟到现实的接触丰富操作成为可能

Yifei Yang, Anzhe Chen, Zhenjie Zhu, Kechun Xu, Yunxuan Mao, Yufei Wei, Lu Chen, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)

AI总结 本文提出了一种通过学习力方向来提升模拟到现实接触丰富操作性能的方法,利用专家设计的控制器逻辑和有限状态机,在四个真实任务中实现了更高的成功率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09713 2026-02-17 cs.CV

Stroke3D: Lifting 2D strokes into rigged 3D model via latent diffusion models

Stroke3D: 通过潜在扩散模型将2D笔触提升为拟合的3D模型

Ruisi Zhao, Haoren Zheng, Zongxin Yang, Hehe Fan, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAAI、浙江大学) DBMI, HMS, Harvard University(DBMI、HMS、哈佛大学)

AI总结 Stroke3D通过潜在扩散模型,将用户绘制的2D笔触和文本提示转化为拟合的3D模型,实现可控的骨骼生成和纹理网格合成。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12991 2026-02-17 cs.HC cs.CL

RAGExplorer: A Visual Analytics System for the Comparative Diagnosis of RAG Systems

RAGExplorer: 一种用于RAG系统比较诊断的可视化分析系统

Haoyu Tian, Yingchaojie Feng, Zhen Wen, Haoxuan Li, Minfeng Zhu, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学) School of Computing, National University of Singapore(computing学院,新加坡国立大学) Zhejiang University(浙江大学)

AI总结 RAGExplorer是一种用于RAG系统比较诊断的可视化分析系统,通过宏观到微观的工作流程帮助开发者理解性能权衡并优化设计。

Comments 11 pages, 7 figures. Accepted to IEEE TVCG (PacificVis 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00232 2026-02-17 cs.CL cs.AI cs.CY cs.LG

BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses

BiasFreeBench: 一个用于减轻大型语言模型响应偏见的基准测试

Xin Xu, Xunzhi He, Churan Zhi, Ruizhe Chen, Julian McAuley, Zexue He

机构 * UC San Diego(加州大学圣地亚哥分校) Columbia University(哥伦比亚大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学)

AI总结 BiasFreeBench通过统一测试平台评估八种主流偏见缓解方法,提供响应层面的偏见自由分数,旨在提升大型语言模型的公平性和安全性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18129 2026-02-17 math.OC cs.DC cs.LG

Pareto-optimal Trade-offs Between Communication and Computation with Flexible Gradient Tracking

在通信与计算之间实现帕累托最优的灵活梯度追踪

Yan Huang, Jinming Xu, Li Chai, Jiming Chen, Karl H. Johansson

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Division of Decision and Control Systems, School of EECS, KTH Royal Institute of Technology(皇家理工学院电子工程系决策与控制系统 division)

AI总结 本文提出FlexGT和Acc-FlexGT方法,在非凸和强凸情况下分别实现通信与计算的帕累托最优权衡。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14530 2026-02-17 cs.RO

Learning to Pick: A Visuomotor Policy for Clustered Strawberry Picking

学习选择:一种用于聚类草莓采摘的视觉-运动策略

Zhenghao Fei, Wenwu Lu, Linsheng Hou, Chen Peng

机构 * ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University, Hangzhou, China(浙江大学杭州国际科技创新中心)

AI总结 本研究提出了一种基于人类示范的视觉-运动策略,用于解决遮挡环境下草莓采摘的挑战,通过改进的ACT模型实现高效精准采摘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23522 2026-02-17 cs.CV cs.LG

OmniEarth-Bench: Towards Holistic Evaluation of Earth's Six Spheres and Cross-Spheres Interactions with Multimodal Observational Earth Data

OmniEarth-Bench: 向全面评估地球六大球体及跨球体交互的多模态观测地球数据迈进

Fengxiang Wang, Mingshuo Chen, Xuming He, Yi-Fan Zhang, Yueying Li, Feng Liu, Zijie Guo, Zhenghao Hu, Jiong Wang, Jingyi Xu, Zhangrui Li, Junchao Gong, Di Wang, Fenghua Ling, Ben Fei, Weijia Li, Long Lan, Wenjing Yang

机构 * National University of Defense Technology, China(国防科技大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Beijing University of Posts and Telecommunications, China(北京邮电大学) Zhejiang University, China(浙江大学) Shanghai Jiao Tong University, China(上海交通大学) Fudan University, China(复旦大学) Sun Yat-sen University, China(中山大学) Nanjing University, China(南京大学) University of Science and Technology of China(中国科学技术大学) Wuhan University, China(武汉大学)

AI总结 OmniEarth-Bench是首个全面评估地球六大球体及跨球体交互的多模态基准测试,通过29,855个标准化注释揭示了地球系统认知能力的系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20630 2026-02-17 eess.AS cs.MM cs.SD

ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting

ISDrama: 通过多模态提示生成沉浸式空间戏剧

Yu Zhang, Wenxiang Guo, Changhao Pan, Zhiyuan Zhu, Tao Jin, Zhou Zhao

机构 * Zhejiang University, Shanghai AI Lab(浙江大学上海人工智能实验室) Zhejiang University(浙江大学)

AI总结 ISDrama通过多模态提示生成沉浸式空间戏剧,首次结合多模态数据建模和戏剧语调生成。

Comments Accepted by ACM Multimedia 2025

Journal ref MM '2025: Proceedings of the 33rd ACM International Conference on Multimedia Pages 9618 - 9627

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19062 2026-02-17 eess.AS cs.CL cs.SD

Versatile Framework for Song Generation with Prompt-based Control

具有基于提示控制的多功能歌曲生成框架

Yu Zhang, Wenxiang Guo, Changhao Pan, Zhiyuan Zhu, Ruiqi Li, Jingyu Lu, Rongjie Huang, Ruiyuan Zhang, Zhiqing Hong, Ziyue Jiang, Zhou Zhao

机构 * Zhejiang University(浙江大学)

AI总结 VersBand通过多任务框架实现基于提示的可控高质量歌曲生成,包含人声、伴奏、歌词和旋律生成模型,实验表明其在多个任务中表现优异。

Comments Accepted by Findings of EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16717 2026-02-17 cs.RO

Strawberry Robotic Operation Interface: An Open-Source Device for Collecting Dexterous Manipulation Data in Robotic Strawberry Farming

草莓机器人操作接口:一种用于收集机器人草莓种植中灵巧操作数据的开源设备

Linsheng Hou, Wenwu Lu, Yanan Wang, Chen Peng, Zhenghao Fei

机构 * Technological Innovation Center, Zhejiang University, Hangzhou, 311215, China(浙江大学杭州技术创新中心) College of Biosystems Engineering(生物系统工程学院) Food Science, Zhejiang University, Hangzhou, 310058, China(食品科学学院)

AI总结 本文提出了一种开源设备SROI,用于收集机器人草莓种植中灵巧操作数据,通过模块化末端执行器和立体摄像头实现野外环境下的数据采集,并发布数据集促进相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13832 2026-02-17 eess.AS cs.CL cs.SD

GTSinger: A Global Multi-Technique Singing Corpus with Realistic Music Scores for All Singing Tasks

GTSinger: 一个包含真实音乐谱的全球多技术歌唱语料库,适用于所有歌唱任务

Yu Zhang, Changhao Pan, Wenxiang Guo, Ruiqi Li, Zhiyuan Zhu, Jialei Wang, Wenhao Xu, Jingyu Lu, Zhiqing Hong, Chuxin Wang, LiChao Zhang, Jinzheng He, Ziyue Jiang, Yuxin Chen, Chen Yang, Jiecheng Zhou, Xinyu Cheng, Zhou Zhao

机构 * Zhejiang University(浙江大学)

AI总结 GTSinger是一个包含真实音乐谱的全球多技术歌唱语料库,旨在通过高质量数据和多任务支持提升歌唱任务的可控性和多样性。

Comments Accepted by NeurIPS 2024 (Spotlight)

Journal ref Advances in Neural Information Processing Systems 37 (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13273 2026-02-17 cs.DB cs.AI cs.DC

MergePipe: A Budget-Aware Parameter Management System for Scalable LLM Merging

MergePipe: 一种面向可扩展大语言模型融合的预算感知参数管理系统

Yuanyi Wang, Yanggan Gu, Zihao Wang, Kunxi Li, Yifan Yang, Zhaoyi Yan, Congkai Xie, Jianmin Wu, Hongxia Yang

机构 * Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

AI总结 MergePipe通过预算感知的参数管理实现高效的大语言模型融合,减少I/O并提升整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13035 2026-02-16 cs.LG cs.AI cs.CL

Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL

向内看,向外探:通过分层强化学习从LLM内部状态学习温度策略

Yixiao Zhou, Yang Li, Dongzhou Cheng, Hehe Fan, Yu Cheng

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 Introspective LLM通过分层强化学习从LLM内部状态学习温度策略,提升数学推理任务中的探索效率与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12205 2026-02-16 cs.CV cs.AI

DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing

DeepGen 1.0: 一种轻量级统一多模态模型,用于推进图像生成与编辑

Dianyi Wang, Ruihang Li, Feng Han, Chaofan Ma, Wei Song, Siyuan Wang, Yibin Wang, Yi Xin, Hongjian Liu, Zhixiong Zhang, Shengyuan Ding, Tianhang Wang, Zhenglin Cheng, Tao Lin, Cheng Jin, Kaicheng Yu, Jingjing Chen, Wenjie Wang, Zhongyu Wei, Jiaqi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) University of Southern California(南加州大学)

AI总结 DeepGen 1.0通过轻量级统一多模态模型在图像生成与编辑领域实现高性能,采用SCB框架和数据驱动训练策略,超越大参数模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12135 2026-02-16 cs.CL

WavBench: Benchmarking Reasoning, Colloquialism, and Paralinguistics for End-to-End Spoken Dialogue Models

WavBench: 语音对话模型推理、口语化和副语言能力的基准测试

Yangzhuo Li, Shengpeng Ji, Yifu Chen, Tianle Liang, Haorong Ying, Yule Wang, Junbo Li, Jun Fang, Zhou Zhao

机构 * Xiamen University(厦门大学) Zhejiang University(浙江大学) CUHK-Shenzhen(香港中文大学(深圳))

AI总结 WavBench通过三重框架评估语音对话模型的推理、口语化和副语言能力,推动真实场景下的对话模型发展。

Comments Open-source at https://naruto-2024.github.io/wavbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12044 2026-02-16 cs.CV

A DMD-Based Adaptive Modulation Method for High Dynamic Range Imaging in High-Glare Environments

基于DMD的自适应调制方法用于高动态范围成像在高眩光环境中的应用

Banglei Guan, Jing Tao, Liang Xu, Dongcai Tan, Pengju Sun, Jianbing Liu, Yang Shang, Qifeng Yu

机构 * College of Aerospace Science and Engineering, National University of Defense Technology(航空航天科学与工程学院,国防科技大学) Hunan Provincial Key Laboratory of Image Measurement and Vision Navigation(湖南省图像测量与视觉导航重点实验室) College Of Optoelectric Science and Engineering, Zhejiang University(光电科学与工程学院,浙江大学)

AI总结 本文提出基于DMD的自适应调制方法,实现高动态范围成像,有效解决高眩光环境下的图像饱和问题,提升DIC精度和应变误差控制。

Comments This paper has been accepted by Experimental Mechanics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08676 2026-02-16 cs.LG cs.AI

LLaDA2.1: Speeding Up Text Diffusion via Token Editing

LLaDA2.1: 通过令牌编辑加速文本扩散

Tiwei Bie, Maosong Cao, Xiang Cao, Bingsen Chen, Fuyuan Chen, Kun Chen, Lun Du, Daozhuo Feng, Haibo Feng, Mingliang Gong, Zhuocheng Gong, Yanmei Gu, Jian Guan, Kaiyuan Guan, Hongliang He, Zenan Huang, Juyong Jiang, Zhonghui Jiang, Zhenzhong Lan, Chengxi Li, Jianguo Li, Zehuan Li, Huabin Liu, Lin Liu, Guoshan Lu, Yuan Lu, Yuxin Ma, Xingyu Mou, Zhenxuan Pan, Kaida Qiu, Yuji Ren, Jianfeng Tan, Yiding Tian, Zian Wang, Lanning Wei, Tao Wu, Yipeng Xing, Wentao Ye, Liangyu Zha, Tianze Zhang, Xiaolu Zhang, Junbo Zhao, Da Zheng, Hao Zhong, Wanli Zhong, Jun Zhou, Junlin Zhou, Liwang Zhu, Muzhi Zhu, Yihong Zhuang

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Westlake University(西湖大学) Southern University of Science and Technology(南方科技大学)

AI总结 LLaDA2.1通过结合令牌编辑与掩码到令牌方案,实现解码速度与生成质量的平衡,展示了在大规模扩散模型上的性能提升。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12287 2026-02-16 cs.CL cs.AI eess.AS

Retrieval-Augmented Self-Taught Reasoning Model with Adaptive Chain-of-Thought for ASR Named Entity Correction

带有自适应思维链的检索增强自教推理模型用于ASR命名实体修正

Junjie An, Jingguang Tian, Tianyi Wang, Yu Gao, Xiaofeng Mou, Yi Xu

机构 * AI Research Institute, Midea Group (Shanghai) Co.,Ltd., China(美的集团(上海)研究院) Zhejiang University, China(浙江大学)

AI总结 本文提出一种检索增强自教推理模型,用于改进ASR中命名实体修正,通过自适应思维链和音节级编辑距离提升纠错效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12159 2026-02-13 cs.RO cs.AI

3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting

3DGSNav: 通过主动3D高斯散射增强视觉-语言模型的物体导航

Wancai Zheng, Hao Chen, Xianlong Lu, Linlin Ou, Xinyi Yu

机构 * Zhejiang University of Technology, Hangzhou, China(浙江工业大学,杭州,中国) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

AI总结 3DGSNav通过主动3D高斯散射提升视觉-语言模型的物体导航能力,结合结构化视觉提示和链式推理,实现高效且可靠的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏