arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2909
2312.15946 2026-06-09 cs.SD cs.GR eess.AS 版本更新

EnchantDance: Unveiling the Potential of Music-Driven Dance Movement

EnchantDance: 揭示音乐驱动舞蹈动作的潜力

Bo Han, Teng Zhang, Zeyu Ling, Feilin Han

机构 * Zhejiang University(浙江大学) Tongji University(同济大学)

AI总结 提出EnchantDance框架,通过构建舞蹈潜在空间和扩散模型,结合大规模数据集ChoreoSpectrum3D和音乐流派预测网络,提升舞蹈生成的质量、多样性和一致性。

Comments Project Page: https://fluide1022.github.io/EnchantDance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07433 2026-06-08 cs.CV cs.AI cs.MM 新提交

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解

Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang

机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) CASIA(中国科学院自动化研究所) University of Tokyo(东京大学) University of Liverpool(利物浦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) UC Merced(加州大学默塞德分校)

AI总结 提出人类视角下视频理解的三个功能能力(观看、记忆、推理),构建统一框架分析视频MLLM的感知、记忆、推理和预测,并总结挑战、方法、应用及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07300 2026-06-08 cs.CL 新提交

Phun-Bench: Evaluating LLMs on Phonological Understanding in Chinese

Phun-Bench:评估大语言模型的中文语音理解能力

Xing Yue, Yongliang Shen, Weiming Lu

机构 * Zhejiang University(浙江大学)

AI总结 提出Phun-Bench基准,通过同音、押韵和语音相似性三个维度系统评估大语言模型的语音理解能力,发现模型在灵活运用语音知识方面存在不足。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07074 2026-06-08 cs.LG cs.AI 新提交

SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating

SlimSearcher: 通过自适应奖励门控实现训练效率感知的Web代理

Zequn Xie, Junjie Wang, Dan Yang, Jie Feng, Yue Shen, Jian Wang, Jinjie Gu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 提出SlimSearcher框架,通过帕累托高效过滤和自适应奖励门控,在保持或提升准确率的同时将工具调用轮次减少17%-58%。

Comments 17 pages, 8 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06891 2026-06-08 cs.CV 新提交

Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors

Stream3D-VLM:基于增量几何先验的在线3D空间理解

Hanxun Yu, Xuan Qu, Lei Ke, Boqiang Zhang, Yuxin Wang, Jianke Zhu, Dong Yu

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文汇) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出在线3D视觉语言模型Stream3D-VLM,通过自回归流控制、轻量视觉-空间特征融合模块和几何自适应体素压缩,实现从流式视频中实时理解3D空间,并构建超百万在线3D问答数据集,在多项任务上超越现有模型。

Comments Project Page: https://stream3d-vlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06819 2026-06-08 cs.CV 新提交

VideoSEG-O3: A Multi-turn Reinforcement Learning Framework for Reasoning Video Object Segmentation

VideoSEG-O3:用于推理视频对象分割的多轮强化学习框架

Ming Dai, Sen Yang, Boqiang Duan, Boyuan Tong, Jiedong Zhuang, Wankou Yang, Jingdong Wang

机构 * School of Automation, Southeast University, Nanjing, China Baidu Inc, Beijing, China College of Information Science \& Electronic Engineering, Zhejiang University, Hangzhou, China

AI总结 提出VideoSEG-O3,首个多轮强化学习框架,通过多轮时空思维链和SEG感知逻辑校准,实现从粗到细的推理视频对象分割,解决复杂视频中的精确像素定位问题。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06397 2026-06-08 cs.LG 版本更新

The Post-GCN Decade Revisited: Curvature-Stratified Evaluation of Relational Learning

后GCN十年回顾:曲率分层的关联学习评估

Shuo Wang, Xiangyu Wang, Quanxin Wang, Bailin Wu, Bokui Wang, Shunyang Huang, Boyan Deng, Haonan Liu, Ruiyi Fang, Zhenxiang Xu, Boyu Wang, Zhao Kang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tsinghua University(清华大学) Western University(西方大学) Zhejiang University(浙江大学)

AI总结 针对关联学习中统一基准掩盖几何依赖性性能的问题,提出曲率分层评估框架,通过将数据集按曲率正负零分区,揭示模型性能本质上是几何依赖的,并给出更可靠的评估协议。

Comments Comments: Suggestions and comments are welcomed

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04226 2026-06-08 cs.MA cs.AI 版本更新

SW-$A^2$-Bench: Benchmarking Autonomous Software Agent Generation for Agentic Web

SW-$A^2$-Bench: 面向智能体网络的自主软件智能体生成基准测试

Linyao Chen, Bo Huang, Qinlao Zhao, Shuai Shao, Zhi Han, Zicai Cui, Ziheng Zhang, Guangtao Zeng, Wenzheng Tang, Yikun Wang, Yuanjian Zhou, Zimian Peng, Yong Yu, Weiwen Liu, Hiroki Kobayashi, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Tokyo(东京大学) Huazhong University of Science and Technology(华中科技大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) Singapore University of Technology and Design(新加坡科技设计大学) Queen’s University(女王大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

AI总结 提出首个软件智能体生成基准SW-$A^2$-Bench,通过编码智能体自动将代码仓库转化为自主软件智能体,评估生成智能体的忠实性与互操作性,以扩展智能体网络规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02029 2026-06-08 cs.AI 版本更新

The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook

潜空间:基础、演化、机制、能力与展望

Xinlei Yu, Zhangquan Chen, Yongbo He, Tianyu Fu, Guanting Dong, Cheng Yang, Chengming Xu, Yue Ma, Xiaobin Hu, Zhe Cao, Jie Xu, Guibin Zhang, Jiale Tao, Jiayi Zhang, Siyuan Ma, Kaituo Feng, Haojie Huang, Youxing Li, Ronghao Chen, Huacan Wang, Chenglin Wu, Zikun Su, Xiaogang Xu, Kelu Yao, Kun Wang, Chen Gao, Yue Liao, Ruqi Huang, Tao Jin, Zhucun Xue, Cheng Tan, Jiangning Zhang, Wenqi Ren, Yanwei Fu, Yong Liu, Yu Wang, Xiangyu Yue, Yu-Gang Jiang, Shuicheng Yan

机构 * National University of Singapore(国立新加坡大学) Fudan University(复旦大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学) DeepWisdom(深智科技) Nanjing University(南京大学) Shanghai Jiatong University(上海交通大学) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文深) QuantaAlpha(量子阿尔法) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang Lab(浙江实验室) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学)

AI总结 本文综述潜空间在语言模型中的基础、演化、机制与能力,指出其克服显式空间计算的结构性限制,并展望未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22574 2026-06-08 cs.CV cs.AI 版本更新

Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models

增强视频表示中的时空语义残差以缓解视频大型多模态模型中的幻觉

Yuansheng Gao, Jinman Zhao, Tong Zhang, Xingguo Xu, Wenbin Xing, Han Bao, Zonghui Wang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) University of Toronto(多伦多大学) Dalian University of Technology(大连理工大学) Sun Yat-sen University(中山大学)

AI总结 提出ViSSRes方法,通过轻量级MLP网络学习视频表示的残差,从时空和语义一致性优化,在推理时仅需单次前向传播,有效降低幻觉率并提升视频理解性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06273 2026-06-05 cs.IT cs.AI math.IT

Adapting Diffusion Language Models for Lossless Pixel-Level Image Transmission

适应扩散语言模型用于无损像素级图像传输

Tianqi Ren, Rongpeng Li, Xianfu Chen, Yingyu Li, Zhifeng Zhao

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Shenzhen CyberAray Network Technology Co., Ltd(深圳CyberAray网络技术有限公司) School of Mechanical Engineering and Electronic Information, China University of Geosciences(中国地质大学(武汉)机械与电子信息学院) Zhejiang Lab(浙江实验室)

AI总结 提出基于离散扩散模型的分离源信道编码框架DDM-SSCC,通过双向注意力下的同步逆向算术编码实现无损像素级图像传输,并引入Halton引导去噪顺序、掩码率感知余弦调度和轻量温度校准模块提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06186 2026-06-05 cs.CV

Adversarial Attacks Already Tell the Answer: Directional Bias-Guided Test-time Defense for Vision-Language Models

对抗攻击已揭示答案:面向视觉语言模型的定向偏差引导测试时防御

Liangsheng Liu, Si Chen, Jiamin Wu, Weiwei Feng, Zhixin Cheng, Xiaotian Yin, Wenfei Yang, Tianzhu Zhang

机构 * University of Science and Technology of China(中国科学技术大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 提出定向偏差引导防御(DBD),利用对抗样本在CLIP特征空间中沿主导方向偏移的现象,通过估计防御方向并采用DB分数双流重建策略恢复鲁棒表示,在15个数据集上实现最先进对抗鲁棒性且保持干净准确率。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06159 2026-06-05 cs.AR cs.AI cs.NE

ITP-STDP: An Intrinsic-Timing Power-of-Two Learning Engine for On-Chip SNN Training

ITP-STDP:用于片上SNN训练的内在时序二次幂学习引擎

Haihang Xia, Xinyu Zhao, Xuecheng Wang, John Goodenough, Charith Abhayaratne, Panagiotis A. Panagiotou, Chunyi Song, Tiantai Deng

机构 * School of Electrical and Electronic Engineering, The University of Sheffield(谢菲尔德大学电子与电气工程学院) Donghai Laboratory(东海实验室) Engineering Research Center of Oceanic Sensing Technologyand Equipment, Ministry of Education(教育部海洋传感技术与设备工程研究中心) State Key Laboratory of Ocean Sensing and Ocean College, Zhejiang University(浙江大学海洋传感与海洋学院国家重点实验室)

AI总结 针对SNN训练中权重更新计算量大导致的硬件资源与能耗问题,提出基于内在时序二次幂的STDP算法(ITP-STDP)及其硬件架构,通过算法与硬件优化消除大部分计算开销,在FPGA和ASIC平台上实现能效和速度的显著提升。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06079 2026-06-05 cs.CL

SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization

SkillComposer: 学习演化智能体技能以实现特化与泛化

Qi Zhang, Zhaopeng Feng, Xiaonan Shi, Xiaomeng Hu, Chu Liu, Pengjun Xie, Xiaobin Wang, Jieping Ye, Bryan Hooi, Haobo Wang, Junbo Zhao

机构 * Zhejiang University(浙江大学) Tongyi Lab(通义实验室) National University of Singapore(新加坡国立大学)

AI总结 提出SkillComposer框架,通过创建、改进和合并三种可学习操作,使语言模型在推理时自我演化技能,支持离线、在线和混合部署模式,在多个基准上提升性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05916 2026-06-05 cs.CV

Unveiling the Unknown: Open Vocabulary Object Detection with Scene Graphs

揭示未知:基于场景图的开放词汇目标检测

Yi Chen, Yinghao Lu, Zhehao Li, Chenchen Yan, Jiafei Wu, Chong Wang, Jiangbo Qian

机构 * Faculty of Electrical Engineering and Computer Science, Ningbo University(宁波大学电气工程与计算机科学学院) Faculty of Computing, Georg-August-Universität Göttingen(哥廷根大学计算机学院) Merchants’ Guild Economics and Cultural Intelligent Computing Laboratory, Ningbo University(宁波大学商帮经济与文化智能计算实验室) School of Software Technology, Zhejiang University(浙江大学软件学院)

AI总结 提出场景引导的关系建模检测框架,利用场景图捕获候选区域与上下文对象之间的结构化语义和空间关系,并通过关系注意力模块和场景文本对齐分支增强开放词汇目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05880 2026-06-05 cs.RO

TAGA: Terrain-aware Active Gaze Learning for Generalizable Agile Humanoid Locomotion

TAGA:面向可泛化敏捷人形运动的地形感知主动注视学习

Peizhuo Li, Hongyi Li, Mingfeng Fan, Fangzhou Xu, Shuhao Liao, Yuxuan Ma, Zicheng Zeng, Ze Wang, Yongbin Jin, Yuhong Cao, Hongtao Wang, Guillaume Sartoretti

机构 * MarmotLab, National University of Singapore(马尔莫实验室,新加坡国立大学) Center of X-Mechanics, Zhejiang University(浙大X力学中心) South China University of Technology(华南理工大学)

AI总结 提出TAGA框架,通过融合视觉、本体感觉和运动命令,让模型学习主动注视地形关键区域,在有限计算资源下提高感知密度,实现鲁棒且可泛化的敏捷人形运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05875 2026-06-05 cs.AI cs.DB

QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving

QCFuse: 通过压缩视图的查询感知缓存融合实现高效RAG服务

Jianxin Yan, Wangze Ni, Zhenxin Li, Jiabao Jin, Zhitao Shen, Haoyang Li, Jia Zhu, Peng Cheng, Xuemin Lin, Lei Chen, Kui Ren

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Ant Group(蚂蚁集团) The Hong Kong Polytechnic University(香港理工大学) Zhejiang Normal University(浙江师范大学) Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 提出QCFuse,一种基于压缩视图的查询感知选择器,通过块锚查询探测和关键层分析实现高效RAG缓存融合,在保持全预填充质量的同时平均加速1.7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05836 2026-06-05 cs.CL

ProSPy: A Profiling-Driven SQL-Python Agentic Framework for Enterprise Text-to-SQL

ProSPy: 面向企业级Text-to-SQL的剖析驱动的SQL-Python智能体框架

Zhaorui Yang, Huawei Zheng, Sen Yang, Yuhui Zhang, Haoxuan Li, Zhizhen Yu, Xuan Yi, Chen Hou, Defeng Xie, Chao Hu, Minfeng Zhu, Dazhen Deng, Haozhe Feng, Danqing Huang, Yingcai Wu, Peng Chen, Wei Chen

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) School of Software Technology(软件技术学院) Tencent TEG(腾讯科技集团) School of Mathematical Sciences, Peking University(北京大学数学科学学院) Zhejiang University(浙江大学)

AI总结 提出ProSPy框架,通过自动剖析、模式剪枝、中间视图获取和Python分析四阶段,结合SQL高效性与Python灵活性,解决企业级数据库Text-to-SQL中的模式异构、元数据不完整和复杂分析问题。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05800 2026-06-05 cs.LG

SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter

SALT: 当更多 rollout 在基于组的策略优化中无益时如何使其发挥作用

Powei Chang, Jinpeng Zhang, Chaoqun Sun, MiniWell Tsao, Lianrui Li, Jianxiang Xiang, Chenyu Wang, Yukang Gao, Dongying Kong

机构 * Bilibili Inc.(哔哩哔哩公司) Fudan University(复旦大学) Zhejiang University(浙江大学)

AI总结 针对 GRPO 风格组归一化中增加 rollout 数量导致梯度抵消的问题,提出 SALT 组件,通过子空间自适应重加权组相对更新系数,改善更新几何并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05769 2026-06-05 cs.CV

Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction

在预测之前想象:用于视频事件预测的交错潜在视觉推理

Tianxiang Jiang, Linquan Wu, Sheng Xia, Songze Li, Ziang Yan, Haoyu Yang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) City University of Hong Kong(香港城市大学) Nanjing University(南京大学) Fudan University(复旦大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 提出Future-L1框架,通过交错潜在视觉推理在自回归解码中交替语言token和连续潜在视觉跨度,结合LA-DAPO强化学习优化,在视频事件预测任务上取得最先进结果。

Comments https://github.com/OpenGVLab/Future-L1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05670 2026-06-05 cs.AI

Do More Agents Help? Controlled and Protocol-Aligned Evaluation of LLM Agent Workflows

更多智能体有帮助吗?LLM智能体工作流的受控与协议对齐评估

Yuhang Fu, Ruishan Fang, Jiaqi Shao, Huiyu Zheng, Zhengtao Zhu, Bing Luo, Tao Lin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Westlake University(西湖大学) Zhejiang University(浙江大学) Duke Kunshan University(杜克大学昆山分校) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学)

AI总结 提出BenchAgent框架,在统一协议下比较单智能体、固定多智能体和演化多智能体工作流,发现大多数多智能体系统在准确率上未超越单智能体基线,但运行时生成的工作流在GAIA上表现优异。

Comments https://github.com/LINs-lab/MASArena/tree/BenchAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05644 2026-06-05 cs.AI

FIDES: Faithful Inference via Deep Evidence Signals for Retrieval-Memory Conflict in RAG

FIDES: 通过深层证据信号实现RAG中检索-记忆冲突的忠实推理

Zhe Yu, Wenpeng Xing, Tiancheng Zhao, Mohan Li, Changting Lin, Meng Han

机构 * Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Zhejiang University(浙江大学) Guangzhou University(广州大学) GenTel.io

AI总结 针对检索增强生成中检索证据与参数记忆冲突导致模型忽略上下文的问题,提出无训练解码器FIDES,通过融合输出表面、隐藏表示和预测轨迹三种内部信号,在token级别动态调整干预强度,显著提升上下文忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05198 2026-06-05 q-bio.BM cs.LG

An accurate nucleic acid-small molecule docking framework via geometric deep learning with large-scale pretraining

基于几何深度学习与大尺度预训练的核酸-小分子精准对接框架

Shi Li, Xujun Zhang, Mingquan Liu, Hui Zhang, Shuoying Jia, Yu Kang, Tingjun Hou, Peichen Pan

机构 * College of Pharmaceutical Sciences, Zhejiang University(浙江大学药学院) Faculty of Health Sciences, University of Macau(澳门大学健康科学学院) Zhejiang Provincial Key Laboratory for Intelligent Drug Discovery and Development, Jinhua Institute of Zhejiang University(浙江省智能药物发现与开发重点实验室,浙江大学金华研究院) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出NucleoDock框架,通过物理引导的大规模预训练和精细调优,结合序列、结构及原子级特征,利用混合密度网络几何评分头实现核酸-小分子对接,在125个复合物基准上达到56%的top-1成功率(RMSD<2.0Å),优于传统方法。

Comments 34 pages, 4 figures, 4 tabels, Supplementary Materials includes 8 tabels

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05172 2026-06-05 cs.HC cs.CV

Is This Edit Correct? A Multi-Dimensional Benchmark for Reasoning-Aware Image Editing

这个编辑正确吗?面向推理感知图像编辑的多维度基准

Yixuan Ding, Wei Huang, Ruijie Quan, Xiaojuan Qi, Yi Yang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

AI总结 提出RE-Edit基准,从物理、环境、文化、因果和指代五个推理维度评估图像编辑系统,发现现有模型在隐式逻辑约束推理上存在不足,并引入轻量级推理引导后编辑基线。

Comments 23 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25158 2026-06-05 cs.AI

Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills

Trace2Skill: 将轨迹局部经验转化为可迁移的代理技能

Jingwei Ni, Yihao Liu, Xinpeng Liu, Yutao Sun, Mengyu Zhou, Pengyu Cheng, Dexin Wang, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * ETH Zürich University of Zurich(苏黎世联邦理工学院) Peking University(北京大学) Zhejiang University(浙江大学) Qwen Large Model Application Team, Alibaba(阿里巴巴文心一言应用团队)

AI总结 本文提出Trace2Skill框架,通过归纳推理将广泛执行轨迹整合为统一的技能目录,有效提升代理技能的可迁移性和实用性,适用于多种领域。

Comments Work in Progress. May version add more experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23190 2026-06-05 cs.SE cs.AI

RAT: RunAnyThing via Fully Automated Environment Configuration

RAT: 通过完全自动化的环境配置实现RunAnyThing

Renhong Huang, Dongdong Hua, Yifei Sun, Sitao Ding, Hanyang Yuan, Daixin Wang, Yang Yang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 本文提出RAT框架,用于在任意仓库上实现跨编程语言的全自动环境配置,通过多阶段流水线整合语言感知抽象、镜像初始化、专用配置工具集和稳健沙箱,并提出RATBench基准测试集,实验表明RAT在环境设置成功率上比强基线提升了36.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00573 2026-06-05 cs.CL

CoMoL: Efficient Mixture of LoRA Experts via Dynamic Core Space Merging

CoMoL: 通过动态核心空间融合实现高效的LoRA专家混合

Jie Cao, Zhenxuan Fan, Zhuonan Wang, Tianwei Lin, Ziyuan Zhao, Rolan Yan, Wenqiao Zhang, Feifei Shao, Hongwei Wang, Jun Xiao, Siliang Tang

机构 * Zhejiang University(浙江大学) Wechat, Tencent(微信,腾讯)

AI总结 本文提出CoMoL,一种新的MoE-LoRA框架,通过引入核心空间专家和核心空间路由,实现参数高效和细粒度适应,同时在多个任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18383 2026-06-05 cs.AI cs.CL cs.LG

Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models

动态思维-令牌选择用于大型推理模型中的高效推理

Zhenyuan Guo, Tong Chen, Wenlong Meng, Chen Gong, Xin Yu, Chengkun Wei, Wenzhi Chen

机构 * Zhejiang University(浙江大学)

AI总结 本研究提出动态思维-令牌选择方法,通过分析推理轨迹发现只有部分关键令牌影响最终答案,从而优化大型推理模型的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10486 2026-06-05 cs.AI cs.CL

IDEAL: Leveraging Infinite and Dynamic Characterizations of Large Language Models for Query-focused Summarization

IDEAL: 利用大型语言模型的无限和动态特性进行查询导向的摘要

Jie Cao, Dian Jiao, Yang Dai, Rolan Yan, Wenqiao Zhang, Siliang Tang

机构 * Zhejiang University(浙江大学) Tencent, Wechat(腾讯,微信)

AI总结 本文针对查询导向摘要问题,提出两种核心方法:高效细粒度查询-LLM对齐和长文档摘要,通过Query-aware HyperExpert和Query-focused Infini-attention模块实现,实验验证了方法的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05143 2026-06-04 cs.RO

HORIZON: Recoverability-Governed Curriculum for Physical-Domain Scaling

HORIZON: 基于可恢复性的物理域缩放课程

Chenhao Bai, Liqin Lu, Kaijun Wang, Hui Chen, Jin-Chuan Shi, Yuyang Liu, Hao Chen, Chunhua Shen

机构 * Zhejiang University, State Key Lab of CAD & CG(浙江大学,计算机辅助设计与图形学国家重点实验室) Zhejiang University of Technology(浙江工业大学)

AI总结 针对机器人策略在物理域缩放中的可学习性问题,提出基于可恢复性的前沿课程HORIZON,通过回滚和边界细化逐步扩展物理域,实验揭示了物理域扩展的三个规律。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏