arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 413
2607.10299 2026-07-14 cs.LG 新提交

Empowering Long-form Omni-modal Understanding with Robust Audio Perception

通过强大的音频感知增强长格式全模态理解

Kaiying Yan, Luoyi Sun, Xiao Zhou, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学 上海人工智能研究院) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 为解决全模态理解不足问题,提出AVDC数据集及AVDC-QA-CoT数据集,利用现成模型标注视频,采用两阶段训练范式,在多下游任务实验中取得显著性能提升,推动全模态感知发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10244 2026-07-14 cs.LG 新提交

DSSMs: State Space Models with Explicit Memory via Delay Differential Equations

DSSMs:通过延迟微分方程实现的具有显式记忆的状态空间模型

Yixiao Qian, Song Chen, Jiaxu Liu, Shengze Cai, Chao Xu

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Department of Mathematics, National University of Singapore(新加坡国立大学数学系) School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院)

AI总结 研究针对状态空间模型压缩历史信息能力有限的问题,提出延迟状态空间模型DSSMs,通过显式延迟状态反馈增强离散SSM循环,推导传递函数在频域计算内核,解决相关工具难题,在延迟检索任务上有显著改进,性能优于S4D。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09818 2026-07-14 cs.RO cs.AI cs.CV 新提交

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) Tongji University(同济大学)

AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。

Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09773 2026-07-14 cs.AI cs.CL cs.LG 新提交

EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents

EvoCUA-1.5:用于多轮计算机使用智能体的在线强化学习

Mianqiu Huang, Taofeng Xue, Chong Peng, Jinrui Ding, Sicheng Fan, Jiale Hong, Yufei Gao, Xiaocheng Zhang, Linsen Guo, Xin Yang, Dengchang Zhao, Yuchen Xie, Peng Pei, Xunliang Xie, Xipeng Qiu

机构 * Meituan(美团) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 研究多轮计算机使用智能体的在线强化学习问题,提出EvoCUA-1.5,通过STEPO、DTAC等方法应对多轮交互挑战,经实验验证其提高了训练稳定性和下游性能,为在线强化学习提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09711 2026-07-14 cs.LG cs.SE 新提交

EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?

EvoClawBench:智能体能否从自身运行中学习可复用技能?

Zhiyuan Peng, Xin Yin, Chenhao Ying, Zhe Cui, Zixiang Ding, Zhenhua Liu, Jiang Wu, Yuan Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Hithink Research(同花顺研究院)

AI总结 研究智能体能否从自身运行学可复用技能,引入EvoClawBench基准测试,涵盖多任务多子问题并支持多运行时。实验对比不同方式,发现直接基线性能依赖运行时,自我创作技能效果各异,表明学习可复用技能有选择性且成本敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09709 2026-07-14 cs.AI cs.SE 新提交

The Verifier is the Curriculum: Execution-Gated Self-Distillation for Cross-Family Game Generation

验证器即课程:用于跨家族游戏生成的执行门控自蒸馏

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

机构 * Institute of Science Tokyo(东京科学研究所) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对游戏生成中代码生成器的优化,提出执行门控自蒸馏方法,通过严格启动过滤器提升跨家族泛化能力,在GameCraft-Bench上实验表明该方法显著提高干净生成率和覆盖率,验证器对模型学习有重要作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09135 2026-07-13 cs.CV 新提交

Super-Generalist: Towards Comprehensive and Accurate Medical Image Understanding via Generalist-Specialist Synergy

超级通才:通过通才-专才协同实现全面准确的医学图像理解

Shaoteng Zhang, Weiwei Cao, Wanxing Chang, Yutong Xie, Kai Cao, Zaiyi Liu, Yu Shi, Tingbo Liang, Qi Zhang, Ling Zhang, Yong Xia, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室) Department of Radiology, Ningbo No. 2 Hospital(宁波市第二医院放射科) Department of Radiology, Guangdong Provincial People’s Hospital(广东省人民医院放射科) Department of Radiology, Shanghai Institution of Pancreatic Disease(上海胰腺疾病研究所放射科) Department of Radiology, Shengjing Hospital of China Medical University(中国医科大学附属盛京医院放射科) The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 研究旨在通过通才-专才协同实现全面准确的医学图像理解。提出SuG框架,整合多分割专家空间先验进行视觉-语言对齐,利用病变掩码校准注意力。在多CT基准测试中评估,其在疾病诊断任务中性能领先,超越专才模型,有强大病变定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09091 2026-07-13 cs.CV 新提交

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

超越时间偏移:将全能语言模型(Omni-LLM)适配为生成式视听模型的无参考评估器

Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(易路泰克科技)

AI总结 研究针对视听生成模型跨模态同步评估难题,提出框架解决人类与自动化评估指标的矛盾。通过引入数据集、适配模型及提出优化方法,实现先进的人类偏好对齐,建立标准化基准推动评估从信号相关性到因果关系发展。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09068 2026-07-13 cs.CV cs.AI 新提交

OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents

OmniMapBench:对多样化地图文档进行以视觉为中心的推理基准测试

Yang Chen, Yunwen Li, Yufan Shen, Minghao Liu, Tianyu Zheng, Bin Fu, Qunshu Lin, Zhi Yu, Botian Shi

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学)

AI总结 针对LVLMs文档理解中视觉推理基准测试不足的问题,提出OmniMapBench,含2096个问答对,设计了视觉依赖指数(VDI)量化基准属性,评估25个LVLMs发现性能差距大,推动了以视觉为中心的推理进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09065 2026-07-13 cs.SE cs.AI 新提交

Inside the Skill Market: From Software Engineering Activities to Reusable Agent Skills

深入技能市场:从软件工程活动到可复用的智能体技能

Jialun Cao, Xinru Yan, Songqiang Chen, Yaojie Lu, Zhongxin Liu, Shing-Chi Cheung

机构 * The Hong Kong University of Science(香港科技大学) University of Chinese Academy of Sciences Beijing, China(中国科学院大学) Institute of Software, Chinese Academy of Sciences Beijing, China(中国科学院软件研究所) Zhejiang University Hangzhou, China(浙江大学)

AI总结 研究探讨软件工程活动如何转化为可复用智能体技能。通过对公共库和市场中SE技能大规模实证研究,分析其封装活动、生命周期覆盖等,发现SE活动正通过技能成为可复用工件,为技能推荐等提供研究机会及相关机制需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08786 2026-07-13 cs.LG cs.AI cs.AR 新提交

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices

使用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理

Tao Lu, Haoyu Wang, Zonghui Wang, Keshen Xiang, Jiaheng Zhang, Wenzhi Chen

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 研究大语言模型推理成本挑战,提出含稀疏张量核层等的三层矩阵存储格式,设计联合稀疏张量核与CUDA核的SpMM内核,实现了在现代GPU上超越密集矩阵乘法,取得显著加速。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08605 2026-07-10 cs.CV cs.AI cs.LG 新提交

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

当结构化稀疏自编码器跨模态学习一致概念时

Weiduo Liao, Yunqiao Yang, Ying Wei

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 研究视觉语言模型中普通稀疏自编码器难以学习模态一致概念的问题,提出结构化稀疏自编码器$S^2AE$,通过图像块分组及结构化稀疏正则化强化概念一致性,经实验验证该方法在语义对齐等方面有提升,能促进跨模态表示更连贯解缠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08270 2026-07-10 cs.CV 新提交

Progression as Latent Drift: Generative Forecasting of Slow-Evolving Pathologies

作为潜在漂移的进展:缓慢演变病理的生成预测

Yuxiang Feng, Juncheng Wang, Chao Xu, Wenlong Hou, Huihan Wang, Yijie Qian, Yang Liu, Baigui Sun, Yong Liu, Shujun Wan

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(IROOTECH技术) Wolf 1069 b Lab, Sany Group(Wolf 1069 b实验室,三一集团)

AI总结 研究针对缓慢演变神经退行性疾病未来解剖结构预测难题,提出潜在漂移的渐进生成框架,在压缩语义表示中学习变化,结合有限标量量化抑制干扰波动,实验表明该方法在神经预测上优于基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12886 2026-07-10 cs.CV cs.AI 新提交

Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement

交错思维中的模态隔离桥接:通过逐步强化监督模态转换

Tingyu Li, Le Zhou, Siyuan Li, Yujun Wu, Xinglong Xu, Jingxuan Wei, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 提出MoTiF框架,通过反射式SFT和Flow-GRPO优化模态转换保真度,解决交错思维中图像与文本脱节的模态隔离问题,提升跨模态一致性和任务准确性。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07608 2026-07-09 cs.RO cs.CV 新提交

Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

用于机器人操作的视觉-语言-动作模型中的双潜记忆

Hongyu Qu, Jianzhe Gao, Xiaobin Hu, Shaohuan Yang, Xinlei Yu, Rui Yan, Wenguan Wang, Xiangbo Shu, Shuicheng Yan

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对主流VLA模型处理长期任务的不足,提出LaMem-VLA框架,通过四个协调组件将历史经验重构为潜记忆令牌并与VLA推理直接交织,实现在同一潜空间处理历史经验,经实验验证该框架具有优越性。

Comments Project page: https://github.com/quhongyu/LaMem-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06699 2026-07-09 cs.RO 新提交

RoboSnap: One-Shot Real-to-Sim Scene Generation for Generalizable Robot Learning and Evaluation

RoboSnap:用于可泛化机器人学习与评估的一次性真实到模拟场景生成

Shujie Zhang, Jingkun Yi, Weipeng Zhong, Zirui Zhou, Yangkun Zhu, Hanqing Wang, Xudong Xu, Weinan Zhang, Chunhua Shen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 针对构建物理稳定且视觉逼真场景缓慢昂贵的问题,提出RoboSnap框架,通过分层设计将单张RGB图像转为模拟场景,实验证明其能实现轨迹重放等,还引入DROID-Sim数据集,凸显真实到模拟方法对机器人学习评估的价值。

Comments 24 pages, 16 figures, Project page: https://robosnap.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06631 2026-07-09 cs.CV cs.AI cs.LG 新提交

Dynamic-in-Few-Step: Unifying Dynamic Computation and Few-Step Distillation for Efficient Video Generation

动态少步长:统一动态计算与少步长蒸馏以实现高效视频生成

Yu Cheng, Siyue Yao, Zhongang Qi, Shanyan Guan, Wei Li, Fajie Yuan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) BlueImage, vivo(蓝城图像,维沃) Xian Jiaotong-Liverpool University(西交利物浦大学)

AI总结 针对视频扩散模型计算成本高问题,提出将动态结构稀疏化融入蒸馏过程的加速框架,联合优化去噪步骤与模型稀疏性,引入相关策略和机制确保训练稳定,开发推理引擎,有效提升效率且保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06560 2026-07-08 cs.CV 新提交

Vision as Unified Multimodal Generation

视觉作为统一的多模态生成

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。

Comments 48 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06136 2026-07-08 cs.CV cs.MM 新提交

Tuning-Free Latent Diffusion Models for Ultrahigh-Resolution Image Editing

用于超高分辨率图像编辑的免调优潜在扩散模型

Wanglong Lu, Lingming Su, Kaijie Shi, Minglun Gong, Xiaogang Jin, Hanli Zhao, Xianta Jiang

机构 * College of Computer Science and Artificial Intelligence, Wenzhou University(温州大学计算机科学与人工智能学院) Department of Computer Science, Memorial University of Newfoundland(纽芬兰纪念大学计算机科学系) AI Analytics Team, Nasdaq(纳斯达克人工智能分析团队) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

AI总结 针对现有图像编辑方法在高分辨率处理上的局限,提出免调优的UltraDiffEdit框架,通过多尺度渐进编辑、多补丁编码、全局-局部一致性去噪及补丁混合采样等技术,实现高质量超高分辨率图像编辑,处理能力达8K且灵活性高。

Comments 29 pages, 29 figures. Published in IEEE Transactions on Neural Networks and Learning Systems

Journal ref IEEE Transactions on Neural Networks and Learning Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05841 2026-07-08 cs.HC cs.AI 新提交

VisTCP: A Visualization Framework to Construct Knowledge-Graph-Based Representation for Traditional Chinese Painting

VisTCP:一种用于构建基于知识图谱的中国传统绘画表示的可视化框架

Zhiguang Zhou, Fengling Zheng, Miaoxin Hu, Lina You, Jin Wen, Huan Liu, Wei Zhang, Dekun Qian, Yuhua Liu, Wei Chen, Yigang Wang, Yong Wang

机构 * School of Media and Design, Hangzhou Dianzi University(杭州电子科技大学媒体与设计学院) School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 针对中国传统绘画语义理解难题,提出VisTCP框架,结合智能模型与专家知识,通过构建语义分类法、训练模型、设计可视化视图,实现人在回路的迭代优化,有效支持TCP的结构化表示和语义理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05794 2026-07-08 cs.AI 新提交

From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space

从被动检索到主动记忆导航:学习将记忆用作结构化动作空间

Yue Xu, Yutao Sun, Yihao Liu, Mengyu Zhou, Jiayi Qiao, Lu Ma, Kai Tang, Wenjie Wang, Xiaoxi Jiang, Guanjun Jiang

机构 * Alibaba(阿里巴巴) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对个性化对话代理中记忆系统的被动性问题,提出NapMem框架,将用户记忆组织成多粒度金字塔并通过工具暴露层次,经记忆工具强化学习训练智能体,在多任务实验中具竞争力,还进行了多方面分析,证明结构化存储与策略结合对长期用户记忆有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05348 2026-07-07 cs.CV cs.RO 新提交

Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis

超越孤立对象:基于3D场景图分析的关系感知开放词汇场景理解

Xianhao Chen, Jiarui Hu, Yuanbo Yang, Xiyu Zhang, Tengyue Wang, Hujun Bao, Guofeng Zhang, Zhaopeng Cui

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Zhejiang University(浙江大学)

AI总结 针对现有开放词汇3D理解方法忽略对象关系的问题,提出RelGraphOV框架,通过3D场景图与自适应门控双流式图注意力网络,提升场景理解性能与泛化性。

Comments Project Page: https://cxavireh.github.io/relgraphov-projectpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05347 2026-07-07 cs.CV 新提交

WildSplat: Feedforward Gaussian Splatting from Unposed In-the-Wild Images

WildSplat:基于无位姿野外图像的前向高斯溅射方法

Xiyu Zhang, Jingyu Zhuang, Hongjia Zhai, Zizheng Yan, Jinwei Chen, Guofeng Zhang, Qingnan Fan

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) vivo BlueImage Lab(vivo蓝河图像实验室)

AI总结 针对前向3D重建在光照变化场景下性能不佳的问题,提出双分支解耦架构的WildSplat框架,实现单步前向的野外新视角合成与外观编辑SOTA性能。

Comments 22 pages, 9 figures; Accepted by ECCV 2026. Project page: https://zju3dv.github.io/wildsplat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05290 2026-07-07 cs.CV 新提交

ChatImage: Navigating Long-Form LLM Answers through Interactive Images

ChatImage:通过交互式图像导航大语言模型的长文本回答

Wencan Jiang, Jiangning Zhang, Yong Liu

机构 * Zhejiang University(浙江大学)

AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。

Comments Project:https://wencanjiang.github.io/ChatImage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05174 2026-07-07 cs.AI 新提交

AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

AgentGym2:在去理想化真实世界环境中评测大语言模型智能体

Zhiheng Xi, Dingwen Yang, Jiaqi Liu, Jixuan Huang, Honglin Guo, Baodai Huang, Tinggang Chen, Qi Zhang, Zhonghang Lu, Chenyu Liu, Jiajun Sun, Jiazheng Zhang, Dingwei Zhu, Xin Guo, Junzhe Wang, Zhihao Zhang, Yuming Yang, Junjie Ye, Minghe Gao, Dongrui Liu, Jiaming Ji, Guohao Li, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghaijiaotong University(上海交通大学) Peking University(北京大学)

AI总结 针对现有LLM智能体基准过于理想化的问题,提出去理想化评测框架AgentGym2,可全面测查智能体实操能力,实验显示当前SOTA模型仍存在明显性能缺口。

Comments Accepted as a main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04963 2026-07-07 cs.AI 新提交

STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training

STAPO:用于大语言模型智能体训练的选择性轨迹感知策略优化

Qiuyi Qi, Tian Liang, Mutian Bao, Jinjian Zhang, Dongnan Liu, Wei Zhou, Linjian Mo, Ming Kong, Jie Liu, Feng Zhang, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学) College of Artificial Intelligence, Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院人工智能学院) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

AI总结 针对强化学习训练大语言模型智能体时轨迹忽视问题,提出归一化熵,引入STAPO框架,利用其定位异常步骤,通过联合机制优化,提升轨迹感知并保持训练稳定性,实验验证其有效性和鲁棒性。

Comments ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04854 2026-07-07 cs.AI 新提交

CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs

CARL:用于大语言模型规划的约束感知强化学习

Qiuyi Qi, Jinjian Zhang, Mutian Bao, Tian Liang, Guocong Li, Dongnan Liu, Wei Zhou, Jie Liu, Ming Kong, Linjian Mo, Feng Zhang, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学) College of Artificial Intelligence, Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院人工智能学院) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

AI总结 研究大语言模型生成违反任务约束计划的问题,提出约束感知强化学习框架CARL,通过比较不同输入下模型输出分布引入奖励,提升模型约束意识,实验证明其优于基线和现有模型。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04636 2026-07-07 cs.CV 新提交

Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis

通过场景感知文档合成增强关键信息提取中的大型多模态模型

Zhipeng Xu, Zulong Chen, Qing Liu, Junhao Ji, Jinxin Hu, Yipeng Yu, Jianqiang Wan, Jun Tang, Zhao Li

机构 * Alibaba Group(阿里巴巴集团) Qwen Team, Alibaba Group(阿里巴巴集团之通义千问团队) Taobao and Tmall Group, Alibaba(阿里巴巴淘宝和天猫集团) Zhejiang University(浙江大学)

AI总结 研究关键信息提取难题,提出场景感知文档合成框架SAYRE,利用示例文档生成训练数据,引入错误驱动生成,提升Qwen3-VL骨干性能,证明该方法是改进多模态KIE的有效数据中心方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04329 2026-07-07 cs.AI 新提交

HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation

HAS-Bench:在可配置人类参与下评估基于大语言模型的人机系统

Yaozu Wu, Wei-Chieh Huang, Jizhou Guo, Dongyuan Li, Renhe Jiang, Henry Peng Zou, Chunyu Miao, Shanghao Li, Weizhi Zhang, WeiWei Ye, Yankai Chen, Meng Zhang, Xue Liu, Philip S. Yu

机构 * The University of Tokyo(东京大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI McGill University(麦吉尔大学) Zhejiang University(浙江大学)

AI总结 介绍基于图的HAS-Framework框架,在此基础上HAS-Bench在多方面可配置人类参与下评估人机系统,测量任务结果与协作行为,实验表明人类参与可提升任务完成等,但收益取决于参与方式等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04270 2026-07-07 cs.IR cs.AI 新提交

LBR: Towards Mitigating Length Bias in Large Language Models for Recommendation

LBR:减轻用于推荐的大语言模型中的长度偏差

Hongchen Li, Bohao Wang, Jingbang Chen, Weiqin Yang, Hang Pan, Bingde Hu, Can Wang, Jiawei Chen

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Bangsun Technology(Bangsun科技)

AI总结 研究大语言模型用于推荐时的长度偏差问题,提出LBR框架。通过长度感知注意力校准减轻输入偏差,引入有效信息长度归一化处理输出偏差,实验证明该框架能减轻偏差并提升推荐准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏