arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2909
2607.04854 2026-07-07 cs.AI 新提交

CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs

CARL:用于大语言模型规划的约束感知强化学习

Qiuyi Qi, Jinjian Zhang, Mutian Bao, Tian Liang, Guocong Li, Dongnan Liu, Wei Zhou, Jie Liu, Ming Kong, Linjian Mo, Feng Zhang, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学) College of Artificial Intelligence, Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院人工智能学院) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

AI总结 研究大语言模型生成违反任务约束计划的问题,提出约束感知强化学习框架CARL,通过比较不同输入下模型输出分布引入奖励,提升模型约束意识,实验证明其优于基线和现有模型。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04636 2026-07-07 cs.CV 新提交

Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis

通过场景感知文档合成增强关键信息提取中的大型多模态模型

Zhipeng Xu, Zulong Chen, Qing Liu, Junhao Ji, Jinxin Hu, Yipeng Yu, Jianqiang Wan, Jun Tang, Zhao Li

机构 * Alibaba Group(阿里巴巴集团) Qwen Team, Alibaba Group(阿里巴巴集团之通义千问团队) Taobao and Tmall Group, Alibaba(阿里巴巴淘宝和天猫集团) Zhejiang University(浙江大学)

AI总结 研究关键信息提取难题,提出场景感知文档合成框架SAYRE,利用示例文档生成训练数据,引入错误驱动生成,提升Qwen3-VL骨干性能,证明该方法是改进多模态KIE的有效数据中心方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04329 2026-07-07 cs.AI 新提交

HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation

HAS-Bench:在可配置人类参与下评估基于大语言模型的人机系统

Yaozu Wu, Wei-Chieh Huang, Jizhou Guo, Dongyuan Li, Renhe Jiang, Henry Peng Zou, Chunyu Miao, Shanghao Li, Weizhi Zhang, WeiWei Ye, Yankai Chen, Meng Zhang, Xue Liu, Philip S. Yu

机构 * The University of Tokyo(东京大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI McGill University(麦吉尔大学) Zhejiang University(浙江大学)

AI总结 介绍基于图的HAS-Framework框架,在此基础上HAS-Bench在多方面可配置人类参与下评估人机系统,测量任务结果与协作行为,实验表明人类参与可提升任务完成等,但收益取决于参与方式等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04270 2026-07-07 cs.IR cs.AI 新提交

LBR: Towards Mitigating Length Bias in Large Language Models for Recommendation

LBR:减轻用于推荐的大语言模型中的长度偏差

Hongchen Li, Bohao Wang, Jingbang Chen, Weiqin Yang, Hang Pan, Bingde Hu, Can Wang, Jiawei Chen

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Bangsun Technology(Bangsun科技)

AI总结 研究大语言模型用于推荐时的长度偏差问题,提出LBR框架。通过长度感知注意力校准减轻输入偏差,引入有效信息长度归一化处理输出偏差,实验证明该框架能减轻偏差并提升推荐准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04260 2026-07-07 cs.RO 新提交

FLOAT Drone for Physical Interaction: Lateral Airflow Reduction, Wrench Modeling, and Adaptive Control

用于物理交互的FLOAT无人机:侧向气流减少、力扳手建模和自适应控制

Junxiao Lin, Kehan Zhou, Shuhang Ji, Yimin Peng, Shen Wang, Jialiang Hou, Fei Gao

机构 * Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院网络系统与控制研究所) Differential Robotics Technology Company(差分机器人技术公司)

AI总结 研究针对下一代无人机空中物理交互,提出FLOAT无人机。通过同轴双旋翼布局、控制面等设计实现多维度力扳手生成等。贡献包括量化侧向气流减少,建立高保真模型并嵌入分配器,实验证明提升控制精度等。

Comments 11 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04234 2026-07-07 cs.RO cs.AI cs.CV 新提交

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects

SoftVTBench:用于物理约束下可变形物体机器人操作的安全感知视觉触觉基准测试

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓景智能) Tsinghua University(清华大学) King’s College London(伦敦国王学院) Southeast University(东南大学) Stevens Institute of Technology(史蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI(简单人工智能公司) Imperial College London(伦敦帝国学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 研究物理约束下可变形物体操作,提出SoftVTBench基准测试,通过有限元模拟可变形物体,定义任务套件,分别报告目标成功和安全成功,实现基线并实验,表明仅成功评估高估策略性能,触觉传感可提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04119 2026-07-07 cs.CV cs.AI 新提交

SOV-CAD: Stepwise Orthographic Views Guided CAD Modeling Sequence Reconstruction

SOV-CAD:逐步正交视图引导的CAD建模序列重建

Zhaopeng Feng, Chen Zhi, Xuhong Zhang, Zhengwen Feng, Xinkui Zhao

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology, Zhejiang University(浙江大学数字智能服务技术重点实验室) ZWSOFT Co., Ltd.(ZWSOFT公司)

AI总结 研究从图像重建CAD建模序列,引入逐步视觉监督,提出SOV-CAD框架将其作为序列决策任务,用离线强化学习及决策变压器架构,利用几何对齐奖励的视觉反馈,提升重建准确性与数据效率。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04098 2026-07-07 cs.CV 新提交

Sparse4D-Radar: An Efficient and Robust Framework for Surround-View 3D Object Detection via 4D Radar-Camera Fusion

Sparse4D-Radar:一种通过4D雷达-相机融合实现高效且稳健的环视3D目标检测框架

Fuyuan Ai, Yuchen Tan, Jiehui Chen, Zhiwei Xu, Chunyi Song

机构 * State Key Laboratory of Ocean Sensing and Ocean College, Zhejiang University(浙江大学海洋传感与海洋学院海洋传感技术国家重点实验室) Engineering Research Center of Oceanic Sensing Technology and Equipment, Ministry of Education, Zhejiang University(浙江大学海洋传感技术与装备教育部工程研究中心) Donghai Laboratory(东海实验室) Ocean College, Institute of Marine Electronics and Intelligent Systems, Zhejiang University(浙江大学海洋学院海洋电子与智能系统研究所)

AI总结 针对4D成像雷达在环视感知缺乏成熟方案的问题,提出Sparse4D-Radar框架。设计可变形融合模块等,经实验验证该框架在环视3D检测性能上达先进水平,兼顾精度、鲁棒性与效率。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04033 2026-07-07 cs.LG cs.AI 新提交

OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers

OmniOpt:现代优化器的分类法、几何结构及基准测试

Siyuan Li, Jiabao Pan, Yumou Liu, Zhuoli Ouyang, Xin Jin, Xinglong Xu, Jingxuan Wei, Shengye Pang, Jintao Che, Xuanhe Zhou, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai University(上海大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学) UCAS(中国科学技术大学) Zhejiang University(浙江大学) Southern University of Science and Technology(南方科技大学)

AI总结 针对大规模模型训练的优化器选择受多种因素制约且方法零散,介绍OmniOpt,通过五阶段元管道、规范约束线性最小化预言机等构建统一分类法和跨域基准测试,为优化器选择提供操作坐标系。

Comments Survey & benchmark preprint V1 (91 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03899 2026-07-07 cs.CV 新提交

DICT: Data Injection and Contrastive Trajectory Refinement for Conditional Image Generation with Diffusion Models

DICT:用于扩散模型条件图像生成的数据注入和对比轨迹细化

Chunnan Shang, Xin Zhang, Zhizhong Wang, Hongwei Wang

机构 * Zhejiang University(浙江大学)

AI总结 针对条件图像生成,提出DICT方法。通过数据注入将噪声扰动条件信号融入早期去噪阶段,结合对比轨迹细化,在统一扩散框架下提升生成质量,且无需引入任务相关架构,跨任务转移效果好。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03748 2026-07-07 cs.AI 新提交

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

将交错多模态推理作为统一决策过程进行衔接

Zican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei Liu, Yunzhuo Hao, Jiawei Gu, Linjie Li, Yu Cheng, Zhenhong Sun, Weibo Gu, Xing Sun, Zhi Wang

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Washington(华盛顿大学) The Chinese University of Hong Kong(香港中文大学) Australian National University(澳大利亚国立大学)

AI总结 研究统一多模态模型中强化学习优化多轮生成的问题,提出BRAID框架,将文本-图像-文本推理视为统一马尔可夫决策过程,通过单一强化学习目标联合优化文本和视觉生成,实验表明该框架性能优于基线。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03693 2026-07-07 cs.RO 新提交

CoRE-VLA: Towards Scalable and Robust Vision-Language-Action Modeling via Conditional Routing of Experts

CoRE-VLA:通过专家的条件路由实现可扩展且稳健的视觉-语言-动作建模

Haozhe Zhang, Sixian Li, Yifei Zhang, Zezheng Huai, Hao Chen, Chunhua Shen, Jingjing Gong, Xipeng Qiu

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Nanjing University(南京大学) Jilin University(吉林大学)

AI总结 研究视觉-语言-动作模型在实际部署中的挑战,提出CoRE-VLA框架,通过上下文条件稀疏计算生成动作,利用传感器可用性和任务意图进行专家路由,实验证明其在多任务等方面表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02907 2026-07-07 cs.CV cs.CL 新提交

ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space

ProLaViT:在结构化潜在空间中学习渐进式潜在视觉思维

Peiming Li, Yifan Wang, Xiaotian Zhang, Zhiyuan Hu, Shiyu Li, Zheng Wei, Yang Tang

机构 * Basic Algorithm Center, PCG, Tencent(腾讯PCG基础算法中心) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 针对多模态大语言模型在复杂视觉推理任务中的不足,ProLaViT框架利用内生自蒸馏机制等,设计两种推理范式及损失函数,使其能在潜在空间进行结构化视觉推导,实验证明效果优于基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01793 2026-07-07 cs.AI 新提交

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

大规模安全测试LLM智能体:从风险发现到基于证据的验证

Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng

机构 * AntGroup(蚂蚁集团) Zhejiang University(浙江大学) Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Hunan Institute of Advanced Technology(湖南先进技术研究院) Deakin University(迪肯大学)

AI总结 提出Vera框架,通过文献驱动的风险发现、组合生成可执行安全用例和自适应执行与证据验证三阶段流水线,实现端到端自动化安全测试,在四个生产级智能体框架上发现严重漏洞,平均攻击成功率93.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10522 2026-07-07 cs.CV 新提交

GUI-AC: Enhancing Continual Learning in GUI Agents

GUI-AC:增强GUI代理的持续学习能力

Can Lin, Tao Feng, Hangjie Yuan, Dan Zhang, Yifan Zhu, Zhonghong Ou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 针对GUI代理在持续学习中的分布漂移和强化微调不稳定性问题,提出GUI-AC方法,通过自适应优势和动态裁剪机制提升性能,超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09426 2026-07-07 cs.AI 版本更新

WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces

WeaveBench: 面向混合接口的长期、真实世界计算机使用代理基准

Wanli Li, Bowen Zhou, Yunyao Yu, Zhou Xu, Yifan Yang, Dongsheng Li, Caihua Shan

机构 * Zhejiang University(浙江大学) Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

AI总结 提出WeaveBench基准,包含114个跨8个真实工作领域的长期混合接口任务,要求代理结合GUI和CLI/代码操作,最佳PassRate仅41.2%,揭示现有评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25475 2026-07-07 cs.CL cs.AI 版本更新

IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference

IndexMem: 基于潜在记忆的学习型KV缓存驱逐策略用于长上下文LLM推理

Xintong Yang, Hao Gu, Binxing Xu, Lujun Li, Bei Liu, Jiacheng Liu, Qiyuan Zhu, Yike Guo, Sirui Han

机构 * The Hong Kong University of Science(香港科学与技术大学) Zhejiang University(浙江大学)

AI总结 提出一种可学习的索引器预测KV重要性,并结合轻量级潜在记忆模块压缩被驱逐的令牌,以在有限KV预算下实现准确的长上下文推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05409 2026-07-07 cs.AI cs.CL 版本更新

Agentic Retrieval-Augmented Generation for Financial Document Question Answering

代理检索增强生成用于财务文档问答

Yang Shu, Yingmin Liu, Zequn Xie

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文提出FinAgent-RAG框架,通过迭代检索-推理循环和自我验证,提升金融文档问答的精度。引入对比金融检索器、程序化思维模块和自适应策略路由,实验表明在三个基准数据集上均取得显著效果,准确率提升5.62-9.32个百分点。

Comments This paper is withdrawn due to significant methodological errors in the experimental design that fundamentally affect the validity of the results. The errors are not correctable within the current framework, and the conclusions can no longer be supported. We apologize for any inconvenience caused to readers

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05305 2026-07-07 cs.CV cs.AI cs.CL 版本更新

FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion

FlashBlock:用于高效长上下文块扩散的注意力缓存

Zhuokun Chen, Jianfei Cai, Bohan Zhuang

机构 * Monash University(墨尔本大学) Zhejiang University(浙江大学)

AI总结 研究长内容生成中块扩散在长上下文设置下的注意力计算开销问题,提出FlashBlock机制,利用块外注意力输出稳定性复用注意力,减少计算与缓存访问,提升效率且不影响质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02368 2026-07-07 cs.CL cs.AI cs.LG 版本更新

Evolutionary Guided Decoding: Iterative Value Refinement for LLMs

进化引导解码:大语言模型的迭代值细化

Zhenhua Liu, Lijun Li, Ruizhe Chen, Yuxian Jiang, Tong Zhu, Zhaochen Su, Wenliang Chen, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Soochow University(苏州大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

AI总结 研究发现引导解码中值函数不准确源于分布差距,提出迭代值细化框架,用值探索提供训练信号,迭代自我细化利用改进值函数生成高质量数据,实验证明该框架能有效对齐语言模型并降低计算成本。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01651 2026-07-07 cs.CV 版本更新

Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning

扩散模型是开放世界的功能学习器:利用生成先验进行3D功能学习

Hanqing Wang, Zhenhao Zhang, Kaiyang Ji, Mingyu Liu, Wenti Yin, yuchao chen, Zhirui Liu, Xiangyu Zeng, Tianxiang Gui, Hangxing Zhang, Jiahao Yuan, Zhiqing Cui, Jiaxin Liu, Zhiyuan Ma, Hui Xiong

机构 * The Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 研究3D功能基础问题,利用文本到图像扩散模型提取先验知识,提出基于扩散的DAG框架用于3D功能预测,通过实验证明其优于现有方法且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02737 2026-07-07 cs.CV cs.LG

Holistic Semantic Representation for Navigational Trajectory Generation

整体语义表示用于导航轨迹生成

Ji Cao, Tongya Zheng, Qinghong Guo, Yu Wang, Junshu Dai, Shunyu Liu, Jie Yang, Jie Song, Mingli Song

机构 * Zhejiang University(浙江大学) Big Graph Center, Hangzhou City University(杭州城市大学大数据中心) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 本文提出HOSER框架,通过道路网络编码器、多粒度轨迹编码器和目的地导向导航器,实现导航轨迹生成的全面语义表示,实验表明其在多个数据集上优于现有方法。

Comments Accepted by AAAI 2025

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 39(1), 40-48 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20893 2026-07-07 cs.LG cs.AI eess.SP 版本更新

MambaCapsule: Towards Transparent Cardiac Disease Diagnosis with Electrocardiography Using Mamba Capsule Network

MambaCapsule:使用Mamba胶囊网络实现基于心电图的透明心脏病诊断

Yinlong Xu, Zitai Kong, Yixuan Wu, Yue Wang, Xiaoqiang Liu, Yingzhou Lu, Jian Wu, Hongxia Xu

机构 * State Key Laboratory of Transvascular Implantation Devices and TIDRI, Zhejiang University(浙江大学血管介入关键实验室及TIDRI) School of Public Health, Zhejiang University and Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江大学公共卫生学院及浙江省医学影像人工智能重点实验室) State Key Laboratory of Transvascular Implantation Devices of The Second Affiliated Hospital and Liangzhu Laboratory, Zhejiang University(浙江大学第二附属医院血管介入关键实验室及梁渚实验室) Department of Gastroenterology, First Hospital of Quanzhou Affiliated to Fujian Medical University(福建医科大学泉州第一医院消化内科) School of Medicine, Stanford University(斯坦福大学医学院)

AI总结 研究针对心律失常诊断模型缺乏透明度问题,提出MambaCapsule网络,用Mamba提取特征、胶囊网络预测,通过重构心电图信号增强可解释性,在数据集上取得高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02516 2026-07-03 cs.CV 新提交

Alignment Is All You Need For X-to-4D Generation

对齐即一切:X到4D生成

Qiaowei Miao, Kehan Li, Yawei Luo, Yi Yang

机构 * Zhejiang University(浙江大学)

AI总结 提出Align4D框架,通过物体距离对齐、运动-几何联合对齐和异步优化,实现任意模态输入到4D视频-3D对的生成,在X4D和Consistent4D数据集上达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02479 2026-07-03 cs.CV 新提交

EAGLE-360: Embodied Active Global-to-Local Exploration in 360$^\circ$

EAGLE-360: 360°环境中的具身主动全局到局部探索

Jingtao Xu, Zizhuo Lin, Jianwen Sun, Yi Yang, Yawei Luo

机构 * Zhejiang University(浙江大学) Central China Normal University(华中师范大学)

AI总结 针对多模态大模型在360°全景主动视觉搜索中因极地畸变和连续拓扑建模不足导致的效率低下问题,提出EAGLE-360框架,通过全局先验引导局部探索,结合RoPE Rolling位置编码和GRPO训练,实现近8倍精度提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02440 2026-07-03 cs.AI cs.CL 新提交

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

EvoPolicyGym:评估交互环境中的自主策略进化

Zhilin Wang, Han Song, Runzhe Zhan, Jusen Du, Jiacheng Chen, Tianle Li, Qingyu Yin, Yulun Wu, Zhennan Shen, Tong Zhu, Yanshu Li, Guanjie Chen, Derek F. Wong, Yafu Li, Yu Cheng, Yang Yang

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) University of Macau(澳门大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Soochow University(苏州大学) Brown University(布朗大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出自主策略进化评估框架,通过EvoPolicyGym基准测试代理在固定交互预算下迭代改进策略的能力,GPT-5.5在16个环境中表现最优,并揭示预算分配与反馈转化机制。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02234 2026-07-03 cs.AI cs.LG 新提交

Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

纯化OPSD:在不失去思考能力的情况下进行在线自我蒸馏

Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学) Jilin University(吉林大学)

AI总结 针对在线自我蒸馏(OPSD)在长链思维推理模型中失效的问题,通过分解教师监督信号,发现参考诱导成分导致死记硬背,提出基于点互信息的参考隔离方法,在保持模型认知行为的同时提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01804 2026-07-03 cs.RO 新提交

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

VLA-Corrector:面向自适应动作视界的轻量级检测与校正推理

Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang

机构 * OmniAI Group of ZJU ACES Lab(浙江大学ACES实验室OmniAI组) Zhejiang University(浙江大学) Alibaba DAMO Academy(阿里巴巴达摩院)

AI总结 提出VLA-Corrector,一种轻量级校正推理框架,通过潜在空间视觉监控和在线梯度引导,实现事件触发的自适应动作视界,在不修改骨干策略权重的情况下,中断复合错误并提升鲁棒性。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01751 2026-07-03 cs.CV cs.AI 新提交

MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding

MedStreamBench: 面向流式与主动式医疗视频理解的时间感知基准

Yuan Wang, Shujian Gao, Songtao Jiang, Zhengyu Hu, Zuozhu Liu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)

AI总结 提出MedStreamBench基准,通过时间受限证据窗口和主动监控设置,评估模型在流式与主动式医疗视频理解中的回答时机与正确性,发现离线识别与时间感知决策间存在显著差距。

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01665 2026-07-03 cs.LG 新提交

Revisiting Decentralized Online Convex Optimization with Compressed Communication

重新审视带压缩通信的分布式在线凸优化

Hao Zhou, Xiaoyu Wang, Chang Yao, Mingli Song, Yuanyu Wan

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室)

AI总结 针对带压缩通信的分布式在线凸优化,首次提出两种基于跟随正则化领导者的算法,在完整信息和赌博机设置下分别匹配或显著改进现有遗憾界与通信成本。

详情

展开后加载摘要…

URL PDF HTML 收藏