arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2925
2605.10937 2026-05-12 cs.CV

Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping

文本到图像模型的强化后训练与超线性优势塑造

Haoyuan Sun, Jing Wang, Yuxin Song, Yu Lu, Bo Fang, Yifu Luo, Jun Yin, Pengyu Zeng, Miao Zhang, Tiantian Zhang, Xueqian Wang, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Baidu Inc.(百度公司) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Jimei University(集美大学)

AI总结 本文提出超线性优势塑造方法,通过信息几何视角优化文本到图像模型的后训练过程,提升训练效率和生成质量,减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10921 2026-05-12 cs.RO

RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark

RoboMemArena:一个全面且具有挑战性的机器人记忆基准

Huashuo Lei, Wenxuan Song, Huarui Zhang, Jieyuan Pei, Jiayi Chen, Haodong Yan, Han Zhao, Pengxiang Ding, Zhipeng Zhang, Lida Huang, Donglin Wang, Yan Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Zhejiang University of Technology(浙江工业大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出RoboMemArena,一个包含26个任务的大型基准,通过多模态注释和真实世界评估,改进了现有机器人记忆基准的不足。PrediMem在基准测试中表现优异,为复杂记忆系统提供了新的见解。

Comments Project website: https://robomemarena.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10912 2026-05-12 cs.CL

WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

WildClawBench: 一个用于真实世界、长周期代理评估的基准测试

Shuangrui Ding, Xuanlang Dai, Long Xing, Shengyuan Ding, Ziyu Liu, Yang JingYi, Penghui Yang, Zhixiong Zhang, Xilin Wei, Xinyu Fang, Yubo Ma, Haodong Duan, Jing Shao, Jiaqi Wang, Dahua Lin, Kai Chen, Yuhang Zang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出WildClawBench,一个包含60个双语多模态任务的原生运行时基准测试,评估代理在真实工具环境中的长周期任务能力,结果显示当前前沿模型在真实运行时表现仍不理想。

Comments Github link: https://github.com/internlm/WildClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10903 2026-05-12 cs.CV cs.RO

CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models

CapVector:在参数空间中学习可转移的能力向量用于视觉-语言-动作模型

Wenxuan Song, Han Zhao, Fuhao Li, Ziyang Zhou, Xi Wang, Jing Lyu, Pengxiang Ding, Yan Wang, Donglin Wang, Haoang Li

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文提出一种方法,通过在参数空间中解耦辅助目标SFT的两个目标,提升通用能力与任务特定动作分布拟合,从而在减少计算开销的同时提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10779 2026-05-12 cs.CR cs.CL

LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments

LITMUS:在真实操作系统环境中评估LLM代理行为越狱的基准测试

Chiyu Zhang, Huiqin Yang, Bendong Jiang, Xiaolei Zhang, Yiran Zhao, Ruyi Chen, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Zhejiang University(浙江大学)

AI总结 LITMUS通过语义-物理双重验证机制和操作系统级状态回滚,解决现有基准测试在物理层危害评估和测试隔离上的不足,揭示LLM代理在行为安全方面的缺陷和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10455 2026-05-12 cs.LG

AxiomOcean: Forecasting the Three-Dimensional Structure of the Upper Ocean

AxiomOcean:预测上层海洋三维结构

Sensen Wu, Yifan Chen, Guantao Pu, Xiaoyao Sun, Yijun Chen, Jin Qi, Ming Kong, Keyi Yang, Lichen Xu, Wenguan Wang, Xiaofeng Li, Zhenhong Du

机构 * School of Earth Sciences & Zhejiang Key Laboratory of Geographic Information Science, Zhejiang University(地球科学学院及浙江省地理信息科学重点实验室,浙江大学) State Key Laboratory of Ocean Sensing, Zhejiang University(海洋感知国家重点实验室,浙江大学) The State Key Lab of Brain-Machine Intelligence, Zhejiang University(脑机智能国家重点实验室,浙江大学) Key Laboratory of Ocean Circulation and Waves, Institute of Oceanology, Chinese Academy of Sciences(海洋环流与波浪重点实验室,中国科学院海洋研究所)

AI总结 AxiomOcean通过三维编码器-骨干-解码器架构,结合大气强迫,预测全球1/12°分辨率下至643米深度的上层海洋温度、盐度和三维流体,提升短期海洋预报精度和物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10429 2026-05-12 physics.chem-ph cs.AI

Physical probes expose and alleviate chemical-environment collapse in molecular representations

物理探针揭示并缓解分子表示中的化学-环境崩溃

Jiebin Fang, Zidi Yan, Churu Mao, Yongjun Jiang, Xinyi Tang, Lei Miao, Dan Lu, Yun Huang, Wanjing Ding, Zhongjun Ma

机构 * Hainan Institute, Zhejiang University(浙江大学海南研究院) Institute of Marine Biology and Pharmacology, Ocean College, Zhejiang University(浙江大学海洋学院海洋生物学与药理研究所) School of Food and Pharmacy, Zhejiang Ocean University(浙江海洋大学食品学院) Hangzhou Bio-Sincerity Pharmaceutical Technology Company Limited(杭州生物 sincerity 药业技术有限公司) School of Pharmaceutical Sciences, Shanghai Jiao Tong University(上海交通大学药学院)

AI总结 本文提出CLAIM框架,通过对比学习恢复化学分辨率,提升分子光谱检索,并在多种分子属性任务中实现有效应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10275 2026-05-12 cs.CV

PolarVSR: A Unified Framework and Benchmark for Continuous Space-Time Polarization Video Reconstruction

PolarVSR:连续时空极化视频重建的统一框架和基准

Chenggong Li, Yidong Luo, Junchao Zhang, Boxin Shi, Degui Yang

机构 * School of Automation, Central South University(中南大学自动化学院) Hunan Provincial Key Laboratory of Optic-Electronic Intelligent Measurement and Control(湖南省光学电子智能测量控制重点实验室) Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(视觉技术国家工程研究中心,北京大学计算机学院)

AI总结 本文提出首个时空极化视频重建框架,通过极化感知隐式神经表示实现高保真重建,并建立首个大规模彩色DoFP极化视频基准,验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07384 2026-05-12 cs.LG

StreamPhy: Streaming Inference of High-Dimensional Physical Dynamics via State Space Models

StreamPhy: 通过状态空间模型实现高维物理动态的流式推断

Panqi Chen, Yifan Sun, Shikai Fang, Xiao Fu, Lei Cheng

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of EECS,Oregon State University(俄勒冈州立大学电子工程与计算机科学学院)

AI总结 本文提出StreamPhy框架,通过自适应观测编码器、结构化状态空间模型和FT-FiLM解码器,实现高效准确的流式推断,实验显示其在复杂动态处理上优于现有方法,精度提升48%以上,速度提升20-100倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03895 2026-05-12 cs.RO cs.CV

NoTVLA: Semantics-Preserving Robot Adaptation via Narrative Action Interfaces

NoTVLA:通过叙事动作接口实现语义保留的机器人适应

Zheng Huang, Mingyu Liu, Xiaoyi Lin, Muzhi Zhu, Canyu Zhao, Zongze Du, Ye Lin, Xiaoman Li, Yiduo Jia, Hao Zhong, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学)

AI总结 NoTVLA通过稀疏轨迹规划减少灾难性遗忘,提升多任务性能,以更低计算成本和无需腕部摄像头实现高精度与语言能力保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03310 2026-05-12 cs.LG cs.AI

Causal Discovery for Irregularly Time Series with Consistency Guarantees

不规则时间序列中的因果发现与一致性保证

Weihong Li, Baohong Li, Anpeng Wu, Zhihan Li, Ming Ma, Keting Yin, Kun Kuang

机构 * Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

AI总结 本文研究了不规则采样时间序列中的因果发现,针对金融、医疗和气候科学等风险敏感领域中缺失数据和不一致采样频率带来的挑战,提出ReTimeCausal框架,通过交替的填补与结构学习过程,提供理论一致性保证。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12910 2026-05-12 cs.LG cs.AI cs.NE physics.chem-ph q-bio.BM

Human-level molecular optimization driven by mol-gene evolution

人类水平的分子优化由分子-基因进化驱动

Jiebin Fang, Churu Mao, Yuchen Zhu, Xiaoming Chen, Chang-Yu Hsieh, Zhongjun Ma

机构 * Hainan Institute of Zhejiang University(浙江大学海南研究院) Institute of Marine Biology and Pharmacology, Ocean College, Zhejiang University(浙江大学海洋学院海洋生物与药理研究所) College of Pharmaceutical Sciences and Cancer Center, Zhejiang University(浙江大学药学院与癌症中心)

AI总结 本文提出DGMM算法,通过离散变分自编码器实现分子结构的灵活优化,发现药理相似但结构不同的化合物,平衡结构新颖性与药理性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.02666 2026-05-12 eess.IV cs.CV

Deep Sequential Feature Learning in Clinical Image Classification of Infectious Keratitis

临床感染性角膜炎图像分类中的深度序列特征学习

Yesheng Xu, Ming Kong, Wenjia Xie, Runping Duan, Zhengqing Fang, Yuxiao Lin, Qiang Zhu, Siliang Tang, Fei Wu, Yu-Feng Yao

机构 * Department of Ophthalmology, Sir Run Run Shaw Hospital, Zhejiang University School of Medicine(浙江大学医学院眼科学系,邵氏医院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文提出深度序列学习模型,用于通过临床图像分类区分感染性角膜病的细微特征,模型在421名眼科医生的竞争中实现了80.00%的诊断准确率,优于医生的49.27%准确率。

Comments Accepted by Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10035 2026-05-12 cs.AI

From Single-Step Edit Response to Multi-Step Molecular Optimization

从单步编辑响应到多步分子优化

Haojie Rao, Kun Li, Yida Xiong, Jiameng Chen, Wenbin Hu, Yizhen Zheng, Jiajun Yu, Duanhua Cao

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Data Science and Artificial Intelligence, Monash University(墨尔本大学数据科学与人工智能系) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Life Sciences and Technology, Tongji University(同济大学生命科学与技术学院)

AI总结 本文提出响应导向的离散编辑优化方法,通过单步分子编辑响应预测器和多步规划器结合,提升分子优化效率与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09939 2026-05-12 cs.RO

Neural Distance-Guided Path Integral Control for Tractor-Trailer Navigation

神经距离引导的路径积分控制用于拖拉机-挂车导航

Peng Wei, Chen Peng, Stavros Vougioukas

机构 * Department of Biological and Agricultural Engineering, University of California Davis(加州大学戴维斯分校生物与农业工程系) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心)

AI总结 本文提出基于几何神经编码器的路径积分控制器,用于实现拖拉机-挂车在复杂农业环境中的安全导航,通过实时距离估计提升动态可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09920 2026-05-12 cs.LG cs.AI

Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward

通过内在梯度-范数奖励实现无需验证器的LLM强化学习

Xuexiang Wen, Hang Yu, Linchao Zhu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 本文提出VIGOR,一种无需外部验证器的强化学习奖励机制,通过内在偏好信号提升政策优化效果,在数学推理和代码基准测试中表现优于现有方法。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09636 2026-05-12 cs.AI

PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

PDEAgent-Bench: 一个多指标、多库的PDE求解器生成基准

Zhen Hang, Yushan Yashengjiang, Junhui Li, Huanshuo Dong, Yang Wei, Zhezheng Hao, Jiangtao Ma, Songlin Bai, Haozhong Kai, Xihang Yue, Gangzong Si, Dongming Jiang, Chao Yao, Zhanhua Hu, Jiangqing Zhang, Pengwei Liu, Yaomin Shen, Xingyu Ren, Lei Liu, Zikang Xu, Han Li, Qingsong Yao, Hande Dong, Hong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Arizona State University(亚利桑那州立大学) Rice University(里士满大学) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Alibaba Group(阿里巴巴集团)

AI总结 PDEAgent-Bench是首个针对PDE求解器生成的多指标、多库基准,包含645个实例,涵盖6类数学问题和11种PDE家族,评估生成求解器的可执行性、数值精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09606 2026-05-12 cs.CR cs.CV

On the Generation and Mitigation of Harmful Geometry in Image-to-3D Models

关于图像到3D模型中有害几何的生成与缓解

Yule Liu, Yilong Yang, Jiale Teng, Hanze Jia, Zeren Luo, Jingyi Zheng, Zifan Peng, Ke Li, Yifan Liao, Zhen Sun, Jiaheng Wei, Yang Liu, Zhuo Ma, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Xidian University(西安电子科技大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

AI总结 研究探讨了图像到3D模型生成有害几何的风险及缓解方法,通过系统评估发现当前模型能有效重建有害几何,但现有防护措施存在不足,提出堆叠防御策略以降低有害几何留存率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09433 2026-05-12 cs.CV

Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs

离线偏好优化用于具有噪声跟踪配对的校正流

Yunhong Lu, Qichao Wang, Hengyuan Cao, Xiaoyin Xu, Min Zhang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study-Zhejiang University(上海先进研究院-浙江大学) Shanghai Institute for Mathematics and Interdisciplinary Sciences(上海数学与交叉科学研究院)

AI总结 本文提出PNAPO框架,通过保留生成胜败图像的先验噪声,改进校正流的偏好优化,提升稳定性和样本效率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14889 2026-05-12 eess.AS cs.CL cs.LG

SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness

SDiaReward:基于模态和口语性的语音对话奖励建模与基准测试

Jingyu Lu, Yuhan Wang, Fan Zhuo, Xize Cheng, Changhao Pan, Xueyi Pu, Yifu Chen, Chenyuhao Wen, Tianle Liang, Zhou Zhao

机构 * Zhejiang University(浙江大学)

AI总结 本文提出SDiaReward,一种端到端的多轮奖励模型,通过SDiaReward-Dataset数据集解决模态和口语性差距问题,实现对语音对话中模态和口语性的联合评估,实验表明其在配对偏好准确率上优于通用音频大语言模型。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09534 2026-05-12 cs.CV

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

AUHead: 通过动作单元控制实现逼真的情感谈话头生成

Jiayi Lyu, Leigang Qu, Wenjing Zhang, Hanyu Jiang, Kai Liu, Zhenglin Zhou, Xiaobo Xia, Jian Xue, Tat-Seng Chua

机构 * University of the Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日報網通信內容認知重點實驗室)

AI总结 本文提出AUHead方法,通过动作单元控制实现逼真的谈话头生成,解决现有方法在情感表达细腻度上的不足。

Comments https://openreview.net/forum?id=dmzlAUkulz&referrer=%5BAuthor%20Console%5D(%2Fgroup%3Fid%3DICLR.cc%2F2026%2FConference%2FAuthors%23your-submissions) Accepted at the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11470 2026-05-12 cs.LG cs.CL

Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning

重新思考在LLM后训练中专家轨迹的利用

Bowen Ding, Yuhan Chen, Jiayang Lyv, Jiyao Yuan, Qi Zhu, Shuangshuang Tian, Dantong Zhu, Futing Wang, Heyuan Deng, Fei Mi, Lifeng Shang, Tao Lin

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究院技术研究所) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文提出Plasticity-Ceiling框架,通过分解最终性能上限,揭示SFT与RL的协同优化方法,建立SFT-然后-RL的流水线,解决同步方法的稳定性问题,并提供精确的缩放指南。

Comments ACL-26, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03648 2026-05-12 cs.LG

SAFA-SNN: Sparsity-Aware On-Device Few-Shot Class-Incremental Learning with Fast-Adaptive Structure of Spiking Neural Network

SAFA-SNN:基于稀疏性的设备端少样本类增量学习与快速自适应的脉冲神经网络结构

Huijing Zhang, Muyang Cao, Linshan Jiang, Xin Du, Di Yu, Changze Lv, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

AI总结 本文提出SAFA-SNN,通过稀疏性感知的神经动力学和快速自适应结构,解决设备端少样本类增量学习中的灾难性遗忘问题,实验表明在多个数据集上优于基线方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09104 2026-05-12 cs.AI

Token Economics for LLM Agents: A Dual-View Study from Computing and Economics

大语言模型代理的代币经济学:从计算和经济学的双重视角研究

Yuxi Chen, Junming Chen, Chenyu He, Yiwei Li, Yicheng Ji, Yifan Wu, Dingyu Yang, Lansong Diao, Lidan Shou, Hongliang Zhang, Huan Li, Gang Chen

机构 * College of Computer Science and Technology Zhejiang University(浙江大学计算机科学与技术学院) School of Economics Zhejiang University(浙江大学经济学院) The State Key Laboratory of Blockchain and Data Security Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Alibaba Cloud(阿里云)

AI总结 本文从计算与经济学双重视角,首次系统探讨代币经济学,提出四维分类框架,涵盖单代理、多代理系统、代理生态系统及安全领域,旨在解决输出质量与经济成本的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08905 2026-05-12 cs.AI

Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs

Forge:面向NP难优化问题的质量感知强化学习

Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Yang Li, Linyang Li, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Zhejiang University(浙江大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Independent(独立)

AI总结 本文提出OPT-BENCH框架,通过质量感知强化学习提升大语言模型在NP难优化问题上的表现,实验表明其在多个任务上均优于现有模型,且任务多样性对泛化能力影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08904 2026-05-12 cs.AI

OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces

OPT-BENCH:评估大搜索空间中LLM代理的迭代自我优化

Xiaozhe Li, Jixuan Chen, Xinyu Fang, Shengyuan Ding, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 OPT-BENCH通过结合20个机器学习任务和10个经典NP难问题,评估LLM代理在大规模搜索空间中通过内在自我反思而非机械工具应用进行适应的能力,揭示更强模型在反馈利用上的优势及基础能力的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08769 2026-05-12 cs.AI

EvoMAS: Learning Execution-Time Workflows for Multi-Agent Systems

EvoMAS:学习执行时间的多智能体系统工作流

Chengdong Xu, Kaiqiang Ke, Ziheng Liu, Jiaqi Wei, Zibo Shao, Weile Guo, Chao Yu

机构 * Sun Yat-Sen University(中山大学) Zhejiang University(浙江大学) ShanghaiTech University(上海理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 EvoMAS通过动态构建执行时间工作流,改进多智能体系统的协作策略,实验证明其在复杂任务中优于单智能体基线和现有自动化方法。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08733 2026-05-12 cs.LG cs.IT math.IT

Generative Actor-Critic with Soft Bridge Policies

生成性动作-批评者与软桥策略

Ke He, Le He, Shunpu Tang, Yafei Wang, Lisheng Fan

机构 * Guangzhou University(广州大学) Zhejiang University(浙江大学) Southeast University(东南大学)

AI总结 本文提出SoftGAC,通过构建可解析的MaxEnt目标,实现高效的生成性策略,仅需单次演员前向传递即可生成动作,提升了连续控制任务的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08670 2026-05-12 cs.AI cs.CL cs.MA

MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction

MIND-Skill: 通过多智能体归纳与演绎保证技能质量

Yixuan Li, Mingshu Cai, Ziyang Xiao, Wanyuan Wang, Yanchen Deng, Bo An

机构 * Nanyang Technological University(南洋理工大学) Waseda University(早稻田大学) Zhejiang University(浙江大学) Southeast University(东南大学)

AI总结 本文提出MIND-Skill框架,通过归纳与演绎自动生成可复用的技能,结合三种损失函数保证质量,实验显示其在AppWorld和BFCL-v3上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08599 2026-05-12 cs.AI

What Will Happen Next: Large Models-Driven Deduction for Emergency Instances

接下来会发生什么:基于大模型的紧急实例推演

Zhengqing Hu, Dong Chen, Junkun Yuan, Liang Liu, Hua Wang, Zhao Jin, Yingchaojie Feng, Wei Chen, Mingliang Xu

机构 * Zhengzhou University(郑州大学) Zhejiang University(浙江大学)

AI总结 本文提出基于大模型的World Line Divergence系统,通过动态调整生成策略和引入事实校准机制,实现多领域紧急实例的多样化推演与可视化,提升风险评估和决策支持的准确性与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏