arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-04-17 至 2026-04-17 共收录 6
2604.10866 2026-04-17 cs.CL

OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation

OccuBench:通过语言环境模拟评估AI代理在真实世界专业任务中的表现

Xiaomeng Hu, Yinger Zhang, Fei Huang, Jianhong Tu, Yang Su, Lianghao Deng, Yuxuan Liu, Yantao Liu, Dayiheng Liu, Tsung-Yi Ho

机构 * Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学)

AI总结 OccuBench通过语言环境模拟评估AI代理在100个真实世界专业任务场景中的表现,涵盖10个行业类别和65个专业领域,发现大模型、新版本和高推理能力提升性能,但强代理不等于强环境模拟器。

Comments 23 pages, 8 figures, 2 tables. Project page: https://gregxmhu.github.io/OccuBench-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11841 2026-04-17 math.OC cs.LG

High Probability Guarantees for Random Reshuffling

随机重洗的高概率保证

Hengxu Yu, Xiao Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文研究了随机重洗方法在非凸优化中的高概率复杂度保证,提出了一种简单停止准则并验证了其有效性。

Comments In this new version, we have removed the saddle-point avoidance part and improved the stopping criterion part by using a horizon-free step size rule

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14877 2026-04-17 cs.LG

Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis

强化学习是否扩展大语言模型代理的能力边界?一种PASS@(k,T)分析

Zhiyuan Zhai, Wenjing Yan, Xiaodan Shao, Xin Wang

机构 * Fudan University(复旦大学) Chinese University of Hong Kong(香港中文大学) University of Waterloo(滑铁卢大学)

AI总结 本文通过PASS@(k,T)指标分析强化学习在代理工具使用中的能力扩展,发现其在复杂任务中确实扩大了能力边界,而静态推理中则趋于收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14806 2026-04-17 cs.SD cs.MM

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

倾听、暂停与推理:迈向基于感知的混合推理以实现音频理解

Jieyi Wang, Yazhe Niu, Dexuan Xu, Zhongyu Wei

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) CUHK MMLab(香港中文大学多媒体实验室) Fudan University(复旦大学)

AI总结 本文提出HyPeR框架,通过感知-推理混合方法提升音频理解能力,通过PAQA数据集训练模型并引入PAUSE标记和一致性奖励,实验表明其在复杂音频场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14768 2026-04-17 cs.AI

CoTEvol: Self-Evolving Chain-of-Thoughts for Data Synthesis in Mathematical Reasoning

CoTEvol:用于数学推理数据合成的自演化思维链

Zhuo Wang, Zhuo Zhang, Yafu Li, Yu Cheng, Lizhen Qu, Zenglin Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Monash University(墨尔本大学) Independent Researcher(独立研究者) Shanghai Academy of AI for Science(上海人工智能科学研究院)

AI总结 本文提出CoTEvol,一种基于遗传算法的思维链生成框架,通过全局交叉和局部突变提升生成准确性和多样性,实验表明其在数学推理任务中效果优于传统方法。

Comments acl2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14178 2026-04-17 cs.RO cs.AI

Towards Deploying VLA without Fine-Tuning: Plug-and-Play Inference-Time VLA Policy Steering via Embodied Evolutionary Diffusion

迈向无需微调的VLA部署:通过具身进化扩散实现即插即用的推理时VLA策略引导

Zhuo Li, Junjia Liu, Zhipeng Dong, Tao Teng, Quentin Rouxel, Darwin Caldwell, Fei Chen

机构 * Collaborative and Versatile Robots (CLOVER) Laboratory, T-Stone Robotics Institute, The Chinese University of Hong Kong, Hong Kong(协作与多功能机器人实验室,T-Stone机器人研究所,香港中文大学,香港) Φ \Phi -Institute for Physical Human Intelligence(物理人机智能研究所) Center for Embodied Artificial Intelligence and Computer Vision, Shenzhen Loop Area Institute, Shenzhen, China(具身人工智能与计算机视觉中心,深圳环园研究院,深圳,中国) Department of Advanced Robotics, Istituto Italiano di Tecnologia, Genoa, Italy(先进机器人系,意大利理工学院,热那亚,意大利)

AI总结 本文提出VLA-Pilot方法,通过即插即用的策略引导实现无需微调的零样本部署,提升预训练VLA在不同任务和机器人平台上的表现。

Comments 9 pages, 8 figures, submitted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏