arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

共收录 1835
2606.05404 2026-06-05 cs.AI cs.CL cs.LG

Harnessing Generalist Agents for Contextualized Time Series

利用通用智能体进行情境化时间序列分析

Zihao Li, Kaifeng Jin, Yuanchen Bei, Jiaru Zou, Avaneesh Kumar, Xuying Ning, Yanjun Zhao, Mengting Ai, Baoyu Jing, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出TimeClaw框架,通过集成可执行时间工具、经验驱动能力进化和情景多模态记忆,使通用大语言模型智能体具备情境化时间推理能力,在能源、金融等多领域基准上取得性能提升。

Comments Preprint. 38 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05402 2026-06-05 cs.CL cs.AI

ReasoningFlow: Discourse Structures for Understanding LLM Reasoning Traces

ReasoningFlow: 理解LLM推理轨迹的话语结构

Jinu Lee, Shivam Agarwal, Amruta Parulekar, Siddarth Madala, Dilek Hakkani-Tur, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出ReasoningFlow框架,将大推理模型的推理轨迹建模为细粒度有向无环图,通过人工和自动标注分析发现模型间结构相似性、多样化推理行为及错误步骤与最终答案的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02031 2026-06-05 cs.LG cs.AI cs.CL cs.CV

OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents

OpenWebRL: 揭秘视觉网络代理的在线多轮强化学习

Rui Yang, Qianhui Wu, Yuxi Chen, Hao Bai, Wenlin Yao, Hao Cheng, Baolin Peng, Huan Zhang, Tong Zhang, Jianfeng Gao

机构 * UIUC(伊利诺伊大学香槟分校) Microsoft(微软)

AI总结 提出OpenWebRL框架,通过在线多轮强化学习在真实网站上训练视觉网络代理,以4B参数模型在基准测试中达到开源最优,并与闭源系统竞争。

Comments 36 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16705 2026-06-05 cs.RO cs.CV

HERO: Learning Humanoid End-Effector Control for Visual Whole-Body Open-Vocabulary Object Grasping

HERO: 学习人形机器人的末端执行器控制用于视觉全身体对象抓取

Runpei Dong, Ziyan Li, Arjun Gupta, Xialin He, Saurabh Gupta

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 该研究提出HERO方法,通过结合大视觉模型和模拟训练,实现了视觉全身体对象抓取任务中末端执行器的高精度控制和场景理解,显著提升了抓取精度和泛化能力。

Comments Project page: https://hero-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23300 2026-06-05 cs.CV cs.RO

Learning Predictive Visuomotor Coordination

学习预测性视觉-运动协调

Wenqi Jia, Bolin Lai, Miao Liu, Danfei Xu, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Tech(佐治亚理工学院) Meta AI

AI总结 本文提出了一种基于预测的视觉-运动协调建模任务,通过结合第一人称视觉和运动学观测预测头部姿态、目光方向和上半身运动,展示了多模态整合在理解视觉-运动协调中的重要性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04807 2026-06-04 cs.AI cs.CL cs.CY cs.LG

BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization

BiasGRPO:通过组相对策略优化在高方差奖励景观中稳定偏差缓解

Saket Reddy, Ke Yang, ChengXiang Zhai

机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出BiasGRPO框架,利用组相对策略优化(GRPO)通过归一化组内奖励来稳定大语言模型的社会偏差缓解,优于DPO和PPO。

Comments Accepted to Findings of the ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04446 2026-06-04 cs.DC cs.LG

D^2SD: Accelerating Speculative Decoding with Dual Diffusion Draft Models

D^2SD: 使用双重扩散草稿模型加速推测解码

Liyuan Zhang, Jiarui Zhang, Jinwei Yao, Ran Yan, Yuchen Yang, Jiahao Zhang, Tongkai Yang, Yi Wu, Binhang Yuan

机构 * Peking University(北京大学) Tsinghua University(清华大学) HKUST(香港科技大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Ant Group(蚂蚁集团)

AI总结 提出D^2SD框架,通过双重扩散草稿模型和置信度引导的前缀树,提升推测解码的接受率,优于现有扩散方法和自回归推测解码基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04302 2026-06-04 cs.CL cs.LG

LazyAttention: Efficient Retrieval-Augmented Generation with Deferred Positional Encoding

LazyAttention: 高效检索增强生成中的延迟位置编码

Haocheng Xia, Mihir Pamnani, Hanxi Fang, Supawit Chockchowwat, Yongjoo Park

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院) Google(谷歌) Amazon(亚马逊)

AI总结 针对检索增强生成中KV缓存位置编码复用性差的问题,提出LazyAttention机制,通过核化延迟位置编码实现零拷贝、位置无关的KV重用,显著降低首令牌延迟并提升推理吞吐量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04261 2026-06-04 cs.AI cs.CL cs.CV cs.ET cs.LG

Can Generalist Agents Automate Data Curation?

通用智能体能否自动化数据筛选?

Feiyang Kang, Hanze Li, Adam Nguyen, Mahavir Dabas, Jiaqi W. Ma, Frederic Sala, Dawn Song, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出Curation-Bench基准,通过通用编码智能体自动化数据筛选循环,实验表明现成智能体可达到强基线,但存在执行-研究差距,而结构化方法引导的智能体能在十分之一数据预算下自主组合出优于强基线的数据选择策略。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01770 2026-06-04 cs.LG cs.AI

Adaptive Auto-Harness: Sustained Self-Improvement for Agentic System Deployment on Open-Ended Task Streams

自适应自动框架:面向开放式任务流的智能体系统部署的持续自我改进

Zewen Liu, Zhan Shi, Yisi Sang, Bing He, Minhua Lin, Tianxin Wei, Dakuo Wang, Benoit Dumoulin, Wei Jin, Hanqing Lu

机构 * Emory University(埃默里大学) Amazon(亚马逊) The Pennsylvania State University(宾夕法尼亚州立大学) UIUC(伊利诺伊大学香槟分校) Northeastern University(东北大学)

AI总结 提出自适应自动框架(Adaptive Auto-Harness),通过状态化多智能体进化器、带求解时路由的框架树和人工引导机制,解决开放式任务流中自动框架性能退化问题,在多个流上超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30705 2026-06-04 cs.CV cs.LG

Equivariant Latent Alignment via Flow Matching under Group Symmetries

群对称下通过流匹配的等变潜在对齐

Sunghyun Kim, Jaehoon Hahm, Jeongwoo Shin, Joonseok Lee

机构 * University of Illinois Urbana-Champaign, Illinois, USA(伊利诺伊大学厄巴纳-香槟分校) Seoul National University, Seoul, Korea(首尔国立大学)

AI总结 针对现有方法在潜在空间中存在的等变错位问题,提出基于流的残差潜在流框架,通过纠正错位潜在表示来增强旋转群SO(n)下的等变一致性,提升新视角合成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25050 2026-06-04 cs.RO

DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors

DiscreteRTC:离散扩散策略是自然的异步执行器

Pengcheng Wang, Kaiwen Hong, Chensheng Peng, Katherine Driggs-Campbell, Masayoshi Tomizuka, Chenfeng Xu, Chen Tang

机构 * UC Berkeley(加州大学伯克利分校) UIUC(伊利诺伊大学香槟分校) UT Austin(德克萨斯大学奥斯汀分校) UCLA(加州大学洛杉矶分校)

AI总结 针对同步执行器在动态任务中的致命停顿问题,提出DiscreteRTC方法,利用离散扩散策略的原生修复能力实现异步执行,在动态模拟和真实操作任务中取得更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07778 2026-06-04 cs.AI

The Accountability Horizon: An Impossibility Theorem for Governing Human-Agent Collectives

问责地平线:人类-智能体集体治理的不可能性定理

Haileleol Tibebu, Hewan Shemtaga

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Responsible Intelligence Institute(负责任智能研究所)

AI总结 本文通过引入人类-智能体集体形式化模型和问责不完全性定理,证明当自主性超过可计算阈值时,现有AI问责框架必然失效,并基于合成实验验证了该相变边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14760 2026-06-04 cs.CL

Reasoning over Boundaries: Enhancing Specification Alignment via Test-time Deliberation

推理边界:通过测试时深思增强规范对齐

Haoran Zhang, Yafu Li, Xuyang Hu, Dongrui Liu, Zhilin Wang, Bo Li, Yu Cheng

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) University of Science and Technology of China, Hefei, Anhui, China(中国科学技术大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) University of Illinois Urbana-Champaign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出Align3方法,利用测试时深思(TTD)和分层反思修正来推理规范边界,并构建SpecBench基准,实验表明TTD能有效增强规范对齐。

Comments 10 pages main text, 52 pages total (including appendix). Code and resources are available at https://github.com/zzzhr97/SpecBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03008 2026-06-04 cs.SI cs.DS cs.LG

Local Clustering on Complex Graphs and Complex Hypergraphs

复杂图与复杂超图上的局部聚类

Zihao Li, Dongqi Fu, Hengyu Liu, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

AI总结 本文通过扩展非近似的Andersen-Chung-Lang (ACL)聚类算法,提出了GeneralACL和HyperACL两种算法,分别适用于带权、有向、自环图以及边依赖顶点权重的超图,并证明了在温和条件下它们能识别出电导率二次最优的聚类。

Comments KDD 2026, Preprint version. 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.00729 2026-06-04 cs.LG cs.GT cs.SY eess.SY math.OC stat.ML

Policy Optimization Provably Converges to Nash Equilibria in Zero-Sum Linear Quadratic Games

策略优化在零和线性二次博弈中可证明收敛至纳什均衡

Kaiqing Zhang, Zhuoran Yang, Tamer Başar

机构 * Department of Electrical and Computer Engineering & Coordinated Science Laboratory, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电子工程与协调科学实验室部门) Department of Operations Research and Financial Engineering, Princeton University(普林斯顿大学运筹学与金融工程系)

AI总结 本文研究了策略优化在零和线性二次博弈中寻找纳什均衡的全局收敛性,通过分析LQ博弈的优化景观,证明了线性反馈控制策略的 stationary 点构成博弈的纳什均衡,并提出三种保证收敛到纳什均衡的投影嵌套梯度方法,同时展示了这些算法具有全局次线性和局部线性收敛率。

Comments Fixed some typos, addressed some comments from NeurIPS reviews

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.02957 2026-06-04 cs.LG cs.NA cs.NE math.NA physics.comp-ph stat.ML

A Deep Neural Network Surrogate for High-Dimensional Random Partial Differential Equations

高维随机偏微分方程的深度神经网络替代模型

Mohammad Amin Nabian, Hadi Meidani

机构 * Department of Civil and Environmental Engineering, University of Illinois at Urbana-Champaign, Urbana, Illinois, USA.(土木与环境工程系,伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出了一种基于深度学习的高维随机偏微分方程求解框架,通过深度残差网络近似随机PDE,并采用强化或弱化初始和边界条件的方法,验证了该方法在扩散和热传导问题中的准确性。

Journal ref Probabilistic Engineering Mechanics, 57, pp.14-25 (2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.10945 2026-06-04 cs.LG cs.SY eess.SY math.OC stat.ML

Target-Based Temporal Difference Learning

基于目标的时序差分学习

Donghwan Lee, Niao He

机构 * Coordinated Science Laboratory (CSL), University of Illinois at Urbana-Champaign(协调科学实验室(CSL),伊利诺伊大学厄巴纳-香槟分校) Department of Industrial and Enterprise Systems Engineering, University of Illinois(工业与企业系统工程系,伊利诺伊大学)

AI总结 本文提出了一种新的基于目标的时序差分学习算法家族,并从理论上分析了其收敛性,展示了这些算法在收敛性能上可能优于标准时序差分学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.02765 2026-06-04 cs.RO cs.LG cs.SY eess.SY math.OC

Intent-Aware Probabilistic Trajectory Estimation for Collision Prediction with Uncertainty Quantification

意图感知的概率轨迹估计用于碰撞预测与不确定性量化

Andrew Patterson, Arun Lakshmanan, Naira Hovakimyan

机构 * Department of Mechanical Science and Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系)

AI总结 本文提出了一种基于高斯过程的概率轨迹估计方法,用于在不确定环境中预测碰撞,通过概率方法替代确定性假设,以考虑更广泛的障碍物类型,并通过案例研究展示了在有限障碍物行为知识下预测碰撞的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.00679 2026-06-04 eess.SY cs.LG cs.SY

Data Driven Chiller Plant Energy Optimization with Domain Knowledge

数据驱动的冷水机组能源优化与领域知识

Hoang Dung Vu, Kok Soon Chai, Bryan Keating, Nurislam Tursynbek, Boyan Xu, Kaige Yang, Xiaoyan Yang, Zhenjie Zhang

机构 * Kaer Pte. Ltd.(卡尔公司) University of Illinois at Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Nazarbayev University(纳扎尔拜耶夫大学) Guangdong University of Technology(广东工业大学) University College London(伦敦大学学院) Advanced Digital Sciences Center(先进数字科学中心)

AI总结 本文提出了一种结合领域知识的数据驱动方法,用于实时冷水机组优化,通过实际案例验证了该方法在降低日常电力消耗方面的显著效果。

Comments CIKM2017. Proceedings of the 26th ACM International Conference on Information and Knowledge Management. 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.06970 2026-06-04 cs.LG cs.NI cs.PF cs.SY eess.SY stat.ML

FastDeepIoT: Towards Understanding and Optimizing Neural Network Execution Time on Mobile and Embedded Devices

FastDeepIoT: 向理解和优化移动和嵌入式设备上神经网络执行时间迈进

Shuochao Yao, Yiran Zhao, Huajie Shao, Shengzhong Liu, Dongxin Liu, Lu Su, Tarek Abdelzaher

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) State University of New York at Buffalo(纽约州立大学布法罗分校)

AI总结 本文提出FastDeepIoT框架,通过揭示神经网络结构与执行时间之间的非线性关系,优化移动和嵌入式设备上执行时间与准确性的权衡,同时无需预先了解硬件规格或深度学习库的实现细节。

Comments Accepted by SenSys '18

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.08138 2026-06-04 cs.AI cs.GT cs.SY eess.SY

Reliable Intersection Control in Non-cooperative Environments

非合作环境中的可靠交叉口控制

Muhammed O. Sayin, Chung-Wei Lin, Shinichi Shiraishi, Tamer Başar

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota InfoTechnology Center(丰田信息技术中心)

AI总结 本文提出一种可靠交叉口控制机制,用于非合作环境中的战略自主和联网车辆。通过分析车辆的战略行为,确定纳什均衡,并识别社会最优均衡以实现公平分配。

Comments Extended version (including proofs of theorems and lemmas) of the paper: M. O. Sayin, C.-W. Lin, S. Shiraishi, and T. Basar, "Reliable intersection control in non-cooperative environments", to appear in the Proceedings of American Control Conference, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.00681 2026-06-04 eess.SY cs.LG cs.SY

Team-Optimal Distributed MMSE Estimation in General and Tree Networks

一般和树状网络中的团队最优分布式最小均方误差估计

Muhammed O. Sayin, Suleyman S. Kozat, Tamer Başar

机构 * The Department of Electrical and Computer Engineering, University of Illinois at Urbana-Champaign, Champaign, IL 61801 USA(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) The Department of Electrical and Electronics Engineering, Bilkent University, Bilkent, Ankara 06800 Turkey(比尔肯特大学电子与电气工程系)

AI总结 本文提出了一种在有限时间范围内实现团队最优学习性能的分布式最小均方误差估计算法,适用于任意网络拓扑,并通过局部估计的递归算法实现最优性能。

Comments Submitted to Digital Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
1503.08855 2026-06-04 math.OC cs.IT cs.LG cs.MA cs.SY eess.SY math.IT stat.ML

Decentralized learning for wireless communications and networking

无线通信与网络中的去中心化学习

Georgios B. Giannakis, Qing Ling, Gonzalo Mateos, Ioannis D. Schizas, Hao Zhu

机构 * University of Minnesota(明尼苏达大学) University of Science and Technology of China(中国科学技术大学) University of Rochester(罗切斯特大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出了一种去中心化学习算法,用于图数据的网络内处理,通过交替方向乘子法实现分布式优化,适用于无线通信和网络任务的案例研究。

Comments Contributed chapter to appear in Splitting Methods in Communication and Imaging, Science and Engineering, R. Glowinski, S. Osher, and W. Yin, Editors, New York, Springer, 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02615 2026-06-03 eess.AS cs.AI cs.SD

FSA-GRPO: Teaching Auditory LLMs to Use Few-shot Demonstrations

FSA-GRPO:训练听觉大语言模型使用少样本示例

Haolong Zheng, Siyin Wang, Xulin Fan, Zengrui Jin, Mark Hasegawa-Johnson

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

AI总结 提出基于强化学习的后训练方法FSA-GRPO,通过专门设计的奖励机制鼓励模型利用少样本示例,增强其少样本适应能力,在儿童语音识别、语音翻译和音频理解等任务上取得提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03935 2026-06-03 cs.NE cs.LG

Quadratic integrate-and-fire neurons exhibit less fragmented loss landscapes and outperform leaky integrate-and-fire neurons in spike-based gradient descent

二次整合-放电神经元表现出更少的碎片化损失景观,并在基于脉冲的梯度下降中优于漏电整合-放电神经元

Carlo Wenig, Raoul-Martin Memmesheimer, Christian Klos

机构 * University of Bonn(波恩大学) University of Tübingen(图宾根大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 通过对比LIF和QIF神经元在Spiking Heidelberg Digits数据集上的表现,发现QIF神经元具有更平滑的损失景观和梯度,从而在脉冲神经网络训练中表现更优。

Comments 9 pages, 5 figures (main part)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03909 2026-06-03 cs.CV

SparseStreet: Sparse Gaussian Splatting for Real-Time Street Scene Simulation

SparseStreet: 用于实时街景模拟的稀疏高斯泼溅

Qingpo Wuwu, Xiaobao Wei, Peng Chen, Nan Huang, Zhongyu Zhao, Hao Wang, Ming Lu, Ningning Ma, Shanghang Zhang

机构 * Peking University(北京大学) Chinese Academy of Sciences(中国科学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Autonomous Driving Development, NIO(蔚来自动驾驶开发)

AI总结 针对街景重建中高斯原语冗余问题,提出节点可学习剪枝与背景压缩框架,实现高达80%压缩比且质量损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03331 2026-06-03 cs.CL cs.AI

Evaluating LLMs' Effectiveness on Real-World Consumer Device Repair Questions

评估大语言模型在真实世界消费设备维修问题上的有效性

Atm Mizanur Rahman, Md Arid Hasan, Syed Ishtiaque Ahmed, Sharifa Sultana

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学)

AI总结 本文通过引入包含991个真实维修问题的基准测试,评估六种大语言模型在英语和孟加拉语上的正确性、完整性、实用性和安全性,发现模型虽能提供有用帮助,但在高风险维修任务中仍不可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02754 2026-06-03 cs.LG

$Ψ$-Bench: Evaluating Persona-Sensitive Influencing in Persuasive Dialogues

$\Psi$-Bench: 评估说服性对话中人格敏感的影响力

Peixuan Han, Hongyi Du, Jiayu Liu, Yihang Sun, Yutong Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出 $\Psi$-Bench 基准,通过三个现实场景评估 LLM 利用用户画像进行说服的能力,发现当前模型仍有较大提升空间,且用户画像带来 18.24% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12925 2026-06-03 cs.SE cs.AI

AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

AgentLens: 揭示 SWE-Agent 评估中的幸运通过问题

Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软)

AI总结 针对软件工程智能体评估中仅依赖最终补丁是否通过测试的二元信号问题,提出AgentLens框架进行过程级评估,通过构建前缀树接受器参考和上下文敏感意图标注器,识别出10.7%的通过轨迹存在“幸运通过”行为,并基于质量分数将轨迹分为幸运、扎实和理想三个等级。

详情

展开后加载摘要…

URL PDF HTML 收藏