arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

2026-05-14 至 2026-05-14 共收录 19
2605.13467 2026-05-14 cs.CL

PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning

PDCR:感知分解置信度奖励用于视觉-语言推理

Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong, SooHwan Eom, Gwanhyeong Koo, Mark Hasegawa-Johnson, Qi Dai, Chong Luo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) University of Illinois at Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research Asia (MSRA)(微软亚洲研究院)

AI总结 PDCR通过分解任务中的感知与推理步骤,提升视觉-语言推理的训练效果,解决全局奖励导致的信号退化问题。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13450 2026-05-14 cs.AI cs.CL cs.HC

Assessing the Creativity of Large Language Models: Testing, Limits, and New Frontiers

评估大语言模型的创造力:测试、限制与新前沿

Samuel Schapiro, Alexi Gladstone, Jonah Black, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文通过系统研究人类创造力测试对大语言模型创造力预测的有效性,发现不同构念测试效果差异显著,提出DRAT测试在预测科学构思能力上具有显著优势。

Comments 36 pages. Extended version of work under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09505 2026-05-14 cs.AI

EpiGraph: Building Generalists for Evidence-Intensive Epilepsy Reasoning in the Wild

EpiGraph:构建证据密集型癫痫推理的通用专家

Yuyang Dai, Zheng Chen, Jathurshan Pradeepkumar, Yasuko Matsubara, Jimeng Sun, Yasushi Sakurai, Yushun Dong

机构 * Florida State University(佛罗里达州立大学) The University of Osaka(大阪大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 EpiGraph通过整合癫痫领域异构知识图谱,提升证据驱动的临床推理能力,在药基因组学任务中提升30-41%,为神经科应用提供实用评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07342 2026-05-14 cs.AI

SupChain-Bench: Benchmarking Large Language Models for Real-World Supply Chain Management

SupChain-Bench:针对现实世界供应链管理的大语言模型基准测试

Shengyue Guan, Yihao Liu, Lang Cao

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出SupChain-Bench基准测试,用于评估大语言模型在现实世界供应链管理中的表现,揭示模型执行可靠性差距,并提出SupChain-ReAct框架提升工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03992 2026-05-14 cs.CR cs.AI

Quantitative Certification of Agentic Tool Selection

代理工具选择的定量认证

Jehyeok Yeon, Isha Chaudhary, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出LLMCert-T框架,通过统计方法为代理工具选择流程提供高置信度的正确性上限,揭示当前LLM代理在干扰选择和Top-N饱和规格下的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13156 2026-05-14 cs.CV

Dual-Pathway Circuits of Object Hallucination in Vision-Language Models

视觉语言模型中物体幻觉的双路径电路

Jiaxin Liu, Ding Zhong, Yue Wang, Zhidong Yang, Zhaolu Kang, Guangyuan Dong, Qishi Zhan, Pengcheng Fang, Aofan Liu

机构 * UIUC(伊利诺伊大学香槟分校) UMich(密歇根大学) Stanford(斯坦福大学) HKUST(香港科技大学) PKU(北京大学) NUS(新加坡国立大学) Marquette(马quette大学) Southampton(南安普顿大学)

AI总结 研究通过双路径电路分析框架揭示视觉语言模型中物体幻觉的机制,发现视觉接地路径与幻觉路径的交互特性,并通过抑制幻觉路径组件降低幻觉发生率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13149 2026-05-14 cs.CL cs.AI cs.LG

AcquisitionSynthesis: Targeted Data Generation using Acquisition Functions

AcquisitionSynthesis:利用获取函数进行定向数据生成

Ishika Agarwal, Sofia Stoica, Emre Can Acikgoz, Pradeep Natarajan, Mahdi Namazifar, Jiaqi Ma, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

AI总结 本文提出AcquisitionSynthesis方法,利用获取函数作为奖励模型训练语言模型生成高质量合成数据,实验表明其在数学、医疗问答和编程任务中提升模型性能并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13025 2026-05-14 cs.LG cs.GT

Offline Two-Player Zero-Sum Markov Games with KL Regularization

离线双玩家零和马尔可夫游戏中的KL正则化

Claire Chen, Yuheng Zhang, Xinyu Liu, Zixuan Xie, Shuze Daniel Liu, Nan Jiang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) California Institute of Technology(加州理工学院) University of Virginia(弗吉尼亚大学) Purdue University(Purdue 大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文研究了离线双玩家零和马尔可夫游戏中纳什均衡的学习问题,提出ROSE框架和SOS-MD算法,通过KL正则化实现快速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12995 2026-05-14 cs.LG

F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking

F-GRPO:基于统一候选生成与排序的因子化组相对策略优化

Rohan Surana, Gagan Mundada, Junda Wu, Xintong Li, Yizhu Jiao, Bowen Jin, Sizhe Zhou, Tong Yu, Ritwik Sinha, Jiawei Han, Jingbo Shang, Julian McAuley

机构 * UC San Diego(南加州大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究院)

AI总结 本文提出F-GRPO,通过因子化组相对策略优化统一完成候选生成与排序,解决传统方法中因反馈滞后导致的优化不稳定问题,提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12978 2026-05-14 cs.AI

Useful Memories Become Faulty When Continuously Updated by LLMs

有用的记忆在由LLMs持续更新时会变得错误

Dylan Zhang, Yanshan Lin, Zhengkun Wu, Yihang Sun, Bingxuan Li, Dianqi Li, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IIIS, Tsinghua University(清华大学人工智能研究院)

AI总结 研究发现,即使基于有用经验,LLM生成的记忆在持续更新后可能失效,建议将原始事件作为首要证据并明确控制记忆巩固过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12975 2026-05-14 cs.AI

Retrieval is Cheap, Show Me the Code: Executable Multi-Hop Reasoning for Retrieval-Augmented Generation

检索成本低廉,展示代码:可执行多跳推理的检索增强生成

Jiashuo Sun, Jimeng Shi, Yixuan Xie, Saizhuo Wang, Jash Rajesh Parekh, Pengcheng Jiang, Zhiyi Shi, Jiajun Fan, Qinglong Zheng, Peiran Li, Shaowen Wang, Ge Liu, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science and Technology(香港科学与技术大学) Texas A&M University(德克萨斯农工大学)

AI总结 本文提出PyRAG框架,将多跳检索增强生成转化为程序合成与执行,通过可执行Python代码实现可调试的推理过程,提升多跳问答性能。

Comments 32 pages, 20 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12922 2026-05-14 cs.AI cs.CL

When Attention Closes: How LLMs Lose the Thread in Multi-Turn Interaction

当注意力关闭:LLMs在多轮交互中如何失去线索

Vardhan Dongre, Joseph Hsieh, Viet Dac Lai, Seunghyun Yoon, Trung Bui, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究)

AI总结 研究揭示LLMs在多轮对话中因注意力关闭导致任务目标丢失的现象,提出目标可访问性比率(GAR)及通道转换框架,分析不同架构下目标相关行为的生存机制及失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12746 2026-05-14 cs.CR cs.AI

CoT-Guard: Small Models for Strong Monitoring

CoT-Guard:用于强监控的小型模型

Nirav Diwan, Han Wang, Berkcan Kapusuzoglu, Ramin Moradi, Supriyo Chakraborty, Giri Iyengar, Sambit Sahu, Huan Zhang, Gang Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Capital One

AI总结 本文提出CoT-Guard,通过结合监督微调和强化学习,提升小型模型在代码生成任务中检测隐藏目标的能力,其在提示和代码攻击下的表现优于现有大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12733 2026-05-14 cs.LG cs.AI stat.ML

From Generalist to Specialist Representation

从通用到专业表征

Yujia Zheng, Fan Feng, Yuke Li, Shaoan Xie, Kevin Murphy, Kun Zhang

机构 * CMU(卡内基梅隆大学) UIUC(伊利诺伊大学香槟分校) UCSD(加州大学圣地亚哥分校) MBZUAI(穆斯林人工智能研究所) UMD(马里兰大学) UBC(不列颠哥伦比亚大学)

AI总结 研究在非参数设置下如何通过非监督方式识别时间步间任务结构,并利用稀疏正则化分离任务相关潜在表征,为从通用到专业模型的理论保障提供新思路。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12674 2026-05-14 cs.AI cs.LG cs.RO

Revealing Interpretable Failure Modes of VLMs

揭示视觉语言模型的可解释性故障模式

Isha Chaudhary, Vedaant V Jain, Kavya Sachdeva, Sayan Ranu, Gagandeep Singh

机构 * UIUC(伊利诺伊大学香槟分校) Kumo AI IIT Delhi(德里印度理工学院)

AI总结 本文提出REVELIO框架,通过系统性探索揭示VLMs在自动驾驶和室内机器人领域中的可解释性故障模式,发现模型在空间定位和安全威胁识别上的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12653 2026-05-14 cs.LG cs.AI stat.ML

Plan Before You Trade: Inference-Time Optimization for RL Trading Agents

先规划再交易:用于强化学习交易代理的推理时间优化

Eun Go, Rohan Deb, Arindam Banerjee

机构 * Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出FPILOT框架,通过预测价格轨迹优化交易策略,提升总回报和风险调整指标,适用于各种预训练代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11299 2026-05-14 cs.LG cs.CL cs.SE

Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling

原始生成,双重判断:从测试时扩展进行自我训练

Yizhu Jiao, Ruixiang Zhang, Richard Bai, Jiawei Han, Ronan Collobert, Yizhe Zhang

机构 * Apple(苹果公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出DuST框架,通过双重判断空间提升代码生成与判断能力,实验显示在多个模型上显著提升测试时扩展性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15867 2026-05-14 cs.LG cs.AI cs.CL cs.MA

RDMA: Cost Effective Agent-Driven Rare Disease Mining from Electronic Health Records

RDMA: 低成本的代理驱动罕见病挖掘从电子健康记录

John Wu, Adam Cross, Jimeng Sun

机构 * Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Department of Pediatrics, University of Illinois College of Medicine Peoria(伊利诺伊大学皮奥里亚医学院儿科系)

AI总结 RDMA通过代理框架在电子健康记录中挖掘罕见病,无需特定任务训练,提升性能并降低部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00990 2026-05-14 cs.RO cs.AI cs.CV

Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations

通过模仿生成视频实现机器人操作

Shivansh Patel, Shraddhaa Mohan, Hanlin Mai, Unnat Jain, Svetlana Lazebnik, Yunzhu Li

机构 * UIUC(伊利诺伊大学香槟分校) UC Irvine(加州大学尔湾分校) Columbia University(哥伦比亚大学)

AI总结 本文提出RIGVid系统,通过模仿AI生成视频使机器人完成复杂操作任务,无需物理示范或特定机器人训练。系统利用视频扩散模型生成潜在示范视频,并通过视觉语言模型筛选符合指令的视频,再通过6D姿态跟踪器提取轨迹并映射到机器人。实验表明生成视频效果与真实示范相当,且性能随生成质量提升。

Comments In ICLR 2026. Website: https://rigvid-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏