arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

共收录 1835
2608.04042 2026-08-06 cs.RO 新提交

Kitchen Robotic Manipulation utilizing Foundation Models

基于基础模型的厨房机器人操作

Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

机构 * Kumoh National Institute of Technology(金乌国立技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究提出一种整合多种基础模型的模块化厨房机器人感知流水线,经评估优化后可在杂乱遮挡场景下实现89.12%的ADI,无需环境重训练即可完成餐具处理等家庭操作任务。

Comments Intelligent Service Robotics (ISR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06052 2026-08-06 cs.CL cs.AI 版本更新

A Survey of Agent Memory in the Second Half: Towards Self-Evolving and Long-Horizon Agents

重新思考基础智能体的内存机制:第二阶段综述

Wei-Chieh Huang, Weizhi Zhang, Yueqing Liang, Yuanchen Bei, Yankai Chen, Tao Feng, Xinyu Pan, Zhen Tan, Yu Wang, Tianxin Wei, Shanglin Wu, Ruiyao Xu, Liangwei Yang, Rui Yang, Wooseong Yang, Chin-Yuan Yeh, Hanrong Zhang, Haozhen Zhang, Siqi Zhu, Henry Peng Zou, Wanjia Zhao, Song Wang, Wujiang Xu, Zixuan Ke, Zheng Hui, Dawei Li, Yaozu Wu, Langzhou He, Chen Wang, Xiongxiao Xu, Baixiang Huang, Juntao Tan, Shelby Heinecke, Huan Wang, Caiming Xiong, Ahmed A. Metwally, Jun Yan, Chen-Yu Lee, Hanqing Zeng, Yinglong Xia, Xiaokai Wei, Ali Payani, Yu Wang, Haitong Ma, Wenya Wang, Chenguang Wang, Yu Zhang, Xin Eric Wang, Yongfeng Zhang, Jiaxuan You, Hanghang Tong, Xiao Luo, Xue Liu, Yizhou Sun, Wei Wang, Julian McAuley, James Zou, Jiawei Han, Philip S. Yu, Kai Shu

机构 * UIC(伊利诺伊大学香槟分校) IIT(伊利诺伊理工学院) UIUC(伊利诺伊大学厄巴纳-香槟分校) UW–Madison(威斯康星大学麦迪逊分校) ASU(亚利桑那州立大学) Emory(埃默里大学) Northwestern(西北大学) NTU(国立台湾大学) UCF(佛罗里达大学) Rutgers(新泽西罗格斯大学) Cambridge(剑桥大学) Harvard(哈佛大学) UTokyo(东京大学) UCSD(加州大学圣地亚哥分校) UCSC(加州大学圣塔克鲁斯分校) TAMU(德克萨斯大学奥斯汀分校) UCSB(加州大学圣塔芭芭拉分校) MBZUAI(马克斯·普朗克人工智能研究所) McGill(麦吉尔大学) UCLA(加州大学洛杉矶分校) Stanford(斯坦福大学) Salesforce Google(谷歌) Meta Roblox Cisco(思科) Capital One

AI总结 本文综述了基础智能体内存机制,从内存基质、认知机制和主体维度分析内存在不同拓扑结构下的实现,并探讨内存操作的学习策略与评估指标。

Comments Accepted at Transactions on Machine Learning Research (TMLR) with Survey Certification. Project page: https://github.com/AgentMemoryWorld/Awesome-Agent-Memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09764 2026-08-06 cs.LG 版本更新

Prototype-based Self-Supervised Multimodal Learning for PPG and Accelerometry Signals

基于原型的PPG与加速度计信号自监督多模态学习

Wanting Mao, Maxwell A Xu, Harish Haresamudram, Mithun Saha, Santosh Kumar, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Memphis(密苏里大学孟菲斯分校)

AI总结 针对PPG与加速度计等生物信号的多模态学习局限,提出基于原型的SSL框架ProtoMM,开发Pulse-Motion基础模型,性能优于现有对比式及多模态SSL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04595 2026-08-06 cs.LG

Photon Splatting: A Physics-Guided Neural Surrogate for Real-Time Wireless Channel Prediction

Ge Cao, Gabriele Gradoni, Zhen Peng

机构 * Center for Computational Electromagnetics, Department of Electrical and Computer Engineering, The Grainger College of Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电气与计算机工程系计算电磁学中心) Institute for Communication Systems, University of Surrey(萨里大学通信系统研究所) Department of Electrical and Computer Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电气与计算机工程系)

Comments 14 pages, 11 figures

Journal ref IEEE Journal of Selected Topics in Electromagnetics, Antennas and Propagation, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02831 2026-08-05 cs.SD cs.CL 新提交

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

以演化 rubric 作为奖励的强化学习用于音频推理

Fangxu Yu, Tao Feng, Dehai Min, Zinan Lin, Weijia Xu, Michael Xu, Philip S. Yu, Ge Liu, Tianyi Zhou

机构 * University of Maryland(马里兰大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft Research(微软研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 提出 AudioRubrics 强化学习框架,以自演化的音频基 rubric 奖励监督音频推理,在三个基准上大幅优于基线,收敛至稳定推理长度,提升音频感知效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01463 2026-08-05 cs.AI cs.MA 版本更新

Where Reasoning Diverges: Localized Multi-Agent Debate for Multi-Hop Question Answering

推理分歧之处:本地化多智能体辩论

Weijun Gao, Xiang Ding, Haoyang Liu, Tiancheng Xing

机构 * The Chinese University of Hong Kong(香港中文大学) Nagoya University(名古屋大学) Institute of Science Tokyo(东京科学大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对多智能体辩论冗余交换完整推理轨迹的问题,提出LMAD协议,通过定位冲突并限制辩论范围,在十个骨干模型上实现宏平均评判准确率提升7.20个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08044 2026-08-05 cs.LG cs.AI cs.CL 版本更新

When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

当行为安全评估失败时:表征层面的视角

Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Technical University of Denmark(丹麦技术大学)

AI总结 本文提出行为安全与干预鲁棒性之间的“审计差距”,通过构建解离模型和引入潜在脆弱性评分(LVS),证明行为安全指标不足以衡量表征层面的鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20956 2026-08-05 cs.LG cs.CY 版本更新

A Deployment Audit of Release-Side Risk in Conformal Triage under Prevalence Shift

发布侧风险的符合性分诊部署审计

Chengze Li, Xiao Liu, Hanrong Zhang, Haiyang Peng, Yanghao Ruan, Huanhuan Ma, Chunyu Miao, Qichao Zhou, Xiangrong Qi, Philip Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Manteia Technologies Co., Ltd(Manteia技术有限公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出了一种泄漏感知的发布侧符合性分诊审计方法,用于评估在患病率变化下,是否真正经历目标事件的患者被释放而无需审查,通过将目标主体分为三个非重叠角色来评估发布直接安全性。

Comments 20 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25077 2026-08-05 cs.AI 版本更新

Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective

在弱到强对齐中评估风险:从偏差-方差视角出发

Hamid Osooli, Kareema Batool, Rick Gentry, Tiasa Singha Roy, Ashwin Gupta, Anirudha Ramesh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软) InstaDeep New York University(纽约大学)

AI总结 本文从偏差-方差视角分析弱到强对齐的风险,通过连续置信度分数研究经验组件,发现强模型方差是欺骗的主要预测因素,表明弱强依赖性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02438 2026-08-04 cs.AI 新提交

xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding

xPress:推测解码中扩散草稿模型的并行优化

Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM(国际商业机器公司(IBM))

AI总结 xPress是恢复扩散草稿模型因果依赖的并行优化方法,在Qwen3-8B的7个基准上,可提升推测解码的接受长度与端到端吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01631 2026-08-04 cs.CL 新提交

Does Accuracy Equal Evidence? Reasoning Faithfulness under KV Cache Compression

准确率等同于证据吗?KV缓存压缩下的推理忠实性

Mengting Ai, Jingrui He, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 该研究针对大型推理模型,发现KV缓存压缩中存在答案-证据差距,即令牌驱逐类方法可保留高准确率却大幅降低推理忠实性,而量化方法受影响更小,表明失效源于推理轨迹部分丢失。

Comments https://github.com/famous-blue-raincoat/Safe_KV_Compress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01456 2026-08-04 cs.CV cs.CL 新提交

Long-Horizon Embodied Decision-Making via Multimodal Memory Compression

基于多模态记忆压缩的长视野具身决策

Bingxuan Li, Rui Yang, Cheng Qian, Jiateng Liu, Jeonghwan Kim, Zhenhailong Wang, Manling Li, Tong Zhang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

AI总结 该研究提出DunphyBench基准用于评估长视野具身决策,发现当前智能体与人类表现存在差距,设计了MeMento记忆压缩器,使VLM驱动智能体准确率提升7.18%且内存使用降低85.38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01392 2026-08-04 cs.CV 新提交

FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision

FineMoLA:基于片段级监督的细粒度动作-语言对齐研究

Tongyan Wang, Zhengyuan Li, Muhan Lin, Shengyang Luo, Yifan Shen, Aniket Bera, Baijian Yang, Yingjie Victor Chen

机构 * Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对现有动作-语言数据集仅提供片段级监督导致细粒度对齐不足的问题,提出弱监督框架FineMoLA,将动作-语言对齐建模为最优传输问题,在SnapMoGen上的实验显示其动作-文本定位性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00371 2026-08-04 cs.CV 新提交

Decoding Children's Gait Behavior

儿童步态行为解码

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) PediaMed AI Shenzhen Children’s Hospital(深圳市儿童医院) Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00356 2026-08-04 cs.CV 新提交

The 1st AI Children Challenge

第一届AI儿童挑战赛

Boyi Li, Yifan Shen, Houze Yang, Xu Cao, Guojun Yun, Li Gao, Turong Chen, Long Xu, Jianguo Cao, Meihuan Huang

机构 * PediaMed AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Hong Kong Polytechnic University(香港理工大学)

AI总结 该第一届AI儿童挑战赛推出儿童步态视觉分析赛道,设EVGS评分、脑瘫步态模式分类任务,提供对应数据集与真值以推动AI在儿童医疗领域的应用。

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 5564-5570. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25327 2026-08-04 cs.RO 版本更新

Belief-Aware Influence and Trust (BAIT): Shaping Human Belief During Repeated Human-Robot Interaction

信念感知影响与信任(BAIT):在人机重复交互中塑造人类信念

Ye-Ji Mun, Mahsa Golchoubian, Shahabedin Sagheb, Yan Bai, Tianhao Ji, Dylan P. Losey, Katherine Driggs-Campbell

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学) Virginia Tech(弗吉尼亚理工大学)

AI总结 研究针对重复人机交互问题,提出BAIT控制器将分层粒子滤波器与信念感知规划器集成,能推断人类信念变化,优化长期影响与人类信任的权衡,在多场景实验中任务性能与基线相当且用户信任更高。

Comments 9 pages, 4 figures, submitted to IEEE Robotics and Automation Letter (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06435 2026-08-04 cs.AI 版本更新

Trust but Verify:Evidence-Linked Multi-Agent Clinical Information Extraction in Pathology

从细则中发现幽门螺杆菌:基于证据关联的多智能体胃活检报告病例发现

Yufan Wang, Anit Kumar Sahu, Yan Fei Ng, Daniel Kang, Shayan Vassef, Soorya Ram Shimgekar, Koustuv Saha, Piyum Zonooz, Navin Kumar, Chee Leong Cheng, Li Yan Khor

机构 * Department of Anatomical Pathology, Singapore General Hospital(新加坡中央医院解剖病理科) Duke–NUS Medical School(新加坡国立大学Duke-NUS医学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究者)

AI总结 研究针对胃活检报告中幽门螺杆菌证据提取难题,采用Nimblemind多智能体系统,经试点评估其总体准确率达98.61%,虽与其他比较器性能相似,但实现了工作流程整合和可追溯性,还能大幅减少审查时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20997 2026-08-04 cs.AI 版本更新

BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery

BioInsight: 面向交互式生物医学知识发现的多智能体编排

Jieyi Wang, Bingxuan Li, Nanyi Jiang, Desong Meng, Zirui Fan, Yuxin Guo, Jiayu Liu, Kunlun Zhu, Eddie Yang, Xiusi Chen, Pan Lu, Bingxin Zhao

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Purdue University(普渡大学) Stanford University(斯坦福大学)

AI总结 提出多智能体系统BioInsight,通过交互式界面生成替代静态报告,实现疾病证据的组织、推理与可视化,在多项生物医学任务中取得最优性能。

Comments Update some experiments and contents

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01095 2026-08-04 cs.CV cs.LG 版本更新

NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

NarrativeTrack: 评估实体中心推理在叙事理解中的表现

Hyeonjeong Ha, Jinjin Ge, Bo Feng, Kaixin Ma, Gargi Chakraborty

机构 * Apple(苹果公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。

Comments Project Page: https://github.com/apple/ml-NarrativeTrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19258 2026-08-04 cs.CL cs.AI cs.CR cs.LG 版本更新

MAPLE: Metadata Augmented Private Language Evolution

MAPLE:元数据增强的隐私语言演化

Eli Chien, Yuzheng Hu, Ryan McKenna, Shanshan Wu, Zheng Xu, Peter Kairouz

机构 * National Taiwan University(国立台湾大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Research(谷歌研究) Meta

AI总结 MAPLE通过差分隐私元数据提取和上下文学习,解决私有演化中初始化瓶颈问题,实现更优的隐私-效用平衡和更低的API成本。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10871 2026-08-04 cs.CL

From Fact to Judgment: Investigating the Impact of Task Framing on LLM Conviction in Dialogue Systems

从事实到判断:探讨任务框架对对话系统中LLM确信度的影响

Parisa Rabbani, Nimet Beyza Bozdag, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究探讨了任务框架对LLM在对话系统中判断确信度的影响,发现对话上下文显著改变模型判断,强调了对话框架在评估中的重要性。

Comments 11 pages, 3 figures

Journal ref Proceedings of the 16th International Workshop on Spoken Dialogue System Technology (IWSDS 2026), pages 193-204

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28674 2026-08-03 cs.AI cs.CL cs.LG 新提交

How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories

它认为有多难?分析大型语言模型思维链轨迹中感知步骤的推理能量

Hui Wei, Junda Wu, Sheldon Yu, Sizhe Zhou, Yizhu Jiao, Ming Zhong, Bowen Jin, Tong Yu, Shijia Pan, Jiawei Han, Julian McAuley

机构 * UC Merced(加州大学默塞德分校) UC San Diego(加州大学圣迭戈分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(奥多比研究院)

AI总结 该研究提出SARE框架量化LLM思维链各步骤的推理能量,发现推理能量不均匀、错误轨迹关键节点能量更低,SARE特征性能优于或匹配输出置信度基线,揭示内部几何动态含预测信息。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19957 2026-08-03 cs.CR cs.AI cs.LG 版本更新

HijackKV: New Threat in Position-Independent KV Cache Reuse

HijackKV:位置无关的键值缓存重用中的新威胁

Yichi Zhang, Zhiqi Wang, Huan Zhang, Yuchen Yang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究位置无关的KV缓存重用中的新威胁KV缓存劫持,介绍HIJACKKV攻击框架,该框架可优化攻击者控制的前缀,使受污染的KV在特定条件下劫持模型行为,单次尝试成功率达94%,还为构建安全KV重用系统提供设计见解。

Comments 20 pages, accepted by USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07161 2026-08-03 cs.AI 版本更新

SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios

SREGym:面向AI SRE代理的实时基准测试平台,具有高保真的故障场景

Jackson Clark, Yiming Su, Saad Mohammad Rafid Pial, Yifang Tian, Lily Gniedziejko, Hans-Arno Jacobsen, Yinfang Chen, Tianyin Xu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学)

AI总结 SREGym通过模拟真实云原生系统栈中的高保真故障场景,为AI SRE代理提供实时基准测试环境,包含90个真实挑战性SRE问题,评估前沿代理能力差异显著,可达40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28627 2026-07-31 cs.CV cs.AI cs.LG 新提交

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

ReToken:用一个标记改进用于视觉检索的视觉-语言模型

Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) Google DeepMind(谷歌DeepMind)

AI总结 该研究提出轻量级ReToken,通过选择视觉键值缓存中与查询相关的稀疏标记解决长视觉上下文的视觉检索难题,在多基准测试中提升Qwen3VL-8B等模型性能,且可在单H100运行。

Comments Code: https://github.com/avaxiao/ReToken

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27783 2026-07-31 cs.CL cs.AI cs.LG 新提交

Reasoning Consensus: Structural Ensembling of LLM Reasoning via Weighted DAG Aggregation

推理共识:通过加权有向无环图聚合实现大语言模型推理的结构集成

Amruta Parulekar, Jinu Lee, Dilek Hakkani-Tür, Hari Sundaram

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 该研究提出通过加权DAG聚合集成LLM推理结构的框架,在六个基准上优于多数投票基线,可提供可检查的共识推理图,还能分析不同推理视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27372 2026-07-31 cs.LG cs.AI cs.CL cs.CV 新提交

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

探索式建模:解锁第三大预训练轴与端到端生成

Alexi Gladstone, Heng Ji, Yilun Du

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学)

AI总结 本研究提出探索式建模(XMs),为生成式模型增添第三预训练轴,可提升多域性能与效率,还能实现端到端重构生成建模,推理步骤大幅减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15040 2026-07-31 cs.AI cs.CL 版本更新

Orchard: An Open-Source Agentic Modeling Framework

Orchard:一个开源的智能体建模框架

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandro Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) UIUC(伊利诺伊大学香槟分校)

AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16140 2026-07-31 cs.LG 版本更新

Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards

具有可验证奖励的强化学习中噪声数据是破坏性的

Yuxuan Zhu, Daniel Kang

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana Champaign, USA(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究指出,现有RLVR算法无法缓解噪声影响,噪声会破坏强化学习性能,真实世界噪声导致Text2SQL任务准确率下降5-12%。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26637 2026-07-30 cs.CL cs.AI 新提交

Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

面向LLM智能体的基于文件系统的内存:组织、演化与可持续性

Sizhe Zhou, Sheldon Yu, Hui Wei, Junda Wu, Siru Ouyang, Yizhu Jiao, Shijia Pan, Julian McAuley, Yu Zhang, Tong Yu, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Merced(加利福尼亚大学默塞德分校) Adobe Research(奥多比研究院) Texas A&M University(德克萨斯农工大学)

AI总结 本研究首次系统探索面向LLM智能体的基于文件系统的内存,定义三个智能体角色开展实验,发现有组织存储可减半检索成本,但多数智能体组织会退化,工具集对存储形态的影响与更换模型相当,将文件系统设为智能体内存的设计空间。

Comments 59 pages, 12 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏