arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

共收录 212
2608.13284 2026-08-14 cs.RO 新提交

Predictive Relative-Velocity Steering for Safe Robotic Manipulator Teleoperation in Dynamic Environments

动态环境下安全机器人操纵器遥操作的预测相对速度转向方法

Changhao Hu, Zeyi Liu, Songqiao Hu, Shuang Liu, Zihan Meng, Xiao He

机构 * Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) TetraBOT

AI总结 针对动态环境下机器人遥操作的安全问题,提出轻量级模块化预测相对速度转向框架,可提升末端执行器避障率并缓解死锁,仿真与物理实验验证了其有效性。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12852 2026-08-14 cs.CL cs.AI 新提交

Falsehood and Impossibility Are Different Directions in an AI's Representation of Language

AI对语言的表征中,虚假与不可能是不同的方向

Yoon Pyo Lee

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究通过对Gemma 3 4B IT模型的激活分析,发现其内部能区分语言的不可能性与虚假,但将偶然虚假混同于矛盾,且不可能性表征与真值、语义异常表征方向不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12564 2026-08-14 cs.LG 新提交

Scaling Automatic Research Agents via World Models

通过世界模型扩展自动研究智能体

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Chenlei Guo, Jingrui He, Zhenyu Liao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12307 2026-08-13 cs.LG cs.AI cs.CL 新提交

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

测试时的AI辅助AI:通过 harness 实现强模型到弱模型的能力迁移

Cheng Qian, Wenting Zhao, Liangwei Yang, Heng Wang, Jielin Qiu, Heng Ji, Silvio Savarese, Huan Wang, Shelby Heinecke

机构 * Salesforce AI Research(Salesforce人工智能研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 该研究提出在测试时通过构建 harness,无需重新训练即可将强模型的认知结构迁移给弱模型,使目标模型在四个心理理论基准上的平均性能从0.49提升至0.91,为模型能力迁移提供了新的思路。

Comments 23 Pages, 12 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11888 2026-08-13 cs.AI 新提交

Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents

智能体技能可能有害:LLM智能体中技能诱导故障的实证研究

Gen Dong, Yanjie Gao, Liqun Li, Tianyin Xu, Yu Hua, Fan Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Microsoft Research(微软研究院) Microsoft(微软) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文通过提出差异分析框架,在SkillsBench等数据集上发现LLM智能体的技能会引发功能故障与效率回归,并构建SkillTriage工具,为安全复用技能提供研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11705 2026-08-13 cs.AI 新提交

Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning

提升大语言模型的客观性:通过特质不变安全微调稳定LLM在不同特质下的安全行为

Lang Cao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对LLM因系统提示词中特质不同导致同一请求安全决策不一致的问题,提出特质不变安全微调(TIST)框架及TraSN方法,提升跨特质安全稳定性且保留通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11624 2026-08-13 cs.CL cs.AI 新提交

Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs

学习说服暴露了大语言模型(LLMs)放弃正确信念的难易程度

Nimet Beyza Bozdag, Emre Can Acikgoz, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究发现优化后的对抗性说服策略可轻易让LLMs放弃正确信念,攻击成功率高且可迁移,凸显多智能体决策系统需将说服鲁棒性作为安全标准

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11425 2026-08-13 cs.CV 新提交

VLMs Win a Systematic Evaluation of Underwater Image Reconstruction

视觉语言模型(VLMs)在水下图像重建的系统评估中胜出

Sara Aghajanzadeh, Yingxue Wang, Ieva Bagdonaviciute, David Forsyth

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出水下图像重建的系统评估流程,评估发现未经过明确物理模型训练的视觉语言模型(VLMs)显著优于基于物理的模型,真实场景图像结果验证了该评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11367 2026-08-13 cs.CV cs.AI 新提交

Gaze Target Estimation Anywhere with Concepts

基于概念的任意场景注视目标估计

Xu Cao, Houze Yang, Vipin Gunda, Zhongyi Zhou, Tianyu Xu, Adarsh Kowdle, Inki Kim, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌公司)

AI总结 针对现有注视估计方法依赖中间阶段、缺乏灵活性的局限,提出PGE任务,构建Gaze-Co数据集,开发GazeAnywhere模型,实现端到端的概念驱动注视目标估计并达到最优性能。

Comments CVPR 2026 Code and Benchmark are aviliable at https://github.com/IrohXu/GazeAnywhere and https://huggingface.co/datasets/IrohXu/Gaze-Co-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11287 2026-08-13 cs.CV cs.AI cs.LG 新提交

CLEAR: Class-wise Expert Aggregation with Structured Sampling for Long-Tailed Classification

CLEAR:面向长尾分类的结构化采样类级专家聚合

Gawon Lim

机构 * School of Information Sciences(信息科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对长尾分类中模型在不同类别间可靠性不均的问题,提出模块化集成框架CLEAR,通过结构化采样生成专家并估计类级信任分数,实验显示其在多数据集上表现优异,尤其小样本性能突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11044 2026-08-12 cs.CL 新提交

TEAMMix: Taxonomy Enrichment Augmentation and Minority-augmented Mixing Strategy for LLM-enhanced Weak-Supervised Hierarchical Text Classification

TEAMMix:用于大语言模型增强弱监督分层文本分类的类别体系丰富增强与少数类增强混合策略

Jian Zhang, Zhuohao Yang, Songlin Lei, Bangli Liu, Ziwei Wang, Xufeng Weng, Gehan Amaratunga, Yu Lin, Hongwei Wang

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC研究院) Shaoxing K3i Technology Co. Ltd(绍兴K3i科技有限公司) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

AI总结 针对LLM应用于分层文本分类的局限,本文提出TEAMMix框架,通过丰富标签层次、生成伪样本并优化其质量,提升了细粒度及不平衡数据集上的分类性能。

Comments Accepted by IEEE CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10374 2026-08-12 cs.LG 新提交

Fisher8: Stabilizing Neural Heteroscedastic Regression via Output-Layer Fisher Geometry

Fisher8:通过输出层Fisher几何稳定神经异方差回归

Sumedh Vemuganti, Nickvash Kani

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 Fisher8是一种输出层梯度修正方法,通过Fisher几何稳定神经异方差回归,无数据依赖超参数,在多维回归等任务中实现了更优的似然-误差权衡与校准不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10299 2026-08-12 cs.CL 新提交

Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design

智能体系统中的协同进化:迈向超越人类设计的自主进化

Qing Zong, Jiayu Liu, Junhao Shen, Zecong Tang, Linsi Wu, Yuxuan Liu, Rui Wang, Zhaowei Wang, Weiqi Wang, Cheng Qian, Xiusi Chen, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 本综述聚焦智能体系统的协同进化,提出三阶段分类法梳理其发展,探讨相关开放挑战,为构建超越人类设计路径的自主智能体系统提供统一基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09807 2026-08-11 cs.RO cs.SY eess.SY 新提交

WRAP: Wasserstein-Robust Adaptive Plug-in for Robot Localization

WRAP:用于机器人定位的Wasserstein鲁棒自适应插件

Minhyuk Jang, Astghik Hakobyan, Jungjin Lee, Naira Hovakimyan, Insoon Yang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 该研究提出适用于EKF和ESKF的Wasserstein鲁棒插件WRAP,经实验验证可显著降低机器人定位的3D位置RMSE,且计算耗时短,能改善定位一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08236 2026-08-11 cs.AI cs.CL 新提交

LatticeMind: A Conflict-Aware Memory Primitive for Multi-Agent Systems

LatticeMind:面向多智能体系统的冲突感知记忆原语

Heng Zhou, Lian Zhang, Yutao Fan, Tiancheng He, Siki Chen, Hejia Geng, Philip Torr, Zhenfei Yin

机构 * University of Science and Technology of China(中国科学技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai AI Laboratory(上海人工智能实验室) Beijing University of Posts and Telecommunications(北京邮电大学) University of Oxford(牛津大学)

AI总结 本研究提出冲突感知记忆原语LatticeMind,解决多智能体LLM系统的主张信任决策问题,在ConflictBank评估中准确率达0.97,显著优于基线, ablation验证了其核心组件的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07261 2026-08-10 cs.CL 新提交

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

仅知道两跳信息是不够:理解语言模型中的两跳泛化

Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。

Comments 24 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07004 2026-08-10 cs.RO cs.SY eess.SY 新提交

Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical Systems

面向复杂动态系统反馈控制器设计的大语言模型基准测试与推理蒸馏

Zhongchao Zhou, Yixuan Xie, Wenwei Yu, Yuxi Lu, Yaonan Zhu, Qian Niu, Yutaka Matsuo, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Chiba University(千叶大学) Tongji University(同济大学) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院)

AI总结 该研究构建了CoDyControlBench基准,评估了6种LLMs的控制器设计性能,开发的15亿参数推理蒸馏模型可实现边缘部署,在机械臂试验中成功完成目标跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06867 2026-08-10 cs.CL 新提交

LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers

LLMRouter:用于开发、评估和部署LLM路由器的统一基础设施

Tao Feng, Fangxu Yu, Haozhen Zhang, Zhongjie Dai, Liangqi Yuan, Zijie Lei, Weizhi Zhang, Kunlun Zhu, Haodong Yue, Keyang Xuan, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学帕克分校) Nanyang Technological University(南洋理工大学) Purdue University(普渡大学) University of Illinois Chicago(芝加哥伊利诺伊大学)

AI总结 针对现有LLM路由器难以公平比较和扩展的问题,研究提出LLMRouter统一基础设施,构建含多类任务的基准xRouteBench,发现学习型路由器等的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06366 2026-08-07 cs.AI cs.LG 新提交

Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering

追踪核心:一种用于心力衰竭特征工程的证据关联管道

Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo

机构 * Nimblemind(宁敏德(音译)) Singapore University of Technology and Design(新加坡科技设计大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Florida International University(佛罗里达国际大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校) Rutgers University Newark(罗格斯大学纽瓦克分校) Rutgers Institute for Health Health Care Policy and Aging Research(罗格斯大学健康、医疗保健政策与老龄化研究所) Robert Wood Johnson Medical School(罗伯特·伍德·约翰逊医学院) Rutgers Health(罗格斯医疗)

AI总结 该研究针对心力衰竭EHR特征工程瓶颈,开发了nMAS管道,经500条虚拟记录验证,可提升HFrEF和HFpEF表型分析的AUROC,为自动化可审核特征工程提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05579 2026-08-07 cs.RO 新提交

ARGUS: Aligning Robot Scene Geometry Under Shifting Views with Large 3D Vision Models

ARGUS:利用大规模3D视觉模型在视角变化下对齐机器人场景几何结构

Rishik Sathua, Haonan Chen, Katherine Driggs-Campbell

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学)

AI总结 本研究提出ARGUS,一种利用大规模3D视觉模型对齐机器人场景几何结构的观测预处理流水线,可提升机器人操纵策略在视角多样化场景下的性能与学习效率。

Comments Project webpage: https://rsathua.github.io/ARGUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05446 2026-08-07 cs.LG cs.CL 新提交

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

EvoHarness-RL:为长视野大语言模型智能体学习自进化运行时管控器

Xuying Ning, Dongqi Fu, Tianxin Wei, Hanqing Zeng, Yuanchen Bei, Bingxuan Li, Zihao Li, Qifan Wang, Xiang Shen, Yifan Wu, Jiayi Liu, Hong Li, Yinglong Xia, Xiangjun Fan, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta AI

AI总结 本研究提出 EvoHarness-RL 方法,通过学习管控器策略解决长视野 LLM 智能体的外部状态管理问题,在 ALFWorld 上达到 96.9% 的任务成功率,验证了可训练管控器策略的有效性。

Comments Accepted to LLA@COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05254 2026-08-07 cs.CL cs.SC 新提交

Constraint-First Reasoning: A Training-Free Protocol for Exploiting Answer-Space Constraints in Mathematical Problem Solving

约束优先推理:一种在数学问题求解中利用答案空间约束的无训练协议

Hongbo Ma, Bangji Yang, Yunqian Selina Cheng, Jiajun Fan, Hanwen Zhang, Ge Liu

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 该研究针对大型语言模型解数学题易违反约束的问题,提出无训练的两阶段提示协议CFR,经多数据集及多维度实验验证可提升性能,是针对性的测试时干预措施。

Comments 53 pages, 5 figures, 36 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05163 2026-08-07 cs.CL cs.LG 新提交

Where Privacy Risk Lives in English-Source Multilingual RAG: A Stage-Decomposed Audit Across Five Query Languages

英语源多语言检索增强生成(RAG)系统的隐私风险所在:五种查询语言下的阶段分解审计

Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

AI总结 该研究针对英语源多语言RAG系统,通过含五种查询语言的两阶段防御审计发现,非英语语言仍存在残留PII泄露,附加黄金文档可阻断多数残留单元,后续计划开展独立MT与非Qwen判别器的复现工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05149 2026-08-06 cs.CV 新提交

CoCo-IR: Contextual Composed Image Retrieval

CoCo-IR:上下文组合图像检索

Shengcao Cao, Tanmaya Shekhar Dabral, Zhongli Ding, Madhuri Shanbhogue, Kaifeng Chen, Zhe Li, Mojtaba Seyedhosseini, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google DeepMind(谷歌DeepMind) OpenAI

AI总结 针对现有图像检索系统无法处理多轮交互的局限,提出CoCo-IR任务,构建基于LMM的模型并开发自主数据引擎,在CIRCO和自建CoCo-IR基准上取得最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05139 2026-08-06 cs.CL cs.LG 新提交

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

面向技能原生的大语言模型:用于基准测试和训练长程推理的技能熵

Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) University of Oxford(牛津大学)

AI总结 该研究针对现有基准无法评估LLM跨技能长程推理能力的问题,提出Skill Entropy(技能熵)并构建Skill²-Bench基准,还开发Skill-Entropy RL训练框架,显著提升了Qwen3模型在该基准上的表现。

Comments https://github.com/Gen-Verse/Skill-Entropy-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04042 2026-08-06 cs.RO 新提交

Kitchen Robotic Manipulation utilizing Foundation Models

基于基础模型的厨房机器人操作

Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

机构 * Kumoh National Institute of Technology(金乌国立技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究提出一种整合多种基础模型的模块化厨房机器人感知流水线,经评估优化后可在杂乱遮挡场景下实现89.12%的ADI,无需环境重训练即可完成餐具处理等家庭操作任务。

Comments Intelligent Service Robotics (ISR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02831 2026-08-05 cs.SD cs.CL 新提交

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

以演化 rubric 作为奖励的强化学习用于音频推理

Fangxu Yu, Tao Feng, Dehai Min, Zinan Lin, Weijia Xu, Michael Xu, Philip S. Yu, Ge Liu, Tianyi Zhou

机构 * University of Maryland(马里兰大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft Research(微软研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 提出 AudioRubrics 强化学习框架,以自演化的音频基 rubric 奖励监督音频推理,在三个基准上大幅优于基线,收敛至稳定推理长度,提升音频感知效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02438 2026-08-04 cs.AI 新提交

xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding

xPress:推测解码中扩散草稿模型的并行优化

Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM(国际商业机器公司(IBM))

AI总结 xPress是恢复扩散草稿模型因果依赖的并行优化方法,在Qwen3-8B的7个基准上,可提升推测解码的接受长度与端到端吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01631 2026-08-04 cs.CL 新提交

Does Accuracy Equal Evidence? Reasoning Faithfulness under KV Cache Compression

准确率等同于证据吗?KV缓存压缩下的推理忠实性

Mengting Ai, Jingrui He, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 该研究针对大型推理模型,发现KV缓存压缩中存在答案-证据差距,即令牌驱逐类方法可保留高准确率却大幅降低推理忠实性,而量化方法受影响更小,表明失效源于推理轨迹部分丢失。

Comments https://github.com/famous-blue-raincoat/Safe_KV_Compress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01456 2026-08-04 cs.CV cs.CL 新提交

Long-Horizon Embodied Decision-Making via Multimodal Memory Compression

基于多模态记忆压缩的长视野具身决策

Bingxuan Li, Rui Yang, Cheng Qian, Jiateng Liu, Jeonghwan Kim, Zhenhailong Wang, Manling Li, Tong Zhang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

AI总结 该研究提出DunphyBench基准用于评估长视野具身决策,发现当前智能体与人类表现存在差距,设计了MeMento记忆压缩器,使VLM驱动智能体准确率提升7.18%且内存使用降低85.38%。

详情

展开后加载摘要…

URL PDF HTML 收藏