Hidden States as Early Signals: Step-level Trace Evaluation and Pruning for Efficient Test-Time Scaling
隐藏状态作为早期信号:用于高效测试时间扩展的步骤级追踪评估与剪枝
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出STEP框架,通过评估隐藏状态实现步骤级追踪剪枝,有效降低推理延迟并提升推理准确性。
高校专区
隐藏状态作为早期信号:用于高效测试时间扩展的步骤级追踪评估与剪枝
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出STEP框架,通过评估隐藏状态实现步骤级追踪剪枝,有效降低推理延迟并提升推理准确性。
评分轮盘:LLM作为裁判框架中的自不一致
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 研究揭示LLM作为裁判框架在不同运行中评分不一致的问题,探讨通过规范指南提升其评估效果的可行性。
Comments Accepted at EMNLP 2025
RAG-RL:通过强化学习和课程学习推进检索增强生成
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 RAG-RL通过强化学习和课程学习提升检索增强生成性能,使生成模型能识别并引用相关信息,提高样本效率和泛化能力,实验显示在多跳问答任务中准确率显著提升。
ARQ:一种用于准确且可证明鲁棒的深度神经网络的混合精度量化框架
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 ARQ通过强化学习和随机平滑技术,在保持干净准确性和可证明鲁棒性的同时,高效优化深度神经网络的量化。
AIDOVECL: 人工智能生成的车辆出图数据集用于眼级分类和定位
机构 * The Grainger College of Engineering, Department of Civil and Environmental Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校土木与环境工程系格拉inger工程学院) ; Center for Artificial Intelligence Innovation, National Center for Supercomputing Applications, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校人工智能创新中心国家超级计算应用中心) ; The Grainger College of Engineering, Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院计算与数据科学学院) ; The Grainger College of Engineering, Department of Electrical and Computer Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院电气与计算机工程系)
AI总结 本文提出AIDOVECL数据集,通过出图技术生成多样化车辆图像,解决自动驾驶、城市规划等领域中缺乏眼级车辆图像的问题,提升检测性能并减少标注工作量。
Comments 34 pages, 10 figures, 5 tables
FARM:通过功能团意识增强分子表示
机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院) ; Department of Computer Science, Texas A&M University(德克萨斯大学计算机科学系) ; Department of Chemistry, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校化学系) ; Department of Chemical & Biomolecular Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校化学与生物分子工程系)
AI总结 FARM通过整合功能团注释提升分子表示,结合SMILES与分子图,改进Transformer模型的分子表示能力,实现功能团与结构信息的联合编码。
Comments Preprint. The code is available at: https://github.com/thaonguyen217/farm_molecular_representation
绿色防护:面向可信AI的用户导向方法
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Melbourne(墨尔本大学) ; University of California, San Francisco(加州大学旧金山分校) ; University of Georgia(佐治亚大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出Green Shielding方法,通过分析用户输入变化对模型行为的影响,为可信AI部署提供证据支持的指导。通过医疗诊断基准测试,展示了交互选择如何系统性地影响模型输出属性,支持高风险领域更安全的部署。
Ramen: 通过主动样本选择实现视觉语言模型的鲁棒性测试时适应
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出Ramen框架,通过主动样本选择实现视觉语言模型在混合域下的鲁棒测试时适应,通过领域一致性与预测平衡准则提升适应性能,实验表明其在多种图像退化和领域偏移基准上表现优异。
Comments Accepted by CVPR 2026 (Findings Track)
HyReach:基于视觉的混合机械臂在未见的杂乱环境中实现稳健的开放世界物体抓取
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Skild AI
AI总结 本文提出一种实时混合刚柔连续机械臂系统,通过视觉感知与3D场景重建结合形状感知运动规划,实现鲁棒的开放世界物体抓取,实验表明在杂乱环境中误差低于2厘米。
Comments 8 pages, 5 figures, 5 tables
面向大推理模型的节能路由
机构 * Department of Electrical and Computer Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) ; AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)
AI总结 研究针对大推理模型的能耗问题,提出基于能量供应与波动平衡的路由策略,通过第二阶分析提升系统性能稳定性。
h-MINT:基于分层分子相互作用网络的口袋-配体结合建模
机构 * Department of Computer Science, UIUC(伊利诺伊大学厄巴纳-香槟分校计算机科学系) ; DOE Center for Advanced Bioenergy and Bioproducts Innovation, UIUC(美国能源部先进生物能源与生物产品创新中心,伊利诺伊大学厄巴纳-香槟分校) ; School of Computer Science, McGill University(麦吉尔大学计算机科学系) ; MILA-Québec AI Institute(魁北克AI研究所) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究 institute) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
AI总结 本文提出h-MINT模型,通过重叠BPE分词和分层分子相互作用网络,改进分子表示以提升结合亲和力预测和虚拟筛选性能。
双方差的故事:当单种子基准在贝叶斯深度学习中失效时
机构 * Department of Mathematical and Statistical Sciences(数学与统计科学系) ; Marquette University(马凯特大学) ; Cornell Ann S. Bowers College of Computing and Information Science(康奈尔大学安·S·博斯计算与信息科学学院) ; Cornell University(康奈尔大学) ; Physics Science and Engineering(物理科学与工程) ; Tongji University(同济大学) ; School of Computing and Information Systems(计算与信息科学学院) ; The University of Melbourne(墨尔本大学) ; Siebel School of Computing and Data Science(希贝尔计算与数据科学学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 研究探讨了在有限数据下,单种子基准的均值作为随机变量的可靠性,发现某些方法在训练过程中会产生显著的方差峰值,影响模型评估结果。
贝叶斯深度学习评估中的不稳定性
机构 * Department of Mathematical and Statistical Sciences(数学与统计学系) ; Marquette University(马凯特大学) ; Cornell University(康奈尔大学) ; The University of Melbourne(墨尔本大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tongji University(同济大学)
AI总结 本文指出在数据稀缺时,贝叶斯深度学习方法的评估假设失效,提出使用贝叶斯分层模型和预测最小可检测差异曲线来评估方法稳定性,证明在低数据环境下需考虑不确定性。
In-Sync: 语音感知大语言模型在ASR中的适应性改进:基于词级时间戳预测
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; IBM Research(IBM研究院)
AI总结 本文提出通过词级时间戳预测提升ASR性能,采用轻量训练策略增强对齐鲁棒性,实验证明在多个数据集上提升了时间戳准确性和整体ASR表现。
Comments Accepted to ICASSP 2026
SEVerA: 验证合成自进化代理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google(谷歌)
AI总结 SEVerA通过引入形式化guarded生成模型,结合搜索、验证和学习三阶段框架,在程序验证、符号数学合成等任务中实现零约束违规,提升自进化代理的正确性和性能。
Comments First Formally Verified Self-Evolving LLM Agents
POPI:通过优化自然语言偏好推断实现个性化LLM
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊) ; University of Notre Dame(Notre Dame 大学)
AI总结 POPI提出一种用户级个性化框架,通过自然语言接口分离共享推断模型和生成器,统一优化目标提升个性化质量并减少上下文开销。
通过渐进式任务特定适应实现参数高效的多任务学习
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊)
AI总结 本文提出渐进式任务特定多任务适应方法,通过共享适配器模块和任务相似性计算,提升多任务学习效果,实验显示在PASCAL和NYUD-v2数据集上优于传统参数高效方法。
Comments Accepted to AISTATS 2026
学习隐藏风险:面向金融领域的可控多轮红队测试框架
机构 * Bloomberg(彭博社) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Florida International University(佛罗里达国际大学) ; Boise State University(博伊西州立大学)
AI总结 本文提出CoRT框架,通过可控的多轮红队测试方法,针对金融领域潜在风险进行隐蔽攻击,提升LLM在监管合规方面的安全性。
Comments Accepted for ACL'26 (Main). TL;DR: We propose a controllable multi-turn risk-concealed red-teaming framework, CoRT, that progressively conceals surface-level risk while exploiting regulatory-violating behaviors on a proposed new benchmark, FinRisk-Bench
EMCompress: 具有端态多模态压缩的视频大语言模型
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Northwestern University(西北大学)
AI总结 本文提出端态多模态压缩(EMC)作为视频问答的结构约束充分统计问题,通过端态变换保持答案不变性,提升视频语言理解的训练和推理性能。
可微滤波用于学习隐马尔可夫模型
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Coordinated Science Laboratory(协调科学实验室) ; Department of Mechanical Science and Engineering(机械科学与工程系)
AI总结 本文提出Belief Net,通过将前向滤波建模为结构化神经网络,利用随机梯度下降学习隐马尔可夫模型参数,实现高效且可解释的参数估计。
Comments 20 pages, 8 figures, accepted to conference: L4DC 2026
NSF关于人工智能在电子设计自动化领域的研讨会报告
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Georgia Institute of Technology(佐治亚理工学院) ; University of California at Los Angeles(加州大学洛杉矶分校) ; Cadence Design Systems, Inc.(Cadence设计系统公司) ; Stanford University(斯坦福大学) ; University of Texas at Austin(得克萨斯大学奥斯汀分校) ; IBM
AI总结 报告总结了NSF人工智能在电子设计自动化领域研讨会的讨论和建议,探讨了AI技术如何加速EDA设计流程,提出加强AI与EDA合作、投资基础AI研究等核心贡献。
Comments Accepted by IEEE Circuits and Systems Magazine (2026). This is the accepted version. The published version is available at https://ieeexplore.ieee.org/document/11466406
Journal ref IEEE Circuits and Systems Magazine, vol. 26, no. 1, First Quarter 2026
灵活的多任务学习与因子化扩散策略
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Harvard University(哈佛大学) ; Norwegian University of Science and Technology(挪威科学与技术大学) ; Columbia University(哥伦比亚大学)
AI总结 本文提出一种因子化扩散策略框架,通过将复杂动作分布分解为多个专用扩散模型,提升多任务学习的灵活性和适应性,实验证明其在仿真和现实机器人任务中表现优异。
联邦非线性系统辨识
机构 * Wadhwani School of Data Science and AI(瓦德哈尼数据科学与人工智能学校) ; Department of Electrical Engineering(电气工程系) ; Center for Responsible AI(负责任人工智能中心) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; AI Innovation Institute(人工智能创新研究院) ; Stony Brook University(石溪大学)
AI总结 本文研究了线性参数化非线性系统的联邦学习,证明了联邦非线性系统辨识在客户端数量增加时收敛速度优于集中方法,通过精心选择特征映射$ϕ$提升性能。
Comments Accepted at American Control Conference 2026
语言特定知识:模型在X语言中是否比在英语中表现更好?
机构 * Department of Computer Science University of Illinois, Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文研究语言选择对语言模型问答能力的影响,提出语言特定知识概念,并通过实验展示不同语言下模型性能差异。
通过反事实多智能体推理提升临床诊断
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Jacobi Medical Center, Albert Einstein College of Medicine(雅各布医疗中心,阿尔伯特·爱因斯坦学院) ; Department of Emergency Medicine, Beth Israel Deaconess Medical Center(贝斯以色列医疗中心急诊科) ; Leaning machines(Leanings machines)
AI总结 本文提出一种基于反事实推理的多智能体诊断框架,通过反事实案例编辑和反事实概率差距方法,提升诊断准确性与可解释性,尤其在复杂和模糊病例中表现突出。
可微 conformal 训练用于 LLM 推理事实性
机构 * Department of Computer Science, University of Illinois at Chicago, Chicago, United States(伊利诺伊大学芝加哥分校计算机科学系) ; Department of Physics, University of Illinois at Urbana-Champaign, Urbana, United States(伊利诺伊大学厄巴纳-香槟分校物理系)
AI总结 本文提出可微 conformal 训练方法,通过联合验证推理步骤中的事实性声明,提升 LLM 的事实性可靠性,实验显示在保持可靠性的同时,事实性声明保留率提升141%。
Comments Submitted ICML
SweRank: 代码排名用于软件问题定位
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Salesforce Research(Salesforce 研究) ; KAIST AI(韩国科学技术院人工智能研究所)
AI总结 本文提出SweRank框架,通过高效的检索与重排序方法提升软件问题定位的准确性,实验表明其在SWE-Bench-Lite和LocBench上优于现有方法。
Comments ICLR 2026 Camera Ready Version
大型语言模型在角色扮演中的公平性测试
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; King's College London(伦敦国王学院) ; Nanyang Technological University(南洋理工大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文通过生成33000个角色特定问题,评估10种先进LLM在角色扮演场景中的公平性,发现107580次偏见响应,揭示角色扮演中偏见的普遍性。
Comments Accepted by ACM International Conference on the Foundations of Software Engineering (FSE 2026)
发现共享的逻辑子空间:通过自然语言和符号视角的对齐来引导LLM逻辑推理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Computer & Information Science and Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系)
AI总结 本文提出通过对齐自然语言和符号视角的逻辑子空间来提升LLM的多步逻辑推理能力,通过实验验证该方法在四个基准测试中提升了准确率并具备良好的泛化能力。
Comments Accepted to ACL 2026
生成AI时代用户模拟:用户建模、合成数据生成与系统评估
机构 * University of Stavanger(斯塔万格大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文探讨生成AI时代用户模拟的跨学科应用,提出从传统预测模型向生成方法转变,并强调伦理考量与AGI追求的理论联系,建立学术与产业的创新生态系统。