arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

2026-08-11 至 2026-08-11 共收录 13
2607.16097 2026-08-11 cs.LG cs.AI cs.CL 版本更新

Understanding Reasoning from Pretraining to Post-Training

理解从预训练到训练后阶段的推理

Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov

机构 * New York University(纽约大学) Modal Labs(模态实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学)

AI总结 研究强化学习在大语言模型从预训练到训练后阶段对推理的作用,以国际象棋为测试平台,按标准流程训练模型,发现预训练损失可预测RL后性能,RL奖励曲线斜率与预训练令牌有关,还揭示RL对SFT策略的影响,且在数学领域也有相同模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02587 2026-08-11 cs.SE cs.LG 版本更新

The Moving Target: A Longitudinal Audit of Trust-Benchmark Score Drift Across Open-Source Chat LLM Release Lines

移动目标:对开源聊天语言模型十二个检查点的可信度漂移进行纵向审计

Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南方 Methodist 大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 通过对四个开源版本系列在多提示模板下的信任基准测试,发现相邻版本间存在显著漂移,结论是发布线的信任分数应重新测量,而非沿用,应作为检查点相关的日期化工件报告。

Comments 6 pages, 1 figure; accepted at IEEE ICMLA 2026; title, presentation, and formatting revised from v1; empirical results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02544 2026-08-11 cs.CL cs.AI 版本更新

SimSD: Simple Speculative Decoding in Diffusion Language Models

SimSD:扩散语言模型中的简单推测解码

Junxia Cui, Haotian Ye, Runchu Tian, Hongcan Guo, Jinya Jiang, Haoru Li, Chaojie Ren, Yiming Huang, Kaijie Zhu, Zhongkai Yu, Kun Zhou, Jingbo Shang

机构 * University of California San Diego(加州大学圣地亚哥分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌) University of California Santa Barbara(加州大学圣芭芭拉分校)

AI总结 针对扩散语言模型无法直接使用标准推测解码的问题,提出SimSD算法,通过即插即用的掩码策略引入参考令牌并设计注意力掩码,实现单次前向传播验证多个草稿令牌,在保持并行解码优势的同时提升解码吞吐量。

Comments 13 pages, 4 figures, code available at https://github.com/airevo2/SimSD-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16902 2026-08-11 cs.LG 版本更新

ArtifactLinker: Linking Scientific Artifacts for Automatic State-of-the-Art Discovery

ArtifactLinker: 通过自动发现最新研究成果来链接科学制品

Haofei Yu, Jiaxuan You, Peter Clark, Bodhisattwa Prasad Majumder, Kyle Richardson

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Allen Institute for AI(人工智能算法研究所)

AI总结 本文提出ArtifactLinker框架,通过图神经网络和大语言模型预测模型-数据集链接,并通过编码实验验证,以实现自动发现最新研究成果

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10925 2026-08-11 cs.HC cs.CL 版本更新

From Words to Widgets for Controllable LLM Generation

从词语到小部件:可控制的LLM生成

Chao Zhang, Yiren Liu, Lunyiu Nie, Jeffrey M. Rzeszotarski, Yun Huang, Tal August

机构 * Cornell University(康奈尔大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Loyola University Maryland(路易斯安那大学马里兰分校)

AI总结 本文提出Malleable Prompting技术,通过将自然语言提示中的偏好转化为可视化的小部件,使用户能更精确地控制LLM生成,提升可控性和透明度。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04465 2026-08-11 cs.HC cs.AI cs.CR 版本更新

Autonomy Reshapes How Personalization Affects Privacy Concerns and Trust in LLM Agents

自主性重塑个性化对隐私担忧和对LLM代理信任的影响

Zhiping Zhang, Yi Evie Zhang, Freda Shi, Tianshi Li

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学)

AI总结 研究探讨了LLM代理自主性如何影响个性化对用户隐私担忧和信任的影响,发现风险驱动的自主性可缓解个性化带来的负面影响。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28590 2026-08-11 cs.AI 版本更新

MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models

MonitorBench: 一个用于大型语言模型链式思维可监控性的综合基准

Han Wang, Yifan Sun, Brian Ko, Mann Talati, Jiawen Gong, Zimeng Li, Naicheng Yu, Xucheng Yu, Wei Shen, Vedant Jolly, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文提出MonitorBench,通过1514个测试实例和两种压力测试设置,评估LLM链式思维的可监控性,发现决策关键因素对中间推理过程的影响程度影响可监控性,更高级的LLM表现出更低的可监控性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21629 2026-08-11 cs.PL cs.AI cs.CL cs.LG 版本更新

Quokka: Accelerating Program Verification with LLMs via Invariant Synthesis

Quokka:通过不变式合成加速程序验证

Anjiang Wei, Tianran Sun, Tarun Suresh, Haoze Wu, Ke Wang, Alex Aiken

机构 * Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amherst College(阿默斯特学院) Nanjing University(南京大学)

AI总结 Quokka通过利用大语言模型生成有用的循环不变式,提升程序验证效率,其评价导向框架在多个模型家族中表现出色,优于现有基于LLM的验证器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00997 2026-08-11 cs.CL 版本更新

Uncertainty-Aware Variational Reward Factorization via Probabilistic Preference Bases for LLM Personalization

基于概率偏好基的不确定性感知变分奖励分解用于大语言模型个性化

Gyuseok Lee, Wonbin Kweon, Zhenrui Yue, SeongKu Kang, Jiawei Han, Dong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea University(高丽大学)

AI总结 本文提出变分奖励分解框架,通过概率偏好基和变分分布实现用户偏好建模,提升LLM个性化效果。

Comments COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20004 2026-08-11 cs.DB cs.CL 版本更新

Human-Level Text-to-SQL via Reinforcement Learning on Verified Data, Without Pipeline Engineering

ReViSQL:实现人水平的文本到SQL

Yuxuan Zhu, Tengjun Jin, Yoojin Choi, Daniel Kang

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出ReViSQL框架,通过高质量训练数据提升SQL推理能力,首次在BIRD基准上达到人水平准确率,且在不同模型规模下均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11480 2026-08-11 cs.CL cs.AI cs.PF cs.PL cs.SE 版本更新

SuperCoder: Assembly Program Superoptimization with Large Language Models

SuperCoder:基于大语言模型的汇编程序超优化

Anjiang Wei, Tarun Suresh, Huanmi Tan, Yinglun Xu, Gagandeep Singh, Ke Wang, Alex Aiken

机构 * Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学)

AI总结 SuperCoder利用大语言模型实现汇编程序超优化,通过强化学习微调后,正确性达95%且平均速度提升1.46倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19040 2026-08-11 cs.LG 版本更新

OATS: Online Data Augmentation for Time Series Foundation Models

OATS: 用于时间序列基础模型的在线数据增强

Junwei Deng, Chang Xu, Jiaqi W. Ma, Ming Jin, Chenghao Liu, Xu Zhang, Li Zhao, Jiang Bian

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) Griffith University(格里菲斯大学) Datadog AI Research(Datadog AI研究院)

AI总结 OATS通过动态生成合成数据提升时间序列基础模型的性能,采用探索-利用机制和扩散框架,在多个数据集上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20968 2026-08-11 cs.DC cs.AI 版本更新

Mesh-Attention: A New Communication-Efficient Distributed Attention with Improved Data Locality

Mesh-Attention: 一种新的通信高效分布式注意力机制,具有改进的数据本地性

Sirui Chen, Jingji Chen, Siqi Zhu, Ziheng Jiang, Yanghua Peng, Xuehai Qian

机构 * Tsinghua University(清华大学) Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ByteDance Seed(字节跳动种子)

AI总结 Mesh-Attention通过改进的数据本地性,提高了分布式注意力的通信效率和可扩展性,实验显示在大规模GPU上实现了显著的加速和通信量减少。

详情

展开后加载摘要…

URL PDF HTML 收藏