arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

共收录 1835
2412.00107 2026-06-16 cs.LG cs.AI eess.SP 版本更新

Virtual Sensing to Enable Real-Time Monitoring of Inaccessible Locations & Unmeasurable Parameters

虚拟传感实现不可达位置与不可测参数的实时监测

Kazuma Kobayashi, Farid Ahmed, Jaewan Park, Subhankar Sarkar, Souvik Chakraborty, Syed Bahauddin Alam

机构 * Plasma & Radiological Engineering Department, Grainger College of Engineering, Nuclear, University of Illinois Urbana-Champaign(等离子体与辐射工程系,格拉inger工程学院,核能,伊利诺伊大学厄巴纳-香槟分校) Mechanical Science and Engineering Department, Grainger College of Engineering, University of Illinois Urbana-Champaign(机械科学与工程系,格拉inger工程学院,伊利诺伊大学厄巴纳-香槟分校) National Center for Supercomputing Applications, Urbana, IL, USA(国家超级计算应用中心,伊利诺伊州厄巴纳,美国) Department of Applied Mechanics, Indian Institute of Technology Delhi, New Delhi, India(应用力学系,印度理工学院德里,新德里,印度) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(Yardi人工智能学院,印度理工学院德里)

AI总结 针对能量系统中物理传感器无法部署的实时监测问题,提出基于神经算子的虚拟传感框架MIMONet,将稀疏边界测量映射到内部场,在多种热流体系统中实现亚毫秒级高精度推理。

Comments New analysis and results are added

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14674 2026-06-15 cs.CL 新提交

AgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition

AgentSpec: 通过受控组合理解具身智能体脚手架

Jixuan Chen, Jianzhi Shen, Haoqiang Kang, Zhi Hong, Qingyi Jiang, Soham Bose, Yiming Zhang, Leon Leng, Amit Vyas, Lingjun Mao, Siru Ouyang, Kun Zhou, Lianhui Qin

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) Johns Hopkins University(约翰霍普金斯大学) University of Washington(华盛顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出AgentSpec模块化规范框架,将具身智能体表示为可复用策略组件的类型化组合,通过标准化接口实现受控组件替换与重组,揭示脚手架兼容性和交互效应对性能的主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13858 2026-06-15 cs.IR cs.AI 新提交

Mood-Aware Music Recommendation: Integrating User Affective Signals into Ranking Systems

情绪感知音乐推荐:将用户情感信号融入排序系统

Terence Zeng, Abhishek K. Umrawal

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出一种情绪条件排序框架,通过能量-效价空间的softmax采样将用户情感信号融入推荐过程,单盲实验表明能提升推荐质量。

Comments 13 pages, 4 figures, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14679 2026-06-15 cs.LG cs.SY eess.SY math.OC stat.ML 新提交

Optimal Hidden-Target Learning for Online Inventory Optimization on General Convex Sets

一般凸集上在线库存优化的最优隐藏目标学习

Anthony Pineci, Yunzong Xu

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对一般凸容量集上的在线库存优化问题,提出隐藏目标投影方法,将遗憾从逆概率依赖改进为平方根逆概率依赖,并证明匹配下界,同时首次给出强凸损失的 polylog 遗憾和动态遗憾保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12918 2026-06-15 cs.CR cs.AI 新提交

MAStrike: Shapley-Guided Collusive Red-Teaming on Multi-Agent Systems

MAStrike: 基于Shapley值的多智能体系统合谋红队测试

Chejian Xu, Zhaorun Chen, Jingyang Zhang, Freddy Lecue, Avni Kothari, Sarah Tan, Wenbo Guo, Bo Li

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virtue AI University of Chicago(芝加哥大学) Wells Fargo(摩根大通) Salesforce University of California, Santa Barbara(加州大学圣芭芭拉分校)

AI总结 提出MAStrike框架,通过Shapley值分析识别多智能体系统中脆弱智能体联盟,生成角色感知的对抗攻击,并迭代优化以绕过防御,显著优于启发式基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03063 2026-06-15 math.ST cs.IT cs.LG math.IT stat.ME stat.ML stat.TH 版本更新

Stability of a Generalized Debiased Lasso with Applications to Resampling-Based Variable Selection

广义去偏Lasso的稳定性及其在基于重抽样的变量选择中的应用

Jingbo Liu

机构 * Department of Statistics, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校统计系) Department of Electrical and Computer Engineering, the Grainger College of Engineering(格拉inger工程学院电子与计算机工程系)

AI总结 提出基于稳定性原理的广义去偏Lasso估计量,通过设计矩阵单列扰动下的简单更新公式,在比例增长机制下实现渐近精确近似,显著降低重抽样变量选择的计算成本。

Comments to appear in Bernoulli

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06196 2026-06-15 cs.CL cs.HC 版本更新

EiCAP: Beyond Fluency, Probing and Improving Emotional Intelligence in LLMs via Psychologically Grounded Multi-Turn Dialogue

EiCAP:超越流畅性,通过心理学基础的多轮对话探究和提升大语言模型的情感智能

Nizi Nazar, Pardis Sadat Zahraei, Dilek Hakkani-Tür, Natasa Milic-Frayling, Ehsaneddin Asgari

机构 * Qatar Computing Research Institute (QCRI), Hamad Bin Khalifa University(卡塔尔计算研究所(QCRI),哈马德·本·卡伊夫大学) University of Illinois Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出基于心理学六层情感智能分类法的EiCAP框架,包含评估基准EiCAP-Bench和微调语料EiCAP-SFT,发现通用对话微调不提升情感智能,而基于情感智能的LoRA微调显著提升模型在所有24个子类别上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00784 2026-06-15 cs.CL

Research Borderlands: Analysing Writing Across Research Cultures

研究边疆:跨研究文化中的写作分析

Shaily Bhatt, Tal August, Maria Antoniak

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院) Pioneer Centre for AI, University of Copenhagen(哥本哈根大学先锋人工智能中心) Allen Institute for Artificial Intelligence (Ai2)(人工智能研究院)

AI总结 本文通过跨文化访谈,揭示研究文化中的语言规范,并评估LLM的文化适应能力,强调人类中心方法在测量文化规范中的有效性。

Comments Accepted to ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13652 2026-06-12 cs.CV cs.GR 新提交

World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible

世界追踪:超越可见表面的生成式像素对齐几何

Hao Zhang, Mohamed El Banani, Jen-Hao Cheng, Paul Zhang, Yi Hua, Ben Mildenhall, Christoph Lassner, Narendra Ahuja, Gengshan Yang

机构 * World Labs University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出世界追踪(World Tracing),一种生成式像素对齐几何表示,通过扩散变压器预测有序点栈,同时重建可见表面和生成遮挡几何,在多个基准上超越深度预测和图像到3D方法。

Comments World Labs Technical Report; Page: https://haoz19.github.io/world-tracing-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13338 2026-06-12 cs.LG 新提交

Navigating the Safety-Fidelity Trade-off: Massive-Variate Time Series Forecasting for Power Systems via Probabilistic Scenarios

导航安全-保真度权衡:通过概率场景进行电力系统的大规模多变量时间序列预测

Kaijie Xu, Anqi Wang, Xilin Dai

机构 * ZJU-UIUC Institute, Zhejiang University(浙江大学伊利诺伊大学厄巴纳香槟校区联合学院)

AI总结 针对现有基准无法评估大规模多变量概率预测的安全性与保真度权衡问题,提出包含多达36,964个通道的电力系统基准PowerPhase和场景式分位数预测器PowerForge,在多个网格上取得最佳平均排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13125 2026-06-12 cs.LG cs.AI 新提交

Select and Improve: Understanding the Mechanics of Post-Training for Reasoning

选择与改进:理解推理后训练的机制

Akshay Krishnamurthy, Audrey Huang, Nived Rajaraman

机构 * Microsoft Research NYC(微软研究院纽约) UIUC(伊利诺伊大学厄巴纳-香槟分校)

AI总结 通过控制实验揭示强化学习后训练通过策略选择和策略改进两种机制提升推理能力,并指出SFT数据和RL数据的不同作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13044 2026-06-12 cs.CL 新提交

No Hidden Prompts Needed! You Can Game AI Peer Review with Presentation-Only Revisions

无需隐藏提示!仅通过展示性修改即可欺骗AI同行评审

Xu Yang, Zhizhou Sha, Junbo Li, Jian Yu, Yifan Sun, Matthew Zhao, Jinrui Fang, Xinyue Guo, Yining Wu, Xu Hu, Yifu Luo, Qiang Liu, Zhangyang Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at Dallas(德克萨斯大学达拉斯分校) Independent Researcher(独立研究者)

AI总结 研究通过仅修改论文的展示层面(如摘要、贡献框架等)而不改变科学内容,利用AI评审反馈进行对抗性重打包,成功提升评分,揭示AI评审易被表面印象误导的结构性缺陷。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12849 2026-06-12 cs.DC cs.CV cs.RO 新提交

SemanticXR: Low Power and Real-time Queryable Semantic Mapping with an Object-Level Device-Cloud Architecture

SemanticXR: 低功耗实时可查询语义建图与对象级设备-云架构

Rahul Singh, Devdeep Ray, Connor Smith, Sarita Adve

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA

AI总结 提出首个设备-云协同系统SemanticXR,通过对象级通信、执行和内存管理,在XR功耗、带宽和内存约束下实现实时开放词汇语义建图与查询,服务器建图延迟提升2.2倍,设备功耗仅增加2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12744 2026-06-12 cs.CV 新提交

GRIP: Feedback-Guided Prompt Retrieval for Large Multimodal Models

GRIP:面向大型多模态模型的反馈引导提示检索

Garvita Allabadi, Matteo Sodano, Roberto Estevão, Yuxiong Wang, Vikram Adve, Emre Kiciman, Ranveer Chandra

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Bonn(波恩大学) Microsoft(微软)

AI总结 提出GRIP,一种可学习的视觉检索框架,利用多模态模型反馈识别真正提升上下文学习性能的示例,在分类、描述和VQA任务上优于基于相似度的检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12735 2026-06-12 cs.LG 新提交

Physics-Informed Neural Networks and Radial Basis Functions for PDEs with Dirac Delta Sources

物理信息神经网络与径向基函数求解含狄拉克δ源的偏微分方程

Manuel Reyna, Alexandre Tartakovsky

机构 * Department of Civil and Environmental Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校土木与环境工程系)

AI总结 针对含狄拉克δ项的偏微分方程,通过将物理信息神经网络解释为残差最小二乘法,利用弱形式直接处理δ项,并对比径向基函数展开方法,发现径向基函数-残差最小二乘法在输运问题中更稳定。

Comments 33 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12730 2026-06-12 cs.AI cs.CL cs.CY cs.LG 新提交

Rethinking Psychometric Evaluation of LLMs: When and Why Self-Reports Predict Behavior

重新思考LLMs的心理测量评估:自我报告何时以及为何能预测行为

Rafal Kocielnik, Pengrui Han, Peiyang Song, Myrl G. Marmarelis, Ramit Debnath, Dean Mobbs, Anima Anandkumar, R. Michael Alvarez

机构 * Caltech(加州理工学院) UIUC(伊利诺伊大学厄巴纳-香槟分校) University of Cambridge(剑桥大学)

AI总结 研究对比大五人格与计划行为理论,发现LLMs的自我报告-行为一致性存在选择性:在共享对话中TPB达到人类水平,跨对话仅对锚定于训练的行为保持一致性,且角色提示不能使行为对齐。

Comments Accepted as an Oral (Contributed Talk) at the ICML 2026 Workshop on Combining Theory and Benchmarks (CTB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26705 2026-06-12 q-bio.BM cs.AI cs.LG

PI-Mamba: Linear-Time Protein Backbone Generation via Spectrally Initialized Flow Matching

PI-Mamba:通过谱初始化流匹配实现线性时间的蛋白质主链生成

Tianyu Wu, Lin Zhu

机构 * Center for Biophysics and Quantitative Biology, University of Illinois Urbana-Champaign(生物物理与定量生物学中心,伊利诺伊大学厄巴纳-香槟分校) School of Information Science, University of Illinois Urbana-Champaign(信息科学学院,伊利诺伊大学厄巴纳-香槟分校)

AI总结 PI-Mamba通过谱初始化和流匹配框架,在保证局部共价几何精确性的同时实现线性时间推断,实现了主链生成的高效与高保真。

Journal ref Bioinformatics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11004 2026-06-12 cs.CL 版本更新

NOVA: NOise-aware Verbal Confidence CAlibration for Robust Large Language Models in RAG Systems

NOVA: 面向RAG系统中鲁棒大语言模型的噪声感知言语置信度校准

Jiayu Liu, Rui Wang, Qing Zong, Yumeng Wang, Cheng Qian, Qingcheng Zeng, Tianshi Zheng, Haochen Shi, Dadi Guo, Baixuan Xu, Chunyang Li, Yangqiu Song

机构 * HKUST(香港科技大学) UIUC(伊利诺伊大学香槟分校) Northwestern University(西北大学)

AI总结 提出NOVA框架,通过规则引导的监督微调,解决检索增强生成中噪声上下文导致的过度自信问题,在域内和域外分别提升ECE 10.9%和8.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03660 2026-06-12 cs.LG 版本更新

Single vs. Multiple Branches in DeepONet and S-DeepONet: Network Architecture Follows Coupling in Multiphysics Systems

DeepONet和S-DeepONet中的单分支与多分支:网络架构遵循多物理系统中的耦合

Jaewan Park, Kazuma Kobayashi, Qibang Liu, Seid Koric, Diab Abueidda, Syed Bahauddin Alam

机构 * National Center for Supercomputing Applications, University of Illinois at Urbana-Champaign(国家超级计算应用中心,伊利诺伊大学厄巴纳-香槟分校) The Grainger College of Engineering, Mechanical Science and Engineering, University of Illinois at Urbana-Champaign(格拉inger工程学院,机械科学与工程系,伊利诺伊大学厄巴纳-香槟分校) The Grainger College of Engineering, Nuclear, Plasma & Radiological Engineering, University of Illinois at Urbana-Champaign(格拉inger工程学院,核物理与辐射工程系,伊利诺伊大学厄巴纳-香槟分校) Department of Industrial and Manufacturing Systems Engineering, Kansas State University(工业与制造系统工程系,堪萨斯州立大学) Civil and Urban Engineering Department, New York University Abu Dhabi, UAE(土木与城市工程系,纽约大学阿布扎比分校,阿联酋)

AI总结 研究比较单分支与多分支神经算子架构在强耦合多物理系统中的表现,发现单分支网络在紧耦合场景下通过共享潜在表示优于多分支,而多分支适用于解耦或单物理任务,代理模型加速高达1.8×10^4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01274 2026-06-12 cs.CV cs.AI 版本更新

ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding

ReFoCUS: 用于上下文理解的强化引导帧优化

Hosu Lee, Junho Kim, Hyunjun Kim, Yong Man Ro

机构 * Korea Advanced Institute of Science & Technology(韩国科学技术院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出ReFoCUS框架,首次将在线策略梯度强化学习集成到视频大语言模型的帧级优化中,通过自回归和查询条件选择架构学习帧选择策略,无需显式帧级监督,提升视频问答推理准确性。

Comments Project page: https://interlive-team.github.io/ReFoCUS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11628 2026-06-11 cs.RO cs.AI 新提交

LUCID: Learning Embodiment-Agnostic Intent Models from Unstructured Human Videos for Scalable Dexterous Robot Skill Acquisition

LUCID:从非结构化人类视频学习与具身无关的意图模型以实现可扩展的灵巧机器人技能获取

Harsh Gupta, Guanya Shi, Wenzhen Yuan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出LUCID两阶段框架,从互联网规模的非结构化人类视频学习任务意图,并在大规模并行仿真中学习机器人控制,实现零样本迁移到不同具身和场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11232 2026-06-11 cs.CL cs.AI 新提交

Every Act Has Its Price: Compressed Moral Composition in Frontier LLMs

每个行为都有代价:前沿大语言模型中的压缩道德组合

Weijia Zhang, Ruiqi Chen, Yunze Xiao, Weihao Xuan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) The University of Tokyo(东京大学)

AI总结 针对现有道德基准仅评估孤立行为偏好的不足,提出Moral Trolley Arena两阶段盲ELO基准,通过校准个体道德行为并组合为双行为项,发现前沿LLM的道德判断呈压缩而非简单加性关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25820 2026-06-11 cs.LG 版本更新

Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models

基于扩散的多模态大语言模型的视觉冗余控制并行解码

Yulin Yuan, Hongshuo Zhao, Xiangming Meng

机构 * Zhejiang University(浙江大学) ZJUI-UIUC Institute(ZJUI-UIUC研究院)

AI总结 针对扩散型多模态大语言模型并行解码中视觉冗余问题,提出视觉冗余指数(VRI)和无需训练的视觉冗余控制解码(VRCD)方法,通过令牌到图像的注意力优先选择视觉互补位置,在多个基准上提升准确率。

Comments 18 pages, 5 figures, preprint. Code is available at https://github.com/infiniteYuanyl/VRCD

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22962 2026-06-11 cs.LG 版本更新

Scaling Laws of Global Weather Models

全球天气模型的缩放定律

Yuejiang Yu, Langwen Huang, Alexandru Calotoiu, Torsten Hoefler

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文分析数据驱动天气模型中模型大小、数据集大小和计算预算与验证损失之间的缩放定律,发现Aurora数据缩放最强,GraphCast参数效率高但硬件利用率低,计算最优分析表明增加训练数据比增大模型更有效,且模型形状上宽度优于深度。

Comments Accepted at ICML 2026. 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10285 2026-06-10 cs.CL 新提交

OpenRTLSet: A Fully Open-Source Dataset for Large Language Model-based Verilog Module Design

OpenRTLSet: 基于大语言模型的Verilog模块设计的完全开源数据集

Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

机构 * UIUC-ChenLab(UIUC-陈实验室)

AI总结 提出最大完全开源硬件设计数据集OpenRTLSet,包含13万+多样Verilog代码样本,结合GitHub代码、VHDL和C/C++翻译,利用DeepSeek-R1生成自然语言描述,支持多种语言模型微调,证明开源方法在硬件设计中的优越性。

Comments Accepted by ICLAD'25

Journal ref 2025 IEEE International Conference on LLM-Aided Design (ICLAD), Stanford, CA, USA, 2025, pp. 212-218

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10279 2026-06-10 cs.AI cs.CL cs.LG 新提交

Supervised Fine-tuning with Synthetic Rationale Data Hurts Real-World Disease Prediction

使用合成理由数据进行监督微调损害真实世界疾病预测

Buxin Su, Bingxuan Li, Cheng Qian, Yiwei Wang, Jin Jin, Bingxin Zhao

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Merced(加州大学默塞德分校)

AI总结 研究发现,在临床预测任务中,使用合成理由数据进行监督微调反而显著降低模型性能,根本原因在于叙事合理性与判别优化之间的结构性冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10061 2026-06-10 cs.CL 新提交

BenSyc: Benchmarking Conversational Sycophancy and Human Alignment in LLMs for Bengali Contexts

BenSyc: 孟加拉语上下文中大语言模型对话谄媚与人类对齐的基准测试

Kazi Noshin, Sajib Acharjee Dip, Ranat Das Prangon, Fardin Hassan Tamim, Syed Ishtiaque Ahmed, Liqing Zhang, Sharifa Sultana

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virginia Tech(弗吉尼亚理工大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) BRAC University(BRAC大学) University of Toronto(多伦多大学)

AI总结 提出BenSyc基准,基于孟加拉语社交数据构建五级标注集,评估15+模型在对话对齐分类与生成任务上的表现,发现前沿模型在区分共情与强化性认可上仍存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20024 2026-06-10 cs.LG 版本更新

Replicable Bandits with UCB based Exploration

基于UCB探索的可复现Bandits

Rohan Deb, Udaya Ghai, Karan Singh, Arindam Banerjee

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究随机多臂老虎机和线性老虎机中基于UCB探索的可复现算法,提出RepUCB和RepLinUCB,分别实现最优遗憾界,显著降低可复现性代价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09821 2026-06-09 cs.LG 新提交

Rethinking the Divergence Regularization in LLM RL

重新思考LLM强化学习中的散度正则化

Jiarui Yao, Xiangxin Zhou, Penghui Qi, Wee Sun Lee, Liefeng Bo, Tianyu Pang

机构 * Tencent Hunyuan(腾讯混元) UIUC(伊利诺伊大学厄巴纳-香槟分校) NUS(新加坡国立大学)

AI总结 针对PPO等方法的硬裁剪或硬掩码在长尾词汇中分布偏移代理不佳的问题,提出DRPO,用平滑的优势加权二次正则化替代硬掩码,保持信任区域几何的同时提供连续梯度权重,提升训练稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09735 2026-06-09 cs.CL 新提交

The Neutral Mask: How RLHF Provides Shallow Alignment while Leaving Partisan Structure Intact in a Large Language Model

中性面具:RLHF如何提供浅层对齐而保留大语言模型中的党派结构

Wendy K. Tam

机构 * Vanderbilt University(范德堡大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National Center for Supercomputing Applications(国家超级计算应用中心)

AI总结 研究RLHF对Llama 3.1 8B党派倾向的影响,发现RLHF仅压缩党派信号方差以实现中性输出,而非移除党派结构,且特征级操控可绕过对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏