Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
高校专区
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
基于因果效应约束的可解释因果发现
机构 * Yale University(耶鲁大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 该研究将条件因果发现转化为贝叶斯推理问题,采用稀有事件估计技术解决小后验质量事件的计算挑战,经合成图和Sachs蛋白质数据集验证了方法的准确性与辅助科学探索的作用。
Comments Accepted by UAI 2026
在离散状态上加速的马尔可夫链蒙特卡洛算法
机构 * Department of Mathematics University of California Santa Barbara, CA 93106, USA(数学系,加州大学圣巴巴拉分校) ; Department of Mathematics Florida State University Tallahassee, FL 32306, USA(数学系,佛罗里达州立大学) ; Department of Mathematics University of California Los Angeles, CA 90095, USA(数学系,加州大学洛杉矶分校) ; Department of Mathematics University of South Carolina Columbia, SC 29208, USA(数学系,南卡罗来纳大学)
AI总结 本文提出了一种基于Nesterov加速梯度方法的离散状态采样算法,通过改进的哈密顿流和相互作用粒子系统,有效估计离散得分函数,无需归一化常数。
DCM 老虎机:面向多点击的多人信息非对称级联老虎机
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 本研究将DCM老虎机扩展至多人信息非对称多点击场景,针对含非对称性的三种场景提供次线性悔恨保证,改进了单智能体结果,算法在非对称环境中表现良好,凸显反馈结构的关键作用。
Comments Accepted to the Asia Conference on Machine Learning and Computing (ACMLC 2026)
隐形斗篷:实时隐私保护的体视频流
机构 * University of California Los Angeles(加利福尼亚大学洛杉矶分校) ; Nokia Bell Labs(诺基亚贝尔实验室)
AI总结 针对体视频流的隐私挑战,提出实时源端隐私系统InViStream,结合目标检测与深度感知掩码等技术,在多视角场景中实现高效隐私保护与实时重建,取得优异性能指标。
用于学习多输入多输出算子的核方法
机构 * University of California Los Angeles(加州大学洛杉矶分校) ; University of Arkansas(阿肯色大学) ; Johns Hopkins University(约翰斯·霍普金斯大学)
AI总结 针对科学机器学习中无限维对象映射学习难题,提出基于核的编码器-解码器框架,开发KernelMO核方法,在五类参数化偏微分方程上实现高精度且高效的算子学习,性能优于相关深度学习模型。
通过投机解码加速时间序列基础模型
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
AI总结 通过投机解码技术提升时间序列预测模型的推理效率,无需修改现有架构即可加速部署系统。
从可解释性到控制:TrustNLP研讨会六年的启示
机构 * Meta ; Autodesk(欧特克公司) ; New Jersey Institute of Technology(新泽西理工学院) ; Salesforce(salesforce公司) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Amazon AGI(亚马逊AGI)
AI总结 该研究基于TrustNLP研讨会六年论文,分析NLP可信领域从可解释性到生成式系统控制的转变,明确各信任维度的发展趋势及与领域整体的关联性,提出结构性见解与研究方向。
Comments 17 pages, 2 figures, 3 tables. Submitted to ACL ARR August 2026 cycle (EACL 2027)
面向抗干扰传感器子集选择的推荐系统方法
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 本文针对现有基于RSSI的传感器子集选择方法易受声学干扰的问题,提出结合频带声学特征与双塔MLP架构的推荐系统框架,在户外车辆跟踪任务中较RSSI基线提升约20%精度且保持低计算开销。
MERA:面向大规模智能体系统的技能适配型模型演化与路由
机构 * Gradient ; Soochow University(苏州大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 MERA以单模型调用为适应单元,通过多轮适配提升小模型能力,结合带验证器回退的成本校准路由,在HumanEval+MBPP、TAU-2等数据集上实现小模型性能提升与成本降低。
Comments Preliminary version in CAIS RL-Eval
HSMLA:用于高效视觉Transformer的分层Softmax多尺度线性注意力
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Columbia University(哥伦比亚大学) ; The University of Melbourne(墨尔本大学)
AI总结 针对视觉Transformer高分辨率密集预测的计算开销问题,提出HSMLA,结合多类注意力机制与深度卷积,在多项任务上实现精度与效率的优异平衡。
指令微调如何改变上游状态影响后期读取:一种跨修补诊断
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 研究探讨指令微调如何通过后期栈与上游状态交互影响后续token选择,通过跨修补诊断发现指令微调模型的后期栈效果依赖自身训练状态,且稀疏特征在其中起中介作用。
Comments 14 pages, 4 figures. Code and compact artifacts: https://github.com/yifan1207/first-divergence-crosspatching
SatIR:可扩展的高召回率约束满足基于信息检索的临床试验匹配
机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系) ; Samueli Electrical and Computer Engineering, UCLA(UCLA Samueli电气与计算机工程系) ; Department of Computer Science and Informatics, Emory University(埃默里大学计算机科学与信息学系) ; Mayo Clinic(梅奥诊所)
AI总结 SatIR通过将临床试验资格条件和摘要转化为形式约束,结合SMT、关系代数和大语言模型,提升了临床试验匹配的召回率和效率,优于基于相似度的基线方法。
多玩家纳什偏好优化
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院) ; The University of Tokyo(东京大学) ; RIKEN AIP(日本理化学研究所智能系统研究中心) ; Pennsylvania State University(宾夕法尼亚州立大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Harvard University(哈佛大学) ; UNC–Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 本文提出多玩家纳什偏好优化框架,扩展了传统的两玩家纳什对齐方法,通过引入多玩家博弈机制,提升对复杂非传递性人类偏好的对齐能力,并在多个基准测试中表现更优。
Journal ref ICLR 2026 Oral
TemMed-Bench:评估视觉语言模型的时序医学图像推理能力
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 本文提出TemMed-Bench时序医学图像推理基准,评估12个视觉语言模型,发现多数模型缺乏分析患者状况时序变化的能力,多模态检索扩充可显著提升其性能。
AquiLLM:支持研究群体中隐性知识捕获的架构
机构 * Southern Oregon University(南俄勒冈大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 AquiLLM是一款采用开放权重模型的开源模块化RAG-LLM框架,经领域专家反馈优化了架构与功能,可支持研究群体捕获隐性知识,助力AI贴合科研实践。
Comments Accepted for publication in the NGEN-AI 2026 proceedings
理解从预训练到训练后阶段的推理
机构 * New York University(纽约大学) ; Modal Labs(模态实验室) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Columbia University(哥伦比亚大学)
AI总结 研究强化学习在大语言模型从预训练到训练后阶段对推理的作用,以国际象棋为测试平台,按标准流程训练模型,发现预训练损失可预测RL后性能,RL奖励曲线斜率与预训练令牌有关,还揭示RL对SFT策略的影响,且在数学领域也有相同模式。
RoboAtlas:上下文感知主动SLAM
机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 提出RoboAtlas框架,通过上下文感知的多臂赌博机平衡几何探索与语义推理,结合3D语义地图OpenRoboVox,在真实环境中实现100%任务成功率,并在GOAT-Bench上以90.6%成功率达到SOTA。
Comments Alexander Schperberg and Shivam K. Panda made equal contribution
FitText: 通过模因检索演化智能体工具生态
机构 * UCLA(加州大学洛杉矶分校)
AI总结 针对用户任务描述与工具文档间的语义鸿沟,提出FitText框架,将检索嵌入推理循环,通过自然语言伪工具描述迭代优化和模因进化选择,显著提升工具检索性能。
Comments 30 pages, including appendices. Accepted at COLM 2026 (main conference) and the COLM 2026 Workshop on Efficient Reasoning
OLIVE: 面向高效自适应外骨骼的在线低秩增量学习
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Columbia University(哥伦比亚大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Rice University(里奇大学)
AI总结 提出OLIVE框架,通过低秩残差分解和奖励驱动策略梯度实现外骨骼控制的在线个性化自适应,在多种地形上提升步态平滑度、降低努力并增强稳定性。
Comments Accepted to UbiComp / ISWC 2026
SimulCost: 一个用于自动化物理模拟的代价感知基准与工具包
机构 * University of California San Diego(加州大学圣地亚哥分校) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Peking University(北京大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; California Institute of Technology(加州理工学院) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 针对现有LLM评估忽略工具使用代价的问题,提出SimulCost基准,通过单轮和多轮参数调优任务比较LLM与传统扫描方法在准确性和计算代价上的表现,发现LLM在高精度任务中初始猜测不可靠且多轮模式效率更低。
Comments post conference revision version at ICML; update: removed CGYRO due to bug in cases search. Will add back soon
DiSCo:用于共享自主的扩散序列助手
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 DiSCo通过扩散策略规划与用户动作一致的动作序列,提升复杂系统控制性能,适用于模拟驾驶和机械臂任务。
Comments 10 pages, 5 figures, HRI '26: Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction
端到端联合语音识别与说话人角色辨识的儿童-成人互动
机构 * Viterbi School of Engineering, University of Southern California, US(维特比工程学院,南加州大学) ; Weill Institute for Neurosciences, University of California, San Francisco, US(韦尔神经科学研究所,旧金山大学) ; David Geffen School of Medicine, University of California, Los Angeles, US(大卫·盖芬医学院,洛杉矶大学)
AI总结 本文提出了一种端到端联合建模框架,用于在大规模上生成可靠的儿童-成人互动转录,通过联合建模语音识别和说话人角色辨识,提高了转录的准确性和效率。
Comments Published in IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP)
FronTalk: 以多模态反馈进行对话式代码生成的前端开发基准测试
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Duke University(杜克大学)
AI总结 提出FronTalk基准,通过多轮对话和多模态反馈(文本与视觉指令)评估前端代码生成,发现模型存在遗忘和视觉反馈理解困难,提出AceCoder方法有效减少遗忘并提升性能。
Comments CoLM 2026
在LLM推理扩展中采样多样性的影响
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Rensselaer Polytechnic Institute(罗切斯特理工学院) ; The Chinese University of Hong Kong(香港中文大学) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; NEC Laboratories America(NEC美国实验室)
AI总结 本文研究了在LLM推理扩展中采样多样性对性能的影响,通过理论和实验证明多样化的采样能提升模型表现,并在不同任务中实现了显著的增益。
Comments 31 pages
DeepLoop:循环变换器的深度缩放
机构 * Princeton University(普林斯顿大学) ; University of California Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 研究循环变换器中深度缩放问题,提出DeepLoop方法,通过控制访问对齐系数形式化绑定深度效应,保持特定架构并设置参数,在不同规模GPT风格模型上实验,结果显示稳定循环深度需考虑参数访问的残差缩放规则。
Comments 25 pages
超越二元检测:Reddit 上癌症错误信息的多维分类法
机构 * Drexel University(德雷塞尔大学) ; UCLA(加州大学洛杉矶分校)
AI总结 研究旨在刻画Reddit上癌症错误信息,引入多维分类法涵盖七个维度。利用专家标注数据评估大语言模型,分析错误信息。发现其约占癌症讨论6%,少样本提示可提高性能,还识别出常见错误信息叙述,为相关建模奠定基础。
层归一化下Transformer的稳定性
机构 * UCLA(加州大学洛杉矶分校) ; UT Austin(德克萨斯大学奥斯汀分校) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; SRI International(SRI国际) ; UMass Amherst(马萨诸塞大学阿姆赫斯特分校)
AI总结 本文系统性研究不同层归一化放置下Transformer的前向与反向稳定性,推导相关边界、分析梯度反向传播影响,为残差步长缩放提供指导,其框架可用于检查新型Transformer架构的稳定性。
追踪核心:一种用于心力衰竭特征工程的证据关联管道
机构 * Nimblemind(宁敏德(音译)) ; Singapore University of Technology and Design(新加坡科技设计大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Florida International University(佛罗里达国际大学) ; University of California Los Angeles(加利福尼亚大学洛杉矶分校) ; Rutgers University Newark(罗格斯大学纽瓦克分校) ; Rutgers Institute for Health Health Care Policy and Aging Research(罗格斯大学健康、医疗保健政策与老龄化研究所) ; Robert Wood Johnson Medical School(罗伯特·伍德·约翰逊医学院) ; Rutgers Health(罗格斯医疗)
AI总结 该研究针对心力衰竭EHR特征工程瓶颈,开发了nMAS管道,经500条虚拟记录验证,可提升HFrEF和HFpEF表型分析的AUROC,为自动化可审核特征工程提供了可行方案。
神经符号AI的RAIL原则:推理(Reasoning)、保证(Assurances)、接口(Interfacing)与学习(Learning)
机构 * Politecnico di Milano(米兰理工大学) ; ELLIS Institute Finland(芬兰ELLIS研究所) ; Åbo Akademi University(奥博 Akademi 大学) ; Samsung AI(三星人工智能研究院) ; Delft University of Technology(代尔夫特理工大学) ; Stony Brook University(石溪大学) ; Politecnico di Torino(都灵理工大学) ; University of Stuttgart(斯图加特大学) ; Graz University of Technology(格拉茨工业大学) ; Lockheed Martin, Advanced Technology Labs(洛克希德·马丁公司先进技术实验室) ; BrainCreators(BrainCreators公司) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; University of Amsterdam(阿姆斯特丹大学) ; University of Edinburgh(爱丁堡大学) ; UCLA(加利福尼亚大学洛杉矶分校)
AI总结 该文提出神经符号AI的RAIL四项原则,可统一分析多类AI系统,助力工程师更科学地设计部署生产级AI,指导整合神经符号方法到下一代AI技术。