Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
高校专区
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
基于因果效应约束的可解释因果发现
机构 * Yale University(耶鲁大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 该研究将条件因果发现转化为贝叶斯推理问题,采用稀有事件估计技术解决小后验质量事件的计算挑战,经合成图和Sachs蛋白质数据集验证了方法的准确性与辅助科学探索的作用。
Comments Accepted by UAI 2026
DCM 老虎机:面向多点击的多人信息非对称级联老虎机
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 本研究将DCM老虎机扩展至多人信息非对称多点击场景,针对含非对称性的三种场景提供次线性悔恨保证,改进了单智能体结果,算法在非对称环境中表现良好,凸显反馈结构的关键作用。
Comments Accepted to the Asia Conference on Machine Learning and Computing (ACMLC 2026)
隐形斗篷:实时隐私保护的体视频流
机构 * University of California Los Angeles(加利福尼亚大学洛杉矶分校) ; Nokia Bell Labs(诺基亚贝尔实验室)
AI总结 针对体视频流的隐私挑战,提出实时源端隐私系统InViStream,结合目标检测与深度感知掩码等技术,在多视角场景中实现高效隐私保护与实时重建,取得优异性能指标。
用于学习多输入多输出算子的核方法
机构 * University of California Los Angeles(加州大学洛杉矶分校) ; University of Arkansas(阿肯色大学) ; Johns Hopkins University(约翰斯·霍普金斯大学)
AI总结 针对科学机器学习中无限维对象映射学习难题,提出基于核的编码器-解码器框架,开发KernelMO核方法,在五类参数化偏微分方程上实现高精度且高效的算子学习,性能优于相关深度学习模型。
从可解释性到控制:TrustNLP研讨会六年的启示
机构 * Meta ; Autodesk(欧特克公司) ; New Jersey Institute of Technology(新泽西理工学院) ; Salesforce(salesforce公司) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Amazon AGI(亚马逊AGI)
AI总结 该研究基于TrustNLP研讨会六年论文,分析NLP可信领域从可解释性到生成式系统控制的转变,明确各信任维度的发展趋势及与领域整体的关联性,提出结构性见解与研究方向。
Comments 17 pages, 2 figures, 3 tables. Submitted to ACL ARR August 2026 cycle (EACL 2027)
面向抗干扰传感器子集选择的推荐系统方法
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 本文针对现有基于RSSI的传感器子集选择方法易受声学干扰的问题,提出结合频带声学特征与双塔MLP架构的推荐系统框架,在户外车辆跟踪任务中较RSSI基线提升约20%精度且保持低计算开销。
MERA:面向大规模智能体系统的技能适配型模型演化与路由
机构 * Gradient ; Soochow University(苏州大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 MERA以单模型调用为适应单元,通过多轮适配提升小模型能力,结合带验证器回退的成本校准路由,在HumanEval+MBPP、TAU-2等数据集上实现小模型性能提升与成本降低。
Comments Preliminary version in CAIS RL-Eval
AquiLLM:支持研究群体中隐性知识捕获的架构
机构 * Southern Oregon University(南俄勒冈大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 AquiLLM是一款采用开放权重模型的开源模块化RAG-LLM框架,经领域专家反馈优化了架构与功能,可支持研究群体捕获隐性知识,助力AI贴合科研实践。
Comments Accepted for publication in the NGEN-AI 2026 proceedings
追踪核心:一种用于心力衰竭特征工程的证据关联管道
机构 * Nimblemind(宁敏德(音译)) ; Singapore University of Technology and Design(新加坡科技设计大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Florida International University(佛罗里达国际大学) ; University of California Los Angeles(加利福尼亚大学洛杉矶分校) ; Rutgers University Newark(罗格斯大学纽瓦克分校) ; Rutgers Institute for Health Health Care Policy and Aging Research(罗格斯大学健康、医疗保健政策与老龄化研究所) ; Robert Wood Johnson Medical School(罗伯特·伍德·约翰逊医学院) ; Rutgers Health(罗格斯医疗)
AI总结 该研究针对心力衰竭EHR特征工程瓶颈,开发了nMAS管道,经500条虚拟记录验证,可提升HFrEF和HFpEF表型分析的AUROC,为自动化可审核特征工程提供了可行方案。
神经符号AI的RAIL原则:推理(Reasoning)、保证(Assurances)、接口(Interfacing)与学习(Learning)
机构 * Politecnico di Milano(米兰理工大学) ; ELLIS Institute Finland(芬兰ELLIS研究所) ; Åbo Akademi University(奥博 Akademi 大学) ; Samsung AI(三星人工智能研究院) ; Delft University of Technology(代尔夫特理工大学) ; Stony Brook University(石溪大学) ; Politecnico di Torino(都灵理工大学) ; University of Stuttgart(斯图加特大学) ; Graz University of Technology(格拉茨工业大学) ; Lockheed Martin, Advanced Technology Labs(洛克希德·马丁公司先进技术实验室) ; BrainCreators(BrainCreators公司) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; University of Amsterdam(阿姆斯特丹大学) ; University of Edinburgh(爱丁堡大学) ; UCLA(加利福尼亚大学洛杉矶分校)
AI总结 该文提出神经符号AI的RAIL四项原则,可统一分析多类AI系统,助力工程师更科学地设计部署生产级AI,指导整合神经符号方法到下一代AI技术。
在线持续学习中生长型与弹性型神经网络的可塑性
机构 * University of California, Los Angeles (UCLA)(加利福尼亚大学洛杉矶分校) ; University of Alberta(阿尔伯塔大学) ; Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)
AI总结 本文研究在线持续学习中生长型与弹性型神经网络的可塑性,实验显示自适应生长型和弹性型神经网络可维持高准确率、不丧失可塑性,或为在线持续学习提供有前景的算法类别。
PlantRig - 从骨骼到分支:自回归绑定模型在植物骨骼重建中的适配
机构 * UCLA(加利福尼亚大学洛杉矶分校) ; University of Osaka(大阪大学)
AI总结 该研究针对自回归绑定模型在植物骨骼重建中存在的问题,通过多轮微调优化UniRig模型,实现了跨多种植物形态的泛化,为自动化植物绑定提供了可行方案。
SeDeM:面向长上下文问答的隐藏状态记忆选择性解压
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 本研究针对LLM长上下文推理成本高、证据利用不可靠的问题,提出SeDeM选择性解压框架,通过解耦记忆存储与解码器条件,在1B、3B主干的四个长上下文QA基准上,优于压缩基线及全上下文微调方法,还提升了解码效率。
AutoSupervision:通过基于事实的修订验证闭合科学工作流中的反馈循环
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; University of California, Los Angeles(加州大学洛杉矶分校) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本研究提出AutoSupervision,利用《自然·通讯》5.6万篇文章的评审记录构建数据集,发现LLM刻画评审关切表现较好但证据验证是瓶颈,为AI辅助科学工作流提供反馈循环闭合方案。
DexDirect:用于高效灵巧演示采集的直接运动学手臂引导
机构 * UCLA(加利福尼亚大学洛杉矶分校)
AI总结 该研究提出DexDirect方法,结合直接运动学手臂引导与视觉手部重定向,采集灵巧操作演示的效率更高、认知负荷更低,训练的扩散策略在立方体抓取任务上达到90%成功率。
Comments 8pages, 6 figures
模型合并中的非对称坍塌:当拒绝覆盖识别
机构 * UCLA(加利福尼亚大学洛杉矶分校) ; Algoverse(阿尔戈沃斯公司) ; Purdue University(普渡大学)
AI总结 本研究针对模型合并能否同时保留多种安全行为的问题,以Gemma-3-1B-IT微调模型为对象,发现合并时攻击抵抗性保留远多于分类准确率,原因是弃权微调的任务向量幅度更大,导致安全识别坍塌为广泛弃权。
Comments Accepted into COLM AIW, waiting decision for AdvML-Frontiers x CoTMA and HAIPS
MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; University of Electronic Science and Technology of China(电子科技大学)
AI总结 针对海洋视频理解面临的挑战,构建MarineEVT数据集,将其理解分解为EVT-R1过程,利用视觉工具驱动模型。实验显示EVT-R1优于多个SOTA VLMs,为海洋相关发展奠定基础并推动VLMs进步。
Comments Accepted to The 19th European Conference on Computer Vision (ECCV) 2026
打破总方差障碍:具有固定动作集的线性异方差博弈的精确样本复杂度
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; National University of Singapore(新加坡国立大学) ; Duke University(杜克大学)
AI总结 研究具有固定动作集的线性异方差博弈问题,提出方差自适应算法\texttt{VAEE}及方差感知变体,实现了具有近乎调和均值依赖率的简单遗憾,打破了$\sqrt{\Lambda}$障碍,并建立了近乎匹配的下界。
学习随推理展开:用于高效强化学习的渐进式展开分配
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 研究针对强化学习中GRPO方法计算昂贵且不稳定的问题,提出VIGOR方法,通过方差引导在线分配展开,理论上推导其加速比,实验表明该方法在数学推理和编码任务中能减少展开次数并提升通过率。
用于参数和边值问题的广义神经算子
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 研究针对偏微分方程基础神经模拟器面临的条件无关部署、物理保真度和推理效率瓶颈,提出广义神经算子,通过形式化适定性条件,引入三个新颖架构组件,实现跨异构物理状态的卓越泛化与高效推理。
具有世界状态寄存器的流式多智能体自回归扩散模型
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; Adobe Research(Adobe研究院)
AI总结 研究多智能体交互世界模型共享状态维护难题,提出WorldWeaver模型,利用跨智能体世界状态寄存器及混合变压器设计,经双智能体我的世界视频生成实验验证,该模型能提升逻辑一致性与生成质量。
Comments Project page: https://vail-ucla.github.io/worldweaver/
GLID:门控局部内在维度修复面部伪造检测器的盲点
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 研究针对微调基础模型面部伪造检测器对训练外生成器家族有盲点的问题,提出GLID检测器,通过估计图像补丁令牌局部内在维度,经置信门进入微调检测器,在基准测试中表现出色,揭示相关经验法则并降低准确率跨种子传播。
Comments 21 pages, 16 figures
RAVEN:用于稳健人形机器人导航的强化自适应可见性图规划与无碰撞MPC
机构 * Robotics and Mechanisms Laboratory (RoMeLa), Department of Mechanical and Aerospace Engineering, University of California, Los Angeles(机器人与机构实验室(RoMeLa),机械与航天工程系,加利福尼亚大学洛杉矶分校)
AI总结 研究针对人形机器人在动态环境中的导航问题,提出RAVEN框架,通过强化学习自适应调整可见性图规划器几何结构,结合无碰撞MPC层跟踪轨迹,经实验评估,该方法能减少超调、提高狭窄通道稳健性及在延迟噪声下可靠导航。
MIDAS手:模块化低阻抗直接驱动拟人传感手
机构 * UCLA(加州大学洛杉矶分校)
AI总结 针对灵巧操作受手部硬件限制的问题,提出低成本开源的MIDAS手,有16个自由度,直接驱动且回驱扭矩低,集成触觉传感,发布完整堆栈,经多种测试分析,为触觉灵巧操作和人机数据收集提供平衡可重复平台。
MonteRET:通过多粒度知识检索增强多模态大语言模型以生成胸部CT报告的人工智能代理
机构 * Weill Cornell Medicine(威尔康乃尔医学院) ; University of Western Australia(西澳大利亚大学) ; Indiana University(印第安纳大学) ; Regenstrief Institute(瑞根斯特里夫研究所) ; Yale University(耶鲁大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 研究针对自动生成胸部CT报告的挑战,提出MonteRET框架,它整合多种特征,通过知识检索和报告重写代理完善报告。经训练和评估,该框架在多方面提升了报告质量,相比其他方法有显著优势,获放射科住院医师青睐。
基于多级智能数据管理的自动硬示例合成
机构 * UCLA(加州大学洛杉矶分校) ; Google(谷歌)
AI总结 研究多模态大语言模型在内容安全审核任务中易受攻击的问题,提出自动智能红队框架,利用多智能体架构合成对抗示例,无需人工干预,提高模型鲁棒性,降低公共图像安全基准中的误报率。
Comments 23 pages; work in progress
无调整哈密顿蒙特卡罗和欠阻尼朗之万中偏差的离域化
机构 * Department of Mathematics, University of California, Los Angeles, CA 90095, USA(加州大学洛杉矶分校数学系) ; Courant Institute, New York University, NY 10012, USA(纽约大学Courant研究所)
AI总结 研究将偏差离域化现象从过阻尼朗之万算法扩展到无调整哈密顿蒙特卡罗和欠阻尼朗之万算法,表明在特定假设下控制高维分布K维边际偏差\(O(\sqrt{K})\)积分步即可,用矩阵多项式框架解决离散时间积分器技术难题。
作为受控过程的记忆:为大语言模型智能体学习自适应内存管理
机构 * University of California Los Angeles(加利福尼亚大学洛杉矶分校) ; University of Washington(华盛顿大学) ; Northwestern University(西北大学)
AI总结 研究LLM智能体内存管理问题,提出MemCon框架将内存操作建模为马尔可夫决策过程,通过在线策略自适应管理内存,该框架与后端无关,实验表明其在多基准测试中优于基线,提升任务成功率并减少令牌消耗。
诱导情绪会影响大语言模型在序列决策中的行为吗?
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Texas A&M University(德州农工大学) ; National University of Singapore(新加坡国立大学) ; UCLA(加州大学洛杉矶分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Mass General Hospital(麻省总医院) ; Harvard Medical School(哈佛医学院)
AI总结 研究探讨诱导情绪对大语言模型在序列决策中行为的影响,采用爱荷华赌博任务结合情绪诱导程序,发现诱导情绪平均不显著影响其决策动态,但愤怒有条件地影响决策,揭示了与人类行为的差异,为相关研究提供工具。