arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

EPFL(洛桑联邦理工学院)

共收录 857
2603.12529 2026-05-15 cs.LG cs.AI cs.CL

TERMINATOR: Learning Optimal Exit Points for Early Stopping in Chain-of-Thought Reasoning

TERMINATOR: 在链式推理中学习最优退出点以实现早期停止

Alliot Nagle, Jakhongir Saydaliev, Dhia Garbaya, Michael Gastpar, Ashok Vardhan Makkuva, Hyeji Kim

机构 * UT Austin(得克萨斯大学) EPFL(苏黎世联邦理工学院) ENS Paris-Saclay(巴黎-萨克雷大学) Télécom Paris (IP Paris)(巴黎理工学院)

AI总结 本文提出TERMINATOR方法,通过预测模型最终答案的首次出现位置,学习最优推理长度,从而减少链式推理的计算量,提升推理效率。

Comments Updated and reorganized results. Added new results

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13999 2026-05-15 cs.LG

Support Before Frequency in Discrete Diffusion

在离散扩散中先支持频率

Adrian Müller, Antoine Gonon, Zebang Shen, Ya-Ping Hsieh, Niao He

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(苏黎世联邦理工学院) Academia Sinica(台湾“中央研究院”)

AI总结 研究揭示离散扩散模型在语言建模中通过学习支持结构优先于频率信息,统一扩散显示有效性改进、保持和恶化编辑的三元组,而吸收扩散则将主要质量放在有效性改进移动上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21929 2026-05-15 cs.LG

LoRIF: Low-Rank Influence Functions for Scalable Training Data Attribution

LoRIF: 低秩影响函数用于可扩展的训练数据归因

Shuangqi Li, Hieu Le, Jingyi Xu, Mathieu Salzmann

机构 * EPFL(瑞士联邦理工学院) UNC Charlotte(北卡罗来纳大学夏洛特分校) Stony Brook University(史蒂文斯理工学院)

AI总结 LoRIF通过利用梯度的低秩结构,解决了大规模训练数据归因中的存储和计算瓶颈,实现存储和查询速度的显著提升,同时保持归因质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13612 2026-05-14 cs.LG cond-mat.dis-nn stat.ML

Deep Learning as Neural Low-Degree Filtering: A Spectral Theory of Hierarchical Feature Learning

深度学习作为神经低阶过滤:层次特征学习的谱理论

Yatin Dandi, Matteo Vilucchio, Luca Arnaboldi, Hugo Tabanelli, Florent Krzakala

机构 * Information Learning and Physics Laboratory, École Polytechnique Fédérale de Lausanne (EPFL)(信息学习与物理实验室,瑞士联邦理工学院(EPFL)) Statistical Physics of Computation Laboratory, École Polytechnique Fédérale de Lausanne (EPFL)(计算统计物理实验室,瑞士联邦理工学院(EPFL))

AI总结 本文提出神经低阶过滤理论,揭示深度学习中层次特征学习的谱机制,通过低阶相关性选择方向,构建新特征,并通过实验验证其有效性。

Comments 62 pages, many figures, companion codes in https://github.com/IdePHICS/Neural-LoFi-Theory

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05157 2026-05-14 cs.LG cs.DS

Efficient distributional regression trees learning algorithms for calibrated non-parametric probabilistic forecasts

高效分布回归树学习算法用于校准的非参数概率预测

Quentin Duchemin, Guillaume Obozinski

机构 * Swiss Data Science Center(瑞士数据科学中心) EPFL(瑞士联邦理工学院) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出高效算法用于校准非参数概率预测,通过min-max堆等数据结构提升计算效率,展示其在WIS和CRPS损失函数下的竞争力,并利用树结构实现可解释的群体条件覆盖保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13329 2026-05-14 cs.CL cs.AI

Tracing Persona Vectors Through LLM Pretraining

通过LLM预训练追溯人格向量

Viktor Moskvoretskii, Dominik Glandorf, Jorge Medina Moreira, Tanja Käser, Robert West

机构 * EPFL(苏黎世联邦理工学院)

AI总结 研究LLM预训练中人格向量的形成机制,发现其在早期阶段就形成并持续优化,为模型安全性和可控性提供新视角。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13306 2026-05-14 cs.CV

Color Constancy in Hyperspectral Imaging via Reduced Spectral Spaces

通过降维光谱空间实现超光谱成像的色恒性

G. Dofri Vidarsson, Liying Lu, Sabine Süsstrunk

机构 * \'Ecole Polytechnique F\'ed\'erale de Lausanne (EPFL), Lausanne, Switzerland

AI总结 本文研究了超光谱数据中光谱维度和表示选择对光照估计的影响,采用Color-by-Correlation框架,探讨了如何高效利用超光谱信息提升光照估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13208 2026-05-14 cs.RO

Calibration-Free Gas Source Localization with Mobile Robots: Source Term Estimation Based on Concentration Measurement Ranking

无需校准的移动机器人气体源定位:基于浓度测量排名的源项估计

Wanting Jin, Agatha Duranceau, İzzet Kağan Erünsal, Alcherio Martinoli

机构 * Distributed Intelligent Systems and Algorithms Laboratory, School of Architecture, Civil and Environmental Engineering, École Polytechnique Fédérale de Lausanne (EPFL)(分布式智能系统与算法实验室,建筑、 civil 和环境工程学院,洛桑联邦理工学院(EPFL))

AI总结 本文提出一种无需校准的气体源定位方法,通过分析移动机器人收集的浓度测量排名差异,估计源位置的概率分布,适用于真实环境。

Comments This paper has been accepted for publication in the IEEE International Conference on Robotics and Automation (ICRA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19304 2026-05-14 cs.LG

Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall

突破离散扩散:确定性绕过采样壁垒

Mingyu Jo, Jaesik Yoon, Justin Deschenaux, Caglar Gulcehre, Sungjin Ahn

机构 * KAIST(韩国科学技术院) EPFL(苏黎世联邦理工学院) Microsoft(微软) SAP NYU(纽约大学)

AI总结 本文提出Loopholing机制,通过确定性潜在路径解决离散扩散模型采样瓶颈问题,显著降低生成困惑度,提升文本连贯性,并在推理任务中表现优异。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11850 2026-05-13 math.OC cs.LG

Constrained Stochastic Spectral Preconditioning Converges for Nonconvex Objectives

受限随机谱预处理收敛于非凸目标

Konstantinos Oikonomidis, Jan Quan, Kimon Antonakopoulos, Antonio Silveti-Falls, Volkan Cevher, Panagiotis Patrinos

机构 * KU Leuven, Department of Electrical Engineering, STADIUS Center for Dynamical Systems, Signal Processing, and Data Analytics(KU莱顿大学,电气工程系,动态系统、信号处理和数据分析中心) École Polytechnique Fédérale de Lausanne (EPFL), Laboratory for Information and Inference Systems (LIONS)(洛桑联邦理工学院(EPFL),信息与推断系统实验室) CVN, CentraleSupélec, Université Paris-Saclay, Inria(CVN,中央超导学院,巴黎-萨克雷大学,法国国家科学研究中心)

AI总结 本文提出基于谱梯度的方法,开发了近端预处理梯度方法,研究了在重尾噪声下的收敛性,并提出一种方差减少版本以加快收敛速度,同时展示非线性预处理器更准确地捕捉多项式迭代。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17031 2026-05-13 cs.CL cs.AI

Where is the Mind? Persona Vectors and LLM Individuation

心灵在哪里?人格向量与大语言模型个体化

Pierre Beckmann, Patrick Butlin

机构 * EPFL(瑞士联邦理工学院) Idiap Research Institute(Idiap研究所) Eleos AI Research(Eleos AI研究)

AI总结 本文探讨大语言模型中个体化问题,通过机制可解释性分析人格向量和人格空间,提出虚拟实例观及两种新观点,论证注意力流维持心理连接,人格结构假说支持人格相关观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03061 2026-05-13 cs.LG

Pure Exploration Beyond Reward Feedback: The Role of Post-Action Context

纯探索超越奖励反馈:后行动上下文的作用

Mohammad Shahverdikondori, Amir Mohammad Abouei, Alireza Rezaeimoghadam, Negar Kiyavash

机构 * EPFL(瑞士联邦理工学院) Sharif University of Technology(谢赫·穆吉加德姆技术大学)

AI总结 本文提出在随机多臂老虎机环境中,考虑后行动上下文的最佳臂识别问题,分析了两种上下文类型,并提出算法以优化样本复杂度。

Comments 46 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11172 2026-05-13 cs.LG

Optimistic Dual Averaging Unifies Modern Optimizers

乐观对偶平均法统一了现代优化器

Thomas Pethick, Wanyun Xie, Roman Machacek, Volkan Cevher

机构 * EPFL (LIONS)(苏黎世联邦理工学院(LIONS)) University of Bern(伯尔尼大学)

AI总结 本文提出SODA,从乐观对偶平均法视角统一了Muon、Lion、AdEMAMix和NAdam等优化器,通过理论指导的1/k衰减调度消除权重衰减调参,实验证明SODA在不同规模和训练周期均提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05884 2026-05-13 cs.CY cs.LG

Integrating the Expected Future in Load Forecasts with Contextually Enhanced Transformer Models

将预期未来整合到负载预测中:基于上下文增强的Transformer模型

Raffael Theiler, Leandro Von Krannichfeldt, Giovanni Sansavini, Michael F. Howland, Olga Fink

机构 * Intelligent Maintenance and Operations Systems (IMOS)(智能维护与运营系统) École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校) Department of Mechanical and Process Engineering(机械与过程工程系) Eidgenössische Technische Hochschule (ETH)(瑞士联邦理工学院(ETH)) Department of Civil and Environmental Engineering(土木与环境工程系) Massachusetts Institute of Technology (MIT)(麻省理工学院)

AI总结 本文提出一种结合预测与回归的任务,通过上下文增强的Transformer模型提升能源预测准确性,通过铁路和建筑能耗案例验证了方法的有效性,显著降低预测误差。

Comments 39 pages, 8 figures and tables, journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10851 2026-05-12 cs.AI cs.CL cs.LG

The Generalized Turing Test: A Foundation for Comparing Intelligence

通用图灵测试:比较智能的基础

Daniel Mitropolsky, Susan S. Hong, Riccardo Neumarker, Emanuele Rimoldi, Tomaso Poggio

机构 * MIT(麻省理工学院) ETH Zurich(苏黎世联邦理工学院) EPFL(苏黎世联邦理工学院)

AI总结 本文提出通用图灵测试框架,通过不可区分性比较任意智能体的能力,研究其性质并实证分析现代模型的智能层次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10650 2026-05-12 cs.LG cond-mat.dis-nn

A Random-Matrix Criterion for Initializing Gated Recurrent Neural Networks

门控循环神经网络初始化的随机矩阵准则

Tommaso Fioratti, Riccardo Marcaccioli, Francesco Casola

机构 * Institute of Mathematics, EPFL, 1015 Lausanne, Switzerland(瑞士洛桑联邦理工学院数学研究所)

AI总结 本文提出一种随机矩阵准则,用于估计门控循环神经网络初始化的临界值,以优化混沌预测任务的性能。

Comments 10 pages, 5 figures, 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10645 2026-05-12 cs.CV

GenMed: A Pairwise Generative Reformulation of Medical Diagnostic Tasks

GenMed:医学诊断任务的成对生成性重述

Hantao Zhang, Weidong Guo, Yuhe Liu, Jiancheng Yang, Sathvik Bhagavan, Danli Shi, Mingda Xu, Pascal Fua

机构 * CVLab, École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL)计算机视觉实验室) Fudan University(复旦大学) Beihang University(北航大学) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(艾尔沃斯大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出一种生成性方法,通过扩散模型建模联合分布P(X,Y),在推理时优化输出,支持任意观测组合,实验显示在医学图像分割、少样本分割、退化输入分割、形状补全和零样本应用中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20898 2026-05-12 eess.AS cs.CL cs.LG

Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection

通过可学习投影减少基于LLM的语音识别中的提示敏感性

Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Srikanth Madikeri, Andrés Carofilis, Pradeep Rangappa, Manjunath K E, Kadri Hacioglu, Petr Motlicek, Andreas Stolcke

机构 * Idiap Research Institute(Idiap研究 institute) EPFL(苏黎世联邦理工学院) Uniphore(Uniphore公司) University of Zurich(苏黎世大学) Brno University of Technology(布拉格技术大学)

AI总结 本文提出一种可学习的提示投影模块,通过优化LLM输入空间提升语音识别性能,减少提示设计的不稳定性。

Comments Paper accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09775 2026-05-12 cs.LG math.OC

Bayesian Optimization with Structured Measurements: A Vector-Valued RKHS Framework

基于结构化测量的贝叶斯优化:一种向量值RKHS框架

Wenbin Wang, Colin N. Jones

机构 * Automatic Control Laboratory, EPFL(瑞士联邦理工学院自动控制实验室)

AI总结 本文提出一种基于向量值RKHS框架的贝叶斯优化方法,利用结构化测量信息提升样本效率,通过UCB算法实现子线性收敛率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09511 2026-05-12 cs.AI

WindINR: Latent-State INR for Fast Local Wind Query and Correction in Complex Terrain

WindINR: 隐式神经表示的潜在状态用于复杂地形中快速局部风查询与修正

Yi Xiao, Qilong Jia, Hang Fan, Pascal Fua, Robert Jenssen, Xiaosong Ma, Wei Xue

机构 * Tsinghua University(清华大学) MBZUAI Columbia University(哥伦比亚大学) EPFL(苏黎世联邦理工学院) The Arctic University of Norway(挪威北极大学)

AI总结 WindINR通过隐式神经表示框架实现复杂地形中高分辨率局部风查询和稀疏观测修正,利用潜在状态解码器提升查询效率,实现快速修正和高精度风力预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07027 2026-05-12 cs.AI cs.CL cs.LG cs.NE physics.chem-ph

LLM-Augmented Chemical Synthesis and Design Decision Programs

基于大语言模型的化学合成与设计决策程序

Haorui Wang, Jeff Guo, Lingkai Kong, Rampi Ramprasad, Philippe Schwaller, Yuanqi Du, Chao Zhang

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑校区) National Centre of Competence in Research (NCCR) Catalysis(催化领域竞争力研究国立中心) Harvard University(哈佛大学) Cornell University(康奈尔大学)

AI总结 本文提出利用大语言模型增强的 retrosynthesis 规划方法,通过高效编码反应路径和新的路线搜索策略,提升多步合成规划与可合成分子设计能力。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09209 2026-05-12 math.OC cs.AI

Select-then-differentiate: Solving Bilevel Optimization with Manifold Lower-level Solution Sets

选择后再求导:解决具有流形下层解集的双层优化问题

Saeed Masiha, Zebang Shen, Negar Kiyavash, Niao He

机构 * EPFL School of Management of Technology(EPFL管理学院) ETH Department of Computer Science(ETH计算机科学系)

AI总结 本文研究了下层问题具有非孤立流形极小解时的乐观双层优化,提出HG-MS方法结合显式乐观选择和高效的伪逆超梯度计算,证明其在流形内在维度内收敛,并在实际应用中取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05108 2026-05-12 math.OC cs.LG

Projection-Free Functional Constrained Optimization for Risk Aversion and Sparsity Control

无投影函数约束优化用于风险规避和稀疏性控制

Yi Cheng, Guanghui Lan, Saeed Masiha, H. Edwin Romeijn

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(赫尔曼·米利顿·斯图尔特工业与系统工程学院,佐治亚理工学院) College of Management of Technology, EPFL(技术管理学院,苏黎世联邦理工学院)

AI总结 本文提出无投影方法解决函数约束优化问题,针对凸和非凸目标,提出LCG和IPP-LCG方法,展示了迭代复杂度并验证了在投资组合选择和IMRT中的稀疏性与风险平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07631 2026-05-11 cs.AI

Inference Time Causal Probing in LLMs

大语言模型中的推断时间因果探测

Sadegh Khorasani, Saber Salehkaleybar, Negar Kiyavash, Matthias Grossglauser

机构 * School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(苏黎世联邦理工学院计算机与通信科学系) Leiden Institute of Advanced Computer Science (LIACS), Leiden University, Leiden, The Netherlands(莱顿大学高级计算机科学研究所) College of Management of Technology, EPFL, Lausanne, Switzerland(苏黎世联邦理工学院技术管理学院)

AI总结 本文提出HDMI方法,通过梯度优化直接操控隐藏状态,提升因果探测的可靠性,实验显示其在多个基准测试中表现优于现有方法。

Comments 16 pages, 4 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14868 2026-05-11 cs.LG cs.AI

Goldilocks RL: Tuning Task Difficulty to Escape Sparse Rewards for Reasoning

Goldilocks RL: 调整任务难度以摆脱稀疏奖励进行推理

Ilia Mahrooghi, Aryo Lotfi, Emmanuel Abbe

机构 * EPFL(苏黎世联邦理工学院) Apple(苹果公司)

AI总结 Goldilocks RL通过预测学生模型的难度来优化数据采样,利用GRPO训练提升模型性能,克服稀疏奖励带来的样本效率低问题。

Comments 28 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14951 2026-05-11 cs.LG cs.AI cs.NE

Flat Channels to Infinity in Neural Loss Landscapes

神经损失景观中的无限平坦通道

Flavio Martinelli, Alexander Van Meegen, Berfin Şimşek, Wulfram Gerstner, Johanni Brea

机构 * EPFL(苏黎世联邦理工学院) Flatiron Institute(Flatiron研究所)

AI总结 研究揭示神经网络损失景观中存在无限平坦通道结构,其中损失缓慢下降而输出权重趋于无穷大,通过梯度动力学和几何分析揭示其特性及计算能力。

Comments Accepted to NeurIPS'25 (fixed resolution of equations in figs.1,2,3)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15567 2026-05-11 cs.AI cond-mat.mtrl-sci cs.LG physics.chem-ph

Evaluating Large Language Models in Scientific Discovery

评估大型语言模型在科学发现中的表现

Zhangde Song, Jieyu Lu, Yuanqi Du, Botao Yu, Thomas M. Pruyn, Yue Huang, Kehan Guo, Xiuzhe Luo, Yuanhao Qu, Yi Qu, Yinkai Wang, Haorui Wang, Jeff Guo, Jingru Gan, Parshin Shojaee, Di Luo, Andres M Bran, Gen Li, Qiyuan Zhao, Shao-Xiong Lennon Luo, Yuxuan Zhang, Xiang Zou, Wanru Zhao, Yifan F. Zhang, Wucheng Zhang, Shunan Zheng, Saiyang Zhang, Sartaaj Takrim Khan, Mahyar Rajabi-Kochi, Samantha Paradi-Maropakis, Tony Baltoiu, Fengyu Xie, Tianyang Chen, Kexin Huang, Weiliang Luo, Meijing Fang, Xin Yang, Lixue Cheng, Jiajun He, Soha Hassoun, Xiangliang Zhang, Wei Wang, Chandan K. Reddy, Chao Zhang, Zhiling Zheng, Mengdi Wang, Le Cong, Carla P. Gomes, Chang-Yu Hsieh, Aditya Nandy, Philippe Schwaller, Heather J. Kulik, Haojun Jia, Huan Sun, Seyed Mohamad Moosavi, Chenru Duan

机构 * Deep Principle(深原则) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学) Department of Computer Science and Engineering, The Ohio State University(计算机科学与工程系,俄亥俄州立大学) Department of Chemical Engineering & Applied Chemistry, University of Toronto(化学工程与应用化学系,多伦多大学) Department of Computer Science and Engineering, University of Notre Dame(计算机科学与工程系,圣母大学) QuEra Computing Inc.(QuEra计算公司) Department of Pathology, Department of Genetics, Cancer Biology Program, Stanford University School of Medicine(病理学系、遗传学系、癌症生物学项目,斯坦福大学医学院) Harvard Law School(哈佛法学院) Department of Computer Science, Tufts University(计算机科学系,塔夫茨大学) School of Computational Science and Engineering, Georgia Institute of Technology(计算科学与工程学院,佐治亚理工学院) Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校) Department of Computer Science, Virginia Tech(计算机科学系,弗吉尼亚理工大学) Department of Physics, Tsinghua University(物理系,清华大学) Institute for Advanced Study, Tsinghua University(清华大学高级研究所) Laboratory of Artificial Chemical Intelligence, Ecole Polytechnique Federale de Lausanne(人工化学智能实验室,瑞士联邦理工学院)

AI总结 本文提出一个基于场景的基准测试,评估LLM在生物学、化学、材料科学和物理学中的科学发现能力,揭示了模型在科学发现任务中的性能差距和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06643 2026-05-08 cs.CV cs.AI cs.LG cs.MM

Are We Making Progress in Multimodal Domain Generalization? A Comprehensive Benchmark Study

我们是否在多模态领域泛化中取得进展?一个全面的基准研究

Hao Dong, Hongzhao Li, Shupan Li, Muhammad Haris Khan, Eleni Chatzi, Olga Fink

机构 * ETH Zürich(苏黎世联邦理工学院) Zhengzhou University(郑州大学) MBZUAI(马克斯·普朗克人工智能研究所) EPFL(苏黎世联邦理工学院)

AI总结 本文通过MMDG-Bench基准测试,评估了多模态领域泛化方法的有效性,发现现有方法在公平比较下进步有限,且存在领域和模态配置差异,揭示了领域泛化仍需进一步改进。

Comments Code: https://github.com/lihongzhao99/MMDG_Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06377 2026-05-08 cs.GT cs.LG cs.MA

Independent Learning of Nash Equilibria in Partially Observable Markov Potential Games with Decoupled Dynamics

在具有解耦动态的可部分观测马尔可夫势博弈中独立学习纳什均衡

Philip Jordan, Maryam Kamgarpour

机构 * SYCAMORE, EPFL(SYCAMORE,瑞士联邦理工学院)

AI总结 本文研究了在可部分观测马尔可夫博弈(POMG)中纳什均衡的学习问题,提出了一种独立学习算法,通过不通信的方式,使玩家在仅观察自身动作和观测的情况下,联合收敛到近似纳什均衡,从而实现高效的样本和计算复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06219 2026-05-08 cs.AI

Joint Consistency: A Unified Test-Time Aggregation Framework via Energy Minimization

联合一致性:通过能量最小化实现的统一测试时间聚合框架

Yunzhen Yao, Hongye Wang, Yahong Wang, Michael C. Gastpar, Bo Jiang, Lie He

机构 * EPFL(苏黎世联邦理工学院) SUFE(上海财经大学)

AI总结 本文提出联合一致性框架,通过能量最小化统一测试时间聚合,整合现有投票和加权聚合方法,利用LLM作为裁判进行交互矩阵构建,并在大规模测试中实现高效近似策略。

详情

展开后加载摘要…

URL PDF HTML 收藏