arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 11791
2605.30873 2026-06-01 cs.LG cs.AI cs.DC

Federated Variational Preference Alignment with Gumbel-Softmax Prior for Personalized User Preferences

联邦变分偏好对齐与Gumbel-Softmax先验用于个性化用户偏好

Jabin Koo, Hoyoung Kim, Minwoo Jang, Jungseul Ok

机构 * Graduate School of AI, POSTECH, Pohang, Republic of Korea(POSTECH人工智能研究生院) Department of CSE, POSTECH, Pohang, Republic of Korea(POSTECH计算机科学与工程系) National AI Research Lab, Seoul, Republic of Korea(首尔国家人工智能研究实验室)

AI总结 提出FedVPA-GP框架,通过联邦混合先验和正交损失解决联邦学习中用户偏好冲突和个性化问题,在HH-RLHF数据集上优于单一模型。

Comments 21 pages, 4 figures. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30859 2026-06-01 cs.LG cs.AI

DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning

DARTS: 分布感知的主动展开轨迹塑造以加速LLM强化学习

Yujie Wang, Siwei Chen, Longzan Luo, Xinyi Liu, Xupeng Miao, Fangcheng Fu, Bin Cui

机构 * School of Computer Science \& Beijing Key Laboratory of Software Hardware Cooperative Artificial Intelligence Systems, Peking University, Beijing, China School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China Institute of Computational Social Science, Peking University (Qingdao), Qingdao, China

AI总结 针对强化学习中长尾响应分布导致的效率瓶颈,提出分布感知的主动轨迹塑造方法,通过细粒度识别提示内长尾并削减无效冗余,实现高达1.77倍的加速而不损失模型性能。

Comments 16 pages, 14 figures, 5 tables. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30825 2026-06-01 cs.LG cs.AI math.OC stat.ML

Unlearning in Diffusion Models: A Unified Framework with KL Divergence and Likelihood Constraints

扩散模型中的遗忘学习:基于KL散度和似然约束的统一框架

Shervin Khalafi, Alejandro Ribeiro, Dongsheng Ding

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Tennessee, Knoxville(田纳西大学,基洛纳)

AI总结 提出一个约束优化框架,通过最小化与预训练模型的偏差并施加与遗忘分布的分离约束,实现扩散模型中的概念和数据遗忘,并基于KL散度和似然约束推导最优解及原始-对偶算法。

Comments 27 pages, 6 figures, 4 tables; Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30813 2026-06-01 cs.CL cs.DS

Incremental BPE Tokenization

增量式 BPE 分词

Shenghu Jiang, Ruihao Gong

机构 * Beihang University(北京航空航天大学) SenseTime Research(商汤科技研究院)

AI总结 提出一种增量式 BPE 分词算法,以 O(log² t) 时间处理每个字节,总复杂度 O(n log² t),支持流式场景,相比 Hugging Face 和 OpenAI 的实现速度提升约 3 倍并降低延迟。

Comments Accepted to ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30812 2026-06-01 cs.LG physics.comp-ph

Learning Permutation-invariant Macroscopic Dynamics

学习置换不变的宏观动力学

Zhichao Han, Mengyi Chen, Qianxiao Li

机构 * Institute for Functional Intelligent Materials, National University of Singapore(功能智能材料研究所,新加坡国立大学) Department of Mathematics, National University of Singapore(数学系,新加坡国立大学)

AI总结 提出一种置换不变的自编码器框架,通过重建质量分布而非逐点重建来学习无序微观系统的宏观动力学,并在粒子系统、Lennard-Jones流体和聚合物拉伸动力学中验证了有效性。

Comments ICML 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30808 2026-06-01 cs.CR cs.AI cs.LG

Differentially Private Preference Data Synthesis for Large Language Model Alignment

面向大语言模型对齐的差分隐私偏好数据合成

Fengyu Gao, Jing Yang

机构 * Department of Computer Science, University of Virginia, Charlottesville, Virginia, USA(弗吉尼亚大学计算机科学系) Department of Electrical and Computer Engineering, University of Virginia, Charlottesville, Virginia, USA(弗吉尼亚大学电气与计算机工程系)

AI总结 提出DPPrefSyn算法,基于Bradley-Terry偏好模型和DP-PCA生成差分隐私合成偏好数据,实现隐私保护的偏好对齐。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30807 2026-06-01 cs.LG

Conformal Reliability: A New Evaluation Metric for Conditional Generation

共形可靠性:条件生成的新评估指标

Yachen Gao, Xinwei Sun, Yikai Wang, Ye Shi, Jingya Wang, Jianfeng Feng, Yanwei Fu

机构 * Institute of Science and Technology for Brain-Inspired Intelligence(脑启发式智能科学与技术研究院) Shanghai Innovation Institute(上海创新研究院) School of Data Science(数据科学学院) Nanyang Technological University(南洋理工大学) School of Information Science and Technology(信息科学与技术学院)

AI总结 提出基于共形预测的可靠性分数作为条件生成模型的新评估指标,并开发CReL框架高效计算该分数,实验证明其有效性和可解释性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30776 2026-06-01 cs.LG

Efficient and Uncertainty-Aware Diffusion Framework for Offline-to-Online Reinforcement Learning

高效且不确定性感知的离线到在线强化学习扩散框架

Ha Manh Bui, Metod Jazbec, Eric Nalisnick, Anqi Liu

机构 * Department of Computer Science, Johns Hopkins University, Baltimore, MD, U.S.A.(约翰霍普金斯大学计算机科学系) AMLab, University of Amsterdam, Amsterdam, Netherlands(阿姆斯特丹大学AM实验室)

AI总结 提出DUAL框架,利用扩散模型先验知识蒸馏快速采样扩散策略和转移模型,并通过拉普拉斯近似和距离转移状态偏移检测进行不确定性量化,以改进在线阶段的探索与利用平衡。

Comments International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30774 2026-06-01 cs.CV

CameraNoise: Enabling Faithful Camera Control in Video Diffusion through Geometry-Flow-Guided Noise Warping

CameraNoise: 通过几何流引导的噪声扭曲实现视频扩散中的忠实相机控制

Haoyu Zhao, Jiaxi Gu, Haoran Chen, Qingping Zheng, Yeying Jin, Hongyi Yang, Junqi Cheng, Yuang Zhang, Zenghui Lu, Huan Yu, Jie Jiang, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯) Xiamen University(厦门大学)

AI总结 提出CameraNoise方法,通过几何流引导的噪声扭曲将相机运动编码为时间一致的随机表示,实现视频扩散中忠实且几何一致的相机控制。

Comments 28 pages, 16 figures

Journal ref Proceedings of the Forty-third International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30750 2026-06-01 cs.CV

SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling

SLAP: 用于变分视频-语言建模的语义最小作用原理

Xiang Fang, Wanlong Fang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学)

AI总结 提出语义最小作用原理(SLAP),将视频插值建模为黎曼流形上的边界值问题,通过离散欧拉-拉格朗日方程保持对象持久性,解决大视频语言模型中的时间间隙问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30745 2026-06-01 cs.CV

Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness

Immuno-VLM:通过生成式语义抗体实现大型视觉-语言模型的开放世界可信赖性

Xiang Fang, Wanlong Fang, Wei Ji

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) Nanjing University(南京大学)

AI总结 针对大型视觉-语言模型在开放世界部署中因缺乏负面知识而将未知异常高置信度误分类为已知类别的“语义傲慢”问题,提出受生物免疫负选择启发的Immuno-VLM框架,利用大语言模型的生成推理主动产生“语义抗体”(近分布异常文本描述)来约束已知类决策空间,在ImageNet-1K和四个OOD基准上达到新最优。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30713 2026-06-01 cs.LG cs.CV cs.MM

Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models

多样性至关重要:重新审视视觉-语言模型中的测试时计算

Yijie Tong, Yifan Hou, Shaobo Cui, Antoine Bosselut, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) Shanghai Jiao Tong University(上海交通大学) EPFL(苏黎世联邦理工学院)

AI总结 针对视觉-语言模型(VLM)中测试时计算(TTC)策略应用不足的问题,提出基于预测熵的ETTC方法,通过利用模型间的置信度差异提升集成性能,理论证明并实验验证其优于多数投票和最佳单模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30648 2026-06-01 cs.LG math.OC

Convergence of Steepest Descent and Adam under Non-Uniform Smoothness

非均匀光滑条件下最速下降与Adam的收敛性

Sharan Vaswani, Yifan Sun, Reza Babanezhad

机构 * Simon Fraser University(西蒙弗雷泽大学) Stony Brook University(石溪大学)

AI总结 本文在非均匀光滑假设下,研究最速下降法及RMSProp和Adam的确定性对角变体的收敛率,证明在逻辑回归、softmax策略梯度等目标上符号梯度下降线性收敛且快于梯度下降,并在两层神经网络上证明RMSProp和Adam可线性收敛。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30641 2026-06-01 cs.CL cs.AI

COFT: Counterfactual-Conformal Decoding for Fair Chain-of-Thought Reasoning in Large Language Models

COFT: 用于大语言模型中公平思维链推理的反事实-保形解码

Arya Fayyazi, Mehdi Kamal, Massoud Pedram

机构 * Department of Electrical and Computer Engineering, University of Southern California, Los Angeles, California, USA(电气与计算机工程系,南加州大学,洛杉矶,加利福尼亚州,美国)

AI总结 提出COFT,一种无需训练的解码方法,通过反事实提示和保形校准在解码时实现token级公平性控制,显著减少思维链生成中的社会偏见,同时保持任务效用和语言质量。

Comments Proceeding of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30635 2026-06-01 cs.LG q-bio.GN

CellBRIDGE: Learning Cellular Trajectories via Interaction-Aware Alignment

CellBRIDGE:通过交互感知对齐学习细胞轨迹

Silas Ruhrberg Estévez, Nicolas Huynh, Tennison Liu, Roderik M. Kortlever, Gerard I. Evan, David L. Bentley, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge(剑桥大学应用数学与理论物理系) Francis Crick Institute(弗朗西斯·克里克研究所) University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医学校区)

AI总结 提出CellBRIDGE方法,通过将配体-受体介导的细胞间通信成本融入最优传输框架,改进了单细胞RNA测序数据中的轨迹推断和跨快照耦合。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30625 2026-06-01 cs.LG cs.AI stat.ML

Active Timepoint Selection for Learning Measure-Valued Trajectories

学习测度值轨迹的主动时间点选择

Nicolas Huynh, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge(剑桥大学 DAMTP 实验室)

AI总结 针对高成本破坏性数据获取场景,提出基于线性化最优传输的主动学习框架,通过高斯过程建模概率路径并迭代选择最优测量时间点以最小化不确定性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30610 2026-06-01 cs.LG

Constrained Flow Optimization via Sequential Fine Tuning for Molecular Design

通过序列微调进行约束流优化以用于分子设计

Sven Gutjahr, Riccardo De Santi, Luca Schaufelberger, Kjell Jorner, Andreas Krause

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Institute of Chemical and Bioengineering, Department of Chemistry and Applied Biosciences, ETH Zurich(苏黎世联邦理工学院化学与生物工程研究所) ETH AI Center(苏黎世联邦理工学院人工智能中心)

AI总结 提出约束流优化(CFO)算法,通过将约束生成优化问题转化为序列微调,在分子设计中平衡奖励最大化与约束满足。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30573 2026-06-01 cs.LG

Zeroth-Order Non-Log-Concave Sampling with Variance Reduction and Applications to Inverse Problems

零阶非对数凹采样与方差缩减及其在逆问题中的应用

M. Berk Sahin, Behzad Sharif, Abolfazl Hashemi

机构 * Elmore School of Electrical and Computer Engineering, Purdue University, West Lafayette, USA(电子工程学院,普渡大学,西拉法叶,美国) Weldon School of Biomedical Engineering, Purdue University, West Lafayette, USA(生物医学工程学院,普渡大学,西拉法叶,美国)

AI总结 针对黑盒设置下非对数凹分布采样中梯度不可访问且经典零阶估计器方差大的问题,提出方差缩减的零阶朗之万采样方法,首次建立非渐近收敛保证,并应用于逆问题后验采样。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30393 2026-06-01 cs.LG cs.AI cs.CR

NumLeak: Public Numeric Benchmarks as Latent Labels in Foundation Models

NumLeak: 基础模型中的公开数值基准作为潜在标签

Anany Kotawala

机构 * Princeton University(普林斯顿大学)

AI总结 提出NumLeak框架,通过API边界探测和开源因果模型的白盒验证,揭示基础模型在预训练中记忆公开数值基准,导致评估高估泛化能力。

Comments 23 pages, 12 figures, 17 tables. Accepted at the ICML 2026 Workshop on the Impact of Memorization on Trustworthy Foundation Models (MemFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28068 2026-06-01 cs.LG

PINE: Pruning Boosted Tree Ensembles with Conformal In-Distribution Prediction Equivalence

PINE:基于共形分布内预测等价的剪枝提升树集成

Haruki Yajima, Yusuke Matsui

机构 * The University of Tokyo(东京大学)

AI总结 提出PINE方法,通过共形校准控制分布内区域,在保持预测等价的同时将剪枝压缩比提升高达30%。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27355 2026-06-01 cs.AI cs.CL cs.LG

Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases

对齐篡改:人类反馈强化学习如何被利用以优化错位偏见

Dongyoon Hahm, Dylan Hadfield-Menell, Kimin Lee

机构 * MIT(麻省理工学院)

AI总结 本文提出对齐篡改漏洞,即对齐中的LLM通过影响偏好数据集使RLHF放大不良行为,并通过实验展示多种偏见的放大,指出现有缓解方法难以在不牺牲质量的情况下解决该问题。

Comments Accepted at ICML 2026, Source code: https://alignment-tampering.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26502 2026-06-01 cs.LG physics.optics

PRISM: Position-encoded Regressive Inverse Spectral Model for Multilayer Thin-Film Design

PRISM:用于多层薄膜设计的位置编码回归逆光谱模型

Runtian Wang, Renhao Xue, Baige Chen, Hao Wu

机构 * Independent Researcher(独立研究者) Work does not relate to position at Amazon(与亚马逊职位无关的工作)

AI总结 提出PRISM,一种解码器仅自回归变压器,通过联合预测离散材料选择和连续厚度回归,解决多层薄膜光学涂层设计的逆问题,相比其他变压器基线MAE降低50%以上,参数仅为其五分之一。

Comments 8 pages, 3 figures, Proceedings of the AI4Physics Workshop at the 43rd International Conference on Machine Learning (AI4Physics@ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26121 2026-06-01 cs.LG cs.AI

GEM: Geometric Entropy Mixing for Optimal LLM Data Curation

GEM: 用于最优LLM数据策展的几何熵混合

Yue Min, Ziyun Qiao, Ruining Chen, Yujun Li

机构 * The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学) Peking University, Beijing, China(北京大学) University of Science and Technology of China, Hefei, China(中国科学技术大学)

AI总结 提出GEM框架,通过将数据策展重构为超球面上的变分问题并采用MM算法优化,解决了分类缺陷和嵌入各向异性问题,在1.1B参数模型上实现下游准确率提升1.2%。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25134 2026-06-01 cs.LG cs.AI

Theoretical Analysis of Sparse Optimization with Reparameterization, Weight Decay, and Adaptive Learning Rate

重参数化、权重衰减和自适应学习率下稀疏优化的理论分析

Huangyu Xu, Jingqin Yang, Qianqian Xu, Jiaye Teng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学计算机科学与技术学院,北京,中国) Beijing Academy of Artificial Intelligence (BAAI), Beijing, China(北京人工智能研究院(BAAI),北京,中国) IIIS, Tsinghua University, Beijing, China(清华大学人工智能院,北京,中国) School of Statistics and Management, Shanghai University of Finance and Economics, Shanghai, China(上海财经大学统计与管理学院,上海,中国) Institute of Data Science and Statistics, Shanghai University of Finance and Economics, Shanghai, China(上海财经大学数据科学与统计研究所,上海,中国)

AI总结 针对稀疏优化中的不稳定问题,提出基于重参数化、权重衰减和自适应学习率的ReWA方法,通过改善优化景观实现比ℓ1正则化更好的稀疏性,同时保持测试精度。

Comments 32 pages, 5 figures. Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20176 2026-06-01 q-bio.BM cs.LG

Cross-Chirality Generalization by Axial Vectors for Hetero-Chiral Protein-Peptide Interaction Design

通过轴向向量实现异手性蛋白质-肽相互作用设计的跨手性泛化

Ziyi Yang, Zitong Tian, Yinjun Jia, Tianyi Zhang, Jiqing Zheng, Hao Wang, Yubu Su, Juncai He, Lei Liu, Yanyan Lan

机构 * Department of Chemistry, Tsinghua University, Beijing, China(清华大学化学系) School of Life Sciences, Tsinghua University, Beijing, China(清华大学生命科学学院) Anew Labs, Shanghai, China(Anew实验室) Tsinghua-Peking Center for Life Sciences, Beijing, China(清华大学-北京大学生命科学中心) Ministry of Education Key Laboratory of Bioorganic Phosphorus Chemistry and Chemical Biology, Tsinghua University, Beijing, China(教育部生物有机磷化学与化学生物学重点实验室) Center for Synthetic and Systems Biology, Tsinghua University, Beijing, China(合成与系统生物学中心) Beijing Frontier Research Center for Biological Structure, Tsinghua University, Beijing, China(北京生物结构前沿研究中心) Qiuzhen College, Tsinghua University, Beijing, China(齐臻学院) Yau Mathematical Sciences Center, Tsinghua University, Beijing, China(叶德平数学科学中心) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学) AI Industry Research Innovation Center,Wuxi Research Institute for Applied Technologies, Tsinghua University(人工智能产业研究创新中心,无锡应用技术研究院,清华大学)

AI总结 提出向E(3)等变(极)向量特征注入轴向特征的方法,结合潜在扩散模型实现从同手性训练数据到异手性设计任务的跨手性泛化,首次通过湿实验验证了生成式AI从头设计D-肽结合物的有效性。

Comments v3: Revised acknowledgements only. The paper has been accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07482 2026-06-01 cs.LG cs.AI

How does Bayesian Sampling help Membership Inference Attacks?

贝叶斯采样如何帮助成员推断攻击?

Zhenlong Liu, Wenyu Jiang, Feng Zhou, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Nanjing University(南京大学计算机科学系) Center for Applied Statistics and School of Statistics, Renmin University of China(应用统计中心和统计学系,中国人民大学)

AI总结 提出贝叶斯成员推断攻击(BMIA),通过拉普拉斯近似对单个参考模型进行贝叶斯采样以估计条件分数分布,理论证明降低模型内方差从而提升攻击性能,并在多模态数据集上实现最先进的效果与效率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24535 2026-06-01 cs.CR cs.LG

Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

超越支持域:无监督越狱激活模拟的对抗训练

Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu

机构 * University of Technology Sydney, Sydney, Australia(技术悉尼大学) School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) Xi'an Jiaotong University, Xi'an, China(西安交通大学)

AI总结 针对现有安全引导方法对未见越狱攻击泛化失败的问题,提出基于无监督潜在方向发现的双层对抗训练框架,通过外推拒绝态有害请求激活模拟多样越狱激活,并训练势诱导引导场实现零样本越狱防御。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21470 2026-06-01 cs.LG cs.AI

Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling

面向延迟优化的Web Agent规划与调度的Agent即时编译

Caleb Winston, Ron Yifeng Wang, Azalia Mirhoseini, Christos Kozyrakis

机构 * Stanford University(斯坦福大学)

AI总结 提出Agent即时编译系统,通过JIT-Planner生成代码计划、JIT-Scheduler探索并行化策略及不变式工具协议,显著降低延迟并提高准确性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21108 2026-06-01 cs.LG cs.AI

Efficient Learning of Deep State Space Models via Importance Smoothing

通过重要性平滑高效学习深度状态空间模型

John-Joseph Brady, Nikolas Nusken, Yunpeng Li

机构 * Centre for Oral, Clinical and Translational Sciences, King's College London, London, United Kingdom(口腔、临床与转化科学中心,伦敦国王学院,伦敦,英国) Department of Mathematics, King's College London, London, United Kingdom(数学系,伦敦国王学院,伦敦,英国)

AI总结 提出并行变分蒙特卡洛(PVMC)方法,结合变分推断和序贯蒙特卡洛,实现深度状态空间模型在判别与生成任务上的高效训练,速度提升10倍。

Comments Accepted to the proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18024 2026-06-01 cs.LG cs.AI cs.MA

Interaction-Breaking Adversarial Learning Framework for Robust Multi-Agent Reinforcement Learning

交互破坏对抗学习框架用于鲁棒多智能体强化学习

Sunwoo Lee, Mingu Kang, Yonghyeon Jo, Seungyul Han

机构 * Graduate School of Artificial Intelligence, UNIST, Ulsan, South Korea(人工智能研究生院,UNIST,乌山,韩国)

AI总结 提出交互破坏对抗学习框架,从信息论角度构建攻击破坏智能体间交互,并训练智能体在干扰下可靠执行,提升鲁棒性。

Comments 9 pages for main, 33 pages for total, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏