arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Georgia Institute of Technology(佐治亚理工学院)

2026-05-26 至 2026-05-26 共收录 13
2605.26072 2026-05-26 cs.LG

Active Query Synthesis for Preference Learning

用于偏好学习的主动查询合成

Namrata Nadagouda, Nauman Ahad, Maegan Tucker, Mark A. Davenport

机构 * Georgia Institute of Technology(佐治亚理工学院) Gauss Labs(Gauss实验室)

AI总结 针对偏好学习中的查询反馈可靠性问题和池评估计算瓶颈,提出基于互信息最大化的连续空间主动查询合成框架Info-Synth,并扩展出两种有限池查询策略,在合成数据、文本摘要和机器人控制任务上验证了有效性。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25360 2026-05-26 cs.CL

Learning to Route Languages for Multilingual Policy Optimization

学习路由语言以实现多语言策略优化

Geyang Guo, Hiromi Wakaki, Yuki Mitsufuji, Alan Ritter, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) Sony Group Corporation(索尼集团)

AI总结 提出语言路由策略优化(LRPO)框架,将语言作为可选变量,通过在线策略优化和可训练的语言路由器(多臂老虎机)自适应地选择语言,在固定预算下提升多语言训练信号的多样性和信息量,从而显著提高多语言性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06798 2026-05-26 cs.LG cs.DC stat.ML

NEST: Network- and Memory-Aware Device Placement For Distributed Deep Learning

NEST: 面向分布式深度学习的网络与内存感知设备放置

Irene Wang, Vishnu Varma Venkata, Arvind Krishnamurthy, Divya Mahajan

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Washington(华盛顿大学)

AI总结 提出NEST框架,通过结构化动态规划统一模型并行、拓扑建模和内存可行性,在多种硬件和网络上实现高达2.43倍的吞吐量提升。

Comments Accepted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24774 2026-05-26 cs.LG physics.comp-ph

Hermite-NGP: Gradient-Augmented Hash Encoding for Learning PDEs

Hermite-NGP:用于学习PDE的梯度增强哈希编码

Jinjin He, Zhiqi Li, Sinan Wang, Bo Zhu

机构 * Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院,亚特兰大,GA,美国)

AI总结 提出Hermite-NGP,一种梯度增强的多分辨率哈希编码,通过显式存储哈希网格顶点处的函数值和混合偏导数并利用Hermite插值实现解析梯度计算,从而快速准确地计算神经PDE求解器的空间导数,并引入多分辨率课程训练策略,在2D和3D PDE基准上实现高达约20倍误差降低和2-10倍收敛时间减少。

Comments Accepted by ICML 2026.Project page: https://jinjinhe2001.github.io/hermite-ngp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24743 2026-05-26 cs.LG cs.AI

Bilevel Optimization of Synthetic Trajectories for Multi-Turn LLM Fine-Tuning

用于多轮LLM微调的合成轨迹的双层优化

Shresth Verma, Mauricio Tec, Cheol Woo Kim, Kai Wang, Milind Tambe

机构 * Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出BOOST双层优化框架,通过内层加权训练和外层轻量级重加权头学习,解决合成轨迹质量异质性导致的LLM多轮交互性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24740 2026-05-26 cs.LG cs.GT

Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality

可达性的强化学习:保证渐近最优性

Amogh Palasamudram, Jakub Svoboda, Suguman Bansal, Krishnendu Chatterjee

机构 * Institute of Science and Technology, Austria(奥地利科学与技术研究所) Georgia Institute of Technology, USA(美国佐治亚理工学院) Dartmouth College, USA(美国达特茅斯学院)

AI总结 针对可达性规格的强化学习,提出一种基于PAC学习的迭代方法,在无需已知MDP内部参数的情况下实现渐近最优策略,并通过实验验证收敛动态。

Comments Main text and appendix of work accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10250 2026-05-26 cs.LG

GeMPO: Generalized Measure Matching for Online Diffusion Reinforcement Learning

GeMPO:在线扩散强化学习的广义度量匹配

Haitong Ma, Chenxiao Gao, Tianyi Chen, Na Li, Bo Dai

机构 * Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出GeMPO框架,通过将扩散RL中的重加权从softmax推广到一般单调函数,并引入负重加权机制,以解决过贪策略和负样本利用不足的问题。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24345 2026-05-26 cs.LG

Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs

通过分位数贝叶斯风险MDP演化在线强化学习中的鲁棒性-探索权衡

Meichen Song, Yuhao Wang, Enlu Zhou

机构 * School of Industrial and Systems Engineering(工业与系统工程系) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出一种基于分位数贝叶斯风险MDP的自适应算法,通过动态调整分位数水平来平衡早期鲁棒性与后期探索,并证明了亚线性贝叶斯遗憾界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24311 2026-05-26 cs.RO

Terrain-Adaptive Grouser Wheel for Optimal Planetary Exploration: Design and Experimental Investigation

地形自适应履刺轮用于最优行星探测:设计与实验研究

Vincent Griffo, Yashwanth Kumar Nakka

机构 * Aerospace Robotics Lab, Daniel Guggenheim School of Aerospace Engineering, Georgia Institute of Technology(航空航天机器人实验室,丹尼尔·古根海姆航空航天工程学院,佐治亚理工学院)

AI总结 针对行星车在颗粒地形上的移动难题,提出一种可连续调节履刺高度的多模态轮,实验表明自适应部署可减少滑转30-58%,并提升行驶时间和能效达77.4%。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23977 2026-05-26 cs.CL cs.SD eess.AS

A Multi-Probe Audit of Clinical-Interview Depression Detection Benchmarks

临床访谈抑郁症检测基准的多探针审计

Takehiro Ishikawa, Jon Duke

机构 * College of Computing, Georgia Institute of Technology(佐治亚理工学院计算机学院) Georgia Tech Research Institute, Georgia Institute of Technology(佐治亚理工学院研究 institute)

AI总结 通过四个互补探针审计临床访谈抑郁症检测基准,发现评估协议缺陷、排行榜不可靠、跨域泛化弱以及文本与音频模态对症状密度的敏感性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03955 2026-05-26 cs.AI cs.MA

AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent

AgentArk:将多智能体智能蒸馏到单个LLM智能体中

Yinyi Luo, Yiqiao Jin, Weichen Yu, Mengqi Zhang, Srijan Kumar, Xiaoxiao Li, Weijie Xu, Xin Chen, Jindong Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽学院) Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊) University of British Columbia(不列颠哥伦比亚大学)

AI总结 提出AgentArk框架,通过三种分层蒸馏策略将多智能体系统的交互动态蒸馏到单个模型权重中,使单个智能体具备多智能体的推理和自校正能力,同时保持计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11428 2026-05-26 cs.LG

Diagnosing Failure Modes of Neural Operators Across Diverse PDE Families

诊断不同PDE族中神经算子的失败模式

Lennon Shikhman

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出一个标准化压力测试框架,通过在不同PDE族上测试FNO、DeepONet和CNO三种架构,发现分布内准确率不能可靠预测鲁棒性,且失败模式依赖于架构和PDE族的组合。

Comments Published in Transactions on Machine Learning Research. 17 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20539 2026-05-26 cs.AI cs.CL

PathWise: Planning through World Model for Automated Heuristic Design via Self-Evolving LLMs

PathWise:通过世界模型规划实现基于自进化LLM的自动启发式设计

Oguzhan Gungordu, Siheng Xiong, Faramarz Fekri

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出PathWise多智能体推理框架,将启发式生成建模为基于蕴含图的序列决策过程,通过策略智能体、世界模型智能体和评论智能体的协作实现状态感知规划,在组合优化问题上收敛更快、泛化更强。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏