arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harvard University(哈佛大学)

2026-06-19 至 2026-06-19 共收录 4
2602.14696 2026-06-19 cs.LG 版本更新

A Critical Look at Targeted Instruction Selection: Disentangling What Matters (and What Doesn't)

对目标指令选择的批判性审视:厘清什么重要(以及什么不重要)

Nihal V. Nayak, Paula Rodriguez-Diaz, Neha Hulkund, Sara Beery, David Alvarez-Melis

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) Kempner Institute(凯门研究所)

AI总结 本文系统解构指令微调中目标指令选择的两大核心要素——数据表示与选择算法,发现基于梯度的表示结合贪心轮询选择在低预算下表现最佳,但收益随预算增加而减弱,并统一了多种算法为近似距离最小化。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16233 2026-06-19 cs.SI cs.AI 版本更新

Policy-Embedded Graph Expansion: Networked HIV Testing with Diffusion-Driven Network Samples

策略嵌入图扩展:基于扩散驱动网络样本的网络化HIV检测

Akseli Kangaslahti, Davin Choo, Lingkai Kong, Milind Tambe, Alastair van Heerden, Cheryl Johnson

机构 * Harvard University(哈佛大学) University of Witwatersrand(沃特瓦特斯兰大学) Wits Health Consortium(沃茨健康联盟) World Health Organization(世界卫生组织)

AI总结 提出策略嵌入图扩展(PEGE)框架,将图扩展的生成分布直接嵌入决策策略,结合基于扩散的图扩展模型DDB,在真实HIV传播网络上实现优于基线17.3%的折扣奖励和15.4%的检测提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14430 2026-06-19 stat.ML cs.LG 版本更新

Meta Flow Maps enable scalable reward alignment

元流映射实现可扩展的奖励对齐

Peter Potaptchik, Adhi Saravanan, Abbas Mammadov, Alvaro Prat, Michael S. Albergo, Yee Whye Teh

机构 * University of Oxford(牛津大学) Harvard University(哈佛大学) Kempner Institute(凯普纳研究所)

AI总结 提出元流映射(MFMs)框架,通过可微分的单步后验采样实现高效价值函数估计,从而无需轨迹模拟即可进行推理时引导和离策略微调,显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19893 2026-06-19 cs.LG 版本更新

EQPO: Equitable Group Relative Policy Optimization for Clinical Reasoning

EQPO: 面向临床推理的公平群体相对策略优化

Shiqi Dai, Wei Dai, Jiaee Cheong, Paul Pu Liang

机构 * MIT(麻省理工学院) Harvard University(哈佛大学)

AI总结 提出EQPO分层强化学习方法,通过自适应重加权样本促进异质临床人群的均衡学习,在7个诊断基准上降低F1标准差43.9%,缩小预测公平差距27.2%。

Comments Accepted as Oral on NeurIPS 2025 GenAI4Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏