arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

NeurIPS

Conference on Neural Information Processing Systems · 会议 · Machine Learning

2026-05-19 至 2026-05-19 共收录 11
2505.20218 2026-05-19 cs.LG

Fine-grained List-wise Alignment for Generative Medication Recommendation

细粒度列表级对齐用于生成性药物推荐

Chenxiao Fan, Chongming Gao, Wentao Shi, Yaxin Gong, Zihao Zhao, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出FLAME框架,通过细粒度列表级对齐方法,利用大语言模型生成药物列表,以提高药物推荐的准确性和安全性,同时考虑药物间的相互作用和潜在不良反应。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17564 2026-05-19 cs.CV

A Conditional U-Net Pipeline with Pre- and Post-Processing for Aerial RGB-to-Thermal Image Translation

具有预处理和后处理的条件U-Net管道用于航空RGB到热图像转换

Tseten Sherpa, Sikandar Ali, Shubham Parab, Haoyun Feng, Matthew Dennis, Keenan Gibbons, Verrah Otiende, Geoffrey H. Siwo

机构 * Department of Data Science, University of Michigan, Ann Arbor, MI, USA(数据科学系,密歇根大学,安阿伯,MI,美国) Department of Information Science, University of Michigan, Ann Arbor, MI, USA(信息科学系,密歇根大学,安阿伯,MI,美国) Department of Computer Science, University of Michigan, Ann Arbor, MI, USA(计算机科学系,密歇根大学,安阿伯,MI,美国) Arcknow, New York, USA(Arcknow,纽约,美国) School of Environmental Sustainability, University of Michigan, Ann Arbor, MI, USA(可持续环境学院,密歇根大学,安阿伯,MI,美国) SmithGroup, Ann Arbor, MI, USA(SmithGroup,安阿伯,MI,美国) Michigan Institute for Data and AI in Society (MIDAS), University of Michigan, Ann Arbor, MI, USA(密歇根数据与人工智能社会研究院(MIDAS),密歇根大学,安阿伯,MI,美国) United States International University (USIU), Nairobi, Kenya(美国国际大学(USIU),内罗毕,肯尼亚) Department of Learning Health Sciences, University of Michigan Medical School, Ann Arbor, MI, USA(学习健康科学系,密歇根大学医学院,安阿伯,MI,美国) Department of Pharmacology, University of Michigan Medical School, Ann Arbor, MI, USA(药理学系,密歇根大学医学院,安阿伯,MI,美国) Center for Global Health Equity, University of Michigan, Ann Arbor, MI, USA(全球健康公平中心,密歇根大学,安阿伯,MI,美国)

AI总结 本文提出了一种基于条件U-Net的简单架构,结合天气数据和针对性预处理与后处理技术,以提高航空RGB到热图像转换的性能,实验结果显示其在PSNR、SSIM和LPIPS指标上优于现有方法。

Comments 8 pages, 7 figures, NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21265 2026-05-19 cs.CL cs.LG cs.SE

ToolMATH: A Diagnostic Benchmark for Long-Horizon Tool Use under Systematic Tool-Catalog Constraints

ToolMATH: 一种用于在系统性工具目录约束下评估长周期工具使用的诊断基准

Hyeonje Choi, Jeongsoo Lee, Hyojun Lee, Jay-Yoon Lee

机构 * Seoul National University(首尔国立大学)

AI总结 本文提出ToolMATH,一种基于数学的诊断基准,用于评估在可控工具目录条件下长周期工具使用的性能,通过将分步MATH解决方案转换为可重用的Python工具,并配对需要顺序工具使用、中间输出重用和逻辑连接工具调用链的问题,从而评估模型在不同工具目录条件下的适应性、鲁棒性和工具连接性。

Comments Submitted to NeurIPS Evaluation & Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17144 2026-05-19 cs.RO cs.AI cs.LG

Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States

对比性概念激活引导(COAST):通过隐藏状态解锁视觉-语言-动作模型

Miranda Muqing Miao, Subin Kim, Brandon Yang, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出COAST方法,通过识别成功子空间来提升视觉-语言-动作模型在机器人任务中的性能,其核心方法是利用概念投射来引导模型向成功分布发展,从而提高任务成功率。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17028 2026-05-19 cs.CL cs.AI

PARALLAX: Separating Genuine Hallucination Detection from Benchmark Construction Artifacts

PARALLAX:区分真实幻觉检测与基准构建人工制品

Khizar Hussain, Murat Kantarcioglu

机构 * Virginia Tech(弗吉尼亚理工大学)

AI总结 本文研究了大型语言模型幻觉检测中的基准构建人工制品问题,提出DRIFT作为对比方法,发现大部分基线方法在控制条件下表现接近随机,而SAPLMA和DRIFT作为上层隐藏状态的监督探针表现出例外。

Comments Preprint to Neurips 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16790 2026-05-19 cs.LG cs.AI cs.CL

TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition

TIER: 用于多步工具组合的轨迹不变执行奖励

Anay Kulkarni, ChiaEn Lu, Dheeraj Mekala, Jayanth Srinivasa, Gaowen Liu, Jingbo Shang

机构 * UC San Diego(加州大学圣迭戈分校) Cisco Research(思科研究)

AI总结 本文提出TIER,一种基于函数模式和运行时执行的奖励框架,能够提供密集且可解释的序列级反馈,支持多种解决方案策略并适应变化的工具接口,在DepthBench等基准上实现了高准确率。

Comments Preprint. Submitted to NeurIPS 2026. 28 pages, 7 figures, 8 tables. Code and datasets available at https://github.com/anaykulkarni/TIER

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16675 2026-05-19 cs.AI

LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning

LinAlg-Bench:一个 forensic 验证基准,揭示 LLM 数学推理中的结构失效模式

Shradha Agarwal, Deepak Rajbhar, Tariq J

机构 * Department of Nuclear Engineering and Computer Science(核工程与计算机科学系)

AI总结 LinAlg-Bench 评估 10 个前沿大语言模型在结构线性代数计算中的表现,揭示 LLM 数学失败并非随机,而是受算法类型和矩阵维度约束。研究发现 4x4 尺寸存在行为阈值,低于该尺寸模型通过执行错误失败,高于则转向计算放弃,通过工具角色扮演等制造响应。

Comments 42 pages, 3 figures, 12 tables. NeurIPS 2026 Evaluations and Datasets Track submission. Dataset: https://huggingface.co/datasets/LinAlgBench/linalg-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13900 2026-05-19 cs.MA cs.LG

Ready from Day 1: Population-Aware Coordination for Large-Scale Constrained Multi-Agent Systems

从第一天开始:面向大规模约束多智能体系统的群体感知协调

Angel Wang, Dominique Perrault-Joncas, Alvaro Maggiar, Carson Eisenach, Dean Foster

机构 * Amazon(亚马逊)

AI总结 本文提出群体感知协调接口,通过学习的原Dual映射,在迭代循环中查询,以实现大规模多智能体系统的协调,减少预测误差和容量违规。

Comments 30 pages, 16 figures. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16786 2026-05-19 cs.LG

FlowMixer: A Depth-Agnostic Neural Architecture for Interpretable Spatiotemporal Forecasting

FlowMixer:一种不依赖深度的神经架构用于可解释的时空预测

Fares B. Mehouachi, Saif Eddin Jabari

机构 * New York University in Abu Dhabi(纽约大学阿布扎赫尔分校) New York University Abu Dhabi(纽约大学阿布扎赫尔分校) Brooklyn, USA(布鲁克林,美国)

AI总结 FlowMixer通过约束矩阵运算建模结构化时空模式,结合可逆映射框架实现可解释的时空预测,通过Kronecker-Koopman特征模式直接操控预测时间跨度,无需重新训练。

Comments Accepted (main track) at NeurIPS 2025. 44 pages, 17 figures, 22 tables. Published in Advances in Neural Information Processing Systems, vol. 38

Journal ref Advances in Neural Information Processing Systems, vol. 38, pp. 88811-88861, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02360 2026-05-19 cs.LG cs.AI

Catastrophic Overfitting, Entropy Gap and Participation Ratio: A Noiseless $l^p$ Norm Solution for Fast Adversarial Training

灾难性过拟合、熵差与参与比:一种无噪声的 $l^p$ 范数解决方案用于快速对抗训练

Fares B. Mehouachi, Saif Eddin Jabari

机构 * New York University of Abu Dhabi(纽约阿布扎比分校) Department of Civil and Urban Engineering(土木与城市工程系) NYU Tandon School of Engineering(纽约大学坦顿工程学院)

AI总结 本文提出基于 $l^p$ 范数的无噪声方法,通过量化梯度集中度和熵测度,自动调整训练范数以缓解灾难性过拟合问题,无需额外正则化或噪声注入。

Comments 26 pages, 13 figures, 5 table. Preliminary version at NeurIPS 2025 Reliable and Responsible AI Workshop. Code: https://github.com/FaresBMehouachi/lpfgsm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16612 2026-05-19 cs.AI cond-mat.mtrl-sci

PRISMat: Policy-Driven, Permutation-Invariant Autoregressive Material Generation

PRISMat:基于策略的、排列不变的自回归材料生成

Claire Schlesinger, Circe Hsu, Peter Schindler, Robin Walters

机构 * Khoury College of Computer Sciences(科里学院计算机科学学院) Northeastern University(东北大学) College of Engineering(工程学院)

AI总结 PRISMat通过高效生成晶体片层,提升了材料发现的准确性,其在切开能和工作函数任务中的均绝对误差显著降低。

Comments 10 pages, 8 figures, Under Review at Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏