arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

NeurIPS

Conference on Neural Information Processing Systems · 会议 · Machine Learning

共收录 17321
2505.15277 2025-11-27 cs.CL

Web-Shepherd: Advancing PRMs for Reinforcing Web Agents

Web-Shepherd: 促进强化网络代理的PRMs

Hyungjoo Chae, Sunghwan Kim, Junhee Cho, Seungone Kim, Seungjun Moon, Gyeom Hwangbo, Dongha Lim, Minjin Kim, Yeonjun Hwang, Minju Gwak, Dongwook Choi, Minseok Kang, Gwanhoon Im, ByeongUng Cho, Hyojun Kim, Jun Hee Han, Taeyoon Kwon, Minju Kim, Beong-woo Kwak, Dongjin Kang, Jinyoung Yeo

机构 * Georgia Institute of Technology(佐治亚理工学院) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) Carnegie Mellon University(卡内基梅隆大学)

AI总结 Web-Shepherd是首个用于强化网络代理的PRM,通过构建大规模数据集和元评估基准,提升了网络导航任务的准确性和效率。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03401 2025-11-27 cs.LG cs.CY cs.GT

Evolutionary Prediction Games

进化预测游戏

Eden Saig, Nir Rosenfeld

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院)

AI总结 本文提出进化预测游戏框架,揭示理想化与现实学习设置间的差异,展示在现实约束下群体间稳定共存与互利共生的可能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14914 2025-11-27 cs.CV cs.CL cs.LG

CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness

CAPability: 一个全面的视觉描述基准,用于评估正确性和全面性

Zhihang Liu, Chen-Wei Xie, Bin Wen, Feiwu Yu, Jixuan Chen, Pandeng Li, Boqiang Zhang, Nianzu Yang, Yinglu Li, Zuan Gao, Yun Zheng, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab, Alibaba Group(阿里云实验室)

AI总结 CAPability是一个全面的视觉描述基准,通过12个维度评估描述的正确性和全面性,利用人类标注数据和启发式指标提升多模态模型的描述能力分析。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09646 2025-11-27 cs.CV cs.RO

Hamba: Single-view 3D Hand Reconstruction with Graph-guided Bi-Scanning Mamba

Hamba: 基于图引导双扫描Mamba的单视角3D手形重建

Haoye Dong, Aviral Chharia, Wenbo Gou, Francisco Vicente Carrasco, Fernando De la Torre

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 Hamba通过图引导双扫描Mamba框架,高效学习关节空间关系,实现更准确的3D手形重建。

Comments NeurIPS 2024; Project Website: https://humansensinglab.github.io/Hamba/

Journal ref NeurIPS, Vancouver, Canada, 2024, pp. 2127-2160

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00098 2025-11-27 cs.LG cs.CR stat.ML

Enabling Differentially Private Federated Learning for Speech Recognition: Benchmarks, Adaptive Optimizers and Gradient Clipping

使差分隐私联邦学习适用于语音识别:基准测试、自适应优化器和梯度裁剪

Martin Pelikan, Sheikh Shams Azam, Vitaly Feldman, Jan "Honza" Silovsky, Kunal Talwar, Christopher G. Brinton, Tatiana Likhomanenko

机构 * Apple(苹果公司) Purdue University(普渡大学)

AI总结 本文提出首个在端到端ASR中应用差分隐私联邦学习的基准测试,通过每层裁剪和层间梯度归一化技术,在强隐私保障下实现高精度语音识别。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20604 2025-11-26 cs.CL cs.AI cs.LG

On Evaluating LLM Alignment by Evaluating LLMs as Judges

通过评估LLM作为裁判来评估LLM对齐

Yixin Liu, Pengfei Liu, Arman Cohan

机构 * Yale University(耶鲁大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出AlignEval基准,通过评估LLM作为裁判的能力来衡量其对齐人类偏好的效果,结果优于现有自动评估基准。

Comments NeurIPS 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20570 2025-11-26 cs.RO cs.AI cs.HC cs.LG

Gated Uncertainty-Aware Runtime Dual Invariants for Neural Signal-Controlled Robotics

门控不确定性感知的实时双不变量框架用于神经信号控制的机器人

Tasha Kim, Oiwi Parker Jones

机构 * Oxford Robotics Institute (ORI)(牛津机器人研究所) Department of Engineering Science(工程科学系) University of Oxford(牛津大学)

AI总结 GUARDIAN通过结合校准置信度的脑信号解码与符号目标接地和双层运行时监控,实现神经信号控制机器人系统的高安全性和可靠性。

Comments Embodied and Safe-Assured Robotic Systems workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20490 2025-11-26 cs.LG cs.AI

MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology

MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准

Kiril Vasilev, Alexandre Misrahi, Eeshaan Jain, Phil F Cheng, Petros Liakopoulos, Olivier Michielin, Michael Moor, Charlotte Bunne

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院) HUG

AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20315 2025-11-26 cs.LG cs.AI cs.CL

Geometry of Decision Making in Language Models

语言模型中决策机制的几何学

Abhinav Joshi, Divyanshu Bhatt, Ashutosh Modi

AI总结 本研究通过分析语言模型中隐藏表示的内在维度,揭示了模型如何通过低维流形结构实现多选问答任务中的决策过程,提供了语言模型泛化和推理机制的几何学视角。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20273 2025-11-26 cs.LG cs.AI cs.CL

Beyond Components: Singular Vector-Based Interpretability of Transformer Circuits

超越组件:基于奇异向量的Transformer电路可解释性

Areeb Ahmad, Abhinav Joshi, Ashutosh Modi

机构 * Indian Institute of Technology Kanpur (IIT Kanpur)(印度理工学院坎浦尔(IIT坎浦尔))

AI总结 本文提出基于奇异向量的Transformer电路可解释性方法,揭示了模型内部更分布、结构化和组合化的计算特性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20194 2025-11-26 cs.LG

In-Context Compositional Learning via Sparse Coding Transformer

基于稀疏编码的上下文组合学习变换器

Wei Chen, Jingxi Yu, Zichen Miao, Qiang Qiu

机构 * Purdue University(普渡大学)

AI总结 本文提出基于稀疏编码的变换器,通过稀疏注意力机制提升组合学习任务的性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19808 2025-11-26 cs.LG cs.AI

Learning to Clean: Reinforcement Learning for Noisy Label Correction

学习以清洁:用于噪声标签纠正的强化学习

Marzi Heidari, Hanping Zhang, Yuhong Guo

机构 * School of Computer Science, Carleton University(卡莱顿大学计算机科学学院) CIFAR AI Chair, Amii(CIFAR人工智能主席,Amii)

AI总结 本文提出了一种基于强化学习的噪声标签纠正方法,通过深度特征表示策略网络实现标签纠正,实验表明其在多个数据集上优于现有技术。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19684 2025-11-26 cs.CV cs.AI cs.HC cs.RO

IndEgo: A Dataset of Industrial Scenarios and Collaborative Work for Egocentric Assistants

IndEgo:工业场景及协作工作的人际助理数据集

Vivek Chavan, Yasmina Imgrund, Tung Dao, Sanwantri Bai, Bosong Wang, Ze Lu, Oliver Heimann, Jörg Krüger

机构 * Fraunhofer IPK(弗劳恩霍夫研究所) Technical University of Berlin(柏林技术大学) University of Tübingen(图宾根大学) RWTH Aachen University(亚琛工业大学) Leibniz University Hannover(汉诺威莱布尼茨大学)

AI总结 IndEgo数据集旨在通过工业场景中的协作工作提升人机交互助理的多模态理解与错误检测能力。

Comments Accepted to NeurIPS 2025 D&B Track. Project Page: https://indego-dataset.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19671 2025-11-26 cs.AI

FISCAL: Financial Synthetic Claim-document Augmented Learning for Efficient Fact-Checking

FISCAL: 金融合成声明-文档增强学习用于高效事实核查

Rishab Sharma, Iman Saberi, Elham Alipour, Jie JW Wu, Fatemeh Fard

机构 * Charli Capital(Charli资本) University of British Columbia(不列颠哥伦比亚大学) Michigan Technological University(密歇根技术大学)

AI总结 FISCAL通过生成领域特定合成数据和高效微调,使小型模型在金融事实核查任务中达到最先进的准确性、鲁棒性和可扩展性。

Comments 3 tables, 11 pages, 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Generative AI in Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19635 2025-11-26 cs.SE cs.LG

Agint: Agentic Graph Compilation for Software Engineering Agents

Agint:软件工程代理的代理图编译

Abhi Chivukula, Jay Somasundaram, Vijay Somasundaram

AI总结 Agint通过代理图编译器和运行时实现高效、可靠的软件工程代理,支持自然语言到代码的自动化转换与协作开发。

Comments 18 pages, 5 figures, NeurIPS 2025: Deep Learning for Code in the Agentic Era

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19431 2025-11-26 cs.CV physics.ao-ph

Cloud4D: Estimating Cloud Properties at a High Spatial and Temporal Resolution

Cloud4D: 高空间和时间分辨率下云特性估计

Jacob Lin, Edward Gryspeerdt, Ronald Clark

机构 * Department of Computer Science University of Oxford(计算机科学系牛津大学) Department of Physics Imperial College London(物理系伦敦帝国学院)

AI总结 Cloud4D通过同步地面相机和2D-3D变换器,实现了高空间和时间分辨率的云特性估计,提升空间-时间分辨率并保持高精度。

Comments NeurIPS 2025 Spotlight, project page: https://cloud4d.jacob-lin.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21945 2025-11-26 cs.LG

Generalization Bounds for Rank-sparse Neural Networks

秩稀疏神经网络的泛化界限

Antoine Ledent, Rodrigo Alves, Yunwen Lei

AI总结 本文研究了秩稀疏神经网络的泛化界限,证明了利用权重矩阵近似低秩结构的神经网络的泛化界限,并探讨了Schatten p准范数在不同p值下的影响。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07664 2025-11-26 cs.LG cs.DC

FedQS: Optimizing Gradient and Model Aggregation for Semi-Asynchronous Federated Learning

FedQS: 优化联邦学习中梯度与模型聚合的半异步方法

Yunbo Li, Jiaping Gui, Zhihang Deng, Fanchao Meng, Yue Wu

AI总结 FedQS通过分而治之策略优化半异步联邦学习中的梯度与模型聚合,提升准确性、稳定性和收敛速度。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01508 2025-11-26 cs.LG

Realistic CDSS Drug Dosing with End-to-end Recurrent Q-learning for Dual Vasopressor Control

面向真实临床环境的CDSS药物剂量优化:基于端到端递归Q学习的双血管加压素控制

Will Y. Zou, Jean Feng, Alexandre Kalimouttou, Jennifer Yuntong Zhang, Christopher W. Seymour, Romain Pirracchio

机构 * University of California, San Francisco(加州大学旧金山分校) Engineering Science, University of Toronto(多伦多大学工程科学系) University of Pittsburgh(匹兹堡大学)

AI总结 本文提出一种端到端递归Q学习方法,用于ICU中双血管加压素的剂量优化,通过设计动作空间提升可解释性与临床实用性。

Comments 13 pages, 5 figures. Neurips 2025 Workshop Learning from Time Series for Health

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17177 2025-11-26 cs.CL cs.CV cs.LG

FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions

FlagEval Findings Report: 对大推理模型在自动可验证文本和视觉问题上的初步评估

Bowen Qin, Chen Yue, Fang Yin, Hui Wang, JG Yao, Jiakang Liu, Jing-Shu Zheng, Miguel Hu Chen, Richeng Xuan, Shibei Meng, Shiqi Zhou, Teng Dai, Tong-Shuai Ren, Wei Cui, Xi Yang, Xialin Du, Xiaojing Xu, Xue Sun, Xuejing Li, Yaming Liu, Yesheng Liu, Ying Liu, Yonghua Lin, Yu Zhao, Yunduo Zhang, Yuwen Luo, Zheqi He, Zhiyuan He, Zhongyuan Wang

机构 * BAAI FlagEval Team(百度人工智能研究院FlagEval团队) State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) Peking University(北京大学)

AI总结 FlagEval报告对大推理模型在自动可验证文本和视觉问题上的初步评估进行了研究,提出了ROME基准以测试视觉线索推理能力。

Comments Project homepage: https://flageval-baai.github.io/LRM-Eval/ This work will also be presented at NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models (FoRLM); update with trials on Gemini 3 Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18847 2025-11-26 cs.CL cs.AI

ConfTuner: Training Large Language Models to Express Their Confidence Verbally

ConfTuner: 训练大型语言模型以口头表达其置信度

Yibo Li, Miao Xiong, Jiaying Wu, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学)

AI总结 ConfTuner通过引入标记化布里尔分数损失函数,有效提升大型语言模型的置信度校准能力,适用于多种推理任务并泛化至黑盒模型。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17681 2025-11-26 cs.LG cs.AI

Unlearning as Ablation: Toward a Falsifiable Benchmark for Generative Scientific Discovery

反例作为消去:面向生成科学发现的可证伪基准

Robert Yang

机构 * S6 Research(S6研究)

AI总结 本文提出'反例作为消去'作为可证伪基准,旨在检验AI在科学发现中的生成能力,通过系统移除目标结果并评估模型能否重新推导,推动AI-科学的基准发展。

Comments 6 pages + appendix. Accepted to NeurIPS 2025 AI4Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22565 2025-11-26 stat.ML cs.LG math.OC

Adjoint Schrödinger Bridge Sampler

伴随施罗德inger桥采样器

Guan-Horng Liu, Jaemoo Choi, Yongxin Chen, Benjamin Kurt Miller, Ricky T. Q. Chen

机构 * FAIR at Meta(Meta 的 FAIR) Georgia Institute of Technology(佐治亚理工学院)

AI总结 ASBS是一种基于施罗德inger桥的新型扩散采样器,通过伴随匹配方法实现高效采样,无需估计目标样本,适用于多种能量函数和分子分布。

Comments NeurIPS 2025 (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08640 2025-11-26 cs.CV

Orientation Matters: Making 3D Generative Models Orientation-Aligned

方向至关重要:使3D生成模型方向对齐

Yichong Lu, Yuzhuo Tian, Zijin Jiang, Yikun Zhao, Yuanbo Yang, Hao Ouyang, Haoji Hu, Huimin Yu, Yujun Shen, Yiyi Liao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 本文提出方向对齐的3D物体生成方法,通过构建Objaverse-OA数据集并微调两种生成模型,实现跨类别的方向一致性,提升下游任务性能。

Comments Accepted by NeurIPS 2025. Project Page: https://xdimlab.github.io/Orientation_Matters

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23575 2025-11-26 cs.AI cs.LG

CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring

CoT红手:链式推理监控的压力测试

Benjamin Arnav, Pablo Bernabeu-Pérez, Nathan Helm-Burger, Tim Kostolansky, Hannes Whittingham, Mary Phuong

机构 * LASR Labs(语言与语音研究实验室)

AI总结 本文提出了一种混合协议,通过结合模型推理和行动评分,提升链式推理监控在检测有害行为方面的性能。

Comments To be published in the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20426 2025-11-26 cs.CV

MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness

MMPerspective: 多模态大语言模型是否理解视角?一个全面的视角感知、推理和鲁棒性评估基准

Yolo Y. Tang, Pinxin Liu, Zhangyun Tan, Mingqian Feng, Rui Mao, Chao Huang, Jing Bi, Yunzhong Xiao, Susan Liang, Hang Hua, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 MMPerspective通过10个任务评估多模态大语言模型在视角感知、推理和鲁棒性方面的能力,揭示其在空间一致性维持和组合推理上的局限性。

Comments Accepted to NeurIPS 2025 DB Track. Rating: 5,5,5,5

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16690 2025-11-26 cs.LG cs.AI

Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator

你的预训练大语言模型实际上是一个未监督的置信度校准器

Beier Luo, Shuoyuan Wang, Sharon Li, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Department of Computer Sciences, University of Wisconsin-Madison(计算机科学系,威斯康星大学麦迪逊分校)

AI总结 本文提出DACA方法,通过无监督方式优化后训练模型的置信度校准,减少不一致预测带来的过度自信问题,提升模型可靠性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16334 2025-11-26 cs.CV

Panoptic Captioning: An Equivalence Bridge for Image and Text

全景描述:图像与文本之间的等价桥梁

Kun-Yu Lin, Hongjun Wang, Weining Ren, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)

AI总结 本文提出全景描述任务,通过PancapEngine和PancapChain方法提升图像与文本的等价描述能力,实验表明其优于现有大语言模型。

Comments NeurIPS 2025; Project page: https://visual-ai.github.io/pancap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14253 2025-11-26 stat.ME

Wavelet Canonical Coherence for Nonstationary Signals

小波典范相干性用于非平稳信号

Haibo Wu, Marina I. Knight, Keiland W. Cooper, Norbert J. Fortin, Hernando Ombao

AI总结 WaveCanCoh通过小波分析方法,用于研究非平稳信号中不同集群间的时变依赖关系,能有效捕捉瞬时频率特定的相互作用。

Comments Accepted at NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13858 2025-11-26 cs.LG

Enforcing Hard Linear Constraints in Deep Learning Models with Decision Rules

在深度学习模型中强制执行硬线性约束的决策规则

Gonzalo E. Constante-Flores, Hao Chen, Can Li

机构 * Davidson School of Chemical Engineering(戴维森化学工程学院) Purdue University(普渡大学)

AI总结 本文提出了一种模型无关的框架,通过结合任务网络和安全网络,强制深度学习模型在训练和推理过程中满足输入依赖的线性约束,同时保持高准确性和低计算成本。

Comments 1 figure

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏