arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9452
2602.14157 2026-04-01 cs.CV cs.AI cs.LG

When Test-Time Guidance Is Enough: Fast Image and Video Editing with Diffusion Guidance

测试时指导足矣:基于扩散指导的快速图像和视频编辑

Ahmed Ghorbel, Badr Moufad, Navid Bagheri Shouraki, Alain Oliviero Durmus, Thomas Hirtz, Eric Moulines, Jimmy Olsson, Yazid Janati

机构 * CMAP, Ecole Polytechnique(巴黎综合理工学院CMAP实验室) Institute of Foundation Models(基础模型研究所) MBZUAI(穆罕默德·本·扎耶德人工智能大学) EPITA(法国高等信息技术学院) Sorbonne University(索邦大学) Lagrange Mathematics and Computing Research Center(拉格朗日数学与计算研究中心) EPITA Research Lab(EPITA研究实验室) KTH Royal Institute of Technology(瑞典皇家理工学院)

AI总结 本文提出通过测试时指导实现高效的图像和视频编辑,理论分析并扩展了现有方法,证明测试时指导能与训练时方法媲美甚至超越。

Journal ref ICLR 2026, ReALM-GEN workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17094 2026-04-01 cs.LG cs.AI cs.CL

The Mouth is Not the Brain: Bridging Energy-Based World Models and Language Generation

嘴巴不是大脑:连接基于能量的世界模型与语言生成

Junichiro Niimi

AI总结 本文提出'嘴巴不是大脑'原则,通过基于能量的世界模型与语言模型分离,展示在消费者评论领域中,世界模型能提升生成质量与可控性,为语言能力与世界理解分离提供实证支持。

Comments ICLR 2026 The 2nd Workshop on World Models: Understanding, Modelling, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14710 2026-04-01 math.AT cs.LG physics.data-an

MCbiF: Measuring Topological Autocorrelation in Multiscale Clusterings via 2-Parameter Persistent Homology

MCbiF:通过2参数持续同调测量多尺度聚类的拓扑自相关

Juni Schindler, Mauricio Barahona

机构 * Department of Mathematics, Imperial College London, UK(英国伦敦帝国理工学院数学系) Department of Mathematical Modeling and Machine Learning, University of Zurich, Switzerland(瑞士苏黎世大学数学建模与机器学习系)

AI总结 本文提出MCbiF方法,利用2参数持续同调分析多尺度聚类序列的拓扑自相关,展示了其在非层次聚类任务中的有效性。

Comments Published as a conference paper at 14th International Conference on Learning Representations (ICLR 2026): https://openreview.net/forum?id=E7D6uybODJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09734 2026-04-01 cs.LG cs.AI

ARROW: An Adaptive Rollout and Routing Method for Global Weather Forecasting

ARROW:一种用于全球天气预报的自适应 rollout 和路由方法

Jindong Tian, Yifei Ding, Ronghui Xu, Hao Miao, Chenjuan Guo, Bin Yang

机构 * East China Normal University(华东师范大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出ARROW方法,通过多区间预测模型和强化学习调度器,解决全球天气预报中空间多尺度依赖和rollout策略平衡问题,实现最先进的预测性能。

Comments 25 pages, 16 figures, ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06662 2026-04-01 cs.LG stat.ML

The Effect of Attention Head Count on Transformer Approximation

注意力头数对变换器近似效果的影响

Penghao Yu, Haotian Jiang, Zeyu Bao, Ruoxi Yu, Qianxiao Li

AI总结 本文研究了变换器中注意力头数对近似性质的影响,推导了参数复杂度的上下界,并通过实验验证了理论结果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13266 2026-04-01 cs.CL cs.AI

QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation

QuestA: 通过问题增强扩展大语言模型的推理能力

Jiazheng Li, Hongzhou Lin, Hong Lu, Kaiyue Wen, Zaiwen Yang, Jiaxuan Gao, Yi Wu, Jingzhao Zhang

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Amazon(亚马逊) Stanford University(斯坦福大学)

AI总结 QuestA通过问题增强策略在训练中引入部分解以降低问题难度,提升大语言模型在数学推理任务中的推理能力,取得新的SOTA结果。

Comments 25 pages, 18 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28651 2026-03-31 cs.AI

Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning

不是搜索,而是扫描:在面向学术论文推理的扫描任务上基准测试大语言模型

Rongjin Li, Zichen Tang, Xianghe Wang, Xinyi Hu, Zhengyu Wang, Zhengyu Lu, Yiling Huang, Jiayuan Chen, Weisheng Tan, Jiacheng Liu, Zhongjun Yang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出ScholScan基准,通过扫描式任务评估大语言模型在学术论文推理中的能力,发现检索增强生成方法在扫描任务上无显著提升,揭示了当前模型在该任务上的系统性缺陷。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07732 2026-03-31 cs.RO cs.AI cs.CL cs.CV cs.LG

ViPRA: Video Prediction for Robot Actions

ViPRA:用于机器人动作的视频预测

Sandeep Routray, Hengkai Pan, Unnat Jain, Shikhar Bahl, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Skild AI University of California, Irvine(加州大学尔湾分校)

AI总结 ViPRA通过预训练和微调框架,从无标注视频中学习连续机器人控制,利用视频语言模型预测视觉观察和运动中心潜在动作,支持跨机器人形态的泛化和高频率连续控制。

Comments In ICLR 2026. Website: https://vipra-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01349 2026-03-31 cs.LG stat.ML

To Augment or Not to Augment? Diagnosing Distributional Symmetry Breaking

增强还是不增强?诊断分布对称性破坏

Hannah Lawrence, Elyssa Hofgard, Vasco Portilheiro, Yuxuan Chen, Tess Smidt, Robin Walters

机构 * MIT(麻省理工学院) University College London(伦敦大学学院) Northeastern University(东北大学)

AI总结 本文提出了一种评估数据集对称性破坏的指标,揭示了点云数据集中的严重偏见问题,并展示了对称性破坏对模型性能的影响。

Comments Published as a conference paper at ICLR 2026. A short version of this paper appeared at the ICLR AI4Mat workshop in April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28603 2026-03-31 cs.CV

ELViS: Efficient Visual Similarity from Local Descriptors that Generalizes Across Domains

ELViS: 从局部描述符高效获取视觉相似性并跨领域泛化

Pavel Suma, Giorgos Kordopatis-Zilos, Yannis Kalantidis, Giorgos Tolias

机构 * VRG, FEE, Czech Technical University in Prague(捷克理工大学,电气工程学院,VRG实验室) NAVER LABS Europe

AI总结 ELViS通过在相似性空间而非表示空间中操作,利用局部描述符对应关系和最优传输步骤,实现跨领域泛化,提升检索性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28360 2026-03-31 cs.AI

CoE: Collaborative Entropy for Uncertainty Quantification in Agentic Multi-LLM Systems

CoE:协作熵用于代理多语言模型系统中的不确定性量化

Kangkang Sun, Jun Wu, Jianhua Li, Minyi Guo, Xiuzhen Che, Jianwei Huang

AI总结 本文提出CoE,一种用于多语言模型协作中语义不确定性的信息理论度量,通过结合模型内语义熵和模型间与集均值的差异,提供更准确的不确定性估计,实验表明其在TriviaQA和SQuAD上优于传统基线。

Comments 18 pages, 7 figures, has already published in ICLR workshop "Agentic AI in the Wild: From Hallucinations to Reliable Autonomy"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28116 2026-03-31 cs.RO cs.CV

$AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning

$AutoDrive\text{-}P^3$:通过强化微调实现感知-预测-规划统一链式推理

Yuqi Ye, Zijian Zhang, Junhong Lin, Shangkun Sun, Changhao Peng, Wei Gao

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

AI总结 本文提出$AutoDrive\text{-}P^3$框架,通过结构化推理整合感知、预测和规划,引入$P^3\text{-}CoT$数据集和$P^3\text{-}GRPO$算法,实现端到端自动驾驶的高效决策与安全规划。

Comments Accepted at ICLR 2026 (International Conference on Learning Representations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28038 2026-03-31 cs.AI cs.LG

Beyond the Answer: Decoding the Behavior of LLMs as Scientific Reasoners

超越答案:解码LLM作为科学推理者的行为

Rohan Pandey, Eric Ye, Michael Li

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过定制遗传Pareto算法优化提示,研究提示对科学推理行为的影响,揭示模型特定的局部逻辑,并探讨其可迁移性和脆弱性。

Comments Accepted at the Post-AGI Science and Society Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27950 2026-03-31 cs.LG

Scaling Atomistic Protein Binder Design with Generative Pretraining and Test-Time Compute

基于生成预训练和测试时计算的原子级蛋白质结合物设计扩展

Kieran Didi, Zuobai Zhang, Guoqing Zhou, Danny Reidenbach, Zhonglin Cao, Sooyoung Cha, Tomas Geffner, Christian Dallago, Jian Tang, Michael M. Bronstein, Martin Steinegger, Emine Kucukbenli, Arash Vahdat, Karsten Kreis

机构 * NVIDIA(英伟达) University of Oxford(牛津大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔高等商学院) CIFAR AI Chair(CIFAR人工智能主席) AITHYRA School of Biological Sciences, Seoul National University(首尔大学生物科学学院) Interdisciplinary Program in Bioinformatics, Seoul National University(首尔大学生物信息学跨学科项目) Institute of Molecular Biology and Genetics, Seoul National University(首尔大学分子生物学与遗传学研究所) Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究所)

AI总结 本文提出Proteina-Complexa方法,结合生成模型与结构预测,实现高精度蛋白质结合物设计,优于现有生成和幻觉方法,同时扩展至小分子和酶设计。

Comments ICLR 2026 Oral Presentation. Project page: https://research.nvidia.com/labs/genair/proteina-complexa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27862 2026-03-31 cs.GR cs.AI cs.CV cs.LG

ImagenWorld: Stress-Testing Image Generation Models with Explainable Human Evaluation on Open-ended Real-World Tasks

ImagenWorld: 通过可解释的人类评估对图像生成模型进行压力测试,针对开放性现实任务

Samin Mahdizadeh Sani, Max Ku, Nima Jamali, Matina Mahdizadeh Sani, Paria Khoshtab, Wei-Chieh Sun, Parnian Fazel, Zhi Rui Tam, Thomas Chong, Edisy Kin Wai Chan, Donald Wai Tong Tsang, Chiao-Wei Hsu, Ting Wai Lam, Ho Yin Sam Ng, Chiafeng Chu, Chak-Wing Mak, Keming Wu, Hiu Tung Wong, Yik Chun Ho, Chi Ruan, Zhuofeng Li, I-Sheng Fang, Shih-Ying Yeh, Ho Kei Cheng, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) G-G-G Comfy Org University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent(独立研究者)

AI总结 ImagenWorld通过3600个条件集评估14个模型,揭示编辑任务比生成任务更难,艺术和照片实感领域表现优异,但符号和文本密集领域表现较差,现代VLM指标在Kendall准确性上达0.79,但无法实现细粒度可解释性误差归因。

Comments Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22300 2026-03-31 cs.LG cs.AI

Scaling Attention via Feature Sparsity

通过特征稀疏性扩展注意力机制

Yan Xie, Tiansheng Wen, Tangda Huang, Bo Chen, Chenyu You, Stefanie Jegelka, Yifei Wang

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) Stony Brook University(石溪大学) TUM(慕尼黑工业大学) MIT(麻省理工学院) Amazon AGI SF Lab(亚马逊AGI旧金山实验室)

AI总结 本文提出Sparse Feature Attention (SFA),通过特征稀疏性降低注意力计算成本,提升处理超长上下文的能力,实验表明其在速度和资源消耗上优于现有方法。

Comments 26 pages, 11 figures; Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18482 2026-03-31 physics.comp-ph cond-mat.stat-mech cs.LG stat.ML

Boltzmann Generators for Condensed Matter via Riemannian Flow Matching

基于黎曼流匹配的凝聚态物质玻尔兹曼生成器

Emil Hoffmann, Maximilian Schebek, Leon Klein, Frank Noé, Jutta Rogal

机构 * Freie Universität Berlin(柏林自由大学) Microsoft Research(微软研究院) Flatiron Institute(熨斗研究所)

AI总结 本文提出利用黎曼流匹配将周期性特征融入连续归一化流,实现高效准确的凝聚相系统平衡分布采样,验证了在单原子冰中训练大规模系统并获得高精度自由能估计的能力。

Comments Published as a workshop paper at AI4MAT, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03904 2026-03-31 cs.LG

LLM as an Algorithmist: Enhancing Anomaly Detectors via Programmatic Synthesis

LLM作为算法家:通过程序合成增强异常检测器

Hangting Ye, Jinmeng Li, He Zhao, Mingchen Zhuge, Dandan Guo, Yi Chang, Hongyuan Zha

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) CUHK-Shenzhen(香港中文大学(深圳)) Department of DSAI, Monash University(莫纳什大学数据科学与人工智能系) KAUST(阿卜杜拉国王科技大学) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)

AI总结 本文提出LLM-DAS框架,将LLM从数据处理者转变为算法家,通过程序合成生成对抗性异常,提升检测器鲁棒性。

Comments Accepted by the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16952 2026-03-31 cs.CL cs.AI

AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation

AirQA:一个用于人工智能研究的综合性问答数据集,具有实例级评估

Tiancheng Huang, Ruisheng Cao, Yuxin Zhang, Zhangyi Kang, Zijian Wang, Chenrun Wang, Yijie Luo, Hang Zheng, Lirong Qian, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Shanghai Innovation Institution(上海创新研究院) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室)

AI总结 本文提出AirQA数据集,包含13956篇AI论文和1246个问题,支持多任务、多模态和实例级评估,并提出ExTrActor框架提升小模型多轮工具使用能力。

Comments 29 page, 6 figures, 17 tables, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03417 2026-03-31 cs.LG

Initialization Schemes for Kolmogorov-Arnold Networks: An Empirical Study

Kolmogorov-Arnold网络的初始化方案:一项实证研究

Spyros Rigas, Dhruv Verma, Georgios Alexandridis, Yixuan Wang

机构 * National and Kapodistrian University of Athens(雅典大学) California Institute of Technology(加州理工学院)

AI总结 本文研究了基于样条的KANs初始化方案,提出两种理论驱动方法和一个可调幂律家族,通过大规模网格搜索、PDE基准和Feynman数据集评估,发现幂律初始化在多种任务和架构中表现最佳。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02343 2026-03-31 cs.LG cs.AI

MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models

MicroMix:基于微缩格式的高效混合精度量化用于大语言模型

Wenyuan Liu, Haoqian Meng, Yilun Luo, Yafei Zhao, Peng Zhang, Xindian Ma

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

AI总结 MicroMix通过引入微缩格式实现大语言模型的高效混合精度量化,平衡精度与效率,实现接近FP16的性能,且在多个任务中保持无损准确性。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05207 2026-03-31 cs.CV

Follow-Your-Motion: Video Motion Transfer via Efficient Spatial-Temporal Decoupled Finetuning

跟随你的动作:通过高效的时空解耦微调实现视频动作迁移

Yue Ma, Yulong Liu, Qiyuan Zhu, Ayden Yang, Kunyu Feng, Xinhua Zhang, Zexuan Yan, Zhifeng Li, Sirui Han, Chenyang Qi, Qifeng Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) XIntelligence Technology Co., Limited(星云科技股份有限公司) SJTU(上海交通大学)

AI总结 本文提出Follow-Your-Motion框架,通过高效的时空解耦微调方法,解决视频扩散变换器在动作迁移中的不一致性和效率问题,并引入MotionBench基准进行验证。

Comments Accepted by ICLR 2026, project page: https://follow-your-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02368 2026-03-31 cs.IR

NextQuill: Causal Preference Modeling for Enhancing LLM Personalization

NextQuill: 基于因果偏好建模的增强大语言模型个性化

Xiaoyan Zhao, Juntao You, Yang Zhang, Wenjie Wang, Hong Cheng, Fuli Feng, See-Kiong Ng, Tat-Seng Chua

AI总结 NextQuill通过因果偏好建模方法,改进大语言模型的个性化对齐,通过区分模型预测和训练数据中的真实偏好影响,提升个性化效果。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11349 2026-03-31 cs.LG nlin.CD physics.comp-ph

Context parroting: A simple but tough-to-beat baseline for foundation models in scientific machine learning

上下文鹦鹉:一种简单但难以击败的基础模型基准,用于科学机器学习中的基础模型

Yuanzhao Zhang, William Gilpin

机构 * Santa Fe Institute(圣塔菲研究所) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文指出基础模型常通过简单鹦鹉策略预测,而非鹦鹉时易出现收敛到均值等失败模式。简单鹦鹉模型在低维混沌、湍流等动态系统预测中表现优于主流模型,且计算成本低。

Comments International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11035 2026-03-31 cs.LG

Deep Latent Variable Model based Vertical Federated Learning with Flexible Alignment and Labeling Scenarios

基于深度潜在变量模型的垂直联邦学习:支持灵活对齐和标注场景

Kihun Hong, Sejun Park, Ganguk Hwang

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

AI总结 本文提出一种深度潜在变量模型,解决垂直联邦学习中数据对齐和标注的灵活性问题,通过统一框架在不同缺失机制下提升性能,实验显示在160种情况下优于所有基线方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27414 2026-03-31 math.ST cs.AI stat.TH

Multiple-Prediction-Powered Inference

多预测驱动推断

Charlie Cowen-Breen, Alekh Agarwal, Stephen Bates, William W. Cohen, Jacob Eisenstein, Amir Globerson, Adam Fisch

机构 * Massachusetts Institute of Technology(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind)

AI总结 本文提出多预测驱动推断框架,通过优化分配资源于不同数据源,实现统计高效估计。理论证明其最小最大最优性、有限样本性能和渐近正态性,并在三个大语言模型评估场景中验证了其优于现有基线的估计误差。

Comments ICLR 2026, 45 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27113 2026-03-31 cs.LG cond-mat.mtrl-sci stat.ML

Hierarchy-Guided Topology Latent Flow for Molecular Graph Generation

层次引导的拓扑潜在流用于分子图生成

Urvi Awasthi, Alexander Arjun Lobo, Leonid Zhukov

机构 * BCG X AI Science Institute(BCG X AI科学研究所)

AI总结 本文提出HLTF模型,通过层次化潜在拓扑流生成具有3D坐标的分子键图,提升拓扑可行性,实验表明在QM9和GEOM-DRUGS数据集上均取得显著效果。

Comments 22 pages, 2 figures, 6 tables. Accepted to ICLR 2026 AI4Mat Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27083 2026-03-31 cs.CV

LightCtrl: Training-free Controllable Video Relighting

LightCtrl: 不需要训练的可控视频重照明

Yizuo Peng, Xuelin Chen, Kai Zhang, Xiaodong Cun

机构 * Tsinghua University(清华大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) Adobe Research(Adobe研究院)

AI总结 LightCtrl是首个无需训练的可控视频重照明方法,通过用户提供的光照轨迹实现对视频光照的显式控制,结合预训练扩散模型提升时间一致性,实验显示其在光照变化多样性和可控性上优于基线方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26996 2026-03-31 cs.AI cs.CL cs.LG cs.PL

FormalProofBench: Can Models Write Graduate Level Math Proofs That Are Formally Verified?

FormalProofBench:模型能否写出经过形式验证的研究生级数学证明?

Nikil Ravi, Kexing Ying, Vasilii Nesterov, Rayan Krishnan, Elif Uskuplu, Bingyu Xia, Janitha Aswedige, Langston Nashold

机构 * Vals AI École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Moscow Institute of Physics and Technology(莫斯科物理技术学院) Indiana University, Bloomington(印第安纳大学布卢明顿分校) Independent Researcher(独立研究员)

AI总结 FormalProofBench评估AI能否生成经过形式验证的研究生级数学证明,通过自然语言问题与Lean 4形式陈述配对,测试模型生成Lean证明的能力,结果显示最佳模型准确率为33.5%。

Comments Accepted at ICLR 2026 Workshop: VerifAI-2: The Second Workshop on AI Verification in the Wild. Live leaderboard hosted here: https://www.vals.ai/benchmarks/proof_bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24143 2026-03-31 cs.CL

Activation Steering for Masked Diffusion Language Models

激活引导用于掩码扩散语言模型

Adi Shnaidman, Erin Feiglin, Osher Yaari, Efrat Mentel, Amit Levi, Raz Lapid

机构 * Deepkeep Technion—Israel Institute of Technology(以色列理工学院)

AI总结 本文提出激活引导方法,通过提取对比提示集的低维方向,实现对MDLMs推理过程的控制,展示了在安全拒绝任务中的有效性及跨语言迁移能力。

Comments Accepted at ReALM-GEN @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏