arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 154 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 154 篇

2601.21164 2026-05-12 cs.AI 93%

Concise Geometric Description as a Bridge: Unleashing the Potential of LLM for Plane Geometry Problem Solving

简洁几何描述作为桥梁:释放LLM在平面几何问题求解中的潜力

Jingyun Wang, Dian Li, Xiaohan Wang, Gang Liu, Jiahong Yan, Guoliang Kang

机构 * Beihang University(北航大学)

专题命中 推理与问题求解 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出通过训练多模态大语言模型解释器生成几何描述,再利用通用LLM进行推理,以解决平面几何问题。通过设计CDL匹配奖励机制,提升生成几何描述的效率,并在新构建的Formalgeo7k-Rec-CoT数据集上验证了方法的有效性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14434 2026-05-12 cs.LG cs.AI cs.CL cs.NE 93%

LLM-FE: Automated Feature Engineering for Tabular Data with LLMs as Evolutionary Optimizers

LLM-FE:基于LLM的进化优化器用于表格数据的自动化特征工程

Nikhil Abhyankar, Parshin Shojaee, Chandan K. Reddy

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出LLM-FE框架,结合LLM的领域知识和推理能力,通过进化搜索自动发现表格学习任务中的有效特征,优于现有方法。

Comments Accepted in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01015 2026-05-12 cs.CL cs.CY 92%

Large Language Models as Students Who Think Aloud: Overly Coherent, Verbose, and Confident

大型语言模型作为思考出声的学生:过于连贯、啰嗦且自信

Conrad Borchers, Jill-Jênn Vie, Roger Azevedo

机构 * Carnegie Mellon University(卡内基梅隆大学) Soda Team, Inria Saclay(Soda团队,法国国家科学研究中心萨克雷分部) University of Central Florida(中央佛罗里达大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文评估LLM在模拟学生思考过程中的表现,发现其推理过于连贯、啰嗦且缺乏变异性,揭示了使用生成式AI设计适应性系统时的认知局限。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09678 2026-05-12 cs.AI 92%

Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities

荒诞世界:一种简单却强大的方法,用于将现实世界扭曲以探测LLM推理能力

Ryan Albright, Golam Md Muktadir, Zarif Ikram, S M Jubaer, Mehrab Hossain, Dianbo Liu

机构 * The Nueva School(新维学校) University of Southern California(南加州大学) Notre Dame College(诺特大学) Arizona State University(亚利桑那州立大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出Absurd World框架,通过扭曲现实世界来测试LLM的推理能力,验证其在简单逻辑任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09260 2026-05-12 cs.NI 92%

Chain-of-Thought Reasoning Enhances In-Context Learning for LLM-Based Mobile Traffic Prediction

基于链式推理的LLM移动交通预测增强情境学习

MohammadMahdi Ghadaksaz, Mohammad Farzanullah, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种基于链式推理的LLM移动交通预测框架,通过离线阶段生成结构化推理示例和在线阶段实时预测,提升交通预测精度,实验表明其在MAE、RMSE和R2-score上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09121 2026-05-12 cs.LG cs.AI cs.CL cs.IT math.IT 92%

A Communication-Theoretic Framework for LLM Agents: Cost-Aware Adaptive Reliability

基于LLM代理的通信理论框架:成本感知的自适应可靠性

Hamed Omidvar, Vahideh Akhlaghi

机构 * INTELLERCE LLC(INTELLERCE公司)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于通信理论的LLM代理框架,将可靠性技术统一为六种经典运算,通过成本感知路由器实现任务级优化,展示在不同任务中动态分配资源的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10211 2026-05-12 cs.CL cs.AI cs.IR 92%

To Redact, or not to Redact? A Local LLM Approach to Deliberative Process Privilege Classification

应标注还是不应标注?一种局部LLM方法用于审议过程特权分类

Maik Larooij, David Graus

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种局部LLM方法,用于自动分类FOIA豁免5项审议过程特权的敏感性,通过结合链式思维提示和基于错误的少样本提示,提升召回率和F2分数,接近商用模型性能。

Comments Accepted to The First Workshop on Artificial Intelligence & Open Government at the 21st International Conference on Artificial Intelligence and Law (ICAIL), June 8, 2026, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09346 2026-05-12 cs.CL cs.AI 92%

RuPLaR : Efficient Latent Compression of LLM Reasoning Chains with Rule-Based Priors From Multi-Step to One-Step

RuPLaR : 通过基于规则的先验概率实现LLM推理链的高效潜在压缩

Xiaocheng Luo, Kang Wang, Zaifu Zhan, Yuechi Zhou, Xiangyu Duan

机构 * School of Computer Science and Technology(计算机科学与技术学院) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RuPLaR框架,通过基于规则的先验概率指导LLM生成单阶段潜在推理令牌,提升推理效率与准确性,实验表明其比现有方法提升11.1%的准确率且消耗更少token。

Comments 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09794 2026-05-12 cs.IR 91%

LLM Agents Enable User-Governed Personalization Beyond Platform Boundaries

LLM代理使用户主导的个性化超越平台边界

Jiacheng Lin, Kun Qian, Arvind Srinivasan, Tian Wang, Fang Han, Changran Hu, Junze Liu, Ziyi Wang, Hanwen Xu, Mengmeng Xue, Shuo Yang, Hansi Zeng, Simon Sinong Zhan, Kai Zhong, Weiqi Zhang, Dakuo Wang, Tianhao Wang, Zhiyuan Li

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出用户主导的个性化方法,利用LLM代理整合跨平台和离线数据,突破平台限制,实现更全面的个性化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08904 2026-05-12 cs.AI 91%

OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces

OPT-BENCH:评估大搜索空间中LLM代理的迭代自我优化

Xiaozhe Li, Jixuan Chen, Xinyu Fang, Shengyuan Ding, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OPT-BENCH通过结合20个机器学习任务和10个经典NP难问题,评估LLM代理在大规模搜索空间中通过内在自我反思而非机械工具应用进行适应的能力,揭示更强模型在反馈利用上的优势及基础能力的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09879 2026-05-12 cs.AI 90%

M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models

M2A:在大型语言模型中协同数学与代理推理

Junjian Wang, Xin Zhou, Qiran Xu, Kun Zhan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Li Auto Inc.(Li Auto公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出M2A框架,通过模型融合协同数学与代理推理,提升多任务学习下的推理稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14937 2026-05-12 cs.LG cs.CL 90%

LLM as Graph Kernel: Rethinking Message Passing on Text-Rich Graphs

LLM作为图核:重新思考文本丰富图上的消息传递

Ying Zhang, Hang Yu, Haipeng Zhang, Peng Di

机构 * Ant Group(蚂蚁集团) ShanghaiTech University(上海科技大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出RAMP方法,将LLM作为图原生聚合算子,通过双表示方案实现文本丰富图的高效推理,解决传统方法信息瓶颈问题,提升图传播与深度文本推理的结合性能。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11198 2026-05-12 cs.CL cs.AI 90%

Temperature and Persona Shape LLM Agent Consensus With Minimal Accuracy Gains in Qualitative Coding

温度与人设塑造LLM代理共识:在定性编码中获得最小的准确性提升

Conrad Borchers, Bahar Shahrokhian, Francesco Balzan, Elham Tajik, Sreecharan Sankaranarayanan, Sebastian Simon

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了多代理系统中温度与人设对共识构建和编码准确性的影响,发现多人设延迟共识但未显著提升准确性,单代理表现更优。

Comments Accepted as full paper to the 19th International Conference on Educational Data Mining (EDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26326 2026-05-12 cs.LG cs.CL stat.ML 90%

Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control

通过精确熵曲线控制解决LLM RL中的性能饱和问题

Bolian Li, Yifan Wang, Yi Ding, Anamika Lochab, Ananth Grama, Ruqi Zhang

机构 * Purdue University(普渡大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Entrocraft方法,通过偏差优势分布实现用户定制的熵调度,解决LLM RL中的性能饱和问题,提升泛化能力、输出多样性及长期训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14345 2026-05-12 cs.LG cs.AI stat.ML 90%

PAC-MCTS: Bias-Aware Pruning for Robust LLM-Guided Search and Planning

PAC-MCTS:具有偏见意识的剪枝用于稳健的LLM引导搜索与规划

Tianhao Qian

机构 * School of Mathematics, Southeast University(东南大学数学学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PAC-MCTS框架,通过动态调整置信区间来应对LLM引导下的偏见问题,实验表明其在Blocksworld和ALFWorld任务中显著提升了鲁棒性和搜索效率。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08326 2026-05-12 cs.LG cs.AI 90%

LLM Advertisement based on Neuron Auctions

基于神经拍卖的大型语言模型广告

Peiran Yun, Wenxin Xu, Jiayuan Liu, Yihang Zhang, Liang Zeng, Lingkai Kong, Tonghan Wang

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经拍卖机制,通过在LLM内部表示中进行拍卖,解决广告嵌入中的收益、平台收入与用户体验平衡问题,实现策略-proof且优化平台收益。

Comments 17 pages, 9 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08694 2026-05-12 cs.SE 90%

A Learning Method for Symbolic Systems Using Large Language Models

基于大语言模型的符号系统学习方法

Jian Fang, Yixun Yao, Yingfei Xiong

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出LLM2Ltac,利用大语言模型作为智能合成器从数据中提取纯符号战术,提升符号证明器的自动证明能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19741 2026-05-12 cs.RO cs.AI 90%

ROS-LLM: A ROS framework for embodied AI with task feedback and structured reasoning

ROS-LLM:一个用于具身AI的ROS框架,具有任务反馈和结构化推理

Christopher E. Mower, Yuhui Wan, Hongzhan Yu, Antoine Grosnit, Jonas Gonzalez-Billandon, Matthieu Zimmer, Jinlong Wang, Xinyu Zhang, Yao Zhao, Anbang Zhai, Puze Liu, Daniel Palenicek, Davide Tateo, Cesar Cadena, Marco Hutter, Jan Peters, Guangjian Tian, Yuzheng Zhuang, Kun Shao, Xingyue Quan, Jianye Hao, Jun Wang, Haitham Bou-Ammar

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Leeds(利兹大学) Technical University of Darmstadt(达姆施塔特技术大学) East China Normal University(华东师范大学) Huawei Technologies(华为技术有限公司) ETH Zurich(苏黎世联邦理工学院) University College London(伦敦大学学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于ROS的框架,允许非专家通过自然语言提示和上下文信息编程机器人,结合大语言模型实现任务描述和行为模式控制,实验验证了其在多样化场景中的鲁棒性和扩展性。

Comments This document contains 26 pages and 13 figures

Journal ref Nature Machine Intelligence 8, 313-325 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02950 2026-05-12 cs.AI 90%

Batch-of-Thought: Cross-Instance Learning for Enhanced LLM Reasoning

批量思考:用于增强大语言模型推理的跨实例学习

Xuan Yang, Furong Jia, Roy Xie, Xiong Xi, Hengwei Bian, Jian Li, Monica Agrawal

机构 * Duke University(杜克大学) ByteDance Inc.(字节跳动公司)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Batch-of-Thought方法,通过联合处理相关查询实现跨实例学习,提升LLM推理准确性和效率,实验显示在多个基准测试中显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06241 2026-05-12 cs.CL 90%

Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning

重新思考LLM推理中的强化学习:不是能力学习,而是稀疏策略选择

Ömer Faruk Akgül, Rajgopal Kannan, Willie Neiswanger, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL ReasonMaxxer

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过分析发现强化学习在LLM推理中主要通过稀疏修正提升性能,提出无需强化学习的ReasonMaxxer方法,仅需少量基础模型推理即可达到与强化学习相当的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09496 2026-05-12 cs.CL cs.LG 90%

Beyond Language: Format-Agnostic Reasoning Subspaces in Large Language Models

超越语言:大型语言模型中的格式无关推理子空间

Aojie Yuan, Zhiyuan Su

机构 * University of Southern California(南加州大学) Duke University(杜克大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 研究揭示大型语言模型中存在格式无关推理子空间(FARS),通过TriForm基准测试发现,FARS能增强概念结构并抑制形式信息,且在不同架构中表现一致,支持柏拉图表示假设。

Comments Preprint. 13 pages, 13 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09008 2026-05-12 cs.LG cs.CL 90%

Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models

相对动能效用用于推理感知的结构剪枝在大语言模型中

Tianhao Qian

机构 * School of Mathematics, Southeast University(东南大学数学学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文提出相对动能效用框架,通过连续动能积分提升结构剪枝效果,实验证明在高稀疏度下提升模型性能,尤其在GSM8K数据集上表现优异。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04289 2026-05-12 cs.LG q-bio.NC 89%

Relational reasoning and inductive bias in transformers and large language models

变换器中的关系推理与归纳偏置

Jesse Geerts, Andrew Liu, Stephanie Chan, Claudia Clopath, Kimberly Stachenfeld

机构 * Imperial College London(帝国理工学院伦敦分校) Google(谷歌) DeepMind(深度Mind) Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本文研究了变换器和大语言模型在关系推理中的表现,比较了基于权重学习和上下文学习的机制,发现基于权重学习的模型能进行传递推理,而基于上下文学习的模型则依赖训练数据进行传递推理,预训练可使上下文学习模型更接近权重学习模型。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10106 2026-05-12 cs.CV cs.AI 89%

ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

ViSRA:一种基于视频的空间推理代理用于多模态大语言模型

Tingshu Mou, Jiabo He, Renying Wang, Ce Liu, Hao Yang, Tiehua Zhang, Jingjing Chen, Xingjun Ma

机构 * Fudan University(复旦大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) Tongji University(同济大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 ViSRA从无训练视角出发,提出一种人类对齐的视频空间推理代理框架,通过显式空间信息探索多模态大语言模型的空间推理机制,实现模块化和可扩展的空间推理,提升3D理解能力并减少训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22508 2026-05-12 cs.AI 89%

Metacognitive Behavioral Tuning of Large Language Models for Multi-Hop Question Answering

元认知行为调节用于多跳问答的大型语言模型

Ik-hwan Kim, Hyeongrok Han, Mingi Jung, Sangwon Yu, Jinseok Hong, Sang Hun Kim, Yoonyoung Choi, Sungroh Yoon

机构 * Dept. of ECE Seoul Nat’l Univ.(首尔国立大学电子工程系) AI Center Samsung Elec. Korea(三星电子韩国人工智能中心) AIIS, ASRI, INMC, ISRC, Interdisc. Prog. in AI Seoul Nat’l Univ.(首尔国立大学人工智能研究所、高级研究机构、人工智能中心、国际研究所以及人工智能跨学科研究计划)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出元认知行为调节(MBT)框架,通过五阶段结构提升多跳问答任务的准确性和效率,减少冗余并保持推理轨迹稳定。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09042 2026-05-12 cs.CL 89%

Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity

评估大语言模型的语用推理:来自量级多样性的证据

Ye-eun Cho

机构 * Sungkyunkwan University(成均馆大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究通过量级多样性评估大语言模型的语用推理能力,发现不同模型和任务结构下语用行为差异显著,评价方法无法单一确定模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08243 2026-05-12 cs.CL 89%

Self-Debias: Self-correcting for Debiasing Large Language Models

Self-Debias:为大型语言模型引入自我纠正的去偏方法

Xuan Feng, Shuai Zhao, Luwei Xiao, Tianlong Gu, Bo An

机构 * Jinan University, China(济南大学,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 本文提出Self-Debias框架,通过资源再分配策略使模型具备自我纠正能力,以解决去偏过程中持续的偏见传播问题,无需外部干预即可提升去偏效果。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08592 2026-05-12 cs.CL cs.AI cs.LG 89%

Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models

多样性越低,安全性越差:大规模语言模型测试时缩放的间接但广泛的风险

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * Bellini College of AI, Cybersecurity, and Computing(人工智能、网络安全与计算学院) University of South Florida, Tampa, Florida, USA(佛罗里达州塔帕斯大学) University of California, Davis, California, USA(加州大学戴维斯分校)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示了测试时缩放(TTS)中多样性降低导致安全风险增加的问题,提出RefDiv协议用于检测TTS管道中的漏洞,并发现现有安全防护措施对此类风险效果有限。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10901 2026-05-12 cs.LG 89%

Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers

超越红队测试:LLM防护分类器的正式保证

Nikita Kezins, Urbas Ekka, Pascal Berrang, Luca Arnaboldi

机构 * Delft University of Technology(代尔夫特理工大学) University of Birmingham(伯明翰大学) Zeroth Research(Zeroth研究)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.LG

AI总结 本文提出通过将验证空间从离散输入空间转移到分类器预激活空间,定义有害区域为包含已知有害提示表示的凸形区域,从而为LLM防护分类器提供正式保证,揭示了不同模型在安全性和鲁棒性上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07027 2026-05-12 cs.AI cs.CL cs.LG cs.NE physics.chem-ph 88%

LLM-Augmented Chemical Synthesis and Design Decision Programs

基于大语言模型的化学合成与设计决策程序

Haorui Wang, Jeff Guo, Lingkai Kong, Rampi Ramprasad, Philippe Schwaller, Yuanqi Du, Chao Zhang

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑校区) National Centre of Competence in Research (NCCR) Catalysis(催化领域竞争力研究国立中心) Harvard University(哈佛大学) Cornell University(康奈尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用大语言模型增强的 retrosynthesis 规划方法,通过高效编码反应路径和新的路线搜索策略,提升多步合成规划与可合成分子设计能力。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏