arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 5820 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 878 篇

2602.09472 2026-07-30 cs.RO cs.CV 版本更新 88%

LLM-Grounded Dynamic Task Planning with Hierarchical Temporal Logic for Human-Aware Multi-Robot Handover

基于分层时序逻辑的LLM引导动态任务规划用于人感知多机器人协作

Shuyuan Hu, Tao Lin, Kai Ye, Tianwei Zhang

机构 * The Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究院) Harbin Institute of Technology(哈尔滨工业大学) The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)) Tsinghua Shenzhen International Graduate School(清华大学深圳国际 Graduate School)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出基于分层时序逻辑的神经符号框架,实现动态任务规划以提升多机器人协作的效率和鲁棒性。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04019 2026-07-24 cs.LG cs.AI cs.CL 版本更新 88%

Simple Policy Gradients for Reasoning with Diffusion Language Models

为扩散语言模型进行推理的简单策略梯度

Anthony Zhan

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);post-training(abstract)

AI总结 本文提出 AGRPO 算法,通过优化 dLLM 的去噪步骤提升推理性能,实现多个任务上的显著增益。

Comments 19 pages. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06940 2026-06-11 eess.AS cs.SD 版本更新 88%

Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models

超越语义主导:音频语言模型中的认知情感推理与共情响应对齐

Zhixian Zhao, Shuiyuan Wang, Wenjie Tian, Jingbin Hu, Ziyu Zhang, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract)

AI总结 提出CogAudio-LLM框架,通过构建LIME-440K数据集实现声学-语义解耦,设计EIPS思维链机制进行心理推理,并采用DR-SAPO优化策略平衡逻辑严谨性与共情质量,解决音频语言模型中的语义主导和情感认知不足问题。

Comments Accepted by Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17433 2026-06-08 cs.CL cs.AI cs.LG 版本更新 88%

Self-Consistency from Only Two Samples: CoT-PoT Ensembling for Efficient LLM Reasoning

仅需两个样本的自一致性:CoT-PoT集成实现高效LLM推理

Raman Saparkhan, Majd Hawasly, Md Rizwan Parvez, Mohammad Raza

机构 * Carnegie Mellon University Qatar(卡内基梅隆大学(卡塔尔)) Qatar Computing Research Institute(卡塔尔计算研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种混合集成方法,结合思维链与程序化推理两种模式,通过仅需两个样本即可实现自一致性,将采样量减少9.3倍,并在78.6%的任务上达到最优。

Comments 9 pages, 3 figures; accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14380 2026-06-08 cs.RO 版本更新 88%

CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks

CRAFT:利用基础模型自主教练强化学习以完成多机器人协调任务

Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

机构 * Department of Mechanical Engineering, University of California Berkeley(机械工程系,加州大学伯克利分校)

专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出CRAFT框架,利用大语言模型分解任务、生成奖励函数,并通过视觉语言模型优化,实现多机器人协调学习,在四足导航和双臂操作任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07943 2026-08-12 cs.CR cs.AI cs.CL 版本更新 88%

Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents

POISE:面向LLM智能体的位置感知不可检测技能注入攻击

Haochang Hao, Dehai Min, Zhifang Zhang, Yunbei Zhang, Miao Xu, Yingqiang Ge, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) University of Queensland(昆士兰大学) Tulane University(路易斯安那州立大学) Rutgers University(罗格斯大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出POISE攻击方法,通过位置感知将恶意指令压缩为单一良性指令嵌入技能正文,在保持隐蔽性的同时实现89.3%的攻击成功率,比随机位置基线高28.0个百分点。

Comments Title changed from "POISE: Position-Aware Undetectable Skill Injection on LLM Agents" to "Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents"; the manuscript, figures, appendices, and reproducibility details have been updated. 15 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10813 2026-08-18 cs.AI cs.GT 版本更新 88%

The Fragility of Strategic Thinking in Large Language Models

大型语言模型战略思维的脆弱性

Enric Junque de Fortuny, Veronica Roberta Cappelli

机构 * IESE(IESE商学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究开发框架拆解博弈中信念形成等环节,发现前沿LLMs的战略思维存在但具脆弱性,随复杂性提升会出现逻辑转变与启发式规则,警示其作为战略主体应用需谨慎。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04997 2026-08-14 cs.AI cs.MA 版本更新 88%

Foam-Agent: A Large Language Model-Based Multi-Agent Framework for Automating Computational Fluid Dynamics Workflows

Foam-Agent:迈向自动化智能CFD工作流程

Ling Yue, Nithin Somasekharan, Tingwen Zhang, Yadi Cao, Zhangze Chen, Shimin Di, Shaowu Pan

机构 * Department of Computer Science, Rensselaer Polytechnic Institute(里士满理工学院计算机科学系) Department of Mechanical, Aerospace, and Nuclear Engineering, Rensselaer Polytechnic Institute(里士满理工学院机械、航空航天与核工程系) Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) College of Education, Zhejiang Normal University(浙江师范大学教育学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 Foam-Agent通过多智能体框架和大型语言模型,实现自动化CFD工作流程,显著提升模拟效率和成功率。

Comments 34 pages, 9 figures, 9 tables

Journal ref Computer Methods in Applied Mechanics and Engineering, Vol. 461, 119271 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17045 2026-08-14 cs.CL 版本更新 88%

Large Language Models Persuade Without Planning Theory of Mind

大语言模型无需规划即可说服理论之心理论

Jared Moore, Rasmus Overmark, Ned Cooper, Beba Cibralic, Nick Haber, Cameron R. Jones

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 大语言模型通过战略性揭示信息说服目标,无需显式理论之心推理,实验显示其在说服任务中表现优于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16481 2026-08-12 cs.AI 版本更新 88%

Leveraging Large Language Models for Causal Discovery: a Constraint-based, Argumentation-driven Approach

利用大语言模型进行因果发现:一种基于约束和论证的方法

Zihao Li, Fabrizio Russo

机构 * Department of Computing(计算系) Imperial College London(帝国理工学院伦敦分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出利用大语言模型作为不完美的专家,结合语义结构先验和条件独立性证据,实现因果发现的先进方法。

Comments Accepted at UAI 2026. 37 pages, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23290 2026-08-11 cs.AI 版本更新 88%

RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning

RareLens:通过对齐不同的大语言模型推理实现端到端罕见病护理

Xi Chen, Hongru Zhou, Shiyu Feng, Hanyu Zhou, Huahui Yi, Rongsheng Wang, Tiancheng He, Kun Wang, Pingping Liu, Qiankun Li, Sicheng Lin, Huiying Ou, Xiaohong Zheng, Tianying Zang, Zhuohang Wu, Leheng Jiang, Kexin Cao, Wenhan Zhang, ChengYi Li, Zhiyang Wang, Songlin Li, Benyou Wang, Ningbei Yin, Shaoting Zhang, Weili Fu, Jian Li, Kang Li

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对罕见病诊断难题,RareLens系统利用不同大语言模型推理的差异,通过四个协同模块实现全病程临床决策支持,在真实数据集和外部研究中表现出色,证明对齐模型推理是高不确定性临床决策的有效策略。

Comments 100 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09459 2026-08-11 cs.CL 版本更新 88%

From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models

从推理到代理:大型语言模型强化学习中的信用分配

Chenchen Zhang

机构 * Independent Researcher(独立研究员)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文探讨了大型语言模型强化学习中信用分配问题,总结了47种方法,并提出了可重用的资源,指出从推理到代理的转变使信用分配更加复杂,推动了新的方法发展。

Comments 50 pages, 4 figures. v3: expanded to a unified 69-paper corpus through July 31, 2026; adds restored-state identification results, blind coding of a 42-paper full-text subset, a source-located reporting audit, the CA-ID Card, and replay-fidelity analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03808 2026-08-06 cs.CV cs.LG 版本更新 88%

From Brute Force to Semantic Insight: Performance-Guided Data Transformation Design with LLMs

从暴力到语义洞察:基于LLM的性能引导数据转换设计

Usha Shrestha, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出了一种基于LLM的性能引导数据转换设计方法,通过经验反馈实现闭环优化,减少穷举搜索需求,提升代码生成的准确性与任务对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21947 2026-07-28 cs.CL 版本更新 88%

Algorithmic Blindness in Large Language Models: A Calibration Study of Performance Prediction

大语言模型是算法上盲目

Sohan Venkatesh, Ashish Mahendran Kurapath, Tejas Melkote

机构 * School of Computer Engineering, Manipal Institute of Technology, Bengaluru, India(马尼帕尔理工学院计算机工程学院,班加罗尔,印度)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究发现大语言模型在算法推理上存在系统性失败,主要贡献是揭示了算法盲目的本质,即声明性知识与校准过程预测之间的差距。

Comments Code available at https://github.com/sohv/algorithmic-blindness

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10002 2026-07-16 cs.AI 版本更新 88%

Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate

辩论动态与价值对齐在大语言模型辩论中

Pratik S. Sachdeva, Tom van Nuenen

机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20899 2026-07-10 cond-mat.mtrl-sci cs.AI 版本更新 88%

Predicting Scale-Up of Metal-Organic Framework Syntheses with Large Language Models

利用大语言模型预测金属有机框架合成的可扩展性

Peter Walther, Hongrui Sheng, Xinxin Liu, Bin Feng, Reid Coyle, Xinhua Yan, Kyle Smith, Harrison Kayal, Shyam Chand Pal, Zhiling Zheng

机构 * Department of Chemistry, Washington University(华盛顿大学化学系) Fudan University(复旦大学) Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) College of Chemistry and Materials Science, Fujian Normal University(福建师范大学化学与材料科学学院) Institute of Materials Science & Engineering, Washington University(华盛顿大学材料科学与工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出ESU-MOF数据集和正例未标记学习策略,通过大语言模型预测MOF合成的可扩展性,准确率达91.4%,助力工业级MOF发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23802 2026-07-09 cs.AI cs.CV 版本更新 88%

EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

EMO-R3:多模态大语言模型中用于情感推理的反射强化学习

Yiyang Fang, Wenke Huang, Pei Fu, Yihao Yang, Kehua Su, Zhenbo Luo, Jian Luan, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型情感推理难题,提出EMO-R3框架。引入结构化情感思维并设计反射情感奖励,经大量实验验证,该框架显著提升模型可解释性与情商,在多视觉情感理解基准测试中表现出色。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11575 2026-06-11 cs.AI 版本更新 88%

A Survey of Reasoning and Agentic Systems in Time Series with Large Language Models

时间序列中基于大语言模型的推理与智能体系统综述

Ching Chang, Yidan Shi, Defu Cao, Wei Yang, Jeehyun Hwang, Haixin Wang, Jiacheng Pang, Wei Wang, Yan Liu, Wen-Chih Peng, Tien-Fu Chen

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文定义时间序列推理问题,按推理拓扑分为直接、线性链和分支结构三类,结合传统分析、解释、因果推断和生成等目标,综述方法、系统、数据集和评估实践,并指导拓扑选择与部署权衡。

Comments Accepted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02937 2026-08-12 cs.LG cs.AI cs.CE 版本更新 88%

Proteo-R1: Reasoning Foundation Models for De Novo Protein Design

Proteo-R1:用于从头蛋白质设计的推理基础模型

Fang Wu, Weihao Xuan, Heli Qi, Hanqun Cao, Heng-Jui Chang, Zeqi Zhou, Haokai Zhao, Ma Jian, Carl Ma, Yu-Chi Cheng, Kuan Pang, Xiangru Tang, Zehong Wang, Guanlue Li, Hanchen Wang, Kejun Ying, Pan Lu, Chiho Im, Seungju Han, Peng Xia, Tinson Xu, Yinxi Li, Deyao Zhu, Pheng-Ann Heng, Naoto Yokoya, Masashi Sugiyama, Li Erran Li, Jure Leskovec, Yejin Choi

专题命中 推理与问题求解 :foundation model(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23333 2026-08-11 cs.LG cs.CL 版本更新 88%

Process Supervision of Confidence Margin for Calibrated LLM Reasoning

校准大语言模型推理的置信度边际过程监督

Liaoyaqi Wang, Chunsheng Zuo, William Jurayj, Benjamin Van Durme, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RLCM框架,通过增强的边际过程奖励优化正确性和置信度可靠性,提升模型校准性能并保持准确性,同时实现更高效的置信度加权聚合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27553 2026-08-04 cs.AI cs.CL econ.GN q-fin.EC 版本更新 88%

AI and Its Impact on Creativity and Diversity: An Empirical Study of LLM-Generated Product Ideas

使用大型语言模型进行创新中的创意生成

Christian Terwiesch, Lennart Meincke, Karan Girotra, Ethan Mollick, Gideon Nave, Karl T. Ulrich

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究对比人类与GPT-4生成的大学生适用低价新产品创意,发现AI生成创意平均购买意向更高、跻身前10%的概率是人类的7倍,但新颖性较低,少样本提示效果略优于零样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06716 2026-08-04 cs.AI cs.CL cs.CR 版本更新 88%

SIEVE: Selective Integrity Verification and Escalation for Defending LLM Agents against Indirect Prompt Injection

认知控制架构(CCA):一种用于鲁棒对齐AI代理的生命周期监督框架

Zhibo Liang, Tianze Hu, Zaiye Chen, Mingjie Tang

机构 * Sichuan University(四川大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出认知控制架构(CCA),通过全生命周期认知监督框架,有效应对复杂IPI攻击,实现安全、功能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04572 2026-07-22 cs.AI cs.LG 版本更新 88%

Context-Masked Truncated Reasoning Audits for Answer-Key Dependence in LLM Tutors

通过截断的思维链审计检测基于大语言模型的教育辅导中的答案驱动推理

Bonan Shen, Dingyan Shang, Youting Wang, Tao Ning, Bowen Liu

机构 * Independent Researcher(独立研究员) Northeastern University(东北大学) Syracuse University(Syracuse大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究基于大语言模型的教育辅导中,模型能否利用答案信息生成答案驱动的解释,用截断推理AUC评估法在三种辅导情境下评估,发现答案信息能提升模型表现,支持截断思维链审计用于诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14169 2026-07-21 cs.AI cs.LG 版本更新 88%

When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models

当经过验证的世界模型仍然失败时:大语言模型合成代码世界模型中的游戏充分性与预测准确性

Javier Aguilar Martín

机构 * AGILabs(AGILabs实验室)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型合成的代码世界模型,发现其虽预测准确率高,但在游戏中仍失败,存在验证与正确的差距,揭示危害规律,指出更多数据无法修复,相同机制在信念推理函数上重现,表明规划世界模型充分性应基于搜索分布或游戏衡量。

Comments 41 pages, 4 figures. Code and reproduction log: https://github.com/JaviMaligno/code-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11765 2026-07-21 cs.MA cs.AI cs.LG 版本更新 88%

OMAC: A Holistic Optimization Framework for LLM-Based Multi-Agent Collaboration

OMAC:一种面向基于大语言模型的多智能体协作的综合优化框架

Shijun Li, Hilaf Hasson, Joydeep Ghosh

机构 * Department of Electrical and Computer Engineering, The University of Texas at Austin, Austin, United States(得克萨斯大学奥斯汀分校电子与计算机工程系) Intuit AI Research, Mountain View, United States(Intuit AI研究)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OMAC框架,通过五个关键优化维度提升基于大语言模型的多智能体系统性能,采用语义初始化器和对比比较器算法实现单维和多维联合优化。

Comments Accepted as a Oral paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04387 2026-07-07 cs.AI cs.CL cs.GT 版本更新 88%

The Language of Bargaining: Linguistic Effects in LLM Negotiations

谈判语言:大语言模型谈判中的语言效应

Stuti Sinha, Himanshu Kumar, Aryan Raju Mandapati, Rakshit Sakhuja, Dhruv Kumar

机构 * BITS Pilani(BITS 普利尼)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 研究通过多智能体模拟,在保持游戏规则等不变的情况下,系统分离英语和四种印度语言框架在不同游戏中的语言效应,发现语言选择对结果影响大,且因任务而异,强调仅用英语评估LLM谈判有局限。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21013 2026-07-02 cs.LG cs.AI 版本更新 88%

Predicting LLM Reasoning Performance with Small Proxy Model

用小代理模型预测LLM推理性能

Woosung Koh, Juyoung Suk, Sungjun Han, Se-Young Yun, Jamin Shin

机构 * Trillion Labs KAIST AI(韩国科学技术院人工智能系)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出rBridge方法,通过任务对齐加权负对数似然,使小模型(≤1B)有效预测大模型推理性能,成本降低超100倍,在1B-32B规模上实现最强相关性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04694 2026-07-02 cs.CL cs.AI 版本更新 88%

Reasoning Up the Instruction Ladder for Controllable Language Models

在指令阶梯上推理以实现可控语言模型

Zishuo Zheng, Vidhisha Balachandran, Chan Young Park, Faeze Brahman, Sachin Kumar

机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Microsoft Research(微软研究院) Allen Institute for AI(艾伦人工智能研究所)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 通过将指令层级解析重构为推理任务,并构建VerIH数据集进行轻量级强化学习,使模型能优先处理高层级指令,在冲突场景下提升约20%的指令遵循准确率,并增强对越狱和提示注入的鲁棒性。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 39332-39354

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12666 2026-06-09 cs.LG cs.AI 版本更新 88%

RetroReasoner: A Reasoning LLM for Strategic Retrosynthesis Prediction

RetroReasoner:一种用于战略 retrosynthesis 预测的推理 LLM

Hanbum Ko, Chanhui Lee, Ye Rin Kim, Rodrigo Hormazabal, Sehui Han, Sungbin Lim, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Department of Statistics, Korea University(韩国大学统计系) Materials Intelligence Lab, LG AI Research(LG人工智能研究实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RetroReasoner 通过监督微调和强化学习,捕捉化学家基于断键策略的推理过程,提升 retrosynthesis 预测的准确性和多样性。

Comments 35 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26846 2026-06-08 cs.LG cs.AI 版本更新 88%

Stable Reasoning, Unstable Responses: Mitigating LLM Deception via Stability Asymmetry

稳定推理,不稳定响应:通过稳定性不对称缓解大语言模型欺骗

Guoxi Zhang, Jiawei Chen, Tianzhuo Yang, Lang Qin, Juntao Dai, Yaodong Yang, Jingwei Yi

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Chinese as a Second Language, Peking University(北京大学第二语言学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型内在欺骗问题,提出稳定性不对称正则化(SAR),通过惩罚内部思维链稳定性与外部响应稳定性之间的不对称性来抑制欺骗,实验证明其有效性且不损害模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏