arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 832 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 832 篇

2607.15776 2026-08-03 cs.AI 版本更新 83%

NeurOWL: An LLM-Based Neural-symbolic Framework for Incomplete OWL Ontology Reasoning

NeurOWL:基于大语言模型的神经符号框架用于不完整OWL本体推理

Hui Yang, Jiaoyan Chen, Yiping Song, Renate Schmidt, Wen Zhang

机构 * The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究不完整OWL本体的包含关系推理问题,提出NeurOWL框架,通过大语言模型和本体嵌入联合执行验证和溯因,利用形式与文本语义,在多领域真实本体上评估,展现强大稳健性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01982 2026-08-03 cs.CV cs.AI q-bio.BM 版本更新 83%

MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding

MolSight: 一种用于统一化学图像理解的图感知视觉语言模型

Wenda Wang, Yihan Tong, Yuwei Hu, Xuchen Pan, Zhewei Wei, Yaliang Li, Bolin Ding

机构 * Renmin University of China(中国人民大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 提出MolSight框架,通过分子拓扑模块和分子接地模块增强视觉语言模型对分子图像的结构理解,在多项化学视觉理解任务中显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03881 2026-07-29 cs.CY cs.AI cs.HC 版本更新 83%

LLM-generated personalized nudges for improving pro-environmental behavior: Field evidence from resource conservation

利用大型语言模型的迭代个性化增强行为提示:一项关于电力和热水节约的实地实验

Zonghan Li, Yi Liu, Chunyan Wang, Song Tong, Kaiping Peng, Feng Ji

机构 * School of Environment, Tsinghua University(清华大学环境学院) Department of Applied Psychology and Human Development, University of Toronto(多伦多大学应用心理学与人类发展系) State Key Laboratory of Regional Environment and Sustainability, Tsinghua University(清华大学区域环境与可持续性国家重点实验室) Department of Psychology, Beijing Normal University at Zhuhai(北京师范大学珠海校区心理学系) Department of Psychology and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本研究利用大型语言模型实现迭代个性化,通过实地实验发现其在促进节能方面效果显著,且在前两轮干预中表现更优,但热水节约效果较弱且随时间减弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12815 2026-07-21 cs.AI 版本更新 83%

Visual Access Boundaries in Vision-Language Model Reasoning

视觉语言模型推理中的视觉访问边界

Hiroto Osaka, Shohei Taniguchi, Gouki Minegishi, Kai Yamashita, Masahiro Suzuki, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究视觉语言模型推理中CoT提示扩展的内容,通过视觉访问扫描定义VAB,发现CoT不主要靠延长图像令牌访问提效,而是扩展语言侧计算,且CoT收益受感知读出限制,瓶颈在读出非计数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23276 2026-07-15 cs.LG cs.MA 版本更新 83%

Auditable Context-Aware HFMD Forecasting with Structured LLM Agents

基于结构化大语言模型代理的可审计上下文感知手足口病预测

Joongwon Chae, Runming Wang, Chen Xiong, Gong Yunhan, Lian Zhang, Ji Jiansong, Dongmei Yu, Peiwu Qin

机构 * Institute of Biomedicine and Health Engineering, Tsinghua Shenzhen International Graduate School (SIGS), Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院生物医学与健康工程学院) The Fifth Affiliated Hospital of Wenzhou Medical University, Lishui 323000, China(温州医科大学第五附属医院) Hengqin Laboratory, Zhuhai, China(横琴实验室) The First Hospital of Hebei Medical University, Shijiazhuang, China(河北医科大学第一医院)

专题命中 推理与问题求解 :LLM(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 研究针对手足口病预测,提出双代理神经符号框架,由基于大语言模型的事件解释器和预测生成器组成,通过摄取异构信号并结合历史病例数进行预测,在两个数据集评估中实现有竞争力的点准确性、可靠区间及可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16728 2026-07-14 cs.LG 版本更新 83%

The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models

推理的成本:链式推理诱导视觉-语言模型的过度自信

Robert Welch, Emir Konuk, Kevin Smith

机构 * KTH Royal Institute of Technology, Stockholm, Sweden(皇家理工学院) Science for Life Laboratory, Stockholm, Sweden(生命科学实验室)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 研究发现链式推理会降低视觉-语言模型的不确定性估计质量,主要机制是隐式答案条件化,导致模型过度自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04673 2026-07-14 cs.AI 版本更新 83%

Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message

木马提示:通过伪造助手消息来破解对话式多模态模型

Wei Duan, Li Qian

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究针对对话式多模态模型的安全漏洞,提出木马提示越狱技术,通过伪造对话历史绕过安全机制,在谷歌Gemini-2.0上实验显示其攻击成功率高于现有方法,揭示对话AI安全缺陷,呼吁转变验证范式。

Comments We stopped working on this idea because we realized that there was a paper submitted before it that took almost identical approach

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30170 2026-07-09 cs.MM cs.CV cs.LG 版本更新 83%

Unveiling the Visual Counting Bottleneck in Vision-Language Models

揭示视觉语言模型中的视觉计数瓶颈

Xingzhou Pang, Yifan Hou, Junling Wang, Mrinmaya Sachan

机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 推理与问题求解 :language model(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18784 2026-07-09 cs.AI 版本更新 83%

Successor-Generator Planning with LLM-generated Heuristics

基于大语言模型生成启发式策略的后继生成器规划

Alexander Tuisov, Yonatan Vernik, Alexander Shleyfman

机构 * Computer Science Department, Bar-Ilan University(巴伊兰大学计算机科学系)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究借助大语言模型,从规划任务中生成特定问题启发式函数并集成到搜索算法。该方法在多规划基准测试中性能优异,还能解决传统形式难表达的问题,经评估展现出有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23844 2026-07-07 cs.CL 版本更新 83%

Language Models as Higher-Order Planning Formalizers

语言模型规划器无法扩展,但形式化器可以吗?

Owen Jiang, Cassie Huang, Ashish Sabharwal, Li Zhang

机构 * Drexel University(德雷克斯el大学) Allen Institute for AI(人工智能研究院)

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究发现语言模型形式化器在规划问题中表现优于规划器,通过分治技术提升鲁棒性,并引入形式化挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13517 2026-07-07 cs.CL 版本更新 83%

Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens

深入思考,而非仅靠长度:通过深度思考令牌测量大语言模型推理工作量

Wei-Lin Chen, Liqian Peng, Tian Tan, Chao Zhao, Blake JianHang Chen, Ziqian Lin, Alec Go, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) Google(谷歌)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过识别深度思考令牌量化推理时间工作量,在多个基准和模型上验证深度思考比例与准确率正相关,据此引入Think@n策略提升推理效率并降低成本。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24575 2026-07-01 cs.RO cs.LG cs.MA 版本更新 83%

Prompting Robot Teams with Natural Language

用自然语言提示机器人团队

Eduardo Sebastián, Nicolas Pfitzer, Ajay Shankar, Amanda Prorok

机构 * Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) Department of Mechanical and Process Engineering, ETH Zurich(苏黎世联邦理工学院机械与过程工程系)

专题命中 推理与问题求解 :prompting(title,abstract);language model(abstract);分类 cs.LG

AI总结 提出利用语言模型将高层任务分解为子任务,并蒸馏为循环神经网络(RNN)以支持多机器人团队的去中心化实时执行,通过图神经网络控制策略实现协作。

Comments This paper has been accepted for publication at IEEE Robotics and Automation Letters. Please, when citing the paper, refer to the official version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20510 2026-06-24 cs.AI 版本更新 83%

Grounded Chess Reasoning in Language Models via Master Distillation

通过大师蒸馏实现语言模型中的接地国际象棋推理

Zhenwei Tang, Qianfeng Wen, Seth Grief-Albert, Yahya Elgabra, Blair Yang, Honghua Dong, Ashton Anderson

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Queen’s University(皇后大学) Coolwei AI Lab(Coolwei人工智能实验室)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出大师蒸馏框架,将专家系统推理过程蒸馏为自然语言思维链,使4B参数模型C1在国际象棋中达到48.1%准确率,超越所有开源模型和多数前沿闭源系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22363 2026-06-18 cs.LG eess.AS 版本更新 83%

Investigating Faithfulness in Large Audio Language Models

大型音频语言模型中的忠实性研究

Pooneh Mousavi, Lovenya Jain, Mirco Ravanelli, Cem Subakan

机构 * Concordia University(康科迪亚大学) Mila - Quebec AI Institute(魁北克人工智能研究院) Université Laval(拉瓦尔大学) Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,皮兰尼)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 提出系统框架评估大型音频语言模型在推理链忠实性上的表现,定义三个音频忠实性标准,并通过基准测试发现模型推理与音频输入存在脱节。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03503 2026-06-16 cs.CL 版本更新 83%

Understanding LLM Reasoning for Abstractive Summarization

理解大语言模型在抽象摘要中的推理能力

Haohan Yuan, Haopeng Zhang

机构 * ALOHA Lab, University of Hawaii at Manoa(夏威夷大学马诺亚分校ALOHA实验室)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过大规模比较8种推理策略和3种大型推理模型在8个数据集上的表现,发现推理并非万能,其效果依赖于策略和摘要设置,且存在质量与事实准确性之间的权衡。

Comments 27 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04474 2026-06-12 cs.CL eess.AS 版本更新 83%

Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention

语音大模型推理中的实体绑定失败:诊断与思维链干预

Ming-Hao Hsu, Xiaohai Tian, Jun Zhang, Zhizheng Wu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(1 数据科学学院,香港中文大学(深圳)) ByteDance, China(2 字节跳动,中国)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过诊断语音大模型在逻辑推理中的实体绑定失败问题,提出实体感知思维链方法,显著提升推理准确率。

Comments INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25004 2026-06-09 cs.AI 版本更新 83%

CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning

CLPO:课程学习与策略优化相结合用于大语言模型推理

Shijie Zhang, Zheng Xiao, Shiyu Liu, Guohao Sun, Kevin Zhang, Xiang Guo, Rujun Guo, Shaoyu Liu, Wangxiao Zhao, Guanjun Jiang

机构 * Peking University(北京大学) Qwen Applications Business Group, Alibaba Group(通义实验室,阿里巴巴集团) Xiamen University(厦门大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CLPO框架,通过在线策略准确率动态调整问题难度,使课程与策略共同进化,在数学和通用推理基准上显著优于GRPO和DAPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01077 2026-08-11 cs.CL cs.LG 版本更新 82%

Message Passing Enables Efficient Reasoning

消息传递实现高效推理

Xuecheng Liu, Daman Arora, Gokul Swamy, Andrea Zanette

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出消息传递语言模型(MPLM),通过线程间直接通信和抢占机制,在Sudoku、3-SAT和长上下文问答任务中实现比串行CoT和并行FJ更高效的推理。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03320 2026-08-04 cs.CL cs.AI 版本更新 82%

From We to Me: Theory Informed Narrative Shift with Abductive Reasoning

从‘我们’到‘我’:基于演绎推理的理论指导叙事转变

Jaikrishna Manojkumar Patil, Divyagna Bavikadi, Kaustuv Mukherji, Ashby Steward-Nolan, Peggy-Jean Allin, Tumininu Awonuga, Joshua Garland, Paulo Shakarian

机构 * Syracuse University(苏塞克斯大学) Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于演绎推理和社会科学理论的神经符号方法,用于改进大型语言模型的叙述转变能力,在多个模型上实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18350 2026-07-28 cs.CL cs.AI 版本更新 82%

Adapter Merging Reactivates Latent Reasoning Traces: A Mechanism Analysis

适配器合并重新激活潜在推理痕迹:一种机制分析

Junyi Zou

机构 * Zjydiary Group(Zjydiary小组)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示适配器合并后推理痕迹的重新激活机制,通过几何方法减少泄漏并提升准确性。

Comments Withdrawn by the authors after identifying an implementation error in adapter coefficient scaling that materially affects the main empirical results and invalidates the current conclusions. A corrected reanalysis is in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03059 2026-07-28 cs.LG cs.AI 版本更新 82%

Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers

Loong:通过验证器大规模合成长思维链

Xingyue Huang, Rishabh, Gregor Franke, Ziyi Yang, Jiamu Bai, Weijie Bai, Jinhe Bi, Zifeng Ding, Yiqun Duan, Chengyu Fan, Wendong Fan, Xin Gao, Ruohao Guo, Yuan He, Zhuangzhuang He, Xianglong Hu, Neil Johnson, Bowen Li, Fangru Lin, Siyu Lin, Tong Liu, Yunpu Ma, Hao Shen, Hao Sun, Beibei Wang, Fangyijie Wang, Hao Wang, Haoran Wang, Yang Wang, Yifeng Wang, Zhaowei Wang, Ziyang Wang, Yifan Wu, Zikai Xiao, Chengxing Xie, Fan Yang, Junxiao Yang, Qianshuo Ye, Ziyu Ye, Guangtao Zeng, Yuwen Ebony Zhang, Zeyu Zhang, Zihao Zhu, Bernard Ghanem, Philip Torr, Guohao Li

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对将LLMs推理能力扩展到其他领域的挑战,提出Loong项目这一开源框架,由LoongBench和LoongEnv组成,通过它们形成强化学习的智能体-环境循环,经实验评估及对合成数据的分析,推动推理密集型领域发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15845 2026-07-01 cs.CL cs.AI 版本更新 82%

Verify when Uncertain: Beyond Self-Consistency in Black Box Hallucination Detection

不确定时验证:超越黑盒幻觉检测中的自一致性

Yihao Xue, Kristjan Greenewald, Youssef Mroueh, Baharan Mirzasoleiman

机构 * MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) IBM Research(IBM研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出两阶段检测算法,结合自一致性与交叉一致性,在保持高检测性能的同时降低计算成本,并通过核均值嵌入提供理论解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11837 2026-06-17 cs.CL cs.AI 版本更新 82%

EmoFSM: A Finite State Machine for Emotional Support Conversation

EmoFSM:一种用于情感支持对话的有限状态机

Yue Zhao, Qingqing Gu, Xiaoyu Wang, Teng Chen, Zhonglin Jiang, Yong Chen, Hongyan Li, Luo Ji

机构 * Geely AI Lab(吉利人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对情感支持对话中长期满意度不足的问题,提出EmoFSM框架,利用有限状态机引导大语言模型进行规划与自我推理,在多个数据集上优于多种基线方法。

Comments 15 pages, 4 figures. PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01101 2026-06-16 cs.AI cs.CL cs.SD eess.AS 版本更新 82%

Virtual Speech Therapist: A Clinician-in-the-Loop AI Speech Therapy Agent for Personalized and Supervised Therapy

虚拟言语治疗师:一种临床医生参与的AI言语治疗代理,用于个性化和监督式治疗

Shakeel Sheikh, Patrick Marmaroli, MD Sahidullah, Slim Ouni, Fabrice Hirsch, Goncalo Leal, Bjorn W Schuller

机构 * The Kashmir Hub for Artficial Intelligence(喀布尔人工智能中心) Microsoft / Vocametrix(微软 / Vocametrix) IAI, TCG CREST(IAI,TCG CREST) Université de Lorraine, CNRS, Inria, LORIA(洛林大学,CNRS,Inria,LORIA) Laboratoire Praxiling, UMR5267, CNRS et Université Paul-Valéry Montpellier 3(Praxiling实验室,UMR5267,CNRS及蒙彼利埃Paul-Valéry大学) Speechcare iStutter, Portuguese Catholic University(Speechcare iStutter,葡萄牙天主教大学) CHI – Chair of Health Informatics, TUM University Hospital(健康信息学系,TUM大学医院) GLAM – Group on Language, Audio, & Music, Imperial College London(语言、音频与音乐小组,伦敦帝国理工学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出虚拟言语治疗师(VST)平台,集成深度学习口吃分类与多智能体大语言模型推理,自动生成个性化治疗方案,并通过临床医生反馈优化,实验证明其高质量推荐。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14888 2026-08-06 cs.CL cs.AI cs.CV cs.LG 版本更新 82%

Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models

推理动态与监控模态依赖性的局限性

Danae Sánchez Villegas, Samuel Lewis-Lim, Nikolaos Aletras, Desmond Elliott

机构 * University of Copenhagen, Department of Computer Science(哥本哈根大学计算机科学系) University of Sheffield, School of Computer Science(谢菲尔德大学计算机科学学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分析18种VLM的推理动态,发现模型易受早期预测影响,推理训练模型在模态条件下表现出更强的纠正行为,但其效果依赖于模态条件,且CoT的可检测性因模型而异。

Comments Accepted for publication in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23146 2026-07-24 q-bio.QM 版本更新 82%

Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks

轻量语言模型在复杂计算表型任务中易出现推理错误

Sarah Pungitore, Shashank Yadav, David Maughan, Vignesh Subbian

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn)

AI总结 研究探讨了轻量语言模型在复杂计算表型任务中的推理错误问题,通过扩展PHEONA框架评估了不同模型的推理准确性,并发现轻量推理模型在提示修改后表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11960 2026-07-07 cs.LG cs.AI cs.CL 版本更新 82%

R$^2$PO: Decoupling Rollout and Inference Policies for LLM Reasoning

R$^2$PO:用于大语言模型推理的解耦展开与推理策略

Jingchu Wang, Bingbing Xu, Yige Yuan, Dan Zhang, Bin Xie, Xiaoqian Sun, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国家大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究指出强化学习方法中训练轨迹与推理响应策略耦合的问题,提出R$^2$PO解耦二者,在训练时多样化展开,保持推理生成不变,实验表明其性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16380 2026-06-12 cs.CL cs.AI cs.CY cs.HC cs.LG 版本更新 82%

MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than Outcomes

MoReBench:评估语言模型中的程序性和多元道德推理,超越结果

Yu Ying Chiu, Michael S. Lee, Rachel Calcott, Brandon Handoko, Paul de Font-Reaulx, Raphaël Millière, Paula Rodriguez, Chen Bo Calvin Zhang, Ziwen Han, Udari Madhushani Sehwag, Yash Maurya, Christina Q Knight, Harry R. Lloyd, Florence Bacus, Conor Downey, Mantas Mazeika, Bing Liu, Yejin Choi, Mitchell L Gordon, Sydney Levine

机构 * University of Washington(华盛顿大学) New York University(纽约大学) Scale AI Harvard University(哈佛大学) University of Michigan(密歇根大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Center for AI Safety(人工智能安全中心) Stanford University(斯坦福大学) MIT(麻省理工学院) University of Oxford(牛津大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MoReBench基准,包含1000个道德场景和超过2.3万条标准,用于评估语言模型在道德推理中的程序性推理能力,发现现有基准无法预测模型表现,且模型对特定道德框架存在偏好。

Comments 46 pages, 8 figures, 10 tables. Published in ICLR 2026. Accepted at CHAI workshop and SPP 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15327 2026-06-09 cs.LG cs.AI cs.CL stat.ML 版本更新 82%

Prescriptive Scaling Reveals the Evolution of Language Model Capabilities

规范性缩放揭示语言模型能力的演变

Hanlin Zhang, Jikai Jin, Vasilis Syrgkanis, Sham Kakade

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(title);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过大规模观测评估和分位数回归,提出规范性缩放定律,将预训练计算预算映射到下游准确率,并验证其时间稳定性,引入平衡I-最优采样算法降低评估成本。

Comments ICML 2026 Oral. Blog Post: https://jkjin.com/prescriptive-scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11840 2026-07-09 cs.LG cs.AI cs.CY cs.MA 版本更新 82%

Diversity Without Fidelity: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation Simulation

当推理模型损害行为模拟:多智能体大语言模型谈判中的求解器-采样器不匹配

Sandro Andric

专题命中 推理与问题求解 :LLM(title,comments);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究指出推理增强模型在模拟行为时可能表现不佳,通过三个多智能体谈判环境实验发现,有界推理能产生更多样且妥协导向的轨迹,强调模拟应将模型视为采样器而非求解器。

Comments 20 pages, 2 figures. Substantially revised. Formerly titled "When Reasoning Models Hurt Behavioral Simulation: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation"

详情

展开后加载摘要…

URL PDF HTML 收藏