arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-18 至 2026-03-18 共收录 56 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 56 篇

2507.21790 2026-03-18 econ.EM cs.AI 92%

Can large language models assist choice modelling? Insights into prompting strategies and current models capabilities

大语言模型能否协助选择建模?关于提示策略和当前模型能力的洞察

Georges Sfeir, Gabriel Nova, Stephane Hess, Sander van Cranenburgh

机构 * Choice Modelling Centre & Institute for Transport Studies, University of Leeds(选择建模中心及交通研究学院,利兹大学) CityAI Lab, Transport and Logistics group, Engineering Systems and Services Department, TU Delft(CityAI实验室,运输与物流组,工程系统与服务部门,代尔夫特理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.AI

AI总结 本文研究大语言模型在离散选择建模中的潜力,通过实验框架评估七种领先模型在不同提示策略和信息可用性下的表现,揭示其在模型规范和估计中的能力与限制。

Comments 35 pages, 8 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21524 2026-03-18 cs.AI cs.IT math.IT 90%

Large Language Models for Wireless Communications: From Adaptation to Autonomy

大语言模型在无线通信中的应用:从适应到自主

Le Liang, Hao Ye, Yucheng Sheng, Ouya Wang, Jiacheng Wang, Shi Jin, Geoffrey Ye Li

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Imperial College London(伦敦帝国理工学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 本文探讨大语言模型在无线通信中的应用,包括适应预训练模型、开发专用基础模型以及实现自主推理的代理模型,总结其优势与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16495 2026-03-18 cs.AI 89%

ExpressMind: A Multimodal Pretrained Large Language Model for Expressway Operation

ExpressMind:一种用于高速公路运营的多模态预训练大语言模型

Zihe Wang, Yihuan Wang, Haiyang Yu. Zhiyong Cui, Xiaojian Liao, Chengcheng Wang, Yonglin Tian, Yongxin Tong

机构 * Beihang University(北航) Shandong Hi-speed Group Co., Ltd(山东高速集团有限公司) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出ExpressMind,一种针对高速公路运营的多模态预训练大语言模型,通过构建全栈数据集和双层预训练方法,提升事件检测、安全响应生成和复杂交通分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16553 2026-03-18 cs.CL cs.AI 88%

EmoLLM: Appraisal-Grounded Cognitive-Emotional Co-Reasoning in Large Language Models

EmoLLM:基于评估的认知-情感共推理在大语言模型中

Yifei Zhang, Mingyang Li, Henry Gao, Liang Zhao

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 EmoLLM通过引入评估推理图结构,实现认知与情感的协同推理,提升对话中情感状态和响应质量,同时保持事实可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14761 2026-03-18 cs.AI cs.CL 88%

BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models

BrainBench:揭示大型语言模型在常识推理上的差距

Yuzhe Tang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 BrainBench通过100道脑筋急转弯问题,揭示LLM在常识推理上的不足,评估八种前沿模型,发现其推理存在随机性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16434 2026-03-18 cs.AI q-fin.TR 88%

From Natural Language to Executable Option Strategies via Large Language Models

从自然语言到可执行期权策略的大型语言模型

Haochen Luo, Zhengzhao Lai, Junjie Xu, Yifan Li, Tang Pok Hin, Yuan Zhang, Chen Liu

机构 * City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Shanghai University of Finance and Economics(上海财经大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出Option Query Language,通过语法规则将期权市场抽象为高层 primitives,使LLM能作为语义解析器生成可执行期权策略,并通过新数据集验证其优于直接生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12633 2026-03-18 cs.CV cs.AI 88%

DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model

DiG:通过差异 grounding 提升多模态大语言模型的细粒度感知

Zhou Tao, Shida Wang, Yongxiang Hua, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出DiG框架,通过学习相似图像对的差异识别提升多模态大语言模型的细粒度感知能力,实验表明其在多个视觉感知基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14730 2026-03-18 cs.LG 87%

GNNVerifier: Graph-based Verifier for LLM Task Planning

GNNVerifier:基于图的LLM任务规划验证器

Yu Hao, Qiuyu Wang, Cheng Yang, Yawen Li, Zhiqiang Zhang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于图的验证器,通过构建任务计划的图结构,利用图神经网络评估计划的合理性,从而纠正LLM生成的计划中的错误。

Comments 17pages,12figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16822 2026-03-18 cs.AI 85%

Surg$Σ$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence

Surg$Σ$: 一种大规模多模态数据和基础模型的光谱,用于外科智能

Zhitao Zeng, Mengya Xu, Jian Jiang, Pengfei Guo, Yunqiu Xu, Zhu Zhuo, Chang Han Low, Yufan He, Dong Yang, Chenxi Lin, Yiming Gu, Jiaxin Guo, Yutong Ban, Daguang Xu, Qi Dou, Yueming Jin

机构 * NUS(新加坡国立大学) CUHK(香港中文大学) SJTU(上海交通大学) NVIDIA(英伟达)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Surg$Σ$,通过大规模多模态数据和基础模型提升外科智能,解决现有框架任务特定、泛化能力差的问题,展示统一语义设计和结构化推理标注的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16264 2026-03-18 cs.AI 85%

Adaptive Theory of Mind for LLM-based Multi-Agent Coordination

自适应理论 of mind 用于基于大语言模型的多智能体协调

Chunjiang Mu, Ya Zeng, Qiaosheng Zhang, Kun Shao, Chen Chu, Hao Guo, Danyang Jia, Zhen Wang, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出自适应理论 of mind 机制,通过估计伙伴的理论 of mind 深度以提升多智能体协作效率,实验验证了该机制在多个任务中的有效性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16143 2026-03-18 eess.SP cs.AI 85%

Structure-Aware Multimodal LLM Framework for Trustworthy Near-Field Beam Prediction

面向可信近场波束预测的结构感知多模态大语言模型框架

Mengyuan Li, Qianfan Lu, Jiachen Tian, Hongjun Hu, Yu Han, Xiao Li, Chao-kai Wen, Shi Jin

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) Institute of Communications Engineering, National Sun Yat-sen University(通讯工程学院,国立中山大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的多模态框架,融合历史GPS数据、RGB图像、LiDAR数据及任务特定文本提示,以提升复杂低空环境中的近场波束对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15255 2026-03-18 cs.AI cs.MA 85%

SAGE: Multi-Agent Self-Evolution for LLM Reasoning

SAGE:多智能体自进化用于大语言模型推理

Yulin Peng, Xinxin Zhu, Chenxing Wei, Nianbo Zeng, Leilei Wang, Ying Tiffany He, F. Richard Yu

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), China(广东省人工智能与数字经济实验室(深圳)) School of Information Technology, Carleton University, Canada(卡尔顿大学信息科技学院,加拿大)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SAGE通过四智能体协同进化提升LLM推理能力,利用小种子集实现稳定自训练,在数学和代码生成基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09295 2026-03-18 cs.MA 85%

MACRO-LLM: LLM-Empowered Multi-Agent Collaborative Reasoning under Spatiotemporal Partial Observability

MACRO-LLM:基于时空部分可观测性的LLM赋能多智能体协作推理

Handi Chen, Running Zhao, Xiuzhe Wu, Edith C. H. Ngai

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出MACRO-LLM,通过三个模块解决多智能体在时空部分可观测性下的协作推理问题,验证了其在复杂任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16192 2026-03-18 cs.CL 84%

Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models

结构化语义遮蔽用于大型语言模型的对抗攻击

Xiaobing Sun, Perry Lam, Shaohua Li, Zizhou Wang, Rick Siow Mong Goh, Yong Liu, Liangli Zhen

机构 * Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科技研究局(A*STAR),新加坡) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(信息技术与设计支柱,新加坡科技设计大学)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL

AI总结 本文提出结构化语义遮蔽(S2C)框架,通过重构恶意意图的多步骤推理过程,提升对抗攻击成功率,同时分析遮蔽程度与输入可恢复性之间的权衡。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15897 2026-03-18 cs.CL cs.AI 84%

COGNAC at SemEval-2026 Task 5: LLM Ensembles for Human-Level Word Sense Plausibility Rating in Challenging Narratives

COGNAC在SemEval-2026任务5中的应用:用于挑战性叙事中人类水平词义可信度评估的LLM集成

Azwad Anjum Islam, Tisa Islam Erana

机构 * Florida International University Knight Foundation School of Computing and Information Sciences(佛罗里达国际大学骑士基金会计算与信息科学学院)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出使用多个闭源商业LLM的集成方法,通过三种提示策略提升短篇故事中多义词词义可信度评估的准确性,最终在比赛中获得第四名。

Comments System description paper in SemEval-2026, Task 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15981 2026-03-18 cs.CL cs.AI 82%

Aligning Paralinguistic Understanding and Generation in Speech LLMs via Multi-Task Reinforcement Learning

通过多任务强化学习对齐语音大语言模型中的语用理解和生成

Jingxiang Chen, Minseok Kim, Seong-Gyun Leem, Yin Huang, Rashi Rungta, Zhicheng Ouyang, Haibin Wu, Surya Teja Appini, Ankur Bansal, Yang Bai, Yue Liu, Florian Metze, Ahmed A Aly, Anuj Kumar, Ariya Rastrow, Zhaojiang Lin

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出通过多任务强化学习提升语音大语言模型对语用信息的理解与生成,实验表明在多个数据集上比监督模型和 proprietary 模型提升了8-12%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15015 2026-03-18 cs.MA 82%

MetaCrit: A Critical Thinking Framework for Self-Regulated LLM Reasoning

MetaCrit: 一种用于自主LLM推理的批判性思维框架

Xinmeng Hou, Ziting Chang, Zhouquan Lu, Chen Wenli, Liang Wan, Wei Feng, Hai Hu, Qing Guo

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出MetaCrit框架,通过多智能体机制提升LLM在多跳问题中的推理能力,增强逻辑严谨性并消除有毒输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15377 2026-03-18 cs.LG cs.AI 81%

More Test-Time Compute Can Hurt: Overestimation Bias in LLM Beam Search

更宽的搜索可能有害:LLM束搜索中的过估计偏差

Gal Dalal, Assaf Hallak, Gal Chechik, Yftah Ziser

机构 * NVIDIA Research(NVIDIA研究实验室) Bar-Ilan University(巴伊兰大学) University of Groningen(格罗宁根大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了束搜索宽度对LLM输出质量的影响,通过极值理论分析发现,过宽的搜索会引入系统性过估计偏差,提出基于信噪比的束宽选择方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22629 2026-03-18 cs.CL cs.AI 81%

Time-Annealed Perturbation Sampling: Diverse Generation for Diffusion Language Models

时间退火扰动采样:扩散语言模型的多样化生成

Jingxuan Wu, Zhenglin Wan, Xingrui Yu, Yuzhe Yang, Yiqiao Huang, Ivor Tsang, Yang You

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) National University of Singapore(新加坡国立大学) CFAR, Agency for Science, Technology and Research(科技研究局CFAR) University of California, Santa Barbara(加州大学圣芭芭拉分校) Harvard University(哈佛大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出时间退火扰动采样方法,通过在扩散过程中早期鼓励语义分支并逐步减少扰动,提升生成多样性,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16445 2026-03-18 cs.AI 79%

Visual Distraction Undermines Moral Reasoning in Vision-Language Models

视觉干扰削弱了视觉语言模型中的道德推理

Xinyi Yang, Chenheng Xu, Weijun Hong, Ce Mo, Qian Wang, Fang Fang, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Yuanpei College, Peking University(北京大学元培学院) Department of Psychology, Sun Yat-sen University(中山大学心理学系) State Key Lab of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康北京市重点实验室)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 研究揭示视觉输入会改变视觉语言模型的道德决策,超越文本安全机制,提出多模态基准MDS以分析视觉与上下文变量对道德决策的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16642 2026-03-18 cs.AI cs.CL cs.CY 79%

When AI Navigates the Fog of War

当AI穿越战争的迷雾

Ming Li, Xirui Li, Tianyi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究AI在战争初期预测能力,通过2026年中东冲突案例,测试模型在无训练数据泄露情况下分析危机的能力,揭示模型在不同领域中的策略现实性和叙事演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05549 2026-03-18 cs.LG cs.AI cs.IR 79%

AGRAG: Advanced Graph-based Retrieval-Augmented Generation for LLMs

AGRAG: 面向大语言模型的高级图基检索增强生成框架

Yubo Wang, Haoyang Li, Fei Teng, Lei Chen

机构 * The Hong Kong University of Science(香港科学与技术大学) The Hong Kong Polytechnic University Hong Kong SAR(香港理工大学(香港特别行政区))

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 AGRAG通过统计方法构建图结构,解决LLM幻觉问题,并采用MCMI子图生成提升推理能力,实现更全面的推理路径,提升检索增强生成效果。

Comments ICDE 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22819 2026-03-18 cs.AI cs.FL cs.LG 79%

Hilbert: Recursively Building Formal Proofs with Informal Reasoning

Hilbert:通过非正式推理递归构建形式证明

Sumanth Varambally, Thomas Voice, Yanchao Sun, Zhifeng Chen, Rose Yu, Ke Ye

机构 * UC San Diego(加州大学圣地亚哥分校) Apple(苹果公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Hilbert结合非正式推理与形式验证,通过递归分解问题并利用反馈优化证明,显著提升在形式证明任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17533 2026-03-18 math.HO cs.AI cs.CL math.NT 79%

From Euler to AI: Unifying Formulas for Mathematical Constants

从欧拉到人工智能:数学常数的统一公式

Tomer Raz, Michael Shalyt, Elyasheev Leibtag, Rotem Kalisch, Shachar Weinbaum, Yaron Hadad, Ido Kaminer

机构 * Technion – Israel Institute of Technology(技术ion理工学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出自动化框架统一数学公式,通过LLM和符号算法处理455,500篇论文,验证385个π公式并证明其中94%的关系,揭示数学常数间的深层联系。

Comments Final version for NeurIPS2025. Published at https://neurips.cc/virtual/2025/loc/san-diego/poster/117099

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15921 2026-03-18 cs.SE cs.AI 77%

VIBEPASS: Can Vibe Coders Really Pass the Vibe Check?

VIBEPASS:振动编码器真的能通过振动检查吗?

Srijan Bansal, Jiao Fangkai, Yilun Zhou, Austin Xu, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce AI研究院) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了振动编码器在自主软件工程中的能力,发现故障定位推理是瓶颈,而非代码生成或测试有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15809 2026-03-18 cs.MA cs.AI 77%

Don't Trust Stubborn Neighbors: A Security Framework for Agentic Networks

不要信任固执的邻居:代理网络的安全框架

Samira Abedini, Sina Mavali, Lea Schönherr, Martin Pawelczyk, Rebekka Burkholz

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) University of Vienna, Faculty of Computer Science(维也纳大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了基于大语言模型的多代理系统中恶意代理传播虚假信息的风险,提出理论框架并通过实验验证了增加良性代理、提升固执度或降低对敌方信任可增强系统安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15707 2026-03-18 cs.SE cs.AI 77%

SEMAG: Self-Evolutionary Multi-Agent Code Generation

SEMAG:自演化多智能体代码生成

Yulin Peng, Haowen Hou, Xinxin Zhu, Ying Tiffany He, F. Richard Yu

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), China(广东省人工智能与数字经济发展实验室(深圳)) School of Information Technology, Carleton University, Canada(卡尔顿大学信息技术学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SEMAG通过自演化多智能体框架提升代码生成适应性,实现更高准确率和更强的模型自适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16458 2026-03-18 cs.NI cs.SY eess.SY 75%

Agentic AI for SAGIN Resource Management_Semantic Awareness, Orchestration, and Optimization

面向SAGIN资源管理的代理AI:语义感知、编排与优化

Linghao Zhang, Haitao Zhao, Bo Xu, Hongbo Zhu, Xianbin Wang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于大语言模型的代理AI框架,用于自主管理空间-空气-地面一体化网络资源,通过语义感知、意图驱动编排和自适应学习代理协作,实现动态环境下的高效资源管理。

Comments eg.: 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16643 2026-03-18 cs.CL 74%

Good Arguments Against the People Pleasers: How Reasoning Mitigates (Yet Masks) LLM Sycophancy

对讨好型人格的有益论点:推理如何缓解(却掩盖)LLM的讨好行为

Zhaoxin Feng, Zheng Chen, Jianfei Ma, Yip Tin Po, Emmanuele Chersoni, Bo Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.CL

AI总结 研究探讨了推理在缓解LLM讨好行为中的作用,发现推理虽能减少最终决策的讨好倾向,但可能在部分样本中掩盖讨好行为,且LLM在主观任务和权威偏见下更易表现出讨好倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16578 2026-03-18 cs.LG cs.CL 73%

When and Why Does Unsupervised RL Succeed in Mathematical Reasoning? A Manifold Envelopment Perspective

在何种情况下和为何无监督强化学习在数学推理中成功?一种流形包裹视角

Zelin Zhang, Fei Cheng, Chenhui Chu

机构 * Kyoto University(京都大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究无监督强化学习在数学推理中的成功条件,提出通过流形包裹视角分析其稳定性与失效原因,设计内在奖励机制并揭示基础逻辑先验对性能的影响。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏