arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18810 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18810 篇

2501.07892 2026-07-08 cs.SE cs.AI 版本更新 89%

Leveraging Metamemory Agent for Enhanced Data-Free Code Generation in Large Language Models

利用元记忆智能体增强大语言模型的无数据代码生成

Shengsheng Zhou, Shuai Wang, Liang Ding, Yibing Zhan, Yong Luo, Zheng He, Fu Lin, Dapeng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) School of Computer Science, National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(多媒体软件国家工程研究中心计算机学院,武汉大学,中国) The University of Sydney, Sydney, Australia(悉尼大学,澳大利亚) Yunnan United Vision Technology Company Ltd., China(云南联合视界技术有限公司,中国) School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,中国) School of Information Science and Engineering, Yunnan University, Kunming, China(云南大学信息科学与工程学院,中国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 提出元记忆智能体,通过引导模型回忆、评估和选择性利用相关知识,无需外部示例即可提升无数据场景下的单次代码生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05199 2026-07-07 cs.AI 新提交 89%

Reason, Reward, Refine: Step-Level Errors Corrections with Structured Feedback for Physics Reasoning in Small Language Models

推理、奖励、优化:面向小语言模型物理推理的带结构化反馈步级纠错方法

Raj Jaiswal, Dhruv Jain, Rishabh Dhawan, Sree Krishna Uppalapati, Shin'ichi Satoh, Tanuja Ganu, Rajiv Ratn Shah

机构 * IIIT Delhi(印度信息技术学院德里分校) IIT BHU(印度理工学院(巴纳拉斯印度教大学)) IIT Kanpur(印度理工学院坎普尔分校) NII Tokyo(日本国立情报学研究所) Microsoft Research India(微软印度研究院)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 针对小语言模型物理推理的步级错误传播问题,提出含结构化反馈的步级奖励框架,无需偏好数据,大幅提升推理准确率并降低各类错误占比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04332 2026-07-07 cs.LG 新提交 89%

On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models

关于强化学习中奖励函数对大语言模型置信度校准的有效性

Chee Heng Tan, Zhuoyi Lin, Mehul Motani, Wee Sun Lee

机构 * School of Computing National University of Singapore(新加坡国立大学计算机学院) Institute of Advanced Intelligence and Computing(高级智能与计算研究所) Agency for Science, Technology and Research(科技研究局) Department of Electrical & Computer Engineering(电气与计算机工程系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 研究大语言模型用强化学习训练以提升推理准确性和表达置信度时,奖励函数的设计问题。提出不可破解置信奖励方案概念并定义相关奖励方案谱,指出实际数据集中存在的问题及最佳校准奖励方案因数据集和应用而异。

Comments 50 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03591 2026-07-07 cs.CV cs.AI cs.CY 新提交 89%

Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models

基于多模态大语言模型的第一视角事故视频中的责任分配估计

Ryosei Tamura, Andrew Shin

机构 * Keio University(庆应大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究第一视角事故视频中责任分配估计新任务,构建大语言模型辅助的责任标注管道并在多输入设置下微调模型,实验证明多模态大语言模型能有效执行该任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22284 2026-06-26 cs.LG 版本更新 89%

BrepCoder: A Unified Multimodal Large Language Model for Multi-task B-rep Reasoning

BrepCoder: 用于多任务B-rep推理的统一多模态大语言模型

Mingi Kim, Yongjun Kim, Jungwoo Kang, Hyungki Kim

机构 * Chungnam National University(全南国立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 提出BrepCoder,一种统一的多模态大语言模型,通过将CAD建模序列转换为类Python代码并与B-rep对齐,采用两阶段训练策略,实现从B-rep输入执行多种CAD任务,包括补全、纠错和问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22126 2026-06-23 cs.CL 新提交 89%

From Recognition to Understanding: Unlocking Cognitive Time Series Reasoning with LLMs

从识别到理解:利用LLM解锁认知时间序列推理

Xin Qiu, Junlong Tong, Yao Zhang, Yunpu Ma, Wei Zhang, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(东方理工数字孪生研究所) Zhejiang University(浙江大学) Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,慕尼黑大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有时间序列任务与LLM能力不匹配的问题,提出多模态基准TSCognition和统一框架TSAlign,通过认知推理任务和语义对齐提升LLM的时间序列推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20227 2026-06-19 cs.AI cs.SE 新提交 89%

QMFOL: Benchmarking Large Language Model Reasoning via Quantifiable Monadic First-Order Logic Test Case Generation

QMFOL:通过可量化的一元一阶逻辑测试用例生成来基准测试大语言模型推理

Xinyi Zheng, Ling Shi, Tianlong Yu, Yongxin Zhao, Lorenz Goette, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Hubei University(湖北大学) East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出QMFOL框架,通过可控制复杂度的合取/析取模式生成一元一阶逻辑推理任务,并构建包含2880个实例的基准QMFOLBench,评估显示逻辑复杂度增加导致性能下降和计算开销上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05833 2026-06-19 cs.CV cs.AI 版本更新 89%

Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models

从视频中学习几何表示以实现空间智能多模态大语言模型

Haibo Wang, Lifu Huang

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出GeoVR框架,通过从2D视频序列中蒸馏3D几何知识(包括相机姿态、深度图、尺度因子和多尺度3D特征),重塑多模态大语言模型的内部表示以赋予其空间智能,在空间推理基准上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17459 2026-06-17 cs.AI 新提交 89%

Can LLMs Be CEOs? Benchmarking Strategic Resource Reallocation with Multi-Role Agent Simulation

LLM 能当 CEO 吗?基于多角色智能体模拟的战略资源重新配置基准测试

Yuyang Dai, Xueqing Peng, Lingfei Qian, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Yale University(耶鲁大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 CEO-Bench,一个多智能体基准,评估 LLM 在约束丰富的组织环境中进行多轮战略资源重新配置的能力,发现模型在结构有效性上表现良好,但在战略校准上存在系统性失败模式。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07910 2026-06-02 cs.CL 89%

Last Layer Logits to Logic: Empowering LLMs with Logic-Consistent Structured Knowledge Reasoning

最后一层逻辑到逻辑:赋予LLM逻辑一致的结构化知识推理能力

Songze Li, Zhiqiang Liu, Zhaoyan Gong, Xiaoke Guo, Zhongpu Bo, Zhengke Gui, Lei Liang, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM在结构化知识推理中的逻辑漂移问题,提出Logits-to-Logic框架,通过logits增强和过滤模块修正输出逻辑缺陷,在多个KGQA基准上取得最佳性能。

Comments EMNLP 2026 Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30963 2026-06-01 q-bio.BM cs.AI 89%

AMix-2: Establishing Protein as a Native Modality in Large Language Models

AMix-2:将蛋白质确立为大语言模型的原生模态

Keyue Qiu, Yixin Wu, Lihao Wang, Yawen Ouyang, Jixiang Yu, Zihan Zhou, Changze Lv, Dongyu Xue, Yuxuan Song, Xinbo Zhang, Hao Wang, Jiangtao Feng, Zhiqiang Gao, Lijun Wu, Xiaoqing Zheng, Ka-Chun Wong, Lei Bai, Ya-Qin Zhang, Wei-Ying Ma, Dahua Lin, Bowen Zhou, Hao Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Generative Symbolic Intelligence Lab (GenSI), Tsinghua University(生成符号智能实验室(GenSI),清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出AMix-2,一种蛋白质-文本基础模型,通过统一蛋白质理解与序列设计,将蛋白质作为大语言模型的原生模态,并引入块状扩散语言建模骨干以更好地匹配蛋白质内在特性。

Comments 30 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02263 2026-05-28 cs.LG 89%

Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning

打破块限制:通过单调熵下降与强化学习为扩散大语言模型实现动态大小推理块

Yan Jiang, Ruihong Qiu, Zi Huang

机构 * School of Electrical Engineering and Computer Science, The University of Queensland, Brisbane, Queensland, Australia(电气工程与计算机科学学院,昆士兰大学,布里斯班,昆士兰,澳大利亚)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 针对扩散大语言模型中固定大小推理块导致的逻辑连贯性差和效率低问题,提出基于单调熵下降目标与强化学习的后训练框架b1,学习动态大小推理块以提升推理连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04540 2026-05-28 cs.CV cs.AI 89%

The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study

点、视觉与文本:点云能否提升大语言模型的空间推理能力?一项偏差控制研究

Weichen Zhang, Ruiying Peng, Xin Zeng, Jianjie Fang, Ziyou Wang, Kaiyuan Li, Heng Dong, Wei Li, Chen Gao, Xin Wang, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本文通过引入包含文本、视觉和点云模态的3D空间推理基准ScanReQA,评估不同模态下大语言模型的空间推理能力,发现点云和视觉模态的模型表现优于纯文本模型,并揭示了3D大语言模型中的注意力下沉现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20128 2026-05-20 cs.CL 89%

MixRea: Benchmarking Explicit-Implicit Reasoning in Large Language Models

MixRea: 在大型语言模型中评估显式-隐式推理的基准测试

Yuanqing Cai, Ziyi Huang, Minhao Liu, Lixin Duan, Wen Li, Yanru Zhang

机构 * DeepMind DeepSeek-AI Anthropic Qwen Touvron Team

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出MixRea基准测试,用于评估大型语言模型在显式和隐式推理任务中的表现,发现即使最佳模型也存在注意力不足的问题,并提出PRCP方法来改进推理能力。

Comments 12 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18352 2026-05-19 cs.CL 89%

Presupposition and Reasoning in Conditionals: A Theory-Based Study of Humans and LLMs

条件句中的预设与推理:人类与LLM的理论研究

Tara Azin, Yongan Yu, Raj Singh, Olessia Jouravlev

机构 * Department of Cognitive Science, Carleton University(卡尔顿大学认知科学系) School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过对比人类判断和LLM预测,研究条件句中预设投影的机制,发现人类结合概率和语用线索进行判断,而LLM存在不一致的对齐模式,表明LLM的表现可能源于表面模式匹配而非语用能力。

Comments To appear in the Proceedings of CoNLL 2026, colocated with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18261 2026-05-19 cs.CL 89%

Knowledge-to-Verification: Exploring RLVR for LLMs in Knowledge-Intensive Domains

知识到验证:探索RLVR在知识密集型领域的LLM应用

Zhonghang Yuan, Zhefan Wang, Fang Hu, Zihong Chen, Jinzhe Li, Gang Li, Jie Ying, Huanjun Kong, Songyang Zhang, Nanqing Dong

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出K2V框架,通过自动化可验证数据合成扩展RLVR到知识密集型领域,提升LLM在这些领域的推理能力,同时不显著影响模型的通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16117 2026-05-18 cs.CL 89%

SGR: A Stepwise Reasoning Framework for LLMs with External Subgraph Generation

SGR:一种用于LLM的分步推理框架,通过外部子图生成

Xin Zhang, Yang Cao, Baoxing Wu, Kai Song, Siying Li

机构 * School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆邮电大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SGR通过外部子图生成提升LLM推理能力,利用结构化知识支持多步推理,实验表明在多个基准数据集上均优于基线方法,提高了推理准确性和事实可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15333 2026-05-18 cs.AI 89%

Zero-Shot Goal Recognition with Large Language Models

基于大语言模型的零样本目标识别

Kin Max Piamolini Gusmão, Nathan Gavenski, Nir Oren, Felipe Meneguzzi

机构 * PUCRS Porto Alegre(圣路易斯-波尔图阿legre大学) King’s College London(伦敦国王学院) University of Aberdeen(阿伯丁大学) PUCRS(圣路易斯-波尔图阿legre大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文首次系统评估前沿大语言模型在经典PDDL基准上的零样本目标识别能力,发现其表现不均,部分模型随证据增加而提升精度,而另一些模型则依赖世界知识先验。

Comments 9 pages, 1 figure, 1 table; appendix with 8 figures and 2 code listings (29 pages total); submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12398 2026-05-13 cs.CL cs.IR 89%

Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring

通过答案可信度评分估计问题难度

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出Q-DAPS方法,通过计算候选答案可信度的熵来估计问题难度,在四个数据集上表现优异,具有可解释性和鲁棒性。

Comments Accepted at ACL 2026

Journal ref Proceedings of the 64rd Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04289 2026-05-12 cs.LG q-bio.NC 89%

Relational reasoning and inductive bias in transformers and large language models

变换器中的关系推理与归纳偏置

Jesse Geerts, Andrew Liu, Stephanie Chan, Claudia Clopath, Kimberly Stachenfeld

机构 * Imperial College London(帝国理工学院伦敦分校) Google(谷歌) DeepMind(深度Mind) Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本文研究了变换器和大语言模型在关系推理中的表现,比较了基于权重学习和上下文学习的机制,发现基于权重学习的模型能进行传递推理,而基于上下文学习的模型则依赖训练数据进行传递推理,预训练可使上下文学习模型更接近权重学习模型。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10106 2026-05-12 cs.CV cs.AI 89%

ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

ViSRA:一种基于视频的空间推理代理用于多模态大语言模型

Tingshu Mou, Jiabo He, Renying Wang, Ce Liu, Hao Yang, Tiehua Zhang, Jingjing Chen, Xingjun Ma

机构 * Fudan University(复旦大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) Tongji University(同济大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 ViSRA从无训练视角出发,提出一种人类对齐的视频空间推理代理框架,通过显式空间信息探索多模态大语言模型的空间推理机制,实现模块化和可扩展的空间推理,提升3D理解能力并减少训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22508 2026-05-12 cs.AI 89%

Metacognitive Behavioral Tuning of Large Language Models for Multi-Hop Question Answering

元认知行为调节用于多跳问答的大型语言模型

Ik-hwan Kim, Hyeongrok Han, Mingi Jung, Sangwon Yu, Jinseok Hong, Sang Hun Kim, Yoonyoung Choi, Sungroh Yoon

机构 * Dept. of ECE Seoul Nat’l Univ.(首尔国立大学电子工程系) AI Center Samsung Elec. Korea(三星电子韩国人工智能中心) AIIS, ASRI, INMC, ISRC, Interdisc. Prog. in AI Seoul Nat’l Univ.(首尔国立大学人工智能研究所、高级研究机构、人工智能中心、国际研究所以及人工智能跨学科研究计划)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出元认知行为调节(MBT)框架,通过五阶段结构提升多跳问答任务的准确性和效率,减少冗余并保持推理轨迹稳定。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09042 2026-05-12 cs.CL 89%

Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity

评估大语言模型的语用推理:来自量级多样性的证据

Ye-eun Cho

机构 * Sungkyunkwan University(成均馆大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究通过量级多样性评估大语言模型的语用推理能力,发现不同模型和任务结构下语用行为差异显著,评价方法无法单一确定模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08243 2026-05-12 cs.CL 89%

Self-Debias: Self-correcting for Debiasing Large Language Models

Self-Debias:为大型语言模型引入自我纠正的去偏方法

Xuan Feng, Shuai Zhao, Luwei Xiao, Tianlong Gu, Bo An

机构 * Jinan University, China(济南大学,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 本文提出Self-Debias框架,通过资源再分配策略使模型具备自我纠正能力,以解决去偏过程中持续的偏见传播问题,无需外部干预即可提升去偏效果。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20338 2026-05-11 cs.LG 89%

Emergent Manifold Separability during Reasoning in Large Language Models

大语言模型推理中的涌现流形分离

Chanwoo Chun, Alexandre Polo, SueYeon Chung

机构 * Department of Physics, Harvard University(哈佛大学物理系) Center for Data Science, New York University(纽约大学数据科学中心) Kempner Institute, Harvard University(哈佛大学 Kempner 研究所) Center for Computational Neuroscience, Flatiron Institute(Flatiron 机构计算神经科学中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 研究大语言模型推理过程中的流形分离现象,通过曼福容量理论分析两种组合推理任务,发现概念流形在计算前解耦为线性可分子空间,揭示动态流形管理机制。

Comments Alexandre Polo and Chanwoo Chun contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16767 2026-05-04 cs.LG 89%

When Structure Doesn't Help: LLMs Do Not Read Text-Attributed Graphs as Effectively as We Expected

结构无助时:LLM在文本属性图上表现不如我们预期

Haotian Xu, Yuning You, Tengfei Ma

机构 * Stony Brook University(石溪大学) California Institute of Technology(加州理工学院)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究发现,LLM在仅依赖节点文本描述时已能高效处理文本属性图,而多数结构编码策略效果有限,挑战了传统图学习范式,推动语义驱动的新方法。

Comments LoG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23330 2026-05-04 cs.CL 89%

Structured In-context Environment Scaling for Large Language Model Reasoning

结构化上下文环境扩展用于大语言模型推理

Peng Yu, Zeyuan Zhao, Shao Zhang, Luoyi Fu, Xinbing Wang, Ying Wen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出SIE框架,通过自动构建结构化数据环境提升大语言模型的推理能力,实现可扩展性、通用性和可验证性,实验显示其在结构化推理和跨领域逻辑推理中的有效性。

Comments Title modified for greater clarity and better alignment with the paper's focus

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20133 2026-04-30 cs.CL 89%

Reasoning Gets Harder for LLMs Inside A Dialogue

在对话中LLM的推理变得更难

Ivan Kartáč, Mateusz Lango, Ondřej Dušek

机构 * Charles University, Faculty of Mathematics and Physics(查理大学数学与物理系) Institute of Formal and Applied Linguistics(形式与应用语言学研究所)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了在对话场景中LLM的推理能力,通过BOULDER基准测试发现,对话环境显著影响LLM性能,揭示了对话多轮交互对推理能力的挑战。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24698 2026-04-28 cs.CL 89%

The Chameleon's Limit: Investigating Persona Collapse and Homogenization in Large Language Models

Chameleon的极限:探究大型语言模型中的人格崩溃与同质化

Yunze Xiao, Vivienne J. Zhang, Chenghao Yang, Ningshan Ma, Weihao Xuan, Jen-tse Huang

机构 * CMU(卡内基梅隆大学) UChicago(芝加哥大学) MIT(麻省理工学院) UTokyo(东京大学) RIKEN AIP(理化学研究所AIP分部) JHU(约翰霍普金斯大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 研究发现大型语言模型中存在人格崩溃现象,导致代理行为模式趋同。通过提出覆盖度、均匀度和复杂度指标,揭示模型在不同维度和领域的人格表现差异,并释放工具支持群体评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03963 2026-04-27 cs.AI 89%

Can Large Language Models Adequately Perform Symbolic Reasoning Over Time Series?

大型语言模型能否在时间序列上进行充分的符号推理?

Zewen Liu, Juntong Ni, Xianfeng Tang, Max S. Y. Lau, Qi He, Wenpeng Yin, Wei Jin

机构 * Emory University(埃默里大学) Amazon(亚马逊) Microsoft(微软) Penn State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 本文提出SymbolBench基准,评估大型语言模型在时间序列上的符号推理能力,结合遗传编程构建闭环系统,揭示模型在科学发现中的优势与局限。

Comments camera_ready

详情

展开后加载摘要…

URL PDF HTML 收藏