arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-03 至 2026-06-03 共收录 404 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 19 篇

2510.16392 2026-06-03 cs.AI 83%

RGMem: Renormalization Group-inspired Memory Evolution for Language Agents

RGMem:基于重正化群启发的语言智能体记忆演化

Ao Tian, Yunfeng Lu, Xinxin Fan, Changhao Wang, Lanzhi Zhou, Yeyao Zhang, Yanfang Liu

机构 * School of Computer Science Engineering, Beihang University, Beijing, China School of Reliability Systems Engineering, Beihang University, Beijing, China State Key Laboratory of Complex \& Critical Software Environment National Key Laboratory of Reliability State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences

专题命中 长上下文与记忆 :language agent(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出RGMem框架,利用重正化群思想对长期对话记忆进行多尺度粗粒化、阈值更新和重缩放,实现从事实到用户偏好的层次化整合,在LOCOMO和PersonaMem基准上超越现有记忆系统。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03463 2026-06-03 cs.AI cs.CL 82%

DMF: A Deterministic Memory Framework for Conversational AI Agents

DMF:对话式AI代理的确定性记忆框架

Matteo Stabile, Enrico Zimuel

机构 * Roma Tre University(罗马三大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种CPU优先的确定性记忆框架DMF,通过经典NLP分析、向量几何和数学评分替代生成式记忆压缩,实现零令牌成本且与Mem0相当的准确性。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03841 2026-06-03 cs.AI 81%

EvoDS: Self-Evolving Autonomous Data Science Agent with Skill Learning and Context Management

EvoDS: 具有技能学习和上下文管理的自进化自主数据科学智能体

Zherui Yang, Fan Liu, Yansong Ning, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出EvoDS,通过自主技能获取和自适应上下文压缩策略,结合强化学习训练,使数据科学智能体能够自进化并显著提升多阶段迭代任务的性能。

Comments Accepted by KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03075 2026-06-03 cs.CV 78%

TGV-KV: Text-Grounded KV Eviction for Vision-Language Models

TGV-KV:面向视觉语言模型的文本引导KV驱逐方法

Jizhihui Liu, Ruizi Han, Miao Zhang, Rui Shao, Xuebo Liu, Weili Guan, Yaowei Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 长上下文与记忆 :language model(title,abstract)

AI总结 针对视觉语言模型中视觉信息冗余导致的KV缓存内存消耗问题,提出基于文本引导的KV驱逐方法TGV-KV,通过文本-视觉预算分配、文本加权排序和文本优先保留策略,在保持高精度的同时显著提升推理吞吐量。

Comments Accepted by ICML-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07123 2026-06-03 cs.CL 77%

Language Bias under Conflicting Information in Multilingual LLMs

多语言大模型中冲突信息下的语言偏见

Robert Östling, Murathan Kurfalı

机构 * Stockholm University(斯德哥尔摩大学) RISE Research Institutes of Sweden(瑞典RISE研究机构)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究通过扩展“干草堆中的冲突针”范式至多语言环境,评估了不同规模的多语言大模型在回答问题时对冲突信息中不同语言的偏好,发现模型普遍存在语言偏见,尤其是对俄语的普遍偏见和对中文的偏好,且提示语言与信息语言匹配时更受青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02812 2026-06-03 cs.AI cs.CL 73%

Traj-Evolve: A Self-Evolving Multi-Agent System for Patient Trajectory Modeling in Lung Cancer Early Detection

Traj-Evolve:用于肺癌早期检测中患者轨迹建模的自进化多智能体系统

Sihang Zeng, Matthew Thompson, Ruth Etzioni, Meliha Yetisgen

机构 * University of Washington(华盛顿大学) Fred Hutch Cancer Center(Fred Hutch癌症中心) Google(谷歌)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Traj-Evolve,一种结合经验池和多智能体强化学习的自进化多智能体系统,通过检索相似患者和参数优化,在肺癌早期检测中优于9个强基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03644 2026-06-03 cs.AI 70%

AdapShot: Adaptive Many-Shot In-Context Learning with Semantic-Aware KV Cache Reuse

AdapShot: 自适应多示例上下文学习与语义感知的KV缓存重用

Jie Ou, Jinyu Guo, Shiyao Guo, Yuang Li, Ruiqi Wu, Zhaokun Wang, Wenyi Li, Wenhong Tian

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AdapShot方法,通过基于熵的探针机制动态优化示例数量,并结合语义感知的KV缓存重用策略,实现高效的多示例上下文学习,性能提升约10%,速度提升4.64倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27762 2026-06-03 cs.AI 70%

PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft

PEAM: 通过经验对比内化的参数化具身智能体记忆在Minecraft中的应用

Yuchen Guo, Junli Gong, Weicheng Wang, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) South China University of Technology(华南理工大学) Hong Kong Baptist University(香港 Baptist大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出PEAM框架,通过对比内化失败-纠正轨迹对,将经验转化为参数化技能,实现Minecraft中具身智能体的持续学习与高效执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14589 2026-06-03 cs.CL 70%

EndPrompt: Efficient Long-Context Extension via Terminal Anchoring

EndPrompt: 通过终端锚定实现高效长上下文扩展

Han Tian, Luxuan Chen, Xinran Chen, Rui Kong, Fang Wang, Jiamin Chen, Jinman Zhao, Yuchen Li, Jiashu Zhao, Shuaiqiang Wang, Haoyi Xiong, Linghe Kong, Dawei Yin

机构 * Nankai University(南开大学) Baidu Inc.(百度公司) Shanghai Jiao Tong University(上海交通大学) Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出EndPrompt方法,仅使用短训练序列通过终端锚定实现长上下文扩展,在LLaMA模型上从8K扩展到64K,性能超越全长度微调等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20183 2026-06-03 cs.CL 70%

Dual-Cluster Memory Agent: Resolving Multi-Paradigm Ambiguity in Optimization Problem Solving

双簇记忆智能体:解决优化问题求解中的多范式歧义

Xinyu Zhang, Yuchen Wan, Boxuan Zhang, Zesheng Yang, Lingling Zhang, Bifan Wei, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(教育部智能网络与网络security重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出双簇记忆智能体(DCM-Agent),通过无训练方式利用历史解决方案构建双簇记忆,并采用记忆增强推理动态导航解路径,在七个优化基准上平均性能提升11%-21%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03099 2026-06-03 cs.CL cs.AI 62%

PhotoCraft: Agentic Reasoning with Hierarchical Self-Evolving Memory for Deep Image Search

PhotoCraft: 具有层次自进化记忆的深度图像搜索代理推理

Kailin Lyu, Zhiqiang Yuan, Jianwei He, Qiwei Yan, Xuanbo Su, Nanxing Hu, Yang Liu, Ce Hao, Shengqian Qin, Lianyu Hu, Jinchao Zhang, Jie Zhou

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc.(微信AI模式识别中心,腾讯公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 提出PhotoCraft,一种无需训练的分层记忆系统,通过工作、情景和语义记忆增强多模态大语言模型,实现深度图像搜索中的多步推理和知识迁移,在DISBench上提升检索性能达18.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03329 2026-06-03 cs.AI 57%

InfoMem: Training Long-Context Memory Agents with Answer-Conditioned Information Gain

InfoMem: 基于答案条件信息增益训练长上下文记忆智能体

Tiancheng Han, Yong Li, Wuzhou Yu, Qiaosheng Zhang, Wenqi Shao

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 长上下文与记忆 :LLM(abstract_cn);分类 cs.AI

AI总结 提出InfoMem奖励机制,通过评估最终记忆对真实答案的每token对数似然增益,训练分块记忆智能体以提升长上下文任务性能。

Comments 17 pages, 7 figrues,

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 61 篇

2606.03705 2026-06-03 cs.AI 92%

Code-on-Graph: Iterative Programmatic Reasoning via Large Language Models on Knowledge Graphs

图上的代码:通过大型语言模型在知识图谱上进行迭代式程序化推理

Weiwei Ding, Zixuan Li, Long Bai, Zhuo Chen, Kun Su, Fei Wang, Xiaolong Jin, Jin Zhang, Jiafeng Guo, Xueqi Cheng

机构 * Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全重点实验室) Shandong University(山东大学) Shandong University-Weihai Research Institute of Industrial Technology(山东大学威海工业技术研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出Code-on-Graph (CoG)框架,通过将知识图谱模式表示为Python类并生成可执行代码,解决现有LLM-KG集成中操作符不灵活和知识注入不可扩展的问题,在WebQSP、CWQ和GrailQA上提升高达10.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03858 2026-06-03 cs.AI 91%

PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models

PyraMathBench: 评估与提升大型语言模型的数学能力

Zetian Ouyang, Linlin Wang, Gerard de Melo, Liang He

机构 * East China Normal University(东华师范大学) Hasso Plattner Institute, University of Potsdam(波茨坦大学哈索普兰特纳研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出PyraMathBench分层基准测试,通过整合数值处理与数学推理评估LLM,并引入SOLVE模块和IRPO优化方法提升数值-数学协同能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03731 2026-06-03 cs.LG stat.ML 90%

Conformal Language Modeling via Posterior Sampling

通过后验采样的共形语言建模

Nicolas Emmenegger, Theo X. Olausson, Armando Solar-Lezama, Chara Podimata

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 提出通过近似LLM后验采样(条件为校准的高分区域)来替代事后过滤,实现目标风险控制并提高下游效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03535 2026-06-03 cs.IR cs.CL 90%

Can LLM Rerankers Predict Their Own Ranking Performance?

LLM 重排序器能否预测自身的排序性能?

Shiyu Ni, Keping Bi, Jiafeng Guo, Jingtong Wu, Zengxin Han, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 研究 LLM 重排序器能否通过自一致性或口头化置信度来估计自身生成的排序质量,并提出两种监督方法 Verb-Num 和 Verb-List 以改进校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20316 2026-06-03 cs.LG 90%

R2IF: Aligning Reasoning with Decisions via Composite Rewards for Interpretable LLM Function Calling

R2IF: 通过复合奖励对齐推理与决策以实现可解释的LLM函数调用

Aijia Cheng, Kailong Wang, Ling Shi, Yongxin Zhao

机构 * Shanghai Key Laboratory of Trustworthy Computing, East China Normal University, Shanghai, China(上海可信计算实验室,华东师范大学,上海,中国) Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出R2IF框架,通过复合奖励(格式/正确性约束、思维链有效性奖励和规范-修改-价值奖励)和GRPO优化,对齐推理过程与工具调用决策,在BFCL/ACEBench上提升函数调用准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05290 2026-06-03 cs.AI 90%

X-RAY: Mapping LLM Reasoning Capability via Formalized and Calibrated Probes

X-RAY: 通过形式化与校准探针映射大语言模型推理能力

Tianxi Gao, Yufan Cai, Yusi Yuan, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出X-RAY系统,利用形式化工具生成结构可控的校准探针,通过分析约束交互、推理深度和解空间几何等属性,揭示LLM在约束细化与解空间重构下的推理不对称性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03030 2026-06-03 cs.GT econ.GN q-fin.EC 89%

Do Matching Mechanisms Work with LLM Agents?

匹配机制在LLM智能体市场中是否有效?

Yukihiro Hoshino, Ayato Kitadai, Nariaki Nishino

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 研究通过对比自由协商与集中式机制市场,发现基于机制的匹配市场在稳定性和效率上更优,且LLM智能体比人类更倾向于真实报告偏好,但策略证明性并非总能提高真实报告率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02673 2026-06-03 cs.AI cs.LG 88%

Visual Graph Scaffolds for Structural Reasoning in Large Language Models

大语言模型中用于结构推理的可视化图脚手架

Runlin Lei, Xiaokui Xiao, Zhewei Wei

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出将图结构作为大语言模型的内部推理辅助而非仅外部知识源,通过多跳问答实验发现视觉图引导相比文本化图在无直接答案提示时仍保持有效性,支持图作为组织推理的可视化脚手架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03761 2026-06-03 cs.CL 88%

Framing Migration News with LLMs: Structured CoT as a Support for Human Interpretation

使用LLM构建移民新闻框架:结构化思维链作为人类解释的支持

David Alonso del Barrio, Jing Wen, Daniel Gatica-Perez

机构 * Idiap Research Institute(日内瓦研究所) University of Geneva(日内瓦大学) EPFL(瑞士联邦理工学院)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL

AI总结 本研究提出结构化思维链(SCoT)提示方法,利用本地可部署的开源LLM(Llama3-8B)辅助移民新闻的框架分析,在单GPU上提升分类性能,并通过人类评估验证其逻辑性和对解释的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03102 2026-06-03 cs.CL 88%

Small RL Controller, Large Language Model: RL-Guided Adaptive Sampling for Test-Time Scaling

小规模RL控制器,大语言模型:基于RL引导的自适应采样用于测试时扩展

Runpeng Dai, Tong Zheng, Rui Liu, Chengsong Huang, Hongtu Zhu

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Maryland College Park(马里兰大学学院市分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出将自适应采样建模为马尔可夫决策过程,使用强化学习训练轻量级控制器,在答案正确性、延迟和计算成本之间取得平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03965 2026-06-03 cs.CL cs.AI 88%

Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning

Agentic Chain-of-Thought Steering:实现高效且可控的LLM推理

Yu Xia, Zhouhang Xie, Xin Xu, Byungkyu Kang, Prarit Lamba, Xiang Gao, Julian McAuley

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Agentic Chain-of-Thought Steering (ACTS)方法,通过强化学习训练控制器智能体在推理过程中自适应地选择推理策略和引导短语,实现预算感知的策略控制,从而在保持推理质量的同时显著节省token,并支持准确率-效率的可控权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17220 2026-06-03 cs.MA cs.AI 87%

Dynamics of Cognitive Heterogeneity: Investigating Behavioral Biases in Multi-Stage Supply Chains with LLM-Based Simulation

认知异质性动力学:基于大语言模型模拟的多阶段供应链中行为偏差研究

Jiuyun Jiang, Yuecheng Hong, Bo Yang, Jin Yang, Guangxin Jiang, Xiaomeng Guo, Guang Xiao

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过引入大语言模型模拟多阶段供应链,基于分层推理框架分析认知异质性对智能体交互的影响,发现信息共享可缓解短视和自利行为导致的系统效率低下。

Comments Accepted to the Main Conference of ACL 2026. 18 pages, 8 figures in total (9 pages, 7 figures for the main text)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19250 2026-06-03 cs.CL 87%

Can Structural Cues Save LLMs? Evaluating Language Models in Massive Document Streams

结构线索能否拯救LLM?评估大规模文档流中的语言模型

Yukyung Lee, Yebin Lim, Woojun Jung, Wonjun Choi, Susik Yoon

机构 * Boston University(波士顿大学) Korea University(韩国大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(title_cn,abstract_cn);分类 cs.CL

AI总结 本文提出StreamBench基准,通过主题聚类、时序问答和摘要任务评估语言模型在混合多事件的文档流中的表现,发现结构线索能提升聚类和时序QA性能,但时序推理仍是挑战。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02380 2026-06-03 cs.CY cs.AI 86%

LLMs, Reasoning and Plagiarism

可反驳性差距:大型语言模型推理验证中的挑战

Elchanan Mossel

机构 * Elchanan Mossel

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文指出当前声称LLM具备科学发现和通用智能的说法不满足波普尔可反驳性原则,并提出了提高科学透明度和可重复性的指南。

Comments The authors explicitly reserve all rights in this work. No permission is granted for the reproduction, storage, or use of this document for the purpose of training artificial intelligence systems or for text and data mining (TDM), including but not limited to the generation of embeddings, summaries, or synthetic derivatives. Claude and Gemini were used in writing this manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03304 2026-06-03 cs.CL cs.LG 86%

From Script to Semantics: Prompting Strategies for African NLI

从脚本到语义:非洲自然语言推理的提示策略

Anuj Tiwari, Terry Oko-odion, Hannah Nwokocha

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究系统评估了五种提示策略在斯瓦希里语、约鲁巴语和豪萨语的自然语言推理任务上的表现,发现对比提示策略最可靠且能显著提升模型性能。

Comments Accepted at the RAIL Workshop, LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01925 2026-06-03 cs.MA 86%

QoEReasoner: An Agentic Reasoning Framework for Automated and Explainable QoE Diagnosis in RANs

QoEReasoner: 用于RAN中自动化和可解释QoE诊断的智能体推理框架

Qizhe Li, Haolong Chen, Shan Dai, Zhuo Li, Zhiwei Hu, Xuan Li, Guangxu Zhu, Qingjiang Shi

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出QoEReasoner,一种基于LLM的智能体系统,通过确定性工具、领域知识库和历史案例库实现RAN中QoE退化的自动、可解释诊断,准确率提升18%-40%,诊断时间从30分钟降至3分钟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01898 2026-06-03 cs.LO 86%

Auto formalisation of Goedel's Second Incompleteness Theorem in Binary Recursive Arithmetic

二元递归算术中哥德尔第二不完备定理的自动形式化

Thierry Coquand

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 使用Claude在Agda中自动形式化了哥德尔第二不完备定理,基于Guard的证明大纲,并分析了LLM在数学形式化中的优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03883 2026-06-03 cs.AI cs.LG 86%

Reasoning Structure of Large Language Models

大型语言模型的推理结构

Frédéric Berdoz, Luca A. Lanzendörfer, Fabian Farestam, Roger Wattenhofer

机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.AI、cs.LG;LLM(comments)

AI总结 针对大型推理模型评估中隐藏不同推理结构的问题,提出基于逻辑谜题的基准测试和将非结构化轨迹转化为可验证推理图的方法,并定义推理效率指标,以量化分析推理拓扑结构。

Comments Accepted at ICML 2026 and presented at the ICLR 2026 workshop on LLM reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏