arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 832 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 832 篇

2601.09402 2026-06-08 cs.CL 版本更新 90%

SEEK: Steering LLM Reasoning for RAG via Internal Reasoning Sketches

SEEK: 通过内部推理草图引导LLM推理用于RAG

Xinze Li, Yuqing Lan, Zhenghao Liu, Haidong Xin, Yukun Yan, Shuo Wang, Zheni Zeng, Sen Mei, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系,人工智能研究院) School of Intelligent Science and Technology, Nanjing University, China(南京大学智能科学与技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SEEK框架,通过构建结构化引导草图,迭代检索和填充知识槽,减少冗余检索,提升RAG性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08525 2026-08-17 cs.AI cs.CL cs.CY 版本更新 90%

Ads in AI Chatbots? An Analysis of How Large Language Models Navigate Conflicts of Interest

AI聊天机器人中的广告:大型语言模型如何应对利益冲突分析

Addison J. Wu, Ryan Liu, Shuyue Stella Li, Yulia Tsvetkov, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文分析了大型语言模型在面临用户与公司利益冲突时的决策问题,通过实验发现多数模型优先考虑公司利益而非用户福祉,展示了在广告推荐中潜在的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12811 2026-07-16 cs.CL cs.AI q-bio.NC 版本更新 90%

Left-right asymmetry in predicting brain activity from LLMs' representations emerges with their formal linguistic competence

在LLM表示中预测脑活动的左右不对称性随着其正式语言能力的出现而出现

Laurent Bonnasse-Gahot, Christophe Pallier

机构 * Centre d’Analyse et de Mathématique Sociales CNRS, EHESS, Paris, France(分析与数学社会中心 CNRS,EHESS,巴黎,法国) Cognitive Neuroimaging Unit CNRS, INSERM, CEA, Neurospin Center, 91191 Gif-sur-Yvette, France(认知神经成像单元 CNRS,INSERM,CEA,Neurospin中心,法国91191 Gif-sur-Yvette)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现LLM的正式语言能力与大脑预测活动的左右不对称性同步发展,且与算术或世界知识任务无关。

Journal ref Neurobiology of Language 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14274 2026-06-25 cs.LG cs.AI cs.LO 版本更新 90%

Discovering New Theorems via LLMs with In-Context Proof Learning in Lean

通过基于 Lean 的上下文证明学习利用 LLM 发现新定理

Kazumi Kasaura, Naoto Onda, Yuta Oriike, Masaya Taniguchi, Akiyoshi Sannai, Sho Sonoda

机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) RIKEN AIP NexaScience CyberAgent Kyoto University(京都大学) RIKEN AGIS Shiga University(大坂大学) NII NISTEP

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出猜想-证明循环(CPL)框架,利用 LLM 在 Lean 4 中迭代生成数学猜想并尝试证明,通过上下文学习重用先前定理的证明策略,提高难证定理的发现率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11790 2026-06-24 cs.CL cs.AI 版本更新 90%

Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions

使用未见过的随机变量问题对LLM的数学推理进行基准测试

Zijin Hong, Hao Wu, Su Dong, Junnan Dong, Yilin Xiao, Yujing Zhang, Zhu Wang, Feiran Huang, Linyi Li, Hongxia Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Tencent Youtu Lab(腾讯优图实验室) Beihang University(北京航空航天大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有数学基准的可靠性问题,提出RV-Bench方法,通过生成随机变量问题评估LLM的真实推理能力,发现模型在已见和未见数据分布上的能力不平衡,且推理泛化有限但可通过测试时扩展提升。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00012 2026-06-23 cs.LG cs.AI cs.CY cs.IR 版本更新 90%

OGD4All: A Framework for Accessible Interaction with Geospatial Open Government Data Based on Large Language Models

OGD4All: 基于大语言模型的可访问地理空间开放政府数据交互框架

Michael Siebenmann, Javier Argota Sánchez-Vaquerizo, Stefan Arisona, Krystian Samp, Luis Gisler, Dirk Helbing

机构 * Professorship of Computational Social Science, ETH Zurich(计算社会科学教授职位,苏黎世联邦理工学院) Esri R&D Center Zurich(埃斯里苏黎世研发中心) Complexity Science Hub(复杂性科学中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出OGD4All框架,结合语义检索、智能体推理和沙盒执行,实现基于大语言模型的地理空间开放政府数据交互,在430个数据集上达到98%分析正确率和94%召回率,有效减少幻觉风险。

Comments Author Accepted Manuscript (AAM). Proceedings of 2026 IEEE CAI (Granada, Spain). Update manuscript with final DOI. Code & data available at: https://github.com/ethz-coss/ogd4all

Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI), pp. 882-888

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07106 2026-06-12 cs.CV cs.AI cs.CL 版本更新 90%

Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models

Ex-Omni:为全模态大语言模型赋能3D面部动画生成

Haoyu Zhang, Zhipeng Li, Yiwen Guo, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) LIGHTSPEED Independent Researcher(独立研究员)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Ex-Omni模型,通过混合形状感知语音单元生成器和解码器解耦语义推理与时间生成,并引入统一令牌查询门控融合机制,实现全模态大语言模型同步生成语音和3D面部动画。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11189 2026-06-09 cs.AI cs.LG 版本更新 90%

Can Global XAI Methods Reveal Injected Behaviours in LLMs? SHAP vs Rule Extraction vs RuleSHAP

全局XAI方法能否揭示LLM中的注入行为?SHAP vs 规则提取 vs RuleSHAP

Francesco Sovrano

机构 * Collegium Helveticum at ETH Zurich(苏黎世联邦理工学院霍夫曼学院) Università della Svizzera italiana(瑞士联邦理工学院)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过统计验证的抽象将全局LLM信念映射为数值分数,提出RuleSHAP算法,结合全局SHAP与规则归纳,以更好地捕捉非单变量触发因素,平均MRR@1比RuleFit提升82%。

Comments Accepted for publication at KDD'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13278 2026-06-08 cs.CL cs.LG 版本更新 90%

AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning

AutoTool: 面向智能体推理的动态工具选择与集成

Jiaru Zou, Ling Yang, Yunzhe Qi, Sirui Chen, Mengting Ai, Ke Shen, Jingrui He, Mengdi Wang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :SFT(summary_cn,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出AutoTool框架,通过双阶段优化(SFT+RL轨迹稳定化和KL正则化Plackett-Luce排序)使大语言模型具备动态工具选择能力,在数学、科学、代码和多模态推理等任务上平均提升6.4%-7.7%。

Comments ICML2026; Best Paper Award at ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03421 2026-08-14 cs.MA 版本更新 89%

When Truth Is Distributed: Misinformation Derails Collective Fact Recovery in LLM-Based Multi-Agent Systems

当真相被分散时:错误信息会破坏基于大语言模型(LLM)的多智能体系统中的集体事实恢复

Chenfei Yan, Zeyang Yue, Feifei Zhao, Erliang Lin, Lu Jia, Haibo Tong, Mingyang Lyu, Chengyi Sun, Yi Zeng

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 本研究提出Hi-Agreement评估框架,发现基于LLM的多智能体系统中,关键证据持有者的虚假证词会破坏集体事实恢复,使恢复率从72.50%降至14.17%,且虚假证据会持续传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21642 2026-08-07 cs.CR 版本更新 89%

CARE: Pre-Execution Command Verification for Shell-Executing LLM Agents

CARE:用于执行 shell 的语言模型代理的执行前命令验证

Yu Liu, Wenxiao Zhang, Zhiwei Yang, Zhongyi Zhang, Hanqi Feng, Xinyu Wang, Peng Qiu, Yanbing Liu, Barnabas Poczos, Jin B. Hong

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究 LLM 代理执行 shell 命令时的调度风险,提出 CARE 验证器,通过规范化命令、推导证据并结合 LLM 判断,实现命令级调解,降低调度边界风险,平衡良性恢复、误报负担、延迟和危害降低之间的关系。

Comments Accepted by ISSRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12029 2026-08-05 cs.SE 版本更新 89%

Enhancing LLM Performance Through Debate: An Empirical Study on Multi-Agent Debate for Coding Tasks

通过辩论提升大语言模型性能:针对编码任务的多智能体辩论实证研究

Yong Jin Chun, Qihong Chen, Jiawei Li, Iftekhar Ahmed

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究探究多智能体辩论(MAD)在软件工程四类编码任务上的有效性,适配NLP的MAD框架并提出两种变体,证实结构化辩论可提升LLM编码性能,凸显其协作协同效应。

Comments accepted to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00667 2026-07-23 cs.CR cs.SE 版本更新 89%

zkCraft: Prompt-Guided LLM as a Zero-Shot Mutation Pattern Oracle for TCCT-Powered ZK Fuzzing

zkCraft: 基于提示的LLM作为零知识电路模糊测试的零样本突变模式Oracle

Rong Fu, Jia Yee Tan, Ziyu Kong, Shuning Zhang, Xianda Li, Kun Liu, Youjin Wang, Simon Fong

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 zkCraft结合确定性R1CS感知本地化与证明承载搜索,通过编码候选约束编辑为Row-Vortex多项式,利用LLM驱动的突变模板检测语义不一致,降低误报并提升ZK电路开发的鲁棒性。

Comments 36 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18030 2026-07-15 cs.HC 版本更新 89%

ParaTutor: Coordinating Parent and Child Math Tutoring through Role Separated LLM Scaffolding

ParaTutor: 通过角色分离的实时脚手架界面实现LLM介导的亲子辅导

Lan Luo, Anqi Wang, Muzhi Zhou, Junhua Zhu, Jie Cai, Ao Yu, Hui Pan

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 针对亲子辅导中角色不对称问题,提出ParaTutor系统,通过为家长提供辅导指导、为孩子提供视觉基础,在实时互动中保持家长主导和孩子参与,实验表明优于通用LLM辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16662 2026-07-03 cs.MA 版本更新 89%

Evaluating Collective Behaviour of Hundreds of LLM Agents

评估数百个LLM代理的集体行为

Richard Willis, Jianing Zhao, Yali Du, Joel Z. Leibo

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出框架评估LLM代理在社会困境中的涌现行为,通过自然语言策略生成与代码翻译,分析行为指纹、自博弈福利及文化演化,发现大群体中文化演化收敛至低福利自私均衡。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04806 2026-06-29 cs.SE 版本更新 89%

MIRAGE: Online LLM Simulation for Microservice Dependency Testing

MIRAGE:微服务依赖测试的在线LLM模拟

XinRan Zhang

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 MIRAGE通过在线LLM模拟动态响应微服务依赖请求,提升测试场景的覆盖率和准确性,尤其在错误处理和代码推理方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22354 2026-06-23 cs.RO 版本更新 89%

LLM-Based Generalizable Hierarchical Task Planning and Execution for Heterogeneous Robot Teams with Event-Driven Replanning

基于LLM的异构机器人团队通用分层任务规划与执行及事件驱动重规划

Suraj Borate, Bhavish Rai B, Vipul Pardeshi, Madhu Vadali

机构 * Department of Mechanical Engineering, IIT Gandhinagar(印度加尔各直辖区理工学院机械工程系) Sahyadri College of Engineering and Management(萨哈亚德里工程与管理学院) Vishwakarma Institute of Information Technology(维什瓦克arma信息技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出CoMuRoS架构,结合集中式规划与分布式执行,通过LLM解释自然语言目标、分配子任务,并支持事件驱动重规划,在硬件实验中实现自主恢复和协调运输。

Comments full version of this short paper is accepted at Frontiers in Robotics and AI Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26760 2026-06-15 cs.IR 版本更新 89%

Factorized Latent Reasoning for LLM-based Recommendation

基于分解潜在推理的LLM推荐方法

Tianqi Gao, Chengkai Huang, Zihan Wang, Cao Liu, Ke Zeng, Lina Yao

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对现有潜在推理方法用单向量表示用户意图难以捕捉多面偏好的问题,提出分解潜在推理框架,通过多因子注意力模块解耦偏好因子,结合正则化与强化学习提升推荐性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19945 2026-06-15 cs.CR 版本更新 89%

Multi-LLM Energy Reasoning for Binary-Free Zero-Day IoT Detection

多LLM能量推理用于无二进制零日物联网检测

Saeid Jamshidi, Foutse Khomh, Kawser Wazed Nafi, Omar Abdul-Wahab, Martine Bellaïche

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出一种无需二进制文件、架构无关的方法,通过三LLM推理架构和能量感知符号负载模型,利用高层描述符估计零日漏洞可能性,模拟评估显示高风险条件下预测概率提升20-35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16136 2026-06-09 cs.RO 版本更新 89%

Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning

基于思维图的奖励进化:一种用于强化学习的双层语言模型框架

Changwei Yao, Xinzi Liu, Chen Li, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 本文提出RE-GoT框架,结合LLM与VLM的图思维推理,通过任务分解和视觉反馈迭代优化奖励函数,实验表明在RoboGen和ManiSkill2任务中均优于现有方法。

Journal ref IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06756 2026-08-10 cs.CL 版本更新 89%

How Long Reasoning Chains Influence LLMs' Judgment of Answer Factuality

推理链长度如何影响LLM对答案事实性的判断

Minzhu Tu, Shiyu Ni, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing University of Post and Telecommunications(北京邮电大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了推理链对LLM判断答案事实性的影响,发现弱判官易受推理存在影响,而强判官部分利用推理作为证据,但仍易被高质量推理链误导。

Comments ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14591 2026-08-06 cs.SD cs.AI 版本更新 89%

AudioDER: A Deduplication-Enhanced Reasoning Dataset for Post-Training Large Audio-Language Models

AudioDER: 一种用于后训练大型音频语言模型的去重增强推理数据集

Hui Geng, Yi Su, Zijian Gao, Tianjiao Wan, Qisheng Xu, Jiaxin Chen, Hengzhu Liu, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Shanghai Jiaotong University(上海交通大学)

专题命中 推理与问题求解 :language model(title,abstract);post-training(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 针对现有音频-语言数据集冗余导致后训练效果下降的问题,提出基于声学相似性去重的数据构建流程,生成包含191k样本的推理导向数据集AudioDER,显著提升LALM在多个音频推理基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01427 2026-07-31 cs.AI 版本更新 89%

A Tale of LLMs and Induced Small Proxies: Scalable Small Language Models for Knowledge Mining

小型语言模型代理实现高效高质量的知识挖掘

Sipeng Zhang, Longfei Yun, Zilong Wang, Letian Peng, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Carneigie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title);LLM(abstract_cn);large language model(abstract)

AI总结 提出Falconer框架,结合大语言模型的代理推理与轻量级代理模型,通过规划与标注实现可扩展的知识挖掘,在保持指令遵循精度的同时降低90%推理成本并加速20倍以上。

Comments Code available: https://github.com/LongfeiYun17/falconer

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21438 2026-07-28 cs.AI 版本更新 89%

Evo-DKD: Dual-Knowledge Decoding for Autonomous Ontology Evolution in Large Language Models

Evo-DKD:用于大语言模型中自主本体进化的双知识解码

Vishal Raman, Vijai Aravindh R, Abhijith Ragav

机构 * Radian Group Inc.(Radian集团) Sri Sivasubramaniya Nadar College Of Engineering(纳德工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究针对本体和知识图谱进化难题,提出Evo-DKD双解码器框架,结合结构化遍历与非结构化推理,通过动态注意力机制协调,经模拟在单流模式下近似双解码,实验证明其在多领域用例中优于基线,为知识库维护提供新范式。

Comments 6 pages, 6 figures, 2 tables. Accepted for publication at IEEE ICMLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07892 2026-07-08 cs.SE cs.AI 版本更新 89%

Leveraging Metamemory Agent for Enhanced Data-Free Code Generation in Large Language Models

利用元记忆智能体增强大语言模型的无数据代码生成

Shengsheng Zhou, Shuai Wang, Liang Ding, Yibing Zhan, Yong Luo, Zheng He, Fu Lin, Dapeng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) School of Computer Science, National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(多媒体软件国家工程研究中心计算机学院,武汉大学,中国) The University of Sydney, Sydney, Australia(悉尼大学,澳大利亚) Yunnan United Vision Technology Company Ltd., China(云南联合视界技术有限公司,中国) School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,中国) School of Information Science and Engineering, Yunnan University, Kunming, China(云南大学信息科学与工程学院,中国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 提出元记忆智能体,通过引导模型回忆、评估和选择性利用相关知识,无需外部示例即可提升无数据场景下的单次代码生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22284 2026-06-26 cs.LG 版本更新 89%

BrepCoder: A Unified Multimodal Large Language Model for Multi-task B-rep Reasoning

BrepCoder: 用于多任务B-rep推理的统一多模态大语言模型

Mingi Kim, Yongjun Kim, Jungwoo Kang, Hyungki Kim

机构 * Chungnam National University(全南国立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 提出BrepCoder,一种统一的多模态大语言模型,通过将CAD建模序列转换为类Python代码并与B-rep对齐,采用两阶段训练策略,实现从B-rep输入执行多种CAD任务,包括补全、纠错和问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05833 2026-06-19 cs.CV cs.AI 版本更新 89%

Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models

从视频中学习几何表示以实现空间智能多模态大语言模型

Haibo Wang, Lifu Huang

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出GeoVR框架,通过从2D视频序列中蒸馏3D几何知识(包括相机姿态、深度图、尺度因子和多尺度3D特征),重塑多模态大语言模型的内部表示以赋予其空间智能,在空间推理基准上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01413 2026-08-17 cs.CL cs.AI 版本更新 89%

Adaptive Stopping for Multi-Turn LLM Reasoning

多轮LLM推理中的自适应停止

Xiaofan Zhou, Huy Nguyen, Bo Yu, Chenxi Liu, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Augustana College(奥古斯塔纳学院) University of Utah(犹他大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MiCP框架,通过分配不同误差预算实现多轮推理中的自适应停止,同时保证覆盖率,减少轮次、推理成本和预测集规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03472 2026-07-23 cs.CL cs.AI 版本更新 89%

Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution

词汇丢弃:LLM共同进化中的课程多样性

Jacob Dineen, Aswin RRV, Zhikun Xu, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM共同进化中问题多样性崩溃的问题,提出词汇丢弃机制,通过在策略训练和课程生成时随机掩码输出logits维持多样性,在数学推理任务上提升求解器性能平均+4.4点。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26104 2026-07-14 cs.CL cs.AI 版本更新 89%

Assert, don't describe: Linguistic features that shift LLM reasoning about animal welfare

断言,而非描述:改变LLM关于动物福利推理的语言特征

Jasmine Brazilek, Harper Dunn

机构 * Compassion Aligned Machine Learning (CaML)(同情对齐机器学习实验室) Independent researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过词汇匹配的立场对比探针,测量十种语言特征对Llama-3.2-1B模型动物福利推理的影响,发现断言性确定性等七种特征增强支持动物福利,而模糊语言等两种特征削弱立场。

详情

展开后加载摘要…

URL PDF HTML 收藏