arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-26 至 2026-05-26 共收录 663 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 104 篇

2506.17629 2026-05-26 cs.CV cs.AI cs.CL 85%

CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning

CLiViS: 通过语言-视觉协同释放认知地图用于具身视觉推理

Kailing Li, Qi'ao Xu, Tianwen Qian, Yuqian Fu, Yang Jiao, Xiaoling Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) King Abdullah University of Science and Technology(科廷大学) Fudan University(复旦大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出CLiViS框架,通过LLM进行高层任务规划并协调VLM驱动的开放世界视觉感知,构建动态认知地图以迭代更新场景上下文,实现无需训练的具身视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23972 2026-05-26 cs.AI cs.CL cs.RO 85%

Why We Need World Models for AGI: Where LLMs Fail and How World Models May Outperform

为什么我们需要世界模型来实现通用人工智能:大语言模型失败之处以及世界模型如何可能超越

Feisal Alaswad, Batoul Aljaddouh, Maher Alrahhal, Poovammal E, Talal Bonny

机构 * Department of Computing Technologies(计算技术系) SRM Institute of Science and Technology(SRM科学与技术学院) Bio-Sensing and Bio-Sensors Group(生物传感与生物传感器组) Smart Automation and Communication Technologies Research Institute of Sciences and Engineering(科学与工程智能自动化与通信技术研究所) University of Sharjah, UAE(阿联酋沙迦大学) Department of Computer Engineering(计算机工程系) College of Computing and Informatics(计算与信息学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过提出潜在动态推理(LDI)概念和Flux环境案例研究,论证了大语言模型在因果推理、状态跟踪和长程规划上的局限性,并展示基于显式状态空间的强化学习智能体在长程游戏中显著优于纯文本LLM。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21734 2026-05-26 cs.CL cs.AI 85%

Asking LLMs to Verify First is Almost Free Lunch

先让LLMs验证几乎是免费的午餐

Shiguang Wu, Quanming Yao

机构 * Department of Electonic Engineering(电子工程系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Verification-First (VF)策略,通过先验证候选答案再生成解决方案,以低计算开销提升推理能力,并扩展为Iter-VF迭代方法,在多个基准上优于标准CoT和现有TTS策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24697 2026-05-26 cs.CL cs.AI 84%

The Path Matters: Learning a Token-Commitment Policy for Diffusion Language Models

路径很重要:学习扩散语言模型的令牌提交策略

Bohang Sun, Max Zhu, Francesco Caso, Jindong Gu, Junchi Yu, Philip Torr, Pietro Liò, Jialin Yu

机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TraceLock,一种轻量级可插拔控制器,通过学习可复用的轨迹状态策略来优化扩散语言模型中的令牌提交决策,从而改善质量与步数之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15835 2026-05-26 cs.CL cs.AI cs.SE 84%

Pragmatic Reasoning improves LLM Code Generation

语用推理提升LLM代码生成

Zhuchen Cao, Sven Apel, Adish Singla, Vera Demberg

机构 * Max Planck Institute for Informatics Saarland Campus(马克斯·普朗克信息研究所萨尔兰州分校) Computer Science Saarland University(萨尔兰州大学计算机科学系) Max Planck Institute for Software Systems Saarland Campus(马克斯·普朗克软件系统研究所萨尔兰州分校)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出CodeRSA方法,通过局部语用竞赛对候选代码进行重排序,以解决自然语言到代码生成中的歧义问题,在多个基准测试中取得最佳平均准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12576 2026-05-26 cs.CL cs.AI 84%

Coupled Variational Reinforcement Learning for Language Model General Reasoning

耦合变分强化学习用于语言模型通用推理

Xueru Wen, Jie Lou, Yanjiang Liu, Hongyu Lin, Ben He, Xianpei Han, Le Sun, Yaojie Lu, Debing Zhang

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出CoVRL方法,通过混合采样策略耦合先验和后验分布,将变分推理与强化学习结合,以解决无验证器强化学习中探索效率低和推理轨迹与答案不一致的问题,在数学和通用推理基准上提升性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24960 2026-05-26 cs.CL cs.AI cs.LG 83%

Investigating the Interplay between Contextual and Parametric Chain-of-Thought Faithfulness under Optimization

探究优化下上下文与参数化思维链忠实性之间的相互作用

Jingyi Sun, Qianli Wang, Pepa Atanasova, Nils Feldhus, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学) Technische Universität Berlin(柏林技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD – 柏林学习与数据基础研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过提出统一偏好对齐接口FaithMate,研究上下文与参数化两种思维链忠实性范式在优化下的相互作用,发现两者正相关但不对称,且上下文忠实性指标间存在权衡。

Comments The first two authors contributed equally and share first-authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25958 2026-05-26 cs.CL cs.CE 83%

PolyGnosis 2.0: Enhancing LLM Reasoning via Agentic Harness Engineering for Polymarket and OSINT Insight Extraction

PolyGnosis 2.0: 通过智能体工程增强LLM推理,用于Polymarket和OSINT洞察提取

Daren Wang, Hong Xu, Jiawen Xian

机构 * The Chinese University of Hong Kong(香港中文大学) Evolution AI Lab(进化人工智能实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出PolyGnosis 2.0多智能体架构,通过融合Polymarket异常信号与全球开源情报(GDELT)来提取预测情报,并量化“视角错配”作为高阿尔法交易信号,同时评估“工具工程”技术(如反射循环、工具调用、分治和思维链)在高噪声金融领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20416 2026-05-26 cs.LG physics.comp-ph 83%

Miller-Index-Based Latent Crystallographic Fracture Plane Reasoning and generation with Vision-Language Models

基于米勒指数的潜在晶体学断裂面推理与生成:视觉-语言模型方法

Qinwu Xu, Xiaofu Ma, Yifan Jiang

机构 * Independent research(独立研究)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 研究多模态大语言模型能否利用米勒指数作为结构化潜在表示来推理断裂几何,实验表明模型在理想条件下可进行潜在推理,并能拒绝不适用物理的表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25186 2026-05-26 cs.CL cs.AI 82%

By Their Fruits You Will Know Them: Comparing Formalizations of Law by the Decisions They Encode

凭其果实,你们将认识它们:通过编码的决策比较法律的形式化

Julius Vernie, Matthias Grabmair

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出一种系统方法,通过SAT求解器枚举不同形式化在边缘案例上的分歧,并转化为具体事实场景,以比较同一法律条款的不同形式化,应用于九个前沿LLM生成的十个欧盟条款形式化,发现行为分歧与结构一致性基本不相关。

Comments 23 pages, 17 figures, submitted to EMNLP PROC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13323 2026-05-26 cs.AI cs.LG 82%

Error-Driven Prompt Optimization for Arithmetic Reasoning

基于错误驱动的算术推理提示优化

Árpád Pándy, Róbert Lakatos, András Hajdu

机构 * Deptartment of Data Science & Visualization, Faculty of Informatics, University of Debrecen(数据科学与可视化系,信息学院,德布勒恩大学)

专题命中 推理与问题求解 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种错误驱动的提示优化框架,通过聚类错误预测迭代优化提示规则,使小型本地语言模型在算术推理任务中准确率达到70.8%,超越GPT-3.5 Turbo。

Journal ref IEEE Access, vol. 14, pp. 62570-62583, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02839 2026-05-26 cs.RO 82%

Language Movement Primitives: Grounding Language Models in Robot Motion

语言运动基元:将语言模型锚定在机器人运动中

Yinlong Dai, Benjamin A. Christie, Daniel J. Evans, Dylan P. Losey, Simon Stepputtis

机构 * Collab , Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, VA 24061(合作组,机械工程系,弗吉尼亚理工学院,黑斯堡,VA 24061) TEA Lab , Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, VA 24061(TEA实验室,机械工程系,弗吉尼亚理工学院,黑斯堡,VA 24061)

专题命中 推理与问题求解 :language model(title,abstract);foundation model(abstract)

AI总结 提出语言运动基元(LMP)框架,通过将视觉语言模型(VLM)推理与动态运动基元(DMP)参数化结合,实现零样本机器人操作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04906 2026-05-26 cs.AI 81%

Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games

Strat-Reasoner:在多智能体游戏中增强大语言模型的战略推理能力

Yidong He, Yutao Lai, Pengxu Yang, Jiarui Gan, Jiexin Wang, Yi Cai, Mengchen Zhao

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Strat-Reasoner框架,通过递归推理范式和集中式思维链比较模块,结合混合优势与组相对强化学习,提升大语言模型在多智能体游戏中的战略推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19988 2026-05-26 cs.CL 81%

AgentCoMa: A Compositional Benchmark Mixing Commonsense and Mathematical Reasoning in Real-World Scenarios

AgentCoMa:一个混合常识与数学推理的现实场景组合基准

Lisa Alazraki, Lihu Chen, Ana Brassard, Joe Stacey, Hossein A. Rahmani, Marek Rei

机构 * Imperial College London(帝国理工学院伦敦分校) RIKEN(日本研究机构) University of Sheffield(谢菲尔德大学) University College London(伦敦大学学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出AgentCoMa基准,测试大语言模型在组合常识与数学推理任务上的性能,发现模型在单独步骤上准确率高但组合后平均下降近30%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15777 2026-05-26 cs.AI 81%

SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?

SaaS-Bench:计算机使用代理能否利用真实世界SaaS解决专业工作流程?

Kean Shi, Zihang Li, Tianyi Ma, Zengji Tu, Jialong Wu, Xinbo Xu, Qingyao Yang, Ruoyu Wu, Weichu Xie, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

机构 * UniPat AI PKU(北京大学) HKU(香港大学) G Labs(0G实验室) Pipeline Lab(Pipeline实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SaaS-Bench基准,包含23个可部署SaaS系统和106个真实工作场景任务,评估计算机使用代理在长期规划、跨应用协调等能力上的表现,发现最强模型端到端任务完成率不足4%。

Comments 24 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08150 2026-05-26 cs.CL 81%

Verbalized Algorithms: Classical Algorithms are All You Need (Mostly)

言语化算法:经典算法就是你所需要的(大部分)

Supriya Lall, Christian Farrell, Hari Pathanjaly, Marko Pavic, Sarvesh Chezhian, Masataro Asai

机构 * MIT CSAIL(MIT 计算与人工智能实验室) MIT-IBM Watson AI Lab(MIT-IBM 沃森人工智能实验室) IBM Infrastructure(IBM 基础设施) Marist University(马里斯特大学) UC Irvine(加州大学尔湾分校) IBM Research Cambridge, USA(IBM 英国剑桥研究中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出言语化算法(VA)范式,将LLM作为可靠的基本操作(如字符串比较)集成到经典算法中,以提升推理的准确性和效率。

Comments Accepted in NeurIPS 2025 Workshop on Efficient Reasoning; Submitted to Position Paper Track at Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25189 2026-05-26 cs.LG cs.CL 81%

Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models

方向对齐缓解语言模型强化学习中的奖励黑客问题

Wenlong Deng, Jiaji Huang, Kaan Ozkara, Yushu Li, Christos Thrampoulidis, Xiaoxiao Li, Youngsuk Park

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Amazon(亚马逊)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 通过分析强化学习更新的几何结构,发现奖励黑客源于优化偏离稳定低维学习轨迹,提出可信方向投影方法约束梯度在干净参考子空间内,延迟捷径利用并保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26017 2026-05-26 cs.SE 80%

Trustworthy Software Project Generation : a Case Study with an Interactive Theorem Prover

可信软件项目生成:以交互式定理证明器为例的案例研究

Jian Fang, Yingfei Xiong

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 本文研究利用交互式定理证明器(ITP)从自然语言需求自动生成大规模可信软件项目,通过将纯逻辑与有副作用的代码分离,在Rocq中完成验证并提取C++代码,成功生成一个RISC-V RV32I CPU解释器,证明了ITP作为LLM生成软件验证后端的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25486 2026-05-26 cs.IR 80%

RAG-Match: Retrieval-Augmented Knowledge Injection and Hierarchical Reasoning for Calibrated Semantic Relevance

RAG-Match:面向校准语义相关性的检索增强知识注入与分层推理

Hengjun Jiang, Liansheng Sun, Yan Jiang, Xiaojie Ke, Yongjin Wang, Xiangkun Liu, Cunxin Gu, Jian Xu, Guanjun Jiang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);pretraining(abstract);preference optimization(abstract)

AI总结 提出RAG-Match三阶段框架,通过知识增强预训练、分层推理对齐和偏好决策校准,提升搜索场景中细粒度语义相关性判断的准确性。

Comments 17 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03318 2026-05-26 cs.CV 80%

EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs

EgoMind: 通过多模态大语言模型中的语言推理激活空间认知

Zhenghao Chen, Huiqun Wang, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出EgoMind框架,通过角色扮演描述和渐进空间分析的无几何空间推理方法,仅用少量数据即可在多基准测试中提升MLLMs的空间推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12628 2026-05-26 cs.CV 80%

Creative4U: MLLMs-based Advertising Creative Image Selector with Comparative Reasoning

Creative4U: 基于MLLMs的广告创意图像选择器与比较推理

Yukang Lin, Xiang Zhang, Shichang Jia, Bowen Wan, Chenghan Fu, Xudong Ren, Yueran Liu, Wanxian Guan, Pengji Wang, Jian Xu, Bo Zheng, Baolin Liu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出基于多模态大语言模型的创意图像评估与选择范式,通过构建比较推理数据集CreativePair和强化学习方法Creative4U,实现可解释的创意选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26038 2026-05-26 cs.CV cs.AI 79%

DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models

DRScaffold:提升轻量级视觉语言模型在密集场景推理中的能力

Xinrui Shi, Kai Liu, Ziqing Zhang, Jianze Li, Anqi Li, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 针对轻量级视觉语言模型在密集场景推理中缺乏显式视觉锚定导致推理链不可靠的问题,提出DRScaffold监督微调框架,通过将监督目标分解为四个因果有序阶段,在不修改架构的情况下强制进行有根据的推理,显著提升密集场景推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26014 2026-05-26 cs.CV cs.CL 79%

STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models

STORM: 视频语言模型中时空推理的内化建模

Yiming Liang, Yixiao Chen, Yiyang Zhou, Yixuan Wang, Shoubin Yu, Andong Deng, Fuxiao Liu, Qin Zhang, Chen Chen, Mohit Bansal, Huaxiu Yao

机构 * Purdue(普渡大学) Harvard(哈佛大学) UNC(北卡罗来纳大学教堂山分校) UCF(佛罗里达大学) NVIDIA(英伟达) Physion Labs(Physion 实验室)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 提出STORM框架,通过有界连续潜在轨迹内化推理过程,无需显式文本思维链或外部工具,提升视频推理准确性并降低推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22137 2026-05-26 cs.CL 79%

Cross-Lingual Consensus: Aligning Multilingual Cultural Knowledge via Multilingual Self-Consistency

跨语言共识:通过多语言自一致性对齐多语言文化知识

Andrew Ivan Soegeng, Patrick Sutanto, Tan Sang Nguyen

机构 * SAP School of Computing, National University of Singapore(国立新加坡大学计算机学院)

专题命中 推理与问题求解 :large language model(abstract,comments);language model(abstract,comments);prompting(abstract);分类 cs.CL

AI总结 提出一种自监督框架,利用多语言自一致性和自我批评机制,从本地语言表示中提取文化知识并迁移到英语,以缩小跨语言文化知识差距,在BLEnD基准上平均提升英语查询性能5.03%。

Comments Accepted to The 1st Workshop on Multilinguality in the Era of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25864 2026-05-26 cs.LG cs.CL 79%

When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards

当自我信念误导:面向可验证奖励的强化学习的主动标签获取

Li Wang, Xiaodong Lu, Xiaohan Wang, Yikun Ban, Jiajun Chai, Wei Lin, Tianhao Peng, Guojun Yin

机构 * Meituan(美团) Beihang University(北京航空航天大学) Nanyang Technological University(新加坡国立大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出RLAVR框架,通过主动获取少量真实标签并与伪标签结合,利用CAG指标和CARE策略稳定训练并提升有限标注预算下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02837 2026-05-26 cs.AI cs.CL 79%

Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents

超越最终答案:评估工具增强型智能体的推理轨迹

Wonjoong Kim, Sangwu Park, Yeonjun In, Sein Kim, Dongha Lee, Chanyoung Park

机构 * Graduate School of Data Science, KAIST, Daejeon, South Korea(数据科学研究生院,韩国科学技术院,大田,韩国) Department of Industrial and Systems Engineering, KAIST, Daejeon, South Korea(工业与系统工程系,韩国科学技术院,大田,韩国) Department of Artificial Intelligence, Yonsei University, Seoul, South Korea(人工智能系,延世大学,首尔,韩国)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对工具增强型LLM,提出无参考框架TRACE,通过证据库多维度评估推理轨迹的效率、幻觉和适应性,并用元评估数据集验证其有效性。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24867 2026-05-26 cs.AI cs.CL cs.NI 79%

Clustering as Reasoning: A $k$-Means Interpretation of Chain-of-Thought Graph Learning

聚类即推理:思维链图学习的 $k$-均值解释

Xuanting Xie, Zhaochen Guo, Bingheng Li, Xingtong Yu, Zhifei Liao, Zhao Kang, Yuan Fang

机构 * University of Electronic Science and Technology of China(电子科技大学) Singapore Management University(新加坡国立大学) Michigan State University(密歇根州立大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出KCoT框架,通过将Transformer块与$k$-均值算法建立数学对应,将思维链推理与图表示学习统一,实现迭代语义-拓扑交互,在标准基准上超越现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25901 2026-05-26 cs.CV cs.RO 78%

AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models

AgentGrounder:使用多模态语言模型的零样本3D视觉点云定位

Cuong Huynh, Maxim Popov, Denis Gridusov, Sergey Kolyubin

机构 * Biomechatronics and Energy-Efficient Robotics (BE2R) Lab, ITMO University(生物机械与高效能机器人实验室,ITMO大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 提出AgentGrounder框架,通过两阶段设计(离线构建对象查找表和在线工具驱动代理)实现零样本3D视觉定位,在ScanRefer和Nr3D上分别提升2.5%和6.3%的准确率。

Comments Code: https://github.com/be2rlab/AgentGrounder

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24305 2026-05-26 cs.LG cs.AI 77%

ChaosBench-Logic v2: Evaluating LLM Logical Reasoning over Dynamical Systems at Scale

ChaosBench-Logic v2: 大规模评估大语言模型在动力系统上的逻辑推理能力

Noel Thomas

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :LLM(title,comments);分类 cs.AI、cs.LG

AI总结 针对二元推理基准的准确性掩盖了关键缺陷,本文提出包含40,886个问题、覆盖165个动力系统的ChaosBench-Logic v2基准和CARE评估协议,揭示模型在状态转换推理、FOL演绎等任务上的表现差异和系统性反相关。

Comments 14 pages, 8 figures. Published at the ICLR 2026 Workshop on LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25384 2026-05-26 cs.CL 77%

GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving

GeoMathCode: 理解几何问题求解中交织的数学-代码推理

Yingji Zhang, Yong Dai, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) X-Humanoid Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Cancer Biomarker Centre, CRUK Manchester Institute(癌症生物标志物中心,CRUK曼彻斯特研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 本文提出GeoMathCode,通过程序化表示作为中间视觉输出,分析多模态大模型在几何问题中的推理与代码生成,发现推理与代码步骤在潜在空间可解耦,监督微调使推理流形更结构化,且层次化代码结构包含更多数学符号信息。

详情

展开后加载摘要…

URL PDF HTML 收藏