arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-12 至 2026-08-12 共收录 58 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 58 篇

2608.10492 2026-08-12 cs.AI cs.CY 新提交 92%

INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators

洞察学生的思维:在LLM学生模拟器中联合建模潜在推理与行动

Rose Niousha, Minwoo Kang, Narges Norouzi

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract,comments);large language model(abstract);prompting(abstract)

AI总结 该研究针对LLM学生模拟器仅复现学生行动却未捕捉其潜在推理的问题,提出INSIDE框架,通过在配对思考轨迹与行动上微调LLM,提升了模拟行动保真度与推理对齐度,最高对齐度达57.9%。

Comments Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11470 2026-08-12 cs.CL 版本更新 92%

The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes

LLM推理的周期表:推理范式、方法与失败模式的结构化综述

Avinash Anand, Mahisha Ramesh, Avni Mittal, Ashutosh Kumar, Rishitej Reddy Vyalla, Erik Cambria, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工大学) Nvidia AI Center (SNAIC)(英伟达人工智能中心(SNAIC)) MIDAS Lab, IIIT Delhi(IIIT德里MIDAS实验室) MIDAS Lab, IIT Mandi(IIT曼迪MIDAS实验室) Owl Autonomous Imaging, Inc.(Owl自主成像公司) College of Computing & Data Science, NTU Singapore(新加坡南洋理工大学计算与数据科学学院) NVIDIA AI Technology Centre, Singapore(英伟达新加坡人工智能技术中心) Department of Computer Science and Engineering, IIT Kanpur(IIT坎普尔计算机科学与工程系)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文系统综述了300多篇论文,提出LLM推理研究的结构化分类法,涵盖多种推理范式,分析方法论趋势,并总结常见限制与失败模式,旨在为开发更鲁棒、可解释和可泛化的推理系统提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10339 2026-08-12 stat.ME cs.AI stat.AP 新提交 90%

Expert-Guided g-computation with Large Language Models for Estimating Causal Effects on Timings: Applications to Hospital Quality Improvement

基于大型语言模型的专家引导g计算法估计时序因果效应:在医院质量改进中的应用

Patrick Vossler, Jialin Ouyang, F. Richard Guo, Anran Huang, Ali Shojaie, Lucas Zier, Fan Xia, Jean Feng

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 本研究提出专家引导g计算法(egg-computation),结合专家判断与LLM技术,用于估计医院干预措施对平均住院时长的因果效应,在模拟和真实医院数据中表现优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10149 2026-08-12 cs.LG 新提交 90%

REATS: LLM Reasoning-based Ensemble Learning for Adaptive Time Series Forecasting

REATS:基于大语言模型推理的集成学习用于自适应时间序列预测

Xu Zhang, Chang Xu, Hui Sun, Nan Ma, Zijian Zhang, Peng Wang, Wei Wang, Li Zhao

机构 * Fudan University(复旦大学) Microsoft Research(微软研究院) Nankai University(南开大学) Jilin University(吉林大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);SFT(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对单一时间序列预测模型的局限性,提出基于LLM推理的REATS集成方法,通过三方面设计实现样本自适应可解释加权,在八个基准测试上优于竞争基线,具备强泛化与迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26355 2026-08-12 cs.CL 版本更新 90%

Shorthand for Thought: Compressing LLM Reasoning via Entropy-Guided Supertokens

思维简写:通过熵引导的超令牌压缩LLM推理

Zhenyu Zhao, Sander Land, Daniel M. Bikel, Waseem Alshikh

机构 * Writer, Inc.(Writer公司)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过熵引导的超令牌压缩技术,减少LLM推理过程中的计算开销,同时保留推理结构信息,提升可解释性和效率。

Comments Accepted to COLM 2026. Code available at https://github.com/Writer/shorthand-for-thought

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10710 2026-08-12 cs.SE 新提交 89%

LLM Ensemble Fault Classification for Automotive HiL Validation

面向汽车HiL验证的大语言模型集成故障分类

Hamza Ouarrad, Mohammad Abboush, Andreas Rausch

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出可解释多LLM集成框架,结合异构LLM输出提升汽车HiL验证故障分类性能,经多车型多场景评估,Top-3集成优于单模型及Top-5集成,实现更优诊断效果。

Comments 8 pages, 3 figures. Accepted at the 23rd Workshop on Model Driven Engineering, Verification and Validation (MoDeVVa 2026), co-located with MODELS 2026. Original submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10530 2026-08-12 cs.CR cs.AI 新提交 89%

On Understanding, Identifying, and Mitigating Vulnerabilities in Agentic Large Language Models

关于智能体大语言模型漏洞的理解、识别与缓解

Md Jafrin Hossain, Mohammad Arif Hossain, Nirwan Ansari

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究针对智能体大语言模型安全开展系统文献综述,提出四层漏洞分类法,发现攻击研究多于防御研究、感知层漏洞研究占比偏高等现状,识别7个开放问题及架构耦合的核心不安全根源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03922 2026-08-12 cs.CL cs.AI cs.CV 版本更新 88%

HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models

HSSBench: 多模态大语言模型在人文学与社会科学能力评估中的基准测试

Zhaolu Kang, Junhao Gong, Jiaxu Yan, Wanke Xia, Yian Wang, Ziwen Wang, Huaxuan Ding, Zhuo Cheng, Wenhao Cao, Zhiyuan Feng, Siqi He, Shannan Yan, Junzhe Chen, Xiaomin He, Chaoya Jiang, Wei Ye, Kaidong Yu, Xuelong Li

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院) University of British Columbia(不列颠哥伦比亚大学) Renmin University of China(中国人民大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 HSSBench是一个专门评估多模态大语言模型在人文学与社会科学任务能力的基准测试,包含多语言样本,通过协作生成数据提升跨学科推理能力。

Comments ICLR 2026 (OpenReview: https://openreview.net/forum?id=iQsKotob31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07943 2026-08-12 cs.CR cs.AI cs.CL 版本更新 88%

Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents

POISE:面向LLM智能体的位置感知不可检测技能注入攻击

Haochang Hao, Dehai Min, Zhifang Zhang, Yunbei Zhang, Miao Xu, Yingqiang Ge, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) University of Queensland(昆士兰大学) Tulane University(路易斯安那州立大学) Rutgers University(罗格斯大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出POISE攻击方法,通过位置感知将恶意指令压缩为单一良性指令嵌入技能正文,在保持隐蔽性的同时实现89.3%的攻击成功率,比随机位置基线高28.0个百分点。

Comments Title changed from "POISE: Position-Aware Undetectable Skill Injection on LLM Agents" to "Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents"; the manuscript, figures, appendices, and reproducibility details have been updated. 15 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16481 2026-08-12 cs.AI 版本更新 88%

Leveraging Large Language Models for Causal Discovery: a Constraint-based, Argumentation-driven Approach

利用大语言模型进行因果发现:一种基于约束和论证的方法

Zihao Li, Fabrizio Russo

机构 * Department of Computing(计算系) Imperial College London(帝国理工学院伦敦分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出利用大语言模型作为不完美的专家,结合语义结构先验和条件独立性证据,实现因果发现的先进方法。

Comments Accepted at UAI 2026. 37 pages, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02937 2026-08-12 cs.LG cs.AI cs.CE 版本更新 88%

Proteo-R1: Reasoning Foundation Models for De Novo Protein Design

Proteo-R1:用于从头蛋白质设计的推理基础模型

Fang Wu, Weihao Xuan, Heli Qi, Hanqun Cao, Heng-Jui Chang, Zeqi Zhou, Haokai Zhao, Ma Jian, Carl Ma, Yu-Chi Cheng, Kuan Pang, Xiangru Tang, Zehong Wang, Guanlue Li, Hanchen Wang, Kejun Ying, Pan Lu, Chiho Im, Seungju Han, Peng Xia, Tinson Xu, Yinxi Li, Deyao Zhu, Pheng-Ann Heng, Naoto Yokoya, Masashi Sugiyama, Li Erran Li, Jure Leskovec, Yejin Choi

专题命中 推理与问题求解 :foundation model(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10441 2026-08-12 cs.LG cs.CL cs.IR 新提交 88%

Detecting an Effect Is Not Learning to Act on It: A Reward-SNR Floor for LLM Acquisition Agents

检测到效应不等同于学习基于该效应行动:LLM获取智能体的奖励信噪比下限

Ying Yuan

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 该研究指出检测信号平均效应与学习基于该效应行动存在差异,提出奖励信噪比下限,引入SHE模型,在三个推荐数据集上发现学习获取策略失效,因数据集SNR低于下限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10843 2026-08-12 cs.AI 新提交 87%

Hypothesis Frontier: Verifier Guided LLM and Symbolic Search for First-Order Induction

假设前沿:验证器引导的大语言模型与符号搜索用于一阶归纳

Serafim Batzoglou

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究提出Hypothesis Frontier框架,结合LLM与符号搜索,在匹配条件下比重复原始提示生成解决更多一阶归纳问题,还可简化所得公式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10483 2026-08-12 cs.AI cond-mat.mtrl-sci 新提交 87%

Predicting Space Groups of Double Perovskites by LLM with Dynamic Few-Shot Learning

基于动态少样本学习的大语言模型预测双钙钛矿的空间群

Jongwon Park, Inhyo Lee, Junhyeong Lee, Seunghwa Ryu

专题命中 推理与问题求解 :LLM(title,summary_cn);prompting(abstract);分类 cs.AI

AI总结 该研究提出基于LLM智能体的DyRIS框架,通过动态少样本检索与规则引导推理,在不平衡双钙钛矿数据集上提升了空间群预测的整体及少数类性能,验证了领域知识与LLM结合的有效性。

Comments 46 pages, 6 figures, Supplementary Information included(24 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05307 2026-08-12 cs.CL 版本更新 87%

MentorCollab: Large-to-Small Inference-Time Mentorship for Concise Reasoning in Language Models

MentorCollab: 选择性大到小推理时指导以实现高效推理

Haojin Wang, Yike Wang, Shangbin Feng, Hannaneh Hajishirzi, Yulia Tsvetkov

机构 * UIUC(伊利诺伊大学香槟分校) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 推理与问题求解 :language model(title,abstract);SLM(abstract,abstract_cn);small language model(abstract);分类 cs.CL

AI总结 MentorCollab通过选择性推理时指导,使小型模型在多步骤推理任务中实现高效协作,提升性能的同时降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11027 2026-08-12 cs.LG cs.CL 新提交 87%

Mapping and Measuring the Behavioral Evolution of Large Language Models

大型语言模型行为演化的映射与测量

Dong Qiao, Chris Ding, Jicong Fan

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

AI总结 本研究构建三种互补差异度,分析32个大型语言模型的行为,发现模型家族形成聚类、跨家族距离随时间减小等规律,且该方法具有标签无关性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09942 2026-08-12 cs.CL cs.AI cs.LG 新提交 87%

When Chain-of-Thought Helps and When It Hurts: An Empirical Investigation of the Serial-Depth Bottleneck in LLM Reasoning

思维链(CoT)何时有助、何时有害:大语言模型推理中序列深度瓶颈的实证研究

Tughanbulut Kurtulush

机构 * Vistula University(维斯图拉大学)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过实证发现,思维链(CoT)是带宽旁路而非通用推理增强器,在高深度推理任务中可提升大语言模型准确率,在浅层任务中冗余,其效果与任务序列深度、模型规模相关。

Comments 15 pages, 3 figures, 5 tables. Pre-registered study (OSF: https://osf.io/92jdk). Data and code: https://osf.io/hteuj

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10714 2026-08-12 cs.NI cs.AI cs.DC cs.ET cs.MA 新提交 86%

Conversational Orchestration for Organic 6G

面向有机6G的对话式编排

Masoud Shokrnezhad, Tarik Taleb

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对有机6G跨域编排的开销与可部署性问题,提出基于LLM驱动域代理的轻量级去中心化对话式编排框架,仿真验证其控制开销可控且决策质量稳健。

Comments 7 pages, 6 figures. Accepted for publication in IEEE Network Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10186 2026-08-12 cs.MA cs.AI cs.CY 新提交 86%

The Deliberative Deficit: An Empirical Critique of LLMs in Democratic Discourse

审议缺陷:对大型语言模型在民主讨论中的实证批判

Maurice Flechtner

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract,abstract_cn);分类 cs.AI

AI总结 该研究通过审议推理指数(DRI)评估1980次五智能体LLM运行,发现LLM群体讨论程序性质量与人类相当但主体间一致性提升小、视角多样性仅为人类的1/3,反转人类收敛模式,仅可作为人类推理的辅助工具而非自主审议智能体。

Comments 10 pages, archival publication at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09096 2026-08-12 cs.CL 版本更新 83%

Evo-Bench: Can Language Models Improve Agent Harness?

Evo-Bench:语言模型能否改进智能体框架?

Lisheng Huang, Chen Yang, Hao Zhou, Huatong Song, Zongchao Chen, Ran Le, Yang Song, Wayne Xin Zhao, Tao Zhang

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究推出首个智能体框架进化基准Evo-Bench,评估语言模型的自主框架优化能力,发现其在通用、搜索任务中优于人工框架,在办公任务中表现不佳,且合成框架可迁移提升各类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20173 2026-08-12 cs.AI cs.SE 版本更新 83%

A Methodology for Selecting and Composing Runtime Architecture Patterns for Production LLM Agents

为生产大语言模型代理选择和组合运行时架构模式的方法

Vasundra Srinivasan

机构 * AI Architect, Independent Researcher(人工智能架构师,独立研究员) Stanford School of Engineering(斯坦福大学工程学院)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出了一种方法,用于选择和组合运行时架构模式,以定义大语言模型代理的随机-确定性边界,并探讨其在不同代理类型中的应用及可靠性分解。

Comments 26 pages, 2 figures, 6 tables. Companion repo at https://github.com/vasundras/agent-runtime-patterns

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06578 2026-08-12 cs.AI cs.CL cs.LG 交叉投稿 82%

Divergent Response Modes in Frontier Language Models Under Steering Pressure

前沿语言模型在引导压力下的发散响应模式

Ali Jalal-Kamali

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估六种前沿语言模型在引导压力下的响应差异,发现模型间存在不同响应模式,以Llama为对象追溯到内部机制,相关发现经多实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08326 2026-08-12 cs.AI 版本更新 81%

StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning

StructReward:用于自修正多模态推理的高效结构化过程奖励

Yifan Li, Ruxin Sun, Tongzhou Zhao

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。

Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03031 2026-08-12 cs.AI 版本更新 81%

CastFSR: A Fast--Slow--Reflect Agentic Reasoning Framework for Context-Aware Time Series Forecasting

CastFSR:用于上下文感知时间序列预测的快慢反思智能体推理框架

Xiaoyu Tao, Mingyue Cheng, Bokai Pan, Chuang Jiang, Huanjian Zhang, Tian Gao, Yaguo Liu, Qi Liu, Enhong Chen

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出CastFSR智能体框架,将上下文感知时间序列预测建模为快慢反思工作流,通过实验证明其在公共数据集上的表现优于代表性基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09924 2026-08-12 cs.CL cs.AI cs.LG 版本更新 80%

LLMs Encode Their Failures: Predicting Success from Pre-Generation Activations

LLMs编码其失败:从预生成激活中预测成功

William Lugoloobi, Thomas Foster, William Bankes, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津大学牛津互联网研究所) FLAIR, University of Oxford(牛津大学FLAIR) Department of Computer Science, University College London(伦敦大学学院计算机科学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过预生成激活预测LLM在数学和编程任务中的成功率,发现模型内部表示能有效指导更高效的推理,且在MATH任务中通过模型池路由可提升性能并降低70%的推理成本。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10198 2026-08-12 cs.AI 新提交 79%

Post-Hoc Sparse Coding of Latent Communication Between Vision-Language Model Agents

视觉-语言模型智能体间潜在通信的事后稀疏编码

Di Wu, Xiaohui Zhu

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 该研究针对视觉-语言模型智能体间的潜在通信,通过事后稀疏自编码器压缩Vision Wormhole的传输数据,在保持性能的同时大幅减少了传输字节,为通信机制优化提供了方向。

Comments 9 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21412 2026-08-12 cs.AI cs.CL cs.SE 版本更新 79%

Euclid-MCP: A Model Context Protocol Server for Deterministic Logical Reasoning via Prolog

欧几里得-MCP:一个通过Prolog进行确定性逻辑推理的模型上下文协议服务器

Bartolomeo Bogliolo

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大型语言模型多步逻辑推理不可靠问题,提出开源的欧几里得-MCP服务器,通过引入欧几里得-IR及支持特定循环的工具接口实现确定性逻辑推理,经评估在处理大问题时效果优于LLMs,可作稳定推理基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27199 2026-08-12 cs.CL cs.LG 版本更新 79%

Forecasting With LLMs: Improved Generalization Through Feature Steering

利用大语言模型进行预测:通过特征引导改进泛化能力

Humzah Merchant, Bradford Levy

机构 * University of Chicago(芝加哥大学) University of Chicago, Illinois, United States(芝加哥大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文利用稀疏自编码器分析LLM内部状态,识别时间感知和前瞻偏差特征,并通过增强时间感知特征减少预测中的前瞻偏差,提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24287 2026-08-12 cs.CL cs.AI 版本更新 79%

Do LLMs Benefit From Their Own Words?

大型语言模型是否受益于自身话语?

Jenny Y. Huang, Leshem Choshen, Wei Sun, Omar Khattab, Ramón Fernandez Astudillo, Mehul Damani, Tamara Broderick, Jacob Andreas

机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) IBM Research(IBM研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,省略大型语言模型自身历史上下文可提高响应质量并减少内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10278 2026-08-12 cs.CV 新提交 78%

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

空间思维链:面向视觉语言模型的模态无关空间定位

Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 该研究提出轻量架构无关框架Space Tokens,将空间信息蒸馏为连续token融入VLMs的思维链,在VSI-Bench上提升两款模型性能,在尺寸估计任务达SOTA,实现高效空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏