arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 92 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 92 篇

2510.03519 2026-08-04 cs.CL cs.AI 版本更新 92%

TS-Reasoner: Aligning Time Series Foundation Models with LLM Reasoning

TS-Reasoner:将时间序列基础模型与大语言模型推理能力对齐

Fangxu Yu, Hongyu Zhao, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 推理与问题求解 :LLM(title,abstract);foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 TS-Reasoner通过两阶段训练将时间序列基础模型与大语言模型对齐,在多个基准上性能优于同类模型且数据效率更高,解决了时间序列模型推理能力不足的问题。

Comments Accepted to Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01175 2026-08-04 cs.AI 新提交 92%

The Graph Language: How Knowledge Graphs Speak to Large Language Models

图语言:知识图谱如何与大语言模型对话

Giuseppe Pirrò

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对知识图谱与大语言模型融合的挑战,提出GRALAN模型,通过关系令牌实现KG在LLM语义空间的适配,在问答任务中显著优于现有方法,为KG-LLM融合提供新范式。

Comments Accepted to ISWC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00515 2026-08-04 cs.CR cs.AI cs.CL 新提交 91%

Auditable Release Control for Pedagogical Leakage in LLM Tutors

LLM辅导器中教学式泄露的可审计发布控制

Nizam Kadir

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM辅导器的教学式泄露问题,提出感知授权的可审计发布控制机制,经实验验证可显著降低泄露标记,且在安全与效用上优于基线方法。

Comments 9 pages, 1 figure, 6 tables. Preprint; not peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00099 2026-08-04 q-bio.GN cs.AI 新提交 91%

LLMBDC: Language Model for Biological Domains Oriented Clustering of Gene Ontology

LLMBDC:面向生物域的基因本体聚类语言模型

Ximing Ran, Jie Xu, Peng Jin, Zhaohui Qin, Zhexing Wen, Jiaying Lu

专题命中 推理与问题求解 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对GO富集分析的术语冗余问题,提出无需训练的LLMBDC框架,利用LLM零样本推理聚类GO术语为生物域,在AD和FXS数据集上较基线方法显著提升了聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24140 2026-08-04 cs.AI 版本更新 90%

HyperGuide: Hyperbolic Guidance for Efficient Multi-Step Reasoning in Large Language Models

HyperGuide: 用于大型语言模型高效多步推理的双曲引导

Yuyu Liu, Haotian Xu, Yanan He, Sarang Rajendra Patil, Mengjia Xu, Tengfei Ma

机构 * Department of Computer Science(计算机科学系) Stony Brook University(石英布鲁克大学) Department of Applied Mathematics and Statistics(应用数学与统计学系) Yale University(耶鲁大学) Department of Data Science(数据科学系) New Jersey Institute of Technology(新泽西理工学院) Department of Biomedical Informatics(生物医学信息学系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对多步推理中单次生成效率高但精度低、树搜索计算量大的问题,提出通过将推理进度蒸馏为双曲几何信号来引导逐步生成,利用双曲空间的距离和角度特性编码解接近度与分支区分,训练轻量头投影隐状态并微调适配器,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01732 2026-08-04 cs.IR cs.AI 新提交 90%

X-KGRank: A Knowledge Graph RAG Framework for Explainable Recommendations via Pattern Mining and LLM Re-Ranking

X-KGRank:一种基于知识图谱检索增强的推荐框架,通过模式挖掘与大语言模型重排序实现可解释推荐

Meenakshi Rajpurohit, Jainish Patel

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 X-KGRank是一种知识图谱检索增强推荐框架,结合协同过滤与LLM解释,在MovieLens-1M数据集上提升了推荐指标,且小参数LLM可实现相当的解释质量但更易产生事实错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00198 2026-08-04 cs.GT cs.CL 89%

Fairshare Data Pricing via Data Valuation for Large Language Models

Luyang Zhang, Cathy Jiao, Beibei Li, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01078 2026-08-04 cs.CL cs.AI 新提交 89%

Attend to Your Own Thoughts: Breaking the Barrier for Post-Training Quantization of Reasoning LLMs through the Lens of 1.58-Bit Quantization

关注自身思维:通过1.58比特量化视角打破推理型大语言模型的后训练量化障碍

Shigeng Wang, Chao Li, Yangyuxuan Kang, Jiawei Fan, Anbang Yao

机构 * Intel Labs China(英特尔中国实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);post-training(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出ScaleQ-1.58三值后训练量化框架,通过集成AYOT校准方法,提升推理型LLM量化性能,该框架可扩展且泛化性强,仅需少量校准token即可实现优异效果。

Comments This research work was completed and submitted for publication in early May 2026. The project page: https://github.com/IntelChina-AI/BitTern

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08876 2026-08-04 cs.LG 版本更新 89%

OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents

OTora:一种用于LLM代理推理层面拒绝服务攻击的统一红队框架

Xinyu Li, Ronghui Mu, Lin Li, Tianjin Huang, Gaojie Jin

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 OTora是首个统一的两阶段红队框架,用于实现推理层面拒绝服务攻击,通过优化对抗触发器和生成代理感知的推理负载,提升推理token数量和延迟,同时保持任务准确性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02089 2026-08-04 cs.LG cs.AI 新提交 88%

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models

推理摘要能透露多少信息?大语言模型的可观测性阶梯

Andres Algaba, Francesca Carlon, Lynn Delcon, Marthe Ballon, Bert Verbruggen, Vincent Ginis

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出大语言模型的可观测性阶梯,通过实验发现有提示时摘要对正确性监测的帮助远小于完整轨迹,可监测性由显示内容和读者共同决定。

Comments 71 pages, 13 figures, 65 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01319 2026-08-04 cs.AI 新提交 88%

Cognitive Demand Steering for Adaptive Meta-Reasoning in Large Language Models

大语言模型自适应元推理的认知需求引导

John Scoville, Shengzhuang Chen, Yejin Bang, Stefan Winzeck, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤森路透基础研究部) Imperial College London(帝国理工学院)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出无需训练的元推理框架CDS,通过认知量表刻画需求,在三类大模型和六个基准上较直接调用、标准CoT分别提升21.9%、9%准确率,难数学编码任务增益显著。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27553 2026-08-04 cs.AI cs.CL econ.GN q-fin.EC 版本更新 88%

AI and Its Impact on Creativity and Diversity: An Empirical Study of LLM-Generated Product Ideas

使用大型语言模型进行创新中的创意生成

Christian Terwiesch, Lennart Meincke, Karan Girotra, Ethan Mollick, Gideon Nave, Karl T. Ulrich

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究对比人类与GPT-4生成的大学生适用低价新产品创意,发现AI生成创意平均购买意向更高、跻身前10%的概率是人类的7倍,但新颖性较低,少样本提示效果略优于零样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06716 2026-08-04 cs.AI cs.CL cs.CR 版本更新 88%

SIEVE: Selective Integrity Verification and Escalation for Defending LLM Agents against Indirect Prompt Injection

认知控制架构(CCA):一种用于鲁棒对齐AI代理的生命周期监督框架

Zhibo Liang, Tianze Hu, Zaiye Chen, Mingjie Tang

机构 * Sichuan University(四川大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出认知控制架构(CCA),通过全生命周期认知监督框架,有效应对复杂IPI攻击,实现安全、功能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12244 2026-08-04 cs.RO 版本更新 88%

Any House Any Task: Scalable Long-Horizon Planning for Abstract Human Tasks

任何房屋任何任务:为抽象人类任务的可扩展长周期规划

Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AHAT是一种优化长周期规划的家庭任务规划器,通过结合LLM和TGPO算法,在复杂家庭任务中实现高效规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20639 2026-08-04 cs.CL cs.AI cs.LG 版本更新 88%

Latent Collaboration in Multi-Agent Systems

多智能体系统中的潜在协作

Jiaru Zou, Ruizhong Qiu, Gaotang Li, Xiyuan Yang, Katherine Tieu, Pan Lu, Ke Shen, Hanghang Tong, Yejin Choi, Jingrui He, James Zou, Mengdi Wang, Ling Yang

机构 * University of Washington(华盛顿大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LatentMAS框架,使LLM智能体在连续潜在空间直接协作,无需文本中介,实现更高精度、更低开销和更快推理。

Comments ICML2026 Spotlight, Project: https://github.com/Gen-Verse/LatentMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02026 2026-08-04 cs.AI 新提交 87%

HPFA: Hypergraph-Based Paired Failure Attribution for LLM Reasoning

HPFA:基于超图的大语言模型推理配对失败归因

Runchuan Zhu, Hongbin Lai, Bowen Jiang, Junrui Zhang, Zhangheng LI, Ostap Kilbasovych, Junyuan Hong

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究针对LLM推理的失败归因缺陷,提出HPFA框架,通过超图配对分析高效定位根本原因,提升归因准确率与效率,训练的归因器可改善推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01598 2026-08-04 cs.CL cs.AI 新提交 87%

PICTURE: Enhancing Theory-of-Mind in Large Language Models by Revealing, Not Hiding, Characters' Lack of Knowledge

PICTURE:通过揭示而非隐藏角色的知识缺失来增强大语言模型的心智理论能力

Eojin Jeon, SangKeun Lee

机构 * Korea University(高丽大学)

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对大语言模型心智理论推理中事件隐藏导致的性能下降问题,提出PICTURE提示方法,通过在思维链中明确角色知识缺失,使模型在错误信念任务上性能提升7.3%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02422 2026-08-04 cs.CR cs.AI 新提交 86%

Agentic Incident Response through Digital Twin-Enhanced Multiscale Planning

基于数字孪生增强多尺度规划的智能体事件响应

Yiran Gao, Tao Li, Kim Hammar

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对现有智能体事件响应方法的局限,提出结合决策论规划与LLM的多尺度方法,经实验验证可显著缩短恢复时间、提升恢复率。

Comments 31st European Symposium on Research in Computer Security (ESORICS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06423 2026-08-04 cs.CL 版本更新 86%

On the Wings of Imagination: Conflicting Script-based Multi-role Framework for Humor Caption Generation

在想象之翼上:用于幽默标题生成的冲突脚本多角色框架

Wenbo Shang, Yuxi Sun, Jing Ma, Xin Huang

机构 * Hong Kong Baptist University(香港 Baptist 大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于幽默理论GTVH的HOMER框架,通过多角色LLM协作生成幽默标题,实验表明其在多模态幽默标题生成中优于现有方法。

Comments Paper published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01575 2026-08-04 cs.LG cs.AI 新提交 86%

Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal standard

基于精确贝叶斯最优标准测量语言模型的上下文内算法推理能力

Hector Zenil, Luan Ozelim

机构 * Oxford Immune Algorithmics(牛津免疫算法学公司) Oxford University Innovation(牛津大学创新公司) London Institute for Healthcare Engineering(伦敦医疗工程研究所) King’s College London(伦敦国王学院)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出F-ICL基准,以精确贝叶斯最优标准测量语言模型的上下文内算法推理能力,发现多数模型分布与最优标准存在差距,该差距与准确率无关且不受模型规模缩小,基准已开放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22536 2026-08-04 cs.CL cs.AI 版本更新 86%

A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models

用于推理增强型语言模型的综合FP8训练方案

Wenjun Wang, Shuo Cai, Congkai Xie, Mingfa Feng, Yiming Zhang, Zhen Li, Kejing Yang, Ming Li, Jiannong Cao, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出整合持续预训练与监督微调的端到端FP8训练方案,通过混合粒度量化实现高效无损失训练,效率较BF16提升显著,将发布代码推动大规模模型训练普及。

Comments This paper has been withdrawn by the authors due to a significant bug discovered in our data processing pipeline. This bug affects the validity of the experimental results, and we can no longer stand by the conclusions presented

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02149 2026-08-04 cs.AI 新提交 85%

Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning

超越均值:面向大语言模型推理的多时刻策略优化

Yijun Zhang, Yule Xie, Jiaxin Ding, Xin Ding, Fan Xu, Haoxiang Zhang, Luoyi Fu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对大语言模型推理提出多时刻策略优化(MMPO)框架,联合最小化失败概率分布的多个矩,在五个数学推理基准上优于基线方法,为策略优化目标设计提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04998 2026-08-04 cs.AI 85%

Mathematical Reasoning for Unmanned Aerial Vehicles: A RAG-Based Approach for Complex Arithmetic Reasoning

无人机数学推理:基于检索增强生成的方法用于复杂算术推理

Mehdi Azarafza, Mojtaba Nayyeri, Faezeh Pasandideh, Steffen Staab, Achim Rettberg

机构 * Department of Computer Science(计算机科学系) Institute For Artificial Intelligence(人工智能研究所) Hamm-Lippstadt University of Applied Sciences(哈姆-利普施塔特应用科学大学) University of Stuttgart(斯图加特大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract,journal_ref);language model(abstract,journal_ref);分类 cs.AI

AI总结 本文提出RAG-UAV框架,通过引入领域文献提升LLM在无人机任务中的数学推理能力,实验表明检索显著提高准确率并减少错误选择。

Comments 15 pages, 7 figures, 4 appendix subsections

Journal ref ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07475 2026-08-04 cs.CL cs.LG 版本更新 85%

A Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMs

对AR和扩散LLM中逐层表示能力的比较分析

Raghavv Goel, Risheek Garrepalli, Sudhanshu Agrawal, Chris Lott, Mingu Lee, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文比较了AR和扩散LLM的表示能力,发现扩散模型产生更全局的表示,而AR模型产生紧密耦合的局部表示,扩散训练引入深度冗余以实现原理性压缩。

Comments v4: improving writing and adding Qwen2.5-Instruct results with all v3 changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00437 2026-08-04 cs.SE cs.AI 新提交 84%

Distilling Reasoning Traces into Advisory Prompts for Software Engineering Tasks

将推理痕迹提炼为软件工程任务的建议提示词

Faizan Faisal, Prem Devanbu, Toufique Ahmed

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 本文受编程学习过程启发,提出将LLM推理痕迹提炼为建议提示词的方法,可减少LLM代码错误,部分提示词还能跨模型迁移,同时明确了方法适用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00014 2026-08-04 cs.AI 新提交 83%

CoT-Core: Accelerating LLM Evaluation via CoT-Aware Coreset Selection

CoT-Core:通过感知思维链的核心集选择加速大语言模型评估

Qihua Pan, Zhenheng Tang, Peijie Dong, Xiang Liu, Huacan Wang, Bo Li, Xiaowen Chu

机构 * Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CoT-Core是无训练的核心问题选择框架,通过感知大语言模型的思维链推理轨迹聚类问题,可大幅降低LLMs评估成本,且在GSM8K等多数据集上维持高保真度分数估计。

Comments 23 pages, 3 figures, 10 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17999 2026-08-04 cs.AI cs.CV 版本更新 83%

Do Maps Still Matter for Machines: Revisiting the Role of Choropleth Maps in Foundation Model Spatial Understanding

地图对机器来说仍然重要吗:重新审视分级统计图在基础模型空间理解中的作用

Zhiwei Wei, Yonghe Sun, Zhenjia Liu, Wenjia Xu, Chao He, Weihua Dong, Chunbo Liu, Hua Liao

专题命中 推理与问题求解 :foundation model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究探讨分级统计图对基础模型空间理解的作用,引入ChoroplethMap-Bench基准,在三种输入条件下评估22个模型,发现地图能显著提升空间推理,尤其结合符号数据及高层次空间模式理解任务时,证明地图是基础模型空间推理的重要外部表示。

Comments 34 pages, 4 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01875 2026-08-04 cs.AI cs.LG 新提交 82%

ReasonCast: Towards Explainable Time Series Forecasting with Reasoning

ReasonCast:面向可解释时间序列预测的推理方法

Seunghan Lee, Jun Seo, Jaehoon Lee, Junhyeok Kang, Sangjun Han, Sungdong Yoo, Minjae Kim, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, Soonyoung Lee, Wonbin Ahn

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出任务融合模型ReasonCast,通过微调LLM实现时间序列预测与可解释文本推理的联合生成,在预测准确性上优于LLM和TS模型,还构建了联合评估基准ReasonTS-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03320 2026-08-04 cs.CL cs.AI 版本更新 82%

From We to Me: Theory Informed Narrative Shift with Abductive Reasoning

从‘我们’到‘我’:基于演绎推理的理论指导叙事转变

Jaikrishna Manojkumar Patil, Divyagna Bavikadi, Kaustuv Mukherji, Ashby Steward-Nolan, Peggy-Jean Allin, Tumininu Awonuga, Joshua Garland, Paulo Shakarian

机构 * Syracuse University(苏塞克斯大学) Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于演绎推理和社会科学理论的神经符号方法,用于改进大型语言模型的叙述转变能力,在多个模型上实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01709 2026-08-04 cs.CV 新提交 82%

SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models

SpatialQuery:评估视觉语言模型中基于几何的多实例空间推理能力

Hai Nguyen, Tung Vu, Cong Tran

机构 * Posts and Telecommunications Institute of Technology(邮电技术学院)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract)

AI总结 该研究针对视觉语言模型的多实例空间推理缺陷,推出SPATIALQUERY框架及含百万对问答的SPATIALQUERY-1M基准,结合UA-CoT提示,使Qwen3-VL-8B在空间推理任务中表现优于多种模型。

详情

展开后加载摘要…

URL PDF HTML 收藏