arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-16 至 2026-03-16 共收录 83 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 12 篇

2511.22645 2026-03-16 cs.CV 85%

GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes

GeoZero:从零开始激励地理空间场景的推理

Di Wang, Shunyu Liu, Wentao Jiang, Fengxiang Wang, Yi Liu, Xiaolei Qin, Zhiming Luo, Chaoyang Zhou, Haonan Guo, Jing Zhang, Bo Du, Dacheng Tao, Liangpei Zhang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 GeoZero通过构建两个数据集和A$^2$GRPO方法,使大语言模型在无预定义推理链监督下实现地理空间推理,提升了遥感任务的推理多样性和准确性。

Comments Code, data, and models are available at https://github.com/MiliLab/GeoZero

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12669 2026-03-16 cs.CV cs.LG 79%

Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning

视觉验证增强的VLMs融合以实现高效的视觉推理

Selim Furkan Tekin, Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Margaret L. Loper, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Systems(思科系统)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出V3Fusion方法,通过融合多种视觉语言模型,利用焦点误差多样性与CKA-focal度量来提升视觉推理性能,实验显示在多个基准上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18632 2026-03-16 cs.CV cs.AI 79%

Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views

用3D思考:从有限视角出发的几何想象引导的空间推理

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xufang Luo, Mingze Sun, Zihao Pan, Xiang An, Yan Feng, Peng Pei, Xunliang Cai, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Meituan(美团) National University of Singapore(新加坡国立大学) Beihang University(北航) LMMs-Lab(LMMs实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出3DThinker框架,通过利用图像中的丰富几何信息实现空间推理,无需3D先验输入或显式标注3D数据,在多个基准测试中优于现有方法。

Comments 25 pages, 17 figures

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12597 2026-03-16 cs.LG cs.AI cs.HC cs.MA cs.SE 73%

Feynman: Knowledge-Infused Diagramming Agent for Scalable Visual Designs

Feynman: 一种融合知识的图表生成代理,用于可扩展的视觉设计

Zixin Wen, Yifu Cai, Kyle Lee, Sam Estep, Josh Sunshine, Aarti Singh, Yuejie Chi, Wode Ni

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Feynman代理,通过知识组件枚举和代码规划生成高质量图表-描述对,构建了可扩展的图表生成流水线,并创建了视觉语言基准Diagramma。

Comments A previous version was submitted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12538 2026-03-16 cs.CV cs.AI 57%

Spatio-Semantic Expert Routing Architecture with Mixture-of-Experts for Referring Image Segmentation

具有混合专家的时空语义专家路由架构用于指代图像分割

Alaa Dalaq, Muzammil Behzad

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SERA架构,通过在视觉语言框架中引入轻量级表达感知专家细化,提升指代图像分割的时空一致性与边界精度,实验表明其在准确定位和精细边界界定上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23228 2026-03-16 cs.CV cs.AI 57%

MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction

MovieTeller: 借助工具的电影概要与ID一致的渐进抽象

Yizhi Li, Xiaohan Chen, Miao Jiang, Wentao Tang, Gaoang Wang

机构 * Central Universities(中央高校) National Natural Science Foundation of China(中国国家自然科学基金委员会) Research Fund for International Scientists of National Natural Science Foundation of China(中国国家自然科学基金委员会国际科学家研究基金)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 MovieTeller通过工具增强的渐进抽象生成电影概要,解决传统VLM在长视频摘要中的身份一致性和叙事连贯性问题,提升事实准确性与一致性。

Comments 6 pages, CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13185 2026-03-16 cs.CV 50%

Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos

从单目视频生成时空世界场景图

Rohith Peddi, Saurabh, Shravan Shanmugam, Likhitha Pallapothula, Yu Xiang, Parag Singla, Vibhav Gogate

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出World Scene Graph Generation任务,通过ActionGenome4D数据集,引入三种方法解决未观测物体推理问题,推动视频场景理解向世界中心、时间持久和可解释的方向发展。

Comments https://github.com/rohithpeddi/WorldSGG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12936 2026-03-16 cs.RO cs.CV 50%

MotionAnymesh: Physics-Grounded Articulation for Simulation-Ready Digital Twins

MotionAnymesh:基于物理的运动模拟数字双胞胎生成

WenBo Xu, Liu Liu, Li Zhang, Dan Guo, RuoNan Liu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出MotionAnymesh框架,通过结合物理先验知识和几何物理联合估计,解决静态3D网格转化为可交互数字双胞胎的难题,提升模拟精度和物理可行性。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08881 2026-03-16 cs.CV 50%

SATGround: A Spatially-Aware Approach for Visual Grounding in Remote Sensing

SATGround:一种面向遥感视觉语义的时空感知方法

Aysim Toker, Andreea-Maria Oncescu, Roy Miles, Ismail Elezi, Jiankang Deng

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SATGround方法,通过结构化定位机制提升卫星图像视觉语义理解,结合语言和空间信息增强定位精度,在多个遥感基准测试中取得显著提升,包括比先前方法提升33.2%的视觉语义定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21105 2026-03-16 cs.CV 50%

RLM: A Vision-Language Model Approach for Radar Scene Understanding

RLM:一种用于雷达场景理解的视觉-语言模型方法

Pushkal Mishra, Kshitiz Bansal, Dinesh Bharadia

机构 * University of California San Diego(加州大学圣地亚哥分校) Blue River Technology

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出RadarVLM,通过结构化空间语言监督学习统一的场景表示,改进了雷达场景理解中的空间推理能力,实验显示其在生成描述和车辆分割任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12708 2026-03-16 cs.CV 50%

FSDAM: Few-Shot Driving Attention Modeling via Vision-Language Coupling

FSDAM:通过视觉-语言耦合实现少样本驾驶注意力建模

Kaiser Hamid, Can Cui, Khandakar Ashrafi Akbar, Ziran Wang, Nade Liang

机构 * Texas Tech University(德克萨斯理工大学) Purdue University(普渡大学) Towson University(托逊大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出FSDAM框架,通过90个标注示例实现驾驶注意力预测与结构化解释生成,利用视觉-语言耦合减少标注需求,提升自动驾驶中的人机协作可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 6 篇

2509.09677 2026-03-16 cs.AI 70%

The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs

持续扩展的幻觉回报:衡量LLM的长周期执行

Akshit Sinha, Arvindh Arun, Shashwat Goel, Steffen Staab, Jonas Geiping

机构 * University of Cambridge(剑桥大学) Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) University of Southampton(南安普顿大学) Tübingen AI Center(图宾根人工智能中心)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文通过分析LLM在长周期任务中的执行能力,揭示了持续扩展LLM并非必然导致回报递减,而是执行能力的提升能显著改善长周期任务表现。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12724 2026-03-16 cs.LG 70%

SciDesignBench: Benchmarking and Improving Language Models for Scientific Inverse Design

SciDesignBench: 科学逆向设计的语言模型基准测试与改进

David van Dijk, Ivan Vrkic

机构 * CellType Inc.(CellType公司)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.LG

AI总结 本文提出SciDesignBench,通过520个模拟器支撑任务评估语言模型在科学逆向设计中的表现,发现模拟反馈对不同设计周期有不同影响,并引入RLSF训练方法提升模型性能。

Comments 35 pages, 19 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23863 2026-03-16 cs.CL 70%

SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models

SPELL: 自我扮演强化学习用于进化长上下文语言模型

Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, Fei Huang

机构 * Sun Yat-sen University(中山大学) Tongyi Lab, Alibaba Group(阿里云实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出SPELL框架,通过自我扮演问答和验证角色实现长上下文推理的无监督优化,实验显示其在多个基准上优于传统微调方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25084 2026-03-16 cs.CL cs.AI cs.IR cs.LG 67%

Scaling Generalist Data-Analytic Agents

放大通用数据分析代理

Shuofei Qiao, Yanqiu Zhao, Zhisong Qiu, Xiaobin Wang, Jintian Zhang, Zhao Bin, Ningyu Zhang, Yong Jiang, Pengjun Xie, Fei Huang, Huajun Chen

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DataMind,通过细粒度任务分类和递归易难任务组合机制,解决开源数据分析代理的数据不足、训练策略不当和代码多轮滚动不稳定问题,构建出性能优异的DataMind-14B和DataMind-7B代理。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04096 2026-03-16 cs.LG 57%

CORE: Context-Robust Remasking for Diffusion Language Models

CORE: 用于扩散语言模型的上下文鲁棒重掩码

Kevin Zhai, Sabbir Mollah, Zhenyi Wang, Mubarak Shah

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 CORE通过上下文鲁棒重掩码方法改进扩散模型解码,通过检测上下文敏感性token提升生成稳定性,在推理阶段实现高效修正,优于现有基线方法。

Comments Project Page: https://ucf-crcv.github.io/core/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02224 2026-03-16 cs.CL 57%

From XAI to Stories: A Factorial Study of LLM-Generated Explanation Quality

从XAI到故事:对LLM生成解释质量的因子研究

Fabian Lukassen, Jan Herrmann, Christoph Weisser, Benjamin Saefken, Thomas Kneib

机构 * University of Göttingen(哥廷根大学) BASF SE(巴斯夫股份有限公司) TU Clausthal(Clausthal 技术大学) Hochschule Bielefeld(比勒菲尔德应用科学大学)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过因子研究探讨了预测模型选择、XAI方法、LLM选择和提示策略对LLM生成解释质量的影响,发现LLM选择主导其他因素,且零次提示在成本上具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 7 篇

2510.03366 2026-03-16 cs.LG cs.AI 81%

Disentangling Recall and Reasoning in Transformer Models through Layer-wise Attention and Activation Analysis

通过分层注意力和激活分析解构Transformer模型中的回忆与推理

Harshwardhan Fartale, Ashish Kattamuri, Rahul Raja, Arpita Vats, Ishita Prasad, Akshata Kishore Moharir

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过可控数据集和激活分析,揭示Transformer模型中回忆与推理的分离电路,为模型泛化和安全部署提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12290 2026-03-16 cs.IR cs.AI 70%

Detecting Miscitation on the Scholarly Web through LLM-Augmented Text-Rich Graph Learning

通过LLM增强的文本丰富图学习检测学术网络中的误引

Huidong Wu, Haojia Xiang, Jingtong Gao, Xiangyu Zhao, Dengsheng Wu, Jianping Li

机构 * Chinese Academy of Sciences & City University of Hong Kong(中国科学院与香港城市大学) City University of Hong Kong(香港城市大学) Shenzhen University & Beijing Dongbi Data Technology(深圳大学与北京东碧数据技术) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出LAGMiD框架,利用LLM进行深度语义推理,结合图神经网络实现高效误引检测,通过证据链推理和知识蒸馏降低计算成本,实验显示效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10862 2026-03-16 cs.CL cs.AI cs.CR cs.CY cs.LG 67%

Superficial Safety Alignment Hypothesis

表面安全对齐假说

Jianwei Li, Jung-Eun Kim

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出表面安全对齐假说,认为安全对齐通过让模型选择正确推理方向来实现,识别出四种关键组件以建立安全防护。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12933 2026-03-16 cs.AI 57%

Efficient and Interpretable Multi-Agent LLM Routing via Ant Colony Optimization

通过蚁群优化实现高效且可解释的多智能体大语言模型路由

Xudong Wang, Chaoning Zhang, Jiaquan Zhang, Chenghao Li, Qigan Sun, Sung-Ho Bae, Peng Wang, Ning Xie, Jie Zou, Yang Yang, Hengtao Shen

机构 * School of Computing, Kyung Hee University(Kyung Hee 大学计算机学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(中国电子科技大学信息与软件工程学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(中国电子科技大学计算机科学与工程学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AMRO-S框架,通过意图推理、任务特定信息素专家和质量门控异步更新机制,提升多智能体系统路由效率与可解释性,实验显示其在质量-成本权衡上优于现有方法。

Comments 11 pages, 3 figures, submitted to IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00016 2026-03-16 cs.RO cs.AI cs.HC 57%

Beyond Static Instruction: A Multi-agent AI Framework for Adaptive Augmented Reality Robot Training

超越静态指令:一种多智能体AI框架用于自适应增强现实机器人训练

Nicolas Leins, Jana Gonnermann-Müller, Malte Teichmann, Sebastian Pokutta

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出多智能体AI框架,用于增强现实机器人训练中的动态适应,通过多模态输入预处理和LLM自主推理实现个性化学习环境调整。

Journal ref Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (2026) 989-993

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12829 2026-03-16 cs.CV 50%

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

专题命中 复杂问题求解 :planning(abstract)

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12644 2026-03-16 cs.CR 50%

Uncovering Security Threats and Architecting Defenses in Autonomous Agents: A Case Study of OpenClaw

揭示自主代理中的安全威胁并构建防御体系:以OpenClaw为例

Zonghao Ying, Xiao Yang, Siyang Wu, Yumeng Song, Yang Qu, Hainan Li, Tianlin Li, Jiakai Wang, Aishan Liu, Xianglong Liu

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文分析了自主代理在安全领域的挑战,提出三层次风险分类和FASA架构,旨在提升自主代理的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 21 篇

2602.02983 2026-03-16 cs.AI 86%

Do LLMs Share Human-Like Biases? Causal Reasoning Under Prior Knowledge, Irrelevant Context, and Varying Compute Budgets

大型语言模型是否具有人类般的偏见?在先验知识、无关上下文和不同计算预算下的因果推理

Hanna M. Dettki, Charley M. Wu, Bob Rehder

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文通过对比20余种LLM与人类基准,在11个由碰撞结构形式化的因果判断任务中发现,小型可解释模型能有效压缩LLM的因果判断,多数LLM表现出比人类更规则化的推理策略,但未表现出人类典型的碰撞偏见。

Journal ref ICLR 2026 Workshop "From Human Cognition to AI Reasoning (HCAIR)"

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12078 2026-03-16 cs.AI cs.CL 81%

Tiny Recursive Reasoning with Mamba-2 Attention Hybrid

微小递归推理与Mamba-2注意力混合

Wenlong Wang, Fergal Reid

机构 * Intercom Dublin, Ireland(Intercom都柏林,爱尔兰)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨将Mamba-2混合操作符替换TRM中的Transformer块,验证其在递归框架下保持推理能力,提升抽象推理任务表现。

Comments Published at ICLR 2026 Latent & Implicit Thinking Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12615 2026-03-16 cs.CY cs.AI cs.CL cs.HC 81%

Literary Narrative as Moral Probe : A Cross-System Framework for Evaluating AI Ethical Reasoning and Refusal Behavior

文学叙述作为道德探针:一种跨系统框架用于评估AI伦理推理与拒绝行为

David C. Flynn

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过文学叙述中的不可解道德情境,提出一种跨系统框架,评估AI的伦理推理与拒绝行为,发现系统能力与仪器复杂性相关,揭示了伦理推理与真实能力间的差距。

Comments 27 pages, 6 tables. Target: Minds and Machines (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12458 2026-03-16 cs.CL cs.AI 81%

Shattering the Shortcut: A Topology-Regularized Benchmark for Multi-hop Medical Reasoning in LLMs

打破捷径:一种用于LLMs多跳医学推理的拓扑正则化基准

Xing Zi, Xinying Zhou, Jinghao Xiao, Catarina Moreira, Mukesh Prasad

机构 * University of Technology Sydney(悉尼技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ShatterMed-QA基准,通过拓扑正则化知识图谱评估深度诊断推理能力,揭示LLMs在多跳医学推理中的缺陷,并验证RAG方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13033 2026-03-16 cs.CV cs.LG cs.RO 79%

ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models

ESPIRE:一种用于视觉-语言模型具身空间推理的诊断基准

Yanpeng Zhao, Wentao Ding, Hongtao Li, Baoxiong Jia, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出ESPIRE基准,通过模拟环境评估视觉-语言模型在具身空间推理中的表现,改进了传统评估方法,实现了更细致的推理与行动分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12225 2026-03-16 cs.CV cs.LG 77%

HoneyBee: Data Recipes for Vision-Language Reasoners

HoneyBee: 用于视觉-语言推理器的数据食谱

Hritik Bansal, Devendra Singh Sachan, Kai-Wei Chang, Aditya Grover, Gargi Ghosh, Wen-tau Yih, Ramakanth Pasunuru

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出HoneyBee数据集,通过数据整理方法提升视觉-语言推理能力,发现上下文来源策略和数据干预显著提升性能,并提出测试时缩放策略以降低解码成本。

Comments 32 pages. Accepted to CVPR 2026 in Denver, Colorado, USA

详情

展开后加载摘要…

URL PDF HTML 收藏