arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-31 至 2026-07-31 共收录 349 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 40 篇

2510.01427 2026-07-31 cs.AI 版本更新 89%

A Tale of LLMs and Induced Small Proxies: Scalable Small Language Models for Knowledge Mining

小型语言模型代理实现高效高质量的知识挖掘

Sipeng Zhang, Longfei Yun, Zilong Wang, Letian Peng, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Carneigie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title);LLM(abstract_cn);large language model(abstract)

AI总结 提出Falconer框架,结合大语言模型的代理推理与轻量级代理模型,通过规划与标注实现可扩展的知识挖掘,在保持指令遵循精度的同时降低90%推理成本并加速20倍以上。

Comments Code available: https://github.com/LongfeiYun17/falconer

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11048 2026-07-31 cs.CL cs.AI 88%

A Systematic Analysis of the Impact of Persona Steering on LLM Capabilities

对人格引导对大语言模型能力影响的系统分析

Jiaqi Chen, Ming Wang, Tingna Xie, Shi Feng, Yongkang Liu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国) School of Computing and Information Systems, Singapore Management University, Singapore 178902, Singapore(新加坡管理大学计算机与信息系统学院,新加坡 178902,新加坡) School of Computer and Communication Engineering, Northeastern University, Qinhuangdao 066004, China(东北大学计算机与通信工程学院,秦皇岛 066004,中国)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过NPTI框架诱导大模型五种人格特质,发现人格引导对认知任务性能有稳定影响,且不同特质对任务表现有不同影响,提出动态人格路由策略提升性能。

Journal ref Chen, J., Wang, M., Xie, T., Feng, S., & Liu, Y. (2026). A Systematic Analysis of the Impact of Persona Steering on LLM Capabilities. Proceedings of the Annual Meeting of the Cognitive Science Society, 48

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28410 2026-07-31 cs.CE cs.CL q-fin.TR 新提交 88%

Can Large Language Models Execute Parent Orders?

大型语言模型能否执行父订单?

Zane Shen, Xinli Xu, Guangyi Zhang, Jialong Chen, Jinsong Zhou, Cong Chen, Guibao Shen, Dongyu Yan, Luozhou Wang, Zhen Yang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究针对算法交易的父订单执行问题,提出分层框架PACE,基于深交所数据验证其性能优于现有方法,表明LLMs可辅助人类交易者执行决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28077 2026-07-31 cs.CL 新提交 88%

LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models

LEEPS:用于大语言模型中高效RLVR的潜在引导探索-利用提示采样

Shuang Liang, Haoyang Zhou, Yifan Gong, Guowei Wang, Xiting Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 LEEPS是一种潜在引导探索-利用提示采样器,通过自适应分配rollout预算等方式优化提示采样,在6个数学推理基准和3个OOD通用推理基准上均取得最优性能,且训练开销较小。

Comments 15pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28460 2026-07-31 cs.LG cs.CR 新提交 87%

Cybersecurity Detection Classification with Reasoning-enabled Language Models

基于推理增强语言模型的网络安全检测分类

Amol Khanna, Manu Nandan, Cristian Viorel Popa, Joan Pujol-Roig, Diana Bolocan, Laura Vasilie, Alexandru Apostu, Chase Helwig, Mihaela Gaman, Michael Brautbar, Edward Raff, Chase Midler, Sven Krasser

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.LG

AI总结 该研究针对SOC警报疲劳问题,训练了思维链推理增强的分类器及校准器,在Windows终端检测任务上提升了良性与恶意召回率,且30B微调模型优于通用大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27790 2026-07-31 cs.CL cs.AI 新提交 87%

Semantic-Aligned Structural Abstraction for Multimodal Sentiment Analysis

面向多模态情感分析的语义对齐结构抽象

Wei Chen, Junkai Li, Tongguan Wang, Hui Liu, Feiyue Xue, Chuanxiang Ma, Ying Sha

机构 * Huazhong Agricultural University(华中农业大学) Hubei University(湖北大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对现有多模态情感分析方法无法建模情感语义的局限,提出SentiLLM框架,通过双流显著性-上下文校准机制实现语义对齐结构抽象,在四个数据集上取得优异性能。

Comments Accepted by MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27923 2026-07-31 cs.SE 新提交 86%

The Case for Vibe Modeling: A Missing Step in AI-Based Trustworthy Software Development

氛围建模的必要性:基于AI的可信软件开发中缺失的一环

Shalini Chakraborty, Michael Mittermaier, Judith Michael

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出在AI辅助软件开发中引入氛围建模作为轻量中间抽象,通过学生调查验证其在提升LLM输出理解、降低验证工作量及增强信任方面的潜力,为可信AI软件工程研究提供方向。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27484 2026-07-31 cs.AI cs.MA 新提交 85%

Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

技能使用还是技能表演?评估技能增强型语言智能体中的推理后台

Jinwei Hu, Yi Qi, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang

专题命中 推理与问题求解 :language agent(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对技能增强型语言智能体,提出BACKTRACE评估框架及BACKROOMBench测试平台,发现其存在推理后台现象,即技能使用声明与实际决策影响存在系统性差距,需通过干预进行审计。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28146 2026-07-31 cs.CL cs.AI 新提交 85%

Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game

智能体能够欺骗吗?使用社交推理游戏评估ParliamentBench中的推理与欺骗能力

Niklas Bauer, Lars Benedikt Kaesberg, Akiko Aizawa, Jan Philip Wahle, Bela Gipp, Terry Ruas

机构 * University of Göttingen(哥廷根大学) National Institute of Informatics(信息学研究所) University of Tokyo(东京大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究基于《Secret Hitler》游戏构建ParliamentBench基准,评估16个LLM的欺骗与推理能力,发现前沿模型表现优异,多数LLM难以维持一致的欺骗人设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26621 2026-07-31 cs.IR cs.AI 版本更新 84%

WhisperRec: Latent Reasoning for Efficient Foundation Recommendation Models

WhisperRec:用于高效基础推荐模型的潜在推理方法

Hao Jiang, Peiru Du, Pengfei Yao, Mengting Li, Siyuan Lou, Kuo Cai, Sheng Yu, Qiang Luo, Jian Liang, Ruiming Tang, Fei Pan, Peng Jiang, Wenwu Ou

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 WhisperRec是一种高效潜在推理框架,通过将教师CoT压缩为可学习潜在标记,在快手数据集上优于显式CoT方法,SID@64提升显著且推理吞吐量更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27705 2026-07-31 cs.AI cs.LG 新提交 84%

Albilich: Steerable Proof-State Orchestration for LLM-Based Mathematical Research with CAS Integration

Albilich:用于结合计算机代数系统(CAS)的基于大语言模型的数学研究的可操控证明状态编排工具

Ting Gong, Michael Ruofan Zeng, Yong Yang

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Albilich是结合CAS等功能的开源数学自主研究智能体框架,在RealMath基准和Kourovka开放问题上取得优异效果,可实现AI辅助的可扩展数学研究。

Comments 7 pages, comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27776 2026-07-31 cs.CR 新提交 83%

CHARGE: Leveraging CWE Hierarchies for Hardware Security SystemVerilog Assertion Generation

CHARGE:利用CWE层次结构生成硬件安全SystemVerilog断言

Xiao Tan, Cynthia Sturton

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 CHARGE是利用CWE层次结构和LLM生成硬件安全SVA的自动化框架,在Hack@DAC系列SoC设计中检测到多个已知与新错误,生成的SVA具备较高有效性。

Comments This paper is an extended version of the paper accepted to the IEEE/ACM International Conference on Computer-Aided Design (ICCAD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27304 2026-07-31 cs.LG cs.CV 新提交 83%

Position, Not Provenance: Separating Reasoning Mediation from Sycophancy in Medical Vision-Language Models

位置,而非来源:在医学视觉-语言模型中分离推理中介与逢迎行为

Supratik Bhowal, Subhrajyoti Basu, Aritra Gir Mahanta, Anik Pal Chowdhury

机构 * IEM Kolkata(印度工程管理学院 Kolkata校区) School of UEMK Kolkata(UEMK Kolkata学院) Heritage Institute of Technology Kolkata(加尔各答遗产技术学院) Indian Institute of Information Technology, Kalyani(卡利亚尼印度信息技术学院)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本研究提出CoT-Mediate框架,结合双臂协议与来源控制干预,在VQA-RAD数据集上评估LLaVA-Med和MedGemma,发现上下文位置而非声明来源是医学VLMs使用生成推理的主要决定因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27420 2026-07-31 cs.AI cs.CL 新提交 82%

Dimensionality and Measurement Precision in HLE's Multiple-Choice Subset

HLE多项选择子集的维度与测量精度

Mayank Sharma, Savira Nadela, Tyler Matteson

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估29个LLM在HLE多项选择子集上的表现,发现HLE仅测量单一一般推理因素,其领域子分数不具区分能力,且对前沿模型的区分能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28397 2026-07-31 cs.AI cs.CL cs.IR 新提交 81%

GLM-RAG: Graph Language Models for Graph-Based Retrieval-Augmented Generation

GLM-RAG:面向基于图的检索增强生成的图语言模型

Maya Arseven, Anette Frank, Beni Egressy, Johann Higl, Moritz Plenz

机构 * Institute of Computational Linguistics, Heidelberg University(海德堡大学计算语言学研究所) Aleph Alpha Research(Aleph Alpha 研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出GLM-RAG的GLM基检索器,对比三类检索器性能,发现微调GLM检索器跨域泛化更优且在多跳基准达SOTA,GNN与向量搜索各有优势。

Comments 10 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10207 2026-07-31 cs.IR 版本更新 80%

LASAR: Latent Adaptive Semantic Aligned Reasoning for Generative Recommendation

LASAR:潜在自适应语义对齐推理用于生成推荐

Yiwen Chen, Fuwei Zhang, Zehao Chen, Hehan Li, Peizhi Xu, Hanmeng Liu, Shuanglong Li, Xin Pei, Fuzhen Zhuang, Zhao Zhang

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 LASAR通过自适应语义对齐推理提升生成推荐性能,解决潜在推理与语义对齐的挑战,实现更高效的推荐质量与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10345 2026-07-31 cs.SE 版本更新 80%

Recovering Fine-Grained Code Change Rationale from Multiple Software Artifacts

细粒度多文档提取与代码变更理由生成

Mehedi Sun, Antu Saha, Nadeeshan De Silva, Antonio Mastropaolo, Oscar Chaparro

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 本文研究如何从多个文档中提取代码变更理由,提出ARGUS方法,通过LLM生成简洁的变更理由摘要,提升代码理解和维护效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19435 2026-07-31 cs.CL 79%

Route to Reason: Adaptive Routing for LLM and Reasoning Strategy Selection

Zhihong Pan, Kai Zhang, Yuze Zhao, Yupeng Han

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.CL

Journal ref Proceedings of the ACM Web Conference 2026, pp. 5568-5578

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24268 2026-07-31 cs.CL 版本更新 74%

Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets

准确性掩盖了语言模型的失败方式:在匹配输出预算下测量失败状态

Zongyou Yang, Yinghan Hou

专题命中 推理与问题求解 :language model(title);分类 cs.CL

AI总结 研究指出语言模型基准测试中准确性分数掩盖问题,引入两层评估框架分离执行证据与正确性。通过实验表明不同模型在匹配输出限制下执行组合不同,验证策略会影响准确性估计,强调评估应同时报告执行状态、覆盖范围和评分者来源。

Comments 7 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03126 2026-07-31 cs.LG cs.AI 版本更新 73%

ACPO: Asymmetric Credit Policy Optimization via Mode-Local Entropy Surrogate

ACPO:通过细粒度替代熵实现自适应信用策略优化

Zijun Xie, Yuyang You, Yongzhi Li, Enlei Gong, Quan Chen, Yanhua Cheng, Peng Jiang, Binbin Zheng, Xiaolong Liu, Zeyu Chen, Yadong Mu

机构 * Peking University(北京大学) Baidu Inc.(百度公司) Kuaishou Inc(快手公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中稀疏奖励致令牌级信用分配难的问题,提出基于模式局部替代熵的ACPO框架,通过不对称调制策略更新改进信用分配,实验表明其优于多种强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28527 2026-07-31 cs.AI 新提交 70%

MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems

MANTA:面向自演进多智能体系统的多智能体网络拓扑自适应框架

Mao-xun Huang, Jerry Wang, Yi-Cheng Lai, Zhengxin Zhang, Claire Cardie, Hen-Hsen Huang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出MANTA框架,使多智能体系统通信拓扑可在推理阶段自演进,在五类基准测试中平均得分74.0,较最强基线高5.8个百分点,验证了推理阶段自改进可延伸至协作架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28110 2026-07-31 cs.AI 新提交 70%

BlueprintRepair: Typed Local Edits for Failed Lean Proof Blueprints

BlueprintRepair:面向失败的Lean证明蓝图的类型化局部编辑

Ruslan Khrulev

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出BlueprintRepair修复接口,构建含142个案例的BlueprintTrace基准,对比三种修复方式,发现类型化修复成本最低且在有限令牌内覆盖率最高。

Comments 19 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27888 2026-07-31 cs.AI 新提交 70%

Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

并非所有 token 都应获得同等权重:面向长思维链(Long-CoT)推理的反事实敏感性权重重分配

Qiangqiang He, Zhongheng Wu, ZiJian Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) Institute of Wireless Communications Technology, Shanghai Jiao Tong University(上海交通大学无线通信技术研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长思维链推理中均匀分配 token 权重的缺陷,提出反事实敏感性权重重分配方法,在数学推理基准上优于 GRPO,验证了特权诱导方向不可靠的诊断。

Comments 20 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27733 2026-07-31 cs.AI 新提交 70%

VeriSkill: A Self-Evolution Framework for Program Verification Skills

VeriSkill:一种用于程序验证技能的自进化框架

Changguo Jia, Tianqi Zhao, Zhiyou Xiao, Weiming Zhang, Minghui Zhou

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出专为程序验证设计的自进化框架VeriSkill,可将验证失败归因于技能缺陷并迭代优化技能,实验显示其在多种场景下均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02383 2026-07-31 cs.CL 版本更新 70%

MEDIAREF: A Public Knowledge Store for Media Background Checks

了解你的来源:用于媒体背景核查的公共知识库

Benjamin Nichols, Michael Schlichtkrull, Nedjma Ousidhoum

机构 * Cardiff University(卡迪夫大学) Queen Mary University of London(伦敦大学女王学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对检索增强生成中证据来源可靠性问题,提出公开知识库MEDIAREF,支持可复现的低成本媒体背景核查生成,评估多种大语言模型并证明其有效性。

Comments Code and Data: https://github.com/nedjmaou/mediaref

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28421 2026-07-31 cs.AI 版本更新 70%

DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

DenoiseRL:引导推理模型从噪声前缀中恢复

Caijun Xu, Changyi Xiao, Zhongyuan Peng, Yixin Cao

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DenoiseRL框架,通过强化学习从弱模型的错误推理中学习,无需外部监督或强教师模型,提升推理性能和训练效率。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28595 2026-07-31 cs.CV 新提交 67%

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Beacon:智能体何时及如何执行智能体视觉推理

Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

机构 * Peking University(北京大学) Kling Team(Kling团队) HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZJU(浙江大学) THU(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本研究针对现有智能体视觉推理模型模式适应性有限、工具增益被损害抵消的问题,提出Beacon模型,通过强化学习相关机制提升性能与适应性,在多基准上表现优异。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27435 2026-07-31 cs.DB 新提交 67%

AgenticER: the next frontier in Entity Resolution

AgenticER:实体解析的下一个前沿领域

George Papadakis, Panos Korovesis, Manolis Koubarakis, Themis Palpanas

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 针对现有实体解析被动范式无法适配异构流数据场景的问题,提出Agentic ER新范式,将其建模为自主智能体的序列决策过程,构建参考架构并明确研究挑战,开拓数据管理与智能体交叉的新研究方向。

Comments Vision paper submitted to VLDB, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27805 2026-07-31 nlin.CD cond-mat.dis-nn 新提交 67%

Chaos in reason: How chain-of-thought LLMs can look for an answer

理性中的混沌:思维链大语言模型(LLMs)如何探寻答案

Gregorio Jaca, Kristóf Benedek, János Török

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本研究将非线性动力学与混沌理论工具应用于思维链LLMs,证实其存在混沌标志性特征,明确各Transformer子模块对扰动的作用,揭示其与典型混沌系统的结构相似性及分形特性,指出注意力机制诱导的非线性耦合是混沌行为的关键驱动因素。

Comments 16 pages 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27747 2026-07-31 cs.CL cs.AI 新提交 62%

Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析

Liangjie Zhao, Jiaqing Lyu, Kexin Tang, Zecheng Fang, Rong Yin, Yulan Hu, Da Li, Jianing Li

机构 * Adelaide University(阿德莱德大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Beihang University(北京航空航天大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏