arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-10 至 2026-03-10 共收录 52 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 52 篇

2601.17842 2026-03-10 cs.CL 88%

EFT-CoT: A Multi-Agent Chain-of-Thought Framework for Emotion-Focused Therapy

EFT-CoT:一种针对情感导向治疗的多智能体链式思考框架

Lanqing Du, Yunong Li, YuJie Long, Shihong Chen

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL

AI总结 EFT-CoT提出一种基于情感导向治疗的多智能体框架,通过三个阶段工作流程提升心理健康问答的共情深度和专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17057 2026-03-10 cs.LG cs.AI 86%

The Ends Justify the Thoughts: RL-Induced Motivated Reasoning in LLM CoTs

终点 justify 思维:RL 引导的动机推理在 LLM CoTs 中

Nikolaus Howe, Micah Carroll

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 研究发现LLM在训练中会因冲突指令产生动机推理,导致监控器被欺骗,强调需进一步研究动机推理的检测与监管。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07078 2026-03-10 cs.AI cs.CL 86%

CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs

CoTJudger: 一种基于图的框架,用于自动评估链式推理效率和冗余性在LRMs中

Siyi Li, Jiajun Shi, Shiwen Ni, Ge Zhang, Shuaimin Li, Shijian Wang, Zhoufutu Wen, Yizhi Li, Hamid Alinejad-Rokny, Jiaheng Liu, Min Yang, Wenhao Huang

机构 * University of Science and Technology of China(科学技术大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen Institutes of Advanced Technology, CAS(深圳先进技术研究所,中国科学院) Southeast University(东南大学) Nanjing University(南京大学) Beihang University(北航) University of Manchester(曼彻斯特大学)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 CoTJudger通过构建依赖图提取最短有效路径,评估链式推理的效率与冗余,揭示模型中的冗余问题及失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07515 2026-03-10 cs.CV 85%

EvolveReason: Self-Evolving Reasoning Paradigm for Explainable Deepfake Facial Image Identification

EvolveReason: 为可解释的深度伪造面部图像识别设计的自演化推理范式

Binjia Zhou, Dawei Luo, Shuai Chen, Feng Xu, Seow, Haoyuan Li, Jiachi Wang, Jiawen Wang, Zunlei Feng, Yijun Bei

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 EvolveReason通过模仿人类推理过程和构建特定数据集,提升深度伪造面部图像识别的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05587 2026-03-10 cs.AI cs.CL cs.DB cs.LG 82%

MMTU: A Massive Multi-Task Table Understanding and Reasoning Benchmark

MMTU: 一个大规模多任务表格理解和推理基准

Junjie Xing, Yeye He, Mengyu Zhou, Haoyu Dong, Shi Han, Lingjiao Chen, Dongmei Zhang, Surajit Chaudhuri, H. V. Jagadish

机构 * University of Michigan(密歇根大学) Microsoft Corporation(微软公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MMTU是一个大规模多任务表格理解和推理基准,旨在评估模型在专家级别处理真实表格的能力,揭示了当前模型在表格理解、推理和编码方面的挑战。

Comments Full version of a paper accepted at NeurIPS 2025; Code and data available at https://github.com/MMTU-Benchmark/MMTU and https://huggingface.co/datasets/MMTU-benchmark/MMTU

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08655 2026-03-10 cs.AI cs.CL cs.IR 82%

OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning

OfficeQA Pro:一个企业级端到端 grounded 推理基准测试

Krista Opsahl-Ong, Arnav Singhvi, Jasmine Collins, Ivan Zhou, Cindy Wang, Ashutosh Baheti, Owen Oertell, Jacob Portes, Sam Havens, Erich Elsen, Michael Bendersky, Matei Zaharia, Xing Chen

机构 * Databricks AI Research(Databricks人工智能研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 OfficeQA Pro 是一个企业级基准测试,评估 AI 代理在大规模文档语料库上进行端到端 grounded 推理的能力,发现结构化文档表示可显著提升性能。

Comments 24 pages, 16 figures. Introduces the OfficeQA Pro benchmark for grounded reasoning over enterprise documents

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07888 2026-03-10 cs.CV cs.AI cs.LG 81%

VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?

VLM-SubtleBench: VLMs在人类水平的细微比较推理方面还有多远?

Minkyu Kim, Sangheon Lee, Dongmin Park

机构 * KRAFTON KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 VLM-SubtleBench通过评估VLMs在细微比较推理上的表现,揭示了模型与人类性能之间的差距,并为提升VLMs的推理能力提供了基础。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07733 2026-03-10 cs.AI cs.CL math.OC 81%

Large Language Model for Discrete Optimization Problems: Evaluation and Step-by-step Reasoning

大规模语言模型在离散优化问题中的应用:评估与逐步推理

Tianhao Qian, Guilin Qi, Z. Y. Wu, Ran Gu, Xuanyi Liu, Canchen Lyu

机构 * School of Mathematics, Southeast University(东南大学数学学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Mathematical Sciences, Chongqing Normal University(重庆师范大学数学学院)

专题命中 推理评测 :reasoning(title);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大规模语言模型在解决离散优化问题中的能力,探讨了CoT技术的有效性,并提出了未来研究的基准。

Comments 50 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07365 2026-03-10 cs.SD cs.AI cs.CL cs.MM eess.AS 81%

Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning

多领域音频问答基准:面向声音内容推理

Chao-Han Huck Yang, Sreyan Ghosh, Qing Wang, Jaeyeon Kim, Hengyi Hong, Sonal Kumar, Guirui Zhong, Zhifeng Kong, S Sakshi, Vaibhavi Lokegaonkar, Oriol Nieto, Ramani Duraiswami, Dinesh Manocha, Gunhee Kim, Jun Du, Rafael Valle, Bryan Catanzaro

机构 * NVIDIA University of Maryland, College Park(马里兰大学 College Park 分校) University of Science and Technology of China(中国科学技术大学) Seoul National University(首尔国立大学) Adobe

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DCASE 2025挑战赛提出多领域音频问答基准,通过生物声学、时间声音景观和复杂问答子集测试音频-语言模型在多样声音场景中的交互式问答能力,推动音频理解和推理能力发展。

Comments Dataset: https://huggingface.co/datasets/PeacefulData/2025_DCASE_AudioQA_Official DCASE Task-5 challenge: dcase.community/challenge2025/task-audio-question-answering. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22854 2026-03-10 cs.LG cs.MA 79%

CRAwDAD: Causal Reasoning Augmentation with Dual-Agent Debate

基于双智能体辩论的因果推理增强:CRAwDAD

Finn G. Vamosi, Nils D. Forkert

机构 * Department of Computer Science, University of Calgary(卡莱尔大学计算机科学系) Department of Radiology, Hotchkiss Brain Institute, and Alberta Children’s Hospital Research Institute, University of Calgary(卡莱尔大学放射学系、霍奇基斯脑研究所及阿尔伯塔儿童医院研究所在卡莱尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 CRAwDAD通过双智能体辩论框架提升因果推理准确性,利用推理语言模型在因果推理和辩论中实现性能提升。

Comments 12 pages, 8 figures. Code available at https://github.com/finnvamosi/CRAwDAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08166 2026-03-10 cs.CL 79%

RexDrug: Reliable Multi-Drug Combination Extraction through Reasoning-Enhanced LLMs

RexDrug:通过增强推理的大型语言模型实现可靠的多药物组合提取

Zhijun Wang, Ling Luo, Dinghao Pan, Huan Zhuang, Lejing Yu, Yuanyuan Sun, Hongfei Lin

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 RexDrug通过增强推理的大型语言模型,实现了可靠的多药物组合提取,优于现有方法并在二元和n元任务中均表现优异。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07931 2026-03-10 cs.CL 79%

BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence

BRIDGE: 多跳推理长多模态文档基准测试与证据 grounded

Biao Xiang, Soyeon Caren Han, Yihao Ding

机构 * The University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 BRIDGE是一个针对长多模态文档的多跳推理基准测试,通过显式的多跳推理注释揭示证据聚合和 grounding 的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06680 2026-03-10 cs.CV cs.AI 79%

VB: Visibility Benchmark for Visibility and Perspective Reasoning in Images

VB:用于图像中可见性与视角推理的可见性基准

Neil Tripathi

机构 * New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 VB基准测试视觉-语言模型在图像可见性推理中的能力,通过可见性声明和置信度评分评估模型性能。

Comments 18 pages, 1 figure, 3 tables. Code and data: https://github.com/neilt93/Paper-with-Davis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06648 2026-03-10 cs.CV cs.AI 79%

ObjChangeVR: Object State Change Reasoning from Continuous Egocentric Views in VR Environments

ObjChangeVR: 从VR环境中连续眼动视角推断物体状态变化

Shiyi Ding, Shaoen Wu, Ying Chen

机构 * Kennesaw State University(肯纳邦大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ObjChangeVR通过结合视角感知和时间基检索,有效识别VR环境中物体状态变化,提升多模态大语言模型在复杂场景下的表现。

Comments European Chapter of the Association for Computational Linguistics (EACL) 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22364 2026-03-10 cs.DB cs.AI cs.DC 79%

Cost Trade-offs of Reasoning and Non-Reasoning Large Language Models in Text-to-SQL

文本到SQL系统中推理与非推理大语言模型的代价权衡

Saurabh Deochake, Debajyoti Mukhopadhyay

机构 * WIDiCoReL Research Lab(WIDiCoReL研究实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了推理与非推理大语言模型在文本到SQL任务中的成本权衡,发现推理模型在处理效率和成本控制上表现更优,但非推理模型存在显著的成本波动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07091 2026-03-10 cs.SE 78%

Exploring the Reasoning Depth of Small Language Models in Software Architecture: A Multidimensional Evaluation Framework Towards Software Engineering 2.0

探索小型语言模型在软件架构中的推理深度:一项面向软件工程2.0的多维评估框架

Ha Vo, Nhut Tran, Khang Vo, Phat T. Tran-Truong, Son Ha

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本研究通过多维评估框架评估小型语言模型在软件架构中的推理深度,发现参数阈值影响推理能力,揭示了中等大小模型在短上下文下的校准机制及语义多样性与幻觉的相关性。

Comments Accepted at ICSA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16160 2026-03-10 cs.CV 78%

Video2Layout: Recall and Reconstruct Metric-Grounded Cognitive Map for Spatial Reasoning

Video2Layout: 重建用于空间推理的度量基础认知图

Yibin Huang, Wang Xu, Wanyue Zhang, Helu Zhi, Jingjing Huang, Yangbin Xu, Yangang Sun, Conghui Zhu, Tiejun Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 Video2Layout通过重建度量基础的空间布局,提升多模态大语言模型在空间推理中的性能,其方法结合监督微调与强化微调,实现更精确的空间认知图构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13795 2026-03-10 cs.CV cs.AI 77%

Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs

Bee:一个高质量语料库和全栈工具包,解锁高级完全开放的多模态大语言模型

Yi Zhang, Bolin Ni, Xin-Sheng Chen, Heng-Rui Zhang, Yongming Rao, Houwen Peng, Qinglin Lu, Han Hu, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Tencent Hunyuan Team(腾讯文英团队)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 Bee通过高质量数据集和全栈工具包,提升完全开放多模态大语言模型的性能,达到与半开放模型相当甚至超越的水平。

Comments homepage: https://open-bee.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11549 2026-03-10 cs.CV 75%

ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?

ODI-Bench: MLLMs能否理解沉浸式全向环境?

Liu Yang, Huiyu Duan, Ran Tao, Juntao Cheng, Sijing Wu, Yunhao Li, Jing Liu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) Tianjin University(天津大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 ODI-Bench旨在评估多模态大语言模型对全向图像沉浸环境的理解能力,通过定制基准和Omni-CoT方法提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21344 2026-03-10 cs.AI cs.CL cs.LG 75%

Linear probes rely on textual evidence: Results from leakage mitigation studies in language models

线性探针依赖文本证据:语言模型中泄露缓解研究的结果

Gerard Boxo, Aman Neelappa, Shivam Raval

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现线性探针在依赖文本证据检测行为时性能下降,表明其在非表层模式检测中可能不够稳健。

Comments 33 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15656 2026-03-10 cs.CR 75%

PhishDebate: An LLM-Based Multi-Agent Framework for Phishing Website Detection

PhishDebate: 基于大语言模型的多智能体框架用于钓鱼网站检测

Wenhao Li, Selvakumar Manickam, Yung-wey Chong, Shankar Karuppayah

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 PhishDebate通过多智能体辩论框架提升钓鱼网站检测的准确性与可解释性,实现高召回率和模块化可配置性。

Comments Please cite as: W. Li, S. Manickam, Y. -W. Chong and S. Karuppayah, "PhishDebate: An LLM-Based Multi-Agent Framework for Phishing Website Detection," 2025 IEEE International Conference on Big Data (BigData), Macau, China, 2025, pp. 6606-6615, doi: 10.1109/BigData66926.2025.11401440

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China, 2025, pp. 6606-6615

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07379 2026-03-10 cs.AI cs.CL cs.CR cs.IR 73%

SoK: Agentic Retrieval-Augmented Generation (RAG): Taxonomy, Architectures, Evaluation, and Research Directions

SoK:基于代理的检索增强生成(RAG):分类、架构、评估及研究方向

Saroj Mishra, Suman Niroula, Umesh Yadav, Dilip Thakur, Srijan Gyawali, Shiva Gaire

机构 * University of North Dakota(北达科他大学) Youngstown State University(青年州大学) University of Toledo(托莱多大学) University of Missouri(密苏里大学) Tribhuvan University(特里布文大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文系统化地分析了基于代理的RAG系统,提出统一框架,识别关键风险并提出研究方向,以构建可靠可扩展的自主检索生成系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08436 2026-03-10 cs.CV cs.CL 70%

Can Vision-Language Models Solve the Shell Game?

视觉-语言模型能解决贝壳游戏吗?

Tiedong Liu, Wee Sun Lee

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出SGCoT方法,通过生成对象轨迹解决VLMs在视觉跟踪中的根本限制,实现超过90%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07825 2026-03-10 cs.CL 70%

Benchmarking Large Language Models for Quebec Insurance: From Closed-Book to Retrieval-Augmented Generation

魁北克保险领域大型语言模型基准测试:从闭卷到检索增强生成

David Beauchemin, Richard Khoury

机构 * Group for Research in Artificial Intelligence of Laval University (GRAIL)(拉瓦尔大学人工智能研究组)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出AEPC-QA基准测试,评估51个LLM在魁北克保险领域的闭卷和检索增强生成性能,揭示推理、RAG效果及专业化悖论等关键发现。

Comments Publish at the Advances in Financial AI: Towards Agentic and Responsible Systems Workshop @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14899 2026-03-10 cs.AI cs.CV 70%

InsightX Agent: An LMM-based Agentic Framework with Integrated Tools for Reliable X-ray NDT Analysis

InsightX Agent: 一种基于LMM的智能框架,集成工具用于可靠X射线无损检测分析

Jiale Liu, Huan Wang, Yue Zhang, Xiaoyu Luo, Jiaxiang Hu, Zhiliang Liu, Min Xie

机构 * School of Physics and Astronomy, The University of Edinburgh(物理学与天文学学院,爱丁堡大学) Glasgow College, University of Electronic Science and Technology of China(电子科技大学成都学院) School of Mechanical and Electrical Engineering, University of Electronic Science and Technology of China(机械与电子工程学院,电子科技大学) Department of Systems Engineering, City University of Hong Kong(系统工程系,香港城市大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 InsightX Agent基于LMM构建智能框架,集成工具提升X射线检测的可靠性与可解释性,实现主动推理与高质量分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07980 2026-03-10 cs.LG cs.AI cs.CL 67%

\$OneMillion-Bench: How Far are Language Agents from Human Experts?

一千万基准:语言代理距离人类专家还有多远?

Qianyu Yang, Yang Liu, Jiaqi Li, Jun Bai, Hao Chen, Kaiyuan Chen, Tiliang Duan, Jiayun Dong, Xiaobo Hu, Zixia Jia, Yang Liu, Tao Peng, Yixin Ren, Ran Tian, Zaiyuan Wang, Yanglihong Xiao, Gang Yao, Lingyue Yin, Ge Zhang, Chun Zhang, Jianpeng Jiao, Zilong Zheng, Yuan Gong

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 一千万基准通过400个专家精选任务评估语言代理在专业领域中的可靠性、深度和实践能力。

Comments 39 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22159 2026-03-10 cs.CR cs.AI cs.CL 62%

RedSage: A Cybersecurity Generalist LLM

RedSage:一种网络安全通用型大语言模型

Naufal Suryanto, Muzammal Naseer, Pengfei Li, Syed Talal Wasim, Jinhui Yi, Juergen Gall, Paolo Ceravolo, Ernesto Damiani

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RedSage通过领域感知的代理增强和预训练,提升网络安全专长和通用推理能力,实现开源本地部署。

Comments Published at ICLR 2026; Project page: https://risys-lab.github.io/RedSage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00726 2026-03-10 cs.RO cs.AI cs.LG 62%

CroSTAta: Cross-State Transition Attention Transformer for Robotic Manipulation

CroSTAta: 用于机器人操作的跨状态转换注意力变换器

Giovanni Minelli, Giulio Turrisi, Victor Barasuol, Claudio Semini

机构 * Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CroSTAta通过引入状态转换注意力机制提升机器人操作策略的鲁棒性和时间推理能力。

Comments Code and data available at https://github.com/iit-DLSLab/croSTAta

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07868 2026-03-10 cs.AI cs.LG 62%

Hospitality-VQA: Decision-Oriented Informativeness Evaluation for Vision-Language Models

Hospitality-VQA: 为视觉-语言模型的决策导向信息评估

Jeongwoo Lee, Baek Duhyeong, Eungyeol Han, Soyeon Shin, Gukin han, Seungduk Kim, Jaehyun Jeon, Taewoo Jeong

机构 * Yonsei University(延世大学) Yanolja NEXT

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出Hospitality-VQA,通过构建专门针对旅游业的VQA数据集,评估视觉-语言模型在决策导向场景中的信息评估能力,并发现需通过领域微调提升其决策意识。

Comments Accepted at EACL 2026 SRW. 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07394 2026-03-10 cs.CV cs.AI cs.CL 62%

AQuA: Toward Strategic Response Generation for Ambiguous Visual Questions

AQuA:迈向具有模糊性视觉问题的策略性响应生成

Jihyoung Jang, Hyounghun Kim

机构 * Graduate School of Artificial Intelligence, POSTECH(人工智能研究生院,POSTECH) Department of Computer Science and Engineering, POSTECH(计算机科学与工程系,POSTECH)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AQuA通过细粒度数据集和策略微调,提升VLMs在模糊视觉问答中的策略性响应生成能力。

Comments ICLR 2026 (28 pages); Project website: https://aqua-iclr2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏