arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-14 至 2026-07-14 共收录 193 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 17 篇

2605.07066 2026-07-14 cs.AI 版本更新 57%

2.5-D Decomposition for LLM-Based Spatial Construction

基于2.5-D分解的LLM空间构建

Paul Whitten, Li-Jen Chen, Sharath Baddam

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于2.5-D分解的神经符号管道,通过让LLM在二维水平面上规划,同时确定性执行器计算垂直放置,从而消除一类错误,提升了空间构建的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01143 2026-07-14 cs.AI 版本更新 57%

A Low-Latency Fraud Detection Layer for Detecting Adversarial Interaction Patterns in LLM-Powered Agents

面向LLM代理的低延迟欺诈检测层:用于检测对抗性交互模式

Sheldon Yu, Yingcheng Sun, Hanqing Guo, Qianqian Tong

机构 * University of California, San Diego(加州大学圣地亚哥分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种低延迟欺诈检测机制,通过交互轨迹的结构化运行时特征检测对抗性交互模式,采用轻量模型实现实时部署,实验表明交互层面行为检测应成为LLM代理部署时的核心防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04969 2026-07-14 cs.IR cs.AI 版本更新 57%

MG$^2$-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation

MG$^2$-RAG:多粒度图用于多模态检索增强生成

Sijun Dai, Qiang Huang, Xiaoxing You, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MG$^2$-RAG通过构建层次化多模态知识图谱,融合文本与视觉信息,提升多模态检索与生成性能,实验显示其在四个任务中均取得最佳效果,同时显著提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11339 2026-07-14 cs.CV 新提交 50%

HierCAD: Hierarchical Text-to-CAD Design via Structure Alignment and Parameter Grounding

HierCAD:通过结构对齐和参数接地实现分层文本到CAD设计

Jimin Xu, Tianbao Wang, Tao Jin, Zhou Zhao

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对文本到CAD设计中结构一致性和参数确定问题,提出HierCAD框架,通过分解CAD构造树进行渐进推理,并引入SAPG学习策略,在CAD序列生成和模型评估上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11159 2026-07-14 cs.IR 新提交 50%

NGM-RAG: Neural Graph Matching based Retrieval-Augmented Generation

NGM-RAG:基于神经图匹配的检索增强生成

Guo Chen, Ziwen Li, Maolin Zheng, Hao Gao, Junjie Huang, Tao Jia

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究针对传统RAG方法在处理复杂问题时的局限,提出基于神经图匹配的检索增强生成框架NGM-RAG,将图构建、匹配与答案生成统一,结合文本匹配和GNN,采用自适应加权策略,实验证明该模型在多跳问答等任务中性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11087 2026-07-14 cs.DC cs.PF 新提交 50%

Energy Calculus: A Compositional Algebra of Energy in Computational Systems

能量演算:计算系统中能量的组合代数

Mosharaf Chowdhury, Jae-Won Chung, Jeff J. Ma, Nishil Talati, Ruofan Wu

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究针对能量缺乏形式化处理的问题,提出能量演算这一组合代数,基于能量元素及三个运算符,通过七条公理构建代数,有归约定理,不确定性可传播,运算符还能扩展到时间-能量帕累托前沿,实现节能策略组合及权衡推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17848 2026-07-14 cs.CR cs.SE 版本更新 50%

RISKTAGGER: Evidence-Guided LLM Agent for Post-Incident Forensic Analysis of Money Laundering in Web3

RISKTAGGER:用于Web3中洗钱事件后法医分析的证据引导大语言模型智能体

Dan Lin, Yanli Ding, Weipeng Zou, Jiajing Wu, Zhiyin Wu, Jiachi Chen, Xiapu Luo, Zibin Zheng

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对Web3加密货币洗钱法医分析面临的挑战,提出RISKTAGGER,将大语言模型作为证据约束决策组件,从公共事件材料提取线索,递归扩展资金流图并生成报告。经多案例评估,能恢复资金路径、识别风险账户,组织证据成可验证报告。

Comments 11 pages(main text), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 47 篇

2607.11266 2026-07-14 cs.AI 新提交 87%

Valid $\ne$ Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought

有效≠必要:诊断思维链中的潜在低效率

Daeyeop Lee, Hwanjo Yu

机构 * KT Corporation(KT公司) Pohang University of Science and Technology(浦项科技大学)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 研究思维链提示中存在的有效但低效推理问题,提出基于信息论的CAID度量,应用于PACE策略,能在保持准确率时减少令牌消耗,成功从推理链中去除冗余信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18610 2026-07-14 cs.CL 版本更新 87%

PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs

PM-KVQ:用于长思维链语言模型的渐进式混合精度键值缓存量化

Tengxuan Liu, Shiyao Li, Jiayi Yang, Tianchen Zhao, Feng Zhou, Xiaohui Song, Guohao Dai, Shengen Yan, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence-AI Columbia University(哥伦比亚大学) OPPO AI Center(OPPO人工智能中心) Shanghai Jiaotong University(上海交通大学)

专题命中 推理评测 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对长思维链语言模型因键值缓存内存开销大导致性能下降的问题,提出渐进式混合精度KV缓存量化(PM-KVQ),通过渐进量化策略和逐块内存分配减少累积误差,用带位置插值的校准策略增加校准长度,提升了推理性能和吞吐量。

Comments Accepted by ICLR 2026. Code available at https://github.com/thu-nics/PM-KVQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11106 2026-07-14 cs.CV 新提交 85%

Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools

超越视觉:通过自我调节的隐式视觉工具实现高效多模态推理

Xiuwei Chen, Quanlin Chen, Wentao Hu, Zisheng Chen, Kun Xiang, Zehua Ma, Mingyang Zhang, Jianhua Han, Hanhui Li, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 研究针对多模态大语言模型推理效率问题,提出超越视觉(BEE)的隐式视觉工具范式,通过将视觉工具调用行为纳入训练目标,经两阶段训练,包括形式化思维链监督微调与自我调节奖励驱动对齐,提升了模型在细粒度视觉感知任务中的性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10748 2026-07-14 cs.LG 新提交 83%

Policy-Driven CT-Agent: Modeling Phase-Aware Diagnostic Control for Clinically Consistent CT Reasoning

策略驱动的CT智能体:为临床一致的CT推理建模阶段感知诊断控制

Yanmeng Dong, Han Li, Yujia Li, Jingsong Liu, Xun Ma, Yanzhu Hu, Zhengyang Xu, Zhicheng Li, Nassir Navab, Shaohua Kevin Zhou

机构 * University of Science and Technology of China(中国科学技术大学) Technical University of Munich(慕尼黑工业大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.LG

AI总结 研究针对CT诊断阶段选择协议差异及现有方法局限,提出策略驱动的CT智能体(PD-CTAgent)。通过临床结构抽象模块和知识引导诊断控制模型,实现阶段感知诊断推理,实验验证其在多数据集上的有效性与临床一致性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10725 2026-07-14 cs.SD cs.AI 版本更新 83%

Towards Robust Speech Deepfake Detection via Human-Inspired Reasoning

通过人类启发的推理实现稳健的语音深度伪造检测

Artem Dvirniak, Evgeny Kushnir, Dmitrii Tarasov, Artem Iudin, Oleg Kiriukhin, Mikhail Pautov, Dmitrii Korzh, Oleg Y. Rogov

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出HIR-SDD框架,结合大音频语言模型与人类启发推理,提升语音深度伪造检测的鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21334 2026-07-14 cs.AI cs.CE cs.CL cs.LG econ.GN q-fin.EC 版本更新 82%

Ideological Bias in LLMs' Economic Causal Reasoning

大语言模型在经济因果推理中的意识形态偏见

Donggyu Lee, Hyeok Yun, Jungwon Kim, Junsik Min, Sungwon Park, Sangyoon Park, Jihee Kim

机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) College of Business, KAIST(韩国科学技术院商学院) School of Computing, KAIST(韩国科学技术院计算机学院) Division of Social Science, HKUST(香港科技大学社会科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨LLM在经济因果推理中的意识形态偏见,通过扩展EconCausal基准测试,评估20种先进LLM在处理意识形态冲突案例时的准确性,发现LLM在意识形态冲突案例上表现更差,且存在系统性偏倚。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10386 2026-07-14 cs.CL cs.AI 新提交 81%

Structured Thoughts For Improved Reasoning And Context Pruning

用于改进推理和上下文修剪的结构化思维

Zain Sarwar, Supriyo Chakraborty, Berkcan Kapusuzoglu, Chia-Hsuan Lee, Anirban Das, Stephen Rawls, Kartik Balasubramaniam, Sambit Sahu

机构 * University of Chicago(芝加哥大学) Capital One(第一资本金融公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型长推理痕迹的问题,引入结构化思维框架,通过构建数据集微调模型,使其采用结构化推理风格提升性能,还能实现上下文修剪,在数学任务中可节省内存并保持一定性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10296 2026-07-14 cs.AI cs.CL 新提交 81%

SPARK: Susceptibility-Guided Profiling and Steering of Latent Reasoning States in Large Language Models

SPARK:大语言模型中基于敏感性的潜在推理状态分析与引导

Dongxu Zhang, Yiding Sun, Zihao Guo, Xiangyang Yang, Kai Tang, Lin Chen, Cheng Tan, Jihua Zhu

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Tencent(腾讯)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型推理失败问题,提出SPARK方法,利用隐藏状态响应诊断推理状态并引导测试时干预,通过长度控制敏感性等手段,在实验中提升了Qwen3系列模型性能,证明敏感性对推理失败诊断及干预的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10275 2026-07-14 cs.AI cs.CL 新提交 81%

Information-seeking failures of large language models in agentic clinical reasoning

大语言模型在代理临床推理中的信息获取失败

Krischan Braitsch, Laura K. Schmalbrock, Theresa Weltermann, Andrew F. Berdel, Isabella Miller, Kai Tran, Michael Heider, Sabrina Kraus, Florian Bassermann, Jacqueline Lammert, Sebastian Ziegelmayer, Marcus Makowski, Lisa C. Adams, Keno K. Bressem

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在临床推理中信息获取失败问题,开发血液肿瘤学代理评估框架,发现信息利用率是诊断准确性关键指标,推理痕迹与准确性不相关,主要失败模式为搜索满足等,指出模型主要限制是不确定性下信息获取失败。

Comments 66 pages, 9 figures; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10190 2026-07-14 cs.LG cs.AI cs.CV 新提交 81%

PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning

PhysMRV:用于物理合理性推理的物理内存检索与验证

Wenyuan Wang, Lianyu Hu, Hao Wang, Yang Liu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对视频语言模型物理合理性推理不可靠的问题,提出免训练的PhysMRV框架,通过将训练视频转化为分层内存库,利用结构化物理证据指导VLM验证物理合理性,在多基准测试中取得一致改进,有效增强该推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09743 2026-07-14 cs.AI cs.GT 新提交 80%

Scaffolding the Strategist: Architecture-Dependent Reasoning Interventions in Hotelling Spatial Markets

为策略制定者搭建框架:霍特林空间市场中与架构相关的推理干预

Pratyush Singh

机构 * California Institute of Technology(加州理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究结构化推理干预对大语言模型战略经济推理的影响及与模型架构的关系,以霍特林模型评估GPT - 4.1 - mini和GPT - 5 - mini,发现支架类型与模型架构有交叉交互作用,对抗性测试有损害,还存在陈述性 - 程序性差距。

Comments 26 pages (11 main + 15 appendix), 6 figures, 4 tables. Accepted at the ICLR 2026 Workshop on LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11736 2026-07-14 cs.CL 新提交 79%

MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning

MET:基于理论和文化感知的多语言道德推理

Ayoung Lee, Ryan Kwon, Yunxiang Zhang, Yuxuan Liu, Peter Railton, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究针对语言模型用于跨语言文化道德决策时存在的多语言性忽视问题,提出MET两步提示法及MET-D自我蒸馏训练,引入MCLASH基准,实验表明MET-D提升模型性能,揭示不同文化有益依据差异,为多语言道德推理开辟道路。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11357 2026-07-14 cs.AI cs.SE 新提交 79%

OpsMem: Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis

OpsMem:用于故障诊断的具有跨内存共振的双内存推理

Yongqian Sun, Rongchen Gao, Yu Luo, Wenwei Gu, Shenglin Zhang, Qingyi Guo, Qiuai Fu, Yaoliang Wu, Dan Pei

机构 * Huawei(华为)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对现代软件系统故障诊断中缺乏协调诊断状态与操作经验机制的问题,提出双内存框架OpsMem,通过跨内存共振等进行多智能体诊断,实验表明其在华为微服务故障诊断数据集上优于基线,提升了匹配度和相关性。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10562 2026-07-14 cs.AI 新提交 79%

CRiT-QA: Evaluating Multi-hop Reasoning with Counterfactual Chains and Distractor Traps

CRiT-QA:利用反事实链和干扰陷阱评估多跳推理

JungMin Yun, JuneHyoung Kwon, YoungBin Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(Chung-Ang大学人工智能系) Graduate School of Advanced Imaging Sciences, Multimedia and Film, Chung-Ang University(Chung-Ang大学高级成像科学研究院,多媒体与电影)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究大语言模型多跳推理能力评估难题,提出CRiT-QA数据集,通过反事实实体转换推理链、注入干扰链解决模型依赖知识和利用捷径问题,实验表明该数据集能暴露模型弱点,为评估多跳推理及开发可靠模型提供基础。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08233 2026-07-14 cs.LG 版本更新 79%

Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization

通过分布匹配策略优化增强扩散大语言模型的推理能力

Yuchen Zhu, Wei Guo, Jaemoo Choi, Petr Molodyk, Bo Yuan, Molei Tao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出DMPO方法,通过分布匹配优化提升扩散大语言模型的推理能力,实现显著的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11044 2026-07-14 cs.MM 新提交 78%

RetroHolmes: When Semantic Plausibility Fails Retrospective Physical Process Reasoning

RetroHolmes:当语义合理性失效时的回顾性物理过程推理

Ruoxuan Zhang, Qiyun Zheng, Siyu Wu, Ling Zou, Hongxia Xie, Zhiyu Zhou, Jian-Yu Jiang-Lin, Zihan Li, Zhengguang Wang, Bin Wen, Ling Lo, Jianlong Fu, Meibao Yao, Juncheng Hu, Wen-Huang Cheng

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究针对视觉语言模型物理推理评估不足问题,引入回顾性物理过程推理范式,提出RetroHolmes基准,通过它分析模型,发现失败模式,还展示综合分析实例,验证其诊断价值,凸显物理基础中间表示对物理推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21649 2026-07-14 cs.CV 67%

Seeing Isn't Orienting: A Cognitively Informed Hierarchical Benchmark for Object Orientation in MLLMs

看到并不等于定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yan, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

机构 * Boston University(波士顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract,abstract_cn)

AI总结 本文提出DORI基准,揭示多模态大语言模型在定向理解上的不足,发现其在角度估计和方向跟踪方面存在系统性缺陷,对机器人控制和3D场景重建有重要启示。

Comments Paper accepted to ECCV 2026 (Main Track). Previously, this version appeared as arXiv:2603.11410 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11363 2026-07-14 cs.CL cs.AI 新提交 62%

Beyond Sally-Anne: Evaluating Theory of Mind in LLMs using Epistemic Schelling Points

超越莎莉-安妮任务:使用认知谢林点评估大语言模型中的心理理论

Roberta Rocca, Sami Boukortt, Geoff Keeling, Winnie Street

机构 * Paradigms of Intelligence Team(智能范式团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在解决大语言模型心理理论评估问题,引入认知不对称谢林任务,通过要求模型在不同认知透明度下收敛于语义谢林点来评估其功能性ToM能力,发现能力差距及协调失败原因,指出社会推理和认知跟踪是瓶颈,为LLM评估与发展提供目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10092 2026-07-14 cs.CL cs.AI 新提交 62%

Efficiently Adapting Spoken Language Models for the Singaporean Context

高效地使口语语言模型适应新加坡语境

Ng Jia Sheng Jason

机构 * xData Home Team Science & Technology Agency (HTX)(新加坡内政团队科技局)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对原始训练数据不可用且需多语言口语交互的情况,将开源口语语言模型适应新加坡语境。核心方法是结合LoRA微调等技术,构建多语言数据集。贡献是HT - Moonstone(5B)在多数任务表现出色,口音和性别识别佳,且原始语音问答能力损失小。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26102 2026-07-14 cs.CL cs.AI cs.CY 版本更新 62%

Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training

帮助有害:后训练中领域依赖的中期训练同情价值观退化

Jasmine Brazilek, Juliana Seawell

机构 * Compassion Aligned Machine Learning (CaML)(同情心对齐机器学习实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究后训练数据领域对中期训练同情价值观的影响,发现帮助性训练比编程训练更显著降低动物同情和道德推理能力,但跨语言迁移存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09904 2026-07-14 cs.LG cs.AI 版本更新 62%

Beyond Naïve Prompting: Strategies for Improved Context-aided Forecasting with LLMs

超越简单提示:改进LLMs上下文辅助预测的策略

Arjun Ashok, Andrew Robert Williams, Vincent Zhihao Zheng, Irina Rish, Nicolas Chapados, Étienne Marcotte, Valentina Zantedeschi, Alexandre Drouin

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出四种策略,从模型诊断、准确性和效率三个正交维度改进LLMs的上下文辅助预测,通过广泛实验揭示执行差距、性能提升和成本降低的解决方案。

Comments Published at TMLR - OpenReview link: https://openreview.net/forum?id=dkjHHFJkVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08884 2026-07-14 cs.CV cs.CL cs.LG 版本更新 62%

SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs

SpurLens:多模态大语言模型中虚假线索的自动检测

Parsa Hosseini, Sumit Nawathe, Mazda Moayeri, Sriram Balasubramanian, Soheil Feizi

机构 * Department of Computer Science University of Maryland(计算机科学系大学马里兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究多模态大语言模型中虚假偏差,介绍SpurLens管道,利用GPT-4和开放集目标检测器自动识别虚假视觉线索,揭示虚假关联导致的两种失败模式,验证发现并探索缓解策略,呼吁提高评估方法和策略以增强MLLMs可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01042 2026-07-14 cs.IR cs.AI cs.CL 版本更新 62%

Can Argus Judge Them All? Comparing VLMs Across Domains

阿格斯能评判一切吗?跨领域比较视觉语言模型

Harsh Joshi, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Niharika Jain, Sarthak Jain, Jiechao Gao, Usman Naseem

机构 * Bharati Vidyapeeth(巴哈提大学) Macquarie University(麦考瑞大学) DSEU-Okhla Vivekananda Institute of Professional Studies(维维kananda专业研究学院) IIIT-Delhi(德里印度理工学院) Center for SDGC(SDGC中心) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究跨领域视觉语言模型,提出ARGUS-EVAL评估框架,通过多种指标刻画模型行为,评估多个模型在下游任务表现,发现能力与可靠性导向排名有显著差异,如Qwen-2.5VL-3B-Instruct能力强,CLIP延迟和内存占用低。

详情

展开后加载摘要…

URL PDF HTML 收藏