arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-17 至 2026-07-17 共收录 106 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 9 篇

2505.16839 2026-07-17 cs.CV 版本更新 50%

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa:用于多模态理解的大型扩散语言模型

Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Adobe Research(Adobe研究) Salesforce Research(Salesforce研究)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 3 篇

2607.14552 2026-07-17 cs.CL cs.AI 新提交 81%

Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models

答案条件思维链降低大语言模型中的可验证推理蒸馏

Jungseob Lee, Seungyoon Lee, Suhyune Son, Dongyub Jude Lee, Sungbin Han, Sugyeong Eo, Heuiseok Lim

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型推理能力蒸馏中,答案条件思维链会降低训练数据质量,导致可验证推理准确性下降,损失随难度增加,机制是从答案反向合理化,危害是数据属性,建议盲目生成答案。

Comments 13 pages, 4 figures, 14 tables. Code: https://github.com/js-lee-AI/answer-leakage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14242 2026-07-17 cs.CL 新提交 79%

Implicit Reasoning Steering via Concept Chaining

通过概念链进行隐式推理引导

Xiao Ye, Sanika Chavan, Yuxi Huang, Shahriar Kabir Nahin, Muhao Chen, Anshuman Chhabra, Ben Zhou

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) Department of Computer Science, University of California, Davis(加利福尼亚大学戴维斯分校计算机科学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 研究大语言模型推理脆弱性,提出概念链方法,通过生成连接段落继续预训练模型,使自然文本能引导模型预测,揭示推理脆弱性可被利用,为潜在偏差影响模型决策创造渠道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01185 2026-07-17 cs.AI 版本更新 57%

"Skill Issues'': Data-Centric Optimization of Lakehouse Agents

技能问题:湖仓代理的数据中心优化

Nicole Rose Schneider, Davide Ghilardi, Giacomo Piccinini, Jacopo Tagliabue

机构 * University of Maryland(马里兰大学) Università Milano Bicocca(米兰Bicocca大学) Bauplan Labs(Bauplan实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 针对分支湖仓Bauplan上的编码代理,提出数据中心的优化流程,通过生成任务验证器对、在隔离沙箱中执行候选技能并利用追踪信号和程序化检查评分,将准确率提升31.9%。

Comments Pre-print of paper accepted at ADS @ VLDB 2026, Boston

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 7 篇

2607.14114 2026-07-17 cs.CL cs.AI 新提交 90%

CoEvoT: Co-Evolving Chain-of-Thought Prompting for Graph-LLM Reasoning

CoEvoT:用于图语言模型推理的协同进化思维链提示

Haohua Niu, Xingtong Yu, Yang Liu, Junfeng Fang, Xuanting Xie, Jie Tan, Zhongjian Zhang, Hong Cheng, Yuan Fang

机构 * Sun Yat-Sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) National University of Singapore(新加坡国立大学) University of Electronic Science and Technology of China(电子科技大学) Beijing University of Posts and Telecommunieations(北京邮电大学) Singapore Management University(新加坡管理大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究分布转移下的图学习问题,提出CoEvoT框架,通过文本到图令牌重写与图到文本推理指导的闭环协同进化,实现逐步的、状态感知的证据细化,在八个数据集实验中性能优于现有基准模型。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14641 2026-07-17 cs.AI 新提交 57%

Analytic Abduction: Causal Decomposition and Governed Commitment for Human--AI Coordination

分析性溯因:用于人机协作的因果分解与受控承诺

Remo Pareschi

机构 * Stake Lab, University of Molise(莫利塞大学斯塔克实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究分析性溯因推理,核心方法是κ - τ 机制及因果簇,贡献在于将未确定分解作为共享协调对象,用于人机协作,为决策者提供竞争解释场景及证据,助力合理行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14557 2026-07-17 cs.AI 新提交 57%

Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation

从零步洞察终点:通过MLP稀疏感知截断加速扩散多模态大语言模型

Qicheng Zhao, Qi Sun, Zheyu Yan

机构 * Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究针对扩散多模态大语言模型推理效率受固定长度生成约束影响的问题,提出Seer框架,利用MLP激活稀疏性变化检测有效语义边界,进行冗余截断及采用混合执行策略,实验表明其可加速吞吐量并维持性能甚至提升复杂视觉任务准确性。

Comments Accepted to ACM Multimedia (ACM MM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14416 2026-07-17 cs.AI 新提交 57%

CausalGraphX: A Counterfactual Graph Neural Network Framework for Explainable Systemic Risk Assessment

因果图X:用于可解释系统性风险评估的反事实图神经网络框架

Rabimba Karanjai, Hemanth Madhavarao, Lei Xu, Weidong Shi

机构 * University of Houston(休斯顿大学) Kent State University(肯特州立大学) PayPal Inc.(贝宝公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对传统风险模型无法捕捉金融网络复杂动态及图神经网络缺乏因果解释的问题,提出因果图X框架,结合图神经网络与反事实推理,能有效评估系统性风险并提供可解释的反事实解释,优于传统和深度学习基线。

Comments Accepted in AAAI'26 Workshop, Agentic AI in Financial Services

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14341 2026-07-17 cs.RO cs.AI 新提交 57%

Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution

超越视觉抓取:从检测到执行的复杂抓取基准测试

Hanyi Zhang, Khang Nguyen, Charith Munasinghe, Basu Hela, Tianyu Li, Zihong Luo, Hoan Nguyen, Hans Wernher van de Venn, Yalin Zheng, Ravi Prakash, Tung D. Ta, Anh Nguyen, Baoru Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zurich University of Applied Science(苏黎世应用科学大学) Indian Institute of Science(印度科学研究所) University of Information Technology(信息技术大学) The University of Tokyo(东京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对现有抓取基准未涵盖复杂多步推理和语义理解任务的问题,提出GCA-Bench基准,实现多种基线方法并进行实证研究,给出新评估指标等,为开发更强大通用的抓取策略提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14303 2026-07-17 physics.ed-ph cs.AI 新提交 57%

Assessing AI in Introductory Physics Problem Solving

评估人工智能在基础物理问题解决中的能力

Amir Bralin, N. Sanjay Rebello

机构 * Texas Tech University(德克萨斯理工大学) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究评估OpenAI的o4-mini模型解决基础物理问题的能力,通过解决《费曼物理学讲义》章节末尾问题展开,发现模型总体准确率约90%,性能受问题模态和难度影响,表明先进大语言模型虽能解决不少基础物理问题,但表现不均衡。

Comments Working paper, submitted as a placeholder

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20785 2026-07-17 cs.CV 版本更新 50%

ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking

ME-IQA: 通过重新排序增强的记忆图像质量评估

Kanglong Fan, Tianhe Wu, Wen Wen, Jianzhao Liu, Le Yang, Yabin Zhang, Yiting Liao, Junlin Li, Li Zhang

机构 * City University of Hong Kong(香港城市大学) ByteDance Inc.(字节跳动公司)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ME-IQA通过构建记忆库和利用推理摘要检索语义和感知对齐的邻居,将VLM重构为概率比较器,并通过门控反思和记忆巩固提升未来决策,从而实现更密集的失真敏感预测,缓解离散崩溃问题。

Comments Published as a conference paper at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 26 篇

2503.19877 2026-07-17 cs.CL 版本更新 85%

Scaling Evaluation-time Compute with Reasoning Models as Evaluators

通过推理模型作为评估器来提升评估时的计算能力

Seungone Kim, Ian Wu, Jinu Lee, Xiang Yue, Seongyun Lee, Mingyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck

机构 * CMU(卡内基梅隆大学) UIUC(伊利诺伊大学) KAIST AI(韩国科学技术院人工智能研究所) NEC Laboratories Europe(日本 NEC 欧洲实验室) Ss.Cyril and Methodius University of Skopje(斯科普里塞尔吉尔和梅蒂乌斯大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL

AI总结 本文探讨了通过增加评估时的计算量来提升语言模型的评估能力,利用推理模型作为评估器,分别评估响应整体和每个步骤,从而提高评估效果。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14895 2026-07-17 cs.LG cs.CL 新提交 81%

Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation

利用指令微调与合并实现推理模型适配

Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究如何利用大量未使用的监督微调数据提升推理语言模型性能,先对模型进行经典指令微调,再与原始推理模型合并,该技术在多领域提升了模型性能且成本效益高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05000 2026-07-17 cs.CR cs.LG 版本更新 79%

Agentic Vulnerability Reasoning on COTS Binaries

基于商用现货二进制文件的智能体漏洞推理

Hwiwon Lee, Jongseong Kim, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 研究LLM智能体对COTS二进制文件漏洞的推理能力,构建SLYP管道,结合二进制探索与动态调试验证漏洞。在COM基准测试中表现出色,发现更多真实漏洞,生成验证PoC,还发现多个零日漏洞,证明工具集和模型选择的重要性及通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14333 2026-07-17 cs.CV cs.CL 新提交 79%

SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning

SD-MAR:通过合成数据和强化学习进行多图像分析推理

Shiyu Yuan, Sourav Sanjukta Bhabesh, Zhe Wang, Dmitriy Bespalov, Wesley Rose, Huzefa Rangwala

机构 * Stevens Institute of Technology(史蒂文斯理工学院) AGI Foundations for AWS(AWS的通用人工智能基金会) Amazon Web Services (AWS)(亚马逊网络服务公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究针对视觉语言模型在多图像分析推理任务中的局限,提出SD-MAR框架,通过合成数据和强化学习训练评估模型。该框架构建场景生成任务,采用GRPO-lite与BDA训练。实验表明能提升域内准确率,保持或提高域外泛化能力,还改进了模型逻辑连贯性和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27636 2026-07-17 cs.CL 79%

Simorgh at SemEval-2026 task 7: Region-Aware Hybrid Retrieval for Low-Resource Cultural Reasoning in Multilingual Question Answering

Simorgh at SemEval-2026 task 7: 面向低资源文化推理的多语言问答中的区域感知混合检索

Hadi Bayrami Asl Tekanlou, Mahdi Bakhtiyarzadeh, Jafar Razmara

机构 * University of Tabriz(塔布里兹大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出区域感知混合检索方法,结合BM25和稠密语义相似度与区域加权启发式,以提升多语言文化问答的跨语言稳定性。

Comments 6 pages, 3 figures, accepted to the Everyday Knowledge Across Diverse Languages and Cultures shared task at SemEval2026

Journal ref Proceedings of the 20th International Workshop on Semantic Evaluation (SemEval-2026), Association for Computational Linguistics, 2026, pp. 624-629

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14109 2026-07-17 cs.CL cs.AI 新提交 79%

Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation

简单性悖论:揭穿关于大语言模型评估中提示和数据集的神话

Inder Preet, Shuxin Lin, Dhaval Patel

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型评估中提示和数据集相关问题,通过对8种提示技术在10个MCQA数据集上的实证研究,发现基线提示常优于复杂技术,还研究了相关关键现象,表明LLM评估社区或使提示工程过复杂,存在性能差距,为模型改进提供机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15255 2026-07-17 cs.CV 新提交 78%

HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning

HoloGeo:通过证据驱动推理减轻地理定位中的地标偏差

Pengcheng Zhou, Xuanyu Liu, Yanchen Yin, Bobo Li, Shengqiong Wu, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Shandong University of Science and Technology(山东科技大学) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究针对视觉语言模型地理定位易受地标偏差影响的问题,提出证据驱动推理框架HoloGeo,借助高质量数据集,通过多维度奖励实现平衡关注与联合推理,经实验验证其在多个数据集上能有效减轻地标偏差,提升地理定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18146 2026-07-17 cs.IR 版本更新 78%

Think When Needed: Model-Aware Reasoning Routing for LLM-based Ranking

按需思考:基于大语言模型排序的模型感知推理路由

Huizhong Guo, Tianjun Wei, Dongxia Wang, Yingpeng Du, Ziyan Wang, Jie Zhang, Zhu Sun

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究基于大语言模型排序时推理时机与效果问题,提出推理路由框架,利用生成前信号决定推理与否,能自适应选策略,经实验验证该框架可提高排序效用并减少令牌消耗,解决准确性与效率权衡问题。

Comments Accepted by SIGIR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14543 2026-07-17 cs.RO cs.AI 新提交 70%

SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents

SafeRelBench:用于VLM驱动的具身智能体过程级安全的空间关系感知基准测试

Huaigang Yang, Ya Li, Min Ren, Bo Dai, Zhenliang Zhang, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究VLM驱动具身智能体的过程级安全问题,引入SAFERELBENCH基准测试,含507个样本。评估七个智能体发现任务成功与安全合规有差距,该基准明确测试行动前安全条件,凸显空间关系在安全评估中的核心地位。

Comments Preprint. 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22030 2026-07-17 cs.AI cs.CL cs.IR cs.LG 版本更新 67%

When Does Belief-Based Agent Memory Help? Reliability-Conditional Updating and Provenance-Capped Poisoning Defense

Nous:一种用于长期智能体记忆的预测世界模型

Pranav Singh

机构 * Indian Institute of Technology Ropar(印度理工学院罗巴尔分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Nous记忆架构,基于知识即预测而非存储的原则,通过贝叶斯更新维护概率分布,以信息论惊喜度评分并记录信念变化,在LoCoMo基准上取得优于对比方法的F1分数。

Comments Preprint. 10 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28732 2026-07-17 cs.CL cs.AI cs.LG 版本更新 67%

MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems

MemTrace:大型语言模型记忆系统中的错误追踪与归因

Xinle Deng, Ruobin Zhong, Hujin Peng, Xiaoben Lu, Yanzhe Wu, Guang Li, Buqiang Xu, Yunzhi Yao, Jizhan Fang, Haoliang Cao, Junjie Guo, Yuan Yuan, Ziqing Ma, Yuanqiang Yu, Rui Hu, Baohua Dong, Hangcheng Zhu, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MemTrace框架,通过构建可执行的记忆演化图实现细粒度错误追踪,并利用自动归因方法定位根因,进而优化提示词提升下游任务性能。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15161 2026-07-17 cs.LG cs.CL 新提交 62%

On-Policy Delta Distillation

策略内增量蒸馏

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

机构 * NAVER AI Lab(NAVER人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究基于策略内蒸馏,引入新的增量信号作为蒸馏奖励,提出策略内增量蒸馏方法。实验表明该方法能显著改进策略内蒸馏,使推理语言模型在短训练期内表现出色,优于传统方法。

Comments 19 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14989 2026-07-17 cs.CL cs.AI 新提交 62%

OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

OmniaBench:跨多样场景对通用人工智能智能体进行基准测试

Chengyu Shen, Yujie Fu, Gangtao Xin, Yanheng Hou, Wenlong Fei, Guojie Zhu, Jiawei Li, Hongcheng Gao, Runming He, Zhen Hao Wong, Meiyi Qiang, Hao Liang, Zhao Cao, Hao Jiang, Chong Chen, Wentao Zhang

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型向通用智能体演变,现有基准测试有局限的问题,引入OmniaBench。通过多渠道获取场景知识形成分类法,构建可执行环境并合成任务,还引入能力分类法等。其数据集含多任务,对前沿模型构成挑战,能表征通用智能体能力边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14159 2026-07-17 cs.AI cs.CL 新提交 62%

MemoHarness: Agent Harnesses That Learn from Experience

MemoHarness:从经验中学习的智能体控制层

Yue Huang, Wenjie Wang, Han Bao, Yuchen Ma, Xiaonan Luo, Yi Nian, Haomin Zhuang, Zheyuan Liu, Yue Zhao, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) LMU Munich(慕尼黑大学) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对智能体控制层设计影响行为但改进方法窄且多重用单一全局控制层的问题,提出自适应框架MemoHarness,通过分解控制层、存储经验并检索应用,在多基准测试中优于固定控制层,证明执行经验可构建更具适应性的控制层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14099 2026-07-17 cs.CL cs.AI cs.CV 新提交 62%

Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs

只需持续提示:评估视觉语言模型中的重复苏格拉底式提示

Shayda Moezzi, Bishoy Galoaa, Lorena Genua, Taskin Padir, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究视觉语言模型在反复提示下的稳定性,引入JKP多轮评估框架,用三种策略对模型提问,在STAR基准子集上评估GPT-4o、Gemini 2.5 Pro和Qwen3-VL-30B,发现重复提示利弊兼具且因模型而异,揭示了模型压力反应概况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09142 2026-07-17 cs.AI cs.CL cs.CV 版本更新 62%

MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

MedRealMM:用于中国在线医疗咨询的真实世界多模态基准测试

Runhan Shi, Quan Zhou, Yuqian Xu, Shuai Yang, Xin Wu, Zitong Zhou, Hui Liu, Bin Zha, Zheming Wang, Liya Li, Wei Wei, Jinru Ding, Wenrao Pang, Mouxiao Bian, Haoyuan Hu, Jun Xu, Jie Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有在线医疗咨询基准与实际临床实践契合度差的问题,构建MedRealMM基准测试,用多模态临床挑战点提取框架转化任务并设评分标准,评估多个大语言模型,指出图像信息重要,前沿模型有不足,为多模态医学推理评估提供现实可重复基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12477 2026-07-17 cs.AI cs.LG 版本更新 62%

DualHNIE: Dual-Channel Hypergraph Learning for Node Importance Estimation in Heterogeneous Knowledge Graphs

MetaHGNIE:异构知识图谱中的元路径诱导超图对比学习

Jiawen Chen, Yanyan He, Qi Shao, Mengli Wei, Duxin Chen, Wenwu Yu, Yanlong Zhao

机构 * Jiangsu Key Laboratory of Networked Collective Intelligence, School of Mathematics, Southeast University(江苏网络集体智能重点实验室,数学学院,东南大学) Jiangsu Key Laboratory of Networked Collective Intelligence, School of Cyber Science and Engineering, Southeast University(江苏网络集体智能重点实验室,网络科学与工程学院,东南大学) State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究异构知识图谱中节点重要性估计问题,提出DualHNIE框架,通过构建高阶知识图谱、引入互补编码器及对比对齐机制进行显式高阶建模和解缠双通道表示学习,实验验证其优于现有方法。

Comments Accepted by IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15241 2026-07-17 cs.CL cs.CV 新提交 57%

Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA

超越排行榜:可信多模态视觉问答的设计经验教训

Sushant Gautam, Vajira Thambawita, Michael A. Riegler, Pål Halvorsen, Steven A. Hicks

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 以MediaEval Medico 2025为案例,分析九个多模态问答系统,发现预训练主干的参数高效适应虽有挑战性能,但答案提升未转化为完整临床推理,结构化推理等方法更可靠,结果促使多方面改进,支持可信多模态医疗保健人工智能。

Comments Accepted for presentation at the 39th IEEE International Symposium on Computer-Based Medical Systems (IEEE CBMS 2026) as a regular paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15202 2026-07-17 cs.AI cs.HC cs.MA cs.MM 新提交 57%

Self-Evolving Human-Centered Framework for Explainable Depression Symptom Annotation

用于可解释抑郁症症状标注的自我进化以人为中心框架

Hoang-Loc Cao, Van Pham, Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Phuc Ho, Veronica Whitford, Hung Cao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对抑郁症标注质量瓶颈,提出结合大语言模型辅助与专家验证的自我进化标注框架,分三阶段运行,采用双记忆架构,能提高标注一致性和可解释性,减少人工修订,还输出多种信息实现可审计性。

Comments Accepted at IEEE International Conference on Omni-Layer Intelligent Systems (COINS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏