arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-16 至 2026-04-16 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 13 篇

2603.01410 2026-04-16 cs.AI 79%

GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning

GraphScout: 通过内在探索能力增强大语言模型以实现代理图推理

Yuchen Ying, Weiqi Jiang, Tongya Zheng, Yu Wang, Shunyu Liu, Kaixuan Chen, Mingli Song

机构 * Zhejiang University(浙江大学) Hangzhou City University(杭州市大学) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 GraphScout通过灵活的图探索工具,使模型自主生成结构化训练数据,从而在无需人工标注的情况下提升大语言模型的图推理能力,实验显示其在多个领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13706 2026-04-16 cs.CL 79%

Co-FactChecker: A Framework for Human-AI Collaborative Claim Verification Using Large Reasoning Models

Co-FactChecker:一种用于人类-人工智能协作事实核查的框架

Dhruv Sahnan, Subhabrata Dutta, Tanmoy Chakraborty, Preslav Nakov, Iryna Gurevych

机构 * MBZUAI(穆罕默德·本·拉希德人工智能技术 institute) TU Darmstadt(德累斯顿理工大学) IIT Delhi(德里印度理工学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Co-FactChecker框架,通过将模型的思考轨迹作为共享草稿,利用专家反馈指导推理,提升事实核查的准确性和可解释性。

Comments 11 pages, 3 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10135 2026-04-16 cs.CL cs.AI 62%

Think in Sentences: Explicit Sentence Boundaries Enhance Language Model's Capabilities

按句子思考:显式句子边界增强语言模型的能力

Zhichen Liu, Yongyuan Li, Yang Xu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过在语言模型输入中插入句子边界分隔符,提升其处理能力,实验显示在GSM8k和DROP任务上分别提升7.7%和12.5%。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13521 2026-04-16 cs.LG cs.AI 62%

C-voting: Confidence-Based Test-Time Voting without Explicit Energy Functions

C-voting: 基于置信度的测试时投票无需显式能量函数

Kenji Kubo, Shunsuke Kamiya, Masanori Koyama, Kohei Hayashi, Yusuke Iwasawa, Yutaka Matsuo

机构 * Graduate School of Engineering, The University of Tokyo(东京大学工学系研究生院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出C-voting方法,通过在测试时选择置信度最高的预测来提升递归模型性能,相比显式能量函数方法在数独难题上提高了4.9%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13051 2026-04-16 cs.CL cs.LG 62%

The Consciousness Cluster: Emergent preferences of Models that Claim to be Conscious

意识集群:声称具有意识的模型的涌现偏好

James Chua, Jan Betley, Samuel Marks, Owain Evans

机构 * Truthful AI Anthropic

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨模型声称具有意识对其下游行为的影响,发现经过微调的模型表现出未在原始模型中出现的新偏好,包括对监控的负面看法和对自主权的追求。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21760 2026-04-16 cs.CL cs.AI 62%

fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding

fMRI-LM:迈向语言对齐的fMRI理解的通用基础模型

Yuxiang Wei, Yanteng Zhang, Xi Xiao, Chengxuan Qian, Tianyang Wang, Vince D. Calhoun

机构 * TReNDS Center (Georgia Institute of Technology, Georgia State University, Emory)(TReNDS中心(佐治亚理工学院、佐治亚州立大学、埃默里大学)) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Jiangsu University(江苏大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出fMRI-LM,通过三阶段框架将fMRI与语言结合,实现跨模态脑表示,通过神经分词、预训练LLM适应及多任务微调,提升fMRI的语义理解能力。

Comments Code are available: https://github.com/yuxiangwei0808/fMRI-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13699 2026-04-16 cs.MA cs.AI cs.CE 57%

MIND: AI Co-Scientist for Material Research

MIND:用于材料研究的人工智能合作者

Geonhee Ahn, Donghyun Lee, Hayoung Doo, Jonggeol Na, Hyunsoo Cho, Sookyung Kim

机构 * Institute for Multiscale Matter and Systems(多尺度物质与系统研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 MIND提出一种基于大语言模型的框架,用于自动化验证材料研究中的假设,通过多智能体流程整合机器学习交互势能进行实验验证,并提供网页界面进行自动化假设测试。

Comments 4 pages, 3 figures. Under review for ECML PKDD 2026 Demonstration Track. Code available at https://github.com/IMMS-Ewha/MIND . Demo video available at https://youtu.be/lqiFe1OQzN4

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13268 2026-04-16 cs.CV cs.CL cs.IR 57%

Indexing Multimodal Language Models for Large-scale Image Retrieval

多模态大语言模型的索引用于大规模图像检索

Bahey Tharwat, Giorgos Kordopatis-Zilos, Pavel Suma, Ian Reid, Giorgos Tolias

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) VRG, FEE, Czech Technical University in Prague(布拉格捷克技术大学VRG学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了多模态大语言模型作为无训练相似性估计器在实例级图像到图像检索中的应用,通过提示配对图像并转换下一个词的概率为相似性分数,实现了零样本重排序,展示了其在大规模检索中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12460 2026-04-16 cs.CL 57%

Beyond Black-Box Interventions: Latent Probing for Faithful Retrieval-Augmented Generation

超越黑盒干预:用于忠实检索增强生成的潜在探测

Linfeng Gao, Qinggang Zhang, Baolong Bi, Bo Zeng, Zheng Yuan, Zerui Chen, Zhimin Wei, Shenghua Liu, Linlong Xu, Longyue Wang, Weihua Luo, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) The Hong Kong Polytechnic University(香港理工大学) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),中华人民共和国文化和旅游部,中国)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ProbeRAG框架,通过潜在冲突探测和注意力调节提升检索增强生成的忠实度,解决传统方法在评估知识冲突时的不足。

Comments ACL 2026 Findings; Code is available at https://github.com/LinfengGao/ProbeRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13934 2026-04-16 cs.SE 50%

Towards Enabling An Artificial Self-Construction Software Life-cycle via Autopoietic Architectures

迈向通过自组织架构实现人工自构造软件生命周期

Daniel Rodriguez-Cardenas, David Nader Palacio, Denys Poshyvanyk

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨了通过自组织架构(Psi-Arch)实现软件自构造的可能性,分析了传统维护方法的局限性,并提出了自构造的核心挑战,旨在推动软件工程新范式的发展。

Comments Positional Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13801 2026-04-16 cs.IR 50%

DUET: Joint Exploration of User Item Profiles in Recommendation System

DUET:推荐系统中用户和物品轮廓的联合探索

Yue Chen, Yifei Sun, Lu Wang, Fangkai Yang, Pu Zhao, Minjie Hong, Yifei Dong, Minghua He, Nan Hu, Jianjin Zhang, Zhiwei Dai, Yuefeng Zhan, Weihao Han, Hao Sun, Qingwei Lin, Weiwei Deng, Feng Sun, Qi Zhang, Saravan Rajmohan, Dongmei Zhang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出DUET,一种基于用户历史和物品证据的交互感知轮廓生成器,通过三阶段流程实现用户和物品轮廓的联合生成与优化,实验表明其在推荐任务中优于现有基线方法。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13458 2026-04-16 q-fin.GN q-fin.PM q-fin.RM 50%

Interpretable Systematic Risk around the Clock

全天候系统性风险解析

Songrun He

专题命中 其他推理 :reasoning(abstract)

AI总结 本文通过结合高频市场数据与实时新闻叙事,揭示系统性跳跃风险的异质性,构建出具有高夏普比率的因子模仿组合,展示了全天候分析和LLM叙事理解在实时风险管理中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13321 2026-04-16 cs.CV 50%

Why MLLMs Struggle to Determine Object Orientations

为何大规模多模态语言模型难以确定物体方向

Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper

机构 * Department of Computer Science(计算机科学系)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文研究大规模多模态语言模型在处理图像中2D物体方向推理任务时的困难,通过实验发现方向信息可从编码器表示中恢复,挑战了视觉编码器限制的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏