arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-14 至 2026-04-14 共收录 233 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 40 篇

2604.09572 2026-04-14 cs.HC cs.AI cs.CL 62%

ACE-TA: An Agentic Teaching Assistant for Grounded Q&A, Quiz Generation, and Code Tutoring

ACE-TA:一种基于代理的教学助手用于 grounded Q&A、测验生成和代码辅导

Himanshu Tripathi, Charlottee Crowell, Kaley Newlin, Subash Neupane, Shahram Rahimi, Jason Keith

机构 * University of Alabama(阿拉巴马大学) Brown University(布朗大学) Meharry Medical College(梅哈里医学院) Iowa State University of Science and Technology(爱荷华州立科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ACE-TA利用预训练大语言模型,通过三个协调模块实现概念性问题的路由,提供精确解释、生成自适应测验并指导学生逐步学习代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27960 2026-04-14 cs.LG cs.CL cs.CV 62%

Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies

迈向高效的大型视觉-语言模型:关于推理策略的综合调查

Surendra Pathak, Bo Han

机构 * George Mason University(乔治梅森大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了提升大型视觉语言模型推理效率的最新方法,从视觉token压缩、内存管理、架构设计和解码策略四个维度进行分类,并指出当前方法的局限性及未来研究方向。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05125 2026-04-14 cs.CL cs.LG 62%

Catalog-Native LLM: Speaking Item-ID Dialect with Less Entanglement for Recommendation

基于目录的LLM:以更少的纠缠进行推荐的口语化项ID表达

Reza Shirkavand, Xiaokai Wei, Chen Wang, Zheng Hui, Heng Huang, Michelle Gong

机构 * University of Maryland - College Park(马里兰大学帕克分校) Roblox University of Cambridge(剑桥大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出IDIOMoE模型,通过将物品交互历史视为语言空间中的本地方言,结合预训练LLM的文本理解和协作信号,提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11462 2026-04-14 cs.AI 57%

Escaping the Context Bottleneck: Active Context Curation for LLM Agents via Reinforcement Learning

突破上下文瓶颈:通过强化学习实现LLM代理的主动上下文精修

Xiaozhe Li, Tianyi Lyu, Yizhao Yang, Liang Shan, Siyi Yang, Ligao Zhang, Zhuoyi Huang, Qingwen Liu, Yang Li

机构 * Tongji University(同济大学) Stanford University(斯坦福大学) CurrentsAI Research(CurrentsAI 研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种解耦上下文管理和任务执行的框架,通过强化学习训练轻量级策略模型ContextCurator,有效减少工作内存中的信息熵,提升LLM在长周期任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11193 2026-04-14 cs.CL 57%

TRACE: An Experiential Framework for Coherent Multi-hop Knowledge Graph Question Answering

TRACE: 一种用于连贯多跳知识图谱问答的经验框架

Yingxu Wang, Jiaxin Huang, Mengzhu Wang, Nan Yin

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hebei University of Technology(河北工业大学) City University of Hong Kong(香港城市大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 TRACE框架通过整合语言模型驱动的上下文推理与探索先验,提升多跳知识图谱问答的连贯性和鲁棒性,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11136 2026-04-14 cs.CV cs.AI 57%

BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning

BoxTuning:直接注入物体框进行多模态模型微调

Zekun Qian, Ruize Han, Wei Feng

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳理工大学计算机科学与人工智能学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 BoxTuning通过将物体空间时间信息直接注入视觉模态,解决多模态大语言模型在视频问答中物体细粒度定位的不足,显著降低token成本并保持时间分辨率,实验表明其在空间导向任务中优于文本坐标方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05505 2026-04-14 cs.CL 57%

FlashMem: Distilling Intrinsic Latent Memory via Computation Reuse

FlashMem: 通过计算复用提炼内在潜在记忆

Yubo Hou, Zhisheng Chen, Tao Wan, Zengchang Qin

机构 * School of ASEE, Beihang University(北京航空航天大学ASEE学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) School of BME, Beijing Advanced Innovation Center for BME, Beihang University(北京航空航天大学生物医学工程学院/北京生物医学工程高精尖创新中心) CAIR and CECS, VinUniversity(VinUniversity计算与人工智能研究中心/计算机工程与计算机科学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 FlashMem通过计算复用直接从临时推理状态提炼内在记忆,消除冗余重参数化,提升推理效率和持久认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11070 2026-04-14 cs.AI 57%

PRISM Risk Signal Framework: Hierarchy-Based Red Lines for AI Behavioral Risk

PRISM风险信号框架:基于层级的AI行为风险红线

Seulki Lee

机构 * AI Integrity Organization (AIO)(AI诚信组织)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于层级的PRISM框架,定义27种行为风险信号,通过双重阈值原则评估,区分确认风险与预警信号,提升AI安全性的前瞻性、全面性和可测量性。

Comments 13 pages, 13 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11065 2026-04-14 cs.AI 57%

AI Integrity: A New Paradigm for Verifiable AI Governance

AI可信性:可验证AI治理的新范式

Seulki Lee

机构 * AI Integrity Organization (AIO)(人工智能诚信组织(AIO))

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AI可信性概念,旨在通过保护AI系统中的权威堆栈,确保推理过程可验证,不同于现有AI伦理、安全和对齐范式。

Comments 13 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10949 2026-04-14 cs.CV cs.AI 57%

Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models

伪统一:熵探测揭示统一多模态模型中分歧的信息模式

Songlin Yang, Xianghao Kong, Anyi Rao

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示统一多模态模型中伪统一现象的根源,通过信息论方法分析输入编码和输出生成,发现模态不对称编码和响应模式分裂是导致分歧的主要原因,强调信息流一致性对真实多模态协同的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10505 2026-04-14 cs.AI cs.MA 57%

Cooperation in Human and Machine Agents: Promise Theory Considerations

人类与机器代理中的合作:承诺理论考虑

M. Burgess

机构 * ChiTek-i AS

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨人类与机器代理合作中的承诺理论,分析其在组织设计和功能实现中的统一视角,涵盖人类、硬件、软件及AI的合作与互动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14800 2026-04-14 eess.SY cs.AI cs.SY 57%

Large Language Model as An Operator: An Experience-Driven Solution for Distribution Network Voltage Control

大语言模型作为算子:一种经验驱动的配电网电压控制解决方案

Xu Yang, Chenhui Lin, Licheng Sha, Liping Yang, Shuzhou Wu, Xichen Tian, Haotian Liu, Wenchuan Wu

机构 * State Key Laboratory of Power Systems(电力系统国家重点实验室) State Grid Beijing Electric Power Company(国网北京市电力公司) Department of Electrical Engineering, Tsinghua University(清华大学电机工程与应用电子技术系)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的经验驱动日提前电压/无功调度方案,通过多模块协作实现调度策略的自进化,实验验证了该方法在信息不完整情况下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09484 2026-04-14 cs.LG 57%

An overview of condensation phenomenon in deep learning

深度学习中冷凝现象综述

Zhi-Qin John Xu, Yaoyu Zhang, Zhangchen Zhou

机构 * School of Mathematical Sciences, Institute of Natural Sciences, MOE-LSC, Shanghai Jiao Tong University(上海交通大学数学科学学院、自然科学研究院、教育部科学与工程计算重点实验室) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文综述了神经网络非线性训练中观察到的冷凝现象,探讨了冷凝过程的机制及其对网络泛化能力和transformer语言模型推理能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09866 2026-04-14 cs.SE cs.AI 57%

Automating Structural Analysis Across Multiple Software Platforms Using Large Language Models

利用大型语言模型在多个软件平台间自动化结构分析

Ziheng Geng, Jiachen Liu, Ian Franklin, Ran Cao, Dan M. Frangopol, Minghui Cheng

机构 * University of Miami(迈阿密大学) HBC Engineering Company(HBC工程公司) Hunan University(湖南大学) Lehigh University(里海大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种多软件平台结构分析自动化方法,通过两阶段多智能体架构实现跨平台建模与分析,实验表明其在多个主流软件中均达到90%以上的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09841 2026-04-14 cs.CV cs.AI 57%

Is There Knowledge Left to Extract? Evidence of Fragility in Medically Fine-Tuned Vision-Language Models

还有可以提取的知识吗?医学微调视觉语言模型中的脆弱性证据

Oliver McLaughlin, Daniel Shubin, Carsten Eickhoff, Ritambhara Singh, William Rudman, Michal Golovanevsky

机构 * Brown University(布朗大学) University of Washington(华盛顿大学) University of Tübingen(蒂宾根大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究评估了四个医学微调的视觉语言模型在四个医学影像任务中的表现,发现任务难度增加时性能下降至接近随机水平,表明临床推理有限,医学微调无明显优势,模型对提示词敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09747 2026-04-14 cs.CR cs.AI 57%

ADAM: A Systematic Data Extraction Attack on Agent Memory via Adaptive Querying

ADAM:通过自适应查询对代理记忆进行系统性数据提取攻击

Xingyu Lyu, Jianfeng He, Ning Wang, Yidan Hu, Tao Li, Danjue Chen, Shixiong Li, Yimin Chen

机构 * University of Massachusetts Lowell, USA(马萨诸塞大学洛厄尔分校) Amazon, USA(亚马逊) University of South Florida, USA(南佛罗里达大学) Rochester Institute of Technology, USA(罗切斯特理工学院) Purdue University, USA(普渡大学) North Carolina State University, USA(北卡罗来纳州立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ADAM攻击,通过估计受害者代理内存的数据分布和熵引导查询策略,提升隐私泄露效果,实验显示其攻击成功率高达100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09584 2026-04-14 cs.AI cs.CV 57%

Agentic Exploration of PDE Spaces using Latent Foundation Models for Parameterized Simulations

基于潜在基础模型的PDE空间代理探索用于参数化模拟

Abhijeet Vishwasrao, Francisco Giral, Mahmoud Golestanian, Federica Tonti, Andrea Arroyo Ramo, Adrian Lozano-Duran, Steven L. Brunton, Sergio Hoyas, Soledad Le Clainche, Hector Gomez, Ricardo Vinuesa

机构 * University of Michigan(密歇根大学) Universidad Politécnica de Madrid(马德里理工大学) Purdue University(普渡大学) Universitat Politècnica de València(瓦伦西亚理工大学) Caltech(加州理工学院) University of Washington(华盛顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用多代理LLM与潜在基础模型耦合,实现对PDE参数空间的连续探索,发现流体中不同尺度的标度律,展示了代理推理在PDE系统中的自动化科学发现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02123 2026-04-14 cs.AI cs.CV 57%

Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy

Nano-EmoX:从感知到共情的多模态情感智能统一框架

Jiahao Huang, Fengyan Lin, Xuechao Yang, Chen Feng, Kexin Zhu, Xu Yang, Zhide Chen

机构 * Fujian Normal University(福建师范大学) RMIT University(皇家墨尔本理工大学) Minjiang University(闽江学院)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Nano-EmoX,通过认知启发的三级架构整合感知、理解与交互层面的情感任务,首次实现六项核心情感任务的统一建模,展现高效且强大的泛化能力。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11321 2026-04-14 cs.NE 50%

Winner-Take-All Spiking Transformer for Language Modeling

胜者全取型脉冲变换器用于语言建模

Chenlin Zhou, Sihang Guo, Jiaqi Wang, Dongyang Ma, Kaiwei Che, Baiyu Chen, Qingyan Meng, Zhengyu Ma, Yonghong Tian

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出胜者全取机制的脉冲变换器模块,用于解决传统softmax基脉冲自注意力机制在语言建模中的高能耗问题,通过端到端训练实现高效的自然语言处理。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10932 2026-04-14 cs.DL cs.CY 50%

Visible, Trackable, Forkable: Opening the Process of Science

可见、可跟踪、可分支:开启科学进程

Sergey V. Samsonau

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出通过开放科学进程而非仅其产出,提升科学进展速度、推理可及性、主张可信度及质量保障可扩展性,提出可见、可跟踪、可分支三大属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10071 2026-04-14 cs.CV 50%

Spotlight and Shadow: Attention-Guided Dual-Anchor Introspective Decoding for MLLM Hallucination Mitigation

聚光与阴影:基于注意力的双锚点反思解码用于MLLM幻觉缓解

Yebo Wu, Han Jin, Zhijiang Guo, Li Li

机构 * State Key Laboratory of IOTSC, University of Macau(澳门大学物联网国家重点实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出双锚点反思解码框架DaID,通过动态校准每个token生成来缓解MLLM幻觉,利用视觉注意力分布指导双锚点选择,提升推理能力。

Comments Accepted for Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10060 2026-04-14 cs.PF 50%

Mosaic: Cross-Modal Clustering for Efficient Video Understanding

Mosaic:用于高效视频理解的跨模态聚类

Tuowei Wang, He Zhou, Chengru Song, Qiushi Li, Ju Ren

专题命中 其他推理 :reasoning(abstract)

AI总结 Mosaic是首个针对流式长视频理解的跨模态聚类驱动VLM推理系统,通过优化KVCache管理实现1.38倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21078 2026-04-14 cs.CV 50%

Towards Mitigating Modality Bias in Vision-Language Models for Temporal Action Localization

面向视频时序动作定位中缓解模态偏差的视觉-语言模型

Jiaqi Li, Guangming Wang, Shuntian Zheng, Minzhe Ni, Xiaoman Lu, Guanghui Ye, Yu Guan

机构 * UVLab, Department of Computer Science, University of Warwick(华威大学计算机科学系UVLab) Department of Automation, University of Cambridge(剑桥大学自动化系) Department of Computer Science, The University of Sheffield(谢菲尔德大学计算机科学系)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出ActionVLM框架,通过去偏差重加权模块和残差聚合策略缓解视频时序动作定位中的模态偏差,提升时间推理能力,在THUMOS14数据集上取得3.2%的mAP提升。

详情

展开后加载摘要…

URL PDF HTML 收藏