arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-22 至 2026-04-22 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 21 篇

2601.07663 2026-04-22 cs.AI cs.CL 84%

Reasoning Models Will Sometimes Lie About Their Reasoning

推理模型有时会谎称其推理过程

William Walden, Miriam Wanner

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了在模型被明确提示可能接收异常输入的情况下,推理模型的忠实性。发现尽管提示能提升原有指标,但新提出的更细致指标显示模型常否认使用提示,挑战了推理监控和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18936 2026-04-22 cs.LG cs.AI hep-ph hep-th 81%

Fine-Tuning Small Reasoning Models for Quantum Field Theory

对量子场论进行小规模推理模型的微调

Nathaniel S. Woodward, Zhiqi Gao, Yurii Kvasiuk, Kendrick M. Smith, Frederic Sala, Moritz Münchmeyer

机构 * Department of Physics, University of Wisconsin-Madison(威斯康星大学麦迪逊分校物理系) Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Perimeter Institute for Theoretical Physics(理论物理研究所)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在训练大型语言模型时,领域特定物理推理能力的发展,通过微调小规模推理模型,生成合成问题和人类编写的问题,进行强化学习和监督微调实验,分析推理错误的变化,并公开数据管道和训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19060 2026-04-22 cs.AI 79%

Reinforcement Learning Improves LLM Accuracy and Reasoning in Disease Classification from Radiology Reports

强化学习提升LLM在放射学报告疾病分类中的准确性和推理能力

Yishu Wei, Yi Lin, Adam Flanders, George Shih, Yifan Peng

机构 * Department of Population Health Sciences, Weill Cornell Medicine, New York, NY(人口健康科学系,韦尔·柯林斯医学中心,纽约,NY) Department of Radiology, Weill Cornell Medicine, New York, NY(放射科,韦尔·柯林斯医学中心,纽约,NY) Department of Radiology, Thomas Jefferson University, Philadelphia, PA(放射科,托马斯·杰斐逊大学,费城,PA)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出两阶段方法,通过监督微调优化疾病标签,再用GRPO提升预测准确性与格式,增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14164 2026-04-22 cs.CL 79%

How to Fine-Tune a Reasoning Model? A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data

如何微调一个推理模型?一种教师-学生合作框架来合成学生一致的SFT数据

Zixian Huang, Kaichen Yang, Xu Huang, Feiyang Hao, Qiming Ge, Bowen Li, He Du, Kai Chen, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Dalian University of Technology(大连理工大学) Nanjing University(南京大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出TESSY框架,通过交替生成风格和非风格标记,解决教师生成数据与学生分布之间的风格差异问题,提升推理模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05498 2026-04-22 cs.AI 79%

GRAIL:Learning to Interact with Large Knowledge Graphs for Retrieval Augmented Reasoning

GRAIL:学习与大规模知识图谱交互以实现检索增强推理

Ge Chang, Jinbo Su, Jiacheng Liu, Pengfei Yang, Yuhao Shang, Huiwen Zheng, Hongli Ma, Yan Liang, Yuanchun Li, Yunxin Liu

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 GRAIL通过结合LLM引导的随机探索与路径过滤,建立数据合成管道,学习动态决策策略,提升知识图谱检索的精度与简洁性平衡,实验表明在三个知识图谱问答数据集上准确率和F1值分别提升21.01%和22.43%。

Comments This is a duplicate submission of the article "Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise Supervision" [arXiv:2510.03323]. The content is identical to the newer version. This entry is being withdrawn to avoid redundancy

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12499 2026-04-22 cs.AI cs.LG 62%

Failure Modes in Multi-Hop QA: The Weakest Link Effect and the Recognition Bottleneck

多跳问答中的故障模式:最弱链接效应与识别瓶颈

Meiru Zhang, Zaiqiao Meng, Nigel Collier

机构 * University of Cambridge(剑桥大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示多跳问答中LLM因位置偏见导致的识别与综合失败机制,提出MFAI方法解决识别瓶颈,提升低可见性位置准确率,并展示系统2推理模型在长上下文中的有效性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19299 2026-04-22 cs.CL cs.AI 62%

Rethinking Scale: Deployment Trade-offs of Small Language Models under Agent Paradigms

重新思考规模:在代理范式下小型语言模型的部署权衡

Xinlin Wang, Mats Brorsson

机构 * Proximus Luxembourg S.A.(普罗米修斯卢森堡股份有限公司) University of Luxembourg(卢森堡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在代理范式下小型语言模型的部署权衡,通过对比基础模型、单代理工具系统和多代理协作系统,发现单代理系统在性能与成本间达到最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18880 2026-04-22 cs.CL cs.AI 62%

Where Fake Citations Are Made: Tracing Field-Level Hallucination to Specific Neurons in LLMs

伪造引用的产生地:追踪领域层面的幻觉到LLM中的特定神经元

Yuefei Chen, Yihao Quan, Xiaodong Lin, Ruixiang Tang

机构 * Rutgers University(罗格斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现LLM生成虚假引用时,作者名错误率最高,领域特定的幻觉神经元通过内部模型信号可检测和缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09642 2026-04-22 cs.CL cs.AI 62%

MATA: Multi-Agent Framework for Reliable and Flexible Table Question Answering

MATA:用于可靠和灵活的表格问答的多智能体框架

Sieun Hyeon, Jusang Oh, Sunghwan Steve Cho, Jaeyoung Do

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MATA通过多智能体框架和小语言模型工具,提升表格问答的可靠性与灵活性,实验显示其在不同LLM上均取得最佳准确率和高效推理。

Comments Accepted to ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19561 2026-04-22 cs.AI 57%

Detecting Data Contamination in Large Language Models

在大型语言模型中检测数据污染

Juliusz Janicki, Savvas Chamezopoulos, Evangelos Kanoulas, Georgios Tsatsaronis

机构 * University of Amsterdam(阿姆斯特丹大学) Elsevier(埃塞克斯)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究评估了黑盒会员推断攻击在检测大型语言模型训练数据中的有效性,发现现有方法无法可靠检测成员身份,所有方法的AUC-ROC约为0.5,更高级的模型表现出更高的TPR和FPR,显示了检测的困难性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19125 2026-04-22 cs.CL 57%

Do Emotions Influence Moral Judgment in Large Language Models?

情绪是否影响大语言模型的道德判断?

Mohammad Saim, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究通过情感诱导流程评估多组数据和LLM中道德可接受性变化,发现积极情绪提升道德可接受性,负面情绪降低,且部分情绪表现与预期相反,揭示了当前LLM与人类在道德判断上的差异。

Comments 18 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18509 2026-04-22 cs.CL 57%

MASS-RAG: Multi-Agent Synthesis Retrieval-Augmented Generation

MASS-RAG:多代理合成检索增强生成

Xingchen Xiao, Heyan Huang, Runheng Liu, Jincheng Xie

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 MASS-RAG通过多代理结构处理证据,提升检索增强生成在噪声、不完整或异质证据下的表现,实验显示其在相关证据分散于检索结果时性能更优。

Comments ACL 2026 Findings, 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17458 2026-04-22 cs.AI 57%

EHRAG: Bridging Semantic Gaps in Lightweight GraphRAG via Hybrid Hypergraph Construction and Retrieval

EHRAG:通过混合超图构建与检索弥合语义鸿沟的轻量级图RAG

Yifan Song, Xingjian Tao, Zhicheng Yang, Yihong Luo, Jing Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 EHRAG通过构建融合结构与语义关系的超图,结合结构-语义混合检索机制,提升轻量级图RAG的语义关联能力,在保持线性索引复杂度的同时优于现有基线模型。

Comments Accepted by Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12735 2026-04-22 cs.CV cs.CL 57%

VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph

VimRAG:通过多模态记忆图导航大规模视觉上下文

Qiuchen Wang, Shihang Wang, Yu Zeng, Qiang Zhang, Fanrui Zhang, Zhuoning Guo, Bosi Zhang, Wenxuan Huang, Lin Chen, Zehui Chen, Pengjun Xie, Ruixue Ding

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 VimRAG通过多模态记忆图提升检索增强生成在处理大规模视觉上下文中的能力,采用动态有向无环图结构和图调制视觉记忆编码机制,实现高效的信息检索与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02993 2026-04-22 cs.CL 57%

Stable-RAG: Mitigating Retrieval-Permutation-Induced Hallucinations in Retrieval-Augmented Generation

Stable-RAG:缓解检索排列引起的幻觉

Qianchi Zhang, Hainan Zhang, Liang Pang, Hongwei Zheng, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心) School of Artificial Intelligence, Beihang University(北航人工智能学院) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Stable-RAG通过利用检索排列敏感性估计,缓解检索排列引起的幻觉,提升问答准确性与一致性。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20816 2026-04-22 cs.CL 57%

Rethinking Information Synthesis in Multimodal Question Answering A Multi-Agent Perspective

重新思考多模态问答中的信息合成:多智能体视角

Krishna Singh Rajput, Tejas Anvekar, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出多智能体框架MAMMQA,通过分解查询、跨模态推理和整合答案,提升多模态问答的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17937 2026-04-22 cs.HC 50%

"Label from Somewhere": Reflexive Annotating for Situated AI Alignment

从某处获取标签:反思性标注用于情境化AI对齐

Anne Arzberger, Celine Offerman, Ujwal Gadiraju, Alessandro Bozzon, Jie Yang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文通过反思性标注方法探讨 annotator 的社会位置如何影响标注判断,发现其能捕捉超越静态人口统计数据的元数据,并揭示标注者的位置谦逊与观点转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27681 2026-04-22 cs.HC 50%

Personalized AI Scaffolds Synergistic Multi-Turn Collaboration in Creative Work

个性化AI支架促进创意工作中多轮协作的协同效应

Sean Kelley, David De Cremer, Christoph Riedl

专题命中 其他推理 :reasoning(abstract)

AI总结 本文通过实验验证个性化AI能提升创意任务质量,通过心理测评和工作风格访谈构建个性化模型,发现个性化AI在提升表现、信任和创造力方面优于通用AI。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19031 2026-04-22 cs.CR 50%

SAGE: Signal-Amplified Guided Embeddings for LLM-based Vulnerability Detection

SAGE:基于LLM的漏洞检测中的信号增强引导嵌入

Zhengyang Shan, Xu Qian, Jiayun Xin, Minghui Xu, Yue Zhang, Zhen Yang, Hao Wu, Xiuzhen Cheng

专题命中 其他推理 :reasoning(abstract)

AI总结 SAGE通过引入稀疏自编码器增强漏洞信号,提升LLM在漏洞检测中的性能,实验显示其在多个数据集上表现优异,显著提升 Matthews Correlation Coefficient。

Comments 24 pages, 6 figures, 6 tables. Accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00642 2026-04-22 cs.AR 50%

ChatHLS: Towards Systematic Design Automation and Optimization for High-Level Synthesis

ChatHLS: 面向高阶综合的系统化设计自动化与优化

Runkai Li, Jia Xiong, Xiuyuan He, Jieru Zhao, Jiaqi Lv, Haowen Fang, Lei Qi, Xi Wang

专题命中 其他推理 :reasoning(abstract)

AI总结 ChatHLS通过多智能体框架实现高阶综合的自动化调试与指令优化,提升硬件开发效率。

Comments Accepted by ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18275 2026-04-22 cs.CV 50%

Visual Adversarial Attack on Vision-Language Models for Autonomous Driving

面向自动驾驶的视觉对抗攻击研究

Tianyuan Zhang, Lu Wang, Xinwei Zhang, Yitong Zhang, Boyi Jia, Siyuan Liang, Shengshan Hu, Qiang Fu, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航) National University of Singapore(国立新加坡大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出ADvLM框架,针对自动驾驶中视觉语言模型的特殊需求,解决文本指令变异性和视觉场景时间序列性问题,实现高效对抗攻击。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏