arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-07 至 2026-04-07 共收录 162 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 18 篇

2506.00318 2026-04-07 cs.CV 82%

Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

链式帧:通过帧感知推理推进多模态大语言模型的视频理解

Sara Ghazanfari, Francesco Croce, Nicolas Flammarion, Prashanth Krishnamurthy, Farshad Khorrami, Siddharth Garg

机构 * New York University(纽约大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract)

AI总结 本文提出一种单阶段视频LLM,通过显式引用相关帧减少推理中的时间不一致性,利用COF-DATA数据集提升视频理解性能,发现合成数据显著提升模型准确率。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04255 2026-04-07 cs.LG cs.CR 79%

Towards Unveiling Vulnerabilities of Large Reasoning Models in Machine Unlearning

面向揭示大规模推理模型在机器反向学习中的漏洞

Aobo Chen, Chenxu Zhao, Chenglin Miao, Mengdi Huai

机构 * Iowa State University(爱荷华州立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文研究大规模推理模型在机器反向学习中的安全漏洞,提出一种能生成误导性推理轨迹的攻击方法,并通过白盒和黑盒实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04208 2026-04-07 cs.LG 79%

Towards Agentic Defect Reasoning: A Graph-Assisted Retrieval Framework for Laser Powder Bed Fusion

迈向代理缺陷推理:一种用于激光粉末床融合的图辅助检索框架

Muhammad Rizwan Awan, Volker Pickert, Muhammad Waqar Ashraf, Saleh Ali, Farshid Mahmouditabar, Shafiq Odhano

机构 * Department of Electrical and Electronic Engineering, The Newcastle University(纽卡斯尔大学电气与电子工程系) The Sargent Centre for Process Systems Engineering, Department of Chemical Engineering, University College London(伦敦大学学院化学工程系萨金特过程系统工程中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出一种图辅助检索框架,用于激光粉末床融合中的缺陷推理,通过构建知识图谱实现参数与缺陷之间的可解释路径识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11572 2026-04-07 cs.CY cs.AI 79%

Implicit Bias-Like Patterns in Reasoning Models

推理模型中的隐性偏见模式

Messi H. J. Lee, Calvin K. Lai

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Rutgers University(罗格斯大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究推理模型在处理关联不兼容任务时消耗更多推理token,揭示其隐性偏见特征及模型内部推理内容的影响

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03671 2026-04-07 cs.IR 78%

User Simulator-Guided Multi-Turn Preference Optimization for Reasoning LLM-based Conversational Recommendation

基于用户模拟器的多轮偏好优化推理LLM对话推荐

Xingyuan Xiang, Xiangchen Pan, Wei Wei

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出SMTPO框架,通过多任务监督微调和强化学习优化多轮对话推荐,提升推荐准确性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04078 2026-04-07 eess.IV cs.AI cs.CV 74%

BAAI Cardiac Agent: An intelligent multimodal agent for automated reasoning and diagnosis of cardiovascular diseases from cardiac magnetic resonance imaging

BAAI心脏代理:一种智能多模态代理,用于从心脏磁共振成像自动推理和诊断心血管疾病

Taiping Qu, Hongkai Zhang, Lantian Zhang, Can Zhao, Nan Zhang, Hui Wang, Zhen Zhou, Mingye Zou, Kairui Bo, Pengfei Zhao, Xingxing Jin, Zixian Su, Kun Jiang, Huan Liu, Yu Du, Maozhou Wang, Ruifang Yan, Zhongyuan Wang, Tiejun Huang, Lei Xu, Henggui Zhang

机构 * Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) Department of Radiology, Beijing Anzhen Hospital, Beijing Institute of Heart, Lung & Vascular Diseases, Capital Medical University(首都医科大学附属北京安贞医院放射科,北京市心肺血管疾病研究所) Department of MR, the First Affiliated Hospital, Henan Medical University(河南医科大学第一附属医院磁共振科) Department of Cardiology, Clinical Center for Coronary Heart Disease, Beijing Institute of Heart, Lung and Blood Vessel Disease, Beijing Anzhen Hospital, Capital Medical University(首都医科大学附属北京安贞医院心内科,冠心病临床中心,北京市心肺血管疾病研究所) Department of Cardiac Surgery, Beijing Anzhen Hospital, Institute of Heart, Lung and Vascular Diseases, Capital Medical University(首都医科大学附属北京安贞医院心脏外科,心肺血管疾病研究所)

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 本文提出BAAI心脏代理,通过多模态智能系统实现心脏磁共振成像的端到端解读,实现了自动分割、功能量化、组织特征分析和疾病诊断,并在多个心血管疾病数据集上验证了其高准确率和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04847 2026-04-07 eess.AS cs.CL 70%

Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency

全双工基准v3:在现实世界不流畅条件下评估全双工语音代理的基准工具

Guan-Ting Lin, Chen Chen, Zhehuai Chen, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出全双工基准v3,用于评估在自然语音条件下和多步骤工具使用中语言模型的性能。通过六个模型配置评估准确性、延迟和轮流交流维度,发现GPT-Realtime在Pass@1和打断避免方面表现最佳,而Gemini Live 3.1具有最短延迟但轮流率最低。

Comments Work in progress. Demo at https://daniellin94144.github.io/FDB-v3-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03266 2026-04-07 cs.MA cs.LG 70%

Emergent Compositional Communication for Latent World Properties

涌现的组合通信用于潜在世界属性

Tomek Kaszyński

机构 * Independent Researcher, Amsterdam, Netherlands(独立研究者,阿姆斯特丹,荷兰)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文研究多智能体通信能否从冻结视频特征中提取离散组合性表示,展示通过Gumbel-Softmax瓶颈和迭代学习发展出无标签的组合协议,验证了感知先验对可通信信息的影响。

Comments 24 pages, 4 figures, 12 tables. Code: https://github.com/TomekKaszynski/emergent-physics-comm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03912 2026-04-07 cs.CR cs.AI cs.DC cs.LG 62%

Automating Cloud Security and Forensics Through a Secure-by-Design Generative AI Framework

通过安全设计的生成AI框架实现云安全与取证自动化

Dalal Alharthi, Ivan Roberto Kawaminami Garcia

机构 * University of Arizona(亚利桑那大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个安全设计的生成AI框架,结合PromptShield和CIAF,提升云环境中的安全性和取证准确性,通过实验证明在攻击条件下分类性能和勒索软件检测精度显著提升。

Comments arXiv admin note: substantial text overlap with arXiv:2510.00452

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14536 2026-04-07 cs.CL cs.AI 62%

Explainable Token-level Noise Filtering for LLM Fine-tuning Datasets

可解释的token级噪声过滤用于LLM微调数据集

Yuchen Yang, Wenze Lin, Enhao Huang, Zhixuan Chu, Hongbin Zhou, Lan Tao, Yiming Li, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) Hangzhou HighTech Zone (Binjiang) Blockchain and Data Security Research Institute(杭州高新区(滨江)区块链与数据安全研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出XTF框架,通过分解token级数据对微调过程的贡献,提升LLM微调性能,实验表明在数学、代码和医学任务中性能提升达13.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00077 2026-04-07 cs.CL cs.LG stat.ML 62%

Gaussian mixture models as a proxy for interacting language models

高斯混合模型作为交互语言模型的代理

Edward L. Wang, Mohammad Sharifi Kiasari, Tianyu Wang, Hayden Helm, Avanti Athreya, Carey Priebe, Vince Lyzinski

机构 * Helivan Research

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出交互高斯混合模型作为交互语言模型的代理,通过构建具有类RAG更新机制的模型,展示其在低计算成本下模拟交互语言模型的反馈过程,并提供理论分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12626 2026-04-07 cs.HC cs.AI cs.CY cs.ET 57%

DoubleAgents: Human-Agent Alignment in a Socially Embedded Workflow

DoubleAgents:社会嵌入式工作流中的人机对齐

Tao Long, Xuanming Zhang, Sitong Wang, Zhou Yu, Lydia B Chilton

机构 * Columbia University(哥伦比亚大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 DoubleAgents通过分布式认知框架实现人机对齐,整合协调代理、可视化仪表板和策略模块,提升复杂社会嵌入式任务的执行效率与用户信任。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03586 2026-04-07 cs.CL 57%

MultiPress: A Multi-Agent Framework for Interpretable Multimodal News Classification

MultiPress:一种用于可解释多模态新闻分类的多智能体框架

Tailong Luo, Hao Li, Rong Fu, Xinyue Jiang, Huaxuan Ding, Yiduo Zhang, Zilin Zhao, Simon Fong, Guangyin Jin, Jianyuan Ni

机构 * New York Institute of Technology(纽约理工学院) University of Arizona(亚利桑那大学) University of Macau(澳门大学) Peking University(北京大学) Juniata College(朱尼亚塔学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MultiPress多智能体框架,通过多模块协作和检索增强推理提升多模态新闻分类的准确性和可解释性。

Comments Accepted in International Joint Conference on Neural Networks (IJCNN) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08388 2026-04-07 cs.AI 57%

A Hierarchical Error-Corrective Graph Framework for Autonomous Agents with LLM-Based Action Generation

一种用于自主代理的分层错误校正图框架:基于大语言模型的动作生成

Cong Cao, Jingyao Zhang, Kun Tong

机构 * Independent Researcher(独立研究者) Beihang University(北京航空航天大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HECG框架,通过多维可转移策略、误差矩阵分类和因果-上下文图检索三大创新,提升自主代理在动态任务中的策略选择、错误分析和情境适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03855 2026-04-07 cs.DB 50%

VectraFlow: Long-Horizon Semantic Processing over Data and Event Streams with LLMs

VectraFlow:基于LLM的长时域语义处理数据与事件流

Shu Chen, Junhan Liu, Deepti Raghavan, Ugur Cetintemel

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 VectraFlow通过结合LLM与传统关系运算符,实现了对无结构数据流的长时域语义处理,提供连续语义运算符,支持自然语言意图到可执行运算图的转换,实现从原始文本到匹配事件群体的端到端模式检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03561 2026-04-07 cs.SE 50%

From UI to Code: Mobile Ads Detection via LLM-Unified Static-Dynamic Analysis

从UI到代码:通过LLM统一的静态-动态分析进行移动广告检测

Shang Ma, Wei Cheng, Yanfang Ye, Xusheng Xiao

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出ADWISE框架,通过结合静态分析和LLM引导的UI结构、应用语义及检索类比,有效检测移动广告。实验表明,ADWISE在广告widget检测上优于现有方法25.60%,并发现更多广告违规情况。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 34 篇

2604.04852 2026-04-07 cs.CR cs.AI 89%

Strengthening Human-Centric Chain-of-Thought Reasoning Integrity in LLMs via a Structured Prompt Framework

通过结构化提示框架强化LLMs中以人为中心的链式推理完整性

Jiling Zhou, Aisvarya Adeseye, Seppo Virtanen, Antti Hakkala, Jouni Isoaho

机构 * Department of Computing, University of Turku(图尔库大学计算机系)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出结构化提示框架以提升LLMs链式推理的可靠性及安全威胁检测能力,通过16个核心维度因素优化推理过程,实验证明在DDoS攻击检测中推理能力提升达40%,并获得高人评一致性。

Comments This paper has been accepted at the 12th Intelligent Systems Conference (IntelliSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01702 2026-04-07 cs.CL 89%

On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning

在长链式思维监督微调中推理模式在泛化差异中的作用

Zhaoyi Li, Xiangyu Xi, Zhengyu Chen, Wei Wang, Gangwei Jiang, Ranran Shen, Linqi Song, Ying Wei, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) Meituan LongCat Team(美团龙猫团队) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文研究不同来源的长链式思维轨迹对模型泛化性能的影响,发现训练损失低并不一定带来更好的泛化能力,提出过滤频繁分支轨迹以提升SFT泛化性能。

Comments Under Review. version2: correct typos in Table 4 and add an ablation study (Table 5)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04443 2026-04-07 cs.CL 83%

DeonticBench: A Benchmark for Reasoning over Rules

DeonticBench: 一个用于规则推理的基准

Guangyao Dou, Luis Brena, Akhil Deo, William Jurayj, Jingyu Zhang, Nils Holzenberger, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出DeonticBench,包含6232个任务,涵盖美国联邦税收、航空行李政策等真实领域,研究复杂规则推理问题,结合语言推理与符号计算,评估LLM在非符号和符号环境下的规则推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04720 2026-04-07 cs.CL cs.AI 81%

What Makes Good Multilingual Reasoning? Disentangling Reasoning Traces with Measurable Features

什么使多语言推理有效?通过可测量的特征解构推理痕迹

Dayeon Ki, Kevin Duh, Marine Carpuat

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过定义可测量的推理特征,研究多语言环境下有效推理的特征,并发现这些特征在不同语言中的关联强度差异显著,挑战了以英语为中心的奖励设计。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20814 2026-04-07 cs.CV cs.AI cs.LG 81%

SPHINX: A Synthetic Environment for Visual Perception and Reasoning

SPHINX:一个用于视觉感知与推理的合成环境

Md Tanvirul Alam, Saksham Aggarwal, Justin Yang Chae, Nidhi Rastogi

机构 * Rochester Institute of Technology(罗彻斯特理工学院) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 SPHINX通过生成具有可验证解的谜题,评估视觉感知与推理能力,发现大模型表现不足,RLVR方法显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03660 2026-04-07 cs.AI 79%

TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables

TableVision:一种大规模基准,用于复杂分层表格上的空间感知推理

Xiaoyu Chen, Lu Dai, Hanqing Wang, Zhuoyu Li, Wenbin Dai, Yanzong Zheng, Zhenggang Xia, Junyong Lin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TableVision基准,通过量化分析发现复杂表格推理中的感知瓶颈,引入轨迹感知的分层任务分类,结合确定性接地流程生成6799条高保真推理轨迹,提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03587 2026-04-07 cs.CR cs.AI 79%

SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization

SecPI: 通过安全推理内化实现安全代码生成

Hao Wang, Niels Mündler, Mark Vero, Jingxuan He, Dawn Song, Martin Vechev

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SecPI通过内化结构化安全推理,使推理模型在无需安全指令的情况下生成安全代码,经验证在多个安全基准测试中显著提升代码功能正确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03676 2026-04-07 cs.IR 78%

Are LLM-Based Retrievers Worth Their Cost? An Empirical Study of Efficiency, Robustness, and Reasoning Overhead

基于大语言模型的检索器是否值得其成本?对效率、鲁棒性和推理开销的实证研究

Abdelrahman Abdallah, Jamie Holdcroft, Mohammed Ali, Adam Jatowt

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文通过12个任务和14个检索器评估了基于大语言模型的检索器在效率、鲁棒性和推理开销方面的表现,发现部分专门化检索器在吞吐量上具有竞争力,而某些大语言模型双编码器则带来显著延迟。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14558 2026-04-07 cs.IR 78%

R2MED: A Benchmark for Reasoning-Driven Medical Retrieval

R2MED:一个面向推理驱动的医学检索基准

Xiangxu Zhang, Lei Li, Xiao Zhou, Zheng Liu

专题命中 推理评测 :reasoning(title,abstract)

AI总结 R2MED旨在解决医学检索中推理需求与现有方法的差距,通过876个查询涵盖三个任务,评估15种检索系统,发现最佳模型仅达31.4nDCG@10,凸显了推理驱动医学检索的挑战。

Comments 38 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03774 2026-04-07 cs.CV cs.AI 77%

When Does Multimodal AI Help? Diagnostic Complementarity of Vision-Language Models and CNNs for Spectrum Management in Satellite-Terrestrial Networks

何时多模态AI有所帮助?视觉-语言模型与CNN在卫星-地面网络中的频谱管理中的诊断互补性

Yuanhang Li

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型与CNN在频谱管理中的互补性,提出SpectrumQA基准测试,并发现CNN在空间定位任务中表现优异,而VLM在语义推理任务中具有独特优势,通过任务类型路由器可提升整体性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04456 2026-04-07 cs.AI cs.CL cs.LG 67%

Empirical Characterization of Rationale Stability Under Controlled Perturbations for Explainable Pattern Recognition

基于受控扰动的理性稳定性经验表征

Abu Noman Md Sakib, Zhensen Wang, Merjulah Roby, Zijie Zhang

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Department of Computer Science, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校计算机科学系) Department of Mechanical, Aerospace, and Industrial Engineering, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校机械、航空航天与工业工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种新指标评估模型解释的一致性,通过BERT等预训练模型和SHAP计算特征重要性,检测模型在相似输入下是否保持一致的推理行为。

Comments 28th International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06800 2026-04-07 cs.CL cs.AI cs.HC cs.MA 62%

FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline

FURINA:通过可扩展的多智能体协作流水线实现完全可定制的角色扮演基准

Haotian Wu, Shufan Jiang, Chios Chen, Yiyang Feng, Hehai Lin, Heqing Zou, Yao Shu, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Stony Brook University(石溪大学) Nanyang Technological University(南洋理工大学) Datawhale Org.(Datawhale 组织) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FURINA-Builder,一种可扩展的多智能体协作流水线,用于构建完全可定制的角色扮演基准。该基准支持多样化的场景和提示格式,通过智能体协作评估任意角色,并发现推理能力提升的同时 hallucinations 增加的新型权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04020 2026-04-07 cs.CL cs.LG 62%

Unmasking Hallucinations: A Causal Graph-Attention Perspective on Factual Reliability in Large Language Models

揭示幻觉:从因果图注意力视角探讨大语言模型中的事实可靠性

Sailesh kiran kurra, Shiek Ruksana, Vishal Borusu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出因果图注意力网络框架,通过构建token级图来减少大语言模型中的幻觉问题,提升事实可靠性。

Comments Paper accepted for publication at IEEE International Conference on Emerging Computing and Intelligent Technologies 2026 (ICoECIT),5 Pages,5 figures,1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03754 2026-04-07 cs.CL cs.AI 62%

Testing the Limits of Truth Directions in LLMs

检验大型语言模型中真理方向的极限

Angelos Poulis, Mark Crovella, Evimaria Terzi

机构 * Boston University(波士顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了大型语言模型中真理方向的普遍性存在局限,指出其依赖于层数、任务类型和复杂性,并受指令影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏