arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-02 至 2026-04-02 共收录 44 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 44 篇

2604.00430 2026-04-02 cs.MA cs.CR 91%

Secure Forgetting: A Framework for Privacy-Driven Unlearning in Large Language Model (LLM)-Based Agents

安全遗忘:一种隐私驱动的大型语言模型(LLM)基于代理的去学习框架

Dayong Ye, Tainqing Zhu, Congcong Zhu, Feng He, Qi He, Shang Wang, Bo Liu, Wanlei Zhou

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出了一种针对LLM基于代理的去学习框架,通过分类三种去学习场景,引入基于自然语言的去学习方法,提升隐私保护下的知识遗忘能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00275 2026-04-02 cs.SE 90%

Structure- and Event-Driven Frameworks for State Machine Modeling with Large Language Models

基于结构和事件的面向状态机建模的大型语言模型框架

Samer Abdulkarim, Evan Boyd, Karl Bridi, Alec Tufenkjian, Boqi Chen, Gunter Mussbacher

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出结合结构和事件驱动的框架,利用大型语言模型自动生成UML状态机,评估了不同模型在非结构化自然语言需求下的表现,发现混合方法能提升非推理模型性能,但无法进一步提升推理模型效果。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00890 2026-04-02 cs.AI cs.CL cs.CV 88%

Beyond Symbolic Solving: Multi Chain-of-Thought Voting for Geometric Reasoning in Large Language Models

超越符号求解:用于大语言模型几何推理的多链式思维投票

Md. Abu Bakor Siddique, Shahrin Hossain, Sadman Ahmed Siam, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MARS-GPS方法,通过生成多个并行推理流程并结合Python代码执行,利用熵值进行排序并多阶段投票,提升大语言模型在几何推理中的性能,实验显示其在Geometry3K数据集上达到88.8%的准确率,比现有最佳水平提升11%。

Comments Under review, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00493 2026-04-02 cs.CV cs.AI cs.LG 86%

A Reasoning-Enabled Vision-Language Foundation Model for Chest X-ray Interpretation

一种用于胸部X光解读的推理增强视觉-语言基础模型

Yabin Zhang, Chong Wang, Yunhe Gao, Jiaming Liu, Maya Varma, Justin Xu, Sophie Ostmeier, Jin Long, Sergios Gatidis, Seena Dehkharghani, Arne Michalson, Eun Kyoung Hong, Christian Bluethgen, Haiwei Henry Guo, Alexander Victor Ortiz, Stephan Altmayer, Sandhya Bodapati, Joseph David Janizek, Ken Chang, Jean-Benoit Delbrouck, Akshay S. Chaudhari, Curtis P. Langlotz

专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI、cs.LG

AI总结 CheXOne模型通过生成诊断预测和临床依据的推理轨迹,提升胸部X光解读的可解释性与准确性,在多个评估任务中表现优异。

Comments Codes: https://github.com/YBZh/CheXOne Models: https://huggingface.co/StanfordAIMI/CheXOne

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24639 2026-04-02 cs.LG cs.AI 86%

Experiential Reflective Learning for Self-Improving LLM Agents

经验反思学习用于自我改进的LLM代理

Marc-Antoine Allard, Arnaud Teinturier, Victor Xing, Gautier Viaud

机构 * Illuin Technology

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出经验反思学习框架,通过反思任务轨迹生成可迁移的启发式方法,提升LLM代理在Gaia2基准上的任务完成可靠性与成功率。

Comments Published as a conference paper at the ICLR 2026 MemAgents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02966 2026-04-02 cs.PL cs.AI cs.MA 85%

Lumos: Let there be Language Model System Certification

Lumos: 让语言模型系统认证成为可能

Isha Chaudhary, Vedaant Jain, Prineet Parhar, Kavya Sachdeva, Avaljot Singh, Sayan Ranu, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indian Institute of Technology Delhi(印度理工学院德里分校)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 Lumos提出首个系统化框架,通过概率编程DSL实现语言模型系统行为的正式认证,支持复杂关系和时间规格,揭示了先进视觉语言模型在自动驾驶场景中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12189 2026-04-02 cs.AI cs.CL 84%

Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering

通过细粒度激活引导缓解语言模型中的内容影响

Marco Valentino, Geonhee Kim, Dhairya Dalal, Zhixue Zhao, André Freitas

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过激活引导技术缓解语言模型的推理偏见,发现对比引导方法能有效减少内容偏见,提升形式推理准确性,且在不同任务中具有鲁棒性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00018 2026-04-02 cs.CL cs.AI 84%

Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning

再三思考后再写作——一种基于熵的解码策略以增强大语言模型推理

Jiashu He, Meizhu Liu, Olaitan P Olaleye, Amit Agarwal, M. Avendi, Yassi Abbasi, Matthew Rowe, Hitesh Laxmichand Patel, Paul Li, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI Science(甲骨文人工智能科学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于熵的解码策略,通过在生成过程中引入令牌级适应性,提高大语言模型的推理能力,实验表明在GSM8K等数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14295 2026-04-02 cs.CL cs.AI cs.LG 83%

Demystifying Chains, Trees, and Graphs of Thoughts

解开思维链、树和图的谜团

Maciej Besta, Florim Memedi, Zhenyu Zhang, Robert Gerstenberger, Guangyuan Piao, Nils Blach, Piotr Nyczyk, Marcin Copik, Grzegorz Kwaśniewski, Jürgen Müller, Lukas Gianinazzi, Ales Kubicek, Hubert Niewiadomski, Aidan O'Mahony, Onur Mutlu, Torsten Hoefler

机构 * ETH Zurich(苏黎世联邦理工学院) Dell(戴尔) Cledar BASF SE(巴斯夫欧洲公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过分析提示执行流程,构建了首个结构增强的大语言模型推理方案分类法,揭示了不同结构对推理性能和成本的影响,并探讨了提示工程与语言模型生态系统的理论基础。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, Volume 47, Issue 12, pages 10967-10989 (December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00375 2026-04-02 cs.CL 83%

Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models

局部自信,全局停滞:扩散语言模型中的质量探索困境

Liancheng Fang, Aiwei Liu, Henry Peng Zou, Yankai Chen, Enze Ma, Leyi Pan, Chunyu Miao, Wei-Chieh Huang, Xue Liu, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Tsinghua University(清华大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文探讨了扩散语言模型中质量与探索的矛盾,提出了一种平衡两者的方法,通过优化分布和采样策略提升生成质量与探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00012 2026-04-02 cs.CL cs.AI 82%

Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms

发现并重新激活已训练大语言模型的隐藏安全机制

Mingjie Li, Wai Man Si, Michael Backes, Yang Zhang, Yisen Wang

机构 * Cranberry-Lemon University(蔓越莓柠檬大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了大语言模型在后训练过程中安全机制的退化原因,提出SafeReAct方法通过LoRA适配器恢复被抑制的安全行为,提升模型在有害提示下的安全性而不影响推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14275 2026-04-02 cs.CL 81%

Let the Model Distribute Its Doubt: Confidence Estimation through Verbalized Probability Distribution

让模型分配其怀疑:通过 verbalized 概率分布进行置信度估计

Ante Wang, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过生成 verbalized 概率分布提升置信度估计,系统实验显示其在多个 LLM 和任务中表现优异,推理效率高且计算节省显著,但也揭示了特定任务的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13841 2026-04-02 cs.AI 81%

LocationReasoner: Evaluating LLMs on Real-World Site Selection Reasoning

LocationReasoner: 评估大语言模型在真实世界选址推理中的能力

Miho Koda, Yu Zheng, Ruixian Ma, Mingyang Sun, Devesh Pansare, Fabio Duarte, Paolo Santi

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);prompting(abstract)

AI总结 本文提出LocationReasoner基准测试,评估大语言模型在复杂现实选址场景中的推理能力,发现先进模型在实际应用中表现有限,且代理策略常因过度推理而效果不佳。

Comments ICLR 2026 Workshop on Efficient Spatial Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00007 2026-04-02 cs.CL cs.AI 81%

Dynin-Omni: Omnimodal Unified Large Diffusion Language Model

Dynin-Omni: 多模态统一的大扩散语言模型

Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim, Yunseok Han, Dogeun Kim, Hoeun Lee, Hyunggeun Kim, Jaeyoung Do

机构 * AIDAS Lab Seoul National University [1.5ex] Project Page Code Model Demo -2em

专题命中 推理与问题求解 :language model(title);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 Dynin-Omni首次提出基于掩码扩散的多模态基础模型,统一文本、图像、语音的理解与生成,以及视频理解,通过共享离散令牌空间实现双向上下文迭代优化。

Comments Project Page: https://dynin.ai/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18807 2026-04-02 cs.HC cs.AI cs.CY 79%

Chat-Based Support Alone May Not Be Enough: Comparing Conversational and Embedded LLM Feedback for Mathematical Proof Learning

基于对话的支持可能并不足够:比较对话式和嵌入式LLM反馈在数学证明学习中的比较

Eason Chen, Sophia Judicke, Kayla Beigh, Xinyi Tang, Isabel Wang, Nina Yuan, Zimo Xiao, Chuangji Li, Shizhuo Li, Reed Luttmer, Shreya Singh, Maria Yampolsky, Naman Parikh, Yvonne Zhao, Meiyi Chen, Scarlett Huang, Anishka Mohanty, Gregory Johnson, John Mackey, Jionghao Lin, Ken Koedinger

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 研究评估了GPTutor系统对大学离散数学课程的影响,发现对话式反馈单独使用可能无法有效提升考试成绩,而嵌入式反馈与学习表现相关性较低。

Comments 9 pages, 4 figures. Accepted at AIED 2026. Camera-ready version with updated references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00597 2026-04-02 cs.CV 78%

Towards Viewpoint-Robust End-to-End Autonomous Driving with 3D Foundation Model Priors

面向视角鲁棒的端到端自动驾驶与3D基础模型先验

Hiroki Hashimoto, Hiromichi Goto, Hiroyuki Sugai, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学) National Institute of Informatics(国立信息学研究所)

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 本文提出一种无需数据增强的端到端自动驾驶方法,利用3D基础模型的几何先验提升视角变化鲁棒性,实验显示在pitch和高度扰动下性能提升显著。

Comments Accepted at CVPR Workshop on Simulation for Autonomous Driving 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10441 2026-04-02 cs.RO 78%

KnowDiffuser: A Knowledge-Guided Diffusion Planner with LLM Reasoning

KnowDiffuser: 一种基于知识的扩散规划器与大语言模型推理

Fan Ding, Xuewen Luo, Fengze Yang, Bo Yu, HwaHui Tew, Ganesh Krishnasamy, Junn Yong Loo

机构 * Monash University Malaysia(莫纳什大学马来西亚校区) University of Utah(犹他大学)

专题命中 推理与问题求解 :LLM(title);language model(abstract)

AI总结 本文提出KnowDiffuser,结合大语言模型的语义理解和扩散模型的生成能力,有效解决自动驾驶中语义到物理的鸿沟问题,实验表明其在开放环和闭环评估中表现优异。

Comments 10pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01181 2026-04-02 cs.HC cs.CL cs.CV 77%

True (VIS) Lies: Analyzing How Generative AI Recognizes Intentionality, Rhetoric, and Misleadingness in Visualization Lies

真正的(视觉)谎言:分析生成式AI如何识别意图性、修辞和误导性在可视化谎言中

Graziano Blasilli, Marco Angelini

机构 * Sapienza University of Rome(罗马大学) Link Campus University(Link Campus大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究多模态大语言模型识别和解释误导性可视化的能力,并通过2336条新冠相关推文数据集分析其识别原因和潜在意图性,评估16种前沿模型并对比人类专家行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01113 2026-04-02 cs.CL 77%

CARE: Privacy-Compliant Agentic Reasoning with Evidence Discordance

CARE:具有证据不一致性的隐私合规代理推理

Haochen Liu, Weien Li, Rui Song, Zeyu Li, Chun Jason Xue, Xiao-Yang Liu, Sam Nallaperuma, Xue Liu, Ye Yuan

机构 * University of Cambridge(剑桥大学) McGill University(麦吉尔大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Columbia University(哥伦比亚大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对医疗领域中症状与体征矛盾的问题,CARE框架通过多阶段隐私合规的代理推理,在不访问敏感数据的情况下提升冲突证据处理能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00790 2026-04-02 cs.AI 77%

RefineRL: Advancing Competitive Programming with Self-Refinement Reinforcement Learning

RefineRL: 通过自我细化强化学习提升竞争性编程

Shaopeng Fu, Xingxing Zhang, Li Dong, Di Wang, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RefineRL通过引入自我细化代理和强化学习方法,提升大语言模型在竞争性编程中的性能,实验表明其在紧凑模型中表现优异,接近大模型单次尝试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00610 2026-04-02 cs.CL 77%

Speech LLMs are Contextual Reasoning Transcribers

语音大模型是上下文推理转录器

Keqi Deng, Ruchao Fan, Bo Ren, Yiming Wang, Jinyu Li

机构 * Microsoft Core AI(微软核心人工智能)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CoT-ASR,通过构建推理链使大模型先分析语音生成上下文分析,从而提升语音识别性能,实验显示WER和EER分别降低8.7%和16.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00280 2026-04-02 cs.SE cs.AI 77%

VeriAct: Beyond Verifiability -- Agentic Synthesis of Correct and Complete Formal Specifications

VeriAct:超越可验证性——基于代理的正确且完整的正式规范合成

Md Rakib Hossain Misu, Iris Ma, Cristina V. Lopes

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VeriAct框架,通过迭代合成与修复规范,超越传统方法的性能极限,生成正确且完整的正式规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00968 2026-04-02 cs.HC 75%

FlexAI: A Multi-modal Solution for Delivering Personalized and Adaptive Fitness Interventions

FlexAI: 一种多模态解决方案,用于提供个性化和自适应的健身干预

Shivangi Agarwal, Zoya Ghoshal, Bharat Jain, Siddharth Siddharth

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 FlexAI通过整合计算机视觉、生理传感器和大语言模型,提供实时个性化健身指导,显著提升用户参与度和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00657 2026-04-02 cs.SE cs.CR 75%

LibScan: Smart Contract Library Misuse Detection with Iterative Feedback and Static Verification

LibScan: 利用迭代反馈和静态验证的智能合约库误用检测

Yishun Wang, Wenkai Li, Xiaoqi Li, Zongwei Li, Lei Xie, Yuqing Zhang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出LibScan框架,结合大语言模型和规则分析,识别智能合约中八类库误用,通过迭代修正和知识库提升检测准确率至85.15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07629 2026-04-02 cs.LG cs.AI cs.CL 75%

Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization

Klear-Reasoner: 通过梯度保持裁剪策略优化提升推理能力

Zhenpeng Su, Leiyu Pan, Xue Bai, Dening Liu, Guanting Dong, Jiaming Huang, Minxuan Lv, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

机构 * Klear Team, Kuaishou Technology(快手科技Klear团队)

专题命中 推理与问题求解 :post-training(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Klear-Reasoner通过梯度保持裁剪策略优化提升推理能力,在数学和编程领域表现出色,达到多项基准测试的高分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00716 2026-04-02 cs.AI cs.LG 73%

CircuitProbe: Predicting Reasoning Circuits in Transformers via Stability Zone Detection

CircuitProbe: 通过稳定性区检测预测Transformer中的推理电路

Rajkiran Panuganti

机构 * Independent Researcher(独立研究员)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 CircuitProbe通过激活统计预测Transformer中的推理电路,利用稳定性区和幅度区检测,提升推理效率,验证了其在多种模型上的有效性。

Comments 11 pages, 1 figure, 3 tables. Code available at https://github.com/agenticclass/circuitprobe

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20209 2026-04-02 cs.CL cs.AI 73%

Children's Intelligence Tests Pose Challenges for MLLMs? KidGym: A 2D Grid-Based Reasoning Benchmark for MLLMs

儿童智力测试对大语言模型构成挑战?KidGym:一种基于二维网格的推理基准测试用于大语言模型

Hengwei Ye, Yuanting Guan, Yuxuan Ge, Tianying Zhu, Zhenhan Guan, Yijia Zhong, Yijing Zhang, Han Zhang, Yingna Wu, Zheng Tian

机构 * ShanghaiTech University(上海科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KidGym,一种基于二维网格的推理基准测试,用于评估大语言模型的执行、感知推理、学习、记忆和规划能力,通过12个独特任务测试模型适应性和发展潜力,揭示当前模型的局限性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08545 2026-04-02 cs.CL cs.AI cs.CV cs.MA 73%

Curriculum Guided Massive Multi Agent System Solving For Robust Long Horizon Tasks

课程引导的大规模多智能体系统解决稳健长周期任务

Indrajit Kar, Kalathur Chenchu Kishore Kumar

机构 * Wipro Innovation Networks(威普罗创新网络)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种分层多智能体架构,通过空间课程逐步扩展网格区域,使智能体先掌握中央任务再处理外围任务,提升长周期任务的稳定性和推理能力。

Comments 22 pages, 2 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11536 2026-04-02 cs.CL cs.AI 73%

HARP: Hallucination Detection via Reasoning Subspace Projection

通过推理子空间投影进行幻觉检测:HARP

Junjie Hu, Gang Tu, ShengYu Cheng, Jinxin Li, Jinting Wang, Rui Chen, Zhilong Zhou, Dongbo Shan

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HARP通过推理子空间投影方法检测大语言模型中的幻觉,通过分解隐藏状态空间并应用SVD提升鲁棒性,实验显示在TriviaQA上达到92.8%的AUROC。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00010 2026-04-02 cs.CL cs.AI 73%

Can LLMs Perceive Time? An Empirical Investigation

大语言模型能感知时间吗?一项实证研究

Aniketh Garikaparthi

机构 * TCS Research(塔塔咨询服务公司研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型在时间估计上的局限性,通过68项任务和四类模型进行实验,发现模型在预任务估计、相对排序和事后回忆中均存在显著误差,表明模型缺乏对自身推理时间的体验性认知。

Comments ICLR 2026 I Can't Believe It's Not Better Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏