arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-30 至 2026-03-30 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 13 篇

2603.26410 2026-03-30 cs.CL cs.AI 87%

Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models

为何模型知道却不说:链式思考中的思考令牌与答案之间的信念差异在开放权重推理模型中

Richard J. Young

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校) DeepNeuro AI

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL、cs.AI

AI总结 研究探讨了12种开放权重推理模型在MMLU和GPQA问题中对误导提示的响应,发现思考令牌与答案之间的信念差异显著,且模型对提示的承认存在方向性差异。

Comments 19 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14765 2026-03-30 cs.LG cs.AI 86%

PepThink-R1: LLM for Interpretable Cyclic Peptide Optimization with CoT SFT and Reinforcement Learning

PepThink-R1:基于CoT SFT和强化学习的可解释环状肽优化LLM

Ruheng Wang, Hang Zhang, Trieu Nguyen, Shasha Feng, Hao-Wei Pang, Xiang Yu, Li Xiao, Peter Zhiping Zhang

机构 * Merck & Co., Inc., Rahway, NJ, USA(默克公司,美国新泽西州拉威) UT Southwestern Medical Center, Dallas, TX, USA(得克萨斯大学西南医学中心,美国得克萨斯州达拉斯) University of Pittsburgh, Pittsburgh, PA, USA(匹兹堡大学,美国宾夕法尼亚州匹兹堡)

专题命中 其他推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PepThink-R1,结合CoT SFT和强化学习,通过显式推理生成可解释的环状肽,提升药理性质表现,优于现有通用LLM和领域模型。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: AI for Science (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25942 2026-03-30 cs.CV cs.AI 85%

Reinforcing Structured Chain-of-Thought for Video Understanding

强化结构链式思考以提升视频理解

Peiyao Wang, Haotian Xu, Noranart Vesdapunt, Rui Hou, Jingyi Zhang, Haibin Ling, Oleksandr Obiednikov, Ning Zhou, Kah Kuen Fu

机构 * Stony Brook University(石溪大学) Amazon(亚马逊)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出SDRL框架,通过结构化链式思考格式和自监督机制,解决多模态大语言模型在视频理解中的推理漂移和时间感知问题,实现单阶段强化学习,提升模型泛化能力。

Comments Accepted to CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25960 2026-03-30 cs.CL cs.AI 84%

When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models

当链式思维产生反效果:评估医疗语言模型在提示敏感性上的表现

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(纽黑文大学SAIL实验室)

专题命中 其他推理 :chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究评估医疗语言模型在不同提示格式下的鲁棒性,发现链式思维提示降低准确性,少样本示例和答案选项洗牌显著影响性能,且领域特定模型的提示工程策略不适用于通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26330 2026-03-30 cs.CV cs.AI 79%

Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation

通过输入自适应深度聚合缓解视觉语言微调中的推理税

Yiming Ren, Yujiu Yang, Junjie Wang

机构 * Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出IADA机制,通过输入自适应的跨深度检索提升视觉语言模型的推理能力,实验表明其在参数效率方面优于LoRA微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26045 2026-03-30 cs.LG cs.AI cs.CL cs.NE 67%

H-Node Attack and Defense in Large Language Models

H-Node攻击与防御在大语言模型中

Eric Yocam, Varghese Vaidyan, Yong Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出H-Node对抗噪声消除框架,通过识别并防御Transformer大语言模型中的幻觉表示,利用逻辑回归探针定位幻觉节点,通过白盒对抗攻击增强这些维度,并采用自适应防御抑制幻觉节点,提升模型鲁棒性。

Comments 17 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25861 2026-03-30 cs.LG cs.AI cs.CR 62%

Why Safety Probes Catch Liars But Miss Fanatics

为何安全探针会识破骗子却无法识别狂热分子

Kristiyan Haralambiev

机构 * Independent Research(独立研究)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究安全探针在检测欺骗性对齐AI系统时的局限性,发现当模型相信有害行为是正当的而非隐藏时,探针无法检测到这种一致性偏差,揭示了探针逃避现象的形成机制。

Comments 18 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18846 2026-03-30 cs.CV cs.AI 57%

DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference

DUET-VLM:双阶段统一高效令牌减少用于VLM训练和推理

Aditya Kumar Singh, Hitesh Kandala, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc. (AMD)(超威半导体公司(AMD))

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 DUET-VLM通过双阶段令牌压缩框架,在保持语义的同时显著减少视觉令牌数量,实现高效训练和推理。

Comments 15 Pages, 8 figures, 15 tables, CVPR 2026; Code: AGI/DUET-VLM" target="_blank" rel="noopener">https://github.com/AMD-AGI/DUET-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13622 2026-03-30 cs.CV cs.AI 57%

CARPE: Context-Aware Image Representation Prioritization via Ensemble for Large Vision-Language Models

CARPE:通过集成实现上下文感知的图像表示优先级

Donghee Lee, Rui Cai, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 CARPE通过集成机制增强大视觉-语言模型对视觉和文本模态的自适应加权能力,提升图像分类和多模态任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26523 2026-03-30 cs.HC 50%

Exploring a Design Framework for Children's Agency through Participatory Design

通过参与式设计探索儿童自主性设计框架

Boyin Yang, Jun Zhao

专题命中 其他推理 :reasoning(abstract)

AI总结 本文通过参与式工作坊探讨儿童自主性设计框架,帮助设计者在设计过程中明确自主性权衡,解决设计者对儿童自主性重要性理解不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24197 2026-03-30 cs.CY cs.SE 50%

Learning to Program Alongside AI: Critical Thinking, AI Ethics, and Gendered Patterns of German Secondary School Students

与AI一同学习编程:批判性思维、AI伦理与德国中学学生的性别化模式

Isabella Graßl

专题命中 其他推理 :reasoning(abstract)

AI总结 研究探讨德国中学学生在使用生成式AI工具编程时的批判性思维、伦理观念及性别差异,发现学生虽具伦理意识,但对AI生成代码理解不足,且性别影响其使用模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26004 2026-03-30 cs.CY 50%

A Human-Centered Approach to Ethical AI Education in Underresourced Secondary Schools

面向欠资中学的伦理AI教育的人本方法

Valentina Kuskova, Sonia Howell, Brianna Stines, Brianna Conaghan

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出一种人本主义方法,通过提供学分课程提升欠资中学学生的人工智能伦理意识,研究发现该课程提高了学生的批判性思维和学术自信,支持伦理判断作为核心学习成果。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22403 2026-03-30 cs.SE 50%

XMENTOR: A Rank-Aware Aggregation Approach for Human-Centered Explainable AI in Just-in-Time Software Defect Prediction

XMENTOR:一种面向人类的排名感知聚合方法用于实时软件缺陷预测中的可解释AI

Saumendu Roy, Banani Roy, Chanchal Roy, Richard Bassey

专题命中 其他推理 :reasoning(abstract)

AI总结 XMENTOR通过整合多种事后解释方法,提升开发者对缺陷预测模型的信任与可解释性,减少混淆和认知负担。

Comments 10 pages, 14 figures, conference (FORGE '26: 2026 IEEE/ACM Third International Conference on AI Foundation Models and Software Engineering, Rio de Janeiro, Brazil, April 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏