arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-09 至 2026-04-09 共收录 102 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 12 篇

2604.07041 2026-04-09 cs.DB cs.AI cs.ET cs.HC cs.IR 57%

AV-SQL: Decomposing Complex Text-to-SQL Queries with Agentic Views

AV-SQL:通过代理视图分解复杂文本到SQL查询

Minh Tam Pham, Trinh Pham, Tong Chen, Hongzhi Yin, Quoc Viet Hung Nguyen, Thanh Tam Nguyen

机构 * Griffith University(格里菲斯大学) The University of Queensland(昆士兰大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 AV-SQL通过代理视图分解复杂文本到SQL查询,提升复杂查询的执行准确率,其在Spider 2.0基准测试中达到70.38%的准确率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07012 2026-04-09 cs.CL 57%

DTCRS: Dynamic Tree Construction for Recursive Summarization

DTCRS: 动态树构建用于递归摘要

Guanran Luo, Zhongquan Jian, Wentao Qiu, Meihong Wang, Qingqiang Wu

机构 * School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 DTCRS通过动态生成摘要树减少冗余,提升摘要与问题的相关性,从而加快构建时间并改进三个问答任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06569 2026-04-09 q-bio.GN 50%

ECLIPSE: A Composable Pipeline for Predicting ecDNA Formation, Evolution, and Therapeutic Vulnerabilities in Cancer

ECLIPSE:用于预测癌症中ecDNA形成、进化和治疗脆弱性的可组合管道

Bryan Cheng, Jasper Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ECLIPSE通过三个模块革新ecDNA预测与建模,展示标准基因组特征可预测ecDNA状态,利用物理约束神经SDEs捕捉随机动态,并通过因果推断识别治疗脆弱性,建立严谨基准并揭示方法论重要性。

Comments 9 pages, 5 figures. Accepted to workshop on AI and Partial Differential Equations, Foundation Models for Science: Real-World Impact and Science-First Design, Machine Learning for Genomics Explorations, and Generative and Experimental Perspectives for Biomolecular Design at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 24 篇

2604.06421 2026-04-09 cs.CL 83%

State-of-the-Art Arabic Language Modeling with Sparse MoE Fine-Tuning and Chain-of-Thought Distillation

最先进的阿拉伯语言建模:基于稀疏MoE微调和链式思维蒸馏

Navan Preet Singh, Anurag Garikipati, Ahmed Abulkhair, Jyani Akshay Jagdishbhai, Atul Yaduvanshi, Amarendra Chaudhary, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * Incept Labs(因塞普特实验室)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出阿拉伯-DeepSeek-R1,通过稀疏MoE架构和链式思维蒸馏,在开放阿拉伯LLM排行榜上实现SOTA,展示了稀疏MoE与文化导向的蒸馏方法在阿拉伯语言任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06192 2026-04-09 cs.CL cs.AI cs.IT cs.LG math.IT 82%

The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?

逐步信息性假设:为什么在大语言模型中熵动态与推理相关?

Mar Gonzàlez I Català, Haitz Sáez de Ocáriz Borde, George D. Montañez, Pietro Liò

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) Harvey Mudd College(哈维穆德学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了大语言模型中熵动态与推理正确性相关的原因,提出逐步信息性假设,并通过实验验证其在多个基准和模型中的有效性。

Comments 21 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06375 2026-04-09 cs.AI 79%

SymptomWise: A Deterministic Reasoning Layer for Reliable and Efficient AI Systems

SymptomWise: 一种用于可靠和高效人工智能系统的确定性推理层

Isaac Henry, Avery Byrne, Christopher Giza, Ron Henry, Shahram Yazdani

机构 * University of California Los Angeles, David Geffen School of Medicine(加州大学洛杉矶分校大卫·格芬医学院) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SymptomWise通过分离语言理解与诊断推理,结合专家知识和确定性推理,提升AI系统可靠性与可解释性,初步验证在儿科神经病学案例中表现优异。

Comments 18 pages, 1 figure,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06264 2026-04-09 q-bio.QM cs.AI 79%

ToxReason: A Benchmark for Mechanistic Chemical Toxicity Reasoning via Adverse Outcome Pathway

ToxReason: 一个通过不良后果途径进行机理化学毒性推理的基准

Jueon Park, Wonjune Jang, Chanhwi Kim, Yein Park, Jaewoo Kang

机构 * Korea University(高丽大学) Myongji University(明知大学) University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心) AIGEN Sciences

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ToxReason基准通过整合药物-靶点相互作用证据与毒性标签,评估多器官水平的毒性推理能力,发现强预测性能不等于可靠推理,且推理意识训练能提升机理推理和毒性预测性能。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23158 2026-04-09 cs.CV cs.AI 79%

REVEAL: Reasoning-Enhanced Forensic Evidence Analysis for Explainable AI-Generated Image Detection

REVEAL: 基于推理的取证分析用于可解释的AI生成图像检测

Huangsen Cao, Qin Mei, Zhiheng Li, Yuxi Li, Zhan Meng, Ying Zhang, Chen Li, Zhimeng Zhang, Xin Ding, Yongwei Wang, Jing Lyu, Fei Wu

机构 * Zhejiang University(浙江大学) WeChat Vision, Tencent Inc(腾讯微信视觉) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 REVEAL通过构建可验证的证据链,提升AI生成图像检测的可解释性与泛化能力,采用专家引导的强化学习训练框架,实现更准确和可信的检测结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11635 2026-04-09 cs.AI 79%

Do MLLMs Really Understand Space? A Mathematical Reasoning Evaluation

大规模语言模型真的能理解空间吗?一项数学推理评估

Shuo Lu, Jianjie Cheng, Yinuo Xu, Yongcan Yu, Lijun Sheng, Peijie Wang, Siru Jiang, Yongguan Hu, Run Ling, Yihua Shao, Ao Ma, Wei Feng, Lingxiao He, Meng Wang, Qianlong Xie, Xingxing Wang, Nicu Sebe, Ran He, Jian Liang

机构 * Meituan Inc.(美团) Northeastern University(东北大学) University of Trento(特伦托大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过MathSpatial数据集评估了大规模语言模型在数学空间推理上的能力,发现其在空间推理任务上表现不佳,提出该数据集有助于提升模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02676 2026-04-09 cs.CV 78%

AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process

AdaptMMBench: 多模态适应推理的基准测试用于模式选择和推理过程

Xintong Zhang, Xiaowen Zhang, Jingrong Wu, Zhi Gao, Shilin Yan, Zhenxin Diao, Kunpeng Gao, Xuanyan Chen, Yuwei Wu, Yunde Jia, Qing Li

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出AdaptMMBench,通过五类领域评估多模态适应推理,利用MCC指标评估模式选择合理性,揭示适应模式选择与最终准确率的脱钩现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19640 2026-04-09 cs.CV 78%

Focus on What Really Matters in Low-Altitude Governance: A Management-Centric Multi-Modal Benchmark with Implicitly Coordinated Vision-Language Reasoning Framework

聚焦低空治理中真正重要的问题:一种以管理为中心的多模态基准与隐式协调的视觉-语言推理框架

Hao Chang, Zhihui Wang, Lingxiang Wu, Wei An, Boyang Li, Zaiping Lin, Weidong Sheng, Jinqiao Wang

机构 * National University of Defense Technology(国防科技大学) Zidong Taichu (Beijing) Technology Co., Ltd.(紫东太初(北京)科技有限公司) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出GovLA-10K多模态基准和GovLA-Reasoner框架,通过功能显著目标和隐式协调的视觉-语言推理提升低空治理中的管理需求理解与执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07017 2026-04-09 cs.AI 70%

A-MBER: Affective Memory Benchmark for Emotion Recognition

A-MBER:情绪识别的情感记忆基准

Deliang Wen, Ke Sun, Yu Wang

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 A-MBER通过评估模型利用多会话交互历史解读用户当前情绪的能力,提出了一种新的情感记忆基准,支持判断、检索和解释任务,并测试模型在不同条件下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08258 2026-04-09 cs.AI 70%

Diagnosing and Mitigating Sycophancy and Skepticism in LLM Causal Judgment

诊断和缓解大语言模型因果判断中的阿谀和怀疑

Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出CAUSALT3基准测试,通过三个轴评估分解性能,识别并缓解因果判断中的阿谀和怀疑陷阱,通过Regulated Causal Anchoring方法改进推理控制。

Comments 19 pages, 3 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07274 2026-04-09 cs.CL cs.AI cs.LG 67%

A Systematic Study of Retrieval Pipeline Design for Retrieval-Augmented Medical Question Answering

检索增强医疗问答中检索流程设计的系统研究

Nusrat Sultana, Abdullah Muhammad Moosa, Kazi Afzalur Rahman, Sajal Chandra Banik

机构 * Department of Mechatronics & Industrial Engineering, Chittagong University of Engineering & Technology(吉大港工程与技术大学机电与工业工程系) Department of Mechanical Engineering, Chittagong University of Engineering & Technology(吉大港工程与技术大学机械工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统评估了检索增强医疗问答的性能,发现检索增强显著提升了零样本医疗问答效果,最佳配置为密集检索加查询改写和重排序,准确率达60.49%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06505 2026-04-09 cs.CL cs.AI 62%

MedConclusion: A Benchmark for Biomedical Conclusion Generation from Structured Abstracts

MedConclusion:一个用于从结构化摘要中生成生物医学结论的基准数据集

Weiyue Li, Ruizhi Qian, Yi Li, Yongce Li, Yunfan Long, Jiahui Cai, Yan Luo, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard Medical School(哈佛大学医学院哈佛人工智能与机器人实验室) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学肯普纳自然与人工智能研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedConclusion数据集,包含570万篇PubMed结构化摘要,用于生物医学结论生成。通过配对摘要非结论部分与原始结论,提供证据到结论推理的自然监督。数据集还包含期刊级元数据,支持跨生物医学领域的子组分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06204 2026-04-09 cs.CL cs.AI cs.HC 62%

SensorPersona: An LLM-Empowered System for Continual Persona Extraction from Longitudinal Mobile Sensor Streams

SensorPersona: 一种基于大语言模型的持续性人设提取系统,用于从长期移动传感器流中无感获取

Bufang Yang, Lilin Xu, Yixuan Li, Kaiwei Liu, Xiaofan Jiang, Zhenyu Yan

机构 * The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SensorPersona系统,通过多模态长期传感器流持续提取稳定用户人设,提升LLM代理的个性化响应质量。系统通过上下文编码、分层人设推理和自适应更新,实现对物理行为、心理特质和生活经验的全面分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06327 2026-04-09 cs.SD cs.AI 57%

A Novel Automatic Framework for Speaker Drift Detection in Synthesized Speech

一种用于合成语音中说话人漂移检测的新型自动框架

Jia-Hong Huang, Seulgi Kim, Yi Chieh Liu, Yixian Shen, Hongyi Zhu, Prayag Tiwari, Stevan Rudinac, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学) Georgia Institute of Technology(佐治亚理工学院) Halmstad University(哈尔姆斯塔德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种自动框架,通过将说话人漂移检测转化为语音层面的二元分类任务,利用余弦相似度和大语言模型进行检测,建立了说话人漂移作为独立研究问题的理论基础。

Comments The paper has been accepted by the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06250 2026-04-09 cs.CV cs.AI 57%

DISSECT: Diagnosing Where Vision Ends and Language Priors Begin in Scientific VLMs

DISSECT:诊断视觉结束和语言先验开始的位置在科学视觉-语言模型中

Dikshant Kukreja, Kshitij Sah, Karan Goyal, Mukesh Mohania, Vikram Goyal

机构 * IIIT Delhi(德里印度理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DISSECT通过12000个问题诊断科学VLMs中视觉与语言先验的界限,揭示了视觉信息提取与下游推理之间的差距,发现开源模型在自身描述推理中表现更优,而闭源模型无此差距,表明跨模态能力的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06233 2026-04-09 cs.AI 57%

Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules

盲性拒绝:语言模型拒绝帮助用户规避不公正、荒谬和不合法的规则

Cameron Pattison, Lorenzo Manuali, Seth Lazar

机构 * Vanderbilt University(范德堡大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨语言模型在面对不公正规则时的拒绝行为,发现模型在无安全风险情况下仍拒绝帮助,且其拒绝行为与规范推理能力脱节。

Comments 9 pages body text, 38 pages total, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06227 2026-04-09 cs.LG econ.EM 57%

A Benchmark of Classical and Deep Learning Models for Agricultural Commodity Price Forecasting on A Novel Bangladeshi Market Price Dataset

一种农业商品价格预测的经典与深度学习模型基准测试:基于一个新颖的孟加拉国市场价格数据集

Tashreef Muhammad, Tahsin Ahmed, Meherun Farzana, Md. Mahmudul Hasan, Abrar Eyasir, Md. Emon Khan, Mahafuzul Islam Shawon, Ferdous Mondol, Mahmudul Hasan, Muhammad Ibrahim

机构 * Southeast University, Dhaka, Bangladesh(东南大学(达卡)) University of Dhaka, Bangladesh(达卡大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 本文基于新颖的孟加拉国市场价格数据集,评估了七种预测方法,包括经典模型和深度学习架构,揭示了农业商品价格预测的异质性及不同模型的性能差异。

Comments 26 pages, 22 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01840 2026-04-09 cs.AI 57%

Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models

并非所有token都同等重要:基于感知的策略优化方法用于大型视觉-语言模型

Zekai Ye, Qiming Li, Xiaocheng Feng, Ruihan Chen, Ziming Li, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于感知的策略优化方法PGPO,通过动态调整token级别的优势,提升多模态推理的鲁棒性与稳定性,实验显示在多个基准上提升18.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04691 2026-04-09 cs.RO cs.AI cs.MA 57%

Before Humans Join the Team: Diagnosing Coordination Failures in Healthcare Robot Team Simulation

在人类加入团队之前:医疗机器人团队模拟中的协调失败诊断

Yuanchen Bai, Zijian Ding, Shaoyue Wen, Xiang Chang, Angelique Taylor

机构 * Cornell Tech(康奈尔科技校区) Department of Information Science, Cornell University(康奈尔大学信息科学系) University of Maryland, College Park(马里兰大学帕克分校) Imperial College London(伦敦帝国学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过模拟方法研究医疗机器人团队的协调失败问题,发现团队结构是协调的主要瓶颈,并提出安全的人机协作设计方法。

Comments Revised version incorporating new analysis and restructuring

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07338 2026-04-09 cs.CV cs.CL cs.MM 57%

Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images

Appear2Meaning: 一个跨文化的结构化文化元数据图像推理基准

Yuechen Jiang, Enze Zhang, Md Mohsinul Kabir, Qianqian Xie, Stavroula Golfomitsou, Konstantinos Arvanitis, Sophia Ananiadou

机构 * University of Manchester(曼彻斯特大学) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Getty Conservation Institute(盖蒂保护研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个跨文化的结构化文化元数据图像推理基准,评估VLMs在文化元数据推断中的表现,发现模型在不同文化和元数据类型上存在显著性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07264 2026-04-09 cs.CR cs.AI 57%

Validated Intent Compilation for Constrained Routing in LEO Mega-Constellations

面向低轨巨型星座受限路由的意图验证编译

Yuanhang Li

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 本文提出端到端系统,通过图神经网络路由器、语言模型意图编译器和确定性验证器,实现高阶意图到低阶路由约束的转换,确保路由安全性和网络配置的准确性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06898 2026-04-09 cs.CY 50%

Are LLMs Ready for Computer Science Education? A Cross-Domain, Cross-Lingual and Cognitive-Level Evaluation Using Professional Certification Exams

LLMs是否准备好用于计算机科学教育?通过专业认证考试进行跨领域、跨语言和认知层面的评估

Chen Gao, Chi Liu, Zhengquan Luo, Dongfu Xiao, Maiying Sui, Sheng Shen, Congcong Zhu, Huajie Chen, Xuhan Zuo, Zongyuan Ge, Tianqing Zhu, Wanlei Zhou, Xiaotong Han

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过专业认证考试数据评估了四个LLM在跨语言、认知层次和领域知识上的表现,发现GPT-5在英文考试中表现最佳,Qwen-Plus在中文环境中更优,DeepSeek-R1在跨语言表现最平衡,但Llama-3.3在高阶推理和鲁棒性上存在明显不足。

Comments 40 pages including Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21697 2026-04-09 cs.SE 50%

EditFlow: Benchmarking and Optimizing Code Edit Recommendation Systems via Reconstruction of Developer Flows

EditFlow:通过开发者流程重建实现代码编辑推荐系统的基准测试与优化

Chenyan Liu, Yun Lin, Jiaxin Chang, Jiawei Liu, Binhang Qi, Bo Jiang, Zhiyong Huang, Jin Song Dong

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出EditFlow,通过重建开发者编辑流程,解决代码编辑推荐系统在数据收集、基准测试和统一优化中的关键挑战,提升开发者生产力。

Comments This paper has been accepted to the Proceedings of the ACM on Programming Languages (OOPSLA 2026). (Proc. ACM Program. Lang., Vol. 10, OOPSLA1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06581 2026-04-09 cs.CV 50%

MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding

MedGRPO:异构医学视频理解的多任务强化学习

Yuhao Su, Anwesa Choudhuri, Zhongpai Gao, Benjamin Planche, Van Nguyen Nguyen, Meng Zheng, Yuhan Shen, Arun Innanje, Terrence Chen, Ehsan Elhamifar, Ziyan Wu

机构 * Northeastern University(东北大学) United Imaging Intelligence(联影智能)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MedGRPO框架,通过跨数据集奖励归一化和医学LLM评判器提升医学视频理解的训练效果,建立基础基准和训练方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 15 篇

2509.26522 2026-04-09 cs.LG 79%

Entropy After </Think> for reasoning model early exiting

推理模型早期退出后的熵

Xi Wang, James McInerney, Lequn Wang, Nathan Kallus

机构 * Johns Hopkins University(约翰霍普金斯大学) Netflix Research(Netflix研究院) Cornell University(康奈尔大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出熵后</Think>信号(EAT)用于检测和防止推理模型过度思考,通过减少冗余推理token消耗提升效率,在数学问题数据集上验证了其有效性。

Comments Code and data assets are available at https://github.com/xidulu/EAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01925 2026-04-09 cs.CL cs.AI 79%

Rectifying LLM Thought from Lens of Optimization

从优化角度纠正大语言模型的思维

Junnan Liu, Hongwei Liu, Songyang Zhang, Kai Chen

机构 * Monash University(莫纳什大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文通过优化视角分析LLM推理过程,提出RePro方法改进推理性能,减少过度思考等亚优行为。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07220 2026-04-09 cs.IR 78%

HIVE: Query, Hypothesize, Verify An LLM Framework for Multimodal Reasoning-Intensive Retrieval

HIVE:一种用于多模态推理密集检索的LLM框架

Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Mostafa Farouk Senussi, Abdelrahman Abdallah, Hyun-Soo Kang

专题命中 其他推理 :reasoning(title,abstract)

AI总结 HIVE通过引入LLM进行显式视觉-文本推理,提升多模态检索效果,达到41.7的nDCG@10,优于现有文本和多模态模型。

Comments accepted at CVPR 2026 Workshop GRAIL-V

详情

展开后加载摘要…

URL PDF HTML 收藏