arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-21 至 2026-04-21 共收录 341 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 91 篇

2603.22368 2026-04-21 cs.CV cs.AI 57%

When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations

当视觉不是问题:在误导性数据可视化上评估视觉-语言模型

Harsh Nishant Lalai, Raj Sanjay Shah, Hanspeter Pfister, Sashank Varma, Grace Guo

机构 * Birla Institute of Technology and Science, Pilani(巴尔·印度理工学院和科学学院,皮拉尼) Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估视觉-语言模型在识别误导性数据可视化中的能力,发现模型在检测可视化设计错误上更可靠,但常误判非误导性可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21257 2026-04-21 cs.CL 57%

MoCo: A One-Stop Shop for Model Collaboration Research

MoCo:模型协作研究的一站式解决方案

Shangbin Feng, Yuyang Bai, Ziyuan Yang, Yike Wang, Zhaoxuan Tan, Jiajie Yan, Zhenyu Lei, Wenxuan Ding, Weijia Shi, Haojin Wang, Zhenting Qi, Yuru Jiang, Heng Wang, Chengsong Huang, Yu Fei, Jihan Yao, Yilun Du, Luke Zettlemoyer, Yejin Choi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) University of Notre Dame(诺特大学) University of Virginia(弗吉尼亚大学) New York University(纽约大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of California Irvine(加州大学尔湾分校) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MoCo库,提供26种模型协作方法及25个评估数据集,验证协作策略在多数场景下优于非协作模型,分析协作系统的有效性及未来研究方向。

Comments Moco is available at https://github.com/BunsenFeng/model_collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01101 2026-04-21 cs.CL 57%

TSVer: A Benchmark for Fact Verification Against Time-Series Evidence

TSVer:一个针对时间序列证据的事实验证基准

Marek Strong, Andreas Vlachos

机构 * Department of Computer Science and Technology(计算机科学与技术系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出TSVer基准,通过时间序列证据进行事实验证,包含304个真实声明和400个时间序列数据,采用LLM辅助标注提升质量,展示先进模型在时间序列推理上的挑战。

Comments Published at EMNLP 2025. v2 includes a revised version of the dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26278 2026-04-21 cs.CV cs.CL 57%

ProfVLM: A lightweight video-language model for multi-view proficiency estimation

ProfVLM:一种轻量级视频-语言模型用于多视角技能评估

Edoardo Bianchi, Jacopo Staiano, Antonio Liotta

机构 * Free University of Bozen-Bolzano(博洛尼亚-博兹纳自由大学) University of Trento(特伦托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ProfVLM,一种轻量级视频-语言模型,通过生成式视觉-语言建模实现多视角技能评估,兼具生成自然语言反馈与定量评分,参数更少且训练更快。

Journal ref Computer Vision and Image Understanding, Volume 268, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25944 2026-04-21 cs.AI 57%

NuRisk: A Visual Question Answering Dataset for Agent-Level Risk Assessment in Autonomous Driving

NuRisk:面向自动驾驶中 agent 级风险评估的视觉问答数据集

Yuan Gao, Mattia Piccinini, Roberto Brusnicki, Yuchen Zhang, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, TUM School of Engineering and Design, Technical University of Munich(自主车辆系统教授职位,TUM工程与设计学院,慕尼黑技术大学) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所(MIRMI))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 NuRisk 数据集通过 2.9K 场景和 1.1M agent 级样本,提供基于鸟瞰图的时序图像及量化风险标注,提升自动驾驶中 agent 行为与情境的时空推理能力。

Comments 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01486 2026-04-21 cs.CL 57%

Human-Centered Supervision for Sentiment Analysis in Telugu: A Systematic Inquiry Beyond Accuracy

面向泰卢格语情感分析的人本监督:超越准确性的系统探究

Vallabhaneni Raj Kumar, Ashwin S, Supriya Manna, Niladri Sett, Cheedella V S N M S Hema Harshitha, Kurakula Harshitha, Anand Kumar Sharma, Basina Deepakraj, Tanuj Sarkar, Bondada Navaneeth Krishna, Samanthapudi Shakeer

机构 * SRM University AP, India(印度AP SRM大学) University of Maryland, College Park, USA(美国马里兰大学 College Park分校) GITAM University, Bangalore, India(印度班加罗尔GITAM大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出TeSent数据集,通过人类选择的解释进行模型对齐,探讨在低资源语言中监督学习对预测性能和公平性的影响。

Comments Camera-ready version; ACL Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01330 2026-04-21 cs.AI 57%

NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks

NaturalGAIA:一个可验证的基准和分层框架用于长周期GUI任务

Zihan Zheng, Tianle Cui, Taoran Wang, Fengtao Wang, Jiahui Pan, Lewei He, Qianglong Chen

机构 * South China Normal University(华南师范大学) Zhejiang University(浙江大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出NaturalGAIA,通过真实人类GUI交互意图构建可验证评估数据集,结合LightManus-Jarvis框架,实现复杂自然任务的宏规划与微执行,实验显示其在路径成功率、token消耗和执行时间上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17133 2026-04-21 cs.AI cs.CR 57%

If Only My CGM Could Speak: A Privacy-Preserving Agent for Question Answering over Continuous Glucose Data

若我的连续葡萄糖监测仪能说话:一个隐私保护的问答代理

Yanjun Cui, Ali Emami, Temiloluwa Prioleau, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院) Emory University(埃默里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CGM-Agent框架,通过本地计算实现隐私保护的连续葡萄糖数据问答,评估显示顶级模型在合成和现实查询中准确率分别为94%和88%。

Comments Accepted by ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17105 2026-04-21 cs.CL 57%

How Tokenization Limits Phonological Knowledge Representation in Language Models and How to Improve Them

词法化如何限制语言模型中语音知识的表示以及如何改进

Disen Liao, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨词法化对文本模型语音知识表示的影响,提出STAD指标量化词法化偏差,并通过IPA基础微调方法提升语音相关任务性能。

Comments 18 pages, 7 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16893 2026-04-21 cs.CV cs.LG 57%

EasyVideoR1: Easier RL for Video Understanding

EasyVideoR1: 更容易的视频理解强化学习

Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出EasyVideoR1框架,通过高效预处理、统一奖励系统和混合训练策略,提升视频理解任务的训练效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16753 2026-04-21 cs.AI 57%

Know When to Trust the Skill: Delayed Appraisal and Epistemic Vigilance for Single-Agent LLMs

何时信任技能:单智能体LLM的延迟评估与认知警惕

Eren Unlu

机构 * Globeholder Paris, France(巴黎Globeholder机构)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MESA-S框架,通过延迟评估和认知警惕机制提升单智能体LLM的可靠性,减少供应链漏洞并防止自信膨胀。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16528 2026-04-21 cs.CV cs.AI 57%

Expert-Annotated Embryo Image Dataset with Natural Language Descriptions for Evidence-Based Patient Communication in IVF

具有自然语言描述的专家标注胚胎图像数据集:用于基于证据的患者沟通的体外受精

Nicklas Neu, Thomas Ebner, Jasmin Primus, Bernhard Schenkenfelder, Raphael Zefferer, Mathias Brunbauer, Florian Kromp

机构 * Software Competence Center Hagenberg(海因斯贝格软件能力中心) Kepler Universitätsklinikum, Kinderwunsch Zentrum(凯普勒大学医院,生育中心) Wunschkind Klinik Dr. Brunbauer(布鲁纳auer生育诊所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一个包含胚胎图像和自然语言描述的专家标注数据集,用于提升体外受精中胚胎选择的可解释性和透明度,支持基于证据的决策和患者沟通。

Comments 7 pages, 3 figures, in submission to Nature Scienfitic Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16506 2026-04-21 cs.CV cs.CL 57%

Medical thinking with multiple images

多图像医学推理

Zonghai Yao, Benlu Wang, Yifan Zhang, Junda Wang, Iris Xia, Zhipeng Tang, Shuo Han, Feiyun Ouyang, Zhichao Yang, Arman Cohan, Hong Yu

机构 * Manning College of Information and Computer Sciences, UMass Amherst(UMass阿默斯特信息与计算机科学学院) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA贝福德医疗保健中心) Department of Computer Science, Yale University(耶鲁大学计算机科学系) Miner School of Computer and Information Sciences, UMass Lowell(UMass洛威计算机与信息科学学院) Department of Electrical and Computer Engineering, UMass Lowell(UMass洛威电气与计算机工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MedThinkVQA多图像医学推理基准,通过专家标注数据验证多图像整合对临床推理的重要性,发现多图像推理瓶颈在于证据提取与对齐,且增加推理时间计算效果有限。

Comments Equal contribution for the first two authors. To appear in the proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026). Code is in https://github.com/benluwang/MedThinkVQA. Dataset is in https://huggingface.co/datasets/bio-nlp-umass/MedThinkVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16387 2026-04-21 cs.IR cs.AI cs.DL 57%

Large language models for post-publication research evaluation: Evidence from expert recommendations and citation indicators

基于大语言模型的发表后研究评估:专家推荐与引用指标的证据

Mengjia Wu, Yi Zhang, Robin Haunschild, Lutz Bornmann

机构 * Australian Artificial Intelligence Institute, Faculty of Engineering and Information Technology, University of Technology Sydney(澳大利亚人工智能研究所,工程与信息科技学院,新南威尔士大学) Max Planck Institute for Solid State Research(马克斯·普朗克固体物理研究所) Science Policy and Strategy Department, Administrative Headquarters of the Max Planck Society(马克斯·普朗克学会科学政策与战略部门,行政总部)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨大语言模型在发表后同行评审中的应用,通过专家判断和引用指标对比,发现其在粗粒度评估中表现良好,但在细粒度评分上效果下降,监督微调效果最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16350 2026-04-21 cs.IR cs.AI 57%

LiteSemRAG: Lightweight LLM-Free Semantic-Aware Graph Retrieval for Robust RAG

LiteSemRAG: 轻量级无大语言模型的语义感知图检索用于鲁棒性RAG

Xiao Yue, Guangzhi Qu, Lige Gan

机构 * Oakland University(奥克兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LiteSemRAG,一种轻量级无大语言模型的语义感知图检索框架,通过构建异构语义图并分离表层词义与上下文依赖语义,提升检索鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17932 2026-04-21 cs.SE cs.AI 57%

From Charts to Code: A Hierarchical Benchmark for Multimodal Models

从图表到代码:一个多模态模型的分层基准

Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu, Zijian Zhang, Yifei Tao, Dongxing Mao, Yang Wan, Jingru Tan, Min Zeng, Min Li, Alex Jinpeng Wang

机构 * CSU-JPG, Central South University(中南大学CSU-JPG) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Chart2Code基准,用于评估大多模态模型的图表理解和代码生成能力,包含三个层级任务,涵盖图表复现、编辑和长表转图表生成,测试了25种最先进的LMMs,结果显示GPT-5在编辑任务中表现不佳,凸显了该基准的挑战性。

Comments This work has been accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06296 2026-04-21 cs.PL cs.AI 57%

VeriEquivBench: An Equivalence Score for Ground-Truth-Free Evaluation of Formally Verifiable Code

VeriEquivBench:一种无需真实地面真相的正式可验证代码评估等价分数

Lingfei Zeng, Fengdi Che, Xuhan Huang, Fei Ye, Xu Xu, Binhang Yuan, Jie Fu

机构 * Huazhong University of Science and Technology(华中科技大学) University of Alberta(阿尔伯塔大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VeriEquivBench,通过2389个复杂算法问题评估正式可验证代码的生成与推理能力,揭示当前LLM在生成正式规范和代码方面的挑战,推动可扩展可靠编码代理的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18134 2026-04-21 cs.CV 50%

Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?

LLM生成文本能否增强外科视觉-语言预训练?

Chengan Che, Chao Wang, Jiayuan Huang, Xinyue Chen, Luis C. Garcia-Peraza-Herrera

机构 * Visual Understanding Research Group, Department of Informatics, King’s College London, UK(视觉理解研究组,信息学院,伦敦国王学院,英国)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出SurgLIME框架,利用LLM生成的文本进行多模态预训练,以解决标注成本高的问题,通过LoRA适配和自适应置信度估计机制提升模型鲁棒性。

Comments Accepted at CVPRW 2026 (AI4RWC Oral presentationn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17873 2026-04-21 cs.CV 50%

Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models

时空趋炎附势:基于否定的欺骗性在视频大语言模型中的表现

Ziyao Tang, Pengkun Jiao, Bin Zhu, Huiyan Qi, Jingjing Chen, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University Shanghai Key Laboratory of Multimodal Embodied AI(可信具身人工智能研究所,复旦大学上海多模态具身人工智能重点实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究视频大语言模型在面对否定性欺骗时的脆弱性,揭示其在时空推理中的错误修正机制,并提出GasVideo-1000基准测试集以评估模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07143 2026-04-21 cs.CV 50%

Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods

我们是否在使用正确的基准:视觉令牌压缩方法的评估框架

Chenfei Liao, Wensong Wang, Zichen Wen, Xu Zheng, Yiyu Wang, Haocong He, Yuanhuiyi Lyu, Lutao Jiang, Xin Zou, Yuqian Fu, Bin Ren, Linfeng Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) MBZUAI

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过实验证明现有基准含大量无关样本, downsampling能有效过滤样本,提出VTC-Bench框架以更公平评估视觉令牌压缩方法。

Comments Accepted by ACL2026 Main. Code: https://github.com/Chenfei-Liao/VTC-Bench; Project Page: https://chenfei-liao.github.io/VTC-Bench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17318 2026-04-21 cs.CV 50%

When Background Matters: Breaking Medical Vision Language Models by Transferable Attack

背景的重要性:通过可转移攻击打破医疗视觉语言模型

Akash Ghosh, Subhadip Baidya, Sriparna Saha, Xiuying Chen

机构 * Indian Institute of Technology Patna(印度理工学院帕纳分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) MBZUAI(穆桑大学人工智能研究所)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MedFocusLeak攻击方法,通过在非诊断背景区域注入协调扰动并利用注意力分散机制,使模型产生看似合理但错误的诊断,揭示了现代临床VLMs推理能力的弱点。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16884 2026-04-21 cs.CV 50%

Bias-constrained multimodal intelligence for equitable and reliable clinical AI

具有偏见约束的多模态智能用于公平且可靠的临床AI

Cheng Li, Weijian Huang, Jiarun Liu, Hao Yang, Qi Yang, Song Wu, Ye Li, Hairong Zheng, Shanshan Wang

机构 * Paul C. Lauterbur Research Center for Biomedical Imaging(Paul C. Lauterbur生物医学成像研究中心) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Radiology, Beijing Chaoyang Hospital, Capital Medical University(首都医科大学北京朝阳医院放射科) Department of Urology, South China Hospital, Medical School, Shenzhen University(深圳大学南方医院泌尿科) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出BiasCareVL框架,通过在模型设计中直接引入偏见控制,解决医疗影像与文本整合中公平性和可靠性问题,展示了其在多任务和基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14122 2026-04-21 cs.CV 50%

EgoSound: Benchmarking Sound Understanding in Egocentric Videos

EgoSound:评估egocentric视频中声音理解的基准测试

Bingwen Zhu, Yuqian Fu, Qiaole Dong, Guolei Sun, Tianwen Qian, Yuzheng Wu, Danda Pani Paudel, Xiangyang Xue, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) KAUST(卡塔尔大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 EgoSound首次系统评估多模态大语言模型在egocentric视频中的声音理解能力,包含7个任务分类,揭示当前模型在空间和因果理解上的局限。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05405 2026-04-21 cs.CV 50%

A VLM-based Method for Visual Anomaly Detection in Robotic Scientific Laboratories

基于VLM的方法用于机器人科学实验室中的视觉异常检测

Shiwei Lin, Chenxu Wang, Xiaozhen Ding, Yi Wang, Boyuan Du, Lei Song, Chenggang Wang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Physics and Electronic Information, Yantai University(烟台大学物理与电子信息学院) School of Computer and Big Data, Fuzhou University(福州大学计算机与大数据学院) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出基于VLM的视觉推理方法,通过四个逐步信息提示配置实现多级监督,构建了专用视觉基准以评估其在科学流程异常检测中的有效性,实验表明提供更多上下文信息可提升检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 47 篇

2604.18187 2026-04-21 cs.SD cs.CL 90%

Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models

Audio-DeepThinker:渐进式推理感知强化学习用于音频语言模型中高质量推理链涌现

Xiang He, Chenxing Li, Jinting Wang, Yan Rong, Tianxin Xie, Wenfu Wang, Li Liu, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) The Hong Kong University of Science(香港科技大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出Audio-DeepThinker框架,通过混合奖励和渐进式课程学习提升音频推理质量,实现高质量推理链涌现,取得多项评测冠军。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12013 2026-04-21 cs.LG 88%

Sample Complexity of Autoregressive Reasoning: Chain-of-Thought vs. End-to-End

自回归推理的样本复杂性:链式推理与端到端

Steve Hanneke, Idan Mehalel, Shay Moran

机构 * Purdue University(普渡大学) The Hebrew University(希伯来大学) Technion and Google Research(技术学院和谷歌研究)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.LG

AI总结 本文研究自回归系统的学习难度,发现端到端监督下样本复杂性随生成长度T变化丰富,而链式推理监督可使样本复杂性与T无关,从而消除对生成长度的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05993 2026-04-21 cs.CL cs.AI cs.LG 82%

Revisiting Entropy in Reinforcement Learning for Large Reasoning Models

重新审视强化学习在大推理模型中的熵

Renren Jin, Pengzhi Gao, Yuqi Ren, Zhuowen Han, Tongxuan Zhang, Wuwei Huang, Wei Liu, Jian Luan, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院 TJUNLP 实验室,中国) Independent Researcher(独立研究者) College of Computer and Information Engineering, Tianjin Normal University, China(天津师范大学计算机与信息工程学院,中国)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了强化学习可验证奖励中大语言模型熵崩溃问题,分析了熵与响应多样性、校准及性能的关系,提出正优势重加权方法以调节熵并保持性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17574 2026-04-21 cs.CL 79%

Beyond Fine-Tuning: In-Context Learning and Chain-of-Thought for Reasoned Distractor Generation

超越微调:基于上下文学习和推理链的干扰项生成

Elaf Alhazmi, Quan Z. Sheng, Wei Emma Zhang

机构 * School of Computing, Macquarie University, Australia(麦考瑞大学计算机学院,澳大利亚) School of Computer and Mathematical Sciences, Adelaide University, Australia(阿德莱德大学计算机与数学科学学院,澳大利亚) College of Engineering and Computing in Al-Lith, Umm Al-Qura University, Saudi Arabia(乌姆·阿尔·库拉大学阿尔·利思工程与计算学院,沙特阿拉伯)

专题命中 其他推理 :chain-of-thought(title);reasoning(abstract);分类 cs.CL

AI总结 本文提出基于上下文学习和推理链的干扰项生成框架,通过无监督语义检索选择示例,提升生成合理干扰项的能力,实验表明在多个基准测试中性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02506 2026-04-21 cs.IR cs.AI 79%

R3A: Reinforced Reasoning for Relevance Assessment for RAG in User-Generated Content Platforms

R3A:强化推理用于用户生成内容平台中的RAG相关性评估

Xiaowei Yuan, Lei Jin, Haoxin Zhang, Ziyang Huang, Yan Gao, Yi Wu, Yao Hu, Jun Zhao, Kang Liu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统认知与决策智能重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xiaohongshu Inc.(小红书公司)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 R3A通过意图推理和证据定位解决UGC平台中相关性评估的挑战,提升模型在稀疏反馈和非对称相关性中的表现。

Comments Accepted by ACL Industry 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20435 2026-04-21 cs.AI 79%

Deep reflective reasoning in interdependence constrained structured data extraction from clinical notes for digital health

在临床笔记中进行深度反思推理以提取受相互依赖约束的结构化数据用于数字健康

Jingwei Huang, Kuroush Nezafati, Zhikai Chi, Ruichen Rong, Colin Treager, Tingyi Wanyan, Yueshuang Xu, Xiaowei Zhan, Patrick Leavey, Guanghua Xiao, Wenqi Shi, Yang Xie

机构 * Quantitative Biomedical Research Center, Department of Health Data Science and Biostatistics, Peter O'Donnell School of Public Health, University of Texas Southwestern Medical Center(定量生物医学研究中心,健康数据科学与生物统计学系,彼得·奥·多尼尔公共卫生学院,德克萨斯西南医学中心)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出深度反思推理方法,通过迭代自我批评和修订,提升LLM在临床笔记中提取结构化数据的可靠性,尤其在肿瘤学应用中显著提高了各类变量的准确率和F1分数。

Comments 12 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏