arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5792 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5792 篇

2508.04349 2026-02-06 cs.CL cs.AI 79%

GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy

GTPO和GRPO-S:基于策略熵的token和序列级奖励塑造

Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

机构 * Northeastern University(东北大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GTPO和GRPO-S两种算法,通过引入熵权机制实现token和序列级的细粒度奖励塑造,提升大型语言模型在长链推理任务中的稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06411 2026-01-30 cs.AI cs.LG 79%

SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization

SofT-GRPO:通过Gumbel-重新参数化软思考策略优化超越离散标记LLM强化学习

Zhi Zheng, Yu Gu, Wei Liu, Yee Whye Teh, Wee Sun Lee

机构 * School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) Department of Statistics, University of Oxford, United Kingdom(英国牛津大学统计系) School of Intelligence Science(智能科学学院) Technology, Nanjing University, China(技术学院,南京大学,中国)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 SofT-GRPO通过引入Gumbel噪声和重新参数化技巧,在软思考模式下提升LLM推理性能,使其在Pass@1和Pass@32任务中分别优于离散标记GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09712 2025-09-23 cs.CL cs.AI 79%

The Thinking Therapist: Training Large Language Models to Deliver Acceptance and Commitment Therapy using Supervised Fine-Tuning and Odds Ratio Policy Optimization

Talha Tahir

机构 * Department of Psychiatry University of Toronto(精神病学系多伦多大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03598 2025-09-03 cs.CL cs.AI 79%

Auto prompt sql: a resource-efficient architecture for text-to-sql translation in constrained environments

Zetong Tang, Qian Ma, Di Wu

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 4 pages,2 figures,EITCE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10652 2025-08-25 cs.CL cs.AI cs.CY 79%

Can Large Language Models Simulate Human Responses? A Case Study of Stated Preference Experiments in the Context of Heating-related Choices

Han Wang, Jacek Pawlak, Aruna Sivakumar

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07142 2025-06-10 cs.CL cs.AI 79%

Prompting Science Report 2: The Decreasing Value of Chain of Thought in Prompting

Lennart Meincke, Ethan Mollick, Lilach Mollick, Dan Shapiro

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18376 2025-05-07 cs.CL cs.AI 79%

Pushing the boundary on Natural Language Inference

Pablo Miralles-González, Javier Huertas-Tato, Alejandro Martín, David Camacho

机构 * Department of Computer Systems Technical University of Madrid(计算机系统系马德里技术大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15235 2025-03-20 cs.CL cs.AI 79%

Exploring Large Language Models for Word Games:Who is the Spy?

Chentian Wei, Jiewei Chen, Jinzhu Xu

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15134 2025-02-24 cs.CL cs.AI 79%

Chain-of-Rank: Enhancing Large Language Models for Domain-Specific RAG in Edge Device

Juntae Lee, Jihwan Bang, Seunghan Yang, Kyuhong Shim, Simyung Chang

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments NAACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09881 2024-12-31 cs.CL cs.AI 79%

In-Context Learning with Iterative Demonstration Selection

Chengwei Qin, Aston Zhang, Chen Chen, Anirudh Dagar, Wenming Ye

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11371 2024-11-19 cs.CL cs.LG 79%

Rethinking Thinking Tokens: Understanding Why They Underperform in Practice

Sreeram Vennam, David Valente, David Herel, Ponnurangam Kumaraguru

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05801 2024-10-10 cs.CL cs.AI 79%

Retrieving, Rethinking and Revising: The Chain-of-Verification Can Improve Retrieval Augmented Generation

Bolei He, Nuo Chen, Xinran He, Lingyong Yan, Zhenkai Wei, Jinchang Luo, Zhen-Hua Ling

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2024 Findings. 9 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01960 2024-04-23 cs.CL cs.AI 79%

Language Models as Knowledge Bases for Visual Word Sense Disambiguation

Anastasia Kritharoula, Maria Lymperaiou, Giorgos Stamou

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Journal ref KBC-LM workshop@ ISWC 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16763 2023-09-08 cs.CL cs.AI 79%

Ladder-of-Thought: Using Knowledge as Steps to Elevate Stance Detection

Kairui Hu, Ming Yan, Joey Tianyi Zhou, Ivor W. Tsang, Wen Haw Chong, Yong Keong Yap

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13980 2026-08-17 cs.CV 新提交 78%

FIRM: Fine-Grained Intra-Token Representation of Masks for Remote Sensing Reasoning Segmentation

FIRM:面向遥感推理分割的掩码细粒度令牌内表示

Weidong Tang, Kaiyu Li, Yikai Wang, Yanan Wu, Haotian Gan, Shihong Wang, Xiangyong Cao

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出FIRM模型,通过预测视觉令牌内的r×r二值子单元掩码代码结合轻量连续渲染器优化边界,在5个遥感推理分割基准上取得领先结果,提升了细粒度分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23290 2026-08-11 cs.CV 版本更新 78%

LineGraph2Road: Structural Graph Reasoning on Line Graphs for Road Network Extraction

LineGraph2Road:基于线路图的结构图推理用于道路网络提取

Zhengyang Wei, Renzhi Jing, Yiyi He, Jenny Suckale

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 LineGraph2Road通过构建全局稀疏欧几里得图并应用图变换器,提升道路网络提取的连通性预测,解决长距离依赖和复杂拓扑问题,实现高精度道路提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05521 2026-08-07 cs.SE 新提交 78%

Reasoning from Traces: Divergence-Guided Agentic Repair of WebAssembly Discrepancies

从痕迹中推理:分歧引导的智能体修复WebAssembly差异

Liyan Huang, Kaicheng Wang, Weihang Wang

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出WasmMend系统,通过差分痕迹分析定位Wasm与原生执行的分歧函数,引导LLM智能体生成补丁,在真实C/C++项目上修复率达70.0%,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29045 2026-08-03 cs.CV 新提交 78%

Adaptive Emotional Video Captioning via Affective Heterogeneous Graph Reasoning and Multi-task Joint Learning

基于情感异质图推理与多任务联合学习的自适应情感视频描述

Junbo Wang, Liangyu Fu, Yuke Li, Xuecheng Wu, Zhiyong Wang

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Computer Science, The University of Sydney(悉尼大学计算机学院)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 针对现有情感视频描述方法情感先验处理的缺陷,提出基于情感异质图与多任务联合学习的SAGML框架,实现了更鲁棒的情感视频描述性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04398 2026-07-30 cs.HC cs.CY 版本更新 78%

The Agency Gap in AI-Supported Writing: How Reactive and Proactive Agent Designs Shape Multimodal Reasoning

AI辅助写作中的主体差距:反应式与主动式智能体设计如何塑造多模态推理

Yueqiao Jin, Kaixun Yang, Roberto Martinez-Maldonado, Dragan Gašević, Lixiang Yan

专题命中 其他推理 :reasoning(title,abstract)

AI总结 该研究针对AI辅助写作中的主体差距,对比反应式与主动式智能体设计的效果,发现主动式设计可强化多模态推理关联,还能缩小AI素养相关的表现差异,为教育AI智能体设计提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25825 2026-07-29 cs.MA 新提交 78%

CHILL-Harness: Counterfactual Harness Learning for Efficient Reasoning in Long-Horizon Agents

CHILL-Harness:用于长期智能体高效推理的反事实控制学习

Jiarun Fu, Lizhong Ding, Sida Chen, Honglei Xin, Chunhui Zhang, Pengqi Li, Qiuning Wei, Ye Yuan, Guoren Wang

专题命中 其他推理 :reasoning(title,abstract)

AI总结 研究长期智能体控制中因依赖固定策略导致效率低的问题,提出CHILL-Harness方法,通过因果干预效应学习和优势实现因果编排,结合成功保留目标与约束,在多任务实验中减少消耗与时间,保持或提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03753 2026-07-28 cs.HC 版本更新 78%

VisTR: Visualizations as Representations for Time-series Table Reasoning

VisTR:将可视化作为时间序列表推理的表示

Jianing Hao, Zhuowen Liang, Chunting Li, Yuyu Luo, Jie Li, Wei Zeng

专题命中 其他推理 :reasoning(title,abstract)

AI总结 针对时间序列表推理难题,VisTR框架以可视化核心,利用其连接数据与认知,通过多模态大语言模型对齐输入,集成机制处理大数据,实现交互式可视化,经评估和案例验证了其在时间序列推理任务中的有效性和适用性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15374 2026-07-20 cs.CV 新提交 78%

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

通过强化学习进行推理引导的部件级视觉定位

Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas

专题命中 其他推理 :reasoning(title,abstract)

AI总结 研究部件级视觉定位难题,提出OP - HRG粗到细推理引导定位策略,先定位父物体再定位部件,经自我检查反思结果,引入部件感知GRPO框架训练,训练的4B模型性能优异且可迁移到推理分割。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12490 2026-07-15 cs.PL 新提交 78%

When is LLM-Based Program Reasoning Correct? A Completion Semantics for LLM-Based Code Inference

基于大语言模型的程序推理何时正确?基于大语言模型的代码推理的补全语义

Zhiyuan Liu, Yihe Li, Trevor E. Carlson, Huiyan Wang, Ruijie Meng, Gregory J. Duck

专题命中 其他推理 :reasoning(title,abstract)

AI总结 研究基于大语言模型的程序推理何时正确,引入补全语义,将不完整程序形式化,定义存在性推理正确性。以见证生成工作流程实例化方法,在真实任务上评估,能区分合理与不合理推理,为验证不完整程序推理提供实用机制。

Comments 28 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11615 2026-07-14 cs.SE 新提交 78%

ThinkLog: Leveraging Reasoning for Log Statement Generation

ThinkLog:利用推理进行日志语句生成

Kazuki Kusama, Honglin Shu, Masanari Kondo, Tao Xiao, Yasutaka Kamei

专题命中 其他推理 :reasoning(title,abstract)

AI总结 针对现有端到端日志语句生成方法准确性有限的问题,提出ThinkLog,该方法基于LLM,通过将推理融入提示作为少样本示例,引导LLM生成日志语句,在准确率提升15.4%的同时,推理成本约为现有最佳方法的50%。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09179 2026-07-13 cs.CR cs.SE 新提交 78%

Malaika: Understanding Malware through Tri-Grounded Agentic Reasoning

Malaika:通过三重基础的智能推理理解恶意软件

Xingzhi Qian, Xinran Zheng, Yiling He, Lorenzo Cavallaro

专题命中 其他推理 :reasoning(title,abstract)

AI总结 研究针对恶意软件理解挑战,将其视为基础推理问题,提出需三种基础形式。介绍多智能体框架Malaika,通过受分析师启发的推理等实现三种基础机制,用于安卓恶意软件分析,实验表明该框架提高分析质量,为可靠恶意软件理解及软件分析提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07605 2026-07-09 cs.CY 新提交 78%

User identity conditions moral wrongness ratings in non-reasoning large language models

用户身份影响非推理大语言模型的道德错误评级

Willem Fourie, Isabel Ray, Gray Manicom

专题命中 其他推理 :reasoning(title,abstract)

AI总结 研究通过行为自下而上方法,评估两个非推理大语言模型,发现用户身份影响其道德错误评级,严重伤害行为有上限效应,有争议规则行为有角色条件性变化,为人工智能价值对齐讨论提出问题并助力重构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05222 2026-07-07 cs.CV 新提交 78%

A Multimodal Reasoning Typology for Grounding Chart-Image Coherence in Science Communication

面向科学传播中图表-图像连贯性锚定的多模态推理类型学

Avina Nakarmi, Sohom Sen, Xun Song, Sreyashi Samaddar, Aritra Dasgupta

机构 * New Jersey Institute of Technology(新泽西理工学院) Brooklyn College(布鲁克林学院)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本研究提出R1-R5多模态推理类型学,刻画科学文献中图表、图像与文本的协同推理缺口,可系统识别连贯性锚定状态,缩小不同人群解读科学结论的认知差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00654 2026-07-02 cs.CV 新提交 78%

Linguistic Relative Policy Optimization for Video Anomaly Reasoning

语言相对策略优化用于视频异常推理

Jiaxu Leng, Jiankang Zheng, Mengjingcheng Mo, Zhanjie Wu, Haosheng Chen, Ji Gan, Xinbo Gao

机构 * Chongqing College of Artificial Intelligence(重庆人工智能学院)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 提出语言相对策略优化(LRPO),通过从多个推理轨迹中提取群体相对语义优势,构建语言表达的异常经验先验,无需参数更新即可引导模型输出,在无调参设置下显著超越现有方法。

Comments Accepted at ICML 2026; 18 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06687 2026-07-01 cs.CV 版本更新 78%

RASR: Retrieval-Augmented Semantic Reasoning for Fake News Video Detection

RASR:基于检索的语义推理用于虚假新闻视频检测

Hui Li, Peien Ding, Jun Li, Guoqi Ma, Zhanyu Liu, Ge Xu, Junfeng Yao, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Computer Science and Information Security, Guilin University of Electronic Technology(桂林电子科技大学计算机科学与信息安全学院) School of Computer and Big Data, Minjiang University(闽江学院计算机与大数据学院) Xiamen University(厦门大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出RASR框架,通过跨实例语义解析器和检索器、领域引导多模态推理模块和多视图特征解耦融合模块,提升虚假新闻视频检测的准确性和跨域泛化能力。

Comments The paper needs revision, and the experiments need to be expanded

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25508 2026-06-25 cs.CV 新提交 78%

C2RM-Seg: Causal Counterfactual Reasoning with Structural-Semantic Priors for Weakly Supervised Histopathological Tissue Segmentation

C2RM-Seg: 基于结构语义先验的因果反事实推理用于弱监督组织病理学组织分割

Hualong Zhang, Siyang Feng, Zihan Huan, Yi Qian, Zhenbing Liu, Rushi Lan, Xipeng Pan

机构 * Guangxi Key Laboratory of Image and Graphic Intelligent Processing, Guilin University of Electronic Technology(广西图像图形智能处理重点实验室,桂林电子科技大学) International Joint Research Laboratory of Spatio-temporal Information and Intelligent Location Services, Guilin University of Electronic Technology(时空信息与智能定位服务国际联合研究实验室,桂林电子科技大学) School of Computer Science and Information Security, Guilin University of Electronic Technology(桂林电子科技大学计算机与信息安全学院)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 提出C2RM-Seg框架,通过因果反事实推理模块生成形态对齐的CAM,结合双路径结构语义架构和不确定性门控边缘损失,解决弱监督组织分割中伪标签噪声问题,在公共数据集上达到最优性能。

Comments 11 pages, 3 figures. Code is available at https://github.com/OceanPetal/C2AM-Seg

详情

展开后加载摘要…

URL PDF HTML 收藏