arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-13 至 2026-04-13 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 12 篇

2510.00938 2026-04-13 cs.LG 85%

Large Reasoning Models Learn Better Alignment from Flawed Thinking

大规模推理模型通过 flawed thinking 学习更好的对齐

ShengYun Peng, Eric Smith, Ivan Evtimov, Song Jiang, Pin-Yu Chen, Hongyuan Zhan, Haozhu Wang, Duen Horng Chau, Mahesh Pasupuleti, Jianfeng Chi

机构 * Meta Superintelligence Labs(Meta超级智能实验室) IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 RECAP通过强化学习提升模型安全对齐能力,减少偏见并增强鲁棒性,同时保持推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08563 2026-04-13 cs.CL cs.AI cs.LG 85%

Temperature-Dependent Performance of Prompting Strategies in Extended Reasoning Large Language Models

提示策略在扩展推理大语言模型中的温度依赖性能

Mousa Salah, Amgad Muneer

机构 * Gujarat Technological University(古吉拉特技术大学) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究评估了不同温度下链式思维和零样本提示策略在扩展推理中的表现,发现零样本提示在中等温度下性能最佳,链式思维在极端温度下表现最佳,扩展推理的收益随温度增加而提升。

Comments 3 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04047 2026-04-13 cs.LG cs.AI 81%

TS-Reasoner: Domain-Oriented Time Series Inference Agents for Reasoning and Automated Analysis

TS-Reasoner: 面向领域的时序推理代理用于推理和自动化分析

Wen Ye, Wei Yang, Defu Cao, Yizhou Zhang, Lumingyuan Tang, Jie Cai, Yan Liu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TS-Reasoner,一种面向领域的时序推理代理,结合大语言模型与领域工具,实现多步推理和约束感知分析,实验表明其在时序理解与多步推理任务中优于通用LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08926 2026-04-13 cs.LG 79%

Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning

弥合SFT与RL:面向鲁棒推理的动态策略优化

Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司智能系统部) Institute of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学前沿交叉研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出DYPO框架,通过组对齐损失、多教师蒸馏和动态探索-利用门控机制,解决SFT与RL间的偏倚-方差权衡问题,提升复杂推理和分布外任务性能。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01580 2026-04-13 cs.LG cs.AI 73%

The Two-Stage Decision-Sampling Hypothesis: Understanding the Emergence of Self-Reflection in RL-Trained LLMs

两阶段决策采样假说:理解RL训练LLM中自反思能力的产生

Zibo Zhao, Yuanting Zha, Haipeng Zhang, Xingcheng Xu

机构 * Arizona State University(亚利桑那州立大学) Shanghaitech University(上海科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了RL训练后LLM中自反思能力的形成机制,提出两阶段决策采样假说,通过梯度归因属性分析发现RL优于SFT的原因在于决策能力的提升而非生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08708 2026-04-13 cs.LG cs.AI cs.CL 67%

Every Response Counts: Quantifying Uncertainty of LLM-based Multi-Agent Systems through Tensor Decomposition

每种回应都重要:通过张量分解量化基于大语言模型的多智能体系统不确定性

Tiejin Chen, Huaiyuan Yao, Jia Chen, Evangelos E. Papalexakis, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of California, Riverside(加利福尼亚大学河滨分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MATU框架,通过张量分解量化多智能体系统中的不确定性,解决多步推理、通信路径变化和拓扑多样性等挑战,提供通用可靠性评估。

Comments Accept to ACL 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20821 2026-04-13 cs.CL cs.AI cs.CE 62%

MultiFinRAG: An Optimized Multimodal Retrieval-Augmented Generation (RAG) Framework for Financial Question Answering

MultiFinRAG:一种优化的多模态检索增强生成(RAG)框架,用于金融问答

Chinmay Gondhalekar, Urjitkumar Patel, Fang-Chun Yeh

机构 * S&P Global Ratings(标普全球评级)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MultiFinRAG通过多模态提取和分层回退策略,提升金融问答任务中跨模态推理的准确性,比ChatGPT-4o在复杂任务上高19个百分点。

Comments Preprint Copy

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23045 2026-04-13 cs.AI 57%

The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?

AI的混乱:模型智能与任务复杂性如何影响对齐问题

Alexander Hägele, Aryo Pradipta Gema, Henry Sleight, Ethan Perez, Jascha Sohl-Dickstein

机构 * Anthropic Fellows Program(Anthropic 研究员计划) EPFL(瑞士联邦理工学院洛桑) University of Edinburgh(爱丁堡大学) Constellation Anthropic

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了高智能AI模型在复杂任务中失败的机制,发现模型规模越大,失败行为越不一致,强调对齐研究在防止奖励黑客和目标误指定中的重要性。

Comments ICLR 2026. 10 pages main text, 40 total, 27 figures. v2: typos, improved writing, references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08355 2026-04-13 cs.AI 57%

ASPECT:Analogical Semantic Policy Execution via Language Conditioned Transfer

ASPECT:通过语言条件转移实现类比语义策略执行

Ajsal Shereef Palattuparambil, Thommen George Karimpanal, Santu Rana

机构 * Applied Artificial Intelligence Initiative, Deakin University, Waurn Ponds, Geelong(迪肯大学应用人工智能计划) School of IT, Deakin University, Waurn Ponds, Geelong(迪肯大学信息技术学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 ASPECT通过语言条件化的变分自编码器和大语言模型实现零样本迁移,解决传统方法在新任务适应性差的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09515 2026-04-13 cs.SE 50%

When LLMs Lag Behind: Knowledge Conflicts from Evolving APIs in Code Generation

当LLM落后时:来自演进API的代码生成中的知识冲突

Ahmed Nusayer Ashik, Shaowei Wang, Tse-Hsun Chen, Muhammad Asaduzzaman, Yuan Tian

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文研究了API演变对LLM代码生成的影响,发现缺乏全面文档时LLM难以优先处理外部上下文,执行率仅42.55%,而结构化文档和大模型规模可提升至66.36%,但推理策略如Self-Reflection可进一步提升11%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08959 2026-04-13 cs.HC 50%

How Do LLMs See Charts? A Comparative Study on High-Level Visualization Comprehension in Humans and LLMs

LLMs如何解读图表?人类与LLMs在高级可视化理解上的比较研究

Hyotaek Jeon, Hyunwook Lee, Minjeong Shin, Tapendra Pandey, Joohee Kim, Shinwook Seon, Daeun Jeong, Sungahn Ko, Ghulam Jilani Quadri

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究比较了人类与LLMs在图表高级理解上的差异,发现LLMs采用结构化列举而非人类的趋势叙事,揭示了可视化设计的新挑战与机遇。

Comments 15 pages, 8 figures, Accepted to EuroVis 2026

Journal ref The Eurographics Conference on Visualization (EuroVis 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09791 2026-04-13 cs.HC 50%

PRAXA: A Grammar for What-If Analysis

PRAXA:什么如果分析的语法

Sneha Gathani, Kevin Li, Raghav Thind, Sirui Zeng, Matthew Xu, Peter J. Haas, Cagatay Demiralp, Zhicheng Liu

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 PRAXA通过统一不同什么如果分析方法为语法,提供分析、组合和支持下一代什么如果系统的基础。

Comments What-if analysis for business intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏