arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-02 至 2026-06-02 共收录 333 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 43 篇

2601.10691 2026-06-02 cs.CY cs.CE cs.HC 50%

The Conversational Exam: A Scalable Assessment Design for the AI Era

对话式考试:AI时代的可扩展评估设计

Lorena A. Barba, Laura Stegner

专题命中 其他推理 :reasoning(abstract)

AI总结 针对学生使用生成式AI导致传统评估失效的问题,提出对话式考试——一种可扩展的口试形式,通过让学生现场编码并解释推理过程来恢复评估有效性,并在58名学生中验证其可行性。

Comments 12 pages

Journal ref Computer, vol. 59, no. 6, pp. 132-139, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07152 2026-06-02 cs.MA 50%

Agents of Diffusion: Enhancing Diffusion Language Models with Multi-Agent Reinforcement Learning for Structured Data Generation (Extended Version)

扩散代理:利用多智能体强化学习增强扩散语言模型以生成结构化数据(扩展版)

Aja Khanal, Kaushik T. Ranade, Rishabh Agrawal, Kalyan S. Basu, Apurva Narayan

专题命中 其他推理 :reasoning(abstract)

AI总结 提出Agents of Diffusion (AoD)框架,通过多智能体强化学习结合扩散语言模型与自回归模型的推理能力,实现高语义新颖性和结构保真度的结构化数据生成。

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12795 2026-06-02 cs.SE 50%

When Large Language Models Meet UAV Projects: An Empirical Study from Developers' Perspective

当大型语言模型遇到无人机项目:来自开发者视角的实证研究

Yihua Chen, Xingle Que, Jiashuo Zhang, Jiachi Chen, Ting Cui, Guangshun Li, Ting Chen

专题命中 其他推理 :reasoning(abstract)

AI总结 通过分析997篇论文和1509个GitHub项目,并调查52位从业者,本研究分类了无人机项目中大型语言模型(LLM)的九种常见任务和四种工作流,揭示了研究与工业实践之间的差异,并指出了整合LLM的五大挑战因素。

详情

展开后加载摘要…

URL PDF HTML 收藏