arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-08 至 2026-06-08 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 8 篇

2606.06842 2026-06-08 cs.CL 新提交 79%

CRAFT: A Unified Counterfactual Reasoning Framework for Tabular Question Answering and Fact Verification

CRAFT:面向表格问答与事实验证的统一反事实推理框架

Chenshuo Pan, Yu Zhao, Jie Zhang, Changzai Pan, Zhenhe Wu, Jiayi Liang, Yujie Mao, Shuangyong Song, Yongxiang Li, Zhongjiang He

机构 * Xingchen AGI Lab,China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(兴晨AGI实验室,中国电信人工智能技术(北京)有限公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出CRAFT统一反事实推理框架,将表格问答和事实验证转化为双向验证过程,通过构建声明及其反事实变体并加权整合证据,显著提升复杂表格推理性能。

Comments 24pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28742 2026-06-08 cs.AI 版本更新 79%

CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning

CORE: 对比反思实现推理能力的快速提升

Linas Nasvytis, Simon Jerome Han, Ben Prystawski, Satchel Grant, Noah D. Goodman, Judith E. Fan

机构 * Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 提出对比反思(CORE)非参数学习算法,通过对比成功与失败的推理轨迹生成自然语言洞察,在少量样本和 rollout 下实现比参数方法(GRPO)和非参数方法(GEPA、情景RAG、MemRL)更快的推理性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07264 2026-06-08 eess.AS 新提交 78%

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track

VISA:面向Interspeech 2026 ARC智能体赛道的视觉信息增强音频推理系统

Wenming Tu, Jian Gao, Yanru Huo, Yixuan Wang, Jing Peng, Bohan Li, Ziyang Ma, Tao Liu, Shuai Fan, Kai Yu, Xie Chen, Zilong Zheng

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出VISA系统,通过多模态特征提取、模型投票推理和细粒度类别感知路由,增强大音频语言模型的音频推理能力,在ARC智能体赛道取得66.23%评分和77.40%准确率。

Comments Submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07462 2026-06-08 cs.AI 新提交 57%

Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle

像真正的研究者一样行动:一套评估前沿LLM和研究生命周期中智能体框架的基准测试套件

Jiayu Wang, Weijiang Lv, Bowen Fu, Jing Fu, Jiayi Song, Lingyu Zhang, Lanxuan Xue, Luodi Chen, Zepeng Xin, Kaiyu Li, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出AARR基准系列,通过AARRI-Bench评估智能体在细粒度研究场景中模拟人类研究者的专业性、全面性和细微推理能力,发现最佳配置成功率仅68.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07000 2026-06-08 cs.AI 新提交 57%

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

教方法而非答案:用于多模态策略优化的特权辅导蒸馏

Shizhe Xiang, Ke An, Wenlong Yu, Yue Liu, Jian Luan, Pei Fu, Qilong Wang

机构 * Tianjin University(天津大学) Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Xiaomi Inc(小米公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出PTD-PO框架,通过构建特权提示提供密集的令牌级监督,避免暴露答案,并采用Top-K JS散度稳定蒸馏,显著提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04234 2026-06-08 cs.MA cs.AI 57%

When Does Multi-Agent Collaboration Help? An Entropy Perspective

何时多智能体协作有助于?从熵的角度来看

Yuxuan Zhao, Sijia Chen, Ningxin Su

机构 * Yantai Research Institute of Harbin Engineering University(哈尔滨工程大学烟台研究室) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文从熵的角度探讨了多智能体协作的有效性,通过分析不同拓扑结构、六个推理基准和两个智能体任务中的熵转换,发现单个智能体在43.3%的情况下表现更优,并揭示了熵动态在第一轮交互中的决定性作用。研究提出了三个关键观察:确定性偏好、基础熵和任务意识,并引入了熵判别算法来提升智能体系统的性能。

Comments Project page: https://multiagent-entropy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26615 2026-06-08 cs.CL 版本更新 57%

SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding

SlideAgent:用于多页视觉文档理解的分层代理框架

Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar

机构 * Georgia Institute of Technology(佐治亚理工学院) J.P. Morgan AI Research(摩根大通AI研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出SlideAgent,一种用于多模态多页文档(如幻灯片)理解的分层代理框架,通过全局、页面和元素三级推理构建结构化表示,在专有和开源模型上分别提升7.9%和9.8%的准确率。

Comments ACL 2026 Main Conference. https://slideagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07246 2026-06-08 cs.AR 新提交 50%

MailoHLS: Multi-Adapter Structure-Aware Learning for Pareto-Driven HLS Pragma Optimization

MailoHLS: 面向帕累托驱动HLS编译指示优化的多适配器结构感知学习

Elena Vouvali, Dimosthenis Masouros, Aggelos Ferikoglou, Dimitrios Soudris, Sotirios Xydis

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出MailoHLS混合框架,结合LLM语义推理与GNN结构建模,通过交叉注意力、目标条件LoRA适配器和帕累托优化,实现HLS编译指示的联合优化,在延迟优化上最高提速12.42倍,并持续生成近帕累托最优设计。

详情

展开后加载摘要…

URL PDF HTML 收藏