arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-17 至 2026-07-17 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 7 篇

2607.14114 2026-07-17 cs.CL cs.AI 新提交 90%

CoEvoT: Co-Evolving Chain-of-Thought Prompting for Graph-LLM Reasoning

CoEvoT:用于图语言模型推理的协同进化思维链提示

Haohua Niu, Xingtong Yu, Yang Liu, Junfeng Fang, Xuanting Xie, Jie Tan, Zhongjian Zhang, Hong Cheng, Yuan Fang

机构 * Sun Yat-Sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) National University of Singapore(新加坡国立大学) University of Electronic Science and Technology of China(电子科技大学) Beijing University of Posts and Telecommunieations(北京邮电大学) Singapore Management University(新加坡管理大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究分布转移下的图学习问题,提出CoEvoT框架,通过文本到图令牌重写与图到文本推理指导的闭环协同进化,实现逐步的、状态感知的证据细化,在八个数据集实验中性能优于现有基准模型。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14641 2026-07-17 cs.AI 新提交 57%

Analytic Abduction: Causal Decomposition and Governed Commitment for Human--AI Coordination

分析性溯因:用于人机协作的因果分解与受控承诺

Remo Pareschi

机构 * Stake Lab, University of Molise(莫利塞大学斯塔克实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究分析性溯因推理,核心方法是κ - τ 机制及因果簇,贡献在于将未确定分解作为共享协调对象,用于人机协作,为决策者提供竞争解释场景及证据,助力合理行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14557 2026-07-17 cs.AI 新提交 57%

Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation

从零步洞察终点:通过MLP稀疏感知截断加速扩散多模态大语言模型

Qicheng Zhao, Qi Sun, Zheyu Yan

机构 * Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究针对扩散多模态大语言模型推理效率受固定长度生成约束影响的问题,提出Seer框架,利用MLP激活稀疏性变化检测有效语义边界,进行冗余截断及采用混合执行策略,实验表明其可加速吞吐量并维持性能甚至提升复杂视觉任务准确性。

Comments Accepted to ACM Multimedia (ACM MM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14416 2026-07-17 cs.AI 新提交 57%

CausalGraphX: A Counterfactual Graph Neural Network Framework for Explainable Systemic Risk Assessment

因果图X:用于可解释系统性风险评估的反事实图神经网络框架

Rabimba Karanjai, Hemanth Madhavarao, Lei Xu, Weidong Shi

机构 * University of Houston(休斯顿大学) Kent State University(肯特州立大学) PayPal Inc.(贝宝公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对传统风险模型无法捕捉金融网络复杂动态及图神经网络缺乏因果解释的问题,提出因果图X框架,结合图神经网络与反事实推理,能有效评估系统性风险并提供可解释的反事实解释,优于传统和深度学习基线。

Comments Accepted in AAAI'26 Workshop, Agentic AI in Financial Services

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14341 2026-07-17 cs.RO cs.AI 新提交 57%

Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution

超越视觉抓取:从检测到执行的复杂抓取基准测试

Hanyi Zhang, Khang Nguyen, Charith Munasinghe, Basu Hela, Tianyu Li, Zihong Luo, Hoan Nguyen, Hans Wernher van de Venn, Yalin Zheng, Ravi Prakash, Tung D. Ta, Anh Nguyen, Baoru Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zurich University of Applied Science(苏黎世应用科学大学) Indian Institute of Science(印度科学研究所) University of Information Technology(信息技术大学) The University of Tokyo(东京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对现有抓取基准未涵盖复杂多步推理和语义理解任务的问题,提出GCA-Bench基准,实现多种基线方法并进行实证研究,给出新评估指标等,为开发更强大通用的抓取策略提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14303 2026-07-17 physics.ed-ph cs.AI 新提交 57%

Assessing AI in Introductory Physics Problem Solving

评估人工智能在基础物理问题解决中的能力

Amir Bralin, N. Sanjay Rebello

机构 * Texas Tech University(德克萨斯理工大学) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究评估OpenAI的o4-mini模型解决基础物理问题的能力,通过解决《费曼物理学讲义》章节末尾问题展开,发现模型总体准确率约90%,性能受问题模态和难度影响,表明先进大语言模型虽能解决不少基础物理问题,但表现不均衡。

Comments Working paper, submitted as a placeholder

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20785 2026-07-17 cs.CV 版本更新 50%

ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking

ME-IQA: 通过重新排序增强的记忆图像质量评估

Kanglong Fan, Tianhe Wu, Wen Wen, Jianzhao Liu, Le Yang, Yabin Zhang, Yiting Liao, Junlin Li, Li Zhang

机构 * City University of Hong Kong(香港城市大学) ByteDance Inc.(字节跳动公司)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ME-IQA通过构建记忆库和利用推理摘要检索语义和感知对齐的邻居,将VLM重构为概率比较器,并通过门控反思和记忆巩固提升未来决策,从而实现更密集的失真敏感预测,缓解离散崩溃问题。

Comments Published as a conference paper at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏