arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-07 至 2026-08-07 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 9 篇

2608.06060 2026-08-07 cs.CV 新提交 89%

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval

从失败中学习:基于难负例的以检索为中心的思维链用于统一多模态检索

Zelong Sun, Jun Wang, Kaicheng Yang, Tiancheng Gu, Ziyong Feng, Zhiwu Lu

专题命中 复杂问题求解 :CoT(title,summary_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究提出UniME-R1框架,通过基于难负例的以检索为中心的思维链(RC-CoT)学习从检索失败中优化,在多模态检索基准上提升了性能。

Comments 26 pages,10 figures,14 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05631 2026-08-07 cs.CV 新提交 78%

ChronoVision: Temporal Reasoning via Latent State Reconstruction

ChronoVision:基于潜在状态重构的时序推理

Yifan Shen, Jian Xu, Boyi Li, Yuner Zhang, Tianjiao Yu, Bingxuan Li, Houze Yang, Rushi Wang, Xu Cao

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 针对多模态大语言模型时序推理不足的问题,本文提出ChronoVision框架,引入Vbvr-VQA数据集,实验显示其在相关基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05565 2026-08-07 cs.CV 新提交 78%

EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal

EffectLearner:面向真实世界视频物体移除的世界感知物体-效应推理

Feier Wu, Wanke Xia, Xu He, Zilang Zhou, Si Chen, Dongxia Liu, Liyang Chen, Qimeng Wu, Zhengbo Zhang, Wenming Yang, Zhiyong Wu

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 该研究提出EffectLearner框架,结合VLM物体-效应推理器与DiT视频擦除器,构建专属数据集EffectWorld并采用渐进式训练,在视频物体移除任务上实现更优性能。

Comments Project: https://morleyolsen.github.io/EffectLearner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06366 2026-08-07 cs.AI cs.LG 新提交 62%

Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering

追踪核心:一种用于心力衰竭特征工程的证据关联管道

Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo

机构 * Nimblemind(宁敏德(音译)) Singapore University of Technology and Design(新加坡科技设计大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Florida International University(佛罗里达国际大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校) Rutgers University Newark(罗格斯大学纽瓦克分校) Rutgers Institute for Health Health Care Policy and Aging Research(罗格斯大学健康、医疗保健政策与老龄化研究所) Robert Wood Johnson Medical School(罗伯特·伍德·约翰逊医学院) Rutgers Health(罗格斯医疗)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对心力衰竭EHR特征工程瓶颈,开发了nMAS管道,经500条虚拟记录验证,可提升HFrEF和HFpEF表型分析的AUROC,为自动化可审核特征工程提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05587 2026-08-07 cs.AI 新提交 57%

StepReflect: Structured UI Transition Reflection for Mobile GUI Agents

StepReflect:面向移动GUI智能体的结构化UI过渡反射

Linqiang Guo, Wei Liu, Li Gu, Yang Wang, Tse-Hsun, Chen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对移动GUI智能体长时序执行的动作反射需求,提出StepReflect模型,在离线和在线实验中均优于GPT-5.2相关方案,成本更低且可本地部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05381 2026-08-07 cs.AI 新提交 57%

C$^3$PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

C³PO:评估全模态模型中的跨模态组合与反事实性能

Swapnanil Mukherjee, Agyeya Negi, Tanuja Ganu, Ponnurangam Kumaraguru

机构 * Microsoft Research India(微软研究院印度分院) IIIT Hyderabad(印度国际信息技术研究院(海得拉巴))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究推出C³PO基准数据集,评估全模态模型的跨模态组合与反事实性能,发现模型存在模态主导问题,需改进架构以支持持续跨模态注意力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05263 2026-08-07 cs.AI 新提交 57%

OrchestraBench: Evaluating Multi-Agent Orchestration Failure Modes, Recovery, and Decomposition Quality

OrchestraBench:评估多智能体编排的故障模式、恢复能力与分解质量

Yidian Chen, Yingzi Gu, Natan Vidra, Spurthi Setty, Sharon Zheng

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 OrchestraBench 是评估多智能体编排故障模式、恢复能力与分解质量的基准,通过可控故障注入揭示了不同路由策略、智能体模式的故障处理差异及级联规律。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01707 2026-08-07 cs.CL cs.DB 版本更新 57%

Memory in the LLM Era: Modular Architectures and Strategies in a Unified Framework

在大语言模型时代:在统一框架下的模块化架构与策略

Yanchen Wu, Tenghui Lin, Yingli Zhou, Fangyuan Zhang, Qintian Guo, Xun Zhou, Sibo Wang, Xilin Liu, Yuchi Ma, Yixiang Fang

机构 * Huawei Cloud(华为云)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文在统一框架下系统比较了多种记忆方法,设计出优于现有方法的新方法,并探讨了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07832 2026-08-07 cs.CL cs.CV 57%

LADDER: Language-Driven Slice Discovery and Error Rectification in Vision Classifiers

Shantanu Ghosh, Rayan Syed, Chenyu Wang, Vaibhav Choudhary, Binxu Li, Clare B. Poynton, Shyam Visweswaran, Kayhan Batmanghelich

机构 * Boston University(波士顿大学) Stanford University(斯坦福大学) Boston University Medical Campus(波士顿大学医学校区) University of Pittsburgh(匹兹堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

Comments ACL 2025. Code: https://github.com/batmanlab/Ladder

Journal ref Findings of the Association for Computational Linguistics: ACL 2025, pages 22935-22970

详情

展开后加载摘要…

URL PDF HTML 收藏