arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-01 至 2026-04-01 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 6 篇

2603.29602 2026-04-01 cs.GR cs.AI cs.CV cs.MA 83%

IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection

IMAGAgent:通过约束感知规划与反思协调多轮图像编辑

Fei Shen, Chengyu Xie, Lihong Wang, Zhanyi Zhang, Xin Jiang, Xiaoyu Du, Jinhui Tang

机构 * National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

专题命中 复杂问题求解 :planning(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 IMAGAgent通过闭环机制整合指令解析、工具调度与自适应修正,解决多轮图像编辑中的上下文感知与反馈问题,提升编辑精度与整体质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00818 2026-04-01 cs.AI cs.CV 79%

Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning

Med-CMR:一个整合视觉证据和临床逻辑的细粒度基准,用于医疗复杂多模态推理

Haozhen Gong, Xiaozhong Ji, Yuansen Liu, Wenbin Wu, Xiaoxiao Yan, Jingjing Liu, Kai Wu, Jiazhen Pan, Bailiang Jian, Jiangning Zhang, Xiaobin Hu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Tongji University(同济大学) Ruijin Hospital(瑞金医院) Technical University of Munich(慕尼黑工业大学) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 Med-CMR通过细粒度分解医疗多模态推理能力,设计挑战性任务并覆盖广泛高质量数据,评估18种先进大语言模型,发现GPT-5在多项选择题和开放性评分中表现最佳,但专业医疗大语言模型并不总能超越强通用模型,长尾泛化成为主要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08115 2026-04-01 cs.AI 79%

TeamMedAgents: Pareto-Efficient Multi-Agent Medical Reasoning Through Teamwork Theory

TeamMedAgents: 通过团队理论实现帕累托高效多智能体医疗推理

Pranav Pushkar Mishra, Mohammad Arvan, Mohan Zalake

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 TeamMedAgents基于团队理论构建模块化多智能体框架,通过共享心理模型、团队领导、团队导向等机制,提升医疗推理效率,实现帕累托效率前沿提升,并在低token成本下取得竞争性准确率。

Comments 19 pages, 6 figure, 12 tables, 2 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01639 2026-04-01 cs.CV 50%

ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval

ReCALL: 为基于MLLM的组合图像检索 recalibrate 能力退化

Tianyu Yang, Chenwei He, Xiangzhao Hao, Tianyue Wang, Jiarui Guo, Haiyun Guo, Leigang Qu, Jinqiao Wang, Tat-Seng Chua

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Southeast University(东南大学) Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院) Guangdong Provincial Key Laboratory of Intellectual Property and Big Data, Guangdong Polytechnic Normal University(广东技术师范大学广东省知识产权大数据重点实验室)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ReCALL通过诊断生成器盲点、生成修正指令和三元组、并持续训练来缓解基于生成式MLLM的检索能力退化问题,实验证明其在CIRR和FashionIQ上达到SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28889 2026-04-01 cs.DB 50%

DeepEye: A Steerable Self-driving Data Agent System

DeepEye:一种可调节的自动驾驶数据代理系统

Boyan Li, Yiran Peng, Yupeng Xie, Sirong Lu, Yizhang Zhu, Xing Mu, Xinyu Liu, Yuyu Luo

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出DeepEye,一种基于工作流的生产级数据代理系统,通过统一多模态协调协议和分层推理机制,解决异构数据源联合分析和上下文爆炸问题,实现透明执行和自动化优化。

Comments SIGMOD Demo (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28807 2026-04-01 cs.CR 50%

SafeClaw-R: Towards Safe and Secure Multi-Agent Personal Assistants

SafeClaw-R:迈向安全且安全的多智能体个人助理

Haoyu Wang, Zibo Xiao, Yedi Zhang, Christopher M. Poskitt, Jun Sun

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出SafeClaw-R框架,通过在执行图层面强制安全不变量,提升多智能体系统在安全性和隐私保护方面的性能,实验表明其在多个领域均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏