arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 548 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 548 篇

2605.20755 2026-06-12 eess.AS 版本更新 50%

DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action

DuplexSLA: 一种具备同步语音、语言和动作的全双工语音语言模型

Haoyang Zhang, Jun Chen, Donghang Wu, Yuxin Li, Yuxin Zhang, Xiangyu Tony Zhang, Che Liu, Qingjian Lin, Yizhou Peng, Hexin Liu, Eng Siong Chng, Chao Yan, Boyong Wu, Yechang Huang, Xuerui Yang, Fei Tian

专题命中 推理评测 :planning(abstract)

AI总结 本研究提出DuplexSLA,一种全双工语音语言模型,通过共享160ms时间线解码助理音频和结构化动作流,实现了同步语音、语言和动作的处理,解决了现有全双工模型在对话中规划和工具调用方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19652 2026-06-12 cs.CV 版本更新 50%

Navigating Gigapixel Pathology Images with Large Multimodal Models

利用大型多模态模型导航千兆像素病理图像

Thomas A. Buckley, Kian R. Weihrauch, Katherine Latham, Andrew Z. Zhou, Padmini A. Manrai, Arjun K. Manrai

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Pathology, Massachusetts General Hospital(麻省总医院病理学系) Department of Pathology and Laboratory Medicine, Brown University(布朗大学病理学与实验室医学系)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出GIANT方法,无需训练即可让通用多模态模型自主导航WSI,通过迭代选择多放大倍数裁剪并聚合证据,在MultiPathQA基准上实现SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10508 2026-06-11 cs.CR cs.NI 版本更新 50%

A Deployment-Oriented Framework for Explainable AI-Assisted eBPF/XDP Mitigation at the IoT Edge

面向部署的可解释AI辅助eBPF/XDP缓解框架在物联网边缘的应用

Abdurrahman Tolay

专题命中 推理评测 :reasoning(abstract)

AI总结 提出一种基于Linux的物联网边缘网关框架,结合资源感知的AI风险评分、事件级可解释性和eBPF/XDP限界缓解,实现可部署的异常流量管控。

Comments 59 pages, 2 figures, 12 tables. Conceptual framework and research agenda for explainable AI-assisted eBPF/XDP mitigation at the IoT edge. Corrected truncated abstract metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20795 2026-06-11 cs.CV 版本更新 50%

What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing

什么语义能经受住连接器的考验?视频编辑中VLM到DiT对齐的诊断

Hangyu Lin, Chao Wen, Chengming Xu, Jianxiong Gao, Jiangning Zhang, Xiaobin Hu, Yanwei Fu

机构 * HKUST(香港理工大学) FDU(福建大学) ZJU(浙江大学) NUS(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究探讨了视频生成模型中VLM与DiT对齐过程中的语义瓶颈问题,通过提出TRACE-Edit数据集和诊断协议,发现连接器模块会导致细粒度结构语义的严重退化,挑战了原有假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00461 2026-06-11 cs.CV 版本更新 50%

ReMoT: Reinforcement Learning with Motion Contrast Triplets

ReMoT: 基于运动对比三元组的强化学习

Cong Wan, Zeyu Guo, Jiangyang Li, SongLin Dong, Yifan Bai, Lin Peng, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Shenzhen University of Advanced Technology(深圳先进技术大学) DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出ReMoT统一训练范式,通过规则生成大规模运动对比数据集和组相对策略优化,解决VLM时空一致性问题,在时空推理任务上提升25.1%。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24088 2026-06-10 cs.MA 版本更新 50%

CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems

CORRECT: 多智能体系统中基于知识迁移的浓缩错误识别

Yifan Yu, Moyan Li, Shaoyuan Xu, Jinmiao Fu, Xinhai Hou, Fan Lai, Bryan Wang

专题命中 推理评测 :reasoning(abstract)

AI总结 提出CORRECT框架,利用在线缓存蒸馏错误模式,实现轻量级、免训练的错误定位,在多智能体系统中提升错误识别效率,并在七个应用上取得最高19.8%的步骤级错误定位提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05949 2026-06-08 cs.CV 版本更新 50%

Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models

忠实、丰富且精确:T2I模型在自然科学插图生成中的基准测试

Yifan Chang, Jiaxin Ai, Jianwen Sun, Yuandong Pu, Siqi Luo, Liangliang Zhao, Yuchen Ren, Minghao Liu, Yunfei Yu, Yu Qiao, Kaipeng Zhang, Yihao Liu

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Nankai University(南开大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) ZODA Alaya Studio(Alaya工作室)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出FEPBench基准,通过细粒度原子集标注和三维评估(指令忠实性、推理丰富性、语义精确性)系统评估T2I模型在自然科学插图生成中的表现,发现即使最先进的闭源模型仍存在文本渲染瓶颈、推理丰富性有限以及生成丰富性与精确性难以平衡的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23294 2026-06-08 eess.SY cs.SY 版本更新 50%

Agentic AI-Enhanced Semantic Communications: Foundations, Architecture, and Applications

基于代理AI的语义通信:基础、架构与应用

Haixiao Gao, Mengying Sun, Ruichen Zhang, Yanhan Wang, Xiaodong Xu, Nan Ma, Dusit Niyato, Ping Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探讨代理AI如何赋能语义通信,提出统一框架并展示多场景应用,通过案例研究验证其有效性。

Comments This version is being withdrawn because we need to further reevaluate the attribution of contributions among the authors

详情

展开后加载摘要…

URL PDF HTML 收藏