arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-18 至 2026-03-18 共收录 105 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 29 篇

2603.16862 2026-03-18 cs.CL 57%

Chronos: Temporal-Aware Conversational Agents with Structured Event Retrieval for Long-Term Memory

Chronos:具有结构化事件检索的时序感知对话代理以实现长期记忆

Sahil Sen, Elias Lumer, Anmol Gulati, Vamse Kumar Subbiah

机构 * Commercial Technology and Innovation Office(商业技术与创新办公室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Chronos通过结构化事件日历和对话日历实现时序感知,有效处理长期对话记忆中的时间敏感查询,提升多跳推理能力,在LongMemEvalS基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15643 2026-03-18 cs.AI 57%

GSI Agent: Domain Knowledge Enhancement for Large Language Models in Green Stormwater Infrastructure

GSI代理:面向绿色雨水基础设施的大语言模型领域知识增强

Shaohuang Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GSI代理,通过监督微调、检索增强生成和代理推理流程,提升大语言模型在绿色雨水基础设施任务中的领域知识能力,实验表明其在领域任务中的表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16544 2026-03-18 cs.CL 57%

How often do Answers Change? Estimating Recency Requirements in Question Answering

答案多久会变化?在问答中估计时效性需求

Bhawna Piryani, Zehra Mert, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学) MEF University(MEF大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出RecencyQA数据集,通过人类评估和实证分析,展示非平稳问题对LLM的挑战随更新频率增加而加剧,为时间推理提供细粒度基准和时效感知问答系统基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16107 2026-03-18 cs.SE cs.AI 57%

RepoReviewer: A Local-First Multi-Agent Architecture for Repository-Level Code Review

RepoReviewer: 一种面向仓库级别的多智能体架构

Peng Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RepoReviewer通过分解仓库获取、上下文合成、文件分析等步骤,提供一种实用的仓库级自动化审查架构,强调系统设计与可重用的评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07923 2026-03-18 cs.CV cs.AI 57%

Exploring the Underwater World Segmentation without Extra Training

探索无需额外训练的水下世界分割

Bingyu Li, Tao Huo, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国) University of Science and Technology of China, China(中国科学技术大学,中国) Northwestern Polytechnical University, China(西北工业大学,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AquaOV255水下分割数据集及Earth2Ocean框架,通过几何引导视觉掩码生成和类别-视觉语义对齐模块,在无需额外训练的情况下实现高效的水下开放词汇分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13397 2026-03-18 cs.CV 50%

TennisExpert: Towards Expert-Level Analytical Sports Video Understanding

TennisExpert: 向专家级分析体育视频理解迈进

Zhaoyu Liu, Xi Weng, Lianyu Hu, Zhe Hou, Kan Jiang, Jin Song Dong, Yang Liu

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Griffith University(格里菲斯大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出TennisExpert框架,通过整合视频语义解析器和基于Qwen3-VL-8B的记忆增强模型,实现高效多模态网球理解,提升战术分析和比赛动态捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 9 篇

2603.16553 2026-03-18 cs.CL cs.AI 81%

EmoLLM: Appraisal-Grounded Cognitive-Emotional Co-Reasoning in Large Language Models

EmoLLM:基于评估的认知-情感共推理在大语言模型中

Yifei Zhang, Mingyang Li, Henry Gao, Liang Zhao

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 EmoLLM通过引入评估推理图结构,实现认知与情感的协同推理,提升对话中情感状态和响应质量,同时保持事实可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16219 2026-03-18 cs.CL 79%

SpecSteer: Synergizing Local Context and Global Reasoning for Efficient Personalized Generation

SpecSteer:协同局部上下文与全局推理以实现高效个性化生成

Hang Lv, Sheng Liang, Hao Wang, Yongyue Zhang, Hongchao Gu, Wei Guo, Defu Lian, Yong Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出SpecSteer框架,通过结合本地上下文与云端推理,解决个性化生成中的隐私与推理能力矛盾,实现高效生成并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17018 2026-03-18 cs.CV 78%

SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward

SophiaVL-R1: 通过思考奖励强化大语言模型的推理能力

Kaixuan Fan, Kaituo Feng, Haoming Lyu, Dongzhan Zhou, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(MMLab,香港中文大学) Shanghai Artifcial Intelligence Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 SophiaVL-R1通过引入思考奖励信号提升多模态大语言模型的推理能力,采用信任GRPO方法和退火训练策略,有效缓解奖励黑客问题,实验表明其在多个基准测试中表现优异。

Comments ICLR 2026, Project page:https://github.com/kxfan2002/SophiaVL-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15981 2026-03-18 cs.CL cs.AI 73%

Aligning Paralinguistic Understanding and Generation in Speech LLMs via Multi-Task Reinforcement Learning

通过多任务强化学习对齐语音大语言模型中的语用理解和生成

Jingxiang Chen, Minseok Kim, Seong-Gyun Leem, Yin Huang, Rashi Rungta, Zhicheng Ouyang, Haibin Wu, Surya Teja Appini, Ankur Bansal, Yang Bai, Yue Liu, Florian Metze, Ahmed A Aly, Anuj Kumar, Ariya Rastrow, Zhaojiang Lin

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过多任务强化学习提升语音大语言模型对语用信息的理解与生成,实验表明在多个数据集上比监督模型和 proprietary 模型提升了8-12%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16737 2026-03-18 cs.CV cs.AI cs.CL 62%

Retrieving Counterfactuals Improves Visual In-Context Learning

检索反事实改进视觉上下文学习

Guangzhi Xiong, Sanchit Sinha, Zhenghao He, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CIRCLES框架,通过主动检索反事实样例提升视觉语言模型的因果推理能力,实验表明其在多个数据集上优于现有方法,尤其在小规模模型和信息稀缺场景下表现突出。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16642 2026-03-18 cs.AI cs.CL cs.CY 62%

When AI Navigates the Fog of War

当AI穿越战争的迷雾

Ming Li, Xirui Li, Tianyi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究AI在战争初期预测能力,通过2026年中东冲突案例,测试模型在无训练数据泄露情况下分析危机的能力,揭示模型在不同领域中的策略现实性和叙事演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21524 2026-03-18 cs.AI cs.IT math.IT 57%

Large Language Models for Wireless Communications: From Adaptation to Autonomy

大语言模型在无线通信中的应用:从适应到自主

Le Liang, Hao Ye, Yucheng Sheng, Ouya Wang, Jiacheng Wang, Shi Jin, Geoffrey Ye Li

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Imperial College London(伦敦帝国理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨大语言模型在无线通信中的应用,包括适应预训练模型、开发专用基础模型以及实现自主推理的代理模型,总结其优势与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15661 2026-03-18 cs.AI 57%

DynaTrust: Defending Multi-Agent Systems Against Sleeper Agents via Dynamic Trust Graphs

DynaTrust: 通过动态信任图防御多智能体系统中的睡眠代理

Yu Li, Qiang Hu, Yao Zhang, Lili Quan, Jiongchi Yu, Junjie Wang

机构 * Tianjin University(天津大学) Singapore Management University(新加坡管理学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DynaTrust,通过动态信任图防御多智能体系统中的睡眠代理,动态更新信任并重构图以隔离受损代理,提升防御效果和系统可用性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14805 2026-03-18 cs.PL cs.AI 57%

Sharing State Between Prompts and Programs

在提示和程序之间共享状态

Ellie Y. Cheng, Logan Weber, Tian Jin, Michael Carbin

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出共享程序状态抽象,使提示可直接访问程序变量并实现控制流,通过Nightjar系统验证了其在任务准确性和代码效率上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏