arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-17 至 2026-07-17 共收录 106 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 26 篇

2607.14256 2026-07-17 cs.AI cs.MA 新提交 57%

Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation

基于多级智能数据管理的自动硬示例合成

Genglin Liu, Muye Zhang, Krishnamurthy Viswanathan, Nichole J. Hansen, Blaž Bratanič, Nathan L Clement, Shalini Ghosh, Ariel Fuxman

机构 * UCLA(加州大学洛杉矶分校) Google(谷歌)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究多模态大语言模型在内容安全审核任务中易受攻击的问题,提出自动智能红队框架,利用多智能体架构合成对抗示例,无需人工干预,提高模型鲁棒性,降低公共图像安全基准中的误报率。

Comments 23 pages; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00724 2026-07-17 cs.CL 版本更新 57%

MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark

MSQA:一个原生来源的多语言多文化SimpleQA基准

Xianru Chen, Yukai Huang, Mingxiang Chen, Xinping Lei, Fangbing Deng, Jin Chen, Ge Zhang, Wenhao Huang, Jiaheng Liu

机构 * M-A-P ByteDance Seed(字节跳动Seed) Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出MSQA基准,包含1064个原生问题覆盖11种语言和5个文化维度,评估18个LLM发现文化能力随预训练暴露程度下降,且推理时补救措施无效。

Comments Due to the company's data approval issue, we need to withdraw the article

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07999 2026-07-17 cs.LG 57%

Benchmarking Deep Learning for Future Liver Remnant Segmentation in Colorectal Liver Metastasis

基于未来肝脏残余分割的深度学习基准测试:用于结直肠肝转移的手术规划

Anthony T. Wu, Arghavan Rezvani, Kela Liu, Roozbeh Houshyar, Pooya Khosravi, Whitney Li, Xiaohui Xie

机构 * University of California, Irvine Donald Bren School of Information and Computer Science(加州大学尔湾分校唐纳德·布伦信息与计算机科学学院) University of California, Irvine School of Medicine(加州大学尔湾分校医学院)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 本文通过手动优化公开数据集,建立了首个开放验证的基准,比较了级联和端到端策略在肝脏残余分割中的性能,发现级联nnU-Net表现最佳,而预训练STU-Net在转移灶分割上更稳健。

Comments Accepted at the 2026 International Symposium on Biomedical Imaging (ISBI) Oral 4-page paper presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14684 2026-07-17 cs.CV 新提交 50%

GlobalForge: Towards Robust AI-Generated Image Detection

GlobalForge:迈向强大的人工智能生成图像检测

Manni Cui, Ruiqi Liu, Dianyuan Zou, Ziheng Qin, Jingrui Xu, ZiAn Wang, Jianglan Wei, Han Zhou, Yu Liu, Yan Wang, Shu Wu

机构 * Huazhong University of Science and Technology(华中科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Jilin University(吉林大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对AI生成图像检测器在现实世界通道传播后性能下降问题,提出GlobalForge框架,通过局部信息瓶颈和全局结构推理模块,基于退化对比结构损失联合训练,提升了检测器在多种基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14660 2026-07-17 cs.CV 新提交 50%

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

VIABench:一个从视障人士收集的用于视障辅助的综合视频基准测试

Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对视障人士视觉信息获取难及多模态大语言模型在视障辅助中实用价值待探索的问题,引入VIABench视频基准测试,定义三个核心任务,提出严格测试流程,实验表明当前模型对视障人士支持不足,有望推动定制模型开发以改善其体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14493 2026-07-17 cs.CR 新提交 50%

Context Contamination in LLM Analysis of Network Security Logs: Poison with Passive Prompt Injection and Mitigation Evaluation

网络安全日志的大语言模型分析中的上下文污染:通过被动提示注入进行中毒攻击及缓解评估

Rabimba Karanjai, Yang Lu, Hemanth Hegadehalli Madhavarao, Lei Xu, Weidong Shi

专题命中 推理评测 :reasoning(abstract)

AI总结 研究网络安全日志大语言模型分析中的上下文污染问题(被动提示注入漏洞),提出LogInject框架评估威胁,通过实验得出攻击成功率等数据,引入上下文拼接技术,评估分层防御效果,揭示需深度防御架构和人工监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12254 2026-07-17 cs.CV 版本更新 50%

Self-Aware Recursively Self-Improving Agents for Personal Singularity: A Goal-, Scope-, Tool-, and Benchmark-Driven Multi-Agent Architecture

如何实现递归式自我提升智能体与个人奇点:一种目标、范围、工具和基准驱动的多智能体架构

Chengshuai Yang

机构 * NextGen PlatformAI C Corp.(下一代平台人工智能C公司)

专题命中 推理评测 :verifier(abstract)

AI总结 研究大型语言模型智能体进步引发的问题,提出受治理多智能体架构实现递归式自我提升,以个人奇点为目标,详细介绍智能体各要素及架构组成,形式化多种机制并提供设计与路线图。

Comments 28 pages, 5 figures, 7 tables, and 5 algorithms. Position and systems-design paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 9 篇

2604.22280 2026-07-17 cs.CV 版本更新 85%

Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings

超越思维链:重写作为生成式多模态嵌入的通用接口

Peixi Wu, Ke Mei, Feipeng Ma, Bosong Chai, Zhibin Lan, Chenxi Zhao, Shannan Yan, Jie Chen, Zhangchi Hu, Yansong Peng, Bo Lin, Junjie Zhou, Dacheng Yin, Tianyi Wang, Fengyun Rao, Jing Lyu, Hebei Li, Xiaoyan Sun

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) Zhejiang University(浙江大学) Tsinghua University(清华大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

AI总结 针对思维链推理在检索中产生冗余和语义歧义的问题,提出重写驱动的多模态嵌入框架RIME,联合优化生成与嵌入,并通过跨模态对齐和精炼强化学习实现高效准确的检索。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14756 2026-07-17 cs.AI 新提交 83%

AI vs Human Expert Reasoning: Assessing Agreements in Building Typology Predictions based on Street View Imagery

人工智能与人类专家推理:基于街景图像评估建筑类型预测中的一致性

Zahratu Shabrina, Muhammad Asa, Jin Rui, Lu Yin, Stephen Law

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究探讨视觉语言模型从街景图像推断建筑类型的潜力,将其预测与人类专家比较,评估多种VLM,发现思维链提示性能更稳定,通过分析关键词概率研究推理过程,表明VLM能逼近专家能力,为城市分析提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14886 2026-07-17 cs.AI 新提交 79%

Reachability-Aware Pretraining for Efficient Target-Oriented Path Exploration in Temporal Knowledge Graph Reasoning

用于时态知识图谱推理中高效面向目标路径探索的可达性感知预训练

Chien-Liang Liu, Tsao-Lun Chen

机构 * Artificial Intelligence Research Center, Chang Gung University(长庚大学人工智能研究中心) Graduate Institute of Oral Biology, National Taiwan University(国立台湾大学口腔生物学研究所) National Taiwan University of Science and Technology(国立台湾科技大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对时态知识图谱推理中外推设置下RL训练奖励稀疏、探索效率低的问题,提出RAPTOR自监督预训练方法,通过学习估计可达性减少无前景路径探索,为RL微调提供初始化,实验证明该方法能提高训练效率并优于传统基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14110 2026-07-17 cs.CL cs.AI 新提交 62%

MAPS: Modeling Co-Existing Subjective Perspectives and Shared Meaning in Multi-Agent Cognitive Dialogue

MAPS:在多智能体认知对话中建模共存的主观视角和共享意义

Molood Arman, Clément Bonnafous

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对当前AI对话系统问题,提出MAPS框架,通过领域加权配置文件、动态GRU记忆和令牌级注意力,让智能体保持个性化推理并趋向共享意义,在多数据集评估中支持语义对齐且不损主观性,为可解释对话系统发展提供路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21005 2026-07-17 cs.AI cs.CL 版本更新 62%

Building Agent Harnesses for Scientific Curation from Multimodal Sources

构建用于多模态来源科学数据提取的智能体框架

Sheng Zhang, Qin Liu, Renqian Luo, Shufang Xie, Reuben Tan, Sean Hayes, Gregory Bryman, Wendong Ge, Ruilian Zhang, Oluwaseun Egbelowo, Kelly Yee, Hoifung Poon

机构 * Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校) Merck & Co., Inc., Rahway, NJ, USA(默克公司(美国新泽西州拉威))

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出Beaver框架,通过任务分解、多模态证据工具和可追溯性,将科学文献中的结构化信息提取转化为可审计的工作流,在GRAS指标上比前沿智能体提升23个绝对百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15254 2026-07-17 cs.AI cs.HC 新提交 57%

teLLMe Why (Ain't Nothing but a Jam): Exploratory Causal Analysis of Urban Driving Data

告诉我为什么(不过是一场拥堵):城市驾驶数据的探索性因果分析

Qiwei Li, Jorge Ortiz

机构 * Rutgers University(罗格斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究城市驾驶数据因果问题,提出teLLMe系统,结合多种方法从结构化事件表出发,通过模式感知大语言模型映射问题,返回‘因果卡片’总结相关内容,能揭示合理关系,用于假设生成和专家推理。

Comments Accepted at the NeurIPS 2025 Workshop on UrbanAI. 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14753 2026-07-17 cs.SD cs.AI 新提交 57%

Large Audio Language Models for Spoofing-Aware Speaker Verification

用于防欺骗语音识别的大型音频语言模型

Sofya Savelyeva, Mariia Perunova, Evgeny Kushnir, Artem Dvirniak, Dmitrii Korzh, Oleg Y. Rogov

机构 * Applied AI Institute(应用人工智能研究所) MIRAI(未来人工智能研究机构) HSE(高等经济学院) MTUCI(莫斯科国立通信与信息技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究用于防欺骗语音识别的大型音频语言模型,通过零样本提示等多种方式进行系统评估,发现预训练模型零样本时不佳,特定任务适应可改善,还找到多种实现竞争力性能的途径,为统一防欺骗语音识别提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14250 2026-07-17 cs.CL 新提交 57%

The Severance Problem: LLMs are Unaware of the Person Beyond the Prompt

分离问题:大语言模型未意识到提示之外的人

Dor Litvak, Liu Leqi

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究指出个人AI助手存在不良行为,源于语言模型的“分离问题”。提出通过“分离模式”将结构化无知纳入语言模型上下文的解决方案,经实证,五个模型家族采用此模式后能减少不良行为,模型在信息缺失时会询问澄清问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14095 2026-07-17 cs.AI 新提交 57%

HG-RAG: Hierarchy-Guided Retrieval-Augmented Generation for Structured Knowledge Graphs

HG-RAG:用于结构化知识图谱的层次引导检索增强生成

Pranav Yadav

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对RAG系统在处理结构化知识推理时的不足,提出HG-RAG框架,通过在层次知识图谱上遍历为语言模型提供结构化上下文,经多规模多类型查询评估,该框架在相关推理任务中优于基线,减少幻觉并保持一致性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏