arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-25 至 2026-06-25 共收录 80 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 23 篇

2606.25007 2026-06-25 cs.LG q-fin.ST 新提交 57%

Multi-Stream Temporal Fusion for Financial Fraud Detection

面向金融欺诈检测的多流时序融合

Mohammadamin Dashti Moghaddam, Nick Sciarrilli

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出多流欺诈Transformer(MSFT),通过独立编码交易、登录、风险等多事件流并融合表示,在千万用户数据集上AUROC达0.996,优于单流Transformer和XGBoost。

Comments 10 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18936 2026-06-25 cs.AI cs.CY 新提交 57%

SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

SciRisk-Bench:面向AI4Science安全的风险维度感知基准

Linghao Feng, Yinqian Sun, Dongqi Liang, Sicheng Shen, Chenfei Yan, Yuxuan Peng, Yilin Zhao, Haibo Tong, Kai Li, FeiFei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive Intelligence Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知智能实验室,自动化研究所,中国科学院,北京,中国) School of Future Technology, University of Chinese Academy of Sciences, China(未来技术学院,中国科学院大学,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(人工智能学院,中国科学院大学,中国) Zhongguancun Academy, China(中关村学院,中国) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Gaoling School of AI, Renmin University of China(甘露人工智能学院,中国人民大学) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院(北京-AISI)) School of Humanities, University of Chinese Academy of Sciences, China(人文学院,中国科学院大学,中国)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出SciRisk-Bench基准,从显式风险维度和科学学科两个角度评估AI4Science安全,覆盖7个学科、31个子学科和10个风险维度,实验揭示主流及科学大模型的安全薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25345 2026-06-25 cs.AI astro-ph.IM 版本更新 57%

Plausible but Wrong: A case study on Agentic Failures in Astrophysical Workflows

可能但错误:天体物理工作流中代理失败的案例研究

Shivam Rawat, Lucie Flek

机构 * Bonn-Aachen International Center for Information Technology, University of Bonn, Germany(波恩-阿森国际信息科技中心,波恩大学,德国) Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(拉马尔机器学习与人工智能研究所,德国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究评估了CMBAgent在两种工作流范式和十八个天体物理任务中的表现,发现代理在缺乏上下文时性能提升显著,但常出现静默错误,产生看似合理却不准确的结果,揭示了代理科学工作流中最危险的失败模式是自信生成错误结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02156 2026-06-25 cs.NI cs.AI 版本更新 57%

How Small Can 6G Reason? Scaling Tiny-to-Small Language Models for AI-Native Networks

6G 推理能有多小?面向 AI 原生网络的微小型语言模型缩放

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿联酋大学) Research Institute for Digital Future, Khalifa University, UAE(未来数字研究院,哈利法大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文系统研究小型语言模型在 6G 网络语义推理中的缩放行为与部署效率,发现 1.5B-3B 参数的中等模型在确定性稳定性和计算效率间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05143 2026-06-25 cs.AI cs.IR 版本更新 57%

CausalRAG2: Hierarchical Causal Knowledge Graph Design for RAG

CausalRAG2: 面向RAG的分层因果知识图谱设计

Nengbo Wang, Tuo Liang, Vikash Singh, Chaoda Song, Van Yang, Yu Yin, Jing Ma, Jagdip Singh, Vipin Chaudhary

机构 * Department of Computer and Data Sciences, Case Western Reserve University, Cleveland, OH, USA(计算机与数据科学系,凯斯西储大学,克利夫兰,OH,USA) Design and Innovation Department, Case Western Reserve University, Cleveland, OH, USA(设计与创新部门,凯斯西储大学,克利夫兰,OH,USA)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出CausalRAG2框架,通过分层模块间的因果门控机制显式建模因果关系,抑制虚假相关,实现大规模知识图谱上的可扩展推理,并引入HolisQA基准,实验表明其优于现有图基RAG方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17037 2026-06-25 cs.CV cs.AI 版本更新 57%

AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

AMVICC: 一种用于VLM和IGM跨模态故障模式分析的新型基准

Aahana Basappa, Pranay Goel, Anusri Karra, Anish Karra, Asa Gilmore, Kevin Zhu

机构 * Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA) Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA) West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA) Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出AMVICC基准,通过图像到文本和文本到图像任务系统比较多模态大模型和图像生成模型的视觉推理失败模式,发现故障模式在模型和模态间共享,但存在特定于模型和模态的失败。

Comments 14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25905 2026-06-25 cs.CV 新提交 50%

SurgAtlas: A Large-Scale Surgical Video-Language Dataset with 2,391 Hours of Open and Minimally Invasive Surgery

SurgAtlas:一个包含2,391小时开放和微创手术的大规模手术视频-语言数据集

Filippos Bellos, Andre S. Gala-Garza, Miaowei Wang, Alyssa M. Hardin, Ahmad M. Hider, Yayuan Li, Jing Bi, Susan Liang, Chenliang Xu, Donald S. Likosky, Jason J. Corso

机构 * University of Michigan(密歇根大学) University of Edinburgh(爱丁堡大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) University of Colorado(科罗拉多大学) University of Rochester(罗切斯特大学) Michigan Medicine(密歇根医学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出SurgAtlas,最大手术视频-语言数据集(15,291视频,2,391小时,18专科,5,000+术式),首次大规模纳入开放手术并建立基准,通过多层级自动标注管道生成丰富注释,微调Qwen3-VL-8B在多个基准上达到领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25867 2026-06-25 cs.SE 新提交 50%

LLM-Based Discovery of Latent Requirements from Stakeholder Conversations: Preliminary Results from Industry

基于LLM从利益相关者对话中发现潜在需求:来自工业界的初步结果

Mithila Sivakumar, Martin Lochner, Shiva Nejati, Mehrdad Sabetzadeh

专题命中 推理评测 :reasoning(abstract)

AI总结 提出LENS方法,利用LLM分析利益相关者访谈记录,提取显式需求并推断潜在需求,以用户故事表示并链接原文,工业评估显示显式需求F1为84.4%,75%潜在需求被认为有用。

Comments This paper has been accepted at the 13th International Workshop on Artificial Intelligence and Requirements Engineering (AIRE 2026), co-located with RE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25296 2026-06-25 cs.AR 新提交 50%

SafeGen: LLM-Driven Assertion Generation and Fault Criticality Evaluation for Functional Safety

SafeGen: 面向功能安全的LLM驱动断言生成与故障关键性评估

Xuanyi Tan, Arjun Chaudhuri, Rubin Parekhji, Krishnendu Chakrabarty

专题命中 推理评测 :reasoning(abstract)

AI总结 提出SafeGen框架,利用大语言模型和超知识图谱从设计文档提取规范并生成功能安全断言,结合门级到RTL故障映射与形式验证实现故障关键性语义分级,在FOC系统中验证了优于传统方法。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25084 2026-06-25 cs.CV 新提交 50%

Are We There Yet? Exploring the Capabilities of MLLMs in Assistive AI Applications

我们到了吗?探索多模态大语言模型在辅助人工智能应用中的能力

Shayon Dasgupta, Avijit Dasgupta, C. V. Jawahar

机构 * IIT BHU India(印度理工学院瓦拉纳西校区) CVIT, IIIT Hyderabad India(印度海得拉巴国际信息技术学院计算机视觉与信息技术中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过真实世界任务评估多模态大语言模型在辅助AI中的表现,开发NetraLink系统收集基准数据,揭示其优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22497 2026-06-25 cs.CV 新提交 50%

Benchmarking Vision-Language Models for Microscopic Plant Image Understanding

用于植物显微图像理解的视觉语言模型基准测试

Tianqi Wei, Xin Yu, Zhi Chen, Scott Chapman, Zi Huang

机构 * The University of Queensland(昆士兰大学) Adelaide University(阿德莱德大学) University of Southern Queensland(南昆士兰大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出PlantMicro基准,包含5000+图像和9000+VQA对,评估视觉语言模型在植物显微图像理解上的能力,发现现有模型在细粒度识别和生物学推理上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 9 篇

2509.22193 2026-06-25 cs.CL 版本更新 79%

Scale or Reason? A Compute-Equivalent Analysis of Reasoning Distillation

规模还是推理?推理蒸馏的计算等价分析

Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Kevin El Haddad, Céline Hudelot, Pierre Colombo

机构 * Diabolocom Artefact Research Center Equall ISIA Lab, University of Mons(ISIA实验室,蒙斯大学) MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎萨克雷大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过控制实验,在相同计算预算下比较推理蒸馏与标准指令微调,发现指令微调在多数配置下处于帕累托前沿,而推理蒸馏仅在7B以上开放任务中有效,混合25-50%推理数据可低成本获得大部分收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25508 2026-06-25 cs.CV 新提交 78%

C2RM-Seg: Causal Counterfactual Reasoning with Structural-Semantic Priors for Weakly Supervised Histopathological Tissue Segmentation

C2RM-Seg: 基于结构语义先验的因果反事实推理用于弱监督组织病理学组织分割

Hualong Zhang, Siyang Feng, Zihan Huan, Yi Qian, Zhenbing Liu, Rushi Lan, Xipeng Pan

机构 * Guangxi Key Laboratory of Image and Graphic Intelligent Processing, Guilin University of Electronic Technology(广西图像图形智能处理重点实验室,桂林电子科技大学) International Joint Research Laboratory of Spatio-temporal Information and Intelligent Location Services, Guilin University of Electronic Technology(时空信息与智能定位服务国际联合研究实验室,桂林电子科技大学) School of Computer Science and Information Security, Guilin University of Electronic Technology(桂林电子科技大学计算机与信息安全学院)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 提出C2RM-Seg框架,通过因果反事实推理模块生成形态对齐的CAM,结合双路径结构语义架构和不确定性门控边缘损失,解决弱监督组织分割中伪标签噪声问题,在公共数据集上达到最优性能。

Comments 11 pages, 3 figures. Code is available at https://github.com/OceanPetal/C2AM-Seg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24369 2026-06-25 cs.AI cs.DC cs.NI cs.PF 新提交 57%

Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation

加速面向视觉生成式大语言模型的解耦强化学习:基于扩散并行与训练器辅助生成

Sijie Wang, Zhengyu Qing, Zhiqiang Tan, Yiming Yin, Yeqing Zhang, Yaoyuan Wang, Qiang Wang, Xiaowen Chu, Shaohuai Shi

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)数据科学与分析学域) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出解耦强化学习框架DigenRL,通过生成轴流水线、时间步并行和弹性训练器辅助生成,解决扩散生成式大语言模型中执行气泡问题,实现1.56-2.10倍吞吐提升。

Comments Withdrawn by the authors pending resolution of intellectual property and institutional disclosure requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17945 2026-06-25 cs.AI 新提交 57%

Small Initialization Matters for Large Language Models

小初始化对大语言模型至关重要

Liangkai Hang, Junjie Yao, Zhiyu Li, Feiyu Xiong, Hongkang Yang, Zhi-Qin John Xu

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Institute of Natural Sciences, Shanghai Jiao Tong University(上海交通大学自然科学研究院) MemTensor (Shanghai) Technology Co., Ltd.(上海记忆张量科技有限公司) Institute for Advanced Algorithms Research(先进算法研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文发现减小初始化尺度能持续改善大语言模型预训练,尤其在推理任务上提升显著,并揭示了小初始化驱动参数从低复杂度结构向丰富表示演化的机制。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09910 2026-06-25 cs.CL 版本更新 57%

Learning to Erase Private Knowledge from Multi-Documents for Retrieval-Augmented Large Language Models

学习从多文档中擦除私有知识以用于检索增强型大语言模型

Yujing Wang, Jinwen Chen, Hainan Zhang, Liang Pang, Yongxin Tong, Binghui Guo, Hongwei Zheng, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) School of Artificial Intelligence, Beihang University, China(北京航空航天大学人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究所) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出Eraser4RAG,通过构建全局知识图谱、划分私有与公共子图并微调Flan-T5重写文档,结合PPO优化,有效擦除用户定义的私有知识,保留公共知识,防御去匿名化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25588 2026-06-25 cs.SE 新提交 50%

IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration

IntentTester:面向意图驱动的跨库测试迁移多智能体框架

Yi Gao, Ziyuan Zhang, Xing Hu, Xiaohu Yang, Xin Xia

专题命中 其他推理 :reasoning(abstract)

AI总结 提出IntentTester多智能体框架,通过将测试抽象为语言无关的测试描述语言(TDL),结合知识图谱对齐语义实体,并利用LLM推理与迭代验证生成可执行测试,实现跨库跨语言测试迁移,在9个开源项目上生成2776个测试,正确率85%,有效性74%,并发现多处隐藏缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25287 2026-06-25 cs.HC 新提交 50%

The Digital Pirahã Condition: Ecological Mismatch and the Reconstruction of Recursive Cognition

数字皮拉罕条件:生态错位与递归认知的重建

Dhushy Thillaivasan, Samar Shailendra, Kristina Nicholls, Deepani Guruge

专题命中 其他推理 :reasoning(abstract)

AI总结 提出“数字皮拉罕条件”模型,解释数字环境如何培养浅层认知模式,导致与学术推理的生态错位,并主张通过教育中的认知生态重建来应对。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24538 2026-06-25 cs.CV 新提交 50%

ForensicsTok: Forensics-Guided Tokenized Modeling for Image Tampering Localization

ForensicsTok: 面向图像篡改定位的法医引导分词建模

Lei Xu, Haowei Wang, Shen Chen, Taiping Yao, Bin Li, Changsheng Chen

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen MSU-BIT University(深圳北理莫斯科大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出ForensicsTok,将图像篡改定位重构为自回归序列生成任务,通过Token Splatting解码器和分层专家融合模块,直接生成空间定位的令牌序列,避免中间监督,在六个基准上超越现有MLLM方法并略优于强法医基线。

Comments 16 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04554 2026-06-25 cs.CV 版本更新 50%

Counterfeit Answers: Adversarial Forgery against OCR-Free Document Visual Question Answering

伪造答案:针对无OCR文档视觉问答的对抗性伪造

Marco Pintore, Maura Pintor, Dimosthenis Karatzas, Battista Biggio

机构 * University of Cagliari, Italy(卡利亚里大学) Computer Vision Center, UAB, Spain(UAB计算机视觉中心)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出一种视觉上不可察觉但语义上定向的对抗攻击方法,通过伪造文档内容诱导DocVQA模型产生错误答案,在Pix2Struct和Donut模型上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏