arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 348 篇

2606.21579 2026-06-23 cs.CV cs.AI 新提交 57%

The Unreasonable Effectiveness of VLMs for Zero-shot Procedural Mistake Detection

VLM在零样本程序性错误检测中的惊人有效性

Serdar Ozsoy, Lars Doorenbos, Federico Spurio, Gianpiero Francesca, Juergen Gall

机构 * University of Bonn(波恩大学) Toyota Motor Europe(丰田欧洲公司) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出ZeProM框架,利用单个预训练VLM同时解决零样本程序性错误检测和时间动作分割,在EgoPER和CaptainCook4D基准上接近或超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21553 2026-06-23 cs.CL cs.IR 新提交 57%

Dissecting Agentic RAG: A Component Ablation for Multi-Hop QA with a Local 7B Model

解析智能体RAG:基于本地7B模型的多跳问答组件消融研究

Sheroz Shaikh

机构 * Independent Researcher(独立研究员)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 通过消融实验,发现固定混合检索和短检索循环对多跳问答贡献最大,自适应路由和深度循环并非必要。

Comments 8 pages, 4 figures, 4 tables. Code: https://github.com/sherozshaikh/agentic-rag-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20580 2026-06-23 cs.NI cs.AI 新提交 57%

Role-Based Agentic AI for Intent-Driven Network and Service Orchestration

基于角色的自主AI用于意图驱动的网络与服务编排

Juan Parra-Ullauri, Talha Ahmed Khan, Daniel McHugh, Shipra Kapoor, Alistair Duke, Alicia Hey, Andy Corston-Petrie

机构 * Research & Commercialisation, BT Group(BT集团研究与商业化部)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 提出一种基于角色的多智能体架构,通过分层代理系统实现从业务到网络的端到端意图编排,弥合BSS与OSS的鸿沟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20574 2026-06-23 cs.NI cs.AI 新提交 57%

LLM-assisted gNB Parameter Configuration for Radio Access Network

LLM辅助的无线接入网gNB参数配置

Yao-Cong Dong, Maria Amparo Canaveras Galdon, Ari Uskudar, Kuntal Chowdhury, Edwin K. P. Chong, Ray-Guang Cheng

机构 * Dept. of Electronic and Computer Engineering, National Taiwan University of Science and Technology, Taiwan(电子与计算机工程系,台湾科技大学) NVIDIA, USA(NVIDIA公司) Colorado State University, USA(科罗拉多州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出LLM辅助框架,通过合成数据生成和微调,自动从错误日志中生成正确的gNB参数配置,在OAI测试中准确率达92.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20120 2026-06-19 cs.RO cs.AI 新提交 57%

Dual-Agent Framework for Cross-Model Verified Translation of Natural-Language Protocols into Robotic Laboratory Platform

用于将自然语言协议翻译为机器人实验室平台的双智能体跨模型验证框架

Hyeonna Choi, Jung Yup Kim, Hyuneui Lim, Seunggyu Jeon

机构 * Department of Bionic Machinery, Research Institute of AI Robot, Korea Institute of Machinery & Materials(生物机械系、人工智能机器人研究所、韩国机械材料研究院)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 提出双智能体框架,通过解析器形式化协议、规则映射引擎生成控制命令、异构LLM验证器纠错,实现自然语言微孔板协议到机器人平台可执行命令的转换,并验证了端到端自主执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19149 2026-06-19 cs.CR cs.LG 新提交 57%

OpenAnt: LLM-Powered Vulnerability Discovery Through Code Decomposition, Adversarial Verification, and Dynamic Testing

OpenAnt:通过代码分解、对抗性验证和动态测试实现LLM驱动的漏洞发现

Nahum Korda, Gadi Evron

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 提出OpenAnt系统,结合静态分析与LLM推理,通过代码分解、对抗性验证和动态测试三阶段流水线,在降低误报率的同时发现未知漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18788 2026-06-18 cs.CV cs.CL 新提交 57%

HandwritingAgent: Language-Driven Handwriting Synthesis in Scalable Vector Space

HandwritingAgent: 语言驱动的可缩放矢量空间手写合成

Jaward Sesay, Yue Yu, Börje F. Karlsson

机构 * Beijing Institute of Technology(北京理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出HandwritingAgent,利用大推理模型在SVG格式中自动回归生成手写笔画序列,无需风格特定训练,通过自然语言和参考图像控制风格,在模仿、识别、多语言及复杂数学表达式合成等任务上达到或超越现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18502 2026-06-18 cs.CL 新提交 57%

Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications

面向企业应用的多智能体系统可扩展定制与部署

Paresh Dashore, Shreyas Kulkarni, Uttam Gurram, Nadia Bathaee, Kartik Balasubramaniam, Genta Indra Winata, Sambit Sahu, Shi-Xiong Zhang

机构 * Capital One(第一资本)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出统一框架,通过智能体模型定制(持续预训练、微调、偏好优化)和推理优化(推测解码、FP8量化),实现领域自适应和4.48倍吞吐加速,保持性能并提升长尾场景鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14202 2026-06-18 cs.NE cs.AI 新提交 57%

MeEvo: Metacognitive Evolution Combined with Natural Evolution for Automatic Heuristic Design

MeEvo: 元认知进化与自然进化相结合用于自动启发式设计

Zishang Qiu, Xinan Chen, Rong Qu, Ruibin Bai

机构 * School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波分校计算机科学学院) School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出MeEvo框架,通过循环耦合自然进化(探索启发式代码)和元认知进化(反思历史生成改进启发式),解决现有方法知识继承弱、探索不足的问题,在五个优化问题上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18166 2026-06-17 cs.CR cs.LG 新提交 57%

Evaluating Open-Source LLMs for Multi-Label ATT&CK Technique Classification on CTI Reports

评估开源大语言模型在CTI报告上的多标签ATT&CK技术分类

Ahmed Ryan, Saad Sakib Noor, Md Erfan, Shaswata Mitra, Sudip Mittal, Md Rayhanur Rahman

机构 * The University of Dhaka(达卡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 针对开源LLM在复杂非结构化CTI报告上的ATT&CK分类性能未被评估的问题,构建了2076句人工标注数据集,评估7个开源LLM,最高F1为0.22,表明当前模型不足以用于生产。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17821 2026-06-17 cs.AI 新提交 57%

DecoSearch: Complexity-Aware Routing and Plan-Level Repair for Text-to-SQL

DecoSearch: 面向Text-to-SQL的复杂度感知路由与计划级修复

Esteban Schafir, Xu Zheng, Hojat Allah Salehi, Zhuomin Chen, Mo Sha, Wei Cheng, Dongsheng Luo

机构 * Florida International University(佛罗里达国际大学) NEC-Labs(NEC实验室) Singapore Management University(新加坡管理大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出DecoSearch框架,通过复杂度感知路由将查询分配给直接生成或DAG分解,并结合拓扑精炼器修复执行失败,在BIRD和Spider上取得高准确率且显著降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17678 2026-06-17 cs.CV cs.AI 新提交 57%

See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

先看后答:基于充分性驱动的强化学习实现视觉证据预对齐

Yilian Liu, Sicong Leng, Guoshun Nan, Junyi Zhu, Jiayu Huang, Minghao Sun, Xuancheng Zhu, Yisong Chen, Zexian Wei, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) China Telecom(中国电信)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出视觉证据预对齐(VEPA)方法,在预训练与后训练之间引入充分性驱动的GRPO优化,以增强多模态大模型对细粒度视觉证据的利用,显著提升视觉密集型任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18108 2026-06-17 astro-ph.IM cs.AI 新提交 57%

Querying an astronomical database using large language models: the ALeRCE text-to-SQL system

使用大语言模型查询天文数据库:ALeRCE文本到SQL系统

P. A. Estevez, J. Espejo-Moreira, S. Sanfeliu-Alvarez, F. Forster, A. M. Munoz Arancibia, G. Cabrera-Vives, F. E. Bauer, A. Bayo, M. Catelan, R. Dastidar, L. Hernandez-Garcia, J. A. Intriago, G. Pignata

机构 * Department of Electrical Engineering, University of Chile, Av. Tupper 2007, Santiago, Chile Millennium Institute of Astrophysics (MAS), Nuncio Monseñor Sótero Sanz 100, Providencia, Santiago, Chile Data Artificial Intelligence Initiative (ID\&IA), Universidad de Chile Center for Mathematical Modeling, Universidad de Chile, Beauchef 851, North building, 7th floor, Santiago 8320000, Chile Departamento de Astronom\'ia, Universidad de Chile, Casilla 36D, Santiago, Chile Department of Computer Science, Universidad de Concepción, Edmundo Larenas 219, Concepción, Chile Center for Data Artificial Intelligence, Universidad de Concepción, Edmundo Larenas 310, Concepción, Chile Heidelberg Institute for Theoretical Studies, Heidelberg, Baden-Württemberg, Germany Instituto de Alta Investigación, Universidad de Tarapacá, Casilla 7D, Arica, 1010000, Chile European Southern Observatory, Karl-Schwarzschild-Strasse 2, 85748 Garching bei München, Germany Instituto de Astrofísica, Facultad de Física, Pontificia Universidad Católica de Chile, Casilla 306, Santiago 22, Chile Centro de Astroingeniería, Pontificia Universidad Católica de Chile, Av. Vicuña Mackenna 4860, 7820436 Macul, Santiago, Chile Instituto de Estudios Astrof\'isicos, Facultad de Ingenier\'ia y Ciencias, Universidad Diego Portales, Av. Ej\'ercito Libertador 441, Santiago, Chile Centro Interdisciplinario de Data Science, Facultad de Ingenier\'ia y Ciencias, Universidad Diego Portales, Av. Ej\'ercito Libertador 441, Santiago, Chile

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 提出基于大语言模型的文本到SQL系统,通过上下文学习和逐步生成框架(模式链接、查询分类、提示分解、自纠正)实现自然语言查询天文数据库,在ALeRCE数据集上评估13个模型,Claude Opus 4.6等表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17056 2026-06-16 cs.CL 新提交 57%

The Value Axis: Language Models Encode Whether They're on the Right Track

价值轴:语言模型编码它们是否在正确的轨道上

Nick Jiang, Isaac Kauvar, Jack Lindsey

机构 * Stanford University(斯坦福大学) Anthropic

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL

AI总结 通过构建Qwen3-8B的“价值轴”,发现语言模型内部追踪当前轨迹的成功概率,并影响自信、自我纠正和探索行为。

Comments Code repository: https://github.com/nickjiang2378/value-axis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16158 2026-06-16 cs.CV cs.CL 新提交 57%

Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding

必要时聚焦:用于无训练视觉定位的自适应路由与协作定位

Yifan Wang, Peiming Li, Shiyu Li, Zhiyuan Hu, Xiaochen Yang, Wenming Yang, Yang Tang, Zheng Wei

机构 * East China University of Science and Technology(华东理工大学) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出LazyMCoT动态框架,通过自适应路由评估不确定性,对简单查询跳过处理,对困难样本利用协作定位模块进行两阶段精炼,在提升推理精度的同时降低平均推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14674 2026-06-15 cs.CL 新提交 57%

AgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition

AgentSpec: 通过受控组合理解具身智能体脚手架

Jixuan Chen, Jianzhi Shen, Haoqiang Kang, Zhi Hong, Qingyi Jiang, Soham Bose, Yiming Zhang, Leon Leng, Amit Vyas, Lingjun Mao, Siru Ouyang, Kun Zhou, Lianhui Qin

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) Johns Hopkins University(约翰霍普金斯大学) University of Washington(华盛顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出AgentSpec模块化规范框架,将具身智能体表示为可复用策略组件的类型化组合,通过标准化接口实现受控组件替换与重组,揭示脚手架兼容性和交互效应对性能的主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14179 2026-06-15 cs.CL 新提交 57%

CacheRL:Multi-Turn Tool-Calling Agents via Cached Rollouts and Hybrid Reward

CacheRL: 通过缓存轨迹和混合奖励实现多轮工具调用智能体

Md Amirul Islam, Sumiran Thakur, Huancheng Chen, Su Min Park, Jiayun Wang, Gyuhak Kim

机构 * Center for Advanced AI Accenture(埃森哲高级人工智能中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出CacheRL系统,通过混合思维轨迹流水线、三级模糊缓存和缓存层级感知奖励,以100倍更少计算量实现92%的多步工具调用准确率,接近GPT-5的94%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13663 2026-06-12 cs.CL 新提交 57%

HyperTool: Beyond Step-Wise Tool Calls for Tool-Augmented Agents

HyperTool:超越逐步工具调用的工具增强型智能体

Yaxin Du, Yifan Zhou, Yujie Ge, Jiajun Wang, Xianghe Pang, Shuo Tang, Tuney Zheng, Bryan Dai, Jian Yang, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) IQuest Research Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 针对工具增强型LLM中逐步调用导致执行粒度不匹配的问题,提出HyperTool统一可执行接口,将确定性工具子流程折叠为单次调用,在多步工具任务上显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13262 2026-06-12 cs.AI 新提交 57%

From Verdict to Process: Agentic Reinforcement Learning for Multi-Stage Fact Verification

从判决到过程:面向多阶段事实核查的智能体强化学习

Rongxin Yang, Shenghong He, Siyuan Zhu, Chao Yu

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出ProFact框架,通过智能体强化学习端到端优化多阶段事实核查流程,引入过程感知奖励解决稀疏延迟监督问题,提升验证性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12400 2026-06-11 cs.CL cs.IR 新提交 57%

Doc-to-Atom: Learning to Compile and Compose Memory Atoms

Doc-to-Atom:学习编译和组合记忆原子

Xingjian Diao, Wenbo Li, Yashas Malur Saidutta, Avinash Amballa, Lazar Valkov, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子AI中心-山景城) Dartmouth College(达特茅斯学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出Doc2Atom框架,将文档分解为语义类型化的知识原子并编译为微LoRA适配器,通过轻量查询路由器选择相关原子组装成查询特定适配器,以解决文档压缩中的干扰和扩展性问题,在六个QA基准上优于Doc-to-LoRA。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09338 2026-06-09 cs.CL 新提交 57%

Multi-Hop Knowledge Composition is Bound by Pretraining Exposure

多跳知识组合受限于预训练暴露

Yannis Karmim, Luis Marti, Djamé Seddah, Valentin Barrière

机构 * Inria, Paris, France(法国国家信息与自动化研究所(巴黎)) Inria, Chile(法国国家信息与自动化研究所(智利)) Dept. of Computer Science, Universidad de Chile(智利大学计算机科学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 研究发现,即使单跳准确率达97%,大语言模型仍无法进行隐式多跳推理,原因是预训练中缺乏组合上下文,而非知识缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09071 2026-06-09 cs.AI 新提交 57%

REFLECT: Intervention-Supported Error Attribution for Silent Failures in LLM Agent Traces

REFLECT: 针对LLM智能体轨迹中静默失败的干预支持错误归因

Xiaofeng Lin, Yingxu Wang, Tung Sum Thomas Kwok, Daniel Guo, Sahil Arun Nale, Charles Fleming, Guang Cheng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出REFLECT方法,通过诊断候选错误步骤、使用诊断特定补丁进行受控重放测试,并利用验证结果作为对比证据来细化归因,在四个基准上取得最高定位准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09064 2026-06-09 cs.CV cs.AI 新提交 57%

See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding

看得更多,思考更深:面向长视频理解的查询扩展视觉证据与答案线索引导反思

Shuning Wang, Zhiheng Wu, YiNuo Lu, Naiming Liu, Chen Jia, Bowen Liu, Shuo Nie, Weijie Zhu, Yumeng Zhang

机构 * Baidu Inc.(百度公司) Harbin Institute of Technology(哈尔滨工业大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出CoVER框架,通过动态收集查询扩展视觉证据和答案特定视觉反馈验证草稿答案,实现从答案中心生成到证据中心和视觉可验证推理的转变,在长视频理解任务上超越同规模模型及部分闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08661 2026-06-09 cs.CR cs.AI cs.DB 新提交 57%

Data Agents Under Attack: Vulnerabilities in LLM-Driven Analytical Systems

数据代理遭受攻击:LLM驱动的分析系统中的漏洞

Kuncan Wang, Ziting Wang, Peizhuo Lv, Haoyang Li, Guoliang Li, Gao Cong, Wei Dong

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究系统分析了LLM驱动的数据代理的安全漏洞,提出了分层漏洞框架和攻击分类法,并在六个系统上评估了攻击效果,揭示了当前系统的重大安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08601 2026-06-09 cs.AI 新提交 57%

InA-Probe: Instruction-Aware Active Probing for Time Series Forecasting with LLMs

InA-Probe:面向LLM时间序列预测的指令感知主动探测

Peiliang Gong, Emadeldeen Eldele, Chenyu Liu, Ziyu Jia, Yi Ding, Xinliang Zhou, Lianchao Gu, Qi Zhu, Yang Liu, Daoqiang Zhang, Xiaoli Li

机构 * Nanyang Technological University(南洋理工大学) Khalifa University(哈利法大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出指令感知主动探测(InA-Probe),通过多级指令注入和自适应查询生成,结合双阶段注意力机制,在7个基准上超越现有方法,跨域误差降低37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08405 2026-06-09 cs.AI physics.flu-dyn 新提交 57%

Self-Evolving Scientific Agent Discovers Generalizable Physically-Reasoned Fluid Control

自进化科学智能体发现可泛化的物理推理流体控制

Boai Sun, Wenjin Guo, Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07462 2026-06-08 cs.AI 新提交 57%

Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle

像真正的研究者一样行动:一套评估前沿LLM和研究生命周期中智能体框架的基准测试套件

Jiayu Wang, Weijiang Lv, Bowen Fu, Jing Fu, Jiayi Song, Lingyu Zhang, Lanxuan Xue, Luodi Chen, Zepeng Xin, Kaiyu Li, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出AARR基准系列,通过AARRI-Bench评估智能体在细粒度研究场景中模拟人类研究者的专业性、全面性和细微推理能力,发现最佳配置成功率仅68.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07000 2026-06-08 cs.AI 新提交 57%

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

教方法而非答案:用于多模态策略优化的特权辅导蒸馏

Shizhe Xiang, Ke An, Wenlong Yu, Yue Liu, Jian Luan, Pei Fu, Qilong Wang

机构 * Tianjin University(天津大学) Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Xiaomi Inc(小米公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出PTD-PO框架,通过构建特权提示提供密集的令牌级监督,避免暴露答案,并采用Top-K JS散度稳定蒸馏,显著提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13384 2026-08-14 cs.IR cs.DB 新提交 50%

Structure then Query: Enabling Precise Analytical Queries over Unstructured Documents

先结构后查询:支持对非结构化文档进行精确分析查询

Teng Lin, Yuyu Luo, Nan Tang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 AnnoIndex通过注释索引与结构化查询引擎,解决非结构化文档精确分析查询难题,在三个数据集上平均F1达0.87,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13292 2026-08-14 cs.SE 新提交 50%

Refine After Generation: Toward Correct and Concise Patches in LLM-based Program Repair

生成后优化:面向基于大语言模型的程序修复中正确且简洁的补丁

Wenqiang Luo, Jacky Keung, Xiaoyu Shi, Yicheng Sun, Boyang Yang, Zhou Yang, Haoye Tian

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对基于LLM的程序修复中补丁冗余问题,提出RECAP适配器,在保留或提升解决率的同时,大幅降低补丁大小,实现更优的大小-正确性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏