arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5001 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5001 篇

2607.15495 2026-07-20 cs.CL cs.AI cs.LG 新提交 67%

Verbalizable Representations Form a Global Workspace in Language Models

语言模型中的可言语化表征形成全局工作空间

Wes Gurnee, Nicholas Sofroniew, Adam Pearce, Mateusz Piotrowski, Isaac Kauvar, Runjin Chen, Anna Soligo, Paul Bogdan, Euan Ong, Rowan Wang, Ben Thompson, David Abrahams, Subhash Kantamneni, Emmanuel Ameisen, Joshua Batson, Jack Lindsey

机构 * Anthropic(A÷)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨语言模型中可言语化表征,用雅可比透镜识别出J空间,其具有全局工作空间功能特性与结构特征,能揭示模型未显思考,发现训练后助手观点在工作空间,引入反事实反思训练,解码表征助于了解认知过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18531 2026-07-20 cs.AI cs.CL cs.LG 67%

Enhancing Hepatopathy Clinical Trial Efficiency: A Secure, Large Language Model-Powered Pre-Screening Pipeline

提升肝病临床试验效率:一种安全的、基于大语言模型的预筛选流程

Xiongbin Gui, Hanlin Lv, Xiao Wang, Longting Lv, Yi Xiao, Lei Wang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于大语言模型的安全预筛选流程,通过两种策略提升肝病临床试验的效率与精度。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11132 2026-07-15 cs.CV 版本更新 67%

From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering

从回顾到前瞻:面向知识驱动视觉问答的自我鼓励回顾蒸馏

Yu Zhao, Ying Zhang, Xuhui Sui, Baohang Zhou, Xinying Qian, Li Shen, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出HinD框架,通过知识鼓励偏好优化提升多模态大语言模型的知识推理能力,实验表明其在OK-VQA和A-OKVQA上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05139 2026-07-07 cs.SE 新提交 67%

On the risk of coding before testing: An empirical study on LLM-based test generation workflow

关于测试前编码风险:基于大语言模型的测试生成工作流程的实证研究

Michael Konstantinou, Florian Tambon, Mike Papadakis

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 研究大语言模型在软件工程工作流程中生成代码和测试套件时,生成的代码是否会使后续测试产生偏差,通过实证研究错误传播现象,评估其在多种编程任务和工作流程中的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00920 2026-07-03 cs.CV 新提交 67%

GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images

GMO-E$^2$DIT:面向电商图像的接地多操作编辑

Zipeng Guo, Xiaoan Liu, Lichen Ma, Cheng Wang, Yu He, Xiaolong Fu, Jingling Fu, Xinyuan Shan, Shaojie Guo, Luohang Liu, Junshi Huang, Yan Li

机构 * Wuhan University(武汉大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract)

AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22897 2026-07-03 cs.AI cs.CL cs.CV cs.LG cs.MM 版本更新 67%

OmniGAIA: Towards Native Omni-Modal AI Agents

OmniGAIA:迈向原生全模态AI代理

Xiaoxi Li, Wenxiang Jiao, Jiarui Jin, Haoxuan Li, Hao Wang, Shijian Wang, Guanting Dong, Jiajie Jin, Yinuo Wang, Yuan Lu, Ji-Rong Wen, Zhicheng Dou, Zhouchen Lin

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) Peking University(北京大学) Southeast University(东南大学) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OmniGAIA基准和OmniAtlas代理,通过全模态事件图和后见引导树探索策略,实现跨视频、音频和图像的深度推理与工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12879 2026-06-23 cs.LG cs.AI cs.CL 版本更新 67%

Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition

通过可扩展归因图分解从十亿参数语言模型中提取分层稀疏电路

Mohammed Mudassir Uddin, Shahnawaz Alam, Mohammed Kaif Pasha

机构 * Department of CSE, Muffakham Jah College of Engineering and Technology (MJCET)(计算机科学与工程系,穆法卡姆·贾赫工程与技术学院(MJCET))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出分层归因图分解(HAGD)方法,通过跨层编码器训练、谱粗化、GNN引导分层遍历和因果干预验证,将电路提取复杂度降至O(n² log n),在多个大模型上实现高行为保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05404 2026-06-05 cs.AI cs.CL cs.LG 67%

Harnessing Generalist Agents for Contextualized Time Series

利用通用智能体进行情境化时间序列分析

Zihao Li, Kaifeng Jin, Yuanchen Bei, Jiaru Zou, Avaneesh Kumar, Xuying Ning, Yanjun Zhao, Mengting Ai, Baoyu Jing, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TimeClaw框架,通过集成可执行时间工具、经验驱动能力进化和情景多模态记忆,使通用大语言模型智能体具备情境化时间推理能力,在能源、金融等多领域基准上取得性能提升。

Comments Preprint. 38 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29076 2026-06-04 cs.CL cs.AI cs.LG 67%

Structured Prompt Optimization Meets Reinforcement Learning for Global and Local Interpretability over Complex Text

结构化提示优化结合强化学习实现复杂文本的全局与局部可解释性

Tianyang Zhou, Wenbo Chen, Pierre Jinghong Liang, Leman Akoglu

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出eXTC框架,通过结构化提示优化、基于SOP的推理蒸馏和强化学习扩展,在分类性能和解释质量上显著优于现有范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05249 2026-06-03 cs.IR 67%

TriAlignGR: Triangular Multitask Alignment with Multimodal Deep Interest Mining for Generative Recommendation

TriAlignGR:面向生成式推荐的多模态深度兴趣挖掘与三角多任务对齐

Yangchen Zeng, Hao Peng, Rongfeng Guo, Zhenyu Yu, Zhiyuan Hu, Jinze Wang

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出TriAlignGR统一多任务多模态框架,通过两阶段语义传播和三角多任务对齐,解决语义ID中的内容退化与语义不透明问题,实现生成式推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19673 2026-06-01 cs.LG cs.AI cs.CL 67%

Bottom-up Policy Optimization: Your Language Model Policy Secretly Contains Internal Policies

自底向上策略优化:你的语言模型策略内部隐藏着内部策略

Yuqiao Tan, Minzheng Wang, Shizhu He, Huanxuan Liao, Chengfeng Zhao, Qiunan Lu, Tian Liang, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tencent AI Lab(腾讯AI实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分解Transformer残差流中的内部层策略和内部模块策略,提出自底向上策略优化(BuPO)方法,通过早期优化内部层来重建LLM的推理基础,在复杂推理基准上验证了有效性。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/BuPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14928 2026-06-01 cs.LG cs.AI cs.CL cs.SI 67%

Graph Machine Learning in the Era of Large Language Models (LLMs)

大语言模型时代的图机器学习

Shijie Wang, Jiani Huang, Zhikai Chen, Yu Song, Wenzhuo Tang, Haitao Mao, Wenqi Fan, Hui Liu, Xiaorui Liu, Dawei Yin, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Michigan State University(密歇根州立大学) North Carolina State University(北卡罗来纳州立大学) Baidu Inc(百度公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了大语言模型如何增强图机器学习的泛化、迁移和少样本学习能力,以及图如何提升大语言模型的推理和可解释性。

Comments Accepted by TIST

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23959 2026-05-28 cs.CL cs.AI cs.LG 67%

HGMEM: Hypergraph-based Working Memory to Improve Multi-step RAG for Long-Context Complex Relational Modeling

HGMem:基于超图的工作记忆以改进长上下文复杂关系建模的多步RAG

Chulun Zhou, Chunkang Zhang, Guoxin Yu, Fandong Meng, Jie Zhou, Wai Lam, Mo Yu

机构 * The Chinese University of Hong Kong.(香港中文大学) Pengcheng Laboratory.(鹏城实验室) WeChat AI, Tencent(微信AI,腾讯) University of Chinese Academy of Sciences.(中国科学院大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HGMem超图工作记忆系统,通过超边表示记忆单元并渐进形成高阶交互,增强多步RAG中的全局理解和复杂推理能力。

Comments ICML 2026; Code released at https://github.com/Encyclomen/HGMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08558 2026-05-26 cs.AI cs.CL cs.IR cs.LG 67%

Agent Learning via Early Experience

通过早期经验进行智能体学习

Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, Zhihan Liu, Xiyao Wang, Yuting Ning, Zhaorun Chen, Xiaohan Fu, Jian Xie, Yuxuan Sun, Boyu Gou, Qi Qi, Zihang Meng, Jianwei Yang, Ning Zhang, Xian Li, Ashish Shah, Dat Huynh, Hengduo Li, Zi Yang, Sara Cao, Lawrence Jang, Shuyan Zhou, Jiacheng Zhu, Huan Sun, Jason Weston, Yu Su, Yifan Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) FAIR at Meta(Meta的FAIR部门) The Ohio State University(俄亥俄州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出早期经验范式,利用智能体自身动作生成的交互数据(无需奖励信号)通过隐式世界建模和自我反思两种策略提升智能体在多样化环境中的效果和跨域泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22902 2026-05-25 cs.LG cs.AI cs.CL 67%

Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models

Transcoders 追踪视觉语言模型中的视觉基础与幻觉

Dimitrios Damianos, Leon Voukoutis, Georgios Skyrianos, Vassilis Katsouros, Georgios Paraskevopoulos

机构 * Institute of Language and Speech Processing(语言与语音处理研究所) Athena Research Center(雅典研究中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 采用基于Transcoders的功能中心框架分解视觉语言模型的计算路径,揭示视觉输入如何影响文本生成,并通过反事实分析和图结构特征预测幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07721 2026-05-20 cs.CL cs.AI cs.LG 67%

Memory-Efficient Looped Transformer: Decoupling Compute from Memory in Looped Language Models

内存高效的循环变换器:在循环语言模型中解耦计算与内存

Victor Conchello Vendrell, Arnau Padres Masdemont, Niccolò Grillo, Jordi Ros-Giralt, Arash Behboodi, Fabio Valerio Massoli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种内存高效的循环变换器(MELT),通过解耦推理深度与内存消耗,实现了常数内存的迭代推理,同时保持了LoopLM的性能,仅需轻量级的后训练过程。

Comments 22 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24701 2026-05-19 cs.CL cs.AI cs.IR cs.LG cs.MA 67%

Tongyi DeepResearch Technical Report

通义深研技术报告

Tongyi DeepResearch Team, Baixuan Li, Bo Zhang, Dingchu Zhang, Fei Huang, Guangyu Li, Guoxin Chen, Huifeng Yin, Jialong Wu, Jingren Zhou, Kuan Li, Liangcai Su, Litu Ou, Liwen Zhang, Pengjun Xie, Rui Ye, Wenbiao Yin, Xinmiao Yu, Xinyu Wang, Xixi Wu, Xuanzhong Chen, Yida Zhao, Zhen Zhang, Zhengwei Tao, Zhongwang Zhang, Zile Qiao, Chenxi Wang, Donglei Yu, Gang Fu, Haiyang Shen, Jiayin Yang, Jun Lin, Junkai Zhang, Kui Zeng, Li Yang, Hailong Yin, Maojia Song, Ming Yan, Minpeng Liao, Peng Xia, Qian Xiao, Rui Min, Ruixue Ding, Runnan Fang, Shaowei Chen, Shen Huang, Shihang Wang, Shihao Cai, Weizhou Shen, Xiaobin Wang, Xin Guan, Xinyu Geng, Yingcheng Shi, Yuning Wu, Zhuo Chen, Zijian Li, Yong Jiang

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文介绍了一种专为长时间深度信息检索任务设计的代理大语言模型,通过端到端训练框架结合代理中期和后期训练,实现了在复杂任务中的可扩展推理和信息检索,同时提供了高可扩展的数据合成管道,实现了无需昂贵人工标注的自动化训练流程,并在多个深度研究基准测试中取得了最先进的性能。

Comments https://tongyi-agent.github.io/blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16790 2026-05-19 cs.LG cs.AI cs.CL 67%

TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition

TIER: 用于多步工具组合的轨迹不变执行奖励

Anay Kulkarni, ChiaEn Lu, Dheeraj Mekala, Jayanth Srinivasa, Gaowen Liu, Jingbo Shang

机构 * UC San Diego(加州大学圣迭戈分校) Cisco Research(思科研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TIER,一种基于函数模式和运行时执行的奖励框架,能够提供密集且可解释的序列级反馈,支持多种解决方案策略并适应变化的工具接口,在DepthBench等基准上实现了高准确率。

Comments Preprint. Submitted to NeurIPS 2026. 28 pages, 7 figures, 8 tables. Code and datasets available at https://github.com/anaykulkarni/TIER

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14389 2026-05-15 cs.AI cs.CL cs.LG 67%

Nexus : An Agentic Framework for Time Series Forecasting

Nexus:一个用于时间序列预测的代理框架

Sarkar Snigdha Sarathi Das, Palash Goyal, Mihir Parmar, Nanyun Peng, Vishy Tirumalashetty, Chun-Liang Li, Rui Zhang, Jinsung Yoon, Tomas Pfister

机构 * Google(谷歌) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Nexus框架通过分解预测任务,整合上下文信息,提升时间序列预测的准确性与可解释性,超越传统模型和LLM的局限。

Comments 30 Pages, 3 figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13484 2026-05-12 cs.CV cs.CY 67%

MINGLE: VLMs for Semantically Complex Region Detection in Urban Scenes

MINGLE:用于城市场景中语义复杂区域检测的视觉语言模型

Liu Liu, Alexandra Kudaeva, Marco Cipriano, Fatimeh Al Ghannam, Freya Tan, Gerard de Melo, Andres Sevtsuk

机构 * Massachusetts Institute of Technology(麻省理工学院) Hasso Plattner Institute(于尔克·平特纳研究所)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract)

AI总结 本文提出MINGLE模型,通过整合人类检测、视觉语言推理和轻量级空间聚合算法,实现城市场景中社交群体区域的检测,贡献包括新数据集和语义丰富的标注方法。

Comments 13 pages, 4 figures Updated with the camera-ready version after acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25203 2026-04-29 cs.CL cs.AI cs.LG 67%

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

BARRED: 通过不对称辩论合成定制策略的守卫规则

Arnon Mazza, Elad Levi

机构 * Plurai Inc.(Plurai公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BARRED通过不对称辩论生成合成训练数据,提升定制策略的安全性与效率,实验表明其优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22452 2026-04-27 cs.AI cs.CL cs.LG 67%

Superminds Test: Actively Evaluating Collective Intelligence of Agent Society via Probing Agents

超级心智测试:通过探测代理主动评估代理社会的集体智慧

Xirui Li, Ming Li, Yunze Xiao, Ryan Wong, Dianqi Li, Timothy Baldwin, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过Superminds测试评估代理社会的集体智慧,发现规模扩大并未带来集体智慧,交互浅显是主要限制因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22061 2026-04-27 cs.CL cs.AI cs.LG 67%

Lightweight Retrieval-Augmented Generation and Large Language Model-Based Modeling for Scalable Patient-Trial Matching

轻量级检索增强生成与基于大语言模型的建模用于可扩展的患者试验匹配

Xiaodi Li, Yang Xiao, Munhwan Lee, Konstantinos Leventakos, Young J. Juhn, David Jones, Terence T. Sio, Wei Liu, Maria Vassilaki, Nansu Zong

机构 * Department of Artificial Intelligence and Informatics, Mayo Clinic(人工智能与信息学系,梅奥诊所) Computer Science Department, University of Tulsa(图兰大学计算机科学系) Mayo Clinic Comprehensive Cancer Center, Mayo Clinic(梅奥诊所综合癌症中心,梅奥诊所) Division of Community Pediatric and Adolescent Medicine, Department of Pediatrics, Mayo Clinic(社区儿科与青少年医学分会,儿科部,梅奥诊所) Department of Neurology, Mayo Clinic(神经病学部,梅奥诊所) Department of Radiation Oncology, Mayo Clinic(放射肿瘤学部,梅奥诊所) Department of Quantitative Health Sciences, Mayo Clinic(定量健康科学部,梅奥诊所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出轻量级框架,结合检索增强生成和大语言模型建模,解决患者试验匹配中长异构电子健康记录和复杂资格标准的可扩展性、泛化性和计算效率问题。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18296 2026-04-22 cs.CL cs.AI cs.LG 67%

Temp-R1: A Unified Autonomous Agent for Complex Temporal KGQA via Reverse Curriculum Reinforcement Learning

Temp-R1:通过反向课程强化学习实现复杂时间知识图谱问答的统一自主代理

Zhaoyan Gong, Zhiqiang Liu, Songze Li, Xiaoke Guo, Yuanxiang Liu, Xinle Deng, Zhizhen Liu, Lei Liang, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Temp-R1,首个通过强化学习训练的时间知识图谱问答自主代理,通过扩展动作空间和反向课程学习提升复杂问题的推理能力,在MultiTQ和TimelineKGQA上取得最佳性能。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21623 2026-04-20 cs.CL cs.AI cs.LG 67%

OjaKV: Context-Aware Online Low-Rank KV Cache Compression

OjaKV: 基于上下文的在线低秩KV缓存压缩

Yuxuan Zhu, David H. Yang, Mohammad Mohammadi Amiri, Keerthiram Murugesan, Tejaswini Pedapati, Pin-Yu Chen

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OjaKV通过结合战略混合存储策略与在线子空间适应,实现KV缓存压缩,提升长上下文推理效率,无需微调模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19807 2026-04-17 cs.AI cs.CL cs.CV cs.LG cs.MA 67%

KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality

KnowRL: 探索知识增强型强化学习以提升事实性

Baochang Ren, Shuofei Qiao, Da Zheng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KnowRL通过整合事实性奖励提升慢思考模型的事实准确性,实验表明其有效缓解了幻觉问题并保持推理能力。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14142 2026-04-16 cs.LG cs.AI cs.CL 67%

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space

从P(y|x)到P(y):在预训练空间中研究强化学习

Yuqiao Tan, Minzheng Wang, Bo Liu, Zichen Liu, Tian Liang, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tencent AI Lab(腾讯AI实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PreRL和DSRL方法,通过优化预训练空间中的边际分布P(y),提升LLM推理能力,并通过NSR机制增强推理效果,实验表明DSRL在推理任务中表现优异。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/Pretrain_Space_RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08708 2026-04-13 cs.LG cs.AI cs.CL 67%

Every Response Counts: Quantifying Uncertainty of LLM-based Multi-Agent Systems through Tensor Decomposition

每种回应都重要:通过张量分解量化基于大语言模型的多智能体系统不确定性

Tiejin Chen, Huaiyuan Yao, Jia Chen, Evangelos E. Papalexakis, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of California, Riverside(加利福尼亚大学河滨分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MATU框架,通过张量分解量化多智能体系统中的不确定性,解决多步推理、通信路径变化和拓扑多样性等挑战,提供通用可靠性评估。

Comments Accept to ACL 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05484 2026-04-08 cs.RO cs.CV 67%

CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment

CoEnv:通过组合环境驱动具身体验多智能体协作

Li Kang, Yutao Fan, Rui Li, Heng Zhou, Yiran Qin, Zhemeng Zhang, Songtao Huang, Xiufeng Song, Zaibin Zhang, Bruno N. Y. Chen, Zhenfei Yin, Dongzhan Zhou, Wangmeng Zuo, Lei Bai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学) CUHK-Shenzhen(香港中文大学(深圳)) Fudan University(复旦大学) Dalian University of Technology(大连理工大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract)

AI总结 本文提出CoEnv框架,通过模拟与现实结合的组合环境,实现多智能体协作的高效执行与安全部署,提升任务成功率和效率。

Comments 31 pages, 8 figures, including supplementary material. Project page: https://faceong.github.io/CoEnv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23752 2026-04-03 cs.CV 67%

ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks

ThinkGeo: 评估用于遥感任务的工具增强代理

Akashah Shabbir, Muhammad Akhtar Munir, Akshay Dudhane, Muhammad Umer Sheikh, Muhammad Haris Khan, Paolo Fraccaro, Juan Bernabe Moreno, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) IBM Research(IBM研究院) Linköping University(林雪平大学) Australian National University(澳大利亚国立大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract)

AI总结 ThinkGeo是一个针对遥感任务设计的代理基准,评估LLM驱动代理在结构化工具使用和多步骤规划中的能力,通过人类 curated 查询和专家验证的推理步骤测试不同模型的工具准确性和规划一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏