arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4066 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 880 篇

2607.04610 2026-07-07 cs.RO 新提交 67%

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications

RoboVista:评估用于各种机器人应用的视觉语言模型

Shuangyu Xie, Kaiyuan Chen, Ziyang Chen, Simeon Adebola, Yixuan Huang, Zehan Ma, Tianshuang Qiu, Wentao Yuan, Dhruv Shah, Pannag R. Sanketi, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 研究针对机器人多样应用,提出模块化评估框架Robot Question Answering及基准RoboVista,其源于真实机器人系统等,含多任务类型VQA实例,实验表明现有视觉语言模型有差距,且与现实任务执行相关。

Comments Accepted to RSS 2026. Project website: https://berkeleyautomation.github.io/robovista/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01972 2026-07-03 cs.CL cs.AI cs.LG 新提交 67%

Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization

Object Aligner: 一种可配置的图结构JSON模式相似度评分,应用于LLM提示优化

Jan Drchal

机构 * Artificial Intelligence Center, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院人工智能中心)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Object Aligner,一种基于递归树对齐和引用对齐的JSON相似度评分方法,通过Weisfeiler-Leman颜色细化近似图同构,用于LLM输出评估和提示优化。

Comments 28 pages, This is a submitted version of a manuscript under review at IEEE Access; it has not been peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00537 2026-07-02 eess.SP 新提交 67%

B2X Networks: Joint Design of Communication and Control for Embodied Intelligence

B2X网络:具身智能的通信与控制联合设计

Yuanwei Liu, Xu Gan, Zhaolin Wang, Chongjun Ouyang, Hao Jiang, Zongyao Zhao, Kaibin Huang, Robert Schober

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出脑-体-万物(B2X)网络概念,通过分布式与集中式脑架构,重新设计上下行通信以平衡传输性能与控制质量,实现无线网络与具身智能的融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31543 2026-07-01 cs.AI cs.CL cs.LG 新提交 67%

Modality-Driven Search with Holistic Trace Judging for ARC-AGI-2

基于模态驱动与整体轨迹判断的ARC-AGI-2求解方法

Johan Land

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对抽象推理中候选轨迹选择难题,提出模态驱动搜索生成多样化候选,并结合整体判断模型在长上下文中联合比较所有轨迹,在ARC-AGI-2上以低成本达到72.9%准确率,超越前沿模型。

Comments 37 pages, 4 figures; source code available at AGI" target="_blank" rel="noopener">https://github.com/beetree/ARC-AGI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31504 2026-07-01 cs.CV 新提交 67%

SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search

SimpleSearch-VL:多模态智能深度搜索的简单配方

Ming Dai, Zhihong Lu, Jinjie Gu, Jiedong Zhuang, Yefeng Liu, Wankou Yang, Jian Wang, Chunhua Shen

机构 * Southeast University(东南大学) Ant Group(蚂蚁集团)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出SimpleSearch-VL框架,通过因子化自适应展开和证据验证推理提升多模态智能搜索的效率与可靠性,仅用少量数据即显著超越基线。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20625 2026-06-23 cs.AI cs.CL cs.LG 新提交 67%

AlphaMemo: Structured Search-Process Memory for Self-Evolving Alpha Mining Agents

AlphaMemo: 用于自我进化的Alpha挖掘智能体的结构化搜索过程记忆

Hang Yu, Zifan Zheng, Jeff Z. Pan, Tongliang Liu, Zhiyong Wang, Fengxiang He

机构 * University of Sydney(悉尼大学) University of Edinburgh(爱丁堡大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AlphaMemo,一种具有结构化搜索过程记忆的自我进化Alpha挖掘智能体,通过记录编辑模式在特定父因子上下文中的成败证据,结合置信门控残差记忆和非对称否决控制,提升样本外表现和固定预算发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13672 2026-06-18 cs.RO 新提交 67%

WEAVER, Better, Faster, Longer: An Effective World Model for Robotic Manipulation

$\texttt{WEAVER}$:更好、更快、更长——一种有效的机器人操作世界模型

Arnav Kumar Jain, Yilin Wu, Jesse Farebrother, Gokul Swamy, Andrea Bajcsy

机构 * Mila - Québec AI Institute(Mila - 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Carnegie Mellon University(卡内基梅隆大学) McGill University(麦吉尔大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出WEAVER世界模型架构,通过流匹配损失训练多视图潜在预测,同时实现高保真度、长程一致性和高效推理,在机器人操作任务中显著提升策略评估、改进和测试时规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18242 2026-06-17 cs.CV 新提交 67%

EventDrive: Event Cameras for Vision-Language Driving Intelligence

EventDrive: 用于视觉-语言驾驶智能的事件相机

Dongyue Lu, Rong Li, Ao Liang, Lingdong Kong, Wei Yin, Lai Xing Ng, Benoit R. Cottereau, Camille Simon Chane, Wei Tsang Ooi

机构 * NUS(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) Horizon Robotics(地平线机器人) A*STAR, I2R(新加坡科技研究局,资讯通信研究院) IPAL, CNRS IRL 2955, Singapore(IPAL,法国国家科学研究中心国际联合实验室2955,新加坡) University Toulouse, CNRS, CerCo, Toulouse, France(图卢兹大学,法国国家科学研究中心,CerCo,法国图卢兹) ETIS UMR 8051, CY Cergy Paris University, ENSEA, CNRS, France(ETIS UMR 8051,CY塞尔吉-巴黎大学,ENSEA,法国国家科学研究中心,法国)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出EventDrive基准和模型套件,通过多时域事件金字塔和时域混合专家模块融合事件流与RGB帧,在感知、理解、预测和规划四维度提升驾驶推理性能。

Comments CVPR2026, 34 pages, 15 figures, 15 tables, project page: https://dylanorange.github.io/projects/eventdrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14989 2026-06-16 cs.MA 新提交 67%

Hierarchical Generative Agents for Simulating Sequential Human Behavior

用于模拟序列人类行为的层次化生成式智能体

Maria G. Mendoza, Lucas Waldburger, Jin Lee, Shankar Sastry

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出基于认知层次和人格驱动的生成式智能体框架,结合大语言模型和人类疏散数据,模拟灾害中序列决策行为。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13497 2026-06-12 cs.RO cs.CV 新提交 67%

SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale

SPARC:来自机器人演示的可靠空间标注

Nils Blank, Paul Mattes, Maximilian Xiling Li, Jakub Suliga, Thomas Roth, Moritz Reuss, Pankhuri Vanjani, Rudolf Lioutikov

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) NVIDIA(英伟达) Robotics Institute Germany(德国机器人研究所)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出SPARC框架,利用机器人任务的时空结构生成可靠性评分,自动标注演示中的空间信息,减少噪声标签并保留更多有用样本,在物体定位基准上优于纯检测基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13049 2026-06-12 cs.RO 新提交 67%

Y-BotFrame: An Extensible Embodied Agent Framework for Quadruped Robot Assistants

Y-BotFrame:一种用于四足机器人助手的可扩展具身智能体框架

Luyao Zhang, Ke Li, Yuan Ding, Xulong Zhao, Guo Yu, Chengwei Yan, Fuyu Dong, Jiawei Hu, Di Wang, Nan Luo, Gang Liu, Quan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出Y-BotFrame框架,集成多模态感知与大语言模型认知核心,将自然语言指令映射为可执行任务单元,实现无遥控器的人机协作,支持模块化扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11119 2026-06-10 cs.LG cs.AI cs.CL 新提交 67%

TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning

TRACE:一种用于高效智能体强化学习的统一展开预算分配框架

Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai, Yixiu Mao, Ru Peng, Xin Xu, Weijie Liu, Kai Yang, Saiyong Yang, Xiangyang Ji

机构 * Tsinghua University(清华大学) Tencent(腾讯)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对多轮智能体强化学习中奖励对比度不足的问题,提出TRACE框架,通过将每个ReAct式思考-行动-观察步骤建模为语义节点,在固定采样预算内将预算分配到提示根和中间前缀,增强奖励对比,提升策略更新信号。

Comments 32 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10651 2026-06-10 cs.CV 新提交 67%

Kwai Keye-VL-2.0 Technical Report

Kwai Keye-VL-2.0 技术报告

Kwai Keye Team, Bin Wen, Changyi Liu, Chengru Song, Chongling Rao, Guowang Zhang, Han Li, Haonan Fan, Hengrui Ju, Jiankang Chen, Jiapeng Chen, Jiawei Yuan, Kaixuan Yang, Kaiyu Jiang, Kun Gai, Lingzhi Zhou, Na Nie, Sen Na, Tianke Zhang, Tingting Gao, Xuanyu Zheng, Yulong Chen, Fan Yang, Haixuan Gao, Lele Yang, Mingqiao Liu, Muxi Diao, Qi Zhang, Qile Su, Wei Chen, Wentao Hong, Xingyu Lu, Yancheng Long, Yankai Yang, Yingxin Li, Yiyang Fan, Yu Xia, Yuzhe Chen, Ziliang Lai, Chuan Yi, Haonan Jia, Tianming Liang, Weixin Xu, Xiaoxiao Ma, Yang Tian, Yufei Han, Feng Han, Hang Li, Jing Wang, Jinghui Jia, Junmin Chen, Junyu Shi, Ruilin Zhang

机构 * Kuaishou Group(快手集团)

专题命中 规划推理 :reasoning(abstract);self-correction(abstract)

AI总结 提出开源MoE多模态基础模型Keye-VL-2.0,首次将DeepSeek稀疏注意力适配到GQA架构,支持无损256K上下文处理,并通过跨模态多教师策略蒸馏和上下文/视频强化学习解决多任务对齐中的灾难性遗忘,在长视频理解和智能体任务上达到同类最优。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07831 2026-06-09 cs.SE 新提交 67%

SLRMentor: An LLM-Based Tool Supporting Learning of SLR in Software Engineering

SLRMentor:一种基于LLM的软件工程系统文献综述学习支持工具

Rodolfo Gil-Pereira, Ronnie de Souza Santos, Cleyton Magalahes, Italo Santos

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出SLRMentor对话助手,利用LLM支持软件工程中系统文献综述的学习与规划,通过引导搜索字符串构建和纳入排除标准推理,降低新手入门门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07723 2026-06-09 cs.RO 新提交 67%

VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation

VoLo: 面向开放词汇长时程操控的物理编排器

Siyi Chen, Hugo Hadfield, Alex Zook, Mikaela Angelina Uy, Chan Hee Song, Erwin Coumans, Xuning Yang, Faisal Ladhak, Qing Qu, Stan Birchfield, Jonathan Tremblay, Valts Blukis

机构 * NVIDIA(英伟达) University of Michigan(密歇根大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出VoLoAgent,利用VLM将VLA/WAM作为可中断工具进行物理编排,实现开放词汇长时程操控,并在新基准RoboVoLo上显著优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03426 2026-07-07 cs.LG cs.AI 新提交 66%

Amortising Bayesian Experimental Design for Sequential Information Gathering in LLMs

用于大语言模型中顺序信息收集的摊销贝叶斯实验设计

Jakob Hartmann, James Harvey, Jhonathan Navott, Erik Y. Wang, Luckeciano C. Melo, Flaviu Cipcigan, Cheng Zhang, Alessandro Abate

机构 * University of Oxford(牛津大学) Ellison Institute of Technology(埃里森理工学院)

专题命中 规划推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

AI总结 研究大语言模型在顺序决策中信息收集问题,提出摊销顺序信息收集方法,将贝叶斯实验设计融入模型策略,经实验验证该方法能有效提升成功率并降低推理成本。

Comments 20 pages, 7 figures. Accepted to FoGen 2026: Foundations of Deep Generative Models: Understanding Memorization, Generalization, and Reasoning, an ICML 2026 workshop (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16794 2026-08-18 cs.RO cs.AI cs.CL 新提交 62%

Neurosymbolic Embodied Agents

神经符号具身智能体

Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha

机构 * Imperial College London(帝国理工学院) Johns Hopkins University(约翰斯·霍普金斯大学) City, University of London(伦敦城市大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15459 2026-08-18 cs.LG cs.AI 新提交 62%

Not All Attention Is Equal: A Quantitative Survey of the EEI Trade-off

并非所有注意力都平等:EEI权衡的定量综述

Aditya Singh

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本综述围绕注意力机制的效率-表达性-可解释性权衡,定量对比21种方法,梳理其多领域发展脉络,分析研究缺口并指明未来方向,支持粗粒度层级对比。

Comments 53 pages, 8 figures, 16 tables. Code and analysis artifacts: https://github.com/Nixon-H/not-all-attention-is-equal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15424 2026-08-18 cs.MA cs.AI cs.LG 新提交 62%

ETHOS: Towards a Modular Ethics Framework for Clinical Multi-Agent Systems

ETHOS:面向临床多智能体系统的模块化伦理框架

Rakesh Sharma, Sydney Pugh, Cameron Beeche, Pankhuri Singhal, Rachel Wu, Margaret Eby, Jeffrey Duda, James Gee, Kyra O'Brien, Hersh Sagreiya, Marina Serper, Victoria Gershuni, Angela Bradbury, Anurag Verma, Eric Eaton, Kevin B. Johnson, Walter Witschey

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ETHOS是可与现有临床多智能体系统集成的模块化伦理框架,通过分层治理提升决策可靠性,将AI伦理原则转化为可部署的安全保障。

Comments Preprint of an article submitted for consideration in Pacific Symposium on Biocomputing \textcopyright\ 2027 World Scientific Publishing Company. \url{https://psb.stanford.edu/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14660 2026-08-18 cs.LG cs.AI cs.CY 新提交 62%

Ring-based Spatial Transformer: Learning Non-linear Spatial Interactions between Building Distribution and Pedestrian Flow

基于环的空间Transformer:学习建筑分布与行人流量之间的非线性空间相互作用

Shun Nakayama, Takahiro Kanamori, Wanglin Yan

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出基于环的SpatialTransformer模型,利用东京100个火车站的环缓冲区数据学习建筑分布与行人流量的非线性空间相互作用,其预测准确率优于GWR,挑战了紧凑城市假设,为城市规划提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12336 2026-08-14 cs.CL cs.AI 新提交 62%

StorySpark: Module-wise Evolutionary Search for Story Premise Generation

StorySpark:面向故事前提生成的模块级进化搜索

Yang Yang, Zining Zhong, Qian Cao, Jindong Li, Boyun Xu, Kaishen Yuan, Menglin Yang, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) Shandong University(山东大学) Institute of Deep Perception Technology, JITRI(JITRI深度感知技术研究院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM故事生成中前提构思不足的问题,提出StorySpark模块级进化搜索框架,通过优化叙事模块生成更优质的故事前提,提升下游故事质量与创意性。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12062 2026-08-13 cs.CL cs.AI 新提交 62%

Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations

偏好树优化:通过前瞻模拟增强面向目标的对话

Lior Baruch, Moshe Butman, Kfir Bar, Doron Friedman

机构 * Reichman University(赖希曼大学) School of Computer Science(计算机科学学院) School of Communications(传播学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。

Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11361 2026-08-13 cs.LG cs.CL cs.PF 新提交 62%

Lifecycle-Optimal Tokenization: Vocabulary Size as a Deployment-Regime-Dependent Infrastructure Parameter

生命周期最优分词:词汇表大小作为与部署 regime 相关的基础设施参数

Rima Mittal, Ankit Gubrani, Satyanarayana Kakollu

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现 LLM 分词器的最优词汇表大小随部署 regime 变化,提出生命周期部署成本模型,经实验证实其与训练最优值差异最高达 16 倍,且最优范围内质量损失极小,为 LLM 部署提供词汇表容量规划指导。

Comments 6 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10692 2026-08-12 cs.CL cs.AI 新提交 62%

SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information

SPIEval:评估大型语言模型作为处理分散个人信息的移动助手的能力

Junjie Ye, Zhuohui Sheng, Shaofan Liu, Yulun Zhu, Wenjie Fu, Dingwei Zhu, Ming Zhang, Yujiong Shen, Weichao Wang, Xin Zhao, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang, Pluto Zhou

机构 * Fudan University(复旦大学) Tencent Hunyuan Team(腾讯混元团队)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出基于五种认知能力的人工策划基准SPIEval,评估9种LLMs作为移动助手处理分散个人信息的能力,发现其准确率最高仅57.3%,存在信息定位等显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10337 2026-08-12 cs.HC cs.AI cs.CL 新提交 62%

Narrative Keyframing for Generative Creative Writing

用于生成式创意写作的叙事关键帧技术

Chao Zhang, Abe Davis

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出叙事关键帧技术,作为AI辅助创意写作的交互方法,通过三种关键帧类型实现对生成文本的精细控制,经用户研究验证其可控性、透明性与趣味性更优。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09019 2026-08-11 cs.HC cs.AI cs.CL cs.CY cs.SI 新提交 62%

How People Evaluate AI-, Expert-, and Peer-Style Financial Advice

人们如何评估AI风格、专家风格和同行风格的金融建议

Aryan Ramchandra Kapadia, Eshwar Chandrasekharan, Koustuv Saha

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过实验对比AI、专家、同行风格金融建议的评估差异,发现归属标注与沟通线索共同影响评估,错误标注会提升AI建议评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08878 2026-08-11 cs.LG cs.AI cs.PF 新提交 62%

DistillCache: KL-Guided Adaptive KV-Cache Eviction for Memory-Efficient LLM Inference

DistillCache:基于KL引导的自适应KV缓存驱逐的内存高效大语言模型推理

Asaad Althoubi

机构 * Oklahoma State University(俄克拉荷马州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DistillCache是一种强化学习框架,将KV缓存驱逐建模为序列决策问题,在25%缓存预算下,在LongBench上保留全缓存94.2%的准确率,优于多种基线方法,可提升推理吞吐量。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08459 2026-08-11 cs.CL cs.AI cs.DB 新提交 62%

Beyond Tables: Doc2DB-Bench for Relationally Faithful Document-to-Database Construction

超越表格:用于关系忠实的文档到数据库构建的Doc2DB-Bench

Zhuowen Liang, Zhengxuan Zhang, Jiayang Wang, Jiazhuo Chen, Nan Tang

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有文档到表格基准无法适配关系数据库构建需求的问题,推出Doc2DB-Bench基准,含多领域长文档实例,为基于LLM的可靠数据系统提供测试平台。

Comments 24 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08236 2026-08-11 cs.AI cs.CL 新提交 62%

LatticeMind: A Conflict-Aware Memory Primitive for Multi-Agent Systems

LatticeMind:面向多智能体系统的冲突感知记忆原语

Heng Zhou, Lian Zhang, Yutao Fan, Tiancheng He, Siki Chen, Hejia Geng, Philip Torr, Zhenfei Yin

机构 * University of Science and Technology of China(中国科学技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai AI Laboratory(上海人工智能实验室) Beijing University of Posts and Telecommunications(北京邮电大学) University of Oxford(牛津大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出冲突感知记忆原语LatticeMind,解决多智能体LLM系统的主张信任决策问题,在ConflictBank评估中准确率达0.97,显著优于基线, ablation验证了其核心组件的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07688 2026-08-11 cs.AI cs.CL cs.CR cs.HC cs.MA 新提交 62%

IntelliAudit: Using Large Language Models to Evaluate Audit Controls

IntelliAudit:使用大语言模型评估审计控制

Allison Wilson, Sina Moradi Sabet, Diar Shakimov, Panteha Shahrivar, Mohammad Reza Bagheri, Dean Konenkamp, Mohammad A. Tayebi

机构 * Coca-Cola(可口可乐公司) Telus(德达斯电信公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于检索的多智能体系统IntelliAudit,用于辅助IT审计证据评估,在ISO/IEC 27001上的评估显示其可支持审计工作,需作为决策支持工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏