arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-14 至 2026-08-14 共收录 184 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 53 篇

2606.29395 2026-08-14 cs.CV 版本更新 78%

NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation

NaLA: 一种用于高质量3D场景生成的原生3D LLM布局代理

Cheng Wan, Yongsen Mao, Wenzheng Wu, Yuxuan Xie, Chucheng Xiang, Runze Wang, Xiang Zhang, Zhongyuan Liu, Rushi Dai, Yuan Liu

专题命中 规划决策 :agent(title,abstract)

AI总结 提出NaLA,一种原生3D LLM布局代理,通过直接编码3D边界和资产到LLM中,采用粗到细预测机制,解决文本-3D模态差距导致的布局不合理问题,在生成质量和推理效率上优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://adamcwan.github.io/NaLA/. Code: https://github.com/adamcwan/NaLA-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12877 2026-08-14 cs.AI 新提交 77%

ReflectFact: Self-Reflective Agents for Improving Comprehension and Reasoning in Multi-Hop Fact Verification

ReflectFact:用于提升多跳事实验证中理解与推理能力的自反思智能体

Runze Zhao, Zixin Tang, Xiaoshuai Hao, Leyuan Chang, Xiaopeng Fu, Boyu Qiao, Dongyang Zhang

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对多跳事实验证中智能体推理偏离目标及参数知识与证据冲突的问题,提出自反思智能体框架ReflectFact,经HOVER、EX-FEVER实验,性能优于最强基线。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19799 2026-08-14 cs.AI hep-lat 版本更新 77%

PhysMaster: Building an Autonomous AI Physicist for Theoretical and Computational Physics Research

PhysMaster:构建一个自主的AI物理学家用于理论和计算物理学研究

Tingjia Miao, Wenkai Jin, Jinxin Tan, Muhua Zhang, Xianghe Pang, Zexi Liu, Yuwen Du, Tian Jin, Tu Guo, Zhengliang Zhang, Jingkun Liu, Yuelin Hu, Jiejun Zhang, Yunjie Huang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Rui Ye, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) School of Physics and Astronomy(物理天文学院) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) Tsung-Dao Lee Institute(李政道研究所) Zhiyuan College(智源学院) Institute of Theoretical Physics(理论物理研究所) Chinese Academy of Sciences(中国科学院) DP Technology(DP技术)

专题命中 规划决策 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 PhysMaster通过结合抽象推理与数值计算,利用LANDAU数据宇宙提升决策可靠性,实现理论与计算物理学研究的自动化与自主发现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09408 2026-08-14 cs.IR 版本更新 75%

DREAM Technical Report

DREAM技术报告

Bin Zhang, Bowen Zheng, Chao Yi, Chengyu Lai, Dian Chen, Dimin Wang, Gaoyang Guo, Jialin Zhu, Jian Wu, Jing Yu, Jiuning Lin, Lingqing Zhang, Lingyun Zheng, Mao Zhang, Mingming Pan, Ruiquan Lan, Shuai Zhong, Wen Chen, Wendong Zhang, Xiaodong Zhu, Xuan Chen, Xunke Xi, Yifan Lu, Yiheng Wang, Yue Zeng, Yujie Luo, Yuning Jiang, Zhe Hu, Zhibo Xiao, Zihong Huang, Binbin Cao, Bo Zheng, Danning Wang, Dixuan Wang, Ge Fan, Haixia Wu, Han Zhu, Hao Fang, Haoming Chen, Huiping Chu, Jian Wang, Jianjun Wu, Jiawei Wu, Jiaxin Yu, Jingwen Liu, Jinzhe Shan, Kai Meng, Kai Zhang, Keqin Xu, Kewei Zhu, Lang Tian, Leihui Chen, Li Chen, Licheng Xu, Lide Xiao, Ruitong Zhang, Shiyao Peng, Silu Zhou, Tao Wang, Wei Shi, Wenjun Yang, Xiang Chen, Xiang Gao, Xiao Ren, Xu Liu, Xuwen Wang, Yang Li, Yeqiu Yang, Yi Hu, Yichen Yuan, Yinnan Song, Yipeng Yu, Yuan Liu, Yunqi Gao, Zhiliang Huang, Zhujin Gao, Zongyuan Wu

专题命中 规划决策 :agentic(abstract,abstract_cn);planning(abstract)

AI总结 该研究针对工业推荐流水线的缺陷,提出基于智能体方法的DREAM架构,通过意图引擎、元引擎与奖励双循环优化,在淘宝测试中实现多项核心指标提升,验证了智能体元控制的可行性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12915 2026-08-14 cs.DC cs.AI 新提交 74%

InFactPlanner: Planning Sustainable Geo-Distributed LLM Data Centers

InFactPlanner:可持续地理分布式大语言模型(LLM)数据中心规划

Nicoletta Tsiopani, Moysis Symeonides, George Pallis, Marios D. Dikaiakos

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 InFactPlanner是用于LLM推理的可持续地理分布式数据中心部署假设分析的决策支持框架,可通过多维度建模分析得出可持续性与延迟最优选择存在差异等结论。

Comments Author copy of paper published at 34th International Symposium on the Modeling, Analysis, and Simulation of Computer and Telecommunication System (MASCOTS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05033 2026-08-14 cs.DC cs.LG 版本更新 74%

SparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic System

SparseDitto:基于大语言模型的智能体系统,为不同稀疏性模式定制GPU内核

Shiyang Li, Guangyan Sun, Jinwei Tang, Yanzhi Wang, Mingyi Hong, Caiwen Ding

专题命中 规划决策 :agentic(title);分类 cs.LG

AI总结 SparseDitto是基于LLM的系统,可为不同矩阵、算子和GPU定制稀疏矩阵GPU内核,在多类算子与GPU上较cuSPARSE实现显著加速,还可提升GCN训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13331 2026-08-14 cs.LG cs.AI 新提交 73%

Training AI Scientists to Replicate Research

训练AI科学家以实现研究的可复现性

Damon Falck, Samer Sabri, Anja Surina, Thom Foster, Anya Sims, Sam Devlin, Dylan Rogers, Tantum Collins, Kaloyan Aleksiev, Louis Kirsch, Edward Hughes

机构 * Inherent(因赫伦特)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发了可扩展的论文复现任务空间Replica,后训练出270亿参数的AI科学家Faraday,其在复现任务上表现优于Claude Opus 4.8和GPT-5.5,为长期科学创新AI智能体奠定基础。

Comments 47 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13511 2026-08-14 cs.RO 新提交 71%

A Browser-Native Digital Test Range for Benchmarking 4D Ocean-Glider Planning Algorithms

用于基准测试4D水下滑翔机规划算法的浏览器原生数字测试场

Edward Holmberg, Elias Ioup, Mahdi Abdelguerfi

机构 * LSU(路易斯安那州立大学) U.S. Naval Research Lab(美国海军研究实验室)

专题命中 规划决策 :planning(title)

AI总结 本研究提出一种浏览器原生数字测试场,用于基准测试4D水下滑翔机规划算法,通过OSSE实验评估了五种经典规划器,为水下滑翔机预部署实验提供了可复现的科学追溯操作空间。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13463 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交 67%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 8 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12763 2026-08-14 cs.CE 新提交 67%

ARIES-Mission2: A Zero-Shot Vision-Language-Action Framework for Fast Large-Scale Aerial Mission Generation

ARIES-Mission2:用于快速大规模空中任务生成的零样本视觉-语言-动作框架

Junhao Wei, Yanxiao Li, Haochen Li, Yifu Zhao, Dexing Yao, Baili Lu, Zikun Li, Yapeng Wang, Sio-Kei Im, Dingcheng Yang, Xu Yang

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 ARIES-Mission2是解耦视觉语义感知与路径优化的零样本VLA框架,在UAV基准上,其飞行距离更短、任务生成速度更快,且TSP模块可扩展性佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00570 2026-08-14 cs.NI 67%

Beyond Per-Request QoS: Coordinating Industrial Workflows with B5G/6G Network Capabilities

超越每请求服务质量:协调工业工作流与B5G/6G网络能力

Qize Guo, Bjoern Riemer, Tarik Taleb, Yan Chen, Hao Yu, Hemant Zope

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 本文提出一种能力感知协调框架,通过网络可持续支持的QoS配置与工业工作流相映射,提升服务连续性和负载下工作流完成率。

Comments 7 pagers, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20936 2026-08-14 physics.soc-ph nlin.AO 版本更新 67%

Empathy Modeling in Active Inference Agents for Perspective-Taking and Alignment

主动推断代理中的共情建模:用于视角转换与对齐

Mahault Albarracin, Hongju Pae, Philip Wilson, Anna Mikeda, Alejandro Jimenez-Rodriguez, Sanjeev V. Namjoshi, Harshil Shah

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 该研究提出了一种基于主动推断的共情框架,通过视角转换实现稳定合作,揭示了共情结构对社会协调的关键作用。

Comments Code and data: https://doi.org/10.5281/zenodo.21908008

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12626 2026-08-14 cs.CL cs.AI cs.MA 新提交 66%

LLMs Are Not Good Strategists, Yet Memory-Enhanced Agency Boosts Reasoning

大型语言模型(LLMs)并非优秀的战略家,然而记忆增强的智能体可提升推理能力

Yi Wu, Zhimin Hu

机构 * University of Chicago(芝加哥大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL;planning(journal_ref)

AI总结 该研究针对LLM在长时环境中战略推理的缺陷,提出EpicStar框架,结合跨回合记忆与动态门控机制,在星际争霸II测试中实现更高胜率且令牌消耗大幅减少。

Journal ref Published at Reasoning and Planning for LLMs at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12959 2026-08-14 cs.LG cs.AI 新提交 62%

The Objective Is the Bottleneck: Latent World Models Encode What Their Planners Cannot Use

目标是瓶颈:潜在世界模型编码了其规划器无法使用的内容

Joyjeet Singh

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现潜在世界模型的规划瓶颈在于规划器目标而非预测器,通过替换目标无需额外训练即可大幅提升长视野规划性能,揭示模型编码了规划器未利用的可达性信息。

Comments Follow-up to arXiv:2608.10145. All experiments run on a laptop CPU; no model was trained or fine-tuned. Code, checkpoints and every measurement: github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12627 2026-08-14 cs.CV cs.AI cs.CL cs.HC 新提交 62%

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

EgoCITE:面向长时程自我中心记忆的上下文增强索引与时序感知检索

Le Zhang, Ke Sun

机构 * University of Michigan(密歇根大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对长时程自我中心记忆系统的索引不可靠、忽略时序意图的问题,提出EgoCITE框架,经多数据集评估,其准确率优于基线且成本显著低于长上下文LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13428 2026-08-14 cs.AI 新提交 57%

RAIL: An Automatic Classifier of the Artificial Intelligence Readiness Level

RAIL:一种人工智能就绪水平的自动分类器

Juan Irving Vasquez, Juan Terven, Laura-Ivoone Garay-Jimenez

机构 * CIETEC-IPN Instituto Politécnico Nacional(墨西哥国立理工学院) CICATA-QRO UPIITA

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出RAIL分类器,将三类AI就绪框架统一为AIRL量表,通过大语言模型智能体小组裁决实现自动评估,测试显示其一致性好且避免高估。

Comments Under review at journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13417 2026-08-14 cs.AI 新提交 57%

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

超越最终得分:面向长期人工智能研究与开发的智能体系统评估

Yiwei Li, Wanli Yang, Hexiang Tan, Xiangzhou Huang, Zhengyu Chen, Ziran Li, Borun Chen, Shanglin Lei, Huaisheng Zhu, Hao Tian, Fei Sun, Xunliang Cai, Jingang Wang

机构 * Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI

AI总结 本文通过新框架评估7个前沿模型在36项长期任务上的表现,发现当前智能体更像工程优化器,方案多基于已有技术,为模型训练等环节改进指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13415 2026-08-14 cs.RO cs.AI 新提交 57%

Deliberate Practice: Learning Robot Skills under a Budget

刻意练习:有限预算下的机器人技能学习

Shivam Vats, Sudarshan Harithas, Mete Tuluhan Akbulut, Arvind Raghunathan, George Konidaris

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 研究有限预算下机器人序列任务技能学习问题,提出刻意练习算法,通过双线性规划计算预算最优分配,经仿真与真实实验验证可提升机器人长程规划能力。

Comments 16 pages including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13179 2026-08-14 cs.AI 新提交 57%

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

学习幅度而非方向:面向多轮多步骤大语言模型智能体的验证器约束信用分配

Zechuan Wang, Siyuan Lu, Hongxuan Zhang, Linjian Mo, Chenyi Zhuang, Leilei Gan

专题命中 规划决策 :tool-use(abstract);分类 cs.AI

AI总结 该研究提出CrEST分层信用分配框架,保留RL的验证器约束上限并结合自我教师的密集token级信号,在BFCL V3和WildToolBench上优于基线,可简化教师在策略优化中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12851 2026-08-14 cs.AI 新提交 57%

Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents

熟能生险:自我改进的大语言模型智能体中的技能误演化

Xutao Mao, Liangjie Zhao, Xiang Zheng, Cong Wang

机构 * Adelaide University(阿德莱德大学) City University of Hong Kong(香港城市大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 该研究针对自我改进LLM智能体的技能误演化问题,构建SkillMisevo-Gym与SkillMisevo-Bench基准,提出SafeEvolve方法,可显著降低不安全检索与新会话危害,同时对良性效用影响极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12548 2026-08-14 cs.HC cs.LG eess.SP 新提交 57%

Analysis of Motor Signatures of Social Adaptation in Autism for Efficient Human-Centric Systems

自闭症社会适应的运动特征分析——面向高效的以人为中心的系统

Lara Pereira, Teresa Sousa, Miguel Castelo-Branco, João Ruivo Paulo

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本研究通过分析舞蹈模仿任务的运动数据,提出SCSI指数,以79.2%的平衡准确率区分自闭症与神经典型成人,发现社会情境敏感性可作为自闭症运动行为的生物标志物,为开发包容性以人为中心技术提供支撑。

Comments Accepted at IEEE SMC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11110 2026-08-14 cs.CL 版本更新 57%

Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents

行动胜于言语:测量使用工具的智能体的跨语言策略保留率

Sourabrata Mukherjee, Kalika Bali, Sunayana Sitaram

机构 * Microsoft Research India(微软研究院印度分部)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 该研究测量使用工具的智能体的跨语言行动策略保留率,发现前沿模型在贪心解码下保留71%-73%策略,参数低于100亿时保留率崩溃,且存在影响测量的混淆因素。

Comments Accepted in COLM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11195 2026-08-14 cs.AI cs.CC cs.HC math.FA 版本更新 57%

Long-Horizon AI Research for Grothendieck Constant: A Case Study in Human-AI Mathematical Collaboration

格罗滕迪克常数的长周期AI研究:人机数学协作的案例研究

Alan Li, Rahul Saha, Anton Xue, Swarat Chaudhuri, Adam Klivans, Pravesh K Kothari, Raghu Meka

专题命中 规划决策 :AI agent(abstract);分类 cs.AI

AI总结 本研究通过案例探究AI在数学研究中的有效应用,利用AI研究系统将格罗滕迪克常数的最优界收紧,同时分析了AI用于数学研究的优劣势及相关经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20017 2026-08-14 cs.CL 版本更新 57%

QUIETT: Query-Independent Table Transformation for Robust Reasoning

QUIETT:查询无关的表格转换以实现稳健的推理

Gaurav Najpande, Tampu Ravi Kumar, Manan Roy Choudhury, Neha Valeti, Yanjie Fu, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 QuIeTT通过查询无关的表格转换框架,提升表格推理的可靠性和效率,实验显示在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12641 2026-08-14 stat.ME 新提交 50%

Empirical Simulation of Survival and Mixed-Type Data for Clinical Trial Design

临床试验设计用生存数据与混合类型数据的经验模拟

Yao Chen, Jiren Sun, Yuxin Ding, Yushi Liu, Yongming Qu

专题命中 规划决策 :planning(abstract)

AI总结 本研究提出基于经验Copula的R包EmpiricalSim,用于模拟含多类型变量的多元生存数据,可匹配目标生存分布并保留变量间相关性,在肿瘤临床试验数据重建中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13395 2026-08-14 cs.RO 新提交 50%

FIRE-VLA: Failure-Informed Self-Evolution for Vision-Language-Action Models in Autonomous Driving

FIRE-VLA:面向自动驾驶的视觉-语言-动作模型的故障感知自演化

Hao Dou

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 规划决策 :planning(abstract)

AI总结 该研究针对自动驾驶VLA模型,提出FIRE-VLA故障感知自演化框架,结合GRPO与自蒸馏,在nuScenes数据集上降低了规划误差与故障流行率,提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13268 2026-08-14 cs.PL cs.LO 新提交 50%

Multiobjective Preexpectation Reasoning for Probabilistic Programs

概率程序的多目标预期望推理

Lena Verscht, Hannah Mertens, Kevin Batz, Sebastian Junges, Benjamin Lucien Kaminski, Joost-Pieter Katoen

专题命中 规划决策 :planning(abstract)

AI总结 针对带非确定性的概率程序规划问题,提出多目标预期望变换器及对应策略综合规则,构建了无限MDP上多目标优化的程序层面符号方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12857 2026-08-14 cs.HC 新提交 50%

PolyPresentation: A Multimodal AI Platform for Slide-Aware Iterative Presentation Practice

PolyPresentation:一种面向幻灯片感知迭代演示练习的多模态AI平台

Chen Chen, Jihao Li, Zhiyuan Wen, Tianhui Zhang, Di Zou, Jiannong Cao

专题命中 规划决策 :planning(abstract)

AI总结 该研究针对现有AI演示排练工具缺乏幻灯片关联与迭代练习规划支持的问题,推出PolyPresentation多模态AI平台,经20次学术演示对比验证其能提供更优的演示改进支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12768 2026-08-14 cs.CY 新提交 50%

A Generative Framework for the Creation of Multi-Attribute Geographically-Explicit Synthetic Population

用于创建多属性地理显式合成种群的生成框架

Jinlin Wu, Si Qiao, Yi Liu, Fuzhen Yin, Na Jiang

专题命中 规划决策 :agent(abstract)

AI总结 提出一种分层扩散生成框架,可从汇总数据重建多属性区域联合分布,生成含3.32亿个体的地理显式合成种群,效果优于IPF等基线方法,能提升地理模拟的真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12741 2026-08-14 cs.IR 新提交 50%

Knowledge Synthesis Review Framework: Task-Level Benchmarking of LLM-Based Systems for Multi-Source Evidence Synthesis

知识综合评审框架:面向多源证据综合的基于大语言模型系统的任务级基准测试

Wafa Shafqat, Mark Patterson, Steven N. Liss

专题命中 规划决策 :workflow(abstract)

AI总结 本研究提出KSR人机协作框架,将证据综合拆分为4项任务,对4款LLM系统开展任务级基准测试,发现各系统各有优劣,该框架可揭示单源综合遗漏的信息,且透明可审计。

详情

展开后加载摘要…

URL PDF HTML 收藏