arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-06 至 2026-08-06 共收录 185 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 15 篇

2504.01407 2026-08-06 cs.CV cs.AI 版本更新 57%

ZoomV: Temporal Zoom-in for Efficient Long Video Understanding

TimeSearch: 基于聚光灯和反射的层次视频搜索用于类人长视频理解

Yuan Zhang, Junwen Pan, Rui Zhang, Xin Wan, Qizhe Zhang, Ming Lu, Qi She, Shanghang Zhang

机构 * ByteDance(字节跳动) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 TimeSearch通过Spotlight和Reflection机制,提升长视频理解的准确性和效率

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04331 2026-08-06 cs.HC 新提交 50%

IntentLint: Supporting Intent Scaffolding and Prompt-time Linting in Human-AI Collaborative Data Analysis

IntentLint:支持人机协同数据分析中的意图支架与提示时 linting

Felicia Li Feng, Jian Zhao, Anamaria Crisan

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究针对人机协同数据分析中意图对齐差等问题,提出含意图支架和提示时 linting 的 IntentLint 系统,经16名分析师验证可提升意图感知与策略反思,为相关设计提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22159 2026-08-06 eess.IV 版本更新 50%

Fifty Years of SAR Automatic Target Recognition: The Road Forward

五十年来合成孔径雷达遥感图像的目标检测与识别:未来之路

Jie Zhou, Yongxiang Liu, Li Liu, Weijie Li, Taoli Yang, Bowen Peng, Yafei Song, Gangyao Kuang, Xiang Li

专题命中 记忆与上下文管理 :AI agent(abstract)

AI总结 本文综述了SAR ATR过去五十年的发展历程,提出未来需关注高质量数据集、公平评估基准和开源生态建设。

Comments Accepted by IEEE GRSM

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 31 篇

2608.04292 2026-08-06 cs.CV 新提交 89%

Binding Biometrics with AI Agent Identifiers for Delegation of Authority

将生物特征与AI智能体标识符绑定以实现权限委托

Joseph Geo Benjamin, Anil K Jain, Karthik Nandakumar

机构 * Michigan State University(密歇根州立大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract)

AI总结 本研究提出BIND框架,通过生物特征密码系统将人类生物特征与AI智能体ID及权限范围绑定,实现经认证的权限委托,基于人脸特征的实验验证其在零错误匹配率下96%真实匹配率,支持1024位智能体令牌。

Comments Accepted in IJCB sessions 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04018 2026-08-06 cs.CY cs.AI 新提交 87%

Governing Execution Risk in Agentic AI Systems: A Trajectory-Guided Framework for Red Teaming

管控智能体AI系统的执行风险:一种基于轨迹的红队测试框架

Zhihao Zhu, Yi Yang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);tool use(abstract)

AI总结 本研究提出基于轨迹的红队测试框架TrajRed和运行时管控层TrajGuard,在AgentDojo实验中,TrajRed识别的漏洞更强,TrajGuard可将攻击成功率降至近零且保留任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29677 2026-08-06 cs.AI 版本更新 84%

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

ExtractBench:模式引导的企业文档抽取基准

Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo

专题命中 Agent评测 :agentic(summary_cn,abstract);agent(abstract);分类 cs.AI

AI总结 研究针对企业文档模式引导抽取的评估需求,构建首个同时评估值准确率等多指标的基准ExtractBench,发现LlamaExtract Agentic Plus在成本远低于编码智能体的情况下,准确率可与之媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04830 2026-08-06 cs.AI 新提交 83%

ContextWeave: A Real-World Workflow Benchmark

ContextWeave:一个真实世界工作流基准测试

Bo Wang, Yuqian Yao, Enxi Wang, Luozhijie Jin, Yang Liu, Yiran Suo, Yuxuan Cai, Enyu Zhou, Yufei Gao, Honglin Guo, Tianyu Huai, Li Ji, Zhikai Lei, Bufan Li, Lizhi Lin, Jinxiu Liu, Jie Yang, Jiazheng Zhou, Maosen Zhou, Pengfang Qian, Shichun Liu, Guanshan Liu, Hao Zheng, Yunhao Yu, Hang Yan, Jihua Kang, Xinchi Chen, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) ByteDance(字节跳动)

专题命中 Agent评测 :workflow(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究推出ContextWeave工作流基准测试,通过实验发现可操作的经验记忆能提升智能体工作流性能,为优化记忆系统提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04562 2026-08-06 cs.AI 新提交 83%

What Is a Skill Worth? Structure-Aware Shapley Valuation of Agent Skills

技能价值几何?智能体技能的结构感知夏普利估值法

Tao Li, Junfeng Liu, Qinghua Zhao, Yifan Li, Lei Wang, Bo Shao, Xuejun Liu, Linjun Shou

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Pengcheng Laboratory(鹏城实验室) Hefei University(合肥学院) Microsoft(微软公司)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出结构感知夏普利式技能估值框架SkillSV,通过编译技能结构、分离内容与上下文价值,在四个智能体基准上验证其可恢复单元交互、指导技能压缩等特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04341 2026-08-06 cs.MA 新提交 82%

Continuous Improvement and Parallel Autonomous Exploration: An LLM-Agent Framework for Searching Large Solution Spaces

持续改进与并行自主探索:用于搜索大型解空间的大语言模型智能体框架

Dulmini Hettiarachchi, Andre Rusli, Julio Christian Young, Sho Akiyama

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract)

AI总结 该研究提出一种LLM智能体框架,含持续改进奖励循环与并行自主探索机制,在产品到目录匹配任务中,5个并行智能体的合格覆盖度较单智能体及基线显著提升。

Comments 5 pages, ACM KDD'26 Workshop on SciSoc Agents & LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04192 2026-08-06 cs.CR cs.AI cs.CL 新提交 81%

Behavioral Skill Reconstruction: Reconstructing Hidden Functionality from LLM Agent Skills

行为技能重构:从大语言模型智能体技能中重构隐藏功能

Peichun Hua, Haoxuan Xu, Mengyuan Li

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出SkillClone黑盒攻击方法,可通过合法交互从隐藏的LLM智能体技能中重构其功能,表明仅文件保密无法确保功能保密。

Comments 20 pages, 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04077 2026-08-06 cs.AI cs.CL 新提交 81%

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

FinProBench:基于专业交付物衍生的角色基准评估金融AI智能体

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究推出FinProBench金融AI智能体基准及RGRC角色基准构建流程,实验显示RGRC在角色专业化角色评估上优于仅提示方法,角色级复用基准可大幅减少工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04828 2026-08-06 cs.CL 新提交 79%

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

技能使用:智能体框架中的大语言模型(LLM)真的能使用技能吗?

Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao

机构 * East China Normal University(华东师范大学) Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Tencent Hunyuan(腾讯混元)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.CL

AI总结 本研究推出Skill-Use基准,评估智能体在渐进式披露下的技能使用,发现8个LLM在两个框架下的SU分数仅0.613,技能使用是依赖框架的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04366 2026-08-06 cs.CR cs.AI 新提交 79%

Combating Knowledge Corruption in Agent Systems: A Byzantine-Tolerant Secure Collaborative RAG Framework

对抗智能体系统中的知识篡改:一种拜占庭容错的安全协同RAG框架

Zhaoqi Wang, Daqing He, Zijian Zhang, Ye Liu, Jiamou Liu, Zhirui Zeng, Zhan Qin, Zhen Li, Xin Li, Hongwei Yao, Jincheng An, Yong Liu, Yi Li, Qi Sun, Xiulei Liu, Liehuang Zhu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对RAG系统面临的知识篡改攻击问题,提出拜占庭容错的安全协同RAG框架SecureCollaRAG,通过多源知识验证机制与动态GNN可信度评分实现攻击防护,在非IID数据下保持鲁棒性。

Journal ref Proceedings of the ACM Web Conference 2026, pages 2661-2672, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00794 2026-08-06 cs.AI 版本更新 79%

Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation

无效度的测量:智能体AI评估中的复合可靠性问题

William Caban

机构 * Red Hat, Inc.(红帽公司) Alma Mater Europaea University(欧洲母校大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 该研究指出智能体AI评估存在复合可靠性问题,任务生成、LLM模拟、评分者间信度三个层面的失效相乘降低效度,提出八项心理测量学改进建议以提升评估可信度。

Comments 34 pages (review/double-spaced format), 2 figures, 5 tables. Submitted to Knowledge-Based Systems (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12294 2026-08-06 q-bio.QM cs.SE q-bio.PE 77%

PesTwin: a biology-informed Digital Twin for enabling precision farming

PesTwin:一种融合生物学的数字孪生用于实现精准农业

Andrea De Antoni, Matteo Rucco, Alberto Maria Cattaneo, Ege Gezer, Giuseppe Sulis, Paola Draicchio, Giovanni Iacca, Andrea Pugliese, Maria Vittoria Mancini

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.SE

AI总结 本文提出一种基于Agent-Based建模的数字孪生框架,用于模拟害虫入侵,通过整合异构数据源预测害虫侵袭,提升精准农业的害虫防控能力。

Comments 6 pages, 5 figures, IEEE conference template

Journal ref Proc. 2026 IEEE Int. Conf. on Smart Computing Workshops (SmartComp Companion), 2026, pp. 195-200

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04772 2026-08-06 cs.CL cs.AI 新提交 76%

Guideline-as-Oracle: Zero-Annotation Training of an Ophthalmic Telephone Triage Agent

以指南为神谕:眼科电话分诊智能体的零标注训练

Chenyu Wang, Yi Liu, Baoqing Li, Min Tu, Diping Song

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

AI总结 本研究提出以指南为神谕(GAO)方法,将美国眼科学会指南转化为训练监督信号,零标注训练出GAO-Triage智能体,大幅提升眼科电话分诊的一致性与紧急案例召回率,且性能优于7个通用系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04653 2026-08-06 cs.CV cs.RO 新提交 67%

Overcoming Statistical Bias in Action-Controllable World Models

克服动作可控世界模型中的统计偏差

Yuhong Shi, Zhenhao Chu, Jie Wei, Jun Hao, Jianyi Liu, Jingwen Fu

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 该研究针对动作可控世界模型的统计偏差问题,提出CoCo反事实一致性框架,结合ARC、DE评估指标及Mini-SSMB数据集,在多项任务上提升了动作可控性与视频预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11183 2026-08-06 cs.CL cs.AI cs.LG 版本更新 67%

Amplitude-Only FFN Intervention for Tool-Structured LLM Inference Method: Gated Evaluation Protocol, and Cross-Model Empirical Results

用于工具结构化大语言模型推理方法的仅幅度前馈网络干预:门控评估协议及跨模型实证结果

Sheng Xu, Zhen Chen, Junhua Wang, Boyuan Huang, Ke Jia, Jiadun Zhu, Yiming Xu

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究推理时FFN干预改善大语言模型结构化输出,提出无损的幅度门控方法,定义细粒度干预系统和评估协议。在多个模型上实验,AG在工具结构化任务中效果最佳,不同AG变体各有优劣,确定工具结构化推理是FFN级推理优化首要目标。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04156 2026-08-06 cs.AI cs.LG 新提交 62%

BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding

BrainBench:面向全面脑电理解的大语言模型基准测试

Yangxuan Zhou, Sha Zhao, Yuning Chen, Chen Wu, Jiquan Wang, Shijian Li, Gang Pan

机构 * Zhejiang University(浙江大学) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 该研究推出BrainBench基准测试,涵盖4个子集共17个数据集等,评估大语言模型在两种范式下的脑电理解能力,为相关研究提供可复现测试平台。

Comments 42pages,22pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04095 2026-08-06 cs.AI cs.CL 新提交 62%

FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents

FinPerMA:一种基于理论、事件驱动的LLM智能体个性化记忆基准

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对LLM智能体个性化记忆的现有基准不足,提出FinPerMA基准,在276个角色的2994个问题上测试7种LLM,发现其记忆配置远未饱和,简单检索优于专用记忆系统且冲击后差距扩大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03722 2026-08-06 cs.AI cs.CL 版本更新 62%

When Outputs Disperse, Does Epistemic Revision Follow? A Black-Box Diagnostic for Machine Collectives

当输出分散时,认知修正会随之而来吗?面向机器集体的黑盒耦合诊断方法

Molood Arman

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出黑盒耦合诊断方法,评估LLM集体输出分散度干预与认知立场修正的关联,发现不同模型的错误前提恢复效应存在显著差异,建议报告立场转变及保留前提率。

Comments Reviewed at Collective Intelligence 2026 (CI 2026) Conference. Revised version incorporating reviewer feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02046 2026-08-06 cs.CL cs.AI 版本更新 62%

CompanionBench: A Theory-Anchored, Real-World-Grounded Benchmark for AI Emotional Companionship

CompanionBench:一个基于理论、扎根于真实世界的AI情感陪伴基准

Yao Liu, Guangjia Chai, Yuming Huang, Jihao Huang, Lei Wang, Junchen Wan

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究推出基于理论与真实数据的交互式双语AI情感陪伴基准CompanionBench,评估28个智能体发现其能力差异,指出角色扮演智能体表现差、核心能力存弱点,将发布500对中英平行数据及评估代码。

Comments 33 pages, 6 figures, 19 tables, 13 appendices. Bilingual (Chinese/English) interactive benchmark; 28 evaluated agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25073 2026-08-06 cs.CR cs.AI cs.LG 62%

Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions

大型语言模型微调生命周期中的安全:威胁、防御、评估与未来方向

Wenjuan Li, Yitao Liu, Runze Chen, Rajkumar Buyya

机构 * Hangzhou Normal University(杭州师范大学) Zhejiang University(浙江大学) China Mobile (Zhejiang) Innovation Research Institute Co., Ltd.(中国移动(浙江)创新研究院有限公司) Quantum Cloud Computing and Distributed Systems (qCLOUDS) Lab, School of Computing and Information Systems(量子云计算与分布式系统(qCLOUDS)实验室,计算与信息学院) The University of Melbourne(墨尔本大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文系统综述了大型语言模型微调过程中的安全威胁与防御,提出了基于生命周期的三阶段框架,并通过统一实验评估了攻击与防御的有效性及跨阶段局限性。

Comments 39 pages, 7 figures, 22 tables

Journal ref Software: Practice and Experience, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04896 2026-08-06 cs.AI cs.CV 新提交 57%

When Shared Rollouts Fail in Defensive Driving Evaluation: A NAVSIM Score Basis Audit

防御性驾驶评估中共享回退的失效:NAVSIM评分依据审计

Ziang Wei, Minjun Yu, Zheyuan Lai, Mingjie Pang, Wei Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究审计NAVSIM v2.2评分中共享回退的失效风险,发现数值不稳定性会使参考条件式容错传播参考失败,贡献含多环节的审计协议以规范防御性驾驶评分使用。

Comments 17 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04840 2026-08-06 cs.CV cs.AI 新提交 57%

Towards a satellite image manipulation and deepfake localization benchmark dataset

面向卫星图像篡改与深度伪造定位的基准数据集

Jacob Arndt, Debvrat Varshney, Philipe Dias, Nivedita Nukavarapu

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 针对遥感领域缺乏合适卫星图像篡改定位基准数据集的问题,构建含60张图像的原型数据集,支持像素级定位等分析,以推动相关研究。

Comments Accepted at IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04195 2026-08-06 cs.SE 新提交 57%

SONAR: Task-Aware Code Summary Evaluation for LLM Consumers Without References

SONAR:面向LLM使用者的任务感知型代码摘要评估框架(无需参考摘要)

Simantika Bhattacharjee Dristi, Matthew B. Dwyer

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 该研究提出无需参考摘要的SONAR框架,从四个维度评估代码摘要,发现正确性、抽象性对LLM性能影响显著,简洁性、流畅性影响微弱,还明确了不同LLM在各维度的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04053 2026-08-06 cs.CR cs.AI 新提交 57%

AgentAntibody: An Adaptive Immune System for Defending LLM Agents against Prompt Injection

AgentAntibody:一种用于防御大语言模型(LLM)智能体提示注入的自适应免疫系统

Shihao Weng, Yang Feng, Xiaofei Xie, Jiongchi Yu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对LLM智能体的提示注入威胁,受自适应免疫启发提出AgentAntibody,通过持久抗体库识别威胁并进化增强防御,实验显示其在防有害行为同时保留合法任务完成上优于现有防御。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28881 2026-08-06 cs.AI 版本更新 57%

Fragility of Value under Imperfect Alignment

不完美对齐下价值的脆弱性

Winter Cross

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文针对AI系统与人类价值对齐问题,建立模型明确人类价值函数与代理条件准确度的相关条件,凸显过度优化风险,提出采用quantilizers等限制优化压力的AI设计方案。

Comments 24 pages, 7 figures Added acknowledgement of funding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25186 2026-08-06 cs.CL 版本更新 57%

CardioBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios

MyoCardBench:用于评估临床真实心血管护理场景中大型语言模型的真实世界数据基准

Xiao Li, Mouxiao Bian, Zhaodi Wu, Sijie Ren, Juechen Chen, Lu Lu, Jingru Ding, Yun Zhong, Jie Xu, Yixiu Liang, Junbo Ge

机构 * Shanghai Institute of Cardiovascular Diseases(上海市心血管病研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Minhang Hospital, Fudan University(复旦大学附属闵行医院)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 该研究开发MyoCardBench真实世界基准评估大语言模型在心血管护理场景的性能,涵盖多任务数据集,经专家注释审核。7个模型在零样本设置下输出,GPT-5.4表现最佳。此基准为评估模型提供框架,助于发现优势与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11745 2026-08-06 cs.AI 版本更新 57%

Text2GraphQuery-Bench: A Text to Graph Query Benchmark

Text2GQL-Bench: 一个文本到图查询语言基准 [实验、分析与基准]

Songlin Lyu, Lujie Ban, Zihang Wu, Tianqi Luo, Jirong Liu, Ayoub Moussaid, Oskar van Rest, Heng Lin, Chenhao Ma, Nan Tang, Shipeng Qi, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xi'an Polytechnic University(西安理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Text2GQL-Bench是一个统一的文本到图查询语言基准,通过多领域数据集和评估方法,揭示了ISO-GQL生成中的方言差距,并展示了通过充足示例提升模型性能的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏