arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 725 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 174 篇

2608.02372 2026-08-04 cs.CL 新提交 70%

PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise

PredAct-Bench:可控工具噪声下的工具增强对话基准

Abdulrahman AlRabah, Xiaocheng Yang, Dilek Hakkani-Tür, Abdussalam Alawini

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究推出PredAct-Bench基准,以教育为测试平台评估带噪声工具的对话智能体,扩展信任校准指标并评估13种LLMs,发现当前模型无法在工具噪声下为教师提供足够可见性,助力构建更优AI决策支持系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01715 2026-08-04 cs.SE cs.AI 新提交 70%

Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch

编码智能体作为测试套件审计器:在接近官方测试套件检测能力的同时发现官方套件遗漏的问题

Shuyang Xie, Shuxiao Xie, Feng Zhu, Yanli Ji, Wangmeng Zuo

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出编码智能体作为测试套件审计器,结合认证链识别官方套件遗漏的缺陷提交,在接近官方套件覆盖度的同时,无官方套件时其构建的套件表现最优。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01690 2026-08-04 cs.RO cs.AI 新提交 70%

ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions

ProtoAct:将湿实验室协议转化为具身机器人动作

Zhe Liu, Jiaming Gu, Zhaohui Du, Zhe Wang, Huanbo Jin, Quan Lu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对湿实验室协议难转化为机器人动作的问题,提出ProtoAct框架,结合ProtoRAG、RefineChecker、ActSchema处理协议,引入BioP2E数据集,经多模型评估与消融实验验证,可实现仿真及真实机器人的协议执行。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01377 2026-08-04 cs.AI 新提交 70%

CraftAlign: Feature-Grounded Evaluation and Revision Guidance for AI Stories

CraftAlign:面向AI故事的基于特征的评估与修订指导

Yang Yang, Boyun Xu, Shaofeng Liang, Yun Han, Zining Zhong, Songning Lai, Kaishen Yuan, Yutao Yue

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CraftAlign是对齐AI故事与人类叙事技巧的框架,含特征估计器与能量模型,可评估写作模式并生成修订指导,实验显示其区分能力及指导效果优于基线。

Comments 17 pages, 5 figures, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01149 2026-08-04 cs.AI 新提交 70%

PATH-Bench: Path-Dependent Evaluation of Lifelong Agents

PATH-Bench:面向终身智能体的路径依赖评估基准

Xidong Yang, Xingyi Zhang, Wenhao Li, Wenyan Liu, Junjie Sheng, Yun Hua, Wei Yin, Tao Fang, Chuyun Shen, Xiangfeng Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究构建了面向终身智能体路径依赖评估的基准PATH-Bench,评估8个智能体后提出SEU机制,该机制可减少遗忘、提升正向迁移,为设计更优终身智能体提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01085 2026-08-04 cs.MA cs.LG 新提交 70%

When Collaboration Becomes a Trigger: Collective Evidence-Threshold Backdoors in Multi-Agent Systems

当协作成为触发因素:多智能体系统中的集体证据阈值后门

Jia-Hao Xiao, Lei Feng, Min-Ling Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对多智能体系统的新型集体证据阈值后门威胁,提出BCBI注入后门、LATTE防御方法,在基准测试中实现高效后门激活与低干扰防御效果。

Comments 26 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00877 2026-08-04 cs.LG 新提交 70%

GeoArbiter: Verifiability-Guided Grounding for Remote-Sensing Multimodal LLMs

GeoArbiter:面向遥感多模态大语言模型的可验证性导向 grounding 方法

Xuechen Li

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对遥感多模态大语言模型的事实断言问题,提出无需训练的 GeoArbiter 流程,通过仅注入图像无法验证的地理事实,有效降低了模型的断言级幻觉并提升了对冲突记录的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00832 2026-08-04 cs.LG 新提交 70%

AdvPlan-Bench: Adversarial Evaluation of Structured Plan-Generation Agents

AdvPlan-Bench:结构化计划生成智能体的对抗性评估基准

Alina Kapanova, Arun Kanhai, Natan Vidra, Spurthi Setty

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出AdvPlan-Bench,这一结构化计划生成智能体的对抗性评估离线基准,通过多维度指标开展实验验证,为相关研究提供可复现的基准支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00366 2026-08-04 cs.SE cs.AI 新提交 70%

Artificial Intelligence and Modeling & Simulation: An Overview

人工智能与建模及仿真:概述

Niclas Feldkamp, Philippe J. Giabbanelli, Istvan David

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本报告概述人工智能与建模及仿真的交叉领域,阐述二者双向促进关系,沿建模及仿真各阶段展示大语言模型等技术的应用,提供概念路线图助力领域探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00106 2026-08-04 cs.LG 新提交 70%

Learning Compositional Meta-Routing for Agentic Workflows: An Executable Benchmark

面向智能体工作流的组合式元路由学习:一个可执行基准

Natan Vidra, Alina Kapanova, Arun Kanhai, Spurthi Setty

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一个智能体工作流的可执行基准和感知预算的组合式元路由器,在保留测试集上实现100%成功率,成本比静态策略低43%,但在词汇偏移挑战任务上表现不佳,凸显词汇泛化是主要限制。

Comments 7 pages, 1 figure; AAAI 2027 anonymous submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00149 2026-08-04 cond-mat.soft cs.AI 新提交 70%

A Synthetically-accessible Universe of Chemically Recyclable Polymers

可化学回收聚合物的合成可及宇宙

Anagha Savit, Wei Xiong, Harikrishna Sahu, Shivank S. Shukla, Will R. Gutekunst, Rampi Ramprasad

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本研究结合VFS与polyBART、POLYT5模型生成100万个可合成的ROP聚合物结构数据集,经严格筛选后可作为下游可持续应用的宝贵资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19396 2026-08-04 cs.AI 版本更新 70%

CrackedPDFs: A Controlled Benchmark for Hidden Prompt Injection in PDFs

CrackedPDFs:用于PDF中隐藏提示注入的受控基准测试

Pukaphol Thienpreecha, Karthik Subramanian

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对PDF中隐藏提示注入问题,引入CrackedPDFs基准测试,评估多种检测方法,如PromptGuard、结构学习模型等,结果显示文档感知混合检测在受控配对评估下有效,但缺乏现实世界鲁棒性和跨家族泛化能力。

Comments Revised author metadata to include Karthik Subramanian; corrected paired-metric terminology; added code, dataset, reproduction, and archival information. Code: https://github.com/volkthienpreecha/crackedpdfs/releases/tag/v1.0.0-paper ; Dataset: https://huggingface.co/datasets/volkthienpreecha/crackedpdfs ; Archive: https://doi.org/10.5281/zenodo.21735803

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30359 2026-08-04 cs.NE cs.DC cs.LG cs.PF cs.SE cs.SY eess.SY 版本更新 70%

Kernel Foundry: A Diagnosis-driven Evolutionary Kernel Optimizer with Multi-Experts

Kernel Foundry:一种基于诊断的多专家进化内核优化器

Zixuan Huang, Da Chen, Kecheng Huang, Lihao Yin, Xing Li, Huiling Zhen, Mingxuan Yuan, Zili Shao

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei Hong Kong(华为香港诺亚实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Kernel Foundry,一种结合专家引导初始化、多岛进化搜索和结构化诊断反馈的自动GPU内核优化框架,显著提升正确性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08645 2026-08-04 cs.CL 版本更新 70%

Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents

快速响应:从人类演示中提取隐含意图以构建个性化移动使用代理

Zheng Wu, Heyuan Huang, Yanjia Yang, Yuanyi Song, Xingyu Lou, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) OPPO Research Institute(OPPO研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出IFRAgent框架,通过分析显式和隐式意图流,提升移动代理对人类意图的对齐率和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01132 2026-08-04 cs.CL 版本更新 70%

Don't Judge a Book by its Cover: Testing LLMs' Robustness Under Logical Obfuscation

不要只看封面判断一本书:测试LLMs在逻辑混淆下的鲁棒性

Abhilekh Borah, Shubhra Ghosh, Kedar Joshi, Aditya Kumar Guru, Kripabandhu Ghosh

机构 * Manipal University Jaipur(马纳普大学贾普尔分校) Indian Institute of Technology, Patna(印度理工学院帕坦分校) Indian Institute of Science Education and Research, Kolkata(印度科学教育与研究学院科钦分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出Logifus框架和LogiQAte基准,测试LLMs在逻辑混淆下的鲁棒性,发现混淆显著降低模型性能,揭示当前LLMs缺乏深度理解。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00255 2026-08-04 eess.SP 新提交 67%

Artificial Intelligence for Spatially Reconfigurable Antennas: Movable, Fluid, and Pinching Antenna Systems

用于空间可重构天线的人工智能:可移动、流体及捏合天线系统

Nguyen Cong Luong, Zeping Sui, Thai-Hoc Vu, Jie Cao, Bo Ma, Thuan Van Le, Xunyang Zhan, Nguyen Duc Hai, Min Xu, Qiushi Zhao, Dong In Kim, Yonghong Zeng, Shaohan Feng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本综述针对可移动、流体、捏合三类空间可重构天线系统,梳理了深度学习等各类AI技术的应用,探讨了相关开放挑战与未来方向。

Comments 30 pages, 7 figures, submitted to IEEE COMST

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02059 2026-08-04 cs.CV cs.MM 新提交 67%

MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing

MIEScore:面向多源图像编辑的人类对齐评估方法

Zitong Xu, Huiyu Duan, Xinyun Zhang, Weifei Xiong, Tianyi Zheng, Xiongkuo Min, Qiang Hu, Zhengxue Cheng, Bo Li, Guangtao Zhai

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对多源图像编辑(MIE)缺乏人类对齐评估基准的问题,研究构建了首个MIE基准MIE-Bench,并提出基于MLLM的评估模型MIEScore,其对齐人类偏好性能最优且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01848 2026-08-04 cs.CV 新提交 67%

Decoupling semantics from vision: A framework for faithful visual-text compression evaluation

将语义与视觉解耦:一种用于可靠视觉-文本压缩评估的框架

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Shenzhen Technology University(深圳技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究针对现有视觉-文本压缩评估依赖下游任务性能的缺陷,提出解耦语义与视觉的评估框架,引入ZeroSense基准消除文本依赖,实验证实VTC质量与下游任务准确率存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01258 2026-08-04 cs.CV 新提交 67%

A Benchmark Dataset for MLLM-Generated Image Detection: GPT Image2 & Nano Banana2

多模态大语言模型生成图像检测的基准数据集:GPT Image2与Nano Banana2

Zirui Zhang, Yinbo Yu, Donghai Guan, Chunwei Tian, Daoqiang Zhang, Qi Zhu

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文构建了含三种生成协议的MLLM生成图像检测基准数据集,评估现有检测器性能并提出SAP-DSP基线框架,验证了其检测稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01157 2026-08-04 cs.CV 新提交 67%

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos

InteracVid:基于直播聊天视频构建真实交互式视听响应数据集

Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出首个开源大规模交互式视听数据集InteracVid,解决现有生成模型监督信号缺失问题,实验证实其可提升多模态助手的交互规划与响应生成性能,为交互式多模态生成提供关键基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00839 2026-08-04 cs.CY cs.HC 新提交 67%

CodeStylist: Supporting Early Undergraduate Programmers with Course-Aware Code Style Feedback

CodeStylist:面向早期本科编程学习者的课程感知代码风格反馈支持工具

Ethan Dickey, Libra Vento, Peter Kurto, Andres Bejarano

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究开发了支持课程特定标准的CodeStylist工具,用于为早期本科编程学习者提供本地化代码风格反馈,专家评审显示其有应用前景但存在信任度不足等问题,需优化工具设计。

Comments 9 pages, 1 table, 1 figure, accepted for publication at Frontiers in Education 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00824 2026-08-04 cs.SE 新提交 67%

Structure-Aware Semantic Chunking with Title-Chain Prefixes: A 1600-Query Evaluation and the Measurement Trap in Text-Transform Ablations

结合标题链前缀的结构感知语义分块:1600次查询评估及文本变换消融实验中的测量陷阱

Yang Yang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出仅在分块侧的三阶段语义分块流水线,经1600次查询评估提升RAG的MRR@5,还发现分块研究中存在的测量陷阱并推荐检索时每个候选前缀评估的方向。

Comments 8 pages, 1 table. Replication package: DOI 10.5281/zenodo.21744653

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00624 2026-08-04 cs.SE 新提交 67%

Can Perplexity Serve as a Cognitive Signal for Code Understandability?

困惑度能否作为代码可理解性的认知信号?

Xiaokai Rong, Mohammadali Sefidi Esfahani, Aashish Yadavally, Rigby Peter, Tien N. Nguyen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究通过实证发现,词元级困惑度的简单片段级聚合与人类代码可理解性相关性不可靠,明确其仅适用于局部代码困惑,需经特定分析才能用于可靠的代码可理解性测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00134 2026-08-04 cs.CR 新提交 67%

Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks

有状态协作智能体防御大型语言模型抵御演进式多轮攻击

Siyuan Li, Zehao Liu, Haoyu Li, Xi Lin, Ning Liu, Jun Wu, Jianhua Li, Mohsen Guizani

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出一种主动防御框架,通过协作多智能体架构结合干扰、误导与自适应策略,在EMRA数据集上使LLMs对抗多轮攻击的ASR平均降低69%,同时提升DR与攻击者token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00068 2026-08-04 cs.CV 新提交 67%

SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining

SafeBuild-Bench:一种具有图增强数据挖掘能力的时序鲁棒建筑安全基准

Yi Cui, Zilin Wang, Yijie Xu, Qianyi Cai, Huizai Yao, Shuai Jiang, Bingzhuo Zhong, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究人员构建了图增强数据挖掘的时序鲁棒建筑安全基准SafeBuild-Bench,开发可扩展验证的GEMS流水线,发现现有多模态大语言模型对建筑安全理解仍不足。

Comments Accepted by KDD 2026. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01546 2026-08-04 physics.ao-ph cs.SE physics.comp-ph physics.flu-dyn 新提交 67%

FESOM2-JAX v1.0: a differentiable shadow of the ocean-sea-ice model FESOM2, cast onto GPUs

FESOM2-JAX v1.0:适配GPU的海冰-海洋模型FESOM2的可微镜像版本

Nikolay V. Koldunov, Sergey Danilov, Suvarchal Cheedela, Dmitry Sidorenko, Sebastian Beyer, Patrick Scholz, Ivan Kuznetsov, Jan Streffing, Aleksei Koldunov, Dmitrii Pantiukhin, Svetlana N. Loza, Thomas Jung

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 FESOM2-JAX v1.0是FESOM2基于JAX的可微GPU版本,与原Fortran版本结果一致,具备端到端可微性,是首个CMIP级非结构化网格可微全球海冰-海洋模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20318 2026-08-04 cs.CV cs.MM 版本更新 67%

UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval

UniCVR:从对齐到重排序的统一零样本复合视觉检索

Haokun Wen, Xuemeng Song, Haoyu Zhang, Weili Guan, Xiangyu Zhao, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学) Southern University of Science and Technology(南方科技大学) Pengcheng Laboratory(鹏城实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 UniCVR提出首个统一零样本复合视觉检索框架,结合多模态大语言模型与视觉语言预训练模型,通过两阶段方法实现多任务联合优化,实验表明其在五个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12147 2026-08-04 cs.CV 版本更新 67%

EgoIntent: A Pre-Outcome Micro-Step Benchmark for Understanding What, Why, and Next

EgoIntent: 一种用于理解‘是什么、为什么和下一步’的以自我为中心的步级基准

Ye Pan, Chi Kit Wong, Yuanhuiyi Lyu, Hanqian Li, Chenfei Liao, Jiahao Huo, Lutao Jiang, Zixin Zhang, Jiacheng Chen, Yuqian Fu, Xu Zheng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 EgoIntent基准旨在通过步级意图理解解决以自我为中心视频中对‘是什么、为什么和下一步’的细粒度理解难题,包含15种日常生活场景,评估模型在三个维度上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18130 2026-08-04 cs.SE 版本更新 67%

Doc2Feat-Bench: Evaluating Documentation-Driven Feature Addition

Doc2Feat-Bench:评估文档驱动的功能添加

Zhonghao Jiang, Le Deng, Jialun Cao, Michael Pradel, Zhongxin Liu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究构建了Doc2Feat-bench基准及经人工验证的子集,用于评估软件工程智能体基于文档变更实现功能的能力,发现当前最先进智能体在该任务上的最佳成功率仅为37.72%,且面临跨文件编辑等关键挑战。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27056 2026-08-04 cs.AI cs.CL 版本更新 62%

Setoka: A Benchmark for Hierarchical User Understanding in Personalized Agents over Heterogeneous Data

Setoka:面向异构数据下个性化智能体分层用户理解的基准测试集

Lingyang Zeng, Guangze Chen, Kaichen Yu, Zhicheng Pan, Siyang Weng, Zirui Hu, Xiangyun Du, Hailin He, Rong Zhang, Chengcheng Yang, Kai Huang, Xuan Zhou

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Setoka基准测试集,评估记忆增强型个性化智能体的分层用户理解能力,发现现有系统在需整合异构信息的任务中性能下降,推动相关记忆机制设计。

详情

展开后加载摘要…

URL PDF HTML 收藏