arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1893 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 1893 篇

2606.22798 2026-06-23 cs.CL 新提交 57%

Does the Same Token Mean the Same State? MoE Routing as Signal for Reasoning Control

相同的 Token 是否意味着相同的状态?MoE 路由作为推理控制的信号

Kang Chen, Minshen Yu, Junjie Nian, Yaoning Wang, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 研究发现稀疏 MoE 语言模型中相同 token 的路由状态因上下文而异,基于此提出 RAD 方法,通过路由一致性选择输出,无需解析答案字符串,在数学、GPQA 和代码任务上表现与多数投票相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22528 2026-06-23 cs.AI 新提交 57%

Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents

治理衰减:上下文压缩如何悄然消除长周期LLM智能体中的安全约束

Shiyang Chen

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究发现LLM智能体的上下文压缩机制会无意中移除安全约束,导致违规行为;提出ConstraintRot基准和Constraint Pinning缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22509 2026-06-23 cs.AI 新提交 57%

Imagine to Ensure Safety in Hierarchical Reinforcement Learning

想象以确保分层强化学习的安全性

Gregory Gorbov, Artem Latyshev, Aleksandr I. Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所) FRC Computer Science RAS(俄罗斯科学院联邦研究中心计算机科学研究所)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出结合可学习世界模型与高低层策略的分层方法,通过高层生成安全子目标、低层利用想象滚动减少不安全行为,在长时域任务中显著优于现有安全强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21868 2026-06-23 cs.LG 新提交 57%

WiSP: A Working-Set View of Mixture-of-Experts Serving on Extremely Low-Resource Hardware

WiSP:极低资源硬件上混合专家模型服务的工作集视角

Jiamu Zhang, Liang Wu, Mayank Darbari, Liangjie Hong

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构、匿名城市、匿名地区、匿名国家)

专题命中 规划决策 :workflow(abstract);分类 cs.LG

AI总结 针对低资源GPU上MoE模型因专家层CPU卸载导致稀疏性优势丧失的问题,提出工作集分页(WiSP)和边际价值工作集分配(MV-WSA),实现专家与KV缓存间VRAM动态分配,解码吞吐量提升至1.95倍。

Comments 18 pages, 6 figures, 9 tables. Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21836 2026-06-23 cs.AR cs.AI 新提交 57%

AgentDSE: Reasoning-Augmented Architectural Design Space Exploration

AgentDSE:推理增强的架构设计空间探索

Chenyu Wang, Jiahe Caroline Shi, David Kong, Duane S. Boning, Zishen Wan, Yilun Du, Vijay Janapa Reddi

机构 * Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出AgentDSE,利用大语言模型编码代理自动进行架构推理,在DNN加速器映射、软硬件协同设计和CPU缓存层次优化中,以少两个数量级的评估次数达到竞争或更优的设计质量。

Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21802 2026-06-23 cs.CL 新提交 57%

When to Plan, When to Polish: Noise Level as a Granularity Axis for Diffusion Language Models

何时规划,何时精炼:噪声水平作为扩散语言模型的粒度轴

Peihong Li, Yuanjie Shi, Yan Yan

机构 * Washington State University(华盛顿州立大学)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 提出噪声依赖粒度控制(NDGC)方法,通过噪声水平调节训练和推理的粒度,实现从粗到细的去噪,无需显式规划器或层次结构,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21734 2026-06-23 cs.CV cs.AI 新提交 57%

HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning

HPP:通过解耦感知与推理的分层程序化探测用于长视频理解

Awais Rauf, Ahmed Hasssan, Greg Slabaugh

机构 * Queen’s University Belfast(贝尔法斯特女王大学) AMD(AMD公司) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出HPP框架,通过将长视频理解重构为分层视频的迭代程序化探索,解耦语义感知与高阶时序推理,在LongVideoBench等基准上取得显著提升。

Comments Project page: https://awaisrauf.com/HPP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21616 2026-06-23 cs.CL 新提交 57%

LLM and Human Modes of Representation

LLM与人类的表征模式

Shalom Lappin

机构 * Shalom Lappin

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 研究比较大型语言模型(LLM)与人类在语言知识和现实推理中的表征差异,发现LLM在语言任务上表现优异但处理方式不同,且在推理任务中学习与泛化效率低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21422 2026-06-23 cs.LG 新提交 57%

Federated Temporal Attention Intelligence for Cyber-Resilient IoMT: Lightweight Digital Twins and PPO-Driven Honeypot Deception

面向网络韧性医疗物联网的联邦时序注意力智能:轻量级数字孪生与PPO驱动的蜜罐欺骗

Syed Zeeshan Haider, Anwar Shah, Muneeb Arif, Hamza Iftikhar, Waqas Ali

机构 * FAST National University of Computer and Emerging Sciences(FAST国立计算机与新兴科学大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出LDT-FRL框架,结合时序注意力编码器、轻量级LSTM数字孪生、联邦PPO智能体和蜜罐层,在资源受限的IoMT设备上实现隐私保护的网络攻击检测与响应,在CICDDoS 2019和TON-IoT数据集上分别达到99.66%和99.95%的测试准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21321 2026-06-23 cs.LG 新提交 57%

Objective-Behavior Alignment: Diagnostics for MORL Policy Selection

目标-行为对齐:多目标强化学习策略选择的诊断方法

Antonio Mone, Zuzanna Osika, Florian Felten, Pradeep K. Murukannaiah, Mark Fuge, Frans A. Oliehoek, Luciano Cavalcante Siebert

机构 * Delft University of Technology(代尔夫特理工大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 规划决策 :workflow(abstract);分类 cs.LG

AI总结 提出一种诊断工作流,自动揭示帕累托前沿上仅靠目标值无法体现的行为差异,通过定量和可视化工具辅助策略选择,在简单网格和连续控制基准上验证有效性。

Comments 22 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21306 2026-06-23 cs.AI 新提交 57%

Towards Dys-XAI: Influence-Based Explanations for Dysarthria Severity Assessment

迈向 Dys-XAI:基于影响的构音障碍严重程度评估解释

Xiaoliang Wu, Qiyang Sun, Yupei Li, Erfan Loweimi, Jennifer Williams, Zhengjun Yue

机构 * University of Southampton(南安普顿大学) Imperial College London(帝国理工学院) University of Edinburgh(爱丁堡大学) King's College London(伦敦国王学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出基于影响的实例级可解释性框架,通过支持性和竞争性训练样本解释构音障碍严重程度评估的深度学习模型决策,并通过删除实验验证解释有效性。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20978 2026-06-23 cs.AI cs.HC 新提交 57%

How Should Agents Read Demonstrations? Hierarchical Structure Beats Flat Action Logs

智能体应如何阅读演示?层级结构优于扁平动作日志

Honjar Xing, Jefferson Lin, Henry Lieberman

机构 * MIT Computer Science and Artificial Intelligence Laboratory (CSAIL)(麻省理工学院计算机科学与人工智能实验室(CSAIL))

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出将演示中的动作序列组织为带标签的层级子目标,在85个Web自动化任务中,层级结构将模糊描述任务的通过率从76.7%提升至90.7%,而扁平结构改进不显著,消融实验表明子目标分组是唯一驱动因素。

Comments Accepted at the 5th Deep Learning for Code (DL4C) Workshop, ICML 2026. 8 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20900 2026-06-23 cs.CL 新提交 57%

Storyline Trees: Hierarchical Representations for Long-Form Narratives

故事线树:长篇叙事的层次化表示

Litu Ou, Mirella Lapata

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 提出故事线树,通过自顶向下和自底向上过程构建叙事层次结构,实现自适应检索,在长上下文叙事问答中优于强基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20672 2026-06-23 cs.NE cs.AI 新提交 57%

Genetic Algorithm Based Coordination and Optimization Model for Generation Grid Load Storage in Active Distribution Networks

基于遗传算法的主动配电网源网荷储协调优化模型

Jinlu Zhang, Fujian Chi, Tianhan Ling, Yulong He, Kejia Zhang, Hongxing Lv, Sheng Wang

机构 * State Grid Tianjin Binhai Electric Power Supply Company(国网天津滨海供电公司) State Grid Tianjin Electric Power Company(国网天津电力公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出一种结合模糊逻辑与遗传算法的优化框架,用于主动配电网中发电、并网、负荷及储能设施的协调与风险评估,通过模糊集处理不确定性,利用遗传算法优化调度,降低技术约束,保持投资水平。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17642 2026-06-23 cs.AI 新提交 57%

FinAcumen: Financial Multimodal Reasoning via Self-Evolving Experience Memory Harness

FinAcumen: 通过自演化经验记忆实现的金融多模态推理

Pianran Guo, Pengcheng Zhou, Yucheng Jian, Shuhua Chen, Zhonfliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出FinAcumen框架,通过选择性经验记忆机制增强工具增强型多模态推理,在四个金融基准上持续提升冻结的8B视觉语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16878 2026-06-23 cs.LG 新提交 57%

Integrated Marketing Attribution: A Bayesian Framework for Privacy-Safe Granular Measurement Anchored in MMM

集成营销归因:基于贝叶斯框架的隐私安全粒度测量,锚定于MMM

Meghana R. Bhat, Ankit Umare, Utsav Aggarwal, Richard Vecsler, Arunkumar Mani, Karthik Nair, Chandhu Nair

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出集成营销归因(IMA)框架,结合营销组合模型(MMM)与贝叶斯归因模型,从聚合数据中推导出活动级效果,实现隐私安全且粒度精细的归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15862 2026-06-23 cs.AI 新提交 57%

RetailBench: Benchmarking long horizon reasoning and coherent decision making of LLM agents in realistic retail environments

RetailBench: 在真实零售环境中评估LLM代理的长期推理与连贯决策能力

Linghua Zhang, Jun Wang, Jingtong Wu, Zhisong Zhang

机构 * Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出RetailBench基准,模拟单店超市运营,评估LLM代理在长期决策中的表现,发现多数模型无法持续生存,与最优策略差距显著。

Comments The submission of this paper was a mistake. This is the second version of arXiv:2603.16453, so it should have replaced the original 2603 version through a replacement submission, rather than being published as a new paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14935 2026-06-23 cs.AI 新提交 57%

PrologMCP: A Standardized Prolog Tool Interface for LLM Agents

PrologMCP:面向LLM代理的标准化Prolog工具接口

Agnieszka Mensfelt, Adarsh Prabhakaran, Adrian Haret, Vince Trencsenyi, Kostas Stathis

机构 * Royal Holloway, University of London(伦敦大学皇家霍洛威学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出PrologMCP,一个通过模型上下文协议将Prolog暴露为状态化工具的任务无关开源服务器,使LLM代理能够通过翻译-运行-检查-修复循环稳健地委托演绎推理,在PARARULE-Plus上达到或超越推理型LLM。

Comments Accepted at Joint Workshop on Statistics and Knowledge Integration for Logic, Learning, Ethical Decisions, and LLMs, 18 July 2026, Lisbon v2: Added references to other Prolog MCP servers; fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20291 2026-06-19 cs.LG cs.CV 新提交 57%

Integrating national forest inventory, airborne lidar, and satellite imagery for wall-to-wall mapping of forest structure with computer vision

整合国家森林清查、机载激光雷达和卫星影像,利用计算机视觉实现森林结构的全覆盖制图

Luke J. Zachmann, David D. Diaz, Vincent A. Landau, Chelsey Walden-Schreiner, Tony Chang, Nathan E. Rutenbeck, Katharyn A. Duffy, Kiarie Ndegwa, Andreas Gros, Scott Conway, Guy Bayes

机构 * Vibrant Planet Public Benefit Corporation(Vibrant Planet 公益公司)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出VibrantForests框架,结合卫星影像、激光雷达样本和计算机视觉,以10米分辨率生成美国本土的冠层覆盖、高度、生物量等森林属性图,减少饱和与回归均值问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19656 2026-06-19 cs.RO cs.LG 新提交 57%

DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning

DF-ExpEnse: 扩散滤波探索用于高效样本微调

Calvin Luo, Chen Sun, Shuran Song

机构 * Stanford University(斯坦福大学) Brown University(布朗大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出DF-ExpEnse探索技术,利用生成控制策略的多模态建模能力和评论家集成,在微调中高效收集在线经验,提升样本效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19300 2026-06-18 cs.CV cs.LG 新提交 57%

Confidence is Not Reliability: Rethinking MC Dropout in Brain Tumour Segmentation

置信度不等于可靠性:重新思考脑肿瘤分割中的MC Dropout

Xin Ci Wong, Duygu Sarikaya, Kieran Zucker, Marc De Kamps, Nishant Ravikumar

机构 * Centre for Doctoral Training in AI for Medical Diagnosis and Care(人工智能辅助医疗诊断与护理博士培训中心) School of Computing, University of Leeds(利兹大学计算机学院) School of Computer Science, University of Leeds(利兹大学计算机科学学院) Leeds Cancer Centre, St James’s University Hospital, Leeds, UK(利兹癌症中心,圣詹姆斯大学医院,利兹,英国)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 通过MC Dropout不确定性估计,发现全局不确定性-误差对齐(AUROC≈0.97)可能掩盖关键子区域(如增强肿瘤)的严重误校准(ECE=0.915),表明子区域校准评估对临床安全至关重要。

Comments Accepted for MIUA2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19140 2026-06-18 cs.LG 新提交 57%

ChronoSurv: A Clinical Pathway-Guided Graph Framework for Multimodal Survival Analysis

ChronoSurv:一种临床路径引导的多模态生存分析图框架

Hugo Miccinilli, Theo Di Piazza

机构 * Université Paris-Saclay, CentraleSupélec, MICS, France(巴黎萨克雷大学,中央超算学院,MICS,法国) University of Lyon, INSA Lyon, CREATIS, France(里昂大学,里昂国家理工学院,CREATIS,法国)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 提出ChronoSurv,一种基于有向图的多模态生存分析框架,通过层次化拓扑和异质消息传递建模临床轨迹,在头颈癌数据集上取得最优判别性能与可靠校准。

Comments Accepted at MICCAI 2026. Submitted version due to embargo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18967 2026-06-18 cs.LG 新提交 57%

EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts

EfficientRollout: 面向强化学习推演的感知系统的自推测解码

Minseo Kim, Minjae Lee, Seunghyuk Oh, Kevin Galim, Donghoon Kim, Coleman Hooper, Harman Singh, Amir Gholami, Hyung Il Koo, Wonjun Kang

机构 * FuriosaAI University of California, Berkeley(加州大学伯克利分校)

专题命中 规划决策 :agentic(abstract);分类 cs.LG

AI总结 针对强化学习推演中自回归解码延迟瓶颈,提出感知系统的自推测解码框架,通过量化自推测解码器与感知系统的推测开关策略,在保持模型质量前提下降低推演和端到端延迟。

Comments Project Page: https://github.com/furiosa-ai/EfficientRollout

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18963 2026-06-18 cs.LG 新提交 57%

Online Reward-Punishment Learning from Fixed-Channel Perceptual Event Streams without Environment Rewards

无环境奖励的固定通道感知事件流在线奖惩学习

Zirong Li

机构 * Zirong Li(李 Cirong)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出OHIRL框架,在无标量奖励下通过固定通道感知流进行在线奖惩学习,利用内部轨迹评估器推断感知维度的效价,在XOR任务和CartPole等控制任务中达到高准确率。

Comments 9 pages, 5 figures, 6 tables; 13-page technical supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18954 2026-06-18 cs.CL 新提交 57%

GraphPO: Graph-based Policy Optimization for Reasoning Models

GraphPO:基于图的推理模型策略优化

Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Ant Group(蚂蚁集团)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 提出GraphPO框架,将推理轨迹建模为有向无环图,通过合并语义等价路径减少冗余探索,并利用边级优势函数提高推理效率,在多个基准上优于链式和树式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18847 2026-06-18 cs.AI 新提交 57%

WorldLines: Benchmarking and Modeling Long-Horizon Stateful Embodied Agents

WorldLines: 对长时域有状态具身智能体进行基准测试与建模

Yehang Zhang, Jianchong Su, Haojian Huang, Yifan Chang, Tianhao Zhou, Xinli Xu, Yingjie Xu, Yinchuan Li, Zexi Li, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Knowin

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出WorldLines基准,通过构建带时间跨度的家庭轨迹(含对话、动作、状态变化等)评估具身智能体的长时记忆与任务规划能力,并设计ObsMem记忆框架提升状态感知决策。

Comments 27 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18828 2026-06-18 cs.RO cs.AI 新提交 57%

Space Is Intelligence: Neural Semigroup Superposition for Riemannian Metric Generation

空间即智能:用于黎曼度量生成的神经半群叠加

Chenghao Xu

机构 * National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(湖南大学机器人视觉感知与控制技术国家工程研究中心)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出将智能置于空间本身,通过神经半群叠加机制生成黎曼度量,使动作简化为测地线跟随,在单障碍场景训练后零样本泛化到未见配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18788 2026-06-18 cs.CV cs.CL 新提交 57%

HandwritingAgent: Language-Driven Handwriting Synthesis in Scalable Vector Space

HandwritingAgent: 语言驱动的可缩放矢量空间手写合成

Jaward Sesay, Yue Yu, Börje F. Karlsson

机构 * Beijing Institute of Technology(北京理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 提出HandwritingAgent,利用大推理模型在SVG格式中自动回归生成手写笔画序列,无需风格特定训练,通过自然语言和参考图像控制风格,在模仿、识别、多语言及复杂数学表达式合成等任务上达到或超越现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18485 2026-06-18 cs.SD cs.AI eess.AS 新提交 57%

MagpieTTS-LF: Inference-Time Long-Form Speech Generation Without Training on Long-Form data

MagpieTTS-LF:无需长语音数据训练的推理时长生成长语音生成

Subhankar Ghosh, Jason Li, Paarth Neekhara, Shehzeen Hussain, Ryan Langman, Xuesong Yang, Roy Fejgin

机构 * NVIDIA Corporation(英伟达公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 提出MagpieTTS-LF推理时方法,通过软注意力先验、有状态推理和历史感知文本编码,在不重新训练模型的情况下实现连贯的长语音生成。

Journal ref Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12837 2026-06-18 cs.CL 新提交 57%

LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling

LoHoSearch: 超越人类难度上限的长时域搜索代理基准测试

Jiarui Zhao, Rongzhi Zhang, Lingchuan Liu, Hao Yang, Xunliang Cai, Xi Su

机构 * Meituan(美团)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 提出LoHoSearch基准,基于700万维基实体知识图谱自动构建544个复杂问题,评估显示最强模型仅34.74%准确率,远超人类难度上限。

详情

展开后加载摘要…

URL PDF HTML 收藏