arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Pennsylvania(宾夕法尼亚大学)

共收录 75
2608.05466 2026-08-14 cs.AI cs.LG 版本更新

Recursive Synthesis for Long-Horizon Terminal Tasks

长视界终端任务的递归合成

Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang

机构 * Tencent HY LLM Frontier(腾讯HY大模型前沿团队) University of Georgia(佐治亚大学) University of Maryland, College Park(马里兰大学帕克分校) University of Pennsylvania(宾夕法尼亚大学) University of Minnesota, Twin Cities(明尼苏达大学双城分校) Indiana University(印第安纳大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出RST递归合成框架,低成本规模化生成3.7万余个长视界终端任务,经微调或PPO优化后,多款Qwen模型在多个终端基准任务上性能显著提升,且递归过程无明显上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00387 2026-08-14 cs.LG cs.HC 版本更新

Bayesian Distributional Models of Executive Functioning

执行功能的贝叶斯分布模型

Robert Kasumba, Zeyu Lu, Dom CP Marticorena, Mingyang Zhong, Paul Beggs, Anja Pahor, Geetha Ramani, Imani Goffney, Susanne M Jaeggi, Aaron R Seitz, Jacob R Gardner, Dennis L Barbour

机构 * Division of Computing and Data Science, Washington University(华盛顿大学计算与数据科学系) Department of Computer Science and Engineering, Washington University(华盛顿大学计算机科学与工程系) Department of Biomedical Engineering, Washington University(华盛顿大学生物医学工程系) Department of Psychology, University of Maribor(马里博大学心理学系) Department of Human Development and Quantitative Methodology, University of Maryland(马里兰大学人类发展与定量方法系) Department of Teaching and Learning, Policy and Leadership, University of Maryland(马里兰大学教学与学习、政策与领导系) Department of Psychology, Northeastern University(东北大学心理学系) Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系)

AI总结 本研究使用已知真实参数的受控模拟,评估分布潜变量模型(DLVM)和贝叶斯分布主动学习(DALE)相比传统独立最大似然估计(IMLE)的优势,证明DLVM结合DALE能更高效地估计认知表现分布。

Comments 45 pages, 9 figures, 2 tables + supplemental info

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19703 2026-08-14 math.ST cs.LG stat.TH 版本更新

Minimax and Adaptive Covariance Matrix Estimation under Differential Privacy

最小最大与自适应协方差矩阵估计在差分隐私下的研究

T. Tony Cai, Yicheng Li

机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) Department of Statistics and Data Science(统计与数据科学系) Tsinghua University(清华大学)

AI总结 本文研究在差分隐私约束下高维带状协方差矩阵的最小最大与自适应估计,提出一种新的差分隐私分块三对角估计器,达到运算规范和弗罗贝尼乌斯范数下的最优收敛速率,并引入自适应估计器在不预知衰减参数的情况下达到最优速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14390 2026-08-14 cs.CL cs.AI 版本更新

REHEARSE: Experiential Rehearsal for Verbal Confidence Calibration in Large Language Models

REHEARSE:大语言模型中用于语言置信度校准的经验式排练

Ke Fang, Tianyi Zhao, Qianwen Wang, Lu Cheng

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

AI总结 针对大语言模型置信度与实际正确性不匹配的问题,提出无训练的Rehearse方法,通过置信度校准博弈的反馈生成校准信号,在多模型多基准实验中显著降低了预期校准误差并提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13252 2026-08-13 cs.CL 版本更新

A Reality Check of Language Models as Formalizers on Constraint Satisfaction Problems

语言模型作为形式化工具在约束满足问题上的现实检验

Rikhil Amonkar, Ceyhun Efe Kayan, Qimei Lai, Ronan Le Bras, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Allen Institute for AI(艾伦人工智能研究所)

AI总结 研究评估了语言模型作为形式化工具在约束满足问题中的表现,发现其在15种模型-数据集组合中表现劣于作为求解器,尽管形式化更具可验证性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00114 2026-08-13 cs.CV 版本更新

Un-EVIMO: Unsupervised Event-Based Independent Motion Segmentation

Un-EVIMO:基于事件的无监督独立运动分割

Ziyun Wang, Jinyuan Guo, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学) Archimedes, Athena RC(阿基米德、阿泰纳RC)

AI总结 本研究提出首个利用几何约束生成IMO伪标签的无监督事件框架,在EVIMO数据集上评估显示其IMO分割性能与监督方法相当,可处理任意非预定物体且易扩展至无昂贵标注的数据集。

Comments European Conference on Computer Vision 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16057 2026-08-12 cs.CL cs.AI 版本更新

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning

跨商业学科的前沿人工智能性能:基于案例的知识工作和分析推理基准

Ajay Patel, Kartik Hosanagar, Ramayya Krishnan, Chris Callison-Burch, Karim Lakhani

机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) Carnegie Mellon University(卡内基梅隆大学) Harvard Business School, Harvard University(哈佛大学哈佛商学院)

AI总结 研究针对人工智能在白领分析性知识工作衡量上的差距,利用顶尖商学院案例教学法构建BusinessCaseBench基准,发现前沿AI模型在此基准上得分高且能力提升快,为商学院及相关职业角色带来启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09273 2026-08-12 cs.LG 版本更新

Instance-Adaptive Online Multicalibration

实例自适应在线多校准

Zhiming Huang, Jamie Morgenstern, Aaron Roth, Claire Jie Zhang

机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington(华盛顿大学保罗·G·阿伦计算机科学与工程学院) Department of Computer and Information Sciences, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系)

AI总结 本文提出了一种高效的实例自适应在线多校准算法,通过动态调整预测值的二进制网格来平衡最坏情况和易处理情况,实现了在不同实例下的最优误差控制。

Comments Affiliation update only; no changes to technical content

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21916 2026-08-11 cs.CL cs.SE 版本更新

MathDuels: A Self-Play Benchmark That Grows

MathDuels:评估大语言模型作为问题提出者和解决者

Zhiqiu Xu, Shibo Jin, Shreya Arya, Mayur Naik

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Mathematics, University of Pennsylvania(宾夕法尼亚大学数学系)

AI总结 MathDuels通过让模型同时扮演问题提出者和解决者角色,揭示了模型在两者能力上的差异,展示了评估方法在区分模型能力上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00077 2026-08-11 cs.CL cs.AI 版本更新

Autorubric: A Unifying Framework for Rubric-Based LLM Evaluation on Non-Verifiable Tasks

Autorubric:统一基于评分标准的LLM评估

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 Autorubric通过整合多种评分标准评估技术,提供统一的评分框架和默认设置,提升LLM评估的可靠性与一致性,并在多个基准测试中展示了其有效性。

Comments 60 pages; COLM 2026 camera ready copy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03159 2026-08-11 cs.DL cs.CL 版本更新

BibTeX Citation Errors in Scientific Publishing Agents: Evaluation and Mitigation

科学出版代理中的BibTeX引用幻觉:评估与缓解

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文评估并缓解了科学出版代理中BibTeX引用的字段级错误,通过构建包含931篇论文的基准测试,发现模型依赖参数记忆,提出clibib工具提升准确性。

Comments 35 pages; COLM 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15062 2026-08-11 cs.CL cs.AI 版本更新

SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning

SAKE:通过强化学习进行复杂LLM推理的结构代理知识外推

Jiashu He, Jinxuan Fan, Bowen Jiang, Ignacio Houine, Dan Roth, Alejandro Ribeiro

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 SAKE通过强化学习训练LLM自主检索和外推结构化知识,提升生物医学和常识领域推理性能,同时减少90%以上token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27581 2026-08-10 cs.LG 版本更新

MUGEN: A Unified Framework for Efficient Motion Understanding and Generation

MUGEN:用于高效运动理解与生成的统一框架

Zhankai Ye, Yukai Jin, Bingyang Wei, Bofan Li, Yusen Wu, Fangyi Li, Shangqian Gao, Xin Liu

机构 * Florida State University(佛罗里达州立大学) Texas Christian University(得克萨斯基督教大学) University of Miami(迈阿密大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 MUGEN是一个无码本的统一运动-语言框架,通过自适应长度自编码器实现高效运动压缩,在HumanML3D和SnapMoGen数据集上的生成、检索与对齐指标均表现优异,兼顾效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15771 2026-08-10 cs.CL 版本更新

Skill-RAG: Failure-State-Aware Retrieval Augmentation via Hidden-State Probing and Skill Routing

Skill-RAG: 通过隐藏状态探测与技能路由实现故障状态感知的检索增强

Kai Wei, Raymond Li, Xi Zhu, Zhaoqian Xue, Jiaojiao Han, Jingcheng Niu, Fan Yang

机构 * University of Michigan(密歇根大学) University of British Columbia(不列颠哥伦比亚大学) Rutgers University(罗格斯大学) University of Pennsylvania(宾夕法尼亚大学) New Jersey Institute of Technology(新泽西理工学院) TU Darmstadt(图腾斯大学) Wake Forest University(威克森林大学)

AI总结 提出Skill-RAG框架,通过轻量级隐藏状态探测器和基于提示的技能路由器,在检索失败时诊断原因并选择四种技能(查询重写、问题分解、证据聚焦、退出)纠正查询-证据错位,显著提升多轮检索后困难案例的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19179 2026-08-10 cs.LG 版本更新

PCAE: Learning Ordered Representations in Latent Space for Intrinsic Dimension Estimation via Principal Component Autoencoder

在潜在空间中学习有序表示以通过主成分自编码器进行内在维度估计

Qipeng Zhan, Zhuoping Zhou, Zexuan Wang, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出了一种结合非均匀方差正则化与等距约束的自编码器框架,用于在潜在空间中学习有序表示以估计内在维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23462 2026-08-06 cs.CL cs.AI cs.CY cs.DL 版本更新

War in the Abstract: The Rise and Consequences of Militarized Language in Scientific Communication

战争在摘要中:科学交流中军事化语言的兴起与后果

Sovesh Mohapatra, David Lydon-Staley, Dani S. Bassett

机构 * Department of Bioengineering, School of Engineering and Applied Science, University of Pennsylvania(宾夕法尼亚大学工程与应用科学学院生物工程系) Annenberg School of Communication, University of Pennsylvania(宾夕法尼亚大学安嫩伯格传播学院) Departments of Electrical & Systems Engineering and Physics & Astronomy, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系和物理与天文学系) Departments of Psychology and Biomedical Engineering, Yale University(耶鲁大学心理学系和生物医学工程系) Wu Tsai Institute, Yale University(耶鲁大学吴蔡研究所)

AI总结 通过分析2140万篇论文摘要和一项受试者内实验,发现2010-2025年间军事化术语使用增长48%-32%,且与全球冲突同步;实验表明战争框架降低了可信度、资助意愿和政策支持。

Comments 7 figures and 10 SI items

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20997 2026-08-04 cs.AI 版本更新

BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery

BioInsight: 面向交互式生物医学知识发现的多智能体编排

Jieyi Wang, Bingxuan Li, Nanyi Jiang, Desong Meng, Zirui Fan, Yuxin Guo, Jiayu Liu, Kunlun Zhu, Eddie Yang, Xiusi Chen, Pan Lu, Bingxin Zhao

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Purdue University(普渡大学) Stanford University(斯坦福大学)

AI总结 提出多智能体系统BioInsight,通过交互式界面生成替代静态报告,实现疾病证据的组织、推理与可视化,在多项生物医学任务中取得最优性能。

Comments Update some experiments and contents

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00093 2026-08-03 cs.CL cs.HC physics.data-an 版本更新

Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why

LLM作为评判者的评估一致性指标:报告什么及为什么

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文通过调查24篇近期论文,指出在二元评判标准下多数一致性指标冗余,强调Cohen's κ提供额外信息,并给出报告清单。

Comments 17 pages, 4 figures; arxiv ancillary files included

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22146 2026-08-03 cs.CL cs.LG 版本更新

FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale

精细指令:将合成指令扩展到预训练规模

Ajay Patel, Colin Raffel, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 研究针对大语言模型监督训练数据有限的问题,提出将互联网规模预训练文档知识转化为合成指令和答案训练对的程序,生成FineInstructions数据集,经实验验证该方法在预训练中表现优于其他技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08065 2026-07-30 cs.AI 版本更新

When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals

当大语言模型达成一致时,它们是正确的吗?将自一致性和跨模型一致性作为置信信号进行审计

Kaihua Ding

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 研究探讨大语言模型一致性与正确性的关系,通过大规模交叉运行研究,发现一致性是正确性的条件代理,对不饱和中层模型和计算分配较有用,对最一致的前沿模型存在过度自信问题,还公开了相关数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05175 2026-07-30 eess.SP cs.IT cs.LG math.IT 版本更新

Graph Signal Diffusion Models for Wireless Resource Allocation

图信号扩散模型用于无线资源分配

Yigit Berkay Uslu, Samar Hadou, Shirin Saeedi Bidokhti, Alejandro Ribeiro

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出利用图信号扩散模型进行无线网络资源优化,通过生成对抗性策略实现近最优资源分配,展示了在功率控制中的高效与泛化能力。

Comments Accepted for presentation at 2026 IEEE SPAWC (Signal Processing Advances in Wireless Communications)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21866 2026-07-29 cs.LG stat.ML 版本更新

Scaling Laws for Classical Machine Learning on Tabular Data: A Benchmark Study

表格数据上经典机器学习的缩放定律:一项基准研究

Kaihua Ding

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 该研究对表格数据上经典机器学习进行课堂规模复制,学生对多个数据集和模型家族运行固定协议,得出幂律拟合情况、模型家族内近似共享指数及复制器实现方差三个发现,并发布相关数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17036 2026-07-29 cs.IR cs.LG 版本更新

LiveGraph: Active-Structure Neural Re-ranking for Exercise Recommendation

LiveGraph: 基于主动-结构神经重排序的运动推荐

Rong Fu, Zijian Zhang, Jiekai Wu, Kun Liu, Xianda Li, Haoyu Zhao, Yang Li, Yongtai Liu, Ziming Wang, Rui Lu, Simon Fong

机构 * University of Macau(澳门大学) University of Pennsylvania(宾夕法尼亚大学) Tongji University(同济大学) Juntendo University(立命馆大学) University of Southampton(南安普顿大学) University of Bologna(博洛尼亚大学) Wuhan University(武汉大学) University of the Chinese Academy of Sciences(中国科学院大学) Hanyang University(汉阳大学) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 LiveGraph通过图表示增强策略和动态重排序机制,解决学生参与长尾分布和个性化学习轨迹适应问题,提升推荐精度与教学多样性。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05899 2026-07-29 cs.CV cs.GR 版本更新

HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing

HOLODECK 2.0:基于视觉-语言的3D世界生成与编辑

Zixuan Bian, Ruohan Ren, Yue Yang, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学) Cornell University(康奈尔大学)

AI总结 HOLODECK 2.0通过视觉-语言模型生成高质量3D场景并支持交互式编辑,提升游戏设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11912 2026-07-28 cs.LG cs.AI 版本更新

How Transformers Learn to Plan via Multi-Token Prediction

Transformer 如何通过多令牌预测学习规划

Jianhao Huang, Zhanpeng Zhou, Renqiu Xia, Baharan Mirzasoleiman, Weijie Su, Wei Huang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) University of Pennsylvania(宾夕法尼亚大学) RIKEN Center for Advanced Intelligence Project(日本理化学研究院先进智能项目中心) The Institute of Statistical Mathematics(统计数学研究所)

AI总结 本文研究多令牌预测如何促进推理,特别是规划,通过实验和理论分析展示其优于单令牌预测的性能及背后的机制。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18748 2026-07-27 eess.SP cs.LG 版本更新

Fast State-Augmented Learning for Wireless Resource Allocation with Dual Variable Regression

基于双变量回归的无线资源分配快速状态增强学习

Yigit Berkay Uslu, Navid NaderiAlizadeh, Mark Eisen, Alejandro Ribeiro

机构 * Department of Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计与生物信息学系) Johns Hopkins Applied Research Laboratory (APL)(约翰霍普金斯应用研究实验室)

AI总结 研究多用户无线网络资源分配问题,提出基于状态增强图神经网络的方法,利用双变量回归实现对偶乘数近最优初始化加快推理,通过最大化拉格朗日函数改善模型训练,经实验验证算法性能优越并给出收敛结果和概率界。

Comments Accepted for publication in IEEE Transactions on Signal Processing (TSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14953 2026-07-24 cs.PL cs.LG 版本更新

Compiling to recurrent neurons

编译到循环神经元

Joey Velez-Ginorio, Nada Amin, Konrad Kording, Steve Zdancewic

机构 * University of Pennsylvania(宾夕法尼亚大学) Harvard University(哈佛大学)

AI总结 本研究通过编译迭代为循环神经元,使离散结构在可微编程中得以有效利用,提升了神经网络的学习效率和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17330 2026-07-23 cs.LG cs.AI 版本更新

SubQuad: Near-Quadratic-Free Structure Inference with Distribution-Balanced Objectives in Adaptive Receptor framework

SubQuad:在自适应受体框架中利用分布平衡目标的近二次自由结构推断

Rong Fu, Zijian Zhang, Kun Liu, Jiekai Wu, Xianda Li, Simon Fong

机构 * University of Macau(澳门大学) University of Pennsylvania(宾夕法尼亚大学) University of Southampton(南安普顿大学) Juntendo University(顺天堂大学) University of Bologna(博洛尼亚大学)

AI总结 SubQuad通过结合抗原感知的近子二次检索、GPU加速的亲和力核、学习多模态融合和公平性约束聚类,解决大规模群体适应性免疫谱分析中的二次成本和数据不平衡问题,提升效率与公平性。

Comments 27 pages, 9 figures. In the previous version, Juntendo University was erroneously listed as the affiliation; we must clarify that this paper has absolutely no relation to Juntendo University. Therefore, we have replaced this affiliation in the new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08998 2026-07-23 stat.ML cs.LG 版本更新

A Confidence Interval for the $\ell_2$ Expected Calibration Error

$\ell_2$期望校准误差的置信区间

Yan Sun, Pratik Chaudhari, Ian J. Barnett, Edgar Dobriban

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 研究针对$\ell_2$期望校准误差开发置信区间,考虑top-1到-k校准,证明ECE去偏估计量的渐近正态性,构建渐近有效置信区间,实验表明该方法产生的置信区间比基于重采样的方法更短。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14512 2026-07-22 cs.AI cs.CL cs.LG 版本更新

RetroAgent: Harnessing LLMs to Search Over Structured Memory for Agentic Retrosynthesis Planning

RetroAgent:利用大语言模型在结构化记忆中进行搜索以实现智能逆合成规划

Yanqiao Zhu, Jingru Gan, Xiaoqi Sun, Fang Sun, Yidan Shi, Md Mofijul Islam, Chao Shang, Wenhao Gao, Connor W. Coley, Yizhou Sun, Wei Wang

机构 * UCLA(加利福尼亚大学洛杉矶分校) MIT(麻省理工学院) Amazon(亚马逊公司) UPenn(宾夕法尼亚大学)

AI总结 研究多步逆合成规划难题,提出RetroAgent智能体,通过结合结构化记忆桥接符号搜索与神经推理,利用记忆和化学工具观察搜索状态,实验证明其在分布内和分布外基准测试中性能强且泛化能力好。

Comments To appear at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏