arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-20 至 2026-08-20 共收录 177 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 15 篇

2608.18389 2026-08-20 cs.AI 新提交 84%

A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations

锯齿状前沿:评估代码智能体对语义保留转换的鲁棒性

Hasan Najib Mahmud (1), Shreya Gupta (2), Isha Chaudhary (3), Nathaniel Enis (1), Ravi Mangal (1), Gagandeep Singh (3), Corina Pasareanu (4) ((1) Colorado State University, (2) Microsoft, (3) University of Illinois Urbana-Champaign, (4) Carnegie Mellon University)

专题命中 软件智能体 :agent(summary_cn,abstract);agentic(abstract);分类 cs.AI

AI总结 该研究评估AI代码智能体对语义保留代码转换的鲁棒性,发现其存在锯齿状鲁棒性前沿,mini-SWE agent更鲁棒,顶级模型仍易受此类扰动影响,引发部署可靠性担忧。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18227 2026-08-20 cs.RO 新提交 82%

Revisiting the "Push-T" Robot Manipulation Task with Agentic Robotics

用智能体机器人技术重新审视“Push-T”机器人操作任务

Shuangyu Xie, Kaiyuan Chen, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 该研究在智能体机器人技术背景下,借助带Fable 5的Claude Code编码智能体,无需演示数据解决Push-T等机器人操作任务,其策略成功率达100%,步骤比基准扩散策略少46%,还支持多字母操作及跨实体机械臂仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18565 2026-08-20 cs.SE 新提交 79%

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation

SemaPLC:一种基于项目、经验证门控的PLC代码生成智能体框架

Yanlun Tu, Huacan Wang, Ziyue Zhou, Jie Zhou, Ningyan Zhu, Ge Chen, Wangyi Chen, Tengfei Zhou, Yifan Zhou, Dasheng Yang, Xiaofeng Mou, Hui Zhang, Yi Xu

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 SemaPLC是基于项目、经验证门控的PLC代码生成智能体框架,通过外部检查确认任务完成,在多模型的POU任务及项目上下文任务中均表现最优,动态行为测试得分显著高于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16934 2026-08-20 cs.AR cs.CL 版本更新 79%

SeqFeed: Improving Agentic RTL Code Generation with Sequential Behavior Feedback

SeqFeed:通过顺序行为反馈改进智能体RTL代码生成

Yuxin Du, Juxin Niu, Tao Hu, Xi Wang, Zhe Jiang, Nan Guan

专题命中 软件智能体 :agentic(title,abstract);分类 cs.CL

AI总结 针对智能体RTL代码生成的时序信息传递难题,本研究提出含SeQuery和SeGraph机制的SeqFeed,通过满足三项反馈要求提升LLM的RTL代码生成通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18280 2026-08-20 cs.SE cs.AI cs.CL cs.LG 新提交 77%

What Makes Software Issue Resolution Tasks Difficult for Agents?

什么因素导致软件问题解决任务对智能体而言难度较高?

Ebtesam Al-Haque, Brittany Johnson

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究提出测量框架,基于CoderForge-Preview数据集的实证分析,发现软件问题解决任务难度可通过静态特征预测,核心驱动因素为补丁碎片化与代码库规模,为构建难度可控的智能体评估基准奠定基础。

Comments To appear in ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18840 2026-08-20 cs.RO cs.CV 新提交 67%

Beyond Placement and Articulation: Usage-Driven Code Scenes for Embodied Interaction

超越布局与关节运动:面向具身交互的使用驱动型代码场景

Zijian Xiao, Zipeng Ye, Jinkun Hao, Xiong Yang, Yuchen Xie, Ran Yi

机构 * Meituan(美团)

专题命中 软件智能体 :agent(abstract);agentic(abstract)

AI总结 针对现有代码场景生成方法未建模场景功能使用的问题,提出RoomWright框架,通过使用驱动型物体推理与代码智能体实现可执行、可编辑的仿真就绪3D场景,为具身AI与策略学习提供交互式环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12036 2026-08-20 cs.AI cs.CL cs.HC cs.LG cs.MA 版本更新 67%

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mechanist:作为科学仪器的AI,用于发现智能的机制

Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang, Zhixiang Cui, Xin Xu, Yunzhi Yao, Buqiang Xu, Fei Shen, Haozhe Luo, Yunxiang Wei, Ningyu Zhang, Julian McAuley, Tat Seng Chua, Huajun Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Heriot-Watt University(赫瑞瓦特大学) Southern University of Science and Technology(南方科技大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) Northeastern University(东北大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07625 2026-08-20 cs.AR cs.MA 版本更新 67%

HINT: Toward an Executable Hardware-Intent Representation Layer for LLM-Driven RTL Generation

HINT:面向大语言模型驱动的RTL生成的可执行硬件意图表示层

Tairan Cheng, Yi Liu, Dongsheng Zuo, Zhengyuan Shi, Hongji Zhang, Xiangfei Hu, Maoshuo He, Hao Yan, Qiang Xu

专题命中 软件智能体 :agent(abstract);workflow(abstract)

AI总结 本文提出HINT可执行硬件意图表示层,用于LLM驱动的RTL生成,在7个算子案例中全量生成合规可综合RTL,面积较人工实现及直接C2RTL结果显著降低,还验证了其在各类复杂设计中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25692 2026-08-20 cs.SE cs.LG 版本更新 62%

A Configuration-First Framework for Reproducible, Low-Code Machine Learning: a Localization Use Case

一种面向可重复、低代码定位的配置优先框架

Tim Strnad (Jožef Stefan Institute, Slovenia), Blaž Bertalanič (Jožef Stefan Institute, Slovenia), Carolina Fortuna (Jožef Stefan Institute, Slovenia)

机构 * Jožef Stefan Institute(乔塞夫·斯蒂芬研究所)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 本文提出了一种低代码、配置优先的框架,通过版本化配置和自动化流程提升定位任务的可重复性和效率。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01916 2026-08-20 cs.AI 版本更新 57%

ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair

ContextSniper: AntTrail的令牌高效代码记忆用于仓库级程序修复

Chiwang Luk, Matin Mohammad Najafi, Zhifeng Jia, Wei Yang, Xiuchang Li, Jinwei Zhu, Yang Ren, Lei Chen, Gao Cong

机构 * Huawei(华为) HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出ContextSniper,一种令牌高效的代码记忆层,通过精准证据选择、混合检索排序和意图感知上下文门控,在SWE-bench Lite上减少51.5%令牌使用和36.4%成本,修复率仅轻微下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15232 2026-08-20 cs.SE 版本更新 57%

When Agents Fail: A Comprehensive Study of Bugs in LLM Agents with Automated Labeling

当代理失效:对LLM代理中bug的全面研究与自动化标记

Niful Islam, Ragib Shahriar Ayon, Deepak George Thomas, Shibbir Ahmed, Mohammad Wardat

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文通过分析1187个bug相关帖子和代码片段,研究LLM代理中的bug类型、根本原因及影响,并构建BugReAct代理自动标记bug。

Comments Accepted at ISSRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18129 2026-08-20 math.OC cs.MA 新提交 50%

Simulation-Optimization of Systems of Optimizers: Exploiting the Inner Optimization's Geometry

优化器系统的模拟优化:利用内部优化的几何结构

Zhou He

专题命中 软件智能体 :agent(abstract)

AI总结 该研究针对优化器系统(SOSO)的模拟优化,提出利用内部优化几何结构的 PRIME 求解器,在多类测试平台上实现了优异性能,大幅降低了方差,为模拟优化提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16911 2026-08-20 stat.CO cs.PL 版本更新 50%

r2py: AI-Assisted Conversion of R Statistical Packages to Python

r2py:用于AI辅助将R统计包转换为Python的框架

Yufei Cai, Jun Li

专题命中 软件智能体 :agentic(abstract)

AI总结 本文提出r2py,这是Claude Code环境中首个七阶段AI辅助方法,可将R包系统转换为数值保真的原生Python库,在KernSmooth包上实现的r2py_kernsmooth通过518项测试,有效数字一致性达6-10位。

Comments v2: substantially extended. Adds a second case study (rpart) reached through R's.Call() interface, and a five-phase prologue reconstructing the portion of R's C API the package uses so its original C compiles without R. v1 covered KernSmooth only. Title shortened

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 3 篇

2608.18647 2026-08-20 cs.RO cs.LG 新提交 70%

Progressive Experience Fusion for Multi-Task World Model Control in Endovascular Navigation

用于血管内导航多任务世界模型控制的渐进式经验融合

Harry Robertshaw, Maxence Boels, Nikola Fischer, Sebastien Ourselin, Christos Bergeles, Alejandro Granados, Thomas C Booth

机构 * School of Biomedical Engineering & Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院) Surgical & Interventional Engineering(外科与介入工程)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 本研究提出渐进式经验融合(PEF)训练多任务TD-MPC2控制器,在血管内导航任务中提升了成功率,可实现跨血管结构迁移与患者特异性微调,为临床应用提供概念验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18547 2026-08-20 cs.HC cs.CY 新提交 67%

Measuring Proof Burden in Public Bounty Listings: A RentAHuman Case Study

测量悬赏清单中的证明负担:RentAHuman案例研究

Iman YeckehZaare (MIT Center for Collective Intelligence, Honor Education)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract)

AI总结 本研究以RentAHuman平台为案例,通过审核981个悬赏清单,测量证明负担,发现56.2%的清单证明负担评分达4或5分,且智能体/机器人标记的清单更常要求现实世界行动等证明。

Comments Accepted at ACM HCOMP 2026 (2026 ACM Conference on Human-AI Complementarity and Alignment), September 27-30, 2026, Alexandria, VA, USA. 10 pages, 4 figures, 3 tables. Camera-ready version; published version DOI: https://doi.org/10.1145/3834580.3838744

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18307 2026-08-20 cs.AI cs.CL cs.HC 新提交 62%

ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents

ComponentBench:诊断计算机使用智能体的组件级故障

Tianchen Guan, Xinlei Lin, Royce Cheng-Yue, Xiangjun Wang, Shuyan Zhou

机构 * Duke University(杜克大学) Amazon AGI SF Lab(亚马逊AGI旧金山实验室)

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ComponentBench基准及诊断流水线,评估7种计算机使用智能体在4种观测动作空间下的表现,发现观测动作空间会显著影响性能,且空间操作仍是智能体的挑战。

Comments Accepted at COLM 2026. 30 pages (10 pages main text), 10 figures, 15 tables. Website: this https URL (https://componentbench.com) Code: this https URL (https://github.com/TianchenGuan/ComponentBench) Data: this https URL (https://huggingface.co/datasets/TianchenGuan/ComponentBench)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 8 篇

2608.18110 2026-08-20 cs.AI 新提交 83%

Emergence of Agentic AI: A Review on Evolution, Background, Working Principles, Applications, Adoption Factors, and Future Research Directions

智能体AI的涌现:关于演进、背景、工作原理、应用、采用因素及未来研究方向的综述

AKM Bahalul Haque, Al Amin Islam Ridoy, Mohammad Rayhan, Ivan Porres

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI

AI总结 本系统综述梳理智能体AI的演进、原理、应用等,构建利益相关者采用框架,为相关人员提供该领域现状、缺口及未来方向的全面见解。

Comments Accepted Version, 54 Pages, 13 tables, 7 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18177 2026-08-20 cs.LG cs.MA 新提交 79%

Towards Reversible Forgetting: Managing Obsolete Knowledge in Continual Enterprise AI Agents

迈向可逆遗忘:在持续式企业智能体中管理过时知识

Nilutpaul Sarker Yash, Tirtho Roy, Ushashi Bhattacharjee

专题命中 记忆与上下文管理 :AI agent(title,abstract);分类 cs.LG

AI总结 针对企业AI智能体在非平稳环境中面临的过时知识问题,提出含三种记忆状态的可逆遗忘框架,实例化为滞后可逆记忆控制器,可减少过时信息影响且不混淆临时抑制与永久擦除,金融场景可验证其思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14670 2026-08-20 q-fin.TR cs.MA 版本更新 78%

FactorMiner: A Self-Evolving Agent with Skills and Experience Memory for Financial Alpha Discovery

FactorMiner: 一种具备技能与经验记忆的自演化代理,用于金融alpha发现

Yanlong Wang, Jian Xu, Hongkang Zhang, Shao-Lun Huang, Danny Dongning Sun, Xiao-Ping Zhang

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 FactorMiner通过模块化技能架构和经验记忆实现自演化,有效挖掘高可解释性的金融alpha因子,降低冗余并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18580 2026-08-20 cs.AI cs.PL 新提交 77%

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis

FACET:在终端任务合成中保留源意图与可执行状态

Kou Shi, Zun Wang, Qisheng Su, Shiting Huang, Ziao Zhang, Zhen Fang, Qingnan Ren, Jin Liu, Yu Zeng, Yiming Zhao, Lin Chen, Zehui Chen, Feng Zhao

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 记忆与上下文管理 :agentic(abstract,abstract_cn);agent(abstract);分类 cs.AI

AI总结 FACET是保留源意图与可执行状态的终端任务合成框架,可生成高质量任务并提升Terminal-Bench 2.1上的智能体微调性能,为任务合成提供关键原则。

Comments this https URL (https://stokou.github.io/FACET-Terminal/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18884 2026-08-20 cs.AI 新提交 70%

Training-Free Inference-Time Self-Reflection and Cost-Bounded Early Stopping for Large Language Models

面向大语言模型的无训练推理时自我反思与成本受限早停机制

Wei Yu, Suxing Liu, Minjie Yu, Jiahao Wang, Zhijian Zheng, Haocheng Deng, Bing Li

机构 * School of Digital Arts, Jiangxi Arts & Ceramics Technology Institute(江西工艺美术职业技术学院数字艺术学院) School of Computing, Universiti Sains Malaysia(马来西亚理科大学计算机学院)

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出无训练的推理时协议EvoResearcher,通过成本受限的自我反思实现大语言模型早停,在多个推理基准上验证其成本受限自我验证的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19013 2026-08-20 cs.LG cs.AI 新提交 62%

Harness Continual Learning: Continual Adaptation Beyond Model Parameters

利用工具链持续学习:超越模型参数的持续适应

Borui Kang, Jinrui Gu, Junhan Lv, Wenbin Li, Lei Wang, Yang Gao

机构 * University of Wollongong(卧龙岗大学) Nanjing University(南京大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出工具链持续学习(HCL)范式,围绕冻结基础模型演化工具链,通过受保护演化机制缓解工具链级遗忘,在多任务实验中相对基准增益超10%,可调整稳定性-可塑性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18235 2026-08-20 cs.LG 新提交 57%

Classifying Directional Trajectories Near Criticality in the Three-State Majority-Vote Model with Deep Belief Networks and Bidirectional GRUs

用深度置信网络和双向门控循环单元对三态多数投票模型临界态附近的定向轨迹进行分类

Mauricio A. Valle, Gonzalo A. Ruz

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本研究用DBN与Bi-GRU处理MV3轨迹分类问题,DBN编码静态快照,Bi-GRU实现四类轨迹近乎完美分离,可实时感知MV3动态 regime,为意见动力学模型临界转变检测提供分层架构。

Comments 8 pages, 6 figures, to be published in AIxSET 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18638 2026-08-20 cs.HC 新提交 50%

Report on The 1st Workshop on Human-Centered Proactive and Personalized Agents for Interactive Information Access at CHIIR 2026

CHIIR 2026 第一届面向交互式信息获取的以人为中心的主动式与个性化智能体研讨会报告

Kirandeep Kaur, Vinayak Gupta, Tanya Roosta, Madhura Raju, Grace Hui Yang, Chirag Shah

专题命中 记忆与上下文管理 :agentic(abstract)

AI总结 该报告总结了CHIIR 2026第一届相关研讨会,探讨交互式信息获取向主动个性化智能体转变的机遇与问题,明确主动的核心内涵并梳理出相关设计挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 28 篇

2608.18099 2026-08-20 cs.AI q-fin.PM 新提交 85%

FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management

FinSkillBench:评估用于投资管理的智能体AI与领域技能

Jermyn Zhen Yong Bek, Zhuang Qiang Bok, Zhongtian Sun

机构 * Deep Insight Labs(深洞察实验室) University of Kent(肯特大学) University of Cambridge(剑桥大学)

专题命中 Agent评测 :AI agent(title);agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI

AI总结 FinSkillBench是评估投资管理领域AI智能体金融技能的基准,经9个模型的大规模评估发现,精选技能可显著提升性能,而自生成技能益处有限,其成果为该领域研究提供了支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13586 2026-08-20 cs.HC cs.CY 版本更新 82%

The Tool-to-Entity Threshold: Parasocial Dynamics of Personalised AI Agents in Shared Social Spaces

工具到实体的阈值:共享社交空间中个性化AI智能体的准社会动态

Leonardo Borges (Eigenstack Pty Ltd), Asif Q. Gill (University of Technology Sydney)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 该研究提出身份标记框架,结合自传式民族志方法,揭示共享社交空间中个性化AI智能体从工具转变为社会实体的四种新动态,指出现有同意框架混淆了智能体存在与消息处理的同意。

Comments 24 pages, 3 figures, 2 tables; corpus message count corrected to ~16,000; scope and consent basis unchanged. Threshold claim reframed as categorical rather than discrete; adds §5.4 and H4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18657 2026-08-20 econ.GN 新提交 78%

Accounting for intra-household joint travel in agent-based transport simulations

在基于智能体的交通模拟中考虑家庭内部联合出行

Javaudin Lucas, Araldo Andrea, Coulombel Nicolas

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究针对基于智能体的交通模拟忽略家庭联合出行的问题,提出三步整合方法,经巴黎数据验证可复现相关出行特征,助力更可靠评估差异化交通政策。

Comments Submission for hEART 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18105 2026-08-20 cs.CL cs.AI cs.LG 新提交 78%

StocksTalk: A Voice-Enabled Conversational Agent for Structured Query Generation over Web Data

StocksTalk:一种面向网络数据结构化查询生成的语音赋能对话智能体

Akshat Parmar, Vikranth Udandarao, Abhay Shakya, Tanmay Hire, Avinash Anand, Rajiv Ratn Shah, Daniel Wang Zhengkui

机构 * IIIT-Delhi(德里印度信息技术学院) Singapore Institute of Technology(新加坡理工学院)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 StocksTalk是一种语音赋能对话系统,可将口语化金融请求转为结构化查询,通过多模块提升准确性,为股票筛选决策提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17756 2026-08-20 cs.AI 版本更新 74%

D$^2$ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory

D²ACCI:一种用于保留证据的智能体记忆的双循环诊断协议

Xule Liu, Yijun Liu, Chao Li, Shao Kun

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 该研究针对LLM智能体持久记忆流程故障难以定位的问题,提出双循环诊断协议D²ACCI,引入DCR指标与D²ACCI-Eval人工制品,在三个公开基准上取得明确性能增益,填补了记忆系统迭代缺乏可追踪证据的空白。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18940 2026-08-20 cs.LG cs.AI cs.CE cs.CL 新提交 67%

Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

面向单步逆合成的化学合理性感知大语言模型训练

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Maksim Kuznetsov, Mathieu Reymond, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine AI Limited(英矽智能人工智能有限公司) Insilico Medicine Canada Inc.(英矽智能加拿大公司) Insilico Medicine Hong Kong Ltd.(英矽智能香港有限公司)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究针对单步逆合成的一对多特性,提出Top-K提示范式,构建超大规模反应数据集训练C3LM,结合特定奖励机制在基准上达最优性能,为逆合成系统提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏