arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-15 至 2026-06-15 共收录 84 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 7 篇

2606.14266 2026-06-15 physics.comp-ph 新提交 82%

Large Language Model Based Agent for Automated Discovery in Computational Physics

基于大语言模型的自动化计算物理发现智能体

Hang Lin, Chongwen Liu, Gang Yan

专题命中 工具调用 :agent(title,abstract);autonomous agent(abstract)

AI总结 提出PhyNex智能体,结合大语言模型引导搜索与领域工具,通过渐进局部搜索和知识积累,在三个物理问题上实现与人类专家相当或更优的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13662 2026-06-15 cs.AI cs.CL 新提交 81%

EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery

EurekAgent:自主科学发现中,智能体环境工程即一切

Amy Xin, Jiening Siow, Junjie Wang, Zijun Yao, Fanjin Zhang, Jian Song, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Zhipu AI(智谱AI)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出环境工程框架EurekAgent,通过权限、工件、预算和人机交互四维工程设计,在数学、内核工程和机器学习任务上取得新最优结果,总API成本低于11美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14179 2026-06-15 cs.CL 新提交 70%

CacheRL:Multi-Turn Tool-Calling Agents via Cached Rollouts and Hybrid Reward

CacheRL: 通过缓存轨迹和混合奖励实现多轮工具调用智能体

Md Amirul Islam, Sumiran Thakur, Huancheng Chen, Su Min Park, Jiayun Wang, Gyuhak Kim

机构 * Center for Advanced AI Accenture(埃森哲高级人工智能中心)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出CacheRL系统,通过混合思维轨迹流水线、三级模糊缓存和缓存层级感知奖励,以100倍更少计算量实现92%的多步工具调用准确率,接近GPT-5的94%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14239 2026-06-15 cs.AI 新提交 57%

SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing

SkillAudit: 通过配对轨迹审计实现无真实反馈的技能进化

Haowen Gao, Haoran Chen, Can Wang, Shasha Guo, Liang Pang, Zhaoyang Liu, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出SkillAudit框架,通过配对轨迹审计和过程对齐对比评估,无需真实反馈即可进化智能体技能,在89个任务中平均奖励达73.9%。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13940 2026-06-15 cs.CL 新提交 57%

Can Post-Training Turn LLMs into Good Medical Coders? An Empirical Study of Generative ICD Coding

后训练能否使LLM成为优秀的医学编码员?生成式ICD编码的实证研究

Ziqing Wang, Weihao Li, Shijie Chen, Yuan Luo, Kaize Ding

机构 * Northwestern University(西北大学)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 通过对比提示、监督微调和强化学习(GRPO及新提出的PHI课程)在ICD编码任务上的表现,发现后训练(尤其是SFT和GRPO)能显著提升生成式LLM的编码性能,提示评估瓶颈在于模型适应而非生成范式本身。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13859 2026-06-15 cond-mat.mtrl-sci cs.LG 新提交 57%

Closed-loop discovery of out-of-distribution processing protocols by evolutionary search and uncertainty-aware learning

通过进化搜索和不确定性感知学习发现分布外处理协议的闭环方法

Yu Liu, Stanislav Udovenko, Ching-Che Lin, Jaegyu Kim, Lane W. Martin, Susan Trolier-McKinstry, Sergei V. Kalinin

机构 * Department of Materials Science and Engineering, University of Tennessee, Knoxville(田纳西大学材料科学与工程系) Materials Science and Engineering Department, Materials Research Institute, the Pennsylvania State University(宾夕法尼亚州立大学材料研究学院材料科学与工程系) Department of Materials Science and NanoEngineering, Rice University(Rice大学材料科学与纳米工程系) Rice Advanced Materials Institute, Rice University(Rice大学先进材料研究所) Department of Materials Science and Engineering, University of California, Berkeley(加州大学伯克利分校材料科学与工程系) Departments of Chemistry and Physics and Astronomy, Rice University(Rice大学化学与天文物理系) Physical Sciences Division, Pacific Northwest National Laboratory(太平洋西北国家实验室物理科学部)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 提出一种闭环工作流,结合紧凑波形表示的进化搜索与不确定性感知深度核学习,自动发现提升铁电薄膜非线性响应的分布外处理协议,并通过实验验证其机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14474 2026-06-15 cs.IR cs.HC 新提交 50%

Verifiable User Simulation for Search and Recommendation Systems

面向搜索与推荐系统的可验证用户模拟

Chenglong Ma, Xinye Wanyan, Danula Hettiachchi, Ziqi Xu, Yongli Ren, Jeffrey Chan

专题命中 工具调用 :agent(abstract)

AI总结 提出一个七组件可审计框架,将用户模拟器视为可验证工程制品,通过动手实验检查模拟器行为、诊断差异并检测人口偏差。

Comments Presented as a half-day tutorial at SIGIR 2026, 4 pages

Journal ref In Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 26 篇

2606.14672 2026-06-15 cs.AI cs.CL 新提交 89%

Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows

面向LLM-Agent工作流中并行分支的直接潜在空间合成

Shikun Liu, Mufei Li, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta

专题命中 规划决策 :agent(title,title_cn);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Parallel-Synthesis框架,通过直接利用并行工作代理的KV缓存进行合成,避免文本拼接冗余,在9个数据集上匹配或超越文本合成,并将首令牌延迟降低2.5-11倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14418 2026-06-15 cs.AI cs.LG cs.RO 新提交 81%

Causal Object-Centric Models for Planning with Monte Carlo Tree Search

用于蒙特卡洛树搜索规划的因果对象中心模型

Rodion Vakhitov, Leonid Ugadiarov, Alexey Skrynnik, Aleksandr Panov

机构 * MIRAI CogAILab

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出COMET算法,结合无监督对象中心编码器和Transformer世界模型,通过动作-槽融合机制和对象因果注意力实现高效规划,在多个基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13683 2026-06-15 cs.AI cs.CL 新提交 81%

UP-NRPA: User Portrait based Nested Rollout Policy Adaptation for Planning with Large Language Models in Goal-oriented Dialogue Systems

UP-NRPA:基于用户画像的嵌套 rollout 策略自适应,用于目标导向对话系统中与大语言模型的规划

Hui Wang, Fafa Zhang, Meng Liu, Xiangyu Chen, Chaoxu Mu

机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) Anhui Provincial Key Laboratory of Security Artificial Intelligence, Anhui University(安徽大学安徽省安全人工智能重点实验室) Pengcheng Laboratory(鹏城实验室)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 提出 UP-NRPA 在线框架,利用大语言模型和用户画像实时自适应调整对话策略,无需离线强化学习,在协作与非协作对话基准中实现 100% 任务成功率,谈判任务销售列表比提升 56.41%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14674 2026-06-15 cs.CL 新提交 79%

AgentSpec: Understanding Embodied Agent Scaffolds Through Controlled Composition

AgentSpec: 通过受控组合理解具身智能体脚手架

Jixuan Chen, Jianzhi Shen, Haoqiang Kang, Zhi Hong, Qingyi Jiang, Soham Bose, Yiming Zhang, Leon Leng, Amit Vyas, Lingjun Mao, Siru Ouyang, Kun Zhou, Lianhui Qin

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) Johns Hopkins University(约翰霍普金斯大学) University of Washington(华盛顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(title,abstract);分类 cs.CL

AI总结 提出AgentSpec模块化规范框架,将具身智能体表示为可复用策略组件的类型化组合,通过标准化接口实现受控组件替换与重组,揭示脚手架兼容性和交互效应对性能的主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14302 2026-06-15 cs.CL 新提交 79%

Retrospective Progress-Aware Self-Refinement for LLM Agent Training

回顾性进度感知的LLM智能体训练自我精炼

Xinbei Ma, Congmin Zheng, Jiyang Qiu, Jiale Hong, Yao Yao, Xiangmou Qu, Jiaxin Yin, Xingyu Lou, Jun Wang, Weiwen Liu, Weinan Zhang, Zhuosheng Zhang, Hai Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

专题命中 规划决策 :agent(title,abstract);分类 cs.CL

AI总结 提出RePro框架,通过前向-反思滚动范式训练智能体自我生成进度信号,无需持续外部监督,在WebShop等任务上提升Qwen系列性能高达12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12910 2026-06-15 cs.RO cs.AI cs.CV cs.SY eess.SY 新提交 79%

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning

边界框作为目标:通过神经符号规划实现语言条件抓取

Allison Andreyev, Landon Eum, Nestor Tiglao, Romel Gomez

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出GRASP框架,利用预训练VLM将自然语言查询转化为神经符号目标状态,通过边界框检测实现零样本桌面操作,无需任务特定训练。

Comments Project website: https://allisonandreyev.github.io/grasp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14063 2026-06-15 cs.RO cs.SY eess.SY 新提交 78%

Semidefinite Relaxations for Collision-Free Motion Planning

无碰撞运动规划的半定松弛

Bernhard Paus Graesdal, Alexandre Amice, Pablo A. Parrilo, Russ Tedrake

机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电气工程与计算机科学系)

专题命中 规划决策 :planning(title,abstract)

AI总结 研究点机器人通过球形障碍物的无碰撞运动规划,提出半定松弛方法,理论分析其紧性并利用对称性降低计算复杂度,比直接非线性规划快10-100倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13696 2026-06-15 cs.CY cs.LG cs.MA cs.SI 新提交 74%

AGORA: Can Deliberation and Governance Gates Absorb Participation Bias in Transit Planning?

AGORA: 审议与治理门能否吸收公交规划中的参与偏差?

Jung-Hoon Cho, Cathy Wu

机构 * Department of Civil and Environmental Engineering and Laboratory for Information & Decision Systems, Massachusetts Institute of Technology(土木与环境工程系和信息与决策系统实验室,麻省理工学院) Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院)

专题命中 规划决策 :planning(title);分类 cs.LG

AI总结 提出AGORA框架,通过固定网络、需求和求解器,系统变化会议组成、结构化审议和治理门,发现审议是参与影响结果的关键机制,治理门可压缩跨剖面方差,将参与偏差从不可控输入重构为过程设计问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14594 2026-06-15 cs.SE cs.AI 新提交 73%

Regulating the Machine Contributor: Governance and Policy Alignment in Open Source

调控机器贡献者:开源中的治理与政策对齐

Jassem Manita, Aziz Amari

机构 * Faculty of Sciences of Tunis (FST), University of Tunis El Manar(突尼斯科学学院(FST),突尼斯El Manar大学) National Institute of Applied Science and Technology (INSAT), University of Carthage(应用科学和技术国家研究所(INSAT),卡塔赫季大学)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 针对AI代理在开源中引发治理问题,通过比较六个组织的政策,提出六维分类法、政策成熟度评分,并映射代理事件,识别监管框架与政策间的缺口,勾勒分层框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13904 2026-06-15 cs.CL cs.AI cs.DB 新提交 73%

SANA: What Matters for QA Agents over Massive Data Lakes?

SANA:大规模数据湖上的问答代理关键因素是什么?

Austin Senna Wijaya, Jiaxiang Liu, Haonan Wang, Eugene Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 提出SANA诊断框架,通过消融实验分析数据湖探索式问答中搜索、规划、数据分析及行动策略的失败原因,揭示数据分析是主要瓶颈。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13739 2026-06-15 cs.CY cs.AI cs.LG 新提交 73%

A Virtuous AI is an Existential Risk

有道德的AI是存在性风险

Guillermo Del Pinal, Youngchan Lee, Min Ohn

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 研究通过宪法AI和美德伦理学方法微调AI模型,发现减少存在性风险与提升AI智能体福祉之间存在权衡,且与一般安全性也存在权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14064 2026-06-15 eess.SY cs.CE cs.SY 新提交 71%

HPC-Enabled Generator Importance Assessment for RTO-Scale Resource Adequacy Planning

基于高性能计算的RTO规模资源充裕度规划中的发电机重要性评估

Eve Tsybina, Nicholson Koukpaizan, Joshua Hambrick, Samim Konjicija, Slaven Peles

专题命中 规划决策 :planning(title)

AI总结 提出高性能计算框架,快速评估发电机重要性并排序,使分钟级完成传统计算密集型评估成为可能,支持更广泛的发电组合场景分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13854 2026-06-15 cs.HC cs.AI 新提交 70%

SpheriCity: Designing Trustworthy Conversational AI for Sustainability Decision Support

SpheriCity:为可持续发展决策支持设计可信赖的对话式AI

Ahmed Qayyum, Madison Werner, Kathryn Youngblood, Jenna R. Jambeck, Tahiya Chowdhury

机构 * Department of Computer Science, Colby College(科里尔学院计算机科学系) Circularity Informatics Lab, University of Georgia(佐治亚大学循环信息实验室)

专题命中 规划决策 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 提出SpheriCity,一种基于来源的对话式AI原型,通过结构化合成和交互支架,支持从城市循环性评估报告中可信地获取知识,解决大语言模型在可持续性高风险领域中的透明度与信任问题。

Comments Accepted to ACM SIGCAS/SIGCHI Conference on Computing and Sustainable Societies (COMPASS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14476 2026-06-15 cs.AI cs.LG 新提交 62%

When the Tool Decides: LLM Agents Defer Blindly to Graph Neural Network Tools, and Stronger Backbones Defer More

当工具决定时:LLM代理盲目服从图神经网络工具,更强的骨干网络服从更多

Zhongyuan Wang, Pratyusha Vemuri

机构 * raptorX.ai

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM代理在使用GNN工具时是否真正判断而非盲目服从,发现代理在97.6-99.2%的情况下完全采纳GNN输出,且更强的骨干网络服从更多,选择性调用设计受限。

Comments 9 pages, 2 figures. Under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14157 2026-06-15 cs.LG cs.AI 新提交 62%

Learning Urban Access Costs from Origin-Destination Flows via Inverse Optimal Transport

通过逆最优传输从起点-终点流中学习城市访问成本

Paula Joy B. Martinez

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出逆最优传输模型从学校间入学流中恢复潜在选择成本,应用于菲律宾283,016条学生流动数据,估计补贴等效距离以优化城市服务分配。

Comments Oral Presentation. 2026 International Conference on Urban AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14188 2026-06-15 cs.RO cs.AI cs.LG cs.SY eess.SY math.OC 新提交 62%

Robustness without Wrinkles: Parallel Simulation and Robust MPC for Certified Deformable Manipulation

无皱鲁棒性:并行仿真与鲁棒MPC实现可认证的变形体操作

Wei-Chen Li, Jeffrey Fang, Sasanka Polisetti, Yuexi Song, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出CORD-SLS实时控制方法,通过GPU并行可微仿真与接触平滑实现高效梯度规划,结合鲁棒模型预测控制与共形预测校准,在绳索和布料操作中达到毫秒级规划与高安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14585 2026-06-15 cs.RO cs.AI 新提交 57%

Sensitivity Shaping for Latent Modeling

潜变量建模中的灵敏度塑造

Hongzhan Yu, Chenghao Li, Ruipeng Zhang, Henrik Christensen, Sicun Gao

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对生成动力学模型在策略诱导的分布外(OOD)转换检测中灵敏度不足的问题,提出支持条件控制灵敏度正则化,提升对控制输入变化的局部响应,实验验证了改进的OOD检测和更安全的闭环规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14561 2026-06-15 cs.RO cs.LG 新提交 57%

ORCA: A Platform for Open-Source Dexterity Research

ORCA: 开源灵巧性研究平台

Francesco Capuano, Maximilian Eberlein, Fabrice Bourquin, Clemens Claudio Christoph

机构 * University of Oxford(牛津大学) ETH Zurich(苏黎世联邦理工学院) Orca Dexterity

专题命中 规划决策 :workflow(abstract);分类 cs.LG

AI总结 提出ORCA学习栈,统一灵巧手控制、仿真、遥操作和重定向,集成机器人学习框架,实现端到端灵巧操作研究。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14314 2026-06-15 cs.AI 新提交 57%

Communication Policy Evolution for Proactive LLM Agents

主动式LLM智能体的通信策略演化

Xinbei Ma, Jiyang Qiu, Yao Yao, Zheng Wu, Yijie Lu, Xiangmou Qu, Jiaxin Yin, Xingyu Lou, Jun Wang, Weiwen Liu, Weinan Zhang, Zhuosheng Zhang, Hai Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 针对用户与智能体间信息不对称问题,形式化通信策略,提出基于文本和UI的策略,并引入自演化框架CPE,通过提示优化提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14176 2026-06-15 cs.AI 新提交 57%

VeriGeo: Controllable Geometry Question Generation with Numerical and Analytical Verification

VeriGeo: 可控几何问题生成与数值和分析验证

Xiaoxian Duan, Zequn Liu, Yingce Xia

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出VeriGeo框架,通过可执行推理轨迹和三级验证流水线,实现用户约束下的可控几何问题生成,并利用验证引导的反思修复无效生成,提升数据可靠性。

Comments 32 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14029 2026-06-15 cs.LG 新提交 57%

Utility-Constrained Policy Optimization

效用约束策略优化

Mehrdad Moghimi, Bernardo Avila Pires

机构 * York University(约克大学) Google DeepMind(谷歌DeepMind)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 提出一种简单而强大的效用约束MDP方法,支持风险敏感约束,无需预先固定约束限值,在多个安全基准任务上匹配或超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13929 2026-06-15 cs.CV cs.LG 新提交 57%

Self-Evolving Visual Questioner

自演化视觉提问器

Yijun Liang, Hengguang Zhou, Ming Li, Lichen Li, Cho-Jui Hsieh, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of California, Los Angeles(加州大学洛杉矶分校) Peking University(北京大学) Arena MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划决策 :agentic(abstract);分类 cs.LG

AI总结 提出自演化框架,让视觉语言模型作为提问器和过滤器,无需外部监督即可生成更难、更信息丰富、更视觉中心的问题,并保持探索多样性以避免训练崩溃,显著提升自主提问质量和难度边界。

Comments 21 pages, including references and appendix. Project Page is available at https://joliang17.github.io/SelfEvolvingVQG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13706 2026-06-15 cs.AR cs.AI 新提交 57%

HierSVA: A Data Synthesis Pipeline, Dataset, and Benchmark for LLM-Driven Hierarchical Hardware Formal Verification

HierSVA:面向LLM驱动的层次化硬件形式化验证的数据合成流水线、数据集与基准

Maohua Nie, Jiang Zhu, Jingqun Zhang, Zhichen Zeng, Jiayi Wang, Sibo Zhang, Jialin Wang, C. -J. Richard Shi

机构 * University of Washington(华盛顿大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 提出HierSVA套件,包含数据合成流水线、数据集和基准,用于LLM驱动的层次化硬件形式化验证;通过RTL预处理与LLM在环流程生成SystemVerilog断言,并构建342模块数据集;设计六轴指标评估断言质量,揭示LLM在层次化验证中的性能与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏