arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-19 至 2026-08-19 共收录 34 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 34 篇

2608.17933 2026-08-19 cs.AI cs.CE 新提交 90%

EvoTS-Agent: A Self-Evolving LLM Agent for Financial Time Series Change Point Detection

EvoTS-Agent:一种用于金融时间序列变点检测的自进化大语言模型智能体

Lei Jiang, Ye Wei, Xinyu Xi, Jordan Langham-Lopez, Yifan Bao, Raad Khraishi, Yihao Ang, Anthony K. H. Tung, Lukasz Szpruch, Hao Ni

机构 * Alan Turing Institute(阿兰·图灵研究所) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) NatWest AI Research(国民西敏寺银行人工智能研究部) University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI

AI总结 该研究针对金融时间序列变点检测难题,提出自进化 LLM 智能体 EvoTS-Agent,经验证引导进化检测流程,在四个基准数据集上表现优于现有同类智能体且执行成功率达100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17597 2026-08-19 cs.CR cs.AI 新提交 85%

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety

HarnessRisk:面向生命周期的智能体管控安全基准

Yajing Bai, Jinhao Duan, Jie Peng, Xianfeng Wu, Sijia Liu, Song Wang, Tianlong Chen

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 研究提出面向生命周期的智能体管控安全基准HarnessRisk,含128个沙箱案例,评估多模型与管控配置的安全表现,发现管控配置阶段最易受攻击,明确风险识别未必带来安全行动,凸显多维度评估智能体安全的必要性。

Comments Project Page: this https URL (https://baiyajing.github.io/harness-risk/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17713 2026-08-19 cs.LG 新提交 83%

Cross-View Correspondence Is a Measurement Intervention: Two-Sided Validation for Agent Evaluation and Credit Assignment

跨视图对应是一种测量干预:智能体评估与信用分配的双面验证

Zhen Zhang, Ahmad Hafez, Amr Alanwar

机构 * School of Computation, Information and Technology(计算、信息与技术学院) Technical University of Munich(慕尼黑工业大学)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.LG

AI总结 该研究指出跨视图对应是测量干预,开发含双面验证等的有效性理论,发现对应分歧会影响智能体评估,需声明验证跨视图对应以支持可靠结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16900 2026-08-19 physics.soc-ph cs.AI cs.CY quant-ph 新提交 83%

QuantumNovelty: A Skill-Orchestrating Language Agent for Referee-Style Review and Patentability Screening of Quantum Papers and Patents

QuantumNovelty:用于量子论文与专利的评审式审查及可专利性筛选的技能编排语言智能体

Shlomo Kashani

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 QuantumNovelty是一款开源技能编排语言智能体,可生成量子计算产物并通过含确定性门的审计层审查,在对抗语料库及真实手稿、专利的测试中表现出审查保守性,属于量子论文与专利审查的决策支持工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18034 2026-08-19 cs.CV 新提交 82%

Deep Academic Survey: Stateful Agentic Closed-Loop Paradigm for Academic Survey Automation

深度学术调查:用于学术调查自动化的有状态智能体闭环范式

Zhikai Xu, Zhucun Xue, Teng Hu, Yabiao Wang, Yong Liu, Jiangning Zhang

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract)

AI总结 该研究提出DAS框架,通过状态智能体闭环实现学术调查自动化,在DAS-Bench基准测试中,其在引用质量等四维度得分及专家评估中均优于现有系统。

Comments Project page: this https URL (https://zhikaixu24.github.io/projects/DAS/) | Code: this https URL (https://github.com/ZhikaiXu24/DAS) | Data: this https URL (https://huggingface.co/datasets/ZhikaiXu24/DAS-2M)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17129 2026-08-19 cs.CV cs.RO 新提交 80%

PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents

PROBE:基于操作的视觉问答(使用VLM智能体)

Vineet Bhat, Siyi Chen, Alex Zook, Xuning Yang, Stan Birchfield, Valts Blukis, Jonathan Tremblay

机构 * NVIDIA(英伟达)

专题命中 Agent评测 :agent(abstract,abstract_cn);planning(abstract);agentic(abstract)

AI总结 针对现实杂乱环境中需操作遮挡物体的视觉问答问题,提出PROBE框架,含模拟器、基准测试集及微调方案,提升VLM智能体性能并验证模拟到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17237 2026-08-19 cs.CV cs.AI 新提交 79%

Structural Plan-to-Model Conversion with Deterministic Geometry and Guarded Agentic Vision-Language Refinement

基于确定性几何与受约束智能体视觉-语言优化的结构平面图到模型转换

Mohammad Talebi-Kalaleh, Qipei Mei

机构 * University of Alberta(阿尔伯塔大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 该研究提出首个无需特定任务检测器训练的结构平面图转模型框架,经100张图基准评估,各构件指标优异,可高效修正绘图错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17177 2026-08-19 cs.SE 新提交 79%

Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation

将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估

Michele Tufano, James McClure, José Cambronero, Runxiang Cheng, Sherry Y. Shi, Renyao Wei, Dorothy Chen, Franjo Ivančić, Livio Dalloro, Pat Rondon

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.SE

AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17029 2026-08-19 cs.SE cs.HC 新提交 79%

LadderTeam: Dual-Agent Laddering Elicitation Framework

LadderTeam:双智能体阶梯式引出框架

Manjushree Aithal, Alexander Kotz, James Mitchell

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 LadderTeam是基于双智能体LLM架构的自动化UX线框图访谈框架,采用三种探测策略,经216次模拟访谈验证,实现高收敛率与可执行响应匹配率,且无主题偏离。

Comments 4 pages, 1 figure, 2 tables, Accepted in ACM AI Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16919 2026-08-19 cs.IR cs.AI 新提交 79%

CARA: Cognitive Adaptive Recommendation Agent

CARA:认知自适应推荐智能体

Weijun Gao, Jinyang Dong, Chuanru Ren, Hengxiao Li

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对现有推荐方法未明确建模用户偏好转化为决策的局限,提出认知自适应推荐框架CARA,经亚马逊评论实验,其多数指标性能最优,较基线相对提升最高达10.15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17733 2026-08-19 cs.CC cs.MA 新提交 78%

The Influence of Agent Models on the Complexity of Bus Routing

智能体模型对公交线路规划问题复杂度的影响

Eva Deltl, Christian Komusiewicz, Jurek Rostalsky, Johannes Schröder, Luca Pascal Staus

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究分析公交线路规划问题的复杂度,发现智能体成本模型、是否允许智能体选择步行等因素会影响问题难度,相关结果还证明了其NP-hard性与参数化难解性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17614 2026-08-19 cs.MA eess.SY 新提交 78%

Adaptive Incentive Design in Dynamic Principal-Agent Problem via Kernelized Bandits

基于核化多臂老虎机的动态委托代理问题中的自适应激励设计

Arghya Mallick, Anuj S. Vora, Sergio Grammatico, Peyman Mohajerin Esfahani

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文针对动态委托代理问题的现有局限,提出引入随机效用模型的Heteroscedastic GP-UCB算法,建立了累积遗憾界,并在V2G激励设计中验证了其更优的经济性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04772 2026-08-19 cs.CL cs.AI 版本更新 76%

Guideline-as-Oracle: Zero-Annotation Training of an Ophthalmic Telephone Triage Agent

以指南为神谕:眼科电话分诊智能体的零标注训练

Chenyu Wang, Yi Liu, Baoqing Li, Min Tu, Diping Song

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

AI总结 本研究提出以指南为神谕(GAO)方法,将美国眼科学会指南转化为训练监督信号,零标注训练出GAO-Triage智能体,大幅提升眼科电话分诊的一致性与紧急案例召回率,且性能优于7个通用系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17756 2026-08-19 cs.AI 新提交 74%

D$^2$ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory

D²ACCI:一种用于保留证据的智能体记忆的双循环诊断协议

Xule Liu, Yijun Liu, Chao Li, Shao Kun

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 该研究针对LLM智能体持久记忆流程故障难以定位的问题,提出双循环诊断协议D²ACCI,引入DCR指标与D²ACCI-Eval人工制品,在三个公开基准上取得明确性能增益,填补了记忆系统迭代缺乏可追踪证据的空白。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17142 2026-08-19 eess.SY 新提交 71%

A Hybrid Discrete-Event and Agent-Based Simulation Approach to Model Circular Supply Chains in Healthcare: A Case Study of Laparoscopic Scissors

用于建模医疗领域循环供应链的混合离散事件与基于智能体的仿真方法:以腹腔镜剪刀为例

Mohd Shoaib, Antuela Tako, Shahin Rahimifard

专题命中 Agent评测 :agent(title)

AI总结 本文以腹腔镜剪刀供应链为案例,采用混合离散事件与基于智能体的仿真方法,评估医疗领域引入循环医疗器械设计的影响,为医院提供最优库存策略,指出采用循环产品可降低环境影响但需大量前期投资。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00867 2026-08-19 cs.HC cs.MA 版本更新 71%

Interactionalism: Re-Designing Higher Learning for the Large Language Agent Era

互动主义:为大语言智能体时代重新设计高等学习

Mihnea C. Moldoveanu, George Siemens

专题命中 Agent评测 :agent(title)

AI总结 该研究提出互动主义作为与生成式AI协同的高等学习实践蓝图,定义互动智能为核心认知任务可由大语言模型智能体自动化时的关键技能,拆解为元认知与元情感组件,用于培养学习者。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18066 2026-08-19 cs.AI cs.CL cs.LG 新提交 67%

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

自改进智能体的脆弱性:方差、任务顺序与规格不足

Qinyuan Ye, Yu Li, Yada Pruksachatkun, Jiaxin Zhang, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究通过多轮运行与打乱任务顺序的实验,揭示当前基于记忆的自改进智能体存在脆弱性,发现其性能受方差与任务顺序影响,还指出规格不足是相关诱因,呼吁采用更严格评估方案与人工监督机制。

Comments Code: this https URL (https://github.com/SalesforceAIResearch/self-improve-fragility) Data: this https URL (https://huggingface.co/datasets/Salesforce/self-improve-fragility)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07436 2026-08-19 cs.AI cs.CL cs.CR 版本更新 66%

The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents

盲选策展人:有偏见的评判者如何在自我进化的智能体中悄然阻碍技能淘汰

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(亚马逊云科技生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)

专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI、cs.CL

AI总结 研究自我进化智能体中,有偏见的评判者对技能淘汰的影响。通过损坏奖励分析等方法发现,“误判通过”偏差会导致技能淘汰机制失效,此为行为安全结果。还提出廉价审计可判断评判者是否越过阈值影响智能体。

Comments Published at COLM 2026 Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17373 2026-08-19 cs.LG cs.AI 新提交 62%

Integrating Novelty and Surprise for Experience Prioritization and Exploration in Image-Based Reinforcement Learning

将新颖性与意外性结合用于基于图像的强化学习中的经验优先级排序与探索

Hoda Yamani, Henry Williams, Bruce A. MacDonald

机构 * University of Auckland(奥克兰大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出NSPER及扩展的NSPER+R,将新颖性与意外性结合,在DeepMind Control Suite任务上提升了基于图像的强化学习的训练效率与收敛速度。

Comments 9 pages, 4 figures. Published in International Journal of Computer and Systems Engineering, 2026. Code: this https URL (https://github.com/UoA-CARES/NSPER)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01008 2026-08-19 cs.SE cs.AI 版本更新 62%

FVSpec: Real-World Property-Based Tests as Lean Challenges

FVSpec: 作为精益挑战的真实世界基于属性的测试

Quinn Dougherty, Max von Hippel, Simon Henniger, Hazel Shackleton, Mike Dodds

机构 * Forall R&D(Forall 研发) Benchify Galois Inc(Galois 公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出FVSpec基准,通过从真实Python仓库中提取属性测试并自动翻译为Lean 4规范,评估AI在形式化验证任务上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25459 2026-08-19 cs.CL cs.LG 版本更新 62%

SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA

SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中

Haozhou Xu, Dongxia Wu, Matteo Chinazzi, Ruijia Niu, Rose Yu, Yi-An Ma

机构 * University of California San Diego(加州大学圣迭戈分校) Stanford University(斯坦福大学) Northeastern University(东北大学)

专题命中 Agent评测 :planning(abstract);分类 cs.CL、cs.LG

AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%

Comments Haozhou Xu and Dongxia Wu are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17800 2026-08-19 cs.AI 新提交 57%

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

StartupBench:基于市场验证的端到端工作流程的通用智能体基准测试

Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang, Jingzhe Ding, Qingshui Gu, Yongjie Zhong, Jinxiang Meng, Yuan Gao, Yunqiu Zhou, Hao Zhu, Jifeng He, Yongzhi Liao, Xinyi Zhang, Chaoxin Li, Yi Zhu, Xi Lin, Duju Zeng, Xiang Gao, Wen Zhang, Yunyang Wang, Duo Wang, Huan Zhou, Zuo Wang, Jin Chen, Kaiyuan Zhang, Chuqian Yu, Tianhao Yu, Longxiang Liu, Jianbo Xue, Huimin Che, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan, Xiaolong Chang, Wenhao Huang

机构 * ByteDance Seed(字节跳动 Seed) Nanjing University(南京大学) M-A-P

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出StartupBench基准测试,基于市场验证的AI初创产品工作流程评估通用智能体,发现当前最强模型仅完成约30%任务,该基准可衡量智能体完成现实用户任务的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17524 2026-08-19 cs.LG 新提交 57%

Evaluating RL Explainability Methods by How Much They Help Fix Bugs in Agents

通过可解释强化学习(XRL)方法对修复智能体Bug的帮助程度来评估XRL方法

Ram Rachum, Yotam Amitai, Bálint Gyevnár, Reuth Mirsky, Cameron Allen

机构 * University of California, Berkeley(加州大学伯克利分校) Tufts University(塔夫茨大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出EvalXRL基准,通过大型语言模型编码智能体结合XRL方法诊断修复RL智能体故障的效果,实现对多种XRL方法的首次闭环直接对比评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17433 2026-08-19 cs.AI cs.MA 新提交 57%

Task-Aware Harness Provisioning for LLM Agents in Mission-Critical Infrastructure Operations

面向关键任务基础设施操作中LLM智能体的任务感知工具链配置

Liangtao Lin, Qingang Zhang, Zhaomeng Zhu, Tianwei Zhang, Yonggang Wen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体的工具链配置问题,提出映射引导的升级算法,在液体冷却任务中提升了准确率并减少token使用,在电网任务中提供低成本替代方案,揭示工具链配置遵循领域依赖的帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17271 2026-08-19 cs.AI 新提交 57%

ASI-Bench: At the Dawn of Artificial Superintelligence

ASI-Bench:人工智能超级智能的黎明

Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren, Xiaohan Jia, Xueyang Zhou, Xiaoyu Cao, Yongchao Chen, Yuanning Feng, Junhao Wu, Cheng Zhang, Sijia Chen, Haoyu Xue, Chengsong You, Huan Wang, Koutian Wu, Peigan Gao, Jiakun Wu, Wenzhe Li, Ergan Shang, Qingyuan Zheng, Jingjing Zhou, Ruixuan Jia, Yan Xu, Hongrui Zhang, Xiao-Han Ma, Zhengxiang Cheng, Yuexing Hao, Liting Mai, Xianglin Ji, Wenjun Zhang, Zhuofan Chen, Yixiao Huang, Chi Wang, Wenyue Hua, Yilun Hao, Yuantao Zhai, Ziyan Zhao, Jingyan Xie

机构 * Tsinghua University(清华大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Boston University(波士顿大学) University of Queensland(昆士兰大学) University of Science and Technology of China(中国科学技术大学) Flatiron Institute(弗拉蒂伦研究所) Microsoft Research(微软研究院) AG2 AI(AG2 AI公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究人员推出首个联合评估AI创新探索与自主科学执行能力的基准ASI-Bench,逐步减少人类方法指导测试AI自主科研能力,发现当前AI仍严重依赖人类指导,该基准面向全球开放邀请贡献。

Comments 16 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17034 2026-08-19 cs.LG 新提交 57%

Agents unlock new capabilities through Switching LoRA Adapters as a Tool (SLAaaT)

智能体通过切换LoRA适配器作为工具(SLAaaT)解锁新能力

Kenneth Ge

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究针对后训练导致的灾难性遗忘问题,提出让智能体在轨迹中途切换专用LoRA适配器的SLAaaT方法,实验显示其可解决新问题、自主切换策略且能力损耗低,在任务能力和token使用上优于生成子智能体的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17167 2026-08-19 cs.IT cs.AI eess.SY stat.ML 新提交 57%

Expected free energy as an information constraint on the Bethe Lagrangian

期望自由能作为Bethe拉格朗日量的信息约束

Wouter M. Kouw

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出受信息约束的Bethe拉格朗日量,可恢复主动推理的期望自由能解,经实验验证其在三个任务上的性能可与EFE和Q-MDP相媲美。

Comments 17 pages, 4 figures, table 2. International Workshop on Active Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16964 2026-08-19 eess.IV 新提交 50%

Technically Plausible but Clinically Misleading? Expert Evaluation of Patient-Personalized Synthetic Prostate MRI

技术上可行但临床误导?患者个性化合成前列腺MRI的专家评估

Gabriel Paulo Maglalang Israel, Sol Gedde, Alvaro Fernandez-Quilez

专题命中 Agent评测 :workflow(abstract_cn)

AI总结 本研究用3D扩散模型合成患者个性化前列腺MRI,验证其技术可行性后开展专家研究,发现其虽技术可行但存在误导解读风险,提示需评估其临床应用安全性。

Comments To appear in SCAI 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17386 2026-08-19 cs.RO 新提交 50%

MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation

MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件

Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) William & Mary(威廉玛丽学院)

专题命中 Agent评测 :planning(abstract)

AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17266 2026-08-19 cs.AR 新提交 50%

The Road Less Traveled: Congestion-Aware NoC Placement and Packet Routing for FPGAs

少有人走的路:面向FPGA的感知拥塞片上网络布局与分组路由

Soheil Gholami Shahrouz, Vaughn Betz

专题命中 Agent评测 :agent(abstract)

AI总结 本研究针对FPGA的片上网络拥塞问题,在开源CAD工具VPR中融入拥塞建模、转弯模型路由、SAT路由建模及强化学习智能体优化,显著降低了NoC拥塞并缩短了线长。

Comments 10 pages, 5 figures, 3 tables. Published at the 2024 34th International Conference on Field-Programmable Logic and Applications (FPL), Torino, Italy. Source code integrated into the VTR project: this https URL (https://github.com/verilog-to-routing/vtr-verilog-to-routing)

详情

展开后加载摘要…

URL PDF HTML 收藏