arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-19 至 2026-05-19 共收录 402 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 77 篇

2605.18593 2026-05-19 cs.CR cs.AI cs.RO 57%

Not What You Asked For: Typographic Attacks in Household Robot Manipulation

并非你所要求的:家庭机器人操作中的字体攻击

Ali Iranmanesh, Peng Liu

机构 * Cyber Security Lab(网络安全实验室) The Pennsylvania State University(宾夕法尼亚州立大学) State College, USA(州立学院,美国)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本研究探讨了字体攻击对家庭机器人操作全流程的影响,提出了一种解耦感知架构,并发现感知错误会通过持久的3D语义地图导致物理性故障,揭示了字体误分类对机器人安全性的实际威胁。

Comments 10 pages, 1 figure, IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06754 2026-05-19 cs.SE 57%

ScarfBench: A Benchmark for Cross-Framework Application Migration in Enterprise Java

ScarfBench:企业Java应用跨框架应用迁移的基准测试

Advait Pavuluri, Bridget McGinn, Ashita Saxena, George Safta, Srikanth Tamilselvam, Raju Pavuluri, Michele Merler, Baishakhi Ray, Rahul Krishna

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出ScarfBench,一个用于评估企业Java应用跨框架迁移行为保持性的基准测试,通过专家编写实现三元组,涵盖Spring、Jakarta EE和Quarkus框架,生成102个变体和204个定向重构任务,评估了五种最先进的编码代理,并揭示了不同框架方向和架构层的难度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18025 2026-05-19 cs.AI 57%

TeleCom-Bench: How Far Are Large Language Models from Industrial Telecommunication Applications?

TeleCom-Bench: 大型语言模型在工业电信应用中还有多远?

Jieting Xiao, Yun Lin, Huizhen Qiu, Rui Ma, Chen Zhong, Dongyang Xu, Xiao Long, Chaoyu Zhang, Qiaobo Hao, Ding Zou, Zhiguo Yang, Yanqin Gao, Fang Tan

机构 * ZTE Corporation(中兴通讯)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出TeleCom-Bench,一个包含12个评估集和22678个精选样本的全面基准,旨在评估大型语言模型在电信领域的综合能力,揭示其在工业流程中的执行能力缺口。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17928 2026-05-19 cs.RO cs.LG 57%

Transfer Learning for Customized Car Racing Environments

迁移学习用于定制化的赛车环境

Benedict Florance Arockiaraj, Richard Chang, Wesley Yee

机构 * seas(系统工程与科学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了迁移学习在深度强化学习中的应用,旨在通过在单一赛道上训练智能体,实现零样本迁移或进一步微调以在其他定制化赛车环境中获得更快的圈速,并比较了基于模型和非基于模型方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17911 2026-05-19 cs.CL 57%

A Pilot Benchmark for NL-to-FOL Translation in Planetary Exploration

行星探测中自然语言到一阶逻辑翻译的试点基准

Hayden Moore, Suman Saha, Mahfuza Farooque

机构 * Department of Computer Science and Engineering, College of Engineering, The Pennsylvania State University(计算机科学与工程系,工程学院,宾夕法尼亚州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出一个试点基准,用于在行星探测领域将自然语言转换为一阶逻辑,通过NASA PDS的实测文档构建数据集,并手动标注FOL表示,以支持语言理解和形式推理的交叉研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17829 2026-05-19 cs.AI 57%

Interactive Evaluation Requires a Design Science

交互评估需要一种设计科学

Keyang Xuan, Peiyang Song, Pan Lu, Pengrui Han, Wenkai Li, Zhenyu Zhang, Zexue He, Wenyue Hua, Manling Li, Jiaxuan You, Adrian Weller, Yizhong Wang, Jiaxin Pei

机构 * University of Texas Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) Northwestern University(西北大学) University of Cambridge(剑桥大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了交互评估应被视为一种原则性的评估范式,而非仅仅是新的智能体基准。通过定义评估为证据到判断的自主映射,文章展示了交互评估如何改变这一映射的两方面,并提出双轴分类法,制定设计原则和报告标准,分析了长期评估挑战在轨迹层面的再现。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17792 2026-05-19 cs.LG physics.geo-ph 57%

HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL

HydroAgent: 通过模拟器引导的强化学习缩小前沿大语言模型与人类专家在水文模型校准之间的差距

Zhi Li, Songkun Yan, Jie Cao, Mofan Zhang, Anjiang Wei, Jinwoong Yoo, Yang Hong

机构 * Civil, Environmental, and Architectural Engineering, University of Colorado Boulder(科罗拉多大学波尔德分校土木、环境与建筑工程系) Civil Engineering and Environmental Sciences, University of Oklahoma(俄克拉荷马大学土木工程与环境科学系) Department of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学系) Civil and Environmental Engineering, Stanford University(斯坦福大学土木与环境工程系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) NASA Goddard Space Flight Center(美国国家航空航天局戈达德空间飞行中心)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文研究如何利用前沿大语言模型(LLM)代理替代人类水文模型师进行水文模型校准,提出HydroAgent方法,通过模拟器引导的强化学习(RLSF)进行微调,以提高模型在不同流域中的适应性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17453 2026-05-19 cs.CR cs.CL 57%

Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback

勿信工具:在不可信工具反馈下评估和防御LLM代理

Lecheng Yan, Ruizhe Li, Xicheng Han, Wenxi Li, Binwu Wang, Longyue Wang, Chenyang Lyu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) University of Science and Technology of China(中国科学技术大学) University of Birmingham(伯明翰大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究探讨了在不可信工具反馈环境下评估和防御LLM代理的问题,提出了一种新的失败模式'认知中毒',并介绍了TRUST-Bench基准、GuardedJoint惩罚指标和VISTA-Guard框架,展示了轨迹感知的最终动作评分在安全与效用权衡中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11975 2026-05-19 cs.LG 57%

Stochastic Minimum-Cost Reach-Avoid Reinforcement Learning

随机最小成本到达-避免强化学习

Jingduo Pan, Taoran Wu, Yiling Xue, Bai Xue

机构 * Key Laboratory of System Software (Chinese Academy of Sciences), Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院系统软件重点实验室,软件研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学交叉学科学院,中国科学院大学,北京,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了随机最小成本到达-避免强化学习问题,提出了一种新的方法来在满足概率至少p的到达-避免约束的同时最小化预期累积成本。通过引入到达-避免概率证书(RAPCs)和基于收缩的Bellman公式,该方法能够将到达-避免考虑整合到强化学习中,并在概率约束下实现成本优化。

Comments Accepted at the Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23355 2026-05-19 cs.AI 57%

LEGO: An LLM Skill-Based Front-End Design Generation Platform

LEGO: 一个基于LLM技能的前端设计生成平台

Jincheng Lou, Ruohan Xu, Jiecheng Ma, Runzhe Tao, Xinyu Qu, Yibo Lin

机构 * School of IC, Peking University(北京大学集成电路学院) School of EECS, Peking University(北京大学电子信息技术学院) School of Microelectronics, Xidian University(西安电子科技大学微电子学院) Institute of EDA, Peking University(北京大学EDA研究院) Beijing Advanced Innovation Center for IC(北京集成电路先进创新中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出LEGO平台,通过将数字前端流程分解为六个独立步骤,并将每个代理能力表示为标准化的可组合电路技能,实现了高效的前端设计生成,显著提升了RTL设计自动化的效果。

Comments Accepted to ISEDA 2026. Best Paper Nomination. 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24238 2026-05-19 cs.LG 57%

Time Series Foundation Models as Strong Baselines in Transportation Forecasting: A Large-Scale Benchmark Analysis

时间序列基础模型在交通预测中的强大基准作用:一项大规模基准分析

Javier Yanes-Pulido, Filipe Rodrigues

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文通过在十个真实世界数据集上评估最新时间序列模型Chronos-2的零样本性能,证明了通用时间序列基础模型在交通预测中的有效性,展示了其在多数数据集上达到或超越传统统计基线和专用深度学习架构的准确性,尤其在长预测范围内表现突出。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05287 2026-05-19 cs.AI 57%

Position: Universal Time Series Foundation Models Rest on a Category Error

位置:通用时间序列基础模型建立在类别错误上

Xilin Dai, Wanxu Cai, Zhijian Xu, Qiang Xu

机构 * ZJU-UIUC Institute(浙大-UIUC研究院) School of Software(软件学院) Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文指出,追求'通用时间序列基础模型'存在根本性的类别错误,将结构容器误认为语义模态。由于时间序列包含不兼容的生成过程(如金融与流体动力学),单一大模型退化为昂贵的'通用过滤器',在分布漂移下无法泛化。为此,我们引入'自回归盲目界限',证明仅依赖历史的模型无法预测干预驱动的制度转变。我们主张用因果控制代理范式取代通用性,其中代理利用外部上下文协调一系列专门的求解器,从冻结领域专家到轻量级即时适应器。最后,我们呼吁将基准从'零样本准确性'转向'漂移适应速度',以优先考虑鲁棒、控制理论系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09575 2026-05-19 cs.SI cs.LG cs.MA eess.SP 57%

Causal Influences over Social Learning Networks

社交学习网络中的因果影响

Mert Kayaalp, Ali H. Sayed

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA USI-SUPSI)(达勒莫勒人工智能研究所(IDSIA USI-SUPSI)) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院(EPFL))

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了由社交图连接的智能体之间的时间动态因果影响,分析了社交学习模型和分布式决策协议的动力学,并推导出揭示智能体对之间因果关系的表达式,解释了网络中的影响流动。结果依赖于图拓扑和每个智能体对推理问题的信息水平。基于这些结论,本文提出了一种算法来对智能体的整体影响进行排名,以发现具有高度影响力的智能体,并提供了一种从原始观测数据中学习必要模型参数的方法。结果和所提算法通过考虑合成数据和真实社交媒体数据进行了示例说明。

Comments Accepted to the Journal of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17324 2026-05-19 cs.CR cs.AI 57%

ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents

ASPI:寻求澄清会放大LLM代理中的提示注入漏洞

Udari Madhushani Sehwag, Zhengyang Shan, Heming Liu, Dileepa Lakshan, Joseph Brandifino, Max Fenkell

机构 * Scale AI Boston University(波士顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Human Frontier Collective(人类前沿集体)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究探讨了LLM代理在执行任务时寻求澄清的行为对提示注入攻击的影响,发现这种行为会显著增加代理的脆弱性,并提出了ASPI基准测试来评估这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16881 2026-05-19 cs.CL 57%

PaliBench: A Multi-Reference Blueprint for Classical Language Translation Benchmarks

PaliBench: 一种多参考框架用于经典语言翻译基准测试

Máté Metzger, Nadnapang Phophichit

机构 * Independent Researcher(独立研究者) International Buddhist Studies College(国际佛教研究学院) Mahachulalongkornrajavidyalaya University(玛哈切通拉翁皇家师范大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文提出PaliBench,一种用于巴利语到英语翻译的基准测试,以及构建多参考翻译基准测试的方法,通过结合LLM辅助对齐、自动化验证、质量过滤、去重和多指标评估,生成包含1700段文本、8389个段落和约345,000个token的基准测试数据集,评估了十个现代大语言模型的性能。

Comments Preprint. This manuscript has not yet been peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16728 2026-05-19 cs.AI 57%

Body-Grounded Perspective Formation and Conative Attunement in Artificial Agents

具身视角形成与意图同调在人工体中

Hongju Pae

机构 * Active Inference Institute, CA, USA(主动推断研究所,加利福尼亚州,美国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种最小架构,用于人工体中的具身视角形成,通过引入内感受性活力信号、Fisher式度量以及意图同调机制,展示了如何在无奖励的网格世界中将学习到的身体倾向转化为稳定的体定向行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10825 2026-05-19 cs.AI 57%

CheeseBench: Evaluating Large Language Models on Rodent Behavioral Neuroscience Paradigms

CheeseBench:在啮齿类行为神经科学范式上评估大语言模型

Zacharie Bugaud

机构 * Astera Institute(Astera研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 CheeseBench通过九种经典行为神经科学范式评估大语言模型,发现模型规模、上下文历史、提示方式和架构对性能有显著影响,且当前模型在空间导航等任务上仍低于啮齿类动物基准。

Comments 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05646 2026-05-19 cs.CR cs.LG cs.NI 57%

Lightweight CNN-Based DDoS Detection for Resource-Constrained Edge Networks

轻量级基于CNN的DDoS检测用于资源受限的边缘网络

Vedanth Ramanathan, Krish Mahadevan, Sejal Dua

机构 * Carnegie Mellon University(卡内基梅隆大学) Green River College(绿河学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.LG

AI总结 本文提出一种轻量级监督深度学习方法,利用CNN检测DDoS攻击,通过提取包流特征并进行分类,实现低延迟的边缘网络检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16279 2026-05-19 cs.CY cs.AI 57%

Generative AI and Two-Tiered Online Mental Health Communities

生成式AI与双层在线心理健康社区

Manyang Zhang, Jinyang Zheng, Zhijun Yan

机构 * School of Management, Beijing Institute of Technology(北京理工大学管理学院) Simon Business School, University of Rochester(罗切斯特大学Simon商学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨生成式AI在双层在线心理健康社区中的影响,发现AI增强了响应速度和患者参与度,但导致部分顾问减少参与,产生跨层溢出效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20421 2026-05-19 cs.CR cs.AR cs.LG cs.NA math.NA 57%

Hawkeye: Reproducing GPU-Level Non-Determinism

Hawkeye:重现GPU级非确定性

Erez Badash, Dan Boneh, Ilan Komargodski, Megha Srivastava

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 Hawkeye系统通过在CPU上重现GPU矩阵乘法运算,实现机器学习模型训练和推理流程的精确复现,解决了传统验证方法的计算开销和鲁棒性问题。

Comments Accepted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18626 2026-05-19 cs.GT 50%

Mechanism Design for Connecting Regions Under Disruptions

在破坏下连接区域的机制设计

Hau Chan, Jianan Lin, Zining Qin, Chenhao Wang

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在道路建设、桥梁关闭或自然障碍物导致区域分离的情况下,如何通过机制设计构建新的路径以维持代理的可达性,提出了策略证明的机制来近似优化社会或最大成本。

Comments full and extended version of the conference paper published in AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18059 2026-05-19 cs.RO 50%

Bench2Drive-Robust: Benchmarking Closed-Loop Autonomous Driving under Deployment Perturbations

Bench2Drive-Robust: 在部署扰动下闭环自动驾驶的基准测试

Zhiyuan Zhang, Zhenghao Jin, Yanlun Peng, Xianda Guo, Haoran Liu, Shaofeng Zhang, Xingjun Ma, Zuxuan Wu, Junchi Yan, Xiaosong Jia, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI (TEAI)(可信具身人工智能研究院) Great Wall Motor(长城汽车) Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学计算机学院及人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出Bench2Drive-Robust,首个针对闭环端到端自动驾驶在现实部署扰动下的设备中心鲁棒性基准测试,评估了三种主要来源的部署相关扰动对自动驾驶系统的影响,揭示了传统图像级腐蚀评估未能完全捕捉的鲁棒性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17897 2026-05-19 cond-mat.mtrl-sci 50%

Metal-free heteroatom doping of carbon nitride for enhanced photocatalytic hydrogen peroxide production

无金属异质原子掺杂碳氮材料以增强光催化过氧化氢生成

Eneko Sebastian-Garate, Bruna F. Gonçalves, Jordi Llusar, Pawel Gluchowski, Ivan Infante, Senentxu-Lanceros Mendez, Qi Zhang, Hugo Salazar

专题命中 Agent评测 :agent(abstract)

AI总结 本研究探讨了无金属异质原子掺杂对石墨碳氮材料结构、电子和光催化性能的影响,发现掺杂后材料性能显著提升,其中硫掺杂材料表现出最高的过氧化氢生成速率和量子产率。

Comments 23 pages, 4 figures

Journal ref Nano Energy 146 (2025) 111551

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17709 2026-05-19 math.DS cs.NA math.NA 50%

Crime hotspot dynamics in residential burglary models with police response

住宅盗窃模型中犯罪热点动态与警察响应

Baoli Hao, Kamrun Mily, Annalisa Quaini, Ming Zhong

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出并分析了结合警察部署的住宅盗窃数学模型,通过延迟反馈机制引入动态警察响应,研究了响应延迟对犯罪热点动态的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17627 2026-05-19 cond-mat.soft nlin.PS 50%

Collective dynamics of active matter with orientation-weighted alignment

具有方向加权对齐的主动物质集体动力学

Bohdan Dobosh, Alexander Yakimenko

专题命中 Agent评测 :agent(abstract)

AI总结 研究一种具有速度依赖对齐规则的基于代理的自驱动粒子模型,通过调整对齐强度产生多种集体状态,包括无序气体态、有序编队、高密度阻塞态和具有活性晶体行为的密集有序移动簇。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17406 2026-05-19 cs.CR 50%

Rethinking Side-Channel Analysis: Automated Discovery and Analysis of Side-Channel Leakage with LLM-Assisted Agents

重新思考侧信道分析:利用LLM辅助代理自动化发现和分析侧信道泄漏

Zhen Xu, Zihao Wang, Yuhua Sun, XiaoFeng Wang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出SCAgent框架,利用LLM辅助代理自动分析侧信道风险,通过系统探索和语义推理发现侧信道并进行大规模分析,以解决侧信道泄漏的自动发现和分析问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17378 2026-05-19 eess.SP cs.NI 50%

UPSim: UxNB Propagation Simulator for 3D Map-Driven FR3 Deployments

UPSim:用于3D地图驱动FR3部署的UxNB传播模拟器

Evgenii Vinogradov

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出UPSim,一种基于射线追踪校准的半确定性解决方案,用于无人机网络中空间一致的FR3空对地传播建模。通过阴影投影从3D建筑几何中推导出确定性可见区域,并补充了路径损耗、大尺度衰落和小尺度衰落等信息,从而准确再现经验信道分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10978 2026-05-19 q-bio.QM 50%

VibeProteinBench: An Evaluation Benchmark for Language-interfaced Vibe Protein Design

VibeProteinBench: 一种用于语言接口的蛋白质设计评估基准

Hyunjin Seo, Hongjoon Ahn, Jimin Park, Sungjun Han, Gyubok Lee, Soojung Yang, Joseph S Brown, Leo Chen, Gina El Nesr, Feyisayo Eweje, Sarah Gurev, Hyejin Lee, Cheng-Hao Liu, Junlang Liu, Zhihui Qi, Gyu Rie Lee, Sungsoo Ahn, Jamin Shin, Sangwon Jung

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出VibeProteinBench,一种用于评估语言接口蛋白质设计能力的基准,通过三个互补阶段验证模型在蛋白质设计中的通用能力,揭示当前LLM在蛋白质设计方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14236 2026-05-19 math.OC 50%

Mean field social optimization: feedback person-by-person optimality and the dynamic programming equation

均场社会优化:反馈人与人之间的最优性和动态规划方程

Minyi Huang, Shuenn-Jyi Sheu, Li-Hsien Sun

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究非线性扩散模型中的均场社会优化问题,通过动态规划方法推导出一个新的哈密顿-雅可比-贝尔曼方程,即价值函数的主方程,并在一定正则条件下建立了基于主方程的控制律的ε-人与人之间的最优性,为接近社会最优提供了必要条件。通过多尺度分析构造两个辅助主方程,得到社会成本的紧估计,并在线性二次情况下给出主方程的显式解,应用于系统性风险。

Comments The first version appeared as a GERAD Technical Report G-2024-45, Aug 2024 (https://www.gerad.ca); this version includes some editorial changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16648 2026-05-19 econ.TH 50%

Strong Dominance for Dynamic Signals

动态信号的强支配

Mark Whitmeyer, Cole Williams

专题命中 Agent评测 :agent(abstract)

AI总结 本文探讨了动态决策问题中信息结构的支配性,通过信息表示揭示了动态信息结构的相对价值,提出了动态版本的揭示或细化条件。

详情

展开后加载摘要…

URL PDF HTML 收藏