arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

共收录 1892
2605.17830 2026-05-19 cs.AI cs.CL

Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents

记住更多,风险更多:具有记忆能力的LLM代理的纵向安全风险

Ahmad Al-Tawaha, Shangding Gu, Peizhi Niu, Ruoxi Jia, Ming Jin

机构 * Virginia Tech(弗吉尼亚理工大学) University of California, Berkeley(加州大学伯克利分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本研究探讨了具有记忆能力的LLM代理在长期任务中因记忆积累导致的安全风险,提出了一种触发-探测协议来评估记忆污染的影响,并发现记忆安全应被视为一个纵向属性而非单一状态属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15508 2026-05-19 cs.LG cs.CL

STS: Efficient Sparse Attention with Speculative Token Sparsity

STS: 高效稀疏注意力与推测性标记稀疏性

Ceyu Xu, Jiangnan Yu, Yongji Wu, Yuan Xie

机构 * The Hong Kong University of Science and Technology(香港科技大学) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出STS,一种无需模型再训练的稀疏注意力机制,通过利用较小的草稿模型识别出的重要标记来预测更大目标模型的重要标记,从而在大规模语言模型推理中实现高效的稀疏注意力计算,显著提升速度并保持准确性。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15177 2026-05-19 cs.AI

OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation

OpenDeepThink: 通过布拉德利-蒂尔利聚合实现并行推理

Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang

机构 * UC San Diego(UC圣地亚哥大学) Princeton University(普林斯顿大学) University of Washington(华盛顿大学) UC Berkeley(伯克利大学)

AI总结 该研究提出OpenDeepThink框架,通过布拉德利-蒂尔利聚合方法在测试时扩展计算资源,以提高大语言模型的推理能力,通过并行选择候选方案并消除选择瓶颈,从而提升模型在Codeforces等领域的表现。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14133 2026-05-19 cs.AI

ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

ClawForge: 为命令行代理生成可执行的交互式基准测试

Yuxiang Lai, Peng Xia, Haonian Ji, Kaiwen Xiong, Kaide Zeng, Jiaqi Liu, Fang Wu, Jike Zhong, Zeyu Zheng, Cihang Xie, Huaxiu Yao

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学切里波因特分校) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

AI总结 ClawForge通过生成可执行的交互式基准测试,解决了可扩展性与真实工作流评估之间的矛盾,通过系统测试代理在存在状态冲突时的处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10236 2026-05-19 cs.LG cs.AI

When Does Non-Uniform Replay Matter in Reinforcement Learning?

在强化学习中非均匀回放何时起作用?

Michal Korniak, Mikołaj Czarnecki, Yarden As, Piotr Miłoś, Pieter Abbeel, Michal Nauman

机构 * ETH Zurich(苏黎世联邦理工学院) University of Warsaw(华沙大学) UC Berkeley(伯克利加州大学) Amazon FAR(亚马逊FAR)

AI总结 本文研究了非均匀回放在强化学习中的有效性,发现回放体积、预期近期性和回放分布熵是决定因素,并提出了一种简单有效的截断几何回放策略以提高样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21357 2026-05-19 cs.LG

Beyond Objective-Based Improvement: Stationarity-Aware Expected Improvement for Bayesian Optimization

超越基于目标的改进:面向站性的期望改进用于贝叶斯优化

Joshua Hang Sai Ip, Georgios Makrygiorgos, Ali Mesbah

机构 * Department of Chemical and Biomolecular Engineering, University of California, Berkeley, CA, USA(加州大学伯克利分校化学与生物分子工程系)

AI总结 本文提出了一种新的期望改进(EI-GN)获取函数,通过引入一阶站性条件来扩展改进原则,从而在高表现和接近站点的区域促进采样,通过在获取标准中嵌入向站性进展,提供更丰富的改进概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13977 2026-05-19 cs.CV

ROVR-Open-Dataset: A Large-Scale Depth Dataset for Autonomous Driving

ROVR-Open-Dataset: 一个大规模深度数据集用于自动驾驶

Xianda Guo, Ruijun Zhang, Yiqun Duan, Ruilin Wang, Matteo Poggi, Keyuan Zhou, Wenzhao Zheng, Wenke Huang, Gangwei Xu, Yanlun Peng, Yuan Si, Qin Zou

机构 * Wuhan University(武汉大学) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) University of Technology Sydney(悉尼大学) University of Bologna(博洛尼亚大学) Zhejiang University(浙江大学) University of California, Berkeley(加州大学伯克利分校) Huazhong University of Science and Technology(华中科技大学) Great Wall Motor(长城汽车) ROVR Labs, Inc.(ROVR实验室)

AI总结 本文提出ROVR-Open-Dataset,一个大规模、多样化且成本效益高的深度数据集,用于提升自动驾驶中空间感知的能力,通过提供丰富的场景、光照和天气条件数据,以及经过验证的地面真实数据,支持鲁棒的模型训练,并识别出当前架构共享的三种失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01523 2026-05-19 cs.LG stat.ML

Beyond RLHF: A Unified Theoretical Framework of Alignment

超越RLHF:对齐的统一理论框架

Jihun Yun, Juno Kim, Jongho Park, Junhyuck Kim, Jongha Jon Ryu, Jaewoong Cho, Kwang-Sung Jun

机构 * KRAFTON UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院) POSTECH

AI总结 本文提出了一种统一的对齐理论框架,通过将对齐视为基于成对偏好的分布学习,推导出三种新的对齐目标,并证明了它们在非渐近情况下具有O(1/n)的收敛性,为RLHF提供了理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02621 2026-05-19 cs.LG math.OC stat.ML

Mirror Mean-Field Langevin Dynamics

镜像均场 Langevin 动力学

Anming Gu, Juno Kim

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) UC Berkeley(伯克利大学)

AI总结 本文提出镜像均场 Langevin 动力学(MMFLD),用于优化受限在 $\mathbb{R}^d$ 子集上的概率测度,并通过统一的对数 Sobolev 不等式获得连续 MMFLD 的线性收敛性保证,以及其时间-粒子离散化版本的统一时间传播混沌结果。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04202 2026-05-19 cs.LG cs.AI cs.CL

ClawArena: Benchmarking AI Agents in Evolving Information Environments

ClawArena:在演化的信息环境中评估AI代理的基准测试

Haonian Ji, Kaiwen Xiong, Siwei Han, Peng Xia, Shi Qiu, Yiyang Zhou, Jiaqi Liu, Jinlong Li, Bingzhou Li, Zeyu Zheng, Cihang Xie, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳州立大学夏洛特分校) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Berkeley(加州大学伯克利分校)

AI总结 ClawArena评估AI代理在信息环境动态变化中的能力,通过多源冲突推理、动态信念更新和隐式个性化三个挑战,测试代理在多通道会话、工作区文件和阶段更新中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08167 2026-05-19 cs.RO cs.AI cs.CV cs.LG

Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning

基于互联网规模知识的自监督行动预测具身推理

Milan Ganai, Katie Luo, Jonas Frey, Clark Barrett, Marco Pavone

机构 * Stanford(斯坦福大学) UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

AI总结 本文提出R&B-EnCoRe方法,通过自监督细化使模型从互联网知识中自推导具身推理策略,提升动作执行和导航性能,减少碰撞率。

Comments Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05679 2026-05-19 cs.LG

Do Sparse Autoencoders Identify Reasoning Features in Language Models?

稀疏自编码器是否在语言模型中识别推理特征?

George Ma, Zhongyuan Liang, Irene Y. Chen, Somayeh Sojoudi

机构 * UC Berkeley(加州大学伯克利分校) UCSF(旧金山大学)

AI总结 研究稀疏自编码器在大语言模型中识别推理相关内部特征的可靠性,提出基于因果token注入的评估框架,发现许多候选特征对token级干预敏感,需通过反证法验证其推理相关性。

Comments In Forty-Third International Conference on Machine Learning (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19590 2026-05-19 cs.LG cs.CL

Learning to Reason without External Rewards

无需外部奖励的学习推理

Xuandong Zhao, Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

AI总结 本文提出Intuitor方法,通过内在反馈实现无需外部奖励的自主学习,实验表明其在数学基准和代码生成等任务中表现优异,为无监督学习提供了新途径。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16193 2026-05-18 cs.CL cs.CY

Improving Cross-Cultural Survey Simulation with Calibrated Value Personas

通过校准价值人设提升跨文化调查模拟

Axel Abels, Elias Fernandez Domingos, Apurva Shah, Tom Lenaerts

机构 * Machine Learning Group, Université Libre de Bruxelles(布鲁塞尔自由大学机器学习小组) AI Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学人工智能实验室) FARI Institute, Université Libre de Bruxelles - Vrije Universiteit Brussel(布鲁塞尔自由大学-布鲁塞尔自由大学FARI研究所) Center for Human-Compatible AI, UC Berkeley(伯克利大学人机兼容人工智能中心)

AI总结 本文提出基于价值的人设构建方法,通过校准提升跨文化调查模拟的准确性,减少预测误差,尤其在少数群体中效果显著。

Comments Submitted to the Fourth International Workshop on Value Engineering in AI (VALE 2026), held at IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05966 2026-05-18 cs.CL

FinReporting: An Agentic Workflow for Localized Reporting of Cross-Jurisdiction Financial Disclosures

FinReporting: 一种用于跨司法管辖区财务披露本地化报告的代理工作流

Fan Zhang, Mingzi Song, Rania Elbadry, Yankai Chen, Shaobo Wang, Yixi Zhou, Xunwen Zheng, Yueru He, Yuyang Dai, Georgi Georgiev, Ayesha Gull, Muhammad Usman Safder, Fan Wu, Liyuan Meng, Fengxian Ji, Junning Zhao, Xueqing Peng, Jimin Huang, Yu Chen, Xue, Liu, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI The University of Tokyo(东京大学) Meiji Gakuin University(明治大学) McGill University(麦吉尔大学) Kyoto University(京都大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出FinReporting,一种代理工作流,用于跨司法管辖区的财务披露本地化报告。该系统构建了涵盖损益表、资产负债表和现金流量表的统一本体,将报告分解为可审计的阶段,并通过约束验证器提升一致性和可靠性。

Comments Accepted at ACL 2026 Demo Track. 9 pages, including figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00417 2026-05-18 cs.CL

CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency

CryptoBench: 一种动态基准,用于评估LLM代理在加密货币领域的专家级能力

Jiacheng Guo, Suozhi Huang, Zixin Yao, Yifan Zhang, Yifu Lu, Jiashuo Liu, Zihao Li, Nicholas Deng, Qixin Xiao, Jia Tian, Kanghong Zhan, Tianyi Li, Xiaochen Liu, Jason Ge, Chaoyang He, Kaixuan Huang, Lin Yang, Wenhao Huang, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Zenith Lab(Zenith实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

AI总结 本文提出CryptoBench,首个专家 curated 的动态基准,用于严格评估LLM在加密货币领域的真实能力。通过50题/月的动态任务,细分子类评估数据获取与预测能力,揭示LLM在检索与预测上的不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02453 2026-05-18 cs.LG cs.AI cs.CL

How to Train Your Advisor: Steering Black-Box LLMs with Advisor Models

如何训练你的导师:通过导师模型引导黑盒大语言模型

Parth Asawa, Alan Zhu, Abigail O'Neill, Matei Zaharia, Alexandros G. Dimakis, Joseph E. Gonzalez

机构 * University of California, Berkeley(加州大学伯克利分校) Bespoke Labs(Bespoke实验室)

AI总结 本文提出Advisor Models,通过训练小型开放权重模型生成动态个性化建议,提升黑盒前沿模型性能,实验显示在多个任务中效果显著,且具有良好的迁移性和鲁棒性。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15619 2026-05-18 cs.RO

Wind-Aware Optimal Trajectory Planning for Efficient Gliding of Fixed-Wing Aerial Systems

考虑风的高效滑翔轨迹规划

Luca Morando, Nishanth Bobbili, Giuseppe Loianno

机构 * New York University(纽约大学) University of California Berkeley(加州大学伯克利分校)

AI总结 本文提出非线性多目标轨迹规划器,通过伯恩斯坦多项式生成三次连续轨迹,结合风速估算优化滑翔性能,实验证明在风扰和障碍物情况下具有稳定性和可靠性。

Comments Accepted for publication at IEEE International Conference on Robotics and Automation (ICRA 2026) held in Vienna

Journal ref IEEE International Conference on Robotics and Automation (ICRA 2026) held in Vienna

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15565 2026-05-18 cs.LG cs.AI

AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs

AstraFlow:面向代理大语言模型的数据流强化学习

Haizhong Zheng, Yizhuo Di, Jiahui Wang, Shuowei Jin, Xueshen Liu, Yongji Wu, Z. Morley Mao, Ion Stoica, Jiawei Zhao, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校) Meta

AI总结 AstraFlow通过数据流导向的强化学习系统,实现复杂多策略协作训练和高效利用异构计算资源,提升代理LLM的推理与工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11485 2026-05-18 cs.RO

Coordinated Diffusion: Generating Multi-Agent Behavior Without Multi-Agent Demonstrations

协同扩散:无需多智能体演示生成多智能体行为

Lasse Peters, Laura Ferranti, Andrea Bajcsy, Javier Alonso-Mora

机构 * University of California, Berkeley(加州大学伯克利分校) Delft University of Technology(代尔夫特理工大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出Coordinated Diffusion框架,通过用户定义的多智能体成本函数将独立训练的单智能体扩散策略耦合,无需多智能体演示数据,实现多智能体行为协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19399 2026-05-18 cs.CL cs.AI cs.LG

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

DR Tulu:基于演进标准的深度研究强化学习

Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) Seattle Children's Hospital(西雅图儿童医院) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出RLER方法,通过演进标准与策略模型共进化,开发出首个开源深度研究模型DR Tulu,其在多个长文深度研究基准上表现优异,且成本显著低于现有模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02734 2026-05-18 q-bio.BM cs.AI q-bio.GN

SAE-RNA: A Sparse Autoencoder Model for Interpreting RNA Language Model Representations

SAE-RNA:一种用于解释RNA语言模型表示的稀疏自编码器模型

Taehan Kim, Sangdae Nam

机构 * Department of Computer Science, University of California, Berkeley(加州大学伯克利分校计算机科学系) Department of Development Engineering, University of California, Berkeley(加州大学伯克利分校发展工程系)

AI总结 本文提出SAE-RNA模型,通过分析RiNALMo表示并映射到人类水平的生物特征,探索稀疏自编码器在RNA语言模型表示中的可解释性及局限性。

Comments 12 pages, 7 figures. v2: Updated bibliography to improve reference accuracy and reflect updated publication venues. Refined claims for better alignment with results and added an Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15077 2026-05-15 cs.CL cs.AI cs.LG

Concurrency without Model Changes: Future-based Asynchronous Function Calling for LLMs

无需模型变更的并发性:面向LLMs的未来式异步函数调用

Guangyu Feng, Huanzhi Mao, Prabal Dutta, Joseph E. Gonzalez

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出AsyncFC框架,通过解耦LLM解码与函数执行,实现解码与执行的重叠及函数间并行,减少端到端延迟并保持任务精度,揭示LLMs具备处理未决执行结果的符号未来推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13360 2026-05-15 cs.LG

Speculative Interaction Agents: Building Real-Time Agents with Asynchronous I/O and Speculative Tool Calling

推测交互代理:构建具有异步I/O和推测性工具调用的实时代理

Coleman Hooper, Minwoo Kang, Suhong Moon, Nicholas Lee, Eric Wen, John Wawrzynek, Michael W. Mahoney, Yakun Sophia Shao, Amir Gholami, Kurt Keutzer

机构 * University of California, Berkeley(加州大学伯克利分校) ICSI LBNL(劳伦斯伯克利国家实验室)

AI总结 本文提出推测交互代理,通过异步I/O和推测性工具调用,实现复杂多轮工具调用的实时交互,提升实时应用性能。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12484 2026-05-15 cs.LG cs.AI

Learning, Fast and Slow: Towards LLMs That Adapt Continually

学习,快速与缓慢:迈向能够持续适应的LLM

Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri

机构 * UC Berkeley(加州大学伯克利分校) Mila(蒙特利尔大学人工智能研究所) UT Austin(得克萨斯大学奥斯汀分校) Eragon Periodic Labs Mirendil Video

AI总结 本文提出一种快速-缓慢学习框架,通过将模型参数作为缓慢权重和优化上下文作为快速权重,提升LLM在连续学习中的样本效率和性能,减少灾难性遗忘。

Comments 29 pages, 14 figures, including appendix; Blog post: https://gepa-ai.github.io/gepa/blog/2026/05/11/learning-fast-and-slow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06471 2026-05-15 cs.LG cs.AI

Why Goal-Conditioned Reinforcement Learning Works: Relation to Dual Control

为何目标条件强化学习有效:与双控的关系

Nathan P. Lawrence, Ali Mesbah

机构 * Department of Chemical and Biomolecular Engineering, University of California, Berkeley, CA 94720 USA(化学与生物分子工程系,加州大学伯克利分校,CA 94720 USA)

AI总结 本文分析了目标条件强化学习与最优控制的关系,揭示了经典目标条件奖励与传统二次目标之间的优化差距,并验证了目标条件策略在非线性和不确定环境中的优势。

Comments IFAC world congress postprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05213 2026-05-15 cs.RO cs.AI cs.LG

VER: Vision Expert Transformer for Robot Learning via Foundation Distillation and Dynamic Routing

VER:基于基础蒸馏和动态路由的机器人学习视觉专家变换器

Yixiao Wang, Mingxiao Huo, Zhixuan Liang, Yushi Du, Lingfeng Sun, Haotian Lin, Jinghuan Shang, Chensheng Peng, Mohit Bansal, Mingyu Ding, Masayoshi Tomizuka

机构 * UC Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学) University of Hong Kong(香港大学) Peking University(北京大学) Stony Brook University(石溪大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 VER通过基础蒸馏和动态路由实现机器人学习,采用轻量路由网络动态选择专家,提升任务灵活性和精度,实现多任务高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14343 2026-05-15 cs.LG math.ST stat.ML stat.TH

Nearest-Neighbor Radii under Dependent Sampling

依赖采样下的最近邻半径

Yuanyuan Gao, Yilong Hou, Zhexiao Lin

机构 * Department of Statistics, University of California, Berkeley, CA 94720, USA(加州大学伯克利分校统计系) Department of Biostatistics, University of California, Berkeley, CA 94720, USA(加州大学伯克利分校生物统计学系)

AI总结 研究依赖采样下最近邻半径的几何性质,建立分布无关的几乎必然收敛和尖锐非渐近矩界,适用于高维数据集中的低维流形。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14290 2026-05-15 cs.CR cs.AI cs.CL cs.SE

Web Agents Should Adopt the Plan-Then-Execute Paradigm

网络代理应采用计划-然后执行范式

Julien Piet, Annabella Chow, Yiwei Hou, Muxi Lyu, Sylvie Venuto, Jinhao Zhu, Raluca Ada Popa, David Wagner

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 本文提出网络代理应默认采用计划-然后执行范式,而非ReAct架构。该范式通过预先制定任务特定程序,避免运行时网页内容的干扰,提升安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14215 2026-05-15 cs.AI cs.LG q-bio.QM

GenCircuit-RL: Reinforcement Learning from Hierarchical Verification for Genetic Circuit Design

GenCircuit-RL:基于分层验证的遗传电路设计强化学习

Noah Flynn

机构 * University of California, Berkeley, CA, USA(加州大学伯克利分校)

AI总结 本文提出GenCircuit-RL框架,通过分层验证奖励和课程学习提升遗传电路设计的正确性与功能推理能力,实验表明其在功能推理任务中成功率提升14-16个百分点。

Comments Link: https://icml.cc/virtual/2026/poster/61789

详情

展开后加载摘要…

URL PDF HTML 收藏