arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Los Angeles(加州大学洛杉矶分校)

共收录 1060
2606.18192 2026-06-18 cs.AI 新提交

The Stanford EDGAR Filings Dataset: Reconstructing U.S. Corporate and Financial Disclosures into Layout-Faithful and Token-Efficient Pretraining Data

斯坦福EDGAR文件数据集:将美国公司及财务披露重建为布局忠实且令牌高效的预训练数据

Nick Bettencourt, Xiaowei Ding, Kay Giesecke

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Nanjing University(南京大学) Stanford University(斯坦福大学)

AI总结 为解决长上下文文档稀缺问题,提出SEFD数据集,将SEC文件重建为布局忠实的MultiMarkdown格式,用于金融语言建模与评估,具有令牌高效、与Common Crawl重叠率低于0.1%的特点。

Comments Preprint. Includes appendix, tables, and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18119 2026-06-17 cs.AI 新提交

First Proof Second Batch

首次证明第二批

Mohammed Abouzaid, Nikhil Srivastava, Rachel Ward, Lauren Williams

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Harvard University(哈佛大学) Polish Academy of Sciences(波兰科学院) UC Berkeley(加州大学伯克利分校) Brown University(布朗大学) ETH Zürich(苏黎世联邦理工学院) MIT(麻省理工学院) Weierstrass Institute(魏尔斯特拉斯研究所) Duke University(杜克大学) Sorbonne Université(索邦大学) Boston College(波士顿学院) Université du Québec à Montréal(魁北克大学蒙特利尔分校) UCLA(加州大学洛杉矶分校) University of Michigan(密歇根大学) University of Maryland(马里兰大学)

AI总结 测试多个AI系统在十个数学研究问题上的解题能力,评估当前AI解决研究级数学问题的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18049 2026-06-17 stat.ML cs.LG 版本更新

Recursive Learning Without Collapse: A Weighting-Based Stabilization Framework

无崩溃的递归学习:基于加权的稳定化框架

Hengzhi He, Shirong Xu, Guang Cheng

机构 * Wang Yanan Institute for Studies in Economics, Xiamen University(厦门大学王亚南经济研究所) Department of Statistics and Data Science, University of California, Los Angeles(加州大学洛杉矶分校统计与数据科学系)

AI总结 针对递归生成模型训练中的模型崩溃问题,提出基于加权的训练策略,在混合真实与合成数据场景下,理论推导出最优加权方案的统一表达式,揭示合成数据利用与模型性能间的权衡。

Comments This article has been accepted for publication in Journal of the Royal Statistical Society: Series B, published by Oxford University Press. The Version of Record is available at https://doi.org/10.1093/jrsssb/qkag099

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17010 2026-06-16 cs.LG 新提交

From Tokens to Policy: Causal and Interpretable Heterogeneous Treatment Effects Identification

从令牌到策略:因果且可解释的异质性处理效应识别

Riccardo Cadei, Frank Otchere, Nyasha Tirivayi, Gustavo Angeles Tagliaferro, Falco J. Bargagli-Stoffi, Francesco Locatello

机构 * ISTA UNICEF(联合国儿童基金会) UCLA(加州大学洛杉矶分校)

AI总结 提出NEXIS方法,利用多模态预处理表示将HTE识别转化为马尔可夫毯发现问题,实现因果可解释的异质性处理效应识别,并在非洲反贫困项目中验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16953 2026-06-16 cs.RO 新提交

SidewalkBench: Benchmarking Visual Navigation on Urban Sidewalks

SidewalkBench: 城市人行道视觉导航基准

Zhizheng Liu, Honglin He, Vivek Alumootil, Akshat Pandya, Brad Squicciarini, Wayne Wu, Bolei Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Coco Robotics

AI总结 针对城市人行道视觉导航缺乏统一基准的问题,提出SidewalkBench,基于NVIDIA Isaac Sim构建高保真仿真环境,评估9种模型,发现行人交互和长距离鲁棒性是关键瓶颈。

Comments Project Page: https://vail-ucla.github.io/SidewalkBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16729 2026-06-16 cs.LG math.OC 新提交

Learning Policy from a Single Trajectory in Average-Reward Markov Decision Process

从平均奖励马尔可夫决策过程中的单条轨迹学习策略

Jongmin Lee, Ernest K. Ryu, Vaneet Aggarwal

机构 * Seoul National University(首尔国立大学) UCLA(加州大学洛杉矶分校) Purdue University(普渡大学)

AI总结 针对弱通信平均奖励MDP,首次从单条轨迹建立有限样本复杂度保证,提出无模型方法,值函数和策略方法分别达到$\widetilde{O}(1/\varepsilon^2)$和$\widetilde{O}(1/\varepsilon^4)$的样本复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16261 2026-06-16 physics.optics cs.CV cs.NE physics.app-ph 新提交

Wavelength-Multiplexed 2D Beam Steering via a Passive Diffractive Network

通过无源衍射网络实现波长复用的二维光束偏转

Che-Yung Shen, Yuhang Li, Cagatay Isil, Tianyi Gan, Mona Jarrahi, Aydogan Ozcan

机构 * Electrical and Computer Engineering Department, University of California, Los Angeles(加州大学洛杉矶分校电气与计算机工程系) Bioengineering Department, University of California, Los Angeles(加州大学洛杉矶分校生物医学工程系) California NanoSystems Institute (CNSI), University of California, Los Angeles(加州大学洛杉矶分校加州纳米系统研究所)

AI总结 提出一种无源衍射光学网络,利用波长作为控制参数实现任意二维光束偏转,通过深度学习优化级联衍射层,数值和实验验证了625个波长通道的25x25偏转阵列,具有亚波长精度和高信道保真度。

Comments 20 Pages, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16122 2026-06-16 cs.AI 新提交

Thinking with Visual Grounding

视觉锚定思维

Junkai Zhang, Yihe Deng, Kai-Wei Chang, Wei Wang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 提出视觉锚定思维方法,让视觉语言模型在推理时交替生成自然语言和视觉锚点(点或框),并通过合成数据管道和锚定感知强化学习训练,在计数和空间推理任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15021 2026-06-16 cs.RO 新提交

Steering Autoregressive Vision-Language-Action Policies via Action Token Intervention

通过动作令牌干预引导自回归视觉-语言-动作策略

Jason Chan, Jonathan C. Kao

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出Token Steering方法,在推理时通过干预动作令牌空间动态引导VLA模型轨迹生成,无需训练或微调,显著提升家务操作任务成功率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15004 2026-06-16 eess.SY cs.LG cs.SY 新提交

CREST: Deployment-Realistic Hardware-in-the-Loop NAS for Embedded Sensing Systems

CREST:面向嵌入式传感系统的部署真实硬件在环神经网络架构搜索

Joseph Q. Zales, Pragya Sharma, Mani Srivastava

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出CREST框架,通过硬件在环测量联合优化模型架构、目标平台、运行时调度和部署策略,在惯性里程计和音频分类任务上相比FLOPs选择降低中位推理能耗41.7%。

Comments 14 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22376 2026-06-16 cs.IR cs.AI 版本更新

Closing the Auto-Research Loop: An AI Co-Scientist for Production Search Ranking

关闭自动研究循环:面向生产搜索排名的AI合作科学家

Liwei Wu, Cho-Jui Hsieh

机构 * Trip.com Group(Trip.com集团) UCLA(加州大学洛杉矶分校)

AI总结 提出AI合作科学家框架,通过LLM代理与云计算集成,自动迭代生成想法、实现代码、进行GPU实验并分析结果,在搜索排名任务中带来额外+0.083%离线增益。

Comments Submitted to EMNLP for review on June 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12670 2026-06-16 cs.AI 版本更新

SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks

SkillsBench: 基准测试智能体技能在不同任务中的有效性

Xiangyi Li, Yimin Liu, Wenbo Chen, Bingran You, Zonglin Di, Yifeng He, Shenghan Zheng, Kyoung Whan Choe, Jiankai Sun, Shuyi Wang, Chujun Tao, Binxu Li, Xuandong Zhao, Hejia Geng, Xiaojun Wu, Junwei Zhou, Xiaokun Chen, Hanwen Xing, Yubo Li, Qunhong Zeng, Di Wang, Yuanli Wang, Roey Ben Chaim, Penghao Jiang, Haotian Shen, Luyang Kong, Xinyi Liu, Runhui Wang, Xuanqing Liu, Jiachen Li, Xin Lan, Yueqian Lin, Wengao Ye, Junwei He, Songlin Li, Yue Zhang, Yipeng Gao, Yijiang Li, Ze Ma, Liqiang Jing, Tianyu Wang, Kaixin Li, Yiqi Xue, Haoran Lyu, Yizhuo He, Yuchen Tian, Shutong Wu, Bowei Wang, Yixuan Gao, Bo Chen, Litong Liu, Sikai Cheng, Jiajun Bao, Shuaicheng Tong, Shuwen Xu, Terry Yue Zhuo, Tinghan Ye, Qi Qi, Miao Li, Longtai Liao, Zelin Tan, Chang Shi, Xilin Tang, Srinath Tankasala, Boqin Yuan, Yaoyao Qian, Jianhong Tu, Chenguang Wang, Yizhou Sun, Wei Wang, Aaron Taylor, Ziyue Yang, Changkun Guan, Zhikang Dong, Xinyu Zhang, Steven Dillmann, Han-chung Lee, Dawn Song

机构 * BenchFlow OSU Amazon UC Berkeley UC Santa Cruz UC Davis Dartmouth RLWRLD Independent Princeton University Oxford University Stanford University USC CMU Foxconn Zenity UNSW UT Austin MSU Duke University ByteDance UT Dallas UC San Diego Columbia University University of Rochester Cornell Tech Georgia Tech Cornell University NEU UCLA Snap Inc. Fanshawe College University of Science and Technology of China HKUST(GZ) Anyscale

AI总结 提出SkillsBench基准,包含8领域87个任务,通过配对评估证明技能提升平均通过率16.6个百分点,小模型配备技能可匹敌大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03867 2026-06-16 math.AG cs.LG stat.ML 版本更新

Constraining the outputs of ReLU neural networks

约束ReLU神经网络的输出

Yulia Alexandr, Guido Montúfar

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Max Planck Institute for Mathematics in the Sciences(马克斯·普朗克数学研究所)

AI总结 通过引入与ReLU网络相关的代数簇,利用激活区域内的秩约束推导多项式方程,刻画网络可表示的函数,并研究簇达到预期维度的条件。

Comments 33 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05163 2026-06-16 cs.CL cs.LG 版本更新

Enhancing LLM Safety Through a Theoretical Minimax Game Lens

通过理论极小极大博弈视角增强LLM安全性

Yihe Deng, Yu Yang, Junkai Zhang, Wei Wang, Bo Li

机构 * University of California, Los Angeles(加州大学洛杉矶分校) VirtueAI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出极小极大强化学习框架,通过数据生成器与分类器协同进化生成高质量多语言安全数据,理论证明收敛到纳什均衡,使小模型在英文基准上超越SOTA近10%且推理速度提升4.5倍。

Comments 24 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14113 2026-06-15 cs.SE cs.CL 新提交

Simulating Students' Java Programming Errors with Large Language Models

用大型语言模型模拟学生的Java编程错误

Ali Keramati, Jie Cao, Iman Mohammadi, Mark Warschauer, Yang Shi

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 探索用LLM模拟学生编程错误,评估五种模型在多样性和对齐性上的表现,发现Claude Sonnet 4平衡最佳,且合成错误与真实错误难以区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13929 2026-06-15 cs.CV cs.LG 新提交

Self-Evolving Visual Questioner

自演化视觉提问器

Yijun Liang, Hengguang Zhou, Ming Li, Lichen Li, Cho-Jui Hsieh, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of California, Los Angeles(加州大学洛杉矶分校) Peking University(北京大学) Arena MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 提出自演化框架,让视觉语言模型作为提问器和过滤器,无需外部监督即可生成更难、更信息丰富、更视觉中心的问题,并保持探索多样性以避免训练崩溃,显著提升自主提问质量和难度边界。

Comments 21 pages, including references and appendix. Project Page is available at https://joliang17.github.io/SelfEvolvingVQG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00947 2026-06-15 cs.LG cs.AI 版本更新

Silent Failures in Federated Personalization of Foundation Models

联邦基础模型个性化中的静默失败

YongKyung Oh, Alex Bui

机构 * Medical & Imaging Informatics (MII) Group, University of California, Los Angeles (UCLA)(医学与影像信息学(MII)组,加州大学洛杉矶分校(UCLA))

AI总结 本文提出联邦基础模型个性化中因隐私约束导致的一类信任失败——静默失败,包括偏差放大、公平性崩溃和对齐侵蚀,并引入六种静默失败模式的分类法,强调隐私保护训练不足以保障可信部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03120 2026-06-15 cs.LG cs.AI 版本更新

Quantized Evolution Strategies: High-precision Fine-tuning of Quantized LLMs at Low-precision Cost

量化进化策略:以低精度代价实现量化大语言模型的高精度微调

Yinggan Xu, Kajetan Schweighofer, Risto Miikkulainen, Xin Qiu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Cognizant AI Lab(Cognizant AI实验室) UT Austin(得克萨斯大学奥斯汀分校)

AI总结 提出量化进化策略(QES),通过集成累积误差反馈和无状态种子重放,直接在量化空间进行全参数微调,无需反向传播,显著优于现有零阶微调方法。

Comments Added more tasks and baselines

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12882 2026-06-12 cs.AI 新提交

HarnessBridge: Learnable Bidirectional Controller for LLM Agent Harness

HarnessBridge: 用于LLM智能体框架的可学习双向控制器

Xiaoxuan Wang, Haixin Wang, Alexander Taylor, Jason Cong, Yizhou Sun, Wei Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出HarnessBridge,一种轻量级可学习框架控制器,通过双向投影参数化智能体-环境接口,减少令牌使用和轨迹长度,并泛化到更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12759 2026-06-12 cs.RO 新提交

Sparse2Act: Learning Action-Aligned Sparse 3D Representations for Cross-Domain Robot Manipulation

Sparse2Act: 学习跨域机器人操作的动作对齐稀疏3D表示

Yu Guo, Chang Yu, Siyu Ma, Yunuo Chen, Yin Yang, Ying Nian Wu, Chenfanfu Jiang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣迭戈分校) University of Utah(犹他大学)

AI总结 提出Sparse2Act框架,通过动作对齐的掩码稀疏3D编码预训练,实现跨域机器人操作,在LIBERO-10上达86.9%成功率,并支持域迁移和sim-to-real。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12603 2026-06-12 cs.RO cs.AI 新提交

From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation

从模仿到对齐:面向长距离人行道导航的人类偏好流策略

Honglin He, Zhizheng Liu, Yukai Ma, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出FlowPilot,一种仅使用单目RGB相机的无地图导航策略,通过锚定流匹配进行预训练,并引入人类偏好学习实现对齐,在长距离人行道导航中提升鲁棒性和社会合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12530 2026-06-12 cs.LG 版本更新

Mixing Makes Markovian Contexts Cheap for Linear Bandits

混合使得马尔可夫上下文在线性赌博机中变得廉价

Kaan Buyukkalayci, Osama Hanna, Christina Fragouli

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Meta, Superintelligence Lab(Meta超智能实验室)

AI总结 针对马尔可夫上下文线性赌博机问题,提出一种基于均匀几何遍历性的约简方法,通过构建平稳替代动作集和延迟更新方案,实现了与标准线性赌博机相当的最坏情况遗憾界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10885 2026-06-12 physics.plasm-ph cs.LG physics.comp-ph

Learning collision operators from plasma phase space data using differentiable simulators

利用可微分模拟器从等离子体相空间数据学习碰撞算子

Diogo D. Carvalho, Pablo J. Bilbao, Warren B. Mori, Luis O. Silva, E. Paulo Alves

机构 * GoLP/Instituto de Plasmas e Fusão Nuclear, Instituto Superior Técnico, Universidade de Lisboa(GoLP/等离子体与核融合研究所,理工学院,里斯本大学) Mani L. Bhaumik Institute for Theoretical Physics, University of California, Los Angeles(马尼·L·巴乌米克理论物理研究所,加州大学洛杉矶分校) The Rudolf Peierls Centre for Theoretical Physics, University of Oxford(鲁道夫·皮埃尔尔斯理论物理中心,牛津大学) Department of Physics and Astronomy University of California, Los Angeles(物理与天文学系,加州大学洛杉矶分校)

AI总结 提出一种结合可微分Fokker-Planck求解器与梯度优化方法,从等离子体相空间数据推断碰撞算子的方法,并在二维PIC模拟数据上验证其准确性和计算效率。

Comments accepted for publication in Journal of Plasma Physics, code available at https://github.com/diogodcarvalho/ml-pic-collision-operators

Journal ref J. Plasma Phys. (2026), vol. 92, E76

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22028 2026-06-12 cs.CV cs.RO 版本更新

From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning

从看见到体验:通过强化学习扩展导航基础模型

Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Coco Robotics(Coco机器人)

AI总结 提出S2E框架,结合离线视频预训练和模拟环境强化学习,通过锚点引导分布匹配和残差注意力模块,提升导航基础模型的交互性和安全性。

Comments 27 pages, 20 figures, 9 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23823 2026-06-12 cs.CL 版本更新

RAGPPI: RAG Benchmark for Protein-Protein Interactions in Drug Discovery

RAGPPI:药物发现中蛋白质-蛋白质相互作用的RAG基准

Youngseung Jeon, Ziwen Li, Thomas Li, JiaSyuan Chang, Morteza Ziyadi, Xiang 'Anthony' Chen

机构 * University of California Los Angeles(加州大学洛杉矶分校) Palo Alto High School(帕洛阿尔托高中) Amazon AGI(亚马逊人工智能研究院)

AI总结 提出RAGPPI基准,包含4420个问答对,用于评估检索增强生成在药物发现中识别蛋白质-蛋白质相互作用生物学影响的能力。

Comments 17 pages, 4 figures, 8 tables

Journal ref Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04021 2026-06-12 cs.DC cs.AI cs.LG cs.PF 版本更新

Prism: Cost-Efficient Multi-LLM Serving via GPU Memory Ballooning

Prism: 通过GPU内存气球实现经济高效的多LLM服务

Shan Yu, Yifan Qiao, Mingyuan Ma, Yangmin Li, Shuo Yang, Xinyuan Tong, Yang Wang, Zhiqiang Xie, Yuwei An, Shiyi Cao, Ke Bao, Deepak Vij, Xiaoning Ding, Yichen Wang, Qingda Lu, Zhong Wang, Gao Gao, Harry Xu, Junyi Shu, Jiarong Xing, Ying Sheng

机构 * UCLA(加州大学洛杉矶分校) UC Berkeley(伯克利加州大学) Harvard University(哈佛大学) CMU(卡内基梅隆大学) University of Edinburgh(爱丁堡大学) Intel(英特尔) Stanford University(斯坦福大学) LMSYS(灵州市系统实验室) ByteDance(字节跳动) Alibaba Cloud(阿里云) Tsinghua University(清华大学) Novita AI Rice University(里士满大学)

AI总结 针对多LLM服务中资源效率低下的问题,提出基于内存气球的内存中心化LLM协同服务框架Prism,统一空间与时间共享,已在10K+ GPU生产环境部署。

Comments OSDI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11429 2026-06-11 eess.AS cs.CL cs.SD 新提交

Gumbel-BEARD: Automatic Layer Selection for Self-Supervised Adaptation of Whisper in Low-Resource Domains

Gumbel-BEARD:低资源领域Whisper自监督自适应的自动层选择

Zilai Wang, Natarajan Balaji Shankar, Mohan Shi, Kaiyuan Zhang, Abeer Alwan

机构 * University of California, Los Angeles, USA(加州大学洛杉矶分校)

AI总结 提出Gumbel-BEARD框架,通过可训练的Gumbel-Softmax选择器自动选择Whisper编码器层,结合BEST-RQ自监督目标实现低资源领域自适应,在儿童语音和方言数据集上取得最先进词错误率。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11743 2026-06-11 cs.RO cs.GR cs.LG 新提交

TacCoRL: Integrating Tactile Feedback into VLA via Simulation

TacCoRL: 通过仿真将触觉反馈集成到视觉-语言-动作模型中

Siyu Ma, Yuqi Liang, Chang Yu, Yunuo Chen, Hao Su, Yixin Zhu, Yin Yang, Chenfanfu Jiang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, San Diego(加利福尼亚大学圣迭戈分校) University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学) University of Utah(犹他大学)

AI总结 提出TacCoRL框架,通过仿真与真实联合训练和强化学习,将触觉反馈注入视觉-语言-动作策略,在接触密集型任务中平均成功率提升22.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11459 2026-06-11 cs.CL cs.AI cs.LG 新提交

APEX: Automated Prompt Engineering eXpert with Dynamic Data Selection

APEX: 具有动态数据选择的自动提示工程专家

Fei Wang, Si Si, Cho-Jui Hsieh, Inderjit S. Dhillon

机构 * Google(谷歌) UCLA(加州大学洛杉矶分校)

AI总结 提出APEX框架,通过动态数据分层(易、难、混合)优先选择高杠杆子集,在固定预算下提升提示优化效率,在三个基准上平均提升11.2%和6.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18543 2026-06-11 cs.AI cs.CL 版本更新

ClawEnvKit: Automatic Environment Generation for Claw-Like Agents

ClawEnvKit:爪型智能体的自动环境生成

Xirui Li, Ming Li, Ion Stoica, Cho-Jui Hsieh, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Arena University of California, Berkley(伯克利大学) University of California, Los Angeles(洛杉矶大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 提出ClawEnvKit自动生成多样、可验证的爪型智能体训练与评估环境,构建含1040个环境的Auto-ClawEval基准,成本降低13800倍,性能提升达15.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏