arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, San Diego(加州大学圣迭戈分校)

共收录 1275
2605.08904 2026-05-12 cs.AI

OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces

OPT-BENCH:评估大搜索空间中LLM代理的迭代自我优化

Xiaozhe Li, Jixuan Chen, Xinyu Fang, Shengyuan Ding, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 OPT-BENCH通过结合20个机器学习任务和10个经典NP难问题,评估LLM代理在大规模搜索空间中通过内在自我反思而非机械工具应用进行适应的能力,揭示更强模型在反馈利用上的优势及基础能力的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08526 2026-05-12 cs.LG

Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck

Skill-CMIB: 多模态代理技能用于通过条件多模态信息瓶颈实现一致行动

Zihan Huang, Junda Wu, Tong Yu, Qianqi Yan, Rohan Surana, Uttaran Bhattacharya, Lina Yao, Xin Eric Wang, Julian McAuley

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院) UC Santa Barbara(UC圣芭芭拉大学) University of New South Wales(新南威尔士大学)

AI总结 本文提出Skill-CMIB方法,通过条件多模态信息瓶颈构建多模态技能,解决多模态环境下代理执行不一致的问题,提升执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08520 2026-05-12 cs.LG cs.DC

FlashEvolve: Accelerating Agent Self-Evolution with Asynchronous Stage Orchestration

FlashEvolve:通过异步阶段协调加速智能体自我进化

Zhengding Hu, Mingge Lu, Zhen Wang, Jixuan Ruan, Chang Chen, Zaifeng Pan, Yue Guan, Ruiyi Wang, Zhongkai Yu, Chao Zhang, Yufei Ding

机构 * University of California, San Diego(加州大学圣地亚哥分校) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出FlashEvolve框架,通过异步工作流和队列降低智能体自我进化的时间成本,提升吞吐量和token效率,在GEPA任务中实现3.5倍和4.9倍的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09096 2026-05-12 cs.RO cs.AI cs.LG

When a Robot is More Capable than a Human: Learning from Constrained Demonstrators

当机器人比人类更强大时:从受限演示中学习

Xinhu Li, Ayush Jain, Zhaojing Yang, Yigit Korkmaz, Erdem Bıyık

机构 * Thomas Lord Department of Computer Science, University of Southern California(汤姆·劳德计算机科学系,南加州大学) Meta AI Department of Computer Science & Engineering, University of California San Diego(计算机科学与工程系,加州大学圣地亚哥分校)

AI总结 本文探讨机器人能否超越受限专家的演示学习,通过探索更高效轨迹和自定义奖励信号,提升学习效率和任务完成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21228 2026-05-12 cs.CR cs.AI

CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing

CachePrune: 通过KV缓存编辑教LLMs不遵循指令

Rui Wang, Junda Wu, Yu Xia, Tong Yu, Ruiyi Zhang, Ryan Rossi, Subrata Mitra, Lina Yao, Julian McAuley

机构 * Adobe Research(Adobe研究院) University of California San Diego(加州大学圣地亚哥分校) University of New South Wales(新南威尔士大学)

AI总结 CachePrune通过KV缓存编辑识别并修剪指令跟随相关神经元,降低间接提示注入攻击成功率,同时保持LLM执行用户指令的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07825 2026-05-11 cs.MM cs.CV

Anisotropic Modality Align

各向异性模态对齐

Xiaomin Yu, Yijiang Li, Yuhui Zhang, Hanzhen Zhao, Yue Yang, Hao Tang, Yue Song, Xiaobin Hu, Chengwei Qin, Shuicheng Yan, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) NUS(国立新加坡大学) UCSD(加州大学圣地亚哥分校) Stanford(斯坦福大学) PKU(北京大学) THU(清华大学)

AI总结 本文研究了多模态模型中模态间转换的可行性,提出各向异性模态对齐方法,通过几何修正框架提升单模态数据的多模态训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08786 2026-05-11 cs.CY cs.LG

On the Meta-Design of Allocation Problems

关于分配问题的元设计

Unai Fischer-Abaigar, Emily Aiken, Christoph Kern, Juan Carlos Perdomo

机构 * LMU Munich(慕尼黑莱茵河大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of California San Diego(圣地亚哥大学) New York University(纽约大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文探讨了在资源分配问题中,如何通过元设计优化投资预测、容量限制和治疗质量,以提升整体福利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07127 2026-05-11 cs.LG cs.CL

The Position Curse: LLMs Struggle to Locate the Last Few Items in a List

位置诅咒:LLM在列表中定位最后几个项目时表现不佳

Zhanqi Zhang, Hua-Dong Xiong, Robert C. Wilson, Mikio Aoi, Marcelo G. Mattar, Li Ji-An

机构 * UC San Diego(加州大学圣地亚哥分校) Georgia Tech(佐治亚理工学院) New York University(纽约大学)

AI总结 LLM在定位长列表中单个相关项目时表现优异,但在短列表中最后几个项目定位上存在缺陷,即位置诅咒。通过构建PosBench数据集进行微调后,虽然提升了定位能力,但仍未达到理想水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06978 2026-05-11 cs.CL cs.AI

Group of Skills: Group-Structured Skill Retrieval for Agent Skill Libraries

技能组:面向智能体技能库的分组结构技能检索

Kun Zeng, Yu Huo, Siyu Zhang, Zi Ye, Yuecheng Zhuo, Haoyue Liu, Yuquan Lu, Junhao Wen, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Sun Yat-sen University(孙中山大学) University of California, San Diego(加州大学圣地亚哥分校) Taiyuan University of Technology(太原理工大学)

AI总结 本文提出GoSkills,一种分组结构技能检索方法,通过构建基于类型技能图的锚点中心技能组,提升智能体在有限技能预算下对可见需求的覆盖能力,改进了传统技能检索方法的性能。

Comments 30 pages, 4 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06841 2026-05-11 cs.AI cs.LG

AGWM: Affordance-Grounded World Models for Environments with Compositional Prerequisites

AGWM:基于 affordance 的世界模型用于具有组合前提条件的环境

Qinshi Zhang, Weipeng Deng, Zhihan Jiang, Jiaming Qu, Qianren Li, Weitao Xu, Ray LC

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Hong Kong(香港大学) Columbia University(哥伦比亚大学) Amazon(亚马逊) City University of Hong Kong(香港城市大学)

AI总结 本文提出 AGWM 模型,通过学习抽象 affordance 结构来跟踪动作的动态可执行性,以解决传统世界模型在多步预测中的误差累积问题。

Comments 16 pages, 3 figures, 4 tables. Appendix on pages 11-16 (main text is self-contained)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18744 2026-05-11 cs.AI cs.LG

TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models

TSRBench: 一个全面的多任务多模态时间序列推理基准,用于通用模型

Fangxu Yu, Xingang Guo, Lingzhi Yuan, Haoqiang Kang, Hongyu Zhao, Lianhui Qin, Furong Huang, Bin Hu, Tianyi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学学院公园分校) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 TSRBench通过4125个问题和15个任务评估通用模型的时间序列推理能力,揭示了感知和推理中的缩放定律失效以及多模态融合的不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02602 2026-05-11 cs.CR cs.LG

SWaRL: Safeguard Code Watermarking via Reinforcement Learning

通过强化学习保障代码水印:SWaRL

Neusha Javidnia, Ruisi Zhang, Ashish Kundu, Farinaz Koushanfar

机构 * ECE Department UC San Diego(UC圣地亚哥大学电子与计算机工程系) Cisco Research(思科研究)

AI总结 SWaRL通过强化学习框架实现稳健且保真度高的代码水印,保护大语言模型的知识产权,通过在生成程序中嵌入唯一可验证签名,有效抵御移除攻击并保持功能正确性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21183 2026-05-11 cs.LG cs.AI cs.CL

MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge

MaPPO:结合先验知识的最大后验偏好优化

Guangchen Lan, Sipeng Zhang, Tianle Wang, Yuwei Zhang, Daoan Zhang, Xinpeng Wei, Xiaoman Pan, Hongming Zhang, Dong-Jun Han, Christopher G. Brinton

机构 * Purdue University(普渡大学) University of California, San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Meta, FAIR Yonsei University(延世大学)

AI总结 MaPPO通过整合先验奖励知识优化偏好学习,提升对齐性能,无需额外超参数,适用于离线和在线设置,支持DPO变体插件,实验显示在多个基准上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06347 2026-05-08 cs.HC cs.AI

Human-AI Co-Evolution and Epistemic Collapse: A Dynamical Systems Perspective

人类与人工智能的共演与知识崩溃:一种动态系统视角

Xuening Wu, Yanlan Kang, Qianya Xu, Kexuan Xie, Jiaqi Mi, Honggang Wang, Yubin Liu, Zeping Chen

机构 * Fudan University(复旦大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of California San Diego(加州大学圣地亚哥分校) Nanjing University of Posts and Telecommunications(南京邮电大学)

AI总结 本文从动态系统视角探讨人类与语言模型的共演及知识崩溃问题,提出人类与模型形成反馈闭环的耦合系统,通过三变量模型揭示共进化增强、脆弱均衡和退化收敛三种动态模式。

Comments 5 pages, 3 figures, ICML EIML Workshop submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06036 2026-05-08 cs.LG cs.AI

Optimal Transport for LLM Reward Modeling from Noisy Preference

基于噪声偏好的LLM奖励建模中的最优传输

Licheng Pan, Haochen Yang, Haoxuan Li, Yunsheng Lu, Yongqi Tong, Yinuo Wang, Shijian Wang, Zhixuan Chu, Lei Shen, Yuan Lu, Hao Wang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文提出SelectiveRM框架,利用最优传输对噪声偏好进行去噪,通过联合一致性差异对齐模型预测分布与偏好数据,并引入质量放松机制以排除矛盾样本,提升奖励建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18978 2026-05-08 cs.LG cs.AI

Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning

针对基于策略的强化学习中批评学习的低秩适应

Yuan Zhuang, Yuexin Bian, Sihong He, Jie Feng, Qing Su, Songyang Han, Jonathan Petit, Shihao Ji, Yuanyuan Shi, Fei Miao

机构 * University of Connecticut(康涅狄格大学) University of California San Diego(加州大学圣地亚哥分校) University of Texas at Arlington(德克萨斯理工大学) Qualcomm(高通)

AI总结 本文提出利用低秩适应(LoRA)作为结构正则化方法,通过冻结基础矩阵并优化低秩适配器,约束批评学习更新到低维子空间,实验表明该方法有效降低批评损失并提升整体策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05758 2026-05-08 cs.CL

BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models

BioTool: 一个全面的工具调用数据集,用于增强大语言模型的生物医学能力

Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie

机构 * UC San Diego(圣迭戈大学) MBZUAI(马克斯·普朗克智能系统研究所)

AI总结 BioTool通过整合生物医学领域常用工具及高质量查询-API调对,提升大语言模型在生物医学任务中的工具调用能力,实验表明其在生物医学领域表现优于现有商业模型。

Comments Published at ACL 2026; Code and data available at https://github.com/gxx27/BioTool

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05609 2026-05-08 cs.LG econ.EM stat.ML

Optimal Contextual Pricing under Agnostic Non-Lipschitz Demand

在无偏非利普希茨需求下的最优上下文定价

Jianyu Xu, Yu-Xiang Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文研究了具有线性估值和有界支持无偏噪声的上下文动态定价问题,提出了一种多项式时间算法,通过随机参数估计、保守残差网格探测和基于置信度的一步重定向,实现了最优的 regret,改进了之前的上界。

Comments 30 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05242 2026-05-08 cs.IR cs.AI

Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction

超越语义相似性:通过直接语料交互重新思考代理搜索的检索

Zhuofeng Li, Haoxiang Zhang, Cong Wei, Pan Lu, Ping Nie, Yi Lu, Yuyang Bai, Shangbin Feng, Hangxiao Zhu, Ming Zhong, Yuyu Zhang, Jianwen Xie, Yejin Choi, James Zou, Jiawei Han, Wenhu Chen, Jimmy Lin, Dongfu Jiang, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(圣地亚哥大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Verdent AI Lambda

AI总结 本文提出直接语料交互(DCI)方法,通过通用终端工具直接搜索原始语料,无需嵌入模型或检索接口,有效提升代理搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16281 2026-05-08 cs.LG q-bio.NC

Laya: A LeJEPA Approach to EEG via Latent Prediction over Reconstruction

Laya: 一种基于联合嵌入预测架构的EEG方法

Saarang Panchavati, Uddhav Panchavati, Hiroki Nariai, Corey Arnold, William Speier

机构 * Department of Medical Informatics(医学信息学系) UCLA(美国加利福尼亚大学洛杉矶分校) Department of Cognitive Science(认知科学系) UCSD(美国圣地亚哥大学) David Geffen School of Medicine(大卫·盖弗医学院) Mattel Children’s Hospital(马特尔儿童医院)

AI总结 本文提出Laya,一种基于LeJEPA的EEG基础模型,通过预测潜在表示而非信号重建,提升EEG表示的语义结构和临床准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04807 2026-05-08 stat.ML cs.LG

Does Sparse Connectivity Improve Generalization? Convolutional Networks Below the Edge of Stability

稀疏连接是否能提高泛化能力?卷积网络在稳定性边缘以下

Tongtong Liang, Esha Singh, Rahul Parhi, Alexander Cloninger, Yu-Xiang Wang

机构 * UC San Diego(圣迭戈大学)

AI总结 研究稀疏连接在卷积网络中如何在稳定性边缘以下提升泛化能力,揭示其与数据几何和梯度下降的联合影响。

Comments Under Review. Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22710 2026-05-08 cs.SD cs.AI cs.HC

Same Words, Different Judgments: How Preferences Vary Across Modalities

相同词语,不同判断:偏好如何在不同模态间变化

Aaron Broukhim, Nadir Weibel, Eshin Jolly

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of California San Diego(加州大学圣地亚哥分校) Department of Psychology(心理学系)

AI总结 研究探讨了文本与语音模态在偏好标注中的差异,发现需9名评阅者才能达到较高一致性,且语音评阅者在决策阈值、长度偏差和用户导向标准上存在显著差异,合成评分可有效预测评阅者一致性,强调音频偏好数据评估需模态特定设计。

Comments Submitted to NeurIPS 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18120 2026-05-08 stat.ML cs.LG

Generalization Below the Edge of Stability: The Role of Data Geometry

在稳定性边缘以下的泛化:数据几何的作用

Tongtong Liang, Alexander Cloninger, Rahul Parhi, Yu-Xiang Wang

机构 * UC San Diego(圣迭戈大学)

AI总结 本文研究了过参数化神经网络中数据几何对泛化能力的影响,通过理论分析揭示了数据几何如何控制隐式偏置,提出在稳定性边缘以下的两层ReLU网络的泛化界限,并探讨了梯度下降在不同数据分布下的学习机制。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01047 2026-05-05 cs.CR cs.AI cs.CL cs.LG

LLM Ghostbusters: Surgical Hallucination Suppression via Adaptive Unlearning

LLM Ghostbusters: 通过自适应反学习实现精准幻觉抑制

Joseph Spracklen, Pedram Aghazadeh, Farinaz Koushanfar, Murtuza Jadliwala

机构 * University of Texas San Antonio(德克萨斯大学圣安东尼奥分校) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文提出自适应反学习框架,通过混合token级目标和自适应发现循环,有效抑制LLM幻觉,减少81%的包幻觉率,同时保持编码基准性能,验证其对特定分布的针对性效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00899 2026-05-05 cs.CV cs.LG

LatentDiff: Scaling Semantic Dataset Comparison to Millions of Images

LatentDiff: 语义数据集比较的扩展方法用于数百万张图像

James Flora, Kowshik Thopalli, Akshay R. Kulkarni, Weng-Keen Wong, Shusen Liu

机构 * School of Electrical Engineering and Computer Science, Oregon State University, Corvallis, Oregon, USA(俄勒冈州立大学电气工程与计算机科学学院) Lawrence Livermore National Laboratory, Livermore, California, USA(劳伦斯利弗莫尔国家实验室) University of California San Diego, California, USA(加州大学圣地亚哥分校)

AI总结 LatentDiff通过在预训练视觉编码器的潜在空间中结合稀疏自编码器的发散测试与密度比估计,实现语义数据集比较的高效准确,且在极小比例图像差异下仍保持鲁棒性。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05134 2026-05-05 cs.LG cs.AI

How Reasoning Evolves from Post-Training Data: An Empirical Study Using Chess

推理如何从训练数据中演变:使用国际象棋的实证研究

Lucas Dionisopoulos, Nicklas Majamaki, Prithviraj Ammanabrolu

机构 * Department of Computer Science and Engineering, University of California San Diego, San Diego, United States(计算机科学与工程系,加州大学圣地亚哥分校,圣地亚哥,美国)

AI总结 研究语言模型推理从监督微调到强化学习的演变,发现直接预测最佳走法的微调能提升性能,但强化学习阶段导致不一致推理,而多步轨迹训练则能获得更稳定的推理。

Comments Accepted at ICML 2026. An earlier version appeared at the NeurIPS 2025 Foundations of Reasoning in Language Models (FoRLM) Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00314 2026-05-04 cs.CR cs.AI cs.PL

Semia: Auditing Agent Skills via Constraint-Guided Representation Synthesis

Semia:通过约束引导的表示合成审计代理技能

Hongbo Wen, Ying Li, Hanzhi Liu, Chaofan Shou, Yanju Chen, Yuan Tian, Yu Feng

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 Semia通过约束引导的表示合成技术,对代理技能进行静态审计,发现超过一半的技能存在关键语义风险,其召回率和F1值显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00244 2026-05-04 cs.RO cs.CV

Lucid-XR: An Extended-Reality Data Engine for Robotic Manipulation

Lucid-XR:一种用于机器人操控的扩展现实数据引擎

Yajvan Ravan, Adam Rashid, Alan Yu, Kai McClennen, Gio Huh, Kevin Yang, Zhutian Yang, Qinxi Yu, Xiaolong Wang, Phillip Isola, Ge Yang

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) FortyFive Labs(FortyFive实验室) Caltech(加州理工学院) Harvard University(哈佛大学) UC San Diego(南加州大学)

AI总结 Lucid-XR通过XR头显直接运行的物理模拟环境生成多模态数据,实现零样本迁移至复杂环境,支持软材料、松散颗粒和刚体接触的精细操控任务。

Comments Project website: https://lucidxr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00136 2026-05-04 cs.AI

Are Tools All We Need? Unveiling the Tool-Use Tax in LLM Agents

工具是否足够?揭示LLM代理中的工具使用税

Kaituo Zhang, Zhen Xiong, Mingyu Zhong, Zhimeng Jiang, Zhouyuan Yuan, Zhecheng Li, Ying Lin

机构 * University of Houston(休斯顿大学) University of Southern California(南加州大学) New York University(纽约大学) Texas A&M University(德克萨斯农工大学) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 本文研究了工具增强推理在LLM代理中的有效性,发现语义干扰下工具性能可能下降,提出Factorized Intervention Framework分析工具使用成本,并引入G-STEP缓解协议误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20823 2026-05-04 cs.LG cs.AI cs.CV

CaTS-Bench: Can Language Models Describe Time Series?

CaTS-Bench:语言模型能否描述时间序列?

Luca Zhou, Pratham Yashwante, Marshall Fisher, Alessio Sampieri, Zihao Zhou, Fabio Galasso, Rose Yu

机构 * Sapienza University of Rome(罗马大学) UC San Diego(圣地亚哥大学) ItalAI Labs(意大利AI实验室)

AI总结 本文提出CaTS-Bench,一个涵盖11个领域的时间序列推理基准,通过1746个人工重写描述进行评估,揭示语言模型在时间序列描述中的不足,并提出合成数据生成方法以提升性能。

Comments 9 pages, 6 figures, 4 tables in the main paper. Many more in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏