arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-25 至 2026-02-25 共收录 50 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 50 篇

2602.21059 2026-02-25 cs.HC cs.CL 89%

An Expert Schema for Evaluating Large Language Model Errors in Scholarly Question-Answering Systems

评估学术问答系统中大语言模型错误的专家模式

Anna Martin-Boyle, William Humphreys, Martha Brown, Cara Leckey, Harmanpreet Kaur

机构 * University of Minnesota(明尼苏达大学) NASA Langley Research Center(NASA兰利研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出了一种评估学术问答系统中大语言模型错误的专家模式,通过与领域专家合作识别错误模式,并探讨了支持专家评估LLM输出的个性化工具机会。

Comments 24 pages, 2 figures. Accepted at ACM CHI conference on Human Factors in Computing Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20976 2026-02-25 cs.CL cs.CY 89%

Evaluating Proactive Risk Awareness of Large Language Models

评估大型语言模型的前瞻性风险意识

Xuan Luo, Yubin Chen, Zhiyu Hou, Linpu Yu, Geng Tu, Jing Li, Ruifeng Xu

机构 * The Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong Polytechnic University, Hong Kong(香港理工大学) Southern University of Science and Technology, Shenzhen(南方科技大学) Shenzhen Loop Area Institute, Shenzhen, China(深圳南山区研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出前瞻性风险意识评估框架,通过Butterfly数据集评估LLMs在生态领域预见潜在危害的能力,发现响应长度限制和多模态保护盲点等问题,强调部署LLM时需加强主动防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12434 2026-02-25 cs.AI 89%

A Survey on the Optimization of Large Language Model-based Agents

基于大语言模型代理的优化综述

Shangheng Du, Jiabao Zhao, Jinxin Shi, Zhentao Xie, Xin Jiang, Yanhong Bai, Liang He

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University(上海人工智能教育研究院,东华大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华大学) School of Computer Science and Technology, Donghua University(计算机科学与技术学院,东华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了基于大语言模型的代理优化方法,分类讨论参数驱动与参数无关策略,分析关键技术和挑战,提出未来研究方向。

Comments Published in ACM Computing Surveys, Vol. 58, No. 9, Article 223, July 2026

Journal ref ACM Computing Surveys 58(9), Article 223, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20812 2026-02-25 cs.AI 89%

Qwen-BIM: developing large language model for BIM-based design with domain-specific benchmark and dataset

Qwen-BIM: 开发用于基于BIM的设计的大型语言模型,结合领域特定的基准和数据集

Jia-Rui Lin, Yun-Hong Cai, Xiang-Rui Ni, Shaojie Zhou, Peng Pan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出Qwen-BIM,通过领域特定基准和数据集开发了首个用于基于BIM设计的大型语言模型,显著提升了在该领域的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20759 2026-02-25 cs.CL 89%

Overton Pluralistic Reinforcement Learning for Large Language Models

奥顿多元强化学习用于大语言模型

Yu Fu, Seongho Son, Ilija Bogunovic

机构 * University College London(伦敦大学学院) University of Basel(巴塞尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出OP-GRPO框架,通过强化学习使大语言模型生成多样化响应,提升人类视角覆盖和视角独特性,实验证明其在自然语言推理任务中的优越性能。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20513 2026-02-25 cs.CL 89%

From Performance to Purpose: A Sociotechnical Taxonomy for Evaluating Large Language Model Utility

从性能到目的:一种用于评估大语言模型效用的社技术分类

Gavin Levinson, Keith Feldman

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出LUX框架,用于评估大语言模型在不同应用场景中的效用,涵盖性能、交互、运营和治理四个领域,并提供动态工具支持框架探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20202 2026-02-25 cs.CR cs.AI 89%

Evaluating the Reliability of Digital Forensic Evidence Discovered by Large Language Model: A Case Study

评估由大语言模型发现的数字证据的可靠性:案例研究

Jeel Piyushkumar Khatiwala, Daniel Kwaku Ntiamoah Addai, Weifeng Xu

机构 * School of Criminal Justice(犯罪司法学院) College of Public Affairs(公共事务学院) University of Baltimore(巴尔的摩大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出了一种结构化框架,通过大语言模型驱动的分析和数字取证知识图谱验证,提升AI识别证据的可靠性与可追溯性。

Comments 10 pages, 5 figures. Published in the Proceedings of the 2025 IEEE 49th Annual Computers, Software, and Applications Conference (COMPSAC), Toronto, ON, Canada, 8-11 July 2025

Journal ref 2025 IEEE 49th Annual Computers, Software, and Applications Conference (COMPSAC), IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18464 2026-02-25 cs.CY cs.AI cs.CL cs.CR 88%

How Well Can LLM Agents Simulate End-User Security and Privacy Attitudes and Behaviors?

LLM代理能多好地模拟终端用户的安全和隐私态度和行为?

Yuxuan Li, Leyang Li, Hao-Ping Lee, Sauvik Das

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Department of Computer Science and Engineering, University of Notre Dame(诺特难大学计算机科学与工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究LLM代理在模拟用户安全隐私态度和行为方面的有效性,发现现有模型表现有限,但通过特定提示策略可提升匹配度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16602 2026-02-25 cs.CL cs.AI 86%

Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics

拒绝引导:为敏感话题对LLM拒绝行为实现细粒度控制

Iker García-Ferrero, David Montero, Roman Orus

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过引导向量控制LLM在敏感话题上的拒绝行为,实现安全且可控的审核方法。

Journal ref LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20224 2026-02-25 cs.LG cs.AI cs.CL 86%

Exploring Anti-Aging Literature via ConvexTopics and Large Language Models

通过凸优化和大语言模型探索抗衰老文献

Lana E. Yeganova, Won G. Kim, Shubo Tian, Natalie Xie, Donald C. Comeau, W. John Wilbur, Zhiyong Lu

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于凸优化和大语言模型的抗衰老文献主题建模方法,通过稳定且细粒度的主题发现,提升可解释性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01012 2026-02-25 cs.AI 85%

AutoEDA: Enabling EDA Flow Automation through Microservice-Based LLM Agents

AutoEDA:通过基于微服务的LLM代理实现EDA流程自动化

Yiyi Lu, Hoi Ian Au, Junyao Zhang, Jingyu Pan, Guanglei Zhou, Yiting Wang, Jingwei Sun, Ang Li, Jianyi Zhang, Hai Li, Yiran Chen

机构 * Duke University(杜克大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AutoEDA通过基于微服务的LLM代理实现EDA流程自动化,利用MCP协议提升交互可靠性,并通过本地微调模型和定制评估方法提高准确性与保密性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20683 2026-02-25 eess.SY cs.SY 85%

Grid-Mind: An LLM-Orchestrated Multi-Fidelity Agent for Automated Connection Impact Assessment

Grid-Mind: 一种基于LLM的多保真度代理用于自动化连接影响评估

Mohamed Shamseldein

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Grid-Mind是一种基于LLM的多保真度代理,通过自主协调电力系统模拟,实现自动化连接影响评估,具有高准确率和自我纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10385 2026-02-25 cs.CL cs.AI cs.IR cs.LG 85%

Augmenting Lateral Thinking in Language Models with Humor and Riddle Data for the BRAINTEASER Task

通过幽默和谜语数据增强语言模型的横向思维以完成BRAINTEASER任务

Mina Ghashami, Soumya Smruti Mishra

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过引入幽默和谜语数据增强语言模型,提升其在BRAINTEASER任务中的横向推理能力,提高句子谜题和词语谜题的准确率。

Comments Accepted at SemEval 2024 (Colocated with NAACL 2024)

Journal ref Proceedings of the 18th International Workshop on Semantic Evaluation (SemEval-2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20379 2026-02-25 cs.CL cs.AI 84%

Case-Aware LLM-as-a-Judge Evaluation for Enterprise-Scale RAG Systems

面向企业级RAG系统的案例感知LLM-as-a-Judge评估

Mukul Chhabra, Luigi Medrano, Arush Verma

机构 * Dell Technologies(戴尔技术)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出面向企业级RAG系统的案例感知LLM-as-a-Judge评估框架,通过八个操作指标评估多轮工作流,揭示企业关键权衡,提升系统诊断清晰度和可操作性。

Comments 12 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20901 2026-02-25 cs.CV cs.LG 83%

SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models

SpatiaLQA: 一个评估视觉-语言模型空间逻辑推理能力的基准

Yuechen Xie, Xiaoyan Zhang, Yicheng Shan, Hao Zhu, Rui Tang, Rong Wei, Mingli Song, Yuanyu Wan, Jie Song

机构 * Zhejiang University(浙江大学) The University of Sydney(悉尼大学) ManyCore State Key Laboratory of Blockchain and Security, Zhejiang University(浙江大学区块链与安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 SpatiaLQA提出了一种评估视觉-语言模型空间逻辑推理能力的基准,通过递归场景图辅助推理方法提升模型在复杂场景中的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10720 2026-02-25 cs.CV 82%

Ecological mapping with geospatial foundation models

基于地理空间基础模型的生态制图

Craig Mahlasi, Gciniwe S. Baloyi, Zaheed Gaffoor, Levente Klein, Anne Jones, Etienne Vos, Michal Muszynski, Geoffrey Dawson, Campbell Watson

机构 * IBM Research(IBM研究) IBM Sustainability Software(IBM可持续性软件)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 本研究通过微调Prithvi-EO-2.0和TerraMind模型,在生态制图任务中展示了优于ResNet基线的性能,强调了数据对齐和高分辨率输入的重要性。

Comments Revised abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20658 2026-02-25 cs.CV cs.AI cs.HC cs.LG 81%

Vision-Language Models for Ergonomic Assessment of Manual Lifting Tasks: Estimating Horizontal and Vertical Hand Distances from RGB Video

用于手动搬运任务的视觉-语言模型:从RGB视频估计水平和垂直手距

Mohammad Sadra Rajabi, Aanuoluwapo Ojelade, Sunwook Kim, Maury A. Nussbaum

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用视觉-语言模型从RGB视频中非侵入性估计搬运任务的水平和垂直手距,通过两种多阶段管道验证了该方法的可行性,并展示了分割技术在减少误差方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21143 2026-02-25 cs.AI cs.CL cs.IR cs.LG 80%

A Benchmark for Deep Information Synthesis

深度信息合成的基准测试

Debjit Paul, Daniel Murphy, Milan Gritta, Ronald Cardenas, Victor Prokhorov, Lena Sophia Bolliger, Aysim Toker, Roy Miles, Andreea-Maria Oncescu, Jasivan Alex Sivakumar, Philipp Borchert, Ismail Elezi, Meiru Zhang, Ka Yiu Lee, Guchun Zhang, Jun Wang, Gerasimos Lampouras

机构 * Huawei Noah’s Ark Lab, UK(华为诺亚实验室,英国) Imperial College London(伦敦帝国理工学院) UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心) University of Zurich(苏黎世大学) University of Sheffield(谢菲尔德大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DEEPSYNTH是一个评估智能体在复杂任务中信息合成与推理能力的新基准测试,通过多阶段数据收集流程和120个跨7个领域的任务,评估LLM在现实问题中的表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20752 2026-02-25 cs.CV cs.AI 79%

OrthoDiffusion: A Generalizable Multi-Task Diffusion Foundation Model for Musculoskeletal MRI Interpretation

OrthoDiffusion:一种通用的多任务扩散基础模型用于骨科MRI解释

Tian Lan, Lei Xu, Zimu Yuan, Shanggui Liu, Jiajun Liu, Jiaxin Liu, Weilai Xiang, Hongyu Yang, Dong Jiang, Jianxin Yin, Dingyu Wang

机构 * Center for Applied Statistics and School of Statistics(应用统计中心和统计学院) Renmin University of China(中国人民大学) Institute of Sports Medicine of Peking University(北京大学运动医学研究所) Beijing Key Laboratory of Research and Translation for Drugs and Medical Devices in Precision Diagnosis and Treatment of Sports Injuries(北京体育损伤精准诊断与治疗药物与医疗设备研究翻译重点实验室) State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 OrthoDiffusion是一种基于扩散的多任务基础模型,通过自监督学习在膝关节MRI上预训练,实现11种结构分割和8种异常检测,具有跨关节的高泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22620 2026-02-25 cs.CR cs.AI cs.LG 79%

Breaking Agent Backbones: Evaluating the Security of Backbone LLMs in AI Agents

打破代理骨干:评估AI代理中骨干LLM的安全性

Julia Bazinska, Max Mathys, Francesco Casucci, Mateo Rojas-Carulla, Xander Davies, Alexandra Souly, Niklas Pfister

机构 * Lakera AI ETH Zürich(苏黎世联邦理工学院) UK AI Security Institute(英国人工智能安全研究所) OATML, University of Oxford(OATML,牛津大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出威胁快照框架,用于评估AI代理中LLM骨干的安全性,通过构建$b^3$基准测试揭示LLM安全性的关键影响因素。

Comments Julia Bazinska and Max Mathys contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03043 2026-02-25 cs.CL cs.AI cs.SD eess.AS 79%

K-Function: Joint Pronunciation Transcription and Feedback for Evaluating Kids Language Function

K-Function:儿童语言功能的联合发音转录与评估反馈

Shuhe Li, Chenxu Guo, Jiachen Lian, Cheol Jun Cho, Wenshuo Zhao, Xiner Xu, Ruiyu Jin, Xiaoyu Shi, Xuanru Zhou, Dingkun Zhou, Sam Wang, Grace Wang, Jingze Yang, Jingyi Xu, Ruohan Bao, Xingrui Chen, Elise Brenner, Brandon In, Francesca Pei, Maria Luisa Gorno-Tempini, Gopala Anumanchipalli

机构 * Zhejiang University(浙江大学) UC Berkeley(加州大学伯克利分校) Duke University(达特茅斯大学) SCUT(上海交通大学) TVT UCSF(加州大学旧金山分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 K-Function通过结合子词转录与LLM评分,提升儿童语音识别精度,实现高效的语言功能评估。

Comments Accepted to 2026 ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13394 2026-02-25 cs.CV 78%

Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models

空间-DisE:评估视觉语言模型空间推理能力的统一基准

Xinmiao Huang, Qisong He, Zhenglin Huang, Boxuan Wang, Zhuoyun Li, Guangliang Cheng, Yi Dong, Xiaowei Huang

机构 * School of Computer Science & informatics, University of Liverpool(计算机科学与信息学系,利物浦大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出Spatial-DISE基准,用于评估视觉语言模型的空间推理能力,通过四个象限分类和大规模数据集,揭示当前模型在多步骤多视角推理上的不足。

Comments ICLR 2026 Accepted Project Page: https://shinmohuang.github.io/spatialdise_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20873 2026-02-25 cs.CV 75%

MUSE: Harnessing Precise and Diverse Semantics for Few-Shot Whole Slide Image Classification

MUSE: 通过精确和多样的语义提升少样本全滑片图像分类

Jiahao Xu, Sheng Huang, Xin Zhang, Zhixiong Nan, Jiajun Dong, Nankun Mu

机构 * School of Big Data & Software Engineering, Chongqing University(大数据与软件工程学院,重庆大学) School of Computer Science & Technology, Chongqing University(计算机科学与技术学院,重庆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MUSE通过样本层面的细粒度语义增强和随机多视图生成,提升少样本全滑片图像分类的性能和鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22500 2026-02-25 cs.LG cs.AI cs.CL 75%

Towards Scalable Oversight via Partitioned Human Supervision

通过分区人类监督实现可扩展的监督

Ren Yin, Takashi Ishida, Masashi Sugiyama

机构 * The University of Tokyo(东京大学) RIKEN(理化学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过分区人类监督实现可扩展的监督,利用互补标签评估和训练AI系统。

Comments ICLR 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20867 2026-02-25 cs.CR cs.AI cs.CE cs.ET 74%

SoK: Agentic Skills -- Beyond Tool Use in LLM Agents

SoK: 代理技能——超越LLM代理中的工具使用

Yanna Jiang, Delong Li, Haiyu Deng, Baihe Ma, Xu Wang, Qin Wang, Guangsheng Yu

机构 * University of Technology Sydney(悉尼科技大学) CSIRO Data61(CSIRO数据61)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本文探讨了代理技能在LLM代理中的应用,分析了技能的生命周期管理、分类方法及其安全影响,并提出了未来研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21054 2026-02-25 cs.CV cs.AI cs.CL 73%

VAUQ: Vision-Aware Uncertainty Quantification for LVLM Self-Evaluation

VAUQ:面向LVLM自评估的视觉感知不确定性量化

Seongheon Park, Changdae Oh, Hyeong Kyu Choi, Xuefeng Du, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 VAUQ通过引入图像信息分数和核心区域遮蔽策略,实现对LVLM自评估的视觉感知不确定性量化,有效提升模型输出的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20294 2026-02-25 cs.CL cs.AI cs.CY 73%

InterviewSim: A Scalable Framework for Interview-Grounded Personality Simulation

InterviewSim: 一种可扩展的基于面试的人格模拟框架

Yu Li, Pranav Narayanan Venkit, Yada Pruksachatkun, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce 研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 InterviewSim提出了一种基于真实面试数据的多维评估框架,通过系统比较证明基于真实访谈数据的方法在人格模拟中表现更优,并揭示了不同方法在人格风格与事实一致性方面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20937 2026-02-25 cs.LG 70%

Extending $μ$P: Spectral Conditions for Feature Learning Across Optimizers

扩展μP:跨优化器的特征学习谱条件

Akshita Gupta, Marieme Ngom, Sam Foreman, Venkatram Vishwanath

机构 * Purdue University(普渡大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种新的框架,用于推导更广泛优化器类别的μP,实现了跨优化器的零样本学习率转移和深度缩放参数化。

Comments 10 main pages, 16 appendix pages and 17 figures; Amended version of the publication in 17th International OPT Workshop on Optimization for Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12876 2026-02-25 cs.AI 70%

BrowseComp-$V^3$: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents

BrowseComp-$V^3$:一种视觉、垂直和可验证的多模态浏览代理基准测试

Huanyao Zhang, Jiepeng Zhou, Bo Li, Bowen Zhou, Yanzhe Shan, Haishan Lu, Zhiyong Cao, Jiaoyang Chen, Yuqian Han, Zinan Sheng, Zhengwei Tao, Hao Liang, Jialong Wu, Yang Shi, Yuanpeng He, Jiaye Lin, Qintong Zhang, Guochen Yan, Runhao Zhao, Zhengpin Li, Xiaohan Yu, Lang Mei, Chong Chen, Wentao Zhang, Bin Cui

机构 * PKU(北京大学) HKUST(GZ)(香港科技大学) OUC(华侨大学) CASIA(中国科学院自动化研究所) HITSZ(哈尔滨工业大学) THU(清华大学) Huawei Cloud BU(华为云业务部)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BrowseComp-$V^3$提出了一种多模态浏览代理基准测试,通过300个跨模态问题评估深度搜索能力,揭示多模态信息整合的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23587 2026-02-25 cs.DB cs.AI 70%

A Survey of Data Agents: Emerging Paradigm or Overstated Hype?

数据代理的综述:新兴范式还是过度炒作?

Yizhang Zhu, Liangwei Wang, Chenyu Yang, Xiaotian Lin, Boyan Li, Wei Zhou, Xinyu Liu, Zhangyang Peng, Tianqi Luo, Yu Li, Chengliang Chai, Chong Chen, Shimin Di, Ju Fan, Ji Sun, Nan Tang, Fugee Tsung, Jiannan Wang, Chenglin Wu, Yanwei Xu, Shaolei Zhang, Yong Zhang, Xuanhe Zhou, Guoliang Li, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Beijing Institute of Technology(北京理工大学) Southeast University(东南大学) Tsinghua University(清华大学) Huawei(华为) DeepWisdom

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文系统梳理了数据代理的分类与演变,提出分层框架并分析其技术发展与未来方向。

Comments Please refer to our paper list and companion materials at: https://github.com/HKUSTDial/awesome-data-agents

详情

展开后加载摘要…

URL PDF HTML 收藏