arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 877 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 190 篇

2605.07786 2026-05-12 cs.CV cs.AI 57%

APEX: Assumption-free Projection-based Embedding eXamination Metric for Image Quality Assessment

APEX:无假设的投影嵌入评估度量指标用于图像质量评估

Caterina Gallegati, Monica Bianchini, Franco Scarselli, Vittorio Murino, Barbara Toniella Corradini

机构 * University of Siena(锡耶纳大学) AI for Good (AIGO), Istituto Italiano di Tecnologia(AI for Good(AIGO),意大利理工学院) University of Verona(威尼斯大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 APEX提出一种基于Sliced Wasserstein距离的无假设投影嵌入评估框架,利用CLIP和DINOv2作为特征提取器,克服传统指标的闭词汇瓶颈和参数限制,提升图像质量评估的鲁棒性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09970 2026-05-12 cs.CL 57%

CREATE: Testing LLMs for Associative Creativity

CREATE:测试大型语言模型的联想创造力

Manya Wadhwa, Tiasa Singha Roy, Harvey Lederman, Junyi Jessy Li, Greg Durrett

机构 * New York University(纽约大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 CREATE基准测试评估模型的创造性联想能力,要求生成高特异性和多样性的概念连接路径,展现模型在复杂搜索空间中的创造力表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09679 2026-05-12 cs.CV cs.AI 57%

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

DeepTumorVQA: 一种分层的3D CT基准,用于分阶段评估医学视觉语言模型和工具增强代理

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Bologna(博洛尼亚大学) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Center for Biomolecular Nanotechnologies, Istituto Italiano di Tecnologia(生物分子纳米技术中心,意大利技术研究院) The First Affiliated Hospital, Sun Yat-Sen University(中山大学第一附属医院) Tongji University(同济大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 DeepTumorVQA通过分阶段证据链分解3D CT推理为四个阶段,提供工具交互环境,揭示医疗VLMs的瓶颈并展示工具增强的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09636 2026-05-12 cs.AI 57%

PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

PDEAgent-Bench: 一个多指标、多库的PDE求解器生成基准

Zhen Hang, Yushan Yashengjiang, Junhui Li, Huanshuo Dong, Yang Wei, Zhezheng Hao, Jiangtao Ma, Songlin Bai, Haozhong Kai, Xihang Yue, Gangzong Si, Dongming Jiang, Chao Yao, Zhanhua Hu, Jiangqing Zhang, Pengwei Liu, Yaomin Shen, Xingyu Ren, Lei Liu, Zikang Xu, Han Li, Qingsong Yao, Hande Dong, Hong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Arizona State University(亚利桑那州立大学) Rice University(里士满大学) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 PDEAgent-Bench是首个针对PDE求解器生成的多指标、多库基准,包含645个实例,涵盖6类数学问题和11种PDE家族,评估生成求解器的可执行性、数值精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09497 2026-05-12 cs.AI cs.CR 57%

Don't Click That: Teaching Web Agents to Resist Deceptive Interfaces

别点那个:教网络代理抵抗欺骗界面

Yilin Zhang, Yingkai Hua, Chunyu Wei, Xin Wang, Yueguo Chen

机构 * Renmin University of China(中国人民大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出DUDE框架,通过混合奖励学习和不对称惩罚,结合经验总结,提升网络代理对欺骗界面的抵抗力,实验显示欺骗敏感度降低53.8%。

Comments Accepted to ACL 2026 Main Conference. 23 pages, 8 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09485 2026-05-12 cs.LG stat.ML 57%

SEMASIA: A Large-Scale Dataset of Semantically Structured Latent Representations

SEMASIA:一个大规模的语义结构化潜在表示数据集

Mario Edoardo Pandolfo, Enrico Grimaldi, Lorenzo Marinucci, Leonardo Di Nino, Simone Fiorellino, Sergio Barbarossa, Paolo Di Lorenzo

机构 * Dept. Computer, Control and Management Engineering(计算机、控制与管理工程系) Sapienza University of Rome(罗马大学西皮恩扎分校) National Inter-University Consortium for Telecommunications (CNIT)(电信全国大学联合体(CNIT)) Dept. of Statistical Sciences(统计科学系) Dept. of Information Engineering, Electronics, and Telecommunications(信息工程、电子与电信系)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 SEMASIA通过收集1700多个预训练视觉模型的潜在表示,提供语义结构化的元数据,用于分析潜在空间组织、对齐映射基准测试及回归分析预训练数据复杂性与嵌入几何特性之间的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09335 2026-05-12 cs.LG 57%

Functional Graphs for Predicting and Explaining Goal Failure in Sparse Goal-Conditioned RL

用于预测和解释稀疏目标条件强化学习中目标失败的功能图

Shalley Dash

机构 * Institute of Management Technology(管理技术学院)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 本文通过功能图分析稀疏目标条件强化学习中的策略失败,定义了局部目标支持指标,提出了一种紧凑的后验分类法来表征残余失败模式,展示了局部策略结构对目标失败的诊断作用。

Comments 9 pages main, 21 pages appendx, 2 figures in main. 8 figures in appendix, Submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21671 2026-05-12 cs.LG q-bio.NC 57%

Neuroprobe: Evaluating Intracranial Brain Responses to Naturalistic Stimuli

Neuroprobe:评估自然刺激下的颅内脑响应

Andrii Zahorodnii, Christopher Wang, Geeling Chau, Bennett Stankovits, Charikleia Moraitaki, Eli Gross, Alexander Brady, Andrei Barbu, Boris Katz, Ila R Fiete

机构 * MIT CSAIL, CBMM(MIT CSAIL,CBMM) MIT McGovern Institute(MIT McGovern研究所) Caltech(加州理工学院) Columbia University(哥伦比亚大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 Neuroprobe通过高分辨率颅内EEG数据研究多模态语言处理,提供评估框架比较不同模型架构,揭示语言处理在大脑中的时间与空间动态。

Comments 38 pages, 7 main figures, 16 supplementary figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08816 2026-05-12 cs.AI cs.CY 57%

Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?

镜中镜:视觉语言模型代理是否真的能辨认自己?

Filippo Ziliotto, Ciro Beneduce, Bruno Lepri, Luciano Serafini, Massimiliano Luca, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) University of Trento(特伦托大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究探讨视觉语言模型是否能通过镜像识别自身,通过设计3D基准测试评估其自我识别能力,发现更强的模型能利用镜像信息进行行动,而较弱的模型则无法正确提取自身相关信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08495 2026-05-12 cs.LG q-bio.NC 57%

NeuralBench: A Unifying Framework to Benchmark NeuroAI Models

NeuralBench:一个统一的神经AI模型评估框架

Hubert Banville, Stéphane d'Ascoli, Simon Dahan, Jérémy Rapin, Marlène Careil, Yohann Benchetrit, Jarod Lévy, Saarang Panchavati, Antoine Ratouchniak, Mingfang, Zhang, Elisa Cascardi, Katelyn Begany, Teon Brooks, Jean-Rémi King

机构 * Brain \& AI team, Meta FAIR École Normale Supérieure, Université PSL, CNRS Hospital Foundation Adolphe de Rothschild MIND, Inria

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出NeuralBench框架,用于评估神经活动AI模型,包含36个EEG任务和14种深度学习架构,揭示基础模型仅小幅优于任务专用模型,且许多任务仍极具挑战性。

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20798 2026-05-12 cs.AI 57%

A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents

一个评估自主AI代理结果驱动约束违反的基准

Miles Q. Li, Benjamin C. M. Fung, Martin Weiss, Pulei Xiong, Khalil Al-Hussaeni, Claude Fachkha

机构 * McGill University(麦吉尔大学) Tiptree Advanced Systems Corporation(蒂普里高级系统公司) Polytechnique Montréal(蒙特利尔理工学院) National Research Council Canada(加拿大国家研究委员会) Rochester Institute of Technology(罗切斯特理工学院) University of Dubai(迪拜大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出一个包含40个场景的基准,用于评估自主AI代理在追求目标优化时出现的结果驱动约束违反问题,发现多数模型存在25%以上的偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08282 2026-05-12 eess.IV cs.AI cs.CV 57%

A Paired Point-of-Care Ultrasound Dataset for Image Quality Enhancement and Benchmarking via a cGAN Baseline

一种配对的点即护理超声数据集用于通过cGAN基线的图像质量增强和基准测试

Lennard M. van Karnenbeek, Hilde G. A. van der Pol, Mark Wijkhuizen, Eva Poelman, Caroline A. Drukker, Theo Ruers, Freija Geldof, Behdad Dashtbozorg

机构 * Department of Nanobiophysics, Faculty of Science and Technology, University of Twente(特文特大学科学与技术学院生物医学系) Image-Guided Surgery, Department of Surgery, Netherlands Cancer Institute(荷兰癌症研究所手术引导外科部) Netherlands Cancer Institute(荷兰癌症研究所) Center for Early Cancer Detection, Netherlands Cancer Institute(荷兰癌症研究所早期癌症检测中心)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 本文提出了一种新的配对数据集,用于通过cGAN基线提升点即护理超声图像质量,并展示了在低资源环境中的诊断价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08160 2026-05-12 cs.CV cs.AI 57%

WATCH: Wide-Area Archaeological Site Tracking for Change Detection

WATCH:大范围考古遗址跟踪用于变化检测

Girmaw Abebe Tadesse, Titien Bartette, Andrew Hassanali, Allen Kim, Jonathan Chemla, Andrew Zolli, Yves Ubelmann, Caleb Robinson, Inbal Becker-Reshef, Juan Lavista Ferres

机构 * Microsoft AI for Good Research Lab(微软AI for Good研究实验室) Iconem, Paris, France(Iconem公司,巴黎,法国) Planet Labs PBC(Planet Labs公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 WATCH通过三种方法实现大规模考古遗址变化检测,利用卫星影像和基础模型嵌入,提高遗址保护的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10921 2026-05-12 cs.RO 50%

RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark

RoboMemArena:一个全面且具有挑战性的机器人记忆基准

Huashuo Lei, Wenxuan Song, Huarui Zhang, Jieyuan Pei, Jiayi Chen, Haodong Yan, Han Zhao, Pengxiang Ding, Zhipeng Zhang, Lida Huang, Donglin Wang, Yan Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Zhejiang University of Technology(浙江工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出RoboMemArena,一个包含26个任务的大型基准,通过多模态注释和真实世界评估,改进了现有机器人记忆基准的不足。PrediMem在基准测试中表现优异,为复杂记忆系统提供了新的见解。

Comments Project website: https://robomemarena.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10756 2026-05-12 cs.CV 50%

TINS: Test-time ID-prototype-separated Negative Semantics Learning for OOD Detection

TINS: 测试时ID-原型分离的负语义学习用于OD检测

Yifeng Yang, Jubo Feng, Jing Xu, Xinbing Wang, Qinying Gu, Nanyang Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 评测与基准 :language model(abstract)

AI总结 TINS通过测试时ID-原型分离负语义学习方法,提升OOD检测性能,实验显示在Four-OOD基准上FPR95显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10571 2026-05-12 eess.IV cs.CV 50%

Set-Based Groupwise Registration for Variable-Length, Variable-Contrast Cardiac MRI

基于集合的组间配准用于变长、变对比心脏MRI

Yi Zhang, Yidong Zhao, Tijmen Toxopeus, Maša Božić-Iven, Sebastian Weingärtner, Qian Tao

机构 * Department of Imaging Physics, Delft University of Technology, The Netherlands(荷兰代尔夫特理工大学影像物理系)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出AnyTwoReg框架,通过集合化处理变长变对比心脏MRI序列,实现跨协议的鲁棒配准,并提升定量映射质量。

Comments MICCAI 2026. Submitted Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04002 2026-05-12 physics.plasm-ph 50%

Features of spherical torus p 11B burning plasmas

球形托卡马克p B11燃烧等离子体的特征

Y. -K. M. Peng, A. Ishida, T. Sun, W. Liu, H. Huang, Y. Shi, B. Liu, D. Guo, Z. Li, D. Luo, X. Xiao, G. Zhao, M. Liu

专题命中 评测与基准 :prompting(abstract)

AI总结 研究开发了满足多磁流体力平衡的球形托卡马克p B11等离子体模型,通过超热离子和电子增强聚变反应率,探讨了紧凑型p B11球形托卡马克的持续燃烧挑战与机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08321 2026-05-12 cs.CV 50%

UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing

UM-Text: 一种统一的多模态模型用于图像理解和视觉文本编辑

Lichen Ma, Xiaolong Fu, Gaojing Zhou, Zipeng Guo, Ting Zhu, Yichun Liu, Yu Shi, Jason Li, Junshi Huang

机构 * Sun Yat-sen University(中山大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出UM-Text模型,通过自然语言指令实现图像理解和视觉文本编辑,引入VLM处理指令和参考图像,结合UM-Encoder生成风格一致的文本图像,并提出区域一致性损失和三阶段训练策略,最终在多个基准上取得最佳性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06248 2026-05-12 cs.CV 50%

Deepfake Detection that Generalizes Across Benchmarks

跨基准测试的深度伪造检测

Andrii Yermakov, Jan Cech, Jiri Matas, Mario Fritz

机构 * Czech Technical University in Prague(捷克技术大学布拉格分校) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出GenD方法,通过参数高效调整预训练视觉编码器实现跨基准测试的深度伪造检测,展示出通过微调层归一化参数和超球面特征流形增强泛化能力,优于其他复杂方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20381 2026-05-12 cs.CV 50%

ReaMOT: A Benchmark and Framework for Reasoning-based Multi-Object Tracking

ReaMOT:基于推理的多目标跟踪基准与框架

Sijia Chen, Yanqiu Yu, En Yu, Wenbing Tao

机构 * National Key Laboratory of Science and Technology on Multi-spectral Information Processing, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(国家多谱信息处理科学与技术重点实验室,人工智能与自动化学院,华中科技大学)

专题命中 评测与基准 :language model(abstract)

AI总结 ReaMOT通过引入推理能力的多目标跟踪框架,解决传统方法在复杂指令下的泛化问题,提出ReaTrack框架并实现RHOTA指标的显著提升。

Comments Code: https://github.com/chen-si-jia/ReaMOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09889 2026-05-12 cs.MA 50%

Skill Description Deception Attack against Task Routing in Internet of Agents

针对物联网代理中任务路由的技能描述欺骗攻击

Jiayi He, Xiaofeng Luo, Jiawen Kang, Ruichen Zhang, Jianhang Tang, Dong In Kim

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出技能描述欺骗攻击模型,通过生成虚假技能描述影响任务路由决策,实验显示攻击成功率高达98%,揭示了物联网代理系统的新安全漏洞。

Comments Submitted to IEEE Globecom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08606 2026-05-12 cs.CV 50%

Egocentric Whole-Body Human Mesh Recovery with Prior-Guided Learning

第一人称全身体素 meshes 恢复与先验引导学习

Soyeon Na, Seung Young Noh, Ju Yong Chang

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出基于先验引导的学习框架,通过构造更准确的优化伪标签和多先验方法,提升第一人称全身体素恢复的精度,实验表明其优于现有方法。

Comments Accepted to ICIP 2026. This is the author-formatted version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 163 篇

2601.20898 2026-05-12 eess.AS cs.CL cs.LG 92%

Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection

通过可学习投影减少基于LLM的语音识别中的提示敏感性

Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Srikanth Madikeri, Andrés Carofilis, Pradeep Rangappa, Manjunath K E, Kadri Hacioglu, Petr Motlicek, Andreas Stolcke

机构 * Idiap Research Institute(Idiap研究 institute) EPFL(苏黎世联邦理工学院) Uniphore(Uniphore公司) University of Zurich(苏黎世大学) Brno University of Technology(布拉格技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出一种可学习的提示投影模块,通过优化LLM输入空间提升语音识别性能,减少提示设计的不稳定性。

Comments Paper accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13830 2026-05-12 cs.CL cs.AI 92%

Users as Annotators: LLM Preference Learning from Comparison Mode

用户作为标注者:从比较模式中学习LLM的偏好

Zhongze Cai, Xiaocheng Li

机构 * Imperial College Business School(帝国理工商业学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过用户日常交互收集偏好数据,利用期望最大化算法估计用户质量因子,提升LLM对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10124 2026-05-12 cs.NI cs.DC cs.IT cs.LG math.IT 92%

GELATO: Generative Entropy- and Lyapunov-based Adaptive Token Offloading for Device-Edge Speculative LLM Inference

GELATO:生成熵和李雅普诺夫基于的自适应令牌卸载用于设备-边缘推测LLM推理

Zengzipeng Tang, Yuxuan Sun, Wei Chen, Jianwen Ding, Bo Ai

机构 * School of Electronic and Information Engineering, Beijing Jiaotong University, Beijing 100044, China(北京交通大学电子与信息工程学院,北京,100044,中国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出GELATO框架,通过生成熵和李雅普诺夫方法优化设备-边缘协同推测LLM推理中的令牌卸载,提升吞吐量并降低能耗,优于现有方法。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02343 2026-05-12 cs.LG 92%

Toward General and Robust LLM-enhanced Text-attributed Graph Learning

迈向通用且稳健的LLM增强型文本属性图学习

Zihao Zhang, Xunkai Li, Rong-Hua Li, Zhenjun Li, Bing Zhou, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen Institute of Technology(深圳理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出UltraTAG框架,解决LLM与GNN交互中的统一优化问题,并通过UltraTAG-S应对现实中的文本和边稀疏性问题,实验表明其在不同稀疏度下均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08568 2026-05-12 cs.LG 92%

Different Prompts, Different Ranks: Prompt-aware Dynamic Rank Selection for SVD-based LLM Compression

不同提示,不同秩:基于SVD的LLM压缩的提示感知动态秩选择

Hengyi Zhu, Zhendong Mi, Grace Li Zhang, Shaoyi Huang

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出PARSE框架,通过提示感知的动态秩选择提升SVD压缩LLM的效率与性能,实现任务准确率提升10%及推理速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20036 2026-05-12 cs.CL cs.SE 92%

ToolScope: Enhancing LLM Agent Tool Use through Tool Merging and Context-Aware Filtering

ToolScope: 通过工具合并和上下文感知过滤增强LLM代理的工具使用

Marianne Menglin Liu, Daniel Garcia, Fjona Parllaku, Vikas Upadhyay, Syed Fahad Allam Shah, Dan Roth

机构 * Oracle AI

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ToolScope通过自动校正的工具合并和上下文感知检索提升LLM代理的工具选择准确性,实验表明在三个顶级LLM和开源基准上提升了8.38%至38.6%的准确率。

Comments ACL Main Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09894 2026-05-12 cs.SE cs.MA 91%

Deterministic vs. LLM-Controlled Orchestration for COBOL-to-Python Modernization

确定性与LLM控制的编译流程在COBOL到Python现代化中的对比

Naing Oo Lwin, Rajesh Kumar

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过实验对比确定性和LLM控制的编译流程,发现确定性方法在准确性、鲁棒性和效率上更优,且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27527 2026-05-12 cs.LG cs.AI 91%

TetraJet-v2: Accurate NVFP4 Training for Large Language Models with Oscillation Suppression and Outlier Control

TetraJet-v2:用于大语言模型的准确NVFP4训练方法,具有振荡抑制和异常值控制

Yuxiang Chen, Yifan Liu, Xiaoming Xu, Pengle Zhang, Michael Beyer, Martin Rapp, Jun Zhu, Jianfei Chen

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究所,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) Zhili College, Tsinghua University(紫荆学院,清华大学) Bosch AI Research, Renningen, Germany(博世人工智能研究,德国Renningen)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 TetraJet-v2通过NVFP4格式实现低精度训练,解决权重振荡和异常值问题,提升大语言模型性能,减少与BF16的性能差距达51.3%,并实现1.67倍速度提升。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026 (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏