arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 717 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 160 篇

2605.17262 2026-05-19 cs.CV 67%

EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning

EgoIntrospect: 一个用于用户中心内部状态推理的注视数据集和基准

Zeyu Wang, Chang Liu, Eduardus Tjitrahardja, Yuntao Wang, Borislav Pavlov, Fangfei Gou, Jose Manuel Davila, Dai Shi, Ran Xu, Yue Pan, Jiayi Tan, Shuting Chang, Qi Wang, Jinzhao Li, Jiacheng Hua, Yifei Huang, Jingwei Sun, Yu Zhang, Liuxin Zhang, Guocai Yao, Jia Jia, Yin Li, Qianying Wang, Yuanchun Shi, Miao Liu

机构 * Tsinghua University(清华大学) Tongji University(同济大学) Renmin University of China(中国人民大学) The University of Tokyo(东京大学) Lenovo Group(联想集团) Peking University(北京大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出EgoIntrospect数据集,用于研究用户中心内部状态推理,通过自注释揭示用户与AI助手的交互意图,评估多模态大语言模型在从注视观察中推理用户内部状态的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09817 2026-05-19 cs.SE cs.CR 67%

Evaluating Tool Cloning in Agentic-AI Ecosystems

评估代理AI生态系统中的工具克隆

Taein Kim, David Jiang, Yuepeng Hu, Yuqi Jia, Neil Gong

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究通过大规模测量分析代理AI生态系统中工具克隆现象,发现高相似性区域普遍存在,60%的高Jaccard候选和85%的高ssdeep候选被验证为克隆,揭示工具克隆对生态系统多样性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04202 2026-05-19 cs.LG cs.AI cs.CL 67%

ClawArena: Benchmarking AI Agents in Evolving Information Environments

ClawArena:在演化的信息环境中评估AI代理的基准测试

Haonian Ji, Kaiwen Xiong, Siwei Han, Peng Xia, Shi Qiu, Yiyang Zhou, Jiaqi Liu, Jinlong Li, Bingzhou Li, Zeyu Zheng, Cihang Xie, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳州立大学夏洛特分校) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ClawArena评估AI代理在信息环境动态变化中的能力,通过多源冲突推理、动态信念更新和隐式个性化三个挑战,测试代理在多通道会话、工作区文件和阶段更新中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10636 2026-05-19 cs.CL cs.AI cs.LG 67%

Mitigating Extrinsic Gender Bias for Bangla Classification Tasks

缓解孟加拉语分类任务中的外在性别偏见

Sajib Kumar Saha Joy, Arman Hassan Mahy, Meherin Sultana, Azizah Mamun Abha, MD Piyal Ahmmed, Yue Dong, G M Shahariar

机构 * Ahsanullah University of Science and Technology(阿沙努拉科学与技术大学) University of California, Riverside(加州大学河滨分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了孟加拉语预训练语言模型中的外在性别偏见,构建了四个任务特定的基准数据集,并提出RandSymKL方法以缓解偏见,实验表明其能有效减少偏见并保持高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16431 2026-05-19 cs.CV 67%

CT-DegradBench: A Physics-Informed Benchmark for CT Degradation Detection and Severity Estimation

CT-DegradBench:一种用于CT退化检测和严重程度估计的物理引导基准

Yousra Nabila Taifour, Marouane Tliba, Zuheng Ming, Marie Luong, Nour Aburaed, Aladine Chetouani, Gorkem Durak, Alessandro Bruno, Faouzi Alaya Cheikh, Habib Zaidi, Ulas Bagci, Azeddine Beghdadi

机构 * Université Sorbonne Paris Nord(索邦巴黎北大学) University of Dubai(迪拜大学) Northwestern University(西北大学) IULM University(IULM大学) Norwegian University of Science and Technology(挪威科学与技术大学) University of Geneva(日内瓦大学)

专题命中 评测与基准 :language model(abstract,abstract_cn)

AI总结 本文提出CT-DegradBench,一个用于评估CT退化检测和严重程度估计的基准,结合语义先验和频域线索,提出SeSpeCT框架,在多模态嵌入空间中构建免训练的语义质量轴,实现退化类型和严重程度的联合预测。

Comments Accepted in CVPR 2026 VISION Workshop (DEXTER track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16402 2026-05-19 cs.CV 67%

WinDeskGround: A Benchmark for Robust GUI Grounding in Complex Multi-Window Desktop Environments

WinDeskGround:复杂多窗口桌面环境中的鲁棒GUI定位基准

Haoren Zhao, Tianyi Chen, Zhen Wang

机构 * School of Cyberspace, Hangzhou Dianzi University, Hangzhou, China(杭州电子科技大学信息学院) Microsoft(微软公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出WinDeskGround基准,通过参数生成复杂桌面场景,评估GUI定位鲁棒性。实验显示顶级模型在简单环境表现佳,但部分遮挡下准确率下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18498 2026-05-19 cs.LG cs.AI 62%

DBES: A Systematic Benchmark and Metric Suite for Evaluating Expert Specialization in Large-Scale MoEs

DBES: 一种用于评估大规模MoE模型专家专业化程度的系统性基准和度量套件

Jing Wang, Hongxuan Lu, Jazze Young, Shu Wang, Zhimin Xin

机构 * Jing Wang(王静) Hongxuan Lu(卢洪轩) Jazze Young(杨杰兹) Shu Wang(王舒) Zhimin Xin(辛志敏)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DBES系统性基准和度量套件,通过多领域基准和五个理论基础的度量指标,评估MoE模型中的专家专业化程度,并验证这些度量指标在领域特定后训练中的可操作性,实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11852 2026-05-19 q-bio.QM cs.AI cs.LG 62%

Limitations of Sequence-Based Protein Representations for Parkinson's Disease Classification: A Leakage-Free Benchmark

序列基蛋白质表示在帕金森病分类中的局限性:一种无泄漏的基准测试

César Jesús Núñez-Prado, Grigori Sidorov, Liliana Chanona-Hernández

机构 * Higher School of Mechanical and Electrical Engineering, Instituto Politécnico Nacional(机械与电气工程高等专科学校,墨西哥国立理工学院) Research Center for Computing, Instituto Politécnico Nacional(计算研究中心,墨西哥国立理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了序列基蛋白质表示在帕金森病分类中的局限性,通过无泄漏的基准测试评估了多种基于蛋白质初级序列的表示方法,发现单一序列信息对疾病分类的判别能力有限,需引入更丰富的生物学特征。

Comments 36 pages, 10 figures, 9 tables. Updated title, abstract, figures, and revised experimental discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21265 2026-05-19 cs.CL cs.LG cs.SE 62%

ToolMATH: A Diagnostic Benchmark for Long-Horizon Tool Use under Systematic Tool-Catalog Constraints

ToolMATH: 一种用于在系统性工具目录约束下评估长周期工具使用的诊断基准

Hyeonje Choi, Jeongsoo Lee, Hyojun Lee, Jay-Yoon Lee

机构 * Seoul National University(首尔国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ToolMATH,一种基于数学的诊断基准,用于评估在可控工具目录条件下长周期工具使用的性能,通过将分步MATH解决方案转换为可重用的Python工具,并配对需要顺序工具使用、中间输出重用和逻辑连接工具调用链的问题,从而评估模型在不同工具目录条件下的适应性、鲁棒性和工具连接性。

Comments Submitted to NeurIPS Evaluation & Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17187 2026-05-19 cs.CL cs.AI cs.CY 62%

PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media

PluRule:一种用于社交媒体上多元社区调节的基准测试

Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan, Haewoon Kwak, Jisun An, Filippo Menczer

机构 * Observatory on Social Media, Indiana University, USA(社交媒体观察站,印第安纳大学,美国) Center Synergy of Systems, TUD Dresden University of Technology, Germany(系统协同中心,德累斯顿技术大学,德国)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了AI模型在调节社交媒体上多元社区中的挑战,提出PluRule基准测试以检测13371条规则违规情况,发现即使使用最先进的视觉语言模型,也难以有效识别违规行为。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16372 2026-05-19 cs.CV cs.AI cs.LG 62%

SwordBench: Evaluating Orthogonality of Steering Image Representations

SwordBench:评估转向图像表示的正交性

Vladimir Zaigrajew, Dawid Pludowski, Hubert Baniecki, Przemyslaw Biecek

机构 * Centre for Credible AI(可信人工智能中心) Warsaw University of Technology(华沙技术大学) University of Warsaw(华沙大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SwordBench,用于评估视觉模型在多个backbone和概念移除任务中转向表示的正交性,引入了交叉概念鲁棒性和 collateral damage 等新评估指标,发现线性SVM在分离性和正交性上优于稀疏自编码器,但无法实现零 collateral damage。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18593 2026-05-19 cs.CR cs.AI cs.RO 57%

Not What You Asked For: Typographic Attacks in Household Robot Manipulation

并非你所要求的:家庭机器人操作中的字体攻击

Ali Iranmanesh, Peng Liu

机构 * Cyber Security Lab(网络安全实验室) The Pennsylvania State University(宾夕法尼亚州立大学) State College, USA(州立学院,美国)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本研究探讨了字体攻击对家庭机器人操作全流程的影响,提出了一种解耦感知架构,并发现感知错误会通过持久的3D语义地图导致物理性故障,揭示了字体误分类对机器人安全性的实际威胁。

Comments 10 pages, 1 figure, IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17416 2026-05-19 cs.SE cs.AI 57%

Benchmarking Mythos-Linked Bug Rediscovery

基于Mythos链接的Bug重发现基准测试

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本文基于Mythos链接的公开系统任务,对六个目标文件进行受控重发现实验,评估不同模型在无CVE标识等信息情况下发现核心bug的能力,结果显示仅6个目标匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16859 2026-05-19 cs.CV cs.AI 57%

VGGT-CD: Training-Free Robust Registration for 3D Change Detection

VGGT-CD:无训练的鲁棒三维变化检测注册

Wei Zhang, Songhua Li, Yihang Wu, Qiang Li, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文提出VGGT-CD方法,通过解耦跨时间注册与动态变化干扰,实现无训练的鲁棒三维变化检测注册,有效减少轨迹误差并提升注册速度。

Comments 13 pages, 5 figures. Code is available at: https://github.com/WZ-CS/VGGT-CD

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22061 2026-05-19 eess.AS cs.CL cs.SD 57%

Speak Your Mind: The Speech Continuation Task as a Probe of Voice-Based Model Bias

说出你的想法:语音延续任务作为语音基础模型偏见的探测器

Shree Harsha Bokkahalli Satish, Harm Lameris, Olivier Perrotin, Gustav Eje Henter, Éva Székely

机构 * Department of Speech, Music and Hearing, KTH Royal Institute of Technology(语音、音乐与听觉系,皇家理工学院) Univ. Grenoble Alpes, CNRS, Grenoble INP, GIPSA-lab(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,格勒诺布尔理工学院,GIPSA实验室)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL

AI总结 本文首次系统评估语音延续任务中的偏见,探讨性别和音质类型对延续行为的影响,发现模型和性别交互显著,且女性提示更倾向于回归模态音质,揭示语音质量偏见。

Comments 8 pages, 2 figures, Accepted to Identity-Aware AI LREC Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16613 2026-05-19 cs.CL econ.GN q-fin.EC q-fin.GN 57%

Beyond Sentiment Classification: A Generative Framework for Emotion Intensity Evaluation in Text

超越情感分类:一种用于文本情感强度评估的生成框架

Francesco A. Fabozzi, Dasol Kim, William N. Goetzmann

机构 * Yale School of Management(耶鲁管理学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出一种新的情感建模方法,关注情感评估而非识别,通过构建情感强度评分数据集并微调生成语言模型,实现更通用的情感分析框架,优于传统分类方法并在相关领域表现出色。

Comments 10 pages, no figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14068 2026-05-19 cs.CV cs.LG 57%

CurveBench: A Benchmark for Exact Topological Reasoning over Nested Jordan Curves

CurveBench:一种用于嵌套乔丹曲线精确拓扑推理的基准

Amirreza Mohseni, Mona Mohammadi, Morteza Saghafian, Naser Talebizadeh Sardari

机构 * Maastricht University(马斯特里赫特大学) Cornell University(康奈尔大学) TU Wien(维也纳技术大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 CurveBench是一个用于从视觉输入中进行层次拓扑推理的基准,包含756张非相交的乔丹曲线图像,通过结构预测任务恢复由曲线诱导的根树结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07649 2026-05-19 cs.IR 50%

LitXBench: A Benchmark for Extracting Experiments from Scientific Literature

LitXBench: 一个用于从科学文献中提取实验的基准测试

Curtis Chong, Jorge Colindres

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出LitXBench基准测试,用于评估从科学文献中提取实验的方法,通过引入LitXAlloy密集基准,包含1426个测量数据,展示了前沿语言模型在提取实验方面的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13839 2026-05-19 cs.CV 50%

DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes

DisasterVQA: 一个用于灾难场景的视觉问答基准数据集

Aisha Al-Mohannadi, Ayisha Firoz, Yin Yang, Muhammad Imran, Ferda Ofli

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学) College of Science & Engineering(科学与工程学院) Qatar University(卡塔尔大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出DisasterVQA数据集,用于灾难场景中的感知与推理任务,通过1395张真实图像和4405对专家 curated 的问答对,评估了七种最先进的视觉-语言模型在灾难响应中的性能,发现模型在细粒度定量推理、物体计数和上下文敏感解释方面存在不足。

Comments Accepted at ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01843 2026-05-19 cs.CV 50%

PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models

PhyDetEx: 检测和解释T2V模型的物理合理性

Zeqing Wang, Keze Wang, Lei Zhang

机构 * Zeqing Wang 1,3(王泽清 1,3) Keze Wang 1(王凯泽 1) Lei Zhang 2(张磊 2)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出PhyDetEx,通过构建PID数据集和轻量级微调方法,评估T2V模型在生成物理合理视频方面的性能,并发现尽管模型在视频生成上有所进步,但理解并遵循物理定律仍存在挑战。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17414 2026-05-19 eess.AS 50%

S2Accompanist: A Semantic-Aware and Structure-Guided Diffusion Model for Music Accompaniment Generation

S2Accompanist: 一种语义感知和结构引导的扩散模型用于音乐伴奏生成

Huakang Chen, Wenkai Cheng, Guobin Ma, Chunbo Hao, Yuxuan Xia, Mengqi Wei, Zhixian Zhao, Pengcheng Zhu, Hanbing Zhang, Lei Xie

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出S2Accompanist,一种语义感知和结构引导的扩散模型,用于音乐伴奏生成,解决了现有模型在数据和计算资源受限情况下生成连贯纯音乐伴奏和缺乏精确局部语义控制的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03170 2026-05-19 cs.SD 50%

TED-TTS: Training-Free Intra-Utterance Emotion and Duration Control for Text-to-Speech Synthesis

TED-TTS: 无需训练的语句内情感和时长控制用于文本到语音合成

Qifan Liang, Yuansen Liu, Ruixin Wei, Nan Lu, Junchuan Zhao, Ye Wang

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出TED-TTS,一种无需训练的可控框架,用于预训练零样本TTS,实现语句内情感和时长表达。通过段落感知的情感条件策略和时长控制策略,结合因果掩码和单调流对齐过滤,实现平滑的情感变化并保持全局语义一致性,同时利用大规模多情感和时长标注数据集进行自动提示生成,实验表明其在多情感和时长控制中达到最先进的语句内一致性,同时保持基础TTS模型的语音质量。

Comments 24 pages, 9 figures, 7 tables, 3 lists

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17179 2026-05-19 cs.CV 50%

iMiGUE-3K: A Large-Scale Benchmark for Micro-Gesture Analysis with Self-Supervised Learning

iMiGUE-3K:一种基于自监督学习的微手势分析大规模基准

Chengyan Wang, Haoyu Chen, Hui Wei, Yueyi Yang, Yunquan Chen, Guoying Zhao

机构 * CMVS, University of Oulu(奥卢大学CMVS实验室) KTH Royal Institute of Technology(皇家理工学院) ELLIS Institute Finland(芬兰ELLIS研究所)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出iMiGUE-3K大规模数据集和MG-FMs基础模型,用于微手势情感理解,通过自监督学习提升情绪识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17014 2026-05-19 cs.CV 50%

RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videos

RHINO:从单目视频中重建人类与新物体的交互

Lixin Xue, Chengwei Zheng, Georgios Paschalidis, Chen Guo, Manuel Kaufmann, Juan Zarate, Dimitrios Tzionas

机构 * ETH Zürich(苏黎世联邦理工学院) The University of Tokyo(东京大学) University of Amsterdam(阿姆斯特丹大学) Aristotle University of Thessaloniki(希腊塞萨洛尼基阿里斯托芬大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出RHINO框架,通过三步方法从单目视频中重建3D人类、新物体和静态场景,解决了视频中物体和人类交互的重建问题,提升了4D重建和新视角合成的性能。

Comments CVPR 2026. Project page: https://lxxue.github.io/RHINO

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08925 2026-05-19 cs.CV 50%

ClickSeg3D: Few-Click Interactive Segmentation via Semantic Embeddings

ClickSeg3D: 通过语义嵌入实现少点击交互分割

Xueyang Kang, Zijian Yu, Kourosh Khoshelham, Liangliang Nan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) University of Science and Technology of China(中国科学技术大学) Faculty of Architecture and the Built Environment, Delft University of Technology(代尔夫特理工大学建筑与环境学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出ClickSeg3D,通过语义嵌入实现高效3D实例分割,采用点集直接处理和多对象点击联合推理,提升分割精度与效率,适用于实时应用。

Comments 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04329 2026-05-19 cs.CV cs.SE 50%

A Retrieval-Augmented Generation Approach to Extracting Algorithmic Logic from Neural Networks

一种基于检索增强生成的方法用于从神经网络中提取算法逻辑

Waleed Khalid, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg, Germany(计算机视觉实验室,CAIDAS,乌尔姆大学,德国)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出NN-RAG方法,通过检索增强生成技术从神经网络代码库中提取并验证模块,实现了跨仓库的架构迁移与重复检测,提升了神经网络架构的可复现性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 139 篇

2604.16400 2026-05-19 cs.DC cs.AI cs.LG 92%

CoLLM: Continuous Adaptation for SLO-Aware LLM Serving on Shared GPU Clusters

CoLLM:面向共享GPU集群的SLO感知LLM服务连续适应

Shaoyuan Huang, Yunfeng Zhao, Na Yan, Tiancheng Zhang, Xiaokai Wang, Xiaofei Wang, Wenyu Wang, Yansha Deng

机构 * Tianjin University(天津大学) King's College London(伦敦大学国王学院) Paiou Cloud Computing (Shanghai) Company, Ltd.(上海帕优云计算有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 CoLLM通过统一联邦参数高效微调与推理,实现LLM服务在共享GPU集群中的连续适应,提升模型质量和效率,实验显示其在吞吐量上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26037 2026-05-19 cs.AI cs.CV cs.LG 92%

CoLLM-NAS: Collaborative Large Language Models for Efficient Knowledge-Guided Neural Architecture Search

CoLLM-NAS:协作大型语言模型用于高效知识引导的神经架构搜索

Zhe Li, Zhiwei Lin, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机科学技术研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CoLLM-NAS,一种基于协作大型语言模型的两阶段神经架构搜索框架,通过导航和生成两个LLM及协调模块,有效指导搜索过程,提升效率并取得新状态最优结果。

Comments Accepted as Oral at CVPR 2026 Workshop on Neural Architecture Search (NAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13217 2026-05-19 cs.CL cs.AI 92%

Sustainability via LLM Right-sizing

通过LLM右尺寸实现可持续性

Jennifer Haase, Finn Klessascheck, Jan Mendling, Sebastian Pokutta

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在现实应用中,小型本地可部署模型是否足够好,通过评估十种LLM在日常职业任务中的表现,提出了一种基于可持续性的评估方法,强调在成本、本地部署和隐私方面的需求。

Comments 21 pages, 2 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17467 2026-05-19 cs.CL 92%

VerifyMAS: Hypothesis Verification for Failure Attribution in LLM Multi-Agent Systems

VerifyMAS: LLM多智能体系统中故障归因的假设验证

Hezhe Qiao, Hanghang Tong, Ee-Peng Lim, Bing Liu, Guansong Pang

机构 * Singapore Management University(新加坡国立管理学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出VerifyMAS框架,通过验证假设的方法对LLM多智能体系统中的故障进行归因,解决了现有方法在全局故障识别和细粒度归因方面的不足,实验表明其在多种模型上均优于现有方法。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏