arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 661 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 166 篇

2608.15265 2026-08-18 cs.AI 新提交 57%

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

VibeWorlding:多模态智能体能否端到端构建3D开放世界?

Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯) AI Thrust TEG AIPD

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 该研究提出VibeWorlding框架,构建VWE-BENCH基准与VibeWorlding-Gym框架,发现当前前沿MLLMs在3D开放世界构建任务中表现不佳,经RL训练的VibeWorlder模型可提升性能,旗舰模型VibeWorlder-30B-A3B表现最优。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15224 2026-08-18 cs.LG 新提交 57%

Structuring Semantic Embeddings for Principle Evaluation: A Prototype-Guided Contrastive Learning Approach

用于原则评估的语义嵌入结构化:一种原型引导的对比学习方法

Che Shen, Junwei Su, Lingpeng Kong, Chuan Wu

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文针对通用文本嵌入在任务区分上的不足,提出PGCL方法,通过多流结合的正则化模块生成任务适配表示,在三个代理任务数据集上均优于原始冻结嵌入,明确了方法适用边界并修订了理论分析。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR). 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14905 2026-08-18 cs.CL 新提交 57%

How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks

智能体在自动研究(AutoResearch)中如何失败?针对100项真实前沿研究任务的端到端诊断评估

Yanlin Fei, Nazhou Liu, Xinmiao Yu, Shaolong Chen, Lei Li, Rahul Thapa, Madalina Ciobanu, Qingqing Mao, Ritankar Das

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 本研究推出AutoResearchEval评估平台,构建含45种失效模式的ARFT分类体系,发现当前智能体缺乏元认知循环是核心缺陷,公开发布相关资源以推动自主科学发现研究。

Comments *Equal Contribution (alphabetical order by last name)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14669 2026-08-18 cs.AI 新提交 57%

Beyond Correctness: Toward Automated Novelty Verification with Lean 4

超越正确性:基于 Lean 4 的自动化新颖性验证研究

Ayrton Porto

机构 * Universidad Nacional del Centro de la Provincia de Buenos Aires (UNICEN)(布宜诺斯艾利斯省国立中部大学(UNICEN))

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出 AViD Journal 流程,基于 Lean 4 从三维度验证数学定理新颖性,评估时发现编译不保证语义保真度等三个通用障碍。

Comments 20 pages. Preliminary version; a large-scale quantitative evaluation (N theorems x M models) is left to future work. Comments welcome. Code: https://github.com/ayrtonporto/avid-journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14663 2026-08-18 cs.LG stat.AP 新提交 57%

In-Context Learning to Assess Built Environment Impacts on Perceived Neighborhood Walkability Among Mobility-impaired Older Adults

基于上下文学习评估建成环境对行动受限老年人感知社区步行便利性的影响

Houhao Liang, Kresimir Friganovic, Joanne Kua, Noor Hafizah Ismail, Su Su, Bryan Yijia Tan, Navrag B. Singh, Panos Mavros

机构 * Future Health Technologies, Singapore-ETH Centre(未来健康技术中心,新加坡-ETH中心) Institute of Geriatrics and Active Ageing, Tan Tock Seng Hospital(陈笃生医院老年病学与 active 老龄化研究所) Geriatric Medicine, Khoo Teck Puat Hospital(邱德拔医院老年医学科) Department of Orthopedic Surgery, Woodlands Health Campus(伍德兰兹健康园区骨科)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究采用TabPFN的上下文学习方法,在小规模数据集上较传统模型更优,通过SHAP-IQ揭示高阶特征交互对行动受限老年人感知社区步行便利性的影响。

Comments 8 pages, 2 tables, 1 figure

Journal ref COSIT 2026 Poster Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15373 2026-08-18 cs.LG cs.NA math.NA 新提交 57%

Beyond Field Accuracy: Two-Axis Diagnosis of Inverse-PINN Parameter Error

超越场精度:逆物理信息神经网络参数误差的双轴诊断

Yifan Zhang, Qian Tao

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 针对逆PINNs的参数误差问题,提出双轴后训练诊断方法,经三类合成PDE及耦合双参数达西检验验证,可有效分离有限样本分辨率与参数偏好,助力后续研究方向确定。

Comments Preprint with supplementary appendix. 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07370 2026-08-18 cs.CL 版本更新 57%

LitTraceQA: A Benchmark for Multi-Stage Grounding and Verification in Scientific Question Answering

LitTraceQA:面向科学问答的多阶段溯源与验证基准

Xuye Liu, Yimu Wang, Peng Shi, Bo Xue, Xiangrui Ke, Songcheng Cai, Kath Choi, Di Wu, Freda Shi, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学) Amazon(亚马逊公司) City University of Hong Kong(香港城市大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究提出LitTraceQA基准,用于科学问答的多阶段溯源与验证,提供含多类型证据的问答数据,可评估系统的论文检索、证据溯源及答案准确性,助力生成可验证的科学问答结果。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18237 2026-08-18 cs.CV cs.LG 版本更新 57%

The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric

视觉相似性的多种意义:一种文本提示的图像感知度量

Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, Jun-Yan Zhu, Eli Shechtman, Alexei A. Efros, Richard Zhang

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究人类视觉相似性判断的上下文依赖问题,通过引入大规模数据集微调VLM,产生能捕捉多种视觉相似性意义的TPIPS度量,该度量与人类感知更契合,还在多种任务中开启新功能。

Comments Project Webpage: https://peterwang512.github.io/TPIPS Code: https://github.com/adobe-research/TPIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13039 2026-08-18 cs.CY cs.AI 版本更新 57%

Safeguard-Conditioned Uplift: Measuring Utility-Risk Frontiers for Dual-Use Biology Assistants

保障条件提升:衡量两用生物助手的效用-风险前沿

Dipesh Tharu Mahato

机构 * New York University(纽约大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 研究两用生物助手访问条件对效用和风险的影响,提出保障条件提升协议,通过人工判断效用-风险前沿比较访问条件,评估了Claude Sonnet 4.6和Gemini 3.5 Flash,给出部署级评估目标和校准程序,衡量其对效用-风险前沿的作用。

Comments 27 pages, 3 figures, 31 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04525 2026-08-18 cs.CV cs.AI 版本更新 57%

SLUM-i: Semi-supervised Learning for Urban Mapping of Informal Settlements and Data Quality Benchmarking

SLUM-i: 非正规住区城市制图的半监督学习与数据质量基准测试

Muhammad Taha Mukhtar, Syed Musa Ali Kazmi, Khola Naseem, Muhammad Ali Chattha, Andreas Dengel, Sheraz Ahmed, Muhammad Naseer Bajwa, Muhammad Imran Malik

机构 * School of Electrical Engineering and Computer Science, National University of Sciences and Technology (NUST)(电气工程与计算机科学学院,国立科学与技术大学(NUST)) Smart Data & Knowledge Services, German Research Center for Artificial Intelligence (DFKI)(智能数据与知识服务,德国人工智能研究中心(DFKI))

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 针对非正规住区制图中标注稀缺和数据质量挑战,提出半监督分割框架,集成类别自适应阈值和DINOv2过滤机制,在跨三大洲七城市实验中mIoU提升最高5.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16843 2026-08-18 cs.RO 新提交 50%

Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation

基于基础模型的具身智能体的安全性:攻击面、攻击、防御与评估

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao

机构 * Wuhan University(武汉大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究以信任边界为核心,针对基于基础模型的具身智能体安全,划分了五个层级与十二个攻击面,分析了58种攻击、61种防御的现状,指出部分领域研究不足并提出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16789 2026-08-18 cs.CY 新提交 50%

"This Is So Claude!" Towards a Theory of the Recognition of AI Character Without Reidentification

这真像Claude!:走向无需重识别的AI特征识别理论

Michele Loi

专题命中 评测与基准 :language model(abstract)

AI总结 该研究区分AI身份研究的三类路径,提出Claude式分级判断的溯因推理,指出AI可识别特征的连续性对陪伴的重要性,不解决数值同一性问题。

Comments 13 pages. Submitted to Philosophical Studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16393 2026-08-18 cs.CR 新提交 50%

Security Assessment of DeepSeek Harness with A.I.G: Evaluating Resistance to Indirect Prompt Injection

基于A.I.G的DeepSeek Harness安全评估:对间接提示注入的抗性评估

Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

专题命中 评测与基准 :LLM(abstract)

AI总结 本研究用A.I.G评估DSH的间接提示注入抗性,开展多场景实验,发现不同攻击的成功率,明确需在不可信内容与敏感动作间增设控制措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16289 2026-08-18 cs.CV 新提交 50%

PosterText: Towards Unified Visual Text Generation and Editing for E-commerce Poster

PosterText:面向电商海报的统一视觉文本生成与编辑

Xiaoan Liu, Lichen Ma, Zipeng Guo, Yu He, Xiaoyan Su, Shaojie Guo, Jingling Fu, Xiaolong Fu, Hao Yang, Tongxuan Liu, Yu Guo, Fei Wang, Xinyi Liu, Yongjun Zhang, Junshi Huang

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出PosterText框架,将文本块作为原子单元实现电商海报的统一生成与编辑,构建了带块级标注的数据集与评估基准,经实验验证其性能优于现有相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15336 2026-08-18 cs.CV 新提交 50%

SAGE-OR: Semi-supervised Adaptive Scene Graph Generation for Operating Rooms

SAGE-OR:面向手术室的半监督自适应场景图生成

Brandon Leblanc, Charalambos Poullis

机构 * Concordia University(康考迪亚大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 SAGE-OR是面向手术室的半监督自适应场景图生成框架,采用解耦范式,轻量高效,在4D-OR基准上F1达76%,经无监督手部增强后达86%,可低成本适配新手术场景。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14721 2026-08-18 cs.CV 新提交 50%

AeroGround: A Comprehensive Benchmark for Aerial-Ground Collaborative Reasoning

AeroGround:用于空-地协同推理的综合基准

Shenghong Yi, Lin Zhang, Muzian Li, Jiakang Yuan, Haoyu Zhang, Peng Ye, Jiayuan Fan, Huafeng Qin, Tao Chen

机构 * Shanghai Innovation Institute(上海创新研究院) College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Chongqing Technology and Business University(重庆工商大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出AeroGround基准,针对现有VLMs在空-地协同场景推理能力的研究空白,构建含29000组多模态观测与2250个问答实例的数据集,实验发现模型与人类表现差距显著,为相关系统开发提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10706 2026-08-18 cs.CV cs.MM 版本更新 50%

MMArt: A Multi-Perspective Multimodal Dataset for Visual Art Understanding

MMArt:用于视觉艺术理解的多视角多模态数据集

Shuai Wang, Wangyuan Ding, Yixian Shen, Jia-Hong Huang, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09251 2026-08-18 cs.DB 版本更新 50%

SQL-RewriteBench: A Correctness-Gated, Full-Denominator Benchmark for Statement-Level SQL Rewriting [Experiment,Analysis & Benchmark]

SQL-RewriteBench:用于语句级SQL重写的正确性门控全分母基准测试[实验、分析与基准测试]

Jiang Long, Tianci Gao, Shiyuan Hao, Haochen Zhang, Shuncheng Liu, Jiang Zhang

专题命中 评测与基准 :LLM(abstract)

AI总结 研究语句级SQL重写,提出SQL-RewriteBench基准测试,应用正确性门控和全分母计算,其指标套件可区分多种指标,定义了SCS和CGOQ,提供多个可执行实例,通过测试发现现有方法存在问题,强调可部署SQL重写需多方面改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24476 2026-08-18 eess.SP 版本更新 50%

WiWorld-RealData: A Real-World Multi-Modal Dataset for 6G Wireless World Models

WiWorld-RealData:用于6G无线世界模型的真实世界多模态数据集

Yinyin Jiao, Huixin Xu, Jianhua Zhang, Yuelong Qiu, Jingjing Wang, Shaoyi Liu, Yuxiang Zhang, Li Yu, Xuebin Sun, Guangyi Liu

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出WiWorld-RealData数据集,包含3.7 GHz和6.775 GHz的信道冲激响应、多视角图像、全景图像、LiDAR点云、毫米波雷达记录和GNSS轨迹,支持环境辅助的信道预测,路径损耗预测MAE为2.02 dB。

Comments 6 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22447 2026-08-18 cs.SE 版本更新 50%

Latent Reuse in Agent Skills: Multi-modal Clone Detection at Ecosystem Scale

SkillClone: 多模态克隆检测与克隆传播分析在智能体技能生态系统中

Jiaying Zhu, Lyuye Zhang, Wenbo Guo, Yang Liu

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出SkillClone,首个多模态智能体技能克隆检测方法,通过融合TF-IDF与通道分解实现高精度检测,揭示技能生态系统中大量克隆关系及传播问题。

Comments 13 pages, ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12381 2026-08-18 cs.CV 版本更新 50%

Synthetic Image Detection with CLIP: Understanding and Assessing Predictive Cues

使用CLIP进行合成图像检测:理解和评估预测线索

Marco Willi, Melanie Mathys, Michael Graber

机构 * Institute for Data Science I4DS(数据科学研究所) University of Applied Sciences FHNW(应用科学大学) FHNW Brugg-Windisch AG(FHNW布吕克-温迪施公司)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出SynthCLIC数据集,通过分析CLIP-based检测器的学习机制,揭示其在合成图像检测中依赖于高级摄影属性而非生成器特定伪影,并强调了持续更新和广泛训练的重要性。

Comments 10 figures; 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04798 2026-08-18 cs.CV 版本更新 50%

Detector-Augmented SAMURAI for Long-Duration Drone Tracking

增强检测器的SAMURAI用于长时间无人机跟踪

Tamara R. Lenhard, Andreas Weinmann, Hichem Snoussi, Tobias Koch

机构 * Institute for the Protection of Terrestrial Infrastructures, German Aerospace Center (DLR)(地面基础设施保护研究所,德国航空航天中心(DLR)) ACIDA Lab, Technical University of Applied Sciences Würzburg-Schweinfurt(应用技术大学施魏尔堡-施维恩富特学院ACIDA实验室) Data Science Institute, European University of Technology(欧洲技术大学数据科学研究所) LIST3N, Université de Technologie de Troyes(图卢兹理工大学LIST3N)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出增强检测器的SAMURAI模型,用于提升无人机在复杂城市环境中的长时间跟踪鲁棒性,显著提高了成功率并降低了误检率。

Journal ref 2026 IEEE/CVF Winter Conference on Applications of Computer Vision Workshops (WACVW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18135 2026-08-18 cs.CV 版本更新 50%

World-in-World: World Models in a Closed-Loop World

世界中的世界:闭环世界中的世界模型

Jiahan Zhang, Muqing Jiang, Nanru Dai, Taiming Lu, Arda Uzunoglu, Shunchi Zhang, Yana Wei, Jiahao Wang, Vishal M. Patel, Paul Pu Liang, Daniel Khashabi, Cheng Peng, Rama Chellappa, Tianmin Shu, Alan Yuille, Yilun Du, Jieneng Chen

机构 * JHU(约翰·霍普金斯大学) PKU(北京大学) Princeton(普林斯顿大学) MIT(麻省理工学院) Harvard(哈佛大学)

专题命中 评测与基准 :post-training(abstract)

AI总结 研究人员推出首个具身场景闭环世界模型基准平台World-in-World,发现视觉质量不保障任务成功,后训练缩放比升级预训练视频生成器更有效,增加推理计算可提升闭环性能。

Comments ICLR 2026 Oral. Add acknowledgement in arxiv v2. Code is at https://github.com/World-In-World/world-in-world

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00077 2026-08-18 q-bio.QM 版本更新 50%

Ribonucleic-Acid Protein Interaction Prediction Based on Deep Learning: A Comprehensive Survey

基于深度学习的核糖核酸-蛋白质相互作用预测:一项综合综述

Danyu Li, Rubing Huang, Chenhui Cui, Dave Towey, Ling Zhou, Jinyu Tian, Bin Zou

专题命中 评测与基准 :language model(abstract)

AI总结 该综述分析2014-2023年179项研究,考察AI在基于深度学习的RPI预测中的应用,总结技术演进、最优模型、挑战及未来方向,填补相关文献空白。

Comments Accepted for publication in Applied Soft Computing. DOI: 10.1016/j.asoc.2025.113795

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 116 篇

2608.11657 2026-08-18 cs.CL cs.AI nlin.CG 版本更新 93%

Semantic Lenia: Emergence of Homeostatic Solitons within the Semantic Space of Large Language Models

语义LENIA:大语言模型语义空间内的稳态孤子涌现

Yoshihiko Kayama

机构 * BAIKA Women’s University(梅田花女子大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Semantic Lenia人工生命框架,将LLM推理转化为宏观logit空间的连续动力系统,通过非线性稳态反馈回路平衡语义吸引与句法排斥,在混沌边缘涌现自主语义孤子,建立机器认知的物理标度律。

Comments 18 pages, 6 figures. Code, datasets, and interactive phase diagrams are available at https://y-kayama.github.io/semantic-lenia/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04504 2026-08-18 cs.CL cs.DC cs.LG cs.SY eess.SY 版本更新 92%

Multi-Bin Batching for Increasing LLM Inference Throughput

用于提升大语言模型(LLM)推理吞吐量的多桶批处理

Ozgur Guldogan, Jackson Kunde, Kangwook Lee, Ramtin Pedarsani

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对LLM请求长度差异导致的资源利用率问题,提出多桶批处理方法,在静态批处理框架下提升了LLM推理吞吐量,量化了其与原生连续批处理的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16477 2026-08-18 cs.LG 新提交 92%

Pallas: A Proactive KV Cache Migration Framework for LLM Inference in AI-RAN

Pallas:面向AI-RAN中LLM推理的主动KV缓存迁移框架

Tianhang Ding, Jianchun Liu, Hongli Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Pallas是面向AI-RAN中LLM推理的主动KV缓存迁移框架,通过切换前在目标基站预准备推理状态,结合在线调度器优化,显著降低服务中断时间与令牌间延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16201 2026-08-18 cs.LG 新提交 92%

Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis

面向基于大语言模型(LLM)的多模态情感分析的多粒度情感集成

Shanshan Lin, Yuesheng Wu, Chao Chen, Yizhe Yang, Zhihao Chen, Zexian Yang, Xiangwen Liao

机构 * Fuzhou University(福州大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Jiangxia University(江夏大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出MGSI多粒度情感集成框架,通过多尺度编码、文本引导对齐等优化,提升基于LLM的多模态情感分析性能,在四个公开基准上效果优于冻结LLM基线。

Comments Accepted to NLPCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14635 2026-08-18 cs.DC cs.LG 新提交 92%

Belayer: Efficient Fault Tolerance for LLM Agentic RL Training

Belayer:面向LLM智能体强化学习训练的高效容错机制

Jiecheng Zhou, Qinghao Hu, Peng Sun, Xingcheng Zhang, Weiming Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Belayer系统,针对LLM智能体强化学习训练的生成引擎和环境故障设计容错机制,可降低无故障训练开销,大幅缩短工作节点与环境故障的恢复时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03770 2026-08-18 cs.DC cs.AI 版本更新 92%

E2LLM: Towards Efficient LLM Serving in Heterogeneous Edge/Fog Environments

E2LLM:异构边缘/雾环境中高效LLM服务

Truong-Thanh Le, Amir Taherkordi, Hoang-Loc La, Frank Eliassen, Phuong Hoai Ha, Peiyuan Guan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出E2LLM框架,通过复制模型到多设备组并采用模型并行,结合遗传算法聚类和动态规划分区,在资源受限的异构边缘/雾环境中实现高效LLM部署,相比Splitwise基线在高需求下平均等待时间降低50%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏