arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 202 篇

2604.10579 2026-06-02 cs.RO cs.AI 57%

AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Afford Correspondence

AffordGen: 通过可供性对应生成多样化演示以实现通用物体操作

Jiawei Zhang, Kaizhe Hu, Yingqian Huang, Yuanchen Ju, Zhengrong Xue, Huazhe Xu

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) Fudan University(复旦大学) UC Berkeley(伯克利大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出AffordGen框架,利用3D生成模型和视觉基础模型在大规模3D网格上的语义对应生成多样化操作轨迹,训练鲁棒的闭环视觉运动策略,实现零样本泛化到未见物体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27223 2026-06-02 cs.CV cs.AI 57%

EuraGovExam: A Multilingual Multimodal Benchmark from Real-World Civil Service Exams

EuraGovExam:来自现实世界公务员考试的多语言多模态基准

Jaeseong Kim, Chaehwan Lim, Sang Hyun Gil, Suan Lee

机构 * School of Computer Science / Data Intelligence Lab(计算机科学学院/数据智能实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出一个包含8000多道真实公务员考试题目的多语言多模态基准EuraGovExam,要求模型直接从图像中进行布局感知的跨语言推理,当前最先进的视觉语言模型准确率仅达86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25640 2026-06-02 cs.DL cs.CL 57%

RenoBench: A Citation Parsing Benchmark

RenoBench: 引文解析基准

Parth Sarin, Juan Pablo Alperin, Adam Buttrick, Dione Mentis

机构 * Graduate School of Education, Stanford University(斯坦福大学教育研究生院) Public Knowledge Project, Simon Fraser University(公共知识项目,西蒙弗雷泽大学) DataCite, Hannover, Germany(DataCite,德国汉诺威) California Digital Library, University of California Office of the President(加州数字图书馆,加州大学校长办公室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对现有引文解析评估方法不可泛化、基于合成数据或不可公开获取的问题,提出从四个出版生态系统收集的公开基准RenoBench,通过自动验证和特征采样构建多语言、多类型数据集,并评估多种解析系统,结果表明语言模型(尤其微调后)表现优异,为可重复标准化评估奠定基础。

Comments Presented as a conference paper at CiteX 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11560 2026-06-02 cs.IR cs.AI 57%

Characterizing Web Search in The Age of Generative AI

生成式AI时代下网络搜索的特征刻画

Elisabeth Kirsten, Jost Grosse Perdekamp, Qinyuan Wu, Mihir Upadhyay, Krishna P. Gummadi, Muhammad Bilal Zafar

机构 * UA Ruhr Research Center for Trustworthy Data Science and Security(乌尔姆-鲁尔可信数据科学与安全研究中心) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Ruhr University Bochum(波鸿鲁尔大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 通过系统比较传统搜索与多个生成式搜索系统,揭示了它们在知识来源、多样性、稳定性上的差异,并指出生成式搜索引入了现有评估范式未覆盖的新维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01132 2026-06-02 cs.CV 50%

HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers

HakushoBench:来自政府白皮书的日语图表VQA基准

Issa Sugiura, Shuhei Kurita, Yusuke Oda, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) NII(日本学术振兴会) NII LLMC(日本学术振兴会LLMC)

专题命中 评测与基准 :language model(abstract)

AI总结 利用政府白皮书构建日语图表VQA基准HakushoBench,包含2053张图像和人工标注问答对,评估视觉语言模型对图表的深度理解。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01050 2026-06-02 cs.CV 50%

TextFake: Benchmarking AI-Generated Image Detection on Text-Rich Images

TextFake: 对富含文本图像中AI生成图像检测的基准测试

Yuning Zhang, Changtao Miao, Mingyu Liao, Tingyu Liu, Xinghao Wang, Tao Gong, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络科学与技术学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) Individual Researcher(独立研究者)

专题命中 评测与基准 :prompting(abstract)

AI总结 针对AI生成图像检测在富含文本图像上的空白,构建包含28种语言、2万图像的TextFake基准,评估14种检测器和3种VLM API,发现系统性能差距并诊断三种失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00640 2026-06-02 cs.CV 50%

An Attribute-Based Measure of Video Complexity

基于属性的视频复杂度度量

Aditya Sarkar, Yi Li, Zihao Wang, Jiacheng Cheng, Sai Vidyaranya Nuthalapati, Aashu Singh, Shlok Kumar Mishra, David Jacobs, Nuno Vasconcelos

机构 * UMIACS-University of Maryland College Park(马里兰大学College Park分校UMIACS) University of California San Diego(加州大学圣地亚哥分校) Yale University(耶鲁大学) Meta AI

专题命中 评测与基准 :LLM(abstract)

AI总结 提出VideoABC框架,通过属性空间量化估计视频-问题对在视频大语言模型上的失败概率,实现非参数复杂度度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00601 2026-06-02 cs.PL cs.DC 50%

ScanWeaver: Compiler-Driven Parallelization of Affine Recurrences via Associative Scan Lowering

ScanWeaver:通过关联扫描降级实现仿射递归的编译器驱动并行化

Qiying Wu, Pavel Zolnikov

专题命中 评测与基准 :language model(abstract)

AI总结 提出ScanWeaver编译器框架,将基于递归的计算转换为关联扫描表示并降级为可执行GPU程序,以解决Mamba等选择性状态空间模型中的输入相关扫描递归的并行化问题。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00592 2026-06-02 cs.CV 50%

Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs

通过PRISM:原则感知、可解释和多尺度的视觉设计评估

Mona Gandhi, KJ Joseph, Srinivasan Parthasarathy, Sayan Nag

机构 * Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出PRISM基准和一种多尺度评估框架,通过原则扰动和分层分析实现可解释的设计质量评估。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00307 2026-06-02 cs.RO 50%

ScaRF-SLAM: Scale-Consistent Reconstruction with Feed-Forward Models and Classical Visual SLAM

ScaRF-SLAM: 基于前馈模型与经典视觉SLAM的尺度一致重建

Yuhao Zhang, Yifu Tao, Frank Dellaert, Maurice Fallon

机构 * Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所) College of Computing, Georgia Institute of Technology(佐治亚理工学院计算机学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出一种解耦框架,将经典特征SLAM用于鲁棒跟踪,几何基础模型仅用于建图,通过尺度优化和子图融合实现高质量一致密集重建,在建筑级数据集上重建精度提升10%-20%。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17499 2026-06-02 eess.SY cs.SY eess.SP 50%

A Tutorial on Learning-Based Radio Map Construction: Data, Paradigms, and Physics-Awareness

基于学习的无线电地图构建教程:数据、范式和物理感知

Xiucheng Wang, Yuhao Pan, Nan Cheng, Çağkan Yapar, Ruijin Sun, Zhisheng Yin, Conghao Zhou, Wenchao Xu, Yuxiang Zhang, Jianhua Zhang, Shuguang Cui, Xuemin Shen

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文系统综述了基于学习的无线电地图构建方法,从数据、范式和物理感知三个维度展开,并讨论了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06453 2026-06-02 cs.CV 50%

Pinterest Canvas: Large-Scale Image Generation at Pinterest

Pinterest Canvas: Pinterest 的大规模图像生成系统

Yu Wang, Eric Tzeng, Raymond Shiau, Jie Yang, Dmitry Kislyuk, Charles Rosenberg

机构 * Pinterest, Inc.(Pinterest公司)

专题命中 评测与基准 :prompting(abstract)

AI总结 本文提出 Pinterest Canvas,一个基于扩散模型的大规模图像生成系统,通过基础模型微调为特定任务(如背景增强和宽高比外扩)生成专用模型,并在线上实验中分别获得18.0%和12.5%的参与度提升。

Comments Accepted by KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 154 篇

2512.24120 2026-06-02 cs.CV cs.AI 93%

Enhancing LLM-Based Neural Network Generation: Few-Shot Prompting and Efficient Validation for Automated Architecture Design

增强基于LLM的神经网络生成:面向自动化架构设计的少样本提示与高效验证

Raghuvir Duvvuri, Chandini Vysyaraju, Avi Goyal, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

专题命中 效率与部署 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出少样本架构提示(FSAP)和空白归一化哈希验证方法,以提升基于LLM的计算机视觉架构自动生成效率,并通过大规模实验验证其有效性。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 3242-3251, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08948 2026-06-02 cs.IR cs.AI 92%

SHERLOCK: Towards Dynamic Knowledge Adaptation in LLM-enhanced E-commerce Risk Management

SHERLOCK:面向LLM增强电商风险管理的动态知识适应

Nan Lu, Yurong Hu, Jiaquan Fang, Yan Liu, Rui Dong, Yiming Wang, Rui Lin, Shaoyi Xu

机构 * Beijing Jiaotong University(北京交通大学) JD.com(京东公司) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出Sherlock框架,通过构建领域知识库、两阶段检索增强生成和自演化数据飞轮,将结构化知识与LLM推理结合,提升电商风险案例调查的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00306 2026-06-02 cs.LG cs.AI 92%

Rethinking the Role of Temperature in Large Language Model Distillation

重新思考温度在大语言模型蒸馏中的作用

Hoang-Chau Luong, Lingwei Chen

机构 * Golisano College of Computing and Information Sciences(戈利萨诺计算与信息科学学院) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析温度τ对前向KL散度和反向KL散度在LLM蒸馏中的不对称影响,发现高温下FKL优于RKL,并证明温度能提升多种蒸馏目标,使简单KL方法达到先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00405 2026-06-02 cs.GT 92%

From Talking Words to Sharing Thoughts: Scalable Multi-LLM Aggregation via Structured Message Passing

从言语到思想:通过结构化消息传递实现可扩展的多LLM聚合

Niloufar Mehrabi, Sayed Pedram Haeri Boroujeni, Abolfazl Razi

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出基于二分因子图的消息传递框架,通过语义层集成多个LLM的输出分布,实现高效、可扩展的多模型聚合,在降低97%令牌使用和6倍API调用的同时,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00991 2026-06-02 cs.AI 92%

Large Language Models in Transportation Systems Management and Operations: From Text Reasoning to Multi-modal Decision Support

交通系统管理与运营中的大语言模型:从文本推理到多模态决策支持

Siyan Li, Zehao Wang, Jiachen Li, Kanok Boriboonsomsin, Matthew J. Barth, Guoyuan Wu

机构 * Bourns College of Engineering, Center for Environmental Research and Technology, University of California at Riverside, CA, USA(伯恩斯工程学院,环境研究与技术中心,加州大学河滨分校,美国,加利福尼亚州河滨)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文综述了大语言模型(LLM)和多模态大语言模型(MM-LLM)在交通系统管理与运营(TSMO)中的应用,涵盖运营与服务、移动性与车队服务、数据建模与决策支持三大领域,并指出了数据异构性、实时推理、可解释性等挑战及未来方向。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02559 2026-06-02 cs.CL cs.AI 92%

From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

从层到子模块:重新思考基于替换的LLM压缩中的粒度

Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca

机构 * University of Trento(特伦托大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出子模块级别的非连续替换压缩方法SubFit,通过为注意力和前馈子模块分别设计轻量残差旁路,在多种LLM上实现更好的困惑度-准确率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22666 2026-06-02 cs.CR cs.CL cs.LG stat.ML 91%

VERA: Variational Inference Framework for Jailbreaking Large Language Models

VERA:用于越狱大型语言模型的变分推理框架

Anamika Lochab, Lu Yan, Patrick Pynadath, Xiangyu Zhang, Ruqi Zhang

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title);language model(title);prompting(abstract)

AI总结 提出VERA框架,将黑盒越狱提示生成视为变分推理问题,训练小型攻击者LLM近似目标LLM的对抗提示后验,无需重新优化即可生成多样且流畅的越狱提示。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00365 2026-06-02 cs.AR 91%

SPARQLe: Sub-Precision Activation Representation for Quantized LLM Inference

SPARQLe: 用于量化LLM推理的子精度激活表示

Aradhana Mohan Parvathy, Soumendu Kumar Ghosh, Shamik Kundu, Arnab Raha, Souvik Kundu, Deepak A. Mathaikutty, Anand Raghunathan

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM推理中激活值高精度需求导致的硬件开销,提出SPARQLe软硬件协同设计框架,利用激活值低位稀疏性,将高精度张量分解为密集低位和稀疏高位部分,在保持精度的同时降低内存访问和计算能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00888 2026-06-02 cs.LG cs.AI 91%

Memory-Efficient LLM Training with Dynamic Sparsity: From Stability to Practical Scaling

基于动态稀疏性的内存高效LLM训练:从稳定性到实际扩展

Qiao Xiao, Boqian Wu, Patrik Okanovic, Tomasz Sternal, Maurice van Keulen, Elena Mocanu, Mykola Pechenizkiy, Decebal Constantin Mocanu, Torsten Hoefler

机构 * University of Waterloo(滑铁卢大学) University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Michigan(密歇根大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SMET方法,通过优化器预热和密度感知学习率缩放解决动态稀疏训练中的优化不稳定问题,实现LLM的稳定、可扩展且内存高效的稀疏预训练。

Comments Accepted at ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00975 2026-06-02 cs.CL 91%

Lost in Delusion: Examining LLM Safety Under User Delusions and Distress

迷失在妄想中:审视用户妄想与痛苦下的LLM安全性

Andrew Aquilina, Chetna Nihalani, Vasudha Varadarajan, Nathan S. Fishbein, Yu-Ru Lin, Maarten Sap

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学) Fordham University(福特汉姆大学)

专题命中 效率与部署 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 本研究通过多轮对话模拟,发现LLM在检测用户痛苦时表现良好,但在痛苦嵌入妄想时干预行为显著减少(高达4.5倍),并提出针对性提示策略以缩小这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26660 2026-06-02 cs.LG 91%

WINDQuant: Weight-Informed Neural Decision-Making for Global Mixed-Precision LLM Quantization

WINDQuant: 权重感知的全局混合精度大语言模型量化神经决策

Phong Nam Huu Nguyen, Khoi M. Le, Cong-Duy T Nguyen, Anh Tuan Luu, Thong Thanh Nguyen, Tho Quan

机构 * CAIR, VinUniversity, Vietnam(越南 VinUniversity 的 CAIR) Ho Chi Minh City University of Technology (HCMUT), VNU-HCM, Ho Chi Minh City, Vietnam(越南胡志明市技术大学 (HCMUT)) CCDS, Nanyang Technological University, Singapore(新加坡南洋理工大学的 CCDS) School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出基于强化学习的WINDQuant控制器,在全局存储预算下为列块分配位宽和量化策略,实现超低位LLM量化的细粒度混合精度,性能优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01099 2026-06-02 cs.CL cs.AI 91%

MiCU: End-to-End Smart Home Command Understanding with Large Language Model

MiCU: 基于大语言模型的端到端智能家居指令理解

Haowei Han, Kexin Hu, Weiwei Cai, Debiao Zhang, Bin Qin, Yuxiang Wang, Jiawei Jiang, Xiao Yan, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Xiaomi Corporation(小米公司) Institute for Math & AI, Wuhan University(武汉大学数学与人工智能研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出MiCU,一种利用课程学习、强化学习和令牌压缩技术的领域特定大语言模型,用于解决智能家居中模糊指令理解问题,平均准确率提升20.01%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23485 2026-06-02 cs.CL cs.AI cs.CY 91%

Failure of contextual invariance in large language models

大型语言模型中语境不变性的失效

Sagar Kumar, Ariel Flint, Luca Maria Aiello, Andrea Baronchelli

机构 * Network Science Institute, Northeastern University(网络科学研究所,东北大学) Center for Health Informatics Program, Boston Children’s Hospital(健康信息学计划中心,波士顿儿童医院) Dept. of Mathematics, City St George’s, University of London(伦敦大学城市圣乔治学院数学系) IT University of Copenhagen(哥本哈根IT大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过代词选择任务发现,在语境等价但无信息量的干扰下,大语言模型输出发生系统性偏移,表明其违反语境不变性,影响偏见评估与高风险应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25837 2026-06-02 cs.LG cs.AI 91%

Distillation of Large Language Models via Concrete Score Matching

通过具体分数匹配进行大型语言模型的蒸馏

Yeongmin Kim, Donghyeok Shin, Mina Kang, Byeonghu Na, Il-Chul Moon

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出具体分数蒸馏(CSD)目标,通过离散分数匹配克服softmax平滑和logit平移不变性限制,实现学生与教师模型间所有词汇对相对logit差异的灵活加权,在GPT-2、OpenLLaMA和GEMMA上优于现有蒸馏方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02430 2026-06-02 cs.DC cs.AI 90%

Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference

并非所有错误都平等:大型语言模型推理中错误传播的系统研究

Yafan Huang, Sheng Di, Guanpeng Li

机构 * University of Iowa(爱荷华大学) Argonne National Laboratory(阿贡国家实验室) University of Florida(佛罗里达大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究通过提出的LLMFI故障注入框架,系统研究了软错误在大型语言模型推理中的传播机制,揭示了关键脆弱性模式,并提出了四种低开销的软件级可靠性改进方向。

Comments Accepted at ICS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02355 2026-06-02 cs.AI cs.LG 90%

SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training

SIRI:具有内在技能的自我内化强化学习用于LLM智能体训练

Zhongyu He, Yuanfan Li, Fei Huang, Tianyu Chen, Siyuan Chen, Xingyang Li, Meng Hsuan Yu, Xiangrong Liu, Leyi Wei, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Xiamen University(厦门大学) Meituan(美团) Macao Polytechnic University(澳门 polytechnic 大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出SIRI框架,通过自我技能挖掘、验证和内化,使LLM智能体无需外部技能生成器或推理时技能库即可提升长程任务性能,在ALFWorld和WebShop上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05395 2026-06-02 stat.ML cs.AI cs.LG 90%

Optimal Bayesian Stopping for Efficient Inference of Consistent LLM Answers

用于高效推断一致LLM答案的最优贝叶斯停止

Jingkai Huang, Will Ma, Zhengyuan Zhou

机构 * Stern School of Business, New York University, New York, USA(纽约大学 Stern 商学院) Graduate School of Business, Columbia University, New York, USA(哥伦比亚大学 商学院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 利用贝叶斯先验信息,通过L-聚合停止策略在达到足够一致性时提前停止采样,以最小化采样成本并高效识别最一致的LLM答案。

Comments Accepted to ICML 2026. Camera-ready version

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01312 2026-06-02 eess.SP cs.AI cs.NI 90%

A Communication-Centric 6G-LLM Architecture for Scalable Tactical Autonomous Defense Vehicle Networks

面向可扩展战术自主防御车辆网络的以通信为中心的6G-LLM架构

Kiran Khurshid, Shumaila Javaid, Nasir Saeed

机构 * Department of Computer and Software Engineering, National University of Sciences and Technology (NUST), Islamabad, Pakistan(计算机与软件工程系,国家科学与技术大学(NUST),伊斯兰堡,巴基斯坦) Department of Control Science and Engineering, College of Electronics and Information Engineering, Tongji University and National Key Laboratory of Autonomous Intelligent Unmanned Systems, Tongji University, China(控制科学与工程系,电子与信息工程学院,同济大学,以及自主智能无人机系统国家重点实验室,同济大学,中国) Department of Electrical and Communication Engineering, UAE University, Al-Ain 15551, UAE(电子与通信工程系,阿联酋大学,阿恩15551,阿联酋)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种以通信为中心的分层架构,通过集成边缘辅助大语言模型推理与6G语义通信,在战术自主防御车辆网络中实现协调效率提升、通信开销降低和延迟韧性增强。

Comments 10 pages, accepted in IEEE Network Magazine

Journal ref K. Khurshid, S. Javaid and N. Saeed, "A Communication-Centric 6G-LLM Architecture for Scalable Tactical Autonomous Defense Vehicle Networks," in IEEE Network, Early access, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏