arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22188 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22188 篇

2604.26557 2026-04-30 cs.DC cs.AI cs.PF 90%

DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference

DUAL-BLADE:双路径NVMe直接KV缓存卸载用于边缘大语言模型推理

Bodon Jeong, Hongsu Byun, Youngjae Kim, Weikuan Yu, Kyungkeun Lee, Jihoon Yang, Sungyong Park

机构 * Sogang University(ソンガン大学) Florida State University(佛罗里达州立大学) Samsung Electronics Co.(三星电子公司)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DUAL-BLADE双路径框架,通过动态分配KV张量到页缓存或NVMe直接路径,减少I/O瓶颈,提升边缘LLM推理吞吐量。

Comments To appear in IEEE International Conference on Distributed Computing Systems (ICDCS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21480 2026-04-30 cs.DB cs.CL cs.IR 90%

Both Ends Count! Just How Good are LLM Agents at "Text-to-Big SQL"?

两端都算!LLM代理在『文本到大数据SQL』方面表现如何?

Germán T. Eizaguirre, Lars Tissen, Marc Sánchez-Artigas

机构 * RWTH Aachen University(亚琛工业大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出评估『文本到大数据SQL』的新指标,揭示传统文本到SQL指标在处理大规模数据时的不足,展示LLM代理在执行效率、成本及数据规模影响方面的表现。

Comments 14 pages, 8 figures

Journal ref Proc. EuroMLSys '26 (2026) 333-345

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07709 2026-04-28 cs.AI 90%

MAGELLAN: Metacognitive predictions of learning progress guide autotelic LLM agents in large goal spaces

MAGELLAN:元认知预测学习进度指导自主LLM代理在大规模目标空间中学习

Loris Gaven, Thomas Carta, Clément Romac, Cédric Colas, Sylvain Lamprier, Olivier Sigaud, Pierre-Yves Oudeyer

机构 * Department of XXX, University of YYY, Location, Country(XXX部门,YYYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Inria (Flowers), University of Bordeaux, France(Inria(Flowers),波尔多大学,法国) MIT, Computational Cognitive Science Lab, Cambridge, MA, USA(麻省理工学院,计算认知科学实验室,马萨诸塞州剑桥,美国)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 MAGELLAN通过元认知预测学习进度,使LLM代理在大规模目标空间中高效优先目标,提升学习效率和适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23141 2026-04-28 cs.CR cs.AI 90%

UNSEEN: A Cross-Stack LLM Unlearning Defense against AR-LLM Social Engineering Attacks

UNSEEN: 一种跨栈LLM去学习防御对抗AR-LLM社会工程攻击

Tianlong Yu, Yang Yang, Xiao Luo, Lihong Liu, Fudu Xing, Zui Tao, Kailong Wang, Gaoyang Liu, Ting Bi

机构 * Hubei University(湖北大学) University of Southern California(南加州大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对AR-LLM社会工程攻击,提出UNSEEN跨栈防御机制,结合AR访问控制层、基于F-RMU的LLM去学习和运行时代理防护,通过用户研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22520 2026-04-27 cs.CL 90%

RouteLMT: Learned Sample Routing for Hybrid LLM Translation Deployment

RouteLMT: 为混合LLM翻译部署设计的学得样本路由

Yingfeng Luo, Hongyu Liu, Dingyang Lin, Kaiyan Chang, Chenglong Wang, Bei Li, Quan Du, Tong Xiao, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) NiuTrans Research, Shenyang, China(牛译研究院,中国沈阳)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RouteLMT,通过在模型内部预测大模型相对于小模型的边际增益,实现高效的样本路由,优于传统启发式和质量估计方法,达到更优的质量-预算帕累托前沿。

Comments Accepted to ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03779 2026-04-27 cs.CL 90%

Tracing the complexity profiles of different linguistic phenomena through the intrinsic dimension of LLM representations

通过LLM表示的内在维度追溯不同语言现象的复杂性特征

Marco Baroni, Emily Cheng, Iria de-Dios-Flores, Francesca Franzon

机构 * Universitat Pompeu Fabra (UPF)(巴塞罗那自治大学) ICREA(加泰罗尼亚凝聚态物理与应用研究中心)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 研究通过LLM表示的内在维度揭示语言复杂性对比,发现复杂现象在不同层间表现出更高的维度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19049 2026-04-22 cs.CR cs.AI cs.SE 90%

Refute-or-Promote: An Adversarial Stage-Gated Multi-Agent Review Methodology for High-Precision LLM-Assisted Defect Discovery

反驳或促进:一种对抗性阶段门多智能体评审方法,用于高精度LLM辅助缺陷发现

Abhinav Agarwal

机构 * OpenSSL

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Refute-or-Promote方法,通过对抗性阶段门多智能体评审,提高LLM辅助缺陷发现的精度,通过多种技术过滤虚假正例,最终发现多个漏洞并推动标准制定。

Comments 10 pages, 3 tables. Artifacts: https://github.com/abhinavagarwal07/refute-or-promote (Zenodo DOI: 10.5281/zenodo.19668799)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18302 2026-04-21 cs.AI 90%

Toward Zero-Egress Psychiatric AI: On-Device LLM Deployment for Privacy-Preserving Mental Health Decision Support

迈向零数据外溢的心理AI:设备端LLM部署用于隐私保护的心理健康决策支持

Eranga Bandara, Asanga Gunaratna, Ross Gore, Anita H. Clayton, Christopher K. Rhea, Sachini Rajapakse, Isurunima Kularathna, Sachin Shetty, Ravi Mukkamala, Xueping Liang, Preston Samuel, Atmaram Yarlagadda

机构 * Old Dominion University(旧 Dominion 大学) AI Motion Labs(AI Motion 实验室) Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) University of Virginia School of Medicine(弗吉尼亚大学医学院) Florida International University(佛罗里达国际大学) Blanchfield Army Community Hospital(Blanchfield陆军社区医院) McDonald Army Health Center(McDonald陆军医疗中心)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出一种零数据外溢的设备端AI平台,通过本地执行推理管道,实现隐私保护的心理健康决策支持,使用轻量级LLM进行诊断评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17271 2026-04-21 cs.CL 90%

HopRank: Self-Supervised LLM Preference-Tuning on Graphs for Few-Shot Node Classification

HopRank: 图上基于自监督的LLM偏好微调用于少样本节点分类

Ziqing Wang, Kaize Ding

机构 * Northwestern University(西北大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出HopRank,通过自监督学习在文本属性图上实现少样本节点分类,利用图拓扑结构编码的类别信息,无需标注数据即可提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16521 2026-04-21 cs.CR cs.AI 90%

CAMP: Cumulative Agentic Masking and Pruning for Privacy Protection in Multi-Turn LLM Conversations

CAMP:累积代理掩码与剪枝用于多轮LLM对话中的隐私保护

Aman Panjwani

机构 * Independent Researcher(独立研究员)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CAMP通过跨轮次隐私保护框架,解决多轮对话中累积PII暴露问题,通过会话级注册、共现图和CPE评分实现有效隐私保护,同时保持对话实用性。

Comments Submitted to arXiv. Finance-domain multi-turn demo evaluated on 4 synthetic scenarios. Independent research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01099 2026-04-20 cs.AI 90%

Cost-Aware Model Orchestration for LLM-based Systems

面向LLM系统的成本感知模型编排

Daria Smirnova, Hamid Nasiri, Marta Adamska, Zhengxin Yu, Peter Garraghan

机构 * Lancaster University(兰卡斯特大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种考虑性能与成本权衡的成本感知模型选择方法,通过整合定量模型性能特征提升任务准确性、能效和编排效率。

Comments 9 pages, 5 figures. Accepted at EuroMLSys '26, Edinburgh, Scotland UK

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14531 2026-04-17 cs.AI 90%

TRACER: Trace-Based Adaptive Cost-Efficient Routing for LLM Classification

TRACER:基于追踪的自适应成本高效路由用于LLM分类

Adam Rida

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 TRACER通过利用生产日志中的标注输入输出对训练轻量级替代模型,实现低成本的LLM分类路由,其通过阈值机制动态决定模型部署边界,并生成可解释性特征。

Comments github.com/adrida/tracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18454 2026-04-16 cs.AR cs.AI cs.DC cs.PL 90%

Sandwich: Joint Configuration Search and Hot-Switching for Efficient CPU LLM Serving

Sandwich:联合配置搜索与热切换的高效CPU LLM服务

Juntao Zhao, Jiuru Li, Chuan Wu

机构 * The University of Hong Kong(香港大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 Sandwich通过联合配置搜索与热切换技术,解决CPU LLM服务中prefill/decode资源冲突问题,实现2.01倍端到端加速和3.40倍延迟降低,同时降低三次数量级的调优成本。

Comments DAC '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23728 2026-04-15 cs.CL 90%

GigaCheck: Detecting LLM-generated Content via Object-Centric Span Localization

GigaCheck:通过以对象为中心的跨度定位检测LLM生成内容

Irina Tolstykh, Aleksandra Tsybina, Sergey Yakubson, Aleksandr Gordeev, Vladimir Dokholyan, Maksim Kuprashevich

机构 * SALUTEDEV LLC

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 GigaCheck提出双策略框架检测AI生成文本,利用细调LLM的表示学习进行作者身份识别,结合DETR-like模型与语言编码器实现精准定位,实验验证了方法的鲁棒性。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12301 2026-04-15 cs.DC cs.AI cs.SE 90%

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads

Local-Splitter:七种减少云LLM令牌使用量策略的测量研究

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

机构 * Sperix Labs(Sperix实验室) VIA Cybersecurity Lab, KNUST(VIA网络安全实验室,科罗尼斯特大学) Quantum and Assistive Technologies Lab, KNUST(量子与辅助技术实验室,科罗尼斯特大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了七种减少云LLM令牌使用量的策略,通过测量发现本地路由与提示压缩组合在编辑密集型任务中可节省45-79%的云令牌,而RAG密集型任务中完整策略集可节省51%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12168 2026-04-15 cs.CR cs.AI 90%

Fully Homomorphic Encryption on Llama 3 model for privacy preserving LLM inference

在Llama 3模型上实现全同态加密以实现隐私保护的LLM推理

Anes Abdennebi, Nadjia Kara, Laaziz Lahlou

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过在Llama 3模型推理管道中集成基于后量子密码学的格基同态加密,提高模型对数据隐私攻击的防护能力,实验显示在i9 CPU上实现98%的文本生成准确率和237 ms的延迟,验证了方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00425 2025-08-12 cs.CV cs.AI 90%

MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization

JiangYong Yu, Sifan Zhou, Dawei Yang, Shuo Wang, Shuoyu Li, Xing Hu, Chen Xu, Zukang Xu, Changyong Shu, Zhihang Yuan

机构 * Southeast University(东南大学) Xi'an Jiaotong University(西安交通大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

Comments Accepted by ACM MM 2025. First PTQ solution for Multimodal large language models applicable to 5 mainstream MLLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16584 2024-05-06 cs.CL 90%

Can Large Language Models (or Humans) Disentangle Text?

Nicolas Audinet de Pieuchon, Adel Daoud, Connor Thomas Jerzak, Moa Johansson, Richard Johansson

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments To appear as: Nicolas Audinet de Pieuchon, Adel Daoud, Connor T. Jerzak, Moa Johansson, Richard Johansson. Can Large Language Models (or Humans) Disentangle Text? In: Sixth Workshop on NLP and Computational Social Science at NAACL, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08775 2024-02-01 cs.AI 90%

GEAR: Augmenting Language Models with Generalizable and Efficient Tool Resolution

Yining Lu, Haoping Yu, Daniel Khashabi

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01022 2024-01-10 cs.LG 90%

Advanced Large Language Model (LLM)-Driven Verilog Development: Enhancing Power, Performance, and Area Optimization in Code Synthesis

Kiran Thorat, Jiahui Zhao, Yaotian Liu, Hongwu Peng, Xi Xie, Bin Lei, Jeff Zhang, Caiwen Ding

专题命中 效率与部署 :language model(title,abstract);LLM(title);large language model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01089 2023-05-18 cs.CL 90%

RPTQ: Reorder-based Post-training Quantization for Large Language Models

Zhihang Yuan, Lin Niu, Jiawei Liu, Wenyu Liu, Xinggang Wang, Yuzhang Shang, Guangyu Sun, Qiang Wu, Jiaxiang Wu, Bingzhe Wu

专题命中 效率与部署 :language model(title,abstract);large language model(title);post-training(title);分类 cs.CL

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18458 2025-06-03 cs.DB cs.AI cs.CL cs.IR cs.LG 90%

A Survey of LLM $\times$ DATA

Xuanhe Zhou, Junxuan He, Wei Zhou, Haodong Chen, Zirui Tang, Haoyu Zhao, Xin Tong, Guoliang Li, Youmin Chen, Jun Zhou, Zhaojun Sun, Binyuan Hui, Shuo Wang, Conghui He, Zhiyuan Liu, Jingren Zhou, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Please refer to the paper list at: https://github.com/weAIDB/awesome-data-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13591 2026-08-17 cs.AI cs.CL 新提交 90%

Stable Miscalibration in Large Language Models: A Practical View of High-Confidence Errors

大语言模型中的稳定校准误差:高置信度错误的实用视角

Akira Okutomi

机构 * ToppyMicroServices OÜ

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出稳定校准误差概念,结合两类诊断方法,发现自我批判提示可降低模型隐藏状态敏感性,但高置信度错误未必是推理脆弱,部分或为稳定校准不当。

Comments Accepted at the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML)@ICML 2026. 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13580 2026-08-17 cs.CL cs.AI 新提交 90%

Jais 2: A Family of Arabic-Centric Open Large Language Models

Jais 2:以阿拉伯语为核心的开源大语言模型家族

Mohamed Anwar, Abed Alhakim Freihat, George Ibrahim, Mostafa Awad, Abdelrahman Sadallah, Gurpreet Gosal, Gokulakrishnan Ramakrishnan, Sarath Chandran, Biswajit Mishra, Rituraj Joshi, Ahmed Frikha, Etienne Goffinet, Abhishek Maiti, Ali El Filali, Sarah AlBarri, Samujjwal Ghosh, Rahul Pal, Parvez Mullah, Awantika Shukla, Sajid siddiki, Samta Kamboj, Onkar Pandit, Sunil Kumar Sahu, AbdelRahman Elbadawy, Amr Mohamed, Ahmad Chamma, Evan Dufraisse, Abdelaziz Bounhar, Dani Bouch, Hadi Abdine, Guokan Shang, Fajri Koto, Yuxia Wang, Zhuohan Xie, Ali Mekky, Rania Elbadry, Sarfraz Ahmad, Momina Ahsan, Omar El Herraoui, Daniil Orel, Hasan Iqbal, Kareem Elzeky, Mervat Abassy, Kareem Elozeiri, Saadeldine Eletter, Farah Atif, Nurdaulet Mukhituly, Haonan Li, Xudong Han, Aaryamonvikram Singh, Zainul Abedien Ahmed Quraishi, Neha Sengupta, Larry Murray, Avraham Sheinin, Joel Hestness, Natalia Vassilieva, Hector Xuguang Ren, Zhengzhong Liu, Michalis Vazirgiannis, Preslav Nakov

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 Jais 2是MBZUAI等联合开发的以阿拉伯语为核心的开源大语言模型家族,含70B、8B参数变体,在阿拉伯语及文化相关基准上表现领先,已开源并部署为多平台聊天应用,可支撑相关研究开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04744 2026-08-12 cs.LG cs.AI 90%

Reward Guidance for Reinforcement Learning Tasks Based on Large Language Models: The LMGT Framework

Yongxin Deng, Xihe Qiu, Jue Chen, Xiaoyu Tan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Journal ref Knowledge-Based Systems, 322 (2025) 113689

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00270 2026-08-11 cs.IR cs.AI cs.CL 版本更新 90%

LLMs Remember First, Forget Last: Dual-Process Interference in Large Language Models

Transformer 优先记住,最后遗忘:大型语言模型中的双过程干扰

Sourav Chattaraj, Kanak Raj

机构 * Thomson Reuters(汤姆森路透)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型在面对冲突信息时的记忆保留机制,发现前瞻性干扰主导后置性干扰,揭示了Transformer注意力机制中的优先效应。

Comments NPIR, Springer book series: Lecture Notes in Networks and Systems, indexed by Scopus and Ei Compendex

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00019 2026-08-04 cs.LG cs.AI 新提交 90%

Uncertainty-Aware Simulation-Based Inference for Operations Research with Large Language Models

面向运筹学的基于模拟的不确定性感知大语言模型推理

Liang Guo, Lin Shaochong, Shen Zuo-Jun Max, Zhang Kun

机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) The University of Hong Kong(香港大学) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文针对大语言模型用于运筹学建模时的短视策略易引发下游错误的问题,提出一种不确定性感知无训练推理框架,通过短前瞻模拟与重要性重采样提升OR公式生成的可靠性,在多基准上表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18280 2026-07-22 cs.LG cs.AI 新提交 90%

Beyond Single-Dimensional Compression: The Compound Sparsity Frontier of Large Language Models

超越单维压缩:大语言模型的复合稀疏前沿

Chao Han, Haozhe Hu, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型压缩,提出复合稀疏框架,结合静态参数剪枝和动态令牌级计算,通过低秩近似、通道剪枝及引入轻量级路由器实现。实验表明其在相同总稀疏度下优于单机制压缩,揭示跨维度干扰及有效分配方式,为改进压缩提供实用途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16243 2026-07-21 cs.LG cs.AI 新提交 90%

RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants

RobustMAD:评估用于可部署异常检测助手的多模态小语言模型的现实世界鲁棒性

Anushiya Arunan, Xin Li, Yan Qin, U-Xuan Tan, Nhu Khue Vuong, Xiaoli Li, Chau Yuen

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Nanyang Technological University(南洋理工大学) Chongqing University(重庆大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对多模态小语言模型现场部署的鲁棒性评估问题,开发RobustMAD基准测试,通过多种开放式查询评估模型,发现最佳模型虽有潜力但仍存差距及三种失败模式,为下一代多模态工业检测助手设计提供指导。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026 at https://openreview.net/forum?id=skrA9UYNIZ

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03223 2026-07-19 cs.AI cs.LG 90%

SI-Agent: An Agentic Framework for Feedback-Driven Generation and Tuning of Human-Readable System Instructions for Large Language Models

SI-Agent: 一种用于反馈驱动生成和调优大型语言模型人类可读系统指令的代理框架

Jeshwanth Challagundla, Mantek Singh, Siddharth Raina, Smarth Behl, FNU Harsh, Jasmin Jarsania

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) Liverpool John Moores University(利物浦约翰·穆里斯大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 SI-Agent通过反馈驱动的代理框架自动生成和优化人类可读的系统指令,提升大型语言模型的可解释性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏