arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-22 至 2026-04-22 共收录 327 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 78 篇

2604.19405 2026-04-22 cs.CL 57%

Lost in Translation: Do LVLM Judges Generalize Across Languages?

迷失在翻译中:大型视觉-语言模型(LVLM)的评判者是否能跨语言泛化?

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul Hoque, Jimmy Huang

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce AI研究)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出MM-JudgeBench,首个多语言多模态评判模型评估基准,包含60000+跨25种语言的配对偏好实例,揭示了LVLM评判器在跨语言性能上的显著差异,指出模型大小和架构并非多语言鲁棒性的良好预测因素。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14294 2026-04-22 cs.SD cs.AI eess.AS 57%

DASB - Discrete Audio and Speech Benchmark

DASB - 离散音频与语音基准

Pooneh Mousavi, Jarod Duret, Darius Petermann, Artem Ploujnikov, Luca Della Libera, Anastasia Kuznetsova, Cem Subakan, Mirco Ravanelli

机构 * Concordia University(康科迪亚大学) Mila-Quebec AI Institute(蒙特利尔AI研究院) Avignon Université(阿维尼昂大学) Université de Montréal(蒙特利尔大学) Université Laval(拉瓦尔大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Indiana University(印第安纳大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出DASB基准,用于评估离散音频token在语音、通用音频和音乐领域的表现,发现离散表示不如连续表示鲁棒,需精细调参,语义token优于声学token,但与连续特征仍有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18862 2026-04-22 cs.SE cs.AI 57%

Human-Machine Co-Boosted Bug Report Identification with Mutualistic Neural Active Learning

人机协同增强的缺陷报告识别与互惠神经主动学习

Guoming Long, Shihai Wang, Hui Fang, Tao Chen

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Loughborough University(洛桑大学) University of Birmingham(伯明翰大学) IDEAS Lab, University of Birmingham(伯明翰大学IDEAS实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出互惠神经主动学习框架,通过人机协作提升缺陷报告识别效率,实现95.8%的可读性与196.0%的可识别性提升,验证了其在软件质量维护中的有效性。

Comments Accepted by TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18722 2026-04-22 cs.CL 57%

Scripts Through Time: A Survey of the Evolving Role of Transliteration in NLP

时间跨度中的脚本:翻译学在自然语言处理中演变角色的综述

Thanmay Jayakumar, Deepon Halder, Raj Dabre

机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) Indian Institute of Engineering, Science and Technology(印度工程、科学与技术学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文综述了翻译学在跨语言NLP中的应用,分析了其在语言模型中的演变和有效性,讨论了关键权衡,并提供了针对不同语言、任务和资源约束的翻译策略建议。

Comments 9 pages, ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18591 2026-04-22 cs.HC cs.AI 57%

SPRITE: From Static Mockups to Engine-Ready Game UI

SPRITE:从静态草图到引擎-ready的游戏UI

Yunshu Bai, RuiHao Li, Hao Zhang, Chien Her Lim, Ming Yan, Mengtian Li

机构 * Shanghai University(上海大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 SPRITE通过整合视觉语言模型与结构化YAML表示,将静态截图转化为可编辑的引擎资产,提升了游戏UI开发的效率和准确性。

Comments CHI EA '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13729 2026-04-22 cs.CL 57%

On Temperature-Constrained Non-Deterministic Machine Translation: Potential and Evaluation

在温度约束下的非确定性机器翻译:潜力与评估

Weichuan Wang, Mingyang Liu, Linqi Song, Chen Ma

机构 * City University of Hong Kong(香港城市大学) City University of Hong Kong Shenzhen Research Institute(香港城市大学深圳研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文研究了非确定性机器翻译在多模态问题中的潜力,提出ExpectoSample策略以改进系统评估。

Comments 9 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20087 2026-04-22 cs.CV 50%

Endoshare: A Publicly Available, Surgeons-Friendly Solution to De-Identify and Manage Surgical Videos

Endoshare: 一种公开可用的、适合外科医生的解决方案,用于去标识化和管理手术视频

Lorenzo Arboit, Dennis N. Schneider, Britty Baby, Vinkle Srivastav, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学、法国国家科学研究中心、法国国家医学研究院、ICube、UMR7357、法国斯特拉斯堡)

专题命中 评测与基准 :prompting(abstract)

AI总结 本文提出Endoshare,一种面向外科医生的工具,用于标准化和去标识化内窥镜视频,通过用户中心开发流程提升可用性,并通过测试显示高用户满意度和实用性,为手术视频管理提供公开解决方案。

Comments 13 pages, 6 figures. Source-available software: https://camma-public.github.io/Endoshare/

Journal ref Surg Endosc, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18797 2026-04-22 cs.CV 50%

CrossPan: A Comprehensive Benchmark for Cross-Sequence Pancreas MRI Segmentation and Generalization

CrossPan:跨序列胰腺MRI分割与泛化的综合性基准

Linkai Peng, Cuiling Sun, Zheyuan Zhang, Wanying Dou, Halil Ertugrul Aktas, Andrea M Bejar, Elif Keles, Tamas Gonda, Michael B Wallace, Zongwei Zhou, Gorkem Durak, Rajesh N Keswani, Ulas Bagci

机构 * Department of Radiology, Northwestern University(西北大学放射科) Department of Electrical and Computer Engineering, Northwestern University(西北大学电气与计算机工程系) Department of Computer Science, Northwestern University(西北大学计算机科学系) Department of Gastroenterology, New York University(纽约大学消化内科部) Division of Gastroenterology and Hepatology, Mayo Clinic in Florida(佛罗里达梅奥诊所消化内科与肝病学部) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Departments of Gastroenterology and Hepatology, Northwestern University(西北大学消化内科与肝病学部)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究揭示跨序列泛化是胰腺MRI分割临床应用的主要障碍,指出跨序列域偏移比跨中心差异更严重,且现有方法在物理驱动对比反转下效果有限,半监督学习在稳定强度分布下有提升但不稳定。

Comments Accepted to MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18713 2026-04-22 cs.CV 50%

Align then Refine: Text-Guided 3D Prostate Lesion Segmentation

对齐后再细化:基于文本的3D前列腺病变分割

Cuiling Sun, Linkai Peng, Adam Murphy, Elif Keles, Hiten D. Patel, Ashley Ross, Frank Miller, Baris Turkbey, Andrea Mia Bejar, Halil Ertugrul Aktas, Gorkem Durak, Ulas Bagci

机构 * Department of Radiology, Northwestern University, Chicago, USA(放射科,西北大学,芝加哥,美国) Department of Urology, Northwestern University, Chicago, USA(泌尿科,西北大学,芝加哥,美国) Center for Cancer Research, National Cancer Institute, Bethesda, USA(癌症研究中心,国家癌症研究所,贝塞斯达,美国)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出一种多编码器U-Net架构,通过引入对齐损失、热图损失和置信度门控多头交叉注意力细化模块,提升前列腺病变分割的精度和多模态融合能力。

Comments Accepted to EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00198 2026-04-22 cs.CV 50%

Mammo-FM: Breast-specific foundational model for Integrated Mammographic Diagnosis, Prognosis, and Reporting

Mammo-FM:乳腺专用基础模型用于整合乳腺X线诊断、预后和报告

Shantanu Ghosh, Vedant Parthesh Joshi, Rayan Syed, Param Budhraja, Aya Kassem, Katelyn C. Morrison, Alex Tang, Ho Cheung Aiden Wong, Abhishek Varshney, Payel Basak, Weicheng Dai, Judy Wawira Gichoya, Hari M. Trivedi, Imon Banerjee, Shyam Visweswaran, Clare B. Poynton, Kayhan Batmanghelich

机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Department of Computer Science, Boston University(波士顿大学计算机科学系) Data Science, Analytics and Engineering, Arizona State University(亚利桑那州立大学数据科学与工程) Center for Regenerative Medicine, Boston University Medical Campus(波士顿大学医学校区再生医学中心) Department of Radiology, Emory University(埃默里大学放射科) Department of Radiology, Mayo Clinic(梅奥诊所放射科) Chobanian & Avedisian School of Medicine, Boston, MA, USA(波士顿大学医学学院) Department of Biomedical Informatics, University of Pittsburgh(匹兹堡大学生物医学信息学系) Department of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) Human-Computer Interaction, Carnegie Mellon University(卡内基梅隆大学人机交互)

专题命中 评测与基准 :foundation model(abstract)

AI总结 Mammo-FM是首个针对乳腺X线的专用基础模型,基于最大且多样化的数据集预训练,用于统一的乳腺影像核心临床任务,包括癌症诊断、病理定位、结构化报告生成和癌症风险预后。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 74 篇

2604.10401 2026-04-22 cs.CL 92%

NameBERT: Scaling Name-Based Nationality Classification with LLM-Augmented Open Academic Data

NameBERT: 通过LLM增强的开放学术数据扩展基于名称的国籍分类

Cong Ming, Ruixin Shi, Yifan Hu

机构 * Northeastern University, United States(美国东北大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出NameBERT,利用LLM增强开放学术数据构建大规模名称-国籍数据集,通过生成低资源国家名称提升分类性能,实现高效且准确的国籍分类。

Comments 12 pages, 3 figures, 8 tables; accepted at the 39th Canadian Conference on Artificial Intelligence (Canadian AI 2026)

Journal ref Proceedings of Machine Learning Research 318 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04445 2026-04-22 cs.NI cs.CL cs.PF 92%

Dynamic Model Routing and Cascading for Efficient LLM Inference: A Survey

动态模型路由与级联用于高效LLM推理:综述

Yasmin Moslem, John D. Kelleher

机构 * ADAPT Centre(ADAPT中心) School of Computer Science & Statistics(计算机科学与统计学学院) Trinity College Dublin(都柏林三一学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了多LLM路由与级联方法,分析了不同路由范式及关键权衡,提出框架揭示路由系统在决策时机、信息使用和计算方式上的特性,强调实际系统常整合多种范式以优化性能。

Comments Work funded by ADAPT Centre, Trinity College Dublin, and Huawei Ireland

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19241 2026-04-22 cs.DC 91%

UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training

UniEP:统一的专家并行MoE MegaKernel用于LLM训练

Size Zheng, Xuegui Zheng, Li-wen Chang, Jidong Zhai

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出UniEP,通过统一专家并行优化策略,将MoE通信与计算融合为MegaKernel,实现自动化适应性调整,提升LLM训练效率并保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18764 2026-04-22 cs.AR 91%

CHICO-Agent: An LLM Agent for the Cross-layer Optimization of 2.5D and 3D Chiplet-based Systems

CHICO-Agent:一种用于2.5D和3D芯片片上系统的跨层优化LLM代理

Qihang Wu, Aman Arora, Vidya A. Chhabria

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对2.5D/3D芯片片上系统设计复杂性问题,提出CHICO-Agent框架,通过LLM驱动优化,降低成本并提供可解释的审计跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18963 2026-04-22 cs.LG cs.AI 91%

Distillation Traps and Guards: A Calibration Knob for LLM Distillability

知识蒸馏陷阱与守护:一种用于LLM可蒸馏性的校准调节器

Weixiao Zhan, Yongcheng Jing, Leszek Rutkowski, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science(生成人工智能实验室,计算与数据科学学院) Nanyang Technological University(南洋理工大学) Systems Research Institute of the Polish Academy of Sciences(波兰科学院系统研究所) AGH University of Krakow(克拉科夫AGH大学) SAN University(SAN大学)

专题命中 效率与部署 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文分析了知识蒸馏中的陷阱,提出了一种后处理校准方法,通过强化学习微调控制教师模型的可蒸馏性,提升蒸馏效果和模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19167 2026-04-22 cs.LG cs.AI 91%

LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation

LBLLM:通过三阶段蒸馏实现大语言模型的轻量二值化

Siqing Song, Chuang Wang, Yong Lang, Yi Yang, Xu-Yao Zhang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 LBLLM通过三阶段蒸馏策略实现大语言模型的轻量二值化,采用W(1+1)A4量化方法,在单GPU上仅用0.016B tokens训练,超越现有二值化方法,在语言模型、常识问答和语言理解任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18697 2026-04-22 cs.CR cs.CL cs.LG 90%

Beyond Indistinguishability: Measuring Extraction Risk in LLM APIs

超越不可区分性:衡量LLM API中的提取风险

Ruixuan Liu, David Evans, Li Xiong

机构 * Emory University(埃默里大学) University of Virginia(弗吉尼亚大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出$(l, b)$-不可提取性作为衡量LLM API提取风险的新标准,通过定义提取风险上界并实验证明其在不同模型中的有效性,为模型训练、API访问和解码配置提供缓解指南。

Comments Accepted by S&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09775 2026-04-22 cs.AR cs.AI cs.DC cs.LG 90%

MIST: A Co-Design Framework for Heterogeneous, Multi-Stage LLM Inference

MIST:一种用于异构、多阶段LLM推理的联合设计框架

Abhimanyu Rajeshkumar Bambhaniya, Hanjiang Wu, Suvinay Subramanian, Sudarshan Srinivasan, Souvik Kundu, Amir Yazdanbakhsh, Midhilesh Elavazhagan, Madhu Kumar, Minlan Yu, Arijit Raychowdhury, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Google(谷歌) Intel(英特尔) Intel Labs(英特尔实验室) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学) Infravana

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 MIST是一种用于异构、多阶段LLM推理的联合设计框架,通过模拟不同请求阶段和复杂硬件层次,优化硬件-软件协同设计,解决LLM推理中的配置空间导航和跨厂商PD配置问题。

Comments Inference System Design for Multi-Stage AI Inference Pipelines. 11 Pages, 10 Figues, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19049 2026-04-22 cs.CR cs.AI cs.SE 90%

Refute-or-Promote: An Adversarial Stage-Gated Multi-Agent Review Methodology for High-Precision LLM-Assisted Defect Discovery

反驳或促进:一种对抗性阶段门多智能体评审方法,用于高精度LLM辅助缺陷发现

Abhinav Agarwal

机构 * OpenSSL

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Refute-or-Promote方法,通过对抗性阶段门多智能体评审,提高LLM辅助缺陷发现的精度,通过多种技术过滤虚假正例,最终发现多个漏洞并推动标准制定。

Comments 10 pages, 3 tables. Artifacts: https://github.com/abhinavagarwal07/refute-or-promote (Zenodo DOI: 10.5281/zenodo.19668799)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19299 2026-04-22 cs.CL cs.AI 90%

Rethinking Scale: Deployment Trade-offs of Small Language Models under Agent Paradigms

重新思考规模:在代理范式下小型语言模型的部署权衡

Xinlin Wang, Mats Brorsson

机构 * Proximus Luxembourg S.A.(普罗米修斯卢森堡股份有限公司) University of Luxembourg(卢森堡大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在代理范式下小型语言模型的部署权衡,通过对比基础模型、单代理工具系统和多代理协作系统,发现单代理系统在性能与成本间达到最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18146 2026-04-22 cs.IR cs.AI cs.CL 90%

Modular Representation Compression: Adapting LLMs for Efficient and Effective Recommendations

模块化表示压缩:适应LLM以实现高效且有效的推荐

Yunjia Xi, Menghui Zhu, Jianghao Lin, Bo Chen, Ruiming Tang, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah's Ark Lab(华为诺亚实验室) Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MARC方法,通过模块化调整和任务解耦,解决LLM表示压缩中的MRA问题,提升推荐系统效率与效果。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19398 2026-04-22 cs.AI 89%

GRASPrune: Global Gating for Budgeted Structured Pruning of Large Language Models

GRASPrune:基于预算的大型语言模型结构剪枝的全局门控

Ziyang Wang, Jiangfeng Xiao, Chuan Xiao, Ruoxiang Li, Rui Mao, Jianbin Qin

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen University(深圳大学) Osaka University(大阪大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 GRASPrune通过全局预算约束联合剪枝FFN通道和KV头部组,采用轻量门分数学习和投影直通估计器,在保持模型权重冻结的情况下实现高效剪枝,并通过校准缩放因子提升推理性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19342 2026-04-22 cs.CL 89%

Are Large Language Models Economically Viable for Industry Deployment?

大语言模型在工业部署中经济上可行吗?

Abdullah Mohammad, Sushant Kumar Ray, Pushkar Arora, Rafiq Ali, Ebad Shabbir, Gautam Siddharth Kashyap, Jiechao Gao, Usman Naseem

机构 * DSEU-Okhla University of Delhi(德里大学) Macquarie University(麦考瑞大学) Center for SDGC(SDGC研究中心) Stanford University(斯坦福大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出EDGE-EVAL框架,评估大语言模型在工业场景中的全生命周期性能,引入五个部署指标,揭示模型在经济性和能效上的效率前沿及异常现象。

Comments Accepted at ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18592 2026-04-22 cs.CL cs.AI 89%

Two-dimensional early exit optimisation of LLM inference

二维早退优化大语言模型推理

Jan Hůla, David Adamczyk, Tomáš Filip, Martin Pavlíček, Petr Sosík

机构 * Institute for Research and Applications of Fuzzy Modelling(模糊建模研究与应用研究所) University of Ostrava(奥斯特拉瓦大学) Institute of Computer Science(计算机科学研究所) Faculty of Philosophy and Science(哲学与科学学院) Silesian University in Opava(奥帕瓦西里西亚大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种二维早退策略,通过协调层间和句子间早退实现大语言模型分类任务的计算优化,实验表明在不同规模的LLM上能显著提升推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29078 2026-04-22 cs.CL cs.LG 89%

PolarQuant: Optimal Gaussian Weight Quantization via Hadamard Rotation for LLM Compression

PolarQuant:通过Hadamard旋转实现最优高斯权重量化用于LLM压缩

Caio Vicentino

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 PolarQuant通过Hadamard旋转实现高斯分布的权重量化,显著降低压缩后的语言模型 perplexity,达到近无损压缩效果,并提升后续INT4量化性能。

Comments Found some errors, I need to fix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09642 2026-04-22 cs.CL cs.AI 88%

MATA: Multi-Agent Framework for Reliable and Flexible Table Question Answering

MATA:用于可靠和灵活的表格问答的多智能体框架

Sieun Hyeon, Jusang Oh, Sunghwan Steve Cho, Jaeyoung Do

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 MATA通过多智能体框架和小语言模型工具,提升表格问答的可靠性与灵活性,实验显示其在不同LLM上均取得最佳准确率和高效推理。

Comments Accepted to ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07761 2026-04-22 cs.AI cs.LG 88%

TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards

TROJail: 多轮对话中针对大语言模型的多轮攻击优化

Xiqiao Xiong, Ouxiang Li, Zhuo Liu, Moxin Li, Wentao Shi, Fengbin Zhu, Qifan Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meta AI

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TROJail,通过多轮强化学习优化攻击策略,引入过程奖励提升攻击成功率,实验显示在多个模型和基准上效果显著。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18610 2026-04-22 cs.NE cs.AI 88%

SpikeMLLM: Spike-based Multimodal Large Language Models via Modality-Specific Temporal Scales and Temporal Compression

基于脉冲的多模态大语言模型:通过模态特定的时间尺度和时间压缩

Han Xu, Zhiyong Qin, Di Shang, Jiahong Zhang, Xuerui Qiu, Bo Lei, Tiejun Huang, Bo Xu, Guoqi Li

机构 * 1 Institute of Automation, Chinese Academy of Sciences 2 University of Chinese Academy of Sciences 3 Beijing Academy of Artificial Intelligence 4 Zhongguancun Academy 5 Peking University 6 Key Laboratory of Brain Cognition Brain-inspired Intelligence Technology 7 Spiking Intelligence Lab, Tianqiao \& Chrissy Chen Institute [0.5em] Equal contribution Corresponding authors

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出SpikeMLLM,首个基于脉冲的多模态大语言模型框架,通过模态特定时间尺度和时间压缩技术,在减少时间步数的同时保持高性能,实验显示其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19157 2026-04-22 cs.LG 87%

SAW-INT4: System-Aware 4-Bit KV-Cache Quantization for Real-World LLM Serving

SAW-INT4: 为现实世界LLM服务的系统感知4位KV缓存量化

Jinda Jia, Jisen Li, Zhongzhu Zhou, Jung Hwan Heo, Jue Wang, Tri Dao, Shuaiwen Leon Song, Ben Athiwaratkun, Chenfeng Xu, Tianyi Zhang, Xiaoxia Wu

机构 * Together AI

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出SAW-INT4方法,通过系统感知的4位KV缓存量化,在满足实际服务约束下实现高精度与高效率的平衡,恢复近全部精度损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18788 2026-04-22 cs.LG 87%

Efficient Mixture-of-Experts LLM Inference with Apple Silicon NPUs

高效混合专家LLM推理与Apple Silicon NPUs

Afsara Benazir, Felix Xiaozhu Lin

机构 * University of Virginia(弗吉尼亚大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出NPUMoE,通过将密集静态计算卸载到Apple Silicon NPUs,提升混合专家LLM推理效率,减少延迟、能耗和CPU使用率。

详情

展开后加载摘要…

URL PDF HTML 收藏