arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 507 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 110 篇

2603.11618 2026-03-17 cs.CV cs.LG 57%

Shape-of-You: Fused Gromov-Wasserstein Optimal Transport for Semantic Correspondence in-the-Wild

Shape-of-You: 基于融合Gromov-Wasserstein最优传输的语义对应研究

Jiin Im, Sisung Liu, Je Hyeong Hong

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出Shape-of-You框架,通过融合Gromov-Wasserstein优化传输解决语义对应问题,利用3D基础模型提升几何结构一致性,通过软目标损失增强鲁棒性,在SPair-71k和AP-10k数据集上取得新突破。

Comments Accepted at CVPR 2026. Supplementary material included after references. 18 pages, 11 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13686 2026-03-17 cs.SD cs.AI 57%

$τ$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains

$τ$-Voice:在真实领域上评估全双工语音代理的基准测试

Soham Ray, Keshav Dhandhania, Victor Barres, Karthik Narasimhan

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出$τ$-voice基准测试,评估语音代理在真实复杂任务中的表现,发现语音代理在清洁条件和嘈杂环境下任务完成率仅为31-51%和26-38%,远低于文本能力,表明代理行为是失败的主要原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13424 2026-03-17 cs.CR cs.AI 57%

Agent Privilege Separation in OpenClaw: A Structural Defense Against Prompt Injection

OpenClaw中代理特权分离:一种对抗提示注入的结构性防御

Darren Cheng, Wen-Kwang Tsao

机构 * TrendAI Lab(TrendAI实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出通过代理隔离和JSON格式化相结合的结构化防御机制,有效阻止提示注入攻击,在OpenClaw平台上实现零攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13233 2026-03-17 cs.HC cs.AI 57%

From Prompts to Worlds: How Users Iterate, Explore, and Make Sense of AI-Generated 3D Environments

从提示到世界:用户如何迭代、探索和理解AI生成的3D环境

Aung Pyae

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 研究探讨用户如何通过迭代和探索理解AI生成的3D环境,发现语言到空间表达的不对称性、沉浸感的间歇性以及结构迭代中的障碍,强调需要混合输入方式和透明反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15558 2026-03-17 cs.CV cs.RO 50%

Panoramic Affordance Prediction

全景 affordance 预测

Zixin Zhang, Chenfei Liao, Hongfei Zhang, Harold Haodong Chen, Kanghao Chen, Zichen Wen, Litao Guo, Bin Ren, Xu Zheng, Yinchuan Li, Xuming Hu, Nicu Sebe, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) MBZUAI(慕尼黑工业大学人工智能研究所) UniTrento(特伦特大学) Knowin

专题命中 评测与基准 :prompting(abstract)

AI总结 本文提出全景 affordance 预测,利用 360 度影像捕捉全局空间关系,通过 PAP-12K 数据集和 PAP 框架解决超高清影像的高分辨率和畸变问题,展现全景感知在具身智能中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15096 2026-03-17 cs.PL 50%

Generation of Programming Exam Question and Answer Using ChatGPT Based on Prompt Engineering

基于提示工程的编程考试题与答案生成

Jongwook Si, Sungyoung Kim

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出利用提示工程技术通过ChatGPT生成编程考试题及答案,涵盖理论与实践内容,提升评估效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14880 2026-03-17 cs.CV 50%

RealVLG-R1: A Large-Scale Real-World Visual-Language Grounding Benchmark for Robotic Perception and Manipulation

RealVLG-R1: 一个大规模真实世界视觉-语言接地基准,用于机器人感知与操作

Linfei Li, Lin Zhang, Ying Shen

机构 * School of Computer Science and Technology, Tongji University, China(同济大学计算机科学与技术学院)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出RealVLG框架,结合RealVLG-11B数据集和RealVLG-R1模型,统一了真实世界视觉-语言接地与抓取任务,支持零样本感知与操作,提供全面的数据与评估平台。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14701 2026-03-17 cs.CV 50%

AURORA-KITTI: Any-Weather Depth Completion and Denoising in the Wild

AURORA-KITTI: 任意天气下的深度补全与去噪

Yiting Wang, Tim Brödermann, Hamed Haghighi, Haonan Zhao, Christos Sakaridis, Kurt Debattista, Valentina Donzella

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出AURORA-KITTI,首个大规模多模态多天气基准,通过统一任务深度补全与去噪,在恶劣天气下实现鲁棒的深度重建,同时引入DDCD基线模型提升效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14401 2026-03-17 cs.RO cs.CV 50%

OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer

OCRA:基于3D和触觉先验的人到机器人动作迁移的物体中心学习

Kuanning Wang, Ke Fan, Yuqian Fu, Siyu Lin, Hu Luo, Daniel Seita, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

专题命中 评测与基准 :foundation model(abstract)

AI总结 OCRA通过结合3D和触觉先验,利用多视角视频和先进模型重建物体中心3D点云,生成稳健的机器人操作动作,实验表明其在视觉和视觉-触觉任务中优于现有方法。

Comments Project page: https://sressers.github.io/OCRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03125 2026-03-17 cs.CV 50%

AWDiff: An a trous wavelet diffusion model for lung ultrasound image synthesis

AWDiff:一种用于肺部超声图像合成的a trous小波扩散模型

Maryam Heidari, Nantheera Anantrasirichai, Steven Walker, Rahul Bhatnagar, Alin Achim

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出AWDiff模型,通过a trous小波变换与BioMedCLIP语义条件,提升肺部超声图像生成的结构精度与临床相关性。

Comments 5 pages5 pages, 4 figures. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09924 2026-03-17 cs.CV 50%

Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning

面向统一模型的基于推理的视频编辑:带有自我反思学习

Xinyu Liu, Hangjie Yuan, Yujie Wei, Jiazheng Xing, Yujin Han, Jiahao Pan, Yanbiao Ma, Chi-Min Chan, Kang Zhao, Shiwei Zhang, Wenhan Luo, Yike Guo

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出RVE任务,通过构建RVE-Bench基准,引入自反思学习框架ReViSE,提升视频编辑的准确性和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13437 2026-03-17 cs.CV eess.SP 50%

Vision-Language Based Expert Reporting for Painting Authentication and Defect Detection

基于视觉-语言的专家报告用于绘画认证和缺陷检测

Eman Ouda, Mohammed Salah, Arsenii O. Chulkov, Gianfranco Gargiulo, Gian Luca Tartaglia, Stefano Sfarra, Yusra Abdulrahman

机构 * organization= Khalifa University of Science Technology, Department of Aerospace Engineering , city= Abu Dhabi , country= United Arab Emirates organization= National Research Tomsk Polytechnic University , country= Russia organization= Academy of Fine Arts of Naples , city= Naples , country= Italy organization= Academy of Fine Arts of Sassari , city= Sassari , country= Italy organization= Department of Industrial Economics (DIIIE), University of L’Aquila , city= L'Aquila I-67100 , country= Italy organization= Advanced Research Innovation Center (ARIC), Khalifa University of Science \& Technology , city= Abu Dhabi , country= UAE

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出一种自动化的热成像-视觉-语言模型框架,用于绘画认证和缺陷检测,通过多模态分析与结构化文本报告生成,提高评估的可解释性和一致性。

Comments Submitted to Journal of Cultural Heritage

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13403 2026-03-17 cs.CV 50%

Diabetic Retinopathy Grading with CLIP-based Ranking-Aware Adaptation:A Comparative Study on Fundus Image

基于CLIP的排名感知适应的糖尿病视网膜病变分级:在视网膜图像上的比较研究

Sungjun Cho

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :prompting(abstract)

AI总结 本文比较了三种基于CLIP的方法用于五类糖尿病视网膜病变严重程度分级,提出排名感知模型在整体准确率和临床关键严重病例召回率上表现最佳,混合FCN-CLIP模型在检测增生性视网膜病变方面表现突出,均优于零样本基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13382 2026-03-17 cs.CV 50%

DINOv3 with Test-Time Calibration for Automated Carotid Intima-Media Thickness Measurement on CUBS v1

DINOv3结合测试时间校准用于CUBS v1上自动颈动脉内膜中层厚度测量

Zhenpeng Zhang, Jinwei Lu, Yurui Dong, Bo Yuan

机构 * School of Basic Medical Sciences, Fudan University, Shanghai 200032, China(复旦大学基础医学学院,上海,中国) Institute of Medical Genetics and Genomics, Fudan University, Shanghai 200032, China(复旦大学医学遗传与基因组学研究院,上海,中国) Fudan University, Shanghai, China(复旦大学,上海,中国)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出基于DINOv3的框架,用于颈动脉内膜中层复杂分割及后续CIMT测量,通过测试时间校准提升测量精度,实验结果显示其在CUBS v1数据集上具有较高的Dice和IoU指标,且误差范围在临床相关范围内。

Comments 9 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 96 篇

2505.20112 2026-03-17 cs.CL cs.AI 91%

ERC-SVD: Error-Controlled SVD for Large Language Model Compression

ERC-SVD: 基于误差控制的大型语言模型压缩SVD

Haolei Bai, Siyong Jian, Tuo Liang, Yu Yin, Huan Wang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 本文提出ERC-SVD方法,通过利用截断过程生成的残差矩阵减少截断损失,并选择性压缩模型最后一层以降低误差传播,从而提升压缩模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13765 2026-03-17 cs.CL cs.AI 91%

Knowledge Distillation for Large Language Models

为大型语言模型进行知识蒸馏

Alejandro Paredes La Torre, Barbara Flores, Diego Rodriguez

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);prompting(abstract)

AI总结 本文提出一种高效的压缩框架,结合引导的思维链强化学习,通过知识蒸馏和链式思维提示提升模型效率,实现更小规模的模型部署。

Comments Code and data are available at: https://github.com/AlejandroParedesLT/knowledge_distillLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13314 2026-03-17 cs.LG 90%

Linear Predictability of Attention Heads in Large Language Models

大语言模型中注意力头的线性可预测性

Khalid Shaikh, Asmit Kumar Singh, Rebecca Christopher Dsouza, Shikhar Shiromani

机构 * Georgia Institute of Technology(佐治亚理工学院) Santa Clara University(圣克拉拉大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 研究发现预训练Transformer中注意力头激活存在线性结构,通过少量参考头可高精度重建目标头,利用此特性可减少KV缓存并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13834 2026-03-17 cs.AI cs.LG 90%

Intelligent Materials Modelling: Large Language Models Versus Partial Least Squares Regression for Predicting Polysulfone Membrane Mechanical Performance

智能材料建模:大语言模型与偏最小二乘回归在预测聚砜膜机械性能中的比较

Dingding Cao, Mieow Kee Chan, Wan Sieng Yeo, Said Bey, Alberto Figoli

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了大语言模型与偏最小二乘回归在预测聚砜膜机械性能中的表现,发现大语言模型在非线性、约束敏感属性上表现更优,而偏最小二乘回归在需要可解释性分解的线性关系中仍具竞争力。

Comments 29 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23404 2026-03-17 cs.CL 89%

AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Models

AJF:基于黑盒大语言模型理解能力的自适应突破框架

Mingyu Yu, Wei Wang, Yanjie Wei, Sujuan Qin, Fei Gao, Wenmin Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出AJF框架,通过分析目标LLM的理解能力,针对不同类型的LLM采用不同的突破策略,实验显示在GPT-4o和GPT-4.1上攻击成功率分别达到98.9%和99.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13562 2026-03-17 cs.LG 89%

Scalable Classification of Course Information Sheets Using Large Language Models: A Reusable Institutional Method for Academic Quality Assurance

利用大语言模型实现课程信息表的可扩展分类:一种用于学术质量保证的可重用机构方法

Brecht Verbeken, Joke Van den Broeck, Inge De Cleyn, Steven Van Luchene, Nadine Engels, Andres Algaba, Vincent Ginis

机构 * Vrije Universiteit Brussel(布鲁塞尔自由大学) Harvard University(哈佛大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出一种利用大语言模型对课程信息表进行大规模分类的方法,通过迭代优化和多模型比较,实现了对课程评估风险的识别与验证,为学术质量保证提供了可重用的机构方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13313 2026-03-17 cs.RO 89%

MRPoS: Mixed Reality-Based Robot Navigation Interface Using Spatial Pointing and Speech with Large Language Model

基于混合现实的机器人导航接口:结合空间指针与语音及大语言模型

Eduardo Iglesius, Masato Kobayashi, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Kobe University(Kobe大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出MRPoS接口,利用空间指针和语音交互替代传统手势,提升机器人导航的直观性和效率,实验表明任务完成时间与工作负荷显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14745 2026-03-17 cs.LG 88%

CAMD: Coverage-Aware Multimodal Decoding for Efficient Reasoning of Multimodal Large Language Models

CAMD:面向多模态大语言模型高效推理的覆盖感知多模态解码

Huijie Guo, Jingyao Wang, Lingyu Si, Jiahuan Zhou, Changwen Zheng, Wenwen Qiang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出CAMD,通过动态分配计算资源提升多模态大语言模型的推理效率与可靠性,解决解码方法在易例和难例间的计算不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05385 2026-03-17 cs.CV 88%

ShaRP: SHAllow-LayeR Pruning for Efficient Video Large Language Models

ShaRP: 用于高效视频大语言模型的浅层层剪枝

Yingjie Xia, Tao Liu, Jinglei Shi, Qingsong Xie, Heng Guo, Jian Yang, Xi Wang

机构 * VCIP & TMCC & DISSec, College of Computer Science, Nankai University(VCIP与TMCC与DISSec学院,南开大学计算机科学学院) LIX, Ecole Polytechnique, IP Paris(LIX,巴黎高等理工学院,IP巴黎) OPPO Research Institute(OPPO研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出ShaRP框架,通过改进局部信息聚合、校准位置偏差和减少冗余,解决浅层解码器剪枝中的性能下降问题,实现97.2%的性能保留和86%的TFLOPs减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13776 2026-03-17 cs.IR cs.AI 87%

Retrieval-Feedback-Driven Distillation and Preference Alignment for Efficient LLM-based Query Expansion

检索-反馈驱动的蒸馏与偏好对齐用于高效的基于大语言模型的查询扩展

Minghan Li, Guodong Zhou

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出一种检索反馈驱动的蒸馏与偏好对齐框架,通过从强教师模型转移检索友好的扩展行为到紧凑的学生模型,以降低推理成本并提升检索效果。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13256 2026-03-17 cs.CL cs.AI cs.ET cs.MA 86%

Training-Free Agentic AI: Probabilistic Control and Coordination in Multi-Agent LLM Systems

无需训练的代理AI:多代理大语言模型系统的概率控制与协调

Mohammad Parsa Hosseini, Ankit Shah, Saiyra Qureshi, Alex Huang, Connie Miao, Wei Wei

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出REDEREF控制器,通过概率方法提升多代理LLM系统的路由效率与鲁棒性,减少资源消耗并提高任务成功率。

Comments under review, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14896 2026-03-17 cs.CL cs.AI 86%

Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs

量化与扩散大语言模型:对后训练量化在扩散大语言模型上的系统研究

Haokun Lin, Haobo Xu, Yichen Wu, Ziyu Guo, Renrui Zhang, Zhichao Lu, Ying Wei, Qingfu Zhang, Zhenan Sun

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统研究了扩散大语言模型的后训练量化,探讨了激活异常值对低比特量化的影响,并通过多维度评估提供了实用见解,为高效部署扩散大语言模型奠定基础。

Comments Published in Machine Intelligence Research, DOI: 10.1007/s11633-025-1624-x

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14283 2026-03-17 cs.CR cs.AI 85%

AEX: Non-Intrusive Multi-Hop Attestation and Provenance for LLM APIs

AEX:非侵入式多跳认证与溯源用于LLM API

Yongjie Guan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AEX为现有JSON基于LLM API提供非侵入式认证扩展,通过添加签名顶层认证对象,绑定客户端可见请求投影到完整响应或流式输出,支持真实部署并防止转换输出被误认为源流前缀。

Comments 29 pages total; 6 figures; 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14110 2026-03-17 cs.LG 85%

SVD Contextual Sparsity Predictors for Fast LLM Inference

基于SVD的上下文稀疏性预测器用于快速LLM推理

Georgii Serbin, Kirill Koshkin, Zhongao Sun, Anastasiya Bistrigova, C. C. Korikov

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种无需训练的快速稀疏模式预测方法,利用截断感知SVD和阈值校准算法,加速ReGLUFFN的LLM推理,实验显示在保持低精度损失下,解码时间减少1.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23586 2026-03-17 cs.SE cs.AI 85%

Reducing Cost of LLM Agents with Trajectory Reduction

通过轨迹缩减降低LLM代理的成本

Yuan-An Xiao, Pengfei Gao, Chao Peng, Yingfei Xiong

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AgentDiet方法,通过减少LLM代理轨迹中的冗余信息,降低计算成本,实验显示可减少输入token和总计算成本达39.9%-59.7%和21.1%-35.9%。

Comments 22 pages, 5 figures; accepted for FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15004 2026-03-17 cs.SE 85%

TriFusion-LLM: Prior-Guided Multimodal Fusion with LLM Arbitration for Fine-grained Code Clone Detection

TriFusion-LLM:基于LLM仲裁的先验引导多模态融合用于细粒度代码克隆检测

Mengdi Li, Yuming Liu, He Wang, Zifeng Xu, Yuqing Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TriFusion-LLM框架,结合传统机器学习的启发式相似性先验、AST结构信号和CodeBERT语义嵌入,提升细粒度代码克隆检测的分类性能,实验表明其在BigCloneBench上将Macro-F1提升至0.875。

详情

展开后加载摘要…

URL PDF HTML 收藏