arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 730 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 730 篇

2606.12908 2026-06-12 cs.CL 新提交 79%

SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents

SENTINEL: 用于训练工具使用语言模型智能体的失败驱动强化学习

Ziyi Wang, Yuxuan Lu, Yimeng Zhang, Qun Liu, Chen Luo, Jiri Gesi, Hanqing Lu, Yisi Sang, Manling Li, Jing Huang, Dakuo Wang

机构 * Northeastern University(东北大学) Independent Researcher(独立研究员) Northwestern University(西北大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 提出SENTINEL框架,通过将智能体失败转化为针对性训练任务,在Tau2-Bench Retail上提升Qwen3-4B模型Pass@1从66.4到74.9,优于通用合成任务上的强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12609 2026-06-12 cs.LG q-bio.QM 新提交 79%

Viral Proteins Reveal Geometry of Protein Language Models

病毒蛋白质揭示蛋白质语言模型的几何结构

Arthur Bigot, Harmon Bhasin, Core Francisco Park, Eugene Shakhnovich, Dianzhuo Wang

机构 * University of Washington(华盛顿大学) DeepMind(深度思维)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 研究蛋白质语言模型在不平衡数据下对病毒蛋白的表示,发现嵌入空间中存在主导的“天然性”轴,该轴按模型困惑度排序序列,且缩放效果因病毒家族而异,但嵌入仍保留病毒特异性信号。

Comments Accepted at ICML 2026 GenBio Workshop and FM4LS Workshop. Code available at https://github.com/MisteFr/viral-proteins-plms

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06853 2026-06-08 cs.CV cs.AI 新提交 79%

MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

MotionEnhancer: 利用视频扩散模型增强运动感知的视觉-语言模型

Yifan Xu, Chao Zhang, Ruifei Ma, Fei Gao, Zhifei Yang, Jiaxing Qi, Zhipeng Chen

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Beijing Digital Native Digital City Research Center(北京数字原生数字城研究中心) School of Computer Science, Peking University(北京大学计算机学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 其他LLM :language model(title,abstract);分类 cs.AI

AI总结 提出MotionEnhancer,通过从视频扩散模型中提取运动先验并利用注意力对齐增强视觉-语言模型的运动理解能力,无需额外参数或架构修改,在运动级视频理解基准上取得一致提升。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27786 2026-06-29 cs.CL cs.AI 新提交 79%

SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in Retrieval-Augmented Generation

SHIFT: 门控调制激活引导用于检索增强生成中的知识冲突缓解

Ruochang Li, Pengcheng Huang, Zhenghao Liu, Yukun Yan, Huiyuan Xie, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,沈阳,中国) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,北京,中国)

专题命中 其他LLM :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出SHIFT框架,通过轻量级门控模块调节LLM内部激活,以自适应解决检索上下文与参数知识间的冲突,仅优化0.01%参数,在六个数据集上验证有效性。

Comments 19 pages, 13 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12155 2026-08-13 cs.CV 新提交 78%

Understanding Why Foundation Models Work for Diffusion-Generated Image Detection

探究基础模型为何适用于扩散生成图像检测

Davide Cozzolino, Giovanni Poggi, Luisa Verdoliva

机构 * University Federico II of Naples(那不勒斯费德里科二世大学)

专题命中 其他LLM :foundation model(title,abstract)

AI总结 本研究探究基础模型用于扩散生成图像检测的原因,通过DDIM反演、频率交换及潜在空间分析,发现其利用中低频分布差异实现检测,为该类方法的可解释性提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09919 2026-08-11 cs.SE 新提交 78%

Detecting Behavioral Changes in Python Refactoring Implementations with Foundation Models

用基础模型检测Python重构实现中的行为变化

Jonhnanthan Oliveira, Rohit Gheyi, Márcio Ribeiro, Alessandro Garcia

专题命中 其他LLM :foundation model(title,abstract)

AI总结 本研究提出基于基础模型Oracle的方法,通过分析git风格差异检测Python重构的行为变化,在Rope上评估发现13个bug,12个被接受,凸显需提升Python重构工具鲁棒性。

Comments Accepted at Brazilian Symposium on Software Engineering (SBES) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08366 2026-08-11 cs.CV q-bio.GN 新提交 78%

VOICE: A Vision-Omics Foundation Model Integrating Direct and Retrieval-Based Prediction of In-situ Single-Cell Gene Expression

VOICE:一种融合原位单细胞基因表达直接预测与基于检索预测的视觉-组学基础模型

Xin Luo, Yicheng Tao, Haoxuan Zeng, Suyuan Wang, Chenzi Ouyang, Meiqi Zhu, Kai Liu, Shuibing Chen, Jie Liu

机构 * University of Michigan(密歇根大学) Weill Cornell Medicine(威尔康奈尔医学院)

专题命中 其他LLM :foundation model(title,abstract)

AI总结 该研究提出多模态基础模型 VOICE,通过对比学习对齐 H&E 形态与单细胞表达嵌入,融合直接回归与参考检索分支,泛化性良好且在七项指标上优于现有方法,可从 H&E 图像预测单细胞基因表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06634 2026-08-10 cs.SD 新提交 78%

From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music

从提示到描述:针对AI生成音乐语言的跨文化研究

Sangheon Park, Claire Arthur

专题命中 其他LLM :prompting(title,abstract)

AI总结 该研究对比了TTM系统提示与音乐描述的语言差异,构建了音乐提示词汇分类法,发现提示与感知存在结构不对称,且不同文化背景的描述特征存在差异,引发对现有TTM系统文化适应性的思考。

Comments Accepted to the 27th International Society for Music Information Retrieval (ISMIR) Conference, 2026

Journal ref ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02401 2026-08-04 cs.CV 新提交 78%

USP-Mamba: Unmixing-Derived Spectral and Structural Prompting for Hyperspectral Image Super-Resolution

USP-Mamba:基于解混的光谱与结构提示的高光谱图像超分辨率方法

Shi Chen, Jie Zhang, Yicong Zhou

专题命中 其他LLM :prompting(title,abstract)

AI总结 本文针对现有Mamba模型用于高光谱图像超分辨率时破坏空间邻接性、未对齐图像固有特征的问题,提出USP-Mamba框架,通过解混光谱提示、结构提示及互补扫描,在多数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00726 2026-08-04 cs.CV 新提交 78%

Foveated Probes Recover Localized Binding Information in Vision Foundation Models

凹点探测法在视觉基础模型中恢复局部绑定信息

Mateusz Michalkiewicz, Mahsa Baktashmotlagh, Guha Balakrishnan

专题命中 其他LLM :foundation model(title,abstract)

AI总结 该研究通过对比全局读出、凹点读出和神谕读出,发现冻结视觉基础模型的空间盲性源于全局嵌入界面,而非 patch 标记缺乏空间信息,凹点读出可有效恢复局部绑定信息。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00235 2026-08-04 cs.CV 新提交 78%

Attention-Steered Vision-Language Models for Sign Language Translation

用于手语翻译的注意力引导视觉-语言模型

Meibo Hu, Guohao Sun, Annemarie D. Ross, Sheng Li, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) University of Virginia(弗吉尼亚大学) National Technical Institute for the Deaf(国家聋人技术学院)

专题命中 其他LLM :language model(title,abstract)

AI总结 针对视觉-语言模型在手语翻译中时空视觉定位差的问题,提出AttnSign框架,通过空间注意力监督和RL运动节奏引导提升性能,在How2Sign和OpenASL基准上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29086 2026-08-03 cs.SD 新提交 78%

Do Music Foundation Models Embed Pitch in Helical Structure?

音乐基础模型是否以螺旋结构嵌入音高?

Hayato Yagi, Shinnosuke Takamichi, Rin Sato, Keitaro Tanaka, Shigeo Morishima

专题命中 其他LLM :foundation model(title,abstract)

AI总结 该研究分析音乐基础模型的中间表征,发现其音高表征形成反映八度周期性的螺旋结构,且结构特征随模型和输入声学特性变化,为阐明模型内部机制提供新方法。

Comments Accepted by ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26288 2026-07-30 econ.EM 新提交 78%

The Innate Economic Preferences of Language Models

语言模型的固有经济偏好

Joy Buchanan, Joshua Foster

专题命中 其他LLM :language model(title,abstract)

AI总结 该研究揭示语言模型生成规则与离散选择随机效用模型同构,通过12种模型的投资组合任务发现其普遍存在异质风险厌恶,且微调可实现目标风险态度的工程化构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23884 2026-07-28 cs.MA 新提交 78%

A Comparative Study of MCP and A2A for Inter-Agent Coordination in LLM-Based Systems

基于大语言模型的系统中用于智能体间协调的MCP和A2A的比较研究

Ionut Predoaia, Tuong Manh Vu, Konstantinos Barmpis, Dimitris Kolovos, Antonio García-Domínguez

专题命中 其他LLM :LLM(title,abstract)

AI总结 本文从多智能体系统工程角度,以涉及基于大语言模型智能体的协调场景,比较MCP和A2A协议。针对多项要求评估同一软件工程任务的两种多智能体实现,发现MCP协调复杂度低,A2A支持更丰富,但都有特点,为智能体间协调协议设计提供了经验和权衡要点。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20768 2026-07-24 cs.CL cs.AI cs.LG 新提交 78%

Are Diversity Metrics Measuring Diversity? A Capability-Controlled Audit of Majority-Vote Gain in LLM Ensembles

多样性指标真的在衡量多样性吗?对大语言模型集成中多数投票增益的能力控制审计

Donghwan Kim

机构 * Aidentyx Inc.(艾登泰克斯公司)

专题命中 其他LLM :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 探讨大语言模型集成中多样性指标与多数投票增益的关系,在能力控制下审计五个多样性指标,发现潜在互补性普遍、指标与准确率共线且统计量不可分离,揭示了多样性指标在衡量多样性方面的问题及相关关联。

Comments 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19683 2026-07-23 cs.CR 新提交 78%

GhostPrompt: Cross-Image Adversarial Prompt for Vision-Language Models

GhostPrompt:视觉语言模型的跨图像对抗性提示

Li Zeng, Zeyu Ye, Meng Xie, Hangtao Zhang, Xianlong Wang, Yanchun Li, Zhetao Li

专题命中 其他LLM :language model(title,abstract)

AI总结 研究视觉语言模型对抗攻击问题,提出GhostPrompt方法,通过联合优化提炼图像不变对抗特征,跨图像引导模型输出,相比现有基线攻击成功率显著提高且计算时间大幅减少。

Comments Accepted to ACM MM 2026. Code: this https://github.com/Ye-ze-yu/GhostPrompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18711 2026-07-22 cs.SE 新提交 78%

LLM-Based Invariant Testing for Software Functional Bugs

基于大语言模型的软件功能缺陷不变式测试

Ruogu Yang, Yifeng He, Yundi Xu, Yuqing Wei, Hao Chen

专题命中 其他LLM :LLM(title,abstract)

AI总结 研究针对软件功能缺陷,提出基于大语言模型的LISA不变式测试框架,在API n-gram反馈指导下迭代生成API序列和程序不变式,相比其他方法有更高缺陷检测率和代码覆盖率,能为开发者提供高可信度缺陷候选。

Comments Accepted for publication at ISSRE 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17035 2026-07-21 cs.CR 新提交 78%

Federated Learning and LLM-Driven Threat Intelligence for Zero Trust IoT Architecture

用于零信任物联网架构的联邦学习和大语言模型驱动的威胁情报

Amal Alshehri, Cihan Tunc

专题命中 其他LLM :LLM(title,abstract)

AI总结 针对物联网安全隐私挑战,提出联邦学习和大语言模型驱动的零信任物联网架构,集成多种技术,通过特定方式在各通信层强化零信任,实验表明该框架能有效为资源受限物联网设备实现隐私保护异常检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14966 2026-07-17 cs.CV 新提交 78%

U-shaped Multi-granularity Learning for Vision-Language Models

用于视觉语言模型的U形多粒度学习

Biao Chen, Yunqian Yu, Xiangxu Zhao, Zhongshu Chen, Mengmeng Jing, Lin Zuo

机构 * University of Electronic Science and Technology of China(电子科技大学) Hithink Research(恒生电子股份有限公司)

专题命中 其他LLM :language model(title,abstract)

AI总结 研究视觉语言模型提示学习的粒度困境,提出U形多粒度提示学习框架UPrompt,通过构建并行多粒度表示及粗细粒度交互增强与监督,在多个基准实验中验证了其有效性和优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13149 2026-07-16 cs.CR 新提交 78%

Composable Trust for Language Models: A proven boundary and a measured defense

语言模型的可组合信任:一个经过验证的边界和一种可衡量的防御

Yakov Pyotr Shkolnikov

专题命中 其他LLM :language model(title,abstract)

AI总结 研究针对语言模型中不可信文本影响问题,开发基于来源可信度的信任模型,通过确定性管道和非模型监视器防御。经实验,钝化和级联提升真实泄漏防御率,自适应红队测试下边界成立,防御率稳定,还提高了事实归属率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12959 2026-07-15 cs.CV 新提交 78%

ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation Models

ViCo3D:利用视觉基础模型增强基于激光雷达的协作式3D目标检测

Haojie Ren, Songrui Luo, Lingfeng Wang, Yan Xia, Yao Li, Jing Li, Lu Zhang, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他LLM :foundation model(title,abstract)

AI总结 研究针对V2X系统中基于激光雷达协作式3D感知的不足,提出ViCo3D框架。通过将点云投影为图像让VFM提取特征,引入融合模块及跨智能体融合策略,实现了先进的3D检测性能,提升了协作增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10932 2026-07-14 stat.AP 新提交 78%

LLM-Enhanced Dynamic Financial Knowledge Graphs for Cross-Entity Signal Propagation and alpha discovery

用于跨实体信号传播和阿尔法发现的大语言模型增强动态金融知识图谱

Lin Zhang

专题命中 其他LLM :LLM(title,abstract)

AI总结 研究针对传统金融NLP忽略跨实体信息扩散问题,开发基于大语言模型的金融测量和信号传播框架,构建动态金融知识图谱,通过社区感知机制传播信号,引入新金融信号及测试,实验表明该框架能准确恢复网络结构等,有增量预测能力。

Comments 36 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10794 2026-07-14 cs.CR 新提交 78%

Can Watermarking Techniques Help Prevent LLM Model Stealing?

水印技术能帮助防止大语言模型被盗用吗?

Elette Boyle, MohammadTaghi Hajiaghayi, Keivan Rezaei, Suho Shin, Amos Stern

专题命中 其他LLM :LLM(title);language model(abstract)

AI总结 研究模型窃取攻击,提出受水印技术启发的防御方法,通过扰动对数its层防止攻击,经实证实验验证防御有效性,在保留模型效用的同时有效抵御攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10329 2026-07-14 cs.CV 新提交 78%

Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection

用于隐私保护的针对视觉语言模型的不可察觉且可逆的对抗性示例

Qi Lu, Ziqi Zhou, Yufei Song, Zijing Li, Lulu Xue, Minghui Li, Shengshan Hu, Leo Yu Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间安全学院) College of Computer Science, Chongqing University(重庆大学计算机科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 其他LLM :language model(title,abstract)

AI总结 研究针对视觉语言模型基于文本的隐私攻击问题,提出CloakDiff框架,结合扩散对抗编辑与可逆网络生成不可察觉的对抗性示例,设计EDM启发式采样提高保真度,实验证明该框架能实现多模态隐私保护且具高视觉质量和可逆性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10269 2026-07-14 cs.CR 新提交 78%

Devil in the Lens: Analyzing and Defending Physical Prompt Injection Against Vision-Language Models on Wearable Devices

镜头中的恶魔:分析并防御可穿戴设备上针对视觉语言模型的物理提示注入

Yaxin Li, Hao Wang, Yanda Shao, Shuhao Zhang, Yan Long

专题命中 其他LLM :language model(title,abstract)

AI总结 研究针对可穿戴设备上视觉语言模型的物理提示注入攻击,利用真实环境照片分析出6种威胁向量及对12个模型的影响,攻击成功率高,还提出基于掩码的外部过滤器和基于语义向量的内部检测器两种防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09225 2026-07-13 cs.CV 新提交 78%

Glob3R: Global Structure-from-Motion with 3D Foundation Models

Glob3R:基于3D基础模型的全局运动恢复结构

Junyuan Deng, Heng Li, Kejie Qiu, Lingteng Qiu, Rui Peng, Weichao Shen, Weihao Yuan, Siyu Zhu, Zilong Dong, Ping Tan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Nanjing University(南京大学) Fudan University(复旦大学)

专题命中 其他LLM :foundation model(title,abstract)

AI总结 研究针对3D基础模型重建结果不准确及处理长序列或大图像集有缺陷的问题,提出Glob3R方法,通过增强主干、转换扭曲为特征轨迹、引入关联策略及进行全局优化等,实现强大准确重建,提升神经渲染质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07430 2026-07-09 cs.RO cs.SY eess.SY 新提交 78%

Immersive Social Interaction with VR and LLM-Assisted Humanoids

通过虚拟现实和大语言模型辅助的人形机器人实现沉浸式社交互动

Niraj Pudasaini, Geeta Chandra Raju Bethala, Pranav Doma, Anthony Tzes, Yi Fang

机构 * Inspire Robotics(Inspire机器人公司)

专题命中 其他LLM :LLM(title,abstract)

AI总结 研究通过集成语音控制移动、VR操作和双向社交互动的框架实现人形机器人全身控制,利用苹果视觉专业版等,经大语言模型辅助语音控制等技术,在宇树H1人形机器人上评估,新手操作成功率可观,证明该方式在多方面应用的潜力。

Comments IEEE-RAS International Conference on Humanoid Robots - Workshop: Designing Interactive Humanoids

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03209 2026-07-07 cs.CV cs.GR cs.RO 新提交 78%

Fast 3D Foundation Model Initialized Gaussian Splatting

快速3D基础模型初始化高斯点云渲染

Anurag Dalal, Daniel Hagen, Kjell G. Robbersmyr, Kristian Muri Knausgård

机构 * Aust-Agder utviklings- og kompetansefond (AAUKF)(奥斯特-阿格德尔发展与能力基金)

专题命中 其他LLM :foundation model(title,abstract)

AI总结 介绍一种无需传统运动结构方法的高质量3D高斯点云重建快速方法,利用3D基础模型初始化相机姿态和点云,通过深度引导损失函数联合优化,提升稀疏视图重建质量,减少训练时间。

Comments 8 pages, 5 figures, 5 tables. Accepted at ICECET 2026

Journal ref 2026 6th International Conference on Electrical, Computer and Energy Technologies (ICECET), Rome, Italy, July 6-9, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31471 2026-07-01 cs.CV 新提交 78%

Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs

边建图边思考:用于增量式3D场景图的异步视觉-语言智能体

Deniz Bickici, Michael Pabst, Shohei Mori, Dieter Schmalstieg

机构 * University of Stuttgart(斯图加特大学) Graz University of Technology(格拉茨技术大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院)

专题命中 其他LLM :language agent(title);language model(abstract)

AI总结 提出异步架构,轻量在线建图与重型语义精化并发运行,通过语义闭环、属性标注和空间关系推导,实现探索时可查询且语义渐增的3D场景图,在多个基准上超越现有方法。

Comments Accepted to ECCV 2026. Project page: https://denizbickici.github.io/thinkgraphs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26626 2026-06-26 cs.HC 新提交 78%

Reviving Reflection-in-Action: Instilling Designerly Thinking in AI-Supported Ideation through Multimodal Prompting

复兴反思行动:通过多模态提示在AI支持的构思中注入设计思维

Samangi Wadinambiarachchi, Jenny Waycott, Greg Wadley

专题命中 其他LLM :prompting(title,abstract)

AI总结 针对当前AI创造力支持工具主要依赖文本提示的局限,提出SketchifAI原型,通过多模态输入(文本、草图、草图加标签)增强设计学生的表达意图、创造力支持和发散思维,发现草图模态提升流畅性但用户偏好文本,探讨如何通过草图反思保留设计技能。

Comments ACM Creativity and Cognition 2026 conference (C&C'26)

详情

展开后加载摘要…

URL PDF HTML 收藏