arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 778 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 54 篇

2606.21619 2026-06-23 cs.SE cs.LG cs.PL 新提交 77%

The Alignment Problem in Constrained Code Generation

约束代码生成中的对齐问题

Matteo Biagiola, Jahrim Gabriele Cesario, Luca Di Grazia, George Zakhour, Guido Salvaneschi

机构 * University of St. Gallen(圣加尔登大学) Università della Svizzera italiana (USI)(瑞士联邦理工学院)

专题命中 其他LLM :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究约束解码中约束器、语言模型与目标语言之间的对齐问题,发现约束器的不完整性会扭曲模型分布,导致功能正确性下降高达97%,并提出设计约束器的定量见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20946 2026-06-23 cs.CL cs.CV 新提交 77%

Scaling Diverse Language Generation for 3D Visual Grounding

面向3D视觉定位的多样化语言生成扩展

Austin T. Wang, Dongchen Yang, Angel X. Chang

机构 * Simon Fraser University(西蒙菲莎大学)

专题命中 其他LLM :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 提出ViGiL3D++方法,通过场景图约束采样与LLM语言生成结合,生成多样化视觉定位查询,提升3DVG模型泛化能力并揭示VLM局限性。

Comments 39 pages, 14 figures, 16 tables. Project Page: https://3dlg-hcvc.github.io/vigil3dpp

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20595 2026-06-23 cs.HC 新提交 75%

Hybrid Intelligence in Cartoon Captioning: Evaluating AI as a Creative Writing Partner

卡通字幕中的混合智能:评估AI作为创意写作伙伴

Uğur Önal, Sanem Sariel, Metin Sezgin, Derya Akleman, Ergun Akleman

专题命中 其他LLM :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过GPT-4o为IEEE计算机杂志卡通生成字幕,评估AI在幽默创作中的表现,发现AI能提供创意但需人类把控,建议作为辅助工具。

Comments 12 pages, 8 Figures, Accepted to AI Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22550 2026-06-23 cs.CV cs.AI cs.CL cs.MM 新提交 73%

Training-Free Semantic Correction for Autoregressive Visual Models

自回归视觉模型的免训练语义校正

Junhao Chen, Chanyu Zhu, Zheqi Lv, Keting Yin, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Shandong University(山东大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Gazer框架,通过多模态大语言模型反馈在自回归视觉模型采样循环中进行语义诊断与校正,无需额外训练即可提升语义对齐和组合准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20600 2026-06-23 cs.AI cs.LG 新提交 73%

The New Associationism: Lessons from Deep Learning

新联想主义:来自深度学习的启示

Daniel Rothschild

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文论证现代AI的成功支持一种温和但真实的联想主义,认为监督学习作为统一、渐进、错误驱动的学习机制,在深度学习中广泛适用,并反驳了联想主义机制不足以解释人类认知能力的观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22483 2026-06-23 cs.LG cs.AI 版本更新 73%

OFMU: Optimization-Driven Framework for Machine Unlearning

OFMU:面向机器遗忘的优化驱动框架

Sadia Asif, Mohammad Mohammadi Amiri

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出OFMU,一种基于惩罚的双层优化框架,通过层次结构优先遗忘并保持保留性能,在视觉和语言基准上优于现有方法。

Comments Under review at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20991 2026-06-23 cs.ET cs.AI 新提交 70%

Text-to-Image Generative AI for Modeling and Simulation: Methods, Opportunities, and Applications

面向建模与仿真的文本到图像生成式人工智能:方法、机遇与应用

Philippe J. Giabbanelli

机构 * National Center for Collaboration in Medical Modeling & Simulation and Office of Enterprise Research & Innovation(医学建模与模拟协作国家中心和企业研究与创新办公室)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本教程介绍文本到图像生成技术如何支持建模与仿真的多个任务,包括概念模型沟通、仿真结果可视化、教育材料生成及多尺度仿真中的异构模型接口,并提供实用工作流。

Comments To appear at the 2026 Winter Simulation Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20717 2026-06-23 cs.CV cs.AI cs.CR 新提交 70%

MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents

MIRAGE: 针对Web代理的隐蔽视觉提示注入漏洞检测

Xuelong Dai, Jianyu Ma, Boyang Ma, Biwei Yan, Yijun Yang, Yue Zhang

机构 * SDU(山东大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MIRAGE框架,利用扩散模型在受限区域生成视觉上无害的对抗图像,实现针对多模态大模型Web代理的隐蔽间接提示注入攻击,以检测其视觉漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23464 2026-06-23 cs.SE cs.CR 新提交 67%

An Automated Framework for Input Alphabet Construction in Stateful Protocol Implementation Learning

有状态协议实现学习中的输入字母表自动构建框架

JiongHan Wang, WenChao Huang

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 提出利用大语言模型自动解析协议消息布局并生成候选输入符号,结合小批量增量学习策略重用已学自动机,以解决手工构建输入字母表导致的探索不完整和语义缺陷问题。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23679 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 62%

Semantic Browsing: Controllable Diversity for Image Generation

语义浏览:图像生成的可控多样性

Sara Dorfman, Maya Vishnevsky, Omer Dahary, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对文本到图像模型生成多样性不足且缺乏语义结构的问题,提出一种在文本层面引入多样性的方法,通过视觉语言模型和代理工作流实现用户可导航的语义变化空间。

Comments ECCV 2026. Project page: https://saradorfman1.github.io/SemanticBrowsing-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22769 2026-06-23 cs.LG cs.AI 新提交 62%

Noise is Signal: Density-Based Outliers as Leading Indicators of Occupational Emergence in Labor Market Text

噪声即信号:基于密度的异常值作为劳动力市场文本中职业涌现的领先指标

Shreyash Rawat

机构 * Independent Researcher(独立研究员)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出涌现-密度反转假设,证明低密度异常值预示新职业涌现,通过时序分析验证并改进涌现职业评分,预测准确率从F1=0.61提升至0.74。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21718 2026-06-23 cs.CL cs.LG 新提交 62%

Leveraging LaBSE with Progressive Curriculum Learning for Multicultural Polarization

利用LaBSE与渐进式课程学习进行多元文化极化检测

Sachin Sundar, Sandeep Kumar, Mothish M

机构 * Indian Institute of Technology, Kharagpur(印度理工学院卡哈拉格普尔分校) Indian Institute of Technology, Madras(印度理工学院马德拉斯分校)

专题命中 其他LLM :prompting(abstract);分类 cs.CL、cs.LG

AI总结 提出基于LaBSE嵌入和渐进式课程学习的架构,解决多语言低资源环境下的在线极化检测,在低资源语言上提升macro F1达0.2。

Comments Accepted at Semeval, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18057 2026-06-23 cs.HC cs.AI cs.CL cs.CY cs.SI 新提交 62%

When AI Says "I have been in similar situations": Synthetic Lived Experience in Peer-Like Caregiver Support

当AI说“我也有过类似经历”:同伴式照护支持中的合成生活经验

Drishti Goel, Agam Goyal, Veda Duddu, Olivia Pal, Violeta J. Rodriguez, Daniel S. Brown, Ravi Karkar, Dong Whi Yoo, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究AI在同伴支持中生成“合成生活经验”的悖论,通过分析人类与AI在阿尔茨海默病照护社区中的叙事差异,揭示AI虽能模拟情感支持但缺乏真实经历,需建立机制区分支持性语言与虚构经历。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18106 2026-06-23 math.OC cs.AI cs.LG stat.ML 版本更新 62%

Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers

优化器设计的对称性兼容原理:嵌入、LM头、SwiGLU MLP和MoE路由器

Tim Tsz-Kit Lau, Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学) Wharton School(沃顿商学院)

专题命中 其他LLM :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现代神经网络参数空间的对称性与坐标级优化器之间的几何不匹配,提出对称性兼容的优化器设计原则,并针对嵌入矩阵、LM头、SwiGLU MLP投影和MoE路由器等特殊参数块导出相应更新规则,实验证明其改善验证损失、负载平衡和训练稳定性。

Comments Corrected typos and updated the list of references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14240 2026-06-23 cs.LG cs.AI 交叉投稿 62%

Paraphrasing Attack Resilience of Various AI-Generated Text Detection Methods

各种AI生成文本检测方法的改写攻击鲁棒性研究

Andrii Shportko, Inessa Verbitsky

机构 * Northwestern University(西北大学)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文评估了三种AI生成文本检测方法的改写攻击鲁棒性,发现Binoculars集成方法性能最强但攻击损失最严重,揭示了文本检测领域性能与鲁棒性之间的矛盾。

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00509 2026-06-23 cs.LG cs.AI math.OC stat.ML 62%

Functional multi-armed bandit and the best function identification problems

函数多臂老虎机与最佳函数识别问题

Yuriy Dorn, Aleksandr Katrutsa, Ilgam Latypov, Anastasiia Soboleva

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学) Moscow Institute of Physics and Technology(莫斯科物理技术学院) Skoltech(斯克里普切尔技术学院) Avito Moscow, Russia(莫斯科,俄罗斯)

专题命中 其他LLM :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出函数多臂老虎机问题和最佳函数识别问题,通过非线性优化算法构建F-LCB算法,提供 regret 上界并展示实验结果。

Journal ref Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02469 2026-06-23 cs.RO cs.AI cs.CL cs.CV 版本更新 62%

SIMSplat: Language-Aligned 4D Gaussian Splatting for Driving Scenario Generation

SIMSplat: 面向驾驶场景生成的语言对齐4D高斯泼溅

Sung-Yeon Park, Adam Lee, Juanwu Lu, Can Cui, Luyang Jiang, Rohit Gupta, Kyungtae Han, Ahmadreza Moradipari, Ziran Wang

机构 * Purdue University(普渡大学) University of California, Berkeley(加州大学伯克利分校) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SIMSplat,一种基于场景图的4D高斯泼溅框架,通过嵌入语言对齐特征实现自由文本查询、对象级编辑和多智能体仿真,在驾驶场景生成中显著提升定位精度和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22768 2026-06-23 cs.LG cs.DC 新提交 57%

Factored Gossip DiLoCo: Reducing Blocking Communication in DiLoCo

因式化Gossip DiLoCo:减少DiLoCo中的阻塞通信

Chamin Hewa Koneputugodage, Thalaiyasingam Ajanthan, Sameera Ramasinghe, Hadi Mohaghegh Dolatabadi, Shamane Siriwardhana, Gil Avraham, Violetta Shevchenko, Karol Pajak, James Snewin, Alexander Long

机构 * Pluralis Research

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 提出因式化Gossip DiLoCo,通过非阻塞混合与阻塞混合分解同步,在低带宽环境下提升计算利用率并保持优化稳定性。

Comments Accepted at ICML 2026. 29 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21077 2026-06-23 cs.CR cs.CL 新提交 57%

OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

OTTER:一种用于规避毒性检测的越狱提示优化的红队系统

Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai, Nai-Chia Chen, Fang Yu

机构 * National Chengchi University, Taipei, Taiwan(国立中正大学,台北,台湾) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.CL

AI总结 提出OTTER系统,通过替换少量令牌解耦表面毒性与对抗意图,在四个GPT模型上将平均攻击成功率从7.0%提升至84.0%,并首次量化分析毒性-绕过关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20711 2026-06-23 cs.CV cs.AI 新提交 57%

Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit

Video2Code: 通过动作感知重访从UI视频生成交互式网页

Mingde Xu, Zhen Yang, Yan Wang, Yu Wang, Xijun Liu, Zijun Dou, Wenyi Hong, Xiaotao Gu, Bin Xu, Jie Tang

机构 * University of Waterloo(滑铁卢大学) Tsinghua University(清华大学) Zhipu AI(智谱AI) Beihang University(北京航空航天大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 提出Video2Code方法,通过动作感知重访UI视频中的关键区域,恢复可执行的状态转换,生成HTML/CSS/JavaScript代码,提升多步交互的代码功能正确性。

Comments 31 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24370 2026-06-23 cs.LG q-bio.QM 版本更新 57%

GEESE: Genotype-aware End-to-End Spatio-temporal Embedding for Behavioral Phenotyping

GEESE: 基因型感知的端到端时空嵌入用于行为表型分析

Yiran Ding, Yuen Gao, Chunqi Qian, Zijun Cui

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Radiology(放射学系)

专题命中 其他LLM :foundation model(abstract);分类 cs.LG

AI总结 提出GEESE框架,利用预训练时间序列基础模型从3D姿态动力学中直接学习行为表征,无需手工特征,在三个自闭症相关基因模型上超越传统方法,并开发了交互式工具HONK。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08262 2026-06-23 cs.RO cs.AI cs.CV 版本更新 57%

CLAR: Learning 3D Representations for Robotic Manipulation by Fusing Masked Reconstruction with Multi-Level Contrastive Alignment

CLAR: 通过融合掩码重建与多层级对比对齐学习用于机器人操作的3D表示

Wenbo Cui, Chengyang Zhao, Yuhui Chen, Haoran Li, Zhizheng Zhang, Dongbin Zhao, He Wang

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carnegie Mellon University(卡内基梅隆大学) Galbot CFCS, School of Computer Science, Peking University(北京大学计算机科学与技术学院CFCS)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI

AI总结 提出CLAR框架,融合掩码自编码与全局跨模态对比学习,并引入基于可变形注意力的局部自适应对齐机制,解决3D预训练中空间几何与语义细节的权衡问题,在视觉运动策略学习中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17789 2026-06-23 cs.CL 版本更新 57%

Multilingual Tokenization through the Lens of Indian Languages: Challenges and Insights

通过印度语言的视角看多语言分词:挑战与洞见

Maharaj Brahma, N J Karthika, Rajat Verma, Nagasai Saketh Naidu, Rohit Saluja, Maunendra Sankar Desarkar, Ganesh Ramakrishnan

机构 * Department of CSE, Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校计算机科学与工程系) Department of CSE, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) SCEE, Indian Institute of Technology Mandi(印度理工学院曼迪分校软件工程系) Adobe Research(Adobe研究)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 本研究针对17种印度语言,系统评估了子词算法、标准化方法、词汇量及词汇构建策略对多语言分词的影响,发现脚本特定标准化、Unigram LM保留形态边界及聚类词汇构建可提升性能。

Comments Accepted at ACL 2026 (Findings - Long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03579 2026-06-23 cs.RO cs.LG 版本更新 57%

Intent-Handover: Grounding Language in Human-Usage Regions for Trustworthy Robot-to-Human Handovers

Intent-Handover:在人类使用区域中接地语言以实现可信的机器人到人交接

Hanxin Zhang, Abdulqader Dhafer, Hongbiao Dong, Zhou Daniel Hao

机构 * DANiLab, University of Leicester(莱斯特大学DANiLab) University of Leicester(莱斯特大学) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) School of Metallurgy and Materials, University of Birmingham(伯明翰大学冶金与材料学院)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 提出Intent-Handover方法,通过视觉语言模型识别目标物体和人类使用区域,结合抓取优化和人体姿态跟踪,实现安全、可信的机器人到人物体交接。

Comments Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23593 2026-06-23 cs.RO cs.CV 新提交 50%

Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery

机器人辅助手术中的实时多模态活动感知错误检测

Seyed Hamid Reza Roodabeh, Zongyu Li, Homa Alemzadeh

机构 * University of Virginia(弗吉尼亚大学)

专题命中 其他LLM :prompting(abstract)

AI总结 提出统一框架,利用视频、运动学数据和文本提示等多模态输入,通过活动提示和活动感知视觉嵌入,在JIGSAWS和SAR-RARP50数据集上分别提升F1分数达5%和16.6%。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22214 2026-06-23 cs.CR 新提交 50%

TRACE: A Threat Modelling Methodology for Distributed, Cloud-First, and Decentralized Organisations

TRACE:面向分布式、云优先和去中心化组织的威胁建模方法

Stefan Beyer

专题命中 其他LLM :language model(abstract)

AI总结 提出TRACE方法,通过三层模型(协议、系统、组织)和证据链,解决现有威胁建模在云优先、去中心化场景下对授权恶意行为、共谋等风险的遗漏问题。

Comments 12 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09717 2026-06-23 cs.SD eess.AS 新提交 50%

What Makes Synthetic Speech Sound Sarcastic? A Prosody-Controlled Perception Study

什么让合成语音听起来讽刺?一项韵律控制的感知研究

Zhu Li, Shekhar Nayak, Matt Coler

机构 * University of Groningen(格罗宁根大学)

专题命中 其他LLM :foundation model(abstract)

AI总结 通过可控神经TTS系统操纵语速、音高变化和响度,发现响度主要驱动人类对讽刺的感知,而模型更依赖语速,揭示了韵律线索权重差异。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05390 2026-06-23 cs.MA 50%

Ahoy: LLMs Enacting Multiagent Interaction Protocols

Ahoy: 大型语言模型执行多智能体交互协议

Omkar J. Joshi, Munindar P. Singh, Amit K. Chopra

专题命中 其他LLM :LLM(abstract)

AI总结 提出Ahoy方法,利用大型语言模型创建无需编程的智能体,使其能够动态选择并执行声明性协议以实现用户目标,无需专门训练即可正确、智能地执行多种协议。

Comments Presented at EMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏