arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-07 至 2026-07-07 共收录 710 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 50 篇

2607.02668 2026-07-07 cs.CL 新提交 70%

Improving LLMs via Validator-to-Generator Alignment

通过验证器与生成器对齐改进大语言模型

Juan Diego Rodriguez, Jocelyn Zhang, Katrin Erk, Greg Durrett

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Departments of Linguistics and Computer Science, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校语言学与计算机科学系) Department of Computer Science & Center for Data Science, New York University(纽约大学计算机科学系及数据科学中心)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型不一致问题,提出基于话语频率的生成器-验证器一致性新公式,介绍\FCPA方法,实验表明该方法能提升生成器性能及两者一致性,且保持验证器质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11475 2026-07-07 cs.LG cs.NI 版本更新 70%

Deep Learning Network-Temporal Models For Traffic Prediction

用于流量预测的深度学习网络-时间模型

Yufeng Xin, Ethan Fan

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对多元时间序列预测问题,提出拓扑感知学习框架,用图注意力模型捕捉相关性,评估微调大语言模型,引入聚类预处理,提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06577 2026-07-07 cs.CY cs.AI 版本更新 70%

Algorithmic Shortlisting in Participatory Budgeting

参与式预算中的算法入围

Juan Zambrano, Clément Contet, Jairo Gudiño-Rosero, Felipe Garrido-Lucero, Umberto Grandi, César Hidalgo

机构 * IRIT, Université Toulouse Capitole(IRIT,图卢兹Capitole大学) IRIT, Université de Toulouse(IRIT,图卢兹大学) Center for Collective Learning, IAST, Toulouse School of Economics(集体学习中心,IAST,图卢兹经济学院) Center for Collective Learning, CIAS, Corvinus University of Budapest(集体学习中心,CIAS,布达佩斯科文纽斯大学) AMBS, University of Manchester(AMBS,曼彻斯特大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究参与式预算中算法入围,设计并测试隐私保护算法,用项目特征和匿名历史投票数据预测可能获资助项目,指出朴素方法局限,提出投票管道使大语言模型与经典机器学习表现相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05149 2026-07-07 cs.SE 新提交 67%

Intent-Based Mutation Testing: From Naturally Written Programming Intents to Mutants

基于意图的变异测试:从自然编写的编程意图到变异体

Asma Hamidi, Ahmed Khanfir, Mike Papadakis

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 提出基于意图的变异测试,通过改变被测程序实现的编程意图来生成变异体,与传统测试不同,能捕获不同类型故障,用大语言模型实现并评估,可补充传统变异测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29429 2026-07-07 cs.CV 版本更新 67%

One Click per Cell Type Suffices: Training-free Group Interaction for Cell Instance Segmentation

每细胞类型一次点击足矣:无需训练的组交互用于细胞实例分割

Sanghyun Jo, Seo Jin Lee, Seohyung Hong, Yoorim Gang, Hyeongsub Kim, Hyungseok Seo, Kyungsu Kim

机构 * OGQ, Korea(韩国OGQ) Seoul National University, Korea(韩国首尔国立大学) LG CNS, Korea(韩国LG CNS)

专题命中 其他LLM :foundation model(abstract);prompting(abstract)

AI总结 提出组提示范式,通过每细胞类型一次点击即可分割所有该类型实例,基于SAM冻结编码器的特征聚类性质,设计无需训练的Chain-of-Prompts框架递归扩展点击,在多个基准上保持高性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04523 2026-07-07 cs.CL cs.AI 新提交 62%

Failures and Successes to Learn a Core Conceptual Distinction from the Statistics of Language

从语言统计中学习核心概念区分的失败与成功

Zhimin Hu, Jeroen van Paridon, Gary Lupyan

机构 * Department of Psychology, University of Wisconsin-Madison(威斯康星大学麦迪逊分校心理学系)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人们能否从语言中学习原则性与统计性属性的区分,发现语言模型对统计流行度敏感,但在表示该区分上有困难,GPT - 4成功做到。

Comments Published at Evolang XV, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02212 2026-07-07 cs.CL cs.AI q-bio.GN 版本更新 62%

Leveraging Natural Language Processing to Unravel the Mystery of Life: A Review of NLP Approaches in Genomics, Transcriptomics, and Proteomics

利用自然语言处理解开生命之谜:基因组学、转录组学和蛋白质组学中自然语言处理方法综述

Ella Rannon, David Burstein

机构 * The Shmunis School of Biomedicine and Cancer Research, George S. Wise Faculty of Life Sciences, Tel-Aviv University(谢蒙尼生物医学与癌症研究学院,乔治·S·威斯生命科学学院,特拉维夫大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI

AI总结 探讨自然语言处理方法在生物序列数据(基因组学、转录组学和蛋白质组学)中的应用,介绍从经典到先进模型的适配,分析分词策略与模型架构,提及生物数据应用进展及语言模型融入生物信息学的前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04708 2026-07-07 econ.TH cs.AI cs.CY cs.GT cs.HC 新提交 57%

Strategic Buying Agents

战略性购买智能体

Mingyang Fu, Ming Hu

机构 * Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 该研究面向自主代客购物场景,分三类信息场景设计有限购物窗口内的最优购买策略,经真实电商价格数据验证,大模型更适配场景选择而非直接购买决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03659 2026-07-07 cs.DB cs.AI 新提交 57%

A Fair Benchmarking of Deep Relational Database Learning Models

深度关系数据库学习模型的公平基准测试

Kazi F. Akhter, Bharath Ajendla, Manar D. Samad

机构 * Department of Computer Science(计算机科学系) Tennessee State University(田纳西州立大学) SAP AI Research and Innovation(SAP人工智能研究与创新) SAP Labs(SAP实验室)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI

AI总结 研究针对关系数据库深度学习方法实验协议不一致问题,通过在五个关系数据库上进行系统基准测试,重构模型确保实验一致性,发现关系变压器方法性能最佳,多表学习有优势但高跳数收益递减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00269 2026-07-07 cs.AI 新提交 57%

Mnemosyne: Agentic Transaction Processing for Validating and Repairing AI-generated Workflows

Mnemosyne: 用于验证和修复AI生成工作流的代理事务处理

Edward Y. Chang, Longling Geng, Emily J. Chang

机构 * Stanford University(斯坦福大学) QuadriumAI

专题命中 其他LLM :LLM(abstract_cn);分类 cs.AI

AI总结 提出代理事务处理(ATP)模型,将生成动作视为不可信提案,通过确定性约束集验证后才提交,并实现运行时修复,确保状态正确性独立于生成层。

Comments 41 pages, 25 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31399 2026-07-07 cs.AI 新提交 57%

World-Model Collapse as a Phase Transition

世界模型崩溃作为相变

Xinyuan Song, Zekun Cai

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 其他LLM :language agent(abstract);分类 cs.AI

AI总结 研究长时域语言代理隐式世界模型中的相变现象,通过确定性任务族的大规模网格搜索揭示从解决平台到崩溃的相图,并证明世界状态保真度先于动作有效性失效。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21534 2026-07-07 cs.AI 版本更新 57%

ARLArena: A Unified Framework for Stable Agentic Reinforcement Learning

ARLArena:用于稳定智能体强化学习的统一框架

Xiaoxuan Wang, Han Zhang, Haixin Wang, Yidan Shi, Ruoyan Li, Kaiqiao Han, Chenyi Tong, Haoran Deng, Renliang Sun, Alexander Taylor, Yanqiao Zhu, Jason Cong, Yizhou Sun, Wei Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 其他LLM :LLM(abstract);分类 cs.AI

AI总结 研究针对智能体强化学习不稳定问题,提出ARLArena框架。先构建测试平台,将策略梯度分解为四个维度分析,据此提出稳定的智能体策略优化方法SAMPO,实现稳定训练与良好性能。

Comments To appear at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00296 2026-07-07 cs.LG cs.CR 版本更新 57%

VLMGuard: Bootstrapping Malicious Prompt Detectors from Unlabeled Vision-Language Prompts in the Wild

VLMGuard:从野生未标记视觉语言提示中引导恶意提示检测器

Junlin Fang, Wenyu Chen, Reshmi Ghosh, Robert Sim, Ahmed Salem, Vitor R. Carvalho, Emily Lawton, Sharon Li, Jack W. Stokes, Sean Du

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) School of Physical and Mathematical Sciences(物理与数学科学学院) Microsoft Corp.(微软公司) Department of Computer Sciences(计算机科学系) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 研究针对视觉语言模型易受恶意输入影响的问题,提出VLMGuard框架,利用野生未标记用户提示,通过自动恶意估计分数区分良性和恶意样本,训练二进制提示分类器,无需额外人工标注,效果优于现有方法。

Comments Accepted to Transactions on Machine Learning Research (07/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09126 2026-07-07 cs.SE cs.LG 57%

Towards Trustworthy AI Software Development Assistance

迈向可信AI软件开发辅助

Daniel Maninger, Krishna Narasimhan, Mira Mezini

机构 * Technische Universität Darmstadt(德累斯顿技术大学) Hessian Center for Artificial Intelligence (hessian.AI)(黑森人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 其他LLM :LLM(abstract);分类 cs.LG

AI总结 本文提出可信AI软件开发助手的架构,通过基础LLM训练、图表示和模块化框架提升代码质量和安全性。

Comments 6 pages, 1 figure; to be published in New Ideas and Emerging Results (ICSE-NIER'24), April 14-20, 2024, Lisbon, Portugal; updated version to reflect the information provided by ACM

Journal ref NIER@ICSE (2024) 112-116

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05034 2026-07-07 cs.CY 新提交 50%

Understanding Student Perceptions, Mistakes, and Debugging Approaches when Solving Natural Language Programming Tasks

理解学生在解决自然语言编程任务时的认知、错误及调试方法

Victor-Alexandru Pădurean, Kaitlin Riegel, Gweneth Barbre, Musa Blake, Paul Denny, Alkis Gotovos, Juho Leinonen, Stephen MacNeil, James Prather, Adish Singla

专题命中 其他LLM :prompting(abstract)

AI总结 研究新手程序员解决自然语言编程任务时的提示错误、沟通问题及调试策略。通过分析超900名学生尝试解决基于对话的提示问题,发现提示更易且有趣,常见错误是遗漏关键细节,失败时注重澄清意图。

Comments ICER'26 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04761 2026-07-07 cs.CV 新提交 50%

DeGenseGS: Geometrically and Semantically Decoupled Surgical Scene Understanding in 4D Gaussian Splatting

DeGenseGS:4D高斯点云渲染中几何与语义解耦的手术场景理解

Yimo Wang, Bin Kang, Shuojue Yang, Yueming Jin

机构 * School of Automation, Southeast University(东南大学自动化学院) School of Internet of Things, Nanjing University of Posts and Telecommunications(南京邮电大学物联网学院) Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系)

专题命中 其他LLM :language model(abstract)

AI总结 研究针对自主手术交互中语义与解剖错位问题,提出DeGenseGS框架,独立建模语义演变与几何变形,用时空纠缠模块同步语义与场景动态,还设计机制确保鲁棒性,提升了手术场景理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04559 2026-07-07 cs.CV 新提交 50%

QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding

QSVideo:用于视频理解的查询条件语义时间检索

Wei Ao, Lan Wang, Vishnu Naresh Boddeti

机构 * Michigan State University(密歇根州立大学)

专题命中 其他LLM :language model(abstract)

AI总结 针对视频理解中视觉语言模型性能随视频时长下降问题,提出QSVideo框架,通过查询条件语义排序器、联合优化相关性和多样性及时间对齐策略,提升视频VLM性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04382 2026-07-07 cs.GT 新提交 50%

Beyond Self-Resolution: Settlement Factorization for Robust Natural Language Mechanism

超越自我解析:用于稳健自然语言机制的结算分解

Nicolas Della Penna

专题命中 其他LLM :language model(abstract)

AI总结 研究语言模型中介付费建议时的结算分解问题,核心方法是将报告硬化为官方记录等,主要贡献是得出类似揭示原理的结果,确定自身报告泄漏量是机制固有不变量等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03419 2026-07-07 cs.CY cs.SE 新提交 50%

Analyzing the Difficulty of Programming Assignments with Interpretable Knowledge Component Metrics

用可解释的知识组件指标分析编程作业的难度

Tsvetomila Mihaylova, Jing Fan, Bita Akram, Narges Norouzi, Peter Brusilovsky, Juho Leinonen, Arto Hellas

专题命中 其他LLM :LLM(abstract)

AI总结 研究如何用知识组件(KC)理解编程入门课程作业难度与学生学习困境,分析基于KC的指标,如作业KC数量及连续作业间KC覆盖变化,揭示相关规律并提出分析框架。

Comments Accepted to IEEE FIE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02949 2026-07-07 cs.SE 新提交 50%

BeSpec: Behavior-Level Specification Alignment for Code Generation

BeSpec:用于代码生成的行为级规范对齐

Qinghua Xu, Guancheng Wang, Boxi Yu, Lionel Briand

专题命中 其他LLM :LLM(abstract)

AI总结 研究针对代码生成中规范不匹配问题,提出基于行为模型的BeSpec方法,通过构建行为模型、生成候选程序并对比行为来对齐规范,在多基准测试中效果优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏