arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-31 至 2026-07-31 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 28 篇

2607.27579 2026-07-31 cs.AI 新提交 92%

From Minds to Models: The Intersection of Psychology and LLM Behaviours

从心智到模型:心理学与大语言模型(LLM)行为的交叉

Oliver Guidetti, Reza Ryan

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究结合心理学方法,测试ChatGPT等LLM的情感差异,发现种族条件的情感效应薄弱且依赖分析方法,提出需跨学科开发模型偏差的行为测量方法。

Comments 32 pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24797 2026-07-31 q-bio.NC cs.AI cs.CL cs.LG 版本更新 91%

Reading Without a Reader: Large Language Models Collapse Reading and Writing into a Single Entangled Code

无需读者的阅读:大语言模型将阅读和写作合并为一个纠缠的代码

Diego Saldaña Ulloa

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型中阅读和写作代码的纠缠情况,通过纠缠指数比较输入输出代码,发现权重上未绑定模型有耦合代码,行为上理解与生成正耦合,此耦合普遍,贡献是量化及跨层一致性,定位LLMs为独特思维点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27373 2026-07-31 cs.CR cs.AI 新提交 91%

RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation

RoguePrompt:用于自重构以规避大型语言模型(LLM)审核的双层编码

Benyamin Tafreshian, Prathamesh Dhake

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RoguePrompt是一种采用双层编码(维吉尼亚密码+ROT13)的LLM越狱流程,在黑盒威胁模型下对313个被拒提示词测试,实现93.93%的过滤绕过率,提供多阶段越狱失效的阶段级证据。

Comments This manuscript supersedes the preliminary version available as arXiv:2511.18790. The work has been substantially revised, expanded, and reorganized, with a refined threat model, revised methodology, clearer stage-level evaluation criteria, and expanded analysis of moderation bypass, instruction reconstruction, and execution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28317 2026-07-31 cs.AI 新提交 90%

One Human, $N$ Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence

一个人类,N个智能体:校准不当且相关置信度下LLM智能体集群的审计预算分配

Cesare Zavattari, Alessandro Tommasi, Giuseppe Prencipe

机构 * Università di Pisa(比萨大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 针对单人类需在有限审计预算下审计N个LLM智能体的问题,研究了置信度校准不当且存在相关性时的审计预算分配,发现校准阈值的变化规律,验证了部分大语言模型置信度的实用性,给出了无效监督的定量准则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10383 2026-07-31 cs.CV 版本更新 89%

Authoring for Living Worlds: Tool-Constrained LLM Agents for Executable Multi-Actor Scenarios

代理视频生成:通过工具约束的LLM规划从文本到可执行事件图

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) Büchi Labortechnik AG(布奇实验室技术股份公司)

专题命中 其他LLM :LLM(title,title_cn)

AI总结 本文提出了一种代理系统,通过LLM生成结构化的事件图规范,并在3D引擎中确定性执行,解决了传统视频生成的语义可靠性问题,展示了在物理真实性和语义对齐上的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28331 2026-07-31 cs.SE 新提交 88%

Structural Validation of LLM-Generated Microservice Decompositions Using Source-Code Dependencies

基于源代码依赖的大语言模型生成微服务分解的结构验证

Daniel Silva, Renan Alves, Emanuel Dantas Filho, Ademar Sousa Neto, Mirko Perkusich, Danyllo Wagner Albuquerque, Kyller Gorgônio, Angelo Perkusich

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于静态依赖分析的自动验证流程,评估OpenAI o3生成的微服务分解的结构一致性,发现零样本与少样本提示的结构一致性相当,且需控制映射覆盖率以避免方法学偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06525 2026-07-31 cs.GT cs.MA econ.TH 版本更新 86%

Who Is Really Playing? Strategic Interaction in AI-Guided Populations

通过AI维持群体合作:一种针对大语言模型的folk定理

Jonathan Shaki, Eden Hartman, Sarit Kraus, Yonatan Aumann

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了大语言模型如何通过指导多个群体中的代理实现合作,发现即使基础游戏激励不一致,共享LLM指导也能维持合作,证明了针对LLM的folk定理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27614 2026-07-31 cs.CL cs.AI 新提交 82%

DualAnchor: Preserving Language Priors and Improving Lexical Fidelity in Gloss-Free Sign Language Translation

DualAnchor:无注释手语翻译中保留语言先验并提升词汇保真度

Hongbin Zhang, Junhao Liu, Xuefeng Bai, Youcheng Pan, Yang Xiang, Kehai Chen

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有无注释手语翻译方法的语言先验退化与词汇保真度差距问题,提出结合TPA和OTA的DualAnchor框架,在两个基准数据集上取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27951 2026-07-31 cs.CR cs.AI 新提交 81%

Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

基于可复制上下文的安全防护无法为大语言模型提供可靠的安全性

Pingyu Wu, Lingyao Zhu, Weiming Zhang, Nenghai Yu

专题命中 其他LLM :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究指出基于可复制上下文的LLM安全防护存在三难困境,提出用可信凭证补充防护以预测下游使用,其结论经相关评估与程序验证具有实际意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27497 2026-07-31 cs.CL 新提交 81%

SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge

SkillSmith:学习组合参数化技能与文本知识

Lucio M. Dery, Benedict Aaron Tjandra, Siavash Samiei, Adhiguna Kuncoro, Zohar Yahav, Jiajun Shen, Arthur Szlam

机构 * Google(谷歌)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SkillSmith将模型权重作为可推理模态,结合前缀调优与文本数据,实现指令引导的参数化合成,性能优于单模态基线,解决了文本与权重集成的未探索问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27938 2026-07-31 cs.HC 新提交 80%

VizPilot: Automated Onboarding for SVG-based Composite Visualizations using Multimodal LLMs

VizPilot:基于多模态大语言模型的SVG复合可视化自动引导系统

Nishaanthini Gnanavel, Yong Wang

专题命中 其他LLM :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 VizPilot是基于多模态大语言模型的SVG复合可视化自动引导工具,通过双模块实现自动生成交互式引导,经评估可降低创作工作量并减轻用户认知负荷,提升复合可视化可用性。

Comments Accepted by IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28423 2026-07-31 cs.CV cs.LG 新提交 79%

Negative controls reveal volume-driven confounding in radiomics and imaging foundation model features

阴性对照揭示放射组学和影像基础模型特征中体积驱动的混杂效应

Katy L. Scott, Sejin Kim, Joshua Siraj, Caryn Geady, Matthew Boccalon, Mattea Welch, Mogtaba Alim, Andrew J. Hope, Benjamin Haibe-Kains

机构 * Princess Margaret Cancer Centre(玛格丽特公主癌症中心) University Health Network(大学网络医疗保健系统)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 该研究推出开源框架READII-2-ROQC,通过体积保持阴性对照分析放射组学和影像基础模型特征,揭示体积驱动的混杂效应,为可解释影像生物标志物开发提供质控策略。

Comments 22 pages (including supplementary), 6 figures, 2 supplementary tables, 5 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27281 2026-07-31 cs.LG 新提交 79%

The Kinetics of Training: A Driven-Nucleation Rate Law for Emergence, Plasticity Loss, and Circuit Control in Language Models

训练动力学:语言模型中涌现、可塑性丧失与回路控制的成核速率定律

Lei Dong

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 该研究提出语言模型能力形成的成核速率定律,揭示无部分 credit 的联合对齐是速率限制步骤,定位可塑性丧失的损伤并找到重新初始化 query-key 切片的解决方案,适用于14亿参数 transformer 的合取回路。

Comments 40 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22917 2026-07-31 cs.AI cs.LG cs.MA 版本更新 79%

Agent Team Work Zone: An Automated, Persistent Workspace for Long-Lived Claude Code Agent Teams

智能体团队工作区:面向长期存在的编码智能体团队的自动化持久工作区

Shouren Wang

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对Claude Code等大语言模型智能体在长期工作流程中存在的问题,提出ATWZ,通过围绕其原生智能体团队构建基于文件系统的操作层,保存智能体工作状态等,解决相关问题并减少提示编写工作量。

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06599 2026-07-31 cs.CL cs.AI 版本更新 79%

How Context Shapes Truth: Geometric Transformations of Statement-level Truth Representations in LLMs

上下文如何塑造真相:LLMs中语句级真相表示的几何变换

Shivam Adarsh, Maria Maistro, Christina Lioma

机构 * University of Copenhagen(哥本哈根大学)

专题命中 其他LLM :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究LLMs中上下文如何改变真相向量,发现早期层正交、中层收敛,上下文增加向量幅度,大模型通过方向变化区分相关与无关上下文。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19790 2026-07-31 cs.CV 版本更新 78%

Geometric Risk Control for Vision-Language Model OCR

从可信性到可验证性:具有视觉-语言模型的风险控制生成OCR

Weile Gong, Zijian Lu, Mingcai Chen, Yiping Zuo, Xin He, Weibei Fan

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) China University of Petroleum(中国石油大学) Southeast University(东南大学)

专题命中 其他LLM :language model(title,abstract)

AI总结 本文提出通过几何风险控制器减少生成OCR的极端错误风险,利用结构化视图和轻量级筛查实现可靠部署。

Comments 9 pages, 5 figures, Code: https://github.com/phare111/GRC

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21517 2026-07-31 cs.IT cs.AI cs.DM math.CO math.IT 版本更新 77%

Improved lower bounds for the Shannon capacity of odd cycles

奇数圈香农容量的改进下界

Nathaniel Itty, Christopher D. Rosin, Chase Carstensen, Daniel Reichman

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过与大语言模型迭代交互,在奇数圈\(C_7^{10}\)、\(C_{11}^{6}\)、\(C_{13}^{6}\)中构造独立集,改进了这些图香农容量的已知下界,还改进了几个奇数圈单个强幂独立数的已知下界。

Comments v2: added improvement on lower bound for the Shannon capacity of C15

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27726 2026-07-31 cs.AI cs.CL cs.LG 新提交 75%

Baikal: Structured Search for Deep Research over Data Lakes

Baikal:面向数据湖深度研究的结构化搜索框架

Dhruv Agarwal, Rishitha Guttapalle Mohan, Aarti Kumari, Ashi Sinha, Athulya Anil, Kavitha Srinivas, Horst Samulowitz, Andrew McCallum

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 Baikal是面向数据湖深度研究的结构化搜索框架,通过聚类证据为语义区域并自适应搜索,在HybridQA和TAT-QA数据湖上较基线方法提升报告得分28%和36%,展现了结构化语义探索的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09487 2026-07-31 cs.CL cs.AI cs.LG 版本更新 75%

Metareasoning constraints couple narratives, affect and cognition

内部叙事参数化情感状态

Jakub Onysk, Quentin J. M. Huys

机构 * Applied Computational Psychiatry Lab(应用计算精神病学实验室) Max Planck UCL Centre for Computational Psychiatry and Ageing Research(马克斯·普朗克UCL计算精神病学与衰老研究中心) Queen Square Institute of Neurology and Mental Health(圣夸克广场神经病学与心理健康研究所) Neuroscience Department(神经科学系) Division of Psychiatry(精神病学系)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过量化参与者内部叙事的大语言模型表示及其子空间,研究了叙事与情感状态之间的关系,发现特定症状的描述性思维能够预测标准化的抑郁评分,并强调保持症状间的协方差对构建效度至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27617 2026-07-31 cs.AI 新提交 74%

Hidden APIs in Language Models: Discovering Reusable Causal Interfaces from Forked Futures

语言模型中的隐藏API:从分叉未来中发现可复用的因果接口

SiYuan Ma, Yiqin Luo, Zhangji, Canran Xiao, Albert Gao, Wei-Hsing Huang, Wei Wang, Qiwei Wu, Xinran Li, Jinfeng Wei, Qixin Zhang

机构 * Nanyang Technological University(南洋理工大学) Southern University of Science and Technology(南方科技大学) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) The Hong Kong Polytechnic University(香港理工大学) Shenzhen University(深圳大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 其他LLM :language model(title);分类 cs.AI

AI总结 本研究从分叉未来采样后续操作以比较语言模型隐藏状态,发现共享接口在多模型评估中表现最优,支持测试操作库中存在可复用因果接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27308 2026-07-31 cs.LG q-bio.NC 新提交 74%

ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution

ZUNA1.1:一种更灵活的用于去噪和超分辨率的脑电图(EEG)基础模型

Christopher Warner, Jonas Mago, JR Huml, Beren Millidge

机构 * Zyphra

专题命中 其他LLM :foundation model(title);分类 cs.LG

AI总结 研究推出3.8亿参数的EEG基础模型ZUNA1.1,其灵活性远超原模型ZUNA1,在EEG去噪与重建任务中性能达标且显著优于MNE包的球形样条插值,已以Apache 2.0许可开源发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27529 2026-07-31 cs.LG 新提交 70%

Latent-Kernel Discrete Flow Maps for Few-Step Generation

用于少步生成的隐核离散流图

Mansoor Ahmed, Yue-Tsz Fan, Hemanth Venkateswara, Murray Patterson

专题命中 其他LLM :language model(abstract,abstract_cn);分类 cs.LG

AI总结 提出隐核离散流图(LKF)模型,通过共享隐变量绑定分解组件实现少步生成,在两个文本基准上较似然基线提升困惑度2.1-3.3倍,M=8时优于现有少步采样器

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28576 2026-07-31 cs.CL cs.AI cs.LG 新提交 67%

Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B

更多采样,更少反思:在相同 token 成本下,自改进(Self-Refine)和反思(Reflexion)不敌重复采样,模型规模从 15 亿到 70 亿参数

Iliya Mirzaei

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究发现,在相同 token 成本下,自改进、反思等含自我检查的语言模型方法均不敌重复采样,且模型规模增长会使自我检查方法的性能优势减弱,70 亿参数模型上的改写方法仍显著弱于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28550 2026-07-31 cs.CY 新提交 67%

Correcting Mode Collapse in Silicon Sampling with Semantic Similarity Rating

用语义相似度评分修正硅采样中的模式崩溃问题

Oscar Heath, Rohan Alexander

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 该研究针对硅采样中LLMs生成回复的模式崩溃问题,提出语义相似度评分法,通过文本嵌入将LLMs生成的文本回复映射为数值尺度,提升了回复分布保真度且校准参数少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28285 2026-07-31 cs.CV 新提交 67%

Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions

超越视觉歧义:通过详细长文本引导具有挑战性场景下的鲁棒单目深度估计

Junrui Zhang, Jiaqi Li, Yiran Wang, Liao Shen, Zhiguo Cao

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 其他LLM :language model(abstract,abstract_cn)

AI总结 该研究针对单目深度估计的视觉歧义问题,提出CapDepth框架,通过详细长文本引导,在非朗伯表面和恶劣天气下的深度误差较现有最优方法分别降低25.0%和22.0%。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27275 2026-07-31 cs.CR 版本更新 67%

Prevalence of Security and Privacy Risk-Inducing Usage of AI-based Conversational Agents

基于人工智能的对话式代理的安全与隐私风险诱导使用的普遍性

Kathrin Grosse, Nico Ebert

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 该研究调查3270名英国成年人发现,三分之一每周使用ChatGPT等CA,三分之一常规用户有攻击相关行为,四分之一尝试越狱,多数人不知数据可用于模型训练,建议CA配备AI护栏并提升数据使用透明度。

Comments 10 pages, 3 figures, 5 tables, accepted at IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18866 2026-07-31 econ.EM cs.LG stat.ML 版本更新 57%

Optimizing Regret

优化遗憾值

Irene Aldridge

专题命中 其他LLM :LLM(abstract);分类 cs.LG

AI总结 本文基于成本与决策协方差发展协方差遗憾泛函导数理论,推导线性策略梯度,扩展到约束优化等,得出通用最速下降方向,还给出收敛界及算法,应用于投资组合倾斜与大语言模型分配策略。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28352 2026-07-31 physics.ed-ph 新提交 50%

Studying Circular Motion with an AI-Generated Smartphone Physics Lab

用AI生成的智能手机物理实验室研究圆周运动

Josep Ll. Suñer, Francisco M. Muñoz-Pérez, Juan C. Castro-Palacio, Juan A. Monsoriu, Martín Monteiro, Cecilia Stari, Arturo C. Martí

专题命中 其他LLM :prompting(abstract)

AI总结 本文通过向AI助手自然语言提示生成无代码定制化浏览器转动实验室,结合旋转平台研究两种圆周运动,并用Tracker视频分析验证测量结果。

详情

展开后加载摘要…

URL PDF HTML 收藏