arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-02 至 2026-07-02 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 18 篇

2507.05740 2026-07-02 cs.CL 版本更新 91%

GPTKB v1.5: A Massive Knowledge Base for Exploring Factual LLM Knowledge

GPTKB v1.5:用于探索事实性LLM知识的大规模知识库

Yujia Hu, Tuan-Phong Nguyen, Shrestha Ghosh, Moritz Müller, Simon Razniewski

机构 * ScaDS.AI Dresden/Leipzig & TU Dresden, Germany(德国德累斯顿/莱比锡ScaDS.AI & 德累斯顿工业大学) VNU University of Engineering and Technology, Hanoi, Vietnam(越南河内国立大学工程与技术大学)

专题命中 其他LLM :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 提出GPTKB v1.5,一个通过GPT-4.1构建的1亿三元组知识库,支持链接遍历、SPARQL查询和LLM知识优劣比较,用于系统分析LLM知识。

Comments 3 pages, 1 figure, 1 table

Journal ref AAAI 2026: Demo track

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13445 2026-07-02 cs.CL cs.AI 版本更新 86%

Verbosity Tradeoffs and the Impact of Scale on the Faithfulness of LLM Self-Explanations

冗长性权衡与规模对LLM自我解释忠实度的影响

Noah Y. Siegel, Nicolas Heess, Maria Perez-Ortiz, Oana-Maria Camburu

机构 * Google DeepMind(谷歌DeepMind) Centre for AI, University College London(伦敦大学学院人工智能中心) Imperial College London(伦敦帝国学院) University College London(伦敦大学学院)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文分析13个模型家族共75个模型的反事实忠实度,提出phi-CCT和F-AUROC两个新指标,发现更大更强的模型在所有指标上更忠实。

Comments ICLR 2026 Workshop on Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities 67 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00445 2026-07-02 cs.HC 新提交 86%

Gaze-Informed Proactive AI Assistance for Children's Picture Exploration

基于注视的主动式AI辅助儿童图画探索

Zekun Wu, Man Su, Huiyong Li, Tomohiro Nagashima, Anna Maria Feit

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出Ollie系统,利用儿童注视估计注意力并触发LLM描述相关图画区域,实验表明注视辅助比随机辅助更有效维持注意力并引导探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12535 2026-07-02 cs.CR 版本更新 82%

Ghost in the Context: Policy-Carriage Integrity in LLM Agents

上下文中的幽灵:在决策时间装配中的政策承载失败测量

Igor Santos-Grueiro

专题命中 其他LLM :LLM(title,abstract)

AI总结 本文研究了在决策时间装配过程中由于状态丢失、削弱或反弹导致的政策边界跨越问题,提出SafeContext控制层以缓解风险,并展示了其在不同模型上的效果。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00062 2026-07-02 cs.SE cs.AI cs.PL 新提交 81%

AlgoBench: Benchmarking Algorithmic Adaptation in Code Generation

AlgoBench: 代码生成中算法适配的基准测试

Xinyuan Song, Zekun Cai, Liang Zhao

专题命中 其他LLM :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 提出AlgoBench框架,通过结构化约束变换自动生成新算法问题,并引入复杂度感知指标评估模型适配能力,实验发现LLM在算法适配中性能显著下降。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00035 2026-07-02 cs.AI 新提交 81%

Making Failure Safe: A Constrained, Verifiable Agent Framework for Open-Web Data Collection

确保失败安全:一个用于开放网络数据收集的受约束、可验证的智能体框架

Bo Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一个受约束、可验证的智能体框架,通过将LLM输出从自由形式代码转换为类型化JSON收集器配置,结合六类型收集器分类、模板和效用函数约束、静态Airflow DAG执行、基于规则的质量检查和结构化反馈纠正,实现了零执行阶段LLM令牌消耗和最低平均挂钟时间。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00394 2026-07-02 cs.DB cs.CL 新提交 81%

When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers

当经典缓存策略失效时:面向语义检索缓冲区的学习增强替换

Yushi Sun, Bowen Cao, Wai Lam

机构 * LIGHTSPEED, Tencent(腾讯光速) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对LLM代理中语义检索缓冲区的缓存替换问题,提出学习增强框架SOLAR,通过遗憾积累和贝叶斯在线学习实现恒定竞争比≤3,在紧缓存下相对FIFO提升5-75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00852 2026-07-02 cs.CL cs.AI 新提交 81%

Recovering Input Text from Hidden States: Study of Gradient-Based Inversion of Decoder-Only Language Models

从隐藏状态恢复输入文本:基于梯度的解码器专用语言模型反演研究

Mikołaj Słowikowski, Maciej Witold Majewski

机构 * AGH University of Krakow, Faculty of Physics and Applied Computer Science(AGH克拉科夫大学物理与应用计算机科学学院)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究解码器专用语言模型最后层隐藏状态的反演问题,提出连续嵌入空间优化方法,通过离散损失评估恢复正确性,发现高频功能词是主要失败原因,内容词几乎完美恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06452 2026-07-02 cs.HC 版本更新 80%

Code Semantic Zooming

代码语义缩放

Jinsheng Ba, Sverrir Thorgeirsson, Zhendong Su

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出基于伪代码的CodeZoom方法,通过多层语义抽象迭代探索、理解和优化代码,在用户研究中相比Claude Code显著提升代码理解与控制感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01558 2026-07-02 cs.LG cs.AI 版本更新 76%

Utilizing Earth Foundation Models to Enhance the Simulation Performance of Hydrological Models with AlphaEarth Embeddings

利用地球基础模型通过AlphaEarth嵌入增强水文模型的模拟性能

Pengfei Qu, Wenyu Ouyang, Chi Zhang, Yikai Chai, Shuolong Xu, Lei Ye, Yongri Piao, Miao Zhang, Huchuan Lu

机构 * School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) School of Infrastructure Engineering, Dalian University of Technology(大连理工大学建设工程学院) School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院) School of Software, Dalian University of Technology(大连理工大学软件学院) School of Artificial Intelligence, Dalian University of Technology(大连理工大学人工智能学院)

专题命中 其他LLM :foundation model(title);分类 cs.AI、cs.LG

AI总结 研究利用AlphaEarth基础模型从卫星图像中学习的嵌入表征流域特征,相比传统属性更有效提升无测站流域的径流预测精度,并发现基于嵌入相似性选择捐赠流域可改善预测性能。

Comments 12 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15692 2026-07-02 cs.HC cs.CL cs.CV 交叉投稿 70%

Surfacing Variations to Calibrate Perceived Reliability of MLLM-generated Image Descriptions

表面化变异以校准MLLM生成图像描述的可信度感知

Meng Chen, Akhil Iyer, Amy Pavel

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过系统性地展示多个MLLM响应间的变异,帮助盲人或低视力用户无需视觉检查即可检测不可靠信息,实验表明该方法将识别不可靠声明的能力提升4.9倍。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00083 2026-07-02 cs.CL cs.AI cs.LG 新提交 67%

Harnessing the Latent Space: From Steering Vectors to Model Calibrators for Control and Trust

利用潜在空间:从引导向量到模型校准器以实现控制与信任

Nishant Subramani

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所)

专题命中 其他LLM :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用潜在空间中的引导向量控制语言模型行为,并开发基于潜在空间的模型校准器评估输出可信度,从而增强模型的可控性与可靠性。

Comments ACL 2026 (BigPicture Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25189 2026-07-02 cs.OS 新提交 67%

ActPlane: Programmable OS-Level Policy Enforcement for Agent Harnesses

ActPlane:面向代理框架的可编程操作系统级策略执行

Yusheng Zheng, Tianyuan Wu, Quanzhi Fu, Tong Yu, Wenan Mao, Tao Ma, Dan Williams, Wei Wang, Andi Quinn

专题命中 其他LLM :LLM(abstract,abstract_cn)

AI总结 提出ActPlane,一种在操作系统内核中执行代理策略的引擎,通过eBPF实现信息流控制,弥补语义鸿沟,覆盖工具层无法观察的间接执行路径,开销1.9%-8.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00588 2026-07-02 cs.CL 新提交 57%

Low Perplexity is Repetition: A One-Dimensional Self-Conditioning Attractor in Continuous Diffusion LMs

低困惑度即重复:连续扩散语言模型中的一维自调节吸引子

Shuai Zhang, Zijie Chen, Hongliang He, Lun Du, Zhenzhong Lan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 发现连续扩散语言模型(如ELF)的低困惑度源于过度重复,提出一维吸引子机制并设计ACE方法消除重复,提升文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00423 2026-07-02 cs.CL 新提交 57%

Selective Test-Time Debiasing for CLIP via Reward Gating

通过奖励门控实现CLIP的选择性测试时去偏

Jaeho Han, Jisoo Yang, Hyeondong Woo, Mingyu Jeon, Sunjae Yoon, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(中央大学人工智能系)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 提出基于强化学习的测试时自适应框架RG-TTA,根据输入对偏见的敏感性选择性应用去偏,在减少偏见的同时保持零样本性能。

Comments 15 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16085 2026-07-02 cs.CV cs.AI 版本更新 57%

Interact3D: Compositional 3D Generation of Interactive Objects

Interact3D: 交互式物体的组合3D生成

Hui Shan, Keyang Luo, Ming Li, Sizhe Zheng, Yanwei Fu, Zhen Chen, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Adobe Fudan University(复旦大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 提出Interact3D框架,通过统一3D引导场景、两阶段组合流水线(全局到局部几何对齐和基于SDF的优化)以及闭环智能体修正策略,从单张图像生成物理合理的交互式3D组合物体,解决遮挡和空间关系保持问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00804 2026-07-02 cs.CV 新提交 50%

Spotted: Location-informed Reidentification of Hyenas and Leopards in Camera Trap Surveys

Spotted: 基于位置信息的相机陷阱调查中鬣狗和豹子的重新识别

Halil Sina Kelebek, Julia Hindel, Kobus Hoffman, Lauren Hoffman, Andrew Loveridge, Bob Mandinyenya, Kudakwashe Ncube, Justin Seymour-Smith, Andrea Sibanda, Abhinav Valada, Matthew Wijers, Daniele De Martini

机构 * Oxford Robotics Institute, University of Oxford(牛津大学牛津机器人研究所) Department of Computer Science, University of Freiburg(弗莱堡大学计算机科学系) Bubye Valley Conservancy(布比耶谷保护区) Wildlife Conservation Research Unit, Department of Biology, University of Oxford(牛津大学生物系野生动物保护研究组) Gonarezhou National Park(戈纳雷若国家公园) Oxford e-Research Centre, University of Oxford(牛津大学牛津电子研究中心)

专题命中 其他LLM :foundation model(abstract)

AI总结 提出Spotted框架,结合视觉相似性与时空可行性先验,减少专家审核量,在三个数据集上Top-5准确率提升最高9pp,查询比较量减少69pp。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00635 2026-07-02 cs.SE 新提交 50%

Checked Program Recovery from Execution Video: A Sound Oracle for Untrusted Generators

从执行视频中检查程序恢复:针对不可信生成器的可靠预言机

Yuan Si, Jialu Zhang

专题命中 其他LLM :language model(abstract)

AI总结 提出一种双层验证预言机,通过静态检查证明镜头等价性并颁发证书,确保从不正确程序中拒绝,从而可靠恢复Scratch程序。

详情

展开后加载摘要…

URL PDF HTML 收藏