arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2707 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2707 篇

2606.17362 2026-06-17 cs.CV cs.AI cs.LG cs.RO 新提交 81%

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

DriveJudge: 用视觉-语言模型重新思考自动驾驶评估

Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

机构 * NVIDIA(英伟达)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出DriveJudge,结合规则评估与VLM推理,通过选择性调用物理规则函数实现可解释且上下文感知的驾驶评估,在驾驶质量分类和轨迹偏好选择任务上超越现有方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15420 2026-06-16 cs.LG cs.AI 新提交 81%

Constitutional Value Potentials: reading and steering internal priority margins in language models

宪法价值潜力:读取和引导语言模型中的内部优先级边际

Tong Che, Rui Wu

机构 * NVIDIA Research(英伟达研究院) Rutgers University(罗格斯大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出宪法价值潜力(CVP)方法,通过从隐藏状态学习标量势来读取模型内部的价值优先级边际,以预测和干预价值冲突,AUROC高达0.95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11599 2026-06-11 cs.CL cs.LG 新提交 81%

When is Your LLM Steerable?

你的大模型何时可操控?

Chenrui Fan, Yize Cheng, Ming Li, Soheil Feizi, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学帕克分校) MBZUAI, UAE(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出通过模型生成初期的内部状态预测激活操控是否成功,并利用该预测器优化操控强度搜索,降低解码成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11105 2026-06-10 cs.CL cs.AI 新提交 81%

PhantomBench: Benchmarking the Non-existential Threat of Language Models

PhantomBench: 对语言模型非存在性威胁的基准测试

Haeji Jung, Hila Gonen

机构 * University of British Columbia(不列颠哥伦比亚大学) Canada CIFAR AI Chair, Amii(加拿大CIFAR人工智能主席,阿米研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出PhantomBench,首个大规模非存在概念基准,包含6万多个虚构实体,评估21个模型,发现平均幻觉率高达86.7%,前沿模型也难以避免。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09894 2026-06-10 cs.LG cs.CL 新提交 81%

A Navigable Manifold of Hypothesized Consciousness-Spectrum States in Language Model Representations

语言模型表示中假设的意识谱状态的可导航流形

Sophie Zhao

机构 * School of Computer Science(计算机科学学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型嵌入空间中与意识谱相关的几何结构,发现嵌入形成可导航流形,高低层区域稳定,中间为过渡走廊,导航性为内在属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08630 2026-06-09 cs.LG cs.AI 新提交 81%

Tyan-WP: A Wind Power Foundation Model for Ultra-Short-Term Probabilistic Forecasting

Tyan-WP:用于超短期概率预测的风电基础模型

Jiahui Huang, Ao Luo, Lei Liu, Hongwei Zhao, Tengyuan Liu, Ruibo Guo, Bo Wang, Zhao Wang, Bin Li

机构 * School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) China Electric Power Research Institute(中国电力科学研究院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出首个风电基础模型Tyan-WP,通过静态站点嵌入和功率感知气象融合模块,在零样本场景下实现超短期概率预测,显著优于传统模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08408 2026-06-09 cs.CL cs.AI 新提交 81%

TimpaTeks: Automatic In-place Text Sequence Modification via Diffusion Language Model Steering

TimpaTeks: 通过扩散语言模型引导实现自动原地文本序列修改

Ryandito Diandaru, Ikhlasul Akmal Hanif, Fadli Aulawi Al Ghiffari, Ahmed Elshabrawy, Alham Fikri Aji

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出TimpaTeks方法,将激活引导扩展到扩散语言模型,实现原地文本修改以改变概念,在情感和概念引导任务上降低困惑度并保持句子结构。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07017 2026-06-08 cs.AI cs.CL cs.ET 新提交 81%

The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

基础模型智能体的仿真到现实差距:统一MDP视角

Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出将基础模型智能体的评估与训练差距形式化为经典仿真到现实问题,围绕MDP四要素(观测、动作、转移、奖励)构建统一框架,并倡导采用域随机化等成熟解决方案。

Comments 7 pages, 2 figures, 2 tables. Accepted by KDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06898 2026-08-10 cs.RO cs.CL cs.HC 新提交 80%

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots

我该如何为我的机器人选择基础模型?支持社会机器人的社区评估框架

Eric Nichols, Alva Markelius, Hatice Gunes

机构 * Honda Research Institute Japan(本田研究所日本分部) University of Cambridge(剑桥大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL

AI总结 针对社会机器人选择基础模型的难题,本文提出三层评估漏斗范式,梳理五个评估维度的适用评估方法,呼吁社区共建评估框架。

Comments 5 pages, 1 figure, 1 table. Accepted at the FoRMA workshop (Foundation Models in the RO-MAN Age: Responsible Development for Social Robotics) at IEEE RO-MAN 2026, Kitakyushu, Japan. Workshop homepage: https://sites.google.com/cam.ac.uk/forma/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10197 2026-07-14 cs.AI 新提交 80%

GRATE: Temporal Extensions for Inductive KG Foundation Models via Gated Rotary Attention

GRATE:基于门控旋转注意力的归纳式知识图谱基础模型的时间扩展

Jiaxin Pan, Osama Mohammed, Daniel Hernández, Steffen Staab

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 研究如何将知识图谱基础模型的归纳迁移能力扩展到时间知识图谱,提出GRATE方法,通过门控旋转注意力编码时间,集成到NBFNet模型中,构建新基准套件测试,单个联合预训练的GRATE检查点在多数设置下优于静态基础模型。

Comments Accepted at the ICML 2026 Workshop on Graph Foundation Models: A New Era for Graph Machine Learning. 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07457 2026-06-08 cs.LG eess.SP stat.ML 新提交 80%

Time series Foundation Models based on Physics-Informed Synthetic Histories for Cold-Start Photovoltaic Forecasting

基于物理信息合成历史的时间序列基础模型用于冷启动光伏预测

Lorenzo Longarini, Alessandro Rongoni, Simone Silenzi, Emanuele Frontoni, Riccardo Rosati

机构 * European Commission(欧洲委员会)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 针对光伏电站冷启动预测问题,提出利用物理信息合成历史数据,结合时间序列基础模型进行零样本预测,在440个站点上实现1.7-2倍性能提升。

Comments To be published in the 2nd ICML Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16859 2026-08-18 cs.CV 新提交 80%

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

HarnessEval-W:将视觉世界评估智能体化

Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出智能体化评估流程HarnessEval-W,将LLM生态的harness范式应用于世界模型基准测试,对18个世界模型的330个案例评估,其判断与人类偏好一致且提供可验证诊断,已开源并邀社区贡献。

Comments Project Page: https://mirros-lab.github.io/HarnessEval-W

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16067 2026-08-18 cs.HC 新提交 80%

SiMUSation: An Interactive Visitor Experience Simulation Framework to Support Museum Exhibition Design

SiMUSation:一种支持博物馆展览设计的交互式参观者体验模拟框架

Huanchen Wang, Qiuming Chen, Zhonghao Ji, Ruqi Sun, Zhichao Lu, Yuxin Ma

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出SiMUSation交互式框架,通过LLM驱动的角色模拟,支持博物馆展览早期设计,经12人用户研究验证其可辅助设计反思优化。

Comments 15 pages, 7 figures, 3 tables, Accepted by ACM UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15814 2026-08-18 cs.CR 新提交 80%

Assessing Attack Surfaces in Generative Search Engines through Publisher Attributes: A Case Study in Political Domains

基于发布者属性评估生成式搜索引擎的攻击面:政治领域的案例研究

Riku Mochizuki, Shusuke Komatsu, Souta Noguchi, Kazuto Ataka

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本研究针对政治领域,提出评估框架与“内容注入屏障”指标,发现不同GSE攻击面有别、执政党攻击面更广、用户画像影响小,揭示了GSE的攻击面特征。

Comments Our full paper will be presented at ACM CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13956 2026-08-17 cs.IR 新提交 80%

How retriever redundancy and diversity impact RAG effectiveness

检索器冗余性与多样性如何影响检索增强生成(RAG)的有效性

Jonathan J Ross, Bevan Koopman, Anton van der Vegt, Guido Zuccon

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本研究探究RAG中检索文档的冗余性与多样性对答案正确性的影响,发现重复冗余与LLM转述无显著增益,而多样文档可将正确性提升17%-47%,并揭示其提升源于体裁多样性,为RAG检索方法优化提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13930 2026-08-17 cs.CR 新提交 80%

Extracting and Verifying Illicit Bitcoin Addresses from Underground Forum Discussions

从地下论坛讨论中提取和验证非法比特币地址

Abdoul Nasser Hassane Amadou, Arnaud Legout, Imane Fouad, Konstantin Avrachenkov, Anas Motii

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本研究提出结合LLM辅助筛选、专家审核与链上验证的可复现流程,从地下论坛HackForums构建含2438个经人工验证非法比特币地址的数据集,为相关研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13463 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交 80%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 8 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13240 2026-08-14 cs.SE 新提交 80%

Can Formal Specifications Be Synthesized from Tests Alone?

仅从测试能否合成形式化规格说明?

Tianhai Liu, Maximilian Müller, Tobias Hey, Vitus Lüntzel, Muhammad Minhas, Anne Koziolek, Bernhard Beckert

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出仅用测试代码和动态执行轨迹,结合LLM与有界模型检查合成形式化规格说明的方法,在SpecGenBench基准上取得初步效果,同时指出需解决检查器兼容性等关键挑战。

Journal ref ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12518 2026-08-14 cs.SE 新提交 80%

Does It Render Everywhere? A Study of Cross-Environment Compatibility in MLLM-Generated Webpages

它是否在所有环境中都能渲染?对多模态大语言模型(MLLM)生成网页的跨环境兼容性研究

Ziyun Guo, Jingyu Xiao, Yuqiang Sun, Yintong Huo

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对MLLM生成网页的跨环境兼容性问题,构建WebCompat数据集并开发XCompat检测器,发现68%的网页存在兼容性问题,XCompat的F1分数达0.903且性能优于现有工具与基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10645 2026-08-12 eess.SY cs.SY 新提交 80%

AIDC Microgrid Vulnerability Assessment Under Computing-Power Coordinated Attacks

算力-电力协同攻击下的AI数据中心(AIDC)微电网脆弱性评估

Ze Yu, Hongwei Zhen, Chao Shen, Mingyang Sun

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文针对低碳AI数据中心(AIDC)微电网的算力-电力协同攻击问题,提出不确定性感知脆弱性评估框架,经案例验证可识别脆弱时段,协同攻击危害大于单一攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09145 2026-08-11 cs.CV 新提交 80%

Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images

正确答案,错误依据:面向红外图像多模态大语言模型的感知感知评估与热基础反馈机制

Yongsong Huang, Xiaofeng Liu, Tomo Miyazaki, Yaohou Fan, Shinichiro Omachi

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对红外图像多模态大语言模型仅以答案准确率评估的问题,提出感知感知评估框架与无需训练的热基础反馈机制,可提升解释热基础度,为可信红外场景理解模型的开发提供了方向。

Comments This manuscript is currently under peer review. Copyright may subsequently be transferred to the publisher, after which the availability of this version may be subject to the publisher's policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06960 2026-08-10 cs.SE cs.CR 新提交 80%

Statistical Analysis of Executability and Program Equivalence in Decompilation for IoT Vulnerability Detection

面向物联网漏洞检测的反编译可执行性与程序等价性统计分析

Minami Yoda, Jialong Li, Yasuyuki Tahara, Yuichi Sei, Yutaka Matsuno

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对物联网固件漏洞检测的反编译问题,提出九维质量评估指标,通过统计分析证明其可有效评估反编译质量,为物联网设备缺陷及黑盒生成模型质量评估提供基础。

Comments Author's English translation of the paper accepted for publication (in Japanese) in Toukei Suri (Proceedings of the Institute of Statistical Mathematics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06790 2026-08-10 cs.SE 新提交 80%

AgentChaos: Chaos Engineering for Agent Systems via Programmatic Fault Injection

AgentChaos:通过可编程故障注入实现智能体系统的混沌工程

Gou Tan, Zhensu Sun, Jieke Shi, Ting Zhang, Zilong He, Qingfu Wu, Shuai Liang, Weifeng Sun, Junda He, Pengfei Chen, Chuanfu Zhang, Lwin Khin Shar, David Lo

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出AgentChaos框架,在不修改源代码的情况下于LLM API共享层注入故障,评估显示智能体系统鲁棒性取决于自身实现,现有故障诊断方法仍有提升空间。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06200 2026-08-07 physics.ed-ph 新提交 80%

Using LLMs to Detect Growth in Computational Thinking in Introductory Physics

使用大型语言模型(LLMs)检测入门物理课程中计算思维的发展

Sean Savage, Anand Shanker, Grace Michlitsch, N. Sanjay Rebello

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究探究用LLMs分析学生计算物理问题书面解释,发现其可复刻人工评估结果并规模化检测计算思维发展趋势,为大招生规模物理课程的CT评估提供可行方法。

Comments 1 figure, 2 tables. Submitted to Physics Education Research Conference (PERC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04536 2026-08-06 cs.DB 新提交 80%

From Research Questions to Columns: Operationalization-Aware Data Discovery

从研究问题到列:感知操作化的数据发现

Houming Chen, H. V. Jagadish

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出感知操作化的数据发现(OADD)任务,构建基准OADD-Bench,评估多种方法后发现OADD仍是未解决问题,其中OADD定向智能体表现最佳。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04034 2026-08-06 cs.CR 新提交 80%

A Multimodal Automatic Redteaming Evaluation based on Atomic Jailbreak Strategy Decoupling and Combination

基于原子越狱策略解耦与组合的多模态自动红队评估

Shiji Zhao, Yuxuan Zhou, Chen Xiong, Dongxian Wu, Yang Bai, Xun Chen

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 针对现有多模态越狱攻击的两大挑战,本文提出HACA方法,构建多模态原子越狱策略空间,对5种主流MLLMs平均攻击成功率达95.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01494 2026-08-04 q-fin.PM q-fin.RM 新提交 80%

Conformal Kelly: Conformal Prediction Intervals as the Scale in Fractional Kelly Position Sizing

共形凯利:将共形预测区间用作分数凯利头寸规模的尺度

Robert Jacob Ryan

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出将共形预测区间与分数凯利结合用于投资组合头寸规模确定,经6年测试表现优于被动基准,还引入风险控制优化回撤,相关配置经预注册和LLM智能体搜索验证。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00567 2026-08-04 econ.GN q-fin.EC 新提交 80%

Optimal Inflation Rate: A Meta-Analysis

最优通胀率:一项元分析

Matej Opatrny, Martin Opatrny, Tomas Havranek, Zuzana Irsova, Mojmir Hampl

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究通过LLM辅助的可重复元分析,利用777项估计值发现最优长期通胀率约为0.6个百分点,远低于多数央行的2%目标,且明确了研究间差异的核心驱动因素。

Comments 62 pages, 4 figures. Also available as CEPR Discussion Paper 21629. Data, code, and extraction prompts: https://meta-analysis.cz/inflation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01544 2026-08-04 econ.EM cs.CV 新提交 80%

Measuring Product Quality Using Images: The CLIP Q-Score and an Application to Real Estate

利用图像衡量产品质量:CLIP Q分数及其在房地产中的应用

Fabian Slonimczyk, Danila Karapsin

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出CLIP Q分数这一基于对比语言-图像预训练的开源图像产品质量衡量方法,其可预测房地产市场价格与流动性,且与LLM评估结果一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28430 2026-07-31 cs.MA 新提交 80%

AgentRadio: Passive Awareness for Long-Horizon Multi-Agent Collaboration

AgentRadio:面向长 horizon 多智能体协作的被动感知机制

Xinxing Ren, Qianbo Zang, Ziyan Wang, Caelum Forder, Suman Deb, Peter Carroll, Zekun Guo

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对现有多智能体系统仅能在阶段间交换信息的局限,提出异步消息传递层 AgentRadio,使编码智能体保持被动感知,在 SWE-Atlas QnA 基准上多智能体任务解决率显著优于单个智能体及 Opus 4.8 版 Claude Code。

详情

展开后加载摘要…

URL PDF HTML 收藏