arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-05 至 2026-08-05 共收录 439 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 105 篇

2507.07551 2026-08-05 cs.HC cs.AI cs.DL 79%

ArchiveGPT: A human-centered evaluation of using a vision language model for image cataloguing

Line Abele, Gerrit Anders, Tolgahan Aydın, Jürgen Buder, Helen Fischer, Dominik Kimmel, Markus Huff

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Comments 56 pages, 7 figures

Journal ref Humanit. Soc. Sci. Commun. 13, 300 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03095 2026-08-05 cs.CL cs.LG 新提交 79%

VIVID: A Culturally Grounded Benchmark Exposing the Figurative Language Gap in Vietnamese NLP

VIVID:面向越南NLP中比喻语言差距的文化基准测试集

Tu Tran Do, Nhat Ngoc Nguyen, Khanh-Tung Tran, Hoang D. Nguyen, Tu Minh Phuong, Long Hoang Dang

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.LG

AI总结 研究团队构建了首个越南文化比喻语言基准VIVID,评估发现越南专用NLP模型远弱于多语言系统,顶尖模型得分不足满分50%,少样本提示未必提升性能,VIVID为相关研究提供关键工具。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03959 2026-08-05 physics.ao-ph 新提交 78%

Prithvi-Precip: Integrating Satellite Observations into an Atmospheric AI Foundation Model for Precipitation Forecasting

Prithvi-Precip:将卫星观测数据整合进大气AI基础模型用于降水预报

Simon Pfreundschuh, Christian D. Kummerow, Johannes Schmude, Sujit Roy, Rahul Ramachandran, Tsengdar Lee, Valentine Anantharaj, Katherine H. Breen

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究基于Prithvi-WxC基础模型开发Prithvi-Precip,通过采用卫星降水训练目标、直接同化卫星观测数据及自回归滚动训练,大幅提升了中期降水预报精度,优于Goddard地球观测系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02039 2026-08-05 cs.CV 版本更新 78%

RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?

RSVideo:你的视觉-语言模型准备好应对遥感视频了吗?

Hongjie Zhou, Shiqin Wang, Haoyang Chen, Haonan Guo, Di Wang, Juhua Liu, Fu Lin, Yong Luo

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 该研究构建了遥感视频数据集RSVideo-10K与评估基准RSVideo-Bench,发现现有视觉-语言模型在遥感视频理解上存在不足,提出强化学习框架RSVideo提升小目标时空聚焦能力,取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27180 2026-08-05 cs.CV cs.RO 版本更新 78%

HumanCLAW: Can Vision-Language Models Act Through a Body?

HumanCLAW:视觉-语言模型能否通过实体身体执行动作

Li Siyao, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo

机构 * Meta Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学) Brown University(布朗大学) Northwestern University(西北大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究提出HumanCLAW框架与HumanCLAW-Bench基准,测试9个先进VLM发现其均未解决具身动作任务,最优仅16.8%成功率,核心缺失具身自我意识。

Comments Project page: https://human-claw.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03720 2026-08-05 cs.CL 新提交 77%

Detecting Hallucinations and Recovering Verified Answers in Arabic Islamic Question Answering

阿拉伯语伊斯兰问答中幻觉检测与可信答案恢复

Khaled Ziani

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对阿拉伯语伊斯兰问答场景,基于微调后的google/gemma-4-12B-it模型构建系统,实现了幻觉检测与可信答案选择的两步任务,在公开数据集上取得了优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03018 2026-08-05 cs.AI 新提交 77%

UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks

UrbanAgent:面向跨系统城市任务的工具增强型智能体

Jiayu Cao, Xingyuan Zeng, feiyu Li, Zhijing Huang, Xujie Yuan, Rongxiang Chen, Shimin Di, Libin Zheng, Jian Yin

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 针对城市数字服务碎片化问题,提出工具增强型智能体UrbanAgent,结合大语言模型与多类工具,引入基准Urban-Eval评估,在多模型上任务成功率达71%,领先基线10个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02672 2026-08-05 cs.CR cs.AI cs.ET cs.SE 新提交 77%

Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation

安全优先的Text-to-Terraform评估:针对安全基础设施即代码生成的大语言模型(LLMs)与小型语言模型(SLMs)基准测试

Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego Kreutz

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 该研究针对7款LLMs与SLMs开展Terraform生成基准测试,发现IaC的语法有效性与安全合规性正交,仅靠提示工程不足,自动化多工具扫描是必要补充。

Comments 10 pages, 1 figure, and 9 tables. The benchmark artifacts and CI/CD pipeline are publicly available at https://gitlab.com/repo-anon-iac/repo-anon-9ac. Accepted for publication at SBSeg 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02639 2026-08-05 cs.SE cs.AI 新提交 77%

Instruction Stacking Collapse: A Benchmark and the Capability-Dependent Value of Prompt Compilation

指令堆叠崩溃:基准测试集与提示词编译的能力依赖价值

Atul Anand, Sourav Chattaraj

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究构建了含24个指令的基准测试集,发现指令遵循率随堆叠指令数增加非线性下降,提出无需训练的指令编译器可提升较弱生产级LLM的指令遵循率,且该收益与模型能力相关。

Comments 13 pages, 11 figures. Benchmark, deterministic verifiers, and cached model responses released for full reproduction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03047 2026-08-05 cs.CV cs.MM 新提交 75%

AIDE: Automated Instruction via Distilled Expertise for Reference-Free Motor Skill Coaching

AIDE:基于提炼专业知识的自动化指令,用于无参考的运动技能指导

Yoshiki Ito

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 研究针对运动技能指导中专业教练稀缺的问题,提出AIDE框架,仅训练阶段用专业参考、推理阶段仅用学习者姿态生成反馈,在ExpertAF数据集上性能优于无参考基线,与需双阶段专业演示的方法相当。

Comments Accepted to ACM Multimedia 2026. 12 pages (including supplementary material), 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03464 2026-08-05 cs.AI cs.CL cs.HC 新提交 73%

ChartAnno: Evaluating MLLMs for Chart Annotation Generation

ChartAnno:评估多模态大语言模型的图表标注生成能力

Zhenghan Chen, Zekai Shao, Lidan Tan, Xin Lin, Xingchen Zeng, Yi Shan, Ziyue Lin, Xiaoliang Fu, Xinyuan Liu, Yuetong Guo, Fen Wang, Bongshin Lee, Siming Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChartAnno基准评估MLLMs的图表标注生成能力,实验显示专有模型表现更优,大规模开源模型正缩小差距,更具体指令可提升标注质量,图表图像仅在设计相关指标上有有限提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23258 2026-08-05 cs.AI cs.LG 版本更新 73%

CAPT: A Multi-task Continuous Autoregressive Transformer enabling Cross-dataset and Cross-species Transfer for Calcium Population Dynamics

CAPT:一种多任务连续自回归Transformer,实现钙群体动力学的跨数据集和跨物种转移

Xinhong Xu, Yimeng Zhang, Yuanlong Zhang

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对钙群体动力学模型跨数据集和物种推广难的问题,提出CAPT这一连续自回归群体Transformer,通过连续补丁令牌化策略建模,经多数据集实验验证,其在预测任务中性能优且能形成共享功能空间,为通用神经基础模型开辟新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10961 2026-08-05 cs.CL cs.AI 版本更新 73%

Obfuscation Rules for Detecting and Detoxifying Korean Toxicity

用于检测和去毒化韩语毒性内容的混淆规则

Yejin Lee, Su-Hyeon Kim, Hyundong Jin, Dayoung Kim, Yeonsoo Kim, Yo-Sub Han

机构 * Yonsei University(延世大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KOTOX数据集,通过定义基于语言学的韩语混淆规则和变换框架,支持对混淆毒性文本的去混淆与去毒化,首次同时实现韩语混淆毒性检测与净化。

Comments 28 pages, 12 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13801 2026-08-05 cs.LG cs.AI 版本更新 73%

Improving Reproducibility in Evaluation through Multi-Level Annotator Modeling

通过多级标注者建模提高评估的可重复性

Deepak Pandita, Flip Korn, Chris Welty, Christopher M. Homan

机构 * Rochester Institute of Technology(罗切斯特理工学院) Google Research(谷歌研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多级抽样方法,通过分析标注者数量与响应数量的平衡,提升评估结果的可重复性与统计显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11834 2026-08-05 cs.LG cs.CL 版本更新 73%

Don't Walk the Line: Boundary Guidance for Filtered Generation

不要走线:边界引导用于过滤生成

Sarah Ball, Andreas Haupt

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Stanford University, Department of Computer Science, Stanford, California, USA(斯坦福大学计算机科学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出边界引导方法,通过强化学习微调生成模型,使其远离分类器边缘,从而提升生成输出的安全性和实用性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04008 2026-08-05 cs.CL 新提交 70%

WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament

世界杯竞技场:前沿大语言模型在实时赛事上的前瞻性、无泄露评估

Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究构建世界杯竞技场基准,在2026世界杯期间让6个前沿LLMs实时预测,发现其平均准确率63.9%,无明显差异,将相关数据和代码作为基准发布。

Comments Project page: https://co-minder.github.io/worldcup2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03892 2026-08-05 cs.AI 新提交 70%

Intertemporal Preference Steering in Qwen3 via Contrastive Activation Addition

通过对比激活加法实现Qwen3的跨期偏好调控

Michal Mráz, Justin Shenk

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对Qwen3-32B大模型,通过对比线性探针识别时间范围方向,利用对比激活加法调控实现跨期偏好的双向大幅改变,还提升了规划相关能力,为相关AI系统及安全问题提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03691 2026-08-05 cs.SE cs.AI cs.CV 新提交 70%

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

像素上的模式:测量多模态代码生成中的模式完成偏差

Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对多模态代码生成中存在的模式完成偏差问题,构建了首个视觉模式完成偏差基准,评估发现前沿MLLMs均存在严重偏差,且偏差与视觉显著性密切相关。

Comments 41st IEEE/ACM International Conference on Automated Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03689 2026-08-05 cs.AI cs.SE 新提交 70%

LiveEvalBench: Toward Open-World Evaluation for Web Generation

LiveEvalBench:面向网页生成的开放世界评估

Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LiveEvalBench是将网页生成评估转为智能体驱动的自适应可扩展过程的自动化框架,经实验验证其与人类专家判断高度一致,可提供前沿模型网页生成能力的细粒度洞察

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03446 2026-08-05 cs.CL 新提交 70%

Predicting Multilingual Classification and Translation Performance of LLMs with Cross-Lingual Alignment $\unicode{x2013}$ Is English Enough?

用跨语言对齐性预测大语言模型的多语言分类与翻译性能——英语足够了吗?

Adnan Al Ali, Kathy Hämmerl, Jindřich Libovický, Alexander Fraser

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究对比分析27种跨语言对齐分数变体,提出基于PMI的翻译指标,发现用英语的跨语言对齐可相当或更好预测LLMs翻译性能,为LLMs以英语为内部枢纽语言提供新证据。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03397 2026-08-05 cs.AI 新提交 70%

MMLongBench-Doc-V2: A Corrected-Annotation, Semantics-Aware Revision of MMLongBench-Doc

MMLongBench-Doc-V2:MMLongBench-Doc的修正标注、语义感知修订版

Mingtian Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对MMLongBench-Doc基准的标注错误等问题,推出MMLongBench-Doc-V2,修正106个标注、调整评估方式,移除错误文件名和重复问题,形成不可与V1分数对比的新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02878 2026-08-05 cs.AI 新提交 70%

VeriTrace: Human-Like Temporal Exploration Completes Agentic Action Space

VeriTrace:类人时间探索完成智能体动作空间

Yu-Tung Liu, Cunxi Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VeriTrace是一种多智能体系统,通过赋予Inspector智能体完整调试动作空间实现类人时间探索,在VerilogEval-V2基准测试上首次达到100% Pass@1,准确率较最强复现基线提升5.1%。

Comments ICLAD 2026, Long Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02604 2026-08-05 cs.AI cs.IR 新提交 70%

ISEE: Interactive Semantic Enrichment for Database Fields

ISEE:数据库字段的交互式语义丰富

Yuan Tian, Yiru Chen, Rakesh R. Menon, Zifan Liu, Ting Cai, Fei Wu, Anudeep Chimakurthi, Prashanthi Ramamurthy, Sridevi Aishwariya Ganesan, Kun Qian, Yunyao Li

机构 * Purdue University(普渡大学) Adobe(奥多比公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出ISEE系统,通过评分、收集领域知识并与用户协作丰富数据库字段语义,可降低认知负荷、提升描述质量并增强下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02965 2026-08-05 cs.AI 版本更新 70%

Designing for Doubt: The Case for Informed Abstention in Autonomous Agents

基准测试无法衡量的:论自主智能体弃权能力的评估

Victor Ojewale, Suresh Venkatasubramanian

机构 * Brown University(布朗大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文指出自主智能体基准测试忽视弃权能力,提出合规偏差概念,并引入弃权场景分类和评估协议,实验表明安全-可用性权衡是可调的。

Comments Accepted to AIES 2026, this is an updated version to the RLEval workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26275 2026-08-05 cs.CL 版本更新 70%

SPEAR: Code-Augmented Agentic Prompt Optimization

SPEAR: 代码增强的智能体提示优化

Mengyin Lu, Cong Feng, Huimin Han, Guangming Lu, Yu Sun, Xiaonan Ding, Shihui Long, Fengyi Li, Tanvi Motwani

机构 * LinkedIn Corporation(领英公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SPEAR方法,将代码执行作为智能体工具进行提示优化,通过Python沙箱实现结构错误分析,并在工业任务和基准测试中取得显著提升。

Comments 19 pages, 3 figures, EMNLP 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17003 2026-08-05 cs.CY cs.CL 版本更新 70%

Beyond Simulations: What 20,000 Real Conversations Reveal About Mental Health AI Safety

超越模拟:20000次真实对话揭示心理健康AI安全

Caitlin A. Stamatis, Jonah Meyerhoff, Richard Zhang, Olivier Tieleman, Matteo Malgaroli, Thomas D. Hull

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究通过分析20000次真实对话,揭示心理健康AI在现实应用中的安全性能差异,指出专门设计的AI在减少有害内容生成方面表现更优,但测试集失败率高于实际部署,强调需转向持续的安全保障而非有限的基准认证。

Comments 43 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19818 2026-08-05 cs.MA cs.AI 70%

PhenoAssistant: A Conversational Multi-Agent AI System for Automated Plant Phenotyping

Feng Chen, Ilias Stogiannidis, Andrew Wood, Danilo Bueno, Dominic Williams, Fraser Macfarlane, Bruce Grieve, Darren Wells, Jonathan A. Atkinson, Malcolm J. Hawkesford, Stephen A. Rolfe, Tracy Lawson, Tony Pridmore, Mario Valerio Giuffrida, Sotirios A. Tsaftaris

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Journal ref Nat Commun 17, 6391 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11421 2026-08-05 cs.CL 版本更新 70%

States Hidden in Hidden States: Implicit Discrete State Representations Emerge in LLMs' Hidden States

隐藏状态中隐藏的状态:大型语言模型的隐藏状态中出现隐式离散状态表示

Junhao Chen, Shengding Hu, Zhiyuan Liu, Maosong Sun

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探索LLMs的符号计算能力,发现其隐藏状态中存在隐式离散状态表示(IDSRs),最强模型可直接计算最多15个加数的求和,但当前开源模型的IDSRs存在损耗会导致输出错误。

Comments 12 pages, 12 figures. Revised manuscript with public code and reproducibility artifacts; clarified the evaluation protocol; corrected figure labels and chance baselines, the attention-bridge description, cross-references, and probe notation. No new experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03734 2026-08-05 cs.SE 新提交 67%

We Must Have Missed This Comment: Detecting and Repairing Stale Function References in Linux Kernel Comments

我们一定漏掉了这条注释:检测和修复 Linux 内核注释中的过时函数引用

Kexin Sun, Yunbo Lyu, Xutong Ma, Hongyu Kuang, Ratnadira Widyasari, He Zhang, Xiaoxing Ma, Julia Lawall, David Lo

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对 Linux 内核注释中因函数变更导致的过时引用问题,提出三阶段方法 ReCite 检测并修复此类引用,在 v6.18-rc1 上检测到 869 个过时引用,其修复建议准确率高,提交的 75 个补丁中有 50 个被接受。

Comments Accepted at ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03392 2026-08-05 cs.SE 新提交 67%

Self-Evolving Coding Agents

自进化编码智能体

Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏