arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-08 至 2026-06-08 共收录 275 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 64 篇

2603.09403 2026-06-08 cs.CL 版本更新 90%

LLM as a Meta-Judge: Synthetic Data for NLP Evaluation Metric Validation

LLM作为元评判者:用于NLP评估指标验证的合成数据

Lukáš Eigler, Jindřich Libovický, David Hurych

机构 * Faculty of Mathematics and Physics, Charles University(数学与物理系,查尔斯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出LLM作为元评判者框架,通过控制语义退化生成合成数据替代人工判断,验证NLG评估指标,在多语言问答中元相关性超过0.9。

Comments 16 pages, 1 figure, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01494 2026-06-08 cs.SE 版本更新 89%

SWR-Bench: Assessing LLM Performance in Real-World Code Review Comment Generation

SWR-Bench:评估大语言模型在真实世界代码审查评论生成中的性能

Zhengran Zeng, Ruikai Shi, Keke Han, Yixin Li, Kaicheng Sun, Yidong Wang, Zhuohao Yu, Rui Xie, Wei Ye, Shikun Zhang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 SWR-Bench通过1000个手动验证的GitHubPull Requests,评估LLM在真实世界代码审查中的性能,提出客观评估方法并验证了多评论聚合策略,显著提升ACR性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07341 2026-06-08 cs.CR 新提交 89%

Empirical Evaluation of Large Language Models for Migration of Code Fragments to Post-Quantum Cryptography

大型语言模型在代码片段向后量子密码迁移中的实证评估

Javier Pallarés de Bonrostro, Ana I. González-Tablas, María Isabel González Vasco

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn)

AI总结 评估大型语言模型在将经典密码代码片段迁移至后量子密码中的能力,通过微调GPT-4.1-mini实现92.5%的功能正确率,优于零样本基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03160 2026-06-08 cs.AI cs.CL 版本更新 88%

VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models

VALUEFLOW:迈向大语言模型中多元化和可引导的基于价值的对齐

Woojin Kim, Sieun Hyeon, Jusang Oh, Jaeyoung Do

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能交叉学科项目)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出VALUEFLOW框架,通过分层价值嵌入、强度标注数据库和锚定评估器,实现大语言模型在价值强度上的可控对齐,解决现有方法在提取、评估和引导方面的不足。

Comments Accepted in ICML 2026 (Oral). Code available at https://github.com/AIDASLab/VALUEFLOW

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07054 2026-06-08 cs.CL cs.AI cs.CR cs.LG 新提交 88%

TRACE: Trajectory Reasoning through Adaptive Cross-Step Evidence Aggregation for LLM Agents

TRACE: 通过自适应跨步骤证据聚合的LLM智能体轨迹推理

Vijitha Mittapalli, Shreyaa Jayant Dani, Satya Srujana Pilli, Snigdha Ansu, Mohammadreza Teymoorianfard, Franck Dernoncourt, Hongjie Chen, Yu Wang, Ryan A. Rossi, Nesreen K. Ahmed

机构 * University of Massachusetts at Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究) Dolby Labs(杜比实验室) University of Oregon(俄勒冈大学) Cisco(思科)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TRACE框架,通过TIJ循环识别高信号区域、累积跨步骤证据并合成轨迹级判决,在SHADE-Arena的十个任务域上F1达0.713,召回率0.844,尤其擅长长距离证据链接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06869 2026-06-08 cs.AI 新提交 88%

Evidence-Based Intelligent Diagnostic and Therapeutic Visualization System with Large Language Models: Multi-Turn Interaction and Multimodal Treatment Plan Generation

基于证据的智能诊断与治疗可视化系统与大语言模型:多轮交互与多模态治疗方案生成

Yunhan Wang, Yuda Wang, Zhiying Tu, Mingqiang Song, Li Song, Kun Li, Dianhui Chu, Bolin Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室) Weihai Municipal Hospital(威海市人民医院) Shanghai Taizhu Technology Co., Ltd(上海泰山技术有限公司) Tianjin Zhifu Qihuang Medical Technology Co., Ltd(天津中孚启黄医疗技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出知识增强的可视化诊断系统,通过知识图谱约束、信息增益驱动提问和多模态治疗呈现,提升中医辨证透明度和治疗可解释性。

Comments 29 pages, 9 figures, 5 tables, including supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23204 2026-06-08 cs.AI 版本更新 88%

TSAQA: Time Series Analysis Question And Answering Benchmark

TSAQA:时间序列分析问答基准

Baoyu Jing, Sanhorn Chen, Lecheng Zheng, Boyu Liu, Zihao Li, Jiaru Zou, Tianxin Wei, Zhining Liu, Zhichen Zeng, Ruizhong Qiu, Xiao Lin, Yuchen Yan, Dongqi Fu, Jingchao Ni, Jingrui He, Hanghang Tong

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virginia Polytechnic Institute and State University(弗吉尼亚理工学院和州立大学) Amazon(亚马逊) Meta AI University of Houston(休斯顿大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 提出TSAQA基准,涵盖6种时间序列分析任务(含新型PZ格式),评估LLM在13领域21万样本上的表现,最佳模型仅65.08分。

Comments Comments: 35 pages, 7 figures. Accepted to the GEM Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04894 2026-06-08 cs.CR cs.AI 版本更新 87%

Extracting Recurring Vulnerabilities from Black-Box LLM-Generated Software

从黑盒LLM生成的软件中提取重复漏洞

Tomer Kordonsky, Amit LeVi, Maayan Yamin, Noam Benzimra, Avi Mendelson

机构 * Technion - Israel Institute of Technology(技术学院 - 以色列理工学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出特征-安全表(FSTab),通过黑盒攻击从前端特征预测后端漏洞,并量化模型跨程序、重述和领域的漏洞复现一致性,实验显示跨域攻击成功率高达94%。

Comments ICML 2026, Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07085 2026-06-08 cs.SE 新提交 87%

Porting Declarative UI to HarmonyOS: A Heuristic-guided LLM Approach

将声明式UI移植到鸿蒙:一种启发式引导的LLM方法

Kunwu Zheng, Pengyu Xue, Zhen Yang, Xiran Lyu, Peishi Lai, Mengying Zhao, Yutian Tang, Huizhi Zhang, Xianhang Li, Linhao Wu, Chengyi Wang

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract)

AI总结 针对鸿蒙系统从Android/iOS迁移声明式UI的需求,提出ArkTrans方法,通过启发式构建骨架和模式匹配修复语法错误,实现高编译成功率和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06779 2026-06-08 cs.IR cs.AI 新提交 86%

Mind the Gap: Bridging Behavioral Silos with LLMs in Multi-Vertical Recommendations

注意差距:用LLM弥合多垂直领域推荐中的行为孤岛

Nimesh Sinha, Raghav Saboo, Martin Wang, Sudeep Das

机构 * DoorDash Inc.(DoorDash公司)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出利用LLM从数据丰富垂直领域(如餐厅)向稀疏领域(如杂货)迁移知识的框架,通过分层RAG生成多级特征,集成到MTL排序模型,显著提升新兴业务个性化与参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17948 2026-06-08 cs.CR cs.AI cs.MA 版本更新 86%

RAVEN: Retrieval-Augmented Vulnerability Exploration Network for Memory Corruption Analysis in User Code and Binary Programs

RAVEN: 用于用户代码和二进制程序中内存损坏分析的检索增强漏洞探索网络

Parteek Jamwal, Minghao Shao, Boyuan Chen, Achyuta Muthuvelan, Asini Subanya, Boubacar Ballo, Kashish Satija, Mariam Shafey, Mohamed Mahmoud, Moncif Dahaji Bouffi, Pasindu Wickramasinghe, Siyona Goel, Yaakulya Sabbani, Hakim Hacid, Mthandazo Ndhlovu, Eleanna Kafeza, Sanjay Rawat, Muhammad Shafique

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RAVEN框架,结合LLM代理与检索增强生成,自动生成遵循Google Project Zero模板的漏洞分析报告,在105个样本上平均质量得分54.21%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09552 2026-06-08 cs.IR cs.AI cs.CL 版本更新 86%

MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval

MCERF:通过增强检索推进工程文档的多模态大语言模型评估

Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu

机构 * School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269) Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MCERF框架,结合多模态检索器ColPali与大语言模型推理,通过混合查找、视觉文本融合、高推理和自一致性决策等策略,在DesignQA基准上实现平均准确率相对提升41.1%,无需完整规则书摄入即可处理工程文档中的多模态问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06881 2026-06-08 cs.LG 新提交 85%

GlucoFM-Bench: Benchmarking Time-Series Foundation Models for Blood Glucose Forecasting

GlucoFM-Bench:血糖预测的时间序列基础模型基准测试

Baiying Lu, Zhaohui Liang, Ryan Pontius, Shengpu Tang, Temiloluwa Prioleau

机构 * Department of Computer Science(计算机科学系) Dartmouth College(达特茅斯学院) Emory University(埃默里大学) Quantitative Biomedical Sciences(定量生物医学科学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出GlucoFM-Bench基准,评估8种时间序列基础模型与监督深度学习模型在15个糖尿病数据集上的血糖预测性能,发现预训练模型在零样本和少样本场景表现优异,但全样本下轻量LSTM仍最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04123 2026-06-08 cs.CY cs.AI cs.LG cs.SE 版本更新 85%

Measuring Agents in Production

生产环境中的智能体测量

Melissa Z. Pan, Negar Arabzadeh, Riccardo Cogo, Yuxuan Zhu, Alexander Xiong, Lakshya A Agrawal, Huanzhi Mao, Emma Shen, Sid Pallerla, Liana Patel, Shu Liu, Tianneng Shi, Xiaoyuan Liu, Jared Quincy Davis, Emmanuele Lacavalla, Alessandro Basile, Shuyi Yang, Paul Castro, Daniel Kang, Koushik Sen, Dawn Song, Joseph E. Gonzalez, Ion Stoica, Matei Zaharia, Marquita Ellis

机构 * University of California at Berkeley(加州大学伯克利分校) IBM Research(IBM研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 通过对86个已部署系统的调查和20个案例研究,发现生产环境中的LLM智能体主要采用简单可控的方法,可靠性是首要挑战,并依赖系统级设计和人工评估。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026) as Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15084 2026-06-08 physics.plasm-ph cs.AI cs.LG 版本更新 84%

TokaMind: A Multi-Modal Transformer Foundation Model for Tokamak Plasma Dynamics

TokaMind: 用于托卡马克等离子体动力学的多模态Transformer基础模型

Tobia Boschi, Andrea Loreti, Nicola C. Amorisco, Rodrigo H. Ordonez-Hurtado, Cécile Rousseau, George K. Holt, Eszter Székely, Alexander Whittle, Samuel Jackson, Adriano Agnello, Stanislas Pamela, Alessandra Pascale, Robert Akers, Juan Bernabe Moreno, Vassil Alexandrov, Mykhaylo Zayats

机构 * IBM Research(IBM研究院) UK Atomic Energy Authority(英国原子能局) STFC Hartree Centre(科学与技术设施研究中心哈特ree中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出TokaMind,首个开源托卡马克等离子体动力学基础模型,基于多模态Transformer在MAST数据集上预训练,支持多种数据模态和缺失信号处理,在14个任务上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06788 2026-06-08 cs.CL cs.HC 新提交 83%

Explain Like I'm 5 or Whatever I Choose: Evaluating the Interactive Potential of Language Model Responses

像对五岁小孩一样解释或随我选择:评估语言模型响应的交互潜力

Indu Panigrahi, Tal August

机构 * Siebel School of Computing and Data Science(计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 提出基于语言复杂度的交互评估框架,测试GPT-5.1等模型生成不同复杂度响应的能力,发现最佳模型仅46%时间正确调整复杂度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07167 2026-06-08 cs.CL cs.AI 新提交 82%

UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding

UrduMMLU:乌尔都语理解的大规模多任务基准

Ahmer Tabassum, Sarfraz Ahmad, Hasan Iqbal, Owais Aijaz, Momina Ahsan, Preslav Nakov

机构 * MBZUAI

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对乌尔都语缺乏本地教育来源的MMLU风格基准,提出包含26,431道多选题的UrduMMLU,覆盖26个学科,评估30个LLM发现Gemini-3.5-Flash最佳,多数模型在人文科目上表现差。

Comments 27 pages, 18 figures, 17 tables, Submitted to ARR May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06959 2026-06-08 cs.CL cs.AI 新提交 82%

OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios

OpenHalDet:面向多种生成场景的幻觉检测统一基准

Xinyi Li, Zhen Fang, Yongxin Deng, Jinyuan Luo, Hongnan Ma, Changdae Oh, Zijing Shi, Shanshan Ye, Hanchen Wang, Shu-Lin Chen, Yadan Luo, Mengyue Yang, Sean Du, Sharon Li, Ling Chen

机构 * University of Technology Sydney(新南威尔士大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Bristol(布里斯托大学) The University of Queensland(昆士兰大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出OpenHalDet基准,标准化幻觉检测评估流程,支持黑盒、灰盒、白盒检测器,实现跨任务、模型和检测器的可控比较。

Comments Preprint. Code and data are available at https://github.com/Nellie179/Hallucination-Detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07300 2026-06-08 cs.CL 新提交 81%

Phun-Bench: Evaluating LLMs on Phonological Understanding in Chinese

Phun-Bench:评估大语言模型的中文语音理解能力

Xing Yue, Yongliang Shen, Weiming Lu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Phun-Bench基准,通过同音、押韵和语音相似性三个维度系统评估大语言模型的语音理解能力,发现模型在灵活运用语音知识方面存在不足。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06871 2026-06-08 cs.LG 新提交 81%

Evidence-Grounded Ensemble Diagnosis of 802.11 Packet Captures: A Multi-Stage Pipeline with Deterministic Reliability Scoring

基于证据的802.11数据包捕获集成诊断:具有确定性可靠性评分的多阶段流水线

Jerome Henry, Swadhin Pradhan, Miroslav Popovic

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出PROBE多阶段流水线,通过确定性证据框架和集成方法解决LLM在802.11诊断中的幻觉、置信度偏差和评估偏见问题,在87个企业Wi-Fi捕获上实现0.957的加权证据F1分数和96%的自动接受率。

Comments 37 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09634 2026-06-08 cs.CL 版本更新 81%

Creation of the Estonian Subjectivity Dataset: Assessing the Degree of Subjectivity on a Scale

爱沙尼亚主观性数据集的创建:评估主观性程度的一个量表

Karl Gustav Gailit, Kadri Muischnek, Kairit Sirts

机构 * University of Tartu(塔尔图大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文创建了爱沙尼亚语文档级主观性数据集,通过连续量表标注并分析标注一致性,初步实验使用大语言模型进行自动主观性分析,发现自动评分可行但不可完全替代人工。

Comments 9 pages, 5 figures, 3 appendixes, LREC 2026

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026) 8204-8216

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07017 2026-06-08 cs.AI cs.CL cs.ET 新提交 81%

The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

基础模型智能体的仿真到现实差距:统一MDP视角

Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出将基础模型智能体的评估与训练差距形式化为经典仿真到现实问题,围绕MDP四要素(观测、动作、转移、奖励)构建统一框架,并倡导采用域随机化等成熟解决方案。

Comments 7 pages, 2 figures, 2 tables. Accepted by KDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02600 2026-06-08 cs.LG cs.AI 版本更新 81%

Step-Wise Refusal Dynamics in Autoregressive and Diffusion Language Models

自回归与扩散语言模型中的逐步拒绝动态

Eliron Rahimi, Elad Hirshel, Rom Himelstein, Amit LeVi, Avi Mendelson, Chaim Baskin

机构 * Department of Computer Science, Technion – Israel Institute of Technology(技术学院计算机科学系,以色列技术学院) INSIGHT Lab, School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Israel(内斯坦实验室,贝内-加隆大学内加尔分校,以色列) Computer Science Department, University of Haifa, Haifa, Israel(海法大学计算机科学系,海法,以色列)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究扩散语言模型(DLM)与自回归(AR)模型在拒绝有害生成行为上的差异,发现扩散重掩码机制可促进恢复,提出逐步拒绝内部动态(SRI)信号,并基于此构建无需修改推理的越狱检测器。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07457 2026-06-08 cs.LG eess.SP stat.ML 新提交 80%

Time series Foundation Models based on Physics-Informed Synthetic Histories for Cold-Start Photovoltaic Forecasting

基于物理信息合成历史的时间序列基础模型用于冷启动光伏预测

Lorenzo Longarini, Alessandro Rongoni, Simone Silenzi, Emanuele Frontoni, Riccardo Rosati

机构 * European Commission(欧洲委员会)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 针对光伏电站冷启动预测问题,提出利用物理信息合成历史数据,结合时间序列基础模型进行零样本预测,在440个站点上实现1.7-2倍性能提升。

Comments To be published in the 2nd ICML Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06843 2026-06-08 cs.SE 新提交 80%

Empirical Study on the Characteristics and Evolution of AI-usage in GitHub Repositories: Evidence from Code Comments

GitHub仓库中AI使用特征与演化的实证研究:来自代码注释的证据

Abdullah Al Mujahid, Preetha Chatterjee, Mia Mohammad Imran

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 通过分析35,361条提及AI的GitHub代码注释及后续提交,发现开发者主要用LLM实现代码,随后频繁重构、集成和修复,AI引用从代码生成转向知识支持和代码增强。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06726 2026-06-08 cs.NI 新提交 80%

Natural Language Access Control (NLAC): From Help Desk Requests to Structured Policies

自然语言访问控制(NLAC):从帮助台请求到结构化策略

Jonas Wessner, Tobias Meuser, Janek Schoffit, Dennis Eisermann, Johannes Deger, Björn Scheuermann, Frank Kargl

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出基于LLM的自然语言访问控制架构NLAC,通过嵌入相似度提取子图将策略翻译准确率提升至98.7%,并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06890 2026-06-08 cs.CV cs.LG 新提交 79%

Diagnosing Visual Ignorance in Vision-Language Models

诊断视觉语言模型中的视觉忽视

Runyu Zhou, Qi Zhang, Qixun Wang, Yisen Wang

机构 * Peking University(北京大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 研究视觉语言模型依赖语言先验的内部机制,通过层替换和探针分析揭示多阶段瓶颈,并引入渐进视觉退化指标发现基准测试可能奖励视觉忽视。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06696 2026-06-08 cs.CV cs.AI 新提交 79%

MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models

MMBU: 大规模多模态生物医学理解基准,用于探测视觉语言模型的感知能力

Ryan D'Cunha, Alejandro Lozano, Xiaoxiao Sun, Daniel Vela Jarquin, Min Woo Sun, Josiah Aklilu, James Burgess, Yuhui Zhang, Ryan Nayebi, Paola Avila, Robayo, Jin Ye, Ming Hu, Zhongying Deng, Junjun He, Xin Chen, Yue Yao, Robert Tibshirani, Jeffrey J. Nirschl, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Instituto Tecnológico de Monterrey(蒙特雷技术学院) Monash University(墨尔本大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出MMBU基准,涵盖35个子模态,通过分类、定位和检测任务系统评估VLM在生物医学领域的视觉感知和泛化能力,发现高准确率可能掩盖感知缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06647 2026-06-08 cs.LG q-bio.NC 新提交 79%

The Identity Trap in EEG Foundation Models: A Diagnostic Audit

脑电图基础模型中的身份陷阱:一项诊断性审计

Jun-You Lin, Ying Choon Wu, Tzyy-Ping Jung

机构 * National Yang Ming Chiao Tung University University of California, San Diego

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 提出FMScope协议,通过方差分解、主题轴擦除等五种诊断方法,揭示EEG基础模型在受试者分离交叉验证中可能依赖受试者身份特征而非临床生物标志物,并验证了该陷阱的普遍性及可移除性。

Comments 28 pages, 6 figures, 8 tables. Code available at https://github.com/Jimmy110101013/fmscope

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06825 2026-06-08 cs.CL cs.AI 新提交 73%

Progress-SQL: Improving Reinforcement Learning for Text-to-SQL via Progressive Rewards

Progress-SQL: 通过渐进式奖励改进文本到SQL的强化学习

Shihao Zhang, Xiaoman Wang, Yuan Liu, Yunshi Lan, Weining Qian

机构 * East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Progress-SQL,一种多轮强化学习框架,通过Oracle引导诊断树(ODT)生成子句级结构反馈,结合渐进式奖励(结构对齐、词汇对齐、延迟奖励和执行状态奖励),提升文本到SQL生成的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏