arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-03 至 2026-06-03 共收录 404 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 84 篇

2510.21011 2026-06-03 cs.HC cs.AI cs.CY 87%

Generating the Modal Worker: A Cross-Model Audit of Race and Gender in LLM-Generated Personas Across 41 Occupations

生成模态工人:跨模型审计41个职业中LLM生成人设的种族与性别

Ilona van der Linden, Sahana Kumar, Arnav Dixit, Aadi Sudan, Smruthi Danda, David C. Anastasiu, Kai Lukoff

机构 * Human-Computer Interaction Lab, Computer Science and Engineering(人机交互实验室,计算机科学与工程) Santa Clara University(圣克拉拉大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究审计了四个大型语言模型生成的150多万个职业人设,通过与BLS数据对比,发现模型压缩了人口统计变异,系统性地扭曲了种族和性别代表性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05302 2026-06-03 cs.AI 87%

PieArena: Ranking and Profiling Language Agents in Realistic Negotiation Scenarios

PieArena:在真实谈判场景中对语言智能体进行排名与画像

Chris Zhu, Sasha Cui, Will Sanok Dufallo, Runzhi Jin, Zhen Xu, Linjun Zhang, Daylian Cain

机构 * Yale University(耶鲁大学) UC Berkeley(加州大学伯克利分校) BloomBerg(摩根大通) Rutgers University(罗格斯大学)

专题命中 评测与基准 :language agent(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文提出PieArena基准,通过多智能体交互评估LLM的谈判能力,并开发排名模型与行为画像,发现联合意图框架对中低端模型提升显著,前沿模型(如GPT-5)在谈判中达到或超过人类基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02809 2026-06-03 cs.CV 87%

Automated Report-Derived Oncology VQA Benchmark for Evaluating Vision-Language Models on 3D Medical Imaging

自动化报告驱动的肿瘤学VQA基准:用于评估3D医学影像上的视觉-语言模型

Bo Liu, Hanxue Gu, Xiangru Li, Zheren Zhu, Jacob Ellison, Kang Wang, Janine M. Lupo, Yang Yang, Hui Lin

机构 * UCSF–UC Berkeley Joint Graduate Program in Bioengineering(UCSF-伯克利生物工程联合研究生项目) Department of Radiology, UCSF(UCSF放射科) Department of Radiation Oncology, UCSF(UCSF放射肿瘤科)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 提出一个自动化管道,从私有放射学报告和3D肿瘤影像生成多选VQA数据集,构建无污染基准,评估六种视觉-语言模型,发现视觉依赖因数据集而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03116 2026-06-03 eess.AS cs.AI cs.SD 86%

AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

AnyAudio-Judge:基于动态评分标准的音频指令跟随基准与评估器

Haitao Li, Tian Tan, Yuguang Yang, Shan Yang, Xie Chen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文脉)

专题命中 评测与基准 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对指令引导音频生成中复杂指令解耦困难、评估缺乏可解释性和细粒度属性匹配的问题,提出基于动态评分标准的评估范式,通过自适应分解音频描述为可验证的二元评分项,并构建包含7920个样本的双语基准和105K训练语料,结合SFT与GRPO训练专用评估器,在零样本对齐检测和下游强化学习指令对齐中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03852 2026-06-03 cs.SE cs.AI 85%

FLARE: Fine-Grained Diagnostic Feedback for LLM Code Refinement

FLARE: 面向大语言模型代码精炼的细粒度诊断反馈

Yinsheng Yao, Hongxiang Zhang, Weixi Tong, Tianyi Zhang

机构 * Tongji University(同济大学) Purdue University(普渡大学)

专题命中 评测与基准 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FLARE框架,利用轻量级诊断模型预测行级可疑信号进行缺陷定位和代码精炼,通过Top-K候选搜索提升修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03657 2026-06-03 cs.AI 85%

Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition

诊断大语言模型工具使用中的知识缺口:面向新API获取的智能体基准

Jinnuo Liu, Yue Peng, Jinhan Niu, Hongyi Wen

机构 * NYU Shanghai(纽约大学上海分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出 NovelAPIBench 基准,通过动态发现新API、分解知识包并生成可执行任务,诊断模型在API使用中的六类错误,发现检索与参数调优互补。

Comments 37 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13996 2026-06-03 cs.AI 85%

DTop-p MoE: Sparsity-Controlled Dynamic Top-p MoE for Foundation Model Pre-training

DTop-p MoE:面向基础模型预训练的稀疏度可控动态Top-p MoE

Can Jin, Hongwu Peng, Mingcan Xiang, Qixin Zhang, Xiangchi Yuan, Amit Hasan, Ohi Dibua, Yifan Gong, Yan Kang, Dimitris N. Metaxas

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DTop-p动态路由机制,通过比例积分控制器学习Top-p概率阈值并采用动态路由归一化,在全局稀疏约束下实现层间专家选择,一致优于Top-k和固定Top-p基线,且FLOPs与Top-k MoE相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03165 2026-06-03 cs.CL cs.AI 85%

Fully Automated Identification of Lexical Alignment and Preference-Stage Shifts in Large Language Models

大型语言模型中词汇对齐和偏好阶段转变的完全自动识别

Thomas Stephan Juzek, Xiaoyang Ming, Jose A. Hernandez

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出两种无需人工干预的评估指标——词汇对齐分数和三角化偏好转变,用于自动识别大型语言模型中的词汇过度使用及其与人类偏好学习的关联。

Comments 16 pages, 2 figures, 10 tables

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pages 6116-6131

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03144 2026-06-03 cs.AI 84%

GTBench: A Curriculum-Grounded Benchmark for Evaluating LLMs as Mathematical Research Assistants in Graph Theory

GTBench:一个基于课程体系的基准,用于评估大语言模型作为图论数学研究助手的能力

Noujoud Nader, Ibrahem Aljabea, Patrick Diehl, Deepti Gupta

机构 * Louisiana State University(路易斯安那州立大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) Texas A&M-Central Texas(德克萨斯大学阿姆斯特朗中央分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出GTBench基准,通过三个难度递增的图论问题组(本科定义、算法推理、研究生证明)评估大语言模型的数学推理能力,发现GPT-5表现最佳,其他模型随难度下降显著,并揭示了人类与自动评估者之间的系统性分歧。

Comments 19 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02754 2026-06-03 cs.LG 84%

$Ψ$-Bench: Evaluating Persona-Sensitive Influencing in Persuasive Dialogues

$\Psi$-Bench: 评估说服性对话中人格敏感的影响力

Peixuan Han, Hongyi Du, Jiayu Liu, Yihang Sun, Yutong Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);language agent(abstract);分类 cs.LG

AI总结 提出 $\Psi$-Bench 基准,通过三个现实场景评估 LLM 利用用户画像进行说服的能力,发现当前模型仍有较大提升空间,且用户画像带来 18.24% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02640 2026-06-03 cs.CR cs.AI 84%

D-Judge: Disrupting Multi-Turn Jailbreaks using Semantics-Preserving Output Rewriting

D-Judge: 使用语义保持输出重写破坏多轮越狱攻击

Huanli Gong, Zhipeng Wei, Yu Fu, Haz Sameen Shahgir, Ananya Gupta, Yue Dong, N. Benjamin Erichson

机构 * University of California, Berkeley(加州大学伯克利分校) International Computer Science Institute(国际计算机科学研究所) University of California, Riverside(加州大学河滨分校) Lawrence Berkeley National Laboratory(伯克利国家实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出D-Judge防御方法,通过语义保持的输出重写干扰攻击者的评判模型反馈循环,从而降低多轮越狱攻击的成功率。

Comments Proceedings of the 43rd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02959 2026-06-03 cs.LG cs.CR 83%

Gate AI: LLM Security Benchmark Evaluation Methodology and Results

Gate AI:大语言模型安全基准评估方法与结果

Ryle Goehausen, Marcus Sousa

机构 * constellationnetwork(Constellation Network)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对提示注入和越狱检测器评估中数据集阈值调优和操作点未公开的问题,提出一种采用5折交叉验证、全局操作点选择和多种泛化诊断的评估框架,并在16个公开基准上进行了测试。

Comments 17 pages, 23 figures, 2 tables. Working preprint; subsequent versions may update benchmark numbers as the framework evolves

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17149 2026-06-03 cs.AI 83%

ProtocolBench: Which LLM MultiAgent Protocol to Choose?

ProtocolBench:选择哪个LLM多智能体协议?

Hongyi Du, Jiaqi Su, Jisen Li, Lijie Ding, Yingxuan Yang, Peixuan Han, Xiangru Tang, Kunlun Zhu, Jiaxuan You

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出ProtocolBench基准,系统比较多智能体协议在任务成功率、延迟、开销和鲁棒性上的表现,并设计可学习的协议路由器ProtocolRouter以动态选择最优协议。

Comments Accepted to ICML 2026. Camera-ready version.Code and benchmark artifacts: https://github.com/ulab-uiuc/AgentProtocols

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26791 2026-06-03 cs.DL cs.AI cs.CL cs.CY 82%

Crystal: Characterizing Relative Impact of Scholarly Publications

Crystal: 表征学术出版物的相对影响力

Hannah Collison, Benjamin Van Durme, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Crystal方法,利用大语言模型对引用论文进行联合排序,通过多数投票消除位置偏差,以更准确地区分高影响力引用,在人工标注数据集上准确率提升9.5%,F1提升8.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01576 2026-06-03 cs.CV 82%

Cryo-Bench: Benchmarking Foundation Models for Cryosphere Applications

Cryo-Bench:面向冰冻圈应用的基础模型基准测试

Saurabh Kaushik, Lalit Maurya, Beth Tellman, Valerio Marsocci

机构 * Center for Sustainability and the Global Environment (SAGE), University of Wisconsin–Madison(可持续性与全球环境中心(SAGE),威斯康星大学麦迪逊分校) Portsmouth AI and Data Science Centre (PAIDS), School of Computing, University of Portsmouth(波特茅斯人工智能与数据科学中心(PAIDS),计算学院,波特茅斯大学) ESA, ESRIN, φ \varphi -lab, Frascati(欧洲航天局(ESA),欧洲空间研究中心(ESRIN),φ实验室,弗拉斯卡蒂)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 提出Cryo-Bench基准,评估14个地理基础模型在冰冻圈关键组件(如冰川、冰湖、海冰等)上的性能,发现UNet在冻结编码器下平均mIoU最高(66.38),而全微调结合学习率调整可提升性能12.77%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03601 2026-06-03 cs.SE cs.AI 81%

DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair

DDOR: 用于可解释过度拒绝测试与修复的Delta调试方法

Qinyan Zhou, Peixin Zhang, Jun Sun, Haonan Zhang, Dongxia Wang

机构 * Southeast University(东南大学) Singapore Management University(新加坡管理学院) Zhejiang University(浙江大学) Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DDOR框架,通过delta调试定位最小拒绝触发片段(mRTF),实现黑盒环境下大语言模型过度拒绝行为的自动化测试与修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03005 2026-06-03 cs.AI 81%

From Moderation to Mediation: Can LLMs Serve as Mediators in Online Flame Wars?

从审核到调解:LLMs能否充当在线论战中的调解员?

Dawei Li, Abdullah Alnaibari, Arslan Bisharat, Manuel Sandoval, Deborah Hall, Yasin Silva, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Loyola University Chicago(芝加哥洛约拉大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探索大型语言模型(LLMs)能否超越内容审核,作为调解员通过判断对话公平性和情感动态并生成共情缓和信息来化解在线冲突,实验表明API模型在推理和干预一致性上优于开源模型。

Comments Accepted by PAKDD 2026 special session on Data Science: Foundations and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09685 2026-06-03 cs.IR cs.AI cs.MM cs.SD eess.AS 81%

TalkPlayData 2: An Agentic Synthetic Data Pipeline for Multimodal Conversational Music Recommendation

TalkPlayData 2:用于多模态对话式音乐推荐的智能体合成数据流水线

Keunwoo Choi, Seungheon Doh, Juhan Nam

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出TalkPlayData 2,一个由智能体数据流水线生成的多模态对话式音乐推荐合成数据集,通过多角色大语言模型模拟对话并覆盖多种场景,以支持生成式推荐模型训练。

Comments 2025-10-08: updating the stat table with the latest numbers. updated the abstract per the latest license terms

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03689 2026-06-03 cs.LG cs.AI 81%

Staying Alive: Uncensored Survival Analysis with Tabular Foundation Models

保持存活:基于表格基础模型的无审查生存分析

Mariana Vargas Vieyra

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种无需训练的生存回归方法,利用表格基础模型预测事件时间并迭代填补右删失数据,构建加速失效时间模型,在标准基准上表现与需训练的模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02461 2026-06-03 cs.AI cs.CL 81%

AgentCL: Toward Rigorous Evaluation of Continual Learning in Language Agents

AGENTCL:面向语言代理持续学习的严格评估

Yiheng Shu, Bernal Jiménez Gutiérrez, Saisri Padmaja Jonnalagedda, Yuguang Yao, Huan Sun, Yu Su

机构 * The Ohio State University(俄亥俄州立大学) Johns Hopkins University(约翰霍普金斯大学) Intuit AI Research(Intuit AI研究)

专题命中 评测与基准 :language agent(title,abstract);分类 cs.CL、cs.AI

AI总结 提出AGENTCL评估框架,通过可控任务流和迁移增益指标,严格评估语言代理的持续学习能力,并开发MemProbe探针方法诊断记忆设计的影响。

Comments 10 pages in the main text, 26 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03410 2026-06-03 cs.CV 80%

Enginuity: A Dataset and Benchmark for Vision-Language Understanding of Engineering Diagrams

Enginuity:工程图纸视觉语言理解的数据集与基准

Abhishek Kumar, Isha Motiyani, Tilak Kasturi, Ethan Seefried, Prahitha Movva, Tirthankar Ghosal

机构 * Predii Oak Ridge National Laboratory(橡树岭国家实验室) Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);prompting(abstract)

AI总结 针对工程图纸领域缺乏公开基准的问题,提出首个开放数据集Enginuity,通过结构化零件表提取和自由形式视觉问答两项任务评估前沿VLM,揭示零件识别与描述保真度之间的系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02852 2026-06-03 cs.SE 80%

Dependency-Guided Repository-Level C-to-Rust Translation with Reinforcement Alignment

依赖引导的仓库级C到Rust翻译与强化对齐

Jia Feng, Wenjie Gan, Cuiyun Gao, Chaozheng Wang, Feng Luo, Xin Xia, Ge Li, Kui Liu

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出DepTrans框架,通过强化对齐语法训练和依赖引导迭代精炼,实现仓库级C到Rust的高效翻译,编译成功率和计算准确性分别提升22.8和17.3个百分点。

Comments Accepted by FSE 2026 Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03644 2026-06-03 cs.LG 79%

Spatial Transcriptomics-Guided Alignment Enhances Molecular Profiling in Pathology Foundation Model

空间转录组学引导的对齐增强病理基础模型中的分子分析

Fengtao Zhou, Yingxue Xu, Zhengyu Zhang, Yihui Wang, Zhengrui Guo, Ling Liang, Jiabo Ma, Cheng Jin, Ziyi Liu, Huajun Zhou, Hongyi Wang, Du Cai, Chenglong Zhao, Xi Wang, Can Yang, Yu Wang, Wenbin Li, Feng Gao, Zhe Wang, Zhenhui Li, Xiuming Zhang, Li Liang, Hao Chen

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(计算机科学与工程系,香港科学与技术大学,香港特别行政区,中国) Department of Pathology, Nanfang Hospital, Southern Medical University, Guangzhou, China(pathology department, 南方医科大学南芳医院,广州,中国) Department of Pathology, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China(pathology department, 南方医科大学基础医学学院,广州,中国) Guangdong Province Key Laboratory of Molecular Tumor Pathology, Guangzhou, China(广东省分子肿瘤病理学重点实验室,广州,中国) Jinfeng Laboratory, Chongqing, China(金风实验室,重庆,中国)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 提出STAMP框架,利用空间转录组数据通过通路感知对齐策略增强病理基础模型的分子感知能力,并在多层级评估中验证其临床效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23469 2026-06-03 cs.LG 79%

Towards Fair Graph Prompting: A Dual-Prompt Mechanism for Mitigating Attribute and Structural Bias

面向公平图提示:一种缓解属性与结构偏差的双提示机制

Yuhan Yang, Xingbo Fu, Jundong Li

机构 * University of Michigan(密歇根大学) University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :prompting(title,abstract);分类 cs.LG

AI总结 提出自适应双提示框架(ADPrompt),通过自适应特征修正和自适应消息校准两个模块,在适应预训练GNN的同时缓解节点属性与图结构中的偏差,实现公平的节点分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03980 2026-06-03 cs.LG cs.CL 79%

Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill

Skill-RM: 通过智能体技能统一异构评估标准

Tao Chen, Gangwei Jiang, Pengyu Cheng, Siyuan Huang, Yihao Liu, Jingwei Ni, Jiaqi Guo, Mengyu Zhou, Kai Tang, Junling Liu, Qinliang Su, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(通义千问大模型应用团队,阿里巴巴) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) ETH Zürich University of Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 提出Skill-RM框架,将奖励建模重构为可重用的奖励评估技能执行,通过动态选择和聚合证据统一异构评估标准,在奖励基准和下游任务中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03540 2026-06-03 cs.CV 78%

Attend to Anything: Foundation Model for Unified Human Attention Modeling

关注一切:统一人类注意力建模的基础模型

Wenzhuo Zhao, Ronghao Xian, Keren Fu, Qijun Zhao

机构 * College of Computer Science, Sichuan University, Chengdu, 610065, China(四川大学计算机学院) National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University, Chengdu, 610065, China(合成视觉基础科学国家重点实验室)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出 Attend to Anything Model (AAM),一种多模态基础模型,通过层次化语言提示和双曲空间嵌入统一图像、视频和视听任务中的注意力建模,并在16个基准上平均提升6%,视频推理加速约4倍。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03530 2026-06-03 cs.CR cs.NI 78%

Towards Intrusion Detection Systems for RPL-based IoT Networks using Foundation Models

基于基础模型的RPL物联网网络入侵检测系统

Elias Lunderbye, Sourasekhar Banerjee, Christian Rohner, Andreas Johnsson

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究探索使用基础模型(MOMENT)检测和识别RPL物联网网络中的多种攻击类型,在Cooja模拟数据集上实现了与现有方法相当的检测性能并有效区分攻击类型。

Comments 4 pages, accepted to Swedish National Computer Networking Workshop (SNCNW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01624 2026-06-03 cs.CV cs.SE 75%

What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs

下一步测试什么:驾驶视觉语言模型中可解释的覆盖缺口发现

Abhishek Aich, Sparsh Garg, Vijay Kumar BG, Turgun Yusuf Kashgari, Manmohan Chandraker

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 提出 SliceScorer 和 SliceNav 方法,通过结合暴露先验和邻居失败先验的确定性评分规则,在驾驶视觉语言模型中有效发现高风险覆盖缺口,并支持可解释和可审计的验证流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22480 2026-06-03 cs.AI cs.CL cs.LG 75%

VeRO: A Harness for Agents to Optimize Agents

VeRO: 用于优化智能体的智能体框架

Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan Xue, Samuel Marc Denton

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 VeRO 框架和 VeRO-Bench 基准,通过版本化快照、预算控制评估和结构化执行轨迹来优化智能体代码,并实验比较不同优化器对目标智能体的改进效果。

Comments Accepted to the Forty-Third International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01472 2026-06-03 cs.DC cs.AI cs.LG 74%

Hierarchical Online Prompt Mutation with Dual-Loop Feedback for Guardrailed Evidence Document Generation: A Production-Evaluation Case Study

分层在线提示变异与双环反馈用于有护栏的证据文档生成:生产评估案例研究

Nataraj Agaram Sundar, Tejas Morabia

机构 * eBay Inc.(eBay公司)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI、cs.LG;LLM(comments)

AI总结 提出分层在线提示变异框架HOPM,通过双环反馈(人工审核与自动评判)优化提示策略,在真实市场纠纷证据生成中显著提升胜率和质量。

Comments 7 pages. Production-evaluation case study of guardrailed LLM evidence-document generation

详情

展开后加载摘要…

URL PDF HTML 收藏