arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-09 至 2026-06-09 共收录 718 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 161 篇

2606.08630 2026-06-09 cs.LG cs.AI 新提交 81%

Tyan-WP: A Wind Power Foundation Model for Ultra-Short-Term Probabilistic Forecasting

Tyan-WP:用于超短期概率预测的风电基础模型

Jiahui Huang, Ao Luo, Lei Liu, Hongwei Zhao, Tengyuan Liu, Ruibo Guo, Bo Wang, Zhao Wang, Bin Li

机构 * School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) China Electric Power Research Institute(中国电力科学研究院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出首个风电基础模型Tyan-WP,通过静态站点嵌入和功率感知气象融合模块,在零样本场景下实现超短期概率预测,显著优于传统模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08408 2026-06-09 cs.CL cs.AI 新提交 81%

TimpaTeks: Automatic In-place Text Sequence Modification via Diffusion Language Model Steering

TimpaTeks: 通过扩散语言模型引导实现自动原地文本序列修改

Ryandito Diandaru, Ikhlasul Akmal Hanif, Fadli Aulawi Al Ghiffari, Ahmed Elshabrawy, Alham Fikri Aji

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出TimpaTeks方法,将激活引导扩展到扩散语言模型,实现原地文本修改以改变概念,在情感和概念引导任务上降低困惑度并保持句子结构。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24384 2026-06-09 cs.CL cs.AI 81%

Side-by-side Comparison Amplifies Dialect Bias in Language Models

并排比较加剧语言模型中的方言偏见

Kritee Kondapally, Claire J. Smerdon, Pooja C. Patel, Ogheneyoma Akoni, Jevon Torres, Jaspreet Ranjit, Matthew Finlayson, Swabha Swayamdipta

机构 * University of Southern California(美国南加州大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过并排比较标准美式英语和非裔美国英语的推文,发现语言模型中的隐性方言偏见在对比设置下显著加剧,且显性方言偏见在安全对齐微调后仍存在。

Comments In proceeding at ACM Conference on Fairness, Accountability, and Transparency 2026

Journal ref In The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18347 2026-06-09 cs.CL cs.AI 版本更新 81%

Multilingual Training and Evaluation Resources for Vision-Language Models

面向视觉语言模型的多语言训练和评估资源

Daniela Baiamonte, Elena Fano, Matteo Gabburo, Stefano Simonazzi, Leonardo Rigutini, Andrea Zugarini

机构 * Villanova.ai Aithlas

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出跨五种欧洲语言的视觉语言模型训练与评估资源,通过再生与翻译方法生成高质量多语言数据,验证多语言数据在非英语基准上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09395 2026-06-09 cs.SE 新提交 80%

Empirical Study for Structured Output Control in LLMs for Software Engineering

软件工程中大语言模型结构化输出控制的实证研究

Yewei Song, Prateek Rajput, Tiezhu Sun, Saad Ezzini, Tegawendé F. Bissyandé, Jacques Klein

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 针对LLM在软件工程中输出格式不匹配问题,提出TTMG方法消除语法错误,但结构性和语义错误仍存在,表明核心瓶颈超越语法格式化。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09060 2026-06-09 cs.SE 新提交 80%

ATTAIN: Automated Exploit Failure Analysis through Trace-Driven Diff Analysis

ATTAIN: 通过轨迹驱动的差异分析实现自动化漏洞利用失败分析

Xinwei Mao, Zirui Chen, Xing Hu, Xin Xia

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出ATTAIN框架,通过轨迹驱动差异分析自动评估库版本中的漏洞存在性,结合LLM搜索相关变更,F1达93.24%,优于现有方法。

Comments Accepted by Internetware2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08096 2026-06-09 cs.SE 新提交 80%

Identifying unique developers in OSS projects: A family of models

识别OSS项目中的唯一开发者:一系列模型

Ruoyu Su, Alexander Bakhtin, Matteo Esposito, Davide Taibi, Valentina Lenarduzzi

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 针对开源项目中开发者别名导致耦合度量失真问题,提出基于Indel相似度和LLM辅助匹配的流水线,训练并比较多种机器学习模型,以平衡精度与计算开销。

Comments ACCEPTED REGISTERED REPORT AT ESEM (CORE A*) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04799 2026-06-09 cs.CR 版本更新 80%

Maris: A Formally Verifiable Privacy Policy Enforcement Paradigm for Multi-Agent Collaboration Systems

Maris:一种用于多智能体协作系统的形式化可验证隐私策略执行范式

Jian Cui, Zichuan Li, Chi Wang, Luyi Xing, Xiaojing Liao

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对多智能体协作系统(MACS)中敏感数据泄露风险,提出一种基于引用监视器的隐私增强开发范式Maris,通过嵌入消息流控制机制实现细粒度数据保护,并在AutoGen和LangChain框架中实现,实验表明其能有效缓解数据泄露威胁且保持高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11012 2026-06-09 cs.SE 版本更新 80%

Beyond Accuracy: Behavioral Dynamics of Agentic Multi-Hunk Repair

超越准确率:智能体多块修复的行为动力学

Noor Nashid, Daniel Ding, Keheliya Gallaba, Ahmed E. Hassan, Ali Mesbah

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 研究LLM驱动的编码智能体在多块缺陷修复中的行为,通过404个多块bug的1616条修复轨迹分析定位、修复准确率、回归行为及操作动力学,发现修复准确率随bug分散度和复杂度下降,且失败修复消耗更多资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10196 2026-06-09 cs.LG cs.AI 版本更新 80%

Large Models for Time Series and Spatio-Temporal Data: A Survey and Outlook

时间序列与时空数据的大模型:综述与展望

Ming Jin, Yaxuan Kong, Yuxuan Liang, Chaoli Zhang, Siqiao Xue, Xue Wang, James Zhang, Yi Wang, Haifeng Chen, Xiaoli Li, Vincent S. Tseng, Yu Zheng, Lei Chen, Hui Xiong, Shirui Pan, Qingsong Wen

机构 * Griffith University(格里菲斯大学) University of Oxford(牛津大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Zhejiang Normal University(浙江师范大学) Ant Group(蚂蚁集团) Alibaba Group(阿里巴巴集团) Deloitte Service LLP(德勤服务有限责任公司) The University of Hong Kong(香港大学) NEC Laboratories America(NEC美国实验室) A*STAR National Yang Ming Chiao Tung University(阳明交通大学) JD Technology(京东科技) Squirrel Ai Learning

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 综述了面向时间序列和时空数据的大模型,按数据类型、模型类别、范围和应用领域分类,总结了通用与领域专用模型,并整理了相关资源与开放问题。

Comments Accepted by ACM Computing Surveys; 35 Pages; Github Repo: https://github.com/qingsongedu/Awesome-TimeSeries-SpatioTemporal-LM-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09670 2026-06-09 cs.CV cs.AI 新提交 79%

Visual Prompting Meets Feature Reconstruction-Based Anomaly Detection with Dual-Teacher Supervision

视觉提示结合基于特征重建的双教师监督异常检测

Mateo Diaz-Bone, Daniel Caraballo, Florian Scheidegger, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Roy Assaf, Niccolo Avogaro, Yagmur G. Cinar, Brown Ebouky, Filip M. Janicki, Piotr S. Kluska, Cezary Skura, Cristiano Malossi

机构 * IBM Research Europe Zurich(IBM欧洲研究院苏黎世分院)

专题命中 评测与基准 :prompting(title,abstract);分类 cs.AI

AI总结 针对异常检测在真实场景中因物体尺度、视角等变化失效的问题,提出视觉提示管道、解冻教师模型和扩散生成数据增强,在AeBAD数据集上提升3.5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08970 2026-06-09 cs.AI 新提交 79%

An Effective Router for Vision-Language Model Selection

一种有效的视觉-语言模型选择路由器

Can Wang, Shengwei Wang, Bolin Zhang, Zhiying Tu, Dianhui Chu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 针对视觉-语言模型(VLM)选择中数据缺乏、特征表示无效和模型空间僵化的问题,提出ARMS路由器,通过增强输入信号和扩展训练策略,在分布内和分布外测试集上表现优异,仅800M参数即可超越GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07706 2026-06-09 cs.CR cs.AI 新提交 79%

MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models

MLingualFC: 评估多语言视觉语言模型中的越狱漏洞

Rishabh Makwana, Mamta, Deeksha Varshney, Oana Cocarascu

机构 * Dwarkadas Jivanlal Sanghvi College of Engineering(达沃拉斯·吉万拉尔·桑格维工程学院) King’s College London(伦敦国王学院) Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出多语言多模态基准MLingualFC,使用流程图编码有害指令评估多语言VLM的越狱漏洞,发现拉丁语系攻击成功率显著高于非拉丁语系,揭示安全机制跨语言泛化不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07653 2026-06-09 cs.CV cs.AI 新提交 79%

A Dataset for Dynamic Human Preferences for Vision Language Models

面向视觉语言模型的动态人类偏好数据集

Hannah Gao, Dylan Hadfield-Menell, Rachel Ma

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出一个评估视觉语言模型理解动态人类偏好能力的基准,通过自动化管道生成包含图像依赖变化的数据集,并评估了现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07595 2026-06-09 cs.CV cs.AI cs.IR 新提交 79%

VisualLeakBench: Reproducible Action-Boundary Propagation Failures in Vision-Language Agents

VisualLeakBench: 视觉语言智能体中可复现的动作边界传播失败

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language agent(title,abstract);分类 cs.AI

AI总结 提出VisualLeakBench基准,评估视觉语言智能体在截图、文档等场景下将敏感文本从图像复制到工具参数中的动作边界传播失败,发现PII传播率达78.8%,不安全文本传播率达85.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22097 2026-06-09 cs.SE cs.AI cs.CL cs.CR 版本更新 79%

SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios

SecureVibeBench: 通过重建引入漏洞的场景来基准测试AI代理的安全振动编码

Junkai Chen, Huihui Huang, Yunbo Lyu, Junwen An, Jieke Shi, Chengran Yang, Ting Zhang, Haoye Tian, Yikun Li, Zhenhao Li, Xin Zhou, Xing Hu, David Lo

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SecureVibeBench,一个包含105个C/C++安全编码任务的基准测试,旨在评估AI代理在真实场景中生成安全代码的能力,发现现有方法在评估人类与AI代理对比时的不足。

Comments ACL 2026 Main Conference. Our code and data are on https://github.com/iCSawyer/SecureVibeBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07779 2026-06-09 astro-ph.IM astro-ph.GA 新提交 78%

Do Vision-Language Models See Dwarf Galaxies the Way We Do?

视觉语言模型是否像我们一样看待矮星系?

Dimitrios Tanoglidis, Chin Yi Tan, Kate Overdeck, Alex Drlica-Wagner

专题命中 评测与基准 :language model(title,abstract)

AI总结 评估视觉语言模型在识别超暗矮星系候选体任务中的表现,发现零样本模型能复现人类整体校准,但在个体层面存在显著差异,且不确定性估计不可靠。

Comments 8 pages, 4 figures; Accepted at the Conference on Physics and AI at Stanford University (PAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07775 2026-06-09 cs.CV 新提交 78%

DALE-CT: Depth-Aware Foundation Models for Computed Tomography

DALE-CT: 用于计算机断层扫描的深度感知基础模型

Evan W. Damron, Mahmut S. Gokmen, Mitchell A. Klusty, Caroline N. Leach, Emily B. Collier, V. K. Cody Bumgardner

机构 * University of Kentucky(肯塔基大学)

专题命中 评测与基准 :foundation model(title);language model(abstract)

AI总结 提出DALE-CT,一种基于LeJEPA的2D切片模型,通过3D深度感知预训练(利用解剖掩膜和异常标注)提升表示质量,在CT多异常检测中达到与3D视觉语言模型近似的性能。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07641 2026-06-09 cs.CV 新提交 78%

Readable Yet Unpredictable: Rotated-Outcome Prediction in Vision-Language Models

可读但不可预测:视觉语言模型中的旋转结果预测

Lexin Wang, Shenghua Liu, Yiwei Wang, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究视觉语言模型能否仅从原图预测180°旋转后的内容,引入RotOutBench基准,发现模型能识别但无法预测旋转结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14441 2026-06-09 eess.SP 版本更新 78%

Batch Effects In Brain Foundation Model Embeddings

脑基础模型嵌入中的批次效应

Ye Tao, Bradley T. Baker, Yu Wu, Anand D. Sarwate, Sandeep Panta, Sergey Plis, Vince D. Calhoun

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究评估了两个脑影像基础模型在多中心fMRI数据集中的嵌入表现,发现嵌入编码了显著的批次相关变异,并探讨了和谐化对嵌入的影响,揭示了不同模型对区域活动和区域交互的偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09826 2026-06-09 cs.CV cs.AI 新提交 77%

OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics

OmniGameArena: 一个统一的UE5基准测试,用于具有改进动态的VLM游戏智能体

Mingxian Lin, Shengju Qian, Yuqi Liu, Yi-Hua Huang, Yiyu Wang, Wei Huang, Yitang Li, Fan Zhang, Zeyu Hu, Lingting Zhu, Xin Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) LIGHTSPEED The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出OmniGameArena,一个包含12个UE5游戏的统一基准,以及改进动态曲线(IDC),通过反思机制评估VLM智能体的冷启动分数、改进动态和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08840 2026-06-09 cs.AI cs.SE 新提交 77%

Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs

超越通过率:开放代码大语言模型的多语言、执行基础评估

Sayed Erfan Arefin

机构 * Sayed Erfan Arefin

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 针对12种编程语言的2707道LeetCode问题,评估9个开放代码LLM,发现最佳模型Yi-Coder-9B-Chat的正确率仅23.64%,远低于人类57.2%的基准,且排名因问题难度和语言而异,编译错误占失败原因的63.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22079 2026-06-09 cs.CL 版本更新 77%

Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements

Ishigaki-IDS-Bench: 一个用于从BIM信息需求生成信息交付规范的基准

Ryo Kanazawa, Koyo Hidaka, Teppei Miyamoto, Takayuki Kato, Tomoki Ando, Chenguang Wang, Dayuan Jiang, Naofumi Fujita, Shuhei Saitoh, Atomu Kondo, Koki Arakawa, Daiho Nishioka

机构 * ONESTRUCTION Inc.(ONESTRUCTION公司) AWS GenAI Innovation Center(AWS生成式人工智能创新中心)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文提出Ishigaki-IDS-Bench基准,用于评估大型语言模型生成符合行业标准的XML信息交付规范(IDS)的能力,通过166个由BIM/IDS专家编写和验证的示例,结合内容一致性评估和结构审核,展示了当前LLM在生成满足IDS标准和IFC词汇约束的XML方面的局限性。

Comments 7 pages; benchmark data and evaluation scripts are available on GitHub and Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09595 2026-06-09 cs.IR 新提交 75%

Popcorn: A Configurable Benchmark for Visual Evidence in Multimodal Movie Recommendation

Popcorn: 多模态电影推荐中视觉证据的可配置基准

Ali Tourani, Fatemeh Nazary, Yashar Deldjoo, Tommaso Di Noia

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 提出Popcorn基准,通过配置合同标准化多模态电影推荐中的视觉证据(全片、预告片、缩略图)的嵌入、融合与评估,实验表明视觉源不可互换且影响推荐性能。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09380 2026-06-09 cs.LG cs.AI cs.CL 新提交 75%

Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

推理竞技场:当可验证奖励不足时的轨迹锦标赛

Han Zhou, Adam X. Yang, Laurence Aitchison, Anna Korhonen, Albert Q. Jiang

机构 * University of Cambridge(剑桥大学) Mistral AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出推理竞技场框架,通过轨迹锦标赛将无梯度信号的非多样奖励组转化为相对奖励信号,结合Bradley-Terry模型高效整合强化学习,在数学和编码基准上平均提升7.6%,加速训练27%-41%。

Comments 9 pages, 6 figures, 2 tables (17 pages including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08426 2026-06-09 cs.HC 新提交 75%

CritLens: Visual Analytics for Criteria Discovery in Review-Based Decision Making

CritLens:基于评论决策中标准发现的视觉分析

Hongjia Wu, Shuai Zhou, Hongxin Zhang, Wei Chen

专题命中 评测与基准 :LLM(summary_cn,abstract_cn)

AI总结 提出CritLens系统,利用LLM将评论转化为AHP决策模型,通过嵌入空间覆盖缺口检测、交互式权重调整和多级记分卡,支持用户迭代发现和验证个性化决策标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04464 2026-06-09 cs.CY econ.GN q-fin.EC 版本更新 75%

Bounded by Risk, Not Capability: Quantifying AI Occupational Substitution Rates via a Tech-Risk Dual-Factor Model

受风险限制而非能力:通过技术-风险双因素模型量化AI职业替代率

Shuyao Gao, Minghao Huang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过技术-风险双因素模型量化AI职业替代率,揭示了职业替代并非瞬间发生,而是渐进过程,并指出算法概率无法涵盖专家受专业责任限制的'机构溢价'。

Comments 32 pages, 4 figures. v2: added link to the reproducibility repository (https://github.com/ShuyaoGao/bounded-risk-oai), updated author email, and updated several references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07623 2026-06-09 cs.LG cs.LO 新提交 74%

Finite Certificates for In-Context Determinacy and a Threshold Theory of Emergence in Language Models

上下文确定性有限证书与语言模型中涌现的阈值理论

Faruk Alpay, Hamdi Alakkad

机构 * Bahcesehir University(巴切谢希尔大学)

专题命中 评测与基准 :language model(title);分类 cs.LG

AI总结 提出用有限语义证书验证上下文条件语言模型行为,证明有限域线性任务族中确定性准则,并证明阈值涌现的反幻象定理,将阈值度量与语义置信度分离。

Comments 40 pages; ancillary files provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08682 2026-06-09 cs.LG cs.AI 新提交 73%

Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation

激活引导引发突现失调:一项更全面的评估

Qi Cao, Jian Lou, Meiting Liu, Wenjie Feng, Dan Li, See-Kiong Ng, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究激活引导是否引发突现失调,通过扩展评估范围,发现激活引导可导致广泛失调,且比微调产生更连贯的有害响应,并分析了关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08200 2026-06-09 cs.AI cs.LG 新提交 73%

Online Agent-as-a-Judge: Situation-Generating Evaluation for Interactive Agents

在线智能体作为裁判:面向交互式智能体的情境生成评估

Hyogon Ryu, Jeonghwan Kim, Yewon Lim, Chaeun Lee, Jeongwook Kim, Donghoon Ham

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出在线智能体作为裁判框架,通过部署环境内评估智能体主动生成相关情境,以评估交互式社交智能体的能力,提高标准覆盖率和与人类标签的一致性。

Comments ICML 2026 Workshop on Trustworthy AI for Good

详情

展开后加载摘要…

URL PDF HTML 收藏