arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2607.14770 2026-07-17 cs.LG 新提交 70%

ChronoQG: Towards a Temporally Expressive and Hop-Bounded Benchmark for Temporal Knowledge Graph Question Generation

ChronoQG:迈向用于时态知识图谱问题生成的具有时态表现力和跳数限制的基准

Xuemeng Liu, Zhengpin Li, Wanpeng Tang, Haotong Xie, Wentao Zhang

机构 * Nankai University(南开大学) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.LG

AI总结 研究时态知识图谱问题生成,提出ChronoQG框架,通过整合多种方法构建有时态表现力和跳数限制的基准数据集,评估多种设置下的相关方法,揭示静态KGQG与TKGQG差距,为时态忠实问题生成提供测试平台。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14604 2026-07-17 cs.LG cs.IR stat.ME 新提交 70%

Accelerating A/B-Tests with Counterfactual Estimation: Reducing Variance through Policy Overlap

通过反事实估计加速A/B测试:通过策略重叠降低方差

Olivier Jeunen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究在线控制实验中A/B测试方差大成本高问题,提出利用策略重叠加速实验的新协议,将随机处理分配机制视为元策略,用Δ-离策略估计方法获无偏估计,理论和实证证明该方法可提升效率,有望用于多种系统评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14591 2026-07-17 cs.CL 新提交 70%

How Well Does AI-Generated Feedback Work? Intrinsic and Extrinsic Evaluation across more than 20,000 EFL Essay Drafts

人工智能生成的反馈效果如何?对20000多篇外语作文草稿的内在和外在评估

Steven Coyne, Diana Galvan-Sosa, Ryan Spring, Machi Shimmei, Michael Zock, Keisuke Sakaguchi, Kentaro Inui

机构 * Tohoku University(东北大学) RIKEN(理化学研究所) ALTA Institute, Computer Laboratory, University of Cambridge(剑桥大学ALTA研究所,计算机实验室) CNRS, LIS, Aix-Marseille University(法国国家科学研究中心,艾克斯-马赛大学语言信息处理实验室) MBZUAI(Mohamed bin Zayed大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究外语写作中人工智能生成的书面纠正性反馈效果,通过大学外语班级近2000名学生的超20000篇草稿,从教师内在评估和学生外在反馈两角度评估,发现传统专家评估与学生反馈一致性低,强调以学习者为中心评估框架的重要性。

Comments Pre-review version of DOI https://doi.org/10.1007/978-3-032-29788-4_35, presented at AIED 2026 Late Breaking Results. Readers are encouraged to refer to the published version

Journal ref AIED CCIS 3031 (2026) 247-253

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14387 2026-07-17 cs.AI cs.RO 新提交 70%

Chat2Scenic: An Iterative RAG-Based Framework for Scenario Generation in Autonomous Driving

Chat2Scenic:一种基于迭代检索增强生成的自动驾驶场景生成框架

Yuan Gao, Wenting Miao, Mattia Piccinini, Haoyu Wang, Qunying Song, Johannes Betz

机构 * Technical University of Munich(慕尼黑工业大学) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所) University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究自动驾驶场景生成难题,提出Chat2Scenic这一基于迭代检索增强生成的框架,通过聊天机器人界面及RAG技术生成DSL场景脚本,构建开放基准,评估结果显示其性能优于现有方法。

Comments Accepted at 2026 IEEE International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15107 2026-07-17 cs.LG math.CT 新提交 70%

Learning in Infinitesimal Non-Compositional Sketches

在无穷小非组合草图中学习

Sridhar Mahadevan

机构 * Adobe Research(Adobe研究院) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究如何通过LINCS框架修复机器学习中非组合性问题,将问题指定为草图,利用切提升和INC自函子,把机器学习表述为寻找余代数不动点,证明特定条件下最终INC余代数存在,正进行多场景实验评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13548 2026-07-16 cs.AI 新提交 70%

How Far Can Root Cause Analysis Go on Real-World Telemetry Data?

根因分析在实际遥测数据上能走多远?

Athira Gopal, Ashwanth Krishnan

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究生产微服务故障根因分析难题,提出结构化多智能体RCA管道,性能超现有方法。引入反向推理智能体和自动规则挖掘管道,发现故障证据多,瓶颈在智能体推理能力,模型推理和领域知识是主要限制,进步需模型改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13111 2026-07-16 cs.SE cs.AI 新提交 70%

SemaDiff: Identifying Semantic-Changing Commits with Generated Code and Tests

SemaDiff:使用生成的代码和测试识别语义变化的提交

Maha Ayub, Michael Konstantinou, Ahmed Khanfir, Nikolaos Tsantalis, Mike Papadakis

机构 * SnT, University of Luxembourg(卢森堡大学SnT分校) RIADI, ENSI, University of Manouba(突尼斯曼努巴大学RIADI与ENSI分校) Concordia University(康科德大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究软件仓库挖掘中区分语义保留与变化提交的问题,提出SemaDiff方法,通过行为分析、生成额外调用方法及依赖类等,实现对提交的语义判断,实验表明该方法能较准确地区分,语义变化提交检测精度高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12375 2026-07-15 cs.CV cs.AI eess.IV 新提交 70%

IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment

IQA-T1:基于工具的图像质量评估视觉证据推理

Jinjian Wu, Jiaqi Tang, Wei Wei, Yingying Yan, Jianmin Chen, Botong Geng, Lei Zhang, Qifeng Chen

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对开放世界图像质量评估难题,提出IQA-T1框架,通过自主调用工具生成视觉证据增强多模态大语言模型推理,构建Q-Tool数据集,实验表明该框架性能最佳且评估可解释、基于证据。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11849 2026-07-14 cs.CL 新提交 70%

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

高级数学基准测试:用于高级数学证明生成与验证的基准测试套件

Lingkai Kong, Zijian Wu, Yuzhe Gu, Haiteng Zhao, Wenyong Huang, Shuang Sun, Zhicheng Xiong, Xiaotian Zhang, Shuya Zhao, Yan Wang, Disheng Xu, Wenwei Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai Jiao Tong University(上海交通大学) Great Bay University(大湾区大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 介绍用于评估高级数学推理能力的AdvancedMathBench基准测试套件,含ProverBench证明生成基准及自动验证管道,还有VerifierBench。实验显示前沿模型在证明生成与验证上表现不佳,该套件对模型提升高级数学证明能力有挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11503 2026-07-14 cs.CL 新提交 70%

GEIS: A Generation-Evaluation-Improvement Loop of Agent Skills for Long-Form Article Generation

GEIS:用于长篇文章生成的智能体技能生成-评估-改进循环

Jiale Zhang, Juntao Hu, Zhijian Ou

机构 * Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能实验室) TasiTech Co., Ltd., China(泰赛科技有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对长篇文章生成难题,提出GEIS循环,通过在Tasi Harness中实现文章写作、证据图像收集等技能,经核心写作、成对评估及改进技能,在20个主题实验中提升了PDF质量得分,证明可将其转变为可改进循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11151 2026-07-14 cs.CR cs.AI 新提交 70%

AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation

AMT-X:基于清单门控评估的阶段结构化多轮红队测试

Yi Ting Shen, Kentaroh Toyoda, Alex Leung

机构 * Vulcan Research, AIFT(Vulcan研究,AIFT)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型安全评估问题,提出AMT-X框架,将攻击设为多阶段状态机,用多角色评审团取代单评判评分,在六个前沿受害者模型和七个审核子类别测试中,不同门控下攻击成功率有显著差异,揭示了部分与完全可操作危害的差距。

Comments A reference implementation is available at https://github.com/VulcanLab/amt-x

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11141 2026-07-14 cs.AI 新提交 70%

NextFund: A Unified Performance Tracking Platform for Agentic Portfolio Management

NextFund:用于智能投资组合管理的统一绩效跟踪平台

Changlun Li, Peixian Ma, Qiqi Duan, Zhenyu Lin, Peineng Wu

机构 * Paradoox AI Research(帕拉多克斯人工智能研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于大语言模型智能体参与投资组合管理的评估问题,提出NextFund平台,通过时间一致的市场准入等实现智能体行为可观察,能跨市场比较模型等,在多地股票上展示其可实现更公平基准测试和可行诊断的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11127 2026-07-14 cs.CL cs.CY 新提交 70%

Do LLMs Fabricate Legal Citations? A Bilingual Benchmark on Saudi Data Protection Law and the GDPR

大语言模型会编造法律引用吗?关于沙特数据保护法和通用数据保护条例的双语基准测试

Noura Suliman Alrajeh

机构 * IT Department, King Abdulaziz University, Jeddah, Saudi Arabia(国王阿卜杜勒阿齐兹大学信息科技系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型对法律引用的编造情况,通过120个双语问题的基准测试评估三个模型,发现对GDPR和沙特PDPL存在管辖权差距,编造与法律管辖权有关,模型置信度无法保障,提出用逐字验证保障合规筛选。

Comments 5 pages, 3 tables. Benchmark data and model outputs to be released. Also archived at Zenodo: 10.5281/zenodo.21320218

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10617 2026-07-14 cs.LG 新提交 70%

modelDNA: Calibrated Lineage Verification and Merge Decomposition from Sampled Weight Fingerprints

modelDNA:从采样权重指纹进行校准谱系验证和合并分解

Muhammad Awais Bin Adil, Saad Aamir

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 研究开放权重语言模型谱系验证问题,提出modelDNA工具,通过HTTP读取指纹识别模型,与参考数据库比较并返回判定类别,实现高AUROC和零误报,还能进行合并分解,恢复混合权重,公开相关数据可离线重现。

Comments Code: https://github.com/AwaisAdilKhokhar/modelDNA . Data: https://huggingface.co/datasets/AwaisAdilKhokhar/modeldna-atlas . Live scanner: https://huggingface.co/spaces/AwaisAdilKhokhar/modelDNA . DOI: 10.5281/zenodo.21305586

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10123 2026-07-14 cs.SE cs.AI 新提交 70%

A Large-Scale Dataset of MCP Implementations on GitHub

GitHub 上 MCP 实现的大规模数据集

Benny Toeppe, Amine Barrak, Emna Ksontini

机构 * Oakland University(奥克兰大学) University of North Carolina Wilmington(北卡罗来纳州温斯洛普大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对模型上下文协议(MCP)在开源开发中的应用情况,通过混合管道从 GitHub 收集并验证相关数据,构建了大规模数据集,分析得出 Python 和 TypeScript 主导 MCP 开发且混合架构最常见,为 MCP 生态系统研究建立基准并支持相关未来研究。

Journal ref Proceedings of MSR '26: 23rd International Conference on Mining Software Repositories, April 13-14, 2026, Rio de Janeiro, Brazil. ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10113 2026-07-14 cs.AI 新提交 70%

Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries

动态智能体技能:不断演进的技能库的生命周期调查与分类法

Yubo Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体中技能库随时间的变化,通过分类法、生命周期架构和技能记录模式等工具组织文献,合成证据分级模式,指出相关问题并提出报告标准及开放问题。

Comments Accepted by TMLR (2026.07), OpenReview Link: https://openreview.net/forum?id=cjU3YbcRr8

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09804 2026-07-14 cs.CR cs.AI 新提交 70%

Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B

简单提示重构绕过谷歌MedGemma-4B中的安全护栏

Avi-ad Avraam Buskila

机构 * Department of Information Science and Applied Artificial Intelligence, Bar-Ilan University, Ramat Gan, Israel(信息科学与应用人工智能系,巴伊兰大学,拉马特甘,以色列)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 研究谷歌MedGemma-4B在安全护栏方面的问题,构建全因子基准测试,通过多种攻击方式和法官编码量化其表现,发现重新解释请求的框架能提高攻击成功率,且稳健性受主题主导,呼吁为开放医学模型加强部署时护栏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09789 2026-07-14 cs.AI cond-mat.mtrl-sci 新提交 70%

PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language

PHITSBench:用于使用自然语言生成人工智能辅助的PHITS辐射传输输入的执行评分基准

Xianglin Ji, Svetlana V. Boriskina

机构 * MIT(麻省理工学院)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 介绍用于PHITS辐射传输输入生成的PHITSBench基准,涵盖三类任务。评估五种基于GPT - 5.4的配置,无特定知识时模型在编辑和修复任务表现好,Reproduce任务差。知识目录和智能体执行可提升成功率,结果显示建模进展依赖多方面因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09654 2026-07-13 cs.CV cs.AI 新提交 70%

Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models

十年视觉语言人工智能模型中准确性和视觉认知错误的演变

Shravan Murlidaran, Miguel P. Eckstein

机构 * Psychological & Brain Sciences, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校心理与脑科学系) Department of Computer Science, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校计算机科学系) Department of Electrical and Computer Engineering, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校电气与计算机工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究十年间视觉语言模型进展,引入CSB数据集,评估模型在其上及MS-COCO样本中的准确性与视觉认知错误类型,发现MLLM消除简单与复杂场景描述准确性差距,几乎消除多数错误类型,为模型发展提供全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08768 2026-07-10 cs.CL 新提交 70%

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

UniClawBench:面向实际任务中主动智能体的通用基准测试

Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。

Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08269 2026-07-10 cs.AI 新提交 70%

PolyUQuest: Verifiable Structure-Aware Web RAG over Heterogeneous Graphs

PolyUQuest:基于异构图的可验证结构感知网络检索增强生成

Ying Liu, Yi Ye, Quanyu Feng, Mingxi Ye, Mingtao Zhang, Haoyang Li, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对现有RAG系统不足,提出基于异构图的PolyUQuest框架。通过双层路由器分配查询到三种检索模式,答案可验证。在PolyU官网等评估中,该框架在多方面优于现有系统,还提供交互式界面,准备部署为学生问答服务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07824 2026-07-10 cs.MA cs.AI 新提交 70%

From Triggers to Emotions: A CPM-Grounded Appraisal Multi-Agent for Dynamic Emotional Evolution in Persona-Based Dialogue

从触发因素到情感:基于CPM的评估多智能体模型用于基于角色的对话中的动态情感演变

Jingyao Cai, Shuaijun Liu, Abdul Rehman, Yutong Guo, Qin Tian, Thomas Dolby, Sue Green, Chantel Cox, Xiaosong Yang

机构 * National Centre for Computer Animation(国家计算机动画中心) Information Hub(信息中心) Key Laboratory of Child Cognition & Behavior Development of Hainan Province(海南省儿童认知与行为发展重点实验室) Chief Technology Officer(首席技术官) School of Health and Care(健康与护理学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对基于角色对话中情感模拟的局限,借鉴CPM理论提出CPM - MultiAgent框架,通过情感触发提取、协作评估和状态更新实现情感一致的角色模拟,经多种实验验证能有效模拟动态情感演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06413 2026-07-08 stat.ME cs.AI 新提交 70%

An Experimental Design Approach to Evaluating Agentic AI's Autonomous Model Discovery

一种评估智能体人工智能自主模型发现的实验设计方法

Hao He, Xueying Liu, Chris J. Kuhlman, Xinwei Deng

机构 * Department of Statistics, Virginia Tech(统计学系,弗吉尼亚理工学院) Department of Statistical Science, Baylor University(统计科学系,贝勒大学) Advanced Research Computing, Virginia Tech(高级研究计算,弗吉尼亚理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型语言模型编码智能体自主模型发现行为,提出实验设计与分析框架,将智能体视为随机模型发现算子,在多种受控因素下研究Codex和Claude Code两个算子,进行回归模型和推理,开发规范分解,通过网络造词游戏测试平台得出相关深刻发现。

Comments 39 pages, 11 figures, 6 tables. Data and code available at the GitHub repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06196 2026-07-08 cs.CL cs.CY 新提交 70%

Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability

Pluralis v0.1:迈向用于人工智能风险与可靠性的多元文化、多模态、多语言基准测试

Alicia Parrish, Rajat Shinde, Sanket Badhe, Xinyi Bai, Sree Bhargavi Balija, Hua-Rong Chu, Emilio Ferrara, Armstrong Foundjem, Rajat Ghosh, Aakash Gupta, Xuanli He, Ong Chen Hui, Minji Jung, Madhangi Karimanal, Faiza Khan Khattak, Boryoung Kim, Eugenia Kim, Liliya Lavitas, Seok Min Lim, Victor Lu, Jim Moirangthem, Dhivya Nagasubramanian, Deepak Pandita, Sita Rajagopal, Geetha Raju, Evgeniia Razumovskaia, Aravind Reddy, Federico Ricciuti, Nobin Sarwar, Sungpil Shin, Sunayana Sitaram, Snehal Thorat, Tharindu Cyril Weerasooriya, Jasmijn Bastings, Joachim Baumann, Kongtao Chen, Murali Emani, Mariya Hendriksen, Jiho Jin, Jun Seong Kim, Younghoon Ko, Alicja Kwasniewska, Minjae Lee, Tom Wei-cyuan Lin Kashyap Ramanandula Manjusha, Junho Myung, Junyeong Park, Roma Patel, Shyam Ratan, Sudarsun Santhiappan, Priyanka Suresh, Tuesday, Ksheeraj Sai Vepuri Laura Amortegui-Ordonez, Claire Dennis, Minsuk Kahng, Chris Knotz, Alice Oh, Balaraman Ravindran, Soojung Ryu William Bartholomew, Hiwot Tesfaye, Lora Aroyo

机构 * Google DeepMind(谷歌DeepMind) University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校) Google(谷歌) University of Missouri Columbia(密苏里大学哥伦比亚分校) Chunghwa Telecom Laboratories(春木电信实验室) University of Southern California(南加州大学) Polytechnique Montreal(蒙特利尔理工学院) Nutanix ThinkEvolve Labs(ThinkEvolve实验室) UCL(伦敦大学学院) Infocomm Media Development Authority(信息通信媒体发展局) Monark Health(Monark健康) Seoul National University(首尔国立大学) Microsoft(微软) Centre for Responsible AI (CeRAI), Wadhwani School of Data Science and AI (WSAI), Indian Institute of Technology Madras(负责任人工智能中心(CeRAI)、瓦达威人工智能学校(WSAI)、印度理工学院马德拉斯分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Microsoft Research India(微软印度研究院) Stanford University(斯坦福大学) Argonne National Laboratory(阿贡国家实验室) University of Oxford(牛津大学) KAIST(韩国科学技术院) Yonsei University(延世大学) Amazon(亚马逊) UIUC(伊利诺伊大学香槟分校) Rochester Institute of Technology(罗切斯特理工学院) Xenoscube Inc.(Xenoscube公司) Korea AI Safety Institute (K-AISI)(韩国人工智能安全研究所(K-AISI)) MLCommons CommonGround Artifex Labs(Artifex实验室)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对现有AI安全评估框架忽视文化差异问题,构建多语言多模态数据集Pluralis v0.1,从文化优先视角引入新评估范式,提出Judge - Pluralis集成,揭示特定地区失败模式,为多语言多元文化评估提供基础和创新起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05773 2026-07-08 cs.AI 新提交 70%

Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning

超越静态评估:构建用于可扩展智能体强化学习的模拟环境

Akshay Arora, Ishan Nigam, Ashutosh Aggarwal, Shefali Bansal, Krishna Singh, Sweta Kumari, Nikhil Mittal, Shariq Farhan, Siddarth Malreddy

机构 * Uber AI Solutions(优步人工智能解决方案)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型成为自主智能体后传统静态评估失效的问题,引入AgenticAI-Supervisor平台,通过API和UI驱动构建强化学习环境,运用可验证执行结果、多维奖励塑造及严格验证测试,以客户支持智能体案例展示核心能力及未来工作重点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05638 2026-07-08 cs.SE cs.AI 新提交 70%

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems

EvalLoop:一种用于商业人工智能系统评估驱动迭代改进的方法

Kenneth Benavides, Josh Fleischer, Danti Chen

机构 * Robert Half(罗伯特·哈夫公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对商业AI系统评估忽视迭代改进价值的问题,提出EvalLoop方法,通过维度指标分组、故障模式分类和结构化迭代工作流程,实现评估驱动的迭代改进,经案例研究验证有效,还能助力模型选择与部署权衡,且被打包为可重用工件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04727 2026-07-07 cs.SE cs.AI cs.CV 新提交 70%

Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards

Dashboard2Code:在重建交互式仪表板上评估多模态模型

Tianhao Niu, Ziyu Han, Qiguang Chen, Shiqi Zhou, Baocai Shan, Hengjie Fang, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态模型在交互式仪表板重建任务,介绍Dashboard2Code任务,提出DashboardMimic基准及自动化评估框架,实验发现开源与闭源模型在此任务上有差距。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04436 2026-07-07 cs.SE cs.AI 新提交 70%

A Retrieval-Augmented Framework for Detecting and Resolving Pragmatic Ambiguities in Natural Language Requirements

一种用于检测和解决自然语言需求中语用歧义的检索增强框架

Pavithra PM Nair, Preethu Rose Anish

机构 * Tata Consultancy Services(塔塔咨询公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究自然语言需求中的语用歧义,利用检索增强技术和不同领域知识库模拟不同专业利益相关者,生成候选消歧需求并验证,评估该方法在需求文档上的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04008 2026-07-07 cs.CL cs.IR 新提交 70%

Candidate-Constrained Retrieval-Augmented Generation for LongEval-RAG: System Design and Empirical Analysis

用于LongEval-RAG的候选约束检索增强生成:系统设计与实证分析

Yingdong Yang, Haijian Wu

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 介绍用于LongEval-RAG的候选约束检索增强生成系统,结合多种方法,经评估得出最强平衡变体rule-minilm,表明主要增益来自稳定规则证据单元与句子级神经选择结合,强调多指标评估需求。

Comments Published in CEUR Workshop Proceedings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03887 2026-07-07 cs.CR cs.AI cs.SE 新提交 70%

Advanced Topic Modeling Techniques for Categorizing Software Vulnerabilities

用于软件漏洞分类的高级主题建模技术

Utkarsh Tiwari, Spoorthi M, Anirudh S, Nidhin Prabhakar T.

机构 * Department of Computer Science & Engineering, Amrita School of Computing, Bengaluru, Amrita Vishwa Vidyapeetham, India(计算机科学与工程系,Amrita计算学院,班加罗尔,Amrita世界大学,印度)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究利用大语言模型驱动的主题建模技术,从软件漏洞数据集中提取有意义见解,采用多种模型及降维和聚类方法,增强网络安全威胁优先级排序与决策,支持漏洞管理的可扩展自动化解决方案。

Comments 10 pages, 10 figures. Accepted at the 16th International Conference on Computing, Communication and Networking Technologies (ICCCNT 2025), July 6-11, 2025, IIT Indore, Madhya Pradesh, India. IEEE proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏