arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-17 至 2026-07-17 共收录 250 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 61 篇

2607.14185 2026-07-17 cs.LG cs.AI 新提交 79%

Closed-Loop Knowledge Dynamics: An Operational Framework for Saturation and Escape

闭环知识动力学:饱和与逃逸的操作框架

Xuening Wu, Shan Yu, Shenqin Yin

机构 * Pfizer(辉瑞公司) Institute of Humanities and Social Science Data, Fudan University(复旦大学人文社会科学数据研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究闭环知识系统饱和及逃逸问题,引入三级操作框架,利用李雅普诺夫漂移条件等刻画系统动态,通过案例展示反馈影响,建立了稳定性工具、干预效果与跨域诊断间的操作联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26842 2026-07-17 cs.LG cs.AI cs.CV 版本更新 79%

VAN-AD: Visual Masked Autoencoder with Normalizing Flow For Time Series Anomaly Detection

VAN-AD:基于归一化流的视觉掩码自编码器用于时间序列异常检测

PengYu Chen, Shang Wan, Xiaohou Shi, Yuan Chang, Yan Sun, Sajal K. Das

机构 * School of Computer Science (National Pilot Software Engineering School)(计算机学院(国家级试点软件工程学院)) Beijing University of Posts and Telecommunications(北京邮电大学) China Telecom Research Institute Beijing(中国电信研究院北京) Department of Computer Science, Missouri University of Science and Technology(计算机科学系,密苏里科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VAN-AD,通过归一化流模块和自适应分布映射模块改进视觉掩码自编码器,提升时间序列异常检测的泛化能力和局部感知能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17471 2026-07-17 cs.CR 版本更新 78%

PatchIsland: Orchestration of LLM Agents for Continuous Vulnerability Repair

PatchIsland:用于持续漏洞修复的大语言模型代理编排

Wonyoung Kim, Seunggi Min, Minjae Gwon, Dowoo Baik, Haein Lee, Hyeon Heo, Minjae Lee, Min Woo Baek, Yonghwi Jin, Younggi Park, Yunjae Choi, Taesoo Kim, Sangdon Park, Insu Yun

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究针对持续模糊测试中漏洞修复多为人工且现有AVR技术不适用于此的问题,提出PatchIsland系统,通过集成多种大语言模型代理及两阶段去重方法,实现高效漏洞修复,在内部评估和竞赛中都取得了较好的修复成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15216 2026-07-17 cs.CV cs.AI 新提交 77%

Symbal: Detecting Systematic Misalignments in Model-Generated Captions

Symbal:检测模型生成字幕中的系统性对齐错误

Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型生成图像字幕时的系统性对齐错误检测问题,提出利用现成基础模型的结构化双阶段设置的Symbal方法,引入SymbalBench基准,Symbal在基准上表现出色,可辅助审核MLLM生成的字幕。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15205 2026-07-17 cs.SE cs.AI 新提交 77%

MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization

MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准

Shaoxiong Zhan, Shi Hu, Boyu Feng, Hai Lin, Andrew Gong, Zhengda Zhou, Jiaying Zhou, Yunyun Hou, Hao Su, Hai-Tao Zheng

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14818 2026-07-17 cs.LO cs.AI 新提交 77%

Can LLMs Build a MaxSAT Solver from Papers? The CoreForge Experience

大语言模型能否根据论文构建最大可满足性求解器?CoreForge 经验

Ruben Martins

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究利用大语言模型从论文构建无权重 MaxSAT 求解器,采用结合论文讨论、代码实现及审核修订的迭代流程,评估特定配置,发现虽未现错误答案,但性能低于手工设计求解器,总结了相关经验教训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14309 2026-07-17 cs.AI cs.CY 新提交 77%

Traccia: An OpenTelemetry-Based Governance Platform for AI Systems

Traccia:一个基于OpenTelemetry的人工智能系统治理平台

Nutan Kumar Naik, Aditya Kumar Saroj, Vijay Prasad Poudel, Saurav Samantray, Abhishek Patel

机构 * National Institute of Technology Rourkela(鲁尔基国立技术学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型和人工智能驱动智能体发展带来的软件治理问题,提出基于OpenTelemetry构建多层次人工智能治理堆栈Traccia,通过添加遥测数据等解决对齐问题,自动创建合规证据包,为企业管理自主人工智能系统创建机器可读基础。

Comments 26 pages, 2 figures, 3 tables, Declaration of generative AI and AI-assisted technologies in the writing process, Declaration of competing interest

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00724 2026-07-17 cs.CL 版本更新 77%

MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark

MSQA:一个原生来源的多语言多文化SimpleQA基准

Xianru Chen, Yukai Huang, Mingxiang Chen, Xinping Lei, Fangbing Deng, Jin Chen, Ge Zhang, Wenhao Huang, Jiaheng Liu

机构 * M-A-P ByteDance Seed(字节跳动Seed) Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 提出MSQA基准,包含1064个原生问题覆盖11种语言和5个文化维度,评估18个LLM发现文化能力随预训练暴露程度下降,且推理时补救措施无效。

Comments Due to the company's data approval issue, we need to withdraw the article

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12254 2026-07-17 cs.CV 版本更新 75%

Self-Aware Recursively Self-Improving Agents for Personal Singularity: A Goal-, Scope-, Tool-, and Benchmark-Driven Multi-Agent Architecture

如何实现递归式自我提升智能体与个人奇点:一种目标、范围、工具和基准驱动的多智能体架构

Chengshuai Yang

机构 * NextGen PlatformAI C Corp.(下一代平台人工智能C公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究大型语言模型智能体进步引发的问题,提出受治理多智能体架构实现递归式自我提升,以个人奇点为目标,详细介绍智能体各要素及架构组成,形式化多种机制并提供设计与路线图。

Comments 28 pages, 5 figures, 7 tables, and 5 algorithms. Position and systems-design paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14541 2026-07-17 cs.AI 新提交 74%

Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent

大语言模型生成的GPU内核能否用于生产?基于追踪的基准测试与优化代理

Lingyun Yang, Yuxiao Wang, Shenghao Liang, Linfeng Yang, Daocheng Ying, Chunbo You, Rui Zhang, Luping Wang, Yinghao Yu, Guodong Yang, Liping Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究大语言模型生成GPU内核用于生产的可行性,提出Atrex-Bench基准测试,发现现有模型表现不佳。为此发布Atrex-Kernel-Agent优化代理,结合多种技术,经案例研究能将回退转换为匹配或超越生产基线的内核。

Comments Both artifacts are released as open source: Atrex-Bench (https://github.com/alibaba/atrex-bench) and Atrex-Kernel-Agent (https://github.com/alibaba/atrex-kernel-agent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03230 2026-07-17 cs.CL 版本更新 74%

PERL: Pinyin Enhanced Rephrasing Language Model for Chinese ASR N-best Error Correction

PERL:用于中文语音识别N-best纠错的拼音增强改写语言模型

Junhong Liang, Bojun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 针对中文语音识别纠错难题,提出PERL受限改写管道,通过预测目标长度、掩码预算及融合语义与拼音表示来纠错,在Aishell-1和DoAD实验中持续降低字符错误率且保持低延迟,还分析了相关交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14989 2026-07-17 cs.CL cs.AI 新提交 73%

OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

OmniaBench:跨多样场景对通用人工智能智能体进行基准测试

Chengyu Shen, Yujie Fu, Gangtao Xin, Yanheng Hou, Wenlong Fei, Guojie Zhu, Jiawei Li, Hongcheng Gao, Runming He, Zhen Hao Wong, Meiyi Qiang, Hao Liang, Zhao Cao, Hao Jiang, Chong Chen, Wentao Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型向通用智能体演变,现有基准测试有局限的问题,引入OmniaBench。通过多渠道获取场景知识形成分类法,构建可执行环境并合成任务,还引入能力分类法等。其数据集含多任务,对前沿模型构成挑战,能表征通用智能体能力边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14158 2026-07-17 cs.AI cs.CL cs.MA cs.SE 新提交 73%

Orchestrating Power Grid Studies with Multi-Agent AI and MCP Servers

利用多智能体人工智能和MCP服务器编排电网研究

Jérôme Picault, Clément Goubet

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 探讨智能体人工智能和MCP在TSO环境下对电网研究的支持,结合大语言模型等要素,介绍pypowsybl - mcp接口搭建试验台,研究智能体交互方式,讨论人工参与原则与评估策略,推动电网研究环境更具交互性、可审计性和扩展性。

Comments Accepted to IJCAI AISE 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14141 2026-07-17 cs.AI cs.LG 新提交 73%

Human AI Construction of Bayesian Networks for Operational Decision Support -- A Virtual Survey Approach

用于运营决策支持的贝叶斯网络的人工AI构建——一种虚拟调查方法

Kumar Rahul, Shovan Chowdhury

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究如何构建贝叶斯网络用于运营决策支持,提出利用大语言模型的新方法,通过人工智能代理估计概率并去噪,开发六步框架,以客户咨询医生意图建模为例,揭示因素影响,得出有效策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14101 2026-07-17 cs.CL cs.AI 新提交 73%

LBA: Textual Hard-Label Adversarial Attack under Low Query Budgets

LBA:低查询预算下的文本硬标签对抗攻击

Shixin Guo, Ming Zhong, Xuhong Zhang, Dandan Zhao, Zhe Wang, Bo Zhang, Shouling Ji, Hao Peng

机构 * Zhejiang Normal University(浙江师范大学) Zhejiang University(浙江大学) China Electric Power Research Institute(中国电力科学研究院)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究在低查询预算硬标签场景下生成高质量对抗文本的难题,提出基于采样的LBA方法,整合先验与后验知识构建近似分布用于采样,实验证明该方法在多语言模型上显著优于基线,生成的对抗文本语义保留性和可理解性更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09142 2026-07-17 cs.AI cs.CL cs.CV 版本更新 73%

MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

MedRealMM:用于中国在线医疗咨询的真实世界多模态基准测试

Runhan Shi, Quan Zhou, Yuqian Xu, Shuai Yang, Xin Wu, Zitong Zhou, Hui Liu, Bin Zha, Zheming Wang, Liya Li, Wei Wei, Jinru Ding, Wenrao Pang, Mouxiao Bian, Haoyuan Hu, Jun Xu, Jie Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有在线医疗咨询基准与实际临床实践契合度差的问题,构建MedRealMM基准测试,用多模态临床挑战点提取框架转化任务并设评分标准,评估多个大语言模型,指出图像信息重要,前沿模型有不足,为多模态医学推理评估提供现实可重复基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15092 2026-07-17 cs.CL 新提交 70%

Rubrics on Trial: Evolving Rubrics from a Single Query via Synthetic Pairwise Evidence

试验中的评分标准:通过合成成对证据从单个查询中演化评分标准

Haocheng Yang, Licheng Pan, Xiaoxi Li, Zhichao Chen, Zhiheng Zhang, Yuan Lu, Haoxuan Li, Hao Wang

机构 * School of Computing, National University of Singapore(新加坡国立大学计算学院) Xiaohongshu Inc.(小红书公司) School of Cyber Science and Technology, Zhejiang University(浙江大学网络空间安全学院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对构建可靠特定查询评分标准难的问题,提出“试验中的评分标准”框架,仅从查询演化评分标准集,靠合成响应对获取监督并验证,实验证明该框架有效,平均准确率最佳且在多数评估集领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14770 2026-07-17 cs.LG 新提交 70%

ChronoQG: Towards a Temporally Expressive and Hop-Bounded Benchmark for Temporal Knowledge Graph Question Generation

ChronoQG:迈向用于时态知识图谱问题生成的具有时态表现力和跳数限制的基准

Xuemeng Liu, Zhengpin Li, Wanpeng Tang, Haotong Xie, Wentao Zhang

机构 * Nankai University(南开大学) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.LG

AI总结 研究时态知识图谱问题生成,提出ChronoQG框架,通过整合多种方法构建有时态表现力和跳数限制的基准数据集,评估多种设置下的相关方法,揭示静态KGQG与TKGQG差距,为时态忠实问题生成提供测试平台。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14604 2026-07-17 cs.LG cs.IR stat.ME 新提交 70%

Accelerating A/B-Tests with Counterfactual Estimation: Reducing Variance through Policy Overlap

通过反事实估计加速A/B测试:通过策略重叠降低方差

Olivier Jeunen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究在线控制实验中A/B测试方差大成本高问题,提出利用策略重叠加速实验的新协议,将随机处理分配机制视为元策略,用Δ-离策略估计方法获无偏估计,理论和实证证明该方法可提升效率,有望用于多种系统评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14591 2026-07-17 cs.CL 新提交 70%

How Well Does AI-Generated Feedback Work? Intrinsic and Extrinsic Evaluation across more than 20,000 EFL Essay Drafts

人工智能生成的反馈效果如何?对20000多篇外语作文草稿的内在和外在评估

Steven Coyne, Diana Galvan-Sosa, Ryan Spring, Machi Shimmei, Michael Zock, Keisuke Sakaguchi, Kentaro Inui

机构 * Tohoku University(东北大学) RIKEN(理化学研究所) ALTA Institute, Computer Laboratory, University of Cambridge(剑桥大学ALTA研究所,计算机实验室) CNRS, LIS, Aix-Marseille University(法国国家科学研究中心,艾克斯-马赛大学语言信息处理实验室) MBZUAI(Mohamed bin Zayed大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究外语写作中人工智能生成的书面纠正性反馈效果,通过大学外语班级近2000名学生的超20000篇草稿,从教师内在评估和学生外在反馈两角度评估,发现传统专家评估与学生反馈一致性低,强调以学习者为中心评估框架的重要性。

Comments Pre-review version of DOI https://doi.org/10.1007/978-3-032-29788-4_35, presented at AIED 2026 Late Breaking Results. Readers are encouraged to refer to the published version

Journal ref AIED CCIS 3031 (2026) 247-253

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14387 2026-07-17 cs.AI cs.RO 新提交 70%

Chat2Scenic: An Iterative RAG-Based Framework for Scenario Generation in Autonomous Driving

Chat2Scenic:一种基于迭代检索增强生成的自动驾驶场景生成框架

Yuan Gao, Wenting Miao, Mattia Piccinini, Haoyu Wang, Qunying Song, Johannes Betz

机构 * Technical University of Munich(慕尼黑工业大学) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所) University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究自动驾驶场景生成难题,提出Chat2Scenic这一基于迭代检索增强生成的框架,通过聊天机器人界面及RAG技术生成DSL场景脚本,构建开放基准,评估结果显示其性能优于现有方法。

Comments Accepted at 2026 IEEE International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15107 2026-07-17 cs.LG math.CT 新提交 70%

Learning in Infinitesimal Non-Compositional Sketches

在无穷小非组合草图中学习

Sridhar Mahadevan

机构 * Adobe Research(Adobe研究院) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究如何通过LINCS框架修复机器学习中非组合性问题,将问题指定为草图,利用切提升和INC自函子,把机器学习表述为寻找余代数不动点,证明特定条件下最终INC余代数存在,正进行多场景实验评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02806 2026-07-17 cs.CL 版本更新 70%

Translating Classical Poetry into Modern Prose

将古典诗歌翻译成现代散文

Chalamalasetti Kranti, Sowmya Vajjala

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍Padyam2Gadyam数据集,用于13-17世纪泰卢固语古典诗歌到当代泰卢固语和英语散文的翻译任务,并评估了5种大语言模型的表现,发现仍有较大改进空间。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14754 2026-07-17 cs.CR 新提交 67%

FlowGuard: From Signals to Evidence for MCP Security Detection

FlowGuard:从信号到MCP安全检测的证据

Baichao An, Pei Chen, Geng Hong, Yueyue Chen, Mengying Wu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究针对现有MCP安全扫描器不足,提出FlowGuard系统,结合语义风险分类等方法,通过运行时证据验证执行风险、检测语义风险,在基准测试和实际评估中取得良好效果,能有效评估MCP交互中的多种风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14660 2026-07-17 cs.CV 新提交 67%

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

VIABench:一个从视障人士收集的用于视障辅助的综合视频基准测试

Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对视障人士视觉信息获取难及多模态大语言模型在视障辅助中实用价值待探索的问题,引入VIABench视频基准测试,定义三个核心任务,提出严格测试流程,实验表明当前模型对视障人士支持不足,有望推动定制模型开发以改善其体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14479 2026-07-17 cs.CY 新提交 67%

BioTIER: A Refusal Benchmark for Targeted Biological Risk Mitigation

BioTIER:用于针对性生物风险缓解的拒绝基准

Eleanor M. Marshall, Pedro Medeiros, Peter Peneder, Nelly Mak, Jacob Kaffey, Faith Rovenolt, Mac Walker, Seth Donoughe, Jasper Götting

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对大语言模型生物滥用问题,引入BioTIER基准,将生物内容分三个风险集,含542个专家策划提示及元数据,可隔离控制灾难性风险信息,确保生物科学知识获取,助力针对性生物风险缓解。

Comments 52 pages, 9 main figures, 9 supplementary figures, 1 main table, 9 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20032 2026-07-17 cs.DC cs.PF 版本更新 67%

LEO: Tracing GPU Stall Root Causes via Cross-Vendor Backward Slicing

LEO:通过跨厂商反向切片追溯GPU停滞的根本原因

Yuning Xia, John Mellor-Crummey

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出LEO,一种跨NVIDIA、AMD和Intel GPU的根因分析工具,通过反向切片追踪停滞指令,揭示性能瓶颈,实验表明其优化可提升1.73至1.82倍,展示不同GPU架构需不同优化策略。

Comments Manuscript accepted at SC'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14399 2026-07-17 cs.AI cs.CL 新提交 62%

Instrument Effects in Language-Model Honesty Evaluation: An Auditable Single-System Demonstration

语言模型诚实度评估中的工具效应:一个可审计的单系统演示

Justin Bronder

机构 * Corabo Inc.(科拉博公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究语言模型诚实度评估中的工具效应,通过构建文本冒险世界测试评估工具,发现工具选择影响行为,如扩展语法、披露标准等会改变结果,重复运行不稳定且预注册梯度被证伪,进而提出四检查完整性协议。

Comments 21 pages. Code: https://github.com/Aargau/latent-underground (tag v1.0-arxiv). Data: https://doi.org/10.5281/zenodo.21384627

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10079 2026-07-17 cs.AI cs.CL 版本更新 62%

MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation

MAG:用于多模态动作与引导生成的网络智能体基准测试与工具包

Chengguang Gan, Hanjun Wei, Yunhao Liang, Zhixi Cai, Qinghao Zhang, Shiwen Ni

机构 * University of Chinese Academy of Sciences(中国科学院大学) Monash University(莫纳什大学) Pusan National University(釜山国立大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 介绍MAG这一网络智能体基准测试,统一任务执行与引导写作,有基于截图的定位方案和完整工具包。用其评估模型并详细分析,还设计GRPO训练方法,提升智能体成功率与引导质量,指出当前模型任务完成率低,为后续研究提供方向。

Comments 8 pages main text, 21 pages total including appendices; 11 figures, 7 tables, 2 algorithms. Benchmark, harness, and model checkpoints to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14673 2026-07-17 cs.AI cs.HC 新提交 57%

Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications

万花筒计划:面向现实世界人工智能应用的情境化、符合人类需求的评估

Leanne Tan, Rohan Jaggi, Shaun Khoo, Roy Ka-Wei Lee

机构 * GovTech(新加坡政府科技局) National University of Singapore(新加坡国立大学) University of British Columbia(英属哥伦比亚大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 该项目旨在解决现实世界AI应用评估瓶颈,提出万花筒计划,通过集成基于角色的测试生成、情境化评分标准和人工审查,实现可靠性门控自动评分,经试点和实验验证了其在端到端可靠自动评分方面的有用特征。

详情

展开后加载摘要…

URL PDF HTML 收藏