arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1356 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1356 篇

2606.22357 2026-08-11 cs.CL cs.CV cs.LG 版本更新 62%

ORBIT: Training-Free Multi-Attribute Behavioral Steering via Orthogonal Subspace Rotation

ORBIT: 通过正交子空间旋转实现无训练的多属性行为引导

Narges Ghasemi, Amir Ziashahabi, Salman Avestimehr, Jonathan May

机构 * Information Sciences Institute, University of Southern California(南加州大学信息科学研究所) Department of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出ORBIT方法,利用奇异值分解构建联合子空间并施加单一旋转,实现无训练的多属性行为引导,平衡多个属性并保持输出连贯性。

Comments v2: Updated technical details and added supplementary evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04203 2026-08-11 cs.CL cs.CV cs.LG cs.SE 版本更新 62%

FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback

FronTalk: 以多模态反馈进行对话式代码生成的前端开发基准测试

Xueqing Wu, Zihan Xue, Da Yin, Shuyan Zhou, Kai-Wei Chang, Nanyun Peng, Yeming Wen

机构 * Meta Superintelligence Labs(Meta超智能实验室) University of California, Los Angeles(加州大学洛杉矶分校) Duke University(杜克大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出FronTalk基准,通过多轮对话和多模态反馈(文本与视觉指令)评估前端代码生成,发现模型存在遗忘和视觉反馈理解困难,提出AceCoder方法有效减少遗忘并提升性能。

Comments CoLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02687 2026-08-11 cs.AI cs.CL 版本更新 62%

The Collaboration Gap: Exploration and Benchmarking of Open-World Agentic Cooperation

协作差距:开放世界智能体协作的探索与基准测试

Tim R. Davidson, Adam Fourney, Saleema Amershi, Robert West, Eric Horvitz, Ece Kamar

机构 * EPFL(瑞士联邦理工学院) Microsoft Research(微软研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出协作迷宫求解基准,评估32个模型的协作能力,发现模型存在协作差距,提出中继推理等缓解措施,强调协作相关评估、训练与交互设计的重要性。

Comments Accepted to COLM 2026, code available at https://github.com/trdavidson/collaboration_gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27853 2026-08-10 cs.CL cs.AI q-fin.CP 版本更新 62%

FinanceHarness: Autonomous Financial Deep Research Framework

FinanceHarness:自主金融深度研究框架

Yijia Xiao, Rujun Han, Yanfei Chen, Zifeng Wang, Ke Jiang, Zhongying CuiZhu, Vishy Tirumalashetty, Wei Wang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 FinanceHarness是一款端到端自动化金融深度研究的自主框架,结合自主智能体与金融专用工具,在FinanceGym基准上大幅提升了金融研究评分规则得分。

Comments FinanceHarness available at https://github.com/Yijia-Xiao/FinanceHarness

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02616 2026-08-07 cs.CL cs.AI 版本更新 62%

OpenAI Privacy Filter: A Cross-Lingual, Cross-Domain PII Evaluation Across 32 Benchmarks

评估OpenAI的隐私过滤器:在42个基准测试中开展跨语言、跨领域的个人身份信息(PII)检测

Rohith Uppala

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究首次系统评估OpenAI的15亿参数PII检测器OPF,在42个跨语言跨领域基准中对比其与Presidio、XLM-RoBERTa、GPT-4o的PII检测性能,揭示其优势与缺陷。

Comments 9 pages, 2 figures, 9 tables; evaluation of a production PII detection system

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06052 2026-08-06 cs.CL cs.AI 版本更新 62%

A Survey of Agent Memory in the Second Half: Towards Self-Evolving and Long-Horizon Agents

重新思考基础智能体的内存机制:第二阶段综述

Wei-Chieh Huang, Weizhi Zhang, Yueqing Liang, Yuanchen Bei, Yankai Chen, Tao Feng, Xinyu Pan, Zhen Tan, Yu Wang, Tianxin Wei, Shanglin Wu, Ruiyao Xu, Liangwei Yang, Rui Yang, Wooseong Yang, Chin-Yuan Yeh, Hanrong Zhang, Haozhen Zhang, Siqi Zhu, Henry Peng Zou, Wanjia Zhao, Song Wang, Wujiang Xu, Zixuan Ke, Zheng Hui, Dawei Li, Yaozu Wu, Langzhou He, Chen Wang, Xiongxiao Xu, Baixiang Huang, Juntao Tan, Shelby Heinecke, Huan Wang, Caiming Xiong, Ahmed A. Metwally, Jun Yan, Chen-Yu Lee, Hanqing Zeng, Yinglong Xia, Xiaokai Wei, Ali Payani, Yu Wang, Haitong Ma, Wenya Wang, Chenguang Wang, Yu Zhang, Xin Eric Wang, Yongfeng Zhang, Jiaxuan You, Hanghang Tong, Xiao Luo, Xue Liu, Yizhou Sun, Wei Wang, Julian McAuley, James Zou, Jiawei Han, Philip S. Yu, Kai Shu

机构 * UIC(伊利诺伊大学香槟分校) IIT(伊利诺伊理工学院) UIUC(伊利诺伊大学厄巴纳-香槟分校) UW–Madison(威斯康星大学麦迪逊分校) ASU(亚利桑那州立大学) Emory(埃默里大学) Northwestern(西北大学) NTU(国立台湾大学) UCF(佛罗里达大学) Rutgers(新泽西罗格斯大学) Cambridge(剑桥大学) Harvard(哈佛大学) UTokyo(东京大学) UCSD(加州大学圣地亚哥分校) UCSC(加州大学圣塔克鲁斯分校) TAMU(德克萨斯大学奥斯汀分校) UCSB(加州大学圣塔芭芭拉分校) MBZUAI(马克斯·普朗克人工智能研究所) McGill(麦吉尔大学) UCLA(加州大学洛杉矶分校) Stanford(斯坦福大学) Salesforce Google(谷歌) Meta Roblox Cisco(思科) Capital One

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了基础智能体内存机制,从内存基质、认知机制和主体维度分析内存在不同拓扑结构下的实现,并探讨内存操作的学习策略与评估指标。

Comments Accepted at Transactions on Machine Learning Research (TMLR) with Survey Certification. Project page: https://github.com/AgentMemoryWorld/Awesome-Agent-Memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15212 2026-08-05 cs.AI cs.LG 版本更新 62%

Modeling Matches as Language: A Generative Transformer Approach for Counterfactual Player Valuation in Football

将比赛建模为语言:一种生成式Transformer方法用于足球中的反事实球员估值

Miru Hong, Minho Lee, Geonhee Jo, Hyeokje Cho, Hyunsung Kim, Pascal Bauer, Sang-Ki Ko

机构 * Department of Artificial Intelligence, University of Seoul, Seoul, Republic of Korea(首尔大学人工智能系) Institute for Sports and Preventive Medicine, Saarland University, Saarbrücken, Germany(萨尔兰州预防医学研究所) Chair for Sports Analytics, Saarland University(萨尔兰州体育分析教授职位)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ScoutGPT,通过将足球比赛事件视为序列标记,利用生成式Transformer模型模拟反事实球员估值,提升对球员转会效果的预测能力。

Comments 21 pages, 4 figures, 11 tables. Accepted at ECML-PKDD 2026 (Applied Data Science Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27056 2026-08-04 cs.AI cs.CL 版本更新 62%

Setoka: A Benchmark for Hierarchical User Understanding in Personalized Agents over Heterogeneous Data

Setoka:面向异构数据下个性化智能体分层用户理解的基准测试集

Lingyang Zeng, Guangze Chen, Kaichen Yu, Zhicheng Pan, Siyang Weng, Zirui Hu, Xiangyun Du, Hailin He, Rong Zhang, Chengcheng Yang, Kai Huang, Xuan Zhou

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Setoka基准测试集,评估记忆增强型个性化智能体的分层用户理解能力,发现现有系统在需整合异构信息的任务中性能下降,推动相关记忆机制设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08417 2026-08-04 cs.CL cs.AI 版本更新 62%

Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics

破解生成困惑度:为何无条件文本评估需要分布度量

Antonio Franca, Alexander Tong

机构 * AITHYRA Institute(AITHYRA研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文指出生成困惑度(gen-PPL)作为非自回归语言模型评估指标存在缺陷,通过构造零参数朴素采样器在LM1B和OpenWebText上达到SOTA gen-PPL但生成不连贯文本,建议采用直接量化生成文本与参考文本分布差异的评估套件。

Comments Presented at the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15307 2026-08-04 cs.AI cs.CL 版本更新 62%

DeepSurvey-Bench: Evaluating Academic Value of Automatically Generated Scientific Surveys

DeepSurvey-Bench: 评估自动生成功科学调查的学术价值

Guo-Biao Zhang, Xian-Ling Mao, Ding-Yuan Liu, Da-Yi Wu, Tian Lan, Huihui Li, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 DeepSurvey-Bench 通过综合评估生成调查的学术价值,解决现有基准在评估深度和可靠性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05627 2026-08-03 cs.CV cs.AI cs.LG cs.RO 版本更新 62%

Leveraging Image Generators to Address Data Scarcity: The Gen4Regen Dataset for Forest Regeneration Mapping

利用图像生成器解决训练数据稀缺问题:Gen4Regen数据集用于森林再生制图

Gabriel Jeanson, David-Alexandre Duclos, William Larrivée-Hardy, Noé Cochet, Matěj Boxan, Anthony Deschênes, François Pomerleau, Philippe Giguère

机构 * Northern Robotics Laboratory, Université Laval, Québec, QC, G1V 0A6, Canada(拉瓦尔大学北部机器人实验室,魁北克,QC,G1V 0A6,加拿大) Département d'informatique et de génie logiciel, Université Laval, Québec, QC, G1V 0A6, Canada(拉瓦尔大学计算机与软件工程系,魁北克,QC,G1V 0A6,加拿大)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过Gen4Regen数据集和Nano Banana Pro模型生成高质量图像及语义掩码,解决森林再生物种分割中的数据稀缺和类别不平衡问题,提升F1分数15%以上。

Comments 33 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11178 2026-07-30 cs.AI cs.CL cs.MM cs.SI 版本更新 62%

TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech

TANDEM: 面向多模态仇恨言论的时间感知神经检测

Girish A. Koushik, Helen Treharne, Diptesh Kanojia

机构 * Nature-Inspired Computing & Engineering, University of Surrey(Surrey大学自然启发计算与工程系) Surrey Centre for Cyber Security, University of Surrey(Surrey大学网络安全中心)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TANDEM统一框架,通过串联强化学习策略联合优化视觉-语言和音频-语言模型,将音频-视觉仇恨检测转化为结构化推理问题,在HateMM上目标识别F1达0.73(提升30%),并保持精确时间定位。

Comments Accepted to AAAI-ICWSM 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18999 2026-07-28 cs.CL cs.AI 版本更新 62%

MedDDC-Eval: Diagnosis-Decoupled Evaluation of Multi-Turn Medical Consultation Agents

MedDDC-Eval:多轮医疗咨询代理的诊断解耦评估

Guofeng Zhang, Yizeng Quan, Huaiyi Fang, Jianwei Lv, Jinyao Liu, Xunxu Duan, Lening An, Yu Ouyang, Junfeng Wang

机构 * Baidu, Inc(百度公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究多轮医疗咨询代理评估问题,提出诊断解耦测试平台MedDDC-Eval,通过共享冻结阅读器保持病史到诊断映射不变,能测量诊断有用性等,支持可控归因与策略开发,应用GRPO后训练模型可提升性能。

Comments supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24411 2026-07-28 cs.AI cs.CL cs.CV cs.HC 版本更新 62%

OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows

OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理

Qiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding, Qi Liu, Zhiyong Wu, Zhuosheng Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。

Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21143 2026-07-27 cs.CL cs.AI 版本更新 62%

One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies

再转一圈,遗憾更少:基于遗憾的大语言模型澄清策略多轮基准测试

Minh Ngoc Ta, My Anh Tran Nguyen, Duong D. Nguyen, Yuxia Wang, Preslav Nakov

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) BKAI Research Center, Hanoi University of Science and Technology(河内科技大学BKAI研究中心) INSAIT, Sofia University "St. Kliment Ohridski"(索非亚大学“圣克莱门特·奥赫里德斯基”INSAIT)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究对话式大语言模型助手在模糊用户请求下的澄清决策问题,核心方法是引入RegretBench基准测试,贡献为揭示模型澄清的有效性和效率,表明有效澄清需在正确时间问对问题并适时停止。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24668 2026-07-27 cs.CL cs.AI 版本更新 62%

InteractComp: Evaluating Search Agents With Ambiguous Queries

InteractComp:使用模糊查询评估搜索代理

Mingyi Deng, Lijun Huang, Yani Fan, Fanqi Kong, Jiayi Zhang, Fashen Ren, Jinyi Bai, Fuzhen Yang, Dayi Miao, Zhaoyang Yu, Yifan Wu, Yanfei Zhang, Fengwei Teng, Yingjia Wan, Song Hu, Yude Li, Xin Jin, Conghao Hu, Haoyu Li, Qirui Fu, Tai Zhong, Xinyu Wang, Xiangru Tang, Nan Tang, Chenglin Wu, Yuyu Luo

机构 * DeepWisdom(深智科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) University of California, Los Angeles(加州大学洛杉矶分校) Agent Universe(智能体宇宙) McGill University(麦吉尔大学) Yale University(耶鲁大学)

专题命中 评测与基准 :language agent(abstract);分类 cs.CL、cs.AI

AI总结 研究针对搜索代理缺乏处理模糊查询及交互能力的问题,引入InteractComp基准,通过目标-干扰物方法构建问题评估17个模型,发现模型存在过度自信问题,强制交互有提升,揭示交互能力停滞,该基准对评估和训练搜索代理交互能力有重要价值。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16345 2026-07-22 cs.SE cs.AI cs.LG cs.PF 版本更新 62%

AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows

AEVAL:从轶事性到确定性的智能体技能工作流测试

Tejas Singh Anand, Yuet Ying Christina Wang, Wanting Jiang, Steve Masson, Tian Zheng, Bingjie Zhou

机构 * nvidia(NVIDIA公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究针对智能体技能工作流测试缺乏确定性和可重复性的问题,提出AEVAL框架,通过执行器与评分器分离等方法,实现确定性、可重复的测试,给出分层修复建议,能将虚假通过率转换为可重复失败信号并记录修复过程。

Comments 8 pages, 1 figure, 1 table, accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15879 2026-07-21 cs.CL cs.AI cs.CY 版本更新 62%

DECODEM: Data Extraction from Corporate Organizational Documents via Enhanced Methods

DECODEM:通过增强方法从公司组织文档中提取数据

Jens Frankenreiter

机构 * Washington University in St. Louis School of Law(圣路易斯华盛顿大学法学院)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在通过增强方法从公司组织文档提取数据,介绍DECODEM基准数据集,评估多种大语言模型提取管道,结果显示自动提取可行且性能因变量而异,标准化基准和评估证明前沿模型能高精度提取信息,凸显自动特征提取作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13518 2026-07-21 stat.ML cs.AI cs.LG 版本更新 62%

Data Balancing Strategies: A Systematic Survey of Resampling and Augmentation Methods

数据平衡策略:重采样与增强方法的系统综述

Behnam Yousefimehr, Mehdi Ghatee, Javad Fazli, Shervin Ghaffari, Zahra Rafei, Mohammad Amin Seifi, Sajed Tavakoli, Abolfazl Nikahd, Mahdi Razi Gandomani, Alireza Orouji, Ramtin Mahmoudi Kashani, Sarina Heshmati, Negin Sadat Mousavi

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) Amirkabir University of Technology (Tehran Polytechnic)(阿美尔卡比大学(德黑兰理工大学)) Iran(伊朗)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文系统回顾了数据平衡方法,涵盖重采样、增强、欠采样及混合策略,分析其适用场景与优劣,指出无一方法普适,需根据数据特征和模型选择优化。

Comments 81 pages, 4 figures, 25 tables

Journal ref Machine Learning and Knowledge Extraction, 2026, 8(7), 211; https://www.mdpi.com/2504-4990/8/7/211

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04893 2026-07-20 cs.LG cs.CL stat.ML 版本更新 62%

Self-Attention as Transport: Limits of Symmetric Spectral Diagnostics

自注意力作为传输:对称谱诊断的极限

Dominik Dahlem, Diego Maniloff, Mac Misiura

机构 * Red Hat AI(红帽人工智能)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型注意力路由的两种失效形状(过度集中或过度分散),证明对称谱诊断对方向不敏感,并揭示因果注意力中传输容量的理论下限,提出基于容量和方向的双轴诊断方法。

Comments 47 pages, 7 figures, 7 tables; 84-page online supplement (proofs, additional experiments, dataset statistics) as an ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10079 2026-07-17 cs.AI cs.CL 版本更新 62%

MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation

MAG:用于多模态动作与引导生成的网络智能体基准测试与工具包

Chengguang Gan, Hanjun Wei, Yunhao Liang, Zhixi Cai, Qinghao Zhang, Shiwen Ni

机构 * University of Chinese Academy of Sciences(中国科学院大学) Monash University(莫纳什大学) Pusan National University(釜山国立大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 介绍MAG这一网络智能体基准测试,统一任务执行与引导写作,有基于截图的定位方案和完整工具包。用其评估模型并详细分析,还设计GRPO训练方法,提升智能体成功率与引导质量,指出当前模型任务完成率低,为后续研究提供方向。

Comments 8 pages main text, 21 pages total including appendices; 11 figures, 7 tables, 2 algorithms. Benchmark, harness, and model checkpoints to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06624 2026-07-15 cs.AI cs.LG cs.SE 版本更新 62%

AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

AgentLens:用于编码智能体评估的生产评估轨迹审查

Andrey Podivilov, Vadim Lomshakov, Sergey Savin, Matvei Startsev, Roman Pozharskiy, Maksim Parshin, Sergey Nikolenko

机构 * Explyt St. Petersburg Department of the Steklov Institute of Mathematics(圣彼得堡斯捷克洛夫数学研究所圣彼得堡分部) St. Petersburg State University(圣彼得堡国立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 介绍用于编码智能体评估的AgentLens基准,结合形式验证、大语言模型编写的轨迹审查和并排比较来评估智能体整个轨迹,不仅能排名,还可用于诊断模型行为、比较智能体版本及发现产品回归问题,且已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12346 2026-07-15 cs.CV cs.AI cs.LG 版本更新 62%

Atlas H&E-TME: Scalable AI-Based Tissue Profiling at Expert Pathologist-Level Accuracy

Atlas H&E-TME:基于AI的可扩展组织分析,达到专家病理学家级别的准确性

Kai Standvoss, Miriam Hägele, Rosemarie Krupar, Julika Ribbat-Idel, Jennifer Altschüler, Gerrit Erdmann, Hans Pinckaers, Evelyn Ramberger, Madleen Drinkwitz, Ádám Nárai, Alexander Möllers, Katja Lingelbach, Sebastian Kons, Lukas Hönig, Recepcan Adigüzel, Joana Baião, Alberto Megina Gonzalo, Marius Teodorescu, Marie-Lisa Eich, Paolo Chetta, Shakil Merchant, Verena Aumiller, Simon Schallenberg, Andrew Norgan, Klaus-Robert Müller, Lukas Ruff, Maximilian Alber, Frederick Klauschen

机构 * Aignostics, Germany(Aignostics,德国) Institute of Pathology, Charité – Universitätsmedizin Berlin, Germany(柏林夏里特医学院病理学研究所) Berlin Institute of Health, Charité – Universitätsmedizin Berlin, Germany(柏林夏里特医学院柏林健康研究所) Massachusetts General Hospital, Department of Pathology, Harvard Medical School, Boston, MA, US(哈佛医学院麻省总医院病理学系) Department of Laboratory Medicine and Pathology, Mayo Clinic, Rochester, MN, US(梅奥诊所检验医学与病理学系) Machine Learning Group, Technische Universität Berlin, Germany(柏林工业大学机器学习组) BIFOLD – Berlin Institute for the Foundations of Learning and Data, Germany(柏林学习与数据基础研究所) Department of Artificial Intelligence, Korea University, Republic of Korea(高丽大学人工智能系) Max-Planck Institute for Informatics, Germany(马克斯·普朗克信息学研究所) German Cancer Research Center (DKFZ) & German Cancer Consortium (DKTK), Berlin & Munich Partner Sites, Germany(德国癌症研究中心及德国癌症联盟柏林和慕尼黑合作站点) Institute of Pathology, Ludwig-Maximilians-Universität München, Germany(慕尼黑大学病理学研究所) Bavarian Cancer Research Center (BZKF), Germany(巴伐利亚癌症研究中心)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出Atlas H&E-TME系统,利用病理基础模型预测组织质量、区域和细胞类型,通过IHC共识验证和20万+注释基准,在多种癌症中达到或超越病理学家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27374 2026-07-15 cs.AI cs.CL 版本更新 62%

Measurement Risk in Supervised Financial NLP: Rubric and Metric Sensitivity on JF-ICR

监督金融NLP中的测量风险:JF-ICR的评分标准和度量敏感性

Sidi Chang, Peiying Zhu, Yuxiao Chen, Rongdong Chai

机构 * Blossom AI Labs, Tokyo, Japan(blossom AI 实验室,东京,日本) Blossom AI Labs, San Francisco, USA(blossom AI 实验室,旧金山,美国)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究监督金融NLP基准中评分标准和度量对模型评估的影响,发现评分标准用词和度量选择会显著改变模型标签,提出可识别的度量标准以提高评估可靠性。

Comments Accepted to IEEE Computational Intelligence in Financial Engineering and Economics (CIFEr) 2026, Tokyo, JP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22770 2026-07-14 cs.CY cs.AI cs.CL cs.HC 版本更新 62%

Learning in Blocks: A Multi Agent Debate Assisted Personalized Adaptive Learning Framework for Language Learning

基于块的学习:一种多智能体辩论辅助的个性化自适应语言学习框架

Nicy Scaria, Silvester John Joseph Kennedy, Deepak Subramani

机构 * Indian Institute of Science, India(印度科学研究院) Talking Yak, India(Talking Yak) Indian Institute of Technology Patna, India(帕纳布印度理工学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于块的学习框架,利用多智能体辩论技术评估语言能力,结合评分和推荐机制,通过间隔复习和掌握进度提升语言学习效果。

Comments Published as main paper in AIED 2026

Journal ref Artificial Intelligence in Education. AIED 2026. Lecture Notes in Computer Science(), vol 16582. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01042 2026-07-14 cs.IR cs.AI cs.CL 版本更新 62%

Can Argus Judge Them All? Comparing VLMs Across Domains

阿格斯能评判一切吗?跨领域比较视觉语言模型

Harsh Joshi, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Niharika Jain, Sarthak Jain, Jiechao Gao, Usman Naseem

机构 * Bharati Vidyapeeth(巴哈提大学) Macquarie University(麦考瑞大学) DSEU-Okhla Vivekananda Institute of Professional Studies(维维kananda专业研究学院) IIIT-Delhi(德里印度理工学院) Center for SDGC(SDGC中心) Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究跨领域视觉语言模型,提出ARGUS-EVAL评估框架,通过多种指标刻画模型行为,评估多个模型在下游任务表现,发现能力与可靠性导向排名有显著差异,如Qwen-2.5VL-3B-Instruct能力强,CLIP延迟和内存占用低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13376 2026-07-10 cs.CV cs.AI cs.CL 版本更新 62%

An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation

用于流程图图像到代码生成的在线无参考评估框架

Giang Son Nguyen, Zi Pong Lim, Sarthak Ketanbhai Modi, Yon Shin Teo, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) AUMOVIO Singapore(AUMOVIO新加坡) VinUniversity(文理大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对流程图图像到代码生成在生产中无真实代码难以评估输出质量的问题,提出无参考评估框架,通过RecallOCR和PrecisionVE两个指标及调和均值F1OCR-VE监测生成质量,在FlowVQA数据集验证了其可靠性。

Comments This manuscript was inadvertently made publicly available before all necessary internal review processes had been completed. The authors are withdrawing the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22136 2026-07-08 cs.LG cs.AI cs.CR cs.SE 版本更新 62%

StepShield: When, Not Whether to Intervene on Rogue Agents

StepShield:何时干预流氓代理,而非是否干预

Gloria Felicia, Zitha Sasindran, Jinfeng He, Michael Eniolade, Hemant Kumar, Milan Hussain Angati

机构 * University of Virginia(弗吉尼亚大学) Indian Institute of Science, Bangalore(印度科学研究院,班加罗尔) Cornell University(康奈尔大学) University of the Cumberlands(库姆伯兰兹大学) University of Arizona(亚利桑那大学) California State University, Northridge(加州州立大学,北岭分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究代理安全检测时机问题,引入StepShield基准及早期干预率(EIR),揭示取证陷阱,指出基于规则的护栏虽召回率高但时机不佳,现有方法无法兼顾高召回、低误报和及时干预,凸显逐步骤流氓检测待解决。

Comments 20 pages, 4 figures, 10 ablation studies. Code and data: https://github.com/glo26/stepshield

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.14019 2026-07-07 cs.CV cs.AI cs.HC cs.LG 版本更新 62%

Domain Knowledge-Informed Self-Supervised Representations for Workout Form Assessment

用于健身动作形式评估的领域知识驱动自监督表示

Paritosh Parmar, Amol Gharat, Helge Rhodin

机构 * University of British Columbia(不列颠哥伦比亚大学) FlexAI Inc.(FlexAI公司)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究健身动作形式评估问题,提出基于领域知识的自监督方法,利用动作谐波运动及多因素差异学习强大表示,创建新数据集,实验表明自监督表示优于现有方法且可用于其他领域。

Comments ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22227 2026-07-03 cs.CL cs.LG 版本更新 62%

Probing Spectrum-Like Organization of States of Mind in Transformer Representation Spaces

Transformer嵌入空间中认知状态的几何组织

Sophie Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过线性与浅层非线性探针评估句子嵌入是否能解码人类可解释的认知属性,发现嵌入空间存在显著的几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏