arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1356 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1356 篇

2602.13319 2026-08-12 cs.AI cs.HC 版本更新 57%

Situation Graph Prediction for User Perspective Modeling

情境图预测:用户建模的结构化视角推断

Jisung Shin, Daniel Platnick, Marjan Alirezaie, Hossein Rahnama

机构 * Flybits Labs, Creative AI Hub(Flybits实验室、创意人工智能中心) University of Toronto(多伦多大学) Toronto Metropolitan University(多伦多 Metropolitan 大学) MIT Media Lab(MIT媒体实验室)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 情境图预测通过结构化视角推断提升用户建模能力,揭示潜在状态推断比表层提取更困难。

Comments Accepted to PILA 2026: Workshop on Personal Intelligence in the Agentic AI Era, at KDD 2026, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28503 2026-08-11 cs.AI 版本更新 57%

InfoOps Bench: A live information operations safety benchmark

InfoOps Bench:实时信息行动安全基准

Dorian Quelle, Lisa-Maria Neudert, Jonathan Bright, John Gallacher

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究提出实时信息行动安全基准InfoOps Bench,测试17个前沿语言模型抵御国家支持信息行动的能力,发现多数模型可被利用,中国开发模型对涉华事实主张合规性显著下降,凸显模型可用性与安全性的平衡挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19430 2026-08-11 cs.CR cs.AI cs.MA 版本更新 57%

ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems

通道卫士:安全模型无法组合成安全的多智能体系统

Elias Hossain, Md Mehedi Hasan Nipu, Fatema Tuj Johora Faria, Tasfia Nuzhat Ornee, Maleeha Sheikh

机构 * College of Engineering and Computer Science, University of Central Florida(工程与计算机科学学院,中央佛罗里达大学) Department of Computer Science and Engineering, North South University(计算机科学与工程系,北南大学) Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程,阿沙努拉科学与技术大学) Department of Electrical and Computer Engineering, Purdue University Fort Wayne(电气与计算机工程系,普渡大学弗拉特沃恩分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究多智能体大语言模型应用程序中智能体间通道安全问题,提出ChannelGuard深度防御框架,在通道设信息瓶颈门,通过文本与对抗短语库评分处理信息,能有效阻止工具中毒攻击,降低提示注入攻击成功率,保持准确率,白盒自适应释义可规避嵌入门。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15434 2026-08-11 cs.MA cs.AI cs.CR 版本更新 57%

Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation

人工智能对人工智能管理中的胁迫与欺骗:无提示升级的代理基准测试

Jasmine Brazilek, Maheep Chaudhary, Zoe Lu, Miles Tidmarsh

机构 * CaML Sentient Futures

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究人工智能管理中代理升级问题,引入管理者胁迫基准测试,通过九级阶梯衡量升级,对五个家族六个模型实验,发现权威增加胁迫,伪造成功局限于部分模型,发布基准测试和代码,为管理多智能体动态提供重要参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14299 2026-08-07 cs.CV cs.LG 版本更新 57%

What Drives Test-Time Adaptation for CLIP? A Controlled Empirical Study from an Update Perspective

什么驱动了CLIP的测试时适应?从更新视角进行的受控实证研究

Jiazhen Huang, Xiao Chen, Zhiming Liu, Yaru Sun, Jingyan Jiang, Zhi Wang

机构 * Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文通过受控实证研究,从更新视角分析了CLIP测试时适应方法的驱动因素,揭示了适应增益主要来自测试时证据和可靠代理,而非繁重优化,并指出无单一范式普遍最优。

Comments Benchmark and codes are available at https://github.com/walawalagoose/TTABC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15145 2026-08-07 cs.AI cs.DL 版本更新 57%

An Axiomatic Benchmark for Evaluation of Scientific Novelty Metrics

一种评估科学新颖性度量的公理化基准

Miri Liu, ChengXiang Zhai

机构 * Department of Computer Science University of Illinois at Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出一种公理化基准,评估科学新颖性度量,通过跨三个AI研究领域的十项任务验证现有度量,发现无一指标完全满足所有公理,且不同架构的指标组合能显著提升基准表现。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16763 2026-08-07 cs.AI 版本更新 57%

When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

当AI基准测试达到平台期:基准饱和的系统性研究

Mubashara Akhtar, Anka Reuel, Prajna Soni, Sanchit Ahuja, Pawan Sasanka Ammanamanchi, Ruchit Rawal, Vilém Zouhar, Srishti Yadav, Chenxi Whitehouse, Dayeon Ki, Jennifer Mickel, Leshem Choshen, Marek Šuppa, Jan Batzner, Jenny Chim, Jeba Sania, Yanan Long, Hossein A. Rahmani, Christina Knight, Yiyang Nan, Jyoutir Raj, Yu Fan, Shubham Singh, Subramanyam Sahoo, Eliya Habba, Usman Gohar, Siddhesh Pawar, Robert Scholz, Arjun Subramonian, Jingwei Ni, Mykel Kochenderfer, Sanmi Koyejo, Mrinmaya Sachan, Stella Biderman, Zeerak Talat, Avijit Ghosh, Irene Solaiman

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学) University of Washington(华盛顿大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本研究定义并分析了60个语言模型基准的饱和现象,发现近半数基准出现饱和,且专家策划而非公开测试数据影响抗饱和能力,为延长基准寿命提供了设计建议。

Comments Published at ICML 2026 (Forty-Third International Conference on Machine Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17241 2026-08-07 cs.CL 版本更新 57%

Predicting Social Media User Actions: A Hybrid Approach for Common and Rare Behavior Prediction on Bluesky

基于社交媒体的人格挑战:混合预测常见和罕见用户行为于Bluesky

Benjamin White, Anastasia Shimorina

机构 * Orange Innovation(Orange创新)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出了一种混合方法,用于预测社交媒体上常见和罕见用户行为,通过结合多种模型和特征工程,在Bluesky数据集上实现了较高的预测精度,并在挑战赛中获得第一名。

Comments 1st place at SocialSim: Social-Media Based Personas challenge 2025; SoCon workshop (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19322 2026-08-06 cs.CL 版本更新 57%

Two-Level Meta-Rubrics for Evaluating Open-Ended Generation: GAMUT, a Benchmark for Factual Completeness

用于评估开放式生成的两级元评分标准:GAMUT,事实完整性基准

Xilun Chen, Zhaleh Feizollahi, Ross Goodwin, Seungwhan Moon, Scott Yih, Pinar Donmez, Babak Damavandi, Luna Dong

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究如何评估开放式生成内容的事实完整性,提出两级元评分标准框架并实例化为Gamut基准,构建基于真实图像的问题及评分标准,评估多个模型,发现其具挑战性、区分性且对法官选择鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17188 2026-08-06 cs.CV cs.CL 版本更新 57%

Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

并非真正的多语言:脚本一致性作为VLM评估中缺失的维度

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina, Rajvee Sheth

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出PuMVR基准,评估10个VLM在旁遮普语三种文字上的表现,发现显著的脚本差距,并提出脚本一致性率(SCR)作为必要评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04832 2026-08-06 cs.CV cs.GR cs.LG 版本更新 57%

BIM-Native Tokenization for Constraint-Aware Room Layout Synthesis

基于标记的建筑:一种用于布局合成的Transformer

Manuel Ladron de Guevara, Jinmo Rhee, Ardavan Bidgoli, Vaidas Razgaitis, Michael Bergin

机构 * Higharc University of Calgary(卡尔加里大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.LG

AI总结 本文提出SBM模型,通过统一建筑元素的异质特征集生成布局合成的Transformer架构,实现高保真房间嵌入和功能布局生成。

Comments 7 pages, 2 page References, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11745 2026-08-06 cs.AI 版本更新 57%

Text2GraphQuery-Bench: A Text to Graph Query Benchmark

Text2GQL-Bench: 一个文本到图查询语言基准 [实验、分析与基准]

Songlin Lyu, Lujie Ban, Zihang Wu, Tianqi Luo, Jirong Liu, Ayoub Moussaid, Oskar van Rest, Heng Lin, Chenhao Ma, Nan Tang, Shipeng Qi, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xi'an Polytechnic University(西安理工大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 Text2GQL-Bench是一个统一的文本到图查询语言基准,通过多领域数据集和评估方法,揭示了ISO-GQL生成中的方言差距,并展示了通过充足示例提升模型性能的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02422 2026-08-06 cs.CR cs.AI 版本更新 57%

Dynamic Jailbreaking Attack

动态目标攻击

Kedong Xiu, Yunhan Yang, Churui Zeng, Tianhang Zheng, Xinzhe Huang, Di Wang, Puning Zhao, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Nanyang Technological University(南洋理工大学) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科技大学) SUN YAT-SEN UNIVERSITY(孙中山大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 动态目标攻击通过利用目标模型自身响应作为自适应目标,提高了对抗攻击的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27975 2026-08-05 cs.CV cs.AI 版本更新 57%

TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions

TransVLM:一种用于检测任意 shot 转换的视觉-语言框架和基准

Ce Chen, Yi Ren, Yuanming Li, Viktor Goriachko, Zhenhui Ye, Zujin Guo, Zhibin Hong, Mingming Gong

机构 * University of Melbourne(墨尔本大学) HeyGen Research(HeyGen研究院) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 TransVLM 提出了一种视觉-语言框架,通过注入光流作为关键运动先验,提升对任意 shot 转换的检测能力,同时设计了可扩展的数据引擎和基准测试,实验表明其性能优于传统方法和现有 VLM。

Comments v2: Corrected an inaccurate statement in the abstract regarding production deployment. Accepted by ECCV 2026. For more related research, please visit HeyGen Research (https://www.heygen.com/research) and HeyGen Avatar-V (https://www.heygen.com/research/avatar-v-model). Project page: https://chence17.github.io/TransVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25379 2026-08-04 cs.AI 版本更新 57%

Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response

具备网络能力的人工智能代理:漏洞、评估遏制与防御响应

Abu Bakar Siddik

机构 * Rajshahi University of Engineering & Technology(拉杰沙希工程技术大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究具备网络能力的人工智能代理的漏洞等问题,综合五类漏洞,以特定事件为案例研究,探讨遏制等控制措施,确定评估网络能力及其运行环境安全性的实际优先事项。

Comments 27 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05915 2026-08-04 cs.AI 版本更新 57%

PCBWorld: A Benchmark Environment for Engine-Grounded PCB Design Automation

PCBWorld:用于基于引擎的PCB设计自动化的基准环境

Hyungseok Song, Junseok Park, Won-Seok Choi, Seohui Bae, Han-Seul Jeong, Youngjoon Park, Soonyoung Lee

机构 * LG AI Research(LG人工智能研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究旨在改进PCB布线,介绍基于KiCad EDA引擎的开源环境PCBWorld及数据集PCBWorld-Bench,支持多种智能体。实验表明其中智能体性能优于基线,仅在合成板训练的强化学习策略可零样本迁移到真实板,有望提升布线能力。

Comments Accepted to the KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI (non-archival). Main text with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17020 2026-08-04 cs.CV cs.AI 版本更新 57%

FusionRS: A Large-Scale RGB-Infrared-Style Remote Sensing Dataset for Cross-Modal Vision-Language Learning

FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集

Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Dingyi Lu, Chengyin Hu, Luwei Yang, Fengyu Zhang, Yiwei Wei, Jiujiang Guo

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) University of Electronic Science and Technology of China(电子科技大学) Tianjin University(天津大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06055 2026-08-04 cs.AI 版本更新 57%

HUSH-Bench: Measuring Memory-Use Boundaries for Sensitive History in Conversational Agents

记忆何时应保持沉默:衡量记忆增强型对话代理的记忆使用边界

Lingxiang Xu, Jiaoyun Yang, Min Hu, Ning An

机构 * Hefei University of Technology(合肥工业大学) Harvard Medical School(哈佛医学院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出RBI-Eval框架,通过探针集比较模型在有/无敏感记忆时的行为差异,发现当前检索增强生成系统无法避免敏感记忆的不当整合,需在检索和生成阶段同时进行记忆感知决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17920 2026-08-04 cs.LG 版本更新 57%

SingLEM: Single-Channel Large EEG Model

SingLEM:单通道脑电大模型

Jamiyan Sukhbaatar, Satoshi Imamura, Ibuki Inoue, Shoya Murakami, Kazi Mahmudul Hassan, Seungwoo Han, Ingon Chanpornpakdi, Toshihisa Tanaka

机构 * Department of Electronic and Information Engineering, Tokyo University of Agriculture and Technology(电子信息工程系,东京农业科技大学) Department of Electronics and Communication Engineering, National University of Mongolia(电子与通信工程系,蒙古国立大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 SingLEM是一种自监督单通道EEG基础模型,通过71个公开EEG数据集预训练,在6项任务的严格评估中表现优于对比方法,支持灵活的EEG特征提取与空间分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09094 2026-08-03 cs.SD cs.CL 版本更新 57%

Few-Shot Contrastive Adaptation for Audio Abuse Detection in Low-Resource Indic Languages

少样本对比适应用于低资源印地语中音频滥用检测

Aditya Narayan Sankaran, Reza Farahbakhsh, Noel Crespi

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 本文探讨了CLAP模型在低资源印地语中直接从音频检测滥用语音的可能性,通过ADIMA数据集评估少样本对比适应的效果,发现CLAP能提供强跨语言音频表示,但少样本适应效果语言依赖且非单调。

Comments 12 pages, preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21419 2026-07-31 cs.AI 版本更新 57%

PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning

PATS:用于智能体强化学习的策略感知训练框架

Yipeng Shi, Zhipeng Ma, Yue Wang, Qitai Tan, Yang Li, Peng Chen, Zhengzhou Zhu

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究针对长期语言模型智能体强化学习中弱策略问题,提出以策略为中心的训练范式Pats,将技能作为动态训练框架,通过转换展开组为证据卡、特定任务评估调整上下文等改进策略,在多个任务上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15297 2026-07-31 cs.CL 版本更新 57%

AfriEconQA: A Benchmark for Quantitative and Temporal Reasoning over World Bank Economic Reports

AfriEconQA:基于世界银行报告的非洲经济分析基准数据集

Edward Ajayi, Mustapha Alaba, David Stephen

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。

Comments Dataset Explorer: https://afrieconqa.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25991 2026-07-31 cs.AI cs.CV 版本更新 57%

Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline

面向社交媒体中统一的多模态虚假信息检测:基准数据集与基线模型

Haiyang Li, Yaxiong Wang, Shengeng Tang, Yuchen Zhang, Lianwei Wu, Lechao Cheng, Liu Liu, Chaofeng Dong, Zhun Zhong

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) School of Computer Science and Technology, Northwestern Polytechnical University(计算机科学与技术学院,西北工业大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究构建了含9.8万样本的OmniFake基准数据集,提出UMFDet框架,实现对人工与AI生成两类多模态虚假内容的统一检测,性能优于专用基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25904 2026-07-30 cs.AI 版本更新 57%

Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification

交互式奖励智能体:通过环境状态验证进行图形用户界面任务评估

Chenrui Shi, Yuwei Wu, Yang Liu, Ruining Feng, Zirui Shang, Zhi Gao, Lifeng Fan, Che Sun

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 研究图形用户界面任务评估难题,提出交互式奖励智能体IRA,基于提议验证框架,结合可见界面与环境状态证据。IRA在GUI-RewardBench基准测试中准确率达86.9%,应用于强化学习时实现34.0%的OSWorld成功率,能为训练图形用户界面智能体提供有效奖励信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24241 2026-07-30 cs.CV cs.AI 版本更新 57%

FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

FilmBench:用于电影视频生成的电影级基准测试

Shengyi Wang, Niantong Li, Guangzheng Hu, Hong Qi, Fei Ding, Weixu Qiao, Jinlin Wang, Xiaotong Lv, Peng Han, Zimeng Li, Fanshu Ding, Yushu Wang, Han Wu, Jingjing Chen, Chongxiao Wang, Yanhao Wu, Chenglong Huang, Xiaoqian Zhu, Jie Tian, Hua Li, Jingjing Fan, Mingshuang Tang, Zhong Li, Hengxia Qiang, Weibin Chen, Jinyang Zhen, Bing Zhao, Lin Qu, Jing Li, Hu Wei

机构 * Alibaba Group(阿里巴巴集团) Moku Lab, Hujing Digital Media & Entertainment Group(魔氪实验室,虎鲸数字媒体与娱乐集团) Beijing Film Academy(北京电影学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 FilmBench是基于电影学院传统专业电影语言开发的文本到视频和参考到视频基准测试。它从获奖影片反向设计提示,依电影分类法评估,开发自动评估代理并开源核心套件,能再现人类模型排名,指出当前模型在动态美学等方面不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06254 2026-07-30 cs.CV cs.AI 版本更新 57%

VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection

VendorBench-100:用于深度伪造图像检测的统一跨范式基准测试

Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo, Kurundkar G. D., Mahamune M. R., Nilesh K. Deshmukh

机构 * Universidade da Beira Interior(贝拉内斯大学) Shri Guru Buddhi Swami College(什里·古鲁·布迪·斯瓦米学院) Swami Ramanand Tirtha Marathwada University(斯瓦米拉曼南德·蒂尔塔马哈拉施特拉大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究针对深度伪造图像检测的三种范式缺乏通用评估的问题,提出VendorBench-100基准测试,用统一框架评估36个模型,强调现实场景,通过MCC排名,发现ROC-AUC与MCC有差异,还发布评估框架和结果助力后续研究。

Comments Fixed scoring-normalization error in Neural Defend/TruthScan results, revising the central finding: MCC and ROC-AUC are strongly correlated (r ~ 0.86) overall, with only a specific subset showing one-directional threshold miscalibration. Abstract, tables, Discussion, Conclusion updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21033 2026-07-30 cs.CE cs.LG 版本更新 57%

TabPFN Extensions for Interpretable Geotechnical Modelling

TabPFN扩展在可解释地质建模中的应用

Taiga Saito, Yu Otake, Daijiro Mizutani, Stephen Wu

机构 * Department of Civil and Environmental Engineering, Tohoku University(东北大学土木环境工程系) Research Organization of Information and Systems, The Institute of Statistical Mathematics(信息与系统研究所统计数学研究所) Department of Statistical Science, The Graduate University for Advanced Studies(高级研究大学统计科学系)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文评估了TabPFN及其扩展库在地质任务中的表现,通过土壤类型分类和参数迭代填补,展示了TabPFN在不确定性量化和可解释性方面的优势。

Journal ref Georisk: Assessment and Management of Risk for Engineered Systems and Geohazards (2026) 1-20

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10605 2026-07-30 stat.ML cs.CY cs.LG econ.EM stat.ME 版本更新 57%

Optimal Causal Annotations: An Application to Casenotes in Social Services

批量自适应因果标注

Ezinne Nwankwo, Lauri Goldkind, Angela Zhou

机构 * UC Berkeley(加州大学伯克利分校) Fordham University(福特汉姆大学) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文提出一种批量自适应方法,通过优化数据采样策略提高因果效应估计效率,减少标注成本,实验证明在缺失数据下能显著降低均方误差。

Comments Extended journal version. A preliminary version was accepted to AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22280 2026-07-28 physics.flu-dyn cs.AI 版本更新 57%

Neptuna: A Comprehensive Machine Learning Framework for Benchmarking Complex Multiphase Flows

海王星:用于复杂多相流基准测试的综合机器学习框架

Harish Ramachandran, Björn Kimpel, Thomas Paula, Josef Winter, Steffen Schmidt, Nikolaus Adams

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 针对冲击驱动的可压缩多相流基准测试难题,介绍含2.4TB数据集的Neptuna框架,评估多种替代模型家族,研究复合损失与自适应损失平衡,结果显示无单一模型最优,复合损失及SoftAdapt策略有显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10856 2026-07-28 cs.SE cs.AI cs.HC 版本更新 57%

How Do Practitioners Build SE Agents? Insights from a Mixed-Methods Study

从业者如何构建软件工程代理?来自混合方法研究的见解

Yunbo Lyu, David Williams, Jieke Shi, Zhensu Sun, Chao Peng, Zhou Yang, Federica Sarro, David Lo

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文通过混合方法研究从业者构建软件工程代理的方式,发现随着实现成本降低瓶颈转移,刻画了七阶段工作流程和评估驱动开发转变,还识别出团队面临的六个挑战及应对实践。

详情

展开后加载摘要…

URL PDF HTML 收藏