arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-13 至 2026-08-13 共收录 300 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 76 篇

2608.11332 2026-08-13 cs.CL cs.CV 新提交 77%

Gloss-Free Representation Learning for Cross-Dataset Sign Spotting

无 gloss( gloss 指手语 gloss,即手语的书面转写)的跨数据集手语定位表征学习

Oğuz Akif Tüfekcioğlu, Ezgi Ekin, Mustafa Kaan Çevik, Hacer Yalim Keles

机构 * Hacettepe University(哈杰泰佩大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 本研究针对资源受限语言的手语研究,用土耳其广播语料库 TSL-News 基于转录文本的伪 gloss 标签预训练手语编码器,在跨数据集手语定位任务中显著提升性能,证明松散对齐的广播数据可提供有效弱监督学习手语表征。

Comments Accepted at the 4th LIMIT Workshop (Representation Learning with Very Limited Resources), ECCV 2026. The abstract was shortened to comply with arXiv's 1,920-character limit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11327 2026-08-13 cs.LG q-fin.CP 新提交 77%

Long-Horizon Forecasting of Complete Financial Statements with Forma

使用Forma进行完整财务报表的长周期预测

Travis L. Johnson, Jiannan Jiang, Soumyabrata Chaudhuri, Yihao Chen, Lauren Falvey, Donal O'Cofaigh

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 该研究发布了ProForma-20Q基准,提出Transformer模型Forma,在1至20个季度的完整财务报表预测任务中,击败各类对比模型,优势随期限扩大,且能支持无需重训的情景分析。

Comments 46 pages, 2 figures, 3 tables. Benchmark: https://github.com/forma-lab-mccombs/proforma-20q. Model and weights: https://github.com/forma-lab-mccombs/forma-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11694 2026-08-13 cs.CL cs.AI 新提交 76%

The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance

措辞效应:量化大语言模型基准测试性能中的双向漂移

Shailja Thakur, Sungeun An, Chad DeLuca, Hima Patel

机构 * IBM Research India(IBM印度研究院) IBM Research Almaden(IBM阿尔马登研究院)

专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI

AI总结 该研究提出BenchDrift方法,通过生成基准问题的保义变体,发现大语言模型性能存在双向漂移,且漂移与重新措辞相关,模型性能提升未消除措辞敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11669 2026-08-13 cs.LG cs.AI cs.CL 新提交 75%

Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL

规则丢弃(Rubric Dropout):缓解以规则为奖励的强化学习中奖励黑客行为的简单方法

Minglai Yang, Xinyu Guo, Utkarsh Tyagi, Mian Zhang, Razvan Dumitru, Sunjie Hou, Yunzhong He, Daniel Yue Zhang, Ying Liu

机构 * Scale AI University of Arizona(亚利桑那大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对以规则为奖励的强化学习中的奖励黑客行为,提出Rubric Dropout方法,在医学和科学规则上训练Qwen3-8B,可提升分布外基准的黄金评判分数、降低黑客指标,30-50%丢弃比例效果最优。

Comments 18 pages, 7 figures, 4 tables. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11219 2026-08-13 cs.AI cs.CL cs.LG 新提交 75%

From Monolithic to Modular: Segment-level Automatic Prompt Optimization

从整体到模块:片段级自动提示优化

Nikita Kulin, Viktor Zhuravlev, Artur Khairullin, Sergey Muravyov, Ilya Makarov, Daniil Sukhorukov, Ekaterina Averkova

机构 * ITMO University(伊蒂莫大学) HSE(高等经济大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对自动提示优化易顾此失彼的问题,提出片段级APO方法SAPO,将提示拆分后针对性优化,在多数据集和模型上取得优于基线的平均得分。

Comments Accepted at the IJCAI-ECAI 2026 Workshop on Robustifying Generative AI for Reliable, Safe, and Human-Centric Systems (RobustifAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04923 2026-08-13 cs.LG cs.AI cs.CL 版本更新 75%

Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning

基于评分标准的强化学习中的奖励黑客行为的复现、分析与检测

Xuekang Wang, Zhuoyuan Hao, Shuo Hou, Hao Peng, Juanzi Li, Xiaozhi Wang

机构 * Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出可控黑客环境CHERRL,通过注入已知偏见复现奖励黑客行为,分析其可发现性与可利用性,并探索基于智能体的自动检测方法。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12097 2026-08-13 cs.AI 新提交 74%

Graph-Structured Rubrics: Compiling Rubrics into Typed Evaluation Graphs for LLM Judges

图结构评分标准:将评分标准编译为用于大语言模型评判器的类型化评估图

Xi Chen, Jie Mu, Mo Xuan, Qun Shao

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本研究提出图结构评分标准(GSR),将评分标准编译为类型化评估图,在GPT-OSS-120B上较Prometheus式评分提升了精确分数一致性,且在成对评估中取得更高准确率。

Comments 11 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04495 2026-08-13 cs.CL cs.AI 版本更新 73%

CAR: Query-Guided Confidence-Aware Reranking for Retrieval-Augmented Generation

CAR:面向检索增强生成的查询引导置信感知重排序

Zhipeng Song, Yizhi Zhou, Xiangyu Kong, Jiulong Jiao, Xuezhou Ye, Chunqi Gao, Xueqing Shi, Yu Wang, Yuhang Zhou, Heng Qi

专题命中 评测与基准 :LLM(summary_cn);分类 cs.CL、cs.AI

AI总结 针对RAG现有重排序仅关注相关性的问题,提出无需训练的CAR框架,通过查询引导的答案稳定性校正排名,在多数据集实验中实现稳健性能提升,可用于黑盒LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11683 2026-08-13 cs.AI cs.CL 新提交 73%

FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents

FrontierFinance:用于衡量金融智能体前沿智能的具有挑战性的基准

Yuhao Zhang, O. Ozan Koyluoglu, Thejas Venkatesh, Richard Diehl Martinez, Vishank Bhatia, Arash Alidoust, Ashwin Paranjape

机构 * Samaya AI(萨马亚人工智能公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究推出覆盖投资者全流程的FrontierFinance基准,评估发现工具框架影响智能体表现,Samaya内部系统最优,开源模型Kimi K3成本更低且接近专有模型,最难用例为筛选与发现等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08283 2026-08-13 cs.CL cs.AI 版本更新 73%

Do Evaluation Metrics Detect Errors in Classical Chinese to English Translations?

评估指标能否检测古文汉英翻译中的错误?

Osvaldo Quinjica, Eric Bennett, Xinchen Yang, Andrew Schonebaum, Marine Carpuat

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究以古文汉英翻译为测试案例,引入诊断框架探查现有翻译评估指标的可靠性,发现MetricX24整体表现最佳,凸显需开发更适配历史文化独特场景的翻译评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12262 2026-08-13 cs.CV cs.AI 新提交 70%

Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

Diagram-MMU:面向科学图表的多模态基准测试

Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Baidu Inc(百度公司) AIML, Adelaide University(阿德莱德大学AIML) SUTD(新加坡科技设计大学) Southeast University(东南大学) East China Normal University(华东师范大学) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文构建了多模态基准测试Diagram-MMU,评估MLLMs的科学图表解析与理解能力,发现图表转代码任务更具挑战,Claude-4.6 Opus在智能体场景下表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12133 2026-08-13 cs.AI 新提交 70%

GUIDE: Governed Unified Intelligence for Document-to-Artifact Generation in Enterprise Settings

GUIDE:企业场景下从文档到制品生成的受控统一智能

Shivali Dalmia, Sumukha Thoppanahalli, Mohammadreza Sediqin, Abhishek Mukherji

机构 * Centific Research(森蒂菲克研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对企业指南文档手动处理效率低的问题,提出基于共享版本化规则库的多智能体框架GUIDE,在120份真实文档上实现96%成功率,大幅提升文档到制品的生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11741 2026-08-13 cs.CV cs.AI 新提交 70%

JieZi: A Large-Scale Expert-Audited Dataset and Benchmark for Ancient Chinese Character Exegesis

JieZi:用于古文字训诂的大规模专家审核数据集与基准

Ran Li, Huiguo He, Jiahuan Cao, Junle Liu, Hiuyi Cheng, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对古文字训诂研究缺乏结构化数据与基准的问题,提出ACCE任务,构建JieZi-Dataset与JieZi-Bench,实验发现多模态大模型在古文字训诂的高阶任务上表现不佳,微调后性能显著提升。

Comments 19 pages, 13 figures. Accepted to the Dataset Track of ACM Multimedia 2026 for oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11738 2026-08-13 cs.CV cs.AI 新提交 70%

Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System

推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统

Haoyu Zhang, Shuoxun Zhang, Peng Ye, Lin Zhang, Jiakang Yuan, Shenghong Yi, Yuening Wang, Tao Chen

机构 * Fudan University(复旦大学) College of Future Information Technology(未来信息技术学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11650 2026-08-13 cs.SD cs.CL 新提交 70%

Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder

Confucius4-TTS:带有可学习说话人编码器的无文本跨语言零样本文本转语音系统

Huaxuan Wang, Huimin Wang, Ruiyu Zhang, Yingjie Li, Yitao Duan

机构 * NetEase Youdao(网易有道)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出支持14种语言的Confucius4-TTS系统,采用两阶段架构,无需音频提示转录即可实现跨语言零样本TTS,在多项基准测试中表现优异,相关资源已公开。

Comments 12 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11528 2026-08-13 cs.CL 新提交 70%

Group Alignment-Induced Sycophancy: A Two-Sided Evaluation of Steerable Pluralistic Alignment

群体对齐诱导的谄媚性:可引导的多元对齐的双向评估

Haokai Zhao, Yunze Xiao, Weihao Xuan, Flora Salim, Benjamin Tag, Aditya Joshi

机构 * University of New South Wales(新南威尔士大学) Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 该研究提出GAS指标,评估3种方法、4个模型在13个人口统计群体上的对齐效果,发现群体对齐的观点收益和谄媚性变化存在群体异质性,建议采用双向多维度报告方式。

Comments 9 pages main text, 23 pages in total, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11238 2026-08-13 cs.AI 新提交 70%

Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability

面向查询不可知的RAG评估:基于查询覆盖率与声明可验证性

Jeonghwan Choi, Taewon Yun, Minjeong Ban, Gyeonghun Sun, Jae-Gil Lee, Hwanjun Song

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Q-CARE框架,通过分解查询与答案实现RAG的细粒度评估,在8个数据集的基准测试中,其评估结果与人工判断的相关性优于现有4种RAG评估指标。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16179 2026-08-13 cs.CV cs.AI 70%

360° Image Perception with MLLMs: A Comprehensive Benchmark and a Training-Free Method

360度图像感知与MLLMs:一个全面的基准和无需训练的方法

Huyen T. T. Tran, Van-Quang Nguyen, Farros Alferro, Kang-Jun Liu, Takayuki Okatani

机构 * GSIS, Tohoku University(东大GSIS研究所,东京东大大学) RIKEN AIP, Japan(日本RIKEN AIP)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出360Bench基准和Free360方法,评估MLLMs在360度图像感知中的能力,揭示其不足,并提出基于场景图的无需训练框架提升VQA性能。

Journal ref ECCV2026 (Link: https://tranhuyen1191.github.io/360Bench-Free360/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12216 2026-08-13 cs.HC 新提交 67%

"Pharos Night: Crown Pursuit": An AI-Native Deck-Building and Tactical Arena Game Design Based on Multi-Agent Systems

《Pharos Night:皇冠追逐》:一款基于多智能体系统的原生AI卡组构建与战术竞技场游戏设计

Ting-Chen Hsu, Jueyao Liu, Yanzi Zhou, Jiangxu Lin, Haoyu Xu, Yuwen Liu, Yanjia Liu, Bangjing Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究设计了基于多智能体系统的原生AI卡组构建与战术竞技场游戏《Pharos Night:皇冠追逐》,利用大语言模型实现核心功能,小规模试玩显示其能提供有策略性的游戏体验,也暴露出相关挑战,展现了多智能体生成式AI在游戏设计中的潜力。

Comments Accepted to 2026 Annual Symposium on Computer-Human Interaction in Play (CHI Play)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12051 2026-08-13 cs.CV 新提交 67%

Do Not Forget the Obvious - RISC: A Risk-Informed Slice-Coverage Protocol for Safe Autonomous Driving

勿忽视显而易见的内容——RISC:一种用于安全自动驾驶的风险感知切片覆盖协议

Fabian Hüger

机构 * CARIAD SE

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究提出RISC协议,将安全问题转化为风险切片,通过风险引导选择提升自动驾驶关键故障发现率,可应用于多类自动驾驶子系统,补充现有测试验证流程。

Comments 14 pages, 3 figures, 5 tables. Accepted at the ECCV 2026 Workshop on Safe and Defensive Autonomous Driving (SDAD). Non-archival workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12950 2026-08-13 cs.SE 版本更新 67%

Diffploit: Facilitating Cross-Version Exploit Migration for Open Source Library Vulnerabilities

Diffploit:助力开源库漏洞的跨版本漏洞利用迁移

Zirui Chen, Zhipeng Xue, Jiayuan Zhou, Xing Hu, Xin Xia, Xiaohu Yang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 Diffploit是一种迭代的差异驱动漏洞利用迁移方法,通过上下文模块和迁移模块提升跨版本漏洞利用迁移成功率,在大规模Java CVE数据集上表现优于现有工具,还发现了受影响版本范围错误的CVE及未报告的易受攻击版本。

Comments ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09045 2026-08-13 econ.GN q-fin.EC 版本更新 67%

Entangled vs. Separable Choice

纠缠型与可分型选择

Nail Kashaev, Martin Plávala, Victor H. Aguiar

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该论文提出了一种无需理性等假设的非参数方法,用于区分决策者的纠缠型与可分型选择,其可分性刻画可应用于匹配操纵、辩诉交易等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06216 2026-08-13 cs.LG cs.AI 版本更新 66%

Continual Learning in Transition

过渡中的持续学习

Zhiyan Hou, Dan Zhang, Tao Feng, Liyuan Wang, Wei Li, Xiangzhao Hao, Hongyan An, Junfeng Fang, Haokai Ma, Zhaohui Xu, Xinyu Tang, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI、cs.LG;LLM(comments)

AI总结 本文系统综述持续学习从以参数为中心向系统级适配的转变,通过时机、方式、位置三轴框架分析其演化,讨论相关挑战与未来方向。

Comments Survey on continual learning in the LLM and agentic-AI era

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12086 2026-08-13 cs.CV cs.LG 新提交 57%

Look What the Probes Dragged In! Real-World Chest X-ray Shortcuts in MedCLIP

看看探针发现了什么!MedCLIP中的真实世界胸部X光捷径

Nikolette Pedersen, Regitze Sydendal, Veronika Cheplygina, Théo Sourget

机构 * Pattern Recognition Revisited Lab (PURRlab)(模式识别重访实验室(PURRlab)) IT University of Copenhagen(哥本哈根信息技术大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 该研究探究MedCLIP模型中不同层的真实世界胸部X光捷径,发现局部捷径出现在较后层、弥散捷径出现在较早层,且两个数据集存在数据质量问题,凸显高质量数据集的必要性。

Comments 11 pages, 3 figure, poster presentation at the joint FAIMI, BRIDGE, and EPIMI workshop at MICCAI 2026 (Strasbourg, France) conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11907 2026-08-13 cs.CV cs.AI 新提交 57%

Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models

你能看到你所绘制的内容吗?面向统一多模态模型整体评估的语义闭环框架

Hao Zhang, Jiaxin Qi, Zhijiang Tang, Jianqiang Huang

机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) University of Chinese Academy of Sciences(中国科学院大学) Computer Network Information Center(计算机网络信息中心) Chinese Academy of Sciences(中国科学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本研究针对统一多模态模型的系统级评估缺口,提出无标注的SGU语义闭环框架,通过感知-生成-推理流程评估模型综合能力,发现高性能模型存在自生成上下文推理局限,为下一代模型开发提供基准基础。

Comments 21 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11767 2026-08-13 cs.CL 新提交 57%

Causal Structure is Inducible but Functionally Decoupled: The Routing/Readout Boundary of a Typed Mechanism Library

因果结构可诱导但功能解耦:类型化机制库的路由/读出边界

Xining Xun

机构 * Tsingjiao Information Science (Beijing) Co., Ltd.(清教信息科学(北京)有限公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究在两种规模的语言模型中发现,类型化机制库的因果结构可由监督诱导,其路由功能与答案读出解耦,且无额外开销、可审计恢复,为因果知识组织机制提供了新见解。

Comments 17 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11681 2026-08-13 cs.CV cs.AI cs.MM 新提交 57%

Learning from Multimodal Pseudo-Labels for Robust Open-Vocabulary Instance and Panoptic Segmentation

学习多模态伪标签以实现鲁棒的开放词汇实例和全景分割

Duy Tran Thanh, Yeejin Lee, Byeongkeun Kang

机构 * Seoul National University of Science and Technology(首尔科技大学) Chung-Ang University(中央大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对开放词汇实例分割与开放集全景分割的痛点,提出多模态框架,结合预训练视觉语言模型生成伪标签并优化训练目标,在COCO数据集上取得优于现有SOTA的性能。

Comments 14 pages

Journal ref Neurocomputing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11643 2026-08-13 cs.CV cs.LG 新提交 57%

Robustness of AI-Art Detectors under Generator Shift

生成器偏移下AI生成艺术检测器的鲁棒性

Shivank Singh Thakur, Meien Li, Mark Stamp

机构 * San Jose State University(圣何塞州立大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.LG

AI总结 该研究针对生成器偏移问题,在SD3.5m数据集上评估了五个AI艺术检测器的鲁棒性,发现模型在跨生成器场景下泛化能力不足,CLIP ViT-L/14表现最优,为分层防御检测器的开发提供了依据。

Comments To appear as a chapter in the book "Artificial Intelligence for Cyber Defense in Emerging Threats", to be published by Springer by early 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11367 2026-08-13 cs.CV cs.AI 新提交 57%

Gaze Target Estimation Anywhere with Concepts

基于概念的任意场景注视目标估计

Xu Cao, Houze Yang, Vipin Gunda, Zhongyi Zhou, Tianyu Xu, Adarsh Kowdle, Inki Kim, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌公司)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 针对现有注视估计方法依赖中间阶段、缺乏灵活性的局限,提出PGE任务,构建Gaze-Co数据集,开发GazeAnywhere模型,实现端到端的概念驱动注视目标估计并达到最优性能。

Comments CVPR 2026 Code and Benchmark are aviliable at https://github.com/IrohXu/GazeAnywhere and https://huggingface.co/datasets/IrohXu/Gaze-Co-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11341 2026-08-13 cs.AI 新提交 57%

Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence

Apodex Discovery:用于评估和构建发现式人工智能的现实基准与环境

Brian Wang, Bin Feng, Xiaoman Pan, Chenyang An, Felix Liu, Tangqi Fang, Gongbo Sun, Lingfeng Shen, Ning Wang, Handuo Zhang, Feng Chen, Fuchao Yang, Xiang Wang, Jiacheng Lin, Siting Li, Zixuan Liu, Chi Han, Zhenhailong Wang, Kunlun Zhu, Lawrence Zhao, Yueqi Guo, Kailong Wen, Feng Xing, Yiling Guo, Lidong Bing, David Tan, Bo An, Heng Ji, Sheng Wang

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 Apodex Discovery是评估和构建发现式AI的框架,含三个核心组件,在AAV衣壳设计等任务中较现有方法取得性能提升,推动AI评估向可验证的真正发现研究发展。

Comments 85 pages, 9 figures, 38 tables

详情

展开后加载摘要…

URL PDF HTML 收藏