arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-22 至 2026-05-22 共收录 333 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 71 篇

2605.22286 2026-05-22 cs.LG cs.AI 82%

EmoTrack: Robust Depression Tracking from Counseling Transcripts across Session Regimes

EmoTrack: 从咨询记录中跨会话制度实现稳健的抑郁跟踪

Zhaomin Wu, Jiayi Li, Bingsheng He

机构 * Department of Computer Science National University of Singapore(新加坡国立大学计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了从单次会话和多会话制度中通过咨询记录进行稳健抑郁跟踪的问题,提出了LongCounsel多会话咨询数据集和EmoTrack框架,结合LLM提取的临床信号和冻结的轮次级语义嵌入,训练症状特定预测器,并通过紧凑的跨会话记忆进一步结合先前会话,实验表明在真实单次会话基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21728 2026-05-22 cs.CV cs.CL cs.LG 82%

BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model

BEiTScore: 一种基于高效交叉编码器的无参考图像描述评估方法

Gonçalo Gomes, Bruno Martins, Chrysoula Zerva

机构 * Instituto Superior Técnico(里斯本大学理工学院) INESC-ID Instituto de Telecomunicações(电信机构)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种无参考图像描述评估方法BEiTScore,通过高效的交叉编码器模型解决传统评估方法在计算成本和敏感性方面的不足,提出了一种新的评估指标,并在多种场景下验证了其优越的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22435 2026-05-22 cs.CL 81%

Assisted Counterspeech Writing at the Crossroads of Hate Speech and Misinformation

在仇恨言论与虚假信息交汇处的辅助反诽谤写作

Genoveffa Martone, Helena Bonaldi, Marco Guerini

机构 * Fondazione Bruno Kessler(布鲁诺·克塞勒基金会) Università Cattolica del Sacro Cuore(天主教圣心大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了在仇恨言论和虚假信息共存的背景下,利用大型语言模型辅助专家反诽谤写作的方法,通过三种知识驱动的生成策略,结合事实核查和非政府组织的指南,提高了反诽谤文本的质量和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22219 2026-05-22 cs.AI 81%

SGR-Bench: Benchmarking Search Agents on State-Gated Retrieval

SGR-Bench: 对状态门控检索的搜索代理基准测试

Ningyuan Li, Haiyang Shen, Mugeng Liu, Yudong Han, Zhuofan Shi, Sixiong Xie, Yun Ma

机构 * Peking University(北京大学) Beijing University of Technology(北京理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SGR-Bench,一个用于评估状态门控检索能力的基准数据集,包含100个专家 curated 任务,通过对比显式和隐式指导方法,揭示了搜索代理在处理状态门控检索任务时的主要挑战。

Comments Work in Progress. 23 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21778 2026-05-22 cs.AI 81%

What Counts as AI Sycophancy? A Taxonomy and Expert Survey of a Fragmented Construct

什么是AI阿谀奉承?对一个碎片化概念的分类和专家调查

Meryl Ye, Lujain Ibrahim, Jessica Y. Bo, Myra Cheng, Ida Mattsson, Daniel Vennemeyer, Robert Kraut, Steve Rathje

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) University of Toronto(多伦多大学) Stanford University(斯坦福大学) University of Cincinnati(克里夫兰医学中心大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过文献综述和专家调查,揭示了AI阿谀奉承行为的分类和测量挑战,提出了一种统一的分类体系以促进对这一问题的理解和应对。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21694 2026-05-22 cs.CR cs.AI 81%

PocketAgents: A Manifest-Driven Library of Autonomous Defense Agents

PocketAgents: 一种基于manifest的自主防御代理库

Sidnei Barbieri, Ágney Lopes Roth Ferraz, Lourenço Alves Pereira Júnior

机构 * Aeronautics Institute of Technology(航空技术研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PocketAgents,一种基于manifest的自主防御代理库,通过定义代理的manifest、prompt和运行时上下文,实现了对大型语言模型驱动的防御系统进行可测量、可扩展和可追溯的防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21615 2026-05-22 cs.CR cs.LG cs.SE 81%

ASSEMBLAGE-DEEPHISTORY: A Cross-Build Binary Dataset with Temporal Coverage

ASSEMBLAGE-DEEPHISTORY: 一个具有时间覆盖的跨构建二进制数据集

Chang Liu, Noah Fleischmann, Nicolò Altamura, Edward Raff, James Holt, Kristopher Micinski

机构 * Syracuse University(Syracuse大学) Booz Allen Hamilton Independent Researcher(独立研究员) CrowdStrike

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文提出ASSEMBLAGE-DEEPHISTORY数据集,整合了跨构建多样性、跨版本历史和CVE标签,为二进制分析提供统一框架,通过三个分析验证了其在LLM漏洞检测、版本聚类和二进制相似性分解中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03784 2026-05-22 cs.AI 81%

Specification-Driven Generation and Evaluation of Discrete-Event World Models via the DEVS Formalism

通过DEVS形式化方法驱动的离散事件世界模型生成与评估

Zheyu Chen, Huiteng Zhuang, Zhuohuan Li, Chuanhao Li

机构 * Zhili College, Tsinghua University(清华大学紫光学院) School of Transportation Science and Engineering, Beihang University(北航交通科学与工程学院) Department of Industrial Engineering, Tsinghua University(清华大学工业工程系)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出了一种基于自然语言规范在线生成离散事件世界模型的方法,结合了显式模拟器的可靠性与神经模型的适应性,通过DEVS形式化方法和分阶段的LLM生成流程,实现了对事件和时间逻辑的结构推断,并通过基准测试集验证了模型的一致性和可验证性。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06503 2026-05-22 cs.AI q-bio.QM 81%

An AI system to help scientists write expert-level empirical software

一种帮助科学家编写专家级经验软件的AI系统

Eser Aygün, Anastasiya Belyaeva, Gheorghe Comanici, Marc Coram, Hao Cui, Jake Garrison, Renee Johnston Anton Kast, Cory Y. McLean, Peter Norgaard, Zahra Shamsi, David Smalling, James Thompson, Subhashini Venugopalan, Brian P. Williams, Chujun He, Sarah Martinson, Martyna Plomecka, Lai Wei, Yuchen Zhou, Qian-Ze Zhu, Matthew Abraham, Erica Brand, Anna Bulanova, Jeffrey A. Cardille, Chris Co, Scott Ellsworth, Grace Joseph, Malcolm Kane, Ryan Krueger, Johan Kartiwa, Dan Liebling, Jan-Matthis Lueckmann, Paul Raccuglia, Xuefei, Wang, Katherine Chou, James Manyika, Yossi Matias, John C. Platt, Lizzie Dorfman, Shibl Mourad, Michael P. Brenner

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Google Platforms and Devices(谷歌平台与设备) Massachusetts Institute of Technology(麻省理工学院) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Empirical Research Assistance (ERA)系统,利用大型语言模型和树搜索技术,自动创建高质量的科学软件,以加速计算实验的开发,从而提高科研效率。

Comments 78 pages, 31 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22462 2026-05-22 cs.CL cs.AI 81%

From Correlation to Cause: A Five-Stage Methodology for Feature Analysis in Transformer Language Models

从相关性到因果:一种五阶段方法用于Transformer语言模型中的特征分析

Caleb Munigety

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种五阶段方法用于Transformer语言模型中的因果特征分析,并在GPT-2小型模型上端到端地展示了其在间接宾语识别任务中的应用,通过激活补丁恢复经典IOI电路,稀疏自编码器恢复特定名称的特征,因果验证发现这些特征具有特定但部分因果性,鲁棒性测试揭示了检测鲁棒性与因果鲁棒性之间的差距,部署评估显示了最优监控配置带来的成本节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22027 2026-05-22 cs.CR 80%

Parser-Free Querying of Security Logs

无解析器的日志查询

Evan Luo, Julien Piet, David Wagner

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Sieve系统,通过将大型语言模型与轻量级自动提取的日志格式上下文相结合,生成可执行的查询代码,从而在无需解析器的情况下实现安全日志的高效查询,显著降低了复杂时间序列和跨事件查询的错误率。

Comments 21 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22008 2026-05-22 cs.NI 80%

Toward Realistic Wi-Fi Fault Diagnosis: A Multi-Modal Benchmark

迈向现实的Wi-Fi故障诊断:一个多模态基准

Junjian Zhang, Haobo Deng, Xinxin Li, Ming Zhao, Fengxiao Tang, Nei Kato

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出一个多模态基准,用于评估Wi-Fi故障诊断方法,通过构建现实中的Wi-Fi测试床和收集超过10,000个故障样本的数据集,揭示了现有方法在利用异构操作数据方面的挑战,并评估了新兴的LLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21919 2026-05-22 cs.CV cs.AI 79%

SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals

SDGBiasBench: 评估和减轻可持续发展目标中视觉-语言模型的偏见

Zihang Lin, Huaiyuan Qin, Muli Yang, Hongyuan Zhu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出SDGBiasBench,一个用于评估和减轻可持续发展目标中视觉-语言模型偏见的大型基准测试集,通过分析模型在决策和估计层面的偏见,提出CADE方法以减少偏见,提高模型的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21544 2026-05-22 cs.LG eess.SP 79%

Tabular foundation models for robust calibration of near-infrared chemical sensing data

用于近红外化学传感数据稳健校准的表格基础模型

Robin Reiter, Denis Cornet, Fabien Michel, Lauriane Rouan, Gregory Beurier

机构 * CIRAD(国际热带农业中心) UMR AGAP Institut(AGAP研究所) Université de Montpellier(蒙彼利埃大学) INRAE(国家农业食品与环境研究机构) Institut Agro(农业研究所) LIRMM(蒙彼利埃大学LIRMM实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文研究了表格基础模型在近红外化学传感数据校准中的应用,通过对比不同模型在回归和分类任务中的表现,发现预处理优化的TabPFN在回归任务中表现最佳,而在分类任务中直接使用原始光谱的数据表现最优,同时指出在存在光谱异常值和外推样本时,传统化学计量学模型仍具竞争力。

Comments 56 pages, 17 figures, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22591 2026-05-22 cs.CV 78%

Rethinking Noise-Robust Training for Frozen Vision Foundation Models: A Cross-Dataset Benchmark with a Case Study of Small-Loss Failure

重新思考冻结视觉基础模型的噪声鲁棒训练:一个跨数据集基准与小损失失败的案例研究

Zitong Li, Haoyu Wang

机构 * Department of Biostatistics and Health Informatics(生物统计学与健康信息学系)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文通过跨五个医学数据集、三种主干网络、两种噪声类型和五种噪声率的基准测试,重新评估了冻结特征域中噪声标签学习方法的性能,揭示了小损失假设在高风险场景下的局限性,并提出了基于特征空间的选择器以指导实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21882 2026-05-22 cs.CV 78%

Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception

Thermo-VL:扩展视觉语言模型以适应热红外感知

Rusiru Thushara, Yasiru Ranasinghe, Jay Paranjape, Vishal M. Patel

机构 * Department of Electrical & Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出Thermo-VL,一种基于热红外感知的视觉语言模型,通过引入可训练的热编码器和文本引导的双注意力融合模块,提升了低光照条件下的多光谱融合能力,并在热红外和RGB+热红外推理任务中取得显著成果。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17186 2026-05-22 cs.CV 78%

Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain

聚焦视觉关键点:通过视觉信息增益进行大视觉语言模型的定向训练

Seulbi Lee, Sangheum Hwang

机构 * Department of Data Science, Seoul National University of Science and Technology(数据科学系,首尔科学技术大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出通过视觉信息增益(VIG)指标,对大视觉语言模型进行定向训练,以提升视觉基础性并减少语言偏见,通过优先选择高VIG样本和token来提高性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17123 2026-05-22 cs.CL 77%

MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation

MTR-Bench:多轮推理评估的综合性基准

Xiaoyuan Li, Keqin Bao, Yubo Ma, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MTR-Bench,一个包含4类、40个任务和3600个实例的综合性基准,用于评估大型语言模型的多轮推理能力,通过自动化框架实现大规模评估,并揭示了当前先进推理模型在多轮交互任务中的不足。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21988 2026-05-22 cs.CV cs.AI 77%

Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning

通过反事实强化学习学习视频大语言模型中的时空敏感性

Dazhao Du, Jian Liu, Jialong Qin, Tao Han, Bohai Gu, Fangqi Zhu, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯)

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出CRPO方法,通过反事实强化学习提升视频大语言模型对时空动态的敏感性,通过构建反事实视频并引入反事实关系奖励,有效抑制了依赖静态线索的简略策略,从而在DyBench基准测试中提升了模型的时空敏感性。

Comments Project website: https://ddz16.github.io/crpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21807 2026-05-22 cs.CL 77%

When Cases Get Rare: A Retrieval Benchmark for Off-Guideline Clinical Question Answering

当案例变得稀少时:一个用于偏离指南临床问答的检索基准

Doeun Lee, Muge Zhang, Yi Yu, Ashish Manne, Stephen Koesters, Frank Wen, Brady Buchanan, Lynda Villagomez, Oluwatoba Moninuola, James Lim, Kathryn Tobin, Andrew Srisuwananukorn, Ping Zhang, Sachin Kumar

机构 * The Ohio State University(俄亥俄州立大学) The Ohio State University Wexner Medical Center(俄亥俄州立大学韦克斯纳医学中心) University of Chicago Medical Center(芝加哥大学医学中心)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出OGCaReBench基准,用于评估医疗问答中超越常规指南的开放性推理能力,通过检索医学文献提升模型在真实世界医疗场景中的表现。

Comments 34 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22355 2026-05-22 cs.CL cs.AI cs.LG 75%

TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route Generation

TransitLM: 一个大规模数据集和基准,用于无地图的公共交通路线生成

Hanyu Guo, Jiedong Yang, Chao Chen, Longfei Xu, Kaikui Liu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) AMAP

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TransitLM,一个包含1300万条公共交通路线规划记录的数据集,用于无地图的公共交通路线生成,展示了通过数据训练模型生成有效路线的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22368 2026-05-22 cs.LG cs.AI cs.SE 73%

VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation

VeriScale:对抗性测试套件缩放用于可验证代码生成

Yifan Bai, Xiaoyang Liu, Zihao Mou, Guihong Wang, Jian Yu, Shuhan Xie, Yantao Li, Yangyu Zhang, Jingwei Liang, Tao Luo

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) School of Mathematics, Jilin University(吉林大学数学学院) School of Mathematical Sciences, Tongji University(同济大学数学科学学院) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Institute of Natural Sciences, Shanghai Jiao Tong University(上海交通大学自然科学研究院) MOE-LSC, CMA-Shanghai, Shanghai Jiao Tong University(上海交通大学MOE-LSC、CMA-上海)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VeriScale框架,通过对抗性实现扩展和缩减测试套件,提升代码生成的可验证性,实验表明VerinaPlus显著暴露了模型弱点,而VerinaLite在低成本下保持判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03674 2026-05-22 cs.CL cs.AI 73%

STRUCTSENSE: A Task-Agnostic Agentic Framework for Structured Information Extraction with Human-In-The-Loop Evaluation and Benchmarking

STRUCTSENSE:一种任务无关的代理框架,用于结构化信息提取,具有人机协同评估和基准测试

Tek Raj Chhetri, Yibei Chen, Puja Trivedi, Dorota Jarecka, Saif Haobsh, Patrick Ray, Lydia Ng, Satrajit S. Ghosh

机构 * McGovern Institute for Brain Research, Massachusetts Institute of Technology, Cambridge, MA, USA(麦戈文脑科学研究所,麻省理工学院,马萨诸塞州剑桥市) Fylo Labs Inc., New York, NY, USA(Fylo实验室公司,纽约州纽约市) Allen Institute for Brain Science, Seattle, WA, USA(艾伦脑科学研究所,华盛顿州西雅图市)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出STRUCTSENSE框架,通过整合本体引导的符号知识、代理自我评估细化和人机协同验证,实现了结构化信息提取的鲁棒性,并在三个领域展示了其跨任务泛化能力。

Comments -

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22096 2026-05-22 cs.CV 71%

VISTA: Validation-Guided Integration of Spatial and Temporal Foundation Models with Anatomical Decoding for Rare-Pathology VCE Event Detection -- after competition results

VISTA:基于解剖解码的时空基础模型验证引导集成用于罕见病理VCE事件检测——竞赛结果后

Bo-Cheng Qiu, Fang-Ying Lin, Ming-Han Sun, Yu-Fan Lin, Chia-Ming Lee, Chih-Chung Hsu

机构 * National Cheng Kung University, Taiwan(国立成功大学, 台湾) National Yang Ming Chiao Tung University, Taiwan(国立阳明交通大学, 台湾)

专题命中 评测与基准 :foundation model(title)

AI总结 本文提出VISTA框架,结合时空基础模型和解剖解码,通过验证引导的加权融合和时间事件解码,提升罕见病理VCE事件检测的性能,竞赛后进一步优化后取得第二名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19512 2026-05-22 eess.IV 71%

Defining Robust Ultrasound Quality Metrics via an Ultrasound Foundation Model

通过超声基础模型定义鲁棒的超声质量指标

Ziyang Huang, Bingyan Li, Chen Ma, Tianyi Liu, Yihui Zhai, Hong Xu, Yi Guo, Zeju Li, Yuanyuan Wang

专题命中 评测与基准 :foundation model(title)

AI总结 本文提出了一种基于超声基础模型的评估框架,通过引入两个新指标TinyUSFM-uLPIPS和TinyUSFM-NRQ,解决了现有标准在量化超声重建诊断效用方面的不足,并展示了其在任务关联质量、跨器官可比性、PSNR一致性敏感性和临床实用性方面的独特优势。

Comments MICCAI 2026 Early Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22570 2026-05-22 cs.CV cs.AI 70%

VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video Synthesis

VGenST-Bench: 一个通过主动视频合成进行时空推理的基准

Jinho Park, Youbin Kim, Hogun Park, Eunbyung Park

机构 * Department of Artificial Intelligence, Sungkyunkwan University(全北大学人工智能系) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VGenST-Bench,一个通过生成模型主动合成多样化评估场景的视频基准,旨在评估多模态大语言模型的时空推理能力,通过引入多代理流程和3x2x2视频分类体系,实现对细粒度时空理解的精准诊断。

Comments 82 pages, 91 figures (7 in main paper, 84 in appendix). Project page: https://zinosii.github.io/VGenST-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22258 2026-05-22 cs.CL 70%

Harder to Defend: Towards Chinese Toxicity Attacks via Implicit Enhancement and Obfuscation Rewriting

更难防御:通过隐含增强和模糊重写实现中文毒性攻击

Jingyi Kang, Junyu Lu, Bo Xu, Hongbo Wang, Linlin zong, Roy Ka-Wei Lee, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) The University of Tokyo(东京大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出了一种针对中文毒性攻击的框架CITA,通过隐含增强和模糊重写技术生成攻击样本,揭示了现有检测器在识别隐含毒性内容时的不足,并展示了通过训练防御模型提升鲁棒性的效果。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22203 2026-05-22 cs.CL 70%

Evaluation of Chunking Strategies for Effective Text Embedding in Low-Resource Language on Agricultural Documents

对低资源语言农业文档中有效文本嵌入的分块策略评估

Sovandara Chhoun, Pichdara Po, Sereiwathna Ros, Wan-Sup Cho, Saksonita Khoeurn

机构 * Department of Big Data, Chungbuk National University, Cheongju-si, South Korea(大数据系, Chungbuk国立大学,韩国Cheongju市) Department of Computer Science, Chungbuk National University, Cheongju-si, South Korea(计算机科学系, Chungbuk国立大学,韩国Cheongju市) BigDataLabs Co., Ltd. Department of Management Information Systems, Chungbuk National University, South Korea(BigDataLabs公司 管理信息系, Chungbuk国立大学,韩国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究比较了四种文本分块方法在Khmer农业文档中的性能,通过检索增强生成(RAG)框架评估分块策略对密集检索优化的影响,发现基于字符的递归分块方法在低资源语言中表现最佳。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11246 2026-05-22 cs.LG 70%

Support-Proximity Augmented Diffusion Estimation for Offline Black-Box Optimization

支持接近增强的扩散估计用于离线黑盒优化

Yonghan Yang, Ye Yuan, Zipeng Sun, Linfeng Du, Bowei He, Haolun Wu, Can Chen, Xue Liu

机构 * MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩擦 bin Zayed 大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(Mila - 加拿大AI研究所) Amazon AGI(亚马逊人工智能实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出SPADE框架,通过条件生成建模重新想象前向替代建模,利用扩散模型建模前向似然p(y|x),并引入校准扩散估计模块和支撑接近正则化机制,以提高优化性能。

Comments Accepted by ICML 2026. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04111 2026-05-22 cs.SE cs.AI cs.HC 70%

CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding

CentaurEval: 评估人机协同在编程中的价值

Hanjun Luo, Chiming Ni, Jiaheng Wen, Zhimu Huang, Yiran Wang, Bingduo Liao, Sylvia Chung, Yingbin Jin, Xinfeng Li, Wenyuan Xu, XiaoFeng Wang, Hanan Salam

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Beijing University of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CentaurEval基准测试,用于评估人机协同在编程中的价值。该基准测试通过协作必要问题模板,结合人类推理和AI效率,展示了人机协作在编程任务中的显著优势。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏