arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-29 至 2026-04-29 共收录 226 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 40 篇

2603.17729 2026-04-29 cs.CV cs.AI 57%

SARE: Sample-wise Adaptive Reasoning for Training-free Fine-grained Visual Recognition

SARE:基于样本的自适应推理用于无训练细粒度视觉识别

Jingxiao Yang, DaLin He, Miao Pan, Kaixiang Yao, Ge Su, Wenqi Zhang, Yifeng Hu, Tangwei Li, Yuke Li, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Netease Yidun AI Lab(网易云智AI实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 SARE提出一种样本自适应推理框架,通过结合快速候选检索与细粒度推理,利用历史失败经验提升无训练细粒度视觉识别的准确性和效率。

Comments preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00756 2026-04-29 cs.AI 57%

MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents

MPR-GUI:多语言感知与推理GUI代理的基准测试与增强

Ruihan Chen, Qiming Li, Xiaocheng Feng, Weihong Zhong, Xiaoliang Yang, Yuxuan Gu, Zekun Zhou, Yunfei Lu, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出MPR-GUI-Bench,通过六种语言和八个细粒度任务评估多语言GUI代理的感知与推理能力,并提出GUI-XLI方法以缩小跨语言差距。

Comments 35pages, 15figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 65 篇

2504.01919 2026-04-29 cs.CL cs.AI 93%

Bridging the Linguistic Divide: A Survey on Leveraging Large Language Models for Machine Translation

弥合语言鸿沟:大型语言模型在机器翻译中的应用综述

Baban Gain, Dibyanayan Bandyopadhyay, Asif Ekbal, Trilok Nath Singh

机构 * Department of Computer Science and Engineering(计算机科学与工程系) IIT Patna(印度理工学院帕纳布)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn)

AI总结 本文综述了大型语言模型在机器翻译中的应用,探讨了提示方法、参数高效微调、合成数据生成等技术,分析了低资源翻译中的挑战与对策,以及文档级和语篇级翻译方法的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11224 2026-04-29 cs.SE cs.CL 92%

Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation

Agent-Diff:通过代码执行基于状态差的评估来基准测试LLM代理在企业API任务上的表现

Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson

机构 * Minerva University(Minerva大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Agent-Diff框架,通过代码执行和基于状态差的评估,评估LLM代理在企业API任务中的性能,提供了九个LLM在224个任务上的基准测试,并通过消融实验评估框架的鲁棒性。

Comments Pre-Print. Under review for KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24477 2026-04-29 cs.CR cs.AI cs.MA 92%

GAMMAF: A Common Framework for Graph-Based Anomaly Monitoring Benchmarking in LLM Multi-Agent Systems

GAMMAF:用于LLM多智能体系统基于图的异常监控基准测试的通用框架

Pablo Mateo-Torrejón, Alfonso Sánchez-Macián

机构 * University Carlos III of Madrid(卡洛斯三世大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GAMMAF框架,用于评估LLM多智能体系统中的异常检测方法,通过生成合成数据集和动态隔离攻击节点,验证了其在拓扑扩展性和执行效率上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27106 2026-04-29 cs.CL 92%

Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks

评分轮盘:LLM作为裁判框架中的自不一致

Rajarshi Haldar, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究揭示LLM作为裁判框架在不同运行中评分不一致的问题,探讨通过规范指南提升其评估效果的可行性。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05432 2026-04-29 cs.AI 91%

AInstein: Can LLMs Solve Research Problems From Parametric Memory Alone?

AInstein:LLM能否仅凭参数记忆解决研究问题?

Shambhavi Mishra, Gaurav Sahu, Marco Pedersoli, Laurent Charlin, Jose Dolz, Christopher Pal

机构 * LIVIA, ÉTS Montréal(LIVIA,蒙特利尔工程学院) Mila – Quebec AI Institute(魁北克人工智能研究所) HEC Montréal(蒙特利尔HEC学院) ServiceNow Research(ServiceNow研究) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院) International Laboratory on Learning Systems (ILLS)(学习系统国际实验室)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出AInstein框架,测试LLM能否通过迭代批评循环生成和改进解决方案。研究发现LLM在70%的问题上成功,但重新发现已发表方案的比例低于19%,表明真正的解决问题能力。但LLM在跨领域类比迁移时存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25318 2026-04-29 cs.GR cs.AI cs.CL 90%

Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation

Cutscene Agent:一种用于自动化3D场景生成的LLM代理框架

Lanshan He, Haozhou Pang, Qi Gan, Xin Shen, Ziwei Zhang, Yibo Liu, Gang Fang, Bo Liu, Kai Sheng, Shengfeng Zeng, Chaofan Li, Zhen Hui, Keer Zhou, Lan Zhou, Shujun Dai

机构 * Kuaishou GameMind Lab(快手游戏大脑实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出Cutscene Agent框架,通过双向集成LLM代理与游戏引擎,实现多代理协作生成可编辑的电影化3D内容,并构建了针对长周期多步骤协作的评估基准。

Comments 27 pages excluding appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24955 2026-04-29 cs.CL cs.AI cs.SE 90%

BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

BenchGuard:谁守护着基准?对LLM代理基准的自动化审计

Xinming Tu, Tianze Wang, Yingzhou, Lu, Kexin Huang, Yuanhao Qu, Sara Mostafavi

机构 * Allen School, University of Washington(华盛顿大学阿伦学院) Phylo, Inc.(Phylo公司) Genentech, Inc.(基因泰克公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 BenchGuard通过结构化LLM协议交叉验证所有基准制品,发现ScienceAgentBench中的12个问题,并在BIXBench Verified-50子集中准确识别83.3%的问题,证明自动化基准审计的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25650 2026-04-29 cs.SE cs.SY eess.SY 90%

Using Large Language Models for Black-Box Testing of FMU-Based Simulations

利用大型语言模型对基于FMU的仿真进行黑盒测试

Abdullah Mughees, Gaadha Sudheerbabu, Tanwir Ahmad, Dragos Truscan, Mikael Manngård, Kristian Klemets

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出利用大型语言模型生成动态仿真模型的测试场景,通过结构化目标减少手动工作量并提高结果可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02537 2026-04-29 cs.DB 90%

Large Language Model-Enhanced Relational Operators: Taxonomy, Benchmark, and Analysis

大语言模型增强的关系运算符:分类、基准测试与分析

Yunxiang Su, Tianjing Zeng, Zhongjun Ding, Yin Lin, Rong Zhu, Zhewei Wei, Bolin Ding, Jingren Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出统一的关系运算符分类,设计全面的基准测试,并评估不同实现下的运算符性能,以指导复杂语义查询系统的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25862 2026-04-29 cs.SE cs.AI 90%

RESTestBench: A Benchmark for Evaluating the Effectiveness of LLM-Generated REST API Test Cases from NL Requirements

RESTestBench:一个评估LLM生成REST API测试用例有效性的基准

Leon Kogler, Stefan Hangler, Maximilian Ehrhart, Benedikt Dornauer, Roland Wuersching, Peter Schrammel

机构 * CASABLANCA hotelsoftware GmbH(CASABLANCA酒店软件公司) University of Innsbruck(因斯布鲁克大学) Technical University of Munich(慕尼黑技术大学) Diffblue Ltd(Diffblue有限公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 RESTestBench通过精确和模糊的自然语言需求评估LLM生成的REST测试用例有效性,引入基于需求的变异测试指标,评估两种生成方法在不同LLM中的表现。

Comments Accepted for EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25580 2026-04-29 cs.CL 90%

Bye Bye Perspective API: Lessons for Measurement Infrastructure in NLP, CSS and LLM Evaluation

再见视角API:NLP、CSS和LLM评估中的测量基础设施教训

David Hartmann, Manuel Tonneau, Angelie Kraft, LK Seiling, Dimitri Staufer, Pieter Delobelle, Jan Fillies, Anna Ricarda Luther, Jan Batzner, Mareike Lisker

机构 * Weizenbaum Institute(韦izenbaum研究所) TU Berlin(柏林技术大学) University of Oxford(牛津大学) KU Leuven(根特大学) Pleias(Pleias公司) Freie Universität Berlin(柏林自由大学) University of Bremen(不莱梅大学) ifib research(ifib研究) TU Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) HTW Berlin(柏林应用技术大学) University of Hamburg(汉堡大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 视角API的关闭使NLP、CSS和LLM评估领域失去自动化毒性测量的基准,本文探讨其依赖问题及对研究的影响,呼吁建立独立、可验证的测量基础设施。

Comments 13 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25224 2026-04-29 cs.AI q-fin.CP 90%

ValueAlpha: Agreement-Gated Stress Testing of LLM-Judged Investment Rationales Before Returns Are Observable

ValueAlpha:基于LLM投资理据的同意门压力测试

Sidi Chang, Peiying Zhu, Yuxiao Chen

机构 * Blossom AI Labs(Blossom AI实验室) Blossom AI

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出ValueAlpha协议,通过控制市场状态资本分配原型,评估LLM投资理据的可发表性与有效性,发现低秩系统和单判官排名的依赖性及术语惩罚问题。

Comments 9 pages, Submitted to IEEE Computational Intelligence in Financial Engineering and Economics (CIFEr) 2026, Tokyo, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18473 2026-04-29 cs.CL cs.AI cs.LG 89%

Principled Detection of Hallucinations in Large Language Models via Multiple Testing

通过多重检验原则检测大语言模型中的幻觉

Jiawei Li, Akshayaa Magesh, Venugopal V. Veeravalli

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过多重检验方法系统整合多个评估分数,实现受控的幻觉检测,验证了方法在不同模型和数据集上的鲁棒性。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25149 2026-04-29 cs.AI 89%

Semantic Layers for Reliable LLM-Powered Data Analytics: A Paired Benchmark of Accuracy and Hallucination Across Three Frontier Models

语义层用于可靠的LLM驱动数据分析:在三个前沿模型上准确性和幻觉的配对基准测试

Michael Rumiantsau, Ivan Fokeev

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过在三个前沿LLM上测试语义层对自然语言查询准确性的影响,发现添加语义描述可显著提升性能,且模型选择对结果影响较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25359 2026-04-29 cs.CL cs.AI 88%

The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models

结构化输出基准:一个多源基准,用于评估大型语言模型中的结构化输出质量

Abhinav Kumar Singh, Harsha Vardhan Khurdula, Yoeven D Khemlani, Vineet Agarwal

机构 * JigsawStack, Inc.(JigsawStack公司) New Delhi, India(印度新德里) San Francisco, CA, USA(美国旧金山) Durgapur, WB, India(印度德里邦杜格apur)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SOB基准,用于评估大型语言模型在多源数据中的结构化输出质量,通过文本、图像和音频三种模态的测试数据,发现模型在结构合规性上表现良好,但价值准确性在不同数据源中差异显著。

Comments 19 pages, 4 figures, 11 tables, submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25456 2026-04-29 cs.CL cs.AI 88%

An Investigation of Linguistic Biases in LLM-Based Recommendations

对基于大语言模型的推荐中语言偏见的调查

Nitin Venkateswaran, Jason Ang, Deep Adhikari, Tarun Krishna Dasari

机构 * University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 研究通过不同方言提示分析LLM在餐厅和产品推荐中的偏见,发现印度英语和混合英语提示对推荐结果有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25083 2026-04-29 cs.AI cs.AR 86%

Agentic Architect: An Agentic AI Framework for Architecture Design Exploration and Optimization

代理架构:一种用于建筑设计探索和优化的代理AI框架

Alexander Blasberg, Vasilis Kypriotis, Dimitrios Skarlatos

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Agentic Architect框架,结合LLM驱动的代码进化与精确模拟,实现计算机架构设计的探索与优化,展示了在缓存替换、数据预取和分支预测等领域的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24977 2026-04-29 cs.CL cs.HC 85%

A Survey on LLM-based Conversational User Simulation

基于大语言模型的对话用户模拟综述

Bo Ni, Leyao Wang, Yu Wang, Branislav Kveton, Franck Dernoncourt, Yu Xia, Hongjie Chen, Reuben Leura, Samyadeep Basu, Subhojyoti Mukherjee, Puneet Mathur, Nesreen Ahmed, Junda Wu, Li Li, Huixin Zhang, Ruiyi Zhang, Tong Yu, Sungchul Kim, Jiuxiang Gu, Zhengzhong Tu, Alexa Siu, Zichao Wang, David Seunghyun Yoon, Nedim Lipka, Namyong Park, Zihao Lin, Trung Bui, Yue Zhao, Tyler Derr, Ryan A. Rossi

机构 * Vanderbilt University(范德比大学) Adobe Research(Adobe研究) Yale University(耶鲁大学) University of Oregon(俄勒冈大学) University of California San Diego(加州大学圣地亚哥分校) Dolby Laboratories(Dolby实验室) University of California, Berkeley(加州大学伯克利分校) Cisco AI Research(思科人工智能研究) University of Southern California(南加州大学) Texas A&M University(德克萨斯阿姆斯特朗大学) UC Davis(加州大学戴维斯分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了基于大语言模型的对话用户模拟最新进展,提出新的分类体系,分析核心技术和评估方法,旨在推动未来研究。

Comments Submitted in August 2025. MOD-81000 approved survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25716 2026-04-29 cs.CL cs.AI 85%

Cross-Lingual Jailbreak Detection via Semantic Codebooks

通过语义代码本进行跨语言 jailbreak 检测

Shirin Alanova, Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

机构 * AI Talent Hub, ITMO University(AI人才中心、ITMO大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究通过语言无关的语义相似性检测跨语言 jailbreak 攻击,评估了四种语言、两种翻译流程、三种嵌入模型和三种目标 LLM 的效果,发现语义相似性在标准基准上表现良好,但在分布偏移情况下性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09723 2026-04-29 cs.CL cs.AI 85%

RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation

RbtAct: 用于生成可操作性评审反馈的反驳作为监督

Sihong Wu, Yiling Ma, Yilun Zhao, Tiansheng Hu, Owen Jiang, Manasi Patwardhan, Arman Cohan

机构 * Yale University(耶鲁大学) New York University(纽约大学) TCS Research(TCS研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出RbtAct,通过利用反驳作为隐式监督,优化反馈生成器以提高可操作性。引入了视角条件段级评审反馈生成任务,并构建了RMR-75K数据集,实验表明在可操作性和具体性上优于基线模型。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25654 2026-04-29 cs.CL 84%

Progressing beyond Art Masterpieces or Touristic Clichés: how to assess your LLMs for cultural alignment?

超越艺术杰作或旅游陈词滥调:如何评估您的LLM文化对齐性?

António Branco, João Silva, Nuno Marques, Luis Gomes, Ricardo Campos, Raquel Sequeira, Sara Nerea, Rodrigo Silva, Miguel Marques, Rodrigo Duarte, Artur Putyato, Diogo Folques, Tiago Valente

机构 * University of Lisbon(里斯本大学) University of Beira Interior(贝拉内尔大学)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出文化评估数据集的设计指南,并通过对比实验展示其在区分文化专精模型与非专精模型方面的有效性。

Comments RESOURCEFUL-2026 Workshop at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25472 2026-04-29 cs.AI 84%

SciEval: A Benchmark for Automatic Evaluation of K-12 Science Instructional Materials

SciEval:用于自动评估K-12科学教学材料的基准

Zhaohui Li, Peng He, Zhiyuan Chen, Honglu Liu, Zeyuan Wang, Tingting Li, Jinjun Xiong

机构 * Department of Computer Science and Engineering, University at Buffalo, USA(宾夕法尼亚大学布法罗分校计算机科学与工程系) Department of Teaching and Learning, Washington State University, USA(华盛顿州立大学教学与学习系) College of Chemistry, Beijing Normal University, China(北京师范大学化学学院) College of AI, Cyber and Computing, University of Texas at San Antonio, USA(德克萨斯大学圣安东尼奥分校人工智能、网络与计算学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SciEval基准,用于评估K-12科学教学材料的自动评估方法,通过专家标注和领域微调提升LLM在教育材料评估中的性能。

Journal ref AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25634 2026-04-29 cs.CR cs.CL 83%

The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive

大语言模型输出的令人惊讶的普遍性:一种实时验证原语

Alex Bogdan, Adrian de Valois-Franklin

机构 * Evolutionairy AI

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究发现大语言模型输出的词频分布符合Mandelbrot分布,提出一种无需GPU的快速验证方法,用于模型指纹识别和黑盒输出评估。

Comments 25 pages, 6 figures, 6 tables, 37 references. Code and data: https://github.com/Evolutionairy-AI/Ranking-Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06723 2026-04-29 eess.IV cs.CV cs.LG 83%

Evaluating Computational Pathology Foundation Models for Prostate Cancer Grading under Distribution Shifts

评估计算病理学基础模型在前列腺癌分级下的分布偏移鲁棒性

Fredrik K. Gustafsson, Mattias Rantalainen

机构 * Department of Medical Epidemiology and Biostatistics, Karolinska Institutet(卡罗林斯卡研究所医学流行病学与生物统计学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文评估了计算病理学基础模型在前列腺癌分级中的鲁棒性,发现跨机构转移时性能显著下降,表明大规模预训练不足以保证下游泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13302 2026-04-29 cs.CL 83%

Images Amplify Misinformation Sharing in Vision-Language Models

图像在视觉-语言模型中放大虚假信息的传播

Alice Plebe, Timothy Douglas, Diana Riazi, R. Maria del Rio-Chanona

机构 * Department of Industrial Engineering, University of Trento(特伦托大学工业工程系) Computer Science Department, University College London(伦敦大学学院计算机科学系)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究探讨了图像如何影响视觉-语言模型分享新闻内容的倾向,发现图像能提高虚假新闻的分享率,且不同模型对图像的反应存在差异。

Comments Accepted for oral presentation at ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25200 2026-04-29 cs.CR cs.AI cs.CY cs.LG 82%

Making AI-Assisted Grant Evaluation Auditable without Exposing the Model

在不暴露模型的情况下使AI辅助的资助评估可审计

Kemal Bicakci

机构 * Informatics Institute, Istanbul Technical University, Istanbul, Türkiye(伊斯坦布尔技术大学信息学院,伊斯坦布尔,土耳其) Securify Information Technology and Security Training Consulting Inc., Ankara, Türkiye(Securify信息科技与安全培训咨询公司,安卡拉,土耳其)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于TEE的架构,通过远程证明技术实现资助评估过程的可审计性,同时防止申请人优化对抗模型和评分标准。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05425 2026-04-29 cs.CV cs.AI 81%

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

SIV-Bench:一种用于社会互动理解和推理的视频基准测试

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SIV-Bench,一个用于评估多模态大语言模型在社会场景理解、社会状态推理和社会动态预测能力的视频基准测试,揭示了现有模型在社会推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25159 2026-04-29 cs.LG 79%

Accurate and Robust Generative Approach for Overcoming Data Sparsity and Imbalance in Landslide Modeling with A Tabular Foundation Model

精确且稳健的生成方法用于克服滑坡建模中的数据稀疏性和不平衡问题:基于表格基础模型

Kaixuan Shao, Gang Mei, Yinghan Wu, Nengxiong Xu, Jianbing Peng

机构 * School of Engineering and Technology, China University of Geosciences (Beijing)(工程与技术学院,中国地质大学(北京)) School of Geological Engineering and Geomatics, Chang'an University(地质工程与测绘学院,长安大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出基于表格基础模型的生成方法,解决滑坡数据稀疏和不平衡问题,通过生成多特征数据集提升滑坡 susceptibility 模型和风险评估的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏