arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-20 至 2026-08-20 共收录 298 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 76 篇

2606.17809 2026-08-20 cs.CV 版本更新 78%

Million-scale multimodal pollen microscopy with expert-guided foundation models

百万级多模态花粉显微镜图像与专家引导的基础模型

András Biricz, Björn Gedda, Donát Magyar, Antonio Spanu, János Fillinger, Péter Pollner, István Csabai

机构 * Department of Physics of Complex Systems, ELTE Eötvös Loránd University(ELTE罗兰大学复杂物理系) The Palynological Laboratory at the Swedish Museum of Natural History(瑞典自然历史博物馆孢粉学实验室) National Centre for Public Health and Pharmacy(国家公共卫生与药品中心) INRAE, UR 546 BioSP, Site Agroparc(法国国家农业、食品与环境研究院,UR 546 BioSP,阿格罗帕克园区) National Korányi Institute for Pulmonology(国家科拉尼肺病研究所) Health Data Science and AI Knowledge Centre, Health Services Management Training Centre, Faculty of Health and Public Administration, Semmelweis University(塞梅维什大学健康与公共管理学院卫生服务管理培训中心健康数据科学与人工智能知识中心) Department of Biological Physics, ELTE Eötvös Loránd University(ELTE罗兰大学生物物理系)

专题命中 评测与基准 :foundation model(title);language model(abstract)

AI总结 提出百万级多模态花粉显微镜数据集Pollen AI Atlas,结合专家引导的视觉-语言模型生成形态描述,实现跨区域、跨设置的高精度花粉识别与检索。

Comments 31 pages, 5 main figures, supplementary information included. Submitted to Scientific Reports. v2: clarified reporting of taxonomic scope, captioning settings, backbone configuration, and evaluation details; no changes to numerical results or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19011 2026-08-20 cs.CR cs.AI 新提交 77%

From Threat Intelligence to Detection: Knowledge-driven Enrichment and Template-based Rule Grounding for Automated Sigma Rule Generation

从威胁情报到检测:知识驱动的丰富化与基于模板的规则落地用于自动化Sigma规则生成

Sepehr Ghaffarzadegan, Boubakr Nour, Makan Pourzandi, Mourad Debbabi, Chadi Assi

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本研究设计了AUTOSIGMA,结合知识驱动丰富化等技术,将非结构化CTI报告自动生成Sigma规则,其在多项指标上优于其他方案。

Comments Submitted for publication and currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18296 2026-08-20 cs.CY cs.AI 新提交 77%

FairGlucose: A CGM Fairness Benchmark Reveals Subgroup Disparities Hidden in Population-Level Validation

FairGlucose:揭示人群水平验证中隐藏亚组差异的CGM公平性基准

Junjie Luo, Xuzhe Zhi, Rui Han, Abhimanyu Kumbara, Anand K. Iyer, Mansur E. Shomali, Ritu Agarwal, Guodong Gordon Gao

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 研究构建FairGlucose基准,发现CGM预测模型人群水平验证掩盖亚组差异,T1D患者误差更高,前沿LLM表现逊于专业神经模型,推动数字健康AI采用亚组分层公平评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06167 2026-08-20 cs.CL cs.HC 77%

Pragmatics beyond humans: meaning, communication, and LLMs

Vít Gvoždiak

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18744 2026-08-20 cs.AI cs.CL cs.SE 新提交 73%

Metrics That Write Themselves: Evolving an Evaluator from Its Own Blind Spots

自动生成的评估指标:从自身盲点进化评估器

Xing Zhang, Yanwei Cui, Guanghui Wang, Zhihao Lin, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出EvalCEGAR方法,借鉴程序验证的反例引导抽象精化进化自动评估指标,在MBPP+等基准上缩小评分差距,效果优于人工算子且无需模型调用费用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18164 2026-08-20 cs.CL cs.AI cs.CR 新提交 73%

Are LLMs Safe Beyond Text: Do Emojis Expose Gaps in Safety Evaluation

M P V S Gopinadh

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 3 pages. Accepted at ACL 2026 Workshop on Evaluation in Practice: Methodological Rigor, Sociotechnical Perspectives, & Community Collaboration (EvalEval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18131 2026-08-20 cs.AI cs.CL cs.CY 新提交 73%

Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs

安全对齐错觉:大语言模型中的跨语言安全差距

Namya Bhatnagar

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对 LLMs 安全对齐以英语为中心导致的跨语言偏见问题,提出多语言评估基准 INCLUDE,评估十款 LLMs 后发现孟加拉语在开源模型中偏见最高、英语在开源与闭源模型中偏见表现反转的现象。

Comments 7 pages, 8 figures, submitted to IEEE SLT (Spoken Language Technology) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18102 2026-08-20 cs.CL cs.LG stat.ML 新提交 73%

Stability-Aware Feature Design for Robust Watermark Detection in Machine-Generated Text

面向机器生成文本鲁棒水印检测的感知稳定性特征设计

Sina Mansouri, Mohit Marvania, Abolfazl Safikhani

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对机器生成文本水印检测在多次释义及短文本场景下性能骤降的问题,提出PSS检测框架,结合多类特征与稳定性得分,在多基准数据集和多模型测试中显著提升检测AUC,且通用分类器跨域泛化性强。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea. 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16645 2026-08-20 cs.AI cs.CL cs.MA 版本更新 73%

Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies

重构:从预发表参考文献中恢复研究思路的盲基准

Shaolong Chen, Yanlin Fei, Nazhou Liu, Xinmiao Yu, Lei Li, Rahul Thapa, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * Stanford University(斯坦福大学) Titan Holdings(泰坦控股公司) Prentis AI(普伦蒂斯人工智能公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Reconstruction盲基准,测试语言模型从预发表参考文献恢复论文思路的能力,发现多智能体流水线可将匹配率提升约2.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19002 2026-08-20 cs.AI 新提交 70%

A Theory of Post-hoc Debate Judgement

事后辩论评判理论

Xiang Yin, Adam Dejl, Antonio Rago, Lihu Chen, Francesca Toni

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出适用于智能体辩论场景的事后辩论评判理论,探究两种评判方法的属性满足情况,发现辩论语义是辩论驱动型AI原则性评判者的理想候选。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18752 2026-08-20 cs.IR cs.CL 新提交 70%

GreekBarRetrieval: A Benchmark for Greek Statutory Retrieval

GreekBarRetrieval:希腊成文法检索基准

Ernest Beta, Odysseas S. Chlapanis, Dimitrios Galanis, Ion Androutsopoulos

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究推出希腊成文法检索基准GreekBarRetrieval,通过实验发现基于大型语言模型的查询重表述可提升BM25检索效果,使其在多项指标上优于其他检索方法。

Comments Submitted to NLLP workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18740 2026-08-20 cs.AI 新提交 70%

A Multi-Agent Platform for Automated Enterprise Analytics and Insight Generation

用于自动化企业分析与洞察生成的多智能体平台

Manoj N M, Vijayakrishna S, Manjunath Srinivas, Rohit Pahan

机构 * Rakuten India Enterprise Private Limited(乐天印度企业私人有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出基于CrewAI的多智能体框架,含五个专业智能体,经300个测试用例验证,功能准确率95.3%,较单智能体基线提升显著,可用于自动化企业分析与洞察生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18726 2026-08-20 cs.CL 新提交 70%

Execution-grounded evaluation reveals hidden failures in language-model calculations for environmental science

基于执行的评估揭示语言模型在环境科学计算中的隐藏失败

Maohao Ran, Chendong Ma, Yanting Zhang, Dailing Jiang, Yusen Huang, Meng Gao, Jun Song

机构 * Department of Geography, Hong Kong(香港地理系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究构建了环境科学计算基准AtmosCoder-Bench,发现现有评估未观测计算过程,多项选择格式会虚高准确率,模型多因未一致应用公式失败,前沿模型仍需专家监督。

Comments 29 pages, 4 figures, 2 tables, plus supplementary materials. Maohao Ran and Chendong Ma contributed equally. Corresponding author: Jun Song (junsong@hkbu.edu.hk). Code: https://github.com/acodercat/AtmosCoder-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18719 2026-08-20 cs.AI 新提交 70%

Competence, Not Accuracy: A Diagnostic for Reference-Free Judge Gates in Skill Optimization

能力而非准确率:技能优化中无参考评判门的诊断方法

Chenle Chen, Yangbo Wei, Chao Yao, Shaoqiang Lu, Junhong Qian, Chen Wu, Lei He

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Arizona State University(亚利桑那州立大学) Eastern Institute of Technology(东方理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出技能优化中无参考评判门的预部署诊断方法,发现评判器能力需超1/k才具可用性,其基准准确率高估关键能力,可预测门控错误。

Comments 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18586 2026-08-20 cs.CV cs.AI 新提交 70%

OmniHandwritingOCR: A Diagnostic Benchmark for Evaluating Multimodal LLMs in Handwritten OCR Scenarios

OmniHandwritingOCR:用于评估多模态大语言模型在手写OCR场景中表现的诊断基准

Zinuo Guo, Min Zhang, Bo Jiang

机构 * East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究推出OmniHandwritingOCR手写OCR诊断基准,评估13个多模态模型,发现其在复杂公式上表现差且存在幻觉,为诊断模型失效模式提供测试平台。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18579 2026-08-20 cs.CV cs.AI 新提交 70%

MR-IQA-2: Faithful Image Quality Reflection via Fine-Grained Credit Assignment

MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映

Yuan li, Youyuan Lin, Chenhui Chu, Shin'ya Nishida

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对现有盲图像质量评估(IQA)中推理真实性不足的问题,提出MR-IQA-2框架,通过解耦推理与评分的细粒度信用分配,在IQA基准上实现了与人类评分的竞争性对齐,还能提供更丰富的视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30497 2026-08-20 cs.CL 版本更新 70%

CanLegalRAGBench: Evaluating Retrieval-Augmented Generation on Canadian Case Law

CanLegalRAGBench:评估加拿大判例法上的检索增强生成

Ethan Zhao, Maksym Taranukhin, Wei Cui, Moira Aikenhead, Vered Shwartz

机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Vector Institute(向量研究所) CIFAR AI Chair Peter A. Allard School of Law, University of British Columbia(不列颠哥伦比亚大学彼得·A·艾尔德法学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对法律RAG系统中幻觉问题及加拿大法律评估不足,提出基于真实查询和专家标注的加拿大法律QA基准CanLegalRAGBench,发现检索性能受设计选择影响、开源嵌入模型与闭源模型竞争力相当,但自动评估存在局限且生成答案常偏离黄金标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13068 2026-08-20 cs.CV cs.LG 版本更新 70%

Eyes on the Image: Gaze Supervised Multimodal Learning for Chest X-ray Diagnosis and Report Generation

聚焦图像:用于胸部X光诊断与报告生成的注视监督多模态学习

Tanjim Islam Riju, Shuchismita Anwar, Saman Sarker Joy, Farig Sadeque, Swakkhar Shatabda

机构 * Department of Computer Science and Engineering, Brac University(计算机科学与工程系,布拉克大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究基于MIMIC-Eye数据集构建两阶段多模态框架,引入注视监督提升胸部X光诊断准确率与报告空间可解释性,为该领域提供了可复现的新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18227 2026-08-20 cs.RO 新提交 67%

Revisiting the "Push-T" Robot Manipulation Task with Agentic Robotics

用智能体机器人技术重新审视“Push-T”机器人操作任务

Shuangyu Xie, Kaiyuan Chen, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究在智能体机器人技术背景下,借助带Fable 5的Claude Code编码智能体,无需演示数据解决Push-T等机器人操作任务,其策略成功率达100%,步骤比基准扩散策略少46%,还支持多字母操作及跨实体机械臂仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19116 2026-08-20 cond-mat.mtrl-sci 新提交 67%

JANUS: A Multi-modal Foundation Neural Sampler for Disordered Materials

JANUS:面向无序材料的多模态基础神经采样器

Denis Blessing, Mouyang Cheng, Maximilian Schebek, Jutta Rogal, Mingda Li, Carles Domingo-Enrich, Yuanqi Du

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究人员开发JANUS多模态神经采样器,用于无序材料的热力学采样,其以远少于传统方法的能量评估次数重现平衡性质,可用于合金逆设计及半导体缺陷探索,为相关研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19192 2026-08-20 astro-ph.SR 新提交 67%

JW-SSD: A Multimodal Benchmark Dataset for Fine-Grained Sunspot Classification

JW-SSD:用于细粒度太阳黑子分类的多模态基准数据集

Hui Wang, Mingfu Shao, Luyang Li, Jiaben Lin, Liyue Tong, Chen Yang, Zhanji Wei

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究提出用于太阳黑子细粒度磁型分类的多模态基准数据集JW-SSD,经质量控制后含36553对图像,可用于训练多种模型,包括取得高准确率的JW-SunSpot。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16603 2026-08-20 cs.CY 版本更新 67%

Characterizing Agentic Flooding of Government Services

刻画政府服务的智能体泛滥问题

Chris Schmitz, Lewis Hammond, Alan Chan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究定义了政府服务的智能体泛滥问题,基于84起案例数据集分析其广泛存在性,开发风险矩阵评估高风险服务,梳理政府应对措施并推荐兼顾公平的缓解方案。

Comments To appear in the proceedings of the 9th AAAI Conference on AI, Ethics, and Society (AIES), October 12-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04160 2026-08-20 eess.AS cs.SD eess.SP 67%

AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis

AffectSpeech: 一个带有精细文本描述的大型情感语音数据集,用于语音情感描述和合成

Tianhua Qi, Wenming Zheng, Björn W. Schuller, Zhaojie Luo, Haizhou Li

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) Key Laboratory of Child Development and Learning Science (Southeast University), Ministry of Education(教育部儿童发展与学习科学重点实验室(东南大学)) Chair of Health Informatics (CHI), Technical University of Munich(慕尼黑工业大学健康信息学教席) Group on Language, Audio, & Music (GLAM), Imperial College London(帝国理工学院语言、音频与音乐组) Shenzhen Loop Area Institute(深圳河套学院) Shenzhen Research Institute of Big Data, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(深圳市大数据研究院,香港中文大学(深圳)人工智能学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出AffectSpeech数据集,通过精细文本描述提升语音情感建模的表达能力,采用人机协作标注方法,实验表明其在情感描述和合成任务中表现优异。

Comments Submitted to IEEE Transactions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19140 2026-08-20 cs.AI cs.CY cs.LG cs.SE 新提交 62%

Grouping the Stochastic Machine: Precision, Not Capability, as the Frontier Metric for AI Systems

分组随机机:将精度而非能力作为AI系统的前沿度量标准

George Andrikopoulos

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将精度而非能力作为AI系统的前沿度量,指出当前基准测试未测量精度,定义了分组度量方法,其测量结果可指导决策,且该方法需通过实际工作测量验证规范价值。

Comments 6 pages, 3 figures. Companion to "Tuning the Stochastic Machine", submitted concurrently

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18096 2026-08-20 cs.CL cs.LG 新提交 62%

MAVEN: A Macro-Societal Value Evaluation Framework of Multimodal Content with Compact Aligned Evaluators

MAVEN:基于紧凑对齐评估器的多模态内容宏观社会价值评估框架

Zijuan Zhao, Zheren Fu, Hou Xia, Licheng Zhang, Yi Liu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 针对多模态内容宏观社会价值评估难题,提出MAVEN分层框架,构建相关基准与指标,优化评估器,实验表明其2B评估器表现接近前沿闭源VLMs,提供了可扩展评估路径。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04546 2026-08-20 cs.RO cs.AI cs.CV cs.LG 版本更新 62%

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。

Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06422 2026-08-20 cs.CL cs.AI cs.CV 版本更新 62%

When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't

何时称苹果为红色:人类遵循内省规则,而视觉语言模型却不遵循

Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

机构 * University of Tübingen(蒂宾根大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了视觉语言模型(VLMs)在何时会表现出意外行为,以及模型是否能可靠预测自身行为,发现VLMs系统性违反内省规则,而人类则遵循规则。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18736 2026-08-20 cs.LG cs.CR cs.DC 新提交 57%

FedLNS: Leverage LayerNorm Signature Modeling to Mitigate Adversarial Manipulation in Federated LLMs

FedLNS:利用层归一化签名建模缓解联邦大语言模型中的对抗性操纵

Kai Li, Jong-Ik Park, Carlee Joe-Wong, Wei Ni, Falko Dressler

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性与跨学科研究中心(SnT)) Carnegie Mellon University(卡内基梅隆大学) Edith Cowan University(埃迪斯科文大学) TU Berlin(柏林工业大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 FedLNS是一种服务器端联邦学习框架,通过层归一化签名筛选恶意更新,在200个客户端、40%目标操纵下,对三类模型均实现优于基线的测试困惑度。

Comments 13 pages (main body), 36 pages (appendix), 3 figures, 98 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18336 2026-08-20 cs.AI cs.CY 新提交 57%

Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme

测量部分学分差距:越南2025年凸评分制的严格基准

Nguyen Quoc Hung, Nguyen Dang Minh, Le Nhu Quynh, Tran Khanh Linh, Nguyen Kieu Linh

机构 * Posts and Telecommunications Institute of Technology(越南邮电技术学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对越南2025年凸评分制,构建THPT-Ladder基准,发现标准准确率指标会夸大模型在该评分制下的表现,不同错误分布会导致模型得分差异显著,影响模型能力评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15265 2026-08-20 cs.AI 版本更新 57%

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

VibeWorlding:多模态智能体能否端到端构建3D开放世界?

Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯) AI Thrust TEG AIPD

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 该研究提出VibeWorlding框架,构建VWE-BENCH基准与VibeWorlding-Gym框架,发现当前前沿MLLMs在3D开放世界构建任务中表现不佳,经RL训练的VibeWorlder模型可提升性能,旗舰模型VibeWorlder-30B-A3B表现最优。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏