arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 803 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 186 篇

2604.17570 2026-04-21 cs.CV cs.AI 77%

PBSBench: A Multi-Level Vision-Language Framework and Benchmark for Hematopathology Whole Slide Image Interpretation

PBSBench:一种多级视觉-语言框架和血液病理学全滑片图像解释基准

Yuanlong Wang, Weichi Chen, Adrian Rajab, Wenfang Liu, Yulan Jin, Andrew Srisuwananukorn, Ping Zhang

机构 * The Ohio State University(俄亥俄州立大学) The Ohio State University Wexner Medical Center(俄亥俄州立大学韦克斯纳医学中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 本文提出PBSBench,一种针对血液病理学全滑片图像解释的多级视觉-语言框架和基准,通过构建PBSInstr数据集和PBS-VL模型,提升了对血涂片图像的理解能力。

Comments 19 pages, 12 figures, Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01066 2026-04-21 cs.CL 77%

HPLT 3.0: Very Large-Scale Multilingual Resources for LLMs and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models

HPLT 3.0:非常大规模的多语言资源用于大语言模型和机器翻译。单语和双语数据、多语言评估以及预训练模型

Stephan Oepen, Nikolay Arefev, Mikko Aulamo, Marta Bañón, Maja Buljan, Laurie Burchell, Lucas Charpentier, Pinzhen Chen, Mariya Fedorova, Ona de Gibert, Barry Haddow, Jan Hajič, Jindřich Helcl, Andrey Kutuzov, Veronika Laippala, Zihao Li, Risto Luukkonen, Bhavitvya Malik, Vladislav Mikhailov, Amanda Myntti, Dayyán O'Brien, Lucie Poláková, Sampo Pyysalo, Gema Ramírez Sánchez, Janine Siewert, Pavel Stepachev, Jörg Tiedemann, Teemu Vahtola, Dušan Variš, Fedor Vitiugin, Tea Vojtěchová, Jaume Zaragoza

机构 * University of Oslo, Department of Informatics(奥斯陆大学信息学院) University of Helsinki, Department of Digital Humanities(赫尔辛基大学数字人文学院) Prompsit Language Engineering(Prompsit语言工程) The Common Crawl Foundation(Common Crawl基金会) Edinburgh University, School of Informatics(爱丁堡大学信息学院) Charles University, Prague, Institute of Formal and Applied Linguistics(布拉格查理大学形式与应用语言学研究所) TurkuNLP, University of Turku, Department of Computing(图尔库大学TurkuNLP,计算机系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 HPLT 3.0 提供了覆盖近200种语言的高质量大规模文本数据集,包含多语言评估基准和预训练模型,通过数据质量分析和模型评估验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16950 2026-04-21 cs.AI 77%

AutoPKG: An Automated Framework for Dynamic E-commerce Product-Attribute Knowledge Graph Construction

AutoPKG:一种用于动态电子商务产品-属性知识图谱构建的自动化框架

Pollawat Hongwimol, Haoning Shang, Chutong Wang, Zhichao Wan, Yi Gao, Yuanming Li, Lin Gui, Wenhao Sun, Cheng Yu

机构 * Lazada, Alibaba International Digital Commerce Group(Lazada,阿里巴巴国际数字 commerce 集团) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AutoPKG框架,通过多智能体大语言模型自动构建产品-属性知识图谱,解决电子商务产品属性提取中本体不一致、不完整和维护成本高的问题,实验证明其在提升GMV和推荐效果上的显著优势。

Comments Accepted as ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14922 2026-04-21 cs.CL 77%

Synthia: Scalable Grounded Persona Generation from Social Media Data

Synthia:从社交媒体数据中可扩展的 grounded 人格生成

Vahid Rahimzadeh, Erfan Moosavi Monazzah, Mohammad Taher Pilehvar, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies(德黑兰高级研究 institute) University of Tehran(德黑兰大学) Cardiff University(卡迪夫大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 Synthia通过结合真实社交媒体数据与语言模型,生成更贴近现实的人格,提升与人类意见分布的一致性,同时在公平性和偏见分析中表现更优,保留交互图结构以支持网络感知分析。

Comments Accepted at ACL 2026 Main Conference, the dataset is available on HuggingFace (see https://huggingface.co/datasets/teias-ai/synthia)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18269 2026-04-21 cs.CL cs.CV 77%

TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation

TextTIGER:基于实体提示精炼的文本智能生成用于文本到图像生成

Shintaro Ozaki, Tomoyuki Jinno, Kazuki Hayashi, Yusuke Sakai, Jingun Kwon, Hidetaka Kamigaito, Katsuhiko Hayashi, Manabu Okumura, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術研究所) The University of Tokyo(东京大学) Chungnam National University(Chungnam国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TextTIGER通过增强外部信息和大语言模型总结,优化实体描述以提升文本到图像生成性能,实验表明其在多种评估指标上优于仅使用描述的提示方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12142 2026-04-21 cs.CL cs.AI cs.HC cs.LG 75%

A Computational Method for Measuring "Open Codes" in Qualitative Analysis

一种用于定性分析中测量'开放代码'的计算方法

John Chen, Alexandros Lotsos, Sihan Cheng, Caiyi Wang, Lexie Zhao, Yanjia Zhang, Jessica Hullman, Bruce Sherin, Uri Wilensky, Michael Horn

机构 * University of Arizona(亚利桑那大学) Northwestern University(西北大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于理论的计算方法,用于评估人类和生成式AI在定性分析中的开放代码结果,通过合并代码本和四种新指标验证方法的稳定性与鲁棒性。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18292 2026-04-21 cs.AI cs.CL 73%

Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence

Agent-World:通过可扩展环境提升进化通用智能

Guanting Dong, Junting Lu, Junjie Huang, Wanjun Zhong, Longxiang Liu, Shijue Huang, Zhenyu Li, Yang Zhao, Xiaoshuai Song, Xiaoxi Li, Jiajie Jin, Yutao Zhu, Hanbin Wang, Fangyu Lei, Qinyu Luo, Mingyang Chen, Zehui Chen, Jiazhan Feng, Ji-Rong Wen, Zhicheng Dou

机构 * Renmin University of China(中国人民大学) ByteDance Seed(字节跳动种子)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Agent-World,通过可扩展环境实现通用智能进化,展示其在23个挑战性基准测试中超越现有模型和基线。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18052 2026-04-21 cs.CR cs.AI cs.LG 73%

ExAI5G: A Logic-Based Explainable AI Framework for Intrusion Detection in 5G Networks

ExAI5G:一种用于5G网络入侵检测的基于逻辑的可解释人工智能框架

Saeid Sheikhi, Panos Kostakos, Lauri Loven

机构 * organization= Faculty of Information Technology Electrical Engineering, University of Oulu , addressline= , city= Oulu , postcode= 90570 , state= , country= Finland

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出ExAI5G框架,结合Transformer深度学习与逻辑可解释AI技术,实现高精度且透明的入侵检测,通过逻辑规则提取和解释评估方法,达到99.9%准确率和0.854宏F1分数,展示出模型推理的透明性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16687 2026-04-21 cs.AI cs.LG 73%

Agentic Risk-Aware Set-Based Engineering Design

代理风险感知的集束工程设计

Varun Kumar, George Em Karniadakis

机构 * School of Engineering, Brown University(布朗大学工程学院) Division of Applied Mathematics, Brown University(布朗大学应用数学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于大语言模型的多代理框架,用于工程设计早期阶段,通过集束设计哲学和风险管理,自动化探索并筛选设计候选方案,提升决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16392 2026-04-21 cs.CY cs.AI cs.CL 73%

RoMathExam: A Longitudinal Dataset of Romanian Math Exams (1895-2025) with a Seven-Decade Core (1957-2025)

RoMathExam:一份涵盖罗马尼亚数学考试的纵向数据集(1895-2025)及一个七十年核心(1957-2025)

Luca-Ncolae Cuclea, Sabin-Codrut Badea, Adrian-Marius Dumitran

机构 * University of Bucharest, Faculty of Mathematics and Computer Science(布加勒斯特大学数学与计算机科学学院) Cu Drag si Sport SRL(Cu Drag si Sport公司) Softbinator Technologies(Softbinator技术公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 RoMathExam 数据集包含10592个数学问题,覆盖1895-2025年的罗马尼亚高中数学考试,提供标准化核心和课程对齐标签,用于评估和研究。

Comments AIED 2026, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16310 2026-04-21 cs.IR cs.AI cs.CL 73%

RAG-DIVE: A Dynamic Approach for Multi-Turn Dialogue Evaluation in Retrieval-Augmented Generation

RAG-DIVE: 多轮对话中检索增强生成系统动态评估方法

Lorenz Brehme, Benedikt Dornauer, Jan-Henrik Böttcher, Klaus Schmid, Mircea-Cristian Racasan, Ruth Breu

机构 * University of Innsbruck(因斯布鲁克大学) University of Hildesheim(希尔德斯海姆大学) c.c.com Moser GmbH(c.c.com Moser公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 RAG-DIVE通过动态模拟用户交互,评估多轮对话中检索增强生成系统的动态性能,提出对话生成、验证和评估三个核心组件,验证了其在动态交互中的有效性。

Comments Accepted for publication at CAIN 2026 (5th International Conference on AI Engineering)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09162 2026-04-21 cs.CL cs.AI cs.HC 73%

Persona-E$^2$: A Human-Grounded Dataset for Personality-Shaped Emotional Responses to Textual Events

Persona-E$^2$: 一种基于人类的用于个性塑造文本事件情感反应的数据集

Yuqin Yang, Haowu Zhou, Haoran Tu, Zhiwen Hui, Shiqi Yan, HaoYang Li, Dong She, Xianrong Yao, Yang Gao, Zhanpeng Jin

机构 * School of Future Technology(未来技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Persona-E$^2$数据集,通过标注MBTI和Big Five特质,捕捉读者对新闻、社交媒体和生活叙事的情感变化,发现性格信息显著提升理解,缓解'性格幻觉'。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02617 2026-04-21 cs.LG cs.AI cs.CV 73%

Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback

通过AI反馈提升文本到视频生成中动态物体交互

Hiroki Furuta, Heiga Zen, Dale Schuurmans, Aleksandra Faust, Yutaka Matsuo, Percy Liang, Sherry Yang

机构 * Google DeepMind(谷歌DeepMind) The University of Tokyo(东京大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究如何利用反馈提升文本到视频模型中动态物体交互的质量,提出利用视觉语言模型提供针对性反馈,实验表明该方法在视频交互场景质量上有显著提升。

Comments Website: https://sites.google.com/view/aif-dynamic-t2v/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15253 2026-04-21 cs.CL cs.CV 70%

Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding

超越上下文的规模:文档理解的多模态检索增强生成综述

Sensen Gao, Shanshan Zhao, Xu Jiang, Lunhao Duan, Yong Xien Chng, Qing-Guo Chen, Weihua Luo, Kaifu Zhang, Jia-Wang Bian, Mingming Gong

机构 * MBZUAI Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) University of Melbourne(墨尔本大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了多模态检索增强生成在文档理解中的应用,提出基于领域、检索模态和粒度的分类体系,总结了关键数据集、基准测试和行业应用,指出了效率、细粒度表示和鲁棒性等挑战。

Comments Accepted by ACL2026 Main Conference; Project is available at https://github.com/SensenGao/Multimodal-RAG-Survey-For-Document

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14397 2026-04-21 cs.CL 70%

Thunder-NUBench: A Benchmark for LLMs' Sentence-Level Negation Understanding

Thunder-NUBench: 一个用于评估大语言模型句子级否定理解的基准测试

Yeonkyoung So, Gyuseong Lee, Sungmok Jung, Joonhak Lee, JiA Kang, Sangho Kim, Jaejin Lee

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Dept. of Computer Science and Engineering, Seoul National University(首尔国立大学计算机科学与工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Thunder-NUBench,专门评估大语言模型对句子级否定的理解,通过对比标准否定与结构多样化的替代形式,如局部否定、矛盾和改写,提供全面的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17391 2026-04-21 cs.SE cs.AR cs.LG 70%

RISC-V Functional Safety for Autonomous Automotive Systems: An Analytical Framework and Research Roadmap for ML-Assisted Certification

RISC-V功能安全用于自动驾驶系统:面向ML辅助认证的分析框架与研究路线图

Nick Andreasyan, Mikhail Struve, Alexey Popov, Maksim Nikolaev, Vadim Vashkelis

机构 * Andes Technology(安德斯技术)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文探讨RISC-V在自动驾驶功能安全中的角色,提出以认证经济性为核心的分析框架,通过ML方法优化认证流程,旨在构建符合ASIL-D标准的可认证RISC-V平台。

Comments 11 pages, 3 figures, 4 tables. Analytical perspective paper on automotive-grade RISC-V functional safety, certification economics, and ML-assisted certification for autonomous driving systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17200 2026-04-21 cs.CL 70%

Calibrating Model-Based Evaluation Metrics for Summarization

校准基于模型的评估指标用于摘要生成

Hongye Liu, Dhanajit Brahma, Ricardo Henao

机构 * Duke University(杜克大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出无需参考摘要、人工标注或昂贵模型指标的通用框架,通过组等距回归分箱(GIRB)校准预测结果,提升摘要质量评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10533 2026-04-21 cs.RO cs.CL cs.CV 70%

VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions

VLN-NF:具有假前提指令的视图与语言导航

Hung-Ting Su, Ting-Jun Wang, Jia-Fong Yeh, Min Sun, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) National Tsing Hua University(国立清华大学) DRIC

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出VLN-NF基准,通过引入假前提指令,要求智能体在目标不存在时进行探索并明确输出NOT-FOUND,采用ROAM方法在房间级导航与室内探索中取得最佳性能。

Comments ACL 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06710 2026-04-21 cs.AI cs.IR 70%

ATANT: An Evaluation Framework for AI Continuity

ATANT:人工智能连续性的评估框架

Samuel Sameer Tanguturi

机构 * Kenotic Labs(肯otic实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ATANT框架,用于评估AI系统在时间维度上的连续性能力,通过10个检查点方法和250个故事的叙事测试集,验证系统在不同架构下的连续性表现。

Comments 7 pages, 8 tables. Framework and evaluation protocol available at https://github.com/Kenotic-Labs/ATANT and https://kenoticlabs.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25944 2026-04-21 cs.AI 70%

NuRisk: A Visual Question Answering Dataset for Agent-Level Risk Assessment in Autonomous Driving

NuRisk:面向自动驾驶中 agent 级风险评估的视觉问答数据集

Yuan Gao, Mattia Piccinini, Roberto Brusnicki, Yuchen Zhang, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, TUM School of Engineering and Design, Technical University of Munich(自主车辆系统教授职位,TUM工程与设计学院,慕尼黑技术大学) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所(MIRMI))

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 NuRisk 数据集通过 2.9K 场景和 1.1M agent 级样本,提供基于鸟瞰图的时序图像及量化风险标注,提升自动驾驶中 agent 行为与情境的时空推理能力。

Comments 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19088 2026-04-21 cs.CY cs.AI cs.HC stat.AP 70%

Digital Twins as Funhouse Mirrors: Five Key Distortions

数字双胞胎作为游乐场镜子:五大关键扭曲

Tianyi Peng, George Gui, Melanie Brucks, Daniel J. Merlau, Grace Jiarui Fan, Malek Ben Sliman, Eric J. Johnson, Abdullah Althenayyan, Silvia Bellezza, Dante Donati, Hortense Fong, Elizabeth Friedman, Ariana Guevara, Mohamed Hussein, Kinshuk Jerath, Bruce Kogut, Akshit Kumar, Kristen Lane, Hannah Li, Vicki Morwitz, Oded Netzer, Patryk Perkowski, Olivier Toubia

机构 * Columbia University(哥伦比亚大学) Yale University(耶鲁大学) Yeshiva University(耶鲁神学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究通过19项预注册研究,比较人类与数字双胞胎对164种不同结果的反应,发现数字双胞胎预测准确度较低且与人类反应相关性弱,识别出五大系统性扭曲问题,并释放数据集和代码以促进方法改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01330 2026-04-21 cs.AI 70%

NaturalGAIA: A Verifiable Benchmark and Hierarchical Framework for Long-Horizon GUI Tasks

NaturalGAIA:一个可验证的基准和分层框架用于长周期GUI任务

Zihan Zheng, Tianle Cui, Taoran Wang, Fengtao Wang, Jiahui Pan, Lewei He, Qianglong Chen

机构 * South China Normal University(华南师范大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出NaturalGAIA,通过真实人类GUI交互意图构建可验证评估数据集,结合LightManus-Jarvis框架,实现复杂自然任务的宏规划与微执行,实验显示其在路径成功率、token消耗和执行时间上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17079 2026-04-21 cs.CL 70%

Auditing Support Strategies in LLMs through Grounded Multi-Turn Social Simulation

通过 grounded 多轮社交模拟审计 LLMs 的支持策略

Michelle Star, Andrew Aquilina, Yu-Ru Lin

机构 * Reddit

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 本文提出多轮模拟框架评估 LLMs 的支持策略,通过分解 Reddit 社区的求助叙事,发现支持策略随用户压力变化而变化,揭示单轮评估无法捕捉的动态特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16893 2026-04-21 cs.CV cs.LG 70%

EasyVideoR1: Easier RL for Video Understanding

EasyVideoR1: 更容易的视频理解强化学习

Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出EasyVideoR1框架,通过高效预处理、统一奖励系统和混合训练策略,提升视频理解任务的训练效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16824 2026-04-21 cs.CR cs.AI 70%

SafeDream: Safety World Model for Proactive Early Jailbreak Detection

SafeDream: 用于主动早期对抗检测的安全世界模型

Bo Yan, Weikai Lin, Yada Zhu, Song Wang

机构 * University of Central Florida(中央佛罗里达大学) University of Rochester(罗切斯特大学) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SafeDream,一种轻量级世界模型框架,通过安全状态模型、CUSUM检测和对比想象组件,实现早期对抗检测,提升检测及时性并降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16785 2026-04-21 cs.CV cs.AI 70%

Bridging Coarse and Fine Recognition: A Hybrid Approach for Open-Ended Multi-Granularity Object Recognition in Interactive Educational Games

弥合粗粒与细粒识别:一种混合方法用于交互教育游戏中的开放多粒度物体识别

Hanling Yi, Feng Lin, Mao Luo, Yifan Yang, Xiaotian Yu, Rong Xiao

机构 * Intellifusion Inc.(Intellifusion公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出HyMOR混合框架,结合MLLM和CLIP模型,解决开放多粒度物体识别中的粗粒与细粒任务差距问题,通过TBO数据集实验验证其在多模态内容生成和互动学习中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16443 2026-04-21 eess.SY cs.LG cs.SY 70%

Thermal-GEMs: Generalized Models for Building Thermal Dynamics

热能-GEs:建筑热动态的通用模型

Felix Koch, Fabian Raisch, Benjamin Tischler

机构 * Technical University of Applied Sciences Rosenheim(应用技术大学罗斯海姆分校) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文评估了建筑热动态通用建模方法,包括多源迁移学习和时间序列基础模型,发现多源迁移学习在真实应用中能显著降低预测误差,但需充足数据预训练以超越时间序列基础模型。

Comments The 13th ACM International Conference on Systems for Energy-Efficient Buildings, Cities, and Transportation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16385 2026-04-21 cs.SE cs.AI 70%

StressWeb: A Diagnostic Benchmark for Web Agent Robustness under Realistic Interaction Variability

StressWeb: 一个用于评估网络代理在现实交互变异下的鲁棒性的诊断基准

Haoyue Bai, Dong Wang, Long Chen, Bingguang Hao, Pengyang Shao, Yonghui Yang, Yicheng He, Chenyi Zhuang

机构 * Inclusion AI, Ant Group(Inclusion AI,蚂蚁集团) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出StressWeb基准,通过构建可控的网络环境和引入结构化扰动,评估网络代理在现实交互中的鲁棒性,揭示隐藏的失败模式和鲁棒性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10159 2026-04-21 cs.CL cs.DB cs.IR cs.MA 70%

ODUTQA-MDC: A Task for Open-Domain Underspecified Tabular QA with Multi-turn Dialogue-based Clarification

ODUTQA-MDC:一个面向开放领域未指定表格问答的任务

Zhensheng Wang, ZhanTeng Lin, Wenmian Yang, Kun Zhou, Yiquan Zhang, Weijia Jia

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ODUTQA-MDC任务及首个综合基准,包含大规模数据集、细粒度标注方案和动态澄清界面,提出MAIC-TQA框架以检测歧义、通过对话澄清并优化答案。

Comments This paper has been accepted by ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14410 2026-04-21 cs.AI 70%

ORThought: Benchmarking and Automating Logistics Optimization Modeling

ORThought: 物流优化建模的基准测试与自动化

Beinuo Yang, Qishen Zhou, Junyi Li, Chenxing Su, Panagiotis Angeloudis, Simon Hu

机构 * ZJU-UIUC Institute, Zhejiang University(浙江大学浙大-伊利诺伊大学联合学院) School of Transportation, Jilin University(吉林大学交通运输学院) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究所) Department of Civil and Environmental Engineering, Imperial College London(伦敦帝国理工学院土木与环境工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ORThought框架,通过引入专家级建模原理,解决物流优化建模中的基准不足、多智能体框架不稳定及评估深度不足等问题,实验证明其在复杂约束下表现优异。

Comments The paper has been accepted by Artificial Intelligence for Transportation

详情

展开后加载摘要…

URL PDF HTML 收藏