arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-07 至 2026-07-07 共收录 712 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 164 篇

2607.02674 2026-07-07 cs.CV 新提交 67%

EmoteGPT: 3D Human Facial Expressions from Natural Language Descriptions

EmoteGPT:从自然语言描述生成3D人类面部表情

Haoran Wang, Mohit Mendiratta, Christian Theobalt, Adam Kortylewski

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息学园区) CISPA Helmholtz Center for Information Security(亥姆霍兹信息安全中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究如何从文本精确控制3D面部表情,将其转化为3D可变形模型解缠参数空间中的回归问题。引入Txt2Emote数据集,提出EmoteGPT框架,经大规模数据增强训练,在表情识别等方面超越现有方法。

Comments Project page: https://genintel.github.io/EmoteGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30583 2026-07-07 cs.CY econ.GN q-fin.EC q-fin.GN 版本更新 67%

AI Premium

AI溢价

Nicola Borri, Yukun Liu, Aleh Tsyvinski

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 基于380万亿token的AI消费数据,构建AI因子并发现高AI贝塔公司获得更高后续收益,AI溢价显著且异质,主要源于密集型、前沿导向的AI消费。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22607 2026-07-07 cs.CV 版本更新 67%

Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off

Dress-ED:基于指令的虚拟试穿和试脱编辑

Davide Lobba, Fulvio Sanguigni, Bin Ren, Marcella Cornia, Rita Cucchiara, Nicu Sebe

机构 * University of Modena(摩德纳大学) University of Trento(特伦托大学) University of Pisa(比萨大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出Dress-ED数据集,首次统一了虚拟试穿、试脱和文本引导的服装编辑,包含146k个样本,涵盖外观和结构修改,提供统一的多模态扩散框架作为指令驱动的VTON和VTOFF基线。

Comments Accepted at ECCV 2026. Project page at https://aimagelab.github.io/Dress-ED/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10730 2026-07-07 cs.CV 版本更新 67%

IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation

IRG-MotionLLM:用于文本到运动生成的交织运动生成、评估和细化

Yuan-Ming Li, Qize Yang, Nan Lei, Shenghao Fu, Ling-An Zeng, Jian-Fang Hu, Xihan Wei, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Tongyi Lab, Alibaba Group(阿里云实验室) Shenzhen Loop Area Institute(深圳河套学院) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究揭示运动评估和细化任务可促进知识流动,提出通过迭代文本-运动对话将运动生成与评估、细化紧密结合的新范式,介绍IRG-MotionLLM及训练方案,构建数据引擎,实验证明其性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20272 2026-07-07 cs.CV 版本更新 67%

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

VKnowU:评估多模态语言模型中的视觉知识理解

Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。

Comments Accepted by ECCV 2026. https://github.com/OpenGVLab/VKnowU

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04690 2026-07-07 cs.CL cs.LG 新提交 62%

PAST-TIDE: Prototype-Anchored Statement Tuning with Topic-Invariant Normalization for Stance Detection

PAST-TIDE:用于立场检测的基于主题不变归一化的原型锚定语句微调

Md. Shakhoyat Rahman Shujon, MD Jahid Hasan Jim, Md. Milon Islam, Md Rezwanul Haque, Fakhri Karray

机构 * Department of Computer Science and Engineering, Khulna University of Engineering & Technology(库尔纳工程技术大学计算机科学与工程系) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学机器学习系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 PAST-TIDE是用于立场检测的系统,通过语句微调,将立场重新定义为完形填空式掩码语言建模,并用原型对比学习及主题条件层归一化补充,在低资源设置中表现有竞争力。

Comments Published in The Fifteenth Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04546 2026-07-07 cs.RO cs.AI cs.CV cs.LG 新提交 62%

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。

Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04542 2026-07-07 cs.LG cs.AI cs.SE 新提交 62%

Auto: The AGI Compiler

自动:通用人工智能编译器

Jaber Jaber, Osama Jaber

机构 * RightNow AI(即时人工智能)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究提出通用人工智能编译器Auto,通过记录智能体行为,提取确定性部分转化为程序或专家,生成带保障的认知二进制文件。在基准测试中表现良好,还量化了失败模式,强调校准和参考保真度对正确性的决定作用。

Comments 10 pages, 4 figures, 3 tables, 1 algorithm. Code: https://github.com/RightNow-AI/auto

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04319 2026-07-07 cs.CL cs.LG 新提交 62%

Legible-by-Construction: Attention and End-to-End Transformers

通过构造实现可读:注意力机制与端到端变换器

Mark Oskin

机构 * Professor School of Computer Science and Engineering University of Washington(计算机科学与工程教授 美国华盛顿大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究将变换器前馈层可读化的思想应用于注意力机制,提出最小化机制及布尔变体,通过选择性压力使值通道成为可读探测器,在多注意力设计中提升了可读性,还训练了端到端可读语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04281 2026-07-07 cs.CL cs.AI 新提交 62%

Risk-Constrained Freshness-Aware Semantic Caching for Open-Web Retrieval-Augmented LLMs

面向开放网络检索增强语言模型的风险约束新鲜度感知语义缓存

Muhammad Mansoor, Tahir Ahmad, Yeo-Chan Yoon

机构 * Jeju National University(济州国立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对开放网络证据时变新鲜度,提出三层语义缓存FreshCache,将缓存重用视为风险约束时间推理问题,给出评估方法并引入基准测试,实验表明其在节省搜索API及降低陈旧错误率方面效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03991 2026-07-07 cs.LG cs.CL 新提交 62%

Knowing When to Stop: Predicting Execution-Consistency Convergence in Text-to-SQL

知道何时停止:预测文本到SQL执行一致性收敛

Yaron Anavi, Mor Aisenberg, Nadav Nesher, Elena Khabibullina, Isabella Cattinelli

机构 * GIGASPACES

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究预测文本到SQL结果执行一致性收敛的停止时机,训练轻量级1-D模型观察一致性轨迹来决定是否继续运行,在多数据集上验证方法能自适应停止点,还展示了训练增强及噪声注入下的效果。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03386 2026-07-07 cs.AI cs.LG 新提交 62%

When Aggregate Alignment Misleads: Auditing Policy Repair Without Per-State Expert Actions

当聚合对齐产生误导时:无需逐状态专家操作的审核策略修复

Peiying Zhu, Sidi Chang

机构 * Blossom AI(绽放人工智能公司) Blossom AI Labs(绽放人工智能实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究在酒店定价模拟器中,智能策略编辑器仅接收区域级诊断反馈时的策略修复问题,用多重启大语言模型编辑器进行修复,其不仅提升收益还减小情节构成距离,结果表明应按诊断反馈是否成可靠闭环结果评估策略修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02975 2026-07-07 cs.AI cs.CL 新提交 62%

Evaluating Generative Agents with Actions Grounded in Socially Distributed Task Environments using Incognita

使用Incognita评估基于社会分布式任务环境中行动的生成智能体

Dan C. Hsu, Luke Lu

机构 * RedMind Research(RedMind研究)

专题命中 评测与基准 :language agent(abstract);分类 cs.CL、cs.AI

AI总结 研究结合现有基准和社会模拟环境要求的评估设置,定义社会分布式任务环境,介绍Incognita框架,以之评估三个生成智能体模型,发现其在奖励和行为上有进展但可靠性仍低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02932 2026-07-07 cs.CR cs.AI cs.HC cs.LG 新提交 62%

PromptPET: Privacy-Utility Optimized Prompt Obfuscation

PromptPET:隐私-效用优化的提示混淆

Ke Yang, Olivia Figueira, Umar Iqbal, Athina Markopoulou

机构 * University of California, Irvine(加州大学 Irvine 分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 旨在通过用户端机制保护用户隐私,该机制转换用户提示中的敏感信息,在保护隐私和保留效用间权衡。考虑评估比较四种混淆动作,提出基于大语言模型的PROMPTPET,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02718 2026-07-07 cs.CV cs.AI cs.LG 新提交 62%

Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models

用基础图像生成模型诊断鸟瞰目标检测器

Stanislav Panev, Minhyek Jeon, Vaishnavi Khindkar, Ahish Deshpande, Celso M de Melo, Shuowen Hu, Shayok Chakraborty, Fernando De la Torre

机构 * Carnegie Mellon University(卡内基梅隆大学) DEVCOM Army Research Laboratory(陆军研究实验室(DEVCOM)) Florida State University(佛罗里达州立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究用文本引导生成、属性控制编辑和自动属性验证构建可控合成测试平台,对预训练检测器进行细粒度评估,以预测实际性能差距并指导高效数据收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03193 2026-07-07 quant-ph cs.AI cs.LG 新提交 62%

Self-Specializing Vision-Language Transmon Chip Calibration in a Physics-Grounded Environment

在物理基础环境中自专业化的视觉语言跨导芯片校准

Animesh Tripathy, Aswanth Krishnan

机构 * QpiAI India Pvt. Ltd(QpiAI印度私人有限公司)

专题命中 评测与基准 :language agent(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言智能体能否在无权重更新下校准超导跨导芯片。通过设计物理模拟环境、视觉语言智能体及无梯度在线自适应方法,在预算压力下提升芯片保真度,诊断硬件故障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16494 2026-07-07 cs.CL cs.AI cs.CV 新提交 62%

Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering

迷失在末尾:多模态检索增强问答中的首因偏差

Jieyuan Liu, Jianyang Gu, Shijie Chen, Jefferson Chen, Zhen Wang

机构 * University of California, San Diego(加州大学圣地亚哥分校) The Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究多模态知识型视觉问答中检索上下文的位置依赖,发现不同于纯文本的U形效应,出现首因偏差(开头优于末尾),并通过消融实验定位原因为指令调优阅读器的提示槽0。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.14019 2026-07-07 cs.CV cs.AI cs.HC cs.LG 版本更新 62%

Domain Knowledge-Informed Self-Supervised Representations for Workout Form Assessment

用于健身动作形式评估的领域知识驱动自监督表示

Paritosh Parmar, Amol Gharat, Helge Rhodin

机构 * University of British Columbia(不列颠哥伦比亚大学) FlexAI Inc.(FlexAI公司)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究健身动作形式评估问题,提出基于领域知识的自监督方法,利用动作谐波运动及多因素差异学习强大表示,创建新数据集,实验表明自监督表示优于现有方法且可用于其他领域。

Comments ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04774 2026-07-07 cs.LG 新提交 57%

MARLIN: De Novo Molecular Structure Elucidation from Tandem Mass Spectra without a Ground-Truth Formula

MARLIN:从串联质谱中进行从头分子结构解析,无需真实分子式

Xujun Che, Xiuxia Du, Depeng Xu

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究针对无分子式的串联质谱,提出MARLIN方法,通过自监督编码器和语言模型生成候选结构,用质量壳约束等确保准确性,在无真实分子式情况下表现出色,能可靠解析结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04537 2026-07-07 cs.SE cs.AI 新提交 57%

Obey, Diverge, Collapse: Blind Obedience to Incorrect Instructions Drives Code LLMs to Irrecoverable Code Semantic Collapse

服从、发散、崩溃:对错误指令的盲目服从驱使代码语言模型陷入无法恢复的代码语义崩溃

Raj Jaiswal, Anany Singh Divy, Savar Bhasin, Adi Bajpai, Tanuja Ganu, Rajiv Ratn Shah

机构 * IIIT Delhi(印度德里国家理工学院) IIT Kanpur(印度坎浦尔理工学院) Microsoft Research India(微软印度研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究代码语言模型在指令错误时的表现,通过四个实验评估其在单步和迭代修复设置中对错误指令的应对,发现模型会盲目服从错误指令致代码语义崩溃,引入幽灵错误且无法恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04147 2026-07-07 cs.CV cs.AI 新提交 57%

HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding

HCSU:用于细粒度历史书法风格理解的数据集和基准测试

Yinsheng Yao, Yan Liu, Chen Ye

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) The Key Laboratory of Embedded System and Service Computing, Ministry of Education(教育部嵌入式系统与服务计算重点实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对大视觉语言模型在书法风格细粒度理解的挑战,引入HCSU数据集,含多朝代书法家字符图像,解耦模态混合问题,提供分层审美描述及评估协议,揭示当前架构局限以推动视觉推理发展。

Comments Accepted at ECCV 2026. 17 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04139 2026-07-07 cs.LG 新提交 57%

Masked Generative-Contrastive Representation Learning for Cross-Dataset EEG-Based Emotion Recognition

用于跨数据集基于脑电图的情绪识别的掩码生成对比表示学习

Huqin Weng, Jiayang Huang, Yimin Wen, Jie Du, Chi-Man Vong, Chuangquan Chen

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 提出掩码生成对比表示学习框架MGCRL用于跨数据集脑电图情绪识别,基于区域感知时空编码器,整合生成与对比学习,通过关键设计实现跨数据集泛化的细粒度和全局判别表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04034 2026-07-07 cs.SE cs.AI 新提交 57%

The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling

“我不知道”过滤器:提高函数调用中智能体的可靠性

Stefan Broecker, Mason del Rosario, Boris Selitser, Thomas Strohmer

机构 * University of California, Davis, Department of Computer Science(加州大学戴维斯分校计算机科学系) Okareo, Inc.(Okareo公司) University of California, Davis, Department of Mathematics(加州大学戴维斯分校数学系)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究语言模型在函数调用基准测试中性能提升但因训练评估指标致幻觉问题。提出考虑错误函数调用负面结果的评估指标及可量化不确定性、去除有害函数调用的轻量级可训练过滤器,助力智能体知道何时说“我不知道”以提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03831 2026-07-07 cs.CV cs.AI 新提交 57%

How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation

扩散分类器如何做出决策?以偏差为中心的评估

Saba Fathi, Fardin Ayar, Maryam Abdolali, Ehsan Javanmardi, Manabu Tsukada, Mahdi Javanmardi

机构 * K. N. Toosi University of Technology(伊朗科技大学) Amirkabir University of Technology(伊朗阿米尔卡比尔理工大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究扩散分类器如何决策,通过ASOB-Bench从属性绑定、大小顺序偏差和背景依赖三维度评估,发现其偏差特征与视觉语言模型不同,为构建更稳健模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03821 2026-07-07 cs.CR cs.AI 新提交 57%

DualView: Preventing Indirect Prompt Injection in Personal AI Agents

双视图:防止个人人工智能代理中的间接提示注入

Juhee Kim, Woohyuk Choi, Taehyun Kang, Youngmin Kim, Byoungyoung Lee

机构 * Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究个人人工智能代理面临的间接提示注入攻击问题,提出双视图方法,通过扩展不可信数据跟踪到用户环境,部署为插件,有效阻止攻击并保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03650 2026-07-07 cs.CV cs.AI 新提交 57%

ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation

ClinOCR-Bench:用于光学字符识别模型评估的综合临床扫描文档数据集

Enshuo Hsu, Jin Zhou, Kirk Roberts

机构 * McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校麦威廉斯生物医学信息学学院) Enterprise Development & Integration, University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心企业开发与集成)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对从扫描医疗文档提取文本信息的挑战,通过发布ClinOCR-Bench数据集,用多样文档类型、覆盖扫描伪像等特性,评估基准OCR性能,为临床OCR模型评估提供公开资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03523 2026-07-07 cs.SE cs.CL 新提交 57%

Anchored Self-Play for Code Repair

用于代码修复的锚定自博弈

Caroline Choi, Zeyneb Kaya, Shirley Wu, Tengyu Ma, Tatsunori Hashimoto, Ludwig Schmidt

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究代码修复能力,提出生成器-修复器自博弈,通过强化学习训练单个模型生成并修复错误,引入BugSourceBench测试泛化性,发现问题后提出锚定自博弈,提高修复率。

Comments 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03381 2026-07-07 cs.DL cs.CL 新提交 57%

Large-scale dataset of automatically classified rhetorical sections in scientific papers

科学论文中自动分类修辞部分的大规模数据集

Daniel Verdi, Jacob Aarup Dalsgaard, Roberta Sinatra

机构 * Graduate School of Education, Stanford University(斯坦福大学教育研究生院) Center for Social Data Science (SODAS), University of Copenhagen(哥本哈根大学社会科学数据科学中心) Networks, Data, and Society (NERDS), IT University of Copenhagen(哥本哈根IT大学网络、数据与社会中心) Pioneer Centre for Artificial Intelligence (P1), Denmark(丹麦先锋人工智能中心) Complexity Science Hub, Austria(奥地利复杂科学中心)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 该研究利用基于规则的分类算法,对语义学者开放研究语料库中的数百万篇科学论文进行质量筛选和标注,构建了一个数据集,可助力大规模科学话语和写作模式的计算研究。

Comments Data descriptor; includes supplementary information (1 PDF). 15 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03135 2026-07-07 cs.SE cs.AI 新提交 57%

Detecting Architectural Drift in Safety-Critical Firmware through Runtime Trace Analysis

通过运行时跟踪分析检测安全关键固件中的架构漂移

Domenico Francesco De Angelis, Marco De Luca, Domenico Amalfitano, Pasquale Cimmino, Anna Rita Fasolino

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) Micron Technology, Inc(美光技术公司) DIETI

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究在长寿命安全关键固件中检测架构漂移问题,核心方法是收集硬件辅助执行跟踪,经抽象比较找出差异,还基于大语言模型生成报告,贡献是经评估该方法有效。

Comments accepted at 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02956 2026-07-07 cs.CV cs.CL 新提交 57%

MORE: A Multilingual Document Parsing Benchmark and Evaluation

MORE:一个多语言文档解析基准和评估

Long Xu, Binghong Wu, Tinghao Yu, Hao Feng, Zhenyu Huang, Haoqing Jiang, Yunhao Wang, Shuo Huang, Feng Zhang

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究针对多语言文档解析,现有基准侧重高资源语言。为此引入MORE基准,其具规模大、结构复杂、数据真实的特点,用它评估模型,为长尾语言建性能基线并验证基准有效性。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). 22 pages, 11 figures. Code and dataset available at https://github.com/zimoqingfeng/MORE

详情

展开后加载摘要…

URL PDF HTML 收藏