arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-26 至 2026-05-26 共收录 663 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 142 篇

2411.00934 2026-05-26 cs.CY cs.AI 70%

The Meme Is the Message: Generative Memesis and AI Visuals in the 2024 USA Presidential Elections

模因即信息:生成式模因与2024年美国总统选举中的AI视觉内容

Ho-Chun Herbert Chang, Benjamin Shaman, Yung-chun Chen, Mingyue Zha, Sean Noh, Chiyu Wei, Tracy Weener, Maya Magee

机构 * Program in Quantitative Social Science, Dartmouth College(量化社会科学项目,达特茅斯学院) Department of Mathematics, Dartmouth College(数学系,达特茅斯学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过分析Instagram图像数据集,结合计算机视觉、大语言模型和面部情感分析,发现模因格式比AI生成内容更能预测用户参与度,但AI生成的模因与人类策展结合时产生协同效应,并定义了生成式模因作为AI介导的模因传播新模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24503 2026-05-26 cs.CV cs.AI 70%

FoodMonitor: Benchmarking MLLMs for Explainable Compliance Analysis

FoodMonitor:用于可解释合规性分析的多模态大语言模型基准测试

Ruihao Xu, Xingming Shui, Jingxuan Niu, Yiqin Wang, Jilin Yu, Haoji Zhang, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有视频异常检测缺乏规则驱动可解释性的问题,提出FoodMonitor基准,包含双通道违规标注和两阶段匹配评估协议,揭示当前多模态大语言模型在空间定位和细粒度规则理解上的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24238 2026-05-26 cs.AI 70%

Toward Enactive Artificial Intelligence

走向生成式人工智能

Banafsheh Rafiee, Richard Sutton

机构 * Independent Researcher(独立研究者) Department of Computing Science, University of Alberta, Canada(阿尔伯塔大学计算机科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文主张将生成式认知方法融入人工智能,强调感知与行动不可分割、具身性和自主性,并指出强化学习在结构上与生成式原则存在共鸣但仍有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12961 2026-05-26 cs.CV cs.LG 70%

Reducing Bias and Variance: Generative Semantic Guidance and Bi-Layer Ensemble for Image Clustering

减少偏差与方差:用于图像聚类的生成语义引导与双层集成

Feijiang Li, Zhenxiong Li, Jieting Wang, Zizheng Jiu, Saixiong Liu, Liang Du

机构 * Institute of Big Data Science and Industry(大数据科学与产业研究院) Key Laboratory of Evolutionary Science Intelligence of Shanxi Province(山西省进化智能科学重点实验室) School of Artificial Intelligence, Shanxi University(山西大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出GSEC框架,通过生成语义引导减少偏差、双层集成学习降低方差,在六个基准数据集上超越18种最新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16435 2026-05-26 cs.RO cs.CL cs.HC 70%

What Questions Should Robots Be Able to Answer? A Dataset of User Questions for Explainable Robotics

机器人应该能够回答哪些问题?一个用于可解释机器人的用户问题数据集

Lennart Wachowiak, Andrew Coles, Gerard Canal, Oya Celiktutan

机构 * King's College London, CDT in Safe and Trusted AI(国王学院伦敦大学,安全与可信人工智能中心) King's College London(国王学院伦敦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过收集100名参与者的1893个问题,构建了一个面向家用机器人的用户问题数据集,涵盖12个类别和70个子类别,旨在帮助机器人学家确定机器人需要回答的关键问题类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23764 2026-05-26 cs.CV cs.CL 70%

MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence

MMSI-Bench:多图像空间智能基准

Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学) University of Hong Kong(香港大学) Beijing Normal University(北京师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MMSI-Bench基准,通过1000道精心设计的VQA问题评估多图像空间推理能力,发现现有模型准确率远低于人类。

Comments ICLR 2026 Camera ready. 38 pages. Project page: https://runsenxu.com/projects/MMSI_Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25784 2026-05-26 cs.CV cs.MM 67%

VertiCue-Bench: Diagnosing Whether MLLMs Use Height Cues to Resolve 2D Ambiguity in Remote Sensing Natural Scenes

VertiCue-Bench: 诊断多模态大语言模型是否利用高度线索解决遥感自然场景中的二维歧义

Jing Huang, Duanchu Wang, Junjie Yang, Zihang Cheng, Cheng Li, Lin Cui, Zhouyi Wu, Di Wang

机构 * Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出VertiCue-Bench基准,通过17个任务1534个实例诊断MLLMs是否真正利用冠层高度模型(CHM)的垂直线索解决遥感自然场景中的语义歧义,发现模型在感知高度线索与语义推理之间存在显著脱节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25364 2026-05-26 cs.CV 67%

Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning

MLLMs 能否超越语言进行推理?VisReason:一个面向视觉中心推理的综合基准

Longteng Guo, Yifan Wang, Pengkang Huo, Tailai Chen, Yuze Wu, Jing Liu, Xinxin Zhu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出 VisReason 基准,包含 1505 个日常场景问题,评估多模态大模型在视觉中心推理上的表现,揭示人类与模型间的显著差距。

Comments Accepted by ACL 2026 Findings, resources released at https://github.com/CASIA-IVA-Lab/VisReason

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25285 2026-05-26 cs.SE 67%

PR-Aware Automated Unit Test Generation: Challenges and Opportunities

PR感知的自动化单元测试生成:挑战与机遇

Vahid Haratian, Atakan Akar, Berk Çakar, Eray Tüzün

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究评估了EvoSuite和GPT-4o在拉取请求(PR)级别生成测试用例的能力,发现两者均难以有效生成捕获变更的测试,但EvoSuite优于GPT-4o,并指出智能体代码生成方法具有潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25007 2026-05-26 cs.IR 67%

Meta-Modal Agent: Sequential Evidence Routing for Missing-Modality Candidate Reranking

元模态智能体:面向缺失模态候选重排序的序列证据路由

Jinze Wang, Yangchen Zeng, Tiehua Zhang, Lu Zhang, Yuze Liu, Zhishu Shen, Jiong Jin, Zhu Sun

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出元模态智能体(MMA),将缺失模态问题转化为序列证据路由任务,通过基于大语言模型的候选池重排序器,结合平衡缺失任务强化学习,在冷启动场景下显著提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24134 2026-05-26 cs.MA 67%

ProofAgent Harness: Open Infrastructure for Adversarial Evaluation of AI Agents

ProofAgent Harness:用于AI智能体对抗性评估的开放基础设施

Fouad Bousetouane

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出ProofAgent Harness开放基础设施,通过对抗性多轮试验、轨迹捕获和多评委评分,实现可扩展、可审计的AI智能体对抗性评估。

Comments 48 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26074 2026-05-26 cs.CL cs.AI q-fin.GN 62%

StakeBench: Evaluating Language Understanding Grounded in Market Commitment

StakeBench: 评估基于市场承诺的语言理解

Yunhua Pei, Jingyu Hu, Yiwei Shi, Hongnan Ma, Weiru Liu, John Cartlidge

机构 * University of Bristol(布里斯托大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出StakeBench框架,通过将市场评论与可验证的交易记录关联,从市场行为中自动生成监督信号,评估语言模型对市场承诺的理解能力。

Comments 21 pages, 2 figures, 20 tables. Preprint. Dataset and evaluation code included

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26036 2026-05-26 cs.AI cs.LG 62%

CITYREP: A Unified Benchmark for Urban Representations Across Cities, Tasks, and Modalities

CITYREP:跨城市、任务和模态的城市表示统一基准

Junyuan Liu, Xinglei Wang, Zichao Zeng, Jiazhuang Feng, Quan Qin, Ilya Ilyankou, Guangsheng Dong, Tao Cheng

机构 * SpaceTimeLab, University College London, UK(伦敦大学空间时间实验室) DIMPact, University College London, UK(伦敦大学3DIMPact实验室) School of Resource and Environmental Sciences, Wuhan University, China(武汉大学资源与环境科学学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University, China(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出CityRep基准,通过空间结构划分评估城市表示在不同模态、城市和任务上的性能,解决随机划分导致的空间泄漏和性能膨胀问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25502 2026-05-26 cs.CL cs.AI 62%

A Controlled Synthetic Benchmark for Educational Aspect-Based Sentiment Analysis

面向教育方面情感分析的可控合成基准

Yehudit Aperstein, Alexander Apartsin

机构 * Intelligent Systems, Afeka Academic College of Engineering(阿法卡学术工程智能系统学院) School of Computer Science, Faculty of Sciences, Holon Institute of Technology(霍洛技术学院计算机科学学院)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 为解决教育领域标注数据稀缺问题,提出一个包含10,000条合成课程评论和20个教学方面的可控合成基准,并通过实验验证了任务难度及合成到真实的迁移能力。

Comments 39 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10921 2026-05-26 cs.CV cs.AI cs.LG 62%

FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model

FG-CLIP 2: 一种双语细粒度视觉-语言对齐模型

Chunyu Xie, Bin Wang, Fanjing Kong, Jincheng Li, Dawei Liang, Ji Ao, Dawei Leng, Yuhui Yin

机构 * AI Research(360人工智能研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出FG-CLIP 2双语视觉语言模型,通过区域-文本匹配、长描述建模和文本内模态对比损失等细粒度监督,在英中双语上实现细粒度对齐,在29个数据集上取得最优结果。

Comments Accepted in ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25166 2026-05-26 cs.LG cs.AI 62%

AME-TS: Anchored Mixture-of-Experts for Time Series Forecasting

AME-TS:基于锚定的混合专家模型用于时间序列预测

Rui Wang, Renhao Xue, Ray Razi, Huan Song, Hannah R. Marlowe

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出AME-TS,一种结构引导的稀疏时间序列基础模型,通过轻量级预测器估计序列级描述符并生成专家软结构先验,实现专家路由与可解释时间结构对齐,在GIFT-Eval基准上实现精度-效率权衡,并在M5微调中展现更稳定的专家专业化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03675 2026-05-26 cs.AI cs.CL cs.IR 62%

OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search

OASES:面向智能搜索的结果对齐搜索-评估协同训练

Erhan Zhang, Yiqun Chen, Zechun Niu, Wei Yang, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) University of Southern California(南加州大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出OASES框架,通过结果对齐的过程奖励和搜索-评估协同训练,解决智能搜索中奖励稀疏和过程监督不可靠的问题,在多跳问答基准上优于强强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24728 2026-05-26 cs.AI 57%

Hylos: Operability Contracts for Model-Native Spatial Intelligence

Hylos: 面向模型原生空间智能的可操作性契约

Christopher Da Silva

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出Hylos系统架构,通过契约约束和空间事务管理,确保生成或编辑的3D内容具备可操作性,支持CAD、机器人等下游应用。

Comments 27 pages, 7 figures. Systems/position preprint with focused artifact study

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25517 2026-05-26 cs.AI 57%

What Gets Cited: Competitive GEO in AI Answer Engines

什么被引用:AI 问答引擎中的竞争性生成式引擎优化

Rahul Vishwakarma, Shushant Kumar, Ratnesh Jamidar

机构 * Sprinklr

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 研究 AI 问答引擎中两个检索候选源竞争时,哪些因素决定哪个源被优先引用,通过控制实验发现主题相关性和列表位置是主要驱动因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22892 2026-05-26 q-fin.RM cs.LG 57%

Is TabPFN the Silver Bullet for Insurance Pricing?

TabPFN 是保险定价的银弹吗?

Bruno Deprez, Wouter Verbeke, Tim Verdonck

机构 * KU Leuven University of Antwerp-imec(根特大学安特卫普-imec) KU Leuven(根特大学) University of Antwerp-imec(安特卫普大学-imec)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文首次实证评估 TabPFN 在车险定价中的表现,与 GLM 和 XGBoost 对比,发现其性能不稳定、推理时间长且对上下文训练集大小敏感,目前无法替代传统精算方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19333 2026-05-26 cs.CL cs.IR cs.SI 57%

PerSoMed: A Large-Scale Balanced Dataset for Persian Social Media Text Classification

PerSoMed:用于波斯社交媒体文本分类的大规模平衡数据集

Isun Chehreh, Ebrahim Ansari

机构 * Institute for Advanced Studies in Basic Sciences (IASBS)(基础科学基础研究 institute)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 该研究构建了首个大规模平衡的波斯社交媒体文本分类数据集,包含9个类别共36,000条帖子,并基于BiLSTM、XLM-RoBERTa、TookaBERT等模型进行基准测试,其中TookaBERT-Large取得了最佳性能(F1分数0.9621)。

Comments 10 pages, including 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05289 2026-05-26 hep-ph cs.LG hep-ex physics.ins-det 57%

A universal vision transformer for fast calorimeter simulations

一种用于快速量热器模拟的通用视觉变换器

Luigi Favaro, Andrea Giammanco, Claudius Krause

机构 * Centre for Cosmology, Particle Physics(宇宙学、粒子物理与现象学研究中心) Marietta Blau Institute for Particle Physics (MBI Vienna), Austrian Academy of Sciences (ÖAW), Austria(玛丽埃塔·布劳粒子物理研究所(MBI维也纳),奥地利科学院(ÖAW),奥地利)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 本研究基于CaloDREAM架构,提出使用视觉变换器(ViT)进行快速量热器模拟,在规则和不规则几何结构及多个探测器上均表现出高精度和可扩展性,生成时间在单GPU上为10-100毫秒,并通过预训练和微调降低了训练成本并提高了数据效率。

Comments 44 pages, 17 figures, 8 tables; journal version. Mach. Learn.: Sci. Technol (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22827 2026-05-26 cs.CV cs.LG 57%

FairJudge: Abstention-Aware Multimodal Judges for Fairness and Alignment Evaluation in Text-to-Image Models

FairJudge: 文本到图像模型中公平性与对齐评估的弃权感知多模态裁判

Zahraa Al Sahili, Maimuna Nowaz, Maryam Fetanat, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦玛丽女王大学) Institut Jožef Stefan(乔泽夫·斯蒂芬研究所) Imperial College London(伦敦帝国学院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.LG

AI总结 提出FairJudge协议,利用多模态大语言模型作为结构化裁判,通过封闭标签、弃权机制和证据报告,在文本到图像模型中实现社会属性预测、职业定位和提示-图像对齐的公平性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22143 2026-05-26 cs.CL 57%

Benchmarking and Learning Real-World Customer Service Dialogue

基准测试与学习真实世界客服对话

Tianhong Gao, Jundong Shen, Jiapeng Wang, Bei Shi, Ying Ju, Junfeng Yao, Huiyu Yu

机构 * ByteDance, Beijing, China(字节跳动,北京,中国)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 针对工业智能客服与真实对话需求脱节的问题,提出OlaBench基准和OlaMind模型,通过蒸馏专家推理模式与分阶段强化学习,在OlaBench上超越GPT-5.2和Gemini 3 Pro,在线A/B测试中问题解决率提升23.67%,人工转接率降低6.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02900 2026-05-26 cs.CR cs.AI cs.CV cs.RO 57%

Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses

具身人工智能的安全性:风险、攻击与防御综述

Xiao Li, Xiang Zheng, Yifeng Gao, Xinyu Xia, Yixu Wang, Xin Wang, Ye Sun, Yunhan Zhao, Ming Wen, Jiayu Li, Zixing Chen, Xun Gong, Yi Liu, Yige Li, Yutao Wu, Cong Wang, Jun Sun, Yixin Cao, Zhineng Chen, Jingjing Chen, Tao Gui, Qi Zhang, Zuxuan Wu, Xipeng Qiu, Xuanjing Huang, Tiehua Zhang, Zhipeng Wei, Kun Wang, Xinfeng Li, Hanxun Huang, Sarah Erfani, James Bailey, Jianping Wang, Chaowei Xiao, Ran He, Bo Li, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学) Jilin University(吉林大学) Singapore Management University(新加坡管理大学) Deakin University(德肯大学) Tongji University(同济大学) Nanyang Technological University(南洋理工大学) Chinese Academy of Sciences(中国科学院) The University of Melbourne(墨尔本大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文综述了具身AI在感知、认知、规划、行动及交互全流程中的安全风险、攻击与防御方法,提出了多层次分类体系,并指出了多模态感知融合脆弱性、规划不稳定及人机交互可信度等关键挑战。

Comments Survey paper; 75 pages, 4 figures, 18 tables; v2 expands embodied-specific coverage of agentic threats, World Action Model threats, and contextual risk mitigation, with over 100 new references added. Project page: https://x-zheng16.github.io/Awesome-Embodied-AI-Safety/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24279 2026-05-26 cs.CL cs.SE 57%

ContextEcho: A Benchmark for Persona Drift in Long Agentic-Coding Sessions

ContextEcho: 长智能编码会话中角色漂移的基准测试

Xianzhong Ding, Yangyang Yu, Changwei Liu, Bill Zhao

机构 * Center for Advanced AI(先进人工智能中心)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出ContextEcho基准测试,通过25探针身份套件和快照-探针协议,测量部署规模下长编码会话中语言模型角色漂移的普遍性、压缩影响及下游效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23921 2026-05-26 cs.CY cs.AI 57%

Authority Signals in Claude AI Health Citations: A Descriptive Analysis Using the Authority Signals Framework

Claude AI 健康引用中的权威信号:基于权威信号框架的描述性分析

Erin T. Jacques, Erela Datuowei, Elizabeth Quaye, Corey H. Basch, Arijit Chatterjee, Juanita Davis

机构 * Department of Health and Human Performance, York College, The City University of New York(健康与人类绩效系,约克学院,纽约市立大学) Department of Health Studies & Applied Educational Psychology, Teachers College, Columbia University(健康研究与应用教育心理学系,哥伦比亚大学教师学院) Department of Accounting and Finance, York College, The City University of New York(会计与金融系,约克学院,纽约市立大学) Department of Public Health, William Paterson University(公共卫生系,威廉·帕特森大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本研究使用权威信号框架,分析 Anthropic 的 Claude AI 在回答消费者健康问题时引用来源的权威信号,发现机构来源占主导地位(97.8%),并建立了 Claude 引用行为的基线。

Comments 10 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25973 2026-05-26 cs.SE 50%

From Early Adoption to Sustained Use: Understanding GenAI Usage Among Software Developers in Italian SMEs

从早期采用到持续使用:理解意大利中小企业中软件开发者的生成式AI使用

Fabio Calefato, Alexandra Pajonk, Victoria Jackson, Guilherme Vaz Pereira, Rafael Prikladnicki, Filippo Lanubile

专题命中 评测与基准 :prompting(abstract)

AI总结 本研究基于UTAUT2框架,通过纵向和横截面混合方法调查意大利中小企业开发者持续使用生成式AI工具的意图,发现个体层面因素(如生产力、享受和易用性)是主要驱动力,而社会和组织因素影响不显著。

Comments Under review at TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25730 2026-05-26 cs.CV 50%

DeCoDrift: Stabilizing Decoder Coupling in Closed-Loop Foundation Segmentation

DeCoDrift:闭环基础分割中的解码器耦合稳定化

H. M. Shadman Tabib, Md. Shamsuzzoha Bayzid, M Sohel Rahman

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :prompting(abstract)

AI总结 针对闭环迭代分割中解码器耦合漂移导致误差累积的问题,提出无需训练或真值监督的推理时稳定化框架DeCoDrift,通过约束提示更新和保持解码器耦合来提升注意力稳定性、时间一致性和分割质量。

Comments 18 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25653 2026-05-26 cs.DC cs.MA 50%

When Agents Control Robots: A Zero Trust Policy Model for Agentic Cyber-Physical Systems

当智能体控制机器人:面向智能体网络物理系统的零信任策略模型

Tharindu Ranathunga, Kavishka Fernando, Susan Rea

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对大型基础模型驱动的多智能体系统控制工业机器人带来的安全威胁,提出包含25个类型化原语的零信任策略模型ZTPM,并通过实验验证了在物理执行边界进行策略强制的必要性。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏