Mystra: Declarative Dynamic Taint Analysis via Shadow Virtual Machine
Mystra:通过影子虚拟机进行声明式动态污点分析
专题命中 安全评测 :trustworthy(abstract)
AI总结 研究针对解释型语言的动态污点分析问题,核心方法是引入影子虚拟机并设计声明式污点规范语言Mystra,主要贡献是实现工具Shar,在准确性和性能上均有出色表现,如V8实例召回率高且零误报,运行时开销低。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
Mystra:通过影子虚拟机进行声明式动态污点分析
专题命中 安全评测 :trustworthy(abstract)
AI总结 研究针对解释型语言的动态污点分析问题,核心方法是引入影子虚拟机并设计声明式污点规范语言Mystra,主要贡献是实现工具Shar,在准确性和性能上均有出色表现,如V8实例召回率高且零误报,运行时开销低。
大型视觉-语言模型在SOTIF条件下2D目标检测的比较评估
机构 * Institute of Automotive Engineering, Graz University of Technology(汽车工程研究所,格拉茨技术大学)
专题命中 安全评测 :safety(abstract)
AI总结 本文评估了大型视觉-语言模型在SOTIF条件下2D目标检测的性能,发现其在复杂场景中召回率显著优于传统方法,但几何精度仍有一定优势。
Comments 8 pages, 11 figures
GTASA:用于视频模型空间时间分析、评估和训练的地面真实标注
机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) ; National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出GTASA,一种包含多主体视频的标注数据集,通过空间关系图和事件级时间映射,验证了其在视频模型训练和评估中的优势。
利用大语言模型评估网络应用的可信度
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文提出利用大语言模型自动评估网络应用的可信度,通过比较不同提示工程技术,提出基于逻辑偏好分数的分层质量模型,实验表明规则提示能提高评估可靠性。
Comments Accepted for publication in the 19th IEEE International Conference on Software Testing, Verification and Validation (ICST) 2026
SOLAR:用于对称多模态检索的自监督联合学习
机构 * Ant Group(蚂蚁集团)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出SOLAR框架,通过自监督学习解决对称多模态检索问题,利用未标记数据提升模型性能,实验显示其在基准测试中优于现有方法。
Comments Accepted by ICML 2026. Code, model and benchmark are available at https://github.com/codefuse-ai/SOLAR
ProAct:用于结构感知主动响应的基准和多模态框架
机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST), Hong Kong SAR, China(香港科技大学计算机科学与工程系) ; Tencent, Shenzhen, China(腾讯(中国深圳)) ; Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究所(SIAT),中国科学院)
专题命中 安全评测 :safety(abstract)
AI总结 针对主动智能体开发受资源缺乏阻碍的问题,引入ProAct-75基准,提出由多模态大语言模型驱动的ProAct-Helper,其利用任务图进行行动选择,实验证明该方法在触发检测等方面优于闭源模型。
TIIF-Bench:你的文本到图像模型如何遵循指令?
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Tsinghua University(清华大学) ; OPPO Research Institute(OPPO研究院)
专题命中 安全评测 :alignment(abstract)
AI总结 研究旨在评估T2I模型遵循指令能力,提出TIIF-Bench基准,含多维度、多难度提示及新评估指标,利用大语言模型知识开发可重现评估器,通过对主流模型测试分析其优缺点及现有基准局限性。
Comments 35 pages, 14 figures, 9 tables
诊断视觉语言模型中由损坏引起的可靠性故障
机构 * City University of Macau(澳门城市大学) ; Nanyang Technological University(南洋理工大学) ; Jiangxi University of Finance and Economics(江西财经大学)
专题命中 安全评测 :alignment(abstract)
AI总结 研究视觉损坏对视觉语言模型行为的影响,引入Bench-C测试平台及稳健对齐分数(RAS),通过对13个VLM实验发现轻度损坏会提高top-1准确率却降低预测结构,支持超越最终答案的稳健性评估。
Comments 14 pages
基于信号监视的水下声源检测与分类:音频数据集整理与跨域评估
机构 * Department of Electrical and Computer Engineering, Drexel University(德雷塞尔大学电气与计算机工程系)
专题命中 安全评测 :alignment(abstract)
AI总结 为解决水下声学标注数据稀缺问题,从开源海事声音档案中整理出包含8类生物和机械声学标签的数据集,并提出带特征对齐的边界增强损失CNN基线,在域内准确率96.35%的同时,零样本舰船检测提升42.60%。
Comments 6 pages, 4 figures. Accepted to the 2026 International Conference on Advanced Visual and Signal-Based Systems (AVSS) - Lecce, Italy
HUGE-Bench: 面向高级无人机视觉-语言-动作任务的基准测试
机构 * The University of Melbourne(墨尔本大学) ; Melsy Tech(Melsy科技) ; MBZUAI ; Navlyn ; The University of Sydney(悉尼大学)
专题命中 安全评测 :safety(abstract)
AI总结 提出HUGE-Bench基准,通过4个数字孪生场景和8个高级任务,评估无人机在简洁语言指令下执行安全、过程导向的复杂轨迹能力,并引入过程导向和碰撞感知指标,揭示现有VLA模型在高级语义完成和安全执行上的显著差距。
CTForensics:用于人工智能生成的CT图像检测的综合数据集和方法
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) ; CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究中心) ; Sangfor Technologies Inc.(深信服技术有限公司)
专题命中 安全评测 :safety(abstract)
AI总结 研究针对人工智能生成CT图像检测难题,介绍含75990张二维CT图像的CTForensics数据集及十种生成模型样本,提出ESF-CTFD框架,实验表明该框架性能优且抗干扰强。
Comments under review, repo: https://github.com/liyih/CTForensics
IRG-MotionLLM:用于文本到运动生成的交织运动生成、评估和细化
机构 * Sun Yat-sen University(中山大学) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; Shenzhen Loop Area Institute(深圳河套学院) ; Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)
专题命中 安全评测 :alignment(abstract)
AI总结 研究揭示运动评估和细化任务可促进知识流动,提出通过迭代文本-运动对话将运动生成与评估、细化紧密结合的新范式,介绍IRG-MotionLLM及训练方案,构建数据引擎,实验证明其性能。
Comments Accepted by ECCV 2026
智能服务计算
专题命中 安全评测 :alignment(abstract)
AI总结 探讨服务计算范式转变带来的新问题,基于现有研究基础,引入智能服务计算,扩展服务计算范畴,为未来服务生态系统奠定以服务为中心的基础,实现对自治代理的系统管理。
CoDoL:用于分布外泛化的条件域提示学习
机构 * East China Normal University(东华师范大学) ; Xidian University(西安电子科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; The University of Oxford(牛津大学) ; Tsinghua University(清华大学)
专题命中 安全评测 :alignment(abstract)
AI总结 针对基于提示的CLIP方法存在的文本描述不准确、视觉语言嵌入对齐有限问题,提出CoDoL方法,利用域信息形成提示,还提出DMN生成输入条件令牌,实验验证其在分布外泛化的有效性。
Comments Accepted to TMLR 2026
REConnect:面向社会可持续性的参与式需求工程
专题命中 安全评测 :alignment(abstract)
AI总结 介绍REConnect这一以人类为中心的参与式需求工程框架,通过对多个社区软件项目分析得出,阐述了三项核心原则及行动,强调人际联系是社会可持续性需求工程基础,讨论其与AI支持的整合。
Comments 22 pages
图像传感器电磁信号注入攻击的仿真框架
机构 * The Hong Kong Polytechnic University(香港理工大学) ; The Education University of Hong Kong(香港教育大学) ; Simon Fraser University(西蒙弗雷泽大学)
专题命中 安全评测 :safety(abstract)
AI总结 针对图像传感器电磁信号注入攻击,通过建模开发仿真框架生成合成对抗图像,可快速评估算法漏洞,对抗训练能提升算法鲁棒性,为缓解攻击威胁提供实用路径。
Comments 20 pages, 9 figures, 6 tables
Journal ref 31st European Symposium on Research in Computer Security 2026
Omni-DuplexEval: 评估实时双工全模交互
机构 * Tsinghua University(清华大学) ; Tongji University(同济大学) ; ModelBest Inc.(ModelBest公司)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出Omni-DuplexEval基准,用于系统评估实时双工交互能力,通过两个互补场景评估模型生成连续响应和主动提醒的能力,并揭示现有模型在平衡响应及时性和内容连贯性方面的局限性。
Comments 21 pages, 6 figures
LLM能否可信地转换来自不同历史表格的面板数据?
专题命中 安全评测 :alignment(abstract)
AI总结 提出基于多模态LLM的管道,以低成本从历史表格中提取面板数据,在车辆登记数据上达到95.4%精确匹配率,成本仅为传统方法的1/50。
SegFly:大规模航空RGB-热红外语义分割的数据集与2D-3D-2D范式
机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) ; TU Munich(慕尼黑工业大学) ; MCML(慕尼黑机器学习中心) ; UCLA(加州大学洛杉矶分校) ; Uni Cambridge(剑桥大学)
专题命中 安全评测 :alignment(abstract)
AI总结 针对航空RGB-T数据集规模小、标注成本高和对齐困难的问题,提出几何驱动的2D-3D-2D范式,通过少量RGB标注自动生成密集伪标签并实现跨模态对齐,构建含2万+RGB图像和1.5万+RGB-T对的SegFly基准,实验表明该范式有效提升分割性能。
Journal ref ECCV 2026
人工智能用于软件架构:文献综述与未来之路
专题命中 安全评测 :trustworthy(abstract)
AI总结 通过系统文献综述,识别AI在软件架构中应用的14个主题领域和6个AI特有挑战,并基于实证访谈提出五大战略支柱的研究路线图。
Comments 37 pages, accepted for publication in TOSEM
HunyuanImage 3.0 技术报告
专题命中 安全评测 :alignment(abstract)
AI总结 HunyuanImage 3.0是一种统一多模态理解与生成的自回归模型,通过精心数据整理、先进架构、原生思维链、渐进预训练和激进后训练,训练出超800亿参数MoE模型(推理时激活130亿),在文本-图像对齐和视觉质量上媲美最先进模型,并开源代码和权重。
MSPL: 用于开放词汇目标检测的多步伪标签方法
机构 * KAIST AI(韩国韩世大学AI研究所) ; Boston University(波士顿大学)
专题命中 安全评测 :alignment(abstract)
AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。
Comments This paper has been accepted by ECCV 2026
无线副驾驶:一个AI驱动的合作伙伴,用于驾驭下一代无线复杂性
专题命中 安全评测 :trustworthy(abstract)
AI总结 提出“无线副驾驶”框架,通过集成大语言模型与认知架构,将人类意图转化为精确的网络操作,以管理6G的复杂性,并在低空无线网络中验证其有效性。
MalSkillBench: 一个运行时验证的恶意智能体技能基准
专题命中 安全评测 :prompt injection(abstract)
AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。
AlignDrive: 用于端到端自动驾驶的对齐横向-纵向规划
机构 * School of Software Engineering, XJTU(软件工程学院,西安交通大学) ; Horizon Robotics ; Shenzhen Loop Area Institute(深圳河套学院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 安全评测 :safety(abstract)
AI总结 本文提出一种 cascaded 框架,通过将纵向规划转化为路径条件推理过程,提升自动驾驶的协调性和安全性。方法引入锚点回归设计和规划导向的数据增强策略,实现在 Bench2Drive 上达到 SOTA 性能。
Comments underreview
ReMoBot: 基于检索的少样本模仿学习用于移动操作与视觉基础模型
机构 * School of Electrical Engineering, Aalto University, Espoo, Finland(艾尔沃大学电气工程学院,埃斯波,芬兰)
专题命中 安全评测 :alignment(abstract)
AI总结 提出ReMoBot,一种基于检索的少样本模仿学习框架,利用视觉基础模型从演示中检索信息,解决移动操作任务中的部分可观测性和数据有限问题,在真实世界任务中取得高成功率。
生成式机器智能中的因果幻象均衡
专题命中 安全评测 :alignment(abstract)
AI总结 针对生成式机器智能中语义表征与物理现实脱钩的问题,提出风险敏感平均场型因果幻象均衡(CME),证明其存在性并揭示内生强化主导时非因果状态的稳定分岔。
Comments 10 pages, 1 figure. References double-checked manually
CrossAlpha: 跨市场因子研究的年报基准
专题命中 安全评测 :alignment(abstract)
AI总结 提出CrossAlpha基准,通过披露蒸馏、残差模式图构建和时序对齐评估,解决跨市场因子研究中披露到收益评估的挑战。
MVAD:多模态AI生成视频-音频检测基准数据集
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 安全评测 :trustworthy(abstract)
AI总结 针对现有数据集缺乏多模态真实性的问题,提出MVAD数据集,包含三种伪造模式、高质量样本及多样化的视觉风格和内容类别,用于检测AI生成的视频-音频内容。
Comments 10 pages,2 figures
水下物联网的语义通信:架构、应用、挑战与未来方向
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文综述了语义通信在水下物联网中的应用,探讨了其架构、学习驱动方法及代表性应用,并指出了关键研究方向,旨在提升资源受限水下网络的通信效率。
Comments 33 pages, 10 figures, and 9 tables. The paper is submitted to IEEE for Possible Publication