arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2719 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 984 篇

2607.12089 2026-07-15 cs.CR cs.SE 新提交 50%

Cross-Cutting Security Analysis of LLM-Generated Code via Metamorphic Testing and Association Rule Mining

通过变形测试和关联规则挖掘对大语言模型生成代码进行横切安全分析

Zedong Peng, Chenggang Wang, Shangyue Zhu

专题命中 安全评测 :safety(abstract)

AI总结 研究针对LLM生成代码的安全漏洞,提出结合变形测试与关联规则挖掘的框架,定义九个MRs并应用于3700个代码片段,揭示共同违反结构与横切模式,还进行提示级风险分析,发现不安全代码生成具结构化和提示依赖性,推动相关验证与干预。

Comments This work has already been accepted by IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12068 2026-07-15 cs.SE 新提交 50%

Beyond Test Presence: Assessing the Quality and Robustness of Agent-Generated Tests in Open-Source Projects

超越测试存在:评估开源项目中代理生成测试的质量和稳健性

Preet Jhanglani, Zeel Kaushal Desai, Vidhi Kansara, Eman Abdullah AlOmar

专题命中 安全评测 :safety(abstract)

AI总结 研究开源项目中代理生成测试的质量和稳健性,通过对大量测试工件进行实证比较,用“白盒”静态分析框架评估质量维度,发现代理在边缘情况覆盖率上优于人类,但生成测试更易脆弱,揭示其缺乏编写稳定测试的“环境意识”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11732 2026-07-14 cs.CV 新提交 50%

GFR-SAM: Training-Free Referring Camouflaged Object Segmentation via Cross-Image Prompting

GFR-SAM:通过跨图像提示实现免训练的指认伪装物体分割

Yilong Yang, Jianxin Tian, Shengchuan Zhang, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,教育部,厦门大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究指认伪装物体分割问题,提出GFR-SAM三阶段免训练框架,通过生成候选掩码、过滤背景干扰、细化边界等步骤,在R2C7K基准测试中表现出色,弥合通用模型与特定感知任务差距,凸显SAM3跨图像提示潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11199 2026-07-14 cs.CV 新提交 50%

DynEval: Holistic Evaluations of T2I Generative Models in the Wild

DynEval:对自然环境下的文本到图像生成模型进行全面评估

Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane, Akhil Sakthieswaran, Sayak Paul, Anirban Chakraborty

机构 * Indian Institute of Science(印度科学研究所) Hugging Face(拥抱脸)

专题命中 安全评测 :alignment(abstract)

AI总结 研究针对文本到图像生成模型评估难题,提出DynEval动态评估框架,通过构建两个数据集,利用课程学习策略微调评估器,在多基准测试中与人类判断相关性更高,可对多个T2I模型进行细粒度分析。

Comments Accepted at ECCV 2026. Project page: https://vcl-iisc.github.io/dyneval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10796 2026-07-14 cs.CV 新提交 50%

Mixture of Cognitive Experts in Large Vision-Language Models

大型视觉语言模型中的认知专家混合体

Robert Wijaya, Ngai-Man Cheung

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究大型视觉语言模型中多编码器专家整合难题,提出证据驱动的多模态推理框架,利用布鲁姆分类法及两阶段认知语言化,改进感知和推理能力,实现细粒度分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09583 2026-07-13 cs.CV 新提交 50%

Promptable Concept Segmentation from Above: Evaluating SAM 3's Zero-Shot and One-Shot Capabilities in Remote Sensing

从上方进行可提示的概念分割:评估SAM 3在遥感中的零样本和单样本能力

Mohammad Dabaja, Turgay Celik

机构 * University of Agder(阿格德大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究在严格零样本和单样本约束下,对SAM 3在遥感场景分类等任务中的能力进行评估。核心方法是对SAM 3结构调整并隔离提示模态来诊断对齐机制,还制定代理评估协议。主要贡献是揭示跨模态干扰,表明SAM 3避免过拟合但受分辨率等限制,指明微调方向。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09016 2026-07-13 cs.CR cs.SE 新提交 50%

SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills

SLBench:评估大语言模型智能体在技能中遵循逻辑关系的情况

Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang

专题命中 安全评测 :safety(abstract)

AI总结 研究评估大语言模型智能体遵循逻辑关系情况,引入SkillLogic框架,构建SLBench基准,扫描超500个公共技能,评估发现不安全率高,人工审核分析失败原因,还表明SLGuard可减少违规,确立遵循逻辑关系是技能引导智能体的可靠性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08397 2026-07-10 cs.CV 新提交 50%

Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation

用于开放词汇量内镜组合式指称分割的属性检索

Shun Liu, Nan Xi, Yang Liu, Tianyu Luan, Xuan Gong, David Doermann

机构 * Virginia Commonwealth University(弗吉尼亚联邦大学) King’s College London(伦敦国王学院) University at Buffalo(纽约州立大学布法罗分校) Harvard Medical School(哈佛医学院)

专题命中 安全评测 :alignment(abstract)

AI总结 该研究针对内镜图像指称分割面临的挑战,引入ReferEndoscopy基准,提出AR-ERIS框架,利用属性检索进行开放词汇量内镜组合式指称分割,在模拟和真实内镜数据上实现最优性能且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08274 2026-07-10 cs.HC cs.SE 新提交 50%

How Analysts Use AI in High-Stakes Crime Linkage: An Industrial Study

分析师如何在高风险犯罪关联中使用人工智能:一项行业研究

Jessica Woodhams, Amy Burrell, Wanyin Li, Fahim Ahmed, Matthew Tonkin, Jan Lemeire, Arkady Konovalov, Steven Frisson, Mark Webb, Sarah Galambos, Vesna Nowack, Dalal Alrajeh

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究探讨分析师在高风险犯罪关联中如何用AI,通过与英国执法机构合作开发工具并进行混合方法可用性研究,发现分析师有选择地用AI预测且常验证,还关注模型特征,强调AI决策支持工具要整合解释与传统方法及现场评估的重要性。

Comments 12 pages, 6 figures, FSE Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08267 2026-07-10 cs.CV 新提交 50%

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

UniRef-UAV:无人机图像通用指称的多模态基准测试

Haibin Tian, Huichao Xie, Xuelin Qian, Ruitao Lu, Junwei Han, Dingwen Zhang

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) College of Missile Engineering, Rocket Force University of Engineering(导弹工程学院,火箭兵工程大学) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)

专题命中 安全评测 :alignment(abstract)

AI总结 该研究针对无人机视觉定位面临的问题,引入通用指称任务,构建UniRef-UAV多模态基准测试,提出UAV-URNet检测式基线方法。实验表明该基线稳定可重复,多模态查询能减少模糊性,相关资源将公开助力可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07529 2026-07-09 cs.GT 新提交 50%

FedMark-FM: Auditable, Risk-Adjusted Data Markets for Federated Foundation-Model Adaptation

FedMark-FM:用于联邦基础模型适配的可审计、风险调整数据市场

Phat T. Tran-Truong, Xuan-Bach Le, Minh Nhat Nguyen

专题命中 安全评测 :safety(abstract)

AI总结 研究联邦基础模型适配中激励机制问题,提出FedMark-FM框架,将客户端视为工件卖家,用S3Val估计贡献,转换支付惩罚不良行为,经多任务评估表现出色,证明管道有序估值独特性,能在一定规模下保留专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07481 2026-07-09 cs.SE 新提交 50%

The Poisoned Chalice of LLM Evaluation Report

大语言模型评估报告的毒圣杯

Jonathan Katzy, Ali Al-Kaswan, Razvan Mihai Popescu, Zhou Yang

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究大语言模型评估中因数据污染致结果不可靠的问题,通过举办竞赛将污染检测设为白盒成员推理任务,提供相关资源,报告竞赛设置与结果,推动软件工程中可信大语言模型评估社区发展。

Comments Report of the competition hosted at FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03915 2026-07-09 cs.CV 新提交 50%

NavEYE: Vision-Centered Multi-Sensor Fusion-Based Situational Awareness System for Intelligent Surface Vehicles

NavEYE:用于智能水面舰艇的基于视觉的多传感器融合态势感知系统

Ryan Wen Liu, Junxiong Liang, Haoyu Wang, Mengwei Bao

机构 * Sanya Science and Education Innovation Park, Wuhan University of Technology(武汉理工大学三亚科教创新园) School of Navigation, Wuhan University of Technology(武汉理工大学航运学院) State Key Laboratory of Maritime Technology and Safety(船舶技术与安全国家重点实验室)

专题命中 安全评测 :safety(abstract)

AI总结 为实现智能水面舰艇在复杂环境中的高质量感知,开发以视觉为中心的多传感器融合系统NavEYE,提出多约束门控数据关联等方法,经实验验证其融合方法在多方面的优越性及对舰艇航行安全的促进作用。

Journal ref Ocean Engineering, Volume 363, Part 4, 2026, Article 126781

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06478 2026-07-08 cs.CV 新提交 50%

A VLM-Enhanced Framework for Comprehensive Traffic Sign Condition Assessment Integrating Daytime Visual Performance and Nighttime Retroreflectivity Evaluation

一种用于综合交通标志状况评估的VLM增强框架,集成白天视觉性能和夜间逆反射率评估

Linlin Zhang, Neema Jakisa Owor, Xiang Yu, Abby Watts, Yaw Adu-Gyamfi

机构 * Department of Civil and Environmental Engineering University of Missouri- Columbia(土木与环境工程系密苏里大学哥伦比亚分校)

专题命中 安全评测 :safety(abstract)

AI总结 研究开发用于综合评估交通标志状况的新框架,利用微调视觉语言模型评估白天视觉性能,结合激光雷达校准的逆反射率评估夜间性能,集成到标志状况指数,提供经济有效的评估方法,LLaVA和Qwen表现优,还标记出需更换的标志。

Comments 21 pages, 7 figures, 5 tables. Preprint. An earlier version of this work was presented at the 105th Annual Meeting of the Transportation Research Board (TRB), January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06118 2026-07-08 cs.CV cs.MM 新提交 50%

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

WebRetriever:用于高效网络智能体评估的大规模综合基准测试

Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

机构 * Mininglamp Technology(旷视科技) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所综合技术集成中心)

专题命中 安全评测 :alignment(abstract)

AI总结 针对现有网络智能体评估基准测试的局限,提出WebRetriever这一大规模综合基准测试,涵盖多领域网站和任务。采用NavEval框架及三个评估协议,实验揭示不同协议性能差异,为网络智能体研发提供细粒度见解和严谨基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06088 2026-07-08 cs.SD 新提交 50%

Flow Matching-Based Speech Source Separation with Best-of-N Biometric Sampling

基于最佳N生物特征采样的流匹配语音源分离

Anastasia Zorkina, Alexandr Anikin, Nikita Khmelev, Anastasiya Korenevskaya, Sergey Novoselov, Vladimir Volokhov, Maxim Korenevsky, Yuriy Matveev

机构 * NVIDIA(英伟达)

专题命中 安全评测 :alignment(abstract)

AI总结 针对单通道语音分离难题,提出基于条件流匹配的方法,训练时用冻结说话人编码器定义源顺序,推理时用于生物特征最佳N候选选择等,在Libri2Mix基准上评估,该方法在分离指标及下游任务中表现出色。

Comments Accepted at the ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05783 2026-07-08 cs.CV 新提交 50%

Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective

从车道感知角度评估自动驾驶对环境错觉的鲁棒性:基准测试

Tianyuan Zhang, Xianglong Liu, Aishan Liu, Lu Wang, Yitong Zhang, Peng Yue, Mingchuan Zhang, Siyuan Liang, Dacheng Tao

机构 * SKLCCSE, the School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院软件安全技术与工程北京市重点实验室) the School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络空间科学与技术学院) Henan University of Science and Technology(河南科技大学) the School of Computing, National University of Singapore(新加坡国立大学计算学院) College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 安全评测 :safety(abstract)

AI总结 研究自动驾驶对环境错觉的鲁棒性,聚焦传统车道检测和视觉语言模型系统。引入基准LanEvil++并评估,发现错觉严重影响性能,阴影干扰最大。提出多模态错觉防御方法MIDA,有效提升了模型在挑战性条件下的鲁棒性。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05625 2026-07-08 cs.CV 新提交 50%

Cross-Contextual Vision-Language Adaptation with LoRA for Personalized Severe Adverse Event Detection in Clinical Wound Monitoring

基于LoRA的跨上下文视觉语言适配用于临床伤口监测中的个性化严重不良事件检测

Aditi Naiknaware, Jian Sun, Aminreza Khandan, Shengyang Huang, Sean Dow, Bijan Najafi, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 安全评测 :alignment(abstract)

AI总结 研究针对临床伤口监测中严重不良事件检测问题,提出基于双流LoRA框架及跨上下文融合机制的多模态框架,结合多种方法识别个性化严重不良事件并捕捉愈合动态,在相关实验中展现良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05290 2026-07-07 cs.CV 新提交 50%

ChatImage: Navigating Long-Form LLM Answers through Interactive Images

ChatImage:通过交互式图像导航大语言模型的长文本回答

Wencan Jiang, Jiangning Zhang, Yong Liu

机构 * Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。

Comments Project:https://wencanjiang.github.io/ChatImage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05264 2026-07-07 cs.CV 新提交 50%

SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments

SteelBench:真实工业环境下的视觉语言模型评估基准

Suryanarayana Reddy Yarrabothula, Manisha Chawla, Kunal Sinha, Gagan Raj Gupta, Sashank Lekkala, Ashirvadhan Dosapati, Saikamal Nannuri, Katragadda Ajay RamaSwamy Chowdary Gowtham

机构 * Indian Institute of Technology Bhilai(印度理工学院比莱分校) Steel Authority of India Limited(印度钢铁管理局有限公司) VIT Vellore(维洛尔理工学院)

专题命中 安全评测 :safety(abstract)

AI总结 针对现有基准无法适配真实工业监控场景的问题,构建含1345条标注片段的SteelBench基准,评估视觉语言模型的工业活动识别、安全规则推理等能力,发现现有模型性能远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04761 2026-07-07 cs.CV 新提交 50%

DeGenseGS: Geometrically and Semantically Decoupled Surgical Scene Understanding in 4D Gaussian Splatting

DeGenseGS:4D高斯点云渲染中几何与语义解耦的手术场景理解

Yimo Wang, Bin Kang, Shuojue Yang, Yueming Jin

机构 * School of Automation, Southeast University(东南大学自动化学院) School of Internet of Things, Nanjing University of Posts and Telecommunications(南京邮电大学物联网学院) Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系)

专题命中 安全评测 :alignment(abstract)

AI总结 研究针对自主手术交互中语义与解剖错位问题,提出DeGenseGS框架,独立建模语义演变与几何变形,用时空纠缠模块同步语义与场景动态,还设计机制确保鲁棒性,提升了手术场景理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04199 2026-07-07 cs.CV 新提交 50%

Topology-Driven Transferability Estimation for 3D Medical Vision Foundation Models

用于3D医学视觉基础模型的拓扑驱动可迁移性估计

Jiaqi Tang, Shaoyang Zhang, Fandong Zhang, Shu Zhang, Yang Liu, Qingchao Chen

机构 * National Institute of Health Data Science, Peking University(北京大学健康数据科学研究所) Institute of Medical Technology, Peking University(北京大学医学技术研究所) Deepwise Co., Ltd.(深度智医科技有限公司) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)

专题命中 安全评测 :alignment(abstract)

AI总结 针对医学视觉基础模型选择难题,提出非参数、拓扑驱动框架,通过最小生成树从密集特征与语义标签的稀疏1-骨架图对齐中估计可迁移性,包含局部和全局互补尺度,提升评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03792 2026-07-07 cs.RO cs.CV 新提交 50%

From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation

从视觉语言导航中的区域到达到实例级定位

Xiangyu Shi, Ruoxi Yang, Wei Tao, Jiwen Zhang, Yanyuan Qiao, Qi Wu

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Ruyi Dynamics(如意动力) Fudan University(复旦大学) Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士洛桑联邦理工学院)

专题命中 安全评测 :alignment(abstract)

AI总结 研究视觉语言导航中当前评估协议局限,提出‘最后3米定位差距’及指标,构建REALM模块和REVERIE - AIM数据集,可减少过早终止,提升定位精度和视觉定位成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03720 2026-07-07 cs.HC 新提交 50%

Between Knowledge and Care: A Mixed-Methods Evaluation of Generative AI for T2DM Self-Management from Patient and Physician Perspectives

知识与关怀之间:从患者和医生角度对用于2型糖尿病自我管理的生成式人工智能的混合方法评估

Ruiqi Chen, Yibo Meng, Huidi Lu, Xiaolan Ding

专题命中 安全评测 :safety(abstract)

AI总结 该混合方法研究从患者和医生角度评估用于2型糖尿病自我管理的生成式人工智能。通过分析患者查询、医生评分及访谈,发现模型优缺点,得出两个分析概念,为四个设计方向提供依据。

Comments arXiv admin note: text overlap with arXiv:2510.10048

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02642 2026-07-07 cs.RO 新提交 50%

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

GigaWorld-1:构建用于机器人策略评估的世界模型路线图

GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(巨元人工智能) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究机器人策略评估中世界模型,介绍WMBench基准,通过分析多种模型、方案及大量模拟策略展开,得出评估器质量受长期动作忠实性影响等核心见解,推导出设计路线图并实现GigaWorld-1。

Comments Project page: https://open-gigaai.github.io/giga-world-1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00874 2026-07-07 cs.RO cs.MA 新提交 50%

Beyond Line of Sight: Hybrid Validation of V2X Collective Perception in Complex Scenarios

超越视线:复杂场景中V2X集体感知的混合验证

Markos Antonopoulos, Anastasia Bolovinou, Bill Roungas, Elena Daskalaki, Angelos Amditis

机构 * European Union(欧盟)

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出一种概率框架和混合验证方法,通过贝叶斯融合算法扩展感知范围,在环形交叉口场景中实现视场覆盖增加260%,占用单元召回率从0.82提升至0.94。

Comments 6 pages, 4 figures, to be presented in ITS World 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12057 2026-07-07 stat.AP 新提交 50%

ChargeBD: Character-Aware Heterogeneous Agent Reasoning for Guided Engineering in Battery Development

ChargeBD:面向电池开发中引导工程的字符感知异构智能体推理

Rui Huang, Zekun Jiang, Mengran Hou, Xingyu Niu, Yuqiang Li, Qinying Gu, Tianhang Zhou

专题命中 安全评测 :safety(abstract)

AI总结 提出ChargeBD框架,通过MBTI启发的角色智能体矩阵,结合异构推理,解决液流电池多尺度多目标研发中的自适应问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02497 2026-07-03 cs.CV 新提交 50%

Seek to Segment: Active Perception for Panoramic Referring Segmentation

寻求分割:全景指代分割的主动感知

Song Tang, Shuming Hu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出主动全景指代分割任务,通过记忆增强智能体PanoSeeker结合视觉语言模型与空间记忆,实现高效搜索与分割。

Comments ECCV 2026, Project Page: https://henghuiding.com/APRS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02325 2026-07-03 cs.HC 新提交 50%

Personality Without Persons? A Psychometric Critique of Big Five Testing in Large Language Models

无人格的人格?大语言模型中大五人格测试的心理测量学批判

Kim Zierahn, Cristina Cachero, Anna Korhonen, Nuria Oliver

专题命中 安全评测 :alignment(abstract)

AI总结 通过心理测量学评估大语言模型的大五人格测试,发现其不适用于LLMs,无法捕捉模型间差异且因子结构失效,建议开发针对LLMs的评估框架。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01383 2026-07-03 cs.CV 新提交 50%

MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation

MIBE:面向个性化图像生成的多主体交互基准与评估器

Zhihan Chen, Yuhuan Zhao, Yijie Zhu, Xinyu Yao, Mengcong Ren, Suwen Wang, Qiuyang Yin, Yuchen Sun, Qin Wang, Lu Xin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) DeerLab LLC(DeerLab有限责任公司) Carnegie Mellon University(卡内基梅隆大学) Clemson University(克莱姆森大学) Google(谷歌) San Jose State University(圣何塞州立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(abstract)

AI总结 提出MIBE框架,包含多主体交互基准(MIB)和评估器(MIE),通过解耦数据体制和双头排序诊断目标,解决多主体个性化图像生成中主体遗漏、外观失配和交互错误问题,在黄金集上达到0.922成对准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏