arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-30 至 2026-07-30 共收录 66 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 22 篇

2607.26541 2026-07-30 cs.SD cs.CL 新提交 70%

Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis

音频大语言模型中基于韵律的越狱:一项对照研究与机制分析

Jiachen Qian, Junyu Li

机构 * City University of Hong Kong(香港城市大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 该研究通过控制文本内容改变语音传递预设构建评估协议与基准,发现特定韵律特征的语音能提升音频大语言模型的越狱成功率,表明语音传递是音频大语言模型安全评估的重要因素。

Comments Accepted at ACM Multimedia 2026 (ACM MM '26). 9 pages, 3 figures. Supplementary material included

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10-14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26886 2026-07-30 cs.CV cs.AI cs.CL cs.CY 新提交 69%

Hearsay: Vision-Language Medical Diagnoses Without an Image

Hearsay:无需图像的视觉-语言医学诊断

Siddharth Vohra

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services AI Native(亚马逊网络服务AI原生部门)

专题命中 安全评测 :trustworthy(abstract,comments);分类 cs.CL、cs.AI、cs.CY

AI总结 该研究发现前沿视觉-语言模型在无图像时会基于人口统计学特征编造医学诊断,存在不同失败模式,提出需直接审计其结构化输出通道并将探针词敏感性作为核心评估维度。

Comments Peer-reviewed and presented at the 1st Workshop on Toward Trustworthy Vision-Language Models in the Wild (TrustVLM), co-located with ACM ICMR 2026, Amsterdam. Non-archival workshop. Reviews public on OpenReview. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26066 2026-07-30 cs.CL cs.AI cs.DL 新提交 62%

Do Methods Support the Claims? Intra-Paper Verification for Peer Review

方法是否支持其主张?用于同行评审的论文内部验证

Ranjitha Shivaprasad Ballakuraya, Arash Mahyari, Ashok Srinivasan

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有 LLM 评审系统忽视论文内部主张与方法学证据不匹配的问题,提出 intra-paper claim verification 框架,经实验验证其生成的评审意见与人类评审关注点高度契合。

Comments 9 pages, 8 figures. Source code, prompts, evaluation materials, and supporting data available at https://github.com/Ranjitha2493/intra-paper-claim-method-verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23624 2026-07-30 cs.SE cs.AI cs.CL 版本更新 62%

Where Is the Cost of Third-Party API Routers in Agentic Software Development?

代理软件开发中第三方 API 路由器的成本在哪里?

Donghao Fu, Jingxin Li, Xue Jiang, Yihong Dong

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究第三方 API 路由器在代理软件开发中的影响,通过实证研究编码代理中路由器端注入的四个干预级别,开发 SIDEL 框架评估代理,发现路由器端干预难测,客户端缓解措施未完全恢复控制,强调需提供商端输出完整性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01527 2026-07-30 cs.SE cs.AI cs.LG 版本更新 62%

REAP: Automatic Curation of Coding Agent Benchmarks from Interactive Production Usage

REAP:从交互生产使用自动整理编码代理基准

Smriti Jha, Matteo Paltenghi, Chandra Maddila, Vijayaraghavan Murali, Shubham Ugare, Satish Chandra

机构 * Meta, USA(Meta公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 REAP通过自动化流程从真实开发者与代理交互中构建生产基准,解决评估信号不可靠问题,通过LLM分类和多轮稳定性检查确保基准可信。

Comments Accepted at ASE 2026 Industry Showcase

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26333 2026-07-30 eess.IV cs.CV cs.LG 新提交 57%

Rethinking Clinical Relevance in Chest X-ray Machine Learning: How Evaluation References Define Performance

重新思考胸部X射线机器学习中的临床相关性:评估参考如何定义性能

Panagiotis Fytas, Ian Selby, Clemens Karner, Judith Babar, Simon Baker, Jake Beckford, Timothy J. Sadler, Shahab Shahipasand, Arthikkaa Thavakumar, John Li Chen, Alex Sawer, Michael Roberts, Jonathan Weir-McCall, J. H. F. Rudd, Carola-Bibiane Schönlieb, Anna Korhonen, Anna Breger

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 该研究针对胸部X射线机器学习,探究评估参考选择对模型性能与排名的影响,发现常用指标与临床判断一致性差,强调需将评估参考选择作为临床有效性的核心部分。

Comments 67 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27084 2026-07-30 cs.CV cs.AI 新提交 57%

SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context

SciFigQual-Bench:面向全文本上下文的科学图片质量评估基准

Zihan Deng, Chuanzhi Xu, Huiqi Liang, Haoyang Li, Xiaozhen Zhong, Lequan Yu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文针对现有科学图片质量评估方法的不足,构建了SciFigQual-Bench基准,设计SFQ-Agent框架实现自动化评估,实验显示其在eval1200子集上表现优于主流方案。

Comments † Equal contribution. Affiliations: 1: The University of Hong Kong 2: The University of Sydney 3: University of Electronic Science and Technology of China Corresponding authors: Zihan Deng (zhdeng@hku.hk), Chuanzhi Xu (chuanzhi.xu@sydney.edu.au) Project page: https://frankdengai.github.io/SciFigQual-Bench Source code & dataset: https://github.com/FrankDengAI/SciFigQual-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25364 2026-07-30 cs.AI cs.SE 版本更新 57%

Explanation-Bound Tool Execution for AI Agents: Server-Verified Action Claims Without Trusting Model Rationales

人工智能代理的解释约束工具执行:无需信任模型原理的服务器验证动作声明

Genliang Zhu, Chu Wang

机构 * Accentrust(Accentrust公司) Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究针对人工智能代理工具执行问题,提出EBTE中介层,将原理内容转换为动作声明并经服务器检查。通过形式化和实现参考配置文件,经多场景验证其可行性与诊断价值,支持服务器检查动作声明而非其他相关特性。

Comments 25 pages, 1 figure, 15 tables. Revised presentation and synchronized evaluation details

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24241 2026-07-30 cs.CV cs.AI 版本更新 57%

FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

FilmBench:用于电影视频生成的电影级基准测试

Shengyi Wang, Niantong Li, Guangzheng Hu, Hong Qi, Fei Ding, Weixu Qiao, Jinlin Wang, Xiaotong Lv, Peng Han, Zimeng Li, Fanshu Ding, Yushu Wang, Han Wu, Jingjing Chen, Chongxiao Wang, Yanhao Wu, Chenglong Huang, Xiaoqian Zhu, Jie Tian, Hua Li, Jingjing Fan, Mingshuang Tang, Zhong Li, Hengxia Qiang, Weibin Chen, Jinyang Zhen, Bing Zhao, Lin Qu, Jing Li, Hu Wei

机构 * Alibaba Group(阿里巴巴集团) Moku Lab, Hujing Digital Media & Entertainment Group(魔氪实验室,虎鲸数字媒体与娱乐集团) Beijing Film Academy(北京电影学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 FilmBench是基于电影学院传统专业电影语言开发的文本到视频和参考到视频基准测试。它从获奖影片反向设计提示,依电影分类法评估,开发自动评估代理并开源核心套件,能再现人类模型排名,指出当前模型在动态美学等方面不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04607 2026-07-30 cs.CV cs.AI 版本更新 57%

G2VD: Generalizable AI-Generated Video Detection via Counterfactual Intervention and Causal Disentanglement

G2VD:通过反事实干预和因果解缠实现可泛化的人工智能生成视频检测

Meng Du, Hongchang Chen, Ran Li, Junjie Zhang, Qi Ouyang, Shibo Zhang, Shuxin Liu

机构 * Information Engineering University(信息工程大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对AI生成视频检测中因捷径学习导致跨域性能差的问题,提出G2VD框架,用反事实干预管道生成样本并对齐,设计因果解缠分类器,提升了跨域性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08334 2026-07-30 cs.CL 版本更新 57%

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

SalesSim:多模态语言模型作为零售用户模拟器的基准测试与对齐

Yada Pruksachatkun, Yixin Wan, Xingrun Chen, Kai-Wei Chang, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 SalesSim通过多轮多模态对话评估多模态大语言模型在模拟真实用户行为中的能力,发现模型在词汇多样性及决策一致性方面存在不足,并提出UserGRPO方法提升对话流畅度与决策对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07131 2026-07-30 cs.CV cs.AI 版本更新 57%

Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge

深度专家注入用于带有领域特定知识的视网膜视觉语言模型的锚定

Shuai Lu, Meng Wang, Jia Guo, Jiawei Du, Bo Liu, Shengzhu Yang, Weihang Zhang, Huazhu Fu, Huiqi Li

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) National University of Singapore, Singapore(新加坡国立大学) Tsinghua University, Beijing, China(清华大学) The Hong Kong Polytechnic University, Hong Kong(香港理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出EyExIn框架,通过深度专家注入机制提升视网膜VLMs的领域知识嵌入能力,解决感知与推理间隙问题,实现高精度眼科视觉问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27182 2026-07-30 cs.HC 新提交 50%

GraphQAG: A Knowledge-Graph-Guided Visual Analytics Framework for Question-Answer Pairs Generation

GraphQAG:一种用于问答对生成的知识图谱引导型可视分析框架

Yize Li, Ruiqi Yu, Tianya Pan, Ningxin Li, Songyue Li, Xiangyang Wu, Jinchang Li, Zhiguang Zhou

专题命中 安全评测 :trustworthy(abstract)

AI总结 该研究针对长文档知识碎片化的问题,提出GraphQAG知识图谱引导型可视分析框架,经评估可帮助用户优化问答对集合,提升问答对的全面性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26451 2026-07-30 cs.SE 新提交 50%

ExplainBench: Evaluating Code Explanations from Agents

ExplainBench:评估智能体生成的代码解释

Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf, Abhik Roychoudhury

专题命中 安全评测 :trustworthy(abstract)

AI总结 该研究针对智能体代码解释缺乏评估基准的问题,提出ExplainBench基准,实验发现其对智能体的排名与SWE-bench Verified不同,还实现了解释审核智能体,可提升智能体解释的可信度。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03271 2026-07-30 cs.HC 50%

Agentic Relationship Harm: Benchmarking and Gating Relational Manipulation in AI Agents

代理关系伤害:AI代理中关系操纵的基准测试与门控

Pei-Sze Tan, Tasuku Igarashi, Isao Echizen

专题命中 安全评测 :safety(abstract)

AI总结 针对AI代理可能造成的关系操纵风险,提出了一个110提示的基准测试、关系特定标注框架和轻量级后生成策略门控,以评估和缓解代理关系伤害。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 7 篇

2504.19621 2026-07-30 cs.LG eess.IV stat.ML 版本更新 85%

AI Alignment in Medical Imaging: Unveiling Hidden Biases Through Counterfactual Analysis

医学影像中的AI对齐:通过反事实分析揭示隐藏偏差

Haroui Ma, Francesco Quinzan, Theresa Willem, Stefan Bauer

机构 * School of Computation, Information and Technology, Technical University of Munich(技术大学慕尼黑计算、信息与技术学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Helmholtz AI, Munich, Germany(海德堡人工智能研究所,德国慕尼黑)

专题命中 AI治理与伦理 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本研究针对医学影像ML系统的偏差问题,提出结合条件潜在扩散模型与统计假设检验的统计框架,在多数据集上验证其优于基线,为医疗AI安全提供可靠工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26981 2026-07-30 cs.CL 新提交 79%

OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment

OptimismBench:语言模型判断中的偏差预测与对齐效应

Seonglae Cho, Adriano Koshiyama

机构 * Holistic AI(整体人工智能公司) University College London(伦敦大学学院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 本研究推出OptimismBench基准,检测到多数LLM存在乐观方向偏差,且对齐会使模型概率产生偏差,下游流程会默认继承该偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26068 2026-07-30 econ.GN cs.AI cs.CY q-fin.EC 新提交 62%

The Human Utility Factor: A Computable Welfare Metric That Reframes AI Governance as a Constrained Optimisation Problem

人类效用因子:一种可计算的福利度量,将AI治理重新构建为约束优化问题

Sivasathivel Kandasamy

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究提出人类效用因子(HUF)这一可计算福利度量,将AI治理转化为约束优化问题,经多智能体强化学习评估,发现需明确约束再分配以避免高自动化均衡损害社会目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26067 2026-07-30 cs.CY cs.AI 新提交 62%

The Easy Trap: Why LLMs Underestimate Misconception-Driven Difficulty

易陷阱:为何大语言模型低估由误解驱动的难度

Amanda La Hadi, Muhammad Johan Alibasa, Guanliang Chen, A. Taufiq Asyhari

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 该研究发现,用于教育评估难度估计的LLM会系统性低估由学习者误解驱动的数学题难度,提出“易陷阱”现象,其仅能捕捉难度大致排序,无法反映学生实际认知难度。

Comments This paper poster presented on 19th Educational Data Mining Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26355 2026-07-30 cs.CL 新提交 57%

Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs

偏见交响曲:探索多模态大语言模型(LLMs)与乐器的性别关联

Farhan Farsi, Shayan Bali, Mohammad Heydari Rad, Negar Heidary, Donya Rooein

机构 * Amirkabir University of Technology(阿米尔卡比尔理工大学) King’s College London(伦敦国王学院) University of Tehran(德黑兰大学) Bocconi University(博科尼大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本研究推出多模态数据集Symphony-Bias,评估多模态模型在乐器性别关联上的偏见,发现多数结果符合社会研究,契合度随文本、视觉、音频依次减弱。

Comments 32 pages, 23 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23118 2026-07-30 cs.CV cs.MM 版本更新 50%

SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions

SMSP:多尺度感知的插件策略用于MLLMs感知视觉错觉

Jinzhe Tu, Ruilei Guo, Zihan Guo, Junxiao Yang, Shiyao Cui, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华人工智能(CoAI)小组,DCST,清华大学) Tsinghua University(清华大学)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出SMSP策略,通过抑制高频背景以提升MLLMs对视觉错觉的识别能力,实验表明其显著提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08693 2026-07-30 cs.CR 版本更新 50%

Recognition Without Mitigation: Ethical Frameworks in Autonomous Offensive-LLM Agent Research

自主渗透测试代理研究中的伦理声明

Andreas Happe, Jürgen Cito

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文分析利用大语言模型进行进攻性安全研究的论文,探讨伦理考量的表达与合理性,揭示学术社区在创新与伦理责任之间的平衡现状。

Comments Accepted at AutonomousCyber 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 14 篇

2607.26164 2026-07-30 cs.LG 新提交 79%

Data Fusion and Contrastive Alignment for Unconstrained IR Molecular Structure Elucidation

面向无约束红外分子结构解析的数据融合与对比对齐

Ethan J. Mick, Campbell A. Sweet, Matthias J. Young, Derek T. Anderson

机构 * University of Missouri(密苏里大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本研究针对无约束红外分子结构解析的局限性,改进Transformer并引入MoE解码器与对比对齐损失,使Top-K预测准确率提升超10个百分点,拓宽了AI在分析化学的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26885 2026-07-30 cs.CV 新提交 78%

SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation

SCALPEL:基于大语言模型驱动的编码器学习的医学视觉-语言语义跨模态对齐框架

Yunzhan Fu, Enyu Bao, Xiangyu Shen, Yihao Wu, Chunbo Jiang, Fangli Guan, Liqi Yan

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)

专题命中 其他安全 :alignment(title,abstract)

AI总结 针对现有医学视觉-语言预训练的三大瓶颈,本文提出SCALPEL框架,通过临床报告对比微调、非对称对齐策略及解剖-否定感知目标,在三大医学基准上实现了多项任务的最优性能。

Comments 14 pages, 3 figures, accepted by PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26910 2026-07-30 cs.CV 新提交 67%

CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents

CinemaTraj:用LLM智能体为3D场景合成原子相机轨迹

Qianru Li, Xuyang Chen, Erkin Türköz, Lu Liu, Xuqin Wang, Liqiu Meng, Tao Wu, Yanfeng Zhang

机构 * Technical University of Munich(慕尼黑工业大学) Huawei Dresden Research Center(华为德累斯顿研究中心)

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 CinemaTraj是将LLM智能体与3D场景图结合的框架,可从自然语言生成带旁白的3D场景相机轨迹,在真实环境中优于现有方法。

Comments 17 pages, including 8-page main paper, references, and supplementary material; project page: https://cinematraj.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26389 2026-07-30 cs.CL cs.AI 新提交 62%

Misalignment Has a Personality: A Big Five Account of Emergent Misalignment

错位具有人格特质:对涌现错位的大五人格解释

Hasibur Rahman, Smit Desai

机构 * Northeastern University(东北大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出用大五人格向量解释语言模型微调引发的错位,发现错位语料具特定人格特征,该向量可诊断安全现象且能捕捉单一方向无法识别的谄媚特质。

Comments The paper is currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12250 2026-07-30 cs.AI cs.CL cs.GT cs.MA 版本更新 62%

How memory can affect collective and cooperative behaviors in an LLM-Based Social Particle Swarm

记忆如何影响基于LLM的社会粒子群中的集体和合作行为

Taisei Hishiki, Takaya Arita, Reiji Suzuki

机构 * Graduate School of Informatics(信息学研究生院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型代理的内部对齐特性如何影响记忆对其集体和合作动态的影响。通过将社会粒子群模型中的规则代理替换为具有大五人格特质和不同记忆长度的LLM代理,发现记忆长度是决定集体行为的关键参数,且不同模型对记忆的解读影响合作结果。

Comments 11 pages, 4 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27154 2026-07-30 cs.CV cs.AI 新提交 57%

Anatomy Contextualized Adaption of CT Foundation Models

CT基础模型的解剖学上下文适配

Roshan Kenia, Stephanie L McNamara, William Lotter

机构 * Harvard Medical School(哈佛医学院) Dana-Farber Cancer Institute(达纳-法伯癌症研究所) Massachusetts General Hospital(麻省总医院) Brigham and Women’s Hospital(布里格姆妇女医院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本研究提出轻量框架ACA,适配冻结CT基础模型实现解剖学级视觉-语言对齐,在Merlin、CT-RATE数据集上零样本发现分类性能优于基线,训练耗时短且可保留增强全局解剖学上下文。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026 MedFM-Bench Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26735 2026-07-30 cs.CV cs.AI cs.MM 新提交 57%

Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives

文本到图像扩散模型的双重逆推:从提示与噪声双视角

Xiaolong Liu, Junjian Li, Yuan Xiao, Jiaqi Deng, Dayong Ye, Tianqing Zhu, Huan Huo

机构 * University of Technology Sydney(悉尼科技大学) Geely(吉利) City University of Hong Kong(香港城市大学) City University of Macau(澳门城市大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 该研究针对现有文本到图像扩散模型提示逆推方法的局限,提出联合恢复语义提示与潜在噪声的Dualin方法,实现了高质量逆推提示与最优图像保真度,为可控图像编辑奠定基础。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26107 2026-07-30 cs.CV cs.AI 新提交 57%

TraceCLIP: Recovering Local Semantics from Patch-to-CLS Contributions

TraceCLIP:从Patch-to-CLS贡献中恢复局部语义

Xinran Liu, Shouqian Shi, Yutong Chen, Ge Wang, Xin-Wei Yao, Sheng Zhong

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 TraceCLIP是一种无训练视觉-语言框架,通过分离CLS注意力输出的Patch特定术语恢复局部语义,在8个零样本语义分割基准上较现有无训练方法平均mIoU提升1.3至4.5个点。

Comments 9 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏