arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-19 至 2026-03-19 共收录 62 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 19 篇

2511.12294 2026-03-19 cs.SE 67%

ProofWright: Towards Agentic Formal Verification of CUDA

ProofWright: 向 CUDA 的代理形式验证迈进

Bodhisatwa Chatterjee, Drew Zagieboylo, Sana Damani, Siva Hari, Christos Kozyrakis

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 ProofWright 通过整合自动形式验证与 LLM 代码生成,为 CUDA 核心提供内存安全、线程安全和语义正确性保证,验证了 74% 的生成内核,发现传统测试遗漏的细微错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05545 2026-03-19 cs.CL cs.CY cs.LG 67%

The Moral Foundations Reddit Corpus

道德基础Reddit语料库

Jackson Trager, Alireza S. Ziabari, Elnaz Rahmati, Aida Mostafazadeh Davani, Preni Golazizian, Farzan Karimi-Malekabadi, Ali Omrani, Zhihe Li, Brendan Kennedy, Georgios Chochlakis, Nils Karl Reimer, Melissa Reyes, Kelsey Cheng, Mellow Wei, Christina Merrifield, Arta Khosravi, Evans Alvarez, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 该研究提出一个包含16123条Reddit评论的语料库,用于标注道德情感,通过评估不同模型表现,强调了人工标注数据在AI对齐评估中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17692 2026-03-19 cs.LG cs.AI q-fin.CP q-fin.PM 62%

Can Blindfolded LLMs Still Trade? An Anonymization-First Framework for Portfolio Optimization

盲folded LLMs仍能进行交易吗?一个以匿名化优先的资产组合优化框架

Joohyoung Jeon, Hongchul Lee

机构 * Korea University(韩国大学) Mirae Asset Securities(美亚证券)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种以匿名化为核心的资产组合优化框架,通过盲fold LLMs来验证市场信号的合法性,实验显示在2025年期间实现了1.40的夏普比率,并通过负控实验验证信号的有效性。

Comments Accepted at the ICLR 2026 Workshop on Advances in Financial AI (FinAI). 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24384 2026-03-19 cs.CL cs.AI 62%

HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment

HarmMetric Eval: 对LLM有害性评估的度量和裁判进行基准测试

Langqi Yang, Tianhang Zheng, Yixuan Chen, Kedong Xiu, Hao Zhou, Wangze Ni, Lei Chen, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Pretraining Team, xAI(预训练团队,xAI) Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HarmMetric Eval,用于评估有害性度量和裁判的质量,发现传统参考型指标在细粒度评估中表现优于LLM裁判,改进的裁判通过结合细粒度标准和参考型指标提升了效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17385 2026-03-19 cs.LG cs.AI cs.CV 62%

Den-TP: A Density-Balanced Data Curation and Evaluation Framework for Trajectory Prediction

Den-TP:一种基于密度平衡的数据整理与评估框架用于轨迹预测

Ruining Yang, Yi Xu, Yun Fu, Lili Su

机构 * Northeastern University, USA(东北大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Den-TP框架,通过密度感知的数据整理和评估方法,平衡轨迹预测数据集的密度分布,提升模型鲁棒性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15797 2026-03-19 cs.LG cs.AI 62%

OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning

OMNIFLOW:一种基于物理的多模态代理用于通用科学推理

Hao Wu, Yongheng Zhang, Yuan Gao, Fan Xu, Fan Zhang, Ruobing Xie, Ruijian Gou, Yuxuan Liang, Xiaomeng Huang, Xian Wu

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shenzhen Loop Area Institute(深圳河套学院) Ocean University of China(海洋大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 OMNIFLOW通过引入语义-符号对齐机制和物理引导的推理流程,实现了多模态模型在物理定律下的科学推理,显著提升了零样本泛化和少样本适应能力,提供透明且物理一致的推理报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17820 2026-03-19 cs.LG 57%

Federated Distributional Reinforcement Learning with Distributional Critic Regularization

联邦分布式强化学习与分布批评正则化

David Millard, Cecilia Alm, Rashid Ali, Pengcheng Shi, Ali Baheri

机构 * Dept. of Mechanical Engineering, Rochester Institute of Technology(机械工程系,罗切斯特理工学院) Dept. of Psychology and School of Information, Rochester Institute of Technology(心理学系和信息学院,罗切斯特理工学院) Department of Engineering Science, University West(工程科学系,西大学) Golisano College of Computing and Information Sciences, Rochester Institute of Technology(计算与信息科学学院,罗切斯特理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出FedDistRL和TR-FedDistRL,通过分布批评正则化提升安全性和稳定性,在多任务环境中表现出更低的均值模糊和更高的安全指标。

Comments 9 pages, 4 Figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16934 2026-03-19 cs.CV cs.AI 57%

AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding

AgriChat:一种用于农业图像理解的多模态大语言模型

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出AgriChat,一种基于多模态大语言模型的农业图像理解系统,通过整合视觉描述与网络增强的科学检索,生成农业基准数据集,提升农业领域的模型鲁棒性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25758 2026-03-19 cs.AI 57%

TheraMind: A Strategic and Adaptive Agent for Longitudinal Psychological Counseling

TheraMind:一种用于长期心理辅导的战略和自适应代理

He Hu, Chiyuan Ma, Qianning Wang, Lin Liu, Yucheng Zhou, Laizhong Cui, Fei Ma, Qi Tian

机构 * Shenzhen University(深圳大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Auckland University of Technology(奥克兰理工大学) University of Science and Technology of China(中国科学技术大学) SKL-IOTSC, CIS, University of Macau(澳门科技研究所、CIS、澳门大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出TheraMind,一种用于可信在线长期心理辅导的战略和自适应代理,通过双循环架构提升对话管理和治疗规划能力,实验证明其在多会话指标上优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04893 2026-03-19 cs.CV cs.AI 57%

SCAM: A Real-World Typographic Robustness Evaluation for Multimodal Foundation Models

SCAM:多模态基础模型的现实世界字形鲁棒性评估

Justus Westerhoff, Erblina Purelku, Jakob Hackstein, Jonas Loos, Leo Pinetzki, Erik Rodner, Lorenz Hufe

机构 * BLISS e.V.(BLISS协会) Berliner Hochschule für Technik (BHT)(柏林技术大学) Technische Universität Berlin(柏林技术大学) KI Werkstatt, Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术经济学院) Merantix Momentum(Merantix Momentum公司) Fraunhofer Heinrich-Hertz-Institut, Berlin, Germany(柏林弗劳恩霍夫 Heinrich-Hertz 研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出SCAM数据集,用于评估多模态基础模型对字形攻击的鲁棒性,发现训练数据和模型架构影响攻击敏感性,且大语言模型基座可降低攻击影响。

Comments Accepted at CVPR 2025 Workshop EVAL-FoMo-2

Journal ref Journal of Data-centric Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19132 2026-03-19 cs.SE 50%

LLMs-Powered Real-Time Fault Injection: An Approach Toward Intelligent Fault Test Cases Generation

基于大语言模型的实时故障注入:一种智能故障测试用例生成方法

Mohammad Abboush, Ahmad Hatahet, Andreas Rausch

专题命中 安全评测 :safety(abstract)

AI总结 本文提出一种利用大语言模型生成实时故障测试用例的方法,通过分析功能安全需求提高测试效率和安全性。

Journal ref 2025 IEEE 28th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02341 2026-03-19 cs.CV 50%

TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction

TALO:推动3D视觉基础模型向全球一致的在线重建迈进

Fengyi Zhang, Tianjun Zhang, Kasra Khosoussi, Zheng Zhang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出基于薄板样条的高自由度长期对齐框架,通过全局传播控制点纠正空间变化不一致,并采用点无关子图注册设计提升鲁棒性,实验表明其在多数据集和相机配置下均能获得更一致的几何和更低的轨迹误差。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 2 篇

2603.16938 2026-03-19 cs.CR cs.AI cs.CY 62%

Cryptographic Runtime Governance for Autonomous AI Systems: The Aegis Architecture for Verifiable Policy Enforcement

面向自主AI系统的加密运行时治理:Aegis架构用于可验证的政策执行

Adam Massimo Mazzocchetti

机构 * SPQR Technologies Inc.(SPQR技术公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出Aegis架构,通过加密技术将政策约束作为执行条件,实现自主AI系统的可验证政策执行,通过实验验证其在运行时治理中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00479 2026-03-19 cs.AI 57%

Aligning Probabilistic Beliefs under Informative Missingness: LLM Steerability in Clinical Reasoning

在信息缺失下对概率信念进行对齐:临床推理中的LLM可引导性

Yuta Kobayashi, Vincent Jeanselme, Shalmali Joshi

机构 * Department of Biomedical Informatics(生物医学信息学系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文研究LLM能否利用信息性缺失进行预测推理,通过分析三种提示方法发现,尽管结构引导和上下文学习可提升概率对齐,但需精心干预才能利用信息性缺失。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 18 篇

2603.16872 2026-03-19 cs.CL cs.CY 76%

Trust, Safety, and Accuracy: Assessing LLMs for Routine Maternity Advice

信任、安全与准确性:评估LLMs用于常规产科咨询

V Sai Divya, A Bhanusree, Rimjhim, K Venkata Krishna Rao

机构 * National Institute of Technology, Warangal, India(印度战争格尔国家理工学院)

专题命中 其他安全 :safety(title);分类 cs.CL、cs.CY

AI总结 本研究评估了LLMs在提供可靠且易懂的产科信息方面的表现,发现Perplexity在语义上与专家接近,而ChatGPT-4o在文本清晰度和医学术语使用上更优,为偏远地区产科教育提供了可行的AI解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18002 2026-03-19 cs.CV cs.AI cs.CL 62%

Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models

Loc3R-VLM:基于语言的定位与3D推理的视觉语言模型

Kevin Qu, Haozhe Qi, Mihai Dusmanu, Mahdi Rad, Rui Wang, Marc Pollefeys

机构 * Microsoft Spatial AI Lab(微软空间AI实验室) ETH Zurich(苏黎世联邦理工学院) EPFL(苏黎世联邦理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Loc3R-VLM通过结合全局布局重建和显式情境建模,提升视觉语言模型的3D空间理解能力,在语言定位和3D问答任务中取得最优性能。

Comments Project Page: https://kevinqu7.github.io/loc3r-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16901 2026-03-19 cs.LG cs.AI 62%

From Language to Action in Arabic: Reliable Structured Tool Calling via Data-Centric Fine-Tuning

从阿拉伯语到行动:通过数据驱动的微调实现可靠的结构化工具调用

Omer Nacar, Deema Alquffari, Saleh Alsharideh, Adeem AlOtaibi, Abdulaziz Alabdulkarim, Leen Alhazmi, Nada Alomar, Wareef Alzubaidi, Nada Alsultan, Ahmed Alrabghi, Demah Alhoshan, Rana Alsayyari, Hamed Alruwaili, Albaraa Jaafar, Khaled Alusmani, Abdulaziz Alsohimy, Munirah Alsubaie, Shahd Aldukhayil, Arwa Alali, Yazeed BinShihah, Razan Alsulaymi, Nourah Alhumaid, Razan Abdulsalam, Reem Alamoudi, Mohammed Alkhalifa

机构 * Tuwaiq Academy(图瓦伊克学院) Tahakom(塔哈科姆) Wakeb Company(沃克公司) Qatmeer Co.(卡提迈尔公司) NCGR Vision Bank(视觉银行)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AISA-AR-FunctionCall框架,通过数据审计、模式修复和提示重构等方法,显著提升阿拉伯语函数调用模型的稳定性与准确性,减少解析失败率并提高功能名称识别精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17969 2026-03-19 cs.RO cs.AI 57%

Specification-Aware Distribution Shaping for Robotics Foundation Models

面向规范的机器人基础模型分布塑形

Sadık Bera Yüksel, Derya Aksaray

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出一种面向规范的机器人基础模型分布优化框架,通过在预训练模型执行中强制满足信号时序逻辑约束,提升机器人在复杂任务中的安全性和合规性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13698 2026-03-19 cs.RO cs.AI 57%

SAATT Nav: a Socially Aware Autonomous Transparent Transportation Navigation Framework for Wheelchairs

SAATT Nav:面向轮椅的社交感知自主透明交通导航框架

Yutong Zhang, Shaiv Y. Mehra, Bradley S. Duerstock, Juan P. Wachs

机构 * Edwardson School of Industrial Engineering, Purdue University(帕克大学工业工程学院) Weldon School of Biomedical Engineering, Purdue University(帕克大学生物医学工程学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出SAATT导航框架,通过整合大语言模型实现社交感知与决策透明,提升轮椅用户的导航安全性与信任度。

Comments 8 pages, 4 figures, 2 tables, 1 algorithm. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17533 2026-03-19 cs.IR cs.LG 57%

A Unified Language Model for Large Scale Search, Recommendation, and Reasoning

大规模检索、推荐与推理的统一语言模型

Marco De Nadai, Edoardo D'Amico, Max Lefarov, Alexandre Tamborrino, Divita Vohra, Mark VanMiddlesworth, Shawn Lin, Jacqueline Wood, Jan Stypka, Eliza Klyce, Keshi Dai, Timothy Christopher Heath, Martin D. Gould, Yves Raimond, Sandeep Ghael, Tony Jebara, Andreas Damianou, Vladan Radosavljevic, Paul N. Bennett, Mounia Lalmas, Praveen Chandar

机构 * Spotify

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出NEO框架,通过将预训练解码器模型适应为工具无关的生成器,实现多领域实体、用户和语言的联合推理,展示了在大规模目录上的推荐、搜索和用户理解任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17208 2026-03-19 cs.CL cs.PL 57%

SYMDIREC: A Neuro-Symbolic Divide-Retrieve-Conquer Framework for Enhanced RTL Synthesis and Summarization

SYMDIREC:一种用于增强RTL综合与摘要的神经符号分割-检索-解决框架

Prashanth Vijayaraghavan, Apoorva Nitsure, Luyao Shi, Charles Mackin, Ashutosh Jadhav, David Beymer, Ehsan Degan, Vandana Mukherjee

机构 * IBM Research(IBM研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 SYMDIREC通过结合符号规划与LLM推理,提升RTL综合与摘要的准确性,实现比基线方法更高的Pass@1率和ROUGE-L分数。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16983 2026-03-19 cs.LG cs.LO 57%

Formal verification of tree-based machine learning models for lateral spreading

基于树形机器学习模型的横向扩展形式验证

Krishna Kumar

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文通过SMT求解器对树形模型进行形式验证,确保地质灾害预测模型在输入域内满足物理规范,展示约束应用如何提升物理一致性,揭示准确率与合规性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19995 2026-03-19 cs.MA cs.CL 57%

Communication to Completion: Modeling Collaborative Workflows with Intelligent Multi-Agent Communication

通信至完成:利用智能多智能体通信建模协作流程

Yiming Lu, Xun Wang, Simin Ma, Shujian Liu, Sathish Reddy Indurthi, Song Wang, Haoyun Deng, Fei Liu, Kaiqiang Song

机构 * Emory University(埃默里大学) Zoom Video Communications(Zoom视频通讯)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出C2C框架,通过建模通信为受限资源提升协作效率,实验表明成本意识策略使效率提升超40%,揭示出智能体自然采用管理者为中心的协调模式。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17965 2026-03-19 cs.CV 50%

LaDe: Unified Multi-Layered Graphic Media Generation and Decomposition

LaDe:统一的多层图形媒体生成与分解

Vlad-Constantin Lungu-Stan, Ionut Mironica, Mariana-Iuliana Georgescu

机构 * Adobe Research(Adobe研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 LaDe通过结合LLM提示扩展器、4D RoPE位置编码的潜在扩散变换器和RGBA VAE,实现灵活的多层媒体设计生成与分解,提升文本到多层媒体设计的对齐能力。

Comments 18 pages (main + supp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16736 2026-03-19 cs.CV 50%

World Reconstruction From Inconsistent Views

从不一致视角重建世界

Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich, Germany(慕尼黑技术大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种非刚性对齐方法,通过全局一致坐标框架生成清晰点云,提升视频扩散模型在3D世界重建中的性能。

Comments project website: https://lukashoel.github.io/video_to_world video: https://www.youtube.com/watch?v=qXnUwhVmBzA code: https://github.com/lukasHoel/video_to_world

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07231 2026-03-19 cs.CV 50%

Semi-supervised Shelter Mapping for WASH Accessibility Assessment in Rohingya Refugee Camps

半监督庇护所制图用于罗兴亚难民营地WASH可及性评估

Kyeongjin Ahn, YongHun Suh, Sungwon Han, Jeasurk Yang, Hannes Taubenböck, Meeyoung Cha

机构 * School of Computing, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院计算学院) Data Science for Humanity Group, Max Planck Institute for Security and Privacy (MPI-SP)(安全与隐私研究所数据科学为人类小组) Meta, California, United States(美国加州Meta公司) German Aerospace Center (DLR), Earth Observation Center (EOC)(德国航天中心地球观测中心) Institute of Geography and Geology, Earth Observation Research Cluster (EORC), Würzburg University(弗赖堡大学地理与地质研究所,地球观测研究集群)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出半监督分割框架,利用SAM模型对多时相亚米分辨率遥感图像进行庇护所制图,提升复杂营地环境中的检测性能,并揭示WASH可及性下降及性别不平等问题。

Comments 22 pages, 13 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17625 2026-03-19 cs.CV 50%

S-VGGT: Structure-Aware Subscene Decomposition for Scalable 3D Foundation Models

S-VGGT:面向可扩展3D基础模型的结构感知子场景分解

Xinze Li, Pengxu Chen, Yiyuan Wang, Weifeng Su, Wentao Cheng

机构 * Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学) Jilin University(吉林大学) Hong Kong Baptist University(香港 Baptist大学) Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science(广东省交叉学科研究与数据科学应用重点实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出S-VGGT方法,通过结构层面的冗余消除,解决3D基础模型中全局注意力带来的二次计算成本问题,实现高效且稳定的子场景划分与处理。

Comments 7 pages, 5 figures. Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17520 2026-03-19 cs.CV 50%

PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation

PCA-Seg:重新审视开放词汇语义和部分分割中的成本聚合

Jianjian Yin, Tao Chen, Yi Chen, Gensheng Pei, Xiangbo Shu, Yazhou Yao, Fumin Shen

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing Normal University(南京师范大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) University of Electronic Science and Technology of China(电子科技大学) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出PCA-Seg方法,通过并行成本聚合缓解类级语义与空间上下文之间的知识干扰,提升开放词汇语义和部分分割性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17326 2026-03-19 cs.CV 50%

FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions

FineViT: 通过密集描述逐步解锁细粒度感知

Peisen Zhao, Xiaopeng Zhang, Mingxing Xu, Ruoyu Sun, Zewei Du, Dunzheng Wang, Guanghao Zheng, Haohang Xu, Zhibo Zhang, Yuhang Zhang, Yi Ai, Lin Liu, Qi Tian

机构 * Huawei Inc.(华为公司)

专题命中 其他安全 :alignment(abstract)

AI总结 FineViT通过密集描述逐步训练,提升细粒度视觉感知能力,在长上下文检索中表现优异,超越现有多模态视觉编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17178 2026-03-19 cs.CV 50%

Patient4D: Temporally Consistent Patient Body Mesh Recovery from Monocular Operating Room Video

Patient4D: 从单目手术室视频中恢复时间一致的患者身体网格

Mingxiao Tu, Hoijoon Jung, Alireza Moghadam, Andre Kyme, Jinman Kim

机构 * University of Sydney(悉尼大学)

专题命中 其他安全 :alignment(abstract)

AI总结 Patient4D通过利用时间一致性先验,结合轻量几何机制和姿态锁定,提升手术AR中单目视频的患者身体网格恢复性能,实验表明其在遮挡条件下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏