arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-31 至 2026-03-31 共收录 109 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 38 篇

2603.27664 2026-03-31 cs.CL 57%

Investigating the Influence of Language on Sycophantic Behavior of Multilingual LLMs

探究语言对多语言大语言模型趋炎附势行为的影响

Bayan Abdullah Aldahlawi, A. B. M. Ashikur Rahman, Irfan Ahmad

机构 * King Fahd University of Petroleum and Minerals(法赫德国王石油矿产大学) SDAIA-KFUPM Joint Research Center for AI (JRCAI)(SDAIA-KFUPM人工智能联合研究中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 研究通过评估三种先进模型在五种语言下的回应,发现尽管新模型趋炎附势倾向降低,但语言仍显著影响其行为,揭示了文化与语言模式。

Comments 15 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27536 2026-03-31 cs.AI 57%

Dual-Stage LLM Framework for Scenario-Centric Semantic Interpretation in Driving Assistance

双阶段LLM框架用于驾驶辅助中的场景中心语义解释

Jean Douglas Carvalho, Hugo Taciro Kenji, Ahmad Mohammad Saber, Glaucia Melo, Max Mauro Dias Santos, Deepa Kundur

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出双阶段LLM框架,用于评估城市驾驶场景中基于LLM的风险推理可复现性。通过多模态驾驶数据构建确定性场景窗口,并在固定提示约束和闭合数字风险方案下评估,揭示模型间在风险等级分配、高风险升级、证据使用和因果归因上的系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27065 2026-03-31 cs.CL 57%

Story2Proposal: A Scaffold for Structured Scientific Paper Writing

Story2Proposal:一种结构化科学论文写作的支架

Zhuoyang Qian, Wei Shi, Xu Lin, Li Ling, Meng Luo, Ziming Wang, Zhiwei Zhang, Tengyue Xu, Gaoge Liu, Zhentao Zhang, Shuo Zhang, Ziqi Wang, Zheng Feng, Yan Luo, Shu Xu, Yongjin Chen, Zhibo Feng, Zhuo Chen, Bruce Yuan, Biao Wu, Harry Wang, Kris Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出Story2Proposal,一种基于合同约束的多智能体框架,通过协调运作的智能体将研究故事转化为结构化论文,提升了论文结构一致性与视觉对齐性。

Comments 10 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26769 2026-03-31 cs.CV cs.AI 57%

Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption

视觉-语言模型边缘可靠性差距:压缩VLM在视觉损坏下的失败模式量化

Mehmet Kaan Erol

机构 * Marmara University, Institute of Pure and Applied Sciences(马尔马拉大学纯科学与应用科学研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文比较了压缩的视觉-语言模型在视觉损坏下的失败模式,发现紧凑模型在COCO上表现出更高的语义漂移和对象盲区,且置信度校准存在显著差异。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28547 2026-03-31 cs.CV 50%

GEditBench v2: A Human-Aligned Benchmark for General Image Editing

GEditBench v2:一个对齐人类的通用图像编辑基准

Zhangqi Jiang, Zheng Sun, Xianfang Zeng, Yufeng Yang, Xuanyang Zhang, Yongliang Wu, Wei Cheng, Gang Yu, Xu Yang, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) StepFun Southeast University(东南大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出GEditBench v2,包含1200个真实用户查询,涵盖23项任务,引入PVC-Judge模型评估视觉一致性,实验表明其在开放源模型中表现优异,揭示当前模型局限性。

Comments 30 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28106 2026-03-31 cs.HC 50%

InconLens: Interactive Visual Diagnosis of Behavioral Inconsistencies in LLM-based Agentic Systems

InconLens:交互式可视化诊断LLM基于代理系统的行为主观不一致性

Shuo Yan, Xiaolin Wen, Shaolun Ruan, Yanjie Zhang, Jiaming Mi, Yushi Sun, Huamin Qu, Rui Sheng

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出InconLens系统,通过信息节点抽象实现跨运行行为分析,帮助开发者更高效识别分歧点并提升代理系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27928 2026-03-31 cs.SI cs.HC 50%

MGDIL: Multi-Granularity Summarization and Domain-Invariant Learning for Cross-Domain Social Bot Detection

MGDIL:多粒度摘要与领域不变学习用于跨领域社交机器人检测

Boyu Qiao, Yunman Chen, Kun Li, Wei Zhou, Songlin Hu, Yunya Song

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出MGDIL框架,通过多粒度摘要和领域不变学习提升跨领域社交机器人检测的鲁棒性,结合任务导向指令微调与领域对抗学习,实现更稳定的领域不变特征学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24037 2026-03-31 cs.CV 50%

A$^3$: Towards Advertising Aesthetic Assessment

A$^3$:迈向广告审美评估

Kaiyuan Ji, Yixuan Gao, Lu Sun, Yushuo Zheng, Zijian Chen, Jianbo Zhang, Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) School of Information and Electronic Engineering, East China Normal University(华东师范大学信息与电子工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出A$^3$框架,通过理论驱动的A$^3$-Law、大规模标注数据集A$^3$-Dataset、多模态大语言模型A$^3$-Align及基准A$^3$-Bench,解决广告审美评估中主观性、缺乏标准等问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07240 2026-03-31 eess.SY cs.MA cs.SY 50%

Continuous-Time Control Synthesis for Multiple Quadrotors under Signal Temporal Logic Specifications

多四旋翼在信号时间逻辑规范下的连续时间控制合成

Yating Yuan, Yu Liu

专题命中 安全评测 :safety(abstract)

AI总结 本文提出双阶段框架,基于几何控制进行Lyapunov分析并设计多维增益,结合混合整数凸优化生成满足多智能体STL任务的轨迹,提升系统鲁棒性和暂态性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27553 2026-03-31 cs.CV 50%

Annotation-Free Detection of Drivable Areas and Curbs Leveraging LiDAR Point Cloud Maps

无需标注的 drivable 区域和路障检测:利用 LiDAR 点云地图

Fulong Ma, Daojie Peng, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全评测 :safety(abstract)

AI总结 本文提出 MADL 模块,通过 LiDAR 地图与路障检测结合,自动生成训练数据,提升 drivable 区域和路障检测的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27103 2026-03-31 cs.CV 50%

LLM Enhanced Action Recognition via Hierarchical Global-Local Skeleton-Language Model

通过分层全局-局部骨架-语言模型增强动作识别

Ruosi Wang, Fangwei Zuo, Lei Li, Zhaoqiang Xia

机构 * Northwestern Polytechnical University(西北工业大学) Shandong University of Finance and Economics(山东财经大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出HocSLM模型,通过分层全局-局部网络和大视觉-语言模型融合骨架与文本信息,提升动作识别的语义表达和跨模态理解能力,实验表明在三个主流数据集上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27091 2026-03-31 math.OC 50%

Meta-Contrastive Learning for Vision-Language Models via Task-Adaptive CLIP Training

通过任务自适应CLIP训练实现视觉语言模型的元对比学习

Merham Fouladvand, Peuroly Batra

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出一种域条件元对比学习框架,通过任务自适应CLIP训练提升视觉语言模型跨域泛化能力,引入域嵌入和交叉域对齐正则化,增强模型在域偏移下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24862 2026-03-31 cs.CV 50%

ViStoryBench: Comprehensive Benchmark Suite for Story Visualization

ViStoryBench:故事可视化全面评估基准套件

Cailin Zhuang, Ailin Huang, Yaoqi Hu, Jingwei Wu, Wei Cheng, Jiaqi Liao, Hongyuan Wang, Xinyao Liao, Weiwei Cai, Hengyuan Xu, Xuanyang Zhang, Xianfang Zeng, Zhewei Huang, Gang Yu, Chi Zhang

机构 * ShanghaiTech University(上海科技大学) StepFun AIGC Research(AIGC研究院) AGI Lab, Westlake University(西湖大学AGI实验室)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出ViStoryBench,一个全面评估故事可视化模型的基准套件,通过多维度指标评估叙事结构、视觉风格和角色设定,结合人类验证确保一致性与真实性,推动视觉叙事技术发展。

Comments Accepted by CVPR 2026. 44 Pages, Project Page: https://vistorybench.github.io, Code: https://github.com/vistorybench/vistorybench, Dataset: https://huggingface.co/datasets/ViStoryBench/ViStoryBench

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 5 篇

2503.05371 2026-03-31 cs.LG cs.AI cs.CL 75%

Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs

视角转换:用于LLM中鲁棒偏见缓解的引导向量

Zara Siddique, Irtaza Khalid, Liam D. Turner, Luis Espinosa-Anke

机构 * School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) AMPLYFI

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过引导向量修改模型激活以缓解LLM中的偏见,通过8个社会偏见轴(如年龄、性别、种族)在BBQ数据集子集上计算引导向量,并在四个数据集上比较其与三种其他偏见缓解方法的效果,展示其在减少偏见方面的有效性。

Comments Published to EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28589 2026-03-31 cs.AI cs.LG 62%

Towards a Medical AI Scientist

迈向医疗AI科学家

Hongtao Wu, Boyun Zheng, Dingjie Song, Yu Jiang, Jianfeng Gao, Lei Xing, Lichao Sun, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Lehigh University(里海大学) Stanford University(斯坦福大学) Microsoft Research(微软研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出医疗AI科学家框架,通过临床工程师协同推理机制生成可落地的医学研究想法,并基于结构化医学规范和伦理政策撰写论文,验证其在171案例、19临床任务和6种数据模态中的高质量表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12433 2026-03-31 cs.CL cs.AI 62%

Exploring Cultural Variations in Moral Judgments with Large Language Models

探索大语言模型在道德判断中的文化差异

Hadi Mohammadi, Ayoub Bagheri

机构 * Utrecht University(乌得勒支大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型在捕捉文化多样性道德价值观方面的能力,通过对比不同模型与全球态度调查数据的关联性,发现指令微调模型在跨文化道德规范上表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27411 2026-03-31 cs.HC 50%

Relational Co-Adaptation in Emotionally Supportive AI: Tensions in Authentic Emotional Interaction

情感支持型AI中的关系共适应:真实情感互动中的张力

Mengqi Shi

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究探讨了情感支持型AI中双向对齐的悖论,指出技术有效性可能引发伦理问题,如AI成为老年人唯一选项、情感需求与系统干预不匹配等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22419 2026-03-31 cs.CV 50%

CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

CLIP存在短视:超越第一句话的注意力分配

Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander

机构 * University of Toronto Robotics Institute(多伦多大学机器人研究所) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 CLIP模型在大规模数据上通过图像-文本对比学习获取可迁移的多模态特征,但其预训练过程偏向于短描述,导致复杂场景对齐不足。本文提出DeBias-CLIP,通过去除摘要句和子采样提升对齐效果,实现更优的长文本检索和鲁棒性。

Comments 20 pages, 15 figures, to be published in the CVPR 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 31 篇

2501.16448 2026-03-31 cs.AI cs.LG 79%

Information-theoretic Distinctions Between Deception and Confusion

信息论视角下欺骗与混淆的区别

Robin Young

专题命中 其他安全 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文从信息论角度区分两种AI安全失效模式:欺骗对齐与目标漂移,揭示二者在人类-AI系统不同接口的信息分歧,提出形式化模型和思想实验,为大型语言模型对齐挑战提供新视角。

Comments Proceedings of the 14th IJCNLP and the 4th AACL (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27438 2026-03-31 cs.AI 70%

The Novelty Bottleneck: A Framework for Understanding Human Effort Scaling in AI-Assisted Work

新颖性瓶颈:一种理解人类在AI辅助工作中的努力扩展的框架

Jacky Liang

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出一个简化的人机协作模型,揭示了新颖性瓶颈机制,即任务中需要人类判断的部分形成不可消除的串行组件。模型推导出人类努力无平滑亚线性区域,更好代理只能改善系数而非指数,团队规模随代理能力下降,总人类努力保持O(E)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27356 2026-03-31 cs.CL cs.AI cs.CY 67%

Culturally Adaptive Explainable LLM Assessment for Multilingual Information Disorder: A Human-in-the-Loop Approach

文化适应性可解释LLM评估用于多语言信息紊乱:一种人机协作方法

Maziar Kianimoghadam Jouneghani

机构 * University of Turin(都灵大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出一种人机协作框架,通过本地语言标注者生成的解释性理由,评估LLM在多语言信息紊乱中的表现,提升模型的文化适应性和可解释性。

Comments 9 pages, 3 figures, 1 table. Accepted to the Information Disorder Workshop at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28038 2026-03-31 cs.AI cs.LG 62%

Beyond the Answer: Decoding the Behavior of LLMs as Scientific Reasoners

超越答案:解码LLM作为科学推理者的行为

Rohan Pandey, Eric Ye, Michael Li

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过定制遗传Pareto算法优化提示,研究提示对科学推理行为的影响,揭示模型特定的局部逻辑,并探讨其可迁移性和脆弱性。

Comments Accepted at the Post-AGI Science and Society Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16430 2026-03-31 cs.CL cs.AI 62%

EngGPT2: Sovereign, Efficient and Open Intelligence

EngGPT2:主权、高效且开放的智能

G. Ciarfaglia, A. Rosanova, S. Cipolla, J. Bartoli, A. Di Domenico, C. Fioroni, A. Fontana, M. R. Scoleri, M. I. Mone, D. Franchi, M. C. Del Gaudio, A. Leodori, F. Cinti, M. Capozzi, C. Baston, F. Picariello, M. Gabusi, S. Bonura, V. Morreale, I. Bailo

机构 * Engineering Group(工程集团)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 EngGPT2是工程集团最新迭代的意大利大语言模型,通过训练2.5万亿token实现高效性能,其在多个基准测试中表现接近8B-16B密集模型,同时消耗更少的推理和训练资源,支持多语言推理模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21782 2026-03-31 cs.AI cond-mat.mtrl-sci cs.LG physics.chem-ph 62%

Accelerating Scientific Discovery with Autonomous Goal-evolving Agents

通过自主目标演化的代理加速科学发现

Yuanqi Du, Botao Yu, Tianyu Liu, Tony Shen, Junwu Chen, Jan G. Rittig, Kunyang Sun, Yikun Zhang, Aarti Krishnan, Yu Zhang, Daniel Rosen, Rosali Pirone, Zhangde Song, Bo Zhou, Cassandra Masschelein, Yingze Wang, Haorui Wang, Haojun Jia, Chao Zhang, Hongyu Zhao, Martin Ester, Nir Hacohen, Teresa Head-Gordon, Carla P. Gomes, Huan Sun, Chenru Duan, Philippe Schwaller, Wengong Jin

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SAGA代理,通过双层架构自动设计优化目标函数,提升科学发现效率,应用于抗生素、纳米抗体等设计任务,取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05675 2026-03-31 cs.AI cs.LG 62%

Synergizing Large Language Models and Task-specific Models for Time Series Anomaly Detection

融合大语言模型与任务特定模型用于时间序列异常检测

Feiyi Chen, Leilei Zhang, Guansong Pang, Roger Zimmermann, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Department of Computer Science and Technology, Singapore Management University(新加坡管理大学计算机科学与技术系) Department of Computer Science and Technology, National University of Singapore(新加坡国立大学计算机科学与技术系)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CoLLaTe框架,通过融合大语言模型与任务特定模型,解决异常检测中的表达域不匹配和预测误差累积问题,提升检测性能。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27836 2026-03-31 quant-ph cs.CL 57%

Q-Bridge: Code Translation for Quantum Machine Learning via LLMs

Q-Bridge:通过LLM实现量子机器学习的代码翻译

Runjia Zeng, Priyabrata Senapati, Ruixiang Tang, Dongfang Liu, Qiang Guan

机构 * Rochester Institute of Technology(罗彻斯特理工学院) Kent State University(肯特州立大学) Rutgers University(罗格斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 Q-Bridge通过LLM指导的代码翻译框架,系统性地将经典机器学习实现转换为可执行的量子机器学习变体,建立了首个可重复的框架和数据集,为可扩展的量子AI发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13516 2026-03-31 cs.CV cs.AI 57%

Bidirectional Multimodal Prompt Learning with Scale-Aware Training for Few-Shot Multi-Class Anomaly Detection

双向多模态提示学习与尺度感知训练用于少样本多类异常检测

Yujin Lee, Sewon Kim, Daeun Moon, Seoyoon Jang, Hyunsoo Yoon

机构 * Yonsei University(延世大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出AnoPLe框架,通过双向交互文本与视觉提示,实现高效多类异常检测,在MVTec-AD等数据集上超越现有方法,且具备良好的泛化能力。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27169 2026-03-31 cs.AI 57%

Aligning LLMs with Graph Neural Solvers for Combinatorial Optimization

对齐大语言模型与图神经求解器以解决组合优化问题

Shaodi Feng, Zhuoyi Lin, Yaoxin Wu, Haiyan Yin, Yan Jin, Senthilnath Jayavelu, Xun Xu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Eindhoven University of Technology(埃因霍温理工大学) Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,新加坡科技研究局) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出AlignOPT方法,通过结合大语言模型与图神经求解器,提升组合优化问题的求解能力,实现语义与结构表示的对齐,实验显示其在多种优化问题中表现优异。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27135 2026-03-31 cs.LG stat.ML 57%

Spectral-Aware Text-to-Time Series Generation with Billion-Scale Multimodal Meteorological Data

具有十亿级多模态气象数据的频谱感知文本到时间序列生成

Shijie Zhang

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,沈阳,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出MTransformer模型,通过频谱提示生成器实现文本到时间序列的精确语义控制,利用大规模气象数据提升生成质量与跨模态对齐精度。

Comments Accepted By IJCNN 2026 (WCCI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26859 2026-03-31 cs.CV cs.AI eess.IV 57%

Beyond Textual Knowledge-Leveraging Multimodal Knowledge Bases for Enhancing Vision-and-Language Navigation

超越文本知识的多模态知识库用于增强视觉-语言导航

Dongsheng Yang, Yinfeng Yu, Liejun Wang

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing(丝绸之路多语言认知计算联合国际研究实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出BTK框架,通过整合环境特定文本知识与生成图像知识库,提升视觉-语言导航中的语义 grounding 和跨模态对齐,实验表明在R2R和REVERIE数据集上性能显著提升。

Comments Main paper (37 pages). Accepted for publication by the Information Processing and Management,Volume 63,Issue 6,September 2026,104766

详情

展开后加载摘要…

URL PDF HTML 收藏