arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

共收录 765
2602.21952 2026-02-26 cs.CV

MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving

MindDriver: 引入渐进多模态推理用于自动驾驶

Lingjun Zhang, Yujian Yuan, Changjie Wu, Xinyuan Chang, Xin Cai, Shuang Zeng, Linzhe Shi, Sijin Wang, Hang Zhang, Mu Xu

机构 * Amap, Alibaba Group(阿里集团蚂巴公司) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学)

AI总结 MindDriver通过渐进多模态推理框架提升自动驾驶系统的推理能力,实现语义到物理空间的转化与轨迹规划,展现优异的性能表现。

Comments CVPR2026; Yujian Yuan and Lingjun Zhang contributed equally with random order

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21873 2026-02-26 cs.CV cs.LG

GFPL: Generative Federated Prototype Learning for Resource-Constrained and Data-Imbalanced Vision Task

GFPL: 生成式联邦原型学习用于资源受限和数据不平衡的视觉任务

Shiwei Lu, Yuhang He, Jiashuo Li, Qiang Wang, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Air Force Engineering University(空军工程大学)

AI总结 GFPL通过生成式联邦原型学习方法,解决联邦学习中因多数类特征偏见导致的知识融合效率低下和通信开销过大的问题,提升模型准确率并降低通信成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21657 2026-02-26 cs.CV cs.AI

Following the Diagnostic Trace: Visual Cognition-guided Cooperative Network for Chest X-Ray Diagnosis

循诊断轨迹:基于视觉认知的协作网络用于胸部X光诊断

Shaoxuan Wu, Jingkun Chen, Chong Ma, Cong Shen, Xiao Zhang, Jun Feng

机构 * College of Computer Science, Northwest University(西北大学计算机学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) Department of PET/CT, The First Affiliated Hospital of Xi’an Jiaotong University(西安交通大学第一附属医院PET/CT科)

AI总结 本文提出基于视觉认知的协作网络VCC-Net,通过整合放射科医生的视觉搜索轨迹和注意力模式,提升胸部X光诊断的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22548 2026-02-26 cs.CV cs.RO

JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation

JanusVLN: 通过双隐式记忆解耦语义与空间性用于视觉-语言导航

Shuang Zeng, Dekang Qi, Xinyuan Chang, Feng Xiong, Shichao Xie, Xiaolong Wu, Shiyi Liang, Mu Xu, Xing Wei, Ning Guo

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团)

AI总结 JanusVLN通过双隐式记忆解耦语义与空间性,提升视觉-语言导航的性能和效率。

Comments Accepted to ICLR 2026. Project page: https://miv-xjtu.github.io/JanusVLN.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21044 2026-02-25 cs.AI

LogicGraph : Benchmarking Multi-Path Logical Reasoning via Neuro-Symbolic Generation and Verification

LogicGraph : 通过神经符号生成与验证进行多路径逻辑推理的基准测试

Yanrui Wu, Lingling Zhang, Xinyu Zhang, Jiayu Chang, Pengyu Li, Xu Jiang, Jingtao Hu, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) School of Computer Science and Technology, Tiangong University(天津大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(中国教育部长智网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室)

AI总结 LogicGraph通过神经符号生成与验证方法,系统评估多路径逻辑推理能力,揭示模型在复杂推理中探索多样路径的不足。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08019 2026-02-25 cs.CV

Coherent and Multi-modality Image Inpainting via Latent Space Optimization

通过潜在空间优化实现一致性和多模态图像修复

Lingzhi Pan, Tong Zhang, Bingyuan Chen, Qi Zhou, Wei Ke, Sabine Süsstrunk, Mathieu Salzmann

机构 * Xi’an Jiaotong University(西安交通大学) EPFL(苏黎世联邦理工学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 PILOT通过潜在空间优化提升图像修复的一致性和多模态处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20152 2026-02-24 cs.LG cs.AI stat.ML

Behavior Learning (BL): Learning Hierarchical Optimization Structures from Data

行为学习(BL):从数据中学习分层优化结构

Zhenyao Ma, Yue Liang, Dongxu Li

机构 * Xiamen University(厦门大学) University of Tübingen(图宾根大学) Xi’an Jiaotong University(西安交通大学)

AI总结 行为学习(BL)是一种从数据中学习分层优化结构的通用机器学习框架,结合可解释性和可识别性,适用于科学领域中的优化问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00403 2026-02-24 cs.LG cs.AI cs.CV

SelfAI: A self-directed framework for long-horizon scientific discovery

SelfAI: 一种用于长周期科学发现的自导向框架

Xiao Wu, Ting-Zhu Huang, Liang-Jian Deng, Xiaobing Yu, Yu Zhong, Shangqi Deng, Ufaq Khan, Jianghao Wu, Xiaofeng Liu, Imran Razzak, Xiaojun Chang, Yutong Xie

机构 * University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Xian Jiaotong University(西安交通大学) Yale University(耶鲁大学) Washington University in St. Louis(圣路易斯华盛顿大学) Monash University(莫纳什大学)

AI总结 SelfAI是一种自导向的多智能体系统,通过自动化科学探索的策略性轨迹决策,实现高效、可重复的长周期科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21258 2026-02-24 cs.CV cs.AI

Learn by Reasoning: Analogical Weight Generation for Few-Shot Class-Incremental Learning

通过推理学习:类增量学习中的类比权重生成

Jizhou Han, Chenhao Ding, Yuhang He, Songlin Dong, Qiang Wang, Xinyuan Gao, Yihong Gong

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) Faculty of Microelectronics, Shenzhen University of Advanced Technology(微电子学院,深圳先进技术大学) College of Software Engineering, Xi’an Jiaotong University(软件工程学院,西安交通大学)

AI总结 本文提出了一种受人类大脑启发的类比生成方法,通过类比学习机制在少样本类增量学习中提升模型性能。

Comments Accepted by IEEE TCSVT. This is the author's version which has not been fully edited and content may change prior to final publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18724 2026-02-24 cs.AI

Task-Aware Exploration via a Predictive Bisimulation Metric

通过预测双模拟度量实现任务感知探索

Dayang Liang, Ruihan Liu, Lipeng Wan, Yunlong Liu, Bo An

机构 * Department of Automation, Xiamen University, Xiamen, China(自动化系,厦门大学) Department of Computer Science, Beijing Normal-Hong Kong Baptist University, Zhuhai, China(计算机科学系,北京师范大学-香港 Baptist大学) School of Artificial Intelligence, Xian Jiaotong University, Xian, China(人工智能学院,西安交通大学) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学)

AI总结 TEB通过预测双模拟度量实现任务感知探索,有效解决稀疏奖励下视觉强化学习中的探索难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14979 2026-02-24 cs.CV cs.AI

From Pixels to Words -- Towards Native Vision-Language Primitives at Scale

从像素到词语 -- 向大规模原生视觉-语言原始语义迈进

Haiwen Diao, Mingxuan Li, Silei Wu, Linjun Dai, Xiaohua Wang, Hanming Deng, Lewei Lu, Dahua Lin, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Xi’an Jiaotong University(西安交通大学)

AI总结 NEO通过原生视觉-语言基础构建,实现了从零开始的视觉感知发展,有效缓解了视觉-语言冲突,推动了大规模原生VLM的发展。

Comments 21 pages, 8 figures, Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25411 2026-02-24 cs.AI cs.LG

Boolean Satisfiability via Imitation Learning

通过模仿学习解决布尔可满足性问题

Zewei Zhang, Huan Liu, Yuanhao Yu, Jun Chen, Xiangyu Xu

机构 * McMaster University(麦斯特大学) Xi’an Jiaotong University(西安交通大学)

AI总结 ImitationSAT通过模仿学习提升CDCL求解器性能,减少传播次数和运行时间,优于现有学习方法。

Comments Accepted to ICLR 2026. Code: https://github.com/zewei-zhang/ImitSAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17133 2026-02-20 cs.LG cs.AI

VP-VAE: Rethinking Vector Quantization via Adaptive Vector Perturbation

VP-VAE:通过自适应向量扰动重新思考向量量化

Linwei Zhai, Han Ding, Mingzhi Lin, Cui Zhao, Fei Wang, Ge Wang, Wang Zhi, Wei Xi

机构 * Xi'an Jiaotong University, China(西安交通大学)

AI总结 VP-VAE通过自适应向量扰动方法解耦表示学习与离散化,提升生成模型的稳定性与重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15857 2026-02-19 cs.CL

Multi-source Heterogeneous Public Opinion Analysis via Collaborative Reasoning and Adaptive Fusion: A Systematically Integrated Approach

通过协同推理与自适应融合进行多源异构公共意见分析:一种系统整合方法

Yi Liu

机构 * Yi Liu School of Software Xi’an Jiaotong University(刘毅 软件学院 西安交通大学)

AI总结 本文提出CRAF框架,通过协同推理与自适应融合整合传统方法与LLMs,提升多源异构公共意见分析的跨平台适应性与性能

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14490 2026-02-17 cs.LG cs.AI cs.CL cs.NE

Parameter-Efficient Fine-Tuning of LLMs with Mixture of Space Experts

使用混合空间专家进行大语言模型的参数高效微调

Buze Zhang, Jinkai Tao, Zilang Zeng, Neil He, Ali Maatouk, Menglin Yang, Rex Ying

机构 * Yale university(耶鲁大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science(香港科学大学) Xi’an Jiaotong University(西安交通大学) Central University of Finance(中央财经大学)

AI总结 本文提出MoSLoRA,通过混合多种几何空间提升大语言模型的参数高效微调效果,实验显示在多个基准测试中表现优于现有方法。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14035 2026-02-17 cs.AI

FloCA: Towards Faithful and Logically Consistent Flowchart Reasoning

FloCA: 向忠实且逻辑一致的流程图推理迈进

Jinzi Zou, Bolin Wang, Liang Li, Shuo Zhang, Nuo Xu, Junzhou Zhao

机构 * MoE KLINNS Lab, Xi’an Jiaotong University, Xi’an 710049, P. R. China(西安交通大学) China Mobile Group Shaanxi Co., Ltd.(中国移动集团陕西公司)

AI总结 FloCA通过结合LLM和外部工具实现流程图推理,解决现有方法在流程图拓扑表示和幻觉问题上的不足,提升对话系统的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05402 2026-02-17 cs.CR cs.LG

Lorica: A Synergistic Fine-Tuning Framework for Advancing Personalized Adversarial Robustness

Lorica:一种协同微调框架,用于提升个性化对抗鲁棒性

Tianyu Qi, Lei Xue, Yufeng Zhan, Xiaobo Ma

机构 * School of Cyber Science and Technology, Sun Yat-sen University(中山大学信息科学与技术学院) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Cyber Science and Engineering, Xi’an Jiaotong University(西安交通大学网络安全工程学院)

AI总结 Lorica提出一种协同微调框架,通过两阶段过程实现个性化对抗鲁棒性提升,显著提高通信效率和模型准确率。

Comments Accepted by the ACM Conference on Computer and Communications Security (CCS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13335 2026-02-17 cs.CV

Meningioma Analysis and Diagnosis using Limited Labeled Samples

利用有限标注样本进行脑膜瘤分析与诊断

Jiamiao Lu, Wei Wu, Ke Gao, Ping Mao, Weichuan Zhang, Tuo Wang, Lingkun Ma, Jiapan Guo, Zanyi Wu, Yuqing Hu, Changming Sun

机构 * Shaanxi University of Science and Technology(陕西科技大学) Department of Neurosurgery, The First Affiliated Hospital of Xi'an Jiaotong University(西安交通大学第一附属医院神经外科) Department of Neurosurgery, The First Affiliated Hospital of Fujian Medical University(福建医科大学第一附属医院神经外科) Department of Radiotherapy, University of Groningen, University Medical Center Groningen(格罗宁根大学放射治疗科,格罗宁根大学医学中心) Department of Nephrology, Chenggong Hospital Affiliated to Xiamen University(厦门大学附属晋江医院肾内科)

AI总结 本文提出了一种基于特征融合和自适应权重的少样本脑膜瘤学习方法,通过引入新的MRI数据集验证了其在脑膜瘤分类中的优越性能。

Comments 19 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13326 2026-02-17 cs.CV

MotionWeaver: Holistic 4D-Anchored Framework for Multi-Humanoid Image Animation

MotionWeaver: 一种面向多人形图像动画的总体4D锚定框架

Xirui Hu, Yanbo Ding, Jiahao Wang, Tingting Shi, Yali Wang, Guo Zhi Zhi, Weizhan Zhang

机构 * Xi’an Jiaotong University(西安交通大学) Chinese Academy of Sciences(中国科学院) Institute of Artificial Intelligence (TeleAI)(人工智能研究所(TeleAI))

AI总结 MotionWeaver通过统一运动表示和4D锚定范式,实现多人形图像动画的高效生成与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12796 2026-02-16 cs.CV cs.GR

GSM-GS: Geometry-Constrained Single and Multi-view Gaussian Splatting for Surface Reconstruction

GSM-GS: 用于表面重建的几何约束单视图和多视图高斯散射

Xiao Ren, Yu Liu, Ning An, Jian Cheng, Xin Qiao, He Kong

机构 * School of Automation and Intelligent Manufacturing, Southern University Science and Technology(自动化与智能制造学院,南方科技大学) Research Institute of Mine Artificial Intelligence, China Coal Research Institute(煤矿人工智能研究院,中国煤炭研究总院) Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人工智能与机器人研究院,西安交通大学)

AI总结 GSM-GS通过几何约束单视图和多视图高斯散射,提升复杂表面结构的重建精度和渲染质量。

Comments https://aislab-sustech.github.io/GSM-GS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12013 2026-02-13 cs.AI

InjectRBP: Steering Large Language Model Reasoning Behavior via Pattern Injection

InjectRBP: 通过模式注入引导大语言模型推理行为

Xiuping Wu, Zhao Yu, Yuxin Cheng, Ngai Wong, Liangjun Ke, Tapas Mishra, Konstantinos V. Katsikopoulos

机构 * Xi'an Jiaotong University(西安交通大学) University of Southampton(南安普顿大学) University of Hongkong(香港大学)

AI总结 InjectRBP通过注入行为模式提升大语言模型推理能力,无需参数更新,实验显示在多种推理任务中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02818 2026-02-12 cs.CV

Are Dense Labels Always Necessary for 3D Object Detection from Point Cloud?

密集标签是否总是必要于点云中的3D物体检测?

Chenqiang Gao, Chuandong Liu, Jun Shu, Fangcen Liu, Jiang Liu, Luyu Yang, Xinbo Gao, Deyu Meng

机构 * School of Intelligent Systems Engineering, the Shenzhen Campus of Sun Yatsen University(南方科技大学深圳校区智能系统工程学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学系和教育部智能网络与网络安全重点实验室) School of Communication and Information Engineering, Chongqing University of Posts and Telecommunications(重庆邮电大学通信与信息工程学院) Meta University of Maryland(美国马里兰大学)

AI总结 本文提出SS3D++方法,通过稀疏注释减少标注成本,在KITTI和Waymo数据集上实现性能媲美或超越全监督方法。

Comments update

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10715 2026-02-12 cs.CL cs.AI

Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents

Locomo-Plus:面向LLM代理的超越事实性认知记忆评估框架

Yifei Li, Weidong Guo, Lingling Zhang, Rongman Xu, Muye Huang, Hui Liu, Lijiao Xu, Yu Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) Tencent(腾讯)

AI总结 LoCoMo-Plus提出一种基于约束一致性的评估框架,用于评估LLM代理在长期对话中处理隐含约束的能力,揭示现有基准无法捕捉的认知记忆挑战。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20044 2026-02-11 cs.CV

A Point-Neighborhood Learning Framework for Nasal Endoscope Image Segmentation

基于点邻域学习的鼻内镜图像分割框架

Pengyu Jie, Wanquan Liu, Chenqiang Gao, Yihui Wen, Rui He, Weiping Wen, Pengcheng Li, Jintao Zhang, Deyu Meng

机构 * School of Intelligent Engineering, Sun Yat-Sen University-Shenzhen Campus(中山大学深圳校区智能工程学院) Department of Otolaryngology, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院耳鼻喉科) Chongqing University of Posts and Telecommunications(重庆邮电大学) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院)

AI总结 本文提出点邻域学习框架,通过引入点邻域信息提升鼻内镜图像分割性能,无需增加参数即可显著优于现有方法。

Comments 10 pages, 10 figures,

Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08657 2026-02-10 cs.LG stat.ME

Two-Stage Data Synthesization: A Statistics-Driven Restricted Trade-off between Privacy and Prediction

两阶段数据合成:一种基于统计的隐私与预测之间的受限权衡

Xiaotong Liu, Shao-Bo Lin, Jun Fan, Ding-Xuan Zhou

机构 * Center for Intelligent Decision-Making and Machine Learning, School of Management, Xi’an Jiaotong University(智能决策与机器学习中心,管理学院,西安交通大学) Department of Mathematics, Hong Kong Baptist University(数学系,香港 Baptist 大学) School of Mathematics and Statistics, University of Sydney(数学与统计学学院,悉尼大学)

AI总结 本文提出了一种两阶段数据合成方法,结合统计学优势,在隐私与预测之间实现受限权衡,通过核岭回归和混合操作提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08047 2026-02-10 cs.CV

Vanilla Group Equivariant Vision Transformer: Simple and Effective

vanilla组等变视觉变换器:简单而有效

Jiahong Fu, Qi Xie, Deyu Meng, Zongben Xu

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(数学与统计学院,西安交通大学)

AI总结 本文提出了一种简单有效的等变视觉变换器框架,通过系统地使关键组件等变,提升ViTs在多种视觉任务中的性能和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08007 2026-02-10 cs.LG cs.AI

From $O(mn)$ to $O(r^2)$: Two-Sided Low-Rank Communication for Adam in Distributed Training with Memory Efficiency

从O(mn)到O(r²):为分布式训练中的Adam引入双侧低秩通信以提高内存效率

Sizhe Dang, Jiaqi Shao, Xiaodong Zheng, Guang Dai, Yan Song, Haishan Ye

机构 * Xi’an Jiaotong University(西安交通大学) SGIT AI Lab(SGIT人工智能实验室) University of Science and Technology of China(中国科学技术大学)

AI总结 TSR-Adam通过双侧低秩通信将Adam优化器的通信开销从O(mn)降至O(r²),在保持低维核心状态的同时减少通信量,提升分布式训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07889 2026-02-10 cs.LG

Efficient Anti-exploration via VQVAE and Fuzzy Clustering in Offline Reinforcement Learning

通过VQVAE和模糊聚类实现高效的反探索:离线强化学习中的方法

Long Chen, Yinkui Liu, Shen Li, Bo Tang, Xuemin Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) State Key Laboratory of Management and Control for Complex Systems(复杂系统管理与控制国家重点实验室) Chinese Academy of Sciences(中国科学院) WAYTOUS Inc.(WAYTOUS公司) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence(人工智能学院) Key Laboratory of Intelligent Sensing System and Security (Hubei University)(智能感知系统与安全重点实验室(湖北大学)) Ministry of Education(教育部) Department of Electrical and Computer Engineering(电气与计算机工程系)

AI总结 本文提出基于VQVAE和模糊聚类的离线强化学习反探索方法,通过多代码本离散化和模糊聚类优化,提升学习效率并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07833 2026-02-10 cs.CV cs.AI cs.CL

SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models

SPD-Faith Bench: 诊断和改进多模态大语言模型中的推理忠实性

Weijiang Lv, Yaoxuan Feng, Xiaobo Xia, Jiayu Wang, Yan Jing, Wenchao Chen, Bo Chen

机构 * Xidian University(西安电子科技大学) National University of Singapore(新加坡国立大学) Xi’an Jiaotong University(西安交通大学)

AI总结 SPD-Faith Bench通过细粒度图像差异推理诊断并改进多模态大语言模型中的推理忠实性,揭示了感知盲区和感知-推理脱节的系统性失败模式,并提出SAGE框架提升视觉路由和推理与感知的一致性。

Comments 53 pages, 42 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07625 2026-02-10 cs.CV cs.AI

AD-MIR: Bridging the Gap from Perception to Persuasion in Advertising Video Understanding via Structured Reasoning

AD-MIR:通过结构化推理弥合从感知到说服的广告视频理解鸿沟

Binxiao Xu, Junyu Feng, Xiaopeng Lin, Haodong Li, Zhiyuan Feng, Bohan Zeng, Shaolin Lu, Ming Lu, Qi She, Wentao Zhang

机构 * Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) South China University of Technology, Guangzhou, China(华南理工大学)

AI总结 AD-MIR通过结构化推理框架,结合语义检索与精确关键词匹配,有效解码广告意图,提升广告视频理解的准确性与说服策略分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏