NOSE: Neural Olfactory-Semantic Embedding with Tri-Modal Orthogonal Contrastive Learning
NOSE:神经嗅觉-语义嵌入与三模态正交对比学习
Yanyi Su, Hongshuai Wang, Zhifeng Gao, Jun Cheng
机构
*
State Key Laboratory of Physical Chemistry of Solid Surface, College of Chemistry and Chemical Engineering, Xiamen University, Xiamen, China(厦门大学固体表面物理化学国家重点实验室,化学与化学工程学院,厦门,中国)
;
DP Technology(DP技术)
;
Laboratory of AI for Electrochemistry (AI4EC), Tan Kah Kee Innovation Laboratory (IKKEM), Xiamen, China(电化学人工智能实验室(AI4EC),淡凯实验室(IKKEM),厦门,中国)
;
Institute of Artificial Intelligence, Xiamen University, Xiamen, China(人工智能研究院,厦门大学,厦门,中国)
Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs
业务即规则:面向LLM的业务规则流建模基准与框架
Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan
机构
*
Zhejiang University of Technology(浙江工业大学)
;
Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室)
;
University of Aberdeen(阿伯丁大学)
;
University of Birmingham(伯明翰大学)
Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods
推进面向艺术字的场景文本识别:数据集与方法
Xingsong Ye, Yongkun Du, Jiaxin Zhang, Haojie Zhang, Chong Sun, Chen Li, Jing Lyu, Zhineng Chen
机构
*
Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所)
;
Shanghai Key Laboratory of Multimodal Embodied AI, Fudan University(复旦大学上海市多模态具身人工智能重点实验室)
;
WeChat Vision, Tencent Inc.(腾讯微信视觉团队)
;
South China University of Technology(华南理工大学)
CommentsAfter submission, we discovered significant issues in the reference and citation information used in the manuscript. Because these issues affect the integrity of the scholarly record and require substantial revision and verification, we request withdrawal of the current submission. A corrected version may be submitted in the future after a comprehensive review
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
State Key Lab of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,北京,中国)
;
Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海))
专题命中
幻觉与鲁棒性
:multimodal large language model(abstract);分类 cs.CV
Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models
多模态大语言模型中基于谱演化引导的令牌剪枝
Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen
机构
*
School of Software Technology, Zhejiang University(浙江大学软件学院)
;
Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室)
;
The University of Queensland(昆士兰大学)
;
Singapore Management University(新加坡管理大学)
;
The University of Southern Queensland(南昆士兰大学)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);MLLM(abstract_cn);分类 cs.CV
机构
*
Guangdong Institute of Intelligence Science and Technology(广东智能科技研究院)
;
Zhejiang University(浙江大学)
;
Southeast University(东南大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
Institute of Science Tokyo(东京科学大学)
;
Shanghai Jiao Tong University(上海交通大学)
机构
*
College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)
;
Department of Bioengineering and Imperial-X, Imperial College London(帝国理工学院伦敦校区生物工程系)
;
Department of Pathology, Xiangtan Maternal and Child Health Hospital(湘潭 maternal and child health hospital pathology department)
;
Department of Pathology, The First People’s Hospital of Xiangtan City(湘潭市第一人民医院病理科)
机构
*
School of Software Technology, Zhejiang University(浙江大学软件学院)
;
Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室)
;
Hong Kong Polytechnic University(香港理工大学)
;
The University of Southern Queensland(南昆士兰大学)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);分类 cs.CV
P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling
P-MTP: 通过渐进深度缩放的多令牌预测实现高效文档解析
Le Xiang, Chenxi Zhai, Shu Wei, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He
机构
*
Department of Computer Vision Technology (VIS) Baidu Inc China(百度计算机视觉技术部(VIS))
;
Tsinghua University Shenzhen International Graduate School China(清华大学深圳国际研究生院)
Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations
评估稀疏自编码器与概念标注的可解释性
Jonas Klotz, Cassio F. Dantas, Pallavi Jain, Diego Marcos, Begüm Demir
机构
*
The Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所)
;
Technische Universität Berlin(柏林工业大学)
;
INRAE(法国国家农业、食品与环境研究院)
;
Inria, EVERGREEN(法国国家信息与自动化研究所,EVERGREEN)
;
UMR TETIS, Univ Montpellier(UMR TETIS,蒙彼利埃大学)
专题命中
VLM训练与架构
:vision language model(abstract);分类 cs.CV、cs.AI