ESC: Emotional Self-Correction for Reliable Vision-Language Models
ESC:面向可靠视觉语言模型的情感自我纠正
Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy, Hung Viet Nguyen, Huy Nguyen Minh Nhat, Thanh-Huy Nguyen, Cuong Tuan Nguyen, Hoang M. Le, Dat Nguyen, Phat Kim Huynh, Min Xu, Ulas Bagci
机构
*
1 GenAI4E Lab 2 University of Information Technology, Ho Chi Minh City, Vietnam 3 Universit\"at Trier, Germany 4 Ho Chi Minh University of Technology, Ho Chi Minh City, Vietnam 5 PAMI Lab, Vietnamese German University, Vietnam 6 Vietnam National University, Ho Chi Minh City, Vietnam 7 Carnegie Mellon University, USA 8 Omoshiroi AI, USA 9 Harvard University, USA 10 Basis Research Institute 11 PASSIO Laboratory, North Carolina A\&T State University, USA 12 Mohamed bin Zayed University of Artificial Intelligence, UAE 13 Northwestern University, USA [4pt] Equal contribution. Corresponding author
Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum
Wiki-R1: 通过数据和采样课程激励基于知识的多模态推理用于VQA
Shan Ning, Longtian Qiu, Xuming He
机构
*
ShanghaiTech University(上海科技大学)
;
Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心)
;
Lingang Laboratory(临港实验室)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)
SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces
SkillFuzz: 面向开放技能市场中隐式意图发现的技能组合模糊测试
Jinwei Hu, Yi Dong, Youcheng Sun, Xiaowei Huang
机构
*
School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中
推理与问题求解
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering
SPADER: 面向多答案问答的逐步同伴优势与多样性感知探索奖励
Qiming Shi, Zhaolu Kang, Yunfan Zhou, Di Weng, Yingcai Wu
机构
*
State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室)
;
School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)
;
School of Software Technology, Zhejiang University(浙江大学软件技术学院)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
Teaching Vision-Language-Action Models What to See and Where to Look
教视觉-语言-动作模型看什么和看哪里
Yuguang Yang, Canyu Chen, Zhewen Tan, Yizhi Wang, Zichao Feng, Chunyang Liu, Kehua Sheng, Juan Zhang, Linlin Yang, Baochang Zhang, Yan Wang, Bo Zhang, Xianbin Cao
机构
*
School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院)
;
National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院)
;
Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
;
DiDi(滴滴出行)
;
State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室)
;
School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
;
School of Cyber Science and Technology, Beihang University(北京航空航天大学网络安全科学与技术学院)
;
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
机构
*
School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院)
;
Shenzhen Loop Area Institute(深圳河套学院)
;
School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)
;
Pengcheng Laboratory(鹏城实验室)
;
School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院)
;
Zhongguancun Academy(中关村学院)
;
City University of Hong Kong(香港城市大学)