arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-07-22 至 2026-07-22 共收录 6
2607.18749 2026-07-22 cs.LG cs.CL cs.ET q-bio.NC 新提交

Is EEG-to-Text Feasible in Real-World Scenarios? An In-Depth Analysis Using a Neuropsychology-Inspired Benchmark

脑电到文本在现实场景中可行吗?使用受神经心理学启发的基准进行深入分析

Zihan Zhang, Yu Bao, Xiao Ding, Tianyi Jiang, Kai Xiong

机构 * Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology(哈尔滨工业大学社会计算与交互机器人研究中心) Shanghai Innovation Institute(上海创新院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Zhongguancun Laboratory(中关村实验室)

AI总结 探讨脑电到文本在现实场景的可行性,利用受神经心理学启发的范式,发现现有基准忽略脑电不稳定性问题。通过实验为无教师强制的EEG2Text解码提供证据,构建COFETT基准,可区分模型性能,实现稳健评估,推动EEG2Text实际应用。

Comments 17 pages, 8 figures. Published in Proceedings of ACL 2026 Main Conference

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, Volume 1: Long Papers (2026), 1378-1393

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07649 2026-07-22 cs.CV cs.AI 版本更新

ViMax: Agentic Video Generation

ViMax: 智能体视频生成

Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang

机构 * The University of Hong Kong(香港大学) South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 提出ViMax框架,通过多智能体协作实现长视频生成,利用分层叙事引擎和视觉一致性机制,保证叙事连贯性和视觉一致性。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13632 2026-07-22 cs.RO cs.CV 版本更新

Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models

引导、思考、行动:面向视觉-语言-动作模型的交互式具身推理

Yiran Ling, Qing Lian, Jinghang Li, Qing Jiang, Tianming Zhang, Xiaoke Jiang, Chuanxiu Liu, Jie Liu, Lei Zhang

机构 * Futian Laboratory(福田实验室) Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA)) School of Robotics, Hunan University(湖南大学机器人学院) South China University of Technology(华南理工大学) Visincept(Visincept公司) National Key Laboratory of Smart Farm Technologies and Systems(智能农业技术与系统国家重点实验室)

AI总结 本文提出GTA-VLA框架,通过允许用户用显式视觉提示引导机器人策略,实现空间可调节的具身推理。该框架整合了外部指导与内部任务规划,提升了在视觉歧义和错误恢复中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06931 2026-07-22 cs.CV cs.AI cs.CL

Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos

通过真实照片生成面部-only反事实来衡量视觉语言模型中的社会偏见

Haodong Chen, Qiang Huang, Jiaqi Zhao, Qiuping Jiang, Xiaojun Chang, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) School of Information Science and Engineering, Ningbo University(宁波大学信息科学与工程学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

AI总结 本文提出通过真实照片生成面部-only反事实来评估视觉语言模型中的社会偏见,构建了FOCUS数据集和REFLECT基准,发现严格视觉控制下仍存在种族性别差异,强调了反事实审计和任务设计的重要性。

Comments 18 pages, 18 figures, and 3 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 39963-39987, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14586 2026-07-22 cs.IR cs.AI 版本更新

CPGRec+: A Balance-oriented Framework for Personalized Video Game Recommendations

CPGRec+: 一种面向个性化视频游戏推荐的平衡框架

Xiping Li, Aier Yang, Jianghong Ma, Kangzhe Liu, Shanshan Feng, Haijun Zhang, Yi Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Computer Science, Wuhan University(武汉大学计算机学院)

AI总结 本文提出CPGRec+框架,通过引入偏好引导边加权和表示生成模块,解决传统推荐系统在准确率与多样性间的平衡问题,实验表明其在Steam数据集上表现更优。

Comments Published in ACM Transactions on Information Systems (TOIS). 43 pages, 9 figures

Journal ref ACM Trans. Inf. Syst. 44, 3, Article 66 (March 2026), 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25699 2026-07-22 cs.CV 版本更新

AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning

AIM-CoT:基于主动信息的多模态链式推理用于视觉-语言推理

Xiping Li, Jianghong Ma

机构 * The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出AIM-CoT框架,通过上下文增强注意力图生成、主动视觉探测和动态注意力转移触发,改进视觉语言模型的证据选择与插入触发,提升视觉-语言推理性能。

Comments Accepted by ACL 2026 Main Conference. 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏