arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

共收录 1439
2605.16519 2026-05-19 cs.CV eess.SP

DepthPolyp: Pseudo-Depth Guided Lightweight Segmentation for Real-Time Colonoscopy

DepthPolyp:基于伪深度引导的轻量级分割用于实时结肠镜检查

Zhuoyu Wu, Wenhui Ou, Lexi Zhang, Pei-Sze Tan, Dongjun Wu, Junhe Zhao, Wenqi Fang, Raphaël C. -W. Phan

机构 * CyPhi AI Lab, Monash University, Malaysia Campus, Malaysia Department of Electronic \& Computer Engineering, Hong Kong University of Science \& Technology, Hong Kong, P.R. China Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, P.R. China Harbin Institute of Technology, Harbin, P.R. China

AI总结 本文提出DepthPolyp,一种基于伪深度引导的多任务学习轻量级分割框架,通过高效特征调制实现强跨数据集泛化能力,在实时结肠镜检查中表现出色。

Comments This paper has been accepted to the International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16363 2026-05-19 cs.LG cs.CY

ORACLE: Anticipating Scams from Partial Trajectories in Streaming App Usage

ORACLE:从流式应用使用轨迹中预见诈骗

Wenbo Gao, Songbai Tan, Zhongan Wang, Fei Shen, Gang Xu, Huiping Zhuang, Yunyun Yang, Ming Li, Xiaofeng Zhu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen University(深圳大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Guangming Laboratory(光明实验室) South China University of Technology(华南理工大学) Hainan University(海南大学)

AI总结 本文提出ORACLE框架,通过流式应用使用轨迹预测诈骗,利用自适应上下文管理器和自蒸馏方案提升早期欺诈检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03707 2026-05-18 cs.CL

AirNav: A Large-Scale UAV Vision-and-Language Navigation Dataset with Natural and Diverse Instructions

AirNav: 一个大规模无人机视觉与语言导航数据集,包含自然且多样的指令

Hengxing Cai, Yijie Rao, Ligang Huang, Zanyang Zhong, Jinhan Dong, Jingjun Tan, Changhao Nai, Jue Hou, Wenhao Lu, Renxin Zhong

机构 * School of Intelligent Systems Engineering, Sun Yat-Sen University(中山大学智能系统工程学院) Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University Of Posts and Telecommunications(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) Xiamen University(厦门大学) National University of Defense Technology(国防科技大学)

AI总结 本文提出AirNav数据集,包含137K自然多样指令的导航样本,评估了多种方法,提出AirVLN-R1模型在测试中取得51.82%的成功率,并通过实际无人机实验验证了仿真到现实的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15621 2026-05-18 cs.CV

LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs

LRCP: 低秩压缩性引导的视觉标记修剪用于高效的LVLMs

Hongyu Lu, Feng Zhang, Wenwei Jin, Huanling Hu, Tianjun Shi, Shikai Jiang, Yao Hu, Jiawei Li

机构 * Xiaohongshu(小红书) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学)

AI总结 本文提出LRCP,通过低秩压缩性引导视觉标记修剪,有效减少视觉语言模型的推理成本,实现94.7%的图像理解性能保留和88.9%的标记减少。

Comments The paper includes 11 figures, multiple tables, comprehensive experimental results on 11 image understanding benchmarks and 3 video benchmarks, with extensive ablation studies and qualitative visualizations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15535 2026-05-18 cs.CV

Learning Dynamic Structural Specialization for Underwater Salient Object Detection

学习动态结构专业化用于水下显著目标检测

Lin Hong, Chenhui Wang, Linan Deng, Yuning Cui, Yu Zhang, Xin Wang, Bojian Zhang, Wenqi Ren, Xingchen Yang, Fumin Zhang

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) School of Robotics and Advanced Manufacture, Harbin Institute of Technology(机器人与先进制造学院,哈尔滨工业大学) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) College of Computer Science & Visual Computing and Intelligent Perception Lab, Nankai University(计算机科学与视觉计算学院及智能感知实验室,南开大学) School of Cyber Science and Technology, Sun Yat-sen University(网络科学与技术学院,中山大学) School of Automation, Southeast University(自动化学院,东南大学)

AI总结 本文提出DSS-USOD方法,通过动态结构专业化解决水下图像退化导致的定位不准确、区域碎片化和边界预测粗的问题,提升边界精度与区域一致性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08894 2026-05-18 cs.CL cs.AI

Fitting Is Not Enough: Smoothness in Extremely Quantized LLMs

拟合并不足够:在极量化的LLM中平滑性

Yuzhuang Xu, Xu Han, Yuxuan Li, Pengzhan Li, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学)

AI总结 本文指出极量化LLM存在平滑性退化问题,通过平滑性代理发现量化位宽越小退化越严重,提出保持平滑性的方法提升性能,强调平滑性在极端量化中的重要性。

Comments 19 pages, 4 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14923 2026-05-15 cs.CV

SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding

SceneParser: 用于视觉语义理解的分层场景解析

Pengxin Xu, Xincheng Lin, Luping Xiao, Qing Jiang, Meishan Zhang, Hao Fei, Shanghang Zhang, Xingyu Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Zhongguancun Academy(中关村学院) Huazhong University of Science and Technology(华中科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) South China University of Technology(华南理工大学) University of Oxford(牛津大学) Peking University(北京大学)

AI总结 本文提出SceneParser,通过分层解析任务构建场景-对象-部件-功能的层次结构,利用结构完成伪标签和课程学习提升结构感知能力,实验表明其在复杂场景理解中表现更优。

Comments Preprint. Code, models, and dataset are provided in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14601 2026-05-15 cs.CV

Towards Accurate Single Panoramic 3D Detection: A Semantic Gaussian Centric Approach

迈向精确的单视角全景3D检测:一种语义高斯中心化方法

Kanglin Ning, Yiran Zhao, Wenrui Li, Shaoru Sun, Xingtao Wang, Xiaopeng Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Suzhou Research Institute of HIT(哈尔滨工业大学苏州研究院) The PengChengLab(鹏城实验室)

AI总结 本文提出PanoGSDet框架,通过连续语义3D高斯表示实现精准单视角全景3D检测,结合全景深度估计与语义高斯组件,提升3D目标检测性能。

Comments Current has been accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14232 2026-05-15 cs.RO

Reactive Planning based Control for Mobile Robots in Obstacle-Cluttered Environments

基于反应规划的移动机器人在障碍物密集环境中的控制

Li Tan, Junlin Xiong, Yan Wang, Wei Ren

机构 * Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学) School of Intelligence Science and Engineering, Harbin Institute of Technology Shenzhen(智能科学与工程学院,哈尔滨工业大学深圳) School of Control Science and Engineering, Dalian University of Technology(控制科学与工程学院,大连理工大学)

AI总结 本文提出基于反应规划的控制策略,用于移动机器人在障碍物密集环境中避障和导航,通过局部修改参考轨迹实现安全运动。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04885 2026-05-15 cs.AI

Proactive Memory for Ad-Hoc Recall over Streaming Dialogues

面向流式对话的主动记忆

Bingbing Wang, Jing Li, Ruifeng Xu

机构 * Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学) The School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出ProStream框架,通过分层结构和多粒度蒸馏实现流式对话中的主动记忆召回,解决记忆 fidelity 与效率的矛盾,提升推理精度并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03630 2026-05-15 cs.CL

Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases

推理模型优于LLM-判官,但存在偏见

Hui Huang, Xuanxin Wu, Muyun Yang, Yuki Arase

机构 * Institute of Science Tokyo(东京科学研究院) Harbin Institute of Technology(哈尔滨工业大学) The University of Osaka(大阪大学)

AI总结 本文系统比较了推理模型在判断任务中的表现,发现其在准确性、指令遵循和抗攻击能力上优于非推理LLM,但存在显著偏见,提出PlanJudge策略以缓解偏见问题。

Comments Accepted by ACL 2026 Workshop EvalEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13859 2026-05-15 cs.NE cs.AI cs.LG

BiSpikCLM: A Spiking Language Model integrating Softmax-Free Spiking Attention and Spike-Aware Alignment Distillation

BiSpikCLM: 一种整合无Softmax脉冲注意力和脉冲感知对齐蒸馏的脉冲语言模型

Sihang Guo, Chenlin Zhou, Jiaqi Wang, Kehai Chen, Qingyan Meng, Zhengyu Ma

机构 * School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University, Shenzhen, China(电子工程学院,深圳研究生院,北京大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学,深圳,中国)

AI总结 BiSpikCLM是首个完全二进制脉冲MatMul-free因果语言模型,通过无Softmax脉冲注意力和脉冲感知对齐蒸馏实现高效训练,显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07931 2026-05-15 cs.CV cs.AI

One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy

每帧一个令牌:重新考虑世界模型中的视觉带宽

Zuojin Tang, Shengchao Yuan, Xiaoxin Bai, Zhiyuan Jing, De Ma, Gang Pan, Bin Liu

机构 * Zhejiang University(浙江大学) Central South University(中南大学) Harbin Institute of Technology(哈尔滨工业大学) Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) E-surfing Digital Life Technology Co., Ltd., China Telecom(亿联数字生活技术有限公司,中国电信)

AI总结 本文提出OneWM-VLA,通过自适应注意力池化将每帧视图压缩为一个语义令牌,以单一流匹配目标生成潜在流和动作轨迹,从而减少每帧视觉带宽而不影响长视界性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13790 2026-05-14 cs.LG cs.AI

Di-BiLPS: Denoising induced Bidirectional Latent-PDE-Solver under Sparse Observations

Di-BiLPS:在稀疏观测下去噪诱导的双向隐空间求解器

Zhonghao Li, Chaoyu Liu, Qian Zhang

机构 * School of Science, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区科学学院) Department of Theoretical Physics(理论物理系) Applied Mathematics, University of Cambridge, Cambridge, United Kingdom(应用数学系,剑桥大学,英国)

AI总结 本文提出Di-BiLPS,一种在极稀疏观测下处理正向和逆向PDE问题的统一神经框架,结合变分自编码器、隐扩散模块和对比学习,提升求解效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13757 2026-05-14 cs.RO

FrameSkip: Learning from Fewer but More Informative Frames in VLA Training

FrameSkip: 从更信息丰富的较少帧中学习以在VLA训练中提升性能

Bin Yu, Shijie Lian, Xiaopeng Lin, Zhaolong Shen, Yuliang Wei, Changti Wu, Hang Yuan, Haishan Liu, Bailing Wang, Cong Huang, Kai Chen

机构 * Harbin Institute of Technology(哈尔滨理工大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Huazhong University of Science and Technology(华中科技大学) East China Normal University(华东师范大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beihang University(北航) DeepCybo

AI总结 本文提出FrameSkip框架,通过选择高重要性帧来优化VLA训练,提升成功率与保留率的平衡,实现在三个基准测试中达到76.15%的成功率。

Comments GitHub: https://github.com/ZGC-EmbodyAI/FrameSkip

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13678 2026-05-14 cs.LG

Three-Stage Learning Unlocks Strong Performance in Simple Models for Long-Term Time Series Forecasting

三阶段学习解锁简单模型在长期时间序列预测中的强大性能

Zhenan Yu, Guangxin Jiang, Jin Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出STAIR方法,通过三阶段学习提升简单时间映射模型性能,引入共享到个体微调和alpha-RevIN以缓解通道独立性和归一化先验限制,实验证明其在长期预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12072 2026-05-14 cs.CV

PairDropGS: Paired Dropout-Induced Consistency Regularization for Sparse-View Gaussian Splatting

PairDropGS: 基于配对 Dropout 引起的一致性正则化的稀疏视角高斯点云法

Hantang Li, Qiang Zhu, Xiandong Meng, Xingtao Wang, Debin Zhao, Xiaopeng Fan

机构 * School of Computer Science, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区计算机科学学院,中国) Pengcheng Laboratory, Shenzhen, China(鹏城实验室,中国) Smart Coding Institute, Pengcheng Laboratory, Shenzhen, China(鹏城实验室智能编码研究所,中国) School of Computer Science, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机科学学院,中国)

AI总结 本文提出PairDropGS,通过配对Dropout引起的一致性正则化改进稀疏视角高斯点云法,提升训练稳定性与重建质量,同时保持方法的简洁性和易用性。

Comments 11 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07770 2026-05-14 cs.DC cs.CL

ArcLight: A Lightweight LLM Inference Architecture for Many-Core CPUs

ArcLight:一种为多核CPU设计的轻量级大语言模型推理架构

Yuzhuang Xu, Xu Han, Yuxuan Li, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学)

AI总结 本文提出ArcLight,一种为多核CPU优化的LLM推理架构,通过高效内存管理和线程调度及精细控制的张量并行性,解决多核CPU上的跨节点内存访问瓶颈,实现更高的推理吞吐量。

Comments Accepted by ACL 2026 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07458 2026-05-14 cs.CV

SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning

SpatialReward: 通过显式空间推理弥合在线强化学习中图像编辑的感知差距

Yancheng Long, Yankai Yang, Hongyang Wei, Wei Chen, Tianke Zhang, Haonan fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)

AI总结 本文提出SpatialReward,通过显式空间推理提升在线强化学习中图像编辑的感知准确性,其在MMRB2和EditReward-Bench上表现优异,并在MultiEditReward-Bench上超越专用评估器。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13130 2026-05-14 cs.AI

GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training

GRACE:基于梯度对齐的推理数据整理以实现高效的后训练

Junjie Li, Ziao Wang, NingXuan Ma, Jianghong Ma, Xiaofeng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Hong Kong Baptist University, China(香港 Baptist 大学) City University of Hong Kong, China(香港城市大学)

AI总结 GRACE通过梯度对齐方法,对推理数据进行高效后训练,仅用20%的数据即可达到全数据性能的108.8%,5%数据仍保持100.2%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13083 2026-05-14 cs.RO

TouchAnything: A Dataset and Framework for Bimanual Tactile Estimation from Egocentric Video

TouchAnything: 一个用于从第一人称视频中估计双臂触觉的数据库和框架

Jianyi Zhou, Ziteng Gao, Feiyang Hong, Zirui Liu, Guannan Zhang, Weisheng Dai, Ruichen Zhen, Chuqiao Lyu, Haotian Wu, Yinian Mao, Xushi Wang, Yuxiang Jiang, Wenbo Ding, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院) Meituan Academy of Robotics(美团机器人研究院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出EgoTouch数据库和TouchAnything框架,通过多视角视频数据提升双臂触觉估计性能,实验表明结合腕部视角可提升接触和体积IoU指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12916 2026-05-14 cs.MA cs.LG

SHM-Agents: A Generalist-Specialist Integrated Agent System for Structural Health Monitoring

SHM-Agents:一种用于结构健康监测的通用-专家集成代理系统

Yuequan Bao, Xing Li, Huabin Sun, Dawei Liu, Yuxuan Tian, Haiyang Hu

机构 * Key Lab of Smart Prevention and Mitigation of Civil Engineering Disasters of the Ministry of Industry and Information Technology, Harbin Institute of Technology, Harbin(工业和信息化部智能防灾减灾重点实验室,哈尔滨工业大学,哈尔滨) Key Lab of Structures Dynamic Behavior and Control of the Ministry of Education, Harbin Institute of Technology, Harbin(教育部结构动态行为与控制重点实验室,哈尔滨工业大学,哈尔滨) School of Civil Engineering, Harbin Institute of Technology, Harbin(哈尔滨工业大学土木工程学院)

AI总结 本文提出SHM-Agents,结合大语言模型的推理能力与专用算法的问题解决能力,实现结构健康监测任务的端到端执行,提升部署效率与系统扩展性。

Comments 19 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22910 2026-05-14 cs.CL

EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction

EchoKV: 通过基于相似性的重建实现高效的KV缓存压缩

Shiyu Ji, Yixuan Wang, Yijun Liu, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology, China(社会计算与交互机器人研究院,哈尔滨工业大学,中国)

AI总结 本文提出EchoKV框架,支持按需切换全缓存与压缩缓存,利用轻量网络重建丢弃的KV组件,通过层内和层间相似性提升压缩效率,实验显示其在多种压缩比和模型上均优于现有方法,保持短上下文场景的吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09636 2026-05-14 cs.AI cs.CV cs.HC cs.LG

PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records

PersonalAlign:面向个性化GUI代理的分层隐式意图对齐

Yibo Lyu, Gongwei Chen, Rui Shao, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出PersonalAlign,通过长期用户记录实现个性化GUI代理的隐式意图对齐,引入AndroidIntent基准测试,评估代理在模糊指令解析和主动建议中的表现,HIM-Agent在执行和主动性能上提升显著。

Comments Accepted to ACL26 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14129 2026-05-14 cs.CV

PVLM: Parsing-Aware Vision Language Model with Dynamic Contrastive Learning for Zero-Shot Deepfake Attribution

PVLM:面向零样本深度伪造属性识别的解析感知视觉语言模型

Yaning Zhang, Jiahe Zhang, Chunjie Ma, Weili Guan, Tian Gan, Zan Gao

机构 * Faculty of Computer Science and Technology, Qilu University of Technology (Shandong Academy of Sciences)(计算机科学与技术学院,齐鲁工业大学(山东省科学院)) Shandong University of Science and Technology(山东科技大学) Shandong Artificial Intelligence Institute, Qilu University of Technology (Shandong Academy of Sciences)(山东省人工智能研究院,齐鲁工业大学(山东省科学院)) School of Electronics and Information Engineering, Harbin Institute of Technology(电子与信息工程学院,哈尔滨工业大学(深圳)) School of Computer Science and Technology, Shandong University(计算机科学与技术学院,山东大学)

AI总结 本文提出PVLM模型,通过动态对比学习实现对未知高级生成器的细粒度追踪,利用面部解析特征捕捉伪造表示,提升深度伪造属性识别性能。

Comments Accepted to IEEE Transactions on Dependable and Secure Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12185 2026-05-13 cs.CL cs.AI

Mitigating Context-Memory Conflicts in LLMs through Dynamic Cognitive Reconciliation Decoding

通过动态认知协调解码缓解LLM中的上下文内存冲突

Yigeng Zhou, Wu Li, Yifan Lu, Yequan Wang, Xuebo Liu, Wenya Wang, Jun Yu, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Nanyang Technological University(南洋理工大学)

AI总结 本文提出动态认知协调解码方法,通过分析注意力图预测潜在冲突并选择解码路径,提升LLM在处理上下文内存冲突时的准确性和效率,同时构建ConflictKG基准测试集验证效果。

Comments Accepted by IEEE TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11402 2026-05-13 cs.LG cs.CR cs.NI

More Than Meets the Eye: A Semantics-Aware Traffic Augmentation Framework for Generalizable Website Fingerprinting

看得更远:一种语义感知的流量增强框架用于可推广的网站指纹识别

Youquan Xian, Xueying Zeng, Lingjia Meng, Lei Cui, Runhan Song, Wei Wang, Zhengquan Ding, Peng Liu, Zhiyu Hao

机构 * School of Cyberspace Security, Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学信息安全学院) School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) Faculty of Computing, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机学院) School of Computer Science and Engineering, Guangxi Normal University, Guilin, China(广西师范大学计算机科学与工程学院) Zhongguancun Laboratory, Beijing, China(中关村实验室)

AI总结 本文提出SATA框架,通过协议规则增强应用层语义并引入跨层特征对齐机制,提升网站指纹识别在复杂场景下的泛化能力,实验显示其在开放世界设置中显著提升准确率和AUC。

Comments 18 pages, 19 figures, Submitted to NDSS 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12034 2026-05-13 cs.CV cs.LG cs.MM

Calibrated Multimodal Representation Learning with Missing Modalities

校准的多模态表示学习与缺失模态

Xiaohao Liu, Xiaobo Xia, Jiaheng Wei, Shuo Yang, Xiu Su, See-Kiong Ng, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Central South University(中南大学)

AI总结 本文提出CalMRL,通过校准缺失模态导致的不完整对齐问题,从锚点偏移角度提供理论见解,结合先验知识和模态间联系,解决优化难题,验证了方法的有效性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10622 2026-05-12 cs.MM cs.CV

Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination

LVLMs中的词汇劫持:通过排除惰性标记来揭示关键注意力头以缓解幻觉

Yangneng Chen, Junlin Li, Weijun Yao, Xilai Ma, Guodong Du, Wenya Wang, Jing Li

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

AI总结 本文通过分析LVLMs的注意力机制,揭示了词汇劫持现象,提出HABI方法定位惰性标记,并引入NHAR指标评估其影响,最终提出HAVAE方法增强关键注意力头以减少幻觉。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10366 2026-05-12 cs.AI

EGL-SCA: Structural Credit Assignment for Co-Evolving Instructions and Tools in Graph Reasoning Agents

EGL-SCA:图推理代理中协同指令与工具的结构信用分配

Zike Yuan, Yukun Cao, Han Zhang, Jianzhi Yan, Le Liu, Cai ke, Yue Yu, Hui Wang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Technology(计算机科学与技术学院)

AI总结 本文提出EGL-SCA框架,通过结构信用分配机制协同优化指令与工具,提升图推理代理的结构正确性与执行效率,实验显示其在四个基准测试中达到92.0%的平均成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏