arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Huazhong University of Science and Technology(华中科技大学)

共收录 702
2602.19974 2026-05-11 cs.CV

RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection

基于内在反思的生成式空间推理器:RL-RIG

Tianyu Wang, Zhiyuan Ma, Qian Wang, Xinyi Zhang, Xinwei Long, Bowen Zhou

机构 * Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫元学院) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 RL-RIG通过生成-反思-编辑范式,提升图像生成的精细空间关系捕捉能力,采用Scene Graph IoU和VLM评估策略,在空间一致性上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06658 2026-05-08 cs.CV

Relit-LiVE: Relight Video by Jointly Learning Environment Video

Relit-LiVE: 通过联合学习环境视频实现视频照明

Weiqing Xiao, Hong Li, Xiuyu Yang, Houyuan Chen, Wenyi Li, Tianqi Liu, Shaocong Xu, Chongjie Ye, Hao Zhao, Beibei Wang

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Chinese Academy of Sciences(中国科学院大学) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 Relit-LiVE通过引入原始参考图像和环境视频预测方法,实现了无需相机姿态先验知识的物理一致视频照明,提升了真实场景下的照明效果和时间稳定性。

Comments Accepted at SIGGRAPH 2026. Project site: https://github.com/zhuxing0/Relit-LiVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06096 2026-05-08 cs.CL cs.CV

Uncovering Entity Identity Confusion in Multimodal Knowledge Editing

揭示多模态知识编辑中的实体身份混淆

Shu Wu, Xiaotian Ye, Xinyu Mou, Dongsheng Liu, Xiaohan Wang, Mengqi Zhang

机构 * New Laboratory of Pattern Recognition (NLPR)(模式识别新实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing University of Posts and Telecommunications(北京邮电大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Huazhong University of Science and Technology(华中科技大学) Shandong University(山东大学)

AI总结 本文研究多模态知识编辑中实体身份混淆问题,发现现有方法无法区分图像-实体绑定与实体-实体关系,导致模型错误关联。通过构建EC-Bench基准测试,提出约束编辑阶段以提升绑定准确性,从而减少混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05951 2026-05-08 cs.AI

HaM-World: Soft-Hamiltonian World Models with Selective Memory for Planning

HaM-World: 带选择性记忆的软哈密顿世界模型用于规划

Haoyun Tang, Haodong Cui, Keyao Xu, Kun Wang, Zhandong Mei

机构 * Xi’an Jiaotong University(西安交通大学) Huazhong University of Science and Technology(华中科技大学) Nankai University(南开大学) Nanyang Technological University(南洋理工大学)

AI总结 HaM-World通过分解潜在状态为规范子空间和上下文子空间,结合Mamba选择性状态空间记忆,提升规划稳定性与鲁棒性,实现高精度预测和任务完成。

Comments 22 pages, 5 figures. Code: https://github.com/HaoyunT/HaM_World

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05819 2026-05-08 cs.LG

HCInfer: An Efficient Inference System via Error Compensation for Resource-Constrained Devices

HCInfer:通过误差补偿实现资源受限设备的高效推理系统

Shen Xu, Xiangwen Zhuge, Zhe Xu, Yingkun Hu, Zheng Yang, Yunhao Liu

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出HCInfer系统,通过将残差补偿任务卸载到CPU,利用GPU执行压缩主干网络,并引入异步补偿管道和敏感性感知的动态秩分配,以提高精度恢复和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05714 2026-05-08 cs.CV cs.RO

TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation

TriRelVLA:三元关系结构用于可迁移的具身操作

Hanyu Zhou, Chuanhao Ma, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

AI总结 TriRelVLA通过构建三元关系结构,解决视觉语言动作模型在未见场景和物体上的泛化问题,提升具身操作的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00117 2026-05-08 cs.RO cs.AI

PEPA: a Persistently Autonomous Embodied Agent with Personalities

PEPA:具有个性的持续自主体

Kaige Liu, Yang Li, Lijun Zhu, Weinan Zhang

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室)

AI总结 本文提出PEPA框架,通过三层认知架构实现持续自主,利用个性特质自主生成目标并维持行为演化,实验证明其在动态环境中稳定运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01347 2026-05-05 cs.CL cs.AI cs.LG

MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate

MAD-OPD: 突破基于策略的蒸馏的天花板:多智能体辩论

Jianze Wang, Ying Liu, Jinlong Chen, Xuchun Hu, Qilong Zhang, Yu Cao, Jun Wang, Hua Yang, Yong Xie, Qianglong Chen

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Alibaba Group(阿里巴巴集团)

AI总结 MAD-OPD通过多智能体辩论机制突破单教师限制,提出多教师辩论框架和基于任务的分歧原理,提升代理任务和代码生成性能。

Comments Preprint. 9-page main paper + appendix. 8 figures, 7 tables. Code: https://github.com/chiefovoavicii/MAD-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01255 2026-05-05 cs.LG

Activation Compression in LLMs: Theoretical Analysis and Efficient Algorithm

LLMs中的激活压缩:理论分析与高效算法

Wen-Da Wei, Han-Bin Fang, Yang-Di Liu, Jiang-Xin Shi, James Kwok, Yu-Feng Li

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Hong Kong University of Science and Technology(香港科学大学)

AI总结 本文提出一种激活-梯度联合压缩方法,通过低秩因子压缩线性层梯度,无需额外计算,提升LLM训练效率与压缩性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28196 2026-05-01 cs.CV

HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation

HERMES++:迈向统一的驾驶世界模型用于3D场景理解和生成

Xin Zhou, Dingkang Liang, Xiwu Chen, Feiyang Tan, Dingyuan Zhang, Hengshuang Zhao, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Mach Drive University of Hong Kong(香港大学)

AI总结 本文提出HERMES++,一种统一的驾驶世界模型,整合3D场景理解和未来几何预测。通过BEV表示、LLM增强世界查询和当前到未来链接等设计,提升驾驶场景的生成与理解能力。

Comments Extended version of ICCV 25 paper HERMES, Code: https://github.com/H-EmbodVis/HERMESV2, Project page: https://h-embodvis.github.io/HERMESV2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14602 2026-05-01 cs.RO cs.AI cs.HC

K2MUSE: A human lower-limb multimodal walking dataset spanning task and acquisition variability for rehabilitation robotics

K2MUSE:一种涵盖任务和采集变异性的下肢多模态行走数据集,用于康复机器人

Jiwei Li, Bi Zhang, Xiaowei Tan, Wanxin Chen, Zhaoyuan Liu, Juanjuan Zhang, Weiguang Huo, Jian Huang, Lianqing Liu, Xingang Zhao

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) College of Artificial Intelligence, Tianjin Key Laboratory of Intelligent Robotics, Nankai University(人工智能学院,天津智能机器人重点实验室,南开大学) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(人工智能与自动化学院,华中科技大学)

AI总结 K2MUSE数据集通过多模态数据揭示下肢康复机器人与生物力学信息的关系,为康复机器人开发提供大规模步态样本和数据驱动方法支持。

Comments 34 pages, 30 figures,7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26917 2026-04-30 cs.CV

AnimateAnyMesh++: A Flexible 4D Foundation Model for High-Fidelity Text-Driven Mesh Animation

AnimateAnyMesh++: 一种灵活的4D基础模型用于高质量文本驱动的网格动画

Zijie Wu, Chaohui Yu, Fan Wang, Xiang Bai

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab, Hangzhou, China(湖畔实验室) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)

AI总结 本文提出AnimateAnyMesh++,通过扩展数据集、改进架构和生成能力,实现高质量文本驱动的网格动画,提升了轨迹重建和几何保真度。

Comments 14 pages, TPAMI submission, code url: https://github.com/JarrentWu1031/AnimateAnyMesh-pp

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26806 2026-04-30 cs.CV cs.AI

ViCrop-Det: Spatial Attention Entropy Guided Cropping for Training-Free Small-Object Detection

ViCrop-Det: 基于空间注意力熵引导的裁剪用于无训练小目标检测

Hui Wang, Hongze Li, Wei Chen, Xiaojin Zhang

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)

AI总结 ViCrop-Det通过空间注意力熵引导裁剪,无需训练即可提升小目标检测性能,实验表明在VisDrone和DOTA-v1.5数据集上,其性能提升显著且计算开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26707 2026-04-30 cs.CV cs.LG

CurEvo: Curriculum-Guided Self-Evolution for Video Understanding

CurEvo: 基于课程引导的视频理解自进化

Guiyi Zeng, Junqing Yu, Yi-Ping Phoebe Chen, Xu Chen, Wei Yang, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) La Trobe University(拉特罗布大学) Beijing Institute of Computer Technology and Applications(北京计算机技术与应用研究院)

AI总结 CurEvo通过引入课程学习提升视频理解的自进化过程,实现更结构化的模型改进,验证了课程引导自进化在视频理解中的有效性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26353 2026-04-30 cs.CV

GateMOT: Q-Gated Attention for Dense Object Tracking

Mingjin Lv, Zelin Liu, Feifei Shao, Yi-Ping Phoebe Chen, Junqing Yu, Wei Yang, Zikai Song

机构 * Huazhong University of Science and Technology, Wuhan, China(华中科技大学,武汉,中国) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国) La Trobe University, Melbourne, Australia(拉筹伯大学,墨尔本,澳大利亚)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26252 2026-04-30 cs.CV

OmniTrend: Content-Context Modeling for Scalable Social Popularity Prediction

OmniTrend: 内容-上下文建模用于可扩展的社会流行度预测

Liliang Ye, Guiyi Zeng, Yunyao Zhang, Yi-Ping Phoebe Chen, Junqing Yu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) La Trobe University(拉特罗布大学)

AI总结 本文提出OmniTrend框架,通过分离内容吸引力与上下文曝光,提升跨平台流行度预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07080 2026-04-30 cs.RO cs.LG

VLN-Cache: Enabling Token Caching for VLN Models with Visual/Semantic Dynamics Awareness

VLN-Cache: 通过视觉/语义动态感知实现VLN模型的令牌缓存

Zihao Zheng, Zhihao Mao, Xingyue Zhou, Jiayu Chen, Maoliang Li, Xinhao Sun, Hailong Zou, Zhaobo Zhang, Xuanzhe Liu, Donggang Cao, Hong Mei, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学系) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学系) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学系)

AI总结 本文提出VLN-Cache框架,通过视觉动态感知和语义动态感知解决VLN模型中因视角和语义变化导致的缓存失效问题,实验显示在R2R-CE模拟基准上实现1.52倍的速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25655 2026-04-29 stat.ML cs.LG

Residual-loss Anomaly Analysis of Physics-Informed Neural Networks: An Inverse Method for Change-point Detection in Nonlinear Dynamical Systems with Regime Switching

基于物理信息神经网络的残差损失异常分析:一种用于具有切换模式的非线性动力系统中突变点检测的逆方法

Yuhe Bai, Chengli Tan, Jiaqi Li, Xiangjun Wang, Zhikun Zhang

机构 * School of Mathematics and Statistics(数学与统计学学院) Huazhong University of Science and Technology(华中科技大学) Northwestern Polytechnical University(西北工业大学)

AI总结 本文提出一种统一框架,利用物理信息学习范式中的动态一致性,联合推断分段参数和突变点,通过残差分析实现突变点检测与参数估计的联合优化,实验表明优于传统解耦方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25614 2026-04-29 cs.AI

HotComment: A Benchmark for Evaluating Popularity of Online Comments

HotComment: 一个评估在线评论流行度的基准

Yafeng Wu, Yunyao Zhang, Liliang Ye, Guiyi Zeng, Junqing Yu, Chen Xu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing Institute of Computer Technology and Applications(北京计算机技术与应用研究所)

AI总结 本文提出HotComment基准,通过内容质量、流行度预测和用户行为模拟三个维度评估在线评论的流行度,同时引入StyleCmt提升社交共振效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23690 2026-04-29 cs.CV

SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation

SynMotion: 语义-视觉适应用于运动定制视频生成

Shuai Tan, Biao Gong, Yujie Wei, Shiwei Zhang, Zhuoxin Liu, Ke Ma, Yan Wang, Kecheng Zheng, Xing Zhu, Yujun Shen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Ant Group(蚂蚁集团) Tongyi(通义) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Huazhong University of Science and Technology(华中科技大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 SynMotion通过联合语义指导和视觉适应,解决视频生成中语义与视觉信息的平衡问题,提出双嵌入语义理解机制和参数高效运动适配器,提升运动细节和时间一致性。

Comments Project page: https://lucaria-academy.github.io/SynMotion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24391 2026-04-28 cs.RO

FreqCache: Accelerating Embodied VLN Models with Adaptive Frequency-Guided Token Caching

FreqCache: 通过自适应频率引导的标记缓存加速具身VLN模型

Zihao Zheng, Xingyue Zhou, Zhihao Mao, Songyu Sun, Lingyue Zhang, Yulong Ao, Yupu Feng, Qiongqiong Zhang, Yonghua Lin, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Academy of Artificial Intelligence, BAAI(北京人工智能研究院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) School of EECS, Peking University(北京大学电子信息技术学院)

AI总结 本文提出FreqCache框架,通过频率域方法优化VLN模型中的标记缓存,解决传统视觉方法在视角迁移、边缘信息和场景时变性上的不足,实验显示其在计算效率上有1.59倍的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05970 2026-04-28 cs.CV cs.AI cs.CL

PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling

PDF-WuKong:一种用于高效长PDF阅读的大型多模态模型,采用端到端稀疏采样

Xudong Xie, Hao Yan, Liang Yin, Yang Liu, Jing Ding, Minghui Liao, Yuliang Liu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

AI总结 本文提出PDF-WuKong,一种针对长PDF文档的多模态大语言模型,通过端到端稀疏采样提升多模态问答效率,实验表明其在长文档理解任务中优于其他模型,F1得分平均高出8.6%。

Comments Accepted by International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23717 2026-04-28 cs.SD cs.CL

HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

HeadRouter: 任务自适应音频标记压缩中的动态头部权重路由

Peize He, Yaodi Luo, Xiaoqian Liu, Xuyang Liu, Jiahang Deng, Yaosong Du, Bangyu Li, Xiyan Gui, Yuxuan Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) DAIL Tech(DAIL科技) Northeastern University(东北大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 HeadRouter通过动态评估不同音频任务中注意力头的重要性,实现高效的音频标记压缩,实验表明其在多个基准上均取得最佳压缩效果。

Comments Homepage: https://dabdans.github.io/HeadRouter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23148 2026-04-28 cs.AI

PhySE: A Psychological Framework for Real-Time AR-LLM Social Engineering Attacks

PhySE: 一种用于实时AR-LLM社会工程攻击的心理学框架

Tianlong Yu, Yang Yang, Ziyi Zhou, Jiaying Xu, Siwei Li, Tong Guan, Kailong Wang, Ting Bi

机构 * Hubei University(湖北大学) Apple Inc(苹果公司) Huazhong University of Science and Technology(华中科技大学)

AI总结 PhySE通过视觉语言模型的社会上下文训练和自适应心理代理,解决AR-LLM社会工程攻击中的冷启动个性化和静态攻击策略问题,提升实时交互效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23141 2026-04-28 cs.CR cs.AI

UNSEEN: A Cross-Stack LLM Unlearning Defense against AR-LLM Social Engineering Attacks

UNSEEN: 一种跨栈LLM去学习防御对抗AR-LLM社会工程攻击

Tianlong Yu, Yang Yang, Xiao Luo, Lihong Liu, Fudu Xing, Zui Tao, Kailong Wang, Gaoyang Liu, Ting Bi

机构 * Hubei University(湖北大学) University of Southern California(南加州大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 针对AR-LLM社会工程攻击,提出UNSEEN跨栈防御机制,结合AR访问控制层、基于F-RMU的LLM去学习和运行时代理防护,通过用户研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10047 2026-04-28 cs.CV

MuSc-V2: Zero-Shot Multimodal Industrial Anomaly Classification and Segmentation with Mutual Scoring of Unlabeled Samples

MuSc-V2:基于未标记样本互评分的零样本多模态工业异常分类与分割

Xurui Li, Feng Xue, Yu Zhou

机构 * Huazhong University of Science and Technology(华中科技大学) University of Trento(特伦特大学)

AI总结 本文提出MuSc-V2框架,通过改进3D表示、融合多尺度特征及互评分机制,实现零样本多模态工业异常检测,提升MVTec 3D-AD和Eyecandies数据集性能。

Comments TPAMI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18836 2026-04-28 eess.IV cs.AI cs.CV

Dual-domain Multi-path Self-supervised Diffusion Model for Accelerated MRI Reconstruction

双域多路径自监督扩散模型用于加速MRI重建

Yuxuan Zhang, Jinkui Hao, Bo Zhou

机构 * Department of Radiology, Northwestern University(放射科,西北大学) Department of Biomedical Engineering, Huazhong University of Science and Technology(生物医学工程系,华中科技大学)

AI总结 本文提出双域多路径自监督扩散模型,通过自监督训练方案、轻量混合注意力网络和多路径推理策略,提升MRI重建的准确性、效率和可解释性,克服传统模型依赖全采样数据的局限。

Comments Accepted at IEEE-TNNLS, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22552 2026-04-27 cs.CV

Transferable Physical-World Adversarial Patches Against Pedestrian Detection Models

可迁移的物理世界对抗性补丁对抗行人检测模型

Shihui Yan, Ziqi Zhou, Yufei Song, Yifan Hu, Minghui Li, Shengshan Hu

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出TriPatch方法,结合多阶段协同攻击与物理多样性下的鲁棒性增强,解决现有物理攻击在多阶段决策管道系统中缺乏系统性干扰和复杂物理变化建模不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22302 2026-04-27 cs.CV

Knowledge Visualization: A Benchmark and Method for Knowledge-Intensive Text-to-Image Generation

知识可视化:一个用于知识密集型文本到图像生成的基准和方法

Ran Zhao, Sheng Jin, Size Wu, Kang Liao, Zerui Gong, Zujin Guo, Yang Xiao, Wei Li

机构 * Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

AI总结 本文提出KVBench基准,评估知识密集型文本到图像生成的可靠性,揭示现有模型在逻辑推理和符号精度上的不足,并提出KE-Check框架提升科学准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21508 2026-04-24 cs.AI q-bio.BM

BioMiner: A Multi-modal System for Automated Mining of Protein-Ligand Bioactivity Data from Literature

BioMiner:一种用于从文献中自动挖掘蛋白质-配体生物活性数据的多模态系统

Jiaxian Yan, Jintao Zhu, Yuhang Yang, Qi Liu, Kai Zhang, Zaixi Zhang, Xukai Liu, Boyan Zhang, Kaiyuan Gao, Jinchuan Xiao, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室) Princeton University(普林斯顿大学) Huazhong University of Science and Technology(华中科技大学) Infinite Intelligence Pharma(无限智能制药)

AI总结 BioMiner通过多模态框架提取生物活性数据,解决手动整理与文献增长不匹配的问题,其核心方法结合直接推理和化学结构解析,实现生物活性三元组的高准确率提取。

Comments 20 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏