arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1952
2608.06975 2026-08-10 cs.CL cs.AI 新提交

PHASE-Tree: Modeling Character-State Evolution in Long-Horizon Role-Playing Dialogue

PHASE-Tree:建模长回合角色扮演对话中的角色状态演化

Bo Tang, Jianan Yang, Junyi Zhu, Yiquan Wu, Rui Zhao, Zhengyu Yang, Yang Zhang, Feiyu Xiong, Zhiyu Li, Jiajun Shen

机构 * MemTensor (Shanghai) Technology(MemTensor(上海)科技) KU Leuven(鲁汶大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Sinar Mas Paper (China) Investment Co., Ltd(金光纸业(中国)投资有限公司) The Hong Kong Polytechnic University(香港理工大学)

AI总结 针对长回合角色扮演对话的角色状态演化问题,提出多时间尺度角色状态树模型PHASE-Tree,构建基准LongEvoRoleBench并验证其在角色生成任务上的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06931 2026-08-10 cs.AI 新提交

Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

科学边缘评估:SEE——迈向真实科学发现的缺失环节

Taolin Han, Yuchen Zhang, Jinghang Wang, Yun Wu, Wai Yuet Chiu, Zhaohai Li, Yifei Zhang, Jinxin Wang, Yuhao Zhou, Chen Zhao, Jiajia Li, Jiaxin Li, Qile Jin, Kewei Sun, Shuang Wu, Weiqi Zhai, Renquan Lv, Junchao Li, Ruodan Chen, Qingteng Chen, Zhibo Yang, Hu Wei, Lin Qu, Shuai Bai, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) University of Alberta(阿尔伯塔大学) Zhejiang University(浙江大学)

AI总结 该研究构建多模态基准SEE评估19个MLLMs,发现其仅达48.7%准确率,通用模型优于专用模型,工具使用可提至52.7%但仍难实现科学发现所需的证据约束推断,需从解释转向推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06849 2026-08-10 cs.CL cs.AI 新提交

Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry

头自主性:基于冻结查询-键几何的无数据稀疏注意力

Yehan Yang, Junyuan Shang, Yang Li, Guanqun Zhao, Shuohuan Wang, Dianhai Yu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing University of Posts and Telecommunications(北京邮电大学) Baidu Inc.(百度公司)

AI总结 本研究提出无数据稀疏注意力方法 AoH,通过查询-键投影谱几何识别检索头与流头,在 50% 稀疏度下平均保留全注意力 96.5% 性能,同时显著降低 LLM 的计算延迟与 KV-cache 内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08531 2026-08-10 cs.AI 版本更新

ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

VESTA: 一种全自动的LLM智能体场景生成与安全评估框架

Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng

机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Long-term AI(长期人工智能)

AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06756 2026-08-10 cs.CL 版本更新

How Long Reasoning Chains Influence LLMs' Judgment of Answer Factuality

推理链长度如何影响LLM对答案事实性的判断

Minzhu Tu, Shiyu Ni, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing University of Post and Telecommunications(北京邮电大学)

AI总结 研究探讨了推理链对LLM判断答案事实性的影响,发现弱判官易受推理存在影响,而强判官部分利用推理作为证据,但仍易被高质量推理链误导。

Comments ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07136 2026-08-10 cs.CV 版本更新

MotionStrata: Hierarchical Motion Latents for Compact Video Autoencoding

MotionStrata:用于紧凑视频自编码的分层运动隐变量

Wenzhang Sun, Huaize Liu, Chunfeng Wang, Biao Gong, Hao Li, Changqing Zou

机构 * University of Chinese Academy of Sciences(中国科学院大学) Li Auto Zhejiang Lab(浙江实验室) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 MotionStrata将运动预算分为全局与详细运动,在不增维度下实现分层表示,压缩时重建质量优于其他方法,为紧凑视频自编码提供新设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05928 2026-08-07 cs.LG 新提交

BioM-JEPA: joint-embedding prediction of graph-connected gene blocks in single cells

BioM-JEPA:单细胞中基于图连接基因块的联合嵌入预测

Yuhao Wang, Zelin Zang, Yuxuan Liu, Zhen Lei, Stan Z. Li

机构 * Westlake University(西湖大学) Centre for Artificial Intelligence and Robotics (CAIR), Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences (HKISI-CAS)(中国科学院香港创新研究院人工智能与机器人中心) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) University of Chinese Academy of Sciences (UCAS)(中国科学院大学)

AI总结 BioM-JEPA通过预测图连接基因块的聚合表示学习单细胞嵌入,在CellBench任务中实现最低扰动响应误差,微调与保留嵌入吞吐量优于scFoundation,为单细胞表示学习提供新预测单元。

Comments 34 pages, 6 figures, and 13 supplementary tables (Tables S1-S13); includes Supplementary Information with detailed training and evaluation protocols. Numerical source data for all figures are provided as ancillary files; training code and the BioM-JEPA checkpoint will be released via GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05741 2026-08-07 cs.CL cs.AI 新提交

Once a Response, Always a Response: Detecting LLM-generated Text via Latent Prompt Restoration

一次响应,始终是响应:通过潜在提示恢复检测大语言模型生成的文本

Hongrui Bao, Yubing Ren, Yanan Cao, Jinhan You, Fang Fang, Shi Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 针对现有零样本LLM生成文本检测器未考虑LLM训练过程的问题,提出无训练检测器EchoPrompt,通过潜在提示恢复实现零样本检测,在零样本检测器中达SOTA性能且稳健性强。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22380 2026-08-07 cs.CV 版本更新

IR275K: A Benchmark for Infrared Multi-Frame Super-Resolution Toward Efficient Remote Sensing

IR275K:面向高效遥感的红外多帧超分辨率基准测试

Jie Deng, Heyang Wang, Changxin Wang, Junkai Shen, Hongyi Chen, Zhiping He, Hongxing Qi, Xudong Zhang, Jianyu Wang

机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) Shanghai Institute of Technical Physics of the Chinese Academy of Sciences(中国科学院上海技术物理研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 该研究针对红外遥感中多帧超分辨率评估分散问题,引入IR275K基准测试。以CGMamba模型为例进行架构分析,其结合2D~RoPE与CGCM融合,实现高效重建,为红外MFSR方法评估及模型设计提供基础和起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27771 2026-08-07 cs.LG cs.CV 版本更新

NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning

NormGuard: 流匹配强化学习中保持奖励的范数约束

Tianlin Pan, Lianyu Pang, Cheng Da, Huan Yang, Changqian Yu, Kun Gai, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 针对流生成器强化学习后训练中感知质量下降的问题,提出NormGuard方法,通过铰链惩罚约束速度范数,在保持奖励的同时提升图像质量和真实性。

Comments v5: Fixed PDF rendering compatibility issue affecting Apple PDFKit (macOS Preview/iOS PDF viewer). No changes to technical content compared to v4

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25699 2026-08-07 cs.RO 版本更新

SA-LIVO: Efficient LiDAR-Inertial-Visual Odometry with Subspace-Aware Degeneracy Handling

SA-LIVO: 基于子空间感知退化处理的轻量级LiDAR-惯性-视觉里程计

Yinong Cao, Xin He, Shouzheng Zhu, Senyuan Wang, Changhui Jiang, Chenyang Zhang, Pingfeng He, Tingwei Wang, Yuwei Chen, Shijie Liu, Chunlai Li, Genghua Huang, Jianyu Wang

机构 * Key Laboratory of Space Active Opto-Electronics Technology, Shanghai Institute of Technical Physics, Chinese Academy of Sciences(中国科学院上海技术物理研究所空间主动光电技术重点实验室) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

AI总结 提出SA-LIVO系统,通过子空间感知信息融合(SAIF)框架对联合信息矩阵进行特征分解,在方向级别选择性融合LiDAR和视觉测量,解决LiDAR退化与视觉失效问题,实现高精度、低内存的实时里程计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09772 2026-08-07 cs.CV 版本更新

SemDINO: Foundation Prior-Guided Cross-Temporal Semantic Alignment Network for Remote Sensing Change Detection

SemDINO: 一种基于DINOv3的跨时间语义对齐变化检测网络

Xinyu Tong, Meihua Zhou, Jinxiao Sun, Zaiyan Zhang, Hongruixuan Chen, Lei Wang

机构 * Xinjiang Institute of Ecology and Geography, Chinese Academy of Sciences(中国科学院新疆生态与地理研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) College of Information and Communication Engineering, Harbin Engineering University(哈尔滨工程大学信息与通信工程学院)

AI总结 提出SemDINO网络,通过双分支编码器、多尺度时序交互、语义净化与变化增强模块,解决语义变化检测中跨时间对齐不足、多尺度表示弱及伪变化鲁棒性差的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03750 2026-08-07 cs.CR cs.AI cs.CL 版本更新

CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering

CREBench:评估大语言模型在密码二进制逆向工程中的能力

Baicheng Chen, Yu Wang, Ziheng Zhou, Xiangru Liu, Juanru Li, Yilei Chen, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Institute of Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Xiongan AI Institute(雄安人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学)

AI总结 本文提出CREBench基准,通过432个基于密码算法的挑战评估大语言模型在密码二进制逆向工程中的性能,发现GPT-5.4在该任务中表现优异,人类专家仍具优势。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05969 2026-08-07 cs.CV cs.AI cs.CL

Imagine How To Change: Explicit Procedure Modeling for Change Captioning

想象如何改变:用于变化描述的显式过程建模

Jiayang Sun, Zixin Guo, Min Cao, Guibo Zhu, Jorma Laaksonen

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Department of Computer Science, Aalto University(阿alto大学计算机科学系) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 ProCap通过动态过程建模改进变化描述,利用关键帧和可学习查询提升描述准确性与效率。

Comments Accepted to ICLR 2026. Code and models are available at https://github.com/BlueberryOreo/ProCap

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12226 2026-08-07 cs.CV 版本更新

Ultrasound Tomography of Musculoskeletal Tissues with Generative Neural Physics

生成式神经物理实现组织力学的定量体积超声成像

Zhijun Zeng, Youjia Zheng, Chang Su, Qianhang Wu, Hao Hu, Zeyuan Dong, Yang Lv, Ligang Cui, Zhiyong Hou, Weijun Lin, Zuoqiang Shi, Yubing Li, He Sun

机构 * College of Future Technology, Peking University(未来技术学院,北京大学) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心) Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) School of Physical Sciences, University of Chinese Academy of Sciences(中国科学院大学物理科学学院) School of EECE, University of Chinese Academy of Sciences(中国科学院大学电子工程与计算机科学学院) Department of Orthopedics, Peking University Third Hospital(北京大学第三医院骨科部) Department of Ultrasound, Peking University Third Hospital(北京大学第三医院超声科) Department of Orthopaedic Surgery, The Third Hospital of Hebei Medical University(河北医科大学第三医院骨科部) Yau Mathematical Sciences Center, Tsinghua University(清华大学姚期智数学科学中心) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications(北京燕琦湖数学科学与应用研究院)

AI总结 该研究提出生成式神经物理框架,结合生成网络与物理信息神经模拟,实现了快速高保真三维超声断层成像,可在十分钟内重建组织参数三维图谱,分辨率媲美MRI,推动定量超声断层成像用于肌肉骨骼成像的临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14243 2026-08-07 cs.CV 版本更新

Multi-Representation Geometric Hierarchy Fusion: An Implicit-Submap Driven Framework for Resilient 3D Place Recognition

多表示几何层次融合:一种用于鲁棒三维地点识别的隐式子图驱动框架

Xiaohui Jiang, Haijiang Zhu, Chade Li, Ning An

机构 * College of Information and Technology, Beijing University of Chemical Technology(信息与技术学院,北京化工大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Research Institute of Mine Artificial Intelligence, China Coal Research Institute(矿山人工智能研究院,中国煤炭科研院)

AI总结 针对激光雷达地点识别中描述子不稳定与表示脆弱性问题,本文提出隐式神经点驱动的多表示几何层次融合框架,在多数据集上实现鲁棒性能,平衡了精度、效率与内存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05078 2026-08-06 cs.RO 新提交

SpikingNav: Robust Embodied Navigation with Spiking Neural Policies

SpikingNav:基于脉冲神经网络策略的鲁棒具身导航

Jiahong Zhang, Sijun Shen, Dehua Wu, Yifan Lin, Xuechen Xia, Xu Chu, Youhui Zhang, GuoqiLi

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心)

AI总结 本文提出SpikingNav脉冲导航框架,含SSE与SPN,在PointNav、ObjectNav任务中,其参数更少、计算量更低,鲁棒性优于匹配的ANN基线,且可部署于Thruster-V2芯片。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05042 2026-08-06 cs.RO 新提交

BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation

BridgeVLA++:一种面向三维操作的数据高效、可泛化且内存增强的视觉-语言-动作框架

Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges ByteDance Seed(字节跳动种子实验室)

AI总结 本研究提出内存增强的三维VLA框架BridgeVLA++,通过新增时空记忆架构,在保留原模型数据效率与泛化能力的同时,提升了记忆相关操作性能,且在多任务与真实平台上验证了其有效性。

Comments This work has been submitted to the IEEE TPAMI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04633 2026-08-06 cs.RO 新提交

Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models

Mind-VLA:面向视觉-语言-动作模型的指令感知空间表示对齐方法

Xingyu Ding, Yuzhong Zhao, Yang Wu, Chaoyang Zhao, Chunhai Zhao, Yifan Zhang, Jian Cheng

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文针对现有VLA方法忽略指令指定目标物体3D几何的问题,提出Mind-VLA方法,通过对齐目标物体相关特征实现指令感知3D理解,在LIBERO、CALVIN及真实机器人遮挡任务上性能显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04442 2026-08-06 cs.LG cs.CV 新提交

Robustness Emerges Early in Training Dynamics, but Is Not Preserved

训练动态中鲁棒性早期出现但无法保留

Jiangang Yang, Wenhui Shi, Lu Hu, Jing Xing, Jian Liu

机构 * Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 针对深度神经网络训练中早期出现的鲁棒性无法保留的问题,提出含EPS和AWR两种无参数策略的框架,在多任务中显著提升性能。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04377 2026-08-06 cs.LG cs.AI 新提交

Towards Trustworthy Hypergraph Neural Networks under Label Noise

面向标签噪声下可信赖的超图神经网络

Mengyao Zhou, Zhiheng Zhou, Xiao Han, Guiying Yan

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Mathematics and Statistics, Shandong University(山东大学数学与统计学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

AI总结 本文针对标签噪声下超图节点分类问题,提出超图鲁棒框架HyperTrust,通过估计超边可信赖性及两个协同模块优化超图结构,在多数据集多噪声设置下验证了其有效性。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01953 2026-08-06 cs.CL cs.LG 版本更新

Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation

蒸馏前先前瞻:智能体策略内蒸馏中教师指导的未来轨迹验证

Chishui Chen, Yaoyou Fan, Te Sun, Yi Yang, Chenghao Sun, Delin Mao, Hongbo Qiao, Zuowei Zhang, Junxi Wang, Chenxing Sun, Yangen Hu, Lu Pan, Xuyang Liu, Linfeng Zhang

机构 * Meituan LongCat Interaction(美团龙猫交互) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Peking University(北京大学) Nanjing University(南京大学) University of Chinese Academy of Sciences(中国科学院大学) Jilin University(吉林大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 该研究针对策略内蒸馏的学生轨迹偏差问题,提出FutureBridge-OPD方法,在多任务基准上显著优于现有方法,代码公开可用。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00155 2026-08-05 cs.AI cs.LG 交叉投稿

AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?

AgentStream:自进化大语言模型智能体在流式任务下的表现如何?

Dong Yan, Jian Liang, Dapeng Hu, Ran He, Nicholas Jing Yuan, Qi Zhang, Tieniu Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Microsoft(微软公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

AI总结 本文提出AgentStream框架,评估三种流式场景下三种基础模型的五种自进化LLM智能体方法,发现自进化表现受场景、模型能力等影响,为方法选择提供指导。

Comments Code is available at https://github.com/Jasper-Yan/AgentStream

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17674 2026-08-05 cs.CV 版本更新

SVL: Empowering Spiking Neural Networks for Efficient 3D Open-World Understanding

SVL:基于脉冲的视觉-语言预训练用于高效的3D开放世界理解

Xuerui Qiu, Peixi Wu, Yaozhi Wen, Shaowei Gu, Yuqi Pan, Xinhao Luo, Bo XU, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

AI总结 SVL提出基于脉冲的视觉-语言预训练框架,通过多尺度三元组对齐和可重参数化的视觉-语言整合,提升SNN在3D开放世界理解中的性能,实现高效零样本3D分类和多模态问答。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23953 2026-08-05 cs.CV 版本更新

T2VAttack: Adversarial Attack on Text-to-Video Diffusion Models

T2VAttack:针对文本到视频扩散模型的对抗攻击

Changzhen Li, Yuecong Min, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen

机构 * Hangzhou Institute for Advanced Study, UCAS, school of Intelligent Science and Technology(杭州高等研究院,UCAS,智能科学与技术学院) State Key Laboratory of AI Safety, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences (UCAS)(中国科学院大学)

AI总结 T2VAttack研究了文本到视频扩散模型的对抗攻击,提出两种攻击方法揭示模型在语义和时间动态上的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02589 2026-08-04 cs.CV 新提交

CAPEval: A Decoupled Caption Evaluation across Understanding and Generation

CAPEval:跨理解与生成的解耦式标题评估

Zhipeng Liu, Haochen Wang, Zhaoxiang Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本研究提出解耦式标题评估基准CAPEval,将标题质量分为覆盖度与精确度,发现二者分别对应理解与生成任务性能,为标题生成器的选择优化提供指导。

Comments 21 pages, 8 figures. Code and dataset will be available at https://liuzhipenggg.github.io/CAPEval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02583 2026-08-04 cs.CV cs.AI cs.CL cs.IR 新提交

UEmbed: Unified Sparse and Dense Multimodal Embeddings

UEmbed:统一稀疏与稠密多模态嵌入

Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu

机构 * CASIA(中国科学院自动化研究所) Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Yale University(耶鲁大学)

AI总结 UEmbed是一种仅解码器的多模态嵌入模型,可单次前向传播生成稀疏与稠密表示,在MMEB-v2和BEIR上表现优异,统一了两类嵌入并支持多模态智能体应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02432 2026-08-04 cs.CV 新提交

Learning to Tessellate: Point Cloud Generation via Recursive Spectral Partitioning

学习镶嵌:通过递归谱划分生成点云

Monan Sun, Bangzhen Liu, Huaidong Zhang, Shengfeng He

机构 * South China University of Technology(华南理工大学) University of Chinese Academy of Sciences(中国科学院大学) City University of Hong Kong(香港城市大学) Singapore Management University(新加坡管理大学)

AI总结 该研究提出自回归框架PointRSP,通过拓扑保留的递归谱划分实现点云生成,引入拓扑感知划分自编码器与双流级联生成器,在生成质量、多样性及复杂3D拓扑泛化上达最优性能。

Comments Accepted by ECCV2026, project page: https://huggingface.co/Mo-nan/PointRSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02378 2026-08-04 cs.LG 新提交

Gecko: Fast Private Inference via Secure Public Encoder Offloading

Gecko:通过安全的公共编码器卸载实现快速私有推理

Cheng'an Wei, Kai Chen, Yue Zhao, Congyi Li, Shenchen Zhu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

AI总结 Gecko通过安全卸载公共编码器实现快速私有推理,在图像和音频任务中推理耗时0.4-2.2秒、通信量≤10.8 MB,准确率与迁移学习基线相当,且能抵御模型提取攻击。

Comments 12 pages, 10 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02184 2026-08-04 cs.AI cs.FL cs.LO 新提交

PAC Approximation and DIRECT Optimization for Parametric Markov Models

参数马尔可夫模型的PAC近似与DIRECT优化

Zhiming Chi, Ying Liu, Andrea Turrini, Lijun Zhang, David N. Jansen

机构 * Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Institute of Optics and Electronics, Chinese Academy of Sciences(中国科学院光电技术研究所) Institute of Intelligent Software Guangzhou(广州智能软件研究所)

AI总结 本文针对参数马尔可夫决策过程,采用场景方法合成PAC近似,结合统计模型检查分析黑盒参数模型,集成DIRECT算法实现无导数全局优化,在2997个基准上验证了DIRECT优化组件的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏