arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

AAAI Conference on Artificial Intelligence · 会议 · Artificial Intelligence

共收录 9565
2511.06240 2026-01-06 cs.RO cs.AI

Affordance-Guided Coarse-to-Fine Exploration for Base Placement in Open-Vocabulary Mobile Manipulation

基于 affordance 的粗到细探索用于开放词汇移动操控中的基座放置

Tzu-Jung Lin, Jia-Fong Yeh, Hung-Ting Su, Chung-Yi Lin, Yi-Ting Chen, Winston H. Hsu

AI总结 本文提出了一种基于 affordance 的粗到细探索方法,通过结合视觉语言模型的语义理解和几何可行性,提升开放词汇移动操控中基座放置的成功率。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11176 2026-01-06 cs.CV cs.AI

G2L:From Giga-Scale to Cancer-Specific Large-Scale Pathology Foundation Models via Knowledge Distillation

G2L:从千兆级到癌症特异性大规模病理基础模型的知识蒸馏

Yesung Cho, Sungmin Lee, Geongyu Lee, Minkyung Lee, Jongbae Park, Dongmyung Shin

AI总结 G2L框架通过知识蒸馏将千兆级模型能力转移到大规模模型,以更少的参数和数据实现癌症特异性任务的高性能表现。

Comments Accepted in AAAI 2026 workshop in Health Intelligence Special Theme on Foundation Models and AI Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14681 2026-01-06 eess.IV cs.CV

Virtual Multiplex Staining for Histological Images using a Marker-wise Conditioned Diffusion Model

使用标记条件扩散模型进行虚拟多标记染色

Hyun-Jic Oh, Junsik Kim, Zhiyi Shi, Yichen Wu, Yu-An Chen, Peter K Sorger, Hanspeter Pfister, Won-Ki Jeong

AI总结 本文提出了一种基于条件扩散模型的虚拟多标记染色方法,利用预训练模型生成多标记图像,提升了H&E图像的分子层面分析能力。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06372 2026-01-06 cs.SD cs.AI

SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models

SpeakerLM:基于多模态大语言模型的端到端多功能说话人辨识与识别

Han Yin, Yafeng Chen, Chong Deng, Luyao Cheng, Hui Wang, Chao-Hong Tan, Qian Chen, Wen Wang, Xiangang Li

AI总结 SpeakerLM通过多模态大语言模型实现端到端的说话人辨识与识别,结合灵活的说话人注册机制,提升多说话人场景下的识别性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06142 2026-01-06 cs.CV

SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models

SDEval: 多模态大语言模型的安全动态评估

Hanqing Wang, Yuan Tian, Mingyu Liu, Zhenhao Zhang, Xiangyang Zhu

AI总结 SDEval通过动态调整安全基准分布和复杂度,提升多模态大语言模型的安全评估效果,缓解数据污染并揭示模型安全局限。

Comments AAAI 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05353 2026-01-06 cs.CV cs.AI

PriorRG: Prior-Guided Contrastive Pre-training and Coarse-to-Fine Decoding for Chest X-ray Report Generation

PriorRG: 基于先验知识的对比预训练与粗到细解码用于胸部X光报告生成

Kang Liu, Zhuoqi Ma, Zikang Fang, Yunan Li, Kun Xie, Qiguang Miao

AI总结 PriorRG通过结合先验知识的对比预训练和粗到细解码,提升胸部X光报告生成的准确性和流畅性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03280 2026-01-06 cs.IR

Modeling Item-Level Dynamic Variability with Residual Diffusion for Bundle Recommendation

基于残差扩散的捆绑推荐中项目级动态变异建模

Dong Zhang, Lin Li, Ming Li, Amran Bhuiyan, Meng Sun, Xiaohui Tao, Jimmy Xiangji Huang

AI总结 本文提出RDiffBR模型,通过残差扩散方法提升捆绑推荐中项目级动态变异适应能力,使Recall和NDCG指标提升达23%。

Comments Extended version for AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20335 2026-01-06 cs.CL cs.AI

Language Model Distillation: A Temporal Difference Imitation Learning Perspective

语言模型蒸馏:一种时差模仿学习视角

Zishun Yu, Shangzhe Li, Xinhua Zhang

AI总结 本文提出一种基于时差学习的通用蒸馏框架,利用教师模型的分布稀疏性,通过缩减动作空间提升语言模型蒸馏效果。

Comments AAAI 2026; Code available at: https://github.com/TobyLeelsz/Bellman-Distillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06275 2026-01-06 cs.LG cs.AI cs.CV physics.optics

SinBasis Networks: Matrix-Equivalent Feature Extraction for Wave-Like Optical Spectrograms

SinBasis网络:用于波形光学光谱图的矩阵等价特征提取

Yuzhou Zhu, Zheng Zhang, Ruyi Zhang, Liang Zhou

AI总结 SinBasis网络通过引入正弦映射的矩阵等价框架,提升波形图像的特征提取能力,实现对周期性模式的高敏感性和空间位移不变性。

Comments AAAI26 Poster

Journal ref The 40th Annual AAAI Conference on Artificial Intelligence (AAAI2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16505 2026-01-06 cs.CV cs.MM

TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning

TraveLLaMA: 一种基于大规模数据集和结构化推理的多模态旅行助手

Meng Chu, Yukang Chen, Haokun Gui, Shaozuo Yu, Yi Wang, Jiaya Jia

AI总结 TraveLLaMA通过结构化推理框架和大规模数据集,提升旅行推荐和场景理解能力,实现用户满意度和系统性能的显著提升。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06521 2026-01-06 cs.CR

Sentient: Detecting APTs Via Capturing Indirect Dependencies and Behavioral Logic

Sentient:通过捕捉间接依赖和行为逻辑检测APT

Wenhao Yan, Ning An, Wei Qiao, Weiheng Wu, Bo Jiang, Zhigang Lu, Baoxu Liu, Junrong Liu

AI总结 Sentient通过结合预训练和意图分析,利用图Transformer和意图分析模块有效检测APT,显著降低误报率。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18281 2026-01-06 cs.CV

MotionCharacter: Fine-Grained Motion Controllable Human Video Generation

MotionCharacter: 高精度可调控的人体视频生成

Haopeng Fang, Di Qiu, Binjie Mao, He Tang

机构 * Meituan(美团)

AI总结 MotionCharacter通过解耦动作类型与运动强度,实现高保真人体视频生成,提升细粒度运动控制与身份一致性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00882 2026-01-06 cs.PL

BALI: Branch-Aware Loop Invariant Inference with Large Language Models

BALI: 基于分支的循环不变式推断与大语言模型

Mingxiu Wang, Jiawei Wang, Xiao Cheng

AI总结 BALI通过结合大语言模型和分支感知分析,提升循环不变式的推断和验证精度,实现更高效和自动化的不变式发现。

Comments 4 pages, 1 figure, AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00584 2026-01-05 cs.CV

GranAlign: Granularity-Aware Alignment Framework for Zero-Shot Video Moment Retrieval

GranAlign: 一种面向零样本视频时刻检索的粒度感知对齐框架

Mingyu Jeon, Sunjae Yoon, Jonghee Kim, Junyeoung Kim

AI总结 GranAlign提出一种无需训练的框架,通过粒度感知对齐技术解决零样本视频时刻检索中的语义粒度不匹配问题,提升检索精度。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00516 2026-01-05 cs.LG cs.AI

Trajectory Guard -- A Lightweight, Sequence-Aware Model for Real-Time Anomaly Detection in Agentic AI

轨迹守护 -- 一种轻量级、序列感知的模型,用于代理AI中的实时异常检测

Laksh Advani

机构 * Laksh Advani

AI总结 轨迹守护通过对比学习和重建学习,实现对代理AI中任务轨迹对齐和序列有效性的联合检测,提升实时异常检测性能。

Comments Accepted to AAAI Trustagent 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00513 2026-01-05 cs.LG

When Small Models Are Right for Wrong Reasons: Process Verification for Trustworthy Agents

当小模型适用于错误的原因:信任代理的过程验证

Laksh Advani

机构 * Laksh Advani

AI总结 本文揭示小型语言模型在推理过程中的可靠性问题,提出推理完整性评分,并展示RAG提升推理质量而元认知可能损害性能,强调过程验证对可信代理的重要性。

Comments Accepted to Trustagent workshop AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00322 2026-01-05 cs.CV

Depth-Synergized Mamba Meets Memory Experts for All-Day Image Reflection Separation

深度协同Mamba遇见记忆专家用于全天图像反射分离

Siyan Fang, Long Peng, Yuntao Wang, Ruonan Wei, Yuehuan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学)

AI总结 DMDNet通过深度感知扫描和记忆专家补偿模块,提升全天图像反射分离性能,尤其在夜间表现更优。

Comments This paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00075 2026-01-05 cs.LG

IMBWatch -- a Spatio-Temporal Graph Neural Network approach to detect Illicit Massage Business

IMBWatch -- 一种用于检测非法按摩业务的时空图神经网络方法

Swetha Varadarajan, Abhishek Ray, Lumina Albert

AI总结 IMBWatch通过时空图神经网络方法,有效检测非法按摩业务,提升识别准确性和可解释性,支持主动干预。

Comments Submitted to AAAI AISI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25008 2026-01-05 cs.CV

FoundationSLAM: Unleashing the Power of Depth Foundation Models for End-to-End Dense Visual SLAM

FoundationSLAM: 释放深度基础模型的力量以实现端到端的密集视觉SLAM

Yuchen Wu, Jiahe Li, Fabio Tosi, Matteo Poggi, Jin Zheng, Xiao Bai

AI总结 FoundationSLAM通过结合深度基础模型与几何推理,实现端到端的密集视觉SLAM,提升轨迹精度和重建质量,实现实时18 FPS运行。

Comments Accept at AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22973 2026-01-05 cs.CV

YOLO-IOD: Towards Real Time Incremental Object Detection

YOLO-IOD:朝向实时增量物体检测

Shizhou Zhang, Xueqiang Lv, Yinghui Xing, Qirui Wu, Di Xu, Chen Zhao, Yanning Zhang

AI总结 YOLO-IOD通过解决增量学习中的知识冲突问题,提出了一种基于预训练YOLO-World模型的实时增量物体检测框架,有效减少遗忘并提升检测性能。

Comments AAAI 2026 accepted. Code & models are available at: https://github.com/qiangzai-lv/YOLO-IOD

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11518 2026-01-05 cs.CL

W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree Search

W2S-AlignTree: 通过蒙特卡洛树搜索实现大语言模型的弱到强推理时对齐

Zhenyu Ding, Yuhao Wang, Tengyue Xiao, Haoying Wang, Caigui Jiang, Ning Ding

AI总结 W2S-AlignTree通过结合MCTS与弱到强泛化范式,实现大语言模型在推理时的高效对齐,提升摘要任务性能15.9%。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05823 2026-01-05 cs.LG cs.CV

Fair Domain Generalization: An Information-Theoretic View

公平领域泛化:信息论视角

Tangzheng Lian, Guanyu Hu, Dimitrios Kollias, Xinyu Yang, Oya Celiktutan

AI总结 本文提出PAFDG框架,通过信息论视角解决公平领域泛化问题,实现效用与公平性的帕累托优化。

Comments Accepted at AAAI (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18864 2026-01-05 cs.CV

Spike Imaging Velocimetry: Dense Motion Estimation of Fluids Using Spike Cameras

尖峰成像测速:利用尖峰相机进行流体密集运动估计

Yunzhong Zhang, Bo Xiong, You Zhou, Changqing Su, Zhen Cheng, Zhaofei Yu, Xun Cao, Tiejun Huang

AI总结 本文提出SIV框架,利用尖峰相机和深度学习技术,实现高速流体运动的高精度估计,通过设计专用模块和数据集,在多种流体场景中优于现有方法。

Comments To appear in AAAI-26 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25067 2026-01-01 cs.CV

FineTec: Fine-Grained Action Recognition Under Temporal Corruption via Skeleton Decomposition and Sequence Completion

FineTec: 通过骨骼分解和序列补全实现受时间腐蚀影响的细粒度动作识别

Dian Shao, Mingfei Shi, Like Liu

AI总结 FineTec通过骨骼分解和序列补全方法,在受时间腐蚀影响下实现细粒度动作识别的高效准确识别。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25015 2026-01-01 cs.CL

MAMA-Memeia! Multi-Aspect Multi-Agent Collaboration for Depressive Symptoms Identification in Memes

MAMA-Memeia! 多维度多智能体协作在表情包抑郁症状识别中的应用

Siddhant Agarwal, Adya Dhuler, Polly Ruhnke, Melvin Speisman, Md Shad Akhtar, Shweta Yadav

AI总结 MAMAMemeia通过多智能体多维度协作框架,利用CAT能力提升表情包抑郁症状识别的宏F1指标,达到7.55%的提升,成为新的基准模型。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24763 2026-01-01 cs.CV

UniC-Lift: Unified 3D Instance Segmentation via Contrastive Learning

UniC-Lift: 通过对比学习实现统一的3D实例分割

Ankit Dhiman, Srinath R, Jaswanth Reddy, Lokesh R Boregowda, Venkatesh Babu Radhakrishnan

AI总结 UniC-Lift通过对比学习实现统一的3D实例分割,引入可学习特征嵌入和改进的嵌入到标签过程,提升分割性能并减少训练时间。

Comments Accepted to AAAI 2026. Project Page: https://unic-lift.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24663 2026-01-01 cs.CV cs.AI

Renormalization Group Guided Tensor Network Structure Search

基于重整化群的张量网络结构搜索

Maolin Wang, Bowen Yu, Sheng Zhang, Linjie Mi, Wanyu Wang, Yiqi Wang, Pengyue Jia, Xuetao Wei, Zenglin Xu, Ruocheng Guo, Xiangyu Zhao

AI总结 RGTN通过多尺度重整化群流引导张量网络结构搜索,实现高效优化和结构演化,取得优异的压缩比和计算效率。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24268 2026-01-01 cs.IR

RAGPart & RAGMask: Retrieval-Stage Defenses Against Corpus Poisoning in Retrieval-Augmented Generation

RAGPart & RAGMask:对抗检索增强生成中语料污染的检索阶段防御

Pankayaraj Pathmanathan, Michael-Andrei Panaitescu-Liess, Cho-Yu Jason Chiang, Furong Huang

AI总结 本文提出RAGPart和RAGMask两种检索阶段防御方法,用于对抗RAG中语料污染攻击,通过文档分区和标记遮蔽技术降低攻击成功率,提升RAG系统的鲁棒性。

Comments Published at AAAI 2026 Workshop on New Frontiers in Information Retrieval [Oral]

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24243 2026-01-01 cs.CV

MambaSeg: Harnessing Mamba for Accurate and Efficient Image-Event Semantic Segmentation

MambaSeg: 利用Mamba实现准确且高效的图像事件语义分割

Fuqiang Gu, Yuanke Li, Xianlei Long, Kangping Ji, Chao Chen, Qingyi Gu, Zhenliang Ni

AI总结 MambaSeg通过双分支框架和双维交互模块,实现高效准确的多模态语义分割,适用于快速运动和低光条件下的图像事件分割任务。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24156 2026-01-01 cs.AI

Graph-Based Exploration for ARC-AGI-3 Interactive Reasoning Tasks

基于图的探索用于ARC-AGI-3交互推理任务

Evgenii Rudakov, Jonathan Shock, Benjamin Ultan Cowley

AI总结 基于图的探索方法在ARC-AGI-3任务中实现高效交互推理,无需训练即可解决大量级别,优于LLM方法。

Journal ref AAAI 2026 Workshop on AI for Scientific Research

详情

展开后加载摘要…

URL PDF HTML 收藏