Evaluating Dedicated Monolingual and Joint Multilingual Causal Models for Dravidian Languages
评价达罗毗荼语的专用单语与联合多语因果模型
专题命中 效率与部署 :language model(abstract);分类 cs.CL
AI总结 本文训练5个GPT-2架构模型对比达罗毗荼语的单语与多语模型,发现单语模型在情感分类等任务上优于mGPT,分词器效率也更高。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
评价达罗毗荼语的专用单语与联合多语因果模型
专题命中 效率与部署 :language model(abstract);分类 cs.CL
AI总结 本文训练5个GPT-2架构模型对比达罗毗荼语的单语与多语模型,发现单语模型在情感分类等任务上优于mGPT,分词器效率也更高。
从接口到推理:从任意阶模型中引出任意阶推理
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Harvard University(哈佛大学)
专题命中 效率与部署 :language model(abstract);分类 cs.LG
AI总结 该研究针对离散推理任务的任意阶推理需求,提出两种掩码扩散改进方法,训练对应模型验证了方法可诱导任意阶推理行为并提升下游性能。
分层声学-语义建模:全双工口语语言模型的模态分离与语义连贯
机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) ; Center for Language, Intelligence and Machines, Shenzhen Loop Area Institute, Shenzhen(深圳环智中语言、智能与机器中心) ; School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)
专题命中 效率与部署 :language model(abstract);分类 cs.CL
AI总结 研究全双工口语语言模型受模态干扰问题,提出Lychee-FD框架及分层参数分离策略,通过实验验证该方法能有效提升模型性能,在语音智能和交互流畅性上取得显著进步,且不影响推理效率。
Comments 22 pages, 9 figures
OmniV2X:一种用于高效端到端协同驾驶的生成式基础规划器
机构 * Purdue University(普渡大学)
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI
AI总结 提出OmniV2X生成式基础模型,通过端到端监督训练和交叉注意力注入,利用多模态多智能体上下文实现高效协同驾驶,在DAIR-V2X-Seq数据集上以少于10%微调数据和1%通信带宽达到最优性能。
Comments Accepted to IROS 2026
边缘上的持续视觉异常检测:基准测试与高效解决方案
机构 * University of Padova(帕多瓦大学)
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI
AI总结 本文提出边缘持续视觉异常检测的首个全面基准测试,评估了七种模型在三种轻量级架构上的表现,并提出Tiny-Dinomaly模型在内存和计算成本上显著降低的同时提升Pixel F1指标。
自洽静电机器学习互原子势的设计空间
专题命中 效率与部署 :foundation model(abstract);分类 cs.LG
AI总结 本文提出一种框架,将现有模型视为密度泛函理论的粗粒度近似,揭示了自洽静电MLIPs的设计空间关键选择,通过MACE架构和共享电荷密度表示进行比较,并在金属-水界面和硅 dioxide 中的带电空位测试案例中评估模型性能。
SLIM-0.5B:学习机器人操作的动作基础预测隐变量
机构 * Fudan University(复旦大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Tsinghua University(清华大学) ; Renmin University of China(中国人民大学)
专题命中 效率与部署 :pretraining(abstract)
AI总结 SLIM-0.5B是0.5B参数的紧凑机器人操作策略,通过自监督掩码轨迹预测学习动作基础预测隐变量,性能优于或匹配大型基线,参数量少、推理延迟低、内存占用小。
Comments 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/
GeoRoute:面向交通未来帧预测的几何感知混合推理方法
机构 * Vietnamese-German University(越南-德国大学) ; University of Science, Ho Chi Minh City(胡志明市科学大学) ; Ho Chi Minh City University of Technology(胡志明市技术大学) ; University of Information Technology, Ho Chi Minh City(胡志明市信息技术大学)
专题命中 效率与部署 :language model(abstract)
AI总结 GeoRoute是一种无需训练的几何感知混合推理框架,通过多帧深度分层渲染器和视角条件选择预测器,在AI City Challenge Track 5基准上实现了具有竞争力的交通未来帧预测性能,提升了静态几何稳定性。
Comments accepted to the ECCV 2026 AI City Challenge Workshop
面向大规模场景重建的结合局部到全局回环检测的多子图隐式神经SLAM
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) ; Carnegie Mellon University(卡内基梅隆大学) ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)
专题命中 效率与部署 :foundation model(abstract)
AI总结 本文提出一种带多子图架构与双层回环检测机制的神经SLAM系统,结合渐进式建图、光流跟踪、局部到全局回环及子图间在线蒸馏算法,在大规模场景重建性能上优于现有最优方法。
视觉令牌编解码器:为ViT特征编码释放空间冗余
机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Pengcheng Laboratory(鹏城实验室) ; Ant Group(蚂蚁集团)
专题命中 效率与部署 :foundation model(abstract)
AI总结 针对ViT特征编码忽略二维补丁网格结构的问题,提出双路径视觉令牌编解码器VTC,在DINOv2、SAM3的分类等任务上,码率降低15.7-37.4倍且性能达未压缩的90%,表现优于基线。
Comments 13 pages, 9 figures
SRE-FER:用于缓解细粒度面部表情识别中局部证据稀释的区域残差证据学习
专题命中 效率与部署 :foundation model(abstract)
AI总结 针对细粒度FER中局部证据稀释问题,提出SRE-FER框架,通过RERA模块和AU指导优化,在三个基准测试中取得具竞争力的FER性能。
Comments 10 pages, 5 figures.Accepted at the 9th International Conference on Artificial Intelligence and Pattern Recognition (AIPR 2026)
VLZip:用于交错长上下文建模的统一视觉与文本压缩方法
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团)
专题命中 效率与部署 :language model(abstract)
AI总结 VLZip 是统一视觉与文本压缩的框架,通过提炼软前缀缩短注意力序列,在长上下文多模态推理上性能领先,支持超大规模 token 处理,为长上下文多模态 AI 建立新高效标准。
Vid2WAM:将视频扩散先验蒸馏为世界动作模型
专题命中 效率与部署 :foundation model(abstract)
AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。
Comments Project website: https://qch-fa.github.io/vid2wam-website/
开放词汇语义分割的测试时原型适配
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; South China Normal University(华南师范大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 本文提出测试时原型适配(TPA),一种无训练即插即用模块,可与多种开放词汇语义分割宿主结合,仅用少量未标注图像构建原型库,无需调优或更新参数即可提升分割准确率。
Comments 17 pages, 12 figures, preprint
AdaDINO:用于高效遥感变化检测的冻结DINO的成对感知骨干内适配
专题命中 效率与部署 :foundation model(abstract)
AI总结 AdaDINO是一种成对感知的骨干内适配框架,通过CGLA、BSCS和CPGR模块优化冻结DINO,在4个遥感变化检测基准上实现了高效且性能更优的变化检测,在SYSU-CD上F1达85.29%且吞吐量提升1.41倍。
回答我的问题需要多少成本?基于云VLM的VQA系统基准测试
专题命中 效率与部署 :language model(abstract)
AI总结 本研究推出首个将客户端输入预处理作为受控变量的VQABench基准,评估12种预处理技术在3个VQA数据集、4个商业VLMs上的95168次API调用,明确预处理对云VLM-based VQA的成本-质量影响,为VQA系统部署提供指导。
Wan-Animate-2:拓展角色动画的应用边界
机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)
专题命中 效率与部署 :pretraining(abstract)
AI总结 本文提出Wan-Animate-2角色动画框架,通过消除中间运动提取器提升动画保真度,新增文本驱动视角控制,推出实时高效变体Wan-Animate-2-Lite,将发布其基础模型权重。
Comments Project page: https://humanaigc.github.io/wan-animate-2/
FlippedRAG: 黑盒意见操控对抗攻击针对检索增强生成模型
专题命中 效率与部署 :LLM(abstract_cn)
AI总结 本文提出FlippedRAG,一种针对黑盒RAG模型的对抗攻击方法,通过逆向工程检索器和污染触发器实现对意见操控的高效攻击。
Comments Accepted by 32nd ACM Conference on Computer and Communications Security (ACM CCS 2025)
Journal ref CCS '25: Proceedings of the 2025 ACM SIGSAC Conference on Computer and Communications Security
用于宇宙学模型区分和宇宙微波背景功率谱异常检测的条件变分自编码器
专题命中 效率与部署 :post-training(abstract)
AI总结 该研究提出参数条件变分自编码器(CVAE),可实现宇宙微波背景功率谱的可解释压缩、快速诊断及异常检测,将MCMC运行时间从约40小时缩短至约2分钟,支持超出$\u039b$CDM的宇宙学模型区分。
Comments 22 pages, 18 figures; accepted for publication in Physical Review D
细粒度语义集成用于基于大语言模型的推荐
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn)
AI总结 TS-Rec通过细粒度语义集成提升基于LLM的推荐系统性能
免费保留物品语义:重新思考基于大语言模型的生成式推荐中的令牌初始化
专题命中 领域大模型 :LLM(title,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本研究针对基于LLM的生成式推荐中SID令牌初始化的缺陷,提出质心初始化方法,无需额外开销即可提升推荐性能,减少训练步骤并改善冷物品表现。
大型语言模型是强大的电子健康记录编码器
机构 * Berlin Institute of Health at Charité – Universitätsmedizin Berlin(柏林夏里特医学院健康研究所) ; BIH Biomedical Innovation Academy, BIH Charité Digital Clinician Scientist Program(BIH生物医学创新学院,BIH夏里特数字临床科学家计划) ; Deutsches Herzzentrum der Charité – Medical Heart Center of Charité and German Heart Institute Berlin(夏里特德国心脏中心 – 夏里特医学院和德国心脏研究所柏林) ; Layer Health, Inc.(Layer Health公司)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract)
AI总结 本文提出利用大型语言模型对电子健康记录进行编码,通过将医疗代码转换为自然语言描述,提升模型在临床预测任务中的表现,同时展示其在不同任务中的有效性。
我们希望人工智能有多敏感?医疗领域大型语言模型的社会交际能力
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 本研究通过分析HELP-Med数据集的1800条对话,评估GPT 4o、Llama 3和Command R+三种LLM的医疗领域社会交际能力,发现其结构化表现差,需调整评估框架以适配人机差异。
提示工程并不能普遍提升大型语言模型在临床决策任务中的性能
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)
AI总结 本研究发现提示工程对LLMs在临床决策任务中的性能提升具有高度依赖模型和任务的特性,强调了定制化策略的重要性。
感知天气与位置的智能体餐饮推荐:利用大语言模型世界知识开展区域敏感语境推理
专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出感知天气与位置的智能体餐饮推荐系统,利用LLM的世界知识生成区域敏感的适配天气的餐饮推荐,为智能体推荐提供了可扩展的架构模式。
Comments 5 pages. An agentic LLM system that reasons over combined location and weather context for region-sensitive dining recommendation. Working prototype implemented and briefly deployed end-to-end
RobustDefect-LLM:具备决策支持与AI辅助报告的可解释、鲁棒性感知型工业表面缺陷分类方法
专题命中 领域大模型 :LLM(title,title_cn)
AI总结 本文提出RobustDefect-LLM框架,在NEU-DET数据集上评估四种CNN,选MobileNetV3-Large实现高准确率,结合Grad-CAM与置信度路由,集成AI辅助报告,验证了工业缺陷检测工作流的可行性。
Comments 27 pages, 11 figures, 16 tables, preprint manuscript, the source code is publicly available
面向基于大语言模型(LLM)的序列推荐中缓解模态偏差的结构保留投影
专题命中 领域大模型 :LLM(title,title_cn)
AI总结 本文针对基于LLM的序列推荐中投影引入的模态偏差问题,提出结构保留投影方法,通过专用损失维持协同嵌入关系几何,经实验验证可提升推荐性能。
Comments Accepted at RecSys 2026
LLMs-Healthcare : 大型语言模型在各医疗专科中的当前应用与挑战
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文综述了大型语言模型在医疗领域中的最新应用与挑战,涵盖诊断、治疗及各专科的创新贡献,探讨其在医疗诊断和患者护理中的潜力与限制。
Comments 26 pages and one figure
Journal ref Artificial Intelligence in Health ,Published online: 2 April 2024
MedPixel:用于医学推理与分割的统一像素-语言模型
专题命中 领域大模型 :language model(title,abstract);LLM(abstract,abstract_cn);preference optimization(abstract);分类 cs.AI
AI总结 该研究提出统一医学像素-语言模型MedPixel,引入44万样本的MedPLG-440K数据集,通过联合多任务微调与像素级偏好优化训练,支持多类医学任务,性能优异且具备零样本迁移与鲁棒性。
SocialFiVis:面向社会金融中基于大语言模型的多智能体模拟的可视分析沙箱
专题命中 领域大模型 :LLM(title,summary_cn)
AI总结 该研究提出嵌入IAD框架的可视分析沙箱SocialFiVis,结合LLM与PRA引擎模拟多智能体,支持探索社会金融领域反事实政策并解释相关涌现现象。
Comments 11 pages, 7 figures, 2 tables. Accepted to IEEE VIS 2026; to appear in IEEE Transactions on Visualization and Computer Graphics