arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-17 至 2026-07-17 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 3 篇

2606.28149 2026-07-17 cs.CV cs.AI 版本更新 73%

Toward Robust In-Context Segmentation via Concept Guidance

通过概念引导实现鲁棒的上下文分割

Zhigang Chen, Xiawu Zheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)

专题命中 其他多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出概念引导的上下文分割(CG-ICS),通过提取参考图像的高层语义概念而非仅依赖低层视觉匹配,结合文本概念与视觉示例,显著提升分割准确性和鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14769 2026-07-17 cs.CL cs.AI cs.MA 新提交 62%

Dialogue Summarization with Emotion Dynamics Using Topic- and Participant-Centric Decomposition

使用以主题和参与者为中心的分解方法进行具有情感动态的对话摘要

Linyun Xiang, Mark Neerincx, Stephanie Tan

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对对话摘要问题,提出基于改进分层智能体链方法的框架,从主题和参与者两个视角分解对话,结合自动推断情感生成摘要,并引入情感轨迹指标评估,实验表明其框架能生成含语义和情感内容的摘要,凸显方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01735 2026-07-17 astro-ph.EP astro-ph.GA astro-ph.IM astro-ph.SR 50%

KMT-2025-BLG-1314 and KMT-2025-BLG-1392: two microlensing planetary/brown-dwarf candidates analyzed with differentiable code

KMT-2025-BLG-1314和KMT-2025-BLG-1392:两种微透镜行星/褐矮星候选体的不同可微代码分析

Haibin Ren, Weicheng Zang, Wei Zhu, Yoon-Hyun Ryu, Yuchen Tang, Jiyuan Zhang, Michael D. Albrow, Sun-Ju Chung, Andrew Gould, Cheongho Han, Kyu-Ha Hwang, Youn Kil Jung, In-Gu Shin, Yossi Shvartzvald, Hongjing Yang, Jennifer C. Yee, Dong-Jin Kim, Chung-Uk Lee, Byeong-Gon Park, Yunyi Tang, Dan Maoz, Shude Mao, Qiyue Qian

专题命中 其他多模态 :multimodal(abstract)

AI总结 利用不同可微代码分析KMT-2025-BLG-1314和KMT-2025-BLG-1392两个微透镜事件,揭示行星/褐矮星候选体的退化问题,并展示HMC方法在双峰后验中的优越性。

Comments 20 pages, 7 figures, submitted to RAA

详情

展开后加载摘要…

URL PDF HTML 收藏