arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 745 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 745 篇

2606.31924 2026-07-01 cs.CV 新提交 50%

InstanceControl: Controllable Complex Image Generation without Instance Labeling

InstanceControl: 无需实例标注的可控复杂图像生成

Xiaoyu Liu, Huan Wang, Fan Li, Zhixin Wang, Jiaqi Xu, Ming Liu, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) HUAWEI Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 其他LLM :language model(abstract)

AI总结 提出InstanceControl方法,利用视觉语言模型自动建立文本与视觉条件间的实例对应,无需人工标注,通过自适应掩码细化策略实现复杂多实例场景的精确可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31909 2026-07-01 cs.RO 新提交 50%

CoDex: Learning Compositional Dexterous Functional Manipulation without Demonstrations

CoDex: 无需演示学习组合式灵巧功能性操作

Bowen Jiang, William Painter Reger, Roberto Martin-Martin

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他LLM :language model(abstract)

AI总结 提出零演示框架CoDex,结合视觉语言模型与强化学习,自主发现并执行涉及物体内部机制操控的灵巧操作策略,在多种工具任务中验证了其有效性。

Comments IEEE International Conference on Robotics and Automation (ICRA) 2026. Project page: https://robin-lab.cs.utexas.edu/CoDex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31245 2026-07-01 cs.CV 新提交 50%

HyperVLP: Enhancing Hierarchical Surgical Video-Language Pre-training in Hyperbolic Space

HyperVLP: 在双曲空间中增强层次化手术视频-语言预训练

Yaojun Hu, Kun Yuan, Nassir Navab, Haochao Ying, Jian Wu, Nicolas Padoy

机构 * Zhejiang University(浙江大学) University of Strasbourg, CNRS, INSERM, ICube, UMR7357(斯特拉斯堡大学,CNRS,INSERM,ICube,UMR7357) IHU Strasbourg(斯特拉斯堡IHU) Technical University of Munich(慕尼黑工业大学)

专题命中 其他LLM :foundation model(abstract)

AI总结 提出双曲空间手术视频-语言预训练框架HyperVLP,通过保留层次结构、缓解结构假负例并强制父子语义一致性,提升零样本和少样本手术阶段识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31125 2026-07-01 cs.CV 新提交 50%

WildProp: Visual Estimation of Wildlife Body Proportions at Scale

WildProp: 大规模野生动物身体比例视觉估计

Mustafa Chasmai, Aaron Sun, Subhransu Maji

专题命中 其他LLM :foundation model(abstract)

AI总结 提出WildProp,一种无需训练的框架,通过检索驱动的对应关系从大规模非约束图像中估计野生动物身体比例分布,无需逐物种训练,在鸟类和两栖动物数据集上中位相对误差10-20%。

Comments Accepted to ECCV 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31007 2026-07-01 cs.CV 新提交 50%

Dense Structural Priors for Sparse Functional Landmark Localization in Surgical Videos

手术视频中稀疏功能标志点定位的密集结构先验

Chenyan Jing, Hao Ding, Lalithkumar Seenivasan, Jacob M. Delgado López, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他LLM :foundation model(abstract)

AI总结 提出利用SAM 3作为结构先验,通过零样本点提示掩码和轻量级精炼框架,在无像素级标注下实现手术视频中功能标志点定位,F1达72.4%(尖端)和58.0%(锚点)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31265 2026-07-01 math-ph hep-th math.MP 新提交 50%

Boundaries in the Instantaneous Formulation of Field Theories

场论瞬时形式中的边界

Silvester G. A. Borsboom

专题命中 其他LLM :prompting(abstract)

AI总结 研究经典场论中协变与瞬时形式下的边界条件,揭示恒定狄利克雷边界条件导致瞬时状态空间为满足该条件的场位形空间的切丛,而仅要求场速度在边界为零时产生扇区结构,每个扇区由边界位形标记的切丛构成,经勒让德变换得到叶状典范泊松结构的扇区相空间,应用于杨-米尔斯理论并与通量超选择扇区关联。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27111 2026-06-26 cs.HC cs.SI 新提交 50%

Behind the Mask: A Taxonomic Analysis of Activities in Online Social Networks

面具背后:在线社交网络中活动的分类学分析

Debora F De Souza, Gabriela Beltrao, Berta Chulvi, Sergio Dantonio, Mehmet Gokay Ozerim, Javier Torregrosa, Adrian Giron, Angel Panizo, Pablo Miralles Gonzalez, Helena Liz, Javier Huertas Tato, Sonia Sousa, Alejandro Martin, Monika Maciuliene, David Camacho

专题命中 其他LLM :prompting(abstract)

AI总结 通过专家协作和文献综述设计分类法,分析恶意行为者的特征与活动,并以反移民话语案例研究验证其帮助识别虚假信息传播的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26075 2026-06-25 astro-ph.EP 新提交 50%

Glossy Silicate Clouds on the Scorched Dayside of LTT9779b

LTT9779b灼热昼侧的硅酸盐云

Suman Saha, James S. Jenkins, Jonathan Brande, Reza Ashtari, Ian J. M. Crossfield, Sarah Stamer, Diana Dragomir, Kevin B. Stevenson, Vivien Parmentier, Thomas M. Evans-Soma, Tansu Daylan, Hayley Beltz, Emma Esparza-Borges

专题命中 其他LLM :prompting(abstract)

AI总结 利用JWST NIRISS和NIRSpec/GH95观测,首次在LTT9779b昼侧以3-5σ置信度探测到硅酸盐云,并发现高反射云层而非高金属丰度是其高光学反照率的原因。

Comments 18 pages, 11 figures, 2 tables. Accepted for publication in ApJ Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24232 2026-06-24 cs.CV cs.GR 新提交 50%

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

FiCA:基于单张肖像图像的前馈即时高斯编解码器化身

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-Hyun Oh, Chen Cao

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 其他LLM :foundation model(abstract)

AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。

Comments Project page: https://kim-youwang.github.io/FiCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23593 2026-06-23 cs.RO cs.CV 新提交 50%

Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery

机器人辅助手术中的实时多模态活动感知错误检测

Seyed Hamid Reza Roodabeh, Zongyu Li, Homa Alemzadeh

机构 * University of Virginia(弗吉尼亚大学)

专题命中 其他LLM :prompting(abstract)

AI总结 提出统一框架,利用视频、运动学数据和文本提示等多模态输入,通过活动提示和活动感知视觉嵌入,在JIGSAWS和SAR-RARP50数据集上分别提升F1分数达5%和16.6%。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22214 2026-06-23 cs.CR 新提交 50%

TRACE: A Threat Modelling Methodology for Distributed, Cloud-First, and Decentralized Organisations

TRACE:面向分布式、云优先和去中心化组织的威胁建模方法

Stefan Beyer

专题命中 其他LLM :language model(abstract)

AI总结 提出TRACE方法,通过三层模型(协议、系统、组织)和证据链,解决现有威胁建模在云优先、去中心化场景下对授权恶意行为、共谋等风险的遗漏问题。

Comments 12 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09717 2026-06-23 cs.SD eess.AS 新提交 50%

What Makes Synthetic Speech Sound Sarcastic? A Prosody-Controlled Perception Study

什么让合成语音听起来讽刺?一项韵律控制的感知研究

Zhu Li, Shekhar Nayak, Matt Coler

机构 * University of Groningen(格罗宁根大学)

专题命中 其他LLM :foundation model(abstract)

AI总结 通过可控神经TTS系统操纵语速、音高变化和响度,发现响度主要驱动人类对讽刺的感知,而模型更依赖语速,揭示了韵律线索权重差异。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19598 2026-06-19 cs.RO 新提交 50%

Fail-RAG : A Retrieval Augmented Generation Informed Framework for Robot Failure Identification

Fail-RAG:一种基于检索增强生成的机器人故障识别框架

Ameya Salvi, Jie Hu

机构 * Hitachi America, Ltd.(日立美国有限公司)

专题命中 其他LLM :language model(abstract)

AI总结 提出Fail-RAG框架,利用检索增强生成和视觉语言模型,通过嵌入故障图像和上下文信息并查询数据库,实现机器人操作故障的高效检测,在仓库自动化任务中平均检测准确率提升25个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17721 2026-06-17 cs.IR 新提交 50%

Understanding and Debugging Failures in N-Gram-Based Generative Retrieval

理解和调试基于N-Gram的生成式检索中的失败

Richard Takacs, Adrian Bracher, Svitlana Vakulenko

专题命中 其他LLM :language model(abstract)

AI总结 本文通过分类法、实证分析和可视化工具,系统研究了基于n-gram的生成式检索方法(如SEAL和MINDER)的失败模式,包括歧义文档ID、低标识符多样性和特定标识符的不成比例影响。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17468 2026-06-17 cs.IR 新提交 50%

RSRank: Learning Relevance from Representational Shifts

RSRank: 从表示偏移中学习相关性

Archit Gupta, Sai Sundaresan, Debabrata Mahapatra

专题命中 其他LLM :language model(abstract)

AI总结 针对RAG系统中重排序依赖启发式阈值和语言模型logit信号的问题,提出基于表示偏移(RS)的相关性信号,通过轻量级训练框架学习映射,在零阈值下过滤无关内容,超越现有重排序器。

Comments Under Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14880 2026-06-16 cs.SI 新提交 50%

Can We Unmask the Underground? Detecting and Predicting Hidden Forum Interactions

我们能揭露地下世界吗?检测和预测隐藏的论坛互动

Abdoul Nasser Hassane Amadou, Imane Fouad, Anas Motii

专题命中 其他LLM :language model(abstract)

AI总结 提出无监督框架HADES,利用预训练语言模型对用户文本交互进行语义嵌入,聚类检测地下论坛中主导和隐藏的威胁社区,并在三个主要论坛上验证其有效性,可提前一年预测社区形成。

Comments Accepted at ARES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14411 2026-06-15 cs.HC 新提交 50%

Fabula: Building a Narrative Storytelling Sidekick with the Writers' Community

Fabula: 与作家社区共建叙事故事创作助手

Piotr Mirowski, Ben Wedin, Reinald Kim Amplayo, Rich Galt, Duncan Williams, Rida Qadri, Jaume Sanchez-Elias, Erin Drake-Kajioka, Sian Gooding, Lucia Lopez-Rivilla, Joao G. M. Araujo, Lion Schulz, Satinder Baveja, Shakir Mohamed, Edward Grefenstette, Laura Rimell, Richard Evans

专题命中 其他LLM :language model(abstract)

AI总结 通过参与式AI设计,与42位专家合作评估Fabula交互式写作应用,探讨基于叙事理论的故事规划、语言模型自动评估及UI设计对故事质量和创造力的影响。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13675 2026-06-15 cs.RO 新提交 50%

Improving Robotic Generalist Policies via Flow Reversal Steering

通过流反转引导改进机器人通用策略

Andy Tang, William Chen, Andrew Wagenmaker, Chelsea Finn, Sergey Levine

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 其他LLM :language model(abstract)

AI总结 提出流反转引导(FRS)方法,通过逆向流策略找到次优动作的潜在噪声并映射到通用策略的动作模式,提升零样本控制、行为克隆和强化学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13215 2026-06-12 eess.SY cs.CE cs.SY 新提交 50%

Mitigating business risks from renewable PPA power sourcing uncertainties for European green hydrogen production: Robust system design, regulatory adjustments and offtake flexibility

缓解可再生能源PPA电力采购不确定性对欧洲绿氢生产的商业风险:稳健系统设计、监管调整与承购灵活性

Jonathan Brandt, Astrid Bensmann, Richard Hanke-Rauschenbach

专题命中 其他LLM :prompting(abstract)

AI总结 针对欧洲绿氢生产因可再生能源电力采购规则(如附加性和时间相关性)导致的商业风险,本研究通过系统设计优化、监管调整和承购灵活性分析,提出缓解措施并评估成本影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12811 2026-06-12 cond-mat.mtrl-sci 新提交 50%

A wrong ground-state structure of HfO$_2$ predicted by machine-learning interatomic potentials based on the PBE functional

基于PBE泛函的机器学习原子间势预测的HfO$_2$错误基态结构

Shuqi Tang, Jinchen Wei, Kang Wang, Junjie Zhou, Yihan Zhang, Menglin Huang, Shiyou Chen

专题命中 其他LLM :foundation model(abstract)

AI总结 发现基于PBE泛函的机器学习势预测HfO2的I41/amd结构比已知基态P21/c更稳定,错误源于PBE泛函过度稳定含六配位Hf-O八面体的低密度结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11819 2026-06-11 cs.IT math.IT 新提交 50%

STCC: A Unified Source-Channel Semantic Token Coding Framework for Semantic Communications

STCC:一种用于语义通信的统一源信道语义令牌编码框架

Zhicheng Bao, Chen Dong, Sen Wang, Long Liu, Nan Ma, Hao Chen, Xiaodong Xu, Yinqiu Liu, Ping Zhang

专题命中 其他LLM :foundation model(abstract)

AI总结 提出STCC框架,通过语义令牌编解码器(STC)将离散语义令牌映射为几何结构化的星座图,利用三重损失优化使信道噪声转化为拓扑错误,在低信噪比下显著优于传统系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10541 2026-06-10 cs.CV 新提交 50%

GRAR: Glass-induced Reflection Artifact Removal in LiDAR Point Clouds

GRAR: LiDAR点云中玻璃引起的反射伪影去除

Wanpeng Shao, Zeyi Guo, Bo Zhang, Yifei Xue, Tie Ji, Yizhen Lao

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) School of Design, Hunan University(湖南大学设计学院) School of Finance and Statistics, Hunan University(湖南大学金融与统计学院)

专题命中 其他LLM :foundation model(abstract)

AI总结 提出两阶段框架,先利用多模态视觉基础模型和几何线索精确分割玻璃区域,再基于物理驱动的反射感知局部-全局几何相似性描述符去除反射伪影,在多个公开数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08914 2026-06-09 cs.HC 新提交 50%

Vibe Visualizing: How Visualization Novices Try (and Fail) to Generate and Interpret Visualizations with Conversational AI

Vibe 可视化:可视化新手如何尝试(并失败)使用对话式 AI 生成和解读可视化

Sam Yu-Te Lee, Yun-Hsin Kuo, Chifang Chou, Matthew Ward, Xiwei Xuan, Kwan-Liu Ma

专题命中 其他LLM :prompting(abstract)

AI总结 通过用户研究发现,可视化新手在使用 ChatGPT 等对话式 AI 生成和解读可视化时面临执行错误、误解和信任问题,并提出了改进 AI 辅助可视化系统的设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07764 2026-06-09 cs.CY 新提交 50%

Reimagining Open Source and Openness in AI: Co-Creating Responsible Technological Futures

重新构想人工智能中的开源与开放性:共创负责任的科技未来

Genevieve Smith, Hiral Patel, Steven Luo, Monica G. Bobra, Judy Brewer, Cathryn Carson, Isadora Cruxen, Shachee Doshi, Maximilian Gahntz, Nicholas Garcia, Natalia Luka, Meredith M. Lee, Min Kyung Lee, Woohyeuk Lee, Jarrod Millman, Ricardo Miron Torres, Chinasa T. Okolo, Cailean Osborne, Derek Slater, Katie Steen-James, Nikko Stevens, Jennifer Tridgell, David Gray Widder

专题命中 其他LLM :foundation model(abstract)

AI总结 通过多部门参与式研讨会,研究不同利益相关者如何共同理解与协商AI中的负责任开放性,识别出关于开放目的、范围与运作的四类核心张力,并提出行动路径与研究路线图。

Comments To appear in the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07161 2026-06-08 cs.CV 新提交 50%

TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance

TraRA: 面向城市监控视频文本识别的轨迹级识别聚合方法

Duc Tri Tran, Trung Thanh Nguyen, Vijay John, Phi Le Nguyen, Yasutomo Kawanishi

机构 * RIKEN(日本理化学研究所) Hanoi University of Science and Technology(河内科学技术大学) Nagoya University(名古屋大学) Lawrence Technological University(劳伦斯技术大学) Ritsumeikan University(立命馆大学)

专题命中 其他LLM :language model(abstract)

AI总结 提出TraRA方法,通过轨迹级文本识别聚合,利用时间与多模态一致性,解决监控视频中运动模糊、遮挡等导致的帧级识别不一致问题,在多个基准上提升跟踪与识别性能。

Comments 22nd IEEE International Conference on Advanced Visual and Signal-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏