arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-01 至 2026-07-01 共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 32 篇

2604.22027 2026-07-01 cs.CL cs.AI cs.LG 版本更新 80%

Shared Lexical Task Representations Explain Behavioral Variability In LLMs

共享的词汇任务表示解释了大语言模型中的行为变异

Zhuonan Yang, Jacob Xiaochen Li, Francisco Piedrahita Velez, Eric Todd, David Bau, Michael L. Littman, Stephen H. Bach, Ellie Pavlick

机构 * Brown University(布朗大学) MIT(麻省理工学院) Northeastern University(东北大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过比较指令式和示例式提示发现,大语言模型在不同提示下行为差异可由共享的词汇任务表示解释,揭示了任务特定注意力头在不同提示风格中的共同机制。

Comments Accepted to ICML 2026. Updated to the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31587 2026-07-01 cs.SD cs.AI 新提交 79%

ZEBRA: Zero-Shot Entropy-Regularized Prompt Learning for Base-to-Novel Generalization in Audio-Language Models

ZEBRA:面向音频语言模型中基类到新类泛化的零样本熵正则化提示学习

Asif Hanif, Mohammad Yaqub

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.AI

AI总结 提出ZEBRA框架,通过融合零样本logits与提示学习logits并采用自熵正则化,解决音频语言模型中提示学习导致的新类性能下降问题,实现基类到新类的泛化提升。

Comments Accepted in InterSpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31471 2026-07-01 cs.CV 新提交 78%

Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs

边建图边思考:用于增量式3D场景图的异步视觉-语言智能体

Deniz Bickici, Michael Pabst, Shohei Mori, Dieter Schmalstieg

机构 * University of Stuttgart(斯图加特大学) Graz University of Technology(格拉茨技术大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院)

专题命中 其他LLM :language agent(title);language model(abstract)

AI总结 提出异步架构,轻量在线建图与重型语义精化并发运行,通过语义闭环、属性标注和空间关系推导,实现探索时可查询且语义渐增的3D场景图,在多个基准上超越现有方法。

Comments Accepted to ECCV 2026. Project page: https://denizbickici.github.io/thinkgraphs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30942 2026-07-01 cs.HC cs.CY 新提交 75%

Anthropomorphism in AI Companion Communities: Age, Gender, and Emotional Correlates

AI伴侣社区中的拟人化:年龄、性别与情感相关性

Afia Mubashir, Boden Moraski, Stephanie Choi, Rose E. Guingrich

专题命中 其他LLM :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究利用Reddit数据,分析AI伴侣社区中用户年龄、性别与拟人化倾向及情感表达的关系,发现成年人和女性更易拟人化,积极情感与拟人化正相关,且这些关系在成年人中更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15029 2026-07-01 cs.LG cond-mat.dis-nn cs.CL 版本更新 73%

Symmetry in language statistics shapes the geometry of model representations

语言统计中的对称性塑造了模型表示的几何结构

Dhruva Karkada, Daniel J. Korchinski, Andres Nava, Matthieu Wyart, Yasaman Bahri

机构 * UC Berkeley(加州大学伯克利分校) EPFL(瑞士联邦理工学院洛桑分校) Johns Hopkins(约翰斯·霍普金斯大学) Google DeepMind(谷歌DeepMind)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文证明语言统计中的平移对称性(如月份共现频率仅取决于时间间隔)决定了词嵌入模型的高维几何结构,并推导出表示流形的解析形式,该几何在统计扰动下仍保持鲁棒。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29793 2026-07-01 cs.CL q-fin.GN 版本更新 70%

Fund2Persona: A Framework for Building and Refining Financial Advisor Personas from Fund Disclosure Data

Fund2Persona:基于基金披露数据构建与精炼金融顾问角色的框架

Suhwan Park, Hoyoung Lee, Zhangyang Wang, Alejandro Lopez-Lira, Young Cha, Chanyeol Choi, Jaewon Choi, Yongjae Lee

机构 * UNIST(蔚山科学技术院) LinqAlpha University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Florida(佛罗里达大学) Blackstone(黑石集团) Hanwha Life(韩华生命)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出Fund2Persona框架,利用基金披露、持仓变动、市场背景和管理人评论构建金融顾问角色,并通过智能体循环精炼,在持仓重建和管理人评论对齐任务上优于通用基线,生成更具体有用的建议。

Comments 17 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31423 2026-07-01 cs.DB cs.AI 新提交 70%

DA-Studio: An Agentic System for End-to-End Data Analysis

DA-Studio:用于端到端数据分析的智能体系统

Yizhe Liu, Shaolei Zhang, Ju Fan

机构 * Renmin University of China(中国人民大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出DA-Studio,一个集成了沙盒执行与可检查工作流的端到端数据分析系统,通过迭代动作生成与代码执行,从原始文件与自然语言请求逐步构建可执行分析步骤。

Comments VLDB 2026 Demo submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31182 2026-07-01 cs.AI 新提交 70%

AI-Assisted Discovery of Convex Relaxations via Dual Agents

通过双智能体实现凸松弛的AI辅助发现

Sungyoon Kim, Mert Pilanci

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种双智能体自动研究范式,通过编码智能体提议约束、理论智能体验证并搜索反例,结合区间算术验证,改进了两个优化常数的下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04126 2026-07-01 cs.CL cs.AI cs.CV 版本更新 62%

InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training

InfiniteWeb: 面向GUI智能体训练的可扩展Web环境合成

Ziyun Zhang, Zezhou Wang, Xiaoyi Zhang, Zongyu Guo, Jiahao Li, Bin Li, Yan Lu

机构 * Peking University(北京大学) Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出InfiniteWeb系统,通过统一规范、任务驱动测试和多样化种子设计自动生成功能完备的Web环境,解决GUI智能体训练数据稀缺问题,在OSWorld和Online-Mind2Web上取得显著性能提升。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31144 2026-07-01 cs.RO cs.AI 新提交 57%

A Modular Vision-Language-Action Robotics Framework for Indoor Environments

面向室内环境的模块化视觉-语言-动作机器人框架

Anindya Jana, Snehasis Banerjee, Arup Sadhu, Ranjan Dasgupta

机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究部) CMU(卡内基梅隆大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 提出模块化架构,集成环境建图、问题处理和导航,通过双流并行处理(语义体素建图与语言分类)实现自然语言指令驱动的自主任务执行。

Comments IEEE IROS 2025 Workshop on Generative AI for Robotics and Smart Manufacturing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31924 2026-07-01 cs.CV 新提交 50%

InstanceControl: Controllable Complex Image Generation without Instance Labeling

InstanceControl: 无需实例标注的可控复杂图像生成

Xiaoyu Liu, Huan Wang, Fan Li, Zhixin Wang, Jiaqi Xu, Ming Liu, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) HUAWEI Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 其他LLM :language model(abstract)

AI总结 提出InstanceControl方法,利用视觉语言模型自动建立文本与视觉条件间的实例对应,无需人工标注,通过自适应掩码细化策略实现复杂多实例场景的精确可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31909 2026-07-01 cs.RO 新提交 50%

CoDex: Learning Compositional Dexterous Functional Manipulation without Demonstrations

CoDex: 无需演示学习组合式灵巧功能性操作

Bowen Jiang, William Painter Reger, Roberto Martin-Martin

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他LLM :language model(abstract)

AI总结 提出零演示框架CoDex,结合视觉语言模型与强化学习,自主发现并执行涉及物体内部机制操控的灵巧操作策略,在多种工具任务中验证了其有效性。

Comments IEEE International Conference on Robotics and Automation (ICRA) 2026. Project page: https://robin-lab.cs.utexas.edu/CoDex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31245 2026-07-01 cs.CV 新提交 50%

HyperVLP: Enhancing Hierarchical Surgical Video-Language Pre-training in Hyperbolic Space

HyperVLP: 在双曲空间中增强层次化手术视频-语言预训练

Yaojun Hu, Kun Yuan, Nassir Navab, Haochao Ying, Jian Wu, Nicolas Padoy

机构 * Zhejiang University(浙江大学) University of Strasbourg, CNRS, INSERM, ICube, UMR7357(斯特拉斯堡大学,CNRS,INSERM,ICube,UMR7357) IHU Strasbourg(斯特拉斯堡IHU) Technical University of Munich(慕尼黑工业大学)

专题命中 其他LLM :foundation model(abstract)

AI总结 提出双曲空间手术视频-语言预训练框架HyperVLP,通过保留层次结构、缓解结构假负例并强制父子语义一致性,提升零样本和少样本手术阶段识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31125 2026-07-01 cs.CV 新提交 50%

WildProp: Visual Estimation of Wildlife Body Proportions at Scale

WildProp: 大规模野生动物身体比例视觉估计

Mustafa Chasmai, Aaron Sun, Subhransu Maji

专题命中 其他LLM :foundation model(abstract)

AI总结 提出WildProp,一种无需训练的框架,通过检索驱动的对应关系从大规模非约束图像中估计野生动物身体比例分布,无需逐物种训练,在鸟类和两栖动物数据集上中位相对误差10-20%。

Comments Accepted to ECCV 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31007 2026-07-01 cs.CV 新提交 50%

Dense Structural Priors for Sparse Functional Landmark Localization in Surgical Videos

手术视频中稀疏功能标志点定位的密集结构先验

Chenyan Jing, Hao Ding, Lalithkumar Seenivasan, Jacob M. Delgado López, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他LLM :foundation model(abstract)

AI总结 提出利用SAM 3作为结构先验,通过零样本点提示掩码和轻量级精炼框架,在无像素级标注下实现手术视频中功能标志点定位,F1达72.4%(尖端)和58.0%(锚点)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31265 2026-07-01 math-ph hep-th math.MP 新提交 50%

Boundaries in the Instantaneous Formulation of Field Theories

场论瞬时形式中的边界

Silvester G. A. Borsboom

专题命中 其他LLM :prompting(abstract)

AI总结 研究经典场论中协变与瞬时形式下的边界条件,揭示恒定狄利克雷边界条件导致瞬时状态空间为满足该条件的场位形空间的切丛,而仅要求场速度在边界为零时产生扇区结构,每个扇区由边界位形标记的切丛构成,经勒让德变换得到叶状典范泊松结构的扇区相空间,应用于杨-米尔斯理论并与通量超选择扇区关联。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21466 2026-07-01 cs.CV 版本更新 50%

StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation

StreamGVE: 无需训练的视频编辑通过少步流式视频生成

Guanlong Jiao, Chenyangguang Zhang, Jia Jun Cheng Xian, Zewei Zhang, Renjie Liao

机构 * The University of British Columbia(不列颠哥伦比亚大学) ETH Zürich(苏黎世联邦理工学院) McMaster University(麦马斯特大学) Vector Institute(向量研究所) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

专题命中 其他LLM :prompting(abstract)

AI总结 本文提出StreamGVE,一种基于噪声到数据视角的视频编辑方法,通过引入双分支快速采样和自注意力桥接以及交叉注意力接地/增强,实现了高效的视频编辑,能够在少步设置中优于现有方法。

Comments ECCV 2026. Project Page: https://dsl-lab.github.io/StreamEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23455 2026-07-01 cs.CV 版本更新 50%

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

DetPO:基于多模态大语言模型的上下文学习用于少样本目标检测

Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Roboflow

专题命中 其他LLM :prompting(abstract)

AI总结 提出DetPO,一种无需梯度的测试时优化方法,通过最大化少样本视觉训练示例上的检测精度并校准预测置信度,优化文本提示,提升多模态大语言模型在少样本目标检测中的性能。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://ggare-cmu.github.io/DetPO/

详情

展开后加载摘要…

URL PDF HTML 收藏