arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-09 至 2026-07-09 共收录 77 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 3 篇

2603.17390 2026-07-09 cs.CV 版本更新 82%

FMMC: Harnessing the Power of Foundation Models for Accurate Material Classification

利用基础模型提升材料分类的准确性

Qingran Lin, Fengwei Yang, Chaolun Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学) Waseda University(早稻田大学)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract)

AI总结 本文提出一种利用基础模型克服数据限制并提升分类准确性的新框架,通过生成高质量数据集和融合视觉语言模型先验知识,有效提高材料分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18360 2026-07-09 cs.SD cs.CL 版本更新 70%

Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval

Omni-Embed-Audio: 利用多模态大语言模型实现鲁棒的音频-文本检索

HaeJun Yoo, Yongseop Shin, Insung Lee, Myoung-Wan Koo, Du-Seong Chang

机构 * Sogang University(首尔大学)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.CL

AI总结 提出Omni-Embed-Audio(OEA)检索编码器,利用多模态大语言模型原生理解音频,并通过用户意图查询(UIQ)和硬负样本挖掘,在文本到音频检索中达到与M2D-CLAP相当的性能,同时在文本到文本检索和硬负样本判别上显著优于现有方法。

Comments Accepted at ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15770 2026-07-09 physics.optics cs.AR cs.CV 版本更新 50%

Physically Grounded Monocular Depth via Nanophotonic Wavefront Encoding

通过纳米光子波前编码实现物理基础的单目深度

Bingxuan Li, Jiahao Wu, Yuan Xu, Zezheng Zhu, Yunxiang Zhang, Kenneth Chen, Yanqi Liang, Nanfang Yu, Qi Sun

机构 * New York University(纽约大学) Columbia University(哥伦比亚大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 研究旨在解决单目深度感知中度量尺度模糊问题,核心方法是用超透镜通过纳米光子学编码深度线索,结合DFMs与输入自适应策略及模拟管道,实验证明该方法有效提升单目度量深度传感精度。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 4 篇

2510.13817 2026-07-09 cs.LG cs.NI 版本更新 88%

What's on My Network? Using Large Language Models to Identify Real-World IoT Devices at Scale

我的网络上有什么?使用大语言模型大规模识别现实世界中的物联网设备

Rameen Mahmood, Tousif Ahmed, Sai Teja Peddinti, Danny Yuxing Huang

机构 * New York University(纽约大学) Google(谷歌)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 研究共享环境中物联网设备识别难题,引入语义推理管道,用大语言模型构建高保真标签并指令微调模型,在众多供应商中取得高准确率,对多种问题保持稳健,为大规模可信设备识别提供基础。

Comments 18 pages, 3 figures

Journal ref Proc. ACM Netw. 4, CoNEXT2, Article 26 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15207 2026-07-09 cs.LG cs.MA 版本更新 79%

TeamTR: Trust-Region Fine-Tuning for Multi-Agent LLM Coordination

TeamTR: 用于多智能体大语言模型协调的信赖区域微调

Yi Xie, Siao Liu, Falong Fan, Yuanqi Yao, Yue Zhao, Bo Liu

机构 * Department of Electrical \& Computer Engineering, University of Arizona Engineering College, Soochow University INSAIT, Sofia University "St. Kliment Ohridski" Department of Electrical Computer Engineering, Stony Brook University

专题命中 指令微调 :LLM(title,abstract);分类 cs.LG

AI总结 本文提出TeamTR,通过信赖区域框架在每个组件更新后重采样轨迹并控制每个智能体的发散度,解决多智能体系统中因上下文分布变化导致的性能下降问题,实验表明其在协调回归抑制和组件替换支持方面优于单智能体和序列基线。

Comments 9pages, Accepted at ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03800 2026-07-09 cs.LG cs.AI 版本更新 62%

Trading Human Curation for Synthetic Augmentation in RLVR

在RLVR中用合成增强替代人工策展

Akshansh, Leonardo Rosa Rodrigues, Michael Korostelev, Youssef Hassan, Mark E. Whiting

机构 * Pareto AI

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过预指定、门控过滤的增强任务替代人工策展任务,在RLVR中实现成本效益权衡,并保持泛化性能。

Comments 21 pages, 5 main-text figures, 4 appendix figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12323 2026-07-09 cs.LG cs.SE 版本更新 57%

The Appeal and Reality of Recycling LoRAs with Adaptive Merging

通过自适应合并回收LoRAs的吸引力与现实

Haokun Liu, Gyung Hyun Je, Marco Ciccone, Zhenlin Xu, Prasanth YSS, Colin Raffel

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Mistral AI Hugging Face

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 研究针对回收在模型库中“野生”的LoRAs,通过实证研究多种自适应和非自适应合并方法,发现自适应合并虽能提升性能,但相比用相同数据训练新LoRA优势有限,且合并LoRAs的具体选择重要性不大,还证实了正向迁移的可能性并开源相关资源。

Comments 24 pages, 14 figures, 5 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 4 篇

2511.01043 2026-07-09 cs.SE 版本更新 83%

DPO-F+: Aligning Code Repair Feedback with Developers' Preferences

DPO-F+:使代码修复反馈与开发者偏好对齐

Zihan Fang, Yifan Zhang, Yueke Zhang, Kevin Leach, Yu Huang

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究针对大语言模型在代码修复中开发者难解读输出的问题,提出DPO-f+框架,通过定义指标、构建数据集、微调模型及评估反馈质量,提升反馈准确性与对齐度,增强了代码理解和人机协作。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02712 2026-07-09 cs.LG cs.CL 版本更新 79%

Towards Understanding Steering Strength

理解引导强度

Magamed Taimeskhanov, Samuel Vaiter, Damien Garreau

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型训练后控制中引导强度问题,提出对其首次理论分析,刻画其对相关量的影响并推导规律,揭示非单调效应,还通过11个语言模型实验验证了理论预测。

Comments Accepted for publication at ICML 2026 (50 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21476 2026-07-09 cs.CL 版本更新 77%

Thinking Seeds: Leveraging Historical Diversity for Position-Aware RL in LLMs

思维种子:在语言模型中利用历史多样性进行位置感知强化学习

Lei Yang, Wei Bi, Chenxi Sun, Renren Jin, Deyi Xiong

机构 * TJUNLP Lab, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院 TJUNLP 实验室)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究语言模型在线强化学习问题,提出思维种子这一令牌级混合策略框架,利用模型历史检查点作离线前缀,通过令牌级重要性比率有效利用历史多样性,实验表明其性能优于标准在线训练和现有离线扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23615 2026-07-09 cs.CV 版本更新 50%

HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework

无需标注的高分辨率大多模态模型视觉推理技术

Jiacheng Yang, Anqi Chen, Yunkai Dang, Qi Fan, Cong Wang, Wenbin Li, Feng Miao, Yang Gao

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) Institute of Brain-inspired Intelligence(脑启发式智能研究院) Shenzhen Research Institute of Nanjing University(南京大学深圳研究院)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 HART通过闭环框架和AP-GRPO方法,实现无需外部标注的高分辨率视觉推理,提升多模态模型在高分辨率任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 7 篇

2508.00554 2026-07-09 q-fin.TR cs.CL q-fin.CP 版本更新 86%

ContestTrade: A Multi-Agent Trading System Based on Internal Contest Mechanism

ContestTrade:一种基于内部竞争机制的多智能体交易系统

Rui Sun, Li Zhao, Zuoyou Jiang, Bo Yang, Yuxiao Bai, Mengting Chen, Jing Li, Zuo Bai

机构 * Stepfun FinStep

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对基于LLM的智能体在金融交易中决策受市场信息影响的问题,提出ContestTrade多智能体交易系统,通过“量化 - 预测 - 分配”竞争机制及两个专业团队协作,在A股回测中取得较好收益和风险调整绩效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00533 2026-07-09 cs.LG cs.IT math.IT 版本更新 84%

Toward Robust Open-set Adaptation: Synapse Consolidation Inspired by Rac1/MAPK Pathways

在开放测试流中学习并适应未知

Xiao Zhang, Tianyu Hu, Juntao Lyu, Qianchuan Zhao, Huimin Ma

机构 * University of Science and Technology Beijing(北京科技大学) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SyCo方法,通过Rac1和MAPK路径实现参数高效适应,解决LLM在动态任务中的适应问题,实验表明其在18个NLP数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24222 2026-07-09 cs.SE cs.AI cs.CL 版本更新 82%

Learning from Execution: Self-Evolving Memory for Private-Library Code Generation

MEMCoder: 多维演化记忆用于面向私有库的代码生成

Mofei Li, Taozhi Chen, Guowei Yang, Jia Li

机构 * College of AI(人工智能学院) Tsinghua University(清华大学) Fitten Tech Co., Ltd.(Fitten科技有限公司)

专题命中 长上下文与记忆 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MEMCoder通过多维演化记忆机制,解决LLM在企业环境中因缺乏内部私有库文档导致的协调问题与参数理解不足,提升代码生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22140 2026-07-09 cs.CL 版本更新 70%

Psy-Chronicle:A Structured Pipeline for Synthesizing Long-Horizon Campus Psychological Counseling Dialogues

Psy-Chronicle: 一个用于合成长周期校园心理辅导对话的结构化流水线

Chaogui Gou

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Psy-Chronicle,一种结构化数据生成框架,用于合成长周期校园心理辅导对话,通过生成学期跨度的时间压力事件图和学生与辅导员代理的交互模拟,构建了包含100个学生档案和9万条对话的CPCD数据集,并通过CPCD-Bench评估模型的长周期校园辅导能力,实验结果表明CPCD有效提升了模型的会话级响应生成和长周期记忆召回能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09558 2026-07-09 cs.DC cs.LG cs.PL 版本更新 70%

VTC: DNN Compilation with Virtual Tensors for Data Movement Elimination

VTC: 基于虚拟张量的DNN编译以消除数据移动

Muyan Hu, Ahan Gupta, Jiachen Yuan, Vima Gupta, Taeksang Kim, Xin Xu, Janardhan Kulkarni, Ofer Dekel, Vikram Adve, Charith Mendis

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院) Microsoft(微软)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 VTC通过引入虚拟张量概念,首次实现消除所有不必要的数据移动,提升DNN编译效率,减少内存占用。

Comments Accepted to OSDI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04809 2026-07-09 cs.SE 版本更新 67%

Watts This Smell: A Comprehensive Taxonomy of Software Energy Smells

一种经过验证的软件能耗异味分类

Mohammadjavad Mehditabar, Saurabhsingh Rajput, Tushar Sharma

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)

AI总结 本文提出了一种全面的软件能耗异味分类,通过系统文献综述和雪球抽样,将320种低效模式分类为12种主要能耗异味和65种根本原因。通过实证验证,发现71%的样本存在多种共存的异味,内存相关异味的修复节能效果最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01109 2026-07-09 cs.AI 版本更新 57%

Platonic Representations for Poverty Mapping: Unified Vision-Language Codes or Agent-Induced Novelty?

贫困地图绘制的柏拉图式表示:统一的视觉语言代码还是智能体诱导的新颖性?

Satiyabooshan Murugaboopathy, Connor T. Jerzak, Adel Daoud

机构 * AI and Global Development Lab(人工智能与全球发展实验室) Institute for Analytical Sociology(分析社会学研究所) Institute of Computer Science(计算机科学研究所) Department of Government(政府系)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 研究社会经济指标在卫星图像和网络文本中的信息印记,开发多模态框架经五条管道预测家庭财富,贡献包括融合视觉与文本提升预测、发现部分表示对齐证据、发布大规模多模态数据集。

Comments ICSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 10 篇

2603.23800 2026-07-09 cs.RO cs.AI cs.LG 版本更新 90%

Object Search in Partially-Known Environments via LLM-informed Model-based Planning and Prompt Selection

通过LLM引导的基于模型的规划与提示选择进行部分已知环境中的物体搜索

Abhishek Paudel, Abhish Khanal, Raihan I. Arnob, Shahriar Hossain, Gregory J. Stein

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于LLM的模型规划框架和提示选择方法,用于部分已知环境中的物体搜索。利用LLM估计不同位置搜索目标物体的可能性,并结合环境地图提取的旅行成本,以实现有效的搜索性能。

Comments 10 pages, 8 figures. Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23802 2026-07-09 cs.AI cs.CV 版本更新 88%

EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models

EMO-R3:多模态大语言模型中用于情感推理的反射强化学习

Yiyang Fang, Wenke Huang, Pei Fu, Yihao Yang, Kehua Su, Zhenbo Luo, Jian Luan, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型情感推理难题,提出EMO-R3框架。引入结构化情感思维并设计反射情感奖励,经大量实验验证,该框架显著提升模型可解释性与情商,在多视觉情感理解基准测试中表现出色。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12265 2026-07-09 cs.CL 版本更新 86%

Fast, Slow, and Tool-augmented Thinking for LLMs: A Review

大语言模型的快速、慢速和工具增强思维:综述

Xinda Jia, Jinpeng Li, Zezhong Wang, Jingjing Li, Xingshan Zeng, Yasheng Wang, Weinan Zhang, Yong Yu, Weiwen Liu

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学机械工程学院) School of Computer Science, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学计算机科学学院) Huawei Technologies Co., Ltd., Beijing 100084, China(华为技术有限公司) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong, Hong Kong 999077, China(香港中文大学系统工程与工程管理系) Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong 999077, China(香港中文大学计算机科学与工程系) Huawei Hong Kong Research Center, Hong Kong 999077, China(华为香港研究中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 综述大语言模型推理进展,基于认知心理学提出LLM推理策略分类法,沿快速/慢速、内部/外部两个知识边界分类,系统调查相关工作并依关键因素归类方法,指出其面临的挑战与未来方向。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-51673-0}

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30170 2026-07-09 cs.MM cs.CV cs.LG 版本更新 83%

Unveiling the Visual Counting Bottleneck in Vision-Language Models

揭示视觉语言模型中的视觉计数瓶颈

Xingzhou Pang, Yifan Hou, Junling Wang, Mrinmaya Sachan

机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 推理与问题求解 :language model(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18784 2026-07-09 cs.AI 版本更新 83%

Successor-Generator Planning with LLM-generated Heuristics

基于大语言模型生成启发式策略的后继生成器规划

Alexander Tuisov, Yonatan Vernik, Alexander Shleyfman

机构 * Computer Science Department, Bar-Ilan University(巴伊兰大学计算机科学系)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究借助大语言模型,从规划任务中生成特定问题启发式函数并集成到搜索算法。该方法在多规划基准测试中性能优异,还能解决传统形式难表达的问题,经评估展现出有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11840 2026-07-09 cs.LG cs.AI cs.CY cs.MA 版本更新 82%

Diversity Without Fidelity: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation Simulation

当推理模型损害行为模拟:多智能体大语言模型谈判中的求解器-采样器不匹配

Sandro Andric

专题命中 推理与问题求解 :LLM(title,comments);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究指出推理增强模型在模拟行为时可能表现不佳,通过三个多智能体谈判环境实验发现,有界推理能产生更多样且妥协导向的轨迹,强调模拟应将模型视为采样器而非求解器。

Comments 20 pages, 2 figures. Substantially revised. Formerly titled "When Reasoning Models Hurt Behavioral Simulation: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27000 2026-07-09 cs.CL cs.AI 版本更新 73%

Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning

撒更宽的网:面向代码推理的协调 Pass@K 策略优化

Yilong Li, Suman Banerjee, Tong Che

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA Research(英伟达研究)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出协调 Pass@K 策略优化 (CPPO),通过规划器生成多种策略并协调求解器尝试,以解决代码生成中重复采样导致冗余推理路径的问题,在多个基准上显著提升 pass@4。

Comments Code reasoning; pass@K optimization; coordinated planning; verifiable rewards; strategy diversity

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13726 2026-07-09 cs.CL cs.AI cs.IR 版本更新 62%

Refine Thought: A Test-Time Inference Method for Embedding Model Reasoning

细化思维:一种用于嵌入模型推理的测试时推理方法

Guangzhi Wang, Kai Li, Yinghao Jiao, Zhi Liu

机构 * CareerInternational Research Team(CareerInternational研究团队)

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究提出RT方法,通过多次前向传递增强文本嵌入模型语义推理能力。在BRIGHT语义推理任务和PJBenchmark上有显著改进,在C-MTEB等通用任务上性能一致,有效激活预训练语义推理能力,是一种测试时推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10956 2026-07-09 cs.CV cs.AI 版本更新 57%

A Study of Commonsense Reasoning over Visual Object Properties

关于视觉对象属性的常识推理研究

Abhishek Kolari, Mohammadhossein Khojasteh, Yifan Jiang, Floris den Hengst, Filip Ilievski

机构 * Department of Computer Science, Vrije Universiteit(自由大学计算机科学系) Information Sciences Institute, University of Southern California(南加州大学信息科学研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究针对视觉对象属性的常识推理,引入含特定图像类型、推理层次和属性维度的评估框架,在两个VQA基准中实验,发现现有VLM存在显著局限,虽新模型有进步但仍与人类有差距,还提供了相关数据和代码以助未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05711 2026-07-09 cs.CV 版本更新 50%

From My View to Yours: Learning Egocentric Cues from Exocentric Video using Privileged Egocentric Supervision

从我的视角到你的视角:利用特权自我中心监督从外中心视频中学习自我中心线索

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Elorian AI

专题命中 推理与问题求解 :language model(abstract)

AI总结 研究针对视觉语言模型难以从外中心视频推断自我中心属性的问题,提出Ego2ExoVLM框架,利用时间同步视频对及特权监督,通过两个组件实现此能力,在多任务评估中取得领先性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 评测与基准 20 篇

2601.16529 2026-07-09 cs.AI cs.HC 版本更新 92%

SycoEval-EM: Sycophancy Evaluation of Large Language Models in Simulated Clinical Encounters for Emergency Care

SycoEval-EM:急诊护理模拟临床场景中大语言模型的谄媚评估

Dongshen Peng, Yi Wang, Austin Schoeffler, Sun-ha Hong, Brian Suffoletto, David Kim, Carl Preiksaitis, Christian Rose

机构 * UNC Chapel Hill(UNC夏洛特山分校) University of Waterloo(滑铁卢大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出SycoEval-EM多智能体模拟框架,评估19个LLM在急诊医学中对患者说服的鲁棒性,发现谄媚率呈双峰分布,静态医学基准无法预测安全表现。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19723 2026-07-09 cs.CL cs.AI 版本更新 91%

Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges

大型语言模型中的数学推理:基准测试、架构、评估与开放挑战

Husnain Amjad, Raja Khurram Shahzad, Aamir Shahzad, Mehwish Fatima

机构 * organization= School of Electrical Engineering Computer Science, National University of Science organization= School of Computing, Data Mathematical Sciences, Western Sydney University, Indonesia organization= Department of Communication, Quality Management Information Systems, Mid Sweden University, Östersund Campus, Sweden

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 本文综述了大型语言模型在数学推理方面的最新进展,通过分析数据集、架构、训练策略和评估协议,探讨了数学推理的基准测试、架构设计、评估方法以及未来的研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏