arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-25 至 2026-06-25 共收录 269 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 69 篇

2606.24679 2026-06-25 cs.LG cs.AI 新提交 90%

FlowPipe: LLM-Enhanced Conditional Generative Flow Networks for Data Preparation Pipeline Construction

FlowPipe: 基于条件生成流网络的LLM增强数据准备流水线构建

Kunyu Ni, Lei Cao, Jie He, Xiaotong Zhang, Jianfeng Jin, Junyu Dong, Yanwei Yu

机构 * Ocean University of China(中国海洋大学) University of Arizona(亚利桑那大学) University of Science and Technology Beijing(北京科技大学) Northeastern University(东北大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出FlowPipe框架,利用条件生成流网络(C-GFlowNets)和LLM语义调制,解决数据准备流水线自动构建中的组合优化和稀疏搜索问题,在74个数据集上平均准确率提升11.96%,训练收敛速度提升12.5倍。

Comments Accepted by SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25608 2026-06-25 cs.CR cs.AI 新提交 90%

An Approach for a Supporting Multi-LLM System for Automated Certification Based on the German IT-Grundschutz

基于德国IT-Grundschutz的自动化认证的多LLM支持系统方法

Lea Roxanne Muth, Marian Margraf

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种多LLM系统结合混合RAG的方法,用于半自动化BSI IT-Grundschutz认证,以提高效率、降低成本并应对NIS2指令带来的认证需求增长。

Comments Accepted for publication at the 2025 IEEE International Conference on Cyber Security and Resilience (IEEE CSR), Chania, Crete, Greece, August 4-6, 2025. 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00804 2026-06-25 cs.CR cs.AI cs.DB 版本更新 90%

Epistemic Bias Injection: Manipulating LLM Opinion via Selective Context Retrieval

认知偏见注入:通过选择性上下文检索操纵LLM观点

Hao Wu, Prateek Saxena

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 研究通过检索增强生成(RAG)数据库注入事实正确但认知偏见的段落,以操纵LLM输出立场,并提出基于几何度量的攻击与防御方法BiasDef。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25296 2026-06-25 cs.AR 新提交 89%

SafeGen: LLM-Driven Assertion Generation and Fault Criticality Evaluation for Functional Safety

SafeGen: 面向功能安全的LLM驱动断言生成与故障关键性评估

Xuanyi Tan, Arjun Chaudhuri, Rubin Parekhji, Krishnendu Chakrabarty

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SafeGen框架,利用大语言模型和超知识图谱从设计文档提取规范并生成功能安全断言,结合门级到RTL故障映射与形式验证实现故障关键性语义分级,在FOC系统中验证了优于传统方法。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02471 2026-06-25 cs.CL 88%

Hengqin-RA-v1: Advanced Large Language Model for Diagnosis and Treatment of Rheumatoid Arthritis with Dataset based Traditional Chinese Medicine

Hengqin-RA-v1: 针对类风湿性关节炎诊断与治疗的先进大语言模型基于传统中医数据集

Yishen Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Hengqin-RA-v1,专为中医诊断和治疗类风湿性关节炎设计,结合古籍和现代文献构建的RA数据集,实验显示其性能超越现有模型,甚至在某些情况下超越中医专家。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24973 2026-06-25 cs.CL cs.AI cs.CY cs.LG 新提交 88%

LLM Performance on a Real, Double-Marked GCSE Benchmark

LLM在真实双评GCSE基准测试中的表现

Malachy Fox, Kavi Samra, Paul Jung

机构 * Medly AI

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究引入包含32,534份双评真实学生GCSE模拟考试回答的数据集,测试大型语言模型与考官评分的一致性,发现顶级模型比考官之间更一致,为自动化评分提供经济有效的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24980 2026-06-25 cs.LG 新提交 88%

Closed-Loop Graph Algorithm Execution with Small Language Models: Step Accuracy and Rollout Reliability

使用小型语言模型的闭环图算法执行:步骤准确性与推出可靠性

Michal Podstawski

机构 * NASK National Research Institute(NASK国家研究所)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.LG

AI总结 研究小型语言模型在闭环中执行图算法的能力,发现结构算法可适应可靠,但加权算法对误差累积敏感,强预测不保证可靠执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19157 2026-06-25 eess.AS cs.CL 新提交 88%

IndicContextEval: A Benchmark for Evaluating Context Utilisation in Audio Large Language Models Across 8 Indic Languages

IndicContextEval:评估8种印度语言音频大语言模型上下文利用能力的基准

Sakshi Joshi, Dhruv Subhash Rathi, Sanskar Singh, Eldho Ittan George, R J Hari, Kaushal Bhogale, Mitesh M. Khapra

机构 * AI4Bharat, Indian Institute of Technology Madras, India(AI4Bharat,印度理工学院马德拉斯分校) Sarvam AI, India(Sarvam AI,印度)

专题命中 评测与基准 :large language model(title);language model(title);pretraining(abstract);prompting(abstract)

AI总结 提出IndicContextEval基准,包含8种印度语言555位说话人的56小时自然语音,通过7级提示框架评估音频大语言模型是否真正利用上下文而非依赖参数化知识。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25193 2026-06-25 cs.SE 新提交 88%

LLM4MTLs: Automated Generation and Empirical Evaluation of Model Transformation Languages

LLM4MTLs:模型转换语言的自动生成与实证评估

Bowen Jiang, Nathan Hagel, Haowei Cheng, Benedikt Jutz, Arne Lange, Weixing Zhang, Rahul Sharma, Ralf Reussner, Anne Koziolek

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出LLM4MTLs工作流,通过少样本提示、语法提示和辅助方法组合,自动生成并评估LLM编写的模型转换代码,发现少样本提示能提升语法质量但语义改进有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25380 2026-06-25 cs.CL 新提交 87%

A Survey of Toxicity Detection and Mitigation Strategies for Multilingual Language Models

多语言语言模型毒性检测与缓解策略综述

Soham Dan, Himanshu Beniwal, Thomas Hartvigsen

机构 * Scale AI Indian Institute of Technology Gandhinagar(印度理工学院甘地讷格尔分校) University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 综述多语言大模型的毒性检测与缓解方法,包括威胁模型、检测方法(跨语言编码器、翻译流水线等)和缓解策略(数据过滤、偏好调优等),指出语言覆盖不均、文化依赖等挑战。

Comments Accepted to the Findings of ACL, 2026

Journal ref Findings of ACL, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25358 2026-06-25 cs.AI cs.MA 新提交 87%

Agentic Knowledge Tracing: A Multi-Agent LLM Architecture for Stealth Assessment of Financial Literacy in Serious Games

Agentic知识追踪:用于严肃游戏中金融素养隐形评估的多智能体大语言模型架构

Gabriel Santos, Rita Julia, Marcelo Nascimento

机构 * Federal University of Uberlândia Computer Science Faculty(伯南布哥联邦大学计算机科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出多智能体大语言模型架构Agentic BKT,通过四阶段流程从严肃游戏事件中隐形评估金融素养,实验表明其预测效度显著优于单智能体基线。

Comments 8 pages, 5 figures, IEEE CoG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25530 2026-06-25 cs.SE cs.AI cs.CL 新提交 87%

Evaluating LLMs on Real-World Software Performance Optimization

评估大语言模型在真实软件性能优化中的表现

Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

机构 * Siemens AG(西门子公司) Technical University of Munich(慕尼黑技术大学) Heilbronn, Germany(德国海德堡) Munich, Germany(德国慕尼黑)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有基准过度简化性能优化的问题,提出基于102个专家优化的仓库级基准SWE-Pro,评估LLM在运行时、峰值内存和时间加权内存使用上的表现,发现LLM优化效果显著弱于专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24950 2026-06-25 cs.LG cs.AI 新提交 85%

MacroLens: A Multi-Task Benchmark for Contextual Financial Reasoning under Macroeconomic Scenarios

MacroLens:宏观经济情景下的多任务上下文金融推理基准

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 针对金融决策中价格、基本面、宏观和文本四信号联合评估的缺失,构建了涵盖4426只美股、七个任务、1130个宏观事件的基准,评估19种方法,揭示上下文特征的重要性。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25760 2026-06-25 cs.LG cs.AI cs.CL cs.CV 新提交 85%

Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets

计算机使用代理的不确定性量化:跨视觉语言模型和GUI基础数据集的基准测试

Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Intel Labs(英特尔实验室) Capital One AI Labs(Capital One AI实验室)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出跨机制基准Argus,评估27种后验不确定性量化方法在4个VLM代理和4个数据集上的表现,发现UQ排名在固定模型内跨数据集稳定,但跨模型类别和接口时下降,隐藏状态和密度方法最稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25391 2026-06-25 cs.SD cs.AI cs.MM 新提交 83%

From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

从声音到场景:评估大型音频语言模型中上下文感知听觉场景理解的基准

Pengfei Zhang, Hoang H Nguyen, Kazi Shaharair Sharif, Yutong Song, Wenjun Huang, Henry Peng Zou, Pinxin Liu, Honghui Xu, Amir M. Rahmani

机构 * University of California Irvine(加州大学尔湾分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Kennesaw State University(肯尼索州立大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出CASU基准,通过构建半合成音频流和设计四项任务,评估大型音频语言模型整合语音、事件和背景环境进行上下文感知听觉场景理解的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19887 2026-06-25 cs.CR cs.AI 新提交 83%

FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming

FFinRED:面向金融大语言模型红队测试的专家引导基准生成与评估框架

Chaeyun Kim, Daeyoung Park, Junghwan Kim, Jinyoung Jeong, Eunji Song, Yongtaek Lim, Minwoo Kim

机构 * DATUMO INC.(DATUMO公司) Korea Advanced Institute of Science and Technology (KAIST)(韩国先进科学研究院) Financial Security Institute (FSI)(金融安全研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 提出FinRED框架,通过专家引导的两级分类法将全球金融标准映射为威胁,并利用真实金融文档生成上下文丰富的红队行为提示,结合专家验证的评估标准,有效降低关键假阴性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26094 2026-06-25 cs.LG 新提交 81%

RevengeBench: Reverse Engineering Code-Space Policies from Behavioral Experiments

RevengeBench: 从行为实验中逆向工程代码空间策略

Babak Rahmani, Sebastian Dziadzio, Joschka Strüber, Sergio Hernández-Gutiérrez, Matthias Bethge

机构 * Tübingen AI Center(图宾根人工智能中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出RevengeBench基准,通过行为轨迹和可控实验逆向工程LLM生成的策略代码,验证恢复质量在34-72%之间,并能提升下游对战胜率。

Comments 12 pages, 5 figures, 22 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26040 2026-06-25 cs.CL 新提交 81%

AI translation of literary texts is "fine", but readers still prefer human translations

AI 翻译文学作品“还行”,但读者仍偏好人工翻译

Yves Ferstler, Adam Podoxin, Ty Brassington, Roman Grundkiewicz, Maite Taboada, Marzena Karpinska

机构 * Simon Fraser University(西蒙菲莎大学) Université du Québec à Montréal(魁北克大学蒙特利尔分校) Microsoft(微软)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过15位读者对15部法、波、日小说的人工翻译与AI翻译的比较实验,发现AI翻译虽可接受,但读者更偏好人工翻译的流畅性、清晰度和沉浸感,且无法可靠区分两者。

Comments 58 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25705 2026-06-25 cs.AI 新提交 81%

GUI agent: Guided Exploration of User-Sensitive Screens

GUI代理:用户敏感屏幕的引导探索

Aradhana Nayak, Mussadiq Nazeer, Wang Peng, Feng Liu

机构 * Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑)) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一种探索代理,通过系统性地探索查询空间,识别在GUI环境中执行后会导致用户敏感状态的查询,以提升LLM代理的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25529 2026-06-25 cs.SD cs.AI 新提交 81%

STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

STEB:用于评估超越翻译保真度的语音到语音翻译表现力基准

Sitong Cheng, Weizhen Bian, Songjun Cao, Jin Li, Bei Liu, Chunyang Jiang, Yike Zhang, Weihao Wu, Yiming Li, Chi-Min Chan, Long Ma, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出STEB基准,通过描述-总结框架评估语音到语音翻译在情感、场景风格和非语言发声方面的表现力,发现现有系统在语义保真度上表现良好但表现力保留不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25445 2026-06-25 cs.CV cs.AI 新提交 81%

C3-Bench: A Context-Aware Change Captioning Benchmark

C3-Bench:一种上下文感知的变化描述基准

Jae-Woo Kim, Hyeongbeom Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出C3-Bench基准,包含51种真实变化场景的4996对图像,并首次引入LLM-as-Judge评估框架,揭示现有模型在非训练分布场景下的系统性盲点。

Comments ECCV 2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25102 2026-06-25 cs.CL 新提交 81%

Dream at SemEval-2026 Task 13: SALSA for Single-Pass Machine-Generated Code Detection

Dream at SemEval-2026 Task 13: SALSA用于单遍机器生成代码检测

Ruslan Berdichevsky, Shai Nahum-Gefen, Elad Ben-Zaken

机构 * Dream Security Ltd.(Dream Security有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SALSA方法,通过自回归语言模型单遍结构化分类,将每个类别映射到专用输出token,结合平衡采样和参数高效微调,在机器生成代码检测任务上达到F1=0.789,远超CodeBERT基线。

Comments Accepted to SemEval-2026, ACL 2026 workshop proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24995 2026-06-25 cs.LG cs.AI q-bio.QM 新提交 81%

Are Tabular Foundation Models Robust to Realistic Query Distribution Shifts in Microbiome Data?

表格基础模型对微生物组数据中真实查询分布偏移的鲁棒性如何?

Giulia Perciballi, Ahmad Fall, Federica Granese, Edi Prifti, Jean-Daniel Zucker

机构 * IRD, Sorbonne Université, Unité de Modélisation Mathématique et Informatique des Systèmes Complexes (UMMISCO)(法国发展研究所、索邦大学、复杂系统数学建模与信息学单元) Inria, CNRS, I3S, Université Côte d’Azur(法国国家信息与自动化研究所、法国国家科学研究中心、信息系统与软件工程实验室、蔚蓝海岸大学) INSERM, Nutrition et Obésités(法国国家健康与医学研究院、营养与肥胖症) Approches Systémiques, NutriOmique, AP-HP, Hôpital Pitié-Salpêtrière(系统方法、营养组学、巴黎公立医院集团、皮提耶-萨勒佩特里医院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过引入基准测试,评估表格基础模型在六个人类肠道微生物组数据集上对三种生物启发式扰动(去除高丰度类群、稀疏化、零值注入)的鲁棒性,发现即使保留判别性特征,模型性能仍下降,零值注入破坏性最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26088 2026-06-25 quant-ph 80%

Simulating Universal Quantum Gate Sets on Photonic OAM Qubits: Single-Qubit and Multi-Qubit Operations via Spatial Light Modulator Phase Holography

在光子OAM量子比特上模拟通用量子门集:通过空间光调制器相位全息实现单量子比特和多量子比特操作

Saleha Maqsood, Muhammad Kamran, Tahir Malik

专题命中 评测与基准 :SLM(summary_cn,abstract)

AI总结 本文基于HOLOEYE LC 2012透射式SLM,通过三通道噪声模型模拟通用单量子比特门和两量子比特纠缠门,预测保真度在0.9914-0.9936之间,并分析了噪声来源和最优工作波长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25905 2026-06-25 cs.CV 新提交 80%

SurgAtlas: A Large-Scale Surgical Video-Language Dataset with 2,391 Hours of Open and Minimally Invasive Surgery

SurgAtlas:一个包含2,391小时开放和微创手术的大规模手术视频-语言数据集

Filippos Bellos, Andre S. Gala-Garza, Miaowei Wang, Alyssa M. Hardin, Ahmad M. Hider, Yayuan Li, Jing Bi, Susan Liang, Chenliang Xu, Donald S. Likosky, Jason J. Corso

机构 * University of Michigan(密歇根大学) University of Edinburgh(爱丁堡大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) University of Colorado(科罗拉多大学) University of Rochester(罗切斯特大学) Michigan Medicine(密歇根医学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract);pretraining(abstract)

AI总结 提出SurgAtlas,最大手术视频-语言数据集(15,291视频,2,391小时,18专科,5,000+术式),首次大规模纳入开放手术并建立基准,通过多层级自动标注管道生成丰富注释,微调Qwen3-VL-8B在多个基准上达到领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05738 2026-06-25 cs.CL 版本更新 79%

MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models

MedLayBench-V:面向医学视觉语言模型中专家与普通人语义对齐的大规模基准

Han Jang, Junhyeok Lee, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University Hospital(首尔国立大学医院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院健康人工智能研究所) The Advanced Imaging and Computational Neuroimaging (AICON) Laboratory(先进影像与计算神经影像实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 提出首个大规模多模态基准MedLayBench-V,通过结构化概念基础精炼管道实现专家-普通人语义对齐,用于训练和评估能弥合医患沟通鸿沟的医学视觉语言模型。

Comments Findings of ACL 2026. 9 pages, 5 figures, 11 tables, plus appendix

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18375-18394

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04584 2026-06-25 cs.CL cs.SD eess.AS 版本更新 79%

Robustness assessment of large audio language models in multiple-choice evaluation

大型音频语言模型在多项选择评估中的鲁棒性评估

Fernando López, Santosh Kesiraju, Jordi Luque

机构 * Scientific Research, Telefónica Innovación Digital, Spain(Telefónica Innovación Digital科研部,西班牙) Universidad Autónoma de Madrid, Spain(马德里自治大学,西班牙) Brno University of Technology, Czech Republic(布拉格技术大学,捷克)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究大型音频语言模型在多项选择问答中对选项顺序、问题措辞的敏感性,并提出考虑细微变化的评估协议和指标。

Comments Accepted in Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25714 2026-06-25 eess.SP 78%

CSI-CLIP++: A Scalable Channel Foundation Model for Wireless Communication via CIR-CSI Consistency

CSI-CLIP++: 一种通过CIR-CSI一致性实现可扩展的信道基础模型

Jun Jiang, Wenjun Yu, Yunfan Li, Yuan Gao, Shugong Xu

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出CSI-CLIP++,通过频域CSI与时延域CIR的对比对齐学习可迁移表示,在信道识别、波束预测和定位任务上优于监督基线,波束预测Top-1准确率提升高达19.31个百分点。

Comments Submitted to IEEE Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25056 2026-06-25 cs.RO 新提交 78%

BFMTrack: Latent Sequence Optimization for Physics-Based Motion Tracking with Behavioral Foundation Models

BFMTrack: 基于行为基础模型的物理运动跟踪的潜在序列优化

Thomas Rupf, Agon Serifi, David Müller, Sammy Christen, Ruben Grandia, Espen Knoop, Moritz Bächer

机构 * Disney Research(迪士尼研究院)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出潜在序列优化方法,结合仿真展开和策略梯度更新,优化潜在序列以实现精确运动跟踪,无需奖励工程,并在密集跟踪、稀疏关键帧和真实人形机器人上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25610 2026-06-25 astro-ph.IM astro-ph.GA 新提交 78%

The Galaxy's Guide to the Tokenizer: A Benchmark for Scientific Foundation Models

银河系分词器指南:科学基础模型的基准测试

Sogol Sanjaripour, Michael J. Smith, Manuel Pérez-Carrasco, Juan Rafael Martínez-Galarza, Bahram Mobasher, Gabriela Canalizo

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究在统一transformer框架下比较四种分词策略对天文图像重建和物理属性预测的影响,发现重建与表征质量解耦,无单一方法全面最优。

Comments Accepted as a spotlight talk at the Conference on Physics and AI (PAI) 2026, Stanford University

详情

展开后加载摘要…

URL PDF HTML 收藏