arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-21 至 2026-07-21 共收录 490 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 73 篇

2607.17243 2026-07-21 cs.AI 新提交 57%

LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning

LenGuard-GPC:用于空间推理强化学习的带引导提示一致性的长度保护

Xingjian Tao, Yiwei Wang, Yujun Cai, Jing Tang

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对多视图空间推理中思维链推理冗长不准确及标准GRPO奖励问题,提出LenGuard-GPC框架,通过比较标准与引导提示下预测分布得KL散度作奖励信号,并引入阶段长度奖励,提升了准确率且缩短了平均响应长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16819 2026-07-21 cs.AI 新提交 57%

FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images

FUSAR-R1:一种用于合成孔径雷达图像智能解释的大规模推理模型

Yi Yang, Xiaokun Zhang, Yuxuan Li, Ruyi Zhang, Xinpeng Zhou, Haipeng Wang

机构 * Fudan University(复旦大学) Key Laboratory for Information Science of Electromagnetic Waves (MoE)(电磁波信息科学教育部重点实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对SAR图像智能解释问题,提出FUSAR-R1模型。通过模拟专家解释构建思维链推理数据指导指令学习,赋予基本推理能力,再用强化学习策略优化输出。该模型在多种SAR解释任务中表现优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16603 2026-07-21 cs.CL 新提交 57%

NOWJ@COLIEE 2026: Adaptive Pipelines for Legal Retrieval and Reasoning

NOWJ@COLIEE 2026:用于法律检索和推理的自适应管道

Thuong-Hieu Ngo, Hoang-Trung Nguyen, Huu-Dong Nguyen, Xuan-Bach Le, Le-Dung Nguyen, Quang-Thanh Tran, Ha-Thanh Nguyen, Thi-Hai-Yen Vuong

机构 * VNU University of Engineering and Technology(越南国立工程技术大学) Center for Juris-Informatics, ROIS-DS College of Engineering & Computer Science, VinUniversity(越南Vin大学工程与计算机科学学院法律信息学中心)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 NOWJ团队参与COLIEE 2026竞赛五项任务,针对各任务提出不同方法。如任务1的四阶段管道,任务2的多种方法结合,任务3的检索增强框架等,通过这些方法在法律检索、推理等方面取得相应成果。

Comments Presented at COLIEE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13569 2026-07-21 cs.CV cs.AI 版本更新 57%

GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning

GHR-VLM:通过基于视觉基础的混合推理实现零样本公交视频分析

Kaicong Huang, Weiheng Oh, Jack M. Reilly, Thomas Guggisberg, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究旨在实现零样本公交视频分析,提出GHR-VLM框架,利用边缘-云设计,通过轻量级边缘监视器跟踪门状态、分割乘客片段,后端VLM经两阶段细化识别乘客与支付行为,减少云推理,评估显示其在公交支付分析中有潜力且面临视频条件挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30362 2026-07-21 cs.RO cs.AI cs.CV 版本更新 57%

ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control

ReactiveBFM:面向通用人形全身控制的反应式闭环运动规划

Xiao Chen, Weishuai Zeng, Xiaojie Niu, Zirui Wang, Jianan Li, Huayi Wang, Furui Xu, Jiahe Chen, Weixiang Zhong, Lihe Ding, Kailin Li, Jiangmiao Pang, Tai Wang, Tianfan Xue, Jingbo Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 提出ReactiveBFM,一种实时闭环规划控制框架,通过调度前缀采样课程和异步重规划机制,解决生成式运动规划器与高频跟踪之间的延迟不匹配和暴露偏差问题,实现人形机器人全身协调和零样本反应式运动。

Comments Project page: https://xiao-chen.tech/reactivebfm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15830 2026-07-21 cs.AI 版本更新 57%

Mini Amusement Parks (MAPs): A Testbed for Modelling Business Decisions

迷你游乐园(MAPs):一个用于模拟商业决策的测试平台

Stéphane Aroca-Ouellette, Ian Berlot-Attwell, Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Tongqi Zhu, Herin Kang, Kaheer Suleman, Sam Pasupalak

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 介绍用于评估智能体决策能力的游乐园模拟器Mini Amusement Parks (MAPs),统一现实决策多方面挑战,提供人类基线和对先进语言模型智能体的评估,发现人类表现更优并揭示智能体在多方面的弱点,为基准测试适应性决策智能体提供新基础。

Comments 9 pages (main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18078 2026-07-21 cs.CV 新提交 50%

VGOcc: Learning Visual-Geometric Gaussians for Vision-Centric 3D Driving Occupancy Prediction

VGOcc:学习视觉几何高斯用于以视觉为中心的3D驾驶占用预测

Junhong Lin, Xianda Guo, Kangli Wang, Yuqi Ye, Xiaoyu Liang, Yanlun Peng, Wei Gao

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 研究仅视觉3D驾驶占用预测问题,提出VGOcc方法,通过从基础模型学习视觉和几何线索,纳入高斯建模的初始化与细化,实现高效语义占用预测,在nuScenes实验中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17675 2026-07-21 cs.CV 新提交 50%

ShotPlan: Cinematic Video Generation with Learnable Planning Token

ShotPlan:使用可学习规划令牌生成电影级视频

Su Guo, Guangce Liu, Haosen Yang, Jiepeng Wang, Cong Liu, Junqi Liu, Haibin Huang, Hongxun Yao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI)) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 针对电影级视频生成难题,提出ShotPlan框架,基于视频扩散基础模型,引入可学习规划令牌捕捉镜头过渡线索,结合分数时间旋转位置嵌入在帧级别建模,实验证明其优于现有方法,提升了镜头管理与一致性。

Comments Project page: https://pensioner-11.github.io/ShotPlan/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16855 2026-07-21 cs.AR cs.LO 新提交 50%

Rtl2lean: Automated RTL-to-Lean Translation with Hierarchical Theorem Generation and Lemma Reuse

Rtl2lean:通过分层定理生成和引理重用实现从寄存器传输级到Lean的自动翻译

Hongqin Lyu, Junxing Dong, Yonghao Wang, Zhiteng Chao, Tiancheng Wang, Huawei Li

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出Rtl2lean框架,自动将RTL设计转为Lean 4模型并构建分层定理库。通过四层定理框架和基于大语言模型的证明循环处理验证。实验表明该框架能构建机器检查的RTL证明库,检查开销低且引理重用性高。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16321 2026-07-21 cs.CV cs.IR 新提交 50%

Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations

超越语义的艺术:用于多关系表示的层状信息对比学习

Ludovica Schaerf, Antonio Purificato, Piera Riccio, Fabrizio Silvestri, Noa Garcia

机构 * University of Zurich(苏黎世大学) Max Planck Institute Bibliotheca Hertziana(马克斯·普朗克赫兹iana图书馆研究所) Sapienza University of Rome(罗马第一大学) Amazon(亚马逊) University of Amsterdam(阿姆斯特丹大学) The University of Osaka(大阪大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究针对视觉语言模型丢失艺术作品多关系结构的问题,引入受层理论启发的CANVAS框架,通过多嵌入和对比损失学习关系感知多模态表示,在新基准测试中表现优于基线,证明多关系对齐在艺术理解中兼具理论与实践价值。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13458 2026-07-21 cs.NI 版本更新 50%

From Traditional Automation to Embodied Wireless Intelligence: Vision-Language-Action Empowered Physics-Aware Communication Networks

从传统自动化到具身无线智能:视觉-语言-动作赋能的物理感知通信网络

Genze Jiang, Kezhi Wang, Xiaomin Chen, Yizhou Huang

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出具身智能基站(eBS)范式,采用视觉-语言-动作(VLA)流水线,使基站具备环境感知、因果物理推理和物理感知动作生成能力,实现从规则自动化到具身智能的转变。

Comments submitted for possible jounal publication

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 110 篇

2511.16478 2026-07-21 cs.IR cs.CL 版本更新 92%

Music Recommendation with Large Language Models: Challenges, Opportunities, and Evaluation

基于大语言模型的音乐推荐:挑战、机遇与评估

Elena V. Epure, Yashar Deldjoo, Bruno Sguerra, Markus Schedl, Manuel Moussallam

机构 * Deezer Research(Deezer研究机构) Johannes Kepler University Linz(约翰·凯撒大学林茨分校) Linz Institute of Technology(林茨技术研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 探讨音乐推荐系统从依赖信息检索框架向LLM驱动转变面临的挑战与机遇,通过回顾LLMs对音乐相关建模的重塑、审视自然语言处理评估实践,勾勒成功与风险维度,为音乐推荐系统评估提供跨学科视角。

Comments Under review with the ACM Transactions on Recommender Systems (TORS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02104 2026-07-21 cs.LG 版本更新 92%

When Can You Debias an LLM Judge? Identifiability Limits, a Test, and Designs for Top-k Ranking

提出正确的比较:基于偏差感知的贝叶斯主动Top-k排序与LLM裁判

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM裁判存在噪声和系统性偏差(如偏好冗长或格式好的回答)的问题,提出将裁判过程建模为贝叶斯推断,引入显式的裁判特定偏差协变量,并设计一种Top-k感知的主动获取规则,以在固定比较预算下准确识别Top-k项。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05558 2026-07-21 cs.LG 版本更新 92%

Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents

自回归扩散世界模型用于LLM智能体的离线评估

Kaixuan Liu, Guojun Xiong, Weinan Zhang, Shengpu Tang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出ADWM框架,通过自回归扩散世界模型从预收集轨迹中模拟环境响应,实现无需在线交互的LLM智能体策略离线评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18635 2026-07-21 cs.CL cs.AI cs.CY 91%

No Free Lunch in Language Model Bias Mitigation? Targeted Bias Reduction Can Exacerbate Unmitigated LLM Biases

语言模型偏见缓解中的“无免费午餐”现象?针对性偏见减少可能加剧未缓解的LLM偏见

Shireen Chand, Faith Baca, Emilio Ferrara

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型偏见缓解的跨类别影响,发现针对性缓解可能加剧其他方面的偏见,强调了多维评估的重要性。

Journal ref AI, 7(1), 24, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04788 2026-07-21 cs.CY 版本更新 90%

From Sycophancy to Deception: A Unified Taxonomy for LLM Spontaneous Misalignment

从幻觉到谋略:一种统一的分类法和基准分析用于LLM欺骗

Jerick Shi, Terry Jingcheng Zhang, Zhijing Jin, Vincent Conitzer

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出统一的LLM欺骗分类法,揭示现有基准在欺骗机制覆盖不足的问题,并为开发者和监管者提供改进建议。

Comments Accepted to ICLR Agents in the Wild: Safety, Security, and Beyond Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17409 2026-07-21 stat.ML cs.LG stat.ME 新提交 90%

Efficient Sequential Evaluation of Large Language Models

大语言模型的高效顺序评估

Chia-Yu Hsu, Shubhanshu Shekhar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究在固定问题集上顺序评估新大语言模型,基于历史数据构建置信序列,提出增长导向查询规则,分析影响收缩率因素并提出混合查询规则,实验发现简单的均匀采样有时表现更好。

Comments This is a preliminary version; feedback is welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15936 2026-07-21 cs.CY cs.HC 版本更新 90%

Large Language Models in Architecture Studio: A Framework for Learning Outcomes

大型语言模型在建筑工作室中的应用:一种学习成果的学习框架

Juan David Salazar Rodriguez, Sam Conrad Joyce, Nachamma Sockalingam, Khoo Eng Tat, Julfendi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本研究探讨了大型语言模型在建筑工作室中的应用,旨在通过AI干预解决教学挑战并提升学习成果。

Comments This work has been accepted for publication in International Conference on Human-Computer Interaction HCII 2026 (pp. 93-110)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17615 2026-07-21 cs.SD cs.AI 新提交 90%

Re-Sonance: A Dysarthric Asynchronous Real-Time Speech Conversion System Based on a Three-Stage Cascaded ASR-LLM-TTS Architecture

共振:基于三级级联ASR-LLM-TTS架构的构音障碍异步实时语音转换系统

Yuxuan Wu, Yifan Xu, Junkun Wang, Jiayong Jiang, Xin Zhao, Zhaojie Luo

机构 * Southeast University(东南大学) School of Biological Science & Medical Engineering, Southeast University(东南大学生物科学与医学工程学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对构音障碍患者在专业演讲场景的沟通问题,提出基于三级级联ASR-LLM-TTS架构的Re-Sonance系统,集成多种技术,经评估其能提高轻度至中度构音障碍患者语音清晰度与自然度,验证了基于LLM方法增强语音驱动AAC系统的潜力。

Comments Accepted by NCMMSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06820 2026-07-21 cs.AI 版本更新 90%

When Direct Prediction Fails: Evidence from LLM-Based Misinformation Risk Evaluation

超越表面判断:LLM生成虚假信息的人类基础风险评估

Zonghuan Xu, Xiang Zheng, Yutao Wu, Xingjun Ma

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) City University of Hong Kong(香港城市大学) Deakin University(迪肯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究LLM生成虚假信息的风险评估,发现LLM法官在整体评分、项目排序和信号依赖上与人类存在显著差异,且法官间一致性高于人类读者,表明内部一致性不能作为读者反应代理的有效证据。

Comments 9 pages, 1 figure. Substantially revised and reorganized version of arXiv:2604.06820 based on the same study and data; adds stricter participant filtering, held-out prediction analyses, and additional robustness checks

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09721 2026-07-21 cs.CL cs.AI 90%

Cross-Platform Evaluation of Large Language Model Safety in Pediatric Consultations: Evolution of Adversarial Robustness and the Scale Paradox

跨平台评估大语言模型在儿科咨询中的安全性:对抗鲁棒性的演变与规模悖论

Vahideh Zolfaghari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了不同模型和平台在家长焦虑驱动下的LLM安全性,发现较小模型在对抗性压力下表现更优,且安全性与模型架构相关,而非规模。

Journal ref npj Digit. Med. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18110 2026-07-21 cs.LG cs.CL 新提交 89%

LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

大语言模型作为教练:不可验证任务的体验式学习

Tianzhu Ye, Li Dong, Guanheng Chen, He Zhu, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(title,summary_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究不可验证任务,提出体验式学习(EL),将LLM反馈模型从评判转为教练,通过提炼体验知识提供密集监督,在开放式任务上表现优于基于规则的RL,泛化性好且减轻奖励作弊。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16777 2026-07-21 cs.CL cs.AI 新提交 88%

JOR-Bench: Japanese Operations Research Benchmarks for Large Language Models

JOR-Bench:用于大语言模型的日语运筹学基准测试

Yuu Jinnai

机构 * CyberAgent

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 JOR-Bench是用于评估大语言模型解决运筹学问题能力的日语基准测试集,涵盖多种规划问题。通过评估七个LLMs的英文和日语版本,发现多语言模型的OR制定能力语言中立,但存在跨语言差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18066 2026-07-21 cs.CL 新提交 88%

Pancasila-Dilemmas: Evaluating Large Language Models on Indonesian Human Value Dilemmas Grounded in Pancasila

潘查希拉困境:基于潘查希拉对印度尼西亚人类价值困境的大语言模型评估

Supryadi, Irfan, Julianti, Darren Keanly Martin, Jayvin Fernando, Yuqi Ren, Deyi Xiong

机构 * Universitas Universal(印尼环球大学) Beijing Language and Culture University(北京语言大学) Tianjin University(天津大学) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究基于印尼新闻构建潘查希拉困境数据集,含1834个按潘查希拉五价值观分类的问题,用于评估大语言模型价值对齐。通过母语人士校对及公民回答,评估50个模型,发现各模型在宗教和团结困境案例中表现差,凸显印尼价值观捕捉差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17745 2026-07-21 cs.AI 新提交 88%

WuYu-EnvLE-Bench: A Benchmark for Evaluating Large Language Models in Environmental Law Enforcement

吴语-环境执法基准:评估大语言模型在环境执法中的基准

Ziliang Yang, Yi Zhang, Kaijun Lin, Jiachao Ke, Haihong Xu, Zongguo Wen

机构 * School of Environment, Tsinghua University(清华大学环境学院) College of Economics and Management, Beijing University of Technology(北京工业大学经济与管理学院) State Key Laboratory of Iron and Steel Industry Environmental Protection, School of Environment, Tsinghua University(清华大学环境学院钢铁工业环境保护国家重点实验室) Appraisal Center for Environmental Engineering, Ministry of Ecology and Environment(生态环境部环境工程评估中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对大语言模型在环境执法中生成可追溯决策能力不明的问题,构建吴语-环境执法基准,含多任务多子领域实例,用AES和IEI评估模型,发现其在部分任务表现不佳,强调证据与规则感知的执法推理需求。

Comments 98 pages, 45 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16609 2026-07-21 cs.CV cs.CL 新提交 88%

Can Multimodal Large Language Models Understand OCT?

多模态大语言模型能理解光学相干断层扫描(OCT)吗?

Baochen Fu, Wenzhi Deng, Baihao Jin, Yang Li, Zihan Nie, Kailin Jiang, Yuntao Du, Weiye Song

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究探讨多模态大语言模型能否理解OCT,引入OCT - Bench基准,包含多维度细粒度任务,基于多个数据集构建大量选择题,评估20个代表性模型,发现当前模型理解OCT能力不足,为评估模型和推动OCT理解提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21961 2026-07-21 cs.CL 版本更新 88%

PapersPlease: A Benchmark for Evaluating Motivational Values of Large Language Models Based on ERG Theory

《请出示文件:基于ERG理论评估大语言模型动机价值的基准》

Junho Myung, Yeon Su Park, Sunwoo Kim, Shin Yoo, Alice Oh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究引入PapersPlease基准,由3700个基于ERG理论的道德困境组成,让LLMs充当移民检查员决策。分析六个LLMs发现决策模式及隐含偏好,评估还显示其对社会身份叙述的反应因动机需求和身份线索而异。

Comments Accepted to GEM2 Workshop: Generation, Evaluation & Metrics - ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09497 2026-07-21 cs.CL cs.AI 版本更新 88%

BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation

BERT-as-a-Judge: 一种更稳健的替代方法,用于高效参考基于的大语言模型评估

Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Emmanuel Malherbe, Céline Hudelot, Pierre Colombo

机构 * Artefact Research Center(Artefact 研究中心) Diabolocom Cohere

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BERT-as-a-Judge,通过编码器驱动的方法评估参考基于的生成结果,克服了传统词汇方法的局限,提供高效且可靠的评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16648 2026-07-21 cs.CR cs.IT math.IT 新提交 88%

Synchronization-Free Algebraic Fingerprints for Large Language Models: From Autoregressive to Diffusion Models

大语言模型的无同步代数指纹:从自回归模型到扩散模型

Jaroslaw Janas, Josef Pieprzyk, Pawel Morawiecki

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 针对大语言模型水印需求,提出无同步水印方案,由相邻令牌生成二元同余作水印,从代数角度分析恢复问题,讨论解码算法,该方法能抗多种操作,避免同步问题,为嵌入不同长度秘密身份提供灵活框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07196 2026-07-21 cs.HC 88%

Large Language Models for Wearable Sensor-Based Human Activity Recognition, Health Monitoring, and Behavioral Modeling: A Survey of Early Trends, Datasets, and Challenges

基于可穿戴传感器的人类活动识别、健康监测与行为建模的大型语言模型:早期趋势、数据集和挑战的综述

Emilio Ferrara

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文综述了大型语言模型在可穿戴传感器数据中的应用,探讨了其在人类活动识别、健康监测和行为建模中的早期趋势、数据集及挑战。

Journal ref Sensors, 24(15), 5045, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏