arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-30 至 2026-06-30 共收录 602 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 143 篇

2604.19224 2026-06-30 cs.SE 67%

iCoRe: An Iterative Correlation-Aware Retriever for Bug Reproduction Test Generation

iCoRe: 一种迭代相关性感知的Bug重现测试生成检索器

Junyi Wang, Jialun Cao, Zhongxin Liu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出iCoRe,一种迭代相关性感知的Bug重现测试生成检索器,通过区分源代码与测试用例的检索需求、结合文本语义与函数调用结构、以及实现检索与生成阶段的反馈循环,提升Bug重现测试生成的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12175 2026-06-30 cs.CV 67%

Redefining Quality Criteria and Distance-Aware Score Modeling for Image Editing Assessment

重新定义质量标准与距离感知评分建模用于图像编辑评估

Xinjie Zhang, Qiang Li, Xiaowen Ma, Axi Niu, Li Yan, Qingsen Yan

机构 * Northwestern Polytechnical University(西北工业大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 本文提出DS-IEQA框架,通过反馈驱动指标优化和令牌解耦距离回归损失,改进图像编辑质量评估的指标定义与评分连续性建模。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 2812-2820

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30152 2026-06-30 cs.CL cs.AI 62%

Estimating Grammatical Gender Directions in Contextual Embeddings under Controlled and Natural Contexts

在受控和自然上下文中估计上下文嵌入的语法性别方向

Huanping Xiao, Yingji Li

机构 * College of Foreign Languages and Cultures, Jilin University(吉林大学外语学院) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对上下文嵌入中语法性别与社会语义偏见的纠缠问题,首次提出在受控模板和自然维基百科上下文中,利用质心、SVM和LDA估计器及污染感知加权策略进行解耦,并设计双目标评估指标平衡去偏与语义保留。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29548 2026-06-30 cs.LG cs.AI cs.DB cs.HC cs.RO 62%

VISTA-DZ: Visual Semantic Trajectory Adaptation for Personalized Dilemma Zone Prediction

VISTA-DZ: 面向个性化困境区域预测的视觉语义轨迹自适应

Chuheng Wei, Ziye Qin, Ziran Wang, Guoyuan Wu

机构 * Purdue University(普渡大学) University of California, Riverside(加州大学河滨分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出VISTA-DZ框架,通过视觉语义轨迹表示和语言模型生成行为画像,实现个性化停走决策与决策时间预测,在仿真和真实数据集上优于基线方法。

Comments This manuscript is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29278 2026-06-30 cs.AI cs.CL 62%

The Complexity Ceiling Benchmark: A Multi-Domain Evaluation of Sequential Reasoning Under Depth Scaling

复杂性天花板基准:深度缩放下顺序推理的多领域评估

Shubh Chapra, Dhruv Kumar, Murari Mandal, Yash Sinha

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出复杂性天花板基准(CCB),通过控制任务语义内容、仅改变推理深度N,评估语言模型在三个结构不同领域中的顺序推理衰减,发现几何级数衰减和领域天花板差异,并引入跟踪级指标TFBC。

Comments 12 pages, 6 figures. Accepted to the 1st Workshop on Combining Theory and Benchmarks (CTB), CTB@ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30576 2026-06-30 cs.CV cs.AI 57%

Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization

超越2D匹配:用于几何感知跨视角目标地理定位的统一单阶段框架

Liyao Wang, Ruipu Wu, Haojun Xu, Lei Shi, Linjiang Huang, Si Liu

机构 * Beihang University(北航) Meituan(美团)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出GAGeo单阶段框架,利用3D基础模型和对比损失,结合多模态提示和相机位姿,实现跨视角目标地理定位,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29661 2026-06-30 cs.AI 57%

Diversity is the Strength of the AI Crowd

多样性是AI群体的力量

Matthew Aitchison, Scott Jeen, Toby Shevlane, Ben Day

机构 * Mantic Technologies

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 研究通过集成不同AI预测模型提升未来事件预测准确性,发现结合准确且多样化的模型(如Grok 4)比单纯增加采样更有效,强调模型质量与多样性的平衡。

Comments Accepted at the ICML 2026 Workshop on Forecasting as a New Frontier of Intelligence, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29649 2026-06-30 cs.CL 57%

Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages

VLM检测有害ASCII艺术的分辨率阈值:跨构建模式与语言的研究

Yikai Hua, Peter West

机构 * Department of Computer Science(计算机科学系) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究图像分辨率如何影响VLM检测有害ASCII艺术,发现检测率在特定分辨率阈值以上急剧下降,且基于单词的模式最难检测,揭示了VLM内容审核系统的系统性漏洞。

Comments 13 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29577 2026-06-30 cs.CV cs.AI 57%

ReMAP-PET: Beyond Visual Understanding -- Learning Region-Guided Metabolic Alignment Semantics from Brain PET

ReMAP-PET:超越视觉理解——从脑PET学习区域引导的代谢对齐语义

Dasen Dai, Yanteng Zhang, Shuoqi Li, Yuxiang Wei, Hongjie Yu, Qingxin Zhang, Qizhen Lan, Jagath C. Rajapakse, Vince D. Calhoun

机构 * The Chinese University of Hong Kong, HKSAR(香港中文大学) TReNDS Center (Georgia State, Georgia Tech, Emory)(TReNDS中心(佐治亚州立大学、佐治亚理工学院、埃默里大学)) ShanghaiTech University, Shanghai, P.R.China(上海科技大学) University of California, Berkeley, USA(加州大学伯克利分校) University of Texas Health Science Center at Houston, USA(德克萨斯大学健康科学中心(休斯顿)) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出ReMAP-PET框架,通过联合回归和对比学习监督3D ResNet-50学习脑PET的区域代谢语义,在SUVR预测和检索上显著优于基线,并实现与临床语言的对齐及报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29464 2026-06-30 cs.CV cs.AI 57%

Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation

秩感知双曲对齐用于视觉-语言数据集蒸馏

Jongoh Jeong, Sun-Kyung Lee, Kuk-Jin Yoon

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出RAHA方法,利用双曲几何和显式对齐容量控制,通过非对称目标优化蒸馏对,在共享范围强制测地线对齐并正则化残差子空间,提升跨模态检索和迁移鲁棒性。

Comments Accepted for publication at ECCV 2026. Project Page: https://andyj1.github.io/raha

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29213 2026-06-30 cs.CL cs.CV 57%

Can OCR-VLMs Read Devanagari? A Stress-Test Benchmark and Post-Correction Study

OCR-VLM能阅读天城文吗?一项压力测试基准与后纠正研究

Aditya Pratap Singh

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本研究通过合成退化条件和真实扫描图像,系统评估了10种OCR系统在天城文(印地语)上的表现,发现专用OCR-VLM在退化条件下最脆弱,真实扫描性能远低于合成文本,并提出了错误分类和后纠正方法。

Comments 9 pages, 5 figures. Benchmark and code released

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29176 2026-06-30 cs.LG math.DG math.OC stat.ML 57%

Dead-Direction Conditioners: Gauge-Equivariant Preconditioning for Deep Networks

死方向调节器:深度网络的规范等变预处理

Tejas Pradeep Shirodkar

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 针对深度网络损失函数对参数连续对称性的不变性,提出DDC(死方向调节器),将基础优化器提升为G-等变优化器,通过G-不变度量的轨道分解调节优化器状态,使轨迹保持在商空间上的预处理梯度流,从而改善优化效果。

Comments 69 pages, 28 figures, 9 tables. Builds the gauge-equivariant preconditioner left open in arXiv:2606.05957

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28863 2026-06-30 cs.CY cs.AI 57%

Defeat Devices in AI Systems

AI系统中的失效装置

Emilio Ferrara

机构 * Department of Computer Science(计算机科学系) University of Southern California(南加州大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 本文提出AI系统在评估与部署环境间行为差异的共性机制——失效装置,定义了三要素判别测试,并论证其可在前沿AI系统中自然涌现,需系统监测。

Comments Final version published in Future Internet, 18(7), 339, 2026

Journal ref Future Internet, 18(7), 339 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28465 2026-06-30 q-bio.QM cs.AI 57%

SVC-Probe: A Framework for Evaluating Perturbation Generalization in Spatial Foundation-Model Embeddings

SVC-Probe:评估空间基础模型嵌入中扰动泛化性的框架

Jake Y. Chen, Huu Phong Nguyen, Fuad Al Abir, Ehsan Saghapour

机构 * Department of Biomedical Informatics and Data Science, University of Alabama at Birmingham(亚拉巴马大学伯明翰分校生物医学信息学与数据科学系) System Pharmacology and AI Research Center, University of Alabama at Birmingham(亚拉巴马大学伯明翰分校系统药理学与人工智能研究中心)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出SVC-Probe框架,通过嵌入稳定性、邻域重连和质心预测评估荧光显微图像空间基础模型嵌入的扰动泛化性,发现高条件判别精度不保证跨药物泛化。

Comments 7

Journal ref CIBB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28385 2026-06-30 cs.RO cs.AI 57%

RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis

RoboGaze: 通过结构化视觉-语言分析评估机器人世界模型

Minh-Loi Nguyen, Nghiem Tuong Diep, Hung Khang Nguyen, Minh Le, Doanh Le Thien, Hoang H. Tran, Dung D. Le, Vu N. Duong, Daniel Sonntag, An Thai Le, Duy Minh Ho Nguyen, Vien Anh Ngo, Tran Van Nhiem

机构 * Ho Chi Minh City University of Science, Vietnam National University(越南国家科学大学胡志明市大学) VinRobotics VinUniversity German Research Center for AI (DFKI)(人工智能研究中心(DFKI)) University of Stuttgart(斯图加特大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) Technische Universität Darmstadt(达姆施塔特技术大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出RoboGaze,一种无需训练的多智能体VLM框架,通过任务-场景对齐、维度专家路由和批评验证三阶段流水线,对机器人操作视频进行结构化可解释评估,显著提升描述F1和时序对齐性能。

Comments First version 29 pages, 7 figures. Project webpage: https://robogaze-eval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00616 2026-06-30 cs.CV cs.AI 57%

Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion

暂停与思考:面向视频基础辅助动作建议的数据集与基准

Shivam Singh, Saptarshi Majumder, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出 pause-and-think-T 数据集和 pause-and-think-B 基准,通过推理监督训练紧凑模型,在视频场景理解与目标规划任务中达到与大型模型相当的性能。

Comments Accepted in IROS 2026 (IEEE/RSJ International Conference on Intelligent Robots and Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05318 2026-06-30 cs.CL 57%

DIA-HARM: Dialectal Disparities in Harmful Content Detection Across 50 English Dialects

DIA-HARM:50种英语方言中有害内容检测的方言差异

Jason Lucas, Matt Murtagh, Ali Al-Lawati, Uchendu Uchendu, Adaku Uchendu, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Trinity College Dublin(都柏林圣三一大学) MIT Lincoln Laboratory(麻省理工学院林肯实验室)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 研究探讨了在50种英语方言中检测虚假信息的鲁棒性,发现人类生成的方言内容使检测性能下降1.4%-3.6%,而AI生成内容稳定。多语言模型在跨方言迁移中表现更佳,单语言模型则表现不佳。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18452 2026-06-30 cs.SD cs.LG eess.AS 57%

RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity

RA-QA:一种用于在现实世界异质性下呼吸音频问答的基准系统

Gaia A. Bertolino, Yuwei Zhang, Tong Xia, Domenico Talia, Cecilia Mascolo

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出RA-QA基准系统,通过标准化数据生成流程和统一评估协议,整合900万组异构问答对,评估通用音频语言模型和领域特定架构在现实异质性下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30393 2026-06-30 cs.CV 50%

SADL: What to Ignore? A Benchmark for Subject-Aware Distractor Localization

SADL:该忽略什么?面向主体感知的干扰物定位基准

Cao-Tri Nguyen, Nguyen-Khoa Luong, Vinh-Tiep Nguyen, Minh-Triet Tran

机构 * University of Science(科学大学) Vietnam National University Ho Chi Minh City(越南胡志明市国家大学) University of Information Technology(信息技术大学) John Von Neumann Institute(约翰·冯·诺依曼研究所)

专题命中 评测与基准 :language model(abstract)

AI总结 提出SADL基准,包含1,800个主体感知案例,用于评估视觉语言模型在干扰物定位中的排除校准能力,揭示模型过度排除的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30220 2026-06-30 cs.CV 50%

From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA

从准确性到视觉依赖性:审计与过滤交通视频问答中的模态崩溃

Sena Korkut, María Alejandra Bravo Sarmiento, Sanghwan Kim, Zeynep Akata

专题命中 评测与基准 :language model(abstract)

AI总结 针对交通视频问答中模型依赖文本捷径而非视觉证据的问题,提出盲差距和视觉增益两个数据集级诊断指标,以及实例级捷径分数实现无训练过滤,提升视觉基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30019 2026-06-30 cs.CV 50%

OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

OmniDance: 基于大规模互联网数据的多模态驱动舞蹈视频生成

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Chubin Chen, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

机构 * Renmin University of China(中国人民大学) AMAP, Alibaba Group(AMAP,阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Malou Tech Inc(Malou科技公司)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出CIPE-Dance大规模舞蹈视频数据集和OmniDance框架,通过深度感知架构、课程学习和条件引导策略,实现文本、音乐及多模态驱动的舞蹈视频生成,达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29905 2026-06-30 cs.CV 50%

StrucTab: A Structured Optimization Framework for Table Parsing

StrucTab: 一种用于表格解析的结构化优化框架

Gengluo Li, Shangpin Peng, Chengquan Zhang, Binghong Wu, Hao Feng, Weinong Wang, Pengyuan Lyu, Huawen Shen, Xingyu Wan, Zhuotao Tian, Han Hu, Can Ma, Yu Zhou

专题命中 评测与基准 :language model(abstract)

AI总结 提出StrucTab框架,通过中间结构监督和奖励分解优化表格解析,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29162 2026-06-30 cs.CV eess.IV 50%

Spatially Localized Image Degradation Embeddings for Image Quality Assessment

用于图像质量评估的空间局部化图像退化嵌入

Krishna Srikar Durbha, Hassene Tmar, Ping-Hao Wu, Ioannis Katsavounidis, Alan C. Bovik

专题命中 评测与基准 :pretraining(abstract)

AI总结 针对自监督学习对空间局部退化敏感度不足的问题,提出SLIDE-IQA方法,采用双分支Vision Transformer框架和阈值边界排除机制,在对比预训练中注入局部退化,提升对局部失真的敏感度并在NR-IQA基准上取得竞争性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29212 2026-06-30 cs.CV cs.HC 50%

MetaRanker: Human-in-the-loop Active Ranking for Metalens Image Quality

MetaRanker:用于超透镜图像质量的人机协同主动排序

Yujin Park, Haejun Chung, Ikbeom Jang

机构 * Hanyang University(翰阳大学) Hankuk University of Foreign Studies(韩国民法大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出MetaRanker框架,通过人机协同主动排序,以语义可解释性为指标评估超透镜图像质量,减少80%人工标注量,并实现与人类评估高度一致的排序。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05522 2026-06-30 eess.IV cs.CV 50%

Tumor-aware augmentation with task-guided attention analysis improves rectal cancer segmentation from magnetic resonance images

肿瘤感知增强与任务引导注意力分析提高磁共振图像直肠癌分割

Aneesh Rangnekar, Joao Miranda, Natally Horvat, Stephanie Chahwan, Samir Alrayess, Aditya Apte, Aditi Iyer, Eve LoCastro, Revathi Ravella, Marc J Gollub, Iva Petkovska, Jesse Joshua Smith, Paul Romesser, Julio Garcia-Aguilar, Harini Veeraraghavan, Joseph O. Deasy

机构 * Department of Medical Physics, Memorial Sloan Kettering Cancer Center(医学物理系,纪念斯隆凯特琳癌症中心) Department of Radiology, Memorial Sloan Kettering Cancer Center(放射学系,纪念斯隆凯特琳癌症中心) Department of Radiation Oncology, Memorial Sloan Kettering Cancer Center(放射肿瘤学系,纪念斯隆凯特琳癌症中心) Department of Surgery, Memorial Sloan Kettering Cancer Center(外科系,纪念斯隆凯特琳癌症中心) Department of Medicine, Memorial Sloan Kettering Cancer Center(医学系,纪念斯隆凯特琳癌症中心)

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文通过肿瘤感知增强和任务引导注意力分析,改进CT到MRI的直肠癌分割,验证了预训练模型在跨模态转移中的局限性,并提出了缓解策略以提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12703 2026-06-30 cs.CV 50%

SVCBench: A Streaming Video Counting Benchmark for Spatial-Temporal State Maintenance

SVCBench:一种用于空间-时间状态维护的流视频计数基准

Pengyiang Liu, Zhongyue Shi, Hongye Hao, Qi Fu, Xueting Bi, Siwei Zhang, Xiaoyang Hu, Zitian Wang, Linjiang Huang, Si Liu

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 评测与基准 :language model(abstract)

AI总结 SVCBench通过流式多点查询观察状态维护轨迹,设计了三个互补指标来诊断数值精度、轨迹一致性及时间意识,评估主流视频语言模型在空间-时间状态维护上的不足,尤其在周期性事件计数上表现不佳。

Comments Accepted to ECCV 2026. Project page: https://buaa-colalab.github.io/SVCBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03253 2026-06-30 cs.CV 50%

LaVPR: Benchmarking Language and Vision for Place Recognition

LaVPR:语言与视觉用于位置识别的基准测试

Ofer Idan, Dan Badur, Yosi Keller, Yoli Shavit

专题命中 评测与基准 :language model(abstract)

AI总结 LaVPR通过引入超过65万条自然语言描述扩展现有VPR数据集,研究多模态融合与跨模态检索,证明语言描述在视觉退化条件下提升性能,尤其对小模型效果显著。

Comments Accepted to ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21545 2026-06-30 cs.CV 50%

EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal

EraseLoRA: 基于多模态大语言模型的前景排除与背景子类型聚合用于无数据集对象去除

Sanghyun Jo, Donghwan Lee, Eunji Jung, Seong Je Oh, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

专题命中 评测与基准 :language model(abstract)

AI总结 EraseLoRA通过多模态大语言模型实现前景排除与背景子类型聚合,提升无数据集对象去除的背景重建与前景抑制效果,显著提高重建真实性并减少冗余生成。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 86 篇

2606.30372 2026-06-30 cs.AI cs.CY cs.HC 92%

Using Large Language Models as Low-Cost Statistical Estimators for Human-Response Data

使用大型语言模型作为人类响应数据的低成本统计估计器

Haobo Yang

机构 * Department of Computer Science and Engineering, SUSTech University(计算机科学与工程系,西南科技大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文证明预训练大型语言模型在平方损失下能实现条件期望的风险等价估计,通过理论分析和校准协议,表明在满足条件时可用LLM替代人类实验进行低成本统计推断。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29700 2026-06-30 cs.AI 92%

Toward Secure and Reliable PDDL Formalization of Large Language Models with Planner-in-the-Loop Feedback

面向具有规划器反馈的大型语言模型的安全可靠PDDL形式化

Jiamei Jiang, Jiajing Zhang, Feifei Mo, Linjing Li, Daniel Zeng

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Industry-education Integration, University of Chinese Academy of Sciences(中国科学院大学产教融合学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);preference optimization(abstract)

AI总结 提出NL-PDDL-Bench基准和规划器在环框架,通过验证器诊断和偏好优化提升LLM生成PDDL规范的可执行性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏