arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-03 至 2026-06-03 共收录 404 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 61 篇

2606.03005 2026-06-03 cs.CV cs.AI 70%

MUSE: A Unified Agentic Harness for MLLMs

MUSE: 多模态大语言模型的统一智能体框架

Jianglin Lu, Hailing Wang, Xu Ma, Qihua Dong, Mingyuan Zhang, Yizhou Wang, Yun Fu

机构 * Northeastern University(东北大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MUSE框架,通过可组合模块(任务表示、视觉处理、感知工具、结构化解析、确定性验证和验证器引导修复)提升冻结多模态大语言模型性能,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02983 2026-06-03 cs.CL 70%

A Locally Deployed RAG-Based Academic Advising System for Course Selection

基于本地部署RAG的课程选择学术咨询系统

Feng Li, Yoritaka Iwata

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种本地部署的RAG学术咨询系统,利用大语言模型和结构化课程大纲检索,以隐私保护方式支持课程选择、先修课程理解和个性化学习规划。

Comments to be published in Elsevier's Procedia Computer. Sci. (KES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25928 2026-06-03 cs.CL 70%

CogRAG: Tackling Heterogeneous Cognitive Demands in RAG via Stratified Retrieval and Reasoning

CogRAG:通过分层检索与推理应对RAG中的异构认知需求

Xudong Wang, Zilong Wang, Kui Su, Zhaoyan Ming

机构 * School of Computer and Computing Science, Hangzhou City University(杭州城市大学计算机与计算科学学院) Innovation Center of Yangtze River Delta, Zhejiang University(长三角创新中心,浙江大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CogRAG框架,基于布鲁姆分类法预测查询的认知负荷,协调认知自适应证据精炼与认知分层结构化推理,解决RAG中不同任务的异构认知需求,在注册营养师资格考试中将Qwen3-8B准确率提升至85.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12176 2026-06-03 cs.AI 70%

Evaluating Relational Reasoning in LLMs with REL

使用REL评估大语言模型中的关系推理能力

Lukas Fesser, Yasha Ektefaie, Ada Fang, Sham M. Kakade, Marinka Zitnik

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过关系复杂度(RC)定义推理难度,构建涵盖代数、化学和生物学的生成式基准REL,发现前沿大语言模型在RC增加时性能持续下降,表明模型在高元关系绑定上存在固有局限。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05530 2026-06-03 cs.AI 70%

MIND: Multi-rationale INtegrated Discriminative Reasoning Framework for Multi-modal Large Models

MIND:面向多模态大模型的多理由集成判别推理框架

Chuang Yu, Jinmiao Zhao, Mingxuan Zhao, Yunpeng Liu, Xiujun Shu, Yuanhao Feng, Bo Wang, Xiangyu Yue

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) MMLab, CUHK(CUHK多模态实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在多理由语义建模、逻辑鲁棒性和抗误导方面的不足,提出MIND推理框架,通过“理解-反思-纠正”机制实现从被动模仿到主动判别推理的范式转变。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03872 2026-06-03 eess.SY cs.SY 67%

NeuroSymbolic Robustness Analysis for Discrete Systems with Respect to Transition Deviations

针对转移偏差的离散系统神经符号鲁棒性分析

Shih-Jie Shih, Jonghan Lim, Ilya Kovalenko, Rômulo Meira-Góes

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出一种神经符号计算框架,利用大语言模型推断可行偏差转移集,再通过符号层计算离散鲁棒性保证,以解决传统方法可扩展性差和保守性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03854 2026-06-03 cs.HC 67%

CLI-Anything: Towards Agent-Native Computer Use

CLI-Anything:迈向智能体原生的计算机使用

Yuhao Yang, Tianyu Fan, Chao Huang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出CLI-Anything方法,通过将现有应用转化为命令行接口,实现智能体原生(agent-native)的计算机使用,避免GUI代理的脆弱性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03577 2026-06-03 cs.CV 67%

Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching

通过宽基线匹配激发多模态大语言模型中的复杂空间推理

Hao Zhong, Muzhi Zhu, Shenyan Zeng, Anzhou Li, Cong Chen, Hua Geng, Duochao Shi, Wentao Ye, Tao Lin, Hao Chen, Chunhua Shen

机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) Westlake University(西湖大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出ReasonMatch-Bench基准和动态对应强化学习(DCRL)方法,以系统评估和提升多模态大语言模型在宽基线匹配任务中的空间推理能力。

Comments CVPR 2026. Project page: https://aim-uofa.github.io/reasonmatch/ Code: https://github.com/aim-uofa/ReasonMatch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02774 2026-06-03 cs.CV 67%

GeoDrive-Bench: Benchmarking Region-Specific Multimodal Reasoning in Autonomous Driving

GeoDrive-Bench:自动驾驶中区域特定多模态推理的基准测试

Yingzi Ma, Chaowei Xiao, Ming Jiang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract)

AI总结 提出GeoDrive-Bench基准,通过5053个跨六国人工验证的多选题,评估视觉语言模型在感知、预测、规划和区域推理四个驾驶任务中基于区域特定交通规则的推理能力,并设计蒸馏算法注入区域知识以提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20508 2026-06-03 cs.MA cs.AI cs.CL 62%

Measuring Weak-to-Strong Legibility of Reasoning Models

衡量推理模型的弱到强可读性

Dani Roytburg, Shreya Sridhar, Daphne Ippolito

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对推理语言模型在多智能体场景中生成的中间思维链,提出“弱到强可读性”概念,并设计衡量指标以评估强模型输出对弱模型的易理解性。

Comments Accepted to Trustworthy AI4GOOD Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03503 2026-06-03 cs.AI 57%

ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning

ThoughtFold: 通过内省偏好学习折叠推理链

Ziyan Liu, Xueda Shen, Yuzhe Gu, Songyang Gao, Kuikun Liu, Guangran Cheng, Chengqi Lyu, Dahua Lin, Wenwei Zhang, Kai Chen

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.AI

AI总结 提出ThoughtFold框架,通过细粒度偏好学习惩罚冗余探索并鼓励直接连接关键推理段,将推理链折叠为更简洁路径,在保持精度的同时大幅降低token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03406 2026-06-03 cs.CV 50%

SAMatcher: Co-Visibility Modeling with Segment Anything for Robust Feature Matching

SAMatcher: 基于Segment Anything的共视性建模用于鲁棒特征匹配

Xu Pan, Qiyuan Ma, Mingyue Dong, He Chen, Wei Ji, Xianwei Zheng

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 提出SAMatcher框架,通过共视性建模预测共视区域掩码和边界框作为结构先验,利用Segment Anything Model的对称交叉视图交互机制和统一监督方案,显著提升大视角和尺度变化下的特征匹配性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00667 2026-06-03 cs.CV 50%

Act Like a Pathologist: Tissue-Aware Whole Slide Image Reasoning

像病理学家一样:组织感知的全切片图像推理

Wentao Huang, Weimin Lyu, Peiliang Lou, Qingqiao Hu, Xiaoling Hu, Shahira Abousamra, Wenchao Han, Ruifeng Guo, Jiawei Zhou, Chao Chen, Chen Wang

机构 * Stony Brook University(石英溪大学) Mayo Clinic(梅奥诊所) Harvard Medical School(哈佛医学院) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出一种问题引导、组织感知的粗到细检索框架HistoSelect,通过识别相关组织区域并选择最具信息量的补丁,在减少70%视觉标记的同时提升病理问答准确性。

Comments 14 pages, 8 figures. Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 84 篇

2606.02741 2026-06-03 cs.CL cs.CY 93%

Greener Than Humans? Environmental Attitudes in Large Language Models

比人类更绿色?大语言模型中的环境态度

Stefanie Kunkel, Tilman Hartwig, Marcus Voss, Emma K. Schütt, Angelika Gellrich

机构 * University of Tübingen(图宾根大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 通过构建基准评估31个LLM的环境认知、情感和行为建议,发现多数模型比德国调查受访者更倾向环保态度,但存在语境敏感性和谄媚偏移。

Comments Code can be found at https://gitlab.opencode.de/uba-ki-lab/llm-questionnaire-benchmarking-framework Benchmark data and results can be found at https://zenodo.org/records/20445903

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02755 2026-06-03 cs.SE cs.AI 92%

Acceptance-Test-Driven Evaluation Protocols for Business-Centric LLM Systems

面向业务中心LLM系统的验收测试驱动评估协议

Eric Liang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM系统概率生成与确定性需求不匹配问题,提出基于验收测试驱动开发、安全工程和业务中心验证的评估协议,将利益相关者目标转化为可执行行为契约,并采用红-训练-绿生命周期确保多维门控通过后才发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03846 2026-06-03 cs.CL cs.AI cs.LG 91%

Clustered Self-Assessment: A Simple yet Effective Method for Uncertainty Quantification in Large Language Models

聚类自评估:一种简单而有效的大型语言模型不确定性量化方法

Qi Cao, Takeshi Kojima, Andrew Gambardella, Helinyi Peng, Yutaka Matsuo, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于语义聚类和多项选择概率的简单自评估方法,用于大型语言模型的不确定性量化,在多个模型和数据集上优于基线方法。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03876 2026-06-03 cs.HC cs.AI cs.MA 91%

From 'What' to 'How' and 'Why': Sharing LLM-Generated Retrospective Summaries of Older Adults' Passive Tracking Data with Remote Family Members

从“是什么”到“怎么样”和“为什么”:与远程家庭成员共享老年人被动追踪数据的LLM生成回顾性摘要

Jiachen Li, Reina Szeyi Chan, Akshat Choube, Xiang Zhi Tan, Elizabeth Mynatt, Varun Mishra

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究利用大型语言模型(LLM)从多模态追踪数据生成回顾性摘要,通过技术探针和访谈重新设计系统,显著提升了远程家庭成员对摘要的满意度、帮助性、信任和接收意愿,并提出了支持其从“是什么”到“怎么样”和“为什么”的认知转变的设计启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03043 2026-06-03 cs.CL 91%

The Geometry of LLM-as-Judge: Why Inter-LLM Consensus Is Not Human Alignment

LLM作为评判者的几何学:为什么LLM间共识不等于人类对齐

Sourabrata Mukherjee, Hamna Hamna, Kalika Bali, Sunayana Sitaram

专题命中 评测与基准 :LLM(title,title_cn);preference optimization(abstract);分类 cs.CL

AI总结 通过几何量测量,发现LLM评判者之间高度一致但与人类对齐差,其评分子空间与人类子空间几乎正交,共识源于子空间坍缩而非人类对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22891 2026-06-03 cs.LG cs.AI cs.CL 90%

Quantifying and Mitigating Self-Preference Bias of LLM Judges

量化与缓解LLM评判者的自我偏好偏差

Jinming Yang, Zheng Hu, Chuxian Qiu, Zhenyu Deng, Xinshan Jiao, Tao Zhou

机构 * CompleX Lab, School of Computer Science and Engineering, University of Electronic Science and Technology of China, Chengdu, China(复杂实验室、计算机科学与工程学院、电子科技大学、成都、中国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出自动化框架量化LLM自我偏好偏差,并通过认知负荷分解的多维评估策略平均降低31.5%的偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03157 2026-06-03 cs.AI 90%

ClinicalMC: A Benchmark for Multi-Course Clinical Decision-Making with Large Language Models

ClinicalMC:面向大语言模型的多疗程临床决策基准

Ruihui Hou, Siyi Zhu, Ziyue Huai, Guangya Yu, Yongqi Fan, Chunming Wang, Tong Ruan

机构 * East China University of Science and Technology, Shanghai, China(东华大学) Renji Hospital Affiliated to Shanghai Jiaotong University School of Medicine, Shanghai, China(复旦大学附属中山医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ClinicalMC基准,包含多阶段样本,通过多智能体评估框架在单轮静态和多轮动态设置下测试大语言模型的临床决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12430 2026-06-03 cs.MA cs.AI 90%

Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward

大型语言模型的智能体技能:架构、获取、安全与未来路径

Renjun Xu, Yang Yan

机构 * ReDiscovery Hangzhou China(杭州ReDiscovery研究院) Westlake University Hangzhou China(西交大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文综述了大型语言模型智能体技能的研究,涵盖架构基础(如SKILL.md规范、渐进式上下文加载)、技能获取(强化学习、自主发现、组合合成)、大规模部署(计算机使用智能体栈、GUI接地)以及安全挑战(26.1%社区技能含漏洞),并提出技能信任与生命周期治理框架。

Comments Accepted by Agent Skills '26 Workshop at ACM Conference on AI and Agentic Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02837 2026-06-03 cs.CL cs.AI 90%

Fixing FOLIO and MALLS: Verified Annotations and an LLM-assisted Framework to Focus Human Relabeling

修复FOLIO和MALLS:经过验证的标注和基于LLM的框架以聚焦人工重新标注

Andrea Brunello, Cristian Curaba, Luca Geatti, Michele Mignani, Angelo Montanari, Nicola Saccomanno

机构 * University of Udine(乌迪大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过人工检查发现FOLIO和MALLS数据集中存在大量形式化错误,提出基于LLM的框架引导人工审核,显著减少所需审核量并提高数据集准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03036 2026-06-03 cs.AI 90%

TriEval: A Resource-Efficient Pipeline for LLM Bias, Toxicity, and Truthfulness Assessment

TriEval: 一种资源高效的LLM偏见、毒性和真实性评估流水线

Akshatha Srikantha, Manpreet Singh, Yash Jajoo, Shyamal Lakhanpal

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出TriEval流水线,通过同时评估LLM输出的偏见、毒性和真实性,在标准笔记本电脑上高效运行,并揭示开源与闭源模型在毒性和真实性上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20306 2026-06-03 cs.CV cs.LG 90%

WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents

WildRoadBench: 面向视觉语言模型与自主智能体的野外航拍道路损伤定位基准

Bingnan Liu, Chenhang Cui, Rui Huang, Jiani Luo, Zhirong Shen, Tinghao Wang, Xiande Huang, Lingbei Meng, Fei Shen, An Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) National University of Singapore(新加坡国立大学) De Artificial Intelligence Lab(德人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 提出WildRoadBench基准,通过VLM直接定位和LLM驱动智能体自主研究两种协议,评估模型在航拍道路损伤定位上的性能,发现现有方法在野外场景下仍不可靠。

Comments Preprint. Under review. 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07842 2026-06-03 cs.CL 90%

Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers

评估和校准LLM在多个正确答案问题上的置信度

Yuhan Wang, Shiyu Ni, Zhikai Ding, Zihang Zhan, Yuanzi Li, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对多正确答案问题导致现有置信度校准方法失效的问题,提出语义置信度聚合(SCA)方法,通过聚合多个高概率采样响应的置信度,在混合答案设置下实现最优校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08247 2026-06-03 cs.CL cs.CY 90%

ParliaBench: An Evaluation and Benchmarking Framework for LLM-Generated Parliamentary Speech

ParliaBench: 面向大语言模型生成的议会演讲的评估与基准框架

Marios Koniaris, Argyro Tsipi, Panayiotis Tsanakas

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ParliaBench基准框架,通过构建英国议会数据集、结合计算指标与LLM评判的评估方法以及两种新型嵌入指标(政治光谱对齐和政党对齐),系统评估LLM生成议会演讲的语言质量、语义连贯性和政治真实性,实验表明微调显著提升多数指标且新指标对政治维度具有强区分力。

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pp. 4797-4818, European Language Resources Association (ELRA), Palma, Mallorca, Spain, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03641 2026-06-03 cs.AI cs.CY 89%

Gender-Dependent Diagnostic Substitution in LLM Medical Triage: Same Symptoms, Unequal Urgency

LLM医疗分诊中的性别依赖性诊断替代:相同症状,不同紧急程度

Qi Han Wong

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型语言模型在相同神经症状下,仅因患者性别和年龄不同而产生不同的分诊建议,发现年轻女性被系统性低估紧急程度,机制为诊断替代。

Comments 7 pages, 3 tables. Multi-model replication across Gemini, Claude, and GPT. Code and data: https://github.com/wongqihan/ai-behavioral-experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31381 2026-06-03 cs.CL 89%

LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

LLM 法官在安全标准和危害类别上不一致地存在分歧

Krishnapriya Vishnubhotla, Sowmya Vajjala, Akriti Vij, Isar Nejadgholi

机构 * National Research Council, Canada(加拿大国家研究理事会) IMDA, Singapore(新加坡信息通信技术发展局)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究评估了自动法官在无参考设置下进行多维安全评估的一致性,发现大型语言模型在识别金融等受监管领域中机器生成建议的安全问题时不可靠,且不一致程度因安全标准、内容语言和风格而异,不同法官之间也存在高度分歧。

Comments 8 pages plus appendices, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03057 2026-06-03 cs.LG cs.AI 88%

Rethinking Molecular Text Representations for LLMs: An Empirical Study

重新思考用于大语言模型的分子文本表示:一项实证研究

Arun Raja, Garrett M. Morris, Kian Ming A. Chai

机构 * University of Oxford(牛津大学) DSO National Laboratories(DSO国家实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 通过系统基准测试,评估了9种分子表示和8种化学任务下16个LLM的性能,发现表示选择强烈影响结果,结构化文本表示(CML、MolJSON)在结构任务中占优,IUPAC在语义任务中占优,而SMILES很少最优。

Comments 25 pages, 11 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03019 2026-06-03 cs.LG cs.AI 88%

Distribution-Calibrated Inference Time Compute for Thinking LLM-as-a-Judge

分布校准的推理时间计算用于思考型LLM作为评判者

Hamid Dadkhahi, Firas Trabelsi, Parker Riley, Juraj Juraska, Mehdi Mirzazadeh

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深Mind) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对思考型大语言模型作为评判者时单样本噪声和聚合不一致问题,提出基于Bradley-Terry-Davidson模型的分布校准聚合方案,利用极性(非平局边际)和决定性(非平局率)区分微弱多数与强共识,显著降低MAE并提高成对准确率,匹配或超越人类评判者。

详情

展开后加载摘要…

URL PDF HTML 收藏