arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1732 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1732 篇

2602.11388 2026-02-13 cs.LG cs.CL 62%

Sparse Semantic Dimension as a Generalization Certificate for LLMs

稀疏语义维度作为大语言模型的泛化证书

Dibyanayan Bandyopadhyay, Asif Ekbal

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

AI总结 通过稀疏语义维度理论,揭示大语言模型泛化能力源于内部表示的稀疏结构而非参数数量。

Comments Work in progress (17 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08520 2026-02-13 cs.AI cs.LG 62%

Reinforcement Inference: Leveraging Uncertainty for Self-Correcting Language Model Reasoning

强化推断:利用不确定性进行自我修正的语言模型推理

Xinhai Sun

机构 * Programme of Management Engineering, Politecnico di Milano(米兰理工学院管理工程项目)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出强化推断方法,通过利用模型不确定性进行自我修正推理,提升语言模型在零样本设置下的准确性,同时减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08272 2026-02-10 cs.LG cs.AI 62%

When Do Multi-Agent Systems Outperform? Analysing the Learning Efficiency of Agentic Systems

多智能体系统何时表现更优?分析智能体系统的学习效率

Junwei Su, Chuan Wu

机构 * Department of Computer Science, University of Hong Kong(计算机科学系,香港大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多智能体强化学习在大语言模型中的学习效率,通过理论分析揭示任务分解与对齐对样本复杂性的影响,明确MARL在特定任务下的优势条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10602 2026-02-10 cs.CV cs.AI cs.CL 62%

TruthPrInt: Mitigating Large Vision-Language Models Object Hallucination Via Latent Truthful-Guided Pre-Intervention

TruthPrInt: 通过潜在真实引导预干预缓解大视觉-语言模型对象幻觉

Jinhao Duan, Fei Kong, Hao Cheng, James Diffenderfer, Bhavya Kailkhura, Lichao Sun, Xiaofeng Zhu, Xiaoshuang Shi, Kaidi Xu

机构 * Drexel University(德雷塞尔大学) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LLNL(劳伦斯利弗莫尔国家实验室) Lehigh University(莱斯大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 TruthPrInt通过学习真相方向并引导解码过程,有效缓解大视觉-语言模型中的对象幻觉问题。

Comments 15 pages, 9 figures, the first two authors contributed equally, Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07164 2026-02-10 cs.CL cs.AI 62%

Your Language Model Secretly Contains Personality Subnetworks

你的语言模型秘密包含个性子网络

Ruimeng Ye, Zihan Wang, Zinan Ling, Yang Xiao, Manling Li, Xiaolong Ma, Bo Hui

机构 * University of Tulsa(图兰大学) Northwestern University(西北大学) University of Arizona(亚利桑那大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大型语言模型内部已嵌入身份子网络,无需外部知识即可实现身份切换和行为调整。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06920 2026-02-09 cs.CL cs.AI 62%

Halluverse-M^3: A multitask multilingual benchmark for hallucination in LLMs

Halluverse-M^3: 一个多任务多语言的幻觉基准测试用于LLMs中的幻觉

Samir Abdaljalil, Parichit Sharma, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) University of Maryland, Baltimore(马里兰大学巴尔的摩分校) Hamad Bin Khalifa University(哈马德·本·卡尔法大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Halluverse-M^3是一个多语言多任务基准测试,用于评估大型语言模型中的幻觉检测性能,涵盖四种语言和两种生成任务,揭示了不同任务和语言下的幻觉检测挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06022 2026-02-06 cs.LG cs.AI 62%

Correctness-Optimized Residual Activation Lens (CORAL): Transferrable and Calibration-Aware Inference-Time Steering

正确性优化残差激活透镜(CORAL):可转移且校准感知的推理时间引导

Miranda Muqing Miao, Young-Min Cho, Lyle Ungar

机构 * Department of Computer and Information Science, University of Pennsylvania, Philadelphia, USA(计算机与信息科学系,宾夕法尼亚大学,费城,美国)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 CORAL通过正则化探针提取模型内部分布式信息,提升推理时多项选择问答的准确性与校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04326 2026-02-05 cs.AI cs.CL cs.MA 62%

From Assumptions to Actions: Turning LLM Reasoning into Uncertainty-Aware Planning for Embodied Agents

从假设到行动:将大语言模型推理转化为具有不确定性的代理规划

SeungWon Seo, SooBin Lim, SeongRae Noh, Haneul Kim, HyeongYeop Kang

机构 * Department of Computer Science and Engineering, Korea University(计算机科学与工程系,韩国大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 PCE框架通过结构化决策树将LLM推理中的假设转化为可靠策略,提升多智能体环境下的规划效率和任务完成率。

Comments 31 pages, 10 figures, Accepted ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03852 2026-02-05 cs.HC cs.AI cs.CY 62%

Perceptions of AI-CBT: Trust and Barriers in Chinese Postgrads

对AI-CBT的认知:中国研究生中的信任与障碍

Chan-in Sio, Alex Mann, Lingxi Fan, Andrew Cheung, Lik-hang Lee

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本研究探讨了中国研究生对AI-CBT聊天机器人在心理健康支持中的信任与障碍,揭示了感知有用性与隐私安全等因素对使用意图的影响。

Comments Accepted and presented in The 30th International Conference on Technologies and Applications of Artificial Intelligence in Taipei, Taiwan on 13-14 December 2025 (TAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02888 2026-02-04 cs.CL cs.AI 62%

HALT: Hallucination Assessment via Log-probs as Time series

HALT:通过log-prob作为时间序列进行幻觉评估

Ahmad Shapiro, Karan Taneja, Ashok Goel

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 HALT通过log-prob时间序列检测幻觉,比Lettuce更高效且兼容专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01956 2026-02-03 cs.LG cs.AI 62%

Efficient Epistemic Uncertainty Estimation for Large Language Models via Knowledge Distillation

通过知识蒸馏实现大型语言模型的高效信念不确定性估计

Seonghyeon Park, Jewon Yeom, Jaewon Sok, Jeongjae Park, Heejun Kim, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Rural Systems Engineering, Seoul National University(首尔国立大学农村系统工程系) Department of Aerospace Engineering, Seoul National University(首尔国立大学航空航天工程系) Department of Electrical Engineering and Computer Science, Gwangju Institute of Science and Technology(全州科学科技研究院电子工程与计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过知识蒸馏高效估计大型语言模型的信念不确定性,减少估计误差并提升幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15386 2026-02-03 cs.CL cs.AI 62%

RePPL: Recalibrating Perplexity by Uncertainty in Semantic Propagation and Language Generation for Explainable QA Hallucination Detection

RePPL:通过语义传播和语言生成中的不确定性重新校准困惑度以检测可解释问答幻觉

Yiming Huang, Junyan Zhang, Zihao Wang, Biquan Bie, Yunzhong Qiu, Xuming Hu, Yi R. Fung, Xinlei He

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 RePPL通过校准语义传播和语言生成中的不确定性,提升问答幻觉检测性能,生成token级不确定性评分作为解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00977 2026-02-03 cs.CL cs.LG 62%

Trust in One Round: Confidence Estimation for Large Language Models via Structural Signals

单轮信任:通过结构信号提升大语言模型的置信度估计

Pengyue Yang, Jiawen Wen, Haolin Jin, Linghan Huang, Huaming Chen, Ling Chen

机构 * The University of Sydney(悉尼大学) University of Technology Sydney(技术大学悉尼)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

AI总结 通过分析模型最终层隐藏状态轨迹中的多尺度结构信号,提出结构置信度方法,实现单次通过的高效、稳健置信度估计,适用于高社会影响和资源受限的LLM应用。

Comments Accepted at The ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00279 2026-02-03 cs.CL cs.LG 62%

Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering

在大型语言模型长格式问答中评估不确定性校准的基准测试

Philip Müller, Nicholas Popovič, Michael Färber, Peter Steinbach

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出首个大规模基准,评估大型语言模型在长格式问答中不确定性校准的可靠性,揭示了指令调优和推理过程对校准的影响及ECE指标的局限性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21969 2026-02-02 cs.CL cs.AI 62%

Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding

Token-Guard: 通过自检解码实现token级幻觉控制

Yifan Zhu, Huiqiang Rong, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 Token-Guard通过自检解码技术,实现对大型语言模型中token级幻觉的有效控制,提升生成准确性与输出可靠性。

Comments Accepted by ICLR 2026 main conference

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04418 2026-01-30 cs.LG cs.CL 62%

The Illusion of Certainty: Uncertainty Quantification for LLMs Fails under Ambiguity

确定性的幻觉:在歧义下LLM的不确定性量化失效

Tim Tomov, Dominik Fuchsgruber, Tom Wollschläger, Stephan Günnemann

机构 * School of Computation, Information Technology \& Munich Data Science Institute - Technical University of Munich

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究揭示了在歧义环境下LLM的不确定性量化方法存在缺陷,提出了MAQA*和AmbigQA*数据集以评估模型在歧义数据上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18306 2026-01-27 cs.CL cs.AI 62%

Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM

超越英语的校准:为更好的量化多语言大语言模型的语言多样性

Everlyn Asiko Chimoto, Mostafa Elhoushi, Bruce A. Bassett

机构 * Lelapa AI Cerebras Systems, Inc University of the Witwatersrand(乌得勒支大学) University of Cape Town(开普敦大学) South African Astronomical Observatory(南非天文台)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过多语言校准集提升多语言大语言模型的量化性能,发现非英语和多语言混合校准显著降低困惑度,强调语言对齐的重要性。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12869 2026-01-27 cs.LG cs.AI cs.DC cs.IT cs.MA math.IT 62%

On the Fundamental Limits of LLMs at Scale

在大规模下的大语言模型根本限制

Muhammad Ahmed Mohsin, Muhammad Umer, Ahsan Bilal, Zeeshan Memon, Muhammad Ibtsaam Qadir, Sagnik Bhattacharya, Hassan Rizwan, Abhiram R. Gorle, Maahe Zehra Kazmi, Nukhba Amir, Ali Subhan, Muhammad Usman Rafique, Zihao He, Pulkit Mehta, Muhammad Ali Jamshed, John M. Cioffi

机构 * Stanford University(斯坦福大学) The University of Oklahoma(俄克拉荷马大学) Emory University(埃默里大学) Purdue University(普渡大学) UC Riverside(加州大学河滨分校) UC Berkeley(加州大学伯克利分校) Khyber Medical University(克希伯医学大学) Universtat Pompeu Fabra(庞培法华大学) Zoox(Zoox公司) Meta Google DeepMind(谷歌DeepMind) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Glasgow(格拉斯哥大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了大规模大语言模型的根本限制,提出统一框架分析计算、信息和学习的基础限制,并提供缓解方法。

Comments Submitted to TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12442 2026-01-21 cs.LG cs.AI cs.CV 62%

Constraint-Aware Neurosymbolic Uncertainty Quantification with Bayesian Deep Learning for Scientific Discovery

具有贝叶斯深度学习的约束感知神经符号不确定性量化框架用于科学发现

Shahnawaz Alam, Mohammed Mudassir Uddin, Mohammed Kaif Pasha

机构 * Department of Computer Science and Engineering Muffakham Jah College of Engineering and Technology (MJCET)(计算机科学与工程系穆法卡姆·贾赫工程与技术学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 CANUF通过结合贝叶斯深度学习与可微符号推理,首次实现科学预测中的不确定性量化、约束满足和可解释性解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10337 2026-01-15 cs.AI cs.LG 62%

A Curriculum Learning Approach to Reinforcement Learning: Leveraging RAG for Multimodal Question Answering

一种基于RAG的强化学习课程学习方法:用于多模态问答

Chenliang Zhang, Lin Wang, Yuanyuan Lu, Yusheng Qi, Kexin Wang, Peixu Hou, Wenshi Chen

机构 * Meituan(美团)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合课程学习与强化学习的方法,用于多模态问答任务,通过检索增强生成系统在挑战中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06022 2026-01-12 cs.CL cs.AI 62%

AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs

AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放

Chengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12278 2026-01-12 cs.CV cs.AI cs.CL 62%

Controlled Automatic Task-Specific Synthetic Data Generation for Hallucination Detection

受控的自动任务特定合成数据生成用于幻觉检测

Yong Xie, Karan Aggarwal, Aitzaz Ahmad, Stephen Lau

机构 * Amazon(亚马逊)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种受控的自动任务特定合成数据生成方法,通过两步流程和数据混合策略提升幻觉检测的泛化能力和鲁棒性,实验表明其在幻觉检测任务中优于基于上下文学习的检测器。

Comments 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (ACM KDD 2024). Accepted by Workshop on Evaluation and Trustworthiness of Generative AI Models

Journal ref 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05376 2026-01-12 cs.AI cs.CL 62%

The Persona Paradox: Medical Personas as Behavioral Priors in Clinical Language Models

医疗人设悖论:临床语言模型中的行为先验

Tassallah Abdullahi, Shrestha Ghosh, Hamish S Fraser, Daniel León Tramontini, Adeel Abbasi, Ghada Bourjeily, Carsten Eickhoff, Ritambhara Singh

机构 * Brown University(布朗大学) University of Tuebingen(图宾根大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示医疗人设在临床语言模型中产生上下文依赖的性能权衡,显示其在重症护理任务中提升表现,但在初级护理中降低性能,且互动风格影响风险倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04728 2026-01-09 cs.LG cs.AI 62%

Excess Description Length of Learning Generalizable Predictors

学习可泛化的预测器的超额描述长度

Elizabeth Donoway, Hailey Joren, Fabien Roger, Jan Leike

机构 * ucb(加州大学伯克利分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EDL框架,用于量化微调提取的预测结构并评估模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23765 2026-01-01 cs.CL cs.AI 62%

Entropy-Aware Speculative Decoding Toward Improved LLM Reasoning

基于熵的推测解码:改进大语言模型推理

Tiancheng Su, Meicong Zhang, Guoxiu He

机构 * School of Economics and Management(经济管理学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 基于熵的推测解码通过动态熵惩罚提升大语言模型推理性能,实验表明其在多数情况下优于目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23547 2025-12-30 cs.CL cs.AI 62%

Lie to Me: Knowledge Graphs for Robust Hallucination Self-Detection in LLMs

对谎言说谎:知识图谱在大语言模型鲁棒性幻觉自检测中的应用

Sahil Kale, Antonio Luca Alfeo

机构 * eCampus University(eCampus大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出利用知识图谱提升大语言模型幻觉自检的鲁棒性,通过转换响应为图谱并估算幻觉可能性,实现准确率和F1分数的显著提升。

Comments Accepted to ICPRAM 2026 in Marbella, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22245 2025-12-30 cs.LG cs.AI 62%

Calibrating LLM Judges: Linear Probes for Fast and Reliable Uncertainty Estimation

校准大语言模型法官:用于快速可靠不确定性估计的线性探针

Bhaktipriya Radharapu, Eshika Saxena, Kenneth Li, Chenxi Whitehouse, Adina Williams, Nicola Cancedda

机构 * FAIR at Meta(Meta 的 FAIR 研究所) Meta Superintelligence Labs(Meta 超智能实验室)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于线性探针的校准方法,通过Brier分数损失训练,实现快速可靠的LLM法官不确定性估计,相比现有方法在计算效率和泛化能力上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01939 2025-12-22 astro-ph.IM astro-ph.SR cs.AI cs.LG 62%

SpecCLIP: Aligning and Translating Spectroscopic Measurements for Stars

SpecCLIP:对齐和翻译恒星光谱测量

Xiaosheng Zhao, Yang Huang, Guirong Xue, Xiao Kong, Jifeng Liu, Xiaoyu Tang, Timothy C. Beers, Yuan-Sen Ting, A-Li Luo

机构 * School of Astronomy Space Science, University of Chinese Academy of Sciences, Beijing 100049, People's Republic of China National Astronomical Observatories, Chinese Academy of Sciences, Beijing 100012, People's Republic of China Department of Physics \& Astronomy, The Johns Hopkins University, Baltimore, MD 21218, USA Zhejiang Laboratory, Hangzhou 311121, People's Republic of China Research Center for Astronomical Computing, Zhejiang Laboratory, Hangzhou 311121, People's Republic of China Department of Physics Astronomy, University of Notre Dame, Notre Dame, IN 46556, USA Joint Institute for Nuclear Astrophysics -- Center for the Evolution of the Elements (JINA-CEE), USA Department of Astronomy, The Ohio State University, 140 West 18th Avenue, Columbus, OH 43210, USA Center for Cosmology AstroParticle Physics (CCAPP), The Ohio State University, Columbus, OH 43210, USA

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 SpecCLIP通过对比学习和光谱意识解码器提升恒星光谱分析的精度和应用灵活性。

Comments 29 pages, 8 figures, 6 tables. Accepted for publication in ApJ. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15663 2025-12-18 cs.AI cs.CL 62%

Explaining the Reasoning of Large Language Models Using Attribution Graphs

通过归因图解释大语言模型的推理过程

Chase Walker, Rickard Ewetz

机构 * University of Florida(佛罗里达大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 CAGE框架通过归因图解释大语言模型的推理过程,提升上下文归因的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14220 2025-12-17 cs.LG cs.AI 62%

Estimating problem difficulty without ground truth using Large Language Model comparisons

无需真实数据即可利用大语言模型比较估计问题难度

Marthe Ballon, Andres Algaba, Brecht Verbeken, Vincent Ginis

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM compare方法,通过大语言模型的成对比较估计问题难度,克服传统方法在分布外问题上的局限性,具有高一致性与鲁棒性。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏