arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18788 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18788 篇

2406.13621 2026-04-14 cs.CL cs.CV cs.LG 90%

LaMI: Augmenting Large Language Models via Late Multi-Image Fusion

LaMI:通过晚期多图像融合增强大型语言模型

Guy Yariv, Idan Schwartz, Yossi Adi, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Bar-Ilan University(巴伊兰大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 LaMI通过在测试时融合多个图像提升视觉常识推理能力,同时保持文本推理性能,适用于视觉和NLP任务。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07048 2026-04-10 cs.CL cs.AI 90%

Search-R3: Unifying Reasoning and Embedding in Large Language Models

Search-R3:在大型语言模型中统一推理与嵌入

Yuntao Gui, James Cheng

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 Search-R3通过统一推理与嵌入生成过程,提升大型语言模型在检索任务中的性能,采用监督学习、强化学习和专用环境机制实现有效嵌入生成。

Comments CHANGELOG: (1) Completed training of Search-R3-Large; (2) Corrected error formulation; (3) Added a `Discussion` section to the appendix. We appreciation to the anonymous reviewers

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02910 2026-04-06 cs.AI cs.CL 90%

Analysis of Optimality of Large Language Models on Planning Problems

大型语言模型在规划问题中的最优性分析

Bernd Bohnet, Michael C. Mozer, Kevin Swersky, Wil Cunningham, Aaron Parisi, Kathleen Kenealy, Noah Fiedel

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在规划问题中的最优性,通过Blocksworld领域和Path-Star图任务,发现增强推理的LLM在复杂多目标配置中显著优于传统规划器,且能精确跟踪理论最优限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02346 2026-04-06 cs.LG cs.AI cs.SE q-bio.BM 90%

DrugPlayGround: Benchmarking Large Language Models and Embeddings for Drug Discovery

DrugPlayGround:大型语言模型和嵌入式在药物发现中的基准测试

Tianyu Liu, Sihan Jiang, Fan Zhang, Kunyang Sun, Teresa Head-Gordon, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院和哈佛大学博德研究所) The Chinese University of Hong Kong(香港中文大学) University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DrugPlayGround框架,用于评估大型语言模型在生成药物物理化学特性、药物协同作用等文本描述方面的性能,同时通过专家解释验证模型的化学和生物推理能力。

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27057 2026-03-31 cs.CL cs.AI 90%

Debiasing Large Language Models toward Social Factors in Online Behavior Analytics through Prompt Knowledge Tuning

通过提示知识微调去偏大型语言模型在在线行为分析中的社会因素

Hossein Salemi, Jitin Krishnan, Hemant Purohit

机构 * George Mason University(乔治梅森大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在社交情境中通过引入用户目标推断 dispositional 因果性和消息上下文推断 situational 因果性对 LLM 性能的影响,提出了一种通过增强指令提示来减少社会归因偏见的方法,提升零样本分类任务的性能。

Comments This is a preprint of the accepted paper for publication in IEEE Transactions on Computational Social Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03223 2026-03-30 cs.CL cs.AI 90%

Attention-Aligned Reasoning for Large Language Models

面向大语言模型的注意力对齐推理

Hongxiang Zhang, Yuan Tian, Tianyi Zhang

机构 * Purdue University(普渡大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ATAR方法,通过利用推理结构引导LLM注意力,提升复杂任务处理性能,实验显示在六个基准上表现优于现有方法,且非推理模型性能可与推理模型媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14765 2026-03-30 cs.LG cs.AI 90%

PepThink-R1: LLM for Interpretable Cyclic Peptide Optimization with CoT SFT and Reinforcement Learning

PepThink-R1:基于CoT SFT和强化学习的可解释环状肽优化LLM

Ruheng Wang, Hang Zhang, Trieu Nguyen, Shasha Feng, Hao-Wei Pang, Xiang Yu, Li Xiao, Peter Zhiping Zhang

机构 * Merck & Co., Inc., Rahway, NJ, USA(默克公司,美国新泽西州拉威) UT Southwestern Medical Center, Dallas, TX, USA(得克萨斯大学西南医学中心,美国得克萨斯州达拉斯) University of Pittsburgh, Pittsburgh, PA, USA(匹兹堡大学,美国宾夕法尼亚州匹兹堡)

专题命中 推理与问题求解 :LLM(title,abstract);SFT(title);large language model(abstract);language model(abstract)

AI总结 本文提出PepThink-R1,结合CoT SFT和强化学习,通过显式推理生成可解释的环状肽,提升药理性质表现,优于现有通用LLM和领域模型。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: AI for Science (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24721 2026-03-27 cs.CV cs.AI cs.LG cs.MM 90%

Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models

可扩展的对象关系编码以提升大语言模型中的3D空间推理

Shengli Zhou, Minghang Zheng, Feng Zheng, Yang Liu

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuatRoPE,通过线性增长的对象数量输入长度和注意力层中的点积计算配对空间关系,提升大语言模型在3D空间推理中的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23004 2026-03-25 cs.AI cs.LG 90%

Can Large Language Models Reason and Optimize Under Constraints?

大型语言模型能否在约束下进行推理和优化?

Fabien Bernier, Salah Ghamizi, Pantelis Dogoulis, Maxime Cordy

机构 * SnT – University of Luxembourg(卢森堡大学SnT分校) Luxembourg Institute of Health (LIH)(卢森堡健康研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大型语言模型在最优功率流问题物理和操作约束下的推理与优化能力,发现现有模型在多数任务中表现不足,揭示了LLM在约束下结构推理的关键差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18118 2026-03-20 cs.CV cs.AI cs.LG 90%

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

Insight-V++: 向多模态大语言模型实现高级长链视觉推理迈进

Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

机构 * S-Lab(S实验室) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文言) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Insight-V++框架,通过多代理视觉推理系统提升多模态大语言模型的长链视觉推理能力,采用ST-GRPO和J-GRPO算法增强空间时间推理和评估鲁棒性,实验显示在图像和视频推理任务中性能显著提升。

Comments arXiv admin note: text overlap with arXiv:2411.14432

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05880 2026-03-16 cs.CL cs.AI 90%

Large language models show fragile cognitive reasoning about human emotions

大型语言模型在人类情感认知推理中的脆弱性

Sree Bhattacharyya, Evgenii Kuriabov, Lucas Craig, Tharun Dilliraj, Reginald B. Adams,, Jia Li, James Z. Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨大型语言模型是否能通过认知维度而非标签进行情感推理,提出CoRE基准测试,发现模型在情感认知结构上有系统性关系,但与人类判断存在偏差且在不同上下文中不稳定。

Comments Under Review, a version was presented at WiML Workshop @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02663 2026-03-06 cs.CL cs.AI 90%

When Do Tools and Planning Help Large Language Models Think? A Cost- and Latency-Aware Benchmark

当工具和规划如何帮助大语言模型思考?一个成本和延迟感知的基准测试

Subha Ghoshal, Ali Al-Bustami

机构 * College of Engineering(工程学院) University of Michigan-Dearborn(密歇根大学-迪尔伯恩分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究通过对比不同配置评估工具和规划对大语言模型性能的影响,发现工具增强能显著提升准确性但增加延迟,而复杂工具协调易导致模型退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08211 2026-03-06 cs.CL cs.AI 90%

Large Language Models are Contrastive Reasoners

大型语言模型是对比推理器

Liang Yao

机构 * Sun Yat-sen University Shenzhen, China(中山大学深圳校区)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出对比提示方法,通过简单提示提升大型语言模型的推理能力,在算术和常识推理任务中优于零样本和少样本方法。

Journal ref Expert Systems With Applications 301 (2026) 130407

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01326 2026-03-03 cs.CL cs.LG 90%

Truth as a Trajectory: What Internal Representations Reveal About Large Language Model Reasoning

真相作为轨迹:内部表示揭示大语言模型推理的本质

Hamed Damirchi, Ignacio Meza De la Jara, Ehsan Abbasnejad, Afshar Shamsi, Zhen Zhang, Javen Shi

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Monash University(莫纳什大学) Concordia University(康科迪亚大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 TaT通过分析大语言模型推理过程中的层间几何位移,揭示有效推理与虚假行为的区别,提升模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22698 2026-02-27 cs.CL cs.AI 90%

Tokenization, Fusion and Decoupling: Bridging the Granularity Mismatch Between Large Language Models and Knowledge Graphs

分词、融合与解耦:弥合大语言模型与知识图谱之间的粒度不匹配

Siyue Su, Jian Yang, Bo Li, Guanglin Niu

机构 * Beihang University(北航大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 KGT通过专门的实体token分词、融合预训练特征及解耦预测,有效弥合大语言模型与知识图谱间的粒度不匹配,提升知识图谱补全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22280 2026-02-27 cs.LG cs.AI 90%

Integrating Machine Learning Ensembles and Large Language Models for Heart Disease Prediction Using Voting Fusion

将机器学习集成与大型语言模型结合用于心脏病预测的投票融合

Md. Tahsin Amin, Tanim Ahmmod, Zannatul Ferdus, Talukder Naemul Hasan Naem, Ehsanul Ferdous, Arpita Bhattacharjee, Ishmam Ahmed Solaiman, Nahiyan Bin Noor

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过结合机器学习集成与大型语言模型的投票融合方法,提高了心脏病预测的准确性与可靠性。

Comments 7 pages, 8 figures, (Accepted at a peer-reviewed conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19467 2026-02-24 cs.CY cs.AI cs.CL 90%

Can Large Language Models Replace Human Coders? Introducing ContentBench

大语言模型能取代人类程序员吗?引入ContentBench

Michael Haman

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文通过ContentBench基准测试,评估低成本大语言模型在解释性编程任务中的表现,揭示其在高精度任务中的优势及在讽刺处理上的局限性。

Comments Project website: https://contentbench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19160 2026-02-24 cs.AI cs.CL cs.LO 90%

Reasoning Capabilities of Large Language Models. Lessons Learned from General Game Playing

大语言模型的推理能力。从通用游戏玩法中获得的教训

Maciej Świechowski, Adam Żychowski, Jacek Mańdziuk

机构 * Grail Team(Grail团队) Warsaw University of Technology(华沙技术大学) AGH University of Krakow(克拉科夫AGH大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文通过通用游戏玩法任务评估大语言模型的推理能力,发现部分模型在多步骤任务中表现稳定,但随着任务复杂度增加性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18776 2026-02-24 cs.CL cs.AI 90%

ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models

阿拉伯数字阅读基准:评估大型语言模型在阿拉伯数字阅读任务中的表现

Anas Alhumud, Abdulaziz Alhammadi, Muhammad Badruddin Khan

机构 * Imam Mohammad Ibn Saud Islamic University Saudi Arabia(伊玛目穆罕默德·本·沙特伊斯兰大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 阿拉伯数字基准评估大型语言模型在阿拉伯数字阅读任务中的表现,揭示不同提示策略和模型在准确率上的显著差异,指出结构化输出生成的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15867 2026-02-19 cs.CL cs.AI 90%

Playing With AI: How Do State-Of-The-Art Large Language Models Perform in the 1977 Text-Based Adventure Game Zork?

玩转AI:当前最先进的大语言模型在1977年文本冒险游戏Zork中的表现如何?

Berry Gerrits

机构 * University of Twente(特文特大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了当前最先进的大语言模型在1977年文本冒险游戏Zork中的表现,发现其在问题解决和推理能力上存在显著局限。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03195 2026-02-17 cs.LG cs.AI 90%

Reinforcement Learning with Promising Tokens for Large Language Models

基于有前景标记的强化学习用于大语言模型

Jing-Cheng Pang, Liang Lu, Xian Tang, Kun Jiang, Sijie Wu, Kai Zhang, Xubin Li

机构 * huawei(华为技术有限公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 基于有前景标记的强化学习框架通过解耦战略决策与标记生成,有效提升大语言模型的训练稳定性与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00075 2026-02-10 cs.LG cs.AI 90%

Theoretical Modeling of Large Language Model Self-Improvement Training Dynamics Through Solver-Verifier Gap

大语言模型自我改进训练动态的理论建模:通过求解器-验证器间隙

Yifan Sun, Yushan Liang, Zhen Zhang, Xin Liu, Jiaye Teng

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文通过求解器-验证器间隙理论,建模大语言模型自我改进的训练动态,并验证了该框架在不同模型和数据集上的有效性,同时探讨了外部数据对动态的影响。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15487 2026-02-10 cs.CL cs.AI 90%

ExpliCa: Evaluating Explicit Causal Reasoning in Large Language Models

ExpliCa:评估大型语言模型中的显式因果推理

Martina Miliani, Serena Auriemma, Alessandro Bondielli, Emmanuele Chersoni, Lucia Passaro, Irene Sucameli, Alessandro Lenci

机构 * CoLing Lab, Department of Philology, Literature, and Linguistics, University of Pisa, Italy(皮尔森大学哲学、文学与语言学系协作语言实验室) Department of Informatics, University of Pisa, Italy(皮尔森大学信息学系) Department of Chinese and Bilingual Studies, The Hong Kong Polytechnic University(香港理工大学中文与双语研究系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 ExpliCa数据集用于评估大型语言模型在显式因果推理中的能力,发现顶级模型在准确率上仍存在显著不足,且模型性能受语言顺序和大小影响明显。

Comments Accepted for publication in Findings of ACL 2025

Journal ref In Findings of the Association for Computational Linguistics: ACL 2025, pages 17335-17355, Vienna, Austria. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18012 2026-02-10 cs.CL cs.AI 90%

Evaluating Semantic and Syntactic Understanding in Large Language Models for Payroll Systems

评估大型语言模型在薪酬系统中的语义和句法理解能力

Hendrika Maclean, Mert Can Cakmak, Muzakkiruddin Ahmed Mohammed, Shames Al Mandalawi, John Talburt

机构 * Center for Entity Resolution(实体解析中心) Information Quality (ERIQ) - University of Arkansas - Little Rock, Arkansas, Little Rock, USA(信息质量(ERIQ)- 阿拉巴马大学-利特尔岩石分校,阿肯色州,利特尔岩石,美国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估大型语言模型在薪酬系统中理解语义和句法的能力,通过实验发现不同提示策略对模型准确性的不同影响,并提出可复现的部署框架。

Comments ITNG 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08487 2026-02-10 cs.CL cs.AI 90%

Beyond Bias Scores: Unmasking Vacuous Neutrality in Small Language Models

超越偏见分数:揭示小型语言模型中的空洞中性

Sumanth Manduru, Carlotta Domeniconi

机构 * George Mason University(乔治·马歇尔大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);SLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出空洞中性框架,评估小型语言模型的公平性与鲁棒性,揭示其在不同社会偏见类别中的隐藏漏洞。

Comments Accepted at EACL 2026 Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06967 2026-02-10 cs.RO cs.AI cs.CL 90%

Leveraging Adaptive Group Negotiation for Heterogeneous Multi-Robot Collaboration with Large Language Models

利用自适应群体谈判实现异构多机器人协作的大型语言模型

Siqi Song, Xuanbing Xie, Zonglin Li, Yuqiang Li, Shijie Wang, Biqing Qi

机构 * Tsinghua University(清华大学) Central South University(中南大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 CLiMRS通过自适应群体谈判框架提升异构多机器人协作效率,实验显示在复杂任务中效率提升超40%。

Comments 20 pages, 12 figures, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08301 2026-02-05 cs.LG cs.AI cs.NE 90%

Large Language Model as Meta-Surrogate for Data-Driven Many-Task Optimization: A Proof-of-Principle Study

大语言模型作为元代理模型用于数据驱动的多任务优化:原理验证研究

Xian-Rong Zhang, Yue-Jiao Gong, Yuan-Ting Zhong, Ting Huang, Jun Zhang

机构 * School of Computer Science and Engineering, South China University of Technology, Guangzhou, China.(计算机科学与工程学院,华南理工大学,广州,中国) Guangzhou Institute of Technology, Xidian University, China.(广州理工大学,西安电子科技大学,中国) College of Artificial Intelligence, Nankai University, Tianjin, China.(人工智能学院,南开大学,天津,中国) Hanyang University, 15588 Ansan, South Korea.(湖南衡阳大学,韩国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出利用大语言模型作为元代理模型,通过多任务优化框架提升适应度预测效率,实现跨任务知识共享与新任务适应性,验证了其在进化迁移优化中的有效性。

Comments 39 pages

Journal ref Information Sciences 726 (2026) 122762

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03309 2026-02-04 cs.LG cs.AI 90%

Entropy-Gated Selective Policy Optimization:Token-Level Gradient Allocation for Hybrid Training of Large Language Models

熵门选择策略优化:用于大型语言模型混合训练的token级梯度分配

Yuelin Hu, Zhengxue Cheng, Wei Liu, Li Song

机构 * Department of Computer Science Anonymous University(计算机科学系 匿名大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 EGSPO通过token级梯度分配提升大型语言模型的混合训练效果,实现数学推理任务的性能提升并降低计算开销。

Comments accepted by cscwd2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10691 2026-02-02 cs.CL cs.AI 90%

Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models

从温和到动态对抗的评估:一个大型语言模型的鱿鱼游戏

Zijian Chen, Wenjun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出鱿鱼游戏,一个动态对抗性评估环境,用于评估大型语言模型的多方面能力,并揭示静态基准中可能存在的评估范式污染问题。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14278 2026-01-27 cs.CR cs.AI cs.LG 90%

Beyond Data Privacy: New Privacy Risks for Large Language Models

超越数据隐私:大型语言模型的新隐私风险

Yuntao Du, Zitao Li, Ninghui Li, Bolin Ding

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) Alibaba(阿里巴巴)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了大型语言模型在部署过程中出现的新隐私风险,并提出缓解策略以应对日益强大的LLMs带来的威胁。

Comments Published in the IEEE Data Engineering Bulletin: http://sites.computer.org/debull/A25dec/issue1.htm

详情

展开后加载摘要…

URL PDF HTML 收藏