arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-13 至 2026-04-13 共收录 237 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 48 篇

2604.08801 2026-04-13 cs.LG cs.CL 62%

$p1$: Better Prompt Optimization with Fewer Prompts

用更少提示实现更好的提示优化

Zhaolin Gao, Yu, Wang, Bo Liu, Thorsten Joachims, Kianté Brantley, Wen Sun

机构 * Cornell University(康奈尔大学) Microsoft(微软) Harvard University(哈佛大学) Databricks AI Research(Databricks AI研究)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示提示优化有效性取决于系统提示与响应方差,提出$p1$过滤方法提升优化效果,实验显示其在推理基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08609 2026-04-13 cs.CV cs.AI cs.LG 62%

Detection of Hate and Threat in Digital Forensics: A Case-Driven Multimodal Approach

数字取证中的仇恨与威胁检测:基于案例的多模态方法

Ponkoj Chandra Shill

机构 * University of Nevada, Reno(内华达大学雷诺分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于案例的多模态方法,用于数字取证中的仇恨与威胁检测,通过区分文本证据、关联上下文文本和图像证据,提升取证的可追溯性和准确性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08603 2026-04-13 cs.AI cs.CL 62%

From Business Events to Auditable Decisions: Ontology-Governed Graph Simulation for Enterprise AI

从商业事件到可审计决策:面向企业AI的本体引导图模拟

Hongyin Zhu, Jinming Liang, Mengjun Hou, Ruifan Tang, Xianbin Zhu, Jingyuan Yang, Yuanman Mao, Feng Wu

机构 * Yonyou AI Lab(用友AI实验室) Yonyou Network Technology Co., Ltd.(用友网络科技股份有限公司)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LOM-action框架,通过本体引导的图模拟实现企业AI决策,确保决策基于模拟图而非无限制知识空间,提升决策可信度与可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08110 2026-04-13 cs.CV cs.AI cs.LG 62%

OV-Stitcher: A Global Context-Aware Framework for Training-Free Open-Vocabulary Semantic Segmentation

OV-Stitcher:一种无需训练的全局上下文感知框架,用于开放词汇语义分割

Seungjae Moon, Seunghyun Oh, Youngmin Ro

机构 * Machine Intelligence Laboratory, University of Seoul, Korea(韩国首尔市立大学机器智能实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OV-Stitcher框架,通过直接拼接碎片化子图像特征,在最终编码器块中实现全局注意力,提升开放词汇分割的性能和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02598 2026-04-13 cs.HC cs.AI cs.PL 57%

Explorable Theorems: Making Written Theorems Explorable by Grounding Them in Formal Representations

可探索的定理:通过将其基于形式化表示来使书面定理可探索

Hita Kambhamettu, Will Crichton, Sean Welleck, Harrison Goldstein, Andrew Head

机构 * University of Pennsylvania(宾夕法尼亚大学) Brown University(布朗大学) Carnegie Mellon University(卡内基梅隆大学) University at Buffalo(布法罗大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出可探索的定理系统,利用LLM将定理和证明转化为Lean语言,使用户能交互式地逐步验证证明并测试例子,提升数学理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09114 2026-04-13 cs.CV cs.LG 57%

FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval

FIRE-CIR:细粒度复合时尚图像检索中的精细推理

François Gardères, Camille-Sovanneary Gauthier, Jean Ponce, Shizhe Chen

机构 * Louis Vuitton(路易威登) Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所, 巴黎高等师范学院, 法国国家科学研究中心, 巴黎文理研究大学) Courant Institute of Mathematical Sciences and Center for Data Science, New York University(纽约大学库朗数学科学研究所与数据科学中心)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 FIRE-CIR通过问题驱动的视觉推理提升时尚图像检索的可解释性和准确性,通过生成属性聚焦的视觉问题并验证参考与候选图像中的证据,实现更精确的检索结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08669 2026-04-13 cond-mat.quant-gas cs.LG quant-ph 57%

An Algorithm for Fast Assembling Large-Scale Defect-Free Atom Arrays

一种快速组装大规模无缺陷原子阵列的算法

Tao Zhang, Xiaodi Li, Hui Zhai, Linghui Chen

机构 * Institute for Advanced Study, Tsinghua University(清华大学高等研究院) Intelligent Quantum Inception Inc.(智能量子启创公司) iFLYTEK Research(科大讯飞研究院)

专题命中 推理与问题求解 :SLM(abstract);分类 cs.LG

AI总结 本文提出一种统一框架,通过监督学习和改进的拍卖解码器进行路径规划,结合相位和轮廓感知的加权Gerchberg-Saxton算法,实现快速组装10^4个量子比特的无缺陷原子阵列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27817 2026-04-13 cs.CV cs.AI cs.CR 57%

Towards Context-Aware Image Anonymization with Multi-Agent Reasoning

面向多智能体推理的上下文感知图像匿名化

Robert Aufschläger, Jakob Folz, Gautam Savaliya, Manjitha D Vidanalage, Michael Heigl, Martin Schramm

机构 * Deggendorf Institute of Technology(代根多夫应用技术大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出CAIAMAR框架,通过多智能体推理和扩散匿名化技术,实现上下文感知的PII分割,减少重识别风险并提升图像质量。

Comments Accepted to IEEE CVPR 2026 GRAIL-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09535 2026-04-13 cs.CV 50%

EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks

EgoTL:用于长时任务的目视思考链

Lulin Liu, Dayou Li, Yiqing Liang, Sicong Jiang, Hitesh Vijay, Hezhen Hu, Xuhai Xu, Zirui Liu, Srinivas Shakkottai, Manling Li, Zhiwen Fan

机构 * UMN(明尼苏达大学) TAMU(德克萨斯农工大学) Brown University(布朗大学) McGill University(麦吉尔大学) UT Austin(德克萨斯大学奥斯汀分校) Columbia University(哥伦比亚大学) Northwestern University(西北大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本文提出EgoTL,通过构建目视思考链管道,提升长时任务中视觉语言模型和世界模型的推理与规划能力,发现基础模型在作为目视助手或开放世界模拟器方面仍有不足。

Comments https://ego-tl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09511 2026-04-13 cs.CV 50%

RIRF: Reasoning Image Restoration Framework

RIRF:图像修复推理框架

Wending Yan, Rongkai Zhang, Kaihua Tang, Yu Cheng, Qiankun Liu

机构 * Southwest Jiaotong University(西南交通大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出RIRF框架,通过整合结构化推理流程提升图像修复的可解释性与修复质量,结合推理与修复任务实现统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09167 2026-04-13 cs.CV cs.MA 50%

MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding

MAG-3D:多智能体基础推理用于3D理解

Henry Zheng, Chenyue Fang, Rui Huang, Siyuan Wei, Xiao Liu, Gao Huang

机构 * Tsinghua University(清华大学) Pico, ByteDance(字节跳动Pico)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出MAG-3D,一种无需训练的多智能体框架,通过动态协调专家代理实现灵活的3D基础推理,解决复杂场景中的空间和几何关系推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08921 2026-04-13 cs.CV 50%

TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction

TAIHRI:面向近距离人机交互的任务感知3D人体关键点定位

Ao Li, Yonggen Ling, Yiyang Lin, Yuji Wang, Yong Deng, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Tencent Robotics X(腾讯机器人实验室X) Futian Laboratory(福田实验室)

专题命中 推理与问题求解 :language model(abstract)

AI总结 TAIHRI是首个针对近距离人机交互的视觉-语言模型,通过任务感知的3D关键点定位实现人机交互中的精准空间定位,提升机器人对任务相关身体部位的识别与响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08726 2026-04-13 cs.RO 50%

Task-Aware Bimanual Affordance Prediction via VLM-Guided Semantic-Geometric Reasoning

基于VLM引导的语义-几何推理的任务感知双臂 affordance 预测

Fabian Hahne, Vignesh Prasad, Georgia Chalvatzaki, Jan Peters, Alap Kshirsagar

机构 * Department of Computer Science, Technical University of Darmstadt(达姆施塔特工业大学计算机科学系) German Research Center for AI (DFKI)(德国人工智能研究中心) Centre for Cognitive Science, Technical University of Darmstadt(达姆施塔特工业大学认知科学中心) Hessian Center for Artificial Intelligence (Hessian.AI), Darmstadt(黑森州人工智能中心) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出一种任务感知双臂 affordance 预测框架,通过VLM实现跨物体类别和任务描述的泛化,融合多视角RGB-D数据生成全局6自由度抓取候选,结合语义和几何过滤提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03370 2026-04-13 cs.CV 50%

ShelfGaussian: Shelf-Supervised Open-Vocabulary Gaussian-based 3D Scene Understanding

ShelfGaussian:基于货架的开放词汇高斯3D场景理解

Lingjun Zhao, Yandong Luo, James Hays, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本文提出ShelfGaussian框架,利用货架监督学习方法,结合多模态高斯变换,提升3D场景理解的开放词汇能力,实验显示其在零样本语义占用预测中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 47 篇

2604.08559 2026-04-13 cs.CL cs.AI 90%

Medical Reasoning with Large Language Models: A Survey and MR-Bench

基于大语言模型的医学推理:综述与MR-Bench

Xiaohan Ren, Chenxiao Fan, Wenyin Ma, Hongliang He, Chongming Gao, Xiaoyan Zhao, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) The First Affiliated Hospital of USTC(中国科学技术大学附属第一医院) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型在医学推理中的应用,提出MR-Bench基准测试,揭示了考试级性能与真实临床任务准确性之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03107 2026-04-13 cs.CL 89%

The Mask of Civility: Benchmarking Chinese Mock Politeness Comprehension in Large Language Models

礼貌的面具:在大型语言模型中基准测试中文虚伪礼貌理解

Yitong Zhang, Yuhan Xiang, Mingxuan Liu

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文从语用学角度评估大型语言模型在识别中文礼貌、不礼貌和虚伪礼貌现象中的表现差异,构建了结合真实和模拟中文话语的三类数据集,并通过六种代表性模型在四种提示条件下进行测试。

Comments Preprint

Journal ref International Conference in Applied Language Sciences (ALS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09029 2026-04-13 cs.CL cs.AI 88%

CONDESION-BENCH: Conditional Decision-Making of Large Language Models in Compositional Action Space

CONDESION-BENCH:大语言模型在组合动作空间中的条件决策

Yeonjun Hwang, Sungyong Park, Minju Kim, Dongha Lee, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CONDESION-BENCH基准,用于评估大语言模型在组合动作空间中的条件决策能力,通过引入变量、上下文和分配层级的显式条件限制,提升决策质量评估的严谨性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08884 2026-04-13 cs.CV cs.AI 88%

HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing

HM-Bench:多模态大语言模型在高光谱遥感中的综合基准

Xinyu Zhang, Zurong Mai, Qingmei Li, Zjin Liao, Yibin Wen, Yuhang Chen, Xiaoya Fan, Chan Tsz Ho, Bi Tianyuan, Haoyuan Liang, Ruifeng Su, Zihao Qian, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-sen University(中山大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) Southwest University(西南大学) National Supercomputing Center in Shenzhen(国家超级计算深圳中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出HM-Bench,首个用于评估多模态大语言模型在高光谱图像理解中的基准,通过构建19337对问题-答案对,探索模型在处理高维高光谱数据中的挑战,揭示视觉输入在空间-光谱推理中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16165 2026-04-13 cs.SE cs.AI cs.HC 88%

Investigating Multimodal Large Language Models to Support Usability Evaluation

探究多模态大语言模型以支持可用性评估

Sebastian Lubos, Alexander Felfernig, Damian Garber, Gerhard Leitner, Julian Schwazer, Manuel Henrich

机构 * Graz University of Technology(格拉茨技术大学) University of Klagenfurt(克拉根福大学) UNiQUARE Software Development GmbH(UNiQUARE软件开发有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文探讨了多模态大语言模型在可用性评估中的应用,通过优先级问题框架识别并排名可用性问题,比较了MLLM与专家评估结果,展示了交互可视化工具,并提出整合MLLM评估到实际开发流程的概念。

Comments To appear in the Proceedings of IEA/AIE 2026, Springer LNAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10277 2026-04-13 physics.comp-ph physics.optics 87%

MCP-Enabled LLM for Meta-optics Inverse Design: Leveraging Differentiable Solver without LLM Expertise

基于MCP的LLM用于元光学逆向设计:无需LLM专业知识即可利用可微求解器

Yi Huang, Bowen Zheng, Yunxi Dong, Hong Tang, Huan Zhao, S. M. Rakibul Hasan Shawon, Sensong An, Hualiang Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出MCP框架,利用LLM生成逆向设计代码,通过动态访问验证代码模板和文档提升设计质量与效率,展示如何使复杂工具对非编程专家可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09240 2026-04-13 cs.LG 85%

DiffHLS: Differential Learning for High-Level Synthesis QoR Prediction with GNNs and LLM Code Embeddings

DiffHLS: 基于GNN和LLM代码嵌入的高阶综合QoR预测差分学习

Zedong Peng, Zeju Li, Qiang Xu, Jieru Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 DiffHLS通过GNN和LLM代码嵌入预测高阶综合QoR,利用核基线与pragma插入设计变体的差分学习,降低合成成本,实验显示在PolyBench上优于GNN基线,且在ForgeHLS数据集上验证了可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08779 2026-04-13 cs.LG 85%

Adaptive Simulation Experiment for LLM Policy Optimization

面向LLM策略优化的自适应模拟实验

Mingjie Hu, Siyang Gao, Jian-qiang Hu, Enlu Zhou

机构 * School of Management, Fudan University(复旦大学管理学院) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H. Milton Stewart工业与系统工程系) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于配对比较的自适应模拟实验框架,用于从有限候选策略中识别最优策略。通过无结构和有结构策略空间,推导最优采样比例并证明算法在统计保证下达到基本数据要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09163 2026-04-13 cs.DB 85%

Evaluating Data Quality Tools: Measurement Capabilities and LLM Integration

评估数据质量工具:测量能力与LLM集成

Tobias Rehberger, Thomas Hütter, Lisa Ehrlinger, Wolfram Wöß

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文评估了六种数据质量工具,分析其测量能力与LLM集成程度,发现专有工具更全面,但开源工具需更多实施努力。LLM在数据验证中尚未被支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09418 2026-04-13 cs.CL cs.LG 84%

Automated Instruction Revision (AIR): A Structured Comparison of Task Adaptation Strategies for LLM

自动化指令修订(AIR):一种针对大语言模型任务适应策略的结构化比较

Solomiia Bilyk, Volodymyr Getmanskyi, Taras Firman

机构 * Eleks Ltd.(Eleks有限公司) Ukrainian Catholic University(乌克兰天主教大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了基于规则归纳的自动化指令修订(AIR)方法,用于在有限任务特定示例下适应大语言模型。通过比较多种适应策略在不同基准测试中的表现,发现任务依赖性显著,无单一方法在所有情况下占优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08947 2026-04-13 cs.CL cs.AI 82%

MuTSE: A Human-in-the-Loop Multi-use Text Simplification Evaluator

MuTSE:一种人机协同的多用途文本简化评估器

Rares-Alexandru Roscan, Gabriel Petre1, Adrian-Marius Dumitran, Angela-Liliana Dumitran

机构 * University of Bucharest(布加勒斯特大学) Universitatea Creștină "Dimitrie Cantemir"(迪米特里耶·坎泰米尔基督教大学) Cu Drag si Sport SRL(Cu Drag si Sport 有限责任公司) Softbinator Technologies(Softbinator 科技公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对LLM文本简化输出的系统性评估难题,MuTSE提出一种人机协同的交互式评估工具,支持多维度的提示-模型组合分析,通过语义对齐引擎和线性偏差启发式算法实现可视化对比,降低定性分析的认知负荷。

Comments Accepted for ITS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08561 2026-04-13 cs.CL cs.LG 81%

A Representation-Level Assessment of Bias Mitigation in Foundation Models

基础模型中偏见缓解的表示层面评估

Svetoslav Nizhnichenkov, Rahul Nair, Elizabeth Daly, Brian Mac Namee

机构 * IBM Research(IBM研究院) School of Computer Science, University College Dublin(都柏林大学计算机科学学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文通过对比基线与偏见缓解模型,分析了性别与职业术语在嵌入空间中的变化,发现偏见缓解减少了性别-职业差异,提出了WinoDec数据集用于评估解码器模型。

Comments Accepted at ECML-PKDD 2025 (5th Workshop on Bias and Fairness in AI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08553 2026-04-13 cs.LG cs.AI cs.CL 80%

GNN-as-Judge: Unleashing the Power of LLMs for Graph Learning with GNN Feedback

GNN-as-Judge: 通过GNN反馈释放LLM在图学习中的潜力

Ruiyao Xu, Kaize Ding

机构 * Northwestern University(西北大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GNN-as-Judge框架,通过结合GNN的结构归纳偏差,解决LLM在低资源条件下生成可靠伪标签和缓解标签噪声的问题,提升图学习性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27141 2026-04-13 cs.CL 79%

Routing Sensitivity Without Controllability: A Diagnostic Study of Fairness in MoE Language Models

在不可控性之外的路由敏感性:MoE语言模型中公平性的诊断研究

Junhyeok Lee, Kyu Sung Choi

机构 * Interdisciplinary Program in Cancer Biology, Seoul National University College of Medicine(首尔大学医学院癌症生物学跨学科项目) Department of Radiology, Seoul National University Hospital(首尔大学医院放射科) Department of Radiology, Seoul National University College of Medicine(首尔大学医学院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔大学医院医疗AI研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究探讨了MoE模型在路由层面的敏感性及其对公平性控制的限制,提出FARE框架揭示路由偏好变化的不可行性、非鲁棒性和高代价,指出解码生成中偏好转移的缺失,揭示专家组中偏见与核心知识的交织问题。

Comments 10 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07220 2026-04-13 cs.CL 79%

The Roots of Performance Disparity in Multilingual Language Models: Intrinsic Modeling Difficulty or Design Choices?

多语言语言模型性能差异的根本原因:内在建模难度还是设计选择?

Chen Shani, Yuval Reif, Nathan Roll, Dan Jurafsky, Ekaterina Shutova

机构 * Stanford University(斯坦福大学) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文探讨多语言模型性能差异的根源,分析语言差异是否源于建模选择而非语言固有复杂性,并提出改进设计以实现更平衡的多语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08602 2026-04-13 cs.DL cs.AI cs.LG 79%

TiAb Review Plugin: A Browser-Based Tool for AI-Assisted Title and Abstract Screening

TiAb Review Plugin:一种基于浏览器的AI辅助标题和摘要筛选工具

Yuki Kataoka, Masahiro Banno, Michihito Kyo, Shuri Nakao, Tomoo Sato, Shunsuke Taito, Tomohiro Takayama, Takahiro Tsuge, Yasushi Tsujimoto, Ryuhei So, Toshi A. Furukawa

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于浏览器的无代码、无服务器AI辅助标题和摘要筛选工具,结合大语言模型和机器学习主动学习,实现了高效的系统综述筛选。

Comments 25 pages, 2 figures. Abstract submitted to Cochrane Colloquium 2026. Code: https://github.com/youkiti/tiab-review-plugin

详情

展开后加载摘要…

URL PDF HTML 收藏