arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-29 至 2026-05-29 共收录 535 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 125 篇

2605.30329 2026-05-29 cs.LG 86%

SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones?

SoundnessBench:你的AI科学家真的能区分好的研究想法和坏的吗?

Sy-Tuyen Ho, Minghui Liu, Huy Nghiem, Furong Huang

机构 * University of Maryland College Park(马里兰大学College Park分校)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出SoundnessBench基准,通过ICLR提交的1099个机器学习研究提案评估LLM判断研究想法方法论合理性的能力,发现当前LLM存在普遍乐观偏差,无法可靠作为科学严谨性的独立初筛评估者。

Comments Project Page: https://hosytuyen.github.io/projects/SoundnessBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06322 2026-05-29 cs.LG 86%

SMolLM: Small Language Models Learn Small Molecular Grammar

SMolLM: 小型语言模型学习小型分子语法

Akhil Jindal, Harang Ju

机构 * Carey Business School Johns Hopkins University(约翰霍普金斯大学Carey商学院)

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.LG

AI总结 本文提出SMolLM,一个53K参数的小型权重共享Transformer,通过固定层次结构学习SMILES语法,在ZINC-250K数据集上以95%的有效性生成分子,优于参数多10倍的GPT模型。

Comments 19 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18416 2026-05-29 cs.SD 86%

SegTune: Structured and Fine-Grained Control for Song Generation

SegTune:歌曲生成的结构化与细粒度控制

Pengfei Cai, Joanna Wang, Haorui Zheng, Xu Li, Zihao Ji, Teng Ma, Zhongliang Liu, Chen Zhang, Pengfei Wan

机构 * Kuaishou Technology(快手科技)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出非自回归框架SegTune,通过段级局部描述和全局提示实现歌曲的结构化可控生成,并引入基于LLM的时长预测器实现精确的歌词-音乐对齐。

Comments This technical report was later revised and published at ACL 2026 (oral). ACL paper link: https://openreview.net/forum?id=FKf2S4u8at , code: https://github.com/KlingAIResearch/SegTune

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01162 2026-05-29 cs.LG cs.AI cs.CL 86%

Bridging the Semantic Gap for Categorical Data Clustering via Large Language Models

弥合分类数据聚类的语义鸿沟:基于大语言模型的方法

Zihua Yang, Xin Liao, Yiqun Zhang, Yiu-ming Cheung

机构 * School of Computer Science and Technology(计算机科学与技术学院) Guangdong University of Technology(广东技术大学) Department of Computer Science(计算机科学系) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BREVE框架,利用外部知识库的语义嵌入丰富分类属性值,并引入自适应权重平衡原始标识与语义信息,在八个基准数据集上平均ARI排名达1.3。

Comments Accepted to ICPR2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29629 2026-05-29 cs.AI 85%

Beyond Attack Success Rate: Temporal Logit Observability for LLM Safety Failures

超越攻击成功率:LLM安全失效的时间对数可观测性

Junyoung Park, Sunghwan Park, Seongyong Ju, Jaewoo Lee

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出时间对数可观测性(TLO)方法,通过解码过程中的合规-拒绝边际将模型-攻击条件映射到校准的二维平面,揭示攻击成功的时间模式,并基于此设计早期停止规则将成功越狱减少一半以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29685 2026-05-29 cs.AI 84%

NICE: A Theory-Grounded Diagnostic Benchmark for Social Intelligence of LLMs

NICE:一个基于理论的LLM社交智能诊断基准

Yunjin Qi, Zhaojun Jiang, Xuan Wu, Hanxi Pan, Yixuan Wang, Yanfang Liu, Xiang Ji, Churu Yu, Chunyuan Zheng, Yingze Chen, Jie He, Liuqing Chen, Zaifeng Gao

机构 * Department of Psychology and Behavioral Sciences, Zhejiang University(浙江大学心理学与行为科学系) College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院) Human Machine Interaction Lab, Huawei Technologies Co., Ltd.(华为技术有限公司人机交互实验室) Zhejiang Key Laboratory of Neurocognitive Development and Mental Health(浙江省神经认知发展与心理健康重点实验室)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过构建基于社会理论的社交智能框架,提出诊断基准NICE,用于细粒度评估大语言模型在社交交互中的能力弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29555 2026-05-29 cs.CL 84%

From Blind Guess to Informed Judgment: Teaching LLMs to Evaluate Materials by Building Knowledge-Augmented Preference Signals

从盲目猜测到知情判断:通过构建知识增强的偏好信号教会LLM评估材料

Yeyong Yu, Wenya Hu, Xing Wu, Quan Qian

机构 * School of Computer Engineering & Science, Shanghai University(上海大学计算机工程与科学学院) Center of Materials Informatics and Data Science, Materials Genome Institute, Shanghai University(上海大学材料信息与数据科学中心) Key Laboratory of Silicate Cultural Relics Conservation (Shanghai University), Ministry of Education, China(教育部硅酸盐文化 relics 保护重点实验室(上海大学)) Shanghai Institute for Advanced Communication and Data Science, Shanghai University(上海大学高级通信与数据科学研究院)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出知识增强偏好信号框架MaterEval,通过成对偏好数据引导大语言模型从直觉判断转向基于证据的可靠评估,并引入快慢推理方案平衡吞吐量、成本和可靠性,在高熵合金评估中验证了有效性。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04934 2026-05-29 cs.LG 84%

Leak@$k$: Unlearning Does Not Make LLMs Forget Under Probabilistic Decoding

Leak@$k$:在概率解码下,遗忘并未使LLM真正忘记

Hadi Reisizadeh, Jiajun Ruan, Yiwei Chen, Soumyadeep Pal, Sijia Liu, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Michigan State University(密歇根州立大学) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文发现现有大语言模型遗忘方法在概率解码下无法真正删除敏感信息,并提出新指标leak@$k$和算法RULE来评估和缓解知识泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30031 2026-05-29 cs.SD cs.AI cs.CL 84%

Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation

大型音频语言模型中的音频越狱:分类、攻防分析与成本感知评估

Bo-Han Feng, Yu-Hsuan Li Liang, Chien-Feng Liu, You-Hsuan Chang, Yun-Nung Chen

机构 * National Taiwan University(台湾大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了大型音频语言模型中音频越狱攻击与防御的统一分类法和受控实证评估,揭示了声学最佳N攻击暴露了最坏情况下的音频空间漏洞,叙事框架是一种有效的低延迟语义威胁,而现有防御在鲁棒性与良性可用性之间存在权衡。

Comments Submitted to ACL ARR 2026 May

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14754 2026-05-29 cs.SE cs.AI cs.CL 84%

Revisiting the Reliability of Language Models in Instruction-Following

重新审视指令跟随中语言模型的可靠性

Jianshuo Dong, Yutong Zhang, Yan Liu, Zhenyu Zhong, Tao Wei, Chao Zhang, Han Qiu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出可靠@k指标和自动生成相似提示的流水线,构建IFEval++基准,发现当前模型在细微差异提示下性能下降高达61.8%,并探索了三种改进方法。

Comments ACL 2026 main oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21627 2026-05-29 cs.GT cs.AI cs.CY cs.LG 84%

Is Your LLM Overcharging You? Tokenization, Transparency, and Incentives

你的大语言模型是否在过度收费?分词、透明度与激励

Ander Artola Velasco, Stratis Tsirtsis, Nastaran Okati, Manuel Gomez-Rodriguez

机构 * Ander Artola Velasco(1. 阿德纳·阿尔托拉·韦拉斯科) Stratis Tsirtsis(2. 斯特拉蒂斯·蒂尔蒂斯) Nastaran Okati(3. 纳斯塔兰·奥卡蒂)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究当前按token计费机制下,服务提供商可能通过策略性报告token数量来过度收费,并提出按字符线性定价的激励相容机制以消除该财务激励。

Comments Selected as an oral presentation at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30345 2026-05-29 cs.AI cs.CL cs.LG 83%

SchGen: PCB Schematic Generation with Semantic-Grounded Code Representations

SchGen: 基于语义接地代码表示的PCB原理图生成

Qinpei Luo, Ruichun Ma, Xinyu Zhang, Lili Qiu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Microsoft Research Asia(微软亚洲研究院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SchGen,首个从自然语言请求生成可编辑PCB原理图的大语言模型,通过语义接地代码表示将几何驱动问题转化为语义驱动匹配任务,并构建大规模数据集,在连线准确性和功能正确性上显著优于现有方法。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30052 2026-05-29 cs.SE cs.AI cs.CL 82%

REPOT: Recoverable Program-of-Thought via Checkpoint Repair

REPOT:通过检查点修复实现可恢复的思维程序

Parsa Mazaheri

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出 RePoT 方法,通过确定性验证重放和 LLM 调用从验证前缀恢复,以解决 Program-of-Thought 中单个无效动作导致轨迹失效的问题,在多个模型和基准上提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28969 2026-05-29 cs.CL cs.AI cs.HC 82%

Beyond Recall: Behavioral Specification as an Interpretive Layer for AI Personalization

超越回忆:行为规范作为AI个性化的解释层

Aarik Gulaya

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出行为规范作为解释层,通过压缩用户数据为解释性模式,显著提升AI代理对用户意图的表示准确性,减少模型规避,并在解释型问题上优于原始语料和商业记忆系统。

Comments 134 pages, 4 figures. Code, data, judge prompts, and reproduction instructions: github.com/agulaya24/beyond-recall

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29257 2026-05-29 cs.SD 82%

ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood

ChildVox:理解与表征儿童期声音的语音、音频及大型音频语言模型基准

Tiantian Feng, Anfeng Xu, Xuan Shi, Aditya Kommineni, Shakhrul Iman Siam, Megan Micheletti, Zhonghao Shi, Helen Tager-Flusberg, Mi Zhang, Lynn K. Perry, Catherine Lord, Daniel Messinger, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) The Ohio State University(俄亥俄州立大学) University of California, Los Angeles(加州大学洛杉矶分校) Harvard University(哈佛大学) Boston University(波士顿大学) University of Miami(迈阿密大学)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract)

AI总结 提出ChildVox基准,整合17个儿童音频数据集和20多个子任务,评估多种基础模型在儿童生理声、非语言发声、规范音节和口语识别上的性能。

Comments preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30094 2026-05-29 cs.AI cs.GT 81%

PokerSkill: LLMs Can Play Expert-Level Poker without Training or Solvers

PokerSkill: 无需训练或求解器,大语言模型可达到专家级扑克水平

Boning Li, Baoxiang Wang, Longbo Huang

机构 * IIIS, Tsinghua University(清华大学人工智能研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PokerSkill框架,通过规则驱动的技能库约束大语言模型动作,无需训练或求解器即可在扑克中达到接近GTO水平的性能。

Comments 45 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30087 2026-05-29 cs.AI 81%

Selective QA over Conflicting Multi-Source Personal Memory: A Diagnostic Testbed and Method Comparison

冲突多源个人记忆上的选择性问答:诊断性测试平台与方法比较

Tiancheng Yang, Matthias Schonlau, Ilia Sucholutsky

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对多源冲突记忆的选择性问答问题,构建了包含34,560个实例的诊断基准,评估了多种方法,发现结构化融合方法在准确性和选择性上优于纯提示LLM。

Comments 55 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30051 2026-05-29 cs.CL cs.CY 81%

Who Am I? History-Aware Profiles for Student Simulation in Tutoring Dialogues

我是谁?面向辅导对话中学生模拟的历史感知档案

Zhangqi Duan, Shuyan Huang, Alexander Scarlatos, Jaewook Lee, Simon Woodhead, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Eedi

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出历史条件的学生模拟任务,通过强化学习训练档案生成器和模拟器,利用学生历史信息准确预测对话轮次,在数学学习平台数据集上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29893 2026-05-29 cs.AI 81%

Redundant or Necessary? A Benchmark for Detecting Redundant Steps in Agent Trajectories

冗余还是必要?检测智能体轨迹中冗余步骤的基准

Minyang Hu, Bo Yang, Zhinuo Zhou, Jiachen Liang, Guo Jiahao, Yiyang Yin, Xiongwei Han

机构 * Huawei Technologies(华为技术有限公司) Noah Arks’ Lab(Noah Arks实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对LLM智能体轨迹中的冗余步骤检测问题,提出RedundancyBench基准,包含标注轨迹的数据集,并评估三种方法,发现最佳方法仅达到24.88%的检测分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22975 2026-05-29 cs.CL cs.CY 81%

When AI Takes Sides on Questions of Faith: Persistent Asymmetries in AI-Mediated Faith Guidance

当AI在信仰问题上站队:AI介导的信仰指导中持续存在的不对称性

Brett Israelsen, Sheryl Carty, Josh Coates, Nancy Fulda, Julie Park, Pete Whiting

机构 * Brigham Young University

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过测试20个大型语言模型在182个宗教配对中的转换建议,发现模型在宗教转换建议上存在系统性不对称,偏好某些宗教而歧视其他宗教,且该现象在不同模型和测试条件下稳定存在。

Comments w/ persuasive language analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19828 2026-05-29 cs.AI 81%

FormalEvolve: Neuro-Symbolic Evolutionary Search for Diverse Autoformalization

FormalEvolve: 用于多样化自动形式化的神经符号进化搜索

Haijian Lu, Wei Wang, Jing Liu

机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出FormalEvolve,一种结合LLM变异、交叉、补丁修复和符号AST重写的神经符号进化搜索方法,将自动形式化重构为预算测试时搜索,通过维护可编译存档并报告去重语义接受库,在CombiBench和ProofNet上分别达到58.0%和84.9%的SH@100,并提升下游定理证明性能。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29523 2026-05-29 cs.LG 81%

K-FinHallu: A Hallucination Detection Benchmark for Multi-Turn RAG in Korean Finance

K-FinHallu:面向韩语金融多轮RAG的幻觉检测基准

Eunbyeol Cho, Yunseung Lee, Mirae Kim, Jeewon Yang, Youngjun Kwak, Edward Choi

机构 * KAIST AI(KAIST人工智能实验室) Financial Tech Lab(金融科技实验室) KakaoBank Corp(Kakao银行公司)

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出K-FinHallu基准,通过构建多轮对话和层次化幻觉分类,评估LLM在韩语金融RAG中的幻觉检测能力,发现即使最强模型在细粒度金融诊断和合理弃权上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29397 2026-05-29 cs.CL 81%

Revisiting Observation Reduction for Web Agents: Comprehensive Evaluation with a Lightweight Framework

重新审视Web智能体的观察缩减:基于轻量级框架的综合评估

Masafumi Enomoto, Ryoma Obara, Haochen Zhang, Masafumi Oyamada

机构 * NEC Corporation(日本电报电话公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对LLM Web智能体中HTML观察过长的问题,提出基于最小失败集(MFS)的轻量级评估框架,通过覆盖率代理指标大幅加速评估,并优化剪枝程序实现2.2-3.1倍延迟降低同时保持84-89%成功率。

Comments 22 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22504 2026-05-29 cs.AI cs.LG 81%

Estimating the Empowerment of Language Model Agents

估计语言模型代理的赋权能力

Jinyeop Song, Jeff Gore, Max Kleiman-Weiner

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出基于信息论中赋权概念的评估框架EELMA,通过多轮文本交互近似有效赋权,实验表明赋权与任务性能强相关,可作为与任务成功度量互补的通用评估指标。

Comments Published at the International Conference on Machine Learning (ICML) 2026. 9 pages, 9 figures; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28868 2026-05-29 cs.LG cs.AI 81%

TaxDistill: Improving Metagenomic Taxonomic Annotation via Distilled Genomic Foundation Models

TaxDistill:通过蒸馏基因组基础模型改进宏基因组分类注释

Rongye Ye, Lun Li, Zheng Luo, Yiran Zhan, Shuhui Song

机构 * National Genomics Data Center, China National Center for Bioinformation(中国生物信息中心国家基因组数据中心) Beijing Key Laboratory of Intelligent Governance and Application of Biological Big Data, China National Center for Bioinformation(北京生物大数据智能治理与应用重点实验室,中国生物信息中心) Beijing Institute of Genomics, Chinese Academy of Sciences(北京基因组研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出TaxDistill知识蒸馏框架,利用500M参数的基因组基础模型GenomeOcean作为教师网络生成软标签,以减轻初始检索工具引入的标签噪声,从而提升宏基因组序列分类性能。

Comments The manuscript contains 14 pages, 7 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28017 2026-05-29 cs.CR cs.IR 80%

Can It Reach the Generator? Investigating the Survival of Prompt-Injection Attacks in Realistic RAG Settings

它能到达生成器吗?探究真实RAG设置中提示注入攻击的存活情况

Yu Yin, Shuai Wang, Bevan Koopman, Guido Zuccon

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文在真实的三阶段RAG流水线(检索器→LLM重排序器→LLM生成器)中重新评估了七种生成式引擎优化(GEO)攻击,发现基于梯度和指令覆盖的攻击在到达生成器前大多失效,仅LLM驱动的提示注入保持端到端有效,且所有攻击易被轻量级防护检测。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16873 2026-05-29 cs.CV cs.SI 80%

Multimodal LLMs See Sentiment

多模态大语言模型感知情感

Neemias B. da Silva, John Harrison, Rodrigo Minetto, Myriam R. Delgado, Bogdan T. Nassu, Thiago H. Silva

机构 * Universidade Tecnológica Federal do Paraná(联邦技术大学帕拉纳州大学) University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过系统评估研究,探讨多模态大语言模型在图像情感分析中的三种方法,发现基于MLLM描述的两阶段流水线在微调后性能显著优于传统基线。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30151 2026-05-29 cs.AI 79%

Temporal Stability and Few-Shot Prompting in Math Task Assessment

数学任务评估中的时间稳定性和少样本提示

Danielle S. Fox, Brenda L. Robles, Elizabeth DiPietro Brovey, Christian D. Schunn

机构 * Learning Research and Development Center, University of Pittsburgh(匹兹堡大学学习研究与发展中心) Institute for Learning, University of Pittsburgh(匹兹堡大学学习研究所)

专题命中 评测与基准 :prompting(title,abstract);分类 cs.AI

AI总结 本研究通过纵向实验评估AI工具在数学任务认知需求分类中的时间稳定性和少样本提示效果,发现提示工程比模型版本更新更能提升性能。

Comments 23 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24895 2026-05-29 cs.LG 79%

Towards Understanding the Shape of Representations in Protein Language Models

理解蛋白质语言模型中表示的形状

Kosio Beshkov, Anders Malthe-Sørenssen

机构 * Department of Physics(物理系) University of Oslo(奥斯陆大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本研究通过平方根速度表示和图过滤分析蛋白质语言模型(PLM)的表示空间,发现ESM2模型中Karcher均值和有效维度随层数非线性变化,且PLM优先编码残基的局部关系,最忠实于结构的表示出现在模型倒数第二层附近。

Comments Accepted as a poster at ICLR 2026. OpenReview: https://openreview.net/forum?id=Dnn8SSBJaY

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29462 2026-05-29 cs.CV cs.AI 79%

Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset

大型视觉语言模型在CFMME上的基准测试:一个全面的中文金融多模态评估数据集

Qian Chen, Xianyin Zhang, Yanzhi Liu, Lifan Guo, Feng Chen, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(文言金团队,阿里云计算)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出CFMME,一个包含6052个实例的中文金融多模态评估基准,涵盖八种主要金融图像模态和四项核心多模态任务,用于评估LVLMs在金融业务全流程中的感知、理解、推理和认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏