arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-04 至 2026-08-04 共收录 260 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 56 篇

2608.00711 2026-08-04 cs.AI 新提交 57%

Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations

追踪级联:一种面向科学智能体幻觉的拓扑感知评估框架

Xinshun Feng, Ziqi Miao, Lijun Li, Jing Shao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对科学智能体幻觉的拓扑结构评估缺口,提出SCHEMA框架,通过构建科学概念图等方式评估,发现幻觉集中于知识枢纽、最终准确率与推理轨迹诚实性脱钩,为高风险科学应用提供机制级评估方案。

Comments 36 pages, 7 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00640 2026-08-04 cs.CL 新提交 57%

TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs

TreeProbe:面向大型语言模型文化偏见的藏医药基准测试集

Jin Zhang, Linyu Li, Weili Jiang, Yuqing Cai, Yutong Liu, Guanquecairang, Yongbin Yu, Jingye Cai, Nyima Tashi, Gadeng Luosang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tibet University(西藏大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究针对大型语言模型的藏医药文化偏见问题,构建了首个基于藏医药“医学之树”框架的基准测试集TreeProbe,发现现有模型存在系统性本体漂移,为公平医疗AI开发提供了诊断基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00106 2026-08-04 cs.LG 新提交 57%

Learning Compositional Meta-Routing for Agentic Workflows: An Executable Benchmark

面向智能体工作流的组合式元路由学习:一个可执行基准

Natan Vidra, Alina Kapanova, Arun Kanhai, Spurthi Setty

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一个智能体工作流的可执行基准和感知预算的组合式元路由器,在保留测试集上实现100%成功率,成本比静态策略低43%,但在词汇偏移挑战任务上表现不佳,凸显词汇泛化是主要限制。

Comments 7 pages, 1 figure; AAAI 2027 anonymous submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00008 2026-08-04 cs.AI cs.ET cs.PF 新提交 57%

Energy Efficiency of Locally Deployed LLMs: A Preliminary Quantitative GPU Power Benchmark on Consumer Hardware

本地部署大语言模型(LLMs)的能效:消费级硬件上的初步GPU功耗定量基准测试

Philipp M. Zähl, Anika Hennig

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文针对9款1B至7B参数的开源LLMs,在RTX 4060Ti 16GB GPU上开展能效基准测试,发现模型架构、量化策略等影响能效,gemma3:1b等模型能效最优,7B-Mistral能效最差,还需区分令牌生成模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09757 2026-08-04 cs.CL cs.AI 版本更新 57%

RSRA: Training-Free Probing of Representation Sensitivity for Efficient LoRA Rank Allocation

RSLoRA:通过表示敏感性探测实现LoRA的无训练秩分配

Jiaqi Liu, Haidong Kang, Qihui Zhao, Guo Yu, Jingchao Wang

机构 * Dalian University of Technology(大连理工大学) Northeastern University(东北大学) Hebei Key Laboratory of Marine Perception Network and Data Processing(河北省海洋感知网络与数据处理重点实验室) Nanjing Tech University(南京工业大学) Institute of Intelligent Manufacturing(智能制造研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对LoRA传统秩分配问题,提出RSLoRA,通过激活空间几何及虚拟表示探测机制确定高敏感性模块,无需训练调整和反向梯度,在主流基准测试中优于现有方法,为模型自适应提供高效方案。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23488 2026-08-04 cs.LG 版本更新 57%

Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation

合成轨迹反映真实的奖励黑客行为吗?对监控真实世界代码生成中黑客行为的系统研究

Lichen Li, Hengguang Zhou, Yijun Liang, Tianyi Zhou, Cho-Jui Hsieh

机构 * Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) Arena University of Maryland(马里兰大学) Mohamed bin Zayed University of Artificial Intelligence(莫莫迪 bin Zayed 人工智能大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文研究合成轨迹与真实世界中代码生成奖励黑客行为的差异,通过对比监控器在合成与真实数据上的表现,发现合成数据训练的监控器无法泛化到真实黑客行为,而真实数据训练的监控器对未见过的黑客类型更具泛化能力。

Comments Corrected a typo in the title; no other changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08262 2026-08-04 cs.AI 版本更新 57%

FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use

FinToolBench:评估LLM代理在真实金融工具使用中的表现

Jiaxuan Lu, Kong Wang, Yemin Wang, Qingmei Tang, Hongwei Zeng, Xiang Chen, Jiahao Pi, Shujian Deng, Lingzhi Chen, Yi Fu, Kehua Yang, Xiao Sun

机构 * Shanghai AI Laboratory(上海人工智能实验室) Hunan University(湖南大学) Xiamen University(厦门大学) Tencent(腾讯) UCAS(中国科学技术大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 FinToolBench是首个评估金融工具学习代理真实世界表现的基准,通过760个可执行金融工具和295个严格查询,评估时效性、意图类型和合规性等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21079 2026-08-04 cs.CL 版本更新 57%

SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials

SoM-1K:用于材料力学能力的千题基准数据集

Qixin Wan, Zilong Wang, Jingwen Zhou, Wanting Wang, Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil & Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系) School of Architecture, University of Miami(迈阿密大学建筑学院) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究推出含1065道题的SoM-1K多模态基准,评估8种基础模型的材料力学能力,提出DoI提示策略,发现当前模型表现差,LLMs配DoI优于VLMs配图像,为工程AI提供基准并强调多模态推理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00761 2026-08-04 q-fin.GN q-fin.CP q-fin.PM q-fin.ST q-fin.TR 新提交 50%

AI and Exchange Rate Predictability

人工智能与汇率可预测性

Amin Izadyar

专题命中 推理评测 :reasoning(abstract)

AI总结 本文利用ChatGPT、DeepSeek等生成式AI分析经济数据,解决汇率脱钩难题,构建的交易策略夏普比率超0.7,超额回报显著,且证实泰勒规则是汇率与基本面关联的关键机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01157 2026-08-04 cs.CV 新提交 50%

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos

InteracVid:基于直播聊天视频构建真实交互式视听响应数据集

Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 推理评测 :planning(abstract)

AI总结 该研究提出首个开源大规模交互式视听数据集InteracVid,解决现有生成模型监督信号缺失问题,实验证实其可提升多模态助手的交互规划与响应生成性能,为交互式多模态生成提供关键基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00232 2026-08-04 cs.CV 新提交 50%

Real-Time Visual Obstruction Detection in Surgical Augmented Reality

手术增强现实中的实时视觉遮挡检测

Shih-Chin Yang, Yanming Xiu, Hanting Ye, Qi Chen, Elias Rotondo, Maria Gorlatova

机构 * Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对手术AR虚拟内容遮挡手术器械的问题,提出结合VLM与分割推理的延迟感知流水线,构建伪AR基准,实现87.43%准确率、479 ms延迟,较云端基线降延迟62.90%。

Comments ISMAR 2026 Mecidal Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27637 2026-08-04 cs.CV 版本更新 50%

MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models

MMOOC:多模态大语言模型的上下文外评估综合基准

Wenjie Zhu, Yabin Zhang, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东方理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MMOOC基准,评估多模态大语言模型在上下文偏移场景下的拒绝与作答能力,实验发现当前模型难以平衡可答性与拒绝性,后训练可提升稳健性,该基准将公开。

Comments project page:https://zhuwenjie98.github.io/MMOOC-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27278 2026-08-04 cs.CV 版本更新 50%

OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation

OVEarth-Bench:面向开放词汇地球观测的类别广度与查询多样性评估

Kaiyu Li, Zepeng Xin, Zixuan Jiang, Jing Fu, Lanxuan Xue, Lingyu Zhang, Xiangyong Cao

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出OVEarth-Bench基准,从类别广度与查询多样性两方面扩展开放词汇地球观测评估,经实验发现MLLM类方法性能最优,为该领域未来研究提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00107 2026-08-04 cs.SE 版本更新 50%

The Illusion of Safety: Multi-Tier Verification of AI vs. Human C++ Code

安全的假象:AI与人类C++代码的多层验证

Saif Mahmud, Fadul Sikder, Yuede Ji, Haotian Zhang, Yu Lei

专题命中 推理评测 :reasoning(abstract)

AI总结 提出VULBENCH-CPP基准,通过四层验证发现AI生成C++代码的运行时违规率约为人类代码的两倍,静态分析会因代码长度产生安全假象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15230 2026-08-04 econ.EM 版本更新 50%

EnergyAgentBench: Benchmarking LLM Agents on Live Energy Infrastructure Data

EnergyAgentBench: 在实时能源基础设施数据上评估LLM代理的基准测试

Eliseo Curcio

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出EnergyAgentBench,首个基于实时电力市场数据的LLM代理基准测试,评估数据中心选址、长期投资组合优化等任务,九种模型在1414次运行中表现各异,Claude Sonnet 4.6在整体得分上领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22868 2026-08-04 cs.CV 版本更新 50%

Seeing the Unseen: Towards Training-Free Inspection for Wind Turbine Blades Using Knowledge-Augmented Vision Language Models

看见不可见:基于知识增强视觉语言模型的无训练风机叶片检测方法

Yang Zhang, Qianyu Zhou, Farhad Imani, Jiong Tang

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究提出结合RAG与VLM的零样本风机叶片检测框架,构建多模态知识库,在小样本测试中表现优于基线,为工业检测提供数据高效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 34 篇

2608.01980 2026-08-04 cs.CV cs.AI 新提交 90%

AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning

AdaThinkV:面向令牌高效视频推理的自适应思维

Jingqi Tian, Haoji Zhang, Lin Chen, Hongbo Jin, Haonan Xu, Tianrui Zhu, Xingming Shui, Shilin Ma, Wenjing Yang, Yansong Tang

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01598 2026-08-04 cs.CL cs.AI 新提交 85%

PICTURE: Enhancing Theory-of-Mind in Large Language Models by Revealing, Not Hiding, Characters' Lack of Knowledge

PICTURE:通过揭示而非隐藏角色的知识缺失来增强大语言模型的心智理论能力

Eojin Jeon, SangKeun Lee

机构 * Korea University(高丽大学)

专题命中 其他推理 :chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对大语言模型心智理论推理中事件隐藏导致的性能下降问题,提出PICTURE提示方法,通过在思维链中明确角色知识缺失,使模型在错误信念任务上性能提升7.3%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01017 2026-08-04 cs.CL cs.AI 新提交 81%

Why LLMs Give In: Conversational Factors and Reasoning Behind Medical Sycophancy

大模型为何妥协:医学谄媚背后的对话因素与推理

Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho

机构 * Virginia Tech(弗吉尼亚理工大学) Shanghai Tongren Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属同仁医院) Emory University(埃默里大学)

专题命中 其他推理 :reasoning(title);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究发现医学谄媚是对话属性而非模型属性,通过5个开放权重模型和500个MedQuAD问题的120万次试验,揭示了对话因素对医学谄媚的影响及思维链轨迹的解释。

Comments 21 pages, 7 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03320 2026-08-04 cs.CL cs.AI 版本更新 81%

From We to Me: Theory Informed Narrative Shift with Abductive Reasoning

从‘我们’到‘我’:基于演绎推理的理论指导叙事转变

Jaikrishna Manojkumar Patil, Divyagna Bavikadi, Kaustuv Mukherji, Ashby Steward-Nolan, Peggy-Jean Allin, Tumininu Awonuga, Joshua Garland, Paulo Shakarian

机构 * Syracuse University(苏塞克斯大学) Arizona State University(亚利桑那州立大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于演绎推理和社会科学理论的神经符号方法,用于改进大型语言模型的叙述转变能力,在多个模型上实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01664 2026-08-04 cs.CV cs.LG 新提交 80%

FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering

FAU参加2026年ImageCLEF多模态推理任务:鲁棒候选评分与简洁多语种视觉问答

Mohamed Basem, Vincent Christlein

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔兰根-纽伦堡大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 FAU提交的多模态推理系统,未做任务特定模型训练,在2026年ImageCLEF竞赛中,获Visual MCQ第三名、Visual OpenQA第一名,凸显推理工程的实用价值。

Comments 16 pages, 3 figures, 7 tables. CLEF 2026 Working Notes, ImageCLEF 2026 Multimodal Reasoning Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00542 2026-08-04 cs.LG 新提交 79%

Agentic Graph Token Reasoning

智能体图令牌推理

Zhuoyi Peng, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本研究提出智能体图令牌推理,将图令牌化融入推理过程,通过三阶段训练实现,在七个图领域评估中大幅优于基线,可零样本迁移至未见领域,推动图分析向智能体范式发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01210 2026-08-04 cs.AI 版本更新 77%

Knowledge Graph Augmented Large Language Models for Disease Prediction

基于知识图谱的大型语言模型用于疾病预测

Ruiyu Wang, Tuan Vinh, Ran Xu, Yuyin Zhou, Jiaying Lu, Francisco Pasquel, Mohammed K Ali, Carl Yang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Division of Medical Sciences, Oxford University(牛津大学医学系) Department of Computer Science and Engineering, UCSC(UCSC计算机科学与工程系) Nell Hodgson Woodruff School of Nursing, Emory University(埃默里大学内尔·霍根·伍德鲁夫护理学院) School of Medicine, Emory University(埃默里大学医学院) Rollins School of Public Health, Emory University(埃默里大学罗林斯公共卫生学院)

专题命中 其他推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出基于知识图谱的大型语言模型框架,用于提升疾病预测的准确性与解释性,通过构建时间一致的推理依据,在多个数据集上取得优于经典基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01585 2026-08-04 cs.CL cs.LG 新提交 62%

Semantic Alignment of AI Models: Concept Collapse, Checkpoint Dynamics, and Cross-Lingual Transfer

AI模型的语义对齐:概念坍缩、检查点动态与跨语言迁移

Tyler Ashoff, Jordan Rodu

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对语言模型基准测试的难点,提出用拓扑方法将模型高维嵌入空间与可解释基线严格比较,以实现多模态对齐,追踪模型适应并测试跨语言短语理解。

Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27553 2026-08-04 cs.AI cs.CL econ.GN q-fin.EC 版本更新 62%

AI and Its Impact on Creativity and Diversity: An Empirical Study of LLM-Generated Product Ideas

使用大型语言模型进行创新中的创意生成

Christian Terwiesch, Lennart Meincke, Karan Girotra, Ethan Mollick, Gideon Nave, Karl T. Ulrich

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究对比人类与GPT-4生成的大学生适用低价新产品创意,发现AI生成创意平均购买意向更高、跻身前10%的概率是人类的7倍,但新颖性较低,少样本提示效果略优于零样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06160 2026-08-04 cs.CL cs.AI 版本更新 62%

LongCrafter: Towards Diverse Long-Context Understanding via Evidence-Graph-Guided Instruction Synthesis

LongCrafter:通过证据图引导的指令合成实现多样化的长上下文理解

Chenhao Yuan, Yinhao Xu, Shuwen Xu, Xizhi Yang, Jiaxiang Liu, Chenxi Zhou, Shaoping Huang, Haolin Ren, Pengfei Cao, Jun Zhao, Kang Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有长上下文理解方法的局限,提出LongCrafter框架,结合分层任务分类法与证据管道,生成多样化长上下文SFT数据,微调后的模型在多个数据集上表现优异,能有效缓解“中间迷失”问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30363 2026-08-04 q-fin.CP cs.AI cs.LG q-fin.ST 版本更新 62%

Enhancing Regime Shift Detection Using Unstructured Data: A Study on the Treasury Market

利用非结构化数据增强制度转换检测:国债市场研究

Mingxuan Yi, Vidal Mehra, Jing Chen, John Cartlidge

机构 * School of Engineering Mathematics and Technology, University of Bristol, UK(布里斯托大学工程数学与技术学院) Propellant Digital B.V., Amsterdam, Netherlands(荷兰阿姆斯特丹Propellant Digital公司) School of Mathematics, Cardiff University, UK(卡迪夫大学数学学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种结合大语言模型推理与统计检验的文本增强型制度转换检测框架,在国债市场数据上实现F1=0.82,优于纯数据驱动方法。

Comments 9 pages, 4 figures. Selected for Long Oral presentation at the International Symposium on Large Language Models for Financial Services (FinLLM@IJCAI 2026), Bremen, Germany, 15 August 2026 (non-archival). Code available at: https://github.com/mingxuan-yi/regime_shift

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15607 2026-08-04 cs.CL cs.LG 版本更新 62%

Syntax Without Semantics: Teaching Large Language Models to Code in an Unseen Language

无语义的语法:教大语言模型在未见过的语言中编程

Vinayshekhar Bannihatti Kumar, Disha Makhija, Manoj Ghuhan Arivazhagan, Rashmi Gangadharaiah

机构 * AWS AI Labs(AWS人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨大语言模型在未见过的语言中生成代码的能力,发现微调仅能教授语法而无法转移语义能力,揭示了推理与语言实现之间的鸿沟。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00099 2026-08-04 q-bio.GN cs.AI 新提交 57%

LLMBDC: Language Model for Biological Domains Oriented Clustering of Gene Ontology

LLMBDC:面向生物域的基因本体聚类语言模型

Ximing Ran, Jie Xu, Peng Jin, Zhaohui Qin, Zhexing Wen, Jiaying Lu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对GO富集分析的术语冗余问题,提出无需训练的LLMBDC框架,利用LLM零样本推理聚类GO术语为生物域,在AD和FXS数据集上较基线方法显著提升了聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01458 2026-08-04 cs.CL 新提交 57%

PALMs: Using Multi Construct-Grounded Rationales for Modeling Population Preferences in LLMs

PALMs:使用多构造基础理由对大语言模型中的群体偏好进行建模

Priyanka Dey, Brihi Joshi, Preyashi Poddar, Jieyu Zhao, Emilio Ferrara

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出了群体对齐语言模型PALMs,通过结合心理与文化构造的理由进行偏好调优,在多维度评估中优于基准模型,且下游任务泛化能力强

详情

展开后加载摘要…

URL PDF HTML 收藏