arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 878 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 154 篇

2605.08441 2026-05-12 cs.LG cs.AI 62%

DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards

DUET:基于可验证奖励的强化学习中优化令牌预算分配

Haoyu Hu, Xuandong Zhao, Xuhai "Orson'' Xu, Nori Jacoby

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 DUET通过联合调整令牌预算分配的两个维度,提升强化学习的推理质量和训练效率,同时在多个基准测试中表现优异,且在预算减少时性能优势扩大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10931 2026-05-12 math.AP cs.LG math.DS 57%

Quantifying Concentration Phenomena of Mean-Field Transformers in the Low-Temperature Regime

量化均场变换器在低温区的集中现象

Albert Alcalde, Leon Bungert, Konstantin Riedl, Tim Roith

机构 * Department of Mathematics(数学系) Friedrich-Alexander-University Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) Institute of Mathematics(数学研究所) CAIDAS University of Würzburg(魏玛大学CAIDAS学院) University of Oxford(牛津大学) Reuben College(雷本学院) CIT School(CIT学院) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 本文研究了低温下均场变换器中token分布的集中现象,通过均场连续性方程和Wasserstein距离分析,证明token在初始分布投影下快速集中并保持亚稳态,揭示了动态在不同时间尺度下的终端阶段特性。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10366 2026-05-12 cs.AI 57%

EGL-SCA: Structural Credit Assignment for Co-Evolving Instructions and Tools in Graph Reasoning Agents

EGL-SCA:图推理代理中协同指令与工具的结构信用分配

Zike Yuan, Yukun Cao, Han Zhang, Jianzhi Yan, Le Liu, Cai ke, Yue Yu, Hui Wang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 本文提出EGL-SCA框架,通过结构信用分配机制协同优化指令与工具,提升图推理代理的结构正确性与执行效率,实验显示其在四个基准测试中达到92.0%的平均成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09622 2026-05-12 cs.CV cs.AI 57%

Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study

任意到任意的3D扩散模型与知识转移:放射治疗计划研究

Yuhan Wang, Zihan Li, Han Liu, Simon Arberet, Martin Kraus, Yuyin Zhou, Florin-Cristian Ghesu, Dorin Comaniciu, Ali Kamen, Riqiang Gao

机构 * UC Santa Cruz(加州大学圣克ruz分校) Siemens Healthineers(西门子医疗) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.AI

AI总结 本文提出DiffKT3D,一种利用预训练视频扩散模型知识的统一Any2Any 3D扩散框架,通过模态特定嵌入实现多临床模态灵活条件化,结合临床导向的强化学习机制,提升放射治疗计划中的剂量预测精度与图像质量。

Comments Accepted by CVPR 2026 main conference. Compare to CVPR version, minor updates here are included (e.g., combine main text and appendix; clarify the timing scenario in appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08815 2026-05-12 cs.LG q-bio.BM q-bio.GN q-bio.QM 57%

MicroFuse: Protein-to-Genome Expert Fusion for Microbial Operon Reasoning

MicroFuse:用于微生物启动子推理的蛋白质到基因组专家融合

Seungik Cho

机构 * Department of Physics and Astronomy, Rice University, Texas, USA(物理与天文学系,里士满大学,德克萨斯州,美国)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 本文提出MicroFuse框架,通过融合蛋白质结构表示和基因组上下文表示,提升微生物启动子预测的准确性。在OG-Operon100K数据集上,MicroFuse在多个评估指标上表现最优,尤其在生物上模糊的情况中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08666 2026-05-12 cs.LG 57%

The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits

无评论强化学习中的取消假设:从结果奖励到令牌信用

Tianhao Cheng, Zeyu Huang, Zihan Qiu, Yu Cheng, Edoardo Ponti, Yinghui Xu, Ivan Titov, Zenglin Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The University of Edinburgh(爱丁堡大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Qwen Team, Alibaba Group(阿里集团Qwen团队) University of Amsterdam(阿姆斯特丹大学)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.LG

AI总结 本文从令牌层面研究无评论强化学习,揭示令牌翻转现象,并提出取消假设,解释令牌层面信用分配机制,通过实验验证该假设并提出改进训练的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10564 2026-05-12 cs.CV cs.RO 50%

DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving

DeepSight: 通过潜在状态预测实现长视距世界建模的端到端自动驾驶

Lingjun Zhang, Changjie Wu, Linzhe Shi, Jiangyang Li, Jiaxin Liu, Lei Yang, Hang Zhang, Mu Xu, Hong Wang

机构 * Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团Amap) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出通过鸟瞰图空间预测连续未来帧的潜在语义特征,实现长视距世界建模,并引入高效适应性文本推理机制提升复杂场景下的驾驶性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10409 2026-05-12 cs.CV 50%

Progressive Photorealistic Simplification

渐进式逼真简化

Adi Rosenthal, Dana Berman, Yedid Hoshen, Ariel Shamir

机构 * Reichman University and Google(里奇曼大学和谷歌) Google Israel(谷歌以色列) Hebrew University and Google(希伯来大学和谷歌) Google(谷歌)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出渐进式语义图像简化框架,通过迭代去除并修补元素保持逼真外观,结合视觉-语言模型和学习验证器实现高效高质量的简化过程,应用于内容感知清理和交互编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09614 2026-05-12 cs.CV 50%

Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning

反射锚点用于长链多模态推理中的传播感知视觉保留

Xuan Gong, Hanbo Huang, Hao Zheng, Yiran Zhang, Wenbin Dai, Weishu Zhao, Shiyu Liang

机构 * Shanghai Jiao Tong University(上海交通大学) Lanzhou University(兰州大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出RAPO方法,通过信息论分析优化视觉传播潜力和局部分支空间,提升长链多模态推理的视觉信息保留效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09534 2026-05-12 cs.CV 50%

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

AUHead: 通过动作单元控制实现逼真的情感谈话头生成

Jiayi Lyu, Leigang Qu, Wenjing Zhang, Hanyu Jiang, Kai Liu, Zhenglin Zhou, Xiaobo Xia, Jian Xue, Tat-Seng Chua

机构 * University of the Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日報網通信內容認知重點實驗室)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出AUHead方法,通过动作单元控制实现逼真的谈话头生成,解决现有方法在情感表达细腻度上的不足。

Comments https://openreview.net/forum?id=dmzlAUkulz&referrer=%5BAuthor%20Console%5D(%2Fgroup%3Fid%3DICLR.cc%2F2026%2FConference%2FAuthors%23your-submissions) Accepted at the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08735 2026-05-12 cs.CV 50%

CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

CollabVR: 基于视觉-语言和视频生成模型的协作视频推理

Joowon Kim, Seungho Shin, Joonhyung Park, Eunho Yang

机构 * KAIST(韩国科学技术院) Kyung Hee University(庆熙大学) AITRICS

专题命中 推理与问题求解 :language model(abstract)

AI总结 CollabVR通过结合视觉-语言模型与视频生成模型,在步骤级实现协作视频推理,提升多步任务性能,并在基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08709 2026-05-12 cs.CV 50%

UniShield: Unified Face Attack Detection via KG-Informed Multimodal Reasoning

UniShield:基于知识图谱的多模态推理统一面部攻击检测

Hongrui Li, Yichen Shi, Hongyang Wang, Yuhao Gao, Hui Ma, Jun Feng, Zitong Yu

机构 * Shijiazhuang Tiedao University(石家庄铁道大学) Shanghai Jiao Tong University(上海交通大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Great Bay University(大贝大学)

专题命中 推理与问题求解 :instruction tuning(abstract)

AI总结 UniShield通过构建面部攻击知识图谱,结合图谱一致推理优化,提升面部攻击检测的准确性和推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08452 2026-05-12 cs.CV 50%

NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics

NICE FACT: 诊断和校准VLMs在运动物理定量推理中的能力

Jian Lan, Zhicheng Liu, Xinpeng Wang, Yuhao Zhou, Haokun Chen, Jiancheng Lv, Barbara Plank, Thomas Seidl

机构 * University of Munich (LMU)(慕尼黑大学(LMU)) Munich Center of Machine Learning(慕尼黑机器学习中心) Sichuan University(四川大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文研究VLMs在运动物理定量推理中的表现,提出NICE和FACT双诊断框架,分析视觉真实性、物理定律理解和时间定位,揭示模型在识别视觉前提和应用物理定律方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 190 篇

2605.10593 2026-05-12 cs.AI cs.CL cs.HC cs.SE 92%

LLARS: Enabling Domain Expert & Developer Collaboration for LLM Prompting, Generation and Evaluation

LLARS:促进领域专家与开发者协作的LLM提示、生成与评估系统

Philipp Steigerwald, Mara Stieler, Jennifer Burghardt, Eric Rudolph, Jens Albrecht

机构 * Technische Hochschule Nürnberg Georg Simon Ohm(图恩-努尔堡技术大学乔治·西蒙·奥姆学院) Faculty of Computer Science, Centre for Artificial Intelligence (KIZ)(计算机科学学院,人工智能中心(KIZ)) Faculty of Social Sciences, Institute for E-Counselling(社会科学学院,电子咨询研究所)

专题命中 评测与基准 :LLM(title,title_cn);prompting(title);分类 cs.CL、cs.AI

AI总结 LLARS通过整合协同提示工程、批量生成和混合评估模块,为构建LLM系统提供端到端流程,提升跨学科协作效率与准确性。

Comments Accepted at IJCAI-ECAI 2026 Demonstrations Track. Demo video: https://youtu.be/3QaKouwr4gU

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08486 2026-05-12 cs.CY 92%

Teachers' Perceived Benefits and Risks of AI Across Fifty-Five Countries: An Audit of LLM Alignment and Steerability

教师对AI在教育中的感知益处与风险:对LLM对齐与可控性的审计

Yan Tao, Olga Viberg, Deepak Varuvel Dennison, Zhikun Wu, René F. Kizilcec

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过分析55国教师对AI的感知益处与风险,评估LLM在教育领域应用的对齐与可控性,揭示模型输出与现实差异,警示LLM不能替代教师直接反馈。

Comments Accepted as full paper to the 13th ACM Conference on Learning @ Scale (L@S'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08305 2026-05-12 cs.LG cs.AI cs.CL cs.PF cs.SE 92%

LLMSYS-HPOBench: Hyperparameter Optimization Benchmark Suite for Real-World LLM Systems

LLMSYS-HPOBench: 为真实世界LLM系统设计的超参数优化基准套件

Siyu Wu, Yulong Ye, Zezhen Xiang, Pengzhou Chen, Gangda Xiong, Tao Chen

机构 * UESTC China(UESTC中国) IDEAS Lab University of Birmingham, UK(IDEAS实验室 英国伯明翰大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LLMSYS-HPOBench,首个针对真实世界LLM系统的超参数优化基准套件,包含大量超参数配置、保真因子和评估指标,旨在验证现有HPO算法并推动AutoML研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10176 2026-05-12 cs.CR cs.AI 92%

When Prompts Become Payloads: A Framework for Mitigating SQL Injection Attacks in Large Language Model-Driven Applications

当提示成为载荷:一种缓解大型语言模型驱动应用中SQL注入攻击的框架

Farzad Nourmohammadzadeh Motlagh, Mehrdad Hajizadeh, Mehryar Majd, Pejman Najafi, Feng Cheng, Christoph Meinel

机构 * Hasso Plattner Institute, University of Potsdam, Germany(波茨坦大学霍斯曼-普拉特研究所, 德国) Chemnitz University of Technology, Chemnitz, Germany(Chemnitz技术大学, Chemnitz, 德国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出一种多层安全框架,通过提示清洗、威胁检测和签名控制层缓解LLM介导的SQL注入攻击,实验表明其在检测精度和误报率方面表现优异。

Comments 11 pages

Journal ref ICAART 2026, 18th Int. Conf. on Agents and Artificial Intelligence, pp. 1380-1390, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26680 2026-05-12 cs.CL cs.AI 92%

AlpsBench: An LLM Personalization Benchmark for Real-Dialogue Memorization and Preference Alignment

AlpsBench: 一个面向真实对话记忆与偏好对齐的LLM个性化基准

Jianfei Xiao, Xiang Yu, Chengbing Wang, Wuqiang Zheng, Xinyu Lin, Kaining Liu, Hongxun Ding, Yang Zhang, Wenjie Wang, Fuli Feng, Xiangnan He

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AlpsBench通过真实人类与LLM对话数据构建,包含2500个长期交互序列及验证的记忆,评估个性化信息提取、更新、检索与利用等核心任务,揭示LLM在记忆管理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09610 2026-05-12 cs.MA cs.AI cs.CE cs.LG cs.PL cs.SE 92%

SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications

SmartEval:一个评估从自然语言规范生成的LLM智能合约质量的基准

Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah

机构 * Columbia University(哥伦比亚大学) IBM T.J. Watson Research Center(IBM T.J. Watson研究院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SmartEval通过9000个生成合约与专家编写的真实实现,结合五维评估标准,验证LLM生成智能合约的质量,并发现逻辑遗漏、状态转换错误等典型故障模式,展示了生成合约在综合评分上比真实实现高出8.29分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16025 2026-05-12 cs.CV cs.MM eess.IV 92%

Context and Pixel Aware Large Language Model for Video Quality Assessment

基于上下文和像素的大型语言模型用于视频质量评估

Wen Wen, Yaohong Wu, Yue Sheng, Neil Birkbeck, Balu Adsumilli, Yilin Wang

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出CP-LLM,通过双视觉编码器和语言解码器同时生成视频质量评分和可解释描述,提升对像素失真敏感度,实验显示其在视频质量评估基准上表现优异。

Comments Accepted to ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10531 2026-05-12 cs.AI 92%

A Reflective Storytelling Agent for Older Adults: Integrating Argumentation Schemes and Argument Mining in LLM-Based Personalised Narratives

为老年人设计的反思性叙事代理:在基于LLM的个性化叙事中整合论证方案和论证挖掘

Jayalakshmi Baskar, Vera C. Kaelin, Kaan Kilic, Helena Lindgren

机构 * Umeå University, Department of Computing Science(乌尔姆大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨了基于知识驱动的LLM叙事是否能支持老年人与数字伴侣的有意义互动。通过整合知识图谱、用户建模、论证理论和论证挖掘,系统在生成叙事时提供指导和检查。研究发现,论证质量与清晰度相关,文化相关性影响使用意愿,而高幻觉风险指标的叙事常被感知为不一致。

Comments Submitted to ACM Transactions on Intelligent Systems and Technology (TIST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10286 2026-05-12 cs.AI 92%

AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks

AgentRx: 一种针对多模态临床预测任务的LLM代理基准研究

Baraa Al Jorf, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM代理在多模态临床预测任务中的表现,发现单代理框架在处理多模态数据和校准方面优于多代理系统,强调了改进多代理协作的重要性。

Comments Accepted at the AHLI Conference on Health, Inference, and Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09350 2026-05-12 cs.AI 92%

CHAINTRIX: A multi-pipeline LLM-augmented framework for automated smart-contract security auditing

CHAINTRIX:一个多管道LLM增强框架用于自动化智能合约安全审计

Gabriela Dobrita, Simona-Vasilica Oprea, Adela Bara

机构 * Bucharest University of Economic Studies(布加勒斯特经济大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CHAINTRIX通过结合LLM与确定性结构表示,提升智能合约审计效率,检测86/120高危漏洞,召回率71.7%,优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09227 2026-05-12 cs.CL 92%

Two Ways to De-Bias an LLM-as-a-Judge: A Continuous-Score Comparison of Hierarchical Bayesian Calibration and Neural-ODE Score Transport

用LLM作为裁判的两种去偏方法:对分层贝叶斯校准和神经ODE分数传输的连续分数比较

Andrea Morandi

机构 * Cisco(思科)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了两种校正方法以减少LLM作为裁判的偏见,发现数据预算决定了方法选择,两种方法在不同锚点数量下表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23025 2026-05-12 cs.CL cs.AI 91%

LENS: LLM-Enabled Narrative Synthesis for Mental Health by Aligning Multimodal Sensing with Language Models

LENS:通过对齐多模态传感与语言模型实现LLM赋能的叙事合成用于心理健康

Wenxuan Xu, Arvind Pillai, Subigya Nepal, Amanda C Collins, Daniel M Mackin, Michael V Heinz, Tess Z Griffin, Nicholas C Jacobson, Andrew Campbell

机构 * Dartmouth College(达特茅斯学院) University of Virginia(弗吉尼亚大学) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

专题命中 评测与基准 :LLM(title,title_cn);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LENS框架,通过将多模态传感数据与语言模型对齐,生成临床相关的心理健康叙述。该方法构建大规模数据集并训练补丁级编码器,提升对长时序传感器数据的处理能力,实验显示其在自然语言处理指标和症状严重性准确性上优于基线模型。

Comments Camera-ready version. Additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08590 2026-05-12 cs.HC cs.AI cs.CL cs.CY 91%

Causal Stories from Sensor Traces: Auditing Epistemic Overreach in LLM-Generated Personal Sensing Explanations

从传感器轨迹中生成因果故事:审计LLM生成的个人传感解释中的知识过度延伸

Shanshan Zhu, Han Zhang, J. Doris Chi, Subigya Nepal, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) Yale University(耶鲁大学) University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM生成个人传感解释时的知识过度延伸问题,通过分析不同数据集中的异常日场景,发现LLM在缺乏足够证据时仍会做出因果归因,且丰富的上下文无法有效减少这种过度延伸。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10323 2026-05-12 cs.IR 90%

Every Preference Has Its Strength: Injecting Ordinal Semantics into LLM-Based Recommenders

每种偏好都有其强度:将序数语义注入基于LLM的推荐系统

Jiwon Jeong, Donghee Han, Sungrae Hong, Woosung Kang, Mun Yong Yi

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出OSA框架,通过建模用户反馈来显式整合偏好强度,保留序数语义以提升推荐系统性能。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09360 2026-05-12 cs.LG cs.AI cs.CL cs.SE 90%

Your Simulation Runs but Solves the Wrong Physics: PDE-Grounded Intent Verification for LLM-Generated Multiphysics Simulation Code

你的模拟运行但解错了物理:基于PDE的意图验证用于LLM生成的多物理场模拟代码

Zhenghan Song, Yulong Liu, Cheng Wan, Chenjun Li, Lingfu Liu, Yunyi Li, Congcong Yuan

机构 * Cornell University(康奈尔大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于PDE的意图验证方法,用于检查LLM生成的多物理场模拟代码是否符合预期物理,通过确定性重构和比较PDE结构提升代码的意图保真度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01022 2026-05-12 econ.GN cs.AI q-fin.EC 90%

Calibrating Behavioral Parameters with Large Language Models

用大语言模型校准行为参数

Brandon Yee, Pairie Koh

机构 * Management Sciences Lab(管理科学实验室) Yee Collins Research Group(Yee Collins研究组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文利用大语言模型校准行为参数,发现其存在系统性理性偏差,并通过校准方法提升参数稳定性与理论一致性,验证了校准参数在资产定价模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02184 2026-05-12 cs.AI cs.DC cs.PL cs.SE 90%

Leveraging LLMs to Automate Energy-Aware Refactoring of Parallel Scientific Codes

利用LLM自动化能源感知的并行科学代码重构

Matthew T. Dearing, Yiheng Tao, Xingfu Wu, Zhiling Lan, Valerie Taylor

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究LLM能否在经验执行反馈指导下生成能源高效的并行科学代码,提出LASSI-EE框架,通过多阶段迭代方法结合运行时功耗分析、能源感知提示、自纠正反馈循环和LLM作为裁判代理,实现代码重构。

Comments 12 pages, 5 figures, version under review at a peer-reviewed conference

详情

展开后加载摘要…

URL PDF HTML 收藏