arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-19 至 2026-08-19 共收录 40 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 40 篇

2608.17154 2026-08-19 cs.CR 新提交 91%

Beyond the Hype: Evaluating LLM Integration and Practical Limitations in Security Operation Centers

超越炒作:评估安全运营中心(SOC)中大型语言模型(LLM)的集成与实际局限性

Elnaz Rabieinejad, Ali Dehghantanha, Fattane Zarrinkalam, Sarina Dastgerdy

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过对20位不同类型SOC从业者的半结构化访谈,分析了LLM在SOC中的应用现状、存在的局限性,提出了LLM集成成熟度标准及相关研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17644 2026-08-19 cs.AI cs.CL 新提交 90%

LLM-Derived Preference Judgments Are Not Self-Consistent

大语言模型(LLM)得出的偏好判断不具备自一致性

Matthew T. Ford, Francis Bahk, Jingjing Wang, Adam S. Jovine, Tinghan Ye, David B. Shmoys, Peter I. Frazier

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究发现,用于解读人类偏好的LLM得出的数值化偏好判断存在大量持续不一致性,无法由单一效用函数概括,打破了相关研究的自一致性假设。

Comments 16 pages, 4 figures; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18027 2026-08-19 cs.CL 新提交 90%

Chain-of-Experience for Continual LLM Improvement

用于持续改进大语言模型的经验链(Chain-of-Experience, CoE)

Haoqin Tu, Yunhao Fang, Yizhong Wang, Cihang Xie, Shen Yan

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) Bytedance Seed(字节跳动Seed)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出经验链(CoE)方法,通过迭代交互让LLM从经验中持续改进,在多领域8种LLM上验证其比无反馈基线更优,结合互补反馈可进一步提升,且每令牌准确率高于现有测试时策略。

Comments H.T. and Y.F. contributed to this work equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17443 2026-08-19 cs.AI 新提交 90%

Structure-Internalized Rule Language Model for Faithful Knowledge Graph Reasoning

用于忠实知识图谱推理的结构内化规则语言模型

Xingrui Zhuo, Jiapu Wang, Manzong Huang, Gongqing Wu, Xindong Wu

机构 * Key Laboratory of Knowledge Engineering with Big Data (Hefei University of Technology)(大数据知识工程重点实验室(合肥工业大学)) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息学院) Nanjing University of Science and Technology(南京理工大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 针对大语言模型在知识图谱推理中存在的推理证据感知漂移问题,提出结构内化规则语言模型SIRLM,通过结构规则生成协调知识与参数化知识,在36个数据集上优于17种现有方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08525 2026-08-19 cs.AI cs.CL cs.CY 版本更新 90%

Ads in AI Chatbots? An Analysis of How Large Language Models Navigate Conflicts of Interest

AI聊天机器人中的广告:大型语言模型如何应对利益冲突分析

Addison J. Wu, Ryan Liu, Shuyue Stella Li, Yulia Tsvetkov, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文分析了大型语言模型在面临用户与公司利益冲突时的决策问题,通过实验发现多数模型优先考虑公司利益而非用户福祉,展示了在广告推荐中潜在的风险。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00992 2026-08-19 cs.AI cs.CL cs.CY cs.HC 版本更新 90%

Evidence of conceptual mastery in the application of rules by Large Language Models

大型语言模型在规则应用中展现出概念掌握能力的证据

José Luiz Nunes, Guilherme FCF Almeida, Brian Flanagan

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文通过两项心理学实验发现,Gemini Pro等部分LLMs在规则应用上展现类人表现,证实LLMs掌握规则概念,对法律决策与哲学探究有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17546 2026-08-19 cs.SE 新提交 89%

REST API Testing with Verified LLM-Inferred Dependencies and Response-Driven Refinement

基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试

Tu Nguyen, Thanh Nguyen, Huy Nguyen, Viet Nguyen, Tien N. Nguyen, Vu Nguyen

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。

Comments Submitted to ICSE 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16927 2026-08-19 cs.LG cs.CV 新提交 88%

Hierarchical Data Selection via Manifold Coverage and Sparse Feature Coverage in LLM Post-training

大语言模型后训练中基于流形覆盖与稀疏特征覆盖的分层数据选择

Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu

专题命中 推理与问题求解 :LLM(title,summary_cn);post-training(title);分类 cs.LG

AI总结 本文提出MASS算法,将LLM后训练的数据选择建模为分层覆盖问题,在Vision Flan与LLaVA-CoT上仅用少量数据即可达到或超过全量训练效果,且优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14026 2026-08-19 cs.CE 版本更新 88%

MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning

MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法

Wenjin Liu, Haoran Luo, Fayuan Ke, Zhenghong Lin, Yue Lu, Zhe Cui, Anh Tuan Luu, Carl Yang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03237 2026-08-19 cs.HC cs.AI cs.CL 版本更新 87%

Supporting Calibrated Reliance in Human-AI Collaboration: Different Strategies for Different Tasks

说服悖论:当LLM解释未能提升人机团队表现时

Ruth Cohen, Lu Feng, Ayala Bloch, Sarit Kraus

机构 * Bar-Ilan University(巴伊兰大学) University of Virginia(弗吉尼亚大学) Department of Psychology, Ariel University(阿里尔大学心理学系)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 研究揭示LLM解释在提升人机团队表现上的矛盾效果,通过三组实验发现解释增加信心但未必提升准确性,且可能抑制错误恢复能力,强调需转向校准依赖与有效错误恢复的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17184 2026-08-19 cs.CL 新提交 86%

AISA: AI Safety Assistant Framework for Continuous Improvement of Highway Construction

AISA:用于公路施工持续改进的AI安全助手框架

Mason Smetana, Trevor Neece, Lev Khazanovich

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出AISA框架,基于LLM和文本嵌入模型实现公路施工事故分类、质量评分及相关数据检索,为未来智能体应用提供基础,在OIICS分类和事故检索等任务上取得优于随机水平的效果。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17975 2026-08-19 cs.GR cs.CV 新提交 86%

aDSL: Agentic 3D Creation via Joint Agent-Program Design

aDSL:通过智能体-程序联合设计实现智能体驱动的3D内容创建

Rui-Huan Wang, Si-Tong Wei, Jia-Qi He, Heng-Yi Wei, Baoquan Chen, Peng-Shuai Wang

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究联合设计以智能体为中心的领域特定语言aDSL与角色专业化多智能体系统,通过“规划-执行-评审”循环提升3D内容创建的鲁棒性等,在文本到形状等任务上优于LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17172 2026-08-19 cs.NE 新提交 86%

Automating Parent Selection Configuration in Genetic Programming with Agentic AI

用智能体人工智能实现遗传编程中父代选择配置的自动化

Jose Guadalupe Hernandez, Jui-Hsuan Chang, Anil Kumar Saini, Xi Li, Jason H. Moore

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出智能体AI框架,结合LLM推理与RAG实现遗传编程父代选择配置自动化,经符号回归测试,5 mini--AR配置表现优于锦标赛选择,为进化系统自动化设计提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17301 2026-08-19 cs.AI 新提交 84%

SignalReasoner: Assessing the Upper Bound of 3B Models for Signal Mathematical Reasoning

SignalReasoner:评估3B模型在信号数学推理任务中的上限

Guozheng Sun

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究针对信号数学推理任务,以Qwen2.5-3B-Base为对象,对比两种训练范式与三种强化优化算法,其最佳模型准确率较基准提升超两倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17153 2026-08-19 cs.CL 新提交 81%

Towards Safer RAG: Only Agents Capable of System 2 Thinking may Access Untrusted Documents

迈向更安全的检索增强生成(RAG):仅具备系统2思考能力的智能体可访问不可信文档

Mehrdad Ghassabi

机构 * University of Isfahan(伊斯法罕大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对RAG系统的知识投毒漏洞,提出仅具备系统2推理能力的智能体可访问不可信文档的安全原则,通过实证证明该原则能提升模型对被破坏证据的鲁棒性且无需严格隔离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06474 2026-08-19 cs.CL 版本更新 81%

DataSTORM: Deep Research on Large-Scale Databases using Exploratory Data Analysis and Data Storytelling

DataSTORM:利用探索性数据分析和数据叙事进行大规模数据库的深度研究

Shicheng Liu, Yucheng Jiang, Sajid Farook, Camila Nicollier Sanchez, David Fernando Castro Pena, Monica S. Lam

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DataSTORM通过探索性数据分析和数据叙事,实现对大规模结构化数据库的深度研究,提出基于论点的分析流程,并在InsightBench上取得新的最佳成绩。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20131 2026-08-19 cs.LG cs.AI cs.IT 版本更新 81%

LZ Penalty: An information-theoretic repetition penalty for autoregressive language models

LZ惩罚:一种用于自回归语言模型的信息论重复惩罚项

Antonio A. Ginart, Naveen Kodali, Jason Lee, Caiming Xiong, Silvio Savarese, John R. Emmons

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LZ惩罚,基于LZ77压缩算法,可让开源推理模型用贪婪解码时无退化重复,优于现有频率、重复惩罚。

Comments Post-publication corrections (minor calculation mistakes)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11615 2026-08-19 cs.SE 版本更新 80%

ThinkLog: Leveraging Reasoning for Log Statement Generation

ThinkLog:利用推理进行日志语句生成

Kazuki Kusama, Honglin Shu, Masanari Kondo, Tao Xiao, Yasutaka Kamei

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对现有端到端日志语句生成方法准确性有限的问题,提出ThinkLog,该方法基于LLM,通过将推理融入提示作为少样本示例,引导LLM生成日志语句,在准确率提升15.4%的同时,推理成本约为现有最佳方法的50%。

Comments 16 pages, Accepted at the 26th IEEE International Conference on Software Quality, Reliability, and Security (QRS 2026), Short Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12700 2026-08-19 cs.LG cs.AR cs.DC 版本更新 79%

A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family

面向大语言模型生成的GPU内核的契约级验证器,以及门控线性循环(GDN)族的原生Blackward反向传播算法

Rishi Shah, Rishav Shrestha

机构 * E3A Healthcare(E3A医疗公司)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.LG

AI总结 本文提出契约级GPU内核验证器,发现公开系统接受的2638个机器生成内核中39.5%存在无法修复的错误,还构建了GDN族的原生Blackwell反向传播算法,指出现有内核生成正确性信号被高估。

Comments 20 pages, 3 figures. Also archived at doi: https://doi.org/10.5281/zenodo.21563213

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08748 2026-08-19 cs.RO cs.AI 版本更新 79%

Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT

面向机器人操作的视觉提示:采用带标注引导的拾取与放置方法,基于ACT算法

Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

机构 * Embodied AI Research Team(具身人工智能研究团队) National Institute of AIST(国家信息与系统技术研究所)

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.AI

AI总结 针对便利店机器人拾取放置任务的挑战,提出带标注引导视觉提示的感知-行动流水线,采用ACT算法实现自适应操作,提升了零售环境下的抓取精度与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17146 2026-08-19 cs.RO 新提交 78%

PDDL-ART: Autonomous Symbolic Abstraction From Demonstration For Long-Horizon Robotic Manipulation Using Vision-Language Models

PDDL-ART:基于演示的自主符号抽象方法,用于使用视觉语言模型的长时程机器人操纵

Disha Kamale, Dmitry Berenson

机构 * University of Michigan(密歇根大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 PDDL-ART是一种基于VLM的框架,可自主从演示生成PDDL描述,经多阶段校正确保语义对齐,在发动机维护和家庭操纵任务上平均成功率达93.3%,优于基线规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12982 2026-08-19 cs.AI cs.MA cs.SC 版本更新 77%

FormalAnalyticGeo: A Neural-Symbolic Based Framework for Multimodal Analytic Geometry Problem Generation

形式分析几何:一种基于神经符号的多模态解析几何问题生成框架

Ruoran Xu, Wending Gao, Xiaoqing Kang, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究解析几何问题生成,提出基于神经符号的FormalAnalyticGeo框架,利用CDL及四个大语言模型组件,无需人工注释自动生成问题,形成闭环,生成的AnalyticGeo7K数据集问题误差小,框架和数据集将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21802 2026-08-19 cs.CL 版本更新 74%

When to Plan, When to Polish: Noise Level as a Granularity Axis for Diffusion Language Models

何时规划,何时精炼:噪声水平作为扩散语言模型的粒度轴

Peihong Li, Yuanjie Shi, Yan Yan

机构 * Washington State University(华盛顿州立大学)

专题命中 推理与问题求解 :language model(title);分类 cs.CL

AI总结 提出噪声依赖粒度控制(NDGC)方法,通过噪声水平调节训练和推理的粒度,实现从粗到细的去噪,无需显式规划器或层次结构,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17938 2026-08-19 cs.CL cs.AI 新提交 73%

Grading Needs a Rubric, Not Intelligence

评分需要评分标准,而非智能

Jhen-Ke Lin

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出any-to-bench设计原则,证实小型语言模型依据明确评分标准评分的可靠性与高成本模型相当,评分标准中的官方答案是关键,可将评分与评分者智能解耦。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17895 2026-08-19 cs.CL cs.AI 新提交 73%

BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models

BEAR-Bench:面向多模态模型的双语企业与学术推理基准

Liubov Chubarova, Alexandra Kuleshova, Daniil Volkov, Kirill Sultanov, Alexey Zaytsev

机构 * Yandex Applied AI Institute(Yandex应用人工智能研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对多模态大语言模型在文本密集专业文档推理能力评估的不足,推出英俄双语的BEAR-Bench基准,评估16个多模态大语言模型并对比幻觉检测方法,发现最强模型仍有明显性能提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17253 2026-08-19 cs.LG cs.AI cs.CV 新提交 73%

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

Co-RL:多智能体强化学习中多样群体涌现的无监督推理

Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi, Ziang Xiao, Nuno Vasconcelos, Yijiang Li

机构 * University of Exeter(埃克塞特大学) ByteDance(字节跳动) Johns Hopkins University(约翰斯·霍普金斯大学) UC San Diego(加州大学圣迭戈分校)

专题命中 推理与问题求解 :LLM(abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出Co-RL框架,通过参数不共享的多智能体协作训练,利用同伴奖励减少对真实标注的依赖,提升纯文本及多模态任务的推理性能,缓解训练崩溃与响应同质化问题。

Comments 30 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20560 2026-08-19 cs.LG cs.AI 版本更新 73%

How Transparent is DiffusionGemma?

DiffusionGemma 的透明度如何?

Joshua Engels, Callum McDougall, Bilal Chughtai, Janos Kramar, Senthooran Rajamanoharan, Cindy Wu, Arthur Conmy, Asic Q Chen, Jean Tarbouriech, Min Ma, Brendan O'Donoghue, João Gabriel Lopes de Oliveira, Rohin Shah, Neel Nanda

机构 * Google(谷歌)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究DiffusionGemma在连续潜空间中的推理透明度,通过变量透明度和算法透明度分解,发现可解释的令牌瓶颈将不透明串行深度降至Gemma 4的1.1倍,并揭示扩散特有现象。

Comments 20 main text pages and 6 pages of references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17834 2026-08-19 cs.HC cs.AI 新提交 70%

AdaLens: Interactive Storyline for Monitoring and Steering Long-Running Agentic Data Analysis

AdaLens:用于监控和引导长时间运行的智能体数据分析的交互式故事情节

Yangtian Liu, Yan Miao, Shuhan Liu, Yunfan Zhou, Dae Hyun Kim, Di Weng, Yingcai Wu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长时间智能体数据分析的传统界面无法满足可观测性与可引导性需求,本文提出交互式系统AdaLens,结合故事情节表示与引导交互,经案例及用户研究验证其能有效支持分析师监控与引导此类分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17164 2026-08-19 cs.LG 新提交 70%

SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting--Extended Version

SCENARIODIFF:面向多模态时间序列预测的场景级引导框架——扩展版

Tuan-Binh Tran, Dat Nguyen Cong, Duc-Trong Le, Thanh Trung Huynh, Tung Kieu

机构 * VinUniversity FPT Software AI Center, FPT Corporation(FPT软件AI中心,FPT集团) VNU University of Engineering and Technology(VNU工程技术大学) Aalborg University(奥尔堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对现有多模态时间序列预测方法上下文影响难解释控制的问题,提出SCENARIODIFF分层框架,通过三类智能体生成结构化信号引导多模态扩散Transformer,锚点混合采样优化轨迹,在Time-MMD基准的事件驱动领域表现优异。

Comments 10 pages. An extended version of "SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting" accepted at ICDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09106 2026-08-19 cs.CL 版本更新 70%

LexKairos: Benchmarking Legal Temporal Capabilities in LLMs

LexKairos:评估大型语言模型的法律时间能力基准

Chenyang Li, Zejia Feng, Yuqin Huang, Yuxiao Ye, Huiyuan Xie

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出LexKairos基准,评估LLMs的中文法律时间能力,经多设置测试发现Gemini-3-Flash表现最优,但现有模型在时间敏感任务上仍存局限,相关能力待提升。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏