跳到正文

技术方向

推理能力 最新动态

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

26 条精选近 30 天 8 条共收录 107 条

更新

精选归档 · 第 2 页

9月27日周三第 21–26 条
  1. Mistral AI93

    Mistral 7B 发布

    Mistral AI 发布 Mistral 7B,这是一个 7.3B 参数的大语言模型,采用 Apache 2.0 许可协议,可在本地、HuggingFace、vLLM 等环境中部署使用。

    推荐理由:官方给出 7.3B 模型相对 Llama 2 13B 的推理、代码表现和部署路径,可作为 7B 级开源模型能力对比的参照。

12月9日周五
  1. Hugging Face Blog63

    Hugging Face 详解 RLHF(基于人类反馈的强化学习)原理与开源实现

    RLHF 利用人类反馈直接优化大语言模型,使其对齐复杂的人类价值观。该流程包含预训练语言模型、收集数据并训练奖励模型、使用 PPO 强化学习微调语言模型三个核心步骤。Hugging Face 介绍了当前活跃的开源工具 TRL、TRLX 和 RL4LMs,并梳理了该领域的发展脉络、现存挑战及后续方向。

    推荐理由:将多模型协同训练的复杂机制拆解为三阶段并梳理开源工具,帮助读者建立对RLHF完整管线的实操理解。

9月26日周一
8月17日周三
  1. Hugging Face Blog88

    Hugging Face 团队详解 LLM.int8() 实现大型语言模型 8-bit 矩阵乘法的原理与实践

    Hugging Face 发布技术教程,结合 transformers、accelerate 和 bitsandbytes 库讲解 LLM.int8() 在大模型部署中的应用。文章通过 BLOOM-176B 和 OPT-175B 的测试数据证明,LLM.int8() 能在保持 FP16 推理性能的前提下将显存占用降低 4 倍,且针对小模型(如 T5-3B)的推理延迟优化策略也已同步更新。

    推荐理由:Hugging Face 团队详细拆解了 LLM.int8() 的底层原理与集成实践,读者可借此实现大模型低显存推理的落地。

7月3日周五
  1. Hugging Face Blog62

    Hugging Face 深入解析 Reformer 长序列建模的内存优化技术

    Hugging Face 官方博客通过公式推导和基准测试,详细解释了 Reformer 模型如何在低于 8GB 内存限制下处理 50 万 token 序列。文章重点剖析了 LSH 自注意力、分块前馈层、可逆残差层和轴向位置编码四种核心技术,展示了它们分别如何降低 O(n^2) 内存复杂性和训练时的激活存储压力。

    推荐理由:原文拆解了 Reformer 四大内存优化组件,并给出基准测试数据,帮助读者理解长序列模型的工程实现取舍。

4月18日周三
  1. OpenAI News63

    OpenAI发布进化策略梯度元学习方法

    OpenAI发布了一种名为Evolved Policy Gradients (EPG) 的实验性元学习方法。该方法通过进化学习代理的损失函数来实现在全新任务上的快速训练,使得代理在面对超出其训练机制的测试任务时(如在房间不同侧面寻找物体)也能成功执行。

    推荐理由:介绍了一种通过进化损失函数来加速新任务训练的实验性元学习方法,其核心价值在于揭示了提升智能体快速适应未知环境能力的技术路径。