跳到正文

技术方向

Agent 智能体 最新动态

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

87 条精选近 30 天 40 条共收录 313 条

更新

精选归档 · 第 5 页

1月10日周三第 81–87 条
  1. Hugging Face Blog70

    使用 Unsloth 和 Hugging Face TRL 实现 2 倍速 LLM 微调

    Hugging Face 团队介绍了由社区开发的轻量级工具 Unsloth,可将 LLM 微调速度提升至 2 倍并降低 40% 内存占用。该工具通过重写 PyTorch 模块为 Triton 内核优化运算,兼容 Llama 和 Mistral 架构,且支持 TRL 训练器套件。

    推荐理由:提供可复现的加速微调方案,实测数据清晰展示了显存与速度优化幅度。

11月6日周一
5月15日周一
4月5日周三
  1. Hugging Face Blog65

    StackLLaMA: 基于 RLHF 微调 LLaMA 模型的实战指南

    Hugging Face 团队开源了 StackLLaMA 模型及 RLHF 训练全流程实现,展示了如何通过监督微调(SFT)、奖励建模(RM)和强化学习(RLHF)让 7B 规模的 LLaMA 模型回答 Stack Exchange 问题。该流程支持使用 LoRA 和 8-bit 量化技术将模型部署在单块 80GB A100 GPU 上,降低了模型对齐训练的硬件门槛。

    推荐理由:原文提供了基于 LLaMA 模型进行 RLHF 训练的完整流水线实现与参数优化策略,适合需要降低模型对齐训练硬件门槛的开发者。

3月23日周四
  1. OpenAI News65

    OpenAI 官方为 ChatGPT 引入插件功能

    OpenAI 官方为 ChatGPT 引入了初步的插件支持。这些专为语言模型设计的工具以安全为核心原则,可帮助 ChatGPT 访问最新信息、运行计算任务或使用第三方服务。

    推荐理由:官方确认ChatGPT支持插件生态,明确了AI通过工具调用实时获取信息和执行任务的可行性路径。

3月9日周四
  1. Hugging Face Blog76

    Hugging Face 发布 trl 与 peft 集成,支持在 24GB 消费级 GPU 上微调 20B 大模型

    Hugging Face 官方发布 trl 与 peft 的集成更新,实现资源受限下的 LLM RLHF 微调。通过 8-bit 矩阵乘法和 LoRA 适配器降低显存占用,在 24GB 的 NVIDIA 4090 GPU 上成功微调 20B 参数量的 gpt-neox 模型,展示了消费级硬件参与大规模模型训练的可能性。

    推荐理由:将 LoRA 与 8-bit 量化结合,让消费级 GPU 承担 20B 模型微调,为资源有限的团队降低 RLHF 落地门槛。

2月10日周五
  1. Hugging Face Blog72

    Hugging Face 发布 PEFT 库实现参数高效微调

    Hugging Face 发布 PEFT 库,集成 LoRA 和 Prompt Tuning 等技术,与 Transformers 和 Accelerate 无缝结合。使用 LoRA 微调 bigscience/T0_3B 模型只需 11GB 显存,且模型权重仅 19MB 即可保存部署,性能接近全量微调。

    推荐理由:官方开源了可插拔的轻量微调库,允许用 MB 级参数文件在消费级显卡上复现全量微调效果,改变了大模型适应下游任务的成本结构。