OpenAI 发布 GPT-5.3-Codex
OpenAI 发布 GPT-5.3-Codex,定位为 Codex 原生智能体,兼具前沿编码能力与通用推理能力,用于支持长程真实技术工作。
推荐理由:官方直接给出新模型定位,读者可据此判断其面向的长程技术任务场景。
技术方向
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
36 条精选近 30 天 12 条共收录 102 条
OpenAI 发布 GPT-5.3-Codex,定位为 Codex 原生智能体,兼具前沿编码能力与通用推理能力,用于支持长程真实技术工作。
推荐理由:官方直接给出新模型定位,读者可据此判断其面向的长程技术任务场景。
OpenAI 发布了用于嵌入 Codex 智能体的 Codex App Server。该服务基于双向 JSON-RPC API,支持流式进度反馈、工具使用、审批和差异对比功能。
推荐理由:官方解释了 Codex App Server 的底层机制,提供了构建双向通信架构的技术参考。
OpenAI 发布面向 macOS 的 Codex 应用,作为 AI 编码和软件开发的指挥中心。该应用支持多智能体、并行工作流和长时运行任务。
推荐理由:官方给出了 Codex 应用的核心定位和关键能力,读者可以据此判断其多智能体并行工作流对长任务编码的影响。
OpenAI 发布 GPT-5 系统卡增补,介绍专为 Codex 中 Agentic 编码优化的模型 GPT-5-Codex。该模型能根据任务复杂度动态调整推理投入,对简单查询快速响应,对复杂任务则独立工作更长时间。
DeepSeek-V3 0324 模型发布,其性能在 MMLU-Pro、GPQA 和 AIME 等基准上均优于前代版本,整体能力接近 GPT-4.5 并超过 Claude Sonnet 3.7。
推荐理由:给出了DeepSeek-V3 0324的基准对比与优化方法推测,并提供了量化和部署指引。
本教程演示如何使用 LM Studio 和 VS Code 扩展 Continue.dev,在本地部署并调用开源模型 OlympicCoder 7B 作为编码助手。
推荐理由:文章给出了在本地运行 OlympicCoder 7B 的完整集成流程,帮读者把开源模型接入现有开发工具。
Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。
推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。
Hugging Face 和 BigCode 团队发布 StarCoder2-15B-Instruct-v0.1,这是一个完全基于自生成数据(self-aligned)训练的代码语言模型,其 HumanEval 得分达 72.6。该模型训练过程完全透明,不依赖 GPT-4 等专有模型的蒸馏数据,并已在 LiveCodeBench 上展现出优于使用 GPT-4 蒸馏数据微调模型的代码生成能力。
推荐理由:该模型完全通过自生成数据实现指令微调,证明不依赖外部教师模型也能获得强代码能力,并开源了全流程。
Meta 发布开源 Llama 3,提供 8B 和 70B 参数的 base 及 instruct-tuned 版本,并配套发布安全微调模型 Llama Guard 2。
推荐理由:提供了 Llama 3 的完整评测数据与 Hugging Face 生态集成指南,方便开发者快速部署和微调该模型。
Google 发布了 CodeGemma 模型,包含 2B、7B 和 7B Instruct 三种版本,专为代码生成、补全和推理设计。CodeGemma 7B 在 Python、JavaScript 和 C++ 的 HumanEval 评测中表现优于其他 7B 模型,但在中文代码方面尚未测试。
推荐理由:三个模型直接开源可下载,附 transformers 代码和量化部署方案,方便读者在本地复现。
BigCode 发布 StarCoder2 系列开源编码大模型,包含 3B、7B、15B 三个规格,全部基于新的 The Stack v2 代码数据集训练并同步开放模型、数据集与训练代码。
推荐理由:原文给出了三代模型规格与数据集规模,读者可以据此判断它与现有开源编码模型之间的定位差异。
Hugging Face 发布教程,演示如何基于 bigcode/starcoder 微调个人代码助手 HugCoder,使用 Hugging Face GitHub 组织公开仓库作为训练数据。
推荐理由:原文完整展示了从 GitHub 仓库提取代码到 QLoRA 与全量微调 StarCoder 的流程,并提供了 1B 模型在本地 M1 芯片运行的可复现步骤。
Hugging Face 发布 Code Llama 家族模型,提供 7B、13B 和 34B 参数版本及其 Python 特化与指令微调变体。基于 Llama 2 并经过 500B tokens 代码数据训练,支持 16k 上下文扩展至 100k。
推荐理由:展示了 Code Llama 在 Hugging Face 生态中的完整部署与微调路径,为工程师提供了可复用的生产级工具链。
Hugging Face 推出代码大语言模型 StarCoder,基座 StarCoderBase 在 The Stack 1.2 数据集上用 80+ 种语言、1 万亿 token 训练出 15B 参数模型,StarCoder 进一步在 35B Python token 上微调得到。
推荐理由:官方展示了模型在 HumanEval 等基准上超越同体量开源及闭源模型的成绩,并给出了多语言与辅助对话的应用潜力。
Hugging Face 发布 PEFT 库,集成 LoRA 和 Prompt Tuning 等技术,与 Transformers 和 Accelerate 无缝结合。使用 LoRA 微调 bigscience/T0_3B 模型只需 11GB 显存,且模型权重仅 19MB 即可保存部署,性能接近全量微调。
推荐理由:官方开源了可插拔的轻量微调库,允许用 MB 级参数文件在消费级显卡上复现全量微调效果,改变了大模型适应下游任务的成本结构。
Hugging Face 发布教程,介绍如何从零训练 110M 和 1.5B 参数的 GPT-2 模型 CodeParrot 以生成 Python 代码。该模型使用基于 180GB Python 代码清洗后的 50GB 数据集训练,并采用 🤗 Accelerate 库在 16 张 A100 GPU 上完成分布式训练。
推荐理由:提供了训练 GPT-2 大模型的具体步骤,涵盖数据清洗、分词器设计和分布式训练,可复用于自研代码模型。