H Company 发布开源行动 VLM Holo1 与 Web 代理 Surfer-H
H Company 在 Hugging Face 上发布开源行动视觉语言模型 Holo1 家族和 WebClick 多模态定位基准。
推荐理由:开源Holo1行动VLM家族与Surfer-H代理给出可对比的成本和精度基准,读者可评估网页自动化的落地门槛。
技术方向
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
86 条精选近 30 天 25 条共收录 276 条
H Company 在 Hugging Face 上发布开源行动视觉语言模型 Holo1 家族和 WebClick 多模态定位基准。
推荐理由:开源Holo1行动VLM家族与Surfer-H代理给出可对比的成本和精度基准,读者可评估网页自动化的落地门槛。
本教程演示如何使用 LM Studio 和 VS Code 扩展 Continue.dev,在本地部署并调用开源模型 OlympicCoder 7B 作为编码助手。
推荐理由:文章给出了在本地运行 OlympicCoder 7B 的完整集成流程,帮读者把开源模型接入现有开发工具。
NVIDIA 在 GTC 2025 大会上发布了三项开源成果:Cosmos Transfer 世界基础模型、15TB 物理 AI 数据集以及通用类人推理模型 Isaac GR00T N1。
推荐理由:NVIDIA 在 GTC 2025 开源了 Cosmos Transfer 与 Isaac GR00T N1 模型及数据集,为开发者提供了训练具身智能体的完整工具链。
Hugging Face 发布 Open R1 Update #3,公布从 DeepSeek-R1 蒸馏得到近 10 万条高质量 C++ 与 Python 代码推理样本的 CodeForces-CoTs 数据集,并发布基于 IOI 的新基准。
推荐理由:给出了代码推理复现的细节与 7B、32B 模型结果,可参考训练策略与评测方法。
Yaak 与 Hugging Face 联合发布 L2D,这是全球规模最大的开源自动驾驶多模态数据集,包含超过 90TB、5000 小时的德国 30 城驾驶数据,涵盖 6 路环视相机、完整车辆状态、环境条件及自然语言指令。数据将分阶段更新至 R4,并支持接入 LeRobot 流水线进行端到端模型训练,2025 年夏季还将开放带安全员的闭环实测。
推荐理由:L2D 是当前最大的开源自动驾驶多模态数据集,包含 90TB 以上数据,可直接接入 LeRobot 训练端到端模型。
Cohere 开放 Aya Vision 8B 和 32B 权重,支持 23 种语言的图像理解、视觉问答与图文翻译。模型基于 SigLIP2-patch14-384 视觉编码器和 Aya Expanse 语言底座,通过 4 倍 Pixel Shuffle 下采样降低多模态输入开销。
推荐理由:模型在开放权重下支持 23 种语言视觉任务,并配合评测基准发布,可直接复用于多语言视觉落地。
Google 发布 SigLIP 2 多语言视觉语言编码器,作者团队在 SigLIP 的 sigmoid loss 之上叠加解码器、全局-局部自蒸馏和掩码预测等辅助目标,以提升语义理解、定位和密集特征能力。
推荐理由:作者拆解了 SigLIP 2 相对 SigLIP 新增的多项训练目标与动态分辨率变体,并给出可直接运行的推理与对比方法。
Google 发布 PaliGemma 2 mix,这是一组在多种视觉语言任务上微调的指令型视觉语言模型,覆盖 3B、10B 和 28B 规模。文章展示了其处理开放式任务提示和检测定位任务的方式,并提供了通过 Transformers 进行推理的代码和在线演示。
推荐理由:文章解释了 mix 变体如何作为预训练模型的下游能力参考,并给出可运行的推理示例。
Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。
推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。
Mistral AI 正式发布 Mistral NeMo 12B,该模型由 NVIDIA 协助构建,提供最高 128k tokens 的上下文窗口。模型采用 Apache 2.0 协议开源,在推理、世界知识和编程能力上达到同规模 SOTA 水平。
推荐理由:Mistral NeMo 12B 引入 128k 上下文和新 tokenizer Tekken,性能超越同类开源模型且支持 FP8 推理,适合多语言业务部署。
Hugging Face 和 BigCode 团队发布 StarCoder2-15B-Instruct-v0.1,这是一个完全基于自生成数据(self-aligned)训练的代码语言模型,其 HumanEval 得分达 72.6。该模型训练过程完全透明,不依赖 GPT-4 等专有模型的蒸馏数据,并已在 LiveCodeBench 上展现出优于使用 GPT-4 蒸馏数据微调模型的代码生成能力。
推荐理由:该模型完全通过自生成数据实现指令微调,证明不依赖外部教师模型也能获得强代码能力,并开源了全流程。
Meta 发布开源 Llama 3,提供 8B 和 70B 参数的 base 及 instruct-tuned 版本,并配套发布安全微调模型 Llama Guard 2。
推荐理由:提供了 Llama 3 的完整评测数据与 Hugging Face 生态集成指南,方便开发者快速部署和微调该模型。
Hugging Face 发布 Idefics2,一个 8B 参数量的通用多模态视觉语言模型,支持输入文本与图像序列并生成文本响应,Apache 2.0 开源。
推荐理由:Idefics2 采用 Apache 2.0 协议开源 8B 多模态模型,并提供配套微调数据 The Cauldron,为多模态社区提供了易用的基础与工具。
Google 发布了 CodeGemma 模型,包含 2B、7B 和 7B Instruct 三种版本,专为代码生成、补全和推理设计。CodeGemma 7B 在 Python、JavaScript 和 C++ 的 HumanEval 评测中表现优于其他 7B 模型,但在中文代码方面尚未测试。
推荐理由:三个模型直接开源可下载,附 transformers 代码和量化部署方案,方便读者在本地复现。
Hugging Face 推出与 Cloudflare Workers AI 的新集成,开发者可通过按请求付费的方式,在全球边缘 GPU 上运行热门开源模型。该功能支持 Meta Llama 2 7B、Mistral 7B 等模型,用户可在模型页面直接选择部署并通过 REST API 或 Cloudflare AI SDK 发起请求。
推荐理由:将热门开源模型集成至 Cloudflare 无服务器推理平台,开发者可按请求付费运行。
Hugging Face 发布了名为 Cosmopedia 的 250 亿 token 合成数据集及配套的 1B 规模模型 cosmo-1b,旨在通过完全开源的端到端流程复现 Microsoft Phi-1.5 的数据集。
推荐理由:原文公开了 250 亿 token 数据集的完整生成链路和 1B 模型评测,读者可据此复现或改进合成数据预训练方法。
BigCode 发布 StarCoder2 系列开源编码大模型,包含 3B、7B、15B 三个规格,全部基于新的 The Stack v2 代码数据集训练并同步开放模型、数据集与训练代码。
推荐理由:原文给出了三代模型规格与数据集规模,读者可以据此判断它与现有开源编码模型之间的定位差异。
Google 发布名为 Gemma 的 4 个开源 LLM 模型,其中 7B 参数版本采用 6T token 预训练,8K context 下得分 63.75。Hugging Face 提供 transformers 4.38 集成支持,并说明使用 QLoRA 在单张 A10G GPU 上微调 gemma-7b 需约 9 小时。
推荐理由:Hugging Face 给出了 Gemma 与同级模型的基准对比,以及消费级 GPU 微调实践入口。
Hugging Face 为 Text Generation Inference 推出 Messages API,使 TGI 1.4.0 起兼容 OpenAI Chat Completion API。
推荐理由:提供 TGI 对齐 OpenAI 的接入细节与示例,读者可据此把现有客户端代码迁移到自托管开源 LLM。
Hugging Face 团队介绍了由社区开发的轻量级工具 Unsloth,可将 LLM 微调速度提升至 2 倍并降低 40% 内存占用。该工具通过重写 PyTorch 模块为 Triton 内核优化运算,兼容 Llama 和 Mistral 架构,且支持 TRL 训练器套件。
推荐理由:提供可复现的加速微调方案,实测数据清晰展示了显存与速度优化幅度。