跳到正文

全部动态

今日 43 条
9月8日周二
9月7日周一
8月28日周五
8月25日周二
8月22日周六
  1. Rohan's Bytes44

    研究发现 ChatGPT 发布以来 1/3 网页由 AI 撰写

    皮尤研究中心(Pew Research)研究显示,ChatGPT 发布以来约有 1/3 的网页显示由 AI 撰写或编辑的迹象。截至 2026 年,.com 网页中 AI 关联内容占比达 9.4%,远高于 .edu 的 1% 和 .gov 的 0.8%。这种分布不均源于商业出版商利用 AI 提升产能的经济动机,而公共机构受限于流程与激励不足。

8月17日周一
8月13日周四
8月10日周一
8月6日周四
8月4日周二
  1. Towards AI39

    2026年如何学习AI工程:围绕核心决策构建工程判断力

    学习AI工程应围绕五个核心决策展开:是否使用LLM、系统架构选型(提示词/RAG/微调/智能体)、数据接入与人工介入点、成功标准及评估、以及失败处理机制。作者建议通过阅读基础资料、构建小型系统并加入评估数据集与追踪功能来积累经验,利用评估与反馈转化工程判断力。相关学习路径已整理为免费的公开GitHub路线图,并附带可定制课程大纲的提示词。

7月29日周三
  1. Towards AI28

    创作者分享 AI Agent 团队将 YouTube 视频制作工作量降低 90% 的自动化经验

    创作者使用 AI Agent 团队将单条 YouTube 视频的制作周期从两至三天压缩至五小时,工作量降低 90%。该流程将研究设计为可探索方向的 Agent,写作则设为受约束的工作流以保持一致性。创作者保留了选题方向、观点塑造与最终事实核查环节在人工控制范围内,其余执行步骤由自动化流水线完成。

7月17日周五
  1. Google DeepMind84

    Google 发布轻量化网络安全模型 Gemini 3.5 Flash Cyber

    Google 发布基于 Gemini 3.5 Flash 微调的网络安全模型 Gemini 3.5 Flash Cyber,用于高效发现、验证和修复代码漏洞。该模型通过限制政府及可信合作伙伴的试点计划访问,在 CyberGym 和 Chrome 生产环境等测试中展现了优于主线路基模型和更大模型的高效性能,已用于保护 Google 内部代码库。

    推荐理由:官方发布了针对网络安全微调的轻量化模型,提供了在漏洞扫描任务中降低成本并提升覆盖率的实操架构。

7月1日周三
  1. Google Research41

    Google Research 将热韧性数据扩展至全球 50 多个城市

    Google Research 发布覆盖 50 多个城市的建筑级屋顶反射率扩展数据集,并上线高分辨率 Heat Resilience Earth Engine App 供公开使用。该数据集融合 Sentinel-2 卫星数据与 30 厘米分辨率商业影像,旨在帮助城市规划者通过冷屋顶方案缓解极端高温。研究指出,利用该数据进行的针对性冷屋顶规划在全球范围内可将城市极端高温缓解最高 0.5°C。

6月26日周五
  1. Towards AI33

    AI Engineer 演讲:基于纯文件引用的 AI 研究操作系统如何解决 Agent 记忆复用难题

    作者在 AI Engineer 世界博览会的主题演讲中展示了一款基于纯文件和引用的 AI 研究操作系统,旨在解决 Agent 难以复用长期记忆的问题。该系统通过三层结构(原始源、索引、维基)将 Obsidian 或 GitHub 等来源转化为可查询和检查的记忆,无需向量数据库或知识图谱。

6月24日周三
6月19日周五
6月17日周三
6月15日周一
6月11日周四
6月7日周日
4月23日周四
4月21日周二
  1. Hugging Face Blog52

    AI 与网络安全未来:为什么开放性很重要

    Hugging Face 讨论前沿模型 Mythos 及其嵌入系统在发现、修复软件漏洞中的表现,指出网络安全是涉及漏洞检测、验证、协调和补丁传播的速度竞赛。作者认为开放代码和工具能为防御方提供结构化优势,并建议采用基于开放组件的半自主 AI Agent,在组织自己的控制范围内运行以辅助安全防御。

4月16日周四
  1. Hugging Face Blog50

    Hugging Face 发布 Skill 与测试框架,辅助将 Transformers 模型移植至 MLX-LM

    Hugging Face 提供了 Skill 和测试框架,用于协助将 transformers 中的语言模型移植到 mlx-lm,实现模型几乎即时可用。该 Skill 作为辅助工具而非自动化流程,支持贡献者处理脚手架搭建及架构校验,同时为审查者生成符合代码规范的高质量 PR 及可复现测试证据。

3月17日周二
3月11日周三
2月19日周四
  1. Google DeepMind74

    Gemini 应用引入 Lyria 3 音乐生成模型

    Gemini 应用上线了最新的生成音乐模型 Lyria 3,用户可以通过文本描述或上传图片生成 30 秒的音乐片段。Lyria 3 支持自动作词,用户可对风格、人声和节奏进行更多控制,生成的音频将嵌入 SynthID 水印,并支持通过 Nano Banana 自动生成封面艺术。

    推荐理由:该功能通过文本或图像直接生成带词曲的30秒音乐,将多模态生成扩展到音频领域。

9月17日周三
9月15日周一
7月1日周二
  1. Hugging Face Blog42

    Sentence Transformers 微调稀疏嵌入模型指南

    Sentence Transformers 提供了一套用于微调稀疏嵌入模型的完整流程,涵盖模型、数据集、损失函数及评估器等组件。该库生成的 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq 模型成本低,特别适合混合搜索或检索重排场景。

6月4日周三
6月3日周二
8月7日周三
  1. Mistral AI65

    Mistral AI 发布模型定制、Agents 与 1.0 版 SDK

    Mistral AI 宣布在 La Plateforme 上开放旗下旗舰及专用模型的定制能力,支持通过 base prompt、few-shot prompting 或 fine-tuning 微调,并可接入自带数据集。

    推荐理由:Mistral 在自家平台同时开放模型定制、智能体与稳定版 SDK,为开发者把前沿模型接入应用提供更完整的路径。

7月24日周三
  1. Mistral AI75

    Mistral Large 2 发布:123B 参数、128k 上下文,性能对齐 GPT-4o 和 Claude 3 Opus

    Mistral 发布新模型 Mistral Large 2,123B 参数、128k 上下文窗口,MMLU 预训练版本达到 84.0%。Mistral 称其在代码和推理上表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并优化了指令跟随、减少模型幻觉。

    推荐理由:官方给出了 MMLU 84.0%、123B 参数、128k 上下文窗口和 la Plateforme 上的部署入口,可判断它与 GPT-4o、Claude 3 Opus 等模型在性价比上的位置。

7月18日周四
  1. Mistral AI63

    Mistral 发布 12B 参数多语言模型 Mistral NeMo,支持 128k 上下文窗口

    Mistral AI 正式发布 Mistral NeMo 12B,该模型由 NVIDIA 协助构建,提供最高 128k tokens 的上下文窗口。模型采用 Apache 2.0 协议开源,在推理、世界知识和编程能力上达到同规模 SOTA 水平。

    推荐理由:Mistral NeMo 12B 引入 128k 上下文和新 tokenizer Tekken,性能超越同类开源模型且支持 FP8 推理,适合多语言业务部署。

7月16日周二
  1. Mistral AI44

    Mistral 开源数学推理模型 Mathstral

    Mistral AI 在 Project Numina 项目中发布数学推理模型 Mathstral,基于 Mistral 7B 构建。该模型在 MATH 基准测试中得分为 56.6%,MMLU 得分为 63.47%。Mathstral 已在 HuggingFace 开放权重,支持通过 mistral-inference 使用。

3月20日周三
3月18日周一
3月4日周一
  1. Hugging Face Blog40

    Argilla 与 Hugging Face 联合发起集体构建偏好数据集实验

    Argilla 与 Hugging Face 启动“Data is Better Together”实验,通过社区协作构建偏好数据集。该实验在数天内吸引 350 名贡献者完成超过 11,000 条提示词评级,并发布包含 10,000 条提示词的 10k_prompts_ranked 数据集。双方正招募首批社区 cohort,提供 Argilla Space 支持及免费持久化存储资源。