ABBEL:通过信念状态更新优化长程交互 LLM 效率
Berkeley AI Research 提出 ABBEL 框架,将摘要重构为受监督的自然语言信念状态,以解决递归摘要导致的性能损耗。 在 CollabBench 协作编码任务中,结合重构型信念评分的 ABBEL 将全上下文模型的性能差距缩小约 50%,且训练步数减少 50%,峰值上下文 token 数显著低于全上下文设置。
Berkeley AI Research 提出 ABBEL 框架,将摘要重构为受监督的自然语言信念状态,以解决递归摘要导致的性能损耗。 在 CollabBench 协作编码任务中,结合重构型信念评分的 ABBEL 将全上下文模型的性能差距缩小约 50%,且训练步数减少 50%,峰值上下文 token 数显著低于全上下文设置。
Hugging Face 发布了 FilBench 评测套件,专门评估 LLM 在 Tagalog、Filipino 和 Cebuano 三种语言中的流畅度、语言学能力、翻译能力及文化知识。
Hugging Face 推出 NeurIPS 2025 E2LM 竞赛,旨在构建能捕捉大型语言模型早期训练阶段(约 200B tokens)推理与科学知识信号的基准。
Hugging Face 开源了 WebSight-v0.2 数据集及微调模型 Sightseer,旨在利用视觉语言模型将网页截图转换为 HTML 代码。该数据集包含 200 万个合成示例,相比 v0.1 版本采用了真实图像和 Tailwind CSS,显著提升了数据质量。Sightseer 模型基于此微调,能够生成包含图像的功能性 HTML,致力于简化 UI 设计到代码的转化流程。
Hugging Face Spaces 通过 arXivLabs 集成在论文页面新增 Demo 标签页,用户可直接访问社区或作者创建的开源机器学习演示。该功能上线时,Hugging Face 用户已基于 Spaces 构建了超过 12,000 个开源演示,帮助研究提高可复现性。
Hugging Face Transformers 新增 Perceiver IO,这是首个基于 Transformer 且适用于文本、图像、音频、视频及点云等任意模态及其组合的模型。该架构在潜在变量上使用自注意力,使计算量独立于输入大小,仅线性依赖输入规模。模型支持 256 或 512 个潜在变量,可实现图像分类及光流预测等任务。
OpenAI 支持 Distill 新期刊今日启动,该期刊旨在出色地传播机器学习研究成果。