AI 在速度和准确率上超越持证会计师,但仍需监督才能完成结算
Mercor 的研究显示,AI 模型在结构化记账任务上的速度和准确率超过平均经验五年半的持证会计师。该研究使用 APEX Accounting Benchmark,结果显示当前最佳模型 Claude Opus 5.5 满足了 61.8% 的评分标准。
Mercor 的研究显示,AI 模型在结构化记账任务上的速度和准确率超过平均经验五年半的持证会计师。该研究使用 APEX Accounting Benchmark,结果显示当前最佳模型 Claude Opus 5.5 满足了 61.8% 的评分标准。
DeepSeek V4.1 Flash 在写作基准测试中平均耗时 43 秒且单脚本成本低于 1 美分,速度比 Fable 快 12 倍、便宜 250 倍。该模型骨干规模接近 V4 Flash 的两倍,全局 KV cache 体积缩小约四分之一。作者建议在需人工编辑的初稿场景使用默认推理设置以控制成本。
在 Google Cloud C4 实例(5 代 Xeon)上运行 Llama-3.2-3 模型和 UAE-Large-V1 嵌入模型,文本嵌入吞吐量较 N2 提升 10–24 倍,文本生成提升 2.3–3.6 倍。C4 每小时价格约为 N2 的 1.3 倍,在成本调整后嵌入和生成的总拥有成本优势分别为 7–19 倍和 1.7–2.9 倍。