跳到正文
原文
OpenAI News·· 2018-04-18精选AI 评分63

OpenAI发布进化策略梯度元学习方法

Evolved Policy Gradients

AI 导读

OpenAI发布了一种名为Evolved Policy Gradients (EPG) 的实验性元学习方法。该方法通过进化学习代理的损失函数来实现在全新任务上的快速训练,使得代理在面对超出其训练机制的测试任务时(如在房间不同侧面寻找物体)也能成功执行。

推荐理由

介绍了一种通过进化损失函数来加速新任务训练的实验性元学习方法,其核心价值在于揭示了提升智能体快速适应未知环境能力的技术路径。

来源:OpenAI News · openai.com