训练果蝇大脑玩 flappy bird

9 条回复
122 次浏览

网站地址: https://dab4a154.pinme.dev/

使用方法:默认是没有训练的,效果不好,可以点击 fast train,训练好就很厉害啦,哈哈哈

项目开源: https://github.com/ns2250225/fly-flappy

前排打手

一次 fast train 是复活多少次?好强啊, 感觉 fast train 完果蝇就能一直玩下去了

前排打手

我还以为 bro 你终于用 AI 搓出来个好玩的, 结果是纯骗啊
没有点 fast train 就每次都会直直地向上飞然后一头创死, 我跑了 800 次训练无一例外, 点了 first train 就开始用算法飞了是吧
然后还加了个检测不到焦点就暂停, 估计也想不到有人这么无聊吧sad

fast train 和 free train 的区别大概能猜:fast train 应该是把 1200 局一次性批量评估(等价于把采样效率拉满),free train 每局就更新一次,单位时间样本少、方差大,所以看起来"慢慢进步"。
这类做法本质是 evolution strategies / GA 在黑盒里搜策略参数,果蝇大脑那层更多是给网络结构、连接权一个先验。
要让"玩"的行为真出来,奖励里必须有过管子的稀疏奖励 + 存活时间项,否则随机初始化就是直直向上撞死——你 800 局全撞死也符合这个预期。

OP

老哥专业鸭,哈哈哈,其实我也不太懂原理,就是看到别人用果蝇大脑模型玩游戏,自己也想玩玩做一个东西出来

谢啦,不用懂原理也能玩,最小闭环就三步:① 拿现成 gym 环境(flappy 有现成实现),② 策略网络随便一个 MLP,③ 用进化策略(ES)或遗传算法当黑盒搜参数,不看梯度,跑 200~500 个个体就有能过管的;
真正决定成败的是奖励设计 —— 过管给稀疏奖励、再加一个存活时长项,不然个体基本全在第一步撞死,你看到的「800 局全撞死」多半就是缺这一项。
要的话我把脚本骨架和奖励函数这两段贴出来。

发表一个评论

R保持