基于 Rokid AIUI:从一句咒语到一副眼镜,我做了款 AR 寻宝游戏《寻宝猎手》
基于 Rokid AIUI:从一句咒语到一副眼镜,我做了款 AR 寻宝游戏《寻宝猎手》
展会上戴着 Rokid 眼镜讲解产品时我就在想:眼镜最大的优势是"你看到什么,它就懂什么"。能不能把它变成一个游戏引擎——你抬头看到的真实世界,就是游戏关卡?于是我做了《寻宝猎手》:AI 出题"找一个红色的东西",你在房间里找到它、拍下它,AI 判定通过,宝物入袋。
接下来我将介绍我做的《寻宝猎手》:
一.首先我们先进入https://aiui.rokid.com/
登录自己Rokid的账号后界面如下:
现在使用的AIUI Stuido对新手也十分友好,只要自身有想法,即使对代码不了解也能完整属于自己的智能体搭。
他改为三种选择方式:新手的话建议使用对话创建;同时也支持智能体直接导入。

此次我将通过对话创建功能来实现我的项目,选择对话创建,在下方输入想要完成的内容。如我输入的“我设计一款小游戏,我想要让眼前的现实世界直接变成游戏地图,生成一个寻宝猎手小游戏”后就直接帮我生成智能体。
等待几分钟后即可看到生成出的智能体:

通过界面可以看出有些地方存在错误,这正好体现出AIUI界面对新手的友好,我们不需要自己从代码中找错误,我们在下方输入发现的错误后,会自动帮我们进行修改。具体出现哪些问题我们稍后再说。
二.智能体的构建与提审
在左上角点击进入界面,会出现如图界面:

首先给你的智能体进行起名,选择应用类别(根据自己实际做的项目选择哦)我做的是一个小游戏,所以我选择--娱乐。接下来进行输入开场白和功能介绍等内容。
开场白--顾名思义就是在开始时给你进行的交互开始。
功能介绍--简单的介绍你的智能体的功能。
还有一个最容易忽略的信息就是左上方的图标,在AIUI中不可以使用默认的图标影响后续审核。
再点开权限依赖这个界面,基本前四个都需要进行勾选;

因为我的智能体用不到Rokid账号信息,在这我就不进行勾选了。
在预览素材这,提审要 3 到 5 个预览素材,至少一图一视频。我一开始想省事,让 AI 画了几张"眼镜界面",看两眼就删了——风格跟实际界面完全不是一回事,图文不符在提审时最容易被卡。后来我运行我的项目,使用实际项目的截图和视频进行提交。然后进行AIX打包后进行提审。

三.项目提审后,我开始讲解一下我的项目整体架构及流程
这是我的项目整体结构:
├── assets/ # 音频资源目录
│ ├── hit.wav
│ ├── miss.wav
│ └── win.wav
├── lib/ # 工具库脚本
│ ├── quests.js # 任务相关逻辑
│ ├── sfx.js # 音效管理
│ ├── storage.js # 本地存储
│ ├── tts.js # 语音合成
│ └── vision.js # 视觉识别
├── pages/ # 页面目录
│ ├── collection/
│ │ └── index.ink
│ ├── hunt/
│ │ └── index.ink
│ └── index/
│ └── index.ink
├── tools/ # 工具脚本
├── AGENTS.md # 智能体说明文档
├── app.js # 应用入口脚本
└── app.json # 应用配置文件
别看这代码结构复杂,其实都是平台自动生成,并非我们手动进行敲代码;
在通过生成出的内容进行调试我的智能体,中途出现过很多问题,如果你只是看到功能为实现并不知道是哪的具体问题,你可以在下方直接输入:帮我查询该项目是否存在问题,有问题帮我进行修改


他会自动检查你的代码查看会出哪些问题,并且会自动修改。
四.我的项目怎么玩
我将在模拟器进行操作演示
项目分为五个主题:色彩猎人找指定颜色,文字侦探找带某个字的招牌,材质大师找指定材质,动态追踪找正在移动的东西(行人不算),反向思维最烧脑,题目是"找这条街上看起来最古老的物体"这种,没有标准答案。
这是我的小游戏的首界面:

通过模拟器的镜腿操作开始AI会自动出题,根据要求进行拍摄目标,完成任务,同时可以通过语言交互,可以进行提示,结束,重来,返回等功能;眼睛拍一张照片,和任务描述一起丢给大模型,让它判断画面里有没有符合目标的东西。命中就播报"漂亮!红色的消防栓,第 1 件宝物入手",没命中它会回一句二十字以内的鼓励。

卡住了喊"提示",它给的是渐进式提示:第一句是"红色的东西,交通设施里很常见哦",第二句才缩到"路边有个红色的、矮矮的圆柱体"。反正不直接报答案。

图鉴:收集存在本地,最多 200 条,每条带主题、宝物名和日期。玩几局之后回去翻,能看到"9 月 15日 [色彩猎人] 红色的消防栓"这种记录。图鉴是重复玩下去的理由,不然找到就结束了。

五.最后
做《寻宝猎手》这么长时间,我最大的感受是:眼镜不是把屏幕变小了塞到眼前,而是第一次让"你正在看的东西"变成了输入。
手机要你举起它,世界就先被打断了。眼镜不用——你抬眼看到什么,它就在理解什么。这也正是我把它做成寻宝的原因:宝物不是代码里生成的金币,是你房间里那个红色的消防栓、street 边那块旧招牌、校园里那棵老树。
四个版本,一次推倒重来,容易出现的坑我上面都写清楚了。如果你也在做 AIUI,希望这些能帮你少熬一晚。
更多推荐

所有评论(0)