先上效果
模型:Nano Banana 2
费用:Gemini 免费版 5 小时限额消耗 100%
成品一:

成品二:

生成过程
这是我第一次尝试 Gemini 软件的图片生成功能。
我一边操作 Gemini,一边用隐私浏览器将我看到的效果与疑问描述给另一个 Google AI 搜索窗口,由其向我解释 Gemini 的逻辑。
下文“电脑”指代 Gemini / Nano Banana 2,“教官”指代 Google AI 搜索。
输入一:公园里,自行车倒在垃圾桶旁的草地上

我说:请将自行车扶起来。
电脑回复:自行车已经扶起,可是图片还是倒在地上的自行车。
我又说:自行车还是倒在地上?
电脑这才将自行车扶起,并撑好脚撑。
而且,电脑查阅了自行车的品牌型号,展示的自行车与真的完全一样。
输入二:提着行李的男孩

上传这张自拍的同时,我说:请让男孩上自行车。
这一步电脑产生的结果让我叹为观止:
- 电脑找到了我穿着的上衣、裤子的确切款式。虽然输入二中裤腿口袋并不可见,但是结果里绘制了准确的口袋位置。
- 输入二提在手里的行李袋,被挪进了自行车车篮。
- 自行车从草地挪到了水泥地,而且脚撑也抬了起来。
成功的中间结果:男孩坐上自行车

据教官解释,电脑可以理解男孩想要骑自行车。
因为骑自行车需要双手握把,所以行李袋就被装入了车篮。
输入三:航站楼里的行李

输入二里背包的主体并不可见,所以电脑脑补了棕色背包。
我上传输入三时说到:行李式样请参看此图。
结果,电脑完全忽略了前面的场景,直接把我的两只包包从椅子上丢到了地上,然后画了一把空空的椅子。
跟随教官指引,我告诉电脑,请忽略航站楼背景、将背包画进自行车场景。
电脑这才听话,不过它在行李袋上画满了极具特色的商标。
据教官解释,电脑识别到世界知名商标后,独特文字的权重相当大,所以导致输出的每一面都出现商标。
我尝试多次,才让商标位置恢复正常。
我还发现,电脑对于“左”、“右”等方位词存在误解,难以理解我说的“左”是指自行车的左侧、还是图片的左侧。
教官建议,我要么说清“自行车的左侧”,要么使用“把手”、“前轮”等更加特定的词语来描述位置。
失败的中间结果:蓝色的背包

电脑对于背包的颜色、式样也存在巨大的困难。
虽然我给出了背包的确切型号,但是电脑画出的背包颜色始终不对劲。
如果我要求“蓝色 MOLLE loops”(背包正面用于悬挂小物件的尼龙缎带),拉链也会变成蓝色;如果我要求拉链变回黑色,缎带也会随之变色。
更有甚者,当我表示“拉链不是蓝色的”,整个背包都变成了蓝色,只剩一条黑色的拉链。
这个问题我没有找到解决方案,所以最终只能选择整体黑色的背包。
输入四:脸部与眼镜的侧面角度

我注意到中间结果里,男孩的眼眶特别深,眼镜的镜片偏小,而且黄色的镜架装饰片不见了。
所以我特意选择了一张脸部微侧的自拍,并写道:脸部与眼镜参看此图,但是注意镜片不应该变色。
之后的输出,眼眶全部恢复自然,而且镜架的装饰片也出现了。
教官赞扬了我的操作。
电脑起初选择了对着左侧的自行车,需要男孩的侧面像。
可是,输入二的脸部只有正面,所以电脑难以知道眼眶深度。
虽然镜架的黄色装饰片在输入二中可以看见,但是电脑为了节省计算成本,不得不忽略了这个细节。
因为我决定上传电脑缺少的信息,所以生成质量大大提升。
我再向电脑描述了运动鞋的型号:Pegasus 41 Arizona Wildcats。
虽然网上有大量 Pegasus 41 产品图片,但是亚利桑那大学专属版本并不多见,所以电脑在鞋子上画出了大量白色色块。
在教官的建议下,我又描述了鞋子的颜色,这才出现满意的结果。
这一步的结果就是成品一。
也许是因为输入四为纵版图片,电脑也将跟着将横板图片改成了纵版图片。
输入五:男孩戴着头盔

在教官的建议下,我让电脑生成了日落的场景。
然后我又突发奇想,写道:下大雨了,男孩的衣服都湿透了。
电脑相当理智,自动删除了太阳,而且天空布满了乌云。
但是,电脑并没有把上衣的帽子竖起来,而是任由我的头发在风中凌乱。
而且,眼镜直接换了一副,而且之前生成的背景中的公园长凳也挪动了位置。
据教官解释,虽然正常人都会在下雨时拉起帽子,但是电脑并没有这种生活常识。
对于电脑而言,一套服装就是一张粘纸。
而且,因为我从未在文字里提到镜架上的黄色装饰片,所以电脑已经遗忘了这个细节。
我又幽幽的说,出于安全考虑,骑车应该戴头盔呢。
电脑直接给加上了灰色的头盔。
我上传了输入五,并说:头盔式样参照此图。
这就是产生了成品二。
电脑画出的头盔与实际相符,湿透的服装也相当贴切。
最后我询问教官,既然共享单车公司强烈建议骑车应该双手握把、戴好头盔,那么为什么第一次骑上车时,行李袋进了车篮、头盔却没有自动加上?
教官的回答是,华盛顿的法律只要求 16 岁以下必须戴头盔,而图中的“男孩”看起来是成年人,训练集里有许多不戴头盔骑车的成年人,所以就没有自动加上。
至此,5 小时 token 额度用完,实验结束。
我学到了什么
- 一边操作 AI,一边用另一个 AI 会话当“教官”,可以理解 AI 的内部逻辑
- 所有的描述都要尽量准确且唯一,减少“左侧”等模糊用词
- 对于电脑不知道的物体式样、特定的视角,可以补充那个视角的照片,让电脑直接“复制粘贴”