初次尝试 Nano Banana 2——生成近乎真实的生活场景

yoursunny 2026-06-14 22:49 1

先上效果


模型:Nano Banana 2

费用:Gemini 免费版 5 小时限额消耗 100%


成品一:


成品二:


生成过程


这是我第一次尝试 Gemini 软件的图片生成功能。

我一边操作 Gemini,一边用隐私浏览器将我看到的效果与疑问描述给另一个 Google AI 搜索窗口,由其向我解释 Gemini 的逻辑。

下文“电脑”指代 Gemini / Nano Banana 2,“教官”指代 Google AI 搜索。


输入一:公园里,自行车倒在垃圾桶旁的草地上



我说:请将自行车扶起来。

电脑回复:自行车已经扶起,可是图片还是倒在地上的自行车。

我又说:自行车还是倒在地上?

电脑这才将自行车扶起,并撑好脚撑。

而且,电脑查阅了自行车的品牌型号,展示的自行车与真的完全一样。


输入二:提着行李的男孩



上传这张自拍的同时,我说:请让男孩上自行车。

这一步电脑产生的结果让我叹为观止:



  • 电脑找到了我穿着的上衣、裤子的确切款式。虽然输入二中裤腿口袋并不可见,但是结果里绘制了准确的口袋位置。

  • 输入二提在手里的行李袋,被挪进了自行车车篮。

  • 自行车从草地挪到了水泥地,而且脚撑也抬了起来。




成功的中间结果:男孩坐上自行车



据教官解释,电脑可以理解男孩想要骑自行车。

因为骑自行车需要双手握把,所以行李袋就被装入了车篮。


输入三:航站楼里的行李



输入二里背包的主体并不可见,所以电脑脑补了棕色背包。

我上传输入三时说到:行李式样请参看此图。

结果,电脑完全忽略了前面的场景,直接把我的两只包包从椅子上丢到了地上,然后画了一把空空的椅子。


跟随教官指引,我告诉电脑,请忽略航站楼背景、将背包画进自行车场景。

电脑这才听话,不过它在行李袋上画满了极具特色的商标。

据教官解释,电脑识别到世界知名商标后,独特文字的权重相当大,所以导致输出的每一面都出现商标。

我尝试多次,才让商标位置恢复正常。


我还发现,电脑对于“左”、“右”等方位词存在误解,难以理解我说的“左”是指自行车的左侧、还是图片的左侧。

教官建议,我要么说清“自行车的左侧”,要么使用“把手”、“前轮”等更加特定的词语来描述位置。




失败的中间结果:蓝色的背包



电脑对于背包的颜色、式样也存在巨大的困难。

虽然我给出了背包的确切型号,但是电脑画出的背包颜色始终不对劲。

如果我要求“蓝色 MOLLE loops”(背包正面用于悬挂小物件的尼龙缎带),拉链也会变成蓝色;如果我要求拉链变回黑色,缎带也会随之变色。

更有甚者,当我表示“拉链不是蓝色的”,整个背包都变成了蓝色,只剩一条黑色的拉链。

这个问题我没有找到解决方案,所以最终只能选择整体黑色的背包。


输入四:脸部与眼镜的侧面角度



我注意到中间结果里,男孩的眼眶特别深,眼镜的镜片偏小,而且黄色的镜架装饰片不见了。

所以我特意选择了一张脸部微侧的自拍,并写道:脸部与眼镜参看此图,但是注意镜片不应该变色。

之后的输出,眼眶全部恢复自然,而且镜架的装饰片也出现了。


教官赞扬了我的操作。

电脑起初选择了对着左侧的自行车,需要男孩的侧面像。

可是,输入二的脸部只有正面,所以电脑难以知道眼眶深度。

虽然镜架的黄色装饰片在输入二中可以看见,但是电脑为了节省计算成本,不得不忽略了这个细节。

因为我决定上传电脑缺少的信息,所以生成质量大大提升。


我再向电脑描述了运动鞋的型号:Pegasus 41 Arizona Wildcats。

虽然网上有大量 Pegasus 41 产品图片,但是亚利桑那大学专属版本并不多见,所以电脑在鞋子上画出了大量白色色块。

在教官的建议下,我又描述了鞋子的颜色,这才出现满意的结果。


这一步的结果就是成品一。

也许是因为输入四为纵版图片,电脑也将跟着将横板图片改成了纵版图片。


输入五:男孩戴着头盔



在教官的建议下,我让电脑生成了日落的场景。

然后我又突发奇想,写道:下大雨了,男孩的衣服都湿透了。

电脑相当理智,自动删除了太阳,而且天空布满了乌云。

但是,电脑并没有把上衣的帽子竖起来,而是任由我的头发在风中凌乱。

而且,眼镜直接换了一副,而且之前生成的背景中的公园长凳也挪动了位置。


据教官解释,虽然正常人都会在下雨时拉起帽子,但是电脑并没有这种生活常识。

对于电脑而言,一套服装就是一张粘纸。

而且,因为我从未在文字里提到镜架上的黄色装饰片,所以电脑已经遗忘了这个细节。


我又幽幽的说,出于安全考虑,骑车应该戴头盔呢。

电脑直接给加上了灰色的头盔。

我上传了输入五,并说:头盔式样参照此图。

这就是产生了成品二。

电脑画出的头盔与实际相符,湿透的服装也相当贴切。


最后我询问教官,既然共享单车公司强烈建议骑车应该双手握把、戴好头盔,那么为什么第一次骑上车时,行李袋进了车篮、头盔却没有自动加上?

教官的回答是,华盛顿的法律只要求 16 岁以下必须戴头盔,而图中的“男孩”看起来是成年人,训练集里有许多不戴头盔骑车的成年人,所以就没有自动加上。


至此,5 小时 token 额度用完,实验结束。


我学到了什么



  • 一边操作 AI,一边用另一个 AI 会话当“教官”,可以理解 AI 的内部逻辑

  • 所有的描述都要尽量准确且唯一,减少“左侧”等模糊用词

  • 对于电脑不知道的物体式样、特定的视角,可以补充那个视角的照片,让电脑直接“复制粘贴”

最新回复 (6)
  • 凉橙 06-14 22:55
    1

    怎么说话这么诡异啊,有点吓人。

  • 一顿饭的功夫 06-14 23:08
    2

    ^-^ 我以为我在公众号呢,有点吓人。

  • 一般路过不热心群众 06-14 23:10
    3

    我好害怕。你是什么模型,先并行20次dynamic workflow自查

  • MiluZz. 06-15 12:12
    4

    有点伪人,不知道是不是先入为主或者是ai图看多了

  • yoursunny 楼主 06-15 17:58
    5

    事后,我让 Google AI “判官”分析了输出的图片,被告知:车轮边的雨水不自然。

    旋转的车轮会带起水花,车轮后方应该有一小块相对干燥的地面。

    但是,图中的地面布满水花。


    我问,既然判官可以知道哪里不对劲,那么电脑为什么不直接集成这个算法呢?

    回答是,虽然判官的算法可以知道哪里不对劲,但是没有办法生成修正这些错误的指令。

    这类似于计算理论的 NP-hard 问题,你可以知道答案是对是错,但是不知道怎么高效算出答案。

  • R MEx 06-15 18:33
    6

    怎么都是中国字连起来我就看不懂了?

* 帖子来源Linux.do
返回