先感谢一下之前帖子里给建议的各位佬,大家关于角色卡、世界书、记忆和剧情推进的意见我都认真研究了下,给了我很大的帮助。最后和孩子商量后,更改了“同行模式”的定义,把聊天改为不让孩子进入故事陪伴角色冒险,而是让孩子做为导演,通过选项和自由对话控制剧情走向。
最近准备在懒爸AI管娃小程序里女儿增加一个“AI酒馆”功能,
想来听听真正玩过、搭过酒馆的大佬们的意见。
先谢过了!
为什么突然想给女儿做个酒馆
感觉娃娃们从三四年开始,就开始频繁讨论各种小说,
上学期是《猫七夜》最近又在说什么《鬼灭之刃》。
这些小说我是完全没听过,根本不了解,深深的感觉自己是个老登了。
他们不仅上学偷偷看偷偷交流,
还在玩起了话本小说,
或者让豆包扮演动漫角色和…


帖子里很多佬提醒NSFW,我翻了下酒馆角色卡的聚合站,很多卡的确内嵌NSFW内容。因为做的是儿童玩具,所以采用先生产再发布的模式:
生成管线兼容标准SillyTavern角色卡世界书,也支持TXT之类的长篇小说。系统调用LLM分步骤提取成角色、世界设定、章节、场景和剧情节点,做儿童内容和 NSFW 过滤,家长审核通过后发布,然后变为清洗版的角色卡世界书+故事,然后再调取生图模型补充故事封面、场景图和角色头像。
角色卡 / 世界书 / TXT 小说
↓
章节切分与内容清洗
↓
LLM 提取角色、世界设定、章节、场景和剧情节点
↓
角色合并、人物关系整理、章节归属判断
↓
NSFW 与儿童不适宜内容过滤
↓
家长后台审核
↓
发布到故事馆
↓
生图模型补充封面、角色头像、场景图



使用控制也接进了原来的作业积分体系。现在的设置是每天免费用30分钟,然后新的角色、故事、章节和额外时长都可以在积分商城兑换。娃娃当天作业没完成,免费时间就不能用,购买付费时间则按三倍积分计价。实际运行起来效果还不错,女儿现在早上起来第一件事就是先做作业,做完了才开始玩。因为不做完买时间要225分,做完作业叠加优惠券只要20多分,轻松拿捏娃娃。 ^-^。


目前系统运行的不错,哈基米3.1flash聊天的表现也挺好。
但是没想到,我卡在了一个看起来很小、孩子却特别在意的问题:
角色头像画出来和漫画不一样。
目前实测的情况是:
GPT-Image2:
生成场景图非常不错,基本能贴合章节里的地点、时间和气氛;但遇到哈利·波特、柯南、《鬼灭之刃》角色这类明确 IP 人物,经常直接拒绝。
第 7 章 · 霍格沃茨特快列车与城堡初遇
摘要:哈利在列车上与罗恩分享零食,结识赫敏,遭遇马尔福挑衅,终于乘船抵达霍格沃茨城堡。
进章旁白:列车驶出伦敦,田野飞驰。哈利与罗恩分享零食,打开巧克力蛙发现邓布利多画片会动。丢蟾蜍的纳威与赫敏出现,赫敏炫耀学识。马尔福前来挑衅,哈利冷冷拒绝。列车到站,海格迎接新生,乘船穿过湖面,霍格沃茨城堡的塔尖在夜空下闪烁。
导演提示:建立哈利与罗恩的友谊、赫敏的好学形象、马尔福的敌意;最终以城堡初次登场营造期待与悬念。
第五幕场景: 乘船渡湖与城堡初现

grok-imagine-image-lite:
这个模型道德水平低,画倒是愿意画,但是最终会生成一个“有点像但不是本人”的原创角色。比如鬼灭之刃娃娃翻了下角色表,就给我说不对。黑死牟是黑色长发、六只眼睛,grok生成出来的却成了红头发、四只眼睛。我倒是一点都看不出来,但是孩子一眼就发现不对了,这个很麻烦,我都没法事后审计。我根本不认识这些漫画人物 ^-^


我曾经尝试过在提示词上改造,不是简单把角色信息丢给生图模型,而是做了一个生图提示词的转换:
角色卡、世界书、小说内容 → 程序拼接各个字段生成生图基准 → LLM生成英文版的生图提示词 → 调用生图模型
实测下来可以不保证不乱出图,但是做不到一模一样。我个人感觉靠提示词继续堆“六只眼睛、黑色长发、禁止红发、禁止四眼”,大概率也解决不了。模型本身不认识或者不愿意画这个角色,提示词写得再精细也只是抽奖。
所以现在请教下佬,我感觉模型是认识这个角色的,也知道这个角色长啥样,就是不愿意画..大家有没破限提示词?比如我每次生图都带个破限提示词会不会就好了?
或者干脆放弃生图这个技术路线,改为爬取头像。当然能够通过角色名稳定匹配头像或官方立绘的数据源通过API调用就好了。或者页面结构相对稳定,数据比较多的WIKI类的动漫库,能够程序化去抓过来用。
或者是我想复杂了?就是模型用错了:会不会有能力强似GPT但是道德水平堪比grok的生图模型?本地生图我肯定干不起,我是集成显卡 ^-^ 因为我只有CPA反代和Grok2api,所以其他生图模式都没尝试过
请教下大家:实际做酒馆、动漫角色聊天或者角色一致性生图时,是怎么解决这个问题的。万分感谢!