ChatGPTやGeminiでテキスト⇒JSON形式⇒画像生成が高精度

ChatGPTやGeminiで画像生成する際、テキストから直接生成するのではなく、一度JSON形式のプロンプトを出力させてから画像化する手法がXで話題だ。JSON経由だと文字化けしにくく、修正時の精度も上がる。架空の化粧水チラシを例に、Gemini 3.1 Proなどで検証すると高品質な広告画像が生成できた。さらに「100名の反響」など数値をKPIとして与えると比較基準が生まれ、AIがより良いデザインを段階的に提案する。JSONベースなら環境が変わっても再現性が保てる利点もある。
GPT-Image2文字入り生成画像をテキストベースで修正する裏技
https://yokotashurin.com/etc/ai-generated-image.html
の続報で、詳しくは15分の動画で解説しました。
https://www.youtube.com/watch?v=IdTTf0Jc1II
0:00 📱 導入・今回のテーマ紹介 0:29 💡 JSON経由で画像生成する話題の発端 2:19 🧴 架空の化粧水チラシ企画を作成 2:41 🖼️ 通常版:テキストから直接画像生成 3:52 📝 JSON形式でプロンプトを先に出力 4:53 ✨ JSONプロンプトから画像生成した結果 5:53 🔷 GeminiでJSON経由の画像生成を検証 7:07 🎨 Geminiの生成品質を比較・評価 8:36 🔄 修正を見据えたJSON先出しのメリット 9:33 📊 比較基準=数字を与える重要性 10:44 📈 反響数を上げてデザインを改善させる 12:36 🛠️ JSONベースでの修正指示のメリット 13:33 🖋️ チラシ=画像×文字の組み合わせ論 14:39 👋 まとめ・締めの挨拶
ChatGPTやGeminiでテキスト⇒JSON形式⇒画像生成が高精度
今からと明日の朝6時からダブルで
上越市倫理法人会の講演です(笑)
イーンスパイアの横田です。
https://www.enspire.co.jp/

内容は2回とも違います。
さて、本題です。
GPT-Image2文字入り生成画像を
テキストベースで修正する裏技の
軸編と、更に改善するノウハウは?
ChatGPTやGeminiでテキスト⇒JSON形式⇒画像生成が高精度
画像生成はテキストよりJSON経由が精度UP!Xで話題の裏技を検証
ChatGPTやGeminiで画像を作るとき、テキストから直接ではなく、いったんJSONを生成→その JSON から画像生成した方が良いのでは?という議論が盛り上がっています。
基本の仕組み
画像生成ボタンを押した瞬間、裏ではJSONプロンプトが動いている。だから生成後に直したいなら、元のJSONを逆引きして文字を修正→再生成すれば元に戻せる。
逆引きできるなら――最初からJSONで出させて、それを画像化すれば逆引きすら不要。ステップは1つ増えるが精度が上がる、という考え方です。
なぜテキスト(JSON)経由が強い?
文字をテキストとして持たせておくと文字化けしにくい。従来DALL-E3などで崩れていた日本語文字が、GeminiのNano-BananaなどでもJSON記述により安定して出せるように。
Claudeでマーケ要素を全部盛り込んだ企画書を作成。架空商品「AQUA VEIL 薬用保湿化粧水/3,980円」を題材にしました。
👉 一発でOKならそれでよいが、次の修正の精度まで見据えるなら、最初からJSONで出させておくのは悪くない選択。
一発出しの弱点は比較基準=データを与えていないこと。見た目だけで良し悪しを判断せず、数字(KPI)を渡すのがコツ。
「100名 → 150名 → 200名…」と反響目標を上げていくと、AIはCTAを2種に分ける・オファーを強調・限定感を上部に、など具体的に改善案を出してくる。
数字を大きくするほど、より練られたデザインを引き出せる。KPI(問い合わせ数・反響数)を基準にすると◎。
チラシは画像と文字の2要素の組み合わせ。文字はAIがほぼ学習済みだが、画像+文字の組み合わせパターンは未成熟。
- JSONベースで訂正指示が出せる(「この字を大きく」等が反映されやすい)
- テキスト修正時の文字化け・別箇所変化が起きにくい
- JSONデータを添付すれば環境が変わってもブレない
- 別チャット・別の人でも同じ結果を再現しやすい(メモリ差の影響を回避)
- セミナーや商品開発で複数部署に同じものを共有する場面に有効
画像生成の呪文はこれ 👇
「JSONプロンプト形式で出力してから画像生成して」
これで精度が変わったよ、という方はぜひコメントを!
ChatGPTやGeminiでテキスト⇒JSON形式⇒画像生成が高精度
- はじめに
- XでバズったJSONプロンプト画像生成、その発端は1ヶ月前の私のブログだった
- 架空の化粧水チラシで実験!ChatGPTとGeminiでJSONプロンプトを試す
- 一発出しの落とし穴と「数値」で比較基準を与えるという発想
- JSONプロンプトが真価を発揮するのは「修正」と「環境が変わる場面」
- おわりに
- よくある質問(Q&A)
はじめに
こんにちは。今日もネットビジネスに関する情報を生中継で15分間お届けしてまいります。2026年7月15日水曜日、今日は最近Xで大きな話題になっているテーマを取り上げます。それが「ChatGPTやGeminiで画像を生成するとき、テキストから直接画像を作るのではなく、いったんJSONを経由させたほうがいいのではないか」という議論です。「JSONって難しそう」「プログラミングの話でしょ?」と身構えてしまう方もいるかもしれません。でも安心してください。今日お話しするのは、コードを書くような難しい話ではなく、AIに与える「呪文」を少し工夫するだけで、生成画像のクオリティがグッと上がるという、とても実用的な内容です。実は、この話題のおおもとは、ちょうど1ヶ月前に私が書いたブログ記事なんです。架空の化粧水チラシを題材に、実際の画面を見ながら一緒に検証していきましょう。ぜひ最後までお付き合いください。よろしくお願いいたします。
XでバズったJSONプロンプト画像生成、その発端は1ヶ月前の私のブログだった
さて、早速ですが本題に入っていきます。今Xで何が話題になっているかというと、ChatGPTやGeminiで画像生成する際に、テキストから画像を生成しないで、テキストからJSONを生成して、そのJSONから画像を生成したほうがいいんじゃないか、ということが議論されているんですね。これが今、すごくXで話題になっているわけです。
でも、これはそもそもどこから来た話なのか。実はこちらなんですよ。ちょうど1ヶ月前の2026年6月15日に、僕が書いたブログ記事があります。「GPT-Image2で文字入り生成画像をテキストベースへ修正する裏技」という記事です。この中で、JSONという言葉自体はタイトルでは隠しているんですけど、記事の中にはしっかり出てきているんですね。
このJSONの言葉が出てくるところで、JSONで直す方法について説明したんですよ。というのは、元々はテキストから画像生成するときに、画像生成ボタンを押した瞬間に裏で動いているのは、このJSONプロンプトなんですね。だから、画像生成した後に修正したいのであれば、その画像の元であるJSONプロンプトを、逆にですね、逆引きさせて、そしてそこにある文字、テキストを修正すれば、画像を生成し直したときにちゃんと元に戻るよ、ということについて説明したんですよ。これが基本の考え方になります。
そして、これができるということは何を意味するのか。それが今日の話の核心なんです。つまり、最初にテキストから画像生成をするのではなくて、JSONプロンプトで一度出させて、それを画像生成すれば、さっきのように逆引きする必要すらないじゃないか、ということなんですね。ただ、作るまでのステップが1個増えるんですけど、この方が精度が上がるということで、いわゆるビフォーアフターとして、JSONプロンプトを使う場合・使わない場合の2枚の写真を投稿して、「どっちがいい?」といったことで、結構Xで話題になっているんですね。ということで、今日はこの話を少ししていきたいなと思いますので、よろしくお願いいたします。
架空の化粧水チラシで実験!ChatGPTとGeminiでJSONプロンプトを試す
では、まずはこちらから見ていきたいと思うんですけど、ちょっと架空の企画を考えます。こんな形で、架空で化粧水のチラシを作りたいので、マーケティング的に全ての条件が入った企画を作って、というのをClaudeでやってみました。「化粧水のチラシ企画書」ということで作った内容がこちらです。
まず商品概要として、商品名はAQUA VEIL(アクアヴェール)薬用保湿化粧水、価格は3,980円(税込/150ml)、ターゲットは30〜45歳女性で、乾燥と初期エイジングサインに悩む層としました。
そしてマーケティング要素のチェックリストが続きます。1つ目はキャッチコピー(ヘッドライン)で、「夜、たっぷり。朝、まだ潤ってる。」というコピー、サブに「72時間うるおいベール処方」。2つ目はベネフィットで、機能ではなく結果を訴求するという観点から、朝のメイクノリが変わる、乾燥小じわを目立たなくする(効能評価試験済み)、1本で化粧水+美容液の役割、といった内容です。3つ目は独自性(USP)で、セラミド3種+ナイアシンアミド配合、角層深部まで浸透する「レイヤードモイスト処方」。4つ目は信頼性(エビデンス)で、使用者満足度94.2%(自社調べ/n=520)、@cosmeベストコスメ化粧水部門1位(架空)、皮膚科医監修/アレルギーテスト済み。
さらに5つ目はお客様の声で、「夕方の乾燥崩れがなくなりました」(38歳・会社員)、「敏感肌でもしみなかった」(42歳・主婦)。6つ目はオファー(特典)で、初回限定1,980円(50%OFF)+送料無料、さらに今ならトライアル美容液(7日分)プレゼント。7つ目は限定性・緊急性で、7月31日まで、先着1,000名様限定。8つ目はリスクリバーサルで、30日間全額返金保証(開封後でもOK)。9つ目は行動喚起(CTA)で、今すぐお申し込み、フリーダイヤル0120-XXX-XXX(24時間受付)、QRコードで30秒で注文完了。そして10個目は追伸(P.S.)で、「返金保証があるので、実質ノーリスクでお試しいただけます」といった具合です。
レイアウト構成もA4片面で決めていて、上部30%にキャッチコピー+商品ビジュアル、中部40%にベネフィット3つ+成分図解+エビデンス、下部20%にお客様の声+オファー(赤枠強調)、最下部10%にCTA(電話番号・QR)+返金保証バッジ。配色はホワイト基調+アクアブルー(清潔感)+オファー部分のみ赤(注意喚起)、という感じで、細かい条件がここに全部出ているんですね。
これでチラシを作ってみたよ、という話がこの後になるわけです。じゃあ早速いきましょう。この内容を、そのまま全部コピーします。コピーしたら、ChatGPTを出しますね。今回はまず普通バージョンでやります。何もしないでこの内容で作ってみたいと思うんですけど、ここで普通に画像生成にチェックをつけまして、こんなプロンプトを入れています。
「30代の女性が読む雑誌、A4の月間雑誌に1ページ1面で広告を出します。発行部数は10万部です。70名の申し込みと30名の問い合わせで合計100名の反響があるデザインを、以下の商品で作って」と。そして以下に先ほどの企画を入れました。これでちょっと押してみます。ちなみに今、僕はモードを「高」にしています。高いモードにした状態でやってみます。
エンターを押しますね。そうすると、ここで「思考中」と出まして、ここで動いているものこそが、さっき言ったJSONプロンプトなんですね。これをやっていると時間がかかるので、やらせている間に次の話をしたいと思います。それがこちらです。今、出てくるデザインとレイアウトが見えていると思うんですけど、裏で動いているものを見ると、ここにJSONプロンプトで書いていっているわけですよ。
これをずっと書いていくんですけど、これを先に出させようというのが、次のこちらになります。ここでまず、画像生成する前にプロンプトをJSON形式で出力して、と。画像生成にはチェックをつけないで、やってみました。そうすると、こんな形です。見えますかね、HTMLみたいな形で出てきました。この中に事細かく日本語が入っていて、どういう指示を与えるか、どういうテキストを載せるか、ということがずっと指示されているんですね。
こんな感じで出ていて、ここで重要なのは、テキストとして出させておけば文字化けする可能性が低いということです。これを画像として出させようとすると文字化けしてしまうのが、いわゆるDALL-E3などだったんですけど、これがGeminiのNano-Bananaでできるようになったのが、このJSONプロンプトで書くという方法なんです。このような形でやってみました。
そして、この一度JSONプロンプト形式で出させておいたものを、内容丸ごとコピーして、画像生成するにチェックをつけてもらうと、これが出てきたんですね。どうでしょうか。ちょっと拡大しますね。拡大すると、「夕方になると肌がカサつくあなたへ」ということで、「夜たっぷり、朝まだ潤ってる」「72時間潤いベール処方」という感じで出てきているんですけど、どうでしょうかね。まあまあいい感じで出ているんじゃないかなと思うんですけど、こんな形が出てくるわけです。
じゃあ今JSONプロンプトを使ったんですけど、使わなかったらどのクオリティが出るか、ということでやってみたいと思うんですね。今まだ生成中ですね。これがどうなるか、できたらお見せしたいと思います。
じゃあ、これと同じことをGoogleのGeminiでやったらどうなるか、ということでもやらせていました。こちらをご覧いただきたいと思うんですけど、同じ例文ですね。まず画像生成する前にプロンプトをJSON形式で出力して、という風に言ってみました。そうすると、「ご提示いただいた商品ガイド、マーケティング要素をもとに、A4サイズの雑誌広告のメインビジュアル上部30%に使用する画像生成プロンプトを作成しました」という風に出ているんですけど、その案がここに出てきているんですね。
続いて「100名の反響を獲得するためのA4片面のデザインを高性能でご提案します」ということで、上部30%だけじゃなくて、中部と下部の案も出てきているんですね。じゃあこれでOKだから、これで画像生成して、と言ってみたらですね、これが出てきたんですよ。見えますかね。ちょっと縮小しましょうか。縮小していますけど、これ良くないですか。
あれ、Gemini、いつの間にこんなに賢くなったの、という気がするんですけど、今、僕はGeminiの有料プランで、3.1 Proにして、さらにこのExtended Thinking、拡張思考モードの拡張にチェックをつけた状態にしていますけど、どうですかね。文字化けなんかも全然していない気がするんですけど、かなり良くなりましたね。かなり良くなっています。ということで、意外にGeminiもまだいけるんじゃないの、という話ですね。これ、どっちでもいいですよね。
こっちの方が若干、僕は精錬されている気がするんですけど、あと画質がいい気がします。なんかメリハリがある。こっちの方がちょっと、なんとなく少し滲んでいるというか、メリハリ感がちょっと足りないけど、でもまあチラシとしてはよくできているんじゃないでしょうか。というものが出てきたんですね。ChatGPT側もできました。どうでしょうか。これ悪くないですよね。だから、JSONプロンプトで出させなくても、かなりクオリティの高いものが出てきているんじゃないかなと思うんですね。
一発出しの落とし穴と「数値」で比較基準を与えるという発想
で、これどっちがいいか。これがいいのか、これがいいのか、ちょっと分からないんですね。こっちの方が若干、ぼやっとしているかな、という気もするけど、気のせいかな。ほぼ分からないですね。だから推測で元に戻さなきゃいけないんですけど、最初から出させたJSONプロンプトのものをちゃんと覚えさせておいて、それで画像生成したほうが、さらに次の修正のときの確率が、精度が上がるんじゃないかなと思うんですよね。
なので、一発でいいものが出るということでOKならばそれでいいんですけど、実際そうではないので。であれば、最初からJSON形式で出しておく、というやり方をするのも悪くないかなと思うわけです。こっちの方が若干、文字数が少ないので、Geminiの方が少し足りない気がするんですけど、でもまあクオリティで言えばそんなに悪くないかなと思います。
じゃあ、ここからどういう風に考えなきゃいけないか、という話なんですね。これは僕が前にも動画で話したように、一発出しをしたら何がいけないかというと、比較基準を与えていない、データを与えていない、ということなんですね。なので、これがいいか悪いかを、見た目のデザインだけで決めなきゃいけなくなる。でも、ここで比較基準を与えるということは、つまり数字を与えなきゃいけないんですね。
なので、数値を少し足していきたいと思うんですけど、例えばこちらの、同じもので作ったものがあるんですけど、これでこういう風に言っていきたいと思います。これは100名が反応するようなデザインを作ってくれたんですけど、今度は逆に、150人の人に反響があるデザインに変えて、と言ったら、これが150人のデザインです、という風に言うんですよ。それが合っているかどうかは分からないけど、これ、人間でも同じですよね。もっといいチラシを作るけど、それがいいかどうかなんて実際テストしなきゃわからないので、これと同じですね。ではAIなりに考えて、これがいいんじゃないか、という案を出してきたわけです。
さらに、ここで「どこを改善したか教えて」と言うと、改善点をこう言ってきます。例えばCTAを2種類に分けたとか、オファーをさらに目立たせたとか、限定感を上部に強化したとか、いろんなことが書いてありますので、「これしたらいいんでしょ」ということでやったようなんですね。じゃあ今度は、合わせて200名に反響があるデザインに変えて、と。画像を生成する。まずはJSON形式でプロンプトを生成してから画像生成してね、という感じで言ってみました。そうすると、これが出てくるんですよ。
これね、正直言うと、この1つ前のものと何が違うのか、なかなか比較したら難しいんですけど、これ、個人的にはモデルさんが良くなりましたね、モデルさん。ぜひ皆さんも比較してみていただきたいと思うんですけど。そうすると、これを200でOKだったら、今度は250とか300といってみましょうね、という話を以前にもしましたよね。つまり、数値を与えると、その数字を大きくすることによって、もっとクオリティの高い、もっとすごいデザインを考えさせることができるんですね。これを言わないと、「もっといいのを作って」ということはできるけど、何をもって「もっといい」とするのかを言いづらいので。
だから、1番の目的である、このチラシを通して何を目指したいか、というときの、いわゆるKPIという数字を決めなきゃいけない。これが仮に問い合わせの数とか、反響数というものがあれば、その反響数を基準に、どんどんいいデザインを考えてもらう、ということをするといいんじゃないかなと思うんですよね。こういうやり方があります、ということなんです。
JSONプロンプトが真価を発揮するのは「修正」と「環境が変わる場面」
はい、で、ここでこっち側の方もそうなんですけど、JSONプロンプトを出させておくと、そうするとJSONプロンプトベースで訂正の指示が出せるんですね。ここのJSONプロンプトベースで、ここの部分をJSONプロンプトベースで直して、という風に言ってもらうと、ここの字を大きくしますとか、ここのコピーを変えますとか、ということを言ってくると思うんですよ。それで画像生成させた方が、テキストの修正のときの、いわゆる文字化けするとか、違うところが変わってしまう、ということが起きにくいと思うんですよね。
なので、チラシっていろんなものがありますけど、反応を得るチラシを作るというのは大きいわけで、そこには2つの要素があります。画像という部分と、文字という部分。この2つの組み合わせでできていますよね。もちろんそれ以外にもいろんな要素、色合いとかあるかもしれませんけど、大きくはこの2つです。文字の方は基本的にほぼ全部AIによって学習できているんですけど、画像の方は全然できていないし、その組み合わせのパターンも全然できていない可能性があるんですね。
なので、今みたいに基準を与えて、「もっといいの、もっといいの」と言ってもらうと、それが出てくると。で、それをテキストベースでやるんだったら数字しかないんだけど、そこにテキストベースではなく、JSON形式のデータを添付していくと、そうすると環境が変わっても起きない、ということなんですね。
今だったら、このチラシのチャットを作ると、チャットの中は同じProで動かしていいと思うんですけど、これが違うチャットとか、違う人になったら、このメモリが入っていない分だけ答えが変わっちゃうわけですね。なので、セミナーだったり、もしくは商品開発でいろんな部署の人に、同じものを見せて話をしたい、という場合は、どうしてもその人に合わせた方がいいということになるので、その人のデザインだったり、テンプレートだったりというものを参考にしながら作っていく、ということもできるんじゃないかなと思います。
はい、ということで、今日は画像生成の仕方ということでお話ししたんですけど、ぜひ皆さんも、呪文のような形で「JSONプロンプト形式で出力してから画像生成して」という風に言ってみて、変わったよ、という方はぜひコメントください。
おわりに
今回は、Xで話題の「JSONプロンプトを経由した画像生成」について、架空の化粧水チラシを題材に検証しました。ポイントは、テキストから直接画像を作るのではなく、いったんJSON形式でプロンプトを出力させ、それをもとに画像生成するという一手間です。この方法だと文字化けが起きにくく、後からの修正もJSONベースで指示できるため精度が安定します。ChatGPTでもGeminiでも、思いのほか高品質なチラシが生成でき、特にGemini 3.1 Proの進化には驚かされました。さらに大切なのは、一発出しに頼らず「100名→150名→200名」と反響数という数値=KPIを与えることで、AIに比較基準を持たせ、デザインをどんどん磨いていくという発想です。そしてJSONデータを添付しておけば、チャットや担当者が変わっても再現性を保てる。セミナーや商品開発など、複数人で同じ成果物を共有したい場面でこそ真価を発揮します。ぜひ皆さんも「JSON形式で出力してから画像生成して」という呪文を試してみてください。
よくある質問(Q&A)
Q1. JSONプロンプトを経由すると、具体的に何が良くなるのですか?
A. 最大のメリットは、テキストの文字化けが起きにくくなることです。画像に文字を直接描かせようとすると崩れやすいのですが、いったんJSON形式でテキストとして出力しておけば正確に保持されます。さらに、後から修正するときもJSONベースで「ここの字を大きく」「このコピーを変えて」と指示でき、他の部分が意図せず変わってしまうリスクが減ります。
Q2. ChatGPTとGemini、どちらがチラシ生成に向いていますか?
A. 今回の検証では、どちらもかなり高品質でほとんど差が分からないレベルでした。ChatGPTの方が若干メリハリや画質が良い印象で、Gemini(3.1 Pro+拡張思考モード)も文字化けなく非常によくできていました。文字数はGeminiの方がやや少なめに感じる場面もありましたが、クオリティ面では甲乙つけがたく、どちらも実用に足ります。
Q3. 「反響数を与える」とは、どういう意味ですか?
A. 「100名の反響があるデザインを作って」のように、達成したい数値目標(KPI)をAIに伝えるということです。数字がないと「もっといいものを」と頼んでも基準が曖昧になりますが、「150名」「200名」と数値を上げていくことで、AIに比較基準を与え、より練り込まれたデザインを引き出せます。人間が実際にテストして良し悪しを判断するのと同じ考え方です。
Q4. JSONプロンプトを使わずに一発出しでは、なぜダメなのですか?
A. 一発出しが必ずしもダメというわけではなく、実際そのままでも高品質なものが出ます。ただ、比較基準やデータを与えていないため、見た目だけで良し悪しを判断するしかなく、修正時に推測で元に戻す必要が出てきます。最初からJSONを出させておけば、その後の修正の精度が上がるという点で有利になります。
Q5. なぜ「環境が変わっても再現できる」ことが重要なのですか?
A. 同じチャット内なら文脈(メモリ)が引き継がれますが、別のチャットや別の担当者になると、その情報がない分だけ結果が変わってしまいます。JSON形式のデータを添付しておけば、環境が変わっても同じ基準で生成でき、再現性が保てます。セミナーや商品開発で複数の部署・人に同じ成果物を共有したい場面で特に役立ちます。
ChatGPTやGeminiでテキスト⇒JSON形式⇒画像生成が高精度

🖼️ 画像生成
テキストや指示をもとにAIが画像を作り出す技術です。ChatGPTやGeminiに文章で指示を与えると、その内容に沿ったイラストや写真、広告デザインなどを自動生成します。近年は文字入りの画像も精度高く作れるようになり、チラシや広告制作など実務での活用が広がっています。
📋 JSONプロンプト
JSONという構造化されたデータ形式で書かれた画像生成の指示文です。実は画像生成ボタンを押した瞬間、裏側ではこのJSONプロンプトが動いています。これを先に出力させてから画像化すると、後で逆引きする手間が省け、生成精度が上がるという考え方が本テーマの中心です。
🔤 文字化け
本来表示されるべき文字が、意味不明な記号や崩れた表記になってしまう現象です。画像内にテキストを描かせると起きやすい問題ですが、JSON形式でテキストとして先に出させておくと発生確率が下がります。文字入り広告を作る上で重要なポイントになっています。
🍌 Nano-Banana
GoogleのGeminiに搭載された画像生成モデルの通称です。かつてDALL-E3などで文字化けしていた文字入り画像も、このモデルとJSONプロンプトの組み合わせで綺麗に生成できるようになりました。本編でも高品質なチラシ画像を出力し、その進化ぶりが紹介されています。
🔍 逆引き
生成された画像から、その元になったJSONプロンプトをたどって取り出す作業です。画像を修正したい時、元のJSONを逆引きしてテキスト部分を直せば、崩れずに画像を作り直せます。ただし最初からJSONで出させておけば、この逆引きの手間自体が不要になります。
📊 比較基準
デザインの良し悪しを判断するための物差しとなる基準のことです。一発出しの画像は見た目だけで評価するしかありませんが、「100名の反響」といった数値を与えると比較基準が生まれます。これによりAIが改善の方向性を持って、より良いデザインを提案できるようになります。
🎯 KPI
Key Performance Indicatorの略で、目標達成度を測る重要業績評価指標です。チラシ制作なら申込数や問い合わせ数、反響数などがこれにあたります。KPIとなる数値を設定してAIに与えることで、その目標に向けてデザインを段階的に洗練させていくことができます。
💧 AQUA VEIL
本編で例として使われた架空の薬用保湿化粧水の商品名です。価格や成分、キャッチコピー、オファーまで細かく設定された企画書をもとに、実際にAIでチラシ広告を生成する検証素材として登場します。マーケティング要素を網羅した実践的なサンプルになっています。
🔄 拡張思考モード
AIがより深く考えてから回答を出す高性能な処理モードです。GeminiではExtend Thinking、有料プランの3.1 Proと組み合わせることで、文字化けの少ない高品質なチラシ画像が生成できました。じっくり推論させることで、複雑な指示にも精度高く応えられるようになります。
🧠 メモリ
AIがそのチャット内でのやり取りや設定を記憶している情報のことです。同じチャット内なら一貫した結果が得られますが、別のチャットや別の人が使うと記憶が引き継がれず答えが変わります。JSON形式のデータを添付しておけば、環境が変わっても再現性を保てる利点があります。
ChatGPTやGeminiでテキスト⇒JSON形式⇒画像生成が高精度

ChatGPTやGeminiでテキスト⇒JSON形式⇒画像生成が高精度
JSONプロンプト画像生成とは?今Xで話題の理由
JSONプロンプトが画像生成AIで注目される背景
2026年に入り、X(旧Twitter)を中心に「画像はテキストから直接生成するのではなく、いったんJSONで出力させてから画像化した方がいい」という議論が急速に広がっています。きっかけは、テキストから画像を生成するボタンを押した瞬間、実はAIの裏側では自然言語がそのままJSON形式のプロンプトへと変換され、その構造化データをもとに描画が行われているという仕組みが広く知られるようになったことです。
つまり、私たちが「文章で指示している」つもりでも、AIは内部でそれをJSONという整理整頓されたデータに翻訳しているわけです。ならば最初から人間の側でJSONを出力させ、それを確認・編集してから画像化すれば、AIの解釈のブレを減らせるのではないか——これが議論の核心です。実際、同じ商品ビジュアルを「JSONあり」「JSONなし」で生成したビフォーアフター比較がSNSで数多く投稿され、多くのユーザーが精度差を実感しています。
かつてDALL-E 3の時代には文字入り画像は文字化けの温床でしたが、2026年現在、ChatGPTもGeminiもテキスト入り画像生成に対応し、マーケティングや広告制作に活用できるようになりました。この進化がJSONプロンプト活用の土台になっています。JSONは一過性の流行ではなく、AIの内部処理と人間の指示を橋渡しする実務的な手法として定着しつつあるのです。
自然言語プロンプトとの根本的な違い
自然言語プロンプトとJSONプロンプトの最大の違いは「構造」の有無です。自然言語は仕切りのないタッパーに全部入れるようなもので、被写体・背景・色・スタイルといった要素が一つの文章に溶け合っています。そのため複数の要素を指定すると、意図しない属性の混線が起こりやすくなります。
たとえば「赤い車と青い空」と指示したとき、一つの属性(色、質感など)が意図しないオブジェクトに適用されてしまう現象。例:「赤い車と青い空」→ 車が紫がかる、空が赤みを帯びるといった「色漏れ」が発生します。これは自然言語の曖昧さが原因です。 Techotakulab
一方でJSONは、要素ごとに明確な箱を用意します。最新の画像生成モデルはフロントエンドに大規模言語モデルを搭載しており、これらはGitHub上の膨大なコードで学習されているため、人間が書く曖昧な文章よりも、JSONやYAMLといった構造化データの方が「論理的」に理解しやすいという特性があります。LLMはコードを大量に学習しているからこそ、構造化データを「明確な契約」として受け取り、ランダム性を抑えた再現性の高い出力を返すのです。この違いを理解することが、JSONプロンプト活用の第一歩になります。
JSONプロンプトで画像生成するメリット
再現性と修正のしやすさが飛躍的に向上する
JSONプロンプトの最大の実利は「再現性」と「修正の容易さ」です。自然言語で一度いい画像が出せても、次に同じクオリティを再現するのは至難の業でした。俗にいう「画像ガチャ」で、たまたまいいタイミングで良い結果が出ていただけ、というケースが多かったのです。
JSONはこの問題を構造的に解決します。JSON形式でのフォーマットは自分で理解しやすい様に整形できるので要素の追加・変更が容易です。そしてJSONを使えば、プロンプトの特定の要素だけを狙い撃ちで修正できる」という、構造化データならではの真のメリットがあります。 ScombuScombu
これは実務で絶大な効果を発揮します。クライアントから「もう少し笑顔で」という曖昧な修正依頼が来ても、JSONなら"expression": "smiling"という具体的なタスクに一瞬で落とし込めます。「表情」というフィールドだけを書き換えれば、他の構図や背景を崩さずにピンポイントで調整できるのです。自然言語だと修正指示のたびに全体が変わってしまい、直したい箇所以外まで変化する「副作用」が起こりがちでしたが、JSONではその副作用が起きにくくなります。特に商品写真やSNSサムネイルなど、同じトーンで大量に生成する必要がある場面では、この再現性が生産性を根本から変えます。
文字入り画像の文字化けを防げる
JSONプロンプトが実務で最も評価されている理由の一つが、文字入り画像の文字化け対策です。チラシやバナー、アイキャッチ画像は「画像」と「文字」の二つの要素の組み合わせでできています。このうち文字の部分は、AIによる学習がほぼ進んでいるものの、画像との組み合わせパターンは十分に学習されていない可能性があり、テキストから直接生成すると文字化けが発生しやすいという課題がありました。
JSONプロンプトはここで威力を発揮します。ポイントは、テキストとして文字情報を先に出力させておけば、文字化けする可能性が低くなるという点です。DALL-E 3では文字化けの温床だった文字入り画像が、GeminiのNano Bananaなどでは、JSONプロンプトで文字情報を明示的に構造化することで安定して描画できるようになりました。
実際、テキスト入りバナーの生成品質では、テキストを含むバナー画像の生成においては、現段階ではGeminiの方が総合的に優れているという結果も報告されており、日本語コピー・ブランドロゴ再現・配色センスでGemini優勢とされています。JSONで「どのテキストを、どの位置に、どんなスタイルで」と分離して指定することで、AIは文字を画像の一部としてではなく明確な情報として扱い、結果として文字化けや誤字が激減するのです。
ChatGPTでJSONプロンプト画像生成をするやり方
ステップ1:画像生成前にJSON形式で出力させる
ChatGPTでJSONプロンプトを活用する基本手順は、「いきなり画像を作らせない」ことから始まります。まず画像生成のチェックを外した状態で、作りたい画像の企画内容を渡し、「画像生成する前に、プロンプトをJSON形式で出力してください」と指示します。
たとえば化粧水のチラシを作るなら、商品名・価格・ターゲット・キャッチコピー・ベネフィット・配色といったマーケティング要素を整理して渡し、JSON化を依頼します。すると、ChatGPTはHTMLのような階層構造で、どのテキストをどこに載せるか、どんな指示を与えるかを事細かに日本語で構造化して出力します。
このワンステップを挟む意味は大きく二つあります。第一に、画像化する前に「AIが何をどう理解したか」を人間が目視で確認・修正できること。意図と違う解釈があれば、この段階でフィールド単位で直せます。第二に、文字情報をテキストとして先に確定させることで、後の画像化での文字化けを防げること。実際、ChatGPTを経験されている方ならばこの手順の応用範囲の広さはすぐに理解できるはずです。まずJSONで設計図を作り、それを承認してから描画に進む——この順序が精度向上の起点になります。 Note
ステップ2:JSONをもとに画像生成を実行する
JSON形式でのプロンプト出力が完成し、内容に問題がなければ、次はいよいよ画像化です。出力されたJSONの内容を丸ごとコピーし、今度は画像生成のチェックをオンにした状態で「このJSONをもとに画像を生成してください」と指示します。
ここで重要なのは、ChatGPTのモード設定です。高精度な結果を求めるなら、思考モードを「高」に設定した状態で実行すると、JSONの各フィールドをより丁寧に解釈してくれます。生成には多少の時間がかかりますが、その間に裏側ではJSONプロンプトが動き、構造化された指示に忠実な画像が描画されていきます。
この方式の真価は、生成後の修正フェーズで発揮されます。最初からJSONを出力させておけば、「JSONプロンプトベースで、ここの部分を直して」という指示が可能になります。すると「ここの文字を大きくします」「このコピーを変えます」といった具体的な変更として反映され、テキスト修正時に文字化けが起きたり、意図しない箇所まで変わったりする事故が起きにくくなります。ベースとなるJSONがガイドラインとして存在するおかげで全体の構成からブレることなく、狙った箇所だけを精密に調整できるのです。一発で完璧を狙うのではなく、JSONを土台に対話的に仕上げる——これが実務で成果を出すワークフローです。
GeminiのNano BananaでJSONプロンプトを使う方法
Geminiで高品質な文字入り画像を生成する手順
Geminiでも手順の骨格はChatGPTと同じで、「まず画像生成する前にプロンプトをJSON形式で出力してください」と指示するところから始まります。GeminiはNano Banana Pro(正式名称Gemini Flash Image系)を搭載し、日本語の理解力と描画品質が近年大きく向上しました。
実際に化粧水チラシのような文字入り広告を作らせると、Geminiは上部・中部・下部といったレイアウト領域ごとに構造化された案を提示してくれます。有料プランでPro系モデルを選び、拡張思考(Extend Thinking)モードにチェックを入れた状態で生成すると、文字化けもほとんどなく、メリハリのある高画質な仕上がりが得られます。実務レベルの完成度で、JSONを介さなくてもかなりのクオリティが出るほど賢くなっているのが2026年時点の実感です。
Geminiが選ばれる理由はコスト面にもあります。Geminiは「Googleアカウントさえあれば誰でも完全無料」「文字入れの指示も日本語でサクッとできる」「ブラウザ上で文章のやり取りの延長でサクサク生成できる」という手軽さがあり、日々コンテンツを量産するメディア運営者にとって大きな武器になります。JSONプロンプトと組み合わせれば、この手軽さに再現性と精度が加わり、ブログのアイキャッチや広告バナーを安定して内製できるようになります。
GeminiでJSONを書くときの注意点
GeminiでJSONプロンプトを使う際は、いくつかのコツを押さえると精度が安定します。まず前提として、GeminiはJSONの記法に厳密でなくても、Nano Banana Proは賢いので、多少の書き間違いは補完してくれることが多いため、完璧なJSON構文でなくても機能します。プログラミング未経験でも臆する必要はありません。 N1110 Art Lab
具体的な注意点は主に三つです。第一に、入れ子構造を使いすぎないこと。階層が深すぎると逆にAIが混乱するため、2〜3階層程度に収めるのが適切です。第二に、項目名も値も日本語でOKである点。Nano Banana Proは日本語を理解できるので、項目名も値も日本語で大丈夫です。無理に英語化する必要はありません。第三に、JSONの前に「以下のJSON形式で画像を生成してください」と一言添えると、AIが意図をより確実に汲み取ります。 N1110 Art Lab + 3
さらにGeminiの柔軟性を活かすなら、標準的なキーに加えて独自のキーを追加しても、Geminiは柔軟なので、このようにJSONのキーを独自に追加しても、文脈から意図を汲み取って反映してくれます。この寛容さこそGeminiでJSONを扱う際の強みで、厳密な構文よりも「何を伝えたいか」を優先して書けるのが実務での使いやすさにつながっています。 Scombu
画像生成JSONプロンプトのテンプレートと比較検証
コピペで使える汎用JSONテンプレート
JSONプロンプトを本格活用するなら、毎回ゼロから書くのではなく、汎用テンプレート(スキーマ)を用意しておくのが効率的です。作成したJSONプロンプトは、あなただけの「画像生成テンプレート」になり、被写体や背景といった中身のフィールドを書き換えるだけで、一貫性のある画像を安定して量産できます。
基本となる構造は、被写体(subject)、背景(background)、カメラ(camera)、照明(lighting)、スタイル(style)、品質(quality)といったフィールドで構成します。たとえば「ファンタジー風の背景」というテンプレートを一度作っておけば、どんなキャラクターを描くときでも使い回せます。パーツごとにテンプレートを管理すれば、組み合わせ次第で高品質な画像を安定して生成でき、この効率化が実務での生産性を大きく押し上げます。
さらに精度を追求するなら、色指定にHEXコード(例:#F8F8F6)を加える方法も有効です。自然言語プロンプト・JSONプロンプトのいずれでもHEXコードでの色指定は反映されやすく、ブランドカラーを正確に再現したい広告制作では特に重宝します。テンプレートをGitのようにバージョン管理すれば、数ヶ月後でも同じ画像を再現でき、チームでの共有やレビューも容易になります。プロンプトを「使い捨ての呪文」から「資産としての設計図」へと変えるのがテンプレート化の本質です。
JSONと自然言語、結局どちらを使うべきか
最後に、JSONと自然言語のどちらを選ぶべきか、という実務判断を整理します。結論から言えば、両者は優劣ではなく「用途による使い分け」の関係にあります。
JSONの強みは精密な制御と再現性です。精密な制御:JSONはパラメータを明確に定義できるため、画像のスタイル、解像度、色調、構図などを細かく指定可能で、再利用性:設定をJSONファイルとして保存・共有でき、同一条件での生成が容易という利点があります。商品写真の大量生成、一貫したキャラクター、ブランドを跨いだキーアートなど、スケールと一貫性が求められる場面ではJSONが最適です。 AIGenArtAIGenArt
一方で自然言語には、初心者でも簡単に使える。素早い試行が可能という直感性があります。ラフなアイデアを素早く形にする段階では、自然言語のほうが向いています。実際、最新のGeminiは自然言語でも十分高品質な画像を出せるため、一発で満足いく結果が出るならJSONを介さなくても構いません。 AIGenArt
現実的なベストプラクティスは、参照ファイルの実演でも示されたように「一発出しに満足できない、あるいは修正・再現・共有が必要になった段階でJSONに切り替える」ことです。特にセミナーや商品開発で複数の関係者に同じ画像を見せる場合、チャットのメモリに依存しない自己完結したJSONデータがあれば、環境や担当者が変わっても結果がブレません。両者を補完的に使いこなすことが、2026年の画像生成における最適解です。
ChatGPTやGeminiでテキスト⇒JSON形式⇒画像生成が高精度












#GPTImage2 #ChatGPT #横田秀珠 #ChatGPTセミナー #ChatGPTコンサルタント #ChatGPT講座 #ChatGPT講習 #ChatGPT講演 #ChatGPT講師 #ChatGPT研修 #ChatGPT勉強会 #ChatGPT講習会















