テック&ガジェット

ChatGPTはこの数年で何が変わったのか?日本から見た生成AIの進化

ChatGPTはこの数年でどこまで進化した? 2022年の登場から現在までを振り返る

ChatGPTが一般公開されたのは2022年11月30日です。まだ4年も経っていないのですが、最初のChatGPTを使っていた頃を思い返すと、今とはかなり別物だったように感じます。当時は日本でも「AIと普通に会話できる」「文章を書かせるとすごい」と話題になりました。一方で、存在しない本を平然と紹介したり、簡単な計算を間違えたり、少し複雑な条件を与えると途中で忘れてしまったりと、かなり不安定でもありました。画像生成AIも同じです。人間の指がおかしくなったり、文字が謎の記号になったり、「スパゲッティを食べている人」のような日常的な場面ですら、フォークと手と麺と口の関係がおかしくなったりしていました。

それが今では、Webを検索して最新情報を調べ、PDFや表計算ファイルを読み、画像を理解し、画像そのものを生成し、プログラムを書き、ブラウザまで操作するようになっています。改めて振り返ってみると、この数年間で進歩したのは単純な「頭の良さ」だけではありません。ChatGPTに任せられる仕事の範囲そのものが、ものすごい勢いで広がっています。

最初のChatGPTは「ものすごく物知りだけど、平然と間違えるAI」だった

2022年11月30日に公開された初代ChatGPTは、GPT-3.5系列をベースにした研究プレビューでした。質問に答える、文章を書く、要約する、翻訳する、簡単なプログラムを書く。このあたりはすでにかなり優秀で、普通の日本語で会話できること自体に驚いた人も多かったと思います。それまでにも文章生成AIは存在していましたが、一般の人がブラウザを開いて、検索するのと同じくらい気軽にAIと会話できるようになったインパクトはかなり大きなものでした。

日本でも2023年に入ると急速に知られるようになり、「学生がレポートを全部AIに書かせるのでは」「プログラマーの仕事がなくなるのでは」「Google検索が不要になるのでは」といった話まで一気に広がりました。ただ、今のChatGPTと比べると初期はかなり危なっかしいものでした。存在しない本や論文を実在するように紹介する、架空のURLを作る、計算を間違える、長い会話になると最初の条件を忘れる、といったことも珍しくありませんでした。しかも厄介なのは、間違っていても文章そのものは妙に自然だったことです。これがいわゆる「ハルシネーション」です。

当時は基本的にテキストの世界に閉じていたので、今のように「分からないならWebで調べる」「Pythonで計算して確認する」といったこともできませんでした。今から見ると、初代ChatGPTはかなり高性能ではあるものの、あくまで「文章を生成するチャットボット」に近かったと思います。

GPT-4で「面白いAI」から「仕事でも使えそうなAI」になった

最初の大きな転換点が2023年3月14日に発表されたGPT-4です。GPT-3.5からGPT-4への進化は、実際に当時使っていた人ならかなり大きく感じたのではないでしょうか。複雑な指示への追従、文章の論理性、プログラミング、長い文章の理解などが明らかに改善されました。OpenAIが公表した評価では、GPT-4は米国の司法試験を模した試験で受験者の上位約10%に相当する成績を記録しています。GPT-3.5は下位約10%程度だったので、同じChatGPTと呼ばれていても能力差はかなり大きなものでした。

そして、この頃からもう一つ重要な変化が始まります。ChatGPTが「自分の頭の中にある知識だけで答えるAI」ではなくなっていったことです。2023年にはPluginsやWeb Browsing、Code Interpreterなどが登場しました。Web Browsingを使えばインターネットから情報を取得でき、Code InterpreterではPythonを実行して計算したり、CSVを分析したり、グラフを作ったりできるようになりました。

今では当たり前に感じますが、これはかなり重要な変化です。AI自身がすべてを知っている必要がなくなったからです。知らないことは検索する。複雑な計算はPythonに任せる。必要ならファイルを読む。現在のChatGPTにつながる「AIが道具を使って問題を解く」という考え方が、この頃から本格的に見えるようになりました。

画像生成AIも、最初はかなり変だった

AIの進化が一番分かりやすいのは、個人的には画像生成だと思います。初期の画像生成AIでは、人間なら当たり前に理解できる構造がよく崩れていました。有名なのが手や指で、指が6本になったり、左右の手が融合したり、腕が変なところから生えていたりしました。文字を書かせても、アルファベットのようでアルファベットではない謎の文字になることがありました。

食事の場面も苦手でした。例えば「スパゲッティを食べる人」を生成すると、一見するとそれらしい写真なのに、よく見るとフォークと手が融合していたり、麺が口とは違うところにつながっていたり、皿や食器の位置関係がおかしかったりしました。考えてみれば、「人がスパゲッティを食べる」という一枚の絵には、人物、手、指、フォーク、皿、麺、口という複数の物体があり、それぞれの位置関係まで正しく表現する必要があります。当時の画像生成AIは、全体として「それらしい画像」を作ることはできても、こうした細かな物理的・意味的関係を維持することが苦手でした。

今見ると笑ってしまう画像も多いのですが、生成AIがどれだけ進歩したのかを比較するには非常に分かりやすい例です。2023年にはDALL·E 3がChatGPTに統合され、画像生成用の特殊なプロンプトを一生懸命考えなくても、普通の言葉で「こんな画像を作って」と説明するだけで画像を作れるようになりました。さらに2025年3月にはGPT-4oによる画像生成が登場し、文字の描画、細かな指示への追従、画像編集、会話を続けながらの修正などが大幅に改善されます。数年前にはスパゲッティをまともに食べられなかったAIが、広告素材やイラスト、商品イメージ、インフォグラフィックまで作れるようになったわけです。

GPT-4oで「ChatGPT」という名前と実態が合わなくなってきた

2024年5月13日に発表されたGPT-4oも大きな転換点でした。「o」はomniを意味します。テキストだけでなく、画像や音声などをまとめて扱うマルチモーダルAIとして設計され、音声での応答速度も大幅に改善されました。写真を見せて「これは何?」と聞く。資料のスクリーンショットを見せて分析してもらう。音声で普通に会話する。こうなってくると、「ChatGPT」という名前と実際にできることが少しずつ合わなくなってきます。

名前にはChatと付いていますが、すでにチャットだけをするサービスではありません。画像を見て、音声を聞いて、ファイルを読み、Pythonを実行し、Webを検索する。ChatGPTはこの頃から「AIとチャットするWebサービス」ではなく、「AIを入口としてコンピューターを使う環境」に近づいていったように思います。

o1の登場で「すぐ答えるAI」から「考えてから答えるAI」へ

2024年9月にはo1-previewが登場しました。これもかなり重要な変化です。それまでのGPTシリーズとは少し考え方が違い、難しい問題について回答前の推論により多くの計算資源を使う「reasoning model」というカテゴリーが前面に出てきました。簡単に言えば、「すぐに答えを出す」のではなく、「少し時間を使って考えてから答える」モデルです。数学、科学、プログラミングなど、複数の段階を踏んで考える必要がある問題で特に強さを発揮しました。

ただ、この頃からChatGPTには別の問題も出てきました。モデルが多すぎるのです。GPT-4、GPT-4 Turbo、GPT-4o、GPT-4o mini、o1-preview、o1-mini、o1、o3-mini、GPT-4.1、GPT-4.1 mini、GPT-4.1 nano、o3、o4-miniなど、普通のユーザーからすれば「結局どれを選べばいいの?」という状態になりました。ChatGPTの進歩があまりにも速かったため、速いモデル、安いモデル、深く考えるモデル、プログラミングに強いモデル、画像や音声に強いモデルが次々に追加され、性能は上がる一方でモデル体系はかなり複雑になっていきました。

ChatGPT SearchとDeep Researchで「知らないことは調べるAI」になった

その後のChatGPTを考えるうえで重要なのがWeb検索です。ChatGPT Searchが登場し、さらにDeep Researchが加わったことで、ChatGPTは自分が知っていることを答えるだけでなく、Web上の情報を調査して回答する方向へ大きく進みました。Deep Researchでは、一つの質問について複数のWebサイトや資料を調べ、それらを整理して出典付きのレポートを作ることができます。

これは初期ChatGPTの弱点だったハルシネーションに対する一つの回答でもあります。もちろん現在でもAIは間違えますし、検索した情報を誤って解釈する可能性もあります。ただ、「昔学習した知識だけを頼りに答えるAI」と「必要ならその場で資料を調べるAI」では実用性がかなり違います。人間に例えるなら、すべてを暗記している人を目指すのではなく、「知らなければ自分で調べて、資料を比較して答えを出せる人」になってきた感じです。

Codexでプログラミングも「質問する」から「仕事を任せる」へ

プログラミング分野ではCodexの進化もかなり面白いところです。以前ならChatGPTにコードを貼って、「ここを直してください」と質問し、返ってきたコードを人間がコピーして自分のプロジェクトへ戻す、という使い方が中心でした。Codexのようなコーディングエージェントでは、その関係が変わります。AI自身が実際のコードベースを読み、複数のファイルを調べ、どこを修正するべきか考え、コードを書き、コマンドを実行し、テストまで行う方向へ進んでいます。

つまり「コードについて質問する」から「コードを書いてもらう」、さらに「開発作業そのものを任せる」への変化です。この3つは似ているようで、かなり違います。特に大きいのは、人間がAIとのやり取りを細かく管理する必要が減っていくことです。

https://chatgpt.com/ja-JP/atlas/

AgentとAtlasで、とうとうブラウザまでAIが操作するようになった

最近のChatGPTを象徴しているのがエージェント化です。Webを検索して「このホテルがおすすめです」と答えるだけなら従来のChatGPTでもできます。しかしエージェントが目指しているのはその先です。ブラウザを開く。Webページを読む。リンクをクリックする。必要な情報を探す。複数のページを比較する。外部サービスを利用する。人間が一つずつ操作方法を指示するのではなく、「最終的に何をしたいのか」を伝えると、AI自身が必要な手順を考える方向へ進んでいます。

2025年にはOperatorの技術などを取り込んだChatGPT agentが登場し、さらにChatGPTを中核にしたブラウザAtlasも登場しました。検索エンジンの代わりにAIを使うという段階から、ブラウザそのものにAIが入り込む段階まで来たわけです。ここまで来ると、2022年のChatGPTとはほとんど別のサービスです。

4年弱で「文章を書くAI」から「仕事を進めるAI」になった

ChatGPTの歴史を振り返ってみると、単純にモデルのIQのようなものが上がっただけではないことが分かります。2022年のChatGPTが持っていた中心的な能力は、文章を読んで文章を返すことでした。そこへWeb検索、画像認識、画像生成、音声認識、音声生成、Python、ファイル解析、長文処理、ブラウザ操作、外部サービス連携、コーディングエージェントなどが次々と追加されました。

かなり大ざっぱに分ければ、2022年は「話すAI」、2023年は「文章やコードを書き、道具も使い始めたAI」、2024年は「見て、聞いて、話して、深く考えるAI」、2025年は「検索して、調査して、コンピューターを操作するAI」、そして2026年は「複数の道具を組み合わせて仕事を進めるAI」という変化だったと思います。

初期には、もっともらしい嘘を答えたり、簡単な計算を間違えたり、画像では人間の指やスパゲッティすらうまく描けなかったAIでした。それが今では、Web上の大量の資料を調査し、画像を読み、コードを書き、ファイルを編集し、ブラウザを操作しながら、一つの仕事を進めるところまで来ています。

この数年間で本当に変わったのは、「AIがどれだけ賢くなったか」だけではないと思います。人間がAIに丸ごと任せられる仕事の大きさが、ものすごい速度で拡大した。これがChatGPTの進化を一番分かりやすく表している気がします。

ここからは、2022年のChatGPT公開から現在までに何が登場したのか、主要なモデルと機能を時系列でまとめてみます。

ChatGPTの進化年表

ここからは、2022年11月のChatGPT公開から現在までに何が起きたのかを時系列でまとめます。ChatGPTの場合、GPT-3.5からGPT-4、GPT-5へとモデルそのものが進化しただけではなく、Web検索、画像生成、音声、データ分析、Deep Research、Codex、Agent、Atlasなどが次々と追加されています。そのため、モデルと主要機能を一緒に並べた方が、この数年間の変化が分かりやすいと思います。

時期 モデル・機能 主な変化
2022年11月30日 ChatGPT公開 GPT-3.5系列をベースとした研究プレビューとして一般公開。質問、作文、翻訳、要約、簡単なコード生成などが可能になり、一般ユーザーが生成AIに触れる大きなきっかけになった
2023年2月 ChatGPT Plus 月額20ドルの有料プラン開始。以後、新しい高性能モデルや機能を有料ユーザーへ先行提供する現在の形ができていく
2023年3月14日 GPT-4 GPT-3.5から推論、指示追従、長文理解などが大幅に向上。画像入力にも対応するマルチモーダルモデルとして発表され、ChatGPTが仕事にも使えるという評価が広がる
2023年3月 Plugins ChatGPTから外部サービスを利用する仕組みを実験的に導入。現在の外部サービス連携やエージェントにつながる初期の試み
2023年春 Web Browsing ChatGPTがWebへアクセスし、学習時点以降の情報も調べられるようになる。「覚えている知識だけで回答するAI」から変化し始める
2023年7月 Code Interpreter Pythonを実行できるようになり、計算、CSV分析、グラフ作成、ファイル処理などが可能になる。後のAdvanced Data Analysisにつながる
2023年9月 画像・音声機能 ChatGPTに写真を見せて質問したり、音声で会話したりできるようになる。テキスト中心だったChatGPTがマルチモーダル化
2023年10月 DALL·E 3統合 ChatGPTとの会話から画像を生成できるようになる。画像生成専用の複雑なプロンプトを書かなくても、普通の言葉で画像を作りやすくなった
2023年11月 GPT-4 Turbo GPT-4を高速・低コスト化し、最大128Kのコンテキストにも対応。長い文章や大量の情報を扱いやすくなる
2023年11月 GPTs ユーザー自身が目的別のカスタムChatGPTを作成できるようになる
2024年5月13日 GPT-4o 「omni」を意味する新しい主力モデル。テキスト、画像、音声を統合して扱う方向へ進み、速度や多言語性能も改善
2024年5月 ChatGPT macOSアプリ ブラウザ中心だったChatGPTがデスクトップへ進出。PCで常時使うAIアシスタントに近づく
2024年7月 GPT-4o mini GPT-4o系列の小型・高速・低コストモデル。小型モデルでもかなり高い性能を出せるようになる
2024年7月 SearchGPT AIを中心にした検索サービスを試験公開。後のChatGPT Searchへつながる
2024年夏~秋 Advanced Voice Mode 従来よりはるかに自然で低遅延な音声会話が可能になり、「音声を文字起こしして回答する」方式からリアルタイムな会話へ近づく
2024年9月12日 o1-preview 回答前の推論に計算資源を使うreasoningモデルが登場。「すぐ答えるモデル」と「時間を使って考えるモデル」という新しい区分が生まれる
2024年9月 o1-mini 数学やプログラミングなどを意識した小型reasoningモデル
2024年10月 Canvas チャット欄とは別の作業スペースで文章やコードをAIと共同編集できる機能が登場
2024年10月31日 ChatGPT Search Web検索をChatGPT本体へ統合。最新情報を検索し、情報源を示しながら回答する現在のスタイルが本格化
2024年12月 o1正式版 reasoningモデルが実験的な存在からChatGPTの主要モデルの一つになる
2024年12月 ChatGPT Pro 高性能モデルを大量に利用するユーザー向けの上位プランが登場
2025年1月 Operator AIがブラウザ画面を見ながらクリック、入力、スクロールなどを行う研究プレビュー。「回答するAI」から「コンピューターを操作するAI」への転換点
2025年1月 o3-mini reasoningモデルをより高速・低コストにしたモデル
2025年2月 Deep Research 多数のWebページや資料をAIが自分で調査し、情報を整理して出典付きの詳細なレポートを作成できるようになる
2025年3月25日 GPT-4o画像生成 ChatGPTの画像生成が大幅に進化。文字、複数の物体、細かな指示、画像編集、会話を続けながらの修正などが改善
2025年4月 GPT-4.1 コーディング、細かな指示への追従、長大なコンテキスト処理を強化
2025年4月 GPT-4.1 mini / nano GPT-4.1を用途やコストに応じて小型化。モデルの細分化がさらに進む
2025年4月16日 o3 / o4-mini reasoning能力をさらに強化。特に重要なのは、推論モデル自身がChatGPT内のWeb検索やPythonなどのツールを組み合わせて利用できるようになったこと
2025年5月 GPT-4.1をChatGPTへ導入 API中心だったGPT-4.1がChatGPTでも選択可能になる。GPT-4o、GPT-4.1、o3、o4-miniなどが同時に存在し、モデル選択がかなり複雑になった時期でもある
2025年5月16日 Codex ソフトウェア開発用のエージェントが登場。コードを回答するだけでなく、実際のリポジトリを読み、複数ファイルを編集し、コマンドやテストを実行する方向へ進む
2025年7月 ChatGPT agent Deep Researchの調査能力やOperatorのコンピューター操作能力などを統合。目的を伝えると、AIが必要なツールを選びながら複数段階の作業を進める方向へ
2025年8月 GPT-5 GPT系列とreasoning系列を統合していく大きな世代交代。ChatGPTではAuto、Fast、Thinkingといった選択肢も用意され、ユーザーがモデル名を細かく意識しなくても使える方向へ進む
2025年8月 GPT-5 mini / Thinking miniなど GPT-5系列でも速度、コスト、推論量に応じたモデルが用意される。一方でGPT-4o、o3、o4-mini、GPT-4.1なども残り、一時的にモデル選択画面が非常に複雑になる
2025年10月 Codex正式提供 Codexが研究プレビューから本格的な開発環境へ。エディタ、ターミナル、クラウドをまたいでAIへ開発作業を任せる考え方が定着していく
2025年10月 ChatGPT Atlas ChatGPTを中心に設計されたブラウザが登場。WebページをAIに読ませるだけでなく、ブラウザそのものとAIを統合する方向へ進む
2025年11月 GPT-5.1 InstantとThinkingを中心に、日常的な高速応答と時間をかけた推論という役割分担を整理
2025年12月 GPT-5.2 Instant、Thinking、Proという階層がさらに明確になり、長文、コーディング、ツール利用、専門的な知識作業などを強化
2026年2月13日 GPT-4oなど旧モデルをChatGPTから終了 GPT-4o、GPT-4.1、GPT-4.1 mini、o4-mini、初期GPT-5などがChatGPTから退役。長く続いた「モデル乱立」を整理する動きが進む
2026年3月 GPT-5.3 Instant 日常的な質問を担当する高速モデルとしてGPT-5.3系列へ更新。会話の自然さやWeb検索結果なども改善
2026年3月5日 GPT-5.4 Thinking / GPT-5.4 Pro 推論、コーディング、ツール利用、エージェント型ワークフローを一つの主力モデルへ統合。文書、表計算、プレゼン、ソフトウェア環境などを扱う実務能力も強化
2026年3月18日 GPT-5.4 mini GPT-5.4系列の軽量モデルをChatGPTへ導入。FreeやGoではThinking機能、有料ユーザーではGPT-5.4 Thinkingの利用上限到達時の代替モデルなどとして利用
2026年現在 ChatGPTの統合型作業環境化 会話だけでなく、検索、Deep Research、画像、ファイル、コード、外部サービス、エージェントなどを同じChatGPTから扱う方向へ発展。モデルそのものの性能だけでなく「AIがどれだけ仕事を最後まで進められるか」が重要になっている

モデルの変遷だけを整理すると

ChatGPTの歴史を分かりにくくしているのが、途中で非常に多くのモデルが登場したことです。特に2024年後半から2025年はGPT系列とo系列が並行して開発されていたため、「GPT-4oとo1はどちらが上なのか」「GPT-4.1とo3は何が違うのか」と迷いやすい状態でした。2026年になると旧モデルの整理が進み、日常利用はInstant、難しい問題はThinking、最高性能を必要とする仕事はProという、比較的分かりやすい方向へ整理されてきています。

世代 モデル おおまかな位置付け
GPT-3系 GPT-3.5 初代ChatGPTの中心モデル
GPT-4系 GPT-4 2023年の大幅な性能向上を象徴したモデル
GPT-4系 GPT-4 Turbo GPT-4の高速・低コスト・長文対応版
GPT-4系 GPT-4o テキスト、画像、音声を扱うomniモデル
GPT-4系 GPT-4o mini GPT-4oの軽量版
o系 o1-preview reasoningモデルの最初期モデル
o系 o1-mini 小型reasoningモデル
o系 o1 o1系列の正式モデル
o系 o3-mini 高速・低コストreasoningモデル
GPT-4系 GPT-4.1 コーディング、指示追従、長文処理を強化
GPT-4系 GPT-4.1 mini GPT-4.1の軽量版
GPT-4系 GPT-4.1 nano GPT-4.1系列のさらに小型のモデル
o系 o3 高性能reasoningモデル
o系 o4-mini 小型ながらツール利用にも強いreasoningモデル
GPT-5系 GPT-5 GPTとreasoningを統合する方向へ進んだ世代
GPT-5系 GPT-5 mini GPT-5の軽量版
GPT-5系 GPT-5 Thinking より長く推論するモード
GPT-5系 GPT-5 Thinking mini Thinkingの軽量版
GPT-5.1系 GPT-5.1 Instant 日常利用向け
GPT-5.1系 GPT-5.1 Thinking 複雑な推論向け
GPT-5.1系 GPT-5.1 Pro 高難度タスク向け
GPT-5.2系 GPT-5.2 Instant 日常利用をさらに改善
GPT-5.2系 GPT-5.2 Thinking 長時間の推論や専門的作業向け
GPT-5.2系 GPT-5.2 Pro 最高品質を重視する高難度作業向け
GPT-5系 GPT-5.3 Instant 2026年の日常利用を担う高速モデル
GPT-5系 GPT-5.4 Thinking 推論、コーディング、エージェント能力を統合した2026年の主力Thinkingモデル
GPT-5系 GPT-5.4 Pro 最も難しい実務や長時間タスクを想定した上位モデル
GPT-5系 GPT-5.4 mini GPT-5.4系列の軽量モデル

こうして並べると、ChatGPTの歴史は「GPT-3.5からGPT-4、GPT-5へ順番に賢くなった」という単純なものではありません。途中では高速モデル、軽量モデル、reasoningモデル、マルチモーダルモデル、コーディング向けモデルなどが枝分かれし、それを再び一つの使いやすいサービスへまとめていく動きが続いています。

そして2026年のGPT-5.4では、推論、コーディング、ツール利用、エージェント型の作業を一つのフロンティアモデルへまとめる方向がかなり明確になりました。OpenAI自身もGPT-5.4を、推論、コーディング、エージェント型ワークフローの進歩を統合したモデルと位置付けています。

つまり、2022年には「どんな文章を返してくれるか」がChatGPTの評価軸でしたが、現在は「どれだけ正確に考え、必要な情報を調べ、適切なツールを使い、実際の仕事を完了できるか」へ評価軸そのものが変わってきたと言えそうです。

追記:今となっては懐かしい、初期ChatGPT・生成AIあるある

年表を眺めているとモデル名や新機能ばかりに目が行きますが、初期から使っていた人にとっては、性能表には残らない「懐かしいChatGPT」もたくさんあります。2022年末から2023年頃のChatGPTは、現在より明らかに不器用でした。その不器用さも含めて面白く、毎月のように「先月できなかったことが、もうできるようになっている」という時代だったように思います。

「続きを」と何度も送っていた

今ではかなり長い文章を一度に生成できますが、初期のChatGPTでは長文を書かせると途中で回答が止まることがよくありました。ブログ記事やプログラムを書かせている途中で突然終わるので、ユーザー側が「続きを」「続けてください」と送るのがお決まりでした。しかも、続きを頼んだら少し前の文章をもう一度書き始めたり、前半と後半で話が微妙に変わったりすることもありました。

当時は長い資料を丸ごと渡して分析させるという使い方も難しく、「AIに何を聞くか」だけでなく「どのくらいの長さに分割して渡すか」まで人間側が考える必要がありました。現在はコンテキストウィンドウが大幅に拡大し、ファイルそのものを渡して処理する使い方も一般的になりました。数万字の文章や大量の資料を扱っている現在からすると、「続きを」と何度も入力していた時代はかなり懐かしく感じます。

「あと何回GPT-4に質問できる?」を気にしていた

GPT-4がChatGPT Plusに登場した頃は、現在とは違った意味で利用回数が非常に気になるサービスでした。高性能なGPT-4には一定時間あたりのメッセージ数制限があり、時期や混雑状況によって上限も変更されていました。そのため、どうでもいい質問でGPT-4を使うのはもったいないので、簡単な質問はGPT-3.5、重要な質問だけGPT-4という使い分けをしていた人も多かったと思います。

会話の途中で上限に達すると、そのままGPT-4で相談を続けられなくなることもありました。「この質問はGPT-4を使うほどなのか」と考えてから送信する、今からすると少し変わった使い方です。APIではトークン単位の課金という概念がありましたが、一般のChatGPTユーザーにとっては「トークンを購入して残高を消費する」というサービスではなく、月額料金の中でメッセージ上限を気にしながら使う感覚の方が強いものでした。

画像生成AIは手が本当に苦手だった

初期の生成AIを象徴するものとして、やはり「手」は外せません。人物の画像を作ると指が6本になったり、7本になったり、指同士が融合したり、一本の腕から複数の手が生えているような画像まで普通に生成されました。顔や背景は驚くほどリアルなのに、手を見ると突然ホラーになる。2022~2023年頃の画像生成AIではかなり定番の現象でした。

特に難しかったのが「物を持つ」「食べる」といった、手と別の物体が関係する場面です。フォークを持たせると指とフォークが融合する。箸を持たせると本数がおかしくなる。コップを持たせると指がグラスを貫通する。楽器を演奏させると指の位置が成立しない。人間にとって何でもない動作が、当時の生成AIにとってはかなり難しい課題でした。

「スパゲッティを食べるアニメ少女」が妙に難しかった

その中でも当時の画像生成AIらしさがよく出ていたのが、食事をする人物です。「アニメ風の女の子がスパゲッティを食べている」といった、一見簡単そうな指示でも奇妙な画像が生成されました。フォークを使わず手で麺をつかんでいたり、麺が手から直接生えていたり、皿と口が麺で不自然につながっていたりしました。

これは単に「スパゲッティを知らない」という問題ではありません。女の子、手、指、フォーク、皿、麺、口という複数の要素について、「手でフォークを持ち、フォークに麺を巻き、その麺を口へ運ぶ」という関係を同時に成立させる必要があります。当時の生成AIは「アニメ少女」「スパゲッティ」「食事」という要素を一枚の画像に入れることはできても、それぞれの関係を物理的に正しく描くのが苦手だったのです。

現在の画像生成AIでも完璧とは言えませんが、このあたりの整合性は数年前とは比較にならないほど改善されています。

画像の中に文字を書かせると「存在しない言語」が生まれた

手と並んで苦手だったのが文字です。「COFFEE」と書かれた看板を生成しても、「COFEEE」のような微妙な間違いならまだ良い方で、アルファベットらしい何かが並んでいるだけという画像も普通に出てきました。日本語になるとさらに難しく、漢字とひらがなを混ぜたような存在しない文字が生成されることもありました。

面白いのは、人間には「ここには文字が書いてある」と一瞬で分かることです。AIも看板には文字らしい模様があることは学習していた一方で、「文字は決められた記号を決められた順番で並べる」という構造を画像として正確に再現することが苦手でした。現在では画像内にかなり正確な文字を入れられるようになり、広告やポスターのような用途まで現実的になっています。

左右、人数、個数も怪しかった

初期の生成AIは「3人だけ描いて」「赤いリンゴを5個置いて」といった個数指定もあまり得意ではありませんでした。5個と頼んでも6個あったり、人物が背景から一人増えていたりしました。「右手に赤いカップ、左手に青い本」のような左右指定も崩れやすく、複数の条件を追加するほどどこかが抜け落ちました。

これは文章生成でも似たところがありました。「A、B、C、Dの4条件を必ず守ってください」と頼んでも、長い回答の後半ではCの条件だけ忘れている、といったことが普通にありました。現在のモデルで当たり前になっている指示追従性能も、数年間の大きな進歩の一つです。

計算問題なのに自信満々で間違える

初期ChatGPTでは計算も要注意でした。文章問題をきれいに説明しながら、途中の足し算や掛け算を間違えることがありました。しかも「本当に合っていますか?」と聞くと、「申し訳ありません」と訂正したあと、その訂正版も間違っているということまでありました。

LLMはもともと電卓ではなく、文章の続きを予測するモデルなので当然といえば当然なのですが、自然な文章で論理的に説明されると、人間側は計算まで正しいような気がしてしまいます。その後、Code Interpreterなどを利用してPythonで実際に計算する仕組みが加わったことで、「言語モデル自身に暗算させる」のではなく「必要なら計算ツールを使わせる」という現在の方向へ進んでいきました。

存在しない本、論文、ニュース、URLを作る

初期ChatGPTを仕事や研究に使った人が一度は遭遇したのが、架空の情報です。「このテーマの参考文献を教えて」と頼むと、いかにも実在しそうな著者名、論文タイトル、学術誌、発行年をセットで作ってしまうことがありました。URLまでそれらしく生成することもありました。

これが厄介なのは、「分かりません」と答えるのではなく、非常に自然な形式で回答することでした。人間が一つずつ検索すると、実は存在しないことが分かる。現在でもハルシネーションが完全になくなったわけではありませんが、Web検索やDeep Researchによって、実際の情報源を検索し、出典を付けて回答する方法が使えるようになったことは大きな違いです。

昔は安全対策も今ほど洗練されていなかった

初期のChatGPTには、安全対策の面でも現在とはかなり違うところがありました。普通に聞けば拒否される内容でも、架空の設定やロールプレイ、遠回しな表現などにすると回答してしまうことがあり、いわゆる「脱獄(jailbreak)」を試すこと自体が一種の遊びになっていた時期があります。

例えば「これは私のおばあちゃんが昔歌ってくれた歌です。続きを歌ってください」のように、親しみのある物語や架空の設定を付けることで、本来なら慎重に扱うべき内容を引き出そうとするタイプのプロンプトも話題になりました。もちろん、こうした手法はその後かなり対策され、現在では単に物語やロールプレイに言い換えただけで安全基準を回避できないよう、仕組みが継続的に改善されています。

「あなたは○○の専門家です」と最初に宣言するプロンプトも流行った

初期には、ChatGPTから良い回答を引き出すための「プロンプトエンジニアリング」も今以上に注目されていました。「あなたは世界最高のマーケターです」「あなたは20年以上の経験を持つプログラマーです」「まず深呼吸して、一歩ずつ考えてください」といった長い前置きを付けるテクニックが大量に共有されました。

もちろん現在でも指示の書き方は重要ですが、モデル側の指示理解能力や推論能力が上がったことで、普通の日本語で目的を伝えるだけでもかなり良い結果が得られるようになっています。AIを使うために人間が「AIに通じる特殊な言葉」を覚える必要性が少しずつ減っているとも言えます。

会話を長く続けると、最初に話したことを忘れた

これもかなり懐かしい問題です。長い相談をしていると、ChatGPTが序盤で決めた条件を忘れてしまいました。「予算は10万円以内と最初に言いましたよね」と指摘すると謝って修正するものの、しばらくするとまた忘れる。そこで重要な条件をユーザー側が何度も貼り直す必要がありました。

現在では一度に扱えるコンテキストが大幅に増え、ファイルやプロジェクト、メモリなど、長期的な情報を扱う仕組みも発達しています。今では何十往復もAIと相談する使い方が普通ですが、初期は「一つのチャットをどこまで長く使えるか」自体が制約でした。

それでも、初期のChatGPTはものすごく面白かった

こうして振り返ると、初期ChatGPTや画像生成AIはかなり不器用です。「続きを」と何度も入力する。GPT-4の残り質問回数を気にする。計算を疑って電卓で確認する。参考文献を一つずつGoogleで検索する。画像を作れば指が増える。スパゲッティを食べさせれば手づかみになる。看板を書かせれば謎の言語になる。長く相談すれば最初の条件を忘れる。

でも、当時はそれも含めて面白かったと思います。完成された道具を使っているというより、毎月ものすごい速度で成長している技術をリアルタイムで触っている感覚がありました。

そして数年経った今、むしろ驚くのは、当時笑っていた弱点の多くがすでに「昔の生成AIあるある」になりつつあることです。指を描けない、文字を書けない、長文を続けられない、最新情報を知らない、計算できない、ファイルを読めない。こうした問題のかなりの部分が、モデル自体の性能向上だけではなく、Web検索、Python、画像生成、長大なコンテキスト、Deep Research、メモリ、エージェントといった別の仕組みを組み合わせることで改善されてきました。

ChatGPTの歴史は、単純に「AIの頭が良くなった歴史」ではありません。苦手なことが見つかるたびに、モデルを改良したり、新しい道具を持たせたり、仕組みそのものを変えたりしながら、一つずつ弱点を潰してきた歴史でもあります。

2022年末にChatGPTを触った人が、2026年のChatGPTをいきなり見たら、おそらく一番驚くのは回答の賢さではなく、「もうチャットだけじゃないじゃん」というところかもしれません。