入力と出力では、増える理由が違う
入力が長くなる主因は、会話履歴、固定指示、検索で取得した文書、ページ本文です。出力が長くなる主因は、最大出力長、回答形式、冗長な指示、モデルの挙動です。合計トークンだけでは、どちらを直すべきか判断できません。
まず代表的な50回の呼び出しについて、入力と出力を分け、中央値と上位10%を出します。平均だけでは、一部の巨大なPDFや長い会話が全体を押し上げている事実を隠すからです。入力中央値2,200、上位10%が18,000なら、全プロンプトを短くするより、巨大入力が発生する条件を直す方が品質への影響を抑えられます。
削る前に、守る品質を決める
問い合わせ回答なら正確性と解決率、商品説明なら必須情報の網羅、要約なら重要事項の欠落率など、用途に合った評価項目を決めます。短くなったこと自体を成功にすると、利用者が再質問し、結果として総費用が増えることがあります。
例えばFAQ回答では、正答率95%以上、必須リンクの欠落ゼロ、再質問率が現状以下、という合格条件を先に置きます。トークンが30%減っても再質問率が8%から20%へ上がれば、1回目を短くしただけで総呼び出し回数は増えるかもしれません。削減率と品質条件の両方を満たして初めて採用します。
- 事実誤りが増えていないか
- 必須項目が欠けていないか
- 利用者の再質問が増えていないか
- 人による修正時間が増えていないか
入力は『重複』から、出力は『用途外』から削る
入力では、同じ注意事項の重複、古い会話履歴、検索結果の重なりを先に除きます。出力では、利用画面に表示しない補足、毎回同じ前置き、必要以上の候補数を見直します。重要な根拠文書や安全上の注意を、文字数だけで削らないでください。
RAGで上位8文書を渡しているなら、同じ規約ページの断片が重複していないか確認します。出力では『理由を詳しく10項目』を『結論、根拠2点、次の操作』へ変え、画面目的に合う形式へ寄せます。安全注意や返品条件など、欠落時の損害が大きい情報は評価項目で保護し、単純な文字数順で削除しません。
一度に一箇所だけ変えて比較する
代表的な20〜50件を固定し、変更前後で入力・出力トークン、成功率、再質問率を比べます。プロンプト短縮とモデル変更を同時に行うと、何が品質へ影響したのか分かりません。変更は戻せる状態にし、本番反映後も少量で確認します。
テスト表には、変更箇所、トークン中央値、上位10%、品質採点、人の修正時間を記します。最初に会話履歴を10ターンから6ターンへ変え、合格後に検索取得数を見直す、と順番を固定します。本番では5%程度の対象から始め、誤回答が基準を超えたら旧設定へ戻せるようバージョンを残します。
- 評価用の入力例を固定する
- 変更点は一つに絞る
- トークン削減率と品質を同時に記録する
- 悪化時に戻す条件を先に決める
最も効果の薄い100トークンを探す
目標は最短の回答ではなく、顧客成果を保ったまま不要部分を減らすことです。まず入力と出力を別々に計測し、どの100トークンが結果にほとんど寄与していないかを一箇所だけ検証しましょう。
成果物は、削減候補と品質条件を対応させた導入チェック表です。『古い履歴4ターンを除外』『回答候補を5件から3件へ』のように具体化し、予想削減量、守る情報、検証件数、合格基準、戻し方を埋めます。費用はモデル単価からの推定であり、反映後はAI事業者の実請求と照合して効果を確定します。採用した変更には、評価セットの版、プロンプトの版、実施日を付けます。後で回答品質が落ちたとき、モデル側の変化なのか自社の削減なのかを追えるためです。
「長いプロンプトと長い回答、先に削るべきなのはどちらか」の「入出力トークン削減の導入チェック表」は、同じ指標を継続して集めることで判断材料になります。AI Cost Guardrails-CNXTを無料でダウンロードし、WordPress上のCalls・Token・推定USDを計測し始めましょう。