AIの安全は後付けではない: 最初の一手を設計する「ハーネス思考」
Hatched by K.
May 08, 2026
1 min read
2 views
87%
もし安全策がモデルの後に来るなら、もう半分負けている
生成AIの失敗は、いつも派手に起きるわけではありません。むしろ厄介なのは、小さな不適切さがそのまま仕事の流れに入り込み、最後まで気づかれないことです。危険な出力、不要な長文、余計なツール呼び出し、無駄なトークン消費。どれも単独では些細に見えますが、積み重なるとコストもリスクも跳ね上がります。
ここで重要なのは、AIの安全や品質を「最後にチェックするもの」と考えると、設計の半分を見逃すということです。実際には、モデルに何をさせるかより先に、どう始めさせるか、どこで止めるか、何を見て判断するかを決める必要があります。安全はブレーキではなく、最初から埋め込まれた操縦系なのです。
この発想をひとことで言えば、モデルの外側を設計することです。ここに、ModerationとGuides, Sensorsという一見別々の話が、深くつながっています。
失敗の本体は出力ではなく、制御の不在にある
AIシステムを作るとき、多くの人はモデル本体の賢さに注目します。より大きいモデル、より良いプロンプト、より多くの文脈。もちろんそれらは重要です。しかし、実運用で本当に差を生むのは、モデルが賢いかどうかより、賢さをどのように運転するかです。
ここで役立つのが、フィードバック制御とフィードフォワード制御という見方です。フィードバック制御は、結果を見てから修正する方法です。たとえば、危険な回答が出た後にフィルタで止める、あるいは失敗した後に再試行する。これは必要ですが、遅い。すでに余計なトークンが使われ、危険な分岐に入り、場合によってはユーザー体験も壊れています。
一方でフィードフォワード制御は、先に道を作る発想です。最初の入力を整え、許される行動を制約し、途中で何を見るべきかを定義する。これがうまくいくと、モデルは「危ないことをしないように気をつける」のではなく、危ない道に入りにくい構造の中で働くことになります。
この差は非常に大きいです。たとえば、ナビゲーションアプリを想像してください。危険な道に入ってから「そこはダメです」と怒るより、最初から通れないルートを優先して提案するほうが圧倒的に安定しています。AIの安全も同じで、後処理は最後の砦であり、第一の設計原理ではないのです。
安全とは、悪い出力を見つける技術ではない。悪い出力が生まれにくい流れを作る技術である。
「最初の一手」が、その後のすべてを決める
ハーネス思考の核心は、最初の一手の精度にあります。これは人間の仕事でも同じです。最初に何を聞くかで会議の質が変わり、最初に何を確認するかで診断の精度が変わり、最初にどう分解するかで問題解決の速度が変わります。AIエージェントもまったく同じで、最初の分岐が、その後の探索空間を大きく左右します。
ここでGuideとSensorという区分が効いてきます。Guideは、進むべき方向を示すものです。役割、制約、手順、優先順位、成功条件。Sensorは、途中で現実を読み取るものです。出力の形式検査、禁止語の検出、ツール結果の確認、ユーザー意図の再評価。つまり、Guideは先回りの設計、Sensorは途中の観測です。
この二つを分けて考えると、AIの失敗がなぜ増えるのかが見えてきます。多くの実装は、Guideが弱いまま、Sensorだけを増やそうとします。すると、モデルは自由すぎる探索を始め、途中で何度も軌道修正され、無駄な往復が増える。これは、道のない山を歩かせておいて、崖に近づいたら笛で止めるようなものです。歩数は増え、疲労は増え、成果は不安定になります。
逆に、Guideが明確なら、Sensorは少なくて済みます。たとえばカスタマーサポートのAIなら、いきなり自由回答させるより、最初に「要約する」「確認する」「次の一手を提案する」という順番を固定するだけで、タスク完了までのトークン消費が大きく変わります。これは単なる節約ではありません。探索空間を狭めることは、品質を上げることでもあるのです。
言い換えると、良いシステムは「何でもできるモデル」を目指しません。何を考えなくてよいかを設計したモデル運用を目指します。
Moderationは検閲ではなく、認知の交通整理である
Moderationと聞くと、多くの人は「危ない言葉をブロックする仕組み」を思い浮かべます。もちろんそれは一部です。しかし、より本質的には、Moderationは出力を後から罰する機構ではなく、認知の流れを整える機構です。
たとえば、文章生成の前に入力をチェックし、不適切な意図や危険なコンテキストを検出する。あるいは、候補生成の途中で危険な方向に逸れていないかを観測し、必要なら別の分岐へ戻す。これは単なるフィルタではなく、システム全体の行動を安全な回廊に収める設計です。
ここで大事なのは、Moderationを「倫理の付属品」と見ないことです。実際には、Moderationは品質工学でもあります。なぜなら、危険な入力はしばしば曖昧さ、文脈の混線、過剰な自由度を伴うからです。それらを前段で扱うと、モデルは余計な推論を減らし、結果として速度も安定性も上がります。
これは人間の会議でも起きています。会議が荒れるのは、発言の自由度が高すぎるからではなく、何を決める場か、何が禁止か、何が前提かが曖昧だからです。Moderationとは発言を黙らせることではなく、議論の目的を明確にし、逸脱を早く見つけることです。AIでも同じで、守るべきものは「自由」ではなく、意図した仕事の流れです。
良いガードレールは、運転の邪魔をしない。むしろ、どこを走ればいいかを明確にする。
本当に強いAIシステムは、モデルではなく境界で差がつく
ここまでを統合すると、一つの結論にたどり着きます。AIシステムの性能差は、モデル単体の能力差より、境界設計の差として現れるということです。
境界設計とは何か。入力の境界、出力の境界、ツール使用の境界、責任分担の境界、失敗時の境界です。どこまでモデルに委ね、どこから人間が介入し、どこで止めるか。その境界を曖昧にすると、エージェントは自由に見えて実は不安定になります。逆に境界が明確だと、モデルは局所的にしか賢くなくても、システム全体としては賢く振る舞えます。
この考え方は、MCPサーバーのような外部接続を考えるとさらに鮮明になります。外部ツールは力を増やしますが、同時にリスクも増やします。だからこそ、ツールを増やすほどGuideが必要になる。何を使うかより、いつ使うか、なぜ使うか、使った後に何を見るかが重要です。道具が増えるほど、オーケストレーションの価値が上がるのです。
つまり、賢いエージェントを作るとは、賢い判断を一箇所に詰め込むことではありません。判断を分割し、それぞれに適した制御を割り当てることです。Moderationは危険の境界を引き、Guideは進路の境界を引き、Sensorは異常の境界を引く。この三つが揃うと、モデルは初めて「暴れない賢さ」を持ちます。
ここで見落とされがちなのは、境界は制約であると同時に、創造性の条件でもあることです。完全に自由な探索は、しばしば迷走に終わります。適切な制約があるからこそ、モデルは本当に重要な候補に集中できる。人間の創作でも、形式や制限がアイデアを鍛えるように、AIもハーネスによって性能が引き出されます。
すぐに使える3つの設計原則
AIの安全や品質を高めたいなら、まず大規模な改善を狙うより、制御の置き方を見直すべきです。次の3つは、今日から適用できます。
-
後処理より先に、前処理を設計する 出力を検査する前に、入力の意図、禁止事項、成功条件を明確化する。モデルがどの道を歩くべきかを先に決める。
-
GuideとSensorを分ける 進路を示すものと、異常を検知するものを混ぜない。役割を分けると、どこで失敗したかが分かりやすくなり、改善も速くなる。
-
最初の一手を最適化する 最初のプロンプト、最初のツール呼び出し、最初の分類結果を見直す。多くの無駄は最初の分岐で決まる。
-
安全をコストではなく圧縮と捉える よい制約は、無駄な探索を減らす。トークン削減、再試行削減、ヒューマンレビュー削減は、安全設計の副産物ではなく本体である。
-
モデルではなくシステムを評価する ひとつの出力の良し悪しではなく、完了率、再試行率、危険分岐率、平均トークン消費を見て、ハーネス全体の性能を測る。
Key Takeaways
- 安全策は後付けでは弱い。モデルの外側に、先回りの制御を置くほうが強い。
- フィードフォワード制御が効く。危険な出力を止める前に、危険な探索を起こしにくくする。
- Guideが探索空間を狭め、Sensorが現実とのズレを検知する。この分業が、精度と効率を同時に上げる。
- 最初の一手が最重要。最初の分岐の精度が、その後のトークン消費とタスク完了率を大きく左右する。
- 強いAIは、賢いモデルではなく賢い境界で作る。能力を足すより、行動の流れを設計する。
終わりに: 未来の競争は、モデルの頭脳ではなく操縦系で決まる
AIについて私たちは、つい「どのモデルが一番賢いか」を問いたくなります。しかし、実際の差はますます別の場所に移っています。どのモデルを使うかではなく、どのように始め、どのように見張り、どのように止めるか。この設計が、成果の安定性を決めるのです。
本当に優れたシステムは、モデルを信じ切るシステムではありません。モデルの自由を尊重しながら、その自由が暴走しないように、周到に周辺を設計したシステムです。そこではModerationは拒絶ではなく整流であり、Guideは命令ではなく進路であり、Sensorは監視ではなく学習のための視界です。
そして最も重要なのは、安全と性能は対立しないということです。適切なハーネスは、リスクを減らすだけではなく、モデルを速く、安く、安定して働かせます。つまり、未来の競争力とは、より大きな頭脳を持つことではなく、より良い操縦系を持つことなのです。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣