はたらクラフト

Claudeを2週間で3.1倍速くした方法に学ぶループエンジニアリング入門

AI活用術

AIに仕事を任せるとき、指示をして、結果を見て、また次の指示を出す。この繰り返しに時間を取られていないでしょうか。

AIの使いこなし方は、指示の書き方から、AIが自分で改善を回し続ける仕組み作りへと進化しています。その最新の段階がループエンジニアリングです。

Anthropicはこのループエンジニアリングで、Claudeのアプリを2週間で3.1倍速くしました。

この記事では、ループエンジニアリングの基本を解説します。加えて、Anthropicの実例をもとに「物差し」「ラチェット」「安全装置」というループエンジニアリングの3つの要点を紹介します。

動画で見たい方はこちら。

AIの使いこなし方は、プロンプト・コンテキスト・ハーネス・ループの順に進化した

プロンプトからループへ4段階で進化するAI活用法の一覧

AIを使いこなす方法は、次の4段階で進化してきました。

  • プロンプトエンジニアリング:AIにどう指示するか
  • コンテキストエンジニアリング:AIに渡す情報をどう整理するか
  • ハーネスエンジニアリング:AIに期待通りの仕事をさせるための補助輪をどう整えるか
  • ループエンジニアリング:AIがゴールまで改善ループを自分で回せる仕組みをどう作るか

プロンプトエンジニアリングは、AIにどのような指示をするかという方法論です。

コンテキストエンジニアリングは、AIに渡す情報を、AIが扱いやすい形にどう整理するかという方法論です。SSoTで、情報をAIが探しやすく整理するのもコンテキストエンジニアリングの一例です。

ハーネスエンジニアリングとループエンジニアリングは、次の章から順に説明します。

ハーネスは、AIの外で整備する、期待通りに動かすための補助輪

AIの行動がテストと実行制限のハーネスを通り安全な結果に至る図

ハーネスエンジニアリングは、AIの外のハーネス、つまり補助輪をどう整備するかという話です。

例えば、AIがアプリに新しい機能を追加するとき、アプリの基本的な機能のテストが網羅されていれば、元からある機能にバグを作ってしまってもすぐに気づけます。このテストがハーネスです。

ほかにも、AIがデータベースの消去のような危険なコマンドを実行できないようにする設定も、ハーネスの一例です。

このように。AIの外側で仕事の道筋を整え、ミスを防ぐ仕組みを整えるのがハーネスエンジニアリングです。

ループエンジニアリングは、ゴールだけを決めて達成手段をAIに任せる

人がゴールを渡しAIが計画実行検証のループを繰り返し達成する図

ループエンジニアリングとは、プロンプト・コンテキスト・ハーネスをすべて整えた上で、AIがゴールを達成するまで改善ループを自分で回せるようにする仕組みのことです。

例えば「アプリの初期表示を0.2秒以内にする」というゴールだけを決めて、達成手段はAIに任せます。

AIは速度改善の方法を検討する、試す、検証するというループを、0.2秒以内の表示速度を達成するまで繰り返し続けます。

このように、AIがゴールに向かって計画・実行・検証のループを回し続けられる仕組みを整えるのがループエンジニアリングです。

Anthropicは利用の95%を占める4つの場面に絞り、約20の改善案にミリ秒の目標を立てた

利用データから4つの主要場面を抽出し改善案とミリ秒目標につなげる図解

ここからは、Anthropicがループエンジニアリングを使ってClaudeを速くした実例を解説します。

Anthropicのエンジニアリングブログによると、2週間の集中改善で、ブラウザ版claudeとデスクトップアプリの13個の速度計測は平均3.1倍速くなりました。

ブラウザでclaudeを開いてから入力できるまでの時間は、3.1秒から0.55秒に縮んでいます。

Anthropicはまず、Claudeの利用データを分析し、利用の95%を占める4つの場面を選びました。アプリを開く、会話を始める、既存の会話を開く、メッセージを送るの4つです。

そしてこの4つの場面で約20個の改善案を出し、それぞれの改善案で何ミリ秒の速度改善ができるかを見積もり、その合計を目標にしました。

目標の物差しは、ブレないこと、速度改善に貢献すると証明できること

ブレない物差しへの切替と効果実証を示す対比図

ですが、ユーザーの待ち時間はループの達成目標には向きません。なぜなら、マシンのスペックやネットワークなどの外部要因でブレるからです。

そこでAnthropicは、ブレない代わりの数字を目標の物差しにしました。プログラムが実行した命令の数や、画面の書き直しの回数などです。これらは外部要因に左右されず、常に一定です。

目標の物差しを選ぶポイントは2つ。ブレないこと、そして実際の速度も改善することです。いくら物差しがブレなくて扱いやすい数字でも、速度改善に貢献しないのであれば意味がありません。

なのでAnthropicは、その物差しが実際の速度改善に貢献することをAIに証明させました。証明の実験では、命令の数を48%減らした処理で、実際の処理時間が78%短くなっています。

物差しまで決まったら、あとはひたすら改善ループを回すだけです。物差しを改善する方法を検討し、実行し、検証する。この繰り返しです。

ラチェットで、改善の合格ラインを引き上げ、後戻りを防ぐ

ラチェットで合格ラインを一方向にのみ引き上げる仕組み

このループを回すときに重要なのがラチェットという考え方です。ラチェットとは、一方向にしか回らない工具のことです。

ループの中で物差しの1つが改善したら、改善した分だけ、その物差しの合格ラインを厳しくします。物差しの数値が改善するたびに合格ラインも厳しくなり、緩むことはない。この合格ラインがラチェットです。

物差しごとにラチェットを用意しておくと、1つの物差しは改善するが別の物差しは悪化する、という変更は却下されます。

Anthropicでは、命令の数が増える変更は自動テストで不合格になり、数が減るたびに上限を自動で下げる仕組みにしています。

ラチェットがあることで、すべての物差しの数値をどんどん改善していけるというわけです。

安全装置はテスト・段階的公開・フィーチャーフラグの3つ

テスト・段階的公開・フィーチャーフラグの3段階から成る安全装置の全体像

ループエンジニアリングを円滑に回すための、Anthropicのもう1つの工夫が安全装置です。テスト、段階的公開、フィーチャーフラグの3つを組み合わせています。

この安全装置のおかげで、2週間で3,000件以上の変更を取り込みながら、顧客に影響する障害も差し戻しも1件も起きていません。

テストで、目標は達成したが別の問題が起きた、を防ぐ

テストが別の問題を捕らえ目標達成だけを通す安全装置

ハーネスの章でも話した、アプリのテストを書いておくことが1つ目の安全装置です。Anthropicでは、速度改善に着手する前に必ずテストを用意しています。

テストがあれば、ループエンジニアリングで目標は達成したが別の問題が起きた、という事態はほぼ防げます。

段階的公開で、テストで拾えない問題を社員と1%のユーザーで見つける

社員から1%のユーザー全員へ公開範囲を段階的に広げる3段階の流れ

段階的公開とは、一部のユーザーにだけ新しい機能を開放していく考え方です。

新しい機能は、まず社員だけに公開します。社員が使って問題がなければ、ユーザーの1%にだけ開放し、それでも問題がなければ全員に開放します。テストで拾いきれなかった問題を、ここで潰します。

フィーチャーフラグで、本番の問題を即座にオフにする

フィーチャーフラグのオフで問題の影響を即座に抑える仕組み

フィーチャーフラグとは、機能を変更・追加したときに、その機能をいつでもオンオフできるスイッチのことです。

フィーチャーフラグがあれば、本番リリース後に問題が起きても、スイッチをオフにすればすぐに影響を抑えられます。Anthropicは2週間で200個近いフラグを用意し、役目を終えたフラグは順次片付けました。

テストでバグを潰し、テストで拾えなかった問題を段階的公開で潰す。そして万が一問題があってもフィーチャーフラグですぐにオフにする。これがAnthropicの安全装置の全体像です。

まとめの前に、お知らせを。

無料メルマガで実務で使えるAI活用を毎日配信中。1分で登録できます。

超実践AI論Substacktaichiaiworker.substack.com

ながら聞きで、AIを仕事に活かす方法がわかるポッドキャストをSpotifyでも配信しています。

超実践AI論Spotifyopen.spotify.com

まとめ:ゴールと物差しを渡して、改善ループをAIに丸ごと任せる

この記事の要点は次の4つです。

  • ループエンジニアリングとは、測定できる指標でゴールを示し、達成までの計画・実行・検証のループをAIが回し続ける仕組みを整えること
  • AIが実際に改善に使う目標の物差しの条件は、ブレないことと、ゴールの達成に役立つと証明できること
  • 物差しが改善するたびにラチェットで合格ラインを厳しくし、1つが改善して別の1つが悪化する変更を却下する
  • 安全に回すための工夫は、テスト、段階的公開、フィーチャーフラグ

あなたもぜひ、AIに特定のゴールを達成するための改善ループを丸ごと任せられないか考えてみてください。

CodexやClaude Codeには、ゴールと試行回数の上限を渡すと達成まで繰り返す/goalがあり、「ホームページの表示速度スコアを90点以上にして。5回試してダメなら止めて」のような指示で活用できます。

この記事をシェア

自分の業務アプリを、AIで自力で作る

AIで自分の業務アプリを作り、自力で修正もできるまでを、経歴10年のITエンジニアが1対1で個別サポートします。残り5名までモニター価格です。