はたらクラフト

Claude公式のスキル評価機能で、スキルを今のモデルに最適化

AI活用術

エージェントスキルをよく使う人ほど、より成果物の品質を上げるために、さまざまな指示や検証が書き足します。でも、その1行1行のすべてが、今のAIモデルに本当に必要な指示だと言い切れるでしょうか。

逆に、本来は手順を書くべきなのに書かれていないせいで、AIがその場で必要な情報を探し回って自分で考え、トークンや時間を浪費していることもあります。

こうした無駄と不足を、AIへの指示1つで洗い出せるのが、Anthropic公式のskill-creatorです。

この記事では、skill-creatorを使ってスキルを最適化する方法を、ぼくが自分のスキルで試した実例とともに解説します。

動画で見たい方はこちら。

AIモデルの性能が上がれば、スキルの最適な中身も変わる

AIモデルの性能向上で、スキルの手順の一部が標準で身につき不要になる対比図

良いエージェントスキルとは、今のAIモデルにとって無駄な指示はゼロで、かつ必要な手順は網羅されているものです。

何が無駄で何が必要かは、AIモデルの性能によって変わります。Anthropicの公式ブログも、スキルに書いていた手順をAIモデルが標準で身につけ、手順自体が不要になる場合があると説明しています。

skill-creatorなら、手作業では大変なスキルの評価をAIに任せられる

スキルの評価を人が手作業で繰り返す場合と、skill-creatorのAIに任せる場合の対比図

スキルを1文ずつ精査し、消したり足したりしながら検証を繰り返して、「この指示は必要なので残す」「ここは手順が足りないので書き足す」と判断していく。この作業を手作業でやるのは大変すぎます。

この評価作業を楽にしてくれるのが、skill-creatorです。Claude Codeに最初から入っていて、スキルを作ったり直したりするときも自動で使われています。

実は、このskill-creatorには、スキルを評価する機能があります。

skill-creatorは、スキルあり・なしで同じ指示を実行して比べる

同じ指示をスキルあり・なしのAIが同時に実行し、検査項目の合否・実行時間・トークン消費を比べる流れ

Claude Codeの公式ドキュメントは、スキルが意図どおりに働いているかを、スキルあり・なしの結果を比べて確かめるよう勧めています。skill-creatorの評価機能は、この比較を自動化したものです。

評価を指示すると、Claude Codeは全く同じ指示を、スキルあり・なしの2通りで、サブエージェント(部下のAI)を使って同時に実行します。

結果の評価では、「この項目は達成できている」「この項目は達成できていない」と判定できる客観的な検査項目を、AIが自分で作って検証します。

そのうえで検査項目の合否と実行時間、トークン消費をスキルあり・なしで比べると、その指示が今のAIモデルに本当に必要か、逆に指示が足りないせいでAIが自分で考えてしまっている箇所はないかが分かります。

使い方は「〇〇のスキルをskill-creatorを使って評価して」と指示するだけ

使い方は簡単で、AIに次のように指示するだけです。

〇〇のスキルをskill-creatorを使って評価して

スキル評価実例:AIが毎回プログラムを自作し、実行時間が約20分伸びていた

毎回AIが自作していた3つのプログラムをスキルに組み込み、約20分と数万トークンの負担を改善した前後の対比図

ぼくも実際に、skill-creatorで自分のスキルを評価しました。試したのは、収録した音声からアニメーションスライドのYouTube動画を作るスキルです。

評価の結果、改善点はかなりありました。特にスライド画像の作成と成果物の検証の工程で、プログラムにすべき処理がプログラムになっていませんでした。

そのためAIは、実行のたびに次のようなプログラムを自分で書いていました。

  • スライド画像から、イラストの範囲を割り出すプログラム
  • イラストや文字の配置データを組み立てるプログラム
  • 動画の書き出し前に、表示時間や文字の間隔を検証するプログラム

この無駄で、スキルの実行時間は約20分伸び、毎回数万トークンを費やしていました。

そこで、上記をプログラム化し、スキルに組み込むことで実行時間とトークン消費を改善しました。

評価結果をドキュメントにまとめ、改善は1つずつAIに任せる

skill-creatorの評価結果はレポートとして出てくるだけで、スキルがいきなり修正されることはありません。

ぼくはこのレポートを改善計画のドキュメントにまとめてもらい、その中から1つずつAIに指示して対応してもらいました。次のように指示すればOKです。

評価結果をもとに、スキルの改善計画をドキュメントにまとめて。改善はAIが1つずつ対応しやすい単位に分けて
@改善計画ドキュメント名の1つ目に対応して

注意点:評価はスキル1回実行の倍以上のトークンを使う

スキルあり・なしの実行、検査項目の検証、レポート作成が積み重なり、スキル1回実行の倍以上になる評価のトークン消費

skill-creatorの評価機能は、トークンを大量に消費します。

スキルあり・なしを同時に実行し、さらに各検査項目を厳密に検証したうえで評価レポートも作るので、スキルを1回実行するのに比べて、少なくとも倍以上のトークンを消費します。

そのため、評価はトークンに余裕があるときに行うのがおすすめです。

まとめの前に、お知らせを。

公式LINEの友だち追加特典で、無料30分相談を受付中。オンライン(顔出し不要)で、AI活用のお困りごとに答えます。

友だち追加後、「相談」と送ると予約リンクが届きます。余裕がなくなったら締め切るので、お早めにどうぞ。

はたらクラフト公式LINELINElin.ee

無料メルマガで実務で使えるAI活用を毎日配信中。1分で登録できます。

超実践AI論Substacktaichiaiworker.substack.com

まとめ:skill-creatorでスキルを今のAIモデルに最適化する

この記事の要点は次の4つです。

  • 良いスキルは、今のAIモデルに無駄な指示がゼロで、必要な手順を網羅したもの。最適な中身はAIモデルの性能で変わる
  • skill-creatorは、同じ指示をスキルあり・なしで同時に実行し、検査項目・実行時間・トークン消費を比べて評価する
  • 使い方は「〇〇のスキルをskill-creatorを使って評価して」と指示するだけ。改善はドキュメントにまとめて1つずつ進める
  • 評価はスキル1回の実行の倍以上のトークンを使うため、トークンに余裕があるときに行う

あなたもよく使っているスキルを1つ選び、skill-creatorで評価してみてください。客観的な評価で、スキルを磨き上げることができます。

この記事をシェア

自分の業務アプリを、AIで自力で作る

AIで自分の業務アプリを作り、自力で修正もできるまでを、経歴10年のITエンジニアが1対1で個別サポートします。残り5名までモニター価格です。