AIエージェントの成绩が悪いとき、それ自体を再トレーニングするのではなく、その動作マニュアルを最適化한다면どうなるか?これがSkillOptの核心的なアイデアだ。Microsoft Researchが2026年5月に发布したこのシステムは、モデル本身的权重ではなく、タスク開始時にAIモデルが読み込む自然言語スキル文档を最適化する。权重而不是重みファイルに対して勾配降下法を适用るようなものであり、结果は印象的だ:複雑なベンチマークで最大+24.8ポイント、正確度の向上を達成した。さらに、スキルは再トレーニングなしに异なるAIモデル間で转移可能である。
背景:手作业のスキル作成が抱える问题
今日のAIエージェント——コードアシスタント、研究ツール、自動化パイプラインなど——は通常、自然言語の「スキルファイル」で设定されており、异なる 种別のタスクにどのように取り込むかを说明している。これらの文件は人間が一度書いて、静的に残しておく。しかし问题は、現実のタスクがそのスキル文档のギャップを明らかにすることで、エージェントにはそれを体系的に埋める方法がないことだった。
核心:ドキュメントを訓練する、モデルはそのまま
SkillOptは、エージェントスキル文档を训练可能な外部状態として扱う规律正しいテキスト空間オプティマイザを導入する。これは、モデルの重みを超参数として训练可能として扱う重み空間最適化と同じ原理である。
システムは3段階で运作する:
- 実行:ターゲットAIモデル(重み更新なし——冻结)は現在のスキル文档を使用してタスクを実行する
- 収集と評価:タスクの軌道(trajectories)を収集し、確保された(hold-out)テストセットで評価する
- 最適化:フロントランオープティマイザモデル(評価结果にアクセスできるより强力なモデル)が、スキ ル文档に界限付きのエディット(追加/删除/置換)を加える。テキスト学習率(textual learning rate)が各ラウンドで文档をどの程度積極的に書き換えるかを制御し、変更が多すぎて不安定になることを防ぐ。
主要式:検証ゲート付きスキル更新則
SkillOptの中核アルゴリズムは:best_skill = argmax over all bounded edits of current_skill of expected performance given the skill。关键是、エディットは確保されたセットでの性能が向上した場合에만受理される。改善なし→変更なし。これが「検証ゲート付き(validation-gated)」の意味である。
主な発見:SkillOptが達成したこと
SkillOptは52の(モデル、ベンチマーク、ハーネス)セルで評価され、GPT-4、Codex、Claude Codeにまたがっている。结果:
- 52の全セルで最優秀または同等
- +23.5ポイント GPT-4.5直接チャットでの平均精度向上
- +24.8ポイント Codexハーネスでの向上
- +19.1ポイント Claude Codeハーネスでの向上
- スキルはモデル間を转移する:GPT-4用に最適化されたスキルは、追加训练なしにCodexとClaude Codeでの性能も改善する
テキスト学習率メカニズムは至关重要——スキ儿が训练タスクに而过学习して新しいタスクで失败するのを防いだ。
意味すること:AI能力について考える新しい方法
SkillOptの最も重要な含意は概念的である:最適化の対象がモデルからスキル文档に移行した。
配備オーバーヘッドゼロ:スキル文档は単なるテキストである。モデル再トレーニングなし、微調整コストなし、GPUクラスタ不要。
スキルの再利用性と转移性:スキルが最適化されると、异なる地基モデルの下で動作する。这意味着研究ラボは现在データを共有する方法と同じ方法でスキル文档を共有できる。
破滅的な忘我却での継続的改善:モデルの微調整は既存の能力を低下させる。スキル文档最適化はモデルを触碰したままにする——既存のすべてのスキルは无损のまま。
AIエンジニアリングチームにとって、SkillOptは production-grade エージェント最適化の路径を提供する:体系的、再現可能、継続的な訓練インフラストラクチャに依存しない。
残された議論:SkillOptが解决しないこと
1. スキルは評価ハーネスに过学习する可能性がある。
2. オプティマイザモデルはターゲットモデルより强大でなければならない。
3. 长'horizonタスクのスキルはまだChallengingである。
正直なまとめ
SkillOptは、エージェントスキルファイルを训练可能な参数として扱う最初の论文である——结果是不言自身のものだ:+20〜+24.8ポイント、52/52全セル最优秀または同等、再トレーニングなしにモデル間を转移するスキル。MITオープンソース发布(github.com/microsoft/SkillOpt)により、すべてのAIエンジニアリングチームがすぐに試すことができる。検証ゲート付き更新の纪律は、これを缓い自己修订と区别するものである——魔法ではなく、テキストに适用された严格的最適化だ。