COSMOS
日本語

魔法ではなく、測定結果

より少ないオーバーヘッド。
確認できるエビデンス。

範囲を限定したワークフローで、コンテキストとオーケストレーションのオーバーヘッドを測定します。これらの結果は、特定の自社テストで実際に起きたことを示すものであり、あらゆるモデル、タスク、請求額について約束するものではありません。

要点

COSMOSは、セッション間で有用な状態を保持し、焦点を絞った作業セットを取得して、簡潔なエビデンスを返します。レイヤーごとに節約されるリソースは異なります。入力トークン、転送バイト数、ツール呼び出しは個別に測定する必要があります。

測定済みの自社結果

入力コンテキスト

変更前
69,393
変更後
4,547
削減
93.45%

入力トークン

範囲と方法

正確な出力を対象とする1件の合成カナリアテストで、継承された最小プロバイダープロファイルと分離された最小プロバイダープロファイルを比較しました。どちらも要求された回答を正確に返しましたが、キャッシュ状態は異なっていました。対象は入力トークンのみであり、請求額の削減やジョブ全体の品質ではありません。

この結果では証明されないこと

キャッシュ状態は異なっていました。この結果は、検索品質の影響を切り分けるものでも、同等のプロバイダー課金を立証するものでもありません。

エビデンスの確認日: · 試行回数: 1

測定済みの自社結果

簡潔な結果ペイロード

変更前
4,290
変更後
712
削減
83.4%

結果バイト

範囲と方法

5件のファイル比較についてローカル開発環境で10回試行し、すでに簡潔な結果とバッチ化した手順を比較しました。シリアライズされた成功結果のバイト数は、1試行当たり4,290と712でした。同一スナップショットでの等価性判定結果は一致しました。セットアップ、失敗、手順の構築は対象外です。

この結果では証明されないこと

結果のバイト数は、通信全体のトラフィック量でもモデルのトークン数でもありません。10月の結果はローカル開発版の候補に関するものであり、リリースについての主張ではありません。

エビデンスの確認日: · 試行回数: 10

測定済みの自社結果

署名付き診断トラフィック

変更前
121,896
変更後
82,455
削減
32.36%

通信バイト

範囲と方法

ローカル環境の中立的な10件の診断シナリオで、実際の応答の通信バイト数を測定したところ、合計で121,896と82,455でした。4件のシナリオでは、より多くのバイト数と追加の呼び出し1回が必要でした。共通セットアップは対象外であり、最終的なモデル回答の品質は比較していません。

この結果では証明されないこと

ネットワーク上で転送されたバイト数から、モデルのトークン使用量や実際のコストを確定することはできません。10月の結果はローカル開発における候補であり、リリースを表明するものではありません。

エビデンスの確認日: · 試行回数: 10

測定済みの自社結果

診断呼び出し

変更前
59
変更後
49
削減
16.95%

ツール呼び出し

範囲と方法

同じローカル環境の10件の診断シナリオで測定したツール呼び出しは、合計で59回と49回でした。合計回数は減少しましたが、すべての個別シナリオで改善したわけではありません。

この結果では証明されないこと

呼び出し回数が少ないことだけでは、レイテンシーやコストの低下、あるいは他のタスクで同等の性能が得られることは証明されません。

エビデンスの確認日: · 試行回数: 10

測定に関する当社の方針

パイロットでは、結果を比較する前に、ベースライン、代表的なタスク、品質チェック、成功基準について合意します。キャッシュに関する前提、出力、再試行、ツール使用状況を報告し、単一のカナリアテストを普遍的な主張へ拡大することはありません。

明確に範囲を限定した実際のワークフロー

これらは、自社での開発例および運用例です。独立した顧客による推薦ではなく、運用例が自動的に測定済みのトークン削減事例になるわけでもありません。

運用パターン

マーケットプレイスのエビデンス → 会計検証

COSMOSは元の記録を信頼境界内に保持し、候補を準備して整合性チェックを行い、外部状態を再読み取りすることで、承認済みの会計アクションを検証します。このワークフローから得られる教訓は、制御された実行と反復調査の削減です。このワークフローについて、トークン削減率は提示していません。

開発パターン

焦点を絞った開発引き継ぎ

専門エージェントは、会話履歴全体ではなく、関連するファイル、制約、確認項目を受け取ります。構造化された結果は、1つのレビュー可能なタスクへ返されます。コンテキスト削減はタスクごとに評価され、必要な成果はテストによって保護されます。

例示的なワークフロー

調査 → 翻訳 → レビュー

調査、草稿作成、翻訳、編集レビューでは、焦点を絞った役割と情報源への参照を使用します。公開は引き続き、別途承認が必要なアクションです。削減効果は、情報源の量、引き継ぎ、選択したプロバイダーによって異なります。

MCP / API / IDE

お使いの環境に、共有コントロールプレーンを。

MCPと設定済みのプロバイダーアダプターを通じて、現在使用しているツールを接続できます。プロトコル互換性は、エンドツーエンドで検証済みのネイティブ連携と同じではありません。

ローカル導入または設定済みアダプター。受け入れ確認が必要

ローカルでの導入と設定済みホスト

  • VS Code
  • Native Codex
  • Cursor
  • Claude / Claude Code

VS CodeとネイティブCodexには、記録済みのローカル導入経路があります。CursorとネイティブClaude / Claude Codeには、ハーネスおよびMCP設定アダプターがありますが、アダプターが設定済みであることは、ホストによる受け入れを意味しません。新しいホストチャット、バージョン、権限、ワークロードはそれぞれ個別に検証されます。

プロトコル互換または候補。パイロットでの検証が必要

MCP互換ホストと候補

  • MCP-compatible hosts
  • OpenClaw

その他のMCP互換環境では、転送方式、権限、ツールの許可を条件として、ガバナンスされたMCPインターフェースを使用できます。OpenClawは、範囲を限定した外部連携パイロットの候補であり、検証済みの同梱連携ではありません。そのゲートウェイとランタイムは組み込まれていません。

合成テストのエビデンス、アダプターコントラクト、計画中のルーティング

プロバイダーとカスタムパイプライン

  • Z.AI / GLM
  • OpenRouter
  • Python / CLI / MCP pipelines

Z.AI / GLMは正確な出力を対象とする合成カナリアテストに合格しましたが、これは非公開データのルーティングを許可するものでも、一般的なモデル品質を立証するものでもありません。OpenRouterのルーティングと評価は計画段階であり、現在はクローズドなプロバイダープロファイルで許可されていません。カスタムパイプラインでは、個別に検証されたドメインアダプターを中心に、Python、CLI、MCPのコントラクトを使用できます。

境界に合わせてデプロイ

お客様のデータと運用上の制約に合わせて、ローカル、プライベートサーバー、マネージド環境へのデプロイを検討します。範囲を限定したデモで、展開前に必要なIDE、モデル、ツール、権限、エビデンスを確定します。

次の段階は公開による再現性

サニタイズ済みのベンチマークコーパスと再現手順を含む公開GitHubリポジトリは、バックログにあります。まだ公開されていません。現時点では、測定方法について話し合い、反復可能なパイロットについて合意できます。無効なリポジトリリンクを掲載することはありません。

より小さな第一歩

1つのワークフローから始める。
「完了」の意味を定義する。

パイロットの検討は、プラットフォーム移行ではなく業務から始まります。何を構築するか決める前に、対象範囲、アクセス境界、有用なテストについて合意します。

01

引き継ぎを整理する

情報源、エージェントの役割、人の判断が必要な事項を明確にします。

02

証明方法を定義する

ベースライン、受け入れ確認、結果の限界を決めます。

03

次のステップを検討する

エビデンスに基づき、改善、拡大、終了のいずれを選ぶか判断します。

最初の候補に適したもの

アクセス可能なエビデンスと確認可能な結果を伴う、反復的なタスク。最初の対象範囲は、レビューできる程度に小さく保ちます。

最初の対象範囲に含めないもの

無制限のアクセス、監督なしで行う不可逆的なアクション、またはすべてのモデル回答が正しいという保証。

簡単なお問い合わせ内容を作成する

出発点を選び、1つの成果を記述してください。準備ができたら指示文をコピーできます。何を共有するかはご自身で決められます。

このビルダーは、このページ上でのみ動作します。内容が保存、分析、または自動送信されることはありません。パスワードや機密情報を入力しないでください。

Telegramを開く

自動的に送信されるものはありません。

これらの数値が意味すること

COSMOSは、私のチームでも同じ削減効果を保証しますか?

いいえ。実際のワークロードを測定し、必要な成果を確認します。コンテキスト、キャッシュ、モデルの料金、ツール、再試行によって結果は変わる可能性があります。

現在使用しているIDEとモデルを利用できますか?

COSMOSは、ネイティブのプロバイダー経路、MCP互換環境、設定済みアダプターに対応しています。具体的なホスト、モデル、権限、デプロイメントは、お客様のワークフローに合わせて検証されます。

公開ベンチマークリポジトリはどこにありますか?

GitHubでの公開はバックログにあります。このページでは、公開リポジトリや独立した再現について主張していません。

ワークフローを一緒に測定しましょう。

1つのタスク、ベースライン、正しさを維持する必要がある成果をご用意ください。ワークフローをご紹介し、お使いの技術構成について話し合い、範囲を限定したデモまたはパイロットを定義できます。

Telegramで相談する