JA
お問い合わせ
メニュー

システム

Colony

会話を続けて仕事を続けるパーソナルエージェント。彼らにプロジェクト、ツール、そして思い出を与えてください。コードを書いたり、Mac を使ったり、小さなアプリを作成したり、自分が管理するコンピュータで予定していた作業に戻ったりすることができます。

ご要望に応じてテクニカルプレビューを行います。

Colony /会話をまたいで働く

01/アサイン

取り組むプロジェクト結果の説明、タスクの継続、スケジュールの設定

02/ワーク

エージェントは、ユーザーのツール、ファイル、コード、および接続アプリケーションを、ユーザーが付与したアクセス権限で使用します

03/キープ

次回も役立ちます。保存されたデータを含むプロジェクトメモリ、再利用可能なスキル、アプリ

それが何をするか

  • 継続的な取り組みを

    目標を割り当てたり、リマインダーを設定したり、定期的なタスクをスケジュールしたりできます。同じワークスペースで進行状況を確認し、作業を一時停止します。

  • お手持ちのツールを使って作業

    ファイルの読み取りと変更、コマンドの実行、Web の調査、Mac アプリケーションの操作を、許可したアクセスで行えます。

  • 記憶して再利用する

    プロジェクトの知識や個人的な好みを、会話のあちこちに残しておきましょう。完了した作業をレビューできるスキルに変えましょう。

  • 必要なものを構築

    保存されたデータと定期的な更新を使用して、簡単なものからトラッカー、ダッシュボード、または小さなアプリを作成します。

Colonyでは、 ある会話から次の会話へと仕事が移っても、エージェントはアイデンティティ、ツール、記憶を維持します。 プロジェクトと必要なファイルを渡し、後で修正や新しいタスクを添えて戻ってください。 以前の作品はまだ残っています。

Colonyは、リマインダー、 コンピューターアシスタンス、役立つ情報を最新の状態に保つ小さなアプリなど、エンジニアリングプロジェクトや個人的なタスクをサポートしています。環境を実行し、 使用するモデルを選択します。

仕事を割り当ててから会話を続ける

リクエストは継続的な目標になり、明確な結果に向けて取り組むことができます。 個別のタスクはそれぞれの会話の中で実行されるため、 ゆっくりとした実験が他のすべての作業を妨げているわけではありません。 定期的なジョブの場合は間隔を設定し、リマインダーの場合は時間を設定します。スケジュールされた作業は、 ブラウザを閉じた後も継続できますが、 Colonyとその必要な接続はホストコンピュータで実行されたままです。

結果がどのように届くかを選択してください。ルーチンレポートは、タスクと一緒に残したり、 会話に表示したり、指示を求められたときに中断したりできます。 ライブの音声会話では、邪魔になるような報告を話すことができます。 それ以外の場合は、開いているインターフェイスまたは設定されたチャネルを通じて表示されます。 未配信の通知は、戻っても引き続き表示されます。作業を検査、 一時停止、または停止できます。

ブラウザワークスペースには、会話、ファイル、エージェント、アプリ、 アクティビティがまとめられています。音声は、 設定したブラウザまたはオーディオエンドポイントの音声モデルを使用できます。メッセージング統合には独自のセットアップが必要です。 現在のZulip接続は、 会話とバックグラウンド結果のプロアクティブな配信をサポートしています。

お手持ちのコンピューターとツールを使う

エージェントは、リポジトリの検査、ファイルの編集、コマンドの実行、Web の検索、接続ツールの呼び出しを行うことができます。スキルは再利用可能な命令を追加し、 MCP接続は外部サービスへのアクセスを追加します。

Macでは、 Colonyはアクセシビリティツリーからアプリケーションウィンドウを読み取ったり、コントロールを選択したり、入力したり、クリップボードを使用したり、画面をキャプチャしたりできます。 これらのアクションには、対応する macOS 権限が必要です。現在、 デスクトップコントロールは macOS 専用です。Linux インストールでも、ファイル、ターミナル、Web、 接続ツールは残っています。

異なる役割からメリットが得られる場合は、複数のエージェントを作成します。権限があれば、 ワークスペースを共有したり、メッセージを交換したりできます。 有限のワークフローでは、指定されたエージェントに依存するステップを割り当て、 生成されたアーティファクトを転送します。実験の場合は、インプットの準備 、ジョブの実行、アウトプットのレビュー、レポートの作成が必要になることがあります。

繰り返し発生するニーズに対応するアプリを作成する

Colony/タスクから保存された作業まで

次のタスクのために保存された作業用アプリ。

  1. 01 / 構築

    実際のプロジェクトで作業してください。

    エージェントはプロジェクトのファイルと許可されたツールを使用してアプリを作成します。この記録されたセッションでは、Colony は科学計算機を構築し、450行の挿入を含む6つのファイルをコミットしました。

    記録されたアプリコミットe790c966 ファイル·450 行の挿入
    • ui/index.htmlインタフェース
    • ui/styles.cssスタイル
    • ui/app.jsロジックとグラフ
    • data/latest.jsonアプリデータ
    • manifest.json定義
    • .gitignore除外

    次の会話で使用できる保存済みアプリケーション。

    e790c96のコミットが記録されました。保存されたプロジェクトには、インターフェイス、ロジック、アプリデータ、および定義が含まれています。
  2. 02 / 確認

    実際に何が保存されたかを調べてください。

    アプリケーションを再度開き、sqrt (9) を確認したところ、3 が返されました。画像は保存されたアプリそのものなので、セッション記録と一緒に結果を調べることができます。

    再開されたアプリケーション/実際のキャプチャ

    保存した科学計算ツール。sqrt (9) でチェックすると 3 が返される

    sqrt(9)3

    実際のアプリキャプチャ。ある算術チェックでは、この保存されたアーティファクトが実証されていますが、完全な正確さではありません。
  3. 03 / 続ける

    次のリクエストはどこかで始めましょう。

    アプリファイル、データ、変更履歴はワークスペースに残ります。後で会話したときに、同じプロジェクトを確認したり変更したりできます。エージェントメモリと再利用可能なスキルは、その継続的な作業をサポートします。

    リテインプロジェクトe790c966 ファイル·450 行の挿入
    • ui/index.htmlインタフェース
    • ui/styles.cssスタイル
    • ui/app.jsロジックとグラフ
    • data/latest.jsonアプリデータ
    • manifest.json定義
    • .gitignore除外
    次の依頼同じファイル、データ、履歴
    同じファイル、アプリデータ、バージョン履歴は、後の作業でも使用できます。

記録された計算セッションと再開されたアプリケーションに基づいています。この例では一般的なコーディングの信頼性は測定していません。

Colonyに、実験トラッカー、 リーディングリスト、ダッシュボード、チェックリスト、リマインダーなどの簡単なアプリを作成するように依頼してください。アプリには独自のページ、 保存されたデータ、変更のための会話があります。 スケジュールされた更新では、入力が動作しなくなったときにデータを更新し、レポートを作成できます。

アプリの作成と定期メンテナンスでは、異なるツール権限を使用します。 Upkeepタスクはアプリのデータを更新してソースを読み取ることができますが、 任意のシェルコマンドを実行したり、アプリのインターフェースを書き換えたりすることはできません。 現在のプレビューでは、Colonyインストールからこれらのアプリが提供されます。 個人顧客向けのパブリックホスティングはまだ計画中です。

Colony 記録されたセッションと保存されたアーティファクト

記録されたアプリコミット

科学計算用電卓。6
つのファイルとして保存されています。

アプリ、そのデータ、および変更履歴は、次のリクエストでも引き続き利用できます。

コミット
e790c96
記録された変更
6 ファイル·450 行の挿入

保存済みアプリケーション

  • ui/index.htmlインタフェース
  • ui/styles.cssスタイル
  • ui/app.js電卓とグラフ
  • data/latest.jsonアプリデータ
  • manifest.jsonアプリ定義
  • .gitignoreファイル除外

再開したアプリをチェックインしました sqrt(9)3

元のセッションとアプリのキャプチャを確認する

01/記録されたビルドセッション

ファイルコミットとその科学計算機のレポートを示すColonyアプリ構築セッションの記録の抜粋。

02/保存済みアプリケーション

実際に保存された電卓アプリを再度開いて sqrt (9) で確認したところ、3 が返されました。
会話の後も残るアプリ。 保存された電卓プロジェクトの記録。元のセッションとアプリのキャプチャは上記にあります。再開されたアプリは sqrt (9) = 3 で確認されています。 以前のインターフェイスキャプチャは、アプリが機能するようにトリミングされました。この例では一般的なコーディングの信頼性は測定していません。

検査できるメモリ

各エージェントは、 プロジェクトのメンバーと共有したメモとともに、独自のメモを保持しています。これらは、作成者と時間情報を含むMarkdownファイルです。 エージェントは通常のツールで検索、読み取り、追加、修正できます。 共有された思い出はプロジェクトに残り、 エージェント自身のメモはワークスペース全体で記録されます。

ノートが大きくなると、 境界付きの統合パスがそれらを統合して進化するサマリーを作成します。ソースファイルは、書き換え前にオペレーター用にアーカイブされます。 統合には設定されたモデルが使用されるため、メモリの維持には、 エージェントのフォアグラウンド作業に加えて独自の推論コストがかかります。

セッション履歴はこれらのメモとは別のものです。検索では、推論用に現在読み込まれているメッセージだけでなく、 保存されているトランスクリプトが読み込まれます。 圧縮を行うと、次のモデルリクエストを短縮できますが、 前の作業は引き続き取得できます。

証拠を保管し、状況を把握しましょう

大量のビルドログと実験出力は、 その後のモデル呼び出しのたびに送信するとコストがかかります。Colonyは、 サイズが大きすぎるツールの結果を完全なコンテンツ・アドレス・アーティファクトとして保存し、 モデルにプレビューと関連するパーツを取得するための指示を与えます。

ステージ現在の行動
結果を保存する8,000 バイトを超える出力は、SHA-256 ハッシュで識別されるセッション所有アーティファクトに書き込まれます。
最初のモデルビュー最大4,000バイトの先頭コンテンツと、出力ID、サイズ、検索命令。
さらに調べる一致する行を検索するか、制限されたバイト範囲を要求します。結果には行またはバイトの位置が含まれます。
ソースを保持完全な出力は、セッションの存続期間中利用可能です。同一の出力はアーティファクトを共有します。

しきい値は現在の実装を表したものであり、 トークンの節約量を示すものではありません。検索にはツール呼び出しが追加され、一部のタスクでは出力全体が必要になります。 アーティファクトの保存に失敗した場合、Colony は結果全体をインラインで返します。

エージェントの安定した命令とツール定義も、1 ターン内でも一貫した順序になるため、 互換性のあるプロバイダーはプロンプトプレフィックスを再利用できます。使用記録には、プロンプト、完了、 プロバイダーから報告されたキャッシュトークンが含まれます。実際の削減額は、エンドポイント、 作業負荷、およびエージェントが再検討する必要のある証拠の量によって異なります。

コンテキストインスペクターには、 直近のターンに送信された命令ブロックが、サイズやハッシュとともに表示されます。 これらのハッシュを前のターンと比較すると、 キャッシュの再利用が停止したときにプロンプトのどの部分が変更されたかを特定するのに役立ちます。

役に立つ仕事を次のタスクに移す

バックグラウンドタスクが完了すると、 Colonyは記録された手順からスキルをドラフトできます。 インストール済みスキルになる前に提案を確認します。ソースタスクとモデルも一緒に記録されるので、 再利用可能なプロシージャには確認できる履歴があります。

Colony は、 同じ入力に対して繰り返されるフォアグラウンド操作が成功するかどうかを監視します。パターンが繰り返されると、再利用可能なスクリプトの作成 、スキルのインストール、 またはワークスペースメモリへのプロシージャの記録といった短いタスクを割り当てることができます。出来上がったツールは検査して後の作業に使用できます。

これらのメカニズムはファイルやプロシージャを変更しますが、モデルの重みは変更しません。 スキルドラフティングとメモリ統合はどちらもモデルコールを消費します。 作業には制限があります。バックグラウンドタスクでは、 これ以上繰り返しのタスクを再帰的に生成することはできません。

私たちの研究対象は、エージェントが次のタスクでどれだけの有益な経験を積むことができるかということです。 スクリプト、プロシージャ、インスペクタブルメモリにより、 テストすべき具体的なオブジェクトが得られます。つまり、どれが再利用され、どれが古くなるか、 同じモデルと計算予算で完成度が向上するかどうかなどです。

エージェントが実際に何をしたかを確認する

会話にはメッセージ、ツールコール、結果が保持されます。 ゴールコンプリートでは、 別のモデルジャッジが基準を実行レコードやワークスペースアーティファクトと照らし合わせて確認します。エージェントが作成した要約は、未確認のクレームとしてマークされます。 必要なファイルがないと、 裁判官が肯定的な評決を下した場合でも、完了できません。

裁判官はまだ間違いを犯す可能性があります。 テストやその他の独立した承認チェックは、引き続き重要な作業のレビューの一部です。Colony はライブ会話の間、人間に決定を求め、答えを待つことができます。 バックグラウンド作業により、決定リクエストが審査の対象になることがあります。 権限によって、各エージェントがアクセスできるツールとワークスペースが決まります。 タスク成功率の比較ベンチマークは公開していません。

ランニングColony

1 つのローカルサービスには、API とブラウザインターフェイスが含まれます。CPU 上で動作します。 設定されたモデルサーバーとツールプロセスには、 それぞれ独自のリソース要件があります。アイドル状態のセッションワーカーは、保存された状態がディスクに残ったまま、 さらに入力が到着するまで停止します。

既存のホストモデルまたは個別に運用されているローカルサーバーを接続します。 分離されたデプロイメントでは、モデル、ツール、 およびそれらの依存関係がすべてその環境内で利用可能でなければなりません。インストール済みビルドは、更新が無効になっていない限り、 自動的にリリースをチェックします。 分離インストールには独自の更新プロセスが必要です。

技術プレビュー

Persistent Agentを使って開発している方や、メモリ、ツールの使い方、長時間のタスクを研究している研究者を対象に、テクニカルプレビューを開始しています。 エージェントに提供する継続的な仕事、必要なツール、 および作業を確認する方法を用意してください。 次のタスクに何が引き継がれるか、 どの程度のコンテキストが必要か、さらに人間の介入が必要な箇所を測定したいと考えています。

[仕様]

  • インターフェイスブラウザワークスペース、音声、コマンドライン、ターミナルインターフェイス、API。
  • プラットフォームAppleシリコン上のmacOS、x86_64とARM64上のLinux。
  • モデル実行中のモデルサーバーまたはホストされたエンドポイントを接続します。現在のビルドにはモデルがバンドルされていません。
  • 状態ローカルファイル:セッションストリーム、目標レコード、ワークスペースアーティファクト、スコープ付きMarkdownメモリ。
  • ツールファイル、ターミナル、Web、Mac デスクトップツール、インストール済みスキル、設定済みの権限下でのMCP接続。
  • 空室状況バックグラウンド作業は、ホストコンピュータと必要なモデルとツールの接続が使用可能なまま実行されます。
  • 利用方法プライベート開発ビルド。テクニカルプレビューについては、ラボにお問い合わせください。

その他のシステム

こちらもこちら:re1