複数のLLM APIを利用するSaaS企業の技術部門
Claude CodeとCodexの両方を試しているが、どちらがプロジェクトに適しているか判断するために、同じタスクを両エージェントで実行して結果を比較したい
Atlas上で両エージェントを並行実行し、各エージェントの推論プロセス・ツール呼び出し・ファイル変更をcheckpointで記録。共有メモリを活用して前回の実行結果を次のエージェント実行に引き継ぎながら、品質と速度を定量比較できるダッシュボードを構築する
AIエージェント導入検討企業向けに「エージェント比較評価サービス」として月額サブスク提供。複数エージェントの実行結果を自動採点・レポート化するWebUIを提供し、導入判断のコンサルティング料として請求