>_tech-draft
OpenAIのアイコン
OpenAI
動画公開日
タイトル

Introducing the Decisions API

再生時間

5分 34秒

GPT-6 Luna搭載「Decisions API」:瞬時のAI判断でアプリ開発を加速

ポイント

  • •Decisions APIは、GPT-6 Luna搭載でアプリケーションに瞬時のAI判断をもたらし、ユーザー体験を劇的に向上させる新サービスです。
  • •テキストや画像を入力に、定義された選択肢から高速で回答を生成し、既存モデルの約10倍の処理速度を実現しています。
  • •フォーム抽出、リアルタイム画像判断、ロボット制御など、多様な分野でAIによる高速で賢明な意思決定を可能にし、開発を加速します。

瞬時のAI判断を可能にする「Decisions API」が登場

アプリケーションが瞬時に、そして賢明な判断を下す必要がある場面は少なくありません。例えば、リクエストのルーティング、画像の分類、またはエージェントが次にとるべき行動の決定などです。本日、私たちは「Decisions API」を導入いたします。このAPIは、モデルがわずか数分の一秒で応答できるように設計されており、ユーザーとのインタラクションがほぼ瞬時に感じられるようになるでしょう。

Decisions APIとは?

Decisions APIは、最新のAIモデルである「GPT-6 Luna」上で動作します。その使い方は非常にシンプルです。テキストや画像をインプットとして提供し、質問といくつかの選択肢を定義するだけで、その結果をアプリケーションで利用できます。

モデルを限られた選択肢に集中させることで、私たちはその処理速度をほぼ10倍に高速化することに成功しました。これにより、画像理解、幅広い言語サポート、そして安全保護といったGPT-6 Lunaの強力な機能は維持しつつ、圧倒的なスピードを実現しています。

テキスト入力による活用例

Decisions APIは、すでに多種多様なアプリケーションでその恩恵をもたらすことが確認されています。 unstructured text (非構造化テキスト) の処理を考えてみましょう。

フォームフィールドの自動抽出とルーティング

長い段落からフォームフィールドを自動的に抽出するといった単純なタスクから始めることができます。さらに、これらの入力を活用して、サポートチケットやインバウンドの営業リクエストを適切なチームにルーティングしたり、分類したりすることが可能です。例えば、様々な形式のユーザー入力を瞬時にセールスリードとして分類する例が見られました。これは驚くべき速さです。

特筆すべきは、この処理が全く高速化されていない実際のデモンストレーションであることです。サーバー側では、Decisions APIは100ミリ秒未満で応答していました。これは非常に印象的なパフォーマンスと言えるでしょう。

画像入力による活用例

Decisions APIのさらにエキサイティングな点は、視覚理解に基づいた高速なアクションに画像入力を利用できることです。簡単なゲームを例にご紹介しましょう。

ゲームにおけるリアルタイムの車線判断

このデモでは、Decisions APIが道路と障害物のフレームを継続的に取得し、車が車線を維持すべきか、左または右に進むべきかを素早く判断しています。速度を上げた場合でも、Decisions APIは推論モデルが要する時間のわずかな時間で、車を正しい車線へと操縦し続けることができました。これは非常にクールな応用例です。

このAPIを基本的なコンピューター使用タスクと組み合わせることで、スクリーンショットを撮り、瞬時にアクションをフィードバックするといったシナリオが実現可能です。もちろん、非常に高度なコンピューター使用やブラウザ使用のシナリオでは、引き続きAstraの機能が必要となるでしょう。

音声入力との組み合わせ

Decisions APIは、音声入力と組み合わせることで、ライブインタラクションをさらに応答性の高いものにすることができます。例えば、GPT-Live-1とアニメーションキャラクターを組み合わせたデモがありました。

アニメーションキャラクターのリアルタイムな感情表現

このデモでは、GPT-Live-1が音声処理を担当し、Decisions APIは私が話す内容に基づいてキャラクターがどのような表情を使用すべきかを瞬時に選択しています。これにより、キャラクターは会話の内容に合わせて適切な表情をリアルタイムで変化させ、より自然で魅力的なインタラクションを生み出していました。選択肢から表情を選ぶことで、アシスタントが実際に話している内容と並行して、会話の一部として小さなリアクションが生まれるのです。

ロボティクスへの応用

Decisions APIは、ロボティクスの分野でも革新的なインタラクティブ体験を可能にします。Hugging Faceのご協力により、開発中のプログラマブルロボット「Microduck」(名前はLavender)を活用したデモが行われました。

ロボットの視覚と行動の連携

このデモでは、GPT-Liveを統合してロボットに音声知能を与え、さらにDecisions APIを利用して、カメラからの情報に基づいてロボットがどこを見るべきかを判断させました。デモにおける選択肢はシンプルで、ロボットの頭を左右に動かし、正しいオブジェクトを見るようにコマンドを送るというものです。

「Lavender、リンゴを追いかけて」と指示すると、カメラからの数フレームごとにDecisions APIが分析を行い、ロボットがどこを見るべきかを判断し、ロボットにコマンドを送ります。Decisions APIが「リンゴ」を認識し、追跡するのです。

曖昧な指示への対応

さらに、少し曖昧なリクエストを試すことも可能です。「Lavender、果物を追いかけてくれる?」と指示すると、Decisions APIは「果物」という概念を理解し、画面上のリンゴを追跡し続けました。これは驚くべきことです。

2つ目のオブジェクト(ゲームパッド)を導入し、「Lavender、どちらがもっと楽しい?」というさらに曖昧な質問をすると、Lavenderはゲームパッドを追いかけました。自然な判断として、ゲームパッドの方がリンゴよりも遊ぶのが楽しいと判断したのです。オブジェクトを入れ替えても、Lavenderは一貫してゲームパッドを追跡し続けました。これは、Decisions APIが単なるオブジェクト認識だけでなく、より複雑な意図や概念を解釈し、判断を下せることを示しています。

まとめ

今回ご紹介したデモは、Decisions APIがテキストおよび視覚入力、そしてキーボードや音声といったインタラクションを通じて、いかに多様な応用が可能であるかを示しています。Decisions APIは、AIとのまったく新しいインタラクションの可能性を解き放つものと確信しており、皆様がこのAPIを使ってどのようなものを構築されるのか、今から非常に楽しみにしております。

参考動画

https://www.youtube.com/watch?v=FB6oCmrIj-Y