ペガサス 1.5

生の動画を構造化データに変換。

話者の交代、ブランドの出現、プレイ、ポリシー違反などの重要なイベントを定義し、1回のAPI呼び出しでタイムコード付きのJSONを返す、動画からテキストへの生成モデルです。

話者の交代、ブランドの出現、プレイ、ポリシー違反などの重要なイベントを定義し、1回のAPI呼び出しでタイムコード付きのJSONを返す、動画からテキストへの生成モデルです。

2時間

エンドツーエンドで完全な時間的コンテキストを保持できる最大動画再生時間。

12

入力プロンプトと生成される出力の両方でサポートされている言語。

0

インデックス前処理ステップ。URL、アセット、またはbase64を送信するだけで、テキストが返されます。

JSON

編集ソフトやパイプラインにそのまま組み込める、構造化されたセグメンテーション出力。

ペガサスだけがすること。

汎用的なVLMはフレームをただ貼り合わせるだけで、それを「理解」と呼んでいます。Pegasusは動画専用に構築されており、プロンプトにタイムスタンプが含まれた瞬間にその実力差は一目瞭然になります。

汎用的なVLMはフレームをただ貼り合わせるだけで、それを「理解」と呼んでいます。Pegasusは動画専用に構築されており、プロンプトにタイムスタンプが含まれた瞬間にその実力差は一目瞭然になります。

Image

回答にはタイムスタンプが付与されます。

Pegasusは「動画の真ん中あたり」ではなく、正確なタイムスタンプで回答します。モデル自体にきめ細かな時間的推論が組み込まれています。

Image

細かい部分まで読み解く。

オンスクリーンテキスト。ユニフォームの背番号。ホワイトボード。レシート。Pegasusは音声トラックと一緒にフレームを解析するため、要約にはスライドの内容も含まれます。

Image

生の動画から構造化されたJSONへ。

話者の交代、ブランドロゴの登場、シーンの切り替えなどのセグメントを定義し、必要なフィールドを選択するだけで、Pegasusがタイムスタンプ付きのJSONを返します。

Image

画像を参照して質問する。

ロゴ、顔、製品などの参照画像をドロップするだけで、Pegasusがそれを視覚的コンテキストとして認識し、活用します。

サインアップから最初の結果を得るまで、わずか5分。

同じモデル、プロンプト、JSON出力。チームに最適なインターフェースを選択してください。

同じモデル、プロンプト、JSON出力。チームに最適なインターフェースを選択してください。

Python
Node.js
1import requests
2 
3# ステップ 2: APIのURLと特定のエンドポイントを定義する
4API_URL = "https://api.twelvelabs.io/v1.3"
5INDEXES_URL = f"{API_URL}/indexes"
6 
7# ステップ 3: 認証に必要なヘッダーを作成する
8headers = {
9 "x-api-key": "<YOUR_API_KEY>"
10}
11 
12# ステップ 4: APIリクエスト用のデータペイロードを準備する
13INDEX_NAME = "<YOUR_INDEX_NAME>"
14data = {
15 "models": [
16 {
17 "model_name": "marengo3.0",
18 "model_options": ["visual", "audio"]
19 }
20 ]
21}

クイックスタート

最初の動画をインデックス化し、5分以内に検索を実行できます。

サンプルアプリ

プロダクション向けリポジトリ:動画検索、動画RAG、ハイライト生成、コンプライアンススキャナー。

MCPサーバ

Claude、Cursor、または任意のMCPクライアントを動画インデックスに接続します。

SDKとAPI

Python、Node、REST。完全なリファレンス、型付きレスポンス、ストリーミングに対応。

クイックスタート

最初の動画をインデックス化し、5分以内に検索を実行できます。

サンプルアプリ

プロダクション向けリポジトリ:動画検索、動画RAG、ハイライト生成、コンプライアンススキャナー。

MCPサーバ

Claude、Cursor、または任意のMCPクライアントを動画インデックスに接続します。

SDKとAPI

Python、Node、REST。完全なリファレンス、型付きレスポンス、ストリーミングに対応。

静止画ではなく、動画のために構築。

一般的な汎用マルチモーダルLLMは、動画から静止画をサンプリングしてキャプションを作成することで動画を処理します。一方、Pegasusは動画全体を処理し、すべてのフレーム、モダリティ、そして一瞬一瞬を捉えます。

一般的な汎用マルチモーダルLLMは、動画から静止画をサンプリングしてキャプションを作成することで動画を処理します。一方、Pegasusは動画全体を処理し、すべてのフレーム、モダリティ、そして一瞬一瞬を捉えます。

7,200秒

Pegasusが1つのプロンプトで処理できる連続動画時間 —— 丸2時間分。

Image

1回のリクエストで処理可能な実質的な最大動画の長さ。

1回のリクエストで処理可能な実質的な最大動画の長さ。

機能

ペガサス 1.5

Gemini 3.1 PRO

GPT-5.5

1回の呼び出しあたりの最大動画時間

120分

90分

指定なし(オムニモーダル、公開されている動画の長さ制限なし)

構造化セグメンテーション出力

JSONネイティブ、スキーマ条件付き

構造化出力をサポート。ネイティブな時間的セグメンテーションはなし

構造化出力をサポート。ネイティブな時間的セグメンテーションはなし

マルチモーダルプロンプティング (画像とテキスト)

対応(構造化されたセグメント出力内)

対応(OCRはGemini 3.xの主要機能)

対応(オムニモーダルOCRサポート)

定義ごとのタイムウィンドウ

対応

汎用フロンティアモデル

汎用オムニモーダルモデル

Start building with TwelveLabs

Bring video intelligence into your production and archive workflows. Deploy, scale, and get more from your content.

Start building with TwelveLabs

Bring video intelligence into your production and archive workflows. Deploy, scale, and get more from your content.

Start building with TwelveLabs

Bring video intelligence into your production and archive workflows. Deploy, scale, and get more from your content.