このドキュメントは AI によって自動翻訳されています。不正確な部分がある場合は、英語版 を参照してください。テキスト抽出ノードは、アップロードされたファイルを大規模言語モデルが処理できるテキストに変換します。言語モデルは PDF や DOCX などのドキュメント形式を直接読み取ることができないため、このノードはファイルアップロードと AI 分析の間の重要な橋渡し役を果たします。
テキスト抽出ノードの設定
サポートされているファイル形式
このノードは、ほとんどのテキストベースのドキュメント形式を処理できます: テキストドキュメント - 直接テキストコンテンツを含む TXT、Markdown、HTML ファイル Office ドキュメント - Microsoft Word および互換アプリケーションの DOCX ファイル PDF ドキュメント - テキストベースの PDF Office ファイル - DOCX ファイルは直接解析され、テーブルは Markdown に変換されます。DOC と ODT ファイルにも対応しています。 スプレッドシート - Excel(.xls/.xlsx)および CSV ファイルを Markdown テーブルに変換 プレゼンテーション - PowerPoint(.ppt/.pptx)ファイル メール形式 - メールコンテンツ抽出のための EML および MSG ファイル 特殊形式 - EPUB 書籍、VTT 字幕、JSON/YAML データ、および Properties ファイル 画像、音声、動画などの主にバイナリコンテンツを含むファイルは、特殊な処理ツールや外部サービスが必要です。入力と出力
入力設定
以下のいずれかを受け入れるようにノードを設定します: 単一ファイル 入力(通常は Start ノードからのファイル変数) 複数ファイル バッチドキュメント処理用の配列として出力構造
ノードは抽出されたテキストコンテンツを出力します:- 単一ファイル入力は抽出されたテキストを含む
stringを生成 - 複数ファイル入力は各ファイルのコンテンツを含む
array[string]を生成
textという名前で、下流処理用の生のテキストコンテンツが含まれています。
実装例
テキスト抽出ノードを使用した完全なドキュメント Q&A ワークフローの例です:ChatPDFスタイルのワークフロー実装
ワークフローセットアップ
ファイルアップロード設定 - ユーザーからのドキュメントアップロードを受け入れるために、Start ノードでファイル入力を有効にします。 テキスト抽出 - テキスト抽出ノードを接続して、アップロードされたファイルを処理し、テキストコンテンツを抽出します。 AI 処理 - 抽出されたテキストを大規模言語モデルのプロンプトで分析、要約、または質問応答に使用します。動作中のドキュメント処理
ドキュメントアップロード付きチャットインターフェース