AI データのよくあるご質問

AI データは、必要なデータをチャット内で指示していただくことで、取得の方法を組み立ててデータフレームとして取り込む機能です。ファイルの中身やデータベースの構造を確認し、必要な処理を判断したうえで、分析にそのまま使える形に整えて取り込みます。

このページでは、AI データについてよくお寄せいただくご質問にお答えします。

使えるデータについて

どのようなデータに対応していますか

Exploratory で現在お使いいただけるデータソースは、そのまま AI データでもご利用いただけます。すでに作成済みの接続情報は AI データの画面に一覧として表示されますので、あらためて接続を設定していただく必要はありません。

対応しているデータソースの主なものは次のとおりです。

  • ファイル: Excel、CSV、PDF、Word、JSON、XML、Parquet、および SPSS や Stata などの統計ソフトの形式に対応しています。
  • データベース: PostgreSQL、MySQL、SQL Server、Oracle、BigQuery、Snowflake、Redshift、MongoDB などをご利用いただけます。
  • クラウドストレージ: Google ドライブ、Google スプレッドシート、Amazon S3、SharePoint、Dropbox、Box に保存されたファイルを、直接お取り込みいただけます。

これらに加えて、e-Stat(政府統計の総合窓口)をはじめとする公的統計や、各種の公開API、Web 上に公開されている資料からもデータを取得できます。あらかじめ専用の手順を用意していないデータソースについても、仕様を調べたうえで取得を試みますので、まずはご要望をそのままお伝えください。

ファイルはどのように渡せばよいですか

AI データの画面に、ファイルをドラッグ&ドロップしていただくだけで結構です。複数のファイルをまとめてドロップしていただくこともできます。

ファイルが階層の分かれたフォルダに入っている場合は、いちばん上の階層を指定していただければ、その下のフォルダまで探して対象のファイルを見つけます。地域ごと、年度ごとにフォルダが分かれているようなデータでも、フォルダの構成を変更していただく必要はありません。

対応している形式は、画像を除くファイル全般です。PDF や Word の文書に含まれる表も、取得の対象となります。

複数のファイルをまとめたい

シート名が異なる Excel ファイルでもまとめられますか

まとめていただけます。月ごとや年度ごとにファイルが分かれていて、「3月回答リスト」「4月分」のようにシート名がファイルごとに異なる場合でも、そのままの状態でご指定いただけます。

従来のインポート&マージでは、シート名を揃えていただいてからでないと取り込めませんでした。AI データでは、ファイルごとにシートの構成を確認したうえで対象を判断しますので、Excel 側でシート名を統一する作業は不要です。

なお、1つのファイルに複数のシートが含まれていて、どのシートを対象にすべきか判断が分かれる場合は、取り込みの前に確認の画面を表示します。意図しないシートが対象になることはありません。

年度によって列名が異なるファイルはどうなりますか

列名の対応表を自動的に作成したうえで、列名を統一してまとめます。年度によって設問の文言が変わっているアンケートのデータなどでも、対応表をご自身でご用意いただく必要はありません。

作成した対応表は、それ自体を別のデータとして残しておくこともできます。どの列がどの列に対応づけられたかを後から確認したい場合や、対応の内容を関係者と共有したい場合にお使いください。「対応表も別のデータフレームとして保存してください」のようにお伝えいただければ、取り込みとあわせて作成します。

列名の位置がファイルによって異なる場合はどうなりますか

事前に揃えていただく必要はありません。列名が1行目にあるファイルと2行目にあるファイルが混在している場合でも、ファイルごとに構造を確認したうえで取り込みます。

整っていないデータを取り込みたい

ヘッダーが二重になっていたり、列名が「列1」のようになっているデータは扱えますか

扱えます。社内のシステムから書き出したデータや、Excel で集めたアンケートの回答では、見出しが2段になっていたり、セルの結合が崩れて列名が失われていることがあります。こうしたデータについても、事前に整えていただく必要はありません。

具体的には、次のような整理を行ったうえで取り込みます。

  • 複数行に分かれた見出しを1行にまとめ直し、見出しとして使った行はデータから取り除きます
  • 結合されていたセルによって空欄になっている見出しは、本来の値を補って各列に割り当てます

これまで、取り込んだ後に列名を手作業で修正されていた場合は、その作業が不要になります。

データの値がコードで入っていて、定義ファイルとの突き合わせが必要な時にも使えますか?

コードと名称の対応表を、データと一緒にご指定ください。

対応表が含まれている場合、変換を自動的に適用することはせず、取り込みの前に方針を1度おうかがいします。お選びいただける方針は次の4つです。

  1. 列名を名称に変換し、値もラベルに変換する
  2. 列名は元のまま、値だけをラベルに変換する
  3. 列名を名称に変換し、値はコードのままにする
  4. 列名も値も、元のまま取り込む

このとき、ID や結合に使うキーの列、および日付の列については、どの方針をお選びいただいても元の名前と値のまま保持します。これらの列の値を変換してしまうと、後から別のデータと結合される際に対応がとれなくなるためです。

取得したデータについて

AI が勝手に集計や計算をしてしまうことはありませんか

ご懸念のような動作は行いません。AI データが担当するのは、指示されたデータの取得と、分析に使える形への整形までです。指示していない指標を独自に作り出すことはありません。

インポート時に行うデータの加工については、「整然データの形への変換」と「データタイプの変換」に限定しています。合計や比率といった新しい列を、AI データの判断で追加することはありません。

取得された数値が元のデータのどの値に由来するかは、生成された R スクリプトからたどっていただけます。

もしインポート時点で追加で加工したい要件があれば、AI データのチャットで追加で指示していただくことで加工することは可能です。

取得したデータは、そのまま分析に使えますか

そのままお使いいただけます。取り込みの前に、次の形に整えます。

  • 1行が1つの観測を表す形にします
  • 1つの列が1つの変数を表す形にします。同じ指標が複数の列に分かれている場合は、1つの列にまとめます
  • 1つのセルには1つの値だけが入る形にします

あわせて、空の行や、脚注や出典などデータではない行を取り除きます。取り込みが完了した時点で、そのままチャートの作成にお進みいただけます。

生成された R スクリプトは確認できますか

画面の右側に表示されますので、いつでもご確認いただけます。

どのような処理が行われたかを確認していただけるほか、内容をご自身で編集していただくこともできます。

セキュリティについて

API キーやデータベースの接続情報は、AI に渡りますか

渡ることはございません。認証情報の取り扱いについては、次のとおり設計しています。

  • API キーやパスワードなどの認証情報を、チャットでお伺いすることはありません
  • 認証情報を R スクリプトに直接書き込むことはありません
  • データベースに接続する場合、R スクリプトの先頭では、Exploratory 側が保持している接続情報を変数として差し込む形になります。ホスト名やポート番号が AI に渡ることはありません

API キーの入力が必要なデータソースをお使いの場合は、専用のダイアログを表示してご入力いただく形になります。ご入力いただいた値は Exploratory の内部で保持され、AI に対してそのまま渡されることはありません。

データのどこまでが AI に送られますか

データの取得方法を組み立てるために必要な範囲の情報が送られます。具体的には、ファイルの列名と先頭の数行、およびデータベースのスキーマ情報です。ファイルの構造が複雑で、先頭の数行だけでは見出しとデータの境目を判断できない場合には、読み取る行数を増やすことがあります。

取得したデータそのものは、生成された R スクリプトをお使いの環境で実行することによって取り込まれます。

更新と再利用について

データが更新されるたびに、AI に指示し直す必要がありますか

その都度指示し直していただく必要はありません。

一度取り込みが完了すると、生成された R スクリプトがデータソースとして保存されます。元のファイルやデータベースの内容が更新された後は、再インポートボタンを押していただくだけで、保存されたスクリプトのみが実行されます。

AI をあらためて動かすことはありませんので、毎回同じ手順で最新のデータをお取り込みいただけます。

同じ処理を繰り返し実行しても結果が変わらないため、定期的に更新されるデータの取り込みにも安心してお使いいただけます。

翌月は別のシートを見てほしい場合は、どうすればよいですか

2つの方法がございます。

1つは、AI データの画面で「8月のシートを見るようにスクリプトを変更してください」とお伝えいただく方法です。該当する箇所のみが書き換えられます。

もう1つは、最初の指示の時点で、シート名を固定しない形にしておく方法です。今後ファイルが同じフォルダに増えていくことが分かっている場合は、「シート名を固定せず、そのフォルダにあるファイルをすべて取得するようにしてください」とお伝えください。

以降は、ファイルを追加していただくだけで対象に含まれるようになりますので、再インポートボタンを押していただくだけで更新ができ、毎月の変更作業が不要になります。

データのインポート後に、追加の指示を出すことはできますか

インポート後のデータは、Exploratory の通常のデータフレームと同じように扱われます。そのため、一度取り込んだ後であっても、条件を変更したり不要な行を除いたりといった調整を、続けて行っていただけます。

操作としては、ソースステップ(1番目のステップ)のトークン(グレーのボックス)から AI データを再度開いてください。

取り込みのときのやり取りがそのまま残った状態で開きますので、そこに追加の指示を入力して送信いただければ、これまでの内容を踏まえたうえで、今回の変更点だけが反映されます。最初から指示をやり直していただく必要はありません。

同じような処理を、毎回指示し直す必要がありますか

その必要はありません。

データフレームを作成または更新されたタイミングで、そのとき使われた手順が自動的にスキルとして保存されます。次に似たような構造のデータをご指定いただいた際には、保存された手順をもとに、列名などの違いを調整しながら同じ処理を適用します。

スキルの中身は、どのようなご依頼のときにどのような R スクリプトを書くかをまとめた、マークダウン形式のファイルです。.exploratoryのレポジトリにある「ai_skills」のフォルダの「datasource」のパスに保存されていますので、内容を確認して意図しない処理が保存されていないかを後から確かめていただくこともできます。

思うような結果にならないとき

Web 上の資料を集める指示に時間がかかります

対象ごとに公開されている場所や資料の形式が異なる場合、1件ずつ確認しながら進めるため、やり取りが数回に及ぶことがございます。

次の内容を最初の指示に含めていただくと、より早く目的のデータに到達できます。

  • 資料の正式な名称。検索で引ける表現をそのままお書きください
  • 対象の範囲。都道府県、年度、機関名などを具体的にお示しください
  • 取得したい表の列。学校名、定員、実員といった項目名をお書きください
Export Chart Image
Output Format
PNG SVG
Background
Set background transparent
Size
Width (Pixel)
Height (Pixel)
Pixel Ratio