データ
データに関連する用語(13件)
データは、AIモデルの学習と評価の基礎となる情報資源です。データの品質・量・多様性がモデル性能を大きく左右し、収集・前処理・管理の手法が重要な研究領域となっています。
用語一覧
コーパス
Corpus / テキストコーパス
言語モデルの学習・分析に使われる、構造化されたテキストデータの集合
時系列データ
Time Series Data
時間の経過に沿って一定間隔または連続的に観測・記録された、順序に意味のあるデータ
合成データ
Synthetic Data
実データの代わりに、モデルやシミュレーションによって人工的に生成される学習用データ
データ拡張
Data Augmentation
既存の学習データへ変換を加えて多様性を増やし、モデルの汎化性能を高める技術
データ汚染
Data Contamination / ベンチマーク汚染 / データコンタミネーション
評価用ベンチマークの問題や解答が学習データへ混入し、評価スコアが実力以上に高く出てしまう問題
AIソフトセンサー
AI Soft Sensor / ソフトセンサー
温度・圧力等、測定容易なセンサーデータからAIが測定困難な品質・状態をリアルタイムに推定する仮想センサー技術
Common Crawl
月次で数十億ページ規模のWebページをクロールし無償公開しているオープンなWebアーカイブで、多くのLLMの事前学習データの主要な情報源
正解データ
Ground Truth / 正解ラベル
モデルの予測や生成結果を評価・学習する際に基準とする、正しいとされるデータやラベル
ラベル付きデータ
Labeled Data
正解ラベルが付与された学習データで、教師あり学習の基盤となるもの
アノテーション
Annotation
学習・評価用データに正解ラベルや付加情報を人手で付与する作業
推薦システム
Recommendation System / レコメンドシステム / レコメンデーションエンジン
ユーザーの嗜好や行動履歴に基づき、関心を持ちそうなアイテムを推薦するシステム
協調フィルタリング
Collaborative Filtering / CF
似た嗜好を持つ他ユーザーの行動履歴から推薦する手法
コンテンツベースフィルタリング
Content-based Filtering / コンテンツベース
アイテム自体の特徴に基づき、ユーザーが過去に好んだものと似たアイテムを推薦する手法