Data Processing for the OpenGPT-X Model Family

要約

このペーパーでは、オープンで高性能な多言語大規模言語モデル (LLM) の作成を目的とした大規模な取り組みである OpenGPT-X プロジェクト用に開発されたデータ準備パイプラインの包括的な概要を示します。
プロジェクトの目標は、欧州連合内の実際のアプリケーションに特に焦点を当て、すべての主要なヨーロッパ言語をカバーするモデルを提供することです。
データの選択と要件定義から始まり、モデル トレーニング用の最終データセットの準備まで、すべてのデータ処理ステップについて説明します。
当社では、厳選されたデータと Web データを区別しています。これらのカテゴリはそれぞれ別個のパイプラインによって処理され、厳選されたデータには最小限のフィルタリングが適用され、Web データには広範なフィルタリングと重複排除が必要となります。
この違いが、両方のパイプラインに特化したアルゴリズム ソリューションの開発を導きました。
処理方法の説明に加えて、データセットの詳細な分析を提供し、透明性を高め、欧州のデータ規制との整合性を高めます。
最後に、プロジェクト中に直面した重要な洞察と課題を共有し、LLM 向けの大規模な多言語データ準備における今後の取り組みへの推奨事項を提供します。

要約(オリジナル)

This paper presents a comprehensive overview of the data preparation pipeline developed for the OpenGPT-X project, a large-scale initiative aimed at creating open and high-performance multilingual large language models (LLMs). The project goal is to deliver models that cover all major European languages, with a particular focus on real-world applications within the European Union. We explain all data processing steps, starting with the data selection and requirement definition to the preparation of the final datasets for model training. We distinguish between curated data and web data, as each of these categories is handled by distinct pipelines, with curated data undergoing minimal filtering and web data requiring extensive filtering and deduplication. This distinction guided the development of specialized algorithmic solutions for both pipelines. In addition to describing the processing methodologies, we provide an in-depth analysis of the datasets, increasing transparency and alignment with European data regulations. Finally, we share key insights and challenges faced during the project, offering recommendations for future endeavors in large-scale multilingual data preparation for LLMs.

arxiv情報

著者 Nicolo’ Brandizzi,Hammam Abdelwahab,Anirban Bhowmick,Lennard Helmer,Benny Jörg Stein,Pavel Denisov,Qasid Saleem,Michael Fromm,Mehdi Ali,Richard Rutmann,Farzad Naderi,Mohamad Saif Agy,Alexander Schwirjow,Fabian Küch,Luzian Hahn,Malte Ostendorff,Pedro Ortiz Suarez,Georg Rehm,Dennis Wegener,Nicolas Flores-Herr,Joachim Köhler,Johannes Leveling
発行日 2024-10-11 13:34:24+00:00
arxivサイト arxiv_id(pdf)

提供元, 利用サービス

arxiv.jp, Google

カテゴリー: cs.CL, I.2.7 パーマリンク