A Statistical Exploration of Text Partition Into Constituents: The Case of the Priestly Source in the Books of Genesis and Exodus



– 統計的なテキスト探索についてのパイプラインを提案する。
– パラメータ化されたテキストから、仮説を立てたテキスト分割と、正解なしの分割の最適な重複を見つける。
– 仮説と正解を比較し、分類に最も重要なスタイリスト的な特徴を抽出する。
– これをユダヤ教の聖書・創世記と出エジプト記に適用し、祭司的なスタイルと非祭司的なスタイルの間に統計的な特徴差を見つける。

– スタイル的な特徴を検出
– 仮説と無監督分割の最適な重複を見つけ、仮説を検証
– テキストの単位の間の相関を保持しながら、最も重要な分類に関連するスタイル的な特徴を抽出
– パイプラインをユダヤ教の聖書・創世記と出エジプト記に適用し、祭司的なスタイルと非祭司的なスタイルに統計的な特徴の違いを見つける。


We present a pipeline for a statistical textual exploration, offering a stylometry-based explanation and statistical validation of a hypothesized partition of a text. Given a parameterization of the text, our pipeline: (1) detects literary features yielding the optimal overlap between the hypothesized and unsupervised partitions, (2) performs a hypothesis-testing analysis to quantify the statistical significance of the optimal overlap, while conserving implicit correlations between units of text that are more likely to be grouped, and (3) extracts and quantifies the importance of features most responsible for the classification, estimates their statistical stability and cluster-wise abundance. We apply our pipeline to the first two books in the Bible, where one stylistic component stands out in the eyes of biblical scholars, namely, the Priestly component. We identify and explore statistically significant stylistic differences between the Priestly and non-Priestly components.


著者 Gideon Yoffe,Axel Bühler,Nachum Dershowitz,Israel Finkelstein,Eli Piasetzky,Thomas Römer,Barak Sober
発行日 2023-05-03 15:07:42+00:00
