📄 テキスト入力
📊 結果
ℹ 使い方
テキスト A
0 文字 / 0 セグメント
テキスト B
0 文字 / 0 セグメント
まだ分析が実行されていません。
テキストを入力して「TRACER 実行」ボタンをクリックしてください。
TRACERさんについて
TRACER(Text Reuse AChieved by Restructuring)は、Marco Büchler(eTRAP研究グループ)が開発した約700種類のアルゴリズムを持つテキスト再利用検出エンジンです。本WebアプリはTRACERのコアアルゴリズムをJavaScriptで再実装し、ブラウザ上で完結して動作します。
処理パイプライン
Step 1: 前処理(Preprocessing)
テキストを分析単位(文・行・ウィンドウ)に分割し、小文字化・句読点除去・ストップワード除去などの正規化を行います。
Step 2: 特徴抽出(Featuring / Training)
各セグメントから単語N-gram・文字N-gram・スキップN-gramなどの特徴を抽出し、転置インデックスを構築します。
Step 3: 選択(Selection)
DF(文書頻度)によるフィルタリングで、極端に高頻度・低頻度の特徴を除外して精度を向上させます。
Step 4: リンク(Linking)
転置インデックスを使って共有特徴を持つセグメントペアを検索します。テキスト間(インターリンク)と同一テキスト内(イントラリンク)の両方に対応しています。
Step 5: スコアリング(Scoring)
Jaccard係数・Dice係数・コサイン類似度などで類似度スコアを計算し、.score形式の結果を出力します。
TRACER 標準入力形式(TSV)
ID(7桁)[TAB]テキスト本文[TAB]日付 YYYY-MM-DD or NULL[TAB]出典
例:
0000001 吾輩は猫である。 1905-01-01 漱石_吾輩
0000002 名前はまだない。 1905-01-01 漱石_吾輩
例:
0000001 吾輩は猫である。 1905-01-01 漱石_吾輩
0000002 名前はまだない。 1905-01-01 漱石_吾輩
出力形式(.score)
ID_A[TAB]ID_B[TAB]共有特徴数[TAB]類似度スコア(0.0–1.0)
詳細は公式マニュアル(tracer.gitbook.io/manual)を参照してください。