Skip to contents

Identifies and analyzes duplicate Zoom transcript files using multiple detection methods. This function helps clean up transcript datasets by finding files that contain similar or identical content, which can occur when multiple transcript formats are generated for the same recording session.

Usage

detect_duplicate_transcripts(
  transcript_list = NULL,
  data_folder = ".",
  transcripts_folder = "transcripts",
  similarity_threshold = 0.95,
  method = c("hybrid", "content", "metadata"),
  names_to_exclude = c("dead_air")
)

Arguments

transcript_list

A tibble with transcript_file column containing file names

data_folder

Base folder containing data files (default: ".")

transcripts_folder

Subfolder where transcript files are stored (default: "transcripts")

similarity_threshold

Similarity threshold for duplicate detection (default: 0.95)

method

Detection method: "hybrid" (default), "content", or "metadata"

names_to_exclude

Vector of names to exclude from comparison (default: c("dead_air"))

Value

List containing duplicate groups, similarity matrix, and recommendations

See also

process_zoom_transcript for processing individual transcripts, summarize_transcript_metrics for analyzing transcript content