Skip to contents

Summarize multiple transcript files and return aggregated metrics. If a tibble with additional columns beyond 'transcript_file' is provided, all metadata columns will be preserved in the output.

Usage

summarize_transcript_files(
  transcript_file_names = NULL,
  data_folder = ".",
  transcripts_folder = "transcripts",
  names_to_exclude = NULL,
  deduplicate_content = FALSE,
  similarity_threshold = 0.95,
  duplicate_method = c("hybrid", "content", "metadata")
)

Arguments

transcript_file_names

Vector of transcript file names or tibble with transcript_file column

data_folder

Base folder containing data files (default: ".")

transcripts_folder

Subfolder where transcript files are stored (default: "transcripts")

names_to_exclude

Vector of names to exclude from analysis (default: NULL)

deduplicate_content

Whether to detect and handle duplicate content (default: FALSE)

similarity_threshold

Similarity threshold for duplicate detection (default: 0.95)

duplicate_method

Method for duplicate detection: "hybrid", "content", or "metadata" (default: "hybrid")

Value

A tibble of speaker-level metrics combined across the requested transcript files. Metadata columns supplied with transcript_file_names are retained in the result.

Examples

transcript_dir <- system.file("extdata/test_transcripts", package = "engager")
transcript_files <- c(
  "ideal_course_session1.vtt",
  "ideal_course_session2.vtt"
)
summary <- summarize_transcript_files(
  transcript_file_names = transcript_files,
  data_folder = transcript_dir,
  transcripts_folder = "."
)