Summarize multiple transcript files and return aggregated metrics. If a tibble with additional columns beyond 'transcript_file' is provided, all metadata columns will be preserved in the output.
Usage
summarize_transcript_files(
transcript_file_names = NULL,
data_folder = ".",
transcripts_folder = "transcripts",
names_to_exclude = NULL,
deduplicate_content = FALSE,
similarity_threshold = 0.95,
duplicate_method = c("hybrid", "content", "metadata")
)Arguments
- transcript_file_names
Vector of transcript file names or tibble with transcript_file column
- data_folder
Base folder containing data files (default: ".")
- transcripts_folder
Subfolder where transcript files are stored (default: "transcripts")
- names_to_exclude
Vector of names to exclude from analysis (default: NULL)
- deduplicate_content
Whether to detect and handle duplicate content (default: FALSE)
- similarity_threshold
Similarity threshold for duplicate detection (default: 0.95)
- duplicate_method
Method for duplicate detection: "hybrid", "content", or "metadata" (default: "hybrid")
Value
A tibble of speaker-level metrics combined across the requested
transcript files. Metadata columns supplied with transcript_file_names
are retained in the result.
Examples
transcript_dir <- system.file("extdata/test_transcripts", package = "engager")
transcript_files <- c(
"ideal_course_session1.vtt",
"ideal_course_session2.vtt"
)
summary <- summarize_transcript_files(
transcript_file_names = transcript_files,
data_folder = transcript_dir,
transcripts_folder = "."
)