Open Research

Open Research

We publish our evaluation methodology, prompt designs, and model comparisons so you can see exactly how BrainTube works under the hood.

Transcription quality benchmark

How we compare Whisper variants, AssemblyAI, and Deepgram across accents, audio quality, and domain vocabulary.

Writeup coming soon

Summarization eval framework

Faithfulness, coverage, and compression metrics across Claude, GPT, and Gemini for long-form video.

Writeup coming soon

Semantic search evals

Recall@k benchmarks across embedding models for transcript chunks.

Writeup coming soon