블로그

우리 팀의 인사이트, 업데이트, 이야기

How We Optimized ScribeToAny: From 3.5s Cloudflare Cold Starts to a 95+ Lighthouse Score
Engineering2026/09/08

How We Optimized ScribeToAny: From 3.5s Cloudflare Cold Starts to a 95+ Lighthouse Score

An 11MB worker bundle and edge cold starts drove our initial TTFB to 3.5 seconds. Here is how we engineered edge HTML caching with zero-staleness build invalidation, decoupled monolithic bundles, deferred hydration tasks, and achieved a 95+ Lighthouse performance score.
Running Whisper on Modal from Cloudflare Workers
Engineering2026/09/03

Running Whisper on Modal from Cloudflare Workers

Cloudflare Workers can't run a multi-minute GPU job or Modal's gRPC SDK — so ScribeToAny treats Modal as a plain HTTP endpoint, fires a fire-and-forget spawn, and lets the GPU box call back over a signed webhook. A walk through the async design, the reconciliation backstop, and the sharp edges.
캡션 vs. 자막: 무엇이 다를까?
가이드2026/08/21

캡션 vs. 자막: 무엇이 다를까?

캡션은 소리를 들을 수 없는 시청자를 위한 것으로 비언어적 소리도 포함하고, 자막은 언어를 이해하지 못하는 시청자를 위한 것으로 대사만 번역합니다. 어느 쪽이 필요한지 결정하는 접근성 규칙과 함께 명확하게 비교합니다.
AI 전사는 얼마나 정확할까? WER 쉽게 이해하기 (2026)
가이드2026/08/21

AI 전사는 얼마나 정확할까? WER 쉽게 이해하기 (2026)

단어 오류율(WER)을 쉬운 말로 설명합니다 — 전사 정확도는 실제로 어떻게 측정하는지, 숫자가 무엇을 뜻하는지, 왜 사람조차 100%가 아닌지, 그리고 정확도를 올리고 내리는 요인들.
자막·전사 파일 형식 설명: SRT, VTT, TXT, JSON, CSV 그리고 그 밖
가이드2026/08/21

자막·전사 파일 형식 설명: SRT, VTT, TXT, JSON, CSV 그리고 그 밖

전사가 만들어 내는 파일 형식에 대한 참고 가이드 — SRT, VTT, TXT, TSV, CSV, JSON, 그리고 ASS, SSA, SMI, TTML — 각각의 실제 예시와 언제 무엇을 쓸지 정리한 표와 함께.
화자 분리란 무엇인가? AI는 누가 무엇을 말했는지 어떻게 알아낼까
가이드2026/08/21

화자 분리란 무엇인가? AI는 누가 무엇을 말했는지 어떻게 알아낼까

화자 분리는 녹음을 화자별로 나누는 단계 — 텍스트 벽을 라벨이 붙은 대화로 바꿉니다. 그것이 무엇인지, 화자 인식과 어떻게 다른지, 어떻게 작동하는지, 그리고 어디서 어려움을 겪는지.