GeekNews주목
Huggingface Speech To Speech - 오픈소스 모델로 로컬 음성 에이전트를 만드는 파이프라인
허깅페이스가 VAD·STT·LLM·TTS를 스레드와 큐로 연결해 완전 로컬에서 동작하는 오픈소스 음성 에이전트 파이프라인을 공개했다.
사서의 짚기
VAD, STT, LLM, TTS를 스레드와 큐로 연결해 완전한 로컬 음성 에이전트를 구성하는 오픈소스 파이프라인으로, 클라우드 API 없이 음성 대화 시스템을 직접 구축하려는 개발자에게 구조를 참고할 좋은 사례다. 각 단계를 독립 스레드로 분리한 설계는 지연시간 최적화를 고민할 때도 참고할 만하다.
원문 발췌
사용자가 말하면 이를 감지하고(VAD) → 음성을 텍스트로 바꾸고(STT) → LLM이 질문을 이해하고 답변 생성 → 생성된 답변을 다시 음성으로 읽어주는(TTS) 완전한 음성 대화 파이프라인 을 로컬에서 구성할 수 있음 각 단계는 각각 별도 스레드에서 동작하고 큐로 연결돼, 한 단계가...