
STT 도구가 다양해진 지금, 상담 수련 현장에서 '어떤 도구를 써야 하는가'라는 질문은 편의성의 문제를 넘어 임상 윤리의 영역과 맞닿아 있다. 한국상담심리학회 윤리강령은 녹음과 기록에 대한 내담자 동의 의무를 명시하고 있지만, 그 동의가 외부 서버 전송 사실을 포함하는지에 대한 실무적 해석은 도구 선택 단계에서부터 시작된다. 이 글에서는 클라우드 STT와 로컬 STT의 구조적 차이를 윤리·기술·실무 세 축으로 검토하고, 상담자가 판단할 수 있는 기준을 제시한다.
윤리 기준 출발점
한국상담심리학회 윤리강령은 두 가지 핵심 의무를 명시한다. 첫째, '상담심리사는 상담의 녹음 및 기록에 관해 내담자의 동의를 구한다.' 둘째, '내담자에게 상담 과정의 녹음과 녹화 가능성, 사례지도 및 교육에의 활용 가능성에 대해 설명하고 동의 또는 거부할 권리가 있음을 알려야 한다.'
이 기준을 STT 도구 사용에 대입하면, 단순히 '녹음한다'는 동의만으로는 충분하지 않을 수 있다. 특히 클라우드 기반 STT를 사용하는 경우, 음성 데이터가 외부 서비스 제공사의 서버를 경유한다는 사실 자체가 별도의 설명 대상이 될 수 있다.
APA(미국심리학회) 윤리 가이드라인도 상담 축어록과 관련 자료는 익명화 및 비밀 보호 절차를 거쳐야 한다고 규정하며, 처리 과정에서의 제3자 접근 가능성을 최소화할 것을 권고한다. 국내 상황에서도 이 원칙은 동일하게 적용된다고 볼 수 있다.
상담심리사는 내담자에게 녹음과 녹화 가능성, 사례지도 및 교육에의 활용 가능성에 대해 설명하고, 동의 또는 거부할 권리가 있음을 알려야 한다. — 한국상담심리학회 윤리강령
클라우드 STT 구조 분석

클라우드 기반 STT는 음성 파일을 인터넷을 통해 서비스 제공사의 외부 서버로 전송한 뒤 텍스트로 변환해 반환하는 방식이다. 변환 품질이 높고 추가 인프라 구축 없이 바로 사용할 수 있다는 실용적 이점이 있다.
그러나 민감한 데이터를 다루는 의료·법률·심리 분야 연구자들이 공통적으로 지적하는 구조적 한계가 있다. 데이터가 외부 서버를 경유하는 순간, 해당 서비스의 데이터 보관 정책·로그 설정·제3자 제공 조건이 통제 변수로 개입한다는 점이다(mljar.com, 로컬 vs 클라우드 데이터 처리 비교 분석, 2024).
상담 현장에서 클라우드 STT를 사용하기로 결정했다면, 다음 절차를 실무에 반영하는 것이 윤리적으로 합리적이다: 내담자에게 서비스명과 데이터 전송 사실을 고지하고 동의 받기, 변환 완료 후 서비스 내 파일 즉시 삭제 확인, 해당 서비스의 데이터 보관 정책 정기적으로 검토.
- 장점: 높은 변환 품질, 별도 설치 불필요, 다국어 지원
- 단점: 음성 데이터가 외부 서버 경유, 데이터 보관·로그 정책은 서비스별 상이
- 윤리적 대응: 서비스명·전송 사실 사전 고지 및 서면 동의, 변환 후 원본 삭제 확인
로컬 STT 기술과 한계

로컬 STT는 음성 인식 모델을 사용자의 PC 내에서 직접 실행하는 방식이다. 대표 모델로는 OpenAI가 2022년 공개한 Whisper가 있다. Radford et al.(2022)의 논문 'Robust Speech Recognition via Large-Scale Weak Supervision'에서 제안된 이 모델은 680만 시간의 레이블 음성 데이터로 사전 학습된 Transformer 기반 인코더-디코더 구조로, 50개 이상의 언어를 지원한다.
로컬 실행의 핵심 장점은 데이터 이동 자체가 발생하지 않는다는 점이다. 민감 정보를 다루는 의료·법률 분야에서 로컬 처리가 선호되는 이유가 바로 여기에 있다. 외부 서버 전송이 없으므로, 클라우드 방식에서 발생하는 제3자 접근 가능성과 데이터 보관 정책의 문제가 구조적으로 제거된다.
다만 실무 적용 시 명확한 한계도 존재한다. 첫째, 처음 모델을 내려받아야 하며 파일 크기가 수백 MB에 달할 수 있다. 둘째, 변환 속도는 PC 사양(CPU·GPU)에 직접적으로 의존하므로 저사양 기기에서는 실시간보다 오래 걸릴 수 있다. 셋째, 화자 분리(Speaker Diarization) 기능은 기술적으로 탑재되어 있어도 두 화자의 발화 길이 불균형, 겹치는 발화, 유사한 음색 등 상담 특유의 발화 환경에서는 오류가 발생하므로 편집 단계에서 반드시 검토가 필요하다.
- 장점: 녹음 데이터가 PC 밖으로 나가지 않음, 인터넷 없이 동작 가능, 외부 전송 0건
- 단점: 초기 모델 다운로드 필요, 변환 속도는 하드웨어 사양 의존
- 화자 구분 한계: 상담 특유의 발화 환경(발화 길이 불균형, 겹치는 발화)에서 오류 가능 — 편집 검토 필수
Privacy-sensitive applications에서 로컬 처리는 protected health information이 사용자의 통제를 벗어나지 않게 한다. — openwhispr.com 로컬 vs 클라우드 STT 비교(2024)
두 방식 판단 기준
두 방식을 '어느 쪽이 절대적으로 우수한가'로 비교하는 것은 실무에서 적절하지 않다. 상황에 따라 달라지는 판단 문제이기 때문이다. 다만 상담이라는 맥락에서 고려해야 할 기준은 비교적 명확하다.
첫 번째 기준은 '내담자에게 어디까지 설명하고 동의를 받았는가'다. 클라우드 방식은 외부 서비스 이름, 데이터 전송 사실, 삭제 방침을 포함한 설명이 필요하다. 로컬 방식은 이 설명의 범위가 상대적으로 좁아진다.
두 번째 기준은 '해당 기관의 개인정보 처리 방침 및 내부 보안 규정과 부합하는가'다. 기관마다 외부 서비스 사용에 대한 내부 규정이 다를 수 있으므로, 개인 판단보다는 기관 슈퍼바이저나 윤리 담당자와 협의하는 것이 권고된다.
- 클라우드 STT 선택 시 필수 절차: 서비스명과 외부 전송 사실 내담자 고지 → 동의 획득 → 변환 후 즉시 삭제 확인
- 로컬 STT 선택 시 필수 절차: 초기 모델 설치 → 변환 결과 화자 구분 검토 → 편집 후 사용
- 공통 필수 사항: 어떤 방식이든 변환 결과 파일의 보관·폐기 기준을 수련기관 지침에 따라 운영
연구의 한계와 실무 적용
현재까지 상담 수련 맥락에서 STT 도구별 윤리 위반 발생률이나 내담자 신뢰 영향을 직접 측정한 국내 연구는 아직 부족하다. 본 글에서 참조한 Radford et al.(2022)의 Whisper 논문은 STT 모델 자체의 기술적 성능에 관한 연구이며, 상담 맥락에서의 임상적 효과나 윤리적 영향을 검증한 것이 아니다.
mljar.com(2024)의 로컬·클라우드 비교 분석 역시 의료·금융 분야를 중심으로 한 일반 원칙이며, 한국 상담심리 수련 환경에 직접 적용할 때는 국내 개인정보보호법 및 학회 윤리강령과의 교차 검토가 필요하다.
실무에서 다음 회기부터 적용해볼 수 있는 변화는 하나다. 도구 선택 이전에 '이 데이터는 어디에서 처리되는가'를 먼저 확인하고, 그 답을 내담자 동의 설명 문안에 반영하는 것이다. 도구의 편의성보다 내담자 정보가 통제되는 범위를 먼저 설계하는 것, 그것이 윤리 강령이 실무에서 작동하는 방식이다.
한국상담심리학회 윤리강령 원문(krcpa.or.kr)과 Radford et al.(2022) Whisper 논문 원문(cdn.openai.com/papers/whisper.pdf)을 직접 확인하시기를 권합니다. 이 글은 원문 해석을 대신하지 않습니다.
축어록 정리와 수퍼비전 보고서 작성을 돕는 프로그램을 만들고 있습니다. 30일 무료로 써보실 수 있습니다.
수비노트 — https://suvi-note-web.pages.dev/
'5️⃣ 교육·학습 이야기 > 수퍼비전, 상담이야기' 카테고리의 다른 글
| 클로바노트 축어록 정확도 개선 실무 가이드: 원인 분석부터 편집 기준까지 (0) | 2026.09.28 |
|---|---|
| 녹음 파일 축어록 변환 실무 가이드: STT 방식 비교부터 편집 기준까지 (0) | 2026.09.27 |
| 클로바노트 없이 축어록 만들기: STT 방식별 구조적 차이와 윤리적 판단 기준 (0) | 2026.09.26 |
| 클로바노트 대신 사용: STT 도구 전환의 임상·윤리·기술적 판단 기준 (0) | 2026.09.25 |
| 상담 녹음 축어록 자동 변환 실무 절차: 녹음 설정부터 학회 양식 완성까지 (0) | 2026.09.24 |