Commit Graph
3 Commits
Author SHA1 Message Date
csbaeandClaude Opus 5 4af0a03de5 feat: 대면 회의 화자 분리 (로컬 diarization)
마이크 한 트랙에 여러 사람이 섞여 들어오는 대면 회의에서 화자를 나눈다.
pyannote-segmentation-3.0 + 3D-Speaker CAM++ 를 ONNX Runtime으로 로컬
Next.js 프로세스에서 실행한다. GPU도 파이썬도 필요 없고 오디오가 외부로
나가지 않는다.

실측 (Apple Silicon, 2스레드, 4인 한국어 아닌 샘플 57초):
- 처리 1.5초 → RTF 0.03, 실시간의 33배
- 자동 추정은 화자 5명(과다 계수), 참석자 수를 주면 4명(정확)
  → 참석자 수 입력을 1급 기능으로 노출

구성:
- lib/diarization.ts — sherpa-onnx-node 래퍼, 모델 캐시, 참석자 수 힌트
- lib/audio-session.ts — 녹음 중 PCM 조각을 세션별로 누적 (메모리)
- api/diarize/chunk — 4초짜리 Int16 PCM 조각 업로드
- api/diarize — 누적 오디오 전체 분석, GET은 모델 설치 여부 확인
- public/pcm-worklet.js — 16kHz Int16 PCM 추출 AudioWorklet
- hooks/useDiarization.ts — 수집·분석 상태 관리
- transcript-formatter: assignSpeakers() — 시간 겹침으로 화자 배정.
  겹치는 구간이 없으면 라벨을 비운다 (틀린 라벨보다 없는 편이 낫다)
- LiveRecorder: 사용 안 함 / 원격 회의 / 대면 회의 3모드 + 참석자 수
- scripts/setup-diarization.mjs — 모델 34MB 내려받기 (npm run setup:diarization)

설계 변경: 롤링 재-diarization 대신 녹음 종료 시 1회 전체 분석.
구간을 잘라 반복하면 실행마다 화자 번호가 달라져 이어 붙일 수 없고,
누적분 재분석은 비용이 회의 길이에 비례해 커진다. 대신 실시간 화자 표시는 없다.

모델은 라이선스와 용량 때문에 저장소에 넣지 않고 gitignore 한다.

테스트 176 → 184.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-09-08 10:47:10 +09:00
352ac2ffd1 feat: OpenAI 호환 프로바이더 지원 (OrcaRouter · OpenAI · 로컬 모델) (#12)
* feat: OpenAI 호환 프로바이더 지원 (OrcaRouter · OpenAI · 로컬 모델)

Gemini 직접 호출만 가능하던 구조를 프로바이더 레이어로 분리.
base URL과 모델 ID만 지정하면 OpenAI Chat Completions 형식을 따르는
엔드포인트는 모두 연결된다 (OrcaRouter, OpenAI, Ollama, LM Studio, vLLM).

- src/lib/providers/ 신설 (gemini / openai-compatible 어댑터 + 프리셋)
- /settings에 프로바이더 선택 UI 추가, 기존 Gemini 키는 자동 승계
- LLM_PROVIDER / LLM_BASE_URL / LLM_MODEL / LLM_API_KEY 환경변수 지원
- base URL은 http/https만 허용 (서버가 대신 fetch하므로 SSRF 방어)
- SECURITY.md에 프로바이더별 전송 경로와 SSRF 주의사항 문서화
- 테스트 102 → 141

DB에 저장되는 summaryMode 값('gemini')은 기존 레코드 호환을 위해 유지하고
UI 라벨만 "AI 요약"으로 변경했다.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>

* chore: 기본 Gemini 모델을 3.5 Flash Lite로 갱신

gemini-2.5-flash-lite → gemini-3.5-flash-lite. 같은 저비용·고속 티어의
최신 세대이며, 무료 등급 중심의 사용 프로필을 그대로 유지한다.

- providers/gemini.ts: DEFAULT_GEMINI_MODEL
- presets.ts: OrcaRouter 기본 모델과 모델 힌트 문구
- .env.example, README 참조 갱신

참고: 화자 분리를 지원하는 gemini-3.5-transcribe는 오디오 입력 전용
음성인식 모델이라 이 자리(텍스트 → 회의록 요약)에 넣을 수 없다.
오디오 캡처가 들어오는 시점에 STT 경로로 별도 추가해야 한다.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>

---------

Co-authored-by: csbae <csbae@RP-002.local>
Co-authored-by: Claude Opus 5 <noreply@anthropic.com>
2026-09-07 18:14:30 +09:00
nad4 f4ad512056 chore: 공개 저장소 전환 보안 강화 + README 재구성 (#11)
* chore: 공개 저장소 전환 보안 강화 + README 재구성

보안 리뷰 결과를 반영하여 회사 직원 로컬 사용에 안전하도록 강화.
README는 사용자가 보기 쉽도록 목차·기능별 anchor·보안 모델로 재구성.

## 보안 변경 (CRITICAL/HIGH 위주)

### 인프라 (docker-compose.yml)
- Postgres 호스트 포트 5432 노출 제거 (컨테이너 내부 네트워크만 사용)
  → LAN의 다른 장치에서 직접 DB 접근 불가
- App 포트 127.0.0.1:3000으로 바인딩 (LAN 노출 차단)
- DB 자격증명 fallback `:- meetingpass` 제거 → `:?` 강제 환경변수
  → .env 누락 시 명시적 에러로 실패 (기본 비밀번호 사용 위험 제거)

### 응답 헤더 (next.config.ts)
- X-Content-Type-Options: nosniff
- X-Frame-Options: DENY
- Referrer-Policy: strict-origin-when-cross-origin
- Permissions-Policy: camera=(), microphone=(self), ...

### 입력 검증
- /api/summarize: transcript 100,000자 상한 (이전 무제한)
- DOMPurify: FORBID_TAGS/ATTR ['style'] 추가 → 인라인 CSS 인젝션 차단

### 런타임 안전성
- src/lib/db.ts: DATABASE_URL 미설정 시 production에서 명시적 경고
  (build-time 빌드는 placeholder로 통과 유지)

### 사용자 안내 (UI)
- /settings 페이지: 공유 PC 경고 + Web Speech API 외부 송출 안내

## 문서

### 신규
- LICENSE (MIT)
- SECURITY.md (위협 모델 / 신뢰 모델 / 한계 / 신고 방법)

### README 재구성
- 4-line Quick Start 헤더
- 📑 목차 (anchor 점프)
- ✨ 주요 기능 7개 sub-section (각각 사용법/동작/제한)
- 🔒 보안 모델 섹션 추가 (공개 배포 권장 사항 명시)
- ⚠️ 알려진 제약 표 정리

### .env.example
- 강력한 비밀번호 생성 가이드 (openssl rand -base64 24)
- 필수/선택 명확히 구분

### docs/ROADMAP.md
- "보안 강화" 섹션 추가 (완료된 보안 조치 목록)

## 사용자 직접 조치 필요 (코드로 처리 불가)
- ⚠️ .env 파일에 발급된 Gemini API 키가 주석 처리되어 남아 있음
  Google AI Studio에서 폐기 후 .env에서 해당 줄 삭제 필요
- POSTGRES_PASSWORD를 강력한 임의 값으로 교체 (openssl rand -base64 24)
- 비밀번호 변경 시 docker compose down -v 후 재시작 (데이터 초기화)

## 검증
- 102 tests passing
- 보안 헤더 4종 적용 확인 (curl -sI)
- LAN IP에서 접근 시도 차단 확인 (192.168.x.x:3000 → 000)
- 127.0.0.1:3000 정상 동작 확인 (200)

## 보류된 항목 (문서화로 처리)
- M-1: Web Speech API의 음성 → Google 송출 (구조적 한계)
- M-2: npm audit 6건 (dev 의존성, 자동 수정 가능한 것 없음)
- H-3: 파일 업로드 매직 바이트 검증 (업로드 파일 미사용 상태)
- 인증 시스템: 단일 사용자 가정으로 비목표

* docs: 직원용 5분 시작 가이드 추가

EMPLOYEE_QUICKSTART.md에 직원 셋업 5분 가이드 작성:
- 한 번에 끝나는 setup 명령 (openssl로 강력한 비밀번호 자동 생성)
- 추천 사용 흐름 + 기능별 단축 액션
- 사내 정책 확인 안내 (음성 → Google 송출 명시)
- 단순 변환 모드(API 키 없음) 옵션 안내
- 자주 쓰는 docker 명령

README에서 직원/팀원 공유 시 가이드로 링크.
2026-04-28 18:59:39 +09:00