From 78e0caac0b8682385992e8c86679c1a9c06edd80 Mon Sep 17 00:00:00 2001 From: nad4-su Date: Tue, 21 Apr 2026 19:38:32 +0900 Subject: [PATCH] =?UTF-8?q?docs:=20Phase=200.5=20=ED=85=9C=ED=94=8C?= =?UTF-8?q?=EB=A6=BF=20=EC=8B=9C=EC=8A=A4=ED=85=9C=20=EB=B0=98=EC=98=81,?= =?UTF-8?q?=20=ED=99=94=EC=9E=90=20=EA=B5=AC=EB=B6=84=EC=9D=80=20=EB=B9=84?= =?UTF-8?q?=EB=AA=A9=ED=91=9C=EB=A1=9C=20=EC=9D=B4=EC=A0=84?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit - ROADMAP: Phase 0.5 (완료) 섹션 추가 — 6개 템플릿, 3단계 강도 - ROADMAP: 화자 구분(#15) 제거 → Non-goals 섹션으로 이동 (유료 API 비용/복잡도가 개인용 범위에 과함) - README: 템플릿 대조표 추가, 강도 설명, 테스트 수 57로 갱신 - CREATE_ISSUES.sh: Phase 4 에픽에서 #15 제거 --- README.md | 37 ++++++++++++++++++++++------- docs/CREATE_ISSUES.sh | 8 ++++--- docs/ROADMAP.md | 55 ++++++++++++++----------------------------- 3 files changed, 52 insertions(+), 48 deletions(-) diff --git a/README.md b/README.md index b3c6192..a31c8af 100644 --- a/README.md +++ b/README.md @@ -6,7 +6,7 @@ --- -## 현재 기능 (Phase 0) +## 현재 기능 (Phase 0 + 0.5) ### 녹음 & 전사 - 브라우저 실시간 음성 인식 (Web Speech API · Chrome `ko-KR`) @@ -22,11 +22,30 @@ - Gemini 실패 시 **단순 변환 마크다운으로 자동 폴백** — 결과물은 항상 보장 - 내보내기: Markdown(.md), HTML(.html), 클립보드 복사 +### 템플릿 & 강도 조절 (Phase 0.5) +용도에 맞게 출력 구조와 요약 깊이를 조절할 수 있음. + +| 템플릿 | 생성되는 구조 | 기본 강도 | 라이브 요약 | +|---|---|---|---| +| 🗂️ 회의록 | 요약 / 논의 / 액션 / 결정 | 표준 | ✅ | +| 🎓 강의·세미나 노트 | 핵심 개념 / 예시 / 인용 / 후속 질문 | 상세 | ✅ | +| 🤝 1:1 미팅 | 주제 / 고민 / 피드백 / 다음 액션 | 표준 | ✅ | +| 💡 브레인스토밍 | 카테고리별 아이디어 / 즉시 시도 / 보류 | 상세 | ✅ | +| 🎤 인터뷰 | Q&A 포맷 / 인상적 발언 / 종합 | 표준 | ❌ | +| 📝 원문 정리 | 요약 없이 문단화·오탈자 정리만 | 상세 고정 | ❌ | +| ⚙️ 커스텀 | 자유 프롬프트 입력 | - | ✅ | + +강도 3단계: +- **간결** — 각 섹션 3줄 이내 +- **표준** — 맥락이 이해될 정도 +- **상세** — 세부사항·수치 누락 없이 보존 + ### 화면 - 녹음 시 **좌(실시간 텍스트) · 우(실시간 회의록)** 분할 뷰 - 확정 전 interim 텍스트는 회색 이탤릭 + 깜빡이는 커서 - 새 내용 도착 시 자동 스크롤 - 진행률 바 (첫 요약까지 단어 수), 쿨다운 카운터 +- 템플릿/강도 변경 시 라이브 요약도 즉시 반영 --- @@ -38,7 +57,7 @@ | STT (실시간) | Web Speech API — Chrome 내장, 무료 | | AI 요약 | Gemini 2.5 Flash Lite — 무료 등급 15 RPM / 1000 RPD | | DB | PostgreSQL 16 + Prisma 7 (스키마 준비, Phase 1에서 활용 예정) | -| 테스트 | Vitest (38 tests, jsdom) | +| 테스트 | Vitest (57 tests, jsdom) | | 배포 | Docker Compose (app + db + test profile) | --- @@ -118,8 +137,9 @@ src/ │ ├── audio-validation.ts │ ├── upload-handler.ts │ ├── transcript-formatter.ts -│ ├── minutes-generator.ts # 최종 요약 생성 -│ ├── live-summary.ts # 롤링 요약 생성 +│ ├── templates.ts # 템플릿 레지스트리 + 프롬프트 빌더 +│ ├── minutes-generator.ts # 최종 요약 생성 (템플릿 적용) +│ ├── live-summary.ts # 롤링 요약 생성 (템플릿 적용) │ └── export-minutes.ts ├── hooks/ │ ├── useSpeechRecognition.ts # Web Speech API + 네트워크 재시도 @@ -128,7 +148,7 @@ src/ │ ├── upload/AudioUploader.tsx │ ├── recorder/LiveRecorder.tsx # 좌우 분할 뷰 │ └── minutes/MinutesViewer.tsx -└── __tests__/ # 38 tests +└── __tests__/ # 57 tests docs/ ├── ROADMAP.md # 개발 로드맵 (Phase 0~4) @@ -147,10 +167,11 @@ prisma/ | Phase | 내용 | 상태 | |---|---|---| | **0** | 실시간 전사 + 롤링 요약 + 자동 최종 생성 | ✅ 완료 | +| **0.5** | 템플릿 (6종) + 강도 조절 (3단계) + 커스텀 프롬프트 | ✅ 완료 | | **1** | 회의 저장/조회/검색 워크스페이스 | 📋 기획됨 | | **2** | 구조화된 액션 아이템 (Gemini JSON + 체크리스트) | 📋 기획됨 | | **3** | 참석자 + 태그 시스템 | 📋 기획됨 | -| **4** | 차별화 기능 (화자 구분, 캘린더, AI Q&A, 블록 에디터) | 💡 선택 | +| **4** | 차별화 기능 (캘린더, AI Q&A, 블록 에디터) | 💡 선택 | ### 진행 관리 1. `gh auth login` 후 `bash docs/CREATE_ISSUES.sh` — 4개 epic issue 자동 생성 @@ -162,7 +183,7 @@ prisma/ ## 알려진 제약 -- **Chrome 전용**: Web Speech API 비표준 — Safari/Firefox는 제한적 (Phase 4 #15에서 서버 사이드 전사로 해결 예정) -- **화자 구분 불가**: Web Speech API가 지원하지 않음. Phase 4 #15에서 Gemini 2.5 오디오 입력 또는 AssemblyAI 경로 계획됨 +- **Chrome 전용**: Web Speech API 비표준 — Safari/Firefox는 제한적 +- **화자 구분 불가**: 의도적 비지원 (개인용 범위를 넘음) - **녹음 저장 없음**: 현재 페이지 세션 내에서만 유지됨. Phase 1에서 DB 영속화 - **Gemini 무료 등급**: 15 RPM / 1000 RPD — 개인 사용에 충분하나 팀 단위는 유료 전환 권장 diff --git a/docs/CREATE_ISSUES.sh b/docs/CREATE_ISSUES.sh index 13b8a41..a17fd82 100755 --- a/docs/CREATE_ISSUES.sh +++ b/docs/CREATE_ISSUES.sh @@ -81,20 +81,22 @@ BODY )" gh issue create \ - --title "[Epic] Phase 4 — 차별화 기능 (화자 구분, 캘린더, AI Q&A)" \ + --title "[Epic] Phase 4 — 차별화 기능 (캘린더, AI Q&A)" \ --label "epic,phase-4" \ --body "$(cat <<'BODY' 선택적 고급 기능. 각 이슈 단독 진행 가능. 세부: [docs/ROADMAP.md](../blob/main/docs/ROADMAP.md). ## 하위 작업 -- [ ] #15 화자 구분 (Gemini 2.5 audio input + MediaRecorder 하이브리드) - [ ] #16 Google Calendar 연동 - [ ] #17 AI Q&A (RAG with pgvector) - [ ] #18 후속 이메일 초안 생성 - [ ] #19 블록 기반 에디터 (우선순위 낮음) +## Non-goal +- 화자 구분은 개인용 범위에 과하여 비목표로 이전 + ## 완료 기준 -각 sub-issue 독립 완료. 전체 Phase 4 완료는 #15 + #18 최소 달성 시 간주. +각 sub-issue 독립 완료. 전체 Phase 4 완료는 #18 최소 달성 시 간주. BODY )" diff --git a/docs/ROADMAP.md b/docs/ROADMAP.md index ba98204..73302e3 100644 --- a/docs/ROADMAP.md +++ b/docs/ROADMAP.md @@ -24,12 +24,28 @@ ### 알려진 제약 - Chrome 전용 (Web Speech API) -- 화자 구분 불가 (Web Speech API 한계) +- 화자 구분 불가 — 의도적 비지원 (Non-goal) - 녹음 저장/조회 불가 (DB 미사용) - Web Speech 세션이 가끔 끊김 → 자동 재연결로 완화 --- +## ✅ Phase 0.5 — 템플릿 + 강도 조절 (완료) + +사용자가 회의록 외 다양한 용도로 쓸 수 있도록 템플릿 시스템과 강도 조절 도입. + +### 구현됨 +- [x] 6개 프리셋 템플릿 (회의록, 강의·세미나, 1:1 미팅, 브레인스토밍, 인터뷰, 원문 정리) +- [x] 커스텀 프롬프트 옵션 (파워 유저용 자유 입력) +- [x] 3단계 강도 조절 (간결 / 표준 / 상세) +- [x] 템플릿별 기본 강도 프리셋 (예: 강의는 상세, 회의록은 표준) +- [x] 템플릿별 라이브 요약 지원 플래그 (raw/interview는 종료 시 한 번만) +- [x] Gemini 모드에서만 노출, 단순 변환은 기존 동작 유지 +- [x] 라이브 요약도 동일 템플릿/강도 적용 +- [x] 프롬프트 빌더 단위 테스트 19개 + +--- + ## 🎯 Phase 1 — 회의 저장/조회 (1~2주) 노션의 **Meeting Database** 수준. 생성한 회의록을 저장하고 다시 찾아볼 수 있게 함. @@ -104,42 +120,6 @@ ## 🎯 Phase 4 — 차별화 기능 (선택, 각 1~2주) -### #15 화자 구분 (Speaker Diarization) -Web Speech API는 화자 구분을 지원하지 않음. 후처리 전략이 필요. - -**접근 방법 비교:** - -| 방법 | 정확도 | 비용 | 한국어 | 실시간 | -|---|---|---|---|---| -| **Gemini 2.5 Flash (오디오 입력)** | 중 | 무료 (RPM 한도 내) | 좋음 | ❌ 후처리만 | -| **AssemblyAI** | 매우 높음 | $0.15/hr (5hr/월 무료) | 좋음 | ✅ 가능 | -| **Deepgram Nova-2** | 높음 | $0.43/hr ($200 무료 크레딧) | 보통 | ✅ 가능 | -| **Google Cloud STT** | 높음 | $1.44/hr | 좋음 | ✅ 가능 | - -**권장 구조 — 하이브리드:** -``` -[클라이언트] - ├─ Web Speech API → 실시간 미리보기 (기존) - └─ MediaRecorder → audio blob 누적 (신규) - -[녹음 종료] - └─ POST /api/transcribe-with-speakers (audio blob) - └─ Gemini 2.5 Flash OR AssemblyAI - └─ 화자 라벨 붙은 최종 transcript - └─ 기존 /api/summarize 파이프라인 재사용 -``` - -**이점:** -- 녹음 중에는 지금처럼 빠른 미리보기 유지 -- 종료 후 고품질 화자 구분 transcript로 최종 회의록 생성 -- 개인용이면 Gemini 2.5로 무료 처리 가능 - -**세부 이슈:** -- [ ] **#15a** 클라이언트에 MediaRecorder 병행 녹음 (WebM/Opus) -- [ ] **#15b** `/api/transcribe-with-speakers` — Gemini 2.5 Flash audio input -- [ ] **#15c** 화자 라벨 transcript 뷰 (화자별 색상 배지) -- [ ] **#15d** AssemblyAI 어댑터 (옵션, 정확도 업그레이드 경로) - ### #16 Google Calendar 연동 (1~2주) - OAuth 플로우 (`next-auth` + Google provider) - 오늘 회의 목록 표시 @@ -167,6 +147,7 @@ Web Speech API는 화자 구분을 지원하지 않음. 후처리 전략이 필 다음 기능은 개인 사용 목적에 부합하지 않아 **의도적으로 범위 밖**: +- **화자 구분 (Speaker Diarization)** — 유료 API 비용/복잡도 대비 개인용에 과함 - **실시간 공동 편집 (CRDT)** — Yjs/Liveblocks 도입 복잡도 대비 이득 없음 - **권한 관리 / 워크스페이스** — 단일 사용자 가정 - **모바일 네이티브 앱** — 웹 PWA로 충분