v4.1.9: 스튜디오 이미지 편집·저장 플로우 + 음성엔진 정리 + GPU 게이지 분리

- 스튜디오 앱: 사진 편집(스타일 변환/이모티콘 세트) + 결과 뷰어 내 크롭/회전/필터/보정/텍스트 오버레이 편집 툴바 + 저장 플로우(중간 편집은 갤러리에 안 남기고 최종본만 저장+업로드 목록에 재사용 등록)
- image_style_transform: SDXL img2img + IP-Adapter-FaceID로 cartoon 스타일 추가 (watercolor/sketch는 identity drift로 재검토 후 제외)
- 음성엔진 provider 값 xtts_gpu → omnivoice_gpu로 리네이밍 (실제 로딩 모델과 이름 일치, XTTS는 이미 OmniVoice로 교체된 지 오래)
- 메인창 사이드바 GPU 게이지를 GPU0/GPU1로 분리 표시
- 단종된 gemini-3-flash-preview를 기본 모델값에서 전부 제거, kimi-k2.6:cloud로 교체
- vault 백업을 cron→systemd timer(Persistent=true)로 전환, /DATA 전체 동기화 스크립트 추가

Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
This commit is contained in:
kim
2026-07-15 18:16:20 +09:00
co-authored by Claude Sonnet 5
parent 88bad1e7d9
commit 2228aedbf7
19 changed files with 1366 additions and 96 deletions
+8 -7
View File
@@ -21,7 +21,7 @@
"providers": {
"ollama": {
"endpoint": "http://localhost:11434",
"model": "gemini-3-flash-preview:cloud"
"model": "kimi-k2.6:cloud"
},
"lm_studio": {
"endpoint": "http://host.docker.internal:1234",
@@ -45,11 +45,11 @@
}
},
"models": {
"primary": "gemini-3-flash-preview:cloud",
"primary": "kimi-k2.6:cloud",
"roles": {
"manager": "gemini-3-flash-preview:cloud",
"executor": "gemini-3-flash-preview:cloud",
"verifier": "gemini-3-flash-preview:cloud",
"manager": "kimi-k2.6:cloud",
"executor": "kimi-k2.6:cloud",
"verifier": "kimi-k2.6:cloud",
"background_task": ""
}
},
@@ -239,7 +239,7 @@
"language": "ko"
},
"tts": {
"provider": "xtts_gpu",
"provider": "omnivoice_gpu",
"model": "ko_KR-kss-medium",
"voice": "ko-KR-SunHiNeural"
},
@@ -266,7 +266,8 @@
"google_cx": "",
"ollama_model": "",
"searxng_url": "http://localhost:8888",
"ollama_api_key": "vault:search.ollama_api_key"
"ollama_api_key": "vault:search.ollama_api_key",
"tavily_api_key": "vault:search.tavily_api_key"
},
"agent_policy": {
"force_web_for_fresh": true,
@@ -1,14 +1,7 @@
{
"known": [
"Salom",
"Xayr",
"Ha",
"Yoʻq",
"Iltimos"
"Xayr"
],
"lessonsDone": {
"1": true,
"2": true,
"3": true
}
"lessonsDone": {}
}
@@ -22,4 +22,18 @@
- Local LLM Server name: 지서버 (Z-Server). [2026-07-03] [2026-07-03]
- Web server name: 클로서버 (Claw-Server). [2026-07-03] [2026-07-03]
- Web server (클로서버) 사양: HP ProDesk 600 G1 DM, 16GB RAM. [2026-07-06] [2026-07-06]
- Web server (클로서버) 사양 업그레이드: Dell T5810, Xeon E5-2683 v4, 40GB RAM, RTX 3060 12GB. [2026-07-09] [2026-07-09]
- Web server (클로서버) 사양 업그레이드: Dell T5810, Xeon E5-2683 v4, 40GB RAM, RTX 3060 12GB. [2026-07-09] [2026-07-09]
- 클로서버(Claw-Server) AI 미디어 파이프라인 구성:
[음성 STT/TTS]
- STT: faster-whisper medium, GPU 상주(voice_engine.py)
- TTS 메인: OmniVoice(k2-fsa/OmniVoice), GPU 상주, 음성 클로닝 지원. 설정값 voice.tts.provider === 'xtts_gpu'일 때 이 경로 탐(설정명은 xtts로 남아있으나 실제 모델은 OmniVoice)
- TTS 폴백: Piper(로컬 wav→ogg, ffmpeg), provider가 xtts_gpu가 아닐 때 구형 경로
- 음성통화는 별도 실시간 경로(GPU 엔진 직결), 텍스트 버튼 TTS와 파이프라인 상이
[이미지/비디오 생성·편집]
- image_generate: SDXL(stabilityai/stable-diffusion-xl-base-1.0, 기본/fast) + FLUX.1-schnell(4-bit 양자화, quality="high" 옵션)
- video_generate: LTX-Video(Lightricks/LTX-Video) 텍스트→영상
- image_style_transform: SDXL img2img + IP-Adapter-FaceID, style="cartoon"만 지원(watercolor·sketch는 identity drift로 되돌림)
- image_edit: crop/resize/rotate/flip/filter/vignette/watermark/speech_bubble/stylize/remove_bg 등. stylize=AnimeGANv2(torch.hub), remove_bg=rembg birefnet-portrait
- 모든 로컬 diffusion/LTX 작업은 전용 venv(imagegen-venv)에서 GPU1 고정 실행 [2026-07-15]