v4.1.9: 스튜디오 이미지 편집·저장 플로우 + 음성엔진 정리 + GPU 게이지 분리
- 스튜디오 앱: 사진 편집(스타일 변환/이모티콘 세트) + 결과 뷰어 내 크롭/회전/필터/보정/텍스트 오버레이 편집 툴바 + 저장 플로우(중간 편집은 갤러리에 안 남기고 최종본만 저장+업로드 목록에 재사용 등록) - image_style_transform: SDXL img2img + IP-Adapter-FaceID로 cartoon 스타일 추가 (watercolor/sketch는 identity drift로 재검토 후 제외) - 음성엔진 provider 값 xtts_gpu → omnivoice_gpu로 리네이밍 (실제 로딩 모델과 이름 일치, XTTS는 이미 OmniVoice로 교체된 지 오래) - 메인창 사이드바 GPU 게이지를 GPU0/GPU1로 분리 표시 - 단종된 gemini-3-flash-preview를 기본 모델값에서 전부 제거, kimi-k2.6:cloud로 교체 - vault 백업을 cron→systemd timer(Persistent=true)로 전환, /DATA 전체 동기화 스크립트 추가 Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
This commit is contained in:
@@ -21,7 +21,7 @@
|
||||
"providers": {
|
||||
"ollama": {
|
||||
"endpoint": "http://localhost:11434",
|
||||
"model": "gemini-3-flash-preview:cloud"
|
||||
"model": "kimi-k2.6:cloud"
|
||||
},
|
||||
"lm_studio": {
|
||||
"endpoint": "http://host.docker.internal:1234",
|
||||
@@ -45,11 +45,11 @@
|
||||
}
|
||||
},
|
||||
"models": {
|
||||
"primary": "gemini-3-flash-preview:cloud",
|
||||
"primary": "kimi-k2.6:cloud",
|
||||
"roles": {
|
||||
"manager": "gemini-3-flash-preview:cloud",
|
||||
"executor": "gemini-3-flash-preview:cloud",
|
||||
"verifier": "gemini-3-flash-preview:cloud",
|
||||
"manager": "kimi-k2.6:cloud",
|
||||
"executor": "kimi-k2.6:cloud",
|
||||
"verifier": "kimi-k2.6:cloud",
|
||||
"background_task": ""
|
||||
}
|
||||
},
|
||||
@@ -239,7 +239,7 @@
|
||||
"language": "ko"
|
||||
},
|
||||
"tts": {
|
||||
"provider": "xtts_gpu",
|
||||
"provider": "omnivoice_gpu",
|
||||
"model": "ko_KR-kss-medium",
|
||||
"voice": "ko-KR-SunHiNeural"
|
||||
},
|
||||
@@ -266,7 +266,8 @@
|
||||
"google_cx": "",
|
||||
"ollama_model": "",
|
||||
"searxng_url": "http://localhost:8888",
|
||||
"ollama_api_key": "vault:search.ollama_api_key"
|
||||
"ollama_api_key": "vault:search.ollama_api_key",
|
||||
"tavily_api_key": "vault:search.tavily_api_key"
|
||||
},
|
||||
"agent_policy": {
|
||||
"force_web_for_fresh": true,
|
||||
|
||||
@@ -1,14 +1,7 @@
|
||||
{
|
||||
"known": [
|
||||
"Salom",
|
||||
"Xayr",
|
||||
"Ha",
|
||||
"Yoʻq",
|
||||
"Iltimos"
|
||||
"Xayr"
|
||||
],
|
||||
"lessonsDone": {
|
||||
"1": true,
|
||||
"2": true,
|
||||
"3": true
|
||||
}
|
||||
"lessonsDone": {}
|
||||
}
|
||||
@@ -22,4 +22,18 @@
|
||||
- Local LLM Server name: 지서버 (Z-Server). [2026-07-03] [2026-07-03]
|
||||
- Web server name: 클로서버 (Claw-Server). [2026-07-03] [2026-07-03]
|
||||
- Web server (클로서버) 사양: HP ProDesk 600 G1 DM, 16GB RAM. [2026-07-06] [2026-07-06]
|
||||
- Web server (클로서버) 사양 업그레이드: Dell T5810, Xeon E5-2683 v4, 40GB RAM, RTX 3060 12GB. [2026-07-09] [2026-07-09]
|
||||
- Web server (클로서버) 사양 업그레이드: Dell T5810, Xeon E5-2683 v4, 40GB RAM, RTX 3060 12GB. [2026-07-09] [2026-07-09]
|
||||
- 클로서버(Claw-Server) AI 미디어 파이프라인 구성:
|
||||
|
||||
[음성 STT/TTS]
|
||||
- STT: faster-whisper medium, GPU 상주(voice_engine.py)
|
||||
- TTS 메인: OmniVoice(k2-fsa/OmniVoice), GPU 상주, 음성 클로닝 지원. 설정값 voice.tts.provider === 'xtts_gpu'일 때 이 경로 탐(설정명은 xtts로 남아있으나 실제 모델은 OmniVoice)
|
||||
- TTS 폴백: Piper(로컬 wav→ogg, ffmpeg), provider가 xtts_gpu가 아닐 때 구형 경로
|
||||
- 음성통화는 별도 실시간 경로(GPU 엔진 직결), 텍스트 버튼 TTS와 파이프라인 상이
|
||||
|
||||
[이미지/비디오 생성·편집]
|
||||
- image_generate: SDXL(stabilityai/stable-diffusion-xl-base-1.0, 기본/fast) + FLUX.1-schnell(4-bit 양자화, quality="high" 옵션)
|
||||
- video_generate: LTX-Video(Lightricks/LTX-Video) 텍스트→영상
|
||||
- image_style_transform: SDXL img2img + IP-Adapter-FaceID, style="cartoon"만 지원(watercolor·sketch는 identity drift로 되돌림)
|
||||
- image_edit: crop/resize/rotate/flip/filter/vignette/watermark/speech_bubble/stylize/remove_bg 등. stylize=AnimeGANv2(torch.hub), remove_bg=rembg birefnet-portrait
|
||||
- 모든 로컬 diffusion/LTX 작업은 전용 venv(imagegen-venv)에서 GPU1 고정 실행 [2026-07-15]
|
||||
Reference in New Issue
Block a user