kone
ainovel

ainovel

시마린 번역기 메모리 누수 코드베이스 분석 요청해봄

02/13/2026, 07:48:46
잡담
1294 views · 2 likes

요약하자면 

1. 누더기 프롬프트가 특정 구문에서 검열 필터를 자극했고
2. 해당 청크가 무한 분할하면서 메모리가 폭발함


물론 나도 버그 재현해본건 아니라 틀릴 수도 있음








시마린 번역기 메모리 누수 코드베이스 분석

커뮤니티에서 보고된 "번역율 68%/82%에서 메모리 폭증" 이슈에 대한 코드 분석 결과입니다.


분석 대상 파일

파일

역할

[main_translator.py]

메인 번역 루프 (2-Pass)

[translate_core.py]

Gemini API 호출 + Divide & Conquer

[epub.py]

EPUB 파일 로드/저장

[translatable_xhtml.py]

챕터별 HTML 파싱/번역 적용

[home_view_model.py]

번역 파이프라인 오케스트레이션


🔴 위험도 높음: 핵심 메모리 누수 후보

1. EPUB 파일 콘텐츠 3중 복제

[!CAUTION] EPUB의 전체 ZIP 콘텐츠가 메모리에 최소 3번 복제됩니다. 이미지가 많은 책일수록 영향이 큽니다.

[epub.py#L84-L93]에서 ZIP의 모든 파일(이미지 포함)을 self._contents에 로드합니다:

python
with zipfile.ZipFile(file_path, 'r') as zin:
    for name in zin.namelist():
        self._contents[name] = zin.read(name)  # 1차: 전체 ZIP 내용

그 후 [epub.py#L424-L437]의 _preserve_original_chapters에서 챕터별로 복제:

python
self._original_contents[chap] = self._contents[chap]  # 2차: 원본 보관
self._contents[new_path] = original_html.encode('utf-8')  # 3차: seamarine_originals/에 추가

그런데 _execute가 2번 호출됩니다 ([main_translator.py#L45-L55]

python
def run(self):
    self._execute(1)      # 1차: Epub 객체 생성 → 전체 메모리 로드
    time.sleep(10)
    self._execute(2)      # 2차: 또 다른 Epub 객체 생성 → 또 전체 메모리 로드

1차 _execute에서 생성된 book 객체가 명시적으로 해제되지 않으므로, 2차 실행 시 1차의 book이 아직 메모리에 남아있을 수 있습니다.

메모리 영향 예시:

  • EPUB 50MB → _contents + _original_contents + seamarine_originals/ ≈ ~100-150MB

  • 2차 _execute 시 추가 → 총 ~200-300MB


2. Divide & Conquer 재귀 깊이 미제한

[!WARNING] 특정 콘텐츠에서 API 오류가 반복되면 재귀적으로 JSON을 분할하여 메모리가 기하급수적으로 증가합니다.

[translate_core.py#L246-L313]

python
def _divide_and_conquer_json(self, contents, level=0, ...):
    json_dict = json.loads(contents)
    mid = len(keys) // 2
    first_half = {k: json_dict[k] for k in keys[:mid]}   # 새 dict
    second_half = {k: json_dict[k] for k in keys[mid:]}   # 새 dict
    
    # 재귀 — 깊이 제한 없음!
    subresp_1 = self.generate_content(subcontents_1, level=level+1, ...)
    subresp_2 = self.generate_content(subcontents_2, level=level+1, ...)
  • level 파라미터가 있지만 깊이 제한 조건이 없음

  • 400/500 에러 반복 시 계속 재귀 → 중간 결과가 스택에 누적

  • "누더기 프롬프트"가 이 경로를 빈번하게 트리거할 가능성이 높음


3. 번역 루프 내 반복적 dict 정렬/재생성

[main_translator.py#L166-L176]

python
for future in as_completed(futures):
    translated_text_dict.update(translated_chunk)
    translated_text_dict = dict(sorted(translated_text_dict.items()))  # 매번 새 dict!
    with open(..., "w") as f:
        json.dump(translated_text_dict, f)  # JSON 직렬화 중 추가 메모리
  • 매 청크 완료마다 전체 dict의 새 복사본 생성

  • 번역 후반부(68%, 82%)에서 dict가 커질수록 영향 증대


🟡 위험도 중간

4. 챕터별 BeautifulSoup DOM 전체 보존

python
# main_translator.py L116-L126
xhtmls: dict[str, utils.TranslatableXHTML] = {}
for chapter_file in chapter_files:
    xhtmls[chapter_file] = utils.TranslatableXHTML(...)  # 각각 BS4 DOM 보유

모든 챕터의 DOM이 동시에 메모리에 존재하며, get_translated_html()에서 추가로 DOM 전체를 복사합니다.

5. ThreadPoolExecutor Future 결과 누적

모든 청크를 한번에 submit하여 Future 객체와 완료된 결과가 as_completed로 소비되기 전까지 메모리에 누적됩니다.

6. genai Client 재생성

키 로테이션 시 genai.Client()를 새로 생성하며, 이전 Client의 내부 HTTP 연결 풀이 즉시 해제되지 않을 수 있습니다.


📊 커뮤니티 이슈 증상과의 매핑

커뮤니티 보고

코드 내 원인

위험도

68%에서 1차 폭증

#1 + #3: dict 정렬 비용 증가

🔴

82%에서 2차 폭증

#1: 2차 _execute 시 새 Epub 로드

🔴

누더기 프롬프트만 문제

#2: 복잡 프롬프트 → D&C 재귀 다발

🔴

같은 레이블 다른 책 OK

책 콘텐츠 특성이 D&C 유발 빈도 결정

🟡


💡 개선 제안 요약

  1. _execute 간 book 명시적 해제del book + gc.collect()

  2. D&C 깊이 제한level >= 5일 때 예외/빈 결과 반환

  3. dict 정렬은 루프 종료 후 1회만 수행

  4. EPUB 이미지 lazy loading: 번역 시 이미지는 메모리에 로드 불필요

  5. 챕터별 스트리밍 처리: 모든 DOM 동시 유지 방지

  6. Future batch 실행: 한번에 모든 chunk submit 대신 batch로 나눠 실행

2
0 comments
중국어 원본 텍본 빠르고 편하게 따는 방법 없나
잡담
basileus31
01/10 1868 1
조용구도 작가 신작 본 사람있냐
잡담
zhsp2071
01/09 2762 3
이거 좀 무서운듯
잡담
greener-straper
01/09 2204 6
유독 중국특유의 기이한 미녀상이 있음
잡담
vango
01/08 2495 1
콜로모 여태 잘써왔는데 누락 엄청 심해짐
잡담
벌떡이
01/08 1797 0
궁금한게 나루토 번역 소설보면 왜 모래마을 파쿠라를 카시라라 적는거임??
잡담
alstn05
01/07 2699 0
어느 과학의 도시 명탐정 완결난건가?
잡담
qoshw46
01/07 1350 0
확실히 패러디들은 원작이 완결 안됐으면 설정충돌이 잘 나는듯
잡담
라스트오리진으로 팔려간 댕라
01/07 1786 6
누가 그에게 수선하라고 했는가 질문?
잡담
ddt1412
01/07 1971 0
포켓몬 패러디 살짝 짜치는 부분 2개
잡담
야돈
01/07 1572 3
번역 미쳐 날뛰는게 번역기 문제가 아니에요.
잡담
sankhara
01/07 1493 2
주인공 이름이 계우인 선협 이름 알려주세요.
잡담
youngwoo222
01/07 1444 0
aistudio에서 온도를 내려서 돌리면 기존 3.0의 과도한 의역을 억제할 수 있을까요
잡담
karlics
01/07 2447 2
패러디물은 이제 씹덕일수록 더 잘 즐길 수 있구나
잡담
collectersss
01/07 3071 1
호그와트 마녀 교육 책자(霍格沃茨:女巫教育手冊章節列表) 무검열본이 있음?
잡담
Ghost
01/06 2736 4
webtoepub에 사이트 추가
잡담
nevid96
01/06 2592 4
붕괴랑 원신 패러디 재밌네요
잡담
allalk
01/06 2663 8
배치번역기 뭐가 문제지
잡담
lonyfur
01/05 2585 1
제미나이 3.0 플래시만 쓰는 이유가 있음?
잡담
basileus31
01/05 2506 0
판타지 용어집 뽑을때 2.5프로와 3.0플래쉬 차이가 큰거 같음
잡담
sonic001
01/05 3128 0
뱅드림 백월광 무섭네요
잡담
poiuytrewq
01/05 2362 6
중국놈들 양털은 뭐 그리 좋아하는지
잡담
260105
01/05 2459 0
타입문 + 유희왕 크로스 오버도 재밌네
잡담
金日成綜合大學
01/05 2320 3
월희 패러디 번역하는데, 존나 빡새네
잡담
金日成綜合大學
01/05 1904 9
모바일게임 패러디는 잘 안읽히네요
잡담
ddt1412
01/05 1902 0
요새 홍루몽 패러디는 재밌는거 없나
잡담
penguinman
01/05 2340 3
인세 지옥 평양
잡담
ㅇㅇ
01/05 1887 1
시각장애인 봇치더락 이거 번역 센스있네
잡담
rt7777
01/05 2248 1
스티브스탠드같은 개그먼치킨 소설 없나요
잡담
aabbp
01/04 2283 0
내일인가 3.0 flash/pro가 preview에서 정식으로 상용화된다던데
잡담
kone1133
01/04 1945 2