kone
ainovel

ainovel

시마린 번역기 메모리 누수 코드베이스 분석 요청해봄

02/13/2026, 07:48:46
잡담
1449 views · 2 likes

요약하자면 

1. 누더기 프롬프트가 특정 구문에서 검열 필터를 자극했고
2. 해당 청크가 무한 분할하면서 메모리가 폭발함


물론 나도 버그 재현해본건 아니라 틀릴 수도 있음








시마린 번역기 메모리 누수 코드베이스 분석

커뮤니티에서 보고된 "번역율 68%/82%에서 메모리 폭증" 이슈에 대한 코드 분석 결과입니다.


분석 대상 파일

파일

역할

[main_translator.py]

메인 번역 루프 (2-Pass)

[translate_core.py]

Gemini API 호출 + Divide & Conquer

[epub.py]

EPUB 파일 로드/저장

[translatable_xhtml.py]

챕터별 HTML 파싱/번역 적용

[home_view_model.py]

번역 파이프라인 오케스트레이션


🔴 위험도 높음: 핵심 메모리 누수 후보

1. EPUB 파일 콘텐츠 3중 복제

[!CAUTION] EPUB의 전체 ZIP 콘텐츠가 메모리에 최소 3번 복제됩니다. 이미지가 많은 책일수록 영향이 큽니다.

[epub.py#L84-L93]에서 ZIP의 모든 파일(이미지 포함)을 self._contents에 로드합니다:

python
with zipfile.ZipFile(file_path, 'r') as zin:
    for name in zin.namelist():
        self._contents[name] = zin.read(name)  # 1차: 전체 ZIP 내용

그 후 [epub.py#L424-L437]의 _preserve_original_chapters에서 챕터별로 복제:

python
self._original_contents[chap] = self._contents[chap]  # 2차: 원본 보관
self._contents[new_path] = original_html.encode('utf-8')  # 3차: seamarine_originals/에 추가

그런데 _execute가 2번 호출됩니다 ([main_translator.py#L45-L55]

python
def run(self):
    self._execute(1)      # 1차: Epub 객체 생성 → 전체 메모리 로드
    time.sleep(10)
    self._execute(2)      # 2차: 또 다른 Epub 객체 생성 → 또 전체 메모리 로드

1차 _execute에서 생성된 book 객체가 명시적으로 해제되지 않으므로, 2차 실행 시 1차의 book이 아직 메모리에 남아있을 수 있습니다.

메모리 영향 예시:

  • EPUB 50MB → _contents + _original_contents + seamarine_originals/ ≈ ~100-150MB

  • 2차 _execute 시 추가 → 총 ~200-300MB


2. Divide & Conquer 재귀 깊이 미제한

[!WARNING] 특정 콘텐츠에서 API 오류가 반복되면 재귀적으로 JSON을 분할하여 메모리가 기하급수적으로 증가합니다.

[translate_core.py#L246-L313]

python
def _divide_and_conquer_json(self, contents, level=0, ...):
    json_dict = json.loads(contents)
    mid = len(keys) // 2
    first_half = {k: json_dict[k] for k in keys[:mid]}   # 새 dict
    second_half = {k: json_dict[k] for k in keys[mid:]}   # 새 dict
    
    # 재귀 — 깊이 제한 없음!
    subresp_1 = self.generate_content(subcontents_1, level=level+1, ...)
    subresp_2 = self.generate_content(subcontents_2, level=level+1, ...)
  • level 파라미터가 있지만 깊이 제한 조건이 없음

  • 400/500 에러 반복 시 계속 재귀 → 중간 결과가 스택에 누적

  • "누더기 프롬프트"가 이 경로를 빈번하게 트리거할 가능성이 높음


3. 번역 루프 내 반복적 dict 정렬/재생성

[main_translator.py#L166-L176]

python
for future in as_completed(futures):
    translated_text_dict.update(translated_chunk)
    translated_text_dict = dict(sorted(translated_text_dict.items()))  # 매번 새 dict!
    with open(..., "w") as f:
        json.dump(translated_text_dict, f)  # JSON 직렬화 중 추가 메모리
  • 매 청크 완료마다 전체 dict의 새 복사본 생성

  • 번역 후반부(68%, 82%)에서 dict가 커질수록 영향 증대


🟡 위험도 중간

4. 챕터별 BeautifulSoup DOM 전체 보존

python
# main_translator.py L116-L126
xhtmls: dict[str, utils.TranslatableXHTML] = {}
for chapter_file in chapter_files:
    xhtmls[chapter_file] = utils.TranslatableXHTML(...)  # 각각 BS4 DOM 보유

모든 챕터의 DOM이 동시에 메모리에 존재하며, get_translated_html()에서 추가로 DOM 전체를 복사합니다.

5. ThreadPoolExecutor Future 결과 누적

모든 청크를 한번에 submit하여 Future 객체와 완료된 결과가 as_completed로 소비되기 전까지 메모리에 누적됩니다.

6. genai Client 재생성

키 로테이션 시 genai.Client()를 새로 생성하며, 이전 Client의 내부 HTTP 연결 풀이 즉시 해제되지 않을 수 있습니다.


📊 커뮤니티 이슈 증상과의 매핑

커뮤니티 보고

코드 내 원인

위험도

68%에서 1차 폭증

#1 + #3: dict 정렬 비용 증가

🔴

82%에서 2차 폭증

#1: 2차 _execute 시 새 Epub 로드

🔴

누더기 프롬프트만 문제

#2: 복잡 프롬프트 → D&C 재귀 다발

🔴

같은 레이블 다른 책 OK

책 콘텐츠 특성이 D&C 유발 빈도 결정

🟡


💡 개선 제안 요약

  1. _execute 간 book 명시적 해제del book + gc.collect()

  2. D&C 깊이 제한level >= 5일 때 예외/빈 결과 반환

  3. dict 정렬은 루프 종료 후 1회만 수행

  4. EPUB 이미지 lazy loading: 번역 시 이미지는 메모리에 로드 불필요

  5. 챕터별 스트리밍 처리: 모든 DOM 동시 유지 방지

  6. Future batch 실행: 한번에 모든 chunk submit 대신 batch로 나눠 실행

2
0 comments
명일방주 패러디 소설은 결국 포기함.
잡담
얀데레좋은듯
10/20/25 1022 4
오행겁주 작가가 데인 참고작품이 뭔지 알거같은데
잡담
kemomo
10/20/25 774 1
안드 폰으로 tts 사용하시는 분들 괄호 한자 날리기
잡담
kemomo
10/20/25 1045 5
중국어 야설들을 읽으면서 개인적으로 느낀 공통점들을 정리해보자면
잡담
karlics
10/20/25 1495 0
윈도우 11 메모장이 더 무거워진 듯
잡담
sankhara
10/20/25 1604 1
구글 깡계 12개째 드디어 차단 당했다
잡담
greener-straper
10/20/25 1280 13
뭔가 익숙한 이름들인데...?
잡담
scp049
10/20/25 788 0
혹시 좀비물은 추천 해 줄만한 게 있나요?
잡담
ho12345
10/19/25 765 0
맛난 사펑 더 없나
잡담
scp049
10/19/25 806 0
잡설이긴한데 대피요령 필요하냐
잡담
Ghost
10/19/25 1026 0
번역하니까 얘가 좀 정신 나갔나 그 생각 하게 됨.
잡담
얀데레좋은듯
10/19/25 1139 4
중국의 흑인혐오가 인도가 근본이였나..?
잡담
brlosnb2744
10/19/25 923 0
헌헌 패러디 재밌네
잡담
latee1
10/19/25 703 0
여러분들은 몇년차 누렁인가요?
잡담
tarask99
10/19/25 769 0
번역 2.5플래시로는 안했으면 합니다.
잡담
tarask99
10/18/25 1359 -7
돈없수선류가 생길지도 모르겠네요
잡담
fyhxdfc
10/18/25 1320 2
여기 누렁이들 왤케 많음?
잡담
fubukidaisuki12
10/18/25 1097 11
이세계 호텔 최신판 읽어보니 슬슬 전작에서 걍 넘어간 떡밥들 풀어내는 거 같네
잡담
뚜르
10/18/25 1223 0
몰상식한 녀석들이 되지 말자구
잡담
닉네임을뭐라고하냐
10/18/25 1059 9
크롬 번역으로 소설 보는사람?
잡담
ㅇㅇ
10/17/25 769 0
말세 대홍수 같은 소설 더 없을까요?
잡담
ho12345
10/17/25 704 0
포켓몬 소설 중에 가장 좋은 패러디 소설이 뭘라나
잡담
임페리오
10/17/25 914 0
중국 패러디 쪽 찾아보는데 역시 롤 쪽 소설에서는 당연하게도 대상혁이 나오네요
잡담
siyss1900
10/16/25 1072 1
혹시 중국발 활협전 패러디 팬픽은 없나?
잡담
uwueeww
10/16/25 717 0
중국애들은 모니카 벨루치 ㅈㄴ 좋아하는듯
잡담
cinekim
10/16/25 841 0
중국내에서 또 검열하나 보네요.
잡담
sankhara
10/16/25 990 0
마블팬픽에서 항상 짜치는 부분
잡담
ddt1412
10/16/25 913 0
마블흑마가 참 재밌었는데 아쉬움
잡담
ddt1412
10/16/25 672 0
궁금한게있는대요?
잡담
esfly123
10/15/25 926 0
유희왕 패러디는 카드 이름이 참 귀찮군요.
잡담
金日成綜合大學
10/15/25 907 2