QWEN 3.8 27B, gpt 루나와 동급
장점:
27b 오픈모델이 대형 llm인 gpt 루나와 동급으로 성능테스트가 나왔다.
입력에 동영상도 포함되어 있다.
단점:
27b가 대형 llm을 이긴 대가가 혹독하다.
너무 긴 추론
27b는 LLM을 이기기 위해 긴 추론이 기본 옵션인데
간단한 원을 그려달라는 부탁에도 27분이 소요된다.
간단한 질문에 간단하게 출력하지 않는다는 것이다.
비싼 API
사용하려고 찾아보니 오픈라우터 기준0.4/3달러로
GPT 루나가 0.2/1.2달러로 절반 이하로 더 싸다.
로컬에서 사용 불가능
위에 너무 긴 추론과 비슷한 이유인데 다른 글에서 찾아보니
로컬 출력 토큰이 30정도 나오는데 너무 긴 추론과 합쳐서
실무에서는 사용하기 어려울 정도로 너무 느리다는 것이다.
그럼 추론을 낮추면 되지 않나요.
그래서 표를 가지고 왔다
추론 | 생각 토큰 | 대기 시간 |
낮음 | 토큰 4,400 | 112초 |
중간 | 토큰 5,900 | 127초 |
매우 높음 | 토큰 44,400 | 718초 |
낮음과 중간의 차이가 없어 낮음으로 사용하면 되고
밴치마크는 BlackwellBoy, 50문항 어려운 추론 밖에 없어서 가지고 오면
추론 | 점수 |
OFF | 68% |
낮음 | 94% |
매우 높음 | 88%(5개가 시간 제한으로 짤려서 공식적으로는 88%, 끝난 것만 보면 97.8%) |
중간은 낮음과 비슷하니 그걸로 같이 보면 되겠다.
표를 보면 낮음으로 돌려도 생각보다 잘 돌아간다.
그래서 사용 추천 방식은 평소에는 낮음으로 사용하다가
막히면 매우 높음을 사용을 권장한다.
Qwen 공식에서도 낮음으로 재시도를 자주하면 매우 높음보다 시간과 토큰이 더 빨릴 수 도 있기 때문에
막히면 매우 높음을 하라고 한다.
s/somisoft
• 157,564 subscribers- 1. 게시물 규정 양식
업로드 시 링크 암호화 & 필수 정보를 기입할 것
- 2. 질문
국룰, 암호화 링크 등 기본사항 질문 금지, 탭 미준수시 차단 및 삭제
- 3. 요청
요청 기준 및 양식 미준수 & 댓글로만 자료 복구 요청 시 차단
- 4. 미성년자 / 근첩 / 페미 / 다중계정
조금이라도 의심되면 선 차단, 후 해명
- 5. 좆목 / 네임드화
닉언, 네임드화 등 친목질 금지
- 6. 분탕 및 어그로 / 혐짤 / 낚시 / 뇌절
해당 카테고리의 차단 기간 및 가중처벌은 처리자 재량으로 판단
- 7. 홍보 / 판촉 / 거래
허용되지 않은 모든 형태의 홍보, 거래, 교환, 조건부 공유 시 차단
- 8. 쌀먹 / 바이러스
조건부 공유 & 수익성 링크 & 고의적인 바이러스 유포 시 갱신차단
- 9. 자료 분류 / AI
미검수 시 표기 필수, 생성형 AI를 사용한 자료의 제목에 AI 미기입 시 차단
- 10. 실사 / 토들러
업로드시 갱신 차단
- 11. 기타 세부 규정은 서브 공지사항 참고