Gemini 3.7 밴치마크
간단하게 알려주면 종합 지능 점수는 GPT 5.5와 동일함
5%이상 차이로 이긴 밴치마크를 보여주면
gemini가 진 밴치마크
𝜏³-Banking: 은행 업무를 도구까지 사용해서 제대로 처리하는지 평가.
CritPt: 매우 어려운 연구 수준 물리학 문제 해결 능력 평가.
IFBench: 복잡하고 세세한 지시사항을 정확히 따르는 능력 평가.
gemini가 이긴 밴치마크
AA-Omniscience Non-Hallucination Rate: 모르는 걸 지어내지 않고 정확하게 답하는 능력.
AutomationBench-AA: 여러 업무용 프로그램을 조작해 실제 작업을 끝내는 능력.
Harvey LAB-AA: 문서 검토·보고서 작성 같은 실제 법률 업무 능력.
AA-AnalystAgent: 엑셀·문서를 분석해서 결론을 내는 데이터/비즈니스 분석가 능력
밴치마크를 하지 않은 내용
EnterpriseOps-Gym-AA: 이메일·캘린더·HR·고객지원 등 실제 회사 업무를 도구로 처리하는 능력.
APEX-Agents-AA: 여러 업무 프로그램을 오가며 길고 복잡한 전문 업무를 끝내는 능력.
ITBench-AA: Kubernetes 장애에서 로그·알림 등을 분석해 IT 장애 원인을 찾아내는 능력.
gemini가 플래쉬 모델이라서 복잡한 작업들의 밴치마크는 제외되었는데
Terminal-Bench v2.1: 터미널을 직접 사용해 코딩·시스템 작업을 해결하는 능력.
SciCode: 과학·연구 문제를 코드로 구현하고 해결하는 능력.
위에 2개의 밴치마크 점수는 GPT 5.5와 비슷하여 아마 우리처럼 간단하게 뭘 하는 사람들은
이제 제미니도 괜찮을 듯?
여담으로 제미니 3.1 pro도 했는데
gemini 3.6부터 스멀스멀 몇 개 이기더니
3.7이 되고 나서는 3.1 pro가 모든 부분에서 이기질 못함
s/somisoft
• 157,564 subscribers- 1. 게시물 규정 양식
업로드 시 링크 암호화 & 필수 정보를 기입할 것
- 2. 질문
국룰, 암호화 링크 등 기본사항 질문 금지, 탭 미준수시 차단 및 삭제
- 3. 요청
요청 기준 및 양식 미준수 & 댓글로만 자료 복구 요청 시 차단
- 4. 미성년자 / 근첩 / 페미 / 다중계정
조금이라도 의심되면 선 차단, 후 해명
- 5. 좆목 / 네임드화
닉언, 네임드화 등 친목질 금지
- 6. 분탕 및 어그로 / 혐짤 / 낚시 / 뇌절
해당 카테고리의 차단 기간 및 가중처벌은 처리자 재량으로 판단
- 7. 홍보 / 판촉 / 거래
허용되지 않은 모든 형태의 홍보, 거래, 교환, 조건부 공유 시 차단
- 8. 쌀먹 / 바이러스
조건부 공유 & 수익성 링크 & 고의적인 바이러스 유포 시 갱신차단
- 9. 자료 분류 / AI
미검수 시 표기 필수, 생성형 AI를 사용한 자료의 제목에 AI 미기입 시 차단
- 10. 실사 / 토들러
업로드시 갱신 차단
- 11. 기타 세부 규정은 서브 공지사항 참고