Ollama 활용 Qwen 모델 3종, 회의록 추출 성능 벤치마크
로컬 LLM의 업무 처리(Extraction) 성능과 컨텍스트 유지력을 실증한 로컬 벤치마크 데이터.
요약
최근 Reddit의 r/ollama 커뮤니티에서는 회의록에서 결정 사항, 실행 항목, 참석자를 추출하는 작업으로 qwen3:8b, qwen2.5:7b, qwen3-vl:4b 등 3개 로컬 모델의 성능을 벤치마크한 결과가 공유되었습니다. 테스트는 취소된 작업, 변경된 마감일, 발언하지 않은 인물 언급 등 함정이 포함된 322초 분량의 합성 회의록을 대상으로 9회(각 모델당 3회) 수행되었습니다. 그 결과, 취소된 작업이 결과에 그대로 반영되는 오류가 9번 중 8번 발생했으며, 참석자 식별 작업에서도 27번의 기회 중 8번만 정확한 이름을 찾아내는 데 그쳤습니다. 특히 qwen3:8b 모델은 프롬프트의 금지 지시에도 불구하고 모든 실행에서 'Speaker A/B/C'와 같이 일반화된 명칭을 반복 출력하는 한계를 보였습니다. 이번 실험은 기본 설정 환경에서 로컬 LLM이 복잡한 맥락 파악과 정확한 정보 추출에서 여전히 취약점을 가질 수 있음을 시사합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Local models keep the task the meeting cancelled: 8 of 9 runs, 3 Qwen models via Ollama, data included
원문 보기 ↗