최신 글
-
Speech + LLM기타 2025.09.09 23:08
최근 연구에서 음성인식기의 디코더로 LLM을 붙여서 높은 음성인식 정확도를 달성하는 모델이 많이 생겨나고 있다, 게다가 번역, 질의 등 다른 테스크까지도 수행할 수 있는 Large Audio Language Model(LALM)의 가능성을 보면, 앞으로는 이러한 형태로 발전하지 않을까 싶어서 슬슬 공부를 하고 있다. 최근에는 Exaone3.5 를 백본으로 SALMONN 모델 아키텍처를 사용해서 학습을 해보았다.역시 가장 큰 걸림돌은 데이터셋이었다. 기존에 가장 많이 가지고 있는 데이터셋은 역시 음성인식용 데이터셋이었는데, 이를 과도하게 넣으면 모델이 "무거운 음성인식기"가 될 뿐이다. 합성 데이터를 만들기 위해서 TTS를 이용할때도 주의해야 한다. 만약 TTS 화자의 목소리와 특정 테스크가 얽혀있으면, ..
-
SALMONN논문 리뷰 2025.09.09 23:02
이번에 살펴 볼 논문은 SALMONN: TOWARDS GENERIC HEARING ABILI- TIES FOR LARGE LANGUAGE MODELS 입니다. 지난번의 QWEN Audio와 공통점과 차이점에 대해서 확인해보시면 더욱 재미있을 것 같습니다.1. 모델 아키텍처SALMONN은 오디오와 텍스트 토큰을 입력으로 받아 텍스트 토큰을 생성해내는 모델입니다. 구조는 크게 오디오 인코더들, 오디오 인코더의 아웃풋을 오디오 토큰으로 변환해주는 Q-Former, 토큰 시퀀스를 입력으로 받아, 텍스트 토큰을 출력해주는 Sequence model (vicuna 사용) 이를 효율적으로 학습할 수 있게 해주는 LoRA 어댑터 입니다. 학습 과정에서 다른 부분들은 학습하지 않고 Q-Former, LoRA 만 학습하기..
-
QWEN audio논문 리뷰 2025.09.09 22:59
이번에 소개할 논문은 Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models 입니다.qwen audio 모델은 중국의 알리바바 그룹에서 만든 Speech Aware Language Model 입니다. (speech aware language model은 이전 지식 공유때 소개한 것 처럼 음성을 텍스트와 같이 인풋으로 넣고, 텍스트만 출력으로 받는 형태의 언어모델입니다.)모델의 큰 구조는 Open AI 에서 만든 음성인식기인 Whisper 의 encoder와 decoder 대신 QwenLM을 붙인 형태입니다.Qwen Audio 모델은 음성 인식 뿐 아니라 다양한 태스크를 하나의 모델에서 ..
-
SLM survey : On The Landscape of Spoken Language Models: A Comprehensive Survey논문 리뷰 2025.06.18 22:10
Chat GPT를 필두로 텍스트 기반의 생성형 언어모델이 성공하자 이를 활용한 멀티모달 인공지능에 대한 연구가 활발해지고 있습니다. (멀티모달이란, 텍스트 외에 사진이나 소리 등을 입력으로 함께 받아 이를 함께 활용하는 인공지능 모델을 의미)오늘은 그 중에서 음성을 같이 활용한 SLM(Speech Language Model)에 대하여 포스팅 하도록 하겠습니다.SLM은 최근에 급격하게 연구가 이루어지고 있는 분야로, 사실 이를 부르는 용어도 통일 되지 않았습니다. speech LM 이라고도 불리고, Spoken LM이라고도 불리며 Large Audio Language Model(LALM) 이라고 불리기도 한답니다.이를 공부하기 위해 저희는 “On The Landscape of Spoken Language ..
-
고성능 파이썬 Chapter 11 - RAM 덜 사용하기고성능 파이썬 2025.02.09 20:23
들어가며해당 챕터는 다양한 자료구조를 통해 메모리를 적게 사용하는 방법을 알려준다. 특히 문자열을 저장하고, count 하는 방식에 대해서 알려준다. 특히 정확도를 약간 희생해서 RAM 사용량을 줄였다는 점에서 count 알고리즘이 흥미로웠다. 해당 알고리즘을 어떤 때 사용해야 하는지도 관심 있게 보면 좋을 것 같다.이 장에서 배울 내용- RAM을 덜 사용해야 하는 이유.- 원시 타입의 수를 많이 저장하는 데 numpy와 array가 더 좋은 이유- 많은 텍스트 정보를 RAM에 효율적으로 저장하는 방법- 1바이트로 1076(대략적으로!)을 세는 방법- 블룸(Bloom) 필터의 정의와 이 필터가 필요한 이유 list 대신 numpy, array를 사용하여 RAM 사용량 줄이기 RAM에 많은 텍스트를 효율..