LLM (4) 썸네일형 리스트형 [Paper Review] Question-Based Retrieval using Atomic Units for Enterprise RAG Qwen2, Stable Audio Open 오픈소스 모델 공개 Qwen2알리바바에서 공개한 오픈소스 LLM으로 특히 코딩, 수학분야에서 뛰어남모델 크기는 Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B, Qwen2-72BQwen2-72B-Instruct는 16개 벤치마크에서 Llama-3-70B-Instruct와 견줄만한 성능을 보임특히 코딩, 수학분야는 Llama3보다 낫다고 말함Llama3와 마찬가지로 GQA 기법을 사용앞으로 멀티모달 언어 모델로서 확장할 계획임허깅페이스에서 사용가능 Stable Audio Open텍스트 to 오디오 오픈소스 모델최대 47초 분량의 오디오 생성 가능허깅페이스에서 사용가능Stable Audio는 최대 3분 길이의 일관된 음악 구조를 가진 풀 트랙을 생성하는 등 고급 기능을 제공하나, Stab.. LLM 웹데이터 기반 학습 ↓ 내용요약- 과거에는 LLM이 주로 인터넷 데이터로 학습되었고, 현재도 대부분 그렇지만, 점점 덜 사실(less true)이며 이제는 맞춤형 데이터로 학습되고 있음- 증거?: OpenAI의 경우 GPT-3 논문때와 다르게 Sora, GPT-5 논문에서 학습 데이터에 대한 설명 없음- 데이터 처리 및 비공개 데이터(주석 및 필터링, RLHF, 사용 데이터 등)는 기존데이터와 다른 출력을 생성하는데 LLM이 취약하다는 단점을 완벽히 해결하지 못함- 해결방법: 개선된 아키텍처, 더 많은 파라미터, 그리고 새로운 예제 데이터- 예를 들어, Phi-3 모델의 경우 합성한 고품질의 맞춤형 데이터를 사용하여 더 크고 무거운 Mixtral 모델과 경쟁할만한 성능을 보여줌 결론데이터가 중요하다: 훌륭한 합성 데이터를 만드.. [chatGPT Prompting] LLM 세팅 [chatGPT Prompting] LLM 세팅 LLM의 결과가 얼마나 랜덤할지는 설정 하이퍼 파라미터의 영향을 받는다. 설정 하이퍼 파라미터는 Temperature, Top p, frequency, presence penalties 등이 있다. chatGPT의 경우 API를 별도로 사용하지 않는 한, 설정 하이퍼파라미터를 수정할 수 없다. Temperature 답변의 랜덤성을 조절하는 설정 하이퍼 파라미터 temperature가 높을수록 예측 불가능하고 창의적인 결과를 낸다. Top p 핵 샘플링 확률의 한계를 설정하고 그 누적 확률을 초과하는 토큰만을 선택한다 선택한 토큰들을 이용해 랜덤한 답변을 생성한다. 예를 들어 top p = 0.9인 경우, 모델은 90%의 확률을 달성하는 가장 가능성 높은 단.. 이전 1 다음