본문 바로가기

반응형

AI

(5)
[Paper Review] SELF-REFINE: Iterative Refinement with Self-Feedback Goal대형 언어 모델(Large Language Models, LLMs)이 첫 번째 시도에서 완벽한 출력을 만들지 못하는 경우가 많으므로, 모델이 자기 자신의 출력을 피드백하고 개선하는 self refinement 방법을 도입하여 출력 품질을 높임Contribution새로운 SELF-REFINE 알고리즘을 제안: 동일한 언어 모델을 사용하여 생성, 피드백, 정제를 반복하는 구조.감독 학습이나 보상 모델 없이 작동하며, 단일 LLM만 필요함.GPT-3.5, GPT-4 등의 SOTA 모델을 사용하여 7가지 다양한 생성 작업에 적용.평균적으로 약 20%의 성능 향상 Methods단계초기 출력 생성: 모델 M이 입력 x에 대해 출력 y_0 생성자기 피드백 제공: 동일한 모델 M이 자신의 출력에 대한 피드백 f..
논문 쓰는 법 논문 쓰는 법 논문 제출처 저널 - 정기적으로 출판되는 학술지 - 학술 논문 뿐만 아니라 뉴스, 사설등의 기고문도 가능 - 컨퍼런스 논문보다 분량이 많고 마감 기한이 없어 논문 심사 과정이 철저한 편 - 네이처, 사이언스 등 컨퍼런스 - 정기적으로 개최되는 학술행사 - 연구자들이 본인의 논문을 발표하고 논문 내용이 담긴 큰 포스터를 만들어 전시함 - 행사 일정이 있으므로 논문 제출 기한이 명확하고 그 이전에 심사가 왼료됨 - 논문 분량, 심사 과정에 저널에 비해 가벼운 편 - 인공지능 분야에서 컨퍼런스에 논문을 투고하는 경우가 많음 - AI Conference Deadlines 워크샵 - 메인 컨퍼런스가 진행되는 기간에 특정 주제를 두고 열리는 작은 컨퍼런스 - 진입장벽이 가장 낮고 비슷한 연구하는 사람..
모델 크기 조절과 규제 모델 크기 조절과 규제 모델의 크기 조절 과대적합이 발생할 경우, 해결 방법 중 하나로 모델의 크기를 줄이는 것이 제시된다. 모델의 크기를 조절하는 것은, 레이어의 유닛 수와 레이어의 수를 조절하는 것이다. 1. 레이어 유닛수를 감소시켜 모델 전체 파라미터 수 감소시키기 2. 레이어 수를 줄여서 더 앝은 신경망으로 만들기 데이터의 규모가 클 때, 더 크고 깊은 모델이 더 좋은 성능을 보여주지만, 데이터에 비해 모델이 너무 크면 과대적합이 발생할 수 있다. 따라서 데이터의 크기에 따라 모델 크기를 적절하게 설정해야 한다. 같이보면 좋을 글 [모델 튜닝] 하는 방법 - 과대적합과 과소적합 이번 포스팅에서는 머신러닝/딥러닝 모델의 성능평가 이슈 2가지 과대적합(overfittiong)과 과소적합(underfi..
정보이론(Information Content) 정보이론(Information Content) 추상적인 '정보'라는 개념을 정량화하고 정보의 저장과 통신을 연구하는 분야 정보를 정량적으로 표현하기 위한 세 가지 조건 1. 일어날 가능성이 높은 사건은 정보량이 낮고, 반드시 일어나는 사건은 정보가 없는 것이나 마찬가지다. 2. 일어날 가능성이 낮은 사건은 정보량이 높다. 3. 두 개의 독립적인 사건이 있을 때 전체 정보량은 각각의 정보량을 더한 것과 같다. 이러한 조건에 따라 아래 예제를 살펴보자 어떤 사람이 주머니에서 공을 꺼내는 과정을 반복하는 실험을 한다. 1. 각각의 주머니에서 공을 꺼낼 때 얻을 수 있는 정보량: 왼쪽 > 오른쪽 2. 파란색 공 999개와 빨간색 공 1개가 들어있는 주머니가 있을 때, 공을 하나 꺼내고 다시 넣는 실험을 반복한다..
[Paper Review] What Is Wrong With Scene Text Recognition Model Comparisons? Dataset and Model Analysis (2019) What Is Wrong With Scene Text Recognition Model Comparisons? Dataset and Model Analysis (2019) 이 논문을 공부하게 된 계기 AI 커뮤니티인 딥다이브의 object detection 스터디에 참여했다. 프로젝트도 하기로 했다. ocr을 이용한 영수증 ocr을 주제로 정했다. EasyOCR, CRAFT 등 여러 OCR 모델을 돌려본 결과 성능이 좋지 않았고, 짧은 프로젝트 기간을 고려하여 모델을 직접 손대는 것 대신, 네이버에서 비공식적으로 지원하는 라이브러리인 pyclovaocr을 이용해 프로젝트를 구현하기로 결정했다. 프로젝트를 99% 견인하는 완성된 라이브러리를 사용하는 대신에 해당 모델에 대한 심도깊은 공부를 하기로 했고, c..

반응형