본문 바로가기

전체 글45

[LLM 프로젝트] 프롬프트 테스트 설계 변수가 될만한 것들 - 정해줘야할 청크사이즈요약여부, 발췌여부프롬프트    한 두개씩 테스트 해볼 수 있는 샘플 데이터 만들기 -> 아주 긴 데이터, 아주 짧은 데이터 골고루 들어가게샘플데이터로 요약 버전들 만들기 샘플데이터로 발췌를 위한 데이터도 만들어보기 {code:idx: guide:} 이런 식으로!!-> 유사도 높은거 뽑기 로직 + 정렬 로직 구현각각의 데이터 이름 규칙 정하고 정한 규칙 대로 파일 선택할 수 있는 로직 만들기code에 따른 작성 가이드 데이터 잘 들어갔는지 확인 -> llm이 더 잘 인식할 수 있게 정제청크 사이즈 변수로 받아서 바꿀 수 있도록 변경청크 나누는 로직 고도화 시켜보기청크 사이즈랑 함수 변수로 받아서 선택에 따라 분기하는 로직으로 만들기 2025. 3. 31.
[LLM 프로젝트] 요약 모델 및 기법 선정 테스트 설계 (1) 회사에서 llm 프로젝트를 시작했다. llm에게 자료를 바탕으로 쿼리를 던져야 하는데자료가 너어무 긴 경우가 있어서 요약 모델을 도입해보고자 한다.  요약이 효과가 괜찮을지는 모르겠지만 테스트 프로세스를 바탕으로 요약 모델과 기법을 선정하고, 실제로 프롬프트에 넣었을 때 괜찮은지까지 테스트를 해봐야함 ! 과연 효과가 있을랑가 .. 걍 gpt 쓰는게 제일 좋을 것 같지만....?뭐 나중에 실시간으로 로컬 모델을 써야될 수도 있으니깐 ... ! 연습을 해보자 ~    요약 모델과 기법을 선정하기 위한 테스트 파이프라인을 정리해보자 ~ 큰 테스트의 줄기는 이렇다.1. 모델 선택2. 요약 기법 선택3. 결과 평가4. 실제 요약 수행 각 과정에서 변수가 될 수 있는 것들을 정리해보자  1. 모델 선택 어떤 모델을.. 2025. 3. 20.
AI 교육 정리 툴 정리하기 - 데이터 수집(웹 스크랩핑) 노코드 툴 - octoparse- 데이터 분석 노코드 툴 - orange- 데이터 분석과 머신러닝을 위한 노코드 툴- 드래그 앤 드롭 방식으로 데이터를 시각화하고 분석할 수 있음- LLM 테스트 툴 - flowise- groq - - 클로드 피드백 주고 파인튜닝 최적화하는 방법- 논문 정리 플랫폼 - litmap - ai 논문 찾아볼 수 있는 사이트- elicit - 논문 비교 분석 추천2. LLM 프롬프트 엔지니어링 & RAG & 파인튜닝에 대한 내용 정리-  [[Inference 차원의 성능 향상 패러다임]]- [[프롬프트 엔지니어링 방법]] 정리- [[RAG란]]?- [[Fine Tuning이란]]?- [[RAG와 FineTuning 비교]]- [[Grou.. 2025. 3. 17.
인덱싱과 해싱(and Vector DB에의 적용) 벡터 DB를 공부하다가 DB에서 사용하는 기술인 인덱싱과 해싱에 대해 궁금해져서 정리해보았다. 보통 인덱싱과 해싱을 같이 사용하는 경우가 많아서 내 머릿속에서 이 개념이 혼재되어 있었다. 두개의 개념과 차이점, 그리고 어떻게 함께 쓰이는지, 정리해 보겠음! 인덱싱이란?데이터를 빠르게 찾기 위해서 데이터의 위치 정보를 저장하는 일 how?검색을 빠르게 하기 위한 데이터 구조를 만든다.트리, 그래프, 리스트 등으로 데이터의 위치 정보를 저장한다.  trade off는?인덱싱의 장점은 검색 속도를 높이는 것이다. 저장된 데이터의 위치 정보를 바탕으로 빠르게 데이터를 찾을 수 있다. 데이터의 위치 정보를 저장하는 데에 추가적인 메모리를 사용한다. 인덱싱을 사용하지 않는 경우에는 추가적인 메모리 사용하지 않지만 .. 2025. 3. 14.
RAG 시스템 구축을 위한 Vector DB 비교 (FAISS vs Chroma) 1. VectorDB란 무엇인가? 데이터를 임베딩 벡터로 저장하고 검색하는 db관계형 db는 정보를 scalar data를 행, 열에 테이블 형태로 저장 - 정형 데이터 이런 형태로 저장하면 비정형 데이터를 저장하고 검색하기 어려움 - 이미지, 음성, 큰 자연어 텍스트  AI에 들어가는 데이터들은 비정형 데이터가 많음AI에게 넣어줄 정보를 빠르게 검색하기 위해서 빠른 임베딩 벡터 검색 시스템이 필요했음. 이런 니즈를 만족시켜준 것이 벡터 디비임. - Document 단위로 저장, ID 부여 - 해시를 활용해 유사도가 높은 벡터들 추려서 비교 - Embeddings - attributes, features 포함  2. Vector db를 쓰는 이유는? long-term 메모리 - ai의 컨텍스트 길이 문제.. 2025. 3. 14.
옵시디언 좋은 블로그 https://stephango.com/40-questions40 questions to ask yourself every yearEvery year I ask myself these 40 questions. I’ve shared this list with my family and closest friends, and always enjoy discussing answers as we reflect on th...stephango.comhttps://notes.yxy.ninja/?utm_source=Nomad+Academy&utm_campaign=b53cd60422-EMAIL_CAMPAIGN_2025_02_07&utm_medium=email&utm_term=0_4313d957c9-7ac123137e-36.. 2025. 2. 7.