본문으로 건너뛰기
뒤로 가기

새싹 보안 전문가 2일차 교육

· 약 3분

AI 기초 및 머신러닝

시작하기 앞서 아래 같은 조언을 해주셨습니다.

Colab

Colab을 사용하는 이유는 패키지가 미리설치되어있어서 편합니다.

클라우드는 가상화 + 인터넷입니다. 가상화는 하드웨어를 소프트웨어처럼 시뮬레이션해주는 기능입니다. 웹, 데이터베이스, 서버가 같은 자원을 쓰면 자원이 몰릴 수 있기에 나눠서 독립적으로 가상화 처리를 합니다. 가상화를 파일로 관리하는데 아래 장점이 있습니다.

클라우드의 가장 큰 특징은 탄력성입니다. 자원의 증설과 축소가 자유롭습니다. 온디멘드로 필요할때만 요청하고 그만큼만 과금합니다.

IaaS 개념으로 네트워크나 서버등 인프라를 빌립니다. PaaS, SaaS 개념으로 확장되었습니다. 코랩도 가상화 머신 혹은 컨테이너가 제공되는 형태입니다.

AI 배경 설명

AI를 사용할 때도 API, SDK를 제공했기에 사용할 수 있습니다. API는 개별 서비스 프로바이더를 대신해서 Openrouter, bedrock처럼 추상화된 기능을 사용하면 의존성이 줄어듭니다. LangChain, Spring AI를 사용하면 SDK 추상화가 가능합니다. ChatGPT 같은 경우 Stateless한 프로토콜로 이뤄집니다. 부족한 부분은 history, memory, context 등이 기존 정보를 추가합니다.

부적절한 언행등을 막는건 엔드 유저로 갈 때 막아야합니다. 프롬프트 인젝션처럼 어디서 악용될 수 있는지관리 포인트를 알아야합니다.

신뢰성 있는 서비스를 제공하려면 불확실성을 줄이고 할루시네이션을 줄여야합니다. 외에 조절을 위해서 매개변수를 조절할 수 있습니다. temperature, top k 등을 조절해서 확률값을 평준화할 수 있습니다. 다음으로 프롬프트를 이용해서 좋은 답변을 얻을 수 있습니다. CoT, 멀티턴등을 사용해 맥락을 더 제공해 답변의 정확성을 올릴 수 있습니다. 모델에 없는 정보는 외부 데이터를 가져옵니다. 이런 검색 기능처럼 반복해서 쓰이는 부분을 Function Call, tool use라고 합니다. 이걸 알아서 처리하는 걸 에이전트, 해당 정보등을 정리해서 표준화해둔 부분을 MCP라고 합니다.

모델이 학습하지 못하는 데이터는 매일 변하는 날씨 데이터등이 있습니다. 또 개인별로 다른 데이터는 학습하지 못합니다. 이럴 때 RAG를 사용해서 컨텍스트를 추가해줄 수 있습니다. 데이터는 숫자로 바꾸는데 임베딩이라는 방법을 통해 VectorDB로 관리합니다. 그래서 연관성이 높은 숫자와 매칭되는 데이터를 찾는 부분을 retrieve라고 합니다. 파일을 불러오는 걸 load, 나누는 걸 split, 숫자로 바꾸는 부분을 embedding이라고 합니다.

잡코디

수업 중간에 취업을 도와주는 잡코디 상담을 받았습니다. 취업에 필요한 건 보안 관련된 자격증, 포트폴리오에 채울 프로젝트였습니다. 기존에 경험해온 것과 앞으로 채울 것들을 정리하라는 조언을 받았습니다.

AI 윤리

차별과 편향이 발생하지 않도록 가드레일 설정이 필요합니다. 과기정통부 AI 윤리처럼 기업, 기관마다 AI에 대한 윤리기준을 정의하고 있습니다.

파이썬 기본 문법


공유하기:

관련 글


이전 글
새싹 보안 전문가 3일차 교육
다음 글
청년취업사관학교 보안 전문가 1일차 교육