전체 글36 OpenAI Responses API vs Chat Completions API ## OpenAI Responses API vs Chat Completions API, 언제 무엇을 써야 할까?OpenAI API를 사용하다 보면 가장 많이 헷갈리는 것이 **Chat Completions API**와 **Responses API**입니다.결론부터 말하면 둘 다 같은 GPT 모델을 호출하지만, **목적이 다릅니다.**---## 한 줄 요약### Chat Completions> **"질문하면 답변을 생성하는 API"**```text사용자 질문 ↓ GPT ↓ 답변```대표적인 사용 사례- 일반 챗봇- 고객 상담 챗봇- RAG(벡터 검색 후 답변 생성)- 문서 요약- 번역- 코드 생성즉, **LLM이 답변만 잘 만들어주면 되는 대부분의 서비스**는 Cha.. 2026. 7. 11. NAT, DNS 사설 IP는 왜 인터넷에서 안 통할까? NAT부터 DNS까지온프레미스 프로젝트를 하다 보면 황당한 순간이 온다. 회사에선 멀쩡히 열리던 주소가 집에서 접속하면 안 열려. 같은 서버, 같은 URL인데 말이지. 이 글은 그 이유를 사설 IP, NAT, DNS 세 가지로 풀어본다.1. IP에는 두 종류가 있다세상 모든 기기가 전 세계에서 유일한 주소를 가지려면 IP가 턱없이 부족하다. 그래서 IP 대역을 둘로 나눔. (네트워크 시간에 배움)공인 IP(Public IP) — 인터넷 전체에서 유일하고 어디서든 도달 가능. 203.0.113.20 같은 주소로 패킷 보내면 전 세계 어디서든 그 서버에 닿는다.사설 IP(Private IP) — 조직 내부에서만 쓰는 주소. 아래 세 대역이 예약돼 있어.대역 범위10번대.. 2026. 6. 2. 샌드박스 "샌드박스 환경에서 테스트했어", "샌드박스로 만들었어" 같은 말을 많이 들었는데 몰랐어서 간단히 정리해봤다.한 줄 정의: 외부에 영향을 주지 않는, 격리된 실행 환경어원 그대로 모래놀이터. 애들이 모래통 안에서만 노는 것처럼, 코드나 프로세스가 그 안에서만 동작하고 바깥에 사이드 이펙트를 못 내게 막는 개념이다.정리결국 어디서 나오든 핵심은 같다. 격리 + 제한된 권한. 뭔가를 건드려도 다른 곳에 영향이 안 가는 환경이면 다 샌드박스다."샌드박스에서 테스트해봐" = prod 건드리지 말고 격리 환경에서 해봐. 이 한 마디로 통한다. 2026. 6. 2. Sparse Model 들어가며검색 서비스를 운영하다 보면 한국어의 특성 때문에 고민이 깊어지는 순간이 있습니다. Dense + BM25 하이브리드 방식이 표준처럼 자리잡았지만, BM25의 근본적인 한계는 여전히 남아있습니다. 이 글에서는 BM25의 한계를 짚어보고, BGE-M3 Sparse가 어떻게 이를 보완할 수 있는지 MIRACL 한국어 벤치마크 실험 결과와 함께 공유합니다.1. BM25 + 형태소 분석, 현재 우리의 선택현재 많은 한국어 검색 시스템은 이런 구조를 가지고 있습니다:사용자 쿼리 → (Kiwi) 형태소 분석 → BM25 스코어링 → 검색왜 형태소 분석이 필수인가한국어는 교착어입니다. "갤럭시를"에서 "갤럭시"를 찾으려면 조사 "를"을 분리해야 합니다. 형태소 분석 없이 BM25를 돌리면 조사에 따라 같은 단.. 2026. 2. 1. Claude Skills 반복되는 불편함의 해결"보고서 양식은 이걸로 해주고, 우리 회사 로고 꼭 넣어주고, 글씨체는 이걸로..."AI를 업무에 활용하다 보면 매번 같은 지시를 반복하게 됩니다. 프롬프트를 정교하게 작성해도 결과물은 미묘하게 달라지고, 이 답답함은 AI 활용의 큰 장벽이 되곤 합니다. Anthropic의 Claude Skills는 바로 이 문제에 대한 꽤 강력한 답변입니다.Claude Skills란? 범용 에이전트를 전문가로 만드는 기술Claude Skills는 지시사항, 스크립트, 리소스를 구조화된 폴더로 패키징하여 Claude가 특정 작업을 수행할 때 동적으로 발견하고 로드할 수 있게 하는 시스템입니다.핵심 구조: 3가지 레이어1. SKILL.md - 핵심 지시사항YAML frontmatter로 메타데이터 정.. 2025. 11. 2. vLLM, paged_Attention - 빠른 LLM 서빙을 위한 vLLM LLM 서빙은 보통 연산력보다 메모리 관리(KV 캐시)에서 병목이 걸린다. vLLM의 핵심은 PagedAttention: KV 캐시를 고정 크기 블록(페이지)으로 쪼개 비연속 메모리에 놓고, 블록 테이블로 논리 순서를 보장하는 방식이다. 이 관점 전환 하나로 배치가 자연스럽게 커지고, 길이가 제각각인 요청이 섞여 들어와도 메모리를 촘촘하게 쓸 수 있다. Prefill / Decode — 캐시가 서빙 성능을 만든다 LLM 추론은 크게 두 단계다. Prefill(프롬프트 인코딩)사용자 프롬프트를 한 번에 통과시키며 레이어·헤드별로 생성된 K(키) / V(밸류)를 KV 캐시에 저장한다. 이때 프롬프트 길이만큼 K/V가 한꺼번에 쌓인다. Decode(토큰 생성)매 스텝에서 Q(쿼리)만 새로 만들고, .. 2025. 10. 12. 이전 1 2 3 4 ··· 6 다음