본문 바로가기

전체 글

Next-Gen Frontier AI Battle: Kimi K3 vs. OpenAI GPT-5.6 Sol, Gemini 3.5, Claude Sonnet 5, DeepSeek V4, and Qwen 3 The AI landscape is undergoing a massive paradigm shift. Beyond raw parameter scaling, the frontier conflict now centers on dynamic test-time compute, repository-scale agentic execution, and ultra-long context retention without latency degradation. Kimi K3 enters a highly competitive arena alongside titans like OpenAI GPT-5.6 Sol, Google Gemini 3.5 Flash/Pro, Anthropic Claude Sonnet 5, DeepSeek .. 더보기
[책 리뷰] 뼈 때리는 '역행자' 리뷰 매일 아침 챗바퀴 돌듯 출퇴근하면서 "이렇게 사는 게 맞나?", "어떻게 해야 경제적 자유를 찾고 진짜 내 인생을 살 수 있을까?" 고민이 깊어지던 차에 자청의 를 읽게 되었습니다.결론부터 말씀드리면, "내가 왜 그동안 제자리걸음만 하고 있었는지" 제대로 뼈를 맞았습니다. 오늘은 제가 이 책을 읽으며 노트에 직접 적어둔 핵심 내용과, 10대부터 50대까지 누구나 인생에 적용할 수 있는 역행자의 7단계 모델을 깔끔하게 정리해 드리겠습니다.1. 우리는 왜 평범하게 살 수밖에 없을까? (순행자 vs 역행자)이 책의 핵심 메시지는 간단합니다."경제적 자유를 통해 궁극적인 인생의 자유와 행복을 추구하자."하지만 대부분의 사람들(순행자)은 이 길을 가지 못합니다. 그 이유는 선조들로부터 물려받은 유전자와 본성에 그.. 더보기
Beyond Model Collapse: Understanding 'Retrieval Collapse' as AI Pollutes the Web What is Retrieval Collapse? How AI-Generated Content is Silently Corrupting Search and RAG EcosystemsAs Large Language Models (LLMs) continue to flood the internet with synthetic content, the web is shifting. While machine learning researchers have long warned about Model Collapse (what happens when a model is trained on its own output), a different, ecosystem-level failure mode has arrived: Ret.. 더보기
맥북에서 GPT-OSS 20B 모델 돌려보기 (Ollama 이용) MacBook에서도 비교적 간단한 설정만으로, 20B 규모의 언어 모델을 띄워 직접 활용할 수 있습니다.실험 환경저는 23년형 Macbook pro (CPU는 M3 pro, 메모리는 36기가) 에서 실험했습니다.GUI로 실행하는 방법가장 쉬운 방법은 Ollama를 이용하는 방법입니다. 다운로드 페이지에서 다운받아 실행하면, 다양한 모델들을 실험해볼 수 있는 ChatGPT와 유사한 챗 인터페이스를 보실 수 있습니다.챗 화면의 오른쪽 아래에 모델을 드롭다운 메뉴로 선택할 수 있고, 처음 시작시에 모델 바이너리 다운받는 시간이 걸립니다. 다른 모델은 로컬에서 돌릴 생각을 못해봤고, gpt-oss:20b 모델만 테스트 해봤습니다. 유료 섭스크립션 플랜인 turbo를 활용하면 Ollama가 클라우드에서 서비스하는.. 더보기
[ML/LLM] Small Language Models are the Future of Agentic AI TitleSmall Language Models are the Future of Agentic AILinkshttps://arxiv.org/pdf/2506.02153Summary최근에 공개된 이 논문은, 대규모 언어 모델(LLM)이 전성기를 누리는 지금, 오히려 작지만 날카로운 모델(Small Language Models, SLM)이 더 적합한 대안이 될 수 있다는 중요한 관점을 제시합니다. 이 글에서는 SLM이 왜 에이전트 중심 AI 시스템에서 빛날 수밖에 없는지, 논문의 핵심을 차분히 짚어보려 합니다.SLMs are: V1 principally sufficiently powerful to handle language modeling errands of agentic applications .. 더보기
OpenAI 오픈 웨이트 모델 공개 gpt-oss-120b, gpt-oss-20b 지난 몇 년간 OpenAI는 뛰어난 성능의 GPT 모델들을 내놓았지만, 연구자와 개발자 입장에서 가장 아쉬웠던 부분은 폐쇄적인 정책이었습니다. GPT‑4 계열 모델의 정확도와 정렬 능력은 놀라웠지만, 우리는 그것이 어떻게 동작하는지, 어떤 아키텍처 설계를 택했는지, 그리고 파인튜닝이 가능한지 알 방법이 없었습니다.그러나 2025년 8월, 그 흐름이 바뀌기 시작했습니다. OpenAI는 gpt-oss-120b와 gpt-oss-20b 두 개의 모델을 Apache 2.0 라이선스로 공개했습니다. 이는 단순한 오픈 모델 그 이상이며, 실질적인 LLM 생태계 전환점이라고 판단합니다.1. 모델 구조와 학습 전략: Mixture-of-Experts의 실전 적용아키텍처 요약모델 이름총 파라미터활성 파라미터Expert 수.. 더보기
[PDF] 머신러닝 인터뷰 정리 노트 (ML technical interview prep. note) 인공지능, 머신러닝 관련 기술 포지션의 면접을 위해 정리한 ML technical interview prep. note를 공유합니다.기본적인 ML concepts들을 리마인드하기 위해 컨셉들을 정리한 문서입니다. Source: https://github.com/dongchankim-io/MLInterviewNotes/releases/ 더보기
[ML/Data] Data Recipes for Reasoning Models TitleData Recipes for Reasoning ModelsLinkshttps://arxiv.org/abs/2506.04178Summary이 논문은 추론 능력을 갖춘 모델을 위한 SFT(Supervised Fine-Tuning) 데이터셋 구성 과정을 체계적으로 분석하고, 데이터 품질에 대한 기존의 통념을 재검토하고자 한다. 최근 수학, 코딩, 과학 등 고차원 추론을 요하는 분야에서 강력한 성능을 보이는 모델들은 보통 강력한 베이스 모델 위에, SFT나 RL(Reinforcement Learning) 등 후처리 학습(post-training) 단계를 거쳐 추론 능력을 부여받는다. 이 과정을 통해 모델은 “생각의 흐름(thinking tokens)“을 생성하며 답을 유도할 수 있게 된다.논문은 특히.. 더보기