인공무능님의 사용자 기여
IT 위키
2025년 11월 13일 (목)
- 05:102025년 11월 13일 (목) 05:10 차이 역사 +66 Medusa (인공지능) 편집 요약 없음 태그: 시각 편집
- 05:092025년 11월 13일 (목) 05:09 차이 역사 +147 새글 파일:Medusa Framework.png 편집 요약 없음 최신
- 05:062025년 11월 13일 (목) 05:06 차이 역사 +2,922 새글 Medusa (인공지능) 새 문서: Medusa(영어: Medusa)는 대형 언어모델(LLM) 기반 생성 모델의 추론 속도를 가속화하기 위해 제안된 프레임워크이다. ==개요== Medusa는 기존 언어모델이 토큰을 순차적으로 하나씩 생성하는 방식의 병목을 해결하기 위해 고안된 방식이다. 기존 방식에서는 출력할 토큰 K개에 대해 모델이 K번의 연산을 실행해야 하지만, Medusa는 여러 개의 디코딩 헤드를 추가해 후속 토큰을... 태그: 시각 편집
2025년 11월 6일 (목)
- 09:392025년 11월 6일 (목) 09:39 차이 역사 −95 추측 디코딩 편집 요약 없음 태그: 시각 편집
- 09:382025년 11월 6일 (목) 09:38 차이 역사 +4,677 새글 추측 디코딩 새 문서: 섬네일|추측적(예측적) 디코딩 방법 추측 디코딩(영어: Speculative Decoding)은 거대 언어 모델(LLM)의 자동회귀 디코딩 과정에서 지연(latency)과 처리량(throughput)을 개선하기 위해 고안된 방법으로, 작은 초안 모델이 여러 개의 미래 토큰을 제안하고, 이후 고성능 대상 모델이 이를 병렬로 검증하는 방식이다. ==개요== 기존의 자동회귀 디코딩 방식... 태그: 시각 편집
- 09:372025년 11월 6일 (목) 09:37 차이 역사 +56 새글 파일:추측적 디코딩.png 편집 요약 없음 최신
2025년 10월 30일 (목)
- 07:532025년 10월 30일 (목) 07:53 차이 역사 +17 희소 데이터 편집 요약 없음 최신 태그: 시각 편집
- 07:532025년 10월 30일 (목) 07:53 차이 역사 +1,477 희소 데이터 편집 요약 없음
- 07:352025년 10월 30일 (목) 07:35 차이 역사 0 딥 러닝 옵티마이저 편집 요약 없음 최신 태그: 시각 편집
- 07:322025년 10월 30일 (목) 07:32 차이 역사 +3,585 새글 가중치 감쇠 새 문서: 가중치 감소(Weight Decay)는 머신러닝 및 딥러닝에서 과적합(overfitting)을 방지하기 위한 정규화(regularization) 기법이다. 학습 과정에서 모델의 가중치(weight)가 지나치게 커지는 것을 억제하여, 일반화(generalization) 능력을 향상시키는 역할을 한다. ==개요== 가중치 감소는 손실 함수(loss function)에 '''가중치의 크기(weight magnitudes)''' 에 대한 '''페널티(penalty)''' 를 추가함으로... 최신
- 07:322025년 10월 30일 (목) 07:32 차이 역사 −3,551 가중치 감소 가중치 감쇠 문서로 넘겨주기 최신 태그: 새 넘겨주기
- 07:322025년 10월 30일 (목) 07:32 차이 역사 +3,487 새글 L2 정규화 새 문서: '''L2 정규화'''(L2 Regularization)는 머신러닝과 딥러닝에서 모델의 복잡도를 억제하고 과적합(overfitting)을 방지하기 위해 손실 함수에 가중치의 제곱합을 추가하는 정규화 기법이다. 일반적으로 가'''중치 감쇠(weight decay)''' 또는 '''릿지 정규화(Ridge Regularization)''' 라고도 불린다. ==개념== L2 정규화는 모델의 파라미터(가중치)가 지나치게 커지지 않도록 제약을 부여한... 최신 태그: 시각 편집
- 07:302025년 10월 30일 (목) 07:30 차이 역사 +35 가중치 감소 편집 요약 없음 태그: 시각 편집
- 07:282025년 10월 30일 (목) 07:28 차이 역사 +3,221 새글 AdaGrad 옵티마이저 새 문서: '''AdaGrad'''(Adaptive Gradient Algorithm)은 각 파라미터마다 학습률(learning rate)을 다르게 적용하여, 파라미터별로 변화량을 자동 조정하는 적응형(Adaptive) 옵티마이저 알고리즘이다. 2011년 John Duchi, Elad Hazan, Yoram Singer가 제안했으며, 희소(sparse) 데이터나 자연어 처리와 같은 영역에서 특히 효과적이다. ==개념== 기존 경사 하강법(Gradient Descent)은 모든 파라미터에 동일한 학... 최신 태그: 시각 편집
- 07:262025년 10월 30일 (목) 07:26 차이 역사 +2,900 새글 RMSProp 새 문서: '''RMSProp'''(Root Mean Square Propagation)은 신경망 학습 시 기울기(gradient)의 크기를 제곱평균제곱근(Root Mean Square)으로 정규화하여, 학습률(learning rate)을 파라미터별로 자동 조정하는 적응형(Adaptive) 옵티마이저 알고리즘이다. 2012년 Geoffrey Hinton이 제안했으며, 딥러닝의 대표적인 적응형 경사 하강법 중 하나로 꼽힌다. ==개념== RMSProp은 AdaGrad의 변형 알고리즘으로, AdaGrad... 최신 태그: 시각 편집
- 07:192025년 10월 30일 (목) 07:19 차이 역사 −1 딥 러닝 옵티마이저 편집 요약 없음 태그: 시각 편집
- 07:142025년 10월 30일 (목) 07:14 차이 역사 +156 옵티마이저 데이터베이스 옵티마이저에 대한 넘겨주기를 제거함 최신 태그: 넘겨주기 제거 시각 편집
- 07:112025년 10월 30일 (목) 07:11 차이 역사 +4,242 새글 딥 러닝 옵티마이저 새 문서: '''딥 러닝 옵티마이저(Deep Learning Optimizer)'''는 딥러닝 모델의 학습 과정에서 손실 함수(loss function)를 최소화하기 위해 신경망의 가중치 및 편향 등의 파라미터를 반복적으로 갱신하는 알고리즘이다. 이러한 최적화 알고리즘은 고차원, 비선형, 대규모 파라미터 공간을 가진 신경망에서 효율적이고 안정적으로 학습이 이루어지도록 하는 핵심 구성 요소이다. ==개념... 태그: 시각 편집
- 07:112025년 10월 30일 (목) 07:11 차이 역사 +8 컴퓨터시스템응용기술사 110회 편집 요약 없음 최신 태그: 시각 편집
- 07:112025년 10월 30일 (목) 07:11 차이 역사 +39 컴퓨터시스템응용기술사 110회 편집 요약 없음 태그: 시각 편집
- 07:002025년 10월 30일 (목) 07:00 차이 역사 +48 새글 트랜스포머 트랜스포머 (인공지능) 문서로 넘겨주기 최신 태그: 새 넘겨주기 시각 편집
- 06:592025년 10월 30일 (목) 06:59 차이 역사 +2,626 드롭아웃 편집 요약 없음 최신
- 06:552025년 10월 30일 (목) 06:55 차이 역사 +2,154 새글 선형 변환 새 문서: 선형 변환(英: linear transformation, 漢: 線形變換)은 벡터 공간 V에서 또 다른 벡터 공간 W로의 함수 T:V→W로서, 덧셈과 스칼라 곱이라는 벡터 공간의 구조를 보존하는 변환이다. ==정의== 벡터 공간 V와 W가 동일한 스칼라 체(예: 실수, 복소수) 위에 있을 때, 함수 T:V→W가 다음 두 조건을 만족하면 이를 선형 변환이라 한다. #모든 벡터 u, v ∈ V에 대해 T(u + v) = T(u) + T(v) #모... 최신 태그: 시각 편집
- 06:432025년 10월 30일 (목) 06:43 차이 역사 0 쿨백-라이블러 발산 편집 요약 없음 최신
- 06:412025년 10월 30일 (목) 06:41 차이 역사 +3,590 새글 쿨백-라이블러 발산 새 문서: '''쿨백-라이블러 발산''' (Kullback–Leibler Divergence, 약칭 '''KL Divergence''')은 두 확률 분포 간의 차이를 측정하는 통계적 척도이다. 주로 확률 모델의 예측 분포와 실제 분포의 불일치 정도를 정량화하는 데 사용되며, 정보이론, 기계학습, 언어모델(LLM) 등에서 광범위하게 활용된다. ==정의== KL 발산은 두 개의 확률분포 \( P(x) \) (참값 분포)와 \( Q(x) \) (모델 분포)가 있을... 태그: 시각 편집
- 06:112025년 10월 30일 (목) 06:11 차이 역사 +30 지식 증류 편집 요약 없음 태그: 시각 편집: 전환됨
- 05:232025년 10월 30일 (목) 05:23 차이 역사 +5,397 새글 지식 증류 새 문서: '''지식 증류'''(Knowledge Distillation, KD)는 대형 신경망(Teacher Model)이 학습한 지식을 작은 신경망(Student Model)에 전이(distill)하여 효율적 성능을 달성하는 모델 압축 기법이다.<ref>Hinton, Geoffrey, Oriol Vinyals, and Jeff Dean. "Distilling the knowledge in a neural network." arXiv:1503.02531 (2015).</ref> 대형 모델이 가진 복잡한 표현과 분류 경계 정보를 소형 모델이 간접적으로 학습하게 함으로써,... 태그: 시각 편집
- 05:182025년 10월 30일 (목) 05:18 차이 역사 +4,694 새글 LoRA (인공지능) 새 문서: '''LoRA'''(Low-Rank Adaptation)는 대형 언어모델(LLM) 등 초거대 신경망의 선형층(linear layer)을 효율적으로 미세조정(fine-tuning)하기 위한 '''저차원 보정'''(low-rank adaptation) 기법이다.<ref name="lora2022">[https://arxiv.org/abs/2106.09685 Hu, Edward J., et al. "LoRA: Low-Rank Adaptation of Large Language Models." ICLR (2022).]</ref> 전체 파라미터를 재학습하지 않고, 각 선형변환 가중치 행렬에 작은 저랭크(rank-... 최신 태그: 시각 편집
- 05:172025년 10월 30일 (목) 05:17 차이 역사 +14 파라미터 효율적 미세조정 편집 요약 없음 최신 태그: 시각 편집
- 04:532025년 10월 30일 (목) 04:53 차이 역사 +4,558 새글 파라미터 효율적 미세조정 새 문서: '''파라미터 효율적 미세조정'''(Parameter-Efficient Fine-Tuning, '''PEFT''')은 대형 언어모델(LLM) 등 초거대 신경망의 모든 파라미터를 다시 학습시키는 대신, 일부 파라미터만 선택적으로 학습하여 특정 다운스트림(downstream) 태스크에 효율적으로 적응시키는 기법이다.<ref name="lora2022">[https://arxiv.org/abs/2106.09685 Hu, Edward J., et al. "LoRA: Low-Rank Adaptation of Large Language Models." ICLR (2022)... 태그: 시각 편집
- 04:402025년 10월 30일 (목) 04:40 차이 역사 +5,394 새글 블록별 자기지도 학습 새 문서: '''블록별 자기지도 학습'''(Block-Wise Self-Supervised Learning)은 심층신경망(Deep Neural Network)의 전역 역전파(global backpropagation)로 인한 메모리 병목 문제를 해결하기 위해, 모델을 여러 블록(block) 단위로 나누고 각 블록에 자기지도 손실(self-supervised loss)을 도입하여 독립적으로 표현 학습을 수행하는 기법이다.<ref name="bim2023">[https://arxiv.org/abs/2311.17218 Luo, Yuxuan, Mengye Ren, and Sai... 최신 태그: 시각 편집
- 04:122025년 10월 30일 (목) 04:12 차이 역사 +3,482 새글 DoReFa-Net 새 문서: '''DoReFa-Net'''은 저정밀도 신경망 학습을 가능하게 하는 기법으로, 가중치(weight), 활성값(activation), 그리고 그래디언트(gradient)를 모두 저비트 정밀도에서 표현하여 연산 효율과 메모리 사용량을 크게 줄이는 방법이다.<ref name="zhou2016">[https://arxiv.org/abs/1606.06160 Zhou, Shuchang, et al. "DoReFa-Net: Training Low Bitwidth Convolutional Neural Networks with Low Bitwidth Gradients." arXiv preprint arXiv:1606.... 최신 태그: 시각 편집
- 02:472025년 10월 30일 (목) 02:47 차이 역사 +690 대형 언어 모델 효율화 편집 요약 없음 최신 태그: 시각 편집
- 02:402025년 10월 30일 (목) 02:40 차이 역사 +434 대형 언어 모델 효율화 편집 요약 없음 태그: 시각 편집
- 02:382025년 10월 30일 (목) 02:38 차이 역사 +3,376 대형 언어 모델 효율화 편집 요약 없음
- 02:302025년 10월 30일 (목) 02:30 차이 역사 −455 대형 언어 모델 효율화 편집 요약 없음 태그: 시각 편집
- 02:172025년 10월 30일 (목) 02:17 차이 역사 +36 대형 언어 모델 채널별 이상치 편집 요약 없음 최신 태그: 시각 편집
- 02:112025년 10월 30일 (목) 02:11 차이 역사 +6,269 새글 대형 언어 모델 채널별 이상치 새 문서: '''대형 언어 모델 채널별 이상치 (Channelwise Outlier in Large Language Models)'''는 트랜스포머(Transformer) 기반 신경망 내부에서 특정 채널(hidden dimension)들이 다른 채널보다 훨씬 큰 활성값을 갖는 현상을 의미한다. 이러한 현상은 대형 언어 모델(LLM)의 Layer Normalization과 Scaling 과정에서 반복적으로 관찰되며, 수치적 이상치(outlier)라기보다 모델 구조상 필연적으로 발생하는 활... 태그: 시각 편집
- 02:102025년 10월 30일 (목) 02:10 차이 역사 +66 새글 파일:채널별 이상치.png 편집 요약 없음 최신
- 02:012025년 10월 30일 (목) 02:01 차이 역사 +809 과도한 활성값 편집 요약 없음 최신 태그: 시각 편집
2025년 10월 28일 (화)
- 15:292025년 10월 28일 (화) 15:29 차이 역사 +34 새글 표준 합성곱 일반 합성곱 문서로 넘겨주기 최신 태그: 새 넘겨주기 시각 편집
- 15:272025년 10월 28일 (화) 15:27 차이 역사 −227 합성곱 신경망 편집 요약 없음 최신 태그: 시각 편집
- 13:142025년 10월 28일 (화) 13:14 차이 역사 +173 일반 합성곱 편집 요약 없음 최신
- 13:122025년 10월 28일 (화) 13:12 차이 역사 +3,382 새글 일반 합성곱 새 문서: 일반 합성곱(standard convolution, 일반的 合成곱)은 인공신경망, 특히 합성곱 신경망(CNN)에서 입력 특징맵과 학습 가능한 필터 간의 연산을 통해 출력 특징맵을 생성하는 가장 기본적인 형태의 합성곱 연산이다. ==정의== <nowiki>일반 합성곱은 입력 텐서 \(X \in \mathbb{R}^{H \times W \times C_{in}}\)과 필터 텐서 \(K \in \mathbb{R}^{k_H \times k_W \times C_{in} \times C_{out}}\)를 사용하여 출력... 태그: 시각 편집
2025년 10월 26일 (일)
- 13:202025년 10월 26일 (일) 13:20 차이 역사 +5,093 새글 텐서 압축 새 문서: 텐서 압축(Tensor Compression)은 고차원 배열(텐서)을 저장·처리할 때 메모리 사용량과 계산 복잡도를 줄이기 위해 희소성(sparsity) 또는 저차(rank) 구조를 이용하여 데이터를 압축하는 기법이다. ==개념== 고차원 텐서란 3차원 이상(예: 3‑way, 4‑way…) 배열을 의미하며, 텐서 압축은 이러한 배열에서 대부분이 0이거나 중요도가 낮은 원소를 효율적으로 표현하는 방식이다.... 최신 태그: 시각 편집
- 13:192025년 10월 26일 (일) 13:19 차이 역사 −16 CSC (압축) 편집 요약 없음 최신 태그: 시각 편집
- 13:182025년 10월 26일 (일) 13:18 차이 역사 +4,672 새글 CSC (압축) 새 문서: CSC(Compressed Sparse Column, 압축된 희소 열 형식)은 희소 행렬을 저장할 때 열 중심(column‑oriented)으로 비제로(non‑zero) 원소를 압축하는 방식이다. ==개념== CSC 방식은 비제로 원소들을 열 단위로 순서대로 저장하며, 각 열의 시작 위치를 나타내는 포인터 배열을 함께 유지한다. 구체적으로 세 개의 배열을 사용한다: * ‘data’ — 비제로 원소들의 값 배열 * ‘indices... 태그: 시각 편집
- 13:172025년 10월 26일 (일) 13:17 차이 역사 +1,190 COO (압축) 편집 요약 없음 최신 태그: 시각 편집
2025년 10월 25일 (토)
- 12:152025년 10월 25일 (토) 12:15 차이 역사 +292 새글 프루닝 새 문서: 프루닝은 컴퓨터 과학 측면에선 계산 효율 및 성능 개선등을 위해 상대적으로 불필요한 경로나 수치를 잘라내는 것을 의미한다. 아래 중 하나의 문서를 선택할 수 있다. * 의사결정 나무의 프루닝 * 신경망 가지치기 최신 태그: 시각 편집
- 11:332025년 10월 25일 (토) 11:33 차이 역사 +3,018 새글 깊이별 합성곱 새 문서: 깊이별 합성곱(Depthwise Convolution)은 합성곱 신경망(CNN)에서 연산 효율성을 높이기 위해 제안된 구조로, 표준 합성곱(Standard Convolution)을 채널 단위로 분리하여 수행하는 방식이다. 이 방식은 MobileNet 등 경량 신경망의 핵심 구성 요소로 사용되며, 모델의 파라미터 수와 연산량을 크게 줄인다. ==개요== 일반적인 합성곱 연산은 입력의 모든 채널에 대해 동일한 필터를 적... 최신 태그: 시각 편집
