기본 콘텐츠로 건너뛰기

개발 공부 - [Huffman Coding] 압축 (Compression) - 1

Case Study : Huffman Coding

Huffman Coding
: 대표적인 데이터 압축 알고리즘의 하나 
- 무손실 Lossless : 데이터 손실이 있으면 안 되는 경우에 사용한다.
- 손실 Lossy : 압축률 측에서 효율적이다.


가령 6개의 문자 a,b,c,d,e,f로 이루어진 파일이 있을 때, 문자의 총 개수는 100,000개이고 각 문자의 등장 횟수가 아래와 같을 때

a : 45
b : 13
c : 12
d : 16
e : 9
f : 5
-> 각 문자를 3 비트로 만듬
a : 000
b : 110
c : 010
d : 011
e : 100
f : 101

(45 + 13 + 12 + 16 + 9 + 5) * 3비트 = 300000비트

고정길이 코드를 사용하면 각가의 문자를 표현하기 위해서 3비트가 필요하며, 따라서 파일의 길이는 300,000 비트가 된다.

-> 가변길이 코드를 사용하면
a : 0 1비트 * 45 = 45000비트
b : 101 3비트 * 13 = 39000비트
c : 100 3비트 * 12 = 36000비트
d : 111 3비트 * 16 = 48000비트
e : 1101 4비트 * 9 = 36000비트
f : 1100 4비트 * 5 = 20000비트

위 테이블의 가변길이 코드를 사용하면 224,000비트가 된다.
: 압축 효과가 좋아졌다.

근데 이거를 1비트 2비트만 사용하면 파일 크기는 줄어든다고 생각 할 수 있겠으나
인코딩을 하는 것이 나중에 다시 디코딩이 가능해야 하는데 문제가 있을 수 있다.


이런 규칙 : Prefix Code

Prefix Code
: 어떤 codeword(101, 010 같은 것) 도 다른 codeword의 prefix(접두사)가 되지 않는 코드
(codeword란 하나의 문자에 부여된 이진코드를 말함)
-> 어떤 코드도 다른 코드의 접두사가 될 수 없는 것이다. 
0일 경우 어떤 코드도 0 으로 시작 불가
101 일 경우 어떤 코드도 101로 시작 불가
그래서 1101일 경우에는 110이 없고 11010도 없음

: 모호함이 없이 decode가 가능하다.

: prefix code는 하나의 이진트리로 표현이 가능하다. 
-> 접두사가 겹치지 않으므로 이진 트리로 만들기 용이하다.
prefix code 인 경우에는 child가 하나씩 있는 것


Huffman Coding
주어진 인코딩할 데이터파일에 대해서 그 데이터파일을 구성하는 각각의 문자들과 문자가 데이터 파일에 등장하는 횟수가 주어졌을 때, 그 데이터파일을 인코딩하기 위해서 우리가 만들 수 있는 prefix 중에서 최종적으로 압축되는 데이터파일의 길이가 최소가 될 수 있도록 인코딩하는 옵티말한 코딩
-> prefix 코드를 사용해서 인코딩을 한다면 huffman coding 보다 더 짧게 압축 할 수는 없다고 증명된 코딩

파일이 서로 다른 5개의 문자로 구성되었다면 prefix code는 문자 자체랑은 상관 없이 동작한다.


Run-Length Encoding
무손실 압축 기법

런(run)은 동일한 문자가 하나 혹은 그 이상 연속해서 나오는 것을 의미한다.
예를 들어 스트링 s = "aaabba"는 다음과 같은 3개의 run으로 구성된다.
aaa bb a

run-length encoding에서는 각각의 run을 그 run을 구성하는 문자 와 
run의 길이 의 순서쌍 (n, ch)로 인코딩한다.
여기서 ch가 문자이고 n은 길이이다.
가령 위의 문자열 s는 다음과 같이 코딩돤다. 3a2b1a.

run-length encoding 은 길이가 긴 run 들이 많은 경우에 효과적이다. (그림 등 - jpeg)

jpeg도 한가지 단일 알고리즘으로 단독 사용 하지는 않고 그 중 한 단계로 알고리즘을 삽입한다.










댓글

이 블로그의 인기 게시물

Ebook - 전자책 drm 상관 없이 pdf로 만들기

yes24와 교보문고에서 ebook을 구매 해야 했는데 너무 불편하고, 필기가 매우 화날 정도로 안 좋아서 원시적으로 사용하기로 했다. 1. 목적 : ebook에서 필기 및 사용이 불편하여 pdf로 변환  2. 용도 : 개인 사용 목적이며 화질이 다소 저하되어도 필기만 용이하면 상관 없음 3. 방법 1) 휴대폰 및 카메라로 동영상을 촬영했다. DRM 때문에 프로그램으로는 촬영이 안 되는 것을 확인했다. (사실 개인 사용 목적이면 기본 화면 캡쳐를 사용해도 된다...) 2) 마우스 클릭 해주는 매크로를 사용했다. (1) key_macro.exe > https://blog.daum.net/pg365/250 듀얼 모니터에서 위치 이탈 현상이 있긴 해도 괜찮았다. (2) AutoClick.exe > http://bestsoftwarecenter.blogspot.com/2011/02/autoclick-22.html 이 걸로 잘 사용했다. 3초마다 한 번 클릭하도록 사용했다. 3) 동영상을 이미지로 변경해주는 프로그램을 사용했다. Free Video to JPG Converter > https://www.dvdvideosoft.com/products/dvd/Free-Video-to-JPG-Converter.htm (240826: 다운로드 시 정상적으로 되지 않아서 URL 수정) 일 하면서 듀얼 모니터에 켜 놨는데 속도가 괜찮았다. * Every frame 으로 사용해야 한다. 4) 중복 사진 제거해주는 프로그램을 사용했다. VlsiPics  > http://www.visipics.info/index.php?title=Main_Page 생각보다 느리니 퇴근시에 걸어놓고 가면 된다. 한번 play가 끝나면 Auto-select 하고 Delete 하면 된다. 5) 이미지를 일괄 Crop 작업 해주는 프로그램을 사용했다. JPEGCrops > https://jpegcrops.softonic.kr/ * https://joker1209.tistory.co

개발 공부 - json JSONObject 사용 시 백슬래시(\), 원화 표시(\) 제거 및 치환

import org.json.simple.JSONObject; String dataString = new String(authData.toJSONString()); dataString = dataString.replaceAll("\\\\", ""); String 으로 안 바뀌는 가 싶어서 String 으로 변환 해 주고 작업 하였다. 사실 toJSONString 해도 정상 동작 해야 하는데 이유를 잘 모르겠음. 그리고 나서 다시 이클립스 구동 하니 toString 도 먹은 걸로 봐서 이상하다고 생각! String dataString = authData.toString(); dataString = dataString.replaceAll("\\\\", ""); 어쨌든 백 슬래시 제거를 해줘야 하는데 \\ 도 아니고 \\\\를 해야 변환이 가능했다는 결말이었습니다. 참고 : https://stackoverflow.com/questions/15450519/why-does-string-replace-not-work/15450539 test =test.replace("KP", "");  replace 후에 담아 주지 않으면 적용이 안 됩니다!

개발 공부 - OracleXETNSListener 서비스가 로컬 컴퓨터에서 시작했다가 중지되었습니다.

여러 가지 요인이 있지만 PC 이름 변경시 OracleXETNSListener 서비스 시작이 불가능합니다. 고치는 법은 C:\oraclexe\app\oracle\product\11.2.0\server\network\ADMIN 와 같은 설치 경로에서 listener.ora와 tnsnames.ora 의 pc명을 바꾼 PC명으로 바꿔주면 됩니다. 그래도 안 된다면 cmd 창에서 services.msc 를 입력 후 OracleXETNSListener 서비스를 시작 시키면 됩니다. 오류명: OracleXETNSListener 서비스가 로컬 컴퓨터에서 시작했다가 중지되었습니다. 일부 서비스는 다른 서비스 또는 프로그램에서 사용되지 않으면 자동으로 중지됩니다. 참고한 사이트들 1. http://blog.naver.com/visioner7/120165951652 2. http://database.sarang.net/?inc=read&aid=6819&criteria=oracle&subcrit=&id=&limit=20&keyword=ora-12560&page=5 이런 걸 보면 오라클은 앙칼진 시골 아가씨야