기본 콘텐츠로 건너뛰기

개발 공부 - [Huffman Coding] 압축 (Compression) - 2

Huffman Method with Run-Length Encoding

무손실 압축 알고리즘을 하이브리드로 이용해서 구현을 해 본다고 한다.
 
- 파일을 구성하는 각각의 run 들을 하나의 super-symbol로 본다.
이 super-symbol에 대해서 허프만 코딩을 적용한다.

예를 들어 AABAACCAABA는 AAA B AA CC AA 로 구성되며
등장 회수는 1 1 1 2 2 와 같다.
A3 - 1
C2 - 1
A1 - 1
B1 - 2
A2 - 2

이 파일에 등장하는 run 들에게 이진 코드를 부여해서 동작시킨다.
A3 - 110
C2 - 10
A1 - 00
B1 - 01
A2 - 111
로 run에 대해서 이진 코드를 부여하면
AAABAACCAABA는 110 01 10 111 10 01 00 으로 인코딩 된다
1100110111100100 <-

이거 이진 트리로 변경 하면 접두사가 겹치지 않는 트리를 제작 가능



* Run과 frequncy 찾기
- 압축할 파일을 처음부터 끝까지 읽어서 파일을 구성하는 run 들과 각 run 들의 등장횟수를 구한다.
- 먼저 각 run들을 표현할 하나의 클래스 class run을 정의한다.
클래스 런은 적어도 세개의 데이터 멤버 symbol, runLen, freq를 가져야 한다.
symbol만 byte고 다른 것은 다 정수이다.
- 인식한 run 들은 하나의 ArrayList에 저장한다.
- 적절한 생성자와 equals 메소드를 구현한다.

symbol : run이 가지고 있는 단자? (AAA 면 A가 symbol이다)
runlen : 길이
freq : 빈도


class Run{
    byte symbol;
    int runlen;
    int freq;
}


요러면 데이터 파일을 적어도 두번은 읽어야 한다.
1) run 찾기
2) 실제 압축 수행

RandomAccessFile을 이용해서 데이터 파일을 읽어본다고 한다.

[RandomAccessFile]


 원래 스트림은 원칙적으로 순서대로 처리되지만

 예외적으로 접근처리를 할수있게 하는 입출력스트림이다.

 말그대로 임의로 파일에 접근할수 있게 한다. 

 다른 스트림과다르게 INPUT OUTPUT을 상속하지 않고

 바로 Object를 상속받는다. 


= 스캐너 클래스처럼 쓰면 되나 부다.

출처: https://ddo-o.tistory.com/40 [공순이의 블로그]

//읽을 데이터 파일을 연다
RandomAccessFile fin = new RandomAccessFile(fileName, "r");

//한 바이트를 읽어 오면, 읽어온 바이트는 0~255사이의 정수로 반환된다.
// EOF면 -1을 반환한다.
int ch = fin.read();

//필요시에는 byte로 캐스팅해서 저장한다.
byte symbol = (byte) ch;


* Run 인식하기

1. 파일의 첫 바이트를 읽으면 이것을 start_symbol이라고 한다.

2. 파일의 끝에 도달하거나 start_symbol과 다른 byte가 나올 때까지 연속해서 읽는다.
AAABBCAAB <- 일 경우에는 A가 끝나는 시점이 B - 현재까지 읽은 바이트 수를 count 라고 한다.
요기서는 지금 byte가 4이다.
AAA B <- 4

3. start_symbol , count-1 인 run이 하나 인식 되면
이 run을 저장하고, 가장 마지막에 읽은 byte를 start_symbol로, count = 1로 reset 하고 다시 반복한다.

고롬 AAA[B]BCAAB 니까 BB C <- 면 byte가 6이 되고 다시 3으로 돌아가서 진행한다.


* Run과 frequency 찾기

class Run{
    public byte symbol;
    public int runLen;
    public int freq;

    //추가적으로 생성자랑 equals 메소드를 완성해야 한다. - symbol하고 runlen 위한 것
}




public class HuffmanCoding{
//인식한 런들을 저장할 어레이리스트를 만든다.
    private ArrayList<Run> runs = new ArrayList<Run>();
    private void collectRuns(RandomAccessFile fin) throws IOExcetpion{
        데이터 파일 fin에 등장하는 모든 run들과 각각의 등장횟수를 count해서 
        어레이리스트 runs에 저장한다.
        

    }

}


main(){
    HuffmanCoding app = new HuffmanCoding();
    RandomAccessFile fin;
    
    try{
        fin = new RandomAccessFile(파일, "r");
        app.collectRuns(fin);
        fin.close();

    }catch(){
        에러 발생시 출력
    }


}



* C 구현체도 있는데
요것도 데이터 파일 fin에 등장하는 모든 run들과 각각 등장횟수를 카운트해서 배열 runs에 저장하고
Run 객체를 동적메모리 할당<-으로 생성하여 배열 runs에서 객체 주소를 저장한 뒤에
배열 크기가 부족할 경우에만 array doubling 을 하도록 하면 된다.










댓글

이 블로그의 인기 게시물

Ebook - 전자책 drm 상관 없이 pdf로 만들기

yes24와 교보문고에서 ebook을 구매 해야 했는데 너무 불편하고, 필기가 매우 화날 정도로 안 좋아서 원시적으로 사용하기로 했다. 1. 목적 : ebook에서 필기 및 사용이 불편하여 pdf로 변환  2. 용도 : 개인 사용 목적이며 화질이 다소 저하되어도 필기만 용이하면 상관 없음 3. 방법 1) 휴대폰 및 카메라로 동영상을 촬영했다. DRM 때문에 프로그램으로는 촬영이 안 되는 것을 확인했다. 2) 마우스 클릭 해주는 매크로를 사용했다. (1) key_macro.exe > https://blog.daum.net/pg365/250 듀얼 모니터에서 위치 이탈 현상이 있긴 해도 괜찮았다. (2) AutoClick.exe > http://bestsoftwarecenter.blogspot.com/2011/02/autoclick-22.html 이 걸로 잘 사용했다. 3초마다 한 번 클릭하도록 사용했다. 3) 동영상을 이미지로 변경해주는 프로그램을 사용했다. Free Video to JPG Converter > https://free-video-to-jpg-converter.kr.uptodown.com/windows 일 하면서 듀얼 모니터에 켜 놨는데 속도가 괜찮았다. * Every frame 으로 사용해야 한다. 4) 중복 사진 제거해주는 프로그램을 사용했다. VlsiPics  > http://www.visipics.info/index.php?title=Main_Page 생각보다 느리니 퇴근시에 걸어놓고 가면 된다. 한번 play가 끝나면 Auto-select 하고 Delete 하면 된다. 5) 이미지를 일괄 Crop 작업 해주는 프로그램을 사용했다. JPEGCrops > https://jpegcrops.softonic.kr/ * https://joker1209.tistory.com/11 도 참고했다. View -> Large 로 크게 본 뒤, Edit -> Syncronize Crops 로 일괄 동일하게 적용하는 방식을 사

개발 공부 - json JSONObject 사용 시 백슬래시(\), 원화 표시(\) 제거 및 치환

import org.json.simple.JSONObject; String dataString = new String(authData.toJSONString()); dataString = dataString.replaceAll("\\\\", ""); String 으로 안 바뀌는 가 싶어서 String 으로 변환 해 주고 작업 하였다. 사실 toJSONString 해도 정상 동작 해야 하는데 이유를 잘 모르겠음. 그리고 나서 다시 이클립스 구동 하니 toString 도 먹은 걸로 봐서 이상하다고 생각! String dataString = authData.toString(); dataString = dataString.replaceAll("\\\\", ""); 어쨌든 백 슬래시 제거를 해줘야 하는데 \\ 도 아니고 \\\\를 해야 변환이 가능했다는 결말이었습니다. 참고 : https://stackoverflow.com/questions/15450519/why-does-string-replace-not-work/15450539 test =test.replace("KP", "");  replace 후에 담아 주지 않으면 적용이 안 됩니다!

개발 공부 - OracleXETNSListener 서비스가 로컬 컴퓨터에서 시작했다가 중지되었습니다.

여러 가지 요인이 있지만 PC 이름 변경시 OracleXETNSListener 서비스 시작이 불가능합니다. 고치는 법은 C:\oraclexe\app\oracle\product\11.2.0\server\network\ADMIN 와 같은 설치 경로에서 listener.ora와 tnsnames.ora 의 pc명을 바꾼 PC명으로 바꿔주면 됩니다. 그래도 안 된다면 cmd 창에서 services.msc 를 입력 후 OracleXETNSListener 서비스를 시작 시키면 됩니다. 오류명: OracleXETNSListener 서비스가 로컬 컴퓨터에서 시작했다가 중지되었습니다. 일부 서비스는 다른 서비스 또는 프로그램에서 사용되지 않으면 자동으로 중지됩니다. 참고한 사이트들 1. http://blog.naver.com/visioner7/120165951652 2. http://database.sarang.net/?inc=read&aid=6819&criteria=oracle&subcrit=&id=&limit=20&keyword=ora-12560&page=5 이런 걸 보면 오라클은 앙칼진 시골 아가씨야