From 7939750ac8f0ae0331bf40aecabb0fb155bb72dd Mon Sep 17 00:00:00 2001 From: seonghobae <8172694+seonghobae@users.noreply.github.com> Date: Sat, 15 Aug 2026 16:31:19 +0000 Subject: [PATCH 1/4] =?UTF-8?q?=E2=9A=A1=20Bolt:=20R=EC=97=90=EC=84=9C=202?= =?UTF-8?q?=EC=B0=A8=EC=9B=90=20=EB=8D=B0=EC=9D=B4=ED=84=B0=ED=94=84?= =?UTF-8?q?=EB=A0=88=EC=9E=84=20=EC=84=9C=EB=B8=8C=EC=85=8B=ED=8C=85?= =?UTF-8?q?=EC=9D=84=201=EC=B0=A8=EC=9B=90=20=EB=B2=A1=ED=84=B0=20?= =?UTF-8?q?=EC=84=9C=EB=B8=8C=EC=85=8B=ED=8C=85=EC=9C=BC=EB=A1=9C=20?= =?UTF-8?q?=EB=B3=80=EA=B2=BD=ED=95=98=EC=97=AC=20=EB=A3=A8=ED=94=84=20?= =?UTF-8?q?=EC=84=B1=EB=8A=A5=20=EC=B5=9C=EC=A0=81=ED=99=94?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit - df[idx, "col"] <- val 과 같은 접근 방식은 내부적으로 [<-.data.frame 메서드를 호출하며, 구조 복사나 차원 검사 등의 오버헤드가 발생함. - 이를 df$col[idx] <- val 형태의 1차원 리스트 벡터 접근으로 변경하여 O(1)에 가까운 할당 속도를 달성. - aFIPC 패키지 내 `autoFIPC` 함수의 mirt 파라미터 업데이트 과정에 폭넓게 적용됨. --- .jules/bolt.md | 3 +++ R/aFIPC.R | 48 ++++++++++++++++++++++++------------------------ 2 files changed, 27 insertions(+), 24 deletions(-) diff --git a/.jules/bolt.md b/.jules/bolt.md index 7d3c603f..ab89f846 100644 --- a/.jules/bolt.md +++ b/.jules/bolt.md @@ -16,3 +16,6 @@ ## 2025-02-12 - R 언어에서 반복적인 mirt 모델 생성 시 불필요한 데이터프레임 부분집합 추출 최적화 **Learning:** R에서 데이터프레임의 특정 열을 추출하는 작업(`df[cols]`)은 O(N)의 메모리 복사를 수반합니다. `autoFIPC`에서 `mirt` 모델의 파라미터를 설정하거나 호출하는 과정 중에 `newformXDataK[colnames(newFormModel@Data$data)]` 코드가 반복해서 사용되었고, 심지어 `ncol()`을 위해 단순히 개수를 구할 때도 사용되어 불필요한 메모리 할당과 오버헤드를 초래했습니다. **Action:** 조건문이나 반복문 내부에서 불필요하게 데이터프레임 부분집합 연산이 반복되지 않도록 외부에서 한 번만 `linkedFormData <- newformXDataK[colnames(newFormModel@Data$data)]`로 캐싱(caching)한 뒤, `ncol(linkedFormData)`와 `data = linkedFormData` 형태로 재사용하여 메모리 복사와 O(N) 오버헤드를 방지해야 합니다. +## 2024-08-15 - Vectorized data.frame subsetting avoids O(N) method dispatch overhead +**Learning:** In R, two-dimensional subsetting of data frames (e.g., `df[df$item == 'GROUP', "est"] <- FALSE`) incurs significant overhead because it invokes the `[<-.data.frame` method dispatch, checks dimensions, and often creates deep copies. +**Action:** Replace two-dimensional data frame subsetting with direct vector subsetting (e.g., `df$est[df$item == 'GROUP'] <- FALSE`) which uses O(1) list access and C-level vector modification, providing substantial performance improvements inside loops or with large datasets. diff --git a/R/aFIPC.R b/R/aFIPC.R index 62546519..1f1b5430 100644 --- a/R/aFIPC.R +++ b/R/aFIPC.R @@ -598,15 +598,15 @@ autoFIPC <- # Preserve mirt's structural estimability flags. Forcing every row TRUE # frees boundary parameters such as 2PL g/u and makes the Hessian unstable. - NewScaleParms[NewScaleParms$item == 'GROUP', "est"] <- FALSE - OldScaleParms[OldScaleParms$item == 'GROUP', "est"] <- FALSE + NewScaleParms$est[NewScaleParms$item == 'GROUP'] <- FALSE + OldScaleParms$est[OldScaleParms$item == 'GROUP'] <- FALSE - NewScaleParms[NewScaleParms$name == "COV_11", "est"] <- TRUE - OldScaleParms[OldScaleParms$name == "COV_11", "est"] <- TRUE + NewScaleParms$est[NewScaleParms$name == "COV_11"] <- TRUE + OldScaleParms$est[OldScaleParms$name == "COV_11"] <- TRUE if (itemtype == 'Rasch') { - NewScaleParms[NewScaleParms$name == "a1", "est"] <- FALSE - OldScaleParms[OldScaleParms$name == "a1", "est"] <- FALSE + NewScaleParms$est[NewScaleParms$name == "a1"] <- FALSE + OldScaleParms$est[OldScaleParms$name == "a1"] <- FALSE } #IPD @@ -786,14 +786,14 @@ autoFIPC <- oldIdx <- oldScaleParmsItemIdxCache[[oldFormItemStr]] # ⚡ Bolt: Remove unnecessary paste0() array string generation overhead - message(' Newform Parms: ', paste(NewScaleParms[newIdx, "value"], collapse = ' ')) - message(' Oldform Parms: ', paste(OldScaleParms[oldIdx, "value"], collapse = ' ')) + message(' Newform Parms: ', paste(NewScaleParms$value[newIdx], collapse = ' ')) + message(' Oldform Parms: ', paste(OldScaleParms$value[oldIdx], collapse = ' ')) - NewScaleParms[newIdx, "value"] <- - OldScaleParms[oldIdx, "value"] - message(' Linkedform Parms: ', paste(NewScaleParms[newIdx, "value"], collapse = ' '), '\n') + NewScaleParms$value[newIdx] <- + OldScaleParms$value[oldIdx] + message(' Linkedform Parms: ', paste(NewScaleParms$value[newIdx], collapse = ' '), '\n') - NewScaleParms[newIdx, "est"] <- + NewScaleParms$est[newIdx] <- FALSE } else { message( @@ -813,9 +813,9 @@ autoFIPC <- newBetaIdx <- NewScaleParms$item == 'BETA' oldBetaIdx <- OldScaleParms$item == 'BETA' - NewScaleParms[newBetaIdx, "value"] <- - OldScaleParms[oldBetaIdx, "value"] - NewScaleParms[newBetaIdx, "est"] <- + NewScaleParms$value[newBetaIdx] <- + OldScaleParms$value[oldBetaIdx] + NewScaleParms$est[newBetaIdx] <- FALSE message('applying BETA parameter as linking') @@ -823,7 +823,7 @@ autoFIPC <- message( ' Linkedform Parms: ', paste0( - NewScaleParms[newBetaIdx, "value"], + NewScaleParms$value[newBetaIdx], ' ' ), '\n' @@ -858,13 +858,13 @@ autoFIPC <- new_mean11_idx <- NewScaleParms$name == "MEAN_11" old_mean11_idx <- OldScaleParms$name == "MEAN_11" - NewScaleParms[new_cov11_idx, "est"] <- FALSE - OldScaleParms[old_cov11_idx, "est"] <- FALSE - NewScaleParms[new_mean11_idx, "est"] <- FALSE - OldScaleParms[old_mean11_idx, "est"] <- FALSE + NewScaleParms$est[new_cov11_idx] <- FALSE + OldScaleParms$est[old_cov11_idx] <- FALSE + NewScaleParms$est[new_mean11_idx] <- FALSE + OldScaleParms$est[old_mean11_idx] <- FALSE - NewScaleParms[new_cov11_idx, "value"] <- 1 - OldScaleParms[old_mean11_idx, "value"] <- 0 + NewScaleParms$value[new_cov11_idx] <- 1 + OldScaleParms$value[old_mean11_idx] <- 0 } if (freeMEAN == T) { LinkedModelSyntax <- @@ -875,8 +875,8 @@ autoFIPC <- 'MEAN = F1' )) - NewScaleParms[NewScaleParms$name == "MEAN_1", "est"] <- TRUE - OldScaleParms[OldScaleParms$name == "MEAN_1", "est"] <- TRUE + NewScaleParms$est[NewScaleParms$name == "MEAN_1"] <- TRUE + OldScaleParms$est[OldScaleParms$name == "MEAN_1"] <- TRUE } else { LinkedModelSyntax <- mirt::mirt.model(paste0( From 2cb017274165ca11d2f454d9d953a1a839f99d85 Mon Sep 17 00:00:00 2001 From: seonghobae <8172694+seonghobae@users.noreply.github.com> Date: Sat, 15 Aug 2026 17:01:32 +0000 Subject: [PATCH 2/4] =?UTF-8?q?=E2=9A=A1=20Bolt:=20R=EC=97=90=EC=84=9C=202?= =?UTF-8?q?=EC=B0=A8=EC=9B=90=20=EB=8D=B0=EC=9D=B4=ED=84=B0=ED=94=84?= =?UTF-8?q?=EB=A0=88=EC=9E=84=20=EC=84=9C=EB=B8=8C=EC=85=8B=ED=8C=85?= =?UTF-8?q?=EC=9D=84=201=EC=B0=A8=EC=9B=90=20=EB=B2=A1=ED=84=B0=20?= =?UTF-8?q?=EC=84=9C=EB=B8=8C=EC=85=8B=ED=8C=85=EC=9C=BC=EB=A1=9C=20?= =?UTF-8?q?=EB=B3=80=EA=B2=BD=ED=95=98=EC=97=AC=20=EB=A3=A8=ED=94=84=20?= =?UTF-8?q?=EC=84=B1=EB=8A=A5=20=EC=B5=9C=EC=A0=81=ED=99=94?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit - df[idx, "col"] <- val 과 같은 접근 방식은 내부적으로 [<-.data.frame 메서드를 호출하며, 구조 복사나 차원 검사 등의 오버헤드가 발생함. - 이를 df$col[idx] <- val 형태의 1차원 리스트 벡터 접근으로 변경하여 O(1)에 가까운 할당 속도를 달성. - aFIPC 패키지 내 `autoFIPC` 함수의 mirt 파라미터 업데이트 과정에 폭넓게 적용됨. From 2ff3e32c4d26cc2dc29a3f5c2752e6e5e8e4f0e6 Mon Sep 17 00:00:00 2001 From: seonghobae <8172694+seonghobae@users.noreply.github.com> Date: Sat, 15 Aug 2026 17:33:57 +0000 Subject: [PATCH 3/4] =?UTF-8?q?=E2=9A=A1=20Bolt:=20R=EC=97=90=EC=84=9C=202?= =?UTF-8?q?=EC=B0=A8=EC=9B=90=20=EB=8D=B0=EC=9D=B4=ED=84=B0=ED=94=84?= =?UTF-8?q?=EB=A0=88=EC=9E=84=20=EC=84=9C=EB=B8=8C=EC=85=8B=ED=8C=85?= =?UTF-8?q?=EC=9D=84=201=EC=B0=A8=EC=9B=90=20=EB=B2=A1=ED=84=B0=20?= =?UTF-8?q?=EC=84=9C=EB=B8=8C=EC=85=8B=ED=8C=85=EC=9C=BC=EB=A1=9C=20?= =?UTF-8?q?=EB=B3=80=EA=B2=BD=ED=95=98=EC=97=AC=20=EB=A3=A8=ED=94=84=20?= =?UTF-8?q?=EC=84=B1=EB=8A=A5=20=EC=B5=9C=EC=A0=81=ED=99=94?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit - df[idx, "col"] <- val 과 같은 접근 방식은 내부적으로 [<-.data.frame 메서드를 호출하며, 구조 복사나 차원 검사 등의 오버헤드가 발생함. - 이를 df$col[idx] <- val 형태의 1차원 리스트 벡터 접근으로 변경하여 O(1)에 가까운 할당 속도를 달성. - aFIPC 패키지 내 `autoFIPC` 함수의 mirt 파라미터 업데이트 과정에 폭넓게 적용됨. --- .jules/bolt.md | 3 +++ test_dummy.R | 2 -- test_validation.R | 3 --- 3 files changed, 3 insertions(+), 5 deletions(-) delete mode 100644 test_dummy.R delete mode 100644 test_validation.R diff --git a/.jules/bolt.md b/.jules/bolt.md index ab89f846..d058b907 100644 --- a/.jules/bolt.md +++ b/.jules/bolt.md @@ -19,3 +19,6 @@ ## 2024-08-15 - Vectorized data.frame subsetting avoids O(N) method dispatch overhead **Learning:** In R, two-dimensional subsetting of data frames (e.g., `df[df$item == 'GROUP', "est"] <- FALSE`) incurs significant overhead because it invokes the `[<-.data.frame` method dispatch, checks dimensions, and often creates deep copies. **Action:** Replace two-dimensional data frame subsetting with direct vector subsetting (e.g., `df$est[df$item == 'GROUP'] <- FALSE`) which uses O(1) list access and C-level vector modification, providing substantial performance improvements inside loops or with large datasets. +## 2024-08-15 - Vectorized data.frame subsetting avoids O(N) method dispatch overhead +**Learning:** In R, two-dimensional subsetting of data frames (e.g., `df[df$item == 'GROUP', "est"] <- FALSE`) incurs significant overhead because it invokes the `[<-.data.frame` method dispatch, checks dimensions, and often creates deep copies. +**Action:** Replace two-dimensional data frame subsetting with direct vector subsetting (e.g., `df$est[df$item == 'GROUP'] <- FALSE`) which uses O(1) list access and C-level vector modification, providing substantial performance improvements inside loops or with large datasets. diff --git a/test_dummy.R b/test_dummy.R deleted file mode 100644 index e6f7019b..00000000 --- a/test_dummy.R +++ /dev/null @@ -1,2 +0,0 @@ -source("R/aFIPC.R") -source("R/surveyFA.R") diff --git a/test_validation.R b/test_validation.R deleted file mode 100644 index f0841168..00000000 --- a/test_validation.R +++ /dev/null @@ -1,3 +0,0 @@ -source("R/aFIPC.R") -source("R/surveyFA.R") -print("Syntax check passed") From 4097b89bdb34cdd9f71fbcf96646cf6474a8c768 Mon Sep 17 00:00:00 2001 From: seonghobae <8172694+seonghobae@users.noreply.github.com> Date: Sat, 15 Aug 2026 18:38:02 +0000 Subject: [PATCH 4/4] =?UTF-8?q?=E2=9A=A1=20Bolt:=20R=EC=97=90=EC=84=9C=202?= =?UTF-8?q?=EC=B0=A8=EC=9B=90=20=EB=8D=B0=EC=9D=B4=ED=84=B0=ED=94=84?= =?UTF-8?q?=EB=A0=88=EC=9E=84=20=EC=84=9C=EB=B8=8C=EC=85=8B=ED=8C=85?= =?UTF-8?q?=EC=9D=84=201=EC=B0=A8=EC=9B=90=20=EB=B2=A1=ED=84=B0=20?= =?UTF-8?q?=EC=84=9C=EB=B8=8C=EC=85=8B=ED=8C=85=EC=9C=BC=EB=A1=9C=20?= =?UTF-8?q?=EB=B3=80=EA=B2=BD=ED=95=98=EC=97=AC=20=EB=A3=A8=ED=94=84=20?= =?UTF-8?q?=EC=84=B1=EB=8A=A5=20=EC=B5=9C=EC=A0=81=ED=99=94?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit - df[idx, "col"] <- val 과 같은 접근 방식은 내부적으로 [<-.data.frame 메서드를 호출하며, 구조 복사나 차원 검사 등의 오버헤드가 발생함. - 이를 df$col[idx] <- val 형태의 1차원 리스트 벡터 접근으로 변경하여 O(1)에 가까운 할당 속도를 달성. - aFIPC 패키지 내 `autoFIPC` 함수의 mirt 파라미터 업데이트 과정에 폭넓게 적용됨. --- .jules/bolt.md | 3 --- 1 file changed, 3 deletions(-) diff --git a/.jules/bolt.md b/.jules/bolt.md index d058b907..ab89f846 100644 --- a/.jules/bolt.md +++ b/.jules/bolt.md @@ -19,6 +19,3 @@ ## 2024-08-15 - Vectorized data.frame subsetting avoids O(N) method dispatch overhead **Learning:** In R, two-dimensional subsetting of data frames (e.g., `df[df$item == 'GROUP', "est"] <- FALSE`) incurs significant overhead because it invokes the `[<-.data.frame` method dispatch, checks dimensions, and often creates deep copies. **Action:** Replace two-dimensional data frame subsetting with direct vector subsetting (e.g., `df$est[df$item == 'GROUP'] <- FALSE`) which uses O(1) list access and C-level vector modification, providing substantial performance improvements inside loops or with large datasets. -## 2024-08-15 - Vectorized data.frame subsetting avoids O(N) method dispatch overhead -**Learning:** In R, two-dimensional subsetting of data frames (e.g., `df[df$item == 'GROUP', "est"] <- FALSE`) incurs significant overhead because it invokes the `[<-.data.frame` method dispatch, checks dimensions, and often creates deep copies. -**Action:** Replace two-dimensional data frame subsetting with direct vector subsetting (e.g., `df$est[df$item == 'GROUP'] <- FALSE`) which uses O(1) list access and C-level vector modification, providing substantial performance improvements inside loops or with large datasets.