gcc после компиляции кода, делает его тестовый прогон, оценивает производительность. Соотвественно по времени работы gcc можно оценить, где код получаеться лучше, там где gcc отработал быстрее, там и код быстрее работает.
сравним на тестовом примере:
int main() { int i; for (i=0; i<100; i++) { static int j = 0; j = j * i + i; } }
$ time gcc -O0 1.c
real 0m0.488s user 0m0.076s sys 0m0.115s
$ time gcc -O3 1.c
real 0m0.762s user 0m0.083s sys 0m0.127s
Очевидно, что с -O0 код получаетсья почти в 1.5 раза быстрее
Счас тебе доходчиво объяснят, что железо твое - полное говно, для реальных оптимизиций нужно купить 2xdualcore-opteron с минимум 4-мя гигами памяти - и все будет летать. А если не будет - поставят Зюзю и ты поймешь, что все уже отлетало.