tidy up dither stage

Using the float iota was just an expedient to write the stage...
this CL adds the U32 iota that dither really wants.

Change-Id: I7990b10afd0c5277186b6b8e730245d291bcef0c
Reviewed-on: https://skia-review.googlesource.com/17441
Reviewed-by: Herb Derby <herb@google.com>
Commit-Queue: Mike Klein <mtklein@chromium.org>
diff --git a/src/jumper/SkJumper.cpp b/src/jumper/SkJumper.cpp
index d5ad29c..1e703e1 100644
--- a/src/jumper/SkJumper.cpp
+++ b/src/jumper/SkJumper.cpp
@@ -22,7 +22,8 @@
 // It's fine to rearrange and add new ones if you update SkJumper_constants.
 using K = const SkJumper_constants;
 static K kConstants = {
-    {0.0f, 1.0f, 2.0f, 3.0f, 4.0f, 5.0f, 6.0f, 7.0f},
+    {0,1,2,3,4,5,6,7},
+    {0,1,2,3,4,5,6,7},
 };
 
 // We can't express the real types of most stage functions portably, so we use a stand-in.
diff --git a/src/jumper/SkJumper.h b/src/jumper/SkJumper.h
index 7dc88ce..7d6d0af 100644
--- a/src/jumper/SkJumper.h
+++ b/src/jumper/SkJumper.h
@@ -51,7 +51,8 @@
 static const int SkJumper_kMaxStride = 8;
 
 struct SkJumper_constants {
-    float iota[SkJumper_kMaxStride];   //  0,1,2,3,4,...
+    float    iota_F  [SkJumper_kMaxStride];   //  0,1,2,3,4,...
+    uint32_t iota_U32[SkJumper_kMaxStride];   //  0,1,2,3,4,...
 };
 
 struct SkJumper_GatherCtx {
diff --git a/src/jumper/SkJumper_generated.S b/src/jumper/SkJumper_generated.S
index fb90560..143f6b5 100644
--- a/src/jumper/SkJumper_generated.S
+++ b/src/jumper/SkJumper_generated.S
@@ -96,16 +96,14 @@
 FUNCTION(_sk_dither_aarch64)
 _sk_dither_aarch64:
   .long  0xa8c10c28                          // ldp           x8, x3, [x1], #16
-  .long  0x3dc00051                          // ldr           q17, [x2]
+  .long  0x3dc00851                          // ldr           q17, [x2, #32]
   .long  0x4e040c10                          // dup           v16.4s, w0
-  .long  0x4e21da10                          // scvtf         v16.4s, v16.4s
-  .long  0xf9400109                          // ldr           x9, [x8]
-  .long  0x4e31d610                          // fadd          v16.4s, v16.4s, v17.4s
   .long  0x4f000432                          // movi          v18.4s, #0x1
+  .long  0xf9400109                          // ldr           x9, [x8]
   .long  0x4f000454                          // movi          v20.4s, #0x2
-  .long  0x4d40c935                          // ld1r          {v21.4s}, [x9]
-  .long  0x4ea1ba10                          // fcvtzs        v16.4s, v16.4s
+  .long  0x4eb08630                          // add           v16.4s, v17.4s, v16.4s
   .long  0x4e321e11                          // and           v17.16b, v16.16b, v18.16b
+  .long  0x4d40c935                          // ld1r          {v21.4s}, [x9]
   .long  0x4e341e16                          // and           v22.16b, v16.16b, v20.16b
   .long  0x4f000493                          // movi          v19.4s, #0x4
   .long  0x4f245631                          // shl           v17.4s, v17.4s, #4
@@ -2708,9 +2706,9 @@
 _sk_gather_i8_aarch64:
   .long  0xaa0103e8                          // mov           x8, x1
   .long  0xf8408429                          // ldr           x9, [x1], #8
-  .long  0xb4000069                          // cbz           x9, 244c <sk_gather_i8_aarch64+0x14>
+  .long  0xb4000069                          // cbz           x9, 2444 <sk_gather_i8_aarch64+0x14>
   .long  0xaa0903ea                          // mov           x10, x9
-  .long  0x14000003                          // b             2454 <sk_gather_i8_aarch64+0x1c>
+  .long  0x14000003                          // b             244c <sk_gather_i8_aarch64+0x1c>
   .long  0xf940050a                          // ldr           x10, [x8, #8]
   .long  0x91004101                          // add           x1, x8, #0x10
   .long  0xf8410548                          // ldr           x8, [x10], #16
@@ -3675,7 +3673,7 @@
   .long  0x6f00e411                          // movi          v17.2d, #0x0
   .long  0xf9400109                          // ldr           x9, [x8]
   .long  0xf100093f                          // cmp           x9, #0x2
-  .long  0x540001c3                          // b.cc          3128 <sk_gradient_aarch64+0x58>  // b.lo, b.ul, b.last
+  .long  0x540001c3                          // b.cc          3120 <sk_gradient_aarch64+0x58>  // b.lo, b.ul, b.last
   .long  0xf940250a                          // ldr           x10, [x8, #72]
   .long  0xd1000529                          // sub           x9, x9, #0x1
   .long  0x6f00e401                          // movi          v1.2d, #0x0
@@ -3686,7 +3684,7 @@
   .long  0x6e23e403                          // fcmge         v3.4s, v0.4s, v3.4s
   .long  0x4e221c63                          // and           v3.16b, v3.16b, v2.16b
   .long  0x4ea18461                          // add           v1.4s, v3.4s, v1.4s
-  .long  0xb5ffff69                          // cbnz          x9, 3108 <sk_gradient_aarch64+0x38>
+  .long  0xb5ffff69                          // cbnz          x9, 3100 <sk_gradient_aarch64+0x38>
   .long  0x6f20a431                          // uxtl2         v17.2d, v1.4s
   .long  0x2f20a421                          // uxtl          v1.2d, v1.2s
   .long  0xa940b10a                          // ldp           x10, x12, [x8, #8]
@@ -4244,38 +4242,36 @@
 FUNCTION(_sk_dither_vfp4)
 _sk_dither_vfp4:
   .long  0xe92d4010                          // push          {r4, lr}
-  .long  0xee800b90                          // vdup.32       d16, r0
-  .long  0xf2c02012                          // vmov.i32      d18, #2
-  .long  0xf3fb0620                          // vcvt.f32.s32  d16, d16
-  .long  0xedd21b00                          // vldr          d17, [r2]
+  .long  0xedd21b08                          // vldr          d17, [r2, #32]
+  .long  0xf2c02011                          // vmov.i32      d18, #1
   .long  0xe8911010                          // ldm           r1, {r4, ip}
-  .long  0xf2c03014                          // vmov.i32      d19, #4
+  .long  0xee800b90                          // vdup.32       d16, r0
+  .long  0xf26108a0                          // vadd.i32      d16, d17, d16
+  .long  0xf2c01012                          // vmov.i32      d17, #2
   .long  0xe3a035f2                          // mov           r3, #1015021568
-  .long  0xe2811008                          // add           r1, r1, #8
-  .long  0xf2400da1                          // vadd.f32      d16, d16, d17
   .long  0xe494e004                          // ldr           lr, [r4], #4
-  .long  0xf2c01011                          // vmov.i32      d17, #1
-  .long  0xf4ee5c9f                          // vld1.32       {d21[]}, [lr :32]
-  .long  0xf3fb0720                          // vcvt.s32.f32  d16, d16
-  .long  0xf24041b1                          // vand          d20, d16, d17
-  .long  0xf24061b2                          // vand          d22, d16, d18
-  .long  0xf34051b5                          // veor          d21, d16, d21
-  .long  0xf24001b3                          // vand          d16, d16, d19
+  .long  0xf24041b2                          // vand          d20, d16, d18
+  .long  0xf24051b1                          // vand          d21, d16, d17
+  .long  0xe2811008                          // add           r1, r1, #8
+  .long  0xf2c03014                          // vmov.i32      d19, #4
+  .long  0xf4ee7c9f                          // vld1.32       {d23[]}, [lr :32]
   .long  0xf2e44534                          // vshl.s32      d20, d20, #4
-  .long  0xf2e16536                          // vshl.s32      d22, d22, #1
-  .long  0xf24511b1                          // vand          d17, d21, d17
-  .long  0xf3fe0030                          // vshr.u32      d16, d16, #2
-  .long  0xf26641b4                          // vorr          d20, d22, d20
-  .long  0xf24521b2                          // vand          d18, d21, d18
-  .long  0xf2e51531                          // vshl.s32      d17, d17, #5
-  .long  0xf26401b0                          // vorr          d16, d20, d16
-  .long  0xf24531b3                          // vand          d19, d21, d19
-  .long  0xf26001b1                          // vorr          d16, d16, d17
-  .long  0xf2e22532                          // vshl.s32      d18, d18, #2
-  .long  0xf3ff1033                          // vshr.u32      d17, d19, #1
-  .long  0xf26001b2                          // vorr          d16, d16, d18
+  .long  0xf24061b3                          // vand          d22, d16, d19
+  .long  0xf34001b7                          // veor          d16, d16, d23
+  .long  0xf2e15535                          // vshl.s32      d21, d21, #1
+  .long  0xf24021b2                          // vand          d18, d16, d18
+  .long  0xf3fe6036                          // vshr.u32      d22, d22, #2
+  .long  0xf26541b4                          // vorr          d20, d21, d20
+  .long  0xf24011b1                          // vand          d17, d16, d17
+  .long  0xf24001b3                          // vand          d16, d16, d19
+  .long  0xf26431b6                          // vorr          d19, d20, d22
+  .long  0xf2e52532                          // vshl.s32      d18, d18, #5
+  .long  0xf2e21531                          // vshl.s32      d17, d17, #2
+  .long  0xf26321b2                          // vorr          d18, d19, d18
+  .long  0xf3ff0030                          // vshr.u32      d16, d16, #1
+  .long  0xf26211b1                          // vorr          d17, d18, d17
   .long  0xf2c03010                          // vmov.i32      d19, #0
-  .long  0xf26001b1                          // vorr          d16, d16, d17
+  .long  0xf26101b0                          // vorr          d16, d17, d16
   .long  0xee813b90                          // vdup.32       d17, r3
   .long  0xf3fb0620                          // vcvt.f32.s32  d16, d16
   .long  0xf3400db1                          // vmul.f32      d16, d16, d17
@@ -8199,7 +8195,7 @@
   .long  0xf2c00010                          // vmov.i32      d16, #0
   .long  0xe59c3000                          // ldr           r3, [ip]
   .long  0xe3530002                          // cmp           r3, #2
-  .long  0x3a00000b                          // bcc           36ec <sk_gradient_vfp4+0x50>
+  .long  0x3a00000b                          // bcc           36e4 <sk_gradient_vfp4+0x50>
   .long  0xe59c4024                          // ldr           r4, [ip, #36]
   .long  0xf2c01010                          // vmov.i32      d17, #0
   .long  0xf2c02011                          // vmov.i32      d18, #1
@@ -8211,7 +8207,7 @@
   .long  0xf3403e23                          // vcge.f32      d19, d0, d19
   .long  0xf35231b1                          // vbsl          d19, d18, d17
   .long  0xf26308a0                          // vadd.i32      d16, d19, d16
-  .long  0x1afffff9                          // bne           36d4 <sk_gradient_vfp4+0x38>
+  .long  0x1afffff9                          // bne           36cc <sk_gradient_vfp4+0x38>
   .long  0xee303b90                          // vmov.32       r3, d16[1]
   .long  0xe59c7010                          // ldr           r7, [ip, #16]
   .long  0xee10eb90                          // vmov.32       lr, d16[0]
@@ -8804,14 +8800,14 @@
   .byte  197,249,110,199                     // vmovd         %edi,%xmm0
   .byte  196,226,125,88,192                  // vpbroadcastd  %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,89,71,0,0         // vbroadcastss  0x4759(%rip),%ymm1        # 481c <_sk_callback_hsw+0x127>
+  .byte  196,226,125,24,13,81,71,0,0         // vbroadcastss  0x4751(%rip),%ymm1        # 4814 <_sk_callback_hsw+0x127>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  197,252,88,2                        // vaddps        (%rdx),%ymm0,%ymm0
   .byte  196,226,125,24,16                   // vbroadcastss  (%rax),%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  197,236,88,201                      // vaddps        %ymm1,%ymm2,%ymm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,21,61,71,0,0         // vbroadcastss  0x473d(%rip),%ymm2        # 4820 <_sk_callback_hsw+0x12b>
+  .byte  196,226,125,24,21,53,71,0,0         // vbroadcastss  0x4735(%rip),%ymm2        # 4818 <_sk_callback_hsw+0x12b>
   .byte  197,228,87,219                      // vxorps        %ymm3,%ymm3,%ymm3
   .byte  197,220,87,228                      // vxorps        %ymm4,%ymm4,%ymm4
   .byte  197,212,87,237                      // vxorps        %ymm5,%ymm5,%ymm5
@@ -8826,19 +8822,17 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,121,110,199                     // vmovd         %edi,%xmm8
   .byte  196,66,125,88,192                   // vpbroadcastd  %xmm8,%ymm8
-  .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  197,60,88,2                         // vaddps        (%rdx),%ymm8,%ymm8
-  .byte  196,65,126,91,192                   // vcvttps2dq    %ymm8,%ymm8
+  .byte  197,61,254,66,32                    // vpaddd        0x20(%rdx),%ymm8,%ymm8
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  196,66,125,88,8                     // vpbroadcastd  (%r8),%ymm9
   .byte  196,65,61,239,201                   // vpxor         %ymm9,%ymm8,%ymm9
-  .byte  196,98,125,88,21,252,70,0,0         // vpbroadcastd  0x46fc(%rip),%ymm10        # 4824 <_sk_callback_hsw+0x12f>
+  .byte  196,98,125,88,21,253,70,0,0         // vpbroadcastd  0x46fd(%rip),%ymm10        # 481c <_sk_callback_hsw+0x12f>
   .byte  196,65,53,219,218                   // vpand         %ymm10,%ymm9,%ymm11
   .byte  196,193,37,114,243,5                // vpslld        $0x5,%ymm11,%ymm11
   .byte  196,65,61,219,210                   // vpand         %ymm10,%ymm8,%ymm10
   .byte  196,193,45,114,242,4                // vpslld        $0x4,%ymm10,%ymm10
-  .byte  196,98,125,88,37,225,70,0,0         // vpbroadcastd  0x46e1(%rip),%ymm12        # 4828 <_sk_callback_hsw+0x133>
-  .byte  196,98,125,88,45,220,70,0,0         // vpbroadcastd  0x46dc(%rip),%ymm13        # 482c <_sk_callback_hsw+0x137>
+  .byte  196,98,125,88,37,226,70,0,0         // vpbroadcastd  0x46e2(%rip),%ymm12        # 4820 <_sk_callback_hsw+0x133>
+  .byte  196,98,125,88,45,221,70,0,0         // vpbroadcastd  0x46dd(%rip),%ymm13        # 4824 <_sk_callback_hsw+0x137>
   .byte  196,65,53,219,245                   // vpand         %ymm13,%ymm9,%ymm14
   .byte  196,193,13,114,246,2                // vpslld        $0x2,%ymm14,%ymm14
   .byte  196,65,61,219,237                   // vpand         %ymm13,%ymm8,%ymm13
@@ -8849,12 +8843,12 @@
   .byte  196,193,61,114,208,2                // vpsrld        $0x2,%ymm8,%ymm8
   .byte  196,65,21,235,210                   // vpor          %ymm10,%ymm13,%ymm10
   .byte  196,65,45,235,192                   // vpor          %ymm8,%ymm10,%ymm8
-  .byte  196,65,37,235,214                   // vpor          %ymm14,%ymm11,%ymm10
-  .byte  196,65,61,235,194                   // vpor          %ymm10,%ymm8,%ymm8
+  .byte  196,65,61,235,195                   // vpor          %ymm11,%ymm8,%ymm8
+  .byte  196,65,13,235,201                   // vpor          %ymm9,%ymm14,%ymm9
   .byte  196,65,61,235,193                   // vpor          %ymm9,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,142,70,0,0         // vbroadcastss  0x468e(%rip),%ymm9        # 4830 <_sk_callback_hsw+0x13b>
-  .byte  196,98,125,24,21,137,70,0,0         // vbroadcastss  0x4689(%rip),%ymm10        # 4834 <_sk_callback_hsw+0x13f>
+  .byte  196,98,125,24,13,143,70,0,0         // vbroadcastss  0x468f(%rip),%ymm9        # 4828 <_sk_callback_hsw+0x13b>
+  .byte  196,98,125,24,21,138,70,0,0         // vbroadcastss  0x468a(%rip),%ymm10        # 482c <_sk_callback_hsw+0x13f>
   .byte  196,66,61,184,209                   // vfmadd231ps   %ymm9,%ymm8,%ymm10
   .byte  196,98,125,24,64,8                  // vbroadcastss  0x8(%rax),%ymm8
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
@@ -8923,7 +8917,7 @@
 FUNCTION(_sk_srcatop_hsw)
 _sk_srcatop_hsw:
   .byte  197,252,89,199                      // vmulps        %ymm7,%ymm0,%ymm0
-  .byte  196,98,125,24,5,224,69,0,0          // vbroadcastss  0x45e0(%rip),%ymm8        # 4838 <_sk_callback_hsw+0x143>
+  .byte  196,98,125,24,5,225,69,0,0          // vbroadcastss  0x45e1(%rip),%ymm8        # 4830 <_sk_callback_hsw+0x143>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,226,61,184,196                  // vfmadd231ps   %ymm4,%ymm8,%ymm0
   .byte  197,244,89,207                      // vmulps        %ymm7,%ymm1,%ymm1
@@ -8939,7 +8933,7 @@
 .globl _sk_dstatop_hsw
 FUNCTION(_sk_dstatop_hsw)
 _sk_dstatop_hsw:
-  .byte  196,98,125,24,5,179,69,0,0          // vbroadcastss  0x45b3(%rip),%ymm8        # 483c <_sk_callback_hsw+0x147>
+  .byte  196,98,125,24,5,180,69,0,0          // vbroadcastss  0x45b4(%rip),%ymm8        # 4834 <_sk_callback_hsw+0x147>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  196,226,101,184,196                 // vfmadd231ps   %ymm4,%ymm3,%ymm0
@@ -8978,7 +8972,7 @@
 .globl _sk_srcout_hsw
 FUNCTION(_sk_srcout_hsw)
 _sk_srcout_hsw:
-  .byte  196,98,125,24,5,90,69,0,0           // vbroadcastss  0x455a(%rip),%ymm8        # 4840 <_sk_callback_hsw+0x14b>
+  .byte  196,98,125,24,5,91,69,0,0           // vbroadcastss  0x455b(%rip),%ymm8        # 4838 <_sk_callback_hsw+0x14b>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
@@ -8991,7 +8985,7 @@
 .globl _sk_dstout_hsw
 FUNCTION(_sk_dstout_hsw)
 _sk_dstout_hsw:
-  .byte  196,226,125,24,5,61,69,0,0          // vbroadcastss  0x453d(%rip),%ymm0        # 4844 <_sk_callback_hsw+0x14f>
+  .byte  196,226,125,24,5,62,69,0,0          // vbroadcastss  0x453e(%rip),%ymm0        # 483c <_sk_callback_hsw+0x14f>
   .byte  197,252,92,219                      // vsubps        %ymm3,%ymm0,%ymm3
   .byte  197,228,89,196                      // vmulps        %ymm4,%ymm3,%ymm0
   .byte  197,228,89,205                      // vmulps        %ymm5,%ymm3,%ymm1
@@ -9004,7 +8998,7 @@
 .globl _sk_srcover_hsw
 FUNCTION(_sk_srcover_hsw)
 _sk_srcover_hsw:
-  .byte  196,98,125,24,5,32,69,0,0           // vbroadcastss  0x4520(%rip),%ymm8        # 4848 <_sk_callback_hsw+0x153>
+  .byte  196,98,125,24,5,33,69,0,0           // vbroadcastss  0x4521(%rip),%ymm8        # 4840 <_sk_callback_hsw+0x153>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,93,184,192                  // vfmadd231ps   %ymm8,%ymm4,%ymm0
   .byte  196,194,85,184,200                  // vfmadd231ps   %ymm8,%ymm5,%ymm1
@@ -9017,7 +9011,7 @@
 .globl _sk_dstover_hsw
 FUNCTION(_sk_dstover_hsw)
 _sk_dstover_hsw:
-  .byte  196,98,125,24,5,255,68,0,0          // vbroadcastss  0x44ff(%rip),%ymm8        # 484c <_sk_callback_hsw+0x157>
+  .byte  196,98,125,24,5,0,69,0,0            // vbroadcastss  0x4500(%rip),%ymm8        # 4844 <_sk_callback_hsw+0x157>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  196,226,61,168,196                  // vfmadd213ps   %ymm4,%ymm8,%ymm0
   .byte  196,226,61,168,205                  // vfmadd213ps   %ymm5,%ymm8,%ymm1
@@ -9041,7 +9035,7 @@
 .globl _sk_multiply_hsw
 FUNCTION(_sk_multiply_hsw)
 _sk_multiply_hsw:
-  .byte  196,98,125,24,5,202,68,0,0          // vbroadcastss  0x44ca(%rip),%ymm8        # 4850 <_sk_callback_hsw+0x15b>
+  .byte  196,98,125,24,5,203,68,0,0          // vbroadcastss  0x44cb(%rip),%ymm8        # 4848 <_sk_callback_hsw+0x15b>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,52,89,208                       // vmulps        %ymm0,%ymm9,%ymm10
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -9089,7 +9083,7 @@
 .globl _sk_xor__hsw
 FUNCTION(_sk_xor__hsw)
 _sk_xor__hsw:
-  .byte  196,98,125,24,5,69,68,0,0           // vbroadcastss  0x4445(%rip),%ymm8        # 4854 <_sk_callback_hsw+0x15f>
+  .byte  196,98,125,24,5,70,68,0,0           // vbroadcastss  0x4446(%rip),%ymm8        # 484c <_sk_callback_hsw+0x15f>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,180,89,192                      // vmulps        %ymm0,%ymm9,%ymm0
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -9123,7 +9117,7 @@
   .byte  197,100,89,206                      // vmulps        %ymm6,%ymm3,%ymm9
   .byte  196,193,108,95,209                  // vmaxps        %ymm9,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,205,67,0,0          // vbroadcastss  0x43cd(%rip),%ymm8        # 4858 <_sk_callback_hsw+0x163>
+  .byte  196,98,125,24,5,206,67,0,0          // vbroadcastss  0x43ce(%rip),%ymm8        # 4850 <_sk_callback_hsw+0x163>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,69,184,216                  // vfmadd231ps   %ymm8,%ymm7,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -9148,7 +9142,7 @@
   .byte  197,100,89,206                      // vmulps        %ymm6,%ymm3,%ymm9
   .byte  196,193,108,93,209                  // vminps        %ymm9,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,124,67,0,0          // vbroadcastss  0x437c(%rip),%ymm8        # 485c <_sk_callback_hsw+0x167>
+  .byte  196,98,125,24,5,125,67,0,0          // vbroadcastss  0x437d(%rip),%ymm8        # 4854 <_sk_callback_hsw+0x167>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,69,184,216                  // vfmadd231ps   %ymm8,%ymm7,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -9176,7 +9170,7 @@
   .byte  196,193,108,93,209                  // vminps        %ymm9,%ymm2,%ymm2
   .byte  197,236,88,210                      // vaddps        %ymm2,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,31,67,0,0           // vbroadcastss  0x431f(%rip),%ymm8        # 4860 <_sk_callback_hsw+0x16b>
+  .byte  196,98,125,24,5,32,67,0,0           // vbroadcastss  0x4320(%rip),%ymm8        # 4858 <_sk_callback_hsw+0x16b>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,69,184,216                  // vfmadd231ps   %ymm8,%ymm7,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -9198,7 +9192,7 @@
   .byte  197,236,89,214                      // vmulps        %ymm6,%ymm2,%ymm2
   .byte  197,236,88,210                      // vaddps        %ymm2,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,221,66,0,0          // vbroadcastss  0x42dd(%rip),%ymm8        # 4864 <_sk_callback_hsw+0x16f>
+  .byte  196,98,125,24,5,222,66,0,0          // vbroadcastss  0x42de(%rip),%ymm8        # 485c <_sk_callback_hsw+0x16f>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,69,184,216                  // vfmadd231ps   %ymm8,%ymm7,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -9208,7 +9202,7 @@
 .globl _sk_colorburn_hsw
 FUNCTION(_sk_colorburn_hsw)
 _sk_colorburn_hsw:
-  .byte  196,98,125,24,5,203,66,0,0          // vbroadcastss  0x42cb(%rip),%ymm8        # 4868 <_sk_callback_hsw+0x173>
+  .byte  196,98,125,24,5,204,66,0,0          // vbroadcastss  0x42cc(%rip),%ymm8        # 4860 <_sk_callback_hsw+0x173>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,52,89,216                       // vmulps        %ymm0,%ymm9,%ymm11
   .byte  196,65,44,87,210                    // vxorps        %ymm10,%ymm10,%ymm10
@@ -9266,7 +9260,7 @@
 FUNCTION(_sk_colordodge_hsw)
 _sk_colordodge_hsw:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
-  .byte  196,98,125,24,13,214,65,0,0         // vbroadcastss  0x41d6(%rip),%ymm9        # 486c <_sk_callback_hsw+0x177>
+  .byte  196,98,125,24,13,215,65,0,0         // vbroadcastss  0x41d7(%rip),%ymm9        # 4864 <_sk_callback_hsw+0x177>
   .byte  197,52,92,215                       // vsubps        %ymm7,%ymm9,%ymm10
   .byte  197,44,89,216                       // vmulps        %ymm0,%ymm10,%ymm11
   .byte  197,52,92,203                       // vsubps        %ymm3,%ymm9,%ymm9
@@ -9319,7 +9313,7 @@
 .globl _sk_hardlight_hsw
 FUNCTION(_sk_hardlight_hsw)
 _sk_hardlight_hsw:
-  .byte  196,98,125,24,5,247,64,0,0          // vbroadcastss  0x40f7(%rip),%ymm8        # 4870 <_sk_callback_hsw+0x17b>
+  .byte  196,98,125,24,5,248,64,0,0          // vbroadcastss  0x40f8(%rip),%ymm8        # 4868 <_sk_callback_hsw+0x17b>
   .byte  197,60,92,215                       // vsubps        %ymm7,%ymm8,%ymm10
   .byte  197,44,89,216                       // vmulps        %ymm0,%ymm10,%ymm11
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -9370,7 +9364,7 @@
 .globl _sk_overlay_hsw
 FUNCTION(_sk_overlay_hsw)
 _sk_overlay_hsw:
-  .byte  196,98,125,24,5,47,64,0,0           // vbroadcastss  0x402f(%rip),%ymm8        # 4874 <_sk_callback_hsw+0x17f>
+  .byte  196,98,125,24,5,48,64,0,0           // vbroadcastss  0x4030(%rip),%ymm8        # 486c <_sk_callback_hsw+0x17f>
   .byte  197,60,92,215                       // vsubps        %ymm7,%ymm8,%ymm10
   .byte  197,44,89,216                       // vmulps        %ymm0,%ymm10,%ymm11
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -9431,10 +9425,10 @@
   .byte  196,65,20,88,197                    // vaddps        %ymm13,%ymm13,%ymm8
   .byte  196,65,60,88,192                    // vaddps        %ymm8,%ymm8,%ymm8
   .byte  196,66,61,168,192                   // vfmadd213ps   %ymm8,%ymm8,%ymm8
-  .byte  196,98,125,24,29,58,63,0,0          // vbroadcastss  0x3f3a(%rip),%ymm11        # 487c <_sk_callback_hsw+0x187>
+  .byte  196,98,125,24,29,59,63,0,0          // vbroadcastss  0x3f3b(%rip),%ymm11        # 4874 <_sk_callback_hsw+0x187>
   .byte  196,65,20,88,227                    // vaddps        %ymm11,%ymm13,%ymm12
   .byte  196,65,28,89,192                    // vmulps        %ymm8,%ymm12,%ymm8
-  .byte  196,98,125,24,37,43,63,0,0          // vbroadcastss  0x3f2b(%rip),%ymm12        # 4880 <_sk_callback_hsw+0x18b>
+  .byte  196,98,125,24,37,44,63,0,0          // vbroadcastss  0x3f2c(%rip),%ymm12        # 4878 <_sk_callback_hsw+0x18b>
   .byte  196,66,21,184,196                   // vfmadd231ps   %ymm12,%ymm13,%ymm8
   .byte  196,65,124,82,245                   // vrsqrtps      %ymm13,%ymm14
   .byte  196,65,124,83,246                   // vrcpps        %ymm14,%ymm14
@@ -9444,7 +9438,7 @@
   .byte  197,4,194,255,2                     // vcmpleps      %ymm7,%ymm15,%ymm15
   .byte  196,67,13,74,240,240                // vblendvps     %ymm15,%ymm8,%ymm14,%ymm14
   .byte  197,116,88,249                      // vaddps        %ymm1,%ymm1,%ymm15
-  .byte  196,98,125,24,5,238,62,0,0          // vbroadcastss  0x3eee(%rip),%ymm8        # 4878 <_sk_callback_hsw+0x183>
+  .byte  196,98,125,24,5,239,62,0,0          // vbroadcastss  0x3eef(%rip),%ymm8        # 4870 <_sk_callback_hsw+0x183>
   .byte  196,65,60,92,237                    // vsubps        %ymm13,%ymm8,%ymm13
   .byte  197,132,92,195                      // vsubps        %ymm3,%ymm15,%ymm0
   .byte  196,98,125,168,235                  // vfmadd213ps   %ymm3,%ymm0,%ymm13
@@ -9557,11 +9551,11 @@
   .byte  196,65,28,89,210                    // vmulps        %ymm10,%ymm12,%ymm10
   .byte  196,65,44,94,214                    // vdivps        %ymm14,%ymm10,%ymm10
   .byte  196,67,45,74,224,240                // vblendvps     %ymm15,%ymm8,%ymm10,%ymm12
-  .byte  196,98,125,24,53,242,60,0,0         // vbroadcastss  0x3cf2(%rip),%ymm14        # 4884 <_sk_callback_hsw+0x18f>
-  .byte  196,98,125,24,61,237,60,0,0         // vbroadcastss  0x3ced(%rip),%ymm15        # 4888 <_sk_callback_hsw+0x193>
+  .byte  196,98,125,24,53,243,60,0,0         // vbroadcastss  0x3cf3(%rip),%ymm14        # 487c <_sk_callback_hsw+0x18f>
+  .byte  196,98,125,24,61,238,60,0,0         // vbroadcastss  0x3cee(%rip),%ymm15        # 4880 <_sk_callback_hsw+0x193>
   .byte  196,65,84,89,239                    // vmulps        %ymm15,%ymm5,%ymm13
   .byte  196,66,93,184,238                   // vfmadd231ps   %ymm14,%ymm4,%ymm13
-  .byte  196,226,125,24,5,222,60,0,0         // vbroadcastss  0x3cde(%rip),%ymm0        # 488c <_sk_callback_hsw+0x197>
+  .byte  196,226,125,24,5,223,60,0,0         // vbroadcastss  0x3cdf(%rip),%ymm0        # 4884 <_sk_callback_hsw+0x197>
   .byte  196,98,77,184,232                   // vfmadd231ps   %ymm0,%ymm6,%ymm13
   .byte  196,65,116,89,215                   // vmulps        %ymm15,%ymm1,%ymm10
   .byte  196,66,53,184,214                   // vfmadd231ps   %ymm14,%ymm9,%ymm10
@@ -9616,7 +9610,7 @@
   .byte  196,193,124,95,192                  // vmaxps        %ymm8,%ymm0,%ymm0
   .byte  196,65,36,95,200                    // vmaxps        %ymm8,%ymm11,%ymm9
   .byte  196,65,116,95,192                   // vmaxps        %ymm8,%ymm1,%ymm8
-  .byte  196,226,125,24,13,203,59,0,0        // vbroadcastss  0x3bcb(%rip),%ymm1        # 4890 <_sk_callback_hsw+0x19b>
+  .byte  196,226,125,24,13,204,59,0,0        // vbroadcastss  0x3bcc(%rip),%ymm1        # 4888 <_sk_callback_hsw+0x19b>
   .byte  197,116,92,215                      // vsubps        %ymm7,%ymm1,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,116,92,219                      // vsubps        %ymm3,%ymm1,%ymm11
@@ -9670,11 +9664,11 @@
   .byte  196,65,28,89,210                    // vmulps        %ymm10,%ymm12,%ymm10
   .byte  196,65,44,94,214                    // vdivps        %ymm14,%ymm10,%ymm10
   .byte  196,67,45,74,224,240                // vblendvps     %ymm15,%ymm8,%ymm10,%ymm12
-  .byte  196,98,125,24,53,226,58,0,0         // vbroadcastss  0x3ae2(%rip),%ymm14        # 4894 <_sk_callback_hsw+0x19f>
-  .byte  196,98,125,24,61,221,58,0,0         // vbroadcastss  0x3add(%rip),%ymm15        # 4898 <_sk_callback_hsw+0x1a3>
+  .byte  196,98,125,24,53,227,58,0,0         // vbroadcastss  0x3ae3(%rip),%ymm14        # 488c <_sk_callback_hsw+0x19f>
+  .byte  196,98,125,24,61,222,58,0,0         // vbroadcastss  0x3ade(%rip),%ymm15        # 4890 <_sk_callback_hsw+0x1a3>
   .byte  196,65,84,89,239                    // vmulps        %ymm15,%ymm5,%ymm13
   .byte  196,66,93,184,238                   // vfmadd231ps   %ymm14,%ymm4,%ymm13
-  .byte  196,226,125,24,5,206,58,0,0         // vbroadcastss  0x3ace(%rip),%ymm0        # 489c <_sk_callback_hsw+0x1a7>
+  .byte  196,226,125,24,5,207,58,0,0         // vbroadcastss  0x3acf(%rip),%ymm0        # 4894 <_sk_callback_hsw+0x1a7>
   .byte  196,98,77,184,232                   // vfmadd231ps   %ymm0,%ymm6,%ymm13
   .byte  196,65,116,89,215                   // vmulps        %ymm15,%ymm1,%ymm10
   .byte  196,66,53,184,214                   // vfmadd231ps   %ymm14,%ymm9,%ymm10
@@ -9729,7 +9723,7 @@
   .byte  196,193,124,95,192                  // vmaxps        %ymm8,%ymm0,%ymm0
   .byte  196,65,36,95,200                    // vmaxps        %ymm8,%ymm11,%ymm9
   .byte  196,65,116,95,192                   // vmaxps        %ymm8,%ymm1,%ymm8
-  .byte  196,226,125,24,13,187,57,0,0        // vbroadcastss  0x39bb(%rip),%ymm1        # 48a0 <_sk_callback_hsw+0x1ab>
+  .byte  196,226,125,24,13,188,57,0,0        // vbroadcastss  0x39bc(%rip),%ymm1        # 4898 <_sk_callback_hsw+0x1ab>
   .byte  197,116,92,215                      // vsubps        %ymm7,%ymm1,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,116,92,219                      // vsubps        %ymm3,%ymm1,%ymm11
@@ -9757,11 +9751,11 @@
   .byte  197,108,89,199                      // vmulps        %ymm7,%ymm2,%ymm8
   .byte  197,116,89,215                      // vmulps        %ymm7,%ymm1,%ymm10
   .byte  197,52,89,223                       // vmulps        %ymm7,%ymm9,%ymm11
-  .byte  196,98,125,24,45,84,57,0,0          // vbroadcastss  0x3954(%rip),%ymm13        # 48a4 <_sk_callback_hsw+0x1af>
-  .byte  196,98,125,24,53,79,57,0,0          // vbroadcastss  0x394f(%rip),%ymm14        # 48a8 <_sk_callback_hsw+0x1b3>
+  .byte  196,98,125,24,45,85,57,0,0          // vbroadcastss  0x3955(%rip),%ymm13        # 489c <_sk_callback_hsw+0x1af>
+  .byte  196,98,125,24,53,80,57,0,0          // vbroadcastss  0x3950(%rip),%ymm14        # 48a0 <_sk_callback_hsw+0x1b3>
   .byte  196,65,84,89,230                    // vmulps        %ymm14,%ymm5,%ymm12
   .byte  196,66,93,184,229                   // vfmadd231ps   %ymm13,%ymm4,%ymm12
-  .byte  196,98,125,24,61,64,57,0,0          // vbroadcastss  0x3940(%rip),%ymm15        # 48ac <_sk_callback_hsw+0x1b7>
+  .byte  196,98,125,24,61,65,57,0,0          // vbroadcastss  0x3941(%rip),%ymm15        # 48a4 <_sk_callback_hsw+0x1b7>
   .byte  196,66,77,184,231                   // vfmadd231ps   %ymm15,%ymm6,%ymm12
   .byte  196,65,44,89,206                    // vmulps        %ymm14,%ymm10,%ymm9
   .byte  196,66,61,184,205                   // vfmadd231ps   %ymm13,%ymm8,%ymm9
@@ -9817,7 +9811,7 @@
   .byte  196,193,116,95,206                  // vmaxps        %ymm14,%ymm1,%ymm1
   .byte  196,65,44,95,198                    // vmaxps        %ymm14,%ymm10,%ymm8
   .byte  196,65,124,95,206                   // vmaxps        %ymm14,%ymm0,%ymm9
-  .byte  196,226,125,24,5,34,56,0,0          // vbroadcastss  0x3822(%rip),%ymm0        # 48b0 <_sk_callback_hsw+0x1bb>
+  .byte  196,226,125,24,5,35,56,0,0          // vbroadcastss  0x3823(%rip),%ymm0        # 48a8 <_sk_callback_hsw+0x1bb>
   .byte  197,124,92,215                      // vsubps        %ymm7,%ymm0,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,124,92,219                      // vsubps        %ymm3,%ymm0,%ymm11
@@ -9845,11 +9839,11 @@
   .byte  197,100,89,196                      // vmulps        %ymm4,%ymm3,%ymm8
   .byte  197,100,89,213                      // vmulps        %ymm5,%ymm3,%ymm10
   .byte  197,100,89,222                      // vmulps        %ymm6,%ymm3,%ymm11
-  .byte  196,98,125,24,45,187,55,0,0         // vbroadcastss  0x37bb(%rip),%ymm13        # 48b4 <_sk_callback_hsw+0x1bf>
-  .byte  196,98,125,24,53,182,55,0,0         // vbroadcastss  0x37b6(%rip),%ymm14        # 48b8 <_sk_callback_hsw+0x1c3>
+  .byte  196,98,125,24,45,188,55,0,0         // vbroadcastss  0x37bc(%rip),%ymm13        # 48ac <_sk_callback_hsw+0x1bf>
+  .byte  196,98,125,24,53,183,55,0,0         // vbroadcastss  0x37b7(%rip),%ymm14        # 48b0 <_sk_callback_hsw+0x1c3>
   .byte  196,65,116,89,230                   // vmulps        %ymm14,%ymm1,%ymm12
   .byte  196,66,109,184,229                  // vfmadd231ps   %ymm13,%ymm2,%ymm12
-  .byte  196,98,125,24,61,167,55,0,0         // vbroadcastss  0x37a7(%rip),%ymm15        # 48bc <_sk_callback_hsw+0x1c7>
+  .byte  196,98,125,24,61,168,55,0,0         // vbroadcastss  0x37a8(%rip),%ymm15        # 48b4 <_sk_callback_hsw+0x1c7>
   .byte  196,66,53,184,231                   // vfmadd231ps   %ymm15,%ymm9,%ymm12
   .byte  196,65,44,89,206                    // vmulps        %ymm14,%ymm10,%ymm9
   .byte  196,66,61,184,205                   // vfmadd231ps   %ymm13,%ymm8,%ymm9
@@ -9905,7 +9899,7 @@
   .byte  196,193,116,95,206                  // vmaxps        %ymm14,%ymm1,%ymm1
   .byte  196,65,44,95,198                    // vmaxps        %ymm14,%ymm10,%ymm8
   .byte  196,65,124,95,206                   // vmaxps        %ymm14,%ymm0,%ymm9
-  .byte  196,226,125,24,5,137,54,0,0         // vbroadcastss  0x3689(%rip),%ymm0        # 48c0 <_sk_callback_hsw+0x1cb>
+  .byte  196,226,125,24,5,138,54,0,0         // vbroadcastss  0x368a(%rip),%ymm0        # 48b8 <_sk_callback_hsw+0x1cb>
   .byte  197,124,92,215                      // vsubps        %ymm7,%ymm0,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,124,92,219                      // vsubps        %ymm3,%ymm0,%ymm11
@@ -9938,7 +9932,7 @@
 .globl _sk_clamp_1_hsw
 FUNCTION(_sk_clamp_1_hsw)
 _sk_clamp_1_hsw:
-  .byte  196,98,125,24,5,37,54,0,0           // vbroadcastss  0x3625(%rip),%ymm8        # 48c4 <_sk_callback_hsw+0x1cf>
+  .byte  196,98,125,24,5,38,54,0,0           // vbroadcastss  0x3626(%rip),%ymm8        # 48bc <_sk_callback_hsw+0x1cf>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  196,193,116,93,200                  // vminps        %ymm8,%ymm1,%ymm1
   .byte  196,193,108,93,208                  // vminps        %ymm8,%ymm2,%ymm2
@@ -9950,7 +9944,7 @@
 .globl _sk_clamp_a_hsw
 FUNCTION(_sk_clamp_a_hsw)
 _sk_clamp_a_hsw:
-  .byte  196,98,125,24,5,8,54,0,0            // vbroadcastss  0x3608(%rip),%ymm8        # 48c8 <_sk_callback_hsw+0x1d3>
+  .byte  196,98,125,24,5,9,54,0,0            // vbroadcastss  0x3609(%rip),%ymm8        # 48c0 <_sk_callback_hsw+0x1d3>
   .byte  196,193,100,93,216                  // vminps        %ymm8,%ymm3,%ymm3
   .byte  197,252,93,195                      // vminps        %ymm3,%ymm0,%ymm0
   .byte  197,244,93,203                      // vminps        %ymm3,%ymm1,%ymm1
@@ -10036,7 +10030,7 @@
 _sk_unpremul_hsw:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,65,100,194,200,0                // vcmpeqps      %ymm8,%ymm3,%ymm9
-  .byte  196,98,125,24,21,80,53,0,0          // vbroadcastss  0x3550(%rip),%ymm10        # 48cc <_sk_callback_hsw+0x1d7>
+  .byte  196,98,125,24,21,81,53,0,0          // vbroadcastss  0x3551(%rip),%ymm10        # 48c4 <_sk_callback_hsw+0x1d7>
   .byte  197,44,94,211                       // vdivps        %ymm3,%ymm10,%ymm10
   .byte  196,67,45,74,192,144                // vblendvps     %ymm9,%ymm8,%ymm10,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
@@ -10049,16 +10043,16 @@
 .globl _sk_from_srgb_hsw
 FUNCTION(_sk_from_srgb_hsw)
 _sk_from_srgb_hsw:
-  .byte  196,98,125,24,5,49,53,0,0           // vbroadcastss  0x3531(%rip),%ymm8        # 48d0 <_sk_callback_hsw+0x1db>
+  .byte  196,98,125,24,5,50,53,0,0           // vbroadcastss  0x3532(%rip),%ymm8        # 48c8 <_sk_callback_hsw+0x1db>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  197,124,89,208                      // vmulps        %ymm0,%ymm0,%ymm10
-  .byte  196,98,125,24,29,35,53,0,0          // vbroadcastss  0x3523(%rip),%ymm11        # 48d4 <_sk_callback_hsw+0x1df>
-  .byte  196,98,125,24,37,30,53,0,0          // vbroadcastss  0x351e(%rip),%ymm12        # 48d8 <_sk_callback_hsw+0x1e3>
+  .byte  196,98,125,24,29,36,53,0,0          // vbroadcastss  0x3524(%rip),%ymm11        # 48cc <_sk_callback_hsw+0x1df>
+  .byte  196,98,125,24,37,31,53,0,0          // vbroadcastss  0x351f(%rip),%ymm12        # 48d0 <_sk_callback_hsw+0x1e3>
   .byte  196,65,124,40,236                   // vmovaps       %ymm12,%ymm13
   .byte  196,66,125,168,235                  // vfmadd213ps   %ymm11,%ymm0,%ymm13
-  .byte  196,98,125,24,53,15,53,0,0          // vbroadcastss  0x350f(%rip),%ymm14        # 48dc <_sk_callback_hsw+0x1e7>
+  .byte  196,98,125,24,53,16,53,0,0          // vbroadcastss  0x3510(%rip),%ymm14        # 48d4 <_sk_callback_hsw+0x1e7>
   .byte  196,66,45,168,238                   // vfmadd213ps   %ymm14,%ymm10,%ymm13
-  .byte  196,98,125,24,21,5,53,0,0           // vbroadcastss  0x3505(%rip),%ymm10        # 48e0 <_sk_callback_hsw+0x1eb>
+  .byte  196,98,125,24,21,6,53,0,0           // vbroadcastss  0x3506(%rip),%ymm10        # 48d8 <_sk_callback_hsw+0x1eb>
   .byte  196,193,124,194,194,1               // vcmpltps      %ymm10,%ymm0,%ymm0
   .byte  196,195,21,74,193,0                 // vblendvps     %ymm0,%ymm9,%ymm13,%ymm0
   .byte  196,65,116,89,200                   // vmulps        %ymm8,%ymm1,%ymm9
@@ -10082,19 +10076,19 @@
 FUNCTION(_sk_to_srgb_hsw)
 _sk_to_srgb_hsw:
   .byte  197,124,82,200                      // vrsqrtps      %ymm0,%ymm9
-  .byte  196,98,125,24,5,169,52,0,0          // vbroadcastss  0x34a9(%rip),%ymm8        # 48e4 <_sk_callback_hsw+0x1ef>
+  .byte  196,98,125,24,5,170,52,0,0          // vbroadcastss  0x34aa(%rip),%ymm8        # 48dc <_sk_callback_hsw+0x1ef>
   .byte  196,65,124,89,208                   // vmulps        %ymm8,%ymm0,%ymm10
-  .byte  196,98,125,24,29,159,52,0,0         // vbroadcastss  0x349f(%rip),%ymm11        # 48e8 <_sk_callback_hsw+0x1f3>
-  .byte  196,98,125,24,37,154,52,0,0         // vbroadcastss  0x349a(%rip),%ymm12        # 48ec <_sk_callback_hsw+0x1f7>
+  .byte  196,98,125,24,29,160,52,0,0         // vbroadcastss  0x34a0(%rip),%ymm11        # 48e0 <_sk_callback_hsw+0x1f3>
+  .byte  196,98,125,24,37,155,52,0,0         // vbroadcastss  0x349b(%rip),%ymm12        # 48e4 <_sk_callback_hsw+0x1f7>
   .byte  196,65,124,40,236                   // vmovaps       %ymm12,%ymm13
   .byte  196,66,53,168,235                   // vfmadd213ps   %ymm11,%ymm9,%ymm13
-  .byte  196,98,125,24,53,139,52,0,0         // vbroadcastss  0x348b(%rip),%ymm14        # 48f0 <_sk_callback_hsw+0x1fb>
+  .byte  196,98,125,24,53,140,52,0,0         // vbroadcastss  0x348c(%rip),%ymm14        # 48e8 <_sk_callback_hsw+0x1fb>
   .byte  196,66,53,168,238                   // vfmadd213ps   %ymm14,%ymm9,%ymm13
-  .byte  196,98,125,24,61,129,52,0,0         // vbroadcastss  0x3481(%rip),%ymm15        # 48f4 <_sk_callback_hsw+0x1ff>
+  .byte  196,98,125,24,61,130,52,0,0         // vbroadcastss  0x3482(%rip),%ymm15        # 48ec <_sk_callback_hsw+0x1ff>
   .byte  196,65,52,88,207                    // vaddps        %ymm15,%ymm9,%ymm9
   .byte  196,65,124,83,201                   // vrcpps        %ymm9,%ymm9
   .byte  196,65,20,89,201                    // vmulps        %ymm9,%ymm13,%ymm9
-  .byte  196,98,125,24,45,109,52,0,0         // vbroadcastss  0x346d(%rip),%ymm13        # 48f8 <_sk_callback_hsw+0x203>
+  .byte  196,98,125,24,45,110,52,0,0         // vbroadcastss  0x346e(%rip),%ymm13        # 48f0 <_sk_callback_hsw+0x203>
   .byte  196,193,124,194,197,1               // vcmpltps      %ymm13,%ymm0,%ymm0
   .byte  196,195,53,74,194,0                 // vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   .byte  197,124,82,201                      // vrsqrtps      %ymm1,%ymm9
@@ -10128,26 +10122,26 @@
   .byte  197,124,93,201                      // vminps        %ymm1,%ymm0,%ymm9
   .byte  197,52,93,202                       // vminps        %ymm2,%ymm9,%ymm9
   .byte  196,65,60,92,209                    // vsubps        %ymm9,%ymm8,%ymm10
-  .byte  196,98,125,24,29,226,51,0,0         // vbroadcastss  0x33e2(%rip),%ymm11        # 48fc <_sk_callback_hsw+0x207>
+  .byte  196,98,125,24,29,227,51,0,0         // vbroadcastss  0x33e3(%rip),%ymm11        # 48f4 <_sk_callback_hsw+0x207>
   .byte  196,65,36,94,218                    // vdivps        %ymm10,%ymm11,%ymm11
   .byte  197,116,92,226                      // vsubps        %ymm2,%ymm1,%ymm12
   .byte  197,116,194,234,1                   // vcmpltps      %ymm2,%ymm1,%ymm13
-  .byte  196,98,125,24,53,207,51,0,0         // vbroadcastss  0x33cf(%rip),%ymm14        # 4900 <_sk_callback_hsw+0x20b>
+  .byte  196,98,125,24,53,208,51,0,0         // vbroadcastss  0x33d0(%rip),%ymm14        # 48f8 <_sk_callback_hsw+0x20b>
   .byte  196,65,4,87,255                     // vxorps        %ymm15,%ymm15,%ymm15
   .byte  196,67,5,74,238,208                 // vblendvps     %ymm13,%ymm14,%ymm15,%ymm13
   .byte  196,66,37,168,229                   // vfmadd213ps   %ymm13,%ymm11,%ymm12
   .byte  197,236,92,208                      // vsubps        %ymm0,%ymm2,%ymm2
   .byte  197,124,92,233                      // vsubps        %ymm1,%ymm0,%ymm13
-  .byte  196,98,125,24,53,182,51,0,0         // vbroadcastss  0x33b6(%rip),%ymm14        # 4908 <_sk_callback_hsw+0x213>
+  .byte  196,98,125,24,53,183,51,0,0         // vbroadcastss  0x33b7(%rip),%ymm14        # 4900 <_sk_callback_hsw+0x213>
   .byte  196,66,37,168,238                   // vfmadd213ps   %ymm14,%ymm11,%ymm13
-  .byte  196,98,125,24,53,164,51,0,0         // vbroadcastss  0x33a4(%rip),%ymm14        # 4904 <_sk_callback_hsw+0x20f>
+  .byte  196,98,125,24,53,165,51,0,0         // vbroadcastss  0x33a5(%rip),%ymm14        # 48fc <_sk_callback_hsw+0x20f>
   .byte  196,194,37,168,214                  // vfmadd213ps   %ymm14,%ymm11,%ymm2
   .byte  197,188,194,201,0                   // vcmpeqps      %ymm1,%ymm8,%ymm1
   .byte  196,227,21,74,202,16                // vblendvps     %ymm1,%ymm2,%ymm13,%ymm1
   .byte  197,188,194,192,0                   // vcmpeqps      %ymm0,%ymm8,%ymm0
   .byte  196,195,117,74,196,0                // vblendvps     %ymm0,%ymm12,%ymm1,%ymm0
   .byte  196,193,60,88,201                   // vaddps        %ymm9,%ymm8,%ymm1
-  .byte  196,98,125,24,29,135,51,0,0         // vbroadcastss  0x3387(%rip),%ymm11        # 4910 <_sk_callback_hsw+0x21b>
+  .byte  196,98,125,24,29,136,51,0,0         // vbroadcastss  0x3388(%rip),%ymm11        # 4908 <_sk_callback_hsw+0x21b>
   .byte  196,193,116,89,211                  // vmulps        %ymm11,%ymm1,%ymm2
   .byte  197,36,194,218,1                    // vcmpltps      %ymm2,%ymm11,%ymm11
   .byte  196,65,12,92,224                    // vsubps        %ymm8,%ymm14,%ymm12
@@ -10157,7 +10151,7 @@
   .byte  197,172,94,201                      // vdivps        %ymm1,%ymm10,%ymm1
   .byte  196,195,125,74,199,128              // vblendvps     %ymm8,%ymm15,%ymm0,%ymm0
   .byte  196,195,117,74,207,128              // vblendvps     %ymm8,%ymm15,%ymm1,%ymm1
-  .byte  196,98,125,24,5,74,51,0,0           // vbroadcastss  0x334a(%rip),%ymm8        # 490c <_sk_callback_hsw+0x217>
+  .byte  196,98,125,24,5,75,51,0,0           // vbroadcastss  0x334b(%rip),%ymm8        # 4904 <_sk_callback_hsw+0x217>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -10174,30 +10168,30 @@
   .byte  197,252,17,92,36,128                // vmovups       %ymm3,-0x80(%rsp)
   .byte  197,252,40,233                      // vmovaps       %ymm1,%ymm5
   .byte  197,252,40,224                      // vmovaps       %ymm0,%ymm4
-  .byte  196,98,125,24,5,23,51,0,0           // vbroadcastss  0x3317(%rip),%ymm8        # 4914 <_sk_callback_hsw+0x21f>
+  .byte  196,98,125,24,5,24,51,0,0           // vbroadcastss  0x3318(%rip),%ymm8        # 490c <_sk_callback_hsw+0x21f>
   .byte  197,60,194,202,2                    // vcmpleps      %ymm2,%ymm8,%ymm9
   .byte  197,84,89,210                       // vmulps        %ymm2,%ymm5,%ymm10
   .byte  196,65,84,92,218                    // vsubps        %ymm10,%ymm5,%ymm11
   .byte  196,67,45,74,203,144                // vblendvps     %ymm9,%ymm11,%ymm10,%ymm9
   .byte  197,52,88,210                       // vaddps        %ymm2,%ymm9,%ymm10
-  .byte  196,98,125,24,13,250,50,0,0         // vbroadcastss  0x32fa(%rip),%ymm9        # 4918 <_sk_callback_hsw+0x223>
+  .byte  196,98,125,24,13,251,50,0,0         // vbroadcastss  0x32fb(%rip),%ymm9        # 4910 <_sk_callback_hsw+0x223>
   .byte  196,66,109,170,202                  // vfmsub213ps   %ymm10,%ymm2,%ymm9
-  .byte  196,98,125,24,29,240,50,0,0         // vbroadcastss  0x32f0(%rip),%ymm11        # 491c <_sk_callback_hsw+0x227>
+  .byte  196,98,125,24,29,241,50,0,0         // vbroadcastss  0x32f1(%rip),%ymm11        # 4914 <_sk_callback_hsw+0x227>
   .byte  196,65,92,88,219                    // vaddps        %ymm11,%ymm4,%ymm11
   .byte  196,67,125,8,227,1                  // vroundps      $0x1,%ymm11,%ymm12
   .byte  196,65,36,92,252                    // vsubps        %ymm12,%ymm11,%ymm15
   .byte  196,65,44,92,217                    // vsubps        %ymm9,%ymm10,%ymm11
-  .byte  196,98,125,24,45,218,50,0,0         // vbroadcastss  0x32da(%rip),%ymm13        # 4924 <_sk_callback_hsw+0x22f>
+  .byte  196,98,125,24,45,219,50,0,0         // vbroadcastss  0x32db(%rip),%ymm13        # 491c <_sk_callback_hsw+0x22f>
   .byte  196,193,4,89,197                    // vmulps        %ymm13,%ymm15,%ymm0
-  .byte  196,98,125,24,53,208,50,0,0         // vbroadcastss  0x32d0(%rip),%ymm14        # 4928 <_sk_callback_hsw+0x233>
+  .byte  196,98,125,24,53,209,50,0,0         // vbroadcastss  0x32d1(%rip),%ymm14        # 4920 <_sk_callback_hsw+0x233>
   .byte  197,12,92,224                       // vsubps        %ymm0,%ymm14,%ymm12
   .byte  196,66,37,168,225                   // vfmadd213ps   %ymm9,%ymm11,%ymm12
-  .byte  196,226,125,24,29,182,50,0,0        // vbroadcastss  0x32b6(%rip),%ymm3        # 4920 <_sk_callback_hsw+0x22b>
+  .byte  196,226,125,24,29,183,50,0,0        // vbroadcastss  0x32b7(%rip),%ymm3        # 4918 <_sk_callback_hsw+0x22b>
   .byte  196,193,100,194,255,2               // vcmpleps      %ymm15,%ymm3,%ymm7
   .byte  196,195,29,74,249,112               // vblendvps     %ymm7,%ymm9,%ymm12,%ymm7
   .byte  196,65,60,194,231,2                 // vcmpleps      %ymm15,%ymm8,%ymm12
   .byte  196,227,45,74,255,192               // vblendvps     %ymm12,%ymm7,%ymm10,%ymm7
-  .byte  196,98,125,24,37,161,50,0,0         // vbroadcastss  0x32a1(%rip),%ymm12        # 492c <_sk_callback_hsw+0x237>
+  .byte  196,98,125,24,37,162,50,0,0         // vbroadcastss  0x32a2(%rip),%ymm12        # 4924 <_sk_callback_hsw+0x237>
   .byte  196,65,28,194,255,2                 // vcmpleps      %ymm15,%ymm12,%ymm15
   .byte  196,194,37,168,193                  // vfmadd213ps   %ymm9,%ymm11,%ymm0
   .byte  196,99,125,74,255,240               // vblendvps     %ymm15,%ymm7,%ymm0,%ymm15
@@ -10213,7 +10207,7 @@
   .byte  197,156,194,192,2                   // vcmpleps      %ymm0,%ymm12,%ymm0
   .byte  196,194,37,168,249                  // vfmadd213ps   %ymm9,%ymm11,%ymm7
   .byte  196,227,69,74,201,0                 // vblendvps     %ymm0,%ymm1,%ymm7,%ymm1
-  .byte  196,226,125,24,5,77,50,0,0          // vbroadcastss  0x324d(%rip),%ymm0        # 4930 <_sk_callback_hsw+0x23b>
+  .byte  196,226,125,24,5,78,50,0,0          // vbroadcastss  0x324e(%rip),%ymm0        # 4928 <_sk_callback_hsw+0x23b>
   .byte  197,220,88,192                      // vaddps        %ymm0,%ymm4,%ymm0
   .byte  196,227,125,8,224,1                 // vroundps      $0x1,%ymm0,%ymm4
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
@@ -10263,11 +10257,11 @@
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  72,1,248                            // add           %rdi,%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,51                              // jne           17c3 <_sk_scale_u8_hsw+0x43>
+  .byte  117,51                              // jne           17ba <_sk_scale_u8_hsw+0x43>
   .byte  197,122,126,0                       // vmovq         (%rax),%xmm8
   .byte  196,66,125,49,192                   // vpmovzxbd     %xmm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,141,49,0,0         // vbroadcastss  0x318d(%rip),%ymm9        # 4934 <_sk_callback_hsw+0x23f>
+  .byte  196,98,125,24,13,142,49,0,0         // vbroadcastss  0x318e(%rip),%ymm9        # 492c <_sk_callback_hsw+0x23f>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
@@ -10285,9 +10279,9 @@
   .byte  77,9,217                            // or            %r11,%r9
   .byte  72,131,193,8                        // add           $0x8,%rcx
   .byte  73,255,202                          // dec           %r10
-  .byte  117,234                             // jne           17cb <_sk_scale_u8_hsw+0x4b>
+  .byte  117,234                             // jne           17c2 <_sk_scale_u8_hsw+0x4b>
   .byte  196,65,249,110,193                  // vmovq         %r9,%xmm8
-  .byte  235,172                             // jmp           1794 <_sk_scale_u8_hsw+0x14>
+  .byte  235,172                             // jmp           178b <_sk_scale_u8_hsw+0x14>
 
 HIDDEN _sk_lerp_1_float_hsw
 .globl _sk_lerp_1_float_hsw
@@ -10315,11 +10309,11 @@
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  72,1,248                            // add           %rdi,%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,71                              // jne           186e <_sk_lerp_u8_hsw+0x57>
+  .byte  117,71                              // jne           1865 <_sk_lerp_u8_hsw+0x57>
   .byte  197,122,126,0                       // vmovq         (%rax),%xmm8
   .byte  196,66,125,49,192                   // vpmovzxbd     %xmm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,250,48,0,0         // vbroadcastss  0x30fa(%rip),%ymm9        # 4938 <_sk_callback_hsw+0x243>
+  .byte  196,98,125,24,13,251,48,0,0         // vbroadcastss  0x30fb(%rip),%ymm9        # 4930 <_sk_callback_hsw+0x243>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
   .byte  196,226,61,168,196                  // vfmadd213ps   %ymm4,%ymm8,%ymm0
@@ -10341,9 +10335,9 @@
   .byte  77,9,217                            // or            %r11,%r9
   .byte  72,131,193,8                        // add           $0x8,%rcx
   .byte  73,255,202                          // dec           %r10
-  .byte  117,234                             // jne           1876 <_sk_lerp_u8_hsw+0x5f>
+  .byte  117,234                             // jne           186d <_sk_lerp_u8_hsw+0x5f>
   .byte  196,65,249,110,193                  // vmovq         %r9,%xmm8
-  .byte  235,152                             // jmp           182b <_sk_lerp_u8_hsw+0x14>
+  .byte  235,152                             // jmp           1822 <_sk_lerp_u8_hsw+0x14>
 
 HIDDEN _sk_lerp_565_hsw
 .globl _sk_lerp_565_hsw
@@ -10352,23 +10346,23 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,169,0,0,0                    // jne           194a <_sk_lerp_565_hsw+0xb7>
+  .byte  15,133,169,0,0,0                    // jne           1941 <_sk_lerp_565_hsw+0xb7>
   .byte  196,65,122,111,4,122                // vmovdqu       (%r10,%rdi,2),%xmm8
   .byte  196,66,125,51,192                   // vpmovzxwd     %xmm8,%ymm8
-  .byte  196,98,125,88,13,135,48,0,0         // vpbroadcastd  0x3087(%rip),%ymm9        # 493c <_sk_callback_hsw+0x247>
+  .byte  196,98,125,88,13,136,48,0,0         // vpbroadcastd  0x3088(%rip),%ymm9        # 4934 <_sk_callback_hsw+0x247>
   .byte  196,65,61,219,201                   // vpand         %ymm9,%ymm8,%ymm9
   .byte  196,65,124,91,201                   // vcvtdq2ps     %ymm9,%ymm9
-  .byte  196,98,125,24,21,120,48,0,0         // vbroadcastss  0x3078(%rip),%ymm10        # 4940 <_sk_callback_hsw+0x24b>
+  .byte  196,98,125,24,21,121,48,0,0         // vbroadcastss  0x3079(%rip),%ymm10        # 4938 <_sk_callback_hsw+0x24b>
   .byte  196,65,52,89,202                    // vmulps        %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,88,21,110,48,0,0         // vpbroadcastd  0x306e(%rip),%ymm10        # 4944 <_sk_callback_hsw+0x24f>
+  .byte  196,98,125,88,21,111,48,0,0         // vpbroadcastd  0x306f(%rip),%ymm10        # 493c <_sk_callback_hsw+0x24f>
   .byte  196,65,61,219,210                   // vpand         %ymm10,%ymm8,%ymm10
   .byte  196,65,124,91,210                   // vcvtdq2ps     %ymm10,%ymm10
-  .byte  196,98,125,24,29,95,48,0,0          // vbroadcastss  0x305f(%rip),%ymm11        # 4948 <_sk_callback_hsw+0x253>
+  .byte  196,98,125,24,29,96,48,0,0          // vbroadcastss  0x3060(%rip),%ymm11        # 4940 <_sk_callback_hsw+0x253>
   .byte  196,65,44,89,211                    // vmulps        %ymm11,%ymm10,%ymm10
-  .byte  196,98,125,88,29,85,48,0,0          // vpbroadcastd  0x3055(%rip),%ymm11        # 494c <_sk_callback_hsw+0x257>
+  .byte  196,98,125,88,29,86,48,0,0          // vpbroadcastd  0x3056(%rip),%ymm11        # 4944 <_sk_callback_hsw+0x257>
   .byte  196,65,61,219,195                   // vpand         %ymm11,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,29,70,48,0,0          // vbroadcastss  0x3046(%rip),%ymm11        # 4950 <_sk_callback_hsw+0x25b>
+  .byte  196,98,125,24,29,71,48,0,0          // vbroadcastss  0x3047(%rip),%ymm11        # 4948 <_sk_callback_hsw+0x25b>
   .byte  196,65,60,89,195                    // vmulps        %ymm11,%ymm8,%ymm8
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
   .byte  196,226,53,168,196                  // vfmadd213ps   %ymm4,%ymm9,%ymm0
@@ -10389,9 +10383,9 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  15,135,68,255,255,255               // ja            18a7 <_sk_lerp_565_hsw+0x14>
+  .byte  15,135,68,255,255,255               // ja            189e <_sk_lerp_565_hsw+0x14>
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,74,0,0,0                  // lea           0x4a(%rip),%r9        # 19b8 <_sk_lerp_565_hsw+0x125>
+  .byte  76,141,13,75,0,0,0                  // lea           0x4b(%rip),%r9        # 19b0 <_sk_lerp_565_hsw+0x126>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -10403,28 +10397,27 @@
   .byte  196,65,57,196,68,122,4,2            // vpinsrw       $0x2,0x4(%r10,%rdi,2),%xmm8,%xmm8
   .byte  196,65,57,196,68,122,2,1            // vpinsrw       $0x1,0x2(%r10,%rdi,2),%xmm8,%xmm8
   .byte  196,65,57,196,4,122,0               // vpinsrw       $0x0,(%r10,%rdi,2),%xmm8,%xmm8
-  .byte  233,239,254,255,255                 // jmpq          18a7 <_sk_lerp_565_hsw+0x14>
-  .byte  244                                 // hlt
+  .byte  233,239,254,255,255                 // jmpq          189e <_sk_lerp_565_hsw+0x14>
+  .byte  144                                 // nop
+  .byte  243,255                             // repz          (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  235,255                             // jmp           19b5 <_sk_lerp_565_hsw+0x12b>
+  .byte  255                                 // (bad)
+  .byte  255,227                             // jmpq          *%rbx
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  236                                 // in            (%dx),%al
+  .byte  219,255                             // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,211                             // callq         *%rbx
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,228                             // jmpq          *%rsp
+  .byte  255,203                             // dec           %ebx
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  220,255                             // fdivr         %st,%st(7)
-  .byte  255                                 // (bad)
-  .byte  255,212                             // callq         *%rsp
-  .byte  255                                 // (bad)
-  .byte  255                                 // (bad)
-  .byte  255,204                             // dec           %esp
-  .byte  255                                 // (bad)
-  .byte  255                                 // (bad)
-  .byte  255                                 // (bad)
-  .byte  191                                 // .byte         0xbf
+  .byte  190                                 // .byte         0xbe
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // .byte         0xff
@@ -10438,23 +10431,23 @@
   .byte  76,141,12,189,0,0,0,0               // lea           0x0(,%rdi,4),%r9
   .byte  76,3,8                              // add           (%rax),%r9
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,105                             // jne           1a52 <_sk_load_tables_hsw+0x7e>
+  .byte  117,105                             // jne           1a4a <_sk_load_tables_hsw+0x7e>
   .byte  196,193,126,111,25                  // vmovdqu       (%r9),%ymm3
-  .byte  197,229,219,13,10,50,0,0            // vpand         0x320a(%rip),%ymm3,%ymm1        # 4c00 <_sk_callback_hsw+0x50b>
+  .byte  197,229,219,13,18,50,0,0            // vpand         0x3212(%rip),%ymm3,%ymm1        # 4c00 <_sk_callback_hsw+0x513>
   .byte  196,65,61,118,192                   // vpcmpeqd      %ymm8,%ymm8,%ymm8
   .byte  72,139,72,8                         // mov           0x8(%rax),%rcx
   .byte  76,139,72,16                        // mov           0x10(%rax),%r9
   .byte  197,237,118,210                     // vpcmpeqd      %ymm2,%ymm2,%ymm2
   .byte  196,226,109,146,4,137               // vgatherdps    %ymm2,(%rcx,%ymm1,4),%ymm0
-  .byte  196,226,101,0,21,10,50,0,0          // vpshufb       0x320a(%rip),%ymm3,%ymm2        # 4c20 <_sk_callback_hsw+0x52b>
+  .byte  196,226,101,0,21,18,50,0,0          // vpshufb       0x3212(%rip),%ymm3,%ymm2        # 4c20 <_sk_callback_hsw+0x533>
   .byte  196,65,53,118,201                   // vpcmpeqd      %ymm9,%ymm9,%ymm9
   .byte  196,194,53,146,12,145               // vgatherdps    %ymm9,(%r9,%ymm2,4),%ymm1
   .byte  72,139,64,24                        // mov           0x18(%rax),%rax
-  .byte  196,98,101,0,13,18,50,0,0           // vpshufb       0x3212(%rip),%ymm3,%ymm9        # 4c40 <_sk_callback_hsw+0x54b>
+  .byte  196,98,101,0,13,26,50,0,0           // vpshufb       0x321a(%rip),%ymm3,%ymm9        # 4c40 <_sk_callback_hsw+0x553>
   .byte  196,162,61,146,20,136               // vgatherdps    %ymm8,(%rax,%ymm9,4),%ymm2
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,14,47,0,0           // vbroadcastss  0x2f0e(%rip),%ymm8        # 4954 <_sk_callback_hsw+0x25f>
+  .byte  196,98,125,24,5,14,47,0,0           // vbroadcastss  0x2f0e(%rip),%ymm8        # 494c <_sk_callback_hsw+0x25f>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,193                          // mov           %r8,%rcx
@@ -10467,7 +10460,7 @@
   .byte  196,193,249,110,194                 // vmovq         %r10,%xmm0
   .byte  196,226,125,33,192                  // vpmovsxbd     %xmm0,%ymm0
   .byte  196,194,125,140,25                  // vpmaskmovd    (%r9),%ymm0,%ymm3
-  .byte  233,115,255,255,255                 // jmpq          19ee <_sk_load_tables_hsw+0x1a>
+  .byte  233,115,255,255,255                 // jmpq          19e6 <_sk_load_tables_hsw+0x1a>
 
 HIDDEN _sk_load_tables_u16_be_hsw
 .globl _sk_load_tables_u16_be_hsw
@@ -10477,7 +10470,7 @@
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  76,141,12,189,0,0,0,0               // lea           0x0(,%rdi,4),%r9
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,201,0,0,0                    // jne           1b5a <_sk_load_tables_u16_be_hsw+0xdf>
+  .byte  15,133,201,0,0,0                    // jne           1b52 <_sk_load_tables_u16_be_hsw+0xdf>
   .byte  196,1,121,16,4,72                   // vmovupd       (%r8,%r9,2),%xmm8
   .byte  196,129,121,16,84,72,16             // vmovupd       0x10(%r8,%r9,2),%xmm2
   .byte  196,129,121,16,92,72,32             // vmovupd       0x20(%r8,%r9,2),%xmm3
@@ -10493,7 +10486,7 @@
   .byte  197,185,108,200                     // vpunpcklqdq   %xmm0,%xmm8,%xmm1
   .byte  197,185,109,208                     // vpunpckhqdq   %xmm0,%xmm8,%xmm2
   .byte  197,49,108,195                      // vpunpcklqdq   %xmm3,%xmm9,%xmm8
-  .byte  197,121,111,21,158,50,0,0           // vmovdqa       0x329e(%rip),%xmm10        # 4d80 <_sk_callback_hsw+0x68b>
+  .byte  197,121,111,21,166,50,0,0           // vmovdqa       0x32a6(%rip),%xmm10        # 4d80 <_sk_callback_hsw+0x693>
   .byte  196,193,113,219,194                 // vpand         %xmm10,%xmm1,%xmm0
   .byte  196,226,125,51,200                  // vpmovzxwd     %xmm0,%ymm1
   .byte  196,65,37,118,219                   // vpcmpeqd      %ymm11,%ymm11,%ymm11
@@ -10515,36 +10508,36 @@
   .byte  197,185,235,219                     // vpor          %xmm3,%xmm8,%xmm3
   .byte  196,226,125,51,219                  // vpmovzxwd     %xmm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,7,46,0,0            // vbroadcastss  0x2e07(%rip),%ymm8        # 4958 <_sk_callback_hsw+0x263>
+  .byte  196,98,125,24,5,7,46,0,0            // vbroadcastss  0x2e07(%rip),%ymm8        # 4950 <_sk_callback_hsw+0x263>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,1,123,16,4,72                   // vmovsd        (%r8,%r9,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  116,85                              // je            1bc0 <_sk_load_tables_u16_be_hsw+0x145>
+  .byte  116,85                              // je            1bb8 <_sk_load_tables_u16_be_hsw+0x145>
   .byte  196,1,57,22,68,72,8                 // vmovhpd       0x8(%r8,%r9,2),%xmm8,%xmm8
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,72                              // jb            1bc0 <_sk_load_tables_u16_be_hsw+0x145>
+  .byte  114,72                              // jb            1bb8 <_sk_load_tables_u16_be_hsw+0x145>
   .byte  196,129,123,16,84,72,16             // vmovsd        0x10(%r8,%r9,2),%xmm2
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  116,72                              // je            1bcd <_sk_load_tables_u16_be_hsw+0x152>
+  .byte  116,72                              // je            1bc5 <_sk_load_tables_u16_be_hsw+0x152>
   .byte  196,129,105,22,84,72,24             // vmovhpd       0x18(%r8,%r9,2),%xmm2,%xmm2
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,59                              // jb            1bcd <_sk_load_tables_u16_be_hsw+0x152>
+  .byte  114,59                              // jb            1bc5 <_sk_load_tables_u16_be_hsw+0x152>
   .byte  196,129,123,16,92,72,32             // vmovsd        0x20(%r8,%r9,2),%xmm3
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  15,132,9,255,255,255                // je            1aac <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  15,132,9,255,255,255                // je            1aa4 <_sk_load_tables_u16_be_hsw+0x31>
   .byte  196,129,97,22,92,72,40              // vmovhpd       0x28(%r8,%r9,2),%xmm3,%xmm3
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  15,130,248,254,255,255              // jb            1aac <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  15,130,248,254,255,255              // jb            1aa4 <_sk_load_tables_u16_be_hsw+0x31>
   .byte  196,1,122,126,76,72,48              // vmovq         0x30(%r8,%r9,2),%xmm9
-  .byte  233,236,254,255,255                 // jmpq          1aac <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  233,236,254,255,255                 // jmpq          1aa4 <_sk_load_tables_u16_be_hsw+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,223,254,255,255                 // jmpq          1aac <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  233,223,254,255,255                 // jmpq          1aa4 <_sk_load_tables_u16_be_hsw+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,214,254,255,255                 // jmpq          1aac <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  233,214,254,255,255                 // jmpq          1aa4 <_sk_load_tables_u16_be_hsw+0x31>
 
 HIDDEN _sk_load_tables_rgb_u16_be_hsw
 .globl _sk_load_tables_rgb_u16_be_hsw
@@ -10554,7 +10547,7 @@
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  76,141,12,127                       // lea           (%rdi,%rdi,2),%r9
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,193,0,0,0                    // jne           1ca9 <_sk_load_tables_rgb_u16_be_hsw+0xd3>
+  .byte  15,133,193,0,0,0                    // jne           1ca1 <_sk_load_tables_rgb_u16_be_hsw+0xd3>
   .byte  196,129,122,111,4,72                // vmovdqu       (%r8,%r9,2),%xmm0
   .byte  196,129,122,111,84,72,12            // vmovdqu       0xc(%r8,%r9,2),%xmm2
   .byte  196,129,122,111,76,72,24            // vmovdqu       0x18(%r8,%r9,2),%xmm1
@@ -10575,7 +10568,7 @@
   .byte  197,185,108,218                     // vpunpcklqdq   %xmm2,%xmm8,%xmm3
   .byte  197,185,109,210                     // vpunpckhqdq   %xmm2,%xmm8,%xmm2
   .byte  197,121,108,193                     // vpunpcklqdq   %xmm1,%xmm0,%xmm8
-  .byte  197,121,111,13,62,49,0,0            // vmovdqa       0x313e(%rip),%xmm9        # 4d90 <_sk_callback_hsw+0x69b>
+  .byte  197,121,111,13,70,49,0,0            // vmovdqa       0x3146(%rip),%xmm9        # 4d90 <_sk_callback_hsw+0x6a3>
   .byte  196,193,97,219,193                  // vpand         %xmm9,%xmm3,%xmm0
   .byte  196,226,125,51,200                  // vpmovzxwd     %xmm0,%ymm1
   .byte  197,229,118,219                     // vpcmpeqd      %ymm3,%ymm3,%ymm3
@@ -10592,41 +10585,41 @@
   .byte  196,98,125,51,194                   // vpmovzxwd     %xmm2,%ymm8
   .byte  196,162,101,146,20,128              // vgatherdps    %ymm3,(%rax,%ymm8,4),%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,181,44,0,0        // vbroadcastss  0x2cb5(%rip),%ymm3        # 495c <_sk_callback_hsw+0x267>
+  .byte  196,226,125,24,29,181,44,0,0        // vbroadcastss  0x2cb5(%rip),%ymm3        # 4954 <_sk_callback_hsw+0x267>
   .byte  255,224                             // jmpq          *%rax
   .byte  196,129,121,110,4,72                // vmovd         (%r8,%r9,2),%xmm0
   .byte  196,129,121,196,68,72,4,2           // vpinsrw       $0x2,0x4(%r8,%r9,2),%xmm0,%xmm0
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  117,5                               // jne           1cc2 <_sk_load_tables_rgb_u16_be_hsw+0xec>
-  .byte  233,90,255,255,255                  // jmpq          1c1c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  117,5                               // jne           1cba <_sk_load_tables_rgb_u16_be_hsw+0xec>
+  .byte  233,90,255,255,255                  // jmpq          1c14 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   .byte  196,129,121,110,76,72,6             // vmovd         0x6(%r8,%r9,2),%xmm1
   .byte  196,1,113,196,68,72,10,2            // vpinsrw       $0x2,0xa(%r8,%r9,2),%xmm1,%xmm8
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,26                              // jb            1cf1 <_sk_load_tables_rgb_u16_be_hsw+0x11b>
+  .byte  114,26                              // jb            1ce9 <_sk_load_tables_rgb_u16_be_hsw+0x11b>
   .byte  196,129,121,110,76,72,12            // vmovd         0xc(%r8,%r9,2),%xmm1
   .byte  196,129,113,196,84,72,16,2          // vpinsrw       $0x2,0x10(%r8,%r9,2),%xmm1,%xmm2
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  117,10                              // jne           1cf6 <_sk_load_tables_rgb_u16_be_hsw+0x120>
-  .byte  233,43,255,255,255                  // jmpq          1c1c <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  .byte  233,38,255,255,255                  // jmpq          1c1c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  117,10                              // jne           1cee <_sk_load_tables_rgb_u16_be_hsw+0x120>
+  .byte  233,43,255,255,255                  // jmpq          1c14 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  233,38,255,255,255                  // jmpq          1c14 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   .byte  196,129,121,110,76,72,18            // vmovd         0x12(%r8,%r9,2),%xmm1
   .byte  196,1,113,196,76,72,22,2            // vpinsrw       $0x2,0x16(%r8,%r9,2),%xmm1,%xmm9
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,26                              // jb            1d25 <_sk_load_tables_rgb_u16_be_hsw+0x14f>
+  .byte  114,26                              // jb            1d1d <_sk_load_tables_rgb_u16_be_hsw+0x14f>
   .byte  196,129,121,110,76,72,24            // vmovd         0x18(%r8,%r9,2),%xmm1
   .byte  196,129,113,196,76,72,28,2          // vpinsrw       $0x2,0x1c(%r8,%r9,2),%xmm1,%xmm1
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  117,10                              // jne           1d2a <_sk_load_tables_rgb_u16_be_hsw+0x154>
-  .byte  233,247,254,255,255                 // jmpq          1c1c <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  .byte  233,242,254,255,255                 // jmpq          1c1c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  117,10                              // jne           1d22 <_sk_load_tables_rgb_u16_be_hsw+0x154>
+  .byte  233,247,254,255,255                 // jmpq          1c14 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  233,242,254,255,255                 // jmpq          1c14 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   .byte  196,129,121,110,92,72,30            // vmovd         0x1e(%r8,%r9,2),%xmm3
   .byte  196,1,97,196,92,72,34,2             // vpinsrw       $0x2,0x22(%r8,%r9,2),%xmm3,%xmm11
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  114,20                              // jb            1d53 <_sk_load_tables_rgb_u16_be_hsw+0x17d>
+  .byte  114,20                              // jb            1d4b <_sk_load_tables_rgb_u16_be_hsw+0x17d>
   .byte  196,129,121,110,92,72,36            // vmovd         0x24(%r8,%r9,2),%xmm3
   .byte  196,129,97,196,92,72,40,2           // vpinsrw       $0x2,0x28(%r8,%r9,2),%xmm3,%xmm3
-  .byte  233,201,254,255,255                 // jmpq          1c1c <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  .byte  233,196,254,255,255                 // jmpq          1c1c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  233,201,254,255,255                 // jmpq          1c14 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  233,196,254,255,255                 // jmpq          1c14 <_sk_load_tables_rgb_u16_be_hsw+0x46>
 
 HIDDEN _sk_byte_tables_hsw
 .globl _sk_byte_tables_hsw
@@ -10639,7 +10632,7 @@
   .byte  65,84                               // push          %r12
   .byte  83                                  // push          %rbx
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,243,43,0,0          // vbroadcastss  0x2bf3(%rip),%ymm8        # 4960 <_sk_callback_hsw+0x26b>
+  .byte  196,98,125,24,5,243,43,0,0          // vbroadcastss  0x2bf3(%rip),%ymm8        # 4958 <_sk_callback_hsw+0x26b>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  197,253,91,192                      // vcvtps2dq     %ymm0,%ymm0
   .byte  196,195,249,22,192,1                // vpextrq       $0x1,%xmm0,%r8
@@ -10676,7 +10669,7 @@
   .byte  196,227,121,32,197,7                // vpinsrb       $0x7,%ebp,%xmm0,%xmm0
   .byte  196,226,125,49,192                  // vpmovzxbd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,13,68,43,0,0          // vbroadcastss  0x2b44(%rip),%ymm9        # 4964 <_sk_callback_hsw+0x26f>
+  .byte  196,98,125,24,13,68,43,0,0          // vbroadcastss  0x2b44(%rip),%ymm9        # 495c <_sk_callback_hsw+0x26f>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
   .byte  197,253,91,201                      // vcvtps2dq     %ymm1,%ymm1
@@ -10837,7 +10830,7 @@
   .byte  196,227,121,32,197,7                // vpinsrb       $0x7,%ebp,%xmm0,%xmm0
   .byte  196,226,125,49,192                  // vpmovzxbd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,13,125,40,0,0         // vbroadcastss  0x287d(%rip),%ymm9        # 4968 <_sk_callback_hsw+0x273>
+  .byte  196,98,125,24,13,125,40,0,0         // vbroadcastss  0x287d(%rip),%ymm9        # 4960 <_sk_callback_hsw+0x273>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
   .byte  197,253,91,201                      // vcvtps2dq     %ymm1,%ymm1
@@ -11000,33 +10993,33 @@
   .byte  196,66,125,168,211                  // vfmadd213ps   %ymm11,%ymm0,%ymm10
   .byte  196,226,125,24,0                    // vbroadcastss  (%rax),%ymm0
   .byte  196,65,124,91,218                   // vcvtdq2ps     %ymm10,%ymm11
-  .byte  196,98,125,24,37,48,38,0,0          // vbroadcastss  0x2630(%rip),%ymm12        # 496c <_sk_callback_hsw+0x277>
-  .byte  196,98,125,24,45,43,38,0,0          // vbroadcastss  0x262b(%rip),%ymm13        # 4970 <_sk_callback_hsw+0x27b>
+  .byte  196,98,125,24,37,48,38,0,0          // vbroadcastss  0x2630(%rip),%ymm12        # 4964 <_sk_callback_hsw+0x277>
+  .byte  196,98,125,24,45,43,38,0,0          // vbroadcastss  0x262b(%rip),%ymm13        # 4968 <_sk_callback_hsw+0x27b>
   .byte  196,65,44,84,213                    // vandps        %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,33,38,0,0          // vbroadcastss  0x2621(%rip),%ymm13        # 4974 <_sk_callback_hsw+0x27f>
+  .byte  196,98,125,24,45,33,38,0,0          // vbroadcastss  0x2621(%rip),%ymm13        # 496c <_sk_callback_hsw+0x27f>
   .byte  196,65,44,86,213                    // vorps         %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,23,38,0,0          // vbroadcastss  0x2617(%rip),%ymm13        # 4978 <_sk_callback_hsw+0x283>
+  .byte  196,98,125,24,45,23,38,0,0          // vbroadcastss  0x2617(%rip),%ymm13        # 4970 <_sk_callback_hsw+0x283>
   .byte  196,66,37,184,236                   // vfmadd231ps   %ymm12,%ymm11,%ymm13
-  .byte  196,98,125,24,29,13,38,0,0          // vbroadcastss  0x260d(%rip),%ymm11        # 497c <_sk_callback_hsw+0x287>
+  .byte  196,98,125,24,29,13,38,0,0          // vbroadcastss  0x260d(%rip),%ymm11        # 4974 <_sk_callback_hsw+0x287>
   .byte  196,66,45,172,221                   // vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  .byte  196,98,125,24,37,3,38,0,0           // vbroadcastss  0x2603(%rip),%ymm12        # 4980 <_sk_callback_hsw+0x28b>
+  .byte  196,98,125,24,37,3,38,0,0           // vbroadcastss  0x2603(%rip),%ymm12        # 4978 <_sk_callback_hsw+0x28b>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,249,37,0,0         // vbroadcastss  0x25f9(%rip),%ymm12        # 4984 <_sk_callback_hsw+0x28f>
+  .byte  196,98,125,24,37,249,37,0,0         // vbroadcastss  0x25f9(%rip),%ymm12        # 497c <_sk_callback_hsw+0x28f>
   .byte  196,65,28,94,210                    // vdivps        %ymm10,%ymm12,%ymm10
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  196,99,125,8,208,1                  // vroundps      $0x1,%ymm0,%ymm10
   .byte  196,65,124,92,210                   // vsubps        %ymm10,%ymm0,%ymm10
-  .byte  196,98,125,24,29,218,37,0,0         // vbroadcastss  0x25da(%rip),%ymm11        # 4988 <_sk_callback_hsw+0x293>
+  .byte  196,98,125,24,29,218,37,0,0         // vbroadcastss  0x25da(%rip),%ymm11        # 4980 <_sk_callback_hsw+0x293>
   .byte  196,193,124,88,195                  // vaddps        %ymm11,%ymm0,%ymm0
-  .byte  196,98,125,24,29,208,37,0,0         // vbroadcastss  0x25d0(%rip),%ymm11        # 498c <_sk_callback_hsw+0x297>
+  .byte  196,98,125,24,29,208,37,0,0         // vbroadcastss  0x25d0(%rip),%ymm11        # 4984 <_sk_callback_hsw+0x297>
   .byte  196,98,45,172,216                   // vfnmadd213ps  %ymm0,%ymm10,%ymm11
-  .byte  196,226,125,24,5,198,37,0,0         // vbroadcastss  0x25c6(%rip),%ymm0        # 4990 <_sk_callback_hsw+0x29b>
+  .byte  196,226,125,24,5,198,37,0,0         // vbroadcastss  0x25c6(%rip),%ymm0        # 4988 <_sk_callback_hsw+0x29b>
   .byte  196,193,124,92,194                  // vsubps        %ymm10,%ymm0,%ymm0
-  .byte  196,98,125,24,21,188,37,0,0         // vbroadcastss  0x25bc(%rip),%ymm10        # 4994 <_sk_callback_hsw+0x29f>
+  .byte  196,98,125,24,21,188,37,0,0         // vbroadcastss  0x25bc(%rip),%ymm10        # 498c <_sk_callback_hsw+0x29f>
   .byte  197,172,94,192                      // vdivps        %ymm0,%ymm10,%ymm0
   .byte  197,164,88,192                      // vaddps        %ymm0,%ymm11,%ymm0
-  .byte  196,98,125,24,21,175,37,0,0         // vbroadcastss  0x25af(%rip),%ymm10        # 4998 <_sk_callback_hsw+0x2a3>
+  .byte  196,98,125,24,21,175,37,0,0         // vbroadcastss  0x25af(%rip),%ymm10        # 4990 <_sk_callback_hsw+0x2a3>
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  197,253,91,192                      // vcvtps2dq     %ymm0,%ymm0
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -11034,7 +11027,7 @@
   .byte  196,195,125,74,193,128              // vblendvps     %ymm8,%ymm9,%ymm0,%ymm0
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,124,95,192                  // vmaxps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,134,37,0,0          // vbroadcastss  0x2586(%rip),%ymm8        # 499c <_sk_callback_hsw+0x2a7>
+  .byte  196,98,125,24,5,134,37,0,0          // vbroadcastss  0x2586(%rip),%ymm8        # 4994 <_sk_callback_hsw+0x2a7>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11054,33 +11047,33 @@
   .byte  196,66,117,168,211                  // vfmadd213ps   %ymm11,%ymm1,%ymm10
   .byte  196,226,125,24,8                    // vbroadcastss  (%rax),%ymm1
   .byte  196,65,124,91,218                   // vcvtdq2ps     %ymm10,%ymm11
-  .byte  196,98,125,24,37,62,37,0,0          // vbroadcastss  0x253e(%rip),%ymm12        # 49a0 <_sk_callback_hsw+0x2ab>
-  .byte  196,98,125,24,45,57,37,0,0          // vbroadcastss  0x2539(%rip),%ymm13        # 49a4 <_sk_callback_hsw+0x2af>
+  .byte  196,98,125,24,37,62,37,0,0          // vbroadcastss  0x253e(%rip),%ymm12        # 4998 <_sk_callback_hsw+0x2ab>
+  .byte  196,98,125,24,45,57,37,0,0          // vbroadcastss  0x2539(%rip),%ymm13        # 499c <_sk_callback_hsw+0x2af>
   .byte  196,65,44,84,213                    // vandps        %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,47,37,0,0          // vbroadcastss  0x252f(%rip),%ymm13        # 49a8 <_sk_callback_hsw+0x2b3>
+  .byte  196,98,125,24,45,47,37,0,0          // vbroadcastss  0x252f(%rip),%ymm13        # 49a0 <_sk_callback_hsw+0x2b3>
   .byte  196,65,44,86,213                    // vorps         %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,37,37,0,0          // vbroadcastss  0x2525(%rip),%ymm13        # 49ac <_sk_callback_hsw+0x2b7>
+  .byte  196,98,125,24,45,37,37,0,0          // vbroadcastss  0x2525(%rip),%ymm13        # 49a4 <_sk_callback_hsw+0x2b7>
   .byte  196,66,37,184,236                   // vfmadd231ps   %ymm12,%ymm11,%ymm13
-  .byte  196,98,125,24,29,27,37,0,0          // vbroadcastss  0x251b(%rip),%ymm11        # 49b0 <_sk_callback_hsw+0x2bb>
+  .byte  196,98,125,24,29,27,37,0,0          // vbroadcastss  0x251b(%rip),%ymm11        # 49a8 <_sk_callback_hsw+0x2bb>
   .byte  196,66,45,172,221                   // vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  .byte  196,98,125,24,37,17,37,0,0          // vbroadcastss  0x2511(%rip),%ymm12        # 49b4 <_sk_callback_hsw+0x2bf>
+  .byte  196,98,125,24,37,17,37,0,0          // vbroadcastss  0x2511(%rip),%ymm12        # 49ac <_sk_callback_hsw+0x2bf>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,7,37,0,0           // vbroadcastss  0x2507(%rip),%ymm12        # 49b8 <_sk_callback_hsw+0x2c3>
+  .byte  196,98,125,24,37,7,37,0,0           // vbroadcastss  0x2507(%rip),%ymm12        # 49b0 <_sk_callback_hsw+0x2c3>
   .byte  196,65,28,94,210                    // vdivps        %ymm10,%ymm12,%ymm10
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
   .byte  196,193,116,89,202                  // vmulps        %ymm10,%ymm1,%ymm1
   .byte  196,99,125,8,209,1                  // vroundps      $0x1,%ymm1,%ymm10
   .byte  196,65,116,92,210                   // vsubps        %ymm10,%ymm1,%ymm10
-  .byte  196,98,125,24,29,232,36,0,0         // vbroadcastss  0x24e8(%rip),%ymm11        # 49bc <_sk_callback_hsw+0x2c7>
+  .byte  196,98,125,24,29,232,36,0,0         // vbroadcastss  0x24e8(%rip),%ymm11        # 49b4 <_sk_callback_hsw+0x2c7>
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,222,36,0,0         // vbroadcastss  0x24de(%rip),%ymm11        # 49c0 <_sk_callback_hsw+0x2cb>
+  .byte  196,98,125,24,29,222,36,0,0         // vbroadcastss  0x24de(%rip),%ymm11        # 49b8 <_sk_callback_hsw+0x2cb>
   .byte  196,98,45,172,217                   // vfnmadd213ps  %ymm1,%ymm10,%ymm11
-  .byte  196,226,125,24,13,212,36,0,0        // vbroadcastss  0x24d4(%rip),%ymm1        # 49c4 <_sk_callback_hsw+0x2cf>
+  .byte  196,226,125,24,13,212,36,0,0        // vbroadcastss  0x24d4(%rip),%ymm1        # 49bc <_sk_callback_hsw+0x2cf>
   .byte  196,193,116,92,202                  // vsubps        %ymm10,%ymm1,%ymm1
-  .byte  196,98,125,24,21,202,36,0,0         // vbroadcastss  0x24ca(%rip),%ymm10        # 49c8 <_sk_callback_hsw+0x2d3>
+  .byte  196,98,125,24,21,202,36,0,0         // vbroadcastss  0x24ca(%rip),%ymm10        # 49c0 <_sk_callback_hsw+0x2d3>
   .byte  197,172,94,201                      // vdivps        %ymm1,%ymm10,%ymm1
   .byte  197,164,88,201                      // vaddps        %ymm1,%ymm11,%ymm1
-  .byte  196,98,125,24,21,189,36,0,0         // vbroadcastss  0x24bd(%rip),%ymm10        # 49cc <_sk_callback_hsw+0x2d7>
+  .byte  196,98,125,24,21,189,36,0,0         // vbroadcastss  0x24bd(%rip),%ymm10        # 49c4 <_sk_callback_hsw+0x2d7>
   .byte  196,193,116,89,202                  // vmulps        %ymm10,%ymm1,%ymm1
   .byte  197,253,91,201                      // vcvtps2dq     %ymm1,%ymm1
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -11088,7 +11081,7 @@
   .byte  196,195,117,74,201,128              // vblendvps     %ymm8,%ymm9,%ymm1,%ymm1
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,116,95,200                  // vmaxps        %ymm8,%ymm1,%ymm1
-  .byte  196,98,125,24,5,148,36,0,0          // vbroadcastss  0x2494(%rip),%ymm8        # 49d0 <_sk_callback_hsw+0x2db>
+  .byte  196,98,125,24,5,148,36,0,0          // vbroadcastss  0x2494(%rip),%ymm8        # 49c8 <_sk_callback_hsw+0x2db>
   .byte  196,193,116,93,200                  // vminps        %ymm8,%ymm1,%ymm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11108,33 +11101,33 @@
   .byte  196,66,109,168,211                  // vfmadd213ps   %ymm11,%ymm2,%ymm10
   .byte  196,226,125,24,16                   // vbroadcastss  (%rax),%ymm2
   .byte  196,65,124,91,218                   // vcvtdq2ps     %ymm10,%ymm11
-  .byte  196,98,125,24,37,76,36,0,0          // vbroadcastss  0x244c(%rip),%ymm12        # 49d4 <_sk_callback_hsw+0x2df>
-  .byte  196,98,125,24,45,71,36,0,0          // vbroadcastss  0x2447(%rip),%ymm13        # 49d8 <_sk_callback_hsw+0x2e3>
+  .byte  196,98,125,24,37,76,36,0,0          // vbroadcastss  0x244c(%rip),%ymm12        # 49cc <_sk_callback_hsw+0x2df>
+  .byte  196,98,125,24,45,71,36,0,0          // vbroadcastss  0x2447(%rip),%ymm13        # 49d0 <_sk_callback_hsw+0x2e3>
   .byte  196,65,44,84,213                    // vandps        %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,61,36,0,0          // vbroadcastss  0x243d(%rip),%ymm13        # 49dc <_sk_callback_hsw+0x2e7>
+  .byte  196,98,125,24,45,61,36,0,0          // vbroadcastss  0x243d(%rip),%ymm13        # 49d4 <_sk_callback_hsw+0x2e7>
   .byte  196,65,44,86,213                    // vorps         %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,51,36,0,0          // vbroadcastss  0x2433(%rip),%ymm13        # 49e0 <_sk_callback_hsw+0x2eb>
+  .byte  196,98,125,24,45,51,36,0,0          // vbroadcastss  0x2433(%rip),%ymm13        # 49d8 <_sk_callback_hsw+0x2eb>
   .byte  196,66,37,184,236                   // vfmadd231ps   %ymm12,%ymm11,%ymm13
-  .byte  196,98,125,24,29,41,36,0,0          // vbroadcastss  0x2429(%rip),%ymm11        # 49e4 <_sk_callback_hsw+0x2ef>
+  .byte  196,98,125,24,29,41,36,0,0          // vbroadcastss  0x2429(%rip),%ymm11        # 49dc <_sk_callback_hsw+0x2ef>
   .byte  196,66,45,172,221                   // vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  .byte  196,98,125,24,37,31,36,0,0          // vbroadcastss  0x241f(%rip),%ymm12        # 49e8 <_sk_callback_hsw+0x2f3>
+  .byte  196,98,125,24,37,31,36,0,0          // vbroadcastss  0x241f(%rip),%ymm12        # 49e0 <_sk_callback_hsw+0x2f3>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,21,36,0,0          // vbroadcastss  0x2415(%rip),%ymm12        # 49ec <_sk_callback_hsw+0x2f7>
+  .byte  196,98,125,24,37,21,36,0,0          // vbroadcastss  0x2415(%rip),%ymm12        # 49e4 <_sk_callback_hsw+0x2f7>
   .byte  196,65,28,94,210                    // vdivps        %ymm10,%ymm12,%ymm10
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
   .byte  196,193,108,89,210                  // vmulps        %ymm10,%ymm2,%ymm2
   .byte  196,99,125,8,210,1                  // vroundps      $0x1,%ymm2,%ymm10
   .byte  196,65,108,92,210                   // vsubps        %ymm10,%ymm2,%ymm10
-  .byte  196,98,125,24,29,246,35,0,0         // vbroadcastss  0x23f6(%rip),%ymm11        # 49f0 <_sk_callback_hsw+0x2fb>
+  .byte  196,98,125,24,29,246,35,0,0         // vbroadcastss  0x23f6(%rip),%ymm11        # 49e8 <_sk_callback_hsw+0x2fb>
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
-  .byte  196,98,125,24,29,236,35,0,0         // vbroadcastss  0x23ec(%rip),%ymm11        # 49f4 <_sk_callback_hsw+0x2ff>
+  .byte  196,98,125,24,29,236,35,0,0         // vbroadcastss  0x23ec(%rip),%ymm11        # 49ec <_sk_callback_hsw+0x2ff>
   .byte  196,98,45,172,218                   // vfnmadd213ps  %ymm2,%ymm10,%ymm11
-  .byte  196,226,125,24,21,226,35,0,0        // vbroadcastss  0x23e2(%rip),%ymm2        # 49f8 <_sk_callback_hsw+0x303>
+  .byte  196,226,125,24,21,226,35,0,0        // vbroadcastss  0x23e2(%rip),%ymm2        # 49f0 <_sk_callback_hsw+0x303>
   .byte  196,193,108,92,210                  // vsubps        %ymm10,%ymm2,%ymm2
-  .byte  196,98,125,24,21,216,35,0,0         // vbroadcastss  0x23d8(%rip),%ymm10        # 49fc <_sk_callback_hsw+0x307>
+  .byte  196,98,125,24,21,216,35,0,0         // vbroadcastss  0x23d8(%rip),%ymm10        # 49f4 <_sk_callback_hsw+0x307>
   .byte  197,172,94,210                      // vdivps        %ymm2,%ymm10,%ymm2
   .byte  197,164,88,210                      // vaddps        %ymm2,%ymm11,%ymm2
-  .byte  196,98,125,24,21,203,35,0,0         // vbroadcastss  0x23cb(%rip),%ymm10        # 4a00 <_sk_callback_hsw+0x30b>
+  .byte  196,98,125,24,21,203,35,0,0         // vbroadcastss  0x23cb(%rip),%ymm10        # 49f8 <_sk_callback_hsw+0x30b>
   .byte  196,193,108,89,210                  // vmulps        %ymm10,%ymm2,%ymm2
   .byte  197,253,91,210                      // vcvtps2dq     %ymm2,%ymm2
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -11142,7 +11135,7 @@
   .byte  196,195,109,74,209,128              // vblendvps     %ymm8,%ymm9,%ymm2,%ymm2
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,108,95,208                  // vmaxps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,162,35,0,0          // vbroadcastss  0x23a2(%rip),%ymm8        # 4a04 <_sk_callback_hsw+0x30f>
+  .byte  196,98,125,24,5,162,35,0,0          // vbroadcastss  0x23a2(%rip),%ymm8        # 49fc <_sk_callback_hsw+0x30f>
   .byte  196,193,108,93,208                  // vminps        %ymm8,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11162,33 +11155,33 @@
   .byte  196,66,101,168,211                  // vfmadd213ps   %ymm11,%ymm3,%ymm10
   .byte  196,226,125,24,24                   // vbroadcastss  (%rax),%ymm3
   .byte  196,65,124,91,218                   // vcvtdq2ps     %ymm10,%ymm11
-  .byte  196,98,125,24,37,90,35,0,0          // vbroadcastss  0x235a(%rip),%ymm12        # 4a08 <_sk_callback_hsw+0x313>
-  .byte  196,98,125,24,45,85,35,0,0          // vbroadcastss  0x2355(%rip),%ymm13        # 4a0c <_sk_callback_hsw+0x317>
+  .byte  196,98,125,24,37,90,35,0,0          // vbroadcastss  0x235a(%rip),%ymm12        # 4a00 <_sk_callback_hsw+0x313>
+  .byte  196,98,125,24,45,85,35,0,0          // vbroadcastss  0x2355(%rip),%ymm13        # 4a04 <_sk_callback_hsw+0x317>
   .byte  196,65,44,84,213                    // vandps        %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,75,35,0,0          // vbroadcastss  0x234b(%rip),%ymm13        # 4a10 <_sk_callback_hsw+0x31b>
+  .byte  196,98,125,24,45,75,35,0,0          // vbroadcastss  0x234b(%rip),%ymm13        # 4a08 <_sk_callback_hsw+0x31b>
   .byte  196,65,44,86,213                    // vorps         %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,65,35,0,0          // vbroadcastss  0x2341(%rip),%ymm13        # 4a14 <_sk_callback_hsw+0x31f>
+  .byte  196,98,125,24,45,65,35,0,0          // vbroadcastss  0x2341(%rip),%ymm13        # 4a0c <_sk_callback_hsw+0x31f>
   .byte  196,66,37,184,236                   // vfmadd231ps   %ymm12,%ymm11,%ymm13
-  .byte  196,98,125,24,29,55,35,0,0          // vbroadcastss  0x2337(%rip),%ymm11        # 4a18 <_sk_callback_hsw+0x323>
+  .byte  196,98,125,24,29,55,35,0,0          // vbroadcastss  0x2337(%rip),%ymm11        # 4a10 <_sk_callback_hsw+0x323>
   .byte  196,66,45,172,221                   // vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  .byte  196,98,125,24,37,45,35,0,0          // vbroadcastss  0x232d(%rip),%ymm12        # 4a1c <_sk_callback_hsw+0x327>
+  .byte  196,98,125,24,37,45,35,0,0          // vbroadcastss  0x232d(%rip),%ymm12        # 4a14 <_sk_callback_hsw+0x327>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,35,35,0,0          // vbroadcastss  0x2323(%rip),%ymm12        # 4a20 <_sk_callback_hsw+0x32b>
+  .byte  196,98,125,24,37,35,35,0,0          // vbroadcastss  0x2323(%rip),%ymm12        # 4a18 <_sk_callback_hsw+0x32b>
   .byte  196,65,28,94,210                    // vdivps        %ymm10,%ymm12,%ymm10
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
   .byte  196,193,100,89,218                  // vmulps        %ymm10,%ymm3,%ymm3
   .byte  196,99,125,8,211,1                  // vroundps      $0x1,%ymm3,%ymm10
   .byte  196,65,100,92,210                   // vsubps        %ymm10,%ymm3,%ymm10
-  .byte  196,98,125,24,29,4,35,0,0           // vbroadcastss  0x2304(%rip),%ymm11        # 4a24 <_sk_callback_hsw+0x32f>
+  .byte  196,98,125,24,29,4,35,0,0           // vbroadcastss  0x2304(%rip),%ymm11        # 4a1c <_sk_callback_hsw+0x32f>
   .byte  196,193,100,88,219                  // vaddps        %ymm11,%ymm3,%ymm3
-  .byte  196,98,125,24,29,250,34,0,0         // vbroadcastss  0x22fa(%rip),%ymm11        # 4a28 <_sk_callback_hsw+0x333>
+  .byte  196,98,125,24,29,250,34,0,0         // vbroadcastss  0x22fa(%rip),%ymm11        # 4a20 <_sk_callback_hsw+0x333>
   .byte  196,98,45,172,219                   // vfnmadd213ps  %ymm3,%ymm10,%ymm11
-  .byte  196,226,125,24,29,240,34,0,0        // vbroadcastss  0x22f0(%rip),%ymm3        # 4a2c <_sk_callback_hsw+0x337>
+  .byte  196,226,125,24,29,240,34,0,0        // vbroadcastss  0x22f0(%rip),%ymm3        # 4a24 <_sk_callback_hsw+0x337>
   .byte  196,193,100,92,218                  // vsubps        %ymm10,%ymm3,%ymm3
-  .byte  196,98,125,24,21,230,34,0,0         // vbroadcastss  0x22e6(%rip),%ymm10        # 4a30 <_sk_callback_hsw+0x33b>
+  .byte  196,98,125,24,21,230,34,0,0         // vbroadcastss  0x22e6(%rip),%ymm10        # 4a28 <_sk_callback_hsw+0x33b>
   .byte  197,172,94,219                      // vdivps        %ymm3,%ymm10,%ymm3
   .byte  197,164,88,219                      // vaddps        %ymm3,%ymm11,%ymm3
-  .byte  196,98,125,24,21,217,34,0,0         // vbroadcastss  0x22d9(%rip),%ymm10        # 4a34 <_sk_callback_hsw+0x33f>
+  .byte  196,98,125,24,21,217,34,0,0         // vbroadcastss  0x22d9(%rip),%ymm10        # 4a2c <_sk_callback_hsw+0x33f>
   .byte  196,193,100,89,218                  // vmulps        %ymm10,%ymm3,%ymm3
   .byte  197,253,91,219                      // vcvtps2dq     %ymm3,%ymm3
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -11196,7 +11189,7 @@
   .byte  196,195,101,74,217,128              // vblendvps     %ymm8,%ymm9,%ymm3,%ymm3
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,100,95,216                  // vmaxps        %ymm8,%ymm3,%ymm3
-  .byte  196,98,125,24,5,176,34,0,0          // vbroadcastss  0x22b0(%rip),%ymm8        # 4a38 <_sk_callback_hsw+0x343>
+  .byte  196,98,125,24,5,176,34,0,0          // vbroadcastss  0x22b0(%rip),%ymm8        # 4a30 <_sk_callback_hsw+0x343>
   .byte  196,193,100,93,216                  // vminps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11205,26 +11198,26 @@
 .globl _sk_lab_to_xyz_hsw
 FUNCTION(_sk_lab_to_xyz_hsw)
 _sk_lab_to_xyz_hsw:
-  .byte  196,98,125,24,5,162,34,0,0          // vbroadcastss  0x22a2(%rip),%ymm8        # 4a3c <_sk_callback_hsw+0x347>
-  .byte  196,98,125,24,13,157,34,0,0         // vbroadcastss  0x229d(%rip),%ymm9        # 4a40 <_sk_callback_hsw+0x34b>
-  .byte  196,98,125,24,21,152,34,0,0         // vbroadcastss  0x2298(%rip),%ymm10        # 4a44 <_sk_callback_hsw+0x34f>
+  .byte  196,98,125,24,5,162,34,0,0          // vbroadcastss  0x22a2(%rip),%ymm8        # 4a34 <_sk_callback_hsw+0x347>
+  .byte  196,98,125,24,13,157,34,0,0         // vbroadcastss  0x229d(%rip),%ymm9        # 4a38 <_sk_callback_hsw+0x34b>
+  .byte  196,98,125,24,21,152,34,0,0         // vbroadcastss  0x2298(%rip),%ymm10        # 4a3c <_sk_callback_hsw+0x34f>
   .byte  196,194,53,168,202                  // vfmadd213ps   %ymm10,%ymm9,%ymm1
   .byte  196,194,53,168,210                  // vfmadd213ps   %ymm10,%ymm9,%ymm2
-  .byte  196,98,125,24,13,137,34,0,0         // vbroadcastss  0x2289(%rip),%ymm9        # 4a48 <_sk_callback_hsw+0x353>
+  .byte  196,98,125,24,13,137,34,0,0         // vbroadcastss  0x2289(%rip),%ymm9        # 4a40 <_sk_callback_hsw+0x353>
   .byte  196,66,125,184,200                  // vfmadd231ps   %ymm8,%ymm0,%ymm9
-  .byte  196,226,125,24,5,127,34,0,0         // vbroadcastss  0x227f(%rip),%ymm0        # 4a4c <_sk_callback_hsw+0x357>
+  .byte  196,226,125,24,5,127,34,0,0         // vbroadcastss  0x227f(%rip),%ymm0        # 4a44 <_sk_callback_hsw+0x357>
   .byte  197,180,89,192                      // vmulps        %ymm0,%ymm9,%ymm0
-  .byte  196,98,125,24,5,118,34,0,0          // vbroadcastss  0x2276(%rip),%ymm8        # 4a50 <_sk_callback_hsw+0x35b>
+  .byte  196,98,125,24,5,118,34,0,0          // vbroadcastss  0x2276(%rip),%ymm8        # 4a48 <_sk_callback_hsw+0x35b>
   .byte  196,98,117,168,192                  // vfmadd213ps   %ymm0,%ymm1,%ymm8
-  .byte  196,98,125,24,13,108,34,0,0         // vbroadcastss  0x226c(%rip),%ymm9        # 4a54 <_sk_callback_hsw+0x35f>
+  .byte  196,98,125,24,13,108,34,0,0         // vbroadcastss  0x226c(%rip),%ymm9        # 4a4c <_sk_callback_hsw+0x35f>
   .byte  196,98,109,172,200                  // vfnmadd213ps  %ymm0,%ymm2,%ymm9
   .byte  196,193,60,89,200                   // vmulps        %ymm8,%ymm8,%ymm1
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
-  .byte  196,226,125,24,21,89,34,0,0         // vbroadcastss  0x2259(%rip),%ymm2        # 4a58 <_sk_callback_hsw+0x363>
+  .byte  196,226,125,24,21,89,34,0,0         // vbroadcastss  0x2259(%rip),%ymm2        # 4a50 <_sk_callback_hsw+0x363>
   .byte  197,108,194,209,1                   // vcmpltps      %ymm1,%ymm2,%ymm10
-  .byte  196,98,125,24,29,79,34,0,0          // vbroadcastss  0x224f(%rip),%ymm11        # 4a5c <_sk_callback_hsw+0x367>
+  .byte  196,98,125,24,29,79,34,0,0          // vbroadcastss  0x224f(%rip),%ymm11        # 4a54 <_sk_callback_hsw+0x367>
   .byte  196,65,60,88,195                    // vaddps        %ymm11,%ymm8,%ymm8
-  .byte  196,98,125,24,37,69,34,0,0          // vbroadcastss  0x2245(%rip),%ymm12        # 4a60 <_sk_callback_hsw+0x36b>
+  .byte  196,98,125,24,37,69,34,0,0          // vbroadcastss  0x2245(%rip),%ymm12        # 4a58 <_sk_callback_hsw+0x36b>
   .byte  196,65,60,89,196                    // vmulps        %ymm12,%ymm8,%ymm8
   .byte  196,99,61,74,193,160                // vblendvps     %ymm10,%ymm1,%ymm8,%ymm8
   .byte  197,252,89,200                      // vmulps        %ymm0,%ymm0,%ymm1
@@ -11239,9 +11232,9 @@
   .byte  196,65,52,88,203                    // vaddps        %ymm11,%ymm9,%ymm9
   .byte  196,65,52,89,204                    // vmulps        %ymm12,%ymm9,%ymm9
   .byte  196,227,53,74,208,32                // vblendvps     %ymm2,%ymm0,%ymm9,%ymm2
-  .byte  196,226,125,24,5,250,33,0,0         // vbroadcastss  0x21fa(%rip),%ymm0        # 4a64 <_sk_callback_hsw+0x36f>
+  .byte  196,226,125,24,5,250,33,0,0         // vbroadcastss  0x21fa(%rip),%ymm0        # 4a5c <_sk_callback_hsw+0x36f>
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
-  .byte  196,98,125,24,5,241,33,0,0          // vbroadcastss  0x21f1(%rip),%ymm8        # 4a68 <_sk_callback_hsw+0x373>
+  .byte  196,98,125,24,5,241,33,0,0          // vbroadcastss  0x21f1(%rip),%ymm8        # 4a60 <_sk_callback_hsw+0x373>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11255,11 +11248,11 @@
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  72,1,248                            // add           %rdi,%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,45                              // jne           28bd <_sk_load_a8_hsw+0x3d>
+  .byte  117,45                              // jne           28b5 <_sk_load_a8_hsw+0x3d>
   .byte  197,250,126,0                       // vmovq         (%rax),%xmm0
   .byte  196,226,125,49,192                  // vpmovzxbd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,198,33,0,0        // vbroadcastss  0x21c6(%rip),%ymm1        # 4a6c <_sk_callback_hsw+0x377>
+  .byte  196,226,125,24,13,198,33,0,0        // vbroadcastss  0x21c6(%rip),%ymm1        # 4a64 <_sk_callback_hsw+0x377>
   .byte  197,252,89,217                      // vmulps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -11276,9 +11269,9 @@
   .byte  77,9,217                            // or            %r11,%r9
   .byte  72,131,193,8                        // add           $0x8,%rcx
   .byte  73,255,202                          // dec           %r10
-  .byte  117,234                             // jne           28c5 <_sk_load_a8_hsw+0x45>
+  .byte  117,234                             // jne           28bd <_sk_load_a8_hsw+0x45>
   .byte  196,193,249,110,193                 // vmovq         %r9,%xmm0
-  .byte  235,178                             // jmp           2894 <_sk_load_a8_hsw+0x14>
+  .byte  235,178                             // jmp           288c <_sk_load_a8_hsw+0x14>
 
 HIDDEN _sk_gather_a8_hsw
 .globl _sk_gather_a8_hsw
@@ -11324,7 +11317,7 @@
   .byte  196,227,121,32,192,7                // vpinsrb       $0x7,%eax,%xmm0,%xmm0
   .byte  196,226,125,49,192                  // vpmovzxbd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,209,32,0,0        // vbroadcastss  0x20d1(%rip),%ymm1        # 4a70 <_sk_callback_hsw+0x37b>
+  .byte  196,226,125,24,13,209,32,0,0        // vbroadcastss  0x20d1(%rip),%ymm1        # 4a68 <_sk_callback_hsw+0x37b>
   .byte  197,252,89,217                      // vmulps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -11342,14 +11335,14 @@
 _sk_store_a8_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  196,98,125,24,5,172,32,0,0          // vbroadcastss  0x20ac(%rip),%ymm8        # 4a74 <_sk_callback_hsw+0x37f>
+  .byte  196,98,125,24,5,172,32,0,0          // vbroadcastss  0x20ac(%rip),%ymm8        # 4a6c <_sk_callback_hsw+0x37f>
   .byte  196,65,100,89,192                   // vmulps        %ymm8,%ymm3,%ymm8
   .byte  196,65,125,91,192                   // vcvtps2dq     %ymm8,%ymm8
   .byte  196,67,125,25,193,1                 // vextractf128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  196,65,57,103,192                   // vpackuswb     %xmm8,%xmm8,%xmm8
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,10                              // jne           29f1 <_sk_store_a8_hsw+0x37>
+  .byte  117,10                              // jne           29e9 <_sk_store_a8_hsw+0x37>
   .byte  196,65,123,17,4,58                  // vmovsd        %xmm8,(%r10,%rdi,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11357,10 +11350,10 @@
   .byte  65,128,224,7                        // and           $0x7,%r8b
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  119,236                             // ja            29ed <_sk_store_a8_hsw+0x33>
+  .byte  119,236                             // ja            29e5 <_sk_store_a8_hsw+0x33>
   .byte  196,66,121,48,192                   // vpmovzxbw     %xmm8,%xmm8
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,67,0,0,0                  // lea           0x43(%rip),%r9        # 2a54 <_sk_store_a8_hsw+0x9a>
+  .byte  76,141,13,67,0,0,0                  // lea           0x43(%rip),%r9        # 2a4c <_sk_store_a8_hsw+0x9a>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11371,7 +11364,7 @@
   .byte  196,67,121,20,68,58,2,4             // vpextrb       $0x4,%xmm8,0x2(%r10,%rdi,1)
   .byte  196,67,121,20,68,58,1,2             // vpextrb       $0x2,%xmm8,0x1(%r10,%rdi,1)
   .byte  196,67,121,20,4,58,0                // vpextrb       $0x0,%xmm8,(%r10,%rdi,1)
-  .byte  235,154                             // jmp           29ed <_sk_store_a8_hsw+0x33>
+  .byte  235,154                             // jmp           29e5 <_sk_store_a8_hsw+0x33>
   .byte  144                                 // nop
   .byte  246,255                             // idiv          %bh
   .byte  255                                 // (bad)
@@ -11405,14 +11398,14 @@
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  72,1,248                            // add           %rdi,%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,50                              // jne           2ab2 <_sk_load_g8_hsw+0x42>
+  .byte  117,50                              // jne           2aaa <_sk_load_g8_hsw+0x42>
   .byte  197,250,126,0                       // vmovq         (%rax),%xmm0
   .byte  196,226,125,49,192                  // vpmovzxbd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,226,31,0,0        // vbroadcastss  0x1fe2(%rip),%ymm1        # 4a78 <_sk_callback_hsw+0x383>
+  .byte  196,226,125,24,13,226,31,0,0        // vbroadcastss  0x1fe2(%rip),%ymm1        # 4a70 <_sk_callback_hsw+0x383>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,215,31,0,0        // vbroadcastss  0x1fd7(%rip),%ymm3        # 4a7c <_sk_callback_hsw+0x387>
+  .byte  196,226,125,24,29,215,31,0,0        // vbroadcastss  0x1fd7(%rip),%ymm3        # 4a74 <_sk_callback_hsw+0x387>
   .byte  76,137,193                          // mov           %r8,%rcx
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
@@ -11426,9 +11419,9 @@
   .byte  77,9,217                            // or            %r11,%r9
   .byte  72,131,193,8                        // add           $0x8,%rcx
   .byte  73,255,202                          // dec           %r10
-  .byte  117,234                             // jne           2aba <_sk_load_g8_hsw+0x4a>
+  .byte  117,234                             // jne           2ab2 <_sk_load_g8_hsw+0x4a>
   .byte  196,193,249,110,193                 // vmovq         %r9,%xmm0
-  .byte  235,173                             // jmp           2a84 <_sk_load_g8_hsw+0x14>
+  .byte  235,173                             // jmp           2a7c <_sk_load_g8_hsw+0x14>
 
 HIDDEN _sk_gather_g8_hsw
 .globl _sk_gather_g8_hsw
@@ -11474,10 +11467,10 @@
   .byte  196,227,121,32,192,7                // vpinsrb       $0x7,%eax,%xmm0,%xmm0
   .byte  196,226,125,49,192                  // vpmovzxbd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,236,30,0,0        // vbroadcastss  0x1eec(%rip),%ymm1        # 4a80 <_sk_callback_hsw+0x38b>
+  .byte  196,226,125,24,13,236,30,0,0        // vbroadcastss  0x1eec(%rip),%ymm1        # 4a78 <_sk_callback_hsw+0x38b>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,225,30,0,0        // vbroadcastss  0x1ee1(%rip),%ymm3        # 4a84 <_sk_callback_hsw+0x38f>
+  .byte  196,226,125,24,29,225,30,0,0        // vbroadcastss  0x1ee1(%rip),%ymm3        # 4a7c <_sk_callback_hsw+0x38f>
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
   .byte  91                                  // pop           %rbx
@@ -11493,9 +11486,9 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,137,192                          // mov           %rax,%r8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  116,5                               // je            2bc3 <_sk_gather_i8_hsw+0xf>
+  .byte  116,5                               // je            2bbb <_sk_gather_i8_hsw+0xf>
   .byte  76,137,192                          // mov           %r8,%rax
-  .byte  235,2                               // jmp           2bc5 <_sk_gather_i8_hsw+0x11>
+  .byte  235,2                               // jmp           2bbd <_sk_gather_i8_hsw+0x11>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,87                               // push          %r15
   .byte  65,86                               // push          %r14
@@ -11533,14 +11526,14 @@
   .byte  73,139,64,8                         // mov           0x8(%r8),%rax
   .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
   .byte  196,226,117,144,28,128              // vpgatherdd    %ymm1,(%rax,%ymm0,4),%ymm3
-  .byte  197,229,219,5,237,31,0,0            // vpand         0x1fed(%rip),%ymm3,%ymm0        # 4c60 <_sk_callback_hsw+0x56b>
+  .byte  197,229,219,5,245,31,0,0            // vpand         0x1ff5(%rip),%ymm3,%ymm0        # 4c60 <_sk_callback_hsw+0x573>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,8,30,0,0            // vbroadcastss  0x1e08(%rip),%ymm8        # 4a88 <_sk_callback_hsw+0x393>
+  .byte  196,98,125,24,5,8,30,0,0            // vbroadcastss  0x1e08(%rip),%ymm8        # 4a80 <_sk_callback_hsw+0x393>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,226,101,0,13,242,31,0,0         // vpshufb       0x1ff2(%rip),%ymm3,%ymm1        # 4c80 <_sk_callback_hsw+0x58b>
+  .byte  196,226,101,0,13,250,31,0,0         // vpshufb       0x1ffa(%rip),%ymm3,%ymm1        # 4c80 <_sk_callback_hsw+0x593>
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
-  .byte  196,226,101,0,21,0,32,0,0           // vpshufb       0x2000(%rip),%ymm3,%ymm2        # 4ca0 <_sk_callback_hsw+0x5ab>
+  .byte  196,226,101,0,21,8,32,0,0           // vpshufb       0x2008(%rip),%ymm3,%ymm2        # 4ca0 <_sk_callback_hsw+0x5b3>
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
@@ -11561,35 +11554,35 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,114                             // jne           2d40 <_sk_load_565_hsw+0x7c>
+  .byte  117,114                             // jne           2d38 <_sk_load_565_hsw+0x7c>
   .byte  196,193,122,111,4,122               // vmovdqu       (%r10,%rdi,2),%xmm0
   .byte  196,226,125,51,208                  // vpmovzxwd     %xmm0,%ymm2
-  .byte  196,226,125,88,5,170,29,0,0         // vpbroadcastd  0x1daa(%rip),%ymm0        # 4a8c <_sk_callback_hsw+0x397>
+  .byte  196,226,125,88,5,170,29,0,0         // vpbroadcastd  0x1daa(%rip),%ymm0        # 4a84 <_sk_callback_hsw+0x397>
   .byte  197,237,219,192                     // vpand         %ymm0,%ymm2,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,157,29,0,0        // vbroadcastss  0x1d9d(%rip),%ymm1        # 4a90 <_sk_callback_hsw+0x39b>
+  .byte  196,226,125,24,13,157,29,0,0        // vbroadcastss  0x1d9d(%rip),%ymm1        # 4a88 <_sk_callback_hsw+0x39b>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,88,13,148,29,0,0        // vpbroadcastd  0x1d94(%rip),%ymm1        # 4a94 <_sk_callback_hsw+0x39f>
+  .byte  196,226,125,88,13,148,29,0,0        // vpbroadcastd  0x1d94(%rip),%ymm1        # 4a8c <_sk_callback_hsw+0x39f>
   .byte  197,237,219,201                     // vpand         %ymm1,%ymm2,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,29,135,29,0,0        // vbroadcastss  0x1d87(%rip),%ymm3        # 4a98 <_sk_callback_hsw+0x3a3>
+  .byte  196,226,125,24,29,135,29,0,0        // vbroadcastss  0x1d87(%rip),%ymm3        # 4a90 <_sk_callback_hsw+0x3a3>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
-  .byte  196,226,125,88,29,126,29,0,0        // vpbroadcastd  0x1d7e(%rip),%ymm3        # 4a9c <_sk_callback_hsw+0x3a7>
+  .byte  196,226,125,88,29,126,29,0,0        // vpbroadcastd  0x1d7e(%rip),%ymm3        # 4a94 <_sk_callback_hsw+0x3a7>
   .byte  197,237,219,211                     // vpand         %ymm3,%ymm2,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,226,125,24,29,113,29,0,0        // vbroadcastss  0x1d71(%rip),%ymm3        # 4aa0 <_sk_callback_hsw+0x3ab>
+  .byte  196,226,125,24,29,113,29,0,0        // vbroadcastss  0x1d71(%rip),%ymm3        # 4a98 <_sk_callback_hsw+0x3ab>
   .byte  197,236,89,211                      // vmulps        %ymm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,102,29,0,0        // vbroadcastss  0x1d66(%rip),%ymm3        # 4aa4 <_sk_callback_hsw+0x3af>
+  .byte  196,226,125,24,29,102,29,0,0        // vbroadcastss  0x1d66(%rip),%ymm3        # 4a9c <_sk_callback_hsw+0x3af>
   .byte  255,224                             // jmpq          *%rax
   .byte  65,137,200                          // mov           %ecx,%r8d
   .byte  65,128,224,7                        // and           $0x7,%r8b
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  119,128                             // ja            2cd4 <_sk_load_565_hsw+0x10>
+  .byte  119,128                             // ja            2ccc <_sk_load_565_hsw+0x10>
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,73,0,0,0                  // lea           0x49(%rip),%r9        # 2da8 <_sk_load_565_hsw+0xe4>
+  .byte  76,141,13,73,0,0,0                  // lea           0x49(%rip),%r9        # 2da0 <_sk_load_565_hsw+0xe4>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11601,7 +11594,7 @@
   .byte  196,193,121,196,68,122,4,2          // vpinsrw       $0x2,0x4(%r10,%rdi,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,122,2,1          // vpinsrw       $0x1,0x2(%r10,%rdi,2),%xmm0,%xmm0
   .byte  196,193,121,196,4,122,0             // vpinsrw       $0x0,(%r10,%rdi,2),%xmm0,%xmm0
-  .byte  233,44,255,255,255                  // jmpq          2cd4 <_sk_load_565_hsw+0x10>
+  .byte  233,44,255,255,255                  // jmpq          2ccc <_sk_load_565_hsw+0x10>
   .byte  244                                 // hlt
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -11671,23 +11664,23 @@
   .byte  65,15,183,4,88                      // movzwl        (%r8,%rbx,2),%eax
   .byte  197,249,196,192,7                   // vpinsrw       $0x7,%eax,%xmm0,%xmm0
   .byte  196,226,125,51,208                  // vpmovzxwd     %xmm0,%ymm2
-  .byte  196,226,125,88,5,41,28,0,0          // vpbroadcastd  0x1c29(%rip),%ymm0        # 4aa8 <_sk_callback_hsw+0x3b3>
+  .byte  196,226,125,88,5,41,28,0,0          // vpbroadcastd  0x1c29(%rip),%ymm0        # 4aa0 <_sk_callback_hsw+0x3b3>
   .byte  197,237,219,192                     // vpand         %ymm0,%ymm2,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,28,28,0,0         // vbroadcastss  0x1c1c(%rip),%ymm1        # 4aac <_sk_callback_hsw+0x3b7>
+  .byte  196,226,125,24,13,28,28,0,0         // vbroadcastss  0x1c1c(%rip),%ymm1        # 4aa4 <_sk_callback_hsw+0x3b7>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,88,13,19,28,0,0         // vpbroadcastd  0x1c13(%rip),%ymm1        # 4ab0 <_sk_callback_hsw+0x3bb>
+  .byte  196,226,125,88,13,19,28,0,0         // vpbroadcastd  0x1c13(%rip),%ymm1        # 4aa8 <_sk_callback_hsw+0x3bb>
   .byte  197,237,219,201                     // vpand         %ymm1,%ymm2,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,29,6,28,0,0          // vbroadcastss  0x1c06(%rip),%ymm3        # 4ab4 <_sk_callback_hsw+0x3bf>
+  .byte  196,226,125,24,29,6,28,0,0          // vbroadcastss  0x1c06(%rip),%ymm3        # 4aac <_sk_callback_hsw+0x3bf>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
-  .byte  196,226,125,88,29,253,27,0,0        // vpbroadcastd  0x1bfd(%rip),%ymm3        # 4ab8 <_sk_callback_hsw+0x3c3>
+  .byte  196,226,125,88,29,253,27,0,0        // vpbroadcastd  0x1bfd(%rip),%ymm3        # 4ab0 <_sk_callback_hsw+0x3c3>
   .byte  197,237,219,211                     // vpand         %ymm3,%ymm2,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,226,125,24,29,240,27,0,0        // vbroadcastss  0x1bf0(%rip),%ymm3        # 4abc <_sk_callback_hsw+0x3c7>
+  .byte  196,226,125,24,29,240,27,0,0        // vbroadcastss  0x1bf0(%rip),%ymm3        # 4ab4 <_sk_callback_hsw+0x3c7>
   .byte  197,236,89,211                      // vmulps        %ymm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,229,27,0,0        // vbroadcastss  0x1be5(%rip),%ymm3        # 4ac0 <_sk_callback_hsw+0x3cb>
+  .byte  196,226,125,24,29,229,27,0,0        // vbroadcastss  0x1be5(%rip),%ymm3        # 4ab8 <_sk_callback_hsw+0x3cb>
   .byte  91                                  // pop           %rbx
   .byte  65,92                               // pop           %r12
   .byte  65,94                               // pop           %r14
@@ -11700,11 +11693,11 @@
 _sk_store_565_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  196,98,125,24,5,210,27,0,0          // vbroadcastss  0x1bd2(%rip),%ymm8        # 4ac4 <_sk_callback_hsw+0x3cf>
+  .byte  196,98,125,24,5,210,27,0,0          // vbroadcastss  0x1bd2(%rip),%ymm8        # 4abc <_sk_callback_hsw+0x3cf>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,193,53,114,241,11               // vpslld        $0xb,%ymm9,%ymm9
-  .byte  196,98,125,24,21,189,27,0,0         // vbroadcastss  0x1bbd(%rip),%ymm10        # 4ac8 <_sk_callback_hsw+0x3d3>
+  .byte  196,98,125,24,21,189,27,0,0         // vbroadcastss  0x1bbd(%rip),%ymm10        # 4ac0 <_sk_callback_hsw+0x3d3>
   .byte  196,65,116,89,210                   // vmulps        %ymm10,%ymm1,%ymm10
   .byte  196,65,125,91,210                   // vcvtps2dq     %ymm10,%ymm10
   .byte  196,193,45,114,242,5                // vpslld        $0x5,%ymm10,%ymm10
@@ -11715,7 +11708,7 @@
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,10                              // jne           2f49 <_sk_store_565_hsw+0x65>
+  .byte  117,10                              // jne           2f41 <_sk_store_565_hsw+0x65>
   .byte  196,65,122,127,4,122                // vmovdqu       %xmm8,(%r10,%rdi,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11723,9 +11716,9 @@
   .byte  65,128,224,7                        // and           $0x7,%r8b
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  119,236                             // ja            2f45 <_sk_store_565_hsw+0x61>
+  .byte  119,236                             // ja            2f3d <_sk_store_565_hsw+0x61>
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,68,0,0,0                  // lea           0x44(%rip),%r9        # 2fa8 <_sk_store_565_hsw+0xc4>
+  .byte  76,141,13,68,0,0,0                  // lea           0x44(%rip),%r9        # 2fa0 <_sk_store_565_hsw+0xc4>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11736,7 +11729,7 @@
   .byte  196,67,121,21,68,122,4,2            // vpextrw       $0x2,%xmm8,0x4(%r10,%rdi,2)
   .byte  196,67,121,21,68,122,2,1            // vpextrw       $0x1,%xmm8,0x2(%r10,%rdi,2)
   .byte  196,67,121,21,4,122,0               // vpextrw       $0x0,%xmm8,(%r10,%rdi,2)
-  .byte  235,159                             // jmp           2f45 <_sk_store_565_hsw+0x61>
+  .byte  235,159                             // jmp           2f3d <_sk_store_565_hsw+0x61>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  245                                 // cmc
   .byte  255                                 // (bad)
@@ -11769,28 +11762,28 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,138,0,0,0                    // jne           305c <_sk_load_4444_hsw+0x98>
+  .byte  15,133,138,0,0,0                    // jne           3054 <_sk_load_4444_hsw+0x98>
   .byte  196,193,122,111,4,122               // vmovdqu       (%r10,%rdi,2),%xmm0
   .byte  196,226,125,51,216                  // vpmovzxwd     %xmm0,%ymm3
-  .byte  196,226,125,88,5,230,26,0,0         // vpbroadcastd  0x1ae6(%rip),%ymm0        # 4acc <_sk_callback_hsw+0x3d7>
+  .byte  196,226,125,88,5,230,26,0,0         // vpbroadcastd  0x1ae6(%rip),%ymm0        # 4ac4 <_sk_callback_hsw+0x3d7>
   .byte  197,229,219,192                     // vpand         %ymm0,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,217,26,0,0        // vbroadcastss  0x1ad9(%rip),%ymm1        # 4ad0 <_sk_callback_hsw+0x3db>
+  .byte  196,226,125,24,13,217,26,0,0        // vbroadcastss  0x1ad9(%rip),%ymm1        # 4ac8 <_sk_callback_hsw+0x3db>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,88,13,208,26,0,0        // vpbroadcastd  0x1ad0(%rip),%ymm1        # 4ad4 <_sk_callback_hsw+0x3df>
+  .byte  196,226,125,88,13,208,26,0,0        // vpbroadcastd  0x1ad0(%rip),%ymm1        # 4acc <_sk_callback_hsw+0x3df>
   .byte  197,229,219,201                     // vpand         %ymm1,%ymm3,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,21,195,26,0,0        // vbroadcastss  0x1ac3(%rip),%ymm2        # 4ad8 <_sk_callback_hsw+0x3e3>
+  .byte  196,226,125,24,21,195,26,0,0        // vbroadcastss  0x1ac3(%rip),%ymm2        # 4ad0 <_sk_callback_hsw+0x3e3>
   .byte  197,244,89,202                      // vmulps        %ymm2,%ymm1,%ymm1
-  .byte  196,226,125,88,21,186,26,0,0        // vpbroadcastd  0x1aba(%rip),%ymm2        # 4adc <_sk_callback_hsw+0x3e7>
+  .byte  196,226,125,88,21,186,26,0,0        // vpbroadcastd  0x1aba(%rip),%ymm2        # 4ad4 <_sk_callback_hsw+0x3e7>
   .byte  197,229,219,210                     // vpand         %ymm2,%ymm3,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,98,125,24,5,173,26,0,0          // vbroadcastss  0x1aad(%rip),%ymm8        # 4ae0 <_sk_callback_hsw+0x3eb>
+  .byte  196,98,125,24,5,173,26,0,0          // vbroadcastss  0x1aad(%rip),%ymm8        # 4ad8 <_sk_callback_hsw+0x3eb>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,88,5,163,26,0,0          // vpbroadcastd  0x1aa3(%rip),%ymm8        # 4ae4 <_sk_callback_hsw+0x3ef>
+  .byte  196,98,125,88,5,163,26,0,0          // vpbroadcastd  0x1aa3(%rip),%ymm8        # 4adc <_sk_callback_hsw+0x3ef>
   .byte  196,193,101,219,216                 // vpand         %ymm8,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,149,26,0,0          // vbroadcastss  0x1a95(%rip),%ymm8        # 4ae8 <_sk_callback_hsw+0x3f3>
+  .byte  196,98,125,24,5,149,26,0,0          // vbroadcastss  0x1a95(%rip),%ymm8        # 4ae0 <_sk_callback_hsw+0x3f3>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11799,9 +11792,9 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  15,135,100,255,255,255              // ja            2fd8 <_sk_load_4444_hsw+0x14>
+  .byte  15,135,100,255,255,255              // ja            2fd0 <_sk_load_4444_hsw+0x14>
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,73,0,0,0                  // lea           0x49(%rip),%r9        # 30c8 <_sk_load_4444_hsw+0x104>
+  .byte  76,141,13,73,0,0,0                  // lea           0x49(%rip),%r9        # 30c0 <_sk_load_4444_hsw+0x104>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11813,7 +11806,7 @@
   .byte  196,193,121,196,68,122,4,2          // vpinsrw       $0x2,0x4(%r10,%rdi,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,122,2,1          // vpinsrw       $0x1,0x2(%r10,%rdi,2),%xmm0,%xmm0
   .byte  196,193,121,196,4,122,0             // vpinsrw       $0x0,(%r10,%rdi,2),%xmm0,%xmm0
-  .byte  233,16,255,255,255                  // jmpq          2fd8 <_sk_load_4444_hsw+0x14>
+  .byte  233,16,255,255,255                  // jmpq          2fd0 <_sk_load_4444_hsw+0x14>
   .byte  244                                 // hlt
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -11883,25 +11876,25 @@
   .byte  65,15,183,4,88                      // movzwl        (%r8,%rbx,2),%eax
   .byte  197,249,196,192,7                   // vpinsrw       $0x7,%eax,%xmm0,%xmm0
   .byte  196,226,125,51,216                  // vpmovzxwd     %xmm0,%ymm3
-  .byte  196,226,125,88,5,77,25,0,0          // vpbroadcastd  0x194d(%rip),%ymm0        # 4aec <_sk_callback_hsw+0x3f7>
+  .byte  196,226,125,88,5,77,25,0,0          // vpbroadcastd  0x194d(%rip),%ymm0        # 4ae4 <_sk_callback_hsw+0x3f7>
   .byte  197,229,219,192                     // vpand         %ymm0,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,64,25,0,0         // vbroadcastss  0x1940(%rip),%ymm1        # 4af0 <_sk_callback_hsw+0x3fb>
+  .byte  196,226,125,24,13,64,25,0,0         // vbroadcastss  0x1940(%rip),%ymm1        # 4ae8 <_sk_callback_hsw+0x3fb>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,88,13,55,25,0,0         // vpbroadcastd  0x1937(%rip),%ymm1        # 4af4 <_sk_callback_hsw+0x3ff>
+  .byte  196,226,125,88,13,55,25,0,0         // vpbroadcastd  0x1937(%rip),%ymm1        # 4aec <_sk_callback_hsw+0x3ff>
   .byte  197,229,219,201                     // vpand         %ymm1,%ymm3,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,21,42,25,0,0         // vbroadcastss  0x192a(%rip),%ymm2        # 4af8 <_sk_callback_hsw+0x403>
+  .byte  196,226,125,24,21,42,25,0,0         // vbroadcastss  0x192a(%rip),%ymm2        # 4af0 <_sk_callback_hsw+0x403>
   .byte  197,244,89,202                      // vmulps        %ymm2,%ymm1,%ymm1
-  .byte  196,226,125,88,21,33,25,0,0         // vpbroadcastd  0x1921(%rip),%ymm2        # 4afc <_sk_callback_hsw+0x407>
+  .byte  196,226,125,88,21,33,25,0,0         // vpbroadcastd  0x1921(%rip),%ymm2        # 4af4 <_sk_callback_hsw+0x407>
   .byte  197,229,219,210                     // vpand         %ymm2,%ymm3,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,98,125,24,5,20,25,0,0           // vbroadcastss  0x1914(%rip),%ymm8        # 4b00 <_sk_callback_hsw+0x40b>
+  .byte  196,98,125,24,5,20,25,0,0           // vbroadcastss  0x1914(%rip),%ymm8        # 4af8 <_sk_callback_hsw+0x40b>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,88,5,10,25,0,0           // vpbroadcastd  0x190a(%rip),%ymm8        # 4b04 <_sk_callback_hsw+0x40f>
+  .byte  196,98,125,88,5,10,25,0,0           // vpbroadcastd  0x190a(%rip),%ymm8        # 4afc <_sk_callback_hsw+0x40f>
   .byte  196,193,101,219,216                 // vpand         %ymm8,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,252,24,0,0          // vbroadcastss  0x18fc(%rip),%ymm8        # 4b08 <_sk_callback_hsw+0x413>
+  .byte  196,98,125,24,5,252,24,0,0          // vbroadcastss  0x18fc(%rip),%ymm8        # 4b00 <_sk_callback_hsw+0x413>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
@@ -11916,7 +11909,7 @@
 _sk_store_4444_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  196,98,125,24,5,226,24,0,0          // vbroadcastss  0x18e2(%rip),%ymm8        # 4b0c <_sk_callback_hsw+0x417>
+  .byte  196,98,125,24,5,226,24,0,0          // vbroadcastss  0x18e2(%rip),%ymm8        # 4b04 <_sk_callback_hsw+0x417>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,193,53,114,241,12               // vpslld        $0xc,%ymm9,%ymm9
@@ -11934,7 +11927,7 @@
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,10                              // jne           328d <_sk_store_4444_hsw+0x71>
+  .byte  117,10                              // jne           3285 <_sk_store_4444_hsw+0x71>
   .byte  196,65,122,127,4,122                // vmovdqu       %xmm8,(%r10,%rdi,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11942,9 +11935,9 @@
   .byte  65,128,224,7                        // and           $0x7,%r8b
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  119,236                             // ja            3289 <_sk_store_4444_hsw+0x6d>
+  .byte  119,236                             // ja            3281 <_sk_store_4444_hsw+0x6d>
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,68,0,0,0                  // lea           0x44(%rip),%r9        # 32ec <_sk_store_4444_hsw+0xd0>
+  .byte  76,141,13,68,0,0,0                  // lea           0x44(%rip),%r9        # 32e4 <_sk_store_4444_hsw+0xd0>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -11955,7 +11948,7 @@
   .byte  196,67,121,21,68,122,4,2            // vpextrw       $0x2,%xmm8,0x4(%r10,%rdi,2)
   .byte  196,67,121,21,68,122,2,1            // vpextrw       $0x1,%xmm8,0x2(%r10,%rdi,2)
   .byte  196,67,121,21,4,122,0               // vpextrw       $0x0,%xmm8,(%r10,%rdi,2)
-  .byte  235,159                             // jmp           3289 <_sk_store_4444_hsw+0x6d>
+  .byte  235,159                             // jmp           3281 <_sk_store_4444_hsw+0x6d>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  245                                 // cmc
   .byte  255                                 // (bad)
@@ -11990,16 +11983,16 @@
   .byte  76,141,12,189,0,0,0,0               // lea           0x0(,%rdi,4),%r9
   .byte  76,3,8                              // add           (%rax),%r9
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,88                              // jne           3375 <_sk_load_8888_hsw+0x6d>
+  .byte  117,88                              // jne           336d <_sk_load_8888_hsw+0x6d>
   .byte  196,193,126,111,25                  // vmovdqu       (%r9),%ymm3
-  .byte  197,229,219,5,150,25,0,0            // vpand         0x1996(%rip),%ymm3,%ymm0        # 4cc0 <_sk_callback_hsw+0x5cb>
+  .byte  197,229,219,5,158,25,0,0            // vpand         0x199e(%rip),%ymm3,%ymm0        # 4cc0 <_sk_callback_hsw+0x5d3>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,217,23,0,0          // vbroadcastss  0x17d9(%rip),%ymm8        # 4b10 <_sk_callback_hsw+0x41b>
+  .byte  196,98,125,24,5,217,23,0,0          // vbroadcastss  0x17d9(%rip),%ymm8        # 4b08 <_sk_callback_hsw+0x41b>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,226,101,0,13,155,25,0,0         // vpshufb       0x199b(%rip),%ymm3,%ymm1        # 4ce0 <_sk_callback_hsw+0x5eb>
+  .byte  196,226,101,0,13,163,25,0,0         // vpshufb       0x19a3(%rip),%ymm3,%ymm1        # 4ce0 <_sk_callback_hsw+0x5f3>
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
-  .byte  196,226,101,0,21,169,25,0,0         // vpshufb       0x19a9(%rip),%ymm3,%ymm2        # 4d00 <_sk_callback_hsw+0x60b>
+  .byte  196,226,101,0,21,177,25,0,0         // vpshufb       0x19b1(%rip),%ymm3,%ymm2        # 4d00 <_sk_callback_hsw+0x613>
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
@@ -12016,7 +12009,7 @@
   .byte  196,225,249,110,192                 // vmovq         %rax,%xmm0
   .byte  196,226,125,33,192                  // vpmovsxbd     %xmm0,%ymm0
   .byte  196,194,125,140,25                  // vpmaskmovd    (%r9),%ymm0,%ymm3
-  .byte  235,135                             // jmp           3322 <_sk_load_8888_hsw+0x1a>
+  .byte  235,135                             // jmp           331a <_sk_load_8888_hsw+0x1a>
 
 HIDDEN _sk_gather_8888_hsw
 .globl _sk_gather_8888_hsw
@@ -12031,14 +12024,14 @@
   .byte  197,245,254,192                     // vpaddd        %ymm0,%ymm1,%ymm0
   .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
   .byte  196,194,117,144,28,128              // vpgatherdd    %ymm1,(%r8,%ymm0,4),%ymm3
-  .byte  197,229,219,5,87,25,0,0             // vpand         0x1957(%rip),%ymm3,%ymm0        # 4d20 <_sk_callback_hsw+0x62b>
+  .byte  197,229,219,5,95,25,0,0             // vpand         0x195f(%rip),%ymm3,%ymm0        # 4d20 <_sk_callback_hsw+0x633>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,62,23,0,0           // vbroadcastss  0x173e(%rip),%ymm8        # 4b14 <_sk_callback_hsw+0x41f>
+  .byte  196,98,125,24,5,62,23,0,0           // vbroadcastss  0x173e(%rip),%ymm8        # 4b0c <_sk_callback_hsw+0x41f>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,226,101,0,13,92,25,0,0          // vpshufb       0x195c(%rip),%ymm3,%ymm1        # 4d40 <_sk_callback_hsw+0x64b>
+  .byte  196,226,101,0,13,100,25,0,0         // vpshufb       0x1964(%rip),%ymm3,%ymm1        # 4d40 <_sk_callback_hsw+0x653>
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
-  .byte  196,226,101,0,21,106,25,0,0         // vpshufb       0x196a(%rip),%ymm3,%ymm2        # 4d60 <_sk_callback_hsw+0x66b>
+  .byte  196,226,101,0,21,114,25,0,0         // vpshufb       0x1972(%rip),%ymm3,%ymm2        # 4d60 <_sk_callback_hsw+0x673>
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
@@ -12055,7 +12048,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,141,12,189,0,0,0,0               // lea           0x0(,%rdi,4),%r9
   .byte  76,3,8                              // add           (%rax),%r9
-  .byte  196,98,125,24,5,238,22,0,0          // vbroadcastss  0x16ee(%rip),%ymm8        # 4b18 <_sk_callback_hsw+0x423>
+  .byte  196,98,125,24,5,238,22,0,0          // vbroadcastss  0x16ee(%rip),%ymm8        # 4b10 <_sk_callback_hsw+0x423>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,65,116,89,208                   // vmulps        %ymm8,%ymm1,%ymm10
@@ -12071,7 +12064,7 @@
   .byte  196,65,45,235,192                   // vpor          %ymm8,%ymm10,%ymm8
   .byte  196,65,53,235,192                   // vpor          %ymm8,%ymm9,%ymm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,12                              // jne           3484 <_sk_store_8888_hsw+0x73>
+  .byte  117,12                              // jne           347c <_sk_store_8888_hsw+0x73>
   .byte  196,65,126,127,1                    // vmovdqu       %ymm8,(%r9)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,193                          // mov           %r8,%rcx
@@ -12084,7 +12077,7 @@
   .byte  196,97,249,110,200                  // vmovq         %rax,%xmm9
   .byte  196,66,125,33,201                   // vpmovsxbd     %xmm9,%ymm9
   .byte  196,66,53,142,1                     // vpmaskmovd    %ymm8,%ymm9,(%r9)
-  .byte  235,211                             // jmp           347d <_sk_store_8888_hsw+0x6c>
+  .byte  235,211                             // jmp           3475 <_sk_store_8888_hsw+0x6c>
 
 HIDDEN _sk_load_f16_hsw
 .globl _sk_load_f16_hsw
@@ -12093,7 +12086,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,97                              // jne           3515 <_sk_load_f16_hsw+0x6b>
+  .byte  117,97                              // jne           350d <_sk_load_f16_hsw+0x6b>
   .byte  197,121,16,4,248                    // vmovupd       (%rax,%rdi,8),%xmm8
   .byte  197,249,16,84,248,16                // vmovupd       0x10(%rax,%rdi,8),%xmm2
   .byte  197,249,16,92,248,32                // vmovupd       0x20(%rax,%rdi,8),%xmm3
@@ -12119,29 +12112,29 @@
   .byte  197,123,16,4,248                    // vmovsd        (%rax,%rdi,8),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  116,79                              // je            3574 <_sk_load_f16_hsw+0xca>
+  .byte  116,79                              // je            356c <_sk_load_f16_hsw+0xca>
   .byte  197,57,22,68,248,8                  // vmovhpd       0x8(%rax,%rdi,8),%xmm8,%xmm8
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,67                              // jb            3574 <_sk_load_f16_hsw+0xca>
+  .byte  114,67                              // jb            356c <_sk_load_f16_hsw+0xca>
   .byte  197,251,16,84,248,16                // vmovsd        0x10(%rax,%rdi,8),%xmm2
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  116,68                              // je            3581 <_sk_load_f16_hsw+0xd7>
+  .byte  116,68                              // je            3579 <_sk_load_f16_hsw+0xd7>
   .byte  197,233,22,84,248,24                // vmovhpd       0x18(%rax,%rdi,8),%xmm2,%xmm2
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,56                              // jb            3581 <_sk_load_f16_hsw+0xd7>
+  .byte  114,56                              // jb            3579 <_sk_load_f16_hsw+0xd7>
   .byte  197,251,16,92,248,32                // vmovsd        0x20(%rax,%rdi,8),%xmm3
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  15,132,114,255,255,255              // je            34cb <_sk_load_f16_hsw+0x21>
+  .byte  15,132,114,255,255,255              // je            34c3 <_sk_load_f16_hsw+0x21>
   .byte  197,225,22,92,248,40                // vmovhpd       0x28(%rax,%rdi,8),%xmm3,%xmm3
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  15,130,98,255,255,255               // jb            34cb <_sk_load_f16_hsw+0x21>
+  .byte  15,130,98,255,255,255               // jb            34c3 <_sk_load_f16_hsw+0x21>
   .byte  197,122,126,76,248,48               // vmovq         0x30(%rax,%rdi,8),%xmm9
-  .byte  233,87,255,255,255                  // jmpq          34cb <_sk_load_f16_hsw+0x21>
+  .byte  233,87,255,255,255                  // jmpq          34c3 <_sk_load_f16_hsw+0x21>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,74,255,255,255                  // jmpq          34cb <_sk_load_f16_hsw+0x21>
+  .byte  233,74,255,255,255                  // jmpq          34c3 <_sk_load_f16_hsw+0x21>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,65,255,255,255                  // jmpq          34cb <_sk_load_f16_hsw+0x21>
+  .byte  233,65,255,255,255                  // jmpq          34c3 <_sk_load_f16_hsw+0x21>
 
 HIDDEN _sk_gather_f16_hsw
 .globl _sk_gather_f16_hsw
@@ -12199,7 +12192,7 @@
   .byte  196,65,57,98,205                    // vpunpckldq    %xmm13,%xmm8,%xmm9
   .byte  196,65,57,106,197                   // vpunpckhdq    %xmm13,%xmm8,%xmm8
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,27                              // jne           3679 <_sk_store_f16_hsw+0x65>
+  .byte  117,27                              // jne           3671 <_sk_store_f16_hsw+0x65>
   .byte  197,120,17,28,248                   // vmovups       %xmm11,(%rax,%rdi,8)
   .byte  197,120,17,84,248,16                // vmovups       %xmm10,0x10(%rax,%rdi,8)
   .byte  197,120,17,76,248,32                // vmovups       %xmm9,0x20(%rax,%rdi,8)
@@ -12208,22 +12201,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  197,121,214,28,248                  // vmovq         %xmm11,(%rax,%rdi,8)
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  116,241                             // je            3675 <_sk_store_f16_hsw+0x61>
+  .byte  116,241                             // je            366d <_sk_store_f16_hsw+0x61>
   .byte  197,121,23,92,248,8                 // vmovhpd       %xmm11,0x8(%rax,%rdi,8)
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,229                             // jb            3675 <_sk_store_f16_hsw+0x61>
+  .byte  114,229                             // jb            366d <_sk_store_f16_hsw+0x61>
   .byte  197,121,214,84,248,16               // vmovq         %xmm10,0x10(%rax,%rdi,8)
-  .byte  116,221                             // je            3675 <_sk_store_f16_hsw+0x61>
+  .byte  116,221                             // je            366d <_sk_store_f16_hsw+0x61>
   .byte  197,121,23,84,248,24                // vmovhpd       %xmm10,0x18(%rax,%rdi,8)
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,209                             // jb            3675 <_sk_store_f16_hsw+0x61>
+  .byte  114,209                             // jb            366d <_sk_store_f16_hsw+0x61>
   .byte  197,121,214,76,248,32               // vmovq         %xmm9,0x20(%rax,%rdi,8)
-  .byte  116,201                             // je            3675 <_sk_store_f16_hsw+0x61>
+  .byte  116,201                             // je            366d <_sk_store_f16_hsw+0x61>
   .byte  197,121,23,76,248,40                // vmovhpd       %xmm9,0x28(%rax,%rdi,8)
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  114,189                             // jb            3675 <_sk_store_f16_hsw+0x61>
+  .byte  114,189                             // jb            366d <_sk_store_f16_hsw+0x61>
   .byte  197,121,214,68,248,48               // vmovq         %xmm8,0x30(%rax,%rdi,8)
-  .byte  235,181                             // jmp           3675 <_sk_store_f16_hsw+0x61>
+  .byte  235,181                             // jmp           366d <_sk_store_f16_hsw+0x61>
 
 HIDDEN _sk_load_u16_be_hsw
 .globl _sk_load_u16_be_hsw
@@ -12233,7 +12226,7 @@
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  72,141,4,189,0,0,0,0                // lea           0x0(,%rdi,4),%rax
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,204,0,0,0                    // jne           37a2 <_sk_load_u16_be_hsw+0xe2>
+  .byte  15,133,204,0,0,0                    // jne           379a <_sk_load_u16_be_hsw+0xe2>
   .byte  196,65,121,16,4,64                  // vmovupd       (%r8,%rax,2),%xmm8
   .byte  196,193,121,16,84,64,16             // vmovupd       0x10(%r8,%rax,2),%xmm2
   .byte  196,193,121,16,92,64,32             // vmovupd       0x20(%r8,%rax,2),%xmm3
@@ -12252,7 +12245,7 @@
   .byte  197,241,235,192                     // vpor          %xmm0,%xmm1,%xmm0
   .byte  196,226,125,51,192                  // vpmovzxwd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,21,229,19,0,0         // vbroadcastss  0x13e5(%rip),%ymm10        # 4b1c <_sk_callback_hsw+0x427>
+  .byte  196,98,125,24,21,229,19,0,0         // vbroadcastss  0x13e5(%rip),%ymm10        # 4b14 <_sk_callback_hsw+0x427>
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  197,185,109,202                     // vpunpckhqdq   %xmm2,%xmm8,%xmm1
   .byte  197,233,113,241,8                   // vpsllw        $0x8,%xmm1,%xmm2
@@ -12280,29 +12273,29 @@
   .byte  196,65,123,16,4,64                  // vmovsd        (%r8,%rax,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  116,85                              // je            3808 <_sk_load_u16_be_hsw+0x148>
+  .byte  116,85                              // je            3800 <_sk_load_u16_be_hsw+0x148>
   .byte  196,65,57,22,68,64,8                // vmovhpd       0x8(%r8,%rax,2),%xmm8,%xmm8
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,72                              // jb            3808 <_sk_load_u16_be_hsw+0x148>
+  .byte  114,72                              // jb            3800 <_sk_load_u16_be_hsw+0x148>
   .byte  196,193,123,16,84,64,16             // vmovsd        0x10(%r8,%rax,2),%xmm2
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  116,72                              // je            3815 <_sk_load_u16_be_hsw+0x155>
+  .byte  116,72                              // je            380d <_sk_load_u16_be_hsw+0x155>
   .byte  196,193,105,22,84,64,24             // vmovhpd       0x18(%r8,%rax,2),%xmm2,%xmm2
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,59                              // jb            3815 <_sk_load_u16_be_hsw+0x155>
+  .byte  114,59                              // jb            380d <_sk_load_u16_be_hsw+0x155>
   .byte  196,193,123,16,92,64,32             // vmovsd        0x20(%r8,%rax,2),%xmm3
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  15,132,6,255,255,255                // je            36f1 <_sk_load_u16_be_hsw+0x31>
+  .byte  15,132,6,255,255,255                // je            36e9 <_sk_load_u16_be_hsw+0x31>
   .byte  196,193,97,22,92,64,40              // vmovhpd       0x28(%r8,%rax,2),%xmm3,%xmm3
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  15,130,245,254,255,255              // jb            36f1 <_sk_load_u16_be_hsw+0x31>
+  .byte  15,130,245,254,255,255              // jb            36e9 <_sk_load_u16_be_hsw+0x31>
   .byte  196,65,122,126,76,64,48             // vmovq         0x30(%r8,%rax,2),%xmm9
-  .byte  233,233,254,255,255                 // jmpq          36f1 <_sk_load_u16_be_hsw+0x31>
+  .byte  233,233,254,255,255                 // jmpq          36e9 <_sk_load_u16_be_hsw+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,220,254,255,255                 // jmpq          36f1 <_sk_load_u16_be_hsw+0x31>
+  .byte  233,220,254,255,255                 // jmpq          36e9 <_sk_load_u16_be_hsw+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,211,254,255,255                 // jmpq          36f1 <_sk_load_u16_be_hsw+0x31>
+  .byte  233,211,254,255,255                 // jmpq          36e9 <_sk_load_u16_be_hsw+0x31>
 
 HIDDEN _sk_load_rgb_u16_be_hsw
 .globl _sk_load_rgb_u16_be_hsw
@@ -12312,7 +12305,7 @@
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  72,141,4,127                        // lea           (%rdi,%rdi,2),%rax
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,204,0,0,0                    // jne           38fc <_sk_load_rgb_u16_be_hsw+0xde>
+  .byte  15,133,204,0,0,0                    // jne           38f4 <_sk_load_rgb_u16_be_hsw+0xde>
   .byte  196,193,122,111,4,64                // vmovdqu       (%r8,%rax,2),%xmm0
   .byte  196,193,122,111,84,64,12            // vmovdqu       0xc(%r8,%rax,2),%xmm2
   .byte  196,193,122,111,76,64,24            // vmovdqu       0x18(%r8,%rax,2),%xmm1
@@ -12336,7 +12329,7 @@
   .byte  197,241,235,192                     // vpor          %xmm0,%xmm1,%xmm0
   .byte  196,226,125,51,192                  // vpmovzxwd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,21,118,18,0,0         // vbroadcastss  0x1276(%rip),%ymm10        # 4b20 <_sk_callback_hsw+0x42b>
+  .byte  196,98,125,24,21,118,18,0,0         // vbroadcastss  0x1276(%rip),%ymm10        # 4b18 <_sk_callback_hsw+0x42b>
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  197,185,109,202                     // vpunpckhqdq   %xmm2,%xmm8,%xmm1
   .byte  197,233,113,241,8                   // vpsllw        $0x8,%xmm1,%xmm2
@@ -12353,41 +12346,41 @@
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,210                  // vmulps        %ymm10,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,42,18,0,0         // vbroadcastss  0x122a(%rip),%ymm3        # 4b24 <_sk_callback_hsw+0x42f>
+  .byte  196,226,125,24,29,42,18,0,0         // vbroadcastss  0x122a(%rip),%ymm3        # 4b1c <_sk_callback_hsw+0x42f>
   .byte  255,224                             // jmpq          *%rax
   .byte  196,193,121,110,4,64                // vmovd         (%r8,%rax,2),%xmm0
   .byte  196,193,121,196,68,64,4,2           // vpinsrw       $0x2,0x4(%r8,%rax,2),%xmm0,%xmm0
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  117,5                               // jne           3915 <_sk_load_rgb_u16_be_hsw+0xf7>
-  .byte  233,79,255,255,255                  // jmpq          3864 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  117,5                               // jne           390d <_sk_load_rgb_u16_be_hsw+0xf7>
+  .byte  233,79,255,255,255                  // jmpq          385c <_sk_load_rgb_u16_be_hsw+0x46>
   .byte  196,193,121,110,76,64,6             // vmovd         0x6(%r8,%rax,2),%xmm1
   .byte  196,65,113,196,68,64,10,2           // vpinsrw       $0x2,0xa(%r8,%rax,2),%xmm1,%xmm8
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,26                              // jb            3944 <_sk_load_rgb_u16_be_hsw+0x126>
+  .byte  114,26                              // jb            393c <_sk_load_rgb_u16_be_hsw+0x126>
   .byte  196,193,121,110,76,64,12            // vmovd         0xc(%r8,%rax,2),%xmm1
   .byte  196,193,113,196,84,64,16,2          // vpinsrw       $0x2,0x10(%r8,%rax,2),%xmm1,%xmm2
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  117,10                              // jne           3949 <_sk_load_rgb_u16_be_hsw+0x12b>
-  .byte  233,32,255,255,255                  // jmpq          3864 <_sk_load_rgb_u16_be_hsw+0x46>
-  .byte  233,27,255,255,255                  // jmpq          3864 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  117,10                              // jne           3941 <_sk_load_rgb_u16_be_hsw+0x12b>
+  .byte  233,32,255,255,255                  // jmpq          385c <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  233,27,255,255,255                  // jmpq          385c <_sk_load_rgb_u16_be_hsw+0x46>
   .byte  196,193,121,110,76,64,18            // vmovd         0x12(%r8,%rax,2),%xmm1
   .byte  196,65,113,196,76,64,22,2           // vpinsrw       $0x2,0x16(%r8,%rax,2),%xmm1,%xmm9
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,26                              // jb            3978 <_sk_load_rgb_u16_be_hsw+0x15a>
+  .byte  114,26                              // jb            3970 <_sk_load_rgb_u16_be_hsw+0x15a>
   .byte  196,193,121,110,76,64,24            // vmovd         0x18(%r8,%rax,2),%xmm1
   .byte  196,193,113,196,76,64,28,2          // vpinsrw       $0x2,0x1c(%r8,%rax,2),%xmm1,%xmm1
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  117,10                              // jne           397d <_sk_load_rgb_u16_be_hsw+0x15f>
-  .byte  233,236,254,255,255                 // jmpq          3864 <_sk_load_rgb_u16_be_hsw+0x46>
-  .byte  233,231,254,255,255                 // jmpq          3864 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  117,10                              // jne           3975 <_sk_load_rgb_u16_be_hsw+0x15f>
+  .byte  233,236,254,255,255                 // jmpq          385c <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  233,231,254,255,255                 // jmpq          385c <_sk_load_rgb_u16_be_hsw+0x46>
   .byte  196,193,121,110,92,64,30            // vmovd         0x1e(%r8,%rax,2),%xmm3
   .byte  196,65,97,196,92,64,34,2            // vpinsrw       $0x2,0x22(%r8,%rax,2),%xmm3,%xmm11
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  114,20                              // jb            39a6 <_sk_load_rgb_u16_be_hsw+0x188>
+  .byte  114,20                              // jb            399e <_sk_load_rgb_u16_be_hsw+0x188>
   .byte  196,193,121,110,92,64,36            // vmovd         0x24(%r8,%rax,2),%xmm3
   .byte  196,193,97,196,92,64,40,2           // vpinsrw       $0x2,0x28(%r8,%rax,2),%xmm3,%xmm3
-  .byte  233,190,254,255,255                 // jmpq          3864 <_sk_load_rgb_u16_be_hsw+0x46>
-  .byte  233,185,254,255,255                 // jmpq          3864 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  233,190,254,255,255                 // jmpq          385c <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  233,185,254,255,255                 // jmpq          385c <_sk_load_rgb_u16_be_hsw+0x46>
 
 HIDDEN _sk_store_u16_be_hsw
 .globl _sk_store_u16_be_hsw
@@ -12396,7 +12389,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  72,141,4,189,0,0,0,0                // lea           0x0(,%rdi,4),%rax
-  .byte  196,98,125,24,5,103,17,0,0          // vbroadcastss  0x1167(%rip),%ymm8        # 4b28 <_sk_callback_hsw+0x433>
+  .byte  196,98,125,24,5,103,17,0,0          // vbroadcastss  0x1167(%rip),%ymm8        # 4b20 <_sk_callback_hsw+0x433>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,67,125,25,202,1                 // vextractf128  $0x1,%ymm9,%xmm10
@@ -12434,7 +12427,7 @@
   .byte  196,65,17,98,200                    // vpunpckldq    %xmm8,%xmm13,%xmm9
   .byte  196,65,17,106,192                   // vpunpckhdq    %xmm8,%xmm13,%xmm8
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,31                              // jne           3aa5 <_sk_store_u16_be_hsw+0xfa>
+  .byte  117,31                              // jne           3a9d <_sk_store_u16_be_hsw+0xfa>
   .byte  196,65,120,17,28,64                 // vmovups       %xmm11,(%r8,%rax,2)
   .byte  196,65,120,17,84,64,16              // vmovups       %xmm10,0x10(%r8,%rax,2)
   .byte  196,65,120,17,76,64,32              // vmovups       %xmm9,0x20(%r8,%rax,2)
@@ -12443,22 +12436,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,214,28,64                // vmovq         %xmm11,(%r8,%rax,2)
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  116,240                             // je            3aa1 <_sk_store_u16_be_hsw+0xf6>
+  .byte  116,240                             // je            3a99 <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,23,92,64,8               // vmovhpd       %xmm11,0x8(%r8,%rax,2)
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,227                             // jb            3aa1 <_sk_store_u16_be_hsw+0xf6>
+  .byte  114,227                             // jb            3a99 <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,214,84,64,16             // vmovq         %xmm10,0x10(%r8,%rax,2)
-  .byte  116,218                             // je            3aa1 <_sk_store_u16_be_hsw+0xf6>
+  .byte  116,218                             // je            3a99 <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,23,84,64,24              // vmovhpd       %xmm10,0x18(%r8,%rax,2)
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,205                             // jb            3aa1 <_sk_store_u16_be_hsw+0xf6>
+  .byte  114,205                             // jb            3a99 <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,214,76,64,32             // vmovq         %xmm9,0x20(%r8,%rax,2)
-  .byte  116,196                             // je            3aa1 <_sk_store_u16_be_hsw+0xf6>
+  .byte  116,196                             // je            3a99 <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,23,76,64,40              // vmovhpd       %xmm9,0x28(%r8,%rax,2)
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  114,183                             // jb            3aa1 <_sk_store_u16_be_hsw+0xf6>
+  .byte  114,183                             // jb            3a99 <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,214,68,64,48             // vmovq         %xmm8,0x30(%r8,%rax,2)
-  .byte  235,174                             // jmp           3aa1 <_sk_store_u16_be_hsw+0xf6>
+  .byte  235,174                             // jmp           3a99 <_sk_store_u16_be_hsw+0xf6>
 
 HIDDEN _sk_load_f32_hsw
 .globl _sk_load_f32_hsw
@@ -12466,10 +12459,10 @@
 _sk_load_f32_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  119,110                             // ja            3b69 <_sk_load_f32_hsw+0x76>
+  .byte  119,110                             // ja            3b61 <_sk_load_f32_hsw+0x76>
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  76,141,12,189,0,0,0,0               // lea           0x0(,%rdi,4),%r9
-  .byte  76,141,21,135,0,0,0                 // lea           0x87(%rip),%r10        # 3b94 <_sk_load_f32_hsw+0xa1>
+  .byte  76,141,21,135,0,0,0                 // lea           0x87(%rip),%r10        # 3b8c <_sk_load_f32_hsw+0xa1>
   .byte  73,99,4,138                         // movslq        (%r10,%rcx,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -12530,7 +12523,7 @@
   .byte  196,65,37,20,196                    // vunpcklpd     %ymm12,%ymm11,%ymm8
   .byte  196,65,37,21,220                    // vunpckhpd     %ymm12,%ymm11,%ymm11
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,55                              // jne           3c21 <_sk_store_f32_hsw+0x6d>
+  .byte  117,55                              // jne           3c19 <_sk_store_f32_hsw+0x6d>
   .byte  196,67,45,24,225,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm12
   .byte  196,67,61,24,235,1                  // vinsertf128   $0x1,%xmm11,%ymm8,%ymm13
   .byte  196,67,45,6,201,49                  // vperm2f128    $0x31,%ymm9,%ymm10,%ymm9
@@ -12543,22 +12536,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,17,20,128                // vmovupd       %xmm10,(%r8,%rax,4)
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  116,240                             // je            3c1d <_sk_store_f32_hsw+0x69>
+  .byte  116,240                             // je            3c15 <_sk_store_f32_hsw+0x69>
   .byte  196,65,121,17,76,128,16             // vmovupd       %xmm9,0x10(%r8,%rax,4)
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,227                             // jb            3c1d <_sk_store_f32_hsw+0x69>
+  .byte  114,227                             // jb            3c15 <_sk_store_f32_hsw+0x69>
   .byte  196,65,121,17,68,128,32             // vmovupd       %xmm8,0x20(%r8,%rax,4)
-  .byte  116,218                             // je            3c1d <_sk_store_f32_hsw+0x69>
+  .byte  116,218                             // je            3c15 <_sk_store_f32_hsw+0x69>
   .byte  196,65,121,17,92,128,48             // vmovupd       %xmm11,0x30(%r8,%rax,4)
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,205                             // jb            3c1d <_sk_store_f32_hsw+0x69>
+  .byte  114,205                             // jb            3c15 <_sk_store_f32_hsw+0x69>
   .byte  196,67,125,25,84,128,64,1           // vextractf128  $0x1,%ymm10,0x40(%r8,%rax,4)
-  .byte  116,195                             // je            3c1d <_sk_store_f32_hsw+0x69>
+  .byte  116,195                             // je            3c15 <_sk_store_f32_hsw+0x69>
   .byte  196,67,125,25,76,128,80,1           // vextractf128  $0x1,%ymm9,0x50(%r8,%rax,4)
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  114,181                             // jb            3c1d <_sk_store_f32_hsw+0x69>
+  .byte  114,181                             // jb            3c15 <_sk_store_f32_hsw+0x69>
   .byte  196,67,125,25,68,128,96,1           // vextractf128  $0x1,%ymm8,0x60(%r8,%rax,4)
-  .byte  235,171                             // jmp           3c1d <_sk_store_f32_hsw+0x69>
+  .byte  235,171                             // jmp           3c15 <_sk_store_f32_hsw+0x69>
 
 HIDDEN _sk_clamp_x_hsw
 .globl _sk_clamp_x_hsw
@@ -12656,11 +12649,11 @@
 .globl _sk_luminance_to_alpha_hsw
 FUNCTION(_sk_luminance_to_alpha_hsw)
 _sk_luminance_to_alpha_hsw:
-  .byte  196,226,125,24,29,183,13,0,0        // vbroadcastss  0xdb7(%rip),%ymm3        # 4b2c <_sk_callback_hsw+0x437>
-  .byte  196,98,125,24,5,178,13,0,0          // vbroadcastss  0xdb2(%rip),%ymm8        # 4b30 <_sk_callback_hsw+0x43b>
+  .byte  196,226,125,24,29,183,13,0,0        // vbroadcastss  0xdb7(%rip),%ymm3        # 4b24 <_sk_callback_hsw+0x437>
+  .byte  196,98,125,24,5,178,13,0,0          // vbroadcastss  0xdb2(%rip),%ymm8        # 4b28 <_sk_callback_hsw+0x43b>
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
   .byte  196,226,125,184,203                 // vfmadd231ps   %ymm3,%ymm0,%ymm1
-  .byte  196,226,125,24,29,163,13,0,0        // vbroadcastss  0xda3(%rip),%ymm3        # 4b34 <_sk_callback_hsw+0x43f>
+  .byte  196,226,125,24,29,163,13,0,0        // vbroadcastss  0xda3(%rip),%ymm3        # 4b2c <_sk_callback_hsw+0x43f>
   .byte  196,226,109,168,217                 // vfmadd213ps   %ymm1,%ymm2,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -12833,9 +12826,9 @@
   .byte  76,139,64,8                         // mov           0x8(%rax),%r8
   .byte  77,137,202                          // mov           %r9,%r10
   .byte  73,255,202                          // dec           %r10
-  .byte  120,7                               // js            4049 <_sk_evenly_spaced_gradient_hsw+0x18>
+  .byte  120,7                               // js            4041 <_sk_evenly_spaced_gradient_hsw+0x18>
   .byte  196,193,242,42,202                  // vcvtsi2ss     %r10,%xmm1,%xmm1
-  .byte  235,22                              // jmp           405f <_sk_evenly_spaced_gradient_hsw+0x2e>
+  .byte  235,22                              // jmp           4057 <_sk_evenly_spaced_gradient_hsw+0x2e>
   .byte  77,137,211                          // mov           %r10,%r11
   .byte  73,209,235                          // shr           %r11
   .byte  65,131,226,1                        // and           $0x1,%r10d
@@ -12846,7 +12839,7 @@
   .byte  197,244,89,200                      // vmulps        %ymm0,%ymm1,%ymm1
   .byte  197,126,91,217                      // vcvttps2dq    %ymm1,%ymm11
   .byte  73,131,249,8                        // cmp           $0x8,%r9
-  .byte  119,70                              // ja            40b8 <_sk_evenly_spaced_gradient_hsw+0x87>
+  .byte  119,70                              // ja            40b0 <_sk_evenly_spaced_gradient_hsw+0x87>
   .byte  196,66,37,22,0                      // vpermps       (%r8),%ymm11,%ymm8
   .byte  76,139,64,40                        // mov           0x28(%rax),%r8
   .byte  196,66,37,22,8                      // vpermps       (%r8),%ymm11,%ymm9
@@ -12862,7 +12855,7 @@
   .byte  196,194,37,22,24                    // vpermps       (%r8),%ymm11,%ymm3
   .byte  72,139,64,64                        // mov           0x40(%rax),%rax
   .byte  196,98,37,22,40                     // vpermps       (%rax),%ymm11,%ymm13
-  .byte  235,110                             // jmp           4126 <_sk_evenly_spaced_gradient_hsw+0xf5>
+  .byte  235,110                             // jmp           411e <_sk_evenly_spaced_gradient_hsw+0xf5>
   .byte  196,65,13,118,246                   // vpcmpeqd      %ymm14,%ymm14,%ymm14
   .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
   .byte  196,2,117,146,4,152                 // vgatherdps    %ymm1,(%r8,%ymm11,4),%ymm8
@@ -12901,11 +12894,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  15,134,180,0,0,0                    // jbe           4205 <_sk_gradient_hsw+0xc3>
+  .byte  15,134,180,0,0,0                    // jbe           41fd <_sk_gradient_hsw+0xc3>
   .byte  76,139,72,72                        // mov           0x48(%rax),%r9
   .byte  197,244,87,201                      // vxorps        %ymm1,%ymm1,%ymm1
   .byte  65,186,1,0,0,0                      // mov           $0x1,%r10d
-  .byte  196,226,125,24,21,208,9,0,0         // vbroadcastss  0x9d0(%rip),%ymm2        # 4b38 <_sk_callback_hsw+0x443>
+  .byte  196,226,125,24,21,208,9,0,0         // vbroadcastss  0x9d0(%rip),%ymm2        # 4b30 <_sk_callback_hsw+0x443>
   .byte  196,65,53,239,201                   // vpxor         %ymm9,%ymm9,%ymm9
   .byte  196,130,125,24,28,145               // vbroadcastss  (%r9,%r10,4),%ymm3
   .byte  197,228,194,216,2                   // vcmpleps      %ymm0,%ymm3,%ymm3
@@ -12913,10 +12906,10 @@
   .byte  196,65,101,254,201                  // vpaddd        %ymm9,%ymm3,%ymm9
   .byte  73,255,194                          // inc           %r10
   .byte  77,57,208                           // cmp           %r10,%r8
-  .byte  117,226                             // jne           416d <_sk_gradient_hsw+0x2b>
+  .byte  117,226                             // jne           4165 <_sk_gradient_hsw+0x2b>
   .byte  76,139,72,8                         // mov           0x8(%rax),%r9
   .byte  73,131,248,8                        // cmp           $0x8,%r8
-  .byte  118,121                             // jbe           420e <_sk_gradient_hsw+0xcc>
+  .byte  118,121                             // jbe           4206 <_sk_gradient_hsw+0xcc>
   .byte  196,65,13,118,246                   // vpcmpeqd      %ymm14,%ymm14,%ymm14
   .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
   .byte  196,2,117,146,4,137                 // vgatherdps    %ymm1,(%r9,%ymm9,4),%ymm8
@@ -12940,7 +12933,7 @@
   .byte  196,130,21,146,28,136               // vgatherdps    %ymm13,(%r8,%ymm9,4),%ymm3
   .byte  72,139,64,64                        // mov           0x40(%rax),%rax
   .byte  196,34,13,146,44,136                // vgatherdps    %ymm14,(%rax,%ymm9,4),%ymm13
-  .byte  235,77                              // jmp           4252 <_sk_gradient_hsw+0x110>
+  .byte  235,77                              // jmp           424a <_sk_gradient_hsw+0x110>
   .byte  76,139,72,8                         // mov           0x8(%rax),%r9
   .byte  196,65,52,87,201                    // vxorps        %ymm9,%ymm9,%ymm9
   .byte  196,66,53,22,1                      // vpermps       (%r9),%ymm9,%ymm8
@@ -13000,24 +12993,24 @@
   .byte  196,65,52,95,226                    // vmaxps        %ymm10,%ymm9,%ymm12
   .byte  196,65,36,94,220                    // vdivps        %ymm12,%ymm11,%ymm11
   .byte  196,65,36,89,227                    // vmulps        %ymm11,%ymm11,%ymm12
-  .byte  196,98,125,24,45,79,8,0,0           // vbroadcastss  0x84f(%rip),%ymm13        # 4b3c <_sk_callback_hsw+0x447>
-  .byte  196,98,125,24,53,74,8,0,0           // vbroadcastss  0x84a(%rip),%ymm14        # 4b40 <_sk_callback_hsw+0x44b>
+  .byte  196,98,125,24,45,79,8,0,0           // vbroadcastss  0x84f(%rip),%ymm13        # 4b34 <_sk_callback_hsw+0x447>
+  .byte  196,98,125,24,53,74,8,0,0           // vbroadcastss  0x84a(%rip),%ymm14        # 4b38 <_sk_callback_hsw+0x44b>
   .byte  196,66,29,184,245                   // vfmadd231ps   %ymm13,%ymm12,%ymm14
-  .byte  196,98,125,24,45,64,8,0,0           // vbroadcastss  0x840(%rip),%ymm13        # 4b44 <_sk_callback_hsw+0x44f>
+  .byte  196,98,125,24,45,64,8,0,0           // vbroadcastss  0x840(%rip),%ymm13        # 4b3c <_sk_callback_hsw+0x44f>
   .byte  196,66,29,184,238                   // vfmadd231ps   %ymm14,%ymm12,%ymm13
-  .byte  196,98,125,24,53,54,8,0,0           // vbroadcastss  0x836(%rip),%ymm14        # 4b48 <_sk_callback_hsw+0x453>
+  .byte  196,98,125,24,53,54,8,0,0           // vbroadcastss  0x836(%rip),%ymm14        # 4b40 <_sk_callback_hsw+0x453>
   .byte  196,66,29,184,245                   // vfmadd231ps   %ymm13,%ymm12,%ymm14
   .byte  196,65,36,89,222                    // vmulps        %ymm14,%ymm11,%ymm11
   .byte  196,65,52,194,202,1                 // vcmpltps      %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,24,21,33,8,0,0           // vbroadcastss  0x821(%rip),%ymm10        # 4b4c <_sk_callback_hsw+0x457>
+  .byte  196,98,125,24,21,33,8,0,0           // vbroadcastss  0x821(%rip),%ymm10        # 4b44 <_sk_callback_hsw+0x457>
   .byte  196,65,44,92,211                    // vsubps        %ymm11,%ymm10,%ymm10
   .byte  196,67,37,74,202,144                // vblendvps     %ymm9,%ymm10,%ymm11,%ymm9
   .byte  196,193,124,194,192,1               // vcmpltps      %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,21,11,8,0,0           // vbroadcastss  0x80b(%rip),%ymm10        # 4b50 <_sk_callback_hsw+0x45b>
+  .byte  196,98,125,24,21,11,8,0,0           // vbroadcastss  0x80b(%rip),%ymm10        # 4b48 <_sk_callback_hsw+0x45b>
   .byte  196,65,44,92,209                    // vsubps        %ymm9,%ymm10,%ymm10
   .byte  196,195,53,74,194,0                 // vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   .byte  196,65,116,194,200,1                // vcmpltps      %ymm8,%ymm1,%ymm9
-  .byte  196,98,125,24,21,245,7,0,0          // vbroadcastss  0x7f5(%rip),%ymm10        # 4b54 <_sk_callback_hsw+0x45f>
+  .byte  196,98,125,24,21,245,7,0,0          // vbroadcastss  0x7f5(%rip),%ymm10        # 4b4c <_sk_callback_hsw+0x45f>
   .byte  197,44,92,208                       // vsubps        %ymm0,%ymm10,%ymm10
   .byte  196,195,125,74,194,144              // vblendvps     %ymm9,%ymm10,%ymm0,%ymm0
   .byte  196,65,124,194,200,3                // vcmpunordps   %ymm8,%ymm0,%ymm9
@@ -13040,7 +13033,7 @@
 FUNCTION(_sk_save_xy_hsw)
 _sk_save_xy_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,194,7,0,0           // vbroadcastss  0x7c2(%rip),%ymm8        # 4b58 <_sk_callback_hsw+0x463>
+  .byte  196,98,125,24,5,194,7,0,0           // vbroadcastss  0x7c2(%rip),%ymm8        # 4b50 <_sk_callback_hsw+0x463>
   .byte  196,65,124,88,200                   // vaddps        %ymm8,%ymm0,%ymm9
   .byte  196,67,125,8,209,1                  // vroundps      $0x1,%ymm9,%ymm10
   .byte  196,65,52,92,202                    // vsubps        %ymm10,%ymm9,%ymm9
@@ -13074,9 +13067,9 @@
 FUNCTION(_sk_bilinear_nx_hsw)
 _sk_bilinear_nx_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,86,7,0,0           // vbroadcastss  0x756(%rip),%ymm0        # 4b5c <_sk_callback_hsw+0x467>
+  .byte  196,226,125,24,5,86,7,0,0           // vbroadcastss  0x756(%rip),%ymm0        # 4b54 <_sk_callback_hsw+0x467>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,77,7,0,0            // vbroadcastss  0x74d(%rip),%ymm8        # 4b60 <_sk_callback_hsw+0x46b>
+  .byte  196,98,125,24,5,77,7,0,0            // vbroadcastss  0x74d(%rip),%ymm8        # 4b58 <_sk_callback_hsw+0x46b>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -13087,7 +13080,7 @@
 FUNCTION(_sk_bilinear_px_hsw)
 _sk_bilinear_px_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,53,7,0,0           // vbroadcastss  0x735(%rip),%ymm0        # 4b64 <_sk_callback_hsw+0x46f>
+  .byte  196,226,125,24,5,53,7,0,0           // vbroadcastss  0x735(%rip),%ymm0        # 4b5c <_sk_callback_hsw+0x46f>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
   .byte  197,124,16,64,64                    // vmovups       0x40(%rax),%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -13099,9 +13092,9 @@
 FUNCTION(_sk_bilinear_ny_hsw)
 _sk_bilinear_ny_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,25,7,0,0          // vbroadcastss  0x719(%rip),%ymm1        # 4b68 <_sk_callback_hsw+0x473>
+  .byte  196,226,125,24,13,25,7,0,0          // vbroadcastss  0x719(%rip),%ymm1        # 4b60 <_sk_callback_hsw+0x473>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,15,7,0,0            // vbroadcastss  0x70f(%rip),%ymm8        # 4b6c <_sk_callback_hsw+0x477>
+  .byte  196,98,125,24,5,15,7,0,0            // vbroadcastss  0x70f(%rip),%ymm8        # 4b64 <_sk_callback_hsw+0x477>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -13112,7 +13105,7 @@
 FUNCTION(_sk_bilinear_py_hsw)
 _sk_bilinear_py_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,247,6,0,0         // vbroadcastss  0x6f7(%rip),%ymm1        # 4b70 <_sk_callback_hsw+0x47b>
+  .byte  196,226,125,24,13,247,6,0,0         // vbroadcastss  0x6f7(%rip),%ymm1        # 4b68 <_sk_callback_hsw+0x47b>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
   .byte  197,124,16,64,96                    // vmovups       0x60(%rax),%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -13124,13 +13117,13 @@
 FUNCTION(_sk_bicubic_n3x_hsw)
 _sk_bicubic_n3x_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,218,6,0,0          // vbroadcastss  0x6da(%rip),%ymm0        # 4b74 <_sk_callback_hsw+0x47f>
+  .byte  196,226,125,24,5,218,6,0,0          // vbroadcastss  0x6da(%rip),%ymm0        # 4b6c <_sk_callback_hsw+0x47f>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,209,6,0,0           // vbroadcastss  0x6d1(%rip),%ymm8        # 4b78 <_sk_callback_hsw+0x483>
+  .byte  196,98,125,24,5,209,6,0,0           // vbroadcastss  0x6d1(%rip),%ymm8        # 4b70 <_sk_callback_hsw+0x483>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,194,6,0,0          // vbroadcastss  0x6c2(%rip),%ymm10        # 4b7c <_sk_callback_hsw+0x487>
-  .byte  196,98,125,24,29,189,6,0,0          // vbroadcastss  0x6bd(%rip),%ymm11        # 4b80 <_sk_callback_hsw+0x48b>
+  .byte  196,98,125,24,21,194,6,0,0          // vbroadcastss  0x6c2(%rip),%ymm10        # 4b74 <_sk_callback_hsw+0x487>
+  .byte  196,98,125,24,29,189,6,0,0          // vbroadcastss  0x6bd(%rip),%ymm11        # 4b78 <_sk_callback_hsw+0x48b>
   .byte  196,66,61,168,218                   // vfmadd213ps   %ymm10,%ymm8,%ymm11
   .byte  196,65,36,89,193                    // vmulps        %ymm9,%ymm11,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -13142,16 +13135,16 @@
 FUNCTION(_sk_bicubic_n1x_hsw)
 _sk_bicubic_n1x_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,160,6,0,0          // vbroadcastss  0x6a0(%rip),%ymm0        # 4b84 <_sk_callback_hsw+0x48f>
+  .byte  196,226,125,24,5,160,6,0,0          // vbroadcastss  0x6a0(%rip),%ymm0        # 4b7c <_sk_callback_hsw+0x48f>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,151,6,0,0           // vbroadcastss  0x697(%rip),%ymm8        # 4b88 <_sk_callback_hsw+0x493>
+  .byte  196,98,125,24,5,151,6,0,0           // vbroadcastss  0x697(%rip),%ymm8        # 4b80 <_sk_callback_hsw+0x493>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
-  .byte  196,98,125,24,13,141,6,0,0          // vbroadcastss  0x68d(%rip),%ymm9        # 4b8c <_sk_callback_hsw+0x497>
-  .byte  196,98,125,24,21,136,6,0,0          // vbroadcastss  0x688(%rip),%ymm10        # 4b90 <_sk_callback_hsw+0x49b>
+  .byte  196,98,125,24,13,141,6,0,0          // vbroadcastss  0x68d(%rip),%ymm9        # 4b84 <_sk_callback_hsw+0x497>
+  .byte  196,98,125,24,21,136,6,0,0          // vbroadcastss  0x688(%rip),%ymm10        # 4b88 <_sk_callback_hsw+0x49b>
   .byte  196,66,61,168,209                   // vfmadd213ps   %ymm9,%ymm8,%ymm10
-  .byte  196,98,125,24,13,126,6,0,0          // vbroadcastss  0x67e(%rip),%ymm9        # 4b94 <_sk_callback_hsw+0x49f>
+  .byte  196,98,125,24,13,126,6,0,0          // vbroadcastss  0x67e(%rip),%ymm9        # 4b8c <_sk_callback_hsw+0x49f>
   .byte  196,66,61,184,202                   // vfmadd231ps   %ymm10,%ymm8,%ymm9
-  .byte  196,98,125,24,21,116,6,0,0          // vbroadcastss  0x674(%rip),%ymm10        # 4b98 <_sk_callback_hsw+0x4a3>
+  .byte  196,98,125,24,21,116,6,0,0          // vbroadcastss  0x674(%rip),%ymm10        # 4b90 <_sk_callback_hsw+0x4a3>
   .byte  196,66,61,184,209                   // vfmadd231ps   %ymm9,%ymm8,%ymm10
   .byte  197,124,17,144,128,0,0,0            // vmovups       %ymm10,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -13162,14 +13155,14 @@
 FUNCTION(_sk_bicubic_p1x_hsw)
 _sk_bicubic_p1x_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,92,6,0,0            // vbroadcastss  0x65c(%rip),%ymm8        # 4b9c <_sk_callback_hsw+0x4a7>
+  .byte  196,98,125,24,5,92,6,0,0            // vbroadcastss  0x65c(%rip),%ymm8        # 4b94 <_sk_callback_hsw+0x4a7>
   .byte  197,188,88,0                        // vaddps        (%rax),%ymm8,%ymm0
   .byte  197,124,16,72,64                    // vmovups       0x40(%rax),%ymm9
-  .byte  196,98,125,24,21,78,6,0,0           // vbroadcastss  0x64e(%rip),%ymm10        # 4ba0 <_sk_callback_hsw+0x4ab>
-  .byte  196,98,125,24,29,73,6,0,0           // vbroadcastss  0x649(%rip),%ymm11        # 4ba4 <_sk_callback_hsw+0x4af>
+  .byte  196,98,125,24,21,78,6,0,0           // vbroadcastss  0x64e(%rip),%ymm10        # 4b98 <_sk_callback_hsw+0x4ab>
+  .byte  196,98,125,24,29,73,6,0,0           // vbroadcastss  0x649(%rip),%ymm11        # 4b9c <_sk_callback_hsw+0x4af>
   .byte  196,66,53,168,218                   // vfmadd213ps   %ymm10,%ymm9,%ymm11
   .byte  196,66,53,168,216                   // vfmadd213ps   %ymm8,%ymm9,%ymm11
-  .byte  196,98,125,24,5,58,6,0,0            // vbroadcastss  0x63a(%rip),%ymm8        # 4ba8 <_sk_callback_hsw+0x4b3>
+  .byte  196,98,125,24,5,58,6,0,0            // vbroadcastss  0x63a(%rip),%ymm8        # 4ba0 <_sk_callback_hsw+0x4b3>
   .byte  196,66,53,184,195                   // vfmadd231ps   %ymm11,%ymm9,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -13180,12 +13173,12 @@
 FUNCTION(_sk_bicubic_p3x_hsw)
 _sk_bicubic_p3x_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,34,6,0,0           // vbroadcastss  0x622(%rip),%ymm0        # 4bac <_sk_callback_hsw+0x4b7>
+  .byte  196,226,125,24,5,34,6,0,0           // vbroadcastss  0x622(%rip),%ymm0        # 4ba4 <_sk_callback_hsw+0x4b7>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
   .byte  197,124,16,64,64                    // vmovups       0x40(%rax),%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,15,6,0,0           // vbroadcastss  0x60f(%rip),%ymm10        # 4bb0 <_sk_callback_hsw+0x4bb>
-  .byte  196,98,125,24,29,10,6,0,0           // vbroadcastss  0x60a(%rip),%ymm11        # 4bb4 <_sk_callback_hsw+0x4bf>
+  .byte  196,98,125,24,21,15,6,0,0           // vbroadcastss  0x60f(%rip),%ymm10        # 4ba8 <_sk_callback_hsw+0x4bb>
+  .byte  196,98,125,24,29,10,6,0,0           // vbroadcastss  0x60a(%rip),%ymm11        # 4bac <_sk_callback_hsw+0x4bf>
   .byte  196,66,61,168,218                   // vfmadd213ps   %ymm10,%ymm8,%ymm11
   .byte  196,65,52,89,195                    // vmulps        %ymm11,%ymm9,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -13197,13 +13190,13 @@
 FUNCTION(_sk_bicubic_n3y_hsw)
 _sk_bicubic_n3y_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,237,5,0,0         // vbroadcastss  0x5ed(%rip),%ymm1        # 4bb8 <_sk_callback_hsw+0x4c3>
+  .byte  196,226,125,24,13,237,5,0,0         // vbroadcastss  0x5ed(%rip),%ymm1        # 4bb0 <_sk_callback_hsw+0x4c3>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,227,5,0,0           // vbroadcastss  0x5e3(%rip),%ymm8        # 4bbc <_sk_callback_hsw+0x4c7>
+  .byte  196,98,125,24,5,227,5,0,0           // vbroadcastss  0x5e3(%rip),%ymm8        # 4bb4 <_sk_callback_hsw+0x4c7>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,212,5,0,0          // vbroadcastss  0x5d4(%rip),%ymm10        # 4bc0 <_sk_callback_hsw+0x4cb>
-  .byte  196,98,125,24,29,207,5,0,0          // vbroadcastss  0x5cf(%rip),%ymm11        # 4bc4 <_sk_callback_hsw+0x4cf>
+  .byte  196,98,125,24,21,212,5,0,0          // vbroadcastss  0x5d4(%rip),%ymm10        # 4bb8 <_sk_callback_hsw+0x4cb>
+  .byte  196,98,125,24,29,207,5,0,0          // vbroadcastss  0x5cf(%rip),%ymm11        # 4bbc <_sk_callback_hsw+0x4cf>
   .byte  196,66,61,168,218                   // vfmadd213ps   %ymm10,%ymm8,%ymm11
   .byte  196,65,36,89,193                    // vmulps        %ymm9,%ymm11,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -13215,16 +13208,16 @@
 FUNCTION(_sk_bicubic_n1y_hsw)
 _sk_bicubic_n1y_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,178,5,0,0         // vbroadcastss  0x5b2(%rip),%ymm1        # 4bc8 <_sk_callback_hsw+0x4d3>
+  .byte  196,226,125,24,13,178,5,0,0         // vbroadcastss  0x5b2(%rip),%ymm1        # 4bc0 <_sk_callback_hsw+0x4d3>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,168,5,0,0           // vbroadcastss  0x5a8(%rip),%ymm8        # 4bcc <_sk_callback_hsw+0x4d7>
+  .byte  196,98,125,24,5,168,5,0,0           // vbroadcastss  0x5a8(%rip),%ymm8        # 4bc4 <_sk_callback_hsw+0x4d7>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
-  .byte  196,98,125,24,13,158,5,0,0          // vbroadcastss  0x59e(%rip),%ymm9        # 4bd0 <_sk_callback_hsw+0x4db>
-  .byte  196,98,125,24,21,153,5,0,0          // vbroadcastss  0x599(%rip),%ymm10        # 4bd4 <_sk_callback_hsw+0x4df>
+  .byte  196,98,125,24,13,158,5,0,0          // vbroadcastss  0x59e(%rip),%ymm9        # 4bc8 <_sk_callback_hsw+0x4db>
+  .byte  196,98,125,24,21,153,5,0,0          // vbroadcastss  0x599(%rip),%ymm10        # 4bcc <_sk_callback_hsw+0x4df>
   .byte  196,66,61,168,209                   // vfmadd213ps   %ymm9,%ymm8,%ymm10
-  .byte  196,98,125,24,13,143,5,0,0          // vbroadcastss  0x58f(%rip),%ymm9        # 4bd8 <_sk_callback_hsw+0x4e3>
+  .byte  196,98,125,24,13,143,5,0,0          // vbroadcastss  0x58f(%rip),%ymm9        # 4bd0 <_sk_callback_hsw+0x4e3>
   .byte  196,66,61,184,202                   // vfmadd231ps   %ymm10,%ymm8,%ymm9
-  .byte  196,98,125,24,21,133,5,0,0          // vbroadcastss  0x585(%rip),%ymm10        # 4bdc <_sk_callback_hsw+0x4e7>
+  .byte  196,98,125,24,21,133,5,0,0          // vbroadcastss  0x585(%rip),%ymm10        # 4bd4 <_sk_callback_hsw+0x4e7>
   .byte  196,66,61,184,209                   // vfmadd231ps   %ymm9,%ymm8,%ymm10
   .byte  197,124,17,144,160,0,0,0            // vmovups       %ymm10,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -13235,14 +13228,14 @@
 FUNCTION(_sk_bicubic_p1y_hsw)
 _sk_bicubic_p1y_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,109,5,0,0           // vbroadcastss  0x56d(%rip),%ymm8        # 4be0 <_sk_callback_hsw+0x4eb>
+  .byte  196,98,125,24,5,109,5,0,0           // vbroadcastss  0x56d(%rip),%ymm8        # 4bd8 <_sk_callback_hsw+0x4eb>
   .byte  197,188,88,72,32                    // vaddps        0x20(%rax),%ymm8,%ymm1
   .byte  197,124,16,72,96                    // vmovups       0x60(%rax),%ymm9
-  .byte  196,98,125,24,21,94,5,0,0           // vbroadcastss  0x55e(%rip),%ymm10        # 4be4 <_sk_callback_hsw+0x4ef>
-  .byte  196,98,125,24,29,89,5,0,0           // vbroadcastss  0x559(%rip),%ymm11        # 4be8 <_sk_callback_hsw+0x4f3>
+  .byte  196,98,125,24,21,94,5,0,0           // vbroadcastss  0x55e(%rip),%ymm10        # 4bdc <_sk_callback_hsw+0x4ef>
+  .byte  196,98,125,24,29,89,5,0,0           // vbroadcastss  0x559(%rip),%ymm11        # 4be0 <_sk_callback_hsw+0x4f3>
   .byte  196,66,53,168,218                   // vfmadd213ps   %ymm10,%ymm9,%ymm11
   .byte  196,66,53,168,216                   // vfmadd213ps   %ymm8,%ymm9,%ymm11
-  .byte  196,98,125,24,5,74,5,0,0            // vbroadcastss  0x54a(%rip),%ymm8        # 4bec <_sk_callback_hsw+0x4f7>
+  .byte  196,98,125,24,5,74,5,0,0            // vbroadcastss  0x54a(%rip),%ymm8        # 4be4 <_sk_callback_hsw+0x4f7>
   .byte  196,66,53,184,195                   // vfmadd231ps   %ymm11,%ymm9,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -13253,12 +13246,12 @@
 FUNCTION(_sk_bicubic_p3y_hsw)
 _sk_bicubic_p3y_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,50,5,0,0          // vbroadcastss  0x532(%rip),%ymm1        # 4bf0 <_sk_callback_hsw+0x4fb>
+  .byte  196,226,125,24,13,50,5,0,0          // vbroadcastss  0x532(%rip),%ymm1        # 4be8 <_sk_callback_hsw+0x4fb>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
   .byte  197,124,16,64,96                    // vmovups       0x60(%rax),%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,30,5,0,0           // vbroadcastss  0x51e(%rip),%ymm10        # 4bf4 <_sk_callback_hsw+0x4ff>
-  .byte  196,98,125,24,29,25,5,0,0           // vbroadcastss  0x519(%rip),%ymm11        # 4bf8 <_sk_callback_hsw+0x503>
+  .byte  196,98,125,24,21,30,5,0,0           // vbroadcastss  0x51e(%rip),%ymm10        # 4bec <_sk_callback_hsw+0x4ff>
+  .byte  196,98,125,24,29,25,5,0,0           // vbroadcastss  0x519(%rip),%ymm11        # 4bf0 <_sk_callback_hsw+0x503>
   .byte  196,66,61,168,218                   // vfmadd213ps   %ymm10,%ymm8,%ymm11
   .byte  196,65,52,89,195                    // vmulps        %ymm11,%ymm9,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -13382,25 +13375,25 @@
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 48cd <.literal4+0xb1>
+  .byte  71,225,61                           // rex.RXB       loope 48c5 <.literal4+0xb1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 48dd <.literal4+0xc1>
+  .byte  71,225,61                           // rex.RXB       loope 48d5 <.literal4+0xc1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 48ed <.literal4+0xd1>
+  .byte  71,225,61                           // rex.RXB       loope 48e5 <.literal4+0xd1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 48fd <.literal4+0xe1>
+  .byte  71,225,61                           // rex.RXB       loope 48f5 <.literal4+0xe1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -13447,7 +13440,7 @@
   .byte  190,129,128,128,59                  // mov           $0x3b808081,%esi
   .byte  129,128,128,59,0,248,0,0,8,33       // addl          $0x21080000,-0x7ffc480(%rax)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        494d <.literal4+0x131>
+  .byte  224,7                               // loopne        4945 <.literal4+0x131>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -13463,10 +13456,10 @@
   .byte  129,128,128,59,129,128,128,59,0,0   // addl          $0x3b80,-0x7f7ec480(%rax)
   .byte  0,52,255                            // add           %dh,(%rdi,%rdi,8)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            4974 <.literal4+0x158>
+  .byte  127,0                               // jg            496c <.literal4+0x158>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            49ed <.literal4+0x1d1>
+  .byte  119,115                             // ja            49e5 <.literal4+0x1d1>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -13480,10 +13473,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            49a8 <.literal4+0x18c>
+  .byte  127,0                               // jg            49a0 <.literal4+0x18c>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            4a21 <.literal4+0x205>
+  .byte  119,115                             // ja            4a19 <.literal4+0x205>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -13497,10 +13490,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            49dc <.literal4+0x1c0>
+  .byte  127,0                               // jg            49d4 <.literal4+0x1c0>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            4a55 <.literal4+0x239>
+  .byte  119,115                             // ja            4a4d <.literal4+0x239>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -13514,10 +13507,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            4a10 <.literal4+0x1f4>
+  .byte  127,0                               // jg            4a08 <.literal4+0x1f4>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            4a89 <.literal4+0x26d>
+  .byte  119,115                             // ja            4a81 <.literal4+0x26d>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -13530,7 +13523,7 @@
   .byte  0,75,0                              // add           %cl,0x0(%rbx)
   .byte  0,128,63,0,0,200                    // add           %al,-0x37ffffc1(%rax)
   .byte  66,0,0                              // rex.X         add %al,(%rax)
-  .byte  127,67                              // jg            4a87 <.literal4+0x26b>
+  .byte  127,67                              // jg            4a7f <.literal4+0x26b>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,195                               // add           %al,%bl
   .byte  0,0                                 // add           %al,(%rax)
@@ -13542,10 +13535,10 @@
   .byte  190,80,128,3,62                     // mov           $0x3e038050,%esi
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           4aa7 <.literal4+0x28b>
+  .byte  118,63                              // jbe           4a9f <.literal4+0x28b>
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  129,128,128,59,129,128,128,59,0,0   // addl          $0x3b80,-0x7f7ec480(%rax)
-  .byte  127,67                              // jg            4abb <.literal4+0x29f>
+  .byte  127,67                              // jg            4ab3 <.literal4+0x29f>
   .byte  129,128,128,59,0,0,128,63,129,128   // addl          $0x80813f80,0x3b80(%rax)
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
   .byte  0,128,63,129,128,128                // add           %al,-0x7f7f7ec1(%rax)
@@ -13554,7 +13547,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        4a9d <.literal4+0x281>
+  .byte  224,7                               // loopne        4a95 <.literal4+0x281>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -13566,7 +13559,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        4ab9 <.literal4+0x29d>
+  .byte  224,7                               // loopne        4ab1 <.literal4+0x29d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -13577,7 +13570,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  248                                 // clc
   .byte  65,0,0                              // add           %al,(%r8)
-  .byte  124,66                              // jl            4b0e <.literal4+0x2f2>
+  .byte  124,66                              // jl            4b06 <.literal4+0x2f2>
   .byte  0,240                               // add           %dh,%al
   .byte  0,0                                 // add           %al,(%rax)
   .byte  137,136,136,55,0,15                 // mov           %ecx,0xf003788(%rax)
@@ -13595,9 +13588,9 @@
   .byte  137,136,136,59,15,0                 // mov           %ecx,0xf3b88(%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  137,136,136,61,0,0                  // mov           %ecx,0x3d88(%rax)
-  .byte  112,65                              // jo            4b51 <.literal4+0x335>
+  .byte  112,65                              // jo            4b49 <.literal4+0x335>
   .byte  129,128,128,59,129,128,128,59,0,0   // addl          $0x3b80,-0x7f7ec480(%rax)
-  .byte  127,67                              // jg            4b5f <.literal4+0x343>
+  .byte  127,67                              // jg            4b57 <.literal4+0x343>
   .byte  128,0,128                           // addb          $0x80,(%rax)
   .byte  55                                  // (bad)
   .byte  128,0,128                           // addb          $0x80,(%rax)
@@ -13605,7 +13598,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  255                                 // (bad)
-  .byte  127,71                              // jg            4b73 <.literal4+0x357>
+  .byte  127,71                              // jg            4b6b <.literal4+0x357>
   .byte  208                                 // (bad)
   .byte  179,89                              // mov           $0x59,%bl
   .byte  62,89                               // ds            pop %rcx
@@ -13705,16 +13698,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a004c28 <_sk_callback_hsw+0xa000533>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a004c28 <_sk_callback_hsw+0xa00053b>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12004c30 <_sk_callback_hsw+0x1200053b>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12004c30 <_sk_callback_hsw+0x12000543>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a004c38 <_sk_callback_hsw+0x1a000543>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a004c38 <_sk_callback_hsw+0x1a00054b>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3004c40 <_sk_callback_hsw+0x300054b>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3004c40 <_sk_callback_hsw+0x3000553>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -13757,16 +13750,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a004c88 <_sk_callback_hsw+0xa000593>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a004c88 <_sk_callback_hsw+0xa00059b>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12004c90 <_sk_callback_hsw+0x1200059b>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12004c90 <_sk_callback_hsw+0x120005a3>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a004c98 <_sk_callback_hsw+0x1a0005a3>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a004c98 <_sk_callback_hsw+0x1a0005ab>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3004ca0 <_sk_callback_hsw+0x30005ab>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3004ca0 <_sk_callback_hsw+0x30005b3>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -13809,16 +13802,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a004ce8 <_sk_callback_hsw+0xa0005f3>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a004ce8 <_sk_callback_hsw+0xa0005fb>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12004cf0 <_sk_callback_hsw+0x120005fb>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12004cf0 <_sk_callback_hsw+0x12000603>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a004cf8 <_sk_callback_hsw+0x1a000603>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a004cf8 <_sk_callback_hsw+0x1a00060b>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3004d00 <_sk_callback_hsw+0x300060b>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3004d00 <_sk_callback_hsw+0x3000613>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -13861,16 +13854,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a004d48 <_sk_callback_hsw+0xa000653>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a004d48 <_sk_callback_hsw+0xa00065b>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12004d50 <_sk_callback_hsw+0x1200065b>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12004d50 <_sk_callback_hsw+0x12000663>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a004d58 <_sk_callback_hsw+0x1a000663>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a004d58 <_sk_callback_hsw+0x1a00066b>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3004d60 <_sk_callback_hsw+0x300066b>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3004d60 <_sk_callback_hsw+0x3000673>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -13991,14 +13984,14 @@
   .byte  197,249,112,192,0                   // vpshufd       $0x0,%xmm0,%xmm0
   .byte  196,227,125,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,87,99,0,0         // vbroadcastss  0x6357(%rip),%ymm1        # 6420 <_sk_callback_avx+0x125>
+  .byte  196,226,125,24,13,95,99,0,0         // vbroadcastss  0x635f(%rip),%ymm1        # 6428 <_sk_callback_avx+0x125>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  197,252,88,2                        // vaddps        (%rdx),%ymm0,%ymm0
   .byte  196,226,125,24,16                   // vbroadcastss  (%rax),%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  197,236,88,201                      // vaddps        %ymm1,%ymm2,%ymm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,21,59,99,0,0         // vbroadcastss  0x633b(%rip),%ymm2        # 6424 <_sk_callback_avx+0x129>
+  .byte  196,226,125,24,21,67,99,0,0         // vbroadcastss  0x6343(%rip),%ymm2        # 642c <_sk_callback_avx+0x129>
   .byte  197,228,87,219                      // vxorps        %ymm3,%ymm3,%ymm3
   .byte  197,220,87,228                      // vxorps        %ymm4,%ymm4,%ymm4
   .byte  197,212,87,237                      // vxorps        %ymm5,%ymm5,%ymm5
@@ -14011,16 +14004,17 @@
 FUNCTION(_sk_dither_avx)
 _sk_dither_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  197,121,110,199                     // vmovd         %edi,%xmm8
-  .byte  196,65,121,112,192,0                // vpshufd       $0x0,%xmm8,%xmm8
-  .byte  196,67,61,24,192,1                  // vinsertf128   $0x1,%xmm8,%ymm8,%ymm8
-  .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  197,60,88,2                         // vaddps        (%rdx),%ymm8,%ymm8
-  .byte  196,65,126,91,192                   // vcvttps2dq    %ymm8,%ymm8
+  .byte  197,124,16,66,32                    // vmovups       0x20(%rdx),%ymm8
+  .byte  196,67,125,25,193,1                 // vextractf128  $0x1,%ymm8,%xmm9
+  .byte  197,121,110,215                     // vmovd         %edi,%xmm10
+  .byte  196,65,121,112,210,0                // vpshufd       $0x0,%xmm10,%xmm10
+  .byte  196,65,49,254,202                   // vpaddd        %xmm10,%xmm9,%xmm9
+  .byte  196,65,57,254,194                   // vpaddd        %xmm10,%xmm8,%xmm8
+  .byte  196,67,61,24,193,1                  // vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  196,66,125,24,8                     // vbroadcastss  (%r8),%ymm9
   .byte  196,65,60,87,209                    // vxorps        %ymm9,%ymm8,%ymm10
-  .byte  196,98,125,24,29,243,98,0,0         // vbroadcastss  0x62f3(%rip),%ymm11        # 6428 <_sk_callback_avx+0x12d>
+  .byte  196,98,125,24,29,244,98,0,0         // vbroadcastss  0x62f4(%rip),%ymm11        # 6430 <_sk_callback_avx+0x12d>
   .byte  196,65,44,84,203                    // vandps        %ymm11,%ymm10,%ymm9
   .byte  196,193,25,114,241,5                // vpslld        $0x5,%xmm9,%xmm12
   .byte  196,67,125,25,201,1                 // vextractf128  $0x1,%ymm9,%xmm9
@@ -14031,8 +14025,8 @@
   .byte  196,67,125,25,219,1                 // vextractf128  $0x1,%ymm11,%xmm11
   .byte  196,193,33,114,243,4                // vpslld        $0x4,%xmm11,%xmm11
   .byte  196,67,29,24,219,1                  // vinsertf128   $0x1,%xmm11,%ymm12,%ymm11
-  .byte  196,98,125,24,37,180,98,0,0         // vbroadcastss  0x62b4(%rip),%ymm12        # 642c <_sk_callback_avx+0x131>
-  .byte  196,98,125,24,45,175,98,0,0         // vbroadcastss  0x62af(%rip),%ymm13        # 6430 <_sk_callback_avx+0x135>
+  .byte  196,98,125,24,37,181,98,0,0         // vbroadcastss  0x62b5(%rip),%ymm12        # 6434 <_sk_callback_avx+0x131>
+  .byte  196,98,125,24,45,176,98,0,0         // vbroadcastss  0x62b0(%rip),%ymm13        # 6438 <_sk_callback_avx+0x135>
   .byte  196,65,44,84,245                    // vandps        %ymm13,%ymm10,%ymm14
   .byte  196,193,1,114,246,2                 // vpslld        $0x2,%xmm14,%xmm15
   .byte  196,67,125,25,246,1                 // vextractf128  $0x1,%ymm14,%xmm14
@@ -14055,13 +14049,13 @@
   .byte  196,67,29,24,192,1                  // vinsertf128   $0x1,%xmm8,%ymm12,%ymm8
   .byte  196,65,20,86,219                    // vorps         %ymm11,%ymm13,%ymm11
   .byte  196,65,36,86,192                    // vorps         %ymm8,%ymm11,%ymm8
-  .byte  196,65,52,86,206                    // vorps         %ymm14,%ymm9,%ymm9
   .byte  196,65,60,86,193                    // vorps         %ymm9,%ymm8,%ymm8
-  .byte  196,65,60,86,194                    // vorps         %ymm10,%ymm8,%ymm8
+  .byte  196,65,12,86,202                    // vorps         %ymm10,%ymm14,%ymm9
+  .byte  196,65,60,86,193                    // vorps         %ymm9,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,26,98,0,0          // vbroadcastss  0x621a(%rip),%ymm9        # 6434 <_sk_callback_avx+0x139>
+  .byte  196,98,125,24,13,27,98,0,0          // vbroadcastss  0x621b(%rip),%ymm9        # 643c <_sk_callback_avx+0x139>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
-  .byte  196,98,125,24,13,16,98,0,0          // vbroadcastss  0x6210(%rip),%ymm9        # 6438 <_sk_callback_avx+0x13d>
+  .byte  196,98,125,24,13,17,98,0,0          // vbroadcastss  0x6211(%rip),%ymm9        # 6440 <_sk_callback_avx+0x13d>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  196,98,125,24,72,8                  // vbroadcastss  0x8(%rax),%ymm9
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
@@ -14130,7 +14124,7 @@
 FUNCTION(_sk_srcatop_avx)
 _sk_srcatop_avx:
   .byte  197,252,89,199                      // vmulps        %ymm7,%ymm0,%ymm0
-  .byte  196,98,125,24,5,103,97,0,0          // vbroadcastss  0x6167(%rip),%ymm8        # 643c <_sk_callback_avx+0x141>
+  .byte  196,98,125,24,5,104,97,0,0          // vbroadcastss  0x6168(%rip),%ymm8        # 6444 <_sk_callback_avx+0x141>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,204                       // vmulps        %ymm4,%ymm8,%ymm9
   .byte  197,180,88,192                      // vaddps        %ymm0,%ymm9,%ymm0
@@ -14151,7 +14145,7 @@
 FUNCTION(_sk_dstatop_avx)
 _sk_dstatop_avx:
   .byte  197,100,89,196                      // vmulps        %ymm4,%ymm3,%ymm8
-  .byte  196,98,125,24,13,41,97,0,0          // vbroadcastss  0x6129(%rip),%ymm9        # 6440 <_sk_callback_avx+0x145>
+  .byte  196,98,125,24,13,42,97,0,0          // vbroadcastss  0x612a(%rip),%ymm9        # 6448 <_sk_callback_avx+0x145>
   .byte  197,52,92,207                       // vsubps        %ymm7,%ymm9,%ymm9
   .byte  197,180,89,192                      // vmulps        %ymm0,%ymm9,%ymm0
   .byte  197,188,88,192                      // vaddps        %ymm0,%ymm8,%ymm0
@@ -14193,7 +14187,7 @@
 .globl _sk_srcout_avx
 FUNCTION(_sk_srcout_avx)
 _sk_srcout_avx:
-  .byte  196,98,125,24,5,200,96,0,0          // vbroadcastss  0x60c8(%rip),%ymm8        # 6444 <_sk_callback_avx+0x149>
+  .byte  196,98,125,24,5,201,96,0,0          // vbroadcastss  0x60c9(%rip),%ymm8        # 644c <_sk_callback_avx+0x149>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
@@ -14206,7 +14200,7 @@
 .globl _sk_dstout_avx
 FUNCTION(_sk_dstout_avx)
 _sk_dstout_avx:
-  .byte  196,226,125,24,5,171,96,0,0         // vbroadcastss  0x60ab(%rip),%ymm0        # 6448 <_sk_callback_avx+0x14d>
+  .byte  196,226,125,24,5,172,96,0,0         // vbroadcastss  0x60ac(%rip),%ymm0        # 6450 <_sk_callback_avx+0x14d>
   .byte  197,252,92,219                      // vsubps        %ymm3,%ymm0,%ymm3
   .byte  197,228,89,196                      // vmulps        %ymm4,%ymm3,%ymm0
   .byte  197,228,89,205                      // vmulps        %ymm5,%ymm3,%ymm1
@@ -14219,7 +14213,7 @@
 .globl _sk_srcover_avx
 FUNCTION(_sk_srcover_avx)
 _sk_srcover_avx:
-  .byte  196,98,125,24,5,142,96,0,0          // vbroadcastss  0x608e(%rip),%ymm8        # 644c <_sk_callback_avx+0x151>
+  .byte  196,98,125,24,5,143,96,0,0          // vbroadcastss  0x608f(%rip),%ymm8        # 6454 <_sk_callback_avx+0x151>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,204                       // vmulps        %ymm4,%ymm8,%ymm9
   .byte  197,180,88,192                      // vaddps        %ymm0,%ymm9,%ymm0
@@ -14236,7 +14230,7 @@
 .globl _sk_dstover_avx
 FUNCTION(_sk_dstover_avx)
 _sk_dstover_avx:
-  .byte  196,98,125,24,5,97,96,0,0           // vbroadcastss  0x6061(%rip),%ymm8        # 6450 <_sk_callback_avx+0x155>
+  .byte  196,98,125,24,5,98,96,0,0           // vbroadcastss  0x6062(%rip),%ymm8        # 6458 <_sk_callback_avx+0x155>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,252,88,196                      // vaddps        %ymm4,%ymm0,%ymm0
@@ -14264,7 +14258,7 @@
 .globl _sk_multiply_avx
 FUNCTION(_sk_multiply_avx)
 _sk_multiply_avx:
-  .byte  196,98,125,24,5,32,96,0,0           // vbroadcastss  0x6020(%rip),%ymm8        # 6454 <_sk_callback_avx+0x159>
+  .byte  196,98,125,24,5,33,96,0,0           // vbroadcastss  0x6021(%rip),%ymm8        # 645c <_sk_callback_avx+0x159>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,52,89,208                       // vmulps        %ymm0,%ymm9,%ymm10
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -14324,7 +14318,7 @@
 .globl _sk_xor__avx
 FUNCTION(_sk_xor__avx)
 _sk_xor__avx:
-  .byte  196,98,125,24,5,111,95,0,0          // vbroadcastss  0x5f6f(%rip),%ymm8        # 6458 <_sk_callback_avx+0x15d>
+  .byte  196,98,125,24,5,112,95,0,0          // vbroadcastss  0x5f70(%rip),%ymm8        # 6460 <_sk_callback_avx+0x15d>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,180,89,192                      // vmulps        %ymm0,%ymm9,%ymm0
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -14361,7 +14355,7 @@
   .byte  197,100,89,206                      // vmulps        %ymm6,%ymm3,%ymm9
   .byte  196,193,108,95,209                  // vmaxps        %ymm9,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,239,94,0,0          // vbroadcastss  0x5eef(%rip),%ymm8        # 645c <_sk_callback_avx+0x161>
+  .byte  196,98,125,24,5,240,94,0,0          // vbroadcastss  0x5ef0(%rip),%ymm8        # 6464 <_sk_callback_avx+0x161>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,199                       // vmulps        %ymm7,%ymm8,%ymm8
   .byte  197,188,88,219                      // vaddps        %ymm3,%ymm8,%ymm3
@@ -14387,7 +14381,7 @@
   .byte  197,100,89,206                      // vmulps        %ymm6,%ymm3,%ymm9
   .byte  196,193,108,93,209                  // vminps        %ymm9,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,155,94,0,0          // vbroadcastss  0x5e9b(%rip),%ymm8        # 6460 <_sk_callback_avx+0x165>
+  .byte  196,98,125,24,5,156,94,0,0          // vbroadcastss  0x5e9c(%rip),%ymm8        # 6468 <_sk_callback_avx+0x165>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,199                       // vmulps        %ymm7,%ymm8,%ymm8
   .byte  197,188,88,219                      // vaddps        %ymm3,%ymm8,%ymm3
@@ -14416,7 +14410,7 @@
   .byte  196,193,108,93,209                  // vminps        %ymm9,%ymm2,%ymm2
   .byte  197,236,88,210                      // vaddps        %ymm2,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,59,94,0,0           // vbroadcastss  0x5e3b(%rip),%ymm8        # 6464 <_sk_callback_avx+0x169>
+  .byte  196,98,125,24,5,60,94,0,0           // vbroadcastss  0x5e3c(%rip),%ymm8        # 646c <_sk_callback_avx+0x169>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,199                       // vmulps        %ymm7,%ymm8,%ymm8
   .byte  197,188,88,219                      // vaddps        %ymm3,%ymm8,%ymm3
@@ -14439,7 +14433,7 @@
   .byte  197,236,89,214                      // vmulps        %ymm6,%ymm2,%ymm2
   .byte  197,236,88,210                      // vaddps        %ymm2,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,246,93,0,0          // vbroadcastss  0x5df6(%rip),%ymm8        # 6468 <_sk_callback_avx+0x16d>
+  .byte  196,98,125,24,5,247,93,0,0          // vbroadcastss  0x5df7(%rip),%ymm8        # 6470 <_sk_callback_avx+0x16d>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,199                       // vmulps        %ymm7,%ymm8,%ymm8
   .byte  197,188,88,219                      // vaddps        %ymm3,%ymm8,%ymm3
@@ -14450,7 +14444,7 @@
 .globl _sk_colorburn_avx
 FUNCTION(_sk_colorburn_avx)
 _sk_colorburn_avx:
-  .byte  196,98,125,24,5,225,93,0,0          // vbroadcastss  0x5de1(%rip),%ymm8        # 646c <_sk_callback_avx+0x171>
+  .byte  196,98,125,24,5,226,93,0,0          // vbroadcastss  0x5de2(%rip),%ymm8        # 6474 <_sk_callback_avx+0x171>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,52,89,216                       // vmulps        %ymm0,%ymm9,%ymm11
   .byte  196,65,44,87,210                    // vxorps        %ymm10,%ymm10,%ymm10
@@ -14512,7 +14506,7 @@
 FUNCTION(_sk_colordodge_avx)
 _sk_colordodge_avx:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
-  .byte  196,98,125,24,13,221,92,0,0         // vbroadcastss  0x5cdd(%rip),%ymm9        # 6470 <_sk_callback_avx+0x175>
+  .byte  196,98,125,24,13,222,92,0,0         // vbroadcastss  0x5cde(%rip),%ymm9        # 6478 <_sk_callback_avx+0x175>
   .byte  197,52,92,215                       // vsubps        %ymm7,%ymm9,%ymm10
   .byte  197,44,89,216                       // vmulps        %ymm0,%ymm10,%ymm11
   .byte  197,52,92,203                       // vsubps        %ymm3,%ymm9,%ymm9
@@ -14569,7 +14563,7 @@
 .globl _sk_hardlight_avx
 FUNCTION(_sk_hardlight_avx)
 _sk_hardlight_avx:
-  .byte  196,98,125,24,5,239,91,0,0          // vbroadcastss  0x5bef(%rip),%ymm8        # 6474 <_sk_callback_avx+0x179>
+  .byte  196,98,125,24,5,240,91,0,0          // vbroadcastss  0x5bf0(%rip),%ymm8        # 647c <_sk_callback_avx+0x179>
   .byte  197,60,92,215                       // vsubps        %ymm7,%ymm8,%ymm10
   .byte  197,44,89,200                       // vmulps        %ymm0,%ymm10,%ymm9
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -14624,7 +14618,7 @@
 .globl _sk_overlay_avx
 FUNCTION(_sk_overlay_avx)
 _sk_overlay_avx:
-  .byte  196,98,125,24,5,24,91,0,0           // vbroadcastss  0x5b18(%rip),%ymm8        # 6478 <_sk_callback_avx+0x17d>
+  .byte  196,98,125,24,5,25,91,0,0           // vbroadcastss  0x5b19(%rip),%ymm8        # 6480 <_sk_callback_avx+0x17d>
   .byte  197,60,92,215                       // vsubps        %ymm7,%ymm8,%ymm10
   .byte  197,44,89,200                       // vmulps        %ymm0,%ymm10,%ymm9
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -14690,10 +14684,10 @@
   .byte  196,65,60,88,192                    // vaddps        %ymm8,%ymm8,%ymm8
   .byte  196,65,60,89,216                    // vmulps        %ymm8,%ymm8,%ymm11
   .byte  196,65,60,88,195                    // vaddps        %ymm11,%ymm8,%ymm8
-  .byte  196,98,125,24,29,15,90,0,0          // vbroadcastss  0x5a0f(%rip),%ymm11        # 6480 <_sk_callback_avx+0x185>
+  .byte  196,98,125,24,29,16,90,0,0          // vbroadcastss  0x5a10(%rip),%ymm11        # 6488 <_sk_callback_avx+0x185>
   .byte  196,65,28,88,235                    // vaddps        %ymm11,%ymm12,%ymm13
   .byte  196,65,20,89,192                    // vmulps        %ymm8,%ymm13,%ymm8
-  .byte  196,98,125,24,45,0,90,0,0           // vbroadcastss  0x5a00(%rip),%ymm13        # 6484 <_sk_callback_avx+0x189>
+  .byte  196,98,125,24,45,1,90,0,0           // vbroadcastss  0x5a01(%rip),%ymm13        # 648c <_sk_callback_avx+0x189>
   .byte  196,65,28,89,245                    // vmulps        %ymm13,%ymm12,%ymm14
   .byte  196,65,12,88,192                    // vaddps        %ymm8,%ymm14,%ymm8
   .byte  196,65,124,82,244                   // vrsqrtps      %ymm12,%ymm14
@@ -14704,7 +14698,7 @@
   .byte  197,4,194,255,2                     // vcmpleps      %ymm7,%ymm15,%ymm15
   .byte  196,67,13,74,240,240                // vblendvps     %ymm15,%ymm8,%ymm14,%ymm14
   .byte  197,116,88,249                      // vaddps        %ymm1,%ymm1,%ymm15
-  .byte  196,98,125,24,5,190,89,0,0          // vbroadcastss  0x59be(%rip),%ymm8        # 647c <_sk_callback_avx+0x181>
+  .byte  196,98,125,24,5,191,89,0,0          // vbroadcastss  0x59bf(%rip),%ymm8        # 6484 <_sk_callback_avx+0x181>
   .byte  196,65,60,92,228                    // vsubps        %ymm12,%ymm8,%ymm12
   .byte  197,132,92,195                      // vsubps        %ymm3,%ymm15,%ymm0
   .byte  196,65,124,89,228                   // vmulps        %ymm12,%ymm0,%ymm12
@@ -14831,12 +14825,12 @@
   .byte  196,65,28,89,219                    // vmulps        %ymm11,%ymm12,%ymm11
   .byte  196,65,36,94,222                    // vdivps        %ymm14,%ymm11,%ymm11
   .byte  196,67,37,74,224,240                // vblendvps     %ymm15,%ymm8,%ymm11,%ymm12
-  .byte  196,98,125,24,53,141,87,0,0         // vbroadcastss  0x578d(%rip),%ymm14        # 6488 <_sk_callback_avx+0x18d>
+  .byte  196,98,125,24,53,142,87,0,0         // vbroadcastss  0x578e(%rip),%ymm14        # 6490 <_sk_callback_avx+0x18d>
   .byte  196,65,92,89,222                    // vmulps        %ymm14,%ymm4,%ymm11
-  .byte  196,98,125,24,61,131,87,0,0         // vbroadcastss  0x5783(%rip),%ymm15        # 648c <_sk_callback_avx+0x191>
+  .byte  196,98,125,24,61,132,87,0,0         // vbroadcastss  0x5784(%rip),%ymm15        # 6494 <_sk_callback_avx+0x191>
   .byte  196,65,84,89,239                    // vmulps        %ymm15,%ymm5,%ymm13
   .byte  196,65,36,88,221                    // vaddps        %ymm13,%ymm11,%ymm11
-  .byte  196,226,125,24,5,116,87,0,0         // vbroadcastss  0x5774(%rip),%ymm0        # 6490 <_sk_callback_avx+0x195>
+  .byte  196,226,125,24,5,117,87,0,0         // vbroadcastss  0x5775(%rip),%ymm0        # 6498 <_sk_callback_avx+0x195>
   .byte  197,76,89,232                       // vmulps        %ymm0,%ymm6,%ymm13
   .byte  196,65,36,88,221                    // vaddps        %ymm13,%ymm11,%ymm11
   .byte  196,65,52,89,238                    // vmulps        %ymm14,%ymm9,%ymm13
@@ -14897,7 +14891,7 @@
   .byte  196,65,36,95,208                    // vmaxps        %ymm8,%ymm11,%ymm10
   .byte  196,195,109,74,209,240              // vblendvps     %ymm15,%ymm9,%ymm2,%ymm2
   .byte  196,193,108,95,208                  // vmaxps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,77,86,0,0           // vbroadcastss  0x564d(%rip),%ymm8        # 6494 <_sk_callback_avx+0x199>
+  .byte  196,98,125,24,5,78,86,0,0           // vbroadcastss  0x564e(%rip),%ymm8        # 649c <_sk_callback_avx+0x199>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,180,89,201                      // vmulps        %ymm1,%ymm9,%ymm1
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -14954,12 +14948,12 @@
   .byte  196,65,28,89,219                    // vmulps        %ymm11,%ymm12,%ymm11
   .byte  196,65,36,94,222                    // vdivps        %ymm14,%ymm11,%ymm11
   .byte  196,67,37,74,224,240                // vblendvps     %ymm15,%ymm8,%ymm11,%ymm12
-  .byte  196,98,125,24,53,91,85,0,0          // vbroadcastss  0x555b(%rip),%ymm14        # 6498 <_sk_callback_avx+0x19d>
+  .byte  196,98,125,24,53,92,85,0,0          // vbroadcastss  0x555c(%rip),%ymm14        # 64a0 <_sk_callback_avx+0x19d>
   .byte  196,65,92,89,222                    // vmulps        %ymm14,%ymm4,%ymm11
-  .byte  196,98,125,24,61,81,85,0,0          // vbroadcastss  0x5551(%rip),%ymm15        # 649c <_sk_callback_avx+0x1a1>
+  .byte  196,98,125,24,61,82,85,0,0          // vbroadcastss  0x5552(%rip),%ymm15        # 64a4 <_sk_callback_avx+0x1a1>
   .byte  196,65,84,89,239                    // vmulps        %ymm15,%ymm5,%ymm13
   .byte  196,65,36,88,221                    // vaddps        %ymm13,%ymm11,%ymm11
-  .byte  196,226,125,24,5,66,85,0,0          // vbroadcastss  0x5542(%rip),%ymm0        # 64a0 <_sk_callback_avx+0x1a5>
+  .byte  196,226,125,24,5,67,85,0,0          // vbroadcastss  0x5543(%rip),%ymm0        # 64a8 <_sk_callback_avx+0x1a5>
   .byte  197,76,89,232                       // vmulps        %ymm0,%ymm6,%ymm13
   .byte  196,65,36,88,221                    // vaddps        %ymm13,%ymm11,%ymm11
   .byte  196,65,52,89,238                    // vmulps        %ymm14,%ymm9,%ymm13
@@ -15020,7 +15014,7 @@
   .byte  196,65,36,95,208                    // vmaxps        %ymm8,%ymm11,%ymm10
   .byte  196,195,109,74,209,240              // vblendvps     %ymm15,%ymm9,%ymm2,%ymm2
   .byte  196,193,108,95,208                  // vmaxps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,27,84,0,0           // vbroadcastss  0x541b(%rip),%ymm8        # 64a4 <_sk_callback_avx+0x1a9>
+  .byte  196,98,125,24,5,28,84,0,0           // vbroadcastss  0x541c(%rip),%ymm8        # 64ac <_sk_callback_avx+0x1a9>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,180,89,201                      // vmulps        %ymm1,%ymm9,%ymm1
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -15049,12 +15043,12 @@
   .byte  197,252,17,68,36,168                // vmovups       %ymm0,-0x58(%rsp)
   .byte  197,124,89,199                      // vmulps        %ymm7,%ymm0,%ymm8
   .byte  197,116,89,207                      // vmulps        %ymm7,%ymm1,%ymm9
-  .byte  196,98,125,24,45,177,83,0,0         // vbroadcastss  0x53b1(%rip),%ymm13        # 64a8 <_sk_callback_avx+0x1ad>
+  .byte  196,98,125,24,45,178,83,0,0         // vbroadcastss  0x53b2(%rip),%ymm13        # 64b0 <_sk_callback_avx+0x1ad>
   .byte  196,65,92,89,213                    // vmulps        %ymm13,%ymm4,%ymm10
-  .byte  196,98,125,24,53,167,83,0,0         // vbroadcastss  0x53a7(%rip),%ymm14        # 64ac <_sk_callback_avx+0x1b1>
+  .byte  196,98,125,24,53,168,83,0,0         // vbroadcastss  0x53a8(%rip),%ymm14        # 64b4 <_sk_callback_avx+0x1b1>
   .byte  196,65,84,89,222                    // vmulps        %ymm14,%ymm5,%ymm11
   .byte  196,65,44,88,211                    // vaddps        %ymm11,%ymm10,%ymm10
-  .byte  196,98,125,24,61,152,83,0,0         // vbroadcastss  0x5398(%rip),%ymm15        # 64b0 <_sk_callback_avx+0x1b5>
+  .byte  196,98,125,24,61,153,83,0,0         // vbroadcastss  0x5399(%rip),%ymm15        # 64b8 <_sk_callback_avx+0x1b5>
   .byte  196,65,76,89,223                    // vmulps        %ymm15,%ymm6,%ymm11
   .byte  196,193,44,88,195                   // vaddps        %ymm11,%ymm10,%ymm0
   .byte  196,65,60,89,221                    // vmulps        %ymm13,%ymm8,%ymm11
@@ -15117,7 +15111,7 @@
   .byte  196,65,44,95,207                    // vmaxps        %ymm15,%ymm10,%ymm9
   .byte  196,195,37,74,192,0                 // vblendvps     %ymm0,%ymm8,%ymm11,%ymm0
   .byte  196,65,124,95,199                   // vmaxps        %ymm15,%ymm0,%ymm8
-  .byte  196,226,125,24,5,95,82,0,0          // vbroadcastss  0x525f(%rip),%ymm0        # 64b4 <_sk_callback_avx+0x1b9>
+  .byte  196,226,125,24,5,96,82,0,0          // vbroadcastss  0x5260(%rip),%ymm0        # 64bc <_sk_callback_avx+0x1b9>
   .byte  197,124,92,215                      // vsubps        %ymm7,%ymm0,%ymm10
   .byte  197,172,89,84,36,168                // vmulps        -0x58(%rsp),%ymm10,%ymm2
   .byte  197,124,92,219                      // vsubps        %ymm3,%ymm0,%ymm11
@@ -15147,12 +15141,12 @@
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
   .byte  197,100,89,196                      // vmulps        %ymm4,%ymm3,%ymm8
   .byte  197,100,89,205                      // vmulps        %ymm5,%ymm3,%ymm9
-  .byte  196,98,125,24,45,241,81,0,0         // vbroadcastss  0x51f1(%rip),%ymm13        # 64b8 <_sk_callback_avx+0x1bd>
+  .byte  196,98,125,24,45,242,81,0,0         // vbroadcastss  0x51f2(%rip),%ymm13        # 64c0 <_sk_callback_avx+0x1bd>
   .byte  196,65,108,89,213                   // vmulps        %ymm13,%ymm2,%ymm10
-  .byte  196,98,125,24,53,231,81,0,0         // vbroadcastss  0x51e7(%rip),%ymm14        # 64bc <_sk_callback_avx+0x1c1>
+  .byte  196,98,125,24,53,232,81,0,0         // vbroadcastss  0x51e8(%rip),%ymm14        # 64c4 <_sk_callback_avx+0x1c1>
   .byte  196,65,116,89,222                   // vmulps        %ymm14,%ymm1,%ymm11
   .byte  196,65,44,88,211                    // vaddps        %ymm11,%ymm10,%ymm10
-  .byte  196,98,125,24,61,216,81,0,0         // vbroadcastss  0x51d8(%rip),%ymm15        # 64c0 <_sk_callback_avx+0x1c5>
+  .byte  196,98,125,24,61,217,81,0,0         // vbroadcastss  0x51d9(%rip),%ymm15        # 64c8 <_sk_callback_avx+0x1c5>
   .byte  196,65,28,89,223                    // vmulps        %ymm15,%ymm12,%ymm11
   .byte  196,193,44,88,195                   // vaddps        %ymm11,%ymm10,%ymm0
   .byte  196,65,60,89,221                    // vmulps        %ymm13,%ymm8,%ymm11
@@ -15215,7 +15209,7 @@
   .byte  196,65,44,95,207                    // vmaxps        %ymm15,%ymm10,%ymm9
   .byte  196,195,37,74,192,0                 // vblendvps     %ymm0,%ymm8,%ymm11,%ymm0
   .byte  196,65,124,95,199                   // vmaxps        %ymm15,%ymm0,%ymm8
-  .byte  196,226,125,24,5,159,80,0,0         // vbroadcastss  0x509f(%rip),%ymm0        # 64c4 <_sk_callback_avx+0x1c9>
+  .byte  196,226,125,24,5,160,80,0,0         // vbroadcastss  0x50a0(%rip),%ymm0        # 64cc <_sk_callback_avx+0x1c9>
   .byte  197,124,92,215                      // vsubps        %ymm7,%ymm0,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,124,92,219                      // vsubps        %ymm3,%ymm0,%ymm11
@@ -15251,7 +15245,7 @@
 .globl _sk_clamp_1_avx
 FUNCTION(_sk_clamp_1_avx)
 _sk_clamp_1_avx:
-  .byte  196,98,125,24,5,50,80,0,0           // vbroadcastss  0x5032(%rip),%ymm8        # 64c8 <_sk_callback_avx+0x1cd>
+  .byte  196,98,125,24,5,51,80,0,0           // vbroadcastss  0x5033(%rip),%ymm8        # 64d0 <_sk_callback_avx+0x1cd>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  196,193,116,93,200                  // vminps        %ymm8,%ymm1,%ymm1
   .byte  196,193,108,93,208                  // vminps        %ymm8,%ymm2,%ymm2
@@ -15263,7 +15257,7 @@
 .globl _sk_clamp_a_avx
 FUNCTION(_sk_clamp_a_avx)
 _sk_clamp_a_avx:
-  .byte  196,98,125,24,5,21,80,0,0           // vbroadcastss  0x5015(%rip),%ymm8        # 64cc <_sk_callback_avx+0x1d1>
+  .byte  196,98,125,24,5,22,80,0,0           // vbroadcastss  0x5016(%rip),%ymm8        # 64d4 <_sk_callback_avx+0x1d1>
   .byte  196,193,100,93,216                  // vminps        %ymm8,%ymm3,%ymm3
   .byte  197,252,93,195                      // vminps        %ymm3,%ymm0,%ymm0
   .byte  197,244,93,203                      // vminps        %ymm3,%ymm1,%ymm1
@@ -15349,7 +15343,7 @@
 _sk_unpremul_avx:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,65,100,194,200,0                // vcmpeqps      %ymm8,%ymm3,%ymm9
-  .byte  196,98,125,24,21,93,79,0,0          // vbroadcastss  0x4f5d(%rip),%ymm10        # 64d0 <_sk_callback_avx+0x1d5>
+  .byte  196,98,125,24,21,94,79,0,0          // vbroadcastss  0x4f5e(%rip),%ymm10        # 64d8 <_sk_callback_avx+0x1d5>
   .byte  197,44,94,211                       // vdivps        %ymm3,%ymm10,%ymm10
   .byte  196,67,45,74,192,144                // vblendvps     %ymm9,%ymm8,%ymm10,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
@@ -15362,17 +15356,17 @@
 .globl _sk_from_srgb_avx
 FUNCTION(_sk_from_srgb_avx)
 _sk_from_srgb_avx:
-  .byte  196,98,125,24,5,62,79,0,0           // vbroadcastss  0x4f3e(%rip),%ymm8        # 64d4 <_sk_callback_avx+0x1d9>
+  .byte  196,98,125,24,5,63,79,0,0           // vbroadcastss  0x4f3f(%rip),%ymm8        # 64dc <_sk_callback_avx+0x1d9>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  197,124,89,208                      // vmulps        %ymm0,%ymm0,%ymm10
-  .byte  196,98,125,24,29,48,79,0,0          // vbroadcastss  0x4f30(%rip),%ymm11        # 64d8 <_sk_callback_avx+0x1dd>
+  .byte  196,98,125,24,29,49,79,0,0          // vbroadcastss  0x4f31(%rip),%ymm11        # 64e0 <_sk_callback_avx+0x1dd>
   .byte  196,65,124,89,227                   // vmulps        %ymm11,%ymm0,%ymm12
-  .byte  196,98,125,24,45,38,79,0,0          // vbroadcastss  0x4f26(%rip),%ymm13        # 64dc <_sk_callback_avx+0x1e1>
+  .byte  196,98,125,24,45,39,79,0,0          // vbroadcastss  0x4f27(%rip),%ymm13        # 64e4 <_sk_callback_avx+0x1e1>
   .byte  196,65,28,88,229                    // vaddps        %ymm13,%ymm12,%ymm12
   .byte  196,65,44,89,212                    // vmulps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,23,79,0,0          // vbroadcastss  0x4f17(%rip),%ymm12        # 64e0 <_sk_callback_avx+0x1e5>
+  .byte  196,98,125,24,37,24,79,0,0          // vbroadcastss  0x4f18(%rip),%ymm12        # 64e8 <_sk_callback_avx+0x1e5>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,53,13,79,0,0          // vbroadcastss  0x4f0d(%rip),%ymm14        # 64e4 <_sk_callback_avx+0x1e9>
+  .byte  196,98,125,24,53,14,79,0,0          // vbroadcastss  0x4f0e(%rip),%ymm14        # 64ec <_sk_callback_avx+0x1e9>
   .byte  196,193,124,194,198,1               // vcmpltps      %ymm14,%ymm0,%ymm0
   .byte  196,195,45,74,193,0                 // vblendvps     %ymm0,%ymm9,%ymm10,%ymm0
   .byte  196,65,116,89,200                   // vmulps        %ymm8,%ymm1,%ymm9
@@ -15399,20 +15393,20 @@
 FUNCTION(_sk_to_srgb_avx)
 _sk_to_srgb_avx:
   .byte  197,124,82,200                      // vrsqrtps      %ymm0,%ymm9
-  .byte  196,98,125,24,5,162,78,0,0          // vbroadcastss  0x4ea2(%rip),%ymm8        # 64e8 <_sk_callback_avx+0x1ed>
+  .byte  196,98,125,24,5,163,78,0,0          // vbroadcastss  0x4ea3(%rip),%ymm8        # 64f0 <_sk_callback_avx+0x1ed>
   .byte  196,65,124,89,208                   // vmulps        %ymm8,%ymm0,%ymm10
-  .byte  196,98,125,24,29,152,78,0,0         // vbroadcastss  0x4e98(%rip),%ymm11        # 64ec <_sk_callback_avx+0x1f1>
+  .byte  196,98,125,24,29,153,78,0,0         // vbroadcastss  0x4e99(%rip),%ymm11        # 64f4 <_sk_callback_avx+0x1f1>
   .byte  196,65,52,89,227                    // vmulps        %ymm11,%ymm9,%ymm12
-  .byte  196,98,125,24,45,142,78,0,0         // vbroadcastss  0x4e8e(%rip),%ymm13        # 64f0 <_sk_callback_avx+0x1f5>
+  .byte  196,98,125,24,45,143,78,0,0         // vbroadcastss  0x4e8f(%rip),%ymm13        # 64f8 <_sk_callback_avx+0x1f5>
   .byte  196,65,28,88,229                    // vaddps        %ymm13,%ymm12,%ymm12
   .byte  196,65,52,89,228                    // vmulps        %ymm12,%ymm9,%ymm12
-  .byte  196,98,125,24,53,127,78,0,0         // vbroadcastss  0x4e7f(%rip),%ymm14        # 64f4 <_sk_callback_avx+0x1f9>
+  .byte  196,98,125,24,53,128,78,0,0         // vbroadcastss  0x4e80(%rip),%ymm14        # 64fc <_sk_callback_avx+0x1f9>
   .byte  196,65,28,88,230                    // vaddps        %ymm14,%ymm12,%ymm12
-  .byte  196,98,125,24,61,117,78,0,0         // vbroadcastss  0x4e75(%rip),%ymm15        # 64f8 <_sk_callback_avx+0x1fd>
+  .byte  196,98,125,24,61,118,78,0,0         // vbroadcastss  0x4e76(%rip),%ymm15        # 6500 <_sk_callback_avx+0x1fd>
   .byte  196,65,52,88,207                    // vaddps        %ymm15,%ymm9,%ymm9
   .byte  196,65,124,83,201                   // vrcpps        %ymm9,%ymm9
   .byte  196,65,52,89,204                    // vmulps        %ymm12,%ymm9,%ymm9
-  .byte  196,98,125,24,37,97,78,0,0          // vbroadcastss  0x4e61(%rip),%ymm12        # 64fc <_sk_callback_avx+0x201>
+  .byte  196,98,125,24,37,98,78,0,0          // vbroadcastss  0x4e62(%rip),%ymm12        # 6504 <_sk_callback_avx+0x201>
   .byte  196,193,124,194,196,1               // vcmpltps      %ymm12,%ymm0,%ymm0
   .byte  196,195,53,74,194,0                 // vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   .byte  197,124,82,201                      // vrsqrtps      %ymm1,%ymm9
@@ -15449,7 +15443,7 @@
   .byte  197,124,93,201                      // vminps        %ymm1,%ymm0,%ymm9
   .byte  197,52,93,202                       // vminps        %ymm2,%ymm9,%ymm9
   .byte  196,65,60,92,209                    // vsubps        %ymm9,%ymm8,%ymm10
-  .byte  196,98,125,24,29,199,77,0,0         // vbroadcastss  0x4dc7(%rip),%ymm11        # 6500 <_sk_callback_avx+0x205>
+  .byte  196,98,125,24,29,200,77,0,0         // vbroadcastss  0x4dc8(%rip),%ymm11        # 6508 <_sk_callback_avx+0x205>
   .byte  196,65,36,94,218                    // vdivps        %ymm10,%ymm11,%ymm11
   .byte  197,116,92,226                      // vsubps        %ymm2,%ymm1,%ymm12
   .byte  196,65,28,89,227                    // vmulps        %ymm11,%ymm12,%ymm12
@@ -15459,19 +15453,19 @@
   .byte  196,193,108,89,211                  // vmulps        %ymm11,%ymm2,%ymm2
   .byte  197,252,92,201                      // vsubps        %ymm1,%ymm0,%ymm1
   .byte  196,193,116,89,203                  // vmulps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,160,77,0,0         // vbroadcastss  0x4da0(%rip),%ymm11        # 650c <_sk_callback_avx+0x211>
+  .byte  196,98,125,24,29,161,77,0,0         // vbroadcastss  0x4da1(%rip),%ymm11        # 6514 <_sk_callback_avx+0x211>
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,142,77,0,0         // vbroadcastss  0x4d8e(%rip),%ymm11        # 6508 <_sk_callback_avx+0x20d>
+  .byte  196,98,125,24,29,143,77,0,0         // vbroadcastss  0x4d8f(%rip),%ymm11        # 6510 <_sk_callback_avx+0x20d>
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
   .byte  196,227,117,74,202,224              // vblendvps     %ymm14,%ymm2,%ymm1,%ymm1
-  .byte  196,226,125,24,21,118,77,0,0        // vbroadcastss  0x4d76(%rip),%ymm2        # 6504 <_sk_callback_avx+0x209>
+  .byte  196,226,125,24,21,119,77,0,0        // vbroadcastss  0x4d77(%rip),%ymm2        # 650c <_sk_callback_avx+0x209>
   .byte  196,65,12,87,246                    // vxorps        %ymm14,%ymm14,%ymm14
   .byte  196,227,13,74,210,208               // vblendvps     %ymm13,%ymm2,%ymm14,%ymm2
   .byte  197,188,194,192,0                   // vcmpeqps      %ymm0,%ymm8,%ymm0
   .byte  196,193,108,88,212                  // vaddps        %ymm12,%ymm2,%ymm2
   .byte  196,227,117,74,194,0                // vblendvps     %ymm0,%ymm2,%ymm1,%ymm0
   .byte  196,193,60,88,201                   // vaddps        %ymm9,%ymm8,%ymm1
-  .byte  196,98,125,24,37,93,77,0,0          // vbroadcastss  0x4d5d(%rip),%ymm12        # 6514 <_sk_callback_avx+0x219>
+  .byte  196,98,125,24,37,94,77,0,0          // vbroadcastss  0x4d5e(%rip),%ymm12        # 651c <_sk_callback_avx+0x219>
   .byte  196,193,116,89,212                  // vmulps        %ymm12,%ymm1,%ymm2
   .byte  197,28,194,226,1                    // vcmpltps      %ymm2,%ymm12,%ymm12
   .byte  196,65,36,92,216                    // vsubps        %ymm8,%ymm11,%ymm11
@@ -15481,7 +15475,7 @@
   .byte  197,172,94,201                      // vdivps        %ymm1,%ymm10,%ymm1
   .byte  196,195,125,74,198,128              // vblendvps     %ymm8,%ymm14,%ymm0,%ymm0
   .byte  196,195,117,74,206,128              // vblendvps     %ymm8,%ymm14,%ymm1,%ymm1
-  .byte  196,98,125,24,5,32,77,0,0           // vbroadcastss  0x4d20(%rip),%ymm8        # 6510 <_sk_callback_avx+0x215>
+  .byte  196,98,125,24,5,33,77,0,0           // vbroadcastss  0x4d21(%rip),%ymm8        # 6518 <_sk_callback_avx+0x215>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -15498,7 +15492,7 @@
   .byte  197,252,17,92,36,128                // vmovups       %ymm3,-0x80(%rsp)
   .byte  197,252,40,225                      // vmovaps       %ymm1,%ymm4
   .byte  197,252,40,216                      // vmovaps       %ymm0,%ymm3
-  .byte  196,98,125,24,5,237,76,0,0          // vbroadcastss  0x4ced(%rip),%ymm8        # 6518 <_sk_callback_avx+0x21d>
+  .byte  196,98,125,24,5,238,76,0,0          // vbroadcastss  0x4cee(%rip),%ymm8        # 6520 <_sk_callback_avx+0x21d>
   .byte  197,60,194,202,2                    // vcmpleps      %ymm2,%ymm8,%ymm9
   .byte  197,92,89,210                       // vmulps        %ymm2,%ymm4,%ymm10
   .byte  196,65,92,92,218                    // vsubps        %ymm10,%ymm4,%ymm11
@@ -15506,23 +15500,23 @@
   .byte  197,52,88,210                       // vaddps        %ymm2,%ymm9,%ymm10
   .byte  197,108,88,202                      // vaddps        %ymm2,%ymm2,%ymm9
   .byte  196,65,52,92,202                    // vsubps        %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,24,29,199,76,0,0         // vbroadcastss  0x4cc7(%rip),%ymm11        # 651c <_sk_callback_avx+0x221>
+  .byte  196,98,125,24,29,200,76,0,0         // vbroadcastss  0x4cc8(%rip),%ymm11        # 6524 <_sk_callback_avx+0x221>
   .byte  196,65,100,88,219                   // vaddps        %ymm11,%ymm3,%ymm11
   .byte  196,67,125,8,227,1                  // vroundps      $0x1,%ymm11,%ymm12
   .byte  196,65,36,92,252                    // vsubps        %ymm12,%ymm11,%ymm15
   .byte  196,65,44,92,217                    // vsubps        %ymm9,%ymm10,%ymm11
-  .byte  196,98,125,24,37,177,76,0,0         // vbroadcastss  0x4cb1(%rip),%ymm12        # 6524 <_sk_callback_avx+0x229>
+  .byte  196,98,125,24,37,178,76,0,0         // vbroadcastss  0x4cb2(%rip),%ymm12        # 652c <_sk_callback_avx+0x229>
   .byte  196,193,4,89,196                    // vmulps        %ymm12,%ymm15,%ymm0
-  .byte  196,98,125,24,45,167,76,0,0         // vbroadcastss  0x4ca7(%rip),%ymm13        # 6528 <_sk_callback_avx+0x22d>
+  .byte  196,98,125,24,45,168,76,0,0         // vbroadcastss  0x4ca8(%rip),%ymm13        # 6530 <_sk_callback_avx+0x22d>
   .byte  197,20,92,240                       // vsubps        %ymm0,%ymm13,%ymm14
   .byte  196,65,36,89,246                    // vmulps        %ymm14,%ymm11,%ymm14
   .byte  196,65,52,88,246                    // vaddps        %ymm14,%ymm9,%ymm14
-  .byte  196,226,125,24,13,136,76,0,0        // vbroadcastss  0x4c88(%rip),%ymm1        # 6520 <_sk_callback_avx+0x225>
+  .byte  196,226,125,24,13,137,76,0,0        // vbroadcastss  0x4c89(%rip),%ymm1        # 6528 <_sk_callback_avx+0x225>
   .byte  196,193,116,194,255,2               // vcmpleps      %ymm15,%ymm1,%ymm7
   .byte  196,195,13,74,249,112               // vblendvps     %ymm7,%ymm9,%ymm14,%ymm7
   .byte  196,65,60,194,247,2                 // vcmpleps      %ymm15,%ymm8,%ymm14
   .byte  196,227,45,74,255,224               // vblendvps     %ymm14,%ymm7,%ymm10,%ymm7
-  .byte  196,98,125,24,53,115,76,0,0         // vbroadcastss  0x4c73(%rip),%ymm14        # 652c <_sk_callback_avx+0x231>
+  .byte  196,98,125,24,53,116,76,0,0         // vbroadcastss  0x4c74(%rip),%ymm14        # 6534 <_sk_callback_avx+0x231>
   .byte  196,65,12,194,255,2                 // vcmpleps      %ymm15,%ymm14,%ymm15
   .byte  196,193,124,89,195                  // vmulps        %ymm11,%ymm0,%ymm0
   .byte  197,180,88,192                      // vaddps        %ymm0,%ymm9,%ymm0
@@ -15541,7 +15535,7 @@
   .byte  197,164,89,247                      // vmulps        %ymm7,%ymm11,%ymm6
   .byte  197,180,88,246                      // vaddps        %ymm6,%ymm9,%ymm6
   .byte  196,227,77,74,237,0                 // vblendvps     %ymm0,%ymm5,%ymm6,%ymm5
-  .byte  196,226,125,24,5,21,76,0,0          // vbroadcastss  0x4c15(%rip),%ymm0        # 6530 <_sk_callback_avx+0x235>
+  .byte  196,226,125,24,5,22,76,0,0          // vbroadcastss  0x4c16(%rip),%ymm0        # 6538 <_sk_callback_avx+0x235>
   .byte  197,228,88,192                      // vaddps        %ymm0,%ymm3,%ymm0
   .byte  196,227,125,8,216,1                 // vroundps      $0x1,%ymm0,%ymm3
   .byte  197,252,92,195                      // vsubps        %ymm3,%ymm0,%ymm0
@@ -15593,14 +15587,14 @@
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  72,1,248                            // add           %rdi,%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,68                              // jne           1a12 <_sk_scale_u8_avx+0x54>
+  .byte  117,68                              // jne           1a19 <_sk_scale_u8_avx+0x54>
   .byte  197,122,126,0                       // vmovq         (%rax),%xmm8
   .byte  196,66,121,49,200                   // vpmovzxbd     %xmm8,%xmm9
   .byte  196,67,121,4,192,229                // vpermilps     $0xe5,%xmm8,%xmm8
   .byte  196,66,121,49,192                   // vpmovzxbd     %xmm8,%xmm8
   .byte  196,67,53,24,192,1                  // vinsertf128   $0x1,%xmm8,%ymm9,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,62,75,0,0          // vbroadcastss  0x4b3e(%rip),%ymm9        # 6534 <_sk_callback_avx+0x239>
+  .byte  196,98,125,24,13,63,75,0,0          // vbroadcastss  0x4b3f(%rip),%ymm9        # 653c <_sk_callback_avx+0x239>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
@@ -15618,9 +15612,9 @@
   .byte  77,9,217                            // or            %r11,%r9
   .byte  72,131,193,8                        // add           $0x8,%rcx
   .byte  73,255,202                          // dec           %r10
-  .byte  117,234                             // jne           1a1a <_sk_scale_u8_avx+0x5c>
+  .byte  117,234                             // jne           1a21 <_sk_scale_u8_avx+0x5c>
   .byte  196,65,249,110,193                  // vmovq         %r9,%xmm8
-  .byte  235,155                             // jmp           19d2 <_sk_scale_u8_avx+0x14>
+  .byte  235,155                             // jmp           19d9 <_sk_scale_u8_avx+0x14>
 
 HIDDEN _sk_lerp_1_float_avx
 .globl _sk_lerp_1_float_avx
@@ -15652,14 +15646,14 @@
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  72,1,248                            // add           %rdi,%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,104                             // jne           1aee <_sk_lerp_u8_avx+0x78>
+  .byte  117,104                             // jne           1af5 <_sk_lerp_u8_avx+0x78>
   .byte  197,122,126,0                       // vmovq         (%rax),%xmm8
   .byte  196,66,121,49,200                   // vpmovzxbd     %xmm8,%xmm9
   .byte  196,67,121,4,192,229                // vpermilps     $0xe5,%xmm8,%xmm8
   .byte  196,66,121,49,192                   // vpmovzxbd     %xmm8,%xmm8
   .byte  196,67,53,24,192,1                  // vinsertf128   $0x1,%xmm8,%ymm9,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,138,74,0,0         // vbroadcastss  0x4a8a(%rip),%ymm9        # 6538 <_sk_callback_avx+0x23d>
+  .byte  196,98,125,24,13,139,74,0,0         // vbroadcastss  0x4a8b(%rip),%ymm9        # 6540 <_sk_callback_avx+0x23d>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
@@ -15685,9 +15679,9 @@
   .byte  77,9,217                            // or            %r11,%r9
   .byte  72,131,193,8                        // add           $0x8,%rcx
   .byte  73,255,202                          // dec           %r10
-  .byte  117,234                             // jne           1af6 <_sk_lerp_u8_avx+0x80>
+  .byte  117,234                             // jne           1afd <_sk_lerp_u8_avx+0x80>
   .byte  196,65,249,110,193                  // vmovq         %r9,%xmm8
-  .byte  233,116,255,255,255                 // jmpq          1a8a <_sk_lerp_u8_avx+0x14>
+  .byte  233,116,255,255,255                 // jmpq          1a91 <_sk_lerp_u8_avx+0x14>
 
 HIDDEN _sk_lerp_565_avx
 .globl _sk_lerp_565_avx
@@ -15696,26 +15690,26 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,208,0,0,0                    // jne           1bf4 <_sk_lerp_565_avx+0xde>
+  .byte  15,133,208,0,0,0                    // jne           1bfb <_sk_lerp_565_avx+0xde>
   .byte  196,65,122,111,4,122                // vmovdqu       (%r10,%rdi,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  196,65,57,105,201                   // vpunpckhwd    %xmm9,%xmm8,%xmm9
   .byte  196,66,121,51,192                   // vpmovzxwd     %xmm8,%xmm8
   .byte  196,67,61,24,193,1                  // vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
-  .byte  196,98,125,24,13,244,73,0,0         // vbroadcastss  0x49f4(%rip),%ymm9        # 653c <_sk_callback_avx+0x241>
+  .byte  196,98,125,24,13,245,73,0,0         // vbroadcastss  0x49f5(%rip),%ymm9        # 6544 <_sk_callback_avx+0x241>
   .byte  196,65,60,84,201                    // vandps        %ymm9,%ymm8,%ymm9
   .byte  196,65,124,91,201                   // vcvtdq2ps     %ymm9,%ymm9
-  .byte  196,98,125,24,21,229,73,0,0         // vbroadcastss  0x49e5(%rip),%ymm10        # 6540 <_sk_callback_avx+0x245>
+  .byte  196,98,125,24,21,230,73,0,0         // vbroadcastss  0x49e6(%rip),%ymm10        # 6548 <_sk_callback_avx+0x245>
   .byte  196,65,52,89,202                    // vmulps        %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,24,21,219,73,0,0         // vbroadcastss  0x49db(%rip),%ymm10        # 6544 <_sk_callback_avx+0x249>
+  .byte  196,98,125,24,21,220,73,0,0         // vbroadcastss  0x49dc(%rip),%ymm10        # 654c <_sk_callback_avx+0x249>
   .byte  196,65,60,84,210                    // vandps        %ymm10,%ymm8,%ymm10
   .byte  196,65,124,91,210                   // vcvtdq2ps     %ymm10,%ymm10
-  .byte  196,98,125,24,29,204,73,0,0         // vbroadcastss  0x49cc(%rip),%ymm11        # 6548 <_sk_callback_avx+0x24d>
+  .byte  196,98,125,24,29,205,73,0,0         // vbroadcastss  0x49cd(%rip),%ymm11        # 6550 <_sk_callback_avx+0x24d>
   .byte  196,65,44,89,211                    // vmulps        %ymm11,%ymm10,%ymm10
-  .byte  196,98,125,24,29,194,73,0,0         // vbroadcastss  0x49c2(%rip),%ymm11        # 654c <_sk_callback_avx+0x251>
+  .byte  196,98,125,24,29,195,73,0,0         // vbroadcastss  0x49c3(%rip),%ymm11        # 6554 <_sk_callback_avx+0x251>
   .byte  196,65,60,84,195                    // vandps        %ymm11,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,29,179,73,0,0         // vbroadcastss  0x49b3(%rip),%ymm11        # 6550 <_sk_callback_avx+0x255>
+  .byte  196,98,125,24,29,180,73,0,0         // vbroadcastss  0x49b4(%rip),%ymm11        # 6558 <_sk_callback_avx+0x255>
   .byte  196,65,60,89,195                    // vmulps        %ymm11,%ymm8,%ymm8
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
@@ -15742,9 +15736,9 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  15,135,29,255,255,255               // ja            1b2a <_sk_lerp_565_avx+0x14>
+  .byte  15,135,29,255,255,255               // ja            1b31 <_sk_lerp_565_avx+0x14>
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,76,0,0,0                  // lea           0x4c(%rip),%r9        # 1c64 <_sk_lerp_565_avx+0x14e>
+  .byte  76,141,13,77,0,0,0                  // lea           0x4d(%rip),%r9        # 1c6c <_sk_lerp_565_avx+0x14f>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -15756,28 +15750,26 @@
   .byte  196,65,57,196,68,122,4,2            // vpinsrw       $0x2,0x4(%r10,%rdi,2),%xmm8,%xmm8
   .byte  196,65,57,196,68,122,2,1            // vpinsrw       $0x1,0x2(%r10,%rdi,2),%xmm8,%xmm8
   .byte  196,65,57,196,4,122,0               // vpinsrw       $0x0,(%r10,%rdi,2),%xmm8,%xmm8
-  .byte  233,200,254,255,255                 // jmpq          1b2a <_sk_lerp_565_avx+0x14>
-  .byte  102,144                             // xchg          %ax,%ax
-  .byte  242,255                             // repnz         (bad)
-  .byte  255                                 // (bad)
-  .byte  255                                 // (bad)
-  .byte  234                                 // (bad)
-  .byte  255                                 // (bad)
-  .byte  255                                 // (bad)
-  .byte  255,226                             // jmpq          *%rdx
+  .byte  233,200,254,255,255                 // jmpq          1b31 <_sk_lerp_565_avx+0x14>
+  .byte  15,31,0                             // nopl          (%rax)
+  .byte  241                                 // icebp
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  218,255                             // (bad)
-  .byte  255                                 // (bad)
-  .byte  255,210                             // callq         *%rdx
-  .byte  255                                 // (bad)
-  .byte  255                                 // (bad)
-  .byte  255,202                             // dec           %edx
+  .byte  233,255,255,255,225                 // jmpq          ffffffffe2001c74 <_sk_callback_avx+0xffffffffe1ffb971>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  189                                 // .byte         0xbd
+  .byte  217,255                             // fcos
+  .byte  255                                 // (bad)
+  .byte  255,209                             // callq         *%rcx
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,201                             // dec           %ecx
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  188                                 // .byte         0xbc
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // .byte         0xff
@@ -15789,7 +15781,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,26,2,0,0                     // jne           1ea8 <_sk_load_tables_avx+0x228>
+  .byte  15,133,26,2,0,0                     // jne           1eb0 <_sk_load_tables_avx+0x228>
   .byte  196,65,124,16,4,184                 // vmovups       (%r8,%rdi,4),%ymm8
   .byte  85                                  // push          %rbp
   .byte  65,87                               // push          %r15
@@ -15797,7 +15789,7 @@
   .byte  65,85                               // push          %r13
   .byte  65,84                               // push          %r12
   .byte  83                                  // push          %rbx
-  .byte  197,124,40,13,154,75,0,0            // vmovaps       0x4b9a(%rip),%ymm9        # 6840 <_sk_callback_avx+0x545>
+  .byte  197,124,40,13,146,75,0,0            // vmovaps       0x4b92(%rip),%ymm9        # 6840 <_sk_callback_avx+0x53d>
   .byte  196,193,60,84,193                   // vandps        %ymm9,%ymm8,%ymm0
   .byte  196,193,249,126,193                 // vmovq         %xmm0,%r9
   .byte  69,137,203                          // mov           %r9d,%r11d
@@ -15889,7 +15881,7 @@
   .byte  196,193,97,114,210,24               // vpsrld        $0x18,%xmm10,%xmm3
   .byte  196,227,61,24,219,1                 // vinsertf128   $0x1,%xmm3,%ymm8,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,191,70,0,0          // vbroadcastss  0x46bf(%rip),%ymm8        # 6554 <_sk_callback_avx+0x259>
+  .byte  196,98,125,24,5,191,70,0,0          // vbroadcastss  0x46bf(%rip),%ymm8        # 655c <_sk_callback_avx+0x259>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
@@ -15904,9 +15896,9 @@
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,211,253,255,255              // ja            1c94 <_sk_load_tables_avx+0x14>
+  .byte  15,135,211,253,255,255              // ja            1c9c <_sk_load_tables_avx+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,140,0,0,0                 // lea           0x8c(%rip),%r10        # 1f58 <_sk_load_tables_avx+0x2d8>
+  .byte  76,141,21,140,0,0,0                 // lea           0x8c(%rip),%r10        # 1f60 <_sk_load_tables_avx+0x2d8>
   .byte  79,99,12,138                        // movslq        (%r10,%r9,4),%r9
   .byte  77,1,209                            // add           %r10,%r9
   .byte  65,255,225                          // jmpq          *%r9
@@ -15929,7 +15921,7 @@
   .byte  196,99,61,12,192,15                 // vblendps      $0xf,%ymm0,%ymm8,%ymm8
   .byte  196,195,57,34,4,184,0               // vpinsrd       $0x0,(%r8,%rdi,4),%xmm8,%xmm0
   .byte  196,99,61,12,192,15                 // vblendps      $0xf,%ymm0,%ymm8,%ymm8
-  .byte  233,62,253,255,255                  // jmpq          1c94 <_sk_load_tables_avx+0x14>
+  .byte  233,62,253,255,255                  // jmpq          1c9c <_sk_load_tables_avx+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  236                                 // in            (%dx),%al
   .byte  255                                 // (bad)
@@ -15947,7 +15939,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  126,255                             // jle           1f71 <_sk_load_tables_avx+0x2f1>
+  .byte  126,255                             // jle           1f79 <_sk_load_tables_avx+0x2f1>
   .byte  255                                 // (bad)
   .byte  255                                 // .byte         0xff
 
@@ -15959,7 +15951,7 @@
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  76,141,12,189,0,0,0,0               // lea           0x0(,%rdi,4),%r9
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,113,2,0,0                    // jne           21fb <_sk_load_tables_u16_be_avx+0x287>
+  .byte  15,133,113,2,0,0                    // jne           2203 <_sk_load_tables_u16_be_avx+0x287>
   .byte  196,1,121,16,4,72                   // vmovupd       (%r8,%r9,2),%xmm8
   .byte  196,129,121,16,84,72,16             // vmovupd       0x10(%r8,%r9,2),%xmm2
   .byte  196,129,121,16,92,72,32             // vmovupd       0x20(%r8,%r9,2),%xmm3
@@ -15981,7 +15973,7 @@
   .byte  197,177,108,208                     // vpunpcklqdq   %xmm0,%xmm9,%xmm2
   .byte  197,177,109,200                     // vpunpckhqdq   %xmm0,%xmm9,%xmm1
   .byte  196,65,57,108,212                   // vpunpcklqdq   %xmm12,%xmm8,%xmm10
-  .byte  197,121,111,29,218,72,0,0           // vmovdqa       0x48da(%rip),%xmm11        # 68c0 <_sk_callback_avx+0x5c5>
+  .byte  197,121,111,29,210,72,0,0           // vmovdqa       0x48d2(%rip),%xmm11        # 68c0 <_sk_callback_avx+0x5bd>
   .byte  196,193,105,219,195                 // vpand         %xmm11,%xmm2,%xmm0
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  196,193,121,105,209                 // vpunpckhwd    %xmm9,%xmm0,%xmm2
@@ -16080,7 +16072,7 @@
   .byte  196,226,121,51,219                  // vpmovzxwd     %xmm3,%xmm3
   .byte  196,195,101,24,216,1                // vinsertf128   $0x1,%xmm8,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,112,67,0,0          // vbroadcastss  0x4370(%rip),%ymm8        # 6558 <_sk_callback_avx+0x25d>
+  .byte  196,98,125,24,5,112,67,0,0          // vbroadcastss  0x4370(%rip),%ymm8        # 6560 <_sk_callback_avx+0x25d>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
@@ -16093,29 +16085,29 @@
   .byte  196,1,123,16,4,72                   // vmovsd        (%r8,%r9,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  116,85                              // je            2261 <_sk_load_tables_u16_be_avx+0x2ed>
+  .byte  116,85                              // je            2269 <_sk_load_tables_u16_be_avx+0x2ed>
   .byte  196,1,57,22,68,72,8                 // vmovhpd       0x8(%r8,%r9,2),%xmm8,%xmm8
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,72                              // jb            2261 <_sk_load_tables_u16_be_avx+0x2ed>
+  .byte  114,72                              // jb            2269 <_sk_load_tables_u16_be_avx+0x2ed>
   .byte  196,129,123,16,84,72,16             // vmovsd        0x10(%r8,%r9,2),%xmm2
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  116,72                              // je            226e <_sk_load_tables_u16_be_avx+0x2fa>
+  .byte  116,72                              // je            2276 <_sk_load_tables_u16_be_avx+0x2fa>
   .byte  196,129,105,22,84,72,24             // vmovhpd       0x18(%r8,%r9,2),%xmm2,%xmm2
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,59                              // jb            226e <_sk_load_tables_u16_be_avx+0x2fa>
+  .byte  114,59                              // jb            2276 <_sk_load_tables_u16_be_avx+0x2fa>
   .byte  196,129,123,16,92,72,32             // vmovsd        0x20(%r8,%r9,2),%xmm3
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  15,132,97,253,255,255               // je            1fa5 <_sk_load_tables_u16_be_avx+0x31>
+  .byte  15,132,97,253,255,255               // je            1fad <_sk_load_tables_u16_be_avx+0x31>
   .byte  196,129,97,22,92,72,40              // vmovhpd       0x28(%r8,%r9,2),%xmm3,%xmm3
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  15,130,80,253,255,255               // jb            1fa5 <_sk_load_tables_u16_be_avx+0x31>
+  .byte  15,130,80,253,255,255               // jb            1fad <_sk_load_tables_u16_be_avx+0x31>
   .byte  196,1,122,126,76,72,48              // vmovq         0x30(%r8,%r9,2),%xmm9
-  .byte  233,68,253,255,255                  // jmpq          1fa5 <_sk_load_tables_u16_be_avx+0x31>
+  .byte  233,68,253,255,255                  // jmpq          1fad <_sk_load_tables_u16_be_avx+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,55,253,255,255                  // jmpq          1fa5 <_sk_load_tables_u16_be_avx+0x31>
+  .byte  233,55,253,255,255                  // jmpq          1fad <_sk_load_tables_u16_be_avx+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,46,253,255,255                  // jmpq          1fa5 <_sk_load_tables_u16_be_avx+0x31>
+  .byte  233,46,253,255,255                  // jmpq          1fad <_sk_load_tables_u16_be_avx+0x31>
 
 HIDDEN _sk_load_tables_rgb_u16_be_avx
 .globl _sk_load_tables_rgb_u16_be_avx
@@ -16125,7 +16117,7 @@
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  76,141,12,127                       // lea           (%rdi,%rdi,2),%r9
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,93,2,0,0                     // jne           24e6 <_sk_load_tables_rgb_u16_be_avx+0x26f>
+  .byte  15,133,93,2,0,0                     // jne           24ee <_sk_load_tables_rgb_u16_be_avx+0x26f>
   .byte  196,129,122,111,4,72                // vmovdqu       (%r8,%r9,2),%xmm0
   .byte  196,129,122,111,84,72,12            // vmovdqu       0xc(%r8,%r9,2),%xmm2
   .byte  196,129,122,111,76,72,24            // vmovdqu       0x18(%r8,%r9,2),%xmm1
@@ -16152,7 +16144,7 @@
   .byte  197,185,108,202                     // vpunpcklqdq   %xmm2,%xmm8,%xmm1
   .byte  197,185,109,210                     // vpunpckhqdq   %xmm2,%xmm8,%xmm2
   .byte  197,121,108,195                     // vpunpcklqdq   %xmm3,%xmm0,%xmm8
-  .byte  197,121,111,13,211,69,0,0           // vmovdqa       0x45d3(%rip),%xmm9        # 68d0 <_sk_callback_avx+0x5d5>
+  .byte  197,121,111,13,203,69,0,0           // vmovdqa       0x45cb(%rip),%xmm9        # 68d0 <_sk_callback_avx+0x5cd>
   .byte  196,193,113,219,193                 // vpand         %xmm9,%xmm1,%xmm0
   .byte  196,65,41,239,210                   // vpxor         %xmm10,%xmm10,%xmm10
   .byte  196,193,121,105,202                 // vpunpckhwd    %xmm10,%xmm0,%xmm1
@@ -16244,7 +16236,7 @@
   .byte  196,227,105,33,211,48               // vinsertps     $0x30,%xmm3,%xmm2,%xmm2
   .byte  196,195,109,24,208,1                // vinsertf128   $0x1,%xmm8,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,130,64,0,0        // vbroadcastss  0x4082(%rip),%ymm3        # 655c <_sk_callback_avx+0x261>
+  .byte  196,226,125,24,29,130,64,0,0        // vbroadcastss  0x4082(%rip),%ymm3        # 6564 <_sk_callback_avx+0x261>
   .byte  91                                  // pop           %rbx
   .byte  65,92                               // pop           %r12
   .byte  65,93                               // pop           %r13
@@ -16255,36 +16247,36 @@
   .byte  196,129,121,110,4,72                // vmovd         (%r8,%r9,2),%xmm0
   .byte  196,129,121,196,68,72,4,2           // vpinsrw       $0x2,0x4(%r8,%r9,2),%xmm0,%xmm0
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  117,5                               // jne           24ff <_sk_load_tables_rgb_u16_be_avx+0x288>
-  .byte  233,190,253,255,255                 // jmpq          22bd <_sk_load_tables_rgb_u16_be_avx+0x46>
+  .byte  117,5                               // jne           2507 <_sk_load_tables_rgb_u16_be_avx+0x288>
+  .byte  233,190,253,255,255                 // jmpq          22c5 <_sk_load_tables_rgb_u16_be_avx+0x46>
   .byte  196,129,121,110,76,72,6             // vmovd         0x6(%r8,%r9,2),%xmm1
   .byte  196,1,113,196,68,72,10,2            // vpinsrw       $0x2,0xa(%r8,%r9,2),%xmm1,%xmm8
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,26                              // jb            252e <_sk_load_tables_rgb_u16_be_avx+0x2b7>
+  .byte  114,26                              // jb            2536 <_sk_load_tables_rgb_u16_be_avx+0x2b7>
   .byte  196,129,121,110,76,72,12            // vmovd         0xc(%r8,%r9,2),%xmm1
   .byte  196,129,113,196,84,72,16,2          // vpinsrw       $0x2,0x10(%r8,%r9,2),%xmm1,%xmm2
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  117,10                              // jne           2533 <_sk_load_tables_rgb_u16_be_avx+0x2bc>
-  .byte  233,143,253,255,255                 // jmpq          22bd <_sk_load_tables_rgb_u16_be_avx+0x46>
-  .byte  233,138,253,255,255                 // jmpq          22bd <_sk_load_tables_rgb_u16_be_avx+0x46>
+  .byte  117,10                              // jne           253b <_sk_load_tables_rgb_u16_be_avx+0x2bc>
+  .byte  233,143,253,255,255                 // jmpq          22c5 <_sk_load_tables_rgb_u16_be_avx+0x46>
+  .byte  233,138,253,255,255                 // jmpq          22c5 <_sk_load_tables_rgb_u16_be_avx+0x46>
   .byte  196,129,121,110,76,72,18            // vmovd         0x12(%r8,%r9,2),%xmm1
   .byte  196,1,113,196,76,72,22,2            // vpinsrw       $0x2,0x16(%r8,%r9,2),%xmm1,%xmm9
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,26                              // jb            2562 <_sk_load_tables_rgb_u16_be_avx+0x2eb>
+  .byte  114,26                              // jb            256a <_sk_load_tables_rgb_u16_be_avx+0x2eb>
   .byte  196,129,121,110,76,72,24            // vmovd         0x18(%r8,%r9,2),%xmm1
   .byte  196,129,113,196,76,72,28,2          // vpinsrw       $0x2,0x1c(%r8,%r9,2),%xmm1,%xmm1
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  117,10                              // jne           2567 <_sk_load_tables_rgb_u16_be_avx+0x2f0>
-  .byte  233,91,253,255,255                  // jmpq          22bd <_sk_load_tables_rgb_u16_be_avx+0x46>
-  .byte  233,86,253,255,255                  // jmpq          22bd <_sk_load_tables_rgb_u16_be_avx+0x46>
+  .byte  117,10                              // jne           256f <_sk_load_tables_rgb_u16_be_avx+0x2f0>
+  .byte  233,91,253,255,255                  // jmpq          22c5 <_sk_load_tables_rgb_u16_be_avx+0x46>
+  .byte  233,86,253,255,255                  // jmpq          22c5 <_sk_load_tables_rgb_u16_be_avx+0x46>
   .byte  196,129,121,110,92,72,30            // vmovd         0x1e(%r8,%r9,2),%xmm3
   .byte  196,1,97,196,92,72,34,2             // vpinsrw       $0x2,0x22(%r8,%r9,2),%xmm3,%xmm11
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  114,20                              // jb            2590 <_sk_load_tables_rgb_u16_be_avx+0x319>
+  .byte  114,20                              // jb            2598 <_sk_load_tables_rgb_u16_be_avx+0x319>
   .byte  196,129,121,110,92,72,36            // vmovd         0x24(%r8,%r9,2),%xmm3
   .byte  196,129,97,196,92,72,40,2           // vpinsrw       $0x2,0x28(%r8,%r9,2),%xmm3,%xmm3
-  .byte  233,45,253,255,255                  // jmpq          22bd <_sk_load_tables_rgb_u16_be_avx+0x46>
-  .byte  233,40,253,255,255                  // jmpq          22bd <_sk_load_tables_rgb_u16_be_avx+0x46>
+  .byte  233,45,253,255,255                  // jmpq          22c5 <_sk_load_tables_rgb_u16_be_avx+0x46>
+  .byte  233,40,253,255,255                  // jmpq          22c5 <_sk_load_tables_rgb_u16_be_avx+0x46>
 
 HIDDEN _sk_byte_tables_avx
 .globl _sk_byte_tables_avx
@@ -16297,7 +16289,7 @@
   .byte  65,84                               // push          %r12
   .byte  83                                  // push          %rbx
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,182,63,0,0          // vbroadcastss  0x3fb6(%rip),%ymm8        # 6560 <_sk_callback_avx+0x265>
+  .byte  196,98,125,24,5,182,63,0,0          // vbroadcastss  0x3fb6(%rip),%ymm8        # 6568 <_sk_callback_avx+0x265>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  197,253,91,192                      // vcvtps2dq     %ymm0,%ymm0
   .byte  196,195,249,22,192,1                // vpextrq       $0x1,%xmm0,%r8
@@ -16334,7 +16326,7 @@
   .byte  196,226,121,49,192                  // vpmovzxbd     %xmm0,%xmm0
   .byte  196,227,53,24,192,1                 // vinsertf128   $0x1,%xmm0,%ymm9,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,13,4,63,0,0           // vbroadcastss  0x3f04(%rip),%ymm9        # 6564 <_sk_callback_avx+0x269>
+  .byte  196,98,125,24,13,4,63,0,0           // vbroadcastss  0x3f04(%rip),%ymm9        # 656c <_sk_callback_avx+0x269>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
   .byte  197,253,91,201                      // vcvtps2dq     %ymm1,%ymm1
@@ -16496,7 +16488,7 @@
   .byte  196,226,121,49,192                  // vpmovzxbd     %xmm0,%xmm0
   .byte  196,227,53,24,192,1                 // vinsertf128   $0x1,%xmm0,%ymm9,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,13,42,60,0,0          // vbroadcastss  0x3c2a(%rip),%ymm9        # 6568 <_sk_callback_avx+0x26d>
+  .byte  196,98,125,24,13,42,60,0,0          // vbroadcastss  0x3c2a(%rip),%ymm9        # 6570 <_sk_callback_avx+0x26d>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
   .byte  197,253,91,201                      // vcvtps2dq     %ymm1,%ymm1
@@ -16793,36 +16785,36 @@
   .byte  196,193,124,88,195                  // vaddps        %ymm11,%ymm0,%ymm0
   .byte  196,98,125,24,16                    // vbroadcastss  (%rax),%ymm10
   .byte  197,124,91,216                      // vcvtdq2ps     %ymm0,%ymm11
-  .byte  196,98,125,24,37,136,55,0,0         // vbroadcastss  0x3788(%rip),%ymm12        # 656c <_sk_callback_avx+0x271>
+  .byte  196,98,125,24,37,136,55,0,0         // vbroadcastss  0x3788(%rip),%ymm12        # 6574 <_sk_callback_avx+0x271>
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,126,55,0,0         // vbroadcastss  0x377e(%rip),%ymm12        # 6570 <_sk_callback_avx+0x275>
+  .byte  196,98,125,24,37,126,55,0,0         // vbroadcastss  0x377e(%rip),%ymm12        # 6578 <_sk_callback_avx+0x275>
   .byte  196,193,124,84,196                  // vandps        %ymm12,%ymm0,%ymm0
-  .byte  196,98,125,24,37,116,55,0,0         // vbroadcastss  0x3774(%rip),%ymm12        # 6574 <_sk_callback_avx+0x279>
+  .byte  196,98,125,24,37,116,55,0,0         // vbroadcastss  0x3774(%rip),%ymm12        # 657c <_sk_callback_avx+0x279>
   .byte  196,193,124,86,196                  // vorps         %ymm12,%ymm0,%ymm0
-  .byte  196,98,125,24,37,106,55,0,0         // vbroadcastss  0x376a(%rip),%ymm12        # 6578 <_sk_callback_avx+0x27d>
+  .byte  196,98,125,24,37,106,55,0,0         // vbroadcastss  0x376a(%rip),%ymm12        # 6580 <_sk_callback_avx+0x27d>
   .byte  196,65,36,88,220                    // vaddps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,96,55,0,0          // vbroadcastss  0x3760(%rip),%ymm12        # 657c <_sk_callback_avx+0x281>
+  .byte  196,98,125,24,37,96,55,0,0          // vbroadcastss  0x3760(%rip),%ymm12        # 6584 <_sk_callback_avx+0x281>
   .byte  196,65,124,89,228                   // vmulps        %ymm12,%ymm0,%ymm12
   .byte  196,65,36,92,220                    // vsubps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,81,55,0,0          // vbroadcastss  0x3751(%rip),%ymm12        # 6580 <_sk_callback_avx+0x285>
+  .byte  196,98,125,24,37,81,55,0,0          // vbroadcastss  0x3751(%rip),%ymm12        # 6588 <_sk_callback_avx+0x285>
   .byte  196,193,124,88,196                  // vaddps        %ymm12,%ymm0,%ymm0
-  .byte  196,98,125,24,37,71,55,0,0          // vbroadcastss  0x3747(%rip),%ymm12        # 6584 <_sk_callback_avx+0x289>
+  .byte  196,98,125,24,37,71,55,0,0          // vbroadcastss  0x3747(%rip),%ymm12        # 658c <_sk_callback_avx+0x289>
   .byte  197,156,94,192                      // vdivps        %ymm0,%ymm12,%ymm0
   .byte  197,164,92,192                      // vsubps        %ymm0,%ymm11,%ymm0
   .byte  197,172,89,192                      // vmulps        %ymm0,%ymm10,%ymm0
   .byte  196,99,125,8,208,1                  // vroundps      $0x1,%ymm0,%ymm10
   .byte  196,65,124,92,210                   // vsubps        %ymm10,%ymm0,%ymm10
-  .byte  196,98,125,24,29,43,55,0,0          // vbroadcastss  0x372b(%rip),%ymm11        # 6588 <_sk_callback_avx+0x28d>
+  .byte  196,98,125,24,29,43,55,0,0          // vbroadcastss  0x372b(%rip),%ymm11        # 6590 <_sk_callback_avx+0x28d>
   .byte  196,193,124,88,195                  // vaddps        %ymm11,%ymm0,%ymm0
-  .byte  196,98,125,24,29,33,55,0,0          // vbroadcastss  0x3721(%rip),%ymm11        # 658c <_sk_callback_avx+0x291>
+  .byte  196,98,125,24,29,33,55,0,0          // vbroadcastss  0x3721(%rip),%ymm11        # 6594 <_sk_callback_avx+0x291>
   .byte  196,65,44,89,219                    // vmulps        %ymm11,%ymm10,%ymm11
   .byte  196,193,124,92,195                  // vsubps        %ymm11,%ymm0,%ymm0
-  .byte  196,98,125,24,29,18,55,0,0          // vbroadcastss  0x3712(%rip),%ymm11        # 6590 <_sk_callback_avx+0x295>
+  .byte  196,98,125,24,29,18,55,0,0          // vbroadcastss  0x3712(%rip),%ymm11        # 6598 <_sk_callback_avx+0x295>
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
-  .byte  196,98,125,24,29,8,55,0,0           // vbroadcastss  0x3708(%rip),%ymm11        # 6594 <_sk_callback_avx+0x299>
+  .byte  196,98,125,24,29,8,55,0,0           // vbroadcastss  0x3708(%rip),%ymm11        # 659c <_sk_callback_avx+0x299>
   .byte  196,65,36,94,210                    // vdivps        %ymm10,%ymm11,%ymm10
   .byte  196,193,124,88,194                  // vaddps        %ymm10,%ymm0,%ymm0
-  .byte  196,98,125,24,21,249,54,0,0         // vbroadcastss  0x36f9(%rip),%ymm10        # 6598 <_sk_callback_avx+0x29d>
+  .byte  196,98,125,24,21,249,54,0,0         // vbroadcastss  0x36f9(%rip),%ymm10        # 65a0 <_sk_callback_avx+0x29d>
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  197,253,91,192                      // vcvtps2dq     %ymm0,%ymm0
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -16830,7 +16822,7 @@
   .byte  196,195,125,74,193,128              // vblendvps     %ymm8,%ymm9,%ymm0,%ymm0
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,124,95,192                  // vmaxps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,208,54,0,0          // vbroadcastss  0x36d0(%rip),%ymm8        # 659c <_sk_callback_avx+0x2a1>
+  .byte  196,98,125,24,5,208,54,0,0          // vbroadcastss  0x36d0(%rip),%ymm8        # 65a4 <_sk_callback_avx+0x2a1>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -16852,36 +16844,36 @@
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
   .byte  196,98,125,24,16                    // vbroadcastss  (%rax),%ymm10
   .byte  197,124,91,217                      // vcvtdq2ps     %ymm1,%ymm11
-  .byte  196,98,125,24,37,129,54,0,0         // vbroadcastss  0x3681(%rip),%ymm12        # 65a0 <_sk_callback_avx+0x2a5>
+  .byte  196,98,125,24,37,129,54,0,0         // vbroadcastss  0x3681(%rip),%ymm12        # 65a8 <_sk_callback_avx+0x2a5>
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,119,54,0,0         // vbroadcastss  0x3677(%rip),%ymm12        # 65a4 <_sk_callback_avx+0x2a9>
+  .byte  196,98,125,24,37,119,54,0,0         // vbroadcastss  0x3677(%rip),%ymm12        # 65ac <_sk_callback_avx+0x2a9>
   .byte  196,193,116,84,204                  // vandps        %ymm12,%ymm1,%ymm1
-  .byte  196,98,125,24,37,109,54,0,0         // vbroadcastss  0x366d(%rip),%ymm12        # 65a8 <_sk_callback_avx+0x2ad>
+  .byte  196,98,125,24,37,109,54,0,0         // vbroadcastss  0x366d(%rip),%ymm12        # 65b0 <_sk_callback_avx+0x2ad>
   .byte  196,193,116,86,204                  // vorps         %ymm12,%ymm1,%ymm1
-  .byte  196,98,125,24,37,99,54,0,0          // vbroadcastss  0x3663(%rip),%ymm12        # 65ac <_sk_callback_avx+0x2b1>
+  .byte  196,98,125,24,37,99,54,0,0          // vbroadcastss  0x3663(%rip),%ymm12        # 65b4 <_sk_callback_avx+0x2b1>
   .byte  196,65,36,88,220                    // vaddps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,89,54,0,0          // vbroadcastss  0x3659(%rip),%ymm12        # 65b0 <_sk_callback_avx+0x2b5>
+  .byte  196,98,125,24,37,89,54,0,0          // vbroadcastss  0x3659(%rip),%ymm12        # 65b8 <_sk_callback_avx+0x2b5>
   .byte  196,65,116,89,228                   // vmulps        %ymm12,%ymm1,%ymm12
   .byte  196,65,36,92,220                    // vsubps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,74,54,0,0          // vbroadcastss  0x364a(%rip),%ymm12        # 65b4 <_sk_callback_avx+0x2b9>
+  .byte  196,98,125,24,37,74,54,0,0          // vbroadcastss  0x364a(%rip),%ymm12        # 65bc <_sk_callback_avx+0x2b9>
   .byte  196,193,116,88,204                  // vaddps        %ymm12,%ymm1,%ymm1
-  .byte  196,98,125,24,37,64,54,0,0          // vbroadcastss  0x3640(%rip),%ymm12        # 65b8 <_sk_callback_avx+0x2bd>
+  .byte  196,98,125,24,37,64,54,0,0          // vbroadcastss  0x3640(%rip),%ymm12        # 65c0 <_sk_callback_avx+0x2bd>
   .byte  197,156,94,201                      // vdivps        %ymm1,%ymm12,%ymm1
   .byte  197,164,92,201                      // vsubps        %ymm1,%ymm11,%ymm1
   .byte  197,172,89,201                      // vmulps        %ymm1,%ymm10,%ymm1
   .byte  196,99,125,8,209,1                  // vroundps      $0x1,%ymm1,%ymm10
   .byte  196,65,116,92,210                   // vsubps        %ymm10,%ymm1,%ymm10
-  .byte  196,98,125,24,29,36,54,0,0          // vbroadcastss  0x3624(%rip),%ymm11        # 65bc <_sk_callback_avx+0x2c1>
+  .byte  196,98,125,24,29,36,54,0,0          // vbroadcastss  0x3624(%rip),%ymm11        # 65c4 <_sk_callback_avx+0x2c1>
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,26,54,0,0          // vbroadcastss  0x361a(%rip),%ymm11        # 65c0 <_sk_callback_avx+0x2c5>
+  .byte  196,98,125,24,29,26,54,0,0          // vbroadcastss  0x361a(%rip),%ymm11        # 65c8 <_sk_callback_avx+0x2c5>
   .byte  196,65,44,89,219                    // vmulps        %ymm11,%ymm10,%ymm11
   .byte  196,193,116,92,203                  // vsubps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,11,54,0,0          // vbroadcastss  0x360b(%rip),%ymm11        # 65c4 <_sk_callback_avx+0x2c9>
+  .byte  196,98,125,24,29,11,54,0,0          // vbroadcastss  0x360b(%rip),%ymm11        # 65cc <_sk_callback_avx+0x2c9>
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
-  .byte  196,98,125,24,29,1,54,0,0           // vbroadcastss  0x3601(%rip),%ymm11        # 65c8 <_sk_callback_avx+0x2cd>
+  .byte  196,98,125,24,29,1,54,0,0           // vbroadcastss  0x3601(%rip),%ymm11        # 65d0 <_sk_callback_avx+0x2cd>
   .byte  196,65,36,94,210                    // vdivps        %ymm10,%ymm11,%ymm10
   .byte  196,193,116,88,202                  // vaddps        %ymm10,%ymm1,%ymm1
-  .byte  196,98,125,24,21,242,53,0,0         // vbroadcastss  0x35f2(%rip),%ymm10        # 65cc <_sk_callback_avx+0x2d1>
+  .byte  196,98,125,24,21,242,53,0,0         // vbroadcastss  0x35f2(%rip),%ymm10        # 65d4 <_sk_callback_avx+0x2d1>
   .byte  196,193,116,89,202                  // vmulps        %ymm10,%ymm1,%ymm1
   .byte  197,253,91,201                      // vcvtps2dq     %ymm1,%ymm1
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -16889,7 +16881,7 @@
   .byte  196,195,117,74,201,128              // vblendvps     %ymm8,%ymm9,%ymm1,%ymm1
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,116,95,200                  // vmaxps        %ymm8,%ymm1,%ymm1
-  .byte  196,98,125,24,5,201,53,0,0          // vbroadcastss  0x35c9(%rip),%ymm8        # 65d0 <_sk_callback_avx+0x2d5>
+  .byte  196,98,125,24,5,201,53,0,0          // vbroadcastss  0x35c9(%rip),%ymm8        # 65d8 <_sk_callback_avx+0x2d5>
   .byte  196,193,116,93,200                  // vminps        %ymm8,%ymm1,%ymm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -16911,36 +16903,36 @@
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
   .byte  196,98,125,24,16                    // vbroadcastss  (%rax),%ymm10
   .byte  197,124,91,218                      // vcvtdq2ps     %ymm2,%ymm11
-  .byte  196,98,125,24,37,122,53,0,0         // vbroadcastss  0x357a(%rip),%ymm12        # 65d4 <_sk_callback_avx+0x2d9>
+  .byte  196,98,125,24,37,122,53,0,0         // vbroadcastss  0x357a(%rip),%ymm12        # 65dc <_sk_callback_avx+0x2d9>
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,112,53,0,0         // vbroadcastss  0x3570(%rip),%ymm12        # 65d8 <_sk_callback_avx+0x2dd>
+  .byte  196,98,125,24,37,112,53,0,0         // vbroadcastss  0x3570(%rip),%ymm12        # 65e0 <_sk_callback_avx+0x2dd>
   .byte  196,193,108,84,212                  // vandps        %ymm12,%ymm2,%ymm2
-  .byte  196,98,125,24,37,102,53,0,0         // vbroadcastss  0x3566(%rip),%ymm12        # 65dc <_sk_callback_avx+0x2e1>
+  .byte  196,98,125,24,37,102,53,0,0         // vbroadcastss  0x3566(%rip),%ymm12        # 65e4 <_sk_callback_avx+0x2e1>
   .byte  196,193,108,86,212                  // vorps         %ymm12,%ymm2,%ymm2
-  .byte  196,98,125,24,37,92,53,0,0          // vbroadcastss  0x355c(%rip),%ymm12        # 65e0 <_sk_callback_avx+0x2e5>
+  .byte  196,98,125,24,37,92,53,0,0          // vbroadcastss  0x355c(%rip),%ymm12        # 65e8 <_sk_callback_avx+0x2e5>
   .byte  196,65,36,88,220                    // vaddps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,82,53,0,0          // vbroadcastss  0x3552(%rip),%ymm12        # 65e4 <_sk_callback_avx+0x2e9>
+  .byte  196,98,125,24,37,82,53,0,0          // vbroadcastss  0x3552(%rip),%ymm12        # 65ec <_sk_callback_avx+0x2e9>
   .byte  196,65,108,89,228                   // vmulps        %ymm12,%ymm2,%ymm12
   .byte  196,65,36,92,220                    // vsubps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,67,53,0,0          // vbroadcastss  0x3543(%rip),%ymm12        # 65e8 <_sk_callback_avx+0x2ed>
+  .byte  196,98,125,24,37,67,53,0,0          // vbroadcastss  0x3543(%rip),%ymm12        # 65f0 <_sk_callback_avx+0x2ed>
   .byte  196,193,108,88,212                  // vaddps        %ymm12,%ymm2,%ymm2
-  .byte  196,98,125,24,37,57,53,0,0          // vbroadcastss  0x3539(%rip),%ymm12        # 65ec <_sk_callback_avx+0x2f1>
+  .byte  196,98,125,24,37,57,53,0,0          // vbroadcastss  0x3539(%rip),%ymm12        # 65f4 <_sk_callback_avx+0x2f1>
   .byte  197,156,94,210                      // vdivps        %ymm2,%ymm12,%ymm2
   .byte  197,164,92,210                      // vsubps        %ymm2,%ymm11,%ymm2
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  196,99,125,8,210,1                  // vroundps      $0x1,%ymm2,%ymm10
   .byte  196,65,108,92,210                   // vsubps        %ymm10,%ymm2,%ymm10
-  .byte  196,98,125,24,29,29,53,0,0          // vbroadcastss  0x351d(%rip),%ymm11        # 65f0 <_sk_callback_avx+0x2f5>
+  .byte  196,98,125,24,29,29,53,0,0          // vbroadcastss  0x351d(%rip),%ymm11        # 65f8 <_sk_callback_avx+0x2f5>
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
-  .byte  196,98,125,24,29,19,53,0,0          // vbroadcastss  0x3513(%rip),%ymm11        # 65f4 <_sk_callback_avx+0x2f9>
+  .byte  196,98,125,24,29,19,53,0,0          // vbroadcastss  0x3513(%rip),%ymm11        # 65fc <_sk_callback_avx+0x2f9>
   .byte  196,65,44,89,219                    // vmulps        %ymm11,%ymm10,%ymm11
   .byte  196,193,108,92,211                  // vsubps        %ymm11,%ymm2,%ymm2
-  .byte  196,98,125,24,29,4,53,0,0           // vbroadcastss  0x3504(%rip),%ymm11        # 65f8 <_sk_callback_avx+0x2fd>
+  .byte  196,98,125,24,29,4,53,0,0           // vbroadcastss  0x3504(%rip),%ymm11        # 6600 <_sk_callback_avx+0x2fd>
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
-  .byte  196,98,125,24,29,250,52,0,0         // vbroadcastss  0x34fa(%rip),%ymm11        # 65fc <_sk_callback_avx+0x301>
+  .byte  196,98,125,24,29,250,52,0,0         // vbroadcastss  0x34fa(%rip),%ymm11        # 6604 <_sk_callback_avx+0x301>
   .byte  196,65,36,94,210                    // vdivps        %ymm10,%ymm11,%ymm10
   .byte  196,193,108,88,210                  // vaddps        %ymm10,%ymm2,%ymm2
-  .byte  196,98,125,24,21,235,52,0,0         // vbroadcastss  0x34eb(%rip),%ymm10        # 6600 <_sk_callback_avx+0x305>
+  .byte  196,98,125,24,21,235,52,0,0         // vbroadcastss  0x34eb(%rip),%ymm10        # 6608 <_sk_callback_avx+0x305>
   .byte  196,193,108,89,210                  // vmulps        %ymm10,%ymm2,%ymm2
   .byte  197,253,91,210                      // vcvtps2dq     %ymm2,%ymm2
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -16948,7 +16940,7 @@
   .byte  196,195,109,74,209,128              // vblendvps     %ymm8,%ymm9,%ymm2,%ymm2
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,108,95,208                  // vmaxps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,194,52,0,0          // vbroadcastss  0x34c2(%rip),%ymm8        # 6604 <_sk_callback_avx+0x309>
+  .byte  196,98,125,24,5,194,52,0,0          // vbroadcastss  0x34c2(%rip),%ymm8        # 660c <_sk_callback_avx+0x309>
   .byte  196,193,108,93,208                  // vminps        %ymm8,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -16970,36 +16962,36 @@
   .byte  196,193,100,88,219                  // vaddps        %ymm11,%ymm3,%ymm3
   .byte  196,98,125,24,16                    // vbroadcastss  (%rax),%ymm10
   .byte  197,124,91,219                      // vcvtdq2ps     %ymm3,%ymm11
-  .byte  196,98,125,24,37,115,52,0,0         // vbroadcastss  0x3473(%rip),%ymm12        # 6608 <_sk_callback_avx+0x30d>
+  .byte  196,98,125,24,37,115,52,0,0         // vbroadcastss  0x3473(%rip),%ymm12        # 6610 <_sk_callback_avx+0x30d>
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,105,52,0,0         // vbroadcastss  0x3469(%rip),%ymm12        # 660c <_sk_callback_avx+0x311>
+  .byte  196,98,125,24,37,105,52,0,0         // vbroadcastss  0x3469(%rip),%ymm12        # 6614 <_sk_callback_avx+0x311>
   .byte  196,193,100,84,220                  // vandps        %ymm12,%ymm3,%ymm3
-  .byte  196,98,125,24,37,95,52,0,0          // vbroadcastss  0x345f(%rip),%ymm12        # 6610 <_sk_callback_avx+0x315>
+  .byte  196,98,125,24,37,95,52,0,0          // vbroadcastss  0x345f(%rip),%ymm12        # 6618 <_sk_callback_avx+0x315>
   .byte  196,193,100,86,220                  // vorps         %ymm12,%ymm3,%ymm3
-  .byte  196,98,125,24,37,85,52,0,0          // vbroadcastss  0x3455(%rip),%ymm12        # 6614 <_sk_callback_avx+0x319>
+  .byte  196,98,125,24,37,85,52,0,0          // vbroadcastss  0x3455(%rip),%ymm12        # 661c <_sk_callback_avx+0x319>
   .byte  196,65,36,88,220                    // vaddps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,75,52,0,0          // vbroadcastss  0x344b(%rip),%ymm12        # 6618 <_sk_callback_avx+0x31d>
+  .byte  196,98,125,24,37,75,52,0,0          // vbroadcastss  0x344b(%rip),%ymm12        # 6620 <_sk_callback_avx+0x31d>
   .byte  196,65,100,89,228                   // vmulps        %ymm12,%ymm3,%ymm12
   .byte  196,65,36,92,220                    // vsubps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,60,52,0,0          // vbroadcastss  0x343c(%rip),%ymm12        # 661c <_sk_callback_avx+0x321>
+  .byte  196,98,125,24,37,60,52,0,0          // vbroadcastss  0x343c(%rip),%ymm12        # 6624 <_sk_callback_avx+0x321>
   .byte  196,193,100,88,220                  // vaddps        %ymm12,%ymm3,%ymm3
-  .byte  196,98,125,24,37,50,52,0,0          // vbroadcastss  0x3432(%rip),%ymm12        # 6620 <_sk_callback_avx+0x325>
+  .byte  196,98,125,24,37,50,52,0,0          // vbroadcastss  0x3432(%rip),%ymm12        # 6628 <_sk_callback_avx+0x325>
   .byte  197,156,94,219                      // vdivps        %ymm3,%ymm12,%ymm3
   .byte  197,164,92,219                      // vsubps        %ymm3,%ymm11,%ymm3
   .byte  197,172,89,219                      // vmulps        %ymm3,%ymm10,%ymm3
   .byte  196,99,125,8,211,1                  // vroundps      $0x1,%ymm3,%ymm10
   .byte  196,65,100,92,210                   // vsubps        %ymm10,%ymm3,%ymm10
-  .byte  196,98,125,24,29,22,52,0,0          // vbroadcastss  0x3416(%rip),%ymm11        # 6624 <_sk_callback_avx+0x329>
+  .byte  196,98,125,24,29,22,52,0,0          // vbroadcastss  0x3416(%rip),%ymm11        # 662c <_sk_callback_avx+0x329>
   .byte  196,193,100,88,219                  // vaddps        %ymm11,%ymm3,%ymm3
-  .byte  196,98,125,24,29,12,52,0,0          // vbroadcastss  0x340c(%rip),%ymm11        # 6628 <_sk_callback_avx+0x32d>
+  .byte  196,98,125,24,29,12,52,0,0          // vbroadcastss  0x340c(%rip),%ymm11        # 6630 <_sk_callback_avx+0x32d>
   .byte  196,65,44,89,219                    // vmulps        %ymm11,%ymm10,%ymm11
   .byte  196,193,100,92,219                  // vsubps        %ymm11,%ymm3,%ymm3
-  .byte  196,98,125,24,29,253,51,0,0         // vbroadcastss  0x33fd(%rip),%ymm11        # 662c <_sk_callback_avx+0x331>
+  .byte  196,98,125,24,29,253,51,0,0         // vbroadcastss  0x33fd(%rip),%ymm11        # 6634 <_sk_callback_avx+0x331>
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
-  .byte  196,98,125,24,29,243,51,0,0         // vbroadcastss  0x33f3(%rip),%ymm11        # 6630 <_sk_callback_avx+0x335>
+  .byte  196,98,125,24,29,243,51,0,0         // vbroadcastss  0x33f3(%rip),%ymm11        # 6638 <_sk_callback_avx+0x335>
   .byte  196,65,36,94,210                    // vdivps        %ymm10,%ymm11,%ymm10
   .byte  196,193,100,88,218                  // vaddps        %ymm10,%ymm3,%ymm3
-  .byte  196,98,125,24,21,228,51,0,0         // vbroadcastss  0x33e4(%rip),%ymm10        # 6634 <_sk_callback_avx+0x339>
+  .byte  196,98,125,24,21,228,51,0,0         // vbroadcastss  0x33e4(%rip),%ymm10        # 663c <_sk_callback_avx+0x339>
   .byte  196,193,100,89,218                  // vmulps        %ymm10,%ymm3,%ymm3
   .byte  197,253,91,219                      // vcvtps2dq     %ymm3,%ymm3
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -17007,7 +16999,7 @@
   .byte  196,195,101,74,217,128              // vblendvps     %ymm8,%ymm9,%ymm3,%ymm3
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,100,95,216                  // vmaxps        %ymm8,%ymm3,%ymm3
-  .byte  196,98,125,24,5,187,51,0,0          // vbroadcastss  0x33bb(%rip),%ymm8        # 6638 <_sk_callback_avx+0x33d>
+  .byte  196,98,125,24,5,187,51,0,0          // vbroadcastss  0x33bb(%rip),%ymm8        # 6640 <_sk_callback_avx+0x33d>
   .byte  196,193,100,93,216                  // vminps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -17016,31 +17008,31 @@
 .globl _sk_lab_to_xyz_avx
 FUNCTION(_sk_lab_to_xyz_avx)
 _sk_lab_to_xyz_avx:
-  .byte  196,98,125,24,5,173,51,0,0          // vbroadcastss  0x33ad(%rip),%ymm8        # 663c <_sk_callback_avx+0x341>
+  .byte  196,98,125,24,5,173,51,0,0          // vbroadcastss  0x33ad(%rip),%ymm8        # 6644 <_sk_callback_avx+0x341>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,163,51,0,0          // vbroadcastss  0x33a3(%rip),%ymm8        # 6640 <_sk_callback_avx+0x345>
+  .byte  196,98,125,24,5,163,51,0,0          // vbroadcastss  0x33a3(%rip),%ymm8        # 6648 <_sk_callback_avx+0x345>
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
-  .byte  196,98,125,24,13,153,51,0,0         // vbroadcastss  0x3399(%rip),%ymm9        # 6644 <_sk_callback_avx+0x349>
+  .byte  196,98,125,24,13,153,51,0,0         // vbroadcastss  0x3399(%rip),%ymm9        # 664c <_sk_callback_avx+0x349>
   .byte  196,193,116,88,201                  // vaddps        %ymm9,%ymm1,%ymm1
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  196,193,108,88,209                  // vaddps        %ymm9,%ymm2,%ymm2
-  .byte  196,98,125,24,5,133,51,0,0          // vbroadcastss  0x3385(%rip),%ymm8        # 6648 <_sk_callback_avx+0x34d>
+  .byte  196,98,125,24,5,133,51,0,0          // vbroadcastss  0x3385(%rip),%ymm8        # 6650 <_sk_callback_avx+0x34d>
   .byte  196,193,124,88,192                  // vaddps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,123,51,0,0          // vbroadcastss  0x337b(%rip),%ymm8        # 664c <_sk_callback_avx+0x351>
+  .byte  196,98,125,24,5,123,51,0,0          // vbroadcastss  0x337b(%rip),%ymm8        # 6654 <_sk_callback_avx+0x351>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,113,51,0,0          // vbroadcastss  0x3371(%rip),%ymm8        # 6650 <_sk_callback_avx+0x355>
+  .byte  196,98,125,24,5,113,51,0,0          // vbroadcastss  0x3371(%rip),%ymm8        # 6658 <_sk_callback_avx+0x355>
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
   .byte  197,252,88,201                      // vaddps        %ymm1,%ymm0,%ymm1
-  .byte  196,98,125,24,5,99,51,0,0           // vbroadcastss  0x3363(%rip),%ymm8        # 6654 <_sk_callback_avx+0x359>
+  .byte  196,98,125,24,5,99,51,0,0           // vbroadcastss  0x3363(%rip),%ymm8        # 665c <_sk_callback_avx+0x359>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  197,252,92,210                      // vsubps        %ymm2,%ymm0,%ymm2
   .byte  197,116,89,193                      // vmulps        %ymm1,%ymm1,%ymm8
   .byte  196,65,116,89,192                   // vmulps        %ymm8,%ymm1,%ymm8
-  .byte  196,98,125,24,13,76,51,0,0          // vbroadcastss  0x334c(%rip),%ymm9        # 6658 <_sk_callback_avx+0x35d>
+  .byte  196,98,125,24,13,76,51,0,0          // vbroadcastss  0x334c(%rip),%ymm9        # 6660 <_sk_callback_avx+0x35d>
   .byte  196,65,52,194,208,1                 // vcmpltps      %ymm8,%ymm9,%ymm10
-  .byte  196,98,125,24,29,65,51,0,0          // vbroadcastss  0x3341(%rip),%ymm11        # 665c <_sk_callback_avx+0x361>
+  .byte  196,98,125,24,29,65,51,0,0          // vbroadcastss  0x3341(%rip),%ymm11        # 6664 <_sk_callback_avx+0x361>
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,37,55,51,0,0          // vbroadcastss  0x3337(%rip),%ymm12        # 6660 <_sk_callback_avx+0x365>
+  .byte  196,98,125,24,37,55,51,0,0          // vbroadcastss  0x3337(%rip),%ymm12        # 6668 <_sk_callback_avx+0x365>
   .byte  196,193,116,89,204                  // vmulps        %ymm12,%ymm1,%ymm1
   .byte  196,67,117,74,192,160               // vblendvps     %ymm10,%ymm8,%ymm1,%ymm8
   .byte  197,252,89,200                      // vmulps        %ymm0,%ymm0,%ymm1
@@ -17055,9 +17047,9 @@
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
   .byte  196,193,108,89,212                  // vmulps        %ymm12,%ymm2,%ymm2
   .byte  196,227,109,74,208,144              // vblendvps     %ymm9,%ymm0,%ymm2,%ymm2
-  .byte  196,226,125,24,5,237,50,0,0         // vbroadcastss  0x32ed(%rip),%ymm0        # 6664 <_sk_callback_avx+0x369>
+  .byte  196,226,125,24,5,237,50,0,0         // vbroadcastss  0x32ed(%rip),%ymm0        # 666c <_sk_callback_avx+0x369>
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
-  .byte  196,98,125,24,5,228,50,0,0          // vbroadcastss  0x32e4(%rip),%ymm8        # 6668 <_sk_callback_avx+0x36d>
+  .byte  196,98,125,24,5,228,50,0,0          // vbroadcastss  0x32e4(%rip),%ymm8        # 6670 <_sk_callback_avx+0x36d>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -17071,14 +17063,14 @@
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  72,1,248                            // add           %rdi,%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,62                              // jne           33db <_sk_load_a8_avx+0x4e>
+  .byte  117,62                              // jne           33e3 <_sk_load_a8_avx+0x4e>
   .byte  197,250,126,0                       // vmovq         (%rax),%xmm0
   .byte  196,226,121,49,200                  // vpmovzxbd     %xmm0,%xmm1
   .byte  196,227,121,4,192,229               // vpermilps     $0xe5,%xmm0,%xmm0
   .byte  196,226,121,49,192                  // vpmovzxbd     %xmm0,%xmm0
   .byte  196,227,117,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,168,50,0,0        // vbroadcastss  0x32a8(%rip),%ymm1        # 666c <_sk_callback_avx+0x371>
+  .byte  196,226,125,24,13,168,50,0,0        // vbroadcastss  0x32a8(%rip),%ymm1        # 6674 <_sk_callback_avx+0x371>
   .byte  197,252,89,217                      // vmulps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -17095,9 +17087,9 @@
   .byte  77,9,217                            // or            %r11,%r9
   .byte  72,131,193,8                        // add           $0x8,%rcx
   .byte  73,255,202                          // dec           %r10
-  .byte  117,234                             // jne           33e3 <_sk_load_a8_avx+0x56>
+  .byte  117,234                             // jne           33eb <_sk_load_a8_avx+0x56>
   .byte  196,193,249,110,193                 // vmovq         %r9,%xmm0
-  .byte  235,161                             // jmp           33a1 <_sk_load_a8_avx+0x14>
+  .byte  235,161                             // jmp           33a9 <_sk_load_a8_avx+0x14>
 
 HIDDEN _sk_gather_a8_avx
 .globl _sk_gather_a8_avx
@@ -17147,7 +17139,7 @@
   .byte  196,226,121,49,201                  // vpmovzxbd     %xmm1,%xmm1
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,157,49,0,0        // vbroadcastss  0x319d(%rip),%ymm1        # 6670 <_sk_callback_avx+0x375>
+  .byte  196,226,125,24,13,157,49,0,0        // vbroadcastss  0x319d(%rip),%ymm1        # 6678 <_sk_callback_avx+0x375>
   .byte  197,252,89,217                      // vmulps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -17165,14 +17157,14 @@
 _sk_store_a8_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  196,98,125,24,5,120,49,0,0          // vbroadcastss  0x3178(%rip),%ymm8        # 6674 <_sk_callback_avx+0x379>
+  .byte  196,98,125,24,5,120,49,0,0          // vbroadcastss  0x3178(%rip),%ymm8        # 667c <_sk_callback_avx+0x379>
   .byte  196,65,100,89,192                   // vmulps        %ymm8,%ymm3,%ymm8
   .byte  196,65,125,91,192                   // vcvtps2dq     %ymm8,%ymm8
   .byte  196,67,125,25,193,1                 // vextractf128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  196,65,57,103,192                   // vpackuswb     %xmm8,%xmm8,%xmm8
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,10                              // jne           3525 <_sk_store_a8_avx+0x37>
+  .byte  117,10                              // jne           352d <_sk_store_a8_avx+0x37>
   .byte  196,65,123,17,4,58                  // vmovsd        %xmm8,(%r10,%rdi,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -17180,10 +17172,10 @@
   .byte  65,128,224,7                        // and           $0x7,%r8b
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  119,236                             // ja            3521 <_sk_store_a8_avx+0x33>
+  .byte  119,236                             // ja            3529 <_sk_store_a8_avx+0x33>
   .byte  196,66,121,48,192                   // vpmovzxbw     %xmm8,%xmm8
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,67,0,0,0                  // lea           0x43(%rip),%r9        # 3588 <_sk_store_a8_avx+0x9a>
+  .byte  76,141,13,67,0,0,0                  // lea           0x43(%rip),%r9        # 3590 <_sk_store_a8_avx+0x9a>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -17194,7 +17186,7 @@
   .byte  196,67,121,20,68,58,2,4             // vpextrb       $0x4,%xmm8,0x2(%r10,%rdi,1)
   .byte  196,67,121,20,68,58,1,2             // vpextrb       $0x2,%xmm8,0x1(%r10,%rdi,1)
   .byte  196,67,121,20,4,58,0                // vpextrb       $0x0,%xmm8,(%r10,%rdi,1)
-  .byte  235,154                             // jmp           3521 <_sk_store_a8_avx+0x33>
+  .byte  235,154                             // jmp           3529 <_sk_store_a8_avx+0x33>
   .byte  144                                 // nop
   .byte  246,255                             // idiv          %bh
   .byte  255                                 // (bad)
@@ -17228,17 +17220,17 @@
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  72,1,248                            // add           %rdi,%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,67                              // jne           35f7 <_sk_load_g8_avx+0x53>
+  .byte  117,67                              // jne           35ff <_sk_load_g8_avx+0x53>
   .byte  197,250,126,0                       // vmovq         (%rax),%xmm0
   .byte  196,226,121,49,200                  // vpmovzxbd     %xmm0,%xmm1
   .byte  196,227,121,4,192,229               // vpermilps     $0xe5,%xmm0,%xmm0
   .byte  196,226,121,49,192                  // vpmovzxbd     %xmm0,%xmm0
   .byte  196,227,117,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,157,48,0,0        // vbroadcastss  0x309d(%rip),%ymm1        # 6678 <_sk_callback_avx+0x37d>
+  .byte  196,226,125,24,13,157,48,0,0        // vbroadcastss  0x309d(%rip),%ymm1        # 6680 <_sk_callback_avx+0x37d>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,146,48,0,0        // vbroadcastss  0x3092(%rip),%ymm3        # 667c <_sk_callback_avx+0x381>
+  .byte  196,226,125,24,29,146,48,0,0        // vbroadcastss  0x3092(%rip),%ymm3        # 6684 <_sk_callback_avx+0x381>
   .byte  76,137,193                          // mov           %r8,%rcx
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
@@ -17252,9 +17244,9 @@
   .byte  77,9,217                            // or            %r11,%r9
   .byte  72,131,193,8                        // add           $0x8,%rcx
   .byte  73,255,202                          // dec           %r10
-  .byte  117,234                             // jne           35ff <_sk_load_g8_avx+0x5b>
+  .byte  117,234                             // jne           3607 <_sk_load_g8_avx+0x5b>
   .byte  196,193,249,110,193                 // vmovq         %r9,%xmm0
-  .byte  235,156                             // jmp           35b8 <_sk_load_g8_avx+0x14>
+  .byte  235,156                             // jmp           35c0 <_sk_load_g8_avx+0x14>
 
 HIDDEN _sk_gather_g8_avx
 .globl _sk_gather_g8_avx
@@ -17304,10 +17296,10 @@
   .byte  196,226,121,49,201                  // vpmovzxbd     %xmm1,%xmm1
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,145,47,0,0        // vbroadcastss  0x2f91(%rip),%ymm1        # 6680 <_sk_callback_avx+0x385>
+  .byte  196,226,125,24,13,145,47,0,0        // vbroadcastss  0x2f91(%rip),%ymm1        # 6688 <_sk_callback_avx+0x385>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,134,47,0,0        // vbroadcastss  0x2f86(%rip),%ymm3        # 6684 <_sk_callback_avx+0x389>
+  .byte  196,226,125,24,29,134,47,0,0        // vbroadcastss  0x2f86(%rip),%ymm3        # 668c <_sk_callback_avx+0x389>
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
   .byte  91                                  // pop           %rbx
@@ -17323,9 +17315,9 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,137,192                          // mov           %rax,%r8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  116,5                               // je            371e <_sk_gather_i8_avx+0xf>
+  .byte  116,5                               // je            3726 <_sk_gather_i8_avx+0xf>
   .byte  76,137,192                          // mov           %r8,%rax
-  .byte  235,2                               // jmp           3720 <_sk_gather_i8_avx+0x11>
+  .byte  235,2                               // jmp           3728 <_sk_gather_i8_avx+0x11>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,87                               // push          %r15
   .byte  65,86                               // push          %r14
@@ -17387,10 +17379,10 @@
   .byte  196,163,121,34,4,163,2              // vpinsrd       $0x2,(%rbx,%r12,4),%xmm0,%xmm0
   .byte  196,163,121,34,28,19,3              // vpinsrd       $0x3,(%rbx,%r10,1),%xmm0,%xmm3
   .byte  196,227,61,24,195,1                 // vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  .byte  197,124,40,21,22,48,0,0             // vmovaps       0x3016(%rip),%ymm10        # 6860 <_sk_callback_avx+0x565>
+  .byte  197,124,40,21,14,48,0,0             // vmovaps       0x300e(%rip),%ymm10        # 6860 <_sk_callback_avx+0x55d>
   .byte  196,193,124,84,194                  // vandps        %ymm10,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,13,44,46,0,0          // vbroadcastss  0x2e2c(%rip),%ymm9        # 6688 <_sk_callback_avx+0x38d>
+  .byte  196,98,125,24,13,44,46,0,0          // vbroadcastss  0x2e2c(%rip),%ymm9        # 6690 <_sk_callback_avx+0x38d>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  196,193,113,114,208,8               // vpsrld        $0x8,%xmm8,%xmm1
   .byte  197,233,114,211,8                   // vpsrld        $0x8,%xmm3,%xmm2
@@ -17424,38 +17416,38 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,128,0,0,0                    // jne           3954 <_sk_load_565_avx+0x8e>
+  .byte  15,133,128,0,0,0                    // jne           395c <_sk_load_565_avx+0x8e>
   .byte  196,193,122,111,4,122               // vmovdqu       (%r10,%rdi,2),%xmm0
   .byte  197,241,239,201                     // vpxor         %xmm1,%xmm1,%xmm1
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,209,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm2
-  .byte  196,226,125,24,5,150,45,0,0         // vbroadcastss  0x2d96(%rip),%ymm0        # 668c <_sk_callback_avx+0x391>
+  .byte  196,226,125,24,5,150,45,0,0         // vbroadcastss  0x2d96(%rip),%ymm0        # 6694 <_sk_callback_avx+0x391>
   .byte  197,236,84,192                      // vandps        %ymm0,%ymm2,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,137,45,0,0        // vbroadcastss  0x2d89(%rip),%ymm1        # 6690 <_sk_callback_avx+0x395>
+  .byte  196,226,125,24,13,137,45,0,0        // vbroadcastss  0x2d89(%rip),%ymm1        # 6698 <_sk_callback_avx+0x395>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,128,45,0,0        // vbroadcastss  0x2d80(%rip),%ymm1        # 6694 <_sk_callback_avx+0x399>
+  .byte  196,226,125,24,13,128,45,0,0        // vbroadcastss  0x2d80(%rip),%ymm1        # 669c <_sk_callback_avx+0x399>
   .byte  197,236,84,201                      // vandps        %ymm1,%ymm2,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,29,115,45,0,0        // vbroadcastss  0x2d73(%rip),%ymm3        # 6698 <_sk_callback_avx+0x39d>
+  .byte  196,226,125,24,29,115,45,0,0        // vbroadcastss  0x2d73(%rip),%ymm3        # 66a0 <_sk_callback_avx+0x39d>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
-  .byte  196,226,125,24,29,106,45,0,0        // vbroadcastss  0x2d6a(%rip),%ymm3        # 669c <_sk_callback_avx+0x3a1>
+  .byte  196,226,125,24,29,106,45,0,0        // vbroadcastss  0x2d6a(%rip),%ymm3        # 66a4 <_sk_callback_avx+0x3a1>
   .byte  197,236,84,211                      // vandps        %ymm3,%ymm2,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,226,125,24,29,93,45,0,0         // vbroadcastss  0x2d5d(%rip),%ymm3        # 66a0 <_sk_callback_avx+0x3a5>
+  .byte  196,226,125,24,29,93,45,0,0         // vbroadcastss  0x2d5d(%rip),%ymm3        # 66a8 <_sk_callback_avx+0x3a5>
   .byte  197,236,89,211                      // vmulps        %ymm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,82,45,0,0         // vbroadcastss  0x2d52(%rip),%ymm3        # 66a4 <_sk_callback_avx+0x3a9>
+  .byte  196,226,125,24,29,82,45,0,0         // vbroadcastss  0x2d52(%rip),%ymm3        # 66ac <_sk_callback_avx+0x3a9>
   .byte  255,224                             // jmpq          *%rax
   .byte  65,137,200                          // mov           %ecx,%r8d
   .byte  65,128,224,7                        // and           $0x7,%r8b
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  15,135,110,255,255,255              // ja            38da <_sk_load_565_avx+0x14>
+  .byte  15,135,110,255,255,255              // ja            38e2 <_sk_load_565_avx+0x14>
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,73,0,0,0                  // lea           0x49(%rip),%r9        # 39c0 <_sk_load_565_avx+0xfa>
+  .byte  76,141,13,73,0,0,0                  // lea           0x49(%rip),%r9        # 39c8 <_sk_load_565_avx+0xfa>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -17467,7 +17459,7 @@
   .byte  196,193,121,196,68,122,4,2          // vpinsrw       $0x2,0x4(%r10,%rdi,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,122,2,1          // vpinsrw       $0x1,0x2(%r10,%rdi,2),%xmm0,%xmm0
   .byte  196,193,121,196,4,122,0             // vpinsrw       $0x0,(%r10,%rdi,2),%xmm0,%xmm0
-  .byte  233,26,255,255,255                  // jmpq          38da <_sk_load_565_avx+0x14>
+  .byte  233,26,255,255,255                  // jmpq          38e2 <_sk_load_565_avx+0x14>
   .byte  244                                 // hlt
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -17545,23 +17537,23 @@
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,209,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm2
-  .byte  196,226,125,24,5,242,43,0,0         // vbroadcastss  0x2bf2(%rip),%ymm0        # 66a8 <_sk_callback_avx+0x3ad>
+  .byte  196,226,125,24,5,242,43,0,0         // vbroadcastss  0x2bf2(%rip),%ymm0        # 66b0 <_sk_callback_avx+0x3ad>
   .byte  197,236,84,192                      // vandps        %ymm0,%ymm2,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,229,43,0,0        // vbroadcastss  0x2be5(%rip),%ymm1        # 66ac <_sk_callback_avx+0x3b1>
+  .byte  196,226,125,24,13,229,43,0,0        // vbroadcastss  0x2be5(%rip),%ymm1        # 66b4 <_sk_callback_avx+0x3b1>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,220,43,0,0        // vbroadcastss  0x2bdc(%rip),%ymm1        # 66b0 <_sk_callback_avx+0x3b5>
+  .byte  196,226,125,24,13,220,43,0,0        // vbroadcastss  0x2bdc(%rip),%ymm1        # 66b8 <_sk_callback_avx+0x3b5>
   .byte  197,236,84,201                      // vandps        %ymm1,%ymm2,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,29,207,43,0,0        // vbroadcastss  0x2bcf(%rip),%ymm3        # 66b4 <_sk_callback_avx+0x3b9>
+  .byte  196,226,125,24,29,207,43,0,0        // vbroadcastss  0x2bcf(%rip),%ymm3        # 66bc <_sk_callback_avx+0x3b9>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
-  .byte  196,226,125,24,29,198,43,0,0        // vbroadcastss  0x2bc6(%rip),%ymm3        # 66b8 <_sk_callback_avx+0x3bd>
+  .byte  196,226,125,24,29,198,43,0,0        // vbroadcastss  0x2bc6(%rip),%ymm3        # 66c0 <_sk_callback_avx+0x3bd>
   .byte  197,236,84,211                      // vandps        %ymm3,%ymm2,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,226,125,24,29,185,43,0,0        // vbroadcastss  0x2bb9(%rip),%ymm3        # 66bc <_sk_callback_avx+0x3c1>
+  .byte  196,226,125,24,29,185,43,0,0        // vbroadcastss  0x2bb9(%rip),%ymm3        # 66c4 <_sk_callback_avx+0x3c1>
   .byte  197,236,89,211                      // vmulps        %ymm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,174,43,0,0        // vbroadcastss  0x2bae(%rip),%ymm3        # 66c0 <_sk_callback_avx+0x3c5>
+  .byte  196,226,125,24,29,174,43,0,0        // vbroadcastss  0x2bae(%rip),%ymm3        # 66c8 <_sk_callback_avx+0x3c5>
   .byte  91                                  // pop           %rbx
   .byte  65,92                               // pop           %r12
   .byte  65,94                               // pop           %r14
@@ -17575,14 +17567,14 @@
 _sk_store_565_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  196,98,125,24,5,154,43,0,0          // vbroadcastss  0x2b9a(%rip),%ymm8        # 66c4 <_sk_callback_avx+0x3c9>
+  .byte  196,98,125,24,5,154,43,0,0          // vbroadcastss  0x2b9a(%rip),%ymm8        # 66cc <_sk_callback_avx+0x3c9>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,193,41,114,241,11               // vpslld        $0xb,%xmm9,%xmm10
   .byte  196,67,125,25,201,1                 // vextractf128  $0x1,%ymm9,%xmm9
   .byte  196,193,49,114,241,11               // vpslld        $0xb,%xmm9,%xmm9
   .byte  196,67,45,24,201,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
-  .byte  196,98,125,24,21,115,43,0,0         // vbroadcastss  0x2b73(%rip),%ymm10        # 66c8 <_sk_callback_avx+0x3cd>
+  .byte  196,98,125,24,21,115,43,0,0         // vbroadcastss  0x2b73(%rip),%ymm10        # 66d0 <_sk_callback_avx+0x3cd>
   .byte  196,65,116,89,210                   // vmulps        %ymm10,%ymm1,%ymm10
   .byte  196,65,125,91,210                   // vcvtps2dq     %ymm10,%ymm10
   .byte  196,193,33,114,242,5                // vpslld        $0x5,%xmm10,%xmm11
@@ -17596,7 +17588,7 @@
   .byte  196,67,125,25,193,1                 // vextractf128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,10                              // jne           3ba5 <_sk_store_565_avx+0x89>
+  .byte  117,10                              // jne           3bad <_sk_store_565_avx+0x89>
   .byte  196,65,122,127,4,122                // vmovdqu       %xmm8,(%r10,%rdi,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -17604,9 +17596,9 @@
   .byte  65,128,224,7                        // and           $0x7,%r8b
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  119,236                             // ja            3ba1 <_sk_store_565_avx+0x85>
+  .byte  119,236                             // ja            3ba9 <_sk_store_565_avx+0x85>
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,68,0,0,0                  // lea           0x44(%rip),%r9        # 3c04 <_sk_store_565_avx+0xe8>
+  .byte  76,141,13,68,0,0,0                  // lea           0x44(%rip),%r9        # 3c0c <_sk_store_565_avx+0xe8>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -17617,7 +17609,7 @@
   .byte  196,67,121,21,68,122,4,2            // vpextrw       $0x2,%xmm8,0x4(%r10,%rdi,2)
   .byte  196,67,121,21,68,122,2,1            // vpextrw       $0x1,%xmm8,0x2(%r10,%rdi,2)
   .byte  196,67,121,21,4,122,0               // vpextrw       $0x0,%xmm8,(%r10,%rdi,2)
-  .byte  235,159                             // jmp           3ba1 <_sk_store_565_avx+0x85>
+  .byte  235,159                             // jmp           3ba9 <_sk_store_565_avx+0x85>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  245                                 // cmc
   .byte  255                                 // (bad)
@@ -17650,31 +17642,31 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,152,0,0,0                    // jne           3cc6 <_sk_load_4444_avx+0xa6>
+  .byte  15,133,152,0,0,0                    // jne           3cce <_sk_load_4444_avx+0xa6>
   .byte  196,193,122,111,4,122               // vmovdqu       (%r10,%rdi,2),%xmm0
   .byte  197,241,239,201                     // vpxor         %xmm1,%xmm1,%xmm1
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,217,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm3
-  .byte  196,226,125,24,5,124,42,0,0         // vbroadcastss  0x2a7c(%rip),%ymm0        # 66cc <_sk_callback_avx+0x3d1>
+  .byte  196,226,125,24,5,124,42,0,0         // vbroadcastss  0x2a7c(%rip),%ymm0        # 66d4 <_sk_callback_avx+0x3d1>
   .byte  197,228,84,192                      // vandps        %ymm0,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,111,42,0,0        // vbroadcastss  0x2a6f(%rip),%ymm1        # 66d0 <_sk_callback_avx+0x3d5>
+  .byte  196,226,125,24,13,111,42,0,0        // vbroadcastss  0x2a6f(%rip),%ymm1        # 66d8 <_sk_callback_avx+0x3d5>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,102,42,0,0        // vbroadcastss  0x2a66(%rip),%ymm1        # 66d4 <_sk_callback_avx+0x3d9>
+  .byte  196,226,125,24,13,102,42,0,0        // vbroadcastss  0x2a66(%rip),%ymm1        # 66dc <_sk_callback_avx+0x3d9>
   .byte  197,228,84,201                      // vandps        %ymm1,%ymm3,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,21,89,42,0,0         // vbroadcastss  0x2a59(%rip),%ymm2        # 66d8 <_sk_callback_avx+0x3dd>
+  .byte  196,226,125,24,21,89,42,0,0         // vbroadcastss  0x2a59(%rip),%ymm2        # 66e0 <_sk_callback_avx+0x3dd>
   .byte  197,244,89,202                      // vmulps        %ymm2,%ymm1,%ymm1
-  .byte  196,226,125,24,21,80,42,0,0         // vbroadcastss  0x2a50(%rip),%ymm2        # 66dc <_sk_callback_avx+0x3e1>
+  .byte  196,226,125,24,21,80,42,0,0         // vbroadcastss  0x2a50(%rip),%ymm2        # 66e4 <_sk_callback_avx+0x3e1>
   .byte  197,228,84,210                      // vandps        %ymm2,%ymm3,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,98,125,24,5,67,42,0,0           // vbroadcastss  0x2a43(%rip),%ymm8        # 66e0 <_sk_callback_avx+0x3e5>
+  .byte  196,98,125,24,5,67,42,0,0           // vbroadcastss  0x2a43(%rip),%ymm8        # 66e8 <_sk_callback_avx+0x3e5>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,57,42,0,0           // vbroadcastss  0x2a39(%rip),%ymm8        # 66e4 <_sk_callback_avx+0x3e9>
+  .byte  196,98,125,24,5,57,42,0,0           // vbroadcastss  0x2a39(%rip),%ymm8        # 66ec <_sk_callback_avx+0x3e9>
   .byte  196,193,100,84,216                  // vandps        %ymm8,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,43,42,0,0           // vbroadcastss  0x2a2b(%rip),%ymm8        # 66e8 <_sk_callback_avx+0x3ed>
+  .byte  196,98,125,24,5,43,42,0,0           // vbroadcastss  0x2a2b(%rip),%ymm8        # 66f0 <_sk_callback_avx+0x3ed>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -17683,9 +17675,9 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  15,135,86,255,255,255               // ja            3c34 <_sk_load_4444_avx+0x14>
+  .byte  15,135,86,255,255,255               // ja            3c3c <_sk_load_4444_avx+0x14>
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,75,0,0,0                  // lea           0x4b(%rip),%r9        # 3d34 <_sk_load_4444_avx+0x114>
+  .byte  76,141,13,75,0,0,0                  // lea           0x4b(%rip),%r9        # 3d3c <_sk_load_4444_avx+0x114>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -17697,7 +17689,7 @@
   .byte  196,193,121,196,68,122,4,2          // vpinsrw       $0x2,0x4(%r10,%rdi,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,122,2,1          // vpinsrw       $0x1,0x2(%r10,%rdi,2),%xmm0,%xmm0
   .byte  196,193,121,196,4,122,0             // vpinsrw       $0x0,(%r10,%rdi,2),%xmm0,%xmm0
-  .byte  233,2,255,255,255                   // jmpq          3c34 <_sk_load_4444_avx+0x14>
+  .byte  233,2,255,255,255                   // jmpq          3c3c <_sk_load_4444_avx+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  242,255                             // repnz         (bad)
   .byte  255                                 // (bad)
@@ -17776,25 +17768,25 @@
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,217,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm3
-  .byte  196,226,125,24,5,194,40,0,0         // vbroadcastss  0x28c2(%rip),%ymm0        # 66ec <_sk_callback_avx+0x3f1>
+  .byte  196,226,125,24,5,194,40,0,0         // vbroadcastss  0x28c2(%rip),%ymm0        # 66f4 <_sk_callback_avx+0x3f1>
   .byte  197,228,84,192                      // vandps        %ymm0,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,181,40,0,0        // vbroadcastss  0x28b5(%rip),%ymm1        # 66f0 <_sk_callback_avx+0x3f5>
+  .byte  196,226,125,24,13,181,40,0,0        // vbroadcastss  0x28b5(%rip),%ymm1        # 66f8 <_sk_callback_avx+0x3f5>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,172,40,0,0        // vbroadcastss  0x28ac(%rip),%ymm1        # 66f4 <_sk_callback_avx+0x3f9>
+  .byte  196,226,125,24,13,172,40,0,0        // vbroadcastss  0x28ac(%rip),%ymm1        # 66fc <_sk_callback_avx+0x3f9>
   .byte  197,228,84,201                      // vandps        %ymm1,%ymm3,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,21,159,40,0,0        // vbroadcastss  0x289f(%rip),%ymm2        # 66f8 <_sk_callback_avx+0x3fd>
+  .byte  196,226,125,24,21,159,40,0,0        // vbroadcastss  0x289f(%rip),%ymm2        # 6700 <_sk_callback_avx+0x3fd>
   .byte  197,244,89,202                      // vmulps        %ymm2,%ymm1,%ymm1
-  .byte  196,226,125,24,21,150,40,0,0        // vbroadcastss  0x2896(%rip),%ymm2        # 66fc <_sk_callback_avx+0x401>
+  .byte  196,226,125,24,21,150,40,0,0        // vbroadcastss  0x2896(%rip),%ymm2        # 6704 <_sk_callback_avx+0x401>
   .byte  197,228,84,210                      // vandps        %ymm2,%ymm3,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,98,125,24,5,137,40,0,0          // vbroadcastss  0x2889(%rip),%ymm8        # 6700 <_sk_callback_avx+0x405>
+  .byte  196,98,125,24,5,137,40,0,0          // vbroadcastss  0x2889(%rip),%ymm8        # 6708 <_sk_callback_avx+0x405>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,127,40,0,0          // vbroadcastss  0x287f(%rip),%ymm8        # 6704 <_sk_callback_avx+0x409>
+  .byte  196,98,125,24,5,127,40,0,0          // vbroadcastss  0x287f(%rip),%ymm8        # 670c <_sk_callback_avx+0x409>
   .byte  196,193,100,84,216                  // vandps        %ymm8,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,113,40,0,0          // vbroadcastss  0x2871(%rip),%ymm8        # 6708 <_sk_callback_avx+0x40d>
+  .byte  196,98,125,24,5,113,40,0,0          // vbroadcastss  0x2871(%rip),%ymm8        # 6710 <_sk_callback_avx+0x40d>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
@@ -17810,7 +17802,7 @@
 _sk_store_4444_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  196,98,125,24,5,86,40,0,0           // vbroadcastss  0x2856(%rip),%ymm8        # 670c <_sk_callback_avx+0x411>
+  .byte  196,98,125,24,5,86,40,0,0           // vbroadcastss  0x2856(%rip),%ymm8        # 6714 <_sk_callback_avx+0x411>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,193,41,114,241,12               // vpslld        $0xc,%xmm9,%xmm10
@@ -17837,7 +17829,7 @@
   .byte  196,67,125,25,193,1                 // vextractf128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,10                              // jne           3f4f <_sk_store_4444_avx+0xa7>
+  .byte  117,10                              // jne           3f57 <_sk_store_4444_avx+0xa7>
   .byte  196,65,122,127,4,122                // vmovdqu       %xmm8,(%r10,%rdi,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -17845,9 +17837,9 @@
   .byte  65,128,224,7                        // and           $0x7,%r8b
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  119,236                             // ja            3f4b <_sk_store_4444_avx+0xa3>
+  .byte  119,236                             // ja            3f53 <_sk_store_4444_avx+0xa3>
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,66,0,0,0                  // lea           0x42(%rip),%r9        # 3fac <_sk_store_4444_avx+0x104>
+  .byte  76,141,13,66,0,0,0                  // lea           0x42(%rip),%r9        # 3fb4 <_sk_store_4444_avx+0x104>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -17858,7 +17850,7 @@
   .byte  196,67,121,21,68,122,4,2            // vpextrw       $0x2,%xmm8,0x4(%r10,%rdi,2)
   .byte  196,67,121,21,68,122,2,1            // vpextrw       $0x1,%xmm8,0x2(%r10,%rdi,2)
   .byte  196,67,121,21,4,122,0               // vpextrw       $0x0,%xmm8,(%r10,%rdi,2)
-  .byte  235,159                             // jmp           3f4b <_sk_store_4444_avx+0xa3>
+  .byte  235,159                             // jmp           3f53 <_sk_store_4444_avx+0xa3>
   .byte  247,255                             // idiv          %edi
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -17889,12 +17881,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,135,0,0,0                    // jne           405d <_sk_load_8888_avx+0x95>
+  .byte  15,133,135,0,0,0                    // jne           4065 <_sk_load_8888_avx+0x95>
   .byte  196,65,124,16,12,186                // vmovups       (%r10,%rdi,4),%ymm9
-  .byte  197,124,40,21,156,40,0,0            // vmovaps       0x289c(%rip),%ymm10        # 6880 <_sk_callback_avx+0x585>
+  .byte  197,124,40,21,148,40,0,0            // vmovaps       0x2894(%rip),%ymm10        # 6880 <_sk_callback_avx+0x57d>
   .byte  196,193,52,84,194                   // vandps        %ymm10,%ymm9,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,26,39,0,0           // vbroadcastss  0x271a(%rip),%ymm8        # 6710 <_sk_callback_avx+0x415>
+  .byte  196,98,125,24,5,26,39,0,0           // vbroadcastss  0x271a(%rip),%ymm8        # 6718 <_sk_callback_avx+0x415>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  196,193,113,114,209,8               // vpsrld        $0x8,%xmm9,%xmm1
   .byte  196,99,125,25,203,1                 // vextractf128  $0x1,%ymm9,%xmm3
@@ -17921,9 +17913,9 @@
   .byte  196,65,52,87,201                    // vxorps        %ymm9,%ymm9,%ymm9
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  15,135,102,255,255,255              // ja            3fdc <_sk_load_8888_avx+0x14>
+  .byte  15,135,102,255,255,255              // ja            3fe4 <_sk_load_8888_avx+0x14>
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,139,0,0,0                 // lea           0x8b(%rip),%r9        # 410c <_sk_load_8888_avx+0x144>
+  .byte  76,141,13,139,0,0,0                 // lea           0x8b(%rip),%r9        # 4114 <_sk_load_8888_avx+0x144>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -17946,7 +17938,7 @@
   .byte  196,99,53,12,200,15                 // vblendps      $0xf,%ymm0,%ymm9,%ymm9
   .byte  196,195,49,34,4,186,0               // vpinsrd       $0x0,(%r10,%rdi,4),%xmm9,%xmm0
   .byte  196,99,53,12,200,15                 // vblendps      $0xf,%ymm0,%ymm9,%ymm9
-  .byte  233,210,254,255,255                 // jmpq          3fdc <_sk_load_8888_avx+0x14>
+  .byte  233,210,254,255,255                 // jmpq          3fe4 <_sk_load_8888_avx+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  236                                 // in            (%dx),%al
   .byte  255                                 // (bad)
@@ -17964,7 +17956,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  126,255                             // jle           4125 <_sk_load_8888_avx+0x15d>
+  .byte  126,255                             // jle           412d <_sk_load_8888_avx+0x15d>
   .byte  255                                 // (bad)
   .byte  255                                 // .byte         0xff
 
@@ -18009,10 +18001,10 @@
   .byte  196,131,121,34,4,152,2              // vpinsrd       $0x2,(%r8,%r11,4),%xmm0,%xmm0
   .byte  196,131,121,34,28,144,3             // vpinsrd       $0x3,(%r8,%r10,4),%xmm0,%xmm3
   .byte  196,227,61,24,195,1                 // vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  .byte  197,124,40,21,198,38,0,0            // vmovaps       0x26c6(%rip),%ymm10        # 68a0 <_sk_callback_avx+0x5a5>
+  .byte  197,124,40,21,190,38,0,0            // vmovaps       0x26be(%rip),%ymm10        # 68a0 <_sk_callback_avx+0x59d>
   .byte  196,193,124,84,194                  // vandps        %ymm10,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,13,40,37,0,0          // vbroadcastss  0x2528(%rip),%ymm9        # 6714 <_sk_callback_avx+0x419>
+  .byte  196,98,125,24,13,40,37,0,0          // vbroadcastss  0x2528(%rip),%ymm9        # 671c <_sk_callback_avx+0x419>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  196,193,113,114,208,8               // vpsrld        $0x8,%xmm8,%xmm1
   .byte  197,233,114,211,8                   // vpsrld        $0x8,%xmm3,%xmm2
@@ -18044,7 +18036,7 @@
 _sk_store_8888_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  196,98,125,24,5,182,36,0,0          // vbroadcastss  0x24b6(%rip),%ymm8        # 6718 <_sk_callback_avx+0x41d>
+  .byte  196,98,125,24,5,182,36,0,0          // vbroadcastss  0x24b6(%rip),%ymm8        # 6720 <_sk_callback_avx+0x41d>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,65,116,89,208                   // vmulps        %ymm8,%ymm1,%ymm10
@@ -18069,7 +18061,7 @@
   .byte  196,65,45,86,192                    // vorpd         %ymm8,%ymm10,%ymm8
   .byte  196,65,53,86,192                    // vorpd         %ymm8,%ymm9,%ymm8
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,10                              // jne           42f0 <_sk_store_8888_avx+0x9c>
+  .byte  117,10                              // jne           42f8 <_sk_store_8888_avx+0x9c>
   .byte  196,65,124,17,4,186                 // vmovups       %ymm8,(%r10,%rdi,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -18077,9 +18069,9 @@
   .byte  65,128,224,7                        // and           $0x7,%r8b
   .byte  65,254,200                          // dec           %r8b
   .byte  65,128,248,6                        // cmp           $0x6,%r8b
-  .byte  119,236                             // ja            42ec <_sk_store_8888_avx+0x98>
+  .byte  119,236                             // ja            42f4 <_sk_store_8888_avx+0x98>
   .byte  69,15,182,192                       // movzbl        %r8b,%r8d
-  .byte  76,141,13,85,0,0,0                  // lea           0x55(%rip),%r9        # 4360 <_sk_store_8888_avx+0x10c>
+  .byte  76,141,13,85,0,0,0                  // lea           0x55(%rip),%r9        # 4368 <_sk_store_8888_avx+0x10c>
   .byte  75,99,4,129                         // movslq        (%r9,%r8,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -18093,7 +18085,7 @@
   .byte  196,67,121,22,68,186,8,2            // vpextrd       $0x2,%xmm8,0x8(%r10,%rdi,4)
   .byte  196,67,121,22,68,186,4,1            // vpextrd       $0x1,%xmm8,0x4(%r10,%rdi,4)
   .byte  196,65,121,126,4,186                // vmovd         %xmm8,(%r10,%rdi,4)
-  .byte  235,143                             // jmp           42ec <_sk_store_8888_avx+0x98>
+  .byte  235,143                             // jmp           42f4 <_sk_store_8888_avx+0x98>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  245                                 // cmc
   .byte  255                                 // (bad)
@@ -18131,7 +18123,7 @@
   .byte  197,252,17,116,36,192               // vmovups       %ymm6,-0x40(%rsp)
   .byte  197,252,17,108,36,160               // vmovups       %ymm5,-0x60(%rsp)
   .byte  197,254,127,100,36,128              // vmovdqu       %ymm4,-0x80(%rsp)
-  .byte  15,133,141,2,0,0                    // jne           4633 <_sk_load_f16_avx+0x2b7>
+  .byte  15,133,141,2,0,0                    // jne           463b <_sk_load_f16_avx+0x2b7>
   .byte  197,121,16,4,248                    // vmovupd       (%rax,%rdi,8),%xmm8
   .byte  197,249,16,84,248,16                // vmovupd       0x10(%rax,%rdi,8),%xmm2
   .byte  197,249,16,76,248,32                // vmovupd       0x20(%rax,%rdi,8),%xmm1
@@ -18149,13 +18141,13 @@
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
-  .byte  196,98,125,24,37,29,35,0,0          // vbroadcastss  0x231d(%rip),%ymm12        # 671c <_sk_callback_avx+0x421>
+  .byte  196,98,125,24,37,29,35,0,0          // vbroadcastss  0x231d(%rip),%ymm12        # 6724 <_sk_callback_avx+0x421>
   .byte  196,193,124,84,204                  // vandps        %ymm12,%ymm0,%ymm1
   .byte  197,252,87,193                      // vxorps        %ymm1,%ymm0,%ymm0
   .byte  196,195,125,25,198,1                // vextractf128  $0x1,%ymm0,%xmm14
-  .byte  196,98,121,24,29,9,35,0,0           // vbroadcastss  0x2309(%rip),%xmm11        # 6720 <_sk_callback_avx+0x425>
+  .byte  196,98,121,24,29,9,35,0,0           // vbroadcastss  0x2309(%rip),%xmm11        # 6728 <_sk_callback_avx+0x425>
   .byte  196,193,8,87,219                    // vxorps        %xmm11,%xmm14,%xmm3
-  .byte  196,98,121,24,45,255,34,0,0         // vbroadcastss  0x22ff(%rip),%xmm13        # 6724 <_sk_callback_avx+0x429>
+  .byte  196,98,121,24,45,255,34,0,0         // vbroadcastss  0x22ff(%rip),%xmm13        # 672c <_sk_callback_avx+0x429>
   .byte  197,145,102,219                     // vpcmpgtd      %xmm3,%xmm13,%xmm3
   .byte  196,65,120,87,211                   // vxorps        %xmm11,%xmm0,%xmm10
   .byte  196,65,17,102,210                   // vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -18169,7 +18161,7 @@
   .byte  196,227,125,24,195,1                // vinsertf128   $0x1,%xmm3,%ymm0,%ymm0
   .byte  197,252,86,193                      // vorps         %ymm1,%ymm0,%ymm0
   .byte  196,227,125,25,193,1                // vextractf128  $0x1,%ymm0,%xmm1
-  .byte  196,226,121,24,29,181,34,0,0        // vbroadcastss  0x22b5(%rip),%xmm3        # 6728 <_sk_callback_avx+0x42d>
+  .byte  196,226,121,24,29,181,34,0,0        // vbroadcastss  0x22b5(%rip),%xmm3        # 6730 <_sk_callback_avx+0x42d>
   .byte  197,241,254,203                     // vpaddd        %xmm3,%xmm1,%xmm1
   .byte  197,249,254,195                     // vpaddd        %xmm3,%xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
@@ -18262,29 +18254,29 @@
   .byte  197,123,16,4,248                    // vmovsd        (%rax,%rdi,8),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  116,79                              // je            4692 <_sk_load_f16_avx+0x316>
+  .byte  116,79                              // je            469a <_sk_load_f16_avx+0x316>
   .byte  197,57,22,68,248,8                  // vmovhpd       0x8(%rax,%rdi,8),%xmm8,%xmm8
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,67                              // jb            4692 <_sk_load_f16_avx+0x316>
+  .byte  114,67                              // jb            469a <_sk_load_f16_avx+0x316>
   .byte  197,251,16,84,248,16                // vmovsd        0x10(%rax,%rdi,8),%xmm2
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  116,68                              // je            469f <_sk_load_f16_avx+0x323>
+  .byte  116,68                              // je            46a7 <_sk_load_f16_avx+0x323>
   .byte  197,233,22,84,248,24                // vmovhpd       0x18(%rax,%rdi,8),%xmm2,%xmm2
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,56                              // jb            469f <_sk_load_f16_avx+0x323>
+  .byte  114,56                              // jb            46a7 <_sk_load_f16_avx+0x323>
   .byte  197,251,16,76,248,32                // vmovsd        0x20(%rax,%rdi,8),%xmm1
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  15,132,70,253,255,255               // je            43bd <_sk_load_f16_avx+0x41>
+  .byte  15,132,70,253,255,255               // je            43c5 <_sk_load_f16_avx+0x41>
   .byte  197,241,22,76,248,40                // vmovhpd       0x28(%rax,%rdi,8),%xmm1,%xmm1
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  15,130,54,253,255,255               // jb            43bd <_sk_load_f16_avx+0x41>
+  .byte  15,130,54,253,255,255               // jb            43c5 <_sk_load_f16_avx+0x41>
   .byte  197,122,126,76,248,48               // vmovq         0x30(%rax,%rdi,8),%xmm9
-  .byte  233,43,253,255,255                  // jmpq          43bd <_sk_load_f16_avx+0x41>
+  .byte  233,43,253,255,255                  // jmpq          43c5 <_sk_load_f16_avx+0x41>
   .byte  197,241,87,201                      // vxorpd        %xmm1,%xmm1,%xmm1
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,30,253,255,255                  // jmpq          43bd <_sk_load_f16_avx+0x41>
+  .byte  233,30,253,255,255                  // jmpq          43c5 <_sk_load_f16_avx+0x41>
   .byte  197,241,87,201                      // vxorpd        %xmm1,%xmm1,%xmm1
-  .byte  233,21,253,255,255                  // jmpq          43bd <_sk_load_f16_avx+0x41>
+  .byte  233,21,253,255,255                  // jmpq          43c5 <_sk_load_f16_avx+0x41>
 
 HIDDEN _sk_gather_f16_avx
 .globl _sk_gather_f16_avx
@@ -18348,13 +18340,13 @@
   .byte  197,249,105,210                     // vpunpckhwd    %xmm2,%xmm0,%xmm2
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,194,1                // vinsertf128   $0x1,%xmm2,%ymm0,%ymm0
-  .byte  196,98,125,24,37,121,31,0,0         // vbroadcastss  0x1f79(%rip),%ymm12        # 672c <_sk_callback_avx+0x431>
+  .byte  196,98,125,24,37,121,31,0,0         // vbroadcastss  0x1f79(%rip),%ymm12        # 6734 <_sk_callback_avx+0x431>
   .byte  196,193,124,84,212                  // vandps        %ymm12,%ymm0,%ymm2
   .byte  197,252,87,194                      // vxorps        %ymm2,%ymm0,%ymm0
   .byte  196,195,125,25,198,1                // vextractf128  $0x1,%ymm0,%xmm14
-  .byte  196,98,121,24,29,101,31,0,0         // vbroadcastss  0x1f65(%rip),%xmm11        # 6730 <_sk_callback_avx+0x435>
+  .byte  196,98,121,24,29,101,31,0,0         // vbroadcastss  0x1f65(%rip),%xmm11        # 6738 <_sk_callback_avx+0x435>
   .byte  196,193,8,87,219                    // vxorps        %xmm11,%xmm14,%xmm3
-  .byte  196,98,121,24,45,91,31,0,0          // vbroadcastss  0x1f5b(%rip),%xmm13        # 6734 <_sk_callback_avx+0x439>
+  .byte  196,98,121,24,45,91,31,0,0          // vbroadcastss  0x1f5b(%rip),%xmm13        # 673c <_sk_callback_avx+0x439>
   .byte  197,145,102,219                     // vpcmpgtd      %xmm3,%xmm13,%xmm3
   .byte  196,65,120,87,211                   // vxorps        %xmm11,%xmm0,%xmm10
   .byte  196,65,17,102,210                   // vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -18368,7 +18360,7 @@
   .byte  196,227,125,24,195,1                // vinsertf128   $0x1,%xmm3,%ymm0,%ymm0
   .byte  197,252,86,194                      // vorps         %ymm2,%ymm0,%ymm0
   .byte  196,227,125,25,194,1                // vextractf128  $0x1,%ymm0,%xmm2
-  .byte  196,226,121,24,29,17,31,0,0         // vbroadcastss  0x1f11(%rip),%xmm3        # 6738 <_sk_callback_avx+0x43d>
+  .byte  196,226,121,24,29,17,31,0,0         // vbroadcastss  0x1f11(%rip),%xmm3        # 6740 <_sk_callback_avx+0x43d>
   .byte  197,233,254,211                     // vpaddd        %xmm3,%xmm2,%xmm2
   .byte  197,249,254,195                     // vpaddd        %xmm3,%xmm0,%xmm0
   .byte  196,227,125,24,194,1                // vinsertf128   $0x1,%xmm2,%ymm0,%ymm0
@@ -18472,12 +18464,12 @@
   .byte  197,252,17,52,36                    // vmovups       %ymm6,(%rsp)
   .byte  197,252,17,108,36,224               // vmovups       %ymm5,-0x20(%rsp)
   .byte  197,252,17,100,36,192               // vmovups       %ymm4,-0x40(%rsp)
-  .byte  196,98,125,24,13,42,29,0,0          // vbroadcastss  0x1d2a(%rip),%ymm9        # 673c <_sk_callback_avx+0x441>
+  .byte  196,98,125,24,13,42,29,0,0          // vbroadcastss  0x1d2a(%rip),%ymm9        # 6744 <_sk_callback_avx+0x441>
   .byte  196,65,124,84,209                   // vandps        %ymm9,%ymm0,%ymm10
   .byte  197,252,17,68,36,128                // vmovups       %ymm0,-0x80(%rsp)
   .byte  196,65,124,87,218                   // vxorps        %ymm10,%ymm0,%ymm11
   .byte  196,67,125,25,220,1                 // vextractf128  $0x1,%ymm11,%xmm12
-  .byte  196,98,121,24,5,15,29,0,0           // vbroadcastss  0x1d0f(%rip),%xmm8        # 6740 <_sk_callback_avx+0x445>
+  .byte  196,98,121,24,5,15,29,0,0           // vbroadcastss  0x1d0f(%rip),%xmm8        # 6748 <_sk_callback_avx+0x445>
   .byte  196,65,57,102,236                   // vpcmpgtd      %xmm12,%xmm8,%xmm13
   .byte  196,65,57,102,243                   // vpcmpgtd      %xmm11,%xmm8,%xmm14
   .byte  196,67,13,24,237,1                  // vinsertf128   $0x1,%xmm13,%ymm14,%ymm13
@@ -18487,7 +18479,7 @@
   .byte  196,67,13,24,242,1                  // vinsertf128   $0x1,%xmm10,%ymm14,%ymm14
   .byte  196,193,33,114,211,13               // vpsrld        $0xd,%xmm11,%xmm11
   .byte  196,193,25,114,212,13               // vpsrld        $0xd,%xmm12,%xmm12
-  .byte  196,98,125,24,21,214,28,0,0         // vbroadcastss  0x1cd6(%rip),%ymm10        # 6744 <_sk_callback_avx+0x449>
+  .byte  196,98,125,24,21,214,28,0,0         // vbroadcastss  0x1cd6(%rip),%ymm10        # 674c <_sk_callback_avx+0x449>
   .byte  196,65,12,86,242                    // vorps         %ymm10,%ymm14,%ymm14
   .byte  196,67,125,25,247,1                 // vextractf128  $0x1,%ymm14,%xmm15
   .byte  196,65,1,254,228                    // vpaddd        %xmm12,%xmm15,%xmm12
@@ -18569,7 +18561,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,66                              // jne           4c4c <_sk_store_f16_avx+0x25e>
+  .byte  117,66                              // jne           4c54 <_sk_store_f16_avx+0x25e>
   .byte  197,120,17,28,248                   // vmovups       %xmm11,(%rax,%rdi,8)
   .byte  197,120,17,84,248,16                // vmovups       %xmm10,0x10(%rax,%rdi,8)
   .byte  197,120,17,76,248,32                // vmovups       %xmm9,0x20(%rax,%rdi,8)
@@ -18585,22 +18577,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  197,121,214,28,248                  // vmovq         %xmm11,(%rax,%rdi,8)
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  116,202                             // je            4c21 <_sk_store_f16_avx+0x233>
+  .byte  116,202                             // je            4c29 <_sk_store_f16_avx+0x233>
   .byte  197,121,23,92,248,8                 // vmovhpd       %xmm11,0x8(%rax,%rdi,8)
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,190                             // jb            4c21 <_sk_store_f16_avx+0x233>
+  .byte  114,190                             // jb            4c29 <_sk_store_f16_avx+0x233>
   .byte  197,121,214,84,248,16               // vmovq         %xmm10,0x10(%rax,%rdi,8)
-  .byte  116,182                             // je            4c21 <_sk_store_f16_avx+0x233>
+  .byte  116,182                             // je            4c29 <_sk_store_f16_avx+0x233>
   .byte  197,121,23,84,248,24                // vmovhpd       %xmm10,0x18(%rax,%rdi,8)
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,170                             // jb            4c21 <_sk_store_f16_avx+0x233>
+  .byte  114,170                             // jb            4c29 <_sk_store_f16_avx+0x233>
   .byte  197,121,214,76,248,32               // vmovq         %xmm9,0x20(%rax,%rdi,8)
-  .byte  116,162                             // je            4c21 <_sk_store_f16_avx+0x233>
+  .byte  116,162                             // je            4c29 <_sk_store_f16_avx+0x233>
   .byte  197,121,23,76,248,40                // vmovhpd       %xmm9,0x28(%rax,%rdi,8)
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  114,150                             // jb            4c21 <_sk_store_f16_avx+0x233>
+  .byte  114,150                             // jb            4c29 <_sk_store_f16_avx+0x233>
   .byte  197,121,214,68,248,48               // vmovq         %xmm8,0x30(%rax,%rdi,8)
-  .byte  235,142                             // jmp           4c21 <_sk_store_f16_avx+0x233>
+  .byte  235,142                             // jmp           4c29 <_sk_store_f16_avx+0x233>
 
 HIDDEN _sk_load_u16_be_avx
 .globl _sk_load_u16_be_avx
@@ -18610,7 +18602,7 @@
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  72,141,4,189,0,0,0,0                // lea           0x0(,%rdi,4),%rax
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,253,0,0,0                    // jne           4da6 <_sk_load_u16_be_avx+0x113>
+  .byte  15,133,253,0,0,0                    // jne           4dae <_sk_load_u16_be_avx+0x113>
   .byte  196,65,121,16,4,64                  // vmovupd       (%r8,%rax,2),%xmm8
   .byte  196,193,121,16,84,64,16             // vmovupd       0x10(%r8,%rax,2),%xmm2
   .byte  196,193,121,16,92,64,32             // vmovupd       0x20(%r8,%rax,2),%xmm3
@@ -18632,7 +18624,7 @@
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,29,46,26,0,0          // vbroadcastss  0x1a2e(%rip),%ymm11        # 6748 <_sk_callback_avx+0x44d>
+  .byte  196,98,125,24,29,46,26,0,0          // vbroadcastss  0x1a2e(%rip),%ymm11        # 6750 <_sk_callback_avx+0x44d>
   .byte  196,193,124,89,195                  // vmulps        %ymm11,%ymm0,%ymm0
   .byte  197,177,109,202                     // vpunpckhqdq   %xmm2,%xmm9,%xmm1
   .byte  197,233,113,241,8                   // vpsllw        $0x8,%xmm1,%xmm2
@@ -18666,29 +18658,29 @@
   .byte  196,65,123,16,4,64                  // vmovsd        (%r8,%rax,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  116,85                              // je            4e0c <_sk_load_u16_be_avx+0x179>
+  .byte  116,85                              // je            4e14 <_sk_load_u16_be_avx+0x179>
   .byte  196,65,57,22,68,64,8                // vmovhpd       0x8(%r8,%rax,2),%xmm8,%xmm8
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,72                              // jb            4e0c <_sk_load_u16_be_avx+0x179>
+  .byte  114,72                              // jb            4e14 <_sk_load_u16_be_avx+0x179>
   .byte  196,193,123,16,84,64,16             // vmovsd        0x10(%r8,%rax,2),%xmm2
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  116,72                              // je            4e19 <_sk_load_u16_be_avx+0x186>
+  .byte  116,72                              // je            4e21 <_sk_load_u16_be_avx+0x186>
   .byte  196,193,105,22,84,64,24             // vmovhpd       0x18(%r8,%rax,2),%xmm2,%xmm2
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,59                              // jb            4e19 <_sk_load_u16_be_avx+0x186>
+  .byte  114,59                              // jb            4e21 <_sk_load_u16_be_avx+0x186>
   .byte  196,193,123,16,92,64,32             // vmovsd        0x20(%r8,%rax,2),%xmm3
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  15,132,213,254,255,255              // je            4cc4 <_sk_load_u16_be_avx+0x31>
+  .byte  15,132,213,254,255,255              // je            4ccc <_sk_load_u16_be_avx+0x31>
   .byte  196,193,97,22,92,64,40              // vmovhpd       0x28(%r8,%rax,2),%xmm3,%xmm3
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  15,130,196,254,255,255              // jb            4cc4 <_sk_load_u16_be_avx+0x31>
+  .byte  15,130,196,254,255,255              // jb            4ccc <_sk_load_u16_be_avx+0x31>
   .byte  196,65,122,126,76,64,48             // vmovq         0x30(%r8,%rax,2),%xmm9
-  .byte  233,184,254,255,255                 // jmpq          4cc4 <_sk_load_u16_be_avx+0x31>
+  .byte  233,184,254,255,255                 // jmpq          4ccc <_sk_load_u16_be_avx+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,171,254,255,255                 // jmpq          4cc4 <_sk_load_u16_be_avx+0x31>
+  .byte  233,171,254,255,255                 // jmpq          4ccc <_sk_load_u16_be_avx+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,162,254,255,255                 // jmpq          4cc4 <_sk_load_u16_be_avx+0x31>
+  .byte  233,162,254,255,255                 // jmpq          4ccc <_sk_load_u16_be_avx+0x31>
 
 HIDDEN _sk_load_rgb_u16_be_avx
 .globl _sk_load_rgb_u16_be_avx
@@ -18698,7 +18690,7 @@
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  72,141,4,127                        // lea           (%rdi,%rdi,2),%rax
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  15,133,243,0,0,0                    // jne           4f27 <_sk_load_rgb_u16_be_avx+0x105>
+  .byte  15,133,243,0,0,0                    // jne           4f2f <_sk_load_rgb_u16_be_avx+0x105>
   .byte  196,193,122,111,4,64                // vmovdqu       (%r8,%rax,2),%xmm0
   .byte  196,193,122,111,84,64,12            // vmovdqu       0xc(%r8,%rax,2),%xmm2
   .byte  196,193,122,111,76,64,24            // vmovdqu       0x18(%r8,%rax,2),%xmm1
@@ -18725,7 +18717,7 @@
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,29,142,24,0,0         // vbroadcastss  0x188e(%rip),%ymm11        # 674c <_sk_callback_avx+0x451>
+  .byte  196,98,125,24,29,142,24,0,0         // vbroadcastss  0x188e(%rip),%ymm11        # 6754 <_sk_callback_avx+0x451>
   .byte  196,193,124,89,195                  // vmulps        %ymm11,%ymm0,%ymm0
   .byte  197,185,109,202                     // vpunpckhqdq   %xmm2,%xmm8,%xmm1
   .byte  197,233,113,241,8                   // vpsllw        $0x8,%xmm1,%xmm2
@@ -18746,41 +18738,41 @@
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,211                  // vmulps        %ymm11,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,43,24,0,0         // vbroadcastss  0x182b(%rip),%ymm3        # 6750 <_sk_callback_avx+0x455>
+  .byte  196,226,125,24,29,43,24,0,0         // vbroadcastss  0x182b(%rip),%ymm3        # 6758 <_sk_callback_avx+0x455>
   .byte  255,224                             // jmpq          *%rax
   .byte  196,193,121,110,4,64                // vmovd         (%r8,%rax,2),%xmm0
   .byte  196,193,121,196,68,64,4,2           // vpinsrw       $0x2,0x4(%r8,%rax,2),%xmm0,%xmm0
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  117,5                               // jne           4f40 <_sk_load_rgb_u16_be_avx+0x11e>
-  .byte  233,40,255,255,255                  // jmpq          4e68 <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  117,5                               // jne           4f48 <_sk_load_rgb_u16_be_avx+0x11e>
+  .byte  233,40,255,255,255                  // jmpq          4e70 <_sk_load_rgb_u16_be_avx+0x46>
   .byte  196,193,121,110,76,64,6             // vmovd         0x6(%r8,%rax,2),%xmm1
   .byte  196,65,113,196,68,64,10,2           // vpinsrw       $0x2,0xa(%r8,%rax,2),%xmm1,%xmm8
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,26                              // jb            4f6f <_sk_load_rgb_u16_be_avx+0x14d>
+  .byte  114,26                              // jb            4f77 <_sk_load_rgb_u16_be_avx+0x14d>
   .byte  196,193,121,110,76,64,12            // vmovd         0xc(%r8,%rax,2),%xmm1
   .byte  196,193,113,196,84,64,16,2          // vpinsrw       $0x2,0x10(%r8,%rax,2),%xmm1,%xmm2
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  117,10                              // jne           4f74 <_sk_load_rgb_u16_be_avx+0x152>
-  .byte  233,249,254,255,255                 // jmpq          4e68 <_sk_load_rgb_u16_be_avx+0x46>
-  .byte  233,244,254,255,255                 // jmpq          4e68 <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  117,10                              // jne           4f7c <_sk_load_rgb_u16_be_avx+0x152>
+  .byte  233,249,254,255,255                 // jmpq          4e70 <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  233,244,254,255,255                 // jmpq          4e70 <_sk_load_rgb_u16_be_avx+0x46>
   .byte  196,193,121,110,76,64,18            // vmovd         0x12(%r8,%rax,2),%xmm1
   .byte  196,65,113,196,76,64,22,2           // vpinsrw       $0x2,0x16(%r8,%rax,2),%xmm1,%xmm9
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,26                              // jb            4fa3 <_sk_load_rgb_u16_be_avx+0x181>
+  .byte  114,26                              // jb            4fab <_sk_load_rgb_u16_be_avx+0x181>
   .byte  196,193,121,110,76,64,24            // vmovd         0x18(%r8,%rax,2),%xmm1
   .byte  196,193,113,196,76,64,28,2          // vpinsrw       $0x2,0x1c(%r8,%rax,2),%xmm1,%xmm1
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  117,10                              // jne           4fa8 <_sk_load_rgb_u16_be_avx+0x186>
-  .byte  233,197,254,255,255                 // jmpq          4e68 <_sk_load_rgb_u16_be_avx+0x46>
-  .byte  233,192,254,255,255                 // jmpq          4e68 <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  117,10                              // jne           4fb0 <_sk_load_rgb_u16_be_avx+0x186>
+  .byte  233,197,254,255,255                 // jmpq          4e70 <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  233,192,254,255,255                 // jmpq          4e70 <_sk_load_rgb_u16_be_avx+0x46>
   .byte  196,193,121,110,92,64,30            // vmovd         0x1e(%r8,%rax,2),%xmm3
   .byte  196,65,97,196,92,64,34,2            // vpinsrw       $0x2,0x22(%r8,%rax,2),%xmm3,%xmm11
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  114,20                              // jb            4fd1 <_sk_load_rgb_u16_be_avx+0x1af>
+  .byte  114,20                              // jb            4fd9 <_sk_load_rgb_u16_be_avx+0x1af>
   .byte  196,193,121,110,92,64,36            // vmovd         0x24(%r8,%rax,2),%xmm3
   .byte  196,193,97,196,92,64,40,2           // vpinsrw       $0x2,0x28(%r8,%rax,2),%xmm3,%xmm3
-  .byte  233,151,254,255,255                 // jmpq          4e68 <_sk_load_rgb_u16_be_avx+0x46>
-  .byte  233,146,254,255,255                 // jmpq          4e68 <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  233,151,254,255,255                 // jmpq          4e70 <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  233,146,254,255,255                 // jmpq          4e70 <_sk_load_rgb_u16_be_avx+0x46>
 
 HIDDEN _sk_store_u16_be_avx
 .globl _sk_store_u16_be_avx
@@ -18789,7 +18781,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  72,141,4,189,0,0,0,0                // lea           0x0(,%rdi,4),%rax
-  .byte  196,98,125,24,5,104,23,0,0          // vbroadcastss  0x1768(%rip),%ymm8        # 6754 <_sk_callback_avx+0x459>
+  .byte  196,98,125,24,5,104,23,0,0          // vbroadcastss  0x1768(%rip),%ymm8        # 675c <_sk_callback_avx+0x459>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,67,125,25,202,1                 // vextractf128  $0x1,%ymm9,%xmm10
@@ -18827,7 +18819,7 @@
   .byte  196,65,17,98,200                    // vpunpckldq    %xmm8,%xmm13,%xmm9
   .byte  196,65,17,106,192                   // vpunpckhdq    %xmm8,%xmm13,%xmm8
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,31                              // jne           50d0 <_sk_store_u16_be_avx+0xfa>
+  .byte  117,31                              // jne           50d8 <_sk_store_u16_be_avx+0xfa>
   .byte  196,65,120,17,28,64                 // vmovups       %xmm11,(%r8,%rax,2)
   .byte  196,65,120,17,84,64,16              // vmovups       %xmm10,0x10(%r8,%rax,2)
   .byte  196,65,120,17,76,64,32              // vmovups       %xmm9,0x20(%r8,%rax,2)
@@ -18836,22 +18828,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,214,28,64                // vmovq         %xmm11,(%r8,%rax,2)
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  116,240                             // je            50cc <_sk_store_u16_be_avx+0xf6>
+  .byte  116,240                             // je            50d4 <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,23,92,64,8               // vmovhpd       %xmm11,0x8(%r8,%rax,2)
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,227                             // jb            50cc <_sk_store_u16_be_avx+0xf6>
+  .byte  114,227                             // jb            50d4 <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,214,84,64,16             // vmovq         %xmm10,0x10(%r8,%rax,2)
-  .byte  116,218                             // je            50cc <_sk_store_u16_be_avx+0xf6>
+  .byte  116,218                             // je            50d4 <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,23,84,64,24              // vmovhpd       %xmm10,0x18(%r8,%rax,2)
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,205                             // jb            50cc <_sk_store_u16_be_avx+0xf6>
+  .byte  114,205                             // jb            50d4 <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,214,76,64,32             // vmovq         %xmm9,0x20(%r8,%rax,2)
-  .byte  116,196                             // je            50cc <_sk_store_u16_be_avx+0xf6>
+  .byte  116,196                             // je            50d4 <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,23,76,64,40              // vmovhpd       %xmm9,0x28(%r8,%rax,2)
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  114,183                             // jb            50cc <_sk_store_u16_be_avx+0xf6>
+  .byte  114,183                             // jb            50d4 <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,214,68,64,48             // vmovq         %xmm8,0x30(%r8,%rax,2)
-  .byte  235,174                             // jmp           50cc <_sk_store_u16_be_avx+0xf6>
+  .byte  235,174                             // jmp           50d4 <_sk_store_u16_be_avx+0xf6>
 
 HIDDEN _sk_load_f32_avx
 .globl _sk_load_f32_avx
@@ -18859,10 +18851,10 @@
 _sk_load_f32_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  119,110                             // ja            5194 <_sk_load_f32_avx+0x76>
+  .byte  119,110                             // ja            519c <_sk_load_f32_avx+0x76>
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  76,141,12,189,0,0,0,0               // lea           0x0(,%rdi,4),%r9
-  .byte  76,141,21,132,0,0,0                 // lea           0x84(%rip),%r10        # 51bc <_sk_load_f32_avx+0x9e>
+  .byte  76,141,21,132,0,0,0                 // lea           0x84(%rip),%r10        # 51c4 <_sk_load_f32_avx+0x9e>
   .byte  73,99,4,138                         // movslq        (%r10,%rcx,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -18921,7 +18913,7 @@
   .byte  196,65,37,20,196                    // vunpcklpd     %ymm12,%ymm11,%ymm8
   .byte  196,65,37,21,220                    // vunpckhpd     %ymm12,%ymm11,%ymm11
   .byte  72,133,201                          // test          %rcx,%rcx
-  .byte  117,55                              // jne           5249 <_sk_store_f32_avx+0x6d>
+  .byte  117,55                              // jne           5251 <_sk_store_f32_avx+0x6d>
   .byte  196,67,45,24,225,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm12
   .byte  196,67,61,24,235,1                  // vinsertf128   $0x1,%xmm11,%ymm8,%ymm13
   .byte  196,67,45,6,201,49                  // vperm2f128    $0x31,%ymm9,%ymm10,%ymm9
@@ -18934,22 +18926,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,17,20,128                // vmovupd       %xmm10,(%r8,%rax,4)
   .byte  72,131,249,1                        // cmp           $0x1,%rcx
-  .byte  116,240                             // je            5245 <_sk_store_f32_avx+0x69>
+  .byte  116,240                             // je            524d <_sk_store_f32_avx+0x69>
   .byte  196,65,121,17,76,128,16             // vmovupd       %xmm9,0x10(%r8,%rax,4)
   .byte  72,131,249,3                        // cmp           $0x3,%rcx
-  .byte  114,227                             // jb            5245 <_sk_store_f32_avx+0x69>
+  .byte  114,227                             // jb            524d <_sk_store_f32_avx+0x69>
   .byte  196,65,121,17,68,128,32             // vmovupd       %xmm8,0x20(%r8,%rax,4)
-  .byte  116,218                             // je            5245 <_sk_store_f32_avx+0x69>
+  .byte  116,218                             // je            524d <_sk_store_f32_avx+0x69>
   .byte  196,65,121,17,92,128,48             // vmovupd       %xmm11,0x30(%r8,%rax,4)
   .byte  72,131,249,5                        // cmp           $0x5,%rcx
-  .byte  114,205                             // jb            5245 <_sk_store_f32_avx+0x69>
+  .byte  114,205                             // jb            524d <_sk_store_f32_avx+0x69>
   .byte  196,67,125,25,84,128,64,1           // vextractf128  $0x1,%ymm10,0x40(%r8,%rax,4)
-  .byte  116,195                             // je            5245 <_sk_store_f32_avx+0x69>
+  .byte  116,195                             // je            524d <_sk_store_f32_avx+0x69>
   .byte  196,67,125,25,76,128,80,1           // vextractf128  $0x1,%ymm9,0x50(%r8,%rax,4)
   .byte  72,131,249,7                        // cmp           $0x7,%rcx
-  .byte  114,181                             // jb            5245 <_sk_store_f32_avx+0x69>
+  .byte  114,181                             // jb            524d <_sk_store_f32_avx+0x69>
   .byte  196,67,125,25,68,128,96,1           // vextractf128  $0x1,%ymm8,0x60(%r8,%rax,4)
-  .byte  235,171                             // jmp           5245 <_sk_store_f32_avx+0x69>
+  .byte  235,171                             // jmp           524d <_sk_store_f32_avx+0x69>
 
 HIDDEN _sk_clamp_x_avx
 .globl _sk_clamp_x_avx
@@ -19055,12 +19047,12 @@
 .globl _sk_luminance_to_alpha_avx
 FUNCTION(_sk_luminance_to_alpha_avx)
 _sk_luminance_to_alpha_avx:
-  .byte  196,226,125,24,29,143,19,0,0        // vbroadcastss  0x138f(%rip),%ymm3        # 6758 <_sk_callback_avx+0x45d>
+  .byte  196,226,125,24,29,143,19,0,0        // vbroadcastss  0x138f(%rip),%ymm3        # 6760 <_sk_callback_avx+0x45d>
   .byte  197,252,89,195                      // vmulps        %ymm3,%ymm0,%ymm0
-  .byte  196,226,125,24,29,134,19,0,0        // vbroadcastss  0x1386(%rip),%ymm3        # 675c <_sk_callback_avx+0x461>
+  .byte  196,226,125,24,29,134,19,0,0        // vbroadcastss  0x1386(%rip),%ymm3        # 6764 <_sk_callback_avx+0x461>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,121,19,0,0        // vbroadcastss  0x1379(%rip),%ymm1        # 6760 <_sk_callback_avx+0x465>
+  .byte  196,226,125,24,13,121,19,0,0        // vbroadcastss  0x1379(%rip),%ymm1        # 6768 <_sk_callback_avx+0x465>
   .byte  197,236,89,201                      // vmulps        %ymm1,%ymm2,%ymm1
   .byte  197,252,88,217                      // vaddps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -19279,9 +19271,9 @@
   .byte  72,139,24                           // mov           (%rax),%rbx
   .byte  72,139,104,8                        // mov           0x8(%rax),%rbp
   .byte  72,255,203                          // dec           %rbx
-  .byte  120,7                               // js            573d <_sk_evenly_spaced_gradient_avx+0x1f>
+  .byte  120,7                               // js            5745 <_sk_evenly_spaced_gradient_avx+0x1f>
   .byte  196,225,242,42,203                  // vcvtsi2ss     %rbx,%xmm1,%xmm1
-  .byte  235,21                              // jmp           5752 <_sk_evenly_spaced_gradient_avx+0x34>
+  .byte  235,21                              // jmp           575a <_sk_evenly_spaced_gradient_avx+0x34>
   .byte  73,137,216                          // mov           %rbx,%r8
   .byte  73,209,232                          // shr           %r8
   .byte  131,227,1                           // and           $0x1,%ebx
@@ -19448,12 +19440,12 @@
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  197,244,87,201                      // vxorps        %ymm1,%ymm1,%ymm1
   .byte  73,131,248,2                        // cmp           $0x2,%r8
-  .byte  114,80                              // jb            5ae0 <_sk_gradient_avx+0x69>
+  .byte  114,80                              // jb            5ae8 <_sk_gradient_avx+0x69>
   .byte  72,139,88,72                        // mov           0x48(%rax),%rbx
   .byte  73,255,200                          // dec           %r8
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  196,65,52,87,201                    // vxorps        %ymm9,%ymm9,%ymm9
-  .byte  196,98,125,24,21,187,12,0,0         // vbroadcastss  0xcbb(%rip),%ymm10        # 6764 <_sk_callback_avx+0x469>
+  .byte  196,98,125,24,21,187,12,0,0         // vbroadcastss  0xcbb(%rip),%ymm10        # 676c <_sk_callback_avx+0x469>
   .byte  197,244,87,201                      // vxorps        %ymm1,%ymm1,%ymm1
   .byte  196,98,125,24,3                     // vbroadcastss  (%rbx),%ymm8
   .byte  197,60,194,192,2                    // vcmpleps      %ymm0,%ymm8,%ymm8
@@ -19465,7 +19457,7 @@
   .byte  196,227,117,24,202,1                // vinsertf128   $0x1,%xmm2,%ymm1,%ymm1
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  73,255,200                          // dec           %r8
-  .byte  117,205                             // jne           5aad <_sk_gradient_avx+0x36>
+  .byte  117,205                             // jne           5ab5 <_sk_gradient_avx+0x36>
   .byte  196,195,249,22,200,1                // vpextrq       $0x1,%xmm1,%r8
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  73,193,232,32                       // shr           $0x20,%r8
@@ -19647,27 +19639,27 @@
   .byte  196,65,52,95,226                    // vmaxps        %ymm10,%ymm9,%ymm12
   .byte  196,65,36,94,220                    // vdivps        %ymm12,%ymm11,%ymm11
   .byte  196,65,36,89,227                    // vmulps        %ymm11,%ymm11,%ymm12
-  .byte  196,98,125,24,45,223,8,0,0          // vbroadcastss  0x8df(%rip),%ymm13        # 6768 <_sk_callback_avx+0x46d>
+  .byte  196,98,125,24,45,223,8,0,0          // vbroadcastss  0x8df(%rip),%ymm13        # 6770 <_sk_callback_avx+0x46d>
   .byte  196,65,28,89,237                    // vmulps        %ymm13,%ymm12,%ymm13
-  .byte  196,98,125,24,53,213,8,0,0          // vbroadcastss  0x8d5(%rip),%ymm14        # 676c <_sk_callback_avx+0x471>
+  .byte  196,98,125,24,53,213,8,0,0          // vbroadcastss  0x8d5(%rip),%ymm14        # 6774 <_sk_callback_avx+0x471>
   .byte  196,65,20,88,238                    // vaddps        %ymm14,%ymm13,%ymm13
   .byte  196,65,28,89,237                    // vmulps        %ymm13,%ymm12,%ymm13
-  .byte  196,98,125,24,53,198,8,0,0          // vbroadcastss  0x8c6(%rip),%ymm14        # 6770 <_sk_callback_avx+0x475>
+  .byte  196,98,125,24,53,198,8,0,0          // vbroadcastss  0x8c6(%rip),%ymm14        # 6778 <_sk_callback_avx+0x475>
   .byte  196,65,20,88,238                    // vaddps        %ymm14,%ymm13,%ymm13
   .byte  196,65,28,89,229                    // vmulps        %ymm13,%ymm12,%ymm12
-  .byte  196,98,125,24,45,183,8,0,0          // vbroadcastss  0x8b7(%rip),%ymm13        # 6774 <_sk_callback_avx+0x479>
+  .byte  196,98,125,24,45,183,8,0,0          // vbroadcastss  0x8b7(%rip),%ymm13        # 677c <_sk_callback_avx+0x479>
   .byte  196,65,28,88,229                    // vaddps        %ymm13,%ymm12,%ymm12
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
   .byte  196,65,52,194,202,1                 // vcmpltps      %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,24,21,162,8,0,0          // vbroadcastss  0x8a2(%rip),%ymm10        # 6778 <_sk_callback_avx+0x47d>
+  .byte  196,98,125,24,21,162,8,0,0          // vbroadcastss  0x8a2(%rip),%ymm10        # 6780 <_sk_callback_avx+0x47d>
   .byte  196,65,44,92,211                    // vsubps        %ymm11,%ymm10,%ymm10
   .byte  196,67,37,74,202,144                // vblendvps     %ymm9,%ymm10,%ymm11,%ymm9
   .byte  196,193,124,194,192,1               // vcmpltps      %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,21,140,8,0,0          // vbroadcastss  0x88c(%rip),%ymm10        # 677c <_sk_callback_avx+0x481>
+  .byte  196,98,125,24,21,140,8,0,0          // vbroadcastss  0x88c(%rip),%ymm10        # 6784 <_sk_callback_avx+0x481>
   .byte  196,65,44,92,209                    // vsubps        %ymm9,%ymm10,%ymm10
   .byte  196,195,53,74,194,0                 // vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   .byte  196,65,116,194,200,1                // vcmpltps      %ymm8,%ymm1,%ymm9
-  .byte  196,98,125,24,21,118,8,0,0          // vbroadcastss  0x876(%rip),%ymm10        # 6780 <_sk_callback_avx+0x485>
+  .byte  196,98,125,24,21,118,8,0,0          // vbroadcastss  0x876(%rip),%ymm10        # 6788 <_sk_callback_avx+0x485>
   .byte  197,44,92,208                       // vsubps        %ymm0,%ymm10,%ymm10
   .byte  196,195,125,74,194,144              // vblendvps     %ymm9,%ymm10,%ymm0,%ymm0
   .byte  196,65,124,194,200,3                // vcmpunordps   %ymm8,%ymm0,%ymm9
@@ -19691,7 +19683,7 @@
 FUNCTION(_sk_save_xy_avx)
 _sk_save_xy_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,64,8,0,0            // vbroadcastss  0x840(%rip),%ymm8        # 6784 <_sk_callback_avx+0x489>
+  .byte  196,98,125,24,5,64,8,0,0            // vbroadcastss  0x840(%rip),%ymm8        # 678c <_sk_callback_avx+0x489>
   .byte  196,65,124,88,200                   // vaddps        %ymm8,%ymm0,%ymm9
   .byte  196,67,125,8,209,1                  // vroundps      $0x1,%ymm9,%ymm10
   .byte  196,65,52,92,202                    // vsubps        %ymm10,%ymm9,%ymm9
@@ -19728,9 +19720,9 @@
 FUNCTION(_sk_bilinear_nx_avx)
 _sk_bilinear_nx_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,204,7,0,0          // vbroadcastss  0x7cc(%rip),%ymm0        # 6788 <_sk_callback_avx+0x48d>
+  .byte  196,226,125,24,5,204,7,0,0          // vbroadcastss  0x7cc(%rip),%ymm0        # 6790 <_sk_callback_avx+0x48d>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,195,7,0,0           // vbroadcastss  0x7c3(%rip),%ymm8        # 678c <_sk_callback_avx+0x491>
+  .byte  196,98,125,24,5,195,7,0,0           // vbroadcastss  0x7c3(%rip),%ymm8        # 6794 <_sk_callback_avx+0x491>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -19741,7 +19733,7 @@
 FUNCTION(_sk_bilinear_px_avx)
 _sk_bilinear_px_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,171,7,0,0          // vbroadcastss  0x7ab(%rip),%ymm0        # 6790 <_sk_callback_avx+0x495>
+  .byte  196,226,125,24,5,171,7,0,0          // vbroadcastss  0x7ab(%rip),%ymm0        # 6798 <_sk_callback_avx+0x495>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
   .byte  197,124,16,64,64                    // vmovups       0x40(%rax),%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -19753,9 +19745,9 @@
 FUNCTION(_sk_bilinear_ny_avx)
 _sk_bilinear_ny_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,143,7,0,0         // vbroadcastss  0x78f(%rip),%ymm1        # 6794 <_sk_callback_avx+0x499>
+  .byte  196,226,125,24,13,143,7,0,0         // vbroadcastss  0x78f(%rip),%ymm1        # 679c <_sk_callback_avx+0x499>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,133,7,0,0           // vbroadcastss  0x785(%rip),%ymm8        # 6798 <_sk_callback_avx+0x49d>
+  .byte  196,98,125,24,5,133,7,0,0           // vbroadcastss  0x785(%rip),%ymm8        # 67a0 <_sk_callback_avx+0x49d>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -19766,7 +19758,7 @@
 FUNCTION(_sk_bilinear_py_avx)
 _sk_bilinear_py_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,109,7,0,0         // vbroadcastss  0x76d(%rip),%ymm1        # 679c <_sk_callback_avx+0x4a1>
+  .byte  196,226,125,24,13,109,7,0,0         // vbroadcastss  0x76d(%rip),%ymm1        # 67a4 <_sk_callback_avx+0x4a1>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
   .byte  197,124,16,64,96                    // vmovups       0x60(%rax),%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -19778,14 +19770,14 @@
 FUNCTION(_sk_bicubic_n3x_avx)
 _sk_bicubic_n3x_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,80,7,0,0           // vbroadcastss  0x750(%rip),%ymm0        # 67a0 <_sk_callback_avx+0x4a5>
+  .byte  196,226,125,24,5,80,7,0,0           // vbroadcastss  0x750(%rip),%ymm0        # 67a8 <_sk_callback_avx+0x4a5>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,71,7,0,0            // vbroadcastss  0x747(%rip),%ymm8        # 67a4 <_sk_callback_avx+0x4a9>
+  .byte  196,98,125,24,5,71,7,0,0            // vbroadcastss  0x747(%rip),%ymm8        # 67ac <_sk_callback_avx+0x4a9>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,56,7,0,0           // vbroadcastss  0x738(%rip),%ymm10        # 67a8 <_sk_callback_avx+0x4ad>
+  .byte  196,98,125,24,21,56,7,0,0           // vbroadcastss  0x738(%rip),%ymm10        # 67b0 <_sk_callback_avx+0x4ad>
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
-  .byte  196,98,125,24,21,46,7,0,0           // vbroadcastss  0x72e(%rip),%ymm10        # 67ac <_sk_callback_avx+0x4b1>
+  .byte  196,98,125,24,21,46,7,0,0           // vbroadcastss  0x72e(%rip),%ymm10        # 67b4 <_sk_callback_avx+0x4b1>
   .byte  196,65,60,88,194                    // vaddps        %ymm10,%ymm8,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -19797,19 +19789,19 @@
 FUNCTION(_sk_bicubic_n1x_avx)
 _sk_bicubic_n1x_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,17,7,0,0           // vbroadcastss  0x711(%rip),%ymm0        # 67b0 <_sk_callback_avx+0x4b5>
+  .byte  196,226,125,24,5,17,7,0,0           // vbroadcastss  0x711(%rip),%ymm0        # 67b8 <_sk_callback_avx+0x4b5>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,8,7,0,0             // vbroadcastss  0x708(%rip),%ymm8        # 67b4 <_sk_callback_avx+0x4b9>
+  .byte  196,98,125,24,5,8,7,0,0             // vbroadcastss  0x708(%rip),%ymm8        # 67bc <_sk_callback_avx+0x4b9>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
-  .byte  196,98,125,24,13,254,6,0,0          // vbroadcastss  0x6fe(%rip),%ymm9        # 67b8 <_sk_callback_avx+0x4bd>
+  .byte  196,98,125,24,13,254,6,0,0          // vbroadcastss  0x6fe(%rip),%ymm9        # 67c0 <_sk_callback_avx+0x4bd>
   .byte  196,65,60,89,201                    // vmulps        %ymm9,%ymm8,%ymm9
-  .byte  196,98,125,24,21,244,6,0,0          // vbroadcastss  0x6f4(%rip),%ymm10        # 67bc <_sk_callback_avx+0x4c1>
+  .byte  196,98,125,24,21,244,6,0,0          // vbroadcastss  0x6f4(%rip),%ymm10        # 67c4 <_sk_callback_avx+0x4c1>
   .byte  196,65,52,88,202                    // vaddps        %ymm10,%ymm9,%ymm9
   .byte  196,65,60,89,201                    // vmulps        %ymm9,%ymm8,%ymm9
-  .byte  196,98,125,24,21,229,6,0,0          // vbroadcastss  0x6e5(%rip),%ymm10        # 67c0 <_sk_callback_avx+0x4c5>
+  .byte  196,98,125,24,21,229,6,0,0          // vbroadcastss  0x6e5(%rip),%ymm10        # 67c8 <_sk_callback_avx+0x4c5>
   .byte  196,65,52,88,202                    // vaddps        %ymm10,%ymm9,%ymm9
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
-  .byte  196,98,125,24,13,214,6,0,0          // vbroadcastss  0x6d6(%rip),%ymm9        # 67c4 <_sk_callback_avx+0x4c9>
+  .byte  196,98,125,24,13,214,6,0,0          // vbroadcastss  0x6d6(%rip),%ymm9        # 67cc <_sk_callback_avx+0x4c9>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -19820,17 +19812,17 @@
 FUNCTION(_sk_bicubic_p1x_avx)
 _sk_bicubic_p1x_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,190,6,0,0           // vbroadcastss  0x6be(%rip),%ymm8        # 67c8 <_sk_callback_avx+0x4cd>
+  .byte  196,98,125,24,5,190,6,0,0           // vbroadcastss  0x6be(%rip),%ymm8        # 67d0 <_sk_callback_avx+0x4cd>
   .byte  197,188,88,0                        // vaddps        (%rax),%ymm8,%ymm0
   .byte  197,124,16,72,64                    // vmovups       0x40(%rax),%ymm9
-  .byte  196,98,125,24,21,176,6,0,0          // vbroadcastss  0x6b0(%rip),%ymm10        # 67cc <_sk_callback_avx+0x4d1>
+  .byte  196,98,125,24,21,176,6,0,0          // vbroadcastss  0x6b0(%rip),%ymm10        # 67d4 <_sk_callback_avx+0x4d1>
   .byte  196,65,52,89,210                    // vmulps        %ymm10,%ymm9,%ymm10
-  .byte  196,98,125,24,29,166,6,0,0          // vbroadcastss  0x6a6(%rip),%ymm11        # 67d0 <_sk_callback_avx+0x4d5>
+  .byte  196,98,125,24,29,166,6,0,0          // vbroadcastss  0x6a6(%rip),%ymm11        # 67d8 <_sk_callback_avx+0x4d5>
   .byte  196,65,44,88,211                    // vaddps        %ymm11,%ymm10,%ymm10
   .byte  196,65,52,89,210                    // vmulps        %ymm10,%ymm9,%ymm10
   .byte  196,65,44,88,192                    // vaddps        %ymm8,%ymm10,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
-  .byte  196,98,125,24,13,141,6,0,0          // vbroadcastss  0x68d(%rip),%ymm9        # 67d4 <_sk_callback_avx+0x4d9>
+  .byte  196,98,125,24,13,141,6,0,0          // vbroadcastss  0x68d(%rip),%ymm9        # 67dc <_sk_callback_avx+0x4d9>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -19841,13 +19833,13 @@
 FUNCTION(_sk_bicubic_p3x_avx)
 _sk_bicubic_p3x_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,117,6,0,0          // vbroadcastss  0x675(%rip),%ymm0        # 67d8 <_sk_callback_avx+0x4dd>
+  .byte  196,226,125,24,5,117,6,0,0          // vbroadcastss  0x675(%rip),%ymm0        # 67e0 <_sk_callback_avx+0x4dd>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
   .byte  197,124,16,64,64                    // vmovups       0x40(%rax),%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,98,6,0,0           // vbroadcastss  0x662(%rip),%ymm10        # 67dc <_sk_callback_avx+0x4e1>
+  .byte  196,98,125,24,21,98,6,0,0           // vbroadcastss  0x662(%rip),%ymm10        # 67e4 <_sk_callback_avx+0x4e1>
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
-  .byte  196,98,125,24,21,88,6,0,0           // vbroadcastss  0x658(%rip),%ymm10        # 67e0 <_sk_callback_avx+0x4e5>
+  .byte  196,98,125,24,21,88,6,0,0           // vbroadcastss  0x658(%rip),%ymm10        # 67e8 <_sk_callback_avx+0x4e5>
   .byte  196,65,60,88,194                    // vaddps        %ymm10,%ymm8,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -19859,14 +19851,14 @@
 FUNCTION(_sk_bicubic_n3y_avx)
 _sk_bicubic_n3y_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,59,6,0,0          // vbroadcastss  0x63b(%rip),%ymm1        # 67e4 <_sk_callback_avx+0x4e9>
+  .byte  196,226,125,24,13,59,6,0,0          // vbroadcastss  0x63b(%rip),%ymm1        # 67ec <_sk_callback_avx+0x4e9>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,49,6,0,0            // vbroadcastss  0x631(%rip),%ymm8        # 67e8 <_sk_callback_avx+0x4ed>
+  .byte  196,98,125,24,5,49,6,0,0            // vbroadcastss  0x631(%rip),%ymm8        # 67f0 <_sk_callback_avx+0x4ed>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,34,6,0,0           // vbroadcastss  0x622(%rip),%ymm10        # 67ec <_sk_callback_avx+0x4f1>
+  .byte  196,98,125,24,21,34,6,0,0           // vbroadcastss  0x622(%rip),%ymm10        # 67f4 <_sk_callback_avx+0x4f1>
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
-  .byte  196,98,125,24,21,24,6,0,0           // vbroadcastss  0x618(%rip),%ymm10        # 67f0 <_sk_callback_avx+0x4f5>
+  .byte  196,98,125,24,21,24,6,0,0           // vbroadcastss  0x618(%rip),%ymm10        # 67f8 <_sk_callback_avx+0x4f5>
   .byte  196,65,60,88,194                    // vaddps        %ymm10,%ymm8,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -19878,19 +19870,19 @@
 FUNCTION(_sk_bicubic_n1y_avx)
 _sk_bicubic_n1y_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,251,5,0,0         // vbroadcastss  0x5fb(%rip),%ymm1        # 67f4 <_sk_callback_avx+0x4f9>
+  .byte  196,226,125,24,13,251,5,0,0         // vbroadcastss  0x5fb(%rip),%ymm1        # 67fc <_sk_callback_avx+0x4f9>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,241,5,0,0           // vbroadcastss  0x5f1(%rip),%ymm8        # 67f8 <_sk_callback_avx+0x4fd>
+  .byte  196,98,125,24,5,241,5,0,0           // vbroadcastss  0x5f1(%rip),%ymm8        # 6800 <_sk_callback_avx+0x4fd>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
-  .byte  196,98,125,24,13,231,5,0,0          // vbroadcastss  0x5e7(%rip),%ymm9        # 67fc <_sk_callback_avx+0x501>
+  .byte  196,98,125,24,13,231,5,0,0          // vbroadcastss  0x5e7(%rip),%ymm9        # 6804 <_sk_callback_avx+0x501>
   .byte  196,65,60,89,201                    // vmulps        %ymm9,%ymm8,%ymm9
-  .byte  196,98,125,24,21,221,5,0,0          // vbroadcastss  0x5dd(%rip),%ymm10        # 6800 <_sk_callback_avx+0x505>
+  .byte  196,98,125,24,21,221,5,0,0          // vbroadcastss  0x5dd(%rip),%ymm10        # 6808 <_sk_callback_avx+0x505>
   .byte  196,65,52,88,202                    // vaddps        %ymm10,%ymm9,%ymm9
   .byte  196,65,60,89,201                    // vmulps        %ymm9,%ymm8,%ymm9
-  .byte  196,98,125,24,21,206,5,0,0          // vbroadcastss  0x5ce(%rip),%ymm10        # 6804 <_sk_callback_avx+0x509>
+  .byte  196,98,125,24,21,206,5,0,0          // vbroadcastss  0x5ce(%rip),%ymm10        # 680c <_sk_callback_avx+0x509>
   .byte  196,65,52,88,202                    // vaddps        %ymm10,%ymm9,%ymm9
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
-  .byte  196,98,125,24,13,191,5,0,0          // vbroadcastss  0x5bf(%rip),%ymm9        # 6808 <_sk_callback_avx+0x50d>
+  .byte  196,98,125,24,13,191,5,0,0          // vbroadcastss  0x5bf(%rip),%ymm9        # 6810 <_sk_callback_avx+0x50d>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -19901,17 +19893,17 @@
 FUNCTION(_sk_bicubic_p1y_avx)
 _sk_bicubic_p1y_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,167,5,0,0           // vbroadcastss  0x5a7(%rip),%ymm8        # 680c <_sk_callback_avx+0x511>
+  .byte  196,98,125,24,5,167,5,0,0           // vbroadcastss  0x5a7(%rip),%ymm8        # 6814 <_sk_callback_avx+0x511>
   .byte  197,188,88,72,32                    // vaddps        0x20(%rax),%ymm8,%ymm1
   .byte  197,124,16,72,96                    // vmovups       0x60(%rax),%ymm9
-  .byte  196,98,125,24,21,152,5,0,0          // vbroadcastss  0x598(%rip),%ymm10        # 6810 <_sk_callback_avx+0x515>
+  .byte  196,98,125,24,21,152,5,0,0          // vbroadcastss  0x598(%rip),%ymm10        # 6818 <_sk_callback_avx+0x515>
   .byte  196,65,52,89,210                    // vmulps        %ymm10,%ymm9,%ymm10
-  .byte  196,98,125,24,29,142,5,0,0          // vbroadcastss  0x58e(%rip),%ymm11        # 6814 <_sk_callback_avx+0x519>
+  .byte  196,98,125,24,29,142,5,0,0          // vbroadcastss  0x58e(%rip),%ymm11        # 681c <_sk_callback_avx+0x519>
   .byte  196,65,44,88,211                    // vaddps        %ymm11,%ymm10,%ymm10
   .byte  196,65,52,89,210                    // vmulps        %ymm10,%ymm9,%ymm10
   .byte  196,65,44,88,192                    // vaddps        %ymm8,%ymm10,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
-  .byte  196,98,125,24,13,117,5,0,0          // vbroadcastss  0x575(%rip),%ymm9        # 6818 <_sk_callback_avx+0x51d>
+  .byte  196,98,125,24,13,117,5,0,0          // vbroadcastss  0x575(%rip),%ymm9        # 6820 <_sk_callback_avx+0x51d>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -19922,13 +19914,13 @@
 FUNCTION(_sk_bicubic_p3y_avx)
 _sk_bicubic_p3y_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,93,5,0,0          // vbroadcastss  0x55d(%rip),%ymm1        # 681c <_sk_callback_avx+0x521>
+  .byte  196,226,125,24,13,93,5,0,0          // vbroadcastss  0x55d(%rip),%ymm1        # 6824 <_sk_callback_avx+0x521>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
   .byte  197,124,16,64,96                    // vmovups       0x60(%rax),%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,73,5,0,0           // vbroadcastss  0x549(%rip),%ymm10        # 6820 <_sk_callback_avx+0x525>
+  .byte  196,98,125,24,21,73,5,0,0           // vbroadcastss  0x549(%rip),%ymm10        # 6828 <_sk_callback_avx+0x525>
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
-  .byte  196,98,125,24,21,63,5,0,0           // vbroadcastss  0x53f(%rip),%ymm10        # 6824 <_sk_callback_avx+0x529>
+  .byte  196,98,125,24,21,63,5,0,0           // vbroadcastss  0x53f(%rip),%ymm10        # 682c <_sk_callback_avx+0x529>
   .byte  196,65,60,88,194                    // vaddps        %ymm10,%ymm8,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -20052,25 +20044,25 @@
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 64d1 <.literal4+0xb1>
+  .byte  71,225,61                           // rex.RXB       loope 64d9 <.literal4+0xb1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 64e1 <.literal4+0xc1>
+  .byte  71,225,61                           // rex.RXB       loope 64e9 <.literal4+0xc1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 64f1 <.literal4+0xd1>
+  .byte  71,225,61                           // rex.RXB       loope 64f9 <.literal4+0xd1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 6501 <.literal4+0xe1>
+  .byte  71,225,61                           // rex.RXB       loope 6509 <.literal4+0xe1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -20118,7 +20110,7 @@
   .byte  190,129,128,128,59                  // mov           $0x3b808081,%esi
   .byte  129,128,128,59,0,248,0,0,8,33       // addl          $0x21080000,-0x7ffc480(%rax)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        654d <.literal4+0x12d>
+  .byte  224,7                               // loopne        6555 <.literal4+0x12d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -20134,10 +20126,10 @@
   .byte  129,128,128,59,129,128,128,59,0,0   // addl          $0x3b80,-0x7f7ec480(%rax)
   .byte  0,52,255                            // add           %dh,(%rdi,%rdi,8)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6574 <.literal4+0x154>
+  .byte  127,0                               // jg            657c <.literal4+0x154>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            65ed <.literal4+0x1cd>
+  .byte  119,115                             // ja            65f5 <.literal4+0x1cd>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -20151,10 +20143,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            65a8 <.literal4+0x188>
+  .byte  127,0                               // jg            65b0 <.literal4+0x188>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            6621 <.literal4+0x201>
+  .byte  119,115                             // ja            6629 <.literal4+0x201>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -20168,10 +20160,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            65dc <.literal4+0x1bc>
+  .byte  127,0                               // jg            65e4 <.literal4+0x1bc>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            6655 <.literal4+0x235>
+  .byte  119,115                             // ja            665d <.literal4+0x235>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -20185,10 +20177,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6610 <.literal4+0x1f0>
+  .byte  127,0                               // jg            6618 <.literal4+0x1f0>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            6689 <.literal4+0x269>
+  .byte  119,115                             // ja            6691 <.literal4+0x269>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -20201,7 +20193,7 @@
   .byte  0,75,0                              // add           %cl,0x0(%rbx)
   .byte  0,128,63,0,0,200                    // add           %al,-0x37ffffc1(%rax)
   .byte  66,0,0                              // rex.X         add %al,(%rax)
-  .byte  127,67                              // jg            6687 <.literal4+0x267>
+  .byte  127,67                              // jg            668f <.literal4+0x267>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,195                               // add           %al,%bl
   .byte  0,0                                 // add           %al,(%rax)
@@ -20213,10 +20205,10 @@
   .byte  190,80,128,3,62                     // mov           $0x3e038050,%esi
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           66a7 <.literal4+0x287>
+  .byte  118,63                              // jbe           66af <.literal4+0x287>
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  129,128,128,59,129,128,128,59,0,0   // addl          $0x3b80,-0x7f7ec480(%rax)
-  .byte  127,67                              // jg            66bb <.literal4+0x29b>
+  .byte  127,67                              // jg            66c3 <.literal4+0x29b>
   .byte  129,128,128,59,0,0,128,63,129,128   // addl          $0x80813f80,0x3b80(%rax)
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
   .byte  0,128,63,129,128,128                // add           %al,-0x7f7f7ec1(%rax)
@@ -20225,7 +20217,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        669d <.literal4+0x27d>
+  .byte  224,7                               // loopne        66a5 <.literal4+0x27d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -20237,7 +20229,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        66b9 <.literal4+0x299>
+  .byte  224,7                               // loopne        66c1 <.literal4+0x299>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -20248,7 +20240,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  248                                 // clc
   .byte  65,0,0                              // add           %al,(%r8)
-  .byte  124,66                              // jl            670e <.literal4+0x2ee>
+  .byte  124,66                              // jl            6716 <.literal4+0x2ee>
   .byte  0,240                               // add           %dh,%al
   .byte  0,0                                 // add           %al,(%rax)
   .byte  137,136,136,55,0,15                 // mov           %ecx,0xf003788(%rax)
@@ -20266,9 +20258,9 @@
   .byte  137,136,136,59,15,0                 // mov           %ecx,0xf3b88(%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  137,136,136,61,0,0                  // mov           %ecx,0x3d88(%rax)
-  .byte  112,65                              // jo            6751 <.literal4+0x331>
+  .byte  112,65                              // jo            6759 <.literal4+0x331>
   .byte  129,128,128,59,129,128,128,59,0,0   // addl          $0x3b80,-0x7f7ec480(%rax)
-  .byte  127,67                              // jg            675f <.literal4+0x33f>
+  .byte  127,67                              // jg            6767 <.literal4+0x33f>
   .byte  0,128,0,0,0,0                       // add           %al,0x0(%rax)
   .byte  0,128,0,4,0,128                     // add           %al,-0x7ffffc00(%rax)
   .byte  0,0                                 // add           %al,(%rax)
@@ -20284,7 +20276,7 @@
   .byte  0,128,55,0,0,128                    // add           %al,-0x7fffffc9(%rax)
   .byte  63                                  // (bad)
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            679f <.literal4+0x37f>
+  .byte  127,71                              // jg            67a7 <.literal4+0x37f>
   .byte  208                                 // (bad)
   .byte  179,89                              // mov           $0x59,%bl
   .byte  62,89                               // ds            pop %rcx
@@ -20514,7 +20506,7 @@
   .byte  102,15,110,199                      // movd          %edi,%xmm0
   .byte  102,15,112,192,0                    // pshufd        $0x0,%xmm0,%xmm0
   .byte  15,91,200                           // cvtdq2ps      %xmm0,%xmm1
-  .byte  15,40,21,84,71,0,0                  // movaps        0x4754(%rip),%xmm2        # 47d0 <_sk_callback_sse41+0xda>
+  .byte  15,40,21,84,71,0,0                  // movaps        0x4754(%rip),%xmm2        # 47d0 <_sk_callback_sse41+0xe0>
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  15,16,2                             // movups        (%rdx),%xmm0
   .byte  15,88,193                           // addps         %xmm1,%xmm0
@@ -20523,7 +20515,7 @@
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,21,67,71,0,0                  // movaps        0x4743(%rip),%xmm2        # 47e0 <_sk_callback_sse41+0xea>
+  .byte  15,40,21,67,71,0,0                  // movaps        0x4743(%rip),%xmm2        # 47e0 <_sk_callback_sse41+0xf0>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  15,87,237                           // xorps         %xmm5,%xmm5
@@ -20538,22 +20530,20 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  102,68,15,110,199                   // movd          %edi,%xmm8
   .byte  102,69,15,112,192,0                 // pshufd        $0x0,%xmm8,%xmm8
-  .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,16,10                         // movups        (%rdx),%xmm9
-  .byte  69,15,88,200                        // addps         %xmm8,%xmm9
-  .byte  243,69,15,91,201                    // cvttps2dq     %xmm9,%xmm9
+  .byte  243,68,15,111,74,32                 // movdqu        0x20(%rdx),%xmm9
+  .byte  102,69,15,254,200                   // paddd         %xmm8,%xmm9
   .byte  72,139,8                            // mov           (%rax),%rcx
   .byte  102,68,15,110,1                     // movd          (%rcx),%xmm8
   .byte  102,69,15,112,192,0                 // pshufd        $0x0,%xmm8,%xmm8
   .byte  102,69,15,239,193                   // pxor          %xmm9,%xmm8
-  .byte  102,68,15,111,21,8,71,0,0           // movdqa        0x4708(%rip),%xmm10        # 47f0 <_sk_callback_sse41+0xfa>
+  .byte  102,68,15,111,21,14,71,0,0          // movdqa        0x470e(%rip),%xmm10        # 47f0 <_sk_callback_sse41+0x100>
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
   .byte  102,69,15,219,218                   // pand          %xmm10,%xmm11
   .byte  102,65,15,114,243,5                 // pslld         $0x5,%xmm11
   .byte  102,69,15,219,209                   // pand          %xmm9,%xmm10
   .byte  102,65,15,114,242,4                 // pslld         $0x4,%xmm10
-  .byte  102,68,15,111,37,244,70,0,0         // movdqa        0x46f4(%rip),%xmm12        # 4800 <_sk_callback_sse41+0x10a>
-  .byte  102,68,15,111,45,251,70,0,0         // movdqa        0x46fb(%rip),%xmm13        # 4810 <_sk_callback_sse41+0x11a>
+  .byte  102,68,15,111,37,250,70,0,0         // movdqa        0x46fa(%rip),%xmm12        # 4800 <_sk_callback_sse41+0x110>
+  .byte  102,68,15,111,45,1,71,0,0           // movdqa        0x4701(%rip),%xmm13        # 4810 <_sk_callback_sse41+0x120>
   .byte  102,69,15,111,240                   // movdqa        %xmm8,%xmm14
   .byte  102,69,15,219,245                   // pand          %xmm13,%xmm14
   .byte  102,65,15,114,246,2                 // pslld         $0x2,%xmm14
@@ -20565,12 +20555,12 @@
   .byte  102,65,15,114,209,2                 // psrld         $0x2,%xmm9
   .byte  102,69,15,235,234                   // por           %xmm10,%xmm13
   .byte  102,69,15,235,233                   // por           %xmm9,%xmm13
-  .byte  102,69,15,235,243                   // por           %xmm11,%xmm14
-  .byte  102,69,15,235,245                   // por           %xmm13,%xmm14
-  .byte  102,69,15,235,240                   // por           %xmm8,%xmm14
-  .byte  69,15,91,198                        // cvtdq2ps      %xmm14,%xmm8
-  .byte  68,15,89,5,182,70,0,0               // mulps         0x46b6(%rip),%xmm8        # 4820 <_sk_callback_sse41+0x12a>
-  .byte  68,15,88,5,190,70,0,0               // addps         0x46be(%rip),%xmm8        # 4830 <_sk_callback_sse41+0x13a>
+  .byte  102,69,15,235,235                   // por           %xmm11,%xmm13
+  .byte  102,69,15,235,198                   // por           %xmm14,%xmm8
+  .byte  102,69,15,235,197                   // por           %xmm13,%xmm8
+  .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
+  .byte  68,15,89,5,188,70,0,0               // mulps         0x46bc(%rip),%xmm8        # 4820 <_sk_callback_sse41+0x130>
+  .byte  68,15,88,5,196,70,0,0               // addps         0x46c4(%rip),%xmm8        # 4830 <_sk_callback_sse41+0x140>
   .byte  243,68,15,16,80,8                   // movss         0x8(%rax),%xmm10
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
@@ -20647,7 +20637,7 @@
 FUNCTION(_sk_srcatop_sse41)
 _sk_srcatop_sse41:
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
-  .byte  68,15,40,5,23,70,0,0                // movaps        0x4617(%rip),%xmm8        # 4840 <_sk_callback_sse41+0x14a>
+  .byte  68,15,40,5,29,70,0,0                // movaps        0x461d(%rip),%xmm8        # 4840 <_sk_callback_sse41+0x150>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -20672,7 +20662,7 @@
 _sk_dstatop_sse41:
   .byte  68,15,40,195                        // movaps        %xmm3,%xmm8
   .byte  68,15,89,196                        // mulps         %xmm4,%xmm8
-  .byte  68,15,40,13,218,69,0,0              // movaps        0x45da(%rip),%xmm9        # 4850 <_sk_callback_sse41+0x15a>
+  .byte  68,15,40,13,224,69,0,0              // movaps        0x45e0(%rip),%xmm9        # 4850 <_sk_callback_sse41+0x160>
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
@@ -20719,7 +20709,7 @@
 .globl _sk_srcout_sse41
 FUNCTION(_sk_srcout_sse41)
 _sk_srcout_sse41:
-  .byte  68,15,40,5,126,69,0,0               // movaps        0x457e(%rip),%xmm8        # 4860 <_sk_callback_sse41+0x16a>
+  .byte  68,15,40,5,132,69,0,0               // movaps        0x4584(%rip),%xmm8        # 4860 <_sk_callback_sse41+0x170>
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
@@ -20732,7 +20722,7 @@
 .globl _sk_dstout_sse41
 FUNCTION(_sk_dstout_sse41)
 _sk_dstout_sse41:
-  .byte  68,15,40,5,110,69,0,0               // movaps        0x456e(%rip),%xmm8        # 4870 <_sk_callback_sse41+0x17a>
+  .byte  68,15,40,5,116,69,0,0               // movaps        0x4574(%rip),%xmm8        # 4870 <_sk_callback_sse41+0x180>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
@@ -20749,7 +20739,7 @@
 .globl _sk_srcover_sse41
 FUNCTION(_sk_srcover_sse41)
 _sk_srcover_sse41:
-  .byte  68,15,40,5,81,69,0,0                // movaps        0x4551(%rip),%xmm8        # 4880 <_sk_callback_sse41+0x18a>
+  .byte  68,15,40,5,87,69,0,0                // movaps        0x4557(%rip),%xmm8        # 4880 <_sk_callback_sse41+0x190>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -20769,7 +20759,7 @@
 .globl _sk_dstover_sse41
 FUNCTION(_sk_dstover_sse41)
 _sk_dstover_sse41:
-  .byte  68,15,40,5,37,69,0,0                // movaps        0x4525(%rip),%xmm8        # 4890 <_sk_callback_sse41+0x19a>
+  .byte  68,15,40,5,43,69,0,0                // movaps        0x452b(%rip),%xmm8        # 4890 <_sk_callback_sse41+0x1a0>
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -20797,7 +20787,7 @@
 .globl _sk_multiply_sse41
 FUNCTION(_sk_multiply_sse41)
 _sk_multiply_sse41:
-  .byte  68,15,40,5,249,68,0,0               // movaps        0x44f9(%rip),%xmm8        # 48a0 <_sk_callback_sse41+0x1aa>
+  .byte  68,15,40,5,255,68,0,0               // movaps        0x44ff(%rip),%xmm8        # 48a0 <_sk_callback_sse41+0x1b0>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
@@ -20873,7 +20863,7 @@
 FUNCTION(_sk_xor__sse41)
 _sk_xor__sse41:
   .byte  68,15,40,195                        // movaps        %xmm3,%xmm8
-  .byte  15,40,29,42,68,0,0                  // movaps        0x442a(%rip),%xmm3        # 48b0 <_sk_callback_sse41+0x1ba>
+  .byte  15,40,29,48,68,0,0                  // movaps        0x4430(%rip),%xmm3        # 48b0 <_sk_callback_sse41+0x1c0>
   .byte  68,15,40,203                        // movaps        %xmm3,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
@@ -20921,7 +20911,7 @@
   .byte  68,15,89,206                        // mulps         %xmm6,%xmm9
   .byte  65,15,95,209                        // maxps         %xmm9,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,149,67,0,0                 // movaps        0x4395(%rip),%xmm2        # 48c0 <_sk_callback_sse41+0x1ca>
+  .byte  15,40,21,155,67,0,0                 // movaps        0x439b(%rip),%xmm2        # 48c0 <_sk_callback_sse41+0x1d0>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -20955,7 +20945,7 @@
   .byte  68,15,89,206                        // mulps         %xmm6,%xmm9
   .byte  65,15,93,209                        // minps         %xmm9,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,58,67,0,0                  // movaps        0x433a(%rip),%xmm2        # 48d0 <_sk_callback_sse41+0x1da>
+  .byte  15,40,21,64,67,0,0                  // movaps        0x4340(%rip),%xmm2        # 48d0 <_sk_callback_sse41+0x1e0>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -20992,7 +20982,7 @@
   .byte  65,15,93,209                        // minps         %xmm9,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,212,66,0,0                 // movaps        0x42d4(%rip),%xmm2        # 48e0 <_sk_callback_sse41+0x1ea>
+  .byte  15,40,21,218,66,0,0                 // movaps        0x42da(%rip),%xmm2        # 48e0 <_sk_callback_sse41+0x1f0>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -21019,7 +21009,7 @@
   .byte  15,89,214                           // mulps         %xmm6,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  68,15,92,202                        // subps         %xmm2,%xmm9
-  .byte  15,40,13,149,66,0,0                 // movaps        0x4295(%rip),%xmm1        # 48f0 <_sk_callback_sse41+0x1fa>
+  .byte  15,40,13,155,66,0,0                 // movaps        0x429b(%rip),%xmm1        # 48f0 <_sk_callback_sse41+0x200>
   .byte  15,92,203                           // subps         %xmm3,%xmm1
   .byte  15,89,207                           // mulps         %xmm7,%xmm1
   .byte  15,88,217                           // addps         %xmm1,%xmm3
@@ -21033,7 +21023,7 @@
 FUNCTION(_sk_colorburn_sse41)
 _sk_colorburn_sse41:
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,40,21,132,66,0,0              // movaps        0x4284(%rip),%xmm10        # 4900 <_sk_callback_sse41+0x20a>
+  .byte  68,15,40,21,138,66,0,0              // movaps        0x428a(%rip),%xmm10        # 4900 <_sk_callback_sse41+0x210>
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
   .byte  68,15,92,223                        // subps         %xmm7,%xmm11
   .byte  69,15,40,203                        // movaps        %xmm11,%xmm9
@@ -21115,7 +21105,7 @@
 FUNCTION(_sk_colordodge_sse41)
 _sk_colordodge_sse41:
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,40,21,98,65,0,0               // movaps        0x4162(%rip),%xmm10        # 4910 <_sk_callback_sse41+0x21a>
+  .byte  68,15,40,21,104,65,0,0              // movaps        0x4168(%rip),%xmm10        # 4910 <_sk_callback_sse41+0x220>
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
   .byte  68,15,92,223                        // subps         %xmm7,%xmm11
   .byte  69,15,40,227                        // movaps        %xmm11,%xmm12
@@ -21197,7 +21187,7 @@
   .byte  15,40,244                           // movaps        %xmm4,%xmm6
   .byte  15,40,227                           // movaps        %xmm3,%xmm4
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
-  .byte  68,15,40,21,59,64,0,0               // movaps        0x403b(%rip),%xmm10        # 4920 <_sk_callback_sse41+0x22a>
+  .byte  68,15,40,21,65,64,0,0               // movaps        0x4041(%rip),%xmm10        # 4920 <_sk_callback_sse41+0x230>
   .byte  65,15,40,234                        // movaps        %xmm10,%xmm5
   .byte  15,92,239                           // subps         %xmm7,%xmm5
   .byte  15,40,197                           // movaps        %xmm5,%xmm0
@@ -21280,7 +21270,7 @@
 _sk_overlay_sse41:
   .byte  68,15,40,201                        // movaps        %xmm1,%xmm9
   .byte  68,15,40,240                        // movaps        %xmm0,%xmm14
-  .byte  68,15,40,21,32,63,0,0               // movaps        0x3f20(%rip),%xmm10        # 4930 <_sk_callback_sse41+0x23a>
+  .byte  68,15,40,21,38,63,0,0               // movaps        0x3f26(%rip),%xmm10        # 4930 <_sk_callback_sse41+0x240>
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
   .byte  68,15,92,223                        // subps         %xmm7,%xmm11
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
@@ -21365,7 +21355,7 @@
   .byte  15,40,198                           // movaps        %xmm6,%xmm0
   .byte  15,94,199                           // divps         %xmm7,%xmm0
   .byte  65,15,84,193                        // andps         %xmm9,%xmm0
-  .byte  15,40,13,247,61,0,0                 // movaps        0x3df7(%rip),%xmm1        # 4940 <_sk_callback_sse41+0x24a>
+  .byte  15,40,13,253,61,0,0                 // movaps        0x3dfd(%rip),%xmm1        # 4940 <_sk_callback_sse41+0x250>
   .byte  68,15,40,209                        // movaps        %xmm1,%xmm10
   .byte  68,15,92,208                        // subps         %xmm0,%xmm10
   .byte  68,15,40,240                        // movaps        %xmm0,%xmm14
@@ -21378,10 +21368,10 @@
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  15,89,210                           // mulps         %xmm2,%xmm2
   .byte  15,88,208                           // addps         %xmm0,%xmm2
-  .byte  68,15,40,45,213,61,0,0              // movaps        0x3dd5(%rip),%xmm13        # 4950 <_sk_callback_sse41+0x25a>
+  .byte  68,15,40,45,219,61,0,0              // movaps        0x3ddb(%rip),%xmm13        # 4950 <_sk_callback_sse41+0x260>
   .byte  69,15,88,245                        // addps         %xmm13,%xmm14
   .byte  68,15,89,242                        // mulps         %xmm2,%xmm14
-  .byte  68,15,40,37,213,61,0,0              // movaps        0x3dd5(%rip),%xmm12        # 4960 <_sk_callback_sse41+0x26a>
+  .byte  68,15,40,37,219,61,0,0              // movaps        0x3ddb(%rip),%xmm12        # 4960 <_sk_callback_sse41+0x270>
   .byte  69,15,89,252                        // mulps         %xmm12,%xmm15
   .byte  69,15,88,254                        // addps         %xmm14,%xmm15
   .byte  15,40,198                           // movaps        %xmm6,%xmm0
@@ -21567,12 +21557,12 @@
   .byte  68,15,84,208                        // andps         %xmm0,%xmm10
   .byte  15,84,200                           // andps         %xmm0,%xmm1
   .byte  68,15,84,232                        // andps         %xmm0,%xmm13
-  .byte  15,40,5,64,59,0,0                   // movaps        0x3b40(%rip),%xmm0        # 4970 <_sk_callback_sse41+0x27a>
+  .byte  15,40,5,70,59,0,0                   // movaps        0x3b46(%rip),%xmm0        # 4970 <_sk_callback_sse41+0x280>
   .byte  68,15,89,224                        // mulps         %xmm0,%xmm12
-  .byte  15,40,21,69,59,0,0                  // movaps        0x3b45(%rip),%xmm2        # 4980 <_sk_callback_sse41+0x28a>
+  .byte  15,40,21,75,59,0,0                  // movaps        0x3b4b(%rip),%xmm2        # 4980 <_sk_callback_sse41+0x290>
   .byte  15,89,250                           // mulps         %xmm2,%xmm7
   .byte  65,15,88,252                        // addps         %xmm12,%xmm7
-  .byte  68,15,40,53,70,59,0,0               // movaps        0x3b46(%rip),%xmm14        # 4990 <_sk_callback_sse41+0x29a>
+  .byte  68,15,40,53,76,59,0,0               // movaps        0x3b4c(%rip),%xmm14        # 4990 <_sk_callback_sse41+0x2a0>
   .byte  68,15,40,252                        // movaps        %xmm4,%xmm15
   .byte  69,15,89,254                        // mulps         %xmm14,%xmm15
   .byte  68,15,88,255                        // addps         %xmm7,%xmm15
@@ -21655,7 +21645,7 @@
   .byte  65,15,88,214                        // addps         %xmm14,%xmm2
   .byte  15,40,196                           // movaps        %xmm4,%xmm0
   .byte  102,15,56,20,202                    // blendvps      %xmm0,%xmm2,%xmm1
-  .byte  68,15,40,13,10,58,0,0               // movaps        0x3a0a(%rip),%xmm9        # 49a0 <_sk_callback_sse41+0x2aa>
+  .byte  68,15,40,13,16,58,0,0               // movaps        0x3a10(%rip),%xmm9        # 49a0 <_sk_callback_sse41+0x2b0>
   .byte  65,15,40,225                        // movaps        %xmm9,%xmm4
   .byte  15,92,229                           // subps         %xmm5,%xmm4
   .byte  15,40,68,36,200                     // movaps        -0x38(%rsp),%xmm0
@@ -21749,14 +21739,14 @@
   .byte  68,15,84,215                        // andps         %xmm7,%xmm10
   .byte  68,15,84,223                        // andps         %xmm7,%xmm11
   .byte  68,15,84,199                        // andps         %xmm7,%xmm8
-  .byte  15,40,21,196,56,0,0                 // movaps        0x38c4(%rip),%xmm2        # 49b0 <_sk_callback_sse41+0x2ba>
+  .byte  15,40,21,202,56,0,0                 // movaps        0x38ca(%rip),%xmm2        # 49b0 <_sk_callback_sse41+0x2c0>
   .byte  15,40,221                           // movaps        %xmm5,%xmm3
   .byte  15,89,218                           // mulps         %xmm2,%xmm3
-  .byte  15,40,13,199,56,0,0                 // movaps        0x38c7(%rip),%xmm1        # 49c0 <_sk_callback_sse41+0x2ca>
+  .byte  15,40,13,205,56,0,0                 // movaps        0x38cd(%rip),%xmm1        # 49c0 <_sk_callback_sse41+0x2d0>
   .byte  15,40,254                           // movaps        %xmm6,%xmm7
   .byte  15,89,249                           // mulps         %xmm1,%xmm7
   .byte  15,88,251                           // addps         %xmm3,%xmm7
-  .byte  68,15,40,45,198,56,0,0              // movaps        0x38c6(%rip),%xmm13        # 49d0 <_sk_callback_sse41+0x2da>
+  .byte  68,15,40,45,204,56,0,0              // movaps        0x38cc(%rip),%xmm13        # 49d0 <_sk_callback_sse41+0x2e0>
   .byte  69,15,89,245                        // mulps         %xmm13,%xmm14
   .byte  68,15,88,247                        // addps         %xmm7,%xmm14
   .byte  65,15,40,218                        // movaps        %xmm10,%xmm3
@@ -21837,7 +21827,7 @@
   .byte  65,15,88,253                        // addps         %xmm13,%xmm7
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  102,68,15,56,20,223                 // blendvps      %xmm0,%xmm7,%xmm11
-  .byte  68,15,40,13,140,55,0,0              // movaps        0x378c(%rip),%xmm9        # 49e0 <_sk_callback_sse41+0x2ea>
+  .byte  68,15,40,13,146,55,0,0              // movaps        0x3792(%rip),%xmm9        # 49e0 <_sk_callback_sse41+0x2f0>
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  68,15,92,204                        // subps         %xmm4,%xmm9
   .byte  15,40,124,36,168                    // movaps        -0x58(%rsp),%xmm7
@@ -21892,14 +21882,14 @@
   .byte  15,40,231                           // movaps        %xmm7,%xmm4
   .byte  68,15,89,244                        // mulps         %xmm4,%xmm14
   .byte  15,89,204                           // mulps         %xmm4,%xmm1
-  .byte  68,15,40,13,215,54,0,0              // movaps        0x36d7(%rip),%xmm9        # 49f0 <_sk_callback_sse41+0x2fa>
+  .byte  68,15,40,13,221,54,0,0              // movaps        0x36dd(%rip),%xmm9        # 49f0 <_sk_callback_sse41+0x300>
   .byte  65,15,40,250                        // movaps        %xmm10,%xmm7
   .byte  65,15,89,249                        // mulps         %xmm9,%xmm7
-  .byte  68,15,40,21,215,54,0,0              // movaps        0x36d7(%rip),%xmm10        # 4a00 <_sk_callback_sse41+0x30a>
+  .byte  68,15,40,21,221,54,0,0              // movaps        0x36dd(%rip),%xmm10        # 4a00 <_sk_callback_sse41+0x310>
   .byte  65,15,40,219                        // movaps        %xmm11,%xmm3
   .byte  65,15,89,218                        // mulps         %xmm10,%xmm3
   .byte  15,88,223                           // addps         %xmm7,%xmm3
-  .byte  68,15,40,29,212,54,0,0              // movaps        0x36d4(%rip),%xmm11        # 4a10 <_sk_callback_sse41+0x31a>
+  .byte  68,15,40,29,218,54,0,0              // movaps        0x36da(%rip),%xmm11        # 4a10 <_sk_callback_sse41+0x320>
   .byte  69,15,40,236                        // movaps        %xmm12,%xmm13
   .byte  69,15,89,235                        // mulps         %xmm11,%xmm13
   .byte  68,15,88,235                        // addps         %xmm3,%xmm13
@@ -21984,7 +21974,7 @@
   .byte  65,15,88,251                        // addps         %xmm11,%xmm7
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  102,15,56,20,207                    // blendvps      %xmm0,%xmm7,%xmm1
-  .byte  68,15,40,13,144,53,0,0              // movaps        0x3590(%rip),%xmm9        # 4a20 <_sk_callback_sse41+0x32a>
+  .byte  68,15,40,13,150,53,0,0              // movaps        0x3596(%rip),%xmm9        # 4a20 <_sk_callback_sse41+0x330>
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  68,15,89,192                        // mulps         %xmm0,%xmm8
@@ -22036,13 +22026,13 @@
   .byte  69,15,89,216                        // mulps         %xmm8,%xmm11
   .byte  68,15,40,203                        // movaps        %xmm3,%xmm9
   .byte  68,15,89,205                        // mulps         %xmm5,%xmm9
-  .byte  68,15,40,5,232,52,0,0               // movaps        0x34e8(%rip),%xmm8        # 4a30 <_sk_callback_sse41+0x33a>
+  .byte  68,15,40,5,238,52,0,0               // movaps        0x34ee(%rip),%xmm8        # 4a30 <_sk_callback_sse41+0x340>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
-  .byte  68,15,40,21,236,52,0,0              // movaps        0x34ec(%rip),%xmm10        # 4a40 <_sk_callback_sse41+0x34a>
+  .byte  68,15,40,21,242,52,0,0              // movaps        0x34f2(%rip),%xmm10        # 4a40 <_sk_callback_sse41+0x350>
   .byte  15,40,233                           // movaps        %xmm1,%xmm5
   .byte  65,15,89,234                        // mulps         %xmm10,%xmm5
   .byte  15,88,232                           // addps         %xmm0,%xmm5
-  .byte  68,15,40,37,234,52,0,0              // movaps        0x34ea(%rip),%xmm12        # 4a50 <_sk_callback_sse41+0x35a>
+  .byte  68,15,40,37,240,52,0,0              // movaps        0x34f0(%rip),%xmm12        # 4a50 <_sk_callback_sse41+0x360>
   .byte  68,15,40,242                        // movaps        %xmm2,%xmm14
   .byte  69,15,89,244                        // mulps         %xmm12,%xmm14
   .byte  68,15,88,245                        // addps         %xmm5,%xmm14
@@ -22127,7 +22117,7 @@
   .byte  65,15,88,244                        // addps         %xmm12,%xmm6
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
   .byte  102,68,15,56,20,206                 // blendvps      %xmm0,%xmm6,%xmm9
-  .byte  15,40,5,160,51,0,0                  // movaps        0x33a0(%rip),%xmm0        # 4a60 <_sk_callback_sse41+0x36a>
+  .byte  15,40,5,166,51,0,0                  // movaps        0x33a6(%rip),%xmm0        # 4a60 <_sk_callback_sse41+0x370>
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  15,92,215                           // subps         %xmm7,%xmm2
   .byte  15,89,226                           // mulps         %xmm2,%xmm4
@@ -22176,7 +22166,7 @@
 .globl _sk_clamp_1_sse41
 FUNCTION(_sk_clamp_1_sse41)
 _sk_clamp_1_sse41:
-  .byte  68,15,40,5,35,51,0,0                // movaps        0x3323(%rip),%xmm8        # 4a70 <_sk_callback_sse41+0x37a>
+  .byte  68,15,40,5,41,51,0,0                // movaps        0x3329(%rip),%xmm8        # 4a70 <_sk_callback_sse41+0x380>
   .byte  65,15,93,192                        // minps         %xmm8,%xmm0
   .byte  65,15,93,200                        // minps         %xmm8,%xmm1
   .byte  65,15,93,208                        // minps         %xmm8,%xmm2
@@ -22188,7 +22178,7 @@
 .globl _sk_clamp_a_sse41
 FUNCTION(_sk_clamp_a_sse41)
 _sk_clamp_a_sse41:
-  .byte  15,93,29,24,51,0,0                  // minps         0x3318(%rip),%xmm3        # 4a80 <_sk_callback_sse41+0x38a>
+  .byte  15,93,29,30,51,0,0                  // minps         0x331e(%rip),%xmm3        # 4a80 <_sk_callback_sse41+0x390>
   .byte  15,93,195                           // minps         %xmm3,%xmm0
   .byte  15,93,203                           // minps         %xmm3,%xmm1
   .byte  15,93,211                           // minps         %xmm3,%xmm2
@@ -22275,7 +22265,7 @@
 FUNCTION(_sk_unpremul_sse41)
 _sk_unpremul_sse41:
   .byte  69,15,87,192                        // xorps         %xmm8,%xmm8
-  .byte  68,15,40,13,131,50,0,0              // movaps        0x3283(%rip),%xmm9        # 4a90 <_sk_callback_sse41+0x39a>
+  .byte  68,15,40,13,137,50,0,0              // movaps        0x3289(%rip),%xmm9        # 4a90 <_sk_callback_sse41+0x3a0>
   .byte  68,15,94,203                        // divps         %xmm3,%xmm9
   .byte  68,15,194,195,4                     // cmpneqps      %xmm3,%xmm8
   .byte  69,15,84,193                        // andps         %xmm9,%xmm8
@@ -22289,20 +22279,20 @@
 .globl _sk_from_srgb_sse41
 FUNCTION(_sk_from_srgb_sse41)
 _sk_from_srgb_sse41:
-  .byte  68,15,40,29,110,50,0,0              // movaps        0x326e(%rip),%xmm11        # 4aa0 <_sk_callback_sse41+0x3aa>
+  .byte  68,15,40,29,116,50,0,0              // movaps        0x3274(%rip),%xmm11        # 4aa0 <_sk_callback_sse41+0x3b0>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
   .byte  68,15,40,208                        // movaps        %xmm0,%xmm10
   .byte  69,15,89,210                        // mulps         %xmm10,%xmm10
-  .byte  68,15,40,37,102,50,0,0              // movaps        0x3266(%rip),%xmm12        # 4ab0 <_sk_callback_sse41+0x3ba>
+  .byte  68,15,40,37,108,50,0,0              // movaps        0x326c(%rip),%xmm12        # 4ab0 <_sk_callback_sse41+0x3c0>
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
   .byte  69,15,89,196                        // mulps         %xmm12,%xmm8
-  .byte  68,15,40,45,102,50,0,0              // movaps        0x3266(%rip),%xmm13        # 4ac0 <_sk_callback_sse41+0x3ca>
+  .byte  68,15,40,45,108,50,0,0              // movaps        0x326c(%rip),%xmm13        # 4ac0 <_sk_callback_sse41+0x3d0>
   .byte  69,15,88,197                        // addps         %xmm13,%xmm8
   .byte  69,15,89,194                        // mulps         %xmm10,%xmm8
-  .byte  68,15,40,53,102,50,0,0              // movaps        0x3266(%rip),%xmm14        # 4ad0 <_sk_callback_sse41+0x3da>
+  .byte  68,15,40,53,108,50,0,0              // movaps        0x326c(%rip),%xmm14        # 4ad0 <_sk_callback_sse41+0x3e0>
   .byte  69,15,88,198                        // addps         %xmm14,%xmm8
-  .byte  68,15,40,61,106,50,0,0              // movaps        0x326a(%rip),%xmm15        # 4ae0 <_sk_callback_sse41+0x3ea>
+  .byte  68,15,40,61,112,50,0,0              // movaps        0x3270(%rip),%xmm15        # 4ae0 <_sk_callback_sse41+0x3f0>
   .byte  65,15,194,199,1                     // cmpltps       %xmm15,%xmm0
   .byte  102,69,15,56,20,193                 // blendvps      %xmm0,%xmm9,%xmm8
   .byte  68,15,40,209                        // movaps        %xmm1,%xmm10
@@ -22345,22 +22335,22 @@
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
   .byte  68,15,82,192                        // rsqrtps       %xmm0,%xmm8
-  .byte  68,15,40,29,226,49,0,0              // movaps        0x31e2(%rip),%xmm11        # 4af0 <_sk_callback_sse41+0x3fa>
+  .byte  68,15,40,29,232,49,0,0              // movaps        0x31e8(%rip),%xmm11        # 4af0 <_sk_callback_sse41+0x400>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
-  .byte  68,15,40,37,226,49,0,0              // movaps        0x31e2(%rip),%xmm12        # 4b00 <_sk_callback_sse41+0x40a>
+  .byte  68,15,40,37,232,49,0,0              // movaps        0x31e8(%rip),%xmm12        # 4b00 <_sk_callback_sse41+0x410>
   .byte  69,15,40,248                        // movaps        %xmm8,%xmm15
   .byte  69,15,89,252                        // mulps         %xmm12,%xmm15
-  .byte  68,15,40,21,226,49,0,0              // movaps        0x31e2(%rip),%xmm10        # 4b10 <_sk_callback_sse41+0x41a>
+  .byte  68,15,40,21,232,49,0,0              // movaps        0x31e8(%rip),%xmm10        # 4b10 <_sk_callback_sse41+0x420>
   .byte  69,15,88,250                        // addps         %xmm10,%xmm15
   .byte  69,15,89,248                        // mulps         %xmm8,%xmm15
-  .byte  68,15,40,45,226,49,0,0              // movaps        0x31e2(%rip),%xmm13        # 4b20 <_sk_callback_sse41+0x42a>
+  .byte  68,15,40,45,232,49,0,0              // movaps        0x31e8(%rip),%xmm13        # 4b20 <_sk_callback_sse41+0x430>
   .byte  69,15,88,253                        // addps         %xmm13,%xmm15
-  .byte  68,15,40,53,230,49,0,0              // movaps        0x31e6(%rip),%xmm14        # 4b30 <_sk_callback_sse41+0x43a>
+  .byte  68,15,40,53,236,49,0,0              // movaps        0x31ec(%rip),%xmm14        # 4b30 <_sk_callback_sse41+0x440>
   .byte  69,15,88,198                        // addps         %xmm14,%xmm8
   .byte  69,15,83,192                        // rcpps         %xmm8,%xmm8
   .byte  69,15,89,199                        // mulps         %xmm15,%xmm8
-  .byte  68,15,40,61,226,49,0,0              // movaps        0x31e2(%rip),%xmm15        # 4b40 <_sk_callback_sse41+0x44a>
+  .byte  68,15,40,61,232,49,0,0              // movaps        0x31e8(%rip),%xmm15        # 4b40 <_sk_callback_sse41+0x450>
   .byte  65,15,194,199,1                     // cmpltps       %xmm15,%xmm0
   .byte  102,69,15,56,20,193                 // blendvps      %xmm0,%xmm9,%xmm8
   .byte  68,15,82,202                        // rsqrtps       %xmm2,%xmm9
@@ -22413,7 +22403,7 @@
   .byte  68,15,93,226                        // minps         %xmm2,%xmm12
   .byte  65,15,40,203                        // movaps        %xmm11,%xmm1
   .byte  65,15,92,204                        // subps         %xmm12,%xmm1
-  .byte  68,15,40,53,47,49,0,0               // movaps        0x312f(%rip),%xmm14        # 4b50 <_sk_callback_sse41+0x45a>
+  .byte  68,15,40,53,53,49,0,0               // movaps        0x3135(%rip),%xmm14        # 4b50 <_sk_callback_sse41+0x460>
   .byte  68,15,94,241                        // divps         %xmm1,%xmm14
   .byte  69,15,40,211                        // movaps        %xmm11,%xmm10
   .byte  69,15,194,208,0                     // cmpeqps       %xmm8,%xmm10
@@ -22422,27 +22412,27 @@
   .byte  65,15,89,198                        // mulps         %xmm14,%xmm0
   .byte  69,15,40,249                        // movaps        %xmm9,%xmm15
   .byte  68,15,194,250,1                     // cmpltps       %xmm2,%xmm15
-  .byte  68,15,84,61,22,49,0,0               // andps         0x3116(%rip),%xmm15        # 4b60 <_sk_callback_sse41+0x46a>
+  .byte  68,15,84,61,28,49,0,0               // andps         0x311c(%rip),%xmm15        # 4b60 <_sk_callback_sse41+0x470>
   .byte  68,15,88,248                        // addps         %xmm0,%xmm15
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
   .byte  65,15,194,193,0                     // cmpeqps       %xmm9,%xmm0
   .byte  65,15,92,208                        // subps         %xmm8,%xmm2
   .byte  65,15,89,214                        // mulps         %xmm14,%xmm2
-  .byte  68,15,40,45,9,49,0,0                // movaps        0x3109(%rip),%xmm13        # 4b70 <_sk_callback_sse41+0x47a>
+  .byte  68,15,40,45,15,49,0,0               // movaps        0x310f(%rip),%xmm13        # 4b70 <_sk_callback_sse41+0x480>
   .byte  65,15,88,213                        // addps         %xmm13,%xmm2
   .byte  69,15,92,193                        // subps         %xmm9,%xmm8
   .byte  69,15,89,198                        // mulps         %xmm14,%xmm8
-  .byte  68,15,88,5,5,49,0,0                 // addps         0x3105(%rip),%xmm8        # 4b80 <_sk_callback_sse41+0x48a>
+  .byte  68,15,88,5,11,49,0,0                // addps         0x310b(%rip),%xmm8        # 4b80 <_sk_callback_sse41+0x490>
   .byte  102,68,15,56,20,194                 // blendvps      %xmm0,%xmm2,%xmm8
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  102,69,15,56,20,199                 // blendvps      %xmm0,%xmm15,%xmm8
-  .byte  68,15,89,5,253,48,0,0               // mulps         0x30fd(%rip),%xmm8        # 4b90 <_sk_callback_sse41+0x49a>
+  .byte  68,15,89,5,3,49,0,0                 // mulps         0x3103(%rip),%xmm8        # 4b90 <_sk_callback_sse41+0x4a0>
   .byte  69,15,40,203                        // movaps        %xmm11,%xmm9
   .byte  69,15,194,204,4                     // cmpneqps      %xmm12,%xmm9
   .byte  69,15,84,193                        // andps         %xmm9,%xmm8
   .byte  69,15,92,235                        // subps         %xmm11,%xmm13
   .byte  69,15,88,220                        // addps         %xmm12,%xmm11
-  .byte  15,40,5,241,48,0,0                  // movaps        0x30f1(%rip),%xmm0        # 4ba0 <_sk_callback_sse41+0x4aa>
+  .byte  15,40,5,247,48,0,0                  // movaps        0x30f7(%rip),%xmm0        # 4ba0 <_sk_callback_sse41+0x4b0>
   .byte  65,15,40,211                        // movaps        %xmm11,%xmm2
   .byte  15,89,208                           // mulps         %xmm0,%xmm2
   .byte  15,194,194,1                        // cmpltps       %xmm2,%xmm0
@@ -22464,7 +22454,7 @@
   .byte  15,41,100,36,184                    // movaps        %xmm4,-0x48(%rsp)
   .byte  15,41,92,36,168                     // movaps        %xmm3,-0x58(%rsp)
   .byte  68,15,40,208                        // movaps        %xmm0,%xmm10
-  .byte  68,15,40,13,183,48,0,0              // movaps        0x30b7(%rip),%xmm9        # 4bb0 <_sk_callback_sse41+0x4ba>
+  .byte  68,15,40,13,189,48,0,0              // movaps        0x30bd(%rip),%xmm9        # 4bb0 <_sk_callback_sse41+0x4c0>
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  15,194,194,2                        // cmpleps       %xmm2,%xmm0
   .byte  15,40,217                           // movaps        %xmm1,%xmm3
@@ -22477,19 +22467,19 @@
   .byte  15,41,84,36,152                     // movaps        %xmm2,-0x68(%rsp)
   .byte  69,15,88,192                        // addps         %xmm8,%xmm8
   .byte  68,15,92,197                        // subps         %xmm5,%xmm8
-  .byte  68,15,40,53,146,48,0,0              // movaps        0x3092(%rip),%xmm14        # 4bc0 <_sk_callback_sse41+0x4ca>
+  .byte  68,15,40,53,152,48,0,0              // movaps        0x3098(%rip),%xmm14        # 4bc0 <_sk_callback_sse41+0x4d0>
   .byte  69,15,88,242                        // addps         %xmm10,%xmm14
   .byte  102,65,15,58,8,198,1                // roundps       $0x1,%xmm14,%xmm0
   .byte  68,15,92,240                        // subps         %xmm0,%xmm14
-  .byte  68,15,40,29,139,48,0,0              // movaps        0x308b(%rip),%xmm11        # 4bd0 <_sk_callback_sse41+0x4da>
+  .byte  68,15,40,29,145,48,0,0              // movaps        0x3091(%rip),%xmm11        # 4bd0 <_sk_callback_sse41+0x4e0>
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
   .byte  65,15,194,198,2                     // cmpleps       %xmm14,%xmm0
   .byte  15,40,245                           // movaps        %xmm5,%xmm6
   .byte  65,15,92,240                        // subps         %xmm8,%xmm6
-  .byte  15,40,61,132,48,0,0                 // movaps        0x3084(%rip),%xmm7        # 4be0 <_sk_callback_sse41+0x4ea>
+  .byte  15,40,61,138,48,0,0                 // movaps        0x308a(%rip),%xmm7        # 4be0 <_sk_callback_sse41+0x4f0>
   .byte  69,15,40,238                        // movaps        %xmm14,%xmm13
   .byte  68,15,89,239                        // mulps         %xmm7,%xmm13
-  .byte  15,40,29,133,48,0,0                 // movaps        0x3085(%rip),%xmm3        # 4bf0 <_sk_callback_sse41+0x4fa>
+  .byte  15,40,29,139,48,0,0                 // movaps        0x308b(%rip),%xmm3        # 4bf0 <_sk_callback_sse41+0x500>
   .byte  68,15,40,227                        // movaps        %xmm3,%xmm12
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  68,15,89,230                        // mulps         %xmm6,%xmm12
@@ -22499,7 +22489,7 @@
   .byte  65,15,194,198,2                     // cmpleps       %xmm14,%xmm0
   .byte  68,15,40,253                        // movaps        %xmm5,%xmm15
   .byte  102,69,15,56,20,252                 // blendvps      %xmm0,%xmm12,%xmm15
-  .byte  68,15,40,37,100,48,0,0              // movaps        0x3064(%rip),%xmm12        # 4c00 <_sk_callback_sse41+0x50a>
+  .byte  68,15,40,37,106,48,0,0              // movaps        0x306a(%rip),%xmm12        # 4c00 <_sk_callback_sse41+0x510>
   .byte  65,15,40,196                        // movaps        %xmm12,%xmm0
   .byte  65,15,194,198,2                     // cmpleps       %xmm14,%xmm0
   .byte  68,15,89,238                        // mulps         %xmm6,%xmm13
@@ -22533,7 +22523,7 @@
   .byte  65,15,40,198                        // movaps        %xmm14,%xmm0
   .byte  15,40,84,36,152                     // movaps        -0x68(%rsp),%xmm2
   .byte  102,15,56,20,202                    // blendvps      %xmm0,%xmm2,%xmm1
-  .byte  68,15,88,21,220,47,0,0              // addps         0x2fdc(%rip),%xmm10        # 4c10 <_sk_callback_sse41+0x51a>
+  .byte  68,15,88,21,226,47,0,0              // addps         0x2fe2(%rip),%xmm10        # 4c10 <_sk_callback_sse41+0x520>
   .byte  102,65,15,58,8,194,1                // roundps       $0x1,%xmm10,%xmm0
   .byte  68,15,92,208                        // subps         %xmm0,%xmm10
   .byte  69,15,194,218,2                     // cmpleps       %xmm10,%xmm11
@@ -22585,7 +22575,7 @@
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  102,68,15,56,49,4,56                // pmovzxbd      (%rax,%rdi,1),%xmm8
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,57,47,0,0                // mulps         0x2f39(%rip),%xmm8        # 4c20 <_sk_callback_sse41+0x52a>
+  .byte  68,15,89,5,63,47,0,0                // mulps         0x2f3f(%rip),%xmm8        # 4c20 <_sk_callback_sse41+0x530>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
@@ -22623,7 +22613,7 @@
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  102,68,15,56,49,4,56                // pmovzxbd      (%rax,%rdi,1),%xmm8
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,229,46,0,0               // mulps         0x2ee5(%rip),%xmm8        # 4c30 <_sk_callback_sse41+0x53a>
+  .byte  68,15,89,5,235,46,0,0               // mulps         0x2eeb(%rip),%xmm8        # 4c30 <_sk_callback_sse41+0x540>
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -22646,17 +22636,17 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  102,68,15,56,51,20,120              // pmovzxwd      (%rax,%rdi,2),%xmm10
-  .byte  102,68,15,111,5,180,46,0,0          // movdqa        0x2eb4(%rip),%xmm8        # 4c40 <_sk_callback_sse41+0x54a>
+  .byte  102,68,15,111,5,186,46,0,0          // movdqa        0x2eba(%rip),%xmm8        # 4c40 <_sk_callback_sse41+0x550>
   .byte  102,69,15,219,194                   // pand          %xmm10,%xmm8
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,179,46,0,0               // mulps         0x2eb3(%rip),%xmm8        # 4c50 <_sk_callback_sse41+0x55a>
-  .byte  102,68,15,111,13,186,46,0,0         // movdqa        0x2eba(%rip),%xmm9        # 4c60 <_sk_callback_sse41+0x56a>
+  .byte  68,15,89,5,185,46,0,0               // mulps         0x2eb9(%rip),%xmm8        # 4c50 <_sk_callback_sse41+0x560>
+  .byte  102,68,15,111,13,192,46,0,0         // movdqa        0x2ec0(%rip),%xmm9        # 4c60 <_sk_callback_sse41+0x570>
   .byte  102,69,15,219,202                   // pand          %xmm10,%xmm9
   .byte  69,15,91,201                        // cvtdq2ps      %xmm9,%xmm9
-  .byte  68,15,89,13,185,46,0,0              // mulps         0x2eb9(%rip),%xmm9        # 4c70 <_sk_callback_sse41+0x57a>
-  .byte  102,68,15,219,21,192,46,0,0         // pand          0x2ec0(%rip),%xmm10        # 4c80 <_sk_callback_sse41+0x58a>
+  .byte  68,15,89,13,191,46,0,0              // mulps         0x2ebf(%rip),%xmm9        # 4c70 <_sk_callback_sse41+0x580>
+  .byte  102,68,15,219,21,198,46,0,0         // pand          0x2ec6(%rip),%xmm10        # 4c80 <_sk_callback_sse41+0x590>
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
-  .byte  68,15,89,21,196,46,0,0              // mulps         0x2ec4(%rip),%xmm10        # 4c90 <_sk_callback_sse41+0x59a>
+  .byte  68,15,89,21,202,46,0,0              // mulps         0x2eca(%rip),%xmm10        # 4c90 <_sk_callback_sse41+0x5a0>
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -22687,7 +22677,7 @@
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  76,139,72,8                         // mov           0x8(%rax),%r9
   .byte  243,69,15,111,4,184                 // movdqu        (%r8,%rdi,4),%xmm8
-  .byte  102,15,111,5,117,46,0,0             // movdqa        0x2e75(%rip),%xmm0        # 4ca0 <_sk_callback_sse41+0x5aa>
+  .byte  102,15,111,5,123,46,0,0             // movdqa        0x2e7b(%rip),%xmm0        # 4ca0 <_sk_callback_sse41+0x5b0>
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,73,15,58,22,192,1               // pextrq        $0x1,%xmm0,%r8
   .byte  102,72,15,126,193                   // movq          %xmm0,%rcx
@@ -22702,7 +22692,7 @@
   .byte  102,15,58,33,193,48                 // insertps      $0x30,%xmm1,%xmm0
   .byte  76,139,64,16                        // mov           0x10(%rax),%r8
   .byte  102,65,15,111,200                   // movdqa        %xmm8,%xmm1
-  .byte  102,15,56,0,13,48,46,0,0            // pshufb        0x2e30(%rip),%xmm1        # 4cb0 <_sk_callback_sse41+0x5ba>
+  .byte  102,15,56,0,13,54,46,0,0            // pshufb        0x2e36(%rip),%xmm1        # 4cb0 <_sk_callback_sse41+0x5c0>
   .byte  102,73,15,58,22,201,1               // pextrq        $0x1,%xmm1,%r9
   .byte  102,72,15,126,201                   // movq          %xmm1,%rcx
   .byte  68,15,182,209                       // movzbl        %cl,%r10d
@@ -22717,7 +22707,7 @@
   .byte  102,15,58,33,202,48                 // insertps      $0x30,%xmm2,%xmm1
   .byte  76,139,64,24                        // mov           0x18(%rax),%r8
   .byte  102,65,15,111,208                   // movdqa        %xmm8,%xmm2
-  .byte  102,15,56,0,21,236,45,0,0           // pshufb        0x2dec(%rip),%xmm2        # 4cc0 <_sk_callback_sse41+0x5ca>
+  .byte  102,15,56,0,21,242,45,0,0           // pshufb        0x2df2(%rip),%xmm2        # 4cc0 <_sk_callback_sse41+0x5d0>
   .byte  102,72,15,58,22,209,1               // pextrq        $0x1,%xmm2,%rcx
   .byte  102,72,15,126,208                   // movq          %xmm2,%rax
   .byte  68,15,182,200                       // movzbl        %al,%r9d
@@ -22732,7 +22722,7 @@
   .byte  102,15,58,33,211,48                 // insertps      $0x30,%xmm3,%xmm2
   .byte  102,65,15,114,208,24                // psrld         $0x18,%xmm8
   .byte  65,15,91,216                        // cvtdq2ps      %xmm8,%xmm3
-  .byte  15,89,29,169,45,0,0                 // mulps         0x2da9(%rip),%xmm3        # 4cd0 <_sk_callback_sse41+0x5da>
+  .byte  15,89,29,175,45,0,0                 // mulps         0x2daf(%rip),%xmm3        # 4cd0 <_sk_callback_sse41+0x5e0>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
@@ -22751,7 +22741,7 @@
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,97,200                       // punpcklwd     %xmm0,%xmm1
   .byte  102,68,15,105,200                   // punpckhwd     %xmm0,%xmm9
-  .byte  102,68,15,111,5,124,45,0,0          // movdqa        0x2d7c(%rip),%xmm8        # 4ce0 <_sk_callback_sse41+0x5ea>
+  .byte  102,68,15,111,5,130,45,0,0          // movdqa        0x2d82(%rip),%xmm8        # 4ce0 <_sk_callback_sse41+0x5f0>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,15,56,51,192                    // pmovzxwd      %xmm0,%xmm0
@@ -22768,7 +22758,7 @@
   .byte  243,67,15,16,20,8                   // movss         (%r8,%r9,1),%xmm2
   .byte  102,15,58,33,194,48                 // insertps      $0x30,%xmm2,%xmm0
   .byte  76,139,64,16                        // mov           0x10(%rax),%r8
-  .byte  102,15,56,0,13,47,45,0,0            // pshufb        0x2d2f(%rip),%xmm1        # 4cf0 <_sk_callback_sse41+0x5fa>
+  .byte  102,15,56,0,13,53,45,0,0            // pshufb        0x2d35(%rip),%xmm1        # 4cf0 <_sk_callback_sse41+0x600>
   .byte  102,15,56,51,201                    // pmovzxwd      %xmm1,%xmm1
   .byte  102,73,15,58,22,201,1               // pextrq        $0x1,%xmm1,%r9
   .byte  102,72,15,126,201                   // movq          %xmm1,%rcx
@@ -22804,7 +22794,7 @@
   .byte  102,65,15,235,216                   // por           %xmm8,%xmm3
   .byte  102,15,56,51,219                    // pmovzxwd      %xmm3,%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,125,44,0,0                 // mulps         0x2c7d(%rip),%xmm3        # 4d00 <_sk_callback_sse41+0x60a>
+  .byte  15,89,29,131,44,0,0                 // mulps         0x2c83(%rip),%xmm3        # 4d00 <_sk_callback_sse41+0x610>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
@@ -22826,7 +22816,7 @@
   .byte  102,68,15,97,200                    // punpcklwd     %xmm0,%xmm9
   .byte  102,15,111,202                      // movdqa        %xmm2,%xmm1
   .byte  102,65,15,97,201                    // punpcklwd     %xmm9,%xmm1
-  .byte  102,68,15,111,5,63,44,0,0           // movdqa        0x2c3f(%rip),%xmm8        # 4d10 <_sk_callback_sse41+0x61a>
+  .byte  102,68,15,111,5,69,44,0,0           // movdqa        0x2c45(%rip),%xmm8        # 4d10 <_sk_callback_sse41+0x620>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,15,56,51,192                    // pmovzxwd      %xmm0,%xmm0
@@ -22843,7 +22833,7 @@
   .byte  243,67,15,16,28,8                   // movss         (%r8,%r9,1),%xmm3
   .byte  102,15,58,33,195,48                 // insertps      $0x30,%xmm3,%xmm0
   .byte  76,139,64,16                        // mov           0x10(%rax),%r8
-  .byte  102,15,56,0,13,242,43,0,0           // pshufb        0x2bf2(%rip),%xmm1        # 4d20 <_sk_callback_sse41+0x62a>
+  .byte  102,15,56,0,13,248,43,0,0           // pshufb        0x2bf8(%rip),%xmm1        # 4d20 <_sk_callback_sse41+0x630>
   .byte  102,15,56,51,201                    // pmovzxwd      %xmm1,%xmm1
   .byte  102,73,15,58,22,201,1               // pextrq        $0x1,%xmm1,%r9
   .byte  102,72,15,126,201                   // movq          %xmm1,%rcx
@@ -22874,7 +22864,7 @@
   .byte  243,65,15,16,28,8                   // movss         (%r8,%rcx,1),%xmm3
   .byte  102,15,58,33,211,48                 // insertps      $0x30,%xmm3,%xmm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,93,43,0,0                  // movaps        0x2b5d(%rip),%xmm3        # 4d30 <_sk_callback_sse41+0x63a>
+  .byte  15,40,29,99,43,0,0                  // movaps        0x2b63(%rip),%xmm3        # 4d30 <_sk_callback_sse41+0x640>
   .byte  255,224                             // jmpq          *%rax
 
 HIDDEN _sk_byte_tables_sse41
@@ -22884,7 +22874,7 @@
   .byte  65,86                               // push          %r14
   .byte  83                                  // push          %rbx
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,94,43,0,0                // movaps        0x2b5e(%rip),%xmm8        # 4d40 <_sk_callback_sse41+0x64a>
+  .byte  68,15,40,5,100,43,0,0               // movaps        0x2b64(%rip),%xmm8        # 4d40 <_sk_callback_sse41+0x650>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,91,192                       // cvtps2dq      %xmm0,%xmm0
   .byte  102,72,15,58,22,193,1               // pextrq        $0x1,%xmm0,%rcx
@@ -22903,7 +22893,7 @@
   .byte  102,15,58,32,193,3                  // pinsrb        $0x3,%ecx,%xmm0
   .byte  102,15,56,49,192                    // pmovzxbd      %xmm0,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,13,15,43,0,0               // movaps        0x2b0f(%rip),%xmm9        # 4d50 <_sk_callback_sse41+0x65a>
+  .byte  68,15,40,13,21,43,0,0               // movaps        0x2b15(%rip),%xmm9        # 4d50 <_sk_callback_sse41+0x660>
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
@@ -22994,7 +22984,7 @@
   .byte  102,15,58,32,193,3                  // pinsrb        $0x3,%ecx,%xmm0
   .byte  102,15,56,49,192                    // pmovzxbd      %xmm0,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,13,151,41,0,0              // movaps        0x2997(%rip),%xmm9        # 4d60 <_sk_callback_sse41+0x66a>
+  .byte  68,15,40,13,157,41,0,0              // movaps        0x299d(%rip),%xmm9        # 4d60 <_sk_callback_sse41+0x670>
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
@@ -23171,31 +23161,31 @@
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,194                        // cvtdq2ps      %xmm10,%xmm8
-  .byte  68,15,89,5,238,38,0,0               // mulps         0x26ee(%rip),%xmm8        # 4d70 <_sk_callback_sse41+0x67a>
-  .byte  68,15,84,21,246,38,0,0              // andps         0x26f6(%rip),%xmm10        # 4d80 <_sk_callback_sse41+0x68a>
-  .byte  68,15,86,21,254,38,0,0              // orps          0x26fe(%rip),%xmm10        # 4d90 <_sk_callback_sse41+0x69a>
-  .byte  68,15,88,5,6,39,0,0                 // addps         0x2706(%rip),%xmm8        # 4da0 <_sk_callback_sse41+0x6aa>
-  .byte  68,15,40,37,14,39,0,0               // movaps        0x270e(%rip),%xmm12        # 4db0 <_sk_callback_sse41+0x6ba>
+  .byte  68,15,89,5,244,38,0,0               // mulps         0x26f4(%rip),%xmm8        # 4d70 <_sk_callback_sse41+0x680>
+  .byte  68,15,84,21,252,38,0,0              // andps         0x26fc(%rip),%xmm10        # 4d80 <_sk_callback_sse41+0x690>
+  .byte  68,15,86,21,4,39,0,0                // orps          0x2704(%rip),%xmm10        # 4d90 <_sk_callback_sse41+0x6a0>
+  .byte  68,15,88,5,12,39,0,0                // addps         0x270c(%rip),%xmm8        # 4da0 <_sk_callback_sse41+0x6b0>
+  .byte  68,15,40,37,20,39,0,0               // movaps        0x2714(%rip),%xmm12        # 4db0 <_sk_callback_sse41+0x6c0>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,196                        // subps         %xmm12,%xmm8
-  .byte  68,15,88,21,14,39,0,0               // addps         0x270e(%rip),%xmm10        # 4dc0 <_sk_callback_sse41+0x6ca>
-  .byte  68,15,40,37,22,39,0,0               // movaps        0x2716(%rip),%xmm12        # 4dd0 <_sk_callback_sse41+0x6da>
+  .byte  68,15,88,21,20,39,0,0               // addps         0x2714(%rip),%xmm10        # 4dc0 <_sk_callback_sse41+0x6d0>
+  .byte  68,15,40,37,28,39,0,0               // movaps        0x271c(%rip),%xmm12        # 4dd0 <_sk_callback_sse41+0x6e0>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,196                        // subps         %xmm12,%xmm8
   .byte  69,15,89,195                        // mulps         %xmm11,%xmm8
   .byte  102,69,15,58,8,208,1                // roundps       $0x1,%xmm8,%xmm10
   .byte  69,15,40,216                        // movaps        %xmm8,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  68,15,88,5,3,39,0,0                 // addps         0x2703(%rip),%xmm8        # 4de0 <_sk_callback_sse41+0x6ea>
-  .byte  68,15,40,21,11,39,0,0               // movaps        0x270b(%rip),%xmm10        # 4df0 <_sk_callback_sse41+0x6fa>
+  .byte  68,15,88,5,9,39,0,0                 // addps         0x2709(%rip),%xmm8        # 4de0 <_sk_callback_sse41+0x6f0>
+  .byte  68,15,40,21,17,39,0,0               // movaps        0x2711(%rip),%xmm10        # 4df0 <_sk_callback_sse41+0x700>
   .byte  69,15,89,211                        // mulps         %xmm11,%xmm10
   .byte  69,15,92,194                        // subps         %xmm10,%xmm8
-  .byte  68,15,40,21,11,39,0,0               // movaps        0x270b(%rip),%xmm10        # 4e00 <_sk_callback_sse41+0x70a>
+  .byte  68,15,40,21,17,39,0,0               // movaps        0x2711(%rip),%xmm10        # 4e00 <_sk_callback_sse41+0x710>
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
-  .byte  68,15,40,29,15,39,0,0               // movaps        0x270f(%rip),%xmm11        # 4e10 <_sk_callback_sse41+0x71a>
+  .byte  68,15,40,29,21,39,0,0               // movaps        0x2715(%rip),%xmm11        # 4e10 <_sk_callback_sse41+0x720>
   .byte  69,15,94,218                        // divps         %xmm10,%xmm11
   .byte  69,15,88,216                        // addps         %xmm8,%xmm11
-  .byte  68,15,89,29,15,39,0,0               // mulps         0x270f(%rip),%xmm11        # 4e20 <_sk_callback_sse41+0x72a>
+  .byte  68,15,89,29,21,39,0,0               // mulps         0x2715(%rip),%xmm11        # 4e20 <_sk_callback_sse41+0x730>
   .byte  102,69,15,91,211                    // cvtps2dq      %xmm11,%xmm10
   .byte  243,68,15,16,64,20                  // movss         0x14(%rax),%xmm8
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
@@ -23203,7 +23193,7 @@
   .byte  102,69,15,56,20,193                 // blendvps      %xmm0,%xmm9,%xmm8
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  68,15,95,192                        // maxps         %xmm0,%xmm8
-  .byte  68,15,93,5,246,38,0,0               // minps         0x26f6(%rip),%xmm8        # 4e30 <_sk_callback_sse41+0x73a>
+  .byte  68,15,93,5,252,38,0,0               // minps         0x26fc(%rip),%xmm8        # 4e30 <_sk_callback_sse41+0x740>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -23233,31 +23223,31 @@
   .byte  68,15,88,217                        // addps         %xmm1,%xmm11
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,91,227                        // cvtdq2ps      %xmm11,%xmm12
-  .byte  68,15,89,37,151,38,0,0              // mulps         0x2697(%rip),%xmm12        # 4e40 <_sk_callback_sse41+0x74a>
-  .byte  68,15,84,29,159,38,0,0              // andps         0x269f(%rip),%xmm11        # 4e50 <_sk_callback_sse41+0x75a>
-  .byte  68,15,86,29,167,38,0,0              // orps          0x26a7(%rip),%xmm11        # 4e60 <_sk_callback_sse41+0x76a>
-  .byte  68,15,88,37,175,38,0,0              // addps         0x26af(%rip),%xmm12        # 4e70 <_sk_callback_sse41+0x77a>
-  .byte  15,40,13,184,38,0,0                 // movaps        0x26b8(%rip),%xmm1        # 4e80 <_sk_callback_sse41+0x78a>
+  .byte  68,15,89,37,157,38,0,0              // mulps         0x269d(%rip),%xmm12        # 4e40 <_sk_callback_sse41+0x750>
+  .byte  68,15,84,29,165,38,0,0              // andps         0x26a5(%rip),%xmm11        # 4e50 <_sk_callback_sse41+0x760>
+  .byte  68,15,86,29,173,38,0,0              // orps          0x26ad(%rip),%xmm11        # 4e60 <_sk_callback_sse41+0x770>
+  .byte  68,15,88,37,181,38,0,0              // addps         0x26b5(%rip),%xmm12        # 4e70 <_sk_callback_sse41+0x780>
+  .byte  15,40,13,190,38,0,0                 // movaps        0x26be(%rip),%xmm1        # 4e80 <_sk_callback_sse41+0x790>
   .byte  65,15,89,203                        // mulps         %xmm11,%xmm1
   .byte  68,15,92,225                        // subps         %xmm1,%xmm12
-  .byte  68,15,88,29,184,38,0,0              // addps         0x26b8(%rip),%xmm11        # 4e90 <_sk_callback_sse41+0x79a>
-  .byte  15,40,13,193,38,0,0                 // movaps        0x26c1(%rip),%xmm1        # 4ea0 <_sk_callback_sse41+0x7aa>
+  .byte  68,15,88,29,190,38,0,0              // addps         0x26be(%rip),%xmm11        # 4e90 <_sk_callback_sse41+0x7a0>
+  .byte  15,40,13,199,38,0,0                 // movaps        0x26c7(%rip),%xmm1        # 4ea0 <_sk_callback_sse41+0x7b0>
   .byte  65,15,94,203                        // divps         %xmm11,%xmm1
   .byte  68,15,92,225                        // subps         %xmm1,%xmm12
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  102,69,15,58,8,212,1                // roundps       $0x1,%xmm12,%xmm10
   .byte  69,15,40,220                        // movaps        %xmm12,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  68,15,88,37,174,38,0,0              // addps         0x26ae(%rip),%xmm12        # 4eb0 <_sk_callback_sse41+0x7ba>
-  .byte  15,40,13,183,38,0,0                 // movaps        0x26b7(%rip),%xmm1        # 4ec0 <_sk_callback_sse41+0x7ca>
+  .byte  68,15,88,37,180,38,0,0              // addps         0x26b4(%rip),%xmm12        # 4eb0 <_sk_callback_sse41+0x7c0>
+  .byte  15,40,13,189,38,0,0                 // movaps        0x26bd(%rip),%xmm1        # 4ec0 <_sk_callback_sse41+0x7d0>
   .byte  65,15,89,203                        // mulps         %xmm11,%xmm1
   .byte  68,15,92,225                        // subps         %xmm1,%xmm12
-  .byte  68,15,40,21,183,38,0,0              // movaps        0x26b7(%rip),%xmm10        # 4ed0 <_sk_callback_sse41+0x7da>
+  .byte  68,15,40,21,189,38,0,0              // movaps        0x26bd(%rip),%xmm10        # 4ed0 <_sk_callback_sse41+0x7e0>
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
-  .byte  15,40,13,188,38,0,0                 // movaps        0x26bc(%rip),%xmm1        # 4ee0 <_sk_callback_sse41+0x7ea>
+  .byte  15,40,13,194,38,0,0                 // movaps        0x26c2(%rip),%xmm1        # 4ee0 <_sk_callback_sse41+0x7f0>
   .byte  65,15,94,202                        // divps         %xmm10,%xmm1
   .byte  65,15,88,204                        // addps         %xmm12,%xmm1
-  .byte  15,89,13,189,38,0,0                 // mulps         0x26bd(%rip),%xmm1        # 4ef0 <_sk_callback_sse41+0x7fa>
+  .byte  15,89,13,195,38,0,0                 // mulps         0x26c3(%rip),%xmm1        # 4ef0 <_sk_callback_sse41+0x800>
   .byte  102,68,15,91,209                    // cvtps2dq      %xmm1,%xmm10
   .byte  243,15,16,72,20                     // movss         0x14(%rax),%xmm1
   .byte  15,198,201,0                        // shufps        $0x0,%xmm1,%xmm1
@@ -23265,7 +23255,7 @@
   .byte  102,65,15,56,20,201                 // blendvps      %xmm0,%xmm9,%xmm1
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  15,95,200                           // maxps         %xmm0,%xmm1
-  .byte  15,93,13,168,38,0,0                 // minps         0x26a8(%rip),%xmm1        # 4f00 <_sk_callback_sse41+0x80a>
+  .byte  15,93,13,174,38,0,0                 // minps         0x26ae(%rip),%xmm1        # 4f00 <_sk_callback_sse41+0x810>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -23295,31 +23285,31 @@
   .byte  68,15,88,218                        // addps         %xmm2,%xmm11
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,91,227                        // cvtdq2ps      %xmm11,%xmm12
-  .byte  68,15,89,37,73,38,0,0               // mulps         0x2649(%rip),%xmm12        # 4f10 <_sk_callback_sse41+0x81a>
-  .byte  68,15,84,29,81,38,0,0               // andps         0x2651(%rip),%xmm11        # 4f20 <_sk_callback_sse41+0x82a>
-  .byte  68,15,86,29,89,38,0,0               // orps          0x2659(%rip),%xmm11        # 4f30 <_sk_callback_sse41+0x83a>
-  .byte  68,15,88,37,97,38,0,0               // addps         0x2661(%rip),%xmm12        # 4f40 <_sk_callback_sse41+0x84a>
-  .byte  15,40,21,106,38,0,0                 // movaps        0x266a(%rip),%xmm2        # 4f50 <_sk_callback_sse41+0x85a>
+  .byte  68,15,89,37,79,38,0,0               // mulps         0x264f(%rip),%xmm12        # 4f10 <_sk_callback_sse41+0x820>
+  .byte  68,15,84,29,87,38,0,0               // andps         0x2657(%rip),%xmm11        # 4f20 <_sk_callback_sse41+0x830>
+  .byte  68,15,86,29,95,38,0,0               // orps          0x265f(%rip),%xmm11        # 4f30 <_sk_callback_sse41+0x840>
+  .byte  68,15,88,37,103,38,0,0              // addps         0x2667(%rip),%xmm12        # 4f40 <_sk_callback_sse41+0x850>
+  .byte  15,40,21,112,38,0,0                 // movaps        0x2670(%rip),%xmm2        # 4f50 <_sk_callback_sse41+0x860>
   .byte  65,15,89,211                        // mulps         %xmm11,%xmm2
   .byte  68,15,92,226                        // subps         %xmm2,%xmm12
-  .byte  68,15,88,29,106,38,0,0              // addps         0x266a(%rip),%xmm11        # 4f60 <_sk_callback_sse41+0x86a>
-  .byte  15,40,21,115,38,0,0                 // movaps        0x2673(%rip),%xmm2        # 4f70 <_sk_callback_sse41+0x87a>
+  .byte  68,15,88,29,112,38,0,0              // addps         0x2670(%rip),%xmm11        # 4f60 <_sk_callback_sse41+0x870>
+  .byte  15,40,21,121,38,0,0                 // movaps        0x2679(%rip),%xmm2        # 4f70 <_sk_callback_sse41+0x880>
   .byte  65,15,94,211                        // divps         %xmm11,%xmm2
   .byte  68,15,92,226                        // subps         %xmm2,%xmm12
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  102,69,15,58,8,212,1                // roundps       $0x1,%xmm12,%xmm10
   .byte  69,15,40,220                        // movaps        %xmm12,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  68,15,88,37,96,38,0,0               // addps         0x2660(%rip),%xmm12        # 4f80 <_sk_callback_sse41+0x88a>
-  .byte  15,40,21,105,38,0,0                 // movaps        0x2669(%rip),%xmm2        # 4f90 <_sk_callback_sse41+0x89a>
+  .byte  68,15,88,37,102,38,0,0              // addps         0x2666(%rip),%xmm12        # 4f80 <_sk_callback_sse41+0x890>
+  .byte  15,40,21,111,38,0,0                 // movaps        0x266f(%rip),%xmm2        # 4f90 <_sk_callback_sse41+0x8a0>
   .byte  65,15,89,211                        // mulps         %xmm11,%xmm2
   .byte  68,15,92,226                        // subps         %xmm2,%xmm12
-  .byte  68,15,40,21,105,38,0,0              // movaps        0x2669(%rip),%xmm10        # 4fa0 <_sk_callback_sse41+0x8aa>
+  .byte  68,15,40,21,111,38,0,0              // movaps        0x266f(%rip),%xmm10        # 4fa0 <_sk_callback_sse41+0x8b0>
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
-  .byte  15,40,21,110,38,0,0                 // movaps        0x266e(%rip),%xmm2        # 4fb0 <_sk_callback_sse41+0x8ba>
+  .byte  15,40,21,116,38,0,0                 // movaps        0x2674(%rip),%xmm2        # 4fb0 <_sk_callback_sse41+0x8c0>
   .byte  65,15,94,210                        // divps         %xmm10,%xmm2
   .byte  65,15,88,212                        // addps         %xmm12,%xmm2
-  .byte  15,89,21,111,38,0,0                 // mulps         0x266f(%rip),%xmm2        # 4fc0 <_sk_callback_sse41+0x8ca>
+  .byte  15,89,21,117,38,0,0                 // mulps         0x2675(%rip),%xmm2        # 4fc0 <_sk_callback_sse41+0x8d0>
   .byte  102,68,15,91,210                    // cvtps2dq      %xmm2,%xmm10
   .byte  243,15,16,80,20                     // movss         0x14(%rax),%xmm2
   .byte  15,198,210,0                        // shufps        $0x0,%xmm2,%xmm2
@@ -23327,7 +23317,7 @@
   .byte  102,65,15,56,20,209                 // blendvps      %xmm0,%xmm9,%xmm2
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  15,95,208                           // maxps         %xmm0,%xmm2
-  .byte  15,93,21,90,38,0,0                  // minps         0x265a(%rip),%xmm2        # 4fd0 <_sk_callback_sse41+0x8da>
+  .byte  15,93,21,96,38,0,0                  // minps         0x2660(%rip),%xmm2        # 4fd0 <_sk_callback_sse41+0x8e0>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -23357,31 +23347,31 @@
   .byte  68,15,88,219                        // addps         %xmm3,%xmm11
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,91,227                        // cvtdq2ps      %xmm11,%xmm12
-  .byte  68,15,89,37,251,37,0,0              // mulps         0x25fb(%rip),%xmm12        # 4fe0 <_sk_callback_sse41+0x8ea>
-  .byte  68,15,84,29,3,38,0,0                // andps         0x2603(%rip),%xmm11        # 4ff0 <_sk_callback_sse41+0x8fa>
-  .byte  68,15,86,29,11,38,0,0               // orps          0x260b(%rip),%xmm11        # 5000 <_sk_callback_sse41+0x90a>
-  .byte  68,15,88,37,19,38,0,0               // addps         0x2613(%rip),%xmm12        # 5010 <_sk_callback_sse41+0x91a>
-  .byte  15,40,29,28,38,0,0                  // movaps        0x261c(%rip),%xmm3        # 5020 <_sk_callback_sse41+0x92a>
+  .byte  68,15,89,37,1,38,0,0                // mulps         0x2601(%rip),%xmm12        # 4fe0 <_sk_callback_sse41+0x8f0>
+  .byte  68,15,84,29,9,38,0,0                // andps         0x2609(%rip),%xmm11        # 4ff0 <_sk_callback_sse41+0x900>
+  .byte  68,15,86,29,17,38,0,0               // orps          0x2611(%rip),%xmm11        # 5000 <_sk_callback_sse41+0x910>
+  .byte  68,15,88,37,25,38,0,0               // addps         0x2619(%rip),%xmm12        # 5010 <_sk_callback_sse41+0x920>
+  .byte  15,40,29,34,38,0,0                  // movaps        0x2622(%rip),%xmm3        # 5020 <_sk_callback_sse41+0x930>
   .byte  65,15,89,219                        // mulps         %xmm11,%xmm3
   .byte  68,15,92,227                        // subps         %xmm3,%xmm12
-  .byte  68,15,88,29,28,38,0,0               // addps         0x261c(%rip),%xmm11        # 5030 <_sk_callback_sse41+0x93a>
-  .byte  15,40,29,37,38,0,0                  // movaps        0x2625(%rip),%xmm3        # 5040 <_sk_callback_sse41+0x94a>
+  .byte  68,15,88,29,34,38,0,0               // addps         0x2622(%rip),%xmm11        # 5030 <_sk_callback_sse41+0x940>
+  .byte  15,40,29,43,38,0,0                  // movaps        0x262b(%rip),%xmm3        # 5040 <_sk_callback_sse41+0x950>
   .byte  65,15,94,219                        // divps         %xmm11,%xmm3
   .byte  68,15,92,227                        // subps         %xmm3,%xmm12
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  102,69,15,58,8,212,1                // roundps       $0x1,%xmm12,%xmm10
   .byte  69,15,40,220                        // movaps        %xmm12,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  68,15,88,37,18,38,0,0               // addps         0x2612(%rip),%xmm12        # 5050 <_sk_callback_sse41+0x95a>
-  .byte  15,40,29,27,38,0,0                  // movaps        0x261b(%rip),%xmm3        # 5060 <_sk_callback_sse41+0x96a>
+  .byte  68,15,88,37,24,38,0,0               // addps         0x2618(%rip),%xmm12        # 5050 <_sk_callback_sse41+0x960>
+  .byte  15,40,29,33,38,0,0                  // movaps        0x2621(%rip),%xmm3        # 5060 <_sk_callback_sse41+0x970>
   .byte  65,15,89,219                        // mulps         %xmm11,%xmm3
   .byte  68,15,92,227                        // subps         %xmm3,%xmm12
-  .byte  68,15,40,21,27,38,0,0               // movaps        0x261b(%rip),%xmm10        # 5070 <_sk_callback_sse41+0x97a>
+  .byte  68,15,40,21,33,38,0,0               // movaps        0x2621(%rip),%xmm10        # 5070 <_sk_callback_sse41+0x980>
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
-  .byte  15,40,29,32,38,0,0                  // movaps        0x2620(%rip),%xmm3        # 5080 <_sk_callback_sse41+0x98a>
+  .byte  15,40,29,38,38,0,0                  // movaps        0x2626(%rip),%xmm3        # 5080 <_sk_callback_sse41+0x990>
   .byte  65,15,94,218                        // divps         %xmm10,%xmm3
   .byte  65,15,88,220                        // addps         %xmm12,%xmm3
-  .byte  15,89,29,33,38,0,0                  // mulps         0x2621(%rip),%xmm3        # 5090 <_sk_callback_sse41+0x99a>
+  .byte  15,89,29,39,38,0,0                  // mulps         0x2627(%rip),%xmm3        # 5090 <_sk_callback_sse41+0x9a0>
   .byte  102,68,15,91,211                    // cvtps2dq      %xmm3,%xmm10
   .byte  243,15,16,88,20                     // movss         0x14(%rax),%xmm3
   .byte  15,198,219,0                        // shufps        $0x0,%xmm3,%xmm3
@@ -23389,7 +23379,7 @@
   .byte  102,65,15,56,20,217                 // blendvps      %xmm0,%xmm9,%xmm3
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  15,95,216                           // maxps         %xmm0,%xmm3
-  .byte  15,93,29,12,38,0,0                  // minps         0x260c(%rip),%xmm3        # 50a0 <_sk_callback_sse41+0x9aa>
+  .byte  15,93,29,18,38,0,0                  // minps         0x2612(%rip),%xmm3        # 50a0 <_sk_callback_sse41+0x9b0>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -23399,29 +23389,29 @@
 FUNCTION(_sk_lab_to_xyz_sse41)
 _sk_lab_to_xyz_sse41:
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,89,5,8,38,0,0                 // mulps         0x2608(%rip),%xmm8        # 50b0 <_sk_callback_sse41+0x9ba>
-  .byte  68,15,40,13,16,38,0,0               // movaps        0x2610(%rip),%xmm9        # 50c0 <_sk_callback_sse41+0x9ca>
+  .byte  68,15,89,5,14,38,0,0                // mulps         0x260e(%rip),%xmm8        # 50b0 <_sk_callback_sse41+0x9c0>
+  .byte  68,15,40,13,22,38,0,0               // movaps        0x2616(%rip),%xmm9        # 50c0 <_sk_callback_sse41+0x9d0>
   .byte  65,15,89,201                        // mulps         %xmm9,%xmm1
-  .byte  15,40,5,21,38,0,0                   // movaps        0x2615(%rip),%xmm0        # 50d0 <_sk_callback_sse41+0x9da>
+  .byte  15,40,5,27,38,0,0                   // movaps        0x261b(%rip),%xmm0        # 50d0 <_sk_callback_sse41+0x9e0>
   .byte  15,88,200                           // addps         %xmm0,%xmm1
   .byte  65,15,89,209                        // mulps         %xmm9,%xmm2
   .byte  15,88,208                           // addps         %xmm0,%xmm2
-  .byte  68,15,88,5,19,38,0,0                // addps         0x2613(%rip),%xmm8        # 50e0 <_sk_callback_sse41+0x9ea>
-  .byte  68,15,89,5,27,38,0,0                // mulps         0x261b(%rip),%xmm8        # 50f0 <_sk_callback_sse41+0x9fa>
-  .byte  15,89,13,36,38,0,0                  // mulps         0x2624(%rip),%xmm1        # 5100 <_sk_callback_sse41+0xa0a>
+  .byte  68,15,88,5,25,38,0,0                // addps         0x2619(%rip),%xmm8        # 50e0 <_sk_callback_sse41+0x9f0>
+  .byte  68,15,89,5,33,38,0,0                // mulps         0x2621(%rip),%xmm8        # 50f0 <_sk_callback_sse41+0xa00>
+  .byte  15,89,13,42,38,0,0                  // mulps         0x262a(%rip),%xmm1        # 5100 <_sk_callback_sse41+0xa10>
   .byte  65,15,88,200                        // addps         %xmm8,%xmm1
-  .byte  15,89,21,41,38,0,0                  // mulps         0x2629(%rip),%xmm2        # 5110 <_sk_callback_sse41+0xa1a>
+  .byte  15,89,21,47,38,0,0                  // mulps         0x262f(%rip),%xmm2        # 5110 <_sk_callback_sse41+0xa20>
   .byte  69,15,40,208                        // movaps        %xmm8,%xmm10
   .byte  68,15,92,210                        // subps         %xmm2,%xmm10
   .byte  68,15,40,217                        // movaps        %xmm1,%xmm11
   .byte  69,15,89,219                        // mulps         %xmm11,%xmm11
   .byte  68,15,89,217                        // mulps         %xmm1,%xmm11
-  .byte  68,15,40,13,29,38,0,0               // movaps        0x261d(%rip),%xmm9        # 5120 <_sk_callback_sse41+0xa2a>
+  .byte  68,15,40,13,35,38,0,0               // movaps        0x2623(%rip),%xmm9        # 5120 <_sk_callback_sse41+0xa30>
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  65,15,194,195,1                     // cmpltps       %xmm11,%xmm0
-  .byte  15,40,21,29,38,0,0                  // movaps        0x261d(%rip),%xmm2        # 5130 <_sk_callback_sse41+0xa3a>
+  .byte  15,40,21,35,38,0,0                  // movaps        0x2623(%rip),%xmm2        # 5130 <_sk_callback_sse41+0xa40>
   .byte  15,88,202                           // addps         %xmm2,%xmm1
-  .byte  68,15,40,37,34,38,0,0               // movaps        0x2622(%rip),%xmm12        # 5140 <_sk_callback_sse41+0xa4a>
+  .byte  68,15,40,37,40,38,0,0               // movaps        0x2628(%rip),%xmm12        # 5140 <_sk_callback_sse41+0xa50>
   .byte  65,15,89,204                        // mulps         %xmm12,%xmm1
   .byte  102,65,15,56,20,203                 // blendvps      %xmm0,%xmm11,%xmm1
   .byte  69,15,40,216                        // movaps        %xmm8,%xmm11
@@ -23440,8 +23430,8 @@
   .byte  65,15,89,212                        // mulps         %xmm12,%xmm2
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  102,65,15,56,20,211                 // blendvps      %xmm0,%xmm11,%xmm2
-  .byte  15,89,13,219,37,0,0                 // mulps         0x25db(%rip),%xmm1        # 5150 <_sk_callback_sse41+0xa5a>
-  .byte  15,89,21,228,37,0,0                 // mulps         0x25e4(%rip),%xmm2        # 5160 <_sk_callback_sse41+0xa6a>
+  .byte  15,89,13,225,37,0,0                 // mulps         0x25e1(%rip),%xmm1        # 5150 <_sk_callback_sse41+0xa60>
+  .byte  15,89,21,234,37,0,0                 // mulps         0x25ea(%rip),%xmm2        # 5160 <_sk_callback_sse41+0xa70>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  65,15,40,200                        // movaps        %xmm8,%xmm1
@@ -23455,7 +23445,7 @@
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  102,15,56,49,4,56                   // pmovzxbd      (%rax,%rdi,1),%xmm0
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,29,212,37,0,0                 // mulps         0x25d4(%rip),%xmm3        # 5170 <_sk_callback_sse41+0xa7a>
+  .byte  15,89,29,218,37,0,0                 // mulps         0x25da(%rip),%xmm3        # 5170 <_sk_callback_sse41+0xa80>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  15,87,201                           // xorps         %xmm1,%xmm1
@@ -23488,7 +23478,7 @@
   .byte  102,15,58,32,192,3                  // pinsrb        $0x3,%eax,%xmm0
   .byte  102,15,56,49,192                    // pmovzxbd      %xmm0,%xmm0
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,29,104,37,0,0                 // mulps         0x2568(%rip),%xmm3        # 5180 <_sk_callback_sse41+0xa8a>
+  .byte  15,89,29,110,37,0,0                 // mulps         0x256e(%rip),%xmm3        # 5180 <_sk_callback_sse41+0xa90>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
@@ -23501,7 +23491,7 @@
 _sk_store_a8_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,92,37,0,0                // movaps        0x255c(%rip),%xmm8        # 5190 <_sk_callback_sse41+0xa9a>
+  .byte  68,15,40,5,98,37,0,0                // movaps        0x2562(%rip),%xmm8        # 5190 <_sk_callback_sse41+0xaa0>
   .byte  68,15,89,195                        // mulps         %xmm3,%xmm8
   .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
   .byte  102,69,15,56,43,192                 // packusdw      %xmm8,%xmm8
@@ -23518,9 +23508,9 @@
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  102,15,56,49,4,56                   // pmovzxbd      (%rax,%rdi,1),%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,57,37,0,0                   // mulps         0x2539(%rip),%xmm0        # 51a0 <_sk_callback_sse41+0xaaa>
+  .byte  15,89,5,63,37,0,0                   // mulps         0x253f(%rip),%xmm0        # 51a0 <_sk_callback_sse41+0xab0>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,64,37,0,0                  // movaps        0x2540(%rip),%xmm3        # 51b0 <_sk_callback_sse41+0xaba>
+  .byte  15,40,29,70,37,0,0                  // movaps        0x2546(%rip),%xmm3        # 51b0 <_sk_callback_sse41+0xac0>
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  255,224                             // jmpq          *%rax
@@ -23551,9 +23541,9 @@
   .byte  102,15,58,32,192,3                  // pinsrb        $0x3,%eax,%xmm0
   .byte  102,15,56,49,192                    // pmovzxbd      %xmm0,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,217,36,0,0                  // mulps         0x24d9(%rip),%xmm0        # 51c0 <_sk_callback_sse41+0xaca>
+  .byte  15,89,5,223,36,0,0                  // mulps         0x24df(%rip),%xmm0        # 51c0 <_sk_callback_sse41+0xad0>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,224,36,0,0                 // movaps        0x24e0(%rip),%xmm3        # 51d0 <_sk_callback_sse41+0xada>
+  .byte  15,40,29,230,36,0,0                 // movaps        0x24e6(%rip),%xmm3        # 51d0 <_sk_callback_sse41+0xae0>
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  255,224                             // jmpq          *%rax
@@ -23565,9 +23555,9 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,137,192                          // mov           %rax,%r8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  116,5                               // je            2d07 <_sk_gather_i8_sse41+0xf>
+  .byte  116,5                               // je            2d01 <_sk_gather_i8_sse41+0xf>
   .byte  76,137,192                          // mov           %r8,%rax
-  .byte  235,2                               // jmp           2d09 <_sk_gather_i8_sse41+0x11>
+  .byte  235,2                               // jmp           2d03 <_sk_gather_i8_sse41+0x11>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  243,15,91,201                       // cvttps2dq     %xmm1,%xmm1
@@ -23598,17 +23588,17 @@
   .byte  102,15,58,34,28,8,1                 // pinsrd        $0x1,(%rax,%rcx,1),%xmm3
   .byte  102,66,15,58,34,28,144,2            // pinsrd        $0x2,(%rax,%r10,4),%xmm3
   .byte  102,66,15,58,34,28,8,3              // pinsrd        $0x3,(%rax,%r9,1),%xmm3
-  .byte  102,15,111,5,55,36,0,0              // movdqa        0x2437(%rip),%xmm0        # 51e0 <_sk_callback_sse41+0xaea>
+  .byte  102,15,111,5,61,36,0,0              // movdqa        0x243d(%rip),%xmm0        # 51e0 <_sk_callback_sse41+0xaf0>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,56,36,0,0                // movaps        0x2438(%rip),%xmm8        # 51f0 <_sk_callback_sse41+0xafa>
+  .byte  68,15,40,5,62,36,0,0                // movaps        0x243e(%rip),%xmm8        # 51f0 <_sk_callback_sse41+0xb00>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
-  .byte  102,15,56,0,13,55,36,0,0            // pshufb        0x2437(%rip),%xmm1        # 5200 <_sk_callback_sse41+0xb0a>
+  .byte  102,15,56,0,13,61,36,0,0            // pshufb        0x243d(%rip),%xmm1        # 5200 <_sk_callback_sse41+0xb10>
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,111,211                      // movdqa        %xmm3,%xmm2
-  .byte  102,15,56,0,21,51,36,0,0            // pshufb        0x2433(%rip),%xmm2        # 5210 <_sk_callback_sse41+0xb1a>
+  .byte  102,15,56,0,21,57,36,0,0            // pshufb        0x2439(%rip),%xmm2        # 5210 <_sk_callback_sse41+0xb20>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
@@ -23624,19 +23614,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  102,15,56,51,20,120                 // pmovzxwd      (%rax,%rdi,2),%xmm2
-  .byte  102,15,111,5,25,36,0,0              // movdqa        0x2419(%rip),%xmm0        # 5220 <_sk_callback_sse41+0xb2a>
+  .byte  102,15,111,5,31,36,0,0              // movdqa        0x241f(%rip),%xmm0        # 5220 <_sk_callback_sse41+0xb30>
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,27,36,0,0                   // mulps         0x241b(%rip),%xmm0        # 5230 <_sk_callback_sse41+0xb3a>
-  .byte  102,15,111,13,35,36,0,0             // movdqa        0x2423(%rip),%xmm1        # 5240 <_sk_callback_sse41+0xb4a>
+  .byte  15,89,5,33,36,0,0                   // mulps         0x2421(%rip),%xmm0        # 5230 <_sk_callback_sse41+0xb40>
+  .byte  102,15,111,13,41,36,0,0             // movdqa        0x2429(%rip),%xmm1        # 5240 <_sk_callback_sse41+0xb50>
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,37,36,0,0                  // mulps         0x2425(%rip),%xmm1        # 5250 <_sk_callback_sse41+0xb5a>
-  .byte  102,15,219,21,45,36,0,0             // pand          0x242d(%rip),%xmm2        # 5260 <_sk_callback_sse41+0xb6a>
+  .byte  15,89,13,43,36,0,0                  // mulps         0x242b(%rip),%xmm1        # 5250 <_sk_callback_sse41+0xb60>
+  .byte  102,15,219,21,51,36,0,0             // pand          0x2433(%rip),%xmm2        # 5260 <_sk_callback_sse41+0xb70>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,51,36,0,0                  // mulps         0x2433(%rip),%xmm2        # 5270 <_sk_callback_sse41+0xb7a>
+  .byte  15,89,21,57,36,0,0                  // mulps         0x2439(%rip),%xmm2        # 5270 <_sk_callback_sse41+0xb80>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,58,36,0,0                  // movaps        0x243a(%rip),%xmm3        # 5280 <_sk_callback_sse41+0xb8a>
+  .byte  15,40,29,64,36,0,0                  // movaps        0x2440(%rip),%xmm3        # 5280 <_sk_callback_sse41+0xb90>
   .byte  255,224                             // jmpq          *%rax
 
 HIDDEN _sk_gather_565_sse41
@@ -23664,19 +23654,19 @@
   .byte  65,15,183,4,65                      // movzwl        (%r9,%rax,2),%eax
   .byte  102,15,196,192,3                    // pinsrw        $0x3,%eax,%xmm0
   .byte  102,15,56,51,208                    // pmovzxwd      %xmm0,%xmm2
-  .byte  102,15,111,5,223,35,0,0             // movdqa        0x23df(%rip),%xmm0        # 5290 <_sk_callback_sse41+0xb9a>
+  .byte  102,15,111,5,229,35,0,0             // movdqa        0x23e5(%rip),%xmm0        # 5290 <_sk_callback_sse41+0xba0>
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,225,35,0,0                  // mulps         0x23e1(%rip),%xmm0        # 52a0 <_sk_callback_sse41+0xbaa>
-  .byte  102,15,111,13,233,35,0,0            // movdqa        0x23e9(%rip),%xmm1        # 52b0 <_sk_callback_sse41+0xbba>
+  .byte  15,89,5,231,35,0,0                  // mulps         0x23e7(%rip),%xmm0        # 52a0 <_sk_callback_sse41+0xbb0>
+  .byte  102,15,111,13,239,35,0,0            // movdqa        0x23ef(%rip),%xmm1        # 52b0 <_sk_callback_sse41+0xbc0>
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,235,35,0,0                 // mulps         0x23eb(%rip),%xmm1        # 52c0 <_sk_callback_sse41+0xbca>
-  .byte  102,15,219,21,243,35,0,0            // pand          0x23f3(%rip),%xmm2        # 52d0 <_sk_callback_sse41+0xbda>
+  .byte  15,89,13,241,35,0,0                 // mulps         0x23f1(%rip),%xmm1        # 52c0 <_sk_callback_sse41+0xbd0>
+  .byte  102,15,219,21,249,35,0,0            // pand          0x23f9(%rip),%xmm2        # 52d0 <_sk_callback_sse41+0xbe0>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,249,35,0,0                 // mulps         0x23f9(%rip),%xmm2        # 52e0 <_sk_callback_sse41+0xbea>
+  .byte  15,89,21,255,35,0,0                 // mulps         0x23ff(%rip),%xmm2        # 52e0 <_sk_callback_sse41+0xbf0>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,0,36,0,0                   // movaps        0x2400(%rip),%xmm3        # 52f0 <_sk_callback_sse41+0xbfa>
+  .byte  15,40,29,6,36,0,0                   // movaps        0x2406(%rip),%xmm3        # 52f0 <_sk_callback_sse41+0xc00>
   .byte  255,224                             // jmpq          *%rax
 
 HIDDEN _sk_store_565_sse41
@@ -23685,12 +23675,12 @@
 _sk_store_565_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,1,36,0,0                 // movaps        0x2401(%rip),%xmm8        # 5300 <_sk_callback_sse41+0xc0a>
+  .byte  68,15,40,5,7,36,0,0                 // movaps        0x2407(%rip),%xmm8        # 5300 <_sk_callback_sse41+0xc10>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
   .byte  102,65,15,114,241,11                // pslld         $0xb,%xmm9
-  .byte  68,15,40,21,246,35,0,0              // movaps        0x23f6(%rip),%xmm10        # 5310 <_sk_callback_sse41+0xc1a>
+  .byte  68,15,40,21,252,35,0,0              // movaps        0x23fc(%rip),%xmm10        # 5310 <_sk_callback_sse41+0xc20>
   .byte  68,15,89,209                        // mulps         %xmm1,%xmm10
   .byte  102,69,15,91,210                    // cvtps2dq      %xmm10,%xmm10
   .byte  102,65,15,114,242,5                 // pslld         $0x5,%xmm10
@@ -23710,21 +23700,21 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  102,15,56,51,28,120                 // pmovzxwd      (%rax,%rdi,2),%xmm3
-  .byte  102,15,111,5,193,35,0,0             // movdqa        0x23c1(%rip),%xmm0        # 5320 <_sk_callback_sse41+0xc2a>
+  .byte  102,15,111,5,199,35,0,0             // movdqa        0x23c7(%rip),%xmm0        # 5320 <_sk_callback_sse41+0xc30>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,195,35,0,0                  // mulps         0x23c3(%rip),%xmm0        # 5330 <_sk_callback_sse41+0xc3a>
-  .byte  102,15,111,13,203,35,0,0            // movdqa        0x23cb(%rip),%xmm1        # 5340 <_sk_callback_sse41+0xc4a>
+  .byte  15,89,5,201,35,0,0                  // mulps         0x23c9(%rip),%xmm0        # 5330 <_sk_callback_sse41+0xc40>
+  .byte  102,15,111,13,209,35,0,0            // movdqa        0x23d1(%rip),%xmm1        # 5340 <_sk_callback_sse41+0xc50>
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,205,35,0,0                 // mulps         0x23cd(%rip),%xmm1        # 5350 <_sk_callback_sse41+0xc5a>
-  .byte  102,15,111,21,213,35,0,0            // movdqa        0x23d5(%rip),%xmm2        # 5360 <_sk_callback_sse41+0xc6a>
+  .byte  15,89,13,211,35,0,0                 // mulps         0x23d3(%rip),%xmm1        # 5350 <_sk_callback_sse41+0xc60>
+  .byte  102,15,111,21,219,35,0,0            // movdqa        0x23db(%rip),%xmm2        # 5360 <_sk_callback_sse41+0xc70>
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,215,35,0,0                 // mulps         0x23d7(%rip),%xmm2        # 5370 <_sk_callback_sse41+0xc7a>
-  .byte  102,15,219,29,223,35,0,0            // pand          0x23df(%rip),%xmm3        # 5380 <_sk_callback_sse41+0xc8a>
+  .byte  15,89,21,221,35,0,0                 // mulps         0x23dd(%rip),%xmm2        # 5370 <_sk_callback_sse41+0xc80>
+  .byte  102,15,219,29,229,35,0,0            // pand          0x23e5(%rip),%xmm3        # 5380 <_sk_callback_sse41+0xc90>
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,229,35,0,0                 // mulps         0x23e5(%rip),%xmm3        # 5390 <_sk_callback_sse41+0xc9a>
+  .byte  15,89,29,235,35,0,0                 // mulps         0x23eb(%rip),%xmm3        # 5390 <_sk_callback_sse41+0xca0>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
@@ -23753,21 +23743,21 @@
   .byte  65,15,183,4,65                      // movzwl        (%r9,%rax,2),%eax
   .byte  102,15,196,192,3                    // pinsrw        $0x3,%eax,%xmm0
   .byte  102,15,56,51,216                    // pmovzxwd      %xmm0,%xmm3
-  .byte  102,15,111,5,136,35,0,0             // movdqa        0x2388(%rip),%xmm0        # 53a0 <_sk_callback_sse41+0xcaa>
+  .byte  102,15,111,5,142,35,0,0             // movdqa        0x238e(%rip),%xmm0        # 53a0 <_sk_callback_sse41+0xcb0>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,138,35,0,0                  // mulps         0x238a(%rip),%xmm0        # 53b0 <_sk_callback_sse41+0xcba>
-  .byte  102,15,111,13,146,35,0,0            // movdqa        0x2392(%rip),%xmm1        # 53c0 <_sk_callback_sse41+0xcca>
+  .byte  15,89,5,144,35,0,0                  // mulps         0x2390(%rip),%xmm0        # 53b0 <_sk_callback_sse41+0xcc0>
+  .byte  102,15,111,13,152,35,0,0            // movdqa        0x2398(%rip),%xmm1        # 53c0 <_sk_callback_sse41+0xcd0>
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,148,35,0,0                 // mulps         0x2394(%rip),%xmm1        # 53d0 <_sk_callback_sse41+0xcda>
-  .byte  102,15,111,21,156,35,0,0            // movdqa        0x239c(%rip),%xmm2        # 53e0 <_sk_callback_sse41+0xcea>
+  .byte  15,89,13,154,35,0,0                 // mulps         0x239a(%rip),%xmm1        # 53d0 <_sk_callback_sse41+0xce0>
+  .byte  102,15,111,21,162,35,0,0            // movdqa        0x23a2(%rip),%xmm2        # 53e0 <_sk_callback_sse41+0xcf0>
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,158,35,0,0                 // mulps         0x239e(%rip),%xmm2        # 53f0 <_sk_callback_sse41+0xcfa>
-  .byte  102,15,219,29,166,35,0,0            // pand          0x23a6(%rip),%xmm3        # 5400 <_sk_callback_sse41+0xd0a>
+  .byte  15,89,21,164,35,0,0                 // mulps         0x23a4(%rip),%xmm2        # 53f0 <_sk_callback_sse41+0xd00>
+  .byte  102,15,219,29,172,35,0,0            // pand          0x23ac(%rip),%xmm3        # 5400 <_sk_callback_sse41+0xd10>
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,172,35,0,0                 // mulps         0x23ac(%rip),%xmm3        # 5410 <_sk_callback_sse41+0xd1a>
+  .byte  15,89,29,178,35,0,0                 // mulps         0x23b2(%rip),%xmm3        # 5410 <_sk_callback_sse41+0xd20>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
@@ -23777,7 +23767,7 @@
 _sk_store_4444_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,171,35,0,0               // movaps        0x23ab(%rip),%xmm8        # 5420 <_sk_callback_sse41+0xd2a>
+  .byte  68,15,40,5,177,35,0,0               // movaps        0x23b1(%rip),%xmm8        # 5420 <_sk_callback_sse41+0xd30>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -23807,17 +23797,17 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  15,16,28,184                        // movups        (%rax,%rdi,4),%xmm3
-  .byte  15,40,5,74,35,0,0                   // movaps        0x234a(%rip),%xmm0        # 5430 <_sk_callback_sse41+0xd3a>
+  .byte  15,40,5,80,35,0,0                   // movaps        0x2350(%rip),%xmm0        # 5430 <_sk_callback_sse41+0xd40>
   .byte  15,84,195                           // andps         %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,76,35,0,0                // movaps        0x234c(%rip),%xmm8        # 5440 <_sk_callback_sse41+0xd4a>
+  .byte  68,15,40,5,82,35,0,0                // movaps        0x2352(%rip),%xmm8        # 5440 <_sk_callback_sse41+0xd50>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,40,203                           // movaps        %xmm3,%xmm1
-  .byte  102,15,56,0,13,76,35,0,0            // pshufb        0x234c(%rip),%xmm1        # 5450 <_sk_callback_sse41+0xd5a>
+  .byte  102,15,56,0,13,82,35,0,0            // pshufb        0x2352(%rip),%xmm1        # 5450 <_sk_callback_sse41+0xd60>
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  15,40,211                           // movaps        %xmm3,%xmm2
-  .byte  102,15,56,0,21,73,35,0,0            // pshufb        0x2349(%rip),%xmm2        # 5460 <_sk_callback_sse41+0xd6a>
+  .byte  102,15,56,0,21,79,35,0,0            // pshufb        0x234f(%rip),%xmm2        # 5460 <_sk_callback_sse41+0xd70>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
@@ -23848,17 +23838,17 @@
   .byte  102,65,15,58,34,28,129,1            // pinsrd        $0x1,(%r9,%rax,4),%xmm3
   .byte  102,67,15,58,34,28,145,2            // pinsrd        $0x2,(%r9,%r10,4),%xmm3
   .byte  102,65,15,58,34,28,137,3            // pinsrd        $0x3,(%r9,%rcx,4),%xmm3
-  .byte  102,15,111,5,226,34,0,0             // movdqa        0x22e2(%rip),%xmm0        # 5470 <_sk_callback_sse41+0xd7a>
+  .byte  102,15,111,5,232,34,0,0             // movdqa        0x22e8(%rip),%xmm0        # 5470 <_sk_callback_sse41+0xd80>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,227,34,0,0               // movaps        0x22e3(%rip),%xmm8        # 5480 <_sk_callback_sse41+0xd8a>
+  .byte  68,15,40,5,233,34,0,0               // movaps        0x22e9(%rip),%xmm8        # 5480 <_sk_callback_sse41+0xd90>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
-  .byte  102,15,56,0,13,226,34,0,0           // pshufb        0x22e2(%rip),%xmm1        # 5490 <_sk_callback_sse41+0xd9a>
+  .byte  102,15,56,0,13,232,34,0,0           // pshufb        0x22e8(%rip),%xmm1        # 5490 <_sk_callback_sse41+0xda0>
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,111,211                      // movdqa        %xmm3,%xmm2
-  .byte  102,15,56,0,21,222,34,0,0           // pshufb        0x22de(%rip),%xmm2        # 54a0 <_sk_callback_sse41+0xdaa>
+  .byte  102,15,56,0,21,228,34,0,0           // pshufb        0x22e4(%rip),%xmm2        # 54a0 <_sk_callback_sse41+0xdb0>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
@@ -23873,7 +23863,7 @@
 _sk_store_8888_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,202,34,0,0               // movaps        0x22ca(%rip),%xmm8        # 54b0 <_sk_callback_sse41+0xdba>
+  .byte  68,15,40,5,208,34,0,0               // movaps        0x22d0(%rip),%xmm8        # 54b0 <_sk_callback_sse41+0xdc0>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -23910,18 +23900,18 @@
   .byte  102,68,15,97,216                    // punpcklwd     %xmm0,%xmm11
   .byte  102,68,15,105,200                   // punpckhwd     %xmm0,%xmm9
   .byte  102,65,15,56,51,203                 // pmovzxwd      %xmm11,%xmm1
-  .byte  102,68,15,111,5,67,34,0,0           // movdqa        0x2243(%rip),%xmm8        # 54c0 <_sk_callback_sse41+0xdca>
+  .byte  102,68,15,111,5,73,34,0,0           // movdqa        0x2249(%rip),%xmm8        # 54c0 <_sk_callback_sse41+0xdd0>
   .byte  102,15,111,209                      // movdqa        %xmm1,%xmm2
   .byte  102,65,15,219,208                   // pand          %xmm8,%xmm2
   .byte  102,15,239,202                      // pxor          %xmm2,%xmm1
-  .byte  102,15,111,29,62,34,0,0             // movdqa        0x223e(%rip),%xmm3        # 54d0 <_sk_callback_sse41+0xdda>
+  .byte  102,15,111,29,68,34,0,0             // movdqa        0x2244(%rip),%xmm3        # 54d0 <_sk_callback_sse41+0xde0>
   .byte  102,15,114,242,16                   // pslld         $0x10,%xmm2
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,15,56,63,195                    // pmaxud        %xmm3,%xmm0
   .byte  102,15,118,193                      // pcmpeqd       %xmm1,%xmm0
   .byte  102,15,114,241,13                   // pslld         $0xd,%xmm1
   .byte  102,15,235,202                      // por           %xmm2,%xmm1
-  .byte  102,68,15,111,21,42,34,0,0          // movdqa        0x222a(%rip),%xmm10        # 54e0 <_sk_callback_sse41+0xdea>
+  .byte  102,68,15,111,21,48,34,0,0          // movdqa        0x2230(%rip),%xmm10        # 54e0 <_sk_callback_sse41+0xdf0>
   .byte  102,65,15,254,202                   // paddd         %xmm10,%xmm1
   .byte  102,15,219,193                      // pand          %xmm1,%xmm0
   .byte  102,65,15,115,219,8                 // psrldq        $0x8,%xmm11
@@ -23994,18 +23984,18 @@
   .byte  102,68,15,97,218                    // punpcklwd     %xmm2,%xmm11
   .byte  102,68,15,105,202                   // punpckhwd     %xmm2,%xmm9
   .byte  102,65,15,56,51,203                 // pmovzxwd      %xmm11,%xmm1
-  .byte  102,68,15,111,5,232,32,0,0          // movdqa        0x20e8(%rip),%xmm8        # 54f0 <_sk_callback_sse41+0xdfa>
+  .byte  102,68,15,111,5,238,32,0,0          // movdqa        0x20ee(%rip),%xmm8        # 54f0 <_sk_callback_sse41+0xe00>
   .byte  102,15,111,209                      // movdqa        %xmm1,%xmm2
   .byte  102,65,15,219,208                   // pand          %xmm8,%xmm2
   .byte  102,15,239,202                      // pxor          %xmm2,%xmm1
-  .byte  102,15,111,29,227,32,0,0            // movdqa        0x20e3(%rip),%xmm3        # 5500 <_sk_callback_sse41+0xe0a>
+  .byte  102,15,111,29,233,32,0,0            // movdqa        0x20e9(%rip),%xmm3        # 5500 <_sk_callback_sse41+0xe10>
   .byte  102,15,114,242,16                   // pslld         $0x10,%xmm2
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,15,56,63,195                    // pmaxud        %xmm3,%xmm0
   .byte  102,15,118,193                      // pcmpeqd       %xmm1,%xmm0
   .byte  102,15,114,241,13                   // pslld         $0xd,%xmm1
   .byte  102,15,235,202                      // por           %xmm2,%xmm1
-  .byte  102,68,15,111,21,207,32,0,0         // movdqa        0x20cf(%rip),%xmm10        # 5510 <_sk_callback_sse41+0xe1a>
+  .byte  102,68,15,111,21,213,32,0,0         // movdqa        0x20d5(%rip),%xmm10        # 5510 <_sk_callback_sse41+0xe20>
   .byte  102,65,15,254,202                   // paddd         %xmm10,%xmm1
   .byte  102,15,219,193                      // pand          %xmm1,%xmm0
   .byte  102,65,15,115,219,8                 // psrldq        $0x8,%xmm11
@@ -24053,17 +24043,17 @@
 _sk_store_f16_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  102,68,15,111,21,5,32,0,0           // movdqa        0x2005(%rip),%xmm10        # 5520 <_sk_callback_sse41+0xe2a>
+  .byte  102,68,15,111,21,11,32,0,0          // movdqa        0x200b(%rip),%xmm10        # 5520 <_sk_callback_sse41+0xe30>
   .byte  102,68,15,111,224                   // movdqa        %xmm0,%xmm12
   .byte  102,68,15,111,232                   // movdqa        %xmm0,%xmm13
   .byte  102,69,15,219,234                   // pand          %xmm10,%xmm13
   .byte  102,69,15,239,229                   // pxor          %xmm13,%xmm12
-  .byte  102,68,15,111,13,248,31,0,0         // movdqa        0x1ff8(%rip),%xmm9        # 5530 <_sk_callback_sse41+0xe3a>
+  .byte  102,68,15,111,13,254,31,0,0         // movdqa        0x1ffe(%rip),%xmm9        # 5530 <_sk_callback_sse41+0xe40>
   .byte  102,65,15,114,213,16                // psrld         $0x10,%xmm13
   .byte  102,69,15,111,193                   // movdqa        %xmm9,%xmm8
   .byte  102,69,15,102,196                   // pcmpgtd       %xmm12,%xmm8
   .byte  102,65,15,114,212,13                // psrld         $0xd,%xmm12
-  .byte  102,68,15,111,29,233,31,0,0         // movdqa        0x1fe9(%rip),%xmm11        # 5540 <_sk_callback_sse41+0xe4a>
+  .byte  102,68,15,111,29,239,31,0,0         // movdqa        0x1fef(%rip),%xmm11        # 5540 <_sk_callback_sse41+0xe50>
   .byte  102,69,15,235,235                   // por           %xmm11,%xmm13
   .byte  102,69,15,254,236                   // paddd         %xmm12,%xmm13
   .byte  102,69,15,223,197                   // pandn         %xmm13,%xmm8
@@ -24133,7 +24123,7 @@
   .byte  102,15,235,200                      // por           %xmm0,%xmm1
   .byte  102,15,56,51,193                    // pmovzxwd      %xmm1,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,184,30,0,0               // movaps        0x1eb8(%rip),%xmm8        # 5550 <_sk_callback_sse41+0xe5a>
+  .byte  68,15,40,5,190,30,0,0               // movaps        0x1ebe(%rip),%xmm8        # 5550 <_sk_callback_sse41+0xe60>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -24185,7 +24175,7 @@
   .byte  102,15,235,193                      // por           %xmm1,%xmm0
   .byte  102,15,56,51,192                    // pmovzxwd      %xmm0,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,249,29,0,0               // movaps        0x1df9(%rip),%xmm8        # 5560 <_sk_callback_sse41+0xe6a>
+  .byte  68,15,40,5,255,29,0,0               // movaps        0x1dff(%rip),%xmm8        # 5560 <_sk_callback_sse41+0xe70>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -24202,7 +24192,7 @@
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,192,29,0,0                 // movaps        0x1dc0(%rip),%xmm3        # 5570 <_sk_callback_sse41+0xe7a>
+  .byte  15,40,29,198,29,0,0                 // movaps        0x1dc6(%rip),%xmm3        # 5570 <_sk_callback_sse41+0xe80>
   .byte  255,224                             // jmpq          *%rax
 
 HIDDEN _sk_store_u16_be_sse41
@@ -24211,7 +24201,7 @@
 _sk_store_u16_be_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,13,193,29,0,0              // movaps        0x1dc1(%rip),%xmm9        # 5580 <_sk_callback_sse41+0xe8a>
+  .byte  68,15,40,13,199,29,0,0              // movaps        0x1dc7(%rip),%xmm9        # 5580 <_sk_callback_sse41+0xe90>
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
@@ -24422,10 +24412,10 @@
 FUNCTION(_sk_luminance_to_alpha_sse41)
 _sk_luminance_to_alpha_sse41:
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
-  .byte  15,89,5,29,27,0,0                   // mulps         0x1b1d(%rip),%xmm0        # 5590 <_sk_callback_sse41+0xe9a>
-  .byte  15,89,13,38,27,0,0                  // mulps         0x1b26(%rip),%xmm1        # 55a0 <_sk_callback_sse41+0xeaa>
+  .byte  15,89,5,35,27,0,0                   // mulps         0x1b23(%rip),%xmm0        # 5590 <_sk_callback_sse41+0xea0>
+  .byte  15,89,13,44,27,0,0                  // mulps         0x1b2c(%rip),%xmm1        # 55a0 <_sk_callback_sse41+0xeb0>
   .byte  15,88,200                           // addps         %xmm0,%xmm1
-  .byte  15,89,29,44,27,0,0                  // mulps         0x1b2c(%rip),%xmm3        # 55b0 <_sk_callback_sse41+0xeba>
+  .byte  15,89,29,50,27,0,0                  // mulps         0x1b32(%rip),%xmm3        # 55b0 <_sk_callback_sse41+0xec0>
   .byte  15,88,217                           // addps         %xmm1,%xmm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
@@ -24701,9 +24691,9 @@
   .byte  72,139,8                            // mov           (%rax),%rcx
   .byte  76,139,88,8                         // mov           0x8(%rax),%r11
   .byte  72,255,201                          // dec           %rcx
-  .byte  120,7                               // js            3ebd <_sk_evenly_spaced_gradient_sse41+0x15>
+  .byte  120,7                               // js            3eb7 <_sk_evenly_spaced_gradient_sse41+0x15>
   .byte  243,72,15,42,201                    // cvtsi2ss      %rcx,%xmm1
-  .byte  235,21                              // jmp           3ed2 <_sk_evenly_spaced_gradient_sse41+0x2a>
+  .byte  235,21                              // jmp           3ecc <_sk_evenly_spaced_gradient_sse41+0x2a>
   .byte  73,137,200                          // mov           %rcx,%r8
   .byte  73,209,232                          // shr           %r8
   .byte  131,225,1                           // and           $0x1,%ecx
@@ -24794,12 +24784,12 @@
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,2                        // cmp           $0x2,%r8
-  .byte  114,50                              // jb            40b5 <_sk_gradient_sse41+0x41>
+  .byte  114,50                              // jb            40af <_sk_gradient_sse41+0x41>
   .byte  72,139,72,72                        // mov           0x48(%rax),%rcx
   .byte  73,255,200                          // dec           %r8
   .byte  72,131,193,4                        // add           $0x4,%rcx
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  15,40,21,39,21,0,0                  // movaps        0x1527(%rip),%xmm2        # 55c0 <_sk_callback_sse41+0xeca>
+  .byte  15,40,21,45,21,0,0                  // movaps        0x152d(%rip),%xmm2        # 55c0 <_sk_callback_sse41+0xed0>
   .byte  243,15,16,25                        // movss         (%rcx),%xmm3
   .byte  15,198,219,0                        // shufps        $0x0,%xmm3,%xmm3
   .byte  15,194,216,2                        // cmpleps       %xmm0,%xmm3
@@ -24807,7 +24797,7 @@
   .byte  102,15,254,203                      // paddd         %xmm3,%xmm1
   .byte  72,131,193,4                        // add           $0x4,%rcx
   .byte  73,255,200                          // dec           %r8
-  .byte  117,228                             // jne           4099 <_sk_gradient_sse41+0x25>
+  .byte  117,228                             // jne           4093 <_sk_gradient_sse41+0x25>
   .byte  65,86                               // push          %r14
   .byte  83                                  // push          %rbx
   .byte  102,73,15,58,22,201,1               // pextrq        $0x1,%xmm1,%r9
@@ -24938,26 +24928,26 @@
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,40,236                        // movaps        %xmm12,%xmm13
   .byte  69,15,89,237                        // mulps         %xmm13,%xmm13
-  .byte  68,15,40,21,201,18,0,0              // movaps        0x12c9(%rip),%xmm10        # 55d0 <_sk_callback_sse41+0xeda>
+  .byte  68,15,40,21,207,18,0,0              // movaps        0x12cf(%rip),%xmm10        # 55d0 <_sk_callback_sse41+0xee0>
   .byte  69,15,89,213                        // mulps         %xmm13,%xmm10
-  .byte  68,15,88,21,205,18,0,0              // addps         0x12cd(%rip),%xmm10        # 55e0 <_sk_callback_sse41+0xeea>
+  .byte  68,15,88,21,211,18,0,0              // addps         0x12d3(%rip),%xmm10        # 55e0 <_sk_callback_sse41+0xef0>
   .byte  69,15,89,213                        // mulps         %xmm13,%xmm10
-  .byte  68,15,88,21,209,18,0,0              // addps         0x12d1(%rip),%xmm10        # 55f0 <_sk_callback_sse41+0xefa>
+  .byte  68,15,88,21,215,18,0,0              // addps         0x12d7(%rip),%xmm10        # 55f0 <_sk_callback_sse41+0xf00>
   .byte  69,15,89,213                        // mulps         %xmm13,%xmm10
-  .byte  68,15,88,21,213,18,0,0              // addps         0x12d5(%rip),%xmm10        # 5600 <_sk_callback_sse41+0xf0a>
+  .byte  68,15,88,21,219,18,0,0              // addps         0x12db(%rip),%xmm10        # 5600 <_sk_callback_sse41+0xf10>
   .byte  69,15,89,212                        // mulps         %xmm12,%xmm10
   .byte  65,15,194,195,1                     // cmpltps       %xmm11,%xmm0
-  .byte  68,15,40,29,212,18,0,0              // movaps        0x12d4(%rip),%xmm11        # 5610 <_sk_callback_sse41+0xf1a>
+  .byte  68,15,40,29,218,18,0,0              // movaps        0x12da(%rip),%xmm11        # 5610 <_sk_callback_sse41+0xf20>
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
   .byte  102,69,15,56,20,211                 // blendvps      %xmm0,%xmm11,%xmm10
   .byte  69,15,194,200,1                     // cmpltps       %xmm8,%xmm9
-  .byte  68,15,40,29,205,18,0,0              // movaps        0x12cd(%rip),%xmm11        # 5620 <_sk_callback_sse41+0xf2a>
+  .byte  68,15,40,29,211,18,0,0              // movaps        0x12d3(%rip),%xmm11        # 5620 <_sk_callback_sse41+0xf30>
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  102,69,15,56,20,211                 // blendvps      %xmm0,%xmm11,%xmm10
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  65,15,194,192,1                     // cmpltps       %xmm8,%xmm0
-  .byte  68,15,40,13,191,18,0,0              // movaps        0x12bf(%rip),%xmm9        # 5630 <_sk_callback_sse41+0xf3a>
+  .byte  68,15,40,13,197,18,0,0              // movaps        0x12c5(%rip),%xmm9        # 5630 <_sk_callback_sse41+0xf40>
   .byte  69,15,92,202                        // subps         %xmm10,%xmm9
   .byte  102,69,15,56,20,209                 // blendvps      %xmm0,%xmm9,%xmm10
   .byte  69,15,194,194,7                     // cmpordps      %xmm10,%xmm8
@@ -24983,7 +24973,7 @@
 FUNCTION(_sk_save_xy_sse41)
 _sk_save_xy_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,147,18,0,0               // movaps        0x1293(%rip),%xmm8        # 5640 <_sk_callback_sse41+0xf4a>
+  .byte  68,15,40,5,153,18,0,0               // movaps        0x1299(%rip),%xmm8        # 5640 <_sk_callback_sse41+0xf50>
   .byte  15,17,0                             // movups        %xmm0,(%rax)
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,88,200                        // addps         %xmm8,%xmm9
@@ -25027,8 +25017,8 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,21,18,0,0                   // addps         0x1215(%rip),%xmm0        # 5650 <_sk_callback_sse41+0xf5a>
-  .byte  68,15,40,13,29,18,0,0               // movaps        0x121d(%rip),%xmm9        # 5660 <_sk_callback_sse41+0xf6a>
+  .byte  15,88,5,27,18,0,0                   // addps         0x121b(%rip),%xmm0        # 5650 <_sk_callback_sse41+0xf60>
+  .byte  68,15,40,13,35,18,0,0               // movaps        0x1223(%rip),%xmm9        # 5660 <_sk_callback_sse41+0xf70>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  68,15,17,136,128,0,0,0              // movups        %xmm9,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -25041,7 +25031,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,12,18,0,0                   // addps         0x120c(%rip),%xmm0        # 5670 <_sk_callback_sse41+0xf7a>
+  .byte  15,88,5,18,18,0,0                   // addps         0x1212(%rip),%xmm0        # 5670 <_sk_callback_sse41+0xf80>
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -25053,8 +25043,8 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,254,17,0,0                 // addps         0x11fe(%rip),%xmm1        # 5680 <_sk_callback_sse41+0xf8a>
-  .byte  68,15,40,13,6,18,0,0                // movaps        0x1206(%rip),%xmm9        # 5690 <_sk_callback_sse41+0xf9a>
+  .byte  15,88,13,4,18,0,0                   // addps         0x1204(%rip),%xmm1        # 5680 <_sk_callback_sse41+0xf90>
+  .byte  68,15,40,13,12,18,0,0               // movaps        0x120c(%rip),%xmm9        # 5690 <_sk_callback_sse41+0xfa0>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  68,15,17,136,160,0,0,0              // movups        %xmm9,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -25067,7 +25057,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,244,17,0,0                 // addps         0x11f4(%rip),%xmm1        # 56a0 <_sk_callback_sse41+0xfaa>
+  .byte  15,88,13,250,17,0,0                 // addps         0x11fa(%rip),%xmm1        # 56a0 <_sk_callback_sse41+0xfb0>
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -25079,13 +25069,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,231,17,0,0                  // addps         0x11e7(%rip),%xmm0        # 56b0 <_sk_callback_sse41+0xfba>
-  .byte  68,15,40,13,239,17,0,0              // movaps        0x11ef(%rip),%xmm9        # 56c0 <_sk_callback_sse41+0xfca>
+  .byte  15,88,5,237,17,0,0                  // addps         0x11ed(%rip),%xmm0        # 56b0 <_sk_callback_sse41+0xfc0>
+  .byte  68,15,40,13,245,17,0,0              // movaps        0x11f5(%rip),%xmm9        # 56c0 <_sk_callback_sse41+0xfd0>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  69,15,89,192                        // mulps         %xmm8,%xmm8
-  .byte  68,15,89,13,235,17,0,0              // mulps         0x11eb(%rip),%xmm9        # 56d0 <_sk_callback_sse41+0xfda>
-  .byte  68,15,88,13,243,17,0,0              // addps         0x11f3(%rip),%xmm9        # 56e0 <_sk_callback_sse41+0xfea>
+  .byte  68,15,89,13,241,17,0,0              // mulps         0x11f1(%rip),%xmm9        # 56d0 <_sk_callback_sse41+0xfe0>
+  .byte  68,15,88,13,249,17,0,0              // addps         0x11f9(%rip),%xmm9        # 56e0 <_sk_callback_sse41+0xff0>
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  68,15,17,136,128,0,0,0              // movups        %xmm9,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -25098,16 +25088,16 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,226,17,0,0                  // addps         0x11e2(%rip),%xmm0        # 56f0 <_sk_callback_sse41+0xffa>
-  .byte  68,15,40,13,234,17,0,0              // movaps        0x11ea(%rip),%xmm9        # 5700 <_sk_callback_sse41+0x100a>
+  .byte  15,88,5,232,17,0,0                  // addps         0x11e8(%rip),%xmm0        # 56f0 <_sk_callback_sse41+0x1000>
+  .byte  68,15,40,13,240,17,0,0              // movaps        0x11f0(%rip),%xmm9        # 5700 <_sk_callback_sse41+0x1010>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
-  .byte  68,15,40,5,238,17,0,0               // movaps        0x11ee(%rip),%xmm8        # 5710 <_sk_callback_sse41+0x101a>
+  .byte  68,15,40,5,244,17,0,0               // movaps        0x11f4(%rip),%xmm8        # 5710 <_sk_callback_sse41+0x1020>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,242,17,0,0               // addps         0x11f2(%rip),%xmm8        # 5720 <_sk_callback_sse41+0x102a>
+  .byte  68,15,88,5,248,17,0,0               // addps         0x11f8(%rip),%xmm8        # 5720 <_sk_callback_sse41+0x1030>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,246,17,0,0               // addps         0x11f6(%rip),%xmm8        # 5730 <_sk_callback_sse41+0x103a>
+  .byte  68,15,88,5,252,17,0,0               // addps         0x11fc(%rip),%xmm8        # 5730 <_sk_callback_sse41+0x1040>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,250,17,0,0               // addps         0x11fa(%rip),%xmm8        # 5740 <_sk_callback_sse41+0x104a>
+  .byte  68,15,88,5,0,18,0,0                 // addps         0x1200(%rip),%xmm8        # 5740 <_sk_callback_sse41+0x1050>
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -25117,17 +25107,17 @@
 FUNCTION(_sk_bicubic_p1x_sse41)
 _sk_bicubic_p1x_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,244,17,0,0               // movaps        0x11f4(%rip),%xmm8        # 5750 <_sk_callback_sse41+0x105a>
+  .byte  68,15,40,5,250,17,0,0               // movaps        0x11fa(%rip),%xmm8        # 5750 <_sk_callback_sse41+0x1060>
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,72,64                      // movups        0x40(%rax),%xmm9
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
-  .byte  68,15,40,21,240,17,0,0              // movaps        0x11f0(%rip),%xmm10        # 5760 <_sk_callback_sse41+0x106a>
+  .byte  68,15,40,21,246,17,0,0              // movaps        0x11f6(%rip),%xmm10        # 5760 <_sk_callback_sse41+0x1070>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,244,17,0,0              // addps         0x11f4(%rip),%xmm10        # 5770 <_sk_callback_sse41+0x107a>
+  .byte  68,15,88,21,250,17,0,0              // addps         0x11fa(%rip),%xmm10        # 5770 <_sk_callback_sse41+0x1080>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,240,17,0,0              // addps         0x11f0(%rip),%xmm10        # 5780 <_sk_callback_sse41+0x108a>
+  .byte  68,15,88,21,246,17,0,0              // addps         0x11f6(%rip),%xmm10        # 5780 <_sk_callback_sse41+0x1090>
   .byte  68,15,17,144,128,0,0,0              // movups        %xmm10,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -25139,11 +25129,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,227,17,0,0                  // addps         0x11e3(%rip),%xmm0        # 5790 <_sk_callback_sse41+0x109a>
+  .byte  15,88,5,233,17,0,0                  // addps         0x11e9(%rip),%xmm0        # 5790 <_sk_callback_sse41+0x10a0>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  69,15,89,201                        // mulps         %xmm9,%xmm9
-  .byte  68,15,89,5,227,17,0,0               // mulps         0x11e3(%rip),%xmm8        # 57a0 <_sk_callback_sse41+0x10aa>
-  .byte  68,15,88,5,235,17,0,0               // addps         0x11eb(%rip),%xmm8        # 57b0 <_sk_callback_sse41+0x10ba>
+  .byte  68,15,89,5,233,17,0,0               // mulps         0x11e9(%rip),%xmm8        # 57a0 <_sk_callback_sse41+0x10b0>
+  .byte  68,15,88,5,241,17,0,0               // addps         0x11f1(%rip),%xmm8        # 57b0 <_sk_callback_sse41+0x10c0>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -25156,13 +25146,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,217,17,0,0                 // addps         0x11d9(%rip),%xmm1        # 57c0 <_sk_callback_sse41+0x10ca>
-  .byte  68,15,40,13,225,17,0,0              // movaps        0x11e1(%rip),%xmm9        # 57d0 <_sk_callback_sse41+0x10da>
+  .byte  15,88,13,223,17,0,0                 // addps         0x11df(%rip),%xmm1        # 57c0 <_sk_callback_sse41+0x10d0>
+  .byte  68,15,40,13,231,17,0,0              // movaps        0x11e7(%rip),%xmm9        # 57d0 <_sk_callback_sse41+0x10e0>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  69,15,89,192                        // mulps         %xmm8,%xmm8
-  .byte  68,15,89,13,221,17,0,0              // mulps         0x11dd(%rip),%xmm9        # 57e0 <_sk_callback_sse41+0x10ea>
-  .byte  68,15,88,13,229,17,0,0              // addps         0x11e5(%rip),%xmm9        # 57f0 <_sk_callback_sse41+0x10fa>
+  .byte  68,15,89,13,227,17,0,0              // mulps         0x11e3(%rip),%xmm9        # 57e0 <_sk_callback_sse41+0x10f0>
+  .byte  68,15,88,13,235,17,0,0              // addps         0x11eb(%rip),%xmm9        # 57f0 <_sk_callback_sse41+0x1100>
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  68,15,17,136,160,0,0,0              // movups        %xmm9,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -25175,16 +25165,16 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,211,17,0,0                 // addps         0x11d3(%rip),%xmm1        # 5800 <_sk_callback_sse41+0x110a>
-  .byte  68,15,40,13,219,17,0,0              // movaps        0x11db(%rip),%xmm9        # 5810 <_sk_callback_sse41+0x111a>
+  .byte  15,88,13,217,17,0,0                 // addps         0x11d9(%rip),%xmm1        # 5800 <_sk_callback_sse41+0x1110>
+  .byte  68,15,40,13,225,17,0,0              // movaps        0x11e1(%rip),%xmm9        # 5810 <_sk_callback_sse41+0x1120>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
-  .byte  68,15,40,5,223,17,0,0               // movaps        0x11df(%rip),%xmm8        # 5820 <_sk_callback_sse41+0x112a>
+  .byte  68,15,40,5,229,17,0,0               // movaps        0x11e5(%rip),%xmm8        # 5820 <_sk_callback_sse41+0x1130>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,227,17,0,0               // addps         0x11e3(%rip),%xmm8        # 5830 <_sk_callback_sse41+0x113a>
+  .byte  68,15,88,5,233,17,0,0               // addps         0x11e9(%rip),%xmm8        # 5830 <_sk_callback_sse41+0x1140>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,231,17,0,0               // addps         0x11e7(%rip),%xmm8        # 5840 <_sk_callback_sse41+0x114a>
+  .byte  68,15,88,5,237,17,0,0               // addps         0x11ed(%rip),%xmm8        # 5840 <_sk_callback_sse41+0x1150>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,235,17,0,0               // addps         0x11eb(%rip),%xmm8        # 5850 <_sk_callback_sse41+0x115a>
+  .byte  68,15,88,5,241,17,0,0               // addps         0x11f1(%rip),%xmm8        # 5850 <_sk_callback_sse41+0x1160>
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -25194,17 +25184,17 @@
 FUNCTION(_sk_bicubic_p1y_sse41)
 _sk_bicubic_p1y_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,229,17,0,0               // movaps        0x11e5(%rip),%xmm8        # 5860 <_sk_callback_sse41+0x116a>
+  .byte  68,15,40,5,235,17,0,0               // movaps        0x11eb(%rip),%xmm8        # 5860 <_sk_callback_sse41+0x1170>
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,72,96                      // movups        0x60(%rax),%xmm9
   .byte  65,15,88,200                        // addps         %xmm8,%xmm1
-  .byte  68,15,40,21,224,17,0,0              // movaps        0x11e0(%rip),%xmm10        # 5870 <_sk_callback_sse41+0x117a>
+  .byte  68,15,40,21,230,17,0,0              // movaps        0x11e6(%rip),%xmm10        # 5870 <_sk_callback_sse41+0x1180>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,228,17,0,0              // addps         0x11e4(%rip),%xmm10        # 5880 <_sk_callback_sse41+0x118a>
+  .byte  68,15,88,21,234,17,0,0              // addps         0x11ea(%rip),%xmm10        # 5880 <_sk_callback_sse41+0x1190>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,224,17,0,0              // addps         0x11e0(%rip),%xmm10        # 5890 <_sk_callback_sse41+0x119a>
+  .byte  68,15,88,21,230,17,0,0              // addps         0x11e6(%rip),%xmm10        # 5890 <_sk_callback_sse41+0x11a0>
   .byte  68,15,17,144,160,0,0,0              // movups        %xmm10,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -25216,11 +25206,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,210,17,0,0                 // addps         0x11d2(%rip),%xmm1        # 58a0 <_sk_callback_sse41+0x11aa>
+  .byte  15,88,13,216,17,0,0                 // addps         0x11d8(%rip),%xmm1        # 58a0 <_sk_callback_sse41+0x11b0>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  69,15,89,201                        // mulps         %xmm9,%xmm9
-  .byte  68,15,89,5,210,17,0,0               // mulps         0x11d2(%rip),%xmm8        # 58b0 <_sk_callback_sse41+0x11ba>
-  .byte  68,15,88,5,218,17,0,0               // addps         0x11da(%rip),%xmm8        # 58c0 <_sk_callback_sse41+0x11ca>
+  .byte  68,15,89,5,216,17,0,0               // mulps         0x11d8(%rip),%xmm8        # 58b0 <_sk_callback_sse41+0x11c0>
+  .byte  68,15,88,5,224,17,0,0               // addps         0x11e0(%rip),%xmm8        # 58c0 <_sk_callback_sse41+0x11d0>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -25818,10 +25808,10 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a004cb8 <_sk_callback_sse41+0xa0005c2>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a004cb8 <_sk_callback_sse41+0xa0005c8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3004cc0 <_sk_callback_sse41+0x30005ca>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3004cc0 <_sk_callback_sse41+0x30005d0>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -25936,7 +25926,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a38dba <_sk_callback_sse41+0xffffffffe9a346c4>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a38dba <_sk_callback_sse41+0xffffffffe9a346ca>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  81                                  // push          %rcx
   .byte  140,242                             // mov           %?,%edx
@@ -26032,7 +26022,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a38e8a <_sk_callback_sse41+0xffffffffe9a34794>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a38e8a <_sk_callback_sse41+0xffffffffe9a3479a>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  81                                  // push          %rcx
   .byte  140,242                             // mov           %?,%edx
@@ -26128,7 +26118,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a38f5a <_sk_callback_sse41+0xffffffffe9a34864>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a38f5a <_sk_callback_sse41+0xffffffffe9a3486a>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  81                                  // push          %rcx
   .byte  140,242                             // mov           %?,%edx
@@ -26224,7 +26214,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3902a <_sk_callback_sse41+0xffffffffe9a34934>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3902a <_sk_callback_sse41+0xffffffffe9a3493a>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  81                                  // push          %rcx
   .byte  140,242                             // mov           %?,%edx
@@ -26382,7 +26372,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3005210 <_sk_callback_sse41+0x3000b1a>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3005210 <_sk_callback_sse41+0x3000b20>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -26624,7 +26614,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3005460 <_sk_callback_sse41+0x3000d6a>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3005460 <_sk_callback_sse41+0x3000d70>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -26651,7 +26641,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 30054a0 <_sk_callback_sse41+0x3000daa>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 30054a0 <_sk_callback_sse41+0x3000db0>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -26934,7 +26924,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63e585 <_sk_callback_sse41+0x3d639e8f>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63e585 <_sk_callback_sse41+0x3d639e95>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -26960,7 +26950,7 @@
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63e5c5 <_sk_callback_sse41+0x3d639ecf>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63e5c5 <_sk_callback_sse41+0x3d639ed5>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
@@ -27044,7 +27034,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63e695 <_sk_callback_sse41+0x3d639f9f>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63e695 <_sk_callback_sse41+0x3d639fa5>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -27070,7 +27060,7 @@
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63e6d5 <_sk_callback_sse41+0x3d639fdf>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63e6d5 <_sk_callback_sse41+0x3d639fe5>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
@@ -27081,11 +27071,11 @@
   .byte  63                                  // (bad)
   .byte  114,28                              // jb            58ce <.literal16+0x10fe>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         58d2 <_sk_callback_sse41+0x11dc>
+  .byte  62,114,28                           // jb,pt         58d2 <_sk_callback_sse41+0x11e2>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         58d6 <_sk_callback_sse41+0x11e0>
+  .byte  62,114,28                           // jb,pt         58d6 <_sk_callback_sse41+0x11e6>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         58da <_sk_callback_sse41+0x11e4>
+  .byte  62,114,28                           // jb,pt         58da <_sk_callback_sse41+0x11ea>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -27155,7 +27145,7 @@
   .byte  102,15,110,199                      // movd          %edi,%xmm0
   .byte  102,15,112,192,0                    // pshufd        $0x0,%xmm0,%xmm0
   .byte  15,91,200                           // cvtdq2ps      %xmm0,%xmm1
-  .byte  15,40,21,196,75,0,0                 // movaps        0x4bc4(%rip),%xmm2        # 4c40 <_sk_callback_sse2+0xdb>
+  .byte  15,40,21,196,75,0,0                 // movaps        0x4bc4(%rip),%xmm2        # 4c40 <_sk_callback_sse2+0xe1>
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  15,16,2                             // movups        (%rdx),%xmm0
   .byte  15,88,193                           // addps         %xmm1,%xmm0
@@ -27164,7 +27154,7 @@
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,21,179,75,0,0                 // movaps        0x4bb3(%rip),%xmm2        # 4c50 <_sk_callback_sse2+0xeb>
+  .byte  15,40,21,179,75,0,0                 // movaps        0x4bb3(%rip),%xmm2        # 4c50 <_sk_callback_sse2+0xf1>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  15,87,237                           // xorps         %xmm5,%xmm5
@@ -27179,22 +27169,20 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  102,68,15,110,199                   // movd          %edi,%xmm8
   .byte  102,69,15,112,192,0                 // pshufd        $0x0,%xmm8,%xmm8
-  .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,16,10                         // movups        (%rdx),%xmm9
-  .byte  69,15,88,200                        // addps         %xmm8,%xmm9
-  .byte  243,69,15,91,201                    // cvttps2dq     %xmm9,%xmm9
+  .byte  243,68,15,111,74,32                 // movdqu        0x20(%rdx),%xmm9
+  .byte  102,69,15,254,200                   // paddd         %xmm8,%xmm9
   .byte  72,139,8                            // mov           (%rax),%rcx
   .byte  102,68,15,110,1                     // movd          (%rcx),%xmm8
   .byte  102,69,15,112,192,0                 // pshufd        $0x0,%xmm8,%xmm8
   .byte  102,69,15,239,193                   // pxor          %xmm9,%xmm8
-  .byte  102,68,15,111,21,120,75,0,0         // movdqa        0x4b78(%rip),%xmm10        # 4c60 <_sk_callback_sse2+0xfb>
+  .byte  102,68,15,111,21,126,75,0,0         // movdqa        0x4b7e(%rip),%xmm10        # 4c60 <_sk_callback_sse2+0x101>
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
   .byte  102,69,15,219,218                   // pand          %xmm10,%xmm11
   .byte  102,65,15,114,243,5                 // pslld         $0x5,%xmm11
   .byte  102,69,15,219,209                   // pand          %xmm9,%xmm10
   .byte  102,65,15,114,242,4                 // pslld         $0x4,%xmm10
-  .byte  102,68,15,111,37,100,75,0,0         // movdqa        0x4b64(%rip),%xmm12        # 4c70 <_sk_callback_sse2+0x10b>
-  .byte  102,68,15,111,45,107,75,0,0         // movdqa        0x4b6b(%rip),%xmm13        # 4c80 <_sk_callback_sse2+0x11b>
+  .byte  102,68,15,111,37,106,75,0,0         // movdqa        0x4b6a(%rip),%xmm12        # 4c70 <_sk_callback_sse2+0x111>
+  .byte  102,68,15,111,45,113,75,0,0         // movdqa        0x4b71(%rip),%xmm13        # 4c80 <_sk_callback_sse2+0x121>
   .byte  102,69,15,111,240                   // movdqa        %xmm8,%xmm14
   .byte  102,69,15,219,245                   // pand          %xmm13,%xmm14
   .byte  102,65,15,114,246,2                 // pslld         $0x2,%xmm14
@@ -27206,12 +27194,12 @@
   .byte  102,65,15,114,209,2                 // psrld         $0x2,%xmm9
   .byte  102,69,15,235,234                   // por           %xmm10,%xmm13
   .byte  102,69,15,235,233                   // por           %xmm9,%xmm13
-  .byte  102,69,15,235,243                   // por           %xmm11,%xmm14
-  .byte  102,69,15,235,245                   // por           %xmm13,%xmm14
-  .byte  102,69,15,235,240                   // por           %xmm8,%xmm14
-  .byte  69,15,91,198                        // cvtdq2ps      %xmm14,%xmm8
-  .byte  68,15,89,5,38,75,0,0                // mulps         0x4b26(%rip),%xmm8        # 4c90 <_sk_callback_sse2+0x12b>
-  .byte  68,15,88,5,46,75,0,0                // addps         0x4b2e(%rip),%xmm8        # 4ca0 <_sk_callback_sse2+0x13b>
+  .byte  102,69,15,235,235                   // por           %xmm11,%xmm13
+  .byte  102,69,15,235,198                   // por           %xmm14,%xmm8
+  .byte  102,69,15,235,197                   // por           %xmm13,%xmm8
+  .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
+  .byte  68,15,89,5,44,75,0,0                // mulps         0x4b2c(%rip),%xmm8        # 4c90 <_sk_callback_sse2+0x131>
+  .byte  68,15,88,5,52,75,0,0                // addps         0x4b34(%rip),%xmm8        # 4ca0 <_sk_callback_sse2+0x141>
   .byte  243,68,15,16,80,8                   // movss         0x8(%rax),%xmm10
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
@@ -27288,7 +27276,7 @@
 FUNCTION(_sk_srcatop_sse2)
 _sk_srcatop_sse2:
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
-  .byte  68,15,40,5,135,74,0,0               // movaps        0x4a87(%rip),%xmm8        # 4cb0 <_sk_callback_sse2+0x14b>
+  .byte  68,15,40,5,141,74,0,0               // movaps        0x4a8d(%rip),%xmm8        # 4cb0 <_sk_callback_sse2+0x151>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -27313,7 +27301,7 @@
 _sk_dstatop_sse2:
   .byte  68,15,40,195                        // movaps        %xmm3,%xmm8
   .byte  68,15,89,196                        // mulps         %xmm4,%xmm8
-  .byte  68,15,40,13,74,74,0,0               // movaps        0x4a4a(%rip),%xmm9        # 4cc0 <_sk_callback_sse2+0x15b>
+  .byte  68,15,40,13,80,74,0,0               // movaps        0x4a50(%rip),%xmm9        # 4cc0 <_sk_callback_sse2+0x161>
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
@@ -27360,7 +27348,7 @@
 .globl _sk_srcout_sse2
 FUNCTION(_sk_srcout_sse2)
 _sk_srcout_sse2:
-  .byte  68,15,40,5,238,73,0,0               // movaps        0x49ee(%rip),%xmm8        # 4cd0 <_sk_callback_sse2+0x16b>
+  .byte  68,15,40,5,244,73,0,0               // movaps        0x49f4(%rip),%xmm8        # 4cd0 <_sk_callback_sse2+0x171>
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
@@ -27373,7 +27361,7 @@
 .globl _sk_dstout_sse2
 FUNCTION(_sk_dstout_sse2)
 _sk_dstout_sse2:
-  .byte  68,15,40,5,222,73,0,0               // movaps        0x49de(%rip),%xmm8        # 4ce0 <_sk_callback_sse2+0x17b>
+  .byte  68,15,40,5,228,73,0,0               // movaps        0x49e4(%rip),%xmm8        # 4ce0 <_sk_callback_sse2+0x181>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
@@ -27390,7 +27378,7 @@
 .globl _sk_srcover_sse2
 FUNCTION(_sk_srcover_sse2)
 _sk_srcover_sse2:
-  .byte  68,15,40,5,193,73,0,0               // movaps        0x49c1(%rip),%xmm8        # 4cf0 <_sk_callback_sse2+0x18b>
+  .byte  68,15,40,5,199,73,0,0               // movaps        0x49c7(%rip),%xmm8        # 4cf0 <_sk_callback_sse2+0x191>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -27410,7 +27398,7 @@
 .globl _sk_dstover_sse2
 FUNCTION(_sk_dstover_sse2)
 _sk_dstover_sse2:
-  .byte  68,15,40,5,149,73,0,0               // movaps        0x4995(%rip),%xmm8        # 4d00 <_sk_callback_sse2+0x19b>
+  .byte  68,15,40,5,155,73,0,0               // movaps        0x499b(%rip),%xmm8        # 4d00 <_sk_callback_sse2+0x1a1>
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -27438,7 +27426,7 @@
 .globl _sk_multiply_sse2
 FUNCTION(_sk_multiply_sse2)
 _sk_multiply_sse2:
-  .byte  68,15,40,5,105,73,0,0               // movaps        0x4969(%rip),%xmm8        # 4d10 <_sk_callback_sse2+0x1ab>
+  .byte  68,15,40,5,111,73,0,0               // movaps        0x496f(%rip),%xmm8        # 4d10 <_sk_callback_sse2+0x1b1>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
@@ -27514,7 +27502,7 @@
 FUNCTION(_sk_xor__sse2)
 _sk_xor__sse2:
   .byte  68,15,40,195                        // movaps        %xmm3,%xmm8
-  .byte  15,40,29,154,72,0,0                 // movaps        0x489a(%rip),%xmm3        # 4d20 <_sk_callback_sse2+0x1bb>
+  .byte  15,40,29,160,72,0,0                 // movaps        0x48a0(%rip),%xmm3        # 4d20 <_sk_callback_sse2+0x1c1>
   .byte  68,15,40,203                        // movaps        %xmm3,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
@@ -27562,7 +27550,7 @@
   .byte  68,15,89,206                        // mulps         %xmm6,%xmm9
   .byte  65,15,95,209                        // maxps         %xmm9,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,5,72,0,0                   // movaps        0x4805(%rip),%xmm2        # 4d30 <_sk_callback_sse2+0x1cb>
+  .byte  15,40,21,11,72,0,0                  // movaps        0x480b(%rip),%xmm2        # 4d30 <_sk_callback_sse2+0x1d1>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -27596,7 +27584,7 @@
   .byte  68,15,89,206                        // mulps         %xmm6,%xmm9
   .byte  65,15,93,209                        // minps         %xmm9,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,170,71,0,0                 // movaps        0x47aa(%rip),%xmm2        # 4d40 <_sk_callback_sse2+0x1db>
+  .byte  15,40,21,176,71,0,0                 // movaps        0x47b0(%rip),%xmm2        # 4d40 <_sk_callback_sse2+0x1e1>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -27633,7 +27621,7 @@
   .byte  65,15,93,209                        // minps         %xmm9,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,68,71,0,0                  // movaps        0x4744(%rip),%xmm2        # 4d50 <_sk_callback_sse2+0x1eb>
+  .byte  15,40,21,74,71,0,0                  // movaps        0x474a(%rip),%xmm2        # 4d50 <_sk_callback_sse2+0x1f1>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -27660,7 +27648,7 @@
   .byte  15,89,214                           // mulps         %xmm6,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  68,15,92,202                        // subps         %xmm2,%xmm9
-  .byte  15,40,13,5,71,0,0                   // movaps        0x4705(%rip),%xmm1        # 4d60 <_sk_callback_sse2+0x1fb>
+  .byte  15,40,13,11,71,0,0                  // movaps        0x470b(%rip),%xmm1        # 4d60 <_sk_callback_sse2+0x201>
   .byte  15,92,203                           // subps         %xmm3,%xmm1
   .byte  15,89,207                           // mulps         %xmm7,%xmm1
   .byte  15,88,217                           // addps         %xmm1,%xmm3
@@ -27674,7 +27662,7 @@
 FUNCTION(_sk_colorburn_sse2)
 _sk_colorburn_sse2:
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,40,21,244,70,0,0              // movaps        0x46f4(%rip),%xmm10        # 4d70 <_sk_callback_sse2+0x20b>
+  .byte  68,15,40,21,250,70,0,0              // movaps        0x46fa(%rip),%xmm10        # 4d70 <_sk_callback_sse2+0x211>
   .byte  69,15,40,202                        // movaps        %xmm10,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  69,15,40,217                        // movaps        %xmm9,%xmm11
@@ -27768,7 +27756,7 @@
 FUNCTION(_sk_colordodge_sse2)
 _sk_colordodge_sse2:
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
-  .byte  68,15,40,21,170,69,0,0              // movaps        0x45aa(%rip),%xmm10        # 4d80 <_sk_callback_sse2+0x21b>
+  .byte  68,15,40,21,176,69,0,0              // movaps        0x45b0(%rip),%xmm10        # 4d80 <_sk_callback_sse2+0x221>
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
   .byte  68,15,92,223                        // subps         %xmm7,%xmm11
   .byte  69,15,40,227                        // movaps        %xmm11,%xmm12
@@ -27862,7 +27850,7 @@
   .byte  15,41,116,36,232                    // movaps        %xmm6,-0x18(%rsp)
   .byte  15,40,245                           // movaps        %xmm5,%xmm6
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
-  .byte  68,15,40,29,95,68,0,0               // movaps        0x445f(%rip),%xmm11        # 4d90 <_sk_callback_sse2+0x22b>
+  .byte  68,15,40,29,101,68,0,0              // movaps        0x4465(%rip),%xmm11        # 4d90 <_sk_callback_sse2+0x231>
   .byte  69,15,40,211                        // movaps        %xmm11,%xmm10
   .byte  68,15,92,215                        // subps         %xmm7,%xmm10
   .byte  69,15,40,194                        // movaps        %xmm10,%xmm8
@@ -27950,7 +27938,7 @@
 _sk_overlay_sse2:
   .byte  68,15,40,193                        // movaps        %xmm1,%xmm8
   .byte  68,15,40,232                        // movaps        %xmm0,%xmm13
-  .byte  68,15,40,13,45,67,0,0               // movaps        0x432d(%rip),%xmm9        # 4da0 <_sk_callback_sse2+0x23b>
+  .byte  68,15,40,13,51,67,0,0               // movaps        0x4333(%rip),%xmm9        # 4da0 <_sk_callback_sse2+0x241>
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
   .byte  68,15,92,215                        // subps         %xmm7,%xmm10
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
@@ -28041,7 +28029,7 @@
   .byte  68,15,40,213                        // movaps        %xmm5,%xmm10
   .byte  68,15,94,215                        // divps         %xmm7,%xmm10
   .byte  69,15,84,212                        // andps         %xmm12,%xmm10
-  .byte  68,15,40,13,234,65,0,0              // movaps        0x41ea(%rip),%xmm9        # 4db0 <_sk_callback_sse2+0x24b>
+  .byte  68,15,40,13,240,65,0,0              // movaps        0x41f0(%rip),%xmm9        # 4db0 <_sk_callback_sse2+0x251>
   .byte  69,15,40,249                        // movaps        %xmm9,%xmm15
   .byte  69,15,92,250                        // subps         %xmm10,%xmm15
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
@@ -28054,10 +28042,10 @@
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
   .byte  65,15,88,194                        // addps         %xmm10,%xmm0
-  .byte  68,15,40,53,196,65,0,0              // movaps        0x41c4(%rip),%xmm14        # 4dc0 <_sk_callback_sse2+0x25b>
+  .byte  68,15,40,53,202,65,0,0              // movaps        0x41ca(%rip),%xmm14        # 4dc0 <_sk_callback_sse2+0x261>
   .byte  69,15,88,222                        // addps         %xmm14,%xmm11
   .byte  68,15,89,216                        // mulps         %xmm0,%xmm11
-  .byte  68,15,40,21,196,65,0,0              // movaps        0x41c4(%rip),%xmm10        # 4dd0 <_sk_callback_sse2+0x26b>
+  .byte  68,15,40,21,202,65,0,0              // movaps        0x41ca(%rip),%xmm10        # 4dd0 <_sk_callback_sse2+0x271>
   .byte  69,15,89,234                        // mulps         %xmm10,%xmm13
   .byte  69,15,88,235                        // addps         %xmm11,%xmm13
   .byte  15,88,228                           // addps         %xmm4,%xmm4
@@ -28202,7 +28190,7 @@
   .byte  68,15,40,209                        // movaps        %xmm1,%xmm10
   .byte  68,15,40,225                        // movaps        %xmm1,%xmm12
   .byte  68,15,89,211                        // mulps         %xmm3,%xmm10
-  .byte  68,15,40,5,7,64,0,0                 // movaps        0x4007(%rip),%xmm8        # 4e10 <_sk_callback_sse2+0x2ab>
+  .byte  68,15,40,5,13,64,0,0                // movaps        0x400d(%rip),%xmm8        # 4e10 <_sk_callback_sse2+0x2b1>
   .byte  69,15,40,216                        // movaps        %xmm8,%xmm11
   .byte  15,40,207                           // movaps        %xmm7,%xmm1
   .byte  68,15,92,217                        // subps         %xmm1,%xmm11
@@ -28248,12 +28236,12 @@
   .byte  69,15,84,206                        // andps         %xmm14,%xmm9
   .byte  69,15,84,214                        // andps         %xmm14,%xmm10
   .byte  65,15,84,214                        // andps         %xmm14,%xmm2
-  .byte  68,15,40,61,27,63,0,0               // movaps        0x3f1b(%rip),%xmm15        # 4de0 <_sk_callback_sse2+0x27b>
+  .byte  68,15,40,61,33,63,0,0               // movaps        0x3f21(%rip),%xmm15        # 4de0 <_sk_callback_sse2+0x281>
   .byte  65,15,89,231                        // mulps         %xmm15,%xmm4
-  .byte  15,40,5,32,63,0,0                   // movaps        0x3f20(%rip),%xmm0        # 4df0 <_sk_callback_sse2+0x28b>
+  .byte  15,40,5,38,63,0,0                   // movaps        0x3f26(%rip),%xmm0        # 4df0 <_sk_callback_sse2+0x291>
   .byte  15,89,240                           // mulps         %xmm0,%xmm6
   .byte  15,88,244                           // addps         %xmm4,%xmm6
-  .byte  68,15,40,53,34,63,0,0               // movaps        0x3f22(%rip),%xmm14        # 4e00 <_sk_callback_sse2+0x29b>
+  .byte  68,15,40,53,40,63,0,0               // movaps        0x3f28(%rip),%xmm14        # 4e00 <_sk_callback_sse2+0x2a1>
   .byte  68,15,40,239                        // movaps        %xmm7,%xmm13
   .byte  69,15,89,238                        // mulps         %xmm14,%xmm13
   .byte  68,15,88,238                        // addps         %xmm6,%xmm13
@@ -28430,14 +28418,14 @@
   .byte  68,15,84,211                        // andps         %xmm3,%xmm10
   .byte  68,15,84,203                        // andps         %xmm3,%xmm9
   .byte  15,84,195                           // andps         %xmm3,%xmm0
-  .byte  68,15,40,5,183,60,0,0               // movaps        0x3cb7(%rip),%xmm8        # 4e20 <_sk_callback_sse2+0x2bb>
+  .byte  68,15,40,5,189,60,0,0               // movaps        0x3cbd(%rip),%xmm8        # 4e20 <_sk_callback_sse2+0x2c1>
   .byte  15,40,214                           // movaps        %xmm6,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
-  .byte  15,40,13,185,60,0,0                 // movaps        0x3cb9(%rip),%xmm1        # 4e30 <_sk_callback_sse2+0x2cb>
+  .byte  15,40,13,191,60,0,0                 // movaps        0x3cbf(%rip),%xmm1        # 4e30 <_sk_callback_sse2+0x2d1>
   .byte  15,40,221                           // movaps        %xmm5,%xmm3
   .byte  15,89,217                           // mulps         %xmm1,%xmm3
   .byte  15,88,218                           // addps         %xmm2,%xmm3
-  .byte  68,15,40,37,184,60,0,0              // movaps        0x3cb8(%rip),%xmm12        # 4e40 <_sk_callback_sse2+0x2db>
+  .byte  68,15,40,37,190,60,0,0              // movaps        0x3cbe(%rip),%xmm12        # 4e40 <_sk_callback_sse2+0x2e1>
   .byte  69,15,89,236                        // mulps         %xmm12,%xmm13
   .byte  68,15,88,235                        // addps         %xmm3,%xmm13
   .byte  65,15,40,210                        // movaps        %xmm10,%xmm2
@@ -28482,7 +28470,7 @@
   .byte  15,40,223                           // movaps        %xmm7,%xmm3
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
   .byte  15,89,221                           // mulps         %xmm5,%xmm3
-  .byte  68,15,40,5,29,60,0,0                // movaps        0x3c1d(%rip),%xmm8        # 4e50 <_sk_callback_sse2+0x2eb>
+  .byte  68,15,40,5,35,60,0,0                // movaps        0x3c23(%rip),%xmm8        # 4e50 <_sk_callback_sse2+0x2f1>
   .byte  65,15,40,224                        // movaps        %xmm8,%xmm4
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  15,88,253                           // addps         %xmm5,%xmm7
@@ -28583,14 +28571,14 @@
   .byte  68,15,40,213                        // movaps        %xmm5,%xmm10
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
   .byte  65,15,40,208                        // movaps        %xmm8,%xmm2
-  .byte  68,15,40,45,187,58,0,0              // movaps        0x3abb(%rip),%xmm13        # 4e60 <_sk_callback_sse2+0x2fb>
+  .byte  68,15,40,45,193,58,0,0              // movaps        0x3ac1(%rip),%xmm13        # 4e60 <_sk_callback_sse2+0x301>
   .byte  68,15,40,198                        // movaps        %xmm6,%xmm8
   .byte  69,15,89,197                        // mulps         %xmm13,%xmm8
-  .byte  68,15,40,53,187,58,0,0              // movaps        0x3abb(%rip),%xmm14        # 4e70 <_sk_callback_sse2+0x30b>
+  .byte  68,15,40,53,193,58,0,0              // movaps        0x3ac1(%rip),%xmm14        # 4e70 <_sk_callback_sse2+0x311>
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
   .byte  65,15,89,198                        // mulps         %xmm14,%xmm0
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
-  .byte  68,15,40,29,183,58,0,0              // movaps        0x3ab7(%rip),%xmm11        # 4e80 <_sk_callback_sse2+0x31b>
+  .byte  68,15,40,29,189,58,0,0              // movaps        0x3abd(%rip),%xmm11        # 4e80 <_sk_callback_sse2+0x321>
   .byte  69,15,89,227                        // mulps         %xmm11,%xmm12
   .byte  68,15,88,224                        // addps         %xmm0,%xmm12
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
@@ -28598,7 +28586,7 @@
   .byte  69,15,40,250                        // movaps        %xmm10,%xmm15
   .byte  69,15,89,254                        // mulps         %xmm14,%xmm15
   .byte  68,15,88,248                        // addps         %xmm0,%xmm15
-  .byte  68,15,40,5,163,58,0,0               // movaps        0x3aa3(%rip),%xmm8        # 4e90 <_sk_callback_sse2+0x32b>
+  .byte  68,15,40,5,169,58,0,0               // movaps        0x3aa9(%rip),%xmm8        # 4e90 <_sk_callback_sse2+0x331>
   .byte  65,15,40,224                        // movaps        %xmm8,%xmm4
   .byte  15,92,226                           // subps         %xmm2,%xmm4
   .byte  15,89,252                           // mulps         %xmm4,%xmm7
@@ -28734,15 +28722,15 @@
   .byte  68,15,40,205                        // movaps        %xmm5,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
   .byte  15,89,222                           // mulps         %xmm6,%xmm3
-  .byte  68,15,40,37,186,56,0,0              // movaps        0x38ba(%rip),%xmm12        # 4ea0 <_sk_callback_sse2+0x33b>
+  .byte  68,15,40,37,192,56,0,0              // movaps        0x38c0(%rip),%xmm12        # 4ea0 <_sk_callback_sse2+0x341>
   .byte  68,15,40,199                        // movaps        %xmm7,%xmm8
   .byte  69,15,89,196                        // mulps         %xmm12,%xmm8
-  .byte  68,15,40,45,186,56,0,0              // movaps        0x38ba(%rip),%xmm13        # 4eb0 <_sk_callback_sse2+0x34b>
+  .byte  68,15,40,45,192,56,0,0              // movaps        0x38c0(%rip),%xmm13        # 4eb0 <_sk_callback_sse2+0x351>
   .byte  68,15,40,241                        // movaps        %xmm1,%xmm14
   .byte  69,15,89,245                        // mulps         %xmm13,%xmm14
   .byte  69,15,88,240                        // addps         %xmm8,%xmm14
-  .byte  68,15,40,29,182,56,0,0              // movaps        0x38b6(%rip),%xmm11        # 4ec0 <_sk_callback_sse2+0x35b>
-  .byte  68,15,40,5,190,56,0,0               // movaps        0x38be(%rip),%xmm8        # 4ed0 <_sk_callback_sse2+0x36b>
+  .byte  68,15,40,29,188,56,0,0              // movaps        0x38bc(%rip),%xmm11        # 4ec0 <_sk_callback_sse2+0x361>
+  .byte  68,15,40,5,196,56,0,0               // movaps        0x38c4(%rip),%xmm8        # 4ed0 <_sk_callback_sse2+0x371>
   .byte  69,15,40,248                        // movaps        %xmm8,%xmm15
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  68,15,92,248                        // subps         %xmm0,%xmm15
@@ -28887,7 +28875,7 @@
 .globl _sk_clamp_1_sse2
 FUNCTION(_sk_clamp_1_sse2)
 _sk_clamp_1_sse2:
-  .byte  68,15,40,5,199,54,0,0               // movaps        0x36c7(%rip),%xmm8        # 4ee0 <_sk_callback_sse2+0x37b>
+  .byte  68,15,40,5,205,54,0,0               // movaps        0x36cd(%rip),%xmm8        # 4ee0 <_sk_callback_sse2+0x381>
   .byte  65,15,93,192                        // minps         %xmm8,%xmm0
   .byte  65,15,93,200                        // minps         %xmm8,%xmm1
   .byte  65,15,93,208                        // minps         %xmm8,%xmm2
@@ -28899,7 +28887,7 @@
 .globl _sk_clamp_a_sse2
 FUNCTION(_sk_clamp_a_sse2)
 _sk_clamp_a_sse2:
-  .byte  15,93,29,188,54,0,0                 // minps         0x36bc(%rip),%xmm3        # 4ef0 <_sk_callback_sse2+0x38b>
+  .byte  15,93,29,194,54,0,0                 // minps         0x36c2(%rip),%xmm3        # 4ef0 <_sk_callback_sse2+0x391>
   .byte  15,93,195                           // minps         %xmm3,%xmm0
   .byte  15,93,203                           // minps         %xmm3,%xmm1
   .byte  15,93,211                           // minps         %xmm3,%xmm2
@@ -28986,7 +28974,7 @@
 FUNCTION(_sk_unpremul_sse2)
 _sk_unpremul_sse2:
   .byte  69,15,87,192                        // xorps         %xmm8,%xmm8
-  .byte  68,15,40,13,39,54,0,0               // movaps        0x3627(%rip),%xmm9        # 4f00 <_sk_callback_sse2+0x39b>
+  .byte  68,15,40,13,45,54,0,0               // movaps        0x362d(%rip),%xmm9        # 4f00 <_sk_callback_sse2+0x3a1>
   .byte  68,15,94,203                        // divps         %xmm3,%xmm9
   .byte  68,15,194,195,4                     // cmpneqps      %xmm3,%xmm8
   .byte  69,15,84,193                        // andps         %xmm9,%xmm8
@@ -29000,20 +28988,20 @@
 .globl _sk_from_srgb_sse2
 FUNCTION(_sk_from_srgb_sse2)
 _sk_from_srgb_sse2:
-  .byte  68,15,40,5,18,54,0,0                // movaps        0x3612(%rip),%xmm8        # 4f10 <_sk_callback_sse2+0x3ab>
+  .byte  68,15,40,5,24,54,0,0                // movaps        0x3618(%rip),%xmm8        # 4f10 <_sk_callback_sse2+0x3b1>
   .byte  68,15,40,232                        // movaps        %xmm0,%xmm13
   .byte  69,15,89,232                        // mulps         %xmm8,%xmm13
   .byte  68,15,40,216                        // movaps        %xmm0,%xmm11
   .byte  69,15,89,219                        // mulps         %xmm11,%xmm11
-  .byte  68,15,40,13,10,54,0,0               // movaps        0x360a(%rip),%xmm9        # 4f20 <_sk_callback_sse2+0x3bb>
+  .byte  68,15,40,13,16,54,0,0               // movaps        0x3610(%rip),%xmm9        # 4f20 <_sk_callback_sse2+0x3c1>
   .byte  68,15,40,240                        // movaps        %xmm0,%xmm14
   .byte  69,15,89,241                        // mulps         %xmm9,%xmm14
-  .byte  68,15,40,21,10,54,0,0               // movaps        0x360a(%rip),%xmm10        # 4f30 <_sk_callback_sse2+0x3cb>
+  .byte  68,15,40,21,16,54,0,0               // movaps        0x3610(%rip),%xmm10        # 4f30 <_sk_callback_sse2+0x3d1>
   .byte  69,15,88,242                        // addps         %xmm10,%xmm14
   .byte  69,15,89,243                        // mulps         %xmm11,%xmm14
-  .byte  68,15,40,29,10,54,0,0               // movaps        0x360a(%rip),%xmm11        # 4f40 <_sk_callback_sse2+0x3db>
+  .byte  68,15,40,29,16,54,0,0               // movaps        0x3610(%rip),%xmm11        # 4f40 <_sk_callback_sse2+0x3e1>
   .byte  69,15,88,243                        // addps         %xmm11,%xmm14
-  .byte  68,15,40,37,14,54,0,0               // movaps        0x360e(%rip),%xmm12        # 4f50 <_sk_callback_sse2+0x3eb>
+  .byte  68,15,40,37,20,54,0,0               // movaps        0x3614(%rip),%xmm12        # 4f50 <_sk_callback_sse2+0x3f1>
   .byte  65,15,194,196,1                     // cmpltps       %xmm12,%xmm0
   .byte  68,15,84,232                        // andps         %xmm0,%xmm13
   .byte  65,15,85,198                        // andnps        %xmm14,%xmm0
@@ -29050,22 +29038,22 @@
 FUNCTION(_sk_to_srgb_sse2)
 _sk_to_srgb_sse2:
   .byte  68,15,82,232                        // rsqrtps       %xmm0,%xmm13
-  .byte  68,15,40,5,155,53,0,0               // movaps        0x359b(%rip),%xmm8        # 4f60 <_sk_callback_sse2+0x3fb>
+  .byte  68,15,40,5,161,53,0,0               // movaps        0x35a1(%rip),%xmm8        # 4f60 <_sk_callback_sse2+0x401>
   .byte  68,15,40,240                        // movaps        %xmm0,%xmm14
   .byte  69,15,89,240                        // mulps         %xmm8,%xmm14
-  .byte  68,15,40,13,155,53,0,0              // movaps        0x359b(%rip),%xmm9        # 4f70 <_sk_callback_sse2+0x40b>
+  .byte  68,15,40,13,161,53,0,0              // movaps        0x35a1(%rip),%xmm9        # 4f70 <_sk_callback_sse2+0x411>
   .byte  69,15,40,253                        // movaps        %xmm13,%xmm15
   .byte  69,15,89,249                        // mulps         %xmm9,%xmm15
-  .byte  68,15,40,21,155,53,0,0              // movaps        0x359b(%rip),%xmm10        # 4f80 <_sk_callback_sse2+0x41b>
+  .byte  68,15,40,21,161,53,0,0              // movaps        0x35a1(%rip),%xmm10        # 4f80 <_sk_callback_sse2+0x421>
   .byte  69,15,88,250                        // addps         %xmm10,%xmm15
   .byte  69,15,89,253                        // mulps         %xmm13,%xmm15
-  .byte  68,15,40,29,155,53,0,0              // movaps        0x359b(%rip),%xmm11        # 4f90 <_sk_callback_sse2+0x42b>
+  .byte  68,15,40,29,161,53,0,0              // movaps        0x35a1(%rip),%xmm11        # 4f90 <_sk_callback_sse2+0x431>
   .byte  69,15,88,251                        // addps         %xmm11,%xmm15
-  .byte  68,15,40,37,159,53,0,0              // movaps        0x359f(%rip),%xmm12        # 4fa0 <_sk_callback_sse2+0x43b>
+  .byte  68,15,40,37,165,53,0,0              // movaps        0x35a5(%rip),%xmm12        # 4fa0 <_sk_callback_sse2+0x441>
   .byte  69,15,88,236                        // addps         %xmm12,%xmm13
   .byte  69,15,83,237                        // rcpps         %xmm13,%xmm13
   .byte  69,15,89,239                        // mulps         %xmm15,%xmm13
-  .byte  68,15,40,61,155,53,0,0              // movaps        0x359b(%rip),%xmm15        # 4fb0 <_sk_callback_sse2+0x44b>
+  .byte  68,15,40,61,161,53,0,0              // movaps        0x35a1(%rip),%xmm15        # 4fb0 <_sk_callback_sse2+0x451>
   .byte  65,15,194,199,1                     // cmpltps       %xmm15,%xmm0
   .byte  68,15,84,240                        // andps         %xmm0,%xmm14
   .byte  65,15,85,197                        // andnps        %xmm13,%xmm0
@@ -29115,7 +29103,7 @@
   .byte  68,15,93,218                        // minps         %xmm2,%xmm11
   .byte  65,15,40,202                        // movaps        %xmm10,%xmm1
   .byte  65,15,92,203                        // subps         %xmm11,%xmm1
-  .byte  68,15,40,45,244,52,0,0              // movaps        0x34f4(%rip),%xmm13        # 4fc0 <_sk_callback_sse2+0x45b>
+  .byte  68,15,40,45,250,52,0,0              // movaps        0x34fa(%rip),%xmm13        # 4fc0 <_sk_callback_sse2+0x461>
   .byte  68,15,94,233                        // divps         %xmm1,%xmm13
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  65,15,194,192,0                     // cmpeqps       %xmm8,%xmm0
@@ -29124,30 +29112,30 @@
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,40,241                        // movaps        %xmm9,%xmm14
   .byte  68,15,194,242,1                     // cmpltps       %xmm2,%xmm14
-  .byte  68,15,84,53,218,52,0,0              // andps         0x34da(%rip),%xmm14        # 4fd0 <_sk_callback_sse2+0x46b>
+  .byte  68,15,84,53,224,52,0,0              // andps         0x34e0(%rip),%xmm14        # 4fd0 <_sk_callback_sse2+0x471>
   .byte  69,15,88,244                        // addps         %xmm12,%xmm14
   .byte  69,15,40,250                        // movaps        %xmm10,%xmm15
   .byte  69,15,194,249,0                     // cmpeqps       %xmm9,%xmm15
   .byte  65,15,92,208                        // subps         %xmm8,%xmm2
   .byte  65,15,89,213                        // mulps         %xmm13,%xmm2
-  .byte  68,15,40,37,205,52,0,0              // movaps        0x34cd(%rip),%xmm12        # 4fe0 <_sk_callback_sse2+0x47b>
+  .byte  68,15,40,37,211,52,0,0              // movaps        0x34d3(%rip),%xmm12        # 4fe0 <_sk_callback_sse2+0x481>
   .byte  65,15,88,212                        // addps         %xmm12,%xmm2
   .byte  69,15,92,193                        // subps         %xmm9,%xmm8
   .byte  69,15,89,197                        // mulps         %xmm13,%xmm8
-  .byte  68,15,88,5,201,52,0,0               // addps         0x34c9(%rip),%xmm8        # 4ff0 <_sk_callback_sse2+0x48b>
+  .byte  68,15,88,5,207,52,0,0               // addps         0x34cf(%rip),%xmm8        # 4ff0 <_sk_callback_sse2+0x491>
   .byte  65,15,84,215                        // andps         %xmm15,%xmm2
   .byte  69,15,85,248                        // andnps        %xmm8,%xmm15
   .byte  68,15,86,250                        // orps          %xmm2,%xmm15
   .byte  68,15,84,240                        // andps         %xmm0,%xmm14
   .byte  65,15,85,199                        // andnps        %xmm15,%xmm0
   .byte  65,15,86,198                        // orps          %xmm14,%xmm0
-  .byte  15,89,5,186,52,0,0                  // mulps         0x34ba(%rip),%xmm0        # 5000 <_sk_callback_sse2+0x49b>
+  .byte  15,89,5,192,52,0,0                  // mulps         0x34c0(%rip),%xmm0        # 5000 <_sk_callback_sse2+0x4a1>
   .byte  69,15,40,194                        // movaps        %xmm10,%xmm8
   .byte  69,15,194,195,4                     // cmpneqps      %xmm11,%xmm8
   .byte  65,15,84,192                        // andps         %xmm8,%xmm0
   .byte  69,15,92,226                        // subps         %xmm10,%xmm12
   .byte  69,15,88,211                        // addps         %xmm11,%xmm10
-  .byte  68,15,40,13,173,52,0,0              // movaps        0x34ad(%rip),%xmm9        # 5010 <_sk_callback_sse2+0x4ab>
+  .byte  68,15,40,13,179,52,0,0              // movaps        0x34b3(%rip),%xmm9        # 5010 <_sk_callback_sse2+0x4b1>
   .byte  65,15,40,210                        // movaps        %xmm10,%xmm2
   .byte  65,15,89,209                        // mulps         %xmm9,%xmm2
   .byte  68,15,194,202,1                     // cmpltps       %xmm2,%xmm9
@@ -29171,7 +29159,7 @@
   .byte  15,41,92,36,168                     // movaps        %xmm3,-0x58(%rsp)
   .byte  68,15,40,218                        // movaps        %xmm2,%xmm11
   .byte  15,40,240                           // movaps        %xmm0,%xmm6
-  .byte  68,15,40,13,108,52,0,0              // movaps        0x346c(%rip),%xmm9        # 5020 <_sk_callback_sse2+0x4bb>
+  .byte  68,15,40,13,114,52,0,0              // movaps        0x3472(%rip),%xmm9        # 5020 <_sk_callback_sse2+0x4c1>
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
   .byte  69,15,194,211,2                     // cmpleps       %xmm11,%xmm10
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
@@ -29188,28 +29176,28 @@
   .byte  69,15,88,211                        // addps         %xmm11,%xmm10
   .byte  69,15,88,219                        // addps         %xmm11,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  15,40,5,53,52,0,0                   // movaps        0x3435(%rip),%xmm0        # 5030 <_sk_callback_sse2+0x4cb>
+  .byte  15,40,5,59,52,0,0                   // movaps        0x343b(%rip),%xmm0        # 5030 <_sk_callback_sse2+0x4d1>
   .byte  15,88,198                           // addps         %xmm6,%xmm0
   .byte  243,15,91,200                       // cvttps2dq     %xmm0,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  15,40,216                           // movaps        %xmm0,%xmm3
   .byte  15,194,217,1                        // cmpltps       %xmm1,%xmm3
-  .byte  15,84,29,45,52,0,0                  // andps         0x342d(%rip),%xmm3        # 5040 <_sk_callback_sse2+0x4db>
+  .byte  15,84,29,51,52,0,0                  // andps         0x3433(%rip),%xmm3        # 5040 <_sk_callback_sse2+0x4e1>
   .byte  15,92,203                           // subps         %xmm3,%xmm1
   .byte  15,92,193                           // subps         %xmm1,%xmm0
-  .byte  68,15,40,45,47,52,0,0               // movaps        0x342f(%rip),%xmm13        # 5050 <_sk_callback_sse2+0x4eb>
+  .byte  68,15,40,45,53,52,0,0               // movaps        0x3435(%rip),%xmm13        # 5050 <_sk_callback_sse2+0x4f1>
   .byte  69,15,40,197                        // movaps        %xmm13,%xmm8
   .byte  68,15,194,192,2                     // cmpleps       %xmm0,%xmm8
   .byte  69,15,40,242                        // movaps        %xmm10,%xmm14
   .byte  69,15,92,243                        // subps         %xmm11,%xmm14
   .byte  65,15,40,217                        // movaps        %xmm9,%xmm3
   .byte  15,194,216,2                        // cmpleps       %xmm0,%xmm3
-  .byte  15,40,21,63,52,0,0                  // movaps        0x343f(%rip),%xmm2        # 5080 <_sk_callback_sse2+0x51b>
+  .byte  15,40,21,69,52,0,0                  // movaps        0x3445(%rip),%xmm2        # 5080 <_sk_callback_sse2+0x521>
   .byte  68,15,40,250                        // movaps        %xmm2,%xmm15
   .byte  68,15,194,248,2                     // cmpleps       %xmm0,%xmm15
-  .byte  15,40,13,15,52,0,0                  // movaps        0x340f(%rip),%xmm1        # 5060 <_sk_callback_sse2+0x4fb>
+  .byte  15,40,13,21,52,0,0                  // movaps        0x3415(%rip),%xmm1        # 5060 <_sk_callback_sse2+0x501>
   .byte  15,89,193                           // mulps         %xmm1,%xmm0
-  .byte  15,40,45,21,52,0,0                  // movaps        0x3415(%rip),%xmm5        # 5070 <_sk_callback_sse2+0x50b>
+  .byte  15,40,45,27,52,0,0                  // movaps        0x341b(%rip),%xmm5        # 5070 <_sk_callback_sse2+0x511>
   .byte  15,40,229                           // movaps        %xmm5,%xmm4
   .byte  15,92,224                           // subps         %xmm0,%xmm4
   .byte  65,15,89,230                        // mulps         %xmm14,%xmm4
@@ -29232,7 +29220,7 @@
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  15,40,222                           // movaps        %xmm6,%xmm3
   .byte  15,194,216,1                        // cmpltps       %xmm0,%xmm3
-  .byte  15,84,29,138,51,0,0                 // andps         0x338a(%rip),%xmm3        # 5040 <_sk_callback_sse2+0x4db>
+  .byte  15,84,29,144,51,0,0                 // andps         0x3390(%rip),%xmm3        # 5040 <_sk_callback_sse2+0x4e1>
   .byte  15,92,195                           // subps         %xmm3,%xmm0
   .byte  68,15,40,230                        // movaps        %xmm6,%xmm12
   .byte  68,15,92,224                        // subps         %xmm0,%xmm12
@@ -29262,12 +29250,12 @@
   .byte  15,40,124,36,136                    // movaps        -0x78(%rsp),%xmm7
   .byte  15,40,231                           // movaps        %xmm7,%xmm4
   .byte  15,85,227                           // andnps        %xmm3,%xmm4
-  .byte  15,88,53,98,51,0,0                  // addps         0x3362(%rip),%xmm6        # 5090 <_sk_callback_sse2+0x52b>
+  .byte  15,88,53,104,51,0,0                 // addps         0x3368(%rip),%xmm6        # 5090 <_sk_callback_sse2+0x531>
   .byte  243,15,91,198                       // cvttps2dq     %xmm6,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  15,40,222                           // movaps        %xmm6,%xmm3
   .byte  15,194,216,1                        // cmpltps       %xmm0,%xmm3
-  .byte  15,84,29,253,50,0,0                 // andps         0x32fd(%rip),%xmm3        # 5040 <_sk_callback_sse2+0x4db>
+  .byte  15,84,29,3,51,0,0                   // andps         0x3303(%rip),%xmm3        # 5040 <_sk_callback_sse2+0x4e1>
   .byte  15,92,195                           // subps         %xmm3,%xmm0
   .byte  15,92,240                           // subps         %xmm0,%xmm6
   .byte  15,89,206                           // mulps         %xmm6,%xmm1
@@ -29331,7 +29319,7 @@
   .byte  102,69,15,96,193                    // punpcklbw     %xmm9,%xmm8
   .byte  102,69,15,97,193                    // punpcklwd     %xmm9,%xmm8
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,139,50,0,0               // mulps         0x328b(%rip),%xmm8        # 50a0 <_sk_callback_sse2+0x53b>
+  .byte  68,15,89,5,145,50,0,0               // mulps         0x3291(%rip),%xmm8        # 50a0 <_sk_callback_sse2+0x541>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
@@ -29372,7 +29360,7 @@
   .byte  102,69,15,96,193                    // punpcklbw     %xmm9,%xmm8
   .byte  102,69,15,97,193                    // punpcklwd     %xmm9,%xmm8
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,41,50,0,0                // mulps         0x3229(%rip),%xmm8        # 50b0 <_sk_callback_sse2+0x54b>
+  .byte  68,15,89,5,47,50,0,0                // mulps         0x322f(%rip),%xmm8        # 50b0 <_sk_callback_sse2+0x551>
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -29397,17 +29385,17 @@
   .byte  243,68,15,126,20,120                // movq          (%rax,%rdi,2),%xmm10
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  102,69,15,97,208                    // punpcklwd     %xmm8,%xmm10
-  .byte  102,68,15,111,5,239,49,0,0          // movdqa        0x31ef(%rip),%xmm8        # 50c0 <_sk_callback_sse2+0x55b>
+  .byte  102,68,15,111,5,245,49,0,0          // movdqa        0x31f5(%rip),%xmm8        # 50c0 <_sk_callback_sse2+0x561>
   .byte  102,69,15,219,194                   // pand          %xmm10,%xmm8
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,238,49,0,0               // mulps         0x31ee(%rip),%xmm8        # 50d0 <_sk_callback_sse2+0x56b>
-  .byte  102,68,15,111,13,245,49,0,0         // movdqa        0x31f5(%rip),%xmm9        # 50e0 <_sk_callback_sse2+0x57b>
+  .byte  68,15,89,5,244,49,0,0               // mulps         0x31f4(%rip),%xmm8        # 50d0 <_sk_callback_sse2+0x571>
+  .byte  102,68,15,111,13,251,49,0,0         // movdqa        0x31fb(%rip),%xmm9        # 50e0 <_sk_callback_sse2+0x581>
   .byte  102,69,15,219,202                   // pand          %xmm10,%xmm9
   .byte  69,15,91,201                        // cvtdq2ps      %xmm9,%xmm9
-  .byte  68,15,89,13,244,49,0,0              // mulps         0x31f4(%rip),%xmm9        # 50f0 <_sk_callback_sse2+0x58b>
-  .byte  102,68,15,219,21,251,49,0,0         // pand          0x31fb(%rip),%xmm10        # 5100 <_sk_callback_sse2+0x59b>
+  .byte  68,15,89,13,250,49,0,0              // mulps         0x31fa(%rip),%xmm9        # 50f0 <_sk_callback_sse2+0x591>
+  .byte  102,68,15,219,21,1,50,0,0           // pand          0x3201(%rip),%xmm10        # 5100 <_sk_callback_sse2+0x5a1>
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
-  .byte  68,15,89,21,255,49,0,0              // mulps         0x31ff(%rip),%xmm10        # 5110 <_sk_callback_sse2+0x5ab>
+  .byte  68,15,89,21,5,50,0,0                // mulps         0x3205(%rip),%xmm10        # 5110 <_sk_callback_sse2+0x5b1>
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -29438,7 +29426,7 @@
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  76,139,72,8                         // mov           0x8(%rax),%r9
   .byte  243,69,15,111,12,184                // movdqu        (%r8,%rdi,4),%xmm9
-  .byte  102,68,15,111,5,175,49,0,0          // movdqa        0x31af(%rip),%xmm8        # 5120 <_sk_callback_sse2+0x5bb>
+  .byte  102,68,15,111,5,181,49,0,0          // movdqa        0x31b5(%rip),%xmm8        # 5120 <_sk_callback_sse2+0x5c1>
   .byte  102,65,15,111,193                   // movdqa        %xmm9,%xmm0
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,15,112,200,78                   // pshufd        $0x4e,%xmm0,%xmm1
@@ -29493,7 +29481,7 @@
   .byte  65,15,20,208                        // unpcklps      %xmm8,%xmm2
   .byte  102,65,15,114,209,24                // psrld         $0x18,%xmm9
   .byte  65,15,91,217                        // cvtdq2ps      %xmm9,%xmm3
-  .byte  15,89,29,188,48,0,0                 // mulps         0x30bc(%rip),%xmm3        # 5130 <_sk_callback_sse2+0x5cb>
+  .byte  15,89,29,194,48,0,0                 // mulps         0x30c2(%rip),%xmm3        # 5130 <_sk_callback_sse2+0x5d1>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
@@ -29512,7 +29500,7 @@
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,97,200                       // punpcklwd     %xmm0,%xmm1
   .byte  102,68,15,105,200                   // punpckhwd     %xmm0,%xmm9
-  .byte  102,68,15,111,21,143,48,0,0         // movdqa        0x308f(%rip),%xmm10        # 5140 <_sk_callback_sse2+0x5db>
+  .byte  102,68,15,111,21,149,48,0,0         // movdqa        0x3095(%rip),%xmm10        # 5140 <_sk_callback_sse2+0x5e1>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,194                   // pand          %xmm10,%xmm0
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
@@ -29573,7 +29561,7 @@
   .byte  102,65,15,235,217                   // por           %xmm9,%xmm3
   .byte  102,65,15,97,216                    // punpcklwd     %xmm8,%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,126,47,0,0                 // mulps         0x2f7e(%rip),%xmm3        # 5150 <_sk_callback_sse2+0x5eb>
+  .byte  15,89,29,132,47,0,0                 // mulps         0x2f84(%rip),%xmm3        # 5150 <_sk_callback_sse2+0x5f1>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
@@ -29595,7 +29583,7 @@
   .byte  102,68,15,97,208                    // punpcklwd     %xmm0,%xmm10
   .byte  102,65,15,111,195                   // movdqa        %xmm11,%xmm0
   .byte  102,65,15,97,194                    // punpcklwd     %xmm10,%xmm0
-  .byte  102,68,15,111,5,62,47,0,0           // movdqa        0x2f3e(%rip),%xmm8        # 5160 <_sk_callback_sse2+0x5fb>
+  .byte  102,68,15,111,5,68,47,0,0           // movdqa        0x2f44(%rip),%xmm8        # 5160 <_sk_callback_sse2+0x601>
   .byte  102,15,112,200,78                   // pshufd        $0x4e,%xmm0,%xmm1
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
@@ -29650,7 +29638,7 @@
   .byte  15,20,211                           // unpcklps      %xmm3,%xmm2
   .byte  65,15,20,208                        // unpcklps      %xmm8,%xmm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,77,46,0,0                  // movaps        0x2e4d(%rip),%xmm3        # 5170 <_sk_callback_sse2+0x60b>
+  .byte  15,40,29,83,46,0,0                  // movaps        0x2e53(%rip),%xmm3        # 5170 <_sk_callback_sse2+0x611>
   .byte  255,224                             // jmpq          *%rax
 
 HIDDEN _sk_byte_tables_sse2
@@ -29660,7 +29648,7 @@
   .byte  65,86                               // push          %r14
   .byte  83                                  // push          %rbx
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,78,46,0,0                // movaps        0x2e4e(%rip),%xmm8        # 5180 <_sk_callback_sse2+0x61b>
+  .byte  68,15,40,5,84,46,0,0                // movaps        0x2e54(%rip),%xmm8        # 5180 <_sk_callback_sse2+0x621>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,91,192                       // cvtps2dq      %xmm0,%xmm0
   .byte  102,72,15,126,193                   // movq          %xmm0,%rcx
@@ -29687,7 +29675,7 @@
   .byte  102,65,15,96,193                    // punpcklbw     %xmm9,%xmm0
   .byte  102,65,15,97,193                    // punpcklwd     %xmm9,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,21,235,45,0,0              // movaps        0x2deb(%rip),%xmm10        # 5190 <_sk_callback_sse2+0x62b>
+  .byte  68,15,40,21,241,45,0,0              // movaps        0x2df1(%rip),%xmm10        # 5190 <_sk_callback_sse2+0x631>
   .byte  65,15,89,194                        // mulps         %xmm10,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
@@ -29803,7 +29791,7 @@
   .byte  102,65,15,96,193                    // punpcklbw     %xmm9,%xmm0
   .byte  102,65,15,97,193                    // punpcklwd     %xmm9,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,21,62,44,0,0               // movaps        0x2c3e(%rip),%xmm10        # 51a0 <_sk_callback_sse2+0x63b>
+  .byte  68,15,40,21,68,44,0,0               // movaps        0x2c44(%rip),%xmm10        # 51a0 <_sk_callback_sse2+0x641>
   .byte  65,15,89,194                        // mulps         %xmm10,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
@@ -30000,15 +29988,15 @@
   .byte  69,15,88,209                        // addps         %xmm9,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,202                        // cvtdq2ps      %xmm10,%xmm9
-  .byte  68,15,89,13,125,41,0,0              // mulps         0x297d(%rip),%xmm9        # 51b0 <_sk_callback_sse2+0x64b>
-  .byte  68,15,84,21,133,41,0,0              // andps         0x2985(%rip),%xmm10        # 51c0 <_sk_callback_sse2+0x65b>
-  .byte  68,15,86,21,141,41,0,0              // orps          0x298d(%rip),%xmm10        # 51d0 <_sk_callback_sse2+0x66b>
-  .byte  68,15,88,13,149,41,0,0              // addps         0x2995(%rip),%xmm9        # 51e0 <_sk_callback_sse2+0x67b>
-  .byte  68,15,40,37,157,41,0,0              // movaps        0x299d(%rip),%xmm12        # 51f0 <_sk_callback_sse2+0x68b>
+  .byte  68,15,89,13,131,41,0,0              // mulps         0x2983(%rip),%xmm9        # 51b0 <_sk_callback_sse2+0x651>
+  .byte  68,15,84,21,139,41,0,0              // andps         0x298b(%rip),%xmm10        # 51c0 <_sk_callback_sse2+0x661>
+  .byte  68,15,86,21,147,41,0,0              // orps          0x2993(%rip),%xmm10        # 51d0 <_sk_callback_sse2+0x671>
+  .byte  68,15,88,13,155,41,0,0              // addps         0x299b(%rip),%xmm9        # 51e0 <_sk_callback_sse2+0x681>
+  .byte  68,15,40,37,163,41,0,0              // movaps        0x29a3(%rip),%xmm12        # 51f0 <_sk_callback_sse2+0x691>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,88,21,157,41,0,0              // addps         0x299d(%rip),%xmm10        # 5200 <_sk_callback_sse2+0x69b>
-  .byte  68,15,40,37,165,41,0,0              // movaps        0x29a5(%rip),%xmm12        # 5210 <_sk_callback_sse2+0x6ab>
+  .byte  68,15,88,21,163,41,0,0              // addps         0x29a3(%rip),%xmm10        # 5200 <_sk_callback_sse2+0x6a1>
+  .byte  68,15,40,37,171,41,0,0              // movaps        0x29ab(%rip),%xmm12        # 5210 <_sk_callback_sse2+0x6b1>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
@@ -30016,22 +30004,22 @@
   .byte  69,15,91,226                        // cvtdq2ps      %xmm10,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,194,236,1                     // cmpltps       %xmm12,%xmm13
-  .byte  68,15,40,21,143,41,0,0              // movaps        0x298f(%rip),%xmm10        # 5220 <_sk_callback_sse2+0x6bb>
+  .byte  68,15,40,21,149,41,0,0              // movaps        0x2995(%rip),%xmm10        # 5220 <_sk_callback_sse2+0x6c1>
   .byte  69,15,84,234                        // andps         %xmm10,%xmm13
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,92,236                        // subps         %xmm12,%xmm13
-  .byte  68,15,88,13,131,41,0,0              // addps         0x2983(%rip),%xmm9        # 5230 <_sk_callback_sse2+0x6cb>
-  .byte  68,15,40,37,139,41,0,0              // movaps        0x298b(%rip),%xmm12        # 5240 <_sk_callback_sse2+0x6db>
+  .byte  68,15,88,13,137,41,0,0              // addps         0x2989(%rip),%xmm9        # 5230 <_sk_callback_sse2+0x6d1>
+  .byte  68,15,40,37,145,41,0,0              // movaps        0x2991(%rip),%xmm12        # 5240 <_sk_callback_sse2+0x6e1>
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,40,37,139,41,0,0              // movaps        0x298b(%rip),%xmm12        # 5250 <_sk_callback_sse2+0x6eb>
+  .byte  68,15,40,37,145,41,0,0              // movaps        0x2991(%rip),%xmm12        # 5250 <_sk_callback_sse2+0x6f1>
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
-  .byte  68,15,40,45,143,41,0,0              // movaps        0x298f(%rip),%xmm13        # 5260 <_sk_callback_sse2+0x6fb>
+  .byte  68,15,40,45,149,41,0,0              // movaps        0x2995(%rip),%xmm13        # 5260 <_sk_callback_sse2+0x701>
   .byte  69,15,94,236                        // divps         %xmm12,%xmm13
   .byte  69,15,88,233                        // addps         %xmm9,%xmm13
-  .byte  68,15,89,45,143,41,0,0              // mulps         0x298f(%rip),%xmm13        # 5270 <_sk_callback_sse2+0x70b>
+  .byte  68,15,89,45,149,41,0,0              // mulps         0x2995(%rip),%xmm13        # 5270 <_sk_callback_sse2+0x711>
   .byte  102,69,15,91,205                    // cvtps2dq      %xmm13,%xmm9
   .byte  243,68,15,16,96,20                  // movss         0x14(%rax),%xmm12
   .byte  69,15,198,228,0                     // shufps        $0x0,%xmm12,%xmm12
@@ -30067,15 +30055,15 @@
   .byte  69,15,88,209                        // addps         %xmm9,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,202                        // cvtdq2ps      %xmm10,%xmm9
-  .byte  68,15,89,13,15,41,0,0               // mulps         0x290f(%rip),%xmm9        # 5280 <_sk_callback_sse2+0x71b>
-  .byte  68,15,84,21,23,41,0,0               // andps         0x2917(%rip),%xmm10        # 5290 <_sk_callback_sse2+0x72b>
-  .byte  68,15,86,21,31,41,0,0               // orps          0x291f(%rip),%xmm10        # 52a0 <_sk_callback_sse2+0x73b>
-  .byte  68,15,88,13,39,41,0,0               // addps         0x2927(%rip),%xmm9        # 52b0 <_sk_callback_sse2+0x74b>
-  .byte  68,15,40,37,47,41,0,0               // movaps        0x292f(%rip),%xmm12        # 52c0 <_sk_callback_sse2+0x75b>
+  .byte  68,15,89,13,21,41,0,0               // mulps         0x2915(%rip),%xmm9        # 5280 <_sk_callback_sse2+0x721>
+  .byte  68,15,84,21,29,41,0,0               // andps         0x291d(%rip),%xmm10        # 5290 <_sk_callback_sse2+0x731>
+  .byte  68,15,86,21,37,41,0,0               // orps          0x2925(%rip),%xmm10        # 52a0 <_sk_callback_sse2+0x741>
+  .byte  68,15,88,13,45,41,0,0               // addps         0x292d(%rip),%xmm9        # 52b0 <_sk_callback_sse2+0x751>
+  .byte  68,15,40,37,53,41,0,0               // movaps        0x2935(%rip),%xmm12        # 52c0 <_sk_callback_sse2+0x761>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,88,21,47,41,0,0               // addps         0x292f(%rip),%xmm10        # 52d0 <_sk_callback_sse2+0x76b>
-  .byte  68,15,40,37,55,41,0,0               // movaps        0x2937(%rip),%xmm12        # 52e0 <_sk_callback_sse2+0x77b>
+  .byte  68,15,88,21,53,41,0,0               // addps         0x2935(%rip),%xmm10        # 52d0 <_sk_callback_sse2+0x771>
+  .byte  68,15,40,37,61,41,0,0               // movaps        0x293d(%rip),%xmm12        # 52e0 <_sk_callback_sse2+0x781>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
@@ -30083,22 +30071,22 @@
   .byte  69,15,91,226                        // cvtdq2ps      %xmm10,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,194,236,1                     // cmpltps       %xmm12,%xmm13
-  .byte  68,15,40,21,33,41,0,0               // movaps        0x2921(%rip),%xmm10        # 52f0 <_sk_callback_sse2+0x78b>
+  .byte  68,15,40,21,39,41,0,0               // movaps        0x2927(%rip),%xmm10        # 52f0 <_sk_callback_sse2+0x791>
   .byte  69,15,84,234                        // andps         %xmm10,%xmm13
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,92,236                        // subps         %xmm12,%xmm13
-  .byte  68,15,88,13,21,41,0,0               // addps         0x2915(%rip),%xmm9        # 5300 <_sk_callback_sse2+0x79b>
-  .byte  68,15,40,37,29,41,0,0               // movaps        0x291d(%rip),%xmm12        # 5310 <_sk_callback_sse2+0x7ab>
+  .byte  68,15,88,13,27,41,0,0               // addps         0x291b(%rip),%xmm9        # 5300 <_sk_callback_sse2+0x7a1>
+  .byte  68,15,40,37,35,41,0,0               // movaps        0x2923(%rip),%xmm12        # 5310 <_sk_callback_sse2+0x7b1>
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,40,37,29,41,0,0               // movaps        0x291d(%rip),%xmm12        # 5320 <_sk_callback_sse2+0x7bb>
+  .byte  68,15,40,37,35,41,0,0               // movaps        0x2923(%rip),%xmm12        # 5320 <_sk_callback_sse2+0x7c1>
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
-  .byte  68,15,40,45,33,41,0,0               // movaps        0x2921(%rip),%xmm13        # 5330 <_sk_callback_sse2+0x7cb>
+  .byte  68,15,40,45,39,41,0,0               // movaps        0x2927(%rip),%xmm13        # 5330 <_sk_callback_sse2+0x7d1>
   .byte  69,15,94,236                        // divps         %xmm12,%xmm13
   .byte  69,15,88,233                        // addps         %xmm9,%xmm13
-  .byte  68,15,89,45,33,41,0,0               // mulps         0x2921(%rip),%xmm13        # 5340 <_sk_callback_sse2+0x7db>
+  .byte  68,15,89,45,39,41,0,0               // mulps         0x2927(%rip),%xmm13        # 5340 <_sk_callback_sse2+0x7e1>
   .byte  102,69,15,91,205                    // cvtps2dq      %xmm13,%xmm9
   .byte  243,68,15,16,96,20                  // movss         0x14(%rax),%xmm12
   .byte  69,15,198,228,0                     // shufps        $0x0,%xmm12,%xmm12
@@ -30134,15 +30122,15 @@
   .byte  69,15,88,209                        // addps         %xmm9,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,202                        // cvtdq2ps      %xmm10,%xmm9
-  .byte  68,15,89,13,161,40,0,0              // mulps         0x28a1(%rip),%xmm9        # 5350 <_sk_callback_sse2+0x7eb>
-  .byte  68,15,84,21,169,40,0,0              // andps         0x28a9(%rip),%xmm10        # 5360 <_sk_callback_sse2+0x7fb>
-  .byte  68,15,86,21,177,40,0,0              // orps          0x28b1(%rip),%xmm10        # 5370 <_sk_callback_sse2+0x80b>
-  .byte  68,15,88,13,185,40,0,0              // addps         0x28b9(%rip),%xmm9        # 5380 <_sk_callback_sse2+0x81b>
-  .byte  68,15,40,37,193,40,0,0              // movaps        0x28c1(%rip),%xmm12        # 5390 <_sk_callback_sse2+0x82b>
+  .byte  68,15,89,13,167,40,0,0              // mulps         0x28a7(%rip),%xmm9        # 5350 <_sk_callback_sse2+0x7f1>
+  .byte  68,15,84,21,175,40,0,0              // andps         0x28af(%rip),%xmm10        # 5360 <_sk_callback_sse2+0x801>
+  .byte  68,15,86,21,183,40,0,0              // orps          0x28b7(%rip),%xmm10        # 5370 <_sk_callback_sse2+0x811>
+  .byte  68,15,88,13,191,40,0,0              // addps         0x28bf(%rip),%xmm9        # 5380 <_sk_callback_sse2+0x821>
+  .byte  68,15,40,37,199,40,0,0              // movaps        0x28c7(%rip),%xmm12        # 5390 <_sk_callback_sse2+0x831>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,88,21,193,40,0,0              // addps         0x28c1(%rip),%xmm10        # 53a0 <_sk_callback_sse2+0x83b>
-  .byte  68,15,40,37,201,40,0,0              // movaps        0x28c9(%rip),%xmm12        # 53b0 <_sk_callback_sse2+0x84b>
+  .byte  68,15,88,21,199,40,0,0              // addps         0x28c7(%rip),%xmm10        # 53a0 <_sk_callback_sse2+0x841>
+  .byte  68,15,40,37,207,40,0,0              // movaps        0x28cf(%rip),%xmm12        # 53b0 <_sk_callback_sse2+0x851>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
@@ -30150,22 +30138,22 @@
   .byte  69,15,91,226                        // cvtdq2ps      %xmm10,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,194,236,1                     // cmpltps       %xmm12,%xmm13
-  .byte  68,15,40,21,179,40,0,0              // movaps        0x28b3(%rip),%xmm10        # 53c0 <_sk_callback_sse2+0x85b>
+  .byte  68,15,40,21,185,40,0,0              // movaps        0x28b9(%rip),%xmm10        # 53c0 <_sk_callback_sse2+0x861>
   .byte  69,15,84,234                        // andps         %xmm10,%xmm13
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,92,236                        // subps         %xmm12,%xmm13
-  .byte  68,15,88,13,167,40,0,0              // addps         0x28a7(%rip),%xmm9        # 53d0 <_sk_callback_sse2+0x86b>
-  .byte  68,15,40,37,175,40,0,0              // movaps        0x28af(%rip),%xmm12        # 53e0 <_sk_callback_sse2+0x87b>
+  .byte  68,15,88,13,173,40,0,0              // addps         0x28ad(%rip),%xmm9        # 53d0 <_sk_callback_sse2+0x871>
+  .byte  68,15,40,37,181,40,0,0              // movaps        0x28b5(%rip),%xmm12        # 53e0 <_sk_callback_sse2+0x881>
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,40,37,175,40,0,0              // movaps        0x28af(%rip),%xmm12        # 53f0 <_sk_callback_sse2+0x88b>
+  .byte  68,15,40,37,181,40,0,0              // movaps        0x28b5(%rip),%xmm12        # 53f0 <_sk_callback_sse2+0x891>
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
-  .byte  68,15,40,45,179,40,0,0              // movaps        0x28b3(%rip),%xmm13        # 5400 <_sk_callback_sse2+0x89b>
+  .byte  68,15,40,45,185,40,0,0              // movaps        0x28b9(%rip),%xmm13        # 5400 <_sk_callback_sse2+0x8a1>
   .byte  69,15,94,236                        // divps         %xmm12,%xmm13
   .byte  69,15,88,233                        // addps         %xmm9,%xmm13
-  .byte  68,15,89,45,179,40,0,0              // mulps         0x28b3(%rip),%xmm13        # 5410 <_sk_callback_sse2+0x8ab>
+  .byte  68,15,89,45,185,40,0,0              // mulps         0x28b9(%rip),%xmm13        # 5410 <_sk_callback_sse2+0x8b1>
   .byte  102,69,15,91,205                    // cvtps2dq      %xmm13,%xmm9
   .byte  243,68,15,16,96,20                  // movss         0x14(%rax),%xmm12
   .byte  69,15,198,228,0                     // shufps        $0x0,%xmm12,%xmm12
@@ -30201,15 +30189,15 @@
   .byte  69,15,88,209                        // addps         %xmm9,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,202                        // cvtdq2ps      %xmm10,%xmm9
-  .byte  68,15,89,13,51,40,0,0               // mulps         0x2833(%rip),%xmm9        # 5420 <_sk_callback_sse2+0x8bb>
-  .byte  68,15,84,21,59,40,0,0               // andps         0x283b(%rip),%xmm10        # 5430 <_sk_callback_sse2+0x8cb>
-  .byte  68,15,86,21,67,40,0,0               // orps          0x2843(%rip),%xmm10        # 5440 <_sk_callback_sse2+0x8db>
-  .byte  68,15,88,13,75,40,0,0               // addps         0x284b(%rip),%xmm9        # 5450 <_sk_callback_sse2+0x8eb>
-  .byte  68,15,40,37,83,40,0,0               // movaps        0x2853(%rip),%xmm12        # 5460 <_sk_callback_sse2+0x8fb>
+  .byte  68,15,89,13,57,40,0,0               // mulps         0x2839(%rip),%xmm9        # 5420 <_sk_callback_sse2+0x8c1>
+  .byte  68,15,84,21,65,40,0,0               // andps         0x2841(%rip),%xmm10        # 5430 <_sk_callback_sse2+0x8d1>
+  .byte  68,15,86,21,73,40,0,0               // orps          0x2849(%rip),%xmm10        # 5440 <_sk_callback_sse2+0x8e1>
+  .byte  68,15,88,13,81,40,0,0               // addps         0x2851(%rip),%xmm9        # 5450 <_sk_callback_sse2+0x8f1>
+  .byte  68,15,40,37,89,40,0,0               // movaps        0x2859(%rip),%xmm12        # 5460 <_sk_callback_sse2+0x901>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,88,21,83,40,0,0               // addps         0x2853(%rip),%xmm10        # 5470 <_sk_callback_sse2+0x90b>
-  .byte  68,15,40,37,91,40,0,0               // movaps        0x285b(%rip),%xmm12        # 5480 <_sk_callback_sse2+0x91b>
+  .byte  68,15,88,21,89,40,0,0               // addps         0x2859(%rip),%xmm10        # 5470 <_sk_callback_sse2+0x911>
+  .byte  68,15,40,37,97,40,0,0               // movaps        0x2861(%rip),%xmm12        # 5480 <_sk_callback_sse2+0x921>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
@@ -30217,22 +30205,22 @@
   .byte  69,15,91,226                        // cvtdq2ps      %xmm10,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,194,236,1                     // cmpltps       %xmm12,%xmm13
-  .byte  68,15,40,21,69,40,0,0               // movaps        0x2845(%rip),%xmm10        # 5490 <_sk_callback_sse2+0x92b>
+  .byte  68,15,40,21,75,40,0,0               // movaps        0x284b(%rip),%xmm10        # 5490 <_sk_callback_sse2+0x931>
   .byte  69,15,84,234                        // andps         %xmm10,%xmm13
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,92,236                        // subps         %xmm12,%xmm13
-  .byte  68,15,88,13,57,40,0,0               // addps         0x2839(%rip),%xmm9        # 54a0 <_sk_callback_sse2+0x93b>
-  .byte  68,15,40,37,65,40,0,0               // movaps        0x2841(%rip),%xmm12        # 54b0 <_sk_callback_sse2+0x94b>
+  .byte  68,15,88,13,63,40,0,0               // addps         0x283f(%rip),%xmm9        # 54a0 <_sk_callback_sse2+0x941>
+  .byte  68,15,40,37,71,40,0,0               // movaps        0x2847(%rip),%xmm12        # 54b0 <_sk_callback_sse2+0x951>
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,40,37,65,40,0,0               // movaps        0x2841(%rip),%xmm12        # 54c0 <_sk_callback_sse2+0x95b>
+  .byte  68,15,40,37,71,40,0,0               // movaps        0x2847(%rip),%xmm12        # 54c0 <_sk_callback_sse2+0x961>
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
-  .byte  68,15,40,45,69,40,0,0               // movaps        0x2845(%rip),%xmm13        # 54d0 <_sk_callback_sse2+0x96b>
+  .byte  68,15,40,45,75,40,0,0               // movaps        0x284b(%rip),%xmm13        # 54d0 <_sk_callback_sse2+0x971>
   .byte  69,15,94,236                        // divps         %xmm12,%xmm13
   .byte  69,15,88,233                        // addps         %xmm9,%xmm13
-  .byte  68,15,89,45,69,40,0,0               // mulps         0x2845(%rip),%xmm13        # 54e0 <_sk_callback_sse2+0x97b>
+  .byte  68,15,89,45,75,40,0,0               // mulps         0x284b(%rip),%xmm13        # 54e0 <_sk_callback_sse2+0x981>
   .byte  102,69,15,91,205                    // cvtps2dq      %xmm13,%xmm9
   .byte  243,68,15,16,96,20                  // movss         0x14(%rax),%xmm12
   .byte  69,15,198,228,0                     // shufps        $0x0,%xmm12,%xmm12
@@ -30249,29 +30237,29 @@
 .globl _sk_lab_to_xyz_sse2
 FUNCTION(_sk_lab_to_xyz_sse2)
 _sk_lab_to_xyz_sse2:
-  .byte  15,89,5,34,40,0,0                   // mulps         0x2822(%rip),%xmm0        # 54f0 <_sk_callback_sse2+0x98b>
-  .byte  68,15,40,5,42,40,0,0                // movaps        0x282a(%rip),%xmm8        # 5500 <_sk_callback_sse2+0x99b>
+  .byte  15,89,5,40,40,0,0                   // mulps         0x2828(%rip),%xmm0        # 54f0 <_sk_callback_sse2+0x991>
+  .byte  68,15,40,5,48,40,0,0                // movaps        0x2830(%rip),%xmm8        # 5500 <_sk_callback_sse2+0x9a1>
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
-  .byte  68,15,40,13,46,40,0,0               // movaps        0x282e(%rip),%xmm9        # 5510 <_sk_callback_sse2+0x9ab>
+  .byte  68,15,40,13,52,40,0,0               // movaps        0x2834(%rip),%xmm9        # 5510 <_sk_callback_sse2+0x9b1>
   .byte  65,15,88,201                        // addps         %xmm9,%xmm1
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  65,15,88,209                        // addps         %xmm9,%xmm2
-  .byte  15,88,5,43,40,0,0                   // addps         0x282b(%rip),%xmm0        # 5520 <_sk_callback_sse2+0x9bb>
-  .byte  15,89,5,52,40,0,0                   // mulps         0x2834(%rip),%xmm0        # 5530 <_sk_callback_sse2+0x9cb>
-  .byte  15,89,13,61,40,0,0                  // mulps         0x283d(%rip),%xmm1        # 5540 <_sk_callback_sse2+0x9db>
+  .byte  15,88,5,49,40,0,0                   // addps         0x2831(%rip),%xmm0        # 5520 <_sk_callback_sse2+0x9c1>
+  .byte  15,89,5,58,40,0,0                   // mulps         0x283a(%rip),%xmm0        # 5530 <_sk_callback_sse2+0x9d1>
+  .byte  15,89,13,67,40,0,0                  // mulps         0x2843(%rip),%xmm1        # 5540 <_sk_callback_sse2+0x9e1>
   .byte  15,88,200                           // addps         %xmm0,%xmm1
-  .byte  15,89,21,67,40,0,0                  // mulps         0x2843(%rip),%xmm2        # 5550 <_sk_callback_sse2+0x9eb>
+  .byte  15,89,21,73,40,0,0                  // mulps         0x2849(%rip),%xmm2        # 5550 <_sk_callback_sse2+0x9f1>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  68,15,92,202                        // subps         %xmm2,%xmm9
   .byte  68,15,40,225                        // movaps        %xmm1,%xmm12
   .byte  69,15,89,228                        // mulps         %xmm12,%xmm12
   .byte  68,15,89,225                        // mulps         %xmm1,%xmm12
-  .byte  15,40,21,56,40,0,0                  // movaps        0x2838(%rip),%xmm2        # 5560 <_sk_callback_sse2+0x9fb>
+  .byte  15,40,21,62,40,0,0                  // movaps        0x283e(%rip),%xmm2        # 5560 <_sk_callback_sse2+0xa01>
   .byte  68,15,40,194                        // movaps        %xmm2,%xmm8
   .byte  69,15,194,196,1                     // cmpltps       %xmm12,%xmm8
-  .byte  68,15,40,21,55,40,0,0               // movaps        0x2837(%rip),%xmm10        # 5570 <_sk_callback_sse2+0xa0b>
+  .byte  68,15,40,21,61,40,0,0               // movaps        0x283d(%rip),%xmm10        # 5570 <_sk_callback_sse2+0xa11>
   .byte  65,15,88,202                        // addps         %xmm10,%xmm1
-  .byte  68,15,40,29,59,40,0,0               // movaps        0x283b(%rip),%xmm11        # 5580 <_sk_callback_sse2+0xa1b>
+  .byte  68,15,40,29,65,40,0,0               // movaps        0x2841(%rip),%xmm11        # 5580 <_sk_callback_sse2+0xa21>
   .byte  65,15,89,203                        // mulps         %xmm11,%xmm1
   .byte  69,15,84,224                        // andps         %xmm8,%xmm12
   .byte  68,15,85,193                        // andnps        %xmm1,%xmm8
@@ -30295,8 +30283,8 @@
   .byte  15,84,194                           // andps         %xmm2,%xmm0
   .byte  65,15,85,209                        // andnps        %xmm9,%xmm2
   .byte  15,86,208                           // orps          %xmm0,%xmm2
-  .byte  68,15,89,5,235,39,0,0               // mulps         0x27eb(%rip),%xmm8        # 5590 <_sk_callback_sse2+0xa2b>
-  .byte  15,89,21,244,39,0,0                 // mulps         0x27f4(%rip),%xmm2        # 55a0 <_sk_callback_sse2+0xa3b>
+  .byte  68,15,89,5,241,39,0,0               // mulps         0x27f1(%rip),%xmm8        # 5590 <_sk_callback_sse2+0xa31>
+  .byte  15,89,21,250,39,0,0                 // mulps         0x27fa(%rip),%xmm2        # 55a0 <_sk_callback_sse2+0xa41>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -30312,7 +30300,7 @@
   .byte  102,15,96,193                       // punpcklbw     %xmm1,%xmm0
   .byte  102,15,97,193                       // punpcklwd     %xmm1,%xmm0
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,29,220,39,0,0                 // mulps         0x27dc(%rip),%xmm3        # 55b0 <_sk_callback_sse2+0xa4b>
+  .byte  15,89,29,226,39,0,0                 // mulps         0x27e2(%rip),%xmm3        # 55b0 <_sk_callback_sse2+0xa51>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
@@ -30357,7 +30345,7 @@
   .byte  102,15,96,193                       // punpcklbw     %xmm1,%xmm0
   .byte  102,15,97,193                       // punpcklwd     %xmm1,%xmm0
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,29,75,39,0,0                  // mulps         0x274b(%rip),%xmm3        # 55c0 <_sk_callback_sse2+0xa5b>
+  .byte  15,89,29,81,39,0,0                  // mulps         0x2751(%rip),%xmm3        # 55c0 <_sk_callback_sse2+0xa61>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
@@ -30370,7 +30358,7 @@
 _sk_store_a8_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,63,39,0,0                // movaps        0x273f(%rip),%xmm8        # 55d0 <_sk_callback_sse2+0xa6b>
+  .byte  68,15,40,5,69,39,0,0                // movaps        0x2745(%rip),%xmm8        # 55d0 <_sk_callback_sse2+0xa71>
   .byte  68,15,89,195                        // mulps         %xmm3,%xmm8
   .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
   .byte  102,65,15,114,240,16                // pslld         $0x10,%xmm8
@@ -30392,9 +30380,9 @@
   .byte  102,15,96,193                       // punpcklbw     %xmm1,%xmm0
   .byte  102,15,97,193                       // punpcklwd     %xmm1,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,6,39,0,0                    // mulps         0x2706(%rip),%xmm0        # 55e0 <_sk_callback_sse2+0xa7b>
+  .byte  15,89,5,12,39,0,0                   // mulps         0x270c(%rip),%xmm0        # 55e0 <_sk_callback_sse2+0xa81>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,13,39,0,0                  // movaps        0x270d(%rip),%xmm3        # 55f0 <_sk_callback_sse2+0xa8b>
+  .byte  15,40,29,19,39,0,0                  // movaps        0x2713(%rip),%xmm3        # 55f0 <_sk_callback_sse2+0xa91>
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  255,224                             // jmpq          *%rax
@@ -30437,9 +30425,9 @@
   .byte  102,15,96,193                       // punpcklbw     %xmm1,%xmm0
   .byte  102,15,97,193                       // punpcklwd     %xmm1,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,130,38,0,0                  // mulps         0x2682(%rip),%xmm0        # 5600 <_sk_callback_sse2+0xa9b>
+  .byte  15,89,5,136,38,0,0                  // mulps         0x2688(%rip),%xmm0        # 5600 <_sk_callback_sse2+0xaa1>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,137,38,0,0                 // movaps        0x2689(%rip),%xmm3        # 5610 <_sk_callback_sse2+0xaab>
+  .byte  15,40,29,143,38,0,0                 // movaps        0x268f(%rip),%xmm3        # 5610 <_sk_callback_sse2+0xab1>
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  255,224                             // jmpq          *%rax
@@ -30451,9 +30439,9 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,137,192                          // mov           %rax,%r8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  116,5                               // je            2f9e <_sk_gather_i8_sse2+0xf>
+  .byte  116,5                               // je            2f98 <_sk_gather_i8_sse2+0xf>
   .byte  76,137,192                          // mov           %r8,%rax
-  .byte  235,2                               // jmp           2fa0 <_sk_gather_i8_sse2+0x11>
+  .byte  235,2                               // jmp           2f9a <_sk_gather_i8_sse2+0x11>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  243,15,91,201                       // cvttps2dq     %xmm1,%xmm1
@@ -30502,11 +30490,11 @@
   .byte  102,67,15,110,12,136                // movd          (%r8,%r9,4),%xmm1
   .byte  102,68,15,98,201                    // punpckldq     %xmm1,%xmm9
   .byte  102,68,15,98,200                    // punpckldq     %xmm0,%xmm9
-  .byte  102,15,111,21,168,37,0,0            // movdqa        0x25a8(%rip),%xmm2        # 5620 <_sk_callback_sse2+0xabb>
+  .byte  102,15,111,21,174,37,0,0            // movdqa        0x25ae(%rip),%xmm2        # 5620 <_sk_callback_sse2+0xac1>
   .byte  102,65,15,111,193                   // movdqa        %xmm9,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,164,37,0,0               // movaps        0x25a4(%rip),%xmm8        # 5630 <_sk_callback_sse2+0xacb>
+  .byte  68,15,40,5,170,37,0,0               // movaps        0x25aa(%rip),%xmm8        # 5630 <_sk_callback_sse2+0xad1>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -30533,19 +30521,19 @@
   .byte  243,15,126,20,120                   // movq          (%rax,%rdi,2),%xmm2
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,208                       // punpcklwd     %xmm0,%xmm2
-  .byte  102,15,111,5,90,37,0,0              // movdqa        0x255a(%rip),%xmm0        # 5640 <_sk_callback_sse2+0xadb>
+  .byte  102,15,111,5,96,37,0,0              // movdqa        0x2560(%rip),%xmm0        # 5640 <_sk_callback_sse2+0xae1>
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,92,37,0,0                   // mulps         0x255c(%rip),%xmm0        # 5650 <_sk_callback_sse2+0xaeb>
-  .byte  102,15,111,13,100,37,0,0            // movdqa        0x2564(%rip),%xmm1        # 5660 <_sk_callback_sse2+0xafb>
+  .byte  15,89,5,98,37,0,0                   // mulps         0x2562(%rip),%xmm0        # 5650 <_sk_callback_sse2+0xaf1>
+  .byte  102,15,111,13,106,37,0,0            // movdqa        0x256a(%rip),%xmm1        # 5660 <_sk_callback_sse2+0xb01>
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,102,37,0,0                 // mulps         0x2566(%rip),%xmm1        # 5670 <_sk_callback_sse2+0xb0b>
-  .byte  102,15,219,21,110,37,0,0            // pand          0x256e(%rip),%xmm2        # 5680 <_sk_callback_sse2+0xb1b>
+  .byte  15,89,13,108,37,0,0                 // mulps         0x256c(%rip),%xmm1        # 5670 <_sk_callback_sse2+0xb11>
+  .byte  102,15,219,21,116,37,0,0            // pand          0x2574(%rip),%xmm2        # 5680 <_sk_callback_sse2+0xb21>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,116,37,0,0                 // mulps         0x2574(%rip),%xmm2        # 5690 <_sk_callback_sse2+0xb2b>
+  .byte  15,89,21,122,37,0,0                 // mulps         0x257a(%rip),%xmm2        # 5690 <_sk_callback_sse2+0xb31>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,123,37,0,0                 // movaps        0x257b(%rip),%xmm3        # 56a0 <_sk_callback_sse2+0xb3b>
+  .byte  15,40,29,129,37,0,0                 // movaps        0x2581(%rip),%xmm3        # 56a0 <_sk_callback_sse2+0xb41>
   .byte  255,224                             // jmpq          *%rax
 
 HIDDEN _sk_gather_565_sse2
@@ -30580,19 +30568,19 @@
   .byte  102,15,196,208,3                    // pinsrw        $0x3,%eax,%xmm2
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,208                       // punpcklwd     %xmm0,%xmm2
-  .byte  102,15,111,5,4,37,0,0               // movdqa        0x2504(%rip),%xmm0        # 56b0 <_sk_callback_sse2+0xb4b>
+  .byte  102,15,111,5,10,37,0,0              // movdqa        0x250a(%rip),%xmm0        # 56b0 <_sk_callback_sse2+0xb51>
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,6,37,0,0                    // mulps         0x2506(%rip),%xmm0        # 56c0 <_sk_callback_sse2+0xb5b>
-  .byte  102,15,111,13,14,37,0,0             // movdqa        0x250e(%rip),%xmm1        # 56d0 <_sk_callback_sse2+0xb6b>
+  .byte  15,89,5,12,37,0,0                   // mulps         0x250c(%rip),%xmm0        # 56c0 <_sk_callback_sse2+0xb61>
+  .byte  102,15,111,13,20,37,0,0             // movdqa        0x2514(%rip),%xmm1        # 56d0 <_sk_callback_sse2+0xb71>
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,16,37,0,0                  // mulps         0x2510(%rip),%xmm1        # 56e0 <_sk_callback_sse2+0xb7b>
-  .byte  102,15,219,21,24,37,0,0             // pand          0x2518(%rip),%xmm2        # 56f0 <_sk_callback_sse2+0xb8b>
+  .byte  15,89,13,22,37,0,0                  // mulps         0x2516(%rip),%xmm1        # 56e0 <_sk_callback_sse2+0xb81>
+  .byte  102,15,219,21,30,37,0,0             // pand          0x251e(%rip),%xmm2        # 56f0 <_sk_callback_sse2+0xb91>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,30,37,0,0                  // mulps         0x251e(%rip),%xmm2        # 5700 <_sk_callback_sse2+0xb9b>
+  .byte  15,89,21,36,37,0,0                  // mulps         0x2524(%rip),%xmm2        # 5700 <_sk_callback_sse2+0xba1>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,37,37,0,0                  // movaps        0x2525(%rip),%xmm3        # 5710 <_sk_callback_sse2+0xbab>
+  .byte  15,40,29,43,37,0,0                  // movaps        0x252b(%rip),%xmm3        # 5710 <_sk_callback_sse2+0xbb1>
   .byte  255,224                             // jmpq          *%rax
 
 HIDDEN _sk_store_565_sse2
@@ -30601,12 +30589,12 @@
 _sk_store_565_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,38,37,0,0                // movaps        0x2526(%rip),%xmm8        # 5720 <_sk_callback_sse2+0xbbb>
+  .byte  68,15,40,5,44,37,0,0                // movaps        0x252c(%rip),%xmm8        # 5720 <_sk_callback_sse2+0xbc1>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
   .byte  102,65,15,114,241,11                // pslld         $0xb,%xmm9
-  .byte  68,15,40,21,27,37,0,0               // movaps        0x251b(%rip),%xmm10        # 5730 <_sk_callback_sse2+0xbcb>
+  .byte  68,15,40,21,33,37,0,0               // movaps        0x2521(%rip),%xmm10        # 5730 <_sk_callback_sse2+0xbd1>
   .byte  68,15,89,209                        // mulps         %xmm1,%xmm10
   .byte  102,69,15,91,210                    // cvtps2dq      %xmm10,%xmm10
   .byte  102,65,15,114,242,5                 // pslld         $0x5,%xmm10
@@ -30630,21 +30618,21 @@
   .byte  243,15,126,28,120                   // movq          (%rax,%rdi,2),%xmm3
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,216                       // punpcklwd     %xmm0,%xmm3
-  .byte  102,15,111,5,212,36,0,0             // movdqa        0x24d4(%rip),%xmm0        # 5740 <_sk_callback_sse2+0xbdb>
+  .byte  102,15,111,5,218,36,0,0             // movdqa        0x24da(%rip),%xmm0        # 5740 <_sk_callback_sse2+0xbe1>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,214,36,0,0                  // mulps         0x24d6(%rip),%xmm0        # 5750 <_sk_callback_sse2+0xbeb>
-  .byte  102,15,111,13,222,36,0,0            // movdqa        0x24de(%rip),%xmm1        # 5760 <_sk_callback_sse2+0xbfb>
+  .byte  15,89,5,220,36,0,0                  // mulps         0x24dc(%rip),%xmm0        # 5750 <_sk_callback_sse2+0xbf1>
+  .byte  102,15,111,13,228,36,0,0            // movdqa        0x24e4(%rip),%xmm1        # 5760 <_sk_callback_sse2+0xc01>
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,224,36,0,0                 // mulps         0x24e0(%rip),%xmm1        # 5770 <_sk_callback_sse2+0xc0b>
-  .byte  102,15,111,21,232,36,0,0            // movdqa        0x24e8(%rip),%xmm2        # 5780 <_sk_callback_sse2+0xc1b>
+  .byte  15,89,13,230,36,0,0                 // mulps         0x24e6(%rip),%xmm1        # 5770 <_sk_callback_sse2+0xc11>
+  .byte  102,15,111,21,238,36,0,0            // movdqa        0x24ee(%rip),%xmm2        # 5780 <_sk_callback_sse2+0xc21>
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,234,36,0,0                 // mulps         0x24ea(%rip),%xmm2        # 5790 <_sk_callback_sse2+0xc2b>
-  .byte  102,15,219,29,242,36,0,0            // pand          0x24f2(%rip),%xmm3        # 57a0 <_sk_callback_sse2+0xc3b>
+  .byte  15,89,21,240,36,0,0                 // mulps         0x24f0(%rip),%xmm2        # 5790 <_sk_callback_sse2+0xc31>
+  .byte  102,15,219,29,248,36,0,0            // pand          0x24f8(%rip),%xmm3        # 57a0 <_sk_callback_sse2+0xc41>
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,248,36,0,0                 // mulps         0x24f8(%rip),%xmm3        # 57b0 <_sk_callback_sse2+0xc4b>
+  .byte  15,89,29,254,36,0,0                 // mulps         0x24fe(%rip),%xmm3        # 57b0 <_sk_callback_sse2+0xc51>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
@@ -30680,21 +30668,21 @@
   .byte  102,15,196,216,3                    // pinsrw        $0x3,%eax,%xmm3
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,216                       // punpcklwd     %xmm0,%xmm3
-  .byte  102,15,111,5,127,36,0,0             // movdqa        0x247f(%rip),%xmm0        # 57c0 <_sk_callback_sse2+0xc5b>
+  .byte  102,15,111,5,133,36,0,0             // movdqa        0x2485(%rip),%xmm0        # 57c0 <_sk_callback_sse2+0xc61>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,129,36,0,0                  // mulps         0x2481(%rip),%xmm0        # 57d0 <_sk_callback_sse2+0xc6b>
-  .byte  102,15,111,13,137,36,0,0            // movdqa        0x2489(%rip),%xmm1        # 57e0 <_sk_callback_sse2+0xc7b>
+  .byte  15,89,5,135,36,0,0                  // mulps         0x2487(%rip),%xmm0        # 57d0 <_sk_callback_sse2+0xc71>
+  .byte  102,15,111,13,143,36,0,0            // movdqa        0x248f(%rip),%xmm1        # 57e0 <_sk_callback_sse2+0xc81>
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,139,36,0,0                 // mulps         0x248b(%rip),%xmm1        # 57f0 <_sk_callback_sse2+0xc8b>
-  .byte  102,15,111,21,147,36,0,0            // movdqa        0x2493(%rip),%xmm2        # 5800 <_sk_callback_sse2+0xc9b>
+  .byte  15,89,13,145,36,0,0                 // mulps         0x2491(%rip),%xmm1        # 57f0 <_sk_callback_sse2+0xc91>
+  .byte  102,15,111,21,153,36,0,0            // movdqa        0x2499(%rip),%xmm2        # 5800 <_sk_callback_sse2+0xca1>
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,149,36,0,0                 // mulps         0x2495(%rip),%xmm2        # 5810 <_sk_callback_sse2+0xcab>
-  .byte  102,15,219,29,157,36,0,0            // pand          0x249d(%rip),%xmm3        # 5820 <_sk_callback_sse2+0xcbb>
+  .byte  15,89,21,155,36,0,0                 // mulps         0x249b(%rip),%xmm2        # 5810 <_sk_callback_sse2+0xcb1>
+  .byte  102,15,219,29,163,36,0,0            // pand          0x24a3(%rip),%xmm3        # 5820 <_sk_callback_sse2+0xcc1>
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,163,36,0,0                 // mulps         0x24a3(%rip),%xmm3        # 5830 <_sk_callback_sse2+0xccb>
+  .byte  15,89,29,169,36,0,0                 // mulps         0x24a9(%rip),%xmm3        # 5830 <_sk_callback_sse2+0xcd1>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
@@ -30704,7 +30692,7 @@
 _sk_store_4444_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,162,36,0,0               // movaps        0x24a2(%rip),%xmm8        # 5840 <_sk_callback_sse2+0xcdb>
+  .byte  68,15,40,5,168,36,0,0               // movaps        0x24a8(%rip),%xmm8        # 5840 <_sk_callback_sse2+0xce1>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -30736,11 +30724,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  68,15,16,12,184                     // movups        (%rax,%rdi,4),%xmm9
-  .byte  15,40,21,53,36,0,0                  // movaps        0x2435(%rip),%xmm2        # 5850 <_sk_callback_sse2+0xceb>
+  .byte  15,40,21,59,36,0,0                  // movaps        0x243b(%rip),%xmm2        # 5850 <_sk_callback_sse2+0xcf1>
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  15,84,194                           // andps         %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,51,36,0,0                // movaps        0x2433(%rip),%xmm8        # 5860 <_sk_callback_sse2+0xcfb>
+  .byte  68,15,40,5,57,36,0,0                // movaps        0x2439(%rip),%xmm8        # 5860 <_sk_callback_sse2+0xd01>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  65,15,40,201                        // movaps        %xmm9,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -30789,11 +30777,11 @@
   .byte  102,67,15,110,12,129                // movd          (%r9,%r8,4),%xmm1
   .byte  102,68,15,98,201                    // punpckldq     %xmm1,%xmm9
   .byte  102,68,15,98,200                    // punpckldq     %xmm0,%xmm9
-  .byte  102,15,111,21,132,35,0,0            // movdqa        0x2384(%rip),%xmm2        # 5870 <_sk_callback_sse2+0xd0b>
+  .byte  102,15,111,21,138,35,0,0            // movdqa        0x238a(%rip),%xmm2        # 5870 <_sk_callback_sse2+0xd11>
   .byte  102,65,15,111,193                   // movdqa        %xmm9,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,128,35,0,0               // movaps        0x2380(%rip),%xmm8        # 5880 <_sk_callback_sse2+0xd1b>
+  .byte  68,15,40,5,134,35,0,0               // movaps        0x2386(%rip),%xmm8        # 5880 <_sk_callback_sse2+0xd21>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -30817,7 +30805,7 @@
 _sk_store_8888_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,67,35,0,0                // movaps        0x2343(%rip),%xmm8        # 5890 <_sk_callback_sse2+0xd2b>
+  .byte  68,15,40,5,73,35,0,0                // movaps        0x2349(%rip),%xmm8        # 5890 <_sk_callback_sse2+0xd31>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -30856,7 +30844,7 @@
   .byte  102,69,15,239,210                   // pxor          %xmm10,%xmm10
   .byte  102,65,15,111,206                   // movdqa        %xmm14,%xmm1
   .byte  102,65,15,97,202                    // punpcklwd     %xmm10,%xmm1
-  .byte  102,68,15,111,13,179,34,0,0         // movdqa        0x22b3(%rip),%xmm9        # 58a0 <_sk_callback_sse2+0xd3b>
+  .byte  102,68,15,111,13,185,34,0,0         // movdqa        0x22b9(%rip),%xmm9        # 58a0 <_sk_callback_sse2+0xd41>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,193                   // pand          %xmm9,%xmm0
   .byte  102,15,239,200                      // pxor          %xmm0,%xmm1
@@ -30864,11 +30852,11 @@
   .byte  102,68,15,111,233                   // movdqa        %xmm1,%xmm13
   .byte  102,65,15,114,245,13                // pslld         $0xd,%xmm13
   .byte  102,68,15,235,232                   // por           %xmm0,%xmm13
-  .byte  102,68,15,111,29,152,34,0,0         // movdqa        0x2298(%rip),%xmm11        # 58b0 <_sk_callback_sse2+0xd4b>
+  .byte  102,68,15,111,29,158,34,0,0         // movdqa        0x229e(%rip),%xmm11        # 58b0 <_sk_callback_sse2+0xd51>
   .byte  102,69,15,254,235                   // paddd         %xmm11,%xmm13
-  .byte  102,68,15,111,37,154,34,0,0         // movdqa        0x229a(%rip),%xmm12        # 58c0 <_sk_callback_sse2+0xd5b>
+  .byte  102,68,15,111,37,160,34,0,0         // movdqa        0x22a0(%rip),%xmm12        # 58c0 <_sk_callback_sse2+0xd61>
   .byte  102,65,15,239,204                   // pxor          %xmm12,%xmm1
-  .byte  102,15,111,29,157,34,0,0            // movdqa        0x229d(%rip),%xmm3        # 58d0 <_sk_callback_sse2+0xd6b>
+  .byte  102,15,111,29,163,34,0,0            // movdqa        0x22a3(%rip),%xmm3        # 58d0 <_sk_callback_sse2+0xd71>
   .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
   .byte  102,15,102,193                      // pcmpgtd       %xmm1,%xmm0
   .byte  102,65,15,223,197                   // pandn         %xmm13,%xmm0
@@ -30954,7 +30942,7 @@
   .byte  102,69,15,239,210                   // pxor          %xmm10,%xmm10
   .byte  102,65,15,111,206                   // movdqa        %xmm14,%xmm1
   .byte  102,65,15,97,202                    // punpcklwd     %xmm10,%xmm1
-  .byte  102,68,15,111,13,43,33,0,0          // movdqa        0x212b(%rip),%xmm9        # 58e0 <_sk_callback_sse2+0xd7b>
+  .byte  102,68,15,111,13,49,33,0,0          // movdqa        0x2131(%rip),%xmm9        # 58e0 <_sk_callback_sse2+0xd81>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,193                   // pand          %xmm9,%xmm0
   .byte  102,15,239,200                      // pxor          %xmm0,%xmm1
@@ -30962,11 +30950,11 @@
   .byte  102,68,15,111,233                   // movdqa        %xmm1,%xmm13
   .byte  102,65,15,114,245,13                // pslld         $0xd,%xmm13
   .byte  102,68,15,235,232                   // por           %xmm0,%xmm13
-  .byte  102,68,15,111,29,16,33,0,0          // movdqa        0x2110(%rip),%xmm11        # 58f0 <_sk_callback_sse2+0xd8b>
+  .byte  102,68,15,111,29,22,33,0,0          // movdqa        0x2116(%rip),%xmm11        # 58f0 <_sk_callback_sse2+0xd91>
   .byte  102,69,15,254,235                   // paddd         %xmm11,%xmm13
-  .byte  102,68,15,111,37,18,33,0,0          // movdqa        0x2112(%rip),%xmm12        # 5900 <_sk_callback_sse2+0xd9b>
+  .byte  102,68,15,111,37,24,33,0,0          // movdqa        0x2118(%rip),%xmm12        # 5900 <_sk_callback_sse2+0xda1>
   .byte  102,65,15,239,204                   // pxor          %xmm12,%xmm1
-  .byte  102,15,111,29,21,33,0,0             // movdqa        0x2115(%rip),%xmm3        # 5910 <_sk_callback_sse2+0xdab>
+  .byte  102,15,111,29,27,33,0,0             // movdqa        0x211b(%rip),%xmm3        # 5910 <_sk_callback_sse2+0xdb1>
   .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
   .byte  102,15,102,193                      // pcmpgtd       %xmm1,%xmm0
   .byte  102,65,15,223,197                   // pandn         %xmm13,%xmm0
@@ -31019,17 +31007,17 @@
 _sk_store_f16_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  102,68,15,111,21,61,32,0,0          // movdqa        0x203d(%rip),%xmm10        # 5920 <_sk_callback_sse2+0xdbb>
+  .byte  102,68,15,111,21,67,32,0,0          // movdqa        0x2043(%rip),%xmm10        # 5920 <_sk_callback_sse2+0xdc1>
   .byte  102,68,15,111,224                   // movdqa        %xmm0,%xmm12
   .byte  102,68,15,111,232                   // movdqa        %xmm0,%xmm13
   .byte  102,69,15,219,234                   // pand          %xmm10,%xmm13
   .byte  102,69,15,239,229                   // pxor          %xmm13,%xmm12
-  .byte  102,68,15,111,13,48,32,0,0          // movdqa        0x2030(%rip),%xmm9        # 5930 <_sk_callback_sse2+0xdcb>
+  .byte  102,68,15,111,13,54,32,0,0          // movdqa        0x2036(%rip),%xmm9        # 5930 <_sk_callback_sse2+0xdd1>
   .byte  102,65,15,114,213,16                // psrld         $0x10,%xmm13
   .byte  102,69,15,111,193                   // movdqa        %xmm9,%xmm8
   .byte  102,69,15,102,196                   // pcmpgtd       %xmm12,%xmm8
   .byte  102,65,15,114,212,13                // psrld         $0xd,%xmm12
-  .byte  102,68,15,111,29,33,32,0,0          // movdqa        0x2021(%rip),%xmm11        # 5940 <_sk_callback_sse2+0xddb>
+  .byte  102,68,15,111,29,39,32,0,0          // movdqa        0x2027(%rip),%xmm11        # 5940 <_sk_callback_sse2+0xde1>
   .byte  102,69,15,235,235                   // por           %xmm11,%xmm13
   .byte  102,69,15,254,236                   // paddd         %xmm12,%xmm13
   .byte  102,65,15,114,245,16                // pslld         $0x10,%xmm13
@@ -31108,7 +31096,7 @@
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
   .byte  102,65,15,97,201                    // punpcklwd     %xmm9,%xmm1
   .byte  15,91,193                           // cvtdq2ps      %xmm1,%xmm0
-  .byte  68,15,40,5,191,30,0,0               // movaps        0x1ebf(%rip),%xmm8        # 5950 <_sk_callback_sse2+0xdeb>
+  .byte  68,15,40,5,197,30,0,0               // movaps        0x1ec5(%rip),%xmm8        # 5950 <_sk_callback_sse2+0xdf1>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -31161,7 +31149,7 @@
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  102,65,15,97,192                    // punpcklwd     %xmm8,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,13,251,29,0,0              // movaps        0x1dfb(%rip),%xmm9        # 5960 <_sk_callback_sse2+0xdfb>
+  .byte  68,15,40,13,1,30,0,0                // movaps        0x1e01(%rip),%xmm9        # 5960 <_sk_callback_sse2+0xe01>
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -31178,7 +31166,7 @@
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,209                        // mulps         %xmm9,%xmm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,194,29,0,0                 // movaps        0x1dc2(%rip),%xmm3        # 5970 <_sk_callback_sse2+0xe0b>
+  .byte  15,40,29,200,29,0,0                 // movaps        0x1dc8(%rip),%xmm3        # 5970 <_sk_callback_sse2+0xe11>
   .byte  255,224                             // jmpq          *%rax
 
 HIDDEN _sk_store_u16_be_sse2
@@ -31187,7 +31175,7 @@
 _sk_store_u16_be_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,13,195,29,0,0              // movaps        0x1dc3(%rip),%xmm9        # 5980 <_sk_callback_sse2+0xe1b>
+  .byte  68,15,40,13,201,29,0,0              // movaps        0x1dc9(%rip),%xmm9        # 5980 <_sk_callback_sse2+0xe21>
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
@@ -31333,7 +31321,7 @@
   .byte  243,69,15,91,209                    // cvttps2dq     %xmm9,%xmm10
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
   .byte  69,15,194,202,1                     // cmpltps       %xmm10,%xmm9
-  .byte  68,15,84,13,195,27,0,0              // andps         0x1bc3(%rip),%xmm9        # 5990 <_sk_callback_sse2+0xe2b>
+  .byte  68,15,84,13,201,27,0,0              // andps         0x1bc9(%rip),%xmm9        # 5990 <_sk_callback_sse2+0xe31>
   .byte  69,15,92,209                        // subps         %xmm9,%xmm10
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
   .byte  65,15,92,194                        // subps         %xmm10,%xmm0
@@ -31353,7 +31341,7 @@
   .byte  243,69,15,91,209                    // cvttps2dq     %xmm9,%xmm10
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
   .byte  69,15,194,202,1                     // cmpltps       %xmm10,%xmm9
-  .byte  68,15,84,13,149,27,0,0              // andps         0x1b95(%rip),%xmm9        # 59a0 <_sk_callback_sse2+0xe3b>
+  .byte  68,15,84,13,155,27,0,0              // andps         0x1b9b(%rip),%xmm9        # 59a0 <_sk_callback_sse2+0xe41>
   .byte  69,15,92,209                        // subps         %xmm9,%xmm10
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
   .byte  65,15,92,202                        // subps         %xmm10,%xmm1
@@ -31377,7 +31365,7 @@
   .byte  243,69,15,91,218                    // cvttps2dq     %xmm10,%xmm11
   .byte  69,15,91,219                        // cvtdq2ps      %xmm11,%xmm11
   .byte  69,15,194,211,1                     // cmpltps       %xmm11,%xmm10
-  .byte  68,15,84,21,85,27,0,0               // andps         0x1b55(%rip),%xmm10        # 59b0 <_sk_callback_sse2+0xe4b>
+  .byte  68,15,84,21,91,27,0,0               // andps         0x1b5b(%rip),%xmm10        # 59b0 <_sk_callback_sse2+0xe51>
   .byte  69,15,87,228                        // xorps         %xmm12,%xmm12
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
   .byte  69,15,89,216                        // mulps         %xmm8,%xmm11
@@ -31405,7 +31393,7 @@
   .byte  243,69,15,91,218                    // cvttps2dq     %xmm10,%xmm11
   .byte  69,15,91,219                        // cvtdq2ps      %xmm11,%xmm11
   .byte  69,15,194,211,1                     // cmpltps       %xmm11,%xmm10
-  .byte  68,15,84,21,5,27,0,0                // andps         0x1b05(%rip),%xmm10        # 59c0 <_sk_callback_sse2+0xe5b>
+  .byte  68,15,84,21,11,27,0,0               // andps         0x1b0b(%rip),%xmm10        # 59c0 <_sk_callback_sse2+0xe61>
   .byte  69,15,87,228                        // xorps         %xmm12,%xmm12
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
   .byte  69,15,89,216                        // mulps         %xmm8,%xmm11
@@ -31422,10 +31410,10 @@
 FUNCTION(_sk_luminance_to_alpha_sse2)
 _sk_luminance_to_alpha_sse2:
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
-  .byte  15,89,5,231,26,0,0                  // mulps         0x1ae7(%rip),%xmm0        # 59d0 <_sk_callback_sse2+0xe6b>
-  .byte  15,89,13,240,26,0,0                 // mulps         0x1af0(%rip),%xmm1        # 59e0 <_sk_callback_sse2+0xe7b>
+  .byte  15,89,5,237,26,0,0                  // mulps         0x1aed(%rip),%xmm0        # 59d0 <_sk_callback_sse2+0xe71>
+  .byte  15,89,13,246,26,0,0                 // mulps         0x1af6(%rip),%xmm1        # 59e0 <_sk_callback_sse2+0xe81>
   .byte  15,88,200                           // addps         %xmm0,%xmm1
-  .byte  15,89,29,246,26,0,0                 // mulps         0x1af6(%rip),%xmm3        # 59f0 <_sk_callback_sse2+0xe8b>
+  .byte  15,89,29,252,26,0,0                 // mulps         0x1afc(%rip),%xmm3        # 59f0 <_sk_callback_sse2+0xe91>
   .byte  15,88,217                           // addps         %xmm1,%xmm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
@@ -31701,9 +31689,9 @@
   .byte  72,139,8                            // mov           (%rax),%rcx
   .byte  76,139,88,8                         // mov           0x8(%rax),%r11
   .byte  72,255,201                          // dec           %rcx
-  .byte  120,7                               // js            4333 <_sk_evenly_spaced_gradient_sse2+0x15>
+  .byte  120,7                               // js            432d <_sk_evenly_spaced_gradient_sse2+0x15>
   .byte  243,72,15,42,201                    // cvtsi2ss      %rcx,%xmm1
-  .byte  235,21                              // jmp           4348 <_sk_evenly_spaced_gradient_sse2+0x2a>
+  .byte  235,21                              // jmp           4342 <_sk_evenly_spaced_gradient_sse2+0x2a>
   .byte  73,137,200                          // mov           %rcx,%r8
   .byte  73,209,232                          // shr           %r8
   .byte  131,225,1                           // and           $0x1,%ecx
@@ -31803,12 +31791,12 @@
   .byte  76,139,0                            // mov           (%rax),%r8
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,2                        // cmp           $0x2,%r8
-  .byte  114,50                              // jb            450b <_sk_gradient_sse2+0x41>
+  .byte  114,50                              // jb            4505 <_sk_gradient_sse2+0x41>
   .byte  72,139,72,72                        // mov           0x48(%rax),%rcx
   .byte  73,255,200                          // dec           %r8
   .byte  72,131,193,4                        // add           $0x4,%rcx
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  15,40,21,17,21,0,0                  // movaps        0x1511(%rip),%xmm2        # 5a00 <_sk_callback_sse2+0xe9b>
+  .byte  15,40,21,23,21,0,0                  // movaps        0x1517(%rip),%xmm2        # 5a00 <_sk_callback_sse2+0xea1>
   .byte  243,15,16,25                        // movss         (%rcx),%xmm3
   .byte  15,198,219,0                        // shufps        $0x0,%xmm3,%xmm3
   .byte  15,194,216,2                        // cmpleps       %xmm0,%xmm3
@@ -31816,7 +31804,7 @@
   .byte  102,15,254,203                      // paddd         %xmm3,%xmm1
   .byte  72,131,193,4                        // add           $0x4,%rcx
   .byte  73,255,200                          // dec           %r8
-  .byte  117,228                             // jne           44ef <_sk_gradient_sse2+0x25>
+  .byte  117,228                             // jne           44e9 <_sk_gradient_sse2+0x25>
   .byte  65,86                               // push          %r14
   .byte  83                                  // push          %rbx
   .byte  102,15,112,209,78                   // pshufd        $0x4e,%xmm1,%xmm2
@@ -31956,29 +31944,29 @@
   .byte  69,15,94,220                        // divps         %xmm12,%xmm11
   .byte  69,15,40,227                        // movaps        %xmm11,%xmm12
   .byte  69,15,89,228                        // mulps         %xmm12,%xmm12
-  .byte  68,15,40,45,211,18,0,0              // movaps        0x12d3(%rip),%xmm13        # 5a10 <_sk_callback_sse2+0xeab>
+  .byte  68,15,40,45,217,18,0,0              // movaps        0x12d9(%rip),%xmm13        # 5a10 <_sk_callback_sse2+0xeb1>
   .byte  69,15,89,236                        // mulps         %xmm12,%xmm13
-  .byte  68,15,88,45,215,18,0,0              // addps         0x12d7(%rip),%xmm13        # 5a20 <_sk_callback_sse2+0xebb>
+  .byte  68,15,88,45,221,18,0,0              // addps         0x12dd(%rip),%xmm13        # 5a20 <_sk_callback_sse2+0xec1>
   .byte  69,15,89,236                        // mulps         %xmm12,%xmm13
-  .byte  68,15,88,45,219,18,0,0              // addps         0x12db(%rip),%xmm13        # 5a30 <_sk_callback_sse2+0xecb>
+  .byte  68,15,88,45,225,18,0,0              // addps         0x12e1(%rip),%xmm13        # 5a30 <_sk_callback_sse2+0xed1>
   .byte  69,15,89,236                        // mulps         %xmm12,%xmm13
-  .byte  68,15,88,45,223,18,0,0              // addps         0x12df(%rip),%xmm13        # 5a40 <_sk_callback_sse2+0xedb>
+  .byte  68,15,88,45,229,18,0,0              // addps         0x12e5(%rip),%xmm13        # 5a40 <_sk_callback_sse2+0xee1>
   .byte  69,15,89,235                        // mulps         %xmm11,%xmm13
   .byte  69,15,194,202,1                     // cmpltps       %xmm10,%xmm9
-  .byte  68,15,40,21,222,18,0,0              // movaps        0x12de(%rip),%xmm10        # 5a50 <_sk_callback_sse2+0xeeb>
+  .byte  68,15,40,21,228,18,0,0              // movaps        0x12e4(%rip),%xmm10        # 5a50 <_sk_callback_sse2+0xef1>
   .byte  69,15,92,213                        // subps         %xmm13,%xmm10
   .byte  69,15,84,209                        // andps         %xmm9,%xmm10
   .byte  69,15,85,205                        // andnps        %xmm13,%xmm9
   .byte  69,15,86,202                        // orps          %xmm10,%xmm9
   .byte  68,15,194,192,1                     // cmpltps       %xmm0,%xmm8
-  .byte  68,15,40,21,209,18,0,0              // movaps        0x12d1(%rip),%xmm10        # 5a60 <_sk_callback_sse2+0xefb>
+  .byte  68,15,40,21,215,18,0,0              // movaps        0x12d7(%rip),%xmm10        # 5a60 <_sk_callback_sse2+0xf01>
   .byte  69,15,92,209                        // subps         %xmm9,%xmm10
   .byte  69,15,84,208                        // andps         %xmm8,%xmm10
   .byte  69,15,85,193                        // andnps        %xmm9,%xmm8
   .byte  69,15,86,194                        // orps          %xmm10,%xmm8
   .byte  68,15,40,201                        // movaps        %xmm1,%xmm9
   .byte  68,15,194,200,1                     // cmpltps       %xmm0,%xmm9
-  .byte  68,15,40,21,192,18,0,0              // movaps        0x12c0(%rip),%xmm10        # 5a70 <_sk_callback_sse2+0xf0b>
+  .byte  68,15,40,21,198,18,0,0              // movaps        0x12c6(%rip),%xmm10        # 5a70 <_sk_callback_sse2+0xf11>
   .byte  69,15,92,208                        // subps         %xmm8,%xmm10
   .byte  69,15,84,209                        // andps         %xmm9,%xmm10
   .byte  69,15,85,200                        // andnps        %xmm8,%xmm9
@@ -32005,7 +31993,7 @@
 FUNCTION(_sk_save_xy_sse2)
 _sk_save_xy_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,146,18,0,0               // movaps        0x1292(%rip),%xmm8        # 5a80 <_sk_callback_sse2+0xf1b>
+  .byte  68,15,40,5,152,18,0,0               // movaps        0x1298(%rip),%xmm8        # 5a80 <_sk_callback_sse2+0xf21>
   .byte  15,17,0                             // movups        %xmm0,(%rax)
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,88,200                        // addps         %xmm8,%xmm9
@@ -32013,7 +32001,7 @@
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
   .byte  69,15,40,217                        // movaps        %xmm9,%xmm11
   .byte  69,15,194,218,1                     // cmpltps       %xmm10,%xmm11
-  .byte  68,15,40,37,125,18,0,0              // movaps        0x127d(%rip),%xmm12        # 5a90 <_sk_callback_sse2+0xf2b>
+  .byte  68,15,40,37,131,18,0,0              // movaps        0x1283(%rip),%xmm12        # 5a90 <_sk_callback_sse2+0xf31>
   .byte  69,15,84,220                        // andps         %xmm12,%xmm11
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
   .byte  69,15,92,202                        // subps         %xmm10,%xmm9
@@ -32060,8 +32048,8 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,246,17,0,0                  // addps         0x11f6(%rip),%xmm0        # 5aa0 <_sk_callback_sse2+0xf3b>
-  .byte  68,15,40,13,254,17,0,0              // movaps        0x11fe(%rip),%xmm9        # 5ab0 <_sk_callback_sse2+0xf4b>
+  .byte  15,88,5,252,17,0,0                  // addps         0x11fc(%rip),%xmm0        # 5aa0 <_sk_callback_sse2+0xf41>
+  .byte  68,15,40,13,4,18,0,0                // movaps        0x1204(%rip),%xmm9        # 5ab0 <_sk_callback_sse2+0xf51>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  68,15,17,136,128,0,0,0              // movups        %xmm9,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -32074,7 +32062,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,237,17,0,0                  // addps         0x11ed(%rip),%xmm0        # 5ac0 <_sk_callback_sse2+0xf5b>
+  .byte  15,88,5,243,17,0,0                  // addps         0x11f3(%rip),%xmm0        # 5ac0 <_sk_callback_sse2+0xf61>
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -32086,8 +32074,8 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,223,17,0,0                 // addps         0x11df(%rip),%xmm1        # 5ad0 <_sk_callback_sse2+0xf6b>
-  .byte  68,15,40,13,231,17,0,0              // movaps        0x11e7(%rip),%xmm9        # 5ae0 <_sk_callback_sse2+0xf7b>
+  .byte  15,88,13,229,17,0,0                 // addps         0x11e5(%rip),%xmm1        # 5ad0 <_sk_callback_sse2+0xf71>
+  .byte  68,15,40,13,237,17,0,0              // movaps        0x11ed(%rip),%xmm9        # 5ae0 <_sk_callback_sse2+0xf81>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  68,15,17,136,160,0,0,0              // movups        %xmm9,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -32100,7 +32088,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,213,17,0,0                 // addps         0x11d5(%rip),%xmm1        # 5af0 <_sk_callback_sse2+0xf8b>
+  .byte  15,88,13,219,17,0,0                 // addps         0x11db(%rip),%xmm1        # 5af0 <_sk_callback_sse2+0xf91>
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -32112,13 +32100,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,200,17,0,0                  // addps         0x11c8(%rip),%xmm0        # 5b00 <_sk_callback_sse2+0xf9b>
-  .byte  68,15,40,13,208,17,0,0              // movaps        0x11d0(%rip),%xmm9        # 5b10 <_sk_callback_sse2+0xfab>
+  .byte  15,88,5,206,17,0,0                  // addps         0x11ce(%rip),%xmm0        # 5b00 <_sk_callback_sse2+0xfa1>
+  .byte  68,15,40,13,214,17,0,0              // movaps        0x11d6(%rip),%xmm9        # 5b10 <_sk_callback_sse2+0xfb1>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  69,15,89,192                        // mulps         %xmm8,%xmm8
-  .byte  68,15,89,13,204,17,0,0              // mulps         0x11cc(%rip),%xmm9        # 5b20 <_sk_callback_sse2+0xfbb>
-  .byte  68,15,88,13,212,17,0,0              // addps         0x11d4(%rip),%xmm9        # 5b30 <_sk_callback_sse2+0xfcb>
+  .byte  68,15,89,13,210,17,0,0              // mulps         0x11d2(%rip),%xmm9        # 5b20 <_sk_callback_sse2+0xfc1>
+  .byte  68,15,88,13,218,17,0,0              // addps         0x11da(%rip),%xmm9        # 5b30 <_sk_callback_sse2+0xfd1>
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  68,15,17,136,128,0,0,0              // movups        %xmm9,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -32131,16 +32119,16 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,195,17,0,0                  // addps         0x11c3(%rip),%xmm0        # 5b40 <_sk_callback_sse2+0xfdb>
-  .byte  68,15,40,13,203,17,0,0              // movaps        0x11cb(%rip),%xmm9        # 5b50 <_sk_callback_sse2+0xfeb>
+  .byte  15,88,5,201,17,0,0                  // addps         0x11c9(%rip),%xmm0        # 5b40 <_sk_callback_sse2+0xfe1>
+  .byte  68,15,40,13,209,17,0,0              // movaps        0x11d1(%rip),%xmm9        # 5b50 <_sk_callback_sse2+0xff1>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
-  .byte  68,15,40,5,207,17,0,0               // movaps        0x11cf(%rip),%xmm8        # 5b60 <_sk_callback_sse2+0xffb>
+  .byte  68,15,40,5,213,17,0,0               // movaps        0x11d5(%rip),%xmm8        # 5b60 <_sk_callback_sse2+0x1001>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,211,17,0,0               // addps         0x11d3(%rip),%xmm8        # 5b70 <_sk_callback_sse2+0x100b>
+  .byte  68,15,88,5,217,17,0,0               // addps         0x11d9(%rip),%xmm8        # 5b70 <_sk_callback_sse2+0x1011>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,215,17,0,0               // addps         0x11d7(%rip),%xmm8        # 5b80 <_sk_callback_sse2+0x101b>
+  .byte  68,15,88,5,221,17,0,0               // addps         0x11dd(%rip),%xmm8        # 5b80 <_sk_callback_sse2+0x1021>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,219,17,0,0               // addps         0x11db(%rip),%xmm8        # 5b90 <_sk_callback_sse2+0x102b>
+  .byte  68,15,88,5,225,17,0,0               // addps         0x11e1(%rip),%xmm8        # 5b90 <_sk_callback_sse2+0x1031>
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -32150,17 +32138,17 @@
 FUNCTION(_sk_bicubic_p1x_sse2)
 _sk_bicubic_p1x_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,213,17,0,0               // movaps        0x11d5(%rip),%xmm8        # 5ba0 <_sk_callback_sse2+0x103b>
+  .byte  68,15,40,5,219,17,0,0               // movaps        0x11db(%rip),%xmm8        # 5ba0 <_sk_callback_sse2+0x1041>
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,72,64                      // movups        0x40(%rax),%xmm9
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
-  .byte  68,15,40,21,209,17,0,0              // movaps        0x11d1(%rip),%xmm10        # 5bb0 <_sk_callback_sse2+0x104b>
+  .byte  68,15,40,21,215,17,0,0              // movaps        0x11d7(%rip),%xmm10        # 5bb0 <_sk_callback_sse2+0x1051>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,213,17,0,0              // addps         0x11d5(%rip),%xmm10        # 5bc0 <_sk_callback_sse2+0x105b>
+  .byte  68,15,88,21,219,17,0,0              // addps         0x11db(%rip),%xmm10        # 5bc0 <_sk_callback_sse2+0x1061>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,209,17,0,0              // addps         0x11d1(%rip),%xmm10        # 5bd0 <_sk_callback_sse2+0x106b>
+  .byte  68,15,88,21,215,17,0,0              // addps         0x11d7(%rip),%xmm10        # 5bd0 <_sk_callback_sse2+0x1071>
   .byte  68,15,17,144,128,0,0,0              // movups        %xmm10,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -32172,11 +32160,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,196,17,0,0                  // addps         0x11c4(%rip),%xmm0        # 5be0 <_sk_callback_sse2+0x107b>
+  .byte  15,88,5,202,17,0,0                  // addps         0x11ca(%rip),%xmm0        # 5be0 <_sk_callback_sse2+0x1081>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  69,15,89,201                        // mulps         %xmm9,%xmm9
-  .byte  68,15,89,5,196,17,0,0               // mulps         0x11c4(%rip),%xmm8        # 5bf0 <_sk_callback_sse2+0x108b>
-  .byte  68,15,88,5,204,17,0,0               // addps         0x11cc(%rip),%xmm8        # 5c00 <_sk_callback_sse2+0x109b>
+  .byte  68,15,89,5,202,17,0,0               // mulps         0x11ca(%rip),%xmm8        # 5bf0 <_sk_callback_sse2+0x1091>
+  .byte  68,15,88,5,210,17,0,0               // addps         0x11d2(%rip),%xmm8        # 5c00 <_sk_callback_sse2+0x10a1>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -32189,13 +32177,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,186,17,0,0                 // addps         0x11ba(%rip),%xmm1        # 5c10 <_sk_callback_sse2+0x10ab>
-  .byte  68,15,40,13,194,17,0,0              // movaps        0x11c2(%rip),%xmm9        # 5c20 <_sk_callback_sse2+0x10bb>
+  .byte  15,88,13,192,17,0,0                 // addps         0x11c0(%rip),%xmm1        # 5c10 <_sk_callback_sse2+0x10b1>
+  .byte  68,15,40,13,200,17,0,0              // movaps        0x11c8(%rip),%xmm9        # 5c20 <_sk_callback_sse2+0x10c1>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  69,15,89,192                        // mulps         %xmm8,%xmm8
-  .byte  68,15,89,13,190,17,0,0              // mulps         0x11be(%rip),%xmm9        # 5c30 <_sk_callback_sse2+0x10cb>
-  .byte  68,15,88,13,198,17,0,0              // addps         0x11c6(%rip),%xmm9        # 5c40 <_sk_callback_sse2+0x10db>
+  .byte  68,15,89,13,196,17,0,0              // mulps         0x11c4(%rip),%xmm9        # 5c30 <_sk_callback_sse2+0x10d1>
+  .byte  68,15,88,13,204,17,0,0              // addps         0x11cc(%rip),%xmm9        # 5c40 <_sk_callback_sse2+0x10e1>
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  68,15,17,136,160,0,0,0              // movups        %xmm9,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -32208,16 +32196,16 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,180,17,0,0                 // addps         0x11b4(%rip),%xmm1        # 5c50 <_sk_callback_sse2+0x10eb>
-  .byte  68,15,40,13,188,17,0,0              // movaps        0x11bc(%rip),%xmm9        # 5c60 <_sk_callback_sse2+0x10fb>
+  .byte  15,88,13,186,17,0,0                 // addps         0x11ba(%rip),%xmm1        # 5c50 <_sk_callback_sse2+0x10f1>
+  .byte  68,15,40,13,194,17,0,0              // movaps        0x11c2(%rip),%xmm9        # 5c60 <_sk_callback_sse2+0x1101>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
-  .byte  68,15,40,5,192,17,0,0               // movaps        0x11c0(%rip),%xmm8        # 5c70 <_sk_callback_sse2+0x110b>
+  .byte  68,15,40,5,198,17,0,0               // movaps        0x11c6(%rip),%xmm8        # 5c70 <_sk_callback_sse2+0x1111>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,196,17,0,0               // addps         0x11c4(%rip),%xmm8        # 5c80 <_sk_callback_sse2+0x111b>
+  .byte  68,15,88,5,202,17,0,0               // addps         0x11ca(%rip),%xmm8        # 5c80 <_sk_callback_sse2+0x1121>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,200,17,0,0               // addps         0x11c8(%rip),%xmm8        # 5c90 <_sk_callback_sse2+0x112b>
+  .byte  68,15,88,5,206,17,0,0               // addps         0x11ce(%rip),%xmm8        # 5c90 <_sk_callback_sse2+0x1131>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,204,17,0,0               // addps         0x11cc(%rip),%xmm8        # 5ca0 <_sk_callback_sse2+0x113b>
+  .byte  68,15,88,5,210,17,0,0               // addps         0x11d2(%rip),%xmm8        # 5ca0 <_sk_callback_sse2+0x1141>
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -32227,17 +32215,17 @@
 FUNCTION(_sk_bicubic_p1y_sse2)
 _sk_bicubic_p1y_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,198,17,0,0               // movaps        0x11c6(%rip),%xmm8        # 5cb0 <_sk_callback_sse2+0x114b>
+  .byte  68,15,40,5,204,17,0,0               // movaps        0x11cc(%rip),%xmm8        # 5cb0 <_sk_callback_sse2+0x1151>
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,72,96                      // movups        0x60(%rax),%xmm9
   .byte  65,15,88,200                        // addps         %xmm8,%xmm1
-  .byte  68,15,40,21,193,17,0,0              // movaps        0x11c1(%rip),%xmm10        # 5cc0 <_sk_callback_sse2+0x115b>
+  .byte  68,15,40,21,199,17,0,0              // movaps        0x11c7(%rip),%xmm10        # 5cc0 <_sk_callback_sse2+0x1161>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,197,17,0,0              // addps         0x11c5(%rip),%xmm10        # 5cd0 <_sk_callback_sse2+0x116b>
+  .byte  68,15,88,21,203,17,0,0              // addps         0x11cb(%rip),%xmm10        # 5cd0 <_sk_callback_sse2+0x1171>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,193,17,0,0              // addps         0x11c1(%rip),%xmm10        # 5ce0 <_sk_callback_sse2+0x117b>
+  .byte  68,15,88,21,199,17,0,0              // addps         0x11c7(%rip),%xmm10        # 5ce0 <_sk_callback_sse2+0x1181>
   .byte  68,15,17,144,160,0,0,0              // movups        %xmm10,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -32249,11 +32237,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,179,17,0,0                 // addps         0x11b3(%rip),%xmm1        # 5cf0 <_sk_callback_sse2+0x118b>
+  .byte  15,88,13,185,17,0,0                 // addps         0x11b9(%rip),%xmm1        # 5cf0 <_sk_callback_sse2+0x1191>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  69,15,89,201                        // mulps         %xmm9,%xmm9
-  .byte  68,15,89,5,179,17,0,0               // mulps         0x11b3(%rip),%xmm8        # 5d00 <_sk_callback_sse2+0x119b>
-  .byte  68,15,88,5,187,17,0,0               // addps         0x11bb(%rip),%xmm8        # 5d10 <_sk_callback_sse2+0x11ab>
+  .byte  68,15,89,5,185,17,0,0               // mulps         0x11b9(%rip),%xmm8        # 5d00 <_sk_callback_sse2+0x11a1>
+  .byte  68,15,88,5,193,17,0,0               // addps         0x11c1(%rip),%xmm8        # 5d10 <_sk_callback_sse2+0x11b1>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -32947,7 +32935,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a391fa <_sk_callback_sse2+0xffffffffe9a34695>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a391fa <_sk_callback_sse2+0xffffffffe9a3469b>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
@@ -33042,7 +33030,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a392ca <_sk_callback_sse2+0xffffffffe9a34765>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a392ca <_sk_callback_sse2+0xffffffffe9a3476b>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
@@ -33137,7 +33125,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3939a <_sk_callback_sse2+0xffffffffe9a34835>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3939a <_sk_callback_sse2+0xffffffffe9a3483b>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
@@ -33232,7 +33220,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3946a <_sk_callback_sse2+0xffffffffe9a34905>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3946a <_sk_callback_sse2+0xffffffffe9a3490b>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
@@ -33915,7 +33903,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63e9d5 <_sk_callback_sse2+0x3d639e70>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63e9d5 <_sk_callback_sse2+0x3d639e76>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -33941,7 +33929,7 @@
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63ea15 <_sk_callback_sse2+0x3d639eb0>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63ea15 <_sk_callback_sse2+0x3d639eb6>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
@@ -34025,7 +34013,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63eae5 <_sk_callback_sse2+0x3d639f80>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63eae5 <_sk_callback_sse2+0x3d639f86>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -34051,7 +34039,7 @@
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63eb25 <_sk_callback_sse2+0x3d639fc0>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63eb25 <_sk_callback_sse2+0x3d639fc6>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
@@ -34062,11 +34050,11 @@
   .byte  63                                  // (bad)
   .byte  114,28                              // jb            5d1e <.literal16+0x10de>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         5d22 <_sk_callback_sse2+0x11bd>
+  .byte  62,114,28                           // jb,pt         5d22 <_sk_callback_sse2+0x11c3>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         5d26 <_sk_callback_sse2+0x11c1>
+  .byte  62,114,28                           // jb,pt         5d26 <_sk_callback_sse2+0x11c7>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         5d2a <_sk_callback_sse2+0x11c5>
+  .byte  62,114,28                           // jb,pt         5d2a <_sk_callback_sse2+0x11cb>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
diff --git a/src/jumper/SkJumper_generated_win.S b/src/jumper/SkJumper_generated_win.S
index 3890657..268cd26 100644
--- a/src/jumper/SkJumper_generated_win.S
+++ b/src/jumper/SkJumper_generated_win.S
@@ -106,14 +106,14 @@
   DB  197,249,110,199                     ; vmovd         %edi,%xmm0
   DB  196,226,125,88,192                  ; vpbroadcastd  %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,122,71,0,0        ; vbroadcastss  0x477a(%rip),%ymm1        # 48d4 <_sk_callback_hsw+0x11b>
+  DB  196,226,125,24,13,110,71,0,0        ; vbroadcastss  0x476e(%rip),%ymm1        # 48c8 <_sk_callback_hsw+0x11b>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  197,252,88,2                        ; vaddps        (%rdx),%ymm0,%ymm0
   DB  196,226,125,24,16                   ; vbroadcastss  (%rax),%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  197,236,88,201                      ; vaddps        %ymm1,%ymm2,%ymm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,21,94,71,0,0         ; vbroadcastss  0x475e(%rip),%ymm2        # 48d8 <_sk_callback_hsw+0x11f>
+  DB  196,226,125,24,21,82,71,0,0         ; vbroadcastss  0x4752(%rip),%ymm2        # 48cc <_sk_callback_hsw+0x11f>
   DB  197,228,87,219                      ; vxorps        %ymm3,%ymm3,%ymm3
   DB  197,220,87,228                      ; vxorps        %ymm4,%ymm4,%ymm4
   DB  197,212,87,237                      ; vxorps        %ymm5,%ymm5,%ymm5
@@ -126,19 +126,17 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,121,110,199                     ; vmovd         %edi,%xmm8
   DB  196,66,125,88,192                   ; vpbroadcastd  %xmm8,%ymm8
-  DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  197,60,88,2                         ; vaddps        (%rdx),%ymm8,%ymm8
-  DB  196,65,126,91,192                   ; vcvttps2dq    %ymm8,%ymm8
+  DB  197,61,254,66,32                    ; vpaddd        0x20(%rdx),%ymm8,%ymm8
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  196,66,125,88,8                     ; vpbroadcastd  (%r8),%ymm9
   DB  196,65,61,239,201                   ; vpxor         %ymm9,%ymm8,%ymm9
-  DB  196,98,125,88,21,29,71,0,0          ; vpbroadcastd  0x471d(%rip),%ymm10        # 48dc <_sk_callback_hsw+0x123>
+  DB  196,98,125,88,21,26,71,0,0          ; vpbroadcastd  0x471a(%rip),%ymm10        # 48d0 <_sk_callback_hsw+0x123>
   DB  196,65,53,219,218                   ; vpand         %ymm10,%ymm9,%ymm11
   DB  196,193,37,114,243,5                ; vpslld        $0x5,%ymm11,%ymm11
   DB  196,65,61,219,210                   ; vpand         %ymm10,%ymm8,%ymm10
   DB  196,193,45,114,242,4                ; vpslld        $0x4,%ymm10,%ymm10
-  DB  196,98,125,88,37,2,71,0,0           ; vpbroadcastd  0x4702(%rip),%ymm12        # 48e0 <_sk_callback_hsw+0x127>
-  DB  196,98,125,88,45,253,70,0,0         ; vpbroadcastd  0x46fd(%rip),%ymm13        # 48e4 <_sk_callback_hsw+0x12b>
+  DB  196,98,125,88,37,255,70,0,0         ; vpbroadcastd  0x46ff(%rip),%ymm12        # 48d4 <_sk_callback_hsw+0x127>
+  DB  196,98,125,88,45,250,70,0,0         ; vpbroadcastd  0x46fa(%rip),%ymm13        # 48d8 <_sk_callback_hsw+0x12b>
   DB  196,65,53,219,245                   ; vpand         %ymm13,%ymm9,%ymm14
   DB  196,193,13,114,246,2                ; vpslld        $0x2,%ymm14,%ymm14
   DB  196,65,61,219,237                   ; vpand         %ymm13,%ymm8,%ymm13
@@ -149,12 +147,12 @@
   DB  196,193,61,114,208,2                ; vpsrld        $0x2,%ymm8,%ymm8
   DB  196,65,21,235,210                   ; vpor          %ymm10,%ymm13,%ymm10
   DB  196,65,45,235,192                   ; vpor          %ymm8,%ymm10,%ymm8
-  DB  196,65,37,235,214                   ; vpor          %ymm14,%ymm11,%ymm10
-  DB  196,65,61,235,194                   ; vpor          %ymm10,%ymm8,%ymm8
+  DB  196,65,61,235,195                   ; vpor          %ymm11,%ymm8,%ymm8
+  DB  196,65,13,235,201                   ; vpor          %ymm9,%ymm14,%ymm9
   DB  196,65,61,235,193                   ; vpor          %ymm9,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,175,70,0,0         ; vbroadcastss  0x46af(%rip),%ymm9        # 48e8 <_sk_callback_hsw+0x12f>
-  DB  196,98,125,24,21,170,70,0,0         ; vbroadcastss  0x46aa(%rip),%ymm10        # 48ec <_sk_callback_hsw+0x133>
+  DB  196,98,125,24,13,172,70,0,0         ; vbroadcastss  0x46ac(%rip),%ymm9        # 48dc <_sk_callback_hsw+0x12f>
+  DB  196,98,125,24,21,167,70,0,0         ; vbroadcastss  0x46a7(%rip),%ymm10        # 48e0 <_sk_callback_hsw+0x133>
   DB  196,66,61,184,209                   ; vfmadd231ps   %ymm9,%ymm8,%ymm10
   DB  196,98,125,24,64,8                  ; vbroadcastss  0x8(%rax),%ymm8
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
@@ -213,7 +211,7 @@
 PUBLIC _sk_srcatop_hsw
 _sk_srcatop_hsw LABEL PROC
   DB  197,252,89,199                      ; vmulps        %ymm7,%ymm0,%ymm0
-  DB  196,98,125,24,5,1,70,0,0            ; vbroadcastss  0x4601(%rip),%ymm8        # 48f0 <_sk_callback_hsw+0x137>
+  DB  196,98,125,24,5,254,69,0,0          ; vbroadcastss  0x45fe(%rip),%ymm8        # 48e4 <_sk_callback_hsw+0x137>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,226,61,184,196                  ; vfmadd231ps   %ymm4,%ymm8,%ymm0
   DB  197,244,89,207                      ; vmulps        %ymm7,%ymm1,%ymm1
@@ -227,7 +225,7 @@
 
 PUBLIC _sk_dstatop_hsw
 _sk_dstatop_hsw LABEL PROC
-  DB  196,98,125,24,5,212,69,0,0          ; vbroadcastss  0x45d4(%rip),%ymm8        # 48f4 <_sk_callback_hsw+0x13b>
+  DB  196,98,125,24,5,209,69,0,0          ; vbroadcastss  0x45d1(%rip),%ymm8        # 48e8 <_sk_callback_hsw+0x13b>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  196,226,101,184,196                 ; vfmadd231ps   %ymm4,%ymm3,%ymm0
@@ -260,7 +258,7 @@
 
 PUBLIC _sk_srcout_hsw
 _sk_srcout_hsw LABEL PROC
-  DB  196,98,125,24,5,123,69,0,0          ; vbroadcastss  0x457b(%rip),%ymm8        # 48f8 <_sk_callback_hsw+0x13f>
+  DB  196,98,125,24,5,120,69,0,0          ; vbroadcastss  0x4578(%rip),%ymm8        # 48ec <_sk_callback_hsw+0x13f>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
@@ -271,7 +269,7 @@
 
 PUBLIC _sk_dstout_hsw
 _sk_dstout_hsw LABEL PROC
-  DB  196,226,125,24,5,94,69,0,0          ; vbroadcastss  0x455e(%rip),%ymm0        # 48fc <_sk_callback_hsw+0x143>
+  DB  196,226,125,24,5,91,69,0,0          ; vbroadcastss  0x455b(%rip),%ymm0        # 48f0 <_sk_callback_hsw+0x143>
   DB  197,252,92,219                      ; vsubps        %ymm3,%ymm0,%ymm3
   DB  197,228,89,196                      ; vmulps        %ymm4,%ymm3,%ymm0
   DB  197,228,89,205                      ; vmulps        %ymm5,%ymm3,%ymm1
@@ -282,7 +280,7 @@
 
 PUBLIC _sk_srcover_hsw
 _sk_srcover_hsw LABEL PROC
-  DB  196,98,125,24,5,65,69,0,0           ; vbroadcastss  0x4541(%rip),%ymm8        # 4900 <_sk_callback_hsw+0x147>
+  DB  196,98,125,24,5,62,69,0,0           ; vbroadcastss  0x453e(%rip),%ymm8        # 48f4 <_sk_callback_hsw+0x147>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,93,184,192                  ; vfmadd231ps   %ymm8,%ymm4,%ymm0
   DB  196,194,85,184,200                  ; vfmadd231ps   %ymm8,%ymm5,%ymm1
@@ -293,7 +291,7 @@
 
 PUBLIC _sk_dstover_hsw
 _sk_dstover_hsw LABEL PROC
-  DB  196,98,125,24,5,32,69,0,0           ; vbroadcastss  0x4520(%rip),%ymm8        # 4904 <_sk_callback_hsw+0x14b>
+  DB  196,98,125,24,5,29,69,0,0           ; vbroadcastss  0x451d(%rip),%ymm8        # 48f8 <_sk_callback_hsw+0x14b>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  196,226,61,168,196                  ; vfmadd213ps   %ymm4,%ymm8,%ymm0
   DB  196,226,61,168,205                  ; vfmadd213ps   %ymm5,%ymm8,%ymm1
@@ -313,7 +311,7 @@
 
 PUBLIC _sk_multiply_hsw
 _sk_multiply_hsw LABEL PROC
-  DB  196,98,125,24,5,235,68,0,0          ; vbroadcastss  0x44eb(%rip),%ymm8        # 4908 <_sk_callback_hsw+0x14f>
+  DB  196,98,125,24,5,232,68,0,0          ; vbroadcastss  0x44e8(%rip),%ymm8        # 48fc <_sk_callback_hsw+0x14f>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,52,89,208                       ; vmulps        %ymm0,%ymm9,%ymm10
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -355,7 +353,7 @@
 
 PUBLIC _sk_xor__hsw
 _sk_xor__hsw LABEL PROC
-  DB  196,98,125,24,5,102,68,0,0          ; vbroadcastss  0x4466(%rip),%ymm8        # 490c <_sk_callback_hsw+0x153>
+  DB  196,98,125,24,5,99,68,0,0           ; vbroadcastss  0x4463(%rip),%ymm8        # 4900 <_sk_callback_hsw+0x153>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,180,89,192                      ; vmulps        %ymm0,%ymm9,%ymm0
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -387,7 +385,7 @@
   DB  197,100,89,206                      ; vmulps        %ymm6,%ymm3,%ymm9
   DB  196,193,108,95,209                  ; vmaxps        %ymm9,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,238,67,0,0          ; vbroadcastss  0x43ee(%rip),%ymm8        # 4910 <_sk_callback_hsw+0x157>
+  DB  196,98,125,24,5,235,67,0,0          ; vbroadcastss  0x43eb(%rip),%ymm8        # 4904 <_sk_callback_hsw+0x157>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,69,184,216                  ; vfmadd231ps   %ymm8,%ymm7,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -410,7 +408,7 @@
   DB  197,100,89,206                      ; vmulps        %ymm6,%ymm3,%ymm9
   DB  196,193,108,93,209                  ; vminps        %ymm9,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,157,67,0,0          ; vbroadcastss  0x439d(%rip),%ymm8        # 4914 <_sk_callback_hsw+0x15b>
+  DB  196,98,125,24,5,154,67,0,0          ; vbroadcastss  0x439a(%rip),%ymm8        # 4908 <_sk_callback_hsw+0x15b>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,69,184,216                  ; vfmadd231ps   %ymm8,%ymm7,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -436,7 +434,7 @@
   DB  196,193,108,93,209                  ; vminps        %ymm9,%ymm2,%ymm2
   DB  197,236,88,210                      ; vaddps        %ymm2,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,64,67,0,0           ; vbroadcastss  0x4340(%rip),%ymm8        # 4918 <_sk_callback_hsw+0x15f>
+  DB  196,98,125,24,5,61,67,0,0           ; vbroadcastss  0x433d(%rip),%ymm8        # 490c <_sk_callback_hsw+0x15f>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,69,184,216                  ; vfmadd231ps   %ymm8,%ymm7,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -456,7 +454,7 @@
   DB  197,236,89,214                      ; vmulps        %ymm6,%ymm2,%ymm2
   DB  197,236,88,210                      ; vaddps        %ymm2,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,254,66,0,0          ; vbroadcastss  0x42fe(%rip),%ymm8        # 491c <_sk_callback_hsw+0x163>
+  DB  196,98,125,24,5,251,66,0,0          ; vbroadcastss  0x42fb(%rip),%ymm8        # 4910 <_sk_callback_hsw+0x163>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,69,184,216                  ; vfmadd231ps   %ymm8,%ymm7,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -464,7 +462,7 @@
 
 PUBLIC _sk_colorburn_hsw
 _sk_colorburn_hsw LABEL PROC
-  DB  196,98,125,24,5,236,66,0,0          ; vbroadcastss  0x42ec(%rip),%ymm8        # 4920 <_sk_callback_hsw+0x167>
+  DB  196,98,125,24,5,233,66,0,0          ; vbroadcastss  0x42e9(%rip),%ymm8        # 4914 <_sk_callback_hsw+0x167>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,52,89,216                       ; vmulps        %ymm0,%ymm9,%ymm11
   DB  196,65,44,87,210                    ; vxorps        %ymm10,%ymm10,%ymm10
@@ -520,7 +518,7 @@
 PUBLIC _sk_colordodge_hsw
 _sk_colordodge_hsw LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
-  DB  196,98,125,24,13,247,65,0,0         ; vbroadcastss  0x41f7(%rip),%ymm9        # 4924 <_sk_callback_hsw+0x16b>
+  DB  196,98,125,24,13,244,65,0,0         ; vbroadcastss  0x41f4(%rip),%ymm9        # 4918 <_sk_callback_hsw+0x16b>
   DB  197,52,92,215                       ; vsubps        %ymm7,%ymm9,%ymm10
   DB  197,44,89,216                       ; vmulps        %ymm0,%ymm10,%ymm11
   DB  197,52,92,203                       ; vsubps        %ymm3,%ymm9,%ymm9
@@ -571,7 +569,7 @@
 
 PUBLIC _sk_hardlight_hsw
 _sk_hardlight_hsw LABEL PROC
-  DB  196,98,125,24,5,24,65,0,0           ; vbroadcastss  0x4118(%rip),%ymm8        # 4928 <_sk_callback_hsw+0x16f>
+  DB  196,98,125,24,5,21,65,0,0           ; vbroadcastss  0x4115(%rip),%ymm8        # 491c <_sk_callback_hsw+0x16f>
   DB  197,60,92,215                       ; vsubps        %ymm7,%ymm8,%ymm10
   DB  197,44,89,216                       ; vmulps        %ymm0,%ymm10,%ymm11
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -620,7 +618,7 @@
 
 PUBLIC _sk_overlay_hsw
 _sk_overlay_hsw LABEL PROC
-  DB  196,98,125,24,5,80,64,0,0           ; vbroadcastss  0x4050(%rip),%ymm8        # 492c <_sk_callback_hsw+0x173>
+  DB  196,98,125,24,5,77,64,0,0           ; vbroadcastss  0x404d(%rip),%ymm8        # 4920 <_sk_callback_hsw+0x173>
   DB  197,60,92,215                       ; vsubps        %ymm7,%ymm8,%ymm10
   DB  197,44,89,216                       ; vmulps        %ymm0,%ymm10,%ymm11
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -680,10 +678,10 @@
   DB  196,65,20,88,197                    ; vaddps        %ymm13,%ymm13,%ymm8
   DB  196,65,60,88,192                    ; vaddps        %ymm8,%ymm8,%ymm8
   DB  196,66,61,168,192                   ; vfmadd213ps   %ymm8,%ymm8,%ymm8
-  DB  196,98,125,24,29,87,63,0,0          ; vbroadcastss  0x3f57(%rip),%ymm11        # 4934 <_sk_callback_hsw+0x17b>
+  DB  196,98,125,24,29,84,63,0,0          ; vbroadcastss  0x3f54(%rip),%ymm11        # 4928 <_sk_callback_hsw+0x17b>
   DB  196,65,20,88,227                    ; vaddps        %ymm11,%ymm13,%ymm12
   DB  196,65,28,89,192                    ; vmulps        %ymm8,%ymm12,%ymm8
-  DB  196,98,125,24,37,72,63,0,0          ; vbroadcastss  0x3f48(%rip),%ymm12        # 4938 <_sk_callback_hsw+0x17f>
+  DB  196,98,125,24,37,69,63,0,0          ; vbroadcastss  0x3f45(%rip),%ymm12        # 492c <_sk_callback_hsw+0x17f>
   DB  196,66,21,184,196                   ; vfmadd231ps   %ymm12,%ymm13,%ymm8
   DB  196,65,124,82,245                   ; vrsqrtps      %ymm13,%ymm14
   DB  196,65,124,83,246                   ; vrcpps        %ymm14,%ymm14
@@ -693,7 +691,7 @@
   DB  197,4,194,255,2                     ; vcmpleps      %ymm7,%ymm15,%ymm15
   DB  196,67,13,74,240,240                ; vblendvps     %ymm15,%ymm8,%ymm14,%ymm14
   DB  197,116,88,249                      ; vaddps        %ymm1,%ymm1,%ymm15
-  DB  196,98,125,24,5,11,63,0,0           ; vbroadcastss  0x3f0b(%rip),%ymm8        # 4930 <_sk_callback_hsw+0x177>
+  DB  196,98,125,24,5,8,63,0,0            ; vbroadcastss  0x3f08(%rip),%ymm8        # 4924 <_sk_callback_hsw+0x177>
   DB  196,65,60,92,237                    ; vsubps        %ymm13,%ymm8,%ymm13
   DB  197,132,92,195                      ; vsubps        %ymm3,%ymm15,%ymm0
   DB  196,98,125,168,235                  ; vfmadd213ps   %ymm3,%ymm0,%ymm13
@@ -806,11 +804,11 @@
   DB  196,65,28,89,210                    ; vmulps        %ymm10,%ymm12,%ymm10
   DB  196,65,44,94,214                    ; vdivps        %ymm14,%ymm10,%ymm10
   DB  196,67,45,74,224,240                ; vblendvps     %ymm15,%ymm8,%ymm10,%ymm12
-  DB  196,98,125,24,53,10,61,0,0          ; vbroadcastss  0x3d0a(%rip),%ymm14        # 493c <_sk_callback_hsw+0x183>
-  DB  196,98,125,24,61,5,61,0,0           ; vbroadcastss  0x3d05(%rip),%ymm15        # 4940 <_sk_callback_hsw+0x187>
+  DB  196,98,125,24,53,7,61,0,0           ; vbroadcastss  0x3d07(%rip),%ymm14        # 4930 <_sk_callback_hsw+0x183>
+  DB  196,98,125,24,61,2,61,0,0           ; vbroadcastss  0x3d02(%rip),%ymm15        # 4934 <_sk_callback_hsw+0x187>
   DB  196,65,84,89,239                    ; vmulps        %ymm15,%ymm5,%ymm13
   DB  196,66,93,184,238                   ; vfmadd231ps   %ymm14,%ymm4,%ymm13
-  DB  196,226,125,24,5,246,60,0,0         ; vbroadcastss  0x3cf6(%rip),%ymm0        # 4944 <_sk_callback_hsw+0x18b>
+  DB  196,226,125,24,5,243,60,0,0         ; vbroadcastss  0x3cf3(%rip),%ymm0        # 4938 <_sk_callback_hsw+0x18b>
   DB  196,98,77,184,232                   ; vfmadd231ps   %ymm0,%ymm6,%ymm13
   DB  196,65,116,89,215                   ; vmulps        %ymm15,%ymm1,%ymm10
   DB  196,66,53,184,214                   ; vfmadd231ps   %ymm14,%ymm9,%ymm10
@@ -865,7 +863,7 @@
   DB  196,193,124,95,192                  ; vmaxps        %ymm8,%ymm0,%ymm0
   DB  196,65,36,95,200                    ; vmaxps        %ymm8,%ymm11,%ymm9
   DB  196,65,116,95,192                   ; vmaxps        %ymm8,%ymm1,%ymm8
-  DB  196,226,125,24,13,227,59,0,0        ; vbroadcastss  0x3be3(%rip),%ymm1        # 4948 <_sk_callback_hsw+0x18f>
+  DB  196,226,125,24,13,224,59,0,0        ; vbroadcastss  0x3be0(%rip),%ymm1        # 493c <_sk_callback_hsw+0x18f>
   DB  197,116,92,215                      ; vsubps        %ymm7,%ymm1,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,116,92,219                      ; vsubps        %ymm3,%ymm1,%ymm11
@@ -919,11 +917,11 @@
   DB  196,65,28,89,210                    ; vmulps        %ymm10,%ymm12,%ymm10
   DB  196,65,44,94,214                    ; vdivps        %ymm14,%ymm10,%ymm10
   DB  196,67,45,74,224,240                ; vblendvps     %ymm15,%ymm8,%ymm10,%ymm12
-  DB  196,98,125,24,53,244,58,0,0         ; vbroadcastss  0x3af4(%rip),%ymm14        # 494c <_sk_callback_hsw+0x193>
-  DB  196,98,125,24,61,239,58,0,0         ; vbroadcastss  0x3aef(%rip),%ymm15        # 4950 <_sk_callback_hsw+0x197>
+  DB  196,98,125,24,53,241,58,0,0         ; vbroadcastss  0x3af1(%rip),%ymm14        # 4940 <_sk_callback_hsw+0x193>
+  DB  196,98,125,24,61,236,58,0,0         ; vbroadcastss  0x3aec(%rip),%ymm15        # 4944 <_sk_callback_hsw+0x197>
   DB  196,65,84,89,239                    ; vmulps        %ymm15,%ymm5,%ymm13
   DB  196,66,93,184,238                   ; vfmadd231ps   %ymm14,%ymm4,%ymm13
-  DB  196,226,125,24,5,224,58,0,0         ; vbroadcastss  0x3ae0(%rip),%ymm0        # 4954 <_sk_callback_hsw+0x19b>
+  DB  196,226,125,24,5,221,58,0,0         ; vbroadcastss  0x3add(%rip),%ymm0        # 4948 <_sk_callback_hsw+0x19b>
   DB  196,98,77,184,232                   ; vfmadd231ps   %ymm0,%ymm6,%ymm13
   DB  196,65,116,89,215                   ; vmulps        %ymm15,%ymm1,%ymm10
   DB  196,66,53,184,214                   ; vfmadd231ps   %ymm14,%ymm9,%ymm10
@@ -978,7 +976,7 @@
   DB  196,193,124,95,192                  ; vmaxps        %ymm8,%ymm0,%ymm0
   DB  196,65,36,95,200                    ; vmaxps        %ymm8,%ymm11,%ymm9
   DB  196,65,116,95,192                   ; vmaxps        %ymm8,%ymm1,%ymm8
-  DB  196,226,125,24,13,205,57,0,0        ; vbroadcastss  0x39cd(%rip),%ymm1        # 4958 <_sk_callback_hsw+0x19f>
+  DB  196,226,125,24,13,202,57,0,0        ; vbroadcastss  0x39ca(%rip),%ymm1        # 494c <_sk_callback_hsw+0x19f>
   DB  197,116,92,215                      ; vsubps        %ymm7,%ymm1,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,116,92,219                      ; vsubps        %ymm3,%ymm1,%ymm11
@@ -1006,11 +1004,11 @@
   DB  197,108,89,199                      ; vmulps        %ymm7,%ymm2,%ymm8
   DB  197,116,89,215                      ; vmulps        %ymm7,%ymm1,%ymm10
   DB  197,52,89,223                       ; vmulps        %ymm7,%ymm9,%ymm11
-  DB  196,98,125,24,45,96,57,0,0          ; vbroadcastss  0x3960(%rip),%ymm13        # 495c <_sk_callback_hsw+0x1a3>
-  DB  196,98,125,24,53,91,57,0,0          ; vbroadcastss  0x395b(%rip),%ymm14        # 4960 <_sk_callback_hsw+0x1a7>
+  DB  196,98,125,24,45,93,57,0,0          ; vbroadcastss  0x395d(%rip),%ymm13        # 4950 <_sk_callback_hsw+0x1a3>
+  DB  196,98,125,24,53,88,57,0,0          ; vbroadcastss  0x3958(%rip),%ymm14        # 4954 <_sk_callback_hsw+0x1a7>
   DB  196,65,84,89,230                    ; vmulps        %ymm14,%ymm5,%ymm12
   DB  196,66,93,184,229                   ; vfmadd231ps   %ymm13,%ymm4,%ymm12
-  DB  196,98,125,24,61,76,57,0,0          ; vbroadcastss  0x394c(%rip),%ymm15        # 4964 <_sk_callback_hsw+0x1ab>
+  DB  196,98,125,24,61,73,57,0,0          ; vbroadcastss  0x3949(%rip),%ymm15        # 4958 <_sk_callback_hsw+0x1ab>
   DB  196,66,77,184,231                   ; vfmadd231ps   %ymm15,%ymm6,%ymm12
   DB  196,65,44,89,206                    ; vmulps        %ymm14,%ymm10,%ymm9
   DB  196,66,61,184,205                   ; vfmadd231ps   %ymm13,%ymm8,%ymm9
@@ -1066,7 +1064,7 @@
   DB  196,193,116,95,206                  ; vmaxps        %ymm14,%ymm1,%ymm1
   DB  196,65,44,95,198                    ; vmaxps        %ymm14,%ymm10,%ymm8
   DB  196,65,124,95,206                   ; vmaxps        %ymm14,%ymm0,%ymm9
-  DB  196,226,125,24,5,46,56,0,0          ; vbroadcastss  0x382e(%rip),%ymm0        # 4968 <_sk_callback_hsw+0x1af>
+  DB  196,226,125,24,5,43,56,0,0          ; vbroadcastss  0x382b(%rip),%ymm0        # 495c <_sk_callback_hsw+0x1af>
   DB  197,124,92,215                      ; vsubps        %ymm7,%ymm0,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,124,92,219                      ; vsubps        %ymm3,%ymm0,%ymm11
@@ -1094,11 +1092,11 @@
   DB  197,100,89,196                      ; vmulps        %ymm4,%ymm3,%ymm8
   DB  197,100,89,213                      ; vmulps        %ymm5,%ymm3,%ymm10
   DB  197,100,89,222                      ; vmulps        %ymm6,%ymm3,%ymm11
-  DB  196,98,125,24,45,193,55,0,0         ; vbroadcastss  0x37c1(%rip),%ymm13        # 496c <_sk_callback_hsw+0x1b3>
-  DB  196,98,125,24,53,188,55,0,0         ; vbroadcastss  0x37bc(%rip),%ymm14        # 4970 <_sk_callback_hsw+0x1b7>
+  DB  196,98,125,24,45,190,55,0,0         ; vbroadcastss  0x37be(%rip),%ymm13        # 4960 <_sk_callback_hsw+0x1b3>
+  DB  196,98,125,24,53,185,55,0,0         ; vbroadcastss  0x37b9(%rip),%ymm14        # 4964 <_sk_callback_hsw+0x1b7>
   DB  196,65,116,89,230                   ; vmulps        %ymm14,%ymm1,%ymm12
   DB  196,66,109,184,229                  ; vfmadd231ps   %ymm13,%ymm2,%ymm12
-  DB  196,98,125,24,61,173,55,0,0         ; vbroadcastss  0x37ad(%rip),%ymm15        # 4974 <_sk_callback_hsw+0x1bb>
+  DB  196,98,125,24,61,170,55,0,0         ; vbroadcastss  0x37aa(%rip),%ymm15        # 4968 <_sk_callback_hsw+0x1bb>
   DB  196,66,53,184,231                   ; vfmadd231ps   %ymm15,%ymm9,%ymm12
   DB  196,65,44,89,206                    ; vmulps        %ymm14,%ymm10,%ymm9
   DB  196,66,61,184,205                   ; vfmadd231ps   %ymm13,%ymm8,%ymm9
@@ -1154,7 +1152,7 @@
   DB  196,193,116,95,206                  ; vmaxps        %ymm14,%ymm1,%ymm1
   DB  196,65,44,95,198                    ; vmaxps        %ymm14,%ymm10,%ymm8
   DB  196,65,124,95,206                   ; vmaxps        %ymm14,%ymm0,%ymm9
-  DB  196,226,125,24,5,143,54,0,0         ; vbroadcastss  0x368f(%rip),%ymm0        # 4978 <_sk_callback_hsw+0x1bf>
+  DB  196,226,125,24,5,140,54,0,0         ; vbroadcastss  0x368c(%rip),%ymm0        # 496c <_sk_callback_hsw+0x1bf>
   DB  197,124,92,215                      ; vsubps        %ymm7,%ymm0,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,124,92,219                      ; vsubps        %ymm3,%ymm0,%ymm11
@@ -1184,7 +1182,7 @@
 
 PUBLIC _sk_clamp_1_hsw
 _sk_clamp_1_hsw LABEL PROC
-  DB  196,98,125,24,5,40,54,0,0           ; vbroadcastss  0x3628(%rip),%ymm8        # 497c <_sk_callback_hsw+0x1c3>
+  DB  196,98,125,24,5,37,54,0,0           ; vbroadcastss  0x3625(%rip),%ymm8        # 4970 <_sk_callback_hsw+0x1c3>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  196,193,116,93,200                  ; vminps        %ymm8,%ymm1,%ymm1
   DB  196,193,108,93,208                  ; vminps        %ymm8,%ymm2,%ymm2
@@ -1194,7 +1192,7 @@
 
 PUBLIC _sk_clamp_a_hsw
 _sk_clamp_a_hsw LABEL PROC
-  DB  196,98,125,24,5,11,54,0,0           ; vbroadcastss  0x360b(%rip),%ymm8        # 4980 <_sk_callback_hsw+0x1c7>
+  DB  196,98,125,24,5,8,54,0,0            ; vbroadcastss  0x3608(%rip),%ymm8        # 4974 <_sk_callback_hsw+0x1c7>
   DB  196,193,100,93,216                  ; vminps        %ymm8,%ymm3,%ymm3
   DB  197,252,93,195                      ; vminps        %ymm3,%ymm0,%ymm0
   DB  197,244,93,203                      ; vminps        %ymm3,%ymm1,%ymm1
@@ -1266,7 +1264,7 @@
 _sk_unpremul_hsw LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,65,100,194,200,0                ; vcmpeqps      %ymm8,%ymm3,%ymm9
-  DB  196,98,125,24,21,83,53,0,0          ; vbroadcastss  0x3553(%rip),%ymm10        # 4984 <_sk_callback_hsw+0x1cb>
+  DB  196,98,125,24,21,80,53,0,0          ; vbroadcastss  0x3550(%rip),%ymm10        # 4978 <_sk_callback_hsw+0x1cb>
   DB  197,44,94,211                       ; vdivps        %ymm3,%ymm10,%ymm10
   DB  196,67,45,74,192,144                ; vblendvps     %ymm9,%ymm8,%ymm10,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
@@ -1277,16 +1275,16 @@
 
 PUBLIC _sk_from_srgb_hsw
 _sk_from_srgb_hsw LABEL PROC
-  DB  196,98,125,24,5,52,53,0,0           ; vbroadcastss  0x3534(%rip),%ymm8        # 4988 <_sk_callback_hsw+0x1cf>
+  DB  196,98,125,24,5,49,53,0,0           ; vbroadcastss  0x3531(%rip),%ymm8        # 497c <_sk_callback_hsw+0x1cf>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  197,124,89,208                      ; vmulps        %ymm0,%ymm0,%ymm10
-  DB  196,98,125,24,29,38,53,0,0          ; vbroadcastss  0x3526(%rip),%ymm11        # 498c <_sk_callback_hsw+0x1d3>
-  DB  196,98,125,24,37,33,53,0,0          ; vbroadcastss  0x3521(%rip),%ymm12        # 4990 <_sk_callback_hsw+0x1d7>
+  DB  196,98,125,24,29,35,53,0,0          ; vbroadcastss  0x3523(%rip),%ymm11        # 4980 <_sk_callback_hsw+0x1d3>
+  DB  196,98,125,24,37,30,53,0,0          ; vbroadcastss  0x351e(%rip),%ymm12        # 4984 <_sk_callback_hsw+0x1d7>
   DB  196,65,124,40,236                   ; vmovaps       %ymm12,%ymm13
   DB  196,66,125,168,235                  ; vfmadd213ps   %ymm11,%ymm0,%ymm13
-  DB  196,98,125,24,53,18,53,0,0          ; vbroadcastss  0x3512(%rip),%ymm14        # 4994 <_sk_callback_hsw+0x1db>
+  DB  196,98,125,24,53,15,53,0,0          ; vbroadcastss  0x350f(%rip),%ymm14        # 4988 <_sk_callback_hsw+0x1db>
   DB  196,66,45,168,238                   ; vfmadd213ps   %ymm14,%ymm10,%ymm13
-  DB  196,98,125,24,21,8,53,0,0           ; vbroadcastss  0x3508(%rip),%ymm10        # 4998 <_sk_callback_hsw+0x1df>
+  DB  196,98,125,24,21,5,53,0,0           ; vbroadcastss  0x3505(%rip),%ymm10        # 498c <_sk_callback_hsw+0x1df>
   DB  196,193,124,194,194,1               ; vcmpltps      %ymm10,%ymm0,%ymm0
   DB  196,195,21,74,193,0                 ; vblendvps     %ymm0,%ymm9,%ymm13,%ymm0
   DB  196,65,116,89,200                   ; vmulps        %ymm8,%ymm1,%ymm9
@@ -1308,19 +1306,19 @@
 PUBLIC _sk_to_srgb_hsw
 _sk_to_srgb_hsw LABEL PROC
   DB  197,124,82,200                      ; vrsqrtps      %ymm0,%ymm9
-  DB  196,98,125,24,5,172,52,0,0          ; vbroadcastss  0x34ac(%rip),%ymm8        # 499c <_sk_callback_hsw+0x1e3>
+  DB  196,98,125,24,5,169,52,0,0          ; vbroadcastss  0x34a9(%rip),%ymm8        # 4990 <_sk_callback_hsw+0x1e3>
   DB  196,65,124,89,208                   ; vmulps        %ymm8,%ymm0,%ymm10
-  DB  196,98,125,24,29,162,52,0,0         ; vbroadcastss  0x34a2(%rip),%ymm11        # 49a0 <_sk_callback_hsw+0x1e7>
-  DB  196,98,125,24,37,157,52,0,0         ; vbroadcastss  0x349d(%rip),%ymm12        # 49a4 <_sk_callback_hsw+0x1eb>
+  DB  196,98,125,24,29,159,52,0,0         ; vbroadcastss  0x349f(%rip),%ymm11        # 4994 <_sk_callback_hsw+0x1e7>
+  DB  196,98,125,24,37,154,52,0,0         ; vbroadcastss  0x349a(%rip),%ymm12        # 4998 <_sk_callback_hsw+0x1eb>
   DB  196,65,124,40,236                   ; vmovaps       %ymm12,%ymm13
   DB  196,66,53,168,235                   ; vfmadd213ps   %ymm11,%ymm9,%ymm13
-  DB  196,98,125,24,53,142,52,0,0         ; vbroadcastss  0x348e(%rip),%ymm14        # 49a8 <_sk_callback_hsw+0x1ef>
+  DB  196,98,125,24,53,139,52,0,0         ; vbroadcastss  0x348b(%rip),%ymm14        # 499c <_sk_callback_hsw+0x1ef>
   DB  196,66,53,168,238                   ; vfmadd213ps   %ymm14,%ymm9,%ymm13
-  DB  196,98,125,24,61,132,52,0,0         ; vbroadcastss  0x3484(%rip),%ymm15        # 49ac <_sk_callback_hsw+0x1f3>
+  DB  196,98,125,24,61,129,52,0,0         ; vbroadcastss  0x3481(%rip),%ymm15        # 49a0 <_sk_callback_hsw+0x1f3>
   DB  196,65,52,88,207                    ; vaddps        %ymm15,%ymm9,%ymm9
   DB  196,65,124,83,201                   ; vrcpps        %ymm9,%ymm9
   DB  196,65,20,89,201                    ; vmulps        %ymm9,%ymm13,%ymm9
-  DB  196,98,125,24,45,112,52,0,0         ; vbroadcastss  0x3470(%rip),%ymm13        # 49b0 <_sk_callback_hsw+0x1f7>
+  DB  196,98,125,24,45,109,52,0,0         ; vbroadcastss  0x346d(%rip),%ymm13        # 49a4 <_sk_callback_hsw+0x1f7>
   DB  196,193,124,194,197,1               ; vcmpltps      %ymm13,%ymm0,%ymm0
   DB  196,195,53,74,194,0                 ; vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   DB  197,124,82,201                      ; vrsqrtps      %ymm1,%ymm9
@@ -1352,26 +1350,26 @@
   DB  197,124,93,201                      ; vminps        %ymm1,%ymm0,%ymm9
   DB  197,52,93,202                       ; vminps        %ymm2,%ymm9,%ymm9
   DB  196,65,60,92,209                    ; vsubps        %ymm9,%ymm8,%ymm10
-  DB  196,98,125,24,29,229,51,0,0         ; vbroadcastss  0x33e5(%rip),%ymm11        # 49b4 <_sk_callback_hsw+0x1fb>
+  DB  196,98,125,24,29,226,51,0,0         ; vbroadcastss  0x33e2(%rip),%ymm11        # 49a8 <_sk_callback_hsw+0x1fb>
   DB  196,65,36,94,218                    ; vdivps        %ymm10,%ymm11,%ymm11
   DB  197,116,92,226                      ; vsubps        %ymm2,%ymm1,%ymm12
   DB  197,116,194,234,1                   ; vcmpltps      %ymm2,%ymm1,%ymm13
-  DB  196,98,125,24,53,210,51,0,0         ; vbroadcastss  0x33d2(%rip),%ymm14        # 49b8 <_sk_callback_hsw+0x1ff>
+  DB  196,98,125,24,53,207,51,0,0         ; vbroadcastss  0x33cf(%rip),%ymm14        # 49ac <_sk_callback_hsw+0x1ff>
   DB  196,65,4,87,255                     ; vxorps        %ymm15,%ymm15,%ymm15
   DB  196,67,5,74,238,208                 ; vblendvps     %ymm13,%ymm14,%ymm15,%ymm13
   DB  196,66,37,168,229                   ; vfmadd213ps   %ymm13,%ymm11,%ymm12
   DB  197,236,92,208                      ; vsubps        %ymm0,%ymm2,%ymm2
   DB  197,124,92,233                      ; vsubps        %ymm1,%ymm0,%ymm13
-  DB  196,98,125,24,53,185,51,0,0         ; vbroadcastss  0x33b9(%rip),%ymm14        # 49c0 <_sk_callback_hsw+0x207>
+  DB  196,98,125,24,53,182,51,0,0         ; vbroadcastss  0x33b6(%rip),%ymm14        # 49b4 <_sk_callback_hsw+0x207>
   DB  196,66,37,168,238                   ; vfmadd213ps   %ymm14,%ymm11,%ymm13
-  DB  196,98,125,24,53,167,51,0,0         ; vbroadcastss  0x33a7(%rip),%ymm14        # 49bc <_sk_callback_hsw+0x203>
+  DB  196,98,125,24,53,164,51,0,0         ; vbroadcastss  0x33a4(%rip),%ymm14        # 49b0 <_sk_callback_hsw+0x203>
   DB  196,194,37,168,214                  ; vfmadd213ps   %ymm14,%ymm11,%ymm2
   DB  197,188,194,201,0                   ; vcmpeqps      %ymm1,%ymm8,%ymm1
   DB  196,227,21,74,202,16                ; vblendvps     %ymm1,%ymm2,%ymm13,%ymm1
   DB  197,188,194,192,0                   ; vcmpeqps      %ymm0,%ymm8,%ymm0
   DB  196,195,117,74,196,0                ; vblendvps     %ymm0,%ymm12,%ymm1,%ymm0
   DB  196,193,60,88,201                   ; vaddps        %ymm9,%ymm8,%ymm1
-  DB  196,98,125,24,29,138,51,0,0         ; vbroadcastss  0x338a(%rip),%ymm11        # 49c8 <_sk_callback_hsw+0x20f>
+  DB  196,98,125,24,29,135,51,0,0         ; vbroadcastss  0x3387(%rip),%ymm11        # 49bc <_sk_callback_hsw+0x20f>
   DB  196,193,116,89,211                  ; vmulps        %ymm11,%ymm1,%ymm2
   DB  197,36,194,218,1                    ; vcmpltps      %ymm2,%ymm11,%ymm11
   DB  196,65,12,92,224                    ; vsubps        %ymm8,%ymm14,%ymm12
@@ -1381,7 +1379,7 @@
   DB  197,172,94,201                      ; vdivps        %ymm1,%ymm10,%ymm1
   DB  196,195,125,74,199,128              ; vblendvps     %ymm8,%ymm15,%ymm0,%ymm0
   DB  196,195,117,74,207,128              ; vblendvps     %ymm8,%ymm15,%ymm1,%ymm1
-  DB  196,98,125,24,5,77,51,0,0           ; vbroadcastss  0x334d(%rip),%ymm8        # 49c4 <_sk_callback_hsw+0x20b>
+  DB  196,98,125,24,5,74,51,0,0           ; vbroadcastss  0x334a(%rip),%ymm8        # 49b8 <_sk_callback_hsw+0x20b>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -1396,30 +1394,30 @@
   DB  197,252,17,28,36                    ; vmovups       %ymm3,(%rsp)
   DB  197,252,40,233                      ; vmovaps       %ymm1,%ymm5
   DB  197,252,40,224                      ; vmovaps       %ymm0,%ymm4
-  DB  196,98,125,24,5,20,51,0,0           ; vbroadcastss  0x3314(%rip),%ymm8        # 49cc <_sk_callback_hsw+0x213>
+  DB  196,98,125,24,5,17,51,0,0           ; vbroadcastss  0x3311(%rip),%ymm8        # 49c0 <_sk_callback_hsw+0x213>
   DB  197,60,194,202,2                    ; vcmpleps      %ymm2,%ymm8,%ymm9
   DB  197,84,89,210                       ; vmulps        %ymm2,%ymm5,%ymm10
   DB  196,65,84,92,218                    ; vsubps        %ymm10,%ymm5,%ymm11
   DB  196,67,45,74,203,144                ; vblendvps     %ymm9,%ymm11,%ymm10,%ymm9
   DB  197,52,88,210                       ; vaddps        %ymm2,%ymm9,%ymm10
-  DB  196,98,125,24,13,247,50,0,0         ; vbroadcastss  0x32f7(%rip),%ymm9        # 49d0 <_sk_callback_hsw+0x217>
+  DB  196,98,125,24,13,244,50,0,0         ; vbroadcastss  0x32f4(%rip),%ymm9        # 49c4 <_sk_callback_hsw+0x217>
   DB  196,66,109,170,202                  ; vfmsub213ps   %ymm10,%ymm2,%ymm9
-  DB  196,98,125,24,29,237,50,0,0         ; vbroadcastss  0x32ed(%rip),%ymm11        # 49d4 <_sk_callback_hsw+0x21b>
+  DB  196,98,125,24,29,234,50,0,0         ; vbroadcastss  0x32ea(%rip),%ymm11        # 49c8 <_sk_callback_hsw+0x21b>
   DB  196,65,92,88,219                    ; vaddps        %ymm11,%ymm4,%ymm11
   DB  196,67,125,8,227,1                  ; vroundps      $0x1,%ymm11,%ymm12
   DB  196,65,36,92,252                    ; vsubps        %ymm12,%ymm11,%ymm15
   DB  196,65,44,92,217                    ; vsubps        %ymm9,%ymm10,%ymm11
-  DB  196,98,125,24,45,215,50,0,0         ; vbroadcastss  0x32d7(%rip),%ymm13        # 49dc <_sk_callback_hsw+0x223>
+  DB  196,98,125,24,45,212,50,0,0         ; vbroadcastss  0x32d4(%rip),%ymm13        # 49d0 <_sk_callback_hsw+0x223>
   DB  196,193,4,89,197                    ; vmulps        %ymm13,%ymm15,%ymm0
-  DB  196,98,125,24,53,205,50,0,0         ; vbroadcastss  0x32cd(%rip),%ymm14        # 49e0 <_sk_callback_hsw+0x227>
+  DB  196,98,125,24,53,202,50,0,0         ; vbroadcastss  0x32ca(%rip),%ymm14        # 49d4 <_sk_callback_hsw+0x227>
   DB  197,12,92,224                       ; vsubps        %ymm0,%ymm14,%ymm12
   DB  196,66,37,168,225                   ; vfmadd213ps   %ymm9,%ymm11,%ymm12
-  DB  196,226,125,24,29,179,50,0,0        ; vbroadcastss  0x32b3(%rip),%ymm3        # 49d8 <_sk_callback_hsw+0x21f>
+  DB  196,226,125,24,29,176,50,0,0        ; vbroadcastss  0x32b0(%rip),%ymm3        # 49cc <_sk_callback_hsw+0x21f>
   DB  196,193,100,194,255,2               ; vcmpleps      %ymm15,%ymm3,%ymm7
   DB  196,195,29,74,249,112               ; vblendvps     %ymm7,%ymm9,%ymm12,%ymm7
   DB  196,65,60,194,231,2                 ; vcmpleps      %ymm15,%ymm8,%ymm12
   DB  196,227,45,74,255,192               ; vblendvps     %ymm12,%ymm7,%ymm10,%ymm7
-  DB  196,98,125,24,37,158,50,0,0         ; vbroadcastss  0x329e(%rip),%ymm12        # 49e4 <_sk_callback_hsw+0x22b>
+  DB  196,98,125,24,37,155,50,0,0         ; vbroadcastss  0x329b(%rip),%ymm12        # 49d8 <_sk_callback_hsw+0x22b>
   DB  196,65,28,194,255,2                 ; vcmpleps      %ymm15,%ymm12,%ymm15
   DB  196,194,37,168,193                  ; vfmadd213ps   %ymm9,%ymm11,%ymm0
   DB  196,99,125,74,255,240               ; vblendvps     %ymm15,%ymm7,%ymm0,%ymm15
@@ -1435,7 +1433,7 @@
   DB  197,156,194,192,2                   ; vcmpleps      %ymm0,%ymm12,%ymm0
   DB  196,194,37,168,249                  ; vfmadd213ps   %ymm9,%ymm11,%ymm7
   DB  196,227,69,74,201,0                 ; vblendvps     %ymm0,%ymm1,%ymm7,%ymm1
-  DB  196,226,125,24,5,74,50,0,0          ; vbroadcastss  0x324a(%rip),%ymm0        # 49e8 <_sk_callback_hsw+0x22f>
+  DB  196,226,125,24,5,71,50,0,0          ; vbroadcastss  0x3247(%rip),%ymm0        # 49dc <_sk_callback_hsw+0x22f>
   DB  197,220,88,192                      ; vaddps        %ymm0,%ymm4,%ymm0
   DB  196,227,125,8,224,1                 ; vroundps      $0x1,%ymm0,%ymm4
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
@@ -1481,11 +1479,11 @@
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  72,1,248                            ; add           %rdi,%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,51                              ; jne           1884 <_sk_scale_u8_hsw+0x43>
+  DB  117,51                              ; jne           187b <_sk_scale_u8_hsw+0x43>
   DB  197,122,126,0                       ; vmovq         (%rax),%xmm8
   DB  196,66,125,49,192                   ; vpmovzxbd     %xmm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,132,49,0,0         ; vbroadcastss  0x3184(%rip),%ymm9        # 49ec <_sk_callback_hsw+0x233>
+  DB  196,98,125,24,13,129,49,0,0         ; vbroadcastss  0x3181(%rip),%ymm9        # 49e0 <_sk_callback_hsw+0x233>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
@@ -1503,9 +1501,9 @@
   DB  77,9,217                            ; or            %r11,%r9
   DB  72,131,193,8                        ; add           $0x8,%rcx
   DB  73,255,202                          ; dec           %r10
-  DB  117,234                             ; jne           188c <_sk_scale_u8_hsw+0x4b>
+  DB  117,234                             ; jne           1883 <_sk_scale_u8_hsw+0x4b>
   DB  196,65,249,110,193                  ; vmovq         %r9,%xmm8
-  DB  235,172                             ; jmp           1855 <_sk_scale_u8_hsw+0x14>
+  DB  235,172                             ; jmp           184c <_sk_scale_u8_hsw+0x14>
 
 PUBLIC _sk_lerp_1_float_hsw
 _sk_lerp_1_float_hsw LABEL PROC
@@ -1529,11 +1527,11 @@
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  72,1,248                            ; add           %rdi,%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,71                              ; jne           192f <_sk_lerp_u8_hsw+0x57>
+  DB  117,71                              ; jne           1926 <_sk_lerp_u8_hsw+0x57>
   DB  197,122,126,0                       ; vmovq         (%rax),%xmm8
   DB  196,66,125,49,192                   ; vpmovzxbd     %xmm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,241,48,0,0         ; vbroadcastss  0x30f1(%rip),%ymm9        # 49f0 <_sk_callback_hsw+0x237>
+  DB  196,98,125,24,13,238,48,0,0         ; vbroadcastss  0x30ee(%rip),%ymm9        # 49e4 <_sk_callback_hsw+0x237>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
   DB  196,226,61,168,196                  ; vfmadd213ps   %ymm4,%ymm8,%ymm0
@@ -1555,32 +1553,32 @@
   DB  77,9,217                            ; or            %r11,%r9
   DB  72,131,193,8                        ; add           $0x8,%rcx
   DB  73,255,202                          ; dec           %r10
-  DB  117,234                             ; jne           1937 <_sk_lerp_u8_hsw+0x5f>
+  DB  117,234                             ; jne           192e <_sk_lerp_u8_hsw+0x5f>
   DB  196,65,249,110,193                  ; vmovq         %r9,%xmm8
-  DB  235,152                             ; jmp           18ec <_sk_lerp_u8_hsw+0x14>
+  DB  235,152                             ; jmp           18e3 <_sk_lerp_u8_hsw+0x14>
 
 PUBLIC _sk_lerp_565_hsw
 _sk_lerp_565_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,169,0,0,0                    ; jne           1a0b <_sk_lerp_565_hsw+0xb7>
+  DB  15,133,169,0,0,0                    ; jne           1a02 <_sk_lerp_565_hsw+0xb7>
   DB  196,65,122,111,4,122                ; vmovdqu       (%r10,%rdi,2),%xmm8
   DB  196,66,125,51,192                   ; vpmovzxwd     %xmm8,%ymm8
-  DB  196,98,125,88,13,126,48,0,0         ; vpbroadcastd  0x307e(%rip),%ymm9        # 49f4 <_sk_callback_hsw+0x23b>
+  DB  196,98,125,88,13,123,48,0,0         ; vpbroadcastd  0x307b(%rip),%ymm9        # 49e8 <_sk_callback_hsw+0x23b>
   DB  196,65,61,219,201                   ; vpand         %ymm9,%ymm8,%ymm9
   DB  196,65,124,91,201                   ; vcvtdq2ps     %ymm9,%ymm9
-  DB  196,98,125,24,21,111,48,0,0         ; vbroadcastss  0x306f(%rip),%ymm10        # 49f8 <_sk_callback_hsw+0x23f>
+  DB  196,98,125,24,21,108,48,0,0         ; vbroadcastss  0x306c(%rip),%ymm10        # 49ec <_sk_callback_hsw+0x23f>
   DB  196,65,52,89,202                    ; vmulps        %ymm10,%ymm9,%ymm9
-  DB  196,98,125,88,21,101,48,0,0         ; vpbroadcastd  0x3065(%rip),%ymm10        # 49fc <_sk_callback_hsw+0x243>
+  DB  196,98,125,88,21,98,48,0,0          ; vpbroadcastd  0x3062(%rip),%ymm10        # 49f0 <_sk_callback_hsw+0x243>
   DB  196,65,61,219,210                   ; vpand         %ymm10,%ymm8,%ymm10
   DB  196,65,124,91,210                   ; vcvtdq2ps     %ymm10,%ymm10
-  DB  196,98,125,24,29,86,48,0,0          ; vbroadcastss  0x3056(%rip),%ymm11        # 4a00 <_sk_callback_hsw+0x247>
+  DB  196,98,125,24,29,83,48,0,0          ; vbroadcastss  0x3053(%rip),%ymm11        # 49f4 <_sk_callback_hsw+0x247>
   DB  196,65,44,89,211                    ; vmulps        %ymm11,%ymm10,%ymm10
-  DB  196,98,125,88,29,76,48,0,0          ; vpbroadcastd  0x304c(%rip),%ymm11        # 4a04 <_sk_callback_hsw+0x24b>
+  DB  196,98,125,88,29,73,48,0,0          ; vpbroadcastd  0x3049(%rip),%ymm11        # 49f8 <_sk_callback_hsw+0x24b>
   DB  196,65,61,219,195                   ; vpand         %ymm11,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,29,61,48,0,0          ; vbroadcastss  0x303d(%rip),%ymm11        # 4a08 <_sk_callback_hsw+0x24f>
+  DB  196,98,125,24,29,58,48,0,0          ; vbroadcastss  0x303a(%rip),%ymm11        # 49fc <_sk_callback_hsw+0x24f>
   DB  196,65,60,89,195                    ; vmulps        %ymm11,%ymm8,%ymm8
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
   DB  196,226,53,168,196                  ; vfmadd213ps   %ymm4,%ymm9,%ymm0
@@ -1601,9 +1599,9 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  15,135,68,255,255,255               ; ja            1968 <_sk_lerp_565_hsw+0x14>
+  DB  15,135,68,255,255,255               ; ja            195f <_sk_lerp_565_hsw+0x14>
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,77,0,0,0                  ; lea           0x4d(%rip),%r9        # 1a7c <_sk_lerp_565_hsw+0x128>
+  DB  76,141,13,74,0,0,0                  ; lea           0x4a(%rip),%r9        # 1a70 <_sk_lerp_565_hsw+0x125>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -1615,26 +1613,28 @@
   DB  196,65,57,196,68,122,4,2            ; vpinsrw       $0x2,0x4(%r10,%rdi,2),%xmm8,%xmm8
   DB  196,65,57,196,68,122,2,1            ; vpinsrw       $0x1,0x2(%r10,%rdi,2),%xmm8,%xmm8
   DB  196,65,57,196,4,122,0               ; vpinsrw       $0x0,(%r10,%rdi,2),%xmm8,%xmm8
-  DB  233,239,254,255,255                 ; jmpq          1968 <_sk_lerp_565_hsw+0x14>
-  DB  15,31,0                             ; nopl          (%rax)
-  DB  241                                 ; icebp
+  DB  233,239,254,255,255                 ; jmpq          195f <_sk_lerp_565_hsw+0x14>
+  DB  244                                 ; hlt
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  233,255,255,255,225                 ; jmpq          ffffffffe2001a84 <_sk_callback_hsw+0xffffffffe1ffd2cb>
+  DB  236                                 ; in            (%dx),%al
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,228                             ; jmpq          *%rsp
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  217,255                             ; fcos
+  DB  220,255                             ; fdivr         %st,%st(7)
   DB  255                                 ; (bad)
-  DB  255,209                             ; callq         *%rcx
+  DB  255,212                             ; callq         *%rsp
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,201                             ; dec           %ecx
+  DB  255,204                             ; dec           %esp
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  188                                 ; .byte         0xbc
+  DB  191                                 ; .byte         0xbf
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; .byte         0xff
@@ -1646,23 +1646,23 @@
   DB  76,141,12,189,0,0,0,0               ; lea           0x0(,%rdi,4),%r9
   DB  76,3,8                              ; add           (%rax),%r9
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,105                             ; jne           1b16 <_sk_load_tables_hsw+0x7e>
+  DB  117,105                             ; jne           1b0a <_sk_load_tables_hsw+0x7e>
   DB  196,193,126,111,25                  ; vmovdqu       (%r9),%ymm3
-  DB  197,229,219,13,6,50,0,0             ; vpand         0x3206(%rip),%ymm3,%ymm1        # 4cc0 <_sk_callback_hsw+0x507>
+  DB  197,229,219,13,18,50,0,0            ; vpand         0x3212(%rip),%ymm3,%ymm1        # 4cc0 <_sk_callback_hsw+0x513>
   DB  196,65,61,118,192                   ; vpcmpeqd      %ymm8,%ymm8,%ymm8
   DB  72,139,72,8                         ; mov           0x8(%rax),%rcx
   DB  76,139,72,16                        ; mov           0x10(%rax),%r9
   DB  197,237,118,210                     ; vpcmpeqd      %ymm2,%ymm2,%ymm2
   DB  196,226,109,146,4,137               ; vgatherdps    %ymm2,(%rcx,%ymm1,4),%ymm0
-  DB  196,226,101,0,21,6,50,0,0           ; vpshufb       0x3206(%rip),%ymm3,%ymm2        # 4ce0 <_sk_callback_hsw+0x527>
+  DB  196,226,101,0,21,18,50,0,0          ; vpshufb       0x3212(%rip),%ymm3,%ymm2        # 4ce0 <_sk_callback_hsw+0x533>
   DB  196,65,53,118,201                   ; vpcmpeqd      %ymm9,%ymm9,%ymm9
   DB  196,194,53,146,12,145               ; vgatherdps    %ymm9,(%r9,%ymm2,4),%ymm1
   DB  72,139,64,24                        ; mov           0x18(%rax),%rax
-  DB  196,98,101,0,13,14,50,0,0           ; vpshufb       0x320e(%rip),%ymm3,%ymm9        # 4d00 <_sk_callback_hsw+0x547>
+  DB  196,98,101,0,13,26,50,0,0           ; vpshufb       0x321a(%rip),%ymm3,%ymm9        # 4d00 <_sk_callback_hsw+0x553>
   DB  196,162,61,146,20,136               ; vgatherdps    %ymm8,(%rax,%ymm9,4),%ymm2
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,2,47,0,0            ; vbroadcastss  0x2f02(%rip),%ymm8        # 4a0c <_sk_callback_hsw+0x253>
+  DB  196,98,125,24,5,2,47,0,0            ; vbroadcastss  0x2f02(%rip),%ymm8        # 4a00 <_sk_callback_hsw+0x253>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,193                          ; mov           %r8,%rcx
@@ -1675,7 +1675,7 @@
   DB  196,193,249,110,194                 ; vmovq         %r10,%xmm0
   DB  196,226,125,33,192                  ; vpmovsxbd     %xmm0,%ymm0
   DB  196,194,125,140,25                  ; vpmaskmovd    (%r9),%ymm0,%ymm3
-  DB  233,115,255,255,255                 ; jmpq          1ab2 <_sk_load_tables_hsw+0x1a>
+  DB  233,115,255,255,255                 ; jmpq          1aa6 <_sk_load_tables_hsw+0x1a>
 
 PUBLIC _sk_load_tables_u16_be_hsw
 _sk_load_tables_u16_be_hsw LABEL PROC
@@ -1683,7 +1683,7 @@
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  76,141,12,189,0,0,0,0               ; lea           0x0(,%rdi,4),%r9
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,201,0,0,0                    ; jne           1c1e <_sk_load_tables_u16_be_hsw+0xdf>
+  DB  15,133,201,0,0,0                    ; jne           1c12 <_sk_load_tables_u16_be_hsw+0xdf>
   DB  196,1,121,16,4,72                   ; vmovupd       (%r8,%r9,2),%xmm8
   DB  196,129,121,16,84,72,16             ; vmovupd       0x10(%r8,%r9,2),%xmm2
   DB  196,129,121,16,92,72,32             ; vmovupd       0x20(%r8,%r9,2),%xmm3
@@ -1699,7 +1699,7 @@
   DB  197,185,108,200                     ; vpunpcklqdq   %xmm0,%xmm8,%xmm1
   DB  197,185,109,208                     ; vpunpckhqdq   %xmm0,%xmm8,%xmm2
   DB  197,49,108,195                      ; vpunpcklqdq   %xmm3,%xmm9,%xmm8
-  DB  197,121,111,21,154,50,0,0           ; vmovdqa       0x329a(%rip),%xmm10        # 4e40 <_sk_callback_hsw+0x687>
+  DB  197,121,111,21,166,50,0,0           ; vmovdqa       0x32a6(%rip),%xmm10        # 4e40 <_sk_callback_hsw+0x693>
   DB  196,193,113,219,194                 ; vpand         %xmm10,%xmm1,%xmm0
   DB  196,226,125,51,200                  ; vpmovzxwd     %xmm0,%ymm1
   DB  196,65,37,118,219                   ; vpcmpeqd      %ymm11,%ymm11,%ymm11
@@ -1721,36 +1721,36 @@
   DB  197,185,235,219                     ; vpor          %xmm3,%xmm8,%xmm3
   DB  196,226,125,51,219                  ; vpmovzxwd     %xmm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,251,45,0,0          ; vbroadcastss  0x2dfb(%rip),%ymm8        # 4a10 <_sk_callback_hsw+0x257>
+  DB  196,98,125,24,5,251,45,0,0          ; vbroadcastss  0x2dfb(%rip),%ymm8        # 4a04 <_sk_callback_hsw+0x257>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,1,123,16,4,72                   ; vmovsd        (%r8,%r9,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  116,85                              ; je            1c84 <_sk_load_tables_u16_be_hsw+0x145>
+  DB  116,85                              ; je            1c78 <_sk_load_tables_u16_be_hsw+0x145>
   DB  196,1,57,22,68,72,8                 ; vmovhpd       0x8(%r8,%r9,2),%xmm8,%xmm8
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,72                              ; jb            1c84 <_sk_load_tables_u16_be_hsw+0x145>
+  DB  114,72                              ; jb            1c78 <_sk_load_tables_u16_be_hsw+0x145>
   DB  196,129,123,16,84,72,16             ; vmovsd        0x10(%r8,%r9,2),%xmm2
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  116,72                              ; je            1c91 <_sk_load_tables_u16_be_hsw+0x152>
+  DB  116,72                              ; je            1c85 <_sk_load_tables_u16_be_hsw+0x152>
   DB  196,129,105,22,84,72,24             ; vmovhpd       0x18(%r8,%r9,2),%xmm2,%xmm2
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,59                              ; jb            1c91 <_sk_load_tables_u16_be_hsw+0x152>
+  DB  114,59                              ; jb            1c85 <_sk_load_tables_u16_be_hsw+0x152>
   DB  196,129,123,16,92,72,32             ; vmovsd        0x20(%r8,%r9,2),%xmm3
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  15,132,9,255,255,255                ; je            1b70 <_sk_load_tables_u16_be_hsw+0x31>
+  DB  15,132,9,255,255,255                ; je            1b64 <_sk_load_tables_u16_be_hsw+0x31>
   DB  196,129,97,22,92,72,40              ; vmovhpd       0x28(%r8,%r9,2),%xmm3,%xmm3
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  15,130,248,254,255,255              ; jb            1b70 <_sk_load_tables_u16_be_hsw+0x31>
+  DB  15,130,248,254,255,255              ; jb            1b64 <_sk_load_tables_u16_be_hsw+0x31>
   DB  196,1,122,126,76,72,48              ; vmovq         0x30(%r8,%r9,2),%xmm9
-  DB  233,236,254,255,255                 ; jmpq          1b70 <_sk_load_tables_u16_be_hsw+0x31>
+  DB  233,236,254,255,255                 ; jmpq          1b64 <_sk_load_tables_u16_be_hsw+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,223,254,255,255                 ; jmpq          1b70 <_sk_load_tables_u16_be_hsw+0x31>
+  DB  233,223,254,255,255                 ; jmpq          1b64 <_sk_load_tables_u16_be_hsw+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,214,254,255,255                 ; jmpq          1b70 <_sk_load_tables_u16_be_hsw+0x31>
+  DB  233,214,254,255,255                 ; jmpq          1b64 <_sk_load_tables_u16_be_hsw+0x31>
 
 PUBLIC _sk_load_tables_rgb_u16_be_hsw
 _sk_load_tables_rgb_u16_be_hsw LABEL PROC
@@ -1758,7 +1758,7 @@
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  76,141,12,127                       ; lea           (%rdi,%rdi,2),%r9
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,193,0,0,0                    ; jne           1d6d <_sk_load_tables_rgb_u16_be_hsw+0xd3>
+  DB  15,133,193,0,0,0                    ; jne           1d61 <_sk_load_tables_rgb_u16_be_hsw+0xd3>
   DB  196,129,122,111,4,72                ; vmovdqu       (%r8,%r9,2),%xmm0
   DB  196,129,122,111,84,72,12            ; vmovdqu       0xc(%r8,%r9,2),%xmm2
   DB  196,129,122,111,76,72,24            ; vmovdqu       0x18(%r8,%r9,2),%xmm1
@@ -1779,7 +1779,7 @@
   DB  197,185,108,218                     ; vpunpcklqdq   %xmm2,%xmm8,%xmm3
   DB  197,185,109,210                     ; vpunpckhqdq   %xmm2,%xmm8,%xmm2
   DB  197,121,108,193                     ; vpunpcklqdq   %xmm1,%xmm0,%xmm8
-  DB  197,121,111,13,58,49,0,0            ; vmovdqa       0x313a(%rip),%xmm9        # 4e50 <_sk_callback_hsw+0x697>
+  DB  197,121,111,13,70,49,0,0            ; vmovdqa       0x3146(%rip),%xmm9        # 4e50 <_sk_callback_hsw+0x6a3>
   DB  196,193,97,219,193                  ; vpand         %xmm9,%xmm3,%xmm0
   DB  196,226,125,51,200                  ; vpmovzxwd     %xmm0,%ymm1
   DB  197,229,118,219                     ; vpcmpeqd      %ymm3,%ymm3,%ymm3
@@ -1796,41 +1796,41 @@
   DB  196,98,125,51,194                   ; vpmovzxwd     %xmm2,%ymm8
   DB  196,162,101,146,20,128              ; vgatherdps    %ymm3,(%rax,%ymm8,4),%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,169,44,0,0        ; vbroadcastss  0x2ca9(%rip),%ymm3        # 4a14 <_sk_callback_hsw+0x25b>
+  DB  196,226,125,24,29,169,44,0,0        ; vbroadcastss  0x2ca9(%rip),%ymm3        # 4a08 <_sk_callback_hsw+0x25b>
   DB  255,224                             ; jmpq          *%rax
   DB  196,129,121,110,4,72                ; vmovd         (%r8,%r9,2),%xmm0
   DB  196,129,121,196,68,72,4,2           ; vpinsrw       $0x2,0x4(%r8,%r9,2),%xmm0,%xmm0
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  117,5                               ; jne           1d86 <_sk_load_tables_rgb_u16_be_hsw+0xec>
-  DB  233,90,255,255,255                  ; jmpq          1ce0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  117,5                               ; jne           1d7a <_sk_load_tables_rgb_u16_be_hsw+0xec>
+  DB  233,90,255,255,255                  ; jmpq          1cd4 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   DB  196,129,121,110,76,72,6             ; vmovd         0x6(%r8,%r9,2),%xmm1
   DB  196,1,113,196,68,72,10,2            ; vpinsrw       $0x2,0xa(%r8,%r9,2),%xmm1,%xmm8
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,26                              ; jb            1db5 <_sk_load_tables_rgb_u16_be_hsw+0x11b>
+  DB  114,26                              ; jb            1da9 <_sk_load_tables_rgb_u16_be_hsw+0x11b>
   DB  196,129,121,110,76,72,12            ; vmovd         0xc(%r8,%r9,2),%xmm1
   DB  196,129,113,196,84,72,16,2          ; vpinsrw       $0x2,0x10(%r8,%r9,2),%xmm1,%xmm2
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  117,10                              ; jne           1dba <_sk_load_tables_rgb_u16_be_hsw+0x120>
-  DB  233,43,255,255,255                  ; jmpq          1ce0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  DB  233,38,255,255,255                  ; jmpq          1ce0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  117,10                              ; jne           1dae <_sk_load_tables_rgb_u16_be_hsw+0x120>
+  DB  233,43,255,255,255                  ; jmpq          1cd4 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  233,38,255,255,255                  ; jmpq          1cd4 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   DB  196,129,121,110,76,72,18            ; vmovd         0x12(%r8,%r9,2),%xmm1
   DB  196,1,113,196,76,72,22,2            ; vpinsrw       $0x2,0x16(%r8,%r9,2),%xmm1,%xmm9
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,26                              ; jb            1de9 <_sk_load_tables_rgb_u16_be_hsw+0x14f>
+  DB  114,26                              ; jb            1ddd <_sk_load_tables_rgb_u16_be_hsw+0x14f>
   DB  196,129,121,110,76,72,24            ; vmovd         0x18(%r8,%r9,2),%xmm1
   DB  196,129,113,196,76,72,28,2          ; vpinsrw       $0x2,0x1c(%r8,%r9,2),%xmm1,%xmm1
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  117,10                              ; jne           1dee <_sk_load_tables_rgb_u16_be_hsw+0x154>
-  DB  233,247,254,255,255                 ; jmpq          1ce0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  DB  233,242,254,255,255                 ; jmpq          1ce0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  117,10                              ; jne           1de2 <_sk_load_tables_rgb_u16_be_hsw+0x154>
+  DB  233,247,254,255,255                 ; jmpq          1cd4 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  233,242,254,255,255                 ; jmpq          1cd4 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   DB  196,129,121,110,92,72,30            ; vmovd         0x1e(%r8,%r9,2),%xmm3
   DB  196,1,97,196,92,72,34,2             ; vpinsrw       $0x2,0x22(%r8,%r9,2),%xmm3,%xmm11
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  114,20                              ; jb            1e17 <_sk_load_tables_rgb_u16_be_hsw+0x17d>
+  DB  114,20                              ; jb            1e0b <_sk_load_tables_rgb_u16_be_hsw+0x17d>
   DB  196,129,121,110,92,72,36            ; vmovd         0x24(%r8,%r9,2),%xmm3
   DB  196,129,97,196,92,72,40,2           ; vpinsrw       $0x2,0x28(%r8,%r9,2),%xmm3,%xmm3
-  DB  233,201,254,255,255                 ; jmpq          1ce0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  DB  233,196,254,255,255                 ; jmpq          1ce0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  233,201,254,255,255                 ; jmpq          1cd4 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  233,196,254,255,255                 ; jmpq          1cd4 <_sk_load_tables_rgb_u16_be_hsw+0x46>
 
 PUBLIC _sk_byte_tables_hsw
 _sk_byte_tables_hsw LABEL PROC
@@ -1841,7 +1841,7 @@
   DB  65,84                               ; push          %r12
   DB  83                                  ; push          %rbx
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,231,43,0,0          ; vbroadcastss  0x2be7(%rip),%ymm8        # 4a18 <_sk_callback_hsw+0x25f>
+  DB  196,98,125,24,5,231,43,0,0          ; vbroadcastss  0x2be7(%rip),%ymm8        # 4a0c <_sk_callback_hsw+0x25f>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  197,253,91,192                      ; vcvtps2dq     %ymm0,%ymm0
   DB  196,195,249,22,192,1                ; vpextrq       $0x1,%xmm0,%r8
@@ -1878,7 +1878,7 @@
   DB  196,227,121,32,197,7                ; vpinsrb       $0x7,%ebp,%xmm0,%xmm0
   DB  196,226,125,49,192                  ; vpmovzxbd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,13,56,43,0,0          ; vbroadcastss  0x2b38(%rip),%ymm9        # 4a1c <_sk_callback_hsw+0x263>
+  DB  196,98,125,24,13,56,43,0,0          ; vbroadcastss  0x2b38(%rip),%ymm9        # 4a10 <_sk_callback_hsw+0x263>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
   DB  197,253,91,201                      ; vcvtps2dq     %ymm1,%ymm1
@@ -2037,7 +2037,7 @@
   DB  196,227,121,32,197,7                ; vpinsrb       $0x7,%ebp,%xmm0,%xmm0
   DB  196,226,125,49,192                  ; vpmovzxbd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,13,113,40,0,0         ; vbroadcastss  0x2871(%rip),%ymm9        # 4a20 <_sk_callback_hsw+0x267>
+  DB  196,98,125,24,13,113,40,0,0         ; vbroadcastss  0x2871(%rip),%ymm9        # 4a14 <_sk_callback_hsw+0x267>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
   DB  197,253,91,201                      ; vcvtps2dq     %ymm1,%ymm1
@@ -2190,33 +2190,33 @@
   DB  196,66,125,168,211                  ; vfmadd213ps   %ymm11,%ymm0,%ymm10
   DB  196,226,125,24,0                    ; vbroadcastss  (%rax),%ymm0
   DB  196,65,124,91,218                   ; vcvtdq2ps     %ymm10,%ymm11
-  DB  196,98,125,24,37,36,38,0,0          ; vbroadcastss  0x2624(%rip),%ymm12        # 4a24 <_sk_callback_hsw+0x26b>
-  DB  196,98,125,24,45,31,38,0,0          ; vbroadcastss  0x261f(%rip),%ymm13        # 4a28 <_sk_callback_hsw+0x26f>
+  DB  196,98,125,24,37,36,38,0,0          ; vbroadcastss  0x2624(%rip),%ymm12        # 4a18 <_sk_callback_hsw+0x26b>
+  DB  196,98,125,24,45,31,38,0,0          ; vbroadcastss  0x261f(%rip),%ymm13        # 4a1c <_sk_callback_hsw+0x26f>
   DB  196,65,44,84,213                    ; vandps        %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,21,38,0,0          ; vbroadcastss  0x2615(%rip),%ymm13        # 4a2c <_sk_callback_hsw+0x273>
+  DB  196,98,125,24,45,21,38,0,0          ; vbroadcastss  0x2615(%rip),%ymm13        # 4a20 <_sk_callback_hsw+0x273>
   DB  196,65,44,86,213                    ; vorps         %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,11,38,0,0          ; vbroadcastss  0x260b(%rip),%ymm13        # 4a30 <_sk_callback_hsw+0x277>
+  DB  196,98,125,24,45,11,38,0,0          ; vbroadcastss  0x260b(%rip),%ymm13        # 4a24 <_sk_callback_hsw+0x277>
   DB  196,66,37,184,236                   ; vfmadd231ps   %ymm12,%ymm11,%ymm13
-  DB  196,98,125,24,29,1,38,0,0           ; vbroadcastss  0x2601(%rip),%ymm11        # 4a34 <_sk_callback_hsw+0x27b>
+  DB  196,98,125,24,29,1,38,0,0           ; vbroadcastss  0x2601(%rip),%ymm11        # 4a28 <_sk_callback_hsw+0x27b>
   DB  196,66,45,172,221                   ; vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  DB  196,98,125,24,37,247,37,0,0         ; vbroadcastss  0x25f7(%rip),%ymm12        # 4a38 <_sk_callback_hsw+0x27f>
+  DB  196,98,125,24,37,247,37,0,0         ; vbroadcastss  0x25f7(%rip),%ymm12        # 4a2c <_sk_callback_hsw+0x27f>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,237,37,0,0         ; vbroadcastss  0x25ed(%rip),%ymm12        # 4a3c <_sk_callback_hsw+0x283>
+  DB  196,98,125,24,37,237,37,0,0         ; vbroadcastss  0x25ed(%rip),%ymm12        # 4a30 <_sk_callback_hsw+0x283>
   DB  196,65,28,94,210                    ; vdivps        %ymm10,%ymm12,%ymm10
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  196,99,125,8,208,1                  ; vroundps      $0x1,%ymm0,%ymm10
   DB  196,65,124,92,210                   ; vsubps        %ymm10,%ymm0,%ymm10
-  DB  196,98,125,24,29,206,37,0,0         ; vbroadcastss  0x25ce(%rip),%ymm11        # 4a40 <_sk_callback_hsw+0x287>
+  DB  196,98,125,24,29,206,37,0,0         ; vbroadcastss  0x25ce(%rip),%ymm11        # 4a34 <_sk_callback_hsw+0x287>
   DB  196,193,124,88,195                  ; vaddps        %ymm11,%ymm0,%ymm0
-  DB  196,98,125,24,29,196,37,0,0         ; vbroadcastss  0x25c4(%rip),%ymm11        # 4a44 <_sk_callback_hsw+0x28b>
+  DB  196,98,125,24,29,196,37,0,0         ; vbroadcastss  0x25c4(%rip),%ymm11        # 4a38 <_sk_callback_hsw+0x28b>
   DB  196,98,45,172,216                   ; vfnmadd213ps  %ymm0,%ymm10,%ymm11
-  DB  196,226,125,24,5,186,37,0,0         ; vbroadcastss  0x25ba(%rip),%ymm0        # 4a48 <_sk_callback_hsw+0x28f>
+  DB  196,226,125,24,5,186,37,0,0         ; vbroadcastss  0x25ba(%rip),%ymm0        # 4a3c <_sk_callback_hsw+0x28f>
   DB  196,193,124,92,194                  ; vsubps        %ymm10,%ymm0,%ymm0
-  DB  196,98,125,24,21,176,37,0,0         ; vbroadcastss  0x25b0(%rip),%ymm10        # 4a4c <_sk_callback_hsw+0x293>
+  DB  196,98,125,24,21,176,37,0,0         ; vbroadcastss  0x25b0(%rip),%ymm10        # 4a40 <_sk_callback_hsw+0x293>
   DB  197,172,94,192                      ; vdivps        %ymm0,%ymm10,%ymm0
   DB  197,164,88,192                      ; vaddps        %ymm0,%ymm11,%ymm0
-  DB  196,98,125,24,21,163,37,0,0         ; vbroadcastss  0x25a3(%rip),%ymm10        # 4a50 <_sk_callback_hsw+0x297>
+  DB  196,98,125,24,21,163,37,0,0         ; vbroadcastss  0x25a3(%rip),%ymm10        # 4a44 <_sk_callback_hsw+0x297>
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  197,253,91,192                      ; vcvtps2dq     %ymm0,%ymm0
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -2224,7 +2224,7 @@
   DB  196,195,125,74,193,128              ; vblendvps     %ymm8,%ymm9,%ymm0,%ymm0
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,124,95,192                  ; vmaxps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,122,37,0,0          ; vbroadcastss  0x257a(%rip),%ymm8        # 4a54 <_sk_callback_hsw+0x29b>
+  DB  196,98,125,24,5,122,37,0,0          ; vbroadcastss  0x257a(%rip),%ymm8        # 4a48 <_sk_callback_hsw+0x29b>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2242,33 +2242,33 @@
   DB  196,66,117,168,211                  ; vfmadd213ps   %ymm11,%ymm1,%ymm10
   DB  196,226,125,24,8                    ; vbroadcastss  (%rax),%ymm1
   DB  196,65,124,91,218                   ; vcvtdq2ps     %ymm10,%ymm11
-  DB  196,98,125,24,37,50,37,0,0          ; vbroadcastss  0x2532(%rip),%ymm12        # 4a58 <_sk_callback_hsw+0x29f>
-  DB  196,98,125,24,45,45,37,0,0          ; vbroadcastss  0x252d(%rip),%ymm13        # 4a5c <_sk_callback_hsw+0x2a3>
+  DB  196,98,125,24,37,50,37,0,0          ; vbroadcastss  0x2532(%rip),%ymm12        # 4a4c <_sk_callback_hsw+0x29f>
+  DB  196,98,125,24,45,45,37,0,0          ; vbroadcastss  0x252d(%rip),%ymm13        # 4a50 <_sk_callback_hsw+0x2a3>
   DB  196,65,44,84,213                    ; vandps        %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,35,37,0,0          ; vbroadcastss  0x2523(%rip),%ymm13        # 4a60 <_sk_callback_hsw+0x2a7>
+  DB  196,98,125,24,45,35,37,0,0          ; vbroadcastss  0x2523(%rip),%ymm13        # 4a54 <_sk_callback_hsw+0x2a7>
   DB  196,65,44,86,213                    ; vorps         %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,25,37,0,0          ; vbroadcastss  0x2519(%rip),%ymm13        # 4a64 <_sk_callback_hsw+0x2ab>
+  DB  196,98,125,24,45,25,37,0,0          ; vbroadcastss  0x2519(%rip),%ymm13        # 4a58 <_sk_callback_hsw+0x2ab>
   DB  196,66,37,184,236                   ; vfmadd231ps   %ymm12,%ymm11,%ymm13
-  DB  196,98,125,24,29,15,37,0,0          ; vbroadcastss  0x250f(%rip),%ymm11        # 4a68 <_sk_callback_hsw+0x2af>
+  DB  196,98,125,24,29,15,37,0,0          ; vbroadcastss  0x250f(%rip),%ymm11        # 4a5c <_sk_callback_hsw+0x2af>
   DB  196,66,45,172,221                   ; vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  DB  196,98,125,24,37,5,37,0,0           ; vbroadcastss  0x2505(%rip),%ymm12        # 4a6c <_sk_callback_hsw+0x2b3>
+  DB  196,98,125,24,37,5,37,0,0           ; vbroadcastss  0x2505(%rip),%ymm12        # 4a60 <_sk_callback_hsw+0x2b3>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,251,36,0,0         ; vbroadcastss  0x24fb(%rip),%ymm12        # 4a70 <_sk_callback_hsw+0x2b7>
+  DB  196,98,125,24,37,251,36,0,0         ; vbroadcastss  0x24fb(%rip),%ymm12        # 4a64 <_sk_callback_hsw+0x2b7>
   DB  196,65,28,94,210                    ; vdivps        %ymm10,%ymm12,%ymm10
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
   DB  196,193,116,89,202                  ; vmulps        %ymm10,%ymm1,%ymm1
   DB  196,99,125,8,209,1                  ; vroundps      $0x1,%ymm1,%ymm10
   DB  196,65,116,92,210                   ; vsubps        %ymm10,%ymm1,%ymm10
-  DB  196,98,125,24,29,220,36,0,0         ; vbroadcastss  0x24dc(%rip),%ymm11        # 4a74 <_sk_callback_hsw+0x2bb>
+  DB  196,98,125,24,29,220,36,0,0         ; vbroadcastss  0x24dc(%rip),%ymm11        # 4a68 <_sk_callback_hsw+0x2bb>
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,210,36,0,0         ; vbroadcastss  0x24d2(%rip),%ymm11        # 4a78 <_sk_callback_hsw+0x2bf>
+  DB  196,98,125,24,29,210,36,0,0         ; vbroadcastss  0x24d2(%rip),%ymm11        # 4a6c <_sk_callback_hsw+0x2bf>
   DB  196,98,45,172,217                   ; vfnmadd213ps  %ymm1,%ymm10,%ymm11
-  DB  196,226,125,24,13,200,36,0,0        ; vbroadcastss  0x24c8(%rip),%ymm1        # 4a7c <_sk_callback_hsw+0x2c3>
+  DB  196,226,125,24,13,200,36,0,0        ; vbroadcastss  0x24c8(%rip),%ymm1        # 4a70 <_sk_callback_hsw+0x2c3>
   DB  196,193,116,92,202                  ; vsubps        %ymm10,%ymm1,%ymm1
-  DB  196,98,125,24,21,190,36,0,0         ; vbroadcastss  0x24be(%rip),%ymm10        # 4a80 <_sk_callback_hsw+0x2c7>
+  DB  196,98,125,24,21,190,36,0,0         ; vbroadcastss  0x24be(%rip),%ymm10        # 4a74 <_sk_callback_hsw+0x2c7>
   DB  197,172,94,201                      ; vdivps        %ymm1,%ymm10,%ymm1
   DB  197,164,88,201                      ; vaddps        %ymm1,%ymm11,%ymm1
-  DB  196,98,125,24,21,177,36,0,0         ; vbroadcastss  0x24b1(%rip),%ymm10        # 4a84 <_sk_callback_hsw+0x2cb>
+  DB  196,98,125,24,21,177,36,0,0         ; vbroadcastss  0x24b1(%rip),%ymm10        # 4a78 <_sk_callback_hsw+0x2cb>
   DB  196,193,116,89,202                  ; vmulps        %ymm10,%ymm1,%ymm1
   DB  197,253,91,201                      ; vcvtps2dq     %ymm1,%ymm1
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -2276,7 +2276,7 @@
   DB  196,195,117,74,201,128              ; vblendvps     %ymm8,%ymm9,%ymm1,%ymm1
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,116,95,200                  ; vmaxps        %ymm8,%ymm1,%ymm1
-  DB  196,98,125,24,5,136,36,0,0          ; vbroadcastss  0x2488(%rip),%ymm8        # 4a88 <_sk_callback_hsw+0x2cf>
+  DB  196,98,125,24,5,136,36,0,0          ; vbroadcastss  0x2488(%rip),%ymm8        # 4a7c <_sk_callback_hsw+0x2cf>
   DB  196,193,116,93,200                  ; vminps        %ymm8,%ymm1,%ymm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2294,33 +2294,33 @@
   DB  196,66,109,168,211                  ; vfmadd213ps   %ymm11,%ymm2,%ymm10
   DB  196,226,125,24,16                   ; vbroadcastss  (%rax),%ymm2
   DB  196,65,124,91,218                   ; vcvtdq2ps     %ymm10,%ymm11
-  DB  196,98,125,24,37,64,36,0,0          ; vbroadcastss  0x2440(%rip),%ymm12        # 4a8c <_sk_callback_hsw+0x2d3>
-  DB  196,98,125,24,45,59,36,0,0          ; vbroadcastss  0x243b(%rip),%ymm13        # 4a90 <_sk_callback_hsw+0x2d7>
+  DB  196,98,125,24,37,64,36,0,0          ; vbroadcastss  0x2440(%rip),%ymm12        # 4a80 <_sk_callback_hsw+0x2d3>
+  DB  196,98,125,24,45,59,36,0,0          ; vbroadcastss  0x243b(%rip),%ymm13        # 4a84 <_sk_callback_hsw+0x2d7>
   DB  196,65,44,84,213                    ; vandps        %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,49,36,0,0          ; vbroadcastss  0x2431(%rip),%ymm13        # 4a94 <_sk_callback_hsw+0x2db>
+  DB  196,98,125,24,45,49,36,0,0          ; vbroadcastss  0x2431(%rip),%ymm13        # 4a88 <_sk_callback_hsw+0x2db>
   DB  196,65,44,86,213                    ; vorps         %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,39,36,0,0          ; vbroadcastss  0x2427(%rip),%ymm13        # 4a98 <_sk_callback_hsw+0x2df>
+  DB  196,98,125,24,45,39,36,0,0          ; vbroadcastss  0x2427(%rip),%ymm13        # 4a8c <_sk_callback_hsw+0x2df>
   DB  196,66,37,184,236                   ; vfmadd231ps   %ymm12,%ymm11,%ymm13
-  DB  196,98,125,24,29,29,36,0,0          ; vbroadcastss  0x241d(%rip),%ymm11        # 4a9c <_sk_callback_hsw+0x2e3>
+  DB  196,98,125,24,29,29,36,0,0          ; vbroadcastss  0x241d(%rip),%ymm11        # 4a90 <_sk_callback_hsw+0x2e3>
   DB  196,66,45,172,221                   ; vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  DB  196,98,125,24,37,19,36,0,0          ; vbroadcastss  0x2413(%rip),%ymm12        # 4aa0 <_sk_callback_hsw+0x2e7>
+  DB  196,98,125,24,37,19,36,0,0          ; vbroadcastss  0x2413(%rip),%ymm12        # 4a94 <_sk_callback_hsw+0x2e7>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,9,36,0,0           ; vbroadcastss  0x2409(%rip),%ymm12        # 4aa4 <_sk_callback_hsw+0x2eb>
+  DB  196,98,125,24,37,9,36,0,0           ; vbroadcastss  0x2409(%rip),%ymm12        # 4a98 <_sk_callback_hsw+0x2eb>
   DB  196,65,28,94,210                    ; vdivps        %ymm10,%ymm12,%ymm10
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
   DB  196,193,108,89,210                  ; vmulps        %ymm10,%ymm2,%ymm2
   DB  196,99,125,8,210,1                  ; vroundps      $0x1,%ymm2,%ymm10
   DB  196,65,108,92,210                   ; vsubps        %ymm10,%ymm2,%ymm10
-  DB  196,98,125,24,29,234,35,0,0         ; vbroadcastss  0x23ea(%rip),%ymm11        # 4aa8 <_sk_callback_hsw+0x2ef>
+  DB  196,98,125,24,29,234,35,0,0         ; vbroadcastss  0x23ea(%rip),%ymm11        # 4a9c <_sk_callback_hsw+0x2ef>
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
-  DB  196,98,125,24,29,224,35,0,0         ; vbroadcastss  0x23e0(%rip),%ymm11        # 4aac <_sk_callback_hsw+0x2f3>
+  DB  196,98,125,24,29,224,35,0,0         ; vbroadcastss  0x23e0(%rip),%ymm11        # 4aa0 <_sk_callback_hsw+0x2f3>
   DB  196,98,45,172,218                   ; vfnmadd213ps  %ymm2,%ymm10,%ymm11
-  DB  196,226,125,24,21,214,35,0,0        ; vbroadcastss  0x23d6(%rip),%ymm2        # 4ab0 <_sk_callback_hsw+0x2f7>
+  DB  196,226,125,24,21,214,35,0,0        ; vbroadcastss  0x23d6(%rip),%ymm2        # 4aa4 <_sk_callback_hsw+0x2f7>
   DB  196,193,108,92,210                  ; vsubps        %ymm10,%ymm2,%ymm2
-  DB  196,98,125,24,21,204,35,0,0         ; vbroadcastss  0x23cc(%rip),%ymm10        # 4ab4 <_sk_callback_hsw+0x2fb>
+  DB  196,98,125,24,21,204,35,0,0         ; vbroadcastss  0x23cc(%rip),%ymm10        # 4aa8 <_sk_callback_hsw+0x2fb>
   DB  197,172,94,210                      ; vdivps        %ymm2,%ymm10,%ymm2
   DB  197,164,88,210                      ; vaddps        %ymm2,%ymm11,%ymm2
-  DB  196,98,125,24,21,191,35,0,0         ; vbroadcastss  0x23bf(%rip),%ymm10        # 4ab8 <_sk_callback_hsw+0x2ff>
+  DB  196,98,125,24,21,191,35,0,0         ; vbroadcastss  0x23bf(%rip),%ymm10        # 4aac <_sk_callback_hsw+0x2ff>
   DB  196,193,108,89,210                  ; vmulps        %ymm10,%ymm2,%ymm2
   DB  197,253,91,210                      ; vcvtps2dq     %ymm2,%ymm2
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -2328,7 +2328,7 @@
   DB  196,195,109,74,209,128              ; vblendvps     %ymm8,%ymm9,%ymm2,%ymm2
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,108,95,208                  ; vmaxps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,150,35,0,0          ; vbroadcastss  0x2396(%rip),%ymm8        # 4abc <_sk_callback_hsw+0x303>
+  DB  196,98,125,24,5,150,35,0,0          ; vbroadcastss  0x2396(%rip),%ymm8        # 4ab0 <_sk_callback_hsw+0x303>
   DB  196,193,108,93,208                  ; vminps        %ymm8,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2346,33 +2346,33 @@
   DB  196,66,101,168,211                  ; vfmadd213ps   %ymm11,%ymm3,%ymm10
   DB  196,226,125,24,24                   ; vbroadcastss  (%rax),%ymm3
   DB  196,65,124,91,218                   ; vcvtdq2ps     %ymm10,%ymm11
-  DB  196,98,125,24,37,78,35,0,0          ; vbroadcastss  0x234e(%rip),%ymm12        # 4ac0 <_sk_callback_hsw+0x307>
-  DB  196,98,125,24,45,73,35,0,0          ; vbroadcastss  0x2349(%rip),%ymm13        # 4ac4 <_sk_callback_hsw+0x30b>
+  DB  196,98,125,24,37,78,35,0,0          ; vbroadcastss  0x234e(%rip),%ymm12        # 4ab4 <_sk_callback_hsw+0x307>
+  DB  196,98,125,24,45,73,35,0,0          ; vbroadcastss  0x2349(%rip),%ymm13        # 4ab8 <_sk_callback_hsw+0x30b>
   DB  196,65,44,84,213                    ; vandps        %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,63,35,0,0          ; vbroadcastss  0x233f(%rip),%ymm13        # 4ac8 <_sk_callback_hsw+0x30f>
+  DB  196,98,125,24,45,63,35,0,0          ; vbroadcastss  0x233f(%rip),%ymm13        # 4abc <_sk_callback_hsw+0x30f>
   DB  196,65,44,86,213                    ; vorps         %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,53,35,0,0          ; vbroadcastss  0x2335(%rip),%ymm13        # 4acc <_sk_callback_hsw+0x313>
+  DB  196,98,125,24,45,53,35,0,0          ; vbroadcastss  0x2335(%rip),%ymm13        # 4ac0 <_sk_callback_hsw+0x313>
   DB  196,66,37,184,236                   ; vfmadd231ps   %ymm12,%ymm11,%ymm13
-  DB  196,98,125,24,29,43,35,0,0          ; vbroadcastss  0x232b(%rip),%ymm11        # 4ad0 <_sk_callback_hsw+0x317>
+  DB  196,98,125,24,29,43,35,0,0          ; vbroadcastss  0x232b(%rip),%ymm11        # 4ac4 <_sk_callback_hsw+0x317>
   DB  196,66,45,172,221                   ; vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  DB  196,98,125,24,37,33,35,0,0          ; vbroadcastss  0x2321(%rip),%ymm12        # 4ad4 <_sk_callback_hsw+0x31b>
+  DB  196,98,125,24,37,33,35,0,0          ; vbroadcastss  0x2321(%rip),%ymm12        # 4ac8 <_sk_callback_hsw+0x31b>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,23,35,0,0          ; vbroadcastss  0x2317(%rip),%ymm12        # 4ad8 <_sk_callback_hsw+0x31f>
+  DB  196,98,125,24,37,23,35,0,0          ; vbroadcastss  0x2317(%rip),%ymm12        # 4acc <_sk_callback_hsw+0x31f>
   DB  196,65,28,94,210                    ; vdivps        %ymm10,%ymm12,%ymm10
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
   DB  196,193,100,89,218                  ; vmulps        %ymm10,%ymm3,%ymm3
   DB  196,99,125,8,211,1                  ; vroundps      $0x1,%ymm3,%ymm10
   DB  196,65,100,92,210                   ; vsubps        %ymm10,%ymm3,%ymm10
-  DB  196,98,125,24,29,248,34,0,0         ; vbroadcastss  0x22f8(%rip),%ymm11        # 4adc <_sk_callback_hsw+0x323>
+  DB  196,98,125,24,29,248,34,0,0         ; vbroadcastss  0x22f8(%rip),%ymm11        # 4ad0 <_sk_callback_hsw+0x323>
   DB  196,193,100,88,219                  ; vaddps        %ymm11,%ymm3,%ymm3
-  DB  196,98,125,24,29,238,34,0,0         ; vbroadcastss  0x22ee(%rip),%ymm11        # 4ae0 <_sk_callback_hsw+0x327>
+  DB  196,98,125,24,29,238,34,0,0         ; vbroadcastss  0x22ee(%rip),%ymm11        # 4ad4 <_sk_callback_hsw+0x327>
   DB  196,98,45,172,219                   ; vfnmadd213ps  %ymm3,%ymm10,%ymm11
-  DB  196,226,125,24,29,228,34,0,0        ; vbroadcastss  0x22e4(%rip),%ymm3        # 4ae4 <_sk_callback_hsw+0x32b>
+  DB  196,226,125,24,29,228,34,0,0        ; vbroadcastss  0x22e4(%rip),%ymm3        # 4ad8 <_sk_callback_hsw+0x32b>
   DB  196,193,100,92,218                  ; vsubps        %ymm10,%ymm3,%ymm3
-  DB  196,98,125,24,21,218,34,0,0         ; vbroadcastss  0x22da(%rip),%ymm10        # 4ae8 <_sk_callback_hsw+0x32f>
+  DB  196,98,125,24,21,218,34,0,0         ; vbroadcastss  0x22da(%rip),%ymm10        # 4adc <_sk_callback_hsw+0x32f>
   DB  197,172,94,219                      ; vdivps        %ymm3,%ymm10,%ymm3
   DB  197,164,88,219                      ; vaddps        %ymm3,%ymm11,%ymm3
-  DB  196,98,125,24,21,205,34,0,0         ; vbroadcastss  0x22cd(%rip),%ymm10        # 4aec <_sk_callback_hsw+0x333>
+  DB  196,98,125,24,21,205,34,0,0         ; vbroadcastss  0x22cd(%rip),%ymm10        # 4ae0 <_sk_callback_hsw+0x333>
   DB  196,193,100,89,218                  ; vmulps        %ymm10,%ymm3,%ymm3
   DB  197,253,91,219                      ; vcvtps2dq     %ymm3,%ymm3
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -2380,33 +2380,33 @@
   DB  196,195,101,74,217,128              ; vblendvps     %ymm8,%ymm9,%ymm3,%ymm3
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,100,95,216                  ; vmaxps        %ymm8,%ymm3,%ymm3
-  DB  196,98,125,24,5,164,34,0,0          ; vbroadcastss  0x22a4(%rip),%ymm8        # 4af0 <_sk_callback_hsw+0x337>
+  DB  196,98,125,24,5,164,34,0,0          ; vbroadcastss  0x22a4(%rip),%ymm8        # 4ae4 <_sk_callback_hsw+0x337>
   DB  196,193,100,93,216                  ; vminps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_lab_to_xyz_hsw
 _sk_lab_to_xyz_hsw LABEL PROC
-  DB  196,98,125,24,5,150,34,0,0          ; vbroadcastss  0x2296(%rip),%ymm8        # 4af4 <_sk_callback_hsw+0x33b>
-  DB  196,98,125,24,13,145,34,0,0         ; vbroadcastss  0x2291(%rip),%ymm9        # 4af8 <_sk_callback_hsw+0x33f>
-  DB  196,98,125,24,21,140,34,0,0         ; vbroadcastss  0x228c(%rip),%ymm10        # 4afc <_sk_callback_hsw+0x343>
+  DB  196,98,125,24,5,150,34,0,0          ; vbroadcastss  0x2296(%rip),%ymm8        # 4ae8 <_sk_callback_hsw+0x33b>
+  DB  196,98,125,24,13,145,34,0,0         ; vbroadcastss  0x2291(%rip),%ymm9        # 4aec <_sk_callback_hsw+0x33f>
+  DB  196,98,125,24,21,140,34,0,0         ; vbroadcastss  0x228c(%rip),%ymm10        # 4af0 <_sk_callback_hsw+0x343>
   DB  196,194,53,168,202                  ; vfmadd213ps   %ymm10,%ymm9,%ymm1
   DB  196,194,53,168,210                  ; vfmadd213ps   %ymm10,%ymm9,%ymm2
-  DB  196,98,125,24,13,125,34,0,0         ; vbroadcastss  0x227d(%rip),%ymm9        # 4b00 <_sk_callback_hsw+0x347>
+  DB  196,98,125,24,13,125,34,0,0         ; vbroadcastss  0x227d(%rip),%ymm9        # 4af4 <_sk_callback_hsw+0x347>
   DB  196,66,125,184,200                  ; vfmadd231ps   %ymm8,%ymm0,%ymm9
-  DB  196,226,125,24,5,115,34,0,0         ; vbroadcastss  0x2273(%rip),%ymm0        # 4b04 <_sk_callback_hsw+0x34b>
+  DB  196,226,125,24,5,115,34,0,0         ; vbroadcastss  0x2273(%rip),%ymm0        # 4af8 <_sk_callback_hsw+0x34b>
   DB  197,180,89,192                      ; vmulps        %ymm0,%ymm9,%ymm0
-  DB  196,98,125,24,5,106,34,0,0          ; vbroadcastss  0x226a(%rip),%ymm8        # 4b08 <_sk_callback_hsw+0x34f>
+  DB  196,98,125,24,5,106,34,0,0          ; vbroadcastss  0x226a(%rip),%ymm8        # 4afc <_sk_callback_hsw+0x34f>
   DB  196,98,117,168,192                  ; vfmadd213ps   %ymm0,%ymm1,%ymm8
-  DB  196,98,125,24,13,96,34,0,0          ; vbroadcastss  0x2260(%rip),%ymm9        # 4b0c <_sk_callback_hsw+0x353>
+  DB  196,98,125,24,13,96,34,0,0          ; vbroadcastss  0x2260(%rip),%ymm9        # 4b00 <_sk_callback_hsw+0x353>
   DB  196,98,109,172,200                  ; vfnmadd213ps  %ymm0,%ymm2,%ymm9
   DB  196,193,60,89,200                   ; vmulps        %ymm8,%ymm8,%ymm1
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
-  DB  196,226,125,24,21,77,34,0,0         ; vbroadcastss  0x224d(%rip),%ymm2        # 4b10 <_sk_callback_hsw+0x357>
+  DB  196,226,125,24,21,77,34,0,0         ; vbroadcastss  0x224d(%rip),%ymm2        # 4b04 <_sk_callback_hsw+0x357>
   DB  197,108,194,209,1                   ; vcmpltps      %ymm1,%ymm2,%ymm10
-  DB  196,98,125,24,29,67,34,0,0          ; vbroadcastss  0x2243(%rip),%ymm11        # 4b14 <_sk_callback_hsw+0x35b>
+  DB  196,98,125,24,29,67,34,0,0          ; vbroadcastss  0x2243(%rip),%ymm11        # 4b08 <_sk_callback_hsw+0x35b>
   DB  196,65,60,88,195                    ; vaddps        %ymm11,%ymm8,%ymm8
-  DB  196,98,125,24,37,57,34,0,0          ; vbroadcastss  0x2239(%rip),%ymm12        # 4b18 <_sk_callback_hsw+0x35f>
+  DB  196,98,125,24,37,57,34,0,0          ; vbroadcastss  0x2239(%rip),%ymm12        # 4b0c <_sk_callback_hsw+0x35f>
   DB  196,65,60,89,196                    ; vmulps        %ymm12,%ymm8,%ymm8
   DB  196,99,61,74,193,160                ; vblendvps     %ymm10,%ymm1,%ymm8,%ymm8
   DB  197,252,89,200                      ; vmulps        %ymm0,%ymm0,%ymm1
@@ -2421,9 +2421,9 @@
   DB  196,65,52,88,203                    ; vaddps        %ymm11,%ymm9,%ymm9
   DB  196,65,52,89,204                    ; vmulps        %ymm12,%ymm9,%ymm9
   DB  196,227,53,74,208,32                ; vblendvps     %ymm2,%ymm0,%ymm9,%ymm2
-  DB  196,226,125,24,5,238,33,0,0         ; vbroadcastss  0x21ee(%rip),%ymm0        # 4b1c <_sk_callback_hsw+0x363>
+  DB  196,226,125,24,5,238,33,0,0         ; vbroadcastss  0x21ee(%rip),%ymm0        # 4b10 <_sk_callback_hsw+0x363>
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
-  DB  196,98,125,24,5,229,33,0,0          ; vbroadcastss  0x21e5(%rip),%ymm8        # 4b20 <_sk_callback_hsw+0x367>
+  DB  196,98,125,24,5,229,33,0,0          ; vbroadcastss  0x21e5(%rip),%ymm8        # 4b14 <_sk_callback_hsw+0x367>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2435,11 +2435,11 @@
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  72,1,248                            ; add           %rdi,%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,45                              ; jne           2981 <_sk_load_a8_hsw+0x3d>
+  DB  117,45                              ; jne           2975 <_sk_load_a8_hsw+0x3d>
   DB  197,250,126,0                       ; vmovq         (%rax),%xmm0
   DB  196,226,125,49,192                  ; vpmovzxbd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,186,33,0,0        ; vbroadcastss  0x21ba(%rip),%ymm1        # 4b24 <_sk_callback_hsw+0x36b>
+  DB  196,226,125,24,13,186,33,0,0        ; vbroadcastss  0x21ba(%rip),%ymm1        # 4b18 <_sk_callback_hsw+0x36b>
   DB  197,252,89,217                      ; vmulps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -2456,9 +2456,9 @@
   DB  77,9,217                            ; or            %r11,%r9
   DB  72,131,193,8                        ; add           $0x8,%rcx
   DB  73,255,202                          ; dec           %r10
-  DB  117,234                             ; jne           2989 <_sk_load_a8_hsw+0x45>
+  DB  117,234                             ; jne           297d <_sk_load_a8_hsw+0x45>
   DB  196,193,249,110,193                 ; vmovq         %r9,%xmm0
-  DB  235,178                             ; jmp           2958 <_sk_load_a8_hsw+0x14>
+  DB  235,178                             ; jmp           294c <_sk_load_a8_hsw+0x14>
 
 PUBLIC _sk_gather_a8_hsw
 _sk_gather_a8_hsw LABEL PROC
@@ -2502,7 +2502,7 @@
   DB  196,227,121,32,192,7                ; vpinsrb       $0x7,%eax,%xmm0,%xmm0
   DB  196,226,125,49,192                  ; vpmovzxbd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,197,32,0,0        ; vbroadcastss  0x20c5(%rip),%ymm1        # 4b28 <_sk_callback_hsw+0x36f>
+  DB  196,226,125,24,13,197,32,0,0        ; vbroadcastss  0x20c5(%rip),%ymm1        # 4b1c <_sk_callback_hsw+0x36f>
   DB  197,252,89,217                      ; vmulps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -2518,14 +2518,14 @@
 _sk_store_a8_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  196,98,125,24,5,160,32,0,0          ; vbroadcastss  0x20a0(%rip),%ymm8        # 4b2c <_sk_callback_hsw+0x373>
+  DB  196,98,125,24,5,160,32,0,0          ; vbroadcastss  0x20a0(%rip),%ymm8        # 4b20 <_sk_callback_hsw+0x373>
   DB  196,65,100,89,192                   ; vmulps        %ymm8,%ymm3,%ymm8
   DB  196,65,125,91,192                   ; vcvtps2dq     %ymm8,%ymm8
   DB  196,67,125,25,193,1                 ; vextractf128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  196,65,57,103,192                   ; vpackuswb     %xmm8,%xmm8,%xmm8
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,10                              ; jne           2ab5 <_sk_store_a8_hsw+0x37>
+  DB  117,10                              ; jne           2aa9 <_sk_store_a8_hsw+0x37>
   DB  196,65,123,17,4,58                  ; vmovsd        %xmm8,(%r10,%rdi,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2533,10 +2533,10 @@
   DB  65,128,224,7                        ; and           $0x7,%r8b
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  119,236                             ; ja            2ab1 <_sk_store_a8_hsw+0x33>
+  DB  119,236                             ; ja            2aa5 <_sk_store_a8_hsw+0x33>
   DB  196,66,121,48,192                   ; vpmovzxbw     %xmm8,%xmm8
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,67,0,0,0                  ; lea           0x43(%rip),%r9        # 2b18 <_sk_store_a8_hsw+0x9a>
+  DB  76,141,13,67,0,0,0                  ; lea           0x43(%rip),%r9        # 2b0c <_sk_store_a8_hsw+0x9a>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2547,7 +2547,7 @@
   DB  196,67,121,20,68,58,2,4             ; vpextrb       $0x4,%xmm8,0x2(%r10,%rdi,1)
   DB  196,67,121,20,68,58,1,2             ; vpextrb       $0x2,%xmm8,0x1(%r10,%rdi,1)
   DB  196,67,121,20,4,58,0                ; vpextrb       $0x0,%xmm8,(%r10,%rdi,1)
-  DB  235,154                             ; jmp           2ab1 <_sk_store_a8_hsw+0x33>
+  DB  235,154                             ; jmp           2aa5 <_sk_store_a8_hsw+0x33>
   DB  144                                 ; nop
   DB  246,255                             ; idiv          %bh
   DB  255                                 ; (bad)
@@ -2579,14 +2579,14 @@
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  72,1,248                            ; add           %rdi,%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,50                              ; jne           2b76 <_sk_load_g8_hsw+0x42>
+  DB  117,50                              ; jne           2b6a <_sk_load_g8_hsw+0x42>
   DB  197,250,126,0                       ; vmovq         (%rax),%xmm0
   DB  196,226,125,49,192                  ; vpmovzxbd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,214,31,0,0        ; vbroadcastss  0x1fd6(%rip),%ymm1        # 4b30 <_sk_callback_hsw+0x377>
+  DB  196,226,125,24,13,214,31,0,0        ; vbroadcastss  0x1fd6(%rip),%ymm1        # 4b24 <_sk_callback_hsw+0x377>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,203,31,0,0        ; vbroadcastss  0x1fcb(%rip),%ymm3        # 4b34 <_sk_callback_hsw+0x37b>
+  DB  196,226,125,24,29,203,31,0,0        ; vbroadcastss  0x1fcb(%rip),%ymm3        # 4b28 <_sk_callback_hsw+0x37b>
   DB  76,137,193                          ; mov           %r8,%rcx
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
@@ -2600,9 +2600,9 @@
   DB  77,9,217                            ; or            %r11,%r9
   DB  72,131,193,8                        ; add           $0x8,%rcx
   DB  73,255,202                          ; dec           %r10
-  DB  117,234                             ; jne           2b7e <_sk_load_g8_hsw+0x4a>
+  DB  117,234                             ; jne           2b72 <_sk_load_g8_hsw+0x4a>
   DB  196,193,249,110,193                 ; vmovq         %r9,%xmm0
-  DB  235,173                             ; jmp           2b48 <_sk_load_g8_hsw+0x14>
+  DB  235,173                             ; jmp           2b3c <_sk_load_g8_hsw+0x14>
 
 PUBLIC _sk_gather_g8_hsw
 _sk_gather_g8_hsw LABEL PROC
@@ -2646,10 +2646,10 @@
   DB  196,227,121,32,192,7                ; vpinsrb       $0x7,%eax,%xmm0,%xmm0
   DB  196,226,125,49,192                  ; vpmovzxbd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,224,30,0,0        ; vbroadcastss  0x1ee0(%rip),%ymm1        # 4b38 <_sk_callback_hsw+0x37f>
+  DB  196,226,125,24,13,224,30,0,0        ; vbroadcastss  0x1ee0(%rip),%ymm1        # 4b2c <_sk_callback_hsw+0x37f>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,213,30,0,0        ; vbroadcastss  0x1ed5(%rip),%ymm3        # 4b3c <_sk_callback_hsw+0x383>
+  DB  196,226,125,24,29,213,30,0,0        ; vbroadcastss  0x1ed5(%rip),%ymm3        # 4b30 <_sk_callback_hsw+0x383>
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
   DB  91                                  ; pop           %rbx
@@ -2663,9 +2663,9 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,137,192                          ; mov           %rax,%r8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  116,5                               ; je            2c87 <_sk_gather_i8_hsw+0xf>
+  DB  116,5                               ; je            2c7b <_sk_gather_i8_hsw+0xf>
   DB  76,137,192                          ; mov           %r8,%rax
-  DB  235,2                               ; jmp           2c89 <_sk_gather_i8_hsw+0x11>
+  DB  235,2                               ; jmp           2c7d <_sk_gather_i8_hsw+0x11>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,87                               ; push          %r15
   DB  65,86                               ; push          %r14
@@ -2703,14 +2703,14 @@
   DB  73,139,64,8                         ; mov           0x8(%r8),%rax
   DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
   DB  196,226,117,144,28,128              ; vpgatherdd    %ymm1,(%rax,%ymm0,4),%ymm3
-  DB  197,229,219,5,233,31,0,0            ; vpand         0x1fe9(%rip),%ymm3,%ymm0        # 4d20 <_sk_callback_hsw+0x567>
+  DB  197,229,219,5,245,31,0,0            ; vpand         0x1ff5(%rip),%ymm3,%ymm0        # 4d20 <_sk_callback_hsw+0x573>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,252,29,0,0          ; vbroadcastss  0x1dfc(%rip),%ymm8        # 4b40 <_sk_callback_hsw+0x387>
+  DB  196,98,125,24,5,252,29,0,0          ; vbroadcastss  0x1dfc(%rip),%ymm8        # 4b34 <_sk_callback_hsw+0x387>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,226,101,0,13,238,31,0,0         ; vpshufb       0x1fee(%rip),%ymm3,%ymm1        # 4d40 <_sk_callback_hsw+0x587>
+  DB  196,226,101,0,13,250,31,0,0         ; vpshufb       0x1ffa(%rip),%ymm3,%ymm1        # 4d40 <_sk_callback_hsw+0x593>
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
-  DB  196,226,101,0,21,252,31,0,0         ; vpshufb       0x1ffc(%rip),%ymm3,%ymm2        # 4d60 <_sk_callback_hsw+0x5a7>
+  DB  196,226,101,0,21,8,32,0,0           ; vpshufb       0x2008(%rip),%ymm3,%ymm2        # 4d60 <_sk_callback_hsw+0x5b3>
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
@@ -2729,35 +2729,35 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,114                             ; jne           2e04 <_sk_load_565_hsw+0x7c>
+  DB  117,114                             ; jne           2df8 <_sk_load_565_hsw+0x7c>
   DB  196,193,122,111,4,122               ; vmovdqu       (%r10,%rdi,2),%xmm0
   DB  196,226,125,51,208                  ; vpmovzxwd     %xmm0,%ymm2
-  DB  196,226,125,88,5,158,29,0,0         ; vpbroadcastd  0x1d9e(%rip),%ymm0        # 4b44 <_sk_callback_hsw+0x38b>
+  DB  196,226,125,88,5,158,29,0,0         ; vpbroadcastd  0x1d9e(%rip),%ymm0        # 4b38 <_sk_callback_hsw+0x38b>
   DB  197,237,219,192                     ; vpand         %ymm0,%ymm2,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,145,29,0,0        ; vbroadcastss  0x1d91(%rip),%ymm1        # 4b48 <_sk_callback_hsw+0x38f>
+  DB  196,226,125,24,13,145,29,0,0        ; vbroadcastss  0x1d91(%rip),%ymm1        # 4b3c <_sk_callback_hsw+0x38f>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,88,13,136,29,0,0        ; vpbroadcastd  0x1d88(%rip),%ymm1        # 4b4c <_sk_callback_hsw+0x393>
+  DB  196,226,125,88,13,136,29,0,0        ; vpbroadcastd  0x1d88(%rip),%ymm1        # 4b40 <_sk_callback_hsw+0x393>
   DB  197,237,219,201                     ; vpand         %ymm1,%ymm2,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,29,123,29,0,0        ; vbroadcastss  0x1d7b(%rip),%ymm3        # 4b50 <_sk_callback_hsw+0x397>
+  DB  196,226,125,24,29,123,29,0,0        ; vbroadcastss  0x1d7b(%rip),%ymm3        # 4b44 <_sk_callback_hsw+0x397>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
-  DB  196,226,125,88,29,114,29,0,0        ; vpbroadcastd  0x1d72(%rip),%ymm3        # 4b54 <_sk_callback_hsw+0x39b>
+  DB  196,226,125,88,29,114,29,0,0        ; vpbroadcastd  0x1d72(%rip),%ymm3        # 4b48 <_sk_callback_hsw+0x39b>
   DB  197,237,219,211                     ; vpand         %ymm3,%ymm2,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,226,125,24,29,101,29,0,0        ; vbroadcastss  0x1d65(%rip),%ymm3        # 4b58 <_sk_callback_hsw+0x39f>
+  DB  196,226,125,24,29,101,29,0,0        ; vbroadcastss  0x1d65(%rip),%ymm3        # 4b4c <_sk_callback_hsw+0x39f>
   DB  197,236,89,211                      ; vmulps        %ymm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,90,29,0,0         ; vbroadcastss  0x1d5a(%rip),%ymm3        # 4b5c <_sk_callback_hsw+0x3a3>
+  DB  196,226,125,24,29,90,29,0,0         ; vbroadcastss  0x1d5a(%rip),%ymm3        # 4b50 <_sk_callback_hsw+0x3a3>
   DB  255,224                             ; jmpq          *%rax
   DB  65,137,200                          ; mov           %ecx,%r8d
   DB  65,128,224,7                        ; and           $0x7,%r8b
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  119,128                             ; ja            2d98 <_sk_load_565_hsw+0x10>
+  DB  119,128                             ; ja            2d8c <_sk_load_565_hsw+0x10>
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,73,0,0,0                  ; lea           0x49(%rip),%r9        # 2e6c <_sk_load_565_hsw+0xe4>
+  DB  76,141,13,73,0,0,0                  ; lea           0x49(%rip),%r9        # 2e60 <_sk_load_565_hsw+0xe4>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2769,7 +2769,7 @@
   DB  196,193,121,196,68,122,4,2          ; vpinsrw       $0x2,0x4(%r10,%rdi,2),%xmm0,%xmm0
   DB  196,193,121,196,68,122,2,1          ; vpinsrw       $0x1,0x2(%r10,%rdi,2),%xmm0,%xmm0
   DB  196,193,121,196,4,122,0             ; vpinsrw       $0x0,(%r10,%rdi,2),%xmm0,%xmm0
-  DB  233,44,255,255,255                  ; jmpq          2d98 <_sk_load_565_hsw+0x10>
+  DB  233,44,255,255,255                  ; jmpq          2d8c <_sk_load_565_hsw+0x10>
   DB  244                                 ; hlt
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -2837,23 +2837,23 @@
   DB  65,15,183,4,88                      ; movzwl        (%r8,%rbx,2),%eax
   DB  197,249,196,192,7                   ; vpinsrw       $0x7,%eax,%xmm0,%xmm0
   DB  196,226,125,51,208                  ; vpmovzxwd     %xmm0,%ymm2
-  DB  196,226,125,88,5,29,28,0,0          ; vpbroadcastd  0x1c1d(%rip),%ymm0        # 4b60 <_sk_callback_hsw+0x3a7>
+  DB  196,226,125,88,5,29,28,0,0          ; vpbroadcastd  0x1c1d(%rip),%ymm0        # 4b54 <_sk_callback_hsw+0x3a7>
   DB  197,237,219,192                     ; vpand         %ymm0,%ymm2,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,16,28,0,0         ; vbroadcastss  0x1c10(%rip),%ymm1        # 4b64 <_sk_callback_hsw+0x3ab>
+  DB  196,226,125,24,13,16,28,0,0         ; vbroadcastss  0x1c10(%rip),%ymm1        # 4b58 <_sk_callback_hsw+0x3ab>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,88,13,7,28,0,0          ; vpbroadcastd  0x1c07(%rip),%ymm1        # 4b68 <_sk_callback_hsw+0x3af>
+  DB  196,226,125,88,13,7,28,0,0          ; vpbroadcastd  0x1c07(%rip),%ymm1        # 4b5c <_sk_callback_hsw+0x3af>
   DB  197,237,219,201                     ; vpand         %ymm1,%ymm2,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,29,250,27,0,0        ; vbroadcastss  0x1bfa(%rip),%ymm3        # 4b6c <_sk_callback_hsw+0x3b3>
+  DB  196,226,125,24,29,250,27,0,0        ; vbroadcastss  0x1bfa(%rip),%ymm3        # 4b60 <_sk_callback_hsw+0x3b3>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
-  DB  196,226,125,88,29,241,27,0,0        ; vpbroadcastd  0x1bf1(%rip),%ymm3        # 4b70 <_sk_callback_hsw+0x3b7>
+  DB  196,226,125,88,29,241,27,0,0        ; vpbroadcastd  0x1bf1(%rip),%ymm3        # 4b64 <_sk_callback_hsw+0x3b7>
   DB  197,237,219,211                     ; vpand         %ymm3,%ymm2,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,226,125,24,29,228,27,0,0        ; vbroadcastss  0x1be4(%rip),%ymm3        # 4b74 <_sk_callback_hsw+0x3bb>
+  DB  196,226,125,24,29,228,27,0,0        ; vbroadcastss  0x1be4(%rip),%ymm3        # 4b68 <_sk_callback_hsw+0x3bb>
   DB  197,236,89,211                      ; vmulps        %ymm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,217,27,0,0        ; vbroadcastss  0x1bd9(%rip),%ymm3        # 4b78 <_sk_callback_hsw+0x3bf>
+  DB  196,226,125,24,29,217,27,0,0        ; vbroadcastss  0x1bd9(%rip),%ymm3        # 4b6c <_sk_callback_hsw+0x3bf>
   DB  91                                  ; pop           %rbx
   DB  65,92                               ; pop           %r12
   DB  65,94                               ; pop           %r14
@@ -2864,11 +2864,11 @@
 _sk_store_565_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  196,98,125,24,5,198,27,0,0          ; vbroadcastss  0x1bc6(%rip),%ymm8        # 4b7c <_sk_callback_hsw+0x3c3>
+  DB  196,98,125,24,5,198,27,0,0          ; vbroadcastss  0x1bc6(%rip),%ymm8        # 4b70 <_sk_callback_hsw+0x3c3>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,193,53,114,241,11               ; vpslld        $0xb,%ymm9,%ymm9
-  DB  196,98,125,24,21,177,27,0,0         ; vbroadcastss  0x1bb1(%rip),%ymm10        # 4b80 <_sk_callback_hsw+0x3c7>
+  DB  196,98,125,24,21,177,27,0,0         ; vbroadcastss  0x1bb1(%rip),%ymm10        # 4b74 <_sk_callback_hsw+0x3c7>
   DB  196,65,116,89,210                   ; vmulps        %ymm10,%ymm1,%ymm10
   DB  196,65,125,91,210                   ; vcvtps2dq     %ymm10,%ymm10
   DB  196,193,45,114,242,5                ; vpslld        $0x5,%ymm10,%ymm10
@@ -2879,7 +2879,7 @@
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,10                              ; jne           300d <_sk_store_565_hsw+0x65>
+  DB  117,10                              ; jne           3001 <_sk_store_565_hsw+0x65>
   DB  196,65,122,127,4,122                ; vmovdqu       %xmm8,(%r10,%rdi,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2887,9 +2887,9 @@
   DB  65,128,224,7                        ; and           $0x7,%r8b
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  119,236                             ; ja            3009 <_sk_store_565_hsw+0x61>
+  DB  119,236                             ; ja            2ffd <_sk_store_565_hsw+0x61>
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,68,0,0,0                  ; lea           0x44(%rip),%r9        # 306c <_sk_store_565_hsw+0xc4>
+  DB  76,141,13,68,0,0,0                  ; lea           0x44(%rip),%r9        # 3060 <_sk_store_565_hsw+0xc4>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2900,7 +2900,7 @@
   DB  196,67,121,21,68,122,4,2            ; vpextrw       $0x2,%xmm8,0x4(%r10,%rdi,2)
   DB  196,67,121,21,68,122,2,1            ; vpextrw       $0x1,%xmm8,0x2(%r10,%rdi,2)
   DB  196,67,121,21,4,122,0               ; vpextrw       $0x0,%xmm8,(%r10,%rdi,2)
-  DB  235,159                             ; jmp           3009 <_sk_store_565_hsw+0x61>
+  DB  235,159                             ; jmp           2ffd <_sk_store_565_hsw+0x61>
   DB  102,144                             ; xchg          %ax,%ax
   DB  245                                 ; cmc
   DB  255                                 ; (bad)
@@ -2931,28 +2931,28 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,138,0,0,0                    ; jne           3120 <_sk_load_4444_hsw+0x98>
+  DB  15,133,138,0,0,0                    ; jne           3114 <_sk_load_4444_hsw+0x98>
   DB  196,193,122,111,4,122               ; vmovdqu       (%r10,%rdi,2),%xmm0
   DB  196,226,125,51,216                  ; vpmovzxwd     %xmm0,%ymm3
-  DB  196,226,125,88,5,218,26,0,0         ; vpbroadcastd  0x1ada(%rip),%ymm0        # 4b84 <_sk_callback_hsw+0x3cb>
+  DB  196,226,125,88,5,218,26,0,0         ; vpbroadcastd  0x1ada(%rip),%ymm0        # 4b78 <_sk_callback_hsw+0x3cb>
   DB  197,229,219,192                     ; vpand         %ymm0,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,205,26,0,0        ; vbroadcastss  0x1acd(%rip),%ymm1        # 4b88 <_sk_callback_hsw+0x3cf>
+  DB  196,226,125,24,13,205,26,0,0        ; vbroadcastss  0x1acd(%rip),%ymm1        # 4b7c <_sk_callback_hsw+0x3cf>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,88,13,196,26,0,0        ; vpbroadcastd  0x1ac4(%rip),%ymm1        # 4b8c <_sk_callback_hsw+0x3d3>
+  DB  196,226,125,88,13,196,26,0,0        ; vpbroadcastd  0x1ac4(%rip),%ymm1        # 4b80 <_sk_callback_hsw+0x3d3>
   DB  197,229,219,201                     ; vpand         %ymm1,%ymm3,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,21,183,26,0,0        ; vbroadcastss  0x1ab7(%rip),%ymm2        # 4b90 <_sk_callback_hsw+0x3d7>
+  DB  196,226,125,24,21,183,26,0,0        ; vbroadcastss  0x1ab7(%rip),%ymm2        # 4b84 <_sk_callback_hsw+0x3d7>
   DB  197,244,89,202                      ; vmulps        %ymm2,%ymm1,%ymm1
-  DB  196,226,125,88,21,174,26,0,0        ; vpbroadcastd  0x1aae(%rip),%ymm2        # 4b94 <_sk_callback_hsw+0x3db>
+  DB  196,226,125,88,21,174,26,0,0        ; vpbroadcastd  0x1aae(%rip),%ymm2        # 4b88 <_sk_callback_hsw+0x3db>
   DB  197,229,219,210                     ; vpand         %ymm2,%ymm3,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,98,125,24,5,161,26,0,0          ; vbroadcastss  0x1aa1(%rip),%ymm8        # 4b98 <_sk_callback_hsw+0x3df>
+  DB  196,98,125,24,5,161,26,0,0          ; vbroadcastss  0x1aa1(%rip),%ymm8        # 4b8c <_sk_callback_hsw+0x3df>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,88,5,151,26,0,0          ; vpbroadcastd  0x1a97(%rip),%ymm8        # 4b9c <_sk_callback_hsw+0x3e3>
+  DB  196,98,125,88,5,151,26,0,0          ; vpbroadcastd  0x1a97(%rip),%ymm8        # 4b90 <_sk_callback_hsw+0x3e3>
   DB  196,193,101,219,216                 ; vpand         %ymm8,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,137,26,0,0          ; vbroadcastss  0x1a89(%rip),%ymm8        # 4ba0 <_sk_callback_hsw+0x3e7>
+  DB  196,98,125,24,5,137,26,0,0          ; vbroadcastss  0x1a89(%rip),%ymm8        # 4b94 <_sk_callback_hsw+0x3e7>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2961,9 +2961,9 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  15,135,100,255,255,255              ; ja            309c <_sk_load_4444_hsw+0x14>
+  DB  15,135,100,255,255,255              ; ja            3090 <_sk_load_4444_hsw+0x14>
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,73,0,0,0                  ; lea           0x49(%rip),%r9        # 318c <_sk_load_4444_hsw+0x104>
+  DB  76,141,13,73,0,0,0                  ; lea           0x49(%rip),%r9        # 3180 <_sk_load_4444_hsw+0x104>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2975,7 +2975,7 @@
   DB  196,193,121,196,68,122,4,2          ; vpinsrw       $0x2,0x4(%r10,%rdi,2),%xmm0,%xmm0
   DB  196,193,121,196,68,122,2,1          ; vpinsrw       $0x1,0x2(%r10,%rdi,2),%xmm0,%xmm0
   DB  196,193,121,196,4,122,0             ; vpinsrw       $0x0,(%r10,%rdi,2),%xmm0,%xmm0
-  DB  233,16,255,255,255                  ; jmpq          309c <_sk_load_4444_hsw+0x14>
+  DB  233,16,255,255,255                  ; jmpq          3090 <_sk_load_4444_hsw+0x14>
   DB  244                                 ; hlt
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -3043,25 +3043,25 @@
   DB  65,15,183,4,88                      ; movzwl        (%r8,%rbx,2),%eax
   DB  197,249,196,192,7                   ; vpinsrw       $0x7,%eax,%xmm0,%xmm0
   DB  196,226,125,51,216                  ; vpmovzxwd     %xmm0,%ymm3
-  DB  196,226,125,88,5,65,25,0,0          ; vpbroadcastd  0x1941(%rip),%ymm0        # 4ba4 <_sk_callback_hsw+0x3eb>
+  DB  196,226,125,88,5,65,25,0,0          ; vpbroadcastd  0x1941(%rip),%ymm0        # 4b98 <_sk_callback_hsw+0x3eb>
   DB  197,229,219,192                     ; vpand         %ymm0,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,52,25,0,0         ; vbroadcastss  0x1934(%rip),%ymm1        # 4ba8 <_sk_callback_hsw+0x3ef>
+  DB  196,226,125,24,13,52,25,0,0         ; vbroadcastss  0x1934(%rip),%ymm1        # 4b9c <_sk_callback_hsw+0x3ef>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,88,13,43,25,0,0         ; vpbroadcastd  0x192b(%rip),%ymm1        # 4bac <_sk_callback_hsw+0x3f3>
+  DB  196,226,125,88,13,43,25,0,0         ; vpbroadcastd  0x192b(%rip),%ymm1        # 4ba0 <_sk_callback_hsw+0x3f3>
   DB  197,229,219,201                     ; vpand         %ymm1,%ymm3,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,21,30,25,0,0         ; vbroadcastss  0x191e(%rip),%ymm2        # 4bb0 <_sk_callback_hsw+0x3f7>
+  DB  196,226,125,24,21,30,25,0,0         ; vbroadcastss  0x191e(%rip),%ymm2        # 4ba4 <_sk_callback_hsw+0x3f7>
   DB  197,244,89,202                      ; vmulps        %ymm2,%ymm1,%ymm1
-  DB  196,226,125,88,21,21,25,0,0         ; vpbroadcastd  0x1915(%rip),%ymm2        # 4bb4 <_sk_callback_hsw+0x3fb>
+  DB  196,226,125,88,21,21,25,0,0         ; vpbroadcastd  0x1915(%rip),%ymm2        # 4ba8 <_sk_callback_hsw+0x3fb>
   DB  197,229,219,210                     ; vpand         %ymm2,%ymm3,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,98,125,24,5,8,25,0,0            ; vbroadcastss  0x1908(%rip),%ymm8        # 4bb8 <_sk_callback_hsw+0x3ff>
+  DB  196,98,125,24,5,8,25,0,0            ; vbroadcastss  0x1908(%rip),%ymm8        # 4bac <_sk_callback_hsw+0x3ff>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,88,5,254,24,0,0          ; vpbroadcastd  0x18fe(%rip),%ymm8        # 4bbc <_sk_callback_hsw+0x403>
+  DB  196,98,125,88,5,254,24,0,0          ; vpbroadcastd  0x18fe(%rip),%ymm8        # 4bb0 <_sk_callback_hsw+0x403>
   DB  196,193,101,219,216                 ; vpand         %ymm8,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,240,24,0,0          ; vbroadcastss  0x18f0(%rip),%ymm8        # 4bc0 <_sk_callback_hsw+0x407>
+  DB  196,98,125,24,5,240,24,0,0          ; vbroadcastss  0x18f0(%rip),%ymm8        # 4bb4 <_sk_callback_hsw+0x407>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
@@ -3074,7 +3074,7 @@
 _sk_store_4444_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  196,98,125,24,5,214,24,0,0          ; vbroadcastss  0x18d6(%rip),%ymm8        # 4bc4 <_sk_callback_hsw+0x40b>
+  DB  196,98,125,24,5,214,24,0,0          ; vbroadcastss  0x18d6(%rip),%ymm8        # 4bb8 <_sk_callback_hsw+0x40b>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,193,53,114,241,12               ; vpslld        $0xc,%ymm9,%ymm9
@@ -3092,7 +3092,7 @@
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,10                              ; jne           3351 <_sk_store_4444_hsw+0x71>
+  DB  117,10                              ; jne           3345 <_sk_store_4444_hsw+0x71>
   DB  196,65,122,127,4,122                ; vmovdqu       %xmm8,(%r10,%rdi,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -3100,9 +3100,9 @@
   DB  65,128,224,7                        ; and           $0x7,%r8b
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  119,236                             ; ja            334d <_sk_store_4444_hsw+0x6d>
+  DB  119,236                             ; ja            3341 <_sk_store_4444_hsw+0x6d>
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,68,0,0,0                  ; lea           0x44(%rip),%r9        # 33b0 <_sk_store_4444_hsw+0xd0>
+  DB  76,141,13,68,0,0,0                  ; lea           0x44(%rip),%r9        # 33a4 <_sk_store_4444_hsw+0xd0>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -3113,7 +3113,7 @@
   DB  196,67,121,21,68,122,4,2            ; vpextrw       $0x2,%xmm8,0x4(%r10,%rdi,2)
   DB  196,67,121,21,68,122,2,1            ; vpextrw       $0x1,%xmm8,0x2(%r10,%rdi,2)
   DB  196,67,121,21,4,122,0               ; vpextrw       $0x0,%xmm8,(%r10,%rdi,2)
-  DB  235,159                             ; jmp           334d <_sk_store_4444_hsw+0x6d>
+  DB  235,159                             ; jmp           3341 <_sk_store_4444_hsw+0x6d>
   DB  102,144                             ; xchg          %ax,%ax
   DB  245                                 ; cmc
   DB  255                                 ; (bad)
@@ -3146,16 +3146,16 @@
   DB  76,141,12,189,0,0,0,0               ; lea           0x0(,%rdi,4),%r9
   DB  76,3,8                              ; add           (%rax),%r9
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,88                              ; jne           3439 <_sk_load_8888_hsw+0x6d>
+  DB  117,88                              ; jne           342d <_sk_load_8888_hsw+0x6d>
   DB  196,193,126,111,25                  ; vmovdqu       (%r9),%ymm3
-  DB  197,229,219,5,146,25,0,0            ; vpand         0x1992(%rip),%ymm3,%ymm0        # 4d80 <_sk_callback_hsw+0x5c7>
+  DB  197,229,219,5,158,25,0,0            ; vpand         0x199e(%rip),%ymm3,%ymm0        # 4d80 <_sk_callback_hsw+0x5d3>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,205,23,0,0          ; vbroadcastss  0x17cd(%rip),%ymm8        # 4bc8 <_sk_callback_hsw+0x40f>
+  DB  196,98,125,24,5,205,23,0,0          ; vbroadcastss  0x17cd(%rip),%ymm8        # 4bbc <_sk_callback_hsw+0x40f>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,226,101,0,13,151,25,0,0         ; vpshufb       0x1997(%rip),%ymm3,%ymm1        # 4da0 <_sk_callback_hsw+0x5e7>
+  DB  196,226,101,0,13,163,25,0,0         ; vpshufb       0x19a3(%rip),%ymm3,%ymm1        # 4da0 <_sk_callback_hsw+0x5f3>
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
-  DB  196,226,101,0,21,165,25,0,0         ; vpshufb       0x19a5(%rip),%ymm3,%ymm2        # 4dc0 <_sk_callback_hsw+0x607>
+  DB  196,226,101,0,21,177,25,0,0         ; vpshufb       0x19b1(%rip),%ymm3,%ymm2        # 4dc0 <_sk_callback_hsw+0x613>
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
@@ -3172,7 +3172,7 @@
   DB  196,225,249,110,192                 ; vmovq         %rax,%xmm0
   DB  196,226,125,33,192                  ; vpmovsxbd     %xmm0,%ymm0
   DB  196,194,125,140,25                  ; vpmaskmovd    (%r9),%ymm0,%ymm3
-  DB  235,135                             ; jmp           33e6 <_sk_load_8888_hsw+0x1a>
+  DB  235,135                             ; jmp           33da <_sk_load_8888_hsw+0x1a>
 
 PUBLIC _sk_gather_8888_hsw
 _sk_gather_8888_hsw LABEL PROC
@@ -3185,14 +3185,14 @@
   DB  197,245,254,192                     ; vpaddd        %ymm0,%ymm1,%ymm0
   DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
   DB  196,194,117,144,28,128              ; vpgatherdd    %ymm1,(%r8,%ymm0,4),%ymm3
-  DB  197,229,219,5,83,25,0,0             ; vpand         0x1953(%rip),%ymm3,%ymm0        # 4de0 <_sk_callback_hsw+0x627>
+  DB  197,229,219,5,95,25,0,0             ; vpand         0x195f(%rip),%ymm3,%ymm0        # 4de0 <_sk_callback_hsw+0x633>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,50,23,0,0           ; vbroadcastss  0x1732(%rip),%ymm8        # 4bcc <_sk_callback_hsw+0x413>
+  DB  196,98,125,24,5,50,23,0,0           ; vbroadcastss  0x1732(%rip),%ymm8        # 4bc0 <_sk_callback_hsw+0x413>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,226,101,0,13,88,25,0,0          ; vpshufb       0x1958(%rip),%ymm3,%ymm1        # 4e00 <_sk_callback_hsw+0x647>
+  DB  196,226,101,0,13,100,25,0,0         ; vpshufb       0x1964(%rip),%ymm3,%ymm1        # 4e00 <_sk_callback_hsw+0x653>
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
-  DB  196,226,101,0,21,102,25,0,0         ; vpshufb       0x1966(%rip),%ymm3,%ymm2        # 4e20 <_sk_callback_hsw+0x667>
+  DB  196,226,101,0,21,114,25,0,0         ; vpshufb       0x1972(%rip),%ymm3,%ymm2        # 4e20 <_sk_callback_hsw+0x673>
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
@@ -3207,7 +3207,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,141,12,189,0,0,0,0               ; lea           0x0(,%rdi,4),%r9
   DB  76,3,8                              ; add           (%rax),%r9
-  DB  196,98,125,24,5,226,22,0,0          ; vbroadcastss  0x16e2(%rip),%ymm8        # 4bd0 <_sk_callback_hsw+0x417>
+  DB  196,98,125,24,5,226,22,0,0          ; vbroadcastss  0x16e2(%rip),%ymm8        # 4bc4 <_sk_callback_hsw+0x417>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,65,116,89,208                   ; vmulps        %ymm8,%ymm1,%ymm10
@@ -3223,7 +3223,7 @@
   DB  196,65,45,235,192                   ; vpor          %ymm8,%ymm10,%ymm8
   DB  196,65,53,235,192                   ; vpor          %ymm8,%ymm9,%ymm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,12                              ; jne           3548 <_sk_store_8888_hsw+0x73>
+  DB  117,12                              ; jne           353c <_sk_store_8888_hsw+0x73>
   DB  196,65,126,127,1                    ; vmovdqu       %ymm8,(%r9)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,193                          ; mov           %r8,%rcx
@@ -3236,14 +3236,14 @@
   DB  196,97,249,110,200                  ; vmovq         %rax,%xmm9
   DB  196,66,125,33,201                   ; vpmovsxbd     %xmm9,%ymm9
   DB  196,66,53,142,1                     ; vpmaskmovd    %ymm8,%ymm9,(%r9)
-  DB  235,211                             ; jmp           3541 <_sk_store_8888_hsw+0x6c>
+  DB  235,211                             ; jmp           3535 <_sk_store_8888_hsw+0x6c>
 
 PUBLIC _sk_load_f16_hsw
 _sk_load_f16_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,97                              ; jne           35d9 <_sk_load_f16_hsw+0x6b>
+  DB  117,97                              ; jne           35cd <_sk_load_f16_hsw+0x6b>
   DB  197,121,16,4,248                    ; vmovupd       (%rax,%rdi,8),%xmm8
   DB  197,249,16,84,248,16                ; vmovupd       0x10(%rax,%rdi,8),%xmm2
   DB  197,249,16,92,248,32                ; vmovupd       0x20(%rax,%rdi,8),%xmm3
@@ -3269,29 +3269,29 @@
   DB  197,123,16,4,248                    ; vmovsd        (%rax,%rdi,8),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  116,79                              ; je            3638 <_sk_load_f16_hsw+0xca>
+  DB  116,79                              ; je            362c <_sk_load_f16_hsw+0xca>
   DB  197,57,22,68,248,8                  ; vmovhpd       0x8(%rax,%rdi,8),%xmm8,%xmm8
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,67                              ; jb            3638 <_sk_load_f16_hsw+0xca>
+  DB  114,67                              ; jb            362c <_sk_load_f16_hsw+0xca>
   DB  197,251,16,84,248,16                ; vmovsd        0x10(%rax,%rdi,8),%xmm2
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  116,68                              ; je            3645 <_sk_load_f16_hsw+0xd7>
+  DB  116,68                              ; je            3639 <_sk_load_f16_hsw+0xd7>
   DB  197,233,22,84,248,24                ; vmovhpd       0x18(%rax,%rdi,8),%xmm2,%xmm2
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,56                              ; jb            3645 <_sk_load_f16_hsw+0xd7>
+  DB  114,56                              ; jb            3639 <_sk_load_f16_hsw+0xd7>
   DB  197,251,16,92,248,32                ; vmovsd        0x20(%rax,%rdi,8),%xmm3
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  15,132,114,255,255,255              ; je            358f <_sk_load_f16_hsw+0x21>
+  DB  15,132,114,255,255,255              ; je            3583 <_sk_load_f16_hsw+0x21>
   DB  197,225,22,92,248,40                ; vmovhpd       0x28(%rax,%rdi,8),%xmm3,%xmm3
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  15,130,98,255,255,255               ; jb            358f <_sk_load_f16_hsw+0x21>
+  DB  15,130,98,255,255,255               ; jb            3583 <_sk_load_f16_hsw+0x21>
   DB  197,122,126,76,248,48               ; vmovq         0x30(%rax,%rdi,8),%xmm9
-  DB  233,87,255,255,255                  ; jmpq          358f <_sk_load_f16_hsw+0x21>
+  DB  233,87,255,255,255                  ; jmpq          3583 <_sk_load_f16_hsw+0x21>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,74,255,255,255                  ; jmpq          358f <_sk_load_f16_hsw+0x21>
+  DB  233,74,255,255,255                  ; jmpq          3583 <_sk_load_f16_hsw+0x21>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,65,255,255,255                  ; jmpq          358f <_sk_load_f16_hsw+0x21>
+  DB  233,65,255,255,255                  ; jmpq          3583 <_sk_load_f16_hsw+0x21>
 
 PUBLIC _sk_gather_f16_hsw
 _sk_gather_f16_hsw LABEL PROC
@@ -3345,7 +3345,7 @@
   DB  196,65,57,98,205                    ; vpunpckldq    %xmm13,%xmm8,%xmm9
   DB  196,65,57,106,197                   ; vpunpckhdq    %xmm13,%xmm8,%xmm8
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,27                              ; jne           373d <_sk_store_f16_hsw+0x65>
+  DB  117,27                              ; jne           3731 <_sk_store_f16_hsw+0x65>
   DB  197,120,17,28,248                   ; vmovups       %xmm11,(%rax,%rdi,8)
   DB  197,120,17,84,248,16                ; vmovups       %xmm10,0x10(%rax,%rdi,8)
   DB  197,120,17,76,248,32                ; vmovups       %xmm9,0x20(%rax,%rdi,8)
@@ -3354,22 +3354,22 @@
   DB  255,224                             ; jmpq          *%rax
   DB  197,121,214,28,248                  ; vmovq         %xmm11,(%rax,%rdi,8)
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  116,241                             ; je            3739 <_sk_store_f16_hsw+0x61>
+  DB  116,241                             ; je            372d <_sk_store_f16_hsw+0x61>
   DB  197,121,23,92,248,8                 ; vmovhpd       %xmm11,0x8(%rax,%rdi,8)
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,229                             ; jb            3739 <_sk_store_f16_hsw+0x61>
+  DB  114,229                             ; jb            372d <_sk_store_f16_hsw+0x61>
   DB  197,121,214,84,248,16               ; vmovq         %xmm10,0x10(%rax,%rdi,8)
-  DB  116,221                             ; je            3739 <_sk_store_f16_hsw+0x61>
+  DB  116,221                             ; je            372d <_sk_store_f16_hsw+0x61>
   DB  197,121,23,84,248,24                ; vmovhpd       %xmm10,0x18(%rax,%rdi,8)
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,209                             ; jb            3739 <_sk_store_f16_hsw+0x61>
+  DB  114,209                             ; jb            372d <_sk_store_f16_hsw+0x61>
   DB  197,121,214,76,248,32               ; vmovq         %xmm9,0x20(%rax,%rdi,8)
-  DB  116,201                             ; je            3739 <_sk_store_f16_hsw+0x61>
+  DB  116,201                             ; je            372d <_sk_store_f16_hsw+0x61>
   DB  197,121,23,76,248,40                ; vmovhpd       %xmm9,0x28(%rax,%rdi,8)
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  114,189                             ; jb            3739 <_sk_store_f16_hsw+0x61>
+  DB  114,189                             ; jb            372d <_sk_store_f16_hsw+0x61>
   DB  197,121,214,68,248,48               ; vmovq         %xmm8,0x30(%rax,%rdi,8)
-  DB  235,181                             ; jmp           3739 <_sk_store_f16_hsw+0x61>
+  DB  235,181                             ; jmp           372d <_sk_store_f16_hsw+0x61>
 
 PUBLIC _sk_load_u16_be_hsw
 _sk_load_u16_be_hsw LABEL PROC
@@ -3377,7 +3377,7 @@
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  72,141,4,189,0,0,0,0                ; lea           0x0(,%rdi,4),%rax
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,204,0,0,0                    ; jne           3866 <_sk_load_u16_be_hsw+0xe2>
+  DB  15,133,204,0,0,0                    ; jne           385a <_sk_load_u16_be_hsw+0xe2>
   DB  196,65,121,16,4,64                  ; vmovupd       (%r8,%rax,2),%xmm8
   DB  196,193,121,16,84,64,16             ; vmovupd       0x10(%r8,%rax,2),%xmm2
   DB  196,193,121,16,92,64,32             ; vmovupd       0x20(%r8,%rax,2),%xmm3
@@ -3396,7 +3396,7 @@
   DB  197,241,235,192                     ; vpor          %xmm0,%xmm1,%xmm0
   DB  196,226,125,51,192                  ; vpmovzxwd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,21,217,19,0,0         ; vbroadcastss  0x13d9(%rip),%ymm10        # 4bd4 <_sk_callback_hsw+0x41b>
+  DB  196,98,125,24,21,217,19,0,0         ; vbroadcastss  0x13d9(%rip),%ymm10        # 4bc8 <_sk_callback_hsw+0x41b>
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  197,185,109,202                     ; vpunpckhqdq   %xmm2,%xmm8,%xmm1
   DB  197,233,113,241,8                   ; vpsllw        $0x8,%xmm1,%xmm2
@@ -3424,29 +3424,29 @@
   DB  196,65,123,16,4,64                  ; vmovsd        (%r8,%rax,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  116,85                              ; je            38cc <_sk_load_u16_be_hsw+0x148>
+  DB  116,85                              ; je            38c0 <_sk_load_u16_be_hsw+0x148>
   DB  196,65,57,22,68,64,8                ; vmovhpd       0x8(%r8,%rax,2),%xmm8,%xmm8
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,72                              ; jb            38cc <_sk_load_u16_be_hsw+0x148>
+  DB  114,72                              ; jb            38c0 <_sk_load_u16_be_hsw+0x148>
   DB  196,193,123,16,84,64,16             ; vmovsd        0x10(%r8,%rax,2),%xmm2
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  116,72                              ; je            38d9 <_sk_load_u16_be_hsw+0x155>
+  DB  116,72                              ; je            38cd <_sk_load_u16_be_hsw+0x155>
   DB  196,193,105,22,84,64,24             ; vmovhpd       0x18(%r8,%rax,2),%xmm2,%xmm2
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,59                              ; jb            38d9 <_sk_load_u16_be_hsw+0x155>
+  DB  114,59                              ; jb            38cd <_sk_load_u16_be_hsw+0x155>
   DB  196,193,123,16,92,64,32             ; vmovsd        0x20(%r8,%rax,2),%xmm3
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  15,132,6,255,255,255                ; je            37b5 <_sk_load_u16_be_hsw+0x31>
+  DB  15,132,6,255,255,255                ; je            37a9 <_sk_load_u16_be_hsw+0x31>
   DB  196,193,97,22,92,64,40              ; vmovhpd       0x28(%r8,%rax,2),%xmm3,%xmm3
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  15,130,245,254,255,255              ; jb            37b5 <_sk_load_u16_be_hsw+0x31>
+  DB  15,130,245,254,255,255              ; jb            37a9 <_sk_load_u16_be_hsw+0x31>
   DB  196,65,122,126,76,64,48             ; vmovq         0x30(%r8,%rax,2),%xmm9
-  DB  233,233,254,255,255                 ; jmpq          37b5 <_sk_load_u16_be_hsw+0x31>
+  DB  233,233,254,255,255                 ; jmpq          37a9 <_sk_load_u16_be_hsw+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,220,254,255,255                 ; jmpq          37b5 <_sk_load_u16_be_hsw+0x31>
+  DB  233,220,254,255,255                 ; jmpq          37a9 <_sk_load_u16_be_hsw+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,211,254,255,255                 ; jmpq          37b5 <_sk_load_u16_be_hsw+0x31>
+  DB  233,211,254,255,255                 ; jmpq          37a9 <_sk_load_u16_be_hsw+0x31>
 
 PUBLIC _sk_load_rgb_u16_be_hsw
 _sk_load_rgb_u16_be_hsw LABEL PROC
@@ -3454,7 +3454,7 @@
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  72,141,4,127                        ; lea           (%rdi,%rdi,2),%rax
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,204,0,0,0                    ; jne           39c0 <_sk_load_rgb_u16_be_hsw+0xde>
+  DB  15,133,204,0,0,0                    ; jne           39b4 <_sk_load_rgb_u16_be_hsw+0xde>
   DB  196,193,122,111,4,64                ; vmovdqu       (%r8,%rax,2),%xmm0
   DB  196,193,122,111,84,64,12            ; vmovdqu       0xc(%r8,%rax,2),%xmm2
   DB  196,193,122,111,76,64,24            ; vmovdqu       0x18(%r8,%rax,2),%xmm1
@@ -3478,7 +3478,7 @@
   DB  197,241,235,192                     ; vpor          %xmm0,%xmm1,%xmm0
   DB  196,226,125,51,192                  ; vpmovzxwd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,21,106,18,0,0         ; vbroadcastss  0x126a(%rip),%ymm10        # 4bd8 <_sk_callback_hsw+0x41f>
+  DB  196,98,125,24,21,106,18,0,0         ; vbroadcastss  0x126a(%rip),%ymm10        # 4bcc <_sk_callback_hsw+0x41f>
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  197,185,109,202                     ; vpunpckhqdq   %xmm2,%xmm8,%xmm1
   DB  197,233,113,241,8                   ; vpsllw        $0x8,%xmm1,%xmm2
@@ -3495,48 +3495,48 @@
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,210                  ; vmulps        %ymm10,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,30,18,0,0         ; vbroadcastss  0x121e(%rip),%ymm3        # 4bdc <_sk_callback_hsw+0x423>
+  DB  196,226,125,24,29,30,18,0,0         ; vbroadcastss  0x121e(%rip),%ymm3        # 4bd0 <_sk_callback_hsw+0x423>
   DB  255,224                             ; jmpq          *%rax
   DB  196,193,121,110,4,64                ; vmovd         (%r8,%rax,2),%xmm0
   DB  196,193,121,196,68,64,4,2           ; vpinsrw       $0x2,0x4(%r8,%rax,2),%xmm0,%xmm0
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  117,5                               ; jne           39d9 <_sk_load_rgb_u16_be_hsw+0xf7>
-  DB  233,79,255,255,255                  ; jmpq          3928 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  117,5                               ; jne           39cd <_sk_load_rgb_u16_be_hsw+0xf7>
+  DB  233,79,255,255,255                  ; jmpq          391c <_sk_load_rgb_u16_be_hsw+0x46>
   DB  196,193,121,110,76,64,6             ; vmovd         0x6(%r8,%rax,2),%xmm1
   DB  196,65,113,196,68,64,10,2           ; vpinsrw       $0x2,0xa(%r8,%rax,2),%xmm1,%xmm8
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,26                              ; jb            3a08 <_sk_load_rgb_u16_be_hsw+0x126>
+  DB  114,26                              ; jb            39fc <_sk_load_rgb_u16_be_hsw+0x126>
   DB  196,193,121,110,76,64,12            ; vmovd         0xc(%r8,%rax,2),%xmm1
   DB  196,193,113,196,84,64,16,2          ; vpinsrw       $0x2,0x10(%r8,%rax,2),%xmm1,%xmm2
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  117,10                              ; jne           3a0d <_sk_load_rgb_u16_be_hsw+0x12b>
-  DB  233,32,255,255,255                  ; jmpq          3928 <_sk_load_rgb_u16_be_hsw+0x46>
-  DB  233,27,255,255,255                  ; jmpq          3928 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  117,10                              ; jne           3a01 <_sk_load_rgb_u16_be_hsw+0x12b>
+  DB  233,32,255,255,255                  ; jmpq          391c <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  233,27,255,255,255                  ; jmpq          391c <_sk_load_rgb_u16_be_hsw+0x46>
   DB  196,193,121,110,76,64,18            ; vmovd         0x12(%r8,%rax,2),%xmm1
   DB  196,65,113,196,76,64,22,2           ; vpinsrw       $0x2,0x16(%r8,%rax,2),%xmm1,%xmm9
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,26                              ; jb            3a3c <_sk_load_rgb_u16_be_hsw+0x15a>
+  DB  114,26                              ; jb            3a30 <_sk_load_rgb_u16_be_hsw+0x15a>
   DB  196,193,121,110,76,64,24            ; vmovd         0x18(%r8,%rax,2),%xmm1
   DB  196,193,113,196,76,64,28,2          ; vpinsrw       $0x2,0x1c(%r8,%rax,2),%xmm1,%xmm1
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  117,10                              ; jne           3a41 <_sk_load_rgb_u16_be_hsw+0x15f>
-  DB  233,236,254,255,255                 ; jmpq          3928 <_sk_load_rgb_u16_be_hsw+0x46>
-  DB  233,231,254,255,255                 ; jmpq          3928 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  117,10                              ; jne           3a35 <_sk_load_rgb_u16_be_hsw+0x15f>
+  DB  233,236,254,255,255                 ; jmpq          391c <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  233,231,254,255,255                 ; jmpq          391c <_sk_load_rgb_u16_be_hsw+0x46>
   DB  196,193,121,110,92,64,30            ; vmovd         0x1e(%r8,%rax,2),%xmm3
   DB  196,65,97,196,92,64,34,2            ; vpinsrw       $0x2,0x22(%r8,%rax,2),%xmm3,%xmm11
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  114,20                              ; jb            3a6a <_sk_load_rgb_u16_be_hsw+0x188>
+  DB  114,20                              ; jb            3a5e <_sk_load_rgb_u16_be_hsw+0x188>
   DB  196,193,121,110,92,64,36            ; vmovd         0x24(%r8,%rax,2),%xmm3
   DB  196,193,97,196,92,64,40,2           ; vpinsrw       $0x2,0x28(%r8,%rax,2),%xmm3,%xmm3
-  DB  233,190,254,255,255                 ; jmpq          3928 <_sk_load_rgb_u16_be_hsw+0x46>
-  DB  233,185,254,255,255                 ; jmpq          3928 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  233,190,254,255,255                 ; jmpq          391c <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  233,185,254,255,255                 ; jmpq          391c <_sk_load_rgb_u16_be_hsw+0x46>
 
 PUBLIC _sk_store_u16_be_hsw
 _sk_store_u16_be_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  72,141,4,189,0,0,0,0                ; lea           0x0(,%rdi,4),%rax
-  DB  196,98,125,24,5,91,17,0,0           ; vbroadcastss  0x115b(%rip),%ymm8        # 4be0 <_sk_callback_hsw+0x427>
+  DB  196,98,125,24,5,91,17,0,0           ; vbroadcastss  0x115b(%rip),%ymm8        # 4bd4 <_sk_callback_hsw+0x427>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,67,125,25,202,1                 ; vextractf128  $0x1,%ymm9,%xmm10
@@ -3574,7 +3574,7 @@
   DB  196,65,17,98,200                    ; vpunpckldq    %xmm8,%xmm13,%xmm9
   DB  196,65,17,106,192                   ; vpunpckhdq    %xmm8,%xmm13,%xmm8
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,31                              ; jne           3b69 <_sk_store_u16_be_hsw+0xfa>
+  DB  117,31                              ; jne           3b5d <_sk_store_u16_be_hsw+0xfa>
   DB  196,65,120,17,28,64                 ; vmovups       %xmm11,(%r8,%rax,2)
   DB  196,65,120,17,84,64,16              ; vmovups       %xmm10,0x10(%r8,%rax,2)
   DB  196,65,120,17,76,64,32              ; vmovups       %xmm9,0x20(%r8,%rax,2)
@@ -3583,31 +3583,31 @@
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,214,28,64                ; vmovq         %xmm11,(%r8,%rax,2)
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  116,240                             ; je            3b65 <_sk_store_u16_be_hsw+0xf6>
+  DB  116,240                             ; je            3b59 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,23,92,64,8               ; vmovhpd       %xmm11,0x8(%r8,%rax,2)
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,227                             ; jb            3b65 <_sk_store_u16_be_hsw+0xf6>
+  DB  114,227                             ; jb            3b59 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,214,84,64,16             ; vmovq         %xmm10,0x10(%r8,%rax,2)
-  DB  116,218                             ; je            3b65 <_sk_store_u16_be_hsw+0xf6>
+  DB  116,218                             ; je            3b59 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,23,84,64,24              ; vmovhpd       %xmm10,0x18(%r8,%rax,2)
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,205                             ; jb            3b65 <_sk_store_u16_be_hsw+0xf6>
+  DB  114,205                             ; jb            3b59 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,214,76,64,32             ; vmovq         %xmm9,0x20(%r8,%rax,2)
-  DB  116,196                             ; je            3b65 <_sk_store_u16_be_hsw+0xf6>
+  DB  116,196                             ; je            3b59 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,23,76,64,40              ; vmovhpd       %xmm9,0x28(%r8,%rax,2)
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  114,183                             ; jb            3b65 <_sk_store_u16_be_hsw+0xf6>
+  DB  114,183                             ; jb            3b59 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,214,68,64,48             ; vmovq         %xmm8,0x30(%r8,%rax,2)
-  DB  235,174                             ; jmp           3b65 <_sk_store_u16_be_hsw+0xf6>
+  DB  235,174                             ; jmp           3b59 <_sk_store_u16_be_hsw+0xf6>
 
 PUBLIC _sk_load_f32_hsw
 _sk_load_f32_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  119,110                             ; ja            3c2d <_sk_load_f32_hsw+0x76>
+  DB  119,110                             ; ja            3c21 <_sk_load_f32_hsw+0x76>
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  76,141,12,189,0,0,0,0               ; lea           0x0(,%rdi,4),%r9
-  DB  76,141,21,135,0,0,0                 ; lea           0x87(%rip),%r10        # 3c58 <_sk_load_f32_hsw+0xa1>
+  DB  76,141,21,135,0,0,0                 ; lea           0x87(%rip),%r10        # 3c4c <_sk_load_f32_hsw+0xa1>
   DB  73,99,4,138                         ; movslq        (%r10,%rcx,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -3666,7 +3666,7 @@
   DB  196,65,37,20,196                    ; vunpcklpd     %ymm12,%ymm11,%ymm8
   DB  196,65,37,21,220                    ; vunpckhpd     %ymm12,%ymm11,%ymm11
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,55                              ; jne           3ce5 <_sk_store_f32_hsw+0x6d>
+  DB  117,55                              ; jne           3cd9 <_sk_store_f32_hsw+0x6d>
   DB  196,67,45,24,225,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm12
   DB  196,67,61,24,235,1                  ; vinsertf128   $0x1,%xmm11,%ymm8,%ymm13
   DB  196,67,45,6,201,49                  ; vperm2f128    $0x31,%ymm9,%ymm10,%ymm9
@@ -3679,22 +3679,22 @@
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,17,20,128                ; vmovupd       %xmm10,(%r8,%rax,4)
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  116,240                             ; je            3ce1 <_sk_store_f32_hsw+0x69>
+  DB  116,240                             ; je            3cd5 <_sk_store_f32_hsw+0x69>
   DB  196,65,121,17,76,128,16             ; vmovupd       %xmm9,0x10(%r8,%rax,4)
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,227                             ; jb            3ce1 <_sk_store_f32_hsw+0x69>
+  DB  114,227                             ; jb            3cd5 <_sk_store_f32_hsw+0x69>
   DB  196,65,121,17,68,128,32             ; vmovupd       %xmm8,0x20(%r8,%rax,4)
-  DB  116,218                             ; je            3ce1 <_sk_store_f32_hsw+0x69>
+  DB  116,218                             ; je            3cd5 <_sk_store_f32_hsw+0x69>
   DB  196,65,121,17,92,128,48             ; vmovupd       %xmm11,0x30(%r8,%rax,4)
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,205                             ; jb            3ce1 <_sk_store_f32_hsw+0x69>
+  DB  114,205                             ; jb            3cd5 <_sk_store_f32_hsw+0x69>
   DB  196,67,125,25,84,128,64,1           ; vextractf128  $0x1,%ymm10,0x40(%r8,%rax,4)
-  DB  116,195                             ; je            3ce1 <_sk_store_f32_hsw+0x69>
+  DB  116,195                             ; je            3cd5 <_sk_store_f32_hsw+0x69>
   DB  196,67,125,25,76,128,80,1           ; vextractf128  $0x1,%ymm9,0x50(%r8,%rax,4)
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  114,181                             ; jb            3ce1 <_sk_store_f32_hsw+0x69>
+  DB  114,181                             ; jb            3cd5 <_sk_store_f32_hsw+0x69>
   DB  196,67,125,25,68,128,96,1           ; vextractf128  $0x1,%ymm8,0x60(%r8,%rax,4)
-  DB  235,171                             ; jmp           3ce1 <_sk_store_f32_hsw+0x69>
+  DB  235,171                             ; jmp           3cd5 <_sk_store_f32_hsw+0x69>
 
 PUBLIC _sk_clamp_x_hsw
 _sk_clamp_x_hsw LABEL PROC
@@ -3778,11 +3778,11 @@
 
 PUBLIC _sk_luminance_to_alpha_hsw
 _sk_luminance_to_alpha_hsw LABEL PROC
-  DB  196,226,125,24,29,171,13,0,0        ; vbroadcastss  0xdab(%rip),%ymm3        # 4be4 <_sk_callback_hsw+0x42b>
-  DB  196,98,125,24,5,166,13,0,0          ; vbroadcastss  0xda6(%rip),%ymm8        # 4be8 <_sk_callback_hsw+0x42f>
+  DB  196,226,125,24,29,171,13,0,0        ; vbroadcastss  0xdab(%rip),%ymm3        # 4bd8 <_sk_callback_hsw+0x42b>
+  DB  196,98,125,24,5,166,13,0,0          ; vbroadcastss  0xda6(%rip),%ymm8        # 4bdc <_sk_callback_hsw+0x42f>
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
   DB  196,226,125,184,203                 ; vfmadd231ps   %ymm3,%ymm0,%ymm1
-  DB  196,226,125,24,29,151,13,0,0        ; vbroadcastss  0xd97(%rip),%ymm3        # 4bec <_sk_callback_hsw+0x433>
+  DB  196,226,125,24,29,151,13,0,0        ; vbroadcastss  0xd97(%rip),%ymm3        # 4be0 <_sk_callback_hsw+0x433>
   DB  196,226,109,168,217                 ; vfmadd213ps   %ymm1,%ymm2,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -3943,9 +3943,9 @@
   DB  76,139,64,8                         ; mov           0x8(%rax),%r8
   DB  77,137,202                          ; mov           %r9,%r10
   DB  73,255,202                          ; dec           %r10
-  DB  120,7                               ; js            410d <_sk_evenly_spaced_gradient_hsw+0x18>
+  DB  120,7                               ; js            4101 <_sk_evenly_spaced_gradient_hsw+0x18>
   DB  196,193,242,42,202                  ; vcvtsi2ss     %r10,%xmm1,%xmm1
-  DB  235,22                              ; jmp           4123 <_sk_evenly_spaced_gradient_hsw+0x2e>
+  DB  235,22                              ; jmp           4117 <_sk_evenly_spaced_gradient_hsw+0x2e>
   DB  77,137,211                          ; mov           %r10,%r11
   DB  73,209,235                          ; shr           %r11
   DB  65,131,226,1                        ; and           $0x1,%r10d
@@ -3956,7 +3956,7 @@
   DB  197,244,89,200                      ; vmulps        %ymm0,%ymm1,%ymm1
   DB  197,126,91,217                      ; vcvttps2dq    %ymm1,%ymm11
   DB  73,131,249,8                        ; cmp           $0x8,%r9
-  DB  119,70                              ; ja            417c <_sk_evenly_spaced_gradient_hsw+0x87>
+  DB  119,70                              ; ja            4170 <_sk_evenly_spaced_gradient_hsw+0x87>
   DB  196,66,37,22,0                      ; vpermps       (%r8),%ymm11,%ymm8
   DB  76,139,64,40                        ; mov           0x28(%rax),%r8
   DB  196,66,37,22,8                      ; vpermps       (%r8),%ymm11,%ymm9
@@ -3972,7 +3972,7 @@
   DB  196,194,37,22,24                    ; vpermps       (%r8),%ymm11,%ymm3
   DB  72,139,64,64                        ; mov           0x40(%rax),%rax
   DB  196,98,37,22,40                     ; vpermps       (%rax),%ymm11,%ymm13
-  DB  235,110                             ; jmp           41ea <_sk_evenly_spaced_gradient_hsw+0xf5>
+  DB  235,110                             ; jmp           41de <_sk_evenly_spaced_gradient_hsw+0xf5>
   DB  196,65,13,118,246                   ; vpcmpeqd      %ymm14,%ymm14,%ymm14
   DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
   DB  196,2,117,146,4,152                 ; vgatherdps    %ymm1,(%r8,%ymm11,4),%ymm8
@@ -4009,11 +4009,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  15,134,180,0,0,0                    ; jbe           42c9 <_sk_gradient_hsw+0xc3>
+  DB  15,134,180,0,0,0                    ; jbe           42bd <_sk_gradient_hsw+0xc3>
   DB  76,139,72,72                        ; mov           0x48(%rax),%r9
   DB  197,244,87,201                      ; vxorps        %ymm1,%ymm1,%ymm1
   DB  65,186,1,0,0,0                      ; mov           $0x1,%r10d
-  DB  196,226,125,24,21,196,9,0,0         ; vbroadcastss  0x9c4(%rip),%ymm2        # 4bf0 <_sk_callback_hsw+0x437>
+  DB  196,226,125,24,21,196,9,0,0         ; vbroadcastss  0x9c4(%rip),%ymm2        # 4be4 <_sk_callback_hsw+0x437>
   DB  196,65,53,239,201                   ; vpxor         %ymm9,%ymm9,%ymm9
   DB  196,130,125,24,28,145               ; vbroadcastss  (%r9,%r10,4),%ymm3
   DB  197,228,194,216,2                   ; vcmpleps      %ymm0,%ymm3,%ymm3
@@ -4021,10 +4021,10 @@
   DB  196,65,101,254,201                  ; vpaddd        %ymm9,%ymm3,%ymm9
   DB  73,255,194                          ; inc           %r10
   DB  77,57,208                           ; cmp           %r10,%r8
-  DB  117,226                             ; jne           4231 <_sk_gradient_hsw+0x2b>
+  DB  117,226                             ; jne           4225 <_sk_gradient_hsw+0x2b>
   DB  76,139,72,8                         ; mov           0x8(%rax),%r9
   DB  73,131,248,8                        ; cmp           $0x8,%r8
-  DB  118,121                             ; jbe           42d2 <_sk_gradient_hsw+0xcc>
+  DB  118,121                             ; jbe           42c6 <_sk_gradient_hsw+0xcc>
   DB  196,65,13,118,246                   ; vpcmpeqd      %ymm14,%ymm14,%ymm14
   DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
   DB  196,2,117,146,4,137                 ; vgatherdps    %ymm1,(%r9,%ymm9,4),%ymm8
@@ -4048,7 +4048,7 @@
   DB  196,130,21,146,28,136               ; vgatherdps    %ymm13,(%r8,%ymm9,4),%ymm3
   DB  72,139,64,64                        ; mov           0x40(%rax),%rax
   DB  196,34,13,146,44,136                ; vgatherdps    %ymm14,(%rax,%ymm9,4),%ymm13
-  DB  235,77                              ; jmp           4316 <_sk_gradient_hsw+0x110>
+  DB  235,77                              ; jmp           430a <_sk_gradient_hsw+0x110>
   DB  76,139,72,8                         ; mov           0x8(%rax),%r9
   DB  196,65,52,87,201                    ; vxorps        %ymm9,%ymm9,%ymm9
   DB  196,66,53,22,1                      ; vpermps       (%r9),%ymm9,%ymm8
@@ -4104,24 +4104,24 @@
   DB  196,65,52,95,226                    ; vmaxps        %ymm10,%ymm9,%ymm12
   DB  196,65,36,94,220                    ; vdivps        %ymm12,%ymm11,%ymm11
   DB  196,65,36,89,227                    ; vmulps        %ymm11,%ymm11,%ymm12
-  DB  196,98,125,24,45,67,8,0,0           ; vbroadcastss  0x843(%rip),%ymm13        # 4bf4 <_sk_callback_hsw+0x43b>
-  DB  196,98,125,24,53,62,8,0,0           ; vbroadcastss  0x83e(%rip),%ymm14        # 4bf8 <_sk_callback_hsw+0x43f>
+  DB  196,98,125,24,45,67,8,0,0           ; vbroadcastss  0x843(%rip),%ymm13        # 4be8 <_sk_callback_hsw+0x43b>
+  DB  196,98,125,24,53,62,8,0,0           ; vbroadcastss  0x83e(%rip),%ymm14        # 4bec <_sk_callback_hsw+0x43f>
   DB  196,66,29,184,245                   ; vfmadd231ps   %ymm13,%ymm12,%ymm14
-  DB  196,98,125,24,45,52,8,0,0           ; vbroadcastss  0x834(%rip),%ymm13        # 4bfc <_sk_callback_hsw+0x443>
+  DB  196,98,125,24,45,52,8,0,0           ; vbroadcastss  0x834(%rip),%ymm13        # 4bf0 <_sk_callback_hsw+0x443>
   DB  196,66,29,184,238                   ; vfmadd231ps   %ymm14,%ymm12,%ymm13
-  DB  196,98,125,24,53,42,8,0,0           ; vbroadcastss  0x82a(%rip),%ymm14        # 4c00 <_sk_callback_hsw+0x447>
+  DB  196,98,125,24,53,42,8,0,0           ; vbroadcastss  0x82a(%rip),%ymm14        # 4bf4 <_sk_callback_hsw+0x447>
   DB  196,66,29,184,245                   ; vfmadd231ps   %ymm13,%ymm12,%ymm14
   DB  196,65,36,89,222                    ; vmulps        %ymm14,%ymm11,%ymm11
   DB  196,65,52,194,202,1                 ; vcmpltps      %ymm10,%ymm9,%ymm9
-  DB  196,98,125,24,21,21,8,0,0           ; vbroadcastss  0x815(%rip),%ymm10        # 4c04 <_sk_callback_hsw+0x44b>
+  DB  196,98,125,24,21,21,8,0,0           ; vbroadcastss  0x815(%rip),%ymm10        # 4bf8 <_sk_callback_hsw+0x44b>
   DB  196,65,44,92,211                    ; vsubps        %ymm11,%ymm10,%ymm10
   DB  196,67,37,74,202,144                ; vblendvps     %ymm9,%ymm10,%ymm11,%ymm9
   DB  196,193,124,194,192,1               ; vcmpltps      %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,21,255,7,0,0          ; vbroadcastss  0x7ff(%rip),%ymm10        # 4c08 <_sk_callback_hsw+0x44f>
+  DB  196,98,125,24,21,255,7,0,0          ; vbroadcastss  0x7ff(%rip),%ymm10        # 4bfc <_sk_callback_hsw+0x44f>
   DB  196,65,44,92,209                    ; vsubps        %ymm9,%ymm10,%ymm10
   DB  196,195,53,74,194,0                 ; vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   DB  196,65,116,194,200,1                ; vcmpltps      %ymm8,%ymm1,%ymm9
-  DB  196,98,125,24,21,233,7,0,0          ; vbroadcastss  0x7e9(%rip),%ymm10        # 4c0c <_sk_callback_hsw+0x453>
+  DB  196,98,125,24,21,233,7,0,0          ; vbroadcastss  0x7e9(%rip),%ymm10        # 4c00 <_sk_callback_hsw+0x453>
   DB  197,44,92,208                       ; vsubps        %ymm0,%ymm10,%ymm10
   DB  196,195,125,74,194,144              ; vblendvps     %ymm9,%ymm10,%ymm0,%ymm0
   DB  196,65,124,194,200,3                ; vcmpunordps   %ymm8,%ymm0,%ymm9
@@ -4140,7 +4140,7 @@
 PUBLIC _sk_save_xy_hsw
 _sk_save_xy_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,182,7,0,0           ; vbroadcastss  0x7b6(%rip),%ymm8        # 4c10 <_sk_callback_hsw+0x457>
+  DB  196,98,125,24,5,182,7,0,0           ; vbroadcastss  0x7b6(%rip),%ymm8        # 4c04 <_sk_callback_hsw+0x457>
   DB  196,65,124,88,200                   ; vaddps        %ymm8,%ymm0,%ymm9
   DB  196,67,125,8,209,1                  ; vroundps      $0x1,%ymm9,%ymm10
   DB  196,65,52,92,202                    ; vsubps        %ymm10,%ymm9,%ymm9
@@ -4170,9 +4170,9 @@
 PUBLIC _sk_bilinear_nx_hsw
 _sk_bilinear_nx_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,74,7,0,0           ; vbroadcastss  0x74a(%rip),%ymm0        # 4c14 <_sk_callback_hsw+0x45b>
+  DB  196,226,125,24,5,74,7,0,0           ; vbroadcastss  0x74a(%rip),%ymm0        # 4c08 <_sk_callback_hsw+0x45b>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,65,7,0,0            ; vbroadcastss  0x741(%rip),%ymm8        # 4c18 <_sk_callback_hsw+0x45f>
+  DB  196,98,125,24,5,65,7,0,0            ; vbroadcastss  0x741(%rip),%ymm8        # 4c0c <_sk_callback_hsw+0x45f>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -4181,7 +4181,7 @@
 PUBLIC _sk_bilinear_px_hsw
 _sk_bilinear_px_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,41,7,0,0           ; vbroadcastss  0x729(%rip),%ymm0        # 4c1c <_sk_callback_hsw+0x463>
+  DB  196,226,125,24,5,41,7,0,0           ; vbroadcastss  0x729(%rip),%ymm0        # 4c10 <_sk_callback_hsw+0x463>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
   DB  197,124,16,64,64                    ; vmovups       0x40(%rax),%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -4191,9 +4191,9 @@
 PUBLIC _sk_bilinear_ny_hsw
 _sk_bilinear_ny_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,13,7,0,0          ; vbroadcastss  0x70d(%rip),%ymm1        # 4c20 <_sk_callback_hsw+0x467>
+  DB  196,226,125,24,13,13,7,0,0          ; vbroadcastss  0x70d(%rip),%ymm1        # 4c14 <_sk_callback_hsw+0x467>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,3,7,0,0             ; vbroadcastss  0x703(%rip),%ymm8        # 4c24 <_sk_callback_hsw+0x46b>
+  DB  196,98,125,24,5,3,7,0,0             ; vbroadcastss  0x703(%rip),%ymm8        # 4c18 <_sk_callback_hsw+0x46b>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -4202,7 +4202,7 @@
 PUBLIC _sk_bilinear_py_hsw
 _sk_bilinear_py_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,235,6,0,0         ; vbroadcastss  0x6eb(%rip),%ymm1        # 4c28 <_sk_callback_hsw+0x46f>
+  DB  196,226,125,24,13,235,6,0,0         ; vbroadcastss  0x6eb(%rip),%ymm1        # 4c1c <_sk_callback_hsw+0x46f>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
   DB  197,124,16,64,96                    ; vmovups       0x60(%rax),%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -4212,13 +4212,13 @@
 PUBLIC _sk_bicubic_n3x_hsw
 _sk_bicubic_n3x_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,206,6,0,0          ; vbroadcastss  0x6ce(%rip),%ymm0        # 4c2c <_sk_callback_hsw+0x473>
+  DB  196,226,125,24,5,206,6,0,0          ; vbroadcastss  0x6ce(%rip),%ymm0        # 4c20 <_sk_callback_hsw+0x473>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,197,6,0,0           ; vbroadcastss  0x6c5(%rip),%ymm8        # 4c30 <_sk_callback_hsw+0x477>
+  DB  196,98,125,24,5,197,6,0,0           ; vbroadcastss  0x6c5(%rip),%ymm8        # 4c24 <_sk_callback_hsw+0x477>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,182,6,0,0          ; vbroadcastss  0x6b6(%rip),%ymm10        # 4c34 <_sk_callback_hsw+0x47b>
-  DB  196,98,125,24,29,177,6,0,0          ; vbroadcastss  0x6b1(%rip),%ymm11        # 4c38 <_sk_callback_hsw+0x47f>
+  DB  196,98,125,24,21,182,6,0,0          ; vbroadcastss  0x6b6(%rip),%ymm10        # 4c28 <_sk_callback_hsw+0x47b>
+  DB  196,98,125,24,29,177,6,0,0          ; vbroadcastss  0x6b1(%rip),%ymm11        # 4c2c <_sk_callback_hsw+0x47f>
   DB  196,66,61,168,218                   ; vfmadd213ps   %ymm10,%ymm8,%ymm11
   DB  196,65,36,89,193                    ; vmulps        %ymm9,%ymm11,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -4228,16 +4228,16 @@
 PUBLIC _sk_bicubic_n1x_hsw
 _sk_bicubic_n1x_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,148,6,0,0          ; vbroadcastss  0x694(%rip),%ymm0        # 4c3c <_sk_callback_hsw+0x483>
+  DB  196,226,125,24,5,148,6,0,0          ; vbroadcastss  0x694(%rip),%ymm0        # 4c30 <_sk_callback_hsw+0x483>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,139,6,0,0           ; vbroadcastss  0x68b(%rip),%ymm8        # 4c40 <_sk_callback_hsw+0x487>
+  DB  196,98,125,24,5,139,6,0,0           ; vbroadcastss  0x68b(%rip),%ymm8        # 4c34 <_sk_callback_hsw+0x487>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
-  DB  196,98,125,24,13,129,6,0,0          ; vbroadcastss  0x681(%rip),%ymm9        # 4c44 <_sk_callback_hsw+0x48b>
-  DB  196,98,125,24,21,124,6,0,0          ; vbroadcastss  0x67c(%rip),%ymm10        # 4c48 <_sk_callback_hsw+0x48f>
+  DB  196,98,125,24,13,129,6,0,0          ; vbroadcastss  0x681(%rip),%ymm9        # 4c38 <_sk_callback_hsw+0x48b>
+  DB  196,98,125,24,21,124,6,0,0          ; vbroadcastss  0x67c(%rip),%ymm10        # 4c3c <_sk_callback_hsw+0x48f>
   DB  196,66,61,168,209                   ; vfmadd213ps   %ymm9,%ymm8,%ymm10
-  DB  196,98,125,24,13,114,6,0,0          ; vbroadcastss  0x672(%rip),%ymm9        # 4c4c <_sk_callback_hsw+0x493>
+  DB  196,98,125,24,13,114,6,0,0          ; vbroadcastss  0x672(%rip),%ymm9        # 4c40 <_sk_callback_hsw+0x493>
   DB  196,66,61,184,202                   ; vfmadd231ps   %ymm10,%ymm8,%ymm9
-  DB  196,98,125,24,21,104,6,0,0          ; vbroadcastss  0x668(%rip),%ymm10        # 4c50 <_sk_callback_hsw+0x497>
+  DB  196,98,125,24,21,104,6,0,0          ; vbroadcastss  0x668(%rip),%ymm10        # 4c44 <_sk_callback_hsw+0x497>
   DB  196,66,61,184,209                   ; vfmadd231ps   %ymm9,%ymm8,%ymm10
   DB  197,124,17,144,128,0,0,0            ; vmovups       %ymm10,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -4246,14 +4246,14 @@
 PUBLIC _sk_bicubic_p1x_hsw
 _sk_bicubic_p1x_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,80,6,0,0            ; vbroadcastss  0x650(%rip),%ymm8        # 4c54 <_sk_callback_hsw+0x49b>
+  DB  196,98,125,24,5,80,6,0,0            ; vbroadcastss  0x650(%rip),%ymm8        # 4c48 <_sk_callback_hsw+0x49b>
   DB  197,188,88,0                        ; vaddps        (%rax),%ymm8,%ymm0
   DB  197,124,16,72,64                    ; vmovups       0x40(%rax),%ymm9
-  DB  196,98,125,24,21,66,6,0,0           ; vbroadcastss  0x642(%rip),%ymm10        # 4c58 <_sk_callback_hsw+0x49f>
-  DB  196,98,125,24,29,61,6,0,0           ; vbroadcastss  0x63d(%rip),%ymm11        # 4c5c <_sk_callback_hsw+0x4a3>
+  DB  196,98,125,24,21,66,6,0,0           ; vbroadcastss  0x642(%rip),%ymm10        # 4c4c <_sk_callback_hsw+0x49f>
+  DB  196,98,125,24,29,61,6,0,0           ; vbroadcastss  0x63d(%rip),%ymm11        # 4c50 <_sk_callback_hsw+0x4a3>
   DB  196,66,53,168,218                   ; vfmadd213ps   %ymm10,%ymm9,%ymm11
   DB  196,66,53,168,216                   ; vfmadd213ps   %ymm8,%ymm9,%ymm11
-  DB  196,98,125,24,5,46,6,0,0            ; vbroadcastss  0x62e(%rip),%ymm8        # 4c60 <_sk_callback_hsw+0x4a7>
+  DB  196,98,125,24,5,46,6,0,0            ; vbroadcastss  0x62e(%rip),%ymm8        # 4c54 <_sk_callback_hsw+0x4a7>
   DB  196,66,53,184,195                   ; vfmadd231ps   %ymm11,%ymm9,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -4262,12 +4262,12 @@
 PUBLIC _sk_bicubic_p3x_hsw
 _sk_bicubic_p3x_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,22,6,0,0           ; vbroadcastss  0x616(%rip),%ymm0        # 4c64 <_sk_callback_hsw+0x4ab>
+  DB  196,226,125,24,5,22,6,0,0           ; vbroadcastss  0x616(%rip),%ymm0        # 4c58 <_sk_callback_hsw+0x4ab>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
   DB  197,124,16,64,64                    ; vmovups       0x40(%rax),%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,3,6,0,0            ; vbroadcastss  0x603(%rip),%ymm10        # 4c68 <_sk_callback_hsw+0x4af>
-  DB  196,98,125,24,29,254,5,0,0          ; vbroadcastss  0x5fe(%rip),%ymm11        # 4c6c <_sk_callback_hsw+0x4b3>
+  DB  196,98,125,24,21,3,6,0,0            ; vbroadcastss  0x603(%rip),%ymm10        # 4c5c <_sk_callback_hsw+0x4af>
+  DB  196,98,125,24,29,254,5,0,0          ; vbroadcastss  0x5fe(%rip),%ymm11        # 4c60 <_sk_callback_hsw+0x4b3>
   DB  196,66,61,168,218                   ; vfmadd213ps   %ymm10,%ymm8,%ymm11
   DB  196,65,52,89,195                    ; vmulps        %ymm11,%ymm9,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -4277,13 +4277,13 @@
 PUBLIC _sk_bicubic_n3y_hsw
 _sk_bicubic_n3y_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,225,5,0,0         ; vbroadcastss  0x5e1(%rip),%ymm1        # 4c70 <_sk_callback_hsw+0x4b7>
+  DB  196,226,125,24,13,225,5,0,0         ; vbroadcastss  0x5e1(%rip),%ymm1        # 4c64 <_sk_callback_hsw+0x4b7>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,215,5,0,0           ; vbroadcastss  0x5d7(%rip),%ymm8        # 4c74 <_sk_callback_hsw+0x4bb>
+  DB  196,98,125,24,5,215,5,0,0           ; vbroadcastss  0x5d7(%rip),%ymm8        # 4c68 <_sk_callback_hsw+0x4bb>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,200,5,0,0          ; vbroadcastss  0x5c8(%rip),%ymm10        # 4c78 <_sk_callback_hsw+0x4bf>
-  DB  196,98,125,24,29,195,5,0,0          ; vbroadcastss  0x5c3(%rip),%ymm11        # 4c7c <_sk_callback_hsw+0x4c3>
+  DB  196,98,125,24,21,200,5,0,0          ; vbroadcastss  0x5c8(%rip),%ymm10        # 4c6c <_sk_callback_hsw+0x4bf>
+  DB  196,98,125,24,29,195,5,0,0          ; vbroadcastss  0x5c3(%rip),%ymm11        # 4c70 <_sk_callback_hsw+0x4c3>
   DB  196,66,61,168,218                   ; vfmadd213ps   %ymm10,%ymm8,%ymm11
   DB  196,65,36,89,193                    ; vmulps        %ymm9,%ymm11,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -4293,16 +4293,16 @@
 PUBLIC _sk_bicubic_n1y_hsw
 _sk_bicubic_n1y_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,166,5,0,0         ; vbroadcastss  0x5a6(%rip),%ymm1        # 4c80 <_sk_callback_hsw+0x4c7>
+  DB  196,226,125,24,13,166,5,0,0         ; vbroadcastss  0x5a6(%rip),%ymm1        # 4c74 <_sk_callback_hsw+0x4c7>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,156,5,0,0           ; vbroadcastss  0x59c(%rip),%ymm8        # 4c84 <_sk_callback_hsw+0x4cb>
+  DB  196,98,125,24,5,156,5,0,0           ; vbroadcastss  0x59c(%rip),%ymm8        # 4c78 <_sk_callback_hsw+0x4cb>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
-  DB  196,98,125,24,13,146,5,0,0          ; vbroadcastss  0x592(%rip),%ymm9        # 4c88 <_sk_callback_hsw+0x4cf>
-  DB  196,98,125,24,21,141,5,0,0          ; vbroadcastss  0x58d(%rip),%ymm10        # 4c8c <_sk_callback_hsw+0x4d3>
+  DB  196,98,125,24,13,146,5,0,0          ; vbroadcastss  0x592(%rip),%ymm9        # 4c7c <_sk_callback_hsw+0x4cf>
+  DB  196,98,125,24,21,141,5,0,0          ; vbroadcastss  0x58d(%rip),%ymm10        # 4c80 <_sk_callback_hsw+0x4d3>
   DB  196,66,61,168,209                   ; vfmadd213ps   %ymm9,%ymm8,%ymm10
-  DB  196,98,125,24,13,131,5,0,0          ; vbroadcastss  0x583(%rip),%ymm9        # 4c90 <_sk_callback_hsw+0x4d7>
+  DB  196,98,125,24,13,131,5,0,0          ; vbroadcastss  0x583(%rip),%ymm9        # 4c84 <_sk_callback_hsw+0x4d7>
   DB  196,66,61,184,202                   ; vfmadd231ps   %ymm10,%ymm8,%ymm9
-  DB  196,98,125,24,21,121,5,0,0          ; vbroadcastss  0x579(%rip),%ymm10        # 4c94 <_sk_callback_hsw+0x4db>
+  DB  196,98,125,24,21,121,5,0,0          ; vbroadcastss  0x579(%rip),%ymm10        # 4c88 <_sk_callback_hsw+0x4db>
   DB  196,66,61,184,209                   ; vfmadd231ps   %ymm9,%ymm8,%ymm10
   DB  197,124,17,144,160,0,0,0            ; vmovups       %ymm10,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -4311,14 +4311,14 @@
 PUBLIC _sk_bicubic_p1y_hsw
 _sk_bicubic_p1y_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,97,5,0,0            ; vbroadcastss  0x561(%rip),%ymm8        # 4c98 <_sk_callback_hsw+0x4df>
+  DB  196,98,125,24,5,97,5,0,0            ; vbroadcastss  0x561(%rip),%ymm8        # 4c8c <_sk_callback_hsw+0x4df>
   DB  197,188,88,72,32                    ; vaddps        0x20(%rax),%ymm8,%ymm1
   DB  197,124,16,72,96                    ; vmovups       0x60(%rax),%ymm9
-  DB  196,98,125,24,21,82,5,0,0           ; vbroadcastss  0x552(%rip),%ymm10        # 4c9c <_sk_callback_hsw+0x4e3>
-  DB  196,98,125,24,29,77,5,0,0           ; vbroadcastss  0x54d(%rip),%ymm11        # 4ca0 <_sk_callback_hsw+0x4e7>
+  DB  196,98,125,24,21,82,5,0,0           ; vbroadcastss  0x552(%rip),%ymm10        # 4c90 <_sk_callback_hsw+0x4e3>
+  DB  196,98,125,24,29,77,5,0,0           ; vbroadcastss  0x54d(%rip),%ymm11        # 4c94 <_sk_callback_hsw+0x4e7>
   DB  196,66,53,168,218                   ; vfmadd213ps   %ymm10,%ymm9,%ymm11
   DB  196,66,53,168,216                   ; vfmadd213ps   %ymm8,%ymm9,%ymm11
-  DB  196,98,125,24,5,62,5,0,0            ; vbroadcastss  0x53e(%rip),%ymm8        # 4ca4 <_sk_callback_hsw+0x4eb>
+  DB  196,98,125,24,5,62,5,0,0            ; vbroadcastss  0x53e(%rip),%ymm8        # 4c98 <_sk_callback_hsw+0x4eb>
   DB  196,66,53,184,195                   ; vfmadd231ps   %ymm11,%ymm9,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -4327,12 +4327,12 @@
 PUBLIC _sk_bicubic_p3y_hsw
 _sk_bicubic_p3y_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,38,5,0,0          ; vbroadcastss  0x526(%rip),%ymm1        # 4ca8 <_sk_callback_hsw+0x4ef>
+  DB  196,226,125,24,13,38,5,0,0          ; vbroadcastss  0x526(%rip),%ymm1        # 4c9c <_sk_callback_hsw+0x4ef>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
   DB  197,124,16,64,96                    ; vmovups       0x60(%rax),%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,18,5,0,0           ; vbroadcastss  0x512(%rip),%ymm10        # 4cac <_sk_callback_hsw+0x4f3>
-  DB  196,98,125,24,29,13,5,0,0           ; vbroadcastss  0x50d(%rip),%ymm11        # 4cb0 <_sk_callback_hsw+0x4f7>
+  DB  196,98,125,24,21,18,5,0,0           ; vbroadcastss  0x512(%rip),%ymm10        # 4ca0 <_sk_callback_hsw+0x4f3>
+  DB  196,98,125,24,29,13,5,0,0           ; vbroadcastss  0x50d(%rip),%ymm11        # 4ca4 <_sk_callback_hsw+0x4f7>
   DB  196,66,61,168,218                   ; vfmadd213ps   %ymm10,%ymm8,%ymm11
   DB  196,65,52,89,195                    ; vmulps        %ymm11,%ymm9,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -4446,25 +4446,25 @@
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 4985 <.literal4+0xb1>
+  DB  71,225,61                           ; rex.RXB       loope 4979 <.literal4+0xb1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 4995 <.literal4+0xc1>
+  DB  71,225,61                           ; rex.RXB       loope 4989 <.literal4+0xc1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 49a5 <.literal4+0xd1>
+  DB  71,225,61                           ; rex.RXB       loope 4999 <.literal4+0xd1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 49b5 <.literal4+0xe1>
+  DB  71,225,61                           ; rex.RXB       loope 49a9 <.literal4+0xe1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -4511,7 +4511,7 @@
   DB  190,129,128,128,59                  ; mov           $0x3b808081,%esi
   DB  129,128,128,59,0,248,0,0,8,33       ; addl          $0x21080000,-0x7ffc480(%rax)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        4a05 <.literal4+0x131>
+  DB  224,7                               ; loopne        49f9 <.literal4+0x131>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -4527,10 +4527,10 @@
   DB  129,128,128,59,129,128,128,59,0,0   ; addl          $0x3b80,-0x7f7ec480(%rax)
   DB  0,52,255                            ; add           %dh,(%rdi,%rdi,8)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4a2c <.literal4+0x158>
+  DB  127,0                               ; jg            4a20 <.literal4+0x158>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            4aa5 <.literal4+0x1d1>
+  DB  119,115                             ; ja            4a99 <.literal4+0x1d1>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -4544,10 +4544,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4a60 <.literal4+0x18c>
+  DB  127,0                               ; jg            4a54 <.literal4+0x18c>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            4ad9 <.literal4+0x205>
+  DB  119,115                             ; ja            4acd <.literal4+0x205>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -4561,10 +4561,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4a94 <.literal4+0x1c0>
+  DB  127,0                               ; jg            4a88 <.literal4+0x1c0>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            4b0d <.literal4+0x239>
+  DB  119,115                             ; ja            4b01 <.literal4+0x239>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -4578,10 +4578,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4ac8 <.literal4+0x1f4>
+  DB  127,0                               ; jg            4abc <.literal4+0x1f4>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            4b41 <.literal4+0x26d>
+  DB  119,115                             ; ja            4b35 <.literal4+0x26d>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -4594,7 +4594,7 @@
   DB  0,75,0                              ; add           %cl,0x0(%rbx)
   DB  0,128,63,0,0,200                    ; add           %al,-0x37ffffc1(%rax)
   DB  66,0,0                              ; rex.X         add %al,(%rax)
-  DB  127,67                              ; jg            4b3f <.literal4+0x26b>
+  DB  127,67                              ; jg            4b33 <.literal4+0x26b>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,195                               ; add           %al,%bl
   DB  0,0                                 ; add           %al,(%rax)
@@ -4606,10 +4606,10 @@
   DB  190,80,128,3,62                     ; mov           $0x3e038050,%esi
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           4b5f <.literal4+0x28b>
+  DB  118,63                              ; jbe           4b53 <.literal4+0x28b>
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  129,128,128,59,129,128,128,59,0,0   ; addl          $0x3b80,-0x7f7ec480(%rax)
-  DB  127,67                              ; jg            4b73 <.literal4+0x29f>
+  DB  127,67                              ; jg            4b67 <.literal4+0x29f>
   DB  129,128,128,59,0,0,128,63,129,128   ; addl          $0x80813f80,0x3b80(%rax)
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
   DB  0,128,63,129,128,128                ; add           %al,-0x7f7f7ec1(%rax)
@@ -4618,7 +4618,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        4b55 <.literal4+0x281>
+  DB  224,7                               ; loopne        4b49 <.literal4+0x281>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -4630,7 +4630,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        4b71 <.literal4+0x29d>
+  DB  224,7                               ; loopne        4b65 <.literal4+0x29d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -4641,7 +4641,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  248                                 ; clc
   DB  65,0,0                              ; add           %al,(%r8)
-  DB  124,66                              ; jl            4bc6 <.literal4+0x2f2>
+  DB  124,66                              ; jl            4bba <.literal4+0x2f2>
   DB  0,240                               ; add           %dh,%al
   DB  0,0                                 ; add           %al,(%rax)
   DB  137,136,136,55,0,15                 ; mov           %ecx,0xf003788(%rax)
@@ -4659,9 +4659,9 @@
   DB  137,136,136,59,15,0                 ; mov           %ecx,0xf3b88(%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  137,136,136,61,0,0                  ; mov           %ecx,0x3d88(%rax)
-  DB  112,65                              ; jo            4c09 <.literal4+0x335>
+  DB  112,65                              ; jo            4bfd <.literal4+0x335>
   DB  129,128,128,59,129,128,128,59,0,0   ; addl          $0x3b80,-0x7f7ec480(%rax)
-  DB  127,67                              ; jg            4c17 <.literal4+0x343>
+  DB  127,67                              ; jg            4c0b <.literal4+0x343>
   DB  128,0,128                           ; addb          $0x80,(%rax)
   DB  55                                  ; (bad)
   DB  128,0,128                           ; addb          $0x80,(%rax)
@@ -4669,7 +4669,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  255                                 ; (bad)
-  DB  127,71                              ; jg            4c2b <.literal4+0x357>
+  DB  127,71                              ; jg            4c1f <.literal4+0x357>
   DB  208                                 ; (bad)
   DB  179,89                              ; mov           $0x59,%bl
   DB  62,89                               ; ds            pop %rcx
@@ -4769,16 +4769,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a004ce8 <_sk_callback_hsw+0xa00052f>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a004ce8 <_sk_callback_hsw+0xa00053b>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12004cf0 <_sk_callback_hsw+0x12000537>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12004cf0 <_sk_callback_hsw+0x12000543>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a004cf8 <_sk_callback_hsw+0x1a00053f>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a004cf8 <_sk_callback_hsw+0x1a00054b>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3004d00 <_sk_callback_hsw+0x3000547>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3004d00 <_sk_callback_hsw+0x3000553>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -4821,16 +4821,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a004d48 <_sk_callback_hsw+0xa00058f>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a004d48 <_sk_callback_hsw+0xa00059b>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12004d50 <_sk_callback_hsw+0x12000597>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12004d50 <_sk_callback_hsw+0x120005a3>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a004d58 <_sk_callback_hsw+0x1a00059f>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a004d58 <_sk_callback_hsw+0x1a0005ab>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3004d60 <_sk_callback_hsw+0x30005a7>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3004d60 <_sk_callback_hsw+0x30005b3>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -4873,16 +4873,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a004da8 <_sk_callback_hsw+0xa0005ef>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a004da8 <_sk_callback_hsw+0xa0005fb>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12004db0 <_sk_callback_hsw+0x120005f7>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12004db0 <_sk_callback_hsw+0x12000603>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a004db8 <_sk_callback_hsw+0x1a0005ff>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a004db8 <_sk_callback_hsw+0x1a00060b>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3004dc0 <_sk_callback_hsw+0x3000607>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3004dc0 <_sk_callback_hsw+0x3000613>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -4925,16 +4925,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a004e08 <_sk_callback_hsw+0xa00064f>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a004e08 <_sk_callback_hsw+0xa00065b>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12004e10 <_sk_callback_hsw+0x12000657>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12004e10 <_sk_callback_hsw+0x12000663>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a004e18 <_sk_callback_hsw+0x1a00065f>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a004e18 <_sk_callback_hsw+0x1a00066b>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3004e20 <_sk_callback_hsw+0x3000667>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3004e20 <_sk_callback_hsw+0x3000673>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -5076,14 +5076,14 @@
   DB  197,249,112,192,0                   ; vpshufd       $0x0,%xmm0,%xmm0
   DB  196,227,125,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,144,99,0,0        ; vbroadcastss  0x6390(%rip),%ymm1        # 64f0 <_sk_callback_avx+0x119>
+  DB  196,226,125,24,13,152,99,0,0        ; vbroadcastss  0x6398(%rip),%ymm1        # 64f8 <_sk_callback_avx+0x119>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  197,252,88,2                        ; vaddps        (%rdx),%ymm0,%ymm0
   DB  196,226,125,24,16                   ; vbroadcastss  (%rax),%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  197,236,88,201                      ; vaddps        %ymm1,%ymm2,%ymm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,21,116,99,0,0        ; vbroadcastss  0x6374(%rip),%ymm2        # 64f4 <_sk_callback_avx+0x11d>
+  DB  196,226,125,24,21,124,99,0,0        ; vbroadcastss  0x637c(%rip),%ymm2        # 64fc <_sk_callback_avx+0x11d>
   DB  197,228,87,219                      ; vxorps        %ymm3,%ymm3,%ymm3
   DB  197,220,87,228                      ; vxorps        %ymm4,%ymm4,%ymm4
   DB  197,212,87,237                      ; vxorps        %ymm5,%ymm5,%ymm5
@@ -5094,16 +5094,17 @@
 PUBLIC _sk_dither_avx
 _sk_dither_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  197,121,110,199                     ; vmovd         %edi,%xmm8
-  DB  196,65,121,112,192,0                ; vpshufd       $0x0,%xmm8,%xmm8
-  DB  196,67,61,24,192,1                  ; vinsertf128   $0x1,%xmm8,%ymm8,%ymm8
-  DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  197,60,88,2                         ; vaddps        (%rdx),%ymm8,%ymm8
-  DB  196,65,126,91,192                   ; vcvttps2dq    %ymm8,%ymm8
+  DB  197,124,16,66,32                    ; vmovups       0x20(%rdx),%ymm8
+  DB  196,67,125,25,193,1                 ; vextractf128  $0x1,%ymm8,%xmm9
+  DB  197,121,110,215                     ; vmovd         %edi,%xmm10
+  DB  196,65,121,112,210,0                ; vpshufd       $0x0,%xmm10,%xmm10
+  DB  196,65,49,254,202                   ; vpaddd        %xmm10,%xmm9,%xmm9
+  DB  196,65,57,254,194                   ; vpaddd        %xmm10,%xmm8,%xmm8
+  DB  196,67,61,24,193,1                  ; vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  196,66,125,24,8                     ; vbroadcastss  (%r8),%ymm9
   DB  196,65,60,87,209                    ; vxorps        %ymm9,%ymm8,%ymm10
-  DB  196,98,125,24,29,44,99,0,0          ; vbroadcastss  0x632c(%rip),%ymm11        # 64f8 <_sk_callback_avx+0x121>
+  DB  196,98,125,24,29,45,99,0,0          ; vbroadcastss  0x632d(%rip),%ymm11        # 6500 <_sk_callback_avx+0x121>
   DB  196,65,44,84,203                    ; vandps        %ymm11,%ymm10,%ymm9
   DB  196,193,25,114,241,5                ; vpslld        $0x5,%xmm9,%xmm12
   DB  196,67,125,25,201,1                 ; vextractf128  $0x1,%ymm9,%xmm9
@@ -5114,8 +5115,8 @@
   DB  196,67,125,25,219,1                 ; vextractf128  $0x1,%ymm11,%xmm11
   DB  196,193,33,114,243,4                ; vpslld        $0x4,%xmm11,%xmm11
   DB  196,67,29,24,219,1                  ; vinsertf128   $0x1,%xmm11,%ymm12,%ymm11
-  DB  196,98,125,24,37,237,98,0,0         ; vbroadcastss  0x62ed(%rip),%ymm12        # 64fc <_sk_callback_avx+0x125>
-  DB  196,98,125,24,45,232,98,0,0         ; vbroadcastss  0x62e8(%rip),%ymm13        # 6500 <_sk_callback_avx+0x129>
+  DB  196,98,125,24,37,238,98,0,0         ; vbroadcastss  0x62ee(%rip),%ymm12        # 6504 <_sk_callback_avx+0x125>
+  DB  196,98,125,24,45,233,98,0,0         ; vbroadcastss  0x62e9(%rip),%ymm13        # 6508 <_sk_callback_avx+0x129>
   DB  196,65,44,84,245                    ; vandps        %ymm13,%ymm10,%ymm14
   DB  196,193,1,114,246,2                 ; vpslld        $0x2,%xmm14,%xmm15
   DB  196,67,125,25,246,1                 ; vextractf128  $0x1,%ymm14,%xmm14
@@ -5138,13 +5139,13 @@
   DB  196,67,29,24,192,1                  ; vinsertf128   $0x1,%xmm8,%ymm12,%ymm8
   DB  196,65,20,86,219                    ; vorps         %ymm11,%ymm13,%ymm11
   DB  196,65,36,86,192                    ; vorps         %ymm8,%ymm11,%ymm8
-  DB  196,65,52,86,206                    ; vorps         %ymm14,%ymm9,%ymm9
   DB  196,65,60,86,193                    ; vorps         %ymm9,%ymm8,%ymm8
-  DB  196,65,60,86,194                    ; vorps         %ymm10,%ymm8,%ymm8
+  DB  196,65,12,86,202                    ; vorps         %ymm10,%ymm14,%ymm9
+  DB  196,65,60,86,193                    ; vorps         %ymm9,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,83,98,0,0          ; vbroadcastss  0x6253(%rip),%ymm9        # 6504 <_sk_callback_avx+0x12d>
+  DB  196,98,125,24,13,84,98,0,0          ; vbroadcastss  0x6254(%rip),%ymm9        # 650c <_sk_callback_avx+0x12d>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
-  DB  196,98,125,24,13,73,98,0,0          ; vbroadcastss  0x6249(%rip),%ymm9        # 6508 <_sk_callback_avx+0x131>
+  DB  196,98,125,24,13,74,98,0,0          ; vbroadcastss  0x624a(%rip),%ymm9        # 6510 <_sk_callback_avx+0x131>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  196,98,125,24,72,8                  ; vbroadcastss  0x8(%rax),%ymm9
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
@@ -5203,7 +5204,7 @@
 PUBLIC _sk_srcatop_avx
 _sk_srcatop_avx LABEL PROC
   DB  197,252,89,199                      ; vmulps        %ymm7,%ymm0,%ymm0
-  DB  196,98,125,24,5,160,97,0,0          ; vbroadcastss  0x61a0(%rip),%ymm8        # 650c <_sk_callback_avx+0x135>
+  DB  196,98,125,24,5,161,97,0,0          ; vbroadcastss  0x61a1(%rip),%ymm8        # 6514 <_sk_callback_avx+0x135>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,204                       ; vmulps        %ymm4,%ymm8,%ymm9
   DB  197,180,88,192                      ; vaddps        %ymm0,%ymm9,%ymm0
@@ -5222,7 +5223,7 @@
 PUBLIC _sk_dstatop_avx
 _sk_dstatop_avx LABEL PROC
   DB  197,100,89,196                      ; vmulps        %ymm4,%ymm3,%ymm8
-  DB  196,98,125,24,13,98,97,0,0          ; vbroadcastss  0x6162(%rip),%ymm9        # 6510 <_sk_callback_avx+0x139>
+  DB  196,98,125,24,13,99,97,0,0          ; vbroadcastss  0x6163(%rip),%ymm9        # 6518 <_sk_callback_avx+0x139>
   DB  197,52,92,207                       ; vsubps        %ymm7,%ymm9,%ymm9
   DB  197,180,89,192                      ; vmulps        %ymm0,%ymm9,%ymm0
   DB  197,188,88,192                      ; vaddps        %ymm0,%ymm8,%ymm0
@@ -5258,7 +5259,7 @@
 
 PUBLIC _sk_srcout_avx
 _sk_srcout_avx LABEL PROC
-  DB  196,98,125,24,5,1,97,0,0            ; vbroadcastss  0x6101(%rip),%ymm8        # 6514 <_sk_callback_avx+0x13d>
+  DB  196,98,125,24,5,2,97,0,0            ; vbroadcastss  0x6102(%rip),%ymm8        # 651c <_sk_callback_avx+0x13d>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
@@ -5269,7 +5270,7 @@
 
 PUBLIC _sk_dstout_avx
 _sk_dstout_avx LABEL PROC
-  DB  196,226,125,24,5,228,96,0,0         ; vbroadcastss  0x60e4(%rip),%ymm0        # 6518 <_sk_callback_avx+0x141>
+  DB  196,226,125,24,5,229,96,0,0         ; vbroadcastss  0x60e5(%rip),%ymm0        # 6520 <_sk_callback_avx+0x141>
   DB  197,252,92,219                      ; vsubps        %ymm3,%ymm0,%ymm3
   DB  197,228,89,196                      ; vmulps        %ymm4,%ymm3,%ymm0
   DB  197,228,89,205                      ; vmulps        %ymm5,%ymm3,%ymm1
@@ -5280,7 +5281,7 @@
 
 PUBLIC _sk_srcover_avx
 _sk_srcover_avx LABEL PROC
-  DB  196,98,125,24,5,199,96,0,0          ; vbroadcastss  0x60c7(%rip),%ymm8        # 651c <_sk_callback_avx+0x145>
+  DB  196,98,125,24,5,200,96,0,0          ; vbroadcastss  0x60c8(%rip),%ymm8        # 6524 <_sk_callback_avx+0x145>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,204                       ; vmulps        %ymm4,%ymm8,%ymm9
   DB  197,180,88,192                      ; vaddps        %ymm0,%ymm9,%ymm0
@@ -5295,7 +5296,7 @@
 
 PUBLIC _sk_dstover_avx
 _sk_dstover_avx LABEL PROC
-  DB  196,98,125,24,5,154,96,0,0          ; vbroadcastss  0x609a(%rip),%ymm8        # 6520 <_sk_callback_avx+0x149>
+  DB  196,98,125,24,5,155,96,0,0          ; vbroadcastss  0x609b(%rip),%ymm8        # 6528 <_sk_callback_avx+0x149>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,252,88,196                      ; vaddps        %ymm4,%ymm0,%ymm0
@@ -5319,7 +5320,7 @@
 
 PUBLIC _sk_multiply_avx
 _sk_multiply_avx LABEL PROC
-  DB  196,98,125,24,5,89,96,0,0           ; vbroadcastss  0x6059(%rip),%ymm8        # 6524 <_sk_callback_avx+0x14d>
+  DB  196,98,125,24,5,90,96,0,0           ; vbroadcastss  0x605a(%rip),%ymm8        # 652c <_sk_callback_avx+0x14d>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,52,89,208                       ; vmulps        %ymm0,%ymm9,%ymm10
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -5373,7 +5374,7 @@
 
 PUBLIC _sk_xor__avx
 _sk_xor__avx LABEL PROC
-  DB  196,98,125,24,5,168,95,0,0          ; vbroadcastss  0x5fa8(%rip),%ymm8        # 6528 <_sk_callback_avx+0x151>
+  DB  196,98,125,24,5,169,95,0,0          ; vbroadcastss  0x5fa9(%rip),%ymm8        # 6530 <_sk_callback_avx+0x151>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,180,89,192                      ; vmulps        %ymm0,%ymm9,%ymm0
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -5408,7 +5409,7 @@
   DB  197,100,89,206                      ; vmulps        %ymm6,%ymm3,%ymm9
   DB  196,193,108,95,209                  ; vmaxps        %ymm9,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,40,95,0,0           ; vbroadcastss  0x5f28(%rip),%ymm8        # 652c <_sk_callback_avx+0x155>
+  DB  196,98,125,24,5,41,95,0,0           ; vbroadcastss  0x5f29(%rip),%ymm8        # 6534 <_sk_callback_avx+0x155>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,199                       ; vmulps        %ymm7,%ymm8,%ymm8
   DB  197,188,88,219                      ; vaddps        %ymm3,%ymm8,%ymm3
@@ -5432,7 +5433,7 @@
   DB  197,100,89,206                      ; vmulps        %ymm6,%ymm3,%ymm9
   DB  196,193,108,93,209                  ; vminps        %ymm9,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,212,94,0,0          ; vbroadcastss  0x5ed4(%rip),%ymm8        # 6530 <_sk_callback_avx+0x159>
+  DB  196,98,125,24,5,213,94,0,0          ; vbroadcastss  0x5ed5(%rip),%ymm8        # 6538 <_sk_callback_avx+0x159>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,199                       ; vmulps        %ymm7,%ymm8,%ymm8
   DB  197,188,88,219                      ; vaddps        %ymm3,%ymm8,%ymm3
@@ -5459,7 +5460,7 @@
   DB  196,193,108,93,209                  ; vminps        %ymm9,%ymm2,%ymm2
   DB  197,236,88,210                      ; vaddps        %ymm2,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,116,94,0,0          ; vbroadcastss  0x5e74(%rip),%ymm8        # 6534 <_sk_callback_avx+0x15d>
+  DB  196,98,125,24,5,117,94,0,0          ; vbroadcastss  0x5e75(%rip),%ymm8        # 653c <_sk_callback_avx+0x15d>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,199                       ; vmulps        %ymm7,%ymm8,%ymm8
   DB  197,188,88,219                      ; vaddps        %ymm3,%ymm8,%ymm3
@@ -5480,7 +5481,7 @@
   DB  197,236,89,214                      ; vmulps        %ymm6,%ymm2,%ymm2
   DB  197,236,88,210                      ; vaddps        %ymm2,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,47,94,0,0           ; vbroadcastss  0x5e2f(%rip),%ymm8        # 6538 <_sk_callback_avx+0x161>
+  DB  196,98,125,24,5,48,94,0,0           ; vbroadcastss  0x5e30(%rip),%ymm8        # 6540 <_sk_callback_avx+0x161>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,199                       ; vmulps        %ymm7,%ymm8,%ymm8
   DB  197,188,88,219                      ; vaddps        %ymm3,%ymm8,%ymm3
@@ -5489,7 +5490,7 @@
 
 PUBLIC _sk_colorburn_avx
 _sk_colorburn_avx LABEL PROC
-  DB  196,98,125,24,5,26,94,0,0           ; vbroadcastss  0x5e1a(%rip),%ymm8        # 653c <_sk_callback_avx+0x165>
+  DB  196,98,125,24,5,27,94,0,0           ; vbroadcastss  0x5e1b(%rip),%ymm8        # 6544 <_sk_callback_avx+0x165>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,52,89,216                       ; vmulps        %ymm0,%ymm9,%ymm11
   DB  196,65,44,87,210                    ; vxorps        %ymm10,%ymm10,%ymm10
@@ -5549,7 +5550,7 @@
 PUBLIC _sk_colordodge_avx
 _sk_colordodge_avx LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
-  DB  196,98,125,24,13,22,93,0,0          ; vbroadcastss  0x5d16(%rip),%ymm9        # 6540 <_sk_callback_avx+0x169>
+  DB  196,98,125,24,13,23,93,0,0          ; vbroadcastss  0x5d17(%rip),%ymm9        # 6548 <_sk_callback_avx+0x169>
   DB  197,52,92,215                       ; vsubps        %ymm7,%ymm9,%ymm10
   DB  197,44,89,216                       ; vmulps        %ymm0,%ymm10,%ymm11
   DB  197,52,92,203                       ; vsubps        %ymm3,%ymm9,%ymm9
@@ -5604,7 +5605,7 @@
 
 PUBLIC _sk_hardlight_avx
 _sk_hardlight_avx LABEL PROC
-  DB  196,98,125,24,5,40,92,0,0           ; vbroadcastss  0x5c28(%rip),%ymm8        # 6544 <_sk_callback_avx+0x16d>
+  DB  196,98,125,24,5,41,92,0,0           ; vbroadcastss  0x5c29(%rip),%ymm8        # 654c <_sk_callback_avx+0x16d>
   DB  197,60,92,215                       ; vsubps        %ymm7,%ymm8,%ymm10
   DB  197,44,89,200                       ; vmulps        %ymm0,%ymm10,%ymm9
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -5657,7 +5658,7 @@
 
 PUBLIC _sk_overlay_avx
 _sk_overlay_avx LABEL PROC
-  DB  196,98,125,24,5,81,91,0,0           ; vbroadcastss  0x5b51(%rip),%ymm8        # 6548 <_sk_callback_avx+0x171>
+  DB  196,98,125,24,5,82,91,0,0           ; vbroadcastss  0x5b52(%rip),%ymm8        # 6550 <_sk_callback_avx+0x171>
   DB  197,60,92,215                       ; vsubps        %ymm7,%ymm8,%ymm10
   DB  197,44,89,200                       ; vmulps        %ymm0,%ymm10,%ymm9
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -5722,10 +5723,10 @@
   DB  196,65,60,88,192                    ; vaddps        %ymm8,%ymm8,%ymm8
   DB  196,65,60,89,216                    ; vmulps        %ymm8,%ymm8,%ymm11
   DB  196,65,60,88,195                    ; vaddps        %ymm11,%ymm8,%ymm8
-  DB  196,98,125,24,29,68,90,0,0          ; vbroadcastss  0x5a44(%rip),%ymm11        # 6550 <_sk_callback_avx+0x179>
+  DB  196,98,125,24,29,69,90,0,0          ; vbroadcastss  0x5a45(%rip),%ymm11        # 6558 <_sk_callback_avx+0x179>
   DB  196,65,28,88,235                    ; vaddps        %ymm11,%ymm12,%ymm13
   DB  196,65,20,89,192                    ; vmulps        %ymm8,%ymm13,%ymm8
-  DB  196,98,125,24,45,53,90,0,0          ; vbroadcastss  0x5a35(%rip),%ymm13        # 6554 <_sk_callback_avx+0x17d>
+  DB  196,98,125,24,45,54,90,0,0          ; vbroadcastss  0x5a36(%rip),%ymm13        # 655c <_sk_callback_avx+0x17d>
   DB  196,65,28,89,245                    ; vmulps        %ymm13,%ymm12,%ymm14
   DB  196,65,12,88,192                    ; vaddps        %ymm8,%ymm14,%ymm8
   DB  196,65,124,82,244                   ; vrsqrtps      %ymm12,%ymm14
@@ -5736,7 +5737,7 @@
   DB  197,4,194,255,2                     ; vcmpleps      %ymm7,%ymm15,%ymm15
   DB  196,67,13,74,240,240                ; vblendvps     %ymm15,%ymm8,%ymm14,%ymm14
   DB  197,116,88,249                      ; vaddps        %ymm1,%ymm1,%ymm15
-  DB  196,98,125,24,5,243,89,0,0          ; vbroadcastss  0x59f3(%rip),%ymm8        # 654c <_sk_callback_avx+0x175>
+  DB  196,98,125,24,5,244,89,0,0          ; vbroadcastss  0x59f4(%rip),%ymm8        # 6554 <_sk_callback_avx+0x175>
   DB  196,65,60,92,228                    ; vsubps        %ymm12,%ymm8,%ymm12
   DB  197,132,92,195                      ; vsubps        %ymm3,%ymm15,%ymm0
   DB  196,65,124,89,228                   ; vmulps        %ymm12,%ymm0,%ymm12
@@ -5863,12 +5864,12 @@
   DB  196,65,28,89,219                    ; vmulps        %ymm11,%ymm12,%ymm11
   DB  196,65,36,94,222                    ; vdivps        %ymm14,%ymm11,%ymm11
   DB  196,67,37,74,224,240                ; vblendvps     %ymm15,%ymm8,%ymm11,%ymm12
-  DB  196,98,125,24,53,189,87,0,0         ; vbroadcastss  0x57bd(%rip),%ymm14        # 6558 <_sk_callback_avx+0x181>
+  DB  196,98,125,24,53,190,87,0,0         ; vbroadcastss  0x57be(%rip),%ymm14        # 6560 <_sk_callback_avx+0x181>
   DB  196,65,92,89,222                    ; vmulps        %ymm14,%ymm4,%ymm11
-  DB  196,98,125,24,61,179,87,0,0         ; vbroadcastss  0x57b3(%rip),%ymm15        # 655c <_sk_callback_avx+0x185>
+  DB  196,98,125,24,61,180,87,0,0         ; vbroadcastss  0x57b4(%rip),%ymm15        # 6564 <_sk_callback_avx+0x185>
   DB  196,65,84,89,239                    ; vmulps        %ymm15,%ymm5,%ymm13
   DB  196,65,36,88,221                    ; vaddps        %ymm13,%ymm11,%ymm11
-  DB  196,226,125,24,5,164,87,0,0         ; vbroadcastss  0x57a4(%rip),%ymm0        # 6560 <_sk_callback_avx+0x189>
+  DB  196,226,125,24,5,165,87,0,0         ; vbroadcastss  0x57a5(%rip),%ymm0        # 6568 <_sk_callback_avx+0x189>
   DB  197,76,89,232                       ; vmulps        %ymm0,%ymm6,%ymm13
   DB  196,65,36,88,221                    ; vaddps        %ymm13,%ymm11,%ymm11
   DB  196,65,52,89,238                    ; vmulps        %ymm14,%ymm9,%ymm13
@@ -5929,7 +5930,7 @@
   DB  196,65,36,95,208                    ; vmaxps        %ymm8,%ymm11,%ymm10
   DB  196,195,109,74,209,240              ; vblendvps     %ymm15,%ymm9,%ymm2,%ymm2
   DB  196,193,108,95,208                  ; vmaxps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,125,86,0,0          ; vbroadcastss  0x567d(%rip),%ymm8        # 6564 <_sk_callback_avx+0x18d>
+  DB  196,98,125,24,5,126,86,0,0          ; vbroadcastss  0x567e(%rip),%ymm8        # 656c <_sk_callback_avx+0x18d>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,180,89,201                      ; vmulps        %ymm1,%ymm9,%ymm1
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -5986,12 +5987,12 @@
   DB  196,65,28,89,219                    ; vmulps        %ymm11,%ymm12,%ymm11
   DB  196,65,36,94,222                    ; vdivps        %ymm14,%ymm11,%ymm11
   DB  196,67,37,74,224,240                ; vblendvps     %ymm15,%ymm8,%ymm11,%ymm12
-  DB  196,98,125,24,53,133,85,0,0         ; vbroadcastss  0x5585(%rip),%ymm14        # 6568 <_sk_callback_avx+0x191>
+  DB  196,98,125,24,53,134,85,0,0         ; vbroadcastss  0x5586(%rip),%ymm14        # 6570 <_sk_callback_avx+0x191>
   DB  196,65,92,89,222                    ; vmulps        %ymm14,%ymm4,%ymm11
-  DB  196,98,125,24,61,123,85,0,0         ; vbroadcastss  0x557b(%rip),%ymm15        # 656c <_sk_callback_avx+0x195>
+  DB  196,98,125,24,61,124,85,0,0         ; vbroadcastss  0x557c(%rip),%ymm15        # 6574 <_sk_callback_avx+0x195>
   DB  196,65,84,89,239                    ; vmulps        %ymm15,%ymm5,%ymm13
   DB  196,65,36,88,221                    ; vaddps        %ymm13,%ymm11,%ymm11
-  DB  196,226,125,24,5,108,85,0,0         ; vbroadcastss  0x556c(%rip),%ymm0        # 6570 <_sk_callback_avx+0x199>
+  DB  196,226,125,24,5,109,85,0,0         ; vbroadcastss  0x556d(%rip),%ymm0        # 6578 <_sk_callback_avx+0x199>
   DB  197,76,89,232                       ; vmulps        %ymm0,%ymm6,%ymm13
   DB  196,65,36,88,221                    ; vaddps        %ymm13,%ymm11,%ymm11
   DB  196,65,52,89,238                    ; vmulps        %ymm14,%ymm9,%ymm13
@@ -6052,7 +6053,7 @@
   DB  196,65,36,95,208                    ; vmaxps        %ymm8,%ymm11,%ymm10
   DB  196,195,109,74,209,240              ; vblendvps     %ymm15,%ymm9,%ymm2,%ymm2
   DB  196,193,108,95,208                  ; vmaxps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,69,84,0,0           ; vbroadcastss  0x5445(%rip),%ymm8        # 6574 <_sk_callback_avx+0x19d>
+  DB  196,98,125,24,5,70,84,0,0           ; vbroadcastss  0x5446(%rip),%ymm8        # 657c <_sk_callback_avx+0x19d>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,180,89,201                      ; vmulps        %ymm1,%ymm9,%ymm1
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -6081,12 +6082,12 @@
   DB  197,252,17,68,36,32                 ; vmovups       %ymm0,0x20(%rsp)
   DB  197,124,89,199                      ; vmulps        %ymm7,%ymm0,%ymm8
   DB  197,116,89,207                      ; vmulps        %ymm7,%ymm1,%ymm9
-  DB  196,98,125,24,45,213,83,0,0         ; vbroadcastss  0x53d5(%rip),%ymm13        # 6578 <_sk_callback_avx+0x1a1>
+  DB  196,98,125,24,45,214,83,0,0         ; vbroadcastss  0x53d6(%rip),%ymm13        # 6580 <_sk_callback_avx+0x1a1>
   DB  196,65,92,89,213                    ; vmulps        %ymm13,%ymm4,%ymm10
-  DB  196,98,125,24,53,203,83,0,0         ; vbroadcastss  0x53cb(%rip),%ymm14        # 657c <_sk_callback_avx+0x1a5>
+  DB  196,98,125,24,53,204,83,0,0         ; vbroadcastss  0x53cc(%rip),%ymm14        # 6584 <_sk_callback_avx+0x1a5>
   DB  196,65,84,89,222                    ; vmulps        %ymm14,%ymm5,%ymm11
   DB  196,65,44,88,211                    ; vaddps        %ymm11,%ymm10,%ymm10
-  DB  196,98,125,24,61,188,83,0,0         ; vbroadcastss  0x53bc(%rip),%ymm15        # 6580 <_sk_callback_avx+0x1a9>
+  DB  196,98,125,24,61,189,83,0,0         ; vbroadcastss  0x53bd(%rip),%ymm15        # 6588 <_sk_callback_avx+0x1a9>
   DB  196,65,76,89,223                    ; vmulps        %ymm15,%ymm6,%ymm11
   DB  196,193,44,88,195                   ; vaddps        %ymm11,%ymm10,%ymm0
   DB  196,65,60,89,221                    ; vmulps        %ymm13,%ymm8,%ymm11
@@ -6149,7 +6150,7 @@
   DB  196,65,44,95,207                    ; vmaxps        %ymm15,%ymm10,%ymm9
   DB  196,195,37,74,192,0                 ; vblendvps     %ymm0,%ymm8,%ymm11,%ymm0
   DB  196,65,124,95,199                   ; vmaxps        %ymm15,%ymm0,%ymm8
-  DB  196,226,125,24,5,131,82,0,0         ; vbroadcastss  0x5283(%rip),%ymm0        # 6584 <_sk_callback_avx+0x1ad>
+  DB  196,226,125,24,5,132,82,0,0         ; vbroadcastss  0x5284(%rip),%ymm0        # 658c <_sk_callback_avx+0x1ad>
   DB  197,124,92,215                      ; vsubps        %ymm7,%ymm0,%ymm10
   DB  197,172,89,84,36,32                 ; vmulps        0x20(%rsp),%ymm10,%ymm2
   DB  197,124,92,219                      ; vsubps        %ymm3,%ymm0,%ymm11
@@ -6179,12 +6180,12 @@
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
   DB  197,100,89,196                      ; vmulps        %ymm4,%ymm3,%ymm8
   DB  197,100,89,205                      ; vmulps        %ymm5,%ymm3,%ymm9
-  DB  196,98,125,24,45,15,82,0,0          ; vbroadcastss  0x520f(%rip),%ymm13        # 6588 <_sk_callback_avx+0x1b1>
+  DB  196,98,125,24,45,16,82,0,0          ; vbroadcastss  0x5210(%rip),%ymm13        # 6590 <_sk_callback_avx+0x1b1>
   DB  196,65,108,89,213                   ; vmulps        %ymm13,%ymm2,%ymm10
-  DB  196,98,125,24,53,5,82,0,0           ; vbroadcastss  0x5205(%rip),%ymm14        # 658c <_sk_callback_avx+0x1b5>
+  DB  196,98,125,24,53,6,82,0,0           ; vbroadcastss  0x5206(%rip),%ymm14        # 6594 <_sk_callback_avx+0x1b5>
   DB  196,65,116,89,222                   ; vmulps        %ymm14,%ymm1,%ymm11
   DB  196,65,44,88,211                    ; vaddps        %ymm11,%ymm10,%ymm10
-  DB  196,98,125,24,61,246,81,0,0         ; vbroadcastss  0x51f6(%rip),%ymm15        # 6590 <_sk_callback_avx+0x1b9>
+  DB  196,98,125,24,61,247,81,0,0         ; vbroadcastss  0x51f7(%rip),%ymm15        # 6598 <_sk_callback_avx+0x1b9>
   DB  196,65,28,89,223                    ; vmulps        %ymm15,%ymm12,%ymm11
   DB  196,193,44,88,195                   ; vaddps        %ymm11,%ymm10,%ymm0
   DB  196,65,60,89,221                    ; vmulps        %ymm13,%ymm8,%ymm11
@@ -6247,7 +6248,7 @@
   DB  196,65,44,95,207                    ; vmaxps        %ymm15,%ymm10,%ymm9
   DB  196,195,37,74,192,0                 ; vblendvps     %ymm0,%ymm8,%ymm11,%ymm0
   DB  196,65,124,95,199                   ; vmaxps        %ymm15,%ymm0,%ymm8
-  DB  196,226,125,24,5,189,80,0,0         ; vbroadcastss  0x50bd(%rip),%ymm0        # 6594 <_sk_callback_avx+0x1bd>
+  DB  196,226,125,24,5,190,80,0,0         ; vbroadcastss  0x50be(%rip),%ymm0        # 659c <_sk_callback_avx+0x1bd>
   DB  197,124,92,215                      ; vsubps        %ymm7,%ymm0,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,124,92,219                      ; vsubps        %ymm3,%ymm0,%ymm11
@@ -6280,7 +6281,7 @@
 
 PUBLIC _sk_clamp_1_avx
 _sk_clamp_1_avx LABEL PROC
-  DB  196,98,125,24,5,77,80,0,0           ; vbroadcastss  0x504d(%rip),%ymm8        # 6598 <_sk_callback_avx+0x1c1>
+  DB  196,98,125,24,5,78,80,0,0           ; vbroadcastss  0x504e(%rip),%ymm8        # 65a0 <_sk_callback_avx+0x1c1>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  196,193,116,93,200                  ; vminps        %ymm8,%ymm1,%ymm1
   DB  196,193,108,93,208                  ; vminps        %ymm8,%ymm2,%ymm2
@@ -6290,7 +6291,7 @@
 
 PUBLIC _sk_clamp_a_avx
 _sk_clamp_a_avx LABEL PROC
-  DB  196,98,125,24,5,48,80,0,0           ; vbroadcastss  0x5030(%rip),%ymm8        # 659c <_sk_callback_avx+0x1c5>
+  DB  196,98,125,24,5,49,80,0,0           ; vbroadcastss  0x5031(%rip),%ymm8        # 65a4 <_sk_callback_avx+0x1c5>
   DB  196,193,100,93,216                  ; vminps        %ymm8,%ymm3,%ymm3
   DB  197,252,93,195                      ; vminps        %ymm3,%ymm0,%ymm0
   DB  197,244,93,203                      ; vminps        %ymm3,%ymm1,%ymm1
@@ -6362,7 +6363,7 @@
 _sk_unpremul_avx LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,65,100,194,200,0                ; vcmpeqps      %ymm8,%ymm3,%ymm9
-  DB  196,98,125,24,21,120,79,0,0         ; vbroadcastss  0x4f78(%rip),%ymm10        # 65a0 <_sk_callback_avx+0x1c9>
+  DB  196,98,125,24,21,121,79,0,0         ; vbroadcastss  0x4f79(%rip),%ymm10        # 65a8 <_sk_callback_avx+0x1c9>
   DB  197,44,94,211                       ; vdivps        %ymm3,%ymm10,%ymm10
   DB  196,67,45,74,192,144                ; vblendvps     %ymm9,%ymm8,%ymm10,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
@@ -6373,17 +6374,17 @@
 
 PUBLIC _sk_from_srgb_avx
 _sk_from_srgb_avx LABEL PROC
-  DB  196,98,125,24,5,89,79,0,0           ; vbroadcastss  0x4f59(%rip),%ymm8        # 65a4 <_sk_callback_avx+0x1cd>
+  DB  196,98,125,24,5,90,79,0,0           ; vbroadcastss  0x4f5a(%rip),%ymm8        # 65ac <_sk_callback_avx+0x1cd>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  197,124,89,208                      ; vmulps        %ymm0,%ymm0,%ymm10
-  DB  196,98,125,24,29,75,79,0,0          ; vbroadcastss  0x4f4b(%rip),%ymm11        # 65a8 <_sk_callback_avx+0x1d1>
+  DB  196,98,125,24,29,76,79,0,0          ; vbroadcastss  0x4f4c(%rip),%ymm11        # 65b0 <_sk_callback_avx+0x1d1>
   DB  196,65,124,89,227                   ; vmulps        %ymm11,%ymm0,%ymm12
-  DB  196,98,125,24,45,65,79,0,0          ; vbroadcastss  0x4f41(%rip),%ymm13        # 65ac <_sk_callback_avx+0x1d5>
+  DB  196,98,125,24,45,66,79,0,0          ; vbroadcastss  0x4f42(%rip),%ymm13        # 65b4 <_sk_callback_avx+0x1d5>
   DB  196,65,28,88,229                    ; vaddps        %ymm13,%ymm12,%ymm12
   DB  196,65,44,89,212                    ; vmulps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,50,79,0,0          ; vbroadcastss  0x4f32(%rip),%ymm12        # 65b0 <_sk_callback_avx+0x1d9>
+  DB  196,98,125,24,37,51,79,0,0          ; vbroadcastss  0x4f33(%rip),%ymm12        # 65b8 <_sk_callback_avx+0x1d9>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,53,40,79,0,0          ; vbroadcastss  0x4f28(%rip),%ymm14        # 65b4 <_sk_callback_avx+0x1dd>
+  DB  196,98,125,24,53,41,79,0,0          ; vbroadcastss  0x4f29(%rip),%ymm14        # 65bc <_sk_callback_avx+0x1dd>
   DB  196,193,124,194,198,1               ; vcmpltps      %ymm14,%ymm0,%ymm0
   DB  196,195,45,74,193,0                 ; vblendvps     %ymm0,%ymm9,%ymm10,%ymm0
   DB  196,65,116,89,200                   ; vmulps        %ymm8,%ymm1,%ymm9
@@ -6408,20 +6409,20 @@
 PUBLIC _sk_to_srgb_avx
 _sk_to_srgb_avx LABEL PROC
   DB  197,124,82,200                      ; vrsqrtps      %ymm0,%ymm9
-  DB  196,98,125,24,5,189,78,0,0          ; vbroadcastss  0x4ebd(%rip),%ymm8        # 65b8 <_sk_callback_avx+0x1e1>
+  DB  196,98,125,24,5,190,78,0,0          ; vbroadcastss  0x4ebe(%rip),%ymm8        # 65c0 <_sk_callback_avx+0x1e1>
   DB  196,65,124,89,208                   ; vmulps        %ymm8,%ymm0,%ymm10
-  DB  196,98,125,24,29,179,78,0,0         ; vbroadcastss  0x4eb3(%rip),%ymm11        # 65bc <_sk_callback_avx+0x1e5>
+  DB  196,98,125,24,29,180,78,0,0         ; vbroadcastss  0x4eb4(%rip),%ymm11        # 65c4 <_sk_callback_avx+0x1e5>
   DB  196,65,52,89,227                    ; vmulps        %ymm11,%ymm9,%ymm12
-  DB  196,98,125,24,45,169,78,0,0         ; vbroadcastss  0x4ea9(%rip),%ymm13        # 65c0 <_sk_callback_avx+0x1e9>
+  DB  196,98,125,24,45,170,78,0,0         ; vbroadcastss  0x4eaa(%rip),%ymm13        # 65c8 <_sk_callback_avx+0x1e9>
   DB  196,65,28,88,229                    ; vaddps        %ymm13,%ymm12,%ymm12
   DB  196,65,52,89,228                    ; vmulps        %ymm12,%ymm9,%ymm12
-  DB  196,98,125,24,53,154,78,0,0         ; vbroadcastss  0x4e9a(%rip),%ymm14        # 65c4 <_sk_callback_avx+0x1ed>
+  DB  196,98,125,24,53,155,78,0,0         ; vbroadcastss  0x4e9b(%rip),%ymm14        # 65cc <_sk_callback_avx+0x1ed>
   DB  196,65,28,88,230                    ; vaddps        %ymm14,%ymm12,%ymm12
-  DB  196,98,125,24,61,144,78,0,0         ; vbroadcastss  0x4e90(%rip),%ymm15        # 65c8 <_sk_callback_avx+0x1f1>
+  DB  196,98,125,24,61,145,78,0,0         ; vbroadcastss  0x4e91(%rip),%ymm15        # 65d0 <_sk_callback_avx+0x1f1>
   DB  196,65,52,88,207                    ; vaddps        %ymm15,%ymm9,%ymm9
   DB  196,65,124,83,201                   ; vrcpps        %ymm9,%ymm9
   DB  196,65,52,89,204                    ; vmulps        %ymm12,%ymm9,%ymm9
-  DB  196,98,125,24,37,124,78,0,0         ; vbroadcastss  0x4e7c(%rip),%ymm12        # 65cc <_sk_callback_avx+0x1f5>
+  DB  196,98,125,24,37,125,78,0,0         ; vbroadcastss  0x4e7d(%rip),%ymm12        # 65d4 <_sk_callback_avx+0x1f5>
   DB  196,193,124,194,196,1               ; vcmpltps      %ymm12,%ymm0,%ymm0
   DB  196,195,53,74,194,0                 ; vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   DB  197,124,82,201                      ; vrsqrtps      %ymm1,%ymm9
@@ -6456,7 +6457,7 @@
   DB  197,124,93,201                      ; vminps        %ymm1,%ymm0,%ymm9
   DB  197,52,93,202                       ; vminps        %ymm2,%ymm9,%ymm9
   DB  196,65,60,92,209                    ; vsubps        %ymm9,%ymm8,%ymm10
-  DB  196,98,125,24,29,226,77,0,0         ; vbroadcastss  0x4de2(%rip),%ymm11        # 65d0 <_sk_callback_avx+0x1f9>
+  DB  196,98,125,24,29,227,77,0,0         ; vbroadcastss  0x4de3(%rip),%ymm11        # 65d8 <_sk_callback_avx+0x1f9>
   DB  196,65,36,94,218                    ; vdivps        %ymm10,%ymm11,%ymm11
   DB  197,116,92,226                      ; vsubps        %ymm2,%ymm1,%ymm12
   DB  196,65,28,89,227                    ; vmulps        %ymm11,%ymm12,%ymm12
@@ -6466,19 +6467,19 @@
   DB  196,193,108,89,211                  ; vmulps        %ymm11,%ymm2,%ymm2
   DB  197,252,92,201                      ; vsubps        %ymm1,%ymm0,%ymm1
   DB  196,193,116,89,203                  ; vmulps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,187,77,0,0         ; vbroadcastss  0x4dbb(%rip),%ymm11        # 65dc <_sk_callback_avx+0x205>
+  DB  196,98,125,24,29,188,77,0,0         ; vbroadcastss  0x4dbc(%rip),%ymm11        # 65e4 <_sk_callback_avx+0x205>
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,169,77,0,0         ; vbroadcastss  0x4da9(%rip),%ymm11        # 65d8 <_sk_callback_avx+0x201>
+  DB  196,98,125,24,29,170,77,0,0         ; vbroadcastss  0x4daa(%rip),%ymm11        # 65e0 <_sk_callback_avx+0x201>
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
   DB  196,227,117,74,202,224              ; vblendvps     %ymm14,%ymm2,%ymm1,%ymm1
-  DB  196,226,125,24,21,145,77,0,0        ; vbroadcastss  0x4d91(%rip),%ymm2        # 65d4 <_sk_callback_avx+0x1fd>
+  DB  196,226,125,24,21,146,77,0,0        ; vbroadcastss  0x4d92(%rip),%ymm2        # 65dc <_sk_callback_avx+0x1fd>
   DB  196,65,12,87,246                    ; vxorps        %ymm14,%ymm14,%ymm14
   DB  196,227,13,74,210,208               ; vblendvps     %ymm13,%ymm2,%ymm14,%ymm2
   DB  197,188,194,192,0                   ; vcmpeqps      %ymm0,%ymm8,%ymm0
   DB  196,193,108,88,212                  ; vaddps        %ymm12,%ymm2,%ymm2
   DB  196,227,117,74,194,0                ; vblendvps     %ymm0,%ymm2,%ymm1,%ymm0
   DB  196,193,60,88,201                   ; vaddps        %ymm9,%ymm8,%ymm1
-  DB  196,98,125,24,37,120,77,0,0         ; vbroadcastss  0x4d78(%rip),%ymm12        # 65e4 <_sk_callback_avx+0x20d>
+  DB  196,98,125,24,37,121,77,0,0         ; vbroadcastss  0x4d79(%rip),%ymm12        # 65ec <_sk_callback_avx+0x20d>
   DB  196,193,116,89,212                  ; vmulps        %ymm12,%ymm1,%ymm2
   DB  197,28,194,226,1                    ; vcmpltps      %ymm2,%ymm12,%ymm12
   DB  196,65,36,92,216                    ; vsubps        %ymm8,%ymm11,%ymm11
@@ -6488,7 +6489,7 @@
   DB  197,172,94,201                      ; vdivps        %ymm1,%ymm10,%ymm1
   DB  196,195,125,74,198,128              ; vblendvps     %ymm8,%ymm14,%ymm0,%ymm0
   DB  196,195,117,74,206,128              ; vblendvps     %ymm8,%ymm14,%ymm1,%ymm1
-  DB  196,98,125,24,5,59,77,0,0           ; vbroadcastss  0x4d3b(%rip),%ymm8        # 65e0 <_sk_callback_avx+0x209>
+  DB  196,98,125,24,5,60,77,0,0           ; vbroadcastss  0x4d3c(%rip),%ymm8        # 65e8 <_sk_callback_avx+0x209>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -6503,7 +6504,7 @@
   DB  197,252,17,28,36                    ; vmovups       %ymm3,(%rsp)
   DB  197,252,40,225                      ; vmovaps       %ymm1,%ymm4
   DB  197,252,40,216                      ; vmovaps       %ymm0,%ymm3
-  DB  196,98,125,24,5,2,77,0,0            ; vbroadcastss  0x4d02(%rip),%ymm8        # 65e8 <_sk_callback_avx+0x211>
+  DB  196,98,125,24,5,3,77,0,0            ; vbroadcastss  0x4d03(%rip),%ymm8        # 65f0 <_sk_callback_avx+0x211>
   DB  197,60,194,202,2                    ; vcmpleps      %ymm2,%ymm8,%ymm9
   DB  197,92,89,210                       ; vmulps        %ymm2,%ymm4,%ymm10
   DB  196,65,92,92,218                    ; vsubps        %ymm10,%ymm4,%ymm11
@@ -6511,23 +6512,23 @@
   DB  197,52,88,210                       ; vaddps        %ymm2,%ymm9,%ymm10
   DB  197,108,88,202                      ; vaddps        %ymm2,%ymm2,%ymm9
   DB  196,65,52,92,202                    ; vsubps        %ymm10,%ymm9,%ymm9
-  DB  196,98,125,24,29,220,76,0,0         ; vbroadcastss  0x4cdc(%rip),%ymm11        # 65ec <_sk_callback_avx+0x215>
+  DB  196,98,125,24,29,221,76,0,0         ; vbroadcastss  0x4cdd(%rip),%ymm11        # 65f4 <_sk_callback_avx+0x215>
   DB  196,65,100,88,219                   ; vaddps        %ymm11,%ymm3,%ymm11
   DB  196,67,125,8,227,1                  ; vroundps      $0x1,%ymm11,%ymm12
   DB  196,65,36,92,252                    ; vsubps        %ymm12,%ymm11,%ymm15
   DB  196,65,44,92,217                    ; vsubps        %ymm9,%ymm10,%ymm11
-  DB  196,98,125,24,37,198,76,0,0         ; vbroadcastss  0x4cc6(%rip),%ymm12        # 65f4 <_sk_callback_avx+0x21d>
+  DB  196,98,125,24,37,199,76,0,0         ; vbroadcastss  0x4cc7(%rip),%ymm12        # 65fc <_sk_callback_avx+0x21d>
   DB  196,193,4,89,196                    ; vmulps        %ymm12,%ymm15,%ymm0
-  DB  196,98,125,24,45,188,76,0,0         ; vbroadcastss  0x4cbc(%rip),%ymm13        # 65f8 <_sk_callback_avx+0x221>
+  DB  196,98,125,24,45,189,76,0,0         ; vbroadcastss  0x4cbd(%rip),%ymm13        # 6600 <_sk_callback_avx+0x221>
   DB  197,20,92,240                       ; vsubps        %ymm0,%ymm13,%ymm14
   DB  196,65,36,89,246                    ; vmulps        %ymm14,%ymm11,%ymm14
   DB  196,65,52,88,246                    ; vaddps        %ymm14,%ymm9,%ymm14
-  DB  196,226,125,24,13,157,76,0,0        ; vbroadcastss  0x4c9d(%rip),%ymm1        # 65f0 <_sk_callback_avx+0x219>
+  DB  196,226,125,24,13,158,76,0,0        ; vbroadcastss  0x4c9e(%rip),%ymm1        # 65f8 <_sk_callback_avx+0x219>
   DB  196,193,116,194,255,2               ; vcmpleps      %ymm15,%ymm1,%ymm7
   DB  196,195,13,74,249,112               ; vblendvps     %ymm7,%ymm9,%ymm14,%ymm7
   DB  196,65,60,194,247,2                 ; vcmpleps      %ymm15,%ymm8,%ymm14
   DB  196,227,45,74,255,224               ; vblendvps     %ymm14,%ymm7,%ymm10,%ymm7
-  DB  196,98,125,24,53,136,76,0,0         ; vbroadcastss  0x4c88(%rip),%ymm14        # 65fc <_sk_callback_avx+0x225>
+  DB  196,98,125,24,53,137,76,0,0         ; vbroadcastss  0x4c89(%rip),%ymm14        # 6604 <_sk_callback_avx+0x225>
   DB  196,65,12,194,255,2                 ; vcmpleps      %ymm15,%ymm14,%ymm15
   DB  196,193,124,89,195                  ; vmulps        %ymm11,%ymm0,%ymm0
   DB  197,180,88,192                      ; vaddps        %ymm0,%ymm9,%ymm0
@@ -6546,7 +6547,7 @@
   DB  197,164,89,247                      ; vmulps        %ymm7,%ymm11,%ymm6
   DB  197,180,88,246                      ; vaddps        %ymm6,%ymm9,%ymm6
   DB  196,227,77,74,237,0                 ; vblendvps     %ymm0,%ymm5,%ymm6,%ymm5
-  DB  196,226,125,24,5,42,76,0,0          ; vbroadcastss  0x4c2a(%rip),%ymm0        # 6600 <_sk_callback_avx+0x229>
+  DB  196,226,125,24,5,43,76,0,0          ; vbroadcastss  0x4c2b(%rip),%ymm0        # 6608 <_sk_callback_avx+0x229>
   DB  197,228,88,192                      ; vaddps        %ymm0,%ymm3,%ymm0
   DB  196,227,125,8,216,1                 ; vroundps      $0x1,%ymm0,%ymm3
   DB  197,252,92,195                      ; vsubps        %ymm3,%ymm0,%ymm0
@@ -6594,14 +6595,14 @@
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  72,1,248                            ; add           %rdi,%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,68                              ; jne           1ad3 <_sk_scale_u8_avx+0x54>
+  DB  117,68                              ; jne           1ada <_sk_scale_u8_avx+0x54>
   DB  197,122,126,0                       ; vmovq         (%rax),%xmm8
   DB  196,66,121,49,200                   ; vpmovzxbd     %xmm8,%xmm9
   DB  196,67,121,4,192,229                ; vpermilps     $0xe5,%xmm8,%xmm8
   DB  196,66,121,49,192                   ; vpmovzxbd     %xmm8,%xmm8
   DB  196,67,53,24,192,1                  ; vinsertf128   $0x1,%xmm8,%ymm9,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,77,75,0,0          ; vbroadcastss  0x4b4d(%rip),%ymm9        # 6604 <_sk_callback_avx+0x22d>
+  DB  196,98,125,24,13,78,75,0,0          ; vbroadcastss  0x4b4e(%rip),%ymm9        # 660c <_sk_callback_avx+0x22d>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
@@ -6619,9 +6620,9 @@
   DB  77,9,217                            ; or            %r11,%r9
   DB  72,131,193,8                        ; add           $0x8,%rcx
   DB  73,255,202                          ; dec           %r10
-  DB  117,234                             ; jne           1adb <_sk_scale_u8_avx+0x5c>
+  DB  117,234                             ; jne           1ae2 <_sk_scale_u8_avx+0x5c>
   DB  196,65,249,110,193                  ; vmovq         %r9,%xmm8
-  DB  235,155                             ; jmp           1a93 <_sk_scale_u8_avx+0x14>
+  DB  235,155                             ; jmp           1a9a <_sk_scale_u8_avx+0x14>
 
 PUBLIC _sk_lerp_1_float_avx
 _sk_lerp_1_float_avx LABEL PROC
@@ -6649,14 +6650,14 @@
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  72,1,248                            ; add           %rdi,%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,104                             ; jne           1baf <_sk_lerp_u8_avx+0x78>
+  DB  117,104                             ; jne           1bb6 <_sk_lerp_u8_avx+0x78>
   DB  197,122,126,0                       ; vmovq         (%rax),%xmm8
   DB  196,66,121,49,200                   ; vpmovzxbd     %xmm8,%xmm9
   DB  196,67,121,4,192,229                ; vpermilps     $0xe5,%xmm8,%xmm8
   DB  196,66,121,49,192                   ; vpmovzxbd     %xmm8,%xmm8
   DB  196,67,53,24,192,1                  ; vinsertf128   $0x1,%xmm8,%ymm9,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,153,74,0,0         ; vbroadcastss  0x4a99(%rip),%ymm9        # 6608 <_sk_callback_avx+0x231>
+  DB  196,98,125,24,13,154,74,0,0         ; vbroadcastss  0x4a9a(%rip),%ymm9        # 6610 <_sk_callback_avx+0x231>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
@@ -6682,35 +6683,35 @@
   DB  77,9,217                            ; or            %r11,%r9
   DB  72,131,193,8                        ; add           $0x8,%rcx
   DB  73,255,202                          ; dec           %r10
-  DB  117,234                             ; jne           1bb7 <_sk_lerp_u8_avx+0x80>
+  DB  117,234                             ; jne           1bbe <_sk_lerp_u8_avx+0x80>
   DB  196,65,249,110,193                  ; vmovq         %r9,%xmm8
-  DB  233,116,255,255,255                 ; jmpq          1b4b <_sk_lerp_u8_avx+0x14>
+  DB  233,116,255,255,255                 ; jmpq          1b52 <_sk_lerp_u8_avx+0x14>
 
 PUBLIC _sk_lerp_565_avx
 _sk_lerp_565_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,208,0,0,0                    ; jne           1cb5 <_sk_lerp_565_avx+0xde>
+  DB  15,133,208,0,0,0                    ; jne           1cbc <_sk_lerp_565_avx+0xde>
   DB  196,65,122,111,4,122                ; vmovdqu       (%r10,%rdi,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  196,65,57,105,201                   ; vpunpckhwd    %xmm9,%xmm8,%xmm9
   DB  196,66,121,51,192                   ; vpmovzxwd     %xmm8,%xmm8
   DB  196,67,61,24,193,1                  ; vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
-  DB  196,98,125,24,13,3,74,0,0           ; vbroadcastss  0x4a03(%rip),%ymm9        # 660c <_sk_callback_avx+0x235>
+  DB  196,98,125,24,13,4,74,0,0           ; vbroadcastss  0x4a04(%rip),%ymm9        # 6614 <_sk_callback_avx+0x235>
   DB  196,65,60,84,201                    ; vandps        %ymm9,%ymm8,%ymm9
   DB  196,65,124,91,201                   ; vcvtdq2ps     %ymm9,%ymm9
-  DB  196,98,125,24,21,244,73,0,0         ; vbroadcastss  0x49f4(%rip),%ymm10        # 6610 <_sk_callback_avx+0x239>
+  DB  196,98,125,24,21,245,73,0,0         ; vbroadcastss  0x49f5(%rip),%ymm10        # 6618 <_sk_callback_avx+0x239>
   DB  196,65,52,89,202                    ; vmulps        %ymm10,%ymm9,%ymm9
-  DB  196,98,125,24,21,234,73,0,0         ; vbroadcastss  0x49ea(%rip),%ymm10        # 6614 <_sk_callback_avx+0x23d>
+  DB  196,98,125,24,21,235,73,0,0         ; vbroadcastss  0x49eb(%rip),%ymm10        # 661c <_sk_callback_avx+0x23d>
   DB  196,65,60,84,210                    ; vandps        %ymm10,%ymm8,%ymm10
   DB  196,65,124,91,210                   ; vcvtdq2ps     %ymm10,%ymm10
-  DB  196,98,125,24,29,219,73,0,0         ; vbroadcastss  0x49db(%rip),%ymm11        # 6618 <_sk_callback_avx+0x241>
+  DB  196,98,125,24,29,220,73,0,0         ; vbroadcastss  0x49dc(%rip),%ymm11        # 6620 <_sk_callback_avx+0x241>
   DB  196,65,44,89,211                    ; vmulps        %ymm11,%ymm10,%ymm10
-  DB  196,98,125,24,29,209,73,0,0         ; vbroadcastss  0x49d1(%rip),%ymm11        # 661c <_sk_callback_avx+0x245>
+  DB  196,98,125,24,29,210,73,0,0         ; vbroadcastss  0x49d2(%rip),%ymm11        # 6624 <_sk_callback_avx+0x245>
   DB  196,65,60,84,195                    ; vandps        %ymm11,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,29,194,73,0,0         ; vbroadcastss  0x49c2(%rip),%ymm11        # 6620 <_sk_callback_avx+0x249>
+  DB  196,98,125,24,29,195,73,0,0         ; vbroadcastss  0x49c3(%rip),%ymm11        # 6628 <_sk_callback_avx+0x249>
   DB  196,65,60,89,195                    ; vmulps        %ymm11,%ymm8,%ymm8
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
@@ -6737,9 +6738,9 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  15,135,29,255,255,255               ; ja            1beb <_sk_lerp_565_avx+0x14>
+  DB  15,135,29,255,255,255               ; ja            1bf2 <_sk_lerp_565_avx+0x14>
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,75,0,0,0                  ; lea           0x4b(%rip),%r9        # 1d24 <_sk_lerp_565_avx+0x14d>
+  DB  76,141,13,76,0,0,0                  ; lea           0x4c(%rip),%r9        # 1d2c <_sk_lerp_565_avx+0x14e>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -6751,27 +6752,28 @@
   DB  196,65,57,196,68,122,4,2            ; vpinsrw       $0x2,0x4(%r10,%rdi,2),%xmm8,%xmm8
   DB  196,65,57,196,68,122,2,1            ; vpinsrw       $0x1,0x2(%r10,%rdi,2),%xmm8,%xmm8
   DB  196,65,57,196,4,122,0               ; vpinsrw       $0x0,(%r10,%rdi,2),%xmm8,%xmm8
-  DB  233,200,254,255,255                 ; jmpq          1beb <_sk_lerp_565_avx+0x14>
-  DB  144                                 ; nop
-  DB  243,255                             ; repz          (bad)
+  DB  233,200,254,255,255                 ; jmpq          1bf2 <_sk_lerp_565_avx+0x14>
+  DB  102,144                             ; xchg          %ax,%ax
+  DB  242,255                             ; repnz         (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  235,255                             ; jmp           1d29 <_sk_lerp_565_avx+0x152>
+  DB  234                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,227                             ; jmpq          *%rbx
+  DB  255                                 ; (bad)
+  DB  255,226                             ; jmpq          *%rdx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  219,255                             ; (bad)
+  DB  218,255                             ; (bad)
   DB  255                                 ; (bad)
-  DB  255,211                             ; callq         *%rbx
+  DB  255,210                             ; callq         *%rdx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,203                             ; dec           %ebx
+  DB  255,202                             ; dec           %edx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  190                                 ; .byte         0xbe
+  DB  189                                 ; .byte         0xbd
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; .byte         0xff
@@ -6781,7 +6783,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,26,2,0,0                     ; jne           1f68 <_sk_load_tables_avx+0x228>
+  DB  15,133,26,2,0,0                     ; jne           1f70 <_sk_load_tables_avx+0x228>
   DB  196,65,124,16,4,184                 ; vmovups       (%r8,%rdi,4),%ymm8
   DB  85                                  ; push          %rbp
   DB  65,87                               ; push          %r15
@@ -6789,7 +6791,7 @@
   DB  65,85                               ; push          %r13
   DB  65,84                               ; push          %r12
   DB  83                                  ; push          %rbx
-  DB  197,124,40,13,154,75,0,0            ; vmovaps       0x4b9a(%rip),%ymm9        # 6900 <_sk_callback_avx+0x529>
+  DB  197,124,40,13,146,75,0,0            ; vmovaps       0x4b92(%rip),%ymm9        # 6900 <_sk_callback_avx+0x521>
   DB  196,193,60,84,193                   ; vandps        %ymm9,%ymm8,%ymm0
   DB  196,193,249,126,193                 ; vmovq         %xmm0,%r9
   DB  69,137,203                          ; mov           %r9d,%r11d
@@ -6881,7 +6883,7 @@
   DB  196,193,97,114,210,24               ; vpsrld        $0x18,%xmm10,%xmm3
   DB  196,227,61,24,219,1                 ; vinsertf128   $0x1,%xmm3,%ymm8,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,207,70,0,0          ; vbroadcastss  0x46cf(%rip),%ymm8        # 6624 <_sk_callback_avx+0x24d>
+  DB  196,98,125,24,5,207,70,0,0          ; vbroadcastss  0x46cf(%rip),%ymm8        # 662c <_sk_callback_avx+0x24d>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
@@ -6896,9 +6898,9 @@
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,211,253,255,255              ; ja            1d54 <_sk_load_tables_avx+0x14>
+  DB  15,135,211,253,255,255              ; ja            1d5c <_sk_load_tables_avx+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,140,0,0,0                 ; lea           0x8c(%rip),%r10        # 2018 <_sk_load_tables_avx+0x2d8>
+  DB  76,141,21,140,0,0,0                 ; lea           0x8c(%rip),%r10        # 2020 <_sk_load_tables_avx+0x2d8>
   DB  79,99,12,138                        ; movslq        (%r10,%r9,4),%r9
   DB  77,1,209                            ; add           %r10,%r9
   DB  65,255,225                          ; jmpq          *%r9
@@ -6921,7 +6923,7 @@
   DB  196,99,61,12,192,15                 ; vblendps      $0xf,%ymm0,%ymm8,%ymm8
   DB  196,195,57,34,4,184,0               ; vpinsrd       $0x0,(%r8,%rdi,4),%xmm8,%xmm0
   DB  196,99,61,12,192,15                 ; vblendps      $0xf,%ymm0,%ymm8,%ymm8
-  DB  233,62,253,255,255                  ; jmpq          1d54 <_sk_load_tables_avx+0x14>
+  DB  233,62,253,255,255                  ; jmpq          1d5c <_sk_load_tables_avx+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  236                                 ; in            (%dx),%al
   DB  255                                 ; (bad)
@@ -6939,7 +6941,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  126,255                             ; jle           2031 <_sk_load_tables_avx+0x2f1>
+  DB  126,255                             ; jle           2039 <_sk_load_tables_avx+0x2f1>
   DB  255                                 ; (bad)
   DB  255                                 ; .byte         0xff
 
@@ -6949,7 +6951,7 @@
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  76,141,12,189,0,0,0,0               ; lea           0x0(,%rdi,4),%r9
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,113,2,0,0                    ; jne           22bb <_sk_load_tables_u16_be_avx+0x287>
+  DB  15,133,113,2,0,0                    ; jne           22c3 <_sk_load_tables_u16_be_avx+0x287>
   DB  196,1,121,16,4,72                   ; vmovupd       (%r8,%r9,2),%xmm8
   DB  196,129,121,16,84,72,16             ; vmovupd       0x10(%r8,%r9,2),%xmm2
   DB  196,129,121,16,92,72,32             ; vmovupd       0x20(%r8,%r9,2),%xmm3
@@ -6971,7 +6973,7 @@
   DB  197,177,108,208                     ; vpunpcklqdq   %xmm0,%xmm9,%xmm2
   DB  197,177,109,200                     ; vpunpckhqdq   %xmm0,%xmm9,%xmm1
   DB  196,65,57,108,212                   ; vpunpcklqdq   %xmm12,%xmm8,%xmm10
-  DB  197,121,111,29,218,72,0,0           ; vmovdqa       0x48da(%rip),%xmm11        # 6980 <_sk_callback_avx+0x5a9>
+  DB  197,121,111,29,210,72,0,0           ; vmovdqa       0x48d2(%rip),%xmm11        # 6980 <_sk_callback_avx+0x5a1>
   DB  196,193,105,219,195                 ; vpand         %xmm11,%xmm2,%xmm0
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  196,193,121,105,209                 ; vpunpckhwd    %xmm9,%xmm0,%xmm2
@@ -7070,7 +7072,7 @@
   DB  196,226,121,51,219                  ; vpmovzxwd     %xmm3,%xmm3
   DB  196,195,101,24,216,1                ; vinsertf128   $0x1,%xmm8,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,128,67,0,0          ; vbroadcastss  0x4380(%rip),%ymm8        # 6628 <_sk_callback_avx+0x251>
+  DB  196,98,125,24,5,128,67,0,0          ; vbroadcastss  0x4380(%rip),%ymm8        # 6630 <_sk_callback_avx+0x251>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
@@ -7083,29 +7085,29 @@
   DB  196,1,123,16,4,72                   ; vmovsd        (%r8,%r9,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  116,85                              ; je            2321 <_sk_load_tables_u16_be_avx+0x2ed>
+  DB  116,85                              ; je            2329 <_sk_load_tables_u16_be_avx+0x2ed>
   DB  196,1,57,22,68,72,8                 ; vmovhpd       0x8(%r8,%r9,2),%xmm8,%xmm8
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,72                              ; jb            2321 <_sk_load_tables_u16_be_avx+0x2ed>
+  DB  114,72                              ; jb            2329 <_sk_load_tables_u16_be_avx+0x2ed>
   DB  196,129,123,16,84,72,16             ; vmovsd        0x10(%r8,%r9,2),%xmm2
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  116,72                              ; je            232e <_sk_load_tables_u16_be_avx+0x2fa>
+  DB  116,72                              ; je            2336 <_sk_load_tables_u16_be_avx+0x2fa>
   DB  196,129,105,22,84,72,24             ; vmovhpd       0x18(%r8,%r9,2),%xmm2,%xmm2
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,59                              ; jb            232e <_sk_load_tables_u16_be_avx+0x2fa>
+  DB  114,59                              ; jb            2336 <_sk_load_tables_u16_be_avx+0x2fa>
   DB  196,129,123,16,92,72,32             ; vmovsd        0x20(%r8,%r9,2),%xmm3
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  15,132,97,253,255,255               ; je            2065 <_sk_load_tables_u16_be_avx+0x31>
+  DB  15,132,97,253,255,255               ; je            206d <_sk_load_tables_u16_be_avx+0x31>
   DB  196,129,97,22,92,72,40              ; vmovhpd       0x28(%r8,%r9,2),%xmm3,%xmm3
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  15,130,80,253,255,255               ; jb            2065 <_sk_load_tables_u16_be_avx+0x31>
+  DB  15,130,80,253,255,255               ; jb            206d <_sk_load_tables_u16_be_avx+0x31>
   DB  196,1,122,126,76,72,48              ; vmovq         0x30(%r8,%r9,2),%xmm9
-  DB  233,68,253,255,255                  ; jmpq          2065 <_sk_load_tables_u16_be_avx+0x31>
+  DB  233,68,253,255,255                  ; jmpq          206d <_sk_load_tables_u16_be_avx+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,55,253,255,255                  ; jmpq          2065 <_sk_load_tables_u16_be_avx+0x31>
+  DB  233,55,253,255,255                  ; jmpq          206d <_sk_load_tables_u16_be_avx+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,46,253,255,255                  ; jmpq          2065 <_sk_load_tables_u16_be_avx+0x31>
+  DB  233,46,253,255,255                  ; jmpq          206d <_sk_load_tables_u16_be_avx+0x31>
 
 PUBLIC _sk_load_tables_rgb_u16_be_avx
 _sk_load_tables_rgb_u16_be_avx LABEL PROC
@@ -7113,7 +7115,7 @@
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  76,141,12,127                       ; lea           (%rdi,%rdi,2),%r9
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,93,2,0,0                     ; jne           25a6 <_sk_load_tables_rgb_u16_be_avx+0x26f>
+  DB  15,133,93,2,0,0                     ; jne           25ae <_sk_load_tables_rgb_u16_be_avx+0x26f>
   DB  196,129,122,111,4,72                ; vmovdqu       (%r8,%r9,2),%xmm0
   DB  196,129,122,111,84,72,12            ; vmovdqu       0xc(%r8,%r9,2),%xmm2
   DB  196,129,122,111,76,72,24            ; vmovdqu       0x18(%r8,%r9,2),%xmm1
@@ -7140,7 +7142,7 @@
   DB  197,185,108,202                     ; vpunpcklqdq   %xmm2,%xmm8,%xmm1
   DB  197,185,109,210                     ; vpunpckhqdq   %xmm2,%xmm8,%xmm2
   DB  197,121,108,195                     ; vpunpcklqdq   %xmm3,%xmm0,%xmm8
-  DB  197,121,111,13,211,69,0,0           ; vmovdqa       0x45d3(%rip),%xmm9        # 6990 <_sk_callback_avx+0x5b9>
+  DB  197,121,111,13,203,69,0,0           ; vmovdqa       0x45cb(%rip),%xmm9        # 6990 <_sk_callback_avx+0x5b1>
   DB  196,193,113,219,193                 ; vpand         %xmm9,%xmm1,%xmm0
   DB  196,65,41,239,210                   ; vpxor         %xmm10,%xmm10,%xmm10
   DB  196,193,121,105,202                 ; vpunpckhwd    %xmm10,%xmm0,%xmm1
@@ -7232,7 +7234,7 @@
   DB  196,227,105,33,211,48               ; vinsertps     $0x30,%xmm3,%xmm2,%xmm2
   DB  196,195,109,24,208,1                ; vinsertf128   $0x1,%xmm8,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,146,64,0,0        ; vbroadcastss  0x4092(%rip),%ymm3        # 662c <_sk_callback_avx+0x255>
+  DB  196,226,125,24,29,146,64,0,0        ; vbroadcastss  0x4092(%rip),%ymm3        # 6634 <_sk_callback_avx+0x255>
   DB  91                                  ; pop           %rbx
   DB  65,92                               ; pop           %r12
   DB  65,93                               ; pop           %r13
@@ -7243,36 +7245,36 @@
   DB  196,129,121,110,4,72                ; vmovd         (%r8,%r9,2),%xmm0
   DB  196,129,121,196,68,72,4,2           ; vpinsrw       $0x2,0x4(%r8,%r9,2),%xmm0,%xmm0
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  117,5                               ; jne           25bf <_sk_load_tables_rgb_u16_be_avx+0x288>
-  DB  233,190,253,255,255                 ; jmpq          237d <_sk_load_tables_rgb_u16_be_avx+0x46>
+  DB  117,5                               ; jne           25c7 <_sk_load_tables_rgb_u16_be_avx+0x288>
+  DB  233,190,253,255,255                 ; jmpq          2385 <_sk_load_tables_rgb_u16_be_avx+0x46>
   DB  196,129,121,110,76,72,6             ; vmovd         0x6(%r8,%r9,2),%xmm1
   DB  196,1,113,196,68,72,10,2            ; vpinsrw       $0x2,0xa(%r8,%r9,2),%xmm1,%xmm8
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,26                              ; jb            25ee <_sk_load_tables_rgb_u16_be_avx+0x2b7>
+  DB  114,26                              ; jb            25f6 <_sk_load_tables_rgb_u16_be_avx+0x2b7>
   DB  196,129,121,110,76,72,12            ; vmovd         0xc(%r8,%r9,2),%xmm1
   DB  196,129,113,196,84,72,16,2          ; vpinsrw       $0x2,0x10(%r8,%r9,2),%xmm1,%xmm2
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  117,10                              ; jne           25f3 <_sk_load_tables_rgb_u16_be_avx+0x2bc>
-  DB  233,143,253,255,255                 ; jmpq          237d <_sk_load_tables_rgb_u16_be_avx+0x46>
-  DB  233,138,253,255,255                 ; jmpq          237d <_sk_load_tables_rgb_u16_be_avx+0x46>
+  DB  117,10                              ; jne           25fb <_sk_load_tables_rgb_u16_be_avx+0x2bc>
+  DB  233,143,253,255,255                 ; jmpq          2385 <_sk_load_tables_rgb_u16_be_avx+0x46>
+  DB  233,138,253,255,255                 ; jmpq          2385 <_sk_load_tables_rgb_u16_be_avx+0x46>
   DB  196,129,121,110,76,72,18            ; vmovd         0x12(%r8,%r9,2),%xmm1
   DB  196,1,113,196,76,72,22,2            ; vpinsrw       $0x2,0x16(%r8,%r9,2),%xmm1,%xmm9
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,26                              ; jb            2622 <_sk_load_tables_rgb_u16_be_avx+0x2eb>
+  DB  114,26                              ; jb            262a <_sk_load_tables_rgb_u16_be_avx+0x2eb>
   DB  196,129,121,110,76,72,24            ; vmovd         0x18(%r8,%r9,2),%xmm1
   DB  196,129,113,196,76,72,28,2          ; vpinsrw       $0x2,0x1c(%r8,%r9,2),%xmm1,%xmm1
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  117,10                              ; jne           2627 <_sk_load_tables_rgb_u16_be_avx+0x2f0>
-  DB  233,91,253,255,255                  ; jmpq          237d <_sk_load_tables_rgb_u16_be_avx+0x46>
-  DB  233,86,253,255,255                  ; jmpq          237d <_sk_load_tables_rgb_u16_be_avx+0x46>
+  DB  117,10                              ; jne           262f <_sk_load_tables_rgb_u16_be_avx+0x2f0>
+  DB  233,91,253,255,255                  ; jmpq          2385 <_sk_load_tables_rgb_u16_be_avx+0x46>
+  DB  233,86,253,255,255                  ; jmpq          2385 <_sk_load_tables_rgb_u16_be_avx+0x46>
   DB  196,129,121,110,92,72,30            ; vmovd         0x1e(%r8,%r9,2),%xmm3
   DB  196,1,97,196,92,72,34,2             ; vpinsrw       $0x2,0x22(%r8,%r9,2),%xmm3,%xmm11
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  114,20                              ; jb            2650 <_sk_load_tables_rgb_u16_be_avx+0x319>
+  DB  114,20                              ; jb            2658 <_sk_load_tables_rgb_u16_be_avx+0x319>
   DB  196,129,121,110,92,72,36            ; vmovd         0x24(%r8,%r9,2),%xmm3
   DB  196,129,97,196,92,72,40,2           ; vpinsrw       $0x2,0x28(%r8,%r9,2),%xmm3,%xmm3
-  DB  233,45,253,255,255                  ; jmpq          237d <_sk_load_tables_rgb_u16_be_avx+0x46>
-  DB  233,40,253,255,255                  ; jmpq          237d <_sk_load_tables_rgb_u16_be_avx+0x46>
+  DB  233,45,253,255,255                  ; jmpq          2385 <_sk_load_tables_rgb_u16_be_avx+0x46>
+  DB  233,40,253,255,255                  ; jmpq          2385 <_sk_load_tables_rgb_u16_be_avx+0x46>
 
 PUBLIC _sk_byte_tables_avx
 _sk_byte_tables_avx LABEL PROC
@@ -7283,7 +7285,7 @@
   DB  65,84                               ; push          %r12
   DB  83                                  ; push          %rbx
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,198,63,0,0          ; vbroadcastss  0x3fc6(%rip),%ymm8        # 6630 <_sk_callback_avx+0x259>
+  DB  196,98,125,24,5,198,63,0,0          ; vbroadcastss  0x3fc6(%rip),%ymm8        # 6638 <_sk_callback_avx+0x259>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  197,253,91,192                      ; vcvtps2dq     %ymm0,%ymm0
   DB  196,195,249,22,192,1                ; vpextrq       $0x1,%xmm0,%r8
@@ -7320,7 +7322,7 @@
   DB  196,226,121,49,192                  ; vpmovzxbd     %xmm0,%xmm0
   DB  196,227,53,24,192,1                 ; vinsertf128   $0x1,%xmm0,%ymm9,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,13,20,63,0,0          ; vbroadcastss  0x3f14(%rip),%ymm9        # 6634 <_sk_callback_avx+0x25d>
+  DB  196,98,125,24,13,20,63,0,0          ; vbroadcastss  0x3f14(%rip),%ymm9        # 663c <_sk_callback_avx+0x25d>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
   DB  197,253,91,201                      ; vcvtps2dq     %ymm1,%ymm1
@@ -7480,7 +7482,7 @@
   DB  196,226,121,49,192                  ; vpmovzxbd     %xmm0,%xmm0
   DB  196,227,53,24,192,1                 ; vinsertf128   $0x1,%xmm0,%ymm9,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,13,58,60,0,0          ; vbroadcastss  0x3c3a(%rip),%ymm9        # 6638 <_sk_callback_avx+0x261>
+  DB  196,98,125,24,13,58,60,0,0          ; vbroadcastss  0x3c3a(%rip),%ymm9        # 6640 <_sk_callback_avx+0x261>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
   DB  197,253,91,201                      ; vcvtps2dq     %ymm1,%ymm1
@@ -7767,36 +7769,36 @@
   DB  196,193,124,88,195                  ; vaddps        %ymm11,%ymm0,%ymm0
   DB  196,98,125,24,16                    ; vbroadcastss  (%rax),%ymm10
   DB  197,124,91,216                      ; vcvtdq2ps     %ymm0,%ymm11
-  DB  196,98,125,24,37,152,55,0,0         ; vbroadcastss  0x3798(%rip),%ymm12        # 663c <_sk_callback_avx+0x265>
+  DB  196,98,125,24,37,152,55,0,0         ; vbroadcastss  0x3798(%rip),%ymm12        # 6644 <_sk_callback_avx+0x265>
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,142,55,0,0         ; vbroadcastss  0x378e(%rip),%ymm12        # 6640 <_sk_callback_avx+0x269>
+  DB  196,98,125,24,37,142,55,0,0         ; vbroadcastss  0x378e(%rip),%ymm12        # 6648 <_sk_callback_avx+0x269>
   DB  196,193,124,84,196                  ; vandps        %ymm12,%ymm0,%ymm0
-  DB  196,98,125,24,37,132,55,0,0         ; vbroadcastss  0x3784(%rip),%ymm12        # 6644 <_sk_callback_avx+0x26d>
+  DB  196,98,125,24,37,132,55,0,0         ; vbroadcastss  0x3784(%rip),%ymm12        # 664c <_sk_callback_avx+0x26d>
   DB  196,193,124,86,196                  ; vorps         %ymm12,%ymm0,%ymm0
-  DB  196,98,125,24,37,122,55,0,0         ; vbroadcastss  0x377a(%rip),%ymm12        # 6648 <_sk_callback_avx+0x271>
+  DB  196,98,125,24,37,122,55,0,0         ; vbroadcastss  0x377a(%rip),%ymm12        # 6650 <_sk_callback_avx+0x271>
   DB  196,65,36,88,220                    ; vaddps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,112,55,0,0         ; vbroadcastss  0x3770(%rip),%ymm12        # 664c <_sk_callback_avx+0x275>
+  DB  196,98,125,24,37,112,55,0,0         ; vbroadcastss  0x3770(%rip),%ymm12        # 6654 <_sk_callback_avx+0x275>
   DB  196,65,124,89,228                   ; vmulps        %ymm12,%ymm0,%ymm12
   DB  196,65,36,92,220                    ; vsubps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,97,55,0,0          ; vbroadcastss  0x3761(%rip),%ymm12        # 6650 <_sk_callback_avx+0x279>
+  DB  196,98,125,24,37,97,55,0,0          ; vbroadcastss  0x3761(%rip),%ymm12        # 6658 <_sk_callback_avx+0x279>
   DB  196,193,124,88,196                  ; vaddps        %ymm12,%ymm0,%ymm0
-  DB  196,98,125,24,37,87,55,0,0          ; vbroadcastss  0x3757(%rip),%ymm12        # 6654 <_sk_callback_avx+0x27d>
+  DB  196,98,125,24,37,87,55,0,0          ; vbroadcastss  0x3757(%rip),%ymm12        # 665c <_sk_callback_avx+0x27d>
   DB  197,156,94,192                      ; vdivps        %ymm0,%ymm12,%ymm0
   DB  197,164,92,192                      ; vsubps        %ymm0,%ymm11,%ymm0
   DB  197,172,89,192                      ; vmulps        %ymm0,%ymm10,%ymm0
   DB  196,99,125,8,208,1                  ; vroundps      $0x1,%ymm0,%ymm10
   DB  196,65,124,92,210                   ; vsubps        %ymm10,%ymm0,%ymm10
-  DB  196,98,125,24,29,59,55,0,0          ; vbroadcastss  0x373b(%rip),%ymm11        # 6658 <_sk_callback_avx+0x281>
+  DB  196,98,125,24,29,59,55,0,0          ; vbroadcastss  0x373b(%rip),%ymm11        # 6660 <_sk_callback_avx+0x281>
   DB  196,193,124,88,195                  ; vaddps        %ymm11,%ymm0,%ymm0
-  DB  196,98,125,24,29,49,55,0,0          ; vbroadcastss  0x3731(%rip),%ymm11        # 665c <_sk_callback_avx+0x285>
+  DB  196,98,125,24,29,49,55,0,0          ; vbroadcastss  0x3731(%rip),%ymm11        # 6664 <_sk_callback_avx+0x285>
   DB  196,65,44,89,219                    ; vmulps        %ymm11,%ymm10,%ymm11
   DB  196,193,124,92,195                  ; vsubps        %ymm11,%ymm0,%ymm0
-  DB  196,98,125,24,29,34,55,0,0          ; vbroadcastss  0x3722(%rip),%ymm11        # 6660 <_sk_callback_avx+0x289>
+  DB  196,98,125,24,29,34,55,0,0          ; vbroadcastss  0x3722(%rip),%ymm11        # 6668 <_sk_callback_avx+0x289>
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
-  DB  196,98,125,24,29,24,55,0,0          ; vbroadcastss  0x3718(%rip),%ymm11        # 6664 <_sk_callback_avx+0x28d>
+  DB  196,98,125,24,29,24,55,0,0          ; vbroadcastss  0x3718(%rip),%ymm11        # 666c <_sk_callback_avx+0x28d>
   DB  196,65,36,94,210                    ; vdivps        %ymm10,%ymm11,%ymm10
   DB  196,193,124,88,194                  ; vaddps        %ymm10,%ymm0,%ymm0
-  DB  196,98,125,24,21,9,55,0,0           ; vbroadcastss  0x3709(%rip),%ymm10        # 6668 <_sk_callback_avx+0x291>
+  DB  196,98,125,24,21,9,55,0,0           ; vbroadcastss  0x3709(%rip),%ymm10        # 6670 <_sk_callback_avx+0x291>
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  197,253,91,192                      ; vcvtps2dq     %ymm0,%ymm0
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -7804,7 +7806,7 @@
   DB  196,195,125,74,193,128              ; vblendvps     %ymm8,%ymm9,%ymm0,%ymm0
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,124,95,192                  ; vmaxps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,224,54,0,0          ; vbroadcastss  0x36e0(%rip),%ymm8        # 666c <_sk_callback_avx+0x295>
+  DB  196,98,125,24,5,224,54,0,0          ; vbroadcastss  0x36e0(%rip),%ymm8        # 6674 <_sk_callback_avx+0x295>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -7824,36 +7826,36 @@
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
   DB  196,98,125,24,16                    ; vbroadcastss  (%rax),%ymm10
   DB  197,124,91,217                      ; vcvtdq2ps     %ymm1,%ymm11
-  DB  196,98,125,24,37,145,54,0,0         ; vbroadcastss  0x3691(%rip),%ymm12        # 6670 <_sk_callback_avx+0x299>
+  DB  196,98,125,24,37,145,54,0,0         ; vbroadcastss  0x3691(%rip),%ymm12        # 6678 <_sk_callback_avx+0x299>
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,135,54,0,0         ; vbroadcastss  0x3687(%rip),%ymm12        # 6674 <_sk_callback_avx+0x29d>
+  DB  196,98,125,24,37,135,54,0,0         ; vbroadcastss  0x3687(%rip),%ymm12        # 667c <_sk_callback_avx+0x29d>
   DB  196,193,116,84,204                  ; vandps        %ymm12,%ymm1,%ymm1
-  DB  196,98,125,24,37,125,54,0,0         ; vbroadcastss  0x367d(%rip),%ymm12        # 6678 <_sk_callback_avx+0x2a1>
+  DB  196,98,125,24,37,125,54,0,0         ; vbroadcastss  0x367d(%rip),%ymm12        # 6680 <_sk_callback_avx+0x2a1>
   DB  196,193,116,86,204                  ; vorps         %ymm12,%ymm1,%ymm1
-  DB  196,98,125,24,37,115,54,0,0         ; vbroadcastss  0x3673(%rip),%ymm12        # 667c <_sk_callback_avx+0x2a5>
+  DB  196,98,125,24,37,115,54,0,0         ; vbroadcastss  0x3673(%rip),%ymm12        # 6684 <_sk_callback_avx+0x2a5>
   DB  196,65,36,88,220                    ; vaddps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,105,54,0,0         ; vbroadcastss  0x3669(%rip),%ymm12        # 6680 <_sk_callback_avx+0x2a9>
+  DB  196,98,125,24,37,105,54,0,0         ; vbroadcastss  0x3669(%rip),%ymm12        # 6688 <_sk_callback_avx+0x2a9>
   DB  196,65,116,89,228                   ; vmulps        %ymm12,%ymm1,%ymm12
   DB  196,65,36,92,220                    ; vsubps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,90,54,0,0          ; vbroadcastss  0x365a(%rip),%ymm12        # 6684 <_sk_callback_avx+0x2ad>
+  DB  196,98,125,24,37,90,54,0,0          ; vbroadcastss  0x365a(%rip),%ymm12        # 668c <_sk_callback_avx+0x2ad>
   DB  196,193,116,88,204                  ; vaddps        %ymm12,%ymm1,%ymm1
-  DB  196,98,125,24,37,80,54,0,0          ; vbroadcastss  0x3650(%rip),%ymm12        # 6688 <_sk_callback_avx+0x2b1>
+  DB  196,98,125,24,37,80,54,0,0          ; vbroadcastss  0x3650(%rip),%ymm12        # 6690 <_sk_callback_avx+0x2b1>
   DB  197,156,94,201                      ; vdivps        %ymm1,%ymm12,%ymm1
   DB  197,164,92,201                      ; vsubps        %ymm1,%ymm11,%ymm1
   DB  197,172,89,201                      ; vmulps        %ymm1,%ymm10,%ymm1
   DB  196,99,125,8,209,1                  ; vroundps      $0x1,%ymm1,%ymm10
   DB  196,65,116,92,210                   ; vsubps        %ymm10,%ymm1,%ymm10
-  DB  196,98,125,24,29,52,54,0,0          ; vbroadcastss  0x3634(%rip),%ymm11        # 668c <_sk_callback_avx+0x2b5>
+  DB  196,98,125,24,29,52,54,0,0          ; vbroadcastss  0x3634(%rip),%ymm11        # 6694 <_sk_callback_avx+0x2b5>
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,42,54,0,0          ; vbroadcastss  0x362a(%rip),%ymm11        # 6690 <_sk_callback_avx+0x2b9>
+  DB  196,98,125,24,29,42,54,0,0          ; vbroadcastss  0x362a(%rip),%ymm11        # 6698 <_sk_callback_avx+0x2b9>
   DB  196,65,44,89,219                    ; vmulps        %ymm11,%ymm10,%ymm11
   DB  196,193,116,92,203                  ; vsubps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,27,54,0,0          ; vbroadcastss  0x361b(%rip),%ymm11        # 6694 <_sk_callback_avx+0x2bd>
+  DB  196,98,125,24,29,27,54,0,0          ; vbroadcastss  0x361b(%rip),%ymm11        # 669c <_sk_callback_avx+0x2bd>
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
-  DB  196,98,125,24,29,17,54,0,0          ; vbroadcastss  0x3611(%rip),%ymm11        # 6698 <_sk_callback_avx+0x2c1>
+  DB  196,98,125,24,29,17,54,0,0          ; vbroadcastss  0x3611(%rip),%ymm11        # 66a0 <_sk_callback_avx+0x2c1>
   DB  196,65,36,94,210                    ; vdivps        %ymm10,%ymm11,%ymm10
   DB  196,193,116,88,202                  ; vaddps        %ymm10,%ymm1,%ymm1
-  DB  196,98,125,24,21,2,54,0,0           ; vbroadcastss  0x3602(%rip),%ymm10        # 669c <_sk_callback_avx+0x2c5>
+  DB  196,98,125,24,21,2,54,0,0           ; vbroadcastss  0x3602(%rip),%ymm10        # 66a4 <_sk_callback_avx+0x2c5>
   DB  196,193,116,89,202                  ; vmulps        %ymm10,%ymm1,%ymm1
   DB  197,253,91,201                      ; vcvtps2dq     %ymm1,%ymm1
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -7861,7 +7863,7 @@
   DB  196,195,117,74,201,128              ; vblendvps     %ymm8,%ymm9,%ymm1,%ymm1
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,116,95,200                  ; vmaxps        %ymm8,%ymm1,%ymm1
-  DB  196,98,125,24,5,217,53,0,0          ; vbroadcastss  0x35d9(%rip),%ymm8        # 66a0 <_sk_callback_avx+0x2c9>
+  DB  196,98,125,24,5,217,53,0,0          ; vbroadcastss  0x35d9(%rip),%ymm8        # 66a8 <_sk_callback_avx+0x2c9>
   DB  196,193,116,93,200                  ; vminps        %ymm8,%ymm1,%ymm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -7881,36 +7883,36 @@
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
   DB  196,98,125,24,16                    ; vbroadcastss  (%rax),%ymm10
   DB  197,124,91,218                      ; vcvtdq2ps     %ymm2,%ymm11
-  DB  196,98,125,24,37,138,53,0,0         ; vbroadcastss  0x358a(%rip),%ymm12        # 66a4 <_sk_callback_avx+0x2cd>
+  DB  196,98,125,24,37,138,53,0,0         ; vbroadcastss  0x358a(%rip),%ymm12        # 66ac <_sk_callback_avx+0x2cd>
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,128,53,0,0         ; vbroadcastss  0x3580(%rip),%ymm12        # 66a8 <_sk_callback_avx+0x2d1>
+  DB  196,98,125,24,37,128,53,0,0         ; vbroadcastss  0x3580(%rip),%ymm12        # 66b0 <_sk_callback_avx+0x2d1>
   DB  196,193,108,84,212                  ; vandps        %ymm12,%ymm2,%ymm2
-  DB  196,98,125,24,37,118,53,0,0         ; vbroadcastss  0x3576(%rip),%ymm12        # 66ac <_sk_callback_avx+0x2d5>
+  DB  196,98,125,24,37,118,53,0,0         ; vbroadcastss  0x3576(%rip),%ymm12        # 66b4 <_sk_callback_avx+0x2d5>
   DB  196,193,108,86,212                  ; vorps         %ymm12,%ymm2,%ymm2
-  DB  196,98,125,24,37,108,53,0,0         ; vbroadcastss  0x356c(%rip),%ymm12        # 66b0 <_sk_callback_avx+0x2d9>
+  DB  196,98,125,24,37,108,53,0,0         ; vbroadcastss  0x356c(%rip),%ymm12        # 66b8 <_sk_callback_avx+0x2d9>
   DB  196,65,36,88,220                    ; vaddps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,98,53,0,0          ; vbroadcastss  0x3562(%rip),%ymm12        # 66b4 <_sk_callback_avx+0x2dd>
+  DB  196,98,125,24,37,98,53,0,0          ; vbroadcastss  0x3562(%rip),%ymm12        # 66bc <_sk_callback_avx+0x2dd>
   DB  196,65,108,89,228                   ; vmulps        %ymm12,%ymm2,%ymm12
   DB  196,65,36,92,220                    ; vsubps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,83,53,0,0          ; vbroadcastss  0x3553(%rip),%ymm12        # 66b8 <_sk_callback_avx+0x2e1>
+  DB  196,98,125,24,37,83,53,0,0          ; vbroadcastss  0x3553(%rip),%ymm12        # 66c0 <_sk_callback_avx+0x2e1>
   DB  196,193,108,88,212                  ; vaddps        %ymm12,%ymm2,%ymm2
-  DB  196,98,125,24,37,73,53,0,0          ; vbroadcastss  0x3549(%rip),%ymm12        # 66bc <_sk_callback_avx+0x2e5>
+  DB  196,98,125,24,37,73,53,0,0          ; vbroadcastss  0x3549(%rip),%ymm12        # 66c4 <_sk_callback_avx+0x2e5>
   DB  197,156,94,210                      ; vdivps        %ymm2,%ymm12,%ymm2
   DB  197,164,92,210                      ; vsubps        %ymm2,%ymm11,%ymm2
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  196,99,125,8,210,1                  ; vroundps      $0x1,%ymm2,%ymm10
   DB  196,65,108,92,210                   ; vsubps        %ymm10,%ymm2,%ymm10
-  DB  196,98,125,24,29,45,53,0,0          ; vbroadcastss  0x352d(%rip),%ymm11        # 66c0 <_sk_callback_avx+0x2e9>
+  DB  196,98,125,24,29,45,53,0,0          ; vbroadcastss  0x352d(%rip),%ymm11        # 66c8 <_sk_callback_avx+0x2e9>
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
-  DB  196,98,125,24,29,35,53,0,0          ; vbroadcastss  0x3523(%rip),%ymm11        # 66c4 <_sk_callback_avx+0x2ed>
+  DB  196,98,125,24,29,35,53,0,0          ; vbroadcastss  0x3523(%rip),%ymm11        # 66cc <_sk_callback_avx+0x2ed>
   DB  196,65,44,89,219                    ; vmulps        %ymm11,%ymm10,%ymm11
   DB  196,193,108,92,211                  ; vsubps        %ymm11,%ymm2,%ymm2
-  DB  196,98,125,24,29,20,53,0,0          ; vbroadcastss  0x3514(%rip),%ymm11        # 66c8 <_sk_callback_avx+0x2f1>
+  DB  196,98,125,24,29,20,53,0,0          ; vbroadcastss  0x3514(%rip),%ymm11        # 66d0 <_sk_callback_avx+0x2f1>
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
-  DB  196,98,125,24,29,10,53,0,0          ; vbroadcastss  0x350a(%rip),%ymm11        # 66cc <_sk_callback_avx+0x2f5>
+  DB  196,98,125,24,29,10,53,0,0          ; vbroadcastss  0x350a(%rip),%ymm11        # 66d4 <_sk_callback_avx+0x2f5>
   DB  196,65,36,94,210                    ; vdivps        %ymm10,%ymm11,%ymm10
   DB  196,193,108,88,210                  ; vaddps        %ymm10,%ymm2,%ymm2
-  DB  196,98,125,24,21,251,52,0,0         ; vbroadcastss  0x34fb(%rip),%ymm10        # 66d0 <_sk_callback_avx+0x2f9>
+  DB  196,98,125,24,21,251,52,0,0         ; vbroadcastss  0x34fb(%rip),%ymm10        # 66d8 <_sk_callback_avx+0x2f9>
   DB  196,193,108,89,210                  ; vmulps        %ymm10,%ymm2,%ymm2
   DB  197,253,91,210                      ; vcvtps2dq     %ymm2,%ymm2
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -7918,7 +7920,7 @@
   DB  196,195,109,74,209,128              ; vblendvps     %ymm8,%ymm9,%ymm2,%ymm2
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,108,95,208                  ; vmaxps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,210,52,0,0          ; vbroadcastss  0x34d2(%rip),%ymm8        # 66d4 <_sk_callback_avx+0x2fd>
+  DB  196,98,125,24,5,210,52,0,0          ; vbroadcastss  0x34d2(%rip),%ymm8        # 66dc <_sk_callback_avx+0x2fd>
   DB  196,193,108,93,208                  ; vminps        %ymm8,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -7938,36 +7940,36 @@
   DB  196,193,100,88,219                  ; vaddps        %ymm11,%ymm3,%ymm3
   DB  196,98,125,24,16                    ; vbroadcastss  (%rax),%ymm10
   DB  197,124,91,219                      ; vcvtdq2ps     %ymm3,%ymm11
-  DB  196,98,125,24,37,131,52,0,0         ; vbroadcastss  0x3483(%rip),%ymm12        # 66d8 <_sk_callback_avx+0x301>
+  DB  196,98,125,24,37,131,52,0,0         ; vbroadcastss  0x3483(%rip),%ymm12        # 66e0 <_sk_callback_avx+0x301>
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,121,52,0,0         ; vbroadcastss  0x3479(%rip),%ymm12        # 66dc <_sk_callback_avx+0x305>
+  DB  196,98,125,24,37,121,52,0,0         ; vbroadcastss  0x3479(%rip),%ymm12        # 66e4 <_sk_callback_avx+0x305>
   DB  196,193,100,84,220                  ; vandps        %ymm12,%ymm3,%ymm3
-  DB  196,98,125,24,37,111,52,0,0         ; vbroadcastss  0x346f(%rip),%ymm12        # 66e0 <_sk_callback_avx+0x309>
+  DB  196,98,125,24,37,111,52,0,0         ; vbroadcastss  0x346f(%rip),%ymm12        # 66e8 <_sk_callback_avx+0x309>
   DB  196,193,100,86,220                  ; vorps         %ymm12,%ymm3,%ymm3
-  DB  196,98,125,24,37,101,52,0,0         ; vbroadcastss  0x3465(%rip),%ymm12        # 66e4 <_sk_callback_avx+0x30d>
+  DB  196,98,125,24,37,101,52,0,0         ; vbroadcastss  0x3465(%rip),%ymm12        # 66ec <_sk_callback_avx+0x30d>
   DB  196,65,36,88,220                    ; vaddps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,91,52,0,0          ; vbroadcastss  0x345b(%rip),%ymm12        # 66e8 <_sk_callback_avx+0x311>
+  DB  196,98,125,24,37,91,52,0,0          ; vbroadcastss  0x345b(%rip),%ymm12        # 66f0 <_sk_callback_avx+0x311>
   DB  196,65,100,89,228                   ; vmulps        %ymm12,%ymm3,%ymm12
   DB  196,65,36,92,220                    ; vsubps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,76,52,0,0          ; vbroadcastss  0x344c(%rip),%ymm12        # 66ec <_sk_callback_avx+0x315>
+  DB  196,98,125,24,37,76,52,0,0          ; vbroadcastss  0x344c(%rip),%ymm12        # 66f4 <_sk_callback_avx+0x315>
   DB  196,193,100,88,220                  ; vaddps        %ymm12,%ymm3,%ymm3
-  DB  196,98,125,24,37,66,52,0,0          ; vbroadcastss  0x3442(%rip),%ymm12        # 66f0 <_sk_callback_avx+0x319>
+  DB  196,98,125,24,37,66,52,0,0          ; vbroadcastss  0x3442(%rip),%ymm12        # 66f8 <_sk_callback_avx+0x319>
   DB  197,156,94,219                      ; vdivps        %ymm3,%ymm12,%ymm3
   DB  197,164,92,219                      ; vsubps        %ymm3,%ymm11,%ymm3
   DB  197,172,89,219                      ; vmulps        %ymm3,%ymm10,%ymm3
   DB  196,99,125,8,211,1                  ; vroundps      $0x1,%ymm3,%ymm10
   DB  196,65,100,92,210                   ; vsubps        %ymm10,%ymm3,%ymm10
-  DB  196,98,125,24,29,38,52,0,0          ; vbroadcastss  0x3426(%rip),%ymm11        # 66f4 <_sk_callback_avx+0x31d>
+  DB  196,98,125,24,29,38,52,0,0          ; vbroadcastss  0x3426(%rip),%ymm11        # 66fc <_sk_callback_avx+0x31d>
   DB  196,193,100,88,219                  ; vaddps        %ymm11,%ymm3,%ymm3
-  DB  196,98,125,24,29,28,52,0,0          ; vbroadcastss  0x341c(%rip),%ymm11        # 66f8 <_sk_callback_avx+0x321>
+  DB  196,98,125,24,29,28,52,0,0          ; vbroadcastss  0x341c(%rip),%ymm11        # 6700 <_sk_callback_avx+0x321>
   DB  196,65,44,89,219                    ; vmulps        %ymm11,%ymm10,%ymm11
   DB  196,193,100,92,219                  ; vsubps        %ymm11,%ymm3,%ymm3
-  DB  196,98,125,24,29,13,52,0,0          ; vbroadcastss  0x340d(%rip),%ymm11        # 66fc <_sk_callback_avx+0x325>
+  DB  196,98,125,24,29,13,52,0,0          ; vbroadcastss  0x340d(%rip),%ymm11        # 6704 <_sk_callback_avx+0x325>
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
-  DB  196,98,125,24,29,3,52,0,0           ; vbroadcastss  0x3403(%rip),%ymm11        # 6700 <_sk_callback_avx+0x329>
+  DB  196,98,125,24,29,3,52,0,0           ; vbroadcastss  0x3403(%rip),%ymm11        # 6708 <_sk_callback_avx+0x329>
   DB  196,65,36,94,210                    ; vdivps        %ymm10,%ymm11,%ymm10
   DB  196,193,100,88,218                  ; vaddps        %ymm10,%ymm3,%ymm3
-  DB  196,98,125,24,21,244,51,0,0         ; vbroadcastss  0x33f4(%rip),%ymm10        # 6704 <_sk_callback_avx+0x32d>
+  DB  196,98,125,24,21,244,51,0,0         ; vbroadcastss  0x33f4(%rip),%ymm10        # 670c <_sk_callback_avx+0x32d>
   DB  196,193,100,89,218                  ; vmulps        %ymm10,%ymm3,%ymm3
   DB  197,253,91,219                      ; vcvtps2dq     %ymm3,%ymm3
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -7975,38 +7977,38 @@
   DB  196,195,101,74,217,128              ; vblendvps     %ymm8,%ymm9,%ymm3,%ymm3
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,100,95,216                  ; vmaxps        %ymm8,%ymm3,%ymm3
-  DB  196,98,125,24,5,203,51,0,0          ; vbroadcastss  0x33cb(%rip),%ymm8        # 6708 <_sk_callback_avx+0x331>
+  DB  196,98,125,24,5,203,51,0,0          ; vbroadcastss  0x33cb(%rip),%ymm8        # 6710 <_sk_callback_avx+0x331>
   DB  196,193,100,93,216                  ; vminps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_lab_to_xyz_avx
 _sk_lab_to_xyz_avx LABEL PROC
-  DB  196,98,125,24,5,189,51,0,0          ; vbroadcastss  0x33bd(%rip),%ymm8        # 670c <_sk_callback_avx+0x335>
+  DB  196,98,125,24,5,189,51,0,0          ; vbroadcastss  0x33bd(%rip),%ymm8        # 6714 <_sk_callback_avx+0x335>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,179,51,0,0          ; vbroadcastss  0x33b3(%rip),%ymm8        # 6710 <_sk_callback_avx+0x339>
+  DB  196,98,125,24,5,179,51,0,0          ; vbroadcastss  0x33b3(%rip),%ymm8        # 6718 <_sk_callback_avx+0x339>
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
-  DB  196,98,125,24,13,169,51,0,0         ; vbroadcastss  0x33a9(%rip),%ymm9        # 6714 <_sk_callback_avx+0x33d>
+  DB  196,98,125,24,13,169,51,0,0         ; vbroadcastss  0x33a9(%rip),%ymm9        # 671c <_sk_callback_avx+0x33d>
   DB  196,193,116,88,201                  ; vaddps        %ymm9,%ymm1,%ymm1
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  196,193,108,88,209                  ; vaddps        %ymm9,%ymm2,%ymm2
-  DB  196,98,125,24,5,149,51,0,0          ; vbroadcastss  0x3395(%rip),%ymm8        # 6718 <_sk_callback_avx+0x341>
+  DB  196,98,125,24,5,149,51,0,0          ; vbroadcastss  0x3395(%rip),%ymm8        # 6720 <_sk_callback_avx+0x341>
   DB  196,193,124,88,192                  ; vaddps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,139,51,0,0          ; vbroadcastss  0x338b(%rip),%ymm8        # 671c <_sk_callback_avx+0x345>
+  DB  196,98,125,24,5,139,51,0,0          ; vbroadcastss  0x338b(%rip),%ymm8        # 6724 <_sk_callback_avx+0x345>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,129,51,0,0          ; vbroadcastss  0x3381(%rip),%ymm8        # 6720 <_sk_callback_avx+0x349>
+  DB  196,98,125,24,5,129,51,0,0          ; vbroadcastss  0x3381(%rip),%ymm8        # 6728 <_sk_callback_avx+0x349>
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
   DB  197,252,88,201                      ; vaddps        %ymm1,%ymm0,%ymm1
-  DB  196,98,125,24,5,115,51,0,0          ; vbroadcastss  0x3373(%rip),%ymm8        # 6724 <_sk_callback_avx+0x34d>
+  DB  196,98,125,24,5,115,51,0,0          ; vbroadcastss  0x3373(%rip),%ymm8        # 672c <_sk_callback_avx+0x34d>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  197,252,92,210                      ; vsubps        %ymm2,%ymm0,%ymm2
   DB  197,116,89,193                      ; vmulps        %ymm1,%ymm1,%ymm8
   DB  196,65,116,89,192                   ; vmulps        %ymm8,%ymm1,%ymm8
-  DB  196,98,125,24,13,92,51,0,0          ; vbroadcastss  0x335c(%rip),%ymm9        # 6728 <_sk_callback_avx+0x351>
+  DB  196,98,125,24,13,92,51,0,0          ; vbroadcastss  0x335c(%rip),%ymm9        # 6730 <_sk_callback_avx+0x351>
   DB  196,65,52,194,208,1                 ; vcmpltps      %ymm8,%ymm9,%ymm10
-  DB  196,98,125,24,29,81,51,0,0          ; vbroadcastss  0x3351(%rip),%ymm11        # 672c <_sk_callback_avx+0x355>
+  DB  196,98,125,24,29,81,51,0,0          ; vbroadcastss  0x3351(%rip),%ymm11        # 6734 <_sk_callback_avx+0x355>
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,37,71,51,0,0          ; vbroadcastss  0x3347(%rip),%ymm12        # 6730 <_sk_callback_avx+0x359>
+  DB  196,98,125,24,37,71,51,0,0          ; vbroadcastss  0x3347(%rip),%ymm12        # 6738 <_sk_callback_avx+0x359>
   DB  196,193,116,89,204                  ; vmulps        %ymm12,%ymm1,%ymm1
   DB  196,67,117,74,192,160               ; vblendvps     %ymm10,%ymm8,%ymm1,%ymm8
   DB  197,252,89,200                      ; vmulps        %ymm0,%ymm0,%ymm1
@@ -8021,9 +8023,9 @@
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
   DB  196,193,108,89,212                  ; vmulps        %ymm12,%ymm2,%ymm2
   DB  196,227,109,74,208,144              ; vblendvps     %ymm9,%ymm0,%ymm2,%ymm2
-  DB  196,226,125,24,5,253,50,0,0         ; vbroadcastss  0x32fd(%rip),%ymm0        # 6734 <_sk_callback_avx+0x35d>
+  DB  196,226,125,24,5,253,50,0,0         ; vbroadcastss  0x32fd(%rip),%ymm0        # 673c <_sk_callback_avx+0x35d>
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
-  DB  196,98,125,24,5,244,50,0,0          ; vbroadcastss  0x32f4(%rip),%ymm8        # 6738 <_sk_callback_avx+0x361>
+  DB  196,98,125,24,5,244,50,0,0          ; vbroadcastss  0x32f4(%rip),%ymm8        # 6740 <_sk_callback_avx+0x361>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8035,14 +8037,14 @@
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  72,1,248                            ; add           %rdi,%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,62                              ; jne           349b <_sk_load_a8_avx+0x4e>
+  DB  117,62                              ; jne           34a3 <_sk_load_a8_avx+0x4e>
   DB  197,250,126,0                       ; vmovq         (%rax),%xmm0
   DB  196,226,121,49,200                  ; vpmovzxbd     %xmm0,%xmm1
   DB  196,227,121,4,192,229               ; vpermilps     $0xe5,%xmm0,%xmm0
   DB  196,226,121,49,192                  ; vpmovzxbd     %xmm0,%xmm0
   DB  196,227,117,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,184,50,0,0        ; vbroadcastss  0x32b8(%rip),%ymm1        # 673c <_sk_callback_avx+0x365>
+  DB  196,226,125,24,13,184,50,0,0        ; vbroadcastss  0x32b8(%rip),%ymm1        # 6744 <_sk_callback_avx+0x365>
   DB  197,252,89,217                      ; vmulps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -8059,9 +8061,9 @@
   DB  77,9,217                            ; or            %r11,%r9
   DB  72,131,193,8                        ; add           $0x8,%rcx
   DB  73,255,202                          ; dec           %r10
-  DB  117,234                             ; jne           34a3 <_sk_load_a8_avx+0x56>
+  DB  117,234                             ; jne           34ab <_sk_load_a8_avx+0x56>
   DB  196,193,249,110,193                 ; vmovq         %r9,%xmm0
-  DB  235,161                             ; jmp           3461 <_sk_load_a8_avx+0x14>
+  DB  235,161                             ; jmp           3469 <_sk_load_a8_avx+0x14>
 
 PUBLIC _sk_gather_a8_avx
 _sk_gather_a8_avx LABEL PROC
@@ -8109,7 +8111,7 @@
   DB  196,226,121,49,201                  ; vpmovzxbd     %xmm1,%xmm1
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,173,49,0,0        ; vbroadcastss  0x31ad(%rip),%ymm1        # 6740 <_sk_callback_avx+0x369>
+  DB  196,226,125,24,13,173,49,0,0        ; vbroadcastss  0x31ad(%rip),%ymm1        # 6748 <_sk_callback_avx+0x369>
   DB  197,252,89,217                      ; vmulps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -8125,14 +8127,14 @@
 _sk_store_a8_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  196,98,125,24,5,136,49,0,0          ; vbroadcastss  0x3188(%rip),%ymm8        # 6744 <_sk_callback_avx+0x36d>
+  DB  196,98,125,24,5,136,49,0,0          ; vbroadcastss  0x3188(%rip),%ymm8        # 674c <_sk_callback_avx+0x36d>
   DB  196,65,100,89,192                   ; vmulps        %ymm8,%ymm3,%ymm8
   DB  196,65,125,91,192                   ; vcvtps2dq     %ymm8,%ymm8
   DB  196,67,125,25,193,1                 ; vextractf128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  196,65,57,103,192                   ; vpackuswb     %xmm8,%xmm8,%xmm8
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,10                              ; jne           35e5 <_sk_store_a8_avx+0x37>
+  DB  117,10                              ; jne           35ed <_sk_store_a8_avx+0x37>
   DB  196,65,123,17,4,58                  ; vmovsd        %xmm8,(%r10,%rdi,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8140,10 +8142,10 @@
   DB  65,128,224,7                        ; and           $0x7,%r8b
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  119,236                             ; ja            35e1 <_sk_store_a8_avx+0x33>
+  DB  119,236                             ; ja            35e9 <_sk_store_a8_avx+0x33>
   DB  196,66,121,48,192                   ; vpmovzxbw     %xmm8,%xmm8
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,67,0,0,0                  ; lea           0x43(%rip),%r9        # 3648 <_sk_store_a8_avx+0x9a>
+  DB  76,141,13,67,0,0,0                  ; lea           0x43(%rip),%r9        # 3650 <_sk_store_a8_avx+0x9a>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8154,7 +8156,7 @@
   DB  196,67,121,20,68,58,2,4             ; vpextrb       $0x4,%xmm8,0x2(%r10,%rdi,1)
   DB  196,67,121,20,68,58,1,2             ; vpextrb       $0x2,%xmm8,0x1(%r10,%rdi,1)
   DB  196,67,121,20,4,58,0                ; vpextrb       $0x0,%xmm8,(%r10,%rdi,1)
-  DB  235,154                             ; jmp           35e1 <_sk_store_a8_avx+0x33>
+  DB  235,154                             ; jmp           35e9 <_sk_store_a8_avx+0x33>
   DB  144                                 ; nop
   DB  246,255                             ; idiv          %bh
   DB  255                                 ; (bad)
@@ -8186,17 +8188,17 @@
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  72,1,248                            ; add           %rdi,%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,67                              ; jne           36b7 <_sk_load_g8_avx+0x53>
+  DB  117,67                              ; jne           36bf <_sk_load_g8_avx+0x53>
   DB  197,250,126,0                       ; vmovq         (%rax),%xmm0
   DB  196,226,121,49,200                  ; vpmovzxbd     %xmm0,%xmm1
   DB  196,227,121,4,192,229               ; vpermilps     $0xe5,%xmm0,%xmm0
   DB  196,226,121,49,192                  ; vpmovzxbd     %xmm0,%xmm0
   DB  196,227,117,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,173,48,0,0        ; vbroadcastss  0x30ad(%rip),%ymm1        # 6748 <_sk_callback_avx+0x371>
+  DB  196,226,125,24,13,173,48,0,0        ; vbroadcastss  0x30ad(%rip),%ymm1        # 6750 <_sk_callback_avx+0x371>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,162,48,0,0        ; vbroadcastss  0x30a2(%rip),%ymm3        # 674c <_sk_callback_avx+0x375>
+  DB  196,226,125,24,29,162,48,0,0        ; vbroadcastss  0x30a2(%rip),%ymm3        # 6754 <_sk_callback_avx+0x375>
   DB  76,137,193                          ; mov           %r8,%rcx
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
@@ -8210,9 +8212,9 @@
   DB  77,9,217                            ; or            %r11,%r9
   DB  72,131,193,8                        ; add           $0x8,%rcx
   DB  73,255,202                          ; dec           %r10
-  DB  117,234                             ; jne           36bf <_sk_load_g8_avx+0x5b>
+  DB  117,234                             ; jne           36c7 <_sk_load_g8_avx+0x5b>
   DB  196,193,249,110,193                 ; vmovq         %r9,%xmm0
-  DB  235,156                             ; jmp           3678 <_sk_load_g8_avx+0x14>
+  DB  235,156                             ; jmp           3680 <_sk_load_g8_avx+0x14>
 
 PUBLIC _sk_gather_g8_avx
 _sk_gather_g8_avx LABEL PROC
@@ -8260,10 +8262,10 @@
   DB  196,226,121,49,201                  ; vpmovzxbd     %xmm1,%xmm1
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,161,47,0,0        ; vbroadcastss  0x2fa1(%rip),%ymm1        # 6750 <_sk_callback_avx+0x379>
+  DB  196,226,125,24,13,161,47,0,0        ; vbroadcastss  0x2fa1(%rip),%ymm1        # 6758 <_sk_callback_avx+0x379>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,150,47,0,0        ; vbroadcastss  0x2f96(%rip),%ymm3        # 6754 <_sk_callback_avx+0x37d>
+  DB  196,226,125,24,29,150,47,0,0        ; vbroadcastss  0x2f96(%rip),%ymm3        # 675c <_sk_callback_avx+0x37d>
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
   DB  91                                  ; pop           %rbx
@@ -8277,9 +8279,9 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,137,192                          ; mov           %rax,%r8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  116,5                               ; je            37de <_sk_gather_i8_avx+0xf>
+  DB  116,5                               ; je            37e6 <_sk_gather_i8_avx+0xf>
   DB  76,137,192                          ; mov           %r8,%rax
-  DB  235,2                               ; jmp           37e0 <_sk_gather_i8_avx+0x11>
+  DB  235,2                               ; jmp           37e8 <_sk_gather_i8_avx+0x11>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,87                               ; push          %r15
   DB  65,86                               ; push          %r14
@@ -8341,10 +8343,10 @@
   DB  196,163,121,34,4,163,2              ; vpinsrd       $0x2,(%rbx,%r12,4),%xmm0,%xmm0
   DB  196,163,121,34,28,19,3              ; vpinsrd       $0x3,(%rbx,%r10,1),%xmm0,%xmm3
   DB  196,227,61,24,195,1                 ; vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  DB  197,124,40,21,22,48,0,0             ; vmovaps       0x3016(%rip),%ymm10        # 6920 <_sk_callback_avx+0x549>
+  DB  197,124,40,21,14,48,0,0             ; vmovaps       0x300e(%rip),%ymm10        # 6920 <_sk_callback_avx+0x541>
   DB  196,193,124,84,194                  ; vandps        %ymm10,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,13,60,46,0,0          ; vbroadcastss  0x2e3c(%rip),%ymm9        # 6758 <_sk_callback_avx+0x381>
+  DB  196,98,125,24,13,60,46,0,0          ; vbroadcastss  0x2e3c(%rip),%ymm9        # 6760 <_sk_callback_avx+0x381>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  196,193,113,114,208,8               ; vpsrld        $0x8,%xmm8,%xmm1
   DB  197,233,114,211,8                   ; vpsrld        $0x8,%xmm3,%xmm2
@@ -8376,38 +8378,38 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,128,0,0,0                    ; jne           3a14 <_sk_load_565_avx+0x8e>
+  DB  15,133,128,0,0,0                    ; jne           3a1c <_sk_load_565_avx+0x8e>
   DB  196,193,122,111,4,122               ; vmovdqu       (%r10,%rdi,2),%xmm0
   DB  197,241,239,201                     ; vpxor         %xmm1,%xmm1,%xmm1
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,209,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm2
-  DB  196,226,125,24,5,166,45,0,0         ; vbroadcastss  0x2da6(%rip),%ymm0        # 675c <_sk_callback_avx+0x385>
+  DB  196,226,125,24,5,166,45,0,0         ; vbroadcastss  0x2da6(%rip),%ymm0        # 6764 <_sk_callback_avx+0x385>
   DB  197,236,84,192                      ; vandps        %ymm0,%ymm2,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,153,45,0,0        ; vbroadcastss  0x2d99(%rip),%ymm1        # 6760 <_sk_callback_avx+0x389>
+  DB  196,226,125,24,13,153,45,0,0        ; vbroadcastss  0x2d99(%rip),%ymm1        # 6768 <_sk_callback_avx+0x389>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,144,45,0,0        ; vbroadcastss  0x2d90(%rip),%ymm1        # 6764 <_sk_callback_avx+0x38d>
+  DB  196,226,125,24,13,144,45,0,0        ; vbroadcastss  0x2d90(%rip),%ymm1        # 676c <_sk_callback_avx+0x38d>
   DB  197,236,84,201                      ; vandps        %ymm1,%ymm2,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,29,131,45,0,0        ; vbroadcastss  0x2d83(%rip),%ymm3        # 6768 <_sk_callback_avx+0x391>
+  DB  196,226,125,24,29,131,45,0,0        ; vbroadcastss  0x2d83(%rip),%ymm3        # 6770 <_sk_callback_avx+0x391>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
-  DB  196,226,125,24,29,122,45,0,0        ; vbroadcastss  0x2d7a(%rip),%ymm3        # 676c <_sk_callback_avx+0x395>
+  DB  196,226,125,24,29,122,45,0,0        ; vbroadcastss  0x2d7a(%rip),%ymm3        # 6774 <_sk_callback_avx+0x395>
   DB  197,236,84,211                      ; vandps        %ymm3,%ymm2,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,226,125,24,29,109,45,0,0        ; vbroadcastss  0x2d6d(%rip),%ymm3        # 6770 <_sk_callback_avx+0x399>
+  DB  196,226,125,24,29,109,45,0,0        ; vbroadcastss  0x2d6d(%rip),%ymm3        # 6778 <_sk_callback_avx+0x399>
   DB  197,236,89,211                      ; vmulps        %ymm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,98,45,0,0         ; vbroadcastss  0x2d62(%rip),%ymm3        # 6774 <_sk_callback_avx+0x39d>
+  DB  196,226,125,24,29,98,45,0,0         ; vbroadcastss  0x2d62(%rip),%ymm3        # 677c <_sk_callback_avx+0x39d>
   DB  255,224                             ; jmpq          *%rax
   DB  65,137,200                          ; mov           %ecx,%r8d
   DB  65,128,224,7                        ; and           $0x7,%r8b
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  15,135,110,255,255,255              ; ja            399a <_sk_load_565_avx+0x14>
+  DB  15,135,110,255,255,255              ; ja            39a2 <_sk_load_565_avx+0x14>
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,73,0,0,0                  ; lea           0x49(%rip),%r9        # 3a80 <_sk_load_565_avx+0xfa>
+  DB  76,141,13,73,0,0,0                  ; lea           0x49(%rip),%r9        # 3a88 <_sk_load_565_avx+0xfa>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8419,7 +8421,7 @@
   DB  196,193,121,196,68,122,4,2          ; vpinsrw       $0x2,0x4(%r10,%rdi,2),%xmm0,%xmm0
   DB  196,193,121,196,68,122,2,1          ; vpinsrw       $0x1,0x2(%r10,%rdi,2),%xmm0,%xmm0
   DB  196,193,121,196,4,122,0             ; vpinsrw       $0x0,(%r10,%rdi,2),%xmm0,%xmm0
-  DB  233,26,255,255,255                  ; jmpq          399a <_sk_load_565_avx+0x14>
+  DB  233,26,255,255,255                  ; jmpq          39a2 <_sk_load_565_avx+0x14>
   DB  244                                 ; hlt
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -8495,23 +8497,23 @@
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,209,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm2
-  DB  196,226,125,24,5,2,44,0,0           ; vbroadcastss  0x2c02(%rip),%ymm0        # 6778 <_sk_callback_avx+0x3a1>
+  DB  196,226,125,24,5,2,44,0,0           ; vbroadcastss  0x2c02(%rip),%ymm0        # 6780 <_sk_callback_avx+0x3a1>
   DB  197,236,84,192                      ; vandps        %ymm0,%ymm2,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,245,43,0,0        ; vbroadcastss  0x2bf5(%rip),%ymm1        # 677c <_sk_callback_avx+0x3a5>
+  DB  196,226,125,24,13,245,43,0,0        ; vbroadcastss  0x2bf5(%rip),%ymm1        # 6784 <_sk_callback_avx+0x3a5>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,236,43,0,0        ; vbroadcastss  0x2bec(%rip),%ymm1        # 6780 <_sk_callback_avx+0x3a9>
+  DB  196,226,125,24,13,236,43,0,0        ; vbroadcastss  0x2bec(%rip),%ymm1        # 6788 <_sk_callback_avx+0x3a9>
   DB  197,236,84,201                      ; vandps        %ymm1,%ymm2,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,29,223,43,0,0        ; vbroadcastss  0x2bdf(%rip),%ymm3        # 6784 <_sk_callback_avx+0x3ad>
+  DB  196,226,125,24,29,223,43,0,0        ; vbroadcastss  0x2bdf(%rip),%ymm3        # 678c <_sk_callback_avx+0x3ad>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
-  DB  196,226,125,24,29,214,43,0,0        ; vbroadcastss  0x2bd6(%rip),%ymm3        # 6788 <_sk_callback_avx+0x3b1>
+  DB  196,226,125,24,29,214,43,0,0        ; vbroadcastss  0x2bd6(%rip),%ymm3        # 6790 <_sk_callback_avx+0x3b1>
   DB  197,236,84,211                      ; vandps        %ymm3,%ymm2,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,226,125,24,29,201,43,0,0        ; vbroadcastss  0x2bc9(%rip),%ymm3        # 678c <_sk_callback_avx+0x3b5>
+  DB  196,226,125,24,29,201,43,0,0        ; vbroadcastss  0x2bc9(%rip),%ymm3        # 6794 <_sk_callback_avx+0x3b5>
   DB  197,236,89,211                      ; vmulps        %ymm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,190,43,0,0        ; vbroadcastss  0x2bbe(%rip),%ymm3        # 6790 <_sk_callback_avx+0x3b9>
+  DB  196,226,125,24,29,190,43,0,0        ; vbroadcastss  0x2bbe(%rip),%ymm3        # 6798 <_sk_callback_avx+0x3b9>
   DB  91                                  ; pop           %rbx
   DB  65,92                               ; pop           %r12
   DB  65,94                               ; pop           %r14
@@ -8523,14 +8525,14 @@
 _sk_store_565_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  196,98,125,24,5,170,43,0,0          ; vbroadcastss  0x2baa(%rip),%ymm8        # 6794 <_sk_callback_avx+0x3bd>
+  DB  196,98,125,24,5,170,43,0,0          ; vbroadcastss  0x2baa(%rip),%ymm8        # 679c <_sk_callback_avx+0x3bd>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,193,41,114,241,11               ; vpslld        $0xb,%xmm9,%xmm10
   DB  196,67,125,25,201,1                 ; vextractf128  $0x1,%ymm9,%xmm9
   DB  196,193,49,114,241,11               ; vpslld        $0xb,%xmm9,%xmm9
   DB  196,67,45,24,201,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
-  DB  196,98,125,24,21,131,43,0,0         ; vbroadcastss  0x2b83(%rip),%ymm10        # 6798 <_sk_callback_avx+0x3c1>
+  DB  196,98,125,24,21,131,43,0,0         ; vbroadcastss  0x2b83(%rip),%ymm10        # 67a0 <_sk_callback_avx+0x3c1>
   DB  196,65,116,89,210                   ; vmulps        %ymm10,%ymm1,%ymm10
   DB  196,65,125,91,210                   ; vcvtps2dq     %ymm10,%ymm10
   DB  196,193,33,114,242,5                ; vpslld        $0x5,%xmm10,%xmm11
@@ -8544,7 +8546,7 @@
   DB  196,67,125,25,193,1                 ; vextractf128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,10                              ; jne           3c65 <_sk_store_565_avx+0x89>
+  DB  117,10                              ; jne           3c6d <_sk_store_565_avx+0x89>
   DB  196,65,122,127,4,122                ; vmovdqu       %xmm8,(%r10,%rdi,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8552,9 +8554,9 @@
   DB  65,128,224,7                        ; and           $0x7,%r8b
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  119,236                             ; ja            3c61 <_sk_store_565_avx+0x85>
+  DB  119,236                             ; ja            3c69 <_sk_store_565_avx+0x85>
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,68,0,0,0                  ; lea           0x44(%rip),%r9        # 3cc4 <_sk_store_565_avx+0xe8>
+  DB  76,141,13,68,0,0,0                  ; lea           0x44(%rip),%r9        # 3ccc <_sk_store_565_avx+0xe8>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8565,7 +8567,7 @@
   DB  196,67,121,21,68,122,4,2            ; vpextrw       $0x2,%xmm8,0x4(%r10,%rdi,2)
   DB  196,67,121,21,68,122,2,1            ; vpextrw       $0x1,%xmm8,0x2(%r10,%rdi,2)
   DB  196,67,121,21,4,122,0               ; vpextrw       $0x0,%xmm8,(%r10,%rdi,2)
-  DB  235,159                             ; jmp           3c61 <_sk_store_565_avx+0x85>
+  DB  235,159                             ; jmp           3c69 <_sk_store_565_avx+0x85>
   DB  102,144                             ; xchg          %ax,%ax
   DB  245                                 ; cmc
   DB  255                                 ; (bad)
@@ -8596,31 +8598,31 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,152,0,0,0                    ; jne           3d86 <_sk_load_4444_avx+0xa6>
+  DB  15,133,152,0,0,0                    ; jne           3d8e <_sk_load_4444_avx+0xa6>
   DB  196,193,122,111,4,122               ; vmovdqu       (%r10,%rdi,2),%xmm0
   DB  197,241,239,201                     ; vpxor         %xmm1,%xmm1,%xmm1
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,217,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm3
-  DB  196,226,125,24,5,140,42,0,0         ; vbroadcastss  0x2a8c(%rip),%ymm0        # 679c <_sk_callback_avx+0x3c5>
+  DB  196,226,125,24,5,140,42,0,0         ; vbroadcastss  0x2a8c(%rip),%ymm0        # 67a4 <_sk_callback_avx+0x3c5>
   DB  197,228,84,192                      ; vandps        %ymm0,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,127,42,0,0        ; vbroadcastss  0x2a7f(%rip),%ymm1        # 67a0 <_sk_callback_avx+0x3c9>
+  DB  196,226,125,24,13,127,42,0,0        ; vbroadcastss  0x2a7f(%rip),%ymm1        # 67a8 <_sk_callback_avx+0x3c9>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,118,42,0,0        ; vbroadcastss  0x2a76(%rip),%ymm1        # 67a4 <_sk_callback_avx+0x3cd>
+  DB  196,226,125,24,13,118,42,0,0        ; vbroadcastss  0x2a76(%rip),%ymm1        # 67ac <_sk_callback_avx+0x3cd>
   DB  197,228,84,201                      ; vandps        %ymm1,%ymm3,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,21,105,42,0,0        ; vbroadcastss  0x2a69(%rip),%ymm2        # 67a8 <_sk_callback_avx+0x3d1>
+  DB  196,226,125,24,21,105,42,0,0        ; vbroadcastss  0x2a69(%rip),%ymm2        # 67b0 <_sk_callback_avx+0x3d1>
   DB  197,244,89,202                      ; vmulps        %ymm2,%ymm1,%ymm1
-  DB  196,226,125,24,21,96,42,0,0         ; vbroadcastss  0x2a60(%rip),%ymm2        # 67ac <_sk_callback_avx+0x3d5>
+  DB  196,226,125,24,21,96,42,0,0         ; vbroadcastss  0x2a60(%rip),%ymm2        # 67b4 <_sk_callback_avx+0x3d5>
   DB  197,228,84,210                      ; vandps        %ymm2,%ymm3,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,98,125,24,5,83,42,0,0           ; vbroadcastss  0x2a53(%rip),%ymm8        # 67b0 <_sk_callback_avx+0x3d9>
+  DB  196,98,125,24,5,83,42,0,0           ; vbroadcastss  0x2a53(%rip),%ymm8        # 67b8 <_sk_callback_avx+0x3d9>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,73,42,0,0           ; vbroadcastss  0x2a49(%rip),%ymm8        # 67b4 <_sk_callback_avx+0x3dd>
+  DB  196,98,125,24,5,73,42,0,0           ; vbroadcastss  0x2a49(%rip),%ymm8        # 67bc <_sk_callback_avx+0x3dd>
   DB  196,193,100,84,216                  ; vandps        %ymm8,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,59,42,0,0           ; vbroadcastss  0x2a3b(%rip),%ymm8        # 67b8 <_sk_callback_avx+0x3e1>
+  DB  196,98,125,24,5,59,42,0,0           ; vbroadcastss  0x2a3b(%rip),%ymm8        # 67c0 <_sk_callback_avx+0x3e1>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8629,9 +8631,9 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  15,135,86,255,255,255               ; ja            3cf4 <_sk_load_4444_avx+0x14>
+  DB  15,135,86,255,255,255               ; ja            3cfc <_sk_load_4444_avx+0x14>
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,75,0,0,0                  ; lea           0x4b(%rip),%r9        # 3df4 <_sk_load_4444_avx+0x114>
+  DB  76,141,13,75,0,0,0                  ; lea           0x4b(%rip),%r9        # 3dfc <_sk_load_4444_avx+0x114>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8643,7 +8645,7 @@
   DB  196,193,121,196,68,122,4,2          ; vpinsrw       $0x2,0x4(%r10,%rdi,2),%xmm0,%xmm0
   DB  196,193,121,196,68,122,2,1          ; vpinsrw       $0x1,0x2(%r10,%rdi,2),%xmm0,%xmm0
   DB  196,193,121,196,4,122,0             ; vpinsrw       $0x0,(%r10,%rdi,2),%xmm0,%xmm0
-  DB  233,2,255,255,255                   ; jmpq          3cf4 <_sk_load_4444_avx+0x14>
+  DB  233,2,255,255,255                   ; jmpq          3cfc <_sk_load_4444_avx+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  242,255                             ; repnz         (bad)
   DB  255                                 ; (bad)
@@ -8720,25 +8722,25 @@
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,217,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm3
-  DB  196,226,125,24,5,210,40,0,0         ; vbroadcastss  0x28d2(%rip),%ymm0        # 67bc <_sk_callback_avx+0x3e5>
+  DB  196,226,125,24,5,210,40,0,0         ; vbroadcastss  0x28d2(%rip),%ymm0        # 67c4 <_sk_callback_avx+0x3e5>
   DB  197,228,84,192                      ; vandps        %ymm0,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,197,40,0,0        ; vbroadcastss  0x28c5(%rip),%ymm1        # 67c0 <_sk_callback_avx+0x3e9>
+  DB  196,226,125,24,13,197,40,0,0        ; vbroadcastss  0x28c5(%rip),%ymm1        # 67c8 <_sk_callback_avx+0x3e9>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,188,40,0,0        ; vbroadcastss  0x28bc(%rip),%ymm1        # 67c4 <_sk_callback_avx+0x3ed>
+  DB  196,226,125,24,13,188,40,0,0        ; vbroadcastss  0x28bc(%rip),%ymm1        # 67cc <_sk_callback_avx+0x3ed>
   DB  197,228,84,201                      ; vandps        %ymm1,%ymm3,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,21,175,40,0,0        ; vbroadcastss  0x28af(%rip),%ymm2        # 67c8 <_sk_callback_avx+0x3f1>
+  DB  196,226,125,24,21,175,40,0,0        ; vbroadcastss  0x28af(%rip),%ymm2        # 67d0 <_sk_callback_avx+0x3f1>
   DB  197,244,89,202                      ; vmulps        %ymm2,%ymm1,%ymm1
-  DB  196,226,125,24,21,166,40,0,0        ; vbroadcastss  0x28a6(%rip),%ymm2        # 67cc <_sk_callback_avx+0x3f5>
+  DB  196,226,125,24,21,166,40,0,0        ; vbroadcastss  0x28a6(%rip),%ymm2        # 67d4 <_sk_callback_avx+0x3f5>
   DB  197,228,84,210                      ; vandps        %ymm2,%ymm3,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,98,125,24,5,153,40,0,0          ; vbroadcastss  0x2899(%rip),%ymm8        # 67d0 <_sk_callback_avx+0x3f9>
+  DB  196,98,125,24,5,153,40,0,0          ; vbroadcastss  0x2899(%rip),%ymm8        # 67d8 <_sk_callback_avx+0x3f9>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,143,40,0,0          ; vbroadcastss  0x288f(%rip),%ymm8        # 67d4 <_sk_callback_avx+0x3fd>
+  DB  196,98,125,24,5,143,40,0,0          ; vbroadcastss  0x288f(%rip),%ymm8        # 67dc <_sk_callback_avx+0x3fd>
   DB  196,193,100,84,216                  ; vandps        %ymm8,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,129,40,0,0          ; vbroadcastss  0x2881(%rip),%ymm8        # 67d8 <_sk_callback_avx+0x401>
+  DB  196,98,125,24,5,129,40,0,0          ; vbroadcastss  0x2881(%rip),%ymm8        # 67e0 <_sk_callback_avx+0x401>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
@@ -8752,7 +8754,7 @@
 _sk_store_4444_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  196,98,125,24,5,102,40,0,0          ; vbroadcastss  0x2866(%rip),%ymm8        # 67dc <_sk_callback_avx+0x405>
+  DB  196,98,125,24,5,102,40,0,0          ; vbroadcastss  0x2866(%rip),%ymm8        # 67e4 <_sk_callback_avx+0x405>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,193,41,114,241,12               ; vpslld        $0xc,%xmm9,%xmm10
@@ -8779,7 +8781,7 @@
   DB  196,67,125,25,193,1                 ; vextractf128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,10                              ; jne           400f <_sk_store_4444_avx+0xa7>
+  DB  117,10                              ; jne           4017 <_sk_store_4444_avx+0xa7>
   DB  196,65,122,127,4,122                ; vmovdqu       %xmm8,(%r10,%rdi,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8787,9 +8789,9 @@
   DB  65,128,224,7                        ; and           $0x7,%r8b
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  119,236                             ; ja            400b <_sk_store_4444_avx+0xa3>
+  DB  119,236                             ; ja            4013 <_sk_store_4444_avx+0xa3>
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,66,0,0,0                  ; lea           0x42(%rip),%r9        # 406c <_sk_store_4444_avx+0x104>
+  DB  76,141,13,66,0,0,0                  ; lea           0x42(%rip),%r9        # 4074 <_sk_store_4444_avx+0x104>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8800,7 +8802,7 @@
   DB  196,67,121,21,68,122,4,2            ; vpextrw       $0x2,%xmm8,0x4(%r10,%rdi,2)
   DB  196,67,121,21,68,122,2,1            ; vpextrw       $0x1,%xmm8,0x2(%r10,%rdi,2)
   DB  196,67,121,21,4,122,0               ; vpextrw       $0x0,%xmm8,(%r10,%rdi,2)
-  DB  235,159                             ; jmp           400b <_sk_store_4444_avx+0xa3>
+  DB  235,159                             ; jmp           4013 <_sk_store_4444_avx+0xa3>
   DB  247,255                             ; idiv          %edi
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -8829,12 +8831,12 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,135,0,0,0                    ; jne           411d <_sk_load_8888_avx+0x95>
+  DB  15,133,135,0,0,0                    ; jne           4125 <_sk_load_8888_avx+0x95>
   DB  196,65,124,16,12,186                ; vmovups       (%r10,%rdi,4),%ymm9
-  DB  197,124,40,21,156,40,0,0            ; vmovaps       0x289c(%rip),%ymm10        # 6940 <_sk_callback_avx+0x569>
+  DB  197,124,40,21,148,40,0,0            ; vmovaps       0x2894(%rip),%ymm10        # 6940 <_sk_callback_avx+0x561>
   DB  196,193,52,84,194                   ; vandps        %ymm10,%ymm9,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,42,39,0,0           ; vbroadcastss  0x272a(%rip),%ymm8        # 67e0 <_sk_callback_avx+0x409>
+  DB  196,98,125,24,5,42,39,0,0           ; vbroadcastss  0x272a(%rip),%ymm8        # 67e8 <_sk_callback_avx+0x409>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  196,193,113,114,209,8               ; vpsrld        $0x8,%xmm9,%xmm1
   DB  196,99,125,25,203,1                 ; vextractf128  $0x1,%ymm9,%xmm3
@@ -8861,9 +8863,9 @@
   DB  196,65,52,87,201                    ; vxorps        %ymm9,%ymm9,%ymm9
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  15,135,102,255,255,255              ; ja            409c <_sk_load_8888_avx+0x14>
+  DB  15,135,102,255,255,255              ; ja            40a4 <_sk_load_8888_avx+0x14>
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,139,0,0,0                 ; lea           0x8b(%rip),%r9        # 41cc <_sk_load_8888_avx+0x144>
+  DB  76,141,13,139,0,0,0                 ; lea           0x8b(%rip),%r9        # 41d4 <_sk_load_8888_avx+0x144>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -8886,7 +8888,7 @@
   DB  196,99,53,12,200,15                 ; vblendps      $0xf,%ymm0,%ymm9,%ymm9
   DB  196,195,49,34,4,186,0               ; vpinsrd       $0x0,(%r10,%rdi,4),%xmm9,%xmm0
   DB  196,99,53,12,200,15                 ; vblendps      $0xf,%ymm0,%ymm9,%ymm9
-  DB  233,210,254,255,255                 ; jmpq          409c <_sk_load_8888_avx+0x14>
+  DB  233,210,254,255,255                 ; jmpq          40a4 <_sk_load_8888_avx+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  236                                 ; in            (%dx),%al
   DB  255                                 ; (bad)
@@ -8904,7 +8906,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  126,255                             ; jle           41e5 <_sk_load_8888_avx+0x15d>
+  DB  126,255                             ; jle           41ed <_sk_load_8888_avx+0x15d>
   DB  255                                 ; (bad)
   DB  255                                 ; .byte         0xff
 
@@ -8947,10 +8949,10 @@
   DB  196,131,121,34,4,152,2              ; vpinsrd       $0x2,(%r8,%r11,4),%xmm0,%xmm0
   DB  196,131,121,34,28,144,3             ; vpinsrd       $0x3,(%r8,%r10,4),%xmm0,%xmm3
   DB  196,227,61,24,195,1                 ; vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  DB  197,124,40,21,198,38,0,0            ; vmovaps       0x26c6(%rip),%ymm10        # 6960 <_sk_callback_avx+0x589>
+  DB  197,124,40,21,190,38,0,0            ; vmovaps       0x26be(%rip),%ymm10        # 6960 <_sk_callback_avx+0x581>
   DB  196,193,124,84,194                  ; vandps        %ymm10,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,13,56,37,0,0          ; vbroadcastss  0x2538(%rip),%ymm9        # 67e4 <_sk_callback_avx+0x40d>
+  DB  196,98,125,24,13,56,37,0,0          ; vbroadcastss  0x2538(%rip),%ymm9        # 67ec <_sk_callback_avx+0x40d>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  196,193,113,114,208,8               ; vpsrld        $0x8,%xmm8,%xmm1
   DB  197,233,114,211,8                   ; vpsrld        $0x8,%xmm3,%xmm2
@@ -8980,7 +8982,7 @@
 _sk_store_8888_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  196,98,125,24,5,198,36,0,0          ; vbroadcastss  0x24c6(%rip),%ymm8        # 67e8 <_sk_callback_avx+0x411>
+  DB  196,98,125,24,5,198,36,0,0          ; vbroadcastss  0x24c6(%rip),%ymm8        # 67f0 <_sk_callback_avx+0x411>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,65,116,89,208                   ; vmulps        %ymm8,%ymm1,%ymm10
@@ -9005,7 +9007,7 @@
   DB  196,65,45,86,192                    ; vorpd         %ymm8,%ymm10,%ymm8
   DB  196,65,53,86,192                    ; vorpd         %ymm8,%ymm9,%ymm8
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,10                              ; jne           43b0 <_sk_store_8888_avx+0x9c>
+  DB  117,10                              ; jne           43b8 <_sk_store_8888_avx+0x9c>
   DB  196,65,124,17,4,186                 ; vmovups       %ymm8,(%r10,%rdi,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -9013,9 +9015,9 @@
   DB  65,128,224,7                        ; and           $0x7,%r8b
   DB  65,254,200                          ; dec           %r8b
   DB  65,128,248,6                        ; cmp           $0x6,%r8b
-  DB  119,236                             ; ja            43ac <_sk_store_8888_avx+0x98>
+  DB  119,236                             ; ja            43b4 <_sk_store_8888_avx+0x98>
   DB  69,15,182,192                       ; movzbl        %r8b,%r8d
-  DB  76,141,13,85,0,0,0                  ; lea           0x55(%rip),%r9        # 4420 <_sk_store_8888_avx+0x10c>
+  DB  76,141,13,85,0,0,0                  ; lea           0x55(%rip),%r9        # 4428 <_sk_store_8888_avx+0x10c>
   DB  75,99,4,129                         ; movslq        (%r9,%r8,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -9029,7 +9031,7 @@
   DB  196,67,121,22,68,186,8,2            ; vpextrd       $0x2,%xmm8,0x8(%r10,%rdi,4)
   DB  196,67,121,22,68,186,4,1            ; vpextrd       $0x1,%xmm8,0x4(%r10,%rdi,4)
   DB  196,65,121,126,4,186                ; vmovd         %xmm8,(%r10,%rdi,4)
-  DB  235,143                             ; jmp           43ac <_sk_store_8888_avx+0x98>
+  DB  235,143                             ; jmp           43b4 <_sk_store_8888_avx+0x98>
   DB  15,31,0                             ; nopl          (%rax)
   DB  245                                 ; cmc
   DB  255                                 ; (bad)
@@ -9065,7 +9067,7 @@
   DB  197,252,17,116,36,64                ; vmovups       %ymm6,0x40(%rsp)
   DB  197,252,17,108,36,32                ; vmovups       %ymm5,0x20(%rsp)
   DB  197,254,127,36,36                   ; vmovdqu       %ymm4,(%rsp)
-  DB  15,133,143,2,0,0                    ; jne           46f7 <_sk_load_f16_avx+0x2bb>
+  DB  15,133,143,2,0,0                    ; jne           46ff <_sk_load_f16_avx+0x2bb>
   DB  197,121,16,4,248                    ; vmovupd       (%rax,%rdi,8),%xmm8
   DB  197,249,16,84,248,16                ; vmovupd       0x10(%rax,%rdi,8),%xmm2
   DB  197,249,16,76,248,32                ; vmovupd       0x20(%rax,%rdi,8),%xmm1
@@ -9083,13 +9085,13 @@
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
-  DB  196,98,125,24,37,43,35,0,0          ; vbroadcastss  0x232b(%rip),%ymm12        # 67ec <_sk_callback_avx+0x415>
+  DB  196,98,125,24,37,43,35,0,0          ; vbroadcastss  0x232b(%rip),%ymm12        # 67f4 <_sk_callback_avx+0x415>
   DB  196,193,124,84,204                  ; vandps        %ymm12,%ymm0,%ymm1
   DB  197,252,87,193                      ; vxorps        %ymm1,%ymm0,%ymm0
   DB  196,195,125,25,198,1                ; vextractf128  $0x1,%ymm0,%xmm14
-  DB  196,98,121,24,29,23,35,0,0          ; vbroadcastss  0x2317(%rip),%xmm11        # 67f0 <_sk_callback_avx+0x419>
+  DB  196,98,121,24,29,23,35,0,0          ; vbroadcastss  0x2317(%rip),%xmm11        # 67f8 <_sk_callback_avx+0x419>
   DB  196,193,8,87,219                    ; vxorps        %xmm11,%xmm14,%xmm3
-  DB  196,98,121,24,45,13,35,0,0          ; vbroadcastss  0x230d(%rip),%xmm13        # 67f4 <_sk_callback_avx+0x41d>
+  DB  196,98,121,24,45,13,35,0,0          ; vbroadcastss  0x230d(%rip),%xmm13        # 67fc <_sk_callback_avx+0x41d>
   DB  197,145,102,219                     ; vpcmpgtd      %xmm3,%xmm13,%xmm3
   DB  196,65,120,87,211                   ; vxorps        %xmm11,%xmm0,%xmm10
   DB  196,65,17,102,210                   ; vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -9103,7 +9105,7 @@
   DB  196,227,125,24,195,1                ; vinsertf128   $0x1,%xmm3,%ymm0,%ymm0
   DB  197,252,86,193                      ; vorps         %ymm1,%ymm0,%ymm0
   DB  196,227,125,25,193,1                ; vextractf128  $0x1,%ymm0,%xmm1
-  DB  196,226,121,24,29,195,34,0,0        ; vbroadcastss  0x22c3(%rip),%xmm3        # 67f8 <_sk_callback_avx+0x421>
+  DB  196,226,121,24,29,195,34,0,0        ; vbroadcastss  0x22c3(%rip),%xmm3        # 6800 <_sk_callback_avx+0x421>
   DB  197,241,254,203                     ; vpaddd        %xmm3,%xmm1,%xmm1
   DB  197,249,254,195                     ; vpaddd        %xmm3,%xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
@@ -9196,29 +9198,29 @@
   DB  197,123,16,4,248                    ; vmovsd        (%rax,%rdi,8),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  116,79                              ; je            4756 <_sk_load_f16_avx+0x31a>
+  DB  116,79                              ; je            475e <_sk_load_f16_avx+0x31a>
   DB  197,57,22,68,248,8                  ; vmovhpd       0x8(%rax,%rdi,8),%xmm8,%xmm8
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,67                              ; jb            4756 <_sk_load_f16_avx+0x31a>
+  DB  114,67                              ; jb            475e <_sk_load_f16_avx+0x31a>
   DB  197,251,16,84,248,16                ; vmovsd        0x10(%rax,%rdi,8),%xmm2
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  116,68                              ; je            4763 <_sk_load_f16_avx+0x327>
+  DB  116,68                              ; je            476b <_sk_load_f16_avx+0x327>
   DB  197,233,22,84,248,24                ; vmovhpd       0x18(%rax,%rdi,8),%xmm2,%xmm2
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,56                              ; jb            4763 <_sk_load_f16_avx+0x327>
+  DB  114,56                              ; jb            476b <_sk_load_f16_avx+0x327>
   DB  197,251,16,76,248,32                ; vmovsd        0x20(%rax,%rdi,8),%xmm1
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  15,132,68,253,255,255               ; je            447f <_sk_load_f16_avx+0x43>
+  DB  15,132,68,253,255,255               ; je            4487 <_sk_load_f16_avx+0x43>
   DB  197,241,22,76,248,40                ; vmovhpd       0x28(%rax,%rdi,8),%xmm1,%xmm1
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  15,130,52,253,255,255               ; jb            447f <_sk_load_f16_avx+0x43>
+  DB  15,130,52,253,255,255               ; jb            4487 <_sk_load_f16_avx+0x43>
   DB  197,122,126,76,248,48               ; vmovq         0x30(%rax,%rdi,8),%xmm9
-  DB  233,41,253,255,255                  ; jmpq          447f <_sk_load_f16_avx+0x43>
+  DB  233,41,253,255,255                  ; jmpq          4487 <_sk_load_f16_avx+0x43>
   DB  197,241,87,201                      ; vxorpd        %xmm1,%xmm1,%xmm1
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,28,253,255,255                  ; jmpq          447f <_sk_load_f16_avx+0x43>
+  DB  233,28,253,255,255                  ; jmpq          4487 <_sk_load_f16_avx+0x43>
   DB  197,241,87,201                      ; vxorpd        %xmm1,%xmm1,%xmm1
-  DB  233,19,253,255,255                  ; jmpq          447f <_sk_load_f16_avx+0x43>
+  DB  233,19,253,255,255                  ; jmpq          4487 <_sk_load_f16_avx+0x43>
 
 PUBLIC _sk_gather_f16_avx
 _sk_gather_f16_avx LABEL PROC
@@ -9280,13 +9282,13 @@
   DB  197,249,105,210                     ; vpunpckhwd    %xmm2,%xmm0,%xmm2
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,194,1                ; vinsertf128   $0x1,%xmm2,%ymm0,%ymm0
-  DB  196,98,125,24,37,131,31,0,0         ; vbroadcastss  0x1f83(%rip),%ymm12        # 67fc <_sk_callback_avx+0x425>
+  DB  196,98,125,24,37,131,31,0,0         ; vbroadcastss  0x1f83(%rip),%ymm12        # 6804 <_sk_callback_avx+0x425>
   DB  196,193,124,84,212                  ; vandps        %ymm12,%ymm0,%ymm2
   DB  197,252,87,194                      ; vxorps        %ymm2,%ymm0,%ymm0
   DB  196,195,125,25,198,1                ; vextractf128  $0x1,%ymm0,%xmm14
-  DB  196,98,121,24,29,111,31,0,0         ; vbroadcastss  0x1f6f(%rip),%xmm11        # 6800 <_sk_callback_avx+0x429>
+  DB  196,98,121,24,29,111,31,0,0         ; vbroadcastss  0x1f6f(%rip),%xmm11        # 6808 <_sk_callback_avx+0x429>
   DB  196,193,8,87,219                    ; vxorps        %xmm11,%xmm14,%xmm3
-  DB  196,98,121,24,45,101,31,0,0         ; vbroadcastss  0x1f65(%rip),%xmm13        # 6804 <_sk_callback_avx+0x42d>
+  DB  196,98,121,24,45,101,31,0,0         ; vbroadcastss  0x1f65(%rip),%xmm13        # 680c <_sk_callback_avx+0x42d>
   DB  197,145,102,219                     ; vpcmpgtd      %xmm3,%xmm13,%xmm3
   DB  196,65,120,87,211                   ; vxorps        %xmm11,%xmm0,%xmm10
   DB  196,65,17,102,210                   ; vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -9300,7 +9302,7 @@
   DB  196,227,125,24,195,1                ; vinsertf128   $0x1,%xmm3,%ymm0,%ymm0
   DB  197,252,86,194                      ; vorps         %ymm2,%ymm0,%ymm0
   DB  196,227,125,25,194,1                ; vextractf128  $0x1,%ymm0,%xmm2
-  DB  196,226,121,24,29,27,31,0,0         ; vbroadcastss  0x1f1b(%rip),%xmm3        # 6808 <_sk_callback_avx+0x431>
+  DB  196,226,121,24,29,27,31,0,0         ; vbroadcastss  0x1f1b(%rip),%xmm3        # 6810 <_sk_callback_avx+0x431>
   DB  197,233,254,211                     ; vpaddd        %xmm3,%xmm2,%xmm2
   DB  197,249,254,195                     ; vpaddd        %xmm3,%xmm0,%xmm0
   DB  196,227,125,24,194,1                ; vinsertf128   $0x1,%xmm2,%ymm0,%ymm0
@@ -9402,12 +9404,12 @@
   DB  197,252,17,180,36,128,0,0,0         ; vmovups       %ymm6,0x80(%rsp)
   DB  197,252,17,108,36,96                ; vmovups       %ymm5,0x60(%rsp)
   DB  197,252,17,100,36,64                ; vmovups       %ymm4,0x40(%rsp)
-  DB  196,98,125,24,13,40,29,0,0          ; vbroadcastss  0x1d28(%rip),%ymm9        # 680c <_sk_callback_avx+0x435>
+  DB  196,98,125,24,13,40,29,0,0          ; vbroadcastss  0x1d28(%rip),%ymm9        # 6814 <_sk_callback_avx+0x435>
   DB  196,65,124,84,209                   ; vandps        %ymm9,%ymm0,%ymm10
   DB  197,252,17,4,36                     ; vmovups       %ymm0,(%rsp)
   DB  196,65,124,87,218                   ; vxorps        %ymm10,%ymm0,%ymm11
   DB  196,67,125,25,220,1                 ; vextractf128  $0x1,%ymm11,%xmm12
-  DB  196,98,121,24,5,14,29,0,0           ; vbroadcastss  0x1d0e(%rip),%xmm8        # 6810 <_sk_callback_avx+0x439>
+  DB  196,98,121,24,5,14,29,0,0           ; vbroadcastss  0x1d0e(%rip),%xmm8        # 6818 <_sk_callback_avx+0x439>
   DB  196,65,57,102,236                   ; vpcmpgtd      %xmm12,%xmm8,%xmm13
   DB  196,65,57,102,243                   ; vpcmpgtd      %xmm11,%xmm8,%xmm14
   DB  196,67,13,24,237,1                  ; vinsertf128   $0x1,%xmm13,%ymm14,%ymm13
@@ -9417,7 +9419,7 @@
   DB  196,67,13,24,242,1                  ; vinsertf128   $0x1,%xmm10,%ymm14,%ymm14
   DB  196,193,33,114,211,13               ; vpsrld        $0xd,%xmm11,%xmm11
   DB  196,193,25,114,212,13               ; vpsrld        $0xd,%xmm12,%xmm12
-  DB  196,98,125,24,21,213,28,0,0         ; vbroadcastss  0x1cd5(%rip),%ymm10        # 6814 <_sk_callback_avx+0x43d>
+  DB  196,98,125,24,21,213,28,0,0         ; vbroadcastss  0x1cd5(%rip),%ymm10        # 681c <_sk_callback_avx+0x43d>
   DB  196,65,12,86,242                    ; vorps         %ymm10,%ymm14,%ymm14
   DB  196,67,125,25,247,1                 ; vextractf128  $0x1,%ymm14,%xmm15
   DB  196,65,1,254,228                    ; vpaddd        %xmm12,%xmm15,%xmm12
@@ -9499,7 +9501,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,75                              ; jne           4d26 <_sk_store_f16_avx+0x270>
+  DB  117,75                              ; jne           4d2e <_sk_store_f16_avx+0x270>
   DB  197,120,17,28,248                   ; vmovups       %xmm11,(%rax,%rdi,8)
   DB  197,120,17,84,248,16                ; vmovups       %xmm10,0x10(%rax,%rdi,8)
   DB  197,120,17,76,248,32                ; vmovups       %xmm9,0x20(%rax,%rdi,8)
@@ -9515,22 +9517,22 @@
   DB  255,224                             ; jmpq          *%rax
   DB  197,121,214,28,248                  ; vmovq         %xmm11,(%rax,%rdi,8)
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  116,193                             ; je            4cf2 <_sk_store_f16_avx+0x23c>
+  DB  116,193                             ; je            4cfa <_sk_store_f16_avx+0x23c>
   DB  197,121,23,92,248,8                 ; vmovhpd       %xmm11,0x8(%rax,%rdi,8)
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,181                             ; jb            4cf2 <_sk_store_f16_avx+0x23c>
+  DB  114,181                             ; jb            4cfa <_sk_store_f16_avx+0x23c>
   DB  197,121,214,84,248,16               ; vmovq         %xmm10,0x10(%rax,%rdi,8)
-  DB  116,173                             ; je            4cf2 <_sk_store_f16_avx+0x23c>
+  DB  116,173                             ; je            4cfa <_sk_store_f16_avx+0x23c>
   DB  197,121,23,84,248,24                ; vmovhpd       %xmm10,0x18(%rax,%rdi,8)
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,161                             ; jb            4cf2 <_sk_store_f16_avx+0x23c>
+  DB  114,161                             ; jb            4cfa <_sk_store_f16_avx+0x23c>
   DB  197,121,214,76,248,32               ; vmovq         %xmm9,0x20(%rax,%rdi,8)
-  DB  116,153                             ; je            4cf2 <_sk_store_f16_avx+0x23c>
+  DB  116,153                             ; je            4cfa <_sk_store_f16_avx+0x23c>
   DB  197,121,23,76,248,40                ; vmovhpd       %xmm9,0x28(%rax,%rdi,8)
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  114,141                             ; jb            4cf2 <_sk_store_f16_avx+0x23c>
+  DB  114,141                             ; jb            4cfa <_sk_store_f16_avx+0x23c>
   DB  197,121,214,68,248,48               ; vmovq         %xmm8,0x30(%rax,%rdi,8)
-  DB  235,133                             ; jmp           4cf2 <_sk_store_f16_avx+0x23c>
+  DB  235,133                             ; jmp           4cfa <_sk_store_f16_avx+0x23c>
 
 PUBLIC _sk_load_u16_be_avx
 _sk_load_u16_be_avx LABEL PROC
@@ -9538,7 +9540,7 @@
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  72,141,4,189,0,0,0,0                ; lea           0x0(,%rdi,4),%rax
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,253,0,0,0                    ; jne           4e80 <_sk_load_u16_be_avx+0x113>
+  DB  15,133,253,0,0,0                    ; jne           4e88 <_sk_load_u16_be_avx+0x113>
   DB  196,65,121,16,4,64                  ; vmovupd       (%r8,%rax,2),%xmm8
   DB  196,193,121,16,84,64,16             ; vmovupd       0x10(%r8,%rax,2),%xmm2
   DB  196,193,121,16,92,64,32             ; vmovupd       0x20(%r8,%rax,2),%xmm3
@@ -9560,7 +9562,7 @@
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,29,36,26,0,0          ; vbroadcastss  0x1a24(%rip),%ymm11        # 6818 <_sk_callback_avx+0x441>
+  DB  196,98,125,24,29,36,26,0,0          ; vbroadcastss  0x1a24(%rip),%ymm11        # 6820 <_sk_callback_avx+0x441>
   DB  196,193,124,89,195                  ; vmulps        %ymm11,%ymm0,%ymm0
   DB  197,177,109,202                     ; vpunpckhqdq   %xmm2,%xmm9,%xmm1
   DB  197,233,113,241,8                   ; vpsllw        $0x8,%xmm1,%xmm2
@@ -9594,29 +9596,29 @@
   DB  196,65,123,16,4,64                  ; vmovsd        (%r8,%rax,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  116,85                              ; je            4ee6 <_sk_load_u16_be_avx+0x179>
+  DB  116,85                              ; je            4eee <_sk_load_u16_be_avx+0x179>
   DB  196,65,57,22,68,64,8                ; vmovhpd       0x8(%r8,%rax,2),%xmm8,%xmm8
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,72                              ; jb            4ee6 <_sk_load_u16_be_avx+0x179>
+  DB  114,72                              ; jb            4eee <_sk_load_u16_be_avx+0x179>
   DB  196,193,123,16,84,64,16             ; vmovsd        0x10(%r8,%rax,2),%xmm2
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  116,72                              ; je            4ef3 <_sk_load_u16_be_avx+0x186>
+  DB  116,72                              ; je            4efb <_sk_load_u16_be_avx+0x186>
   DB  196,193,105,22,84,64,24             ; vmovhpd       0x18(%r8,%rax,2),%xmm2,%xmm2
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,59                              ; jb            4ef3 <_sk_load_u16_be_avx+0x186>
+  DB  114,59                              ; jb            4efb <_sk_load_u16_be_avx+0x186>
   DB  196,193,123,16,92,64,32             ; vmovsd        0x20(%r8,%rax,2),%xmm3
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  15,132,213,254,255,255              ; je            4d9e <_sk_load_u16_be_avx+0x31>
+  DB  15,132,213,254,255,255              ; je            4da6 <_sk_load_u16_be_avx+0x31>
   DB  196,193,97,22,92,64,40              ; vmovhpd       0x28(%r8,%rax,2),%xmm3,%xmm3
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  15,130,196,254,255,255              ; jb            4d9e <_sk_load_u16_be_avx+0x31>
+  DB  15,130,196,254,255,255              ; jb            4da6 <_sk_load_u16_be_avx+0x31>
   DB  196,65,122,126,76,64,48             ; vmovq         0x30(%r8,%rax,2),%xmm9
-  DB  233,184,254,255,255                 ; jmpq          4d9e <_sk_load_u16_be_avx+0x31>
+  DB  233,184,254,255,255                 ; jmpq          4da6 <_sk_load_u16_be_avx+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,171,254,255,255                 ; jmpq          4d9e <_sk_load_u16_be_avx+0x31>
+  DB  233,171,254,255,255                 ; jmpq          4da6 <_sk_load_u16_be_avx+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,162,254,255,255                 ; jmpq          4d9e <_sk_load_u16_be_avx+0x31>
+  DB  233,162,254,255,255                 ; jmpq          4da6 <_sk_load_u16_be_avx+0x31>
 
 PUBLIC _sk_load_rgb_u16_be_avx
 _sk_load_rgb_u16_be_avx LABEL PROC
@@ -9624,7 +9626,7 @@
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  72,141,4,127                        ; lea           (%rdi,%rdi,2),%rax
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  15,133,243,0,0,0                    ; jne           5001 <_sk_load_rgb_u16_be_avx+0x105>
+  DB  15,133,243,0,0,0                    ; jne           5009 <_sk_load_rgb_u16_be_avx+0x105>
   DB  196,193,122,111,4,64                ; vmovdqu       (%r8,%rax,2),%xmm0
   DB  196,193,122,111,84,64,12            ; vmovdqu       0xc(%r8,%rax,2),%xmm2
   DB  196,193,122,111,76,64,24            ; vmovdqu       0x18(%r8,%rax,2),%xmm1
@@ -9651,7 +9653,7 @@
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,29,132,24,0,0         ; vbroadcastss  0x1884(%rip),%ymm11        # 681c <_sk_callback_avx+0x445>
+  DB  196,98,125,24,29,132,24,0,0         ; vbroadcastss  0x1884(%rip),%ymm11        # 6824 <_sk_callback_avx+0x445>
   DB  196,193,124,89,195                  ; vmulps        %ymm11,%ymm0,%ymm0
   DB  197,185,109,202                     ; vpunpckhqdq   %xmm2,%xmm8,%xmm1
   DB  197,233,113,241,8                   ; vpsllw        $0x8,%xmm1,%xmm2
@@ -9672,48 +9674,48 @@
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,211                  ; vmulps        %ymm11,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,33,24,0,0         ; vbroadcastss  0x1821(%rip),%ymm3        # 6820 <_sk_callback_avx+0x449>
+  DB  196,226,125,24,29,33,24,0,0         ; vbroadcastss  0x1821(%rip),%ymm3        # 6828 <_sk_callback_avx+0x449>
   DB  255,224                             ; jmpq          *%rax
   DB  196,193,121,110,4,64                ; vmovd         (%r8,%rax,2),%xmm0
   DB  196,193,121,196,68,64,4,2           ; vpinsrw       $0x2,0x4(%r8,%rax,2),%xmm0,%xmm0
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  117,5                               ; jne           501a <_sk_load_rgb_u16_be_avx+0x11e>
-  DB  233,40,255,255,255                  ; jmpq          4f42 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  117,5                               ; jne           5022 <_sk_load_rgb_u16_be_avx+0x11e>
+  DB  233,40,255,255,255                  ; jmpq          4f4a <_sk_load_rgb_u16_be_avx+0x46>
   DB  196,193,121,110,76,64,6             ; vmovd         0x6(%r8,%rax,2),%xmm1
   DB  196,65,113,196,68,64,10,2           ; vpinsrw       $0x2,0xa(%r8,%rax,2),%xmm1,%xmm8
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,26                              ; jb            5049 <_sk_load_rgb_u16_be_avx+0x14d>
+  DB  114,26                              ; jb            5051 <_sk_load_rgb_u16_be_avx+0x14d>
   DB  196,193,121,110,76,64,12            ; vmovd         0xc(%r8,%rax,2),%xmm1
   DB  196,193,113,196,84,64,16,2          ; vpinsrw       $0x2,0x10(%r8,%rax,2),%xmm1,%xmm2
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  117,10                              ; jne           504e <_sk_load_rgb_u16_be_avx+0x152>
-  DB  233,249,254,255,255                 ; jmpq          4f42 <_sk_load_rgb_u16_be_avx+0x46>
-  DB  233,244,254,255,255                 ; jmpq          4f42 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  117,10                              ; jne           5056 <_sk_load_rgb_u16_be_avx+0x152>
+  DB  233,249,254,255,255                 ; jmpq          4f4a <_sk_load_rgb_u16_be_avx+0x46>
+  DB  233,244,254,255,255                 ; jmpq          4f4a <_sk_load_rgb_u16_be_avx+0x46>
   DB  196,193,121,110,76,64,18            ; vmovd         0x12(%r8,%rax,2),%xmm1
   DB  196,65,113,196,76,64,22,2           ; vpinsrw       $0x2,0x16(%r8,%rax,2),%xmm1,%xmm9
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,26                              ; jb            507d <_sk_load_rgb_u16_be_avx+0x181>
+  DB  114,26                              ; jb            5085 <_sk_load_rgb_u16_be_avx+0x181>
   DB  196,193,121,110,76,64,24            ; vmovd         0x18(%r8,%rax,2),%xmm1
   DB  196,193,113,196,76,64,28,2          ; vpinsrw       $0x2,0x1c(%r8,%rax,2),%xmm1,%xmm1
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  117,10                              ; jne           5082 <_sk_load_rgb_u16_be_avx+0x186>
-  DB  233,197,254,255,255                 ; jmpq          4f42 <_sk_load_rgb_u16_be_avx+0x46>
-  DB  233,192,254,255,255                 ; jmpq          4f42 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  117,10                              ; jne           508a <_sk_load_rgb_u16_be_avx+0x186>
+  DB  233,197,254,255,255                 ; jmpq          4f4a <_sk_load_rgb_u16_be_avx+0x46>
+  DB  233,192,254,255,255                 ; jmpq          4f4a <_sk_load_rgb_u16_be_avx+0x46>
   DB  196,193,121,110,92,64,30            ; vmovd         0x1e(%r8,%rax,2),%xmm3
   DB  196,65,97,196,92,64,34,2            ; vpinsrw       $0x2,0x22(%r8,%rax,2),%xmm3,%xmm11
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  114,20                              ; jb            50ab <_sk_load_rgb_u16_be_avx+0x1af>
+  DB  114,20                              ; jb            50b3 <_sk_load_rgb_u16_be_avx+0x1af>
   DB  196,193,121,110,92,64,36            ; vmovd         0x24(%r8,%rax,2),%xmm3
   DB  196,193,97,196,92,64,40,2           ; vpinsrw       $0x2,0x28(%r8,%rax,2),%xmm3,%xmm3
-  DB  233,151,254,255,255                 ; jmpq          4f42 <_sk_load_rgb_u16_be_avx+0x46>
-  DB  233,146,254,255,255                 ; jmpq          4f42 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  233,151,254,255,255                 ; jmpq          4f4a <_sk_load_rgb_u16_be_avx+0x46>
+  DB  233,146,254,255,255                 ; jmpq          4f4a <_sk_load_rgb_u16_be_avx+0x46>
 
 PUBLIC _sk_store_u16_be_avx
 _sk_store_u16_be_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  72,141,4,189,0,0,0,0                ; lea           0x0(,%rdi,4),%rax
-  DB  196,98,125,24,5,94,23,0,0           ; vbroadcastss  0x175e(%rip),%ymm8        # 6824 <_sk_callback_avx+0x44d>
+  DB  196,98,125,24,5,94,23,0,0           ; vbroadcastss  0x175e(%rip),%ymm8        # 682c <_sk_callback_avx+0x44d>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,67,125,25,202,1                 ; vextractf128  $0x1,%ymm9,%xmm10
@@ -9751,7 +9753,7 @@
   DB  196,65,17,98,200                    ; vpunpckldq    %xmm8,%xmm13,%xmm9
   DB  196,65,17,106,192                   ; vpunpckhdq    %xmm8,%xmm13,%xmm8
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,31                              ; jne           51aa <_sk_store_u16_be_avx+0xfa>
+  DB  117,31                              ; jne           51b2 <_sk_store_u16_be_avx+0xfa>
   DB  196,65,120,17,28,64                 ; vmovups       %xmm11,(%r8,%rax,2)
   DB  196,65,120,17,84,64,16              ; vmovups       %xmm10,0x10(%r8,%rax,2)
   DB  196,65,120,17,76,64,32              ; vmovups       %xmm9,0x20(%r8,%rax,2)
@@ -9760,31 +9762,31 @@
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,214,28,64                ; vmovq         %xmm11,(%r8,%rax,2)
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  116,240                             ; je            51a6 <_sk_store_u16_be_avx+0xf6>
+  DB  116,240                             ; je            51ae <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,23,92,64,8               ; vmovhpd       %xmm11,0x8(%r8,%rax,2)
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,227                             ; jb            51a6 <_sk_store_u16_be_avx+0xf6>
+  DB  114,227                             ; jb            51ae <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,214,84,64,16             ; vmovq         %xmm10,0x10(%r8,%rax,2)
-  DB  116,218                             ; je            51a6 <_sk_store_u16_be_avx+0xf6>
+  DB  116,218                             ; je            51ae <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,23,84,64,24              ; vmovhpd       %xmm10,0x18(%r8,%rax,2)
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,205                             ; jb            51a6 <_sk_store_u16_be_avx+0xf6>
+  DB  114,205                             ; jb            51ae <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,214,76,64,32             ; vmovq         %xmm9,0x20(%r8,%rax,2)
-  DB  116,196                             ; je            51a6 <_sk_store_u16_be_avx+0xf6>
+  DB  116,196                             ; je            51ae <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,23,76,64,40              ; vmovhpd       %xmm9,0x28(%r8,%rax,2)
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  114,183                             ; jb            51a6 <_sk_store_u16_be_avx+0xf6>
+  DB  114,183                             ; jb            51ae <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,214,68,64,48             ; vmovq         %xmm8,0x30(%r8,%rax,2)
-  DB  235,174                             ; jmp           51a6 <_sk_store_u16_be_avx+0xf6>
+  DB  235,174                             ; jmp           51ae <_sk_store_u16_be_avx+0xf6>
 
 PUBLIC _sk_load_f32_avx
 _sk_load_f32_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  119,110                             ; ja            526e <_sk_load_f32_avx+0x76>
+  DB  119,110                             ; ja            5276 <_sk_load_f32_avx+0x76>
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  76,141,12,189,0,0,0,0               ; lea           0x0(,%rdi,4),%r9
-  DB  76,141,21,134,0,0,0                 ; lea           0x86(%rip),%r10        # 5298 <_sk_load_f32_avx+0xa0>
+  DB  76,141,21,134,0,0,0                 ; lea           0x86(%rip),%r10        # 52a0 <_sk_load_f32_avx+0xa0>
   DB  73,99,4,138                         ; movslq        (%r10,%rcx,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -9841,7 +9843,7 @@
   DB  196,65,37,20,196                    ; vunpcklpd     %ymm12,%ymm11,%ymm8
   DB  196,65,37,21,220                    ; vunpckhpd     %ymm12,%ymm11,%ymm11
   DB  72,133,201                          ; test          %rcx,%rcx
-  DB  117,55                              ; jne           5325 <_sk_store_f32_avx+0x6d>
+  DB  117,55                              ; jne           532d <_sk_store_f32_avx+0x6d>
   DB  196,67,45,24,225,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm12
   DB  196,67,61,24,235,1                  ; vinsertf128   $0x1,%xmm11,%ymm8,%ymm13
   DB  196,67,45,6,201,49                  ; vperm2f128    $0x31,%ymm9,%ymm10,%ymm9
@@ -9854,22 +9856,22 @@
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,17,20,128                ; vmovupd       %xmm10,(%r8,%rax,4)
   DB  72,131,249,1                        ; cmp           $0x1,%rcx
-  DB  116,240                             ; je            5321 <_sk_store_f32_avx+0x69>
+  DB  116,240                             ; je            5329 <_sk_store_f32_avx+0x69>
   DB  196,65,121,17,76,128,16             ; vmovupd       %xmm9,0x10(%r8,%rax,4)
   DB  72,131,249,3                        ; cmp           $0x3,%rcx
-  DB  114,227                             ; jb            5321 <_sk_store_f32_avx+0x69>
+  DB  114,227                             ; jb            5329 <_sk_store_f32_avx+0x69>
   DB  196,65,121,17,68,128,32             ; vmovupd       %xmm8,0x20(%r8,%rax,4)
-  DB  116,218                             ; je            5321 <_sk_store_f32_avx+0x69>
+  DB  116,218                             ; je            5329 <_sk_store_f32_avx+0x69>
   DB  196,65,121,17,92,128,48             ; vmovupd       %xmm11,0x30(%r8,%rax,4)
   DB  72,131,249,5                        ; cmp           $0x5,%rcx
-  DB  114,205                             ; jb            5321 <_sk_store_f32_avx+0x69>
+  DB  114,205                             ; jb            5329 <_sk_store_f32_avx+0x69>
   DB  196,67,125,25,84,128,64,1           ; vextractf128  $0x1,%ymm10,0x40(%r8,%rax,4)
-  DB  116,195                             ; je            5321 <_sk_store_f32_avx+0x69>
+  DB  116,195                             ; je            5329 <_sk_store_f32_avx+0x69>
   DB  196,67,125,25,76,128,80,1           ; vextractf128  $0x1,%ymm9,0x50(%r8,%rax,4)
   DB  72,131,249,7                        ; cmp           $0x7,%rcx
-  DB  114,181                             ; jb            5321 <_sk_store_f32_avx+0x69>
+  DB  114,181                             ; jb            5329 <_sk_store_f32_avx+0x69>
   DB  196,67,125,25,68,128,96,1           ; vextractf128  $0x1,%ymm8,0x60(%r8,%rax,4)
-  DB  235,171                             ; jmp           5321 <_sk_store_f32_avx+0x69>
+  DB  235,171                             ; jmp           5329 <_sk_store_f32_avx+0x69>
 
 PUBLIC _sk_clamp_x_avx
 _sk_clamp_x_avx LABEL PROC
@@ -9961,12 +9963,12 @@
 
 PUBLIC _sk_luminance_to_alpha_avx
 _sk_luminance_to_alpha_avx LABEL PROC
-  DB  196,226,125,24,29,131,19,0,0        ; vbroadcastss  0x1383(%rip),%ymm3        # 6828 <_sk_callback_avx+0x451>
+  DB  196,226,125,24,29,131,19,0,0        ; vbroadcastss  0x1383(%rip),%ymm3        # 6830 <_sk_callback_avx+0x451>
   DB  197,252,89,195                      ; vmulps        %ymm3,%ymm0,%ymm0
-  DB  196,226,125,24,29,122,19,0,0        ; vbroadcastss  0x137a(%rip),%ymm3        # 682c <_sk_callback_avx+0x455>
+  DB  196,226,125,24,29,122,19,0,0        ; vbroadcastss  0x137a(%rip),%ymm3        # 6834 <_sk_callback_avx+0x455>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,109,19,0,0        ; vbroadcastss  0x136d(%rip),%ymm1        # 6830 <_sk_callback_avx+0x459>
+  DB  196,226,125,24,13,109,19,0,0        ; vbroadcastss  0x136d(%rip),%ymm1        # 6838 <_sk_callback_avx+0x459>
   DB  197,236,89,201                      ; vmulps        %ymm1,%ymm2,%ymm1
   DB  197,252,88,217                      ; vaddps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -10173,9 +10175,9 @@
   DB  72,139,24                           ; mov           (%rax),%rbx
   DB  72,139,104,8                        ; mov           0x8(%rax),%rbp
   DB  72,255,203                          ; dec           %rbx
-  DB  120,7                               ; js            5819 <_sk_evenly_spaced_gradient_avx+0x1f>
+  DB  120,7                               ; js            5821 <_sk_evenly_spaced_gradient_avx+0x1f>
   DB  196,225,242,42,203                  ; vcvtsi2ss     %rbx,%xmm1,%xmm1
-  DB  235,21                              ; jmp           582e <_sk_evenly_spaced_gradient_avx+0x34>
+  DB  235,21                              ; jmp           5836 <_sk_evenly_spaced_gradient_avx+0x34>
   DB  73,137,216                          ; mov           %rbx,%r8
   DB  73,209,232                          ; shr           %r8
   DB  131,227,1                           ; and           $0x1,%ebx
@@ -10340,12 +10342,12 @@
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  197,244,87,201                      ; vxorps        %ymm1,%ymm1,%ymm1
   DB  73,131,248,2                        ; cmp           $0x2,%r8
-  DB  114,80                              ; jb            5bbc <_sk_gradient_avx+0x69>
+  DB  114,80                              ; jb            5bc4 <_sk_gradient_avx+0x69>
   DB  72,139,88,72                        ; mov           0x48(%rax),%rbx
   DB  73,255,200                          ; dec           %r8
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  196,65,52,87,201                    ; vxorps        %ymm9,%ymm9,%ymm9
-  DB  196,98,125,24,21,175,12,0,0         ; vbroadcastss  0xcaf(%rip),%ymm10        # 6834 <_sk_callback_avx+0x45d>
+  DB  196,98,125,24,21,175,12,0,0         ; vbroadcastss  0xcaf(%rip),%ymm10        # 683c <_sk_callback_avx+0x45d>
   DB  197,244,87,201                      ; vxorps        %ymm1,%ymm1,%ymm1
   DB  196,98,125,24,3                     ; vbroadcastss  (%rbx),%ymm8
   DB  197,60,194,192,2                    ; vcmpleps      %ymm0,%ymm8,%ymm8
@@ -10357,7 +10359,7 @@
   DB  196,227,117,24,202,1                ; vinsertf128   $0x1,%xmm2,%ymm1,%ymm1
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  73,255,200                          ; dec           %r8
-  DB  117,205                             ; jne           5b89 <_sk_gradient_avx+0x36>
+  DB  117,205                             ; jne           5b91 <_sk_gradient_avx+0x36>
   DB  196,195,249,22,200,1                ; vpextrq       $0x1,%xmm1,%r8
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  73,193,232,32                       ; shr           $0x20,%r8
@@ -10535,27 +10537,27 @@
   DB  196,65,52,95,226                    ; vmaxps        %ymm10,%ymm9,%ymm12
   DB  196,65,36,94,220                    ; vdivps        %ymm12,%ymm11,%ymm11
   DB  196,65,36,89,227                    ; vmulps        %ymm11,%ymm11,%ymm12
-  DB  196,98,125,24,45,211,8,0,0          ; vbroadcastss  0x8d3(%rip),%ymm13        # 6838 <_sk_callback_avx+0x461>
+  DB  196,98,125,24,45,211,8,0,0          ; vbroadcastss  0x8d3(%rip),%ymm13        # 6840 <_sk_callback_avx+0x461>
   DB  196,65,28,89,237                    ; vmulps        %ymm13,%ymm12,%ymm13
-  DB  196,98,125,24,53,201,8,0,0          ; vbroadcastss  0x8c9(%rip),%ymm14        # 683c <_sk_callback_avx+0x465>
+  DB  196,98,125,24,53,201,8,0,0          ; vbroadcastss  0x8c9(%rip),%ymm14        # 6844 <_sk_callback_avx+0x465>
   DB  196,65,20,88,238                    ; vaddps        %ymm14,%ymm13,%ymm13
   DB  196,65,28,89,237                    ; vmulps        %ymm13,%ymm12,%ymm13
-  DB  196,98,125,24,53,186,8,0,0          ; vbroadcastss  0x8ba(%rip),%ymm14        # 6840 <_sk_callback_avx+0x469>
+  DB  196,98,125,24,53,186,8,0,0          ; vbroadcastss  0x8ba(%rip),%ymm14        # 6848 <_sk_callback_avx+0x469>
   DB  196,65,20,88,238                    ; vaddps        %ymm14,%ymm13,%ymm13
   DB  196,65,28,89,229                    ; vmulps        %ymm13,%ymm12,%ymm12
-  DB  196,98,125,24,45,171,8,0,0          ; vbroadcastss  0x8ab(%rip),%ymm13        # 6844 <_sk_callback_avx+0x46d>
+  DB  196,98,125,24,45,171,8,0,0          ; vbroadcastss  0x8ab(%rip),%ymm13        # 684c <_sk_callback_avx+0x46d>
   DB  196,65,28,88,229                    ; vaddps        %ymm13,%ymm12,%ymm12
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
   DB  196,65,52,194,202,1                 ; vcmpltps      %ymm10,%ymm9,%ymm9
-  DB  196,98,125,24,21,150,8,0,0          ; vbroadcastss  0x896(%rip),%ymm10        # 6848 <_sk_callback_avx+0x471>
+  DB  196,98,125,24,21,150,8,0,0          ; vbroadcastss  0x896(%rip),%ymm10        # 6850 <_sk_callback_avx+0x471>
   DB  196,65,44,92,211                    ; vsubps        %ymm11,%ymm10,%ymm10
   DB  196,67,37,74,202,144                ; vblendvps     %ymm9,%ymm10,%ymm11,%ymm9
   DB  196,193,124,194,192,1               ; vcmpltps      %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,21,128,8,0,0          ; vbroadcastss  0x880(%rip),%ymm10        # 684c <_sk_callback_avx+0x475>
+  DB  196,98,125,24,21,128,8,0,0          ; vbroadcastss  0x880(%rip),%ymm10        # 6854 <_sk_callback_avx+0x475>
   DB  196,65,44,92,209                    ; vsubps        %ymm9,%ymm10,%ymm10
   DB  196,195,53,74,194,0                 ; vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   DB  196,65,116,194,200,1                ; vcmpltps      %ymm8,%ymm1,%ymm9
-  DB  196,98,125,24,21,106,8,0,0          ; vbroadcastss  0x86a(%rip),%ymm10        # 6850 <_sk_callback_avx+0x479>
+  DB  196,98,125,24,21,106,8,0,0          ; vbroadcastss  0x86a(%rip),%ymm10        # 6858 <_sk_callback_avx+0x479>
   DB  197,44,92,208                       ; vsubps        %ymm0,%ymm10,%ymm10
   DB  196,195,125,74,194,144              ; vblendvps     %ymm9,%ymm10,%ymm0,%ymm0
   DB  196,65,124,194,200,3                ; vcmpunordps   %ymm8,%ymm0,%ymm9
@@ -10575,7 +10577,7 @@
 PUBLIC _sk_save_xy_avx
 _sk_save_xy_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,52,8,0,0            ; vbroadcastss  0x834(%rip),%ymm8        # 6854 <_sk_callback_avx+0x47d>
+  DB  196,98,125,24,5,52,8,0,0            ; vbroadcastss  0x834(%rip),%ymm8        # 685c <_sk_callback_avx+0x47d>
   DB  196,65,124,88,200                   ; vaddps        %ymm8,%ymm0,%ymm9
   DB  196,67,125,8,209,1                  ; vroundps      $0x1,%ymm9,%ymm10
   DB  196,65,52,92,202                    ; vsubps        %ymm10,%ymm9,%ymm9
@@ -10608,9 +10610,9 @@
 PUBLIC _sk_bilinear_nx_avx
 _sk_bilinear_nx_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,192,7,0,0          ; vbroadcastss  0x7c0(%rip),%ymm0        # 6858 <_sk_callback_avx+0x481>
+  DB  196,226,125,24,5,192,7,0,0          ; vbroadcastss  0x7c0(%rip),%ymm0        # 6860 <_sk_callback_avx+0x481>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,183,7,0,0           ; vbroadcastss  0x7b7(%rip),%ymm8        # 685c <_sk_callback_avx+0x485>
+  DB  196,98,125,24,5,183,7,0,0           ; vbroadcastss  0x7b7(%rip),%ymm8        # 6864 <_sk_callback_avx+0x485>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -10619,7 +10621,7 @@
 PUBLIC _sk_bilinear_px_avx
 _sk_bilinear_px_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,159,7,0,0          ; vbroadcastss  0x79f(%rip),%ymm0        # 6860 <_sk_callback_avx+0x489>
+  DB  196,226,125,24,5,159,7,0,0          ; vbroadcastss  0x79f(%rip),%ymm0        # 6868 <_sk_callback_avx+0x489>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
   DB  197,124,16,64,64                    ; vmovups       0x40(%rax),%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -10629,9 +10631,9 @@
 PUBLIC _sk_bilinear_ny_avx
 _sk_bilinear_ny_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,131,7,0,0         ; vbroadcastss  0x783(%rip),%ymm1        # 6864 <_sk_callback_avx+0x48d>
+  DB  196,226,125,24,13,131,7,0,0         ; vbroadcastss  0x783(%rip),%ymm1        # 686c <_sk_callback_avx+0x48d>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,121,7,0,0           ; vbroadcastss  0x779(%rip),%ymm8        # 6868 <_sk_callback_avx+0x491>
+  DB  196,98,125,24,5,121,7,0,0           ; vbroadcastss  0x779(%rip),%ymm8        # 6870 <_sk_callback_avx+0x491>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -10640,7 +10642,7 @@
 PUBLIC _sk_bilinear_py_avx
 _sk_bilinear_py_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,97,7,0,0          ; vbroadcastss  0x761(%rip),%ymm1        # 686c <_sk_callback_avx+0x495>
+  DB  196,226,125,24,13,97,7,0,0          ; vbroadcastss  0x761(%rip),%ymm1        # 6874 <_sk_callback_avx+0x495>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
   DB  197,124,16,64,96                    ; vmovups       0x60(%rax),%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -10650,14 +10652,14 @@
 PUBLIC _sk_bicubic_n3x_avx
 _sk_bicubic_n3x_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,68,7,0,0           ; vbroadcastss  0x744(%rip),%ymm0        # 6870 <_sk_callback_avx+0x499>
+  DB  196,226,125,24,5,68,7,0,0           ; vbroadcastss  0x744(%rip),%ymm0        # 6878 <_sk_callback_avx+0x499>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,59,7,0,0            ; vbroadcastss  0x73b(%rip),%ymm8        # 6874 <_sk_callback_avx+0x49d>
+  DB  196,98,125,24,5,59,7,0,0            ; vbroadcastss  0x73b(%rip),%ymm8        # 687c <_sk_callback_avx+0x49d>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,44,7,0,0           ; vbroadcastss  0x72c(%rip),%ymm10        # 6878 <_sk_callback_avx+0x4a1>
+  DB  196,98,125,24,21,44,7,0,0           ; vbroadcastss  0x72c(%rip),%ymm10        # 6880 <_sk_callback_avx+0x4a1>
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
-  DB  196,98,125,24,21,34,7,0,0           ; vbroadcastss  0x722(%rip),%ymm10        # 687c <_sk_callback_avx+0x4a5>
+  DB  196,98,125,24,21,34,7,0,0           ; vbroadcastss  0x722(%rip),%ymm10        # 6884 <_sk_callback_avx+0x4a5>
   DB  196,65,60,88,194                    ; vaddps        %ymm10,%ymm8,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -10667,19 +10669,19 @@
 PUBLIC _sk_bicubic_n1x_avx
 _sk_bicubic_n1x_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,5,7,0,0            ; vbroadcastss  0x705(%rip),%ymm0        # 6880 <_sk_callback_avx+0x4a9>
+  DB  196,226,125,24,5,5,7,0,0            ; vbroadcastss  0x705(%rip),%ymm0        # 6888 <_sk_callback_avx+0x4a9>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,252,6,0,0           ; vbroadcastss  0x6fc(%rip),%ymm8        # 6884 <_sk_callback_avx+0x4ad>
+  DB  196,98,125,24,5,252,6,0,0           ; vbroadcastss  0x6fc(%rip),%ymm8        # 688c <_sk_callback_avx+0x4ad>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
-  DB  196,98,125,24,13,242,6,0,0          ; vbroadcastss  0x6f2(%rip),%ymm9        # 6888 <_sk_callback_avx+0x4b1>
+  DB  196,98,125,24,13,242,6,0,0          ; vbroadcastss  0x6f2(%rip),%ymm9        # 6890 <_sk_callback_avx+0x4b1>
   DB  196,65,60,89,201                    ; vmulps        %ymm9,%ymm8,%ymm9
-  DB  196,98,125,24,21,232,6,0,0          ; vbroadcastss  0x6e8(%rip),%ymm10        # 688c <_sk_callback_avx+0x4b5>
+  DB  196,98,125,24,21,232,6,0,0          ; vbroadcastss  0x6e8(%rip),%ymm10        # 6894 <_sk_callback_avx+0x4b5>
   DB  196,65,52,88,202                    ; vaddps        %ymm10,%ymm9,%ymm9
   DB  196,65,60,89,201                    ; vmulps        %ymm9,%ymm8,%ymm9
-  DB  196,98,125,24,21,217,6,0,0          ; vbroadcastss  0x6d9(%rip),%ymm10        # 6890 <_sk_callback_avx+0x4b9>
+  DB  196,98,125,24,21,217,6,0,0          ; vbroadcastss  0x6d9(%rip),%ymm10        # 6898 <_sk_callback_avx+0x4b9>
   DB  196,65,52,88,202                    ; vaddps        %ymm10,%ymm9,%ymm9
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
-  DB  196,98,125,24,13,202,6,0,0          ; vbroadcastss  0x6ca(%rip),%ymm9        # 6894 <_sk_callback_avx+0x4bd>
+  DB  196,98,125,24,13,202,6,0,0          ; vbroadcastss  0x6ca(%rip),%ymm9        # 689c <_sk_callback_avx+0x4bd>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -10688,17 +10690,17 @@
 PUBLIC _sk_bicubic_p1x_avx
 _sk_bicubic_p1x_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,178,6,0,0           ; vbroadcastss  0x6b2(%rip),%ymm8        # 6898 <_sk_callback_avx+0x4c1>
+  DB  196,98,125,24,5,178,6,0,0           ; vbroadcastss  0x6b2(%rip),%ymm8        # 68a0 <_sk_callback_avx+0x4c1>
   DB  197,188,88,0                        ; vaddps        (%rax),%ymm8,%ymm0
   DB  197,124,16,72,64                    ; vmovups       0x40(%rax),%ymm9
-  DB  196,98,125,24,21,164,6,0,0          ; vbroadcastss  0x6a4(%rip),%ymm10        # 689c <_sk_callback_avx+0x4c5>
+  DB  196,98,125,24,21,164,6,0,0          ; vbroadcastss  0x6a4(%rip),%ymm10        # 68a4 <_sk_callback_avx+0x4c5>
   DB  196,65,52,89,210                    ; vmulps        %ymm10,%ymm9,%ymm10
-  DB  196,98,125,24,29,154,6,0,0          ; vbroadcastss  0x69a(%rip),%ymm11        # 68a0 <_sk_callback_avx+0x4c9>
+  DB  196,98,125,24,29,154,6,0,0          ; vbroadcastss  0x69a(%rip),%ymm11        # 68a8 <_sk_callback_avx+0x4c9>
   DB  196,65,44,88,211                    ; vaddps        %ymm11,%ymm10,%ymm10
   DB  196,65,52,89,210                    ; vmulps        %ymm10,%ymm9,%ymm10
   DB  196,65,44,88,192                    ; vaddps        %ymm8,%ymm10,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
-  DB  196,98,125,24,13,129,6,0,0          ; vbroadcastss  0x681(%rip),%ymm9        # 68a4 <_sk_callback_avx+0x4cd>
+  DB  196,98,125,24,13,129,6,0,0          ; vbroadcastss  0x681(%rip),%ymm9        # 68ac <_sk_callback_avx+0x4cd>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -10707,13 +10709,13 @@
 PUBLIC _sk_bicubic_p3x_avx
 _sk_bicubic_p3x_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,105,6,0,0          ; vbroadcastss  0x669(%rip),%ymm0        # 68a8 <_sk_callback_avx+0x4d1>
+  DB  196,226,125,24,5,105,6,0,0          ; vbroadcastss  0x669(%rip),%ymm0        # 68b0 <_sk_callback_avx+0x4d1>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
   DB  197,124,16,64,64                    ; vmovups       0x40(%rax),%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,86,6,0,0           ; vbroadcastss  0x656(%rip),%ymm10        # 68ac <_sk_callback_avx+0x4d5>
+  DB  196,98,125,24,21,86,6,0,0           ; vbroadcastss  0x656(%rip),%ymm10        # 68b4 <_sk_callback_avx+0x4d5>
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
-  DB  196,98,125,24,21,76,6,0,0           ; vbroadcastss  0x64c(%rip),%ymm10        # 68b0 <_sk_callback_avx+0x4d9>
+  DB  196,98,125,24,21,76,6,0,0           ; vbroadcastss  0x64c(%rip),%ymm10        # 68b8 <_sk_callback_avx+0x4d9>
   DB  196,65,60,88,194                    ; vaddps        %ymm10,%ymm8,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -10723,14 +10725,14 @@
 PUBLIC _sk_bicubic_n3y_avx
 _sk_bicubic_n3y_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,47,6,0,0          ; vbroadcastss  0x62f(%rip),%ymm1        # 68b4 <_sk_callback_avx+0x4dd>
+  DB  196,226,125,24,13,47,6,0,0          ; vbroadcastss  0x62f(%rip),%ymm1        # 68bc <_sk_callback_avx+0x4dd>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,37,6,0,0            ; vbroadcastss  0x625(%rip),%ymm8        # 68b8 <_sk_callback_avx+0x4e1>
+  DB  196,98,125,24,5,37,6,0,0            ; vbroadcastss  0x625(%rip),%ymm8        # 68c0 <_sk_callback_avx+0x4e1>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,22,6,0,0           ; vbroadcastss  0x616(%rip),%ymm10        # 68bc <_sk_callback_avx+0x4e5>
+  DB  196,98,125,24,21,22,6,0,0           ; vbroadcastss  0x616(%rip),%ymm10        # 68c4 <_sk_callback_avx+0x4e5>
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
-  DB  196,98,125,24,21,12,6,0,0           ; vbroadcastss  0x60c(%rip),%ymm10        # 68c0 <_sk_callback_avx+0x4e9>
+  DB  196,98,125,24,21,12,6,0,0           ; vbroadcastss  0x60c(%rip),%ymm10        # 68c8 <_sk_callback_avx+0x4e9>
   DB  196,65,60,88,194                    ; vaddps        %ymm10,%ymm8,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -10740,19 +10742,19 @@
 PUBLIC _sk_bicubic_n1y_avx
 _sk_bicubic_n1y_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,239,5,0,0         ; vbroadcastss  0x5ef(%rip),%ymm1        # 68c4 <_sk_callback_avx+0x4ed>
+  DB  196,226,125,24,13,239,5,0,0         ; vbroadcastss  0x5ef(%rip),%ymm1        # 68cc <_sk_callback_avx+0x4ed>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,229,5,0,0           ; vbroadcastss  0x5e5(%rip),%ymm8        # 68c8 <_sk_callback_avx+0x4f1>
+  DB  196,98,125,24,5,229,5,0,0           ; vbroadcastss  0x5e5(%rip),%ymm8        # 68d0 <_sk_callback_avx+0x4f1>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
-  DB  196,98,125,24,13,219,5,0,0          ; vbroadcastss  0x5db(%rip),%ymm9        # 68cc <_sk_callback_avx+0x4f5>
+  DB  196,98,125,24,13,219,5,0,0          ; vbroadcastss  0x5db(%rip),%ymm9        # 68d4 <_sk_callback_avx+0x4f5>
   DB  196,65,60,89,201                    ; vmulps        %ymm9,%ymm8,%ymm9
-  DB  196,98,125,24,21,209,5,0,0          ; vbroadcastss  0x5d1(%rip),%ymm10        # 68d0 <_sk_callback_avx+0x4f9>
+  DB  196,98,125,24,21,209,5,0,0          ; vbroadcastss  0x5d1(%rip),%ymm10        # 68d8 <_sk_callback_avx+0x4f9>
   DB  196,65,52,88,202                    ; vaddps        %ymm10,%ymm9,%ymm9
   DB  196,65,60,89,201                    ; vmulps        %ymm9,%ymm8,%ymm9
-  DB  196,98,125,24,21,194,5,0,0          ; vbroadcastss  0x5c2(%rip),%ymm10        # 68d4 <_sk_callback_avx+0x4fd>
+  DB  196,98,125,24,21,194,5,0,0          ; vbroadcastss  0x5c2(%rip),%ymm10        # 68dc <_sk_callback_avx+0x4fd>
   DB  196,65,52,88,202                    ; vaddps        %ymm10,%ymm9,%ymm9
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
-  DB  196,98,125,24,13,179,5,0,0          ; vbroadcastss  0x5b3(%rip),%ymm9        # 68d8 <_sk_callback_avx+0x501>
+  DB  196,98,125,24,13,179,5,0,0          ; vbroadcastss  0x5b3(%rip),%ymm9        # 68e0 <_sk_callback_avx+0x501>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -10761,17 +10763,17 @@
 PUBLIC _sk_bicubic_p1y_avx
 _sk_bicubic_p1y_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,155,5,0,0           ; vbroadcastss  0x59b(%rip),%ymm8        # 68dc <_sk_callback_avx+0x505>
+  DB  196,98,125,24,5,155,5,0,0           ; vbroadcastss  0x59b(%rip),%ymm8        # 68e4 <_sk_callback_avx+0x505>
   DB  197,188,88,72,32                    ; vaddps        0x20(%rax),%ymm8,%ymm1
   DB  197,124,16,72,96                    ; vmovups       0x60(%rax),%ymm9
-  DB  196,98,125,24,21,140,5,0,0          ; vbroadcastss  0x58c(%rip),%ymm10        # 68e0 <_sk_callback_avx+0x509>
+  DB  196,98,125,24,21,140,5,0,0          ; vbroadcastss  0x58c(%rip),%ymm10        # 68e8 <_sk_callback_avx+0x509>
   DB  196,65,52,89,210                    ; vmulps        %ymm10,%ymm9,%ymm10
-  DB  196,98,125,24,29,130,5,0,0          ; vbroadcastss  0x582(%rip),%ymm11        # 68e4 <_sk_callback_avx+0x50d>
+  DB  196,98,125,24,29,130,5,0,0          ; vbroadcastss  0x582(%rip),%ymm11        # 68ec <_sk_callback_avx+0x50d>
   DB  196,65,44,88,211                    ; vaddps        %ymm11,%ymm10,%ymm10
   DB  196,65,52,89,210                    ; vmulps        %ymm10,%ymm9,%ymm10
   DB  196,65,44,88,192                    ; vaddps        %ymm8,%ymm10,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
-  DB  196,98,125,24,13,105,5,0,0          ; vbroadcastss  0x569(%rip),%ymm9        # 68e8 <_sk_callback_avx+0x511>
+  DB  196,98,125,24,13,105,5,0,0          ; vbroadcastss  0x569(%rip),%ymm9        # 68f0 <_sk_callback_avx+0x511>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -10780,13 +10782,13 @@
 PUBLIC _sk_bicubic_p3y_avx
 _sk_bicubic_p3y_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,81,5,0,0          ; vbroadcastss  0x551(%rip),%ymm1        # 68ec <_sk_callback_avx+0x515>
+  DB  196,226,125,24,13,81,5,0,0          ; vbroadcastss  0x551(%rip),%ymm1        # 68f4 <_sk_callback_avx+0x515>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
   DB  197,124,16,64,96                    ; vmovups       0x60(%rax),%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,61,5,0,0           ; vbroadcastss  0x53d(%rip),%ymm10        # 68f0 <_sk_callback_avx+0x519>
+  DB  196,98,125,24,21,61,5,0,0           ; vbroadcastss  0x53d(%rip),%ymm10        # 68f8 <_sk_callback_avx+0x519>
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
-  DB  196,98,125,24,21,51,5,0,0           ; vbroadcastss  0x533(%rip),%ymm10        # 68f4 <_sk_callback_avx+0x51d>
+  DB  196,98,125,24,21,51,5,0,0           ; vbroadcastss  0x533(%rip),%ymm10        # 68fc <_sk_callback_avx+0x51d>
   DB  196,65,60,88,194                    ; vaddps        %ymm10,%ymm8,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -10900,25 +10902,25 @@
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 65a1 <.literal4+0xb1>
+  DB  71,225,61                           ; rex.RXB       loope 65a9 <.literal4+0xb1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 65b1 <.literal4+0xc1>
+  DB  71,225,61                           ; rex.RXB       loope 65b9 <.literal4+0xc1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 65c1 <.literal4+0xd1>
+  DB  71,225,61                           ; rex.RXB       loope 65c9 <.literal4+0xd1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 65d1 <.literal4+0xe1>
+  DB  71,225,61                           ; rex.RXB       loope 65d9 <.literal4+0xe1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -10966,7 +10968,7 @@
   DB  190,129,128,128,59                  ; mov           $0x3b808081,%esi
   DB  129,128,128,59,0,248,0,0,8,33       ; addl          $0x21080000,-0x7ffc480(%rax)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        661d <.literal4+0x12d>
+  DB  224,7                               ; loopne        6625 <.literal4+0x12d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -10982,10 +10984,10 @@
   DB  129,128,128,59,129,128,128,59,0,0   ; addl          $0x3b80,-0x7f7ec480(%rax)
   DB  0,52,255                            ; add           %dh,(%rdi,%rdi,8)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6644 <.literal4+0x154>
+  DB  127,0                               ; jg            664c <.literal4+0x154>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            66bd <.literal4+0x1cd>
+  DB  119,115                             ; ja            66c5 <.literal4+0x1cd>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -10999,10 +11001,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6678 <.literal4+0x188>
+  DB  127,0                               ; jg            6680 <.literal4+0x188>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            66f1 <.literal4+0x201>
+  DB  119,115                             ; ja            66f9 <.literal4+0x201>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -11016,10 +11018,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            66ac <.literal4+0x1bc>
+  DB  127,0                               ; jg            66b4 <.literal4+0x1bc>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            6725 <.literal4+0x235>
+  DB  119,115                             ; ja            672d <.literal4+0x235>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -11033,10 +11035,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            66e0 <.literal4+0x1f0>
+  DB  127,0                               ; jg            66e8 <.literal4+0x1f0>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            6759 <.literal4+0x269>
+  DB  119,115                             ; ja            6761 <.literal4+0x269>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -11049,7 +11051,7 @@
   DB  0,75,0                              ; add           %cl,0x0(%rbx)
   DB  0,128,63,0,0,200                    ; add           %al,-0x37ffffc1(%rax)
   DB  66,0,0                              ; rex.X         add %al,(%rax)
-  DB  127,67                              ; jg            6757 <.literal4+0x267>
+  DB  127,67                              ; jg            675f <.literal4+0x267>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,195                               ; add           %al,%bl
   DB  0,0                                 ; add           %al,(%rax)
@@ -11061,10 +11063,10 @@
   DB  190,80,128,3,62                     ; mov           $0x3e038050,%esi
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           6777 <.literal4+0x287>
+  DB  118,63                              ; jbe           677f <.literal4+0x287>
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  129,128,128,59,129,128,128,59,0,0   ; addl          $0x3b80,-0x7f7ec480(%rax)
-  DB  127,67                              ; jg            678b <.literal4+0x29b>
+  DB  127,67                              ; jg            6793 <.literal4+0x29b>
   DB  129,128,128,59,0,0,128,63,129,128   ; addl          $0x80813f80,0x3b80(%rax)
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
   DB  0,128,63,129,128,128                ; add           %al,-0x7f7f7ec1(%rax)
@@ -11073,7 +11075,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        676d <.literal4+0x27d>
+  DB  224,7                               ; loopne        6775 <.literal4+0x27d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -11085,7 +11087,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6789 <.literal4+0x299>
+  DB  224,7                               ; loopne        6791 <.literal4+0x299>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -11096,7 +11098,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  248                                 ; clc
   DB  65,0,0                              ; add           %al,(%r8)
-  DB  124,66                              ; jl            67de <.literal4+0x2ee>
+  DB  124,66                              ; jl            67e6 <.literal4+0x2ee>
   DB  0,240                               ; add           %dh,%al
   DB  0,0                                 ; add           %al,(%rax)
   DB  137,136,136,55,0,15                 ; mov           %ecx,0xf003788(%rax)
@@ -11114,9 +11116,9 @@
   DB  137,136,136,59,15,0                 ; mov           %ecx,0xf3b88(%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  137,136,136,61,0,0                  ; mov           %ecx,0x3d88(%rax)
-  DB  112,65                              ; jo            6821 <.literal4+0x331>
+  DB  112,65                              ; jo            6829 <.literal4+0x331>
   DB  129,128,128,59,129,128,128,59,0,0   ; addl          $0x3b80,-0x7f7ec480(%rax)
-  DB  127,67                              ; jg            682f <.literal4+0x33f>
+  DB  127,67                              ; jg            6837 <.literal4+0x33f>
   DB  0,128,0,0,0,0                       ; add           %al,0x0(%rax)
   DB  0,128,0,4,0,128                     ; add           %al,-0x7ffffc00(%rax)
   DB  0,0                                 ; add           %al,(%rax)
@@ -11132,7 +11134,7 @@
   DB  0,128,55,0,0,128                    ; add           %al,-0x7fffffc9(%rax)
   DB  63                                  ; (bad)
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            686f <.literal4+0x37f>
+  DB  127,71                              ; jg            6877 <.literal4+0x37f>
   DB  208                                 ; (bad)
   DB  179,89                              ; mov           $0x59,%bl
   DB  62,89                               ; ds            pop %rcx
@@ -11383,7 +11385,7 @@
   DB  102,15,110,199                      ; movd          %edi,%xmm0
   DB  102,15,112,192,0                    ; pshufd        $0x0,%xmm0,%xmm0
   DB  15,91,200                           ; cvtdq2ps      %xmm0,%xmm1
-  DB  15,40,21,97,71,0,0                  ; movaps        0x4761(%rip),%xmm2        # 4870 <_sk_callback_sse41+0xb7>
+  DB  15,40,21,81,71,0,0                  ; movaps        0x4751(%rip),%xmm2        # 4860 <_sk_callback_sse41+0xad>
   DB  15,88,202                           ; addps         %xmm2,%xmm1
   DB  15,16,2                             ; movups        (%rdx),%xmm0
   DB  15,88,193                           ; addps         %xmm1,%xmm0
@@ -11392,7 +11394,7 @@
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  15,88,202                           ; addps         %xmm2,%xmm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,21,80,71,0,0                  ; movaps        0x4750(%rip),%xmm2        # 4880 <_sk_callback_sse41+0xc7>
+  DB  15,40,21,64,71,0,0                  ; movaps        0x4740(%rip),%xmm2        # 4870 <_sk_callback_sse41+0xbd>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
   DB  15,87,237                           ; xorps         %xmm5,%xmm5
@@ -11405,22 +11407,20 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  102,68,15,110,199                   ; movd          %edi,%xmm8
   DB  102,69,15,112,192,0                 ; pshufd        $0x0,%xmm8,%xmm8
-  DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,16,10                         ; movups        (%rdx),%xmm9
-  DB  69,15,88,200                        ; addps         %xmm8,%xmm9
-  DB  243,69,15,91,201                    ; cvttps2dq     %xmm9,%xmm9
+  DB  243,68,15,111,74,32                 ; movdqu        0x20(%rdx),%xmm9
+  DB  102,69,15,254,200                   ; paddd         %xmm8,%xmm9
   DB  72,139,8                            ; mov           (%rax),%rcx
   DB  102,68,15,110,1                     ; movd          (%rcx),%xmm8
   DB  102,69,15,112,192,0                 ; pshufd        $0x0,%xmm8,%xmm8
   DB  102,69,15,239,193                   ; pxor          %xmm9,%xmm8
-  DB  102,68,15,111,21,21,71,0,0          ; movdqa        0x4715(%rip),%xmm10        # 4890 <_sk_callback_sse41+0xd7>
+  DB  102,68,15,111,21,11,71,0,0          ; movdqa        0x470b(%rip),%xmm10        # 4880 <_sk_callback_sse41+0xcd>
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
   DB  102,69,15,219,218                   ; pand          %xmm10,%xmm11
   DB  102,65,15,114,243,5                 ; pslld         $0x5,%xmm11
   DB  102,69,15,219,209                   ; pand          %xmm9,%xmm10
   DB  102,65,15,114,242,4                 ; pslld         $0x4,%xmm10
-  DB  102,68,15,111,37,1,71,0,0           ; movdqa        0x4701(%rip),%xmm12        # 48a0 <_sk_callback_sse41+0xe7>
-  DB  102,68,15,111,45,8,71,0,0           ; movdqa        0x4708(%rip),%xmm13        # 48b0 <_sk_callback_sse41+0xf7>
+  DB  102,68,15,111,37,247,70,0,0         ; movdqa        0x46f7(%rip),%xmm12        # 4890 <_sk_callback_sse41+0xdd>
+  DB  102,68,15,111,45,254,70,0,0         ; movdqa        0x46fe(%rip),%xmm13        # 48a0 <_sk_callback_sse41+0xed>
   DB  102,69,15,111,240                   ; movdqa        %xmm8,%xmm14
   DB  102,69,15,219,245                   ; pand          %xmm13,%xmm14
   DB  102,65,15,114,246,2                 ; pslld         $0x2,%xmm14
@@ -11432,12 +11432,12 @@
   DB  102,65,15,114,209,2                 ; psrld         $0x2,%xmm9
   DB  102,69,15,235,234                   ; por           %xmm10,%xmm13
   DB  102,69,15,235,233                   ; por           %xmm9,%xmm13
-  DB  102,69,15,235,243                   ; por           %xmm11,%xmm14
-  DB  102,69,15,235,245                   ; por           %xmm13,%xmm14
-  DB  102,69,15,235,240                   ; por           %xmm8,%xmm14
-  DB  69,15,91,198                        ; cvtdq2ps      %xmm14,%xmm8
-  DB  68,15,89,5,195,70,0,0               ; mulps         0x46c3(%rip),%xmm8        # 48c0 <_sk_callback_sse41+0x107>
-  DB  68,15,88,5,203,70,0,0               ; addps         0x46cb(%rip),%xmm8        # 48d0 <_sk_callback_sse41+0x117>
+  DB  102,69,15,235,235                   ; por           %xmm11,%xmm13
+  DB  102,69,15,235,198                   ; por           %xmm14,%xmm8
+  DB  102,69,15,235,197                   ; por           %xmm13,%xmm8
+  DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
+  DB  68,15,89,5,185,70,0,0               ; mulps         0x46b9(%rip),%xmm8        # 48b0 <_sk_callback_sse41+0xfd>
+  DB  68,15,88,5,193,70,0,0               ; addps         0x46c1(%rip),%xmm8        # 48c0 <_sk_callback_sse41+0x10d>
   DB  243,68,15,16,80,8                   ; movss         0x8(%rax),%xmm10
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
@@ -11504,7 +11504,7 @@
 PUBLIC _sk_srcatop_sse41
 _sk_srcatop_sse41 LABEL PROC
   DB  15,89,199                           ; mulps         %xmm7,%xmm0
-  DB  68,15,40,5,36,70,0,0                ; movaps        0x4624(%rip),%xmm8        # 48e0 <_sk_callback_sse41+0x127>
+  DB  68,15,40,5,26,70,0,0                ; movaps        0x461a(%rip),%xmm8        # 48d0 <_sk_callback_sse41+0x11d>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -11527,7 +11527,7 @@
 _sk_dstatop_sse41 LABEL PROC
   DB  68,15,40,195                        ; movaps        %xmm3,%xmm8
   DB  68,15,89,196                        ; mulps         %xmm4,%xmm8
-  DB  68,15,40,13,231,69,0,0              ; movaps        0x45e7(%rip),%xmm9        # 48f0 <_sk_callback_sse41+0x137>
+  DB  68,15,40,13,221,69,0,0              ; movaps        0x45dd(%rip),%xmm9        # 48e0 <_sk_callback_sse41+0x12d>
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
@@ -11568,7 +11568,7 @@
 
 PUBLIC _sk_srcout_sse41
 _sk_srcout_sse41 LABEL PROC
-  DB  68,15,40,5,139,69,0,0               ; movaps        0x458b(%rip),%xmm8        # 4900 <_sk_callback_sse41+0x147>
+  DB  68,15,40,5,129,69,0,0               ; movaps        0x4581(%rip),%xmm8        # 48f0 <_sk_callback_sse41+0x13d>
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
@@ -11579,7 +11579,7 @@
 
 PUBLIC _sk_dstout_sse41
 _sk_dstout_sse41 LABEL PROC
-  DB  68,15,40,5,123,69,0,0               ; movaps        0x457b(%rip),%xmm8        # 4910 <_sk_callback_sse41+0x157>
+  DB  68,15,40,5,113,69,0,0               ; movaps        0x4571(%rip),%xmm8        # 4900 <_sk_callback_sse41+0x14d>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  15,89,196                           ; mulps         %xmm4,%xmm0
@@ -11594,7 +11594,7 @@
 
 PUBLIC _sk_srcover_sse41
 _sk_srcover_sse41 LABEL PROC
-  DB  68,15,40,5,94,69,0,0                ; movaps        0x455e(%rip),%xmm8        # 4920 <_sk_callback_sse41+0x167>
+  DB  68,15,40,5,84,69,0,0                ; movaps        0x4554(%rip),%xmm8        # 4910 <_sk_callback_sse41+0x15d>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -11612,7 +11612,7 @@
 
 PUBLIC _sk_dstover_sse41
 _sk_dstover_sse41 LABEL PROC
-  DB  68,15,40,5,50,69,0,0                ; movaps        0x4532(%rip),%xmm8        # 4930 <_sk_callback_sse41+0x177>
+  DB  68,15,40,5,40,69,0,0                ; movaps        0x4528(%rip),%xmm8        # 4920 <_sk_callback_sse41+0x16d>
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -11636,7 +11636,7 @@
 
 PUBLIC _sk_multiply_sse41
 _sk_multiply_sse41 LABEL PROC
-  DB  68,15,40,5,6,69,0,0                 ; movaps        0x4506(%rip),%xmm8        # 4940 <_sk_callback_sse41+0x187>
+  DB  68,15,40,5,252,68,0,0               ; movaps        0x44fc(%rip),%xmm8        # 4930 <_sk_callback_sse41+0x17d>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
@@ -11706,7 +11706,7 @@
 PUBLIC _sk_xor__sse41
 _sk_xor__sse41 LABEL PROC
   DB  68,15,40,195                        ; movaps        %xmm3,%xmm8
-  DB  15,40,29,55,68,0,0                  ; movaps        0x4437(%rip),%xmm3        # 4950 <_sk_callback_sse41+0x197>
+  DB  15,40,29,45,68,0,0                  ; movaps        0x442d(%rip),%xmm3        # 4940 <_sk_callback_sse41+0x18d>
   DB  68,15,40,203                        ; movaps        %xmm3,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
@@ -11752,7 +11752,7 @@
   DB  68,15,89,206                        ; mulps         %xmm6,%xmm9
   DB  65,15,95,209                        ; maxps         %xmm9,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,162,67,0,0                 ; movaps        0x43a2(%rip),%xmm2        # 4960 <_sk_callback_sse41+0x1a7>
+  DB  15,40,21,152,67,0,0                 ; movaps        0x4398(%rip),%xmm2        # 4950 <_sk_callback_sse41+0x19d>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -11784,7 +11784,7 @@
   DB  68,15,89,206                        ; mulps         %xmm6,%xmm9
   DB  65,15,93,209                        ; minps         %xmm9,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,71,67,0,0                  ; movaps        0x4347(%rip),%xmm2        # 4970 <_sk_callback_sse41+0x1b7>
+  DB  15,40,21,61,67,0,0                  ; movaps        0x433d(%rip),%xmm2        # 4960 <_sk_callback_sse41+0x1ad>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -11819,7 +11819,7 @@
   DB  65,15,93,209                        ; minps         %xmm9,%xmm2
   DB  15,88,210                           ; addps         %xmm2,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,225,66,0,0                 ; movaps        0x42e1(%rip),%xmm2        # 4980 <_sk_callback_sse41+0x1c7>
+  DB  15,40,21,215,66,0,0                 ; movaps        0x42d7(%rip),%xmm2        # 4970 <_sk_callback_sse41+0x1bd>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -11844,7 +11844,7 @@
   DB  15,89,214                           ; mulps         %xmm6,%xmm2
   DB  15,88,210                           ; addps         %xmm2,%xmm2
   DB  68,15,92,202                        ; subps         %xmm2,%xmm9
-  DB  15,40,13,162,66,0,0                 ; movaps        0x42a2(%rip),%xmm1        # 4990 <_sk_callback_sse41+0x1d7>
+  DB  15,40,13,152,66,0,0                 ; movaps        0x4298(%rip),%xmm1        # 4980 <_sk_callback_sse41+0x1cd>
   DB  15,92,203                           ; subps         %xmm3,%xmm1
   DB  15,89,207                           ; mulps         %xmm7,%xmm1
   DB  15,88,217                           ; addps         %xmm1,%xmm3
@@ -11856,7 +11856,7 @@
 PUBLIC _sk_colorburn_sse41
 _sk_colorburn_sse41 LABEL PROC
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,40,21,145,66,0,0              ; movaps        0x4291(%rip),%xmm10        # 49a0 <_sk_callback_sse41+0x1e7>
+  DB  68,15,40,21,135,66,0,0              ; movaps        0x4287(%rip),%xmm10        # 4990 <_sk_callback_sse41+0x1dd>
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
   DB  68,15,92,223                        ; subps         %xmm7,%xmm11
   DB  69,15,40,203                        ; movaps        %xmm11,%xmm9
@@ -11936,7 +11936,7 @@
 PUBLIC _sk_colordodge_sse41
 _sk_colordodge_sse41 LABEL PROC
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,40,21,111,65,0,0              ; movaps        0x416f(%rip),%xmm10        # 49b0 <_sk_callback_sse41+0x1f7>
+  DB  68,15,40,21,101,65,0,0              ; movaps        0x4165(%rip),%xmm10        # 49a0 <_sk_callback_sse41+0x1ed>
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
   DB  68,15,92,223                        ; subps         %xmm7,%xmm11
   DB  69,15,40,227                        ; movaps        %xmm11,%xmm12
@@ -12017,7 +12017,7 @@
   DB  15,40,244                           ; movaps        %xmm4,%xmm6
   DB  15,40,227                           ; movaps        %xmm3,%xmm4
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
-  DB  68,15,40,21,69,64,0,0               ; movaps        0x4045(%rip),%xmm10        # 49c0 <_sk_callback_sse41+0x207>
+  DB  68,15,40,21,59,64,0,0               ; movaps        0x403b(%rip),%xmm10        # 49b0 <_sk_callback_sse41+0x1fd>
   DB  65,15,40,234                        ; movaps        %xmm10,%xmm5
   DB  15,92,239                           ; subps         %xmm7,%xmm5
   DB  15,40,197                           ; movaps        %xmm5,%xmm0
@@ -12099,7 +12099,7 @@
 _sk_overlay_sse41 LABEL PROC
   DB  68,15,40,201                        ; movaps        %xmm1,%xmm9
   DB  68,15,40,240                        ; movaps        %xmm0,%xmm14
-  DB  68,15,40,21,39,63,0,0               ; movaps        0x3f27(%rip),%xmm10        # 49d0 <_sk_callback_sse41+0x217>
+  DB  68,15,40,21,29,63,0,0               ; movaps        0x3f1d(%rip),%xmm10        # 49c0 <_sk_callback_sse41+0x20d>
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
   DB  68,15,92,223                        ; subps         %xmm7,%xmm11
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
@@ -12183,7 +12183,7 @@
   DB  15,40,198                           ; movaps        %xmm6,%xmm0
   DB  15,94,199                           ; divps         %xmm7,%xmm0
   DB  65,15,84,193                        ; andps         %xmm9,%xmm0
-  DB  15,40,13,250,61,0,0                 ; movaps        0x3dfa(%rip),%xmm1        # 49e0 <_sk_callback_sse41+0x227>
+  DB  15,40,13,240,61,0,0                 ; movaps        0x3df0(%rip),%xmm1        # 49d0 <_sk_callback_sse41+0x21d>
   DB  68,15,40,209                        ; movaps        %xmm1,%xmm10
   DB  68,15,92,208                        ; subps         %xmm0,%xmm10
   DB  68,15,40,240                        ; movaps        %xmm0,%xmm14
@@ -12196,10 +12196,10 @@
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  15,89,210                           ; mulps         %xmm2,%xmm2
   DB  15,88,208                           ; addps         %xmm0,%xmm2
-  DB  68,15,40,45,216,61,0,0              ; movaps        0x3dd8(%rip),%xmm13        # 49f0 <_sk_callback_sse41+0x237>
+  DB  68,15,40,45,206,61,0,0              ; movaps        0x3dce(%rip),%xmm13        # 49e0 <_sk_callback_sse41+0x22d>
   DB  69,15,88,245                        ; addps         %xmm13,%xmm14
   DB  68,15,89,242                        ; mulps         %xmm2,%xmm14
-  DB  68,15,40,37,216,61,0,0              ; movaps        0x3dd8(%rip),%xmm12        # 4a00 <_sk_callback_sse41+0x247>
+  DB  68,15,40,37,206,61,0,0              ; movaps        0x3dce(%rip),%xmm12        # 49f0 <_sk_callback_sse41+0x23d>
   DB  69,15,89,252                        ; mulps         %xmm12,%xmm15
   DB  69,15,88,254                        ; addps         %xmm14,%xmm15
   DB  15,40,198                           ; movaps        %xmm6,%xmm0
@@ -12385,12 +12385,12 @@
   DB  68,15,84,208                        ; andps         %xmm0,%xmm10
   DB  15,84,200                           ; andps         %xmm0,%xmm1
   DB  68,15,84,232                        ; andps         %xmm0,%xmm13
-  DB  15,40,5,62,59,0,0                   ; movaps        0x3b3e(%rip),%xmm0        # 4a10 <_sk_callback_sse41+0x257>
+  DB  15,40,5,52,59,0,0                   ; movaps        0x3b34(%rip),%xmm0        # 4a00 <_sk_callback_sse41+0x24d>
   DB  68,15,89,224                        ; mulps         %xmm0,%xmm12
-  DB  15,40,21,67,59,0,0                  ; movaps        0x3b43(%rip),%xmm2        # 4a20 <_sk_callback_sse41+0x267>
+  DB  15,40,21,57,59,0,0                  ; movaps        0x3b39(%rip),%xmm2        # 4a10 <_sk_callback_sse41+0x25d>
   DB  15,89,250                           ; mulps         %xmm2,%xmm7
   DB  65,15,88,252                        ; addps         %xmm12,%xmm7
-  DB  68,15,40,53,68,59,0,0               ; movaps        0x3b44(%rip),%xmm14        # 4a30 <_sk_callback_sse41+0x277>
+  DB  68,15,40,53,58,59,0,0               ; movaps        0x3b3a(%rip),%xmm14        # 4a20 <_sk_callback_sse41+0x26d>
   DB  68,15,40,252                        ; movaps        %xmm4,%xmm15
   DB  69,15,89,254                        ; mulps         %xmm14,%xmm15
   DB  68,15,88,255                        ; addps         %xmm7,%xmm15
@@ -12473,7 +12473,7 @@
   DB  65,15,88,214                        ; addps         %xmm14,%xmm2
   DB  15,40,196                           ; movaps        %xmm4,%xmm0
   DB  102,15,56,20,202                    ; blendvps      %xmm0,%xmm2,%xmm1
-  DB  68,15,40,13,9,58,0,0                ; movaps        0x3a09(%rip),%xmm9        # 4a40 <_sk_callback_sse41+0x287>
+  DB  68,15,40,13,255,57,0,0              ; movaps        0x39ff(%rip),%xmm9        # 4a30 <_sk_callback_sse41+0x27d>
   DB  65,15,40,225                        ; movaps        %xmm9,%xmm4
   DB  15,92,229                           ; subps         %xmm5,%xmm4
   DB  15,40,68,36,48                      ; movaps        0x30(%rsp),%xmm0
@@ -12567,14 +12567,14 @@
   DB  68,15,84,215                        ; andps         %xmm7,%xmm10
   DB  68,15,84,223                        ; andps         %xmm7,%xmm11
   DB  68,15,84,199                        ; andps         %xmm7,%xmm8
-  DB  15,40,21,188,56,0,0                 ; movaps        0x38bc(%rip),%xmm2        # 4a50 <_sk_callback_sse41+0x297>
+  DB  15,40,21,178,56,0,0                 ; movaps        0x38b2(%rip),%xmm2        # 4a40 <_sk_callback_sse41+0x28d>
   DB  15,40,221                           ; movaps        %xmm5,%xmm3
   DB  15,89,218                           ; mulps         %xmm2,%xmm3
-  DB  15,40,13,191,56,0,0                 ; movaps        0x38bf(%rip),%xmm1        # 4a60 <_sk_callback_sse41+0x2a7>
+  DB  15,40,13,181,56,0,0                 ; movaps        0x38b5(%rip),%xmm1        # 4a50 <_sk_callback_sse41+0x29d>
   DB  15,40,254                           ; movaps        %xmm6,%xmm7
   DB  15,89,249                           ; mulps         %xmm1,%xmm7
   DB  15,88,251                           ; addps         %xmm3,%xmm7
-  DB  68,15,40,45,190,56,0,0              ; movaps        0x38be(%rip),%xmm13        # 4a70 <_sk_callback_sse41+0x2b7>
+  DB  68,15,40,45,180,56,0,0              ; movaps        0x38b4(%rip),%xmm13        # 4a60 <_sk_callback_sse41+0x2ad>
   DB  69,15,89,245                        ; mulps         %xmm13,%xmm14
   DB  68,15,88,247                        ; addps         %xmm7,%xmm14
   DB  65,15,40,218                        ; movaps        %xmm10,%xmm3
@@ -12655,7 +12655,7 @@
   DB  65,15,88,253                        ; addps         %xmm13,%xmm7
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  102,68,15,56,20,223                 ; blendvps      %xmm0,%xmm7,%xmm11
-  DB  68,15,40,13,132,55,0,0              ; movaps        0x3784(%rip),%xmm9        # 4a80 <_sk_callback_sse41+0x2c7>
+  DB  68,15,40,13,122,55,0,0              ; movaps        0x377a(%rip),%xmm9        # 4a70 <_sk_callback_sse41+0x2bd>
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  68,15,92,204                        ; subps         %xmm4,%xmm9
   DB  15,40,60,36                         ; movaps        (%rsp),%xmm7
@@ -12710,14 +12710,14 @@
   DB  15,40,231                           ; movaps        %xmm7,%xmm4
   DB  68,15,89,244                        ; mulps         %xmm4,%xmm14
   DB  15,89,204                           ; mulps         %xmm4,%xmm1
-  DB  68,15,40,13,201,54,0,0              ; movaps        0x36c9(%rip),%xmm9        # 4a90 <_sk_callback_sse41+0x2d7>
+  DB  68,15,40,13,191,54,0,0              ; movaps        0x36bf(%rip),%xmm9        # 4a80 <_sk_callback_sse41+0x2cd>
   DB  65,15,40,250                        ; movaps        %xmm10,%xmm7
   DB  65,15,89,249                        ; mulps         %xmm9,%xmm7
-  DB  68,15,40,21,201,54,0,0              ; movaps        0x36c9(%rip),%xmm10        # 4aa0 <_sk_callback_sse41+0x2e7>
+  DB  68,15,40,21,191,54,0,0              ; movaps        0x36bf(%rip),%xmm10        # 4a90 <_sk_callback_sse41+0x2dd>
   DB  65,15,40,219                        ; movaps        %xmm11,%xmm3
   DB  65,15,89,218                        ; mulps         %xmm10,%xmm3
   DB  15,88,223                           ; addps         %xmm7,%xmm3
-  DB  68,15,40,29,198,54,0,0              ; movaps        0x36c6(%rip),%xmm11        # 4ab0 <_sk_callback_sse41+0x2f7>
+  DB  68,15,40,29,188,54,0,0              ; movaps        0x36bc(%rip),%xmm11        # 4aa0 <_sk_callback_sse41+0x2ed>
   DB  69,15,40,236                        ; movaps        %xmm12,%xmm13
   DB  69,15,89,235                        ; mulps         %xmm11,%xmm13
   DB  68,15,88,235                        ; addps         %xmm3,%xmm13
@@ -12802,7 +12802,7 @@
   DB  65,15,88,251                        ; addps         %xmm11,%xmm7
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  102,15,56,20,207                    ; blendvps      %xmm0,%xmm7,%xmm1
-  DB  68,15,40,13,130,53,0,0              ; movaps        0x3582(%rip),%xmm9        # 4ac0 <_sk_callback_sse41+0x307>
+  DB  68,15,40,13,120,53,0,0              ; movaps        0x3578(%rip),%xmm9        # 4ab0 <_sk_callback_sse41+0x2fd>
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  68,15,89,192                        ; mulps         %xmm0,%xmm8
@@ -12854,13 +12854,13 @@
   DB  69,15,89,216                        ; mulps         %xmm8,%xmm11
   DB  68,15,40,203                        ; movaps        %xmm3,%xmm9
   DB  68,15,89,205                        ; mulps         %xmm5,%xmm9
-  DB  68,15,40,5,212,52,0,0               ; movaps        0x34d4(%rip),%xmm8        # 4ad0 <_sk_callback_sse41+0x317>
+  DB  68,15,40,5,202,52,0,0               ; movaps        0x34ca(%rip),%xmm8        # 4ac0 <_sk_callback_sse41+0x30d>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
-  DB  68,15,40,21,216,52,0,0              ; movaps        0x34d8(%rip),%xmm10        # 4ae0 <_sk_callback_sse41+0x327>
+  DB  68,15,40,21,206,52,0,0              ; movaps        0x34ce(%rip),%xmm10        # 4ad0 <_sk_callback_sse41+0x31d>
   DB  15,40,233                           ; movaps        %xmm1,%xmm5
   DB  65,15,89,234                        ; mulps         %xmm10,%xmm5
   DB  15,88,232                           ; addps         %xmm0,%xmm5
-  DB  68,15,40,37,214,52,0,0              ; movaps        0x34d6(%rip),%xmm12        # 4af0 <_sk_callback_sse41+0x337>
+  DB  68,15,40,37,204,52,0,0              ; movaps        0x34cc(%rip),%xmm12        # 4ae0 <_sk_callback_sse41+0x32d>
   DB  68,15,40,242                        ; movaps        %xmm2,%xmm14
   DB  69,15,89,244                        ; mulps         %xmm12,%xmm14
   DB  68,15,88,245                        ; addps         %xmm5,%xmm14
@@ -12945,7 +12945,7 @@
   DB  65,15,88,244                        ; addps         %xmm12,%xmm6
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
   DB  102,68,15,56,20,206                 ; blendvps      %xmm0,%xmm6,%xmm9
-  DB  15,40,5,140,51,0,0                  ; movaps        0x338c(%rip),%xmm0        # 4b00 <_sk_callback_sse41+0x347>
+  DB  15,40,5,130,51,0,0                  ; movaps        0x3382(%rip),%xmm0        # 4af0 <_sk_callback_sse41+0x33d>
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  15,92,215                           ; subps         %xmm7,%xmm2
   DB  15,89,226                           ; mulps         %xmm2,%xmm4
@@ -12991,7 +12991,7 @@
 
 PUBLIC _sk_clamp_1_sse41
 _sk_clamp_1_sse41 LABEL PROC
-  DB  68,15,40,5,12,51,0,0                ; movaps        0x330c(%rip),%xmm8        # 4b10 <_sk_callback_sse41+0x357>
+  DB  68,15,40,5,2,51,0,0                 ; movaps        0x3302(%rip),%xmm8        # 4b00 <_sk_callback_sse41+0x34d>
   DB  65,15,93,192                        ; minps         %xmm8,%xmm0
   DB  65,15,93,200                        ; minps         %xmm8,%xmm1
   DB  65,15,93,208                        ; minps         %xmm8,%xmm2
@@ -13001,7 +13001,7 @@
 
 PUBLIC _sk_clamp_a_sse41
 _sk_clamp_a_sse41 LABEL PROC
-  DB  15,93,29,1,51,0,0                   ; minps         0x3301(%rip),%xmm3        # 4b20 <_sk_callback_sse41+0x367>
+  DB  15,93,29,247,50,0,0                 ; minps         0x32f7(%rip),%xmm3        # 4b10 <_sk_callback_sse41+0x35d>
   DB  15,93,195                           ; minps         %xmm3,%xmm0
   DB  15,93,203                           ; minps         %xmm3,%xmm1
   DB  15,93,211                           ; minps         %xmm3,%xmm2
@@ -13074,7 +13074,7 @@
 PUBLIC _sk_unpremul_sse41
 _sk_unpremul_sse41 LABEL PROC
   DB  69,15,87,192                        ; xorps         %xmm8,%xmm8
-  DB  68,15,40,13,108,50,0,0              ; movaps        0x326c(%rip),%xmm9        # 4b30 <_sk_callback_sse41+0x377>
+  DB  68,15,40,13,98,50,0,0               ; movaps        0x3262(%rip),%xmm9        # 4b20 <_sk_callback_sse41+0x36d>
   DB  68,15,94,203                        ; divps         %xmm3,%xmm9
   DB  68,15,194,195,4                     ; cmpneqps      %xmm3,%xmm8
   DB  69,15,84,193                        ; andps         %xmm9,%xmm8
@@ -13086,20 +13086,20 @@
 
 PUBLIC _sk_from_srgb_sse41
 _sk_from_srgb_sse41 LABEL PROC
-  DB  68,15,40,29,87,50,0,0               ; movaps        0x3257(%rip),%xmm11        # 4b40 <_sk_callback_sse41+0x387>
+  DB  68,15,40,29,77,50,0,0               ; movaps        0x324d(%rip),%xmm11        # 4b30 <_sk_callback_sse41+0x37d>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
   DB  68,15,40,208                        ; movaps        %xmm0,%xmm10
   DB  69,15,89,210                        ; mulps         %xmm10,%xmm10
-  DB  68,15,40,37,79,50,0,0               ; movaps        0x324f(%rip),%xmm12        # 4b50 <_sk_callback_sse41+0x397>
+  DB  68,15,40,37,69,50,0,0               ; movaps        0x3245(%rip),%xmm12        # 4b40 <_sk_callback_sse41+0x38d>
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
   DB  69,15,89,196                        ; mulps         %xmm12,%xmm8
-  DB  68,15,40,45,79,50,0,0               ; movaps        0x324f(%rip),%xmm13        # 4b60 <_sk_callback_sse41+0x3a7>
+  DB  68,15,40,45,69,50,0,0               ; movaps        0x3245(%rip),%xmm13        # 4b50 <_sk_callback_sse41+0x39d>
   DB  69,15,88,197                        ; addps         %xmm13,%xmm8
   DB  69,15,89,194                        ; mulps         %xmm10,%xmm8
-  DB  68,15,40,53,79,50,0,0               ; movaps        0x324f(%rip),%xmm14        # 4b70 <_sk_callback_sse41+0x3b7>
+  DB  68,15,40,53,69,50,0,0               ; movaps        0x3245(%rip),%xmm14        # 4b60 <_sk_callback_sse41+0x3ad>
   DB  69,15,88,198                        ; addps         %xmm14,%xmm8
-  DB  68,15,40,61,83,50,0,0               ; movaps        0x3253(%rip),%xmm15        # 4b80 <_sk_callback_sse41+0x3c7>
+  DB  68,15,40,61,73,50,0,0               ; movaps        0x3249(%rip),%xmm15        # 4b70 <_sk_callback_sse41+0x3bd>
   DB  65,15,194,199,1                     ; cmpltps       %xmm15,%xmm0
   DB  102,69,15,56,20,193                 ; blendvps      %xmm0,%xmm9,%xmm8
   DB  68,15,40,209                        ; movaps        %xmm1,%xmm10
@@ -13141,22 +13141,22 @@
   DB  15,40,218                           ; movaps        %xmm2,%xmm3
   DB  15,40,209                           ; movaps        %xmm1,%xmm2
   DB  68,15,82,192                        ; rsqrtps       %xmm0,%xmm8
-  DB  68,15,40,29,200,49,0,0              ; movaps        0x31c8(%rip),%xmm11        # 4b90 <_sk_callback_sse41+0x3d7>
+  DB  68,15,40,29,190,49,0,0              ; movaps        0x31be(%rip),%xmm11        # 4b80 <_sk_callback_sse41+0x3cd>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
-  DB  68,15,40,37,200,49,0,0              ; movaps        0x31c8(%rip),%xmm12        # 4ba0 <_sk_callback_sse41+0x3e7>
+  DB  68,15,40,37,190,49,0,0              ; movaps        0x31be(%rip),%xmm12        # 4b90 <_sk_callback_sse41+0x3dd>
   DB  69,15,40,248                        ; movaps        %xmm8,%xmm15
   DB  69,15,89,252                        ; mulps         %xmm12,%xmm15
-  DB  68,15,40,21,200,49,0,0              ; movaps        0x31c8(%rip),%xmm10        # 4bb0 <_sk_callback_sse41+0x3f7>
+  DB  68,15,40,21,190,49,0,0              ; movaps        0x31be(%rip),%xmm10        # 4ba0 <_sk_callback_sse41+0x3ed>
   DB  69,15,88,250                        ; addps         %xmm10,%xmm15
   DB  69,15,89,248                        ; mulps         %xmm8,%xmm15
-  DB  68,15,40,45,200,49,0,0              ; movaps        0x31c8(%rip),%xmm13        # 4bc0 <_sk_callback_sse41+0x407>
+  DB  68,15,40,45,190,49,0,0              ; movaps        0x31be(%rip),%xmm13        # 4bb0 <_sk_callback_sse41+0x3fd>
   DB  69,15,88,253                        ; addps         %xmm13,%xmm15
-  DB  68,15,40,53,204,49,0,0              ; movaps        0x31cc(%rip),%xmm14        # 4bd0 <_sk_callback_sse41+0x417>
+  DB  68,15,40,53,194,49,0,0              ; movaps        0x31c2(%rip),%xmm14        # 4bc0 <_sk_callback_sse41+0x40d>
   DB  69,15,88,198                        ; addps         %xmm14,%xmm8
   DB  69,15,83,192                        ; rcpps         %xmm8,%xmm8
   DB  69,15,89,199                        ; mulps         %xmm15,%xmm8
-  DB  68,15,40,61,200,49,0,0              ; movaps        0x31c8(%rip),%xmm15        # 4be0 <_sk_callback_sse41+0x427>
+  DB  68,15,40,61,190,49,0,0              ; movaps        0x31be(%rip),%xmm15        # 4bd0 <_sk_callback_sse41+0x41d>
   DB  65,15,194,199,1                     ; cmpltps       %xmm15,%xmm0
   DB  102,69,15,56,20,193                 ; blendvps      %xmm0,%xmm9,%xmm8
   DB  68,15,82,202                        ; rsqrtps       %xmm2,%xmm9
@@ -13208,7 +13208,7 @@
   DB  68,15,93,226                        ; minps         %xmm2,%xmm12
   DB  65,15,40,203                        ; movaps        %xmm11,%xmm1
   DB  65,15,92,204                        ; subps         %xmm12,%xmm1
-  DB  68,15,40,53,18,49,0,0               ; movaps        0x3112(%rip),%xmm14        # 4bf0 <_sk_callback_sse41+0x437>
+  DB  68,15,40,53,8,49,0,0                ; movaps        0x3108(%rip),%xmm14        # 4be0 <_sk_callback_sse41+0x42d>
   DB  68,15,94,241                        ; divps         %xmm1,%xmm14
   DB  69,15,40,211                        ; movaps        %xmm11,%xmm10
   DB  69,15,194,208,0                     ; cmpeqps       %xmm8,%xmm10
@@ -13217,27 +13217,27 @@
   DB  65,15,89,198                        ; mulps         %xmm14,%xmm0
   DB  69,15,40,249                        ; movaps        %xmm9,%xmm15
   DB  68,15,194,250,1                     ; cmpltps       %xmm2,%xmm15
-  DB  68,15,84,61,249,48,0,0              ; andps         0x30f9(%rip),%xmm15        # 4c00 <_sk_callback_sse41+0x447>
+  DB  68,15,84,61,239,48,0,0              ; andps         0x30ef(%rip),%xmm15        # 4bf0 <_sk_callback_sse41+0x43d>
   DB  68,15,88,248                        ; addps         %xmm0,%xmm15
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
   DB  65,15,194,193,0                     ; cmpeqps       %xmm9,%xmm0
   DB  65,15,92,208                        ; subps         %xmm8,%xmm2
   DB  65,15,89,214                        ; mulps         %xmm14,%xmm2
-  DB  68,15,40,45,236,48,0,0              ; movaps        0x30ec(%rip),%xmm13        # 4c10 <_sk_callback_sse41+0x457>
+  DB  68,15,40,45,226,48,0,0              ; movaps        0x30e2(%rip),%xmm13        # 4c00 <_sk_callback_sse41+0x44d>
   DB  65,15,88,213                        ; addps         %xmm13,%xmm2
   DB  69,15,92,193                        ; subps         %xmm9,%xmm8
   DB  69,15,89,198                        ; mulps         %xmm14,%xmm8
-  DB  68,15,88,5,232,48,0,0               ; addps         0x30e8(%rip),%xmm8        # 4c20 <_sk_callback_sse41+0x467>
+  DB  68,15,88,5,222,48,0,0               ; addps         0x30de(%rip),%xmm8        # 4c10 <_sk_callback_sse41+0x45d>
   DB  102,68,15,56,20,194                 ; blendvps      %xmm0,%xmm2,%xmm8
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  102,69,15,56,20,199                 ; blendvps      %xmm0,%xmm15,%xmm8
-  DB  68,15,89,5,224,48,0,0               ; mulps         0x30e0(%rip),%xmm8        # 4c30 <_sk_callback_sse41+0x477>
+  DB  68,15,89,5,214,48,0,0               ; mulps         0x30d6(%rip),%xmm8        # 4c20 <_sk_callback_sse41+0x46d>
   DB  69,15,40,203                        ; movaps        %xmm11,%xmm9
   DB  69,15,194,204,4                     ; cmpneqps      %xmm12,%xmm9
   DB  69,15,84,193                        ; andps         %xmm9,%xmm8
   DB  69,15,92,235                        ; subps         %xmm11,%xmm13
   DB  69,15,88,220                        ; addps         %xmm12,%xmm11
-  DB  15,40,5,212,48,0,0                  ; movaps        0x30d4(%rip),%xmm0        # 4c40 <_sk_callback_sse41+0x487>
+  DB  15,40,5,202,48,0,0                  ; movaps        0x30ca(%rip),%xmm0        # 4c30 <_sk_callback_sse41+0x47d>
   DB  65,15,40,211                        ; movaps        %xmm11,%xmm2
   DB  15,89,208                           ; mulps         %xmm0,%xmm2
   DB  15,194,194,1                        ; cmpltps       %xmm2,%xmm0
@@ -13258,7 +13258,7 @@
   DB  15,41,100,36,32                     ; movaps        %xmm4,0x20(%rsp)
   DB  15,41,92,36,16                      ; movaps        %xmm3,0x10(%rsp)
   DB  68,15,40,208                        ; movaps        %xmm0,%xmm10
-  DB  68,15,40,13,150,48,0,0              ; movaps        0x3096(%rip),%xmm9        # 4c50 <_sk_callback_sse41+0x497>
+  DB  68,15,40,13,140,48,0,0              ; movaps        0x308c(%rip),%xmm9        # 4c40 <_sk_callback_sse41+0x48d>
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  15,194,194,2                        ; cmpleps       %xmm2,%xmm0
   DB  15,40,217                           ; movaps        %xmm1,%xmm3
@@ -13271,19 +13271,19 @@
   DB  15,41,20,36                         ; movaps        %xmm2,(%rsp)
   DB  69,15,88,192                        ; addps         %xmm8,%xmm8
   DB  68,15,92,197                        ; subps         %xmm5,%xmm8
-  DB  68,15,40,53,114,48,0,0              ; movaps        0x3072(%rip),%xmm14        # 4c60 <_sk_callback_sse41+0x4a7>
+  DB  68,15,40,53,104,48,0,0              ; movaps        0x3068(%rip),%xmm14        # 4c50 <_sk_callback_sse41+0x49d>
   DB  69,15,88,242                        ; addps         %xmm10,%xmm14
   DB  102,65,15,58,8,198,1                ; roundps       $0x1,%xmm14,%xmm0
   DB  68,15,92,240                        ; subps         %xmm0,%xmm14
-  DB  68,15,40,29,107,48,0,0              ; movaps        0x306b(%rip),%xmm11        # 4c70 <_sk_callback_sse41+0x4b7>
+  DB  68,15,40,29,97,48,0,0               ; movaps        0x3061(%rip),%xmm11        # 4c60 <_sk_callback_sse41+0x4ad>
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
   DB  65,15,194,198,2                     ; cmpleps       %xmm14,%xmm0
   DB  15,40,245                           ; movaps        %xmm5,%xmm6
   DB  65,15,92,240                        ; subps         %xmm8,%xmm6
-  DB  15,40,61,100,48,0,0                 ; movaps        0x3064(%rip),%xmm7        # 4c80 <_sk_callback_sse41+0x4c7>
+  DB  15,40,61,90,48,0,0                  ; movaps        0x305a(%rip),%xmm7        # 4c70 <_sk_callback_sse41+0x4bd>
   DB  69,15,40,238                        ; movaps        %xmm14,%xmm13
   DB  68,15,89,239                        ; mulps         %xmm7,%xmm13
-  DB  15,40,29,101,48,0,0                 ; movaps        0x3065(%rip),%xmm3        # 4c90 <_sk_callback_sse41+0x4d7>
+  DB  15,40,29,91,48,0,0                  ; movaps        0x305b(%rip),%xmm3        # 4c80 <_sk_callback_sse41+0x4cd>
   DB  68,15,40,227                        ; movaps        %xmm3,%xmm12
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  68,15,89,230                        ; mulps         %xmm6,%xmm12
@@ -13293,7 +13293,7 @@
   DB  65,15,194,198,2                     ; cmpleps       %xmm14,%xmm0
   DB  68,15,40,253                        ; movaps        %xmm5,%xmm15
   DB  102,69,15,56,20,252                 ; blendvps      %xmm0,%xmm12,%xmm15
-  DB  68,15,40,37,68,48,0,0               ; movaps        0x3044(%rip),%xmm12        # 4ca0 <_sk_callback_sse41+0x4e7>
+  DB  68,15,40,37,58,48,0,0               ; movaps        0x303a(%rip),%xmm12        # 4c90 <_sk_callback_sse41+0x4dd>
   DB  65,15,40,196                        ; movaps        %xmm12,%xmm0
   DB  65,15,194,198,2                     ; cmpleps       %xmm14,%xmm0
   DB  68,15,89,238                        ; mulps         %xmm6,%xmm13
@@ -13327,7 +13327,7 @@
   DB  65,15,40,198                        ; movaps        %xmm14,%xmm0
   DB  15,40,20,36                         ; movaps        (%rsp),%xmm2
   DB  102,15,56,20,202                    ; blendvps      %xmm0,%xmm2,%xmm1
-  DB  68,15,88,21,189,47,0,0              ; addps         0x2fbd(%rip),%xmm10        # 4cb0 <_sk_callback_sse41+0x4f7>
+  DB  68,15,88,21,179,47,0,0              ; addps         0x2fb3(%rip),%xmm10        # 4ca0 <_sk_callback_sse41+0x4ed>
   DB  102,65,15,58,8,194,1                ; roundps       $0x1,%xmm10,%xmm0
   DB  68,15,92,208                        ; subps         %xmm0,%xmm10
   DB  69,15,194,218,2                     ; cmpleps       %xmm10,%xmm11
@@ -13376,7 +13376,7 @@
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  102,68,15,56,49,4,56                ; pmovzxbd      (%rax,%rdi,1),%xmm8
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,22,47,0,0                ; mulps         0x2f16(%rip),%xmm8        # 4cc0 <_sk_callback_sse41+0x507>
+  DB  68,15,89,5,12,47,0,0                ; mulps         0x2f0c(%rip),%xmm8        # 4cb0 <_sk_callback_sse41+0x4fd>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
@@ -13410,7 +13410,7 @@
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  102,68,15,56,49,4,56                ; pmovzxbd      (%rax,%rdi,1),%xmm8
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,194,46,0,0               ; mulps         0x2ec2(%rip),%xmm8        # 4cd0 <_sk_callback_sse41+0x517>
+  DB  68,15,89,5,184,46,0,0               ; mulps         0x2eb8(%rip),%xmm8        # 4cc0 <_sk_callback_sse41+0x50d>
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -13431,17 +13431,17 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  102,68,15,56,51,20,120              ; pmovzxwd      (%rax,%rdi,2),%xmm10
-  DB  102,68,15,111,5,145,46,0,0          ; movdqa        0x2e91(%rip),%xmm8        # 4ce0 <_sk_callback_sse41+0x527>
+  DB  102,68,15,111,5,135,46,0,0          ; movdqa        0x2e87(%rip),%xmm8        # 4cd0 <_sk_callback_sse41+0x51d>
   DB  102,69,15,219,194                   ; pand          %xmm10,%xmm8
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,144,46,0,0               ; mulps         0x2e90(%rip),%xmm8        # 4cf0 <_sk_callback_sse41+0x537>
-  DB  102,68,15,111,13,151,46,0,0         ; movdqa        0x2e97(%rip),%xmm9        # 4d00 <_sk_callback_sse41+0x547>
+  DB  68,15,89,5,134,46,0,0               ; mulps         0x2e86(%rip),%xmm8        # 4ce0 <_sk_callback_sse41+0x52d>
+  DB  102,68,15,111,13,141,46,0,0         ; movdqa        0x2e8d(%rip),%xmm9        # 4cf0 <_sk_callback_sse41+0x53d>
   DB  102,69,15,219,202                   ; pand          %xmm10,%xmm9
   DB  69,15,91,201                        ; cvtdq2ps      %xmm9,%xmm9
-  DB  68,15,89,13,150,46,0,0              ; mulps         0x2e96(%rip),%xmm9        # 4d10 <_sk_callback_sse41+0x557>
-  DB  102,68,15,219,21,157,46,0,0         ; pand          0x2e9d(%rip),%xmm10        # 4d20 <_sk_callback_sse41+0x567>
+  DB  68,15,89,13,140,46,0,0              ; mulps         0x2e8c(%rip),%xmm9        # 4d00 <_sk_callback_sse41+0x54d>
+  DB  102,68,15,219,21,147,46,0,0         ; pand          0x2e93(%rip),%xmm10        # 4d10 <_sk_callback_sse41+0x55d>
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
-  DB  68,15,89,21,161,46,0,0              ; mulps         0x2ea1(%rip),%xmm10        # 4d30 <_sk_callback_sse41+0x577>
+  DB  68,15,89,21,151,46,0,0              ; mulps         0x2e97(%rip),%xmm10        # 4d20 <_sk_callback_sse41+0x56d>
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -13470,7 +13470,7 @@
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  76,139,72,8                         ; mov           0x8(%rax),%r9
   DB  243,69,15,111,4,184                 ; movdqu        (%r8,%rdi,4),%xmm8
-  DB  102,15,111,5,82,46,0,0              ; movdqa        0x2e52(%rip),%xmm0        # 4d40 <_sk_callback_sse41+0x587>
+  DB  102,15,111,5,72,46,0,0              ; movdqa        0x2e48(%rip),%xmm0        # 4d30 <_sk_callback_sse41+0x57d>
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,73,15,58,22,192,1               ; pextrq        $0x1,%xmm0,%r8
   DB  102,72,15,126,193                   ; movq          %xmm0,%rcx
@@ -13485,7 +13485,7 @@
   DB  102,15,58,33,193,48                 ; insertps      $0x30,%xmm1,%xmm0
   DB  76,139,64,16                        ; mov           0x10(%rax),%r8
   DB  102,65,15,111,200                   ; movdqa        %xmm8,%xmm1
-  DB  102,15,56,0,13,13,46,0,0            ; pshufb        0x2e0d(%rip),%xmm1        # 4d50 <_sk_callback_sse41+0x597>
+  DB  102,15,56,0,13,3,46,0,0             ; pshufb        0x2e03(%rip),%xmm1        # 4d40 <_sk_callback_sse41+0x58d>
   DB  102,73,15,58,22,201,1               ; pextrq        $0x1,%xmm1,%r9
   DB  102,72,15,126,201                   ; movq          %xmm1,%rcx
   DB  68,15,182,209                       ; movzbl        %cl,%r10d
@@ -13500,7 +13500,7 @@
   DB  102,15,58,33,202,48                 ; insertps      $0x30,%xmm2,%xmm1
   DB  76,139,64,24                        ; mov           0x18(%rax),%r8
   DB  102,65,15,111,208                   ; movdqa        %xmm8,%xmm2
-  DB  102,15,56,0,21,201,45,0,0           ; pshufb        0x2dc9(%rip),%xmm2        # 4d60 <_sk_callback_sse41+0x5a7>
+  DB  102,15,56,0,21,191,45,0,0           ; pshufb        0x2dbf(%rip),%xmm2        # 4d50 <_sk_callback_sse41+0x59d>
   DB  102,72,15,58,22,209,1               ; pextrq        $0x1,%xmm2,%rcx
   DB  102,72,15,126,208                   ; movq          %xmm2,%rax
   DB  68,15,182,200                       ; movzbl        %al,%r9d
@@ -13515,7 +13515,7 @@
   DB  102,15,58,33,211,48                 ; insertps      $0x30,%xmm3,%xmm2
   DB  102,65,15,114,208,24                ; psrld         $0x18,%xmm8
   DB  65,15,91,216                        ; cvtdq2ps      %xmm8,%xmm3
-  DB  15,89,29,134,45,0,0                 ; mulps         0x2d86(%rip),%xmm3        # 4d70 <_sk_callback_sse41+0x5b7>
+  DB  15,89,29,124,45,0,0                 ; mulps         0x2d7c(%rip),%xmm3        # 4d60 <_sk_callback_sse41+0x5ad>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
@@ -13532,7 +13532,7 @@
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,97,200                       ; punpcklwd     %xmm0,%xmm1
   DB  102,68,15,105,200                   ; punpckhwd     %xmm0,%xmm9
-  DB  102,68,15,111,5,89,45,0,0           ; movdqa        0x2d59(%rip),%xmm8        # 4d80 <_sk_callback_sse41+0x5c7>
+  DB  102,68,15,111,5,79,45,0,0           ; movdqa        0x2d4f(%rip),%xmm8        # 4d70 <_sk_callback_sse41+0x5bd>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,15,56,51,192                    ; pmovzxwd      %xmm0,%xmm0
@@ -13549,7 +13549,7 @@
   DB  243,67,15,16,20,8                   ; movss         (%r8,%r9,1),%xmm2
   DB  102,15,58,33,194,48                 ; insertps      $0x30,%xmm2,%xmm0
   DB  76,139,64,16                        ; mov           0x10(%rax),%r8
-  DB  102,15,56,0,13,12,45,0,0            ; pshufb        0x2d0c(%rip),%xmm1        # 4d90 <_sk_callback_sse41+0x5d7>
+  DB  102,15,56,0,13,2,45,0,0             ; pshufb        0x2d02(%rip),%xmm1        # 4d80 <_sk_callback_sse41+0x5cd>
   DB  102,15,56,51,201                    ; pmovzxwd      %xmm1,%xmm1
   DB  102,73,15,58,22,201,1               ; pextrq        $0x1,%xmm1,%r9
   DB  102,72,15,126,201                   ; movq          %xmm1,%rcx
@@ -13585,7 +13585,7 @@
   DB  102,65,15,235,216                   ; por           %xmm8,%xmm3
   DB  102,15,56,51,219                    ; pmovzxwd      %xmm3,%xmm3
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,90,44,0,0                  ; mulps         0x2c5a(%rip),%xmm3        # 4da0 <_sk_callback_sse41+0x5e7>
+  DB  15,89,29,80,44,0,0                  ; mulps         0x2c50(%rip),%xmm3        # 4d90 <_sk_callback_sse41+0x5dd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
@@ -13605,7 +13605,7 @@
   DB  102,68,15,97,200                    ; punpcklwd     %xmm0,%xmm9
   DB  102,15,111,202                      ; movdqa        %xmm2,%xmm1
   DB  102,65,15,97,201                    ; punpcklwd     %xmm9,%xmm1
-  DB  102,68,15,111,5,28,44,0,0           ; movdqa        0x2c1c(%rip),%xmm8        # 4db0 <_sk_callback_sse41+0x5f7>
+  DB  102,68,15,111,5,18,44,0,0           ; movdqa        0x2c12(%rip),%xmm8        # 4da0 <_sk_callback_sse41+0x5ed>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,15,56,51,192                    ; pmovzxwd      %xmm0,%xmm0
@@ -13622,7 +13622,7 @@
   DB  243,67,15,16,28,8                   ; movss         (%r8,%r9,1),%xmm3
   DB  102,15,58,33,195,48                 ; insertps      $0x30,%xmm3,%xmm0
   DB  76,139,64,16                        ; mov           0x10(%rax),%r8
-  DB  102,15,56,0,13,207,43,0,0           ; pshufb        0x2bcf(%rip),%xmm1        # 4dc0 <_sk_callback_sse41+0x607>
+  DB  102,15,56,0,13,197,43,0,0           ; pshufb        0x2bc5(%rip),%xmm1        # 4db0 <_sk_callback_sse41+0x5fd>
   DB  102,15,56,51,201                    ; pmovzxwd      %xmm1,%xmm1
   DB  102,73,15,58,22,201,1               ; pextrq        $0x1,%xmm1,%r9
   DB  102,72,15,126,201                   ; movq          %xmm1,%rcx
@@ -13653,7 +13653,7 @@
   DB  243,65,15,16,28,8                   ; movss         (%r8,%rcx,1),%xmm3
   DB  102,15,58,33,211,48                 ; insertps      $0x30,%xmm3,%xmm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,58,43,0,0                  ; movaps        0x2b3a(%rip),%xmm3        # 4dd0 <_sk_callback_sse41+0x617>
+  DB  15,40,29,48,43,0,0                  ; movaps        0x2b30(%rip),%xmm3        # 4dc0 <_sk_callback_sse41+0x60d>
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_byte_tables_sse41
@@ -13661,7 +13661,7 @@
   DB  65,86                               ; push          %r14
   DB  83                                  ; push          %rbx
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,59,43,0,0                ; movaps        0x2b3b(%rip),%xmm8        # 4de0 <_sk_callback_sse41+0x627>
+  DB  68,15,40,5,49,43,0,0                ; movaps        0x2b31(%rip),%xmm8        # 4dd0 <_sk_callback_sse41+0x61d>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,91,192                       ; cvtps2dq      %xmm0,%xmm0
   DB  102,72,15,58,22,193,1               ; pextrq        $0x1,%xmm0,%rcx
@@ -13680,7 +13680,7 @@
   DB  102,15,58,32,193,3                  ; pinsrb        $0x3,%ecx,%xmm0
   DB  102,15,56,49,192                    ; pmovzxbd      %xmm0,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,13,236,42,0,0              ; movaps        0x2aec(%rip),%xmm9        # 4df0 <_sk_callback_sse41+0x637>
+  DB  68,15,40,13,226,42,0,0              ; movaps        0x2ae2(%rip),%xmm9        # 4de0 <_sk_callback_sse41+0x62d>
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,91,201                       ; cvtps2dq      %xmm1,%xmm1
@@ -13769,7 +13769,7 @@
   DB  102,15,58,32,193,3                  ; pinsrb        $0x3,%ecx,%xmm0
   DB  102,15,56,49,192                    ; pmovzxbd      %xmm0,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,13,116,41,0,0              ; movaps        0x2974(%rip),%xmm9        # 4e00 <_sk_callback_sse41+0x647>
+  DB  68,15,40,13,106,41,0,0              ; movaps        0x296a(%rip),%xmm9        # 4df0 <_sk_callback_sse41+0x63d>
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,91,201                       ; cvtps2dq      %xmm1,%xmm1
@@ -13936,31 +13936,31 @@
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,194                        ; cvtdq2ps      %xmm10,%xmm8
-  DB  68,15,89,5,203,38,0,0               ; mulps         0x26cb(%rip),%xmm8        # 4e10 <_sk_callback_sse41+0x657>
-  DB  68,15,84,21,211,38,0,0              ; andps         0x26d3(%rip),%xmm10        # 4e20 <_sk_callback_sse41+0x667>
-  DB  68,15,86,21,219,38,0,0              ; orps          0x26db(%rip),%xmm10        # 4e30 <_sk_callback_sse41+0x677>
-  DB  68,15,88,5,227,38,0,0               ; addps         0x26e3(%rip),%xmm8        # 4e40 <_sk_callback_sse41+0x687>
-  DB  68,15,40,37,235,38,0,0              ; movaps        0x26eb(%rip),%xmm12        # 4e50 <_sk_callback_sse41+0x697>
+  DB  68,15,89,5,193,38,0,0               ; mulps         0x26c1(%rip),%xmm8        # 4e00 <_sk_callback_sse41+0x64d>
+  DB  68,15,84,21,201,38,0,0              ; andps         0x26c9(%rip),%xmm10        # 4e10 <_sk_callback_sse41+0x65d>
+  DB  68,15,86,21,209,38,0,0              ; orps          0x26d1(%rip),%xmm10        # 4e20 <_sk_callback_sse41+0x66d>
+  DB  68,15,88,5,217,38,0,0               ; addps         0x26d9(%rip),%xmm8        # 4e30 <_sk_callback_sse41+0x67d>
+  DB  68,15,40,37,225,38,0,0              ; movaps        0x26e1(%rip),%xmm12        # 4e40 <_sk_callback_sse41+0x68d>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,196                        ; subps         %xmm12,%xmm8
-  DB  68,15,88,21,235,38,0,0              ; addps         0x26eb(%rip),%xmm10        # 4e60 <_sk_callback_sse41+0x6a7>
-  DB  68,15,40,37,243,38,0,0              ; movaps        0x26f3(%rip),%xmm12        # 4e70 <_sk_callback_sse41+0x6b7>
+  DB  68,15,88,21,225,38,0,0              ; addps         0x26e1(%rip),%xmm10        # 4e50 <_sk_callback_sse41+0x69d>
+  DB  68,15,40,37,233,38,0,0              ; movaps        0x26e9(%rip),%xmm12        # 4e60 <_sk_callback_sse41+0x6ad>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,196                        ; subps         %xmm12,%xmm8
   DB  69,15,89,195                        ; mulps         %xmm11,%xmm8
   DB  102,69,15,58,8,208,1                ; roundps       $0x1,%xmm8,%xmm10
   DB  69,15,40,216                        ; movaps        %xmm8,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  68,15,88,5,224,38,0,0               ; addps         0x26e0(%rip),%xmm8        # 4e80 <_sk_callback_sse41+0x6c7>
-  DB  68,15,40,21,232,38,0,0              ; movaps        0x26e8(%rip),%xmm10        # 4e90 <_sk_callback_sse41+0x6d7>
+  DB  68,15,88,5,214,38,0,0               ; addps         0x26d6(%rip),%xmm8        # 4e70 <_sk_callback_sse41+0x6bd>
+  DB  68,15,40,21,222,38,0,0              ; movaps        0x26de(%rip),%xmm10        # 4e80 <_sk_callback_sse41+0x6cd>
   DB  69,15,89,211                        ; mulps         %xmm11,%xmm10
   DB  69,15,92,194                        ; subps         %xmm10,%xmm8
-  DB  68,15,40,21,232,38,0,0              ; movaps        0x26e8(%rip),%xmm10        # 4ea0 <_sk_callback_sse41+0x6e7>
+  DB  68,15,40,21,222,38,0,0              ; movaps        0x26de(%rip),%xmm10        # 4e90 <_sk_callback_sse41+0x6dd>
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
-  DB  68,15,40,29,236,38,0,0              ; movaps        0x26ec(%rip),%xmm11        # 4eb0 <_sk_callback_sse41+0x6f7>
+  DB  68,15,40,29,226,38,0,0              ; movaps        0x26e2(%rip),%xmm11        # 4ea0 <_sk_callback_sse41+0x6ed>
   DB  69,15,94,218                        ; divps         %xmm10,%xmm11
   DB  69,15,88,216                        ; addps         %xmm8,%xmm11
-  DB  68,15,89,29,236,38,0,0              ; mulps         0x26ec(%rip),%xmm11        # 4ec0 <_sk_callback_sse41+0x707>
+  DB  68,15,89,29,226,38,0,0              ; mulps         0x26e2(%rip),%xmm11        # 4eb0 <_sk_callback_sse41+0x6fd>
   DB  102,69,15,91,211                    ; cvtps2dq      %xmm11,%xmm10
   DB  243,68,15,16,64,20                  ; movss         0x14(%rax),%xmm8
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
@@ -13968,7 +13968,7 @@
   DB  102,69,15,56,20,193                 ; blendvps      %xmm0,%xmm9,%xmm8
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  68,15,95,192                        ; maxps         %xmm0,%xmm8
-  DB  68,15,93,5,211,38,0,0               ; minps         0x26d3(%rip),%xmm8        # 4ed0 <_sk_callback_sse41+0x717>
+  DB  68,15,93,5,201,38,0,0               ; minps         0x26c9(%rip),%xmm8        # 4ec0 <_sk_callback_sse41+0x70d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -13996,31 +13996,31 @@
   DB  68,15,88,217                        ; addps         %xmm1,%xmm11
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,91,227                        ; cvtdq2ps      %xmm11,%xmm12
-  DB  68,15,89,37,116,38,0,0              ; mulps         0x2674(%rip),%xmm12        # 4ee0 <_sk_callback_sse41+0x727>
-  DB  68,15,84,29,124,38,0,0              ; andps         0x267c(%rip),%xmm11        # 4ef0 <_sk_callback_sse41+0x737>
-  DB  68,15,86,29,132,38,0,0              ; orps          0x2684(%rip),%xmm11        # 4f00 <_sk_callback_sse41+0x747>
-  DB  68,15,88,37,140,38,0,0              ; addps         0x268c(%rip),%xmm12        # 4f10 <_sk_callback_sse41+0x757>
-  DB  15,40,13,149,38,0,0                 ; movaps        0x2695(%rip),%xmm1        # 4f20 <_sk_callback_sse41+0x767>
+  DB  68,15,89,37,106,38,0,0              ; mulps         0x266a(%rip),%xmm12        # 4ed0 <_sk_callback_sse41+0x71d>
+  DB  68,15,84,29,114,38,0,0              ; andps         0x2672(%rip),%xmm11        # 4ee0 <_sk_callback_sse41+0x72d>
+  DB  68,15,86,29,122,38,0,0              ; orps          0x267a(%rip),%xmm11        # 4ef0 <_sk_callback_sse41+0x73d>
+  DB  68,15,88,37,130,38,0,0              ; addps         0x2682(%rip),%xmm12        # 4f00 <_sk_callback_sse41+0x74d>
+  DB  15,40,13,139,38,0,0                 ; movaps        0x268b(%rip),%xmm1        # 4f10 <_sk_callback_sse41+0x75d>
   DB  65,15,89,203                        ; mulps         %xmm11,%xmm1
   DB  68,15,92,225                        ; subps         %xmm1,%xmm12
-  DB  68,15,88,29,149,38,0,0              ; addps         0x2695(%rip),%xmm11        # 4f30 <_sk_callback_sse41+0x777>
-  DB  15,40,13,158,38,0,0                 ; movaps        0x269e(%rip),%xmm1        # 4f40 <_sk_callback_sse41+0x787>
+  DB  68,15,88,29,139,38,0,0              ; addps         0x268b(%rip),%xmm11        # 4f20 <_sk_callback_sse41+0x76d>
+  DB  15,40,13,148,38,0,0                 ; movaps        0x2694(%rip),%xmm1        # 4f30 <_sk_callback_sse41+0x77d>
   DB  65,15,94,203                        ; divps         %xmm11,%xmm1
   DB  68,15,92,225                        ; subps         %xmm1,%xmm12
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  102,69,15,58,8,212,1                ; roundps       $0x1,%xmm12,%xmm10
   DB  69,15,40,220                        ; movaps        %xmm12,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  68,15,88,37,139,38,0,0              ; addps         0x268b(%rip),%xmm12        # 4f50 <_sk_callback_sse41+0x797>
-  DB  15,40,13,148,38,0,0                 ; movaps        0x2694(%rip),%xmm1        # 4f60 <_sk_callback_sse41+0x7a7>
+  DB  68,15,88,37,129,38,0,0              ; addps         0x2681(%rip),%xmm12        # 4f40 <_sk_callback_sse41+0x78d>
+  DB  15,40,13,138,38,0,0                 ; movaps        0x268a(%rip),%xmm1        # 4f50 <_sk_callback_sse41+0x79d>
   DB  65,15,89,203                        ; mulps         %xmm11,%xmm1
   DB  68,15,92,225                        ; subps         %xmm1,%xmm12
-  DB  68,15,40,21,148,38,0,0              ; movaps        0x2694(%rip),%xmm10        # 4f70 <_sk_callback_sse41+0x7b7>
+  DB  68,15,40,21,138,38,0,0              ; movaps        0x268a(%rip),%xmm10        # 4f60 <_sk_callback_sse41+0x7ad>
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
-  DB  15,40,13,153,38,0,0                 ; movaps        0x2699(%rip),%xmm1        # 4f80 <_sk_callback_sse41+0x7c7>
+  DB  15,40,13,143,38,0,0                 ; movaps        0x268f(%rip),%xmm1        # 4f70 <_sk_callback_sse41+0x7bd>
   DB  65,15,94,202                        ; divps         %xmm10,%xmm1
   DB  65,15,88,204                        ; addps         %xmm12,%xmm1
-  DB  15,89,13,154,38,0,0                 ; mulps         0x269a(%rip),%xmm1        # 4f90 <_sk_callback_sse41+0x7d7>
+  DB  15,89,13,144,38,0,0                 ; mulps         0x2690(%rip),%xmm1        # 4f80 <_sk_callback_sse41+0x7cd>
   DB  102,68,15,91,209                    ; cvtps2dq      %xmm1,%xmm10
   DB  243,15,16,72,20                     ; movss         0x14(%rax),%xmm1
   DB  15,198,201,0                        ; shufps        $0x0,%xmm1,%xmm1
@@ -14028,7 +14028,7 @@
   DB  102,65,15,56,20,201                 ; blendvps      %xmm0,%xmm9,%xmm1
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  15,95,200                           ; maxps         %xmm0,%xmm1
-  DB  15,93,13,133,38,0,0                 ; minps         0x2685(%rip),%xmm1        # 4fa0 <_sk_callback_sse41+0x7e7>
+  DB  15,93,13,123,38,0,0                 ; minps         0x267b(%rip),%xmm1        # 4f90 <_sk_callback_sse41+0x7dd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -14056,31 +14056,31 @@
   DB  68,15,88,218                        ; addps         %xmm2,%xmm11
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,91,227                        ; cvtdq2ps      %xmm11,%xmm12
-  DB  68,15,89,37,38,38,0,0               ; mulps         0x2626(%rip),%xmm12        # 4fb0 <_sk_callback_sse41+0x7f7>
-  DB  68,15,84,29,46,38,0,0               ; andps         0x262e(%rip),%xmm11        # 4fc0 <_sk_callback_sse41+0x807>
-  DB  68,15,86,29,54,38,0,0               ; orps          0x2636(%rip),%xmm11        # 4fd0 <_sk_callback_sse41+0x817>
-  DB  68,15,88,37,62,38,0,0               ; addps         0x263e(%rip),%xmm12        # 4fe0 <_sk_callback_sse41+0x827>
-  DB  15,40,21,71,38,0,0                  ; movaps        0x2647(%rip),%xmm2        # 4ff0 <_sk_callback_sse41+0x837>
+  DB  68,15,89,37,28,38,0,0               ; mulps         0x261c(%rip),%xmm12        # 4fa0 <_sk_callback_sse41+0x7ed>
+  DB  68,15,84,29,36,38,0,0               ; andps         0x2624(%rip),%xmm11        # 4fb0 <_sk_callback_sse41+0x7fd>
+  DB  68,15,86,29,44,38,0,0               ; orps          0x262c(%rip),%xmm11        # 4fc0 <_sk_callback_sse41+0x80d>
+  DB  68,15,88,37,52,38,0,0               ; addps         0x2634(%rip),%xmm12        # 4fd0 <_sk_callback_sse41+0x81d>
+  DB  15,40,21,61,38,0,0                  ; movaps        0x263d(%rip),%xmm2        # 4fe0 <_sk_callback_sse41+0x82d>
   DB  65,15,89,211                        ; mulps         %xmm11,%xmm2
   DB  68,15,92,226                        ; subps         %xmm2,%xmm12
-  DB  68,15,88,29,71,38,0,0               ; addps         0x2647(%rip),%xmm11        # 5000 <_sk_callback_sse41+0x847>
-  DB  15,40,21,80,38,0,0                  ; movaps        0x2650(%rip),%xmm2        # 5010 <_sk_callback_sse41+0x857>
+  DB  68,15,88,29,61,38,0,0               ; addps         0x263d(%rip),%xmm11        # 4ff0 <_sk_callback_sse41+0x83d>
+  DB  15,40,21,70,38,0,0                  ; movaps        0x2646(%rip),%xmm2        # 5000 <_sk_callback_sse41+0x84d>
   DB  65,15,94,211                        ; divps         %xmm11,%xmm2
   DB  68,15,92,226                        ; subps         %xmm2,%xmm12
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  102,69,15,58,8,212,1                ; roundps       $0x1,%xmm12,%xmm10
   DB  69,15,40,220                        ; movaps        %xmm12,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  68,15,88,37,61,38,0,0               ; addps         0x263d(%rip),%xmm12        # 5020 <_sk_callback_sse41+0x867>
-  DB  15,40,21,70,38,0,0                  ; movaps        0x2646(%rip),%xmm2        # 5030 <_sk_callback_sse41+0x877>
+  DB  68,15,88,37,51,38,0,0               ; addps         0x2633(%rip),%xmm12        # 5010 <_sk_callback_sse41+0x85d>
+  DB  15,40,21,60,38,0,0                  ; movaps        0x263c(%rip),%xmm2        # 5020 <_sk_callback_sse41+0x86d>
   DB  65,15,89,211                        ; mulps         %xmm11,%xmm2
   DB  68,15,92,226                        ; subps         %xmm2,%xmm12
-  DB  68,15,40,21,70,38,0,0               ; movaps        0x2646(%rip),%xmm10        # 5040 <_sk_callback_sse41+0x887>
+  DB  68,15,40,21,60,38,0,0               ; movaps        0x263c(%rip),%xmm10        # 5030 <_sk_callback_sse41+0x87d>
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
-  DB  15,40,21,75,38,0,0                  ; movaps        0x264b(%rip),%xmm2        # 5050 <_sk_callback_sse41+0x897>
+  DB  15,40,21,65,38,0,0                  ; movaps        0x2641(%rip),%xmm2        # 5040 <_sk_callback_sse41+0x88d>
   DB  65,15,94,210                        ; divps         %xmm10,%xmm2
   DB  65,15,88,212                        ; addps         %xmm12,%xmm2
-  DB  15,89,21,76,38,0,0                  ; mulps         0x264c(%rip),%xmm2        # 5060 <_sk_callback_sse41+0x8a7>
+  DB  15,89,21,66,38,0,0                  ; mulps         0x2642(%rip),%xmm2        # 5050 <_sk_callback_sse41+0x89d>
   DB  102,68,15,91,210                    ; cvtps2dq      %xmm2,%xmm10
   DB  243,15,16,80,20                     ; movss         0x14(%rax),%xmm2
   DB  15,198,210,0                        ; shufps        $0x0,%xmm2,%xmm2
@@ -14088,7 +14088,7 @@
   DB  102,65,15,56,20,209                 ; blendvps      %xmm0,%xmm9,%xmm2
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  15,95,208                           ; maxps         %xmm0,%xmm2
-  DB  15,93,21,55,38,0,0                  ; minps         0x2637(%rip),%xmm2        # 5070 <_sk_callback_sse41+0x8b7>
+  DB  15,93,21,45,38,0,0                  ; minps         0x262d(%rip),%xmm2        # 5060 <_sk_callback_sse41+0x8ad>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -14116,31 +14116,31 @@
   DB  68,15,88,219                        ; addps         %xmm3,%xmm11
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,91,227                        ; cvtdq2ps      %xmm11,%xmm12
-  DB  68,15,89,37,216,37,0,0              ; mulps         0x25d8(%rip),%xmm12        # 5080 <_sk_callback_sse41+0x8c7>
-  DB  68,15,84,29,224,37,0,0              ; andps         0x25e0(%rip),%xmm11        # 5090 <_sk_callback_sse41+0x8d7>
-  DB  68,15,86,29,232,37,0,0              ; orps          0x25e8(%rip),%xmm11        # 50a0 <_sk_callback_sse41+0x8e7>
-  DB  68,15,88,37,240,37,0,0              ; addps         0x25f0(%rip),%xmm12        # 50b0 <_sk_callback_sse41+0x8f7>
-  DB  15,40,29,249,37,0,0                 ; movaps        0x25f9(%rip),%xmm3        # 50c0 <_sk_callback_sse41+0x907>
+  DB  68,15,89,37,206,37,0,0              ; mulps         0x25ce(%rip),%xmm12        # 5070 <_sk_callback_sse41+0x8bd>
+  DB  68,15,84,29,214,37,0,0              ; andps         0x25d6(%rip),%xmm11        # 5080 <_sk_callback_sse41+0x8cd>
+  DB  68,15,86,29,222,37,0,0              ; orps          0x25de(%rip),%xmm11        # 5090 <_sk_callback_sse41+0x8dd>
+  DB  68,15,88,37,230,37,0,0              ; addps         0x25e6(%rip),%xmm12        # 50a0 <_sk_callback_sse41+0x8ed>
+  DB  15,40,29,239,37,0,0                 ; movaps        0x25ef(%rip),%xmm3        # 50b0 <_sk_callback_sse41+0x8fd>
   DB  65,15,89,219                        ; mulps         %xmm11,%xmm3
   DB  68,15,92,227                        ; subps         %xmm3,%xmm12
-  DB  68,15,88,29,249,37,0,0              ; addps         0x25f9(%rip),%xmm11        # 50d0 <_sk_callback_sse41+0x917>
-  DB  15,40,29,2,38,0,0                   ; movaps        0x2602(%rip),%xmm3        # 50e0 <_sk_callback_sse41+0x927>
+  DB  68,15,88,29,239,37,0,0              ; addps         0x25ef(%rip),%xmm11        # 50c0 <_sk_callback_sse41+0x90d>
+  DB  15,40,29,248,37,0,0                 ; movaps        0x25f8(%rip),%xmm3        # 50d0 <_sk_callback_sse41+0x91d>
   DB  65,15,94,219                        ; divps         %xmm11,%xmm3
   DB  68,15,92,227                        ; subps         %xmm3,%xmm12
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  102,69,15,58,8,212,1                ; roundps       $0x1,%xmm12,%xmm10
   DB  69,15,40,220                        ; movaps        %xmm12,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  68,15,88,37,239,37,0,0              ; addps         0x25ef(%rip),%xmm12        # 50f0 <_sk_callback_sse41+0x937>
-  DB  15,40,29,248,37,0,0                 ; movaps        0x25f8(%rip),%xmm3        # 5100 <_sk_callback_sse41+0x947>
+  DB  68,15,88,37,229,37,0,0              ; addps         0x25e5(%rip),%xmm12        # 50e0 <_sk_callback_sse41+0x92d>
+  DB  15,40,29,238,37,0,0                 ; movaps        0x25ee(%rip),%xmm3        # 50f0 <_sk_callback_sse41+0x93d>
   DB  65,15,89,219                        ; mulps         %xmm11,%xmm3
   DB  68,15,92,227                        ; subps         %xmm3,%xmm12
-  DB  68,15,40,21,248,37,0,0              ; movaps        0x25f8(%rip),%xmm10        # 5110 <_sk_callback_sse41+0x957>
+  DB  68,15,40,21,238,37,0,0              ; movaps        0x25ee(%rip),%xmm10        # 5100 <_sk_callback_sse41+0x94d>
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
-  DB  15,40,29,253,37,0,0                 ; movaps        0x25fd(%rip),%xmm3        # 5120 <_sk_callback_sse41+0x967>
+  DB  15,40,29,243,37,0,0                 ; movaps        0x25f3(%rip),%xmm3        # 5110 <_sk_callback_sse41+0x95d>
   DB  65,15,94,218                        ; divps         %xmm10,%xmm3
   DB  65,15,88,220                        ; addps         %xmm12,%xmm3
-  DB  15,89,29,254,37,0,0                 ; mulps         0x25fe(%rip),%xmm3        # 5130 <_sk_callback_sse41+0x977>
+  DB  15,89,29,244,37,0,0                 ; mulps         0x25f4(%rip),%xmm3        # 5120 <_sk_callback_sse41+0x96d>
   DB  102,68,15,91,211                    ; cvtps2dq      %xmm3,%xmm10
   DB  243,15,16,88,20                     ; movss         0x14(%rax),%xmm3
   DB  15,198,219,0                        ; shufps        $0x0,%xmm3,%xmm3
@@ -14148,7 +14148,7 @@
   DB  102,65,15,56,20,217                 ; blendvps      %xmm0,%xmm9,%xmm3
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  15,95,216                           ; maxps         %xmm0,%xmm3
-  DB  15,93,29,233,37,0,0                 ; minps         0x25e9(%rip),%xmm3        # 5140 <_sk_callback_sse41+0x987>
+  DB  15,93,29,223,37,0,0                 ; minps         0x25df(%rip),%xmm3        # 5130 <_sk_callback_sse41+0x97d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -14156,29 +14156,29 @@
 PUBLIC _sk_lab_to_xyz_sse41
 _sk_lab_to_xyz_sse41 LABEL PROC
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,89,5,229,37,0,0               ; mulps         0x25e5(%rip),%xmm8        # 5150 <_sk_callback_sse41+0x997>
-  DB  68,15,40,13,237,37,0,0              ; movaps        0x25ed(%rip),%xmm9        # 5160 <_sk_callback_sse41+0x9a7>
+  DB  68,15,89,5,219,37,0,0               ; mulps         0x25db(%rip),%xmm8        # 5140 <_sk_callback_sse41+0x98d>
+  DB  68,15,40,13,227,37,0,0              ; movaps        0x25e3(%rip),%xmm9        # 5150 <_sk_callback_sse41+0x99d>
   DB  65,15,89,201                        ; mulps         %xmm9,%xmm1
-  DB  15,40,5,242,37,0,0                  ; movaps        0x25f2(%rip),%xmm0        # 5170 <_sk_callback_sse41+0x9b7>
+  DB  15,40,5,232,37,0,0                  ; movaps        0x25e8(%rip),%xmm0        # 5160 <_sk_callback_sse41+0x9ad>
   DB  15,88,200                           ; addps         %xmm0,%xmm1
   DB  65,15,89,209                        ; mulps         %xmm9,%xmm2
   DB  15,88,208                           ; addps         %xmm0,%xmm2
-  DB  68,15,88,5,240,37,0,0               ; addps         0x25f0(%rip),%xmm8        # 5180 <_sk_callback_sse41+0x9c7>
-  DB  68,15,89,5,248,37,0,0               ; mulps         0x25f8(%rip),%xmm8        # 5190 <_sk_callback_sse41+0x9d7>
-  DB  15,89,13,1,38,0,0                   ; mulps         0x2601(%rip),%xmm1        # 51a0 <_sk_callback_sse41+0x9e7>
+  DB  68,15,88,5,230,37,0,0               ; addps         0x25e6(%rip),%xmm8        # 5170 <_sk_callback_sse41+0x9bd>
+  DB  68,15,89,5,238,37,0,0               ; mulps         0x25ee(%rip),%xmm8        # 5180 <_sk_callback_sse41+0x9cd>
+  DB  15,89,13,247,37,0,0                 ; mulps         0x25f7(%rip),%xmm1        # 5190 <_sk_callback_sse41+0x9dd>
   DB  65,15,88,200                        ; addps         %xmm8,%xmm1
-  DB  15,89,21,6,38,0,0                   ; mulps         0x2606(%rip),%xmm2        # 51b0 <_sk_callback_sse41+0x9f7>
+  DB  15,89,21,252,37,0,0                 ; mulps         0x25fc(%rip),%xmm2        # 51a0 <_sk_callback_sse41+0x9ed>
   DB  69,15,40,208                        ; movaps        %xmm8,%xmm10
   DB  68,15,92,210                        ; subps         %xmm2,%xmm10
   DB  68,15,40,217                        ; movaps        %xmm1,%xmm11
   DB  69,15,89,219                        ; mulps         %xmm11,%xmm11
   DB  68,15,89,217                        ; mulps         %xmm1,%xmm11
-  DB  68,15,40,13,250,37,0,0              ; movaps        0x25fa(%rip),%xmm9        # 51c0 <_sk_callback_sse41+0xa07>
+  DB  68,15,40,13,240,37,0,0              ; movaps        0x25f0(%rip),%xmm9        # 51b0 <_sk_callback_sse41+0x9fd>
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  65,15,194,195,1                     ; cmpltps       %xmm11,%xmm0
-  DB  15,40,21,250,37,0,0                 ; movaps        0x25fa(%rip),%xmm2        # 51d0 <_sk_callback_sse41+0xa17>
+  DB  15,40,21,240,37,0,0                 ; movaps        0x25f0(%rip),%xmm2        # 51c0 <_sk_callback_sse41+0xa0d>
   DB  15,88,202                           ; addps         %xmm2,%xmm1
-  DB  68,15,40,37,255,37,0,0              ; movaps        0x25ff(%rip),%xmm12        # 51e0 <_sk_callback_sse41+0xa27>
+  DB  68,15,40,37,245,37,0,0              ; movaps        0x25f5(%rip),%xmm12        # 51d0 <_sk_callback_sse41+0xa1d>
   DB  65,15,89,204                        ; mulps         %xmm12,%xmm1
   DB  102,65,15,56,20,203                 ; blendvps      %xmm0,%xmm11,%xmm1
   DB  69,15,40,216                        ; movaps        %xmm8,%xmm11
@@ -14197,8 +14197,8 @@
   DB  65,15,89,212                        ; mulps         %xmm12,%xmm2
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  102,65,15,56,20,211                 ; blendvps      %xmm0,%xmm11,%xmm2
-  DB  15,89,13,184,37,0,0                 ; mulps         0x25b8(%rip),%xmm1        # 51f0 <_sk_callback_sse41+0xa37>
-  DB  15,89,21,193,37,0,0                 ; mulps         0x25c1(%rip),%xmm2        # 5200 <_sk_callback_sse41+0xa47>
+  DB  15,89,13,174,37,0,0                 ; mulps         0x25ae(%rip),%xmm1        # 51e0 <_sk_callback_sse41+0xa2d>
+  DB  15,89,21,183,37,0,0                 ; mulps         0x25b7(%rip),%xmm2        # 51f0 <_sk_callback_sse41+0xa3d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,40,193                           ; movaps        %xmm1,%xmm0
   DB  65,15,40,200                        ; movaps        %xmm8,%xmm1
@@ -14210,7 +14210,7 @@
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  102,15,56,49,4,56                   ; pmovzxbd      (%rax,%rdi,1),%xmm0
   DB  15,91,216                           ; cvtdq2ps      %xmm0,%xmm3
-  DB  15,89,29,177,37,0,0                 ; mulps         0x25b1(%rip),%xmm3        # 5210 <_sk_callback_sse41+0xa57>
+  DB  15,89,29,167,37,0,0                 ; mulps         0x25a7(%rip),%xmm3        # 5200 <_sk_callback_sse41+0xa4d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  15,87,201                           ; xorps         %xmm1,%xmm1
@@ -14241,7 +14241,7 @@
   DB  102,15,58,32,192,3                  ; pinsrb        $0x3,%eax,%xmm0
   DB  102,15,56,49,192                    ; pmovzxbd      %xmm0,%xmm0
   DB  15,91,216                           ; cvtdq2ps      %xmm0,%xmm3
-  DB  15,89,29,69,37,0,0                  ; mulps         0x2545(%rip),%xmm3        # 5220 <_sk_callback_sse41+0xa67>
+  DB  15,89,29,59,37,0,0                  ; mulps         0x253b(%rip),%xmm3        # 5210 <_sk_callback_sse41+0xa5d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
@@ -14252,7 +14252,7 @@
 _sk_store_a8_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,57,37,0,0                ; movaps        0x2539(%rip),%xmm8        # 5230 <_sk_callback_sse41+0xa77>
+  DB  68,15,40,5,47,37,0,0                ; movaps        0x252f(%rip),%xmm8        # 5220 <_sk_callback_sse41+0xa6d>
   DB  68,15,89,195                        ; mulps         %xmm3,%xmm8
   DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
   DB  102,69,15,56,43,192                 ; packusdw      %xmm8,%xmm8
@@ -14267,9 +14267,9 @@
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  102,15,56,49,4,56                   ; pmovzxbd      (%rax,%rdi,1),%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,22,37,0,0                   ; mulps         0x2516(%rip),%xmm0        # 5240 <_sk_callback_sse41+0xa87>
+  DB  15,89,5,12,37,0,0                   ; mulps         0x250c(%rip),%xmm0        # 5230 <_sk_callback_sse41+0xa7d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,29,37,0,0                  ; movaps        0x251d(%rip),%xmm3        # 5250 <_sk_callback_sse41+0xa97>
+  DB  15,40,29,19,37,0,0                  ; movaps        0x2513(%rip),%xmm3        # 5240 <_sk_callback_sse41+0xa8d>
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  255,224                             ; jmpq          *%rax
@@ -14298,9 +14298,9 @@
   DB  102,15,58,32,192,3                  ; pinsrb        $0x3,%eax,%xmm0
   DB  102,15,56,49,192                    ; pmovzxbd      %xmm0,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,182,36,0,0                  ; mulps         0x24b6(%rip),%xmm0        # 5260 <_sk_callback_sse41+0xaa7>
+  DB  15,89,5,172,36,0,0                  ; mulps         0x24ac(%rip),%xmm0        # 5250 <_sk_callback_sse41+0xa9d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,189,36,0,0                 ; movaps        0x24bd(%rip),%xmm3        # 5270 <_sk_callback_sse41+0xab7>
+  DB  15,40,29,179,36,0,0                 ; movaps        0x24b3(%rip),%xmm3        # 5260 <_sk_callback_sse41+0xaad>
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  255,224                             ; jmpq          *%rax
@@ -14310,9 +14310,9 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,137,192                          ; mov           %rax,%r8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  116,5                               ; je            2dca <_sk_gather_i8_sse41+0xf>
+  DB  116,5                               ; je            2dc4 <_sk_gather_i8_sse41+0xf>
   DB  76,137,192                          ; mov           %r8,%rax
-  DB  235,2                               ; jmp           2dcc <_sk_gather_i8_sse41+0x11>
+  DB  235,2                               ; jmp           2dc6 <_sk_gather_i8_sse41+0x11>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  243,15,91,201                       ; cvttps2dq     %xmm1,%xmm1
@@ -14343,17 +14343,17 @@
   DB  102,15,58,34,28,8,1                 ; pinsrd        $0x1,(%rax,%rcx,1),%xmm3
   DB  102,66,15,58,34,28,144,2            ; pinsrd        $0x2,(%rax,%r10,4),%xmm3
   DB  102,66,15,58,34,28,8,3              ; pinsrd        $0x3,(%rax,%r9,1),%xmm3
-  DB  102,15,111,5,20,36,0,0              ; movdqa        0x2414(%rip),%xmm0        # 5280 <_sk_callback_sse41+0xac7>
+  DB  102,15,111,5,10,36,0,0              ; movdqa        0x240a(%rip),%xmm0        # 5270 <_sk_callback_sse41+0xabd>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,21,36,0,0                ; movaps        0x2415(%rip),%xmm8        # 5290 <_sk_callback_sse41+0xad7>
+  DB  68,15,40,5,11,36,0,0                ; movaps        0x240b(%rip),%xmm8        # 5280 <_sk_callback_sse41+0xacd>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
-  DB  102,15,56,0,13,20,36,0,0            ; pshufb        0x2414(%rip),%xmm1        # 52a0 <_sk_callback_sse41+0xae7>
+  DB  102,15,56,0,13,10,36,0,0            ; pshufb        0x240a(%rip),%xmm1        # 5290 <_sk_callback_sse41+0xadd>
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,111,211                      ; movdqa        %xmm3,%xmm2
-  DB  102,15,56,0,21,16,36,0,0            ; pshufb        0x2410(%rip),%xmm2        # 52b0 <_sk_callback_sse41+0xaf7>
+  DB  102,15,56,0,21,6,36,0,0             ; pshufb        0x2406(%rip),%xmm2        # 52a0 <_sk_callback_sse41+0xaed>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  102,15,114,211,24                   ; psrld         $0x18,%xmm3
@@ -14367,19 +14367,19 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  102,15,56,51,20,120                 ; pmovzxwd      (%rax,%rdi,2),%xmm2
-  DB  102,15,111,5,246,35,0,0             ; movdqa        0x23f6(%rip),%xmm0        # 52c0 <_sk_callback_sse41+0xb07>
+  DB  102,15,111,5,236,35,0,0             ; movdqa        0x23ec(%rip),%xmm0        # 52b0 <_sk_callback_sse41+0xafd>
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,248,35,0,0                  ; mulps         0x23f8(%rip),%xmm0        # 52d0 <_sk_callback_sse41+0xb17>
-  DB  102,15,111,13,0,36,0,0              ; movdqa        0x2400(%rip),%xmm1        # 52e0 <_sk_callback_sse41+0xb27>
+  DB  15,89,5,238,35,0,0                  ; mulps         0x23ee(%rip),%xmm0        # 52c0 <_sk_callback_sse41+0xb0d>
+  DB  102,15,111,13,246,35,0,0            ; movdqa        0x23f6(%rip),%xmm1        # 52d0 <_sk_callback_sse41+0xb1d>
   DB  102,15,219,202                      ; pand          %xmm2,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,2,36,0,0                   ; mulps         0x2402(%rip),%xmm1        # 52f0 <_sk_callback_sse41+0xb37>
-  DB  102,15,219,21,10,36,0,0             ; pand          0x240a(%rip),%xmm2        # 5300 <_sk_callback_sse41+0xb47>
+  DB  15,89,13,248,35,0,0                 ; mulps         0x23f8(%rip),%xmm1        # 52e0 <_sk_callback_sse41+0xb2d>
+  DB  102,15,219,21,0,36,0,0              ; pand          0x2400(%rip),%xmm2        # 52f0 <_sk_callback_sse41+0xb3d>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,16,36,0,0                  ; mulps         0x2410(%rip),%xmm2        # 5310 <_sk_callback_sse41+0xb57>
+  DB  15,89,21,6,36,0,0                   ; mulps         0x2406(%rip),%xmm2        # 5300 <_sk_callback_sse41+0xb4d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,23,36,0,0                  ; movaps        0x2417(%rip),%xmm3        # 5320 <_sk_callback_sse41+0xb67>
+  DB  15,40,29,13,36,0,0                  ; movaps        0x240d(%rip),%xmm3        # 5310 <_sk_callback_sse41+0xb5d>
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_gather_565_sse41
@@ -14405,31 +14405,31 @@
   DB  65,15,183,4,65                      ; movzwl        (%r9,%rax,2),%eax
   DB  102,15,196,192,3                    ; pinsrw        $0x3,%eax,%xmm0
   DB  102,15,56,51,208                    ; pmovzxwd      %xmm0,%xmm2
-  DB  102,15,111,5,188,35,0,0             ; movdqa        0x23bc(%rip),%xmm0        # 5330 <_sk_callback_sse41+0xb77>
+  DB  102,15,111,5,178,35,0,0             ; movdqa        0x23b2(%rip),%xmm0        # 5320 <_sk_callback_sse41+0xb6d>
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,190,35,0,0                  ; mulps         0x23be(%rip),%xmm0        # 5340 <_sk_callback_sse41+0xb87>
-  DB  102,15,111,13,198,35,0,0            ; movdqa        0x23c6(%rip),%xmm1        # 5350 <_sk_callback_sse41+0xb97>
+  DB  15,89,5,180,35,0,0                  ; mulps         0x23b4(%rip),%xmm0        # 5330 <_sk_callback_sse41+0xb7d>
+  DB  102,15,111,13,188,35,0,0            ; movdqa        0x23bc(%rip),%xmm1        # 5340 <_sk_callback_sse41+0xb8d>
   DB  102,15,219,202                      ; pand          %xmm2,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,200,35,0,0                 ; mulps         0x23c8(%rip),%xmm1        # 5360 <_sk_callback_sse41+0xba7>
-  DB  102,15,219,21,208,35,0,0            ; pand          0x23d0(%rip),%xmm2        # 5370 <_sk_callback_sse41+0xbb7>
+  DB  15,89,13,190,35,0,0                 ; mulps         0x23be(%rip),%xmm1        # 5350 <_sk_callback_sse41+0xb9d>
+  DB  102,15,219,21,198,35,0,0            ; pand          0x23c6(%rip),%xmm2        # 5360 <_sk_callback_sse41+0xbad>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,214,35,0,0                 ; mulps         0x23d6(%rip),%xmm2        # 5380 <_sk_callback_sse41+0xbc7>
+  DB  15,89,21,204,35,0,0                 ; mulps         0x23cc(%rip),%xmm2        # 5370 <_sk_callback_sse41+0xbbd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,221,35,0,0                 ; movaps        0x23dd(%rip),%xmm3        # 5390 <_sk_callback_sse41+0xbd7>
+  DB  15,40,29,211,35,0,0                 ; movaps        0x23d3(%rip),%xmm3        # 5380 <_sk_callback_sse41+0xbcd>
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_store_565_sse41
 _sk_store_565_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,222,35,0,0               ; movaps        0x23de(%rip),%xmm8        # 53a0 <_sk_callback_sse41+0xbe7>
+  DB  68,15,40,5,212,35,0,0               ; movaps        0x23d4(%rip),%xmm8        # 5390 <_sk_callback_sse41+0xbdd>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
   DB  102,65,15,114,241,11                ; pslld         $0xb,%xmm9
-  DB  68,15,40,21,211,35,0,0              ; movaps        0x23d3(%rip),%xmm10        # 53b0 <_sk_callback_sse41+0xbf7>
+  DB  68,15,40,21,201,35,0,0              ; movaps        0x23c9(%rip),%xmm10        # 53a0 <_sk_callback_sse41+0xbed>
   DB  68,15,89,209                        ; mulps         %xmm1,%xmm10
   DB  102,69,15,91,210                    ; cvtps2dq      %xmm10,%xmm10
   DB  102,65,15,114,242,5                 ; pslld         $0x5,%xmm10
@@ -14447,21 +14447,21 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  102,15,56,51,28,120                 ; pmovzxwd      (%rax,%rdi,2),%xmm3
-  DB  102,15,111,5,158,35,0,0             ; movdqa        0x239e(%rip),%xmm0        # 53c0 <_sk_callback_sse41+0xc07>
+  DB  102,15,111,5,148,35,0,0             ; movdqa        0x2394(%rip),%xmm0        # 53b0 <_sk_callback_sse41+0xbfd>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,160,35,0,0                  ; mulps         0x23a0(%rip),%xmm0        # 53d0 <_sk_callback_sse41+0xc17>
-  DB  102,15,111,13,168,35,0,0            ; movdqa        0x23a8(%rip),%xmm1        # 53e0 <_sk_callback_sse41+0xc27>
+  DB  15,89,5,150,35,0,0                  ; mulps         0x2396(%rip),%xmm0        # 53c0 <_sk_callback_sse41+0xc0d>
+  DB  102,15,111,13,158,35,0,0            ; movdqa        0x239e(%rip),%xmm1        # 53d0 <_sk_callback_sse41+0xc1d>
   DB  102,15,219,203                      ; pand          %xmm3,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,170,35,0,0                 ; mulps         0x23aa(%rip),%xmm1        # 53f0 <_sk_callback_sse41+0xc37>
-  DB  102,15,111,21,178,35,0,0            ; movdqa        0x23b2(%rip),%xmm2        # 5400 <_sk_callback_sse41+0xc47>
+  DB  15,89,13,160,35,0,0                 ; mulps         0x23a0(%rip),%xmm1        # 53e0 <_sk_callback_sse41+0xc2d>
+  DB  102,15,111,21,168,35,0,0            ; movdqa        0x23a8(%rip),%xmm2        # 53f0 <_sk_callback_sse41+0xc3d>
   DB  102,15,219,211                      ; pand          %xmm3,%xmm2
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,180,35,0,0                 ; mulps         0x23b4(%rip),%xmm2        # 5410 <_sk_callback_sse41+0xc57>
-  DB  102,15,219,29,188,35,0,0            ; pand          0x23bc(%rip),%xmm3        # 5420 <_sk_callback_sse41+0xc67>
+  DB  15,89,21,170,35,0,0                 ; mulps         0x23aa(%rip),%xmm2        # 5400 <_sk_callback_sse41+0xc4d>
+  DB  102,15,219,29,178,35,0,0            ; pand          0x23b2(%rip),%xmm3        # 5410 <_sk_callback_sse41+0xc5d>
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,194,35,0,0                 ; mulps         0x23c2(%rip),%xmm3        # 5430 <_sk_callback_sse41+0xc77>
+  DB  15,89,29,184,35,0,0                 ; mulps         0x23b8(%rip),%xmm3        # 5420 <_sk_callback_sse41+0xc6d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
@@ -14488,21 +14488,21 @@
   DB  65,15,183,4,65                      ; movzwl        (%r9,%rax,2),%eax
   DB  102,15,196,192,3                    ; pinsrw        $0x3,%eax,%xmm0
   DB  102,15,56,51,216                    ; pmovzxwd      %xmm0,%xmm3
-  DB  102,15,111,5,101,35,0,0             ; movdqa        0x2365(%rip),%xmm0        # 5440 <_sk_callback_sse41+0xc87>
+  DB  102,15,111,5,91,35,0,0              ; movdqa        0x235b(%rip),%xmm0        # 5430 <_sk_callback_sse41+0xc7d>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,103,35,0,0                  ; mulps         0x2367(%rip),%xmm0        # 5450 <_sk_callback_sse41+0xc97>
-  DB  102,15,111,13,111,35,0,0            ; movdqa        0x236f(%rip),%xmm1        # 5460 <_sk_callback_sse41+0xca7>
+  DB  15,89,5,93,35,0,0                   ; mulps         0x235d(%rip),%xmm0        # 5440 <_sk_callback_sse41+0xc8d>
+  DB  102,15,111,13,101,35,0,0            ; movdqa        0x2365(%rip),%xmm1        # 5450 <_sk_callback_sse41+0xc9d>
   DB  102,15,219,203                      ; pand          %xmm3,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,113,35,0,0                 ; mulps         0x2371(%rip),%xmm1        # 5470 <_sk_callback_sse41+0xcb7>
-  DB  102,15,111,21,121,35,0,0            ; movdqa        0x2379(%rip),%xmm2        # 5480 <_sk_callback_sse41+0xcc7>
+  DB  15,89,13,103,35,0,0                 ; mulps         0x2367(%rip),%xmm1        # 5460 <_sk_callback_sse41+0xcad>
+  DB  102,15,111,21,111,35,0,0            ; movdqa        0x236f(%rip),%xmm2        # 5470 <_sk_callback_sse41+0xcbd>
   DB  102,15,219,211                      ; pand          %xmm3,%xmm2
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,123,35,0,0                 ; mulps         0x237b(%rip),%xmm2        # 5490 <_sk_callback_sse41+0xcd7>
-  DB  102,15,219,29,131,35,0,0            ; pand          0x2383(%rip),%xmm3        # 54a0 <_sk_callback_sse41+0xce7>
+  DB  15,89,21,113,35,0,0                 ; mulps         0x2371(%rip),%xmm2        # 5480 <_sk_callback_sse41+0xccd>
+  DB  102,15,219,29,121,35,0,0            ; pand          0x2379(%rip),%xmm3        # 5490 <_sk_callback_sse41+0xcdd>
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,137,35,0,0                 ; mulps         0x2389(%rip),%xmm3        # 54b0 <_sk_callback_sse41+0xcf7>
+  DB  15,89,29,127,35,0,0                 ; mulps         0x237f(%rip),%xmm3        # 54a0 <_sk_callback_sse41+0xced>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
@@ -14510,7 +14510,7 @@
 _sk_store_4444_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,136,35,0,0               ; movaps        0x2388(%rip),%xmm8        # 54c0 <_sk_callback_sse41+0xd07>
+  DB  68,15,40,5,126,35,0,0               ; movaps        0x237e(%rip),%xmm8        # 54b0 <_sk_callback_sse41+0xcfd>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -14538,17 +14538,17 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  15,16,28,184                        ; movups        (%rax,%rdi,4),%xmm3
-  DB  15,40,5,39,35,0,0                   ; movaps        0x2327(%rip),%xmm0        # 54d0 <_sk_callback_sse41+0xd17>
+  DB  15,40,5,29,35,0,0                   ; movaps        0x231d(%rip),%xmm0        # 54c0 <_sk_callback_sse41+0xd0d>
   DB  15,84,195                           ; andps         %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,41,35,0,0                ; movaps        0x2329(%rip),%xmm8        # 54e0 <_sk_callback_sse41+0xd27>
+  DB  68,15,40,5,31,35,0,0                ; movaps        0x231f(%rip),%xmm8        # 54d0 <_sk_callback_sse41+0xd1d>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,40,203                           ; movaps        %xmm3,%xmm1
-  DB  102,15,56,0,13,41,35,0,0            ; pshufb        0x2329(%rip),%xmm1        # 54f0 <_sk_callback_sse41+0xd37>
+  DB  102,15,56,0,13,31,35,0,0            ; pshufb        0x231f(%rip),%xmm1        # 54e0 <_sk_callback_sse41+0xd2d>
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  15,40,211                           ; movaps        %xmm3,%xmm2
-  DB  102,15,56,0,21,38,35,0,0            ; pshufb        0x2326(%rip),%xmm2        # 5500 <_sk_callback_sse41+0xd47>
+  DB  102,15,56,0,21,28,35,0,0            ; pshufb        0x231c(%rip),%xmm2        # 54f0 <_sk_callback_sse41+0xd3d>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  102,15,114,211,24                   ; psrld         $0x18,%xmm3
@@ -14577,17 +14577,17 @@
   DB  102,65,15,58,34,28,129,1            ; pinsrd        $0x1,(%r9,%rax,4),%xmm3
   DB  102,67,15,58,34,28,145,2            ; pinsrd        $0x2,(%r9,%r10,4),%xmm3
   DB  102,65,15,58,34,28,137,3            ; pinsrd        $0x3,(%r9,%rcx,4),%xmm3
-  DB  102,15,111,5,191,34,0,0             ; movdqa        0x22bf(%rip),%xmm0        # 5510 <_sk_callback_sse41+0xd57>
+  DB  102,15,111,5,181,34,0,0             ; movdqa        0x22b5(%rip),%xmm0        # 5500 <_sk_callback_sse41+0xd4d>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,192,34,0,0               ; movaps        0x22c0(%rip),%xmm8        # 5520 <_sk_callback_sse41+0xd67>
+  DB  68,15,40,5,182,34,0,0               ; movaps        0x22b6(%rip),%xmm8        # 5510 <_sk_callback_sse41+0xd5d>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
-  DB  102,15,56,0,13,191,34,0,0           ; pshufb        0x22bf(%rip),%xmm1        # 5530 <_sk_callback_sse41+0xd77>
+  DB  102,15,56,0,13,181,34,0,0           ; pshufb        0x22b5(%rip),%xmm1        # 5520 <_sk_callback_sse41+0xd6d>
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,111,211                      ; movdqa        %xmm3,%xmm2
-  DB  102,15,56,0,21,187,34,0,0           ; pshufb        0x22bb(%rip),%xmm2        # 5540 <_sk_callback_sse41+0xd87>
+  DB  102,15,56,0,21,177,34,0,0           ; pshufb        0x22b1(%rip),%xmm2        # 5530 <_sk_callback_sse41+0xd7d>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  102,15,114,211,24                   ; psrld         $0x18,%xmm3
@@ -14600,7 +14600,7 @@
 _sk_store_8888_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,167,34,0,0               ; movaps        0x22a7(%rip),%xmm8        # 5550 <_sk_callback_sse41+0xd97>
+  DB  68,15,40,5,157,34,0,0               ; movaps        0x229d(%rip),%xmm8        # 5540 <_sk_callback_sse41+0xd8d>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -14635,18 +14635,18 @@
   DB  102,68,15,97,216                    ; punpcklwd     %xmm0,%xmm11
   DB  102,68,15,105,200                   ; punpckhwd     %xmm0,%xmm9
   DB  102,65,15,56,51,203                 ; pmovzxwd      %xmm11,%xmm1
-  DB  102,68,15,111,5,32,34,0,0           ; movdqa        0x2220(%rip),%xmm8        # 5560 <_sk_callback_sse41+0xda7>
+  DB  102,68,15,111,5,22,34,0,0           ; movdqa        0x2216(%rip),%xmm8        # 5550 <_sk_callback_sse41+0xd9d>
   DB  102,15,111,209                      ; movdqa        %xmm1,%xmm2
   DB  102,65,15,219,208                   ; pand          %xmm8,%xmm2
   DB  102,15,239,202                      ; pxor          %xmm2,%xmm1
-  DB  102,15,111,29,27,34,0,0             ; movdqa        0x221b(%rip),%xmm3        # 5570 <_sk_callback_sse41+0xdb7>
+  DB  102,15,111,29,17,34,0,0             ; movdqa        0x2211(%rip),%xmm3        # 5560 <_sk_callback_sse41+0xdad>
   DB  102,15,114,242,16                   ; pslld         $0x10,%xmm2
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,15,56,63,195                    ; pmaxud        %xmm3,%xmm0
   DB  102,15,118,193                      ; pcmpeqd       %xmm1,%xmm0
   DB  102,15,114,241,13                   ; pslld         $0xd,%xmm1
   DB  102,15,235,202                      ; por           %xmm2,%xmm1
-  DB  102,68,15,111,21,7,34,0,0           ; movdqa        0x2207(%rip),%xmm10        # 5580 <_sk_callback_sse41+0xdc7>
+  DB  102,68,15,111,21,253,33,0,0         ; movdqa        0x21fd(%rip),%xmm10        # 5570 <_sk_callback_sse41+0xdbd>
   DB  102,65,15,254,202                   ; paddd         %xmm10,%xmm1
   DB  102,15,219,193                      ; pand          %xmm1,%xmm0
   DB  102,65,15,115,219,8                 ; psrldq        $0x8,%xmm11
@@ -14717,18 +14717,18 @@
   DB  102,68,15,97,218                    ; punpcklwd     %xmm2,%xmm11
   DB  102,68,15,105,202                   ; punpckhwd     %xmm2,%xmm9
   DB  102,65,15,56,51,203                 ; pmovzxwd      %xmm11,%xmm1
-  DB  102,68,15,111,5,197,32,0,0          ; movdqa        0x20c5(%rip),%xmm8        # 5590 <_sk_callback_sse41+0xdd7>
+  DB  102,68,15,111,5,187,32,0,0          ; movdqa        0x20bb(%rip),%xmm8        # 5580 <_sk_callback_sse41+0xdcd>
   DB  102,15,111,209                      ; movdqa        %xmm1,%xmm2
   DB  102,65,15,219,208                   ; pand          %xmm8,%xmm2
   DB  102,15,239,202                      ; pxor          %xmm2,%xmm1
-  DB  102,15,111,29,192,32,0,0            ; movdqa        0x20c0(%rip),%xmm3        # 55a0 <_sk_callback_sse41+0xde7>
+  DB  102,15,111,29,182,32,0,0            ; movdqa        0x20b6(%rip),%xmm3        # 5590 <_sk_callback_sse41+0xddd>
   DB  102,15,114,242,16                   ; pslld         $0x10,%xmm2
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,15,56,63,195                    ; pmaxud        %xmm3,%xmm0
   DB  102,15,118,193                      ; pcmpeqd       %xmm1,%xmm0
   DB  102,15,114,241,13                   ; pslld         $0xd,%xmm1
   DB  102,15,235,202                      ; por           %xmm2,%xmm1
-  DB  102,68,15,111,21,172,32,0,0         ; movdqa        0x20ac(%rip),%xmm10        # 55b0 <_sk_callback_sse41+0xdf7>
+  DB  102,68,15,111,21,162,32,0,0         ; movdqa        0x20a2(%rip),%xmm10        # 55a0 <_sk_callback_sse41+0xded>
   DB  102,65,15,254,202                   ; paddd         %xmm10,%xmm1
   DB  102,15,219,193                      ; pand          %xmm1,%xmm0
   DB  102,65,15,115,219,8                 ; psrldq        $0x8,%xmm11
@@ -14774,17 +14774,17 @@
 _sk_store_f16_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  102,68,15,111,21,226,31,0,0         ; movdqa        0x1fe2(%rip),%xmm10        # 55c0 <_sk_callback_sse41+0xe07>
+  DB  102,68,15,111,21,216,31,0,0         ; movdqa        0x1fd8(%rip),%xmm10        # 55b0 <_sk_callback_sse41+0xdfd>
   DB  102,68,15,111,224                   ; movdqa        %xmm0,%xmm12
   DB  102,68,15,111,232                   ; movdqa        %xmm0,%xmm13
   DB  102,69,15,219,234                   ; pand          %xmm10,%xmm13
   DB  102,69,15,239,229                   ; pxor          %xmm13,%xmm12
-  DB  102,68,15,111,13,213,31,0,0         ; movdqa        0x1fd5(%rip),%xmm9        # 55d0 <_sk_callback_sse41+0xe17>
+  DB  102,68,15,111,13,203,31,0,0         ; movdqa        0x1fcb(%rip),%xmm9        # 55c0 <_sk_callback_sse41+0xe0d>
   DB  102,65,15,114,213,16                ; psrld         $0x10,%xmm13
   DB  102,69,15,111,193                   ; movdqa        %xmm9,%xmm8
   DB  102,69,15,102,196                   ; pcmpgtd       %xmm12,%xmm8
   DB  102,65,15,114,212,13                ; psrld         $0xd,%xmm12
-  DB  102,68,15,111,29,198,31,0,0         ; movdqa        0x1fc6(%rip),%xmm11        # 55e0 <_sk_callback_sse41+0xe27>
+  DB  102,68,15,111,29,188,31,0,0         ; movdqa        0x1fbc(%rip),%xmm11        # 55d0 <_sk_callback_sse41+0xe1d>
   DB  102,69,15,235,235                   ; por           %xmm11,%xmm13
   DB  102,69,15,254,236                   ; paddd         %xmm12,%xmm13
   DB  102,69,15,223,197                   ; pandn         %xmm13,%xmm8
@@ -14852,7 +14852,7 @@
   DB  102,15,235,200                      ; por           %xmm0,%xmm1
   DB  102,15,56,51,193                    ; pmovzxwd      %xmm1,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,149,30,0,0               ; movaps        0x1e95(%rip),%xmm8        # 55f0 <_sk_callback_sse41+0xe37>
+  DB  68,15,40,5,139,30,0,0               ; movaps        0x1e8b(%rip),%xmm8        # 55e0 <_sk_callback_sse41+0xe2d>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
@@ -14902,7 +14902,7 @@
   DB  102,15,235,193                      ; por           %xmm1,%xmm0
   DB  102,15,56,51,192                    ; pmovzxwd      %xmm0,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,214,29,0,0               ; movaps        0x1dd6(%rip),%xmm8        # 5600 <_sk_callback_sse41+0xe47>
+  DB  68,15,40,5,204,29,0,0               ; movaps        0x1dcc(%rip),%xmm8        # 55f0 <_sk_callback_sse41+0xe3d>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
@@ -14919,14 +14919,14 @@
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,157,29,0,0                 ; movaps        0x1d9d(%rip),%xmm3        # 5610 <_sk_callback_sse41+0xe57>
+  DB  15,40,29,147,29,0,0                 ; movaps        0x1d93(%rip),%xmm3        # 5600 <_sk_callback_sse41+0xe4d>
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_store_u16_be_sse41
 _sk_store_u16_be_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,13,158,29,0,0              ; movaps        0x1d9e(%rip),%xmm9        # 5620 <_sk_callback_sse41+0xe67>
+  DB  68,15,40,13,148,29,0,0              ; movaps        0x1d94(%rip),%xmm9        # 5610 <_sk_callback_sse41+0xe5d>
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
@@ -15119,10 +15119,10 @@
 PUBLIC _sk_luminance_to_alpha_sse41
 _sk_luminance_to_alpha_sse41 LABEL PROC
   DB  15,40,218                           ; movaps        %xmm2,%xmm3
-  DB  15,89,5,250,26,0,0                  ; mulps         0x1afa(%rip),%xmm0        # 5630 <_sk_callback_sse41+0xe77>
-  DB  15,89,13,3,27,0,0                   ; mulps         0x1b03(%rip),%xmm1        # 5640 <_sk_callback_sse41+0xe87>
+  DB  15,89,5,240,26,0,0                  ; mulps         0x1af0(%rip),%xmm0        # 5620 <_sk_callback_sse41+0xe6d>
+  DB  15,89,13,249,26,0,0                 ; mulps         0x1af9(%rip),%xmm1        # 5630 <_sk_callback_sse41+0xe7d>
   DB  15,88,200                           ; addps         %xmm0,%xmm1
-  DB  15,89,29,9,27,0,0                   ; mulps         0x1b09(%rip),%xmm3        # 5650 <_sk_callback_sse41+0xe97>
+  DB  15,89,29,255,26,0,0                 ; mulps         0x1aff(%rip),%xmm3        # 5640 <_sk_callback_sse41+0xe8d>
   DB  15,88,217                           ; addps         %xmm1,%xmm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
@@ -15386,9 +15386,9 @@
   DB  72,139,8                            ; mov           (%rax),%rcx
   DB  76,139,88,8                         ; mov           0x8(%rax),%r11
   DB  72,255,201                          ; dec           %rcx
-  DB  120,7                               ; js            3f80 <_sk_evenly_spaced_gradient_sse41+0x15>
+  DB  120,7                               ; js            3f7a <_sk_evenly_spaced_gradient_sse41+0x15>
   DB  243,72,15,42,201                    ; cvtsi2ss      %rcx,%xmm1
-  DB  235,21                              ; jmp           3f95 <_sk_evenly_spaced_gradient_sse41+0x2a>
+  DB  235,21                              ; jmp           3f8f <_sk_evenly_spaced_gradient_sse41+0x2a>
   DB  73,137,200                          ; mov           %rcx,%r8
   DB  73,209,232                          ; shr           %r8
   DB  131,225,1                           ; and           $0x1,%ecx
@@ -15477,12 +15477,12 @@
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,2                        ; cmp           $0x2,%r8
-  DB  114,50                              ; jb            4178 <_sk_gradient_sse41+0x41>
+  DB  114,50                              ; jb            4172 <_sk_gradient_sse41+0x41>
   DB  72,139,72,72                        ; mov           0x48(%rax),%rcx
   DB  73,255,200                          ; dec           %r8
   DB  72,131,193,4                        ; add           $0x4,%rcx
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  15,40,21,4,21,0,0                   ; movaps        0x1504(%rip),%xmm2        # 5660 <_sk_callback_sse41+0xea7>
+  DB  15,40,21,250,20,0,0                 ; movaps        0x14fa(%rip),%xmm2        # 5650 <_sk_callback_sse41+0xe9d>
   DB  243,15,16,25                        ; movss         (%rcx),%xmm3
   DB  15,198,219,0                        ; shufps        $0x0,%xmm3,%xmm3
   DB  15,194,216,2                        ; cmpleps       %xmm0,%xmm3
@@ -15490,7 +15490,7 @@
   DB  102,15,254,203                      ; paddd         %xmm3,%xmm1
   DB  72,131,193,4                        ; add           $0x4,%rcx
   DB  73,255,200                          ; dec           %r8
-  DB  117,228                             ; jne           415c <_sk_gradient_sse41+0x25>
+  DB  117,228                             ; jne           4156 <_sk_gradient_sse41+0x25>
   DB  65,86                               ; push          %r14
   DB  83                                  ; push          %rbx
   DB  102,73,15,58,22,201,1               ; pextrq        $0x1,%xmm1,%r9
@@ -15617,26 +15617,26 @@
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,40,236                        ; movaps        %xmm12,%xmm13
   DB  69,15,89,237                        ; mulps         %xmm13,%xmm13
-  DB  68,15,40,21,166,18,0,0              ; movaps        0x12a6(%rip),%xmm10        # 5670 <_sk_callback_sse41+0xeb7>
+  DB  68,15,40,21,156,18,0,0              ; movaps        0x129c(%rip),%xmm10        # 5660 <_sk_callback_sse41+0xead>
   DB  69,15,89,213                        ; mulps         %xmm13,%xmm10
-  DB  68,15,88,21,170,18,0,0              ; addps         0x12aa(%rip),%xmm10        # 5680 <_sk_callback_sse41+0xec7>
+  DB  68,15,88,21,160,18,0,0              ; addps         0x12a0(%rip),%xmm10        # 5670 <_sk_callback_sse41+0xebd>
   DB  69,15,89,213                        ; mulps         %xmm13,%xmm10
-  DB  68,15,88,21,174,18,0,0              ; addps         0x12ae(%rip),%xmm10        # 5690 <_sk_callback_sse41+0xed7>
+  DB  68,15,88,21,164,18,0,0              ; addps         0x12a4(%rip),%xmm10        # 5680 <_sk_callback_sse41+0xecd>
   DB  69,15,89,213                        ; mulps         %xmm13,%xmm10
-  DB  68,15,88,21,178,18,0,0              ; addps         0x12b2(%rip),%xmm10        # 56a0 <_sk_callback_sse41+0xee7>
+  DB  68,15,88,21,168,18,0,0              ; addps         0x12a8(%rip),%xmm10        # 5690 <_sk_callback_sse41+0xedd>
   DB  69,15,89,212                        ; mulps         %xmm12,%xmm10
   DB  65,15,194,195,1                     ; cmpltps       %xmm11,%xmm0
-  DB  68,15,40,29,177,18,0,0              ; movaps        0x12b1(%rip),%xmm11        # 56b0 <_sk_callback_sse41+0xef7>
+  DB  68,15,40,29,167,18,0,0              ; movaps        0x12a7(%rip),%xmm11        # 56a0 <_sk_callback_sse41+0xeed>
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
   DB  102,69,15,56,20,211                 ; blendvps      %xmm0,%xmm11,%xmm10
   DB  69,15,194,200,1                     ; cmpltps       %xmm8,%xmm9
-  DB  68,15,40,29,170,18,0,0              ; movaps        0x12aa(%rip),%xmm11        # 56c0 <_sk_callback_sse41+0xf07>
+  DB  68,15,40,29,160,18,0,0              ; movaps        0x12a0(%rip),%xmm11        # 56b0 <_sk_callback_sse41+0xefd>
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  102,69,15,56,20,211                 ; blendvps      %xmm0,%xmm11,%xmm10
   DB  15,40,193                           ; movaps        %xmm1,%xmm0
   DB  65,15,194,192,1                     ; cmpltps       %xmm8,%xmm0
-  DB  68,15,40,13,156,18,0,0              ; movaps        0x129c(%rip),%xmm9        # 56d0 <_sk_callback_sse41+0xf17>
+  DB  68,15,40,13,146,18,0,0              ; movaps        0x1292(%rip),%xmm9        # 56c0 <_sk_callback_sse41+0xf0d>
   DB  69,15,92,202                        ; subps         %xmm10,%xmm9
   DB  102,69,15,56,20,209                 ; blendvps      %xmm0,%xmm9,%xmm10
   DB  69,15,194,194,7                     ; cmpordps      %xmm10,%xmm8
@@ -15658,7 +15658,7 @@
 PUBLIC _sk_save_xy_sse41
 _sk_save_xy_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,112,18,0,0               ; movaps        0x1270(%rip),%xmm8        # 56e0 <_sk_callback_sse41+0xf27>
+  DB  68,15,40,5,102,18,0,0               ; movaps        0x1266(%rip),%xmm8        # 56d0 <_sk_callback_sse41+0xf1d>
   DB  15,17,0                             ; movups        %xmm0,(%rax)
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,88,200                        ; addps         %xmm8,%xmm9
@@ -15698,8 +15698,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,242,17,0,0                  ; addps         0x11f2(%rip),%xmm0        # 56f0 <_sk_callback_sse41+0xf37>
-  DB  68,15,40,13,250,17,0,0              ; movaps        0x11fa(%rip),%xmm9        # 5700 <_sk_callback_sse41+0xf47>
+  DB  15,88,5,232,17,0,0                  ; addps         0x11e8(%rip),%xmm0        # 56e0 <_sk_callback_sse41+0xf2d>
+  DB  68,15,40,13,240,17,0,0              ; movaps        0x11f0(%rip),%xmm9        # 56f0 <_sk_callback_sse41+0xf3d>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  68,15,17,136,128,0,0,0              ; movups        %xmm9,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -15710,7 +15710,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,233,17,0,0                  ; addps         0x11e9(%rip),%xmm0        # 5710 <_sk_callback_sse41+0xf57>
+  DB  15,88,5,223,17,0,0                  ; addps         0x11df(%rip),%xmm0        # 5700 <_sk_callback_sse41+0xf4d>
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -15720,8 +15720,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,219,17,0,0                 ; addps         0x11db(%rip),%xmm1        # 5720 <_sk_callback_sse41+0xf67>
-  DB  68,15,40,13,227,17,0,0              ; movaps        0x11e3(%rip),%xmm9        # 5730 <_sk_callback_sse41+0xf77>
+  DB  15,88,13,209,17,0,0                 ; addps         0x11d1(%rip),%xmm1        # 5710 <_sk_callback_sse41+0xf5d>
+  DB  68,15,40,13,217,17,0,0              ; movaps        0x11d9(%rip),%xmm9        # 5720 <_sk_callback_sse41+0xf6d>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  68,15,17,136,160,0,0,0              ; movups        %xmm9,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -15732,7 +15732,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,209,17,0,0                 ; addps         0x11d1(%rip),%xmm1        # 5740 <_sk_callback_sse41+0xf87>
+  DB  15,88,13,199,17,0,0                 ; addps         0x11c7(%rip),%xmm1        # 5730 <_sk_callback_sse41+0xf7d>
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -15742,13 +15742,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,196,17,0,0                  ; addps         0x11c4(%rip),%xmm0        # 5750 <_sk_callback_sse41+0xf97>
-  DB  68,15,40,13,204,17,0,0              ; movaps        0x11cc(%rip),%xmm9        # 5760 <_sk_callback_sse41+0xfa7>
+  DB  15,88,5,186,17,0,0                  ; addps         0x11ba(%rip),%xmm0        # 5740 <_sk_callback_sse41+0xf8d>
+  DB  68,15,40,13,194,17,0,0              ; movaps        0x11c2(%rip),%xmm9        # 5750 <_sk_callback_sse41+0xf9d>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  69,15,89,192                        ; mulps         %xmm8,%xmm8
-  DB  68,15,89,13,200,17,0,0              ; mulps         0x11c8(%rip),%xmm9        # 5770 <_sk_callback_sse41+0xfb7>
-  DB  68,15,88,13,208,17,0,0              ; addps         0x11d0(%rip),%xmm9        # 5780 <_sk_callback_sse41+0xfc7>
+  DB  68,15,89,13,190,17,0,0              ; mulps         0x11be(%rip),%xmm9        # 5760 <_sk_callback_sse41+0xfad>
+  DB  68,15,88,13,198,17,0,0              ; addps         0x11c6(%rip),%xmm9        # 5770 <_sk_callback_sse41+0xfbd>
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  68,15,17,136,128,0,0,0              ; movups        %xmm9,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -15759,16 +15759,16 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,191,17,0,0                  ; addps         0x11bf(%rip),%xmm0        # 5790 <_sk_callback_sse41+0xfd7>
-  DB  68,15,40,13,199,17,0,0              ; movaps        0x11c7(%rip),%xmm9        # 57a0 <_sk_callback_sse41+0xfe7>
+  DB  15,88,5,181,17,0,0                  ; addps         0x11b5(%rip),%xmm0        # 5780 <_sk_callback_sse41+0xfcd>
+  DB  68,15,40,13,189,17,0,0              ; movaps        0x11bd(%rip),%xmm9        # 5790 <_sk_callback_sse41+0xfdd>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
-  DB  68,15,40,5,203,17,0,0               ; movaps        0x11cb(%rip),%xmm8        # 57b0 <_sk_callback_sse41+0xff7>
+  DB  68,15,40,5,193,17,0,0               ; movaps        0x11c1(%rip),%xmm8        # 57a0 <_sk_callback_sse41+0xfed>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,207,17,0,0               ; addps         0x11cf(%rip),%xmm8        # 57c0 <_sk_callback_sse41+0x1007>
+  DB  68,15,88,5,197,17,0,0               ; addps         0x11c5(%rip),%xmm8        # 57b0 <_sk_callback_sse41+0xffd>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,211,17,0,0               ; addps         0x11d3(%rip),%xmm8        # 57d0 <_sk_callback_sse41+0x1017>
+  DB  68,15,88,5,201,17,0,0               ; addps         0x11c9(%rip),%xmm8        # 57c0 <_sk_callback_sse41+0x100d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,215,17,0,0               ; addps         0x11d7(%rip),%xmm8        # 57e0 <_sk_callback_sse41+0x1027>
+  DB  68,15,88,5,205,17,0,0               ; addps         0x11cd(%rip),%xmm8        # 57d0 <_sk_callback_sse41+0x101d>
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -15776,17 +15776,17 @@
 PUBLIC _sk_bicubic_p1x_sse41
 _sk_bicubic_p1x_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,209,17,0,0               ; movaps        0x11d1(%rip),%xmm8        # 57f0 <_sk_callback_sse41+0x1037>
+  DB  68,15,40,5,199,17,0,0               ; movaps        0x11c7(%rip),%xmm8        # 57e0 <_sk_callback_sse41+0x102d>
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,72,64                      ; movups        0x40(%rax),%xmm9
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
-  DB  68,15,40,21,205,17,0,0              ; movaps        0x11cd(%rip),%xmm10        # 5800 <_sk_callback_sse41+0x1047>
+  DB  68,15,40,21,195,17,0,0              ; movaps        0x11c3(%rip),%xmm10        # 57f0 <_sk_callback_sse41+0x103d>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,209,17,0,0              ; addps         0x11d1(%rip),%xmm10        # 5810 <_sk_callback_sse41+0x1057>
+  DB  68,15,88,21,199,17,0,0              ; addps         0x11c7(%rip),%xmm10        # 5800 <_sk_callback_sse41+0x104d>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,205,17,0,0              ; addps         0x11cd(%rip),%xmm10        # 5820 <_sk_callback_sse41+0x1067>
+  DB  68,15,88,21,195,17,0,0              ; addps         0x11c3(%rip),%xmm10        # 5810 <_sk_callback_sse41+0x105d>
   DB  68,15,17,144,128,0,0,0              ; movups        %xmm10,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -15796,11 +15796,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,192,17,0,0                  ; addps         0x11c0(%rip),%xmm0        # 5830 <_sk_callback_sse41+0x1077>
+  DB  15,88,5,182,17,0,0                  ; addps         0x11b6(%rip),%xmm0        # 5820 <_sk_callback_sse41+0x106d>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  69,15,89,201                        ; mulps         %xmm9,%xmm9
-  DB  68,15,89,5,192,17,0,0               ; mulps         0x11c0(%rip),%xmm8        # 5840 <_sk_callback_sse41+0x1087>
-  DB  68,15,88,5,200,17,0,0               ; addps         0x11c8(%rip),%xmm8        # 5850 <_sk_callback_sse41+0x1097>
+  DB  68,15,89,5,182,17,0,0               ; mulps         0x11b6(%rip),%xmm8        # 5830 <_sk_callback_sse41+0x107d>
+  DB  68,15,88,5,190,17,0,0               ; addps         0x11be(%rip),%xmm8        # 5840 <_sk_callback_sse41+0x108d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -15811,13 +15811,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,182,17,0,0                 ; addps         0x11b6(%rip),%xmm1        # 5860 <_sk_callback_sse41+0x10a7>
-  DB  68,15,40,13,190,17,0,0              ; movaps        0x11be(%rip),%xmm9        # 5870 <_sk_callback_sse41+0x10b7>
+  DB  15,88,13,172,17,0,0                 ; addps         0x11ac(%rip),%xmm1        # 5850 <_sk_callback_sse41+0x109d>
+  DB  68,15,40,13,180,17,0,0              ; movaps        0x11b4(%rip),%xmm9        # 5860 <_sk_callback_sse41+0x10ad>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  69,15,89,192                        ; mulps         %xmm8,%xmm8
-  DB  68,15,89,13,186,17,0,0              ; mulps         0x11ba(%rip),%xmm9        # 5880 <_sk_callback_sse41+0x10c7>
-  DB  68,15,88,13,194,17,0,0              ; addps         0x11c2(%rip),%xmm9        # 5890 <_sk_callback_sse41+0x10d7>
+  DB  68,15,89,13,176,17,0,0              ; mulps         0x11b0(%rip),%xmm9        # 5870 <_sk_callback_sse41+0x10bd>
+  DB  68,15,88,13,184,17,0,0              ; addps         0x11b8(%rip),%xmm9        # 5880 <_sk_callback_sse41+0x10cd>
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  68,15,17,136,160,0,0,0              ; movups        %xmm9,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -15828,16 +15828,16 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,176,17,0,0                 ; addps         0x11b0(%rip),%xmm1        # 58a0 <_sk_callback_sse41+0x10e7>
-  DB  68,15,40,13,184,17,0,0              ; movaps        0x11b8(%rip),%xmm9        # 58b0 <_sk_callback_sse41+0x10f7>
+  DB  15,88,13,166,17,0,0                 ; addps         0x11a6(%rip),%xmm1        # 5890 <_sk_callback_sse41+0x10dd>
+  DB  68,15,40,13,174,17,0,0              ; movaps        0x11ae(%rip),%xmm9        # 58a0 <_sk_callback_sse41+0x10ed>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
-  DB  68,15,40,5,188,17,0,0               ; movaps        0x11bc(%rip),%xmm8        # 58c0 <_sk_callback_sse41+0x1107>
+  DB  68,15,40,5,178,17,0,0               ; movaps        0x11b2(%rip),%xmm8        # 58b0 <_sk_callback_sse41+0x10fd>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,192,17,0,0               ; addps         0x11c0(%rip),%xmm8        # 58d0 <_sk_callback_sse41+0x1117>
+  DB  68,15,88,5,182,17,0,0               ; addps         0x11b6(%rip),%xmm8        # 58c0 <_sk_callback_sse41+0x110d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,196,17,0,0               ; addps         0x11c4(%rip),%xmm8        # 58e0 <_sk_callback_sse41+0x1127>
+  DB  68,15,88,5,186,17,0,0               ; addps         0x11ba(%rip),%xmm8        # 58d0 <_sk_callback_sse41+0x111d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,200,17,0,0               ; addps         0x11c8(%rip),%xmm8        # 58f0 <_sk_callback_sse41+0x1137>
+  DB  68,15,88,5,190,17,0,0               ; addps         0x11be(%rip),%xmm8        # 58e0 <_sk_callback_sse41+0x112d>
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -15845,17 +15845,17 @@
 PUBLIC _sk_bicubic_p1y_sse41
 _sk_bicubic_p1y_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,194,17,0,0               ; movaps        0x11c2(%rip),%xmm8        # 5900 <_sk_callback_sse41+0x1147>
+  DB  68,15,40,5,184,17,0,0               ; movaps        0x11b8(%rip),%xmm8        # 58f0 <_sk_callback_sse41+0x113d>
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,72,96                      ; movups        0x60(%rax),%xmm9
   DB  65,15,88,200                        ; addps         %xmm8,%xmm1
-  DB  68,15,40,21,189,17,0,0              ; movaps        0x11bd(%rip),%xmm10        # 5910 <_sk_callback_sse41+0x1157>
+  DB  68,15,40,21,179,17,0,0              ; movaps        0x11b3(%rip),%xmm10        # 5900 <_sk_callback_sse41+0x114d>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,193,17,0,0              ; addps         0x11c1(%rip),%xmm10        # 5920 <_sk_callback_sse41+0x1167>
+  DB  68,15,88,21,183,17,0,0              ; addps         0x11b7(%rip),%xmm10        # 5910 <_sk_callback_sse41+0x115d>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,189,17,0,0              ; addps         0x11bd(%rip),%xmm10        # 5930 <_sk_callback_sse41+0x1177>
+  DB  68,15,88,21,179,17,0,0              ; addps         0x11b3(%rip),%xmm10        # 5920 <_sk_callback_sse41+0x116d>
   DB  68,15,17,144,160,0,0,0              ; movups        %xmm10,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -15865,11 +15865,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,175,17,0,0                 ; addps         0x11af(%rip),%xmm1        # 5940 <_sk_callback_sse41+0x1187>
+  DB  15,88,13,165,17,0,0                 ; addps         0x11a5(%rip),%xmm1        # 5930 <_sk_callback_sse41+0x117d>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  69,15,89,201                        ; mulps         %xmm9,%xmm9
-  DB  68,15,89,5,175,17,0,0               ; mulps         0x11af(%rip),%xmm8        # 5950 <_sk_callback_sse41+0x1197>
-  DB  68,15,88,5,183,17,0,0               ; addps         0x11b7(%rip),%xmm8        # 5960 <_sk_callback_sse41+0x11a7>
+  DB  68,15,89,5,165,17,0,0               ; mulps         0x11a5(%rip),%xmm8        # 5940 <_sk_callback_sse41+0x118d>
+  DB  68,15,88,5,173,17,0,0               ; addps         0x11ad(%rip),%xmm8        # 5950 <_sk_callback_sse41+0x119d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -16074,11 +16074,11 @@
   DB  128,191,0,0,128,191,0               ; cmpb          $0x0,-0x40800000(%rdi)
   DB  0,224                               ; add           %ah,%al
   DB  64,0,0                              ; add           %al,(%rax)
-  DB  224,64                              ; loopne        4a48 <.literal16+0x1d8>
+  DB  224,64                              ; loopne        4a38 <.literal16+0x1d8>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,64                              ; loopne        4a4c <.literal16+0x1dc>
+  DB  224,64                              ; loopne        4a3c <.literal16+0x1dc>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,64                              ; loopne        4a50 <.literal16+0x1e0>
+  DB  224,64                              ; loopne        4a40 <.literal16+0x1e0>
   DB  154                                 ; (bad)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
@@ -16098,13 +16098,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4a71 <.literal16+0x201>
+  DB  71,225,61                           ; rex.RXB       loope 4a61 <.literal16+0x201>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4a75 <.literal16+0x205>
+  DB  71,225,61                           ; rex.RXB       loope 4a65 <.literal16+0x205>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4a79 <.literal16+0x209>
+  DB  71,225,61                           ; rex.RXB       loope 4a69 <.literal16+0x209>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4a7d <.literal16+0x20d>
+  DB  71,225,61                           ; rex.RXB       loope 4a6d <.literal16+0x20d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -16129,13 +16129,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4ab1 <.literal16+0x241>
+  DB  71,225,61                           ; rex.RXB       loope 4aa1 <.literal16+0x241>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4ab5 <.literal16+0x245>
+  DB  71,225,61                           ; rex.RXB       loope 4aa5 <.literal16+0x245>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4ab9 <.literal16+0x249>
+  DB  71,225,61                           ; rex.RXB       loope 4aa9 <.literal16+0x249>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4abd <.literal16+0x24d>
+  DB  71,225,61                           ; rex.RXB       loope 4aad <.literal16+0x24d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -16160,13 +16160,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4af1 <.literal16+0x281>
+  DB  71,225,61                           ; rex.RXB       loope 4ae1 <.literal16+0x281>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4af5 <.literal16+0x285>
+  DB  71,225,61                           ; rex.RXB       loope 4ae5 <.literal16+0x285>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4af9 <.literal16+0x289>
+  DB  71,225,61                           ; rex.RXB       loope 4ae9 <.literal16+0x289>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4afd <.literal16+0x28d>
+  DB  71,225,61                           ; rex.RXB       loope 4aed <.literal16+0x28d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -16191,13 +16191,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4b31 <.literal16+0x2c1>
+  DB  71,225,61                           ; rex.RXB       loope 4b21 <.literal16+0x2c1>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4b35 <.literal16+0x2c5>
+  DB  71,225,61                           ; rex.RXB       loope 4b25 <.literal16+0x2c5>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4b39 <.literal16+0x2c9>
+  DB  71,225,61                           ; rex.RXB       loope 4b29 <.literal16+0x2c9>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 4b3d <.literal16+0x2cd>
+  DB  71,225,61                           ; rex.RXB       loope 4b2d <.literal16+0x2cd>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -16413,13 +16413,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        4d09 <.literal16+0x499>
+  DB  224,7                               ; loopne        4cf9 <.literal16+0x499>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        4d0d <.literal16+0x49d>
+  DB  224,7                               ; loopne        4cfd <.literal16+0x49d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        4d11 <.literal16+0x4a1>
+  DB  224,7                               ; loopne        4d01 <.literal16+0x4a1>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        4d15 <.literal16+0x4a5>
+  DB  224,7                               ; loopne        4d05 <.literal16+0x4a5>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -16453,10 +16453,10 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a004d58 <_sk_callback_sse41+0xa00059f>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a004d48 <_sk_callback_sse41+0xa000595>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3004d60 <_sk_callback_sse41+0x30005a7>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3004d50 <_sk_callback_sse41+0x300059d>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -16511,11 +16511,11 @@
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            4e2b <.literal16+0x5bb>
+  DB  127,67                              ; jg            4e1b <.literal16+0x5bb>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            4e2f <.literal16+0x5bf>
+  DB  127,67                              ; jg            4e1f <.literal16+0x5bf>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            4e33 <.literal16+0x5c3>
+  DB  127,67                              ; jg            4e23 <.literal16+0x5c3>
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,129                          ; cmpb          $0x81,(%rbx)
   DB  128,128,59,129,128,128,59           ; addb          $0x3b,-0x7f7f7ec5(%rax)
@@ -16530,16 +16530,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4e24 <.literal16+0x5b4>
+  DB  127,0                               ; jg            4e14 <.literal16+0x5b4>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4e28 <.literal16+0x5b8>
+  DB  127,0                               ; jg            4e18 <.literal16+0x5b8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4e2c <.literal16+0x5bc>
+  DB  127,0                               ; jg            4e1c <.literal16+0x5bc>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4e30 <.literal16+0x5c0>
+  DB  127,0                               ; jg            4e20 <.literal16+0x5c0>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -16548,7 +16548,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            4eb5 <.literal16+0x645>
+  DB  119,115                             ; ja            4ea5 <.literal16+0x645>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -16559,7 +16559,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           4e19 <.literal16+0x5a9>
+  DB  117,191                             ; jne           4e09 <.literal16+0x5a9>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -16571,7 +16571,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a38e5a <_sk_callback_sse41+0xffffffffe9a346a1>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a38e4a <_sk_callback_sse41+0xffffffffe9a34697>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  81                                  ; push          %rcx
   DB  140,242                             ; mov           %?,%edx
@@ -16626,16 +16626,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4ef4 <.literal16+0x684>
+  DB  127,0                               ; jg            4ee4 <.literal16+0x684>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4ef8 <.literal16+0x688>
+  DB  127,0                               ; jg            4ee8 <.literal16+0x688>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4efc <.literal16+0x68c>
+  DB  127,0                               ; jg            4eec <.literal16+0x68c>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4f00 <.literal16+0x690>
+  DB  127,0                               ; jg            4ef0 <.literal16+0x690>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -16644,7 +16644,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            4f85 <.literal16+0x715>
+  DB  119,115                             ; ja            4f75 <.literal16+0x715>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -16655,7 +16655,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           4ee9 <.literal16+0x679>
+  DB  117,191                             ; jne           4ed9 <.literal16+0x679>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -16667,7 +16667,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a38f2a <_sk_callback_sse41+0xffffffffe9a34771>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a38f1a <_sk_callback_sse41+0xffffffffe9a34767>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  81                                  ; push          %rcx
   DB  140,242                             ; mov           %?,%edx
@@ -16722,16 +16722,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4fc4 <.literal16+0x754>
+  DB  127,0                               ; jg            4fb4 <.literal16+0x754>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4fc8 <.literal16+0x758>
+  DB  127,0                               ; jg            4fb8 <.literal16+0x758>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4fcc <.literal16+0x75c>
+  DB  127,0                               ; jg            4fbc <.literal16+0x75c>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            4fd0 <.literal16+0x760>
+  DB  127,0                               ; jg            4fc0 <.literal16+0x760>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -16740,7 +16740,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            5055 <.literal16+0x7e5>
+  DB  119,115                             ; ja            5045 <.literal16+0x7e5>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -16751,7 +16751,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           4fb9 <.literal16+0x749>
+  DB  117,191                             ; jne           4fa9 <.literal16+0x749>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -16763,7 +16763,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a38ffa <_sk_callback_sse41+0xffffffffe9a34841>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a38fea <_sk_callback_sse41+0xffffffffe9a34837>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  81                                  ; push          %rcx
   DB  140,242                             ; mov           %?,%edx
@@ -16818,16 +16818,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5094 <.literal16+0x824>
+  DB  127,0                               ; jg            5084 <.literal16+0x824>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5098 <.literal16+0x828>
+  DB  127,0                               ; jg            5088 <.literal16+0x828>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            509c <.literal16+0x82c>
+  DB  127,0                               ; jg            508c <.literal16+0x82c>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            50a0 <.literal16+0x830>
+  DB  127,0                               ; jg            5090 <.literal16+0x830>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -16836,7 +16836,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            5125 <.literal16+0x8b5>
+  DB  119,115                             ; ja            5115 <.literal16+0x8b5>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -16847,7 +16847,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           5089 <.literal16+0x819>
+  DB  117,191                             ; jne           5079 <.literal16+0x819>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -16859,7 +16859,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a390ca <_sk_callback_sse41+0xffffffffe9a34911>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a390ba <_sk_callback_sse41+0xffffffffe9a34907>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  81                                  ; push          %rcx
   DB  140,242                             ; mov           %?,%edx
@@ -16910,13 +16910,13 @@
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
-  DB  127,67                              ; jg            51a7 <.literal16+0x937>
+  DB  127,67                              ; jg            5197 <.literal16+0x937>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            51ab <.literal16+0x93b>
+  DB  127,67                              ; jg            519b <.literal16+0x93b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            51af <.literal16+0x93f>
+  DB  127,67                              ; jg            519f <.literal16+0x93f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            51b3 <.literal16+0x943>
+  DB  127,67                              ; jg            51a3 <.literal16+0x943>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,195                               ; add           %al,%bl
   DB  0,0                                 ; add           %al,(%rax)
@@ -16963,16 +16963,16 @@
   DB  128,3,62                            ; addb          $0x3e,(%rbx)
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           5233 <.literal16+0x9c3>
+  DB  118,63                              ; jbe           5223 <.literal16+0x9c3>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           5237 <.literal16+0x9c7>
+  DB  118,63                              ; jbe           5227 <.literal16+0x9c7>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           523b <.literal16+0x9cb>
+  DB  118,63                              ; jbe           522b <.literal16+0x9cb>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           523f <.literal16+0x9cf>
+  DB  118,63                              ; jbe           522f <.literal16+0x9cf>
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
@@ -16984,11 +16984,11 @@
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            527b <.literal16+0xa0b>
+  DB  127,67                              ; jg            526b <.literal16+0xa0b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            527f <.literal16+0xa0f>
+  DB  127,67                              ; jg            526f <.literal16+0xa0f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            5283 <.literal16+0xa13>
+  DB  127,67                              ; jg            5273 <.literal16+0xa13>
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,129                          ; cmpb          $0x81,(%rbx)
   DB  128,128,59,0,0,128,63               ; addb          $0x3f,-0x7fffffc5(%rax)
@@ -17017,7 +17017,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 30052b0 <_sk_callback_sse41+0x3000af7>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 30052a0 <_sk_callback_sse41+0x3000aed>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -17046,13 +17046,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        52e9 <.literal16+0xa79>
+  DB  224,7                               ; loopne        52d9 <.literal16+0xa79>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        52ed <.literal16+0xa7d>
+  DB  224,7                               ; loopne        52dd <.literal16+0xa7d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        52f1 <.literal16+0xa81>
+  DB  224,7                               ; loopne        52e1 <.literal16+0xa81>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        52f5 <.literal16+0xa85>
+  DB  224,7                               ; loopne        52e5 <.literal16+0xa85>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -17098,13 +17098,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        5359 <.literal16+0xae9>
+  DB  224,7                               ; loopne        5349 <.literal16+0xae9>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        535d <.literal16+0xaed>
+  DB  224,7                               ; loopne        534d <.literal16+0xaed>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        5361 <.literal16+0xaf1>
+  DB  224,7                               ; loopne        5351 <.literal16+0xaf1>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        5365 <.literal16+0xaf5>
+  DB  224,7                               ; loopne        5355 <.literal16+0xaf5>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -17142,13 +17142,13 @@
   DB  65,0,0                              ; add           %al,(%r8)
   DB  248                                 ; clc
   DB  65,0,0                              ; add           %al,(%r8)
-  DB  124,66                              ; jl            53f6 <.literal16+0xb86>
+  DB  124,66                              ; jl            53e6 <.literal16+0xb86>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            53fa <.literal16+0xb8a>
+  DB  124,66                              ; jl            53ea <.literal16+0xb8a>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            53fe <.literal16+0xb8e>
+  DB  124,66                              ; jl            53ee <.literal16+0xb8e>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            5402 <.literal16+0xb92>
+  DB  124,66                              ; jl            53f2 <.literal16+0xb92>
   DB  0,240                               ; add           %dh,%al
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,240                               ; add           %dh,%al
@@ -17238,13 +17238,13 @@
   DB  136,136,61,137,136,136              ; mov           %cl,-0x777776c3(%rax)
   DB  61,137,136,136,61                   ; cmp           $0x3d888889,%eax
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            5505 <.literal16+0xc95>
+  DB  112,65                              ; jo            54f5 <.literal16+0xc95>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            5509 <.literal16+0xc99>
+  DB  112,65                              ; jo            54f9 <.literal16+0xc99>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            550d <.literal16+0xc9d>
+  DB  112,65                              ; jo            54fd <.literal16+0xc9d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            5511 <.literal16+0xca1>
+  DB  112,65                              ; jo            5501 <.literal16+0xca1>
   DB  255,0                               ; incl          (%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  255,0                               ; incl          (%rax)
@@ -17259,7 +17259,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3005500 <_sk_callback_sse41+0x3000d47>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 30054f0 <_sk_callback_sse41+0x3000d3d>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -17286,7 +17286,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3005540 <_sk_callback_sse41+0x3000d87>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3005530 <_sk_callback_sse41+0x3000d7d>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -17301,11 +17301,11 @@
   DB  255,0                               ; incl          (%rax)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            559b <.literal16+0xd2b>
+  DB  127,67                              ; jg            558b <.literal16+0xd2b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            559f <.literal16+0xd2f>
+  DB  127,67                              ; jg            558f <.literal16+0xd2f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            55a3 <.literal16+0xd33>
+  DB  127,67                              ; jg            5593 <.literal16+0xd33>
   DB  0,128,0,0,0,128                     ; add           %al,-0x80000000(%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,128,0,0,0,128                     ; add           %al,-0x80000000(%rax)
@@ -17381,13 +17381,13 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  255                                 ; (bad)
-  DB  127,71                              ; jg            566b <.literal16+0xdfb>
+  DB  127,71                              ; jg            565b <.literal16+0xdfb>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            566f <.literal16+0xdff>
+  DB  127,71                              ; jg            565f <.literal16+0xdff>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            5673 <.literal16+0xe03>
+  DB  127,71                              ; jg            5663 <.literal16+0xe03>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            5677 <.literal16+0xe07>
+  DB  127,71                              ; jg            5667 <.literal16+0xe07>
   DB  208                                 ; (bad)
   DB  179,89                              ; mov           $0x59,%bl
   DB  62,208                              ; ds            (bad)
@@ -17521,11 +17521,11 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,114                          ; cmpb          $0x72,(%rdi)
   DB  28,199                              ; sbb           $0xc7,%al
-  DB  62,114,28                           ; jb,pt         5792 <.literal16+0xf22>
+  DB  62,114,28                           ; jb,pt         5782 <.literal16+0xf22>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         5796 <.literal16+0xf26>
+  DB  62,114,28                           ; jb,pt         5786 <.literal16+0xf26>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         579a <.literal16+0xf2a>
+  DB  62,114,28                           ; jb,pt         578a <.literal16+0xf2a>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -17569,7 +17569,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63e625 <_sk_callback_sse41+0x3d639e6c>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63e615 <_sk_callback_sse41+0x3d639e62>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -17595,7 +17595,7 @@
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63e665 <_sk_callback_sse41+0x3d639eac>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63e655 <_sk_callback_sse41+0x3d639ea2>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
@@ -17604,13 +17604,13 @@
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
-  DB  114,28                              ; jb            585e <.literal16+0xfee>
+  DB  114,28                              ; jb            584e <.literal16+0xfee>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         5862 <.literal16+0xff2>
+  DB  62,114,28                           ; jb,pt         5852 <.literal16+0xff2>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         5866 <.literal16+0xff6>
+  DB  62,114,28                           ; jb,pt         5856 <.literal16+0xff6>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         586a <.literal16+0xffa>
+  DB  62,114,28                           ; jb,pt         585a <.literal16+0xffa>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -17631,11 +17631,11 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,114                          ; cmpb          $0x72,(%rdi)
   DB  28,199                              ; sbb           $0xc7,%al
-  DB  62,114,28                           ; jb,pt         58a2 <.literal16+0x1032>
+  DB  62,114,28                           ; jb,pt         5892 <.literal16+0x1032>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         58a6 <.literal16+0x1036>
+  DB  62,114,28                           ; jb,pt         5896 <.literal16+0x1036>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         58aa <.literal16+0x103a>
+  DB  62,114,28                           ; jb,pt         589a <.literal16+0x103a>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -17679,7 +17679,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63e735 <_sk_callback_sse41+0x3d639f7c>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63e725 <_sk_callback_sse41+0x3d639f72>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -17705,7 +17705,7 @@
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63e775 <_sk_callback_sse41+0x3d639fbc>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63e765 <_sk_callback_sse41+0x3d639fb2>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
@@ -17714,13 +17714,13 @@
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
-  DB  114,28                              ; jb            596e <.literal16+0x10fe>
+  DB  114,28                              ; jb            595e <.literal16+0x10fe>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         5972 <_sk_callback_sse41+0x11b9>
+  DB  62,114,28                           ; jb,pt         5962 <_sk_callback_sse41+0x11af>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         5976 <_sk_callback_sse41+0x11bd>
+  DB  62,114,28                           ; jb,pt         5966 <_sk_callback_sse41+0x11b3>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         597a <_sk_callback_sse41+0x11c1>
+  DB  62,114,28                           ; jb,pt         596a <_sk_callback_sse41+0x11b7>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -17811,7 +17811,7 @@
   DB  102,15,110,199                      ; movd          %edi,%xmm0
   DB  102,15,112,192,0                    ; pshufd        $0x0,%xmm0,%xmm0
   DB  15,91,200                           ; cvtdq2ps      %xmm0,%xmm1
-  DB  15,40,21,193,75,0,0                 ; movaps        0x4bc1(%rip),%xmm2        # 4cd0 <_sk_callback_sse2+0xb0>
+  DB  15,40,21,193,75,0,0                 ; movaps        0x4bc1(%rip),%xmm2        # 4cd0 <_sk_callback_sse2+0xb6>
   DB  15,88,202                           ; addps         %xmm2,%xmm1
   DB  15,16,2                             ; movups        (%rdx),%xmm0
   DB  15,88,193                           ; addps         %xmm1,%xmm0
@@ -17820,7 +17820,7 @@
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  15,88,202                           ; addps         %xmm2,%xmm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,21,176,75,0,0                 ; movaps        0x4bb0(%rip),%xmm2        # 4ce0 <_sk_callback_sse2+0xc0>
+  DB  15,40,21,176,75,0,0                 ; movaps        0x4bb0(%rip),%xmm2        # 4ce0 <_sk_callback_sse2+0xc6>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
   DB  15,87,237                           ; xorps         %xmm5,%xmm5
@@ -17833,22 +17833,20 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  102,68,15,110,199                   ; movd          %edi,%xmm8
   DB  102,69,15,112,192,0                 ; pshufd        $0x0,%xmm8,%xmm8
-  DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,16,10                         ; movups        (%rdx),%xmm9
-  DB  69,15,88,200                        ; addps         %xmm8,%xmm9
-  DB  243,69,15,91,201                    ; cvttps2dq     %xmm9,%xmm9
+  DB  243,68,15,111,74,32                 ; movdqu        0x20(%rdx),%xmm9
+  DB  102,69,15,254,200                   ; paddd         %xmm8,%xmm9
   DB  72,139,8                            ; mov           (%rax),%rcx
   DB  102,68,15,110,1                     ; movd          (%rcx),%xmm8
   DB  102,69,15,112,192,0                 ; pshufd        $0x0,%xmm8,%xmm8
   DB  102,69,15,239,193                   ; pxor          %xmm9,%xmm8
-  DB  102,68,15,111,21,117,75,0,0         ; movdqa        0x4b75(%rip),%xmm10        # 4cf0 <_sk_callback_sse2+0xd0>
+  DB  102,68,15,111,21,123,75,0,0         ; movdqa        0x4b7b(%rip),%xmm10        # 4cf0 <_sk_callback_sse2+0xd6>
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
   DB  102,69,15,219,218                   ; pand          %xmm10,%xmm11
   DB  102,65,15,114,243,5                 ; pslld         $0x5,%xmm11
   DB  102,69,15,219,209                   ; pand          %xmm9,%xmm10
   DB  102,65,15,114,242,4                 ; pslld         $0x4,%xmm10
-  DB  102,68,15,111,37,97,75,0,0          ; movdqa        0x4b61(%rip),%xmm12        # 4d00 <_sk_callback_sse2+0xe0>
-  DB  102,68,15,111,45,104,75,0,0         ; movdqa        0x4b68(%rip),%xmm13        # 4d10 <_sk_callback_sse2+0xf0>
+  DB  102,68,15,111,37,103,75,0,0         ; movdqa        0x4b67(%rip),%xmm12        # 4d00 <_sk_callback_sse2+0xe6>
+  DB  102,68,15,111,45,110,75,0,0         ; movdqa        0x4b6e(%rip),%xmm13        # 4d10 <_sk_callback_sse2+0xf6>
   DB  102,69,15,111,240                   ; movdqa        %xmm8,%xmm14
   DB  102,69,15,219,245                   ; pand          %xmm13,%xmm14
   DB  102,65,15,114,246,2                 ; pslld         $0x2,%xmm14
@@ -17860,12 +17858,12 @@
   DB  102,65,15,114,209,2                 ; psrld         $0x2,%xmm9
   DB  102,69,15,235,234                   ; por           %xmm10,%xmm13
   DB  102,69,15,235,233                   ; por           %xmm9,%xmm13
-  DB  102,69,15,235,243                   ; por           %xmm11,%xmm14
-  DB  102,69,15,235,245                   ; por           %xmm13,%xmm14
-  DB  102,69,15,235,240                   ; por           %xmm8,%xmm14
-  DB  69,15,91,198                        ; cvtdq2ps      %xmm14,%xmm8
-  DB  68,15,89,5,35,75,0,0                ; mulps         0x4b23(%rip),%xmm8        # 4d20 <_sk_callback_sse2+0x100>
-  DB  68,15,88,5,43,75,0,0                ; addps         0x4b2b(%rip),%xmm8        # 4d30 <_sk_callback_sse2+0x110>
+  DB  102,69,15,235,235                   ; por           %xmm11,%xmm13
+  DB  102,69,15,235,198                   ; por           %xmm14,%xmm8
+  DB  102,69,15,235,197                   ; por           %xmm13,%xmm8
+  DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
+  DB  68,15,89,5,41,75,0,0                ; mulps         0x4b29(%rip),%xmm8        # 4d20 <_sk_callback_sse2+0x106>
+  DB  68,15,88,5,49,75,0,0                ; addps         0x4b31(%rip),%xmm8        # 4d30 <_sk_callback_sse2+0x116>
   DB  243,68,15,16,80,8                   ; movss         0x8(%rax),%xmm10
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
@@ -17932,7 +17930,7 @@
 PUBLIC _sk_srcatop_sse2
 _sk_srcatop_sse2 LABEL PROC
   DB  15,89,199                           ; mulps         %xmm7,%xmm0
-  DB  68,15,40,5,132,74,0,0               ; movaps        0x4a84(%rip),%xmm8        # 4d40 <_sk_callback_sse2+0x120>
+  DB  68,15,40,5,138,74,0,0               ; movaps        0x4a8a(%rip),%xmm8        # 4d40 <_sk_callback_sse2+0x126>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -17955,7 +17953,7 @@
 _sk_dstatop_sse2 LABEL PROC
   DB  68,15,40,195                        ; movaps        %xmm3,%xmm8
   DB  68,15,89,196                        ; mulps         %xmm4,%xmm8
-  DB  68,15,40,13,71,74,0,0               ; movaps        0x4a47(%rip),%xmm9        # 4d50 <_sk_callback_sse2+0x130>
+  DB  68,15,40,13,77,74,0,0               ; movaps        0x4a4d(%rip),%xmm9        # 4d50 <_sk_callback_sse2+0x136>
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
@@ -17996,7 +17994,7 @@
 
 PUBLIC _sk_srcout_sse2
 _sk_srcout_sse2 LABEL PROC
-  DB  68,15,40,5,235,73,0,0               ; movaps        0x49eb(%rip),%xmm8        # 4d60 <_sk_callback_sse2+0x140>
+  DB  68,15,40,5,241,73,0,0               ; movaps        0x49f1(%rip),%xmm8        # 4d60 <_sk_callback_sse2+0x146>
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
@@ -18007,7 +18005,7 @@
 
 PUBLIC _sk_dstout_sse2
 _sk_dstout_sse2 LABEL PROC
-  DB  68,15,40,5,219,73,0,0               ; movaps        0x49db(%rip),%xmm8        # 4d70 <_sk_callback_sse2+0x150>
+  DB  68,15,40,5,225,73,0,0               ; movaps        0x49e1(%rip),%xmm8        # 4d70 <_sk_callback_sse2+0x156>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  15,89,196                           ; mulps         %xmm4,%xmm0
@@ -18022,7 +18020,7 @@
 
 PUBLIC _sk_srcover_sse2
 _sk_srcover_sse2 LABEL PROC
-  DB  68,15,40,5,190,73,0,0               ; movaps        0x49be(%rip),%xmm8        # 4d80 <_sk_callback_sse2+0x160>
+  DB  68,15,40,5,196,73,0,0               ; movaps        0x49c4(%rip),%xmm8        # 4d80 <_sk_callback_sse2+0x166>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -18040,7 +18038,7 @@
 
 PUBLIC _sk_dstover_sse2
 _sk_dstover_sse2 LABEL PROC
-  DB  68,15,40,5,146,73,0,0               ; movaps        0x4992(%rip),%xmm8        # 4d90 <_sk_callback_sse2+0x170>
+  DB  68,15,40,5,152,73,0,0               ; movaps        0x4998(%rip),%xmm8        # 4d90 <_sk_callback_sse2+0x176>
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -18064,7 +18062,7 @@
 
 PUBLIC _sk_multiply_sse2
 _sk_multiply_sse2 LABEL PROC
-  DB  68,15,40,5,102,73,0,0               ; movaps        0x4966(%rip),%xmm8        # 4da0 <_sk_callback_sse2+0x180>
+  DB  68,15,40,5,108,73,0,0               ; movaps        0x496c(%rip),%xmm8        # 4da0 <_sk_callback_sse2+0x186>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
@@ -18134,7 +18132,7 @@
 PUBLIC _sk_xor__sse2
 _sk_xor__sse2 LABEL PROC
   DB  68,15,40,195                        ; movaps        %xmm3,%xmm8
-  DB  15,40,29,151,72,0,0                 ; movaps        0x4897(%rip),%xmm3        # 4db0 <_sk_callback_sse2+0x190>
+  DB  15,40,29,157,72,0,0                 ; movaps        0x489d(%rip),%xmm3        # 4db0 <_sk_callback_sse2+0x196>
   DB  68,15,40,203                        ; movaps        %xmm3,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
@@ -18180,7 +18178,7 @@
   DB  68,15,89,206                        ; mulps         %xmm6,%xmm9
   DB  65,15,95,209                        ; maxps         %xmm9,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,2,72,0,0                   ; movaps        0x4802(%rip),%xmm2        # 4dc0 <_sk_callback_sse2+0x1a0>
+  DB  15,40,21,8,72,0,0                   ; movaps        0x4808(%rip),%xmm2        # 4dc0 <_sk_callback_sse2+0x1a6>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -18212,7 +18210,7 @@
   DB  68,15,89,206                        ; mulps         %xmm6,%xmm9
   DB  65,15,93,209                        ; minps         %xmm9,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,167,71,0,0                 ; movaps        0x47a7(%rip),%xmm2        # 4dd0 <_sk_callback_sse2+0x1b0>
+  DB  15,40,21,173,71,0,0                 ; movaps        0x47ad(%rip),%xmm2        # 4dd0 <_sk_callback_sse2+0x1b6>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -18247,7 +18245,7 @@
   DB  65,15,93,209                        ; minps         %xmm9,%xmm2
   DB  15,88,210                           ; addps         %xmm2,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,65,71,0,0                  ; movaps        0x4741(%rip),%xmm2        # 4de0 <_sk_callback_sse2+0x1c0>
+  DB  15,40,21,71,71,0,0                  ; movaps        0x4747(%rip),%xmm2        # 4de0 <_sk_callback_sse2+0x1c6>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -18272,7 +18270,7 @@
   DB  15,89,214                           ; mulps         %xmm6,%xmm2
   DB  15,88,210                           ; addps         %xmm2,%xmm2
   DB  68,15,92,202                        ; subps         %xmm2,%xmm9
-  DB  15,40,13,2,71,0,0                   ; movaps        0x4702(%rip),%xmm1        # 4df0 <_sk_callback_sse2+0x1d0>
+  DB  15,40,13,8,71,0,0                   ; movaps        0x4708(%rip),%xmm1        # 4df0 <_sk_callback_sse2+0x1d6>
   DB  15,92,203                           ; subps         %xmm3,%xmm1
   DB  15,89,207                           ; mulps         %xmm7,%xmm1
   DB  15,88,217                           ; addps         %xmm1,%xmm3
@@ -18284,7 +18282,7 @@
 PUBLIC _sk_colorburn_sse2
 _sk_colorburn_sse2 LABEL PROC
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,40,21,241,70,0,0              ; movaps        0x46f1(%rip),%xmm10        # 4e00 <_sk_callback_sse2+0x1e0>
+  DB  68,15,40,21,247,70,0,0              ; movaps        0x46f7(%rip),%xmm10        # 4e00 <_sk_callback_sse2+0x1e6>
   DB  69,15,40,202                        ; movaps        %xmm10,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  69,15,40,217                        ; movaps        %xmm9,%xmm11
@@ -18376,7 +18374,7 @@
 PUBLIC _sk_colordodge_sse2
 _sk_colordodge_sse2 LABEL PROC
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
-  DB  68,15,40,21,167,69,0,0              ; movaps        0x45a7(%rip),%xmm10        # 4e10 <_sk_callback_sse2+0x1f0>
+  DB  68,15,40,21,173,69,0,0              ; movaps        0x45ad(%rip),%xmm10        # 4e10 <_sk_callback_sse2+0x1f6>
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
   DB  68,15,92,223                        ; subps         %xmm7,%xmm11
   DB  69,15,40,227                        ; movaps        %xmm11,%xmm12
@@ -18469,7 +18467,7 @@
   DB  15,41,52,36                         ; movaps        %xmm6,(%rsp)
   DB  15,40,245                           ; movaps        %xmm5,%xmm6
   DB  15,40,236                           ; movaps        %xmm4,%xmm5
-  DB  68,15,40,29,89,68,0,0               ; movaps        0x4459(%rip),%xmm11        # 4e20 <_sk_callback_sse2+0x200>
+  DB  68,15,40,29,95,68,0,0               ; movaps        0x445f(%rip),%xmm11        # 4e20 <_sk_callback_sse2+0x206>
   DB  69,15,40,211                        ; movaps        %xmm11,%xmm10
   DB  68,15,92,215                        ; subps         %xmm7,%xmm10
   DB  69,15,40,194                        ; movaps        %xmm10,%xmm8
@@ -18556,7 +18554,7 @@
 _sk_overlay_sse2 LABEL PROC
   DB  68,15,40,193                        ; movaps        %xmm1,%xmm8
   DB  68,15,40,232                        ; movaps        %xmm0,%xmm13
-  DB  68,15,40,13,36,67,0,0               ; movaps        0x4324(%rip),%xmm9        # 4e30 <_sk_callback_sse2+0x210>
+  DB  68,15,40,13,42,67,0,0               ; movaps        0x432a(%rip),%xmm9        # 4e30 <_sk_callback_sse2+0x216>
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
   DB  68,15,92,215                        ; subps         %xmm7,%xmm10
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
@@ -18646,7 +18644,7 @@
   DB  68,15,40,213                        ; movaps        %xmm5,%xmm10
   DB  68,15,94,215                        ; divps         %xmm7,%xmm10
   DB  69,15,84,212                        ; andps         %xmm12,%xmm10
-  DB  68,15,40,13,222,65,0,0              ; movaps        0x41de(%rip),%xmm9        # 4e40 <_sk_callback_sse2+0x220>
+  DB  68,15,40,13,228,65,0,0              ; movaps        0x41e4(%rip),%xmm9        # 4e40 <_sk_callback_sse2+0x226>
   DB  69,15,40,249                        ; movaps        %xmm9,%xmm15
   DB  69,15,92,250                        ; subps         %xmm10,%xmm15
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
@@ -18659,10 +18657,10 @@
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
   DB  65,15,88,194                        ; addps         %xmm10,%xmm0
-  DB  68,15,40,53,184,65,0,0              ; movaps        0x41b8(%rip),%xmm14        # 4e50 <_sk_callback_sse2+0x230>
+  DB  68,15,40,53,190,65,0,0              ; movaps        0x41be(%rip),%xmm14        # 4e50 <_sk_callback_sse2+0x236>
   DB  69,15,88,222                        ; addps         %xmm14,%xmm11
   DB  68,15,89,216                        ; mulps         %xmm0,%xmm11
-  DB  68,15,40,21,184,65,0,0              ; movaps        0x41b8(%rip),%xmm10        # 4e60 <_sk_callback_sse2+0x240>
+  DB  68,15,40,21,190,65,0,0              ; movaps        0x41be(%rip),%xmm10        # 4e60 <_sk_callback_sse2+0x246>
   DB  69,15,89,234                        ; mulps         %xmm10,%xmm13
   DB  69,15,88,235                        ; addps         %xmm11,%xmm13
   DB  15,88,228                           ; addps         %xmm4,%xmm4
@@ -18807,7 +18805,7 @@
   DB  68,15,40,209                        ; movaps        %xmm1,%xmm10
   DB  68,15,40,225                        ; movaps        %xmm1,%xmm12
   DB  68,15,89,211                        ; mulps         %xmm3,%xmm10
-  DB  68,15,40,5,244,63,0,0               ; movaps        0x3ff4(%rip),%xmm8        # 4ea0 <_sk_callback_sse2+0x280>
+  DB  68,15,40,5,250,63,0,0               ; movaps        0x3ffa(%rip),%xmm8        # 4ea0 <_sk_callback_sse2+0x286>
   DB  69,15,40,216                        ; movaps        %xmm8,%xmm11
   DB  15,40,207                           ; movaps        %xmm7,%xmm1
   DB  68,15,92,217                        ; subps         %xmm1,%xmm11
@@ -18853,12 +18851,12 @@
   DB  69,15,84,206                        ; andps         %xmm14,%xmm9
   DB  69,15,84,214                        ; andps         %xmm14,%xmm10
   DB  65,15,84,214                        ; andps         %xmm14,%xmm2
-  DB  68,15,40,61,8,63,0,0                ; movaps        0x3f08(%rip),%xmm15        # 4e70 <_sk_callback_sse2+0x250>
+  DB  68,15,40,61,14,63,0,0               ; movaps        0x3f0e(%rip),%xmm15        # 4e70 <_sk_callback_sse2+0x256>
   DB  65,15,89,231                        ; mulps         %xmm15,%xmm4
-  DB  15,40,5,13,63,0,0                   ; movaps        0x3f0d(%rip),%xmm0        # 4e80 <_sk_callback_sse2+0x260>
+  DB  15,40,5,19,63,0,0                   ; movaps        0x3f13(%rip),%xmm0        # 4e80 <_sk_callback_sse2+0x266>
   DB  15,89,240                           ; mulps         %xmm0,%xmm6
   DB  15,88,244                           ; addps         %xmm4,%xmm6
-  DB  68,15,40,53,15,63,0,0               ; movaps        0x3f0f(%rip),%xmm14        # 4e90 <_sk_callback_sse2+0x270>
+  DB  68,15,40,53,21,63,0,0               ; movaps        0x3f15(%rip),%xmm14        # 4e90 <_sk_callback_sse2+0x276>
   DB  68,15,40,239                        ; movaps        %xmm7,%xmm13
   DB  69,15,89,238                        ; mulps         %xmm14,%xmm13
   DB  68,15,88,238                        ; addps         %xmm6,%xmm13
@@ -19035,14 +19033,14 @@
   DB  68,15,84,211                        ; andps         %xmm3,%xmm10
   DB  68,15,84,203                        ; andps         %xmm3,%xmm9
   DB  15,84,195                           ; andps         %xmm3,%xmm0
-  DB  68,15,40,5,159,60,0,0               ; movaps        0x3c9f(%rip),%xmm8        # 4eb0 <_sk_callback_sse2+0x290>
+  DB  68,15,40,5,165,60,0,0               ; movaps        0x3ca5(%rip),%xmm8        # 4eb0 <_sk_callback_sse2+0x296>
   DB  15,40,214                           ; movaps        %xmm6,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
-  DB  15,40,13,161,60,0,0                 ; movaps        0x3ca1(%rip),%xmm1        # 4ec0 <_sk_callback_sse2+0x2a0>
+  DB  15,40,13,167,60,0,0                 ; movaps        0x3ca7(%rip),%xmm1        # 4ec0 <_sk_callback_sse2+0x2a6>
   DB  15,40,221                           ; movaps        %xmm5,%xmm3
   DB  15,89,217                           ; mulps         %xmm1,%xmm3
   DB  15,88,218                           ; addps         %xmm2,%xmm3
-  DB  68,15,40,37,160,60,0,0              ; movaps        0x3ca0(%rip),%xmm12        # 4ed0 <_sk_callback_sse2+0x2b0>
+  DB  68,15,40,37,166,60,0,0              ; movaps        0x3ca6(%rip),%xmm12        # 4ed0 <_sk_callback_sse2+0x2b6>
   DB  69,15,89,236                        ; mulps         %xmm12,%xmm13
   DB  68,15,88,235                        ; addps         %xmm3,%xmm13
   DB  65,15,40,210                        ; movaps        %xmm10,%xmm2
@@ -19087,7 +19085,7 @@
   DB  15,40,223                           ; movaps        %xmm7,%xmm3
   DB  15,40,236                           ; movaps        %xmm4,%xmm5
   DB  15,89,221                           ; mulps         %xmm5,%xmm3
-  DB  68,15,40,5,5,60,0,0                 ; movaps        0x3c05(%rip),%xmm8        # 4ee0 <_sk_callback_sse2+0x2c0>
+  DB  68,15,40,5,11,60,0,0                ; movaps        0x3c0b(%rip),%xmm8        # 4ee0 <_sk_callback_sse2+0x2c6>
   DB  65,15,40,224                        ; movaps        %xmm8,%xmm4
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  15,88,253                           ; addps         %xmm5,%xmm7
@@ -19188,14 +19186,14 @@
   DB  68,15,40,213                        ; movaps        %xmm5,%xmm10
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
   DB  65,15,40,208                        ; movaps        %xmm8,%xmm2
-  DB  68,15,40,45,157,58,0,0              ; movaps        0x3a9d(%rip),%xmm13        # 4ef0 <_sk_callback_sse2+0x2d0>
+  DB  68,15,40,45,163,58,0,0              ; movaps        0x3aa3(%rip),%xmm13        # 4ef0 <_sk_callback_sse2+0x2d6>
   DB  68,15,40,198                        ; movaps        %xmm6,%xmm8
   DB  69,15,89,197                        ; mulps         %xmm13,%xmm8
-  DB  68,15,40,53,157,58,0,0              ; movaps        0x3a9d(%rip),%xmm14        # 4f00 <_sk_callback_sse2+0x2e0>
+  DB  68,15,40,53,163,58,0,0              ; movaps        0x3aa3(%rip),%xmm14        # 4f00 <_sk_callback_sse2+0x2e6>
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
   DB  65,15,89,198                        ; mulps         %xmm14,%xmm0
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
-  DB  68,15,40,29,153,58,0,0              ; movaps        0x3a99(%rip),%xmm11        # 4f10 <_sk_callback_sse2+0x2f0>
+  DB  68,15,40,29,159,58,0,0              ; movaps        0x3a9f(%rip),%xmm11        # 4f10 <_sk_callback_sse2+0x2f6>
   DB  69,15,89,227                        ; mulps         %xmm11,%xmm12
   DB  68,15,88,224                        ; addps         %xmm0,%xmm12
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
@@ -19203,7 +19201,7 @@
   DB  69,15,40,250                        ; movaps        %xmm10,%xmm15
   DB  69,15,89,254                        ; mulps         %xmm14,%xmm15
   DB  68,15,88,248                        ; addps         %xmm0,%xmm15
-  DB  68,15,40,5,133,58,0,0               ; movaps        0x3a85(%rip),%xmm8        # 4f20 <_sk_callback_sse2+0x300>
+  DB  68,15,40,5,139,58,0,0               ; movaps        0x3a8b(%rip),%xmm8        # 4f20 <_sk_callback_sse2+0x306>
   DB  65,15,40,224                        ; movaps        %xmm8,%xmm4
   DB  15,92,226                           ; subps         %xmm2,%xmm4
   DB  15,89,252                           ; mulps         %xmm4,%xmm7
@@ -19339,15 +19337,15 @@
   DB  68,15,40,205                        ; movaps        %xmm5,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
   DB  15,89,222                           ; mulps         %xmm6,%xmm3
-  DB  68,15,40,37,151,56,0,0              ; movaps        0x3897(%rip),%xmm12        # 4f30 <_sk_callback_sse2+0x310>
+  DB  68,15,40,37,157,56,0,0              ; movaps        0x389d(%rip),%xmm12        # 4f30 <_sk_callback_sse2+0x316>
   DB  68,15,40,199                        ; movaps        %xmm7,%xmm8
   DB  69,15,89,196                        ; mulps         %xmm12,%xmm8
-  DB  68,15,40,45,151,56,0,0              ; movaps        0x3897(%rip),%xmm13        # 4f40 <_sk_callback_sse2+0x320>
+  DB  68,15,40,45,157,56,0,0              ; movaps        0x389d(%rip),%xmm13        # 4f40 <_sk_callback_sse2+0x326>
   DB  68,15,40,241                        ; movaps        %xmm1,%xmm14
   DB  69,15,89,245                        ; mulps         %xmm13,%xmm14
   DB  69,15,88,240                        ; addps         %xmm8,%xmm14
-  DB  68,15,40,29,147,56,0,0              ; movaps        0x3893(%rip),%xmm11        # 4f50 <_sk_callback_sse2+0x330>
-  DB  68,15,40,5,155,56,0,0               ; movaps        0x389b(%rip),%xmm8        # 4f60 <_sk_callback_sse2+0x340>
+  DB  68,15,40,29,153,56,0,0              ; movaps        0x3899(%rip),%xmm11        # 4f50 <_sk_callback_sse2+0x336>
+  DB  68,15,40,5,161,56,0,0               ; movaps        0x38a1(%rip),%xmm8        # 4f60 <_sk_callback_sse2+0x346>
   DB  69,15,40,248                        ; movaps        %xmm8,%xmm15
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  68,15,92,248                        ; subps         %xmm0,%xmm15
@@ -19489,7 +19487,7 @@
 
 PUBLIC _sk_clamp_1_sse2
 _sk_clamp_1_sse2 LABEL PROC
-  DB  68,15,40,5,162,54,0,0               ; movaps        0x36a2(%rip),%xmm8        # 4f70 <_sk_callback_sse2+0x350>
+  DB  68,15,40,5,168,54,0,0               ; movaps        0x36a8(%rip),%xmm8        # 4f70 <_sk_callback_sse2+0x356>
   DB  65,15,93,192                        ; minps         %xmm8,%xmm0
   DB  65,15,93,200                        ; minps         %xmm8,%xmm1
   DB  65,15,93,208                        ; minps         %xmm8,%xmm2
@@ -19499,7 +19497,7 @@
 
 PUBLIC _sk_clamp_a_sse2
 _sk_clamp_a_sse2 LABEL PROC
-  DB  15,93,29,151,54,0,0                 ; minps         0x3697(%rip),%xmm3        # 4f80 <_sk_callback_sse2+0x360>
+  DB  15,93,29,157,54,0,0                 ; minps         0x369d(%rip),%xmm3        # 4f80 <_sk_callback_sse2+0x366>
   DB  15,93,195                           ; minps         %xmm3,%xmm0
   DB  15,93,203                           ; minps         %xmm3,%xmm1
   DB  15,93,211                           ; minps         %xmm3,%xmm2
@@ -19572,7 +19570,7 @@
 PUBLIC _sk_unpremul_sse2
 _sk_unpremul_sse2 LABEL PROC
   DB  69,15,87,192                        ; xorps         %xmm8,%xmm8
-  DB  68,15,40,13,2,54,0,0                ; movaps        0x3602(%rip),%xmm9        # 4f90 <_sk_callback_sse2+0x370>
+  DB  68,15,40,13,8,54,0,0                ; movaps        0x3608(%rip),%xmm9        # 4f90 <_sk_callback_sse2+0x376>
   DB  68,15,94,203                        ; divps         %xmm3,%xmm9
   DB  68,15,194,195,4                     ; cmpneqps      %xmm3,%xmm8
   DB  69,15,84,193                        ; andps         %xmm9,%xmm8
@@ -19584,20 +19582,20 @@
 
 PUBLIC _sk_from_srgb_sse2
 _sk_from_srgb_sse2 LABEL PROC
-  DB  68,15,40,5,237,53,0,0               ; movaps        0x35ed(%rip),%xmm8        # 4fa0 <_sk_callback_sse2+0x380>
+  DB  68,15,40,5,243,53,0,0               ; movaps        0x35f3(%rip),%xmm8        # 4fa0 <_sk_callback_sse2+0x386>
   DB  68,15,40,232                        ; movaps        %xmm0,%xmm13
   DB  69,15,89,232                        ; mulps         %xmm8,%xmm13
   DB  68,15,40,216                        ; movaps        %xmm0,%xmm11
   DB  69,15,89,219                        ; mulps         %xmm11,%xmm11
-  DB  68,15,40,13,229,53,0,0              ; movaps        0x35e5(%rip),%xmm9        # 4fb0 <_sk_callback_sse2+0x390>
+  DB  68,15,40,13,235,53,0,0              ; movaps        0x35eb(%rip),%xmm9        # 4fb0 <_sk_callback_sse2+0x396>
   DB  68,15,40,240                        ; movaps        %xmm0,%xmm14
   DB  69,15,89,241                        ; mulps         %xmm9,%xmm14
-  DB  68,15,40,21,229,53,0,0              ; movaps        0x35e5(%rip),%xmm10        # 4fc0 <_sk_callback_sse2+0x3a0>
+  DB  68,15,40,21,235,53,0,0              ; movaps        0x35eb(%rip),%xmm10        # 4fc0 <_sk_callback_sse2+0x3a6>
   DB  69,15,88,242                        ; addps         %xmm10,%xmm14
   DB  69,15,89,243                        ; mulps         %xmm11,%xmm14
-  DB  68,15,40,29,229,53,0,0              ; movaps        0x35e5(%rip),%xmm11        # 4fd0 <_sk_callback_sse2+0x3b0>
+  DB  68,15,40,29,235,53,0,0              ; movaps        0x35eb(%rip),%xmm11        # 4fd0 <_sk_callback_sse2+0x3b6>
   DB  69,15,88,243                        ; addps         %xmm11,%xmm14
-  DB  68,15,40,37,233,53,0,0              ; movaps        0x35e9(%rip),%xmm12        # 4fe0 <_sk_callback_sse2+0x3c0>
+  DB  68,15,40,37,239,53,0,0              ; movaps        0x35ef(%rip),%xmm12        # 4fe0 <_sk_callback_sse2+0x3c6>
   DB  65,15,194,196,1                     ; cmpltps       %xmm12,%xmm0
   DB  68,15,84,232                        ; andps         %xmm0,%xmm13
   DB  65,15,85,198                        ; andnps        %xmm14,%xmm0
@@ -19632,22 +19630,22 @@
 PUBLIC _sk_to_srgb_sse2
 _sk_to_srgb_sse2 LABEL PROC
   DB  68,15,82,232                        ; rsqrtps       %xmm0,%xmm13
-  DB  68,15,40,5,118,53,0,0               ; movaps        0x3576(%rip),%xmm8        # 4ff0 <_sk_callback_sse2+0x3d0>
+  DB  68,15,40,5,124,53,0,0               ; movaps        0x357c(%rip),%xmm8        # 4ff0 <_sk_callback_sse2+0x3d6>
   DB  68,15,40,240                        ; movaps        %xmm0,%xmm14
   DB  69,15,89,240                        ; mulps         %xmm8,%xmm14
-  DB  68,15,40,13,118,53,0,0              ; movaps        0x3576(%rip),%xmm9        # 5000 <_sk_callback_sse2+0x3e0>
+  DB  68,15,40,13,124,53,0,0              ; movaps        0x357c(%rip),%xmm9        # 5000 <_sk_callback_sse2+0x3e6>
   DB  69,15,40,253                        ; movaps        %xmm13,%xmm15
   DB  69,15,89,249                        ; mulps         %xmm9,%xmm15
-  DB  68,15,40,21,118,53,0,0              ; movaps        0x3576(%rip),%xmm10        # 5010 <_sk_callback_sse2+0x3f0>
+  DB  68,15,40,21,124,53,0,0              ; movaps        0x357c(%rip),%xmm10        # 5010 <_sk_callback_sse2+0x3f6>
   DB  69,15,88,250                        ; addps         %xmm10,%xmm15
   DB  69,15,89,253                        ; mulps         %xmm13,%xmm15
-  DB  68,15,40,29,118,53,0,0              ; movaps        0x3576(%rip),%xmm11        # 5020 <_sk_callback_sse2+0x400>
+  DB  68,15,40,29,124,53,0,0              ; movaps        0x357c(%rip),%xmm11        # 5020 <_sk_callback_sse2+0x406>
   DB  69,15,88,251                        ; addps         %xmm11,%xmm15
-  DB  68,15,40,37,122,53,0,0              ; movaps        0x357a(%rip),%xmm12        # 5030 <_sk_callback_sse2+0x410>
+  DB  68,15,40,37,128,53,0,0              ; movaps        0x3580(%rip),%xmm12        # 5030 <_sk_callback_sse2+0x416>
   DB  69,15,88,236                        ; addps         %xmm12,%xmm13
   DB  69,15,83,237                        ; rcpps         %xmm13,%xmm13
   DB  69,15,89,239                        ; mulps         %xmm15,%xmm13
-  DB  68,15,40,61,118,53,0,0              ; movaps        0x3576(%rip),%xmm15        # 5040 <_sk_callback_sse2+0x420>
+  DB  68,15,40,61,124,53,0,0              ; movaps        0x357c(%rip),%xmm15        # 5040 <_sk_callback_sse2+0x426>
   DB  65,15,194,199,1                     ; cmpltps       %xmm15,%xmm0
   DB  68,15,84,240                        ; andps         %xmm0,%xmm14
   DB  65,15,85,197                        ; andnps        %xmm13,%xmm0
@@ -19695,7 +19693,7 @@
   DB  68,15,93,218                        ; minps         %xmm2,%xmm11
   DB  65,15,40,202                        ; movaps        %xmm10,%xmm1
   DB  65,15,92,203                        ; subps         %xmm11,%xmm1
-  DB  68,15,40,45,207,52,0,0              ; movaps        0x34cf(%rip),%xmm13        # 5050 <_sk_callback_sse2+0x430>
+  DB  68,15,40,45,213,52,0,0              ; movaps        0x34d5(%rip),%xmm13        # 5050 <_sk_callback_sse2+0x436>
   DB  68,15,94,233                        ; divps         %xmm1,%xmm13
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  65,15,194,192,0                     ; cmpeqps       %xmm8,%xmm0
@@ -19704,30 +19702,30 @@
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,40,241                        ; movaps        %xmm9,%xmm14
   DB  68,15,194,242,1                     ; cmpltps       %xmm2,%xmm14
-  DB  68,15,84,53,181,52,0,0              ; andps         0x34b5(%rip),%xmm14        # 5060 <_sk_callback_sse2+0x440>
+  DB  68,15,84,53,187,52,0,0              ; andps         0x34bb(%rip),%xmm14        # 5060 <_sk_callback_sse2+0x446>
   DB  69,15,88,244                        ; addps         %xmm12,%xmm14
   DB  69,15,40,250                        ; movaps        %xmm10,%xmm15
   DB  69,15,194,249,0                     ; cmpeqps       %xmm9,%xmm15
   DB  65,15,92,208                        ; subps         %xmm8,%xmm2
   DB  65,15,89,213                        ; mulps         %xmm13,%xmm2
-  DB  68,15,40,37,168,52,0,0              ; movaps        0x34a8(%rip),%xmm12        # 5070 <_sk_callback_sse2+0x450>
+  DB  68,15,40,37,174,52,0,0              ; movaps        0x34ae(%rip),%xmm12        # 5070 <_sk_callback_sse2+0x456>
   DB  65,15,88,212                        ; addps         %xmm12,%xmm2
   DB  69,15,92,193                        ; subps         %xmm9,%xmm8
   DB  69,15,89,197                        ; mulps         %xmm13,%xmm8
-  DB  68,15,88,5,164,52,0,0               ; addps         0x34a4(%rip),%xmm8        # 5080 <_sk_callback_sse2+0x460>
+  DB  68,15,88,5,170,52,0,0               ; addps         0x34aa(%rip),%xmm8        # 5080 <_sk_callback_sse2+0x466>
   DB  65,15,84,215                        ; andps         %xmm15,%xmm2
   DB  69,15,85,248                        ; andnps        %xmm8,%xmm15
   DB  68,15,86,250                        ; orps          %xmm2,%xmm15
   DB  68,15,84,240                        ; andps         %xmm0,%xmm14
   DB  65,15,85,199                        ; andnps        %xmm15,%xmm0
   DB  65,15,86,198                        ; orps          %xmm14,%xmm0
-  DB  15,89,5,149,52,0,0                  ; mulps         0x3495(%rip),%xmm0        # 5090 <_sk_callback_sse2+0x470>
+  DB  15,89,5,155,52,0,0                  ; mulps         0x349b(%rip),%xmm0        # 5090 <_sk_callback_sse2+0x476>
   DB  69,15,40,194                        ; movaps        %xmm10,%xmm8
   DB  69,15,194,195,4                     ; cmpneqps      %xmm11,%xmm8
   DB  65,15,84,192                        ; andps         %xmm8,%xmm0
   DB  69,15,92,226                        ; subps         %xmm10,%xmm12
   DB  69,15,88,211                        ; addps         %xmm11,%xmm10
-  DB  68,15,40,13,136,52,0,0              ; movaps        0x3488(%rip),%xmm9        # 50a0 <_sk_callback_sse2+0x480>
+  DB  68,15,40,13,142,52,0,0              ; movaps        0x348e(%rip),%xmm9        # 50a0 <_sk_callback_sse2+0x486>
   DB  65,15,40,210                        ; movaps        %xmm10,%xmm2
   DB  65,15,89,209                        ; mulps         %xmm9,%xmm2
   DB  68,15,194,202,1                     ; cmpltps       %xmm2,%xmm9
@@ -19750,7 +19748,7 @@
   DB  15,41,92,36,32                      ; movaps        %xmm3,0x20(%rsp)
   DB  68,15,40,218                        ; movaps        %xmm2,%xmm11
   DB  15,40,240                           ; movaps        %xmm0,%xmm6
-  DB  68,15,40,13,67,52,0,0               ; movaps        0x3443(%rip),%xmm9        # 50b0 <_sk_callback_sse2+0x490>
+  DB  68,15,40,13,73,52,0,0               ; movaps        0x3449(%rip),%xmm9        # 50b0 <_sk_callback_sse2+0x496>
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
   DB  69,15,194,211,2                     ; cmpleps       %xmm11,%xmm10
   DB  15,40,193                           ; movaps        %xmm1,%xmm0
@@ -19767,28 +19765,28 @@
   DB  69,15,88,211                        ; addps         %xmm11,%xmm10
   DB  69,15,88,219                        ; addps         %xmm11,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  15,40,5,13,52,0,0                   ; movaps        0x340d(%rip),%xmm0        # 50c0 <_sk_callback_sse2+0x4a0>
+  DB  15,40,5,19,52,0,0                   ; movaps        0x3413(%rip),%xmm0        # 50c0 <_sk_callback_sse2+0x4a6>
   DB  15,88,198                           ; addps         %xmm6,%xmm0
   DB  243,15,91,200                       ; cvttps2dq     %xmm0,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  15,40,216                           ; movaps        %xmm0,%xmm3
   DB  15,194,217,1                        ; cmpltps       %xmm1,%xmm3
-  DB  15,84,29,5,52,0,0                   ; andps         0x3405(%rip),%xmm3        # 50d0 <_sk_callback_sse2+0x4b0>
+  DB  15,84,29,11,52,0,0                  ; andps         0x340b(%rip),%xmm3        # 50d0 <_sk_callback_sse2+0x4b6>
   DB  15,92,203                           ; subps         %xmm3,%xmm1
   DB  15,92,193                           ; subps         %xmm1,%xmm0
-  DB  68,15,40,45,7,52,0,0                ; movaps        0x3407(%rip),%xmm13        # 50e0 <_sk_callback_sse2+0x4c0>
+  DB  68,15,40,45,13,52,0,0               ; movaps        0x340d(%rip),%xmm13        # 50e0 <_sk_callback_sse2+0x4c6>
   DB  69,15,40,197                        ; movaps        %xmm13,%xmm8
   DB  68,15,194,192,2                     ; cmpleps       %xmm0,%xmm8
   DB  69,15,40,242                        ; movaps        %xmm10,%xmm14
   DB  69,15,92,243                        ; subps         %xmm11,%xmm14
   DB  65,15,40,217                        ; movaps        %xmm9,%xmm3
   DB  15,194,216,2                        ; cmpleps       %xmm0,%xmm3
-  DB  15,40,21,23,52,0,0                  ; movaps        0x3417(%rip),%xmm2        # 5110 <_sk_callback_sse2+0x4f0>
+  DB  15,40,21,29,52,0,0                  ; movaps        0x341d(%rip),%xmm2        # 5110 <_sk_callback_sse2+0x4f6>
   DB  68,15,40,250                        ; movaps        %xmm2,%xmm15
   DB  68,15,194,248,2                     ; cmpleps       %xmm0,%xmm15
-  DB  15,40,13,231,51,0,0                 ; movaps        0x33e7(%rip),%xmm1        # 50f0 <_sk_callback_sse2+0x4d0>
+  DB  15,40,13,237,51,0,0                 ; movaps        0x33ed(%rip),%xmm1        # 50f0 <_sk_callback_sse2+0x4d6>
   DB  15,89,193                           ; mulps         %xmm1,%xmm0
-  DB  15,40,45,237,51,0,0                 ; movaps        0x33ed(%rip),%xmm5        # 5100 <_sk_callback_sse2+0x4e0>
+  DB  15,40,45,243,51,0,0                 ; movaps        0x33f3(%rip),%xmm5        # 5100 <_sk_callback_sse2+0x4e6>
   DB  15,40,229                           ; movaps        %xmm5,%xmm4
   DB  15,92,224                           ; subps         %xmm0,%xmm4
   DB  65,15,89,230                        ; mulps         %xmm14,%xmm4
@@ -19811,7 +19809,7 @@
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
   DB  15,40,222                           ; movaps        %xmm6,%xmm3
   DB  15,194,216,1                        ; cmpltps       %xmm0,%xmm3
-  DB  15,84,29,98,51,0,0                  ; andps         0x3362(%rip),%xmm3        # 50d0 <_sk_callback_sse2+0x4b0>
+  DB  15,84,29,104,51,0,0                 ; andps         0x3368(%rip),%xmm3        # 50d0 <_sk_callback_sse2+0x4b6>
   DB  15,92,195                           ; subps         %xmm3,%xmm0
   DB  68,15,40,230                        ; movaps        %xmm6,%xmm12
   DB  68,15,92,224                        ; subps         %xmm0,%xmm12
@@ -19841,12 +19839,12 @@
   DB  15,40,60,36                         ; movaps        (%rsp),%xmm7
   DB  15,40,231                           ; movaps        %xmm7,%xmm4
   DB  15,85,227                           ; andnps        %xmm3,%xmm4
-  DB  15,88,53,59,51,0,0                  ; addps         0x333b(%rip),%xmm6        # 5120 <_sk_callback_sse2+0x500>
+  DB  15,88,53,65,51,0,0                  ; addps         0x3341(%rip),%xmm6        # 5120 <_sk_callback_sse2+0x506>
   DB  243,15,91,198                       ; cvttps2dq     %xmm6,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
   DB  15,40,222                           ; movaps        %xmm6,%xmm3
   DB  15,194,216,1                        ; cmpltps       %xmm0,%xmm3
-  DB  15,84,29,214,50,0,0                 ; andps         0x32d6(%rip),%xmm3        # 50d0 <_sk_callback_sse2+0x4b0>
+  DB  15,84,29,220,50,0,0                 ; andps         0x32dc(%rip),%xmm3        # 50d0 <_sk_callback_sse2+0x4b6>
   DB  15,92,195                           ; subps         %xmm3,%xmm0
   DB  15,92,240                           ; subps         %xmm0,%xmm6
   DB  15,89,206                           ; mulps         %xmm6,%xmm1
@@ -19907,7 +19905,7 @@
   DB  102,69,15,96,193                    ; punpcklbw     %xmm9,%xmm8
   DB  102,69,15,97,193                    ; punpcklwd     %xmm9,%xmm8
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,96,50,0,0                ; mulps         0x3260(%rip),%xmm8        # 5130 <_sk_callback_sse2+0x510>
+  DB  68,15,89,5,102,50,0,0               ; mulps         0x3266(%rip),%xmm8        # 5130 <_sk_callback_sse2+0x516>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
@@ -19944,7 +19942,7 @@
   DB  102,69,15,96,193                    ; punpcklbw     %xmm9,%xmm8
   DB  102,69,15,97,193                    ; punpcklwd     %xmm9,%xmm8
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,254,49,0,0               ; mulps         0x31fe(%rip),%xmm8        # 5140 <_sk_callback_sse2+0x520>
+  DB  68,15,89,5,4,50,0,0                 ; mulps         0x3204(%rip),%xmm8        # 5140 <_sk_callback_sse2+0x526>
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -19967,17 +19965,17 @@
   DB  243,68,15,126,20,120                ; movq          (%rax,%rdi,2),%xmm10
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  102,69,15,97,208                    ; punpcklwd     %xmm8,%xmm10
-  DB  102,68,15,111,5,196,49,0,0          ; movdqa        0x31c4(%rip),%xmm8        # 5150 <_sk_callback_sse2+0x530>
+  DB  102,68,15,111,5,202,49,0,0          ; movdqa        0x31ca(%rip),%xmm8        # 5150 <_sk_callback_sse2+0x536>
   DB  102,69,15,219,194                   ; pand          %xmm10,%xmm8
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,195,49,0,0               ; mulps         0x31c3(%rip),%xmm8        # 5160 <_sk_callback_sse2+0x540>
-  DB  102,68,15,111,13,202,49,0,0         ; movdqa        0x31ca(%rip),%xmm9        # 5170 <_sk_callback_sse2+0x550>
+  DB  68,15,89,5,201,49,0,0               ; mulps         0x31c9(%rip),%xmm8        # 5160 <_sk_callback_sse2+0x546>
+  DB  102,68,15,111,13,208,49,0,0         ; movdqa        0x31d0(%rip),%xmm9        # 5170 <_sk_callback_sse2+0x556>
   DB  102,69,15,219,202                   ; pand          %xmm10,%xmm9
   DB  69,15,91,201                        ; cvtdq2ps      %xmm9,%xmm9
-  DB  68,15,89,13,201,49,0,0              ; mulps         0x31c9(%rip),%xmm9        # 5180 <_sk_callback_sse2+0x560>
-  DB  102,68,15,219,21,208,49,0,0         ; pand          0x31d0(%rip),%xmm10        # 5190 <_sk_callback_sse2+0x570>
+  DB  68,15,89,13,207,49,0,0              ; mulps         0x31cf(%rip),%xmm9        # 5180 <_sk_callback_sse2+0x566>
+  DB  102,68,15,219,21,214,49,0,0         ; pand          0x31d6(%rip),%xmm10        # 5190 <_sk_callback_sse2+0x576>
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
-  DB  68,15,89,21,212,49,0,0              ; mulps         0x31d4(%rip),%xmm10        # 51a0 <_sk_callback_sse2+0x580>
+  DB  68,15,89,21,218,49,0,0              ; mulps         0x31da(%rip),%xmm10        # 51a0 <_sk_callback_sse2+0x586>
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -20006,7 +20004,7 @@
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  76,139,72,8                         ; mov           0x8(%rax),%r9
   DB  243,69,15,111,12,184                ; movdqu        (%r8,%rdi,4),%xmm9
-  DB  102,68,15,111,5,132,49,0,0          ; movdqa        0x3184(%rip),%xmm8        # 51b0 <_sk_callback_sse2+0x590>
+  DB  102,68,15,111,5,138,49,0,0          ; movdqa        0x318a(%rip),%xmm8        # 51b0 <_sk_callback_sse2+0x596>
   DB  102,65,15,111,193                   ; movdqa        %xmm9,%xmm0
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,15,112,200,78                   ; pshufd        $0x4e,%xmm0,%xmm1
@@ -20061,7 +20059,7 @@
   DB  65,15,20,208                        ; unpcklps      %xmm8,%xmm2
   DB  102,65,15,114,209,24                ; psrld         $0x18,%xmm9
   DB  65,15,91,217                        ; cvtdq2ps      %xmm9,%xmm3
-  DB  15,89,29,145,48,0,0                 ; mulps         0x3091(%rip),%xmm3        # 51c0 <_sk_callback_sse2+0x5a0>
+  DB  15,89,29,151,48,0,0                 ; mulps         0x3097(%rip),%xmm3        # 51c0 <_sk_callback_sse2+0x5a6>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
@@ -20078,7 +20076,7 @@
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,97,200                       ; punpcklwd     %xmm0,%xmm1
   DB  102,68,15,105,200                   ; punpckhwd     %xmm0,%xmm9
-  DB  102,68,15,111,21,100,48,0,0         ; movdqa        0x3064(%rip),%xmm10        # 51d0 <_sk_callback_sse2+0x5b0>
+  DB  102,68,15,111,21,106,48,0,0         ; movdqa        0x306a(%rip),%xmm10        # 51d0 <_sk_callback_sse2+0x5b6>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,194                   ; pand          %xmm10,%xmm0
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
@@ -20139,7 +20137,7 @@
   DB  102,65,15,235,217                   ; por           %xmm9,%xmm3
   DB  102,65,15,97,216                    ; punpcklwd     %xmm8,%xmm3
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,83,47,0,0                  ; mulps         0x2f53(%rip),%xmm3        # 51e0 <_sk_callback_sse2+0x5c0>
+  DB  15,89,29,89,47,0,0                  ; mulps         0x2f59(%rip),%xmm3        # 51e0 <_sk_callback_sse2+0x5c6>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
@@ -20159,7 +20157,7 @@
   DB  102,68,15,97,208                    ; punpcklwd     %xmm0,%xmm10
   DB  102,65,15,111,195                   ; movdqa        %xmm11,%xmm0
   DB  102,65,15,97,194                    ; punpcklwd     %xmm10,%xmm0
-  DB  102,68,15,111,5,19,47,0,0           ; movdqa        0x2f13(%rip),%xmm8        # 51f0 <_sk_callback_sse2+0x5d0>
+  DB  102,68,15,111,5,25,47,0,0           ; movdqa        0x2f19(%rip),%xmm8        # 51f0 <_sk_callback_sse2+0x5d6>
   DB  102,15,112,200,78                   ; pshufd        $0x4e,%xmm0,%xmm1
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
@@ -20214,7 +20212,7 @@
   DB  15,20,211                           ; unpcklps      %xmm3,%xmm2
   DB  65,15,20,208                        ; unpcklps      %xmm8,%xmm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,34,46,0,0                  ; movaps        0x2e22(%rip),%xmm3        # 5200 <_sk_callback_sse2+0x5e0>
+  DB  15,40,29,40,46,0,0                  ; movaps        0x2e28(%rip),%xmm3        # 5200 <_sk_callback_sse2+0x5e6>
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_byte_tables_sse2
@@ -20222,7 +20220,7 @@
   DB  65,86                               ; push          %r14
   DB  83                                  ; push          %rbx
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,35,46,0,0                ; movaps        0x2e23(%rip),%xmm8        # 5210 <_sk_callback_sse2+0x5f0>
+  DB  68,15,40,5,41,46,0,0                ; movaps        0x2e29(%rip),%xmm8        # 5210 <_sk_callback_sse2+0x5f6>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,91,192                       ; cvtps2dq      %xmm0,%xmm0
   DB  102,72,15,126,193                   ; movq          %xmm0,%rcx
@@ -20249,7 +20247,7 @@
   DB  102,65,15,96,193                    ; punpcklbw     %xmm9,%xmm0
   DB  102,65,15,97,193                    ; punpcklwd     %xmm9,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,21,192,45,0,0              ; movaps        0x2dc0(%rip),%xmm10        # 5220 <_sk_callback_sse2+0x600>
+  DB  68,15,40,21,198,45,0,0              ; movaps        0x2dc6(%rip),%xmm10        # 5220 <_sk_callback_sse2+0x606>
   DB  65,15,89,194                        ; mulps         %xmm10,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,91,201                       ; cvtps2dq      %xmm1,%xmm1
@@ -20363,7 +20361,7 @@
   DB  102,65,15,96,193                    ; punpcklbw     %xmm9,%xmm0
   DB  102,65,15,97,193                    ; punpcklwd     %xmm9,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,21,19,44,0,0               ; movaps        0x2c13(%rip),%xmm10        # 5230 <_sk_callback_sse2+0x610>
+  DB  68,15,40,21,25,44,0,0               ; movaps        0x2c19(%rip),%xmm10        # 5230 <_sk_callback_sse2+0x616>
   DB  65,15,89,194                        ; mulps         %xmm10,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,91,201                       ; cvtps2dq      %xmm1,%xmm1
@@ -20550,15 +20548,15 @@
   DB  69,15,88,209                        ; addps         %xmm9,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,202                        ; cvtdq2ps      %xmm10,%xmm9
-  DB  68,15,89,13,82,41,0,0               ; mulps         0x2952(%rip),%xmm9        # 5240 <_sk_callback_sse2+0x620>
-  DB  68,15,84,21,90,41,0,0               ; andps         0x295a(%rip),%xmm10        # 5250 <_sk_callback_sse2+0x630>
-  DB  68,15,86,21,98,41,0,0               ; orps          0x2962(%rip),%xmm10        # 5260 <_sk_callback_sse2+0x640>
-  DB  68,15,88,13,106,41,0,0              ; addps         0x296a(%rip),%xmm9        # 5270 <_sk_callback_sse2+0x650>
-  DB  68,15,40,37,114,41,0,0              ; movaps        0x2972(%rip),%xmm12        # 5280 <_sk_callback_sse2+0x660>
+  DB  68,15,89,13,88,41,0,0               ; mulps         0x2958(%rip),%xmm9        # 5240 <_sk_callback_sse2+0x626>
+  DB  68,15,84,21,96,41,0,0               ; andps         0x2960(%rip),%xmm10        # 5250 <_sk_callback_sse2+0x636>
+  DB  68,15,86,21,104,41,0,0              ; orps          0x2968(%rip),%xmm10        # 5260 <_sk_callback_sse2+0x646>
+  DB  68,15,88,13,112,41,0,0              ; addps         0x2970(%rip),%xmm9        # 5270 <_sk_callback_sse2+0x656>
+  DB  68,15,40,37,120,41,0,0              ; movaps        0x2978(%rip),%xmm12        # 5280 <_sk_callback_sse2+0x666>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,88,21,114,41,0,0              ; addps         0x2972(%rip),%xmm10        # 5290 <_sk_callback_sse2+0x670>
-  DB  68,15,40,37,122,41,0,0              ; movaps        0x297a(%rip),%xmm12        # 52a0 <_sk_callback_sse2+0x680>
+  DB  68,15,88,21,120,41,0,0              ; addps         0x2978(%rip),%xmm10        # 5290 <_sk_callback_sse2+0x676>
+  DB  68,15,40,37,128,41,0,0              ; movaps        0x2980(%rip),%xmm12        # 52a0 <_sk_callback_sse2+0x686>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
@@ -20566,22 +20564,22 @@
   DB  69,15,91,226                        ; cvtdq2ps      %xmm10,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,194,236,1                     ; cmpltps       %xmm12,%xmm13
-  DB  68,15,40,21,100,41,0,0              ; movaps        0x2964(%rip),%xmm10        # 52b0 <_sk_callback_sse2+0x690>
+  DB  68,15,40,21,106,41,0,0              ; movaps        0x296a(%rip),%xmm10        # 52b0 <_sk_callback_sse2+0x696>
   DB  69,15,84,234                        ; andps         %xmm10,%xmm13
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,92,236                        ; subps         %xmm12,%xmm13
-  DB  68,15,88,13,88,41,0,0               ; addps         0x2958(%rip),%xmm9        # 52c0 <_sk_callback_sse2+0x6a0>
-  DB  68,15,40,37,96,41,0,0               ; movaps        0x2960(%rip),%xmm12        # 52d0 <_sk_callback_sse2+0x6b0>
+  DB  68,15,88,13,94,41,0,0               ; addps         0x295e(%rip),%xmm9        # 52c0 <_sk_callback_sse2+0x6a6>
+  DB  68,15,40,37,102,41,0,0              ; movaps        0x2966(%rip),%xmm12        # 52d0 <_sk_callback_sse2+0x6b6>
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,40,37,96,41,0,0               ; movaps        0x2960(%rip),%xmm12        # 52e0 <_sk_callback_sse2+0x6c0>
+  DB  68,15,40,37,102,41,0,0              ; movaps        0x2966(%rip),%xmm12        # 52e0 <_sk_callback_sse2+0x6c6>
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
-  DB  68,15,40,45,100,41,0,0              ; movaps        0x2964(%rip),%xmm13        # 52f0 <_sk_callback_sse2+0x6d0>
+  DB  68,15,40,45,106,41,0,0              ; movaps        0x296a(%rip),%xmm13        # 52f0 <_sk_callback_sse2+0x6d6>
   DB  69,15,94,236                        ; divps         %xmm12,%xmm13
   DB  69,15,88,233                        ; addps         %xmm9,%xmm13
-  DB  68,15,89,45,100,41,0,0              ; mulps         0x2964(%rip),%xmm13        # 5300 <_sk_callback_sse2+0x6e0>
+  DB  68,15,89,45,106,41,0,0              ; mulps         0x296a(%rip),%xmm13        # 5300 <_sk_callback_sse2+0x6e6>
   DB  102,69,15,91,205                    ; cvtps2dq      %xmm13,%xmm9
   DB  243,68,15,16,96,20                  ; movss         0x14(%rax),%xmm12
   DB  69,15,198,228,0                     ; shufps        $0x0,%xmm12,%xmm12
@@ -20615,15 +20613,15 @@
   DB  69,15,88,209                        ; addps         %xmm9,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,202                        ; cvtdq2ps      %xmm10,%xmm9
-  DB  68,15,89,13,228,40,0,0              ; mulps         0x28e4(%rip),%xmm9        # 5310 <_sk_callback_sse2+0x6f0>
-  DB  68,15,84,21,236,40,0,0              ; andps         0x28ec(%rip),%xmm10        # 5320 <_sk_callback_sse2+0x700>
-  DB  68,15,86,21,244,40,0,0              ; orps          0x28f4(%rip),%xmm10        # 5330 <_sk_callback_sse2+0x710>
-  DB  68,15,88,13,252,40,0,0              ; addps         0x28fc(%rip),%xmm9        # 5340 <_sk_callback_sse2+0x720>
-  DB  68,15,40,37,4,41,0,0                ; movaps        0x2904(%rip),%xmm12        # 5350 <_sk_callback_sse2+0x730>
+  DB  68,15,89,13,234,40,0,0              ; mulps         0x28ea(%rip),%xmm9        # 5310 <_sk_callback_sse2+0x6f6>
+  DB  68,15,84,21,242,40,0,0              ; andps         0x28f2(%rip),%xmm10        # 5320 <_sk_callback_sse2+0x706>
+  DB  68,15,86,21,250,40,0,0              ; orps          0x28fa(%rip),%xmm10        # 5330 <_sk_callback_sse2+0x716>
+  DB  68,15,88,13,2,41,0,0                ; addps         0x2902(%rip),%xmm9        # 5340 <_sk_callback_sse2+0x726>
+  DB  68,15,40,37,10,41,0,0               ; movaps        0x290a(%rip),%xmm12        # 5350 <_sk_callback_sse2+0x736>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,88,21,4,41,0,0                ; addps         0x2904(%rip),%xmm10        # 5360 <_sk_callback_sse2+0x740>
-  DB  68,15,40,37,12,41,0,0               ; movaps        0x290c(%rip),%xmm12        # 5370 <_sk_callback_sse2+0x750>
+  DB  68,15,88,21,10,41,0,0               ; addps         0x290a(%rip),%xmm10        # 5360 <_sk_callback_sse2+0x746>
+  DB  68,15,40,37,18,41,0,0               ; movaps        0x2912(%rip),%xmm12        # 5370 <_sk_callback_sse2+0x756>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
@@ -20631,22 +20629,22 @@
   DB  69,15,91,226                        ; cvtdq2ps      %xmm10,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,194,236,1                     ; cmpltps       %xmm12,%xmm13
-  DB  68,15,40,21,246,40,0,0              ; movaps        0x28f6(%rip),%xmm10        # 5380 <_sk_callback_sse2+0x760>
+  DB  68,15,40,21,252,40,0,0              ; movaps        0x28fc(%rip),%xmm10        # 5380 <_sk_callback_sse2+0x766>
   DB  69,15,84,234                        ; andps         %xmm10,%xmm13
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,92,236                        ; subps         %xmm12,%xmm13
-  DB  68,15,88,13,234,40,0,0              ; addps         0x28ea(%rip),%xmm9        # 5390 <_sk_callback_sse2+0x770>
-  DB  68,15,40,37,242,40,0,0              ; movaps        0x28f2(%rip),%xmm12        # 53a0 <_sk_callback_sse2+0x780>
+  DB  68,15,88,13,240,40,0,0              ; addps         0x28f0(%rip),%xmm9        # 5390 <_sk_callback_sse2+0x776>
+  DB  68,15,40,37,248,40,0,0              ; movaps        0x28f8(%rip),%xmm12        # 53a0 <_sk_callback_sse2+0x786>
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,40,37,242,40,0,0              ; movaps        0x28f2(%rip),%xmm12        # 53b0 <_sk_callback_sse2+0x790>
+  DB  68,15,40,37,248,40,0,0              ; movaps        0x28f8(%rip),%xmm12        # 53b0 <_sk_callback_sse2+0x796>
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
-  DB  68,15,40,45,246,40,0,0              ; movaps        0x28f6(%rip),%xmm13        # 53c0 <_sk_callback_sse2+0x7a0>
+  DB  68,15,40,45,252,40,0,0              ; movaps        0x28fc(%rip),%xmm13        # 53c0 <_sk_callback_sse2+0x7a6>
   DB  69,15,94,236                        ; divps         %xmm12,%xmm13
   DB  69,15,88,233                        ; addps         %xmm9,%xmm13
-  DB  68,15,89,45,246,40,0,0              ; mulps         0x28f6(%rip),%xmm13        # 53d0 <_sk_callback_sse2+0x7b0>
+  DB  68,15,89,45,252,40,0,0              ; mulps         0x28fc(%rip),%xmm13        # 53d0 <_sk_callback_sse2+0x7b6>
   DB  102,69,15,91,205                    ; cvtps2dq      %xmm13,%xmm9
   DB  243,68,15,16,96,20                  ; movss         0x14(%rax),%xmm12
   DB  69,15,198,228,0                     ; shufps        $0x0,%xmm12,%xmm12
@@ -20680,15 +20678,15 @@
   DB  69,15,88,209                        ; addps         %xmm9,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,202                        ; cvtdq2ps      %xmm10,%xmm9
-  DB  68,15,89,13,118,40,0,0              ; mulps         0x2876(%rip),%xmm9        # 53e0 <_sk_callback_sse2+0x7c0>
-  DB  68,15,84,21,126,40,0,0              ; andps         0x287e(%rip),%xmm10        # 53f0 <_sk_callback_sse2+0x7d0>
-  DB  68,15,86,21,134,40,0,0              ; orps          0x2886(%rip),%xmm10        # 5400 <_sk_callback_sse2+0x7e0>
-  DB  68,15,88,13,142,40,0,0              ; addps         0x288e(%rip),%xmm9        # 5410 <_sk_callback_sse2+0x7f0>
-  DB  68,15,40,37,150,40,0,0              ; movaps        0x2896(%rip),%xmm12        # 5420 <_sk_callback_sse2+0x800>
+  DB  68,15,89,13,124,40,0,0              ; mulps         0x287c(%rip),%xmm9        # 53e0 <_sk_callback_sse2+0x7c6>
+  DB  68,15,84,21,132,40,0,0              ; andps         0x2884(%rip),%xmm10        # 53f0 <_sk_callback_sse2+0x7d6>
+  DB  68,15,86,21,140,40,0,0              ; orps          0x288c(%rip),%xmm10        # 5400 <_sk_callback_sse2+0x7e6>
+  DB  68,15,88,13,148,40,0,0              ; addps         0x2894(%rip),%xmm9        # 5410 <_sk_callback_sse2+0x7f6>
+  DB  68,15,40,37,156,40,0,0              ; movaps        0x289c(%rip),%xmm12        # 5420 <_sk_callback_sse2+0x806>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,88,21,150,40,0,0              ; addps         0x2896(%rip),%xmm10        # 5430 <_sk_callback_sse2+0x810>
-  DB  68,15,40,37,158,40,0,0              ; movaps        0x289e(%rip),%xmm12        # 5440 <_sk_callback_sse2+0x820>
+  DB  68,15,88,21,156,40,0,0              ; addps         0x289c(%rip),%xmm10        # 5430 <_sk_callback_sse2+0x816>
+  DB  68,15,40,37,164,40,0,0              ; movaps        0x28a4(%rip),%xmm12        # 5440 <_sk_callback_sse2+0x826>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
@@ -20696,22 +20694,22 @@
   DB  69,15,91,226                        ; cvtdq2ps      %xmm10,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,194,236,1                     ; cmpltps       %xmm12,%xmm13
-  DB  68,15,40,21,136,40,0,0              ; movaps        0x2888(%rip),%xmm10        # 5450 <_sk_callback_sse2+0x830>
+  DB  68,15,40,21,142,40,0,0              ; movaps        0x288e(%rip),%xmm10        # 5450 <_sk_callback_sse2+0x836>
   DB  69,15,84,234                        ; andps         %xmm10,%xmm13
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,92,236                        ; subps         %xmm12,%xmm13
-  DB  68,15,88,13,124,40,0,0              ; addps         0x287c(%rip),%xmm9        # 5460 <_sk_callback_sse2+0x840>
-  DB  68,15,40,37,132,40,0,0              ; movaps        0x2884(%rip),%xmm12        # 5470 <_sk_callback_sse2+0x850>
+  DB  68,15,88,13,130,40,0,0              ; addps         0x2882(%rip),%xmm9        # 5460 <_sk_callback_sse2+0x846>
+  DB  68,15,40,37,138,40,0,0              ; movaps        0x288a(%rip),%xmm12        # 5470 <_sk_callback_sse2+0x856>
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,40,37,132,40,0,0              ; movaps        0x2884(%rip),%xmm12        # 5480 <_sk_callback_sse2+0x860>
+  DB  68,15,40,37,138,40,0,0              ; movaps        0x288a(%rip),%xmm12        # 5480 <_sk_callback_sse2+0x866>
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
-  DB  68,15,40,45,136,40,0,0              ; movaps        0x2888(%rip),%xmm13        # 5490 <_sk_callback_sse2+0x870>
+  DB  68,15,40,45,142,40,0,0              ; movaps        0x288e(%rip),%xmm13        # 5490 <_sk_callback_sse2+0x876>
   DB  69,15,94,236                        ; divps         %xmm12,%xmm13
   DB  69,15,88,233                        ; addps         %xmm9,%xmm13
-  DB  68,15,89,45,136,40,0,0              ; mulps         0x2888(%rip),%xmm13        # 54a0 <_sk_callback_sse2+0x880>
+  DB  68,15,89,45,142,40,0,0              ; mulps         0x288e(%rip),%xmm13        # 54a0 <_sk_callback_sse2+0x886>
   DB  102,69,15,91,205                    ; cvtps2dq      %xmm13,%xmm9
   DB  243,68,15,16,96,20                  ; movss         0x14(%rax),%xmm12
   DB  69,15,198,228,0                     ; shufps        $0x0,%xmm12,%xmm12
@@ -20745,15 +20743,15 @@
   DB  69,15,88,209                        ; addps         %xmm9,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,202                        ; cvtdq2ps      %xmm10,%xmm9
-  DB  68,15,89,13,8,40,0,0                ; mulps         0x2808(%rip),%xmm9        # 54b0 <_sk_callback_sse2+0x890>
-  DB  68,15,84,21,16,40,0,0               ; andps         0x2810(%rip),%xmm10        # 54c0 <_sk_callback_sse2+0x8a0>
-  DB  68,15,86,21,24,40,0,0               ; orps          0x2818(%rip),%xmm10        # 54d0 <_sk_callback_sse2+0x8b0>
-  DB  68,15,88,13,32,40,0,0               ; addps         0x2820(%rip),%xmm9        # 54e0 <_sk_callback_sse2+0x8c0>
-  DB  68,15,40,37,40,40,0,0               ; movaps        0x2828(%rip),%xmm12        # 54f0 <_sk_callback_sse2+0x8d0>
+  DB  68,15,89,13,14,40,0,0               ; mulps         0x280e(%rip),%xmm9        # 54b0 <_sk_callback_sse2+0x896>
+  DB  68,15,84,21,22,40,0,0               ; andps         0x2816(%rip),%xmm10        # 54c0 <_sk_callback_sse2+0x8a6>
+  DB  68,15,86,21,30,40,0,0               ; orps          0x281e(%rip),%xmm10        # 54d0 <_sk_callback_sse2+0x8b6>
+  DB  68,15,88,13,38,40,0,0               ; addps         0x2826(%rip),%xmm9        # 54e0 <_sk_callback_sse2+0x8c6>
+  DB  68,15,40,37,46,40,0,0               ; movaps        0x282e(%rip),%xmm12        # 54f0 <_sk_callback_sse2+0x8d6>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,88,21,40,40,0,0               ; addps         0x2828(%rip),%xmm10        # 5500 <_sk_callback_sse2+0x8e0>
-  DB  68,15,40,37,48,40,0,0               ; movaps        0x2830(%rip),%xmm12        # 5510 <_sk_callback_sse2+0x8f0>
+  DB  68,15,88,21,46,40,0,0               ; addps         0x282e(%rip),%xmm10        # 5500 <_sk_callback_sse2+0x8e6>
+  DB  68,15,40,37,54,40,0,0               ; movaps        0x2836(%rip),%xmm12        # 5510 <_sk_callback_sse2+0x8f6>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
@@ -20761,22 +20759,22 @@
   DB  69,15,91,226                        ; cvtdq2ps      %xmm10,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,194,236,1                     ; cmpltps       %xmm12,%xmm13
-  DB  68,15,40,21,26,40,0,0               ; movaps        0x281a(%rip),%xmm10        # 5520 <_sk_callback_sse2+0x900>
+  DB  68,15,40,21,32,40,0,0               ; movaps        0x2820(%rip),%xmm10        # 5520 <_sk_callback_sse2+0x906>
   DB  69,15,84,234                        ; andps         %xmm10,%xmm13
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,92,236                        ; subps         %xmm12,%xmm13
-  DB  68,15,88,13,14,40,0,0               ; addps         0x280e(%rip),%xmm9        # 5530 <_sk_callback_sse2+0x910>
-  DB  68,15,40,37,22,40,0,0               ; movaps        0x2816(%rip),%xmm12        # 5540 <_sk_callback_sse2+0x920>
+  DB  68,15,88,13,20,40,0,0               ; addps         0x2814(%rip),%xmm9        # 5530 <_sk_callback_sse2+0x916>
+  DB  68,15,40,37,28,40,0,0               ; movaps        0x281c(%rip),%xmm12        # 5540 <_sk_callback_sse2+0x926>
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,40,37,22,40,0,0               ; movaps        0x2816(%rip),%xmm12        # 5550 <_sk_callback_sse2+0x930>
+  DB  68,15,40,37,28,40,0,0               ; movaps        0x281c(%rip),%xmm12        # 5550 <_sk_callback_sse2+0x936>
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
-  DB  68,15,40,45,26,40,0,0               ; movaps        0x281a(%rip),%xmm13        # 5560 <_sk_callback_sse2+0x940>
+  DB  68,15,40,45,32,40,0,0               ; movaps        0x2820(%rip),%xmm13        # 5560 <_sk_callback_sse2+0x946>
   DB  69,15,94,236                        ; divps         %xmm12,%xmm13
   DB  69,15,88,233                        ; addps         %xmm9,%xmm13
-  DB  68,15,89,45,26,40,0,0               ; mulps         0x281a(%rip),%xmm13        # 5570 <_sk_callback_sse2+0x950>
+  DB  68,15,89,45,32,40,0,0               ; mulps         0x2820(%rip),%xmm13        # 5570 <_sk_callback_sse2+0x956>
   DB  102,69,15,91,205                    ; cvtps2dq      %xmm13,%xmm9
   DB  243,68,15,16,96,20                  ; movss         0x14(%rax),%xmm12
   DB  69,15,198,228,0                     ; shufps        $0x0,%xmm12,%xmm12
@@ -20791,29 +20789,29 @@
 
 PUBLIC _sk_lab_to_xyz_sse2
 _sk_lab_to_xyz_sse2 LABEL PROC
-  DB  15,89,5,247,39,0,0                  ; mulps         0x27f7(%rip),%xmm0        # 5580 <_sk_callback_sse2+0x960>
-  DB  68,15,40,5,255,39,0,0               ; movaps        0x27ff(%rip),%xmm8        # 5590 <_sk_callback_sse2+0x970>
+  DB  15,89,5,253,39,0,0                  ; mulps         0x27fd(%rip),%xmm0        # 5580 <_sk_callback_sse2+0x966>
+  DB  68,15,40,5,5,40,0,0                 ; movaps        0x2805(%rip),%xmm8        # 5590 <_sk_callback_sse2+0x976>
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
-  DB  68,15,40,13,3,40,0,0                ; movaps        0x2803(%rip),%xmm9        # 55a0 <_sk_callback_sse2+0x980>
+  DB  68,15,40,13,9,40,0,0                ; movaps        0x2809(%rip),%xmm9        # 55a0 <_sk_callback_sse2+0x986>
   DB  65,15,88,201                        ; addps         %xmm9,%xmm1
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  65,15,88,209                        ; addps         %xmm9,%xmm2
-  DB  15,88,5,0,40,0,0                    ; addps         0x2800(%rip),%xmm0        # 55b0 <_sk_callback_sse2+0x990>
-  DB  15,89,5,9,40,0,0                    ; mulps         0x2809(%rip),%xmm0        # 55c0 <_sk_callback_sse2+0x9a0>
-  DB  15,89,13,18,40,0,0                  ; mulps         0x2812(%rip),%xmm1        # 55d0 <_sk_callback_sse2+0x9b0>
+  DB  15,88,5,6,40,0,0                    ; addps         0x2806(%rip),%xmm0        # 55b0 <_sk_callback_sse2+0x996>
+  DB  15,89,5,15,40,0,0                   ; mulps         0x280f(%rip),%xmm0        # 55c0 <_sk_callback_sse2+0x9a6>
+  DB  15,89,13,24,40,0,0                  ; mulps         0x2818(%rip),%xmm1        # 55d0 <_sk_callback_sse2+0x9b6>
   DB  15,88,200                           ; addps         %xmm0,%xmm1
-  DB  15,89,21,24,40,0,0                  ; mulps         0x2818(%rip),%xmm2        # 55e0 <_sk_callback_sse2+0x9c0>
+  DB  15,89,21,30,40,0,0                  ; mulps         0x281e(%rip),%xmm2        # 55e0 <_sk_callback_sse2+0x9c6>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  68,15,92,202                        ; subps         %xmm2,%xmm9
   DB  68,15,40,225                        ; movaps        %xmm1,%xmm12
   DB  69,15,89,228                        ; mulps         %xmm12,%xmm12
   DB  68,15,89,225                        ; mulps         %xmm1,%xmm12
-  DB  15,40,21,13,40,0,0                  ; movaps        0x280d(%rip),%xmm2        # 55f0 <_sk_callback_sse2+0x9d0>
+  DB  15,40,21,19,40,0,0                  ; movaps        0x2813(%rip),%xmm2        # 55f0 <_sk_callback_sse2+0x9d6>
   DB  68,15,40,194                        ; movaps        %xmm2,%xmm8
   DB  69,15,194,196,1                     ; cmpltps       %xmm12,%xmm8
-  DB  68,15,40,21,12,40,0,0               ; movaps        0x280c(%rip),%xmm10        # 5600 <_sk_callback_sse2+0x9e0>
+  DB  68,15,40,21,18,40,0,0               ; movaps        0x2812(%rip),%xmm10        # 5600 <_sk_callback_sse2+0x9e6>
   DB  65,15,88,202                        ; addps         %xmm10,%xmm1
-  DB  68,15,40,29,16,40,0,0               ; movaps        0x2810(%rip),%xmm11        # 5610 <_sk_callback_sse2+0x9f0>
+  DB  68,15,40,29,22,40,0,0               ; movaps        0x2816(%rip),%xmm11        # 5610 <_sk_callback_sse2+0x9f6>
   DB  65,15,89,203                        ; mulps         %xmm11,%xmm1
   DB  69,15,84,224                        ; andps         %xmm8,%xmm12
   DB  68,15,85,193                        ; andnps        %xmm1,%xmm8
@@ -20837,8 +20835,8 @@
   DB  15,84,194                           ; andps         %xmm2,%xmm0
   DB  65,15,85,209                        ; andnps        %xmm9,%xmm2
   DB  15,86,208                           ; orps          %xmm0,%xmm2
-  DB  68,15,89,5,192,39,0,0               ; mulps         0x27c0(%rip),%xmm8        # 5620 <_sk_callback_sse2+0xa00>
-  DB  15,89,21,201,39,0,0                 ; mulps         0x27c9(%rip),%xmm2        # 5630 <_sk_callback_sse2+0xa10>
+  DB  68,15,89,5,198,39,0,0               ; mulps         0x27c6(%rip),%xmm8        # 5620 <_sk_callback_sse2+0xa06>
+  DB  15,89,21,207,39,0,0                 ; mulps         0x27cf(%rip),%xmm2        # 5630 <_sk_callback_sse2+0xa16>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -20852,7 +20850,7 @@
   DB  102,15,96,193                       ; punpcklbw     %xmm1,%xmm0
   DB  102,15,97,193                       ; punpcklwd     %xmm1,%xmm0
   DB  15,91,216                           ; cvtdq2ps      %xmm0,%xmm3
-  DB  15,89,29,177,39,0,0                 ; mulps         0x27b1(%rip),%xmm3        # 5640 <_sk_callback_sse2+0xa20>
+  DB  15,89,29,183,39,0,0                 ; mulps         0x27b7(%rip),%xmm3        # 5640 <_sk_callback_sse2+0xa26>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
@@ -20895,7 +20893,7 @@
   DB  102,15,96,193                       ; punpcklbw     %xmm1,%xmm0
   DB  102,15,97,193                       ; punpcklwd     %xmm1,%xmm0
   DB  15,91,216                           ; cvtdq2ps      %xmm0,%xmm3
-  DB  15,89,29,32,39,0,0                  ; mulps         0x2720(%rip),%xmm3        # 5650 <_sk_callback_sse2+0xa30>
+  DB  15,89,29,38,39,0,0                  ; mulps         0x2726(%rip),%xmm3        # 5650 <_sk_callback_sse2+0xa36>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
@@ -20906,7 +20904,7 @@
 _sk_store_a8_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,20,39,0,0                ; movaps        0x2714(%rip),%xmm8        # 5660 <_sk_callback_sse2+0xa40>
+  DB  68,15,40,5,26,39,0,0                ; movaps        0x271a(%rip),%xmm8        # 5660 <_sk_callback_sse2+0xa46>
   DB  68,15,89,195                        ; mulps         %xmm3,%xmm8
   DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
   DB  102,65,15,114,240,16                ; pslld         $0x10,%xmm8
@@ -20926,9 +20924,9 @@
   DB  102,15,96,193                       ; punpcklbw     %xmm1,%xmm0
   DB  102,15,97,193                       ; punpcklwd     %xmm1,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,219,38,0,0                  ; mulps         0x26db(%rip),%xmm0        # 5670 <_sk_callback_sse2+0xa50>
+  DB  15,89,5,225,38,0,0                  ; mulps         0x26e1(%rip),%xmm0        # 5670 <_sk_callback_sse2+0xa56>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,226,38,0,0                 ; movaps        0x26e2(%rip),%xmm3        # 5680 <_sk_callback_sse2+0xa60>
+  DB  15,40,29,232,38,0,0                 ; movaps        0x26e8(%rip),%xmm3        # 5680 <_sk_callback_sse2+0xa66>
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  255,224                             ; jmpq          *%rax
@@ -20969,9 +20967,9 @@
   DB  102,15,96,193                       ; punpcklbw     %xmm1,%xmm0
   DB  102,15,97,193                       ; punpcklwd     %xmm1,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,87,38,0,0                   ; mulps         0x2657(%rip),%xmm0        # 5690 <_sk_callback_sse2+0xa70>
+  DB  15,89,5,93,38,0,0                   ; mulps         0x265d(%rip),%xmm0        # 5690 <_sk_callback_sse2+0xa76>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,94,38,0,0                  ; movaps        0x265e(%rip),%xmm3        # 56a0 <_sk_callback_sse2+0xa80>
+  DB  15,40,29,100,38,0,0                 ; movaps        0x2664(%rip),%xmm3        # 56a0 <_sk_callback_sse2+0xa86>
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  255,224                             ; jmpq          *%rax
@@ -20981,9 +20979,9 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,137,192                          ; mov           %rax,%r8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  116,5                               ; je            3059 <_sk_gather_i8_sse2+0xf>
+  DB  116,5                               ; je            3053 <_sk_gather_i8_sse2+0xf>
   DB  76,137,192                          ; mov           %r8,%rax
-  DB  235,2                               ; jmp           305b <_sk_gather_i8_sse2+0x11>
+  DB  235,2                               ; jmp           3055 <_sk_gather_i8_sse2+0x11>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  243,15,91,201                       ; cvttps2dq     %xmm1,%xmm1
@@ -21032,11 +21030,11 @@
   DB  102,67,15,110,12,136                ; movd          (%r8,%r9,4),%xmm1
   DB  102,68,15,98,201                    ; punpckldq     %xmm1,%xmm9
   DB  102,68,15,98,200                    ; punpckldq     %xmm0,%xmm9
-  DB  102,15,111,21,125,37,0,0            ; movdqa        0x257d(%rip),%xmm2        # 56b0 <_sk_callback_sse2+0xa90>
+  DB  102,15,111,21,131,37,0,0            ; movdqa        0x2583(%rip),%xmm2        # 56b0 <_sk_callback_sse2+0xa96>
   DB  102,65,15,111,193                   ; movdqa        %xmm9,%xmm0
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,121,37,0,0               ; movaps        0x2579(%rip),%xmm8        # 56c0 <_sk_callback_sse2+0xaa0>
+  DB  68,15,40,5,127,37,0,0               ; movaps        0x257f(%rip),%xmm8        # 56c0 <_sk_callback_sse2+0xaa6>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,114,209,8                    ; psrld         $0x8,%xmm1
@@ -21061,19 +21059,19 @@
   DB  243,15,126,20,120                   ; movq          (%rax,%rdi,2),%xmm2
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  102,15,97,208                       ; punpcklwd     %xmm0,%xmm2
-  DB  102,15,111,5,47,37,0,0              ; movdqa        0x252f(%rip),%xmm0        # 56d0 <_sk_callback_sse2+0xab0>
+  DB  102,15,111,5,53,37,0,0              ; movdqa        0x2535(%rip),%xmm0        # 56d0 <_sk_callback_sse2+0xab6>
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,49,37,0,0                   ; mulps         0x2531(%rip),%xmm0        # 56e0 <_sk_callback_sse2+0xac0>
-  DB  102,15,111,13,57,37,0,0             ; movdqa        0x2539(%rip),%xmm1        # 56f0 <_sk_callback_sse2+0xad0>
+  DB  15,89,5,55,37,0,0                   ; mulps         0x2537(%rip),%xmm0        # 56e0 <_sk_callback_sse2+0xac6>
+  DB  102,15,111,13,63,37,0,0             ; movdqa        0x253f(%rip),%xmm1        # 56f0 <_sk_callback_sse2+0xad6>
   DB  102,15,219,202                      ; pand          %xmm2,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,59,37,0,0                  ; mulps         0x253b(%rip),%xmm1        # 5700 <_sk_callback_sse2+0xae0>
-  DB  102,15,219,21,67,37,0,0             ; pand          0x2543(%rip),%xmm2        # 5710 <_sk_callback_sse2+0xaf0>
+  DB  15,89,13,65,37,0,0                  ; mulps         0x2541(%rip),%xmm1        # 5700 <_sk_callback_sse2+0xae6>
+  DB  102,15,219,21,73,37,0,0             ; pand          0x2549(%rip),%xmm2        # 5710 <_sk_callback_sse2+0xaf6>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,73,37,0,0                  ; mulps         0x2549(%rip),%xmm2        # 5720 <_sk_callback_sse2+0xb00>
+  DB  15,89,21,79,37,0,0                  ; mulps         0x254f(%rip),%xmm2        # 5720 <_sk_callback_sse2+0xb06>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,80,37,0,0                  ; movaps        0x2550(%rip),%xmm3        # 5730 <_sk_callback_sse2+0xb10>
+  DB  15,40,29,86,37,0,0                  ; movaps        0x2556(%rip),%xmm3        # 5730 <_sk_callback_sse2+0xb16>
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_gather_565_sse2
@@ -21106,31 +21104,31 @@
   DB  102,15,196,208,3                    ; pinsrw        $0x3,%eax,%xmm2
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  102,15,97,208                       ; punpcklwd     %xmm0,%xmm2
-  DB  102,15,111,5,217,36,0,0             ; movdqa        0x24d9(%rip),%xmm0        # 5740 <_sk_callback_sse2+0xb20>
+  DB  102,15,111,5,223,36,0,0             ; movdqa        0x24df(%rip),%xmm0        # 5740 <_sk_callback_sse2+0xb26>
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,219,36,0,0                  ; mulps         0x24db(%rip),%xmm0        # 5750 <_sk_callback_sse2+0xb30>
-  DB  102,15,111,13,227,36,0,0            ; movdqa        0x24e3(%rip),%xmm1        # 5760 <_sk_callback_sse2+0xb40>
+  DB  15,89,5,225,36,0,0                  ; mulps         0x24e1(%rip),%xmm0        # 5750 <_sk_callback_sse2+0xb36>
+  DB  102,15,111,13,233,36,0,0            ; movdqa        0x24e9(%rip),%xmm1        # 5760 <_sk_callback_sse2+0xb46>
   DB  102,15,219,202                      ; pand          %xmm2,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,229,36,0,0                 ; mulps         0x24e5(%rip),%xmm1        # 5770 <_sk_callback_sse2+0xb50>
-  DB  102,15,219,21,237,36,0,0            ; pand          0x24ed(%rip),%xmm2        # 5780 <_sk_callback_sse2+0xb60>
+  DB  15,89,13,235,36,0,0                 ; mulps         0x24eb(%rip),%xmm1        # 5770 <_sk_callback_sse2+0xb56>
+  DB  102,15,219,21,243,36,0,0            ; pand          0x24f3(%rip),%xmm2        # 5780 <_sk_callback_sse2+0xb66>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,243,36,0,0                 ; mulps         0x24f3(%rip),%xmm2        # 5790 <_sk_callback_sse2+0xb70>
+  DB  15,89,21,249,36,0,0                 ; mulps         0x24f9(%rip),%xmm2        # 5790 <_sk_callback_sse2+0xb76>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,250,36,0,0                 ; movaps        0x24fa(%rip),%xmm3        # 57a0 <_sk_callback_sse2+0xb80>
+  DB  15,40,29,0,37,0,0                   ; movaps        0x2500(%rip),%xmm3        # 57a0 <_sk_callback_sse2+0xb86>
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_store_565_sse2
 _sk_store_565_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,251,36,0,0               ; movaps        0x24fb(%rip),%xmm8        # 57b0 <_sk_callback_sse2+0xb90>
+  DB  68,15,40,5,1,37,0,0                 ; movaps        0x2501(%rip),%xmm8        # 57b0 <_sk_callback_sse2+0xb96>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
   DB  102,65,15,114,241,11                ; pslld         $0xb,%xmm9
-  DB  68,15,40,21,240,36,0,0              ; movaps        0x24f0(%rip),%xmm10        # 57c0 <_sk_callback_sse2+0xba0>
+  DB  68,15,40,21,246,36,0,0              ; movaps        0x24f6(%rip),%xmm10        # 57c0 <_sk_callback_sse2+0xba6>
   DB  68,15,89,209                        ; mulps         %xmm1,%xmm10
   DB  102,69,15,91,210                    ; cvtps2dq      %xmm10,%xmm10
   DB  102,65,15,114,242,5                 ; pslld         $0x5,%xmm10
@@ -21152,21 +21150,21 @@
   DB  243,15,126,28,120                   ; movq          (%rax,%rdi,2),%xmm3
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  102,15,97,216                       ; punpcklwd     %xmm0,%xmm3
-  DB  102,15,111,5,169,36,0,0             ; movdqa        0x24a9(%rip),%xmm0        # 57d0 <_sk_callback_sse2+0xbb0>
+  DB  102,15,111,5,175,36,0,0             ; movdqa        0x24af(%rip),%xmm0        # 57d0 <_sk_callback_sse2+0xbb6>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,171,36,0,0                  ; mulps         0x24ab(%rip),%xmm0        # 57e0 <_sk_callback_sse2+0xbc0>
-  DB  102,15,111,13,179,36,0,0            ; movdqa        0x24b3(%rip),%xmm1        # 57f0 <_sk_callback_sse2+0xbd0>
+  DB  15,89,5,177,36,0,0                  ; mulps         0x24b1(%rip),%xmm0        # 57e0 <_sk_callback_sse2+0xbc6>
+  DB  102,15,111,13,185,36,0,0            ; movdqa        0x24b9(%rip),%xmm1        # 57f0 <_sk_callback_sse2+0xbd6>
   DB  102,15,219,203                      ; pand          %xmm3,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,181,36,0,0                 ; mulps         0x24b5(%rip),%xmm1        # 5800 <_sk_callback_sse2+0xbe0>
-  DB  102,15,111,21,189,36,0,0            ; movdqa        0x24bd(%rip),%xmm2        # 5810 <_sk_callback_sse2+0xbf0>
+  DB  15,89,13,187,36,0,0                 ; mulps         0x24bb(%rip),%xmm1        # 5800 <_sk_callback_sse2+0xbe6>
+  DB  102,15,111,21,195,36,0,0            ; movdqa        0x24c3(%rip),%xmm2        # 5810 <_sk_callback_sse2+0xbf6>
   DB  102,15,219,211                      ; pand          %xmm3,%xmm2
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,191,36,0,0                 ; mulps         0x24bf(%rip),%xmm2        # 5820 <_sk_callback_sse2+0xc00>
-  DB  102,15,219,29,199,36,0,0            ; pand          0x24c7(%rip),%xmm3        # 5830 <_sk_callback_sse2+0xc10>
+  DB  15,89,21,197,36,0,0                 ; mulps         0x24c5(%rip),%xmm2        # 5820 <_sk_callback_sse2+0xc06>
+  DB  102,15,219,29,205,36,0,0            ; pand          0x24cd(%rip),%xmm3        # 5830 <_sk_callback_sse2+0xc16>
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,205,36,0,0                 ; mulps         0x24cd(%rip),%xmm3        # 5840 <_sk_callback_sse2+0xc20>
+  DB  15,89,29,211,36,0,0                 ; mulps         0x24d3(%rip),%xmm3        # 5840 <_sk_callback_sse2+0xc26>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
@@ -21200,21 +21198,21 @@
   DB  102,15,196,216,3                    ; pinsrw        $0x3,%eax,%xmm3
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  102,15,97,216                       ; punpcklwd     %xmm0,%xmm3
-  DB  102,15,111,5,84,36,0,0              ; movdqa        0x2454(%rip),%xmm0        # 5850 <_sk_callback_sse2+0xc30>
+  DB  102,15,111,5,90,36,0,0              ; movdqa        0x245a(%rip),%xmm0        # 5850 <_sk_callback_sse2+0xc36>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,86,36,0,0                   ; mulps         0x2456(%rip),%xmm0        # 5860 <_sk_callback_sse2+0xc40>
-  DB  102,15,111,13,94,36,0,0             ; movdqa        0x245e(%rip),%xmm1        # 5870 <_sk_callback_sse2+0xc50>
+  DB  15,89,5,92,36,0,0                   ; mulps         0x245c(%rip),%xmm0        # 5860 <_sk_callback_sse2+0xc46>
+  DB  102,15,111,13,100,36,0,0            ; movdqa        0x2464(%rip),%xmm1        # 5870 <_sk_callback_sse2+0xc56>
   DB  102,15,219,203                      ; pand          %xmm3,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,96,36,0,0                  ; mulps         0x2460(%rip),%xmm1        # 5880 <_sk_callback_sse2+0xc60>
-  DB  102,15,111,21,104,36,0,0            ; movdqa        0x2468(%rip),%xmm2        # 5890 <_sk_callback_sse2+0xc70>
+  DB  15,89,13,102,36,0,0                 ; mulps         0x2466(%rip),%xmm1        # 5880 <_sk_callback_sse2+0xc66>
+  DB  102,15,111,21,110,36,0,0            ; movdqa        0x246e(%rip),%xmm2        # 5890 <_sk_callback_sse2+0xc76>
   DB  102,15,219,211                      ; pand          %xmm3,%xmm2
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,106,36,0,0                 ; mulps         0x246a(%rip),%xmm2        # 58a0 <_sk_callback_sse2+0xc80>
-  DB  102,15,219,29,114,36,0,0            ; pand          0x2472(%rip),%xmm3        # 58b0 <_sk_callback_sse2+0xc90>
+  DB  15,89,21,112,36,0,0                 ; mulps         0x2470(%rip),%xmm2        # 58a0 <_sk_callback_sse2+0xc86>
+  DB  102,15,219,29,120,36,0,0            ; pand          0x2478(%rip),%xmm3        # 58b0 <_sk_callback_sse2+0xc96>
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,120,36,0,0                 ; mulps         0x2478(%rip),%xmm3        # 58c0 <_sk_callback_sse2+0xca0>
+  DB  15,89,29,126,36,0,0                 ; mulps         0x247e(%rip),%xmm3        # 58c0 <_sk_callback_sse2+0xca6>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
@@ -21222,7 +21220,7 @@
 _sk_store_4444_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,119,36,0,0               ; movaps        0x2477(%rip),%xmm8        # 58d0 <_sk_callback_sse2+0xcb0>
+  DB  68,15,40,5,125,36,0,0               ; movaps        0x247d(%rip),%xmm8        # 58d0 <_sk_callback_sse2+0xcb6>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -21252,11 +21250,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  68,15,16,12,184                     ; movups        (%rax,%rdi,4),%xmm9
-  DB  15,40,21,10,36,0,0                  ; movaps        0x240a(%rip),%xmm2        # 58e0 <_sk_callback_sse2+0xcc0>
+  DB  15,40,21,16,36,0,0                  ; movaps        0x2410(%rip),%xmm2        # 58e0 <_sk_callback_sse2+0xcc6>
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  15,84,194                           ; andps         %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,8,36,0,0                 ; movaps        0x2408(%rip),%xmm8        # 58f0 <_sk_callback_sse2+0xcd0>
+  DB  68,15,40,5,14,36,0,0                ; movaps        0x240e(%rip),%xmm8        # 58f0 <_sk_callback_sse2+0xcd6>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  65,15,40,201                        ; movaps        %xmm9,%xmm1
   DB  102,15,114,209,8                    ; psrld         $0x8,%xmm1
@@ -21303,11 +21301,11 @@
   DB  102,67,15,110,12,129                ; movd          (%r9,%r8,4),%xmm1
   DB  102,68,15,98,201                    ; punpckldq     %xmm1,%xmm9
   DB  102,68,15,98,200                    ; punpckldq     %xmm0,%xmm9
-  DB  102,15,111,21,89,35,0,0             ; movdqa        0x2359(%rip),%xmm2        # 5900 <_sk_callback_sse2+0xce0>
+  DB  102,15,111,21,95,35,0,0             ; movdqa        0x235f(%rip),%xmm2        # 5900 <_sk_callback_sse2+0xce6>
   DB  102,65,15,111,193                   ; movdqa        %xmm9,%xmm0
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,85,35,0,0                ; movaps        0x2355(%rip),%xmm8        # 5910 <_sk_callback_sse2+0xcf0>
+  DB  68,15,40,5,91,35,0,0                ; movaps        0x235b(%rip),%xmm8        # 5910 <_sk_callback_sse2+0xcf6>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,114,209,8                    ; psrld         $0x8,%xmm1
@@ -21329,7 +21327,7 @@
 _sk_store_8888_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,24,35,0,0                ; movaps        0x2318(%rip),%xmm8        # 5920 <_sk_callback_sse2+0xd00>
+  DB  68,15,40,5,30,35,0,0                ; movaps        0x231e(%rip),%xmm8        # 5920 <_sk_callback_sse2+0xd06>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -21366,7 +21364,7 @@
   DB  102,69,15,239,210                   ; pxor          %xmm10,%xmm10
   DB  102,65,15,111,206                   ; movdqa        %xmm14,%xmm1
   DB  102,65,15,97,202                    ; punpcklwd     %xmm10,%xmm1
-  DB  102,68,15,111,13,136,34,0,0         ; movdqa        0x2288(%rip),%xmm9        # 5930 <_sk_callback_sse2+0xd10>
+  DB  102,68,15,111,13,142,34,0,0         ; movdqa        0x228e(%rip),%xmm9        # 5930 <_sk_callback_sse2+0xd16>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,193                   ; pand          %xmm9,%xmm0
   DB  102,15,239,200                      ; pxor          %xmm0,%xmm1
@@ -21374,11 +21372,11 @@
   DB  102,68,15,111,233                   ; movdqa        %xmm1,%xmm13
   DB  102,65,15,114,245,13                ; pslld         $0xd,%xmm13
   DB  102,68,15,235,232                   ; por           %xmm0,%xmm13
-  DB  102,68,15,111,29,109,34,0,0         ; movdqa        0x226d(%rip),%xmm11        # 5940 <_sk_callback_sse2+0xd20>
+  DB  102,68,15,111,29,115,34,0,0         ; movdqa        0x2273(%rip),%xmm11        # 5940 <_sk_callback_sse2+0xd26>
   DB  102,69,15,254,235                   ; paddd         %xmm11,%xmm13
-  DB  102,68,15,111,37,111,34,0,0         ; movdqa        0x226f(%rip),%xmm12        # 5950 <_sk_callback_sse2+0xd30>
+  DB  102,68,15,111,37,117,34,0,0         ; movdqa        0x2275(%rip),%xmm12        # 5950 <_sk_callback_sse2+0xd36>
   DB  102,65,15,239,204                   ; pxor          %xmm12,%xmm1
-  DB  102,15,111,29,114,34,0,0            ; movdqa        0x2272(%rip),%xmm3        # 5960 <_sk_callback_sse2+0xd40>
+  DB  102,15,111,29,120,34,0,0            ; movdqa        0x2278(%rip),%xmm3        # 5960 <_sk_callback_sse2+0xd46>
   DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
   DB  102,15,102,193                      ; pcmpgtd       %xmm1,%xmm0
   DB  102,65,15,223,197                   ; pandn         %xmm13,%xmm0
@@ -21462,7 +21460,7 @@
   DB  102,69,15,239,210                   ; pxor          %xmm10,%xmm10
   DB  102,65,15,111,206                   ; movdqa        %xmm14,%xmm1
   DB  102,65,15,97,202                    ; punpcklwd     %xmm10,%xmm1
-  DB  102,68,15,111,13,0,33,0,0           ; movdqa        0x2100(%rip),%xmm9        # 5970 <_sk_callback_sse2+0xd50>
+  DB  102,68,15,111,13,6,33,0,0           ; movdqa        0x2106(%rip),%xmm9        # 5970 <_sk_callback_sse2+0xd56>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,193                   ; pand          %xmm9,%xmm0
   DB  102,15,239,200                      ; pxor          %xmm0,%xmm1
@@ -21470,11 +21468,11 @@
   DB  102,68,15,111,233                   ; movdqa        %xmm1,%xmm13
   DB  102,65,15,114,245,13                ; pslld         $0xd,%xmm13
   DB  102,68,15,235,232                   ; por           %xmm0,%xmm13
-  DB  102,68,15,111,29,229,32,0,0         ; movdqa        0x20e5(%rip),%xmm11        # 5980 <_sk_callback_sse2+0xd60>
+  DB  102,68,15,111,29,235,32,0,0         ; movdqa        0x20eb(%rip),%xmm11        # 5980 <_sk_callback_sse2+0xd66>
   DB  102,69,15,254,235                   ; paddd         %xmm11,%xmm13
-  DB  102,68,15,111,37,231,32,0,0         ; movdqa        0x20e7(%rip),%xmm12        # 5990 <_sk_callback_sse2+0xd70>
+  DB  102,68,15,111,37,237,32,0,0         ; movdqa        0x20ed(%rip),%xmm12        # 5990 <_sk_callback_sse2+0xd76>
   DB  102,65,15,239,204                   ; pxor          %xmm12,%xmm1
-  DB  102,15,111,29,234,32,0,0            ; movdqa        0x20ea(%rip),%xmm3        # 59a0 <_sk_callback_sse2+0xd80>
+  DB  102,15,111,29,240,32,0,0            ; movdqa        0x20f0(%rip),%xmm3        # 59a0 <_sk_callback_sse2+0xd86>
   DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
   DB  102,15,102,193                      ; pcmpgtd       %xmm1,%xmm0
   DB  102,65,15,223,197                   ; pandn         %xmm13,%xmm0
@@ -21525,17 +21523,17 @@
 _sk_store_f16_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  102,68,15,111,21,18,32,0,0          ; movdqa        0x2012(%rip),%xmm10        # 59b0 <_sk_callback_sse2+0xd90>
+  DB  102,68,15,111,21,24,32,0,0          ; movdqa        0x2018(%rip),%xmm10        # 59b0 <_sk_callback_sse2+0xd96>
   DB  102,68,15,111,224                   ; movdqa        %xmm0,%xmm12
   DB  102,68,15,111,232                   ; movdqa        %xmm0,%xmm13
   DB  102,69,15,219,234                   ; pand          %xmm10,%xmm13
   DB  102,69,15,239,229                   ; pxor          %xmm13,%xmm12
-  DB  102,68,15,111,13,5,32,0,0           ; movdqa        0x2005(%rip),%xmm9        # 59c0 <_sk_callback_sse2+0xda0>
+  DB  102,68,15,111,13,11,32,0,0          ; movdqa        0x200b(%rip),%xmm9        # 59c0 <_sk_callback_sse2+0xda6>
   DB  102,65,15,114,213,16                ; psrld         $0x10,%xmm13
   DB  102,69,15,111,193                   ; movdqa        %xmm9,%xmm8
   DB  102,69,15,102,196                   ; pcmpgtd       %xmm12,%xmm8
   DB  102,65,15,114,212,13                ; psrld         $0xd,%xmm12
-  DB  102,68,15,111,29,246,31,0,0         ; movdqa        0x1ff6(%rip),%xmm11        # 59d0 <_sk_callback_sse2+0xdb0>
+  DB  102,68,15,111,29,252,31,0,0         ; movdqa        0x1ffc(%rip),%xmm11        # 59d0 <_sk_callback_sse2+0xdb6>
   DB  102,69,15,235,235                   ; por           %xmm11,%xmm13
   DB  102,69,15,254,236                   ; paddd         %xmm12,%xmm13
   DB  102,65,15,114,245,16                ; pslld         $0x10,%xmm13
@@ -21612,7 +21610,7 @@
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
   DB  102,65,15,97,201                    ; punpcklwd     %xmm9,%xmm1
   DB  15,91,193                           ; cvtdq2ps      %xmm1,%xmm0
-  DB  68,15,40,5,148,30,0,0               ; movaps        0x1e94(%rip),%xmm8        # 59e0 <_sk_callback_sse2+0xdc0>
+  DB  68,15,40,5,154,30,0,0               ; movaps        0x1e9a(%rip),%xmm8        # 59e0 <_sk_callback_sse2+0xdc6>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
@@ -21663,7 +21661,7 @@
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  102,65,15,97,192                    ; punpcklwd     %xmm8,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,13,208,29,0,0              ; movaps        0x1dd0(%rip),%xmm9        # 59f0 <_sk_callback_sse2+0xdd0>
+  DB  68,15,40,13,214,29,0,0              ; movaps        0x1dd6(%rip),%xmm9        # 59f0 <_sk_callback_sse2+0xdd6>
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
@@ -21680,14 +21678,14 @@
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,209                        ; mulps         %xmm9,%xmm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,151,29,0,0                 ; movaps        0x1d97(%rip),%xmm3        # 5a00 <_sk_callback_sse2+0xde0>
+  DB  15,40,29,157,29,0,0                 ; movaps        0x1d9d(%rip),%xmm3        # 5a00 <_sk_callback_sse2+0xde6>
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_store_u16_be_sse2
 _sk_store_u16_be_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,13,152,29,0,0              ; movaps        0x1d98(%rip),%xmm9        # 5a10 <_sk_callback_sse2+0xdf0>
+  DB  68,15,40,13,158,29,0,0              ; movaps        0x1d9e(%rip),%xmm9        # 5a10 <_sk_callback_sse2+0xdf6>
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
@@ -21823,7 +21821,7 @@
   DB  243,69,15,91,209                    ; cvttps2dq     %xmm9,%xmm10
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
   DB  69,15,194,202,1                     ; cmpltps       %xmm10,%xmm9
-  DB  68,15,84,13,152,27,0,0              ; andps         0x1b98(%rip),%xmm9        # 5a20 <_sk_callback_sse2+0xe00>
+  DB  68,15,84,13,158,27,0,0              ; andps         0x1b9e(%rip),%xmm9        # 5a20 <_sk_callback_sse2+0xe06>
   DB  69,15,92,209                        ; subps         %xmm9,%xmm10
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
   DB  65,15,92,194                        ; subps         %xmm10,%xmm0
@@ -21841,7 +21839,7 @@
   DB  243,69,15,91,209                    ; cvttps2dq     %xmm9,%xmm10
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
   DB  69,15,194,202,1                     ; cmpltps       %xmm10,%xmm9
-  DB  68,15,84,13,106,27,0,0              ; andps         0x1b6a(%rip),%xmm9        # 5a30 <_sk_callback_sse2+0xe10>
+  DB  68,15,84,13,112,27,0,0              ; andps         0x1b70(%rip),%xmm9        # 5a30 <_sk_callback_sse2+0xe16>
   DB  69,15,92,209                        ; subps         %xmm9,%xmm10
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
   DB  65,15,92,202                        ; subps         %xmm10,%xmm1
@@ -21863,7 +21861,7 @@
   DB  243,69,15,91,218                    ; cvttps2dq     %xmm10,%xmm11
   DB  69,15,91,219                        ; cvtdq2ps      %xmm11,%xmm11
   DB  69,15,194,211,1                     ; cmpltps       %xmm11,%xmm10
-  DB  68,15,84,21,42,27,0,0               ; andps         0x1b2a(%rip),%xmm10        # 5a40 <_sk_callback_sse2+0xe20>
+  DB  68,15,84,21,48,27,0,0               ; andps         0x1b30(%rip),%xmm10        # 5a40 <_sk_callback_sse2+0xe26>
   DB  69,15,87,228                        ; xorps         %xmm12,%xmm12
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
   DB  69,15,89,216                        ; mulps         %xmm8,%xmm11
@@ -21889,7 +21887,7 @@
   DB  243,69,15,91,218                    ; cvttps2dq     %xmm10,%xmm11
   DB  69,15,91,219                        ; cvtdq2ps      %xmm11,%xmm11
   DB  69,15,194,211,1                     ; cmpltps       %xmm11,%xmm10
-  DB  68,15,84,21,218,26,0,0              ; andps         0x1ada(%rip),%xmm10        # 5a50 <_sk_callback_sse2+0xe30>
+  DB  68,15,84,21,224,26,0,0              ; andps         0x1ae0(%rip),%xmm10        # 5a50 <_sk_callback_sse2+0xe36>
   DB  69,15,87,228                        ; xorps         %xmm12,%xmm12
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
   DB  69,15,89,216                        ; mulps         %xmm8,%xmm11
@@ -21904,10 +21902,10 @@
 PUBLIC _sk_luminance_to_alpha_sse2
 _sk_luminance_to_alpha_sse2 LABEL PROC
   DB  15,40,218                           ; movaps        %xmm2,%xmm3
-  DB  15,89,5,188,26,0,0                  ; mulps         0x1abc(%rip),%xmm0        # 5a60 <_sk_callback_sse2+0xe40>
-  DB  15,89,13,197,26,0,0                 ; mulps         0x1ac5(%rip),%xmm1        # 5a70 <_sk_callback_sse2+0xe50>
+  DB  15,89,5,194,26,0,0                  ; mulps         0x1ac2(%rip),%xmm0        # 5a60 <_sk_callback_sse2+0xe46>
+  DB  15,89,13,203,26,0,0                 ; mulps         0x1acb(%rip),%xmm1        # 5a70 <_sk_callback_sse2+0xe56>
   DB  15,88,200                           ; addps         %xmm0,%xmm1
-  DB  15,89,29,203,26,0,0                 ; mulps         0x1acb(%rip),%xmm3        # 5a80 <_sk_callback_sse2+0xe60>
+  DB  15,89,29,209,26,0,0                 ; mulps         0x1ad1(%rip),%xmm3        # 5a80 <_sk_callback_sse2+0xe66>
   DB  15,88,217                           ; addps         %xmm1,%xmm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
@@ -22171,9 +22169,9 @@
   DB  72,139,8                            ; mov           (%rax),%rcx
   DB  76,139,88,8                         ; mov           0x8(%rax),%r11
   DB  72,255,201                          ; dec           %rcx
-  DB  120,7                               ; js            43ee <_sk_evenly_spaced_gradient_sse2+0x15>
+  DB  120,7                               ; js            43e8 <_sk_evenly_spaced_gradient_sse2+0x15>
   DB  243,72,15,42,201                    ; cvtsi2ss      %rcx,%xmm1
-  DB  235,21                              ; jmp           4403 <_sk_evenly_spaced_gradient_sse2+0x2a>
+  DB  235,21                              ; jmp           43fd <_sk_evenly_spaced_gradient_sse2+0x2a>
   DB  73,137,200                          ; mov           %rcx,%r8
   DB  73,209,232                          ; shr           %r8
   DB  131,225,1                           ; and           $0x1,%ecx
@@ -22271,12 +22269,12 @@
   DB  76,139,0                            ; mov           (%rax),%r8
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,2                        ; cmp           $0x2,%r8
-  DB  114,50                              ; jb            45c6 <_sk_gradient_sse2+0x41>
+  DB  114,50                              ; jb            45c0 <_sk_gradient_sse2+0x41>
   DB  72,139,72,72                        ; mov           0x48(%rax),%rcx
   DB  73,255,200                          ; dec           %r8
   DB  72,131,193,4                        ; add           $0x4,%rcx
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  15,40,21,230,20,0,0                 ; movaps        0x14e6(%rip),%xmm2        # 5a90 <_sk_callback_sse2+0xe70>
+  DB  15,40,21,236,20,0,0                 ; movaps        0x14ec(%rip),%xmm2        # 5a90 <_sk_callback_sse2+0xe76>
   DB  243,15,16,25                        ; movss         (%rcx),%xmm3
   DB  15,198,219,0                        ; shufps        $0x0,%xmm3,%xmm3
   DB  15,194,216,2                        ; cmpleps       %xmm0,%xmm3
@@ -22284,7 +22282,7 @@
   DB  102,15,254,203                      ; paddd         %xmm3,%xmm1
   DB  72,131,193,4                        ; add           $0x4,%rcx
   DB  73,255,200                          ; dec           %r8
-  DB  117,228                             ; jne           45aa <_sk_gradient_sse2+0x25>
+  DB  117,228                             ; jne           45a4 <_sk_gradient_sse2+0x25>
   DB  65,86                               ; push          %r14
   DB  83                                  ; push          %rbx
   DB  102,15,112,209,78                   ; pshufd        $0x4e,%xmm1,%xmm2
@@ -22420,29 +22418,29 @@
   DB  69,15,94,220                        ; divps         %xmm12,%xmm11
   DB  69,15,40,227                        ; movaps        %xmm11,%xmm12
   DB  69,15,89,228                        ; mulps         %xmm12,%xmm12
-  DB  68,15,40,45,168,18,0,0              ; movaps        0x12a8(%rip),%xmm13        # 5aa0 <_sk_callback_sse2+0xe80>
+  DB  68,15,40,45,174,18,0,0              ; movaps        0x12ae(%rip),%xmm13        # 5aa0 <_sk_callback_sse2+0xe86>
   DB  69,15,89,236                        ; mulps         %xmm12,%xmm13
-  DB  68,15,88,45,172,18,0,0              ; addps         0x12ac(%rip),%xmm13        # 5ab0 <_sk_callback_sse2+0xe90>
+  DB  68,15,88,45,178,18,0,0              ; addps         0x12b2(%rip),%xmm13        # 5ab0 <_sk_callback_sse2+0xe96>
   DB  69,15,89,236                        ; mulps         %xmm12,%xmm13
-  DB  68,15,88,45,176,18,0,0              ; addps         0x12b0(%rip),%xmm13        # 5ac0 <_sk_callback_sse2+0xea0>
+  DB  68,15,88,45,182,18,0,0              ; addps         0x12b6(%rip),%xmm13        # 5ac0 <_sk_callback_sse2+0xea6>
   DB  69,15,89,236                        ; mulps         %xmm12,%xmm13
-  DB  68,15,88,45,180,18,0,0              ; addps         0x12b4(%rip),%xmm13        # 5ad0 <_sk_callback_sse2+0xeb0>
+  DB  68,15,88,45,186,18,0,0              ; addps         0x12ba(%rip),%xmm13        # 5ad0 <_sk_callback_sse2+0xeb6>
   DB  69,15,89,235                        ; mulps         %xmm11,%xmm13
   DB  69,15,194,202,1                     ; cmpltps       %xmm10,%xmm9
-  DB  68,15,40,21,179,18,0,0              ; movaps        0x12b3(%rip),%xmm10        # 5ae0 <_sk_callback_sse2+0xec0>
+  DB  68,15,40,21,185,18,0,0              ; movaps        0x12b9(%rip),%xmm10        # 5ae0 <_sk_callback_sse2+0xec6>
   DB  69,15,92,213                        ; subps         %xmm13,%xmm10
   DB  69,15,84,209                        ; andps         %xmm9,%xmm10
   DB  69,15,85,205                        ; andnps        %xmm13,%xmm9
   DB  69,15,86,202                        ; orps          %xmm10,%xmm9
   DB  68,15,194,192,1                     ; cmpltps       %xmm0,%xmm8
-  DB  68,15,40,21,166,18,0,0              ; movaps        0x12a6(%rip),%xmm10        # 5af0 <_sk_callback_sse2+0xed0>
+  DB  68,15,40,21,172,18,0,0              ; movaps        0x12ac(%rip),%xmm10        # 5af0 <_sk_callback_sse2+0xed6>
   DB  69,15,92,209                        ; subps         %xmm9,%xmm10
   DB  69,15,84,208                        ; andps         %xmm8,%xmm10
   DB  69,15,85,193                        ; andnps        %xmm9,%xmm8
   DB  69,15,86,194                        ; orps          %xmm10,%xmm8
   DB  68,15,40,201                        ; movaps        %xmm1,%xmm9
   DB  68,15,194,200,1                     ; cmpltps       %xmm0,%xmm9
-  DB  68,15,40,21,149,18,0,0              ; movaps        0x1295(%rip),%xmm10        # 5b00 <_sk_callback_sse2+0xee0>
+  DB  68,15,40,21,155,18,0,0              ; movaps        0x129b(%rip),%xmm10        # 5b00 <_sk_callback_sse2+0xee6>
   DB  69,15,92,208                        ; subps         %xmm8,%xmm10
   DB  69,15,84,209                        ; andps         %xmm9,%xmm10
   DB  69,15,85,200                        ; andnps        %xmm8,%xmm9
@@ -22465,7 +22463,7 @@
 PUBLIC _sk_save_xy_sse2
 _sk_save_xy_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,103,18,0,0               ; movaps        0x1267(%rip),%xmm8        # 5b10 <_sk_callback_sse2+0xef0>
+  DB  68,15,40,5,109,18,0,0               ; movaps        0x126d(%rip),%xmm8        # 5b10 <_sk_callback_sse2+0xef6>
   DB  15,17,0                             ; movups        %xmm0,(%rax)
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,88,200                        ; addps         %xmm8,%xmm9
@@ -22473,7 +22471,7 @@
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
   DB  69,15,40,217                        ; movaps        %xmm9,%xmm11
   DB  69,15,194,218,1                     ; cmpltps       %xmm10,%xmm11
-  DB  68,15,40,37,82,18,0,0               ; movaps        0x1252(%rip),%xmm12        # 5b20 <_sk_callback_sse2+0xf00>
+  DB  68,15,40,37,88,18,0,0               ; movaps        0x1258(%rip),%xmm12        # 5b20 <_sk_callback_sse2+0xf06>
   DB  69,15,84,220                        ; andps         %xmm12,%xmm11
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
   DB  69,15,92,202                        ; subps         %xmm10,%xmm9
@@ -22516,8 +22514,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,203,17,0,0                  ; addps         0x11cb(%rip),%xmm0        # 5b30 <_sk_callback_sse2+0xf10>
-  DB  68,15,40,13,211,17,0,0              ; movaps        0x11d3(%rip),%xmm9        # 5b40 <_sk_callback_sse2+0xf20>
+  DB  15,88,5,209,17,0,0                  ; addps         0x11d1(%rip),%xmm0        # 5b30 <_sk_callback_sse2+0xf16>
+  DB  68,15,40,13,217,17,0,0              ; movaps        0x11d9(%rip),%xmm9        # 5b40 <_sk_callback_sse2+0xf26>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  68,15,17,136,128,0,0,0              ; movups        %xmm9,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -22528,7 +22526,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,194,17,0,0                  ; addps         0x11c2(%rip),%xmm0        # 5b50 <_sk_callback_sse2+0xf30>
+  DB  15,88,5,200,17,0,0                  ; addps         0x11c8(%rip),%xmm0        # 5b50 <_sk_callback_sse2+0xf36>
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -22538,8 +22536,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,180,17,0,0                 ; addps         0x11b4(%rip),%xmm1        # 5b60 <_sk_callback_sse2+0xf40>
-  DB  68,15,40,13,188,17,0,0              ; movaps        0x11bc(%rip),%xmm9        # 5b70 <_sk_callback_sse2+0xf50>
+  DB  15,88,13,186,17,0,0                 ; addps         0x11ba(%rip),%xmm1        # 5b60 <_sk_callback_sse2+0xf46>
+  DB  68,15,40,13,194,17,0,0              ; movaps        0x11c2(%rip),%xmm9        # 5b70 <_sk_callback_sse2+0xf56>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  68,15,17,136,160,0,0,0              ; movups        %xmm9,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -22550,7 +22548,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,170,17,0,0                 ; addps         0x11aa(%rip),%xmm1        # 5b80 <_sk_callback_sse2+0xf60>
+  DB  15,88,13,176,17,0,0                 ; addps         0x11b0(%rip),%xmm1        # 5b80 <_sk_callback_sse2+0xf66>
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -22560,13 +22558,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,157,17,0,0                  ; addps         0x119d(%rip),%xmm0        # 5b90 <_sk_callback_sse2+0xf70>
-  DB  68,15,40,13,165,17,0,0              ; movaps        0x11a5(%rip),%xmm9        # 5ba0 <_sk_callback_sse2+0xf80>
+  DB  15,88,5,163,17,0,0                  ; addps         0x11a3(%rip),%xmm0        # 5b90 <_sk_callback_sse2+0xf76>
+  DB  68,15,40,13,171,17,0,0              ; movaps        0x11ab(%rip),%xmm9        # 5ba0 <_sk_callback_sse2+0xf86>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  69,15,89,192                        ; mulps         %xmm8,%xmm8
-  DB  68,15,89,13,161,17,0,0              ; mulps         0x11a1(%rip),%xmm9        # 5bb0 <_sk_callback_sse2+0xf90>
-  DB  68,15,88,13,169,17,0,0              ; addps         0x11a9(%rip),%xmm9        # 5bc0 <_sk_callback_sse2+0xfa0>
+  DB  68,15,89,13,167,17,0,0              ; mulps         0x11a7(%rip),%xmm9        # 5bb0 <_sk_callback_sse2+0xf96>
+  DB  68,15,88,13,175,17,0,0              ; addps         0x11af(%rip),%xmm9        # 5bc0 <_sk_callback_sse2+0xfa6>
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  68,15,17,136,128,0,0,0              ; movups        %xmm9,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -22577,16 +22575,16 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,152,17,0,0                  ; addps         0x1198(%rip),%xmm0        # 5bd0 <_sk_callback_sse2+0xfb0>
-  DB  68,15,40,13,160,17,0,0              ; movaps        0x11a0(%rip),%xmm9        # 5be0 <_sk_callback_sse2+0xfc0>
+  DB  15,88,5,158,17,0,0                  ; addps         0x119e(%rip),%xmm0        # 5bd0 <_sk_callback_sse2+0xfb6>
+  DB  68,15,40,13,166,17,0,0              ; movaps        0x11a6(%rip),%xmm9        # 5be0 <_sk_callback_sse2+0xfc6>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
-  DB  68,15,40,5,164,17,0,0               ; movaps        0x11a4(%rip),%xmm8        # 5bf0 <_sk_callback_sse2+0xfd0>
+  DB  68,15,40,5,170,17,0,0               ; movaps        0x11aa(%rip),%xmm8        # 5bf0 <_sk_callback_sse2+0xfd6>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,168,17,0,0               ; addps         0x11a8(%rip),%xmm8        # 5c00 <_sk_callback_sse2+0xfe0>
+  DB  68,15,88,5,174,17,0,0               ; addps         0x11ae(%rip),%xmm8        # 5c00 <_sk_callback_sse2+0xfe6>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,172,17,0,0               ; addps         0x11ac(%rip),%xmm8        # 5c10 <_sk_callback_sse2+0xff0>
+  DB  68,15,88,5,178,17,0,0               ; addps         0x11b2(%rip),%xmm8        # 5c10 <_sk_callback_sse2+0xff6>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,176,17,0,0               ; addps         0x11b0(%rip),%xmm8        # 5c20 <_sk_callback_sse2+0x1000>
+  DB  68,15,88,5,182,17,0,0               ; addps         0x11b6(%rip),%xmm8        # 5c20 <_sk_callback_sse2+0x1006>
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -22594,17 +22592,17 @@
 PUBLIC _sk_bicubic_p1x_sse2
 _sk_bicubic_p1x_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,170,17,0,0               ; movaps        0x11aa(%rip),%xmm8        # 5c30 <_sk_callback_sse2+0x1010>
+  DB  68,15,40,5,176,17,0,0               ; movaps        0x11b0(%rip),%xmm8        # 5c30 <_sk_callback_sse2+0x1016>
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,72,64                      ; movups        0x40(%rax),%xmm9
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
-  DB  68,15,40,21,166,17,0,0              ; movaps        0x11a6(%rip),%xmm10        # 5c40 <_sk_callback_sse2+0x1020>
+  DB  68,15,40,21,172,17,0,0              ; movaps        0x11ac(%rip),%xmm10        # 5c40 <_sk_callback_sse2+0x1026>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,170,17,0,0              ; addps         0x11aa(%rip),%xmm10        # 5c50 <_sk_callback_sse2+0x1030>
+  DB  68,15,88,21,176,17,0,0              ; addps         0x11b0(%rip),%xmm10        # 5c50 <_sk_callback_sse2+0x1036>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,166,17,0,0              ; addps         0x11a6(%rip),%xmm10        # 5c60 <_sk_callback_sse2+0x1040>
+  DB  68,15,88,21,172,17,0,0              ; addps         0x11ac(%rip),%xmm10        # 5c60 <_sk_callback_sse2+0x1046>
   DB  68,15,17,144,128,0,0,0              ; movups        %xmm10,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -22614,11 +22612,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,153,17,0,0                  ; addps         0x1199(%rip),%xmm0        # 5c70 <_sk_callback_sse2+0x1050>
+  DB  15,88,5,159,17,0,0                  ; addps         0x119f(%rip),%xmm0        # 5c70 <_sk_callback_sse2+0x1056>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  69,15,89,201                        ; mulps         %xmm9,%xmm9
-  DB  68,15,89,5,153,17,0,0               ; mulps         0x1199(%rip),%xmm8        # 5c80 <_sk_callback_sse2+0x1060>
-  DB  68,15,88,5,161,17,0,0               ; addps         0x11a1(%rip),%xmm8        # 5c90 <_sk_callback_sse2+0x1070>
+  DB  68,15,89,5,159,17,0,0               ; mulps         0x119f(%rip),%xmm8        # 5c80 <_sk_callback_sse2+0x1066>
+  DB  68,15,88,5,167,17,0,0               ; addps         0x11a7(%rip),%xmm8        # 5c90 <_sk_callback_sse2+0x1076>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -22629,13 +22627,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,143,17,0,0                 ; addps         0x118f(%rip),%xmm1        # 5ca0 <_sk_callback_sse2+0x1080>
-  DB  68,15,40,13,151,17,0,0              ; movaps        0x1197(%rip),%xmm9        # 5cb0 <_sk_callback_sse2+0x1090>
+  DB  15,88,13,149,17,0,0                 ; addps         0x1195(%rip),%xmm1        # 5ca0 <_sk_callback_sse2+0x1086>
+  DB  68,15,40,13,157,17,0,0              ; movaps        0x119d(%rip),%xmm9        # 5cb0 <_sk_callback_sse2+0x1096>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  69,15,89,192                        ; mulps         %xmm8,%xmm8
-  DB  68,15,89,13,147,17,0,0              ; mulps         0x1193(%rip),%xmm9        # 5cc0 <_sk_callback_sse2+0x10a0>
-  DB  68,15,88,13,155,17,0,0              ; addps         0x119b(%rip),%xmm9        # 5cd0 <_sk_callback_sse2+0x10b0>
+  DB  68,15,89,13,153,17,0,0              ; mulps         0x1199(%rip),%xmm9        # 5cc0 <_sk_callback_sse2+0x10a6>
+  DB  68,15,88,13,161,17,0,0              ; addps         0x11a1(%rip),%xmm9        # 5cd0 <_sk_callback_sse2+0x10b6>
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  68,15,17,136,160,0,0,0              ; movups        %xmm9,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -22646,16 +22644,16 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,137,17,0,0                 ; addps         0x1189(%rip),%xmm1        # 5ce0 <_sk_callback_sse2+0x10c0>
-  DB  68,15,40,13,145,17,0,0              ; movaps        0x1191(%rip),%xmm9        # 5cf0 <_sk_callback_sse2+0x10d0>
+  DB  15,88,13,143,17,0,0                 ; addps         0x118f(%rip),%xmm1        # 5ce0 <_sk_callback_sse2+0x10c6>
+  DB  68,15,40,13,151,17,0,0              ; movaps        0x1197(%rip),%xmm9        # 5cf0 <_sk_callback_sse2+0x10d6>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
-  DB  68,15,40,5,149,17,0,0               ; movaps        0x1195(%rip),%xmm8        # 5d00 <_sk_callback_sse2+0x10e0>
+  DB  68,15,40,5,155,17,0,0               ; movaps        0x119b(%rip),%xmm8        # 5d00 <_sk_callback_sse2+0x10e6>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,153,17,0,0               ; addps         0x1199(%rip),%xmm8        # 5d10 <_sk_callback_sse2+0x10f0>
+  DB  68,15,88,5,159,17,0,0               ; addps         0x119f(%rip),%xmm8        # 5d10 <_sk_callback_sse2+0x10f6>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,157,17,0,0               ; addps         0x119d(%rip),%xmm8        # 5d20 <_sk_callback_sse2+0x1100>
+  DB  68,15,88,5,163,17,0,0               ; addps         0x11a3(%rip),%xmm8        # 5d20 <_sk_callback_sse2+0x1106>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,161,17,0,0               ; addps         0x11a1(%rip),%xmm8        # 5d30 <_sk_callback_sse2+0x1110>
+  DB  68,15,88,5,167,17,0,0               ; addps         0x11a7(%rip),%xmm8        # 5d30 <_sk_callback_sse2+0x1116>
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -22663,17 +22661,17 @@
 PUBLIC _sk_bicubic_p1y_sse2
 _sk_bicubic_p1y_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,155,17,0,0               ; movaps        0x119b(%rip),%xmm8        # 5d40 <_sk_callback_sse2+0x1120>
+  DB  68,15,40,5,161,17,0,0               ; movaps        0x11a1(%rip),%xmm8        # 5d40 <_sk_callback_sse2+0x1126>
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,72,96                      ; movups        0x60(%rax),%xmm9
   DB  65,15,88,200                        ; addps         %xmm8,%xmm1
-  DB  68,15,40,21,150,17,0,0              ; movaps        0x1196(%rip),%xmm10        # 5d50 <_sk_callback_sse2+0x1130>
+  DB  68,15,40,21,156,17,0,0              ; movaps        0x119c(%rip),%xmm10        # 5d50 <_sk_callback_sse2+0x1136>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,154,17,0,0              ; addps         0x119a(%rip),%xmm10        # 5d60 <_sk_callback_sse2+0x1140>
+  DB  68,15,88,21,160,17,0,0              ; addps         0x11a0(%rip),%xmm10        # 5d60 <_sk_callback_sse2+0x1146>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,150,17,0,0              ; addps         0x1196(%rip),%xmm10        # 5d70 <_sk_callback_sse2+0x1150>
+  DB  68,15,88,21,156,17,0,0              ; addps         0x119c(%rip),%xmm10        # 5d70 <_sk_callback_sse2+0x1156>
   DB  68,15,17,144,160,0,0,0              ; movups        %xmm10,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -22683,11 +22681,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,136,17,0,0                 ; addps         0x1188(%rip),%xmm1        # 5d80 <_sk_callback_sse2+0x1160>
+  DB  15,88,13,142,17,0,0                 ; addps         0x118e(%rip),%xmm1        # 5d80 <_sk_callback_sse2+0x1166>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  69,15,89,201                        ; mulps         %xmm9,%xmm9
-  DB  68,15,89,5,136,17,0,0               ; mulps         0x1188(%rip),%xmm8        # 5d90 <_sk_callback_sse2+0x1170>
-  DB  68,15,88,5,144,17,0,0               ; addps         0x1190(%rip),%xmm8        # 5da0 <_sk_callback_sse2+0x1180>
+  DB  68,15,89,5,142,17,0,0               ; mulps         0x118e(%rip),%xmm8        # 5d90 <_sk_callback_sse2+0x1176>
+  DB  68,15,88,5,150,17,0,0               ; addps         0x1196(%rip),%xmm8        # 5da0 <_sk_callback_sse2+0x1186>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -23367,7 +23365,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3928a <_sk_callback_sse2+0xffffffffe9a3466a>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3928a <_sk_callback_sse2+0xffffffffe9a34670>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
@@ -23462,7 +23460,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3935a <_sk_callback_sse2+0xffffffffe9a3473a>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3935a <_sk_callback_sse2+0xffffffffe9a34740>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
@@ -23557,7 +23555,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3942a <_sk_callback_sse2+0xffffffffe9a3480a>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3942a <_sk_callback_sse2+0xffffffffe9a34810>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
@@ -23652,7 +23650,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a394fa <_sk_callback_sse2+0xffffffffe9a348da>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a394fa <_sk_callback_sse2+0xffffffffe9a348e0>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
@@ -24335,7 +24333,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63ea65 <_sk_callback_sse2+0x3d639e45>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63ea65 <_sk_callback_sse2+0x3d639e4b>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -24361,7 +24359,7 @@
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63eaa5 <_sk_callback_sse2+0x3d639e85>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63eaa5 <_sk_callback_sse2+0x3d639e8b>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
@@ -24445,7 +24443,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63eb75 <_sk_callback_sse2+0x3d639f55>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63eb75 <_sk_callback_sse2+0x3d639f5b>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -24471,7 +24469,7 @@
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63ebb5 <_sk_callback_sse2+0x3d639f95>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63ebb5 <_sk_callback_sse2+0x3d639f9b>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
@@ -24482,11 +24480,11 @@
   DB  63                                  ; (bad)
   DB  114,28                              ; jb            5dae <.literal16+0x10de>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         5db2 <_sk_callback_sse2+0x1192>
+  DB  62,114,28                           ; jb,pt         5db2 <_sk_callback_sse2+0x1198>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         5db6 <_sk_callback_sse2+0x1196>
+  DB  62,114,28                           ; jb,pt         5db6 <_sk_callback_sse2+0x119c>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         5dba <_sk_callback_sse2+0x119a>
+  DB  62,114,28                           ; jb,pt         5dba <_sk_callback_sse2+0x11a0>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
diff --git a/src/jumper/SkJumper_stages.cpp b/src/jumper/SkJumper_stages.cpp
index 4d84cb4..fa11869 100644
--- a/src/jumper/SkJumper_stages.cpp
+++ b/src/jumper/SkJumper_stages.cpp
@@ -286,7 +286,7 @@
     // It's important for speed to explicitly cast(x) and cast(y),
     // which has the effect of splatting them to vectors before converting to floats.
     // On Intel this breaks a data dependency on previous loop iterations' registers.
-    r = cast(x) + 0.5f + unaligned_load<F>(k->iota);
+    r = cast(x) + 0.5f + unaligned_load<F>(k->iota_F);
     g = cast(y) + 0.5f;
     b = 1.0f;
     a = 0;
@@ -297,7 +297,7 @@
     auto c = (const SkJumper_DitherCtx*)ctx;
 
     // Get [(x,y), (x+1,y), (x+2,y), ...] loaded up in integer vectors.
-    U32 X = trunc_((int)x + unaligned_load<F>(k->iota)),  // Going through float is kind of lazy..
+    U32 X = x + unaligned_load<U32>(k->iota_U32),
         Y = (uint32_t)*c->y;
 
     // We're doing 8x8 ordered dithering, see https://en.wikipedia.org/wiki/Ordered_dithering.