add stages for black and white colors

histogram of test skps:

black: 1/7
white: 2/7
other: 4/7

Bug: skia:
Change-Id: I3a092899d31ce87837e66e5c8ea9ec5e0f239361
Reviewed-on: https://skia-review.googlesource.com/21408
Reviewed-by: Herb Derby <herb@google.com>
Commit-Queue: Mike Reed <reed@google.com>
diff --git a/bench/SkRasterPipelineBench.cpp b/bench/SkRasterPipelineBench.cpp
index 39e7c91..33e0efd 100644
--- a/bench/SkRasterPipelineBench.cpp
+++ b/bench/SkRasterPipelineBench.cpp
@@ -123,7 +123,7 @@
         SkColorSpaceTransferFn from_2dot2 = gamma(  2.2f),
                                  to_2dot2 = gamma(1/2.2f);
         SkRasterPipeline_<256> p;
-        p.append(SkRasterPipeline::constant_color, &c);
+        p.append(SkRasterPipeline::uniform_color, &c);
         p.append(SkRasterPipeline::parametric_r, &from_2dot2);
         p.append(SkRasterPipeline::parametric_g, &from_2dot2);
         p.append(SkRasterPipeline::parametric_b, &from_2dot2);
diff --git a/src/core/SkColorFilter.cpp b/src/core/SkColorFilter.cpp
index ecfa54b..6cc8ae8 100644
--- a/src/core/SkColorFilter.cpp
+++ b/src/core/SkColorFilter.cpp
@@ -69,7 +69,7 @@
     SkSTArenaAlloc<128> alloc;
     SkRasterPipeline    pipeline(&alloc);
 
-    pipeline.append(SkRasterPipeline::constant_color, &src);
+    pipeline.append_uniform_color(&alloc, src);
     this->onAppendStages(&pipeline, nullptr, &alloc, c.fA == 1);
     SkPM4f* dstPtr = &dst;
     pipeline.append(SkRasterPipeline::store_f32, &dstPtr);
diff --git a/src/core/SkModeColorFilter.cpp b/src/core/SkModeColorFilter.cpp
index ca86675..089bcd3 100644
--- a/src/core/SkModeColorFilter.cpp
+++ b/src/core/SkModeColorFilter.cpp
@@ -77,10 +77,8 @@
                                        SkColorSpace* dst,
                                        SkArenaAlloc* scratch,
                                        bool shaderIsOpaque) const {
-    auto color = scratch->make<SkPM4f>(SkPM4f_from_SkColor(fColor, dst));
-
     p->append(SkRasterPipeline::move_src_dst);
-    p->append(SkRasterPipeline::constant_color, color);
+    p->append_uniform_color(scratch, SkPM4f_from_SkColor(fColor, dst));
     SkBlendMode_AppendStages(fMode, p);
 }
 
diff --git a/src/core/SkPM4fPriv.h b/src/core/SkPM4fPriv.h
index 700e128..44f6603 100644
--- a/src/core/SkPM4fPriv.h
+++ b/src/core/SkPM4fPriv.h
@@ -153,7 +153,7 @@
         float scratch_matrix_3x4[12];
 
         SkRasterPipeline_<256> p;
-        p.append(SkRasterPipeline::constant_color, color4f_ptr);
+        p.append(SkRasterPipeline::uniform_color, color4f_ptr);
         append_gamut_transform(&p, scratch_matrix_3x4, src, dst, kUnpremul_SkAlphaType);
         p.append(SkRasterPipeline::store_f32, &color4f_ptr);
 
diff --git a/src/core/SkRasterPipeline.cpp b/src/core/SkRasterPipeline.cpp
index 05fa75f..a7b25d7 100644
--- a/src/core/SkRasterPipeline.cpp
+++ b/src/core/SkRasterPipeline.cpp
@@ -6,6 +6,7 @@
  */
 
 #include "SkRasterPipeline.h"
+#include "SkPM4f.h"
 
 SkRasterPipeline::SkRasterPipeline(SkArenaAlloc* alloc) : fAlloc(alloc) {
     this->reset();
@@ -61,6 +62,43 @@
     SkDebugf("\n");
 }
 
+//#define TRACK_COLOR_HISTOGRAM
+#ifdef TRACK_COLOR_HISTOGRAM
+    static int gBlack;
+    static int gWhite;
+    static int gColor;
+    #define INC_BLACK   gBlack++
+    #define INC_WHITE   gWhite++
+    #define INC_COLOR   gColor++
+#else
+    #define INC_BLACK
+    #define INC_WHITE
+    #define INC_COLOR
+#endif
+
+void SkRasterPipeline::append_uniform_color(SkArenaAlloc* alloc, const SkPM4f& c) {
+    if (c.r() == 0 && c.g() == 0 && c.b() == 0 && c.a() == 1) {
+        this->append(black_color);
+        INC_BLACK;
+    } else if (c.r() == 1 && c.g() == 1 && c.b() == 1 && c.a() == 1) {
+        this->append(white_color);
+        INC_WHITE;
+    } else {
+        float* storage = alloc->makeArray<float>(4);
+        memcpy(storage, c.fVec, 4 * sizeof(float));
+        this->append(uniform_color, storage);
+        INC_COLOR;
+    }
+
+#ifdef TRACK_COLOR_HISTOGRAM
+    SkDebugf("B=%d W=%d C=%d\n", gBlack, gWhite, gColor);
+#endif
+}
+
+#undef INC_BLACK
+#undef INC_WHITE
+#undef INC_COLOR
+
 // It's pretty easy to start with sound premultiplied linear floats, pack those
 // to sRGB encoded bytes, then read them back to linear floats and find them not
 // quite premultiplied, with a color channel just a smidge greater than the alpha
diff --git a/src/core/SkRasterPipeline.h b/src/core/SkRasterPipeline.h
index 2374201..fee5346 100644
--- a/src/core/SkRasterPipeline.h
+++ b/src/core/SkRasterPipeline.h
@@ -17,6 +17,7 @@
 #include <vector>
 
 struct SkJumper_constants;
+struct SkPM4f;
 
 /**
  * SkRasterPipeline provides a cheap way to chain together a pixel processing pipeline.
@@ -42,7 +43,8 @@
     M(unpremul) M(premul)                                        \
     M(set_rgb) M(swap_rb)                                        \
     M(from_srgb) M(from_srgb_dst) M(to_srgb)                     \
-    M(constant_color) M(seed_shader) M(dither)                   \
+    M(black_color) M(white_color) M(uniform_color)               \
+    M(seed_shader) M(dither)                                     \
                                                 M(gather_i8)     \
     M(load_a8)   M(load_a8_dst)   M(store_a8)   M(gather_a8)     \
     M(load_g8)   M(load_g8_dst)                 M(gather_g8)     \
@@ -132,6 +134,9 @@
     // the type of matrix.
     void append_matrix(SkArenaAlloc*, const SkMatrix&);
 
+    // Appends a stage for the uniform color. Tries to optimize the stage based on the color.
+    void append_uniform_color(SkArenaAlloc*, const SkPM4f& color);
+
     bool empty() const { return fStages == nullptr; }
 
 private:
diff --git a/src/core/SkRasterPipelineBlitter.cpp b/src/core/SkRasterPipelineBlitter.cpp
index fff3d8b..b35bfad 100644
--- a/src/core/SkRasterPipelineBlitter.cpp
+++ b/src/core/SkRasterPipelineBlitter.cpp
@@ -91,21 +91,21 @@
                                          const SkMatrix& ctm,
                                          SkArenaAlloc* alloc) {
     SkColorSpace* dstCS = dst.colorSpace();
-    auto paintColor = alloc->make<SkPM4f>(SkPM4f_from_SkColor(paint.getColor(), dstCS));
+    SkPM4f paintColor = SkPM4f_from_SkColor(paint.getColor(), dstCS);
     auto shader = as_SB(paint.getShader());
 
     SkRasterPipeline_<256> shaderPipeline;
     if (!shader) {
         // Having no shader makes things nice and easy... just use the paint color.
-        shaderPipeline.append(SkRasterPipeline::constant_color, paintColor);
-        bool is_opaque    = paintColor->a() == 1.0f,
+        shaderPipeline.append_uniform_color(alloc, paintColor);
+        bool is_opaque    = paintColor.a() == 1.0f,
              is_constant  = true;
         return SkRasterPipelineBlitter::Create(dst, paint, alloc,
                                                shaderPipeline, nullptr,
                                                is_opaque, is_constant);
     }
 
-    bool is_opaque    = shader->isOpaque() && paintColor->a() == 1.0f;
+    bool is_opaque    = shader->isOpaque() && paintColor.a() == 1.0f;
     bool is_constant  = shader->isConstant();
 
     // Check whether the shader prefers to run in burst mode.
@@ -118,8 +118,9 @@
     }
 
     if (shader->appendStages(&shaderPipeline, dstCS, alloc, ctm, paint)) {
-        if (paintColor->a() != 1.0f) {
-            shaderPipeline.append(SkRasterPipeline::scale_1_float, &paintColor->fVec[SkPM4f::A]);
+        if (paintColor.a() != 1.0f) {
+            shaderPipeline.append(SkRasterPipeline::scale_1_float,
+                                  alloc->make<float>(paintColor.a()));
         }
         return SkRasterPipelineBlitter::Create(dst, paint, alloc, shaderPipeline, nullptr,
                                                is_opaque, is_constant);
@@ -190,11 +191,12 @@
 
     // A pipeline that's still constant here can collapse back into a constant color.
     if (is_constant) {
-        auto constantColor = alloc->make<SkPM4f>();
+        SkPM4f storage;
+        SkPM4f* constantColor = &storage;
         colorPipeline->append(SkRasterPipeline::store_f32, &constantColor);
         colorPipeline->run(0,0,1);
         colorPipeline->reset();
-        colorPipeline->append(SkRasterPipeline::constant_color, constantColor);
+        colorPipeline->append_uniform_color(alloc, *constantColor);
 
         is_opaque = constantColor->a() == 1.0f;
     }
diff --git a/src/jumper/SkJumper.cpp b/src/jumper/SkJumper.cpp
index 1b4cb3b..9dcd463 100644
--- a/src/jumper/SkJumper.cpp
+++ b/src/jumper/SkJumper.cpp
@@ -71,7 +71,7 @@
 
 // Some stages have low-precision (~15 bit) versions from SkJumper_stages_lowp.cpp.
 #define LOWP_STAGES(M)   \
-    M(constant_color)    \
+    M(black_color) M(white_color) M(uniform_color) \
     M(set_rgb)           \
     M(premul)            \
     M(load_8888) M(load_8888_dst) M(store_8888) \
diff --git a/src/jumper/SkJumper_generated.S b/src/jumper/SkJumper_generated.S
index 8180162..c2614c9 100644
--- a/src/jumper/SkJumper_generated.S
+++ b/src/jumper/SkJumper_generated.S
@@ -152,10 +152,10 @@
   .long  0x4e22f642                          // fmax          v2.4s, v18.4s, v2.4s
   .long  0xd61f00a0                          // br            x5
 
-HIDDEN _sk_constant_color_aarch64
-.globl _sk_constant_color_aarch64
-FUNCTION(_sk_constant_color_aarch64)
-_sk_constant_color_aarch64:
+HIDDEN _sk_uniform_color_aarch64
+.globl _sk_uniform_color_aarch64
+FUNCTION(_sk_uniform_color_aarch64)
+_sk_uniform_color_aarch64:
   .long  0xa8c11428                          // ldp           x8, x5, [x1], #16
   .long  0xaa0803ea                          // mov           x10, x8
   .long  0x4ddfc940                          // ld1r          {v0.4s}, [x10], #4
@@ -166,6 +166,28 @@
   .long  0x4d40c941                          // ld1r          {v1.4s}, [x10]
   .long  0xd61f00a0                          // br            x5
 
+HIDDEN _sk_black_color_aarch64
+.globl _sk_black_color_aarch64
+FUNCTION(_sk_black_color_aarch64)
+_sk_black_color_aarch64:
+  .long  0xf8408425                          // ldr           x5, [x1], #8
+  .long  0x4f03f603                          // fmov          v3.4s, #1.000000000000000000e+00
+  .long  0x6f00e400                          // movi          v0.2d, #0x0
+  .long  0x6f00e401                          // movi          v1.2d, #0x0
+  .long  0x6f00e402                          // movi          v2.2d, #0x0
+  .long  0xd61f00a0                          // br            x5
+
+HIDDEN _sk_white_color_aarch64
+.globl _sk_white_color_aarch64
+FUNCTION(_sk_white_color_aarch64)
+_sk_white_color_aarch64:
+  .long  0xf8408425                          // ldr           x5, [x1], #8
+  .long  0x4f03f600                          // fmov          v0.4s, #1.000000000000000000e+00
+  .long  0x4ea01c01                          // mov           v1.16b, v0.16b
+  .long  0x4ea01c02                          // mov           v2.16b, v0.16b
+  .long  0x4ea01c03                          // mov           v3.16b, v0.16b
+  .long  0xd61f00a0                          // br            x5
+
 HIDDEN _sk_load_rgba_aarch64
 .globl _sk_load_rgba_aarch64
 FUNCTION(_sk_load_rgba_aarch64)
@@ -1253,7 +1275,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020908                          // add           x8, x8, x2, lsl #2
-  .long  0xb5000504                          // cbnz          x4, 111c <sk_srcover_rgba_8888_aarch64+0xac>
+  .long  0xb5000504                          // cbnz          x4, 114c <sk_srcover_rgba_8888_aarch64+0xac>
   .long  0x3dc00104                          // ldr           q4, [x8]
   .long  0x6f00e625                          // movi          v5.2d, #0xff000000ff
   .long  0x6f380486                          // ushr          v6.4s, v4.4s, #8
@@ -1288,42 +1310,42 @@
   .long  0x6e21a871                          // fcvtnu        v17.4s, v3.4s
   .long  0x4f385631                          // shl           v17.4s, v17.4s, #24
   .long  0x4eb11e10                          // orr           v16.16b, v16.16b, v17.16b
-  .long  0xb5000284                          // cbnz          x4, 1158 <sk_srcover_rgba_8888_aarch64+0xe8>
+  .long  0xb5000284                          // cbnz          x4, 1188 <sk_srcover_rgba_8888_aarch64+0xe8>
   .long  0x3d800110                          // str           q16, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000300                          // b.eq          1184 <sk_srcover_rgba_8888_aarch64+0x114>  // b.none
+  .long  0x54000300                          // b.eq          11b4 <sk_srcover_rgba_8888_aarch64+0x114>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x6f00e404                          // movi          v4.2d, #0x0
-  .long  0x540000c0                          // b.eq          1148 <sk_srcover_rgba_8888_aarch64+0xd8>  // b.none
+  .long  0x540000c0                          // b.eq          1178 <sk_srcover_rgba_8888_aarch64+0xd8>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffa61                          // b.ne          1084 <sk_srcover_rgba_8888_aarch64+0x14>  // b.any
+  .long  0x54fffa61                          // b.ne          10b4 <sk_srcover_rgba_8888_aarch64+0x14>  // b.any
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x4e040fe4                          // dup           v4.4s, wzr
   .long  0x4d408124                          // ld1           {v4.s}[2], [x9]
   .long  0xfd400105                          // ldr           d5, [x8]
   .long  0x6e054084                          // ext           v4.16b, v4.16b, v5.16b, #8
   .long  0x6e044084                          // ext           v4.16b, v4.16b, v4.16b, #8
-  .long  0x17ffffcc                          // b             1084 <sk_srcover_rgba_8888_aarch64+0x14>
+  .long  0x17ffffcc                          // b             10b4 <sk_srcover_rgba_8888_aarch64+0x14>
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000180                          // b.eq          1190 <sk_srcover_rgba_8888_aarch64+0x120>  // b.none
+  .long  0x54000180                          // b.eq          11c0 <sk_srcover_rgba_8888_aarch64+0x120>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
-  .long  0x540000a0                          // b.eq          117c <sk_srcover_rgba_8888_aarch64+0x10c>  // b.none
+  .long  0x540000a0                          // b.eq          11ac <sk_srcover_rgba_8888_aarch64+0x10c>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffd01                          // b.ne          1110 <sk_srcover_rgba_8888_aarch64+0xa0>  // b.any
+  .long  0x54fffd01                          // b.ne          1140 <sk_srcover_rgba_8888_aarch64+0xa0>  // b.any
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x4d008130                          // st1           {v16.s}[2], [x9]
   .long  0xfd000110                          // str           d16, [x8]
-  .long  0x17ffffe4                          // b             1110 <sk_srcover_rgba_8888_aarch64+0xa0>
+  .long  0x17ffffe4                          // b             1140 <sk_srcover_rgba_8888_aarch64+0xa0>
   .long  0x4e040fe4                          // dup           v4.4s, wzr
   .long  0x0d408104                          // ld1           {v4.s}[0], [x8]
-  .long  0x17ffffbe                          // b             1084 <sk_srcover_rgba_8888_aarch64+0x14>
+  .long  0x17ffffbe                          // b             10b4 <sk_srcover_rgba_8888_aarch64+0x14>
   .long  0x0d008110                          // st1           {v16.s}[0], [x8]
-  .long  0x17ffffdf                          // b             1110 <sk_srcover_rgba_8888_aarch64+0xa0>
+  .long  0x17ffffdf                          // b             1140 <sk_srcover_rgba_8888_aarch64+0xa0>
 
 HIDDEN _sk_clamp_0_aarch64
 .globl _sk_clamp_0_aarch64
@@ -1744,7 +1766,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb50002e4                          // cbnz          x4, 1730 <sk_scale_u8_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 1760 <sk_scale_u8_aarch64+0x68>
   .long  0x39400109                          // ldrb          w9, [x8]
   .long  0x3940050a                          // ldrb          w10, [x8, #1]
   .long  0x3940090b                          // ldrb          w11, [x8, #2]
@@ -1769,12 +1791,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          177c <sk_scale_u8_aarch64+0xb4>  // b.none
+  .long  0x54000220                          // b.eq          17ac <sk_scale_u8_aarch64+0xb4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e410                          // movi          d16, #0x0
-  .long  0x540000c0                          // b.eq          175c <sk_scale_u8_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          178c <sk_scale_u8_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffd61                          // b.ne          16f8 <sk_scale_u8_aarch64+0x30>  // b.any
+  .long  0x54fffd61                          // b.ne          1728 <sk_scale_u8_aarch64+0x30>  // b.any
   .long  0x39400909                          // ldrb          w9, [x8, #2]
   .long  0x0e020ff0                          // dup           v16.4h, wzr
   .long  0x4e0a1d30                          // mov           v16.h[2], w9
@@ -1785,11 +1807,11 @@
   .long  0x0e401a31                          // uzp1          v17.4h, v17.4h, v0.4h
   .long  0x2e112210                          // ext           v16.8b, v16.8b, v17.8b, #4
   .long  0x2e102210                          // ext           v16.8b, v16.8b, v16.8b, #4
-  .long  0x17ffffe0                          // b             16f8 <sk_scale_u8_aarch64+0x30>
+  .long  0x17ffffe0                          // b             1728 <sk_scale_u8_aarch64+0x30>
   .long  0x39400108                          // ldrb          w8, [x8]
   .long  0x0e020ff0                          // dup           v16.4h, wzr
   .long  0x4e021d10                          // mov           v16.h[0], w8
-  .long  0x17ffffdc                          // b             16f8 <sk_scale_u8_aarch64+0x30>
+  .long  0x17ffffdc                          // b             1728 <sk_scale_u8_aarch64+0x30>
 
 HIDDEN _sk_lerp_1_float_aarch64
 .globl _sk_lerp_1_float_aarch64
@@ -1818,7 +1840,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb50003e4                          // cbnz          x4, 1850 <sk_lerp_u8_aarch64+0x88>
+  .long  0xb50003e4                          // cbnz          x4, 1880 <sk_lerp_u8_aarch64+0x88>
   .long  0x39400109                          // ldrb          w9, [x8]
   .long  0x3940050a                          // ldrb          w10, [x8, #1]
   .long  0x3940090b                          // ldrb          w11, [x8, #2]
@@ -1851,12 +1873,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          189c <sk_lerp_u8_aarch64+0xd4>  // b.none
+  .long  0x54000220                          // b.eq          18cc <sk_lerp_u8_aarch64+0xd4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e410                          // movi          d16, #0x0
-  .long  0x540000c0                          // b.eq          187c <sk_lerp_u8_aarch64+0xb4>  // b.none
+  .long  0x540000c0                          // b.eq          18ac <sk_lerp_u8_aarch64+0xb4>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffc61                          // b.ne          17f8 <sk_lerp_u8_aarch64+0x30>  // b.any
+  .long  0x54fffc61                          // b.ne          1828 <sk_lerp_u8_aarch64+0x30>  // b.any
   .long  0x39400909                          // ldrb          w9, [x8, #2]
   .long  0x0e020ff0                          // dup           v16.4h, wzr
   .long  0x4e0a1d30                          // mov           v16.h[2], w9
@@ -1867,11 +1889,11 @@
   .long  0x0e401a31                          // uzp1          v17.4h, v17.4h, v0.4h
   .long  0x2e112210                          // ext           v16.8b, v16.8b, v17.8b, #4
   .long  0x2e102210                          // ext           v16.8b, v16.8b, v16.8b, #4
-  .long  0x17ffffd8                          // b             17f8 <sk_lerp_u8_aarch64+0x30>
+  .long  0x17ffffd8                          // b             1828 <sk_lerp_u8_aarch64+0x30>
   .long  0x39400108                          // ldrb          w8, [x8]
   .long  0x0e020ff0                          // dup           v16.4h, wzr
   .long  0x4e021d10                          // mov           v16.h[0], w8
-  .long  0x17ffffd4                          // b             17f8 <sk_lerp_u8_aarch64+0x30>
+  .long  0x17ffffd4                          // b             1828 <sk_lerp_u8_aarch64+0x30>
 
 HIDDEN _sk_lerp_565_aarch64
 .globl _sk_lerp_565_aarch64
@@ -1880,7 +1902,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
-  .long  0xb50005c4                          // cbnz          x4, 1970 <sk_lerp_565_aarch64+0xc4>
+  .long  0xb50005c4                          // cbnz          x4, 19a0 <sk_lerp_565_aarch64+0xc4>
   .long  0xfd400110                          // ldr           d16, [x8]
   .long  0x321b17e8                          // orr           w8, wzr, #0x7e0
   .long  0x4e040d12                          // dup           v18.4s, w8
@@ -1928,12 +1950,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          19bc <sk_lerp_565_aarch64+0x110>  // b.none
+  .long  0x54000220                          // b.eq          19ec <sk_lerp_565_aarch64+0x110>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e410                          // movi          d16, #0x0
-  .long  0x540000c0                          // b.eq          199c <sk_lerp_565_aarch64+0xf0>  // b.none
+  .long  0x540000c0                          // b.eq          19cc <sk_lerp_565_aarch64+0xf0>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fff9a1                          // b.ne          18c0 <sk_lerp_565_aarch64+0x14>  // b.any
+  .long  0x54fff9a1                          // b.ne          18f0 <sk_lerp_565_aarch64+0x14>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0e020ff0                          // dup           v16.4h, wzr
   .long  0x0d405130                          // ld1           {v16.h}[2], [x9]
@@ -1944,10 +1966,10 @@
   .long  0x0e401a31                          // uzp1          v17.4h, v17.4h, v0.4h
   .long  0x2e112210                          // ext           v16.8b, v16.8b, v17.8b, #4
   .long  0x2e102210                          // ext           v16.8b, v16.8b, v16.8b, #4
-  .long  0x17ffffc2                          // b             18c0 <sk_lerp_565_aarch64+0x14>
+  .long  0x17ffffc2                          // b             18f0 <sk_lerp_565_aarch64+0x14>
   .long  0x0e020ff0                          // dup           v16.4h, wzr
   .long  0x0d404110                          // ld1           {v16.h}[0], [x8]
-  .long  0x17ffffbf                          // b             18c0 <sk_lerp_565_aarch64+0x14>
+  .long  0x17ffffbf                          // b             18f0 <sk_lerp_565_aarch64+0x14>
 
 HIDDEN _sk_load_tables_aarch64
 .globl _sk_load_tables_aarch64
@@ -1956,7 +1978,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400109                          // ldr           x9, [x8]
   .long  0x8b020929                          // add           x9, x9, x2, lsl #2
-  .long  0xb50006e4                          // cbnz          x4, 1ab0 <sk_load_tables_aarch64+0xe8>
+  .long  0xb50006e4                          // cbnz          x4, 1ae0 <sk_load_tables_aarch64+0xe8>
   .long  0x3dc00122                          // ldr           q2, [x9]
   .long  0xa940a909                          // ldp           x9, x10, [x8, #8]
   .long  0x6f00e620                          // movi          v0.2d, #0xff000000ff
@@ -2013,22 +2035,22 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x1200048a                          // and           w10, w4, #0x3
   .long  0x7100055f                          // cmp           w10, #0x1
-  .long  0x540001a0                          // b.eq          1aec <sk_load_tables_aarch64+0x124>  // b.none
+  .long  0x540001a0                          // b.eq          1b1c <sk_load_tables_aarch64+0x124>  // b.none
   .long  0x7100095f                          // cmp           w10, #0x2
   .long  0x6f00e402                          // movi          v2.2d, #0x0
-  .long  0x540000c0                          // b.eq          1adc <sk_load_tables_aarch64+0x114>  // b.none
+  .long  0x540000c0                          // b.eq          1b0c <sk_load_tables_aarch64+0x114>  // b.none
   .long  0x71000d5f                          // cmp           w10, #0x3
-  .long  0x54fff881                          // b.ne          19dc <sk_load_tables_aarch64+0x14>  // b.any
+  .long  0x54fff881                          // b.ne          1a0c <sk_load_tables_aarch64+0x14>  // b.any
   .long  0x9100212a                          // add           x10, x9, #0x8
   .long  0x4e040fe2                          // dup           v2.4s, wzr
   .long  0x4d408142                          // ld1           {v2.s}[2], [x10]
   .long  0xfd400120                          // ldr           d0, [x9]
   .long  0x6e004040                          // ext           v0.16b, v2.16b, v0.16b, #8
   .long  0x6e004002                          // ext           v2.16b, v0.16b, v0.16b, #8
-  .long  0x17ffffbd                          // b             19dc <sk_load_tables_aarch64+0x14>
+  .long  0x17ffffbd                          // b             1a0c <sk_load_tables_aarch64+0x14>
   .long  0x4e040fe2                          // dup           v2.4s, wzr
   .long  0x0d408122                          // ld1           {v2.s}[0], [x9]
-  .long  0x17ffffba                          // b             19dc <sk_load_tables_aarch64+0x14>
+  .long  0x17ffffba                          // b             1a0c <sk_load_tables_aarch64+0x14>
 
 HIDDEN _sk_load_tables_u16_be_aarch64
 .globl _sk_load_tables_u16_be_aarch64
@@ -2037,7 +2059,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400109                          // ldr           x9, [x8]
   .long  0x8b020d29                          // add           x9, x9, x2, lsl #3
-  .long  0xb5000744                          // cbnz          x4, 1bec <sk_load_tables_u16_be_aarch64+0xf4>
+  .long  0xb5000744                          // cbnz          x4, 1c1c <sk_load_tables_u16_be_aarch64+0xf4>
   .long  0x0c400520                          // ld4           {v0.4h-v3.4h}, [x9]
   .long  0xa940a909                          // ldp           x9, x10, [x8, #8]
   .long  0x2f07b7e0                          // bic           v0.4h, #0xff, lsl #8
@@ -2097,14 +2119,14 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x0d606120                          // ld4           {v0.h-v3.h}[0], [x9]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54fff8c0                          // b.eq          1b0c <sk_load_tables_u16_be_aarch64+0x14>  // b.none
+  .long  0x54fff8c0                          // b.eq          1b3c <sk_load_tables_u16_be_aarch64+0x14>  // b.none
   .long  0x9100212a                          // add           x10, x9, #0x8
   .long  0x0d606940                          // ld4           {v0.h-v3.h}[1], [x10]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fff843                          // b.cc          1b0c <sk_load_tables_u16_be_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fff843                          // b.cc          1b3c <sk_load_tables_u16_be_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91004129                          // add           x9, x9, #0x10
   .long  0x0d607120                          // ld4           {v0.h-v3.h}[2], [x9]
-  .long  0x17ffffbf                          // b             1b0c <sk_load_tables_u16_be_aarch64+0x14>
+  .long  0x17ffffbf                          // b             1b3c <sk_load_tables_u16_be_aarch64+0x14>
 
 HIDDEN _sk_load_tables_rgb_u16_be_aarch64
 .globl _sk_load_tables_rgb_u16_be_aarch64
@@ -2114,7 +2136,7 @@
   .long  0x321f07ea                          // orr           w10, wzr, #0x6
   .long  0xf9400109                          // ldr           x9, [x8]
   .long  0x9b0a2449                          // madd          x9, x2, x10, x9
-  .long  0xb5000664                          // cbnz          x4, 1cf0 <sk_load_tables_rgb_u16_be_aarch64+0xdc>
+  .long  0xb5000664                          // cbnz          x4, 1d20 <sk_load_tables_rgb_u16_be_aarch64+0xdc>
   .long  0x0c404520                          // ld3           {v0.4h-v2.4h}, [x9]
   .long  0xa940a909                          // ldp           x9, x10, [x8, #8]
   .long  0x2f07b7e0                          // bic           v0.4h, #0xff, lsl #8
@@ -2167,14 +2189,14 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x0d406120                          // ld3           {v0.h-v2.h}[0], [x9]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54fff9a0                          // b.eq          1c2c <sk_load_tables_rgb_u16_be_aarch64+0x18>  // b.none
+  .long  0x54fff9a0                          // b.eq          1c5c <sk_load_tables_rgb_u16_be_aarch64+0x18>  // b.none
   .long  0x9100192a                          // add           x10, x9, #0x6
   .long  0x0d406940                          // ld3           {v0.h-v2.h}[1], [x10]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fff923                          // b.cc          1c2c <sk_load_tables_rgb_u16_be_aarch64+0x18>  // b.lo, b.ul, b.last
+  .long  0x54fff923                          // b.cc          1c5c <sk_load_tables_rgb_u16_be_aarch64+0x18>  // b.lo, b.ul, b.last
   .long  0x91003129                          // add           x9, x9, #0xc
   .long  0x0d407120                          // ld3           {v0.h-v2.h}[2], [x9]
-  .long  0x17ffffc6                          // b             1c2c <sk_load_tables_rgb_u16_be_aarch64+0x18>
+  .long  0x17ffffc6                          // b             1c5c <sk_load_tables_rgb_u16_be_aarch64+0x18>
 
 HIDDEN _sk_byte_tables_aarch64
 .globl _sk_byte_tables_aarch64
@@ -2819,7 +2841,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb50002e4                          // cbnz          x4, 2694 <sk_load_a8_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 26c4 <sk_load_a8_aarch64+0x68>
   .long  0x39400109                          // ldrb          w9, [x8]
   .long  0x3940050a                          // ldrb          w10, [x8, #1]
   .long  0x3940090b                          // ldrb          w11, [x8, #2]
@@ -2844,12 +2866,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          26e0 <sk_load_a8_aarch64+0xb4>  // b.none
+  .long  0x54000220                          // b.eq          2710 <sk_load_a8_aarch64+0xb4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e402                          // movi          d2, #0x0
-  .long  0x540000c0                          // b.eq          26c0 <sk_load_a8_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          26f0 <sk_load_a8_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffd61                          // b.ne          265c <sk_load_a8_aarch64+0x30>  // b.any
+  .long  0x54fffd61                          // b.ne          268c <sk_load_a8_aarch64+0x30>  // b.any
   .long  0x39400909                          // ldrb          w9, [x8, #2]
   .long  0x0e020fe2                          // dup           v2.4h, wzr
   .long  0x4e0a1d22                          // mov           v2.h[2], w9
@@ -2860,11 +2882,11 @@
   .long  0x0e401800                          // uzp1          v0.4h, v0.4h, v0.4h
   .long  0x2e002040                          // ext           v0.8b, v2.8b, v0.8b, #4
   .long  0x2e002002                          // ext           v2.8b, v0.8b, v0.8b, #4
-  .long  0x17ffffe0                          // b             265c <sk_load_a8_aarch64+0x30>
+  .long  0x17ffffe0                          // b             268c <sk_load_a8_aarch64+0x30>
   .long  0x39400108                          // ldrb          w8, [x8]
   .long  0x0e020fe2                          // dup           v2.4h, wzr
   .long  0x4e021d02                          // mov           v2.h[0], w8
-  .long  0x17ffffdc                          // b             265c <sk_load_a8_aarch64+0x30>
+  .long  0x17ffffdc                          // b             268c <sk_load_a8_aarch64+0x30>
 
 HIDDEN _sk_load_a8_dst_aarch64
 .globl _sk_load_a8_dst_aarch64
@@ -2873,7 +2895,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb50002e4                          // cbnz          x4, 2758 <sk_load_a8_dst_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 2788 <sk_load_a8_dst_aarch64+0x68>
   .long  0x39400109                          // ldrb          w9, [x8]
   .long  0x3940050a                          // ldrb          w10, [x8, #1]
   .long  0x3940090b                          // ldrb          w11, [x8, #2]
@@ -2898,12 +2920,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          27a4 <sk_load_a8_dst_aarch64+0xb4>  // b.none
+  .long  0x54000220                          // b.eq          27d4 <sk_load_a8_dst_aarch64+0xb4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e406                          // movi          d6, #0x0
-  .long  0x540000c0                          // b.eq          2784 <sk_load_a8_dst_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          27b4 <sk_load_a8_dst_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffd61                          // b.ne          2720 <sk_load_a8_dst_aarch64+0x30>  // b.any
+  .long  0x54fffd61                          // b.ne          2750 <sk_load_a8_dst_aarch64+0x30>  // b.any
   .long  0x39400909                          // ldrb          w9, [x8, #2]
   .long  0x0e020fe6                          // dup           v6.4h, wzr
   .long  0x4e0a1d26                          // mov           v6.h[2], w9
@@ -2914,11 +2936,11 @@
   .long  0x0e401884                          // uzp1          v4.4h, v4.4h, v0.4h
   .long  0x2e0420c4                          // ext           v4.8b, v6.8b, v4.8b, #4
   .long  0x2e042086                          // ext           v6.8b, v4.8b, v4.8b, #4
-  .long  0x17ffffe0                          // b             2720 <sk_load_a8_dst_aarch64+0x30>
+  .long  0x17ffffe0                          // b             2750 <sk_load_a8_dst_aarch64+0x30>
   .long  0x39400108                          // ldrb          w8, [x8]
   .long  0x0e020fe6                          // dup           v6.4h, wzr
   .long  0x4e021d06                          // mov           v6.h[0], w8
-  .long  0x17ffffdc                          // b             2720 <sk_load_a8_dst_aarch64+0x30>
+  .long  0x17ffffdc                          // b             2750 <sk_load_a8_dst_aarch64+0x30>
 
 HIDDEN _sk_gather_a8_aarch64
 .globl _sk_gather_a8_aarch64
@@ -2967,7 +2989,7 @@
   .long  0x6e21aa10                          // fcvtnu        v16.4s, v16.4s
   .long  0x0e612a10                          // xtn           v16.4h, v16.4s
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb5000184                          // cbnz          x4, 287c <sk_store_a8_aarch64+0x50>
+  .long  0xb5000184                          // cbnz          x4, 28ac <sk_store_a8_aarch64+0x50>
   .long  0x0e0e3e09                          // umov          w9, v16.h[3]
   .long  0x0e0a3e0a                          // umov          w10, v16.h[2]
   .long  0x0e063e0b                          // umov          w11, v16.h[1]
@@ -2981,21 +3003,21 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000180                          // b.eq          28b4 <sk_store_a8_aarch64+0x88>  // b.none
+  .long  0x54000180                          // b.eq          28e4 <sk_store_a8_aarch64+0x88>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
-  .long  0x540000a0                          // b.eq          28a0 <sk_store_a8_aarch64+0x74>  // b.none
+  .long  0x540000a0                          // b.eq          28d0 <sk_store_a8_aarch64+0x74>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffee1                          // b.ne          2870 <sk_store_a8_aarch64+0x44>  // b.any
+  .long  0x54fffee1                          // b.ne          28a0 <sk_store_a8_aarch64+0x44>  // b.any
   .long  0x0e0a3e09                          // umov          w9, v16.h[2]
   .long  0x39000909                          // strb          w9, [x8, #2]
   .long  0x0e023e09                          // umov          w9, v16.h[0]
   .long  0x0e063e0a                          // umov          w10, v16.h[1]
   .long  0x3900050a                          // strb          w10, [x8, #1]
   .long  0x39000109                          // strb          w9, [x8]
-  .long  0x17fffff0                          // b             2870 <sk_store_a8_aarch64+0x44>
+  .long  0x17fffff0                          // b             28a0 <sk_store_a8_aarch64+0x44>
   .long  0x0e023e09                          // umov          w9, v16.h[0]
   .long  0x39000109                          // strb          w9, [x8]
-  .long  0x17ffffed                          // b             2870 <sk_store_a8_aarch64+0x44>
+  .long  0x17ffffed                          // b             28a0 <sk_store_a8_aarch64+0x44>
 
 HIDDEN _sk_load_g8_aarch64
 .globl _sk_load_g8_aarch64
@@ -3004,7 +3026,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb50002e4                          // cbnz          x4, 2928 <sk_load_g8_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 2958 <sk_load_g8_aarch64+0x68>
   .long  0x39400109                          // ldrb          w9, [x8]
   .long  0x3940050a                          // ldrb          w10, [x8, #1]
   .long  0x3940090b                          // ldrb          w11, [x8, #2]
@@ -3029,12 +3051,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          2974 <sk_load_g8_aarch64+0xb4>  // b.none
+  .long  0x54000220                          // b.eq          29a4 <sk_load_g8_aarch64+0xb4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e400                          // movi          d0, #0x0
-  .long  0x540000c0                          // b.eq          2954 <sk_load_g8_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          2984 <sk_load_g8_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffd61                          // b.ne          28f0 <sk_load_g8_aarch64+0x30>  // b.any
+  .long  0x54fffd61                          // b.ne          2920 <sk_load_g8_aarch64+0x30>  // b.any
   .long  0x39400909                          // ldrb          w9, [x8, #2]
   .long  0x0e020fe0                          // dup           v0.4h, wzr
   .long  0x4e0a1d20                          // mov           v0.h[2], w9
@@ -3045,11 +3067,11 @@
   .long  0x0e401821                          // uzp1          v1.4h, v1.4h, v0.4h
   .long  0x2e012000                          // ext           v0.8b, v0.8b, v1.8b, #4
   .long  0x2e002000                          // ext           v0.8b, v0.8b, v0.8b, #4
-  .long  0x17ffffe0                          // b             28f0 <sk_load_g8_aarch64+0x30>
+  .long  0x17ffffe0                          // b             2920 <sk_load_g8_aarch64+0x30>
   .long  0x39400108                          // ldrb          w8, [x8]
   .long  0x0e020fe0                          // dup           v0.4h, wzr
   .long  0x4e021d00                          // mov           v0.h[0], w8
-  .long  0x17ffffdc                          // b             28f0 <sk_load_g8_aarch64+0x30>
+  .long  0x17ffffdc                          // b             2920 <sk_load_g8_aarch64+0x30>
 
 HIDDEN _sk_load_g8_dst_aarch64
 .globl _sk_load_g8_dst_aarch64
@@ -3058,7 +3080,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020108                          // add           x8, x8, x2
-  .long  0xb50002e4                          // cbnz          x4, 29ec <sk_load_g8_dst_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 2a1c <sk_load_g8_dst_aarch64+0x68>
   .long  0x39400109                          // ldrb          w9, [x8]
   .long  0x3940050a                          // ldrb          w10, [x8, #1]
   .long  0x3940090b                          // ldrb          w11, [x8, #2]
@@ -3083,12 +3105,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          2a38 <sk_load_g8_dst_aarch64+0xb4>  // b.none
+  .long  0x54000220                          // b.eq          2a68 <sk_load_g8_dst_aarch64+0xb4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e404                          // movi          d4, #0x0
-  .long  0x540000c0                          // b.eq          2a18 <sk_load_g8_dst_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          2a48 <sk_load_g8_dst_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffd61                          // b.ne          29b4 <sk_load_g8_dst_aarch64+0x30>  // b.any
+  .long  0x54fffd61                          // b.ne          29e4 <sk_load_g8_dst_aarch64+0x30>  // b.any
   .long  0x39400909                          // ldrb          w9, [x8, #2]
   .long  0x0e020fe4                          // dup           v4.4h, wzr
   .long  0x4e0a1d24                          // mov           v4.h[2], w9
@@ -3099,11 +3121,11 @@
   .long  0x0e4018a5                          // uzp1          v5.4h, v5.4h, v0.4h
   .long  0x2e052084                          // ext           v4.8b, v4.8b, v5.8b, #4
   .long  0x2e042084                          // ext           v4.8b, v4.8b, v4.8b, #4
-  .long  0x17ffffe0                          // b             29b4 <sk_load_g8_dst_aarch64+0x30>
+  .long  0x17ffffe0                          // b             29e4 <sk_load_g8_dst_aarch64+0x30>
   .long  0x39400108                          // ldrb          w8, [x8]
   .long  0x0e020fe4                          // dup           v4.4h, wzr
   .long  0x4e021d04                          // mov           v4.h[0], w8
-  .long  0x17ffffdc                          // b             29b4 <sk_load_g8_dst_aarch64+0x30>
+  .long  0x17ffffdc                          // b             29e4 <sk_load_g8_dst_aarch64+0x30>
 
 HIDDEN _sk_gather_g8_aarch64
 .globl _sk_gather_g8_aarch64
@@ -3146,9 +3168,9 @@
 _sk_gather_i8_aarch64:
   .long  0xaa0103e8                          // mov           x8, x1
   .long  0xf8408429                          // ldr           x9, [x1], #8
-  .long  0xb4000069                          // cbz           x9, 2ad4 <sk_gather_i8_aarch64+0x14>
+  .long  0xb4000069                          // cbz           x9, 2b04 <sk_gather_i8_aarch64+0x14>
   .long  0xaa0903ea                          // mov           x10, x9
-  .long  0x14000003                          // b             2adc <sk_gather_i8_aarch64+0x1c>
+  .long  0x14000003                          // b             2b0c <sk_gather_i8_aarch64+0x1c>
   .long  0xf940050a                          // ldr           x10, [x8, #8]
   .long  0x91004101                          // add           x1, x8, #0x10
   .long  0xf8410548                          // ldr           x8, [x10], #16
@@ -3211,7 +3233,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
-  .long  0xb50003c4                          // cbnz          x4, 2c30 <sk_load_565_aarch64+0x84>
+  .long  0xb50003c4                          // cbnz          x4, 2c60 <sk_load_565_aarch64+0x84>
   .long  0xfd400100                          // ldr           d0, [x8]
   .long  0x321b17e8                          // orr           w8, wzr, #0x7e0
   .long  0x4e040d02                          // dup           v2.4s, w8
@@ -3243,12 +3265,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          2c7c <sk_load_565_aarch64+0xd0>  // b.none
+  .long  0x54000220                          // b.eq          2cac <sk_load_565_aarch64+0xd0>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e400                          // movi          d0, #0x0
-  .long  0x540000c0                          // b.eq          2c5c <sk_load_565_aarch64+0xb0>  // b.none
+  .long  0x540000c0                          // b.eq          2c8c <sk_load_565_aarch64+0xb0>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffba1                          // b.ne          2bc0 <sk_load_565_aarch64+0x14>  // b.any
+  .long  0x54fffba1                          // b.ne          2bf0 <sk_load_565_aarch64+0x14>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0e020fe0                          // dup           v0.4h, wzr
   .long  0x0d405120                          // ld1           {v0.h}[2], [x9]
@@ -3259,10 +3281,10 @@
   .long  0x0e401821                          // uzp1          v1.4h, v1.4h, v0.4h
   .long  0x2e012000                          // ext           v0.8b, v0.8b, v1.8b, #4
   .long  0x2e002000                          // ext           v0.8b, v0.8b, v0.8b, #4
-  .long  0x17ffffd2                          // b             2bc0 <sk_load_565_aarch64+0x14>
+  .long  0x17ffffd2                          // b             2bf0 <sk_load_565_aarch64+0x14>
   .long  0x0e020fe0                          // dup           v0.4h, wzr
   .long  0x0d404100                          // ld1           {v0.h}[0], [x8]
-  .long  0x17ffffcf                          // b             2bc0 <sk_load_565_aarch64+0x14>
+  .long  0x17ffffcf                          // b             2bf0 <sk_load_565_aarch64+0x14>
 
 HIDDEN _sk_load_565_dst_aarch64
 .globl _sk_load_565_dst_aarch64
@@ -3271,7 +3293,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
-  .long  0xb50003c4                          // cbnz          x4, 2d0c <sk_load_565_dst_aarch64+0x84>
+  .long  0xb50003c4                          // cbnz          x4, 2d3c <sk_load_565_dst_aarch64+0x84>
   .long  0xfd400104                          // ldr           d4, [x8]
   .long  0x321b17e8                          // orr           w8, wzr, #0x7e0
   .long  0x4e040d06                          // dup           v6.4s, w8
@@ -3303,12 +3325,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          2d58 <sk_load_565_dst_aarch64+0xd0>  // b.none
+  .long  0x54000220                          // b.eq          2d88 <sk_load_565_dst_aarch64+0xd0>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e404                          // movi          d4, #0x0
-  .long  0x540000c0                          // b.eq          2d38 <sk_load_565_dst_aarch64+0xb0>  // b.none
+  .long  0x540000c0                          // b.eq          2d68 <sk_load_565_dst_aarch64+0xb0>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffba1                          // b.ne          2c9c <sk_load_565_dst_aarch64+0x14>  // b.any
+  .long  0x54fffba1                          // b.ne          2ccc <sk_load_565_dst_aarch64+0x14>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0e020fe4                          // dup           v4.4h, wzr
   .long  0x0d405124                          // ld1           {v4.h}[2], [x9]
@@ -3319,10 +3341,10 @@
   .long  0x0e4018a5                          // uzp1          v5.4h, v5.4h, v0.4h
   .long  0x2e052084                          // ext           v4.8b, v4.8b, v5.8b, #4
   .long  0x2e042084                          // ext           v4.8b, v4.8b, v4.8b, #4
-  .long  0x17ffffd2                          // b             2c9c <sk_load_565_dst_aarch64+0x14>
+  .long  0x17ffffd2                          // b             2ccc <sk_load_565_dst_aarch64+0x14>
   .long  0x0e020fe4                          // dup           v4.4h, wzr
   .long  0x0d404104                          // ld1           {v4.h}[0], [x8]
-  .long  0x17ffffcf                          // b             2c9c <sk_load_565_dst_aarch64+0x14>
+  .long  0x17ffffcf                          // b             2ccc <sk_load_565_dst_aarch64+0x14>
 
 HIDDEN _sk_gather_565_aarch64
 .globl _sk_gather_565_aarch64
@@ -3394,24 +3416,24 @@
   .long  0x4eb01e30                          // orr           v16.16b, v17.16b, v16.16b
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
   .long  0x0e612a10                          // xtn           v16.4h, v16.4s
-  .long  0xb50000a4                          // cbnz          x4, 2e6c <sk_store_565_aarch64+0x58>
+  .long  0xb50000a4                          // cbnz          x4, 2e9c <sk_store_565_aarch64+0x58>
   .long  0xfd000110                          // str           d16, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000120                          // b.eq          2e98 <sk_store_565_aarch64+0x84>  // b.none
+  .long  0x54000120                          // b.eq          2ec8 <sk_store_565_aarch64+0x84>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
-  .long  0x540000a0                          // b.eq          2e90 <sk_store_565_aarch64+0x7c>  // b.none
+  .long  0x540000a0                          // b.eq          2ec0 <sk_store_565_aarch64+0x7c>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffee1                          // b.ne          2e60 <sk_store_565_aarch64+0x4c>  // b.any
+  .long  0x54fffee1                          // b.ne          2e90 <sk_store_565_aarch64+0x4c>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0d005130                          // st1           {v16.h}[2], [x9]
   .long  0x91000909                          // add           x9, x8, #0x2
   .long  0x0d004930                          // st1           {v16.h}[1], [x9]
   .long  0x0d004110                          // st1           {v16.h}[0], [x8]
-  .long  0x17fffff1                          // b             2e60 <sk_store_565_aarch64+0x4c>
+  .long  0x17fffff1                          // b             2e90 <sk_store_565_aarch64+0x4c>
 
 HIDDEN _sk_load_4444_aarch64
 .globl _sk_load_4444_aarch64
@@ -3420,7 +3442,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
-  .long  0xb5000444                          // cbnz          x4, 2f34 <sk_load_4444_aarch64+0x94>
+  .long  0xb5000444                          // cbnz          x4, 2f64 <sk_load_4444_aarch64+0x94>
   .long  0xfd400100                          // ldr           d0, [x8]
   .long  0x52a6f108                          // mov           w8, #0x37880000
   .long  0x2f10a400                          // uxtl          v0.4s, v0.4h
@@ -3456,12 +3478,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          2f80 <sk_load_4444_aarch64+0xe0>  // b.none
+  .long  0x54000220                          // b.eq          2fb0 <sk_load_4444_aarch64+0xe0>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e400                          // movi          d0, #0x0
-  .long  0x540000c0                          // b.eq          2f60 <sk_load_4444_aarch64+0xc0>  // b.none
+  .long  0x540000c0                          // b.eq          2f90 <sk_load_4444_aarch64+0xc0>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffb21                          // b.ne          2eb4 <sk_load_4444_aarch64+0x14>  // b.any
+  .long  0x54fffb21                          // b.ne          2ee4 <sk_load_4444_aarch64+0x14>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0e020fe0                          // dup           v0.4h, wzr
   .long  0x0d405120                          // ld1           {v0.h}[2], [x9]
@@ -3472,10 +3494,10 @@
   .long  0x0e401821                          // uzp1          v1.4h, v1.4h, v0.4h
   .long  0x2e012000                          // ext           v0.8b, v0.8b, v1.8b, #4
   .long  0x2e002000                          // ext           v0.8b, v0.8b, v0.8b, #4
-  .long  0x17ffffce                          // b             2eb4 <sk_load_4444_aarch64+0x14>
+  .long  0x17ffffce                          // b             2ee4 <sk_load_4444_aarch64+0x14>
   .long  0x0e020fe0                          // dup           v0.4h, wzr
   .long  0x0d404100                          // ld1           {v0.h}[0], [x8]
-  .long  0x17ffffcb                          // b             2eb4 <sk_load_4444_aarch64+0x14>
+  .long  0x17ffffcb                          // b             2ee4 <sk_load_4444_aarch64+0x14>
 
 HIDDEN _sk_load_4444_dst_aarch64
 .globl _sk_load_4444_dst_aarch64
@@ -3484,7 +3506,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
-  .long  0xb5000444                          // cbnz          x4, 3020 <sk_load_4444_dst_aarch64+0x94>
+  .long  0xb5000444                          // cbnz          x4, 3050 <sk_load_4444_dst_aarch64+0x94>
   .long  0xfd400104                          // ldr           d4, [x8]
   .long  0x52a6f108                          // mov           w8, #0x37880000
   .long  0x2f10a484                          // uxtl          v4.4s, v4.4h
@@ -3520,12 +3542,12 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000220                          // b.eq          306c <sk_load_4444_dst_aarch64+0xe0>  // b.none
+  .long  0x54000220                          // b.eq          309c <sk_load_4444_dst_aarch64+0xe0>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x2f00e404                          // movi          d4, #0x0
-  .long  0x540000c0                          // b.eq          304c <sk_load_4444_dst_aarch64+0xc0>  // b.none
+  .long  0x540000c0                          // b.eq          307c <sk_load_4444_dst_aarch64+0xc0>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffb21                          // b.ne          2fa0 <sk_load_4444_dst_aarch64+0x14>  // b.any
+  .long  0x54fffb21                          // b.ne          2fd0 <sk_load_4444_dst_aarch64+0x14>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0e020fe4                          // dup           v4.4h, wzr
   .long  0x0d405124                          // ld1           {v4.h}[2], [x9]
@@ -3536,10 +3558,10 @@
   .long  0x0e4018a5                          // uzp1          v5.4h, v5.4h, v0.4h
   .long  0x2e052084                          // ext           v4.8b, v4.8b, v5.8b, #4
   .long  0x2e042084                          // ext           v4.8b, v4.8b, v4.8b, #4
-  .long  0x17ffffce                          // b             2fa0 <sk_load_4444_dst_aarch64+0x14>
+  .long  0x17ffffce                          // b             2fd0 <sk_load_4444_dst_aarch64+0x14>
   .long  0x0e020fe4                          // dup           v4.4h, wzr
   .long  0x0d404104                          // ld1           {v4.h}[0], [x8]
-  .long  0x17ffffcb                          // b             2fa0 <sk_load_4444_dst_aarch64+0x14>
+  .long  0x17ffffcb                          // b             2fd0 <sk_load_4444_dst_aarch64+0x14>
 
 HIDDEN _sk_gather_4444_aarch64
 .globl _sk_gather_4444_aarch64
@@ -3618,24 +3640,24 @@
   .long  0x4eb01e30                          // orr           v16.16b, v17.16b, v16.16b
   .long  0x8b020508                          // add           x8, x8, x2, lsl #1
   .long  0x0e612a10                          // xtn           v16.4h, v16.4s
-  .long  0xb50000a4                          // cbnz          x4, 319c <sk_store_4444_aarch64+0x60>
+  .long  0xb50000a4                          // cbnz          x4, 31cc <sk_store_4444_aarch64+0x60>
   .long  0xfd000110                          // str           d16, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000120                          // b.eq          31c8 <sk_store_4444_aarch64+0x8c>  // b.none
+  .long  0x54000120                          // b.eq          31f8 <sk_store_4444_aarch64+0x8c>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
-  .long  0x540000a0                          // b.eq          31c0 <sk_store_4444_aarch64+0x84>  // b.none
+  .long  0x540000a0                          // b.eq          31f0 <sk_store_4444_aarch64+0x84>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffee1                          // b.ne          3190 <sk_store_4444_aarch64+0x54>  // b.any
+  .long  0x54fffee1                          // b.ne          31c0 <sk_store_4444_aarch64+0x54>  // b.any
   .long  0x91001109                          // add           x9, x8, #0x4
   .long  0x0d005130                          // st1           {v16.h}[2], [x9]
   .long  0x91000909                          // add           x9, x8, #0x2
   .long  0x0d004930                          // st1           {v16.h}[1], [x9]
   .long  0x0d004110                          // st1           {v16.h}[0], [x8]
-  .long  0x17fffff1                          // b             3190 <sk_store_4444_aarch64+0x54>
+  .long  0x17fffff1                          // b             31c0 <sk_store_4444_aarch64+0x54>
 
 HIDDEN _sk_load_8888_aarch64
 .globl _sk_load_8888_aarch64
@@ -3644,7 +3666,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020908                          // add           x8, x8, x2, lsl #2
-  .long  0xb50002e4                          // cbnz          x4, 3238 <sk_load_8888_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 3268 <sk_load_8888_aarch64+0x68>
   .long  0x3dc00100                          // ldr           q0, [x8]
   .long  0x6f00e621                          // movi          v1.2d, #0xff000000ff
   .long  0x52a77008                          // mov           w8, #0x3b800000
@@ -3669,22 +3691,22 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x540001a0                          // b.eq          3274 <sk_load_8888_aarch64+0xa4>  // b.none
+  .long  0x540001a0                          // b.eq          32a4 <sk_load_8888_aarch64+0xa4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x6f00e400                          // movi          v0.2d, #0x0
-  .long  0x540000c0                          // b.eq          3264 <sk_load_8888_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          3294 <sk_load_8888_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffc81                          // b.ne          31e4 <sk_load_8888_aarch64+0x14>  // b.any
+  .long  0x54fffc81                          // b.ne          3214 <sk_load_8888_aarch64+0x14>  // b.any
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x4e040fe0                          // dup           v0.4s, wzr
   .long  0x4d408120                          // ld1           {v0.s}[2], [x9]
   .long  0xfd400101                          // ldr           d1, [x8]
   .long  0x6e014000                          // ext           v0.16b, v0.16b, v1.16b, #8
   .long  0x6e004000                          // ext           v0.16b, v0.16b, v0.16b, #8
-  .long  0x17ffffdd                          // b             31e4 <sk_load_8888_aarch64+0x14>
+  .long  0x17ffffdd                          // b             3214 <sk_load_8888_aarch64+0x14>
   .long  0x4e040fe0                          // dup           v0.4s, wzr
   .long  0x0d408100                          // ld1           {v0.s}[0], [x8]
-  .long  0x17ffffda                          // b             31e4 <sk_load_8888_aarch64+0x14>
+  .long  0x17ffffda                          // b             3214 <sk_load_8888_aarch64+0x14>
 
 HIDDEN _sk_load_8888_dst_aarch64
 .globl _sk_load_8888_dst_aarch64
@@ -3693,7 +3715,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020908                          // add           x8, x8, x2, lsl #2
-  .long  0xb50002e4                          // cbnz          x4, 32e8 <sk_load_8888_dst_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 3318 <sk_load_8888_dst_aarch64+0x68>
   .long  0x3dc00104                          // ldr           q4, [x8]
   .long  0x6f00e625                          // movi          v5.2d, #0xff000000ff
   .long  0x52a77008                          // mov           w8, #0x3b800000
@@ -3718,22 +3740,22 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x540001a0                          // b.eq          3324 <sk_load_8888_dst_aarch64+0xa4>  // b.none
+  .long  0x540001a0                          // b.eq          3354 <sk_load_8888_dst_aarch64+0xa4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x6f00e404                          // movi          v4.2d, #0x0
-  .long  0x540000c0                          // b.eq          3314 <sk_load_8888_dst_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          3344 <sk_load_8888_dst_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffc81                          // b.ne          3294 <sk_load_8888_dst_aarch64+0x14>  // b.any
+  .long  0x54fffc81                          // b.ne          32c4 <sk_load_8888_dst_aarch64+0x14>  // b.any
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x4e040fe4                          // dup           v4.4s, wzr
   .long  0x4d408124                          // ld1           {v4.s}[2], [x9]
   .long  0xfd400105                          // ldr           d5, [x8]
   .long  0x6e054084                          // ext           v4.16b, v4.16b, v5.16b, #8
   .long  0x6e044084                          // ext           v4.16b, v4.16b, v4.16b, #8
-  .long  0x17ffffdd                          // b             3294 <sk_load_8888_dst_aarch64+0x14>
+  .long  0x17ffffdd                          // b             32c4 <sk_load_8888_dst_aarch64+0x14>
   .long  0x4e040fe4                          // dup           v4.4s, wzr
   .long  0x0d408104                          // ld1           {v4.s}[0], [x8]
-  .long  0x17ffffda                          // b             3294 <sk_load_8888_dst_aarch64+0x14>
+  .long  0x17ffffda                          // b             32c4 <sk_load_8888_dst_aarch64+0x14>
 
 HIDDEN _sk_gather_8888_aarch64
 .globl _sk_gather_8888_aarch64
@@ -3801,24 +3823,24 @@
   .long  0x4eb21e31                          // orr           v17.16b, v17.16b, v18.16b
   .long  0x8b020908                          // add           x8, x8, x2, lsl #2
   .long  0x4eb01e30                          // orr           v16.16b, v17.16b, v16.16b
-  .long  0xb50000a4                          // cbnz          x4, 3428 <sk_store_8888_aarch64+0x60>
+  .long  0xb50000a4                          // cbnz          x4, 3458 <sk_store_8888_aarch64+0x60>
   .long  0x3d800110                          // str           q16, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000120                          // b.eq          3454 <sk_store_8888_aarch64+0x8c>  // b.none
+  .long  0x54000120                          // b.eq          3484 <sk_store_8888_aarch64+0x8c>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
-  .long  0x540000a0                          // b.eq          344c <sk_store_8888_aarch64+0x84>  // b.none
+  .long  0x540000a0                          // b.eq          347c <sk_store_8888_aarch64+0x84>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffee1                          // b.ne          341c <sk_store_8888_aarch64+0x54>  // b.any
+  .long  0x54fffee1                          // b.ne          344c <sk_store_8888_aarch64+0x54>  // b.any
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x4d008130                          // st1           {v16.s}[2], [x9]
   .long  0xfd000110                          // str           d16, [x8]
-  .long  0x17fffff3                          // b             341c <sk_store_8888_aarch64+0x54>
+  .long  0x17fffff3                          // b             344c <sk_store_8888_aarch64+0x54>
   .long  0x0d008110                          // st1           {v16.s}[0], [x8]
-  .long  0x17fffff1                          // b             341c <sk_store_8888_aarch64+0x54>
+  .long  0x17fffff1                          // b             344c <sk_store_8888_aarch64+0x54>
 
 HIDDEN _sk_load_bgra_aarch64
 .globl _sk_load_bgra_aarch64
@@ -3827,7 +3849,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020908                          // add           x8, x8, x2, lsl #2
-  .long  0xb50002e4                          // cbnz          x4, 34c4 <sk_load_bgra_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 34f4 <sk_load_bgra_aarch64+0x68>
   .long  0x3dc00100                          // ldr           q0, [x8]
   .long  0x6f00e621                          // movi          v1.2d, #0xff000000ff
   .long  0x52a77008                          // mov           w8, #0x3b800000
@@ -3852,22 +3874,22 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x540001a0                          // b.eq          3500 <sk_load_bgra_aarch64+0xa4>  // b.none
+  .long  0x540001a0                          // b.eq          3530 <sk_load_bgra_aarch64+0xa4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x6f00e400                          // movi          v0.2d, #0x0
-  .long  0x540000c0                          // b.eq          34f0 <sk_load_bgra_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          3520 <sk_load_bgra_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffc81                          // b.ne          3470 <sk_load_bgra_aarch64+0x14>  // b.any
+  .long  0x54fffc81                          // b.ne          34a0 <sk_load_bgra_aarch64+0x14>  // b.any
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x4e040fe0                          // dup           v0.4s, wzr
   .long  0x4d408120                          // ld1           {v0.s}[2], [x9]
   .long  0xfd400101                          // ldr           d1, [x8]
   .long  0x6e014000                          // ext           v0.16b, v0.16b, v1.16b, #8
   .long  0x6e004000                          // ext           v0.16b, v0.16b, v0.16b, #8
-  .long  0x17ffffdd                          // b             3470 <sk_load_bgra_aarch64+0x14>
+  .long  0x17ffffdd                          // b             34a0 <sk_load_bgra_aarch64+0x14>
   .long  0x4e040fe0                          // dup           v0.4s, wzr
   .long  0x0d408100                          // ld1           {v0.s}[0], [x8]
-  .long  0x17ffffda                          // b             3470 <sk_load_bgra_aarch64+0x14>
+  .long  0x17ffffda                          // b             34a0 <sk_load_bgra_aarch64+0x14>
 
 HIDDEN _sk_load_bgra_dst_aarch64
 .globl _sk_load_bgra_dst_aarch64
@@ -3876,7 +3898,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020908                          // add           x8, x8, x2, lsl #2
-  .long  0xb50002e4                          // cbnz          x4, 3574 <sk_load_bgra_dst_aarch64+0x68>
+  .long  0xb50002e4                          // cbnz          x4, 35a4 <sk_load_bgra_dst_aarch64+0x68>
   .long  0x3dc00104                          // ldr           q4, [x8]
   .long  0x6f00e625                          // movi          v5.2d, #0xff000000ff
   .long  0x52a77008                          // mov           w8, #0x3b800000
@@ -3901,22 +3923,22 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x540001a0                          // b.eq          35b0 <sk_load_bgra_dst_aarch64+0xa4>  // b.none
+  .long  0x540001a0                          // b.eq          35e0 <sk_load_bgra_dst_aarch64+0xa4>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
   .long  0x6f00e404                          // movi          v4.2d, #0x0
-  .long  0x540000c0                          // b.eq          35a0 <sk_load_bgra_dst_aarch64+0x94>  // b.none
+  .long  0x540000c0                          // b.eq          35d0 <sk_load_bgra_dst_aarch64+0x94>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffc81                          // b.ne          3520 <sk_load_bgra_dst_aarch64+0x14>  // b.any
+  .long  0x54fffc81                          // b.ne          3550 <sk_load_bgra_dst_aarch64+0x14>  // b.any
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x4e040fe4                          // dup           v4.4s, wzr
   .long  0x4d408124                          // ld1           {v4.s}[2], [x9]
   .long  0xfd400105                          // ldr           d5, [x8]
   .long  0x6e054084                          // ext           v4.16b, v4.16b, v5.16b, #8
   .long  0x6e044084                          // ext           v4.16b, v4.16b, v4.16b, #8
-  .long  0x17ffffdd                          // b             3520 <sk_load_bgra_dst_aarch64+0x14>
+  .long  0x17ffffdd                          // b             3550 <sk_load_bgra_dst_aarch64+0x14>
   .long  0x4e040fe4                          // dup           v4.4s, wzr
   .long  0x0d408104                          // ld1           {v4.s}[0], [x8]
-  .long  0x17ffffda                          // b             3520 <sk_load_bgra_dst_aarch64+0x14>
+  .long  0x17ffffda                          // b             3550 <sk_load_bgra_dst_aarch64+0x14>
 
 HIDDEN _sk_gather_bgra_aarch64
 .globl _sk_gather_bgra_aarch64
@@ -3984,24 +4006,24 @@
   .long  0x4eb21e31                          // orr           v17.16b, v17.16b, v18.16b
   .long  0x8b020908                          // add           x8, x8, x2, lsl #2
   .long  0x4eb01e30                          // orr           v16.16b, v17.16b, v16.16b
-  .long  0xb50000a4                          // cbnz          x4, 36b4 <sk_store_bgra_aarch64+0x60>
+  .long  0xb50000a4                          // cbnz          x4, 36e4 <sk_store_bgra_aarch64+0x60>
   .long  0x3d800110                          // str           q16, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0x12000489                          // and           w9, w4, #0x3
   .long  0x7100053f                          // cmp           w9, #0x1
-  .long  0x54000120                          // b.eq          36e0 <sk_store_bgra_aarch64+0x8c>  // b.none
+  .long  0x54000120                          // b.eq          3710 <sk_store_bgra_aarch64+0x8c>  // b.none
   .long  0x7100093f                          // cmp           w9, #0x2
-  .long  0x540000a0                          // b.eq          36d8 <sk_store_bgra_aarch64+0x84>  // b.none
+  .long  0x540000a0                          // b.eq          3708 <sk_store_bgra_aarch64+0x84>  // b.none
   .long  0x71000d3f                          // cmp           w9, #0x3
-  .long  0x54fffee1                          // b.ne          36a8 <sk_store_bgra_aarch64+0x54>  // b.any
+  .long  0x54fffee1                          // b.ne          36d8 <sk_store_bgra_aarch64+0x54>  // b.any
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x4d008130                          // st1           {v16.s}[2], [x9]
   .long  0xfd000110                          // str           d16, [x8]
-  .long  0x17fffff3                          // b             36a8 <sk_store_bgra_aarch64+0x54>
+  .long  0x17fffff3                          // b             36d8 <sk_store_bgra_aarch64+0x54>
   .long  0x0d008110                          // st1           {v16.s}[0], [x8]
-  .long  0x17fffff1                          // b             36a8 <sk_store_bgra_aarch64+0x54>
+  .long  0x17fffff1                          // b             36d8 <sk_store_bgra_aarch64+0x54>
 
 HIDDEN _sk_load_f16_aarch64
 .globl _sk_load_f16_aarch64
@@ -4010,7 +4032,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020d08                          // add           x8, x8, x2, lsl #3
-  .long  0xb5000124                          // cbnz          x4, 3718 <sk_load_f16_aarch64+0x30>
+  .long  0xb5000124                          // cbnz          x4, 3748 <sk_load_f16_aarch64+0x30>
   .long  0x0c400510                          // ld4           {v16.4h-v19.4h}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x0e217a00                          // fcvtl         v0.4s, v16.4h
@@ -4021,14 +4043,14 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x0d606110                          // ld4           {v16.h-v19.h}[0], [x8]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54fffee0                          // b.eq          36fc <sk_load_f16_aarch64+0x14>  // b.none
+  .long  0x54fffee0                          // b.eq          372c <sk_load_f16_aarch64+0x14>  // b.none
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x0d606930                          // ld4           {v16.h-v19.h}[1], [x9]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fffe63                          // b.cc          36fc <sk_load_f16_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fffe63                          // b.cc          372c <sk_load_f16_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91004108                          // add           x8, x8, #0x10
   .long  0x0d607110                          // ld4           {v16.h-v19.h}[2], [x8]
-  .long  0x17fffff0                          // b             36fc <sk_load_f16_aarch64+0x14>
+  .long  0x17fffff0                          // b             372c <sk_load_f16_aarch64+0x14>
 
 HIDDEN _sk_load_f16_dst_aarch64
 .globl _sk_load_f16_dst_aarch64
@@ -4037,7 +4059,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020d08                          // add           x8, x8, x2, lsl #3
-  .long  0xb5000124                          // cbnz          x4, 3770 <sk_load_f16_dst_aarch64+0x30>
+  .long  0xb5000124                          // cbnz          x4, 37a0 <sk_load_f16_dst_aarch64+0x30>
   .long  0x0c400510                          // ld4           {v16.4h-v19.4h}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x0e217a04                          // fcvtl         v4.4s, v16.4h
@@ -4048,14 +4070,14 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x0d606110                          // ld4           {v16.h-v19.h}[0], [x8]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54fffee0                          // b.eq          3754 <sk_load_f16_dst_aarch64+0x14>  // b.none
+  .long  0x54fffee0                          // b.eq          3784 <sk_load_f16_dst_aarch64+0x14>  // b.none
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x0d606930                          // ld4           {v16.h-v19.h}[1], [x9]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fffe63                          // b.cc          3754 <sk_load_f16_dst_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fffe63                          // b.cc          3784 <sk_load_f16_dst_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91004108                          // add           x8, x8, #0x10
   .long  0x0d607110                          // ld4           {v16.h-v19.h}[2], [x8]
-  .long  0x17fffff0                          // b             3754 <sk_load_f16_dst_aarch64+0x14>
+  .long  0x17fffff0                          // b             3784 <sk_load_f16_dst_aarch64+0x14>
 
 HIDDEN _sk_gather_f16_aarch64
 .globl _sk_gather_f16_aarch64
@@ -4109,21 +4131,21 @@
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x0e216873                          // fcvtn         v19.4h, v3.4s
   .long  0x8b020d08                          // add           x8, x8, x2, lsl #3
-  .long  0xb50000a4                          // cbnz          x4, 3858 <sk_store_f16_aarch64+0x30>
+  .long  0xb50000a4                          // cbnz          x4, 3888 <sk_store_f16_aarch64+0x30>
   .long  0x0c000510                          // st4           {v16.4h-v19.4h}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0xf100049f                          // cmp           x4, #0x1
   .long  0x0d206110                          // st4           {v16.h-v19.h}[0], [x8]
-  .long  0x54ffff60                          // b.eq          384c <sk_store_f16_aarch64+0x24>  // b.none
+  .long  0x54ffff60                          // b.eq          387c <sk_store_f16_aarch64+0x24>  // b.none
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0xf1000c9f                          // cmp           x4, #0x3
   .long  0x0d206930                          // st4           {v16.h-v19.h}[1], [x9]
-  .long  0x54fffee3                          // b.cc          384c <sk_store_f16_aarch64+0x24>  // b.lo, b.ul, b.last
+  .long  0x54fffee3                          // b.cc          387c <sk_store_f16_aarch64+0x24>  // b.lo, b.ul, b.last
   .long  0x91004108                          // add           x8, x8, #0x10
   .long  0x0d207110                          // st4           {v16.h-v19.h}[2], [x8]
-  .long  0x17fffff4                          // b             384c <sk_store_f16_aarch64+0x24>
+  .long  0x17fffff4                          // b             387c <sk_store_f16_aarch64+0x24>
 
 HIDDEN _sk_load_u16_be_aarch64
 .globl _sk_load_u16_be_aarch64
@@ -4132,7 +4154,7 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b020d08                          // add           x8, x8, x2, lsl #3
-  .long  0xb5000404                          // cbnz          x4, 390c <sk_load_u16_be_aarch64+0x8c>
+  .long  0xb5000404                          // cbnz          x4, 393c <sk_load_u16_be_aarch64+0x8c>
   .long  0x0c400500                          // ld4           {v0.4h-v3.4h}, [x8]
   .long  0x0f185410                          // shl           v16.4h, v0.4h, #8
   .long  0x2f180411                          // ushr          v17.4h, v0.4h, #8
@@ -4166,14 +4188,14 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x0d606100                          // ld4           {v0.h-v3.h}[0], [x8]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54fffc00                          // b.eq          3894 <sk_load_u16_be_aarch64+0x14>  // b.none
+  .long  0x54fffc00                          // b.eq          38c4 <sk_load_u16_be_aarch64+0x14>  // b.none
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0x0d606920                          // ld4           {v0.h-v3.h}[1], [x9]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fffb83                          // b.cc          3894 <sk_load_u16_be_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fffb83                          // b.cc          38c4 <sk_load_u16_be_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91004108                          // add           x8, x8, #0x10
   .long  0x0d607100                          // ld4           {v0.h-v3.h}[2], [x8]
-  .long  0x17ffffd9                          // b             3894 <sk_load_u16_be_aarch64+0x14>
+  .long  0x17ffffd9                          // b             38c4 <sk_load_u16_be_aarch64+0x14>
 
 HIDDEN _sk_load_rgb_u16_be_aarch64
 .globl _sk_load_rgb_u16_be_aarch64
@@ -4183,7 +4205,7 @@
   .long  0x321f07e9                          // orr           w9, wzr, #0x6
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x9b092048                          // madd          x8, x2, x9, x8
-  .long  0xb5000384                          // cbnz          x4, 39b4 <sk_load_rgb_u16_be_aarch64+0x80>
+  .long  0xb5000384                          // cbnz          x4, 39e4 <sk_load_rgb_u16_be_aarch64+0x80>
   .long  0x0c404500                          // ld3           {v0.4h-v2.4h}, [x8]
   .long  0x0f185403                          // shl           v3.4h, v0.4h, #8
   .long  0x2f180410                          // ushr          v16.4h, v0.4h, #8
@@ -4213,14 +4235,14 @@
   .long  0xd61f00a0                          // br            x5
   .long  0x0d406100                          // ld3           {v0.h-v2.h}[0], [x8]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54fffc80                          // b.eq          394c <sk_load_rgb_u16_be_aarch64+0x18>  // b.none
+  .long  0x54fffc80                          // b.eq          397c <sk_load_rgb_u16_be_aarch64+0x18>  // b.none
   .long  0x91001909                          // add           x9, x8, #0x6
   .long  0x0d406920                          // ld3           {v0.h-v2.h}[1], [x9]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fffc03                          // b.cc          394c <sk_load_rgb_u16_be_aarch64+0x18>  // b.lo, b.ul, b.last
+  .long  0x54fffc03                          // b.cc          397c <sk_load_rgb_u16_be_aarch64+0x18>  // b.lo, b.ul, b.last
   .long  0x91003108                          // add           x8, x8, #0xc
   .long  0x0d407100                          // ld3           {v0.h-v2.h}[2], [x8]
-  .long  0x17ffffdd                          // b             394c <sk_load_rgb_u16_be_aarch64+0x18>
+  .long  0x17ffffdd                          // b             397c <sk_load_rgb_u16_be_aarch64+0x18>
 
 HIDDEN _sk_store_u16_be_aarch64
 .globl _sk_store_u16_be_aarch64
@@ -4256,21 +4278,21 @@
   .long  0x2f180694                          // ushr          v20.4h, v20.4h, #8
   .long  0x8b020d08                          // add           x8, x8, x2, lsl #3
   .long  0x0eb41eb3                          // orr           v19.8b, v21.8b, v20.8b
-  .long  0xb50000a4                          // cbnz          x4, 3a68 <sk_store_u16_be_aarch64+0x8c>
+  .long  0xb50000a4                          // cbnz          x4, 3a98 <sk_store_u16_be_aarch64+0x8c>
   .long  0x0c000510                          // st4           {v16.4h-v19.4h}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0xf100049f                          // cmp           x4, #0x1
   .long  0x0d206110                          // st4           {v16.h-v19.h}[0], [x8]
-  .long  0x54ffff60                          // b.eq          3a5c <sk_store_u16_be_aarch64+0x80>  // b.none
+  .long  0x54ffff60                          // b.eq          3a8c <sk_store_u16_be_aarch64+0x80>  // b.none
   .long  0x91002109                          // add           x9, x8, #0x8
   .long  0xf1000c9f                          // cmp           x4, #0x3
   .long  0x0d206930                          // st4           {v16.h-v19.h}[1], [x9]
-  .long  0x54fffee3                          // b.cc          3a5c <sk_store_u16_be_aarch64+0x80>  // b.lo, b.ul, b.last
+  .long  0x54fffee3                          // b.cc          3a8c <sk_store_u16_be_aarch64+0x80>  // b.lo, b.ul, b.last
   .long  0x91004108                          // add           x8, x8, #0x10
   .long  0x0d207110                          // st4           {v16.h-v19.h}[2], [x8]
-  .long  0x17fffff4                          // b             3a5c <sk_store_u16_be_aarch64+0x80>
+  .long  0x17fffff4                          // b             3a8c <sk_store_u16_be_aarch64+0x80>
 
 HIDDEN _sk_load_f32_aarch64
 .globl _sk_load_f32_aarch64
@@ -4279,21 +4301,21 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b021108                          // add           x8, x8, x2, lsl #4
-  .long  0xb50000a4                          // cbnz          x4, 3ab0 <sk_load_f32_aarch64+0x20>
+  .long  0xb50000a4                          // cbnz          x4, 3ae0 <sk_load_f32_aarch64+0x20>
   .long  0x4c400900                          // ld4           {v0.4s-v3.4s}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0x0d60a100                          // ld4           {v0.s-v3.s}[0], [x8]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54ffff60                          // b.eq          3aa4 <sk_load_f32_aarch64+0x14>  // b.none
+  .long  0x54ffff60                          // b.eq          3ad4 <sk_load_f32_aarch64+0x14>  // b.none
   .long  0x91004109                          // add           x9, x8, #0x10
   .long  0x0d60b120                          // ld4           {v0.s-v3.s}[1], [x9]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fffee3                          // b.cc          3aa4 <sk_load_f32_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fffee3                          // b.cc          3ad4 <sk_load_f32_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91008108                          // add           x8, x8, #0x20
   .long  0x4d60a100                          // ld4           {v0.s-v3.s}[2], [x8]
-  .long  0x17fffff4                          // b             3aa4 <sk_load_f32_aarch64+0x14>
+  .long  0x17fffff4                          // b             3ad4 <sk_load_f32_aarch64+0x14>
 
 HIDDEN _sk_load_f32_dst_aarch64
 .globl _sk_load_f32_dst_aarch64
@@ -4302,21 +4324,21 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b021108                          // add           x8, x8, x2, lsl #4
-  .long  0xb50000a4                          // cbnz          x4, 3af8 <sk_load_f32_dst_aarch64+0x20>
+  .long  0xb50000a4                          // cbnz          x4, 3b28 <sk_load_f32_dst_aarch64+0x20>
   .long  0x4c400904                          // ld4           {v4.4s-v7.4s}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0x0d60a104                          // ld4           {v4.s-v7.s}[0], [x8]
   .long  0xf100049f                          // cmp           x4, #0x1
-  .long  0x54ffff60                          // b.eq          3aec <sk_load_f32_dst_aarch64+0x14>  // b.none
+  .long  0x54ffff60                          // b.eq          3b1c <sk_load_f32_dst_aarch64+0x14>  // b.none
   .long  0x91004109                          // add           x9, x8, #0x10
   .long  0x0d60b124                          // ld4           {v4.s-v7.s}[1], [x9]
   .long  0xf1000c9f                          // cmp           x4, #0x3
-  .long  0x54fffee3                          // b.cc          3aec <sk_load_f32_dst_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fffee3                          // b.cc          3b1c <sk_load_f32_dst_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91008108                          // add           x8, x8, #0x20
   .long  0x4d60a104                          // ld4           {v4.s-v7.s}[2], [x8]
-  .long  0x17fffff4                          // b             3aec <sk_load_f32_dst_aarch64+0x14>
+  .long  0x17fffff4                          // b             3b1c <sk_load_f32_dst_aarch64+0x14>
 
 HIDDEN _sk_store_f32_aarch64
 .globl _sk_store_f32_aarch64
@@ -4325,21 +4347,21 @@
   .long  0xf9400028                          // ldr           x8, [x1]
   .long  0xf9400108                          // ldr           x8, [x8]
   .long  0x8b021108                          // add           x8, x8, x2, lsl #4
-  .long  0xb50000a4                          // cbnz          x4, 3b40 <sk_store_f32_aarch64+0x20>
+  .long  0xb50000a4                          // cbnz          x4, 3b70 <sk_store_f32_aarch64+0x20>
   .long  0x4c000900                          // st4           {v0.4s-v3.4s}, [x8]
   .long  0xf9400425                          // ldr           x5, [x1, #8]
   .long  0x91004021                          // add           x1, x1, #0x10
   .long  0xd61f00a0                          // br            x5
   .long  0xf100049f                          // cmp           x4, #0x1
   .long  0x0d20a100                          // st4           {v0.s-v3.s}[0], [x8]
-  .long  0x54ffff60                          // b.eq          3b34 <sk_store_f32_aarch64+0x14>  // b.none
+  .long  0x54ffff60                          // b.eq          3b64 <sk_store_f32_aarch64+0x14>  // b.none
   .long  0x91004109                          // add           x9, x8, #0x10
   .long  0xf1000c9f                          // cmp           x4, #0x3
   .long  0x0d20b120                          // st4           {v0.s-v3.s}[1], [x9]
-  .long  0x54fffee3                          // b.cc          3b34 <sk_store_f32_aarch64+0x14>  // b.lo, b.ul, b.last
+  .long  0x54fffee3                          // b.cc          3b64 <sk_store_f32_aarch64+0x14>  // b.lo, b.ul, b.last
   .long  0x91008108                          // add           x8, x8, #0x20
   .long  0x4d20a100                          // st4           {v0.s-v3.s}[2], [x8]
-  .long  0x17fffff4                          // b             3b34 <sk_store_f32_aarch64+0x14>
+  .long  0x17fffff4                          // b             3b64 <sk_store_f32_aarch64+0x14>
 
 HIDDEN _sk_clamp_x_aarch64
 .globl _sk_clamp_x_aarch64
@@ -4824,7 +4846,7 @@
   .long  0x6f00e411                          // movi          v17.2d, #0x0
   .long  0xf9400109                          // ldr           x9, [x8]
   .long  0xf100093f                          // cmp           x9, #0x2
-  .long  0x540001c3                          // b.cc          41a0 <sk_gradient_aarch64+0x58>  // b.lo, b.ul, b.last
+  .long  0x540001c3                          // b.cc          41d0 <sk_gradient_aarch64+0x58>  // b.lo, b.ul, b.last
   .long  0xf940250a                          // ldr           x10, [x8, #72]
   .long  0xd1000529                          // sub           x9, x9, #0x1
   .long  0x6f00e401                          // movi          v1.2d, #0x0
@@ -4835,7 +4857,7 @@
   .long  0x6e23e403                          // fcmge         v3.4s, v0.4s, v3.4s
   .long  0x4e221c63                          // and           v3.16b, v3.16b, v2.16b
   .long  0x4ea18461                          // add           v1.4s, v3.4s, v1.4s
-  .long  0xb5ffff69                          // cbnz          x9, 4180 <sk_gradient_aarch64+0x38>
+  .long  0xb5ffff69                          // cbnz          x9, 41b0 <sk_gradient_aarch64+0x38>
   .long  0x6f20a431                          // uxtl2         v17.2d, v1.4s
   .long  0x2f20a421                          // uxtl          v1.2d, v1.2s
   .long  0xa940b10a                          // ldp           x10, x12, [x8, #8]
@@ -5580,10 +5602,10 @@
   .long  0xbefc0000                          // .word         0xbefc0000
   .long  0xbefc0000                          // .word         0xbefc0000
 
-HIDDEN _sk_constant_color_vfp4
-.globl _sk_constant_color_vfp4
-FUNCTION(_sk_constant_color_vfp4)
-_sk_constant_color_vfp4:
+HIDDEN _sk_uniform_color_vfp4
+.globl _sk_uniform_color_vfp4
+FUNCTION(_sk_uniform_color_vfp4)
+_sk_uniform_color_vfp4:
   .long  0xe92d4830                          // push          {r4, r5, fp, lr}
   .long  0xe591e000                          // ldr           lr, [r1]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -5598,6 +5620,28 @@
   .long  0xe8bd4830                          // pop           {r4, r5, fp, lr}
   .long  0xe12fff1c                          // bx            ip
 
+HIDDEN _sk_black_color_vfp4
+.globl _sk_black_color_vfp4
+FUNCTION(_sk_black_color_vfp4)
+_sk_black_color_vfp4:
+  .long  0xe491c004                          // ldr           ip, [r1], #4
+  .long  0xf2800010                          // vmov.i32      d0, #0
+  .long  0xf2801010                          // vmov.i32      d1, #0
+  .long  0xf2802010                          // vmov.i32      d2, #0
+  .long  0xf2873f10                          // vmov.f32      d3, #1
+  .long  0xe12fff1c                          // bx            ip
+
+HIDDEN _sk_white_color_vfp4
+.globl _sk_white_color_vfp4
+FUNCTION(_sk_white_color_vfp4)
+_sk_white_color_vfp4:
+  .long  0xe491c004                          // ldr           ip, [r1], #4
+  .long  0xf2870f10                          // vmov.f32      d0, #1
+  .long  0xf2871f10                          // vmov.f32      d1, #1
+  .long  0xf2872f10                          // vmov.f32      d2, #1
+  .long  0xf2873f10                          // vmov.f32      d3, #1
+  .long  0xe12fff1c                          // bx            ip
+
 HIDDEN _sk_load_rgba_vfp4
 .globl _sk_load_rgba_vfp4
 FUNCTION(_sk_load_rgba_vfp4)
@@ -6850,7 +6894,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc102                          // add           ip, ip, r2, lsl #2
-  .long  0x0a00002c                          // beq           13c8 <sk_srcover_rgba_8888_vfp4+0xd0>
+  .long  0x0a00002c                          // beq           13f8 <sk_srcover_rgba_8888_vfp4+0xd0>
   .long  0xed9c4b00                          // vldr          d4, [ip]
   .long  0xf2c71f10                          // vmov.f32      d17, #1
   .long  0xeddf6b2f                          // vldr          d22, [pc, #188]
@@ -6890,7 +6934,7 @@
   .long  0xf2f00530                          // vshl.s32      d16, d16, #16
   .long  0xf26111b2                          // vorr          d17, d17, d18
   .long  0xf26101b0                          // vorr          d16, d17, d16
-  .long  0x0a000007                          // beq           13d4 <sk_srcover_rgba_8888_vfp4+0xdc>
+  .long  0x0a000007                          // beq           1404 <sk_srcover_rgba_8888_vfp4+0xdc>
   .long  0xedcc0b00                          // vstr          d16, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
   .long  0xe2811008                          // add           r1, r1, #8
@@ -6898,9 +6942,9 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xeddf4a06                          // vldr          s9, [pc, #24]
   .long  0xed9c4a00                          // vldr          s8, [ip]
-  .long  0xeaffffd0                          // b             1318 <sk_srcover_rgba_8888_vfp4+0x20>
+  .long  0xeaffffd0                          // b             1348 <sk_srcover_rgba_8888_vfp4+0x20>
   .long  0xf4cc083f                          // vst1.32       {d16[0]}, [ip :32]
-  .long  0xeafffff6                          // b             13b8 <sk_srcover_rgba_8888_vfp4+0xc0>
+  .long  0xeafffff6                          // b             13e8 <sk_srcover_rgba_8888_vfp4+0xc0>
   .long  0xe320f000                          // nop           {0}
   .long  0x437f0000                          // .word         0x437f0000
   .long  0x437f0000                          // .word         0x437f0000
@@ -7383,7 +7427,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
-  .long  0x0a000014                          // beq           1a68 <sk_scale_u8_vfp4+0x78>
+  .long  0x0a000014                          // beq           1a98 <sk_scale_u8_vfp4+0x78>
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xe1cdc0b4                          // strh          ip, [sp, #4]
   .long  0xe28dc004                          // add           ip, sp, #4
@@ -7408,7 +7452,7 @@
   .long  0xe5dcc000                          // ldrb          ip, [ip]
   .long  0xeddf8a03                          // vldr          s17, [pc, #12]
   .long  0xee08ca10                          // vmov          s16, ip
-  .long  0xeaffffec                          // b             1a2c <sk_scale_u8_vfp4+0x3c>
+  .long  0xeaffffec                          // b             1a5c <sk_scale_u8_vfp4+0x3c>
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x00000000                          // .word         0x00000000
@@ -7449,7 +7493,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
-  .long  0x0a00001e                          // beq           1b70 <sk_lerp_u8_vfp4+0xa0>
+  .long  0x0a00001e                          // beq           1ba0 <sk_lerp_u8_vfp4+0xa0>
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xe1cdc0b4                          // strh          ip, [sp, #4]
   .long  0xe28dc004                          // add           ip, sp, #4
@@ -7484,7 +7528,7 @@
   .long  0xe5dcc000                          // ldrb          ip, [ip]
   .long  0xeddf8a03                          // vldr          s17, [pc, #12]
   .long  0xee08ca10                          // vmov          s16, ip
-  .long  0xeaffffe2                          // b             1b0c <sk_lerp_u8_vfp4+0x3c>
+  .long  0xeaffffe2                          // b             1b3c <sk_lerp_u8_vfp4+0x3c>
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x00000000                          // .word         0x00000000
@@ -7502,7 +7546,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc082                          // add           ip, ip, r2, lsl #1
-  .long  0x0a00002e                          // beq           1c70 <sk_lerp_565_vfp4+0xe0>
+  .long  0x0a00002e                          // beq           1ca0 <sk_lerp_565_vfp4+0xe0>
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe58dc004                          // str           ip, [sp, #4]
   .long  0xe28dc004                          // add           ip, sp, #4
@@ -7553,7 +7597,7 @@
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xeddf8a07                          // vldr          s17, [pc, #28]
   .long  0xee08ca10                          // vmov          s16, ip
-  .long  0xeaffffd1                          // b             1bc8 <sk_lerp_565_vfp4+0x38>
+  .long  0xeaffffd1                          // b             1bf8 <sk_lerp_565_vfp4+0x38>
   .long  0x3d042108                          // .word         0x3d042108
   .long  0x3d042108                          // .word         0x3d042108
   .long  0x3a020821                          // .word         0x3a020821
@@ -7573,7 +7617,7 @@
   .long  0xe59ce000                          // ldr           lr, [ip]
   .long  0xe3540001                          // cmp           r4, #1
   .long  0xe08ee102                          // add           lr, lr, r2, lsl #2
-  .long  0x0a000023                          // beq           1d4c <sk_load_tables_vfp4+0xac>
+  .long  0x0a000023                          // beq           1d7c <sk_load_tables_vfp4+0xac>
   .long  0xed9e0b00                          // vldr          d0, [lr]
   .long  0xf3c7001f                          // vmov.i32      d16, #255
   .long  0xe59c7004                          // ldr           r7, [ip, #4]
@@ -7612,7 +7656,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xeddf0a03                          // vldr          s1, [pc, #12]
   .long  0xed9e0a00                          // vldr          s0, [lr]
-  .long  0xeaffffd9                          // b             1cc0 <sk_load_tables_vfp4+0x20>
+  .long  0xeaffffd9                          // b             1cf0 <sk_load_tables_vfp4+0x20>
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x00000000                          // .word         0x00000000
@@ -7629,7 +7673,7 @@
   .long  0xe3540000                          // cmp           r4, #0
   .long  0xe08ee182                          // add           lr, lr, r2, lsl #3
   .long  0xf4ee070f                          // vld4.16       {d16[0],d17[0],d18[0],d19[0]}, [lr]
-  .long  0x1a000001                          // bne           1d90 <sk_load_tables_u16_be_vfp4+0x28>
+  .long  0x1a000001                          // bne           1dc0 <sk_load_tables_u16_be_vfp4+0x28>
   .long  0xe28e4008                          // add           r4, lr, #8
   .long  0xf4e4074f                          // vld4.16       {d16[1],d17[1],d18[1],d19[1]}, [r4]
   .long  0xee924bb0                          // vmov.u16      r4, d18[0]
@@ -7701,7 +7745,7 @@
   .long  0xe59d4020                          // ldr           r4, [sp, #32]
   .long  0xf4ee060f                          // vld3.16       {d16[0],d17[0],d18[0]}, [lr]
   .long  0xe3540000                          // cmp           r4, #0
-  .long  0x1a000001                          // bne           1e9c <sk_load_tables_rgb_u16_be_vfp4+0x2c>
+  .long  0x1a000001                          // bne           1ecc <sk_load_tables_rgb_u16_be_vfp4+0x2c>
   .long  0xe28e4006                          // add           r4, lr, #6
   .long  0xf4e4064f                          // vld3.16       {d16[1],d17[1],d18[1]}, [r4]
   .long  0xee924bb0                          // vmov.u16      r4, d18[0]
@@ -8416,7 +8460,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
-  .long  0x0a000012                          // beq           291c <sk_load_a8_vfp4+0x6c>
+  .long  0x0a000012                          // beq           294c <sk_load_a8_vfp4+0x6c>
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xe1cdc0b0                          // strh          ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8439,7 +8483,7 @@
   .long  0xe5dcc000                          // ldrb          ip, [ip]
   .long  0xeddf0a04                          // vldr          s1, [pc, #16]
   .long  0xee00ca10                          // vmov          s0, ip
-  .long  0xeaffffee                          // b             28e8 <sk_load_a8_vfp4+0x38>
+  .long  0xeaffffee                          // b             2918 <sk_load_a8_vfp4+0x38>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -8457,7 +8501,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
-  .long  0x0a000012                          // beq           29ac <sk_load_a8_dst_vfp4+0x6c>
+  .long  0x0a000012                          // beq           29dc <sk_load_a8_dst_vfp4+0x6c>
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xe1cdc0b0                          // strh          ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8480,7 +8524,7 @@
   .long  0xe5dcc000                          // ldrb          ip, [ip]
   .long  0xeddf4a04                          // vldr          s9, [pc, #16]
   .long  0xee04ca10                          // vmov          s8, ip
-  .long  0xeaffffee                          // b             2978 <sk_load_a8_dst_vfp4+0x38>
+  .long  0xeaffffee                          // b             29a8 <sk_load_a8_dst_vfp4+0x38>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -8534,7 +8578,7 @@
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
   .long  0xf3fb07a1                          // vcvt.u32.f32  d16, d17
-  .long  0x0a000007                          // beq           2a8c <sk_store_a8_vfp4+0x4c>
+  .long  0x0a000007                          // beq           2abc <sk_store_a8_vfp4+0x4c>
   .long  0xee30eb90                          // vmov.32       lr, d16[1]
   .long  0xee104b90                          // vmov.32       r4, d16[0]
   .long  0xe5cce001                          // strb          lr, [ip, #1]
@@ -8545,7 +8589,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xee10eb90                          // vmov.32       lr, d16[0]
   .long  0xe5cce000                          // strb          lr, [ip]
-  .long  0xeafffff8                          // b             2a7c <sk_store_a8_vfp4+0x3c>
+  .long  0xeafffff8                          // b             2aac <sk_store_a8_vfp4+0x3c>
   .long  0x437f0000                          // .word         0x437f0000
   .long  0x437f0000                          // .word         0x437f0000
 
@@ -8560,7 +8604,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
-  .long  0x0a000012                          // beq           2b0c <sk_load_g8_vfp4+0x6c>
+  .long  0x0a000012                          // beq           2b3c <sk_load_g8_vfp4+0x6c>
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xe1cdc0b0                          // strh          ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8583,7 +8627,7 @@
   .long  0xe5dcc000                          // ldrb          ip, [ip]
   .long  0xeddf0a04                          // vldr          s1, [pc, #16]
   .long  0xee00ca10                          // vmov          s0, ip
-  .long  0xeaffffee                          // b             2ad8 <sk_load_g8_vfp4+0x38>
+  .long  0xeaffffee                          // b             2b08 <sk_load_g8_vfp4+0x38>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -8601,7 +8645,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc002                          // add           ip, ip, r2
-  .long  0x0a000012                          // beq           2b9c <sk_load_g8_dst_vfp4+0x6c>
+  .long  0x0a000012                          // beq           2bcc <sk_load_g8_dst_vfp4+0x6c>
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xe1cdc0b0                          // strh          ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8624,7 +8668,7 @@
   .long  0xe5dcc000                          // ldrb          ip, [ip]
   .long  0xeddf4a04                          // vldr          s9, [pc, #16]
   .long  0xee04ca10                          // vmov          s8, ip
-  .long  0xeaffffee                          // b             2b68 <sk_load_g8_dst_vfp4+0x38>
+  .long  0xeaffffee                          // b             2b98 <sk_load_g8_dst_vfp4+0x38>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -8728,7 +8772,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc082                          // add           ip, ip, r2, lsl #1
-  .long  0x0a00001a                          // beq           2d7c <sk_load_565_vfp4+0x8c>
+  .long  0x0a00001a                          // beq           2dac <sk_load_565_vfp4+0x8c>
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe58dc000                          // str           ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8759,7 +8803,7 @@
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xeddf0a08                          // vldr          s1, [pc, #32]
   .long  0xee00ca10                          // vmov          s0, ip
-  .long  0xeaffffe5                          // b             2d24 <sk_load_565_vfp4+0x34>
+  .long  0xeaffffe5                          // b             2d54 <sk_load_565_vfp4+0x34>
   .long  0xe320f000                          // nop           {0}
   .long  0x37842108                          // .word         0x37842108
   .long  0x37842108                          // .word         0x37842108
@@ -8781,7 +8825,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc082                          // add           ip, ip, r2, lsl #1
-  .long  0x0a00001a                          // beq           2e3c <sk_load_565_dst_vfp4+0x8c>
+  .long  0x0a00001a                          // beq           2e6c <sk_load_565_dst_vfp4+0x8c>
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe58dc000                          // str           ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8812,7 +8856,7 @@
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xeddf4a08                          // vldr          s9, [pc, #32]
   .long  0xee04ca10                          // vmov          s8, ip
-  .long  0xeaffffe5                          // b             2de4 <sk_load_565_dst_vfp4+0x34>
+  .long  0xeaffffe5                          // b             2e14 <sk_load_565_dst_vfp4+0x34>
   .long  0xe320f000                          // nop           {0}
   .long  0x37842108                          // .word         0x37842108
   .long  0x37842108                          // .word         0x37842108
@@ -8895,7 +8939,7 @@
   .long  0xf2eb1531                          // vshl.s32      d17, d17, #11
   .long  0xf26001b1                          // vorr          d16, d16, d17
   .long  0xf26001b2                          // vorr          d16, d16, d18
-  .long  0x0a000005                          // beq           2f88 <sk_store_565_vfp4+0x70>
+  .long  0x0a000005                          // beq           2fb8 <sk_store_565_vfp4+0x70>
   .long  0xf3f60121                          // vuzp.16       d16, d17
   .long  0xf4cc080f                          // vst1.32       {d16[0]}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -8904,7 +8948,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xee10eb90                          // vmov.32       lr, d16[0]
   .long  0xe1cce0b0                          // strh          lr, [ip]
-  .long  0xeafffff8                          // b             2f78 <sk_store_565_vfp4+0x60>
+  .long  0xeafffff8                          // b             2fa8 <sk_store_565_vfp4+0x60>
   .long  0xe320f000                          // nop           {0}
   .long  0x427c0000                          // .word         0x427c0000
   .long  0x427c0000                          // .word         0x427c0000
@@ -8920,7 +8964,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc082                          // add           ip, ip, r2, lsl #1
-  .long  0x0a00001d                          // beq           3038 <sk_load_4444_vfp4+0x98>
+  .long  0x0a00001d                          // beq           3068 <sk_load_4444_vfp4+0x98>
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe58dc000                          // str           ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -8954,7 +8998,7 @@
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xeddf0a09                          // vldr          s1, [pc, #36]
   .long  0xee00ca10                          // vmov          s0, ip
-  .long  0xeaffffe2                          // b             2fd4 <sk_load_4444_vfp4+0x34>
+  .long  0xeaffffe2                          // b             3004 <sk_load_4444_vfp4+0x34>
   .long  0x37888889                          // .word         0x37888889
   .long  0x37888889                          // .word         0x37888889
   .long  0x39888889                          // .word         0x39888889
@@ -8977,7 +9021,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc082                          // add           ip, ip, r2, lsl #1
-  .long  0x0a00001d                          // beq           3108 <sk_load_4444_dst_vfp4+0x98>
+  .long  0x0a00001d                          // beq           3138 <sk_load_4444_dst_vfp4+0x98>
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe58dc000                          // str           ip, [sp]
   .long  0xe1a0c00d                          // mov           ip, sp
@@ -9011,7 +9055,7 @@
   .long  0xe1dcc0b0                          // ldrh          ip, [ip]
   .long  0xeddf4a09                          // vldr          s9, [pc, #36]
   .long  0xee04ca10                          // vmov          s8, ip
-  .long  0xeaffffe2                          // b             30a4 <sk_load_4444_dst_vfp4+0x34>
+  .long  0xeaffffe2                          // b             30d4 <sk_load_4444_dst_vfp4+0x34>
   .long  0x37888889                          // .word         0x37888889
   .long  0x37888889                          // .word         0x37888889
   .long  0x39888889                          // .word         0x39888889
@@ -9105,7 +9149,7 @@
   .long  0xf26201b0                          // vorr          d16, d18, d16
   .long  0xf26001b3                          // vorr          d16, d16, d19
   .long  0xf26001b1                          // vorr          d16, d16, d17
-  .long  0x0a000005                          // beq           3280 <sk_store_4444_vfp4+0x80>
+  .long  0x0a000005                          // beq           32b0 <sk_store_4444_vfp4+0x80>
   .long  0xf3f60121                          // vuzp.16       d16, d17
   .long  0xf4cc080f                          // vst1.32       {d16[0]}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -9114,7 +9158,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xee10eb90                          // vmov.32       lr, d16[0]
   .long  0xe1cce0b0                          // strh          lr, [ip]
-  .long  0xeafffff8                          // b             3270 <sk_store_4444_vfp4+0x70>
+  .long  0xeafffff8                          // b             32a0 <sk_store_4444_vfp4+0x70>
   .long  0xe320f000                          // nop           {0}
 
 HIDDEN _sk_load_8888_vfp4
@@ -9127,7 +9171,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc102                          // add           ip, ip, r2, lsl #2
-  .long  0x0a000014                          // beq           3300 <sk_load_8888_vfp4+0x70>
+  .long  0x0a000014                          // beq           3330 <sk_load_8888_vfp4+0x70>
   .long  0xed9c0b00                          // vldr          d0, [ip]
   .long  0xf3c7001f                          // vmov.i32      d16, #255
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -9151,7 +9195,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xeddf0a04                          // vldr          s1, [pc, #16]
   .long  0xed9c0a00                          // vldr          s0, [ip]
-  .long  0xeaffffe8                          // b             32b0 <sk_load_8888_vfp4+0x20>
+  .long  0xeaffffe8                          // b             32e0 <sk_load_8888_vfp4+0x20>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -9168,7 +9212,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc102                          // add           ip, ip, r2, lsl #2
-  .long  0x0a000014                          // beq           3390 <sk_load_8888_dst_vfp4+0x70>
+  .long  0x0a000014                          // beq           33c0 <sk_load_8888_dst_vfp4+0x70>
   .long  0xed9c4b00                          // vldr          d4, [ip]
   .long  0xf3c7001f                          // vmov.i32      d16, #255
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -9192,7 +9236,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xeddf4a04                          // vldr          s9, [pc, #16]
   .long  0xed9c4a00                          // vldr          s8, [ip]
-  .long  0xeaffffe8                          // b             3340 <sk_load_8888_dst_vfp4+0x20>
+  .long  0xeaffffe8                          // b             3370 <sk_load_8888_dst_vfp4+0x20>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -9269,14 +9313,14 @@
   .long  0xf2f81533                          // vshl.s32      d17, d19, #24
   .long  0xf26001b2                          // vorr          d16, d16, d18
   .long  0xf26001b1                          // vorr          d16, d16, d17
-  .long  0x0a000004                          // beq           34bc <sk_store_8888_vfp4+0x7c>
+  .long  0x0a000004                          // beq           34ec <sk_store_8888_vfp4+0x7c>
   .long  0xedcc0b00                          // vstr          d16, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
   .long  0xe2811008                          // add           r1, r1, #8
   .long  0xe8bd4800                          // pop           {fp, lr}
   .long  0xe12fff1c                          // bx            ip
   .long  0xf4cc083f                          // vst1.32       {d16[0]}, [ip :32]
-  .long  0xeafffff9                          // b             34ac <sk_store_8888_vfp4+0x6c>
+  .long  0xeafffff9                          // b             34dc <sk_store_8888_vfp4+0x6c>
   .long  0xe320f000                          // nop           {0}
   .long  0x437f0000                          // .word         0x437f0000
   .long  0x437f0000                          // .word         0x437f0000
@@ -9291,7 +9335,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc102                          // add           ip, ip, r2, lsl #2
-  .long  0x0a000014                          // beq           3540 <sk_load_bgra_vfp4+0x70>
+  .long  0x0a000014                          // beq           3570 <sk_load_bgra_vfp4+0x70>
   .long  0xed9c0b00                          // vldr          d0, [ip]
   .long  0xf3c7001f                          // vmov.i32      d16, #255
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -9315,7 +9359,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xeddf0a04                          // vldr          s1, [pc, #16]
   .long  0xed9c0a00                          // vldr          s0, [ip]
-  .long  0xeaffffe8                          // b             34f0 <sk_load_bgra_vfp4+0x20>
+  .long  0xeaffffe8                          // b             3520 <sk_load_bgra_vfp4+0x20>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -9332,7 +9376,7 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0001                          // cmp           lr, #1
   .long  0xe08cc102                          // add           ip, ip, r2, lsl #2
-  .long  0x0a000014                          // beq           35d0 <sk_load_bgra_dst_vfp4+0x70>
+  .long  0x0a000014                          // beq           3600 <sk_load_bgra_dst_vfp4+0x70>
   .long  0xed9c4b00                          // vldr          d4, [ip]
   .long  0xf3c7001f                          // vmov.i32      d16, #255
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -9356,7 +9400,7 @@
   .long  0xe12fff1c                          // bx            ip
   .long  0xeddf4a04                          // vldr          s9, [pc, #16]
   .long  0xed9c4a00                          // vldr          s8, [ip]
-  .long  0xeaffffe8                          // b             3580 <sk_load_bgra_dst_vfp4+0x20>
+  .long  0xeaffffe8                          // b             35b0 <sk_load_bgra_dst_vfp4+0x20>
   .long  0xe320f000                          // nop           {0}
   .long  0x3b808081                          // .word         0x3b808081
   .long  0x3b808081                          // .word         0x3b808081
@@ -9433,14 +9477,14 @@
   .long  0xf2f81533                          // vshl.s32      d17, d19, #24
   .long  0xf26001b2                          // vorr          d16, d16, d18
   .long  0xf26001b1                          // vorr          d16, d16, d17
-  .long  0x0a000004                          // beq           36fc <sk_store_bgra_vfp4+0x7c>
+  .long  0x0a000004                          // beq           372c <sk_store_bgra_vfp4+0x7c>
   .long  0xedcc0b00                          // vstr          d16, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
   .long  0xe2811008                          // add           r1, r1, #8
   .long  0xe8bd4800                          // pop           {fp, lr}
   .long  0xe12fff1c                          // bx            ip
   .long  0xf4cc083f                          // vst1.32       {d16[0]}, [ip :32]
-  .long  0xeafffff9                          // b             36ec <sk_store_bgra_vfp4+0x6c>
+  .long  0xeafffff9                          // b             371c <sk_store_bgra_vfp4+0x6c>
   .long  0xe320f000                          // nop           {0}
   .long  0x437f0000                          // .word         0x437f0000
   .long  0x437f0000                          // .word         0x437f0000
@@ -9456,7 +9500,7 @@
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xe08cc182                          // add           ip, ip, r2, lsl #3
   .long  0xf4ec070f                          // vld4.16       {d16[0],d17[0],d18[0],d19[0]}, [ip]
-  .long  0x1a000001                          // bne           3738 <sk_load_f16_vfp4+0x28>
+  .long  0x1a000001                          // bne           3768 <sk_load_f16_vfp4+0x28>
   .long  0xe28cc008                          // add           ip, ip, #8
   .long  0xf4ec074f                          // vld4.16       {d16[1],d17[1],d18[1],d19[1]}, [ip]
   .long  0xf3b60720                          // vcvt.f32.f16  q0, d16
@@ -9481,7 +9525,7 @@
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xe08cc182                          // add           ip, ip, r2, lsl #3
   .long  0xf4ec070f                          // vld4.16       {d16[0],d17[0],d18[0],d19[0]}, [ip]
-  .long  0x1a000001                          // bne           3788 <sk_load_f16_dst_vfp4+0x28>
+  .long  0x1a000001                          // bne           37b8 <sk_load_f16_dst_vfp4+0x28>
   .long  0xe28cc008                          // add           ip, ip, #8
   .long  0xf4ec074f                          // vld4.16       {d16[1],d17[1],d18[1],d19[1]}, [ip]
   .long  0xf3b64720                          // vcvt.f32.f16  q2, d16
@@ -9551,7 +9595,7 @@
   .long  0xf3f65622                          // vcvt.f16.f32  d21, q9
   .long  0xf3f64600                          // vcvt.f16.f32  d20, q0
   .long  0xf4cc470f                          // vst4.16       {d20[0],d21[0],d22[0],d23[0]}, [ip]
-  .long  0x1a000001                          // bne           3878 <sk_store_f16_vfp4+0x40>
+  .long  0x1a000001                          // bne           38a8 <sk_store_f16_vfp4+0x40>
   .long  0xe28cc008                          // add           ip, ip, #8
   .long  0xf4cc474f                          // vst4.16       {d20[1],d21[1],d22[1],d23[1]}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -9572,7 +9616,7 @@
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xe08cc182                          // add           ip, ip, r2, lsl #3
   .long  0xf4ec070f                          // vld4.16       {d16[0],d17[0],d18[0],d19[0]}, [ip]
-  .long  0x1a000001                          // bne           38b8 <sk_load_u16_be_vfp4+0x28>
+  .long  0x1a000001                          // bne           38e8 <sk_load_u16_be_vfp4+0x28>
   .long  0xe28cc008                          // add           ip, ip, #8
   .long  0xf4ec074f                          // vld4.16       {d16[1],d17[1],d18[1],d19[1]}, [ip]
   .long  0xee90cbb0                          // vmov.u16      ip, d16[0]
@@ -9640,7 +9684,7 @@
   .long  0xe59de018                          // ldr           lr, [sp, #24]
   .long  0xf4ec060f                          // vld3.16       {d16[0],d17[0],d18[0]}, [ip]
   .long  0xe35e0000                          // cmp           lr, #0
-  .long  0x1a000001                          // bne           39b4 <sk_load_rgb_u16_be_vfp4+0x2c>
+  .long  0x1a000001                          // bne           39e4 <sk_load_rgb_u16_be_vfp4+0x2c>
   .long  0xe28cc006                          // add           ip, ip, #6
   .long  0xf4ec064f                          // vld3.16       {d16[1],d17[1],d18[1]}, [ip]
   .long  0xee90cbb0                          // vmov.u16      ip, d16[0]
@@ -9732,7 +9776,7 @@
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xf3f60124                          // vuzp.16       d16, d20
   .long  0xf4cc070f                          // vst4.16       {d16[0],d17[0],d18[0],d19[0]}, [ip]
-  .long  0x1a000001                          // bne           3b10 <sk_store_u16_be_vfp4+0xb0>
+  .long  0x1a000001                          // bne           3b40 <sk_store_u16_be_vfp4+0xb0>
   .long  0xe28cc008                          // add           ip, ip, #8
   .long  0xf4cc074f                          // vst4.16       {d16[1],d17[1],d18[1],d19[1]}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
@@ -9752,14 +9796,14 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xe08cc202                          // add           ip, ip, r2, lsl #4
-  .long  0x1a000004                          // bne           3b58 <sk_load_f32_vfp4+0x30>
+  .long  0x1a000004                          // bne           3b88 <sk_load_f32_vfp4+0x30>
   .long  0xf42c008f                          // vld4.32       {d0-d3}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
   .long  0xe2811008                          // add           r1, r1, #8
   .long  0xe8bd4800                          // pop           {fp, lr}
   .long  0xe12fff1c                          // bx            ip
   .long  0xf4ac0f8f                          // vld4.32       {d0[]-d3[]}, [ip]
-  .long  0xeafffff9                          // b             3b48 <sk_load_f32_vfp4+0x20>
+  .long  0xeafffff9                          // b             3b78 <sk_load_f32_vfp4+0x20>
 
 HIDDEN _sk_load_f32_dst_vfp4
 .globl _sk_load_f32_dst_vfp4
@@ -9771,14 +9815,14 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xe08cc202                          // add           ip, ip, r2, lsl #4
-  .long  0x1a000004                          // bne           3b90 <sk_load_f32_dst_vfp4+0x30>
+  .long  0x1a000004                          // bne           3bc0 <sk_load_f32_dst_vfp4+0x30>
   .long  0xf42c408f                          // vld4.32       {d4-d7}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
   .long  0xe2811008                          // add           r1, r1, #8
   .long  0xe8bd4800                          // pop           {fp, lr}
   .long  0xe12fff1c                          // bx            ip
   .long  0xf4ac4f8f                          // vld4.32       {d4[]-d7[]}, [ip]
-  .long  0xeafffff9                          // b             3b80 <sk_load_f32_dst_vfp4+0x20>
+  .long  0xeafffff9                          // b             3bb0 <sk_load_f32_dst_vfp4+0x20>
 
 HIDDEN _sk_store_f32_vfp4
 .globl _sk_store_f32_vfp4
@@ -9790,14 +9834,14 @@
   .long  0xe59cc000                          // ldr           ip, [ip]
   .long  0xe35e0000                          // cmp           lr, #0
   .long  0xe08cc202                          // add           ip, ip, r2, lsl #4
-  .long  0x1a000004                          // bne           3bc8 <sk_store_f32_vfp4+0x30>
+  .long  0x1a000004                          // bne           3bf8 <sk_store_f32_vfp4+0x30>
   .long  0xf40c008f                          // vst4.32       {d0-d3}, [ip]
   .long  0xe591c004                          // ldr           ip, [r1, #4]
   .long  0xe2811008                          // add           r1, r1, #8
   .long  0xe8bd4800                          // pop           {fp, lr}
   .long  0xe12fff1c                          // bx            ip
   .long  0xf48c0b0f                          // vst4.32       {d0[0],d1[0],d2[0],d3[0]}, [ip]
-  .long  0xeafffff9                          // b             3bb8 <sk_store_f32_vfp4+0x20>
+  .long  0xeafffff9                          // b             3be8 <sk_store_f32_vfp4+0x20>
 
 HIDDEN _sk_clamp_x_vfp4
 .globl _sk_clamp_x_vfp4
@@ -10411,7 +10455,7 @@
   .long  0xe591c000                          // ldr           ip, [r1]
   .long  0xe59c4000                          // ldr           r4, [ip]
   .long  0xe3540002                          // cmp           r4, #2
-  .long  0x3a00000b                          // bcc           4408 <sk_gradient_vfp4+0x58>
+  .long  0x3a00000b                          // bcc           4438 <sk_gradient_vfp4+0x58>
   .long  0xe59c5024                          // ldr           r5, [ip, #36]
   .long  0xf2c01010                          // vmov.i32      d17, #0
   .long  0xf2c02011                          // vmov.i32      d18, #1
@@ -10423,7 +10467,7 @@
   .long  0xf3403e23                          // vcge.f32      d19, d0, d19
   .long  0xf35231b1                          // vbsl          d19, d18, d17
   .long  0xf26308a0                          // vadd.i32      d16, d19, d16
-  .long  0x1afffff9                          // bne           43f0 <sk_gradient_vfp4+0x40>
+  .long  0x1afffff9                          // bne           4420 <sk_gradient_vfp4+0x40>
   .long  0xee304b90                          // vmov.32       r4, d16[1]
   .long  0xe59c6010                          // ldr           r6, [ip, #16]
   .long  0xee10eb90                          // vmov.32       lr, d16[0]
@@ -11225,7 +11269,7 @@
   .byte  197,249,110,194                     // vmovd         %edx,%xmm0
   .byte  196,226,125,88,192                  // vpbroadcastd  %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,253,86,0,0        // vbroadcastss  0x56fd(%rip),%ymm1        # 5794 <_sk_callback_hsw+0x144>
+  .byte  196,226,125,24,13,45,87,0,0         // vbroadcastss  0x572d(%rip),%ymm1        # 57c4 <_sk_callback_hsw+0x144>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  197,252,88,7                        // vaddps        (%rdi),%ymm0,%ymm0
   .byte  197,249,110,209                     // vmovd         %ecx,%xmm2
@@ -11233,7 +11277,7 @@
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  197,236,88,201                      // vaddps        %ymm1,%ymm2,%ymm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,21,221,86,0,0        // vbroadcastss  0x56dd(%rip),%ymm2        # 5798 <_sk_callback_hsw+0x148>
+  .byte  196,226,125,24,21,13,87,0,0         // vbroadcastss  0x570d(%rip),%ymm2        # 57c8 <_sk_callback_hsw+0x148>
   .byte  197,228,87,219                      // vxorps        %ymm3,%ymm3,%ymm3
   .byte  197,220,87,228                      // vxorps        %ymm4,%ymm4,%ymm4
   .byte  197,212,87,237                      // vxorps        %ymm5,%ymm5,%ymm5
@@ -11252,13 +11296,13 @@
   .byte  197,121,110,201                     // vmovd         %ecx,%xmm9
   .byte  196,66,125,88,201                   // vpbroadcastd  %xmm9,%ymm9
   .byte  196,65,53,239,200                   // vpxor         %ymm8,%ymm9,%ymm9
-  .byte  196,98,125,88,21,164,86,0,0         // vpbroadcastd  0x56a4(%rip),%ymm10        # 579c <_sk_callback_hsw+0x14c>
+  .byte  196,98,125,88,21,212,86,0,0         // vpbroadcastd  0x56d4(%rip),%ymm10        # 57cc <_sk_callback_hsw+0x14c>
   .byte  196,65,53,219,218                   // vpand         %ymm10,%ymm9,%ymm11
   .byte  196,193,37,114,243,5                // vpslld        $0x5,%ymm11,%ymm11
   .byte  196,65,61,219,210                   // vpand         %ymm10,%ymm8,%ymm10
   .byte  196,193,45,114,242,4                // vpslld        $0x4,%ymm10,%ymm10
-  .byte  196,98,125,88,37,137,86,0,0         // vpbroadcastd  0x5689(%rip),%ymm12        # 57a0 <_sk_callback_hsw+0x150>
-  .byte  196,98,125,88,45,132,86,0,0         // vpbroadcastd  0x5684(%rip),%ymm13        # 57a4 <_sk_callback_hsw+0x154>
+  .byte  196,98,125,88,37,185,86,0,0         // vpbroadcastd  0x56b9(%rip),%ymm12        # 57d0 <_sk_callback_hsw+0x150>
+  .byte  196,98,125,88,45,180,86,0,0         // vpbroadcastd  0x56b4(%rip),%ymm13        # 57d4 <_sk_callback_hsw+0x154>
   .byte  196,65,53,219,245                   // vpand         %ymm13,%ymm9,%ymm14
   .byte  196,193,13,114,246,2                // vpslld        $0x2,%ymm14,%ymm14
   .byte  196,65,61,219,237                   // vpand         %ymm13,%ymm8,%ymm13
@@ -11273,8 +11317,8 @@
   .byte  196,65,61,235,194                   // vpor          %ymm10,%ymm8,%ymm8
   .byte  196,65,61,235,193                   // vpor          %ymm9,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,54,86,0,0          // vbroadcastss  0x5636(%rip),%ymm9        # 57a8 <_sk_callback_hsw+0x158>
-  .byte  196,98,125,24,21,49,86,0,0          // vbroadcastss  0x5631(%rip),%ymm10        # 57ac <_sk_callback_hsw+0x15c>
+  .byte  196,98,125,24,13,102,86,0,0         // vbroadcastss  0x5666(%rip),%ymm9        # 57d8 <_sk_callback_hsw+0x158>
+  .byte  196,98,125,24,21,97,86,0,0          // vbroadcastss  0x5661(%rip),%ymm10        # 57dc <_sk_callback_hsw+0x15c>
   .byte  196,66,61,184,209                   // vfmadd231ps   %ymm9,%ymm8,%ymm10
   .byte  196,98,125,24,0                     // vbroadcastss  (%rax),%ymm8
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
@@ -11291,10 +11335,10 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
-HIDDEN _sk_constant_color_hsw
-.globl _sk_constant_color_hsw
-FUNCTION(_sk_constant_color_hsw)
-_sk_constant_color_hsw:
+HIDDEN _sk_uniform_color_hsw
+.globl _sk_uniform_color_hsw
+FUNCTION(_sk_uniform_color_hsw)
+_sk_uniform_color_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  196,226,125,24,0                    // vbroadcastss  (%rax),%ymm0
   .byte  196,226,125,24,72,4                 // vbroadcastss  0x4(%rax),%ymm1
@@ -11303,6 +11347,28 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
+HIDDEN _sk_black_color_hsw
+.globl _sk_black_color_hsw
+FUNCTION(_sk_black_color_hsw)
+_sk_black_color_hsw:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  196,226,125,24,29,1,86,0,0          // vbroadcastss  0x5601(%rip),%ymm3        # 57e0 <_sk_callback_hsw+0x160>
+  .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
+  .byte  197,244,87,201                      // vxorps        %ymm1,%ymm1,%ymm1
+  .byte  197,236,87,210                      // vxorps        %ymm2,%ymm2,%ymm2
+  .byte  255,224                             // jmpq          *%rax
+
+HIDDEN _sk_white_color_hsw
+.globl _sk_white_color_hsw
+FUNCTION(_sk_white_color_hsw)
+_sk_white_color_hsw:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  196,226,125,24,5,236,85,0,0         // vbroadcastss  0x55ec(%rip),%ymm0        # 57e4 <_sk_callback_hsw+0x164>
+  .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
+  .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
+  .byte  197,252,40,216                      // vmovaps       %ymm0,%ymm3
+  .byte  255,224                             // jmpq          *%rax
+
 HIDDEN _sk_load_rgba_hsw
 .globl _sk_load_rgba_hsw
 FUNCTION(_sk_load_rgba_hsw)
@@ -11343,7 +11409,7 @@
 FUNCTION(_sk_srcatop_hsw)
 _sk_srcatop_hsw:
   .byte  197,252,89,199                      // vmulps        %ymm7,%ymm0,%ymm0
-  .byte  196,98,125,24,5,137,85,0,0          // vbroadcastss  0x5589(%rip),%ymm8        # 57b0 <_sk_callback_hsw+0x160>
+  .byte  196,98,125,24,5,143,85,0,0          // vbroadcastss  0x558f(%rip),%ymm8        # 57e8 <_sk_callback_hsw+0x168>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,226,61,184,196                  // vfmadd231ps   %ymm4,%ymm8,%ymm0
   .byte  197,244,89,207                      // vmulps        %ymm7,%ymm1,%ymm1
@@ -11359,7 +11425,7 @@
 .globl _sk_dstatop_hsw
 FUNCTION(_sk_dstatop_hsw)
 _sk_dstatop_hsw:
-  .byte  196,98,125,24,5,92,85,0,0           // vbroadcastss  0x555c(%rip),%ymm8        # 57b4 <_sk_callback_hsw+0x164>
+  .byte  196,98,125,24,5,98,85,0,0           // vbroadcastss  0x5562(%rip),%ymm8        # 57ec <_sk_callback_hsw+0x16c>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  196,226,101,184,196                 // vfmadd231ps   %ymm4,%ymm3,%ymm0
@@ -11398,7 +11464,7 @@
 .globl _sk_srcout_hsw
 FUNCTION(_sk_srcout_hsw)
 _sk_srcout_hsw:
-  .byte  196,98,125,24,5,3,85,0,0            // vbroadcastss  0x5503(%rip),%ymm8        # 57b8 <_sk_callback_hsw+0x168>
+  .byte  196,98,125,24,5,9,85,0,0            // vbroadcastss  0x5509(%rip),%ymm8        # 57f0 <_sk_callback_hsw+0x170>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
@@ -11411,7 +11477,7 @@
 .globl _sk_dstout_hsw
 FUNCTION(_sk_dstout_hsw)
 _sk_dstout_hsw:
-  .byte  196,226,125,24,5,230,84,0,0         // vbroadcastss  0x54e6(%rip),%ymm0        # 57bc <_sk_callback_hsw+0x16c>
+  .byte  196,226,125,24,5,236,84,0,0         // vbroadcastss  0x54ec(%rip),%ymm0        # 57f4 <_sk_callback_hsw+0x174>
   .byte  197,252,92,219                      // vsubps        %ymm3,%ymm0,%ymm3
   .byte  197,228,89,196                      // vmulps        %ymm4,%ymm3,%ymm0
   .byte  197,228,89,205                      // vmulps        %ymm5,%ymm3,%ymm1
@@ -11424,7 +11490,7 @@
 .globl _sk_srcover_hsw
 FUNCTION(_sk_srcover_hsw)
 _sk_srcover_hsw:
-  .byte  196,98,125,24,5,201,84,0,0          // vbroadcastss  0x54c9(%rip),%ymm8        # 57c0 <_sk_callback_hsw+0x170>
+  .byte  196,98,125,24,5,207,84,0,0          // vbroadcastss  0x54cf(%rip),%ymm8        # 57f8 <_sk_callback_hsw+0x178>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,93,184,192                  // vfmadd231ps   %ymm8,%ymm4,%ymm0
   .byte  196,194,85,184,200                  // vfmadd231ps   %ymm8,%ymm5,%ymm1
@@ -11437,7 +11503,7 @@
 .globl _sk_dstover_hsw
 FUNCTION(_sk_dstover_hsw)
 _sk_dstover_hsw:
-  .byte  196,98,125,24,5,168,84,0,0          // vbroadcastss  0x54a8(%rip),%ymm8        # 57c4 <_sk_callback_hsw+0x174>
+  .byte  196,98,125,24,5,174,84,0,0          // vbroadcastss  0x54ae(%rip),%ymm8        # 57fc <_sk_callback_hsw+0x17c>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  196,226,61,168,196                  // vfmadd213ps   %ymm4,%ymm8,%ymm0
   .byte  196,226,61,168,205                  // vfmadd213ps   %ymm5,%ymm8,%ymm1
@@ -11461,7 +11527,7 @@
 .globl _sk_multiply_hsw
 FUNCTION(_sk_multiply_hsw)
 _sk_multiply_hsw:
-  .byte  196,98,125,24,5,115,84,0,0          // vbroadcastss  0x5473(%rip),%ymm8        # 57c8 <_sk_callback_hsw+0x178>
+  .byte  196,98,125,24,5,121,84,0,0          // vbroadcastss  0x5479(%rip),%ymm8        # 5800 <_sk_callback_hsw+0x180>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,52,89,208                       // vmulps        %ymm0,%ymm9,%ymm10
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -11509,7 +11575,7 @@
 .globl _sk_xor__hsw
 FUNCTION(_sk_xor__hsw)
 _sk_xor__hsw:
-  .byte  196,98,125,24,5,238,83,0,0          // vbroadcastss  0x53ee(%rip),%ymm8        # 57cc <_sk_callback_hsw+0x17c>
+  .byte  196,98,125,24,5,244,83,0,0          // vbroadcastss  0x53f4(%rip),%ymm8        # 5804 <_sk_callback_hsw+0x184>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,180,89,192                      // vmulps        %ymm0,%ymm9,%ymm0
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -11543,7 +11609,7 @@
   .byte  197,100,89,206                      // vmulps        %ymm6,%ymm3,%ymm9
   .byte  196,193,108,95,209                  // vmaxps        %ymm9,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,118,83,0,0          // vbroadcastss  0x5376(%rip),%ymm8        # 57d0 <_sk_callback_hsw+0x180>
+  .byte  196,98,125,24,5,124,83,0,0          // vbroadcastss  0x537c(%rip),%ymm8        # 5808 <_sk_callback_hsw+0x188>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,69,184,216                  // vfmadd231ps   %ymm8,%ymm7,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -11568,7 +11634,7 @@
   .byte  197,100,89,206                      // vmulps        %ymm6,%ymm3,%ymm9
   .byte  196,193,108,93,209                  // vminps        %ymm9,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,37,83,0,0           // vbroadcastss  0x5325(%rip),%ymm8        # 57d4 <_sk_callback_hsw+0x184>
+  .byte  196,98,125,24,5,43,83,0,0           // vbroadcastss  0x532b(%rip),%ymm8        # 580c <_sk_callback_hsw+0x18c>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,69,184,216                  // vfmadd231ps   %ymm8,%ymm7,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -11596,7 +11662,7 @@
   .byte  196,193,108,93,209                  // vminps        %ymm9,%ymm2,%ymm2
   .byte  197,236,88,210                      // vaddps        %ymm2,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,200,82,0,0          // vbroadcastss  0x52c8(%rip),%ymm8        # 57d8 <_sk_callback_hsw+0x188>
+  .byte  196,98,125,24,5,206,82,0,0          // vbroadcastss  0x52ce(%rip),%ymm8        # 5810 <_sk_callback_hsw+0x190>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,69,184,216                  // vfmadd231ps   %ymm8,%ymm7,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -11618,7 +11684,7 @@
   .byte  197,236,89,214                      // vmulps        %ymm6,%ymm2,%ymm2
   .byte  197,236,88,210                      // vaddps        %ymm2,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,134,82,0,0          // vbroadcastss  0x5286(%rip),%ymm8        # 57dc <_sk_callback_hsw+0x18c>
+  .byte  196,98,125,24,5,140,82,0,0          // vbroadcastss  0x528c(%rip),%ymm8        # 5814 <_sk_callback_hsw+0x194>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  196,194,69,184,216                  // vfmadd231ps   %ymm8,%ymm7,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -11628,7 +11694,7 @@
 .globl _sk_colorburn_hsw
 FUNCTION(_sk_colorburn_hsw)
 _sk_colorburn_hsw:
-  .byte  196,98,125,24,5,116,82,0,0          // vbroadcastss  0x5274(%rip),%ymm8        # 57e0 <_sk_callback_hsw+0x190>
+  .byte  196,98,125,24,5,122,82,0,0          // vbroadcastss  0x527a(%rip),%ymm8        # 5818 <_sk_callback_hsw+0x198>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,52,89,216                       // vmulps        %ymm0,%ymm9,%ymm11
   .byte  196,65,44,87,210                    // vxorps        %ymm10,%ymm10,%ymm10
@@ -11686,7 +11752,7 @@
 FUNCTION(_sk_colordodge_hsw)
 _sk_colordodge_hsw:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
-  .byte  196,98,125,24,13,127,81,0,0         // vbroadcastss  0x517f(%rip),%ymm9        # 57e4 <_sk_callback_hsw+0x194>
+  .byte  196,98,125,24,13,133,81,0,0         // vbroadcastss  0x5185(%rip),%ymm9        # 581c <_sk_callback_hsw+0x19c>
   .byte  197,52,92,215                       // vsubps        %ymm7,%ymm9,%ymm10
   .byte  197,44,89,216                       // vmulps        %ymm0,%ymm10,%ymm11
   .byte  197,52,92,203                       // vsubps        %ymm3,%ymm9,%ymm9
@@ -11739,7 +11805,7 @@
 .globl _sk_hardlight_hsw
 FUNCTION(_sk_hardlight_hsw)
 _sk_hardlight_hsw:
-  .byte  196,98,125,24,5,160,80,0,0          // vbroadcastss  0x50a0(%rip),%ymm8        # 57e8 <_sk_callback_hsw+0x198>
+  .byte  196,98,125,24,5,166,80,0,0          // vbroadcastss  0x50a6(%rip),%ymm8        # 5820 <_sk_callback_hsw+0x1a0>
   .byte  197,60,92,215                       // vsubps        %ymm7,%ymm8,%ymm10
   .byte  197,44,89,216                       // vmulps        %ymm0,%ymm10,%ymm11
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -11790,7 +11856,7 @@
 .globl _sk_overlay_hsw
 FUNCTION(_sk_overlay_hsw)
 _sk_overlay_hsw:
-  .byte  196,98,125,24,5,216,79,0,0          // vbroadcastss  0x4fd8(%rip),%ymm8        # 57ec <_sk_callback_hsw+0x19c>
+  .byte  196,98,125,24,5,222,79,0,0          // vbroadcastss  0x4fde(%rip),%ymm8        # 5824 <_sk_callback_hsw+0x1a4>
   .byte  197,60,92,215                       // vsubps        %ymm7,%ymm8,%ymm10
   .byte  197,44,89,216                       // vmulps        %ymm0,%ymm10,%ymm11
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -11851,10 +11917,10 @@
   .byte  196,65,20,88,197                    // vaddps        %ymm13,%ymm13,%ymm8
   .byte  196,65,60,88,192                    // vaddps        %ymm8,%ymm8,%ymm8
   .byte  196,66,61,168,192                   // vfmadd213ps   %ymm8,%ymm8,%ymm8
-  .byte  196,98,125,24,29,227,78,0,0         // vbroadcastss  0x4ee3(%rip),%ymm11        # 57f4 <_sk_callback_hsw+0x1a4>
+  .byte  196,98,125,24,29,233,78,0,0         // vbroadcastss  0x4ee9(%rip),%ymm11        # 582c <_sk_callback_hsw+0x1ac>
   .byte  196,65,20,88,227                    // vaddps        %ymm11,%ymm13,%ymm12
   .byte  196,65,28,89,192                    // vmulps        %ymm8,%ymm12,%ymm8
-  .byte  196,98,125,24,37,212,78,0,0         // vbroadcastss  0x4ed4(%rip),%ymm12        # 57f8 <_sk_callback_hsw+0x1a8>
+  .byte  196,98,125,24,37,218,78,0,0         // vbroadcastss  0x4eda(%rip),%ymm12        # 5830 <_sk_callback_hsw+0x1b0>
   .byte  196,66,21,184,196                   // vfmadd231ps   %ymm12,%ymm13,%ymm8
   .byte  196,65,124,82,245                   // vrsqrtps      %ymm13,%ymm14
   .byte  196,65,124,83,246                   // vrcpps        %ymm14,%ymm14
@@ -11864,7 +11930,7 @@
   .byte  197,4,194,255,2                     // vcmpleps      %ymm7,%ymm15,%ymm15
   .byte  196,67,13,74,240,240                // vblendvps     %ymm15,%ymm8,%ymm14,%ymm14
   .byte  197,116,88,249                      // vaddps        %ymm1,%ymm1,%ymm15
-  .byte  196,98,125,24,5,151,78,0,0          // vbroadcastss  0x4e97(%rip),%ymm8        # 57f0 <_sk_callback_hsw+0x1a0>
+  .byte  196,98,125,24,5,157,78,0,0          // vbroadcastss  0x4e9d(%rip),%ymm8        # 5828 <_sk_callback_hsw+0x1a8>
   .byte  196,65,60,92,237                    // vsubps        %ymm13,%ymm8,%ymm13
   .byte  197,132,92,195                      // vsubps        %ymm3,%ymm15,%ymm0
   .byte  196,98,125,168,235                  // vfmadd213ps   %ymm3,%ymm0,%ymm13
@@ -11977,11 +12043,11 @@
   .byte  196,65,28,89,210                    // vmulps        %ymm10,%ymm12,%ymm10
   .byte  196,65,44,94,214                    // vdivps        %ymm14,%ymm10,%ymm10
   .byte  196,67,45,74,224,240                // vblendvps     %ymm15,%ymm8,%ymm10,%ymm12
-  .byte  196,98,125,24,53,155,76,0,0         // vbroadcastss  0x4c9b(%rip),%ymm14        # 57fc <_sk_callback_hsw+0x1ac>
-  .byte  196,98,125,24,61,150,76,0,0         // vbroadcastss  0x4c96(%rip),%ymm15        # 5800 <_sk_callback_hsw+0x1b0>
+  .byte  196,98,125,24,53,161,76,0,0         // vbroadcastss  0x4ca1(%rip),%ymm14        # 5834 <_sk_callback_hsw+0x1b4>
+  .byte  196,98,125,24,61,156,76,0,0         // vbroadcastss  0x4c9c(%rip),%ymm15        # 5838 <_sk_callback_hsw+0x1b8>
   .byte  196,65,84,89,239                    // vmulps        %ymm15,%ymm5,%ymm13
   .byte  196,66,93,184,238                   // vfmadd231ps   %ymm14,%ymm4,%ymm13
-  .byte  196,226,125,24,5,135,76,0,0         // vbroadcastss  0x4c87(%rip),%ymm0        # 5804 <_sk_callback_hsw+0x1b4>
+  .byte  196,226,125,24,5,141,76,0,0         // vbroadcastss  0x4c8d(%rip),%ymm0        # 583c <_sk_callback_hsw+0x1bc>
   .byte  196,98,77,184,232                   // vfmadd231ps   %ymm0,%ymm6,%ymm13
   .byte  196,65,116,89,215                   // vmulps        %ymm15,%ymm1,%ymm10
   .byte  196,66,53,184,214                   // vfmadd231ps   %ymm14,%ymm9,%ymm10
@@ -12036,7 +12102,7 @@
   .byte  196,193,124,95,192                  // vmaxps        %ymm8,%ymm0,%ymm0
   .byte  196,65,36,95,200                    // vmaxps        %ymm8,%ymm11,%ymm9
   .byte  196,65,116,95,192                   // vmaxps        %ymm8,%ymm1,%ymm8
-  .byte  196,226,125,24,13,116,75,0,0        // vbroadcastss  0x4b74(%rip),%ymm1        # 5808 <_sk_callback_hsw+0x1b8>
+  .byte  196,226,125,24,13,122,75,0,0        // vbroadcastss  0x4b7a(%rip),%ymm1        # 5840 <_sk_callback_hsw+0x1c0>
   .byte  197,116,92,215                      // vsubps        %ymm7,%ymm1,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,116,92,219                      // vsubps        %ymm3,%ymm1,%ymm11
@@ -12090,11 +12156,11 @@
   .byte  196,65,28,89,210                    // vmulps        %ymm10,%ymm12,%ymm10
   .byte  196,65,44,94,214                    // vdivps        %ymm14,%ymm10,%ymm10
   .byte  196,67,45,74,224,240                // vblendvps     %ymm15,%ymm8,%ymm10,%ymm12
-  .byte  196,98,125,24,53,139,74,0,0         // vbroadcastss  0x4a8b(%rip),%ymm14        # 580c <_sk_callback_hsw+0x1bc>
-  .byte  196,98,125,24,61,134,74,0,0         // vbroadcastss  0x4a86(%rip),%ymm15        # 5810 <_sk_callback_hsw+0x1c0>
+  .byte  196,98,125,24,53,145,74,0,0         // vbroadcastss  0x4a91(%rip),%ymm14        # 5844 <_sk_callback_hsw+0x1c4>
+  .byte  196,98,125,24,61,140,74,0,0         // vbroadcastss  0x4a8c(%rip),%ymm15        # 5848 <_sk_callback_hsw+0x1c8>
   .byte  196,65,84,89,239                    // vmulps        %ymm15,%ymm5,%ymm13
   .byte  196,66,93,184,238                   // vfmadd231ps   %ymm14,%ymm4,%ymm13
-  .byte  196,226,125,24,5,119,74,0,0         // vbroadcastss  0x4a77(%rip),%ymm0        # 5814 <_sk_callback_hsw+0x1c4>
+  .byte  196,226,125,24,5,125,74,0,0         // vbroadcastss  0x4a7d(%rip),%ymm0        # 584c <_sk_callback_hsw+0x1cc>
   .byte  196,98,77,184,232                   // vfmadd231ps   %ymm0,%ymm6,%ymm13
   .byte  196,65,116,89,215                   // vmulps        %ymm15,%ymm1,%ymm10
   .byte  196,66,53,184,214                   // vfmadd231ps   %ymm14,%ymm9,%ymm10
@@ -12149,7 +12215,7 @@
   .byte  196,193,124,95,192                  // vmaxps        %ymm8,%ymm0,%ymm0
   .byte  196,65,36,95,200                    // vmaxps        %ymm8,%ymm11,%ymm9
   .byte  196,65,116,95,192                   // vmaxps        %ymm8,%ymm1,%ymm8
-  .byte  196,226,125,24,13,100,73,0,0        // vbroadcastss  0x4964(%rip),%ymm1        # 5818 <_sk_callback_hsw+0x1c8>
+  .byte  196,226,125,24,13,106,73,0,0        // vbroadcastss  0x496a(%rip),%ymm1        # 5850 <_sk_callback_hsw+0x1d0>
   .byte  197,116,92,215                      // vsubps        %ymm7,%ymm1,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,116,92,219                      // vsubps        %ymm3,%ymm1,%ymm11
@@ -12177,11 +12243,11 @@
   .byte  197,108,89,199                      // vmulps        %ymm7,%ymm2,%ymm8
   .byte  197,116,89,215                      // vmulps        %ymm7,%ymm1,%ymm10
   .byte  197,52,89,223                       // vmulps        %ymm7,%ymm9,%ymm11
-  .byte  196,98,125,24,45,253,72,0,0         // vbroadcastss  0x48fd(%rip),%ymm13        # 581c <_sk_callback_hsw+0x1cc>
-  .byte  196,98,125,24,53,248,72,0,0         // vbroadcastss  0x48f8(%rip),%ymm14        # 5820 <_sk_callback_hsw+0x1d0>
+  .byte  196,98,125,24,45,3,73,0,0           // vbroadcastss  0x4903(%rip),%ymm13        # 5854 <_sk_callback_hsw+0x1d4>
+  .byte  196,98,125,24,53,254,72,0,0         // vbroadcastss  0x48fe(%rip),%ymm14        # 5858 <_sk_callback_hsw+0x1d8>
   .byte  196,65,84,89,230                    // vmulps        %ymm14,%ymm5,%ymm12
   .byte  196,66,93,184,229                   // vfmadd231ps   %ymm13,%ymm4,%ymm12
-  .byte  196,98,125,24,61,233,72,0,0         // vbroadcastss  0x48e9(%rip),%ymm15        # 5824 <_sk_callback_hsw+0x1d4>
+  .byte  196,98,125,24,61,239,72,0,0         // vbroadcastss  0x48ef(%rip),%ymm15        # 585c <_sk_callback_hsw+0x1dc>
   .byte  196,66,77,184,231                   // vfmadd231ps   %ymm15,%ymm6,%ymm12
   .byte  196,65,44,89,206                    // vmulps        %ymm14,%ymm10,%ymm9
   .byte  196,66,61,184,205                   // vfmadd231ps   %ymm13,%ymm8,%ymm9
@@ -12237,7 +12303,7 @@
   .byte  196,193,116,95,206                  // vmaxps        %ymm14,%ymm1,%ymm1
   .byte  196,65,44,95,198                    // vmaxps        %ymm14,%ymm10,%ymm8
   .byte  196,65,124,95,206                   // vmaxps        %ymm14,%ymm0,%ymm9
-  .byte  196,226,125,24,5,203,71,0,0         // vbroadcastss  0x47cb(%rip),%ymm0        # 5828 <_sk_callback_hsw+0x1d8>
+  .byte  196,226,125,24,5,209,71,0,0         // vbroadcastss  0x47d1(%rip),%ymm0        # 5860 <_sk_callback_hsw+0x1e0>
   .byte  197,124,92,215                      // vsubps        %ymm7,%ymm0,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,124,92,219                      // vsubps        %ymm3,%ymm0,%ymm11
@@ -12265,11 +12331,11 @@
   .byte  197,100,89,196                      // vmulps        %ymm4,%ymm3,%ymm8
   .byte  197,100,89,213                      // vmulps        %ymm5,%ymm3,%ymm10
   .byte  197,100,89,222                      // vmulps        %ymm6,%ymm3,%ymm11
-  .byte  196,98,125,24,45,100,71,0,0         // vbroadcastss  0x4764(%rip),%ymm13        # 582c <_sk_callback_hsw+0x1dc>
-  .byte  196,98,125,24,53,95,71,0,0          // vbroadcastss  0x475f(%rip),%ymm14        # 5830 <_sk_callback_hsw+0x1e0>
+  .byte  196,98,125,24,45,106,71,0,0         // vbroadcastss  0x476a(%rip),%ymm13        # 5864 <_sk_callback_hsw+0x1e4>
+  .byte  196,98,125,24,53,101,71,0,0         // vbroadcastss  0x4765(%rip),%ymm14        # 5868 <_sk_callback_hsw+0x1e8>
   .byte  196,65,116,89,230                   // vmulps        %ymm14,%ymm1,%ymm12
   .byte  196,66,109,184,229                  // vfmadd231ps   %ymm13,%ymm2,%ymm12
-  .byte  196,98,125,24,61,80,71,0,0          // vbroadcastss  0x4750(%rip),%ymm15        # 5834 <_sk_callback_hsw+0x1e4>
+  .byte  196,98,125,24,61,86,71,0,0          // vbroadcastss  0x4756(%rip),%ymm15        # 586c <_sk_callback_hsw+0x1ec>
   .byte  196,66,53,184,231                   // vfmadd231ps   %ymm15,%ymm9,%ymm12
   .byte  196,65,44,89,206                    // vmulps        %ymm14,%ymm10,%ymm9
   .byte  196,66,61,184,205                   // vfmadd231ps   %ymm13,%ymm8,%ymm9
@@ -12325,7 +12391,7 @@
   .byte  196,193,116,95,206                  // vmaxps        %ymm14,%ymm1,%ymm1
   .byte  196,65,44,95,198                    // vmaxps        %ymm14,%ymm10,%ymm8
   .byte  196,65,124,95,206                   // vmaxps        %ymm14,%ymm0,%ymm9
-  .byte  196,226,125,24,5,50,70,0,0          // vbroadcastss  0x4632(%rip),%ymm0        # 5838 <_sk_callback_hsw+0x1e8>
+  .byte  196,226,125,24,5,56,70,0,0          // vbroadcastss  0x4638(%rip),%ymm0        # 5870 <_sk_callback_hsw+0x1f0>
   .byte  197,124,92,215                      // vsubps        %ymm7,%ymm0,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,124,92,219                      // vsubps        %ymm3,%ymm0,%ymm11
@@ -12351,19 +12417,19 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,180,0,0,0                    // jne           1315 <_sk_srcover_rgba_8888_hsw+0xcd>
+  .byte  15,133,180,0,0,0                    // jne           1347 <_sk_srcover_rgba_8888_hsw+0xcd>
   .byte  196,193,124,16,58                   // vmovups       (%r10),%ymm7
-  .byte  197,196,84,37,210,73,0,0            // vandps        0x49d2(%rip),%ymm7,%ymm4        # 5c40 <_sk_callback_hsw+0x5f0>
+  .byte  197,196,84,37,224,73,0,0            // vandps        0x49e0(%rip),%ymm7,%ymm4        # 5c80 <_sk_callback_hsw+0x600>
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,69,0,45,229,73,0,0          // vpshufb       0x49e5(%rip),%ymm7,%ymm5        # 5c60 <_sk_callback_hsw+0x610>
+  .byte  196,226,69,0,45,243,73,0,0          // vpshufb       0x49f3(%rip),%ymm7,%ymm5        # 5ca0 <_sk_callback_hsw+0x620>
   .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
-  .byte  196,226,69,0,53,248,73,0,0          // vpshufb       0x49f8(%rip),%ymm7,%ymm6        # 5c80 <_sk_callback_hsw+0x630>
+  .byte  196,226,69,0,53,6,74,0,0            // vpshufb       0x4a06(%rip),%ymm7,%ymm6        # 5cc0 <_sk_callback_hsw+0x640>
   .byte  197,252,91,246                      // vcvtdq2ps     %ymm6,%ymm6
   .byte  197,197,114,215,24                  // vpsrld        $0x18,%ymm7,%ymm7
   .byte  197,252,91,255                      // vcvtdq2ps     %ymm7,%ymm7
-  .byte  196,98,125,24,5,158,69,0,0          // vbroadcastss  0x459e(%rip),%ymm8        # 583c <_sk_callback_hsw+0x1ec>
+  .byte  196,98,125,24,5,164,69,0,0          // vbroadcastss  0x45a4(%rip),%ymm8        # 5874 <_sk_callback_hsw+0x1f4>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
-  .byte  196,98,125,24,13,149,69,0,0         // vbroadcastss  0x4595(%rip),%ymm9        # 5840 <_sk_callback_hsw+0x1f0>
+  .byte  196,98,125,24,13,155,69,0,0         // vbroadcastss  0x459b(%rip),%ymm9        # 5878 <_sk_callback_hsw+0x1f8>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  196,194,93,184,192                  // vfmadd231ps   %ymm8,%ymm4,%ymm0
   .byte  196,193,116,89,201                  // vmulps        %ymm9,%ymm1,%ymm1
@@ -12383,7 +12449,7 @@
   .byte  196,65,53,235,202                   // vpor          %ymm10,%ymm9,%ymm9
   .byte  196,65,61,235,193                   // vpor          %ymm9,%ymm8,%ymm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,53                              // jne           133e <_sk_srcover_rgba_8888_hsw+0xf6>
+  .byte  117,53                              // jne           1370 <_sk_srcover_rgba_8888_hsw+0xf6>
   .byte  196,65,124,17,2                     // vmovups       %ymm8,(%r10)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,201                          // mov           %r9,%rcx
@@ -12396,7 +12462,7 @@
   .byte  196,225,249,110,224                 // vmovq         %rax,%xmm4
   .byte  196,226,125,33,228                  // vpmovsxbd     %xmm4,%ymm4
   .byte  196,194,93,44,58                    // vmaskmovps    (%r10),%ymm4,%ymm7
-  .byte  233,40,255,255,255                  // jmpq          1266 <_sk_srcover_rgba_8888_hsw+0x1e>
+  .byte  233,40,255,255,255                  // jmpq          1298 <_sk_srcover_rgba_8888_hsw+0x1e>
   .byte  185,8,0,0,0                         // mov           $0x8,%ecx
   .byte  68,41,193                           // sub           %r8d,%ecx
   .byte  192,225,3                           // shl           $0x3,%cl
@@ -12405,7 +12471,7 @@
   .byte  196,97,249,110,200                  // vmovq         %rax,%xmm9
   .byte  196,66,125,33,201                   // vpmovsxbd     %xmm9,%ymm9
   .byte  196,66,53,46,2                      // vmaskmovps    %ymm8,%ymm9,(%r10)
-  .byte  235,170                             // jmp           130e <_sk_srcover_rgba_8888_hsw+0xc6>
+  .byte  235,170                             // jmp           1340 <_sk_srcover_rgba_8888_hsw+0xc6>
 
 HIDDEN _sk_clamp_0_hsw
 .globl _sk_clamp_0_hsw
@@ -12423,7 +12489,7 @@
 .globl _sk_clamp_1_hsw
 FUNCTION(_sk_clamp_1_hsw)
 _sk_clamp_1_hsw:
-  .byte  196,98,125,24,5,186,68,0,0          // vbroadcastss  0x44ba(%rip),%ymm8        # 5844 <_sk_callback_hsw+0x1f4>
+  .byte  196,98,125,24,5,192,68,0,0          // vbroadcastss  0x44c0(%rip),%ymm8        # 587c <_sk_callback_hsw+0x1fc>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  196,193,116,93,200                  // vminps        %ymm8,%ymm1,%ymm1
   .byte  196,193,108,93,208                  // vminps        %ymm8,%ymm2,%ymm2
@@ -12435,7 +12501,7 @@
 .globl _sk_clamp_a_hsw
 FUNCTION(_sk_clamp_a_hsw)
 _sk_clamp_a_hsw:
-  .byte  196,98,125,24,5,157,68,0,0          // vbroadcastss  0x449d(%rip),%ymm8        # 5848 <_sk_callback_hsw+0x1f8>
+  .byte  196,98,125,24,5,163,68,0,0          // vbroadcastss  0x44a3(%rip),%ymm8        # 5880 <_sk_callback_hsw+0x200>
   .byte  196,193,100,93,216                  // vminps        %ymm8,%ymm3,%ymm3
   .byte  197,252,93,195                      // vminps        %ymm3,%ymm0,%ymm0
   .byte  197,244,93,203                      // vminps        %ymm3,%ymm1,%ymm1
@@ -12447,7 +12513,7 @@
 .globl _sk_clamp_a_dst_hsw
 FUNCTION(_sk_clamp_a_dst_hsw)
 _sk_clamp_a_dst_hsw:
-  .byte  196,98,125,24,5,131,68,0,0          // vbroadcastss  0x4483(%rip),%ymm8        # 584c <_sk_callback_hsw+0x1fc>
+  .byte  196,98,125,24,5,137,68,0,0          // vbroadcastss  0x4489(%rip),%ymm8        # 5884 <_sk_callback_hsw+0x204>
   .byte  196,193,68,93,248                   // vminps        %ymm8,%ymm7,%ymm7
   .byte  197,220,93,231                      // vminps        %ymm7,%ymm4,%ymm4
   .byte  197,212,93,239                      // vminps        %ymm7,%ymm5,%ymm5
@@ -12514,7 +12580,7 @@
 _sk_unpremul_hsw:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,65,100,194,200,0                // vcmpeqps      %ymm8,%ymm3,%ymm9
-  .byte  196,98,125,24,21,255,67,0,0         // vbroadcastss  0x43ff(%rip),%ymm10        # 5850 <_sk_callback_hsw+0x200>
+  .byte  196,98,125,24,21,5,68,0,0           // vbroadcastss  0x4405(%rip),%ymm10        # 5888 <_sk_callback_hsw+0x208>
   .byte  197,44,94,211                       // vdivps        %ymm3,%ymm10,%ymm10
   .byte  196,67,45,74,192,144                // vblendvps     %ymm9,%ymm8,%ymm10,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
@@ -12527,16 +12593,16 @@
 .globl _sk_from_srgb_hsw
 FUNCTION(_sk_from_srgb_hsw)
 _sk_from_srgb_hsw:
-  .byte  196,98,125,24,5,224,67,0,0          // vbroadcastss  0x43e0(%rip),%ymm8        # 5854 <_sk_callback_hsw+0x204>
+  .byte  196,98,125,24,5,230,67,0,0          // vbroadcastss  0x43e6(%rip),%ymm8        # 588c <_sk_callback_hsw+0x20c>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  197,124,89,208                      // vmulps        %ymm0,%ymm0,%ymm10
-  .byte  196,98,125,24,29,210,67,0,0         // vbroadcastss  0x43d2(%rip),%ymm11        # 5858 <_sk_callback_hsw+0x208>
-  .byte  196,98,125,24,37,205,67,0,0         // vbroadcastss  0x43cd(%rip),%ymm12        # 585c <_sk_callback_hsw+0x20c>
+  .byte  196,98,125,24,29,216,67,0,0         // vbroadcastss  0x43d8(%rip),%ymm11        # 5890 <_sk_callback_hsw+0x210>
+  .byte  196,98,125,24,37,211,67,0,0         // vbroadcastss  0x43d3(%rip),%ymm12        # 5894 <_sk_callback_hsw+0x214>
   .byte  196,65,124,40,236                   // vmovaps       %ymm12,%ymm13
   .byte  196,66,125,168,235                  // vfmadd213ps   %ymm11,%ymm0,%ymm13
-  .byte  196,98,125,24,53,190,67,0,0         // vbroadcastss  0x43be(%rip),%ymm14        # 5860 <_sk_callback_hsw+0x210>
+  .byte  196,98,125,24,53,196,67,0,0         // vbroadcastss  0x43c4(%rip),%ymm14        # 5898 <_sk_callback_hsw+0x218>
   .byte  196,66,45,168,238                   // vfmadd213ps   %ymm14,%ymm10,%ymm13
-  .byte  196,98,125,24,21,180,67,0,0         // vbroadcastss  0x43b4(%rip),%ymm10        # 5864 <_sk_callback_hsw+0x214>
+  .byte  196,98,125,24,21,186,67,0,0         // vbroadcastss  0x43ba(%rip),%ymm10        # 589c <_sk_callback_hsw+0x21c>
   .byte  196,193,124,194,194,1               // vcmpltps      %ymm10,%ymm0,%ymm0
   .byte  196,195,21,74,193,0                 // vblendvps     %ymm0,%ymm9,%ymm13,%ymm0
   .byte  196,65,116,89,200                   // vmulps        %ymm8,%ymm1,%ymm9
@@ -12559,16 +12625,16 @@
 .globl _sk_from_srgb_dst_hsw
 FUNCTION(_sk_from_srgb_dst_hsw)
 _sk_from_srgb_dst_hsw:
-  .byte  196,98,125,24,5,92,67,0,0           // vbroadcastss  0x435c(%rip),%ymm8        # 5868 <_sk_callback_hsw+0x218>
+  .byte  196,98,125,24,5,98,67,0,0           // vbroadcastss  0x4362(%rip),%ymm8        # 58a0 <_sk_callback_hsw+0x220>
   .byte  196,65,92,89,200                    // vmulps        %ymm8,%ymm4,%ymm9
   .byte  197,92,89,212                       // vmulps        %ymm4,%ymm4,%ymm10
-  .byte  196,98,125,24,29,78,67,0,0          // vbroadcastss  0x434e(%rip),%ymm11        # 586c <_sk_callback_hsw+0x21c>
-  .byte  196,98,125,24,37,73,67,0,0          // vbroadcastss  0x4349(%rip),%ymm12        # 5870 <_sk_callback_hsw+0x220>
+  .byte  196,98,125,24,29,84,67,0,0          // vbroadcastss  0x4354(%rip),%ymm11        # 58a4 <_sk_callback_hsw+0x224>
+  .byte  196,98,125,24,37,79,67,0,0          // vbroadcastss  0x434f(%rip),%ymm12        # 58a8 <_sk_callback_hsw+0x228>
   .byte  196,65,124,40,236                   // vmovaps       %ymm12,%ymm13
   .byte  196,66,93,168,235                   // vfmadd213ps   %ymm11,%ymm4,%ymm13
-  .byte  196,98,125,24,53,58,67,0,0          // vbroadcastss  0x433a(%rip),%ymm14        # 5874 <_sk_callback_hsw+0x224>
+  .byte  196,98,125,24,53,64,67,0,0          // vbroadcastss  0x4340(%rip),%ymm14        # 58ac <_sk_callback_hsw+0x22c>
   .byte  196,66,45,168,238                   // vfmadd213ps   %ymm14,%ymm10,%ymm13
-  .byte  196,98,125,24,21,48,67,0,0          // vbroadcastss  0x4330(%rip),%ymm10        # 5878 <_sk_callback_hsw+0x228>
+  .byte  196,98,125,24,21,54,67,0,0          // vbroadcastss  0x4336(%rip),%ymm10        # 58b0 <_sk_callback_hsw+0x230>
   .byte  196,193,92,194,226,1                // vcmpltps      %ymm10,%ymm4,%ymm4
   .byte  196,195,21,74,225,64                // vblendvps     %ymm4,%ymm9,%ymm13,%ymm4
   .byte  196,65,84,89,200                    // vmulps        %ymm8,%ymm5,%ymm9
@@ -12592,19 +12658,19 @@
 FUNCTION(_sk_to_srgb_hsw)
 _sk_to_srgb_hsw:
   .byte  197,124,82,200                      // vrsqrtps      %ymm0,%ymm9
-  .byte  196,98,125,24,5,212,66,0,0          // vbroadcastss  0x42d4(%rip),%ymm8        # 587c <_sk_callback_hsw+0x22c>
+  .byte  196,98,125,24,5,218,66,0,0          // vbroadcastss  0x42da(%rip),%ymm8        # 58b4 <_sk_callback_hsw+0x234>
   .byte  196,65,124,89,208                   // vmulps        %ymm8,%ymm0,%ymm10
-  .byte  196,98,125,24,29,202,66,0,0         // vbroadcastss  0x42ca(%rip),%ymm11        # 5880 <_sk_callback_hsw+0x230>
-  .byte  196,98,125,24,37,197,66,0,0         // vbroadcastss  0x42c5(%rip),%ymm12        # 5884 <_sk_callback_hsw+0x234>
+  .byte  196,98,125,24,29,208,66,0,0         // vbroadcastss  0x42d0(%rip),%ymm11        # 58b8 <_sk_callback_hsw+0x238>
+  .byte  196,98,125,24,37,203,66,0,0         // vbroadcastss  0x42cb(%rip),%ymm12        # 58bc <_sk_callback_hsw+0x23c>
   .byte  196,65,124,40,236                   // vmovaps       %ymm12,%ymm13
   .byte  196,66,53,168,235                   // vfmadd213ps   %ymm11,%ymm9,%ymm13
-  .byte  196,98,125,24,53,182,66,0,0         // vbroadcastss  0x42b6(%rip),%ymm14        # 5888 <_sk_callback_hsw+0x238>
+  .byte  196,98,125,24,53,188,66,0,0         // vbroadcastss  0x42bc(%rip),%ymm14        # 58c0 <_sk_callback_hsw+0x240>
   .byte  196,66,53,168,238                   // vfmadd213ps   %ymm14,%ymm9,%ymm13
-  .byte  196,98,125,24,61,172,66,0,0         // vbroadcastss  0x42ac(%rip),%ymm15        # 588c <_sk_callback_hsw+0x23c>
+  .byte  196,98,125,24,61,178,66,0,0         // vbroadcastss  0x42b2(%rip),%ymm15        # 58c4 <_sk_callback_hsw+0x244>
   .byte  196,65,52,88,207                    // vaddps        %ymm15,%ymm9,%ymm9
   .byte  196,65,124,83,201                   // vrcpps        %ymm9,%ymm9
   .byte  196,65,20,89,201                    // vmulps        %ymm9,%ymm13,%ymm9
-  .byte  196,98,125,24,45,152,66,0,0         // vbroadcastss  0x4298(%rip),%ymm13        # 5890 <_sk_callback_hsw+0x240>
+  .byte  196,98,125,24,45,158,66,0,0         // vbroadcastss  0x429e(%rip),%ymm13        # 58c8 <_sk_callback_hsw+0x248>
   .byte  196,193,124,194,197,1               // vcmpltps      %ymm13,%ymm0,%ymm0
   .byte  196,195,53,74,194,0                 // vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   .byte  197,124,82,201                      // vrsqrtps      %ymm1,%ymm9
@@ -12638,26 +12704,26 @@
   .byte  197,124,93,201                      // vminps        %ymm1,%ymm0,%ymm9
   .byte  197,52,93,202                       // vminps        %ymm2,%ymm9,%ymm9
   .byte  196,65,60,92,209                    // vsubps        %ymm9,%ymm8,%ymm10
-  .byte  196,98,125,24,29,13,66,0,0          // vbroadcastss  0x420d(%rip),%ymm11        # 5894 <_sk_callback_hsw+0x244>
+  .byte  196,98,125,24,29,19,66,0,0          // vbroadcastss  0x4213(%rip),%ymm11        # 58cc <_sk_callback_hsw+0x24c>
   .byte  196,65,36,94,218                    // vdivps        %ymm10,%ymm11,%ymm11
   .byte  197,116,92,226                      // vsubps        %ymm2,%ymm1,%ymm12
   .byte  197,116,194,234,1                   // vcmpltps      %ymm2,%ymm1,%ymm13
-  .byte  196,98,125,24,53,250,65,0,0         // vbroadcastss  0x41fa(%rip),%ymm14        # 5898 <_sk_callback_hsw+0x248>
+  .byte  196,98,125,24,53,0,66,0,0           // vbroadcastss  0x4200(%rip),%ymm14        # 58d0 <_sk_callback_hsw+0x250>
   .byte  196,65,4,87,255                     // vxorps        %ymm15,%ymm15,%ymm15
   .byte  196,67,5,74,238,208                 // vblendvps     %ymm13,%ymm14,%ymm15,%ymm13
   .byte  196,66,37,168,229                   // vfmadd213ps   %ymm13,%ymm11,%ymm12
   .byte  197,236,92,208                      // vsubps        %ymm0,%ymm2,%ymm2
   .byte  197,124,92,233                      // vsubps        %ymm1,%ymm0,%ymm13
-  .byte  196,98,125,24,53,225,65,0,0         // vbroadcastss  0x41e1(%rip),%ymm14        # 58a0 <_sk_callback_hsw+0x250>
+  .byte  196,98,125,24,53,231,65,0,0         // vbroadcastss  0x41e7(%rip),%ymm14        # 58d8 <_sk_callback_hsw+0x258>
   .byte  196,66,37,168,238                   // vfmadd213ps   %ymm14,%ymm11,%ymm13
-  .byte  196,98,125,24,53,207,65,0,0         // vbroadcastss  0x41cf(%rip),%ymm14        # 589c <_sk_callback_hsw+0x24c>
+  .byte  196,98,125,24,53,213,65,0,0         // vbroadcastss  0x41d5(%rip),%ymm14        # 58d4 <_sk_callback_hsw+0x254>
   .byte  196,194,37,168,214                  // vfmadd213ps   %ymm14,%ymm11,%ymm2
   .byte  197,188,194,201,0                   // vcmpeqps      %ymm1,%ymm8,%ymm1
   .byte  196,227,21,74,202,16                // vblendvps     %ymm1,%ymm2,%ymm13,%ymm1
   .byte  197,188,194,192,0                   // vcmpeqps      %ymm0,%ymm8,%ymm0
   .byte  196,195,117,74,196,0                // vblendvps     %ymm0,%ymm12,%ymm1,%ymm0
   .byte  196,193,60,88,201                   // vaddps        %ymm9,%ymm8,%ymm1
-  .byte  196,98,125,24,29,178,65,0,0         // vbroadcastss  0x41b2(%rip),%ymm11        # 58a8 <_sk_callback_hsw+0x258>
+  .byte  196,98,125,24,29,184,65,0,0         // vbroadcastss  0x41b8(%rip),%ymm11        # 58e0 <_sk_callback_hsw+0x260>
   .byte  196,193,116,89,211                  // vmulps        %ymm11,%ymm1,%ymm2
   .byte  197,36,194,218,1                    // vcmpltps      %ymm2,%ymm11,%ymm11
   .byte  196,65,12,92,224                    // vsubps        %ymm8,%ymm14,%ymm12
@@ -12667,7 +12733,7 @@
   .byte  197,172,94,201                      // vdivps        %ymm1,%ymm10,%ymm1
   .byte  196,195,125,74,199,128              // vblendvps     %ymm8,%ymm15,%ymm0,%ymm0
   .byte  196,195,117,74,207,128              // vblendvps     %ymm8,%ymm15,%ymm1,%ymm1
-  .byte  196,98,125,24,5,117,65,0,0          // vbroadcastss  0x4175(%rip),%ymm8        # 58a4 <_sk_callback_hsw+0x254>
+  .byte  196,98,125,24,5,123,65,0,0          // vbroadcastss  0x417b(%rip),%ymm8        # 58dc <_sk_callback_hsw+0x25c>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -12684,30 +12750,30 @@
   .byte  197,252,17,92,36,128                // vmovups       %ymm3,-0x80(%rsp)
   .byte  197,252,40,233                      // vmovaps       %ymm1,%ymm5
   .byte  197,252,40,224                      // vmovaps       %ymm0,%ymm4
-  .byte  196,98,125,24,5,66,65,0,0           // vbroadcastss  0x4142(%rip),%ymm8        # 58ac <_sk_callback_hsw+0x25c>
+  .byte  196,98,125,24,5,72,65,0,0           // vbroadcastss  0x4148(%rip),%ymm8        # 58e4 <_sk_callback_hsw+0x264>
   .byte  197,60,194,202,2                    // vcmpleps      %ymm2,%ymm8,%ymm9
   .byte  197,84,89,210                       // vmulps        %ymm2,%ymm5,%ymm10
   .byte  196,65,84,92,218                    // vsubps        %ymm10,%ymm5,%ymm11
   .byte  196,67,45,74,203,144                // vblendvps     %ymm9,%ymm11,%ymm10,%ymm9
   .byte  197,52,88,210                       // vaddps        %ymm2,%ymm9,%ymm10
-  .byte  196,98,125,24,13,37,65,0,0          // vbroadcastss  0x4125(%rip),%ymm9        # 58b0 <_sk_callback_hsw+0x260>
+  .byte  196,98,125,24,13,43,65,0,0          // vbroadcastss  0x412b(%rip),%ymm9        # 58e8 <_sk_callback_hsw+0x268>
   .byte  196,66,109,170,202                  // vfmsub213ps   %ymm10,%ymm2,%ymm9
-  .byte  196,98,125,24,29,27,65,0,0          // vbroadcastss  0x411b(%rip),%ymm11        # 58b4 <_sk_callback_hsw+0x264>
+  .byte  196,98,125,24,29,33,65,0,0          // vbroadcastss  0x4121(%rip),%ymm11        # 58ec <_sk_callback_hsw+0x26c>
   .byte  196,65,92,88,219                    // vaddps        %ymm11,%ymm4,%ymm11
   .byte  196,67,125,8,227,1                  // vroundps      $0x1,%ymm11,%ymm12
   .byte  196,65,36,92,252                    // vsubps        %ymm12,%ymm11,%ymm15
   .byte  196,65,44,92,217                    // vsubps        %ymm9,%ymm10,%ymm11
-  .byte  196,98,125,24,45,5,65,0,0           // vbroadcastss  0x4105(%rip),%ymm13        # 58bc <_sk_callback_hsw+0x26c>
+  .byte  196,98,125,24,45,11,65,0,0          // vbroadcastss  0x410b(%rip),%ymm13        # 58f4 <_sk_callback_hsw+0x274>
   .byte  196,193,4,89,197                    // vmulps        %ymm13,%ymm15,%ymm0
-  .byte  196,98,125,24,53,251,64,0,0         // vbroadcastss  0x40fb(%rip),%ymm14        # 58c0 <_sk_callback_hsw+0x270>
+  .byte  196,98,125,24,53,1,65,0,0           // vbroadcastss  0x4101(%rip),%ymm14        # 58f8 <_sk_callback_hsw+0x278>
   .byte  197,12,92,224                       // vsubps        %ymm0,%ymm14,%ymm12
   .byte  196,66,37,168,225                   // vfmadd213ps   %ymm9,%ymm11,%ymm12
-  .byte  196,226,125,24,29,225,64,0,0        // vbroadcastss  0x40e1(%rip),%ymm3        # 58b8 <_sk_callback_hsw+0x268>
+  .byte  196,226,125,24,29,231,64,0,0        // vbroadcastss  0x40e7(%rip),%ymm3        # 58f0 <_sk_callback_hsw+0x270>
   .byte  196,193,100,194,255,2               // vcmpleps      %ymm15,%ymm3,%ymm7
   .byte  196,195,29,74,249,112               // vblendvps     %ymm7,%ymm9,%ymm12,%ymm7
   .byte  196,65,60,194,231,2                 // vcmpleps      %ymm15,%ymm8,%ymm12
   .byte  196,227,45,74,255,192               // vblendvps     %ymm12,%ymm7,%ymm10,%ymm7
-  .byte  196,98,125,24,37,204,64,0,0         // vbroadcastss  0x40cc(%rip),%ymm12        # 58c4 <_sk_callback_hsw+0x274>
+  .byte  196,98,125,24,37,210,64,0,0         // vbroadcastss  0x40d2(%rip),%ymm12        # 58fc <_sk_callback_hsw+0x27c>
   .byte  196,65,28,194,255,2                 // vcmpleps      %ymm15,%ymm12,%ymm15
   .byte  196,194,37,168,193                  // vfmadd213ps   %ymm9,%ymm11,%ymm0
   .byte  196,99,125,74,255,240               // vblendvps     %ymm15,%ymm7,%ymm0,%ymm15
@@ -12723,7 +12789,7 @@
   .byte  197,156,194,192,2                   // vcmpleps      %ymm0,%ymm12,%ymm0
   .byte  196,194,37,168,249                  // vfmadd213ps   %ymm9,%ymm11,%ymm7
   .byte  196,227,69,74,201,0                 // vblendvps     %ymm0,%ymm1,%ymm7,%ymm1
-  .byte  196,226,125,24,5,120,64,0,0         // vbroadcastss  0x4078(%rip),%ymm0        # 58c8 <_sk_callback_hsw+0x278>
+  .byte  196,226,125,24,5,126,64,0,0         // vbroadcastss  0x407e(%rip),%ymm0        # 5900 <_sk_callback_hsw+0x280>
   .byte  197,220,88,192                      // vaddps        %ymm0,%ymm4,%ymm0
   .byte  196,227,125,8,224,1                 // vroundps      $0x1,%ymm0,%ymm4
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
@@ -12771,12 +12837,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,58                              // jne           1931 <_sk_scale_u8_hsw+0x44>
+  .byte  117,58                              // jne           1963 <_sk_scale_u8_hsw+0x44>
   .byte  196,66,121,48,4,19                  // vpmovzxbw     (%r11,%rdx,1),%xmm8
-  .byte  197,57,219,5,155,70,0,0             // vpand         0x469b(%rip),%xmm8,%xmm8        # 5fa0 <_sk_callback_hsw+0x950>
+  .byte  197,57,219,5,169,70,0,0             // vpand         0x46a9(%rip),%xmm8,%xmm8        # 5fe0 <_sk_callback_hsw+0x960>
   .byte  196,66,125,51,192                   // vpmovzxwd     %xmm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,180,63,0,0         // vbroadcastss  0x3fb4(%rip),%ymm9        # 58cc <_sk_callback_hsw+0x27c>
+  .byte  196,98,125,24,13,186,63,0,0         // vbroadcastss  0x3fba(%rip),%ymm9        # 5904 <_sk_callback_hsw+0x284>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
@@ -12789,15 +12855,15 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,183                             // ja            18fd <_sk_scale_u8_hsw+0x10>
+  .byte  119,183                             // ja            192f <_sk_scale_u8_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,123,0,0,0                 // lea           0x7b(%rip),%r10        # 19cc <_sk_scale_u8_hsw+0xdf>
+  .byte  76,141,21,121,0,0,0                 // lea           0x79(%rip),%r10        # 19fc <_sk_scale_u8_hsw+0xdd>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  235,152                             // jmp           18fd <_sk_scale_u8_hsw+0x10>
+  .byte  235,152                             // jmp           192f <_sk_scale_u8_hsw+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,2                    // vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -12805,7 +12871,7 @@
   .byte  197,121,110,200                     // vmovd         %eax,%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,57,2,193,1                   // vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,111,255,255,255                 // jmpq          18fd <_sk_scale_u8_hsw+0x10>
+  .byte  233,111,255,255,255                 // jmpq          192f <_sk_scale_u8_hsw+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,6                    // vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -12816,21 +12882,24 @@
   .byte  196,65,121,110,12,19                // vmovd         (%r11,%rdx,1),%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,49,2,192,12                  // vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  .byte  233,51,255,255,255                  // jmpq          18fd <_sk_scale_u8_hsw+0x10>
-  .byte  102,144                             // xchg          %ax,%ax
-  .byte  142,255                             // mov           %edi,%?
+  .byte  233,51,255,255,255                  // jmpq          192f <_sk_scale_u8_hsw+0x10>
+  .byte  144                                 // nop
   .byte  255                                 // (bad)
-  .byte  255,169,255,255,255,153             // ljmp          *-0x66000001(%rcx)
+  .byte  255                                 // (bad)
+  .byte  255,171,255,255,255,155             // ljmp          *-0x64000001(%rbx)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  232,255,255,255,221                 // callq         ffffffffde0019dc <_sk_callback_hsw+0xffffffffddffc38c>
+  .byte  234                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,210                             // callq         *%rdx
+  .byte  255                                 // (bad)
+  .byte  223,255                             // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,212                             // callq         *%rsp
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,194                             // inc           %edx
+  .byte  255,196                             // inc           %esp
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // .byte         0xff
@@ -12859,12 +12928,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,78                              // jne           1a6f <_sk_lerp_u8_hsw+0x58>
+  .byte  117,78                              // jne           1a9f <_sk_lerp_u8_hsw+0x58>
   .byte  196,66,121,48,4,19                  // vpmovzxbw     (%r11,%rdx,1),%xmm8
-  .byte  197,57,219,5,129,69,0,0             // vpand         0x4581(%rip),%xmm8,%xmm8        # 5fb0 <_sk_callback_hsw+0x960>
+  .byte  197,57,219,5,145,69,0,0             // vpand         0x4591(%rip),%xmm8,%xmm8        # 5ff0 <_sk_callback_hsw+0x970>
   .byte  196,66,125,51,192                   // vpmovzxwd     %xmm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,142,62,0,0         // vbroadcastss  0x3e8e(%rip),%ymm9        # 58d0 <_sk_callback_hsw+0x280>
+  .byte  196,98,125,24,13,150,62,0,0         // vbroadcastss  0x3e96(%rip),%ymm9        # 5908 <_sk_callback_hsw+0x288>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
   .byte  196,226,61,168,196                  // vfmadd213ps   %ymm4,%ymm8,%ymm0
@@ -12881,15 +12950,15 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,163                             // ja            1a27 <_sk_lerp_u8_hsw+0x10>
+  .byte  119,163                             // ja            1a57 <_sk_lerp_u8_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,121,0,0,0                 // lea           0x79(%rip),%r10        # 1b08 <_sk_lerp_u8_hsw+0xf1>
+  .byte  76,141,21,121,0,0,0                 // lea           0x79(%rip),%r10        # 1b38 <_sk_lerp_u8_hsw+0xf1>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  235,132                             // jmp           1a27 <_sk_lerp_u8_hsw+0x10>
+  .byte  235,132                             // jmp           1a57 <_sk_lerp_u8_hsw+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,2                    // vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -12897,7 +12966,7 @@
   .byte  197,121,110,200                     // vmovd         %eax,%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,57,2,193,1                   // vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,91,255,255,255                  // jmpq          1a27 <_sk_lerp_u8_hsw+0x10>
+  .byte  233,91,255,255,255                  // jmpq          1a57 <_sk_lerp_u8_hsw+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,6                    // vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -12908,7 +12977,7 @@
   .byte  196,65,121,110,12,19                // vmovd         (%r11,%rdx,1),%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,49,2,192,12                  // vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  .byte  233,31,255,255,255                  // jmpq          1a27 <_sk_lerp_u8_hsw+0x10>
+  .byte  233,31,255,255,255                  // jmpq          1a57 <_sk_lerp_u8_hsw+0x10>
   .byte  144                                 // nop
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -12937,23 +13006,23 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,169,0,0,0                    // jne           1bdb <_sk_lerp_565_hsw+0xb7>
+  .byte  15,133,169,0,0,0                    // jne           1c0b <_sk_lerp_565_hsw+0xb7>
   .byte  196,65,122,111,4,83                 // vmovdqu       (%r11,%rdx,2),%xmm8
   .byte  196,66,125,51,192                   // vpmovzxwd     %xmm8,%ymm8
-  .byte  196,98,125,88,13,142,61,0,0         // vpbroadcastd  0x3d8e(%rip),%ymm9        # 58d4 <_sk_callback_hsw+0x284>
+  .byte  196,98,125,88,13,150,61,0,0         // vpbroadcastd  0x3d96(%rip),%ymm9        # 590c <_sk_callback_hsw+0x28c>
   .byte  196,65,61,219,201                   // vpand         %ymm9,%ymm8,%ymm9
   .byte  196,65,124,91,201                   // vcvtdq2ps     %ymm9,%ymm9
-  .byte  196,98,125,24,21,127,61,0,0         // vbroadcastss  0x3d7f(%rip),%ymm10        # 58d8 <_sk_callback_hsw+0x288>
+  .byte  196,98,125,24,21,135,61,0,0         // vbroadcastss  0x3d87(%rip),%ymm10        # 5910 <_sk_callback_hsw+0x290>
   .byte  196,65,52,89,202                    // vmulps        %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,88,21,117,61,0,0         // vpbroadcastd  0x3d75(%rip),%ymm10        # 58dc <_sk_callback_hsw+0x28c>
+  .byte  196,98,125,88,21,125,61,0,0         // vpbroadcastd  0x3d7d(%rip),%ymm10        # 5914 <_sk_callback_hsw+0x294>
   .byte  196,65,61,219,210                   // vpand         %ymm10,%ymm8,%ymm10
   .byte  196,65,124,91,210                   // vcvtdq2ps     %ymm10,%ymm10
-  .byte  196,98,125,24,29,102,61,0,0         // vbroadcastss  0x3d66(%rip),%ymm11        # 58e0 <_sk_callback_hsw+0x290>
+  .byte  196,98,125,24,29,110,61,0,0         // vbroadcastss  0x3d6e(%rip),%ymm11        # 5918 <_sk_callback_hsw+0x298>
   .byte  196,65,44,89,211                    // vmulps        %ymm11,%ymm10,%ymm10
-  .byte  196,98,125,88,29,92,61,0,0          // vpbroadcastd  0x3d5c(%rip),%ymm11        # 58e4 <_sk_callback_hsw+0x294>
+  .byte  196,98,125,88,29,100,61,0,0         // vpbroadcastd  0x3d64(%rip),%ymm11        # 591c <_sk_callback_hsw+0x29c>
   .byte  196,65,61,219,195                   // vpand         %ymm11,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,29,77,61,0,0          // vbroadcastss  0x3d4d(%rip),%ymm11        # 58e8 <_sk_callback_hsw+0x298>
+  .byte  196,98,125,24,29,85,61,0,0          // vbroadcastss  0x3d55(%rip),%ymm11        # 5920 <_sk_callback_hsw+0x2a0>
   .byte  196,65,60,89,195                    // vmulps        %ymm11,%ymm8,%ymm8
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
   .byte  196,226,53,168,196                  // vfmadd213ps   %ymm4,%ymm9,%ymm0
@@ -12974,27 +13043,27 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,68,255,255,255               // ja            1b38 <_sk_lerp_565_hsw+0x14>
+  .byte  15,135,68,255,255,255               // ja            1b68 <_sk_lerp_565_hsw+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,101,0,0,0                 // lea           0x65(%rip),%r10        # 1c64 <_sk_lerp_565_hsw+0x140>
+  .byte  76,141,21,101,0,0,0                 // lea           0x65(%rip),%r10        # 1c94 <_sk_lerp_565_hsw+0x140>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  233,34,255,255,255                  // jmpq          1b38 <_sk_lerp_565_hsw+0x14>
+  .byte  233,34,255,255,255                  // jmpq          1b68 <_sk_lerp_565_hsw+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,65,57,196,68,83,4,2             // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,121,110,12,83                // vmovd         (%r11,%rdx,2),%xmm9
   .byte  196,67,57,2,193,1                   // vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,4,255,255,255                   // jmpq          1b38 <_sk_lerp_565_hsw+0x14>
+  .byte  233,4,255,255,255                   // jmpq          1b68 <_sk_lerp_565_hsw+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,65,57,196,68,83,12,6            // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,57,196,68,83,10,5            // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,57,196,68,83,8,4             // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,122,126,12,83                // vmovq         (%r11,%rdx,2),%xmm9
   .byte  196,67,49,2,192,12                  // vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  .byte  233,214,254,255,255                 // jmpq          1b38 <_sk_lerp_565_hsw+0x14>
+  .byte  233,214,254,255,255                 // jmpq          1b68 <_sk_lerp_565_hsw+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  164                                 // movsb         %ds:(%rsi),%es:(%rdi)
   .byte  255                                 // (bad)
@@ -13027,23 +13096,23 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,105                             // jne           1cfe <_sk_load_tables_hsw+0x7e>
+  .byte  117,105                             // jne           1d2e <_sk_load_tables_hsw+0x7e>
   .byte  196,193,124,16,26                   // vmovups       (%r10),%ymm3
-  .byte  197,228,84,13,254,63,0,0            // vandps        0x3ffe(%rip),%ymm3,%ymm1        # 5ca0 <_sk_callback_hsw+0x650>
+  .byte  197,228,84,13,14,64,0,0             // vandps        0x400e(%rip),%ymm3,%ymm1        # 5ce0 <_sk_callback_hsw+0x660>
   .byte  196,65,61,118,192                   // vpcmpeqd      %ymm8,%ymm8,%ymm8
   .byte  72,139,72,8                         // mov           0x8(%rax),%rcx
   .byte  76,139,80,16                        // mov           0x10(%rax),%r10
   .byte  197,237,118,210                     // vpcmpeqd      %ymm2,%ymm2,%ymm2
   .byte  196,226,109,146,4,137               // vgatherdps    %ymm2,(%rcx,%ymm1,4),%ymm0
-  .byte  196,226,101,0,21,254,63,0,0         // vpshufb       0x3ffe(%rip),%ymm3,%ymm2        # 5cc0 <_sk_callback_hsw+0x670>
+  .byte  196,226,101,0,21,14,64,0,0          // vpshufb       0x400e(%rip),%ymm3,%ymm2        # 5d00 <_sk_callback_hsw+0x680>
   .byte  196,65,53,118,201                   // vpcmpeqd      %ymm9,%ymm9,%ymm9
   .byte  196,194,53,146,12,146               // vgatherdps    %ymm9,(%r10,%ymm2,4),%ymm1
   .byte  72,139,64,24                        // mov           0x18(%rax),%rax
-  .byte  196,98,101,0,13,6,64,0,0            // vpshufb       0x4006(%rip),%ymm3,%ymm9        # 5ce0 <_sk_callback_hsw+0x690>
+  .byte  196,98,101,0,13,22,64,0,0           // vpshufb       0x4016(%rip),%ymm3,%ymm9        # 5d20 <_sk_callback_hsw+0x6a0>
   .byte  196,162,61,146,20,136               // vgatherdps    %ymm8,(%rax,%ymm9,4),%ymm2
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,250,59,0,0          // vbroadcastss  0x3bfa(%rip),%ymm8        # 58ec <_sk_callback_hsw+0x29c>
+  .byte  196,98,125,24,5,2,60,0,0            // vbroadcastss  0x3c02(%rip),%ymm8        # 5924 <_sk_callback_hsw+0x2a4>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,201                          // mov           %r9,%rcx
@@ -13056,7 +13125,7 @@
   .byte  196,193,249,110,195                 // vmovq         %r11,%xmm0
   .byte  196,226,125,33,192                  // vpmovsxbd     %xmm0,%ymm0
   .byte  196,194,125,44,26                   // vmaskmovps    (%r10),%ymm0,%ymm3
-  .byte  233,115,255,255,255                 // jmpq          1c9a <_sk_load_tables_hsw+0x1a>
+  .byte  233,115,255,255,255                 // jmpq          1cca <_sk_load_tables_hsw+0x1a>
 
 HIDDEN _sk_load_tables_u16_be_hsw
 .globl _sk_load_tables_u16_be_hsw
@@ -13066,7 +13135,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,201,0,0,0                    // jne           1e06 <_sk_load_tables_u16_be_hsw+0xdf>
+  .byte  15,133,201,0,0,0                    // jne           1e36 <_sk_load_tables_u16_be_hsw+0xdf>
   .byte  196,1,121,16,4,81                   // vmovupd       (%r9,%r10,2),%xmm8
   .byte  196,129,121,16,84,81,16             // vmovupd       0x10(%r9,%r10,2),%xmm2
   .byte  196,129,121,16,92,81,32             // vmovupd       0x20(%r9,%r10,2),%xmm3
@@ -13082,7 +13151,7 @@
   .byte  197,185,108,200                     // vpunpcklqdq   %xmm0,%xmm8,%xmm1
   .byte  197,185,109,208                     // vpunpckhqdq   %xmm0,%xmm8,%xmm2
   .byte  197,49,108,195                      // vpunpcklqdq   %xmm3,%xmm9,%xmm8
-  .byte  197,121,111,21,50,66,0,0            // vmovdqa       0x4232(%rip),%xmm10        # 5fc0 <_sk_callback_hsw+0x970>
+  .byte  197,121,111,21,66,66,0,0            // vmovdqa       0x4242(%rip),%xmm10        # 6000 <_sk_callback_hsw+0x980>
   .byte  196,193,113,219,194                 // vpand         %xmm10,%xmm1,%xmm0
   .byte  196,226,125,51,200                  // vpmovzxwd     %xmm0,%ymm1
   .byte  196,65,37,118,219                   // vpcmpeqd      %ymm11,%ymm11,%ymm11
@@ -13104,36 +13173,36 @@
   .byte  197,185,235,219                     // vpor          %xmm3,%xmm8,%xmm3
   .byte  196,226,125,51,219                  // vpmovzxwd     %xmm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,243,58,0,0          // vbroadcastss  0x3af3(%rip),%ymm8        # 58f0 <_sk_callback_hsw+0x2a0>
+  .byte  196,98,125,24,5,251,58,0,0          // vbroadcastss  0x3afb(%rip),%ymm8        # 5928 <_sk_callback_hsw+0x2a8>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,1,123,16,4,81                   // vmovsd        (%r9,%r10,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,85                              // je            1e6c <_sk_load_tables_u16_be_hsw+0x145>
+  .byte  116,85                              // je            1e9c <_sk_load_tables_u16_be_hsw+0x145>
   .byte  196,1,57,22,68,81,8                 // vmovhpd       0x8(%r9,%r10,2),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,72                              // jb            1e6c <_sk_load_tables_u16_be_hsw+0x145>
+  .byte  114,72                              // jb            1e9c <_sk_load_tables_u16_be_hsw+0x145>
   .byte  196,129,123,16,84,81,16             // vmovsd        0x10(%r9,%r10,2),%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,72                              // je            1e79 <_sk_load_tables_u16_be_hsw+0x152>
+  .byte  116,72                              // je            1ea9 <_sk_load_tables_u16_be_hsw+0x152>
   .byte  196,129,105,22,84,81,24             // vmovhpd       0x18(%r9,%r10,2),%xmm2,%xmm2
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,59                              // jb            1e79 <_sk_load_tables_u16_be_hsw+0x152>
+  .byte  114,59                              // jb            1ea9 <_sk_load_tables_u16_be_hsw+0x152>
   .byte  196,129,123,16,92,81,32             // vmovsd        0x20(%r9,%r10,2),%xmm3
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,9,255,255,255                // je            1d58 <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  15,132,9,255,255,255                // je            1d88 <_sk_load_tables_u16_be_hsw+0x31>
   .byte  196,129,97,22,92,81,40              // vmovhpd       0x28(%r9,%r10,2),%xmm3,%xmm3
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,248,254,255,255              // jb            1d58 <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  15,130,248,254,255,255              // jb            1d88 <_sk_load_tables_u16_be_hsw+0x31>
   .byte  196,1,122,126,76,81,48              // vmovq         0x30(%r9,%r10,2),%xmm9
-  .byte  233,236,254,255,255                 // jmpq          1d58 <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  233,236,254,255,255                 // jmpq          1d88 <_sk_load_tables_u16_be_hsw+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,223,254,255,255                 // jmpq          1d58 <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  233,223,254,255,255                 // jmpq          1d88 <_sk_load_tables_u16_be_hsw+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,214,254,255,255                 // jmpq          1d58 <_sk_load_tables_u16_be_hsw+0x31>
+  .byte  233,214,254,255,255                 // jmpq          1d88 <_sk_load_tables_u16_be_hsw+0x31>
 
 HIDDEN _sk_load_tables_rgb_u16_be_hsw
 .globl _sk_load_tables_rgb_u16_be_hsw
@@ -13143,7 +13212,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,82                        // lea           (%rdx,%rdx,2),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,193,0,0,0                    // jne           1f55 <_sk_load_tables_rgb_u16_be_hsw+0xd3>
+  .byte  15,133,193,0,0,0                    // jne           1f85 <_sk_load_tables_rgb_u16_be_hsw+0xd3>
   .byte  196,129,122,111,4,81                // vmovdqu       (%r9,%r10,2),%xmm0
   .byte  196,129,122,111,84,81,12            // vmovdqu       0xc(%r9,%r10,2),%xmm2
   .byte  196,129,122,111,76,81,24            // vmovdqu       0x18(%r9,%r10,2),%xmm1
@@ -13164,7 +13233,7 @@
   .byte  197,185,108,218                     // vpunpcklqdq   %xmm2,%xmm8,%xmm3
   .byte  197,185,109,210                     // vpunpckhqdq   %xmm2,%xmm8,%xmm2
   .byte  197,121,108,193                     // vpunpcklqdq   %xmm1,%xmm0,%xmm8
-  .byte  197,121,111,13,210,64,0,0           // vmovdqa       0x40d2(%rip),%xmm9        # 5fd0 <_sk_callback_hsw+0x980>
+  .byte  197,121,111,13,226,64,0,0           // vmovdqa       0x40e2(%rip),%xmm9        # 6010 <_sk_callback_hsw+0x990>
   .byte  196,193,97,219,193                  // vpand         %xmm9,%xmm3,%xmm0
   .byte  196,226,125,51,200                  // vpmovzxwd     %xmm0,%ymm1
   .byte  197,229,118,219                     // vpcmpeqd      %ymm3,%ymm3,%ymm3
@@ -13181,48 +13250,48 @@
   .byte  196,98,125,51,194                   // vpmovzxwd     %xmm2,%ymm8
   .byte  196,162,101,146,20,128              // vgatherdps    %ymm3,(%rax,%ymm8,4),%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,161,57,0,0        // vbroadcastss  0x39a1(%rip),%ymm3        # 58f4 <_sk_callback_hsw+0x2a4>
+  .byte  196,226,125,24,29,169,57,0,0        // vbroadcastss  0x39a9(%rip),%ymm3        # 592c <_sk_callback_hsw+0x2ac>
   .byte  255,224                             // jmpq          *%rax
   .byte  196,129,121,110,4,81                // vmovd         (%r9,%r10,2),%xmm0
   .byte  196,129,121,196,68,81,4,2           // vpinsrw       $0x2,0x4(%r9,%r10,2),%xmm0,%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,5                               // jne           1f6e <_sk_load_tables_rgb_u16_be_hsw+0xec>
-  .byte  233,90,255,255,255                  // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  117,5                               // jne           1f9e <_sk_load_tables_rgb_u16_be_hsw+0xec>
+  .byte  233,90,255,255,255                  // jmpq          1ef8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   .byte  196,129,121,110,76,81,6             // vmovd         0x6(%r9,%r10,2),%xmm1
   .byte  196,1,113,196,68,81,10,2            // vpinsrw       $0x2,0xa(%r9,%r10,2),%xmm1,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,26                              // jb            1f9d <_sk_load_tables_rgb_u16_be_hsw+0x11b>
+  .byte  114,26                              // jb            1fcd <_sk_load_tables_rgb_u16_be_hsw+0x11b>
   .byte  196,129,121,110,76,81,12            // vmovd         0xc(%r9,%r10,2),%xmm1
   .byte  196,129,113,196,84,81,16,2          // vpinsrw       $0x2,0x10(%r9,%r10,2),%xmm1,%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  117,10                              // jne           1fa2 <_sk_load_tables_rgb_u16_be_hsw+0x120>
-  .byte  233,43,255,255,255                  // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  .byte  233,38,255,255,255                  // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  117,10                              // jne           1fd2 <_sk_load_tables_rgb_u16_be_hsw+0x120>
+  .byte  233,43,255,255,255                  // jmpq          1ef8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  233,38,255,255,255                  // jmpq          1ef8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   .byte  196,129,121,110,76,81,18            // vmovd         0x12(%r9,%r10,2),%xmm1
   .byte  196,1,113,196,76,81,22,2            // vpinsrw       $0x2,0x16(%r9,%r10,2),%xmm1,%xmm9
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,26                              // jb            1fd1 <_sk_load_tables_rgb_u16_be_hsw+0x14f>
+  .byte  114,26                              // jb            2001 <_sk_load_tables_rgb_u16_be_hsw+0x14f>
   .byte  196,129,121,110,76,81,24            // vmovd         0x18(%r9,%r10,2),%xmm1
   .byte  196,129,113,196,76,81,28,2          // vpinsrw       $0x2,0x1c(%r9,%r10,2),%xmm1,%xmm1
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  117,10                              // jne           1fd6 <_sk_load_tables_rgb_u16_be_hsw+0x154>
-  .byte  233,247,254,255,255                 // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  .byte  233,242,254,255,255                 // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  117,10                              // jne           2006 <_sk_load_tables_rgb_u16_be_hsw+0x154>
+  .byte  233,247,254,255,255                 // jmpq          1ef8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  233,242,254,255,255                 // jmpq          1ef8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   .byte  196,129,121,110,92,81,30            // vmovd         0x1e(%r9,%r10,2),%xmm3
   .byte  196,1,97,196,92,81,34,2             // vpinsrw       $0x2,0x22(%r9,%r10,2),%xmm3,%xmm11
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,20                              // jb            1fff <_sk_load_tables_rgb_u16_be_hsw+0x17d>
+  .byte  114,20                              // jb            202f <_sk_load_tables_rgb_u16_be_hsw+0x17d>
   .byte  196,129,121,110,92,81,36            // vmovd         0x24(%r9,%r10,2),%xmm3
   .byte  196,129,97,196,92,81,40,2           // vpinsrw       $0x2,0x28(%r9,%r10,2),%xmm3,%xmm3
-  .byte  233,201,254,255,255                 // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  .byte  233,196,254,255,255                 // jmpq          1ec8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  233,201,254,255,255                 // jmpq          1ef8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  .byte  233,196,254,255,255                 // jmpq          1ef8 <_sk_load_tables_rgb_u16_be_hsw+0x46>
 
 HIDDEN _sk_byte_tables_hsw
 .globl _sk_byte_tables_hsw
 FUNCTION(_sk_byte_tables_hsw)
 _sk_byte_tables_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,233,56,0,0          // vbroadcastss  0x38e9(%rip),%ymm8        # 58f8 <_sk_callback_hsw+0x2a8>
+  .byte  196,98,125,24,5,241,56,0,0          // vbroadcastss  0x38f1(%rip),%ymm8        # 5930 <_sk_callback_hsw+0x2b0>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  197,125,91,200                      // vcvtps2dq     %ymm0,%ymm9
   .byte  196,65,249,126,201                  // vmovq         %xmm9,%r9
@@ -13344,7 +13413,7 @@
   .byte  67,15,182,4,26                      // movzbl        (%r10,%r11,1),%eax
   .byte  196,194,125,49,193                  // vpmovzxbd     %xmm9,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,142,54,0,0          // vbroadcastss  0x368e(%rip),%ymm8        # 58fc <_sk_callback_hsw+0x2ac>
+  .byte  196,98,125,24,5,150,54,0,0          // vbroadcastss  0x3696(%rip),%ymm8        # 5934 <_sk_callback_hsw+0x2b4>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  196,226,125,49,201                  // vpmovzxbd     %xmm1,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
@@ -13460,7 +13529,7 @@
   .byte  67,15,182,4,26                      // movzbl        (%r10,%r11,1),%eax
   .byte  196,194,125,49,193                  // vpmovzxbd     %xmm9,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,122,52,0,0          // vbroadcastss  0x347a(%rip),%ymm8        # 5900 <_sk_callback_hsw+0x2b0>
+  .byte  196,98,125,24,5,130,52,0,0          // vbroadcastss  0x3482(%rip),%ymm8        # 5938 <_sk_callback_hsw+0x2b8>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  196,226,125,49,201                  // vpmovzxbd     %xmm1,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
@@ -13559,33 +13628,33 @@
   .byte  196,66,125,168,211                  // vfmadd213ps   %ymm11,%ymm0,%ymm10
   .byte  196,226,125,24,0                    // vbroadcastss  (%rax),%ymm0
   .byte  196,65,124,91,218                   // vcvtdq2ps     %ymm10,%ymm11
-  .byte  196,98,125,24,37,84,51,0,0          // vbroadcastss  0x3354(%rip),%ymm12        # 5904 <_sk_callback_hsw+0x2b4>
-  .byte  196,98,125,24,45,79,51,0,0          // vbroadcastss  0x334f(%rip),%ymm13        # 5908 <_sk_callback_hsw+0x2b8>
+  .byte  196,98,125,24,37,92,51,0,0          // vbroadcastss  0x335c(%rip),%ymm12        # 593c <_sk_callback_hsw+0x2bc>
+  .byte  196,98,125,24,45,87,51,0,0          // vbroadcastss  0x3357(%rip),%ymm13        # 5940 <_sk_callback_hsw+0x2c0>
   .byte  196,65,44,84,213                    // vandps        %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,69,51,0,0          // vbroadcastss  0x3345(%rip),%ymm13        # 590c <_sk_callback_hsw+0x2bc>
+  .byte  196,98,125,24,45,77,51,0,0          // vbroadcastss  0x334d(%rip),%ymm13        # 5944 <_sk_callback_hsw+0x2c4>
   .byte  196,65,44,86,213                    // vorps         %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,59,51,0,0          // vbroadcastss  0x333b(%rip),%ymm13        # 5910 <_sk_callback_hsw+0x2c0>
+  .byte  196,98,125,24,45,67,51,0,0          // vbroadcastss  0x3343(%rip),%ymm13        # 5948 <_sk_callback_hsw+0x2c8>
   .byte  196,66,37,184,236                   // vfmadd231ps   %ymm12,%ymm11,%ymm13
-  .byte  196,98,125,24,29,49,51,0,0          // vbroadcastss  0x3331(%rip),%ymm11        # 5914 <_sk_callback_hsw+0x2c4>
+  .byte  196,98,125,24,29,57,51,0,0          // vbroadcastss  0x3339(%rip),%ymm11        # 594c <_sk_callback_hsw+0x2cc>
   .byte  196,66,45,172,221                   // vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  .byte  196,98,125,24,37,39,51,0,0          // vbroadcastss  0x3327(%rip),%ymm12        # 5918 <_sk_callback_hsw+0x2c8>
+  .byte  196,98,125,24,37,47,51,0,0          // vbroadcastss  0x332f(%rip),%ymm12        # 5950 <_sk_callback_hsw+0x2d0>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,29,51,0,0          // vbroadcastss  0x331d(%rip),%ymm12        # 591c <_sk_callback_hsw+0x2cc>
+  .byte  196,98,125,24,37,37,51,0,0          // vbroadcastss  0x3325(%rip),%ymm12        # 5954 <_sk_callback_hsw+0x2d4>
   .byte  196,65,28,94,210                    // vdivps        %ymm10,%ymm12,%ymm10
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  196,99,125,8,208,1                  // vroundps      $0x1,%ymm0,%ymm10
   .byte  196,65,124,92,210                   // vsubps        %ymm10,%ymm0,%ymm10
-  .byte  196,98,125,24,29,254,50,0,0         // vbroadcastss  0x32fe(%rip),%ymm11        # 5920 <_sk_callback_hsw+0x2d0>
+  .byte  196,98,125,24,29,6,51,0,0           // vbroadcastss  0x3306(%rip),%ymm11        # 5958 <_sk_callback_hsw+0x2d8>
   .byte  196,193,124,88,195                  // vaddps        %ymm11,%ymm0,%ymm0
-  .byte  196,98,125,24,29,244,50,0,0         // vbroadcastss  0x32f4(%rip),%ymm11        # 5924 <_sk_callback_hsw+0x2d4>
+  .byte  196,98,125,24,29,252,50,0,0         // vbroadcastss  0x32fc(%rip),%ymm11        # 595c <_sk_callback_hsw+0x2dc>
   .byte  196,98,45,172,216                   // vfnmadd213ps  %ymm0,%ymm10,%ymm11
-  .byte  196,226,125,24,5,234,50,0,0         // vbroadcastss  0x32ea(%rip),%ymm0        # 5928 <_sk_callback_hsw+0x2d8>
+  .byte  196,226,125,24,5,242,50,0,0         // vbroadcastss  0x32f2(%rip),%ymm0        # 5960 <_sk_callback_hsw+0x2e0>
   .byte  196,193,124,92,194                  // vsubps        %ymm10,%ymm0,%ymm0
-  .byte  196,98,125,24,21,224,50,0,0         // vbroadcastss  0x32e0(%rip),%ymm10        # 592c <_sk_callback_hsw+0x2dc>
+  .byte  196,98,125,24,21,232,50,0,0         // vbroadcastss  0x32e8(%rip),%ymm10        # 5964 <_sk_callback_hsw+0x2e4>
   .byte  197,172,94,192                      // vdivps        %ymm0,%ymm10,%ymm0
   .byte  197,164,88,192                      // vaddps        %ymm0,%ymm11,%ymm0
-  .byte  196,98,125,24,21,211,50,0,0         // vbroadcastss  0x32d3(%rip),%ymm10        # 5930 <_sk_callback_hsw+0x2e0>
+  .byte  196,98,125,24,21,219,50,0,0         // vbroadcastss  0x32db(%rip),%ymm10        # 5968 <_sk_callback_hsw+0x2e8>
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  197,253,91,192                      // vcvtps2dq     %ymm0,%ymm0
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -13593,7 +13662,7 @@
   .byte  196,195,125,74,193,128              // vblendvps     %ymm8,%ymm9,%ymm0,%ymm0
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,124,95,192                  // vmaxps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,170,50,0,0          // vbroadcastss  0x32aa(%rip),%ymm8        # 5934 <_sk_callback_hsw+0x2e4>
+  .byte  196,98,125,24,5,178,50,0,0          // vbroadcastss  0x32b2(%rip),%ymm8        # 596c <_sk_callback_hsw+0x2ec>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -13613,33 +13682,33 @@
   .byte  196,66,117,168,211                  // vfmadd213ps   %ymm11,%ymm1,%ymm10
   .byte  196,226,125,24,8                    // vbroadcastss  (%rax),%ymm1
   .byte  196,65,124,91,218                   // vcvtdq2ps     %ymm10,%ymm11
-  .byte  196,98,125,24,37,98,50,0,0          // vbroadcastss  0x3262(%rip),%ymm12        # 5938 <_sk_callback_hsw+0x2e8>
-  .byte  196,98,125,24,45,93,50,0,0          // vbroadcastss  0x325d(%rip),%ymm13        # 593c <_sk_callback_hsw+0x2ec>
+  .byte  196,98,125,24,37,106,50,0,0         // vbroadcastss  0x326a(%rip),%ymm12        # 5970 <_sk_callback_hsw+0x2f0>
+  .byte  196,98,125,24,45,101,50,0,0         // vbroadcastss  0x3265(%rip),%ymm13        # 5974 <_sk_callback_hsw+0x2f4>
   .byte  196,65,44,84,213                    // vandps        %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,83,50,0,0          // vbroadcastss  0x3253(%rip),%ymm13        # 5940 <_sk_callback_hsw+0x2f0>
+  .byte  196,98,125,24,45,91,50,0,0          // vbroadcastss  0x325b(%rip),%ymm13        # 5978 <_sk_callback_hsw+0x2f8>
   .byte  196,65,44,86,213                    // vorps         %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,73,50,0,0          // vbroadcastss  0x3249(%rip),%ymm13        # 5944 <_sk_callback_hsw+0x2f4>
+  .byte  196,98,125,24,45,81,50,0,0          // vbroadcastss  0x3251(%rip),%ymm13        # 597c <_sk_callback_hsw+0x2fc>
   .byte  196,66,37,184,236                   // vfmadd231ps   %ymm12,%ymm11,%ymm13
-  .byte  196,98,125,24,29,63,50,0,0          // vbroadcastss  0x323f(%rip),%ymm11        # 5948 <_sk_callback_hsw+0x2f8>
+  .byte  196,98,125,24,29,71,50,0,0          // vbroadcastss  0x3247(%rip),%ymm11        # 5980 <_sk_callback_hsw+0x300>
   .byte  196,66,45,172,221                   // vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  .byte  196,98,125,24,37,53,50,0,0          // vbroadcastss  0x3235(%rip),%ymm12        # 594c <_sk_callback_hsw+0x2fc>
+  .byte  196,98,125,24,37,61,50,0,0          // vbroadcastss  0x323d(%rip),%ymm12        # 5984 <_sk_callback_hsw+0x304>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,43,50,0,0          // vbroadcastss  0x322b(%rip),%ymm12        # 5950 <_sk_callback_hsw+0x300>
+  .byte  196,98,125,24,37,51,50,0,0          // vbroadcastss  0x3233(%rip),%ymm12        # 5988 <_sk_callback_hsw+0x308>
   .byte  196,65,28,94,210                    // vdivps        %ymm10,%ymm12,%ymm10
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
   .byte  196,193,116,89,202                  // vmulps        %ymm10,%ymm1,%ymm1
   .byte  196,99,125,8,209,1                  // vroundps      $0x1,%ymm1,%ymm10
   .byte  196,65,116,92,210                   // vsubps        %ymm10,%ymm1,%ymm10
-  .byte  196,98,125,24,29,12,50,0,0          // vbroadcastss  0x320c(%rip),%ymm11        # 5954 <_sk_callback_hsw+0x304>
+  .byte  196,98,125,24,29,20,50,0,0          // vbroadcastss  0x3214(%rip),%ymm11        # 598c <_sk_callback_hsw+0x30c>
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,2,50,0,0           // vbroadcastss  0x3202(%rip),%ymm11        # 5958 <_sk_callback_hsw+0x308>
+  .byte  196,98,125,24,29,10,50,0,0          // vbroadcastss  0x320a(%rip),%ymm11        # 5990 <_sk_callback_hsw+0x310>
   .byte  196,98,45,172,217                   // vfnmadd213ps  %ymm1,%ymm10,%ymm11
-  .byte  196,226,125,24,13,248,49,0,0        // vbroadcastss  0x31f8(%rip),%ymm1        # 595c <_sk_callback_hsw+0x30c>
+  .byte  196,226,125,24,13,0,50,0,0          // vbroadcastss  0x3200(%rip),%ymm1        # 5994 <_sk_callback_hsw+0x314>
   .byte  196,193,116,92,202                  // vsubps        %ymm10,%ymm1,%ymm1
-  .byte  196,98,125,24,21,238,49,0,0         // vbroadcastss  0x31ee(%rip),%ymm10        # 5960 <_sk_callback_hsw+0x310>
+  .byte  196,98,125,24,21,246,49,0,0         // vbroadcastss  0x31f6(%rip),%ymm10        # 5998 <_sk_callback_hsw+0x318>
   .byte  197,172,94,201                      // vdivps        %ymm1,%ymm10,%ymm1
   .byte  197,164,88,201                      // vaddps        %ymm1,%ymm11,%ymm1
-  .byte  196,98,125,24,21,225,49,0,0         // vbroadcastss  0x31e1(%rip),%ymm10        # 5964 <_sk_callback_hsw+0x314>
+  .byte  196,98,125,24,21,233,49,0,0         // vbroadcastss  0x31e9(%rip),%ymm10        # 599c <_sk_callback_hsw+0x31c>
   .byte  196,193,116,89,202                  // vmulps        %ymm10,%ymm1,%ymm1
   .byte  197,253,91,201                      // vcvtps2dq     %ymm1,%ymm1
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -13647,7 +13716,7 @@
   .byte  196,195,117,74,201,128              // vblendvps     %ymm8,%ymm9,%ymm1,%ymm1
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,116,95,200                  // vmaxps        %ymm8,%ymm1,%ymm1
-  .byte  196,98,125,24,5,184,49,0,0          // vbroadcastss  0x31b8(%rip),%ymm8        # 5968 <_sk_callback_hsw+0x318>
+  .byte  196,98,125,24,5,192,49,0,0          // vbroadcastss  0x31c0(%rip),%ymm8        # 59a0 <_sk_callback_hsw+0x320>
   .byte  196,193,116,93,200                  // vminps        %ymm8,%ymm1,%ymm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -13667,33 +13736,33 @@
   .byte  196,66,109,168,211                  // vfmadd213ps   %ymm11,%ymm2,%ymm10
   .byte  196,226,125,24,16                   // vbroadcastss  (%rax),%ymm2
   .byte  196,65,124,91,218                   // vcvtdq2ps     %ymm10,%ymm11
-  .byte  196,98,125,24,37,112,49,0,0         // vbroadcastss  0x3170(%rip),%ymm12        # 596c <_sk_callback_hsw+0x31c>
-  .byte  196,98,125,24,45,107,49,0,0         // vbroadcastss  0x316b(%rip),%ymm13        # 5970 <_sk_callback_hsw+0x320>
+  .byte  196,98,125,24,37,120,49,0,0         // vbroadcastss  0x3178(%rip),%ymm12        # 59a4 <_sk_callback_hsw+0x324>
+  .byte  196,98,125,24,45,115,49,0,0         // vbroadcastss  0x3173(%rip),%ymm13        # 59a8 <_sk_callback_hsw+0x328>
   .byte  196,65,44,84,213                    // vandps        %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,97,49,0,0          // vbroadcastss  0x3161(%rip),%ymm13        # 5974 <_sk_callback_hsw+0x324>
+  .byte  196,98,125,24,45,105,49,0,0         // vbroadcastss  0x3169(%rip),%ymm13        # 59ac <_sk_callback_hsw+0x32c>
   .byte  196,65,44,86,213                    // vorps         %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,87,49,0,0          // vbroadcastss  0x3157(%rip),%ymm13        # 5978 <_sk_callback_hsw+0x328>
+  .byte  196,98,125,24,45,95,49,0,0          // vbroadcastss  0x315f(%rip),%ymm13        # 59b0 <_sk_callback_hsw+0x330>
   .byte  196,66,37,184,236                   // vfmadd231ps   %ymm12,%ymm11,%ymm13
-  .byte  196,98,125,24,29,77,49,0,0          // vbroadcastss  0x314d(%rip),%ymm11        # 597c <_sk_callback_hsw+0x32c>
+  .byte  196,98,125,24,29,85,49,0,0          // vbroadcastss  0x3155(%rip),%ymm11        # 59b4 <_sk_callback_hsw+0x334>
   .byte  196,66,45,172,221                   // vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  .byte  196,98,125,24,37,67,49,0,0          // vbroadcastss  0x3143(%rip),%ymm12        # 5980 <_sk_callback_hsw+0x330>
+  .byte  196,98,125,24,37,75,49,0,0          // vbroadcastss  0x314b(%rip),%ymm12        # 59b8 <_sk_callback_hsw+0x338>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,57,49,0,0          // vbroadcastss  0x3139(%rip),%ymm12        # 5984 <_sk_callback_hsw+0x334>
+  .byte  196,98,125,24,37,65,49,0,0          // vbroadcastss  0x3141(%rip),%ymm12        # 59bc <_sk_callback_hsw+0x33c>
   .byte  196,65,28,94,210                    // vdivps        %ymm10,%ymm12,%ymm10
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
   .byte  196,193,108,89,210                  // vmulps        %ymm10,%ymm2,%ymm2
   .byte  196,99,125,8,210,1                  // vroundps      $0x1,%ymm2,%ymm10
   .byte  196,65,108,92,210                   // vsubps        %ymm10,%ymm2,%ymm10
-  .byte  196,98,125,24,29,26,49,0,0          // vbroadcastss  0x311a(%rip),%ymm11        # 5988 <_sk_callback_hsw+0x338>
+  .byte  196,98,125,24,29,34,49,0,0          // vbroadcastss  0x3122(%rip),%ymm11        # 59c0 <_sk_callback_hsw+0x340>
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
-  .byte  196,98,125,24,29,16,49,0,0          // vbroadcastss  0x3110(%rip),%ymm11        # 598c <_sk_callback_hsw+0x33c>
+  .byte  196,98,125,24,29,24,49,0,0          // vbroadcastss  0x3118(%rip),%ymm11        # 59c4 <_sk_callback_hsw+0x344>
   .byte  196,98,45,172,218                   // vfnmadd213ps  %ymm2,%ymm10,%ymm11
-  .byte  196,226,125,24,21,6,49,0,0          // vbroadcastss  0x3106(%rip),%ymm2        # 5990 <_sk_callback_hsw+0x340>
+  .byte  196,226,125,24,21,14,49,0,0         // vbroadcastss  0x310e(%rip),%ymm2        # 59c8 <_sk_callback_hsw+0x348>
   .byte  196,193,108,92,210                  // vsubps        %ymm10,%ymm2,%ymm2
-  .byte  196,98,125,24,21,252,48,0,0         // vbroadcastss  0x30fc(%rip),%ymm10        # 5994 <_sk_callback_hsw+0x344>
+  .byte  196,98,125,24,21,4,49,0,0           // vbroadcastss  0x3104(%rip),%ymm10        # 59cc <_sk_callback_hsw+0x34c>
   .byte  197,172,94,210                      // vdivps        %ymm2,%ymm10,%ymm2
   .byte  197,164,88,210                      // vaddps        %ymm2,%ymm11,%ymm2
-  .byte  196,98,125,24,21,239,48,0,0         // vbroadcastss  0x30ef(%rip),%ymm10        # 5998 <_sk_callback_hsw+0x348>
+  .byte  196,98,125,24,21,247,48,0,0         // vbroadcastss  0x30f7(%rip),%ymm10        # 59d0 <_sk_callback_hsw+0x350>
   .byte  196,193,108,89,210                  // vmulps        %ymm10,%ymm2,%ymm2
   .byte  197,253,91,210                      // vcvtps2dq     %ymm2,%ymm2
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -13701,7 +13770,7 @@
   .byte  196,195,109,74,209,128              // vblendvps     %ymm8,%ymm9,%ymm2,%ymm2
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,108,95,208                  // vmaxps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,198,48,0,0          // vbroadcastss  0x30c6(%rip),%ymm8        # 599c <_sk_callback_hsw+0x34c>
+  .byte  196,98,125,24,5,206,48,0,0          // vbroadcastss  0x30ce(%rip),%ymm8        # 59d4 <_sk_callback_hsw+0x354>
   .byte  196,193,108,93,208                  // vminps        %ymm8,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -13721,33 +13790,33 @@
   .byte  196,66,101,168,211                  // vfmadd213ps   %ymm11,%ymm3,%ymm10
   .byte  196,226,125,24,24                   // vbroadcastss  (%rax),%ymm3
   .byte  196,65,124,91,218                   // vcvtdq2ps     %ymm10,%ymm11
-  .byte  196,98,125,24,37,126,48,0,0         // vbroadcastss  0x307e(%rip),%ymm12        # 59a0 <_sk_callback_hsw+0x350>
-  .byte  196,98,125,24,45,121,48,0,0         // vbroadcastss  0x3079(%rip),%ymm13        # 59a4 <_sk_callback_hsw+0x354>
+  .byte  196,98,125,24,37,134,48,0,0         // vbroadcastss  0x3086(%rip),%ymm12        # 59d8 <_sk_callback_hsw+0x358>
+  .byte  196,98,125,24,45,129,48,0,0         // vbroadcastss  0x3081(%rip),%ymm13        # 59dc <_sk_callback_hsw+0x35c>
   .byte  196,65,44,84,213                    // vandps        %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,111,48,0,0         // vbroadcastss  0x306f(%rip),%ymm13        # 59a8 <_sk_callback_hsw+0x358>
+  .byte  196,98,125,24,45,119,48,0,0         // vbroadcastss  0x3077(%rip),%ymm13        # 59e0 <_sk_callback_hsw+0x360>
   .byte  196,65,44,86,213                    // vorps         %ymm13,%ymm10,%ymm10
-  .byte  196,98,125,24,45,101,48,0,0         // vbroadcastss  0x3065(%rip),%ymm13        # 59ac <_sk_callback_hsw+0x35c>
+  .byte  196,98,125,24,45,109,48,0,0         // vbroadcastss  0x306d(%rip),%ymm13        # 59e4 <_sk_callback_hsw+0x364>
   .byte  196,66,37,184,236                   // vfmadd231ps   %ymm12,%ymm11,%ymm13
-  .byte  196,98,125,24,29,91,48,0,0          // vbroadcastss  0x305b(%rip),%ymm11        # 59b0 <_sk_callback_hsw+0x360>
+  .byte  196,98,125,24,29,99,48,0,0          // vbroadcastss  0x3063(%rip),%ymm11        # 59e8 <_sk_callback_hsw+0x368>
   .byte  196,66,45,172,221                   // vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  .byte  196,98,125,24,37,81,48,0,0          // vbroadcastss  0x3051(%rip),%ymm12        # 59b4 <_sk_callback_hsw+0x364>
+  .byte  196,98,125,24,37,89,48,0,0          // vbroadcastss  0x3059(%rip),%ymm12        # 59ec <_sk_callback_hsw+0x36c>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,71,48,0,0          // vbroadcastss  0x3047(%rip),%ymm12        # 59b8 <_sk_callback_hsw+0x368>
+  .byte  196,98,125,24,37,79,48,0,0          // vbroadcastss  0x304f(%rip),%ymm12        # 59f0 <_sk_callback_hsw+0x370>
   .byte  196,65,28,94,210                    // vdivps        %ymm10,%ymm12,%ymm10
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
   .byte  196,193,100,89,218                  // vmulps        %ymm10,%ymm3,%ymm3
   .byte  196,99,125,8,211,1                  // vroundps      $0x1,%ymm3,%ymm10
   .byte  196,65,100,92,210                   // vsubps        %ymm10,%ymm3,%ymm10
-  .byte  196,98,125,24,29,40,48,0,0          // vbroadcastss  0x3028(%rip),%ymm11        # 59bc <_sk_callback_hsw+0x36c>
+  .byte  196,98,125,24,29,48,48,0,0          // vbroadcastss  0x3030(%rip),%ymm11        # 59f4 <_sk_callback_hsw+0x374>
   .byte  196,193,100,88,219                  // vaddps        %ymm11,%ymm3,%ymm3
-  .byte  196,98,125,24,29,30,48,0,0          // vbroadcastss  0x301e(%rip),%ymm11        # 59c0 <_sk_callback_hsw+0x370>
+  .byte  196,98,125,24,29,38,48,0,0          // vbroadcastss  0x3026(%rip),%ymm11        # 59f8 <_sk_callback_hsw+0x378>
   .byte  196,98,45,172,219                   // vfnmadd213ps  %ymm3,%ymm10,%ymm11
-  .byte  196,226,125,24,29,20,48,0,0         // vbroadcastss  0x3014(%rip),%ymm3        # 59c4 <_sk_callback_hsw+0x374>
+  .byte  196,226,125,24,29,28,48,0,0         // vbroadcastss  0x301c(%rip),%ymm3        # 59fc <_sk_callback_hsw+0x37c>
   .byte  196,193,100,92,218                  // vsubps        %ymm10,%ymm3,%ymm3
-  .byte  196,98,125,24,21,10,48,0,0          // vbroadcastss  0x300a(%rip),%ymm10        # 59c8 <_sk_callback_hsw+0x378>
+  .byte  196,98,125,24,21,18,48,0,0          // vbroadcastss  0x3012(%rip),%ymm10        # 5a00 <_sk_callback_hsw+0x380>
   .byte  197,172,94,219                      // vdivps        %ymm3,%ymm10,%ymm3
   .byte  197,164,88,219                      // vaddps        %ymm3,%ymm11,%ymm3
-  .byte  196,98,125,24,21,253,47,0,0         // vbroadcastss  0x2ffd(%rip),%ymm10        # 59cc <_sk_callback_hsw+0x37c>
+  .byte  196,98,125,24,21,5,48,0,0           // vbroadcastss  0x3005(%rip),%ymm10        # 5a04 <_sk_callback_hsw+0x384>
   .byte  196,193,100,89,218                  // vmulps        %ymm10,%ymm3,%ymm3
   .byte  197,253,91,219                      // vcvtps2dq     %ymm3,%ymm3
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -13755,7 +13824,7 @@
   .byte  196,195,101,74,217,128              // vblendvps     %ymm8,%ymm9,%ymm3,%ymm3
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,100,95,216                  // vmaxps        %ymm8,%ymm3,%ymm3
-  .byte  196,98,125,24,5,212,47,0,0          // vbroadcastss  0x2fd4(%rip),%ymm8        # 59d0 <_sk_callback_hsw+0x380>
+  .byte  196,98,125,24,5,220,47,0,0          // vbroadcastss  0x2fdc(%rip),%ymm8        # 5a08 <_sk_callback_hsw+0x388>
   .byte  196,193,100,93,216                  // vminps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -13764,26 +13833,26 @@
 .globl _sk_lab_to_xyz_hsw
 FUNCTION(_sk_lab_to_xyz_hsw)
 _sk_lab_to_xyz_hsw:
-  .byte  196,98,125,24,5,198,47,0,0          // vbroadcastss  0x2fc6(%rip),%ymm8        # 59d4 <_sk_callback_hsw+0x384>
-  .byte  196,98,125,24,13,193,47,0,0         // vbroadcastss  0x2fc1(%rip),%ymm9        # 59d8 <_sk_callback_hsw+0x388>
-  .byte  196,98,125,24,21,188,47,0,0         // vbroadcastss  0x2fbc(%rip),%ymm10        # 59dc <_sk_callback_hsw+0x38c>
+  .byte  196,98,125,24,5,206,47,0,0          // vbroadcastss  0x2fce(%rip),%ymm8        # 5a0c <_sk_callback_hsw+0x38c>
+  .byte  196,98,125,24,13,201,47,0,0         // vbroadcastss  0x2fc9(%rip),%ymm9        # 5a10 <_sk_callback_hsw+0x390>
+  .byte  196,98,125,24,21,196,47,0,0         // vbroadcastss  0x2fc4(%rip),%ymm10        # 5a14 <_sk_callback_hsw+0x394>
   .byte  196,194,53,168,202                  // vfmadd213ps   %ymm10,%ymm9,%ymm1
   .byte  196,194,53,168,210                  // vfmadd213ps   %ymm10,%ymm9,%ymm2
-  .byte  196,98,125,24,13,173,47,0,0         // vbroadcastss  0x2fad(%rip),%ymm9        # 59e0 <_sk_callback_hsw+0x390>
+  .byte  196,98,125,24,13,181,47,0,0         // vbroadcastss  0x2fb5(%rip),%ymm9        # 5a18 <_sk_callback_hsw+0x398>
   .byte  196,66,125,184,200                  // vfmadd231ps   %ymm8,%ymm0,%ymm9
-  .byte  196,226,125,24,5,163,47,0,0         // vbroadcastss  0x2fa3(%rip),%ymm0        # 59e4 <_sk_callback_hsw+0x394>
+  .byte  196,226,125,24,5,171,47,0,0         // vbroadcastss  0x2fab(%rip),%ymm0        # 5a1c <_sk_callback_hsw+0x39c>
   .byte  197,180,89,192                      // vmulps        %ymm0,%ymm9,%ymm0
-  .byte  196,98,125,24,5,154,47,0,0          // vbroadcastss  0x2f9a(%rip),%ymm8        # 59e8 <_sk_callback_hsw+0x398>
+  .byte  196,98,125,24,5,162,47,0,0          // vbroadcastss  0x2fa2(%rip),%ymm8        # 5a20 <_sk_callback_hsw+0x3a0>
   .byte  196,98,117,168,192                  // vfmadd213ps   %ymm0,%ymm1,%ymm8
-  .byte  196,98,125,24,13,144,47,0,0         // vbroadcastss  0x2f90(%rip),%ymm9        # 59ec <_sk_callback_hsw+0x39c>
+  .byte  196,98,125,24,13,152,47,0,0         // vbroadcastss  0x2f98(%rip),%ymm9        # 5a24 <_sk_callback_hsw+0x3a4>
   .byte  196,98,109,172,200                  // vfnmadd213ps  %ymm0,%ymm2,%ymm9
   .byte  196,193,60,89,200                   // vmulps        %ymm8,%ymm8,%ymm1
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
-  .byte  196,226,125,24,21,125,47,0,0        // vbroadcastss  0x2f7d(%rip),%ymm2        # 59f0 <_sk_callback_hsw+0x3a0>
+  .byte  196,226,125,24,21,133,47,0,0        // vbroadcastss  0x2f85(%rip),%ymm2        # 5a28 <_sk_callback_hsw+0x3a8>
   .byte  197,108,194,209,1                   // vcmpltps      %ymm1,%ymm2,%ymm10
-  .byte  196,98,125,24,29,115,47,0,0         // vbroadcastss  0x2f73(%rip),%ymm11        # 59f4 <_sk_callback_hsw+0x3a4>
+  .byte  196,98,125,24,29,123,47,0,0         // vbroadcastss  0x2f7b(%rip),%ymm11        # 5a2c <_sk_callback_hsw+0x3ac>
   .byte  196,65,60,88,195                    // vaddps        %ymm11,%ymm8,%ymm8
-  .byte  196,98,125,24,37,105,47,0,0         // vbroadcastss  0x2f69(%rip),%ymm12        # 59f8 <_sk_callback_hsw+0x3a8>
+  .byte  196,98,125,24,37,113,47,0,0         // vbroadcastss  0x2f71(%rip),%ymm12        # 5a30 <_sk_callback_hsw+0x3b0>
   .byte  196,65,60,89,196                    // vmulps        %ymm12,%ymm8,%ymm8
   .byte  196,99,61,74,193,160                // vblendvps     %ymm10,%ymm1,%ymm8,%ymm8
   .byte  197,252,89,200                      // vmulps        %ymm0,%ymm0,%ymm1
@@ -13798,9 +13867,9 @@
   .byte  196,65,52,88,203                    // vaddps        %ymm11,%ymm9,%ymm9
   .byte  196,65,52,89,204                    // vmulps        %ymm12,%ymm9,%ymm9
   .byte  196,227,53,74,208,32                // vblendvps     %ymm2,%ymm0,%ymm9,%ymm2
-  .byte  196,226,125,24,5,30,47,0,0          // vbroadcastss  0x2f1e(%rip),%ymm0        # 59fc <_sk_callback_hsw+0x3ac>
+  .byte  196,226,125,24,5,38,47,0,0          // vbroadcastss  0x2f26(%rip),%ymm0        # 5a34 <_sk_callback_hsw+0x3b4>
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
-  .byte  196,98,125,24,5,21,47,0,0           // vbroadcastss  0x2f15(%rip),%ymm8        # 5a00 <_sk_callback_hsw+0x3b0>
+  .byte  196,98,125,24,5,29,47,0,0           // vbroadcastss  0x2f1d(%rip),%ymm8        # 5a38 <_sk_callback_hsw+0x3b8>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -13812,12 +13881,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,52                              // jne           2b32 <_sk_load_a8_hsw+0x3e>
+  .byte  117,52                              // jne           2b62 <_sk_load_a8_hsw+0x3e>
   .byte  196,194,121,48,4,19                 // vpmovzxbw     (%r11,%rdx,1),%xmm0
-  .byte  197,249,219,5,212,52,0,0            // vpand         0x34d4(%rip),%xmm0,%xmm0        # 5fe0 <_sk_callback_hsw+0x990>
+  .byte  197,249,219,5,228,52,0,0            // vpand         0x34e4(%rip),%xmm0,%xmm0        # 6020 <_sk_callback_hsw+0x9a0>
   .byte  196,226,125,51,192                  // vpmovzxwd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,230,46,0,0        // vbroadcastss  0x2ee6(%rip),%ymm1        # 5a04 <_sk_callback_hsw+0x3b4>
+  .byte  196,226,125,24,13,238,46,0,0        // vbroadcastss  0x2eee(%rip),%ymm1        # 5a3c <_sk_callback_hsw+0x3bc>
   .byte  197,252,89,217                      // vmulps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -13829,15 +13898,15 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,190                             // ja            2b04 <_sk_load_a8_hsw+0x10>
+  .byte  119,190                             // ja            2b34 <_sk_load_a8_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,119,0,0,0                 // lea           0x77(%rip),%r10        # 2bc8 <_sk_load_a8_hsw+0xd4>
+  .byte  76,141,21,119,0,0,0                 // lea           0x77(%rip),%r10        # 2bf8 <_sk_load_a8_hsw+0xd4>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  235,159                             // jmp           2b04 <_sk_load_a8_hsw+0x10>
+  .byte  235,159                             // jmp           2b34 <_sk_load_a8_hsw+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,2                   // vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -13845,7 +13914,7 @@
   .byte  197,249,110,200                     // vmovd         %eax,%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,121,2,193,1                 // vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  233,119,255,255,255                 // jmpq          2b04 <_sk_load_a8_hsw+0x10>
+  .byte  233,119,255,255,255                 // jmpq          2b34 <_sk_load_a8_hsw+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,6                   // vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -13856,7 +13925,7 @@
   .byte  196,193,121,110,12,19               // vmovd         (%r11,%rdx,1),%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,113,2,192,12                // vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  .byte  233,60,255,255,255                  // jmpq          2b04 <_sk_load_a8_hsw+0x10>
+  .byte  233,60,255,255,255                  // jmpq          2b34 <_sk_load_a8_hsw+0x10>
   .byte  146                                 // xchg          %eax,%edx
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -13884,12 +13953,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,52                              // jne           2c22 <_sk_load_a8_dst_hsw+0x3e>
+  .byte  117,52                              // jne           2c52 <_sk_load_a8_dst_hsw+0x3e>
   .byte  196,194,121,48,36,19                // vpmovzxbw     (%r11,%rdx,1),%xmm4
-  .byte  197,217,219,37,244,51,0,0           // vpand         0x33f4(%rip),%xmm4,%xmm4        # 5ff0 <_sk_callback_hsw+0x9a0>
+  .byte  197,217,219,37,4,52,0,0             // vpand         0x3404(%rip),%xmm4,%xmm4        # 6030 <_sk_callback_hsw+0x9b0>
   .byte  196,226,125,51,228                  // vpmovzxwd     %xmm4,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,250,45,0,0        // vbroadcastss  0x2dfa(%rip),%ymm5        # 5a08 <_sk_callback_hsw+0x3b8>
+  .byte  196,226,125,24,45,2,46,0,0          // vbroadcastss  0x2e02(%rip),%ymm5        # 5a40 <_sk_callback_hsw+0x3c0>
   .byte  197,220,89,253                      // vmulps        %ymm5,%ymm4,%ymm7
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,220,87,228                      // vxorps        %ymm4,%ymm4,%ymm4
@@ -13901,15 +13970,15 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,190                             // ja            2bf4 <_sk_load_a8_dst_hsw+0x10>
+  .byte  119,190                             // ja            2c24 <_sk_load_a8_dst_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,119,0,0,0                 // lea           0x77(%rip),%r10        # 2cb8 <_sk_load_a8_dst_hsw+0xd4>
+  .byte  76,141,21,119,0,0,0                 // lea           0x77(%rip),%r10        # 2ce8 <_sk_load_a8_dst_hsw+0xd4>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  235,159                             // jmp           2bf4 <_sk_load_a8_dst_hsw+0x10>
+  .byte  235,159                             // jmp           2c24 <_sk_load_a8_dst_hsw+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,2                   // vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -13917,7 +13986,7 @@
   .byte  197,249,110,232                     // vmovd         %eax,%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,89,2,229,1                  // vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  233,119,255,255,255                 // jmpq          2bf4 <_sk_load_a8_dst_hsw+0x10>
+  .byte  233,119,255,255,255                 // jmpq          2c24 <_sk_load_a8_dst_hsw+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,6                   // vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -13928,7 +13997,7 @@
   .byte  196,193,121,110,44,19               // vmovd         (%r11,%rdx,1),%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,81,2,228,12                 // vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  .byte  233,60,255,255,255                  // jmpq          2bf4 <_sk_load_a8_dst_hsw+0x10>
+  .byte  233,60,255,255,255                  // jmpq          2c24 <_sk_load_a8_dst_hsw+0x10>
   .byte  146                                 // xchg          %eax,%edx
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -13989,7 +14058,7 @@
   .byte  196,227,121,32,192,7                // vpinsrb       $0x7,%eax,%xmm0,%xmm0
   .byte  196,226,125,49,192                  // vpmovzxbd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,130,44,0,0        // vbroadcastss  0x2c82(%rip),%ymm1        # 5a0c <_sk_callback_hsw+0x3bc>
+  .byte  196,226,125,24,13,138,44,0,0        // vbroadcastss  0x2c8a(%rip),%ymm1        # 5a44 <_sk_callback_hsw+0x3c4>
   .byte  197,252,89,217                      // vmulps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -14003,14 +14072,14 @@
 _sk_store_a8_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
-  .byte  196,98,125,24,5,100,44,0,0          // vbroadcastss  0x2c64(%rip),%ymm8        # 5a10 <_sk_callback_hsw+0x3c0>
+  .byte  196,98,125,24,5,108,44,0,0          // vbroadcastss  0x2c6c(%rip),%ymm8        # 5a48 <_sk_callback_hsw+0x3c8>
   .byte  196,65,100,89,192                   // vmulps        %ymm8,%ymm3,%ymm8
   .byte  196,65,125,91,192                   // vcvtps2dq     %ymm8,%ymm8
   .byte  196,67,125,25,193,1                 // vextractf128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  196,65,57,103,192                   // vpackuswb     %xmm8,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           2dd5 <_sk_store_a8_hsw+0x37>
+  .byte  117,10                              // jne           2e05 <_sk_store_a8_hsw+0x37>
   .byte  196,65,123,17,4,19                  // vmovsd        %xmm8,(%r11,%rdx,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -14018,25 +14087,25 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            2dd1 <_sk_store_a8_hsw+0x33>
+  .byte  119,236                             // ja            2e01 <_sk_store_a8_hsw+0x33>
   .byte  196,66,121,48,192                   // vpmovzxbw     %xmm8,%xmm8
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,87,0,0,0                  // lea           0x57(%rip),%r10        # 2e4c <_sk_store_a8_hsw+0xae>
+  .byte  76,141,21,87,0,0,0                  // lea           0x57(%rip),%r10        # 2e7c <_sk_store_a8_hsw+0xae>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,20,4,19,0                // vpextrb       $0x0,%xmm8,(%r11,%rdx,1)
-  .byte  235,202                             // jmp           2dd1 <_sk_store_a8_hsw+0x33>
+  .byte  235,202                             // jmp           2e01 <_sk_store_a8_hsw+0x33>
   .byte  196,67,121,20,68,19,2,4             // vpextrb       $0x4,%xmm8,0x2(%r11,%rdx,1)
-  .byte  196,98,57,0,5,232,49,0,0            // vpshufb       0x31e8(%rip),%xmm8,%xmm8        # 6000 <_sk_callback_hsw+0x9b0>
+  .byte  196,98,57,0,5,248,49,0,0            // vpshufb       0x31f8(%rip),%xmm8,%xmm8        # 6040 <_sk_callback_hsw+0x9c0>
   .byte  196,67,121,21,4,19,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,1)
-  .byte  235,176                             // jmp           2dd1 <_sk_store_a8_hsw+0x33>
+  .byte  235,176                             // jmp           2e01 <_sk_store_a8_hsw+0x33>
   .byte  196,67,121,20,68,19,6,12            // vpextrb       $0xc,%xmm8,0x6(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,5,10            // vpextrb       $0xa,%xmm8,0x5(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,4,8             // vpextrb       $0x8,%xmm8,0x4(%r11,%rdx,1)
-  .byte  196,98,57,0,5,206,49,0,0            // vpshufb       0x31ce(%rip),%xmm8,%xmm8        # 6010 <_sk_callback_hsw+0x9c0>
+  .byte  196,98,57,0,5,222,49,0,0            // vpshufb       0x31de(%rip),%xmm8,%xmm8        # 6050 <_sk_callback_hsw+0x9d0>
   .byte  196,65,121,126,4,19                 // vmovd         %xmm8,(%r11,%rdx,1)
-  .byte  235,135                             // jmp           2dd1 <_sk_store_a8_hsw+0x33>
+  .byte  235,135                             // jmp           2e01 <_sk_store_a8_hsw+0x33>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  178,255                             // mov           $0xff,%dl
   .byte  255                                 // (bad)
@@ -14065,15 +14134,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,57                              // jne           2eab <_sk_load_g8_hsw+0x43>
+  .byte  117,57                              // jne           2edb <_sk_load_g8_hsw+0x43>
   .byte  196,194,121,48,4,19                 // vpmovzxbw     (%r11,%rdx,1),%xmm0
-  .byte  197,249,219,5,160,49,0,0            // vpand         0x31a0(%rip),%xmm0,%xmm0        # 6020 <_sk_callback_hsw+0x9d0>
+  .byte  197,249,219,5,176,49,0,0            // vpand         0x31b0(%rip),%xmm0,%xmm0        # 6060 <_sk_callback_hsw+0x9e0>
   .byte  196,226,125,51,192                  // vpmovzxwd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,130,43,0,0        // vbroadcastss  0x2b82(%rip),%ymm1        # 5a14 <_sk_callback_hsw+0x3c4>
+  .byte  196,226,125,24,13,138,43,0,0        // vbroadcastss  0x2b8a(%rip),%ymm1        # 5a4c <_sk_callback_hsw+0x3cc>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,119,43,0,0        // vbroadcastss  0x2b77(%rip),%ymm3        # 5a18 <_sk_callback_hsw+0x3c8>
+  .byte  196,226,125,24,29,127,43,0,0        // vbroadcastss  0x2b7f(%rip),%ymm3        # 5a50 <_sk_callback_hsw+0x3d0>
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
   .byte  255,224                             // jmpq          *%rax
@@ -14082,15 +14151,15 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,185                             // ja            2e78 <_sk_load_g8_hsw+0x10>
+  .byte  119,185                             // ja            2ea8 <_sk_load_g8_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 2f44 <_sk_load_g8_hsw+0xdc>
+  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 2f74 <_sk_load_g8_hsw+0xdc>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  235,154                             // jmp           2e78 <_sk_load_g8_hsw+0x10>
+  .byte  235,154                             // jmp           2ea8 <_sk_load_g8_hsw+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,2                   // vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -14098,7 +14167,7 @@
   .byte  197,249,110,200                     // vmovd         %eax,%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,121,2,193,1                 // vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  233,114,255,255,255                 // jmpq          2e78 <_sk_load_g8_hsw+0x10>
+  .byte  233,114,255,255,255                 // jmpq          2ea8 <_sk_load_g8_hsw+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,6                   // vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -14109,7 +14178,7 @@
   .byte  196,193,121,110,12,19               // vmovd         (%r11,%rdx,1),%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,113,2,192,12                // vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  .byte  233,55,255,255,255                  // jmpq          2e78 <_sk_load_g8_hsw+0x10>
+  .byte  233,55,255,255,255                  // jmpq          2ea8 <_sk_load_g8_hsw+0x10>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  143                                 // (bad)
   .byte  255                                 // (bad)
@@ -14138,15 +14207,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,57                              // jne           2fa3 <_sk_load_g8_dst_hsw+0x43>
+  .byte  117,57                              // jne           2fd3 <_sk_load_g8_dst_hsw+0x43>
   .byte  196,194,121,48,36,19                // vpmovzxbw     (%r11,%rdx,1),%xmm4
-  .byte  197,217,219,37,184,48,0,0           // vpand         0x30b8(%rip),%xmm4,%xmm4        # 6030 <_sk_callback_hsw+0x9e0>
+  .byte  197,217,219,37,200,48,0,0           // vpand         0x30c8(%rip),%xmm4,%xmm4        # 6070 <_sk_callback_hsw+0x9f0>
   .byte  196,226,125,51,228                  // vpmovzxwd     %xmm4,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,146,42,0,0        // vbroadcastss  0x2a92(%rip),%ymm5        # 5a1c <_sk_callback_hsw+0x3cc>
+  .byte  196,226,125,24,45,154,42,0,0        // vbroadcastss  0x2a9a(%rip),%ymm5        # 5a54 <_sk_callback_hsw+0x3d4>
   .byte  197,220,89,229                      // vmulps        %ymm5,%ymm4,%ymm4
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,61,135,42,0,0        // vbroadcastss  0x2a87(%rip),%ymm7        # 5a20 <_sk_callback_hsw+0x3d0>
+  .byte  196,226,125,24,61,143,42,0,0        // vbroadcastss  0x2a8f(%rip),%ymm7        # 5a58 <_sk_callback_hsw+0x3d8>
   .byte  197,252,40,236                      // vmovaps       %ymm4,%ymm5
   .byte  197,252,40,244                      // vmovaps       %ymm4,%ymm6
   .byte  255,224                             // jmpq          *%rax
@@ -14155,15 +14224,15 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,185                             // ja            2f70 <_sk_load_g8_dst_hsw+0x10>
+  .byte  119,185                             // ja            2fa0 <_sk_load_g8_dst_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 303c <_sk_load_g8_dst_hsw+0xdc>
+  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 306c <_sk_load_g8_dst_hsw+0xdc>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  235,154                             // jmp           2f70 <_sk_load_g8_dst_hsw+0x10>
+  .byte  235,154                             // jmp           2fa0 <_sk_load_g8_dst_hsw+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,2                   // vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -14171,7 +14240,7 @@
   .byte  197,249,110,232                     // vmovd         %eax,%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,89,2,229,1                  // vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  233,114,255,255,255                 // jmpq          2f70 <_sk_load_g8_dst_hsw+0x10>
+  .byte  233,114,255,255,255                 // jmpq          2fa0 <_sk_load_g8_dst_hsw+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,6                   // vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -14182,7 +14251,7 @@
   .byte  196,193,121,110,44,19               // vmovd         (%r11,%rdx,1),%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,81,2,228,12                 // vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  .byte  233,55,255,255,255                  // jmpq          2f70 <_sk_load_g8_dst_hsw+0x10>
+  .byte  233,55,255,255,255                  // jmpq          2fa0 <_sk_load_g8_dst_hsw+0x10>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  143                                 // (bad)
   .byte  255                                 // (bad)
@@ -14244,10 +14313,10 @@
   .byte  196,227,121,32,192,7                // vpinsrb       $0x7,%eax,%xmm0,%xmm0
   .byte  196,226,125,49,192                  // vpmovzxbd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,22,41,0,0         // vbroadcastss  0x2916(%rip),%ymm1        # 5a24 <_sk_callback_hsw+0x3d4>
+  .byte  196,226,125,24,13,30,41,0,0         // vbroadcastss  0x291e(%rip),%ymm1        # 5a5c <_sk_callback_hsw+0x3dc>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,11,41,0,0         // vbroadcastss  0x290b(%rip),%ymm3        # 5a28 <_sk_callback_hsw+0x3d8>
+  .byte  196,226,125,24,29,19,41,0,0         // vbroadcastss  0x2913(%rip),%ymm3        # 5a60 <_sk_callback_hsw+0x3e0>
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
   .byte  255,224                             // jmpq          *%rax
@@ -14259,9 +14328,9 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,137,193                          // mov           %rax,%r9
   .byte  77,133,201                          // test          %r9,%r9
-  .byte  116,5                               // je            3136 <_sk_gather_i8_hsw+0xf>
+  .byte  116,5                               // je            3166 <_sk_gather_i8_hsw+0xf>
   .byte  76,137,200                          // mov           %r9,%rax
-  .byte  235,2                               // jmp           3138 <_sk_gather_i8_hsw+0x11>
+  .byte  235,2                               // jmp           3168 <_sk_gather_i8_hsw+0x11>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  83                                  // push          %rbx
   .byte  76,139,16                           // mov           (%rax),%r10
@@ -14295,14 +14364,14 @@
   .byte  73,139,65,8                         // mov           0x8(%r9),%rax
   .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
   .byte  196,226,117,144,28,128              // vpgatherdd    %ymm1,(%rax,%ymm0,4),%ymm3
-  .byte  197,229,219,5,35,43,0,0             // vpand         0x2b23(%rip),%ymm3,%ymm0        # 5d00 <_sk_callback_hsw+0x6b0>
+  .byte  197,229,219,5,51,43,0,0             // vpand         0x2b33(%rip),%ymm3,%ymm0        # 5d40 <_sk_callback_hsw+0x6c0>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,66,40,0,0           // vbroadcastss  0x2842(%rip),%ymm8        # 5a2c <_sk_callback_hsw+0x3dc>
+  .byte  196,98,125,24,5,74,40,0,0           // vbroadcastss  0x284a(%rip),%ymm8        # 5a64 <_sk_callback_hsw+0x3e4>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,226,101,0,13,40,43,0,0          // vpshufb       0x2b28(%rip),%ymm3,%ymm1        # 5d20 <_sk_callback_hsw+0x6d0>
+  .byte  196,226,101,0,13,56,43,0,0          // vpshufb       0x2b38(%rip),%ymm3,%ymm1        # 5d60 <_sk_callback_hsw+0x6e0>
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
-  .byte  196,226,101,0,21,54,43,0,0          // vpshufb       0x2b36(%rip),%ymm3,%ymm2        # 5d40 <_sk_callback_hsw+0x6f0>
+  .byte  196,226,101,0,21,70,43,0,0          // vpshufb       0x2b46(%rip),%ymm3,%ymm2        # 5d80 <_sk_callback_hsw+0x700>
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
@@ -14319,53 +14388,53 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,114                             // jne           32a2 <_sk_load_565_hsw+0x7c>
+  .byte  117,114                             // jne           32d2 <_sk_load_565_hsw+0x7c>
   .byte  196,193,122,111,4,83                // vmovdqu       (%r11,%rdx,2),%xmm0
   .byte  196,226,125,51,208                  // vpmovzxwd     %xmm0,%ymm2
-  .byte  196,226,125,88,5,236,39,0,0         // vpbroadcastd  0x27ec(%rip),%ymm0        # 5a30 <_sk_callback_hsw+0x3e0>
+  .byte  196,226,125,88,5,244,39,0,0         // vpbroadcastd  0x27f4(%rip),%ymm0        # 5a68 <_sk_callback_hsw+0x3e8>
   .byte  197,237,219,192                     // vpand         %ymm0,%ymm2,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,223,39,0,0        // vbroadcastss  0x27df(%rip),%ymm1        # 5a34 <_sk_callback_hsw+0x3e4>
+  .byte  196,226,125,24,13,231,39,0,0        // vbroadcastss  0x27e7(%rip),%ymm1        # 5a6c <_sk_callback_hsw+0x3ec>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,88,13,214,39,0,0        // vpbroadcastd  0x27d6(%rip),%ymm1        # 5a38 <_sk_callback_hsw+0x3e8>
+  .byte  196,226,125,88,13,222,39,0,0        // vpbroadcastd  0x27de(%rip),%ymm1        # 5a70 <_sk_callback_hsw+0x3f0>
   .byte  197,237,219,201                     // vpand         %ymm1,%ymm2,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,29,201,39,0,0        // vbroadcastss  0x27c9(%rip),%ymm3        # 5a3c <_sk_callback_hsw+0x3ec>
+  .byte  196,226,125,24,29,209,39,0,0        // vbroadcastss  0x27d1(%rip),%ymm3        # 5a74 <_sk_callback_hsw+0x3f4>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
-  .byte  196,226,125,88,29,192,39,0,0        // vpbroadcastd  0x27c0(%rip),%ymm3        # 5a40 <_sk_callback_hsw+0x3f0>
+  .byte  196,226,125,88,29,200,39,0,0        // vpbroadcastd  0x27c8(%rip),%ymm3        # 5a78 <_sk_callback_hsw+0x3f8>
   .byte  197,237,219,211                     // vpand         %ymm3,%ymm2,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,226,125,24,29,179,39,0,0        // vbroadcastss  0x27b3(%rip),%ymm3        # 5a44 <_sk_callback_hsw+0x3f4>
+  .byte  196,226,125,24,29,187,39,0,0        // vbroadcastss  0x27bb(%rip),%ymm3        # 5a7c <_sk_callback_hsw+0x3fc>
   .byte  197,236,89,211                      // vmulps        %ymm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,168,39,0,0        // vbroadcastss  0x27a8(%rip),%ymm3        # 5a48 <_sk_callback_hsw+0x3f8>
+  .byte  196,226,125,24,29,176,39,0,0        // vbroadcastss  0x27b0(%rip),%ymm3        # 5a80 <_sk_callback_hsw+0x400>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,128                             // ja            3236 <_sk_load_565_hsw+0x10>
+  .byte  119,128                             // ja            3266 <_sk_load_565_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 3324 <_sk_load_565_hsw+0xfe>
+  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 3354 <_sk_load_565_hsw+0xfe>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  233,94,255,255,255                  // jmpq          3236 <_sk_load_565_hsw+0x10>
+  .byte  233,94,255,255,255                  // jmpq          3266 <_sk_load_565_hsw+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,110,12,83               // vmovd         (%r11,%rdx,2),%xmm1
   .byte  196,227,121,2,193,1                 // vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  233,65,255,255,255                  // jmpq          3236 <_sk_load_565_hsw+0x10>
+  .byte  233,65,255,255,255                  // jmpq          3266 <_sk_load_565_hsw+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,122,126,12,83               // vmovq         (%r11,%rdx,2),%xmm1
   .byte  196,227,113,2,192,12                // vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  .byte  233,20,255,255,255                  // jmpq          3236 <_sk_load_565_hsw+0x10>
+  .byte  233,20,255,255,255                  // jmpq          3266 <_sk_load_565_hsw+0x10>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  166                                 // cmpsb         %es:(%rdi),%ds:(%rsi)
   .byte  255                                 // (bad)
@@ -14393,53 +14462,53 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,114                             // jne           33bc <_sk_load_565_dst_hsw+0x7c>
+  .byte  117,114                             // jne           33ec <_sk_load_565_dst_hsw+0x7c>
   .byte  196,193,122,111,36,83               // vmovdqu       (%r11,%rdx,2),%xmm4
   .byte  196,226,125,51,244                  // vpmovzxwd     %xmm4,%ymm6
-  .byte  196,226,125,88,37,238,38,0,0        // vpbroadcastd  0x26ee(%rip),%ymm4        # 5a4c <_sk_callback_hsw+0x3fc>
+  .byte  196,226,125,88,37,246,38,0,0        // vpbroadcastd  0x26f6(%rip),%ymm4        # 5a84 <_sk_callback_hsw+0x404>
   .byte  197,205,219,228                     // vpand         %ymm4,%ymm6,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,225,38,0,0        // vbroadcastss  0x26e1(%rip),%ymm5        # 5a50 <_sk_callback_hsw+0x400>
+  .byte  196,226,125,24,45,233,38,0,0        // vbroadcastss  0x26e9(%rip),%ymm5        # 5a88 <_sk_callback_hsw+0x408>
   .byte  197,220,89,229                      // vmulps        %ymm5,%ymm4,%ymm4
-  .byte  196,226,125,88,45,216,38,0,0        // vpbroadcastd  0x26d8(%rip),%ymm5        # 5a54 <_sk_callback_hsw+0x404>
+  .byte  196,226,125,88,45,224,38,0,0        // vpbroadcastd  0x26e0(%rip),%ymm5        # 5a8c <_sk_callback_hsw+0x40c>
   .byte  197,205,219,237                     // vpand         %ymm5,%ymm6,%ymm5
   .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
-  .byte  196,226,125,24,61,203,38,0,0        // vbroadcastss  0x26cb(%rip),%ymm7        # 5a58 <_sk_callback_hsw+0x408>
+  .byte  196,226,125,24,61,211,38,0,0        // vbroadcastss  0x26d3(%rip),%ymm7        # 5a90 <_sk_callback_hsw+0x410>
   .byte  197,212,89,239                      // vmulps        %ymm7,%ymm5,%ymm5
-  .byte  196,226,125,88,61,194,38,0,0        // vpbroadcastd  0x26c2(%rip),%ymm7        # 5a5c <_sk_callback_hsw+0x40c>
+  .byte  196,226,125,88,61,202,38,0,0        // vpbroadcastd  0x26ca(%rip),%ymm7        # 5a94 <_sk_callback_hsw+0x414>
   .byte  197,205,219,247                     // vpand         %ymm7,%ymm6,%ymm6
   .byte  197,252,91,246                      // vcvtdq2ps     %ymm6,%ymm6
-  .byte  196,226,125,24,61,181,38,0,0        // vbroadcastss  0x26b5(%rip),%ymm7        # 5a60 <_sk_callback_hsw+0x410>
+  .byte  196,226,125,24,61,189,38,0,0        // vbroadcastss  0x26bd(%rip),%ymm7        # 5a98 <_sk_callback_hsw+0x418>
   .byte  197,204,89,247                      // vmulps        %ymm7,%ymm6,%ymm6
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,61,170,38,0,0        // vbroadcastss  0x26aa(%rip),%ymm7        # 5a64 <_sk_callback_hsw+0x414>
+  .byte  196,226,125,24,61,178,38,0,0        // vbroadcastss  0x26b2(%rip),%ymm7        # 5a9c <_sk_callback_hsw+0x41c>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,128                             // ja            3350 <_sk_load_565_dst_hsw+0x10>
+  .byte  119,128                             // ja            3380 <_sk_load_565_dst_hsw+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,97,0,0,0                  // lea           0x61(%rip),%r10        # 343c <_sk_load_565_dst_hsw+0xfc>
+  .byte  76,141,21,97,0,0,0                  // lea           0x61(%rip),%r10        # 346c <_sk_load_565_dst_hsw+0xfc>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  233,94,255,255,255                  // jmpq          3350 <_sk_load_565_dst_hsw+0x10>
+  .byte  233,94,255,255,255                  // jmpq          3380 <_sk_load_565_dst_hsw+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,121,110,44,83               // vmovd         (%r11,%rdx,2),%xmm5
   .byte  196,227,89,2,229,1                  // vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  233,65,255,255,255                  // jmpq          3350 <_sk_load_565_dst_hsw+0x10>
+  .byte  233,65,255,255,255                  // jmpq          3380 <_sk_load_565_dst_hsw+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,122,126,44,83               // vmovq         (%r11,%rdx,2),%xmm5
   .byte  196,227,81,2,228,12                 // vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  .byte  233,20,255,255,255                  // jmpq          3350 <_sk_load_565_dst_hsw+0x10>
+  .byte  233,20,255,255,255                  // jmpq          3380 <_sk_load_565_dst_hsw+0x10>
   .byte  168,255                             // test          $0xff,%al
   .byte  255                                 // (bad)
   .byte  255,194                             // inc           %edx
@@ -14500,23 +14569,23 @@
   .byte  67,15,183,4,89                      // movzwl        (%r9,%r11,2),%eax
   .byte  197,249,196,192,7                   // vpinsrw       $0x7,%eax,%xmm0,%xmm0
   .byte  196,226,125,51,208                  // vpmovzxwd     %xmm0,%ymm2
-  .byte  196,226,125,88,5,95,37,0,0          // vpbroadcastd  0x255f(%rip),%ymm0        # 5a68 <_sk_callback_hsw+0x418>
+  .byte  196,226,125,88,5,103,37,0,0         // vpbroadcastd  0x2567(%rip),%ymm0        # 5aa0 <_sk_callback_hsw+0x420>
   .byte  197,237,219,192                     // vpand         %ymm0,%ymm2,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,82,37,0,0         // vbroadcastss  0x2552(%rip),%ymm1        # 5a6c <_sk_callback_hsw+0x41c>
+  .byte  196,226,125,24,13,90,37,0,0         // vbroadcastss  0x255a(%rip),%ymm1        # 5aa4 <_sk_callback_hsw+0x424>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,88,13,73,37,0,0         // vpbroadcastd  0x2549(%rip),%ymm1        # 5a70 <_sk_callback_hsw+0x420>
+  .byte  196,226,125,88,13,81,37,0,0         // vpbroadcastd  0x2551(%rip),%ymm1        # 5aa8 <_sk_callback_hsw+0x428>
   .byte  197,237,219,201                     // vpand         %ymm1,%ymm2,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,29,60,37,0,0         // vbroadcastss  0x253c(%rip),%ymm3        # 5a74 <_sk_callback_hsw+0x424>
+  .byte  196,226,125,24,29,68,37,0,0         // vbroadcastss  0x2544(%rip),%ymm3        # 5aac <_sk_callback_hsw+0x42c>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
-  .byte  196,226,125,88,29,51,37,0,0         // vpbroadcastd  0x2533(%rip),%ymm3        # 5a78 <_sk_callback_hsw+0x428>
+  .byte  196,226,125,88,29,59,37,0,0         // vpbroadcastd  0x253b(%rip),%ymm3        # 5ab0 <_sk_callback_hsw+0x430>
   .byte  197,237,219,211                     // vpand         %ymm3,%ymm2,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,226,125,24,29,38,37,0,0         // vbroadcastss  0x2526(%rip),%ymm3        # 5a7c <_sk_callback_hsw+0x42c>
+  .byte  196,226,125,24,29,46,37,0,0         // vbroadcastss  0x252e(%rip),%ymm3        # 5ab4 <_sk_callback_hsw+0x434>
   .byte  197,236,89,211                      // vmulps        %ymm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,27,37,0,0         // vbroadcastss  0x251b(%rip),%ymm3        # 5a80 <_sk_callback_hsw+0x430>
+  .byte  196,226,125,24,29,35,37,0,0         // vbroadcastss  0x2523(%rip),%ymm3        # 5ab8 <_sk_callback_hsw+0x438>
   .byte  255,224                             // jmpq          *%rax
 
 HIDDEN _sk_store_565_hsw
@@ -14525,11 +14594,11 @@
 _sk_store_565_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
-  .byte  196,98,125,24,5,15,37,0,0           // vbroadcastss  0x250f(%rip),%ymm8        # 5a84 <_sk_callback_hsw+0x434>
+  .byte  196,98,125,24,5,23,37,0,0           // vbroadcastss  0x2517(%rip),%ymm8        # 5abc <_sk_callback_hsw+0x43c>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,193,53,114,241,11               // vpslld        $0xb,%ymm9,%ymm9
-  .byte  196,98,125,24,21,250,36,0,0         // vbroadcastss  0x24fa(%rip),%ymm10        # 5a88 <_sk_callback_hsw+0x438>
+  .byte  196,98,125,24,21,2,37,0,0           // vbroadcastss  0x2502(%rip),%ymm10        # 5ac0 <_sk_callback_hsw+0x440>
   .byte  196,65,116,89,210                   // vmulps        %ymm10,%ymm1,%ymm10
   .byte  196,65,125,91,210                   // vcvtps2dq     %ymm10,%ymm10
   .byte  196,193,45,114,242,5                // vpslld        $0x5,%ymm10,%ymm10
@@ -14540,7 +14609,7 @@
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           35cc <_sk_store_565_hsw+0x65>
+  .byte  117,10                              // jne           35fc <_sk_store_565_hsw+0x65>
   .byte  196,65,122,127,4,83                 // vmovdqu       %xmm8,(%r11,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -14548,22 +14617,22 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            35c8 <_sk_store_565_hsw+0x61>
+  .byte  119,236                             // ja            35f8 <_sk_store_565_hsw+0x61>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,69,0,0,0                  // lea           0x45(%rip),%r10        # 362c <_sk_store_565_hsw+0xc5>
+  .byte  76,141,21,69,0,0,0                  // lea           0x45(%rip),%r10        # 365c <_sk_store_565_hsw+0xc5>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,21,4,83,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  .byte  235,207                             // jmp           35c8 <_sk_store_565_hsw+0x61>
+  .byte  235,207                             // jmp           35f8 <_sk_store_565_hsw+0x61>
   .byte  196,67,121,21,68,83,4,2             // vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   .byte  196,65,121,126,4,83                 // vmovd         %xmm8,(%r11,%rdx,2)
-  .byte  235,191                             // jmp           35c8 <_sk_store_565_hsw+0x61>
+  .byte  235,191                             // jmp           35f8 <_sk_store_565_hsw+0x61>
   .byte  196,67,121,21,68,83,12,6            // vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,10,5            // vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,8,4             // vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   .byte  196,65,121,214,4,83                 // vmovq         %xmm8,(%r11,%rdx,2)
-  .byte  235,159                             // jmp           35c8 <_sk_store_565_hsw+0x61>
+  .byte  235,159                             // jmp           35f8 <_sk_store_565_hsw+0x61>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  196                                 // (bad)
   .byte  255                                 // (bad)
@@ -14596,28 +14665,28 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,138,0,0,0                    // jne           36e0 <_sk_load_4444_hsw+0x98>
+  .byte  15,133,138,0,0,0                    // jne           3710 <_sk_load_4444_hsw+0x98>
   .byte  196,193,122,111,4,83                // vmovdqu       (%r11,%rdx,2),%xmm0
   .byte  196,226,125,51,216                  // vpmovzxwd     %xmm0,%ymm3
-  .byte  196,226,125,88,5,34,36,0,0          // vpbroadcastd  0x2422(%rip),%ymm0        # 5a8c <_sk_callback_hsw+0x43c>
+  .byte  196,226,125,88,5,42,36,0,0          // vpbroadcastd  0x242a(%rip),%ymm0        # 5ac4 <_sk_callback_hsw+0x444>
   .byte  197,229,219,192                     // vpand         %ymm0,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,21,36,0,0         // vbroadcastss  0x2415(%rip),%ymm1        # 5a90 <_sk_callback_hsw+0x440>
+  .byte  196,226,125,24,13,29,36,0,0         // vbroadcastss  0x241d(%rip),%ymm1        # 5ac8 <_sk_callback_hsw+0x448>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,88,13,12,36,0,0         // vpbroadcastd  0x240c(%rip),%ymm1        # 5a94 <_sk_callback_hsw+0x444>
+  .byte  196,226,125,88,13,20,36,0,0         // vpbroadcastd  0x2414(%rip),%ymm1        # 5acc <_sk_callback_hsw+0x44c>
   .byte  197,229,219,201                     // vpand         %ymm1,%ymm3,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,21,255,35,0,0        // vbroadcastss  0x23ff(%rip),%ymm2        # 5a98 <_sk_callback_hsw+0x448>
+  .byte  196,226,125,24,21,7,36,0,0          // vbroadcastss  0x2407(%rip),%ymm2        # 5ad0 <_sk_callback_hsw+0x450>
   .byte  197,244,89,202                      // vmulps        %ymm2,%ymm1,%ymm1
-  .byte  196,226,125,88,21,246,35,0,0        // vpbroadcastd  0x23f6(%rip),%ymm2        # 5a9c <_sk_callback_hsw+0x44c>
+  .byte  196,226,125,88,21,254,35,0,0        // vpbroadcastd  0x23fe(%rip),%ymm2        # 5ad4 <_sk_callback_hsw+0x454>
   .byte  197,229,219,210                     // vpand         %ymm2,%ymm3,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,98,125,24,5,233,35,0,0          // vbroadcastss  0x23e9(%rip),%ymm8        # 5aa0 <_sk_callback_hsw+0x450>
+  .byte  196,98,125,24,5,241,35,0,0          // vbroadcastss  0x23f1(%rip),%ymm8        # 5ad8 <_sk_callback_hsw+0x458>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,88,5,223,35,0,0          // vpbroadcastd  0x23df(%rip),%ymm8        # 5aa4 <_sk_callback_hsw+0x454>
+  .byte  196,98,125,88,5,231,35,0,0          // vpbroadcastd  0x23e7(%rip),%ymm8        # 5adc <_sk_callback_hsw+0x45c>
   .byte  196,193,101,219,216                 // vpand         %ymm8,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,209,35,0,0          // vbroadcastss  0x23d1(%rip),%ymm8        # 5aa8 <_sk_callback_hsw+0x458>
+  .byte  196,98,125,24,5,217,35,0,0          // vbroadcastss  0x23d9(%rip),%ymm8        # 5ae0 <_sk_callback_hsw+0x460>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -14626,27 +14695,27 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,100,255,255,255              // ja            365c <_sk_load_4444_hsw+0x14>
+  .byte  15,135,100,255,255,255              // ja            368c <_sk_load_4444_hsw+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,97,0,0,0                  // lea           0x61(%rip),%r10        # 3764 <_sk_load_4444_hsw+0x11c>
+  .byte  76,141,21,97,0,0,0                  // lea           0x61(%rip),%r10        # 3794 <_sk_load_4444_hsw+0x11c>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  233,66,255,255,255                  // jmpq          365c <_sk_load_4444_hsw+0x14>
+  .byte  233,66,255,255,255                  // jmpq          368c <_sk_load_4444_hsw+0x14>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,110,12,83               // vmovd         (%r11,%rdx,2),%xmm1
   .byte  196,227,121,2,193,1                 // vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  233,37,255,255,255                  // jmpq          365c <_sk_load_4444_hsw+0x14>
+  .byte  233,37,255,255,255                  // jmpq          368c <_sk_load_4444_hsw+0x14>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,122,126,12,83               // vmovq         (%r11,%rdx,2),%xmm1
   .byte  196,227,113,2,192,12                // vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  .byte  233,248,254,255,255                 // jmpq          365c <_sk_load_4444_hsw+0x14>
+  .byte  233,248,254,255,255                 // jmpq          368c <_sk_load_4444_hsw+0x14>
   .byte  168,255                             // test          $0xff,%al
   .byte  255                                 // (bad)
   .byte  255,194                             // inc           %edx
@@ -14673,28 +14742,28 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,138,0,0,0                    // jne           3818 <_sk_load_4444_dst_hsw+0x98>
+  .byte  15,133,138,0,0,0                    // jne           3848 <_sk_load_4444_dst_hsw+0x98>
   .byte  196,193,122,111,36,83               // vmovdqu       (%r11,%rdx,2),%xmm4
   .byte  196,226,125,51,252                  // vpmovzxwd     %xmm4,%ymm7
-  .byte  196,226,125,88,37,10,35,0,0         // vpbroadcastd  0x230a(%rip),%ymm4        # 5aac <_sk_callback_hsw+0x45c>
+  .byte  196,226,125,88,37,18,35,0,0         // vpbroadcastd  0x2312(%rip),%ymm4        # 5ae4 <_sk_callback_hsw+0x464>
   .byte  197,197,219,228                     // vpand         %ymm4,%ymm7,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,253,34,0,0        // vbroadcastss  0x22fd(%rip),%ymm5        # 5ab0 <_sk_callback_hsw+0x460>
+  .byte  196,226,125,24,45,5,35,0,0          // vbroadcastss  0x2305(%rip),%ymm5        # 5ae8 <_sk_callback_hsw+0x468>
   .byte  197,220,89,229                      // vmulps        %ymm5,%ymm4,%ymm4
-  .byte  196,226,125,88,45,244,34,0,0        // vpbroadcastd  0x22f4(%rip),%ymm5        # 5ab4 <_sk_callback_hsw+0x464>
+  .byte  196,226,125,88,45,252,34,0,0        // vpbroadcastd  0x22fc(%rip),%ymm5        # 5aec <_sk_callback_hsw+0x46c>
   .byte  197,197,219,237                     // vpand         %ymm5,%ymm7,%ymm5
   .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
-  .byte  196,226,125,24,53,231,34,0,0        // vbroadcastss  0x22e7(%rip),%ymm6        # 5ab8 <_sk_callback_hsw+0x468>
+  .byte  196,226,125,24,53,239,34,0,0        // vbroadcastss  0x22ef(%rip),%ymm6        # 5af0 <_sk_callback_hsw+0x470>
   .byte  197,212,89,238                      // vmulps        %ymm6,%ymm5,%ymm5
-  .byte  196,226,125,88,53,222,34,0,0        // vpbroadcastd  0x22de(%rip),%ymm6        # 5abc <_sk_callback_hsw+0x46c>
+  .byte  196,226,125,88,53,230,34,0,0        // vpbroadcastd  0x22e6(%rip),%ymm6        # 5af4 <_sk_callback_hsw+0x474>
   .byte  197,197,219,246                     // vpand         %ymm6,%ymm7,%ymm6
   .byte  197,252,91,246                      // vcvtdq2ps     %ymm6,%ymm6
-  .byte  196,98,125,24,5,209,34,0,0          // vbroadcastss  0x22d1(%rip),%ymm8        # 5ac0 <_sk_callback_hsw+0x470>
+  .byte  196,98,125,24,5,217,34,0,0          // vbroadcastss  0x22d9(%rip),%ymm8        # 5af8 <_sk_callback_hsw+0x478>
   .byte  196,193,76,89,240                   // vmulps        %ymm8,%ymm6,%ymm6
-  .byte  196,98,125,88,5,199,34,0,0          // vpbroadcastd  0x22c7(%rip),%ymm8        # 5ac4 <_sk_callback_hsw+0x474>
+  .byte  196,98,125,88,5,207,34,0,0          // vpbroadcastd  0x22cf(%rip),%ymm8        # 5afc <_sk_callback_hsw+0x47c>
   .byte  196,193,69,219,248                  // vpand         %ymm8,%ymm7,%ymm7
   .byte  197,252,91,255                      // vcvtdq2ps     %ymm7,%ymm7
-  .byte  196,98,125,24,5,185,34,0,0          // vbroadcastss  0x22b9(%rip),%ymm8        # 5ac8 <_sk_callback_hsw+0x478>
+  .byte  196,98,125,24,5,193,34,0,0          // vbroadcastss  0x22c1(%rip),%ymm8        # 5b00 <_sk_callback_hsw+0x480>
   .byte  196,193,68,89,248                   // vmulps        %ymm8,%ymm7,%ymm7
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -14703,27 +14772,27 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,100,255,255,255              // ja            3794 <_sk_load_4444_dst_hsw+0x14>
+  .byte  15,135,100,255,255,255              // ja            37c4 <_sk_load_4444_dst_hsw+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,97,0,0,0                  // lea           0x61(%rip),%r10        # 389c <_sk_load_4444_dst_hsw+0x11c>
+  .byte  76,141,21,97,0,0,0                  // lea           0x61(%rip),%r10        # 38cc <_sk_load_4444_dst_hsw+0x11c>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  233,66,255,255,255                  // jmpq          3794 <_sk_load_4444_dst_hsw+0x14>
+  .byte  233,66,255,255,255                  // jmpq          37c4 <_sk_load_4444_dst_hsw+0x14>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,121,110,44,83               // vmovd         (%r11,%rdx,2),%xmm5
   .byte  196,227,89,2,229,1                  // vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  233,37,255,255,255                  // jmpq          3794 <_sk_load_4444_dst_hsw+0x14>
+  .byte  233,37,255,255,255                  // jmpq          37c4 <_sk_load_4444_dst_hsw+0x14>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,122,126,44,83               // vmovq         (%r11,%rdx,2),%xmm5
   .byte  196,227,81,2,228,12                 // vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  .byte  233,248,254,255,255                 // jmpq          3794 <_sk_load_4444_dst_hsw+0x14>
+  .byte  233,248,254,255,255                 // jmpq          37c4 <_sk_load_4444_dst_hsw+0x14>
   .byte  168,255                             // test          $0xff,%al
   .byte  255                                 // (bad)
   .byte  255,194                             // inc           %edx
@@ -14784,25 +14853,25 @@
   .byte  67,15,183,4,89                      // movzwl        (%r9,%r11,2),%eax
   .byte  197,249,196,192,7                   // vpinsrw       $0x7,%eax,%xmm0,%xmm0
   .byte  196,226,125,51,216                  // vpmovzxwd     %xmm0,%ymm3
-  .byte  196,226,125,88,5,99,33,0,0          // vpbroadcastd  0x2163(%rip),%ymm0        # 5acc <_sk_callback_hsw+0x47c>
+  .byte  196,226,125,88,5,107,33,0,0         // vpbroadcastd  0x216b(%rip),%ymm0        # 5b04 <_sk_callback_hsw+0x484>
   .byte  197,229,219,192                     // vpand         %ymm0,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,86,33,0,0         // vbroadcastss  0x2156(%rip),%ymm1        # 5ad0 <_sk_callback_hsw+0x480>
+  .byte  196,226,125,24,13,94,33,0,0         // vbroadcastss  0x215e(%rip),%ymm1        # 5b08 <_sk_callback_hsw+0x488>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,88,13,77,33,0,0         // vpbroadcastd  0x214d(%rip),%ymm1        # 5ad4 <_sk_callback_hsw+0x484>
+  .byte  196,226,125,88,13,85,33,0,0         // vpbroadcastd  0x2155(%rip),%ymm1        # 5b0c <_sk_callback_hsw+0x48c>
   .byte  197,229,219,201                     // vpand         %ymm1,%ymm3,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,21,64,33,0,0         // vbroadcastss  0x2140(%rip),%ymm2        # 5ad8 <_sk_callback_hsw+0x488>
+  .byte  196,226,125,24,21,72,33,0,0         // vbroadcastss  0x2148(%rip),%ymm2        # 5b10 <_sk_callback_hsw+0x490>
   .byte  197,244,89,202                      // vmulps        %ymm2,%ymm1,%ymm1
-  .byte  196,226,125,88,21,55,33,0,0         // vpbroadcastd  0x2137(%rip),%ymm2        # 5adc <_sk_callback_hsw+0x48c>
+  .byte  196,226,125,88,21,63,33,0,0         // vpbroadcastd  0x213f(%rip),%ymm2        # 5b14 <_sk_callback_hsw+0x494>
   .byte  197,229,219,210                     // vpand         %ymm2,%ymm3,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,98,125,24,5,42,33,0,0           // vbroadcastss  0x212a(%rip),%ymm8        # 5ae0 <_sk_callback_hsw+0x490>
+  .byte  196,98,125,24,5,50,33,0,0           // vbroadcastss  0x2132(%rip),%ymm8        # 5b18 <_sk_callback_hsw+0x498>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,88,5,32,33,0,0           // vpbroadcastd  0x2120(%rip),%ymm8        # 5ae4 <_sk_callback_hsw+0x494>
+  .byte  196,98,125,88,5,40,33,0,0           // vpbroadcastd  0x2128(%rip),%ymm8        # 5b1c <_sk_callback_hsw+0x49c>
   .byte  196,193,101,219,216                 // vpand         %ymm8,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,18,33,0,0           // vbroadcastss  0x2112(%rip),%ymm8        # 5ae8 <_sk_callback_hsw+0x498>
+  .byte  196,98,125,24,5,26,33,0,0           // vbroadcastss  0x211a(%rip),%ymm8        # 5b20 <_sk_callback_hsw+0x4a0>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -14813,7 +14882,7 @@
 _sk_store_4444_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
-  .byte  196,98,125,24,5,255,32,0,0          // vbroadcastss  0x20ff(%rip),%ymm8        # 5aec <_sk_callback_hsw+0x49c>
+  .byte  196,98,125,24,5,7,33,0,0            // vbroadcastss  0x2107(%rip),%ymm8        # 5b24 <_sk_callback_hsw+0x4a4>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,193,53,114,241,12               // vpslld        $0xc,%ymm9,%ymm9
@@ -14831,7 +14900,7 @@
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           3a50 <_sk_store_4444_hsw+0x71>
+  .byte  117,10                              // jne           3a80 <_sk_store_4444_hsw+0x71>
   .byte  196,65,122,127,4,83                 // vmovdqu       %xmm8,(%r11,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -14839,22 +14908,22 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            3a4c <_sk_store_4444_hsw+0x6d>
+  .byte  119,236                             // ja            3a7c <_sk_store_4444_hsw+0x6d>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,69,0,0,0                  // lea           0x45(%rip),%r10        # 3ab0 <_sk_store_4444_hsw+0xd1>
+  .byte  76,141,21,69,0,0,0                  // lea           0x45(%rip),%r10        # 3ae0 <_sk_store_4444_hsw+0xd1>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,21,4,83,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  .byte  235,207                             // jmp           3a4c <_sk_store_4444_hsw+0x6d>
+  .byte  235,207                             // jmp           3a7c <_sk_store_4444_hsw+0x6d>
   .byte  196,67,121,21,68,83,4,2             // vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   .byte  196,65,121,126,4,83                 // vmovd         %xmm8,(%r11,%rdx,2)
-  .byte  235,191                             // jmp           3a4c <_sk_store_4444_hsw+0x6d>
+  .byte  235,191                             // jmp           3a7c <_sk_store_4444_hsw+0x6d>
   .byte  196,67,121,21,68,83,12,6            // vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,10,5            // vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,8,4             // vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   .byte  196,65,121,214,4,83                 // vmovq         %xmm8,(%r11,%rdx,2)
-  .byte  235,159                             // jmp           3a4c <_sk_store_4444_hsw+0x6d>
+  .byte  235,159                             // jmp           3a7c <_sk_store_4444_hsw+0x6d>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  196                                 // (bad)
   .byte  255                                 // (bad)
@@ -14889,16 +14958,16 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,88                              // jne           3b39 <_sk_load_8888_hsw+0x6d>
+  .byte  117,88                              // jne           3b69 <_sk_load_8888_hsw+0x6d>
   .byte  196,193,124,16,26                   // vmovups       (%r10),%ymm3
-  .byte  197,228,84,5,114,34,0,0             // vandps        0x2272(%rip),%ymm3,%ymm0        # 5d60 <_sk_callback_hsw+0x710>
+  .byte  197,228,84,5,130,34,0,0             // vandps        0x2282(%rip),%ymm3,%ymm0        # 5da0 <_sk_callback_hsw+0x720>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,245,31,0,0          // vbroadcastss  0x1ff5(%rip),%ymm8        # 5af0 <_sk_callback_hsw+0x4a0>
+  .byte  196,98,125,24,5,253,31,0,0          // vbroadcastss  0x1ffd(%rip),%ymm8        # 5b28 <_sk_callback_hsw+0x4a8>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,226,101,0,13,119,34,0,0         // vpshufb       0x2277(%rip),%ymm3,%ymm1        # 5d80 <_sk_callback_hsw+0x730>
+  .byte  196,226,101,0,13,135,34,0,0         // vpshufb       0x2287(%rip),%ymm3,%ymm1        # 5dc0 <_sk_callback_hsw+0x740>
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
-  .byte  196,226,101,0,21,133,34,0,0         // vpshufb       0x2285(%rip),%ymm3,%ymm2        # 5da0 <_sk_callback_hsw+0x750>
+  .byte  196,226,101,0,21,149,34,0,0         // vpshufb       0x2295(%rip),%ymm3,%ymm2        # 5de0 <_sk_callback_hsw+0x760>
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
@@ -14915,7 +14984,7 @@
   .byte  196,225,249,110,192                 // vmovq         %rax,%xmm0
   .byte  196,226,125,33,192                  // vpmovsxbd     %xmm0,%ymm0
   .byte  196,194,125,44,26                   // vmaskmovps    (%r10),%ymm0,%ymm3
-  .byte  235,135                             // jmp           3ae6 <_sk_load_8888_hsw+0x1a>
+  .byte  235,135                             // jmp           3b16 <_sk_load_8888_hsw+0x1a>
 
 HIDDEN _sk_load_8888_dst_hsw
 .globl _sk_load_8888_dst_hsw
@@ -14926,16 +14995,16 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,88                              // jne           3bcc <_sk_load_8888_dst_hsw+0x6d>
+  .byte  117,88                              // jne           3bfc <_sk_load_8888_dst_hsw+0x6d>
   .byte  196,193,124,16,58                   // vmovups       (%r10),%ymm7
-  .byte  197,196,84,37,63,34,0,0             // vandps        0x223f(%rip),%ymm7,%ymm4        # 5dc0 <_sk_callback_hsw+0x770>
+  .byte  197,196,84,37,79,34,0,0             // vandps        0x224f(%rip),%ymm7,%ymm4        # 5e00 <_sk_callback_hsw+0x780>
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,98,125,24,5,102,31,0,0          // vbroadcastss  0x1f66(%rip),%ymm8        # 5af4 <_sk_callback_hsw+0x4a4>
+  .byte  196,98,125,24,5,110,31,0,0          // vbroadcastss  0x1f6e(%rip),%ymm8        # 5b2c <_sk_callback_hsw+0x4ac>
   .byte  196,193,92,89,224                   // vmulps        %ymm8,%ymm4,%ymm4
-  .byte  196,226,69,0,45,68,34,0,0           // vpshufb       0x2244(%rip),%ymm7,%ymm5        # 5de0 <_sk_callback_hsw+0x790>
+  .byte  196,226,69,0,45,84,34,0,0           // vpshufb       0x2254(%rip),%ymm7,%ymm5        # 5e20 <_sk_callback_hsw+0x7a0>
   .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
   .byte  196,193,84,89,232                   // vmulps        %ymm8,%ymm5,%ymm5
-  .byte  196,226,69,0,53,82,34,0,0           // vpshufb       0x2252(%rip),%ymm7,%ymm6        # 5e00 <_sk_callback_hsw+0x7b0>
+  .byte  196,226,69,0,53,98,34,0,0           // vpshufb       0x2262(%rip),%ymm7,%ymm6        # 5e40 <_sk_callback_hsw+0x7c0>
   .byte  197,252,91,246                      // vcvtdq2ps     %ymm6,%ymm6
   .byte  196,193,76,89,240                   // vmulps        %ymm8,%ymm6,%ymm6
   .byte  197,197,114,215,24                  // vpsrld        $0x18,%ymm7,%ymm7
@@ -14952,7 +15021,7 @@
   .byte  196,225,249,110,224                 // vmovq         %rax,%xmm4
   .byte  196,226,125,33,228                  // vpmovsxbd     %xmm4,%ymm4
   .byte  196,194,93,44,58                    // vmaskmovps    (%r10),%ymm4,%ymm7
-  .byte  235,135                             // jmp           3b79 <_sk_load_8888_dst_hsw+0x1a>
+  .byte  235,135                             // jmp           3ba9 <_sk_load_8888_dst_hsw+0x1a>
 
 HIDDEN _sk_gather_8888_hsw
 .globl _sk_gather_8888_hsw
@@ -14967,14 +15036,14 @@
   .byte  197,245,254,192                     // vpaddd        %ymm0,%ymm1,%ymm0
   .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
   .byte  196,194,117,144,28,129              // vpgatherdd    %ymm1,(%r9,%ymm0,4),%ymm3
-  .byte  197,229,219,5,0,34,0,0              // vpand         0x2200(%rip),%ymm3,%ymm0        # 5e20 <_sk_callback_hsw+0x7d0>
+  .byte  197,229,219,5,16,34,0,0             // vpand         0x2210(%rip),%ymm3,%ymm0        # 5e60 <_sk_callback_hsw+0x7e0>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,203,30,0,0          // vbroadcastss  0x1ecb(%rip),%ymm8        # 5af8 <_sk_callback_hsw+0x4a8>
+  .byte  196,98,125,24,5,211,30,0,0          // vbroadcastss  0x1ed3(%rip),%ymm8        # 5b30 <_sk_callback_hsw+0x4b0>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,226,101,0,13,5,34,0,0           // vpshufb       0x2205(%rip),%ymm3,%ymm1        # 5e40 <_sk_callback_hsw+0x7f0>
+  .byte  196,226,101,0,13,21,34,0,0          // vpshufb       0x2215(%rip),%ymm3,%ymm1        # 5e80 <_sk_callback_hsw+0x800>
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
-  .byte  196,226,101,0,21,19,34,0,0          // vpshufb       0x2213(%rip),%ymm3,%ymm2        # 5e60 <_sk_callback_hsw+0x810>
+  .byte  196,226,101,0,21,35,34,0,0          // vpshufb       0x2223(%rip),%ymm3,%ymm2        # 5ea0 <_sk_callback_hsw+0x820>
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
@@ -14991,7 +15060,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
-  .byte  196,98,125,24,5,123,30,0,0          // vbroadcastss  0x1e7b(%rip),%ymm8        # 5afc <_sk_callback_hsw+0x4ac>
+  .byte  196,98,125,24,5,131,30,0,0          // vbroadcastss  0x1e83(%rip),%ymm8        # 5b34 <_sk_callback_hsw+0x4b4>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,65,116,89,208                   // vmulps        %ymm8,%ymm1,%ymm10
@@ -15007,7 +15076,7 @@
   .byte  196,65,45,235,192                   // vpor          %ymm8,%ymm10,%ymm8
   .byte  196,65,53,235,192                   // vpor          %ymm8,%ymm9,%ymm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,12                              // jne           3cdb <_sk_store_8888_hsw+0x73>
+  .byte  117,12                              // jne           3d0b <_sk_store_8888_hsw+0x73>
   .byte  196,65,124,17,2                     // vmovups       %ymm8,(%r10)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,201                          // mov           %r9,%rcx
@@ -15020,7 +15089,7 @@
   .byte  196,97,249,110,200                  // vmovq         %rax,%xmm9
   .byte  196,66,125,33,201                   // vpmovsxbd     %xmm9,%ymm9
   .byte  196,66,53,46,2                      // vmaskmovps    %ymm8,%ymm9,(%r10)
-  .byte  235,211                             // jmp           3cd4 <_sk_store_8888_hsw+0x6c>
+  .byte  235,211                             // jmp           3d04 <_sk_store_8888_hsw+0x6c>
 
 HIDDEN _sk_load_bgra_hsw
 .globl _sk_load_bgra_hsw
@@ -15031,16 +15100,16 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,88                              // jne           3d6e <_sk_load_bgra_hsw+0x6d>
+  .byte  117,88                              // jne           3d9e <_sk_load_bgra_hsw+0x6d>
   .byte  196,193,124,16,26                   // vmovups       (%r10),%ymm3
-  .byte  197,228,84,5,93,33,0,0              // vandps        0x215d(%rip),%ymm3,%ymm0        # 5e80 <_sk_callback_hsw+0x830>
+  .byte  197,228,84,5,109,33,0,0             // vandps        0x216d(%rip),%ymm3,%ymm0        # 5ec0 <_sk_callback_hsw+0x840>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,208,29,0,0          // vbroadcastss  0x1dd0(%rip),%ymm8        # 5b00 <_sk_callback_hsw+0x4b0>
+  .byte  196,98,125,24,5,216,29,0,0          // vbroadcastss  0x1dd8(%rip),%ymm8        # 5b38 <_sk_callback_hsw+0x4b8>
   .byte  196,193,124,89,208                  // vmulps        %ymm8,%ymm0,%ymm2
-  .byte  196,226,101,0,5,98,33,0,0           // vpshufb       0x2162(%rip),%ymm3,%ymm0        # 5ea0 <_sk_callback_hsw+0x850>
+  .byte  196,226,101,0,5,114,33,0,0          // vpshufb       0x2172(%rip),%ymm3,%ymm0        # 5ee0 <_sk_callback_hsw+0x860>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
   .byte  196,193,124,89,200                  // vmulps        %ymm8,%ymm0,%ymm1
-  .byte  196,226,101,0,5,112,33,0,0          // vpshufb       0x2170(%rip),%ymm3,%ymm0        # 5ec0 <_sk_callback_hsw+0x870>
+  .byte  196,226,101,0,5,128,33,0,0          // vpshufb       0x2180(%rip),%ymm3,%ymm0        # 5f00 <_sk_callback_hsw+0x880>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
@@ -15057,7 +15126,7 @@
   .byte  196,225,249,110,192                 // vmovq         %rax,%xmm0
   .byte  196,226,125,33,192                  // vpmovsxbd     %xmm0,%ymm0
   .byte  196,194,125,44,26                   // vmaskmovps    (%r10),%ymm0,%ymm3
-  .byte  235,135                             // jmp           3d1b <_sk_load_bgra_hsw+0x1a>
+  .byte  235,135                             // jmp           3d4b <_sk_load_bgra_hsw+0x1a>
 
 HIDDEN _sk_load_bgra_dst_hsw
 .globl _sk_load_bgra_dst_hsw
@@ -15068,16 +15137,16 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,88                              // jne           3e01 <_sk_load_bgra_dst_hsw+0x6d>
+  .byte  117,88                              // jne           3e31 <_sk_load_bgra_dst_hsw+0x6d>
   .byte  196,193,124,16,58                   // vmovups       (%r10),%ymm7
-  .byte  197,196,84,37,42,33,0,0             // vandps        0x212a(%rip),%ymm7,%ymm4        # 5ee0 <_sk_callback_hsw+0x890>
+  .byte  197,196,84,37,58,33,0,0             // vandps        0x213a(%rip),%ymm7,%ymm4        # 5f20 <_sk_callback_hsw+0x8a0>
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,98,125,24,5,65,29,0,0           // vbroadcastss  0x1d41(%rip),%ymm8        # 5b04 <_sk_callback_hsw+0x4b4>
+  .byte  196,98,125,24,5,73,29,0,0           // vbroadcastss  0x1d49(%rip),%ymm8        # 5b3c <_sk_callback_hsw+0x4bc>
   .byte  196,193,92,89,240                   // vmulps        %ymm8,%ymm4,%ymm6
-  .byte  196,226,69,0,37,47,33,0,0           // vpshufb       0x212f(%rip),%ymm7,%ymm4        # 5f00 <_sk_callback_hsw+0x8b0>
+  .byte  196,226,69,0,37,63,33,0,0           // vpshufb       0x213f(%rip),%ymm7,%ymm4        # 5f40 <_sk_callback_hsw+0x8c0>
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
   .byte  196,193,92,89,232                   // vmulps        %ymm8,%ymm4,%ymm5
-  .byte  196,226,69,0,37,61,33,0,0           // vpshufb       0x213d(%rip),%ymm7,%ymm4        # 5f20 <_sk_callback_hsw+0x8d0>
+  .byte  196,226,69,0,37,77,33,0,0           // vpshufb       0x214d(%rip),%ymm7,%ymm4        # 5f60 <_sk_callback_hsw+0x8e0>
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
   .byte  196,193,92,89,224                   // vmulps        %ymm8,%ymm4,%ymm4
   .byte  197,197,114,215,24                  // vpsrld        $0x18,%ymm7,%ymm7
@@ -15094,7 +15163,7 @@
   .byte  196,225,249,110,224                 // vmovq         %rax,%xmm4
   .byte  196,226,125,33,228                  // vpmovsxbd     %xmm4,%ymm4
   .byte  196,194,93,44,58                    // vmaskmovps    (%r10),%ymm4,%ymm7
-  .byte  235,135                             // jmp           3dae <_sk_load_bgra_dst_hsw+0x1a>
+  .byte  235,135                             // jmp           3dde <_sk_load_bgra_dst_hsw+0x1a>
 
 HIDDEN _sk_gather_bgra_hsw
 .globl _sk_gather_bgra_hsw
@@ -15109,14 +15178,14 @@
   .byte  197,245,254,192                     // vpaddd        %ymm0,%ymm1,%ymm0
   .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
   .byte  196,194,117,144,28,129              // vpgatherdd    %ymm1,(%r9,%ymm0,4),%ymm3
-  .byte  197,229,219,5,235,32,0,0            // vpand         0x20eb(%rip),%ymm3,%ymm0        # 5f40 <_sk_callback_hsw+0x8f0>
+  .byte  197,229,219,5,251,32,0,0            // vpand         0x20fb(%rip),%ymm3,%ymm0        # 5f80 <_sk_callback_hsw+0x900>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,166,28,0,0          // vbroadcastss  0x1ca6(%rip),%ymm8        # 5b08 <_sk_callback_hsw+0x4b8>
+  .byte  196,98,125,24,5,174,28,0,0          // vbroadcastss  0x1cae(%rip),%ymm8        # 5b40 <_sk_callback_hsw+0x4c0>
   .byte  196,193,124,89,208                  // vmulps        %ymm8,%ymm0,%ymm2
-  .byte  196,226,101,0,5,240,32,0,0          // vpshufb       0x20f0(%rip),%ymm3,%ymm0        # 5f60 <_sk_callback_hsw+0x910>
+  .byte  196,226,101,0,5,0,33,0,0            // vpshufb       0x2100(%rip),%ymm3,%ymm0        # 5fa0 <_sk_callback_hsw+0x920>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
   .byte  196,193,124,89,200                  // vmulps        %ymm8,%ymm0,%ymm1
-  .byte  196,226,101,0,5,254,32,0,0          // vpshufb       0x20fe(%rip),%ymm3,%ymm0        # 5f80 <_sk_callback_hsw+0x930>
+  .byte  196,226,101,0,5,14,33,0,0           // vpshufb       0x210e(%rip),%ymm3,%ymm0        # 5fc0 <_sk_callback_hsw+0x940>
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  197,229,114,211,24                  // vpsrld        $0x18,%ymm3,%ymm3
@@ -15133,7 +15202,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
-  .byte  196,98,125,24,5,86,28,0,0           // vbroadcastss  0x1c56(%rip),%ymm8        # 5b0c <_sk_callback_hsw+0x4bc>
+  .byte  196,98,125,24,5,94,28,0,0           // vbroadcastss  0x1c5e(%rip),%ymm8        # 5b44 <_sk_callback_hsw+0x4c4>
   .byte  196,65,108,89,200                   // vmulps        %ymm8,%ymm2,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,65,116,89,208                   // vmulps        %ymm8,%ymm1,%ymm10
@@ -15149,7 +15218,7 @@
   .byte  196,65,45,235,192                   // vpor          %ymm8,%ymm10,%ymm8
   .byte  196,65,53,235,192                   // vpor          %ymm8,%ymm9,%ymm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,12                              // jne           3f10 <_sk_store_bgra_hsw+0x73>
+  .byte  117,12                              // jne           3f40 <_sk_store_bgra_hsw+0x73>
   .byte  196,65,124,17,2                     // vmovups       %ymm8,(%r10)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,201                          // mov           %r9,%rcx
@@ -15162,7 +15231,7 @@
   .byte  196,97,249,110,200                  // vmovq         %rax,%xmm9
   .byte  196,66,125,33,201                   // vpmovsxbd     %xmm9,%ymm9
   .byte  196,66,53,46,2                      // vmaskmovps    %ymm8,%ymm9,(%r10)
-  .byte  235,211                             // jmp           3f09 <_sk_store_bgra_hsw+0x6c>
+  .byte  235,211                             // jmp           3f39 <_sk_store_bgra_hsw+0x6c>
 
 HIDDEN _sk_load_f16_hsw
 .globl _sk_load_f16_hsw
@@ -15171,7 +15240,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,97                              // jne           3fa1 <_sk_load_f16_hsw+0x6b>
+  .byte  117,97                              // jne           3fd1 <_sk_load_f16_hsw+0x6b>
   .byte  197,121,16,4,208                    // vmovupd       (%rax,%rdx,8),%xmm8
   .byte  197,249,16,84,208,16                // vmovupd       0x10(%rax,%rdx,8),%xmm2
   .byte  197,249,16,92,208,32                // vmovupd       0x20(%rax,%rdx,8),%xmm3
@@ -15197,29 +15266,29 @@
   .byte  197,123,16,4,208                    // vmovsd        (%rax,%rdx,8),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,79                              // je            4000 <_sk_load_f16_hsw+0xca>
+  .byte  116,79                              // je            4030 <_sk_load_f16_hsw+0xca>
   .byte  197,57,22,68,208,8                  // vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,67                              // jb            4000 <_sk_load_f16_hsw+0xca>
+  .byte  114,67                              // jb            4030 <_sk_load_f16_hsw+0xca>
   .byte  197,251,16,84,208,16                // vmovsd        0x10(%rax,%rdx,8),%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,68                              // je            400d <_sk_load_f16_hsw+0xd7>
+  .byte  116,68                              // je            403d <_sk_load_f16_hsw+0xd7>
   .byte  197,233,22,84,208,24                // vmovhpd       0x18(%rax,%rdx,8),%xmm2,%xmm2
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,56                              // jb            400d <_sk_load_f16_hsw+0xd7>
+  .byte  114,56                              // jb            403d <_sk_load_f16_hsw+0xd7>
   .byte  197,251,16,92,208,32                // vmovsd        0x20(%rax,%rdx,8),%xmm3
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,114,255,255,255              // je            3f57 <_sk_load_f16_hsw+0x21>
+  .byte  15,132,114,255,255,255              // je            3f87 <_sk_load_f16_hsw+0x21>
   .byte  197,225,22,92,208,40                // vmovhpd       0x28(%rax,%rdx,8),%xmm3,%xmm3
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,98,255,255,255               // jb            3f57 <_sk_load_f16_hsw+0x21>
+  .byte  15,130,98,255,255,255               // jb            3f87 <_sk_load_f16_hsw+0x21>
   .byte  197,122,126,76,208,48               // vmovq         0x30(%rax,%rdx,8),%xmm9
-  .byte  233,87,255,255,255                  // jmpq          3f57 <_sk_load_f16_hsw+0x21>
+  .byte  233,87,255,255,255                  // jmpq          3f87 <_sk_load_f16_hsw+0x21>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,74,255,255,255                  // jmpq          3f57 <_sk_load_f16_hsw+0x21>
+  .byte  233,74,255,255,255                  // jmpq          3f87 <_sk_load_f16_hsw+0x21>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,65,255,255,255                  // jmpq          3f57 <_sk_load_f16_hsw+0x21>
+  .byte  233,65,255,255,255                  // jmpq          3f87 <_sk_load_f16_hsw+0x21>
 
 HIDDEN _sk_load_f16_dst_hsw
 .globl _sk_load_f16_dst_hsw
@@ -15228,7 +15297,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,97                              // jne           4081 <_sk_load_f16_dst_hsw+0x6b>
+  .byte  117,97                              // jne           40b1 <_sk_load_f16_dst_hsw+0x6b>
   .byte  197,121,16,4,208                    // vmovupd       (%rax,%rdx,8),%xmm8
   .byte  197,249,16,116,208,16               // vmovupd       0x10(%rax,%rdx,8),%xmm6
   .byte  197,249,16,124,208,32               // vmovupd       0x20(%rax,%rdx,8),%xmm7
@@ -15254,29 +15323,29 @@
   .byte  197,123,16,4,208                    // vmovsd        (%rax,%rdx,8),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,79                              // je            40e0 <_sk_load_f16_dst_hsw+0xca>
+  .byte  116,79                              // je            4110 <_sk_load_f16_dst_hsw+0xca>
   .byte  197,57,22,68,208,8                  // vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,67                              // jb            40e0 <_sk_load_f16_dst_hsw+0xca>
+  .byte  114,67                              // jb            4110 <_sk_load_f16_dst_hsw+0xca>
   .byte  197,251,16,116,208,16               // vmovsd        0x10(%rax,%rdx,8),%xmm6
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,68                              // je            40ed <_sk_load_f16_dst_hsw+0xd7>
+  .byte  116,68                              // je            411d <_sk_load_f16_dst_hsw+0xd7>
   .byte  197,201,22,116,208,24               // vmovhpd       0x18(%rax,%rdx,8),%xmm6,%xmm6
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,56                              // jb            40ed <_sk_load_f16_dst_hsw+0xd7>
+  .byte  114,56                              // jb            411d <_sk_load_f16_dst_hsw+0xd7>
   .byte  197,251,16,124,208,32               // vmovsd        0x20(%rax,%rdx,8),%xmm7
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,114,255,255,255              // je            4037 <_sk_load_f16_dst_hsw+0x21>
+  .byte  15,132,114,255,255,255              // je            4067 <_sk_load_f16_dst_hsw+0x21>
   .byte  197,193,22,124,208,40               // vmovhpd       0x28(%rax,%rdx,8),%xmm7,%xmm7
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,98,255,255,255               // jb            4037 <_sk_load_f16_dst_hsw+0x21>
+  .byte  15,130,98,255,255,255               // jb            4067 <_sk_load_f16_dst_hsw+0x21>
   .byte  197,122,126,76,208,48               // vmovq         0x30(%rax,%rdx,8),%xmm9
-  .byte  233,87,255,255,255                  // jmpq          4037 <_sk_load_f16_dst_hsw+0x21>
+  .byte  233,87,255,255,255                  // jmpq          4067 <_sk_load_f16_dst_hsw+0x21>
   .byte  197,193,87,255                      // vxorpd        %xmm7,%xmm7,%xmm7
   .byte  197,201,87,246                      // vxorpd        %xmm6,%xmm6,%xmm6
-  .byte  233,74,255,255,255                  // jmpq          4037 <_sk_load_f16_dst_hsw+0x21>
+  .byte  233,74,255,255,255                  // jmpq          4067 <_sk_load_f16_dst_hsw+0x21>
   .byte  197,193,87,255                      // vxorpd        %xmm7,%xmm7,%xmm7
-  .byte  233,65,255,255,255                  // jmpq          4037 <_sk_load_f16_dst_hsw+0x21>
+  .byte  233,65,255,255,255                  // jmpq          4067 <_sk_load_f16_dst_hsw+0x21>
 
 HIDDEN _sk_gather_f16_hsw
 .globl _sk_gather_f16_hsw
@@ -15334,7 +15403,7 @@
   .byte  196,65,57,98,205                    // vpunpckldq    %xmm13,%xmm8,%xmm9
   .byte  196,65,57,106,197                   // vpunpckhdq    %xmm13,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,27                              // jne           41e5 <_sk_store_f16_hsw+0x65>
+  .byte  117,27                              // jne           4215 <_sk_store_f16_hsw+0x65>
   .byte  197,120,17,28,208                   // vmovups       %xmm11,(%rax,%rdx,8)
   .byte  197,120,17,84,208,16                // vmovups       %xmm10,0x10(%rax,%rdx,8)
   .byte  197,120,17,76,208,32                // vmovups       %xmm9,0x20(%rax,%rdx,8)
@@ -15343,22 +15412,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  197,121,214,28,208                  // vmovq         %xmm11,(%rax,%rdx,8)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,241                             // je            41e1 <_sk_store_f16_hsw+0x61>
+  .byte  116,241                             // je            4211 <_sk_store_f16_hsw+0x61>
   .byte  197,121,23,92,208,8                 // vmovhpd       %xmm11,0x8(%rax,%rdx,8)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,229                             // jb            41e1 <_sk_store_f16_hsw+0x61>
+  .byte  114,229                             // jb            4211 <_sk_store_f16_hsw+0x61>
   .byte  197,121,214,84,208,16               // vmovq         %xmm10,0x10(%rax,%rdx,8)
-  .byte  116,221                             // je            41e1 <_sk_store_f16_hsw+0x61>
+  .byte  116,221                             // je            4211 <_sk_store_f16_hsw+0x61>
   .byte  197,121,23,84,208,24                // vmovhpd       %xmm10,0x18(%rax,%rdx,8)
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,209                             // jb            41e1 <_sk_store_f16_hsw+0x61>
+  .byte  114,209                             // jb            4211 <_sk_store_f16_hsw+0x61>
   .byte  197,121,214,76,208,32               // vmovq         %xmm9,0x20(%rax,%rdx,8)
-  .byte  116,201                             // je            41e1 <_sk_store_f16_hsw+0x61>
+  .byte  116,201                             // je            4211 <_sk_store_f16_hsw+0x61>
   .byte  197,121,23,76,208,40                // vmovhpd       %xmm9,0x28(%rax,%rdx,8)
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,189                             // jb            41e1 <_sk_store_f16_hsw+0x61>
+  .byte  114,189                             // jb            4211 <_sk_store_f16_hsw+0x61>
   .byte  197,121,214,68,208,48               // vmovq         %xmm8,0x30(%rax,%rdx,8)
-  .byte  235,181                             // jmp           41e1 <_sk_store_f16_hsw+0x61>
+  .byte  235,181                             // jmp           4211 <_sk_store_f16_hsw+0x61>
 
 HIDDEN _sk_load_u16_be_hsw
 .globl _sk_load_u16_be_hsw
@@ -15368,7 +15437,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,204,0,0,0                    // jne           430e <_sk_load_u16_be_hsw+0xe2>
+  .byte  15,133,204,0,0,0                    // jne           433e <_sk_load_u16_be_hsw+0xe2>
   .byte  196,65,121,16,4,65                  // vmovupd       (%r9,%rax,2),%xmm8
   .byte  196,193,121,16,84,65,16             // vmovupd       0x10(%r9,%rax,2),%xmm2
   .byte  196,193,121,16,92,65,32             // vmovupd       0x20(%r9,%rax,2),%xmm3
@@ -15387,7 +15456,7 @@
   .byte  197,241,235,192                     // vpor          %xmm0,%xmm1,%xmm0
   .byte  196,226,125,51,192                  // vpmovzxwd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,21,109,24,0,0         // vbroadcastss  0x186d(%rip),%ymm10        # 5b10 <_sk_callback_hsw+0x4c0>
+  .byte  196,98,125,24,21,117,24,0,0         // vbroadcastss  0x1875(%rip),%ymm10        # 5b48 <_sk_callback_hsw+0x4c8>
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  197,185,109,202                     // vpunpckhqdq   %xmm2,%xmm8,%xmm1
   .byte  197,233,113,241,8                   // vpsllw        $0x8,%xmm1,%xmm2
@@ -15415,29 +15484,29 @@
   .byte  196,65,123,16,4,65                  // vmovsd        (%r9,%rax,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,85                              // je            4374 <_sk_load_u16_be_hsw+0x148>
+  .byte  116,85                              // je            43a4 <_sk_load_u16_be_hsw+0x148>
   .byte  196,65,57,22,68,65,8                // vmovhpd       0x8(%r9,%rax,2),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,72                              // jb            4374 <_sk_load_u16_be_hsw+0x148>
+  .byte  114,72                              // jb            43a4 <_sk_load_u16_be_hsw+0x148>
   .byte  196,193,123,16,84,65,16             // vmovsd        0x10(%r9,%rax,2),%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,72                              // je            4381 <_sk_load_u16_be_hsw+0x155>
+  .byte  116,72                              // je            43b1 <_sk_load_u16_be_hsw+0x155>
   .byte  196,193,105,22,84,65,24             // vmovhpd       0x18(%r9,%rax,2),%xmm2,%xmm2
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,59                              // jb            4381 <_sk_load_u16_be_hsw+0x155>
+  .byte  114,59                              // jb            43b1 <_sk_load_u16_be_hsw+0x155>
   .byte  196,193,123,16,92,65,32             // vmovsd        0x20(%r9,%rax,2),%xmm3
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,6,255,255,255                // je            425d <_sk_load_u16_be_hsw+0x31>
+  .byte  15,132,6,255,255,255                // je            428d <_sk_load_u16_be_hsw+0x31>
   .byte  196,193,97,22,92,65,40              // vmovhpd       0x28(%r9,%rax,2),%xmm3,%xmm3
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,245,254,255,255              // jb            425d <_sk_load_u16_be_hsw+0x31>
+  .byte  15,130,245,254,255,255              // jb            428d <_sk_load_u16_be_hsw+0x31>
   .byte  196,65,122,126,76,65,48             // vmovq         0x30(%r9,%rax,2),%xmm9
-  .byte  233,233,254,255,255                 // jmpq          425d <_sk_load_u16_be_hsw+0x31>
+  .byte  233,233,254,255,255                 // jmpq          428d <_sk_load_u16_be_hsw+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,220,254,255,255                 // jmpq          425d <_sk_load_u16_be_hsw+0x31>
+  .byte  233,220,254,255,255                 // jmpq          428d <_sk_load_u16_be_hsw+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,211,254,255,255                 // jmpq          425d <_sk_load_u16_be_hsw+0x31>
+  .byte  233,211,254,255,255                 // jmpq          428d <_sk_load_u16_be_hsw+0x31>
 
 HIDDEN _sk_load_rgb_u16_be_hsw
 .globl _sk_load_rgb_u16_be_hsw
@@ -15447,7 +15516,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,82                         // lea           (%rdx,%rdx,2),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,204,0,0,0                    // jne           4468 <_sk_load_rgb_u16_be_hsw+0xde>
+  .byte  15,133,204,0,0,0                    // jne           4498 <_sk_load_rgb_u16_be_hsw+0xde>
   .byte  196,193,122,111,4,65                // vmovdqu       (%r9,%rax,2),%xmm0
   .byte  196,193,122,111,84,65,12            // vmovdqu       0xc(%r9,%rax,2),%xmm2
   .byte  196,193,122,111,76,65,24            // vmovdqu       0x18(%r9,%rax,2),%xmm1
@@ -15471,7 +15540,7 @@
   .byte  197,241,235,192                     // vpor          %xmm0,%xmm1,%xmm0
   .byte  196,226,125,51,192                  // vpmovzxwd     %xmm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,21,254,22,0,0         // vbroadcastss  0x16fe(%rip),%ymm10        # 5b14 <_sk_callback_hsw+0x4c4>
+  .byte  196,98,125,24,21,6,23,0,0           // vbroadcastss  0x1706(%rip),%ymm10        # 5b4c <_sk_callback_hsw+0x4cc>
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  197,185,109,202                     // vpunpckhqdq   %xmm2,%xmm8,%xmm1
   .byte  197,233,113,241,8                   // vpsllw        $0x8,%xmm1,%xmm2
@@ -15488,41 +15557,41 @@
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,210                  // vmulps        %ymm10,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,178,22,0,0        // vbroadcastss  0x16b2(%rip),%ymm3        # 5b18 <_sk_callback_hsw+0x4c8>
+  .byte  196,226,125,24,29,186,22,0,0        // vbroadcastss  0x16ba(%rip),%ymm3        # 5b50 <_sk_callback_hsw+0x4d0>
   .byte  255,224                             // jmpq          *%rax
   .byte  196,193,121,110,4,65                // vmovd         (%r9,%rax,2),%xmm0
   .byte  196,193,121,196,68,65,4,2           // vpinsrw       $0x2,0x4(%r9,%rax,2),%xmm0,%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,5                               // jne           4481 <_sk_load_rgb_u16_be_hsw+0xf7>
-  .byte  233,79,255,255,255                  // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  117,5                               // jne           44b1 <_sk_load_rgb_u16_be_hsw+0xf7>
+  .byte  233,79,255,255,255                  // jmpq          4400 <_sk_load_rgb_u16_be_hsw+0x46>
   .byte  196,193,121,110,76,65,6             // vmovd         0x6(%r9,%rax,2),%xmm1
   .byte  196,65,113,196,68,65,10,2           // vpinsrw       $0x2,0xa(%r9,%rax,2),%xmm1,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,26                              // jb            44b0 <_sk_load_rgb_u16_be_hsw+0x126>
+  .byte  114,26                              // jb            44e0 <_sk_load_rgb_u16_be_hsw+0x126>
   .byte  196,193,121,110,76,65,12            // vmovd         0xc(%r9,%rax,2),%xmm1
   .byte  196,193,113,196,84,65,16,2          // vpinsrw       $0x2,0x10(%r9,%rax,2),%xmm1,%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  117,10                              // jne           44b5 <_sk_load_rgb_u16_be_hsw+0x12b>
-  .byte  233,32,255,255,255                  // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
-  .byte  233,27,255,255,255                  // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  117,10                              // jne           44e5 <_sk_load_rgb_u16_be_hsw+0x12b>
+  .byte  233,32,255,255,255                  // jmpq          4400 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  233,27,255,255,255                  // jmpq          4400 <_sk_load_rgb_u16_be_hsw+0x46>
   .byte  196,193,121,110,76,65,18            // vmovd         0x12(%r9,%rax,2),%xmm1
   .byte  196,65,113,196,76,65,22,2           // vpinsrw       $0x2,0x16(%r9,%rax,2),%xmm1,%xmm9
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,26                              // jb            44e4 <_sk_load_rgb_u16_be_hsw+0x15a>
+  .byte  114,26                              // jb            4514 <_sk_load_rgb_u16_be_hsw+0x15a>
   .byte  196,193,121,110,76,65,24            // vmovd         0x18(%r9,%rax,2),%xmm1
   .byte  196,193,113,196,76,65,28,2          // vpinsrw       $0x2,0x1c(%r9,%rax,2),%xmm1,%xmm1
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  117,10                              // jne           44e9 <_sk_load_rgb_u16_be_hsw+0x15f>
-  .byte  233,236,254,255,255                 // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
-  .byte  233,231,254,255,255                 // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  117,10                              // jne           4519 <_sk_load_rgb_u16_be_hsw+0x15f>
+  .byte  233,236,254,255,255                 // jmpq          4400 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  233,231,254,255,255                 // jmpq          4400 <_sk_load_rgb_u16_be_hsw+0x46>
   .byte  196,193,121,110,92,65,30            // vmovd         0x1e(%r9,%rax,2),%xmm3
   .byte  196,65,97,196,92,65,34,2            // vpinsrw       $0x2,0x22(%r9,%rax,2),%xmm3,%xmm11
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,20                              // jb            4512 <_sk_load_rgb_u16_be_hsw+0x188>
+  .byte  114,20                              // jb            4542 <_sk_load_rgb_u16_be_hsw+0x188>
   .byte  196,193,121,110,92,65,36            // vmovd         0x24(%r9,%rax,2),%xmm3
   .byte  196,193,97,196,92,65,40,2           // vpinsrw       $0x2,0x28(%r9,%rax,2),%xmm3,%xmm3
-  .byte  233,190,254,255,255                 // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
-  .byte  233,185,254,255,255                 // jmpq          43d0 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  233,190,254,255,255                 // jmpq          4400 <_sk_load_rgb_u16_be_hsw+0x46>
+  .byte  233,185,254,255,255                 // jmpq          4400 <_sk_load_rgb_u16_be_hsw+0x46>
 
 HIDDEN _sk_store_u16_be_hsw
 .globl _sk_store_u16_be_hsw
@@ -15531,7 +15600,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
-  .byte  196,98,125,24,5,239,21,0,0          // vbroadcastss  0x15ef(%rip),%ymm8        # 5b1c <_sk_callback_hsw+0x4cc>
+  .byte  196,98,125,24,5,247,21,0,0          // vbroadcastss  0x15f7(%rip),%ymm8        # 5b54 <_sk_callback_hsw+0x4d4>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,67,125,25,202,1                 // vextractf128  $0x1,%ymm9,%xmm10
@@ -15569,7 +15638,7 @@
   .byte  196,65,17,98,200                    // vpunpckldq    %xmm8,%xmm13,%xmm9
   .byte  196,65,17,106,192                   // vpunpckhdq    %xmm8,%xmm13,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,31                              // jne           4611 <_sk_store_u16_be_hsw+0xfa>
+  .byte  117,31                              // jne           4641 <_sk_store_u16_be_hsw+0xfa>
   .byte  196,65,120,17,28,65                 // vmovups       %xmm11,(%r9,%rax,2)
   .byte  196,65,120,17,84,65,16              // vmovups       %xmm10,0x10(%r9,%rax,2)
   .byte  196,65,120,17,76,65,32              // vmovups       %xmm9,0x20(%r9,%rax,2)
@@ -15578,22 +15647,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,214,28,65                // vmovq         %xmm11,(%r9,%rax,2)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            460d <_sk_store_u16_be_hsw+0xf6>
+  .byte  116,240                             // je            463d <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,23,92,65,8               // vmovhpd       %xmm11,0x8(%r9,%rax,2)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            460d <_sk_store_u16_be_hsw+0xf6>
+  .byte  114,227                             // jb            463d <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,214,84,65,16             // vmovq         %xmm10,0x10(%r9,%rax,2)
-  .byte  116,218                             // je            460d <_sk_store_u16_be_hsw+0xf6>
+  .byte  116,218                             // je            463d <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,23,84,65,24              // vmovhpd       %xmm10,0x18(%r9,%rax,2)
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,205                             // jb            460d <_sk_store_u16_be_hsw+0xf6>
+  .byte  114,205                             // jb            463d <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,214,76,65,32             // vmovq         %xmm9,0x20(%r9,%rax,2)
-  .byte  116,196                             // je            460d <_sk_store_u16_be_hsw+0xf6>
+  .byte  116,196                             // je            463d <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,23,76,65,40              // vmovhpd       %xmm9,0x28(%r9,%rax,2)
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,183                             // jb            460d <_sk_store_u16_be_hsw+0xf6>
+  .byte  114,183                             // jb            463d <_sk_store_u16_be_hsw+0xf6>
   .byte  196,65,121,214,68,65,48             // vmovq         %xmm8,0x30(%r9,%rax,2)
-  .byte  235,174                             // jmp           460d <_sk_store_u16_be_hsw+0xf6>
+  .byte  235,174                             // jmp           463d <_sk_store_u16_be_hsw+0xf6>
 
 HIDDEN _sk_load_f32_hsw
 .globl _sk_load_f32_hsw
@@ -15601,10 +15670,10 @@
 _sk_load_f32_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  119,110                             // ja            46d5 <_sk_load_f32_hsw+0x76>
+  .byte  119,110                             // ja            4705 <_sk_load_f32_hsw+0x76>
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
-  .byte  76,141,29,135,0,0,0                 // lea           0x87(%rip),%r11        # 4700 <_sk_load_f32_hsw+0xa1>
+  .byte  76,141,29,135,0,0,0                 // lea           0x87(%rip),%r11        # 4730 <_sk_load_f32_hsw+0xa1>
   .byte  75,99,4,131                         // movslq        (%r11,%r8,4),%rax
   .byte  76,1,216                            // add           %r11,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -15655,10 +15724,10 @@
 _sk_load_f32_dst_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  119,110                             // ja            4796 <_sk_load_f32_dst_hsw+0x76>
+  .byte  119,110                             // ja            47c6 <_sk_load_f32_dst_hsw+0x76>
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
-  .byte  76,141,29,134,0,0,0                 // lea           0x86(%rip),%r11        # 47c0 <_sk_load_f32_dst_hsw+0xa0>
+  .byte  76,141,29,134,0,0,0                 // lea           0x86(%rip),%r11        # 47f0 <_sk_load_f32_dst_hsw+0xa0>
   .byte  75,99,4,131                         // movslq        (%r11,%r8,4),%rax
   .byte  76,1,216                            // add           %r11,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -15717,7 +15786,7 @@
   .byte  196,65,37,20,196                    // vunpcklpd     %ymm12,%ymm11,%ymm8
   .byte  196,65,37,21,220                    // vunpckhpd     %ymm12,%ymm11,%ymm11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,55                              // jne           484d <_sk_store_f32_hsw+0x6d>
+  .byte  117,55                              // jne           487d <_sk_store_f32_hsw+0x6d>
   .byte  196,67,45,24,225,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm12
   .byte  196,67,61,24,235,1                  // vinsertf128   $0x1,%xmm11,%ymm8,%ymm13
   .byte  196,67,45,6,201,49                  // vperm2f128    $0x31,%ymm9,%ymm10,%ymm9
@@ -15730,22 +15799,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,17,20,129                // vmovupd       %xmm10,(%r9,%rax,4)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            4849 <_sk_store_f32_hsw+0x69>
+  .byte  116,240                             // je            4879 <_sk_store_f32_hsw+0x69>
   .byte  196,65,121,17,76,129,16             // vmovupd       %xmm9,0x10(%r9,%rax,4)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            4849 <_sk_store_f32_hsw+0x69>
+  .byte  114,227                             // jb            4879 <_sk_store_f32_hsw+0x69>
   .byte  196,65,121,17,68,129,32             // vmovupd       %xmm8,0x20(%r9,%rax,4)
-  .byte  116,218                             // je            4849 <_sk_store_f32_hsw+0x69>
+  .byte  116,218                             // je            4879 <_sk_store_f32_hsw+0x69>
   .byte  196,65,121,17,92,129,48             // vmovupd       %xmm11,0x30(%r9,%rax,4)
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,205                             // jb            4849 <_sk_store_f32_hsw+0x69>
+  .byte  114,205                             // jb            4879 <_sk_store_f32_hsw+0x69>
   .byte  196,67,125,25,84,129,64,1           // vextractf128  $0x1,%ymm10,0x40(%r9,%rax,4)
-  .byte  116,195                             // je            4849 <_sk_store_f32_hsw+0x69>
+  .byte  116,195                             // je            4879 <_sk_store_f32_hsw+0x69>
   .byte  196,67,125,25,76,129,80,1           // vextractf128  $0x1,%ymm9,0x50(%r9,%rax,4)
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,181                             // jb            4849 <_sk_store_f32_hsw+0x69>
+  .byte  114,181                             // jb            4879 <_sk_store_f32_hsw+0x69>
   .byte  196,67,125,25,68,129,96,1           // vextractf128  $0x1,%ymm8,0x60(%r9,%rax,4)
-  .byte  235,171                             // jmp           4849 <_sk_store_f32_hsw+0x69>
+  .byte  235,171                             // jmp           4879 <_sk_store_f32_hsw+0x69>
 
 HIDDEN _sk_clamp_x_hsw
 .globl _sk_clamp_x_hsw
@@ -15818,7 +15887,7 @@
   .byte  196,65,124,92,218                   // vsubps        %ymm10,%ymm0,%ymm11
   .byte  196,193,58,88,192                   // vaddss        %xmm8,%xmm8,%xmm0
   .byte  196,98,125,24,192                   // vbroadcastss  %xmm0,%ymm8
-  .byte  197,178,89,5,189,17,0,0             // vmulss        0x11bd(%rip),%xmm9,%xmm0        # 5b20 <_sk_callback_hsw+0x4d0>
+  .byte  197,178,89,5,197,17,0,0             // vmulss        0x11c5(%rip),%xmm9,%xmm0        # 5b58 <_sk_callback_hsw+0x4d8>
   .byte  196,226,125,24,192                  // vbroadcastss  %xmm0,%ymm0
   .byte  197,164,89,192                      // vmulps        %ymm0,%ymm11,%ymm0
   .byte  196,227,125,8,192,1                 // vroundps      $0x1,%ymm0,%ymm0
@@ -15844,7 +15913,7 @@
   .byte  196,65,116,92,218                   // vsubps        %ymm10,%ymm1,%ymm11
   .byte  196,193,58,88,200                   // vaddss        %xmm8,%xmm8,%xmm1
   .byte  196,98,125,24,193                   // vbroadcastss  %xmm1,%ymm8
-  .byte  197,178,89,13,97,17,0,0             // vmulss        0x1161(%rip),%xmm9,%xmm1        # 5b24 <_sk_callback_hsw+0x4d4>
+  .byte  197,178,89,13,105,17,0,0            // vmulss        0x1169(%rip),%xmm9,%xmm1        # 5b5c <_sk_callback_hsw+0x4dc>
   .byte  196,226,125,24,201                  // vbroadcastss  %xmm1,%ymm1
   .byte  197,164,89,201                      // vmulps        %ymm1,%ymm11,%ymm1
   .byte  196,227,125,8,201,1                 // vroundps      $0x1,%ymm1,%ymm1
@@ -15865,7 +15934,7 @@
 _sk_clamp_x_1_hsw:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  197,188,95,192                      // vmaxps        %ymm0,%ymm8,%ymm0
-  .byte  196,98,125,24,5,26,17,0,0           // vbroadcastss  0x111a(%rip),%ymm8        # 5b28 <_sk_callback_hsw+0x4d8>
+  .byte  196,98,125,24,5,34,17,0,0           // vbroadcastss  0x1122(%rip),%ymm8        # 5b60 <_sk_callback_hsw+0x4e0>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -15883,9 +15952,9 @@
 .globl _sk_mirror_x_1_hsw
 FUNCTION(_sk_mirror_x_1_hsw)
 _sk_mirror_x_1_hsw:
-  .byte  196,98,125,24,5,253,16,0,0          // vbroadcastss  0x10fd(%rip),%ymm8        # 5b2c <_sk_callback_hsw+0x4dc>
+  .byte  196,98,125,24,5,5,17,0,0            // vbroadcastss  0x1105(%rip),%ymm8        # 5b64 <_sk_callback_hsw+0x4e4>
   .byte  196,193,124,88,192                  // vaddps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,13,243,16,0,0         // vbroadcastss  0x10f3(%rip),%ymm9        # 5b30 <_sk_callback_hsw+0x4e0>
+  .byte  196,98,125,24,13,251,16,0,0         // vbroadcastss  0x10fb(%rip),%ymm9        # 5b68 <_sk_callback_hsw+0x4e8>
   .byte  196,65,124,89,201                   // vmulps        %ymm9,%ymm0,%ymm9
   .byte  196,67,125,8,201,1                  // vroundps      $0x1,%ymm9,%ymm9
   .byte  196,65,52,88,201                    // vaddps        %ymm9,%ymm9,%ymm9
@@ -15901,11 +15970,11 @@
 .globl _sk_luminance_to_alpha_hsw
 FUNCTION(_sk_luminance_to_alpha_hsw)
 _sk_luminance_to_alpha_hsw:
-  .byte  196,226,125,24,29,195,16,0,0        // vbroadcastss  0x10c3(%rip),%ymm3        # 5b34 <_sk_callback_hsw+0x4e4>
-  .byte  196,98,125,24,5,190,16,0,0          // vbroadcastss  0x10be(%rip),%ymm8        # 5b38 <_sk_callback_hsw+0x4e8>
+  .byte  196,226,125,24,29,203,16,0,0        // vbroadcastss  0x10cb(%rip),%ymm3        # 5b6c <_sk_callback_hsw+0x4ec>
+  .byte  196,98,125,24,5,198,16,0,0          // vbroadcastss  0x10c6(%rip),%ymm8        # 5b70 <_sk_callback_hsw+0x4f0>
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
   .byte  196,226,125,184,203                 // vfmadd231ps   %ymm3,%ymm0,%ymm1
-  .byte  196,226,125,24,29,175,16,0,0        // vbroadcastss  0x10af(%rip),%ymm3        # 5b3c <_sk_callback_hsw+0x4ec>
+  .byte  196,226,125,24,29,183,16,0,0        // vbroadcastss  0x10b7(%rip),%ymm3        # 5b74 <_sk_callback_hsw+0x4f4>
   .byte  196,226,109,168,217                 // vfmadd213ps   %ymm1,%ymm2,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -16105,9 +16174,9 @@
   .byte  76,139,72,8                         // mov           0x8(%rax),%r9
   .byte  77,137,211                          // mov           %r10,%r11
   .byte  73,255,203                          // dec           %r11
-  .byte  120,7                               // js            4d86 <_sk_evenly_spaced_gradient_hsw+0x19>
+  .byte  120,7                               // js            4db6 <_sk_evenly_spaced_gradient_hsw+0x19>
   .byte  196,193,242,42,203                  // vcvtsi2ss     %r11,%xmm1,%xmm1
-  .byte  235,22                              // jmp           4d9c <_sk_evenly_spaced_gradient_hsw+0x2f>
+  .byte  235,22                              // jmp           4dcc <_sk_evenly_spaced_gradient_hsw+0x2f>
   .byte  76,137,219                          // mov           %r11,%rbx
   .byte  72,209,235                          // shr           %rbx
   .byte  65,131,227,1                        // and           $0x1,%r11d
@@ -16118,7 +16187,7 @@
   .byte  197,244,89,200                      // vmulps        %ymm0,%ymm1,%ymm1
   .byte  197,126,91,217                      // vcvttps2dq    %ymm1,%ymm11
   .byte  73,131,250,8                        // cmp           $0x8,%r10
-  .byte  119,70                              // ja            4df5 <_sk_evenly_spaced_gradient_hsw+0x88>
+  .byte  119,70                              // ja            4e25 <_sk_evenly_spaced_gradient_hsw+0x88>
   .byte  196,66,37,22,1                      // vpermps       (%r9),%ymm11,%ymm8
   .byte  72,139,88,40                        // mov           0x28(%rax),%rbx
   .byte  196,98,37,22,11                     // vpermps       (%rbx),%ymm11,%ymm9
@@ -16134,7 +16203,7 @@
   .byte  196,226,37,22,27                    // vpermps       (%rbx),%ymm11,%ymm3
   .byte  72,139,64,64                        // mov           0x40(%rax),%rax
   .byte  196,98,37,22,40                     // vpermps       (%rax),%ymm11,%ymm13
-  .byte  235,110                             // jmp           4e63 <_sk_evenly_spaced_gradient_hsw+0xf6>
+  .byte  235,110                             // jmp           4e93 <_sk_evenly_spaced_gradient_hsw+0xf6>
   .byte  196,65,13,118,246                   // vpcmpeqd      %ymm14,%ymm14,%ymm14
   .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
   .byte  196,2,117,146,4,153                 // vgatherdps    %ymm1,(%r9,%ymm11,4),%ymm8
@@ -16171,14 +16240,14 @@
 .globl _sk_gauss_a_to_rgba_hsw
 FUNCTION(_sk_gauss_a_to_rgba_hsw)
 _sk_gauss_a_to_rgba_hsw:
-  .byte  196,226,125,24,5,183,12,0,0         // vbroadcastss  0xcb7(%rip),%ymm0        # 5b40 <_sk_callback_hsw+0x4f0>
-  .byte  196,226,125,24,13,178,12,0,0        // vbroadcastss  0xcb2(%rip),%ymm1        # 5b44 <_sk_callback_hsw+0x4f4>
+  .byte  196,226,125,24,5,191,12,0,0         // vbroadcastss  0xcbf(%rip),%ymm0        # 5b78 <_sk_callback_hsw+0x4f8>
+  .byte  196,226,125,24,13,186,12,0,0        // vbroadcastss  0xcba(%rip),%ymm1        # 5b7c <_sk_callback_hsw+0x4fc>
   .byte  196,226,101,168,200                 // vfmadd213ps   %ymm0,%ymm3,%ymm1
-  .byte  196,226,125,24,5,168,12,0,0         // vbroadcastss  0xca8(%rip),%ymm0        # 5b48 <_sk_callback_hsw+0x4f8>
+  .byte  196,226,125,24,5,176,12,0,0         // vbroadcastss  0xcb0(%rip),%ymm0        # 5b80 <_sk_callback_hsw+0x500>
   .byte  196,226,101,184,193                 // vfmadd231ps   %ymm1,%ymm3,%ymm0
-  .byte  196,226,125,24,13,158,12,0,0        // vbroadcastss  0xc9e(%rip),%ymm1        # 5b4c <_sk_callback_hsw+0x4fc>
+  .byte  196,226,125,24,13,166,12,0,0        // vbroadcastss  0xca6(%rip),%ymm1        # 5b84 <_sk_callback_hsw+0x504>
   .byte  196,226,101,184,200                 // vfmadd231ps   %ymm0,%ymm3,%ymm1
-  .byte  196,226,125,24,5,148,12,0,0         // vbroadcastss  0xc94(%rip),%ymm0        # 5b50 <_sk_callback_hsw+0x500>
+  .byte  196,226,125,24,5,156,12,0,0         // vbroadcastss  0xc9c(%rip),%ymm0        # 5b88 <_sk_callback_hsw+0x508>
   .byte  196,226,101,184,193                 // vfmadd231ps   %ymm1,%ymm3,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
@@ -16193,11 +16262,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  73,131,249,1                        // cmp           $0x1,%r9
-  .byte  15,134,180,0,0,0                    // jbe           4f94 <_sk_gradient_hsw+0xc3>
+  .byte  15,134,180,0,0,0                    // jbe           4fc4 <_sk_gradient_hsw+0xc3>
   .byte  76,139,80,72                        // mov           0x48(%rax),%r10
   .byte  197,244,87,201                      // vxorps        %ymm1,%ymm1,%ymm1
   .byte  65,187,1,0,0,0                      // mov           $0x1,%r11d
-  .byte  196,226,125,24,21,93,12,0,0         // vbroadcastss  0xc5d(%rip),%ymm2        # 5b54 <_sk_callback_hsw+0x504>
+  .byte  196,226,125,24,21,101,12,0,0        // vbroadcastss  0xc65(%rip),%ymm2        # 5b8c <_sk_callback_hsw+0x50c>
   .byte  196,65,53,239,201                   // vpxor         %ymm9,%ymm9,%ymm9
   .byte  196,130,125,24,28,154               // vbroadcastss  (%r10,%r11,4),%ymm3
   .byte  197,228,194,216,2                   // vcmpleps      %ymm0,%ymm3,%ymm3
@@ -16205,10 +16274,10 @@
   .byte  196,65,101,254,201                  // vpaddd        %ymm9,%ymm3,%ymm9
   .byte  73,255,195                          // inc           %r11
   .byte  77,57,217                           // cmp           %r11,%r9
-  .byte  117,226                             // jne           4efc <_sk_gradient_hsw+0x2b>
+  .byte  117,226                             // jne           4f2c <_sk_gradient_hsw+0x2b>
   .byte  76,139,80,8                         // mov           0x8(%rax),%r10
   .byte  73,131,249,8                        // cmp           $0x8,%r9
-  .byte  118,121                             // jbe           4f9d <_sk_gradient_hsw+0xcc>
+  .byte  118,121                             // jbe           4fcd <_sk_gradient_hsw+0xcc>
   .byte  196,65,13,118,246                   // vpcmpeqd      %ymm14,%ymm14,%ymm14
   .byte  197,245,118,201                     // vpcmpeqd      %ymm1,%ymm1,%ymm1
   .byte  196,2,117,146,4,138                 // vgatherdps    %ymm1,(%r10,%ymm9,4),%ymm8
@@ -16232,7 +16301,7 @@
   .byte  196,130,21,146,28,137               // vgatherdps    %ymm13,(%r9,%ymm9,4),%ymm3
   .byte  72,139,64,64                        // mov           0x40(%rax),%rax
   .byte  196,34,13,146,44,136                // vgatherdps    %ymm14,(%rax,%ymm9,4),%ymm13
-  .byte  235,77                              // jmp           4fe1 <_sk_gradient_hsw+0x110>
+  .byte  235,77                              // jmp           5011 <_sk_gradient_hsw+0x110>
   .byte  76,139,80,8                         // mov           0x8(%rax),%r10
   .byte  196,65,52,87,201                    // vxorps        %ymm9,%ymm9,%ymm9
   .byte  196,66,53,22,2                      // vpermps       (%r10),%ymm9,%ymm8
@@ -16292,24 +16361,24 @@
   .byte  196,65,52,95,226                    // vmaxps        %ymm10,%ymm9,%ymm12
   .byte  196,65,36,94,220                    // vdivps        %ymm12,%ymm11,%ymm11
   .byte  196,65,36,89,227                    // vmulps        %ymm11,%ymm11,%ymm12
-  .byte  196,98,125,24,45,220,10,0,0         // vbroadcastss  0xadc(%rip),%ymm13        # 5b58 <_sk_callback_hsw+0x508>
-  .byte  196,98,125,24,53,215,10,0,0         // vbroadcastss  0xad7(%rip),%ymm14        # 5b5c <_sk_callback_hsw+0x50c>
+  .byte  196,98,125,24,45,228,10,0,0         // vbroadcastss  0xae4(%rip),%ymm13        # 5b90 <_sk_callback_hsw+0x510>
+  .byte  196,98,125,24,53,223,10,0,0         // vbroadcastss  0xadf(%rip),%ymm14        # 5b94 <_sk_callback_hsw+0x514>
   .byte  196,66,29,184,245                   // vfmadd231ps   %ymm13,%ymm12,%ymm14
-  .byte  196,98,125,24,45,205,10,0,0         // vbroadcastss  0xacd(%rip),%ymm13        # 5b60 <_sk_callback_hsw+0x510>
+  .byte  196,98,125,24,45,213,10,0,0         // vbroadcastss  0xad5(%rip),%ymm13        # 5b98 <_sk_callback_hsw+0x518>
   .byte  196,66,29,184,238                   // vfmadd231ps   %ymm14,%ymm12,%ymm13
-  .byte  196,98,125,24,53,195,10,0,0         // vbroadcastss  0xac3(%rip),%ymm14        # 5b64 <_sk_callback_hsw+0x514>
+  .byte  196,98,125,24,53,203,10,0,0         // vbroadcastss  0xacb(%rip),%ymm14        # 5b9c <_sk_callback_hsw+0x51c>
   .byte  196,66,29,184,245                   // vfmadd231ps   %ymm13,%ymm12,%ymm14
   .byte  196,65,36,89,222                    // vmulps        %ymm14,%ymm11,%ymm11
   .byte  196,65,52,194,202,1                 // vcmpltps      %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,24,21,174,10,0,0         // vbroadcastss  0xaae(%rip),%ymm10        # 5b68 <_sk_callback_hsw+0x518>
+  .byte  196,98,125,24,21,182,10,0,0         // vbroadcastss  0xab6(%rip),%ymm10        # 5ba0 <_sk_callback_hsw+0x520>
   .byte  196,65,44,92,211                    // vsubps        %ymm11,%ymm10,%ymm10
   .byte  196,67,37,74,202,144                // vblendvps     %ymm9,%ymm10,%ymm11,%ymm9
   .byte  196,193,124,194,192,1               // vcmpltps      %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,21,152,10,0,0         // vbroadcastss  0xa98(%rip),%ymm10        # 5b6c <_sk_callback_hsw+0x51c>
+  .byte  196,98,125,24,21,160,10,0,0         // vbroadcastss  0xaa0(%rip),%ymm10        # 5ba4 <_sk_callback_hsw+0x524>
   .byte  196,65,44,92,209                    // vsubps        %ymm9,%ymm10,%ymm10
   .byte  196,195,53,74,194,0                 // vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   .byte  196,65,116,194,200,1                // vcmpltps      %ymm8,%ymm1,%ymm9
-  .byte  196,98,125,24,21,130,10,0,0         // vbroadcastss  0xa82(%rip),%ymm10        # 5b70 <_sk_callback_hsw+0x520>
+  .byte  196,98,125,24,21,138,10,0,0         // vbroadcastss  0xa8a(%rip),%ymm10        # 5ba8 <_sk_callback_hsw+0x528>
   .byte  197,44,92,208                       // vsubps        %ymm0,%ymm10,%ymm10
   .byte  196,195,125,74,194,144              // vblendvps     %ymm9,%ymm10,%ymm0,%ymm0
   .byte  196,65,124,194,200,3                // vcmpunordps   %ymm8,%ymm0,%ymm9
@@ -16337,23 +16406,23 @@
   .byte  197,50,89,80,44                     // vmulss        0x2c(%rax),%xmm9,%xmm10
   .byte  196,66,125,24,210                   // vbroadcastss  %xmm10,%ymm10
   .byte  197,44,88,208                       // vaddps        %ymm0,%ymm10,%ymm10
-  .byte  196,98,125,24,29,54,10,0,0          // vbroadcastss  0xa36(%rip),%ymm11        # 5b74 <_sk_callback_hsw+0x524>
+  .byte  196,98,125,24,29,62,10,0,0          // vbroadcastss  0xa3e(%rip),%ymm11        # 5bac <_sk_callback_hsw+0x52c>
   .byte  196,65,44,89,211                    // vmulps        %ymm11,%ymm10,%ymm10
   .byte  197,116,89,217                      // vmulps        %ymm1,%ymm1,%ymm11
   .byte  196,98,125,184,216                  // vfmadd231ps   %ymm0,%ymm0,%ymm11
   .byte  196,193,50,89,193                   // vmulss        %xmm9,%xmm9,%xmm0
   .byte  196,226,125,24,192                  // vbroadcastss  %xmm0,%ymm0
   .byte  197,164,92,192                      // vsubps        %ymm0,%ymm11,%ymm0
-  .byte  196,98,125,24,13,21,10,0,0          // vbroadcastss  0xa15(%rip),%ymm9        # 5b78 <_sk_callback_hsw+0x528>
+  .byte  196,98,125,24,13,29,10,0,0          // vbroadcastss  0xa1d(%rip),%ymm9        # 5bb0 <_sk_callback_hsw+0x530>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  196,194,45,184,194                  // vfmadd231ps   %ymm10,%ymm10,%ymm0
   .byte  197,252,81,192                      // vsqrtps       %ymm0,%ymm0
   .byte  196,98,125,24,64,36                 // vbroadcastss  0x24(%rax),%ymm8
-  .byte  196,98,125,24,13,248,9,0,0          // vbroadcastss  0x9f8(%rip),%ymm9        # 5b7c <_sk_callback_hsw+0x52c>
+  .byte  196,98,125,24,13,0,10,0,0           // vbroadcastss  0xa00(%rip),%ymm9        # 5bb4 <_sk_callback_hsw+0x534>
   .byte  196,65,44,87,201                    // vxorps        %ymm9,%ymm10,%ymm9
   .byte  196,65,124,92,210                   // vsubps        %ymm10,%ymm0,%ymm10
-  .byte  196,98,125,24,29,233,9,0,0          // vbroadcastss  0x9e9(%rip),%ymm11        # 5b80 <_sk_callback_hsw+0x530>
+  .byte  196,98,125,24,29,241,9,0,0          // vbroadcastss  0x9f1(%rip),%ymm11        # 5bb8 <_sk_callback_hsw+0x538>
   .byte  196,65,60,89,195                    // vmulps        %ymm11,%ymm8,%ymm8
   .byte  196,65,44,89,208                    // vmulps        %ymm8,%ymm10,%ymm10
   .byte  197,180,92,192                      // vsubps        %ymm0,%ymm9,%ymm0
@@ -16372,23 +16441,23 @@
   .byte  197,50,89,80,44                     // vmulss        0x2c(%rax),%xmm9,%xmm10
   .byte  196,66,125,24,210                   // vbroadcastss  %xmm10,%ymm10
   .byte  197,44,88,208                       // vaddps        %ymm0,%ymm10,%ymm10
-  .byte  196,98,125,24,29,174,9,0,0          // vbroadcastss  0x9ae(%rip),%ymm11        # 5b84 <_sk_callback_hsw+0x534>
+  .byte  196,98,125,24,29,182,9,0,0          // vbroadcastss  0x9b6(%rip),%ymm11        # 5bbc <_sk_callback_hsw+0x53c>
   .byte  196,65,44,89,211                    // vmulps        %ymm11,%ymm10,%ymm10
   .byte  197,116,89,217                      // vmulps        %ymm1,%ymm1,%ymm11
   .byte  196,98,125,184,216                  // vfmadd231ps   %ymm0,%ymm0,%ymm11
   .byte  196,193,50,89,193                   // vmulss        %xmm9,%xmm9,%xmm0
   .byte  196,226,125,24,192                  // vbroadcastss  %xmm0,%ymm0
   .byte  197,164,92,192                      // vsubps        %ymm0,%ymm11,%ymm0
-  .byte  196,98,125,24,13,141,9,0,0          // vbroadcastss  0x98d(%rip),%ymm9        # 5b88 <_sk_callback_hsw+0x538>
+  .byte  196,98,125,24,13,149,9,0,0          // vbroadcastss  0x995(%rip),%ymm9        # 5bc0 <_sk_callback_hsw+0x540>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  196,194,45,184,194                  // vfmadd231ps   %ymm10,%ymm10,%ymm0
   .byte  197,252,81,192                      // vsqrtps       %ymm0,%ymm0
   .byte  196,98,125,24,64,36                 // vbroadcastss  0x24(%rax),%ymm8
-  .byte  196,98,125,24,13,112,9,0,0          // vbroadcastss  0x970(%rip),%ymm9        # 5b8c <_sk_callback_hsw+0x53c>
+  .byte  196,98,125,24,13,120,9,0,0          // vbroadcastss  0x978(%rip),%ymm9        # 5bc4 <_sk_callback_hsw+0x544>
   .byte  196,65,44,87,201                    // vxorps        %ymm9,%ymm10,%ymm9
   .byte  196,65,124,92,210                   // vsubps        %ymm10,%ymm0,%ymm10
-  .byte  196,98,125,24,29,97,9,0,0           // vbroadcastss  0x961(%rip),%ymm11        # 5b90 <_sk_callback_hsw+0x540>
+  .byte  196,98,125,24,29,105,9,0,0          // vbroadcastss  0x969(%rip),%ymm11        # 5bc8 <_sk_callback_hsw+0x548>
   .byte  196,65,60,89,195                    // vmulps        %ymm11,%ymm8,%ymm8
   .byte  196,65,44,89,208                    // vmulps        %ymm8,%ymm10,%ymm10
   .byte  197,180,92,192                      // vsubps        %ymm0,%ymm9,%ymm0
@@ -16406,14 +16475,14 @@
   .byte  197,58,89,72,44                     // vmulss        0x2c(%rax),%xmm8,%xmm9
   .byte  196,66,125,24,201                   // vbroadcastss  %xmm9,%ymm9
   .byte  197,52,88,200                       // vaddps        %ymm0,%ymm9,%ymm9
-  .byte  196,98,125,24,21,44,9,0,0           // vbroadcastss  0x92c(%rip),%ymm10        # 5b94 <_sk_callback_hsw+0x544>
+  .byte  196,98,125,24,21,52,9,0,0           // vbroadcastss  0x934(%rip),%ymm10        # 5bcc <_sk_callback_hsw+0x54c>
   .byte  196,65,52,89,202                    // vmulps        %ymm10,%ymm9,%ymm9
   .byte  197,116,89,209                      // vmulps        %ymm1,%ymm1,%ymm10
   .byte  196,98,125,184,208                  // vfmadd231ps   %ymm0,%ymm0,%ymm10
   .byte  196,193,58,89,192                   // vmulss        %xmm8,%xmm8,%xmm0
   .byte  196,226,125,24,192                  // vbroadcastss  %xmm0,%ymm0
   .byte  197,172,92,192                      // vsubps        %ymm0,%ymm10,%ymm0
-  .byte  196,98,125,24,5,11,9,0,0            // vbroadcastss  0x90b(%rip),%ymm8        # 5b98 <_sk_callback_hsw+0x548>
+  .byte  196,98,125,24,5,19,9,0,0            // vbroadcastss  0x913(%rip),%ymm8        # 5bd0 <_sk_callback_hsw+0x550>
   .byte  196,193,124,87,192                  // vxorps        %ymm8,%ymm0,%ymm0
   .byte  196,193,124,94,193                  // vdivps        %ymm9,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -16453,7 +16522,7 @@
 FUNCTION(_sk_save_xy_hsw)
 _sk_save_xy_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,171,8,0,0           // vbroadcastss  0x8ab(%rip),%ymm8        # 5b9c <_sk_callback_hsw+0x54c>
+  .byte  196,98,125,24,5,179,8,0,0           // vbroadcastss  0x8b3(%rip),%ymm8        # 5bd4 <_sk_callback_hsw+0x554>
   .byte  196,65,124,88,200                   // vaddps        %ymm8,%ymm0,%ymm9
   .byte  196,67,125,8,209,1                  // vroundps      $0x1,%ymm9,%ymm10
   .byte  196,65,52,92,202                    // vsubps        %ymm10,%ymm9,%ymm9
@@ -16487,9 +16556,9 @@
 FUNCTION(_sk_bilinear_nx_hsw)
 _sk_bilinear_nx_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,63,8,0,0           // vbroadcastss  0x83f(%rip),%ymm0        # 5ba0 <_sk_callback_hsw+0x550>
+  .byte  196,226,125,24,5,71,8,0,0           // vbroadcastss  0x847(%rip),%ymm0        # 5bd8 <_sk_callback_hsw+0x558>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,54,8,0,0            // vbroadcastss  0x836(%rip),%ymm8        # 5ba4 <_sk_callback_hsw+0x554>
+  .byte  196,98,125,24,5,62,8,0,0            // vbroadcastss  0x83e(%rip),%ymm8        # 5bdc <_sk_callback_hsw+0x55c>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -16500,7 +16569,7 @@
 FUNCTION(_sk_bilinear_px_hsw)
 _sk_bilinear_px_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,30,8,0,0           // vbroadcastss  0x81e(%rip),%ymm0        # 5ba8 <_sk_callback_hsw+0x558>
+  .byte  196,226,125,24,5,38,8,0,0           // vbroadcastss  0x826(%rip),%ymm0        # 5be0 <_sk_callback_hsw+0x560>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
   .byte  197,124,16,64,64                    // vmovups       0x40(%rax),%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -16512,9 +16581,9 @@
 FUNCTION(_sk_bilinear_ny_hsw)
 _sk_bilinear_ny_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,2,8,0,0           // vbroadcastss  0x802(%rip),%ymm1        # 5bac <_sk_callback_hsw+0x55c>
+  .byte  196,226,125,24,13,10,8,0,0          // vbroadcastss  0x80a(%rip),%ymm1        # 5be4 <_sk_callback_hsw+0x564>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,248,7,0,0           // vbroadcastss  0x7f8(%rip),%ymm8        # 5bb0 <_sk_callback_hsw+0x560>
+  .byte  196,98,125,24,5,0,8,0,0             // vbroadcastss  0x800(%rip),%ymm8        # 5be8 <_sk_callback_hsw+0x568>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -16525,7 +16594,7 @@
 FUNCTION(_sk_bilinear_py_hsw)
 _sk_bilinear_py_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,224,7,0,0         // vbroadcastss  0x7e0(%rip),%ymm1        # 5bb4 <_sk_callback_hsw+0x564>
+  .byte  196,226,125,24,13,232,7,0,0         // vbroadcastss  0x7e8(%rip),%ymm1        # 5bec <_sk_callback_hsw+0x56c>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
   .byte  197,124,16,64,96                    // vmovups       0x60(%rax),%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -16537,13 +16606,13 @@
 FUNCTION(_sk_bicubic_n3x_hsw)
 _sk_bicubic_n3x_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,195,7,0,0          // vbroadcastss  0x7c3(%rip),%ymm0        # 5bb8 <_sk_callback_hsw+0x568>
+  .byte  196,226,125,24,5,203,7,0,0          // vbroadcastss  0x7cb(%rip),%ymm0        # 5bf0 <_sk_callback_hsw+0x570>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,186,7,0,0           // vbroadcastss  0x7ba(%rip),%ymm8        # 5bbc <_sk_callback_hsw+0x56c>
+  .byte  196,98,125,24,5,194,7,0,0           // vbroadcastss  0x7c2(%rip),%ymm8        # 5bf4 <_sk_callback_hsw+0x574>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,171,7,0,0          // vbroadcastss  0x7ab(%rip),%ymm10        # 5bc0 <_sk_callback_hsw+0x570>
-  .byte  196,98,125,24,29,166,7,0,0          // vbroadcastss  0x7a6(%rip),%ymm11        # 5bc4 <_sk_callback_hsw+0x574>
+  .byte  196,98,125,24,21,179,7,0,0          // vbroadcastss  0x7b3(%rip),%ymm10        # 5bf8 <_sk_callback_hsw+0x578>
+  .byte  196,98,125,24,29,174,7,0,0          // vbroadcastss  0x7ae(%rip),%ymm11        # 5bfc <_sk_callback_hsw+0x57c>
   .byte  196,66,61,168,218                   // vfmadd213ps   %ymm10,%ymm8,%ymm11
   .byte  196,65,36,89,193                    // vmulps        %ymm9,%ymm11,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -16555,16 +16624,16 @@
 FUNCTION(_sk_bicubic_n1x_hsw)
 _sk_bicubic_n1x_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,137,7,0,0          // vbroadcastss  0x789(%rip),%ymm0        # 5bc8 <_sk_callback_hsw+0x578>
+  .byte  196,226,125,24,5,145,7,0,0          // vbroadcastss  0x791(%rip),%ymm0        # 5c00 <_sk_callback_hsw+0x580>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,128,7,0,0           // vbroadcastss  0x780(%rip),%ymm8        # 5bcc <_sk_callback_hsw+0x57c>
+  .byte  196,98,125,24,5,136,7,0,0           // vbroadcastss  0x788(%rip),%ymm8        # 5c04 <_sk_callback_hsw+0x584>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
-  .byte  196,98,125,24,13,118,7,0,0          // vbroadcastss  0x776(%rip),%ymm9        # 5bd0 <_sk_callback_hsw+0x580>
-  .byte  196,98,125,24,21,113,7,0,0          // vbroadcastss  0x771(%rip),%ymm10        # 5bd4 <_sk_callback_hsw+0x584>
+  .byte  196,98,125,24,13,126,7,0,0          // vbroadcastss  0x77e(%rip),%ymm9        # 5c08 <_sk_callback_hsw+0x588>
+  .byte  196,98,125,24,21,121,7,0,0          // vbroadcastss  0x779(%rip),%ymm10        # 5c0c <_sk_callback_hsw+0x58c>
   .byte  196,66,61,168,209                   // vfmadd213ps   %ymm9,%ymm8,%ymm10
-  .byte  196,98,125,24,13,103,7,0,0          // vbroadcastss  0x767(%rip),%ymm9        # 5bd8 <_sk_callback_hsw+0x588>
+  .byte  196,98,125,24,13,111,7,0,0          // vbroadcastss  0x76f(%rip),%ymm9        # 5c10 <_sk_callback_hsw+0x590>
   .byte  196,66,61,184,202                   // vfmadd231ps   %ymm10,%ymm8,%ymm9
-  .byte  196,98,125,24,21,93,7,0,0           // vbroadcastss  0x75d(%rip),%ymm10        # 5bdc <_sk_callback_hsw+0x58c>
+  .byte  196,98,125,24,21,101,7,0,0          // vbroadcastss  0x765(%rip),%ymm10        # 5c14 <_sk_callback_hsw+0x594>
   .byte  196,66,61,184,209                   // vfmadd231ps   %ymm9,%ymm8,%ymm10
   .byte  197,124,17,144,128,0,0,0            // vmovups       %ymm10,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -16575,14 +16644,14 @@
 FUNCTION(_sk_bicubic_p1x_hsw)
 _sk_bicubic_p1x_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,69,7,0,0            // vbroadcastss  0x745(%rip),%ymm8        # 5be0 <_sk_callback_hsw+0x590>
+  .byte  196,98,125,24,5,77,7,0,0            // vbroadcastss  0x74d(%rip),%ymm8        # 5c18 <_sk_callback_hsw+0x598>
   .byte  197,188,88,0                        // vaddps        (%rax),%ymm8,%ymm0
   .byte  197,124,16,72,64                    // vmovups       0x40(%rax),%ymm9
-  .byte  196,98,125,24,21,55,7,0,0           // vbroadcastss  0x737(%rip),%ymm10        # 5be4 <_sk_callback_hsw+0x594>
-  .byte  196,98,125,24,29,50,7,0,0           // vbroadcastss  0x732(%rip),%ymm11        # 5be8 <_sk_callback_hsw+0x598>
+  .byte  196,98,125,24,21,63,7,0,0           // vbroadcastss  0x73f(%rip),%ymm10        # 5c1c <_sk_callback_hsw+0x59c>
+  .byte  196,98,125,24,29,58,7,0,0           // vbroadcastss  0x73a(%rip),%ymm11        # 5c20 <_sk_callback_hsw+0x5a0>
   .byte  196,66,53,168,218                   // vfmadd213ps   %ymm10,%ymm9,%ymm11
   .byte  196,66,53,168,216                   // vfmadd213ps   %ymm8,%ymm9,%ymm11
-  .byte  196,98,125,24,5,35,7,0,0            // vbroadcastss  0x723(%rip),%ymm8        # 5bec <_sk_callback_hsw+0x59c>
+  .byte  196,98,125,24,5,43,7,0,0            // vbroadcastss  0x72b(%rip),%ymm8        # 5c24 <_sk_callback_hsw+0x5a4>
   .byte  196,66,53,184,195                   // vfmadd231ps   %ymm11,%ymm9,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -16593,12 +16662,12 @@
 FUNCTION(_sk_bicubic_p3x_hsw)
 _sk_bicubic_p3x_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,11,7,0,0           // vbroadcastss  0x70b(%rip),%ymm0        # 5bf0 <_sk_callback_hsw+0x5a0>
+  .byte  196,226,125,24,5,19,7,0,0           // vbroadcastss  0x713(%rip),%ymm0        # 5c28 <_sk_callback_hsw+0x5a8>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
   .byte  197,124,16,64,64                    // vmovups       0x40(%rax),%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,248,6,0,0          // vbroadcastss  0x6f8(%rip),%ymm10        # 5bf4 <_sk_callback_hsw+0x5a4>
-  .byte  196,98,125,24,29,243,6,0,0          // vbroadcastss  0x6f3(%rip),%ymm11        # 5bf8 <_sk_callback_hsw+0x5a8>
+  .byte  196,98,125,24,21,0,7,0,0            // vbroadcastss  0x700(%rip),%ymm10        # 5c2c <_sk_callback_hsw+0x5ac>
+  .byte  196,98,125,24,29,251,6,0,0          // vbroadcastss  0x6fb(%rip),%ymm11        # 5c30 <_sk_callback_hsw+0x5b0>
   .byte  196,66,61,168,218                   // vfmadd213ps   %ymm10,%ymm8,%ymm11
   .byte  196,65,52,89,195                    // vmulps        %ymm11,%ymm9,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -16610,13 +16679,13 @@
 FUNCTION(_sk_bicubic_n3y_hsw)
 _sk_bicubic_n3y_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,214,6,0,0         // vbroadcastss  0x6d6(%rip),%ymm1        # 5bfc <_sk_callback_hsw+0x5ac>
+  .byte  196,226,125,24,13,222,6,0,0         // vbroadcastss  0x6de(%rip),%ymm1        # 5c34 <_sk_callback_hsw+0x5b4>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,204,6,0,0           // vbroadcastss  0x6cc(%rip),%ymm8        # 5c00 <_sk_callback_hsw+0x5b0>
+  .byte  196,98,125,24,5,212,6,0,0           // vbroadcastss  0x6d4(%rip),%ymm8        # 5c38 <_sk_callback_hsw+0x5b8>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,189,6,0,0          // vbroadcastss  0x6bd(%rip),%ymm10        # 5c04 <_sk_callback_hsw+0x5b4>
-  .byte  196,98,125,24,29,184,6,0,0          // vbroadcastss  0x6b8(%rip),%ymm11        # 5c08 <_sk_callback_hsw+0x5b8>
+  .byte  196,98,125,24,21,197,6,0,0          // vbroadcastss  0x6c5(%rip),%ymm10        # 5c3c <_sk_callback_hsw+0x5bc>
+  .byte  196,98,125,24,29,192,6,0,0          // vbroadcastss  0x6c0(%rip),%ymm11        # 5c40 <_sk_callback_hsw+0x5c0>
   .byte  196,66,61,168,218                   // vfmadd213ps   %ymm10,%ymm8,%ymm11
   .byte  196,65,36,89,193                    // vmulps        %ymm9,%ymm11,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -16628,16 +16697,16 @@
 FUNCTION(_sk_bicubic_n1y_hsw)
 _sk_bicubic_n1y_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,155,6,0,0         // vbroadcastss  0x69b(%rip),%ymm1        # 5c0c <_sk_callback_hsw+0x5bc>
+  .byte  196,226,125,24,13,163,6,0,0         // vbroadcastss  0x6a3(%rip),%ymm1        # 5c44 <_sk_callback_hsw+0x5c4>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,145,6,0,0           // vbroadcastss  0x691(%rip),%ymm8        # 5c10 <_sk_callback_hsw+0x5c0>
+  .byte  196,98,125,24,5,153,6,0,0           // vbroadcastss  0x699(%rip),%ymm8        # 5c48 <_sk_callback_hsw+0x5c8>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
-  .byte  196,98,125,24,13,135,6,0,0          // vbroadcastss  0x687(%rip),%ymm9        # 5c14 <_sk_callback_hsw+0x5c4>
-  .byte  196,98,125,24,21,130,6,0,0          // vbroadcastss  0x682(%rip),%ymm10        # 5c18 <_sk_callback_hsw+0x5c8>
+  .byte  196,98,125,24,13,143,6,0,0          // vbroadcastss  0x68f(%rip),%ymm9        # 5c4c <_sk_callback_hsw+0x5cc>
+  .byte  196,98,125,24,21,138,6,0,0          // vbroadcastss  0x68a(%rip),%ymm10        # 5c50 <_sk_callback_hsw+0x5d0>
   .byte  196,66,61,168,209                   // vfmadd213ps   %ymm9,%ymm8,%ymm10
-  .byte  196,98,125,24,13,120,6,0,0          // vbroadcastss  0x678(%rip),%ymm9        # 5c1c <_sk_callback_hsw+0x5cc>
+  .byte  196,98,125,24,13,128,6,0,0          // vbroadcastss  0x680(%rip),%ymm9        # 5c54 <_sk_callback_hsw+0x5d4>
   .byte  196,66,61,184,202                   // vfmadd231ps   %ymm10,%ymm8,%ymm9
-  .byte  196,98,125,24,21,110,6,0,0          // vbroadcastss  0x66e(%rip),%ymm10        # 5c20 <_sk_callback_hsw+0x5d0>
+  .byte  196,98,125,24,21,118,6,0,0          // vbroadcastss  0x676(%rip),%ymm10        # 5c58 <_sk_callback_hsw+0x5d8>
   .byte  196,66,61,184,209                   // vfmadd231ps   %ymm9,%ymm8,%ymm10
   .byte  197,124,17,144,160,0,0,0            // vmovups       %ymm10,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -16648,14 +16717,14 @@
 FUNCTION(_sk_bicubic_p1y_hsw)
 _sk_bicubic_p1y_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,86,6,0,0            // vbroadcastss  0x656(%rip),%ymm8        # 5c24 <_sk_callback_hsw+0x5d4>
+  .byte  196,98,125,24,5,94,6,0,0            // vbroadcastss  0x65e(%rip),%ymm8        # 5c5c <_sk_callback_hsw+0x5dc>
   .byte  197,188,88,72,32                    // vaddps        0x20(%rax),%ymm8,%ymm1
   .byte  197,124,16,72,96                    // vmovups       0x60(%rax),%ymm9
-  .byte  196,98,125,24,21,71,6,0,0           // vbroadcastss  0x647(%rip),%ymm10        # 5c28 <_sk_callback_hsw+0x5d8>
-  .byte  196,98,125,24,29,66,6,0,0           // vbroadcastss  0x642(%rip),%ymm11        # 5c2c <_sk_callback_hsw+0x5dc>
+  .byte  196,98,125,24,21,79,6,0,0           // vbroadcastss  0x64f(%rip),%ymm10        # 5c60 <_sk_callback_hsw+0x5e0>
+  .byte  196,98,125,24,29,74,6,0,0           // vbroadcastss  0x64a(%rip),%ymm11        # 5c64 <_sk_callback_hsw+0x5e4>
   .byte  196,66,53,168,218                   // vfmadd213ps   %ymm10,%ymm9,%ymm11
   .byte  196,66,53,168,216                   // vfmadd213ps   %ymm8,%ymm9,%ymm11
-  .byte  196,98,125,24,5,51,6,0,0            // vbroadcastss  0x633(%rip),%ymm8        # 5c30 <_sk_callback_hsw+0x5e0>
+  .byte  196,98,125,24,5,59,6,0,0            // vbroadcastss  0x63b(%rip),%ymm8        # 5c68 <_sk_callback_hsw+0x5e8>
   .byte  196,66,53,184,195                   // vfmadd231ps   %ymm11,%ymm9,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -16666,12 +16735,12 @@
 FUNCTION(_sk_bicubic_p3y_hsw)
 _sk_bicubic_p3y_hsw:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,27,6,0,0          // vbroadcastss  0x61b(%rip),%ymm1        # 5c34 <_sk_callback_hsw+0x5e4>
+  .byte  196,226,125,24,13,35,6,0,0          // vbroadcastss  0x623(%rip),%ymm1        # 5c6c <_sk_callback_hsw+0x5ec>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
   .byte  197,124,16,64,96                    // vmovups       0x60(%rax),%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,7,6,0,0            // vbroadcastss  0x607(%rip),%ymm10        # 5c38 <_sk_callback_hsw+0x5e8>
-  .byte  196,98,125,24,29,2,6,0,0            // vbroadcastss  0x602(%rip),%ymm11        # 5c3c <_sk_callback_hsw+0x5ec>
+  .byte  196,98,125,24,21,15,6,0,0           // vbroadcastss  0x60f(%rip),%ymm10        # 5c70 <_sk_callback_hsw+0x5f0>
+  .byte  196,98,125,24,29,10,6,0,0           // vbroadcastss  0x60a(%rip),%ymm11        # 5c74 <_sk_callback_hsw+0x5f4>
   .byte  196,66,61,168,218                   // vfmadd213ps   %ymm10,%ymm8,%ymm11
   .byte  196,65,52,89,195                    // vmulps        %ymm11,%ymm9,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -16796,30 +16865,32 @@
   .byte  63                                  // (bad)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
-  .byte  0,128,191,0,0,224                   // add           %al,-0x1fffff41(%rax)
-  .byte  64,154                              // rex           (bad)
+  .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
+  .byte  63                                  // (bad)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  128,191,0,0,224,64,154              // cmpb          $0x9a,0x40e00000(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 5845 <.literal4+0xb1>
+  .byte  71,225,61                           // rex.RXB       loope 587d <.literal4+0xb9>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 5855 <.literal4+0xc1>
+  .byte  71,225,61                           // rex.RXB       loope 588d <.literal4+0xc9>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 5865 <.literal4+0xd1>
+  .byte  71,225,61                           // rex.RXB       loope 589d <.literal4+0xd9>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 5875 <.literal4+0xe1>
+  .byte  71,225,61                           // rex.RXB       loope 58ad <.literal4+0xe9>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,127                    // add           %al,0x7f00003f(%rax)
@@ -16881,7 +16952,7 @@
   .byte  190,129,128,128,59                  // mov           $0x3b808081,%esi
   .byte  129,128,128,59,0,248,0,0,8,33       // addl          $0x21080000,-0x7ffc480(%rax)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        58e5 <.literal4+0x151>
+  .byte  224,7                               // loopne        591d <.literal4+0x159>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -16897,10 +16968,10 @@
   .byte  129,128,128,59,129,128,128,59,0,0   // addl          $0x3b80,-0x7f7ec480(%rax)
   .byte  0,52,255                            // add           %dh,(%rdi,%rdi,8)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            590c <.literal4+0x178>
+  .byte  127,0                               // jg            5944 <.literal4+0x180>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            5985 <.literal4+0x1f1>
+  .byte  119,115                             // ja            59bd <.literal4+0x1f9>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -16914,10 +16985,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5940 <.literal4+0x1ac>
+  .byte  127,0                               // jg            5978 <.literal4+0x1b4>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            59b9 <.literal4+0x225>
+  .byte  119,115                             // ja            59f1 <.literal4+0x22d>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -16931,10 +17002,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            5974 <.literal4+0x1e0>
+  .byte  127,0                               // jg            59ac <.literal4+0x1e8>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            59ed <.literal4+0x259>
+  .byte  119,115                             // ja            5a25 <.literal4+0x261>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -16948,10 +17019,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            59a8 <.literal4+0x214>
+  .byte  127,0                               // jg            59e0 <.literal4+0x21c>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            5a21 <.literal4+0x28d>
+  .byte  119,115                             // ja            5a59 <.literal4+0x295>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -16964,7 +17035,7 @@
   .byte  0,75,0                              // add           %cl,0x0(%rbx)
   .byte  0,128,63,0,0,200                    // add           %al,-0x37ffffc1(%rax)
   .byte  66,0,0                              // rex.X         add %al,(%rax)
-  .byte  127,67                              // jg            5a1f <.literal4+0x28b>
+  .byte  127,67                              // jg            5a57 <.literal4+0x293>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,195                               // add           %al,%bl
   .byte  0,0                                 // add           %al,(%rax)
@@ -16976,7 +17047,7 @@
   .byte  190,80,128,3,62                     // mov           $0x3e038050,%esi
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           5a3f <.literal4+0x2ab>
+  .byte  118,63                              // jbe           5a77 <.literal4+0x2b3>
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
@@ -16991,7 +17062,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        5a41 <.literal4+0x2ad>
+  .byte  224,7                               // loopne        5a79 <.literal4+0x2b5>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -17003,7 +17074,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        5a5d <.literal4+0x2c9>
+  .byte  224,7                               // loopne        5a95 <.literal4+0x2d1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -17015,7 +17086,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        5a79 <.literal4+0x2e5>
+  .byte  224,7                               // loopne        5ab1 <.literal4+0x2ed>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -17026,7 +17097,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  248                                 // clc
   .byte  65,0,0                              // add           %al,(%r8)
-  .byte  124,66                              // jl            5ace <.literal4+0x33a>
+  .byte  124,66                              // jl            5b06 <.literal4+0x342>
   .byte  0,240                               // add           %dh,%al
   .byte  0,0                                 // add           %al,(%rax)
   .byte  137,136,136,55,0,15                 // mov           %ecx,0xf003788(%rax)
@@ -17052,7 +17123,7 @@
   .byte  137,136,136,59,15,0                 // mov           %ecx,0xf3b88(%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  137,136,136,61,0,0                  // mov           %ecx,0x3d88(%rax)
-  .byte  112,65                              // jo            5b31 <.literal4+0x39d>
+  .byte  112,65                              // jo            5b69 <.literal4+0x3a5>
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
@@ -17066,7 +17137,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  255                                 // (bad)
-  .byte  127,71                              // jg            5b67 <.literal4+0x3d3>
+  .byte  127,71                              // jg            5b9f <.literal4+0x3db>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -17193,16 +17264,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005c68 <_sk_callback_hsw+0xa000618>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005ca8 <_sk_callback_hsw+0xa000628>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005c70 <_sk_callback_hsw+0x12000620>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005cb0 <_sk_callback_hsw+0x12000630>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005c78 <_sk_callback_hsw+0x1a000628>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005cb8 <_sk_callback_hsw+0x1a000638>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005c80 <_sk_callback_hsw+0x3000630>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005cc0 <_sk_callback_hsw+0x3000640>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -17245,16 +17316,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005cc8 <_sk_callback_hsw+0xa000678>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005d08 <_sk_callback_hsw+0xa000688>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005cd0 <_sk_callback_hsw+0x12000680>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005d10 <_sk_callback_hsw+0x12000690>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005cd8 <_sk_callback_hsw+0x1a000688>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005d18 <_sk_callback_hsw+0x1a000698>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005ce0 <_sk_callback_hsw+0x3000690>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005d20 <_sk_callback_hsw+0x30006a0>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -17297,16 +17368,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005d28 <_sk_callback_hsw+0xa0006d8>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005d68 <_sk_callback_hsw+0xa0006e8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005d30 <_sk_callback_hsw+0x120006e0>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005d70 <_sk_callback_hsw+0x120006f0>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005d38 <_sk_callback_hsw+0x1a0006e8>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005d78 <_sk_callback_hsw+0x1a0006f8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005d40 <_sk_callback_hsw+0x30006f0>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005d80 <_sk_callback_hsw+0x3000700>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -17349,16 +17420,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005d88 <_sk_callback_hsw+0xa000738>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005dc8 <_sk_callback_hsw+0xa000748>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005d90 <_sk_callback_hsw+0x12000740>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005dd0 <_sk_callback_hsw+0x12000750>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005d98 <_sk_callback_hsw+0x1a000748>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005dd8 <_sk_callback_hsw+0x1a000758>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005da0 <_sk_callback_hsw+0x3000750>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005de0 <_sk_callback_hsw+0x3000760>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -17401,16 +17472,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005de8 <_sk_callback_hsw+0xa000798>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005e28 <_sk_callback_hsw+0xa0007a8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005df0 <_sk_callback_hsw+0x120007a0>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005e30 <_sk_callback_hsw+0x120007b0>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005df8 <_sk_callback_hsw+0x1a0007a8>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005e38 <_sk_callback_hsw+0x1a0007b8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005e00 <_sk_callback_hsw+0x30007b0>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005e40 <_sk_callback_hsw+0x30007c0>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -17453,16 +17524,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005e48 <_sk_callback_hsw+0xa0007f8>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005e88 <_sk_callback_hsw+0xa000808>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005e50 <_sk_callback_hsw+0x12000800>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005e90 <_sk_callback_hsw+0x12000810>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005e58 <_sk_callback_hsw+0x1a000808>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005e98 <_sk_callback_hsw+0x1a000818>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005e60 <_sk_callback_hsw+0x3000810>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005ea0 <_sk_callback_hsw+0x3000820>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -17505,16 +17576,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005ea8 <_sk_callback_hsw+0xa000858>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005ee8 <_sk_callback_hsw+0xa000868>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005eb0 <_sk_callback_hsw+0x12000860>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005ef0 <_sk_callback_hsw+0x12000870>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005eb8 <_sk_callback_hsw+0x1a000868>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005ef8 <_sk_callback_hsw+0x1a000878>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005ec0 <_sk_callback_hsw+0x3000870>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005f00 <_sk_callback_hsw+0x3000880>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -17557,16 +17628,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005f08 <_sk_callback_hsw+0xa0008b8>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005f48 <_sk_callback_hsw+0xa0008c8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005f10 <_sk_callback_hsw+0x120008c0>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005f50 <_sk_callback_hsw+0x120008d0>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005f18 <_sk_callback_hsw+0x1a0008c8>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005f58 <_sk_callback_hsw+0x1a0008d8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005f20 <_sk_callback_hsw+0x30008d0>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005f60 <_sk_callback_hsw+0x30008e0>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -17609,16 +17680,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005f68 <_sk_callback_hsw+0xa000918>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005fa8 <_sk_callback_hsw+0xa000928>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005f70 <_sk_callback_hsw+0x12000920>
+  .byte  255,13,255,255,255,17               // decl          0x11ffffff(%rip)        # 12005fb0 <_sk_callback_hsw+0x12000930>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005f78 <_sk_callback_hsw+0x1a000928>
+  .byte  255,21,255,255,255,25               // callq         *0x19ffffff(%rip)        # 1a005fb8 <_sk_callback_hsw+0x1a000938>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005f80 <_sk_callback_hsw+0x3000930>
+  .byte  255,29,255,255,255,2                // lcall         *0x2ffffff(%rip)        # 3005fc0 <_sk_callback_hsw+0x3000940>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -17795,7 +17866,7 @@
   .byte  197,249,112,192,0                   // vpshufd       $0x0,%xmm0,%xmm0
   .byte  196,227,125,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,15,120,0,0        // vbroadcastss  0x780f(%rip),%ymm1        # 78ac <_sk_callback_avx+0x144>
+  .byte  196,226,125,24,13,67,120,0,0        // vbroadcastss  0x7843(%rip),%ymm1        # 78e0 <_sk_callback_avx+0x144>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  197,252,88,7                        // vaddps        (%rdi),%ymm0,%ymm0
   .byte  197,249,110,209                     // vmovd         %ecx,%xmm2
@@ -17804,7 +17875,7 @@
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  197,236,88,201                      // vaddps        %ymm1,%ymm2,%ymm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,21,233,119,0,0       // vbroadcastss  0x77e9(%rip),%ymm2        # 78b0 <_sk_callback_avx+0x148>
+  .byte  196,226,125,24,21,29,120,0,0        // vbroadcastss  0x781d(%rip),%ymm2        # 78e4 <_sk_callback_avx+0x148>
   .byte  197,228,87,219                      // vxorps        %ymm3,%ymm3,%ymm3
   .byte  197,220,87,228                      // vxorps        %ymm4,%ymm4,%ymm4
   .byte  197,212,87,237                      // vxorps        %ymm5,%ymm5,%ymm5
@@ -17828,7 +17899,7 @@
   .byte  196,65,121,112,201,0                // vpshufd       $0x0,%xmm9,%xmm9
   .byte  196,67,53,24,201,1                  // vinsertf128   $0x1,%xmm9,%ymm9,%ymm9
   .byte  196,65,52,87,208                    // vxorps        %ymm8,%ymm9,%ymm10
-  .byte  196,98,125,24,29,146,119,0,0        // vbroadcastss  0x7792(%rip),%ymm11        # 78b4 <_sk_callback_avx+0x14c>
+  .byte  196,98,125,24,29,198,119,0,0        // vbroadcastss  0x77c6(%rip),%ymm11        # 78e8 <_sk_callback_avx+0x14c>
   .byte  196,65,44,84,203                    // vandps        %ymm11,%ymm10,%ymm9
   .byte  196,193,25,114,241,5                // vpslld        $0x5,%xmm9,%xmm12
   .byte  196,67,125,25,201,1                 // vextractf128  $0x1,%ymm9,%xmm9
@@ -17839,8 +17910,8 @@
   .byte  196,67,125,25,219,1                 // vextractf128  $0x1,%ymm11,%xmm11
   .byte  196,193,33,114,243,4                // vpslld        $0x4,%xmm11,%xmm11
   .byte  196,67,29,24,219,1                  // vinsertf128   $0x1,%xmm11,%ymm12,%ymm11
-  .byte  196,98,125,24,37,83,119,0,0         // vbroadcastss  0x7753(%rip),%ymm12        # 78b8 <_sk_callback_avx+0x150>
-  .byte  196,98,125,24,45,78,119,0,0         // vbroadcastss  0x774e(%rip),%ymm13        # 78bc <_sk_callback_avx+0x154>
+  .byte  196,98,125,24,37,135,119,0,0        // vbroadcastss  0x7787(%rip),%ymm12        # 78ec <_sk_callback_avx+0x150>
+  .byte  196,98,125,24,45,130,119,0,0        // vbroadcastss  0x7782(%rip),%ymm13        # 78f0 <_sk_callback_avx+0x154>
   .byte  196,65,44,84,245                    // vandps        %ymm13,%ymm10,%ymm14
   .byte  196,193,1,114,246,2                 // vpslld        $0x2,%xmm14,%xmm15
   .byte  196,67,125,25,246,1                 // vextractf128  $0x1,%ymm14,%xmm14
@@ -17867,9 +17938,9 @@
   .byte  196,65,60,86,193                    // vorps         %ymm9,%ymm8,%ymm8
   .byte  196,65,60,86,194                    // vorps         %ymm10,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,185,118,0,0        // vbroadcastss  0x76b9(%rip),%ymm9        # 78c0 <_sk_callback_avx+0x158>
+  .byte  196,98,125,24,13,237,118,0,0        // vbroadcastss  0x76ed(%rip),%ymm9        # 78f4 <_sk_callback_avx+0x158>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
-  .byte  196,98,125,24,13,175,118,0,0        // vbroadcastss  0x76af(%rip),%ymm9        # 78c4 <_sk_callback_avx+0x15c>
+  .byte  196,98,125,24,13,227,118,0,0        // vbroadcastss  0x76e3(%rip),%ymm9        # 78f8 <_sk_callback_avx+0x15c>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  196,98,125,24,8                     // vbroadcastss  (%rax),%ymm9
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
@@ -17886,10 +17957,10 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
-HIDDEN _sk_constant_color_avx
-.globl _sk_constant_color_avx
-FUNCTION(_sk_constant_color_avx)
-_sk_constant_color_avx:
+HIDDEN _sk_uniform_color_avx
+.globl _sk_uniform_color_avx
+FUNCTION(_sk_uniform_color_avx)
+_sk_uniform_color_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  196,226,125,24,0                    // vbroadcastss  (%rax),%ymm0
   .byte  196,226,125,24,72,4                 // vbroadcastss  0x4(%rax),%ymm1
@@ -17898,6 +17969,28 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
+HIDDEN _sk_black_color_avx
+.globl _sk_black_color_avx
+FUNCTION(_sk_black_color_avx)
+_sk_black_color_avx:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  196,226,125,24,29,131,118,0,0       // vbroadcastss  0x7683(%rip),%ymm3        # 78fc <_sk_callback_avx+0x160>
+  .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
+  .byte  197,244,87,201                      // vxorps        %ymm1,%ymm1,%ymm1
+  .byte  197,236,87,210                      // vxorps        %ymm2,%ymm2,%ymm2
+  .byte  255,224                             // jmpq          *%rax
+
+HIDDEN _sk_white_color_avx
+.globl _sk_white_color_avx
+FUNCTION(_sk_white_color_avx)
+_sk_white_color_avx:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  196,226,125,24,5,110,118,0,0        // vbroadcastss  0x766e(%rip),%ymm0        # 7900 <_sk_callback_avx+0x164>
+  .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
+  .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
+  .byte  197,252,40,216                      // vmovaps       %ymm0,%ymm3
+  .byte  255,224                             // jmpq          *%rax
+
 HIDDEN _sk_load_rgba_avx
 .globl _sk_load_rgba_avx
 FUNCTION(_sk_load_rgba_avx)
@@ -17938,7 +18031,7 @@
 FUNCTION(_sk_srcatop_avx)
 _sk_srcatop_avx:
   .byte  197,252,89,199                      // vmulps        %ymm7,%ymm0,%ymm0
-  .byte  196,98,125,24,5,7,118,0,0           // vbroadcastss  0x7607(%rip),%ymm8        # 78c8 <_sk_callback_avx+0x160>
+  .byte  196,98,125,24,5,17,118,0,0          // vbroadcastss  0x7611(%rip),%ymm8        # 7904 <_sk_callback_avx+0x168>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,204                       // vmulps        %ymm4,%ymm8,%ymm9
   .byte  197,180,88,192                      // vaddps        %ymm0,%ymm9,%ymm0
@@ -17959,7 +18052,7 @@
 FUNCTION(_sk_dstatop_avx)
 _sk_dstatop_avx:
   .byte  197,100,89,196                      // vmulps        %ymm4,%ymm3,%ymm8
-  .byte  196,98,125,24,13,201,117,0,0        // vbroadcastss  0x75c9(%rip),%ymm9        # 78cc <_sk_callback_avx+0x164>
+  .byte  196,98,125,24,13,211,117,0,0        // vbroadcastss  0x75d3(%rip),%ymm9        # 7908 <_sk_callback_avx+0x16c>
   .byte  197,52,92,207                       // vsubps        %ymm7,%ymm9,%ymm9
   .byte  197,180,89,192                      // vmulps        %ymm0,%ymm9,%ymm0
   .byte  197,188,88,192                      // vaddps        %ymm0,%ymm8,%ymm0
@@ -18001,7 +18094,7 @@
 .globl _sk_srcout_avx
 FUNCTION(_sk_srcout_avx)
 _sk_srcout_avx:
-  .byte  196,98,125,24,5,104,117,0,0         // vbroadcastss  0x7568(%rip),%ymm8        # 78d0 <_sk_callback_avx+0x168>
+  .byte  196,98,125,24,5,114,117,0,0         // vbroadcastss  0x7572(%rip),%ymm8        # 790c <_sk_callback_avx+0x170>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
@@ -18014,7 +18107,7 @@
 .globl _sk_dstout_avx
 FUNCTION(_sk_dstout_avx)
 _sk_dstout_avx:
-  .byte  196,226,125,24,5,75,117,0,0         // vbroadcastss  0x754b(%rip),%ymm0        # 78d4 <_sk_callback_avx+0x16c>
+  .byte  196,226,125,24,5,85,117,0,0         // vbroadcastss  0x7555(%rip),%ymm0        # 7910 <_sk_callback_avx+0x174>
   .byte  197,252,92,219                      // vsubps        %ymm3,%ymm0,%ymm3
   .byte  197,228,89,196                      // vmulps        %ymm4,%ymm3,%ymm0
   .byte  197,228,89,205                      // vmulps        %ymm5,%ymm3,%ymm1
@@ -18027,7 +18120,7 @@
 .globl _sk_srcover_avx
 FUNCTION(_sk_srcover_avx)
 _sk_srcover_avx:
-  .byte  196,98,125,24,5,46,117,0,0          // vbroadcastss  0x752e(%rip),%ymm8        # 78d8 <_sk_callback_avx+0x170>
+  .byte  196,98,125,24,5,56,117,0,0          // vbroadcastss  0x7538(%rip),%ymm8        # 7914 <_sk_callback_avx+0x178>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,204                       // vmulps        %ymm4,%ymm8,%ymm9
   .byte  197,180,88,192                      // vaddps        %ymm0,%ymm9,%ymm0
@@ -18044,7 +18137,7 @@
 .globl _sk_dstover_avx
 FUNCTION(_sk_dstover_avx)
 _sk_dstover_avx:
-  .byte  196,98,125,24,5,1,117,0,0           // vbroadcastss  0x7501(%rip),%ymm8        # 78dc <_sk_callback_avx+0x174>
+  .byte  196,98,125,24,5,11,117,0,0          // vbroadcastss  0x750b(%rip),%ymm8        # 7918 <_sk_callback_avx+0x17c>
   .byte  197,60,92,199                       // vsubps        %ymm7,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,252,88,196                      // vaddps        %ymm4,%ymm0,%ymm0
@@ -18072,7 +18165,7 @@
 .globl _sk_multiply_avx
 FUNCTION(_sk_multiply_avx)
 _sk_multiply_avx:
-  .byte  196,98,125,24,5,192,116,0,0         // vbroadcastss  0x74c0(%rip),%ymm8        # 78e0 <_sk_callback_avx+0x178>
+  .byte  196,98,125,24,5,202,116,0,0         // vbroadcastss  0x74ca(%rip),%ymm8        # 791c <_sk_callback_avx+0x180>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,52,89,208                       // vmulps        %ymm0,%ymm9,%ymm10
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -18132,7 +18225,7 @@
 .globl _sk_xor__avx
 FUNCTION(_sk_xor__avx)
 _sk_xor__avx:
-  .byte  196,98,125,24,5,15,116,0,0          // vbroadcastss  0x740f(%rip),%ymm8        # 78e4 <_sk_callback_avx+0x17c>
+  .byte  196,98,125,24,5,25,116,0,0          // vbroadcastss  0x7419(%rip),%ymm8        # 7920 <_sk_callback_avx+0x184>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,180,89,192                      // vmulps        %ymm0,%ymm9,%ymm0
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -18169,7 +18262,7 @@
   .byte  197,100,89,206                      // vmulps        %ymm6,%ymm3,%ymm9
   .byte  196,193,108,95,209                  // vmaxps        %ymm9,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,143,115,0,0         // vbroadcastss  0x738f(%rip),%ymm8        # 78e8 <_sk_callback_avx+0x180>
+  .byte  196,98,125,24,5,153,115,0,0         // vbroadcastss  0x7399(%rip),%ymm8        # 7924 <_sk_callback_avx+0x188>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,199                       // vmulps        %ymm7,%ymm8,%ymm8
   .byte  197,188,88,219                      // vaddps        %ymm3,%ymm8,%ymm3
@@ -18195,7 +18288,7 @@
   .byte  197,100,89,206                      // vmulps        %ymm6,%ymm3,%ymm9
   .byte  196,193,108,93,209                  // vminps        %ymm9,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,59,115,0,0          // vbroadcastss  0x733b(%rip),%ymm8        # 78ec <_sk_callback_avx+0x184>
+  .byte  196,98,125,24,5,69,115,0,0          // vbroadcastss  0x7345(%rip),%ymm8        # 7928 <_sk_callback_avx+0x18c>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,199                       // vmulps        %ymm7,%ymm8,%ymm8
   .byte  197,188,88,219                      // vaddps        %ymm3,%ymm8,%ymm3
@@ -18224,7 +18317,7 @@
   .byte  196,193,108,93,209                  // vminps        %ymm9,%ymm2,%ymm2
   .byte  197,236,88,210                      // vaddps        %ymm2,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,219,114,0,0         // vbroadcastss  0x72db(%rip),%ymm8        # 78f0 <_sk_callback_avx+0x188>
+  .byte  196,98,125,24,5,229,114,0,0         // vbroadcastss  0x72e5(%rip),%ymm8        # 792c <_sk_callback_avx+0x190>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,199                       // vmulps        %ymm7,%ymm8,%ymm8
   .byte  197,188,88,219                      // vaddps        %ymm3,%ymm8,%ymm3
@@ -18247,7 +18340,7 @@
   .byte  197,236,89,214                      // vmulps        %ymm6,%ymm2,%ymm2
   .byte  197,236,88,210                      // vaddps        %ymm2,%ymm2,%ymm2
   .byte  197,188,92,210                      // vsubps        %ymm2,%ymm8,%ymm2
-  .byte  196,98,125,24,5,150,114,0,0         // vbroadcastss  0x7296(%rip),%ymm8        # 78f4 <_sk_callback_avx+0x18c>
+  .byte  196,98,125,24,5,160,114,0,0         // vbroadcastss  0x72a0(%rip),%ymm8        # 7930 <_sk_callback_avx+0x194>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
   .byte  197,60,89,199                       // vmulps        %ymm7,%ymm8,%ymm8
   .byte  197,188,88,219                      // vaddps        %ymm3,%ymm8,%ymm3
@@ -18258,7 +18351,7 @@
 .globl _sk_colorburn_avx
 FUNCTION(_sk_colorburn_avx)
 _sk_colorburn_avx:
-  .byte  196,98,125,24,5,129,114,0,0         // vbroadcastss  0x7281(%rip),%ymm8        # 78f8 <_sk_callback_avx+0x190>
+  .byte  196,98,125,24,5,139,114,0,0         // vbroadcastss  0x728b(%rip),%ymm8        # 7934 <_sk_callback_avx+0x198>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,52,89,216                       // vmulps        %ymm0,%ymm9,%ymm11
   .byte  196,65,44,87,210                    // vxorps        %ymm10,%ymm10,%ymm10
@@ -18320,7 +18413,7 @@
 FUNCTION(_sk_colordodge_avx)
 _sk_colordodge_avx:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
-  .byte  196,98,125,24,13,125,113,0,0        // vbroadcastss  0x717d(%rip),%ymm9        # 78fc <_sk_callback_avx+0x194>
+  .byte  196,98,125,24,13,135,113,0,0        // vbroadcastss  0x7187(%rip),%ymm9        # 7938 <_sk_callback_avx+0x19c>
   .byte  197,52,92,215                       // vsubps        %ymm7,%ymm9,%ymm10
   .byte  197,44,89,216                       // vmulps        %ymm0,%ymm10,%ymm11
   .byte  197,52,92,203                       // vsubps        %ymm3,%ymm9,%ymm9
@@ -18377,7 +18470,7 @@
 .globl _sk_hardlight_avx
 FUNCTION(_sk_hardlight_avx)
 _sk_hardlight_avx:
-  .byte  196,98,125,24,5,143,112,0,0         // vbroadcastss  0x708f(%rip),%ymm8        # 7900 <_sk_callback_avx+0x198>
+  .byte  196,98,125,24,5,153,112,0,0         // vbroadcastss  0x7099(%rip),%ymm8        # 793c <_sk_callback_avx+0x1a0>
   .byte  197,60,92,215                       // vsubps        %ymm7,%ymm8,%ymm10
   .byte  197,44,89,200                       // vmulps        %ymm0,%ymm10,%ymm9
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -18432,7 +18525,7 @@
 .globl _sk_overlay_avx
 FUNCTION(_sk_overlay_avx)
 _sk_overlay_avx:
-  .byte  196,98,125,24,5,184,111,0,0         // vbroadcastss  0x6fb8(%rip),%ymm8        # 7904 <_sk_callback_avx+0x19c>
+  .byte  196,98,125,24,5,194,111,0,0         // vbroadcastss  0x6fc2(%rip),%ymm8        # 7940 <_sk_callback_avx+0x1a4>
   .byte  197,60,92,215                       // vsubps        %ymm7,%ymm8,%ymm10
   .byte  197,44,89,200                       // vmulps        %ymm0,%ymm10,%ymm9
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -18498,10 +18591,10 @@
   .byte  196,65,60,88,192                    // vaddps        %ymm8,%ymm8,%ymm8
   .byte  196,65,60,89,216                    // vmulps        %ymm8,%ymm8,%ymm11
   .byte  196,65,60,88,195                    // vaddps        %ymm11,%ymm8,%ymm8
-  .byte  196,98,125,24,29,175,110,0,0        // vbroadcastss  0x6eaf(%rip),%ymm11        # 790c <_sk_callback_avx+0x1a4>
+  .byte  196,98,125,24,29,185,110,0,0        // vbroadcastss  0x6eb9(%rip),%ymm11        # 7948 <_sk_callback_avx+0x1ac>
   .byte  196,65,28,88,235                    // vaddps        %ymm11,%ymm12,%ymm13
   .byte  196,65,20,89,192                    // vmulps        %ymm8,%ymm13,%ymm8
-  .byte  196,98,125,24,45,160,110,0,0        // vbroadcastss  0x6ea0(%rip),%ymm13        # 7910 <_sk_callback_avx+0x1a8>
+  .byte  196,98,125,24,45,170,110,0,0        // vbroadcastss  0x6eaa(%rip),%ymm13        # 794c <_sk_callback_avx+0x1b0>
   .byte  196,65,28,89,245                    // vmulps        %ymm13,%ymm12,%ymm14
   .byte  196,65,12,88,192                    // vaddps        %ymm8,%ymm14,%ymm8
   .byte  196,65,124,82,244                   // vrsqrtps      %ymm12,%ymm14
@@ -18512,7 +18605,7 @@
   .byte  197,4,194,255,2                     // vcmpleps      %ymm7,%ymm15,%ymm15
   .byte  196,67,13,74,240,240                // vblendvps     %ymm15,%ymm8,%ymm14,%ymm14
   .byte  197,116,88,249                      // vaddps        %ymm1,%ymm1,%ymm15
-  .byte  196,98,125,24,5,94,110,0,0          // vbroadcastss  0x6e5e(%rip),%ymm8        # 7908 <_sk_callback_avx+0x1a0>
+  .byte  196,98,125,24,5,104,110,0,0         // vbroadcastss  0x6e68(%rip),%ymm8        # 7944 <_sk_callback_avx+0x1a8>
   .byte  196,65,60,92,228                    // vsubps        %ymm12,%ymm8,%ymm12
   .byte  197,132,92,195                      // vsubps        %ymm3,%ymm15,%ymm0
   .byte  196,65,124,89,228                   // vmulps        %ymm12,%ymm0,%ymm12
@@ -18639,12 +18732,12 @@
   .byte  196,65,28,89,219                    // vmulps        %ymm11,%ymm12,%ymm11
   .byte  196,65,36,94,222                    // vdivps        %ymm14,%ymm11,%ymm11
   .byte  196,67,37,74,224,240                // vblendvps     %ymm15,%ymm8,%ymm11,%ymm12
-  .byte  196,98,125,24,53,45,108,0,0         // vbroadcastss  0x6c2d(%rip),%ymm14        # 7914 <_sk_callback_avx+0x1ac>
+  .byte  196,98,125,24,53,55,108,0,0         // vbroadcastss  0x6c37(%rip),%ymm14        # 7950 <_sk_callback_avx+0x1b4>
   .byte  196,65,92,89,222                    // vmulps        %ymm14,%ymm4,%ymm11
-  .byte  196,98,125,24,61,35,108,0,0         // vbroadcastss  0x6c23(%rip),%ymm15        # 7918 <_sk_callback_avx+0x1b0>
+  .byte  196,98,125,24,61,45,108,0,0         // vbroadcastss  0x6c2d(%rip),%ymm15        # 7954 <_sk_callback_avx+0x1b8>
   .byte  196,65,84,89,239                    // vmulps        %ymm15,%ymm5,%ymm13
   .byte  196,65,36,88,221                    // vaddps        %ymm13,%ymm11,%ymm11
-  .byte  196,226,125,24,5,20,108,0,0         // vbroadcastss  0x6c14(%rip),%ymm0        # 791c <_sk_callback_avx+0x1b4>
+  .byte  196,226,125,24,5,30,108,0,0         // vbroadcastss  0x6c1e(%rip),%ymm0        # 7958 <_sk_callback_avx+0x1bc>
   .byte  197,76,89,232                       // vmulps        %ymm0,%ymm6,%ymm13
   .byte  196,65,36,88,221                    // vaddps        %ymm13,%ymm11,%ymm11
   .byte  196,65,52,89,238                    // vmulps        %ymm14,%ymm9,%ymm13
@@ -18705,7 +18798,7 @@
   .byte  196,65,36,95,208                    // vmaxps        %ymm8,%ymm11,%ymm10
   .byte  196,195,109,74,209,240              // vblendvps     %ymm15,%ymm9,%ymm2,%ymm2
   .byte  196,193,108,95,208                  // vmaxps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,237,106,0,0         // vbroadcastss  0x6aed(%rip),%ymm8        # 7920 <_sk_callback_avx+0x1b8>
+  .byte  196,98,125,24,5,247,106,0,0         // vbroadcastss  0x6af7(%rip),%ymm8        # 795c <_sk_callback_avx+0x1c0>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,180,89,201                      // vmulps        %ymm1,%ymm9,%ymm1
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -18762,12 +18855,12 @@
   .byte  196,65,28,89,219                    // vmulps        %ymm11,%ymm12,%ymm11
   .byte  196,65,36,94,222                    // vdivps        %ymm14,%ymm11,%ymm11
   .byte  196,67,37,74,224,240                // vblendvps     %ymm15,%ymm8,%ymm11,%ymm12
-  .byte  196,98,125,24,53,251,105,0,0        // vbroadcastss  0x69fb(%rip),%ymm14        # 7924 <_sk_callback_avx+0x1bc>
+  .byte  196,98,125,24,53,5,106,0,0          // vbroadcastss  0x6a05(%rip),%ymm14        # 7960 <_sk_callback_avx+0x1c4>
   .byte  196,65,92,89,222                    // vmulps        %ymm14,%ymm4,%ymm11
-  .byte  196,98,125,24,61,241,105,0,0        // vbroadcastss  0x69f1(%rip),%ymm15        # 7928 <_sk_callback_avx+0x1c0>
+  .byte  196,98,125,24,61,251,105,0,0        // vbroadcastss  0x69fb(%rip),%ymm15        # 7964 <_sk_callback_avx+0x1c8>
   .byte  196,65,84,89,239                    // vmulps        %ymm15,%ymm5,%ymm13
   .byte  196,65,36,88,221                    // vaddps        %ymm13,%ymm11,%ymm11
-  .byte  196,226,125,24,5,226,105,0,0        // vbroadcastss  0x69e2(%rip),%ymm0        # 792c <_sk_callback_avx+0x1c4>
+  .byte  196,226,125,24,5,236,105,0,0        // vbroadcastss  0x69ec(%rip),%ymm0        # 7968 <_sk_callback_avx+0x1cc>
   .byte  197,76,89,232                       // vmulps        %ymm0,%ymm6,%ymm13
   .byte  196,65,36,88,221                    // vaddps        %ymm13,%ymm11,%ymm11
   .byte  196,65,52,89,238                    // vmulps        %ymm14,%ymm9,%ymm13
@@ -18828,7 +18921,7 @@
   .byte  196,65,36,95,208                    // vmaxps        %ymm8,%ymm11,%ymm10
   .byte  196,195,109,74,209,240              // vblendvps     %ymm15,%ymm9,%ymm2,%ymm2
   .byte  196,193,108,95,208                  // vmaxps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,187,104,0,0         // vbroadcastss  0x68bb(%rip),%ymm8        # 7930 <_sk_callback_avx+0x1c8>
+  .byte  196,98,125,24,5,197,104,0,0         // vbroadcastss  0x68c5(%rip),%ymm8        # 796c <_sk_callback_avx+0x1d0>
   .byte  197,60,92,207                       // vsubps        %ymm7,%ymm8,%ymm9
   .byte  197,180,89,201                      // vmulps        %ymm1,%ymm9,%ymm1
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
@@ -18857,12 +18950,12 @@
   .byte  197,252,17,68,36,168                // vmovups       %ymm0,-0x58(%rsp)
   .byte  197,124,89,199                      // vmulps        %ymm7,%ymm0,%ymm8
   .byte  197,116,89,207                      // vmulps        %ymm7,%ymm1,%ymm9
-  .byte  196,98,125,24,45,81,104,0,0         // vbroadcastss  0x6851(%rip),%ymm13        # 7934 <_sk_callback_avx+0x1cc>
+  .byte  196,98,125,24,45,91,104,0,0         // vbroadcastss  0x685b(%rip),%ymm13        # 7970 <_sk_callback_avx+0x1d4>
   .byte  196,65,92,89,213                    // vmulps        %ymm13,%ymm4,%ymm10
-  .byte  196,98,125,24,53,71,104,0,0         // vbroadcastss  0x6847(%rip),%ymm14        # 7938 <_sk_callback_avx+0x1d0>
+  .byte  196,98,125,24,53,81,104,0,0         // vbroadcastss  0x6851(%rip),%ymm14        # 7974 <_sk_callback_avx+0x1d8>
   .byte  196,65,84,89,222                    // vmulps        %ymm14,%ymm5,%ymm11
   .byte  196,65,44,88,211                    // vaddps        %ymm11,%ymm10,%ymm10
-  .byte  196,98,125,24,61,56,104,0,0         // vbroadcastss  0x6838(%rip),%ymm15        # 793c <_sk_callback_avx+0x1d4>
+  .byte  196,98,125,24,61,66,104,0,0         // vbroadcastss  0x6842(%rip),%ymm15        # 7978 <_sk_callback_avx+0x1dc>
   .byte  196,65,76,89,223                    // vmulps        %ymm15,%ymm6,%ymm11
   .byte  196,193,44,88,195                   // vaddps        %ymm11,%ymm10,%ymm0
   .byte  196,65,60,89,221                    // vmulps        %ymm13,%ymm8,%ymm11
@@ -18925,7 +19018,7 @@
   .byte  196,65,44,95,207                    // vmaxps        %ymm15,%ymm10,%ymm9
   .byte  196,195,37,74,192,0                 // vblendvps     %ymm0,%ymm8,%ymm11,%ymm0
   .byte  196,65,124,95,199                   // vmaxps        %ymm15,%ymm0,%ymm8
-  .byte  196,226,125,24,5,255,102,0,0        // vbroadcastss  0x66ff(%rip),%ymm0        # 7940 <_sk_callback_avx+0x1d8>
+  .byte  196,226,125,24,5,9,103,0,0          // vbroadcastss  0x6709(%rip),%ymm0        # 797c <_sk_callback_avx+0x1e0>
   .byte  197,124,92,215                      // vsubps        %ymm7,%ymm0,%ymm10
   .byte  197,172,89,84,36,168                // vmulps        -0x58(%rsp),%ymm10,%ymm2
   .byte  197,124,92,219                      // vsubps        %ymm3,%ymm0,%ymm11
@@ -18955,12 +19048,12 @@
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
   .byte  197,100,89,196                      // vmulps        %ymm4,%ymm3,%ymm8
   .byte  197,100,89,205                      // vmulps        %ymm5,%ymm3,%ymm9
-  .byte  196,98,125,24,45,145,102,0,0        // vbroadcastss  0x6691(%rip),%ymm13        # 7944 <_sk_callback_avx+0x1dc>
+  .byte  196,98,125,24,45,155,102,0,0        // vbroadcastss  0x669b(%rip),%ymm13        # 7980 <_sk_callback_avx+0x1e4>
   .byte  196,65,108,89,213                   // vmulps        %ymm13,%ymm2,%ymm10
-  .byte  196,98,125,24,53,135,102,0,0        // vbroadcastss  0x6687(%rip),%ymm14        # 7948 <_sk_callback_avx+0x1e0>
+  .byte  196,98,125,24,53,145,102,0,0        // vbroadcastss  0x6691(%rip),%ymm14        # 7984 <_sk_callback_avx+0x1e8>
   .byte  196,65,116,89,222                   // vmulps        %ymm14,%ymm1,%ymm11
   .byte  196,65,44,88,211                    // vaddps        %ymm11,%ymm10,%ymm10
-  .byte  196,98,125,24,61,120,102,0,0        // vbroadcastss  0x6678(%rip),%ymm15        # 794c <_sk_callback_avx+0x1e4>
+  .byte  196,98,125,24,61,130,102,0,0        // vbroadcastss  0x6682(%rip),%ymm15        # 7988 <_sk_callback_avx+0x1ec>
   .byte  196,65,28,89,223                    // vmulps        %ymm15,%ymm12,%ymm11
   .byte  196,193,44,88,195                   // vaddps        %ymm11,%ymm10,%ymm0
   .byte  196,65,60,89,221                    // vmulps        %ymm13,%ymm8,%ymm11
@@ -19023,7 +19116,7 @@
   .byte  196,65,44,95,207                    // vmaxps        %ymm15,%ymm10,%ymm9
   .byte  196,195,37,74,192,0                 // vblendvps     %ymm0,%ymm8,%ymm11,%ymm0
   .byte  196,65,124,95,199                   // vmaxps        %ymm15,%ymm0,%ymm8
-  .byte  196,226,125,24,5,63,101,0,0         // vbroadcastss  0x653f(%rip),%ymm0        # 7950 <_sk_callback_avx+0x1e8>
+  .byte  196,226,125,24,5,73,101,0,0         // vbroadcastss  0x6549(%rip),%ymm0        # 798c <_sk_callback_avx+0x1f0>
   .byte  197,124,92,215                      // vsubps        %ymm7,%ymm0,%ymm10
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  197,124,92,219                      // vsubps        %ymm3,%ymm0,%ymm11
@@ -19052,9 +19145,9 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,43,1,0,0                     // jne           15a0 <_sk_srcover_rgba_8888_avx+0x144>
+  .byte  15,133,43,1,0,0                     // jne           15d2 <_sk_srcover_rgba_8888_avx+0x144>
   .byte  196,193,124,16,58                   // vmovups       (%r10),%ymm7
-  .byte  197,124,40,13,190,106,0,0           // vmovaps       0x6abe(%rip),%ymm9        # 7f40 <_sk_callback_avx+0x7d8>
+  .byte  197,124,40,13,204,106,0,0           // vmovaps       0x6acc(%rip),%ymm9        # 7f80 <_sk_callback_avx+0x7e4>
   .byte  196,193,68,84,225                   // vandps        %ymm9,%ymm7,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
   .byte  197,209,114,215,8                   // vpsrld        $0x8,%xmm7,%xmm5
@@ -19072,9 +19165,9 @@
   .byte  196,193,65,114,208,24               // vpsrld        $0x18,%xmm8,%xmm7
   .byte  196,227,53,24,255,1                 // vinsertf128   $0x1,%xmm7,%ymm9,%ymm7
   .byte  197,252,91,255                      // vcvtdq2ps     %ymm7,%ymm7
-  .byte  196,98,125,24,5,113,100,0,0         // vbroadcastss  0x6471(%rip),%ymm8        # 7954 <_sk_callback_avx+0x1ec>
+  .byte  196,98,125,24,5,123,100,0,0         // vbroadcastss  0x647b(%rip),%ymm8        # 7990 <_sk_callback_avx+0x1f4>
   .byte  197,60,92,195                       // vsubps        %ymm3,%ymm8,%ymm8
-  .byte  196,98,125,24,13,104,100,0,0        // vbroadcastss  0x6468(%rip),%ymm9        # 7958 <_sk_callback_avx+0x1f0>
+  .byte  196,98,125,24,13,114,100,0,0        // vbroadcastss  0x6472(%rip),%ymm9        # 7994 <_sk_callback_avx+0x1f8>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  197,60,89,212                       // vmulps        %ymm4,%ymm8,%ymm10
   .byte  196,193,124,88,194                  // vaddps        %ymm10,%ymm0,%ymm0
@@ -19107,7 +19200,7 @@
   .byte  196,65,53,86,202                    // vorpd         %ymm10,%ymm9,%ymm9
   .byte  196,65,61,86,193                    // vorpd         %ymm9,%ymm8,%ymm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,87                              // jne           15eb <_sk_srcover_rgba_8888_avx+0x18f>
+  .byte  117,87                              // jne           161d <_sk_srcover_rgba_8888_avx+0x18f>
   .byte  196,65,124,17,2                     // vmovups       %ymm8,(%r10)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,201                          // mov           %r9,%rcx
@@ -19119,13 +19212,13 @@
   .byte  72,211,232                          // shr           %cl,%rax
   .byte  196,225,249,110,224                 // vmovq         %rax,%xmm4
   .byte  196,226,121,48,228                  // vpmovzxbw     %xmm4,%xmm4
-  .byte  196,226,89,0,45,200,103,0,0         // vpshufb       0x67c8(%rip),%xmm4,%xmm5        # 7d90 <_sk_callback_avx+0x628>
+  .byte  196,226,89,0,45,214,103,0,0         // vpshufb       0x67d6(%rip),%xmm4,%xmm5        # 7dd0 <_sk_callback_avx+0x634>
   .byte  196,226,121,33,237                  // vpmovsxbd     %xmm5,%xmm5
-  .byte  196,226,89,0,37,202,103,0,0         // vpshufb       0x67ca(%rip),%xmm4,%xmm4        # 7da0 <_sk_callback_avx+0x638>
+  .byte  196,226,89,0,37,216,103,0,0         // vpshufb       0x67d8(%rip),%xmm4,%xmm4        # 7de0 <_sk_callback_avx+0x644>
   .byte  196,226,121,33,228                  // vpmovsxbd     %xmm4,%xmm4
   .byte  196,227,85,24,228,1                 // vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
   .byte  196,194,93,44,58                    // vmaskmovps    (%r10),%ymm4,%ymm7
-  .byte  233,143,254,255,255                 // jmpq          147a <_sk_srcover_rgba_8888_avx+0x1e>
+  .byte  233,143,254,255,255                 // jmpq          14ac <_sk_srcover_rgba_8888_avx+0x1e>
   .byte  185,8,0,0,0                         // mov           $0x8,%ecx
   .byte  68,41,193                           // sub           %r8d,%ecx
   .byte  192,225,3                           // shl           $0x3,%cl
@@ -19133,13 +19226,13 @@
   .byte  72,211,232                          // shr           %cl,%rax
   .byte  196,97,249,110,200                  // vmovq         %rax,%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
-  .byte  196,98,49,0,21,125,103,0,0          // vpshufb       0x677d(%rip),%xmm9,%xmm10        # 7d90 <_sk_callback_avx+0x628>
+  .byte  196,98,49,0,21,139,103,0,0          // vpshufb       0x678b(%rip),%xmm9,%xmm10        # 7dd0 <_sk_callback_avx+0x634>
   .byte  196,66,121,33,210                   // vpmovsxbd     %xmm10,%xmm10
-  .byte  196,98,49,0,13,127,103,0,0          // vpshufb       0x677f(%rip),%xmm9,%xmm9        # 7da0 <_sk_callback_avx+0x638>
+  .byte  196,98,49,0,13,141,103,0,0          // vpshufb       0x678d(%rip),%xmm9,%xmm9        # 7de0 <_sk_callback_avx+0x644>
   .byte  196,66,121,33,201                   // vpmovsxbd     %xmm9,%xmm9
   .byte  196,67,45,24,201,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
   .byte  196,66,53,46,2                      // vmaskmovps    %ymm8,%ymm9,(%r10)
-  .byte  233,99,255,255,255                  // jmpq          1599 <_sk_srcover_rgba_8888_avx+0x13d>
+  .byte  233,99,255,255,255                  // jmpq          15cb <_sk_srcover_rgba_8888_avx+0x13d>
 
 HIDDEN _sk_clamp_0_avx
 .globl _sk_clamp_0_avx
@@ -19157,7 +19250,7 @@
 .globl _sk_clamp_1_avx
 FUNCTION(_sk_clamp_1_avx)
 _sk_clamp_1_avx:
-  .byte  196,98,125,24,5,0,99,0,0            // vbroadcastss  0x6300(%rip),%ymm8        # 795c <_sk_callback_avx+0x1f4>
+  .byte  196,98,125,24,5,10,99,0,0           // vbroadcastss  0x630a(%rip),%ymm8        # 7998 <_sk_callback_avx+0x1fc>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  196,193,116,93,200                  // vminps        %ymm8,%ymm1,%ymm1
   .byte  196,193,108,93,208                  // vminps        %ymm8,%ymm2,%ymm2
@@ -19169,7 +19262,7 @@
 .globl _sk_clamp_a_avx
 FUNCTION(_sk_clamp_a_avx)
 _sk_clamp_a_avx:
-  .byte  196,98,125,24,5,227,98,0,0          // vbroadcastss  0x62e3(%rip),%ymm8        # 7960 <_sk_callback_avx+0x1f8>
+  .byte  196,98,125,24,5,237,98,0,0          // vbroadcastss  0x62ed(%rip),%ymm8        # 799c <_sk_callback_avx+0x200>
   .byte  196,193,100,93,216                  // vminps        %ymm8,%ymm3,%ymm3
   .byte  197,252,93,195                      // vminps        %ymm3,%ymm0,%ymm0
   .byte  197,244,93,203                      // vminps        %ymm3,%ymm1,%ymm1
@@ -19181,7 +19274,7 @@
 .globl _sk_clamp_a_dst_avx
 FUNCTION(_sk_clamp_a_dst_avx)
 _sk_clamp_a_dst_avx:
-  .byte  196,98,125,24,5,201,98,0,0          // vbroadcastss  0x62c9(%rip),%ymm8        # 7964 <_sk_callback_avx+0x1fc>
+  .byte  196,98,125,24,5,211,98,0,0          // vbroadcastss  0x62d3(%rip),%ymm8        # 79a0 <_sk_callback_avx+0x204>
   .byte  196,193,68,93,248                   // vminps        %ymm8,%ymm7,%ymm7
   .byte  197,220,93,231                      // vminps        %ymm7,%ymm4,%ymm4
   .byte  197,212,93,239                      // vminps        %ymm7,%ymm5,%ymm5
@@ -19248,7 +19341,7 @@
 _sk_unpremul_avx:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,65,100,194,200,0                // vcmpeqps      %ymm8,%ymm3,%ymm9
-  .byte  196,98,125,24,21,69,98,0,0          // vbroadcastss  0x6245(%rip),%ymm10        # 7968 <_sk_callback_avx+0x200>
+  .byte  196,98,125,24,21,79,98,0,0          // vbroadcastss  0x624f(%rip),%ymm10        # 79a4 <_sk_callback_avx+0x208>
   .byte  197,44,94,211                       // vdivps        %ymm3,%ymm10,%ymm10
   .byte  196,67,45,74,192,144                // vblendvps     %ymm9,%ymm8,%ymm10,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
@@ -19261,17 +19354,17 @@
 .globl _sk_from_srgb_avx
 FUNCTION(_sk_from_srgb_avx)
 _sk_from_srgb_avx:
-  .byte  196,98,125,24,5,38,98,0,0           // vbroadcastss  0x6226(%rip),%ymm8        # 796c <_sk_callback_avx+0x204>
+  .byte  196,98,125,24,5,48,98,0,0           // vbroadcastss  0x6230(%rip),%ymm8        # 79a8 <_sk_callback_avx+0x20c>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  197,124,89,208                      // vmulps        %ymm0,%ymm0,%ymm10
-  .byte  196,98,125,24,29,24,98,0,0          // vbroadcastss  0x6218(%rip),%ymm11        # 7970 <_sk_callback_avx+0x208>
+  .byte  196,98,125,24,29,34,98,0,0          // vbroadcastss  0x6222(%rip),%ymm11        # 79ac <_sk_callback_avx+0x210>
   .byte  196,65,124,89,227                   // vmulps        %ymm11,%ymm0,%ymm12
-  .byte  196,98,125,24,45,14,98,0,0          // vbroadcastss  0x620e(%rip),%ymm13        # 7974 <_sk_callback_avx+0x20c>
+  .byte  196,98,125,24,45,24,98,0,0          // vbroadcastss  0x6218(%rip),%ymm13        # 79b0 <_sk_callback_avx+0x214>
   .byte  196,65,28,88,229                    // vaddps        %ymm13,%ymm12,%ymm12
   .byte  196,65,44,89,212                    // vmulps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,255,97,0,0         // vbroadcastss  0x61ff(%rip),%ymm12        # 7978 <_sk_callback_avx+0x210>
+  .byte  196,98,125,24,37,9,98,0,0           // vbroadcastss  0x6209(%rip),%ymm12        # 79b4 <_sk_callback_avx+0x218>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,53,245,97,0,0         // vbroadcastss  0x61f5(%rip),%ymm14        # 797c <_sk_callback_avx+0x214>
+  .byte  196,98,125,24,53,255,97,0,0         // vbroadcastss  0x61ff(%rip),%ymm14        # 79b8 <_sk_callback_avx+0x21c>
   .byte  196,193,124,194,198,1               // vcmpltps      %ymm14,%ymm0,%ymm0
   .byte  196,195,45,74,193,0                 // vblendvps     %ymm0,%ymm9,%ymm10,%ymm0
   .byte  196,65,116,89,200                   // vmulps        %ymm8,%ymm1,%ymm9
@@ -19297,17 +19390,17 @@
 .globl _sk_from_srgb_dst_avx
 FUNCTION(_sk_from_srgb_dst_avx)
 _sk_from_srgb_dst_avx:
-  .byte  196,98,125,24,5,142,97,0,0          // vbroadcastss  0x618e(%rip),%ymm8        # 7980 <_sk_callback_avx+0x218>
+  .byte  196,98,125,24,5,152,97,0,0          // vbroadcastss  0x6198(%rip),%ymm8        # 79bc <_sk_callback_avx+0x220>
   .byte  196,65,92,89,200                    // vmulps        %ymm8,%ymm4,%ymm9
   .byte  197,92,89,212                       // vmulps        %ymm4,%ymm4,%ymm10
-  .byte  196,98,125,24,29,128,97,0,0         // vbroadcastss  0x6180(%rip),%ymm11        # 7984 <_sk_callback_avx+0x21c>
+  .byte  196,98,125,24,29,138,97,0,0         // vbroadcastss  0x618a(%rip),%ymm11        # 79c0 <_sk_callback_avx+0x224>
   .byte  196,65,92,89,227                    // vmulps        %ymm11,%ymm4,%ymm12
-  .byte  196,98,125,24,45,118,97,0,0         // vbroadcastss  0x6176(%rip),%ymm13        # 7988 <_sk_callback_avx+0x220>
+  .byte  196,98,125,24,45,128,97,0,0         // vbroadcastss  0x6180(%rip),%ymm13        # 79c4 <_sk_callback_avx+0x228>
   .byte  196,65,28,88,229                    // vaddps        %ymm13,%ymm12,%ymm12
   .byte  196,65,44,89,212                    // vmulps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,37,103,97,0,0         // vbroadcastss  0x6167(%rip),%ymm12        # 798c <_sk_callback_avx+0x224>
+  .byte  196,98,125,24,37,113,97,0,0         // vbroadcastss  0x6171(%rip),%ymm12        # 79c8 <_sk_callback_avx+0x22c>
   .byte  196,65,44,88,212                    // vaddps        %ymm12,%ymm10,%ymm10
-  .byte  196,98,125,24,53,93,97,0,0          // vbroadcastss  0x615d(%rip),%ymm14        # 7990 <_sk_callback_avx+0x228>
+  .byte  196,98,125,24,53,103,97,0,0         // vbroadcastss  0x6167(%rip),%ymm14        # 79cc <_sk_callback_avx+0x230>
   .byte  196,193,92,194,230,1                // vcmpltps      %ymm14,%ymm4,%ymm4
   .byte  196,195,45,74,225,64                // vblendvps     %ymm4,%ymm9,%ymm10,%ymm4
   .byte  196,65,84,89,200                    // vmulps        %ymm8,%ymm5,%ymm9
@@ -19334,20 +19427,20 @@
 FUNCTION(_sk_to_srgb_avx)
 _sk_to_srgb_avx:
   .byte  197,124,82,200                      // vrsqrtps      %ymm0,%ymm9
-  .byte  196,98,125,24,5,242,96,0,0          // vbroadcastss  0x60f2(%rip),%ymm8        # 7994 <_sk_callback_avx+0x22c>
+  .byte  196,98,125,24,5,252,96,0,0          // vbroadcastss  0x60fc(%rip),%ymm8        # 79d0 <_sk_callback_avx+0x234>
   .byte  196,65,124,89,208                   // vmulps        %ymm8,%ymm0,%ymm10
-  .byte  196,98,125,24,29,232,96,0,0         // vbroadcastss  0x60e8(%rip),%ymm11        # 7998 <_sk_callback_avx+0x230>
+  .byte  196,98,125,24,29,242,96,0,0         // vbroadcastss  0x60f2(%rip),%ymm11        # 79d4 <_sk_callback_avx+0x238>
   .byte  196,65,52,89,227                    // vmulps        %ymm11,%ymm9,%ymm12
-  .byte  196,98,125,24,45,222,96,0,0         // vbroadcastss  0x60de(%rip),%ymm13        # 799c <_sk_callback_avx+0x234>
+  .byte  196,98,125,24,45,232,96,0,0         // vbroadcastss  0x60e8(%rip),%ymm13        # 79d8 <_sk_callback_avx+0x23c>
   .byte  196,65,28,88,229                    // vaddps        %ymm13,%ymm12,%ymm12
   .byte  196,65,52,89,228                    // vmulps        %ymm12,%ymm9,%ymm12
-  .byte  196,98,125,24,53,207,96,0,0         // vbroadcastss  0x60cf(%rip),%ymm14        # 79a0 <_sk_callback_avx+0x238>
+  .byte  196,98,125,24,53,217,96,0,0         // vbroadcastss  0x60d9(%rip),%ymm14        # 79dc <_sk_callback_avx+0x240>
   .byte  196,65,28,88,230                    // vaddps        %ymm14,%ymm12,%ymm12
-  .byte  196,98,125,24,61,197,96,0,0         // vbroadcastss  0x60c5(%rip),%ymm15        # 79a4 <_sk_callback_avx+0x23c>
+  .byte  196,98,125,24,61,207,96,0,0         // vbroadcastss  0x60cf(%rip),%ymm15        # 79e0 <_sk_callback_avx+0x244>
   .byte  196,65,52,88,207                    // vaddps        %ymm15,%ymm9,%ymm9
   .byte  196,65,124,83,201                   // vrcpps        %ymm9,%ymm9
   .byte  196,65,52,89,204                    // vmulps        %ymm12,%ymm9,%ymm9
-  .byte  196,98,125,24,37,177,96,0,0         // vbroadcastss  0x60b1(%rip),%ymm12        # 79a8 <_sk_callback_avx+0x240>
+  .byte  196,98,125,24,37,187,96,0,0         // vbroadcastss  0x60bb(%rip),%ymm12        # 79e4 <_sk_callback_avx+0x248>
   .byte  196,193,124,194,196,1               // vcmpltps      %ymm12,%ymm0,%ymm0
   .byte  196,195,53,74,194,0                 // vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   .byte  197,124,82,201                      // vrsqrtps      %ymm1,%ymm9
@@ -19384,7 +19477,7 @@
   .byte  197,124,93,201                      // vminps        %ymm1,%ymm0,%ymm9
   .byte  197,52,93,202                       // vminps        %ymm2,%ymm9,%ymm9
   .byte  196,65,60,92,209                    // vsubps        %ymm9,%ymm8,%ymm10
-  .byte  196,98,125,24,29,23,96,0,0          // vbroadcastss  0x6017(%rip),%ymm11        # 79ac <_sk_callback_avx+0x244>
+  .byte  196,98,125,24,29,33,96,0,0          // vbroadcastss  0x6021(%rip),%ymm11        # 79e8 <_sk_callback_avx+0x24c>
   .byte  196,65,36,94,218                    // vdivps        %ymm10,%ymm11,%ymm11
   .byte  197,116,92,226                      // vsubps        %ymm2,%ymm1,%ymm12
   .byte  196,65,28,89,227                    // vmulps        %ymm11,%ymm12,%ymm12
@@ -19394,19 +19487,19 @@
   .byte  196,193,108,89,211                  // vmulps        %ymm11,%ymm2,%ymm2
   .byte  197,252,92,201                      // vsubps        %ymm1,%ymm0,%ymm1
   .byte  196,193,116,89,203                  // vmulps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,240,95,0,0         // vbroadcastss  0x5ff0(%rip),%ymm11        # 79b8 <_sk_callback_avx+0x250>
+  .byte  196,98,125,24,29,250,95,0,0         // vbroadcastss  0x5ffa(%rip),%ymm11        # 79f4 <_sk_callback_avx+0x258>
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,222,95,0,0         // vbroadcastss  0x5fde(%rip),%ymm11        # 79b4 <_sk_callback_avx+0x24c>
+  .byte  196,98,125,24,29,232,95,0,0         // vbroadcastss  0x5fe8(%rip),%ymm11        # 79f0 <_sk_callback_avx+0x254>
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
   .byte  196,227,117,74,202,224              // vblendvps     %ymm14,%ymm2,%ymm1,%ymm1
-  .byte  196,226,125,24,21,198,95,0,0        // vbroadcastss  0x5fc6(%rip),%ymm2        # 79b0 <_sk_callback_avx+0x248>
+  .byte  196,226,125,24,21,208,95,0,0        // vbroadcastss  0x5fd0(%rip),%ymm2        # 79ec <_sk_callback_avx+0x250>
   .byte  196,65,12,87,246                    // vxorps        %ymm14,%ymm14,%ymm14
   .byte  196,227,13,74,210,208               // vblendvps     %ymm13,%ymm2,%ymm14,%ymm2
   .byte  197,188,194,192,0                   // vcmpeqps      %ymm0,%ymm8,%ymm0
   .byte  196,193,108,88,212                  // vaddps        %ymm12,%ymm2,%ymm2
   .byte  196,227,117,74,194,0                // vblendvps     %ymm0,%ymm2,%ymm1,%ymm0
   .byte  196,193,60,88,201                   // vaddps        %ymm9,%ymm8,%ymm1
-  .byte  196,98,125,24,37,173,95,0,0         // vbroadcastss  0x5fad(%rip),%ymm12        # 79c0 <_sk_callback_avx+0x258>
+  .byte  196,98,125,24,37,183,95,0,0         // vbroadcastss  0x5fb7(%rip),%ymm12        # 79fc <_sk_callback_avx+0x260>
   .byte  196,193,116,89,212                  // vmulps        %ymm12,%ymm1,%ymm2
   .byte  197,28,194,226,1                    // vcmpltps      %ymm2,%ymm12,%ymm12
   .byte  196,65,36,92,216                    // vsubps        %ymm8,%ymm11,%ymm11
@@ -19416,7 +19509,7 @@
   .byte  197,172,94,201                      // vdivps        %ymm1,%ymm10,%ymm1
   .byte  196,195,125,74,198,128              // vblendvps     %ymm8,%ymm14,%ymm0,%ymm0
   .byte  196,195,117,74,206,128              // vblendvps     %ymm8,%ymm14,%ymm1,%ymm1
-  .byte  196,98,125,24,5,112,95,0,0          // vbroadcastss  0x5f70(%rip),%ymm8        # 79bc <_sk_callback_avx+0x254>
+  .byte  196,98,125,24,5,122,95,0,0          // vbroadcastss  0x5f7a(%rip),%ymm8        # 79f8 <_sk_callback_avx+0x25c>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -19433,7 +19526,7 @@
   .byte  197,252,17,92,36,128                // vmovups       %ymm3,-0x80(%rsp)
   .byte  197,252,40,225                      // vmovaps       %ymm1,%ymm4
   .byte  197,252,40,216                      // vmovaps       %ymm0,%ymm3
-  .byte  196,98,125,24,5,61,95,0,0           // vbroadcastss  0x5f3d(%rip),%ymm8        # 79c4 <_sk_callback_avx+0x25c>
+  .byte  196,98,125,24,5,71,95,0,0           // vbroadcastss  0x5f47(%rip),%ymm8        # 7a00 <_sk_callback_avx+0x264>
   .byte  197,60,194,202,2                    // vcmpleps      %ymm2,%ymm8,%ymm9
   .byte  197,92,89,210                       // vmulps        %ymm2,%ymm4,%ymm10
   .byte  196,65,92,92,218                    // vsubps        %ymm10,%ymm4,%ymm11
@@ -19441,23 +19534,23 @@
   .byte  197,52,88,210                       // vaddps        %ymm2,%ymm9,%ymm10
   .byte  197,108,88,202                      // vaddps        %ymm2,%ymm2,%ymm9
   .byte  196,65,52,92,202                    // vsubps        %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,24,29,23,95,0,0          // vbroadcastss  0x5f17(%rip),%ymm11        # 79c8 <_sk_callback_avx+0x260>
+  .byte  196,98,125,24,29,33,95,0,0          // vbroadcastss  0x5f21(%rip),%ymm11        # 7a04 <_sk_callback_avx+0x268>
   .byte  196,65,100,88,219                   // vaddps        %ymm11,%ymm3,%ymm11
   .byte  196,67,125,8,227,1                  // vroundps      $0x1,%ymm11,%ymm12
   .byte  196,65,36,92,252                    // vsubps        %ymm12,%ymm11,%ymm15
   .byte  196,65,44,92,217                    // vsubps        %ymm9,%ymm10,%ymm11
-  .byte  196,98,125,24,37,1,95,0,0           // vbroadcastss  0x5f01(%rip),%ymm12        # 79d0 <_sk_callback_avx+0x268>
+  .byte  196,98,125,24,37,11,95,0,0          // vbroadcastss  0x5f0b(%rip),%ymm12        # 7a0c <_sk_callback_avx+0x270>
   .byte  196,193,4,89,196                    // vmulps        %ymm12,%ymm15,%ymm0
-  .byte  196,98,125,24,45,247,94,0,0         // vbroadcastss  0x5ef7(%rip),%ymm13        # 79d4 <_sk_callback_avx+0x26c>
+  .byte  196,98,125,24,45,1,95,0,0           // vbroadcastss  0x5f01(%rip),%ymm13        # 7a10 <_sk_callback_avx+0x274>
   .byte  197,20,92,240                       // vsubps        %ymm0,%ymm13,%ymm14
   .byte  196,65,36,89,246                    // vmulps        %ymm14,%ymm11,%ymm14
   .byte  196,65,52,88,246                    // vaddps        %ymm14,%ymm9,%ymm14
-  .byte  196,226,125,24,13,216,94,0,0        // vbroadcastss  0x5ed8(%rip),%ymm1        # 79cc <_sk_callback_avx+0x264>
+  .byte  196,226,125,24,13,226,94,0,0        // vbroadcastss  0x5ee2(%rip),%ymm1        # 7a08 <_sk_callback_avx+0x26c>
   .byte  196,193,116,194,255,2               // vcmpleps      %ymm15,%ymm1,%ymm7
   .byte  196,195,13,74,249,112               // vblendvps     %ymm7,%ymm9,%ymm14,%ymm7
   .byte  196,65,60,194,247,2                 // vcmpleps      %ymm15,%ymm8,%ymm14
   .byte  196,227,45,74,255,224               // vblendvps     %ymm14,%ymm7,%ymm10,%ymm7
-  .byte  196,98,125,24,53,195,94,0,0         // vbroadcastss  0x5ec3(%rip),%ymm14        # 79d8 <_sk_callback_avx+0x270>
+  .byte  196,98,125,24,53,205,94,0,0         // vbroadcastss  0x5ecd(%rip),%ymm14        # 7a14 <_sk_callback_avx+0x278>
   .byte  196,65,12,194,255,2                 // vcmpleps      %ymm15,%ymm14,%ymm15
   .byte  196,193,124,89,195                  // vmulps        %ymm11,%ymm0,%ymm0
   .byte  197,180,88,192                      // vaddps        %ymm0,%ymm9,%ymm0
@@ -19476,7 +19569,7 @@
   .byte  197,164,89,247                      // vmulps        %ymm7,%ymm11,%ymm6
   .byte  197,180,88,246                      // vaddps        %ymm6,%ymm9,%ymm6
   .byte  196,227,77,74,237,0                 // vblendvps     %ymm0,%ymm5,%ymm6,%ymm5
-  .byte  196,226,125,24,5,101,94,0,0         // vbroadcastss  0x5e65(%rip),%ymm0        # 79dc <_sk_callback_avx+0x274>
+  .byte  196,226,125,24,5,111,94,0,0         // vbroadcastss  0x5e6f(%rip),%ymm0        # 7a18 <_sk_callback_avx+0x27c>
   .byte  197,228,88,192                      // vaddps        %ymm0,%ymm3,%ymm0
   .byte  196,227,125,8,216,1                 // vroundps      $0x1,%ymm0,%ymm3
   .byte  197,252,92,195                      // vsubps        %ymm3,%ymm0,%ymm0
@@ -19526,15 +19619,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,74                              // jne           1c6e <_sk_scale_u8_avx+0x54>
+  .byte  117,74                              // jne           1ca0 <_sk_scale_u8_avx+0x54>
   .byte  196,66,121,48,4,19                  // vpmovzxbw     (%r11,%rdx,1),%xmm8
-  .byte  197,57,219,5,126,97,0,0             // vpand         0x617e(%rip),%xmm8,%xmm8        # 7db0 <_sk_callback_avx+0x648>
+  .byte  197,57,219,5,140,97,0,0             // vpand         0x618c(%rip),%xmm8,%xmm8        # 7df0 <_sk_callback_avx+0x654>
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  196,65,57,105,201                   // vpunpckhwd    %xmm9,%xmm8,%xmm9
   .byte  196,66,121,51,192                   // vpmovzxwd     %xmm8,%xmm8
   .byte  196,67,61,24,193,1                  // vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,139,93,0,0         // vbroadcastss  0x5d8b(%rip),%ymm9        # 79e0 <_sk_callback_avx+0x278>
+  .byte  196,98,125,24,13,149,93,0,0         // vbroadcastss  0x5d95(%rip),%ymm9        # 7a1c <_sk_callback_avx+0x280>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  197,188,89,201                      // vmulps        %ymm1,%ymm8,%ymm1
@@ -19547,15 +19640,15 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,167                             // ja            1c2a <_sk_scale_u8_avx+0x10>
+  .byte  119,167                             // ja            1c5c <_sk_scale_u8_avx+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 1d08 <_sk_scale_u8_avx+0xee>
+  .byte  76,141,21,124,0,0,0                 // lea           0x7c(%rip),%r10        # 1d3c <_sk_scale_u8_avx+0xf0>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  235,136                             // jmp           1c2a <_sk_scale_u8_avx+0x10>
+  .byte  235,136                             // jmp           1c5c <_sk_scale_u8_avx+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,2                    // vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -19563,7 +19656,7 @@
   .byte  197,121,110,200                     // vmovd         %eax,%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,57,14,193,3                  // vpblendw      $0x3,%xmm9,%xmm8,%xmm8
-  .byte  233,95,255,255,255                  // jmpq          1c2a <_sk_scale_u8_avx+0x10>
+  .byte  233,95,255,255,255                  // jmpq          1c5c <_sk_scale_u8_avx+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,6                    // vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -19574,22 +19667,24 @@
   .byte  196,65,121,110,12,19                // vmovd         (%r11,%rdx,1),%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,49,14,192,240                // vpblendw      $0xf0,%xmm8,%xmm9,%xmm8
-  .byte  233,35,255,255,255                  // jmpq          1c2a <_sk_scale_u8_avx+0x10>
-  .byte  144                                 // nop
-  .byte  143                                 // (bad)
+  .byte  233,35,255,255,255                  // jmpq          1c5c <_sk_scale_u8_avx+0x10>
+  .byte  15,31,0                             // nopl          (%rax)
+  .byte  141                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,170,255,255,255,154             // ljmp          *-0x65000001(%rdx)
+  .byte  255,168,255,255,255,152             // ljmp          *-0x67000001(%rax)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255,231                             // jmpq          *%rdi
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  233,255,255,255,222                 // jmpq          ffffffffdf001d18 <_sk_callback_avx+0xffffffffdeffa5b0>
+  .byte  220,255                             // fdivr         %st,%st(7)
+  .byte  255                                 // (bad)
+  .byte  255,209                             // callq         *%rcx
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,211                             // callq         *%rbx
-  .byte  255                                 // (bad)
-  .byte  255                                 // (bad)
-  .byte  255,195                             // inc           %ebx
+  .byte  255,193                             // inc           %ecx
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // .byte         0xff
@@ -19622,15 +19717,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,110                             // jne           1ddb <_sk_lerp_u8_avx+0x78>
+  .byte  117,110                             // jne           1e0f <_sk_lerp_u8_avx+0x78>
   .byte  196,66,121,48,4,19                  // vpmovzxbw     (%r11,%rdx,1),%xmm8
-  .byte  197,57,219,5,69,96,0,0              // vpand         0x6045(%rip),%xmm8,%xmm8        # 7dc0 <_sk_callback_avx+0x658>
+  .byte  197,57,219,5,81,96,0,0              // vpand         0x6051(%rip),%xmm8,%xmm8        # 7e00 <_sk_callback_avx+0x664>
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  196,65,57,105,201                   // vpunpckhwd    %xmm9,%xmm8,%xmm9
   .byte  196,66,121,51,192                   // vpmovzxwd     %xmm8,%xmm8
   .byte  196,67,61,24,193,1                  // vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,13,70,92,0,0          // vbroadcastss  0x5c46(%rip),%ymm9        # 79e4 <_sk_callback_avx+0x27c>
+  .byte  196,98,125,24,13,78,92,0,0          // vbroadcastss  0x5c4e(%rip),%ymm9        # 7a20 <_sk_callback_avx+0x284>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
@@ -19651,15 +19746,15 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,131                             // ja            1d73 <_sk_lerp_u8_avx+0x10>
+  .byte  119,131                             // ja            1da7 <_sk_lerp_u8_avx+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,125,0,0,0                 // lea           0x7d(%rip),%r10        # 1e78 <_sk_lerp_u8_avx+0x115>
+  .byte  76,141,21,125,0,0,0                 // lea           0x7d(%rip),%r10        # 1eac <_sk_lerp_u8_avx+0x115>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  233,97,255,255,255                  // jmpq          1d73 <_sk_lerp_u8_avx+0x10>
+  .byte  233,97,255,255,255                  // jmpq          1da7 <_sk_lerp_u8_avx+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,2                    // vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -19667,7 +19762,7 @@
   .byte  197,121,110,200                     // vmovd         %eax,%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,57,14,193,3                  // vpblendw      $0x3,%xmm9,%xmm8,%xmm8
-  .byte  233,56,255,255,255                  // jmpq          1d73 <_sk_lerp_u8_avx+0x10>
+  .byte  233,56,255,255,255                  // jmpq          1da7 <_sk_lerp_u8_avx+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  197,57,196,192,6                    // vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -19678,7 +19773,7 @@
   .byte  196,65,121,110,12,19                // vmovd         (%r11,%rdx,1),%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
   .byte  196,67,49,14,192,240                // vpblendw      $0xf0,%xmm8,%xmm9,%xmm8
-  .byte  233,252,254,255,255                 // jmpq          1d73 <_sk_lerp_u8_avx+0x10>
+  .byte  233,252,254,255,255                 // jmpq          1da7 <_sk_lerp_u8_avx+0x10>
   .byte  144                                 // nop
   .byte  140,255                             // mov           %?,%edi
   .byte  255                                 // (bad)
@@ -19686,7 +19781,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  233,255,255,255,222                 // jmpq          ffffffffdf001e88 <_sk_callback_avx+0xffffffffdeffa720>
+  .byte  233,255,255,255,222                 // jmpq          ffffffffdf001ebc <_sk_callback_avx+0xffffffffdeffa720>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,211                             // callq         *%rbx
@@ -19704,26 +19799,26 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,208,0,0,0                    // jne           1f72 <_sk_lerp_565_avx+0xde>
+  .byte  15,133,208,0,0,0                    // jne           1fa6 <_sk_lerp_565_avx+0xde>
   .byte  196,65,122,111,4,83                 // vmovdqu       (%r11,%rdx,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  196,65,57,105,201                   // vpunpckhwd    %xmm9,%xmm8,%xmm9
   .byte  196,66,121,51,192                   // vpmovzxwd     %xmm8,%xmm8
   .byte  196,67,61,24,193,1                  // vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
-  .byte  196,98,125,24,13,34,91,0,0          // vbroadcastss  0x5b22(%rip),%ymm9        # 79e8 <_sk_callback_avx+0x280>
+  .byte  196,98,125,24,13,42,91,0,0          // vbroadcastss  0x5b2a(%rip),%ymm9        # 7a24 <_sk_callback_avx+0x288>
   .byte  196,65,60,84,201                    // vandps        %ymm9,%ymm8,%ymm9
   .byte  196,65,124,91,201                   // vcvtdq2ps     %ymm9,%ymm9
-  .byte  196,98,125,24,21,19,91,0,0          // vbroadcastss  0x5b13(%rip),%ymm10        # 79ec <_sk_callback_avx+0x284>
+  .byte  196,98,125,24,21,27,91,0,0          // vbroadcastss  0x5b1b(%rip),%ymm10        # 7a28 <_sk_callback_avx+0x28c>
   .byte  196,65,52,89,202                    // vmulps        %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,24,21,9,91,0,0           // vbroadcastss  0x5b09(%rip),%ymm10        # 79f0 <_sk_callback_avx+0x288>
+  .byte  196,98,125,24,21,17,91,0,0          // vbroadcastss  0x5b11(%rip),%ymm10        # 7a2c <_sk_callback_avx+0x290>
   .byte  196,65,60,84,210                    // vandps        %ymm10,%ymm8,%ymm10
   .byte  196,65,124,91,210                   // vcvtdq2ps     %ymm10,%ymm10
-  .byte  196,98,125,24,29,250,90,0,0         // vbroadcastss  0x5afa(%rip),%ymm11        # 79f4 <_sk_callback_avx+0x28c>
+  .byte  196,98,125,24,29,2,91,0,0           // vbroadcastss  0x5b02(%rip),%ymm11        # 7a30 <_sk_callback_avx+0x294>
   .byte  196,65,44,89,211                    // vmulps        %ymm11,%ymm10,%ymm10
-  .byte  196,98,125,24,29,240,90,0,0         // vbroadcastss  0x5af0(%rip),%ymm11        # 79f8 <_sk_callback_avx+0x290>
+  .byte  196,98,125,24,29,248,90,0,0         // vbroadcastss  0x5af8(%rip),%ymm11        # 7a34 <_sk_callback_avx+0x298>
   .byte  196,65,60,84,195                    // vandps        %ymm11,%ymm8,%ymm8
   .byte  196,65,124,91,192                   // vcvtdq2ps     %ymm8,%ymm8
-  .byte  196,98,125,24,29,225,90,0,0         // vbroadcastss  0x5ae1(%rip),%ymm11        # 79fc <_sk_callback_avx+0x294>
+  .byte  196,98,125,24,29,233,90,0,0         // vbroadcastss  0x5ae9(%rip),%ymm11        # 7a38 <_sk_callback_avx+0x29c>
   .byte  196,65,60,89,195                    // vmulps        %ymm11,%ymm8,%ymm8
   .byte  197,252,92,196                      // vsubps        %ymm4,%ymm0,%ymm0
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
@@ -19750,27 +19845,27 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,29,255,255,255               // ja            1ea8 <_sk_lerp_565_avx+0x14>
+  .byte  15,135,29,255,255,255               // ja            1edc <_sk_lerp_565_avx+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,102,0,0,0                 // lea           0x66(%rip),%r10        # 1ffc <_sk_lerp_565_avx+0x168>
+  .byte  76,141,21,102,0,0,0                 // lea           0x66(%rip),%r10        # 2030 <_sk_lerp_565_avx+0x168>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  233,251,254,255,255                 // jmpq          1ea8 <_sk_lerp_565_avx+0x14>
+  .byte  233,251,254,255,255                 // jmpq          1edc <_sk_lerp_565_avx+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,65,57,196,68,83,4,2             // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,121,110,12,83                // vmovd         (%r11,%rdx,2),%xmm9
   .byte  196,67,57,14,193,3                  // vpblendw      $0x3,%xmm9,%xmm8,%xmm8
-  .byte  233,221,254,255,255                 // jmpq          1ea8 <_sk_lerp_565_avx+0x14>
+  .byte  233,221,254,255,255                 // jmpq          1edc <_sk_lerp_565_avx+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,65,57,196,68,83,12,6            // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,57,196,68,83,10,5            // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,57,196,68,83,8,4             // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm8,%xmm8
   .byte  196,65,122,126,12,83                // vmovq         (%r11,%rdx,2),%xmm9
   .byte  196,67,49,14,192,240                // vpblendw      $0xf0,%xmm8,%xmm9,%xmm8
-  .byte  233,175,254,255,255                 // jmpq          1ea8 <_sk_lerp_565_avx+0x14>
+  .byte  233,175,254,255,255                 // jmpq          1edc <_sk_lerp_565_avx+0x14>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  163,255,255,255,190,255,255,255,177 // movabs        %eax,0xb1ffffffbeffffff
   .byte  255                                 // (bad)
@@ -19801,9 +19896,9 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,248,1,0,0                    // jne           2230 <_sk_load_tables_avx+0x218>
+  .byte  15,133,248,1,0,0                    // jne           2264 <_sk_load_tables_avx+0x218>
   .byte  196,65,124,16,18                    // vmovups       (%r10),%ymm10
-  .byte  197,124,40,13,27,95,0,0             // vmovaps       0x5f1b(%rip),%ymm9        # 7f60 <_sk_callback_avx+0x7f8>
+  .byte  197,124,40,13,39,95,0,0             // vmovaps       0x5f27(%rip),%ymm9        # 7fa0 <_sk_callback_avx+0x804>
   .byte  196,193,44,84,201                   // vandps        %ymm9,%ymm10,%ymm1
   .byte  196,227,125,25,200,1                // vextractf128  $0x1,%ymm1,%xmm0
   .byte  196,193,249,126,195                 // vmovq         %xmm0,%r11
@@ -19895,7 +19990,7 @@
   .byte  196,193,65,114,208,24               // vpsrld        $0x18,%xmm8,%xmm7
   .byte  196,227,101,24,223,1                // vinsertf128   $0x1,%xmm7,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,226,125,24,61,226,87,0,0        // vbroadcastss  0x57e2(%rip),%ymm7        # 7a00 <_sk_callback_avx+0x298>
+  .byte  196,226,125,24,61,234,87,0,0        // vbroadcastss  0x57ea(%rip),%ymm7        # 7a3c <_sk_callback_avx+0x2a0>
   .byte  197,228,89,223                      // vmulps        %ymm7,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,201                          // mov           %r9,%rcx
@@ -19909,13 +20004,13 @@
   .byte  73,211,235                          // shr           %cl,%r11
   .byte  196,193,249,110,195                 // vmovq         %r11,%xmm0
   .byte  196,226,121,48,192                  // vpmovzxbw     %xmm0,%xmm0
-  .byte  196,226,121,0,13,120,91,0,0         // vpshufb       0x5b78(%rip),%xmm0,%xmm1        # 7dd0 <_sk_callback_avx+0x668>
+  .byte  196,226,121,0,13,132,91,0,0         // vpshufb       0x5b84(%rip),%xmm0,%xmm1        # 7e10 <_sk_callback_avx+0x674>
   .byte  196,226,121,33,201                  // vpmovsxbd     %xmm1,%xmm1
-  .byte  196,226,121,0,5,122,91,0,0          // vpshufb       0x5b7a(%rip),%xmm0,%xmm0        # 7de0 <_sk_callback_avx+0x678>
+  .byte  196,226,121,0,5,134,91,0,0          // vpshufb       0x5b86(%rip),%xmm0,%xmm0        # 7e20 <_sk_callback_avx+0x684>
   .byte  196,226,121,33,192                  // vpmovsxbd     %xmm0,%xmm0
   .byte  196,227,117,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  196,66,125,44,18                    // vmaskmovps    (%r10),%ymm0,%ymm10
-  .byte  233,194,253,255,255                 // jmpq          203d <_sk_load_tables_avx+0x25>
+  .byte  233,194,253,255,255                 // jmpq          2071 <_sk_load_tables_avx+0x25>
 
 HIDDEN _sk_load_tables_u16_be_avx
 .globl _sk_load_tables_u16_be_avx
@@ -19926,7 +20021,7 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  77,133,192                          // test          %r8,%r8
   .byte  197,252,17,124,36,200               // vmovups       %ymm7,-0x38(%rsp)
-  .byte  15,133,84,2,0,0                     // jne           24eb <_sk_load_tables_u16_be_avx+0x270>
+  .byte  15,133,84,2,0,0                     // jne           251f <_sk_load_tables_u16_be_avx+0x270>
   .byte  196,1,121,16,4,81                   // vmovupd       (%r9,%r10,2),%xmm8
   .byte  196,129,121,16,84,81,16             // vmovupd       0x10(%r9,%r10,2),%xmm2
   .byte  196,129,121,16,92,81,32             // vmovupd       0x20(%r9,%r10,2),%xmm3
@@ -19941,7 +20036,7 @@
   .byte  197,113,105,219                     // vpunpckhwd    %xmm3,%xmm1,%xmm11
   .byte  197,177,108,200                     // vpunpcklqdq   %xmm0,%xmm9,%xmm1
   .byte  197,49,109,224                      // vpunpckhqdq   %xmm0,%xmm9,%xmm12
-  .byte  197,121,111,21,12,91,0,0            // vmovdqa       0x5b0c(%rip),%xmm10        # 7df0 <_sk_callback_avx+0x688>
+  .byte  197,121,111,21,24,91,0,0            // vmovdqa       0x5b18(%rip),%xmm10        # 7e30 <_sk_callback_avx+0x694>
   .byte  196,193,113,219,202                 // vpand         %xmm10,%xmm1,%xmm1
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  196,193,113,105,209                 // vpunpckhwd    %xmm9,%xmm1,%xmm2
@@ -20039,7 +20134,7 @@
   .byte  196,226,121,51,219                  // vpmovzxwd     %xmm3,%xmm3
   .byte  196,227,101,24,223,1                // vinsertf128   $0x1,%xmm7,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,226,125,24,61,39,85,0,0         // vbroadcastss  0x5527(%rip),%ymm7        # 7a04 <_sk_callback_avx+0x29c>
+  .byte  196,226,125,24,61,47,85,0,0         // vbroadcastss  0x552f(%rip),%ymm7        # 7a40 <_sk_callback_avx+0x2a4>
   .byte  197,228,89,223                      // vmulps        %ymm7,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,16,124,36,200               // vmovups       -0x38(%rsp),%ymm7
@@ -20047,29 +20142,29 @@
   .byte  196,1,123,16,4,81                   // vmovsd        (%r9,%r10,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,85                              // je            2551 <_sk_load_tables_u16_be_avx+0x2d6>
+  .byte  116,85                              // je            2585 <_sk_load_tables_u16_be_avx+0x2d6>
   .byte  196,1,57,22,68,81,8                 // vmovhpd       0x8(%r9,%r10,2),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,72                              // jb            2551 <_sk_load_tables_u16_be_avx+0x2d6>
+  .byte  114,72                              // jb            2585 <_sk_load_tables_u16_be_avx+0x2d6>
   .byte  196,129,123,16,84,81,16             // vmovsd        0x10(%r9,%r10,2),%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,72                              // je            255e <_sk_load_tables_u16_be_avx+0x2e3>
+  .byte  116,72                              // je            2592 <_sk_load_tables_u16_be_avx+0x2e3>
   .byte  196,129,105,22,84,81,24             // vmovhpd       0x18(%r9,%r10,2),%xmm2,%xmm2
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,59                              // jb            255e <_sk_load_tables_u16_be_avx+0x2e3>
+  .byte  114,59                              // jb            2592 <_sk_load_tables_u16_be_avx+0x2e3>
   .byte  196,129,123,16,92,81,32             // vmovsd        0x20(%r9,%r10,2),%xmm3
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,126,253,255,255              // je            22b2 <_sk_load_tables_u16_be_avx+0x37>
+  .byte  15,132,126,253,255,255              // je            22e6 <_sk_load_tables_u16_be_avx+0x37>
   .byte  196,129,97,22,92,81,40              // vmovhpd       0x28(%r9,%r10,2),%xmm3,%xmm3
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,109,253,255,255              // jb            22b2 <_sk_load_tables_u16_be_avx+0x37>
+  .byte  15,130,109,253,255,255              // jb            22e6 <_sk_load_tables_u16_be_avx+0x37>
   .byte  196,1,122,126,76,81,48              // vmovq         0x30(%r9,%r10,2),%xmm9
-  .byte  233,97,253,255,255                  // jmpq          22b2 <_sk_load_tables_u16_be_avx+0x37>
+  .byte  233,97,253,255,255                  // jmpq          22e6 <_sk_load_tables_u16_be_avx+0x37>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,84,253,255,255                  // jmpq          22b2 <_sk_load_tables_u16_be_avx+0x37>
+  .byte  233,84,253,255,255                  // jmpq          22e6 <_sk_load_tables_u16_be_avx+0x37>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,75,253,255,255                  // jmpq          22b2 <_sk_load_tables_u16_be_avx+0x37>
+  .byte  233,75,253,255,255                  // jmpq          22e6 <_sk_load_tables_u16_be_avx+0x37>
 
 HIDDEN _sk_load_tables_rgb_u16_be_avx
 .globl _sk_load_tables_rgb_u16_be_avx
@@ -20081,7 +20176,7 @@
   .byte  77,133,192                          // test          %r8,%r8
   .byte  197,252,17,124,36,200               // vmovups       %ymm7,-0x38(%rsp)
   .byte  197,252,17,116,36,168               // vmovups       %ymm6,-0x58(%rsp)
-  .byte  15,133,71,2,0,0                     // jne           27cc <_sk_load_tables_rgb_u16_be_avx+0x265>
+  .byte  15,133,71,2,0,0                     // jne           2800 <_sk_load_tables_rgb_u16_be_avx+0x265>
   .byte  196,129,122,111,4,81                // vmovdqu       (%r9,%r10,2),%xmm0
   .byte  196,129,122,111,84,81,12            // vmovdqu       0xc(%r9,%r10,2),%xmm2
   .byte  196,129,122,111,76,81,24            // vmovdqu       0x18(%r9,%r10,2),%xmm1
@@ -20102,7 +20197,7 @@
   .byte  197,185,108,218                     // vpunpcklqdq   %xmm2,%xmm8,%xmm3
   .byte  197,57,109,218                      // vpunpckhqdq   %xmm2,%xmm8,%xmm11
   .byte  197,121,108,193                     // vpunpcklqdq   %xmm1,%xmm0,%xmm8
-  .byte  197,121,111,13,17,88,0,0            // vmovdqa       0x5811(%rip),%xmm9        # 7e00 <_sk_callback_avx+0x698>
+  .byte  197,121,111,13,29,88,0,0            // vmovdqa       0x581d(%rip),%xmm9        # 7e40 <_sk_callback_avx+0x6a4>
   .byte  196,193,97,219,193                  // vpand         %xmm9,%xmm3,%xmm0
   .byte  196,65,41,239,210                   // vpxor         %xmm10,%xmm10,%xmm10
   .byte  196,193,121,105,202                 // vpunpckhwd    %xmm10,%xmm0,%xmm1
@@ -20192,50 +20287,50 @@
   .byte  196,195,105,33,211,48               // vinsertps     $0x30,%xmm11,%xmm2,%xmm2
   .byte  196,227,109,24,211,1                // vinsertf128   $0x1,%xmm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,74,82,0,0         // vbroadcastss  0x524a(%rip),%ymm3        # 7a08 <_sk_callback_avx+0x2a0>
+  .byte  196,226,125,24,29,82,82,0,0         // vbroadcastss  0x5252(%rip),%ymm3        # 7a44 <_sk_callback_avx+0x2a8>
   .byte  197,252,16,116,36,168               // vmovups       -0x58(%rsp),%ymm6
   .byte  197,252,16,124,36,200               // vmovups       -0x38(%rsp),%ymm7
   .byte  255,224                             // jmpq          *%rax
   .byte  196,129,121,110,4,81                // vmovd         (%r9,%r10,2),%xmm0
   .byte  196,129,121,196,68,81,4,2           // vpinsrw       $0x2,0x4(%r9,%r10,2),%xmm0,%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,5                               // jne           27e5 <_sk_load_tables_rgb_u16_be_avx+0x27e>
-  .byte  233,212,253,255,255                 // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  117,5                               // jne           2819 <_sk_load_tables_rgb_u16_be_avx+0x27e>
+  .byte  233,212,253,255,255                 // jmpq          25ed <_sk_load_tables_rgb_u16_be_avx+0x52>
   .byte  196,129,121,110,76,81,6             // vmovd         0x6(%r9,%r10,2),%xmm1
   .byte  196,1,113,196,68,81,10,2            // vpinsrw       $0x2,0xa(%r9,%r10,2),%xmm1,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,26                              // jb            2814 <_sk_load_tables_rgb_u16_be_avx+0x2ad>
+  .byte  114,26                              // jb            2848 <_sk_load_tables_rgb_u16_be_avx+0x2ad>
   .byte  196,129,121,110,76,81,12            // vmovd         0xc(%r9,%r10,2),%xmm1
   .byte  196,129,113,196,84,81,16,2          // vpinsrw       $0x2,0x10(%r9,%r10,2),%xmm1,%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  117,10                              // jne           2819 <_sk_load_tables_rgb_u16_be_avx+0x2b2>
-  .byte  233,165,253,255,255                 // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
-  .byte  233,160,253,255,255                 // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  117,10                              // jne           284d <_sk_load_tables_rgb_u16_be_avx+0x2b2>
+  .byte  233,165,253,255,255                 // jmpq          25ed <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  233,160,253,255,255                 // jmpq          25ed <_sk_load_tables_rgb_u16_be_avx+0x52>
   .byte  196,129,121,110,76,81,18            // vmovd         0x12(%r9,%r10,2),%xmm1
   .byte  196,1,113,196,76,81,22,2            // vpinsrw       $0x2,0x16(%r9,%r10,2),%xmm1,%xmm9
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,26                              // jb            2848 <_sk_load_tables_rgb_u16_be_avx+0x2e1>
+  .byte  114,26                              // jb            287c <_sk_load_tables_rgb_u16_be_avx+0x2e1>
   .byte  196,129,121,110,76,81,24            // vmovd         0x18(%r9,%r10,2),%xmm1
   .byte  196,129,113,196,76,81,28,2          // vpinsrw       $0x2,0x1c(%r9,%r10,2),%xmm1,%xmm1
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  117,10                              // jne           284d <_sk_load_tables_rgb_u16_be_avx+0x2e6>
-  .byte  233,113,253,255,255                 // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
-  .byte  233,108,253,255,255                 // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  117,10                              // jne           2881 <_sk_load_tables_rgb_u16_be_avx+0x2e6>
+  .byte  233,113,253,255,255                 // jmpq          25ed <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  233,108,253,255,255                 // jmpq          25ed <_sk_load_tables_rgb_u16_be_avx+0x52>
   .byte  196,129,121,110,92,81,30            // vmovd         0x1e(%r9,%r10,2),%xmm3
   .byte  196,1,97,196,92,81,34,2             // vpinsrw       $0x2,0x22(%r9,%r10,2),%xmm3,%xmm11
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,20                              // jb            2876 <_sk_load_tables_rgb_u16_be_avx+0x30f>
+  .byte  114,20                              // jb            28aa <_sk_load_tables_rgb_u16_be_avx+0x30f>
   .byte  196,129,121,110,92,81,36            // vmovd         0x24(%r9,%r10,2),%xmm3
   .byte  196,129,97,196,92,81,40,2           // vpinsrw       $0x2,0x28(%r9,%r10,2),%xmm3,%xmm3
-  .byte  233,67,253,255,255                  // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
-  .byte  233,62,253,255,255                  // jmpq          25b9 <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  233,67,253,255,255                  // jmpq          25ed <_sk_load_tables_rgb_u16_be_avx+0x52>
+  .byte  233,62,253,255,255                  // jmpq          25ed <_sk_load_tables_rgb_u16_be_avx+0x52>
 
 HIDDEN _sk_byte_tables_avx
 .globl _sk_byte_tables_avx
 FUNCTION(_sk_byte_tables_avx)
 _sk_byte_tables_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,134,81,0,0          // vbroadcastss  0x5186(%rip),%ymm8        # 7a0c <_sk_callback_avx+0x2a4>
+  .byte  196,98,125,24,5,142,81,0,0          // vbroadcastss  0x518e(%rip),%ymm8        # 7a48 <_sk_callback_avx+0x2ac>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  197,125,91,200                      // vcvtps2dq     %ymm0,%ymm9
   .byte  196,65,249,126,201                  // vmovq         %xmm9,%r9
@@ -20354,7 +20449,7 @@
   .byte  196,194,121,49,204                  // vpmovzxbd     %xmm12,%xmm1
   .byte  196,194,121,49,213                  // vpmovzxbd     %xmm13,%xmm2
   .byte  196,227,117,24,202,1                // vinsertf128   $0x1,%xmm2,%ymm1,%ymm1
-  .byte  196,98,125,24,13,48,79,0,0          // vbroadcastss  0x4f30(%rip),%ymm9        # 7a10 <_sk_callback_avx+0x2a8>
+  .byte  196,98,125,24,13,56,79,0,0          // vbroadcastss  0x4f38(%rip),%ymm9        # 7a4c <_sk_callback_avx+0x2b0>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
   .byte  196,193,116,89,201                  // vmulps        %ymm9,%ymm1,%ymm1
@@ -20470,7 +20565,7 @@
   .byte  196,194,121,49,203                  // vpmovzxbd     %xmm11,%xmm1
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,13,17,77,0,0          // vbroadcastss  0x4d11(%rip),%ymm9        # 7a14 <_sk_callback_avx+0x2ac>
+  .byte  196,98,125,24,13,25,77,0,0          // vbroadcastss  0x4d19(%rip),%ymm9        # 7a50 <_sk_callback_avx+0x2b4>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  196,194,121,49,202                  // vpmovzxbd     %xmm10,%xmm1
   .byte  196,194,121,49,212                  // vpmovzxbd     %xmm12,%xmm2
@@ -20675,36 +20770,36 @@
   .byte  196,193,124,88,195                  // vaddps        %ymm11,%ymm0,%ymm0
   .byte  196,98,125,24,16                    // vbroadcastss  (%rax),%ymm10
   .byte  197,124,91,216                      // vcvtdq2ps     %ymm0,%ymm11
-  .byte  196,98,125,24,37,190,73,0,0         // vbroadcastss  0x49be(%rip),%ymm12        # 7a18 <_sk_callback_avx+0x2b0>
+  .byte  196,98,125,24,37,198,73,0,0         // vbroadcastss  0x49c6(%rip),%ymm12        # 7a54 <_sk_callback_avx+0x2b8>
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,180,73,0,0         // vbroadcastss  0x49b4(%rip),%ymm12        # 7a1c <_sk_callback_avx+0x2b4>
+  .byte  196,98,125,24,37,188,73,0,0         // vbroadcastss  0x49bc(%rip),%ymm12        # 7a58 <_sk_callback_avx+0x2bc>
   .byte  196,193,124,84,196                  // vandps        %ymm12,%ymm0,%ymm0
-  .byte  196,98,125,24,37,170,73,0,0         // vbroadcastss  0x49aa(%rip),%ymm12        # 7a20 <_sk_callback_avx+0x2b8>
+  .byte  196,98,125,24,37,178,73,0,0         // vbroadcastss  0x49b2(%rip),%ymm12        # 7a5c <_sk_callback_avx+0x2c0>
   .byte  196,193,124,86,196                  // vorps         %ymm12,%ymm0,%ymm0
-  .byte  196,98,125,24,37,160,73,0,0         // vbroadcastss  0x49a0(%rip),%ymm12        # 7a24 <_sk_callback_avx+0x2bc>
+  .byte  196,98,125,24,37,168,73,0,0         // vbroadcastss  0x49a8(%rip),%ymm12        # 7a60 <_sk_callback_avx+0x2c4>
   .byte  196,65,36,88,220                    // vaddps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,150,73,0,0         // vbroadcastss  0x4996(%rip),%ymm12        # 7a28 <_sk_callback_avx+0x2c0>
+  .byte  196,98,125,24,37,158,73,0,0         // vbroadcastss  0x499e(%rip),%ymm12        # 7a64 <_sk_callback_avx+0x2c8>
   .byte  196,65,124,89,228                   // vmulps        %ymm12,%ymm0,%ymm12
   .byte  196,65,36,92,220                    // vsubps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,135,73,0,0         // vbroadcastss  0x4987(%rip),%ymm12        # 7a2c <_sk_callback_avx+0x2c4>
+  .byte  196,98,125,24,37,143,73,0,0         // vbroadcastss  0x498f(%rip),%ymm12        # 7a68 <_sk_callback_avx+0x2cc>
   .byte  196,193,124,88,196                  // vaddps        %ymm12,%ymm0,%ymm0
-  .byte  196,98,125,24,37,125,73,0,0         // vbroadcastss  0x497d(%rip),%ymm12        # 7a30 <_sk_callback_avx+0x2c8>
+  .byte  196,98,125,24,37,133,73,0,0         // vbroadcastss  0x4985(%rip),%ymm12        # 7a6c <_sk_callback_avx+0x2d0>
   .byte  197,156,94,192                      // vdivps        %ymm0,%ymm12,%ymm0
   .byte  197,164,92,192                      // vsubps        %ymm0,%ymm11,%ymm0
   .byte  197,172,89,192                      // vmulps        %ymm0,%ymm10,%ymm0
   .byte  196,99,125,8,208,1                  // vroundps      $0x1,%ymm0,%ymm10
   .byte  196,65,124,92,210                   // vsubps        %ymm10,%ymm0,%ymm10
-  .byte  196,98,125,24,29,97,73,0,0          // vbroadcastss  0x4961(%rip),%ymm11        # 7a34 <_sk_callback_avx+0x2cc>
+  .byte  196,98,125,24,29,105,73,0,0         // vbroadcastss  0x4969(%rip),%ymm11        # 7a70 <_sk_callback_avx+0x2d4>
   .byte  196,193,124,88,195                  // vaddps        %ymm11,%ymm0,%ymm0
-  .byte  196,98,125,24,29,87,73,0,0          // vbroadcastss  0x4957(%rip),%ymm11        # 7a38 <_sk_callback_avx+0x2d0>
+  .byte  196,98,125,24,29,95,73,0,0          // vbroadcastss  0x495f(%rip),%ymm11        # 7a74 <_sk_callback_avx+0x2d8>
   .byte  196,65,44,89,219                    // vmulps        %ymm11,%ymm10,%ymm11
   .byte  196,193,124,92,195                  // vsubps        %ymm11,%ymm0,%ymm0
-  .byte  196,98,125,24,29,72,73,0,0          // vbroadcastss  0x4948(%rip),%ymm11        # 7a3c <_sk_callback_avx+0x2d4>
+  .byte  196,98,125,24,29,80,73,0,0          // vbroadcastss  0x4950(%rip),%ymm11        # 7a78 <_sk_callback_avx+0x2dc>
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
-  .byte  196,98,125,24,29,62,73,0,0          // vbroadcastss  0x493e(%rip),%ymm11        # 7a40 <_sk_callback_avx+0x2d8>
+  .byte  196,98,125,24,29,70,73,0,0          // vbroadcastss  0x4946(%rip),%ymm11        # 7a7c <_sk_callback_avx+0x2e0>
   .byte  196,65,36,94,210                    // vdivps        %ymm10,%ymm11,%ymm10
   .byte  196,193,124,88,194                  // vaddps        %ymm10,%ymm0,%ymm0
-  .byte  196,98,125,24,21,47,73,0,0          // vbroadcastss  0x492f(%rip),%ymm10        # 7a44 <_sk_callback_avx+0x2dc>
+  .byte  196,98,125,24,21,55,73,0,0          // vbroadcastss  0x4937(%rip),%ymm10        # 7a80 <_sk_callback_avx+0x2e4>
   .byte  196,193,124,89,194                  // vmulps        %ymm10,%ymm0,%ymm0
   .byte  197,253,91,192                      // vcvtps2dq     %ymm0,%ymm0
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -20712,7 +20807,7 @@
   .byte  196,195,125,74,193,128              // vblendvps     %ymm8,%ymm9,%ymm0,%ymm0
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,124,95,192                  // vmaxps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,6,73,0,0            // vbroadcastss  0x4906(%rip),%ymm8        # 7a48 <_sk_callback_avx+0x2e0>
+  .byte  196,98,125,24,5,14,73,0,0           // vbroadcastss  0x490e(%rip),%ymm8        # 7a84 <_sk_callback_avx+0x2e8>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -20734,36 +20829,36 @@
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
   .byte  196,98,125,24,16                    // vbroadcastss  (%rax),%ymm10
   .byte  197,124,91,217                      // vcvtdq2ps     %ymm1,%ymm11
-  .byte  196,98,125,24,37,183,72,0,0         // vbroadcastss  0x48b7(%rip),%ymm12        # 7a4c <_sk_callback_avx+0x2e4>
+  .byte  196,98,125,24,37,191,72,0,0         // vbroadcastss  0x48bf(%rip),%ymm12        # 7a88 <_sk_callback_avx+0x2ec>
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,173,72,0,0         // vbroadcastss  0x48ad(%rip),%ymm12        # 7a50 <_sk_callback_avx+0x2e8>
+  .byte  196,98,125,24,37,181,72,0,0         // vbroadcastss  0x48b5(%rip),%ymm12        # 7a8c <_sk_callback_avx+0x2f0>
   .byte  196,193,116,84,204                  // vandps        %ymm12,%ymm1,%ymm1
-  .byte  196,98,125,24,37,163,72,0,0         // vbroadcastss  0x48a3(%rip),%ymm12        # 7a54 <_sk_callback_avx+0x2ec>
+  .byte  196,98,125,24,37,171,72,0,0         // vbroadcastss  0x48ab(%rip),%ymm12        # 7a90 <_sk_callback_avx+0x2f4>
   .byte  196,193,116,86,204                  // vorps         %ymm12,%ymm1,%ymm1
-  .byte  196,98,125,24,37,153,72,0,0         // vbroadcastss  0x4899(%rip),%ymm12        # 7a58 <_sk_callback_avx+0x2f0>
+  .byte  196,98,125,24,37,161,72,0,0         // vbroadcastss  0x48a1(%rip),%ymm12        # 7a94 <_sk_callback_avx+0x2f8>
   .byte  196,65,36,88,220                    // vaddps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,143,72,0,0         // vbroadcastss  0x488f(%rip),%ymm12        # 7a5c <_sk_callback_avx+0x2f4>
+  .byte  196,98,125,24,37,151,72,0,0         // vbroadcastss  0x4897(%rip),%ymm12        # 7a98 <_sk_callback_avx+0x2fc>
   .byte  196,65,116,89,228                   // vmulps        %ymm12,%ymm1,%ymm12
   .byte  196,65,36,92,220                    // vsubps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,128,72,0,0         // vbroadcastss  0x4880(%rip),%ymm12        # 7a60 <_sk_callback_avx+0x2f8>
+  .byte  196,98,125,24,37,136,72,0,0         // vbroadcastss  0x4888(%rip),%ymm12        # 7a9c <_sk_callback_avx+0x300>
   .byte  196,193,116,88,204                  // vaddps        %ymm12,%ymm1,%ymm1
-  .byte  196,98,125,24,37,118,72,0,0         // vbroadcastss  0x4876(%rip),%ymm12        # 7a64 <_sk_callback_avx+0x2fc>
+  .byte  196,98,125,24,37,126,72,0,0         // vbroadcastss  0x487e(%rip),%ymm12        # 7aa0 <_sk_callback_avx+0x304>
   .byte  197,156,94,201                      // vdivps        %ymm1,%ymm12,%ymm1
   .byte  197,164,92,201                      // vsubps        %ymm1,%ymm11,%ymm1
   .byte  197,172,89,201                      // vmulps        %ymm1,%ymm10,%ymm1
   .byte  196,99,125,8,209,1                  // vroundps      $0x1,%ymm1,%ymm10
   .byte  196,65,116,92,210                   // vsubps        %ymm10,%ymm1,%ymm10
-  .byte  196,98,125,24,29,90,72,0,0          // vbroadcastss  0x485a(%rip),%ymm11        # 7a68 <_sk_callback_avx+0x300>
+  .byte  196,98,125,24,29,98,72,0,0          // vbroadcastss  0x4862(%rip),%ymm11        # 7aa4 <_sk_callback_avx+0x308>
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,80,72,0,0          // vbroadcastss  0x4850(%rip),%ymm11        # 7a6c <_sk_callback_avx+0x304>
+  .byte  196,98,125,24,29,88,72,0,0          // vbroadcastss  0x4858(%rip),%ymm11        # 7aa8 <_sk_callback_avx+0x30c>
   .byte  196,65,44,89,219                    // vmulps        %ymm11,%ymm10,%ymm11
   .byte  196,193,116,92,203                  // vsubps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,29,65,72,0,0          // vbroadcastss  0x4841(%rip),%ymm11        # 7a70 <_sk_callback_avx+0x308>
+  .byte  196,98,125,24,29,73,72,0,0          // vbroadcastss  0x4849(%rip),%ymm11        # 7aac <_sk_callback_avx+0x310>
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
-  .byte  196,98,125,24,29,55,72,0,0          // vbroadcastss  0x4837(%rip),%ymm11        # 7a74 <_sk_callback_avx+0x30c>
+  .byte  196,98,125,24,29,63,72,0,0          // vbroadcastss  0x483f(%rip),%ymm11        # 7ab0 <_sk_callback_avx+0x314>
   .byte  196,65,36,94,210                    // vdivps        %ymm10,%ymm11,%ymm10
   .byte  196,193,116,88,202                  // vaddps        %ymm10,%ymm1,%ymm1
-  .byte  196,98,125,24,21,40,72,0,0          // vbroadcastss  0x4828(%rip),%ymm10        # 7a78 <_sk_callback_avx+0x310>
+  .byte  196,98,125,24,21,48,72,0,0          // vbroadcastss  0x4830(%rip),%ymm10        # 7ab4 <_sk_callback_avx+0x318>
   .byte  196,193,116,89,202                  // vmulps        %ymm10,%ymm1,%ymm1
   .byte  197,253,91,201                      // vcvtps2dq     %ymm1,%ymm1
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -20771,7 +20866,7 @@
   .byte  196,195,117,74,201,128              // vblendvps     %ymm8,%ymm9,%ymm1,%ymm1
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,116,95,200                  // vmaxps        %ymm8,%ymm1,%ymm1
-  .byte  196,98,125,24,5,255,71,0,0          // vbroadcastss  0x47ff(%rip),%ymm8        # 7a7c <_sk_callback_avx+0x314>
+  .byte  196,98,125,24,5,7,72,0,0            // vbroadcastss  0x4807(%rip),%ymm8        # 7ab8 <_sk_callback_avx+0x31c>
   .byte  196,193,116,93,200                  // vminps        %ymm8,%ymm1,%ymm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -20793,36 +20888,36 @@
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
   .byte  196,98,125,24,16                    // vbroadcastss  (%rax),%ymm10
   .byte  197,124,91,218                      // vcvtdq2ps     %ymm2,%ymm11
-  .byte  196,98,125,24,37,176,71,0,0         // vbroadcastss  0x47b0(%rip),%ymm12        # 7a80 <_sk_callback_avx+0x318>
+  .byte  196,98,125,24,37,184,71,0,0         // vbroadcastss  0x47b8(%rip),%ymm12        # 7abc <_sk_callback_avx+0x320>
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,166,71,0,0         // vbroadcastss  0x47a6(%rip),%ymm12        # 7a84 <_sk_callback_avx+0x31c>
+  .byte  196,98,125,24,37,174,71,0,0         // vbroadcastss  0x47ae(%rip),%ymm12        # 7ac0 <_sk_callback_avx+0x324>
   .byte  196,193,108,84,212                  // vandps        %ymm12,%ymm2,%ymm2
-  .byte  196,98,125,24,37,156,71,0,0         // vbroadcastss  0x479c(%rip),%ymm12        # 7a88 <_sk_callback_avx+0x320>
+  .byte  196,98,125,24,37,164,71,0,0         // vbroadcastss  0x47a4(%rip),%ymm12        # 7ac4 <_sk_callback_avx+0x328>
   .byte  196,193,108,86,212                  // vorps         %ymm12,%ymm2,%ymm2
-  .byte  196,98,125,24,37,146,71,0,0         // vbroadcastss  0x4792(%rip),%ymm12        # 7a8c <_sk_callback_avx+0x324>
+  .byte  196,98,125,24,37,154,71,0,0         // vbroadcastss  0x479a(%rip),%ymm12        # 7ac8 <_sk_callback_avx+0x32c>
   .byte  196,65,36,88,220                    // vaddps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,136,71,0,0         // vbroadcastss  0x4788(%rip),%ymm12        # 7a90 <_sk_callback_avx+0x328>
+  .byte  196,98,125,24,37,144,71,0,0         // vbroadcastss  0x4790(%rip),%ymm12        # 7acc <_sk_callback_avx+0x330>
   .byte  196,65,108,89,228                   // vmulps        %ymm12,%ymm2,%ymm12
   .byte  196,65,36,92,220                    // vsubps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,121,71,0,0         // vbroadcastss  0x4779(%rip),%ymm12        # 7a94 <_sk_callback_avx+0x32c>
+  .byte  196,98,125,24,37,129,71,0,0         // vbroadcastss  0x4781(%rip),%ymm12        # 7ad0 <_sk_callback_avx+0x334>
   .byte  196,193,108,88,212                  // vaddps        %ymm12,%ymm2,%ymm2
-  .byte  196,98,125,24,37,111,71,0,0         // vbroadcastss  0x476f(%rip),%ymm12        # 7a98 <_sk_callback_avx+0x330>
+  .byte  196,98,125,24,37,119,71,0,0         // vbroadcastss  0x4777(%rip),%ymm12        # 7ad4 <_sk_callback_avx+0x338>
   .byte  197,156,94,210                      // vdivps        %ymm2,%ymm12,%ymm2
   .byte  197,164,92,210                      // vsubps        %ymm2,%ymm11,%ymm2
   .byte  197,172,89,210                      // vmulps        %ymm2,%ymm10,%ymm2
   .byte  196,99,125,8,210,1                  // vroundps      $0x1,%ymm2,%ymm10
   .byte  196,65,108,92,210                   // vsubps        %ymm10,%ymm2,%ymm10
-  .byte  196,98,125,24,29,83,71,0,0          // vbroadcastss  0x4753(%rip),%ymm11        # 7a9c <_sk_callback_avx+0x334>
+  .byte  196,98,125,24,29,91,71,0,0          // vbroadcastss  0x475b(%rip),%ymm11        # 7ad8 <_sk_callback_avx+0x33c>
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
-  .byte  196,98,125,24,29,73,71,0,0          // vbroadcastss  0x4749(%rip),%ymm11        # 7aa0 <_sk_callback_avx+0x338>
+  .byte  196,98,125,24,29,81,71,0,0          // vbroadcastss  0x4751(%rip),%ymm11        # 7adc <_sk_callback_avx+0x340>
   .byte  196,65,44,89,219                    // vmulps        %ymm11,%ymm10,%ymm11
   .byte  196,193,108,92,211                  // vsubps        %ymm11,%ymm2,%ymm2
-  .byte  196,98,125,24,29,58,71,0,0          // vbroadcastss  0x473a(%rip),%ymm11        # 7aa4 <_sk_callback_avx+0x33c>
+  .byte  196,98,125,24,29,66,71,0,0          // vbroadcastss  0x4742(%rip),%ymm11        # 7ae0 <_sk_callback_avx+0x344>
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
-  .byte  196,98,125,24,29,48,71,0,0          // vbroadcastss  0x4730(%rip),%ymm11        # 7aa8 <_sk_callback_avx+0x340>
+  .byte  196,98,125,24,29,56,71,0,0          // vbroadcastss  0x4738(%rip),%ymm11        # 7ae4 <_sk_callback_avx+0x348>
   .byte  196,65,36,94,210                    // vdivps        %ymm10,%ymm11,%ymm10
   .byte  196,193,108,88,210                  // vaddps        %ymm10,%ymm2,%ymm2
-  .byte  196,98,125,24,21,33,71,0,0          // vbroadcastss  0x4721(%rip),%ymm10        # 7aac <_sk_callback_avx+0x344>
+  .byte  196,98,125,24,21,41,71,0,0          // vbroadcastss  0x4729(%rip),%ymm10        # 7ae8 <_sk_callback_avx+0x34c>
   .byte  196,193,108,89,210                  // vmulps        %ymm10,%ymm2,%ymm2
   .byte  197,253,91,210                      // vcvtps2dq     %ymm2,%ymm2
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -20830,7 +20925,7 @@
   .byte  196,195,109,74,209,128              // vblendvps     %ymm8,%ymm9,%ymm2,%ymm2
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,108,95,208                  // vmaxps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,248,70,0,0          // vbroadcastss  0x46f8(%rip),%ymm8        # 7ab0 <_sk_callback_avx+0x348>
+  .byte  196,98,125,24,5,0,71,0,0            // vbroadcastss  0x4700(%rip),%ymm8        # 7aec <_sk_callback_avx+0x350>
   .byte  196,193,108,93,208                  // vminps        %ymm8,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -20852,36 +20947,36 @@
   .byte  196,193,100,88,219                  // vaddps        %ymm11,%ymm3,%ymm3
   .byte  196,98,125,24,16                    // vbroadcastss  (%rax),%ymm10
   .byte  197,124,91,219                      // vcvtdq2ps     %ymm3,%ymm11
-  .byte  196,98,125,24,37,169,70,0,0         // vbroadcastss  0x46a9(%rip),%ymm12        # 7ab4 <_sk_callback_avx+0x34c>
+  .byte  196,98,125,24,37,177,70,0,0         // vbroadcastss  0x46b1(%rip),%ymm12        # 7af0 <_sk_callback_avx+0x354>
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,159,70,0,0         // vbroadcastss  0x469f(%rip),%ymm12        # 7ab8 <_sk_callback_avx+0x350>
+  .byte  196,98,125,24,37,167,70,0,0         // vbroadcastss  0x46a7(%rip),%ymm12        # 7af4 <_sk_callback_avx+0x358>
   .byte  196,193,100,84,220                  // vandps        %ymm12,%ymm3,%ymm3
-  .byte  196,98,125,24,37,149,70,0,0         // vbroadcastss  0x4695(%rip),%ymm12        # 7abc <_sk_callback_avx+0x354>
+  .byte  196,98,125,24,37,157,70,0,0         // vbroadcastss  0x469d(%rip),%ymm12        # 7af8 <_sk_callback_avx+0x35c>
   .byte  196,193,100,86,220                  // vorps         %ymm12,%ymm3,%ymm3
-  .byte  196,98,125,24,37,139,70,0,0         // vbroadcastss  0x468b(%rip),%ymm12        # 7ac0 <_sk_callback_avx+0x358>
+  .byte  196,98,125,24,37,147,70,0,0         // vbroadcastss  0x4693(%rip),%ymm12        # 7afc <_sk_callback_avx+0x360>
   .byte  196,65,36,88,220                    // vaddps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,129,70,0,0         // vbroadcastss  0x4681(%rip),%ymm12        # 7ac4 <_sk_callback_avx+0x35c>
+  .byte  196,98,125,24,37,137,70,0,0         // vbroadcastss  0x4689(%rip),%ymm12        # 7b00 <_sk_callback_avx+0x364>
   .byte  196,65,100,89,228                   // vmulps        %ymm12,%ymm3,%ymm12
   .byte  196,65,36,92,220                    // vsubps        %ymm12,%ymm11,%ymm11
-  .byte  196,98,125,24,37,114,70,0,0         // vbroadcastss  0x4672(%rip),%ymm12        # 7ac8 <_sk_callback_avx+0x360>
+  .byte  196,98,125,24,37,122,70,0,0         // vbroadcastss  0x467a(%rip),%ymm12        # 7b04 <_sk_callback_avx+0x368>
   .byte  196,193,100,88,220                  // vaddps        %ymm12,%ymm3,%ymm3
-  .byte  196,98,125,24,37,104,70,0,0         // vbroadcastss  0x4668(%rip),%ymm12        # 7acc <_sk_callback_avx+0x364>
+  .byte  196,98,125,24,37,112,70,0,0         // vbroadcastss  0x4670(%rip),%ymm12        # 7b08 <_sk_callback_avx+0x36c>
   .byte  197,156,94,219                      // vdivps        %ymm3,%ymm12,%ymm3
   .byte  197,164,92,219                      // vsubps        %ymm3,%ymm11,%ymm3
   .byte  197,172,89,219                      // vmulps        %ymm3,%ymm10,%ymm3
   .byte  196,99,125,8,211,1                  // vroundps      $0x1,%ymm3,%ymm10
   .byte  196,65,100,92,210                   // vsubps        %ymm10,%ymm3,%ymm10
-  .byte  196,98,125,24,29,76,70,0,0          // vbroadcastss  0x464c(%rip),%ymm11        # 7ad0 <_sk_callback_avx+0x368>
+  .byte  196,98,125,24,29,84,70,0,0          // vbroadcastss  0x4654(%rip),%ymm11        # 7b0c <_sk_callback_avx+0x370>
   .byte  196,193,100,88,219                  // vaddps        %ymm11,%ymm3,%ymm3
-  .byte  196,98,125,24,29,66,70,0,0          // vbroadcastss  0x4642(%rip),%ymm11        # 7ad4 <_sk_callback_avx+0x36c>
+  .byte  196,98,125,24,29,74,70,0,0          // vbroadcastss  0x464a(%rip),%ymm11        # 7b10 <_sk_callback_avx+0x374>
   .byte  196,65,44,89,219                    // vmulps        %ymm11,%ymm10,%ymm11
   .byte  196,193,100,92,219                  // vsubps        %ymm11,%ymm3,%ymm3
-  .byte  196,98,125,24,29,51,70,0,0          // vbroadcastss  0x4633(%rip),%ymm11        # 7ad8 <_sk_callback_avx+0x370>
+  .byte  196,98,125,24,29,59,70,0,0          // vbroadcastss  0x463b(%rip),%ymm11        # 7b14 <_sk_callback_avx+0x378>
   .byte  196,65,36,92,210                    // vsubps        %ymm10,%ymm11,%ymm10
-  .byte  196,98,125,24,29,41,70,0,0          // vbroadcastss  0x4629(%rip),%ymm11        # 7adc <_sk_callback_avx+0x374>
+  .byte  196,98,125,24,29,49,70,0,0          // vbroadcastss  0x4631(%rip),%ymm11        # 7b18 <_sk_callback_avx+0x37c>
   .byte  196,65,36,94,210                    // vdivps        %ymm10,%ymm11,%ymm10
   .byte  196,193,100,88,218                  // vaddps        %ymm10,%ymm3,%ymm3
-  .byte  196,98,125,24,21,26,70,0,0          // vbroadcastss  0x461a(%rip),%ymm10        # 7ae0 <_sk_callback_avx+0x378>
+  .byte  196,98,125,24,21,34,70,0,0          // vbroadcastss  0x4622(%rip),%ymm10        # 7b1c <_sk_callback_avx+0x380>
   .byte  196,193,100,89,218                  // vmulps        %ymm10,%ymm3,%ymm3
   .byte  197,253,91,219                      // vcvtps2dq     %ymm3,%ymm3
   .byte  196,98,125,24,80,20                 // vbroadcastss  0x14(%rax),%ymm10
@@ -20889,7 +20984,7 @@
   .byte  196,195,101,74,217,128              // vblendvps     %ymm8,%ymm9,%ymm3,%ymm3
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  196,193,100,95,216                  // vmaxps        %ymm8,%ymm3,%ymm3
-  .byte  196,98,125,24,5,241,69,0,0          // vbroadcastss  0x45f1(%rip),%ymm8        # 7ae4 <_sk_callback_avx+0x37c>
+  .byte  196,98,125,24,5,249,69,0,0          // vbroadcastss  0x45f9(%rip),%ymm8        # 7b20 <_sk_callback_avx+0x384>
   .byte  196,193,100,93,216                  // vminps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -20898,31 +20993,31 @@
 .globl _sk_lab_to_xyz_avx
 FUNCTION(_sk_lab_to_xyz_avx)
 _sk_lab_to_xyz_avx:
-  .byte  196,98,125,24,5,227,69,0,0          // vbroadcastss  0x45e3(%rip),%ymm8        # 7ae8 <_sk_callback_avx+0x380>
+  .byte  196,98,125,24,5,235,69,0,0          // vbroadcastss  0x45eb(%rip),%ymm8        # 7b24 <_sk_callback_avx+0x388>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,217,69,0,0          // vbroadcastss  0x45d9(%rip),%ymm8        # 7aec <_sk_callback_avx+0x384>
+  .byte  196,98,125,24,5,225,69,0,0          // vbroadcastss  0x45e1(%rip),%ymm8        # 7b28 <_sk_callback_avx+0x38c>
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
-  .byte  196,98,125,24,13,207,69,0,0         // vbroadcastss  0x45cf(%rip),%ymm9        # 7af0 <_sk_callback_avx+0x388>
+  .byte  196,98,125,24,13,215,69,0,0         // vbroadcastss  0x45d7(%rip),%ymm9        # 7b2c <_sk_callback_avx+0x390>
   .byte  196,193,116,88,201                  // vaddps        %ymm9,%ymm1,%ymm1
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  196,193,108,88,209                  // vaddps        %ymm9,%ymm2,%ymm2
-  .byte  196,98,125,24,5,187,69,0,0          // vbroadcastss  0x45bb(%rip),%ymm8        # 7af4 <_sk_callback_avx+0x38c>
+  .byte  196,98,125,24,5,195,69,0,0          // vbroadcastss  0x45c3(%rip),%ymm8        # 7b30 <_sk_callback_avx+0x394>
   .byte  196,193,124,88,192                  // vaddps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,177,69,0,0          // vbroadcastss  0x45b1(%rip),%ymm8        # 7af8 <_sk_callback_avx+0x390>
+  .byte  196,98,125,24,5,185,69,0,0          // vbroadcastss  0x45b9(%rip),%ymm8        # 7b34 <_sk_callback_avx+0x398>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,5,167,69,0,0          // vbroadcastss  0x45a7(%rip),%ymm8        # 7afc <_sk_callback_avx+0x394>
+  .byte  196,98,125,24,5,175,69,0,0          // vbroadcastss  0x45af(%rip),%ymm8        # 7b38 <_sk_callback_avx+0x39c>
   .byte  196,193,116,89,200                  // vmulps        %ymm8,%ymm1,%ymm1
   .byte  197,252,88,201                      // vaddps        %ymm1,%ymm0,%ymm1
-  .byte  196,98,125,24,5,153,69,0,0          // vbroadcastss  0x4599(%rip),%ymm8        # 7b00 <_sk_callback_avx+0x398>
+  .byte  196,98,125,24,5,161,69,0,0          // vbroadcastss  0x45a1(%rip),%ymm8        # 7b3c <_sk_callback_avx+0x3a0>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  197,252,92,210                      // vsubps        %ymm2,%ymm0,%ymm2
   .byte  197,116,89,193                      // vmulps        %ymm1,%ymm1,%ymm8
   .byte  196,65,116,89,192                   // vmulps        %ymm8,%ymm1,%ymm8
-  .byte  196,98,125,24,13,130,69,0,0         // vbroadcastss  0x4582(%rip),%ymm9        # 7b04 <_sk_callback_avx+0x39c>
+  .byte  196,98,125,24,13,138,69,0,0         // vbroadcastss  0x458a(%rip),%ymm9        # 7b40 <_sk_callback_avx+0x3a4>
   .byte  196,65,52,194,208,1                 // vcmpltps      %ymm8,%ymm9,%ymm10
-  .byte  196,98,125,24,29,119,69,0,0         // vbroadcastss  0x4577(%rip),%ymm11        # 7b08 <_sk_callback_avx+0x3a0>
+  .byte  196,98,125,24,29,127,69,0,0         // vbroadcastss  0x457f(%rip),%ymm11        # 7b44 <_sk_callback_avx+0x3a8>
   .byte  196,193,116,88,203                  // vaddps        %ymm11,%ymm1,%ymm1
-  .byte  196,98,125,24,37,109,69,0,0         // vbroadcastss  0x456d(%rip),%ymm12        # 7b0c <_sk_callback_avx+0x3a4>
+  .byte  196,98,125,24,37,117,69,0,0         // vbroadcastss  0x4575(%rip),%ymm12        # 7b48 <_sk_callback_avx+0x3ac>
   .byte  196,193,116,89,204                  // vmulps        %ymm12,%ymm1,%ymm1
   .byte  196,67,117,74,192,160               // vblendvps     %ymm10,%ymm8,%ymm1,%ymm8
   .byte  197,252,89,200                      // vmulps        %ymm0,%ymm0,%ymm1
@@ -20937,9 +21032,9 @@
   .byte  196,193,108,88,211                  // vaddps        %ymm11,%ymm2,%ymm2
   .byte  196,193,108,89,212                  // vmulps        %ymm12,%ymm2,%ymm2
   .byte  196,227,109,74,208,144              // vblendvps     %ymm9,%ymm0,%ymm2,%ymm2
-  .byte  196,226,125,24,5,35,69,0,0          // vbroadcastss  0x4523(%rip),%ymm0        # 7b10 <_sk_callback_avx+0x3a8>
+  .byte  196,226,125,24,5,43,69,0,0          // vbroadcastss  0x452b(%rip),%ymm0        # 7b4c <_sk_callback_avx+0x3b0>
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
-  .byte  196,98,125,24,5,26,69,0,0           // vbroadcastss  0x451a(%rip),%ymm8        # 7b14 <_sk_callback_avx+0x3ac>
+  .byte  196,98,125,24,5,34,69,0,0           // vbroadcastss  0x4522(%rip),%ymm8        # 7b50 <_sk_callback_avx+0x3b4>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -20951,15 +21046,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           364f <_sk_load_a8_avx+0x4c>
+  .byte  117,66                              // jne           3683 <_sk_load_a8_avx+0x4c>
   .byte  196,194,121,48,4,19                 // vpmovzxbw     (%r11,%rdx,1),%xmm0
-  .byte  197,249,219,5,245,71,0,0            // vpand         0x47f5(%rip),%xmm0,%xmm0        # 7e10 <_sk_callback_avx+0x6a8>
+  .byte  197,249,219,5,1,72,0,0              // vpand         0x4801(%rip),%xmm0,%xmm0        # 7e50 <_sk_callback_avx+0x6b4>
   .byte  197,241,239,201                     // vpxor         %xmm1,%xmm1,%xmm1
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,221,68,0,0        // vbroadcastss  0x44dd(%rip),%ymm1        # 7b18 <_sk_callback_avx+0x3b0>
+  .byte  196,226,125,24,13,229,68,0,0        // vbroadcastss  0x44e5(%rip),%ymm1        # 7b54 <_sk_callback_avx+0x3b8>
   .byte  197,252,89,217                      // vmulps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -20971,15 +21066,15 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,176                             // ja            3613 <_sk_load_a8_avx+0x10>
+  .byte  119,176                             // ja            3647 <_sk_load_a8_avx+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 36e8 <_sk_load_a8_avx+0xe5>
+  .byte  76,141,21,122,0,0,0                 // lea           0x7a(%rip),%r10        # 371c <_sk_load_a8_avx+0xe5>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  235,145                             // jmp           3613 <_sk_load_a8_avx+0x10>
+  .byte  235,145                             // jmp           3647 <_sk_load_a8_avx+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,2                   // vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -20987,7 +21082,7 @@
   .byte  197,249,110,200                     // vmovd         %eax,%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,121,14,193,3                // vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  .byte  233,105,255,255,255                 // jmpq          3613 <_sk_load_a8_avx+0x10>
+  .byte  233,105,255,255,255                 // jmpq          3647 <_sk_load_a8_avx+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,6                   // vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -20998,7 +21093,7 @@
   .byte  196,193,121,110,12,19               // vmovd         (%r11,%rdx,1),%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,113,14,192,240              // vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  .byte  233,46,255,255,255                  // jmpq          3613 <_sk_load_a8_avx+0x10>
+  .byte  233,46,255,255,255                  // jmpq          3647 <_sk_load_a8_avx+0x10>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  143                                 // (bad)
   .byte  255                                 // (bad)
@@ -21027,15 +21122,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           3750 <_sk_load_a8_dst_avx+0x4c>
+  .byte  117,66                              // jne           3784 <_sk_load_a8_dst_avx+0x4c>
   .byte  196,194,121,48,36,19                // vpmovzxbw     (%r11,%rdx,1),%xmm4
-  .byte  197,217,219,37,4,71,0,0             // vpand         0x4704(%rip),%xmm4,%xmm4        # 7e20 <_sk_callback_avx+0x6b8>
+  .byte  197,217,219,37,16,71,0,0            // vpand         0x4710(%rip),%xmm4,%xmm4        # 7e60 <_sk_callback_avx+0x6c4>
   .byte  197,209,239,237                     // vpxor         %xmm5,%xmm5,%xmm5
   .byte  197,217,105,237                     // vpunpckhwd    %xmm5,%xmm4,%xmm5
   .byte  196,226,121,51,228                  // vpmovzxwd     %xmm4,%xmm4
   .byte  196,227,93,24,229,1                 // vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,224,67,0,0        // vbroadcastss  0x43e0(%rip),%ymm5        # 7b1c <_sk_callback_avx+0x3b4>
+  .byte  196,226,125,24,45,232,67,0,0        // vbroadcastss  0x43e8(%rip),%ymm5        # 7b58 <_sk_callback_avx+0x3bc>
   .byte  197,220,89,253                      // vmulps        %ymm5,%ymm4,%ymm7
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,220,87,228                      // vxorps        %ymm4,%ymm4,%ymm4
@@ -21047,15 +21142,15 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,176                             // ja            3714 <_sk_load_a8_dst_avx+0x10>
+  .byte  119,176                             // ja            3748 <_sk_load_a8_dst_avx+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,121,0,0,0                 // lea           0x79(%rip),%r10        # 37e8 <_sk_load_a8_dst_avx+0xe4>
+  .byte  76,141,21,121,0,0,0                 // lea           0x79(%rip),%r10        # 381c <_sk_load_a8_dst_avx+0xe4>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  235,145                             // jmp           3714 <_sk_load_a8_dst_avx+0x10>
+  .byte  235,145                             // jmp           3748 <_sk_load_a8_dst_avx+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,2                   // vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -21063,7 +21158,7 @@
   .byte  197,249,110,232                     // vmovd         %eax,%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,89,14,229,3                 // vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  .byte  233,105,255,255,255                 // jmpq          3714 <_sk_load_a8_dst_avx+0x10>
+  .byte  233,105,255,255,255                 // jmpq          3748 <_sk_load_a8_dst_avx+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,6                   // vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -21074,7 +21169,7 @@
   .byte  196,193,121,110,44,19               // vmovd         (%r11,%rdx,1),%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,81,14,228,240               // vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  .byte  233,46,255,255,255                  // jmpq          3714 <_sk_load_a8_dst_avx+0x10>
+  .byte  233,46,255,255,255                  // jmpq          3748 <_sk_load_a8_dst_avx+0x10>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  144                                 // nop
   .byte  255                                 // (bad)
@@ -21083,7 +21178,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  232,255,255,255,221                 // callq         ffffffffde0037f8 <_sk_callback_avx+0xffffffffddffc090>
+  .byte  232,255,255,255,221                 // callq         ffffffffde00382c <_sk_callback_avx+0xffffffffddffc090>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,210                             // callq         *%rdx
@@ -21138,7 +21233,7 @@
   .byte  196,226,121,49,192                  // vpmovzxbd     %xmm0,%xmm0
   .byte  196,227,117,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,80,66,0,0         // vbroadcastss  0x4250(%rip),%ymm1        # 7b20 <_sk_callback_avx+0x3b8>
+  .byte  196,226,125,24,13,88,66,0,0         // vbroadcastss  0x4258(%rip),%ymm1        # 7b5c <_sk_callback_avx+0x3c0>
   .byte  197,252,89,217                      // vmulps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
@@ -21152,14 +21247,14 @@
 _sk_store_a8_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
-  .byte  196,98,125,24,5,50,66,0,0           // vbroadcastss  0x4232(%rip),%ymm8        # 7b24 <_sk_callback_avx+0x3bc>
+  .byte  196,98,125,24,5,58,66,0,0           // vbroadcastss  0x423a(%rip),%ymm8        # 7b60 <_sk_callback_avx+0x3c4>
   .byte  196,65,100,89,192                   // vmulps        %ymm8,%ymm3,%ymm8
   .byte  196,65,125,91,192                   // vcvtps2dq     %ymm8,%ymm8
   .byte  196,67,125,25,193,1                 // vextractf128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  196,65,57,103,192                   // vpackuswb     %xmm8,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           391b <_sk_store_a8_avx+0x37>
+  .byte  117,10                              // jne           394f <_sk_store_a8_avx+0x37>
   .byte  196,65,123,17,4,19                  // vmovsd        %xmm8,(%r11,%rdx,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -21167,25 +21262,25 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            3917 <_sk_store_a8_avx+0x33>
+  .byte  119,236                             // ja            394b <_sk_store_a8_avx+0x33>
   .byte  196,66,121,48,192                   // vpmovzxbw     %xmm8,%xmm8
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,85,0,0,0                  // lea           0x55(%rip),%r10        # 3990 <_sk_store_a8_avx+0xac>
+  .byte  76,141,21,85,0,0,0                  // lea           0x55(%rip),%r10        # 39c4 <_sk_store_a8_avx+0xac>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,20,4,19,0                // vpextrb       $0x0,%xmm8,(%r11,%rdx,1)
-  .byte  235,202                             // jmp           3917 <_sk_store_a8_avx+0x33>
+  .byte  235,202                             // jmp           394b <_sk_store_a8_avx+0x33>
   .byte  196,67,121,20,68,19,2,4             // vpextrb       $0x4,%xmm8,0x2(%r11,%rdx,1)
-  .byte  196,98,57,0,5,210,68,0,0            // vpshufb       0x44d2(%rip),%xmm8,%xmm8        # 7e30 <_sk_callback_avx+0x6c8>
+  .byte  196,98,57,0,5,222,68,0,0            // vpshufb       0x44de(%rip),%xmm8,%xmm8        # 7e70 <_sk_callback_avx+0x6d4>
   .byte  196,67,121,21,4,19,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,1)
-  .byte  235,176                             // jmp           3917 <_sk_store_a8_avx+0x33>
+  .byte  235,176                             // jmp           394b <_sk_store_a8_avx+0x33>
   .byte  196,67,121,20,68,19,6,12            // vpextrb       $0xc,%xmm8,0x6(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,5,10            // vpextrb       $0xa,%xmm8,0x5(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,4,8             // vpextrb       $0x8,%xmm8,0x4(%r11,%rdx,1)
-  .byte  196,98,57,0,5,184,68,0,0            // vpshufb       0x44b8(%rip),%xmm8,%xmm8        # 7e40 <_sk_callback_avx+0x6d8>
+  .byte  196,98,57,0,5,196,68,0,0            // vpshufb       0x44c4(%rip),%xmm8,%xmm8        # 7e80 <_sk_callback_avx+0x6e4>
   .byte  196,65,121,126,4,19                 // vmovd         %xmm8,(%r11,%rdx,1)
-  .byte  235,135                             // jmp           3917 <_sk_store_a8_avx+0x33>
+  .byte  235,135                             // jmp           394b <_sk_store_a8_avx+0x33>
   .byte  180,255                             // mov           $0xff,%ah
   .byte  255                                 // (bad)
   .byte  255,197                             // inc           %ebp
@@ -21213,18 +21308,18 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,71                              // jne           39fd <_sk_load_g8_avx+0x51>
+  .byte  117,71                              // jne           3a31 <_sk_load_g8_avx+0x51>
   .byte  196,194,121,48,4,19                 // vpmovzxbw     (%r11,%rdx,1),%xmm0
-  .byte  197,249,219,5,140,68,0,0            // vpand         0x448c(%rip),%xmm0,%xmm0        # 7e50 <_sk_callback_avx+0x6e8>
+  .byte  197,249,219,5,152,68,0,0            // vpand         0x4498(%rip),%xmm0,%xmm0        # 7e90 <_sk_callback_avx+0x6f4>
   .byte  197,241,239,201                     // vpxor         %xmm1,%xmm1,%xmm1
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,68,65,0,0         // vbroadcastss  0x4144(%rip),%ymm1        # 7b28 <_sk_callback_avx+0x3c0>
+  .byte  196,226,125,24,13,76,65,0,0         // vbroadcastss  0x414c(%rip),%ymm1        # 7b64 <_sk_callback_avx+0x3c8>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,57,65,0,0         // vbroadcastss  0x4139(%rip),%ymm3        # 7b2c <_sk_callback_avx+0x3c4>
+  .byte  196,226,125,24,29,65,65,0,0         // vbroadcastss  0x4141(%rip),%ymm3        # 7b68 <_sk_callback_avx+0x3cc>
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
   .byte  255,224                             // jmpq          *%rax
@@ -21233,15 +21328,15 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,171                             // ja            39bc <_sk_load_g8_avx+0x10>
+  .byte  119,171                             // ja            39f0 <_sk_load_g8_avx+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,120,0,0,0                 // lea           0x78(%rip),%r10        # 3a94 <_sk_load_g8_avx+0xe8>
+  .byte  76,141,21,120,0,0,0                 // lea           0x78(%rip),%r10        # 3ac8 <_sk_load_g8_avx+0xe8>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  235,140                             // jmp           39bc <_sk_load_g8_avx+0x10>
+  .byte  235,140                             // jmp           39f0 <_sk_load_g8_avx+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,2                   // vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -21249,7 +21344,7 @@
   .byte  197,249,110,200                     // vmovd         %eax,%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,121,14,193,3                // vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  .byte  233,100,255,255,255                 // jmpq          39bc <_sk_load_g8_avx+0x10>
+  .byte  233,100,255,255,255                 // jmpq          39f0 <_sk_load_g8_avx+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  197,249,196,192,6                   // vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -21260,7 +21355,7 @@
   .byte  196,193,121,110,12,19               // vmovd         (%r11,%rdx,1),%xmm1
   .byte  196,226,121,48,201                  // vpmovzxbw     %xmm1,%xmm1
   .byte  196,227,113,14,192,240              // vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  .byte  233,41,255,255,255                  // jmpq          39bc <_sk_load_g8_avx+0x10>
+  .byte  233,41,255,255,255                  // jmpq          39f0 <_sk_load_g8_avx+0x10>
   .byte  144                                 // nop
   .byte  145                                 // xchg          %eax,%ecx
   .byte  255                                 // (bad)
@@ -21269,7 +21364,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  233,255,255,255,222                 // jmpq          ffffffffdf003aa4 <_sk_callback_avx+0xffffffffdeffc33c>
+  .byte  233,255,255,255,222                 // jmpq          ffffffffdf003ad8 <_sk_callback_avx+0xffffffffdeffc33c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,211                             // callq         *%rbx
@@ -21287,18 +21382,18 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,71                              // jne           3b01 <_sk_load_g8_dst_avx+0x51>
+  .byte  117,71                              // jne           3b35 <_sk_load_g8_dst_avx+0x51>
   .byte  196,194,121,48,36,19                // vpmovzxbw     (%r11,%rdx,1),%xmm4
-  .byte  197,217,219,37,152,67,0,0           // vpand         0x4398(%rip),%xmm4,%xmm4        # 7e60 <_sk_callback_avx+0x6f8>
+  .byte  197,217,219,37,164,67,0,0           // vpand         0x43a4(%rip),%xmm4,%xmm4        # 7ea0 <_sk_callback_avx+0x704>
   .byte  197,209,239,237                     // vpxor         %xmm5,%xmm5,%xmm5
   .byte  197,217,105,237                     // vpunpckhwd    %xmm5,%xmm4,%xmm5
   .byte  196,226,121,51,228                  // vpmovzxwd     %xmm4,%xmm4
   .byte  196,227,93,24,229,1                 // vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,72,64,0,0         // vbroadcastss  0x4048(%rip),%ymm5        # 7b30 <_sk_callback_avx+0x3c8>
+  .byte  196,226,125,24,45,80,64,0,0         // vbroadcastss  0x4050(%rip),%ymm5        # 7b6c <_sk_callback_avx+0x3d0>
   .byte  197,220,89,229                      // vmulps        %ymm5,%ymm4,%ymm4
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,61,61,64,0,0         // vbroadcastss  0x403d(%rip),%ymm7        # 7b34 <_sk_callback_avx+0x3cc>
+  .byte  196,226,125,24,61,69,64,0,0         // vbroadcastss  0x4045(%rip),%ymm7        # 7b70 <_sk_callback_avx+0x3d4>
   .byte  197,252,40,236                      // vmovaps       %ymm4,%ymm5
   .byte  197,252,40,244                      // vmovaps       %ymm4,%ymm6
   .byte  255,224                             // jmpq          *%rax
@@ -21307,15 +21402,15 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,171                             // ja            3ac0 <_sk_load_g8_dst_avx+0x10>
+  .byte  119,171                             // ja            3af4 <_sk_load_g8_dst_avx+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,120,0,0,0                 // lea           0x78(%rip),%r10        # 3b98 <_sk_load_g8_dst_avx+0xe8>
+  .byte  76,141,21,120,0,0,0                 // lea           0x78(%rip),%r10        # 3bcc <_sk_load_g8_dst_avx+0xe8>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  235,140                             // jmp           3ac0 <_sk_load_g8_dst_avx+0x10>
+  .byte  235,140                             // jmp           3af4 <_sk_load_g8_dst_avx+0x10>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,2                   // vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -21323,7 +21418,7 @@
   .byte  197,249,110,232                     // vmovd         %eax,%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,89,14,229,3                 // vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  .byte  233,100,255,255,255                 // jmpq          3ac0 <_sk_load_g8_dst_avx+0x10>
+  .byte  233,100,255,255,255                 // jmpq          3af4 <_sk_load_g8_dst_avx+0x10>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  197,217,196,224,6                   // vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -21334,7 +21429,7 @@
   .byte  196,193,121,110,44,19               // vmovd         (%r11,%rdx,1),%xmm5
   .byte  196,226,121,48,237                  // vpmovzxbw     %xmm5,%xmm5
   .byte  196,227,81,14,228,240               // vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  .byte  233,41,255,255,255                  // jmpq          3ac0 <_sk_load_g8_dst_avx+0x10>
+  .byte  233,41,255,255,255                  // jmpq          3af4 <_sk_load_g8_dst_avx+0x10>
   .byte  144                                 // nop
   .byte  145                                 // xchg          %eax,%ecx
   .byte  255                                 // (bad)
@@ -21343,7 +21438,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  233,255,255,255,222                 // jmpq          ffffffffdf003ba8 <_sk_callback_avx+0xffffffffdeffc440>
+  .byte  233,255,255,255,222                 // jmpq          ffffffffdf003bdc <_sk_callback_avx+0xffffffffdeffc440>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,211                             // callq         *%rbx
@@ -21398,10 +21493,10 @@
   .byte  196,226,121,49,192                  // vpmovzxbd     %xmm0,%xmm0
   .byte  196,227,117,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,184,62,0,0        // vbroadcastss  0x3eb8(%rip),%ymm1        # 7b38 <_sk_callback_avx+0x3d0>
+  .byte  196,226,125,24,13,192,62,0,0        // vbroadcastss  0x3ec0(%rip),%ymm1        # 7b74 <_sk_callback_avx+0x3d8>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,173,62,0,0        // vbroadcastss  0x3ead(%rip),%ymm3        # 7b3c <_sk_callback_avx+0x3d4>
+  .byte  196,226,125,24,29,181,62,0,0        // vbroadcastss  0x3eb5(%rip),%ymm3        # 7b78 <_sk_callback_avx+0x3dc>
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
   .byte  197,252,40,208                      // vmovaps       %ymm0,%ymm2
   .byte  255,224                             // jmpq          *%rax
@@ -21413,9 +21508,9 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,137,193                          // mov           %rax,%r9
   .byte  77,133,201                          // test          %r9,%r9
-  .byte  116,5                               // je            3ca8 <_sk_gather_i8_avx+0xf>
+  .byte  116,5                               // je            3cdc <_sk_gather_i8_avx+0xf>
   .byte  76,137,200                          // mov           %r9,%rax
-  .byte  235,2                               // jmp           3caa <_sk_gather_i8_avx+0x11>
+  .byte  235,2                               // jmp           3cde <_sk_gather_i8_avx+0x11>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  83                                  // push          %rbx
   .byte  76,139,16                           // mov           (%rax),%r10
@@ -21473,10 +21568,10 @@
   .byte  72,193,235,30                       // shr           $0x1e,%rbx
   .byte  196,195,121,34,28,27,3              // vpinsrd       $0x3,(%r11,%rbx,1),%xmm0,%xmm3
   .byte  196,227,61,24,195,1                 // vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  .byte  197,124,40,21,184,65,0,0            // vmovaps       0x41b8(%rip),%ymm10        # 7f80 <_sk_callback_avx+0x818>
+  .byte  197,124,40,21,196,65,0,0            // vmovaps       0x41c4(%rip),%ymm10        # 7fc0 <_sk_callback_avx+0x824>
   .byte  196,193,124,84,194                  // vandps        %ymm10,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,13,102,61,0,0         // vbroadcastss  0x3d66(%rip),%ymm9        # 7b40 <_sk_callback_avx+0x3d8>
+  .byte  196,98,125,24,13,110,61,0,0         // vbroadcastss  0x3d6e(%rip),%ymm9        # 7b7c <_sk_callback_avx+0x3e0>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  196,193,113,114,208,8               // vpsrld        $0x8,%xmm8,%xmm1
   .byte  197,233,114,211,8                   // vpsrld        $0x8,%xmm3,%xmm2
@@ -21506,56 +21601,56 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,128,0,0,0                    // jne           3eca <_sk_load_565_avx+0x8e>
+  .byte  15,133,128,0,0,0                    // jne           3efe <_sk_load_565_avx+0x8e>
   .byte  196,193,122,111,4,83                // vmovdqu       (%r11,%rdx,2),%xmm0
   .byte  197,241,239,201                     // vpxor         %xmm1,%xmm1,%xmm1
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,209,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm2
-  .byte  196,226,125,24,5,216,60,0,0         // vbroadcastss  0x3cd8(%rip),%ymm0        # 7b44 <_sk_callback_avx+0x3dc>
+  .byte  196,226,125,24,5,224,60,0,0         // vbroadcastss  0x3ce0(%rip),%ymm0        # 7b80 <_sk_callback_avx+0x3e4>
   .byte  197,236,84,192                      // vandps        %ymm0,%ymm2,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,203,60,0,0        // vbroadcastss  0x3ccb(%rip),%ymm1        # 7b48 <_sk_callback_avx+0x3e0>
+  .byte  196,226,125,24,13,211,60,0,0        // vbroadcastss  0x3cd3(%rip),%ymm1        # 7b84 <_sk_callback_avx+0x3e8>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,194,60,0,0        // vbroadcastss  0x3cc2(%rip),%ymm1        # 7b4c <_sk_callback_avx+0x3e4>
+  .byte  196,226,125,24,13,202,60,0,0        // vbroadcastss  0x3cca(%rip),%ymm1        # 7b88 <_sk_callback_avx+0x3ec>
   .byte  197,236,84,201                      // vandps        %ymm1,%ymm2,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,29,181,60,0,0        // vbroadcastss  0x3cb5(%rip),%ymm3        # 7b50 <_sk_callback_avx+0x3e8>
+  .byte  196,226,125,24,29,189,60,0,0        // vbroadcastss  0x3cbd(%rip),%ymm3        # 7b8c <_sk_callback_avx+0x3f0>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
-  .byte  196,226,125,24,29,172,60,0,0        // vbroadcastss  0x3cac(%rip),%ymm3        # 7b54 <_sk_callback_avx+0x3ec>
+  .byte  196,226,125,24,29,180,60,0,0        // vbroadcastss  0x3cb4(%rip),%ymm3        # 7b90 <_sk_callback_avx+0x3f4>
   .byte  197,236,84,211                      // vandps        %ymm3,%ymm2,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,226,125,24,29,159,60,0,0        // vbroadcastss  0x3c9f(%rip),%ymm3        # 7b58 <_sk_callback_avx+0x3f0>
+  .byte  196,226,125,24,29,167,60,0,0        // vbroadcastss  0x3ca7(%rip),%ymm3        # 7b94 <_sk_callback_avx+0x3f8>
   .byte  197,236,89,211                      // vmulps        %ymm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,148,60,0,0        // vbroadcastss  0x3c94(%rip),%ymm3        # 7b5c <_sk_callback_avx+0x3f4>
+  .byte  196,226,125,24,29,156,60,0,0        // vbroadcastss  0x3c9c(%rip),%ymm3        # 7b98 <_sk_callback_avx+0x3fc>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,110,255,255,255              // ja            3e50 <_sk_load_565_avx+0x14>
+  .byte  15,135,110,255,255,255              // ja            3e84 <_sk_load_565_avx+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 3f50 <_sk_load_565_avx+0x114>
+  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 3f84 <_sk_load_565_avx+0x114>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  233,76,255,255,255                  // jmpq          3e50 <_sk_load_565_avx+0x14>
+  .byte  233,76,255,255,255                  // jmpq          3e84 <_sk_load_565_avx+0x14>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,110,12,83               // vmovd         (%r11,%rdx,2),%xmm1
   .byte  196,227,121,14,193,3                // vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  .byte  233,47,255,255,255                  // jmpq          3e50 <_sk_load_565_avx+0x14>
+  .byte  233,47,255,255,255                  // jmpq          3e84 <_sk_load_565_avx+0x14>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,122,126,12,83               // vmovq         (%r11,%rdx,2),%xmm1
   .byte  196,227,113,14,192,240              // vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  .byte  233,2,255,255,255                   // jmpq          3e50 <_sk_load_565_avx+0x14>
+  .byte  233,2,255,255,255                   // jmpq          3e84 <_sk_load_565_avx+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  166                                 // cmpsb         %es:(%rdi),%ds:(%rsi)
   .byte  255                                 // (bad)
@@ -21583,56 +21678,56 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,128,0,0,0                    // jne           3ffa <_sk_load_565_dst_avx+0x8e>
+  .byte  15,133,128,0,0,0                    // jne           402e <_sk_load_565_dst_avx+0x8e>
   .byte  196,193,122,111,36,83               // vmovdqu       (%r11,%rdx,2),%xmm4
   .byte  197,209,239,237                     // vpxor         %xmm5,%xmm5,%xmm5
   .byte  197,217,105,237                     // vpunpckhwd    %xmm5,%xmm4,%xmm5
   .byte  196,226,121,51,228                  // vpmovzxwd     %xmm4,%xmm4
   .byte  196,227,93,24,245,1                 // vinsertf128   $0x1,%xmm5,%ymm4,%ymm6
-  .byte  196,226,125,24,37,196,59,0,0        // vbroadcastss  0x3bc4(%rip),%ymm4        # 7b60 <_sk_callback_avx+0x3f8>
+  .byte  196,226,125,24,37,204,59,0,0        // vbroadcastss  0x3bcc(%rip),%ymm4        # 7b9c <_sk_callback_avx+0x400>
   .byte  197,204,84,228                      // vandps        %ymm4,%ymm6,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,183,59,0,0        // vbroadcastss  0x3bb7(%rip),%ymm5        # 7b64 <_sk_callback_avx+0x3fc>
+  .byte  196,226,125,24,45,191,59,0,0        // vbroadcastss  0x3bbf(%rip),%ymm5        # 7ba0 <_sk_callback_avx+0x404>
   .byte  197,220,89,229                      // vmulps        %ymm5,%ymm4,%ymm4
-  .byte  196,226,125,24,45,174,59,0,0        // vbroadcastss  0x3bae(%rip),%ymm5        # 7b68 <_sk_callback_avx+0x400>
+  .byte  196,226,125,24,45,182,59,0,0        // vbroadcastss  0x3bb6(%rip),%ymm5        # 7ba4 <_sk_callback_avx+0x408>
   .byte  197,204,84,237                      // vandps        %ymm5,%ymm6,%ymm5
   .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
-  .byte  196,226,125,24,61,161,59,0,0        // vbroadcastss  0x3ba1(%rip),%ymm7        # 7b6c <_sk_callback_avx+0x404>
+  .byte  196,226,125,24,61,169,59,0,0        // vbroadcastss  0x3ba9(%rip),%ymm7        # 7ba8 <_sk_callback_avx+0x40c>
   .byte  197,212,89,239                      // vmulps        %ymm7,%ymm5,%ymm5
-  .byte  196,226,125,24,61,152,59,0,0        // vbroadcastss  0x3b98(%rip),%ymm7        # 7b70 <_sk_callback_avx+0x408>
+  .byte  196,226,125,24,61,160,59,0,0        // vbroadcastss  0x3ba0(%rip),%ymm7        # 7bac <_sk_callback_avx+0x410>
   .byte  197,204,84,247                      // vandps        %ymm7,%ymm6,%ymm6
   .byte  197,252,91,246                      // vcvtdq2ps     %ymm6,%ymm6
-  .byte  196,226,125,24,61,139,59,0,0        // vbroadcastss  0x3b8b(%rip),%ymm7        # 7b74 <_sk_callback_avx+0x40c>
+  .byte  196,226,125,24,61,147,59,0,0        // vbroadcastss  0x3b93(%rip),%ymm7        # 7bb0 <_sk_callback_avx+0x414>
   .byte  197,204,89,247                      // vmulps        %ymm7,%ymm6,%ymm6
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,61,128,59,0,0        // vbroadcastss  0x3b80(%rip),%ymm7        # 7b78 <_sk_callback_avx+0x410>
+  .byte  196,226,125,24,61,136,59,0,0        // vbroadcastss  0x3b88(%rip),%ymm7        # 7bb4 <_sk_callback_avx+0x418>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,110,255,255,255              // ja            3f80 <_sk_load_565_dst_avx+0x14>
+  .byte  15,135,110,255,255,255              // ja            3fb4 <_sk_load_565_dst_avx+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 4080 <_sk_load_565_dst_avx+0x114>
+  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 40b4 <_sk_load_565_dst_avx+0x114>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  233,76,255,255,255                  // jmpq          3f80 <_sk_load_565_dst_avx+0x14>
+  .byte  233,76,255,255,255                  // jmpq          3fb4 <_sk_load_565_dst_avx+0x14>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,121,110,44,83               // vmovd         (%r11,%rdx,2),%xmm5
   .byte  196,227,89,14,229,3                 // vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  .byte  233,47,255,255,255                  // jmpq          3f80 <_sk_load_565_dst_avx+0x14>
+  .byte  233,47,255,255,255                  // jmpq          3fb4 <_sk_load_565_dst_avx+0x14>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,122,126,44,83               // vmovq         (%r11,%rdx,2),%xmm5
   .byte  196,227,81,14,228,240               // vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  .byte  233,2,255,255,255                   // jmpq          3f80 <_sk_load_565_dst_avx+0x14>
+  .byte  233,2,255,255,255                   // jmpq          3fb4 <_sk_load_565_dst_avx+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  166                                 // cmpsb         %es:(%rdi),%ds:(%rsi)
   .byte  255                                 // (bad)
@@ -21701,23 +21796,23 @@
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,209,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm2
-  .byte  196,226,125,24,5,14,58,0,0          // vbroadcastss  0x3a0e(%rip),%ymm0        # 7b7c <_sk_callback_avx+0x414>
+  .byte  196,226,125,24,5,22,58,0,0          // vbroadcastss  0x3a16(%rip),%ymm0        # 7bb8 <_sk_callback_avx+0x41c>
   .byte  197,236,84,192                      // vandps        %ymm0,%ymm2,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,1,58,0,0          // vbroadcastss  0x3a01(%rip),%ymm1        # 7b80 <_sk_callback_avx+0x418>
+  .byte  196,226,125,24,13,9,58,0,0          // vbroadcastss  0x3a09(%rip),%ymm1        # 7bbc <_sk_callback_avx+0x420>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,248,57,0,0        // vbroadcastss  0x39f8(%rip),%ymm1        # 7b84 <_sk_callback_avx+0x41c>
+  .byte  196,226,125,24,13,0,58,0,0          // vbroadcastss  0x3a00(%rip),%ymm1        # 7bc0 <_sk_callback_avx+0x424>
   .byte  197,236,84,201                      // vandps        %ymm1,%ymm2,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,29,235,57,0,0        // vbroadcastss  0x39eb(%rip),%ymm3        # 7b88 <_sk_callback_avx+0x420>
+  .byte  196,226,125,24,29,243,57,0,0        // vbroadcastss  0x39f3(%rip),%ymm3        # 7bc4 <_sk_callback_avx+0x428>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
-  .byte  196,226,125,24,29,226,57,0,0        // vbroadcastss  0x39e2(%rip),%ymm3        # 7b8c <_sk_callback_avx+0x424>
+  .byte  196,226,125,24,29,234,57,0,0        // vbroadcastss  0x39ea(%rip),%ymm3        # 7bc8 <_sk_callback_avx+0x42c>
   .byte  197,236,84,211                      // vandps        %ymm3,%ymm2,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,226,125,24,29,213,57,0,0        // vbroadcastss  0x39d5(%rip),%ymm3        # 7b90 <_sk_callback_avx+0x428>
+  .byte  196,226,125,24,29,221,57,0,0        // vbroadcastss  0x39dd(%rip),%ymm3        # 7bcc <_sk_callback_avx+0x430>
   .byte  197,236,89,211                      // vmulps        %ymm3,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,202,57,0,0        // vbroadcastss  0x39ca(%rip),%ymm3        # 7b94 <_sk_callback_avx+0x42c>
+  .byte  196,226,125,24,29,210,57,0,0        // vbroadcastss  0x39d2(%rip),%ymm3        # 7bd0 <_sk_callback_avx+0x434>
   .byte  255,224                             // jmpq          *%rax
 
 HIDDEN _sk_store_565_avx
@@ -21726,14 +21821,14 @@
 _sk_store_565_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
-  .byte  196,98,125,24,5,190,57,0,0          // vbroadcastss  0x39be(%rip),%ymm8        # 7b98 <_sk_callback_avx+0x430>
+  .byte  196,98,125,24,5,198,57,0,0          // vbroadcastss  0x39c6(%rip),%ymm8        # 7bd4 <_sk_callback_avx+0x438>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,193,41,114,241,11               // vpslld        $0xb,%xmm9,%xmm10
   .byte  196,67,125,25,201,1                 // vextractf128  $0x1,%ymm9,%xmm9
   .byte  196,193,49,114,241,11               // vpslld        $0xb,%xmm9,%xmm9
   .byte  196,67,45,24,201,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
-  .byte  196,98,125,24,21,151,57,0,0         // vbroadcastss  0x3997(%rip),%ymm10        # 7b9c <_sk_callback_avx+0x434>
+  .byte  196,98,125,24,21,159,57,0,0         // vbroadcastss  0x399f(%rip),%ymm10        # 7bd8 <_sk_callback_avx+0x43c>
   .byte  196,65,116,89,210                   // vmulps        %ymm10,%ymm1,%ymm10
   .byte  196,65,125,91,210                   // vcvtps2dq     %ymm10,%ymm10
   .byte  196,193,33,114,242,5                // vpslld        $0x5,%xmm10,%xmm11
@@ -21747,7 +21842,7 @@
   .byte  196,67,125,25,193,1                 // vextractf128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           4255 <_sk_store_565_avx+0x89>
+  .byte  117,10                              // jne           4289 <_sk_store_565_avx+0x89>
   .byte  196,65,122,127,4,83                 // vmovdqu       %xmm8,(%r11,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -21755,22 +21850,22 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            4251 <_sk_store_565_avx+0x85>
+  .byte  119,236                             // ja            4285 <_sk_store_565_avx+0x85>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,68,0,0,0                  // lea           0x44(%rip),%r10        # 42b4 <_sk_store_565_avx+0xe8>
+  .byte  76,141,21,68,0,0,0                  // lea           0x44(%rip),%r10        # 42e8 <_sk_store_565_avx+0xe8>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,21,4,83,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  .byte  235,207                             // jmp           4251 <_sk_store_565_avx+0x85>
+  .byte  235,207                             // jmp           4285 <_sk_store_565_avx+0x85>
   .byte  196,67,121,21,68,83,4,2             // vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   .byte  196,65,121,126,4,83                 // vmovd         %xmm8,(%r11,%rdx,2)
-  .byte  235,191                             // jmp           4251 <_sk_store_565_avx+0x85>
+  .byte  235,191                             // jmp           4285 <_sk_store_565_avx+0x85>
   .byte  196,67,121,21,68,83,12,6            // vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,10,5            // vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,8,4             // vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   .byte  196,65,121,214,4,83                 // vmovq         %xmm8,(%r11,%rdx,2)
-  .byte  235,159                             // jmp           4251 <_sk_store_565_avx+0x85>
+  .byte  235,159                             // jmp           4285 <_sk_store_565_avx+0x85>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  197,255,255                         // (bad)
   .byte  255,214                             // callq         *%rsi
@@ -21801,31 +21896,31 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,152,0,0,0                    // jne           4376 <_sk_load_4444_avx+0xa6>
+  .byte  15,133,152,0,0,0                    // jne           43aa <_sk_load_4444_avx+0xa6>
   .byte  196,193,122,111,4,83                // vmovdqu       (%r11,%rdx,2),%xmm0
   .byte  197,241,239,201                     // vpxor         %xmm1,%xmm1,%xmm1
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,217,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm3
-  .byte  196,226,125,24,5,160,56,0,0         // vbroadcastss  0x38a0(%rip),%ymm0        # 7ba0 <_sk_callback_avx+0x438>
+  .byte  196,226,125,24,5,168,56,0,0         // vbroadcastss  0x38a8(%rip),%ymm0        # 7bdc <_sk_callback_avx+0x440>
   .byte  197,228,84,192                      // vandps        %ymm0,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,147,56,0,0        // vbroadcastss  0x3893(%rip),%ymm1        # 7ba4 <_sk_callback_avx+0x43c>
+  .byte  196,226,125,24,13,155,56,0,0        // vbroadcastss  0x389b(%rip),%ymm1        # 7be0 <_sk_callback_avx+0x444>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,138,56,0,0        // vbroadcastss  0x388a(%rip),%ymm1        # 7ba8 <_sk_callback_avx+0x440>
+  .byte  196,226,125,24,13,146,56,0,0        // vbroadcastss  0x3892(%rip),%ymm1        # 7be4 <_sk_callback_avx+0x448>
   .byte  197,228,84,201                      // vandps        %ymm1,%ymm3,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,21,125,56,0,0        // vbroadcastss  0x387d(%rip),%ymm2        # 7bac <_sk_callback_avx+0x444>
+  .byte  196,226,125,24,21,133,56,0,0        // vbroadcastss  0x3885(%rip),%ymm2        # 7be8 <_sk_callback_avx+0x44c>
   .byte  197,244,89,202                      // vmulps        %ymm2,%ymm1,%ymm1
-  .byte  196,226,125,24,21,116,56,0,0        // vbroadcastss  0x3874(%rip),%ymm2        # 7bb0 <_sk_callback_avx+0x448>
+  .byte  196,226,125,24,21,124,56,0,0        // vbroadcastss  0x387c(%rip),%ymm2        # 7bec <_sk_callback_avx+0x450>
   .byte  197,228,84,210                      // vandps        %ymm2,%ymm3,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,98,125,24,5,103,56,0,0          // vbroadcastss  0x3867(%rip),%ymm8        # 7bb4 <_sk_callback_avx+0x44c>
+  .byte  196,98,125,24,5,111,56,0,0          // vbroadcastss  0x386f(%rip),%ymm8        # 7bf0 <_sk_callback_avx+0x454>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,93,56,0,0           // vbroadcastss  0x385d(%rip),%ymm8        # 7bb8 <_sk_callback_avx+0x450>
+  .byte  196,98,125,24,5,101,56,0,0          // vbroadcastss  0x3865(%rip),%ymm8        # 7bf4 <_sk_callback_avx+0x458>
   .byte  196,193,100,84,216                  // vandps        %ymm8,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,79,56,0,0           // vbroadcastss  0x384f(%rip),%ymm8        # 7bbc <_sk_callback_avx+0x454>
+  .byte  196,98,125,24,5,87,56,0,0           // vbroadcastss  0x3857(%rip),%ymm8        # 7bf8 <_sk_callback_avx+0x45c>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -21834,27 +21929,27 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,86,255,255,255               // ja            42e4 <_sk_load_4444_avx+0x14>
+  .byte  15,135,86,255,255,255               // ja            4318 <_sk_load_4444_avx+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 43fc <_sk_load_4444_avx+0x12c>
+  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 4430 <_sk_load_4444_avx+0x12c>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  233,52,255,255,255                  // jmpq          42e4 <_sk_load_4444_avx+0x14>
+  .byte  233,52,255,255,255                  // jmpq          4318 <_sk_load_4444_avx+0x14>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,110,12,83               // vmovd         (%r11,%rdx,2),%xmm1
   .byte  196,227,121,14,193,3                // vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  .byte  233,23,255,255,255                  // jmpq          42e4 <_sk_load_4444_avx+0x14>
+  .byte  233,23,255,255,255                  // jmpq          4318 <_sk_load_4444_avx+0x14>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,193,121,196,68,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,121,196,68,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   .byte  196,193,122,126,12,83               // vmovq         (%r11,%rdx,2),%xmm1
   .byte  196,227,113,14,192,240              // vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  .byte  233,234,254,255,255                 // jmpq          42e4 <_sk_load_4444_avx+0x14>
+  .byte  233,234,254,255,255                 // jmpq          4318 <_sk_load_4444_avx+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  166                                 // cmpsb         %es:(%rdi),%ds:(%rsi)
   .byte  255                                 // (bad)
@@ -21882,31 +21977,31 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,152,0,0,0                    // jne           44be <_sk_load_4444_dst_avx+0xa6>
+  .byte  15,133,152,0,0,0                    // jne           44f2 <_sk_load_4444_dst_avx+0xa6>
   .byte  196,193,122,111,36,83               // vmovdqu       (%r11,%rdx,2),%xmm4
   .byte  197,209,239,237                     // vpxor         %xmm5,%xmm5,%xmm5
   .byte  197,217,105,237                     // vpunpckhwd    %xmm5,%xmm4,%xmm5
   .byte  196,226,121,51,228                  // vpmovzxwd     %xmm4,%xmm4
   .byte  196,227,93,24,253,1                 // vinsertf128   $0x1,%xmm5,%ymm4,%ymm7
-  .byte  196,226,125,24,37,120,55,0,0        // vbroadcastss  0x3778(%rip),%ymm4        # 7bc0 <_sk_callback_avx+0x458>
+  .byte  196,226,125,24,37,128,55,0,0        // vbroadcastss  0x3780(%rip),%ymm4        # 7bfc <_sk_callback_avx+0x460>
   .byte  197,196,84,228                      // vandps        %ymm4,%ymm7,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,226,125,24,45,107,55,0,0        // vbroadcastss  0x376b(%rip),%ymm5        # 7bc4 <_sk_callback_avx+0x45c>
+  .byte  196,226,125,24,45,115,55,0,0        // vbroadcastss  0x3773(%rip),%ymm5        # 7c00 <_sk_callback_avx+0x464>
   .byte  197,220,89,229                      // vmulps        %ymm5,%ymm4,%ymm4
-  .byte  196,226,125,24,45,98,55,0,0         // vbroadcastss  0x3762(%rip),%ymm5        # 7bc8 <_sk_callback_avx+0x460>
+  .byte  196,226,125,24,45,106,55,0,0        // vbroadcastss  0x376a(%rip),%ymm5        # 7c04 <_sk_callback_avx+0x468>
   .byte  197,196,84,237                      // vandps        %ymm5,%ymm7,%ymm5
   .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
-  .byte  196,226,125,24,53,85,55,0,0         // vbroadcastss  0x3755(%rip),%ymm6        # 7bcc <_sk_callback_avx+0x464>
+  .byte  196,226,125,24,53,93,55,0,0         // vbroadcastss  0x375d(%rip),%ymm6        # 7c08 <_sk_callback_avx+0x46c>
   .byte  197,212,89,238                      // vmulps        %ymm6,%ymm5,%ymm5
-  .byte  196,226,125,24,53,76,55,0,0         // vbroadcastss  0x374c(%rip),%ymm6        # 7bd0 <_sk_callback_avx+0x468>
+  .byte  196,226,125,24,53,84,55,0,0         // vbroadcastss  0x3754(%rip),%ymm6        # 7c0c <_sk_callback_avx+0x470>
   .byte  197,196,84,246                      // vandps        %ymm6,%ymm7,%ymm6
   .byte  197,252,91,246                      // vcvtdq2ps     %ymm6,%ymm6
-  .byte  196,98,125,24,5,63,55,0,0           // vbroadcastss  0x373f(%rip),%ymm8        # 7bd4 <_sk_callback_avx+0x46c>
+  .byte  196,98,125,24,5,71,55,0,0           // vbroadcastss  0x3747(%rip),%ymm8        # 7c10 <_sk_callback_avx+0x474>
   .byte  196,193,76,89,240                   // vmulps        %ymm8,%ymm6,%ymm6
-  .byte  196,98,125,24,5,53,55,0,0           // vbroadcastss  0x3735(%rip),%ymm8        # 7bd8 <_sk_callback_avx+0x470>
+  .byte  196,98,125,24,5,61,55,0,0           // vbroadcastss  0x373d(%rip),%ymm8        # 7c14 <_sk_callback_avx+0x478>
   .byte  196,193,68,84,248                   // vandps        %ymm8,%ymm7,%ymm7
   .byte  197,252,91,255                      // vcvtdq2ps     %ymm7,%ymm7
-  .byte  196,98,125,24,5,39,55,0,0           // vbroadcastss  0x3727(%rip),%ymm8        # 7bdc <_sk_callback_avx+0x474>
+  .byte  196,98,125,24,5,47,55,0,0           // vbroadcastss  0x372f(%rip),%ymm8        # 7c18 <_sk_callback_avx+0x47c>
   .byte  196,193,68,89,248                   // vmulps        %ymm8,%ymm7,%ymm7
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -21915,27 +22010,27 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,86,255,255,255               // ja            442c <_sk_load_4444_dst_avx+0x14>
+  .byte  15,135,86,255,255,255               // ja            4460 <_sk_load_4444_dst_avx+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 4544 <_sk_load_4444_dst_avx+0x12c>
+  .byte  76,141,21,99,0,0,0                  // lea           0x63(%rip),%r10        # 4578 <_sk_load_4444_dst_avx+0x12c>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,183,4,83                      // movzwl        (%r11,%rdx,2),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  233,52,255,255,255                  // jmpq          442c <_sk_load_4444_dst_avx+0x14>
+  .byte  233,52,255,255,255                  // jmpq          4460 <_sk_load_4444_dst_avx+0x14>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,4,2           // vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,121,110,44,83               // vmovd         (%r11,%rdx,2),%xmm5
   .byte  196,227,89,14,229,3                 // vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  .byte  233,23,255,255,255                  // jmpq          442c <_sk_load_4444_dst_avx+0x14>
+  .byte  233,23,255,255,255                  // jmpq          4460 <_sk_load_4444_dst_avx+0x14>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,193,89,196,100,83,12,6          // vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,10,5          // vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,89,196,100,83,8,4           // vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   .byte  196,193,122,126,44,83               // vmovq         (%r11,%rdx,2),%xmm5
   .byte  196,227,81,14,228,240               // vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  .byte  233,234,254,255,255                 // jmpq          442c <_sk_load_4444_dst_avx+0x14>
+  .byte  233,234,254,255,255                 // jmpq          4460 <_sk_load_4444_dst_avx+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  166                                 // cmpsb         %es:(%rdi),%ds:(%rsi)
   .byte  255                                 // (bad)
@@ -22004,25 +22099,25 @@
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,217,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm3
-  .byte  196,226,125,24,5,174,53,0,0         // vbroadcastss  0x35ae(%rip),%ymm0        # 7be0 <_sk_callback_avx+0x478>
+  .byte  196,226,125,24,5,182,53,0,0         // vbroadcastss  0x35b6(%rip),%ymm0        # 7c1c <_sk_callback_avx+0x480>
   .byte  197,228,84,192                      // vandps        %ymm0,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,226,125,24,13,161,53,0,0        // vbroadcastss  0x35a1(%rip),%ymm1        # 7be4 <_sk_callback_avx+0x47c>
+  .byte  196,226,125,24,13,169,53,0,0        // vbroadcastss  0x35a9(%rip),%ymm1        # 7c20 <_sk_callback_avx+0x484>
   .byte  197,252,89,193                      // vmulps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,152,53,0,0        // vbroadcastss  0x3598(%rip),%ymm1        # 7be8 <_sk_callback_avx+0x480>
+  .byte  196,226,125,24,13,160,53,0,0        // vbroadcastss  0x35a0(%rip),%ymm1        # 7c24 <_sk_callback_avx+0x488>
   .byte  197,228,84,201                      // vandps        %ymm1,%ymm3,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,226,125,24,21,139,53,0,0        // vbroadcastss  0x358b(%rip),%ymm2        # 7bec <_sk_callback_avx+0x484>
+  .byte  196,226,125,24,21,147,53,0,0        // vbroadcastss  0x3593(%rip),%ymm2        # 7c28 <_sk_callback_avx+0x48c>
   .byte  197,244,89,202                      // vmulps        %ymm2,%ymm1,%ymm1
-  .byte  196,226,125,24,21,130,53,0,0        // vbroadcastss  0x3582(%rip),%ymm2        # 7bf0 <_sk_callback_avx+0x488>
+  .byte  196,226,125,24,21,138,53,0,0        // vbroadcastss  0x358a(%rip),%ymm2        # 7c2c <_sk_callback_avx+0x490>
   .byte  197,228,84,210                      // vandps        %ymm2,%ymm3,%ymm2
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
-  .byte  196,98,125,24,5,117,53,0,0          // vbroadcastss  0x3575(%rip),%ymm8        # 7bf4 <_sk_callback_avx+0x48c>
+  .byte  196,98,125,24,5,125,53,0,0          // vbroadcastss  0x357d(%rip),%ymm8        # 7c30 <_sk_callback_avx+0x494>
   .byte  196,193,108,89,208                  // vmulps        %ymm8,%ymm2,%ymm2
-  .byte  196,98,125,24,5,107,53,0,0          // vbroadcastss  0x356b(%rip),%ymm8        # 7bf8 <_sk_callback_avx+0x490>
+  .byte  196,98,125,24,5,115,53,0,0          // vbroadcastss  0x3573(%rip),%ymm8        # 7c34 <_sk_callback_avx+0x498>
   .byte  196,193,100,84,216                  // vandps        %ymm8,%ymm3,%ymm3
   .byte  197,252,91,219                      // vcvtdq2ps     %ymm3,%ymm3
-  .byte  196,98,125,24,5,93,53,0,0           // vbroadcastss  0x355d(%rip),%ymm8        # 7bfc <_sk_callback_avx+0x494>
+  .byte  196,98,125,24,5,101,53,0,0          // vbroadcastss  0x3565(%rip),%ymm8        # 7c38 <_sk_callback_avx+0x49c>
   .byte  196,193,100,89,216                  // vmulps        %ymm8,%ymm3,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -22033,7 +22128,7 @@
 _sk_store_4444_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
-  .byte  196,98,125,24,5,74,53,0,0           // vbroadcastss  0x354a(%rip),%ymm8        # 7c00 <_sk_callback_avx+0x498>
+  .byte  196,98,125,24,5,82,53,0,0           // vbroadcastss  0x3552(%rip),%ymm8        # 7c3c <_sk_callback_avx+0x4a0>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,193,41,114,241,12               // vpslld        $0xc,%xmm9,%xmm10
@@ -22060,7 +22155,7 @@
   .byte  196,67,125,25,193,1                 // vextractf128  $0x1,%ymm8,%xmm9
   .byte  196,66,57,43,193                    // vpackusdw     %xmm9,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           474f <_sk_store_4444_avx+0xa7>
+  .byte  117,10                              // jne           4783 <_sk_store_4444_avx+0xa7>
   .byte  196,65,122,127,4,83                 // vmovdqu       %xmm8,(%r11,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -22068,22 +22163,22 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            474b <_sk_store_4444_avx+0xa3>
+  .byte  119,236                             // ja            477f <_sk_store_4444_avx+0xa3>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,66,0,0,0                  // lea           0x42(%rip),%r10        # 47ac <_sk_store_4444_avx+0x104>
+  .byte  76,141,21,66,0,0,0                  // lea           0x42(%rip),%r10        # 47e0 <_sk_store_4444_avx+0x104>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,21,4,83,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  .byte  235,207                             // jmp           474b <_sk_store_4444_avx+0xa3>
+  .byte  235,207                             // jmp           477f <_sk_store_4444_avx+0xa3>
   .byte  196,67,121,21,68,83,4,2             // vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   .byte  196,65,121,126,4,83                 // vmovd         %xmm8,(%r11,%rdx,2)
-  .byte  235,191                             // jmp           474b <_sk_store_4444_avx+0xa3>
+  .byte  235,191                             // jmp           477f <_sk_store_4444_avx+0xa3>
   .byte  196,67,121,21,68,83,12,6            // vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,10,5            // vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   .byte  196,67,121,21,68,83,8,4             // vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   .byte  196,65,121,214,4,83                 // vmovq         %xmm8,(%r11,%rdx,2)
-  .byte  235,159                             // jmp           474b <_sk_store_4444_avx+0xa3>
+  .byte  235,159                             // jmp           477f <_sk_store_4444_avx+0xa3>
   .byte  199                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -22101,7 +22196,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  232,255,255,255,224                 // callq         ffffffffe10047c4 <_sk_callback_avx+0xffffffffe0ffd05c>
+  .byte  232,255,255,255,224                 // callq         ffffffffe10047f8 <_sk_callback_avx+0xffffffffe0ffd05c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // .byte         0xff
@@ -22115,12 +22210,12 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,137,0,0,0                    // jne           486a <_sk_load_8888_avx+0xa2>
+  .byte  15,133,137,0,0,0                    // jne           489e <_sk_load_8888_avx+0xa2>
   .byte  196,193,124,16,26                   // vmovups       (%r10),%ymm3
-  .byte  197,124,40,21,178,55,0,0            // vmovaps       0x37b2(%rip),%ymm10        # 7fa0 <_sk_callback_avx+0x838>
+  .byte  197,124,40,21,190,55,0,0            // vmovaps       0x37be(%rip),%ymm10        # 7fe0 <_sk_callback_avx+0x844>
   .byte  196,193,100,84,194                  // vandps        %ymm10,%ymm3,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,5,4,52,0,0            // vbroadcastss  0x3404(%rip),%ymm8        # 7c04 <_sk_callback_avx+0x49c>
+  .byte  196,98,125,24,5,12,52,0,0           // vbroadcastss  0x340c(%rip),%ymm8        # 7c40 <_sk_callback_avx+0x4a4>
   .byte  196,193,124,89,192                  // vmulps        %ymm8,%ymm0,%ymm0
   .byte  197,241,114,211,8                   // vpsrld        $0x8,%xmm3,%xmm1
   .byte  196,195,125,25,217,1                // vextractf128  $0x1,%ymm3,%xmm9
@@ -22150,13 +22245,13 @@
   .byte  72,211,232                          // shr           %cl,%rax
   .byte  196,225,249,110,192                 // vmovq         %rax,%xmm0
   .byte  196,226,121,48,192                  // vpmovzxbw     %xmm0,%xmm0
-  .byte  196,226,121,0,13,222,53,0,0         // vpshufb       0x35de(%rip),%xmm0,%xmm1        # 7e70 <_sk_callback_avx+0x708>
+  .byte  196,226,121,0,13,234,53,0,0         // vpshufb       0x35ea(%rip),%xmm0,%xmm1        # 7eb0 <_sk_callback_avx+0x714>
   .byte  196,226,121,33,201                  // vpmovsxbd     %xmm1,%xmm1
-  .byte  196,226,121,0,5,224,53,0,0          // vpshufb       0x35e0(%rip),%xmm0,%xmm0        # 7e80 <_sk_callback_avx+0x718>
+  .byte  196,226,121,0,5,236,53,0,0          // vpshufb       0x35ec(%rip),%xmm0,%xmm0        # 7ec0 <_sk_callback_avx+0x724>
   .byte  196,226,121,33,192                  // vpmovsxbd     %xmm0,%xmm0
   .byte  196,227,117,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  196,194,125,44,26                   // vmaskmovps    (%r10),%ymm0,%ymm3
-  .byte  233,49,255,255,255                  // jmpq          47e6 <_sk_load_8888_avx+0x1e>
+  .byte  233,49,255,255,255                  // jmpq          481a <_sk_load_8888_avx+0x1e>
 
 HIDDEN _sk_load_8888_dst_avx
 .globl _sk_load_8888_dst_avx
@@ -22167,12 +22262,12 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,137,0,0,0                    // jne           4957 <_sk_load_8888_dst_avx+0xa2>
+  .byte  15,133,137,0,0,0                    // jne           498b <_sk_load_8888_dst_avx+0xa2>
   .byte  196,193,124,16,58                   // vmovups       (%r10),%ymm7
-  .byte  197,124,40,21,229,54,0,0            // vmovaps       0x36e5(%rip),%ymm10        # 7fc0 <_sk_callback_avx+0x858>
+  .byte  197,124,40,21,241,54,0,0            // vmovaps       0x36f1(%rip),%ymm10        # 8000 <_sk_callback_avx+0x864>
   .byte  196,193,68,84,226                   // vandps        %ymm10,%ymm7,%ymm4
   .byte  197,252,91,228                      // vcvtdq2ps     %ymm4,%ymm4
-  .byte  196,98,125,24,5,27,51,0,0           // vbroadcastss  0x331b(%rip),%ymm8        # 7c08 <_sk_callback_avx+0x4a0>
+  .byte  196,98,125,24,5,35,51,0,0           // vbroadcastss  0x3323(%rip),%ymm8        # 7c44 <_sk_callback_avx+0x4a8>
   .byte  196,193,92,89,224                   // vmulps        %ymm8,%ymm4,%ymm4
   .byte  197,209,114,215,8                   // vpsrld        $0x8,%xmm7,%xmm5
   .byte  196,195,125,25,249,1                // vextractf128  $0x1,%ymm7,%xmm9
@@ -22202,13 +22297,13 @@
   .byte  72,211,232                          // shr           %cl,%rax
   .byte  196,225,249,110,224                 // vmovq         %rax,%xmm4
   .byte  196,226,121,48,228                  // vpmovzxbw     %xmm4,%xmm4
-  .byte  196,226,89,0,45,17,53,0,0           // vpshufb       0x3511(%rip),%xmm4,%xmm5        # 7e90 <_sk_callback_avx+0x728>
+  .byte  196,226,89,0,45,29,53,0,0           // vpshufb       0x351d(%rip),%xmm4,%xmm5        # 7ed0 <_sk_callback_avx+0x734>
   .byte  196,226,121,33,237                  // vpmovsxbd     %xmm5,%xmm5
-  .byte  196,226,89,0,37,19,53,0,0           // vpshufb       0x3513(%rip),%xmm4,%xmm4        # 7ea0 <_sk_callback_avx+0x738>
+  .byte  196,226,89,0,37,31,53,0,0           // vpshufb       0x351f(%rip),%xmm4,%xmm4        # 7ee0 <_sk_callback_avx+0x744>
   .byte  196,226,121,33,228                  // vpmovsxbd     %xmm4,%xmm4
   .byte  196,227,85,24,228,1                 // vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
   .byte  196,194,93,44,58                    // vmaskmovps    (%r10),%ymm4,%ymm7
-  .byte  233,49,255,255,255                  // jmpq          48d3 <_sk_load_8888_dst_avx+0x1e>
+  .byte  233,49,255,255,255                  // jmpq          4907 <_sk_load_8888_dst_avx+0x1e>
 
 HIDDEN _sk_gather_8888_avx
 .globl _sk_gather_8888_avx
@@ -22247,10 +22342,10 @@
   .byte  73,193,234,32                       // shr           $0x20,%r10
   .byte  196,131,121,34,28,145,3             // vpinsrd       $0x3,(%r9,%r10,4),%xmm0,%xmm3
   .byte  196,227,61,24,195,1                 // vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  .byte  197,124,40,21,147,53,0,0            // vmovaps       0x3593(%rip),%ymm10        # 7fe0 <_sk_callback_avx+0x878>
+  .byte  197,124,40,21,159,53,0,0            // vmovaps       0x359f(%rip),%ymm10        # 8020 <_sk_callback_avx+0x884>
   .byte  196,193,124,84,194                  // vandps        %ymm10,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,13,173,49,0,0         // vbroadcastss  0x31ad(%rip),%ymm9        # 7c0c <_sk_callback_avx+0x4a4>
+  .byte  196,98,125,24,13,181,49,0,0         // vbroadcastss  0x31b5(%rip),%ymm9        # 7c48 <_sk_callback_avx+0x4ac>
   .byte  196,193,124,89,193                  // vmulps        %ymm9,%ymm0,%ymm0
   .byte  196,193,113,114,208,8               // vpsrld        $0x8,%xmm8,%xmm1
   .byte  197,233,114,211,8                   // vpsrld        $0x8,%xmm3,%xmm2
@@ -22280,7 +22375,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
-  .byte  196,98,125,24,5,55,49,0,0           // vbroadcastss  0x3137(%rip),%ymm8        # 7c10 <_sk_callback_avx+0x4a8>
+  .byte  196,98,125,24,5,63,49,0,0           // vbroadcastss  0x313f(%rip),%ymm8        # 7c4c <_sk_callback_avx+0x4b0>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,65,116,89,208                   // vmulps        %ymm8,%ymm1,%ymm10
@@ -22305,7 +22400,7 @@
   .byte  196,65,45,86,192                    // vorpd         %ymm8,%ymm10,%ymm8
   .byte  196,65,53,86,192                    // vorpd         %ymm8,%ymm9,%ymm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,12                              // jne           4b69 <_sk_store_8888_avx+0xa9>
+  .byte  117,12                              // jne           4b9d <_sk_store_8888_avx+0xa9>
   .byte  196,65,124,17,2                     // vmovups       %ymm8,(%r10)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,201                          // mov           %r9,%rcx
@@ -22317,13 +22412,13 @@
   .byte  72,211,232                          // shr           %cl,%rax
   .byte  196,97,249,110,200                  // vmovq         %rax,%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
-  .byte  196,98,49,0,21,31,51,0,0            // vpshufb       0x331f(%rip),%xmm9,%xmm10        # 7eb0 <_sk_callback_avx+0x748>
+  .byte  196,98,49,0,21,43,51,0,0            // vpshufb       0x332b(%rip),%xmm9,%xmm10        # 7ef0 <_sk_callback_avx+0x754>
   .byte  196,66,121,33,210                   // vpmovsxbd     %xmm10,%xmm10
-  .byte  196,98,49,0,13,33,51,0,0            // vpshufb       0x3321(%rip),%xmm9,%xmm9        # 7ec0 <_sk_callback_avx+0x758>
+  .byte  196,98,49,0,13,45,51,0,0            // vpshufb       0x332d(%rip),%xmm9,%xmm9        # 7f00 <_sk_callback_avx+0x764>
   .byte  196,66,121,33,201                   // vpmovsxbd     %xmm9,%xmm9
   .byte  196,67,45,24,201,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
   .byte  196,66,53,46,2                      // vmaskmovps    %ymm8,%ymm9,(%r10)
-  .byte  235,177                             // jmp           4b62 <_sk_store_8888_avx+0xa2>
+  .byte  235,177                             // jmp           4b96 <_sk_store_8888_avx+0xa2>
 
 HIDDEN _sk_load_bgra_avx
 .globl _sk_load_bgra_avx
@@ -22334,12 +22429,12 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,137,0,0,0                    // jne           4c53 <_sk_load_bgra_avx+0xa2>
+  .byte  15,133,137,0,0,0                    // jne           4c87 <_sk_load_bgra_avx+0xa2>
   .byte  196,193,124,16,26                   // vmovups       (%r10),%ymm3
-  .byte  197,124,40,21,41,52,0,0             // vmovaps       0x3429(%rip),%ymm10        # 8000 <_sk_callback_avx+0x898>
+  .byte  197,124,40,21,53,52,0,0             // vmovaps       0x3435(%rip),%ymm10        # 8040 <_sk_callback_avx+0x8a4>
   .byte  196,193,100,84,202                  // vandps        %ymm10,%ymm3,%ymm1
   .byte  197,252,91,201                      // vcvtdq2ps     %ymm1,%ymm1
-  .byte  196,98,125,24,5,43,48,0,0           // vbroadcastss  0x302b(%rip),%ymm8        # 7c14 <_sk_callback_avx+0x4ac>
+  .byte  196,98,125,24,5,51,48,0,0           // vbroadcastss  0x3033(%rip),%ymm8        # 7c50 <_sk_callback_avx+0x4b4>
   .byte  196,193,116,89,208                  // vmulps        %ymm8,%ymm1,%ymm2
   .byte  197,241,114,211,8                   // vpsrld        $0x8,%xmm3,%xmm1
   .byte  196,195,125,25,217,1                // vextractf128  $0x1,%ymm3,%xmm9
@@ -22369,13 +22464,13 @@
   .byte  72,211,232                          // shr           %cl,%rax
   .byte  196,225,249,110,192                 // vmovq         %rax,%xmm0
   .byte  196,226,121,48,192                  // vpmovzxbw     %xmm0,%xmm0
-  .byte  196,226,121,0,13,85,50,0,0          // vpshufb       0x3255(%rip),%xmm0,%xmm1        # 7ed0 <_sk_callback_avx+0x768>
+  .byte  196,226,121,0,13,97,50,0,0          // vpshufb       0x3261(%rip),%xmm0,%xmm1        # 7f10 <_sk_callback_avx+0x774>
   .byte  196,226,121,33,201                  // vpmovsxbd     %xmm1,%xmm1
-  .byte  196,226,121,0,5,87,50,0,0           // vpshufb       0x3257(%rip),%xmm0,%xmm0        # 7ee0 <_sk_callback_avx+0x778>
+  .byte  196,226,121,0,5,99,50,0,0           // vpshufb       0x3263(%rip),%xmm0,%xmm0        # 7f20 <_sk_callback_avx+0x784>
   .byte  196,226,121,33,192                  // vpmovsxbd     %xmm0,%xmm0
   .byte  196,227,117,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  196,194,125,44,26                   // vmaskmovps    (%r10),%ymm0,%ymm3
-  .byte  233,49,255,255,255                  // jmpq          4bcf <_sk_load_bgra_avx+0x1e>
+  .byte  233,49,255,255,255                  // jmpq          4c03 <_sk_load_bgra_avx+0x1e>
 
 HIDDEN _sk_load_bgra_dst_avx
 .globl _sk_load_bgra_dst_avx
@@ -22386,12 +22481,12 @@
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,137,0,0,0                    // jne           4d40 <_sk_load_bgra_dst_avx+0xa2>
+  .byte  15,133,137,0,0,0                    // jne           4d74 <_sk_load_bgra_dst_avx+0xa2>
   .byte  196,193,124,16,58                   // vmovups       (%r10),%ymm7
-  .byte  197,124,40,21,92,51,0,0             // vmovaps       0x335c(%rip),%ymm10        # 8020 <_sk_callback_avx+0x8b8>
+  .byte  197,124,40,21,104,51,0,0            // vmovaps       0x3368(%rip),%ymm10        # 8060 <_sk_callback_avx+0x8c4>
   .byte  196,193,68,84,234                   // vandps        %ymm10,%ymm7,%ymm5
   .byte  197,252,91,237                      // vcvtdq2ps     %ymm5,%ymm5
-  .byte  196,98,125,24,5,66,47,0,0           // vbroadcastss  0x2f42(%rip),%ymm8        # 7c18 <_sk_callback_avx+0x4b0>
+  .byte  196,98,125,24,5,74,47,0,0           // vbroadcastss  0x2f4a(%rip),%ymm8        # 7c54 <_sk_callback_avx+0x4b8>
   .byte  196,193,84,89,240                   // vmulps        %ymm8,%ymm5,%ymm6
   .byte  197,209,114,215,8                   // vpsrld        $0x8,%xmm7,%xmm5
   .byte  196,195,125,25,249,1                // vextractf128  $0x1,%ymm7,%xmm9
@@ -22421,13 +22516,13 @@
   .byte  72,211,232                          // shr           %cl,%rax
   .byte  196,225,249,110,224                 // vmovq         %rax,%xmm4
   .byte  196,226,121,48,228                  // vpmovzxbw     %xmm4,%xmm4
-  .byte  196,226,89,0,45,136,49,0,0          // vpshufb       0x3188(%rip),%xmm4,%xmm5        # 7ef0 <_sk_callback_avx+0x788>
+  .byte  196,226,89,0,45,148,49,0,0          // vpshufb       0x3194(%rip),%xmm4,%xmm5        # 7f30 <_sk_callback_avx+0x794>
   .byte  196,226,121,33,237                  // vpmovsxbd     %xmm5,%xmm5
-  .byte  196,226,89,0,37,138,49,0,0          // vpshufb       0x318a(%rip),%xmm4,%xmm4        # 7f00 <_sk_callback_avx+0x798>
+  .byte  196,226,89,0,37,150,49,0,0          // vpshufb       0x3196(%rip),%xmm4,%xmm4        # 7f40 <_sk_callback_avx+0x7a4>
   .byte  196,226,121,33,228                  // vpmovsxbd     %xmm4,%xmm4
   .byte  196,227,85,24,228,1                 // vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
   .byte  196,194,93,44,58                    // vmaskmovps    (%r10),%ymm4,%ymm7
-  .byte  233,49,255,255,255                  // jmpq          4cbc <_sk_load_bgra_dst_avx+0x1e>
+  .byte  233,49,255,255,255                  // jmpq          4cf0 <_sk_load_bgra_dst_avx+0x1e>
 
 HIDDEN _sk_gather_bgra_avx
 .globl _sk_gather_bgra_avx
@@ -22466,10 +22561,10 @@
   .byte  73,193,234,32                       // shr           $0x20,%r10
   .byte  196,131,121,34,28,145,3             // vpinsrd       $0x3,(%r9,%r10,4),%xmm0,%xmm3
   .byte  196,227,61,24,195,1                 // vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  .byte  197,124,40,13,10,50,0,0             // vmovaps       0x320a(%rip),%ymm9        # 8040 <_sk_callback_avx+0x8d8>
+  .byte  197,124,40,13,22,50,0,0             // vmovaps       0x3216(%rip),%ymm9        # 8080 <_sk_callback_avx+0x8e4>
   .byte  196,193,124,84,193                  // vandps        %ymm9,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,21,212,45,0,0         // vbroadcastss  0x2dd4(%rip),%ymm10        # 7c1c <_sk_callback_avx+0x4b4>
+  .byte  196,98,125,24,21,220,45,0,0         // vbroadcastss  0x2ddc(%rip),%ymm10        # 7c58 <_sk_callback_avx+0x4bc>
   .byte  196,193,124,89,210                  // vmulps        %ymm10,%ymm0,%ymm2
   .byte  196,193,121,114,208,8               // vpsrld        $0x8,%xmm8,%xmm0
   .byte  197,241,114,211,8                   // vpsrld        $0x8,%xmm3,%xmm1
@@ -22499,7 +22594,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  76,3,16                             // add           (%rax),%r10
-  .byte  196,98,125,24,5,94,45,0,0           // vbroadcastss  0x2d5e(%rip),%ymm8        # 7c20 <_sk_callback_avx+0x4b8>
+  .byte  196,98,125,24,5,102,45,0,0          // vbroadcastss  0x2d66(%rip),%ymm8        # 7c5c <_sk_callback_avx+0x4c0>
   .byte  196,65,108,89,200                   // vmulps        %ymm8,%ymm2,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,65,116,89,208                   // vmulps        %ymm8,%ymm1,%ymm10
@@ -22524,7 +22619,7 @@
   .byte  196,65,45,86,192                    // vorpd         %ymm8,%ymm10,%ymm8
   .byte  196,65,53,86,192                    // vorpd         %ymm8,%ymm9,%ymm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,12                              // jne           4f52 <_sk_store_bgra_avx+0xa9>
+  .byte  117,12                              // jne           4f86 <_sk_store_bgra_avx+0xa9>
   .byte  196,65,124,17,2                     // vmovups       %ymm8,(%r10)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,137,201                          // mov           %r9,%rcx
@@ -22536,13 +22631,13 @@
   .byte  72,211,232                          // shr           %cl,%rax
   .byte  196,97,249,110,200                  // vmovq         %rax,%xmm9
   .byte  196,66,121,48,201                   // vpmovzxbw     %xmm9,%xmm9
-  .byte  196,98,49,0,21,150,47,0,0           // vpshufb       0x2f96(%rip),%xmm9,%xmm10        # 7f10 <_sk_callback_avx+0x7a8>
+  .byte  196,98,49,0,21,162,47,0,0           // vpshufb       0x2fa2(%rip),%xmm9,%xmm10        # 7f50 <_sk_callback_avx+0x7b4>
   .byte  196,66,121,33,210                   // vpmovsxbd     %xmm10,%xmm10
-  .byte  196,98,49,0,13,152,47,0,0           // vpshufb       0x2f98(%rip),%xmm9,%xmm9        # 7f20 <_sk_callback_avx+0x7b8>
+  .byte  196,98,49,0,13,164,47,0,0           // vpshufb       0x2fa4(%rip),%xmm9,%xmm9        # 7f60 <_sk_callback_avx+0x7c4>
   .byte  196,66,121,33,201                   // vpmovsxbd     %xmm9,%xmm9
   .byte  196,67,45,24,201,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
   .byte  196,66,53,46,2                      // vmaskmovps    %ymm8,%ymm9,(%r10)
-  .byte  235,177                             // jmp           4f4b <_sk_store_bgra_avx+0xa2>
+  .byte  235,177                             // jmp           4f7f <_sk_store_bgra_avx+0xa2>
 
 HIDDEN _sk_load_f16_avx
 .globl _sk_load_f16_avx
@@ -22556,7 +22651,7 @@
   .byte  197,252,17,116,36,192               // vmovups       %ymm6,-0x40(%rsp)
   .byte  197,252,17,108,36,160               // vmovups       %ymm5,-0x60(%rsp)
   .byte  197,254,127,100,36,128              // vmovdqu       %ymm4,-0x80(%rsp)
-  .byte  15,133,141,2,0,0                    // jne           5251 <_sk_load_f16_avx+0x2b7>
+  .byte  15,133,141,2,0,0                    // jne           5285 <_sk_load_f16_avx+0x2b7>
   .byte  197,121,16,4,208                    // vmovupd       (%rax,%rdx,8),%xmm8
   .byte  197,249,16,84,208,16                // vmovupd       0x10(%rax,%rdx,8),%xmm2
   .byte  197,249,16,76,208,32                // vmovupd       0x20(%rax,%rdx,8),%xmm1
@@ -22574,13 +22669,13 @@
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
-  .byte  196,98,125,24,37,7,44,0,0           // vbroadcastss  0x2c07(%rip),%ymm12        # 7c24 <_sk_callback_avx+0x4bc>
+  .byte  196,98,125,24,37,15,44,0,0          // vbroadcastss  0x2c0f(%rip),%ymm12        # 7c60 <_sk_callback_avx+0x4c4>
   .byte  196,193,124,84,204                  // vandps        %ymm12,%ymm0,%ymm1
   .byte  197,252,87,193                      // vxorps        %ymm1,%ymm0,%ymm0
   .byte  196,195,125,25,198,1                // vextractf128  $0x1,%ymm0,%xmm14
-  .byte  196,98,121,24,29,243,43,0,0         // vbroadcastss  0x2bf3(%rip),%xmm11        # 7c28 <_sk_callback_avx+0x4c0>
+  .byte  196,98,121,24,29,251,43,0,0         // vbroadcastss  0x2bfb(%rip),%xmm11        # 7c64 <_sk_callback_avx+0x4c8>
   .byte  196,193,8,87,219                    // vxorps        %xmm11,%xmm14,%xmm3
-  .byte  196,98,121,24,45,233,43,0,0         // vbroadcastss  0x2be9(%rip),%xmm13        # 7c2c <_sk_callback_avx+0x4c4>
+  .byte  196,98,121,24,45,241,43,0,0         // vbroadcastss  0x2bf1(%rip),%xmm13        # 7c68 <_sk_callback_avx+0x4cc>
   .byte  197,145,102,219                     // vpcmpgtd      %xmm3,%xmm13,%xmm3
   .byte  196,65,120,87,211                   // vxorps        %xmm11,%xmm0,%xmm10
   .byte  196,65,17,102,210                   // vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -22594,7 +22689,7 @@
   .byte  196,227,125,24,195,1                // vinsertf128   $0x1,%xmm3,%ymm0,%ymm0
   .byte  197,252,86,193                      // vorps         %ymm1,%ymm0,%ymm0
   .byte  196,227,125,25,193,1                // vextractf128  $0x1,%ymm0,%xmm1
-  .byte  196,226,121,24,29,159,43,0,0        // vbroadcastss  0x2b9f(%rip),%xmm3        # 7c30 <_sk_callback_avx+0x4c8>
+  .byte  196,226,121,24,29,167,43,0,0        // vbroadcastss  0x2ba7(%rip),%xmm3        # 7c6c <_sk_callback_avx+0x4d0>
   .byte  197,241,254,203                     // vpaddd        %xmm3,%xmm1,%xmm1
   .byte  197,249,254,195                     // vpaddd        %xmm3,%xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
@@ -22687,29 +22782,29 @@
   .byte  197,123,16,4,208                    // vmovsd        (%rax,%rdx,8),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,79                              // je            52b0 <_sk_load_f16_avx+0x316>
+  .byte  116,79                              // je            52e4 <_sk_load_f16_avx+0x316>
   .byte  197,57,22,68,208,8                  // vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,67                              // jb            52b0 <_sk_load_f16_avx+0x316>
+  .byte  114,67                              // jb            52e4 <_sk_load_f16_avx+0x316>
   .byte  197,251,16,84,208,16                // vmovsd        0x10(%rax,%rdx,8),%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,68                              // je            52bd <_sk_load_f16_avx+0x323>
+  .byte  116,68                              // je            52f1 <_sk_load_f16_avx+0x323>
   .byte  197,233,22,84,208,24                // vmovhpd       0x18(%rax,%rdx,8),%xmm2,%xmm2
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,56                              // jb            52bd <_sk_load_f16_avx+0x323>
+  .byte  114,56                              // jb            52f1 <_sk_load_f16_avx+0x323>
   .byte  197,251,16,76,208,32                // vmovsd        0x20(%rax,%rdx,8),%xmm1
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,70,253,255,255               // je            4fdb <_sk_load_f16_avx+0x41>
+  .byte  15,132,70,253,255,255               // je            500f <_sk_load_f16_avx+0x41>
   .byte  197,241,22,76,208,40                // vmovhpd       0x28(%rax,%rdx,8),%xmm1,%xmm1
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,54,253,255,255               // jb            4fdb <_sk_load_f16_avx+0x41>
+  .byte  15,130,54,253,255,255               // jb            500f <_sk_load_f16_avx+0x41>
   .byte  197,122,126,76,208,48               // vmovq         0x30(%rax,%rdx,8),%xmm9
-  .byte  233,43,253,255,255                  // jmpq          4fdb <_sk_load_f16_avx+0x41>
+  .byte  233,43,253,255,255                  // jmpq          500f <_sk_load_f16_avx+0x41>
   .byte  197,241,87,201                      // vxorpd        %xmm1,%xmm1,%xmm1
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,30,253,255,255                  // jmpq          4fdb <_sk_load_f16_avx+0x41>
+  .byte  233,30,253,255,255                  // jmpq          500f <_sk_load_f16_avx+0x41>
   .byte  197,241,87,201                      // vxorpd        %xmm1,%xmm1,%xmm1
-  .byte  233,21,253,255,255                  // jmpq          4fdb <_sk_load_f16_avx+0x41>
+  .byte  233,21,253,255,255                  // jmpq          500f <_sk_load_f16_avx+0x41>
 
 HIDDEN _sk_load_f16_dst_avx
 .globl _sk_load_f16_dst_avx
@@ -22723,7 +22818,7 @@
   .byte  197,252,17,84,36,192                // vmovups       %ymm2,-0x40(%rsp)
   .byte  197,252,17,76,36,160                // vmovups       %ymm1,-0x60(%rsp)
   .byte  197,254,127,68,36,128               // vmovdqu       %ymm0,-0x80(%rsp)
-  .byte  15,133,141,2,0,0                    // jne           557d <_sk_load_f16_dst_avx+0x2b7>
+  .byte  15,133,141,2,0,0                    // jne           55b1 <_sk_load_f16_dst_avx+0x2b7>
   .byte  197,121,16,4,208                    // vmovupd       (%rax,%rdx,8),%xmm8
   .byte  197,249,16,116,208,16               // vmovupd       0x10(%rax,%rdx,8),%xmm6
   .byte  197,249,16,108,208,32               // vmovupd       0x20(%rax,%rdx,8),%xmm5
@@ -22741,13 +22836,13 @@
   .byte  197,217,105,232                     // vpunpckhwd    %xmm0,%xmm4,%xmm5
   .byte  196,226,121,51,228                  // vpmovzxwd     %xmm4,%xmm4
   .byte  196,227,93,24,229,1                 // vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
-  .byte  196,98,125,24,37,235,40,0,0         // vbroadcastss  0x28eb(%rip),%ymm12        # 7c34 <_sk_callback_avx+0x4cc>
+  .byte  196,98,125,24,37,243,40,0,0         // vbroadcastss  0x28f3(%rip),%ymm12        # 7c70 <_sk_callback_avx+0x4d4>
   .byte  196,193,92,84,236                   // vandps        %ymm12,%ymm4,%ymm5
   .byte  197,220,87,229                      // vxorps        %ymm5,%ymm4,%ymm4
   .byte  196,195,125,25,230,1                // vextractf128  $0x1,%ymm4,%xmm14
-  .byte  196,98,121,24,29,215,40,0,0         // vbroadcastss  0x28d7(%rip),%xmm11        # 7c38 <_sk_callback_avx+0x4d0>
+  .byte  196,98,121,24,29,223,40,0,0         // vbroadcastss  0x28df(%rip),%xmm11        # 7c74 <_sk_callback_avx+0x4d8>
   .byte  196,193,8,87,251                    // vxorps        %xmm11,%xmm14,%xmm7
-  .byte  196,98,121,24,45,205,40,0,0         // vbroadcastss  0x28cd(%rip),%xmm13        # 7c3c <_sk_callback_avx+0x4d4>
+  .byte  196,98,121,24,45,213,40,0,0         // vbroadcastss  0x28d5(%rip),%xmm13        # 7c78 <_sk_callback_avx+0x4dc>
   .byte  197,145,102,255                     // vpcmpgtd      %xmm7,%xmm13,%xmm7
   .byte  196,65,88,87,211                    // vxorps        %xmm11,%xmm4,%xmm10
   .byte  196,65,17,102,210                   // vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -22761,7 +22856,7 @@
   .byte  196,227,93,24,231,1                 // vinsertf128   $0x1,%xmm7,%ymm4,%ymm4
   .byte  197,220,86,229                      // vorps         %ymm5,%ymm4,%ymm4
   .byte  196,227,125,25,229,1                // vextractf128  $0x1,%ymm4,%xmm5
-  .byte  196,226,121,24,61,131,40,0,0        // vbroadcastss  0x2883(%rip),%xmm7        # 7c40 <_sk_callback_avx+0x4d8>
+  .byte  196,226,121,24,61,139,40,0,0        // vbroadcastss  0x288b(%rip),%xmm7        # 7c7c <_sk_callback_avx+0x4e0>
   .byte  197,209,254,239                     // vpaddd        %xmm7,%xmm5,%xmm5
   .byte  197,217,254,231                     // vpaddd        %xmm7,%xmm4,%xmm4
   .byte  196,227,93,24,229,1                 // vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
@@ -22854,29 +22949,29 @@
   .byte  197,123,16,4,208                    // vmovsd        (%rax,%rdx,8),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,79                              // je            55dc <_sk_load_f16_dst_avx+0x316>
+  .byte  116,79                              // je            5610 <_sk_load_f16_dst_avx+0x316>
   .byte  197,57,22,68,208,8                  // vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,67                              // jb            55dc <_sk_load_f16_dst_avx+0x316>
+  .byte  114,67                              // jb            5610 <_sk_load_f16_dst_avx+0x316>
   .byte  197,251,16,116,208,16               // vmovsd        0x10(%rax,%rdx,8),%xmm6
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,68                              // je            55e9 <_sk_load_f16_dst_avx+0x323>
+  .byte  116,68                              // je            561d <_sk_load_f16_dst_avx+0x323>
   .byte  197,201,22,116,208,24               // vmovhpd       0x18(%rax,%rdx,8),%xmm6,%xmm6
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,56                              // jb            55e9 <_sk_load_f16_dst_avx+0x323>
+  .byte  114,56                              // jb            561d <_sk_load_f16_dst_avx+0x323>
   .byte  197,251,16,108,208,32               // vmovsd        0x20(%rax,%rdx,8),%xmm5
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,70,253,255,255               // je            5307 <_sk_load_f16_dst_avx+0x41>
+  .byte  15,132,70,253,255,255               // je            533b <_sk_load_f16_dst_avx+0x41>
   .byte  197,209,22,108,208,40               // vmovhpd       0x28(%rax,%rdx,8),%xmm5,%xmm5
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,54,253,255,255               // jb            5307 <_sk_load_f16_dst_avx+0x41>
+  .byte  15,130,54,253,255,255               // jb            533b <_sk_load_f16_dst_avx+0x41>
   .byte  197,122,126,76,208,48               // vmovq         0x30(%rax,%rdx,8),%xmm9
-  .byte  233,43,253,255,255                  // jmpq          5307 <_sk_load_f16_dst_avx+0x41>
+  .byte  233,43,253,255,255                  // jmpq          533b <_sk_load_f16_dst_avx+0x41>
   .byte  197,209,87,237                      // vxorpd        %xmm5,%xmm5,%xmm5
   .byte  197,201,87,246                      // vxorpd        %xmm6,%xmm6,%xmm6
-  .byte  233,30,253,255,255                  // jmpq          5307 <_sk_load_f16_dst_avx+0x41>
+  .byte  233,30,253,255,255                  // jmpq          533b <_sk_load_f16_dst_avx+0x41>
   .byte  197,209,87,237                      // vxorpd        %xmm5,%xmm5,%xmm5
-  .byte  233,21,253,255,255                  // jmpq          5307 <_sk_load_f16_dst_avx+0x41>
+  .byte  233,21,253,255,255                  // jmpq          533b <_sk_load_f16_dst_avx+0x41>
 
 HIDDEN _sk_gather_f16_avx
 .globl _sk_gather_f16_avx
@@ -22937,13 +23032,13 @@
   .byte  197,249,105,201                     // vpunpckhwd    %xmm1,%xmm0,%xmm1
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
-  .byte  196,98,125,24,37,72,37,0,0          // vbroadcastss  0x2548(%rip),%ymm12        # 7c44 <_sk_callback_avx+0x4dc>
+  .byte  196,98,125,24,37,80,37,0,0          // vbroadcastss  0x2550(%rip),%ymm12        # 7c80 <_sk_callback_avx+0x4e4>
   .byte  196,193,124,84,204                  // vandps        %ymm12,%ymm0,%ymm1
   .byte  197,252,87,193                      // vxorps        %ymm1,%ymm0,%ymm0
   .byte  196,195,125,25,198,1                // vextractf128  $0x1,%ymm0,%xmm14
-  .byte  196,98,121,24,29,52,37,0,0          // vbroadcastss  0x2534(%rip),%xmm11        # 7c48 <_sk_callback_avx+0x4e0>
+  .byte  196,98,121,24,29,60,37,0,0          // vbroadcastss  0x253c(%rip),%xmm11        # 7c84 <_sk_callback_avx+0x4e8>
   .byte  196,193,8,87,219                    // vxorps        %xmm11,%xmm14,%xmm3
-  .byte  196,98,121,24,45,42,37,0,0          // vbroadcastss  0x252a(%rip),%xmm13        # 7c4c <_sk_callback_avx+0x4e4>
+  .byte  196,98,121,24,45,50,37,0,0          // vbroadcastss  0x2532(%rip),%xmm13        # 7c88 <_sk_callback_avx+0x4ec>
   .byte  197,145,102,219                     // vpcmpgtd      %xmm3,%xmm13,%xmm3
   .byte  196,65,120,87,211                   // vxorps        %xmm11,%xmm0,%xmm10
   .byte  196,65,17,102,210                   // vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -22957,7 +23052,7 @@
   .byte  196,227,125,24,195,1                // vinsertf128   $0x1,%xmm3,%ymm0,%ymm0
   .byte  197,252,86,193                      // vorps         %ymm1,%ymm0,%ymm0
   .byte  196,227,125,25,193,1                // vextractf128  $0x1,%ymm0,%xmm1
-  .byte  196,226,121,24,29,224,36,0,0        // vbroadcastss  0x24e0(%rip),%xmm3        # 7c50 <_sk_callback_avx+0x4e8>
+  .byte  196,226,121,24,29,232,36,0,0        // vbroadcastss  0x24e8(%rip),%xmm3        # 7c8c <_sk_callback_avx+0x4f0>
   .byte  197,241,254,203                     // vpaddd        %xmm3,%xmm1,%xmm1
   .byte  197,249,254,195                     // vpaddd        %xmm3,%xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
@@ -23057,12 +23152,12 @@
   .byte  197,252,17,52,36                    // vmovups       %ymm6,(%rsp)
   .byte  197,252,17,108,36,224               // vmovups       %ymm5,-0x20(%rsp)
   .byte  197,252,17,100,36,192               // vmovups       %ymm4,-0x40(%rsp)
-  .byte  196,98,125,24,13,0,35,0,0           // vbroadcastss  0x2300(%rip),%ymm9        # 7c54 <_sk_callback_avx+0x4ec>
+  .byte  196,98,125,24,13,8,35,0,0           // vbroadcastss  0x2308(%rip),%ymm9        # 7c90 <_sk_callback_avx+0x4f4>
   .byte  196,65,124,84,209                   // vandps        %ymm9,%ymm0,%ymm10
   .byte  197,252,17,68,36,128                // vmovups       %ymm0,-0x80(%rsp)
   .byte  196,65,124,87,218                   // vxorps        %ymm10,%ymm0,%ymm11
   .byte  196,67,125,25,220,1                 // vextractf128  $0x1,%ymm11,%xmm12
-  .byte  196,98,121,24,5,229,34,0,0          // vbroadcastss  0x22e5(%rip),%xmm8        # 7c58 <_sk_callback_avx+0x4f0>
+  .byte  196,98,121,24,5,237,34,0,0          // vbroadcastss  0x22ed(%rip),%xmm8        # 7c94 <_sk_callback_avx+0x4f8>
   .byte  196,65,57,102,236                   // vpcmpgtd      %xmm12,%xmm8,%xmm13
   .byte  196,65,57,102,243                   // vpcmpgtd      %xmm11,%xmm8,%xmm14
   .byte  196,67,13,24,237,1                  // vinsertf128   $0x1,%xmm13,%ymm14,%ymm13
@@ -23072,7 +23167,7 @@
   .byte  196,67,13,24,242,1                  // vinsertf128   $0x1,%xmm10,%ymm14,%ymm14
   .byte  196,193,33,114,211,13               // vpsrld        $0xd,%xmm11,%xmm11
   .byte  196,193,25,114,212,13               // vpsrld        $0xd,%xmm12,%xmm12
-  .byte  196,98,125,24,21,172,34,0,0         // vbroadcastss  0x22ac(%rip),%ymm10        # 7c5c <_sk_callback_avx+0x4f4>
+  .byte  196,98,125,24,21,180,34,0,0         // vbroadcastss  0x22b4(%rip),%ymm10        # 7c98 <_sk_callback_avx+0x4fc>
   .byte  196,65,12,86,242                    // vorps         %ymm10,%ymm14,%ymm14
   .byte  196,67,125,25,247,1                 // vextractf128  $0x1,%ymm14,%xmm15
   .byte  196,65,1,254,228                    // vpaddd        %xmm12,%xmm15,%xmm12
@@ -23154,7 +23249,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           5b8e <_sk_store_f16_avx+0x25e>
+  .byte  117,66                              // jne           5bc2 <_sk_store_f16_avx+0x25e>
   .byte  197,120,17,28,208                   // vmovups       %xmm11,(%rax,%rdx,8)
   .byte  197,120,17,84,208,16                // vmovups       %xmm10,0x10(%rax,%rdx,8)
   .byte  197,120,17,76,208,32                // vmovups       %xmm9,0x20(%rax,%rdx,8)
@@ -23170,22 +23265,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  197,121,214,28,208                  // vmovq         %xmm11,(%rax,%rdx,8)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,202                             // je            5b63 <_sk_store_f16_avx+0x233>
+  .byte  116,202                             // je            5b97 <_sk_store_f16_avx+0x233>
   .byte  197,121,23,92,208,8                 // vmovhpd       %xmm11,0x8(%rax,%rdx,8)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,190                             // jb            5b63 <_sk_store_f16_avx+0x233>
+  .byte  114,190                             // jb            5b97 <_sk_store_f16_avx+0x233>
   .byte  197,121,214,84,208,16               // vmovq         %xmm10,0x10(%rax,%rdx,8)
-  .byte  116,182                             // je            5b63 <_sk_store_f16_avx+0x233>
+  .byte  116,182                             // je            5b97 <_sk_store_f16_avx+0x233>
   .byte  197,121,23,84,208,24                // vmovhpd       %xmm10,0x18(%rax,%rdx,8)
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,170                             // jb            5b63 <_sk_store_f16_avx+0x233>
+  .byte  114,170                             // jb            5b97 <_sk_store_f16_avx+0x233>
   .byte  197,121,214,76,208,32               // vmovq         %xmm9,0x20(%rax,%rdx,8)
-  .byte  116,162                             // je            5b63 <_sk_store_f16_avx+0x233>
+  .byte  116,162                             // je            5b97 <_sk_store_f16_avx+0x233>
   .byte  197,121,23,76,208,40                // vmovhpd       %xmm9,0x28(%rax,%rdx,8)
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,150                             // jb            5b63 <_sk_store_f16_avx+0x233>
+  .byte  114,150                             // jb            5b97 <_sk_store_f16_avx+0x233>
   .byte  197,121,214,68,208,48               // vmovq         %xmm8,0x30(%rax,%rdx,8)
-  .byte  235,142                             // jmp           5b63 <_sk_store_f16_avx+0x233>
+  .byte  235,142                             // jmp           5b97 <_sk_store_f16_avx+0x233>
 
 HIDDEN _sk_load_u16_be_avx
 .globl _sk_load_u16_be_avx
@@ -23195,7 +23290,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,253,0,0,0                    // jne           5ce8 <_sk_load_u16_be_avx+0x113>
+  .byte  15,133,253,0,0,0                    // jne           5d1c <_sk_load_u16_be_avx+0x113>
   .byte  196,65,121,16,4,65                  // vmovupd       (%r9,%rax,2),%xmm8
   .byte  196,193,121,16,84,65,16             // vmovupd       0x10(%r9,%rax,2),%xmm2
   .byte  196,193,121,16,92,65,32             // vmovupd       0x20(%r9,%rax,2),%xmm3
@@ -23217,7 +23312,7 @@
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,29,4,32,0,0           // vbroadcastss  0x2004(%rip),%ymm11        # 7c60 <_sk_callback_avx+0x4f8>
+  .byte  196,98,125,24,29,12,32,0,0          // vbroadcastss  0x200c(%rip),%ymm11        # 7c9c <_sk_callback_avx+0x500>
   .byte  196,193,124,89,195                  // vmulps        %ymm11,%ymm0,%ymm0
   .byte  197,177,109,202                     // vpunpckhqdq   %xmm2,%xmm9,%xmm1
   .byte  197,233,113,241,8                   // vpsllw        $0x8,%xmm1,%xmm2
@@ -23251,29 +23346,29 @@
   .byte  196,65,123,16,4,65                  // vmovsd        (%r9,%rax,2),%xmm8
   .byte  196,65,49,239,201                   // vpxor         %xmm9,%xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,85                              // je            5d4e <_sk_load_u16_be_avx+0x179>
+  .byte  116,85                              // je            5d82 <_sk_load_u16_be_avx+0x179>
   .byte  196,65,57,22,68,65,8                // vmovhpd       0x8(%r9,%rax,2),%xmm8,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,72                              // jb            5d4e <_sk_load_u16_be_avx+0x179>
+  .byte  114,72                              // jb            5d82 <_sk_load_u16_be_avx+0x179>
   .byte  196,193,123,16,84,65,16             // vmovsd        0x10(%r9,%rax,2),%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  116,72                              // je            5d5b <_sk_load_u16_be_avx+0x186>
+  .byte  116,72                              // je            5d8f <_sk_load_u16_be_avx+0x186>
   .byte  196,193,105,22,84,65,24             // vmovhpd       0x18(%r9,%rax,2),%xmm2,%xmm2
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,59                              // jb            5d5b <_sk_load_u16_be_avx+0x186>
+  .byte  114,59                              // jb            5d8f <_sk_load_u16_be_avx+0x186>
   .byte  196,193,123,16,92,65,32             // vmovsd        0x20(%r9,%rax,2),%xmm3
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  15,132,213,254,255,255              // je            5c06 <_sk_load_u16_be_avx+0x31>
+  .byte  15,132,213,254,255,255              // je            5c3a <_sk_load_u16_be_avx+0x31>
   .byte  196,193,97,22,92,65,40              // vmovhpd       0x28(%r9,%rax,2),%xmm3,%xmm3
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  15,130,196,254,255,255              // jb            5c06 <_sk_load_u16_be_avx+0x31>
+  .byte  15,130,196,254,255,255              // jb            5c3a <_sk_load_u16_be_avx+0x31>
   .byte  196,65,122,126,76,65,48             // vmovq         0x30(%r9,%rax,2),%xmm9
-  .byte  233,184,254,255,255                 // jmpq          5c06 <_sk_load_u16_be_avx+0x31>
+  .byte  233,184,254,255,255                 // jmpq          5c3a <_sk_load_u16_be_avx+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
   .byte  197,233,87,210                      // vxorpd        %xmm2,%xmm2,%xmm2
-  .byte  233,171,254,255,255                 // jmpq          5c06 <_sk_load_u16_be_avx+0x31>
+  .byte  233,171,254,255,255                 // jmpq          5c3a <_sk_load_u16_be_avx+0x31>
   .byte  197,225,87,219                      // vxorpd        %xmm3,%xmm3,%xmm3
-  .byte  233,162,254,255,255                 // jmpq          5c06 <_sk_load_u16_be_avx+0x31>
+  .byte  233,162,254,255,255                 // jmpq          5c3a <_sk_load_u16_be_avx+0x31>
 
 HIDDEN _sk_load_rgb_u16_be_avx
 .globl _sk_load_rgb_u16_be_avx
@@ -23283,7 +23378,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,82                         // lea           (%rdx,%rdx,2),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,243,0,0,0                    // jne           5e69 <_sk_load_rgb_u16_be_avx+0x105>
+  .byte  15,133,243,0,0,0                    // jne           5e9d <_sk_load_rgb_u16_be_avx+0x105>
   .byte  196,193,122,111,4,65                // vmovdqu       (%r9,%rax,2),%xmm0
   .byte  196,193,122,111,84,65,12            // vmovdqu       0xc(%r9,%rax,2),%xmm2
   .byte  196,193,122,111,76,65,24            // vmovdqu       0x18(%r9,%rax,2),%xmm1
@@ -23310,7 +23405,7 @@
   .byte  196,226,121,51,192                  // vpmovzxwd     %xmm0,%xmm0
   .byte  196,227,125,24,193,1                // vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   .byte  197,252,91,192                      // vcvtdq2ps     %ymm0,%ymm0
-  .byte  196,98,125,24,29,100,30,0,0         // vbroadcastss  0x1e64(%rip),%ymm11        # 7c64 <_sk_callback_avx+0x4fc>
+  .byte  196,98,125,24,29,108,30,0,0         // vbroadcastss  0x1e6c(%rip),%ymm11        # 7ca0 <_sk_callback_avx+0x504>
   .byte  196,193,124,89,195                  // vmulps        %ymm11,%ymm0,%ymm0
   .byte  197,185,109,202                     // vpunpckhqdq   %xmm2,%xmm8,%xmm1
   .byte  197,233,113,241,8                   // vpsllw        $0x8,%xmm1,%xmm2
@@ -23331,41 +23426,41 @@
   .byte  197,252,91,210                      // vcvtdq2ps     %ymm2,%ymm2
   .byte  196,193,108,89,211                  // vmulps        %ymm11,%ymm2,%ymm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,29,1,30,0,0          // vbroadcastss  0x1e01(%rip),%ymm3        # 7c68 <_sk_callback_avx+0x500>
+  .byte  196,226,125,24,29,9,30,0,0          // vbroadcastss  0x1e09(%rip),%ymm3        # 7ca4 <_sk_callback_avx+0x508>
   .byte  255,224                             // jmpq          *%rax
   .byte  196,193,121,110,4,65                // vmovd         (%r9,%rax,2),%xmm0
   .byte  196,193,121,196,68,65,4,2           // vpinsrw       $0x2,0x4(%r9,%rax,2),%xmm0,%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,5                               // jne           5e82 <_sk_load_rgb_u16_be_avx+0x11e>
-  .byte  233,40,255,255,255                  // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  117,5                               // jne           5eb6 <_sk_load_rgb_u16_be_avx+0x11e>
+  .byte  233,40,255,255,255                  // jmpq          5dde <_sk_load_rgb_u16_be_avx+0x46>
   .byte  196,193,121,110,76,65,6             // vmovd         0x6(%r9,%rax,2),%xmm1
   .byte  196,65,113,196,68,65,10,2           // vpinsrw       $0x2,0xa(%r9,%rax,2),%xmm1,%xmm8
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,26                              // jb            5eb1 <_sk_load_rgb_u16_be_avx+0x14d>
+  .byte  114,26                              // jb            5ee5 <_sk_load_rgb_u16_be_avx+0x14d>
   .byte  196,193,121,110,76,65,12            // vmovd         0xc(%r9,%rax,2),%xmm1
   .byte  196,193,113,196,84,65,16,2          // vpinsrw       $0x2,0x10(%r9,%rax,2),%xmm1,%xmm2
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  117,10                              // jne           5eb6 <_sk_load_rgb_u16_be_avx+0x152>
-  .byte  233,249,254,255,255                 // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
-  .byte  233,244,254,255,255                 // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  117,10                              // jne           5eea <_sk_load_rgb_u16_be_avx+0x152>
+  .byte  233,249,254,255,255                 // jmpq          5dde <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  233,244,254,255,255                 // jmpq          5dde <_sk_load_rgb_u16_be_avx+0x46>
   .byte  196,193,121,110,76,65,18            // vmovd         0x12(%r9,%rax,2),%xmm1
   .byte  196,65,113,196,76,65,22,2           // vpinsrw       $0x2,0x16(%r9,%rax,2),%xmm1,%xmm9
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,26                              // jb            5ee5 <_sk_load_rgb_u16_be_avx+0x181>
+  .byte  114,26                              // jb            5f19 <_sk_load_rgb_u16_be_avx+0x181>
   .byte  196,193,121,110,76,65,24            // vmovd         0x18(%r9,%rax,2),%xmm1
   .byte  196,193,113,196,76,65,28,2          // vpinsrw       $0x2,0x1c(%r9,%rax,2),%xmm1,%xmm1
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  117,10                              // jne           5eea <_sk_load_rgb_u16_be_avx+0x186>
-  .byte  233,197,254,255,255                 // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
-  .byte  233,192,254,255,255                 // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  117,10                              // jne           5f1e <_sk_load_rgb_u16_be_avx+0x186>
+  .byte  233,197,254,255,255                 // jmpq          5dde <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  233,192,254,255,255                 // jmpq          5dde <_sk_load_rgb_u16_be_avx+0x46>
   .byte  196,193,121,110,92,65,30            // vmovd         0x1e(%r9,%rax,2),%xmm3
   .byte  196,65,97,196,92,65,34,2            // vpinsrw       $0x2,0x22(%r9,%rax,2),%xmm3,%xmm11
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,20                              // jb            5f13 <_sk_load_rgb_u16_be_avx+0x1af>
+  .byte  114,20                              // jb            5f47 <_sk_load_rgb_u16_be_avx+0x1af>
   .byte  196,193,121,110,92,65,36            // vmovd         0x24(%r9,%rax,2),%xmm3
   .byte  196,193,97,196,92,65,40,2           // vpinsrw       $0x2,0x28(%r9,%rax,2),%xmm3,%xmm3
-  .byte  233,151,254,255,255                 // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
-  .byte  233,146,254,255,255                 // jmpq          5daa <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  233,151,254,255,255                 // jmpq          5dde <_sk_load_rgb_u16_be_avx+0x46>
+  .byte  233,146,254,255,255                 // jmpq          5dde <_sk_load_rgb_u16_be_avx+0x46>
 
 HIDDEN _sk_store_u16_be_avx
 .globl _sk_store_u16_be_avx
@@ -23374,7 +23469,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
-  .byte  196,98,125,24,5,62,29,0,0           // vbroadcastss  0x1d3e(%rip),%ymm8        # 7c6c <_sk_callback_avx+0x504>
+  .byte  196,98,125,24,5,70,29,0,0           // vbroadcastss  0x1d46(%rip),%ymm8        # 7ca8 <_sk_callback_avx+0x50c>
   .byte  196,65,124,89,200                   // vmulps        %ymm8,%ymm0,%ymm9
   .byte  196,65,125,91,201                   // vcvtps2dq     %ymm9,%ymm9
   .byte  196,67,125,25,202,1                 // vextractf128  $0x1,%ymm9,%xmm10
@@ -23412,7 +23507,7 @@
   .byte  196,65,17,98,200                    // vpunpckldq    %xmm8,%xmm13,%xmm9
   .byte  196,65,17,106,192                   // vpunpckhdq    %xmm8,%xmm13,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,31                              // jne           6012 <_sk_store_u16_be_avx+0xfa>
+  .byte  117,31                              // jne           6046 <_sk_store_u16_be_avx+0xfa>
   .byte  196,65,120,17,28,65                 // vmovups       %xmm11,(%r9,%rax,2)
   .byte  196,65,120,17,84,65,16              // vmovups       %xmm10,0x10(%r9,%rax,2)
   .byte  196,65,120,17,76,65,32              // vmovups       %xmm9,0x20(%r9,%rax,2)
@@ -23421,22 +23516,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,214,28,65                // vmovq         %xmm11,(%r9,%rax,2)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            600e <_sk_store_u16_be_avx+0xf6>
+  .byte  116,240                             // je            6042 <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,23,92,65,8               // vmovhpd       %xmm11,0x8(%r9,%rax,2)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            600e <_sk_store_u16_be_avx+0xf6>
+  .byte  114,227                             // jb            6042 <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,214,84,65,16             // vmovq         %xmm10,0x10(%r9,%rax,2)
-  .byte  116,218                             // je            600e <_sk_store_u16_be_avx+0xf6>
+  .byte  116,218                             // je            6042 <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,23,84,65,24              // vmovhpd       %xmm10,0x18(%r9,%rax,2)
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,205                             // jb            600e <_sk_store_u16_be_avx+0xf6>
+  .byte  114,205                             // jb            6042 <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,214,76,65,32             // vmovq         %xmm9,0x20(%r9,%rax,2)
-  .byte  116,196                             // je            600e <_sk_store_u16_be_avx+0xf6>
+  .byte  116,196                             // je            6042 <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,23,76,65,40              // vmovhpd       %xmm9,0x28(%r9,%rax,2)
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,183                             // jb            600e <_sk_store_u16_be_avx+0xf6>
+  .byte  114,183                             // jb            6042 <_sk_store_u16_be_avx+0xf6>
   .byte  196,65,121,214,68,65,48             // vmovq         %xmm8,0x30(%r9,%rax,2)
-  .byte  235,174                             // jmp           600e <_sk_store_u16_be_avx+0xf6>
+  .byte  235,174                             // jmp           6042 <_sk_store_u16_be_avx+0xf6>
 
 HIDDEN _sk_load_f32_avx
 .globl _sk_load_f32_avx
@@ -23444,10 +23539,10 @@
 _sk_load_f32_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  119,110                             // ja            60d6 <_sk_load_f32_avx+0x76>
+  .byte  119,110                             // ja            610a <_sk_load_f32_avx+0x76>
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
-  .byte  76,141,29,134,0,0,0                 // lea           0x86(%rip),%r11        # 6100 <_sk_load_f32_avx+0xa0>
+  .byte  76,141,29,134,0,0,0                 // lea           0x86(%rip),%r11        # 6134 <_sk_load_f32_avx+0xa0>
   .byte  75,99,4,131                         // movslq        (%r11,%r8,4),%rax
   .byte  76,1,216                            // add           %r11,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -23496,10 +23591,10 @@
 _sk_load_f32_dst_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  119,110                             // ja            6196 <_sk_load_f32_dst_avx+0x76>
+  .byte  119,110                             // ja            61ca <_sk_load_f32_dst_avx+0x76>
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
-  .byte  76,141,29,134,0,0,0                 // lea           0x86(%rip),%r11        # 61c0 <_sk_load_f32_dst_avx+0xa0>
+  .byte  76,141,29,134,0,0,0                 // lea           0x86(%rip),%r11        # 61f4 <_sk_load_f32_dst_avx+0xa0>
   .byte  75,99,4,131                         // movslq        (%r11,%r8,4),%rax
   .byte  76,1,216                            // add           %r11,%rax
   .byte  255,224                             // jmpq          *%rax
@@ -23558,7 +23653,7 @@
   .byte  196,65,37,20,196                    // vunpcklpd     %ymm12,%ymm11,%ymm8
   .byte  196,65,37,21,220                    // vunpckhpd     %ymm12,%ymm11,%ymm11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,55                              // jne           624d <_sk_store_f32_avx+0x6d>
+  .byte  117,55                              // jne           6281 <_sk_store_f32_avx+0x6d>
   .byte  196,67,45,24,225,1                  // vinsertf128   $0x1,%xmm9,%ymm10,%ymm12
   .byte  196,67,61,24,235,1                  // vinsertf128   $0x1,%xmm11,%ymm8,%ymm13
   .byte  196,67,45,6,201,49                  // vperm2f128    $0x31,%ymm9,%ymm10,%ymm9
@@ -23571,22 +23666,22 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,17,20,129                // vmovupd       %xmm10,(%r9,%rax,4)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            6249 <_sk_store_f32_avx+0x69>
+  .byte  116,240                             // je            627d <_sk_store_f32_avx+0x69>
   .byte  196,65,121,17,76,129,16             // vmovupd       %xmm9,0x10(%r9,%rax,4)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            6249 <_sk_store_f32_avx+0x69>
+  .byte  114,227                             // jb            627d <_sk_store_f32_avx+0x69>
   .byte  196,65,121,17,68,129,32             // vmovupd       %xmm8,0x20(%r9,%rax,4)
-  .byte  116,218                             // je            6249 <_sk_store_f32_avx+0x69>
+  .byte  116,218                             // je            627d <_sk_store_f32_avx+0x69>
   .byte  196,65,121,17,92,129,48             // vmovupd       %xmm11,0x30(%r9,%rax,4)
   .byte  73,131,248,5                        // cmp           $0x5,%r8
-  .byte  114,205                             // jb            6249 <_sk_store_f32_avx+0x69>
+  .byte  114,205                             // jb            627d <_sk_store_f32_avx+0x69>
   .byte  196,67,125,25,84,129,64,1           // vextractf128  $0x1,%ymm10,0x40(%r9,%rax,4)
-  .byte  116,195                             // je            6249 <_sk_store_f32_avx+0x69>
+  .byte  116,195                             // je            627d <_sk_store_f32_avx+0x69>
   .byte  196,67,125,25,76,129,80,1           // vextractf128  $0x1,%ymm9,0x50(%r9,%rax,4)
   .byte  73,131,248,7                        // cmp           $0x7,%r8
-  .byte  114,181                             // jb            6249 <_sk_store_f32_avx+0x69>
+  .byte  114,181                             // jb            627d <_sk_store_f32_avx+0x69>
   .byte  196,67,125,25,68,129,96,1           // vextractf128  $0x1,%ymm8,0x60(%r9,%rax,4)
-  .byte  235,171                             // jmp           6249 <_sk_store_f32_avx+0x69>
+  .byte  235,171                             // jmp           627d <_sk_store_f32_avx+0x69>
 
 HIDDEN _sk_clamp_x_avx
 .globl _sk_clamp_x_avx
@@ -23675,7 +23770,7 @@
   .byte  196,193,58,88,192                   // vaddss        %xmm8,%xmm8,%xmm0
   .byte  196,227,121,4,192,0                 // vpermilps     $0x0,%xmm0,%xmm0
   .byte  196,99,125,24,192,1                 // vinsertf128   $0x1,%xmm0,%ymm0,%ymm8
-  .byte  197,178,89,5,175,24,0,0             // vmulss        0x18af(%rip),%xmm9,%xmm0        # 7c70 <_sk_callback_avx+0x508>
+  .byte  197,178,89,5,183,24,0,0             // vmulss        0x18b7(%rip),%xmm9,%xmm0        # 7cac <_sk_callback_avx+0x510>
   .byte  196,227,121,4,192,0                 // vpermilps     $0x0,%xmm0,%xmm0
   .byte  196,227,125,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   .byte  197,164,89,192                      // vmulps        %ymm0,%ymm11,%ymm0
@@ -23708,7 +23803,7 @@
   .byte  196,193,58,88,200                   // vaddss        %xmm8,%xmm8,%xmm1
   .byte  196,227,121,4,201,0                 // vpermilps     $0x0,%xmm1,%xmm1
   .byte  196,99,117,24,193,1                 // vinsertf128   $0x1,%xmm1,%ymm1,%ymm8
-  .byte  197,178,89,13,42,24,0,0             // vmulss        0x182a(%rip),%xmm9,%xmm1        # 7c74 <_sk_callback_avx+0x50c>
+  .byte  197,178,89,13,50,24,0,0             // vmulss        0x1832(%rip),%xmm9,%xmm1        # 7cb0 <_sk_callback_avx+0x514>
   .byte  196,227,121,4,201,0                 // vpermilps     $0x0,%xmm1,%xmm1
   .byte  196,227,117,24,201,1                // vinsertf128   $0x1,%xmm1,%ymm1,%ymm1
   .byte  197,164,89,201                      // vmulps        %ymm1,%ymm11,%ymm1
@@ -23734,7 +23829,7 @@
 _sk_clamp_x_1_avx:
   .byte  196,65,60,87,192                    // vxorps        %ymm8,%ymm8,%ymm8
   .byte  197,188,95,192                      // vmaxps        %ymm0,%ymm8,%ymm0
-  .byte  196,98,125,24,5,200,23,0,0          // vbroadcastss  0x17c8(%rip),%ymm8        # 7c78 <_sk_callback_avx+0x510>
+  .byte  196,98,125,24,5,208,23,0,0          // vbroadcastss  0x17d0(%rip),%ymm8        # 7cb4 <_sk_callback_avx+0x518>
   .byte  196,193,124,93,192                  // vminps        %ymm8,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -23752,9 +23847,9 @@
 .globl _sk_mirror_x_1_avx
 FUNCTION(_sk_mirror_x_1_avx)
 _sk_mirror_x_1_avx:
-  .byte  196,98,125,24,5,171,23,0,0          // vbroadcastss  0x17ab(%rip),%ymm8        # 7c7c <_sk_callback_avx+0x514>
+  .byte  196,98,125,24,5,179,23,0,0          // vbroadcastss  0x17b3(%rip),%ymm8        # 7cb8 <_sk_callback_avx+0x51c>
   .byte  196,193,124,88,192                  // vaddps        %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,13,161,23,0,0         // vbroadcastss  0x17a1(%rip),%ymm9        # 7c80 <_sk_callback_avx+0x518>
+  .byte  196,98,125,24,13,169,23,0,0         // vbroadcastss  0x17a9(%rip),%ymm9        # 7cbc <_sk_callback_avx+0x520>
   .byte  196,65,124,89,201                   // vmulps        %ymm9,%ymm0,%ymm9
   .byte  196,67,125,8,201,1                  // vroundps      $0x1,%ymm9,%ymm9
   .byte  196,65,52,88,201                    // vaddps        %ymm9,%ymm9,%ymm9
@@ -23770,12 +23865,12 @@
 .globl _sk_luminance_to_alpha_avx
 FUNCTION(_sk_luminance_to_alpha_avx)
 _sk_luminance_to_alpha_avx:
-  .byte  196,226,125,24,29,113,23,0,0        // vbroadcastss  0x1771(%rip),%ymm3        # 7c84 <_sk_callback_avx+0x51c>
+  .byte  196,226,125,24,29,121,23,0,0        // vbroadcastss  0x1779(%rip),%ymm3        # 7cc0 <_sk_callback_avx+0x524>
   .byte  197,252,89,195                      // vmulps        %ymm3,%ymm0,%ymm0
-  .byte  196,226,125,24,29,104,23,0,0        // vbroadcastss  0x1768(%rip),%ymm3        # 7c88 <_sk_callback_avx+0x520>
+  .byte  196,226,125,24,29,112,23,0,0        // vbroadcastss  0x1770(%rip),%ymm3        # 7cc4 <_sk_callback_avx+0x528>
   .byte  197,244,89,203                      // vmulps        %ymm3,%ymm1,%ymm1
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
-  .byte  196,226,125,24,13,91,23,0,0         // vbroadcastss  0x175b(%rip),%ymm1        # 7c8c <_sk_callback_avx+0x524>
+  .byte  196,226,125,24,13,99,23,0,0         // vbroadcastss  0x1763(%rip),%ymm1        # 7cc8 <_sk_callback_avx+0x52c>
   .byte  197,236,89,201                      // vmulps        %ymm1,%ymm2,%ymm1
   .byte  197,252,88,217                      // vaddps        %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -24023,9 +24118,9 @@
   .byte  72,139,24                           // mov           (%rax),%rbx
   .byte  72,139,104,8                        // mov           0x8(%rax),%rbp
   .byte  72,255,203                          // dec           %rbx
-  .byte  120,7                               // js            68d5 <_sk_evenly_spaced_gradient_avx+0x25>
+  .byte  120,7                               // js            6909 <_sk_evenly_spaced_gradient_avx+0x25>
   .byte  196,225,242,42,203                  // vcvtsi2ss     %rbx,%xmm1,%xmm1
-  .byte  235,21                              // jmp           68ea <_sk_evenly_spaced_gradient_avx+0x3a>
+  .byte  235,21                              // jmp           691e <_sk_evenly_spaced_gradient_avx+0x3a>
   .byte  73,137,217                          // mov           %rbx,%r9
   .byte  73,209,233                          // shr           %r9
   .byte  131,227,1                           // and           $0x1,%ebx
@@ -24183,18 +24278,18 @@
 .globl _sk_gauss_a_to_rgba_avx
 FUNCTION(_sk_gauss_a_to_rgba_avx)
 _sk_gauss_a_to_rgba_avx:
-  .byte  196,226,125,24,5,66,16,0,0          // vbroadcastss  0x1042(%rip),%ymm0        # 7c90 <_sk_callback_avx+0x528>
+  .byte  196,226,125,24,5,74,16,0,0          // vbroadcastss  0x104a(%rip),%ymm0        # 7ccc <_sk_callback_avx+0x530>
   .byte  197,228,89,192                      // vmulps        %ymm0,%ymm3,%ymm0
-  .byte  196,226,125,24,13,57,16,0,0         // vbroadcastss  0x1039(%rip),%ymm1        # 7c94 <_sk_callback_avx+0x52c>
+  .byte  196,226,125,24,13,65,16,0,0         // vbroadcastss  0x1041(%rip),%ymm1        # 7cd0 <_sk_callback_avx+0x534>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  197,252,89,195                      // vmulps        %ymm3,%ymm0,%ymm0
-  .byte  196,226,125,24,13,44,16,0,0         // vbroadcastss  0x102c(%rip),%ymm1        # 7c98 <_sk_callback_avx+0x530>
+  .byte  196,226,125,24,13,52,16,0,0         // vbroadcastss  0x1034(%rip),%ymm1        # 7cd4 <_sk_callback_avx+0x538>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  197,252,89,195                      // vmulps        %ymm3,%ymm0,%ymm0
-  .byte  196,226,125,24,13,31,16,0,0         // vbroadcastss  0x101f(%rip),%ymm1        # 7c9c <_sk_callback_avx+0x534>
+  .byte  196,226,125,24,13,39,16,0,0         // vbroadcastss  0x1027(%rip),%ymm1        # 7cd8 <_sk_callback_avx+0x53c>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  197,252,89,195                      // vmulps        %ymm3,%ymm0,%ymm0
-  .byte  196,226,125,24,13,18,16,0,0         // vbroadcastss  0x1012(%rip),%ymm1        # 7ca0 <_sk_callback_avx+0x538>
+  .byte  196,226,125,24,13,26,16,0,0         // vbroadcastss  0x101a(%rip),%ymm1        # 7cdc <_sk_callback_avx+0x540>
   .byte  197,252,88,193                      // vaddps        %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,252,40,200                      // vmovaps       %ymm0,%ymm1
@@ -24217,12 +24312,12 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  197,244,87,201                      // vxorps        %ymm1,%ymm1,%ymm1
   .byte  73,131,249,2                        // cmp           $0x2,%r9
-  .byte  114,80                              // jb            6d11 <_sk_gradient_avx+0x6f>
+  .byte  114,80                              // jb            6d45 <_sk_gradient_avx+0x6f>
   .byte  72,139,88,72                        // mov           0x48(%rax),%rbx
   .byte  73,255,201                          // dec           %r9
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  196,65,52,87,201                    // vxorps        %ymm9,%ymm9,%ymm9
-  .byte  196,98,125,24,21,202,15,0,0         // vbroadcastss  0xfca(%rip),%ymm10        # 7ca4 <_sk_callback_avx+0x53c>
+  .byte  196,98,125,24,21,210,15,0,0         // vbroadcastss  0xfd2(%rip),%ymm10        # 7ce0 <_sk_callback_avx+0x544>
   .byte  197,244,87,201                      // vxorps        %ymm1,%ymm1,%ymm1
   .byte  196,98,125,24,3                     // vbroadcastss  (%rbx),%ymm8
   .byte  197,60,194,192,2                    // vcmpleps      %ymm0,%ymm8,%ymm8
@@ -24234,7 +24329,7 @@
   .byte  196,227,117,24,202,1                // vinsertf128   $0x1,%xmm2,%ymm1,%ymm1
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  73,255,201                          // dec           %r9
-  .byte  117,205                             // jne           6cde <_sk_gradient_avx+0x3c>
+  .byte  117,205                             // jne           6d12 <_sk_gradient_avx+0x3c>
   .byte  196,195,249,22,201,1                // vpextrq       $0x1,%xmm1,%r9
   .byte  69,137,202                          // mov           %r9d,%r10d
   .byte  73,193,233,32                       // shr           $0x20,%r9
@@ -24417,27 +24512,27 @@
   .byte  196,65,52,95,226                    // vmaxps        %ymm10,%ymm9,%ymm12
   .byte  196,65,36,94,220                    // vdivps        %ymm12,%ymm11,%ymm11
   .byte  196,65,36,89,227                    // vmulps        %ymm11,%ymm11,%ymm12
-  .byte  196,98,125,24,45,192,11,0,0         // vbroadcastss  0xbc0(%rip),%ymm13        # 7ca8 <_sk_callback_avx+0x540>
+  .byte  196,98,125,24,45,200,11,0,0         // vbroadcastss  0xbc8(%rip),%ymm13        # 7ce4 <_sk_callback_avx+0x548>
   .byte  196,65,28,89,237                    // vmulps        %ymm13,%ymm12,%ymm13
-  .byte  196,98,125,24,53,182,11,0,0         // vbroadcastss  0xbb6(%rip),%ymm14        # 7cac <_sk_callback_avx+0x544>
+  .byte  196,98,125,24,53,190,11,0,0         // vbroadcastss  0xbbe(%rip),%ymm14        # 7ce8 <_sk_callback_avx+0x54c>
   .byte  196,65,20,88,238                    // vaddps        %ymm14,%ymm13,%ymm13
   .byte  196,65,28,89,237                    // vmulps        %ymm13,%ymm12,%ymm13
-  .byte  196,98,125,24,53,167,11,0,0         // vbroadcastss  0xba7(%rip),%ymm14        # 7cb0 <_sk_callback_avx+0x548>
+  .byte  196,98,125,24,53,175,11,0,0         // vbroadcastss  0xbaf(%rip),%ymm14        # 7cec <_sk_callback_avx+0x550>
   .byte  196,65,20,88,238                    // vaddps        %ymm14,%ymm13,%ymm13
   .byte  196,65,28,89,229                    // vmulps        %ymm13,%ymm12,%ymm12
-  .byte  196,98,125,24,45,152,11,0,0         // vbroadcastss  0xb98(%rip),%ymm13        # 7cb4 <_sk_callback_avx+0x54c>
+  .byte  196,98,125,24,45,160,11,0,0         // vbroadcastss  0xba0(%rip),%ymm13        # 7cf0 <_sk_callback_avx+0x554>
   .byte  196,65,28,88,229                    // vaddps        %ymm13,%ymm12,%ymm12
   .byte  196,65,36,89,220                    // vmulps        %ymm12,%ymm11,%ymm11
   .byte  196,65,52,194,202,1                 // vcmpltps      %ymm10,%ymm9,%ymm9
-  .byte  196,98,125,24,21,131,11,0,0         // vbroadcastss  0xb83(%rip),%ymm10        # 7cb8 <_sk_callback_avx+0x550>
+  .byte  196,98,125,24,21,139,11,0,0         // vbroadcastss  0xb8b(%rip),%ymm10        # 7cf4 <_sk_callback_avx+0x558>
   .byte  196,65,44,92,211                    // vsubps        %ymm11,%ymm10,%ymm10
   .byte  196,67,37,74,202,144                // vblendvps     %ymm9,%ymm10,%ymm11,%ymm9
   .byte  196,193,124,194,192,1               // vcmpltps      %ymm8,%ymm0,%ymm0
-  .byte  196,98,125,24,21,109,11,0,0         // vbroadcastss  0xb6d(%rip),%ymm10        # 7cbc <_sk_callback_avx+0x554>
+  .byte  196,98,125,24,21,117,11,0,0         // vbroadcastss  0xb75(%rip),%ymm10        # 7cf8 <_sk_callback_avx+0x55c>
   .byte  196,65,44,92,209                    // vsubps        %ymm9,%ymm10,%ymm10
   .byte  196,195,53,74,194,0                 // vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   .byte  196,65,116,194,200,1                // vcmpltps      %ymm8,%ymm1,%ymm9
-  .byte  196,98,125,24,21,87,11,0,0          // vbroadcastss  0xb57(%rip),%ymm10        # 7cc0 <_sk_callback_avx+0x558>
+  .byte  196,98,125,24,21,95,11,0,0          // vbroadcastss  0xb5f(%rip),%ymm10        # 7cfc <_sk_callback_avx+0x560>
   .byte  197,44,92,208                       // vsubps        %ymm0,%ymm10,%ymm10
   .byte  196,195,125,74,194,144              // vblendvps     %ymm9,%ymm10,%ymm0,%ymm0
   .byte  196,65,124,194,200,3                // vcmpunordps   %ymm8,%ymm0,%ymm9
@@ -24467,7 +24562,7 @@
   .byte  196,67,121,4,210,0                  // vpermilps     $0x0,%xmm10,%xmm10
   .byte  196,67,45,24,210,1                  // vinsertf128   $0x1,%xmm10,%ymm10,%ymm10
   .byte  197,44,88,208                       // vaddps        %ymm0,%ymm10,%ymm10
-  .byte  196,98,125,24,29,1,11,0,0           // vbroadcastss  0xb01(%rip),%ymm11        # 7cc4 <_sk_callback_avx+0x55c>
+  .byte  196,98,125,24,29,9,11,0,0           // vbroadcastss  0xb09(%rip),%ymm11        # 7d00 <_sk_callback_avx+0x564>
   .byte  196,65,44,89,211                    // vmulps        %ymm11,%ymm10,%ymm10
   .byte  197,252,89,192                      // vmulps        %ymm0,%ymm0,%ymm0
   .byte  197,116,89,217                      // vmulps        %ymm1,%ymm1,%ymm11
@@ -24476,17 +24571,17 @@
   .byte  196,227,121,4,192,0                 // vpermilps     $0x0,%xmm0,%xmm0
   .byte  196,227,125,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   .byte  197,164,92,192                      // vsubps        %ymm0,%ymm11,%ymm0
-  .byte  196,98,125,24,13,213,10,0,0         // vbroadcastss  0xad5(%rip),%ymm9        # 7cc8 <_sk_callback_avx+0x560>
+  .byte  196,98,125,24,13,221,10,0,0         // vbroadcastss  0xadd(%rip),%ymm9        # 7d04 <_sk_callback_avx+0x568>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  196,65,44,89,194                    // vmulps        %ymm10,%ymm10,%ymm8
   .byte  196,193,124,88,192                  // vaddps        %ymm8,%ymm0,%ymm0
   .byte  197,252,81,192                      // vsqrtps       %ymm0,%ymm0
   .byte  196,98,125,24,64,36                 // vbroadcastss  0x24(%rax),%ymm8
-  .byte  196,98,125,24,13,179,10,0,0         // vbroadcastss  0xab3(%rip),%ymm9        # 7ccc <_sk_callback_avx+0x564>
+  .byte  196,98,125,24,13,187,10,0,0         // vbroadcastss  0xabb(%rip),%ymm9        # 7d08 <_sk_callback_avx+0x56c>
   .byte  196,65,44,87,201                    // vxorps        %ymm9,%ymm10,%ymm9
   .byte  196,65,124,92,210                   // vsubps        %ymm10,%ymm0,%ymm10
-  .byte  196,98,125,24,29,164,10,0,0         // vbroadcastss  0xaa4(%rip),%ymm11        # 7cd0 <_sk_callback_avx+0x568>
+  .byte  196,98,125,24,29,172,10,0,0         // vbroadcastss  0xaac(%rip),%ymm11        # 7d0c <_sk_callback_avx+0x570>
   .byte  196,65,60,89,195                    // vmulps        %ymm11,%ymm8,%ymm8
   .byte  196,65,60,89,210                    // vmulps        %ymm10,%ymm8,%ymm10
   .byte  197,180,92,192                      // vsubps        %ymm0,%ymm9,%ymm0
@@ -24506,7 +24601,7 @@
   .byte  196,67,121,4,210,0                  // vpermilps     $0x0,%xmm10,%xmm10
   .byte  196,67,45,24,210,1                  // vinsertf128   $0x1,%xmm10,%ymm10,%ymm10
   .byte  197,44,88,208                       // vaddps        %ymm0,%ymm10,%ymm10
-  .byte  196,98,125,24,29,99,10,0,0          // vbroadcastss  0xa63(%rip),%ymm11        # 7cd4 <_sk_callback_avx+0x56c>
+  .byte  196,98,125,24,29,107,10,0,0         // vbroadcastss  0xa6b(%rip),%ymm11        # 7d10 <_sk_callback_avx+0x574>
   .byte  196,65,44,89,211                    // vmulps        %ymm11,%ymm10,%ymm10
   .byte  197,252,89,192                      // vmulps        %ymm0,%ymm0,%ymm0
   .byte  197,116,89,217                      // vmulps        %ymm1,%ymm1,%ymm11
@@ -24515,17 +24610,17 @@
   .byte  196,227,121,4,192,0                 // vpermilps     $0x0,%xmm0,%xmm0
   .byte  196,227,125,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   .byte  197,164,92,192                      // vsubps        %ymm0,%ymm11,%ymm0
-  .byte  196,98,125,24,13,55,10,0,0          // vbroadcastss  0xa37(%rip),%ymm9        # 7cd8 <_sk_callback_avx+0x570>
+  .byte  196,98,125,24,13,63,10,0,0          // vbroadcastss  0xa3f(%rip),%ymm9        # 7d14 <_sk_callback_avx+0x578>
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
   .byte  197,188,89,192                      // vmulps        %ymm0,%ymm8,%ymm0
   .byte  196,65,44,89,194                    // vmulps        %ymm10,%ymm10,%ymm8
   .byte  196,193,124,88,192                  // vaddps        %ymm8,%ymm0,%ymm0
   .byte  197,252,81,192                      // vsqrtps       %ymm0,%ymm0
   .byte  196,98,125,24,64,36                 // vbroadcastss  0x24(%rax),%ymm8
-  .byte  196,98,125,24,13,21,10,0,0          // vbroadcastss  0xa15(%rip),%ymm9        # 7cdc <_sk_callback_avx+0x574>
+  .byte  196,98,125,24,13,29,10,0,0          // vbroadcastss  0xa1d(%rip),%ymm9        # 7d18 <_sk_callback_avx+0x57c>
   .byte  196,65,44,87,201                    // vxorps        %ymm9,%ymm10,%ymm9
   .byte  196,65,124,92,210                   // vsubps        %ymm10,%ymm0,%ymm10
-  .byte  196,98,125,24,29,6,10,0,0           // vbroadcastss  0xa06(%rip),%ymm11        # 7ce0 <_sk_callback_avx+0x578>
+  .byte  196,98,125,24,29,14,10,0,0          // vbroadcastss  0xa0e(%rip),%ymm11        # 7d1c <_sk_callback_avx+0x580>
   .byte  196,65,60,89,195                    // vmulps        %ymm11,%ymm8,%ymm8
   .byte  196,65,60,89,210                    // vmulps        %ymm10,%ymm8,%ymm10
   .byte  197,180,92,192                      // vsubps        %ymm0,%ymm9,%ymm0
@@ -24544,7 +24639,7 @@
   .byte  196,67,121,4,201,0                  // vpermilps     $0x0,%xmm9,%xmm9
   .byte  196,67,53,24,201,1                  // vinsertf128   $0x1,%xmm9,%ymm9,%ymm9
   .byte  197,52,88,200                       // vaddps        %ymm0,%ymm9,%ymm9
-  .byte  196,98,125,24,21,203,9,0,0          // vbroadcastss  0x9cb(%rip),%ymm10        # 7ce4 <_sk_callback_avx+0x57c>
+  .byte  196,98,125,24,21,211,9,0,0          // vbroadcastss  0x9d3(%rip),%ymm10        # 7d20 <_sk_callback_avx+0x584>
   .byte  196,65,52,89,202                    // vmulps        %ymm10,%ymm9,%ymm9
   .byte  197,252,89,192                      // vmulps        %ymm0,%ymm0,%ymm0
   .byte  197,116,89,209                      // vmulps        %ymm1,%ymm1,%ymm10
@@ -24553,7 +24648,7 @@
   .byte  196,227,121,4,192,0                 // vpermilps     $0x0,%xmm0,%xmm0
   .byte  196,227,125,24,192,1                // vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   .byte  197,172,92,192                      // vsubps        %ymm0,%ymm10,%ymm0
-  .byte  196,98,125,24,5,159,9,0,0           // vbroadcastss  0x99f(%rip),%ymm8        # 7ce8 <_sk_callback_avx+0x580>
+  .byte  196,98,125,24,5,167,9,0,0           // vbroadcastss  0x9a7(%rip),%ymm8        # 7d24 <_sk_callback_avx+0x588>
   .byte  196,193,124,87,192                  // vxorps        %ymm8,%ymm0,%ymm0
   .byte  196,193,124,94,193                  // vdivps        %ymm9,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -24594,7 +24689,7 @@
 FUNCTION(_sk_save_xy_avx)
 _sk_save_xy_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,59,9,0,0            // vbroadcastss  0x93b(%rip),%ymm8        # 7cec <_sk_callback_avx+0x584>
+  .byte  196,98,125,24,5,67,9,0,0            // vbroadcastss  0x943(%rip),%ymm8        # 7d28 <_sk_callback_avx+0x58c>
   .byte  196,65,124,88,200                   // vaddps        %ymm8,%ymm0,%ymm9
   .byte  196,67,125,8,209,1                  // vroundps      $0x1,%ymm9,%ymm10
   .byte  196,65,52,92,202                    // vsubps        %ymm10,%ymm9,%ymm9
@@ -24631,9 +24726,9 @@
 FUNCTION(_sk_bilinear_nx_avx)
 _sk_bilinear_nx_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,199,8,0,0          // vbroadcastss  0x8c7(%rip),%ymm0        # 7cf0 <_sk_callback_avx+0x588>
+  .byte  196,226,125,24,5,207,8,0,0          // vbroadcastss  0x8cf(%rip),%ymm0        # 7d2c <_sk_callback_avx+0x590>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,190,8,0,0           // vbroadcastss  0x8be(%rip),%ymm8        # 7cf4 <_sk_callback_avx+0x58c>
+  .byte  196,98,125,24,5,198,8,0,0           // vbroadcastss  0x8c6(%rip),%ymm8        # 7d30 <_sk_callback_avx+0x594>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -24644,7 +24739,7 @@
 FUNCTION(_sk_bilinear_px_avx)
 _sk_bilinear_px_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,166,8,0,0          // vbroadcastss  0x8a6(%rip),%ymm0        # 7cf8 <_sk_callback_avx+0x590>
+  .byte  196,226,125,24,5,174,8,0,0          // vbroadcastss  0x8ae(%rip),%ymm0        # 7d34 <_sk_callback_avx+0x598>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
   .byte  197,124,16,64,64                    // vmovups       0x40(%rax),%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -24656,9 +24751,9 @@
 FUNCTION(_sk_bilinear_ny_avx)
 _sk_bilinear_ny_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,138,8,0,0         // vbroadcastss  0x88a(%rip),%ymm1        # 7cfc <_sk_callback_avx+0x594>
+  .byte  196,226,125,24,13,146,8,0,0         // vbroadcastss  0x892(%rip),%ymm1        # 7d38 <_sk_callback_avx+0x59c>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,128,8,0,0           // vbroadcastss  0x880(%rip),%ymm8        # 7d00 <_sk_callback_avx+0x598>
+  .byte  196,98,125,24,5,136,8,0,0           // vbroadcastss  0x888(%rip),%ymm8        # 7d3c <_sk_callback_avx+0x5a0>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -24669,7 +24764,7 @@
 FUNCTION(_sk_bilinear_py_avx)
 _sk_bilinear_py_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,104,8,0,0         // vbroadcastss  0x868(%rip),%ymm1        # 7d04 <_sk_callback_avx+0x59c>
+  .byte  196,226,125,24,13,112,8,0,0         // vbroadcastss  0x870(%rip),%ymm1        # 7d40 <_sk_callback_avx+0x5a4>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
   .byte  197,124,16,64,96                    // vmovups       0x60(%rax),%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -24681,14 +24776,14 @@
 FUNCTION(_sk_bicubic_n3x_avx)
 _sk_bicubic_n3x_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,75,8,0,0           // vbroadcastss  0x84b(%rip),%ymm0        # 7d08 <_sk_callback_avx+0x5a0>
+  .byte  196,226,125,24,5,83,8,0,0           // vbroadcastss  0x853(%rip),%ymm0        # 7d44 <_sk_callback_avx+0x5a8>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,66,8,0,0            // vbroadcastss  0x842(%rip),%ymm8        # 7d0c <_sk_callback_avx+0x5a4>
+  .byte  196,98,125,24,5,74,8,0,0            // vbroadcastss  0x84a(%rip),%ymm8        # 7d48 <_sk_callback_avx+0x5ac>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,51,8,0,0           // vbroadcastss  0x833(%rip),%ymm10        # 7d10 <_sk_callback_avx+0x5a8>
+  .byte  196,98,125,24,21,59,8,0,0           // vbroadcastss  0x83b(%rip),%ymm10        # 7d4c <_sk_callback_avx+0x5b0>
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
-  .byte  196,98,125,24,21,41,8,0,0           // vbroadcastss  0x829(%rip),%ymm10        # 7d14 <_sk_callback_avx+0x5ac>
+  .byte  196,98,125,24,21,49,8,0,0           // vbroadcastss  0x831(%rip),%ymm10        # 7d50 <_sk_callback_avx+0x5b4>
   .byte  196,65,60,88,194                    // vaddps        %ymm10,%ymm8,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -24700,19 +24795,19 @@
 FUNCTION(_sk_bicubic_n1x_avx)
 _sk_bicubic_n1x_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,12,8,0,0           // vbroadcastss  0x80c(%rip),%ymm0        # 7d18 <_sk_callback_avx+0x5b0>
+  .byte  196,226,125,24,5,20,8,0,0           // vbroadcastss  0x814(%rip),%ymm0        # 7d54 <_sk_callback_avx+0x5b8>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
-  .byte  196,98,125,24,5,3,8,0,0             // vbroadcastss  0x803(%rip),%ymm8        # 7d1c <_sk_callback_avx+0x5b4>
+  .byte  196,98,125,24,5,11,8,0,0            // vbroadcastss  0x80b(%rip),%ymm8        # 7d58 <_sk_callback_avx+0x5bc>
   .byte  197,60,92,64,64                     // vsubps        0x40(%rax),%ymm8,%ymm8
-  .byte  196,98,125,24,13,249,7,0,0          // vbroadcastss  0x7f9(%rip),%ymm9        # 7d20 <_sk_callback_avx+0x5b8>
+  .byte  196,98,125,24,13,1,8,0,0            // vbroadcastss  0x801(%rip),%ymm9        # 7d5c <_sk_callback_avx+0x5c0>
   .byte  196,65,60,89,201                    // vmulps        %ymm9,%ymm8,%ymm9
-  .byte  196,98,125,24,21,239,7,0,0          // vbroadcastss  0x7ef(%rip),%ymm10        # 7d24 <_sk_callback_avx+0x5bc>
+  .byte  196,98,125,24,21,247,7,0,0          // vbroadcastss  0x7f7(%rip),%ymm10        # 7d60 <_sk_callback_avx+0x5c4>
   .byte  196,65,52,88,202                    // vaddps        %ymm10,%ymm9,%ymm9
   .byte  196,65,60,89,201                    // vmulps        %ymm9,%ymm8,%ymm9
-  .byte  196,98,125,24,21,224,7,0,0          // vbroadcastss  0x7e0(%rip),%ymm10        # 7d28 <_sk_callback_avx+0x5c0>
+  .byte  196,98,125,24,21,232,7,0,0          // vbroadcastss  0x7e8(%rip),%ymm10        # 7d64 <_sk_callback_avx+0x5c8>
   .byte  196,65,52,88,202                    // vaddps        %ymm10,%ymm9,%ymm9
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
-  .byte  196,98,125,24,13,209,7,0,0          // vbroadcastss  0x7d1(%rip),%ymm9        # 7d2c <_sk_callback_avx+0x5c4>
+  .byte  196,98,125,24,13,217,7,0,0          // vbroadcastss  0x7d9(%rip),%ymm9        # 7d68 <_sk_callback_avx+0x5cc>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -24723,17 +24818,17 @@
 FUNCTION(_sk_bicubic_p1x_avx)
 _sk_bicubic_p1x_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,185,7,0,0           // vbroadcastss  0x7b9(%rip),%ymm8        # 7d30 <_sk_callback_avx+0x5c8>
+  .byte  196,98,125,24,5,193,7,0,0           // vbroadcastss  0x7c1(%rip),%ymm8        # 7d6c <_sk_callback_avx+0x5d0>
   .byte  197,188,88,0                        // vaddps        (%rax),%ymm8,%ymm0
   .byte  197,124,16,72,64                    // vmovups       0x40(%rax),%ymm9
-  .byte  196,98,125,24,21,171,7,0,0          // vbroadcastss  0x7ab(%rip),%ymm10        # 7d34 <_sk_callback_avx+0x5cc>
+  .byte  196,98,125,24,21,179,7,0,0          // vbroadcastss  0x7b3(%rip),%ymm10        # 7d70 <_sk_callback_avx+0x5d4>
   .byte  196,65,52,89,210                    // vmulps        %ymm10,%ymm9,%ymm10
-  .byte  196,98,125,24,29,161,7,0,0          // vbroadcastss  0x7a1(%rip),%ymm11        # 7d38 <_sk_callback_avx+0x5d0>
+  .byte  196,98,125,24,29,169,7,0,0          // vbroadcastss  0x7a9(%rip),%ymm11        # 7d74 <_sk_callback_avx+0x5d8>
   .byte  196,65,44,88,211                    // vaddps        %ymm11,%ymm10,%ymm10
   .byte  196,65,52,89,210                    // vmulps        %ymm10,%ymm9,%ymm10
   .byte  196,65,44,88,192                    // vaddps        %ymm8,%ymm10,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
-  .byte  196,98,125,24,13,136,7,0,0          // vbroadcastss  0x788(%rip),%ymm9        # 7d3c <_sk_callback_avx+0x5d4>
+  .byte  196,98,125,24,13,144,7,0,0          // vbroadcastss  0x790(%rip),%ymm9        # 7d78 <_sk_callback_avx+0x5dc>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -24744,13 +24839,13 @@
 FUNCTION(_sk_bicubic_p3x_avx)
 _sk_bicubic_p3x_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,5,112,7,0,0          // vbroadcastss  0x770(%rip),%ymm0        # 7d40 <_sk_callback_avx+0x5d8>
+  .byte  196,226,125,24,5,120,7,0,0          // vbroadcastss  0x778(%rip),%ymm0        # 7d7c <_sk_callback_avx+0x5e0>
   .byte  197,252,88,0                        // vaddps        (%rax),%ymm0,%ymm0
   .byte  197,124,16,64,64                    // vmovups       0x40(%rax),%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,93,7,0,0           // vbroadcastss  0x75d(%rip),%ymm10        # 7d44 <_sk_callback_avx+0x5dc>
+  .byte  196,98,125,24,21,101,7,0,0          // vbroadcastss  0x765(%rip),%ymm10        # 7d80 <_sk_callback_avx+0x5e4>
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
-  .byte  196,98,125,24,21,83,7,0,0           // vbroadcastss  0x753(%rip),%ymm10        # 7d48 <_sk_callback_avx+0x5e0>
+  .byte  196,98,125,24,21,91,7,0,0           // vbroadcastss  0x75b(%rip),%ymm10        # 7d84 <_sk_callback_avx+0x5e8>
   .byte  196,65,60,88,194                    // vaddps        %ymm10,%ymm8,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
   .byte  197,124,17,128,128,0,0,0            // vmovups       %ymm8,0x80(%rax)
@@ -24762,14 +24857,14 @@
 FUNCTION(_sk_bicubic_n3y_avx)
 _sk_bicubic_n3y_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,54,7,0,0          // vbroadcastss  0x736(%rip),%ymm1        # 7d4c <_sk_callback_avx+0x5e4>
+  .byte  196,226,125,24,13,62,7,0,0          // vbroadcastss  0x73e(%rip),%ymm1        # 7d88 <_sk_callback_avx+0x5ec>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,44,7,0,0            // vbroadcastss  0x72c(%rip),%ymm8        # 7d50 <_sk_callback_avx+0x5e8>
+  .byte  196,98,125,24,5,52,7,0,0            // vbroadcastss  0x734(%rip),%ymm8        # 7d8c <_sk_callback_avx+0x5f0>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,29,7,0,0           // vbroadcastss  0x71d(%rip),%ymm10        # 7d54 <_sk_callback_avx+0x5ec>
+  .byte  196,98,125,24,21,37,7,0,0           // vbroadcastss  0x725(%rip),%ymm10        # 7d90 <_sk_callback_avx+0x5f4>
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
-  .byte  196,98,125,24,21,19,7,0,0           // vbroadcastss  0x713(%rip),%ymm10        # 7d58 <_sk_callback_avx+0x5f0>
+  .byte  196,98,125,24,21,27,7,0,0           // vbroadcastss  0x71b(%rip),%ymm10        # 7d94 <_sk_callback_avx+0x5f8>
   .byte  196,65,60,88,194                    // vaddps        %ymm10,%ymm8,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -24781,19 +24876,19 @@
 FUNCTION(_sk_bicubic_n1y_avx)
 _sk_bicubic_n1y_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,246,6,0,0         // vbroadcastss  0x6f6(%rip),%ymm1        # 7d5c <_sk_callback_avx+0x5f4>
+  .byte  196,226,125,24,13,254,6,0,0         // vbroadcastss  0x6fe(%rip),%ymm1        # 7d98 <_sk_callback_avx+0x5fc>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
-  .byte  196,98,125,24,5,236,6,0,0           // vbroadcastss  0x6ec(%rip),%ymm8        # 7d60 <_sk_callback_avx+0x5f8>
+  .byte  196,98,125,24,5,244,6,0,0           // vbroadcastss  0x6f4(%rip),%ymm8        # 7d9c <_sk_callback_avx+0x600>
   .byte  197,60,92,64,96                     // vsubps        0x60(%rax),%ymm8,%ymm8
-  .byte  196,98,125,24,13,226,6,0,0          // vbroadcastss  0x6e2(%rip),%ymm9        # 7d64 <_sk_callback_avx+0x5fc>
+  .byte  196,98,125,24,13,234,6,0,0          // vbroadcastss  0x6ea(%rip),%ymm9        # 7da0 <_sk_callback_avx+0x604>
   .byte  196,65,60,89,201                    // vmulps        %ymm9,%ymm8,%ymm9
-  .byte  196,98,125,24,21,216,6,0,0          // vbroadcastss  0x6d8(%rip),%ymm10        # 7d68 <_sk_callback_avx+0x600>
+  .byte  196,98,125,24,21,224,6,0,0          // vbroadcastss  0x6e0(%rip),%ymm10        # 7da4 <_sk_callback_avx+0x608>
   .byte  196,65,52,88,202                    // vaddps        %ymm10,%ymm9,%ymm9
   .byte  196,65,60,89,201                    // vmulps        %ymm9,%ymm8,%ymm9
-  .byte  196,98,125,24,21,201,6,0,0          // vbroadcastss  0x6c9(%rip),%ymm10        # 7d6c <_sk_callback_avx+0x604>
+  .byte  196,98,125,24,21,209,6,0,0          // vbroadcastss  0x6d1(%rip),%ymm10        # 7da8 <_sk_callback_avx+0x60c>
   .byte  196,65,52,88,202                    // vaddps        %ymm10,%ymm9,%ymm9
   .byte  196,65,60,89,193                    // vmulps        %ymm9,%ymm8,%ymm8
-  .byte  196,98,125,24,13,186,6,0,0          // vbroadcastss  0x6ba(%rip),%ymm9        # 7d70 <_sk_callback_avx+0x608>
+  .byte  196,98,125,24,13,194,6,0,0          // vbroadcastss  0x6c2(%rip),%ymm9        # 7dac <_sk_callback_avx+0x610>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -24804,17 +24899,17 @@
 FUNCTION(_sk_bicubic_p1y_avx)
 _sk_bicubic_p1y_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,98,125,24,5,162,6,0,0           // vbroadcastss  0x6a2(%rip),%ymm8        # 7d74 <_sk_callback_avx+0x60c>
+  .byte  196,98,125,24,5,170,6,0,0           // vbroadcastss  0x6aa(%rip),%ymm8        # 7db0 <_sk_callback_avx+0x614>
   .byte  197,188,88,72,32                    // vaddps        0x20(%rax),%ymm8,%ymm1
   .byte  197,124,16,72,96                    // vmovups       0x60(%rax),%ymm9
-  .byte  196,98,125,24,21,147,6,0,0          // vbroadcastss  0x693(%rip),%ymm10        # 7d78 <_sk_callback_avx+0x610>
+  .byte  196,98,125,24,21,155,6,0,0          // vbroadcastss  0x69b(%rip),%ymm10        # 7db4 <_sk_callback_avx+0x618>
   .byte  196,65,52,89,210                    // vmulps        %ymm10,%ymm9,%ymm10
-  .byte  196,98,125,24,29,137,6,0,0          // vbroadcastss  0x689(%rip),%ymm11        # 7d7c <_sk_callback_avx+0x614>
+  .byte  196,98,125,24,29,145,6,0,0          // vbroadcastss  0x691(%rip),%ymm11        # 7db8 <_sk_callback_avx+0x61c>
   .byte  196,65,44,88,211                    // vaddps        %ymm11,%ymm10,%ymm10
   .byte  196,65,52,89,210                    // vmulps        %ymm10,%ymm9,%ymm10
   .byte  196,65,44,88,192                    // vaddps        %ymm8,%ymm10,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
-  .byte  196,98,125,24,13,112,6,0,0          // vbroadcastss  0x670(%rip),%ymm9        # 7d80 <_sk_callback_avx+0x618>
+  .byte  196,98,125,24,13,120,6,0,0          // vbroadcastss  0x678(%rip),%ymm9        # 7dbc <_sk_callback_avx+0x620>
   .byte  196,65,60,88,193                    // vaddps        %ymm9,%ymm8,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -24825,13 +24920,13 @@
 FUNCTION(_sk_bicubic_p3y_avx)
 _sk_bicubic_p3y_avx:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,24,13,88,6,0,0          // vbroadcastss  0x658(%rip),%ymm1        # 7d84 <_sk_callback_avx+0x61c>
+  .byte  196,226,125,24,13,96,6,0,0          // vbroadcastss  0x660(%rip),%ymm1        # 7dc0 <_sk_callback_avx+0x624>
   .byte  197,244,88,72,32                    // vaddps        0x20(%rax),%ymm1,%ymm1
   .byte  197,124,16,64,96                    // vmovups       0x60(%rax),%ymm8
   .byte  196,65,60,89,200                    // vmulps        %ymm8,%ymm8,%ymm9
-  .byte  196,98,125,24,21,68,6,0,0           // vbroadcastss  0x644(%rip),%ymm10        # 7d88 <_sk_callback_avx+0x620>
+  .byte  196,98,125,24,21,76,6,0,0           // vbroadcastss  0x64c(%rip),%ymm10        # 7dc4 <_sk_callback_avx+0x628>
   .byte  196,65,60,89,194                    // vmulps        %ymm10,%ymm8,%ymm8
-  .byte  196,98,125,24,21,58,6,0,0           // vbroadcastss  0x63a(%rip),%ymm10        # 7d8c <_sk_callback_avx+0x624>
+  .byte  196,98,125,24,21,66,6,0,0           // vbroadcastss  0x642(%rip),%ymm10        # 7dc8 <_sk_callback_avx+0x62c>
   .byte  196,65,60,88,194                    // vaddps        %ymm10,%ymm8,%ymm8
   .byte  196,65,52,89,192                    // vmulps        %ymm8,%ymm9,%ymm8
   .byte  197,124,17,128,160,0,0,0            // vmovups       %ymm8,0xa0(%rax)
@@ -24956,30 +25051,32 @@
   .byte  63                                  // (bad)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
-  .byte  0,128,191,0,0,224                   // add           %al,-0x1fffff41(%rax)
-  .byte  64,154                              // rex           (bad)
+  .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
+  .byte  63                                  // (bad)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  128,191,0,0,224,64,154              // cmpb          $0x9a,0x40e00000(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 795d <.literal4+0xb1>
+  .byte  71,225,61                           // rex.RXB       loope 7999 <.literal4+0xb9>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 796d <.literal4+0xc1>
+  .byte  71,225,61                           // rex.RXB       loope 79a9 <.literal4+0xc9>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 797d <.literal4+0xd1>
+  .byte  71,225,61                           // rex.RXB       loope 79b9 <.literal4+0xd9>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,154                          // cmpb          $0x9a,(%rdi)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
   .byte  62,61,10,23,63,174                  // ds            cmp $0xae3f170a,%eax
-  .byte  71,225,61                           // rex.RXB       loope 798d <.literal4+0xe1>
+  .byte  71,225,61                           // rex.RXB       loope 79c9 <.literal4+0xe9>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,127                    // add           %al,0x7f00003f(%rax)
@@ -25043,7 +25140,7 @@
   .byte  190,129,128,128,59                  // mov           $0x3b808081,%esi
   .byte  129,128,128,59,0,248,0,0,8,33       // addl          $0x21080000,-0x7ffc480(%rax)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        79f9 <.literal4+0x14d>
+  .byte  224,7                               // loopne        7a35 <.literal4+0x155>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -25059,10 +25156,10 @@
   .byte  129,128,128,59,129,128,128,59,0,0   // addl          $0x3b80,-0x7f7ec480(%rax)
   .byte  0,52,255                            // add           %dh,(%rdi,%rdi,8)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            7a20 <.literal4+0x174>
+  .byte  127,0                               // jg            7a5c <.literal4+0x17c>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            7a99 <.literal4+0x1ed>
+  .byte  119,115                             // ja            7ad5 <.literal4+0x1f5>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -25076,10 +25173,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            7a54 <.literal4+0x1a8>
+  .byte  127,0                               // jg            7a90 <.literal4+0x1b0>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            7acd <.literal4+0x221>
+  .byte  119,115                             // ja            7b09 <.literal4+0x229>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -25093,10 +25190,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            7a88 <.literal4+0x1dc>
+  .byte  127,0                               // jg            7ac4 <.literal4+0x1e4>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            7b01 <.literal4+0x255>
+  .byte  119,115                             // ja            7b3d <.literal4+0x25d>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -25110,10 +25207,10 @@
   .byte  0,128,63,0,0,0                      // add           %al,0x3f(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            7abc <.literal4+0x210>
+  .byte  127,0                               // jg            7af8 <.literal4+0x218>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            7b35 <.literal4+0x289>
+  .byte  119,115                             // ja            7b71 <.literal4+0x291>
   .byte  248                                 // clc
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,249,68,180                   // mov           $0xb444f93f,%edi
@@ -25126,7 +25223,7 @@
   .byte  0,75,0                              // add           %cl,0x0(%rbx)
   .byte  0,128,63,0,0,200                    // add           %al,-0x37ffffc1(%rax)
   .byte  66,0,0                              // rex.X         add %al,(%rax)
-  .byte  127,67                              // jg            7b33 <.literal4+0x287>
+  .byte  127,67                              // jg            7b6f <.literal4+0x28f>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,195                               // add           %al,%bl
   .byte  0,0                                 // add           %al,(%rax)
@@ -25138,7 +25235,7 @@
   .byte  190,80,128,3,62                     // mov           $0x3e038050,%esi
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           7b53 <.literal4+0x2a7>
+  .byte  118,63                              // jbe           7b8f <.literal4+0x2af>
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
@@ -25153,7 +25250,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        7b55 <.literal4+0x2a9>
+  .byte  224,7                               // loopne        7b91 <.literal4+0x2b1>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -25165,7 +25262,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        7b71 <.literal4+0x2c5>
+  .byte  224,7                               // loopne        7bad <.literal4+0x2cd>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -25177,7 +25274,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        7b8d <.literal4+0x2e1>
+  .byte  224,7                               // loopne        7bc9 <.literal4+0x2e9>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -25188,7 +25285,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  248                                 // clc
   .byte  65,0,0                              // add           %al,(%r8)
-  .byte  124,66                              // jl            7be2 <.literal4+0x336>
+  .byte  124,66                              // jl            7c1e <.literal4+0x33e>
   .byte  0,240                               // add           %dh,%al
   .byte  0,0                                 // add           %al,(%rax)
   .byte  137,136,136,55,0,15                 // mov           %ecx,0xf003788(%rax)
@@ -25214,7 +25311,7 @@
   .byte  137,136,136,59,15,0                 // mov           %ecx,0xf3b88(%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  137,136,136,61,0,0                  // mov           %ecx,0x3d88(%rax)
-  .byte  112,65                              // jo            7c45 <.literal4+0x399>
+  .byte  112,65                              // jo            7c81 <.literal4+0x3a1>
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
@@ -25240,7 +25337,7 @@
   .byte  0,128,55,0,0,128                    // add           %al,-0x7fffffc9(%rax)
   .byte  63                                  // (bad)
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            7cb7 <.literal4+0x40b>
+  .byte  127,71                              // jg            7cf3 <.literal4+0x413>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -25786,7 +25883,7 @@
   .byte  102,15,110,194                      // movd          %edx,%xmm0
   .byte  102,15,112,192,0                    // pshufd        $0x0,%xmm0,%xmm0
   .byte  15,91,200                           // cvtdq2ps      %xmm0,%xmm1
-  .byte  15,40,21,127,91,0,0                 // movaps        0x5b7f(%rip),%xmm2        # 5c20 <_sk_callback_sse41+0xf7>
+  .byte  15,40,21,175,91,0,0                 // movaps        0x5baf(%rip),%xmm2        # 5c50 <_sk_callback_sse41+0xff>
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  15,16,7                             // movups        (%rdi),%xmm0
   .byte  15,88,193                           // addps         %xmm1,%xmm0
@@ -25795,7 +25892,7 @@
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,21,110,91,0,0                 // movaps        0x5b6e(%rip),%xmm2        # 5c30 <_sk_callback_sse41+0x107>
+  .byte  15,40,21,158,91,0,0                 // movaps        0x5b9e(%rip),%xmm2        # 5c60 <_sk_callback_sse41+0x10f>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  15,87,237                           // xorps         %xmm5,%xmm5
@@ -25815,14 +25912,14 @@
   .byte  102,68,15,110,193                   // movd          %ecx,%xmm8
   .byte  102,69,15,112,192,0                 // pshufd        $0x0,%xmm8,%xmm8
   .byte  102,69,15,239,193                   // pxor          %xmm9,%xmm8
-  .byte  102,68,15,111,21,60,91,0,0          // movdqa        0x5b3c(%rip),%xmm10        # 5c40 <_sk_callback_sse41+0x117>
+  .byte  102,68,15,111,21,108,91,0,0         // movdqa        0x5b6c(%rip),%xmm10        # 5c70 <_sk_callback_sse41+0x11f>
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
   .byte  102,69,15,219,218                   // pand          %xmm10,%xmm11
   .byte  102,65,15,114,243,5                 // pslld         $0x5,%xmm11
   .byte  102,69,15,219,209                   // pand          %xmm9,%xmm10
   .byte  102,65,15,114,242,4                 // pslld         $0x4,%xmm10
-  .byte  102,68,15,111,37,40,91,0,0          // movdqa        0x5b28(%rip),%xmm12        # 5c50 <_sk_callback_sse41+0x127>
-  .byte  102,68,15,111,45,47,91,0,0          // movdqa        0x5b2f(%rip),%xmm13        # 5c60 <_sk_callback_sse41+0x137>
+  .byte  102,68,15,111,37,88,91,0,0          // movdqa        0x5b58(%rip),%xmm12        # 5c80 <_sk_callback_sse41+0x12f>
+  .byte  102,68,15,111,45,95,91,0,0          // movdqa        0x5b5f(%rip),%xmm13        # 5c90 <_sk_callback_sse41+0x13f>
   .byte  102,69,15,111,240                   // movdqa        %xmm8,%xmm14
   .byte  102,69,15,219,245                   // pand          %xmm13,%xmm14
   .byte  102,65,15,114,246,2                 // pslld         $0x2,%xmm14
@@ -25838,8 +25935,8 @@
   .byte  102,69,15,235,245                   // por           %xmm13,%xmm14
   .byte  102,69,15,235,240                   // por           %xmm8,%xmm14
   .byte  69,15,91,198                        // cvtdq2ps      %xmm14,%xmm8
-  .byte  68,15,89,5,234,90,0,0               // mulps         0x5aea(%rip),%xmm8        # 5c70 <_sk_callback_sse41+0x147>
-  .byte  68,15,88,5,242,90,0,0               // addps         0x5af2(%rip),%xmm8        # 5c80 <_sk_callback_sse41+0x157>
+  .byte  68,15,89,5,26,91,0,0                // mulps         0x5b1a(%rip),%xmm8        # 5ca0 <_sk_callback_sse41+0x14f>
+  .byte  68,15,88,5,34,91,0,0                // addps         0x5b22(%rip),%xmm8        # 5cb0 <_sk_callback_sse41+0x15f>
   .byte  243,68,15,16,16                     // movss         (%rax),%xmm10
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
@@ -25860,10 +25957,10 @@
   .byte  65,15,40,201                        // movaps        %xmm9,%xmm1
   .byte  255,224                             // jmpq          *%rax
 
-HIDDEN _sk_constant_color_sse41
-.globl _sk_constant_color_sse41
-FUNCTION(_sk_constant_color_sse41)
-_sk_constant_color_sse41:
+HIDDEN _sk_uniform_color_sse41
+.globl _sk_uniform_color_sse41
+FUNCTION(_sk_uniform_color_sse41)
+_sk_uniform_color_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  243,15,16,0                         // movss         (%rax),%xmm0
   .byte  243,15,16,72,4                      // movss         0x4(%rax),%xmm1
@@ -25876,6 +25973,28 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
+HIDDEN _sk_black_color_sse41
+.globl _sk_black_color_sse41
+FUNCTION(_sk_black_color_sse41)
+_sk_black_color_sse41:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  15,40,29,184,90,0,0                 // movaps        0x5ab8(%rip),%xmm3        # 5cc0 <_sk_callback_sse41+0x16f>
+  .byte  15,87,192                           // xorps         %xmm0,%xmm0
+  .byte  15,87,201                           // xorps         %xmm1,%xmm1
+  .byte  15,87,210                           // xorps         %xmm2,%xmm2
+  .byte  255,224                             // jmpq          *%rax
+
+HIDDEN _sk_white_color_sse41
+.globl _sk_white_color_sse41
+FUNCTION(_sk_white_color_sse41)
+_sk_white_color_sse41:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  15,40,5,180,90,0,0                  // movaps        0x5ab4(%rip),%xmm0        # 5cd0 <_sk_callback_sse41+0x17f>
+  .byte  15,40,200                           // movaps        %xmm0,%xmm1
+  .byte  15,40,208                           // movaps        %xmm0,%xmm2
+  .byte  15,40,216                           // movaps        %xmm0,%xmm3
+  .byte  255,224                             // jmpq          *%rax
+
 HIDDEN _sk_load_rgba_sse41
 .globl _sk_load_rgba_sse41
 FUNCTION(_sk_load_rgba_sse41)
@@ -25916,7 +26035,7 @@
 FUNCTION(_sk_srcatop_sse41)
 _sk_srcatop_sse41:
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
-  .byte  68,15,40,5,76,90,0,0                // movaps        0x5a4c(%rip),%xmm8        # 5c90 <_sk_callback_sse41+0x167>
+  .byte  68,15,40,5,116,90,0,0               // movaps        0x5a74(%rip),%xmm8        # 5ce0 <_sk_callback_sse41+0x18f>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -25941,7 +26060,7 @@
 _sk_dstatop_sse41:
   .byte  68,15,40,195                        // movaps        %xmm3,%xmm8
   .byte  68,15,89,196                        // mulps         %xmm4,%xmm8
-  .byte  68,15,40,13,15,90,0,0               // movaps        0x5a0f(%rip),%xmm9        # 5ca0 <_sk_callback_sse41+0x177>
+  .byte  68,15,40,13,55,90,0,0               // movaps        0x5a37(%rip),%xmm9        # 5cf0 <_sk_callback_sse41+0x19f>
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
@@ -25988,7 +26107,7 @@
 .globl _sk_srcout_sse41
 FUNCTION(_sk_srcout_sse41)
 _sk_srcout_sse41:
-  .byte  68,15,40,5,179,89,0,0               // movaps        0x59b3(%rip),%xmm8        # 5cb0 <_sk_callback_sse41+0x187>
+  .byte  68,15,40,5,219,89,0,0               // movaps        0x59db(%rip),%xmm8        # 5d00 <_sk_callback_sse41+0x1af>
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
@@ -26001,7 +26120,7 @@
 .globl _sk_dstout_sse41
 FUNCTION(_sk_dstout_sse41)
 _sk_dstout_sse41:
-  .byte  68,15,40,5,163,89,0,0               // movaps        0x59a3(%rip),%xmm8        # 5cc0 <_sk_callback_sse41+0x197>
+  .byte  68,15,40,5,203,89,0,0               // movaps        0x59cb(%rip),%xmm8        # 5d10 <_sk_callback_sse41+0x1bf>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
@@ -26018,7 +26137,7 @@
 .globl _sk_srcover_sse41
 FUNCTION(_sk_srcover_sse41)
 _sk_srcover_sse41:
-  .byte  68,15,40,5,134,89,0,0               // movaps        0x5986(%rip),%xmm8        # 5cd0 <_sk_callback_sse41+0x1a7>
+  .byte  68,15,40,5,174,89,0,0               // movaps        0x59ae(%rip),%xmm8        # 5d20 <_sk_callback_sse41+0x1cf>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -26038,7 +26157,7 @@
 .globl _sk_dstover_sse41
 FUNCTION(_sk_dstover_sse41)
 _sk_dstover_sse41:
-  .byte  68,15,40,5,90,89,0,0                // movaps        0x595a(%rip),%xmm8        # 5ce0 <_sk_callback_sse41+0x1b7>
+  .byte  68,15,40,5,130,89,0,0               // movaps        0x5982(%rip),%xmm8        # 5d30 <_sk_callback_sse41+0x1df>
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -26066,7 +26185,7 @@
 .globl _sk_multiply_sse41
 FUNCTION(_sk_multiply_sse41)
 _sk_multiply_sse41:
-  .byte  68,15,40,5,46,89,0,0                // movaps        0x592e(%rip),%xmm8        # 5cf0 <_sk_callback_sse41+0x1c7>
+  .byte  68,15,40,5,86,89,0,0                // movaps        0x5956(%rip),%xmm8        # 5d40 <_sk_callback_sse41+0x1ef>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
@@ -26141,7 +26260,7 @@
 FUNCTION(_sk_xor__sse41)
 _sk_xor__sse41:
   .byte  68,15,40,195                        // movaps        %xmm3,%xmm8
-  .byte  15,40,29,99,88,0,0                  // movaps        0x5863(%rip),%xmm3        # 5d00 <_sk_callback_sse41+0x1d7>
+  .byte  15,40,29,139,88,0,0                 // movaps        0x588b(%rip),%xmm3        # 5d50 <_sk_callback_sse41+0x1ff>
   .byte  68,15,40,203                        // movaps        %xmm3,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
@@ -26189,7 +26308,7 @@
   .byte  68,15,89,206                        // mulps         %xmm6,%xmm9
   .byte  65,15,95,209                        // maxps         %xmm9,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,206,87,0,0                 // movaps        0x57ce(%rip),%xmm2        # 5d10 <_sk_callback_sse41+0x1e7>
+  .byte  15,40,21,246,87,0,0                 // movaps        0x57f6(%rip),%xmm2        # 5d60 <_sk_callback_sse41+0x20f>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -26223,7 +26342,7 @@
   .byte  68,15,89,206                        // mulps         %xmm6,%xmm9
   .byte  65,15,93,209                        // minps         %xmm9,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,115,87,0,0                 // movaps        0x5773(%rip),%xmm2        # 5d20 <_sk_callback_sse41+0x1f7>
+  .byte  15,40,21,155,87,0,0                 // movaps        0x579b(%rip),%xmm2        # 5d70 <_sk_callback_sse41+0x21f>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -26260,7 +26379,7 @@
   .byte  65,15,93,209                        // minps         %xmm9,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,13,87,0,0                  // movaps        0x570d(%rip),%xmm2        # 5d30 <_sk_callback_sse41+0x207>
+  .byte  15,40,21,53,87,0,0                  // movaps        0x5735(%rip),%xmm2        # 5d80 <_sk_callback_sse41+0x22f>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -26288,7 +26407,7 @@
   .byte  15,89,214                           // mulps         %xmm6,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,205,86,0,0                 // movaps        0x56cd(%rip),%xmm2        # 5d40 <_sk_callback_sse41+0x217>
+  .byte  15,40,21,245,86,0,0                 // movaps        0x56f5(%rip),%xmm2        # 5d90 <_sk_callback_sse41+0x23f>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -26301,7 +26420,7 @@
 FUNCTION(_sk_colorburn_sse41)
 _sk_colorburn_sse41:
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,40,21,192,86,0,0              // movaps        0x56c0(%rip),%xmm10        # 5d50 <_sk_callback_sse41+0x227>
+  .byte  68,15,40,21,232,86,0,0              // movaps        0x56e8(%rip),%xmm10        # 5da0 <_sk_callback_sse41+0x24f>
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
   .byte  68,15,92,223                        // subps         %xmm7,%xmm11
   .byte  69,15,40,203                        // movaps        %xmm11,%xmm9
@@ -26383,7 +26502,7 @@
 FUNCTION(_sk_colordodge_sse41)
 _sk_colordodge_sse41:
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,40,21,158,85,0,0              // movaps        0x559e(%rip),%xmm10        # 5d60 <_sk_callback_sse41+0x237>
+  .byte  68,15,40,21,198,85,0,0              // movaps        0x55c6(%rip),%xmm10        # 5db0 <_sk_callback_sse41+0x25f>
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
   .byte  68,15,92,223                        // subps         %xmm7,%xmm11
   .byte  69,15,40,227                        // movaps        %xmm11,%xmm12
@@ -26465,7 +26584,7 @@
   .byte  15,40,244                           // movaps        %xmm4,%xmm6
   .byte  15,40,227                           // movaps        %xmm3,%xmm4
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
-  .byte  68,15,40,21,119,84,0,0              // movaps        0x5477(%rip),%xmm10        # 5d70 <_sk_callback_sse41+0x247>
+  .byte  68,15,40,21,159,84,0,0              // movaps        0x549f(%rip),%xmm10        # 5dc0 <_sk_callback_sse41+0x26f>
   .byte  65,15,40,234                        // movaps        %xmm10,%xmm5
   .byte  15,92,239                           // subps         %xmm7,%xmm5
   .byte  15,40,197                           // movaps        %xmm5,%xmm0
@@ -26548,7 +26667,7 @@
 _sk_overlay_sse41:
   .byte  68,15,40,201                        // movaps        %xmm1,%xmm9
   .byte  68,15,40,240                        // movaps        %xmm0,%xmm14
-  .byte  68,15,40,21,92,83,0,0               // movaps        0x535c(%rip),%xmm10        # 5d80 <_sk_callback_sse41+0x257>
+  .byte  68,15,40,21,132,83,0,0              // movaps        0x5384(%rip),%xmm10        # 5dd0 <_sk_callback_sse41+0x27f>
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
   .byte  68,15,92,223                        // subps         %xmm7,%xmm11
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
@@ -26633,7 +26752,7 @@
   .byte  15,40,198                           // movaps        %xmm6,%xmm0
   .byte  15,94,199                           // divps         %xmm7,%xmm0
   .byte  65,15,84,193                        // andps         %xmm9,%xmm0
-  .byte  15,40,13,51,82,0,0                  // movaps        0x5233(%rip),%xmm1        # 5d90 <_sk_callback_sse41+0x267>
+  .byte  15,40,13,91,82,0,0                  // movaps        0x525b(%rip),%xmm1        # 5de0 <_sk_callback_sse41+0x28f>
   .byte  68,15,40,209                        // movaps        %xmm1,%xmm10
   .byte  68,15,92,208                        // subps         %xmm0,%xmm10
   .byte  68,15,40,240                        // movaps        %xmm0,%xmm14
@@ -26646,10 +26765,10 @@
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  15,89,210                           // mulps         %xmm2,%xmm2
   .byte  15,88,208                           // addps         %xmm0,%xmm2
-  .byte  68,15,40,45,17,82,0,0               // movaps        0x5211(%rip),%xmm13        # 5da0 <_sk_callback_sse41+0x277>
+  .byte  68,15,40,45,57,82,0,0               // movaps        0x5239(%rip),%xmm13        # 5df0 <_sk_callback_sse41+0x29f>
   .byte  69,15,88,245                        // addps         %xmm13,%xmm14
   .byte  68,15,89,242                        // mulps         %xmm2,%xmm14
-  .byte  68,15,40,37,17,82,0,0               // movaps        0x5211(%rip),%xmm12        # 5db0 <_sk_callback_sse41+0x287>
+  .byte  68,15,40,37,57,82,0,0               // movaps        0x5239(%rip),%xmm12        # 5e00 <_sk_callback_sse41+0x2af>
   .byte  69,15,89,252                        // mulps         %xmm12,%xmm15
   .byte  69,15,88,254                        // addps         %xmm14,%xmm15
   .byte  15,40,198                           // movaps        %xmm6,%xmm0
@@ -26835,12 +26954,12 @@
   .byte  68,15,84,208                        // andps         %xmm0,%xmm10
   .byte  15,84,200                           // andps         %xmm0,%xmm1
   .byte  68,15,84,232                        // andps         %xmm0,%xmm13
-  .byte  15,40,5,124,79,0,0                  // movaps        0x4f7c(%rip),%xmm0        # 5dc0 <_sk_callback_sse41+0x297>
+  .byte  15,40,5,164,79,0,0                  // movaps        0x4fa4(%rip),%xmm0        # 5e10 <_sk_callback_sse41+0x2bf>
   .byte  68,15,89,224                        // mulps         %xmm0,%xmm12
-  .byte  15,40,21,129,79,0,0                 // movaps        0x4f81(%rip),%xmm2        # 5dd0 <_sk_callback_sse41+0x2a7>
+  .byte  15,40,21,169,79,0,0                 // movaps        0x4fa9(%rip),%xmm2        # 5e20 <_sk_callback_sse41+0x2cf>
   .byte  15,89,250                           // mulps         %xmm2,%xmm7
   .byte  65,15,88,252                        // addps         %xmm12,%xmm7
-  .byte  68,15,40,53,130,79,0,0              // movaps        0x4f82(%rip),%xmm14        # 5de0 <_sk_callback_sse41+0x2b7>
+  .byte  68,15,40,53,170,79,0,0              // movaps        0x4faa(%rip),%xmm14        # 5e30 <_sk_callback_sse41+0x2df>
   .byte  68,15,40,252                        // movaps        %xmm4,%xmm15
   .byte  69,15,89,254                        // mulps         %xmm14,%xmm15
   .byte  68,15,88,255                        // addps         %xmm7,%xmm15
@@ -26923,7 +27042,7 @@
   .byte  65,15,88,214                        // addps         %xmm14,%xmm2
   .byte  15,40,196                           // movaps        %xmm4,%xmm0
   .byte  102,15,56,20,202                    // blendvps      %xmm0,%xmm2,%xmm1
-  .byte  68,15,40,13,70,78,0,0               // movaps        0x4e46(%rip),%xmm9        # 5df0 <_sk_callback_sse41+0x2c7>
+  .byte  68,15,40,13,110,78,0,0              // movaps        0x4e6e(%rip),%xmm9        # 5e40 <_sk_callback_sse41+0x2ef>
   .byte  65,15,40,225                        // movaps        %xmm9,%xmm4
   .byte  15,92,229                           // subps         %xmm5,%xmm4
   .byte  15,40,68,36,200                     // movaps        -0x38(%rsp),%xmm0
@@ -27017,14 +27136,14 @@
   .byte  68,15,84,215                        // andps         %xmm7,%xmm10
   .byte  68,15,84,223                        // andps         %xmm7,%xmm11
   .byte  68,15,84,199                        // andps         %xmm7,%xmm8
-  .byte  15,40,21,0,77,0,0                   // movaps        0x4d00(%rip),%xmm2        # 5e00 <_sk_callback_sse41+0x2d7>
+  .byte  15,40,21,40,77,0,0                  // movaps        0x4d28(%rip),%xmm2        # 5e50 <_sk_callback_sse41+0x2ff>
   .byte  15,40,221                           // movaps        %xmm5,%xmm3
   .byte  15,89,218                           // mulps         %xmm2,%xmm3
-  .byte  15,40,13,3,77,0,0                   // movaps        0x4d03(%rip),%xmm1        # 5e10 <_sk_callback_sse41+0x2e7>
+  .byte  15,40,13,43,77,0,0                  // movaps        0x4d2b(%rip),%xmm1        # 5e60 <_sk_callback_sse41+0x30f>
   .byte  15,40,254                           // movaps        %xmm6,%xmm7
   .byte  15,89,249                           // mulps         %xmm1,%xmm7
   .byte  15,88,251                           // addps         %xmm3,%xmm7
-  .byte  68,15,40,45,2,77,0,0                // movaps        0x4d02(%rip),%xmm13        # 5e20 <_sk_callback_sse41+0x2f7>
+  .byte  68,15,40,45,42,77,0,0               // movaps        0x4d2a(%rip),%xmm13        # 5e70 <_sk_callback_sse41+0x31f>
   .byte  69,15,89,245                        // mulps         %xmm13,%xmm14
   .byte  68,15,88,247                        // addps         %xmm7,%xmm14
   .byte  65,15,40,218                        // movaps        %xmm10,%xmm3
@@ -27105,7 +27224,7 @@
   .byte  65,15,88,253                        // addps         %xmm13,%xmm7
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  102,68,15,56,20,223                 // blendvps      %xmm0,%xmm7,%xmm11
-  .byte  68,15,40,13,200,75,0,0              // movaps        0x4bc8(%rip),%xmm9        # 5e30 <_sk_callback_sse41+0x307>
+  .byte  68,15,40,13,240,75,0,0              // movaps        0x4bf0(%rip),%xmm9        # 5e80 <_sk_callback_sse41+0x32f>
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  68,15,92,204                        // subps         %xmm4,%xmm9
   .byte  15,40,124,36,168                    // movaps        -0x58(%rsp),%xmm7
@@ -27160,14 +27279,14 @@
   .byte  15,40,231                           // movaps        %xmm7,%xmm4
   .byte  68,15,89,244                        // mulps         %xmm4,%xmm14
   .byte  15,89,204                           // mulps         %xmm4,%xmm1
-  .byte  68,15,40,13,19,75,0,0               // movaps        0x4b13(%rip),%xmm9        # 5e40 <_sk_callback_sse41+0x317>
+  .byte  68,15,40,13,59,75,0,0               // movaps        0x4b3b(%rip),%xmm9        # 5e90 <_sk_callback_sse41+0x33f>
   .byte  65,15,40,250                        // movaps        %xmm10,%xmm7
   .byte  65,15,89,249                        // mulps         %xmm9,%xmm7
-  .byte  68,15,40,21,19,75,0,0               // movaps        0x4b13(%rip),%xmm10        # 5e50 <_sk_callback_sse41+0x327>
+  .byte  68,15,40,21,59,75,0,0               // movaps        0x4b3b(%rip),%xmm10        # 5ea0 <_sk_callback_sse41+0x34f>
   .byte  65,15,40,219                        // movaps        %xmm11,%xmm3
   .byte  65,15,89,218                        // mulps         %xmm10,%xmm3
   .byte  15,88,223                           // addps         %xmm7,%xmm3
-  .byte  68,15,40,29,16,75,0,0               // movaps        0x4b10(%rip),%xmm11        # 5e60 <_sk_callback_sse41+0x337>
+  .byte  68,15,40,29,56,75,0,0               // movaps        0x4b38(%rip),%xmm11        # 5eb0 <_sk_callback_sse41+0x35f>
   .byte  69,15,40,236                        // movaps        %xmm12,%xmm13
   .byte  69,15,89,235                        // mulps         %xmm11,%xmm13
   .byte  68,15,88,235                        // addps         %xmm3,%xmm13
@@ -27252,7 +27371,7 @@
   .byte  65,15,88,251                        // addps         %xmm11,%xmm7
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  102,15,56,20,207                    // blendvps      %xmm0,%xmm7,%xmm1
-  .byte  68,15,40,13,204,73,0,0              // movaps        0x49cc(%rip),%xmm9        # 5e70 <_sk_callback_sse41+0x347>
+  .byte  68,15,40,13,244,73,0,0              // movaps        0x49f4(%rip),%xmm9        # 5ec0 <_sk_callback_sse41+0x36f>
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  68,15,89,192                        // mulps         %xmm0,%xmm8
@@ -27304,13 +27423,13 @@
   .byte  69,15,89,216                        // mulps         %xmm8,%xmm11
   .byte  68,15,40,203                        // movaps        %xmm3,%xmm9
   .byte  68,15,89,205                        // mulps         %xmm5,%xmm9
-  .byte  68,15,40,5,36,73,0,0                // movaps        0x4924(%rip),%xmm8        # 5e80 <_sk_callback_sse41+0x357>
+  .byte  68,15,40,5,76,73,0,0                // movaps        0x494c(%rip),%xmm8        # 5ed0 <_sk_callback_sse41+0x37f>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
-  .byte  68,15,40,21,40,73,0,0               // movaps        0x4928(%rip),%xmm10        # 5e90 <_sk_callback_sse41+0x367>
+  .byte  68,15,40,21,80,73,0,0               // movaps        0x4950(%rip),%xmm10        # 5ee0 <_sk_callback_sse41+0x38f>
   .byte  15,40,233                           // movaps        %xmm1,%xmm5
   .byte  65,15,89,234                        // mulps         %xmm10,%xmm5
   .byte  15,88,232                           // addps         %xmm0,%xmm5
-  .byte  68,15,40,37,38,73,0,0               // movaps        0x4926(%rip),%xmm12        # 5ea0 <_sk_callback_sse41+0x377>
+  .byte  68,15,40,37,78,73,0,0               // movaps        0x494e(%rip),%xmm12        # 5ef0 <_sk_callback_sse41+0x39f>
   .byte  68,15,40,242                        // movaps        %xmm2,%xmm14
   .byte  69,15,89,244                        // mulps         %xmm12,%xmm14
   .byte  68,15,88,245                        // addps         %xmm5,%xmm14
@@ -27395,7 +27514,7 @@
   .byte  65,15,88,244                        // addps         %xmm12,%xmm6
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
   .byte  102,68,15,56,20,206                 // blendvps      %xmm0,%xmm6,%xmm9
-  .byte  15,40,5,220,71,0,0                  // movaps        0x47dc(%rip),%xmm0        # 5eb0 <_sk_callback_sse41+0x387>
+  .byte  15,40,5,4,72,0,0                    // movaps        0x4804(%rip),%xmm0        # 5f00 <_sk_callback_sse41+0x3af>
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  15,92,215                           // subps         %xmm7,%xmm2
   .byte  15,89,226                           // mulps         %xmm2,%xmm4
@@ -27435,23 +27554,23 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,217,0,0,0                    // jne           1828 <_sk_srcover_rgba_8888_sse41+0xe7>
+  .byte  15,133,217,0,0,0                    // jne           1850 <_sk_srcover_rgba_8888_sse41+0xe7>
   .byte  243,15,111,60,144                   // movdqu        (%rax,%rdx,4),%xmm7
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  102,15,111,37,97,71,0,0             // movdqa        0x4761(%rip),%xmm4        # 5ec0 <_sk_callback_sse41+0x397>
+  .byte  102,15,111,37,137,71,0,0            // movdqa        0x4789(%rip),%xmm4        # 5f10 <_sk_callback_sse41+0x3bf>
   .byte  102,15,219,231                      // pand          %xmm7,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
   .byte  102,15,111,239                      // movdqa        %xmm7,%xmm5
-  .byte  102,15,56,0,45,93,71,0,0            // pshufb        0x475d(%rip),%xmm5        # 5ed0 <_sk_callback_sse41+0x3a7>
+  .byte  102,15,56,0,45,133,71,0,0           // pshufb        0x4785(%rip),%xmm5        # 5f20 <_sk_callback_sse41+0x3cf>
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
   .byte  102,15,111,247                      // movdqa        %xmm7,%xmm6
-  .byte  102,15,56,0,53,93,71,0,0            // pshufb        0x475d(%rip),%xmm6        # 5ee0 <_sk_callback_sse41+0x3b7>
+  .byte  102,15,56,0,53,133,71,0,0           // pshufb        0x4785(%rip),%xmm6        # 5f30 <_sk_callback_sse41+0x3df>
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
   .byte  102,15,114,215,24                   // psrld         $0x18,%xmm7
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
-  .byte  68,15,40,5,90,71,0,0                // movaps        0x475a(%rip),%xmm8        # 5ef0 <_sk_callback_sse41+0x3c7>
+  .byte  68,15,40,5,130,71,0,0               // movaps        0x4782(%rip),%xmm8        # 5f40 <_sk_callback_sse41+0x3ef>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
-  .byte  68,15,40,37,94,71,0,0               // movaps        0x475e(%rip),%xmm12        # 5f00 <_sk_callback_sse41+0x3d7>
+  .byte  68,15,40,37,134,71,0,0              // movaps        0x4786(%rip),%xmm12        # 5f50 <_sk_callback_sse41+0x3ff>
   .byte  65,15,89,196                        // mulps         %xmm12,%xmm0
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -27477,7 +27596,7 @@
   .byte  102,15,114,240,24                   // pslld         $0x18,%xmm0
   .byte  102,15,235,194                      // por           %xmm2,%xmm0
   .byte  102,15,235,193                      // por           %xmm1,%xmm0
-  .byte  117,85                              // jne           1864 <_sk_srcover_rgba_8888_sse41+0x123>
+  .byte  117,85                              // jne           188c <_sk_srcover_rgba_8888_sse41+0x123>
   .byte  243,15,127,4,144                    // movdqu        %xmm0,(%rax,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
@@ -27488,32 +27607,32 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,87                              // je            188c <_sk_srcover_rgba_8888_sse41+0x14b>
+  .byte  116,87                              // je            18b4 <_sk_srcover_rgba_8888_sse41+0x14b>
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            1854 <_sk_srcover_rgba_8888_sse41+0x113>
+  .byte  116,21                              // je            187c <_sk_srcover_rgba_8888_sse41+0x113>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  15,133,11,255,255,255               // jne           1754 <_sk_srcover_rgba_8888_sse41+0x13>
+  .byte  15,133,11,255,255,255               // jne           177c <_sk_srcover_rgba_8888_sse41+0x13>
   .byte  102,15,110,100,144,8                // movd          0x8(%rax,%rdx,4),%xmm4
   .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
   .byte  243,15,126,36,144                   // movq          (%rax,%rdx,4),%xmm4
   .byte  102,15,58,14,252,15                 // pblendw       $0xf,%xmm4,%xmm7
-  .byte  233,240,254,255,255                 // jmpq          1754 <_sk_srcover_rgba_8888_sse41+0x13>
+  .byte  233,240,254,255,255                 // jmpq          177c <_sk_srcover_rgba_8888_sse41+0x13>
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,37                              // je            1896 <_sk_srcover_rgba_8888_sse41+0x155>
+  .byte  116,37                              // je            18be <_sk_srcover_rgba_8888_sse41+0x155>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,14                              // je            1885 <_sk_srcover_rgba_8888_sse41+0x144>
+  .byte  116,14                              // je            18ad <_sk_srcover_rgba_8888_sse41+0x144>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,151                             // jne           1814 <_sk_srcover_rgba_8888_sse41+0xd3>
+  .byte  117,151                             // jne           183c <_sk_srcover_rgba_8888_sse41+0xd3>
   .byte  102,15,58,22,68,144,8,2             // pextrd        $0x2,%xmm0,0x8(%rax,%rdx,4)
   .byte  102,15,214,4,144                    // movq          %xmm0,(%rax,%rdx,4)
-  .byte  235,136                             // jmp           1814 <_sk_srcover_rgba_8888_sse41+0xd3>
+  .byte  235,136                             // jmp           183c <_sk_srcover_rgba_8888_sse41+0xd3>
   .byte  102,15,110,60,144                   // movd          (%rax,%rdx,4),%xmm7
-  .byte  233,190,254,255,255                 // jmpq          1754 <_sk_srcover_rgba_8888_sse41+0x13>
+  .byte  233,190,254,255,255                 // jmpq          177c <_sk_srcover_rgba_8888_sse41+0x13>
   .byte  102,15,126,4,144                    // movd          %xmm0,(%rax,%rdx,4)
-  .byte  233,116,255,255,255                 // jmpq          1814 <_sk_srcover_rgba_8888_sse41+0xd3>
+  .byte  233,116,255,255,255                 // jmpq          183c <_sk_srcover_rgba_8888_sse41+0xd3>
 
 HIDDEN _sk_clamp_0_sse41
 .globl _sk_clamp_0_sse41
@@ -27531,7 +27650,7 @@
 .globl _sk_clamp_1_sse41
 FUNCTION(_sk_clamp_1_sse41)
 _sk_clamp_1_sse41:
-  .byte  68,15,40,5,80,70,0,0                // movaps        0x4650(%rip),%xmm8        # 5f10 <_sk_callback_sse41+0x3e7>
+  .byte  68,15,40,5,120,70,0,0               // movaps        0x4678(%rip),%xmm8        # 5f60 <_sk_callback_sse41+0x40f>
   .byte  65,15,93,192                        // minps         %xmm8,%xmm0
   .byte  65,15,93,200                        // minps         %xmm8,%xmm1
   .byte  65,15,93,208                        // minps         %xmm8,%xmm2
@@ -27543,7 +27662,7 @@
 .globl _sk_clamp_a_sse41
 FUNCTION(_sk_clamp_a_sse41)
 _sk_clamp_a_sse41:
-  .byte  15,93,29,69,70,0,0                  // minps         0x4645(%rip),%xmm3        # 5f20 <_sk_callback_sse41+0x3f7>
+  .byte  15,93,29,109,70,0,0                 // minps         0x466d(%rip),%xmm3        # 5f70 <_sk_callback_sse41+0x41f>
   .byte  15,93,195                           // minps         %xmm3,%xmm0
   .byte  15,93,203                           // minps         %xmm3,%xmm1
   .byte  15,93,211                           // minps         %xmm3,%xmm2
@@ -27554,7 +27673,7 @@
 .globl _sk_clamp_a_dst_sse41
 FUNCTION(_sk_clamp_a_dst_sse41)
 _sk_clamp_a_dst_sse41:
-  .byte  15,93,61,65,70,0,0                  // minps         0x4641(%rip),%xmm7        # 5f30 <_sk_callback_sse41+0x407>
+  .byte  15,93,61,105,70,0,0                 // minps         0x4669(%rip),%xmm7        # 5f80 <_sk_callback_sse41+0x42f>
   .byte  15,93,231                           // minps         %xmm7,%xmm4
   .byte  15,93,239                           // minps         %xmm7,%xmm5
   .byte  15,93,247                           // minps         %xmm7,%xmm6
@@ -27622,7 +27741,7 @@
 FUNCTION(_sk_unpremul_sse41)
 _sk_unpremul_sse41:
   .byte  69,15,87,192                        // xorps         %xmm8,%xmm8
-  .byte  68,15,40,13,220,69,0,0              // movaps        0x45dc(%rip),%xmm9        # 5f40 <_sk_callback_sse41+0x417>
+  .byte  68,15,40,13,4,70,0,0                // movaps        0x4604(%rip),%xmm9        # 5f90 <_sk_callback_sse41+0x43f>
   .byte  68,15,94,203                        // divps         %xmm3,%xmm9
   .byte  68,15,194,195,4                     // cmpneqps      %xmm3,%xmm8
   .byte  69,15,84,193                        // andps         %xmm9,%xmm8
@@ -27636,20 +27755,20 @@
 .globl _sk_from_srgb_sse41
 FUNCTION(_sk_from_srgb_sse41)
 _sk_from_srgb_sse41:
-  .byte  68,15,40,29,199,69,0,0              // movaps        0x45c7(%rip),%xmm11        # 5f50 <_sk_callback_sse41+0x427>
+  .byte  68,15,40,29,239,69,0,0              // movaps        0x45ef(%rip),%xmm11        # 5fa0 <_sk_callback_sse41+0x44f>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
   .byte  68,15,40,208                        // movaps        %xmm0,%xmm10
   .byte  69,15,89,210                        // mulps         %xmm10,%xmm10
-  .byte  68,15,40,37,191,69,0,0              // movaps        0x45bf(%rip),%xmm12        # 5f60 <_sk_callback_sse41+0x437>
+  .byte  68,15,40,37,231,69,0,0              // movaps        0x45e7(%rip),%xmm12        # 5fb0 <_sk_callback_sse41+0x45f>
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
   .byte  69,15,89,196                        // mulps         %xmm12,%xmm8
-  .byte  68,15,40,45,191,69,0,0              // movaps        0x45bf(%rip),%xmm13        # 5f70 <_sk_callback_sse41+0x447>
+  .byte  68,15,40,45,231,69,0,0              // movaps        0x45e7(%rip),%xmm13        # 5fc0 <_sk_callback_sse41+0x46f>
   .byte  69,15,88,197                        // addps         %xmm13,%xmm8
   .byte  69,15,89,194                        // mulps         %xmm10,%xmm8
-  .byte  68,15,40,53,191,69,0,0              // movaps        0x45bf(%rip),%xmm14        # 5f80 <_sk_callback_sse41+0x457>
+  .byte  68,15,40,53,231,69,0,0              // movaps        0x45e7(%rip),%xmm14        # 5fd0 <_sk_callback_sse41+0x47f>
   .byte  69,15,88,198                        // addps         %xmm14,%xmm8
-  .byte  68,15,40,61,195,69,0,0              // movaps        0x45c3(%rip),%xmm15        # 5f90 <_sk_callback_sse41+0x467>
+  .byte  68,15,40,61,235,69,0,0              // movaps        0x45eb(%rip),%xmm15        # 5fe0 <_sk_callback_sse41+0x48f>
   .byte  65,15,194,199,1                     // cmpltps       %xmm15,%xmm0
   .byte  102,69,15,56,20,193                 // blendvps      %xmm0,%xmm9,%xmm8
   .byte  68,15,40,209                        // movaps        %xmm1,%xmm10
@@ -27686,19 +27805,19 @@
 _sk_from_srgb_dst_sse41:
   .byte  68,15,40,204                        // movaps        %xmm4,%xmm9
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,40,29,78,69,0,0               // movaps        0x454e(%rip),%xmm11        # 5fa0 <_sk_callback_sse41+0x477>
+  .byte  68,15,40,29,118,69,0,0              // movaps        0x4576(%rip),%xmm11        # 5ff0 <_sk_callback_sse41+0x49f>
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
   .byte  69,15,89,211                        // mulps         %xmm11,%xmm10
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
-  .byte  68,15,40,37,71,69,0,0               // movaps        0x4547(%rip),%xmm12        # 5fb0 <_sk_callback_sse41+0x487>
+  .byte  68,15,40,37,111,69,0,0              // movaps        0x456f(%rip),%xmm12        # 6000 <_sk_callback_sse41+0x4af>
   .byte  65,15,89,228                        // mulps         %xmm12,%xmm4
-  .byte  68,15,40,45,75,69,0,0               // movaps        0x454b(%rip),%xmm13        # 5fc0 <_sk_callback_sse41+0x497>
+  .byte  68,15,40,45,115,69,0,0              // movaps        0x4573(%rip),%xmm13        # 6010 <_sk_callback_sse41+0x4bf>
   .byte  65,15,88,229                        // addps         %xmm13,%xmm4
   .byte  15,89,224                           // mulps         %xmm0,%xmm4
-  .byte  68,15,40,53,76,69,0,0               // movaps        0x454c(%rip),%xmm14        # 5fd0 <_sk_callback_sse41+0x4a7>
+  .byte  68,15,40,53,116,69,0,0              // movaps        0x4574(%rip),%xmm14        # 6020 <_sk_callback_sse41+0x4cf>
   .byte  65,15,88,230                        // addps         %xmm14,%xmm4
-  .byte  68,15,40,61,80,69,0,0               // movaps        0x4550(%rip),%xmm15        # 5fe0 <_sk_callback_sse41+0x4b7>
+  .byte  68,15,40,61,120,69,0,0              // movaps        0x4578(%rip),%xmm15        # 6030 <_sk_callback_sse41+0x4df>
   .byte  69,15,194,207,1                     // cmpltps       %xmm15,%xmm9
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  102,65,15,56,20,226                 // blendvps      %xmm0,%xmm10,%xmm4
@@ -27742,22 +27861,22 @@
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
   .byte  68,15,82,192                        // rsqrtps       %xmm0,%xmm8
-  .byte  68,15,40,29,196,68,0,0              // movaps        0x44c4(%rip),%xmm11        # 5ff0 <_sk_callback_sse41+0x4c7>
+  .byte  68,15,40,29,236,68,0,0              // movaps        0x44ec(%rip),%xmm11        # 6040 <_sk_callback_sse41+0x4ef>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
-  .byte  68,15,40,37,196,68,0,0              // movaps        0x44c4(%rip),%xmm12        # 6000 <_sk_callback_sse41+0x4d7>
+  .byte  68,15,40,37,236,68,0,0              // movaps        0x44ec(%rip),%xmm12        # 6050 <_sk_callback_sse41+0x4ff>
   .byte  69,15,40,248                        // movaps        %xmm8,%xmm15
   .byte  69,15,89,252                        // mulps         %xmm12,%xmm15
-  .byte  68,15,40,21,196,68,0,0              // movaps        0x44c4(%rip),%xmm10        # 6010 <_sk_callback_sse41+0x4e7>
+  .byte  68,15,40,21,236,68,0,0              // movaps        0x44ec(%rip),%xmm10        # 6060 <_sk_callback_sse41+0x50f>
   .byte  69,15,88,250                        // addps         %xmm10,%xmm15
   .byte  69,15,89,248                        // mulps         %xmm8,%xmm15
-  .byte  68,15,40,45,196,68,0,0              // movaps        0x44c4(%rip),%xmm13        # 6020 <_sk_callback_sse41+0x4f7>
+  .byte  68,15,40,45,236,68,0,0              // movaps        0x44ec(%rip),%xmm13        # 6070 <_sk_callback_sse41+0x51f>
   .byte  69,15,88,253                        // addps         %xmm13,%xmm15
-  .byte  68,15,40,53,200,68,0,0              // movaps        0x44c8(%rip),%xmm14        # 6030 <_sk_callback_sse41+0x507>
+  .byte  68,15,40,53,240,68,0,0              // movaps        0x44f0(%rip),%xmm14        # 6080 <_sk_callback_sse41+0x52f>
   .byte  69,15,88,198                        // addps         %xmm14,%xmm8
   .byte  69,15,83,192                        // rcpps         %xmm8,%xmm8
   .byte  69,15,89,199                        // mulps         %xmm15,%xmm8
-  .byte  68,15,40,61,196,68,0,0              // movaps        0x44c4(%rip),%xmm15        # 6040 <_sk_callback_sse41+0x517>
+  .byte  68,15,40,61,236,68,0,0              // movaps        0x44ec(%rip),%xmm15        # 6090 <_sk_callback_sse41+0x53f>
   .byte  65,15,194,199,1                     // cmpltps       %xmm15,%xmm0
   .byte  102,69,15,56,20,193                 // blendvps      %xmm0,%xmm9,%xmm8
   .byte  68,15,82,202                        // rsqrtps       %xmm2,%xmm9
@@ -27810,7 +27929,7 @@
   .byte  68,15,93,226                        // minps         %xmm2,%xmm12
   .byte  65,15,40,203                        // movaps        %xmm11,%xmm1
   .byte  65,15,92,204                        // subps         %xmm12,%xmm1
-  .byte  68,15,40,53,17,68,0,0               // movaps        0x4411(%rip),%xmm14        # 6050 <_sk_callback_sse41+0x527>
+  .byte  68,15,40,53,57,68,0,0               // movaps        0x4439(%rip),%xmm14        # 60a0 <_sk_callback_sse41+0x54f>
   .byte  68,15,94,241                        // divps         %xmm1,%xmm14
   .byte  69,15,40,211                        // movaps        %xmm11,%xmm10
   .byte  69,15,194,208,0                     // cmpeqps       %xmm8,%xmm10
@@ -27819,27 +27938,27 @@
   .byte  65,15,89,198                        // mulps         %xmm14,%xmm0
   .byte  69,15,40,249                        // movaps        %xmm9,%xmm15
   .byte  68,15,194,250,1                     // cmpltps       %xmm2,%xmm15
-  .byte  68,15,84,61,248,67,0,0              // andps         0x43f8(%rip),%xmm15        # 6060 <_sk_callback_sse41+0x537>
+  .byte  68,15,84,61,32,68,0,0               // andps         0x4420(%rip),%xmm15        # 60b0 <_sk_callback_sse41+0x55f>
   .byte  68,15,88,248                        // addps         %xmm0,%xmm15
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
   .byte  65,15,194,193,0                     // cmpeqps       %xmm9,%xmm0
   .byte  65,15,92,208                        // subps         %xmm8,%xmm2
   .byte  65,15,89,214                        // mulps         %xmm14,%xmm2
-  .byte  68,15,40,45,235,67,0,0              // movaps        0x43eb(%rip),%xmm13        # 6070 <_sk_callback_sse41+0x547>
+  .byte  68,15,40,45,19,68,0,0               // movaps        0x4413(%rip),%xmm13        # 60c0 <_sk_callback_sse41+0x56f>
   .byte  65,15,88,213                        // addps         %xmm13,%xmm2
   .byte  69,15,92,193                        // subps         %xmm9,%xmm8
   .byte  69,15,89,198                        // mulps         %xmm14,%xmm8
-  .byte  68,15,88,5,231,67,0,0               // addps         0x43e7(%rip),%xmm8        # 6080 <_sk_callback_sse41+0x557>
+  .byte  68,15,88,5,15,68,0,0                // addps         0x440f(%rip),%xmm8        # 60d0 <_sk_callback_sse41+0x57f>
   .byte  102,68,15,56,20,194                 // blendvps      %xmm0,%xmm2,%xmm8
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  102,69,15,56,20,199                 // blendvps      %xmm0,%xmm15,%xmm8
-  .byte  68,15,89,5,223,67,0,0               // mulps         0x43df(%rip),%xmm8        # 6090 <_sk_callback_sse41+0x567>
+  .byte  68,15,89,5,7,68,0,0                 // mulps         0x4407(%rip),%xmm8        # 60e0 <_sk_callback_sse41+0x58f>
   .byte  69,15,40,203                        // movaps        %xmm11,%xmm9
   .byte  69,15,194,204,4                     // cmpneqps      %xmm12,%xmm9
   .byte  69,15,84,193                        // andps         %xmm9,%xmm8
   .byte  69,15,92,235                        // subps         %xmm11,%xmm13
   .byte  69,15,88,220                        // addps         %xmm12,%xmm11
-  .byte  15,40,5,211,67,0,0                  // movaps        0x43d3(%rip),%xmm0        # 60a0 <_sk_callback_sse41+0x577>
+  .byte  15,40,5,251,67,0,0                  // movaps        0x43fb(%rip),%xmm0        # 60f0 <_sk_callback_sse41+0x59f>
   .byte  65,15,40,211                        // movaps        %xmm11,%xmm2
   .byte  15,89,208                           // mulps         %xmm0,%xmm2
   .byte  15,194,194,1                        // cmpltps       %xmm2,%xmm0
@@ -27861,7 +27980,7 @@
   .byte  15,41,100,36,184                    // movaps        %xmm4,-0x48(%rsp)
   .byte  15,41,92,36,168                     // movaps        %xmm3,-0x58(%rsp)
   .byte  68,15,40,208                        // movaps        %xmm0,%xmm10
-  .byte  68,15,40,13,153,67,0,0              // movaps        0x4399(%rip),%xmm9        # 60b0 <_sk_callback_sse41+0x587>
+  .byte  68,15,40,13,193,67,0,0              // movaps        0x43c1(%rip),%xmm9        # 6100 <_sk_callback_sse41+0x5af>
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  15,194,194,2                        // cmpleps       %xmm2,%xmm0
   .byte  15,40,217                           // movaps        %xmm1,%xmm3
@@ -27874,19 +27993,19 @@
   .byte  15,41,84,36,152                     // movaps        %xmm2,-0x68(%rsp)
   .byte  69,15,88,192                        // addps         %xmm8,%xmm8
   .byte  68,15,92,197                        // subps         %xmm5,%xmm8
-  .byte  68,15,40,53,116,67,0,0              // movaps        0x4374(%rip),%xmm14        # 60c0 <_sk_callback_sse41+0x597>
+  .byte  68,15,40,53,156,67,0,0              // movaps        0x439c(%rip),%xmm14        # 6110 <_sk_callback_sse41+0x5bf>
   .byte  69,15,88,242                        // addps         %xmm10,%xmm14
   .byte  102,65,15,58,8,198,1                // roundps       $0x1,%xmm14,%xmm0
   .byte  68,15,92,240                        // subps         %xmm0,%xmm14
-  .byte  68,15,40,29,109,67,0,0              // movaps        0x436d(%rip),%xmm11        # 60d0 <_sk_callback_sse41+0x5a7>
+  .byte  68,15,40,29,149,67,0,0              // movaps        0x4395(%rip),%xmm11        # 6120 <_sk_callback_sse41+0x5cf>
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
   .byte  65,15,194,198,2                     // cmpleps       %xmm14,%xmm0
   .byte  15,40,245                           // movaps        %xmm5,%xmm6
   .byte  65,15,92,240                        // subps         %xmm8,%xmm6
-  .byte  15,40,61,102,67,0,0                 // movaps        0x4366(%rip),%xmm7        # 60e0 <_sk_callback_sse41+0x5b7>
+  .byte  15,40,61,142,67,0,0                 // movaps        0x438e(%rip),%xmm7        # 6130 <_sk_callback_sse41+0x5df>
   .byte  69,15,40,238                        // movaps        %xmm14,%xmm13
   .byte  68,15,89,239                        // mulps         %xmm7,%xmm13
-  .byte  15,40,29,103,67,0,0                 // movaps        0x4367(%rip),%xmm3        # 60f0 <_sk_callback_sse41+0x5c7>
+  .byte  15,40,29,143,67,0,0                 // movaps        0x438f(%rip),%xmm3        # 6140 <_sk_callback_sse41+0x5ef>
   .byte  68,15,40,227                        // movaps        %xmm3,%xmm12
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  68,15,89,230                        // mulps         %xmm6,%xmm12
@@ -27896,7 +28015,7 @@
   .byte  65,15,194,198,2                     // cmpleps       %xmm14,%xmm0
   .byte  68,15,40,253                        // movaps        %xmm5,%xmm15
   .byte  102,69,15,56,20,252                 // blendvps      %xmm0,%xmm12,%xmm15
-  .byte  68,15,40,37,70,67,0,0               // movaps        0x4346(%rip),%xmm12        # 6100 <_sk_callback_sse41+0x5d7>
+  .byte  68,15,40,37,110,67,0,0              // movaps        0x436e(%rip),%xmm12        # 6150 <_sk_callback_sse41+0x5ff>
   .byte  65,15,40,196                        // movaps        %xmm12,%xmm0
   .byte  65,15,194,198,2                     // cmpleps       %xmm14,%xmm0
   .byte  68,15,89,238                        // mulps         %xmm6,%xmm13
@@ -27930,7 +28049,7 @@
   .byte  65,15,40,198                        // movaps        %xmm14,%xmm0
   .byte  15,40,84,36,152                     // movaps        -0x68(%rsp),%xmm2
   .byte  102,15,56,20,202                    // blendvps      %xmm0,%xmm2,%xmm1
-  .byte  68,15,88,21,190,66,0,0              // addps         0x42be(%rip),%xmm10        # 6110 <_sk_callback_sse41+0x5e7>
+  .byte  68,15,88,21,230,66,0,0              // addps         0x42e6(%rip),%xmm10        # 6160 <_sk_callback_sse41+0x60f>
   .byte  102,65,15,58,8,194,1                // roundps       $0x1,%xmm10,%xmm0
   .byte  68,15,92,208                        // subps         %xmm0,%xmm10
   .byte  69,15,194,218,2                     // cmpleps       %xmm10,%xmm11
@@ -27981,11 +28100,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,52                              // jne           1f2b <_sk_scale_u8_sse41+0x3e>
+  .byte  117,52                              // jne           1f53 <_sk_scale_u8_sse41+0x3e>
   .byte  102,69,15,56,49,4,18                // pmovzxbd      (%r10,%rdx,1),%xmm8
-  .byte  102,68,15,219,5,25,66,0,0           // pand          0x4219(%rip),%xmm8        # 6120 <_sk_callback_sse41+0x5f7>
+  .byte  102,68,15,219,5,65,66,0,0           // pand          0x4241(%rip),%xmm8        # 6170 <_sk_callback_sse41+0x61f>
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,29,66,0,0                // mulps         0x421d(%rip),%xmm8        # 6130 <_sk_callback_sse41+0x607>
+  .byte  68,15,89,5,69,66,0,0                // mulps         0x4245(%rip),%xmm8        # 6180 <_sk_callback_sse41+0x62f>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
@@ -27996,12 +28115,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,59                              // je            1f73 <_sk_scale_u8_sse41+0x86>
+  .byte  116,59                              // je            1f9b <_sk_scale_u8_sse41+0x86>
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,23                              // je            1f5a <_sk_scale_u8_sse41+0x6d>
+  .byte  116,23                              // je            1f82 <_sk_scale_u8_sse41+0x6d>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,181                             // jne           1efe <_sk_scale_u8_sse41+0x11>
+  .byte  117,181                             // jne           1f26 <_sk_scale_u8_sse41+0x11>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  102,69,15,112,192,69                // pshufd        $0x45,%xmm8,%xmm8
@@ -28009,10 +28128,10 @@
   .byte  102,68,15,110,200                   // movd          %eax,%xmm9
   .byte  102,69,15,56,49,201                 // pmovzxbd      %xmm9,%xmm9
   .byte  102,69,15,58,14,193,15              // pblendw       $0xf,%xmm9,%xmm8
-  .byte  235,139                             // jmp           1efe <_sk_scale_u8_sse41+0x11>
+  .byte  235,139                             // jmp           1f26 <_sk_scale_u8_sse41+0x11>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
-  .byte  233,124,255,255,255                 // jmpq          1efe <_sk_scale_u8_sse41+0x11>
+  .byte  233,124,255,255,255                 // jmpq          1f26 <_sk_scale_u8_sse41+0x11>
 
 HIDDEN _sk_lerp_1_float_sse41
 .globl _sk_lerp_1_float_sse41
@@ -28043,11 +28162,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,72                              // jne           200c <_sk_lerp_u8_sse41+0x52>
+  .byte  117,72                              // jne           2034 <_sk_lerp_u8_sse41+0x52>
   .byte  102,69,15,56,49,4,18                // pmovzxbd      (%r10,%rdx,1),%xmm8
-  .byte  102,68,15,219,5,108,65,0,0          // pand          0x416c(%rip),%xmm8        # 6140 <_sk_callback_sse41+0x617>
+  .byte  102,68,15,219,5,148,65,0,0          // pand          0x4194(%rip),%xmm8        # 6190 <_sk_callback_sse41+0x63f>
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,112,65,0,0               // mulps         0x4170(%rip),%xmm8        # 6150 <_sk_callback_sse41+0x627>
+  .byte  68,15,89,5,152,65,0,0               // mulps         0x4198(%rip),%xmm8        # 61a0 <_sk_callback_sse41+0x64f>
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -28065,12 +28184,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,62                              // je            2057 <_sk_lerp_u8_sse41+0x9d>
+  .byte  116,62                              // je            207f <_sk_lerp_u8_sse41+0x9d>
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,23                              // je            203b <_sk_lerp_u8_sse41+0x81>
+  .byte  116,23                              // je            2063 <_sk_lerp_u8_sse41+0x81>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,161                             // jne           1fcb <_sk_lerp_u8_sse41+0x11>
+  .byte  117,161                             // jne           1ff3 <_sk_lerp_u8_sse41+0x11>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  102,69,15,112,192,69                // pshufd        $0x45,%xmm8,%xmm8
@@ -28078,10 +28197,10 @@
   .byte  102,68,15,110,200                   // movd          %eax,%xmm9
   .byte  102,69,15,56,49,201                 // pmovzxbd      %xmm9,%xmm9
   .byte  102,69,15,58,14,193,15              // pblendw       $0xf,%xmm9,%xmm8
-  .byte  233,116,255,255,255                 // jmpq          1fcb <_sk_lerp_u8_sse41+0x11>
+  .byte  233,116,255,255,255                 // jmpq          1ff3 <_sk_lerp_u8_sse41+0x11>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
-  .byte  233,101,255,255,255                 // jmpq          1fcb <_sk_lerp_u8_sse41+0x11>
+  .byte  233,101,255,255,255                 // jmpq          1ff3 <_sk_lerp_u8_sse41+0x11>
 
 HIDDEN _sk_lerp_565_sse41
 .globl _sk_lerp_565_sse41
@@ -28090,19 +28209,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,152,0,0,0                    // jne           210c <_sk_lerp_565_sse41+0xa6>
+  .byte  15,133,152,0,0,0                    // jne           2134 <_sk_lerp_565_sse41+0xa6>
   .byte  102,69,15,56,51,20,82               // pmovzxwd      (%r10,%rdx,2),%xmm10
-  .byte  102,68,15,111,5,220,64,0,0          // movdqa        0x40dc(%rip),%xmm8        # 6160 <_sk_callback_sse41+0x637>
+  .byte  102,68,15,111,5,4,65,0,0            // movdqa        0x4104(%rip),%xmm8        # 61b0 <_sk_callback_sse41+0x65f>
   .byte  102,69,15,219,194                   // pand          %xmm10,%xmm8
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,219,64,0,0               // mulps         0x40db(%rip),%xmm8        # 6170 <_sk_callback_sse41+0x647>
-  .byte  102,68,15,111,13,226,64,0,0         // movdqa        0x40e2(%rip),%xmm9        # 6180 <_sk_callback_sse41+0x657>
+  .byte  68,15,89,5,3,65,0,0                 // mulps         0x4103(%rip),%xmm8        # 61c0 <_sk_callback_sse41+0x66f>
+  .byte  102,68,15,111,13,10,65,0,0          // movdqa        0x410a(%rip),%xmm9        # 61d0 <_sk_callback_sse41+0x67f>
   .byte  102,69,15,219,202                   // pand          %xmm10,%xmm9
   .byte  69,15,91,201                        // cvtdq2ps      %xmm9,%xmm9
-  .byte  68,15,89,13,225,64,0,0              // mulps         0x40e1(%rip),%xmm9        # 6190 <_sk_callback_sse41+0x667>
-  .byte  102,68,15,219,21,232,64,0,0         // pand          0x40e8(%rip),%xmm10        # 61a0 <_sk_callback_sse41+0x677>
+  .byte  68,15,89,13,9,65,0,0                // mulps         0x4109(%rip),%xmm9        # 61e0 <_sk_callback_sse41+0x68f>
+  .byte  102,68,15,219,21,16,65,0,0          // pand          0x4110(%rip),%xmm10        # 61f0 <_sk_callback_sse41+0x69f>
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
-  .byte  68,15,89,21,236,64,0,0              // mulps         0x40ec(%rip),%xmm10        # 61b0 <_sk_callback_sse41+0x687>
+  .byte  68,15,89,21,20,65,0,0               // mulps         0x4114(%rip),%xmm10        # 6200 <_sk_callback_sse41+0x6af>
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -28127,22 +28246,22 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,62                              // je            2157 <_sk_lerp_565_sse41+0xf1>
+  .byte  116,62                              // je            217f <_sk_lerp_565_sse41+0xf1>
   .byte  102,69,15,239,210                   // pxor          %xmm10,%xmm10
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,27                              // je            213f <_sk_lerp_565_sse41+0xd9>
+  .byte  116,27                              // je            2167 <_sk_lerp_565_sse41+0xd9>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  15,133,77,255,255,255               // jne           207b <_sk_lerp_565_sse41+0x15>
+  .byte  15,133,77,255,255,255               // jne           20a3 <_sk_lerp_565_sse41+0x15>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  102,69,15,112,208,69                // pshufd        $0x45,%xmm8,%xmm10
   .byte  102,69,15,110,4,82                  // movd          (%r10,%rdx,2),%xmm8
   .byte  102,69,15,56,51,192                 // pmovzxwd      %xmm8,%xmm8
   .byte  102,69,15,58,14,208,15              // pblendw       $0xf,%xmm8,%xmm10
-  .byte  233,36,255,255,255                  // jmpq          207b <_sk_lerp_565_sse41+0x15>
+  .byte  233,36,255,255,255                  // jmpq          20a3 <_sk_lerp_565_sse41+0x15>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,68,15,110,208                   // movd          %eax,%xmm10
-  .byte  233,21,255,255,255                  // jmpq          207b <_sk_lerp_565_sse41+0x15>
+  .byte  233,21,255,255,255                  // jmpq          20a3 <_sk_lerp_565_sse41+0x15>
 
 HIDDEN _sk_load_tables_sse41
 .globl _sk_load_tables_sse41
@@ -28151,12 +28270,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,24,1,0,0                     // jne           228c <_sk_load_tables_sse41+0x126>
+  .byte  15,133,24,1,0,0                     // jne           22b4 <_sk_load_tables_sse41+0x126>
   .byte  243,69,15,111,4,145                 // movdqu        (%r9,%rdx,4),%xmm8
   .byte  65,87                               // push          %r15
   .byte  65,86                               // push          %r14
   .byte  83                                  // push          %rbx
-  .byte  102,15,111,5,57,64,0,0              // movdqa        0x4039(%rip),%xmm0        # 61c0 <_sk_callback_sse41+0x697>
+  .byte  102,15,111,5,97,64,0,0              // movdqa        0x4061(%rip),%xmm0        # 6210 <_sk_callback_sse41+0x6bf>
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,73,15,58,22,193,1               // pextrq        $0x1,%xmm0,%r9
   .byte  102,73,15,126,194                   // movq          %xmm0,%r10
@@ -28171,7 +28290,7 @@
   .byte  102,66,15,58,33,4,179,32            // insertps      $0x20,(%rbx,%r14,4),%xmm0
   .byte  102,66,15,58,33,4,11,48             // insertps      $0x30,(%rbx,%r9,1),%xmm0
   .byte  102,65,15,111,200                   // movdqa        %xmm8,%xmm1
-  .byte  102,15,56,0,13,244,63,0,0           // pshufb        0x3ff4(%rip),%xmm1        # 61d0 <_sk_callback_sse41+0x6a7>
+  .byte  102,15,56,0,13,28,64,0,0            // pshufb        0x401c(%rip),%xmm1        # 6220 <_sk_callback_sse41+0x6cf>
   .byte  102,73,15,58,22,201,1               // pextrq        $0x1,%xmm1,%r9
   .byte  102,72,15,126,203                   // movq          %xmm1,%rbx
   .byte  68,15,182,211                       // movzbl        %bl,%r10d
@@ -28186,7 +28305,7 @@
   .byte  102,15,58,33,202,48                 // insertps      $0x30,%xmm2,%xmm1
   .byte  76,139,72,24                        // mov           0x18(%rax),%r9
   .byte  102,65,15,111,208                   // movdqa        %xmm8,%xmm2
-  .byte  102,15,56,0,21,176,63,0,0           // pshufb        0x3fb0(%rip),%xmm2        # 61e0 <_sk_callback_sse41+0x6b7>
+  .byte  102,15,56,0,21,216,63,0,0           // pshufb        0x3fd8(%rip),%xmm2        # 6230 <_sk_callback_sse41+0x6df>
   .byte  102,72,15,58,22,211,1               // pextrq        $0x1,%xmm2,%rbx
   .byte  102,72,15,126,208                   // movq          %xmm2,%rax
   .byte  68,15,182,208                       // movzbl        %al,%r10d
@@ -28201,7 +28320,7 @@
   .byte  102,15,58,33,211,48                 // insertps      $0x30,%xmm3,%xmm2
   .byte  102,65,15,114,208,24                // psrld         $0x18,%xmm8
   .byte  65,15,91,216                        // cvtdq2ps      %xmm8,%xmm3
-  .byte  15,89,29,109,63,0,0                 // mulps         0x3f6d(%rip),%xmm3        # 61f0 <_sk_callback_sse41+0x6c7>
+  .byte  15,89,29,149,63,0,0                 // mulps         0x3f95(%rip),%xmm3        # 6240 <_sk_callback_sse41+0x6ef>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
   .byte  65,94                               // pop           %r14
@@ -28210,19 +28329,19 @@
   .byte  69,137,194                          // mov           %r8d,%r10d
   .byte  65,128,226,3                        // and           $0x3,%r10b
   .byte  65,128,250,1                        // cmp           $0x1,%r10b
-  .byte  116,52                              // je            22cd <_sk_load_tables_sse41+0x167>
+  .byte  116,52                              // je            22f5 <_sk_load_tables_sse41+0x167>
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,128,250,2                        // cmp           $0x2,%r10b
-  .byte  116,23                              // je            22bb <_sk_load_tables_sse41+0x155>
+  .byte  116,23                              // je            22e3 <_sk_load_tables_sse41+0x155>
   .byte  65,128,250,3                        // cmp           $0x3,%r10b
-  .byte  15,133,204,254,255,255              // jne           217a <_sk_load_tables_sse41+0x14>
+  .byte  15,133,204,254,255,255              // jne           21a2 <_sk_load_tables_sse41+0x14>
   .byte  102,65,15,110,68,145,8              // movd          0x8(%r9,%rdx,4),%xmm0
   .byte  102,68,15,112,192,69                // pshufd        $0x45,%xmm0,%xmm8
   .byte  243,65,15,126,4,145                 // movq          (%r9,%rdx,4),%xmm0
   .byte  102,68,15,58,14,192,15              // pblendw       $0xf,%xmm0,%xmm8
-  .byte  233,173,254,255,255                 // jmpq          217a <_sk_load_tables_sse41+0x14>
+  .byte  233,173,254,255,255                 // jmpq          21a2 <_sk_load_tables_sse41+0x14>
   .byte  102,69,15,110,4,145                 // movd          (%r9,%rdx,4),%xmm8
-  .byte  233,162,254,255,255                 // jmpq          217a <_sk_load_tables_sse41+0x14>
+  .byte  233,162,254,255,255                 // jmpq          21a2 <_sk_load_tables_sse41+0x14>
 
 HIDDEN _sk_load_tables_u16_be_sse41
 .globl _sk_load_tables_u16_be_sse41
@@ -28232,7 +28351,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,99,1,0,0                     // jne           2451 <_sk_load_tables_u16_be_sse41+0x179>
+  .byte  15,133,99,1,0,0                     // jne           2479 <_sk_load_tables_u16_be_sse41+0x179>
   .byte  102,67,15,16,4,81                   // movupd        (%r9,%r10,2),%xmm0
   .byte  243,67,15,111,76,81,16              // movdqu        0x10(%r9,%r10,2),%xmm1
   .byte  65,87                               // push          %r15
@@ -28244,7 +28363,7 @@
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,97,200                       // punpcklwd     %xmm0,%xmm1
   .byte  102,68,15,105,200                   // punpckhwd     %xmm0,%xmm9
-  .byte  102,68,15,111,5,219,62,0,0          // movdqa        0x3edb(%rip),%xmm8        # 6200 <_sk_callback_sse41+0x6d7>
+  .byte  102,68,15,111,5,3,63,0,0            // movdqa        0x3f03(%rip),%xmm8        # 6250 <_sk_callback_sse41+0x6ff>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,15,56,51,192                    // pmovzxwd      %xmm0,%xmm0
@@ -28262,7 +28381,7 @@
   .byte  102,15,58,33,194,32                 // insertps      $0x20,%xmm2,%xmm0
   .byte  243,66,15,16,20,11                  // movss         (%rbx,%r9,1),%xmm2
   .byte  102,15,58,33,194,48                 // insertps      $0x30,%xmm2,%xmm0
-  .byte  102,15,56,0,13,138,62,0,0           // pshufb        0x3e8a(%rip),%xmm1        # 6210 <_sk_callback_sse41+0x6e7>
+  .byte  102,15,56,0,13,178,62,0,0           // pshufb        0x3eb2(%rip),%xmm1        # 6260 <_sk_callback_sse41+0x70f>
   .byte  102,15,56,51,201                    // pmovzxwd      %xmm1,%xmm1
   .byte  102,73,15,58,22,201,1               // pextrq        $0x1,%xmm1,%r9
   .byte  102,72,15,126,203                   // movq          %xmm1,%rbx
@@ -28298,7 +28417,7 @@
   .byte  102,65,15,235,216                   // por           %xmm8,%xmm3
   .byte  102,15,56,51,219                    // pmovzxwd      %xmm3,%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,216,61,0,0                 // mulps         0x3dd8(%rip),%xmm3        # 6220 <_sk_callback_sse41+0x6f7>
+  .byte  15,89,29,0,62,0,0                   // mulps         0x3e00(%rip),%xmm3        # 6270 <_sk_callback_sse41+0x71f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
   .byte  65,94                               // pop           %r14
@@ -28306,16 +28425,16 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,67,15,16,4,81                   // movsd         (%r9,%r10,2),%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,13                              // jne           246a <_sk_load_tables_u16_be_sse41+0x192>
+  .byte  117,13                              // jne           2492 <_sk_load_tables_u16_be_sse41+0x192>
   .byte  243,15,126,192                      // movq          %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,145,254,255,255                 // jmpq          22fb <_sk_load_tables_u16_be_sse41+0x23>
+  .byte  233,145,254,255,255                 // jmpq          2323 <_sk_load_tables_u16_be_sse41+0x23>
   .byte  102,67,15,22,68,81,8                // movhpd        0x8(%r9,%r10,2),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,124,254,255,255              // jb            22fb <_sk_load_tables_u16_be_sse41+0x23>
+  .byte  15,130,124,254,255,255              // jb            2323 <_sk_load_tables_u16_be_sse41+0x23>
   .byte  243,67,15,126,76,81,16              // movq          0x10(%r9,%r10,2),%xmm1
-  .byte  233,112,254,255,255                 // jmpq          22fb <_sk_load_tables_u16_be_sse41+0x23>
+  .byte  233,112,254,255,255                 // jmpq          2323 <_sk_load_tables_u16_be_sse41+0x23>
 
 HIDDEN _sk_load_tables_rgb_u16_be_sse41
 .globl _sk_load_tables_rgb_u16_be_sse41
@@ -28325,7 +28444,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,82                        // lea           (%rdx,%rdx,2),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,83,1,0,0                     // jne           25f0 <_sk_load_tables_rgb_u16_be_sse41+0x165>
+  .byte  15,133,83,1,0,0                     // jne           2618 <_sk_load_tables_rgb_u16_be_sse41+0x165>
   .byte  243,67,15,111,20,81                 // movdqu        (%r9,%r10,2),%xmm2
   .byte  243,67,15,111,76,81,8               // movdqu        0x8(%r9,%r10,2),%xmm1
   .byte  102,15,115,217,4                    // psrldq        $0x4,%xmm1
@@ -28340,7 +28459,7 @@
   .byte  102,68,15,97,200                    // punpcklwd     %xmm0,%xmm9
   .byte  102,15,111,202                      // movdqa        %xmm2,%xmm1
   .byte  102,65,15,97,201                    // punpcklwd     %xmm9,%xmm1
-  .byte  102,68,15,111,5,77,61,0,0           // movdqa        0x3d4d(%rip),%xmm8        # 6230 <_sk_callback_sse41+0x707>
+  .byte  102,68,15,111,5,117,61,0,0          // movdqa        0x3d75(%rip),%xmm8        # 6280 <_sk_callback_sse41+0x72f>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,15,56,51,192                    // pmovzxwd      %xmm0,%xmm0
@@ -28358,7 +28477,7 @@
   .byte  102,15,58,33,195,32                 // insertps      $0x20,%xmm3,%xmm0
   .byte  243,66,15,16,28,11                  // movss         (%rbx,%r9,1),%xmm3
   .byte  102,15,58,33,195,48                 // insertps      $0x30,%xmm3,%xmm0
-  .byte  102,15,56,0,13,252,60,0,0           // pshufb        0x3cfc(%rip),%xmm1        # 6240 <_sk_callback_sse41+0x717>
+  .byte  102,15,56,0,13,36,61,0,0            // pshufb        0x3d24(%rip),%xmm1        # 6290 <_sk_callback_sse41+0x73f>
   .byte  102,15,56,51,201                    // pmovzxwd      %xmm1,%xmm1
   .byte  102,73,15,58,22,201,1               // pextrq        $0x1,%xmm1,%r9
   .byte  102,72,15,126,203                   // movq          %xmm1,%rbx
@@ -28389,7 +28508,7 @@
   .byte  243,65,15,16,28,25                  // movss         (%r9,%rbx,1),%xmm3
   .byte  102,15,58,33,211,48                 // insertps      $0x30,%xmm3,%xmm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,103,60,0,0                 // movaps        0x3c67(%rip),%xmm3        # 6250 <_sk_callback_sse41+0x727>
+  .byte  15,40,29,143,60,0,0                 // movaps        0x3c8f(%rip),%xmm3        # 62a0 <_sk_callback_sse41+0x74f>
   .byte  91                                  // pop           %rbx
   .byte  65,94                               // pop           %r14
   .byte  65,95                               // pop           %r15
@@ -28398,21 +28517,21 @@
   .byte  102,67,15,196,84,81,4,2             // pinsrw        $0x2,0x4(%r9,%r10,2),%xmm2
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,14                              // jne           2616 <_sk_load_tables_rgb_u16_be_sse41+0x18b>
+  .byte  117,14                              // jne           263e <_sk_load_tables_rgb_u16_be_sse41+0x18b>
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
-  .byte  233,173,254,255,255                 // jmpq          24c3 <_sk_load_tables_rgb_u16_be_sse41+0x38>
+  .byte  233,173,254,255,255                 // jmpq          24eb <_sk_load_tables_rgb_u16_be_sse41+0x38>
   .byte  102,71,15,110,76,81,6               // movd          0x6(%r9,%r10,2),%xmm9
   .byte  102,71,15,196,76,81,10,2            // pinsrw        $0x2,0xa(%r9,%r10,2),%xmm9
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,24                              // jb            2647 <_sk_load_tables_rgb_u16_be_sse41+0x1bc>
+  .byte  114,24                              // jb            266f <_sk_load_tables_rgb_u16_be_sse41+0x1bc>
   .byte  102,67,15,110,76,81,12              // movd          0xc(%r9,%r10,2),%xmm1
   .byte  102,67,15,196,76,81,16,2            // pinsrw        $0x2,0x10(%r9,%r10,2),%xmm1
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
-  .byte  233,124,254,255,255                 // jmpq          24c3 <_sk_load_tables_rgb_u16_be_sse41+0x38>
+  .byte  233,124,254,255,255                 // jmpq          24eb <_sk_load_tables_rgb_u16_be_sse41+0x38>
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,115,254,255,255                 // jmpq          24c3 <_sk_load_tables_rgb_u16_be_sse41+0x38>
+  .byte  233,115,254,255,255                 // jmpq          24eb <_sk_load_tables_rgb_u16_be_sse41+0x38>
 
 HIDDEN _sk_byte_tables_sse41
 .globl _sk_byte_tables_sse41
@@ -28423,7 +28542,7 @@
   .byte  65,84                               // push          %r12
   .byte  83                                  // push          %rbx
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,255,59,0,0               // movaps        0x3bff(%rip),%xmm8        # 6260 <_sk_callback_sse41+0x737>
+  .byte  68,15,40,5,39,60,0,0                // movaps        0x3c27(%rip),%xmm8        # 62b0 <_sk_callback_sse41+0x75f>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,91,192                       // cvtps2dq      %xmm0,%xmm0
   .byte  102,73,15,58,22,193,1               // pextrq        $0x1,%xmm0,%r9
@@ -28442,7 +28561,7 @@
   .byte  102,15,58,32,195,3                  // pinsrb        $0x3,%ebx,%xmm0
   .byte  102,15,56,49,192                    // pmovzxbd      %xmm0,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,13,176,59,0,0              // movaps        0x3bb0(%rip),%xmm9        # 6270 <_sk_callback_sse41+0x747>
+  .byte  68,15,40,13,216,59,0,0              // movaps        0x3bd8(%rip),%xmm9        # 62c0 <_sk_callback_sse41+0x76f>
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
@@ -28538,7 +28657,7 @@
   .byte  102,15,58,32,195,3                  // pinsrb        $0x3,%ebx,%xmm0
   .byte  102,15,56,49,192                    // pmovzxbd      %xmm0,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,13,40,58,0,0               // movaps        0x3a28(%rip),%xmm9        # 6280 <_sk_callback_sse41+0x757>
+  .byte  68,15,40,13,80,58,0,0               // movaps        0x3a50(%rip),%xmm9        # 62d0 <_sk_callback_sse41+0x77f>
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
@@ -28725,31 +28844,31 @@
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,194                        // cvtdq2ps      %xmm10,%xmm8
-  .byte  68,15,89,5,112,55,0,0               // mulps         0x3770(%rip),%xmm8        # 6290 <_sk_callback_sse41+0x767>
-  .byte  68,15,84,21,120,55,0,0              // andps         0x3778(%rip),%xmm10        # 62a0 <_sk_callback_sse41+0x777>
-  .byte  68,15,86,21,128,55,0,0              // orps          0x3780(%rip),%xmm10        # 62b0 <_sk_callback_sse41+0x787>
-  .byte  68,15,88,5,136,55,0,0               // addps         0x3788(%rip),%xmm8        # 62c0 <_sk_callback_sse41+0x797>
-  .byte  68,15,40,37,144,55,0,0              // movaps        0x3790(%rip),%xmm12        # 62d0 <_sk_callback_sse41+0x7a7>
+  .byte  68,15,89,5,152,55,0,0               // mulps         0x3798(%rip),%xmm8        # 62e0 <_sk_callback_sse41+0x78f>
+  .byte  68,15,84,21,160,55,0,0              // andps         0x37a0(%rip),%xmm10        # 62f0 <_sk_callback_sse41+0x79f>
+  .byte  68,15,86,21,168,55,0,0              // orps          0x37a8(%rip),%xmm10        # 6300 <_sk_callback_sse41+0x7af>
+  .byte  68,15,88,5,176,55,0,0               // addps         0x37b0(%rip),%xmm8        # 6310 <_sk_callback_sse41+0x7bf>
+  .byte  68,15,40,37,184,55,0,0              // movaps        0x37b8(%rip),%xmm12        # 6320 <_sk_callback_sse41+0x7cf>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,196                        // subps         %xmm12,%xmm8
-  .byte  68,15,88,21,144,55,0,0              // addps         0x3790(%rip),%xmm10        # 62e0 <_sk_callback_sse41+0x7b7>
-  .byte  68,15,40,37,152,55,0,0              // movaps        0x3798(%rip),%xmm12        # 62f0 <_sk_callback_sse41+0x7c7>
+  .byte  68,15,88,21,184,55,0,0              // addps         0x37b8(%rip),%xmm10        # 6330 <_sk_callback_sse41+0x7df>
+  .byte  68,15,40,37,192,55,0,0              // movaps        0x37c0(%rip),%xmm12        # 6340 <_sk_callback_sse41+0x7ef>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,196                        // subps         %xmm12,%xmm8
   .byte  69,15,89,195                        // mulps         %xmm11,%xmm8
   .byte  102,69,15,58,8,208,1                // roundps       $0x1,%xmm8,%xmm10
   .byte  69,15,40,216                        // movaps        %xmm8,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  68,15,88,5,133,55,0,0               // addps         0x3785(%rip),%xmm8        # 6300 <_sk_callback_sse41+0x7d7>
-  .byte  68,15,40,21,141,55,0,0              // movaps        0x378d(%rip),%xmm10        # 6310 <_sk_callback_sse41+0x7e7>
+  .byte  68,15,88,5,173,55,0,0               // addps         0x37ad(%rip),%xmm8        # 6350 <_sk_callback_sse41+0x7ff>
+  .byte  68,15,40,21,181,55,0,0              // movaps        0x37b5(%rip),%xmm10        # 6360 <_sk_callback_sse41+0x80f>
   .byte  69,15,89,211                        // mulps         %xmm11,%xmm10
   .byte  69,15,92,194                        // subps         %xmm10,%xmm8
-  .byte  68,15,40,21,141,55,0,0              // movaps        0x378d(%rip),%xmm10        # 6320 <_sk_callback_sse41+0x7f7>
+  .byte  68,15,40,21,181,55,0,0              // movaps        0x37b5(%rip),%xmm10        # 6370 <_sk_callback_sse41+0x81f>
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
-  .byte  68,15,40,29,145,55,0,0              // movaps        0x3791(%rip),%xmm11        # 6330 <_sk_callback_sse41+0x807>
+  .byte  68,15,40,29,185,55,0,0              // movaps        0x37b9(%rip),%xmm11        # 6380 <_sk_callback_sse41+0x82f>
   .byte  69,15,94,218                        // divps         %xmm10,%xmm11
   .byte  69,15,88,216                        // addps         %xmm8,%xmm11
-  .byte  68,15,89,29,145,55,0,0              // mulps         0x3791(%rip),%xmm11        # 6340 <_sk_callback_sse41+0x817>
+  .byte  68,15,89,29,185,55,0,0              // mulps         0x37b9(%rip),%xmm11        # 6390 <_sk_callback_sse41+0x83f>
   .byte  102,69,15,91,211                    // cvtps2dq      %xmm11,%xmm10
   .byte  243,68,15,16,64,20                  // movss         0x14(%rax),%xmm8
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
@@ -28757,7 +28876,7 @@
   .byte  102,69,15,56,20,193                 // blendvps      %xmm0,%xmm9,%xmm8
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  68,15,95,192                        // maxps         %xmm0,%xmm8
-  .byte  68,15,93,5,120,55,0,0               // minps         0x3778(%rip),%xmm8        # 6350 <_sk_callback_sse41+0x827>
+  .byte  68,15,93,5,160,55,0,0               // minps         0x37a0(%rip),%xmm8        # 63a0 <_sk_callback_sse41+0x84f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -28787,31 +28906,31 @@
   .byte  68,15,88,217                        // addps         %xmm1,%xmm11
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,91,227                        // cvtdq2ps      %xmm11,%xmm12
-  .byte  68,15,89,37,25,55,0,0               // mulps         0x3719(%rip),%xmm12        # 6360 <_sk_callback_sse41+0x837>
-  .byte  68,15,84,29,33,55,0,0               // andps         0x3721(%rip),%xmm11        # 6370 <_sk_callback_sse41+0x847>
-  .byte  68,15,86,29,41,55,0,0               // orps          0x3729(%rip),%xmm11        # 6380 <_sk_callback_sse41+0x857>
-  .byte  68,15,88,37,49,55,0,0               // addps         0x3731(%rip),%xmm12        # 6390 <_sk_callback_sse41+0x867>
-  .byte  15,40,13,58,55,0,0                  // movaps        0x373a(%rip),%xmm1        # 63a0 <_sk_callback_sse41+0x877>
+  .byte  68,15,89,37,65,55,0,0               // mulps         0x3741(%rip),%xmm12        # 63b0 <_sk_callback_sse41+0x85f>
+  .byte  68,15,84,29,73,55,0,0               // andps         0x3749(%rip),%xmm11        # 63c0 <_sk_callback_sse41+0x86f>
+  .byte  68,15,86,29,81,55,0,0               // orps          0x3751(%rip),%xmm11        # 63d0 <_sk_callback_sse41+0x87f>
+  .byte  68,15,88,37,89,55,0,0               // addps         0x3759(%rip),%xmm12        # 63e0 <_sk_callback_sse41+0x88f>
+  .byte  15,40,13,98,55,0,0                  // movaps        0x3762(%rip),%xmm1        # 63f0 <_sk_callback_sse41+0x89f>
   .byte  65,15,89,203                        // mulps         %xmm11,%xmm1
   .byte  68,15,92,225                        // subps         %xmm1,%xmm12
-  .byte  68,15,88,29,58,55,0,0               // addps         0x373a(%rip),%xmm11        # 63b0 <_sk_callback_sse41+0x887>
-  .byte  15,40,13,67,55,0,0                  // movaps        0x3743(%rip),%xmm1        # 63c0 <_sk_callback_sse41+0x897>
+  .byte  68,15,88,29,98,55,0,0               // addps         0x3762(%rip),%xmm11        # 6400 <_sk_callback_sse41+0x8af>
+  .byte  15,40,13,107,55,0,0                 // movaps        0x376b(%rip),%xmm1        # 6410 <_sk_callback_sse41+0x8bf>
   .byte  65,15,94,203                        // divps         %xmm11,%xmm1
   .byte  68,15,92,225                        // subps         %xmm1,%xmm12
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  102,69,15,58,8,212,1                // roundps       $0x1,%xmm12,%xmm10
   .byte  69,15,40,220                        // movaps        %xmm12,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  68,15,88,37,48,55,0,0               // addps         0x3730(%rip),%xmm12        # 63d0 <_sk_callback_sse41+0x8a7>
-  .byte  15,40,13,57,55,0,0                  // movaps        0x3739(%rip),%xmm1        # 63e0 <_sk_callback_sse41+0x8b7>
+  .byte  68,15,88,37,88,55,0,0               // addps         0x3758(%rip),%xmm12        # 6420 <_sk_callback_sse41+0x8cf>
+  .byte  15,40,13,97,55,0,0                  // movaps        0x3761(%rip),%xmm1        # 6430 <_sk_callback_sse41+0x8df>
   .byte  65,15,89,203                        // mulps         %xmm11,%xmm1
   .byte  68,15,92,225                        // subps         %xmm1,%xmm12
-  .byte  68,15,40,21,57,55,0,0               // movaps        0x3739(%rip),%xmm10        # 63f0 <_sk_callback_sse41+0x8c7>
+  .byte  68,15,40,21,97,55,0,0               // movaps        0x3761(%rip),%xmm10        # 6440 <_sk_callback_sse41+0x8ef>
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
-  .byte  15,40,13,62,55,0,0                  // movaps        0x373e(%rip),%xmm1        # 6400 <_sk_callback_sse41+0x8d7>
+  .byte  15,40,13,102,55,0,0                 // movaps        0x3766(%rip),%xmm1        # 6450 <_sk_callback_sse41+0x8ff>
   .byte  65,15,94,202                        // divps         %xmm10,%xmm1
   .byte  65,15,88,204                        // addps         %xmm12,%xmm1
-  .byte  15,89,13,63,55,0,0                  // mulps         0x373f(%rip),%xmm1        # 6410 <_sk_callback_sse41+0x8e7>
+  .byte  15,89,13,103,55,0,0                 // mulps         0x3767(%rip),%xmm1        # 6460 <_sk_callback_sse41+0x90f>
   .byte  102,68,15,91,209                    // cvtps2dq      %xmm1,%xmm10
   .byte  243,15,16,72,20                     // movss         0x14(%rax),%xmm1
   .byte  15,198,201,0                        // shufps        $0x0,%xmm1,%xmm1
@@ -28819,7 +28938,7 @@
   .byte  102,65,15,56,20,201                 // blendvps      %xmm0,%xmm9,%xmm1
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  15,95,200                           // maxps         %xmm0,%xmm1
-  .byte  15,93,13,42,55,0,0                  // minps         0x372a(%rip),%xmm1        # 6420 <_sk_callback_sse41+0x8f7>
+  .byte  15,93,13,82,55,0,0                  // minps         0x3752(%rip),%xmm1        # 6470 <_sk_callback_sse41+0x91f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -28849,31 +28968,31 @@
   .byte  68,15,88,218                        // addps         %xmm2,%xmm11
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,91,227                        // cvtdq2ps      %xmm11,%xmm12
-  .byte  68,15,89,37,203,54,0,0              // mulps         0x36cb(%rip),%xmm12        # 6430 <_sk_callback_sse41+0x907>
-  .byte  68,15,84,29,211,54,0,0              // andps         0x36d3(%rip),%xmm11        # 6440 <_sk_callback_sse41+0x917>
-  .byte  68,15,86,29,219,54,0,0              // orps          0x36db(%rip),%xmm11        # 6450 <_sk_callback_sse41+0x927>
-  .byte  68,15,88,37,227,54,0,0              // addps         0x36e3(%rip),%xmm12        # 6460 <_sk_callback_sse41+0x937>
-  .byte  15,40,21,236,54,0,0                 // movaps        0x36ec(%rip),%xmm2        # 6470 <_sk_callback_sse41+0x947>
+  .byte  68,15,89,37,243,54,0,0              // mulps         0x36f3(%rip),%xmm12        # 6480 <_sk_callback_sse41+0x92f>
+  .byte  68,15,84,29,251,54,0,0              // andps         0x36fb(%rip),%xmm11        # 6490 <_sk_callback_sse41+0x93f>
+  .byte  68,15,86,29,3,55,0,0                // orps          0x3703(%rip),%xmm11        # 64a0 <_sk_callback_sse41+0x94f>
+  .byte  68,15,88,37,11,55,0,0               // addps         0x370b(%rip),%xmm12        # 64b0 <_sk_callback_sse41+0x95f>
+  .byte  15,40,21,20,55,0,0                  // movaps        0x3714(%rip),%xmm2        # 64c0 <_sk_callback_sse41+0x96f>
   .byte  65,15,89,211                        // mulps         %xmm11,%xmm2
   .byte  68,15,92,226                        // subps         %xmm2,%xmm12
-  .byte  68,15,88,29,236,54,0,0              // addps         0x36ec(%rip),%xmm11        # 6480 <_sk_callback_sse41+0x957>
-  .byte  15,40,21,245,54,0,0                 // movaps        0x36f5(%rip),%xmm2        # 6490 <_sk_callback_sse41+0x967>
+  .byte  68,15,88,29,20,55,0,0               // addps         0x3714(%rip),%xmm11        # 64d0 <_sk_callback_sse41+0x97f>
+  .byte  15,40,21,29,55,0,0                  // movaps        0x371d(%rip),%xmm2        # 64e0 <_sk_callback_sse41+0x98f>
   .byte  65,15,94,211                        // divps         %xmm11,%xmm2
   .byte  68,15,92,226                        // subps         %xmm2,%xmm12
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  102,69,15,58,8,212,1                // roundps       $0x1,%xmm12,%xmm10
   .byte  69,15,40,220                        // movaps        %xmm12,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  68,15,88,37,226,54,0,0              // addps         0x36e2(%rip),%xmm12        # 64a0 <_sk_callback_sse41+0x977>
-  .byte  15,40,21,235,54,0,0                 // movaps        0x36eb(%rip),%xmm2        # 64b0 <_sk_callback_sse41+0x987>
+  .byte  68,15,88,37,10,55,0,0               // addps         0x370a(%rip),%xmm12        # 64f0 <_sk_callback_sse41+0x99f>
+  .byte  15,40,21,19,55,0,0                  // movaps        0x3713(%rip),%xmm2        # 6500 <_sk_callback_sse41+0x9af>
   .byte  65,15,89,211                        // mulps         %xmm11,%xmm2
   .byte  68,15,92,226                        // subps         %xmm2,%xmm12
-  .byte  68,15,40,21,235,54,0,0              // movaps        0x36eb(%rip),%xmm10        # 64c0 <_sk_callback_sse41+0x997>
+  .byte  68,15,40,21,19,55,0,0               // movaps        0x3713(%rip),%xmm10        # 6510 <_sk_callback_sse41+0x9bf>
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
-  .byte  15,40,21,240,54,0,0                 // movaps        0x36f0(%rip),%xmm2        # 64d0 <_sk_callback_sse41+0x9a7>
+  .byte  15,40,21,24,55,0,0                  // movaps        0x3718(%rip),%xmm2        # 6520 <_sk_callback_sse41+0x9cf>
   .byte  65,15,94,210                        // divps         %xmm10,%xmm2
   .byte  65,15,88,212                        // addps         %xmm12,%xmm2
-  .byte  15,89,21,241,54,0,0                 // mulps         0x36f1(%rip),%xmm2        # 64e0 <_sk_callback_sse41+0x9b7>
+  .byte  15,89,21,25,55,0,0                  // mulps         0x3719(%rip),%xmm2        # 6530 <_sk_callback_sse41+0x9df>
   .byte  102,68,15,91,210                    // cvtps2dq      %xmm2,%xmm10
   .byte  243,15,16,80,20                     // movss         0x14(%rax),%xmm2
   .byte  15,198,210,0                        // shufps        $0x0,%xmm2,%xmm2
@@ -28881,7 +29000,7 @@
   .byte  102,65,15,56,20,209                 // blendvps      %xmm0,%xmm9,%xmm2
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  15,95,208                           // maxps         %xmm0,%xmm2
-  .byte  15,93,21,220,54,0,0                 // minps         0x36dc(%rip),%xmm2        # 64f0 <_sk_callback_sse41+0x9c7>
+  .byte  15,93,21,4,55,0,0                   // minps         0x3704(%rip),%xmm2        # 6540 <_sk_callback_sse41+0x9ef>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -28911,31 +29030,31 @@
   .byte  68,15,88,219                        // addps         %xmm3,%xmm11
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,91,227                        // cvtdq2ps      %xmm11,%xmm12
-  .byte  68,15,89,37,125,54,0,0              // mulps         0x367d(%rip),%xmm12        # 6500 <_sk_callback_sse41+0x9d7>
-  .byte  68,15,84,29,133,54,0,0              // andps         0x3685(%rip),%xmm11        # 6510 <_sk_callback_sse41+0x9e7>
-  .byte  68,15,86,29,141,54,0,0              // orps          0x368d(%rip),%xmm11        # 6520 <_sk_callback_sse41+0x9f7>
-  .byte  68,15,88,37,149,54,0,0              // addps         0x3695(%rip),%xmm12        # 6530 <_sk_callback_sse41+0xa07>
-  .byte  15,40,29,158,54,0,0                 // movaps        0x369e(%rip),%xmm3        # 6540 <_sk_callback_sse41+0xa17>
+  .byte  68,15,89,37,165,54,0,0              // mulps         0x36a5(%rip),%xmm12        # 6550 <_sk_callback_sse41+0x9ff>
+  .byte  68,15,84,29,173,54,0,0              // andps         0x36ad(%rip),%xmm11        # 6560 <_sk_callback_sse41+0xa0f>
+  .byte  68,15,86,29,181,54,0,0              // orps          0x36b5(%rip),%xmm11        # 6570 <_sk_callback_sse41+0xa1f>
+  .byte  68,15,88,37,189,54,0,0              // addps         0x36bd(%rip),%xmm12        # 6580 <_sk_callback_sse41+0xa2f>
+  .byte  15,40,29,198,54,0,0                 // movaps        0x36c6(%rip),%xmm3        # 6590 <_sk_callback_sse41+0xa3f>
   .byte  65,15,89,219                        // mulps         %xmm11,%xmm3
   .byte  68,15,92,227                        // subps         %xmm3,%xmm12
-  .byte  68,15,88,29,158,54,0,0              // addps         0x369e(%rip),%xmm11        # 6550 <_sk_callback_sse41+0xa27>
-  .byte  15,40,29,167,54,0,0                 // movaps        0x36a7(%rip),%xmm3        # 6560 <_sk_callback_sse41+0xa37>
+  .byte  68,15,88,29,198,54,0,0              // addps         0x36c6(%rip),%xmm11        # 65a0 <_sk_callback_sse41+0xa4f>
+  .byte  15,40,29,207,54,0,0                 // movaps        0x36cf(%rip),%xmm3        # 65b0 <_sk_callback_sse41+0xa5f>
   .byte  65,15,94,219                        // divps         %xmm11,%xmm3
   .byte  68,15,92,227                        // subps         %xmm3,%xmm12
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  102,69,15,58,8,212,1                // roundps       $0x1,%xmm12,%xmm10
   .byte  69,15,40,220                        // movaps        %xmm12,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  68,15,88,37,148,54,0,0              // addps         0x3694(%rip),%xmm12        # 6570 <_sk_callback_sse41+0xa47>
-  .byte  15,40,29,157,54,0,0                 // movaps        0x369d(%rip),%xmm3        # 6580 <_sk_callback_sse41+0xa57>
+  .byte  68,15,88,37,188,54,0,0              // addps         0x36bc(%rip),%xmm12        # 65c0 <_sk_callback_sse41+0xa6f>
+  .byte  15,40,29,197,54,0,0                 // movaps        0x36c5(%rip),%xmm3        # 65d0 <_sk_callback_sse41+0xa7f>
   .byte  65,15,89,219                        // mulps         %xmm11,%xmm3
   .byte  68,15,92,227                        // subps         %xmm3,%xmm12
-  .byte  68,15,40,21,157,54,0,0              // movaps        0x369d(%rip),%xmm10        # 6590 <_sk_callback_sse41+0xa67>
+  .byte  68,15,40,21,197,54,0,0              // movaps        0x36c5(%rip),%xmm10        # 65e0 <_sk_callback_sse41+0xa8f>
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
-  .byte  15,40,29,162,54,0,0                 // movaps        0x36a2(%rip),%xmm3        # 65a0 <_sk_callback_sse41+0xa77>
+  .byte  15,40,29,202,54,0,0                 // movaps        0x36ca(%rip),%xmm3        # 65f0 <_sk_callback_sse41+0xa9f>
   .byte  65,15,94,218                        // divps         %xmm10,%xmm3
   .byte  65,15,88,220                        // addps         %xmm12,%xmm3
-  .byte  15,89,29,163,54,0,0                 // mulps         0x36a3(%rip),%xmm3        # 65b0 <_sk_callback_sse41+0xa87>
+  .byte  15,89,29,203,54,0,0                 // mulps         0x36cb(%rip),%xmm3        # 6600 <_sk_callback_sse41+0xaaf>
   .byte  102,68,15,91,211                    // cvtps2dq      %xmm3,%xmm10
   .byte  243,15,16,88,20                     // movss         0x14(%rax),%xmm3
   .byte  15,198,219,0                        // shufps        $0x0,%xmm3,%xmm3
@@ -28943,7 +29062,7 @@
   .byte  102,65,15,56,20,217                 // blendvps      %xmm0,%xmm9,%xmm3
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  15,95,216                           // maxps         %xmm0,%xmm3
-  .byte  15,93,29,142,54,0,0                 // minps         0x368e(%rip),%xmm3        # 65c0 <_sk_callback_sse41+0xa97>
+  .byte  15,93,29,182,54,0,0                 // minps         0x36b6(%rip),%xmm3        # 6610 <_sk_callback_sse41+0xabf>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -28953,29 +29072,29 @@
 FUNCTION(_sk_lab_to_xyz_sse41)
 _sk_lab_to_xyz_sse41:
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,89,5,138,54,0,0               // mulps         0x368a(%rip),%xmm8        # 65d0 <_sk_callback_sse41+0xaa7>
-  .byte  68,15,40,13,146,54,0,0              // movaps        0x3692(%rip),%xmm9        # 65e0 <_sk_callback_sse41+0xab7>
+  .byte  68,15,89,5,178,54,0,0               // mulps         0x36b2(%rip),%xmm8        # 6620 <_sk_callback_sse41+0xacf>
+  .byte  68,15,40,13,186,54,0,0              // movaps        0x36ba(%rip),%xmm9        # 6630 <_sk_callback_sse41+0xadf>
   .byte  65,15,89,201                        // mulps         %xmm9,%xmm1
-  .byte  15,40,5,151,54,0,0                  // movaps        0x3697(%rip),%xmm0        # 65f0 <_sk_callback_sse41+0xac7>
+  .byte  15,40,5,191,54,0,0                  // movaps        0x36bf(%rip),%xmm0        # 6640 <_sk_callback_sse41+0xaef>
   .byte  15,88,200                           // addps         %xmm0,%xmm1
   .byte  65,15,89,209                        // mulps         %xmm9,%xmm2
   .byte  15,88,208                           // addps         %xmm0,%xmm2
-  .byte  68,15,88,5,149,54,0,0               // addps         0x3695(%rip),%xmm8        # 6600 <_sk_callback_sse41+0xad7>
-  .byte  68,15,89,5,157,54,0,0               // mulps         0x369d(%rip),%xmm8        # 6610 <_sk_callback_sse41+0xae7>
-  .byte  15,89,13,166,54,0,0                 // mulps         0x36a6(%rip),%xmm1        # 6620 <_sk_callback_sse41+0xaf7>
+  .byte  68,15,88,5,189,54,0,0               // addps         0x36bd(%rip),%xmm8        # 6650 <_sk_callback_sse41+0xaff>
+  .byte  68,15,89,5,197,54,0,0               // mulps         0x36c5(%rip),%xmm8        # 6660 <_sk_callback_sse41+0xb0f>
+  .byte  15,89,13,206,54,0,0                 // mulps         0x36ce(%rip),%xmm1        # 6670 <_sk_callback_sse41+0xb1f>
   .byte  65,15,88,200                        // addps         %xmm8,%xmm1
-  .byte  15,89,21,171,54,0,0                 // mulps         0x36ab(%rip),%xmm2        # 6630 <_sk_callback_sse41+0xb07>
+  .byte  15,89,21,211,54,0,0                 // mulps         0x36d3(%rip),%xmm2        # 6680 <_sk_callback_sse41+0xb2f>
   .byte  69,15,40,208                        // movaps        %xmm8,%xmm10
   .byte  68,15,92,210                        // subps         %xmm2,%xmm10
   .byte  68,15,40,217                        // movaps        %xmm1,%xmm11
   .byte  69,15,89,219                        // mulps         %xmm11,%xmm11
   .byte  68,15,89,217                        // mulps         %xmm1,%xmm11
-  .byte  68,15,40,13,159,54,0,0              // movaps        0x369f(%rip),%xmm9        # 6640 <_sk_callback_sse41+0xb17>
+  .byte  68,15,40,13,199,54,0,0              // movaps        0x36c7(%rip),%xmm9        # 6690 <_sk_callback_sse41+0xb3f>
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  65,15,194,195,1                     // cmpltps       %xmm11,%xmm0
-  .byte  15,40,21,159,54,0,0                 // movaps        0x369f(%rip),%xmm2        # 6650 <_sk_callback_sse41+0xb27>
+  .byte  15,40,21,199,54,0,0                 // movaps        0x36c7(%rip),%xmm2        # 66a0 <_sk_callback_sse41+0xb4f>
   .byte  15,88,202                           // addps         %xmm2,%xmm1
-  .byte  68,15,40,37,164,54,0,0              // movaps        0x36a4(%rip),%xmm12        # 6660 <_sk_callback_sse41+0xb37>
+  .byte  68,15,40,37,204,54,0,0              // movaps        0x36cc(%rip),%xmm12        # 66b0 <_sk_callback_sse41+0xb5f>
   .byte  65,15,89,204                        // mulps         %xmm12,%xmm1
   .byte  102,65,15,56,20,203                 // blendvps      %xmm0,%xmm11,%xmm1
   .byte  69,15,40,216                        // movaps        %xmm8,%xmm11
@@ -28994,8 +29113,8 @@
   .byte  65,15,89,212                        // mulps         %xmm12,%xmm2
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  102,65,15,56,20,211                 // blendvps      %xmm0,%xmm11,%xmm2
-  .byte  15,89,13,93,54,0,0                  // mulps         0x365d(%rip),%xmm1        # 6670 <_sk_callback_sse41+0xb47>
-  .byte  15,89,21,102,54,0,0                 // mulps         0x3666(%rip),%xmm2        # 6680 <_sk_callback_sse41+0xb57>
+  .byte  15,89,13,133,54,0,0                 // mulps         0x3685(%rip),%xmm1        # 66c0 <_sk_callback_sse41+0xb6f>
+  .byte  15,89,21,142,54,0,0                 // mulps         0x368e(%rip),%xmm2        # 66d0 <_sk_callback_sse41+0xb7f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  65,15,40,200                        // movaps        %xmm8,%xmm1
@@ -29008,11 +29127,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,39                              // jne           3056 <_sk_load_a8_sse41+0x31>
+  .byte  117,39                              // jne           307e <_sk_load_a8_sse41+0x31>
   .byte  102,65,15,56,49,4,18                // pmovzxbd      (%r10,%rdx,1),%xmm0
-  .byte  102,15,219,5,82,54,0,0              // pand          0x3652(%rip),%xmm0        # 6690 <_sk_callback_sse41+0xb67>
+  .byte  102,15,219,5,122,54,0,0             // pand          0x367a(%rip),%xmm0        # 66e0 <_sk_callback_sse41+0xb8f>
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,29,88,54,0,0                  // mulps         0x3658(%rip),%xmm3        # 66a0 <_sk_callback_sse41+0xb77>
+  .byte  15,89,29,128,54,0,0                 // mulps         0x3680(%rip),%xmm3        # 66f0 <_sk_callback_sse41+0xb9f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
@@ -29021,12 +29140,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            3098 <_sk_load_a8_sse41+0x73>
+  .byte  116,53                              // je            30c0 <_sk_load_a8_sse41+0x73>
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3082 <_sk_load_a8_sse41+0x5d>
+  .byte  116,21                              // je            30aa <_sk_load_a8_sse41+0x5d>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,195                             // jne           3036 <_sk_load_a8_sse41+0x11>
+  .byte  117,195                             // jne           305e <_sk_load_a8_sse41+0x11>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,192,69                   // pshufd        $0x45,%xmm0,%xmm0
@@ -29034,10 +29153,10 @@
   .byte  102,15,110,200                      // movd          %eax,%xmm1
   .byte  102,15,56,49,201                    // pmovzxbd      %xmm1,%xmm1
   .byte  102,15,58,14,193,15                 // pblendw       $0xf,%xmm1,%xmm0
-  .byte  235,158                             // jmp           3036 <_sk_load_a8_sse41+0x11>
+  .byte  235,158                             // jmp           305e <_sk_load_a8_sse41+0x11>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
-  .byte  235,147                             // jmp           3036 <_sk_load_a8_sse41+0x11>
+  .byte  235,147                             // jmp           305e <_sk_load_a8_sse41+0x11>
 
 HIDDEN _sk_load_a8_dst_sse41
 .globl _sk_load_a8_dst_sse41
@@ -29046,11 +29165,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,39                              // jne           30d4 <_sk_load_a8_dst_sse41+0x31>
+  .byte  117,39                              // jne           30fc <_sk_load_a8_dst_sse41+0x31>
   .byte  102,65,15,56,49,36,18               // pmovzxbd      (%r10,%rdx,1),%xmm4
-  .byte  102,15,219,37,244,53,0,0            // pand          0x35f4(%rip),%xmm4        # 66b0 <_sk_callback_sse41+0xb87>
+  .byte  102,15,219,37,28,54,0,0             // pand          0x361c(%rip),%xmm4        # 6700 <_sk_callback_sse41+0xbaf>
   .byte  15,91,252                           // cvtdq2ps      %xmm4,%xmm7
-  .byte  15,89,61,250,53,0,0                 // mulps         0x35fa(%rip),%xmm7        # 66c0 <_sk_callback_sse41+0xb97>
+  .byte  15,89,61,34,54,0,0                  // mulps         0x3622(%rip),%xmm7        # 6710 <_sk_callback_sse41+0xbbf>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  102,15,239,237                      // pxor          %xmm5,%xmm5
@@ -29059,12 +29178,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            3116 <_sk_load_a8_dst_sse41+0x73>
+  .byte  116,53                              // je            313e <_sk_load_a8_dst_sse41+0x73>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3100 <_sk_load_a8_dst_sse41+0x5d>
+  .byte  116,21                              // je            3128 <_sk_load_a8_dst_sse41+0x5d>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,195                             // jne           30b4 <_sk_load_a8_dst_sse41+0x11>
+  .byte  117,195                             // jne           30dc <_sk_load_a8_dst_sse41+0x11>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,228,69                   // pshufd        $0x45,%xmm4,%xmm4
@@ -29072,10 +29191,10 @@
   .byte  102,15,110,232                      // movd          %eax,%xmm5
   .byte  102,15,56,49,237                    // pmovzxbd      %xmm5,%xmm5
   .byte  102,15,58,14,229,15                 // pblendw       $0xf,%xmm5,%xmm4
-  .byte  235,158                             // jmp           30b4 <_sk_load_a8_dst_sse41+0x11>
+  .byte  235,158                             // jmp           30dc <_sk_load_a8_dst_sse41+0x11>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
-  .byte  235,147                             // jmp           30b4 <_sk_load_a8_dst_sse41+0x11>
+  .byte  235,147                             // jmp           30dc <_sk_load_a8_dst_sse41+0x11>
 
 HIDDEN _sk_gather_a8_sse41
 .globl _sk_gather_a8_sse41
@@ -29104,7 +29223,7 @@
   .byte  102,15,58,32,192,3                  // pinsrb        $0x3,%eax,%xmm0
   .byte  102,15,56,49,192                    // pmovzxbd      %xmm0,%xmm0
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,29,63,53,0,0                  // mulps         0x353f(%rip),%xmm3        # 66d0 <_sk_callback_sse41+0xba7>
+  .byte  15,89,29,103,53,0,0                 // mulps         0x3567(%rip),%xmm3        # 6720 <_sk_callback_sse41+0xbcf>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
@@ -29118,13 +29237,13 @@
 _sk_store_a8_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  68,15,40,5,50,53,0,0                // movaps        0x3532(%rip),%xmm8        # 66e0 <_sk_callback_sse41+0xbb7>
+  .byte  68,15,40,5,90,53,0,0                // movaps        0x355a(%rip),%xmm8        # 6730 <_sk_callback_sse41+0xbdf>
   .byte  68,15,89,195                        // mulps         %xmm3,%xmm8
   .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
   .byte  102,69,15,56,43,192                 // packusdw      %xmm8,%xmm8
   .byte  102,69,15,103,192                   // packuswb      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,13                              // jne           31d4 <_sk_store_a8_sse41+0x33>
+  .byte  117,13                              // jne           31fc <_sk_store_a8_sse41+0x33>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  65,137,4,18                         // mov           %eax,(%r10,%rdx,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -29133,17 +29252,17 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,41                              // je            3210 <_sk_store_a8_sse41+0x6f>
+  .byte  116,41                              // je            3238 <_sk_store_a8_sse41+0x6f>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,15                              // je            31fc <_sk_store_a8_sse41+0x5b>
+  .byte  116,15                              // je            3224 <_sk_store_a8_sse41+0x5b>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,221                             // jne           31d0 <_sk_store_a8_sse41+0x2f>
+  .byte  117,221                             // jne           31f8 <_sk_store_a8_sse41+0x2f>
   .byte  102,69,15,58,20,68,18,2,8           // pextrb        $0x8,%xmm8,0x2(%r10,%rdx,1)
-  .byte  102,68,15,56,0,5,234,52,0,0         // pshufb        0x34ea(%rip),%xmm8        # 66f0 <_sk_callback_sse41+0xbc7>
+  .byte  102,68,15,56,0,5,18,53,0,0          // pshufb        0x3512(%rip),%xmm8        # 6740 <_sk_callback_sse41+0xbef>
   .byte  102,69,15,58,21,4,18,0              // pextrw        $0x0,%xmm8,(%r10,%rdx,1)
-  .byte  235,192                             // jmp           31d0 <_sk_store_a8_sse41+0x2f>
+  .byte  235,192                             // jmp           31f8 <_sk_store_a8_sse41+0x2f>
   .byte  102,69,15,58,20,4,18,0              // pextrb        $0x0,%xmm8,(%r10,%rdx,1)
-  .byte  235,182                             // jmp           31d0 <_sk_store_a8_sse41+0x2f>
+  .byte  235,182                             // jmp           31f8 <_sk_store_a8_sse41+0x2f>
 
 HIDDEN _sk_load_g8_sse41
 .globl _sk_load_g8_sse41
@@ -29152,25 +29271,25 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,42                              // jne           324e <_sk_load_g8_sse41+0x34>
+  .byte  117,42                              // jne           3276 <_sk_load_g8_sse41+0x34>
   .byte  102,65,15,56,49,4,18                // pmovzxbd      (%r10,%rdx,1),%xmm0
-  .byte  102,15,219,5,205,52,0,0             // pand          0x34cd(%rip),%xmm0        # 6700 <_sk_callback_sse41+0xbd7>
+  .byte  102,15,219,5,245,52,0,0             // pand          0x34f5(%rip),%xmm0        # 6750 <_sk_callback_sse41+0xbff>
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,211,52,0,0                  // mulps         0x34d3(%rip),%xmm0        # 6710 <_sk_callback_sse41+0xbe7>
+  .byte  15,89,5,251,52,0,0                  // mulps         0x34fb(%rip),%xmm0        # 6760 <_sk_callback_sse41+0xc0f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,218,52,0,0                 // movaps        0x34da(%rip),%xmm3        # 6720 <_sk_callback_sse41+0xbf7>
+  .byte  15,40,29,2,53,0,0                   // movaps        0x3502(%rip),%xmm3        # 6770 <_sk_callback_sse41+0xc1f>
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            3290 <_sk_load_g8_sse41+0x76>
+  .byte  116,53                              // je            32b8 <_sk_load_g8_sse41+0x76>
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            327a <_sk_load_g8_sse41+0x60>
+  .byte  116,21                              // je            32a2 <_sk_load_g8_sse41+0x60>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,192                             // jne           322b <_sk_load_g8_sse41+0x11>
+  .byte  117,192                             // jne           3253 <_sk_load_g8_sse41+0x11>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,192,69                   // pshufd        $0x45,%xmm0,%xmm0
@@ -29178,10 +29297,10 @@
   .byte  102,15,110,200                      // movd          %eax,%xmm1
   .byte  102,15,56,49,201                    // pmovzxbd      %xmm1,%xmm1
   .byte  102,15,58,14,193,15                 // pblendw       $0xf,%xmm1,%xmm0
-  .byte  235,155                             // jmp           322b <_sk_load_g8_sse41+0x11>
+  .byte  235,155                             // jmp           3253 <_sk_load_g8_sse41+0x11>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
-  .byte  235,144                             // jmp           322b <_sk_load_g8_sse41+0x11>
+  .byte  235,144                             // jmp           3253 <_sk_load_g8_sse41+0x11>
 
 HIDDEN _sk_load_g8_dst_sse41
 .globl _sk_load_g8_dst_sse41
@@ -29190,25 +29309,25 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,42                              // jne           32cf <_sk_load_g8_dst_sse41+0x34>
+  .byte  117,42                              // jne           32f7 <_sk_load_g8_dst_sse41+0x34>
   .byte  102,65,15,56,49,36,18               // pmovzxbd      (%r10,%rdx,1),%xmm4
-  .byte  102,15,219,37,124,52,0,0            // pand          0x347c(%rip),%xmm4        # 6730 <_sk_callback_sse41+0xc07>
+  .byte  102,15,219,37,164,52,0,0            // pand          0x34a4(%rip),%xmm4        # 6780 <_sk_callback_sse41+0xc2f>
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,37,130,52,0,0                 // mulps         0x3482(%rip),%xmm4        # 6740 <_sk_callback_sse41+0xc17>
+  .byte  15,89,37,170,52,0,0                 // mulps         0x34aa(%rip),%xmm4        # 6790 <_sk_callback_sse41+0xc3f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,61,137,52,0,0                 // movaps        0x3489(%rip),%xmm7        # 6750 <_sk_callback_sse41+0xc27>
+  .byte  15,40,61,177,52,0,0                 // movaps        0x34b1(%rip),%xmm7        # 67a0 <_sk_callback_sse41+0xc4f>
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
   .byte  15,40,244                           // movaps        %xmm4,%xmm6
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            3311 <_sk_load_g8_dst_sse41+0x76>
+  .byte  116,53                              // je            3339 <_sk_load_g8_dst_sse41+0x76>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            32fb <_sk_load_g8_dst_sse41+0x60>
+  .byte  116,21                              // je            3323 <_sk_load_g8_dst_sse41+0x60>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,192                             // jne           32ac <_sk_load_g8_dst_sse41+0x11>
+  .byte  117,192                             // jne           32d4 <_sk_load_g8_dst_sse41+0x11>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,228,69                   // pshufd        $0x45,%xmm4,%xmm4
@@ -29216,10 +29335,10 @@
   .byte  102,15,110,232                      // movd          %eax,%xmm5
   .byte  102,15,56,49,237                    // pmovzxbd      %xmm5,%xmm5
   .byte  102,15,58,14,229,15                 // pblendw       $0xf,%xmm5,%xmm4
-  .byte  235,155                             // jmp           32ac <_sk_load_g8_dst_sse41+0x11>
+  .byte  235,155                             // jmp           32d4 <_sk_load_g8_dst_sse41+0x11>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
-  .byte  235,144                             // jmp           32ac <_sk_load_g8_dst_sse41+0x11>
+  .byte  235,144                             // jmp           32d4 <_sk_load_g8_dst_sse41+0x11>
 
 HIDDEN _sk_gather_g8_sse41
 .globl _sk_gather_g8_sse41
@@ -29248,9 +29367,9 @@
   .byte  102,15,58,32,192,3                  // pinsrb        $0x3,%eax,%xmm0
   .byte  102,15,56,49,192                    // pmovzxbd      %xmm0,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,212,51,0,0                  // mulps         0x33d4(%rip),%xmm0        # 6760 <_sk_callback_sse41+0xc37>
+  .byte  15,89,5,252,51,0,0                  // mulps         0x33fc(%rip),%xmm0        # 67b0 <_sk_callback_sse41+0xc5f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,219,51,0,0                 // movaps        0x33db(%rip),%xmm3        # 6770 <_sk_callback_sse41+0xc47>
+  .byte  15,40,29,3,52,0,0                   // movaps        0x3403(%rip),%xmm3        # 67c0 <_sk_callback_sse41+0xc6f>
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  91                                  // pop           %rbx
@@ -29263,9 +29382,9 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,137,193                          // mov           %rax,%r9
   .byte  77,133,201                          // test          %r9,%r9
-  .byte  116,5                               // je            33ad <_sk_gather_i8_sse41+0xf>
+  .byte  116,5                               // je            33d5 <_sk_gather_i8_sse41+0xf>
   .byte  76,137,200                          // mov           %r9,%rax
-  .byte  235,2                               // jmp           33af <_sk_gather_i8_sse41+0x11>
+  .byte  235,2                               // jmp           33d7 <_sk_gather_i8_sse41+0x11>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,86                               // push          %r14
   .byte  83                                  // push          %rbx
@@ -29298,17 +29417,17 @@
   .byte  102,15,58,34,28,24,1                // pinsrd        $0x1,(%rax,%rbx,1),%xmm3
   .byte  102,66,15,58,34,28,152,2            // pinsrd        $0x2,(%rax,%r11,4),%xmm3
   .byte  102,66,15,58,34,28,16,3             // pinsrd        $0x3,(%rax,%r10,1),%xmm3
-  .byte  102,15,111,5,46,51,0,0              // movdqa        0x332e(%rip),%xmm0        # 6780 <_sk_callback_sse41+0xc57>
+  .byte  102,15,111,5,86,51,0,0              // movdqa        0x3356(%rip),%xmm0        # 67d0 <_sk_callback_sse41+0xc7f>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,47,51,0,0                // movaps        0x332f(%rip),%xmm8        # 6790 <_sk_callback_sse41+0xc67>
+  .byte  68,15,40,5,87,51,0,0                // movaps        0x3357(%rip),%xmm8        # 67e0 <_sk_callback_sse41+0xc8f>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
-  .byte  102,15,56,0,13,46,51,0,0            // pshufb        0x332e(%rip),%xmm1        # 67a0 <_sk_callback_sse41+0xc77>
+  .byte  102,15,56,0,13,86,51,0,0            // pshufb        0x3356(%rip),%xmm1        # 67f0 <_sk_callback_sse41+0xc9f>
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,111,211                      // movdqa        %xmm3,%xmm2
-  .byte  102,15,56,0,21,42,51,0,0            // pshufb        0x332a(%rip),%xmm2        # 67b0 <_sk_callback_sse41+0xc87>
+  .byte  102,15,56,0,21,82,51,0,0            // pshufb        0x3352(%rip),%xmm2        # 6800 <_sk_callback_sse41+0xcaf>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
@@ -29326,41 +29445,41 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,80                              // jne           34fa <_sk_load_565_sse41+0x5a>
+  .byte  117,80                              // jne           3522 <_sk_load_565_sse41+0x5a>
   .byte  102,65,15,56,51,20,82               // pmovzxwd      (%r10,%rdx,2),%xmm2
-  .byte  102,15,111,5,7,51,0,0               // movdqa        0x3307(%rip),%xmm0        # 67c0 <_sk_callback_sse41+0xc97>
+  .byte  102,15,111,5,47,51,0,0              // movdqa        0x332f(%rip),%xmm0        # 6810 <_sk_callback_sse41+0xcbf>
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,9,51,0,0                    // mulps         0x3309(%rip),%xmm0        # 67d0 <_sk_callback_sse41+0xca7>
-  .byte  102,15,111,13,17,51,0,0             // movdqa        0x3311(%rip),%xmm1        # 67e0 <_sk_callback_sse41+0xcb7>
+  .byte  15,89,5,49,51,0,0                   // mulps         0x3331(%rip),%xmm0        # 6820 <_sk_callback_sse41+0xccf>
+  .byte  102,15,111,13,57,51,0,0             // movdqa        0x3339(%rip),%xmm1        # 6830 <_sk_callback_sse41+0xcdf>
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,19,51,0,0                  // mulps         0x3313(%rip),%xmm1        # 67f0 <_sk_callback_sse41+0xcc7>
-  .byte  102,15,219,21,27,51,0,0             // pand          0x331b(%rip),%xmm2        # 6800 <_sk_callback_sse41+0xcd7>
+  .byte  15,89,13,59,51,0,0                  // mulps         0x333b(%rip),%xmm1        # 6840 <_sk_callback_sse41+0xcef>
+  .byte  102,15,219,21,67,51,0,0             // pand          0x3343(%rip),%xmm2        # 6850 <_sk_callback_sse41+0xcff>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,33,51,0,0                  // mulps         0x3321(%rip),%xmm2        # 6810 <_sk_callback_sse41+0xce7>
+  .byte  15,89,21,73,51,0,0                  // mulps         0x3349(%rip),%xmm2        # 6860 <_sk_callback_sse41+0xd0f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,40,51,0,0                  // movaps        0x3328(%rip),%xmm3        # 6820 <_sk_callback_sse41+0xcf7>
+  .byte  15,40,29,80,51,0,0                  // movaps        0x3350(%rip),%xmm3        # 6870 <_sk_callback_sse41+0xd1f>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            353c <_sk_load_565_sse41+0x9c>
+  .byte  116,53                              // je            3564 <_sk_load_565_sse41+0x9c>
   .byte  102,15,239,210                      // pxor          %xmm2,%xmm2
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3526 <_sk_load_565_sse41+0x86>
+  .byte  116,21                              // je            354e <_sk_load_565_sse41+0x86>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,154                             // jne           34b1 <_sk_load_565_sse41+0x11>
+  .byte  117,154                             // jne           34d9 <_sk_load_565_sse41+0x11>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,208,69                   // pshufd        $0x45,%xmm0,%xmm2
   .byte  102,65,15,110,4,82                  // movd          (%r10,%rdx,2),%xmm0
   .byte  102,15,56,51,192                    // pmovzxwd      %xmm0,%xmm0
   .byte  102,15,58,14,208,15                 // pblendw       $0xf,%xmm0,%xmm2
-  .byte  233,117,255,255,255                 // jmpq          34b1 <_sk_load_565_sse41+0x11>
+  .byte  233,117,255,255,255                 // jmpq          34d9 <_sk_load_565_sse41+0x11>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,208                      // movd          %eax,%xmm2
-  .byte  233,103,255,255,255                 // jmpq          34b1 <_sk_load_565_sse41+0x11>
+  .byte  233,103,255,255,255                 // jmpq          34d9 <_sk_load_565_sse41+0x11>
 
 HIDDEN _sk_load_565_dst_sse41
 .globl _sk_load_565_dst_sse41
@@ -29369,41 +29488,41 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,80                              // jne           35a4 <_sk_load_565_dst_sse41+0x5a>
+  .byte  117,80                              // jne           35cc <_sk_load_565_dst_sse41+0x5a>
   .byte  102,65,15,56,51,52,82               // pmovzxwd      (%r10,%rdx,2),%xmm6
-  .byte  102,15,111,37,205,50,0,0            // movdqa        0x32cd(%rip),%xmm4        # 6830 <_sk_callback_sse41+0xd07>
+  .byte  102,15,111,37,245,50,0,0            // movdqa        0x32f5(%rip),%xmm4        # 6880 <_sk_callback_sse41+0xd2f>
   .byte  102,15,219,230                      // pand          %xmm6,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,37,207,50,0,0                 // mulps         0x32cf(%rip),%xmm4        # 6840 <_sk_callback_sse41+0xd17>
-  .byte  102,15,111,45,215,50,0,0            // movdqa        0x32d7(%rip),%xmm5        # 6850 <_sk_callback_sse41+0xd27>
+  .byte  15,89,37,247,50,0,0                 // mulps         0x32f7(%rip),%xmm4        # 6890 <_sk_callback_sse41+0xd3f>
+  .byte  102,15,111,45,255,50,0,0            // movdqa        0x32ff(%rip),%xmm5        # 68a0 <_sk_callback_sse41+0xd4f>
   .byte  102,15,219,238                      // pand          %xmm6,%xmm5
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
-  .byte  15,89,45,217,50,0,0                 // mulps         0x32d9(%rip),%xmm5        # 6860 <_sk_callback_sse41+0xd37>
-  .byte  102,15,219,53,225,50,0,0            // pand          0x32e1(%rip),%xmm6        # 6870 <_sk_callback_sse41+0xd47>
+  .byte  15,89,45,1,51,0,0                   // mulps         0x3301(%rip),%xmm5        # 68b0 <_sk_callback_sse41+0xd5f>
+  .byte  102,15,219,53,9,51,0,0              // pand          0x3309(%rip),%xmm6        # 68c0 <_sk_callback_sse41+0xd6f>
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,53,231,50,0,0                 // mulps         0x32e7(%rip),%xmm6        # 6880 <_sk_callback_sse41+0xd57>
+  .byte  15,89,53,15,51,0,0                  // mulps         0x330f(%rip),%xmm6        # 68d0 <_sk_callback_sse41+0xd7f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,61,238,50,0,0                 // movaps        0x32ee(%rip),%xmm7        # 6890 <_sk_callback_sse41+0xd67>
+  .byte  15,40,61,22,51,0,0                  // movaps        0x3316(%rip),%xmm7        # 68e0 <_sk_callback_sse41+0xd8f>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            35e6 <_sk_load_565_dst_sse41+0x9c>
+  .byte  116,53                              // je            360e <_sk_load_565_dst_sse41+0x9c>
   .byte  102,15,239,246                      // pxor          %xmm6,%xmm6
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            35d0 <_sk_load_565_dst_sse41+0x86>
+  .byte  116,21                              // je            35f8 <_sk_load_565_dst_sse41+0x86>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,154                             // jne           355b <_sk_load_565_dst_sse41+0x11>
+  .byte  117,154                             // jne           3583 <_sk_load_565_dst_sse41+0x11>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,244,69                   // pshufd        $0x45,%xmm4,%xmm6
   .byte  102,65,15,110,36,82                 // movd          (%r10,%rdx,2),%xmm4
   .byte  102,15,56,51,228                    // pmovzxwd      %xmm4,%xmm4
   .byte  102,15,58,14,244,15                 // pblendw       $0xf,%xmm4,%xmm6
-  .byte  233,117,255,255,255                 // jmpq          355b <_sk_load_565_dst_sse41+0x11>
+  .byte  233,117,255,255,255                 // jmpq          3583 <_sk_load_565_dst_sse41+0x11>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,240                      // movd          %eax,%xmm6
-  .byte  233,103,255,255,255                 // jmpq          355b <_sk_load_565_dst_sse41+0x11>
+  .byte  233,103,255,255,255                 // jmpq          3583 <_sk_load_565_dst_sse41+0x11>
 
 HIDDEN _sk_gather_565_sse41
 .globl _sk_gather_565_sse41
@@ -29431,19 +29550,19 @@
   .byte  65,15,183,4,65                      // movzwl        (%r9,%rax,2),%eax
   .byte  102,15,196,192,3                    // pinsrw        $0x3,%eax,%xmm0
   .byte  102,15,56,51,208                    // pmovzxwd      %xmm0,%xmm2
-  .byte  102,15,111,5,66,50,0,0              // movdqa        0x3242(%rip),%xmm0        # 68a0 <_sk_callback_sse41+0xd77>
+  .byte  102,15,111,5,106,50,0,0             // movdqa        0x326a(%rip),%xmm0        # 68f0 <_sk_callback_sse41+0xd9f>
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,68,50,0,0                   // mulps         0x3244(%rip),%xmm0        # 68b0 <_sk_callback_sse41+0xd87>
-  .byte  102,15,111,13,76,50,0,0             // movdqa        0x324c(%rip),%xmm1        # 68c0 <_sk_callback_sse41+0xd97>
+  .byte  15,89,5,108,50,0,0                  // mulps         0x326c(%rip),%xmm0        # 6900 <_sk_callback_sse41+0xdaf>
+  .byte  102,15,111,13,116,50,0,0            // movdqa        0x3274(%rip),%xmm1        # 6910 <_sk_callback_sse41+0xdbf>
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,78,50,0,0                  // mulps         0x324e(%rip),%xmm1        # 68d0 <_sk_callback_sse41+0xda7>
-  .byte  102,15,219,21,86,50,0,0             // pand          0x3256(%rip),%xmm2        # 68e0 <_sk_callback_sse41+0xdb7>
+  .byte  15,89,13,118,50,0,0                 // mulps         0x3276(%rip),%xmm1        # 6920 <_sk_callback_sse41+0xdcf>
+  .byte  102,15,219,21,126,50,0,0            // pand          0x327e(%rip),%xmm2        # 6930 <_sk_callback_sse41+0xddf>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,92,50,0,0                  // mulps         0x325c(%rip),%xmm2        # 68f0 <_sk_callback_sse41+0xdc7>
+  .byte  15,89,21,132,50,0,0                 // mulps         0x3284(%rip),%xmm2        # 6940 <_sk_callback_sse41+0xdef>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,99,50,0,0                  // movaps        0x3263(%rip),%xmm3        # 6900 <_sk_callback_sse41+0xdd7>
+  .byte  15,40,29,139,50,0,0                 // movaps        0x328b(%rip),%xmm3        # 6950 <_sk_callback_sse41+0xdff>
   .byte  91                                  // pop           %rbx
   .byte  255,224                             // jmpq          *%rax
 
@@ -29453,12 +29572,12 @@
 _sk_store_565_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,99,50,0,0                // movaps        0x3263(%rip),%xmm8        # 6910 <_sk_callback_sse41+0xde7>
+  .byte  68,15,40,5,139,50,0,0               // movaps        0x328b(%rip),%xmm8        # 6960 <_sk_callback_sse41+0xe0f>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
   .byte  102,65,15,114,241,11                // pslld         $0xb,%xmm9
-  .byte  68,15,40,21,88,50,0,0               // movaps        0x3258(%rip),%xmm10        # 6920 <_sk_callback_sse41+0xdf7>
+  .byte  68,15,40,21,128,50,0,0              // movaps        0x3280(%rip),%xmm10        # 6970 <_sk_callback_sse41+0xe1f>
   .byte  68,15,89,209                        // mulps         %xmm1,%xmm10
   .byte  102,69,15,91,210                    // cvtps2dq      %xmm10,%xmm10
   .byte  102,65,15,114,242,5                 // pslld         $0x5,%xmm10
@@ -29468,7 +29587,7 @@
   .byte  102,69,15,86,194                    // orpd          %xmm10,%xmm8
   .byte  102,69,15,56,43,192                 // packusdw      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           36ff <_sk_store_565_sse41+0x5f>
+  .byte  117,10                              // jne           3727 <_sk_store_565_sse41+0x5f>
   .byte  242,68,15,17,4,80                   // movsd         %xmm8,(%rax,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -29476,17 +29595,17 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,35                              // je            3735 <_sk_store_565_sse41+0x95>
+  .byte  116,35                              // je            375d <_sk_store_565_sse41+0x95>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,15                              // je            3727 <_sk_store_565_sse41+0x87>
+  .byte  116,15                              // je            374f <_sk_store_565_sse41+0x87>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,221                             // jne           36fb <_sk_store_565_sse41+0x5b>
+  .byte  117,221                             // jne           3723 <_sk_store_565_sse41+0x5b>
   .byte  102,68,15,58,21,68,80,4,4           // pextrw        $0x4,%xmm8,0x4(%rax,%rdx,2)
   .byte  242,69,15,112,192,232               // pshuflw       $0xe8,%xmm8,%xmm8
   .byte  102,68,15,126,4,80                  // movd          %xmm8,(%rax,%rdx,2)
-  .byte  235,198                             // jmp           36fb <_sk_store_565_sse41+0x5b>
+  .byte  235,198                             // jmp           3723 <_sk_store_565_sse41+0x5b>
   .byte  102,68,15,58,21,4,80,0              // pextrw        $0x0,%xmm8,(%rax,%rdx,2)
-  .byte  235,188                             // jmp           36fb <_sk_store_565_sse41+0x5b>
+  .byte  235,188                             // jmp           3723 <_sk_store_565_sse41+0x5b>
 
 HIDDEN _sk_load_4444_sse41
 .globl _sk_load_4444_sse41
@@ -29495,44 +29614,44 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,95                              // jne           37a8 <_sk_load_4444_sse41+0x69>
+  .byte  117,95                              // jne           37d0 <_sk_load_4444_sse41+0x69>
   .byte  102,65,15,56,51,28,82               // pmovzxwd      (%r10,%rdx,2),%xmm3
-  .byte  102,15,111,5,216,49,0,0             // movdqa        0x31d8(%rip),%xmm0        # 6930 <_sk_callback_sse41+0xe07>
+  .byte  102,15,111,5,0,50,0,0               // movdqa        0x3200(%rip),%xmm0        # 6980 <_sk_callback_sse41+0xe2f>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,218,49,0,0                  // mulps         0x31da(%rip),%xmm0        # 6940 <_sk_callback_sse41+0xe17>
-  .byte  102,15,111,13,226,49,0,0            // movdqa        0x31e2(%rip),%xmm1        # 6950 <_sk_callback_sse41+0xe27>
+  .byte  15,89,5,2,50,0,0                    // mulps         0x3202(%rip),%xmm0        # 6990 <_sk_callback_sse41+0xe3f>
+  .byte  102,15,111,13,10,50,0,0             // movdqa        0x320a(%rip),%xmm1        # 69a0 <_sk_callback_sse41+0xe4f>
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,228,49,0,0                 // mulps         0x31e4(%rip),%xmm1        # 6960 <_sk_callback_sse41+0xe37>
-  .byte  102,15,111,21,236,49,0,0            // movdqa        0x31ec(%rip),%xmm2        # 6970 <_sk_callback_sse41+0xe47>
+  .byte  15,89,13,12,50,0,0                  // mulps         0x320c(%rip),%xmm1        # 69b0 <_sk_callback_sse41+0xe5f>
+  .byte  102,15,111,21,20,50,0,0             // movdqa        0x3214(%rip),%xmm2        # 69c0 <_sk_callback_sse41+0xe6f>
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,238,49,0,0                 // mulps         0x31ee(%rip),%xmm2        # 6980 <_sk_callback_sse41+0xe57>
-  .byte  102,15,219,29,246,49,0,0            // pand          0x31f6(%rip),%xmm3        # 6990 <_sk_callback_sse41+0xe67>
+  .byte  15,89,21,22,50,0,0                  // mulps         0x3216(%rip),%xmm2        # 69d0 <_sk_callback_sse41+0xe7f>
+  .byte  102,15,219,29,30,50,0,0             // pand          0x321e(%rip),%xmm3        # 69e0 <_sk_callback_sse41+0xe8f>
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,252,49,0,0                 // mulps         0x31fc(%rip),%xmm3        # 69a0 <_sk_callback_sse41+0xe77>
+  .byte  15,89,29,36,50,0,0                  // mulps         0x3224(%rip),%xmm3        # 69f0 <_sk_callback_sse41+0xe9f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            37ea <_sk_load_4444_sse41+0xab>
+  .byte  116,53                              // je            3812 <_sk_load_4444_sse41+0xab>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            37d4 <_sk_load_4444_sse41+0x95>
+  .byte  116,21                              // je            37fc <_sk_load_4444_sse41+0x95>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,139                             // jne           3750 <_sk_load_4444_sse41+0x11>
+  .byte  117,139                             // jne           3778 <_sk_load_4444_sse41+0x11>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,216,69                   // pshufd        $0x45,%xmm0,%xmm3
   .byte  102,65,15,110,4,82                  // movd          (%r10,%rdx,2),%xmm0
   .byte  102,15,56,51,192                    // pmovzxwd      %xmm0,%xmm0
   .byte  102,15,58,14,216,15                 // pblendw       $0xf,%xmm0,%xmm3
-  .byte  233,102,255,255,255                 // jmpq          3750 <_sk_load_4444_sse41+0x11>
+  .byte  233,102,255,255,255                 // jmpq          3778 <_sk_load_4444_sse41+0x11>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,216                      // movd          %eax,%xmm3
-  .byte  233,88,255,255,255                  // jmpq          3750 <_sk_load_4444_sse41+0x11>
+  .byte  233,88,255,255,255                  // jmpq          3778 <_sk_load_4444_sse41+0x11>
 
 HIDDEN _sk_load_4444_dst_sse41
 .globl _sk_load_4444_dst_sse41
@@ -29541,44 +29660,44 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,95                              // jne           3861 <_sk_load_4444_dst_sse41+0x69>
+  .byte  117,95                              // jne           3889 <_sk_load_4444_dst_sse41+0x69>
   .byte  102,65,15,56,51,60,82               // pmovzxwd      (%r10,%rdx,2),%xmm7
-  .byte  102,15,111,37,159,49,0,0            // movdqa        0x319f(%rip),%xmm4        # 69b0 <_sk_callback_sse41+0xe87>
+  .byte  102,15,111,37,199,49,0,0            // movdqa        0x31c7(%rip),%xmm4        # 6a00 <_sk_callback_sse41+0xeaf>
   .byte  102,15,219,231                      // pand          %xmm7,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,37,161,49,0,0                 // mulps         0x31a1(%rip),%xmm4        # 69c0 <_sk_callback_sse41+0xe97>
-  .byte  102,15,111,45,169,49,0,0            // movdqa        0x31a9(%rip),%xmm5        # 69d0 <_sk_callback_sse41+0xea7>
+  .byte  15,89,37,201,49,0,0                 // mulps         0x31c9(%rip),%xmm4        # 6a10 <_sk_callback_sse41+0xebf>
+  .byte  102,15,111,45,209,49,0,0            // movdqa        0x31d1(%rip),%xmm5        # 6a20 <_sk_callback_sse41+0xecf>
   .byte  102,15,219,239                      // pand          %xmm7,%xmm5
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
-  .byte  15,89,45,171,49,0,0                 // mulps         0x31ab(%rip),%xmm5        # 69e0 <_sk_callback_sse41+0xeb7>
-  .byte  102,15,111,53,179,49,0,0            // movdqa        0x31b3(%rip),%xmm6        # 69f0 <_sk_callback_sse41+0xec7>
+  .byte  15,89,45,211,49,0,0                 // mulps         0x31d3(%rip),%xmm5        # 6a30 <_sk_callback_sse41+0xedf>
+  .byte  102,15,111,53,219,49,0,0            // movdqa        0x31db(%rip),%xmm6        # 6a40 <_sk_callback_sse41+0xeef>
   .byte  102,15,219,247                      // pand          %xmm7,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,53,181,49,0,0                 // mulps         0x31b5(%rip),%xmm6        # 6a00 <_sk_callback_sse41+0xed7>
-  .byte  102,15,219,61,189,49,0,0            // pand          0x31bd(%rip),%xmm7        # 6a10 <_sk_callback_sse41+0xee7>
+  .byte  15,89,53,221,49,0,0                 // mulps         0x31dd(%rip),%xmm6        # 6a50 <_sk_callback_sse41+0xeff>
+  .byte  102,15,219,61,229,49,0,0            // pand          0x31e5(%rip),%xmm7        # 6a60 <_sk_callback_sse41+0xf0f>
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
-  .byte  15,89,61,195,49,0,0                 // mulps         0x31c3(%rip),%xmm7        # 6a20 <_sk_callback_sse41+0xef7>
+  .byte  15,89,61,235,49,0,0                 // mulps         0x31eb(%rip),%xmm7        # 6a70 <_sk_callback_sse41+0xf1f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,53                              // je            38a3 <_sk_load_4444_dst_sse41+0xab>
+  .byte  116,53                              // je            38cb <_sk_load_4444_dst_sse41+0xab>
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            388d <_sk_load_4444_dst_sse41+0x95>
+  .byte  116,21                              // je            38b5 <_sk_load_4444_dst_sse41+0x95>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,139                             // jne           3809 <_sk_load_4444_dst_sse41+0x11>
+  .byte  117,139                             // jne           3831 <_sk_load_4444_dst_sse41+0x11>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
   .byte  102,65,15,110,36,82                 // movd          (%r10,%rdx,2),%xmm4
   .byte  102,15,56,51,228                    // pmovzxwd      %xmm4,%xmm4
   .byte  102,15,58,14,252,15                 // pblendw       $0xf,%xmm4,%xmm7
-  .byte  233,102,255,255,255                 // jmpq          3809 <_sk_load_4444_dst_sse41+0x11>
+  .byte  233,102,255,255,255                 // jmpq          3831 <_sk_load_4444_dst_sse41+0x11>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,248                      // movd          %eax,%xmm7
-  .byte  233,88,255,255,255                  // jmpq          3809 <_sk_load_4444_dst_sse41+0x11>
+  .byte  233,88,255,255,255                  // jmpq          3831 <_sk_load_4444_dst_sse41+0x11>
 
 HIDDEN _sk_gather_4444_sse41
 .globl _sk_gather_4444_sse41
@@ -29606,21 +29725,21 @@
   .byte  65,15,183,4,65                      // movzwl        (%r9,%rax,2),%eax
   .byte  102,15,196,192,3                    // pinsrw        $0x3,%eax,%xmm0
   .byte  102,15,56,51,216                    // pmovzxwd      %xmm0,%xmm3
-  .byte  102,15,111,5,21,49,0,0              // movdqa        0x3115(%rip),%xmm0        # 6a30 <_sk_callback_sse41+0xf07>
+  .byte  102,15,111,5,61,49,0,0              // movdqa        0x313d(%rip),%xmm0        # 6a80 <_sk_callback_sse41+0xf2f>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,23,49,0,0                   // mulps         0x3117(%rip),%xmm0        # 6a40 <_sk_callback_sse41+0xf17>
-  .byte  102,15,111,13,31,49,0,0             // movdqa        0x311f(%rip),%xmm1        # 6a50 <_sk_callback_sse41+0xf27>
+  .byte  15,89,5,63,49,0,0                   // mulps         0x313f(%rip),%xmm0        # 6a90 <_sk_callback_sse41+0xf3f>
+  .byte  102,15,111,13,71,49,0,0             // movdqa        0x3147(%rip),%xmm1        # 6aa0 <_sk_callback_sse41+0xf4f>
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,33,49,0,0                  // mulps         0x3121(%rip),%xmm1        # 6a60 <_sk_callback_sse41+0xf37>
-  .byte  102,15,111,21,41,49,0,0             // movdqa        0x3129(%rip),%xmm2        # 6a70 <_sk_callback_sse41+0xf47>
+  .byte  15,89,13,73,49,0,0                  // mulps         0x3149(%rip),%xmm1        # 6ab0 <_sk_callback_sse41+0xf5f>
+  .byte  102,15,111,21,81,49,0,0             // movdqa        0x3151(%rip),%xmm2        # 6ac0 <_sk_callback_sse41+0xf6f>
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,43,49,0,0                  // mulps         0x312b(%rip),%xmm2        # 6a80 <_sk_callback_sse41+0xf57>
-  .byte  102,15,219,29,51,49,0,0             // pand          0x3133(%rip),%xmm3        # 6a90 <_sk_callback_sse41+0xf67>
+  .byte  15,89,21,83,49,0,0                  // mulps         0x3153(%rip),%xmm2        # 6ad0 <_sk_callback_sse41+0xf7f>
+  .byte  102,15,219,29,91,49,0,0             // pand          0x315b(%rip),%xmm3        # 6ae0 <_sk_callback_sse41+0xf8f>
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,57,49,0,0                  // mulps         0x3139(%rip),%xmm3        # 6aa0 <_sk_callback_sse41+0xf77>
+  .byte  15,89,29,97,49,0,0                  // mulps         0x3161(%rip),%xmm3        # 6af0 <_sk_callback_sse41+0xf9f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
   .byte  255,224                             // jmpq          *%rax
@@ -29631,7 +29750,7 @@
 _sk_store_4444_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,55,49,0,0                // movaps        0x3137(%rip),%xmm8        # 6ab0 <_sk_callback_sse41+0xf87>
+  .byte  68,15,40,5,95,49,0,0                // movaps        0x315f(%rip),%xmm8        # 6b00 <_sk_callback_sse41+0xfaf>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -29651,7 +29770,7 @@
   .byte  102,69,15,86,194                    // orpd          %xmm10,%xmm8
   .byte  102,69,15,56,43,192                 // packusdw      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           39df <_sk_store_4444_sse41+0x73>
+  .byte  117,10                              // jne           3a07 <_sk_store_4444_sse41+0x73>
   .byte  242,68,15,17,4,80                   // movsd         %xmm8,(%rax,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -29659,17 +29778,17 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,35                              // je            3a15 <_sk_store_4444_sse41+0xa9>
+  .byte  116,35                              // je            3a3d <_sk_store_4444_sse41+0xa9>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,15                              // je            3a07 <_sk_store_4444_sse41+0x9b>
+  .byte  116,15                              // je            3a2f <_sk_store_4444_sse41+0x9b>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,221                             // jne           39db <_sk_store_4444_sse41+0x6f>
+  .byte  117,221                             // jne           3a03 <_sk_store_4444_sse41+0x6f>
   .byte  102,68,15,58,21,68,80,4,4           // pextrw        $0x4,%xmm8,0x4(%rax,%rdx,2)
   .byte  242,69,15,112,192,232               // pshuflw       $0xe8,%xmm8,%xmm8
   .byte  102,68,15,126,4,80                  // movd          %xmm8,(%rax,%rdx,2)
-  .byte  235,198                             // jmp           39db <_sk_store_4444_sse41+0x6f>
+  .byte  235,198                             // jmp           3a03 <_sk_store_4444_sse41+0x6f>
   .byte  102,68,15,58,21,4,80,0              // pextrw        $0x0,%xmm8,(%rax,%rdx,2)
-  .byte  235,188                             // jmp           39db <_sk_store_4444_sse41+0x6f>
+  .byte  235,188                             // jmp           3a03 <_sk_store_4444_sse41+0x6f>
 
 HIDDEN _sk_load_8888_sse41
 .globl _sk_load_8888_sse41
@@ -29678,19 +29797,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,88                              // jne           3a81 <_sk_load_8888_sse41+0x62>
+  .byte  117,88                              // jne           3aa9 <_sk_load_8888_sse41+0x62>
   .byte  243,15,111,28,144                   // movdqu        (%rax,%rdx,4),%xmm3
-  .byte  102,15,111,5,138,48,0,0             // movdqa        0x308a(%rip),%xmm0        # 6ac0 <_sk_callback_sse41+0xf97>
+  .byte  102,15,111,5,178,48,0,0             // movdqa        0x30b2(%rip),%xmm0        # 6b10 <_sk_callback_sse41+0xfbf>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,139,48,0,0               // movaps        0x308b(%rip),%xmm8        # 6ad0 <_sk_callback_sse41+0xfa7>
+  .byte  68,15,40,5,179,48,0,0               // movaps        0x30b3(%rip),%xmm8        # 6b20 <_sk_callback_sse41+0xfcf>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
-  .byte  102,15,56,0,13,138,48,0,0           // pshufb        0x308a(%rip),%xmm1        # 6ae0 <_sk_callback_sse41+0xfb7>
+  .byte  102,15,56,0,13,178,48,0,0           // pshufb        0x30b2(%rip),%xmm1        # 6b30 <_sk_callback_sse41+0xfdf>
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,111,211                      // movdqa        %xmm3,%xmm2
-  .byte  102,15,56,0,21,134,48,0,0           // pshufb        0x3086(%rip),%xmm2        # 6af0 <_sk_callback_sse41+0xfc7>
+  .byte  102,15,56,0,21,174,48,0,0           // pshufb        0x30ae(%rip),%xmm2        # 6b40 <_sk_callback_sse41+0xfef>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
@@ -29701,19 +29820,19 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,43                              // je            3ab9 <_sk_load_8888_sse41+0x9a>
+  .byte  116,43                              // je            3ae1 <_sk_load_8888_sse41+0x9a>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,17                              // je            3aa9 <_sk_load_8888_sse41+0x8a>
+  .byte  116,17                              // je            3ad1 <_sk_load_8888_sse41+0x8a>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,144                             // jne           3a2e <_sk_load_8888_sse41+0xf>
+  .byte  117,144                             // jne           3a56 <_sk_load_8888_sse41+0xf>
   .byte  102,15,110,68,144,8                 // movd          0x8(%rax,%rdx,4),%xmm0
   .byte  102,15,112,216,69                   // pshufd        $0x45,%xmm0,%xmm3
   .byte  243,15,126,4,144                    // movq          (%rax,%rdx,4),%xmm0
   .byte  102,15,58,14,216,15                 // pblendw       $0xf,%xmm0,%xmm3
-  .byte  233,117,255,255,255                 // jmpq          3a2e <_sk_load_8888_sse41+0xf>
+  .byte  233,117,255,255,255                 // jmpq          3a56 <_sk_load_8888_sse41+0xf>
   .byte  102,15,110,28,144                   // movd          (%rax,%rdx,4),%xmm3
-  .byte  233,107,255,255,255                 // jmpq          3a2e <_sk_load_8888_sse41+0xf>
+  .byte  233,107,255,255,255                 // jmpq          3a56 <_sk_load_8888_sse41+0xf>
 
 HIDDEN _sk_load_8888_dst_sse41
 .globl _sk_load_8888_dst_sse41
@@ -29722,19 +29841,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,88                              // jne           3b25 <_sk_load_8888_dst_sse41+0x62>
+  .byte  117,88                              // jne           3b4d <_sk_load_8888_dst_sse41+0x62>
   .byte  243,15,111,60,144                   // movdqu        (%rax,%rdx,4),%xmm7
-  .byte  102,15,111,37,38,48,0,0             // movdqa        0x3026(%rip),%xmm4        # 6b00 <_sk_callback_sse41+0xfd7>
+  .byte  102,15,111,37,78,48,0,0             // movdqa        0x304e(%rip),%xmm4        # 6b50 <_sk_callback_sse41+0xfff>
   .byte  102,15,219,231                      // pand          %xmm7,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  68,15,40,5,39,48,0,0                // movaps        0x3027(%rip),%xmm8        # 6b10 <_sk_callback_sse41+0xfe7>
+  .byte  68,15,40,5,79,48,0,0                // movaps        0x304f(%rip),%xmm8        # 6b60 <_sk_callback_sse41+0x100f>
   .byte  65,15,89,224                        // mulps         %xmm8,%xmm4
   .byte  102,15,111,239                      // movdqa        %xmm7,%xmm5
-  .byte  102,15,56,0,45,38,48,0,0            // pshufb        0x3026(%rip),%xmm5        # 6b20 <_sk_callback_sse41+0xff7>
+  .byte  102,15,56,0,45,78,48,0,0            // pshufb        0x304e(%rip),%xmm5        # 6b70 <_sk_callback_sse41+0x101f>
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
   .byte  65,15,89,232                        // mulps         %xmm8,%xmm5
   .byte  102,15,111,247                      // movdqa        %xmm7,%xmm6
-  .byte  102,15,56,0,53,34,48,0,0            // pshufb        0x3022(%rip),%xmm6        # 6b30 <_sk_callback_sse41+0x1007>
+  .byte  102,15,56,0,53,74,48,0,0            // pshufb        0x304a(%rip),%xmm6        # 6b80 <_sk_callback_sse41+0x102f>
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
   .byte  65,15,89,240                        // mulps         %xmm8,%xmm6
   .byte  102,15,114,215,24                   // psrld         $0x18,%xmm7
@@ -29745,19 +29864,19 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,43                              // je            3b5d <_sk_load_8888_dst_sse41+0x9a>
+  .byte  116,43                              // je            3b85 <_sk_load_8888_dst_sse41+0x9a>
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,17                              // je            3b4d <_sk_load_8888_dst_sse41+0x8a>
+  .byte  116,17                              // je            3b75 <_sk_load_8888_dst_sse41+0x8a>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,144                             // jne           3ad2 <_sk_load_8888_dst_sse41+0xf>
+  .byte  117,144                             // jne           3afa <_sk_load_8888_dst_sse41+0xf>
   .byte  102,15,110,100,144,8                // movd          0x8(%rax,%rdx,4),%xmm4
   .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
   .byte  243,15,126,36,144                   // movq          (%rax,%rdx,4),%xmm4
   .byte  102,15,58,14,252,15                 // pblendw       $0xf,%xmm4,%xmm7
-  .byte  233,117,255,255,255                 // jmpq          3ad2 <_sk_load_8888_dst_sse41+0xf>
+  .byte  233,117,255,255,255                 // jmpq          3afa <_sk_load_8888_dst_sse41+0xf>
   .byte  102,15,110,60,144                   // movd          (%rax,%rdx,4),%xmm7
-  .byte  233,107,255,255,255                 // jmpq          3ad2 <_sk_load_8888_dst_sse41+0xf>
+  .byte  233,107,255,255,255                 // jmpq          3afa <_sk_load_8888_dst_sse41+0xf>
 
 HIDDEN _sk_gather_8888_sse41
 .globl _sk_gather_8888_sse41
@@ -29782,17 +29901,17 @@
   .byte  102,65,15,58,34,28,129,1            // pinsrd        $0x1,(%r9,%rax,4),%xmm3
   .byte  102,65,15,58,34,28,153,2            // pinsrd        $0x2,(%r9,%rbx,4),%xmm3
   .byte  102,67,15,58,34,28,153,3            // pinsrd        $0x3,(%r9,%r11,4),%xmm3
-  .byte  102,15,111,5,120,47,0,0             // movdqa        0x2f78(%rip),%xmm0        # 6b40 <_sk_callback_sse41+0x1017>
+  .byte  102,15,111,5,160,47,0,0             // movdqa        0x2fa0(%rip),%xmm0        # 6b90 <_sk_callback_sse41+0x103f>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,121,47,0,0               // movaps        0x2f79(%rip),%xmm8        # 6b50 <_sk_callback_sse41+0x1027>
+  .byte  68,15,40,5,161,47,0,0               // movaps        0x2fa1(%rip),%xmm8        # 6ba0 <_sk_callback_sse41+0x104f>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
-  .byte  102,15,56,0,13,120,47,0,0           // pshufb        0x2f78(%rip),%xmm1        # 6b60 <_sk_callback_sse41+0x1037>
+  .byte  102,15,56,0,13,160,47,0,0           // pshufb        0x2fa0(%rip),%xmm1        # 6bb0 <_sk_callback_sse41+0x105f>
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,111,211                      // movdqa        %xmm3,%xmm2
-  .byte  102,15,56,0,21,116,47,0,0           // pshufb        0x2f74(%rip),%xmm2        # 6b70 <_sk_callback_sse41+0x1047>
+  .byte  102,15,56,0,21,156,47,0,0           // pshufb        0x2f9c(%rip),%xmm2        # 6bc0 <_sk_callback_sse41+0x106f>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
@@ -29808,7 +29927,7 @@
 _sk_store_8888_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,95,47,0,0                // movaps        0x2f5f(%rip),%xmm8        # 6b80 <_sk_callback_sse41+0x1057>
+  .byte  68,15,40,5,135,47,0,0               // movaps        0x2f87(%rip),%xmm8        # 6bd0 <_sk_callback_sse41+0x107f>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -29827,23 +29946,23 @@
   .byte  102,69,15,235,193                   // por           %xmm9,%xmm8
   .byte  102,69,15,235,194                   // por           %xmm10,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           3c81 <_sk_store_8888_sse41+0x6d>
+  .byte  117,10                              // jne           3ca9 <_sk_store_8888_sse41+0x6d>
   .byte  243,68,15,127,4,144                 // movdqu        %xmm8,(%rax,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,29                              // je            3cab <_sk_store_8888_sse41+0x97>
+  .byte  116,29                              // je            3cd3 <_sk_store_8888_sse41+0x97>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,15                              // je            3ca3 <_sk_store_8888_sse41+0x8f>
+  .byte  116,15                              // je            3ccb <_sk_store_8888_sse41+0x8f>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,227                             // jne           3c7d <_sk_store_8888_sse41+0x69>
+  .byte  117,227                             // jne           3ca5 <_sk_store_8888_sse41+0x69>
   .byte  102,68,15,58,22,68,144,8,2          // pextrd        $0x2,%xmm8,0x8(%rax,%rdx,4)
   .byte  102,68,15,214,4,144                 // movq          %xmm8,(%rax,%rdx,4)
-  .byte  235,210                             // jmp           3c7d <_sk_store_8888_sse41+0x69>
+  .byte  235,210                             // jmp           3ca5 <_sk_store_8888_sse41+0x69>
   .byte  102,68,15,126,4,144                 // movd          %xmm8,(%rax,%rdx,4)
-  .byte  235,202                             // jmp           3c7d <_sk_store_8888_sse41+0x69>
+  .byte  235,202                             // jmp           3ca5 <_sk_store_8888_sse41+0x69>
 
 HIDDEN _sk_load_bgra_sse41
 .globl _sk_load_bgra_sse41
@@ -29852,19 +29971,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,88                              // jne           3d15 <_sk_load_bgra_sse41+0x62>
+  .byte  117,88                              // jne           3d3d <_sk_load_bgra_sse41+0x62>
   .byte  243,15,111,28,144                   // movdqu        (%rax,%rdx,4),%xmm3
-  .byte  102,15,111,5,198,46,0,0             // movdqa        0x2ec6(%rip),%xmm0        # 6b90 <_sk_callback_sse41+0x1067>
+  .byte  102,15,111,5,238,46,0,0             // movdqa        0x2eee(%rip),%xmm0        # 6be0 <_sk_callback_sse41+0x108f>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,208                           // cvtdq2ps      %xmm0,%xmm2
-  .byte  68,15,40,5,199,46,0,0               // movaps        0x2ec7(%rip),%xmm8        # 6ba0 <_sk_callback_sse41+0x1077>
+  .byte  68,15,40,5,239,46,0,0               // movaps        0x2eef(%rip),%xmm8        # 6bf0 <_sk_callback_sse41+0x109f>
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
-  .byte  102,15,56,0,5,198,46,0,0            // pshufb        0x2ec6(%rip),%xmm0        # 6bb0 <_sk_callback_sse41+0x1087>
+  .byte  102,15,56,0,5,238,46,0,0            // pshufb        0x2eee(%rip),%xmm0        # 6c00 <_sk_callback_sse41+0x10af>
   .byte  15,91,200                           // cvtdq2ps      %xmm0,%xmm1
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
-  .byte  102,15,56,0,5,194,46,0,0            // pshufb        0x2ec2(%rip),%xmm0        # 6bc0 <_sk_callback_sse41+0x1097>
+  .byte  102,15,56,0,5,234,46,0,0            // pshufb        0x2eea(%rip),%xmm0        # 6c10 <_sk_callback_sse41+0x10bf>
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
@@ -29875,19 +29994,19 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,43                              // je            3d4d <_sk_load_bgra_sse41+0x9a>
+  .byte  116,43                              // je            3d75 <_sk_load_bgra_sse41+0x9a>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,17                              // je            3d3d <_sk_load_bgra_sse41+0x8a>
+  .byte  116,17                              // je            3d65 <_sk_load_bgra_sse41+0x8a>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,144                             // jne           3cc2 <_sk_load_bgra_sse41+0xf>
+  .byte  117,144                             // jne           3cea <_sk_load_bgra_sse41+0xf>
   .byte  102,15,110,68,144,8                 // movd          0x8(%rax,%rdx,4),%xmm0
   .byte  102,15,112,216,69                   // pshufd        $0x45,%xmm0,%xmm3
   .byte  243,15,126,4,144                    // movq          (%rax,%rdx,4),%xmm0
   .byte  102,15,58,14,216,15                 // pblendw       $0xf,%xmm0,%xmm3
-  .byte  233,117,255,255,255                 // jmpq          3cc2 <_sk_load_bgra_sse41+0xf>
+  .byte  233,117,255,255,255                 // jmpq          3cea <_sk_load_bgra_sse41+0xf>
   .byte  102,15,110,28,144                   // movd          (%rax,%rdx,4),%xmm3
-  .byte  233,107,255,255,255                 // jmpq          3cc2 <_sk_load_bgra_sse41+0xf>
+  .byte  233,107,255,255,255                 // jmpq          3cea <_sk_load_bgra_sse41+0xf>
 
 HIDDEN _sk_load_bgra_dst_sse41
 .globl _sk_load_bgra_dst_sse41
@@ -29896,19 +30015,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,88                              // jne           3db9 <_sk_load_bgra_dst_sse41+0x62>
+  .byte  117,88                              // jne           3de1 <_sk_load_bgra_dst_sse41+0x62>
   .byte  243,15,111,60,144                   // movdqu        (%rax,%rdx,4),%xmm7
-  .byte  102,15,111,37,98,46,0,0             // movdqa        0x2e62(%rip),%xmm4        # 6bd0 <_sk_callback_sse41+0x10a7>
+  .byte  102,15,111,37,138,46,0,0            // movdqa        0x2e8a(%rip),%xmm4        # 6c20 <_sk_callback_sse41+0x10cf>
   .byte  102,15,219,231                      // pand          %xmm7,%xmm4
   .byte  15,91,244                           // cvtdq2ps      %xmm4,%xmm6
-  .byte  68,15,40,5,99,46,0,0                // movaps        0x2e63(%rip),%xmm8        # 6be0 <_sk_callback_sse41+0x10b7>
+  .byte  68,15,40,5,139,46,0,0               // movaps        0x2e8b(%rip),%xmm8        # 6c30 <_sk_callback_sse41+0x10df>
   .byte  65,15,89,240                        // mulps         %xmm8,%xmm6
   .byte  102,15,111,231                      // movdqa        %xmm7,%xmm4
-  .byte  102,15,56,0,37,98,46,0,0            // pshufb        0x2e62(%rip),%xmm4        # 6bf0 <_sk_callback_sse41+0x10c7>
+  .byte  102,15,56,0,37,138,46,0,0           // pshufb        0x2e8a(%rip),%xmm4        # 6c40 <_sk_callback_sse41+0x10ef>
   .byte  15,91,236                           // cvtdq2ps      %xmm4,%xmm5
   .byte  65,15,89,232                        // mulps         %xmm8,%xmm5
   .byte  102,15,111,231                      // movdqa        %xmm7,%xmm4
-  .byte  102,15,56,0,37,94,46,0,0            // pshufb        0x2e5e(%rip),%xmm4        # 6c00 <_sk_callback_sse41+0x10d7>
+  .byte  102,15,56,0,37,134,46,0,0           // pshufb        0x2e86(%rip),%xmm4        # 6c50 <_sk_callback_sse41+0x10ff>
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
   .byte  65,15,89,224                        // mulps         %xmm8,%xmm4
   .byte  102,15,114,215,24                   // psrld         $0x18,%xmm7
@@ -29919,19 +30038,19 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,43                              // je            3df1 <_sk_load_bgra_dst_sse41+0x9a>
+  .byte  116,43                              // je            3e19 <_sk_load_bgra_dst_sse41+0x9a>
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,17                              // je            3de1 <_sk_load_bgra_dst_sse41+0x8a>
+  .byte  116,17                              // je            3e09 <_sk_load_bgra_dst_sse41+0x8a>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,144                             // jne           3d66 <_sk_load_bgra_dst_sse41+0xf>
+  .byte  117,144                             // jne           3d8e <_sk_load_bgra_dst_sse41+0xf>
   .byte  102,15,110,100,144,8                // movd          0x8(%rax,%rdx,4),%xmm4
   .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
   .byte  243,15,126,36,144                   // movq          (%rax,%rdx,4),%xmm4
   .byte  102,15,58,14,252,15                 // pblendw       $0xf,%xmm4,%xmm7
-  .byte  233,117,255,255,255                 // jmpq          3d66 <_sk_load_bgra_dst_sse41+0xf>
+  .byte  233,117,255,255,255                 // jmpq          3d8e <_sk_load_bgra_dst_sse41+0xf>
   .byte  102,15,110,60,144                   // movd          (%rax,%rdx,4),%xmm7
-  .byte  233,107,255,255,255                 // jmpq          3d66 <_sk_load_bgra_dst_sse41+0xf>
+  .byte  233,107,255,255,255                 // jmpq          3d8e <_sk_load_bgra_dst_sse41+0xf>
 
 HIDDEN _sk_gather_bgra_sse41
 .globl _sk_gather_bgra_sse41
@@ -29956,17 +30075,17 @@
   .byte  102,65,15,58,34,28,129,1            // pinsrd        $0x1,(%r9,%rax,4),%xmm3
   .byte  102,65,15,58,34,28,153,2            // pinsrd        $0x2,(%r9,%rbx,4),%xmm3
   .byte  102,67,15,58,34,28,153,3            // pinsrd        $0x3,(%r9,%r11,4),%xmm3
-  .byte  102,15,111,5,180,45,0,0             // movdqa        0x2db4(%rip),%xmm0        # 6c10 <_sk_callback_sse41+0x10e7>
+  .byte  102,15,111,5,220,45,0,0             // movdqa        0x2ddc(%rip),%xmm0        # 6c60 <_sk_callback_sse41+0x110f>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,208                           // cvtdq2ps      %xmm0,%xmm2
-  .byte  68,15,40,5,181,45,0,0               // movaps        0x2db5(%rip),%xmm8        # 6c20 <_sk_callback_sse41+0x10f7>
+  .byte  68,15,40,5,221,45,0,0               // movaps        0x2ddd(%rip),%xmm8        # 6c70 <_sk_callback_sse41+0x111f>
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
-  .byte  102,15,56,0,5,180,45,0,0            // pshufb        0x2db4(%rip),%xmm0        # 6c30 <_sk_callback_sse41+0x1107>
+  .byte  102,15,56,0,5,220,45,0,0            // pshufb        0x2ddc(%rip),%xmm0        # 6c80 <_sk_callback_sse41+0x112f>
   .byte  15,91,200                           // cvtdq2ps      %xmm0,%xmm1
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
-  .byte  102,15,56,0,5,176,45,0,0            // pshufb        0x2db0(%rip),%xmm0        # 6c40 <_sk_callback_sse41+0x1117>
+  .byte  102,15,56,0,5,216,45,0,0            // pshufb        0x2dd8(%rip),%xmm0        # 6c90 <_sk_callback_sse41+0x113f>
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
@@ -29982,7 +30101,7 @@
 _sk_store_bgra_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,155,45,0,0               // movaps        0x2d9b(%rip),%xmm8        # 6c50 <_sk_callback_sse41+0x1127>
+  .byte  68,15,40,5,195,45,0,0               // movaps        0x2dc3(%rip),%xmm8        # 6ca0 <_sk_callback_sse41+0x114f>
   .byte  68,15,40,202                        // movaps        %xmm2,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -30001,23 +30120,23 @@
   .byte  102,69,15,235,193                   // por           %xmm9,%xmm8
   .byte  102,69,15,235,194                   // por           %xmm10,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           3f15 <_sk_store_bgra_sse41+0x6d>
+  .byte  117,10                              // jne           3f3d <_sk_store_bgra_sse41+0x6d>
   .byte  243,68,15,127,4,144                 // movdqu        %xmm8,(%rax,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,29                              // je            3f3f <_sk_store_bgra_sse41+0x97>
+  .byte  116,29                              // je            3f67 <_sk_store_bgra_sse41+0x97>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,15                              // je            3f37 <_sk_store_bgra_sse41+0x8f>
+  .byte  116,15                              // je            3f5f <_sk_store_bgra_sse41+0x8f>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,227                             // jne           3f11 <_sk_store_bgra_sse41+0x69>
+  .byte  117,227                             // jne           3f39 <_sk_store_bgra_sse41+0x69>
   .byte  102,68,15,58,22,68,144,8,2          // pextrd        $0x2,%xmm8,0x8(%rax,%rdx,4)
   .byte  102,68,15,214,4,144                 // movq          %xmm8,(%rax,%rdx,4)
-  .byte  235,210                             // jmp           3f11 <_sk_store_bgra_sse41+0x69>
+  .byte  235,210                             // jmp           3f39 <_sk_store_bgra_sse41+0x69>
   .byte  102,68,15,126,4,144                 // movd          %xmm8,(%rax,%rdx,4)
-  .byte  235,202                             // jmp           3f11 <_sk_store_bgra_sse41+0x69>
+  .byte  235,202                             // jmp           3f39 <_sk_store_bgra_sse41+0x69>
 
 HIDDEN _sk_load_f16_sse41
 .globl _sk_load_f16_sse41
@@ -30026,7 +30145,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,60,1,0,0                     // jne           4091 <_sk_load_f16_sse41+0x14a>
+  .byte  15,133,60,1,0,0                     // jne           40b9 <_sk_load_f16_sse41+0x14a>
   .byte  102,15,16,4,208                     // movupd        (%rax,%rdx,8),%xmm0
   .byte  243,15,111,76,208,16                // movdqu        0x10(%rax,%rdx,8),%xmm1
   .byte  102,68,15,40,200                    // movapd        %xmm0,%xmm9
@@ -30036,18 +30155,18 @@
   .byte  102,68,15,97,216                    // punpcklwd     %xmm0,%xmm11
   .byte  102,68,15,105,200                   // punpckhwd     %xmm0,%xmm9
   .byte  102,65,15,56,51,203                 // pmovzxwd      %xmm11,%xmm1
-  .byte  102,68,15,111,5,212,44,0,0          // movdqa        0x2cd4(%rip),%xmm8        # 6c60 <_sk_callback_sse41+0x1137>
+  .byte  102,68,15,111,5,252,44,0,0          // movdqa        0x2cfc(%rip),%xmm8        # 6cb0 <_sk_callback_sse41+0x115f>
   .byte  102,15,111,209                      // movdqa        %xmm1,%xmm2
   .byte  102,65,15,219,208                   // pand          %xmm8,%xmm2
   .byte  102,15,239,202                      // pxor          %xmm2,%xmm1
-  .byte  102,15,111,29,207,44,0,0            // movdqa        0x2ccf(%rip),%xmm3        # 6c70 <_sk_callback_sse41+0x1147>
+  .byte  102,15,111,29,247,44,0,0            // movdqa        0x2cf7(%rip),%xmm3        # 6cc0 <_sk_callback_sse41+0x116f>
   .byte  102,15,114,242,16                   // pslld         $0x10,%xmm2
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,15,56,63,195                    // pmaxud        %xmm3,%xmm0
   .byte  102,15,118,193                      // pcmpeqd       %xmm1,%xmm0
   .byte  102,15,114,241,13                   // pslld         $0xd,%xmm1
   .byte  102,15,235,202                      // por           %xmm2,%xmm1
-  .byte  102,68,15,111,21,187,44,0,0         // movdqa        0x2cbb(%rip),%xmm10        # 6c80 <_sk_callback_sse41+0x1157>
+  .byte  102,68,15,111,21,227,44,0,0         // movdqa        0x2ce3(%rip),%xmm10        # 6cd0 <_sk_callback_sse41+0x117f>
   .byte  102,65,15,254,202                   // paddd         %xmm10,%xmm1
   .byte  102,15,219,193                      // pand          %xmm1,%xmm0
   .byte  102,65,15,115,219,8                 // psrldq        $0x8,%xmm11
@@ -30090,16 +30209,16 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,15,16,4,208                     // movsd         (%rax,%rdx,8),%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,13                              // jne           40a9 <_sk_load_f16_sse41+0x162>
+  .byte  117,13                              // jne           40d1 <_sk_load_f16_sse41+0x162>
   .byte  243,15,126,192                      // movq          %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,183,254,255,255                 // jmpq          3f60 <_sk_load_f16_sse41+0x19>
+  .byte  233,183,254,255,255                 // jmpq          3f88 <_sk_load_f16_sse41+0x19>
   .byte  102,15,22,68,208,8                  // movhpd        0x8(%rax,%rdx,8),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,163,254,255,255              // jb            3f60 <_sk_load_f16_sse41+0x19>
+  .byte  15,130,163,254,255,255              // jb            3f88 <_sk_load_f16_sse41+0x19>
   .byte  243,15,126,76,208,16                // movq          0x10(%rax,%rdx,8),%xmm1
-  .byte  233,152,254,255,255                 // jmpq          3f60 <_sk_load_f16_sse41+0x19>
+  .byte  233,152,254,255,255                 // jmpq          3f88 <_sk_load_f16_sse41+0x19>
 
 HIDDEN _sk_load_f16_dst_sse41
 .globl _sk_load_f16_dst_sse41
@@ -30108,7 +30227,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,60,1,0,0                     // jne           4212 <_sk_load_f16_dst_sse41+0x14a>
+  .byte  15,133,60,1,0,0                     // jne           423a <_sk_load_f16_dst_sse41+0x14a>
   .byte  102,15,16,36,208                    // movupd        (%rax,%rdx,8),%xmm4
   .byte  243,15,111,108,208,16               // movdqu        0x10(%rax,%rdx,8),%xmm5
   .byte  102,68,15,40,204                    // movapd        %xmm4,%xmm9
@@ -30118,18 +30237,18 @@
   .byte  102,68,15,97,220                    // punpcklwd     %xmm4,%xmm11
   .byte  102,68,15,105,204                   // punpckhwd     %xmm4,%xmm9
   .byte  102,65,15,56,51,235                 // pmovzxwd      %xmm11,%xmm5
-  .byte  102,68,15,111,5,131,43,0,0          // movdqa        0x2b83(%rip),%xmm8        # 6c90 <_sk_callback_sse41+0x1167>
+  .byte  102,68,15,111,5,171,43,0,0          // movdqa        0x2bab(%rip),%xmm8        # 6ce0 <_sk_callback_sse41+0x118f>
   .byte  102,15,111,245                      // movdqa        %xmm5,%xmm6
   .byte  102,65,15,219,240                   // pand          %xmm8,%xmm6
   .byte  102,15,239,238                      // pxor          %xmm6,%xmm5
-  .byte  102,15,111,61,126,43,0,0            // movdqa        0x2b7e(%rip),%xmm7        # 6ca0 <_sk_callback_sse41+0x1177>
+  .byte  102,15,111,61,166,43,0,0            // movdqa        0x2ba6(%rip),%xmm7        # 6cf0 <_sk_callback_sse41+0x119f>
   .byte  102,15,114,246,16                   // pslld         $0x10,%xmm6
   .byte  102,15,111,229                      // movdqa        %xmm5,%xmm4
   .byte  102,15,56,63,231                    // pmaxud        %xmm7,%xmm4
   .byte  102,15,118,229                      // pcmpeqd       %xmm5,%xmm4
   .byte  102,15,114,245,13                   // pslld         $0xd,%xmm5
   .byte  102,15,235,238                      // por           %xmm6,%xmm5
-  .byte  102,68,15,111,21,106,43,0,0         // movdqa        0x2b6a(%rip),%xmm10        # 6cb0 <_sk_callback_sse41+0x1187>
+  .byte  102,68,15,111,21,146,43,0,0         // movdqa        0x2b92(%rip),%xmm10        # 6d00 <_sk_callback_sse41+0x11af>
   .byte  102,65,15,254,234                   // paddd         %xmm10,%xmm5
   .byte  102,15,219,229                      // pand          %xmm5,%xmm4
   .byte  102,65,15,115,219,8                 // psrldq        $0x8,%xmm11
@@ -30172,16 +30291,16 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,15,16,36,208                    // movsd         (%rax,%rdx,8),%xmm4
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,13                              // jne           422a <_sk_load_f16_dst_sse41+0x162>
+  .byte  117,13                              // jne           4252 <_sk_load_f16_dst_sse41+0x162>
   .byte  243,15,126,228                      // movq          %xmm4,%xmm4
   .byte  102,15,239,237                      // pxor          %xmm5,%xmm5
-  .byte  233,183,254,255,255                 // jmpq          40e1 <_sk_load_f16_dst_sse41+0x19>
+  .byte  233,183,254,255,255                 // jmpq          4109 <_sk_load_f16_dst_sse41+0x19>
   .byte  102,15,22,100,208,8                 // movhpd        0x8(%rax,%rdx,8),%xmm4
   .byte  102,15,239,237                      // pxor          %xmm5,%xmm5
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,163,254,255,255              // jb            40e1 <_sk_load_f16_dst_sse41+0x19>
+  .byte  15,130,163,254,255,255              // jb            4109 <_sk_load_f16_dst_sse41+0x19>
   .byte  243,15,126,108,208,16               // movq          0x10(%rax,%rdx,8),%xmm5
-  .byte  233,152,254,255,255                 // jmpq          40e1 <_sk_load_f16_dst_sse41+0x19>
+  .byte  233,152,254,255,255                 // jmpq          4109 <_sk_load_f16_dst_sse41+0x19>
 
 HIDDEN _sk_gather_f16_sse41
 .globl _sk_gather_f16_sse41
@@ -30215,18 +30334,18 @@
   .byte  102,68,15,97,218                    // punpcklwd     %xmm2,%xmm11
   .byte  102,68,15,105,202                   // punpckhwd     %xmm2,%xmm9
   .byte  102,65,15,56,51,203                 // pmovzxwd      %xmm11,%xmm1
-  .byte  102,68,15,111,5,240,41,0,0          // movdqa        0x29f0(%rip),%xmm8        # 6cc0 <_sk_callback_sse41+0x1197>
+  .byte  102,68,15,111,5,24,42,0,0           // movdqa        0x2a18(%rip),%xmm8        # 6d10 <_sk_callback_sse41+0x11bf>
   .byte  102,15,111,209                      // movdqa        %xmm1,%xmm2
   .byte  102,65,15,219,208                   // pand          %xmm8,%xmm2
   .byte  102,15,239,202                      // pxor          %xmm2,%xmm1
-  .byte  102,15,111,29,235,41,0,0            // movdqa        0x29eb(%rip),%xmm3        # 6cd0 <_sk_callback_sse41+0x11a7>
+  .byte  102,15,111,29,19,42,0,0             // movdqa        0x2a13(%rip),%xmm3        # 6d20 <_sk_callback_sse41+0x11cf>
   .byte  102,15,114,242,16                   // pslld         $0x10,%xmm2
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,15,56,63,195                    // pmaxud        %xmm3,%xmm0
   .byte  102,15,118,193                      // pcmpeqd       %xmm1,%xmm0
   .byte  102,15,114,241,13                   // pslld         $0xd,%xmm1
   .byte  102,15,235,202                      // por           %xmm2,%xmm1
-  .byte  102,68,15,111,21,215,41,0,0         // movdqa        0x29d7(%rip),%xmm10        # 6ce0 <_sk_callback_sse41+0x11b7>
+  .byte  102,68,15,111,21,255,41,0,0         // movdqa        0x29ff(%rip),%xmm10        # 6d30 <_sk_callback_sse41+0x11df>
   .byte  102,65,15,254,202                   // paddd         %xmm10,%xmm1
   .byte  102,15,219,193                      // pand          %xmm1,%xmm0
   .byte  102,65,15,115,219,8                 // psrldq        $0x8,%xmm11
@@ -30275,17 +30394,17 @@
 _sk_store_f16_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  102,68,15,111,21,12,41,0,0          // movdqa        0x290c(%rip),%xmm10        # 6cf0 <_sk_callback_sse41+0x11c7>
+  .byte  102,68,15,111,21,52,41,0,0          // movdqa        0x2934(%rip),%xmm10        # 6d40 <_sk_callback_sse41+0x11ef>
   .byte  102,68,15,111,216                   // movdqa        %xmm0,%xmm11
   .byte  102,69,15,219,218                   // pand          %xmm10,%xmm11
   .byte  102,68,15,111,232                   // movdqa        %xmm0,%xmm13
   .byte  102,69,15,239,235                   // pxor          %xmm11,%xmm13
-  .byte  102,68,15,111,13,255,40,0,0         // movdqa        0x28ff(%rip),%xmm9        # 6d00 <_sk_callback_sse41+0x11d7>
+  .byte  102,68,15,111,13,39,41,0,0          // movdqa        0x2927(%rip),%xmm9        # 6d50 <_sk_callback_sse41+0x11ff>
   .byte  102,65,15,114,211,16                // psrld         $0x10,%xmm11
   .byte  102,69,15,111,193                   // movdqa        %xmm9,%xmm8
   .byte  102,69,15,102,197                   // pcmpgtd       %xmm13,%xmm8
   .byte  102,65,15,114,213,13                // psrld         $0xd,%xmm13
-  .byte  102,68,15,111,37,240,40,0,0         // movdqa        0x28f0(%rip),%xmm12        # 6d10 <_sk_callback_sse41+0x11e7>
+  .byte  102,68,15,111,37,24,41,0,0          // movdqa        0x2918(%rip),%xmm12        # 6d60 <_sk_callback_sse41+0x120f>
   .byte  102,69,15,235,220                   // por           %xmm12,%xmm11
   .byte  102,69,15,254,221                   // paddd         %xmm13,%xmm11
   .byte  102,69,15,223,195                   // pandn         %xmm11,%xmm8
@@ -30329,7 +30448,7 @@
   .byte  102,69,15,111,200                   // movdqa        %xmm8,%xmm9
   .byte  102,69,15,98,203                    // punpckldq     %xmm11,%xmm9
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,21                              // jne           4516 <_sk_store_f16_sse41+0x140>
+  .byte  117,21                              // jne           453e <_sk_store_f16_sse41+0x140>
   .byte  68,15,17,12,208                     // movups        %xmm9,(%rax,%rdx,8)
   .byte  102,69,15,106,195                   // punpckhdq     %xmm11,%xmm8
   .byte  243,68,15,127,68,208,16             // movdqu        %xmm8,0x10(%rax,%rdx,8)
@@ -30337,13 +30456,13 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  102,68,15,214,12,208                // movq          %xmm9,(%rax,%rdx,8)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            4512 <_sk_store_f16_sse41+0x13c>
+  .byte  116,240                             // je            453a <_sk_store_f16_sse41+0x13c>
   .byte  102,68,15,23,76,208,8               // movhpd        %xmm9,0x8(%rax,%rdx,8)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            4512 <_sk_store_f16_sse41+0x13c>
+  .byte  114,227                             // jb            453a <_sk_store_f16_sse41+0x13c>
   .byte  102,69,15,106,195                   // punpckhdq     %xmm11,%xmm8
   .byte  102,68,15,214,68,208,16             // movq          %xmm8,0x10(%rax,%rdx,8)
-  .byte  235,213                             // jmp           4512 <_sk_store_f16_sse41+0x13c>
+  .byte  235,213                             // jmp           453a <_sk_store_f16_sse41+0x13c>
 
 HIDDEN _sk_load_u16_be_sse41
 .globl _sk_load_u16_be_sse41
@@ -30353,7 +30472,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,185,0,0,0                    // jne           460c <_sk_load_u16_be_sse41+0xcf>
+  .byte  15,133,185,0,0,0                    // jne           4634 <_sk_load_u16_be_sse41+0xcf>
   .byte  102,65,15,16,4,65                   // movupd        (%r9,%rax,2),%xmm0
   .byte  243,65,15,111,76,65,16              // movdqu        0x10(%r9,%rax,2),%xmm1
   .byte  102,15,40,208                       // movapd        %xmm0,%xmm2
@@ -30369,7 +30488,7 @@
   .byte  102,15,235,200                      // por           %xmm0,%xmm1
   .byte  102,15,56,51,193                    // pmovzxwd      %xmm1,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,129,39,0,0               // movaps        0x2781(%rip),%xmm8        # 6d20 <_sk_callback_sse41+0x11f7>
+  .byte  68,15,40,5,169,39,0,0               // movaps        0x27a9(%rip),%xmm8        # 6d70 <_sk_callback_sse41+0x121f>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -30397,16 +30516,16 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,65,15,16,4,65                   // movsd         (%r9,%rax,2),%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,13                              // jne           4625 <_sk_load_u16_be_sse41+0xe8>
+  .byte  117,13                              // jne           464d <_sk_load_u16_be_sse41+0xe8>
   .byte  243,15,126,192                      // movq          %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,59,255,255,255                  // jmpq          4560 <_sk_load_u16_be_sse41+0x23>
+  .byte  233,59,255,255,255                  // jmpq          4588 <_sk_load_u16_be_sse41+0x23>
   .byte  102,65,15,22,68,65,8                // movhpd        0x8(%r9,%rax,2),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,38,255,255,255               // jb            4560 <_sk_load_u16_be_sse41+0x23>
+  .byte  15,130,38,255,255,255               // jb            4588 <_sk_load_u16_be_sse41+0x23>
   .byte  243,65,15,126,76,65,16              // movq          0x10(%r9,%rax,2),%xmm1
-  .byte  233,26,255,255,255                  // jmpq          4560 <_sk_load_u16_be_sse41+0x23>
+  .byte  233,26,255,255,255                  // jmpq          4588 <_sk_load_u16_be_sse41+0x23>
 
 HIDDEN _sk_load_rgb_u16_be_sse41
 .globl _sk_load_rgb_u16_be_sse41
@@ -30416,7 +30535,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,82                         // lea           (%rdx,%rdx,2),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,170,0,0,0                    // jne           4702 <_sk_load_rgb_u16_be_sse41+0xbc>
+  .byte  15,133,170,0,0,0                    // jne           472a <_sk_load_rgb_u16_be_sse41+0xbc>
   .byte  243,65,15,111,20,65                 // movdqu        (%r9,%rax,2),%xmm2
   .byte  243,65,15,111,92,65,8               // movdqu        0x8(%r9,%rax,2),%xmm3
   .byte  102,15,115,219,4                    // psrldq        $0x4,%xmm3
@@ -30436,7 +30555,7 @@
   .byte  102,15,235,200                      // por           %xmm0,%xmm1
   .byte  102,15,56,51,193                    // pmovzxwd      %xmm1,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,121,38,0,0               // movaps        0x2679(%rip),%xmm8        # 6d30 <_sk_callback_sse41+0x1207>
+  .byte  68,15,40,5,161,38,0,0               // movaps        0x26a1(%rip),%xmm8        # 6d80 <_sk_callback_sse41+0x122f>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -30453,27 +30572,27 @@
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,64,38,0,0                  // movaps        0x2640(%rip),%xmm3        # 6d40 <_sk_callback_sse41+0x1217>
+  .byte  15,40,29,104,38,0,0                 // movaps        0x2668(%rip),%xmm3        # 6d90 <_sk_callback_sse41+0x123f>
   .byte  255,224                             // jmpq          *%rax
   .byte  102,65,15,110,20,65                 // movd          (%r9,%rax,2),%xmm2
   .byte  102,65,15,196,84,65,4,2             // pinsrw        $0x2,0x4(%r9,%rax,2),%xmm2
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,13                              // jne           4727 <_sk_load_rgb_u16_be_sse41+0xe1>
+  .byte  117,13                              // jne           474f <_sk_load_rgb_u16_be_sse41+0xe1>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
-  .byte  233,85,255,255,255                  // jmpq          467c <_sk_load_rgb_u16_be_sse41+0x36>
+  .byte  233,85,255,255,255                  // jmpq          46a4 <_sk_load_rgb_u16_be_sse41+0x36>
   .byte  102,65,15,110,68,65,6               // movd          0x6(%r9,%rax,2),%xmm0
   .byte  102,65,15,196,68,65,10,2            // pinsrw        $0x2,0xa(%r9,%rax,2),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,24                              // jb            4758 <_sk_load_rgb_u16_be_sse41+0x112>
+  .byte  114,24                              // jb            4780 <_sk_load_rgb_u16_be_sse41+0x112>
   .byte  102,65,15,110,92,65,12              // movd          0xc(%r9,%rax,2),%xmm3
   .byte  102,65,15,196,92,65,16,2            // pinsrw        $0x2,0x10(%r9,%rax,2),%xmm3
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,36,255,255,255                  // jmpq          467c <_sk_load_rgb_u16_be_sse41+0x36>
+  .byte  233,36,255,255,255                  // jmpq          46a4 <_sk_load_rgb_u16_be_sse41+0x36>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
-  .byte  233,27,255,255,255                  // jmpq          467c <_sk_load_rgb_u16_be_sse41+0x36>
+  .byte  233,27,255,255,255                  // jmpq          46a4 <_sk_load_rgb_u16_be_sse41+0x36>
 
 HIDDEN _sk_store_u16_be_sse41
 .globl _sk_store_u16_be_sse41
@@ -30482,7 +30601,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
-  .byte  68,15,40,21,218,37,0,0              // movaps        0x25da(%rip),%xmm10        # 6d50 <_sk_callback_sse41+0x1227>
+  .byte  68,15,40,21,2,38,0,0                // movaps        0x2602(%rip),%xmm10        # 6da0 <_sk_callback_sse41+0x124f>
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
   .byte  69,15,89,194                        // mulps         %xmm10,%xmm8
   .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
@@ -30519,7 +30638,7 @@
   .byte  102,69,15,111,208                   // movdqa        %xmm8,%xmm10
   .byte  102,69,15,98,209                    // punpckldq     %xmm9,%xmm10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,21                              // jne           4844 <_sk_store_u16_be_sse41+0xe3>
+  .byte  117,21                              // jne           486c <_sk_store_u16_be_sse41+0xe3>
   .byte  69,15,17,20,65                      // movups        %xmm10,(%r9,%rax,2)
   .byte  102,69,15,106,193                   // punpckhdq     %xmm9,%xmm8
   .byte  243,69,15,127,68,65,16              // movdqu        %xmm8,0x10(%r9,%rax,2)
@@ -30527,13 +30646,13 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  102,69,15,214,20,65                 // movq          %xmm10,(%r9,%rax,2)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            4840 <_sk_store_u16_be_sse41+0xdf>
+  .byte  116,240                             // je            4868 <_sk_store_u16_be_sse41+0xdf>
   .byte  102,69,15,23,84,65,8                // movhpd        %xmm10,0x8(%r9,%rax,2)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            4840 <_sk_store_u16_be_sse41+0xdf>
+  .byte  114,227                             // jb            4868 <_sk_store_u16_be_sse41+0xdf>
   .byte  102,69,15,106,193                   // punpckhdq     %xmm9,%xmm8
   .byte  102,69,15,214,68,65,16              // movq          %xmm8,0x10(%r9,%rax,2)
-  .byte  235,213                             // jmp           4840 <_sk_store_u16_be_sse41+0xdf>
+  .byte  235,213                             // jmp           4868 <_sk_store_u16_be_sse41+0xdf>
 
 HIDDEN _sk_load_f32_sse41
 .globl _sk_load_f32_sse41
@@ -30546,7 +30665,7 @@
   .byte  72,193,224,4                        // shl           $0x4,%rax
   .byte  69,15,16,4,2                        // movups        (%r10,%rax,1),%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           48cb <_sk_load_f32_sse41+0x60>
+  .byte  117,66                              // jne           48f3 <_sk_load_f32_sse41+0x60>
   .byte  67,15,16,68,138,16                  // movups        0x10(%r10,%r9,4),%xmm0
   .byte  67,15,16,92,138,32                  // movups        0x20(%r10,%r9,4),%xmm3
   .byte  71,15,16,76,138,48                  // movups        0x30(%r10,%r9,4),%xmm9
@@ -30566,17 +30685,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  69,15,87,201                        // xorps         %xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,8                               // jne           48dd <_sk_load_f32_sse41+0x72>
+  .byte  117,8                               // jne           4905 <_sk_load_f32_sse41+0x72>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
-  .byte  235,190                             // jmp           489b <_sk_load_f32_sse41+0x30>
+  .byte  235,190                             // jmp           48c3 <_sk_load_f32_sse41+0x30>
   .byte  67,15,16,68,138,16                  // movups        0x10(%r10,%r9,4),%xmm0
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,8                               // jb            48f1 <_sk_load_f32_sse41+0x86>
+  .byte  114,8                               // jb            4919 <_sk_load_f32_sse41+0x86>
   .byte  67,15,16,92,138,32                  // movups        0x20(%r10,%r9,4),%xmm3
-  .byte  235,170                             // jmp           489b <_sk_load_f32_sse41+0x30>
+  .byte  235,170                             // jmp           48c3 <_sk_load_f32_sse41+0x30>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
-  .byte  235,165                             // jmp           489b <_sk_load_f32_sse41+0x30>
+  .byte  235,165                             // jmp           48c3 <_sk_load_f32_sse41+0x30>
 
 HIDDEN _sk_load_f32_dst_sse41
 .globl _sk_load_f32_dst_sse41
@@ -30589,7 +30708,7 @@
   .byte  72,193,224,4                        // shl           $0x4,%rax
   .byte  69,15,16,4,2                        // movups        (%r10,%rax,1),%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           4956 <_sk_load_f32_dst_sse41+0x60>
+  .byte  117,66                              // jne           497e <_sk_load_f32_dst_sse41+0x60>
   .byte  67,15,16,100,138,16                 // movups        0x10(%r10,%r9,4),%xmm4
   .byte  67,15,16,124,138,32                 // movups        0x20(%r10,%r9,4),%xmm7
   .byte  71,15,16,76,138,48                  // movups        0x30(%r10,%r9,4),%xmm9
@@ -30609,17 +30728,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  69,15,87,201                        // xorps         %xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,8                               // jne           4968 <_sk_load_f32_dst_sse41+0x72>
+  .byte  117,8                               // jne           4990 <_sk_load_f32_dst_sse41+0x72>
   .byte  15,87,255                           // xorps         %xmm7,%xmm7
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
-  .byte  235,190                             // jmp           4926 <_sk_load_f32_dst_sse41+0x30>
+  .byte  235,190                             // jmp           494e <_sk_load_f32_dst_sse41+0x30>
   .byte  67,15,16,100,138,16                 // movups        0x10(%r10,%r9,4),%xmm4
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,8                               // jb            497c <_sk_load_f32_dst_sse41+0x86>
+  .byte  114,8                               // jb            49a4 <_sk_load_f32_dst_sse41+0x86>
   .byte  67,15,16,124,138,32                 // movups        0x20(%r10,%r9,4),%xmm7
-  .byte  235,170                             // jmp           4926 <_sk_load_f32_dst_sse41+0x30>
+  .byte  235,170                             // jmp           494e <_sk_load_f32_dst_sse41+0x30>
   .byte  15,87,255                           // xorps         %xmm7,%xmm7
-  .byte  235,165                             // jmp           4926 <_sk_load_f32_dst_sse41+0x30>
+  .byte  235,165                             // jmp           494e <_sk_load_f32_dst_sse41+0x30>
 
 HIDDEN _sk_store_f32_sse41
 .globl _sk_store_f32_sse41
@@ -30645,7 +30764,7 @@
   .byte  102,69,15,20,203                    // unpcklpd      %xmm11,%xmm9
   .byte  102,69,15,17,36,2                   // movupd        %xmm12,(%r10,%rax,1)
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,29                              // jne           49f3 <_sk_store_f32_sse41+0x72>
+  .byte  117,29                              // jne           4a1b <_sk_store_f32_sse41+0x72>
   .byte  102,69,15,21,211                    // unpckhpd      %xmm11,%xmm10
   .byte  71,15,17,68,138,16                  // movups        %xmm8,0x10(%r10,%r9,4)
   .byte  102,71,15,17,76,138,32              // movupd        %xmm9,0x20(%r10,%r9,4)
@@ -30653,12 +30772,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,246                             // je            49ef <_sk_store_f32_sse41+0x6e>
+  .byte  116,246                             // je            4a17 <_sk_store_f32_sse41+0x6e>
   .byte  71,15,17,68,138,16                  // movups        %xmm8,0x10(%r10,%r9,4)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,234                             // jb            49ef <_sk_store_f32_sse41+0x6e>
+  .byte  114,234                             // jb            4a17 <_sk_store_f32_sse41+0x6e>
   .byte  102,71,15,17,76,138,32              // movupd        %xmm9,0x20(%r10,%r9,4)
-  .byte  235,225                             // jmp           49ef <_sk_store_f32_sse41+0x6e>
+  .byte  235,225                             // jmp           4a17 <_sk_store_f32_sse41+0x6e>
 
 HIDDEN _sk_clamp_x_sse41
 .globl _sk_clamp_x_sse41
@@ -30742,7 +30861,7 @@
   .byte  65,15,92,194                        // subps         %xmm10,%xmm0
   .byte  243,69,15,88,192                    // addss         %xmm8,%xmm8
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
-  .byte  243,68,15,89,13,187,38,0,0          // mulss         0x26bb(%rip),%xmm9        # 71c0 <_sk_callback_sse41+0x1697>
+  .byte  243,68,15,89,13,227,38,0,0          // mulss         0x26e3(%rip),%xmm9        # 7210 <_sk_callback_sse41+0x16bf>
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
   .byte  68,15,89,200                        // mulps         %xmm0,%xmm9
   .byte  102,69,15,58,8,201,1                // roundps       $0x1,%xmm9,%xmm9
@@ -30770,7 +30889,7 @@
   .byte  65,15,92,202                        // subps         %xmm10,%xmm1
   .byte  243,69,15,88,192                    // addss         %xmm8,%xmm8
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
-  .byte  243,68,15,89,13,88,38,0,0           // mulss         0x2658(%rip),%xmm9        # 71c4 <_sk_callback_sse41+0x169b>
+  .byte  243,68,15,89,13,128,38,0,0          // mulss         0x2680(%rip),%xmm9        # 7214 <_sk_callback_sse41+0x16c3>
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
   .byte  68,15,89,201                        // mulps         %xmm1,%xmm9
   .byte  102,69,15,58,8,201,1                // roundps       $0x1,%xmm9,%xmm9
@@ -30792,7 +30911,7 @@
 _sk_clamp_x_1_sse41:
   .byte  69,15,87,192                        // xorps         %xmm8,%xmm8
   .byte  68,15,95,192                        // maxps         %xmm0,%xmm8
-  .byte  68,15,93,5,170,33,0,0               // minps         0x21aa(%rip),%xmm8        # 6d60 <_sk_callback_sse41+0x1237>
+  .byte  68,15,93,5,210,33,0,0               // minps         0x21d2(%rip),%xmm8        # 6db0 <_sk_callback_sse41+0x125f>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -30810,9 +30929,9 @@
 .globl _sk_mirror_x_1_sse41
 FUNCTION(_sk_mirror_x_1_sse41)
 _sk_mirror_x_1_sse41:
-  .byte  68,15,40,5,155,33,0,0               // movaps        0x219b(%rip),%xmm8        # 6d70 <_sk_callback_sse41+0x1247>
+  .byte  68,15,40,5,195,33,0,0               // movaps        0x21c3(%rip),%xmm8        # 6dc0 <_sk_callback_sse41+0x126f>
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
-  .byte  68,15,40,13,159,33,0,0              // movaps        0x219f(%rip),%xmm9        # 6d80 <_sk_callback_sse41+0x1257>
+  .byte  68,15,40,13,199,33,0,0              // movaps        0x21c7(%rip),%xmm9        # 6dd0 <_sk_callback_sse41+0x127f>
   .byte  68,15,89,200                        // mulps         %xmm0,%xmm9
   .byte  102,69,15,58,8,201,1                // roundps       $0x1,%xmm9,%xmm9
   .byte  69,15,88,201                        // addps         %xmm9,%xmm9
@@ -30829,10 +30948,10 @@
 FUNCTION(_sk_luminance_to_alpha_sse41)
 _sk_luminance_to_alpha_sse41:
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
-  .byte  15,89,5,126,33,0,0                  // mulps         0x217e(%rip),%xmm0        # 6d90 <_sk_callback_sse41+0x1267>
-  .byte  15,89,13,135,33,0,0                 // mulps         0x2187(%rip),%xmm1        # 6da0 <_sk_callback_sse41+0x1277>
+  .byte  15,89,5,166,33,0,0                  // mulps         0x21a6(%rip),%xmm0        # 6de0 <_sk_callback_sse41+0x128f>
+  .byte  15,89,13,175,33,0,0                 // mulps         0x21af(%rip),%xmm1        # 6df0 <_sk_callback_sse41+0x129f>
   .byte  15,88,200                           // addps         %xmm0,%xmm1
-  .byte  15,89,29,141,33,0,0                 // mulps         0x218d(%rip),%xmm3        # 6db0 <_sk_callback_sse41+0x1287>
+  .byte  15,89,29,181,33,0,0                 // mulps         0x21b5(%rip),%xmm3        # 6e00 <_sk_callback_sse41+0x12af>
   .byte  15,88,217                           // addps         %xmm1,%xmm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
@@ -31145,9 +31264,9 @@
   .byte  72,139,24                           // mov           (%rax),%rbx
   .byte  76,139,112,8                        // mov           0x8(%rax),%r14
   .byte  72,255,203                          // dec           %rbx
-  .byte  120,7                               // js            50c5 <_sk_evenly_spaced_gradient_sse41+0x1a>
+  .byte  120,7                               // js            50ed <_sk_evenly_spaced_gradient_sse41+0x1a>
   .byte  243,72,15,42,203                    // cvtsi2ss      %rbx,%xmm1
-  .byte  235,21                              // jmp           50da <_sk_evenly_spaced_gradient_sse41+0x2f>
+  .byte  235,21                              // jmp           5102 <_sk_evenly_spaced_gradient_sse41+0x2f>
   .byte  73,137,217                          // mov           %rbx,%r9
   .byte  73,209,233                          // shr           %r9
   .byte  131,227,1                           // and           $0x1,%ebx
@@ -31237,15 +31356,15 @@
 .globl _sk_gauss_a_to_rgba_sse41
 FUNCTION(_sk_gauss_a_to_rgba_sse41)
 _sk_gauss_a_to_rgba_sse41:
-  .byte  15,40,5,56,27,0,0                   // movaps        0x1b38(%rip),%xmm0        # 6dc0 <_sk_callback_sse41+0x1297>
+  .byte  15,40,5,96,27,0,0                   // movaps        0x1b60(%rip),%xmm0        # 6e10 <_sk_callback_sse41+0x12bf>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,62,27,0,0                   // addps         0x1b3e(%rip),%xmm0        # 6dd0 <_sk_callback_sse41+0x12a7>
+  .byte  15,88,5,102,27,0,0                  // addps         0x1b66(%rip),%xmm0        # 6e20 <_sk_callback_sse41+0x12cf>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,68,27,0,0                   // addps         0x1b44(%rip),%xmm0        # 6de0 <_sk_callback_sse41+0x12b7>
+  .byte  15,88,5,108,27,0,0                  // addps         0x1b6c(%rip),%xmm0        # 6e30 <_sk_callback_sse41+0x12df>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,74,27,0,0                   // addps         0x1b4a(%rip),%xmm0        # 6df0 <_sk_callback_sse41+0x12c7>
+  .byte  15,88,5,114,27,0,0                  // addps         0x1b72(%rip),%xmm0        # 6e40 <_sk_callback_sse41+0x12ef>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,80,27,0,0                   // addps         0x1b50(%rip),%xmm0        # 6e00 <_sk_callback_sse41+0x12d7>
+  .byte  15,88,5,120,27,0,0                  // addps         0x1b78(%rip),%xmm0        # 6e50 <_sk_callback_sse41+0x12ff>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
@@ -31263,12 +31382,12 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,249,2                        // cmp           $0x2,%r9
-  .byte  114,50                              // jb            5303 <_sk_gradient_sse41+0x46>
+  .byte  114,50                              // jb            532b <_sk_gradient_sse41+0x46>
   .byte  72,139,88,72                        // mov           0x48(%rax),%rbx
   .byte  73,255,201                          // dec           %r9
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  15,40,21,41,27,0,0                  // movaps        0x1b29(%rip),%xmm2        # 6e10 <_sk_callback_sse41+0x12e7>
+  .byte  15,40,21,81,27,0,0                  // movaps        0x1b51(%rip),%xmm2        # 6e60 <_sk_callback_sse41+0x130f>
   .byte  243,15,16,27                        // movss         (%rbx),%xmm3
   .byte  15,198,219,0                        // shufps        $0x0,%xmm3,%xmm3
   .byte  15,194,216,2                        // cmpleps       %xmm0,%xmm3
@@ -31276,7 +31395,7 @@
   .byte  102,15,254,203                      // paddd         %xmm3,%xmm1
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  73,255,201                          // dec           %r9
-  .byte  117,228                             // jne           52e7 <_sk_gradient_sse41+0x2a>
+  .byte  117,228                             // jne           530f <_sk_gradient_sse41+0x2a>
   .byte  102,73,15,58,22,201,1               // pextrq        $0x1,%xmm1,%r9
   .byte  69,137,202                          // mov           %r9d,%r10d
   .byte  73,193,233,32                       // shr           $0x20,%r9
@@ -31406,26 +31525,26 @@
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,40,236                        // movaps        %xmm12,%xmm13
   .byte  69,15,89,237                        // mulps         %xmm13,%xmm13
-  .byte  68,15,40,21,202,24,0,0              // movaps        0x18ca(%rip),%xmm10        # 6e20 <_sk_callback_sse41+0x12f7>
+  .byte  68,15,40,21,242,24,0,0              // movaps        0x18f2(%rip),%xmm10        # 6e70 <_sk_callback_sse41+0x131f>
   .byte  69,15,89,213                        // mulps         %xmm13,%xmm10
-  .byte  68,15,88,21,206,24,0,0              // addps         0x18ce(%rip),%xmm10        # 6e30 <_sk_callback_sse41+0x1307>
+  .byte  68,15,88,21,246,24,0,0              // addps         0x18f6(%rip),%xmm10        # 6e80 <_sk_callback_sse41+0x132f>
   .byte  69,15,89,213                        // mulps         %xmm13,%xmm10
-  .byte  68,15,88,21,210,24,0,0              // addps         0x18d2(%rip),%xmm10        # 6e40 <_sk_callback_sse41+0x1317>
+  .byte  68,15,88,21,250,24,0,0              // addps         0x18fa(%rip),%xmm10        # 6e90 <_sk_callback_sse41+0x133f>
   .byte  69,15,89,213                        // mulps         %xmm13,%xmm10
-  .byte  68,15,88,21,214,24,0,0              // addps         0x18d6(%rip),%xmm10        # 6e50 <_sk_callback_sse41+0x1327>
+  .byte  68,15,88,21,254,24,0,0              // addps         0x18fe(%rip),%xmm10        # 6ea0 <_sk_callback_sse41+0x134f>
   .byte  69,15,89,212                        // mulps         %xmm12,%xmm10
   .byte  65,15,194,195,1                     // cmpltps       %xmm11,%xmm0
-  .byte  68,15,40,29,213,24,0,0              // movaps        0x18d5(%rip),%xmm11        # 6e60 <_sk_callback_sse41+0x1337>
+  .byte  68,15,40,29,253,24,0,0              // movaps        0x18fd(%rip),%xmm11        # 6eb0 <_sk_callback_sse41+0x135f>
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
   .byte  102,69,15,56,20,211                 // blendvps      %xmm0,%xmm11,%xmm10
   .byte  69,15,194,200,1                     // cmpltps       %xmm8,%xmm9
-  .byte  68,15,40,29,206,24,0,0              // movaps        0x18ce(%rip),%xmm11        # 6e70 <_sk_callback_sse41+0x1347>
+  .byte  68,15,40,29,246,24,0,0              // movaps        0x18f6(%rip),%xmm11        # 6ec0 <_sk_callback_sse41+0x136f>
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  102,69,15,56,20,211                 // blendvps      %xmm0,%xmm11,%xmm10
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  65,15,194,192,1                     // cmpltps       %xmm8,%xmm0
-  .byte  68,15,40,13,192,24,0,0              // movaps        0x18c0(%rip),%xmm9        # 6e80 <_sk_callback_sse41+0x1357>
+  .byte  68,15,40,13,232,24,0,0              // movaps        0x18e8(%rip),%xmm9        # 6ed0 <_sk_callback_sse41+0x137f>
   .byte  69,15,92,202                        // subps         %xmm10,%xmm9
   .byte  102,69,15,56,20,209                 // blendvps      %xmm0,%xmm9,%xmm10
   .byte  69,15,194,194,7                     // cmpordps      %xmm10,%xmm8
@@ -31459,7 +31578,7 @@
   .byte  243,69,15,89,203                    // mulss         %xmm11,%xmm9
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
   .byte  68,15,88,200                        // addps         %xmm0,%xmm9
-  .byte  68,15,89,13,105,24,0,0              // mulps         0x1869(%rip),%xmm9        # 6e90 <_sk_callback_sse41+0x1367>
+  .byte  68,15,89,13,145,24,0,0              // mulps         0x1891(%rip),%xmm9        # 6ee0 <_sk_callback_sse41+0x138f>
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
   .byte  68,15,40,225                        // movaps        %xmm1,%xmm12
   .byte  69,15,89,228                        // mulps         %xmm12,%xmm12
@@ -31467,7 +31586,7 @@
   .byte  243,69,15,89,219                    // mulss         %xmm11,%xmm11
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,92,227                        // subps         %xmm11,%xmm12
-  .byte  68,15,89,21,84,24,0,0               // mulps         0x1854(%rip),%xmm10        # 6ea0 <_sk_callback_sse41+0x1377>
+  .byte  68,15,89,21,124,24,0,0              // mulps         0x187c(%rip),%xmm10        # 6ef0 <_sk_callback_sse41+0x139f>
   .byte  69,15,89,212                        // mulps         %xmm12,%xmm10
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
@@ -31476,8 +31595,8 @@
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  65,15,92,193                        // subps         %xmm9,%xmm0
-  .byte  68,15,87,13,60,24,0,0               // xorps         0x183c(%rip),%xmm9        # 6eb0 <_sk_callback_sse41+0x1387>
-  .byte  68,15,89,5,68,24,0,0                // mulps         0x1844(%rip),%xmm8        # 6ec0 <_sk_callback_sse41+0x1397>
+  .byte  68,15,87,13,100,24,0,0              // xorps         0x1864(%rip),%xmm9        # 6f00 <_sk_callback_sse41+0x13af>
+  .byte  68,15,89,5,108,24,0,0               // mulps         0x186c(%rip),%xmm8        # 6f10 <_sk_callback_sse41+0x13bf>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  69,15,92,202                        // subps         %xmm10,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
@@ -31498,7 +31617,7 @@
   .byte  243,69,15,89,203                    // mulss         %xmm11,%xmm9
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
   .byte  68,15,88,200                        // addps         %xmm0,%xmm9
-  .byte  68,15,89,13,11,24,0,0               // mulps         0x180b(%rip),%xmm9        # 6ed0 <_sk_callback_sse41+0x13a7>
+  .byte  68,15,89,13,51,24,0,0               // mulps         0x1833(%rip),%xmm9        # 6f20 <_sk_callback_sse41+0x13cf>
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
   .byte  68,15,40,225                        // movaps        %xmm1,%xmm12
   .byte  69,15,89,228                        // mulps         %xmm12,%xmm12
@@ -31506,7 +31625,7 @@
   .byte  243,69,15,89,219                    // mulss         %xmm11,%xmm11
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,92,227                        // subps         %xmm11,%xmm12
-  .byte  68,15,89,21,246,23,0,0              // mulps         0x17f6(%rip),%xmm10        # 6ee0 <_sk_callback_sse41+0x13b7>
+  .byte  68,15,89,21,30,24,0,0               // mulps         0x181e(%rip),%xmm10        # 6f30 <_sk_callback_sse41+0x13df>
   .byte  69,15,89,212                        // mulps         %xmm12,%xmm10
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
@@ -31515,8 +31634,8 @@
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  65,15,92,193                        // subps         %xmm9,%xmm0
-  .byte  68,15,87,13,222,23,0,0              // xorps         0x17de(%rip),%xmm9        # 6ef0 <_sk_callback_sse41+0x13c7>
-  .byte  68,15,89,5,230,23,0,0               // mulps         0x17e6(%rip),%xmm8        # 6f00 <_sk_callback_sse41+0x13d7>
+  .byte  68,15,87,13,6,24,0,0                // xorps         0x1806(%rip),%xmm9        # 6f40 <_sk_callback_sse41+0x13ef>
+  .byte  68,15,89,5,14,24,0,0                // mulps         0x180e(%rip),%xmm8        # 6f50 <_sk_callback_sse41+0x13ff>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  69,15,92,202                        // subps         %xmm10,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
@@ -31534,7 +31653,7 @@
   .byte  243,69,15,89,200                    // mulss         %xmm8,%xmm9
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
   .byte  68,15,88,200                        // addps         %xmm0,%xmm9
-  .byte  68,15,89,13,190,23,0,0              // mulps         0x17be(%rip),%xmm9        # 6f10 <_sk_callback_sse41+0x13e7>
+  .byte  68,15,89,13,230,23,0,0              // mulps         0x17e6(%rip),%xmm9        # 6f60 <_sk_callback_sse41+0x140f>
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
   .byte  68,15,40,209                        // movaps        %xmm1,%xmm10
   .byte  69,15,89,210                        // mulps         %xmm10,%xmm10
@@ -31542,7 +31661,7 @@
   .byte  243,69,15,89,192                    // mulss         %xmm8,%xmm8
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
   .byte  65,15,92,192                        // subps         %xmm8,%xmm0
-  .byte  15,87,5,170,23,0,0                  // xorps         0x17aa(%rip),%xmm0        # 6f20 <_sk_callback_sse41+0x13f7>
+  .byte  15,87,5,210,23,0,0                  // xorps         0x17d2(%rip),%xmm0        # 6f70 <_sk_callback_sse41+0x141f>
   .byte  65,15,94,193                        // divps         %xmm9,%xmm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -31585,7 +31704,7 @@
 FUNCTION(_sk_save_xy_sse41)
 _sk_save_xy_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,80,23,0,0                // movaps        0x1750(%rip),%xmm8        # 6f30 <_sk_callback_sse41+0x1407>
+  .byte  68,15,40,5,120,23,0,0               // movaps        0x1778(%rip),%xmm8        # 6f80 <_sk_callback_sse41+0x142f>
   .byte  15,17,0                             // movups        %xmm0,(%rax)
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,88,200                        // addps         %xmm8,%xmm9
@@ -31629,8 +31748,8 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,210,22,0,0                  // addps         0x16d2(%rip),%xmm0        # 6f40 <_sk_callback_sse41+0x1417>
-  .byte  68,15,40,13,218,22,0,0              // movaps        0x16da(%rip),%xmm9        # 6f50 <_sk_callback_sse41+0x1427>
+  .byte  15,88,5,250,22,0,0                  // addps         0x16fa(%rip),%xmm0        # 6f90 <_sk_callback_sse41+0x143f>
+  .byte  68,15,40,13,2,23,0,0                // movaps        0x1702(%rip),%xmm9        # 6fa0 <_sk_callback_sse41+0x144f>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  68,15,17,136,128,0,0,0              // movups        %xmm9,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -31643,7 +31762,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,201,22,0,0                  // addps         0x16c9(%rip),%xmm0        # 6f60 <_sk_callback_sse41+0x1437>
+  .byte  15,88,5,241,22,0,0                  // addps         0x16f1(%rip),%xmm0        # 6fb0 <_sk_callback_sse41+0x145f>
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -31655,8 +31774,8 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,187,22,0,0                 // addps         0x16bb(%rip),%xmm1        # 6f70 <_sk_callback_sse41+0x1447>
-  .byte  68,15,40,13,195,22,0,0              // movaps        0x16c3(%rip),%xmm9        # 6f80 <_sk_callback_sse41+0x1457>
+  .byte  15,88,13,227,22,0,0                 // addps         0x16e3(%rip),%xmm1        # 6fc0 <_sk_callback_sse41+0x146f>
+  .byte  68,15,40,13,235,22,0,0              // movaps        0x16eb(%rip),%xmm9        # 6fd0 <_sk_callback_sse41+0x147f>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  68,15,17,136,160,0,0,0              // movups        %xmm9,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -31669,7 +31788,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,177,22,0,0                 // addps         0x16b1(%rip),%xmm1        # 6f90 <_sk_callback_sse41+0x1467>
+  .byte  15,88,13,217,22,0,0                 // addps         0x16d9(%rip),%xmm1        # 6fe0 <_sk_callback_sse41+0x148f>
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -31681,13 +31800,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,164,22,0,0                  // addps         0x16a4(%rip),%xmm0        # 6fa0 <_sk_callback_sse41+0x1477>
-  .byte  68,15,40,13,172,22,0,0              // movaps        0x16ac(%rip),%xmm9        # 6fb0 <_sk_callback_sse41+0x1487>
+  .byte  15,88,5,204,22,0,0                  // addps         0x16cc(%rip),%xmm0        # 6ff0 <_sk_callback_sse41+0x149f>
+  .byte  68,15,40,13,212,22,0,0              // movaps        0x16d4(%rip),%xmm9        # 7000 <_sk_callback_sse41+0x14af>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  69,15,89,192                        // mulps         %xmm8,%xmm8
-  .byte  68,15,89,13,168,22,0,0              // mulps         0x16a8(%rip),%xmm9        # 6fc0 <_sk_callback_sse41+0x1497>
-  .byte  68,15,88,13,176,22,0,0              // addps         0x16b0(%rip),%xmm9        # 6fd0 <_sk_callback_sse41+0x14a7>
+  .byte  68,15,89,13,208,22,0,0              // mulps         0x16d0(%rip),%xmm9        # 7010 <_sk_callback_sse41+0x14bf>
+  .byte  68,15,88,13,216,22,0,0              // addps         0x16d8(%rip),%xmm9        # 7020 <_sk_callback_sse41+0x14cf>
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  68,15,17,136,128,0,0,0              // movups        %xmm9,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -31700,16 +31819,16 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,159,22,0,0                  // addps         0x169f(%rip),%xmm0        # 6fe0 <_sk_callback_sse41+0x14b7>
-  .byte  68,15,40,13,167,22,0,0              // movaps        0x16a7(%rip),%xmm9        # 6ff0 <_sk_callback_sse41+0x14c7>
+  .byte  15,88,5,199,22,0,0                  // addps         0x16c7(%rip),%xmm0        # 7030 <_sk_callback_sse41+0x14df>
+  .byte  68,15,40,13,207,22,0,0              // movaps        0x16cf(%rip),%xmm9        # 7040 <_sk_callback_sse41+0x14ef>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
-  .byte  68,15,40,5,171,22,0,0               // movaps        0x16ab(%rip),%xmm8        # 7000 <_sk_callback_sse41+0x14d7>
+  .byte  68,15,40,5,211,22,0,0               // movaps        0x16d3(%rip),%xmm8        # 7050 <_sk_callback_sse41+0x14ff>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,175,22,0,0               // addps         0x16af(%rip),%xmm8        # 7010 <_sk_callback_sse41+0x14e7>
+  .byte  68,15,88,5,215,22,0,0               // addps         0x16d7(%rip),%xmm8        # 7060 <_sk_callback_sse41+0x150f>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,179,22,0,0               // addps         0x16b3(%rip),%xmm8        # 7020 <_sk_callback_sse41+0x14f7>
+  .byte  68,15,88,5,219,22,0,0               // addps         0x16db(%rip),%xmm8        # 7070 <_sk_callback_sse41+0x151f>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,183,22,0,0               // addps         0x16b7(%rip),%xmm8        # 7030 <_sk_callback_sse41+0x1507>
+  .byte  68,15,88,5,223,22,0,0               // addps         0x16df(%rip),%xmm8        # 7080 <_sk_callback_sse41+0x152f>
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -31719,17 +31838,17 @@
 FUNCTION(_sk_bicubic_p1x_sse41)
 _sk_bicubic_p1x_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,177,22,0,0               // movaps        0x16b1(%rip),%xmm8        # 7040 <_sk_callback_sse41+0x1517>
+  .byte  68,15,40,5,217,22,0,0               // movaps        0x16d9(%rip),%xmm8        # 7090 <_sk_callback_sse41+0x153f>
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,72,64                      // movups        0x40(%rax),%xmm9
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
-  .byte  68,15,40,21,173,22,0,0              // movaps        0x16ad(%rip),%xmm10        # 7050 <_sk_callback_sse41+0x1527>
+  .byte  68,15,40,21,213,22,0,0              // movaps        0x16d5(%rip),%xmm10        # 70a0 <_sk_callback_sse41+0x154f>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,177,22,0,0              // addps         0x16b1(%rip),%xmm10        # 7060 <_sk_callback_sse41+0x1537>
+  .byte  68,15,88,21,217,22,0,0              // addps         0x16d9(%rip),%xmm10        # 70b0 <_sk_callback_sse41+0x155f>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,173,22,0,0              // addps         0x16ad(%rip),%xmm10        # 7070 <_sk_callback_sse41+0x1547>
+  .byte  68,15,88,21,213,22,0,0              // addps         0x16d5(%rip),%xmm10        # 70c0 <_sk_callback_sse41+0x156f>
   .byte  68,15,17,144,128,0,0,0              // movups        %xmm10,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -31741,11 +31860,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,160,22,0,0                  // addps         0x16a0(%rip),%xmm0        # 7080 <_sk_callback_sse41+0x1557>
+  .byte  15,88,5,200,22,0,0                  // addps         0x16c8(%rip),%xmm0        # 70d0 <_sk_callback_sse41+0x157f>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  69,15,89,201                        // mulps         %xmm9,%xmm9
-  .byte  68,15,89,5,160,22,0,0               // mulps         0x16a0(%rip),%xmm8        # 7090 <_sk_callback_sse41+0x1567>
-  .byte  68,15,88,5,168,22,0,0               // addps         0x16a8(%rip),%xmm8        # 70a0 <_sk_callback_sse41+0x1577>
+  .byte  68,15,89,5,200,22,0,0               // mulps         0x16c8(%rip),%xmm8        # 70e0 <_sk_callback_sse41+0x158f>
+  .byte  68,15,88,5,208,22,0,0               // addps         0x16d0(%rip),%xmm8        # 70f0 <_sk_callback_sse41+0x159f>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -31758,13 +31877,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,150,22,0,0                 // addps         0x1696(%rip),%xmm1        # 70b0 <_sk_callback_sse41+0x1587>
-  .byte  68,15,40,13,158,22,0,0              // movaps        0x169e(%rip),%xmm9        # 70c0 <_sk_callback_sse41+0x1597>
+  .byte  15,88,13,190,22,0,0                 // addps         0x16be(%rip),%xmm1        # 7100 <_sk_callback_sse41+0x15af>
+  .byte  68,15,40,13,198,22,0,0              // movaps        0x16c6(%rip),%xmm9        # 7110 <_sk_callback_sse41+0x15bf>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  69,15,89,192                        // mulps         %xmm8,%xmm8
-  .byte  68,15,89,13,154,22,0,0              // mulps         0x169a(%rip),%xmm9        # 70d0 <_sk_callback_sse41+0x15a7>
-  .byte  68,15,88,13,162,22,0,0              // addps         0x16a2(%rip),%xmm9        # 70e0 <_sk_callback_sse41+0x15b7>
+  .byte  68,15,89,13,194,22,0,0              // mulps         0x16c2(%rip),%xmm9        # 7120 <_sk_callback_sse41+0x15cf>
+  .byte  68,15,88,13,202,22,0,0              // addps         0x16ca(%rip),%xmm9        # 7130 <_sk_callback_sse41+0x15df>
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  68,15,17,136,160,0,0,0              // movups        %xmm9,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -31777,16 +31896,16 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,144,22,0,0                 // addps         0x1690(%rip),%xmm1        # 70f0 <_sk_callback_sse41+0x15c7>
-  .byte  68,15,40,13,152,22,0,0              // movaps        0x1698(%rip),%xmm9        # 7100 <_sk_callback_sse41+0x15d7>
+  .byte  15,88,13,184,22,0,0                 // addps         0x16b8(%rip),%xmm1        # 7140 <_sk_callback_sse41+0x15ef>
+  .byte  68,15,40,13,192,22,0,0              // movaps        0x16c0(%rip),%xmm9        # 7150 <_sk_callback_sse41+0x15ff>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
-  .byte  68,15,40,5,156,22,0,0               // movaps        0x169c(%rip),%xmm8        # 7110 <_sk_callback_sse41+0x15e7>
+  .byte  68,15,40,5,196,22,0,0               // movaps        0x16c4(%rip),%xmm8        # 7160 <_sk_callback_sse41+0x160f>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,160,22,0,0               // addps         0x16a0(%rip),%xmm8        # 7120 <_sk_callback_sse41+0x15f7>
+  .byte  68,15,88,5,200,22,0,0               // addps         0x16c8(%rip),%xmm8        # 7170 <_sk_callback_sse41+0x161f>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,164,22,0,0               // addps         0x16a4(%rip),%xmm8        # 7130 <_sk_callback_sse41+0x1607>
+  .byte  68,15,88,5,204,22,0,0               // addps         0x16cc(%rip),%xmm8        # 7180 <_sk_callback_sse41+0x162f>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,168,22,0,0               // addps         0x16a8(%rip),%xmm8        # 7140 <_sk_callback_sse41+0x1617>
+  .byte  68,15,88,5,208,22,0,0               // addps         0x16d0(%rip),%xmm8        # 7190 <_sk_callback_sse41+0x163f>
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -31796,17 +31915,17 @@
 FUNCTION(_sk_bicubic_p1y_sse41)
 _sk_bicubic_p1y_sse41:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,162,22,0,0               // movaps        0x16a2(%rip),%xmm8        # 7150 <_sk_callback_sse41+0x1627>
+  .byte  68,15,40,5,202,22,0,0               // movaps        0x16ca(%rip),%xmm8        # 71a0 <_sk_callback_sse41+0x164f>
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,72,96                      // movups        0x60(%rax),%xmm9
   .byte  65,15,88,200                        // addps         %xmm8,%xmm1
-  .byte  68,15,40,21,157,22,0,0              // movaps        0x169d(%rip),%xmm10        # 7160 <_sk_callback_sse41+0x1637>
+  .byte  68,15,40,21,197,22,0,0              // movaps        0x16c5(%rip),%xmm10        # 71b0 <_sk_callback_sse41+0x165f>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,161,22,0,0              // addps         0x16a1(%rip),%xmm10        # 7170 <_sk_callback_sse41+0x1647>
+  .byte  68,15,88,21,201,22,0,0              // addps         0x16c9(%rip),%xmm10        # 71c0 <_sk_callback_sse41+0x166f>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,157,22,0,0              // addps         0x169d(%rip),%xmm10        # 7180 <_sk_callback_sse41+0x1657>
+  .byte  68,15,88,21,197,22,0,0              // addps         0x16c5(%rip),%xmm10        # 71d0 <_sk_callback_sse41+0x167f>
   .byte  68,15,17,144,160,0,0,0              // movups        %xmm10,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -31818,11 +31937,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,143,22,0,0                 // addps         0x168f(%rip),%xmm1        # 7190 <_sk_callback_sse41+0x1667>
+  .byte  15,88,13,183,22,0,0                 // addps         0x16b7(%rip),%xmm1        # 71e0 <_sk_callback_sse41+0x168f>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  69,15,89,201                        // mulps         %xmm9,%xmm9
-  .byte  68,15,89,5,143,22,0,0               // mulps         0x168f(%rip),%xmm8        # 71a0 <_sk_callback_sse41+0x1677>
-  .byte  68,15,88,5,151,22,0,0               // addps         0x1697(%rip),%xmm8        # 71b0 <_sk_callback_sse41+0x1687>
+  .byte  68,15,89,5,183,22,0,0               // mulps         0x16b7(%rip),%xmm8        # 71f0 <_sk_callback_sse41+0x169f>
+  .byte  68,15,88,5,191,22,0,0               // addps         0x16bf(%rip),%xmm8        # 7200 <_sk_callback_sse41+0x16af>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -32047,16 +32166,26 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
+  .byte  63                                  // (bad)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  128,63,0                            // cmpb          $0x0,(%rdi)
+  .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
+  .byte  63                                  // (bad)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  128,63,0                            // cmpb          $0x0,(%rdi)
+  .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
+  .byte  63                                  // (bad)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  128,63,0                            // cmpb          $0x0,(%rdi)
+  .byte  0,128,191,0,0,128                   // add           %al,-0x7fffff41(%rax)
   .byte  191,0,0,128,191                     // mov           $0xbf800000,%edi
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  128,191,0,0,128,191,0               // cmpb          $0x0,-0x40800000(%rdi)
+  .byte  128,191,0,0,224,64,0                // cmpb          $0x0,0x40e00000(%rdi)
   .byte  0,224                               // add           %ah,%al
   .byte  64,0,0                              // add           %al,(%rax)
-  .byte  224,64                              // loopne        5df8 <.literal16+0x1d8>
+  .byte  224,64                              // loopne        5e4c <.literal16+0x1fc>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,64                              // loopne        5dfc <.literal16+0x1dc>
-  .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,64                              // loopne        5e00 <.literal16+0x1e0>
+  .byte  224,64                              // loopne        5e50 <.literal16+0x200>
   .byte  154                                 // (bad)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
@@ -32076,13 +32205,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e21 <.literal16+0x201>
+  .byte  71,225,61                           // rex.RXB       loope 5e71 <.literal16+0x221>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e25 <.literal16+0x205>
+  .byte  71,225,61                           // rex.RXB       loope 5e75 <.literal16+0x225>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e29 <.literal16+0x209>
+  .byte  71,225,61                           // rex.RXB       loope 5e79 <.literal16+0x229>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e2d <.literal16+0x20d>
+  .byte  71,225,61                           // rex.RXB       loope 5e7d <.literal16+0x22d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -32107,13 +32236,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e61 <.literal16+0x241>
+  .byte  71,225,61                           // rex.RXB       loope 5eb1 <.literal16+0x261>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e65 <.literal16+0x245>
+  .byte  71,225,61                           // rex.RXB       loope 5eb5 <.literal16+0x265>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e69 <.literal16+0x249>
+  .byte  71,225,61                           // rex.RXB       loope 5eb9 <.literal16+0x269>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5e6d <.literal16+0x24d>
+  .byte  71,225,61                           // rex.RXB       loope 5ebd <.literal16+0x26d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -32138,13 +32267,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5ea1 <.literal16+0x281>
+  .byte  71,225,61                           // rex.RXB       loope 5ef1 <.literal16+0x2a1>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5ea5 <.literal16+0x285>
+  .byte  71,225,61                           // rex.RXB       loope 5ef5 <.literal16+0x2a5>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5ea9 <.literal16+0x289>
+  .byte  71,225,61                           // rex.RXB       loope 5ef9 <.literal16+0x2a9>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5ead <.literal16+0x28d>
+  .byte  71,225,61                           // rex.RXB       loope 5efd <.literal16+0x2ad>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -32169,13 +32298,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5ee1 <.literal16+0x2c1>
+  .byte  71,225,61                           // rex.RXB       loope 5f31 <.literal16+0x2e1>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5ee5 <.literal16+0x2c5>
+  .byte  71,225,61                           // rex.RXB       loope 5f35 <.literal16+0x2e5>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5ee9 <.literal16+0x2c9>
+  .byte  71,225,61                           // rex.RXB       loope 5f39 <.literal16+0x2e9>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 5eed <.literal16+0x2cd>
+  .byte  71,225,61                           // rex.RXB       loope 5f3d <.literal16+0x2ed>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -32192,10 +32321,10 @@
   .byte  0,1                                 // add           %al,(%rcx)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005ed8 <_sk_callback_sse41+0xa0003af>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a005f28 <_sk_callback_sse41+0xa0003d7>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3005ee0 <_sk_callback_sse41+0x30003b7>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3005f30 <_sk_callback_sse41+0x30003df>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -32214,11 +32343,11 @@
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,127                    // add           %al,0x7f00003f(%rax)
   .byte  67,0,0                              // rex.XB        add %al,(%r8)
-  .byte  127,67                              // jg            5f4b <.literal16+0x32b>
+  .byte  127,67                              // jg            5f9b <.literal16+0x34b>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            5f4f <.literal16+0x32f>
+  .byte  127,67                              // jg            5f9f <.literal16+0x34f>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            5f53 <.literal16+0x333>
+  .byte  127,67                              // jg            5fa3 <.literal16+0x353>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -32500,13 +32629,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        6189 <.literal16+0x569>
+  .byte  224,7                               // loopne        61d9 <.literal16+0x589>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        618d <.literal16+0x56d>
+  .byte  224,7                               // loopne        61dd <.literal16+0x58d>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6191 <.literal16+0x571>
+  .byte  224,7                               // loopne        61e1 <.literal16+0x591>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6195 <.literal16+0x575>
+  .byte  224,7                               // loopne        61e5 <.literal16+0x595>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -32540,10 +32669,10 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  1,255                               // add           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a0061d8 <_sk_callback_sse41+0xa0006af>
+  .byte  255,5,255,255,255,9                 // incl          0x9ffffff(%rip)        # a006228 <_sk_callback_sse41+0xa0006d7>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 30061e0 <_sk_callback_sse41+0x30006b7>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006230 <_sk_callback_sse41+0x30006df>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -32598,11 +32727,11 @@
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            62ab <.literal16+0x68b>
+  .byte  127,67                              // jg            62fb <.literal16+0x6ab>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            62af <.literal16+0x68f>
+  .byte  127,67                              // jg            62ff <.literal16+0x6af>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            62b3 <.literal16+0x693>
+  .byte  127,67                              // jg            6303 <.literal16+0x6b3>
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
   .byte  128,59,129                          // cmpb          $0x81,(%rbx)
   .byte  128,128,59,129,128,128,59           // addb          $0x3b,-0x7f7f7ec5(%rax)
@@ -32617,16 +32746,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            62a4 <.literal16+0x684>
+  .byte  127,0                               // jg            62f4 <.literal16+0x6a4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            62a8 <.literal16+0x688>
+  .byte  127,0                               // jg            62f8 <.literal16+0x6a8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            62ac <.literal16+0x68c>
+  .byte  127,0                               // jg            62fc <.literal16+0x6ac>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            62b0 <.literal16+0x690>
+  .byte  127,0                               // jg            6300 <.literal16+0x6b0>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -32635,7 +32764,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            6335 <.literal16+0x715>
+  .byte  119,115                             // ja            6385 <.literal16+0x735>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -32646,7 +32775,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           6299 <.literal16+0x679>
+  .byte  117,191                             // jne           62e9 <.literal16+0x699>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -32658,7 +32787,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a2da <_sk_callback_sse41+0xffffffffe9a347b1>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a32a <_sk_callback_sse41+0xffffffffe9a347d9>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  81                                  // push          %rcx
   .byte  140,242                             // mov           %?,%edx
@@ -32713,16 +32842,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6374 <.literal16+0x754>
+  .byte  127,0                               // jg            63c4 <.literal16+0x774>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6378 <.literal16+0x758>
+  .byte  127,0                               // jg            63c8 <.literal16+0x778>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            637c <.literal16+0x75c>
+  .byte  127,0                               // jg            63cc <.literal16+0x77c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6380 <.literal16+0x760>
+  .byte  127,0                               // jg            63d0 <.literal16+0x780>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -32731,7 +32860,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            6405 <.literal16+0x7e5>
+  .byte  119,115                             // ja            6455 <.literal16+0x805>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -32742,7 +32871,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           6369 <.literal16+0x749>
+  .byte  117,191                             // jne           63b9 <.literal16+0x769>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -32754,7 +32883,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a3aa <_sk_callback_sse41+0xffffffffe9a34881>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a3fa <_sk_callback_sse41+0xffffffffe9a348a9>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  81                                  // push          %rcx
   .byte  140,242                             // mov           %?,%edx
@@ -32809,16 +32938,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6444 <.literal16+0x824>
+  .byte  127,0                               // jg            6494 <.literal16+0x844>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6448 <.literal16+0x828>
+  .byte  127,0                               // jg            6498 <.literal16+0x848>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            644c <.literal16+0x82c>
+  .byte  127,0                               // jg            649c <.literal16+0x84c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6450 <.literal16+0x830>
+  .byte  127,0                               // jg            64a0 <.literal16+0x850>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -32827,7 +32956,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            64d5 <.literal16+0x8b5>
+  .byte  119,115                             // ja            6525 <.literal16+0x8d5>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -32838,7 +32967,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           6439 <.literal16+0x819>
+  .byte  117,191                             // jne           6489 <.literal16+0x839>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -32850,7 +32979,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a47a <_sk_callback_sse41+0xffffffffe9a34951>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a4ca <_sk_callback_sse41+0xffffffffe9a34979>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  81                                  // push          %rcx
   .byte  140,242                             // mov           %?,%edx
@@ -32905,16 +33034,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6514 <.literal16+0x8f4>
+  .byte  127,0                               // jg            6564 <.literal16+0x914>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6518 <.literal16+0x8f8>
+  .byte  127,0                               // jg            6568 <.literal16+0x918>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            651c <.literal16+0x8fc>
+  .byte  127,0                               // jg            656c <.literal16+0x91c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6520 <.literal16+0x900>
+  .byte  127,0                               // jg            6570 <.literal16+0x920>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -32923,7 +33052,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            65a5 <.literal16+0x985>
+  .byte  119,115                             // ja            65f5 <.literal16+0x9a5>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -32934,7 +33063,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           6509 <.literal16+0x8e9>
+  .byte  117,191                             // jne           6559 <.literal16+0x909>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -32946,7 +33075,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a54a <_sk_callback_sse41+0xffffffffe9a34a21>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a59a <_sk_callback_sse41+0xffffffffe9a34a49>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  81                                  // push          %rcx
   .byte  140,242                             // mov           %?,%edx
@@ -32997,13 +33126,13 @@
   .byte  200,66,0,0                          // enterq        $0x42,$0x0
   .byte  200,66,0,0                          // enterq        $0x42,$0x0
   .byte  200,66,0,0                          // enterq        $0x42,$0x0
-  .byte  127,67                              // jg            6627 <.literal16+0xa07>
+  .byte  127,67                              // jg            6677 <.literal16+0xa27>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            662b <.literal16+0xa0b>
+  .byte  127,67                              // jg            667b <.literal16+0xa2b>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            662f <.literal16+0xa0f>
+  .byte  127,67                              // jg            667f <.literal16+0xa2f>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6633 <.literal16+0xa13>
+  .byte  127,67                              // jg            6683 <.literal16+0xa33>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,195                               // add           %al,%bl
   .byte  0,0                                 // add           %al,(%rax)
@@ -33050,16 +33179,16 @@
   .byte  128,3,62                            // addb          $0x3e,(%rbx)
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           66b3 <.literal16+0xa93>
+  .byte  118,63                              // jbe           6703 <.literal16+0xab3>
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           66b7 <.literal16+0xa97>
+  .byte  118,63                              // jbe           6707 <.literal16+0xab7>
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           66bb <.literal16+0xa9b>
+  .byte  118,63                              // jbe           670b <.literal16+0xabb>
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           66bf <.literal16+0xa9f>
+  .byte  118,63                              // jbe           670f <.literal16+0xabf>
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
@@ -33088,11 +33217,11 @@
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            672b <.literal16+0xb0b>
+  .byte  127,67                              // jg            677b <.literal16+0xb2b>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            672f <.literal16+0xb0f>
+  .byte  127,67                              // jg            677f <.literal16+0xb2f>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6733 <.literal16+0xb13>
+  .byte  127,67                              // jg            6783 <.literal16+0xb33>
   .byte  0,4,0                               // add           %al,(%rax,%rax,1)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,0                                 // add           %al,(%rax)
@@ -33150,7 +33279,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 30067b0 <_sk_callback_sse41+0x3000c87>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006800 <_sk_callback_sse41+0x3000caf>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -33179,13 +33308,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        67e9 <.literal16+0xbc9>
+  .byte  224,7                               // loopne        6839 <.literal16+0xbe9>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        67ed <.literal16+0xbcd>
+  .byte  224,7                               // loopne        683d <.literal16+0xbed>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        67f1 <.literal16+0xbd1>
+  .byte  224,7                               // loopne        6841 <.literal16+0xbf1>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        67f5 <.literal16+0xbd5>
+  .byte  224,7                               // loopne        6845 <.literal16+0xbf5>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -33231,13 +33360,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        6859 <.literal16+0xc39>
+  .byte  224,7                               // loopne        68a9 <.literal16+0xc59>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        685d <.literal16+0xc3d>
+  .byte  224,7                               // loopne        68ad <.literal16+0xc5d>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6861 <.literal16+0xc41>
+  .byte  224,7                               // loopne        68b1 <.literal16+0xc61>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6865 <.literal16+0xc45>
+  .byte  224,7                               // loopne        68b5 <.literal16+0xc65>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -33283,13 +33412,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        68c9 <.literal16+0xca9>
+  .byte  224,7                               // loopne        6919 <.literal16+0xcc9>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        68cd <.literal16+0xcad>
+  .byte  224,7                               // loopne        691d <.literal16+0xccd>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        68d1 <.literal16+0xcb1>
+  .byte  224,7                               // loopne        6921 <.literal16+0xcd1>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        68d5 <.literal16+0xcb5>
+  .byte  224,7                               // loopne        6925 <.literal16+0xcd5>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -33327,13 +33456,13 @@
   .byte  65,0,0                              // add           %al,(%r8)
   .byte  248                                 // clc
   .byte  65,0,0                              // add           %al,(%r8)
-  .byte  124,66                              // jl            6966 <.literal16+0xd46>
+  .byte  124,66                              // jl            69b6 <.literal16+0xd66>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  124,66                              // jl            696a <.literal16+0xd4a>
+  .byte  124,66                              // jl            69ba <.literal16+0xd6a>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  124,66                              // jl            696e <.literal16+0xd4e>
+  .byte  124,66                              // jl            69be <.literal16+0xd6e>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  124,66                              // jl            6972 <.literal16+0xd52>
+  .byte  124,66                              // jl            69c2 <.literal16+0xd72>
   .byte  0,240                               // add           %dh,%al
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,240                               // add           %dh,%al
@@ -33467,13 +33596,13 @@
   .byte  136,136,61,137,136,136              // mov           %cl,-0x777776c3(%rax)
   .byte  61,137,136,136,61                   // cmp           $0x3d888889,%eax
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6af5 <.literal16+0xed5>
+  .byte  112,65                              // jo            6b45 <.literal16+0xef5>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6af9 <.literal16+0xed9>
+  .byte  112,65                              // jo            6b49 <.literal16+0xef9>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6afd <.literal16+0xedd>
+  .byte  112,65                              // jo            6b4d <.literal16+0xefd>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6b01 <.literal16+0xee1>
+  .byte  112,65                              // jo            6b51 <.literal16+0xf01>
   .byte  255,0                               // incl          (%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  255,0                               // incl          (%rax)
@@ -33488,7 +33617,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006af0 <_sk_callback_sse41+0x3000fc7>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006b40 <_sk_callback_sse41+0x3000fef>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -33515,7 +33644,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006b30 <_sk_callback_sse41+0x3001007>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006b80 <_sk_callback_sse41+0x300102f>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -33542,7 +33671,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006b70 <_sk_callback_sse41+0x3001047>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006bc0 <_sk_callback_sse41+0x300106f>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -33557,11 +33686,11 @@
   .byte  255,0                               // incl          (%rax)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6bcb <.literal16+0xfab>
+  .byte  127,67                              // jg            6c1b <.literal16+0xfcb>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6bcf <.literal16+0xfaf>
+  .byte  127,67                              // jg            6c1f <.literal16+0xfcf>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6bd3 <.literal16+0xfb3>
+  .byte  127,67                              // jg            6c23 <.literal16+0xfd3>
   .byte  255,0                               // incl          (%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  255,0                               // incl          (%rax)
@@ -33576,7 +33705,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006bc0 <_sk_callback_sse41+0x3001097>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006c10 <_sk_callback_sse41+0x30010bf>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -33603,7 +33732,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006c00 <_sk_callback_sse41+0x30010d7>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006c50 <_sk_callback_sse41+0x30010ff>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -33630,7 +33759,7 @@
   .byte  5,255,255,255,9                     // add           $0x9ffffff,%eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006c40 <_sk_callback_sse41+0x3001117>
+  .byte  255,13,255,255,255,2                // decl          0x2ffffff(%rip)        # 3006c90 <_sk_callback_sse41+0x300113f>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,6                               // incl          (%rsi)
@@ -33645,11 +33774,11 @@
   .byte  255,0                               // incl          (%rax)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6c9b <.literal16+0x107b>
+  .byte  127,67                              // jg            6ceb <.literal16+0x109b>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6c9f <.literal16+0x107f>
+  .byte  127,67                              // jg            6cef <.literal16+0x109f>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6ca3 <.literal16+0x1083>
+  .byte  127,67                              // jg            6cf3 <.literal16+0x10a3>
   .byte  0,128,0,0,0,128                     // add           %al,-0x80000000(%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,128,0,0,0,128                     // add           %al,-0x80000000(%rax)
@@ -33744,13 +33873,13 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  255                                 // (bad)
-  .byte  127,71                              // jg            6d9b <.literal16+0x117b>
+  .byte  127,71                              // jg            6deb <.literal16+0x119b>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            6d9f <.literal16+0x117f>
+  .byte  127,71                              // jg            6def <.literal16+0x119f>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            6da3 <.literal16+0x1183>
+  .byte  127,71                              // jg            6df3 <.literal16+0x11a3>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            6da7 <.literal16+0x1187>
+  .byte  127,71                              // jg            6df7 <.literal16+0x11a7>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -33796,10 +33925,10 @@
   .byte  61,152,221,147,61                   // cmp           $0x3d93dd98,%eax
   .byte  152                                 // cwtl
   .byte  221,147,61,45,16,17                 // fstl          0x11102d3d(%rbx)
-  .byte  192,45,16,17,192,45,16              // shrb          $0x10,0x2dc01110(%rip)        # 2dc07eda <_sk_callback_sse41+0x2dc023b1>
+  .byte  192,45,16,17,192,45,16              // shrb          $0x10,0x2dc01110(%rip)        # 2dc07f2a <_sk_callback_sse41+0x2dc023d9>
   .byte  17,192                              // adc           %eax,%eax
   .byte  45,16,17,192,18                     // sub           $0x12c01110,%eax
-  .byte  120,57                              // js            6e0c <.literal16+0x11ec>
+  .byte  120,57                              // js            6e5c <.literal16+0x120c>
   .byte  64,18,120,57                        // adc           0x39(%rax),%dil
   .byte  64,18,120,57                        // adc           0x39(%rax),%dil
   .byte  64,18,120,57                        // adc           0x39(%rax),%dil
@@ -33980,11 +34109,11 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,114                          // cmpb          $0x72,(%rdi)
   .byte  28,199                              // sbb           $0xc7,%al
-  .byte  62,114,28                           // jb,pt         6fe2 <.literal16+0x13c2>
+  .byte  62,114,28                           // jb,pt         7032 <.literal16+0x13e2>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6fe6 <.literal16+0x13c6>
+  .byte  62,114,28                           // jb,pt         7036 <.literal16+0x13e6>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         6fea <.literal16+0x13ca>
+  .byte  62,114,28                           // jb,pt         703a <.literal16+0x13ea>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -34028,7 +34157,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63fe75 <_sk_callback_sse41+0x3d63a34c>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63fec5 <_sk_callback_sse41+0x3d63a374>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -34054,7 +34183,7 @@
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63feb5 <_sk_callback_sse41+0x3d63a38c>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63ff05 <_sk_callback_sse41+0x3d63a3b4>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
@@ -34063,13 +34192,13 @@
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
-  .byte  114,28                              // jb            70ae <.literal16+0x148e>
+  .byte  114,28                              // jb            70fe <.literal16+0x14ae>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         70b2 <.literal16+0x1492>
+  .byte  62,114,28                           // jb,pt         7102 <.literal16+0x14b2>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         70b6 <.literal16+0x1496>
+  .byte  62,114,28                           // jb,pt         7106 <.literal16+0x14b6>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         70ba <.literal16+0x149a>
+  .byte  62,114,28                           // jb,pt         710a <.literal16+0x14ba>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -34090,11 +34219,11 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,114                          // cmpb          $0x72,(%rdi)
   .byte  28,199                              // sbb           $0xc7,%al
-  .byte  62,114,28                           // jb,pt         70f2 <.literal16+0x14d2>
+  .byte  62,114,28                           // jb,pt         7142 <.literal16+0x14f2>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         70f6 <.literal16+0x14d6>
+  .byte  62,114,28                           // jb,pt         7146 <.literal16+0x14f6>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         70fa <.literal16+0x14da>
+  .byte  62,114,28                           // jb,pt         714a <.literal16+0x14fa>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -34138,7 +34267,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63ff85 <_sk_callback_sse41+0x3d63a45c>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63ffd5 <_sk_callback_sse41+0x3d63a484>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -34164,7 +34293,7 @@
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d63ffc5 <_sk_callback_sse41+0x3d63a49c>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d640015 <_sk_callback_sse41+0x3d63a4c4>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
@@ -34173,13 +34302,13 @@
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
-  .byte  114,28                              // jb            71be <.literal16+0x159e>
+  .byte  114,28                              // jb            720e <.literal16+0x15be>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         71c2 <_sk_callback_sse41+0x1699>
+  .byte  62,114,28                           // jb,pt         7212 <_sk_callback_sse41+0x16c1>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         71c6 <_sk_callback_sse41+0x169d>
+  .byte  62,114,28                           // jb,pt         7216 <_sk_callback_sse41+0x16c5>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         71ca <_sk_callback_sse41+0x16a1>
+  .byte  62,114,28                           // jb,pt         721a <_sk_callback_sse41+0x16c9>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -34271,7 +34400,7 @@
   .byte  102,15,110,194                      // movd          %edx,%xmm0
   .byte  102,15,112,192,0                    // pshufd        $0x0,%xmm0,%xmm0
   .byte  15,91,200                           // cvtdq2ps      %xmm0,%xmm1
-  .byte  15,40,21,175,96,0,0                 // movaps        0x60af(%rip),%xmm2        # 6150 <_sk_callback_sse2+0xfa>
+  .byte  15,40,21,207,96,0,0                 // movaps        0x60cf(%rip),%xmm2        # 6170 <_sk_callback_sse2+0xf2>
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  15,16,7                             // movups        (%rdi),%xmm0
   .byte  15,88,193                           // addps         %xmm1,%xmm0
@@ -34280,7 +34409,7 @@
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,21,158,96,0,0                 // movaps        0x609e(%rip),%xmm2        # 6160 <_sk_callback_sse2+0x10a>
+  .byte  15,40,21,190,96,0,0                 // movaps        0x60be(%rip),%xmm2        # 6180 <_sk_callback_sse2+0x102>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  15,87,237                           // xorps         %xmm5,%xmm5
@@ -34300,14 +34429,14 @@
   .byte  102,68,15,110,193                   // movd          %ecx,%xmm8
   .byte  102,69,15,112,192,0                 // pshufd        $0x0,%xmm8,%xmm8
   .byte  102,69,15,239,193                   // pxor          %xmm9,%xmm8
-  .byte  102,68,15,111,21,108,96,0,0         // movdqa        0x606c(%rip),%xmm10        # 6170 <_sk_callback_sse2+0x11a>
+  .byte  102,68,15,111,21,140,96,0,0         // movdqa        0x608c(%rip),%xmm10        # 6190 <_sk_callback_sse2+0x112>
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
   .byte  102,69,15,219,218                   // pand          %xmm10,%xmm11
   .byte  102,65,15,114,243,5                 // pslld         $0x5,%xmm11
   .byte  102,69,15,219,209                   // pand          %xmm9,%xmm10
   .byte  102,65,15,114,242,4                 // pslld         $0x4,%xmm10
-  .byte  102,68,15,111,37,88,96,0,0          // movdqa        0x6058(%rip),%xmm12        # 6180 <_sk_callback_sse2+0x12a>
-  .byte  102,68,15,111,45,95,96,0,0          // movdqa        0x605f(%rip),%xmm13        # 6190 <_sk_callback_sse2+0x13a>
+  .byte  102,68,15,111,37,120,96,0,0         // movdqa        0x6078(%rip),%xmm12        # 61a0 <_sk_callback_sse2+0x122>
+  .byte  102,68,15,111,45,127,96,0,0         // movdqa        0x607f(%rip),%xmm13        # 61b0 <_sk_callback_sse2+0x132>
   .byte  102,69,15,111,240                   // movdqa        %xmm8,%xmm14
   .byte  102,69,15,219,245                   // pand          %xmm13,%xmm14
   .byte  102,65,15,114,246,2                 // pslld         $0x2,%xmm14
@@ -34323,8 +34452,8 @@
   .byte  102,69,15,235,245                   // por           %xmm13,%xmm14
   .byte  102,69,15,235,240                   // por           %xmm8,%xmm14
   .byte  69,15,91,198                        // cvtdq2ps      %xmm14,%xmm8
-  .byte  68,15,89,5,26,96,0,0                // mulps         0x601a(%rip),%xmm8        # 61a0 <_sk_callback_sse2+0x14a>
-  .byte  68,15,88,5,34,96,0,0                // addps         0x6022(%rip),%xmm8        # 61b0 <_sk_callback_sse2+0x15a>
+  .byte  68,15,89,5,58,96,0,0                // mulps         0x603a(%rip),%xmm8        # 61c0 <_sk_callback_sse2+0x142>
+  .byte  68,15,88,5,66,96,0,0                // addps         0x6042(%rip),%xmm8        # 61d0 <_sk_callback_sse2+0x152>
   .byte  243,68,15,16,16                     // movss         (%rax),%xmm10
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
@@ -34345,10 +34474,10 @@
   .byte  65,15,40,201                        // movaps        %xmm9,%xmm1
   .byte  255,224                             // jmpq          *%rax
 
-HIDDEN _sk_constant_color_sse2
-.globl _sk_constant_color_sse2
-FUNCTION(_sk_constant_color_sse2)
-_sk_constant_color_sse2:
+HIDDEN _sk_uniform_color_sse2
+.globl _sk_uniform_color_sse2
+FUNCTION(_sk_uniform_color_sse2)
+_sk_uniform_color_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  243,15,16,0                         // movss         (%rax),%xmm0
   .byte  243,15,16,72,4                      // movss         0x4(%rax),%xmm1
@@ -34361,6 +34490,28 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
+HIDDEN _sk_black_color_sse2
+.globl _sk_black_color_sse2
+FUNCTION(_sk_black_color_sse2)
+_sk_black_color_sse2:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  15,40,29,216,95,0,0                 // movaps        0x5fd8(%rip),%xmm3        # 61e0 <_sk_callback_sse2+0x162>
+  .byte  15,87,192                           // xorps         %xmm0,%xmm0
+  .byte  15,87,201                           // xorps         %xmm1,%xmm1
+  .byte  15,87,210                           // xorps         %xmm2,%xmm2
+  .byte  255,224                             // jmpq          *%rax
+
+HIDDEN _sk_white_color_sse2
+.globl _sk_white_color_sse2
+FUNCTION(_sk_white_color_sse2)
+_sk_white_color_sse2:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  15,40,5,212,95,0,0                  // movaps        0x5fd4(%rip),%xmm0        # 61f0 <_sk_callback_sse2+0x172>
+  .byte  15,40,200                           // movaps        %xmm0,%xmm1
+  .byte  15,40,208                           // movaps        %xmm0,%xmm2
+  .byte  15,40,216                           // movaps        %xmm0,%xmm3
+  .byte  255,224                             // jmpq          *%rax
+
 HIDDEN _sk_load_rgba_sse2
 .globl _sk_load_rgba_sse2
 FUNCTION(_sk_load_rgba_sse2)
@@ -34401,7 +34552,7 @@
 FUNCTION(_sk_srcatop_sse2)
 _sk_srcatop_sse2:
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
-  .byte  68,15,40,5,124,95,0,0               // movaps        0x5f7c(%rip),%xmm8        # 61c0 <_sk_callback_sse2+0x16a>
+  .byte  68,15,40,5,148,95,0,0               // movaps        0x5f94(%rip),%xmm8        # 6200 <_sk_callback_sse2+0x182>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -34426,7 +34577,7 @@
 _sk_dstatop_sse2:
   .byte  68,15,40,195                        // movaps        %xmm3,%xmm8
   .byte  68,15,89,196                        // mulps         %xmm4,%xmm8
-  .byte  68,15,40,13,63,95,0,0               // movaps        0x5f3f(%rip),%xmm9        # 61d0 <_sk_callback_sse2+0x17a>
+  .byte  68,15,40,13,87,95,0,0               // movaps        0x5f57(%rip),%xmm9        # 6210 <_sk_callback_sse2+0x192>
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
@@ -34473,7 +34624,7 @@
 .globl _sk_srcout_sse2
 FUNCTION(_sk_srcout_sse2)
 _sk_srcout_sse2:
-  .byte  68,15,40,5,227,94,0,0               // movaps        0x5ee3(%rip),%xmm8        # 61e0 <_sk_callback_sse2+0x18a>
+  .byte  68,15,40,5,251,94,0,0               // movaps        0x5efb(%rip),%xmm8        # 6220 <_sk_callback_sse2+0x1a2>
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
@@ -34486,7 +34637,7 @@
 .globl _sk_dstout_sse2
 FUNCTION(_sk_dstout_sse2)
 _sk_dstout_sse2:
-  .byte  68,15,40,5,211,94,0,0               // movaps        0x5ed3(%rip),%xmm8        # 61f0 <_sk_callback_sse2+0x19a>
+  .byte  68,15,40,5,235,94,0,0               // movaps        0x5eeb(%rip),%xmm8        # 6230 <_sk_callback_sse2+0x1b2>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
@@ -34503,7 +34654,7 @@
 .globl _sk_srcover_sse2
 FUNCTION(_sk_srcover_sse2)
 _sk_srcover_sse2:
-  .byte  68,15,40,5,182,94,0,0               // movaps        0x5eb6(%rip),%xmm8        # 6200 <_sk_callback_sse2+0x1aa>
+  .byte  68,15,40,5,206,94,0,0               // movaps        0x5ece(%rip),%xmm8        # 6240 <_sk_callback_sse2+0x1c2>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -34523,7 +34674,7 @@
 .globl _sk_dstover_sse2
 FUNCTION(_sk_dstover_sse2)
 _sk_dstover_sse2:
-  .byte  68,15,40,5,138,94,0,0               // movaps        0x5e8a(%rip),%xmm8        # 6210 <_sk_callback_sse2+0x1ba>
+  .byte  68,15,40,5,162,94,0,0               // movaps        0x5ea2(%rip),%xmm8        # 6250 <_sk_callback_sse2+0x1d2>
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -34551,7 +34702,7 @@
 .globl _sk_multiply_sse2
 FUNCTION(_sk_multiply_sse2)
 _sk_multiply_sse2:
-  .byte  68,15,40,5,94,94,0,0                // movaps        0x5e5e(%rip),%xmm8        # 6220 <_sk_callback_sse2+0x1ca>
+  .byte  68,15,40,5,118,94,0,0               // movaps        0x5e76(%rip),%xmm8        # 6260 <_sk_callback_sse2+0x1e2>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
@@ -34626,7 +34777,7 @@
 FUNCTION(_sk_xor__sse2)
 _sk_xor__sse2:
   .byte  68,15,40,195                        // movaps        %xmm3,%xmm8
-  .byte  15,40,29,147,93,0,0                 // movaps        0x5d93(%rip),%xmm3        # 6230 <_sk_callback_sse2+0x1da>
+  .byte  15,40,29,171,93,0,0                 // movaps        0x5dab(%rip),%xmm3        # 6270 <_sk_callback_sse2+0x1f2>
   .byte  68,15,40,203                        // movaps        %xmm3,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
@@ -34674,7 +34825,7 @@
   .byte  68,15,89,206                        // mulps         %xmm6,%xmm9
   .byte  65,15,95,209                        // maxps         %xmm9,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,254,92,0,0                 // movaps        0x5cfe(%rip),%xmm2        # 6240 <_sk_callback_sse2+0x1ea>
+  .byte  15,40,21,22,93,0,0                  // movaps        0x5d16(%rip),%xmm2        # 6280 <_sk_callback_sse2+0x202>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -34708,7 +34859,7 @@
   .byte  68,15,89,206                        // mulps         %xmm6,%xmm9
   .byte  65,15,93,209                        // minps         %xmm9,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,163,92,0,0                 // movaps        0x5ca3(%rip),%xmm2        # 6250 <_sk_callback_sse2+0x1fa>
+  .byte  15,40,21,187,92,0,0                 // movaps        0x5cbb(%rip),%xmm2        # 6290 <_sk_callback_sse2+0x212>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -34745,7 +34896,7 @@
   .byte  65,15,93,209                        // minps         %xmm9,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,61,92,0,0                  // movaps        0x5c3d(%rip),%xmm2        # 6260 <_sk_callback_sse2+0x20a>
+  .byte  15,40,21,85,92,0,0                  // movaps        0x5c55(%rip),%xmm2        # 62a0 <_sk_callback_sse2+0x222>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -34773,7 +34924,7 @@
   .byte  15,89,214                           // mulps         %xmm6,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  68,15,92,194                        // subps         %xmm2,%xmm8
-  .byte  15,40,21,253,91,0,0                 // movaps        0x5bfd(%rip),%xmm2        # 6270 <_sk_callback_sse2+0x21a>
+  .byte  15,40,21,21,92,0,0                  // movaps        0x5c15(%rip),%xmm2        # 62b0 <_sk_callback_sse2+0x232>
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,89,215                           // mulps         %xmm7,%xmm2
   .byte  15,88,218                           // addps         %xmm2,%xmm3
@@ -34786,7 +34937,7 @@
 FUNCTION(_sk_colorburn_sse2)
 _sk_colorburn_sse2:
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
-  .byte  68,15,40,21,240,91,0,0              // movaps        0x5bf0(%rip),%xmm10        # 6280 <_sk_callback_sse2+0x22a>
+  .byte  68,15,40,21,8,92,0,0                // movaps        0x5c08(%rip),%xmm10        # 62c0 <_sk_callback_sse2+0x242>
   .byte  69,15,40,202                        // movaps        %xmm10,%xmm9
   .byte  68,15,92,207                        // subps         %xmm7,%xmm9
   .byte  69,15,40,217                        // movaps        %xmm9,%xmm11
@@ -34880,7 +35031,7 @@
 FUNCTION(_sk_colordodge_sse2)
 _sk_colordodge_sse2:
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
-  .byte  68,15,40,21,166,90,0,0              // movaps        0x5aa6(%rip),%xmm10        # 6290 <_sk_callback_sse2+0x23a>
+  .byte  68,15,40,21,190,90,0,0              // movaps        0x5abe(%rip),%xmm10        # 62d0 <_sk_callback_sse2+0x252>
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
   .byte  68,15,92,223                        // subps         %xmm7,%xmm11
   .byte  69,15,40,227                        // movaps        %xmm11,%xmm12
@@ -34974,7 +35125,7 @@
   .byte  15,41,116,36,232                    // movaps        %xmm6,-0x18(%rsp)
   .byte  15,40,245                           // movaps        %xmm5,%xmm6
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
-  .byte  68,15,40,29,91,89,0,0               // movaps        0x595b(%rip),%xmm11        # 62a0 <_sk_callback_sse2+0x24a>
+  .byte  68,15,40,29,115,89,0,0              // movaps        0x5973(%rip),%xmm11        # 62e0 <_sk_callback_sse2+0x262>
   .byte  69,15,40,211                        // movaps        %xmm11,%xmm10
   .byte  68,15,92,215                        // subps         %xmm7,%xmm10
   .byte  69,15,40,194                        // movaps        %xmm10,%xmm8
@@ -35062,7 +35213,7 @@
 _sk_overlay_sse2:
   .byte  68,15,40,193                        // movaps        %xmm1,%xmm8
   .byte  68,15,40,232                        // movaps        %xmm0,%xmm13
-  .byte  68,15,40,13,41,88,0,0               // movaps        0x5829(%rip),%xmm9        # 62b0 <_sk_callback_sse2+0x25a>
+  .byte  68,15,40,13,65,88,0,0               // movaps        0x5841(%rip),%xmm9        # 62f0 <_sk_callback_sse2+0x272>
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
   .byte  68,15,92,215                        // subps         %xmm7,%xmm10
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
@@ -35153,7 +35304,7 @@
   .byte  68,15,40,213                        // movaps        %xmm5,%xmm10
   .byte  68,15,94,215                        // divps         %xmm7,%xmm10
   .byte  69,15,84,212                        // andps         %xmm12,%xmm10
-  .byte  68,15,40,13,230,86,0,0              // movaps        0x56e6(%rip),%xmm9        # 62c0 <_sk_callback_sse2+0x26a>
+  .byte  68,15,40,13,254,86,0,0              // movaps        0x56fe(%rip),%xmm9        # 6300 <_sk_callback_sse2+0x282>
   .byte  69,15,40,249                        // movaps        %xmm9,%xmm15
   .byte  69,15,92,250                        // subps         %xmm10,%xmm15
   .byte  69,15,40,218                        // movaps        %xmm10,%xmm11
@@ -35166,10 +35317,10 @@
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
   .byte  65,15,88,194                        // addps         %xmm10,%xmm0
-  .byte  68,15,40,53,192,86,0,0              // movaps        0x56c0(%rip),%xmm14        # 62d0 <_sk_callback_sse2+0x27a>
+  .byte  68,15,40,53,216,86,0,0              // movaps        0x56d8(%rip),%xmm14        # 6310 <_sk_callback_sse2+0x292>
   .byte  69,15,88,222                        // addps         %xmm14,%xmm11
   .byte  68,15,89,216                        // mulps         %xmm0,%xmm11
-  .byte  68,15,40,21,192,86,0,0              // movaps        0x56c0(%rip),%xmm10        # 62e0 <_sk_callback_sse2+0x28a>
+  .byte  68,15,40,21,216,86,0,0              // movaps        0x56d8(%rip),%xmm10        # 6320 <_sk_callback_sse2+0x2a2>
   .byte  69,15,89,234                        // mulps         %xmm10,%xmm13
   .byte  69,15,88,235                        // addps         %xmm11,%xmm13
   .byte  15,88,228                           // addps         %xmm4,%xmm4
@@ -35314,7 +35465,7 @@
   .byte  68,15,40,209                        // movaps        %xmm1,%xmm10
   .byte  68,15,40,225                        // movaps        %xmm1,%xmm12
   .byte  68,15,89,211                        // mulps         %xmm3,%xmm10
-  .byte  68,15,40,5,3,85,0,0                 // movaps        0x5503(%rip),%xmm8        # 6320 <_sk_callback_sse2+0x2ca>
+  .byte  68,15,40,5,27,85,0,0                // movaps        0x551b(%rip),%xmm8        # 6360 <_sk_callback_sse2+0x2e2>
   .byte  69,15,40,216                        // movaps        %xmm8,%xmm11
   .byte  15,40,207                           // movaps        %xmm7,%xmm1
   .byte  68,15,92,217                        // subps         %xmm1,%xmm11
@@ -35362,12 +35513,12 @@
   .byte  69,15,84,206                        // andps         %xmm14,%xmm9
   .byte  69,15,84,214                        // andps         %xmm14,%xmm10
   .byte  65,15,84,214                        // andps         %xmm14,%xmm2
-  .byte  68,15,40,61,16,84,0,0               // movaps        0x5410(%rip),%xmm15        # 62f0 <_sk_callback_sse2+0x29a>
+  .byte  68,15,40,61,40,84,0,0               // movaps        0x5428(%rip),%xmm15        # 6330 <_sk_callback_sse2+0x2b2>
   .byte  65,15,89,231                        // mulps         %xmm15,%xmm4
-  .byte  15,40,5,21,84,0,0                   // movaps        0x5415(%rip),%xmm0        # 6300 <_sk_callback_sse2+0x2aa>
+  .byte  15,40,5,45,84,0,0                   // movaps        0x542d(%rip),%xmm0        # 6340 <_sk_callback_sse2+0x2c2>
   .byte  15,89,240                           // mulps         %xmm0,%xmm6
   .byte  15,88,244                           // addps         %xmm4,%xmm6
-  .byte  68,15,40,53,23,84,0,0               // movaps        0x5417(%rip),%xmm14        # 6310 <_sk_callback_sse2+0x2ba>
+  .byte  68,15,40,53,47,84,0,0               // movaps        0x542f(%rip),%xmm14        # 6350 <_sk_callback_sse2+0x2d2>
   .byte  68,15,40,239                        // movaps        %xmm7,%xmm13
   .byte  69,15,89,238                        // mulps         %xmm14,%xmm13
   .byte  68,15,88,238                        // addps         %xmm6,%xmm13
@@ -35545,14 +35696,14 @@
   .byte  68,15,84,211                        // andps         %xmm3,%xmm10
   .byte  68,15,84,203                        // andps         %xmm3,%xmm9
   .byte  15,84,195                           // andps         %xmm3,%xmm0
-  .byte  68,15,40,5,169,81,0,0               // movaps        0x51a9(%rip),%xmm8        # 6330 <_sk_callback_sse2+0x2da>
+  .byte  68,15,40,5,193,81,0,0               // movaps        0x51c1(%rip),%xmm8        # 6370 <_sk_callback_sse2+0x2f2>
   .byte  15,40,214                           // movaps        %xmm6,%xmm2
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
-  .byte  15,40,13,171,81,0,0                 // movaps        0x51ab(%rip),%xmm1        # 6340 <_sk_callback_sse2+0x2ea>
+  .byte  15,40,13,195,81,0,0                 // movaps        0x51c3(%rip),%xmm1        # 6380 <_sk_callback_sse2+0x302>
   .byte  15,40,221                           // movaps        %xmm5,%xmm3
   .byte  15,89,217                           // mulps         %xmm1,%xmm3
   .byte  15,88,218                           // addps         %xmm2,%xmm3
-  .byte  68,15,40,37,170,81,0,0              // movaps        0x51aa(%rip),%xmm12        # 6350 <_sk_callback_sse2+0x2fa>
+  .byte  68,15,40,37,194,81,0,0              // movaps        0x51c2(%rip),%xmm12        # 6390 <_sk_callback_sse2+0x312>
   .byte  69,15,89,236                        // mulps         %xmm12,%xmm13
   .byte  68,15,88,235                        // addps         %xmm3,%xmm13
   .byte  65,15,40,210                        // movaps        %xmm10,%xmm2
@@ -35597,7 +35748,7 @@
   .byte  15,40,223                           // movaps        %xmm7,%xmm3
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
   .byte  15,89,221                           // mulps         %xmm5,%xmm3
-  .byte  68,15,40,5,15,81,0,0                // movaps        0x510f(%rip),%xmm8        # 6360 <_sk_callback_sse2+0x30a>
+  .byte  68,15,40,5,39,81,0,0                // movaps        0x5127(%rip),%xmm8        # 63a0 <_sk_callback_sse2+0x322>
   .byte  65,15,40,224                        // movaps        %xmm8,%xmm4
   .byte  68,15,92,199                        // subps         %xmm7,%xmm8
   .byte  15,88,253                           // addps         %xmm5,%xmm7
@@ -35698,14 +35849,14 @@
   .byte  68,15,40,213                        // movaps        %xmm5,%xmm10
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
   .byte  65,15,40,208                        // movaps        %xmm8,%xmm2
-  .byte  68,15,40,45,173,79,0,0              // movaps        0x4fad(%rip),%xmm13        # 6370 <_sk_callback_sse2+0x31a>
+  .byte  68,15,40,45,197,79,0,0              // movaps        0x4fc5(%rip),%xmm13        # 63b0 <_sk_callback_sse2+0x332>
   .byte  68,15,40,198                        // movaps        %xmm6,%xmm8
   .byte  69,15,89,197                        // mulps         %xmm13,%xmm8
-  .byte  68,15,40,53,173,79,0,0              // movaps        0x4fad(%rip),%xmm14        # 6380 <_sk_callback_sse2+0x32a>
+  .byte  68,15,40,53,197,79,0,0              // movaps        0x4fc5(%rip),%xmm14        # 63c0 <_sk_callback_sse2+0x342>
   .byte  65,15,40,195                        // movaps        %xmm11,%xmm0
   .byte  65,15,89,198                        // mulps         %xmm14,%xmm0
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
-  .byte  68,15,40,29,169,79,0,0              // movaps        0x4fa9(%rip),%xmm11        # 6390 <_sk_callback_sse2+0x33a>
+  .byte  68,15,40,29,193,79,0,0              // movaps        0x4fc1(%rip),%xmm11        # 63d0 <_sk_callback_sse2+0x352>
   .byte  69,15,89,227                        // mulps         %xmm11,%xmm12
   .byte  68,15,88,224                        // addps         %xmm0,%xmm12
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
@@ -35713,7 +35864,7 @@
   .byte  69,15,40,250                        // movaps        %xmm10,%xmm15
   .byte  69,15,89,254                        // mulps         %xmm14,%xmm15
   .byte  68,15,88,248                        // addps         %xmm0,%xmm15
-  .byte  68,15,40,5,149,79,0,0               // movaps        0x4f95(%rip),%xmm8        # 63a0 <_sk_callback_sse2+0x34a>
+  .byte  68,15,40,5,173,79,0,0               // movaps        0x4fad(%rip),%xmm8        # 63e0 <_sk_callback_sse2+0x362>
   .byte  65,15,40,224                        // movaps        %xmm8,%xmm4
   .byte  15,92,226                           // subps         %xmm2,%xmm4
   .byte  15,89,252                           // mulps         %xmm4,%xmm7
@@ -35849,15 +36000,15 @@
   .byte  68,15,40,205                        // movaps        %xmm5,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
   .byte  15,89,222                           // mulps         %xmm6,%xmm3
-  .byte  68,15,40,37,172,77,0,0              // movaps        0x4dac(%rip),%xmm12        # 63b0 <_sk_callback_sse2+0x35a>
+  .byte  68,15,40,37,196,77,0,0              // movaps        0x4dc4(%rip),%xmm12        # 63f0 <_sk_callback_sse2+0x372>
   .byte  68,15,40,199                        // movaps        %xmm7,%xmm8
   .byte  69,15,89,196                        // mulps         %xmm12,%xmm8
-  .byte  68,15,40,45,172,77,0,0              // movaps        0x4dac(%rip),%xmm13        # 63c0 <_sk_callback_sse2+0x36a>
+  .byte  68,15,40,45,196,77,0,0              // movaps        0x4dc4(%rip),%xmm13        # 6400 <_sk_callback_sse2+0x382>
   .byte  68,15,40,241                        // movaps        %xmm1,%xmm14
   .byte  69,15,89,245                        // mulps         %xmm13,%xmm14
   .byte  69,15,88,240                        // addps         %xmm8,%xmm14
-  .byte  68,15,40,29,168,77,0,0              // movaps        0x4da8(%rip),%xmm11        # 63d0 <_sk_callback_sse2+0x37a>
-  .byte  68,15,40,5,176,77,0,0               // movaps        0x4db0(%rip),%xmm8        # 63e0 <_sk_callback_sse2+0x38a>
+  .byte  68,15,40,29,192,77,0,0              // movaps        0x4dc0(%rip),%xmm11        # 6410 <_sk_callback_sse2+0x392>
+  .byte  68,15,40,5,200,77,0,0               // movaps        0x4dc8(%rip),%xmm8        # 6420 <_sk_callback_sse2+0x3a2>
   .byte  69,15,40,248                        // movaps        %xmm8,%xmm15
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  68,15,92,248                        // subps         %xmm0,%xmm15
@@ -35993,10 +36144,10 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,227,0,0,0                    // jne           1908 <_sk_srcover_rgba_8888_sse2+0xf1>
+  .byte  15,133,227,0,0,0                    // jne           1930 <_sk_srcover_rgba_8888_sse2+0xf1>
   .byte  243,68,15,111,4,144                 // movdqu        (%rax,%rdx,4),%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  102,15,111,53,186,75,0,0            // movdqa        0x4bba(%rip),%xmm6        # 63f0 <_sk_callback_sse2+0x39a>
+  .byte  102,15,111,53,210,75,0,0            // movdqa        0x4bd2(%rip),%xmm6        # 6430 <_sk_callback_sse2+0x3b2>
   .byte  102,65,15,111,224                   // movdqa        %xmm8,%xmm4
   .byte  102,15,219,230                      // pand          %xmm6,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
@@ -36010,9 +36161,9 @@
   .byte  15,91,247                           // cvtdq2ps      %xmm7,%xmm6
   .byte  102,65,15,114,208,24                // psrld         $0x18,%xmm8
   .byte  65,15,91,248                        // cvtdq2ps      %xmm8,%xmm7
-  .byte  68,15,40,5,138,75,0,0               // movaps        0x4b8a(%rip),%xmm8        # 6400 <_sk_callback_sse2+0x3aa>
+  .byte  68,15,40,5,162,75,0,0               // movaps        0x4ba2(%rip),%xmm8        # 6440 <_sk_callback_sse2+0x3c2>
   .byte  68,15,92,195                        // subps         %xmm3,%xmm8
-  .byte  68,15,40,37,142,75,0,0              // movaps        0x4b8e(%rip),%xmm12        # 6410 <_sk_callback_sse2+0x3ba>
+  .byte  68,15,40,37,166,75,0,0              // movaps        0x4ba6(%rip),%xmm12        # 6450 <_sk_callback_sse2+0x3d2>
   .byte  65,15,89,196                        // mulps         %xmm12,%xmm0
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  68,15,89,204                        // mulps         %xmm4,%xmm9
@@ -36038,7 +36189,7 @@
   .byte  102,15,114,240,24                   // pslld         $0x18,%xmm0
   .byte  102,15,235,194                      // por           %xmm2,%xmm0
   .byte  102,15,235,193                      // por           %xmm1,%xmm0
-  .byte  117,82                              // jne           1941 <_sk_srcover_rgba_8888_sse2+0x12a>
+  .byte  117,82                              // jne           1969 <_sk_srcover_rgba_8888_sse2+0x12a>
   .byte  243,15,127,4,144                    // movdqu        %xmm0,(%rax,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
@@ -36049,32 +36200,32 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,87                              // je            196c <_sk_srcover_rgba_8888_sse2+0x155>
+  .byte  116,87                              // je            1994 <_sk_srcover_rgba_8888_sse2+0x155>
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,22                              // je            1936 <_sk_srcover_rgba_8888_sse2+0x11f>
+  .byte  116,22                              // je            195e <_sk_srcover_rgba_8888_sse2+0x11f>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  15,133,1,255,255,255                // jne           182b <_sk_srcover_rgba_8888_sse2+0x14>
+  .byte  15,133,1,255,255,255                // jne           1853 <_sk_srcover_rgba_8888_sse2+0x14>
   .byte  102,15,110,100,144,8                // movd          0x8(%rax,%rdx,4),%xmm4
   .byte  102,68,15,112,196,69                // pshufd        $0x45,%xmm4,%xmm8
   .byte  102,68,15,18,4,144                  // movlpd        (%rax,%rdx,4),%xmm8
-  .byte  233,234,254,255,255                 // jmpq          182b <_sk_srcover_rgba_8888_sse2+0x14>
+  .byte  233,234,254,255,255                 // jmpq          1853 <_sk_srcover_rgba_8888_sse2+0x14>
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,41                              // je            1977 <_sk_srcover_rgba_8888_sse2+0x160>
+  .byte  116,41                              // je            199f <_sk_srcover_rgba_8888_sse2+0x160>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,17                              // je            1965 <_sk_srcover_rgba_8888_sse2+0x14e>
+  .byte  116,17                              // je            198d <_sk_srcover_rgba_8888_sse2+0x14e>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,154                             // jne           18f4 <_sk_srcover_rgba_8888_sse2+0xdd>
+  .byte  117,154                             // jne           191c <_sk_srcover_rgba_8888_sse2+0xdd>
   .byte  102,15,112,200,78                   // pshufd        $0x4e,%xmm0,%xmm1
   .byte  102,15,126,76,144,8                 // movd          %xmm1,0x8(%rax,%rdx,4)
   .byte  102,15,214,4,144                    // movq          %xmm0,(%rax,%rdx,4)
-  .byte  235,136                             // jmp           18f4 <_sk_srcover_rgba_8888_sse2+0xdd>
+  .byte  235,136                             // jmp           191c <_sk_srcover_rgba_8888_sse2+0xdd>
   .byte  102,68,15,110,4,144                 // movd          (%rax,%rdx,4),%xmm8
-  .byte  233,180,254,255,255                 // jmpq          182b <_sk_srcover_rgba_8888_sse2+0x14>
+  .byte  233,180,254,255,255                 // jmpq          1853 <_sk_srcover_rgba_8888_sse2+0x14>
   .byte  102,15,126,4,144                    // movd          %xmm0,(%rax,%rdx,4)
-  .byte  233,115,255,255,255                 // jmpq          18f4 <_sk_srcover_rgba_8888_sse2+0xdd>
+  .byte  233,115,255,255,255                 // jmpq          191c <_sk_srcover_rgba_8888_sse2+0xdd>
 
 HIDDEN _sk_clamp_0_sse2
 .globl _sk_clamp_0_sse2
@@ -36092,7 +36243,7 @@
 .globl _sk_clamp_1_sse2
 FUNCTION(_sk_clamp_1_sse2)
 _sk_clamp_1_sse2:
-  .byte  68,15,40,5,127,74,0,0               // movaps        0x4a7f(%rip),%xmm8        # 6420 <_sk_callback_sse2+0x3ca>
+  .byte  68,15,40,5,151,74,0,0               // movaps        0x4a97(%rip),%xmm8        # 6460 <_sk_callback_sse2+0x3e2>
   .byte  65,15,93,192                        // minps         %xmm8,%xmm0
   .byte  65,15,93,200                        // minps         %xmm8,%xmm1
   .byte  65,15,93,208                        // minps         %xmm8,%xmm2
@@ -36104,7 +36255,7 @@
 .globl _sk_clamp_a_sse2
 FUNCTION(_sk_clamp_a_sse2)
 _sk_clamp_a_sse2:
-  .byte  15,93,29,116,74,0,0                 // minps         0x4a74(%rip),%xmm3        # 6430 <_sk_callback_sse2+0x3da>
+  .byte  15,93,29,140,74,0,0                 // minps         0x4a8c(%rip),%xmm3        # 6470 <_sk_callback_sse2+0x3f2>
   .byte  15,93,195                           // minps         %xmm3,%xmm0
   .byte  15,93,203                           // minps         %xmm3,%xmm1
   .byte  15,93,211                           // minps         %xmm3,%xmm2
@@ -36115,7 +36266,7 @@
 .globl _sk_clamp_a_dst_sse2
 FUNCTION(_sk_clamp_a_dst_sse2)
 _sk_clamp_a_dst_sse2:
-  .byte  15,93,61,112,74,0,0                 // minps         0x4a70(%rip),%xmm7        # 6440 <_sk_callback_sse2+0x3ea>
+  .byte  15,93,61,136,74,0,0                 // minps         0x4a88(%rip),%xmm7        # 6480 <_sk_callback_sse2+0x402>
   .byte  15,93,231                           // minps         %xmm7,%xmm4
   .byte  15,93,239                           // minps         %xmm7,%xmm5
   .byte  15,93,247                           // minps         %xmm7,%xmm6
@@ -36183,7 +36334,7 @@
 FUNCTION(_sk_unpremul_sse2)
 _sk_unpremul_sse2:
   .byte  69,15,87,192                        // xorps         %xmm8,%xmm8
-  .byte  68,15,40,13,11,74,0,0               // movaps        0x4a0b(%rip),%xmm9        # 6450 <_sk_callback_sse2+0x3fa>
+  .byte  68,15,40,13,35,74,0,0               // movaps        0x4a23(%rip),%xmm9        # 6490 <_sk_callback_sse2+0x412>
   .byte  68,15,94,203                        // divps         %xmm3,%xmm9
   .byte  68,15,194,195,4                     // cmpneqps      %xmm3,%xmm8
   .byte  69,15,84,193                        // andps         %xmm9,%xmm8
@@ -36197,20 +36348,20 @@
 .globl _sk_from_srgb_sse2
 FUNCTION(_sk_from_srgb_sse2)
 _sk_from_srgb_sse2:
-  .byte  68,15,40,5,246,73,0,0               // movaps        0x49f6(%rip),%xmm8        # 6460 <_sk_callback_sse2+0x40a>
+  .byte  68,15,40,5,14,74,0,0                // movaps        0x4a0e(%rip),%xmm8        # 64a0 <_sk_callback_sse2+0x422>
   .byte  68,15,40,232                        // movaps        %xmm0,%xmm13
   .byte  69,15,89,232                        // mulps         %xmm8,%xmm13
   .byte  68,15,40,216                        // movaps        %xmm0,%xmm11
   .byte  69,15,89,219                        // mulps         %xmm11,%xmm11
-  .byte  68,15,40,13,238,73,0,0              // movaps        0x49ee(%rip),%xmm9        # 6470 <_sk_callback_sse2+0x41a>
+  .byte  68,15,40,13,6,74,0,0                // movaps        0x4a06(%rip),%xmm9        # 64b0 <_sk_callback_sse2+0x432>
   .byte  68,15,40,240                        // movaps        %xmm0,%xmm14
   .byte  69,15,89,241                        // mulps         %xmm9,%xmm14
-  .byte  68,15,40,21,238,73,0,0              // movaps        0x49ee(%rip),%xmm10        # 6480 <_sk_callback_sse2+0x42a>
+  .byte  68,15,40,21,6,74,0,0                // movaps        0x4a06(%rip),%xmm10        # 64c0 <_sk_callback_sse2+0x442>
   .byte  69,15,88,242                        // addps         %xmm10,%xmm14
   .byte  69,15,89,243                        // mulps         %xmm11,%xmm14
-  .byte  68,15,40,29,238,73,0,0              // movaps        0x49ee(%rip),%xmm11        # 6490 <_sk_callback_sse2+0x43a>
+  .byte  68,15,40,29,6,74,0,0                // movaps        0x4a06(%rip),%xmm11        # 64d0 <_sk_callback_sse2+0x452>
   .byte  69,15,88,243                        // addps         %xmm11,%xmm14
-  .byte  68,15,40,37,242,73,0,0              // movaps        0x49f2(%rip),%xmm12        # 64a0 <_sk_callback_sse2+0x44a>
+  .byte  68,15,40,37,10,74,0,0               // movaps        0x4a0a(%rip),%xmm12        # 64e0 <_sk_callback_sse2+0x462>
   .byte  65,15,194,196,1                     // cmpltps       %xmm12,%xmm0
   .byte  68,15,84,232                        // andps         %xmm0,%xmm13
   .byte  65,15,85,198                        // andnps        %xmm14,%xmm0
@@ -36246,20 +36397,20 @@
 .globl _sk_from_srgb_dst_sse2
 FUNCTION(_sk_from_srgb_dst_sse2)
 _sk_from_srgb_dst_sse2:
-  .byte  68,15,40,5,131,73,0,0               // movaps        0x4983(%rip),%xmm8        # 64b0 <_sk_callback_sse2+0x45a>
+  .byte  68,15,40,5,155,73,0,0               // movaps        0x499b(%rip),%xmm8        # 64f0 <_sk_callback_sse2+0x472>
   .byte  68,15,40,236                        // movaps        %xmm4,%xmm13
   .byte  69,15,89,232                        // mulps         %xmm8,%xmm13
   .byte  68,15,40,220                        // movaps        %xmm4,%xmm11
   .byte  69,15,89,219                        // mulps         %xmm11,%xmm11
-  .byte  68,15,40,13,123,73,0,0              // movaps        0x497b(%rip),%xmm9        # 64c0 <_sk_callback_sse2+0x46a>
+  .byte  68,15,40,13,147,73,0,0              // movaps        0x4993(%rip),%xmm9        # 6500 <_sk_callback_sse2+0x482>
   .byte  68,15,40,244                        // movaps        %xmm4,%xmm14
   .byte  69,15,89,241                        // mulps         %xmm9,%xmm14
-  .byte  68,15,40,21,123,73,0,0              // movaps        0x497b(%rip),%xmm10        # 64d0 <_sk_callback_sse2+0x47a>
+  .byte  68,15,40,21,147,73,0,0              // movaps        0x4993(%rip),%xmm10        # 6510 <_sk_callback_sse2+0x492>
   .byte  69,15,88,242                        // addps         %xmm10,%xmm14
   .byte  69,15,89,243                        // mulps         %xmm11,%xmm14
-  .byte  68,15,40,29,123,73,0,0              // movaps        0x497b(%rip),%xmm11        # 64e0 <_sk_callback_sse2+0x48a>
+  .byte  68,15,40,29,147,73,0,0              // movaps        0x4993(%rip),%xmm11        # 6520 <_sk_callback_sse2+0x4a2>
   .byte  69,15,88,243                        // addps         %xmm11,%xmm14
-  .byte  68,15,40,37,127,73,0,0              // movaps        0x497f(%rip),%xmm12        # 64f0 <_sk_callback_sse2+0x49a>
+  .byte  68,15,40,37,151,73,0,0              // movaps        0x4997(%rip),%xmm12        # 6530 <_sk_callback_sse2+0x4b2>
   .byte  65,15,194,228,1                     // cmpltps       %xmm12,%xmm4
   .byte  68,15,84,236                        // andps         %xmm4,%xmm13
   .byte  65,15,85,230                        // andnps        %xmm14,%xmm4
@@ -36296,22 +36447,22 @@
 FUNCTION(_sk_to_srgb_sse2)
 _sk_to_srgb_sse2:
   .byte  68,15,82,232                        // rsqrtps       %xmm0,%xmm13
-  .byte  68,15,40,5,12,73,0,0                // movaps        0x490c(%rip),%xmm8        # 6500 <_sk_callback_sse2+0x4aa>
+  .byte  68,15,40,5,36,73,0,0                // movaps        0x4924(%rip),%xmm8        # 6540 <_sk_callback_sse2+0x4c2>
   .byte  68,15,40,240                        // movaps        %xmm0,%xmm14
   .byte  69,15,89,240                        // mulps         %xmm8,%xmm14
-  .byte  68,15,40,13,12,73,0,0               // movaps        0x490c(%rip),%xmm9        # 6510 <_sk_callback_sse2+0x4ba>
+  .byte  68,15,40,13,36,73,0,0               // movaps        0x4924(%rip),%xmm9        # 6550 <_sk_callback_sse2+0x4d2>
   .byte  69,15,40,253                        // movaps        %xmm13,%xmm15
   .byte  69,15,89,249                        // mulps         %xmm9,%xmm15
-  .byte  68,15,40,21,12,73,0,0               // movaps        0x490c(%rip),%xmm10        # 6520 <_sk_callback_sse2+0x4ca>
+  .byte  68,15,40,21,36,73,0,0               // movaps        0x4924(%rip),%xmm10        # 6560 <_sk_callback_sse2+0x4e2>
   .byte  69,15,88,250                        // addps         %xmm10,%xmm15
   .byte  69,15,89,253                        // mulps         %xmm13,%xmm15
-  .byte  68,15,40,29,12,73,0,0               // movaps        0x490c(%rip),%xmm11        # 6530 <_sk_callback_sse2+0x4da>
+  .byte  68,15,40,29,36,73,0,0               // movaps        0x4924(%rip),%xmm11        # 6570 <_sk_callback_sse2+0x4f2>
   .byte  69,15,88,251                        // addps         %xmm11,%xmm15
-  .byte  68,15,40,37,16,73,0,0               // movaps        0x4910(%rip),%xmm12        # 6540 <_sk_callback_sse2+0x4ea>
+  .byte  68,15,40,37,40,73,0,0               // movaps        0x4928(%rip),%xmm12        # 6580 <_sk_callback_sse2+0x502>
   .byte  69,15,88,236                        // addps         %xmm12,%xmm13
   .byte  69,15,83,237                        // rcpps         %xmm13,%xmm13
   .byte  69,15,89,239                        // mulps         %xmm15,%xmm13
-  .byte  68,15,40,61,12,73,0,0               // movaps        0x490c(%rip),%xmm15        # 6550 <_sk_callback_sse2+0x4fa>
+  .byte  68,15,40,61,36,73,0,0               // movaps        0x4924(%rip),%xmm15        # 6590 <_sk_callback_sse2+0x512>
   .byte  65,15,194,199,1                     // cmpltps       %xmm15,%xmm0
   .byte  68,15,84,240                        // andps         %xmm0,%xmm14
   .byte  65,15,85,197                        // andnps        %xmm13,%xmm0
@@ -36361,7 +36512,7 @@
   .byte  68,15,93,218                        // minps         %xmm2,%xmm11
   .byte  65,15,40,202                        // movaps        %xmm10,%xmm1
   .byte  65,15,92,203                        // subps         %xmm11,%xmm1
-  .byte  68,15,40,45,101,72,0,0              // movaps        0x4865(%rip),%xmm13        # 6560 <_sk_callback_sse2+0x50a>
+  .byte  68,15,40,45,125,72,0,0              // movaps        0x487d(%rip),%xmm13        # 65a0 <_sk_callback_sse2+0x522>
   .byte  68,15,94,233                        // divps         %xmm1,%xmm13
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  65,15,194,192,0                     // cmpeqps       %xmm8,%xmm0
@@ -36370,30 +36521,30 @@
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,40,241                        // movaps        %xmm9,%xmm14
   .byte  68,15,194,242,1                     // cmpltps       %xmm2,%xmm14
-  .byte  68,15,84,53,75,72,0,0               // andps         0x484b(%rip),%xmm14        # 6570 <_sk_callback_sse2+0x51a>
+  .byte  68,15,84,53,99,72,0,0               // andps         0x4863(%rip),%xmm14        # 65b0 <_sk_callback_sse2+0x532>
   .byte  69,15,88,244                        // addps         %xmm12,%xmm14
   .byte  69,15,40,250                        // movaps        %xmm10,%xmm15
   .byte  69,15,194,249,0                     // cmpeqps       %xmm9,%xmm15
   .byte  65,15,92,208                        // subps         %xmm8,%xmm2
   .byte  65,15,89,213                        // mulps         %xmm13,%xmm2
-  .byte  68,15,40,37,62,72,0,0               // movaps        0x483e(%rip),%xmm12        # 6580 <_sk_callback_sse2+0x52a>
+  .byte  68,15,40,37,86,72,0,0               // movaps        0x4856(%rip),%xmm12        # 65c0 <_sk_callback_sse2+0x542>
   .byte  65,15,88,212                        // addps         %xmm12,%xmm2
   .byte  69,15,92,193                        // subps         %xmm9,%xmm8
   .byte  69,15,89,197                        // mulps         %xmm13,%xmm8
-  .byte  68,15,88,5,58,72,0,0                // addps         0x483a(%rip),%xmm8        # 6590 <_sk_callback_sse2+0x53a>
+  .byte  68,15,88,5,82,72,0,0                // addps         0x4852(%rip),%xmm8        # 65d0 <_sk_callback_sse2+0x552>
   .byte  65,15,84,215                        // andps         %xmm15,%xmm2
   .byte  69,15,85,248                        // andnps        %xmm8,%xmm15
   .byte  68,15,86,250                        // orps          %xmm2,%xmm15
   .byte  68,15,84,240                        // andps         %xmm0,%xmm14
   .byte  65,15,85,199                        // andnps        %xmm15,%xmm0
   .byte  65,15,86,198                        // orps          %xmm14,%xmm0
-  .byte  15,89,5,43,72,0,0                   // mulps         0x482b(%rip),%xmm0        # 65a0 <_sk_callback_sse2+0x54a>
+  .byte  15,89,5,67,72,0,0                   // mulps         0x4843(%rip),%xmm0        # 65e0 <_sk_callback_sse2+0x562>
   .byte  69,15,40,194                        // movaps        %xmm10,%xmm8
   .byte  69,15,194,195,4                     // cmpneqps      %xmm11,%xmm8
   .byte  65,15,84,192                        // andps         %xmm8,%xmm0
   .byte  69,15,92,226                        // subps         %xmm10,%xmm12
   .byte  69,15,88,211                        // addps         %xmm11,%xmm10
-  .byte  68,15,40,13,30,72,0,0               // movaps        0x481e(%rip),%xmm9        # 65b0 <_sk_callback_sse2+0x55a>
+  .byte  68,15,40,13,54,72,0,0               // movaps        0x4836(%rip),%xmm9        # 65f0 <_sk_callback_sse2+0x572>
   .byte  65,15,40,210                        // movaps        %xmm10,%xmm2
   .byte  65,15,89,209                        // mulps         %xmm9,%xmm2
   .byte  68,15,194,202,1                     // cmpltps       %xmm2,%xmm9
@@ -36417,7 +36568,7 @@
   .byte  15,41,92,36,168                     // movaps        %xmm3,-0x58(%rsp)
   .byte  68,15,40,218                        // movaps        %xmm2,%xmm11
   .byte  15,40,240                           // movaps        %xmm0,%xmm6
-  .byte  68,15,40,13,221,71,0,0              // movaps        0x47dd(%rip),%xmm9        # 65c0 <_sk_callback_sse2+0x56a>
+  .byte  68,15,40,13,245,71,0,0              // movaps        0x47f5(%rip),%xmm9        # 6600 <_sk_callback_sse2+0x582>
   .byte  69,15,40,209                        // movaps        %xmm9,%xmm10
   .byte  69,15,194,211,2                     // cmpleps       %xmm11,%xmm10
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
@@ -36434,28 +36585,28 @@
   .byte  69,15,88,211                        // addps         %xmm11,%xmm10
   .byte  69,15,88,219                        // addps         %xmm11,%xmm11
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
-  .byte  15,40,5,166,71,0,0                  // movaps        0x47a6(%rip),%xmm0        # 65d0 <_sk_callback_sse2+0x57a>
+  .byte  15,40,5,190,71,0,0                  // movaps        0x47be(%rip),%xmm0        # 6610 <_sk_callback_sse2+0x592>
   .byte  15,88,198                           // addps         %xmm6,%xmm0
   .byte  243,15,91,200                       // cvttps2dq     %xmm0,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
   .byte  15,40,216                           // movaps        %xmm0,%xmm3
   .byte  15,194,217,1                        // cmpltps       %xmm1,%xmm3
-  .byte  15,84,29,158,71,0,0                 // andps         0x479e(%rip),%xmm3        # 65e0 <_sk_callback_sse2+0x58a>
+  .byte  15,84,29,182,71,0,0                 // andps         0x47b6(%rip),%xmm3        # 6620 <_sk_callback_sse2+0x5a2>
   .byte  15,92,203                           // subps         %xmm3,%xmm1
   .byte  15,92,193                           // subps         %xmm1,%xmm0
-  .byte  68,15,40,45,160,71,0,0              // movaps        0x47a0(%rip),%xmm13        # 65f0 <_sk_callback_sse2+0x59a>
+  .byte  68,15,40,45,184,71,0,0              // movaps        0x47b8(%rip),%xmm13        # 6630 <_sk_callback_sse2+0x5b2>
   .byte  69,15,40,197                        // movaps        %xmm13,%xmm8
   .byte  68,15,194,192,2                     // cmpleps       %xmm0,%xmm8
   .byte  69,15,40,242                        // movaps        %xmm10,%xmm14
   .byte  69,15,92,243                        // subps         %xmm11,%xmm14
   .byte  65,15,40,217                        // movaps        %xmm9,%xmm3
   .byte  15,194,216,2                        // cmpleps       %xmm0,%xmm3
-  .byte  15,40,21,176,71,0,0                 // movaps        0x47b0(%rip),%xmm2        # 6620 <_sk_callback_sse2+0x5ca>
+  .byte  15,40,21,200,71,0,0                 // movaps        0x47c8(%rip),%xmm2        # 6660 <_sk_callback_sse2+0x5e2>
   .byte  68,15,40,250                        // movaps        %xmm2,%xmm15
   .byte  68,15,194,248,2                     // cmpleps       %xmm0,%xmm15
-  .byte  15,40,13,128,71,0,0                 // movaps        0x4780(%rip),%xmm1        # 6600 <_sk_callback_sse2+0x5aa>
+  .byte  15,40,13,152,71,0,0                 // movaps        0x4798(%rip),%xmm1        # 6640 <_sk_callback_sse2+0x5c2>
   .byte  15,89,193                           // mulps         %xmm1,%xmm0
-  .byte  15,40,45,134,71,0,0                 // movaps        0x4786(%rip),%xmm5        # 6610 <_sk_callback_sse2+0x5ba>
+  .byte  15,40,45,158,71,0,0                 // movaps        0x479e(%rip),%xmm5        # 6650 <_sk_callback_sse2+0x5d2>
   .byte  15,40,229                           // movaps        %xmm5,%xmm4
   .byte  15,92,224                           // subps         %xmm0,%xmm4
   .byte  65,15,89,230                        // mulps         %xmm14,%xmm4
@@ -36478,7 +36629,7 @@
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  15,40,222                           // movaps        %xmm6,%xmm3
   .byte  15,194,216,1                        // cmpltps       %xmm0,%xmm3
-  .byte  15,84,29,251,70,0,0                 // andps         0x46fb(%rip),%xmm3        # 65e0 <_sk_callback_sse2+0x58a>
+  .byte  15,84,29,19,71,0,0                  // andps         0x4713(%rip),%xmm3        # 6620 <_sk_callback_sse2+0x5a2>
   .byte  15,92,195                           // subps         %xmm3,%xmm0
   .byte  68,15,40,230                        // movaps        %xmm6,%xmm12
   .byte  68,15,92,224                        // subps         %xmm0,%xmm12
@@ -36508,12 +36659,12 @@
   .byte  15,40,124,36,136                    // movaps        -0x78(%rsp),%xmm7
   .byte  15,40,231                           // movaps        %xmm7,%xmm4
   .byte  15,85,227                           // andnps        %xmm3,%xmm4
-  .byte  15,88,53,211,70,0,0                 // addps         0x46d3(%rip),%xmm6        # 6630 <_sk_callback_sse2+0x5da>
+  .byte  15,88,53,235,70,0,0                 // addps         0x46eb(%rip),%xmm6        # 6670 <_sk_callback_sse2+0x5f2>
   .byte  243,15,91,198                       // cvttps2dq     %xmm6,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  15,40,222                           // movaps        %xmm6,%xmm3
   .byte  15,194,216,1                        // cmpltps       %xmm0,%xmm3
-  .byte  15,84,29,110,70,0,0                 // andps         0x466e(%rip),%xmm3        # 65e0 <_sk_callback_sse2+0x58a>
+  .byte  15,84,29,134,70,0,0                 // andps         0x4686(%rip),%xmm3        # 6620 <_sk_callback_sse2+0x5a2>
   .byte  15,92,195                           // subps         %xmm3,%xmm0
   .byte  15,92,240                           // subps         %xmm0,%xmm6
   .byte  15,89,206                           // mulps         %xmm6,%xmm1
@@ -36573,13 +36724,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,61                              // jne           2065 <_sk_scale_u8_sse2+0x47>
+  .byte  117,61                              // jne           208d <_sk_scale_u8_sse2+0x47>
   .byte  102,69,15,110,4,18                  // movd          (%r10,%rdx,1),%xmm8
   .byte  102,68,15,96,192                    // punpcklbw     %xmm0,%xmm8
   .byte  102,68,15,97,192                    // punpcklwd     %xmm0,%xmm8
-  .byte  102,68,15,219,5,255,69,0,0          // pand          0x45ff(%rip),%xmm8        # 6640 <_sk_callback_sse2+0x5ea>
+  .byte  102,68,15,219,5,23,70,0,0           // pand          0x4617(%rip),%xmm8        # 6680 <_sk_callback_sse2+0x602>
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,3,70,0,0                 // mulps         0x4603(%rip),%xmm8        # 6650 <_sk_callback_sse2+0x5fa>
+  .byte  68,15,89,5,27,70,0,0                // mulps         0x461b(%rip),%xmm8        # 6690 <_sk_callback_sse2+0x612>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
@@ -36590,12 +36741,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,61                              // je            20af <_sk_scale_u8_sse2+0x91>
+  .byte  116,61                              // je            20d7 <_sk_scale_u8_sse2+0x91>
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,23                              // je            2094 <_sk_scale_u8_sse2+0x76>
+  .byte  116,23                              // je            20bc <_sk_scale_u8_sse2+0x76>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,181                             // jne           2038 <_sk_scale_u8_sse2+0x1a>
+  .byte  117,181                             // jne           2060 <_sk_scale_u8_sse2+0x1a>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  102,69,15,112,192,69                // pshufd        $0x45,%xmm8,%xmm8
@@ -36604,10 +36755,10 @@
   .byte  102,68,15,96,200                    // punpcklbw     %xmm0,%xmm9
   .byte  102,68,15,97,200                    // punpcklwd     %xmm0,%xmm9
   .byte  242,69,15,16,193                    // movsd         %xmm9,%xmm8
-  .byte  235,137                             // jmp           2038 <_sk_scale_u8_sse2+0x1a>
+  .byte  235,137                             // jmp           2060 <_sk_scale_u8_sse2+0x1a>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
-  .byte  233,122,255,255,255                 // jmpq          2038 <_sk_scale_u8_sse2+0x1a>
+  .byte  233,122,255,255,255                 // jmpq          2060 <_sk_scale_u8_sse2+0x1a>
 
 HIDDEN _sk_lerp_1_float_sse2
 .globl _sk_lerp_1_float_sse2
@@ -36638,13 +36789,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,81                              // jne           2151 <_sk_lerp_u8_sse2+0x5b>
+  .byte  117,81                              // jne           2179 <_sk_lerp_u8_sse2+0x5b>
   .byte  102,69,15,110,4,18                  // movd          (%r10,%rdx,1),%xmm8
   .byte  102,68,15,96,192                    // punpcklbw     %xmm0,%xmm8
   .byte  102,68,15,97,192                    // punpcklwd     %xmm0,%xmm8
-  .byte  102,68,15,219,5,71,69,0,0           // pand          0x4547(%rip),%xmm8        # 6660 <_sk_callback_sse2+0x60a>
+  .byte  102,68,15,219,5,95,69,0,0           // pand          0x455f(%rip),%xmm8        # 66a0 <_sk_callback_sse2+0x622>
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,75,69,0,0                // mulps         0x454b(%rip),%xmm8        # 6670 <_sk_callback_sse2+0x61a>
+  .byte  68,15,89,5,99,69,0,0                // mulps         0x4563(%rip),%xmm8        # 66b0 <_sk_callback_sse2+0x632>
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -36662,12 +36813,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,64                              // je            219e <_sk_lerp_u8_sse2+0xa8>
+  .byte  116,64                              // je            21c6 <_sk_lerp_u8_sse2+0xa8>
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,23                              // je            2180 <_sk_lerp_u8_sse2+0x8a>
+  .byte  116,23                              // je            21a8 <_sk_lerp_u8_sse2+0x8a>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,161                             // jne           2110 <_sk_lerp_u8_sse2+0x1a>
+  .byte  117,161                             // jne           2138 <_sk_lerp_u8_sse2+0x1a>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  102,69,15,112,192,69                // pshufd        $0x45,%xmm8,%xmm8
@@ -36676,10 +36827,10 @@
   .byte  102,68,15,96,200                    // punpcklbw     %xmm0,%xmm9
   .byte  102,68,15,97,200                    // punpcklwd     %xmm0,%xmm9
   .byte  242,69,15,16,193                    // movsd         %xmm9,%xmm8
-  .byte  233,114,255,255,255                 // jmpq          2110 <_sk_lerp_u8_sse2+0x1a>
+  .byte  233,114,255,255,255                 // jmpq          2138 <_sk_lerp_u8_sse2+0x1a>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
-  .byte  233,99,255,255,255                  // jmpq          2110 <_sk_lerp_u8_sse2+0x1a>
+  .byte  233,99,255,255,255                  // jmpq          2138 <_sk_lerp_u8_sse2+0x1a>
 
 HIDDEN _sk_lerp_565_sse2
 .globl _sk_lerp_565_sse2
@@ -36688,20 +36839,20 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,156,0,0,0                    // jne           2257 <_sk_lerp_565_sse2+0xaa>
+  .byte  15,133,156,0,0,0                    // jne           227f <_sk_lerp_565_sse2+0xaa>
   .byte  243,69,15,126,12,82                 // movq          (%r10,%rdx,2),%xmm9
   .byte  102,68,15,97,200                    // punpcklwd     %xmm0,%xmm9
-  .byte  102,68,15,111,5,177,68,0,0          // movdqa        0x44b1(%rip),%xmm8        # 6680 <_sk_callback_sse2+0x62a>
+  .byte  102,68,15,111,5,201,68,0,0          // movdqa        0x44c9(%rip),%xmm8        # 66c0 <_sk_callback_sse2+0x642>
   .byte  102,69,15,219,193                   // pand          %xmm9,%xmm8
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
-  .byte  68,15,89,5,176,68,0,0               // mulps         0x44b0(%rip),%xmm8        # 6690 <_sk_callback_sse2+0x63a>
-  .byte  102,68,15,111,21,183,68,0,0         // movdqa        0x44b7(%rip),%xmm10        # 66a0 <_sk_callback_sse2+0x64a>
+  .byte  68,15,89,5,200,68,0,0               // mulps         0x44c8(%rip),%xmm8        # 66d0 <_sk_callback_sse2+0x652>
+  .byte  102,68,15,111,21,207,68,0,0         // movdqa        0x44cf(%rip),%xmm10        # 66e0 <_sk_callback_sse2+0x662>
   .byte  102,69,15,219,209                   // pand          %xmm9,%xmm10
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
-  .byte  68,15,89,21,182,68,0,0              // mulps         0x44b6(%rip),%xmm10        # 66b0 <_sk_callback_sse2+0x65a>
-  .byte  102,68,15,219,13,189,68,0,0         // pand          0x44bd(%rip),%xmm9        # 66c0 <_sk_callback_sse2+0x66a>
+  .byte  68,15,89,21,206,68,0,0              // mulps         0x44ce(%rip),%xmm10        # 66f0 <_sk_callback_sse2+0x672>
+  .byte  102,68,15,219,13,213,68,0,0         // pand          0x44d5(%rip),%xmm9        # 6700 <_sk_callback_sse2+0x682>
   .byte  69,15,91,201                        // cvtdq2ps      %xmm9,%xmm9
-  .byte  68,15,89,13,193,68,0,0              // mulps         0x44c1(%rip),%xmm9        # 66d0 <_sk_callback_sse2+0x67a>
+  .byte  68,15,89,13,217,68,0,0              // mulps         0x44d9(%rip),%xmm9        # 6710 <_sk_callback_sse2+0x692>
   .byte  15,92,196                           // subps         %xmm4,%xmm0
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
@@ -36726,22 +36877,22 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,59                              // je            229f <_sk_lerp_565_sse2+0xf2>
+  .byte  116,59                              // je            22c7 <_sk_lerp_565_sse2+0xf2>
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,27                              // je            228a <_sk_lerp_565_sse2+0xdd>
+  .byte  116,27                              // je            22b2 <_sk_lerp_565_sse2+0xdd>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  15,133,77,255,255,255               // jne           21c6 <_sk_lerp_565_sse2+0x19>
+  .byte  15,133,77,255,255,255               // jne           21ee <_sk_lerp_565_sse2+0x19>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  102,69,15,112,200,69                // pshufd        $0x45,%xmm8,%xmm9
   .byte  102,69,15,110,4,82                  // movd          (%r10,%rdx,2),%xmm8
   .byte  102,68,15,97,192                    // punpcklwd     %xmm0,%xmm8
   .byte  242,69,15,16,200                    // movsd         %xmm8,%xmm9
-  .byte  233,39,255,255,255                  // jmpq          21c6 <_sk_lerp_565_sse2+0x19>
+  .byte  233,39,255,255,255                  // jmpq          21ee <_sk_lerp_565_sse2+0x19>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,68,15,110,200                   // movd          %eax,%xmm9
-  .byte  233,24,255,255,255                  // jmpq          21c6 <_sk_lerp_565_sse2+0x19>
+  .byte  233,24,255,255,255                  // jmpq          21ee <_sk_lerp_565_sse2+0x19>
 
 HIDDEN _sk_load_tables_sse2
 .globl _sk_load_tables_sse2
@@ -36750,12 +36901,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,36,1,0,0                     // jne           23e0 <_sk_load_tables_sse2+0x132>
+  .byte  15,133,36,1,0,0                     // jne           2408 <_sk_load_tables_sse2+0x132>
   .byte  243,69,15,111,12,145                // movdqu        (%r9,%rdx,4),%xmm9
   .byte  65,87                               // push          %r15
   .byte  65,86                               // push          %r14
   .byte  83                                  // push          %rbx
-  .byte  102,68,15,111,5,16,68,0,0           // movdqa        0x4410(%rip),%xmm8        # 66e0 <_sk_callback_sse2+0x68a>
+  .byte  102,68,15,111,5,40,68,0,0           // movdqa        0x4428(%rip),%xmm8        # 6720 <_sk_callback_sse2+0x6a2>
   .byte  102,65,15,111,193                   // movdqa        %xmm9,%xmm0
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,15,112,200,78                   // pshufd        $0x4e,%xmm0,%xmm1
@@ -36811,7 +36962,7 @@
   .byte  65,15,20,208                        // unpcklps      %xmm8,%xmm2
   .byte  102,65,15,114,209,24                // psrld         $0x18,%xmm9
   .byte  65,15,91,217                        // cvtdq2ps      %xmm9,%xmm3
-  .byte  15,89,29,25,67,0,0                  // mulps         0x4319(%rip),%xmm3        # 66f0 <_sk_callback_sse2+0x69a>
+  .byte  15,89,29,49,67,0,0                  // mulps         0x4331(%rip),%xmm3        # 6730 <_sk_callback_sse2+0x6b2>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
   .byte  65,94                               // pop           %r14
@@ -36820,18 +36971,18 @@
   .byte  69,137,194                          // mov           %r8d,%r10d
   .byte  65,128,226,3                        // and           $0x3,%r10b
   .byte  65,128,250,1                        // cmp           $0x1,%r10b
-  .byte  116,45                              // je            241a <_sk_load_tables_sse2+0x16c>
+  .byte  116,45                              // je            2442 <_sk_load_tables_sse2+0x16c>
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
   .byte  65,128,250,2                        // cmp           $0x2,%r10b
-  .byte  116,23                              // je            240f <_sk_load_tables_sse2+0x161>
+  .byte  116,23                              // je            2437 <_sk_load_tables_sse2+0x161>
   .byte  65,128,250,3                        // cmp           $0x3,%r10b
-  .byte  15,133,192,254,255,255              // jne           22c2 <_sk_load_tables_sse2+0x14>
+  .byte  15,133,192,254,255,255              // jne           22ea <_sk_load_tables_sse2+0x14>
   .byte  102,65,15,110,68,145,8              // movd          0x8(%r9,%rdx,4),%xmm0
   .byte  102,68,15,112,200,69                // pshufd        $0x45,%xmm0,%xmm9
   .byte  102,69,15,18,12,145                 // movlpd        (%r9,%rdx,4),%xmm9
-  .byte  233,168,254,255,255                 // jmpq          22c2 <_sk_load_tables_sse2+0x14>
+  .byte  233,168,254,255,255                 // jmpq          22ea <_sk_load_tables_sse2+0x14>
   .byte  102,69,15,110,12,145                // movd          (%r9,%rdx,4),%xmm9
-  .byte  233,157,254,255,255                 // jmpq          22c2 <_sk_load_tables_sse2+0x14>
+  .byte  233,157,254,255,255                 // jmpq          22ea <_sk_load_tables_sse2+0x14>
 
 HIDDEN _sk_load_tables_u16_be_sse2
 .globl _sk_load_tables_u16_be_sse2
@@ -36841,7 +36992,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,149,0,0,0,0               // lea           0x0(,%rdx,4),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,101,1,0,0                    // jne           25a0 <_sk_load_tables_u16_be_sse2+0x17b>
+  .byte  15,133,101,1,0,0                    // jne           25c8 <_sk_load_tables_u16_be_sse2+0x17b>
   .byte  102,67,15,16,4,81                   // movupd        (%r9,%r10,2),%xmm0
   .byte  102,67,15,16,76,81,16               // movupd        0x10(%r9,%r10,2),%xmm1
   .byte  65,87                               // push          %r15
@@ -36853,7 +37004,7 @@
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,97,200                       // punpcklwd     %xmm0,%xmm1
   .byte  102,68,15,105,200                   // punpckhwd     %xmm0,%xmm9
-  .byte  102,68,15,111,21,142,66,0,0         // movdqa        0x428e(%rip),%xmm10        # 6700 <_sk_callback_sse2+0x6aa>
+  .byte  102,68,15,111,21,166,66,0,0         // movdqa        0x42a6(%rip),%xmm10        # 6740 <_sk_callback_sse2+0x6c2>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,194                   // pand          %xmm10,%xmm0
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
@@ -36915,7 +37066,7 @@
   .byte  102,65,15,235,217                   // por           %xmm9,%xmm3
   .byte  102,65,15,97,216                    // punpcklwd     %xmm8,%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,121,65,0,0                 // mulps         0x4179(%rip),%xmm3        # 6710 <_sk_callback_sse2+0x6ba>
+  .byte  15,89,29,145,65,0,0                 // mulps         0x4191(%rip),%xmm3        # 6750 <_sk_callback_sse2+0x6d2>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
   .byte  65,94                               // pop           %r14
@@ -36923,17 +37074,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,67,15,16,4,81                   // movsd         (%r9,%r10,2),%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,17                              // jne           25bd <_sk_load_tables_u16_be_sse2+0x198>
+  .byte  117,17                              // jne           25e5 <_sk_load_tables_u16_be_sse2+0x198>
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
   .byte  102,15,20,193                       // unpcklpd      %xmm1,%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
-  .byte  233,139,254,255,255                 // jmpq          2448 <_sk_load_tables_u16_be_sse2+0x23>
+  .byte  233,139,254,255,255                 // jmpq          2470 <_sk_load_tables_u16_be_sse2+0x23>
   .byte  102,67,15,22,68,81,8                // movhpd        0x8(%r9,%r10,2),%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,118,254,255,255              // jb            2448 <_sk_load_tables_u16_be_sse2+0x23>
+  .byte  15,130,118,254,255,255              // jb            2470 <_sk_load_tables_u16_be_sse2+0x23>
   .byte  242,67,15,16,76,81,16               // movsd         0x10(%r9,%r10,2),%xmm1
-  .byte  233,106,254,255,255                 // jmpq          2448 <_sk_load_tables_u16_be_sse2+0x23>
+  .byte  233,106,254,255,255                 // jmpq          2470 <_sk_load_tables_u16_be_sse2+0x23>
 
 HIDDEN _sk_load_tables_rgb_u16_be_sse2
 .globl _sk_load_tables_rgb_u16_be_sse2
@@ -36943,7 +37094,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  76,141,20,82                        // lea           (%rdx,%rdx,2),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,84,1,0,0                     // jne           2744 <_sk_load_tables_rgb_u16_be_sse2+0x166>
+  .byte  15,133,84,1,0,0                     // jne           276c <_sk_load_tables_rgb_u16_be_sse2+0x166>
   .byte  243,71,15,111,28,81                 // movdqu        (%r9,%r10,2),%xmm11
   .byte  243,67,15,111,76,81,8               // movdqu        0x8(%r9,%r10,2),%xmm1
   .byte  102,15,115,217,4                    // psrldq        $0x4,%xmm1
@@ -36958,7 +37109,7 @@
   .byte  102,68,15,97,208                    // punpcklwd     %xmm0,%xmm10
   .byte  102,65,15,111,195                   // movdqa        %xmm11,%xmm0
   .byte  102,65,15,97,194                    // punpcklwd     %xmm10,%xmm0
-  .byte  102,68,15,111,5,232,64,0,0          // movdqa        0x40e8(%rip),%xmm8        # 6720 <_sk_callback_sse2+0x6ca>
+  .byte  102,68,15,111,5,0,65,0,0            // movdqa        0x4100(%rip),%xmm8        # 6760 <_sk_callback_sse2+0x6e2>
   .byte  102,15,112,200,78                   // pshufd        $0x4e,%xmm0,%xmm1
   .byte  102,65,15,219,192                   // pand          %xmm8,%xmm0
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
@@ -37014,7 +37165,7 @@
   .byte  15,20,211                           // unpcklps      %xmm3,%xmm2
   .byte  65,15,20,208                        // unpcklps      %xmm8,%xmm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,243,63,0,0                 // movaps        0x3ff3(%rip),%xmm3        # 6730 <_sk_callback_sse2+0x6da>
+  .byte  15,40,29,11,64,0,0                  // movaps        0x400b(%rip),%xmm3        # 6770 <_sk_callback_sse2+0x6f2>
   .byte  91                                  // pop           %rbx
   .byte  65,94                               // pop           %r14
   .byte  65,95                               // pop           %r15
@@ -37023,21 +37174,21 @@
   .byte  102,71,15,196,92,81,4,2             // pinsrw        $0x2,0x4(%r9,%r10,2),%xmm11
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,14                              // jne           276a <_sk_load_tables_rgb_u16_be_sse2+0x18c>
+  .byte  117,14                              // jne           2792 <_sk_load_tables_rgb_u16_be_sse2+0x18c>
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  102,69,15,239,210                   // pxor          %xmm10,%xmm10
-  .byte  233,172,254,255,255                 // jmpq          2616 <_sk_load_tables_rgb_u16_be_sse2+0x38>
+  .byte  233,172,254,255,255                 // jmpq          263e <_sk_load_tables_rgb_u16_be_sse2+0x38>
   .byte  102,71,15,110,84,81,6               // movd          0x6(%r9,%r10,2),%xmm10
   .byte  102,71,15,196,84,81,10,2            // pinsrw        $0x2,0xa(%r9,%r10,2),%xmm10
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,24                              // jb            279b <_sk_load_tables_rgb_u16_be_sse2+0x1bd>
+  .byte  114,24                              // jb            27c3 <_sk_load_tables_rgb_u16_be_sse2+0x1bd>
   .byte  102,67,15,110,76,81,12              // movd          0xc(%r9,%r10,2),%xmm1
   .byte  102,67,15,196,76,81,16,2            // pinsrw        $0x2,0x10(%r9,%r10,2),%xmm1
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
-  .byte  233,123,254,255,255                 // jmpq          2616 <_sk_load_tables_rgb_u16_be_sse2+0x38>
+  .byte  233,123,254,255,255                 // jmpq          263e <_sk_load_tables_rgb_u16_be_sse2+0x38>
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,114,254,255,255                 // jmpq          2616 <_sk_load_tables_rgb_u16_be_sse2+0x38>
+  .byte  233,114,254,255,255                 // jmpq          263e <_sk_load_tables_rgb_u16_be_sse2+0x38>
 
 HIDDEN _sk_byte_tables_sse2
 .globl _sk_byte_tables_sse2
@@ -37048,7 +37199,7 @@
   .byte  65,86                               // push          %r14
   .byte  83                                  // push          %rbx
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,140,63,0,0               // movaps        0x3f8c(%rip),%xmm8        # 6740 <_sk_callback_sse2+0x6ea>
+  .byte  68,15,40,5,164,63,0,0               // movaps        0x3fa4(%rip),%xmm8        # 6780 <_sk_callback_sse2+0x702>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,91,192                       // cvtps2dq      %xmm0,%xmm0
   .byte  102,73,15,126,193                   // movq          %xmm0,%r9
@@ -37076,7 +37227,7 @@
   .byte  102,65,15,96,193                    // punpcklbw     %xmm9,%xmm0
   .byte  102,65,15,97,193                    // punpcklwd     %xmm9,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,21,38,63,0,0               // movaps        0x3f26(%rip),%xmm10        # 6750 <_sk_callback_sse2+0x6fa>
+  .byte  68,15,40,21,62,63,0,0               // movaps        0x3f3e(%rip),%xmm10        # 6790 <_sk_callback_sse2+0x712>
   .byte  65,15,89,194                        // mulps         %xmm10,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
@@ -37197,7 +37348,7 @@
   .byte  102,65,15,96,193                    // punpcklbw     %xmm9,%xmm0
   .byte  102,65,15,97,193                    // punpcklwd     %xmm9,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,21,110,61,0,0              // movaps        0x3d6e(%rip),%xmm10        # 6760 <_sk_callback_sse2+0x70a>
+  .byte  68,15,40,21,134,61,0,0              // movaps        0x3d86(%rip),%xmm10        # 67a0 <_sk_callback_sse2+0x722>
   .byte  65,15,89,194                        // mulps         %xmm10,%xmm0
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
@@ -37404,15 +37555,15 @@
   .byte  69,15,88,209                        // addps         %xmm9,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,202                        // cvtdq2ps      %xmm10,%xmm9
-  .byte  68,15,89,13,162,58,0,0              // mulps         0x3aa2(%rip),%xmm9        # 6770 <_sk_callback_sse2+0x71a>
-  .byte  68,15,84,21,170,58,0,0              // andps         0x3aaa(%rip),%xmm10        # 6780 <_sk_callback_sse2+0x72a>
-  .byte  68,15,86,21,178,58,0,0              // orps          0x3ab2(%rip),%xmm10        # 6790 <_sk_callback_sse2+0x73a>
-  .byte  68,15,88,13,186,58,0,0              // addps         0x3aba(%rip),%xmm9        # 67a0 <_sk_callback_sse2+0x74a>
-  .byte  68,15,40,37,194,58,0,0              // movaps        0x3ac2(%rip),%xmm12        # 67b0 <_sk_callback_sse2+0x75a>
+  .byte  68,15,89,13,186,58,0,0              // mulps         0x3aba(%rip),%xmm9        # 67b0 <_sk_callback_sse2+0x732>
+  .byte  68,15,84,21,194,58,0,0              // andps         0x3ac2(%rip),%xmm10        # 67c0 <_sk_callback_sse2+0x742>
+  .byte  68,15,86,21,202,58,0,0              // orps          0x3aca(%rip),%xmm10        # 67d0 <_sk_callback_sse2+0x752>
+  .byte  68,15,88,13,210,58,0,0              // addps         0x3ad2(%rip),%xmm9        # 67e0 <_sk_callback_sse2+0x762>
+  .byte  68,15,40,37,218,58,0,0              // movaps        0x3ada(%rip),%xmm12        # 67f0 <_sk_callback_sse2+0x772>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,88,21,194,58,0,0              // addps         0x3ac2(%rip),%xmm10        # 67c0 <_sk_callback_sse2+0x76a>
-  .byte  68,15,40,37,202,58,0,0              // movaps        0x3aca(%rip),%xmm12        # 67d0 <_sk_callback_sse2+0x77a>
+  .byte  68,15,88,21,218,58,0,0              // addps         0x3ada(%rip),%xmm10        # 6800 <_sk_callback_sse2+0x782>
+  .byte  68,15,40,37,226,58,0,0              // movaps        0x3ae2(%rip),%xmm12        # 6810 <_sk_callback_sse2+0x792>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
@@ -37420,22 +37571,22 @@
   .byte  69,15,91,226                        // cvtdq2ps      %xmm10,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,194,236,1                     // cmpltps       %xmm12,%xmm13
-  .byte  68,15,40,21,180,58,0,0              // movaps        0x3ab4(%rip),%xmm10        # 67e0 <_sk_callback_sse2+0x78a>
+  .byte  68,15,40,21,204,58,0,0              // movaps        0x3acc(%rip),%xmm10        # 6820 <_sk_callback_sse2+0x7a2>
   .byte  69,15,84,234                        // andps         %xmm10,%xmm13
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,92,236                        // subps         %xmm12,%xmm13
-  .byte  68,15,88,13,168,58,0,0              // addps         0x3aa8(%rip),%xmm9        # 67f0 <_sk_callback_sse2+0x79a>
-  .byte  68,15,40,37,176,58,0,0              // movaps        0x3ab0(%rip),%xmm12        # 6800 <_sk_callback_sse2+0x7aa>
+  .byte  68,15,88,13,192,58,0,0              // addps         0x3ac0(%rip),%xmm9        # 6830 <_sk_callback_sse2+0x7b2>
+  .byte  68,15,40,37,200,58,0,0              // movaps        0x3ac8(%rip),%xmm12        # 6840 <_sk_callback_sse2+0x7c2>
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,40,37,176,58,0,0              // movaps        0x3ab0(%rip),%xmm12        # 6810 <_sk_callback_sse2+0x7ba>
+  .byte  68,15,40,37,200,58,0,0              // movaps        0x3ac8(%rip),%xmm12        # 6850 <_sk_callback_sse2+0x7d2>
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
-  .byte  68,15,40,45,180,58,0,0              // movaps        0x3ab4(%rip),%xmm13        # 6820 <_sk_callback_sse2+0x7ca>
+  .byte  68,15,40,45,204,58,0,0              // movaps        0x3acc(%rip),%xmm13        # 6860 <_sk_callback_sse2+0x7e2>
   .byte  69,15,94,236                        // divps         %xmm12,%xmm13
   .byte  69,15,88,233                        // addps         %xmm9,%xmm13
-  .byte  68,15,89,45,180,58,0,0              // mulps         0x3ab4(%rip),%xmm13        # 6830 <_sk_callback_sse2+0x7da>
+  .byte  68,15,89,45,204,58,0,0              // mulps         0x3acc(%rip),%xmm13        # 6870 <_sk_callback_sse2+0x7f2>
   .byte  102,69,15,91,205                    // cvtps2dq      %xmm13,%xmm9
   .byte  243,68,15,16,96,20                  // movss         0x14(%rax),%xmm12
   .byte  69,15,198,228,0                     // shufps        $0x0,%xmm12,%xmm12
@@ -37471,15 +37622,15 @@
   .byte  69,15,88,209                        // addps         %xmm9,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,202                        // cvtdq2ps      %xmm10,%xmm9
-  .byte  68,15,89,13,52,58,0,0               // mulps         0x3a34(%rip),%xmm9        # 6840 <_sk_callback_sse2+0x7ea>
-  .byte  68,15,84,21,60,58,0,0               // andps         0x3a3c(%rip),%xmm10        # 6850 <_sk_callback_sse2+0x7fa>
-  .byte  68,15,86,21,68,58,0,0               // orps          0x3a44(%rip),%xmm10        # 6860 <_sk_callback_sse2+0x80a>
-  .byte  68,15,88,13,76,58,0,0               // addps         0x3a4c(%rip),%xmm9        # 6870 <_sk_callback_sse2+0x81a>
-  .byte  68,15,40,37,84,58,0,0               // movaps        0x3a54(%rip),%xmm12        # 6880 <_sk_callback_sse2+0x82a>
+  .byte  68,15,89,13,76,58,0,0               // mulps         0x3a4c(%rip),%xmm9        # 6880 <_sk_callback_sse2+0x802>
+  .byte  68,15,84,21,84,58,0,0               // andps         0x3a54(%rip),%xmm10        # 6890 <_sk_callback_sse2+0x812>
+  .byte  68,15,86,21,92,58,0,0               // orps          0x3a5c(%rip),%xmm10        # 68a0 <_sk_callback_sse2+0x822>
+  .byte  68,15,88,13,100,58,0,0              // addps         0x3a64(%rip),%xmm9        # 68b0 <_sk_callback_sse2+0x832>
+  .byte  68,15,40,37,108,58,0,0              // movaps        0x3a6c(%rip),%xmm12        # 68c0 <_sk_callback_sse2+0x842>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,88,21,84,58,0,0               // addps         0x3a54(%rip),%xmm10        # 6890 <_sk_callback_sse2+0x83a>
-  .byte  68,15,40,37,92,58,0,0               // movaps        0x3a5c(%rip),%xmm12        # 68a0 <_sk_callback_sse2+0x84a>
+  .byte  68,15,88,21,108,58,0,0              // addps         0x3a6c(%rip),%xmm10        # 68d0 <_sk_callback_sse2+0x852>
+  .byte  68,15,40,37,116,58,0,0              // movaps        0x3a74(%rip),%xmm12        # 68e0 <_sk_callback_sse2+0x862>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
@@ -37487,22 +37638,22 @@
   .byte  69,15,91,226                        // cvtdq2ps      %xmm10,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,194,236,1                     // cmpltps       %xmm12,%xmm13
-  .byte  68,15,40,21,70,58,0,0               // movaps        0x3a46(%rip),%xmm10        # 68b0 <_sk_callback_sse2+0x85a>
+  .byte  68,15,40,21,94,58,0,0               // movaps        0x3a5e(%rip),%xmm10        # 68f0 <_sk_callback_sse2+0x872>
   .byte  69,15,84,234                        // andps         %xmm10,%xmm13
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,92,236                        // subps         %xmm12,%xmm13
-  .byte  68,15,88,13,58,58,0,0               // addps         0x3a3a(%rip),%xmm9        # 68c0 <_sk_callback_sse2+0x86a>
-  .byte  68,15,40,37,66,58,0,0               // movaps        0x3a42(%rip),%xmm12        # 68d0 <_sk_callback_sse2+0x87a>
+  .byte  68,15,88,13,82,58,0,0               // addps         0x3a52(%rip),%xmm9        # 6900 <_sk_callback_sse2+0x882>
+  .byte  68,15,40,37,90,58,0,0               // movaps        0x3a5a(%rip),%xmm12        # 6910 <_sk_callback_sse2+0x892>
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,40,37,66,58,0,0               // movaps        0x3a42(%rip),%xmm12        # 68e0 <_sk_callback_sse2+0x88a>
+  .byte  68,15,40,37,90,58,0,0               // movaps        0x3a5a(%rip),%xmm12        # 6920 <_sk_callback_sse2+0x8a2>
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
-  .byte  68,15,40,45,70,58,0,0               // movaps        0x3a46(%rip),%xmm13        # 68f0 <_sk_callback_sse2+0x89a>
+  .byte  68,15,40,45,94,58,0,0               // movaps        0x3a5e(%rip),%xmm13        # 6930 <_sk_callback_sse2+0x8b2>
   .byte  69,15,94,236                        // divps         %xmm12,%xmm13
   .byte  69,15,88,233                        // addps         %xmm9,%xmm13
-  .byte  68,15,89,45,70,58,0,0               // mulps         0x3a46(%rip),%xmm13        # 6900 <_sk_callback_sse2+0x8aa>
+  .byte  68,15,89,45,94,58,0,0               // mulps         0x3a5e(%rip),%xmm13        # 6940 <_sk_callback_sse2+0x8c2>
   .byte  102,69,15,91,205                    // cvtps2dq      %xmm13,%xmm9
   .byte  243,68,15,16,96,20                  // movss         0x14(%rax),%xmm12
   .byte  69,15,198,228,0                     // shufps        $0x0,%xmm12,%xmm12
@@ -37538,15 +37689,15 @@
   .byte  69,15,88,209                        // addps         %xmm9,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,202                        // cvtdq2ps      %xmm10,%xmm9
-  .byte  68,15,89,13,198,57,0,0              // mulps         0x39c6(%rip),%xmm9        # 6910 <_sk_callback_sse2+0x8ba>
-  .byte  68,15,84,21,206,57,0,0              // andps         0x39ce(%rip),%xmm10        # 6920 <_sk_callback_sse2+0x8ca>
-  .byte  68,15,86,21,214,57,0,0              // orps          0x39d6(%rip),%xmm10        # 6930 <_sk_callback_sse2+0x8da>
-  .byte  68,15,88,13,222,57,0,0              // addps         0x39de(%rip),%xmm9        # 6940 <_sk_callback_sse2+0x8ea>
-  .byte  68,15,40,37,230,57,0,0              // movaps        0x39e6(%rip),%xmm12        # 6950 <_sk_callback_sse2+0x8fa>
+  .byte  68,15,89,13,222,57,0,0              // mulps         0x39de(%rip),%xmm9        # 6950 <_sk_callback_sse2+0x8d2>
+  .byte  68,15,84,21,230,57,0,0              // andps         0x39e6(%rip),%xmm10        # 6960 <_sk_callback_sse2+0x8e2>
+  .byte  68,15,86,21,238,57,0,0              // orps          0x39ee(%rip),%xmm10        # 6970 <_sk_callback_sse2+0x8f2>
+  .byte  68,15,88,13,246,57,0,0              // addps         0x39f6(%rip),%xmm9        # 6980 <_sk_callback_sse2+0x902>
+  .byte  68,15,40,37,254,57,0,0              // movaps        0x39fe(%rip),%xmm12        # 6990 <_sk_callback_sse2+0x912>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,88,21,230,57,0,0              // addps         0x39e6(%rip),%xmm10        # 6960 <_sk_callback_sse2+0x90a>
-  .byte  68,15,40,37,238,57,0,0              // movaps        0x39ee(%rip),%xmm12        # 6970 <_sk_callback_sse2+0x91a>
+  .byte  68,15,88,21,254,57,0,0              // addps         0x39fe(%rip),%xmm10        # 69a0 <_sk_callback_sse2+0x922>
+  .byte  68,15,40,37,6,58,0,0                // movaps        0x3a06(%rip),%xmm12        # 69b0 <_sk_callback_sse2+0x932>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
@@ -37554,22 +37705,22 @@
   .byte  69,15,91,226                        // cvtdq2ps      %xmm10,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,194,236,1                     // cmpltps       %xmm12,%xmm13
-  .byte  68,15,40,21,216,57,0,0              // movaps        0x39d8(%rip),%xmm10        # 6980 <_sk_callback_sse2+0x92a>
+  .byte  68,15,40,21,240,57,0,0              // movaps        0x39f0(%rip),%xmm10        # 69c0 <_sk_callback_sse2+0x942>
   .byte  69,15,84,234                        // andps         %xmm10,%xmm13
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,92,236                        // subps         %xmm12,%xmm13
-  .byte  68,15,88,13,204,57,0,0              // addps         0x39cc(%rip),%xmm9        # 6990 <_sk_callback_sse2+0x93a>
-  .byte  68,15,40,37,212,57,0,0              // movaps        0x39d4(%rip),%xmm12        # 69a0 <_sk_callback_sse2+0x94a>
+  .byte  68,15,88,13,228,57,0,0              // addps         0x39e4(%rip),%xmm9        # 69d0 <_sk_callback_sse2+0x952>
+  .byte  68,15,40,37,236,57,0,0              // movaps        0x39ec(%rip),%xmm12        # 69e0 <_sk_callback_sse2+0x962>
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,40,37,212,57,0,0              // movaps        0x39d4(%rip),%xmm12        # 69b0 <_sk_callback_sse2+0x95a>
+  .byte  68,15,40,37,236,57,0,0              // movaps        0x39ec(%rip),%xmm12        # 69f0 <_sk_callback_sse2+0x972>
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
-  .byte  68,15,40,45,216,57,0,0              // movaps        0x39d8(%rip),%xmm13        # 69c0 <_sk_callback_sse2+0x96a>
+  .byte  68,15,40,45,240,57,0,0              // movaps        0x39f0(%rip),%xmm13        # 6a00 <_sk_callback_sse2+0x982>
   .byte  69,15,94,236                        // divps         %xmm12,%xmm13
   .byte  69,15,88,233                        // addps         %xmm9,%xmm13
-  .byte  68,15,89,45,216,57,0,0              // mulps         0x39d8(%rip),%xmm13        # 69d0 <_sk_callback_sse2+0x97a>
+  .byte  68,15,89,45,240,57,0,0              // mulps         0x39f0(%rip),%xmm13        # 6a10 <_sk_callback_sse2+0x992>
   .byte  102,69,15,91,205                    // cvtps2dq      %xmm13,%xmm9
   .byte  243,68,15,16,96,20                  // movss         0x14(%rax),%xmm12
   .byte  69,15,198,228,0                     // shufps        $0x0,%xmm12,%xmm12
@@ -37605,15 +37756,15 @@
   .byte  69,15,88,209                        // addps         %xmm9,%xmm10
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,91,202                        // cvtdq2ps      %xmm10,%xmm9
-  .byte  68,15,89,13,88,57,0,0               // mulps         0x3958(%rip),%xmm9        # 69e0 <_sk_callback_sse2+0x98a>
-  .byte  68,15,84,21,96,57,0,0               // andps         0x3960(%rip),%xmm10        # 69f0 <_sk_callback_sse2+0x99a>
-  .byte  68,15,86,21,104,57,0,0              // orps          0x3968(%rip),%xmm10        # 6a00 <_sk_callback_sse2+0x9aa>
-  .byte  68,15,88,13,112,57,0,0              // addps         0x3970(%rip),%xmm9        # 6a10 <_sk_callback_sse2+0x9ba>
-  .byte  68,15,40,37,120,57,0,0              // movaps        0x3978(%rip),%xmm12        # 6a20 <_sk_callback_sse2+0x9ca>
+  .byte  68,15,89,13,112,57,0,0              // mulps         0x3970(%rip),%xmm9        # 6a20 <_sk_callback_sse2+0x9a2>
+  .byte  68,15,84,21,120,57,0,0              // andps         0x3978(%rip),%xmm10        # 6a30 <_sk_callback_sse2+0x9b2>
+  .byte  68,15,86,21,128,57,0,0              // orps          0x3980(%rip),%xmm10        # 6a40 <_sk_callback_sse2+0x9c2>
+  .byte  68,15,88,13,136,57,0,0              // addps         0x3988(%rip),%xmm9        # 6a50 <_sk_callback_sse2+0x9d2>
+  .byte  68,15,40,37,144,57,0,0              // movaps        0x3990(%rip),%xmm12        # 6a60 <_sk_callback_sse2+0x9e2>
   .byte  69,15,89,226                        // mulps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,88,21,120,57,0,0              // addps         0x3978(%rip),%xmm10        # 6a30 <_sk_callback_sse2+0x9da>
-  .byte  68,15,40,37,128,57,0,0              // movaps        0x3980(%rip),%xmm12        # 6a40 <_sk_callback_sse2+0x9ea>
+  .byte  68,15,88,21,144,57,0,0              // addps         0x3990(%rip),%xmm10        # 6a70 <_sk_callback_sse2+0x9f2>
+  .byte  68,15,40,37,152,57,0,0              // movaps        0x3998(%rip),%xmm12        # 6a80 <_sk_callback_sse2+0xa02>
   .byte  69,15,94,226                        // divps         %xmm10,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
   .byte  69,15,89,203                        // mulps         %xmm11,%xmm9
@@ -37621,22 +37772,22 @@
   .byte  69,15,91,226                        // cvtdq2ps      %xmm10,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,194,236,1                     // cmpltps       %xmm12,%xmm13
-  .byte  68,15,40,21,106,57,0,0              // movaps        0x396a(%rip),%xmm10        # 6a50 <_sk_callback_sse2+0x9fa>
+  .byte  68,15,40,21,130,57,0,0              // movaps        0x3982(%rip),%xmm10        # 6a90 <_sk_callback_sse2+0xa12>
   .byte  69,15,84,234                        // andps         %xmm10,%xmm13
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
   .byte  69,15,40,233                        // movaps        %xmm9,%xmm13
   .byte  69,15,92,236                        // subps         %xmm12,%xmm13
-  .byte  68,15,88,13,94,57,0,0               // addps         0x395e(%rip),%xmm9        # 6a60 <_sk_callback_sse2+0xa0a>
-  .byte  68,15,40,37,102,57,0,0              // movaps        0x3966(%rip),%xmm12        # 6a70 <_sk_callback_sse2+0xa1a>
+  .byte  68,15,88,13,118,57,0,0              // addps         0x3976(%rip),%xmm9        # 6aa0 <_sk_callback_sse2+0xa22>
+  .byte  68,15,40,37,126,57,0,0              // movaps        0x397e(%rip),%xmm12        # 6ab0 <_sk_callback_sse2+0xa32>
   .byte  69,15,89,229                        // mulps         %xmm13,%xmm12
   .byte  69,15,92,204                        // subps         %xmm12,%xmm9
-  .byte  68,15,40,37,102,57,0,0              // movaps        0x3966(%rip),%xmm12        # 6a80 <_sk_callback_sse2+0xa2a>
+  .byte  68,15,40,37,126,57,0,0              // movaps        0x397e(%rip),%xmm12        # 6ac0 <_sk_callback_sse2+0xa42>
   .byte  69,15,92,229                        // subps         %xmm13,%xmm12
-  .byte  68,15,40,45,106,57,0,0              // movaps        0x396a(%rip),%xmm13        # 6a90 <_sk_callback_sse2+0xa3a>
+  .byte  68,15,40,45,130,57,0,0              // movaps        0x3982(%rip),%xmm13        # 6ad0 <_sk_callback_sse2+0xa52>
   .byte  69,15,94,236                        // divps         %xmm12,%xmm13
   .byte  69,15,88,233                        // addps         %xmm9,%xmm13
-  .byte  68,15,89,45,106,57,0,0              // mulps         0x396a(%rip),%xmm13        # 6aa0 <_sk_callback_sse2+0xa4a>
+  .byte  68,15,89,45,130,57,0,0              // mulps         0x3982(%rip),%xmm13        # 6ae0 <_sk_callback_sse2+0xa62>
   .byte  102,69,15,91,205                    // cvtps2dq      %xmm13,%xmm9
   .byte  243,68,15,16,96,20                  // movss         0x14(%rax),%xmm12
   .byte  69,15,198,228,0                     // shufps        $0x0,%xmm12,%xmm12
@@ -37653,29 +37804,29 @@
 .globl _sk_lab_to_xyz_sse2
 FUNCTION(_sk_lab_to_xyz_sse2)
 _sk_lab_to_xyz_sse2:
-  .byte  15,89,5,71,57,0,0                   // mulps         0x3947(%rip),%xmm0        # 6ab0 <_sk_callback_sse2+0xa5a>
-  .byte  68,15,40,5,79,57,0,0                // movaps        0x394f(%rip),%xmm8        # 6ac0 <_sk_callback_sse2+0xa6a>
+  .byte  15,89,5,95,57,0,0                   // mulps         0x395f(%rip),%xmm0        # 6af0 <_sk_callback_sse2+0xa72>
+  .byte  68,15,40,5,103,57,0,0               // movaps        0x3967(%rip),%xmm8        # 6b00 <_sk_callback_sse2+0xa82>
   .byte  65,15,89,200                        // mulps         %xmm8,%xmm1
-  .byte  68,15,40,13,83,57,0,0               // movaps        0x3953(%rip),%xmm9        # 6ad0 <_sk_callback_sse2+0xa7a>
+  .byte  68,15,40,13,107,57,0,0              // movaps        0x396b(%rip),%xmm9        # 6b10 <_sk_callback_sse2+0xa92>
   .byte  65,15,88,201                        // addps         %xmm9,%xmm1
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  65,15,88,209                        // addps         %xmm9,%xmm2
-  .byte  15,88,5,80,57,0,0                   // addps         0x3950(%rip),%xmm0        # 6ae0 <_sk_callback_sse2+0xa8a>
-  .byte  15,89,5,89,57,0,0                   // mulps         0x3959(%rip),%xmm0        # 6af0 <_sk_callback_sse2+0xa9a>
-  .byte  15,89,13,98,57,0,0                  // mulps         0x3962(%rip),%xmm1        # 6b00 <_sk_callback_sse2+0xaaa>
+  .byte  15,88,5,104,57,0,0                  // addps         0x3968(%rip),%xmm0        # 6b20 <_sk_callback_sse2+0xaa2>
+  .byte  15,89,5,113,57,0,0                  // mulps         0x3971(%rip),%xmm0        # 6b30 <_sk_callback_sse2+0xab2>
+  .byte  15,89,13,122,57,0,0                 // mulps         0x397a(%rip),%xmm1        # 6b40 <_sk_callback_sse2+0xac2>
   .byte  15,88,200                           // addps         %xmm0,%xmm1
-  .byte  15,89,21,104,57,0,0                 // mulps         0x3968(%rip),%xmm2        # 6b10 <_sk_callback_sse2+0xaba>
+  .byte  15,89,21,128,57,0,0                 // mulps         0x3980(%rip),%xmm2        # 6b50 <_sk_callback_sse2+0xad2>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  68,15,92,202                        // subps         %xmm2,%xmm9
   .byte  68,15,40,225                        // movaps        %xmm1,%xmm12
   .byte  69,15,89,228                        // mulps         %xmm12,%xmm12
   .byte  68,15,89,225                        // mulps         %xmm1,%xmm12
-  .byte  15,40,21,93,57,0,0                  // movaps        0x395d(%rip),%xmm2        # 6b20 <_sk_callback_sse2+0xaca>
+  .byte  15,40,21,117,57,0,0                 // movaps        0x3975(%rip),%xmm2        # 6b60 <_sk_callback_sse2+0xae2>
   .byte  68,15,40,194                        // movaps        %xmm2,%xmm8
   .byte  69,15,194,196,1                     // cmpltps       %xmm12,%xmm8
-  .byte  68,15,40,21,92,57,0,0               // movaps        0x395c(%rip),%xmm10        # 6b30 <_sk_callback_sse2+0xada>
+  .byte  68,15,40,21,116,57,0,0              // movaps        0x3974(%rip),%xmm10        # 6b70 <_sk_callback_sse2+0xaf2>
   .byte  65,15,88,202                        // addps         %xmm10,%xmm1
-  .byte  68,15,40,29,96,57,0,0               // movaps        0x3960(%rip),%xmm11        # 6b40 <_sk_callback_sse2+0xaea>
+  .byte  68,15,40,29,120,57,0,0              // movaps        0x3978(%rip),%xmm11        # 6b80 <_sk_callback_sse2+0xb02>
   .byte  65,15,89,203                        // mulps         %xmm11,%xmm1
   .byte  69,15,84,224                        // andps         %xmm8,%xmm12
   .byte  68,15,85,193                        // andnps        %xmm1,%xmm8
@@ -37699,8 +37850,8 @@
   .byte  15,84,194                           // andps         %xmm2,%xmm0
   .byte  65,15,85,209                        // andnps        %xmm9,%xmm2
   .byte  15,86,208                           // orps          %xmm0,%xmm2
-  .byte  68,15,89,5,16,57,0,0                // mulps         0x3910(%rip),%xmm8        # 6b50 <_sk_callback_sse2+0xafa>
-  .byte  15,89,21,25,57,0,0                  // mulps         0x3919(%rip),%xmm2        # 6b60 <_sk_callback_sse2+0xb0a>
+  .byte  68,15,89,5,40,57,0,0                // mulps         0x3928(%rip),%xmm8        # 6b90 <_sk_callback_sse2+0xb12>
+  .byte  15,89,21,49,57,0,0                  // mulps         0x3931(%rip),%xmm2        # 6ba0 <_sk_callback_sse2+0xb22>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -37712,13 +37863,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,46                              // jne           3287 <_sk_load_a8_sse2+0x38>
+  .byte  117,46                              // jne           32af <_sk_load_a8_sse2+0x38>
   .byte  102,65,15,110,4,18                  // movd          (%r10,%rdx,1),%xmm0
   .byte  102,15,96,192                       // punpcklbw     %xmm0,%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
-  .byte  102,15,219,5,1,57,0,0               // pand          0x3901(%rip),%xmm0        # 6b70 <_sk_callback_sse2+0xb1a>
+  .byte  102,15,219,5,25,57,0,0              // pand          0x3919(%rip),%xmm0        # 6bb0 <_sk_callback_sse2+0xb32>
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,29,7,57,0,0                   // mulps         0x3907(%rip),%xmm3        # 6b80 <_sk_callback_sse2+0xb2a>
+  .byte  15,89,29,31,57,0,0                  // mulps         0x391f(%rip),%xmm3        # 6bc0 <_sk_callback_sse2+0xb42>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
@@ -37727,12 +37878,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,54                              // je            32ca <_sk_load_a8_sse2+0x7b>
+  .byte  116,54                              // je            32f2 <_sk_load_a8_sse2+0x7b>
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            32b3 <_sk_load_a8_sse2+0x64>
+  .byte  116,21                              // je            32db <_sk_load_a8_sse2+0x64>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,195                             // jne           3267 <_sk_load_a8_sse2+0x18>
+  .byte  117,195                             // jne           328f <_sk_load_a8_sse2+0x18>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,192,69                   // pshufd        $0x45,%xmm0,%xmm0
@@ -37741,10 +37892,10 @@
   .byte  102,15,96,200                       // punpcklbw     %xmm0,%xmm1
   .byte  102,15,97,200                       // punpcklwd     %xmm0,%xmm1
   .byte  242,15,16,193                       // movsd         %xmm1,%xmm0
-  .byte  235,157                             // jmp           3267 <_sk_load_a8_sse2+0x18>
+  .byte  235,157                             // jmp           328f <_sk_load_a8_sse2+0x18>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
-  .byte  235,146                             // jmp           3267 <_sk_load_a8_sse2+0x18>
+  .byte  235,146                             // jmp           328f <_sk_load_a8_sse2+0x18>
 
 HIDDEN _sk_load_a8_dst_sse2
 .globl _sk_load_a8_dst_sse2
@@ -37753,13 +37904,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,46                              // jne           330d <_sk_load_a8_dst_sse2+0x38>
+  .byte  117,46                              // jne           3335 <_sk_load_a8_dst_sse2+0x38>
   .byte  102,65,15,110,36,18                 // movd          (%r10,%rdx,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,219,37,155,56,0,0            // pand          0x389b(%rip),%xmm4        # 6b90 <_sk_callback_sse2+0xb3a>
+  .byte  102,15,219,37,179,56,0,0            // pand          0x38b3(%rip),%xmm4        # 6bd0 <_sk_callback_sse2+0xb52>
   .byte  15,91,252                           // cvtdq2ps      %xmm4,%xmm7
-  .byte  15,89,61,161,56,0,0                 // mulps         0x38a1(%rip),%xmm7        # 6ba0 <_sk_callback_sse2+0xb4a>
+  .byte  15,89,61,185,56,0,0                 // mulps         0x38b9(%rip),%xmm7        # 6be0 <_sk_callback_sse2+0xb62>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  102,15,87,237                       // xorpd         %xmm5,%xmm5
@@ -37768,12 +37919,12 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,54                              // je            3350 <_sk_load_a8_dst_sse2+0x7b>
+  .byte  116,54                              // je            3378 <_sk_load_a8_dst_sse2+0x7b>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3339 <_sk_load_a8_dst_sse2+0x64>
+  .byte  116,21                              // je            3361 <_sk_load_a8_dst_sse2+0x64>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,195                             // jne           32ed <_sk_load_a8_dst_sse2+0x18>
+  .byte  117,195                             // jne           3315 <_sk_load_a8_dst_sse2+0x18>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,228,69                   // pshufd        $0x45,%xmm4,%xmm4
@@ -37782,10 +37933,10 @@
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  235,157                             // jmp           32ed <_sk_load_a8_dst_sse2+0x18>
+  .byte  235,157                             // jmp           3315 <_sk_load_a8_dst_sse2+0x18>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
-  .byte  235,146                             // jmp           32ed <_sk_load_a8_dst_sse2+0x18>
+  .byte  235,146                             // jmp           3315 <_sk_load_a8_dst_sse2+0x18>
 
 HIDDEN _sk_gather_a8_sse2
 .globl _sk_gather_a8_sse2
@@ -37827,7 +37978,7 @@
   .byte  102,15,96,193                       // punpcklbw     %xmm1,%xmm0
   .byte  102,15,97,193                       // punpcklwd     %xmm1,%xmm0
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,29,194,55,0,0                 // mulps         0x37c2(%rip),%xmm3        # 6bb0 <_sk_callback_sse2+0xb5a>
+  .byte  15,89,29,218,55,0,0                 // mulps         0x37da(%rip),%xmm3        # 6bf0 <_sk_callback_sse2+0xb72>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
@@ -37842,7 +37993,7 @@
 _sk_store_a8_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  68,15,40,5,180,55,0,0               // movaps        0x37b4(%rip),%xmm8        # 6bc0 <_sk_callback_sse2+0xb6a>
+  .byte  68,15,40,5,204,55,0,0               // movaps        0x37cc(%rip),%xmm8        # 6c00 <_sk_callback_sse2+0xb82>
   .byte  68,15,89,195                        // mulps         %xmm3,%xmm8
   .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
   .byte  102,65,15,114,240,16                // pslld         $0x10,%xmm8
@@ -37850,7 +38001,7 @@
   .byte  102,69,15,107,192                   // packssdw      %xmm8,%xmm8
   .byte  102,69,15,103,192                   // packuswb      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,13                              // jne           343d <_sk_store_a8_sse2+0x3e>
+  .byte  117,13                              // jne           3465 <_sk_store_a8_sse2+0x3e>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  65,137,4,18                         // mov           %eax,(%r10,%rdx,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -37860,24 +38011,24 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,59                              // je            348f <_sk_store_a8_sse2+0x90>
+  .byte  116,59                              // je            34b7 <_sk_store_a8_sse2+0x90>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,22                              // je            3470 <_sk_store_a8_sse2+0x71>
+  .byte  116,22                              // je            3498 <_sk_store_a8_sse2+0x71>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,217                             // jne           3439 <_sk_store_a8_sse2+0x3a>
+  .byte  117,217                             // jne           3461 <_sk_store_a8_sse2+0x3a>
   .byte  102,68,15,127,68,36,232             // movdqa        %xmm8,-0x18(%rsp)
   .byte  138,68,36,240                       // mov           -0x10(%rsp),%al
   .byte  65,136,68,18,2                      // mov           %al,0x2(%r10,%rdx,1)
-  .byte  102,68,15,219,5,87,55,0,0           // pand          0x3757(%rip),%xmm8        # 6bd0 <_sk_callback_sse2+0xb7a>
+  .byte  102,68,15,219,5,111,55,0,0          // pand          0x376f(%rip),%xmm8        # 6c10 <_sk_callback_sse2+0xb92>
   .byte  102,69,15,103,192                   // packuswb      %xmm8,%xmm8
   .byte  102,69,15,103,192                   // packuswb      %xmm8,%xmm8
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  102,65,137,4,18                     // mov           %ax,(%r10,%rdx,1)
-  .byte  235,170                             // jmp           3439 <_sk_store_a8_sse2+0x3a>
+  .byte  235,170                             // jmp           3461 <_sk_store_a8_sse2+0x3a>
   .byte  102,68,15,127,68,36,216             // movdqa        %xmm8,-0x28(%rsp)
   .byte  138,68,36,216                       // mov           -0x28(%rsp),%al
   .byte  65,136,4,18                         // mov           %al,(%r10,%rdx,1)
-  .byte  235,153                             // jmp           3439 <_sk_store_a8_sse2+0x3a>
+  .byte  235,153                             // jmp           3461 <_sk_store_a8_sse2+0x3a>
 
 HIDDEN _sk_load_g8_sse2
 .globl _sk_load_g8_sse2
@@ -37886,27 +38037,27 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,49                              // jne           34db <_sk_load_g8_sse2+0x3b>
+  .byte  117,49                              // jne           3503 <_sk_load_g8_sse2+0x3b>
   .byte  102,65,15,110,4,18                  // movd          (%r10,%rdx,1),%xmm0
   .byte  102,15,96,192                       // punpcklbw     %xmm0,%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
-  .byte  102,15,219,5,32,55,0,0              // pand          0x3720(%rip),%xmm0        # 6be0 <_sk_callback_sse2+0xb8a>
+  .byte  102,15,219,5,56,55,0,0              // pand          0x3738(%rip),%xmm0        # 6c20 <_sk_callback_sse2+0xba2>
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,38,55,0,0                   // mulps         0x3726(%rip),%xmm0        # 6bf0 <_sk_callback_sse2+0xb9a>
+  .byte  15,89,5,62,55,0,0                   // mulps         0x373e(%rip),%xmm0        # 6c30 <_sk_callback_sse2+0xbb2>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,45,55,0,0                  // movaps        0x372d(%rip),%xmm3        # 6c00 <_sk_callback_sse2+0xbaa>
+  .byte  15,40,29,69,55,0,0                  // movaps        0x3745(%rip),%xmm3        # 6c40 <_sk_callback_sse2+0xbc2>
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,54                              // je            351e <_sk_load_g8_sse2+0x7e>
+  .byte  116,54                              // je            3546 <_sk_load_g8_sse2+0x7e>
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3507 <_sk_load_g8_sse2+0x67>
+  .byte  116,21                              // je            352f <_sk_load_g8_sse2+0x67>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,192                             // jne           34b8 <_sk_load_g8_sse2+0x18>
+  .byte  117,192                             // jne           34e0 <_sk_load_g8_sse2+0x18>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,192,69                   // pshufd        $0x45,%xmm0,%xmm0
@@ -37915,10 +38066,10 @@
   .byte  102,15,96,200                       // punpcklbw     %xmm0,%xmm1
   .byte  102,15,97,200                       // punpcklwd     %xmm0,%xmm1
   .byte  242,15,16,193                       // movsd         %xmm1,%xmm0
-  .byte  235,154                             // jmp           34b8 <_sk_load_g8_sse2+0x18>
+  .byte  235,154                             // jmp           34e0 <_sk_load_g8_sse2+0x18>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
-  .byte  235,143                             // jmp           34b8 <_sk_load_g8_sse2+0x18>
+  .byte  235,143                             // jmp           34e0 <_sk_load_g8_sse2+0x18>
 
 HIDDEN _sk_load_g8_dst_sse2
 .globl _sk_load_g8_dst_sse2
@@ -37927,27 +38078,27 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,49                              // jne           3564 <_sk_load_g8_dst_sse2+0x3b>
+  .byte  117,49                              // jne           358c <_sk_load_g8_dst_sse2+0x3b>
   .byte  102,65,15,110,36,18                 // movd          (%r10,%rdx,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,219,37,199,54,0,0            // pand          0x36c7(%rip),%xmm4        # 6c10 <_sk_callback_sse2+0xbba>
+  .byte  102,15,219,37,223,54,0,0            // pand          0x36df(%rip),%xmm4        # 6c50 <_sk_callback_sse2+0xbd2>
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,37,205,54,0,0                 // mulps         0x36cd(%rip),%xmm4        # 6c20 <_sk_callback_sse2+0xbca>
+  .byte  15,89,37,229,54,0,0                 // mulps         0x36e5(%rip),%xmm4        # 6c60 <_sk_callback_sse2+0xbe2>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,61,212,54,0,0                 // movaps        0x36d4(%rip),%xmm7        # 6c30 <_sk_callback_sse2+0xbda>
+  .byte  15,40,61,236,54,0,0                 // movaps        0x36ec(%rip),%xmm7        # 6c70 <_sk_callback_sse2+0xbf2>
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
   .byte  15,40,244                           // movaps        %xmm4,%xmm6
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,54                              // je            35a7 <_sk_load_g8_dst_sse2+0x7e>
+  .byte  116,54                              // je            35cf <_sk_load_g8_dst_sse2+0x7e>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3590 <_sk_load_g8_dst_sse2+0x67>
+  .byte  116,21                              // je            35b8 <_sk_load_g8_dst_sse2+0x67>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,192                             // jne           3541 <_sk_load_g8_dst_sse2+0x18>
+  .byte  117,192                             // jne           3569 <_sk_load_g8_dst_sse2+0x18>
   .byte  65,15,182,68,18,2                   // movzbl        0x2(%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,228,69                   // pshufd        $0x45,%xmm4,%xmm4
@@ -37956,10 +38107,10 @@
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  235,154                             // jmp           3541 <_sk_load_g8_dst_sse2+0x18>
+  .byte  235,154                             // jmp           3569 <_sk_load_g8_dst_sse2+0x18>
   .byte  65,15,182,4,18                      // movzbl        (%r10,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
-  .byte  235,143                             // jmp           3541 <_sk_load_g8_dst_sse2+0x18>
+  .byte  235,143                             // jmp           3569 <_sk_load_g8_dst_sse2+0x18>
 
 HIDDEN _sk_gather_g8_sse2
 .globl _sk_gather_g8_sse2
@@ -38001,9 +38152,9 @@
   .byte  102,15,96,193                       // punpcklbw     %xmm1,%xmm0
   .byte  102,15,97,193                       // punpcklwd     %xmm1,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,251,53,0,0                  // mulps         0x35fb(%rip),%xmm0        # 6c40 <_sk_callback_sse2+0xbea>
+  .byte  15,89,5,19,54,0,0                   // mulps         0x3613(%rip),%xmm0        # 6c80 <_sk_callback_sse2+0xc02>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,2,54,0,0                   // movaps        0x3602(%rip),%xmm3        # 6c50 <_sk_callback_sse2+0xbfa>
+  .byte  15,40,29,26,54,0,0                  // movaps        0x361a(%rip),%xmm3        # 6c90 <_sk_callback_sse2+0xc12>
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  91                                  // pop           %rbx
@@ -38017,9 +38168,9 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  73,137,193                          // mov           %rax,%r9
   .byte  77,133,201                          // test          %r9,%r9
-  .byte  116,5                               // je            3667 <_sk_gather_i8_sse2+0xf>
+  .byte  116,5                               // je            368f <_sk_gather_i8_sse2+0xf>
   .byte  76,137,200                          // mov           %r9,%rax
-  .byte  235,2                               // jmp           3669 <_sk_gather_i8_sse2+0x11>
+  .byte  235,2                               // jmp           3691 <_sk_gather_i8_sse2+0x11>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  85                                  // push          %rbp
   .byte  65,86                               // push          %r14
@@ -38071,11 +38222,11 @@
   .byte  102,66,15,110,76,149,0              // movd          0x0(%rbp,%r10,4),%xmm1
   .byte  102,68,15,98,201                    // punpckldq     %xmm1,%xmm9
   .byte  102,68,15,98,200                    // punpckldq     %xmm0,%xmm9
-  .byte  102,15,111,21,27,53,0,0             // movdqa        0x351b(%rip),%xmm2        # 6c60 <_sk_callback_sse2+0xc0a>
+  .byte  102,15,111,21,51,53,0,0             // movdqa        0x3533(%rip),%xmm2        # 6ca0 <_sk_callback_sse2+0xc22>
   .byte  102,65,15,111,193                   // movdqa        %xmm9,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,23,53,0,0                // movaps        0x3517(%rip),%xmm8        # 6c70 <_sk_callback_sse2+0xc1a>
+  .byte  68,15,40,5,47,53,0,0                // movaps        0x352f(%rip),%xmm8        # 6cb0 <_sk_callback_sse2+0xc32>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -38103,42 +38254,42 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,83                              // jne           37fa <_sk_load_565_sse2+0x5d>
+  .byte  117,83                              // jne           3822 <_sk_load_565_sse2+0x5d>
   .byte  243,65,15,126,20,82                 // movq          (%r10,%rdx,2),%xmm2
   .byte  102,15,97,208                       // punpcklwd     %xmm0,%xmm2
-  .byte  102,15,111,5,199,52,0,0             // movdqa        0x34c7(%rip),%xmm0        # 6c80 <_sk_callback_sse2+0xc2a>
+  .byte  102,15,111,5,223,52,0,0             // movdqa        0x34df(%rip),%xmm0        # 6cc0 <_sk_callback_sse2+0xc42>
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,201,52,0,0                  // mulps         0x34c9(%rip),%xmm0        # 6c90 <_sk_callback_sse2+0xc3a>
-  .byte  102,15,111,13,209,52,0,0            // movdqa        0x34d1(%rip),%xmm1        # 6ca0 <_sk_callback_sse2+0xc4a>
+  .byte  15,89,5,225,52,0,0                  // mulps         0x34e1(%rip),%xmm0        # 6cd0 <_sk_callback_sse2+0xc52>
+  .byte  102,15,111,13,233,52,0,0            // movdqa        0x34e9(%rip),%xmm1        # 6ce0 <_sk_callback_sse2+0xc62>
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,211,52,0,0                 // mulps         0x34d3(%rip),%xmm1        # 6cb0 <_sk_callback_sse2+0xc5a>
-  .byte  102,15,219,21,219,52,0,0            // pand          0x34db(%rip),%xmm2        # 6cc0 <_sk_callback_sse2+0xc6a>
+  .byte  15,89,13,235,52,0,0                 // mulps         0x34eb(%rip),%xmm1        # 6cf0 <_sk_callback_sse2+0xc72>
+  .byte  102,15,219,21,243,52,0,0            // pand          0x34f3(%rip),%xmm2        # 6d00 <_sk_callback_sse2+0xc82>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,225,52,0,0                 // mulps         0x34e1(%rip),%xmm2        # 6cd0 <_sk_callback_sse2+0xc7a>
+  .byte  15,89,21,249,52,0,0                 // mulps         0x34f9(%rip),%xmm2        # 6d10 <_sk_callback_sse2+0xc92>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,232,52,0,0                 // movaps        0x34e8(%rip),%xmm3        # 6ce0 <_sk_callback_sse2+0xc8a>
+  .byte  15,40,29,0,53,0,0                   // movaps        0x3500(%rip),%xmm3        # 6d20 <_sk_callback_sse2+0xca2>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,50                              // je            3839 <_sk_load_565_sse2+0x9c>
+  .byte  116,50                              // je            3861 <_sk_load_565_sse2+0x9c>
   .byte  102,15,239,210                      // pxor          %xmm2,%xmm2
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3826 <_sk_load_565_sse2+0x89>
+  .byte  116,21                              // je            384e <_sk_load_565_sse2+0x89>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,154                             // jne           37b1 <_sk_load_565_sse2+0x14>
+  .byte  117,154                             // jne           37d9 <_sk_load_565_sse2+0x14>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,208,69                   // pshufd        $0x45,%xmm0,%xmm2
   .byte  102,65,15,110,4,82                  // movd          (%r10,%rdx,2),%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
   .byte  242,15,16,208                       // movsd         %xmm0,%xmm2
-  .byte  233,120,255,255,255                 // jmpq          37b1 <_sk_load_565_sse2+0x14>
+  .byte  233,120,255,255,255                 // jmpq          37d9 <_sk_load_565_sse2+0x14>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,208                      // movd          %eax,%xmm2
-  .byte  233,106,255,255,255                 // jmpq          37b1 <_sk_load_565_sse2+0x14>
+  .byte  233,106,255,255,255                 // jmpq          37d9 <_sk_load_565_sse2+0x14>
 
 HIDDEN _sk_load_565_dst_sse2
 .globl _sk_load_565_dst_sse2
@@ -38147,42 +38298,42 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,83                              // jne           38a4 <_sk_load_565_dst_sse2+0x5d>
+  .byte  117,83                              // jne           38cc <_sk_load_565_dst_sse2+0x5d>
   .byte  243,65,15,126,52,82                 // movq          (%r10,%rdx,2),%xmm6
   .byte  102,15,97,240                       // punpcklwd     %xmm0,%xmm6
-  .byte  102,15,111,37,141,52,0,0            // movdqa        0x348d(%rip),%xmm4        # 6cf0 <_sk_callback_sse2+0xc9a>
+  .byte  102,15,111,37,165,52,0,0            // movdqa        0x34a5(%rip),%xmm4        # 6d30 <_sk_callback_sse2+0xcb2>
   .byte  102,15,219,230                      // pand          %xmm6,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,37,143,52,0,0                 // mulps         0x348f(%rip),%xmm4        # 6d00 <_sk_callback_sse2+0xcaa>
-  .byte  102,15,111,45,151,52,0,0            // movdqa        0x3497(%rip),%xmm5        # 6d10 <_sk_callback_sse2+0xcba>
+  .byte  15,89,37,167,52,0,0                 // mulps         0x34a7(%rip),%xmm4        # 6d40 <_sk_callback_sse2+0xcc2>
+  .byte  102,15,111,45,175,52,0,0            // movdqa        0x34af(%rip),%xmm5        # 6d50 <_sk_callback_sse2+0xcd2>
   .byte  102,15,219,238                      // pand          %xmm6,%xmm5
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
-  .byte  15,89,45,153,52,0,0                 // mulps         0x3499(%rip),%xmm5        # 6d20 <_sk_callback_sse2+0xcca>
-  .byte  102,15,219,53,161,52,0,0            // pand          0x34a1(%rip),%xmm6        # 6d30 <_sk_callback_sse2+0xcda>
+  .byte  15,89,45,177,52,0,0                 // mulps         0x34b1(%rip),%xmm5        # 6d60 <_sk_callback_sse2+0xce2>
+  .byte  102,15,219,53,185,52,0,0            // pand          0x34b9(%rip),%xmm6        # 6d70 <_sk_callback_sse2+0xcf2>
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,53,167,52,0,0                 // mulps         0x34a7(%rip),%xmm6        # 6d40 <_sk_callback_sse2+0xcea>
+  .byte  15,89,53,191,52,0,0                 // mulps         0x34bf(%rip),%xmm6        # 6d80 <_sk_callback_sse2+0xd02>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,61,174,52,0,0                 // movaps        0x34ae(%rip),%xmm7        # 6d50 <_sk_callback_sse2+0xcfa>
+  .byte  15,40,61,198,52,0,0                 // movaps        0x34c6(%rip),%xmm7        # 6d90 <_sk_callback_sse2+0xd12>
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,50                              // je            38e3 <_sk_load_565_dst_sse2+0x9c>
+  .byte  116,50                              // je            390b <_sk_load_565_dst_sse2+0x9c>
   .byte  102,15,239,246                      // pxor          %xmm6,%xmm6
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            38d0 <_sk_load_565_dst_sse2+0x89>
+  .byte  116,21                              // je            38f8 <_sk_load_565_dst_sse2+0x89>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,154                             // jne           385b <_sk_load_565_dst_sse2+0x14>
+  .byte  117,154                             // jne           3883 <_sk_load_565_dst_sse2+0x14>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,244,69                   // pshufd        $0x45,%xmm4,%xmm6
   .byte  102,65,15,110,36,82                 // movd          (%r10,%rdx,2),%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
   .byte  242,15,16,244                       // movsd         %xmm4,%xmm6
-  .byte  233,120,255,255,255                 // jmpq          385b <_sk_load_565_dst_sse2+0x14>
+  .byte  233,120,255,255,255                 // jmpq          3883 <_sk_load_565_dst_sse2+0x14>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,240                      // movd          %eax,%xmm6
-  .byte  233,106,255,255,255                 // jmpq          385b <_sk_load_565_dst_sse2+0x14>
+  .byte  233,106,255,255,255                 // jmpq          3883 <_sk_load_565_dst_sse2+0x14>
 
 HIDDEN _sk_gather_565_sse2
 .globl _sk_gather_565_sse2
@@ -38217,19 +38368,19 @@
   .byte  102,15,196,208,3                    // pinsrw        $0x3,%eax,%xmm2
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,208                       // punpcklwd     %xmm0,%xmm2
-  .byte  102,15,111,5,233,51,0,0             // movdqa        0x33e9(%rip),%xmm0        # 6d60 <_sk_callback_sse2+0xd0a>
+  .byte  102,15,111,5,1,52,0,0               // movdqa        0x3401(%rip),%xmm0        # 6da0 <_sk_callback_sse2+0xd22>
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,235,51,0,0                  // mulps         0x33eb(%rip),%xmm0        # 6d70 <_sk_callback_sse2+0xd1a>
-  .byte  102,15,111,13,243,51,0,0            // movdqa        0x33f3(%rip),%xmm1        # 6d80 <_sk_callback_sse2+0xd2a>
+  .byte  15,89,5,3,52,0,0                    // mulps         0x3403(%rip),%xmm0        # 6db0 <_sk_callback_sse2+0xd32>
+  .byte  102,15,111,13,11,52,0,0             // movdqa        0x340b(%rip),%xmm1        # 6dc0 <_sk_callback_sse2+0xd42>
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,245,51,0,0                 // mulps         0x33f5(%rip),%xmm1        # 6d90 <_sk_callback_sse2+0xd3a>
-  .byte  102,15,219,21,253,51,0,0            // pand          0x33fd(%rip),%xmm2        # 6da0 <_sk_callback_sse2+0xd4a>
+  .byte  15,89,13,13,52,0,0                  // mulps         0x340d(%rip),%xmm1        # 6dd0 <_sk_callback_sse2+0xd52>
+  .byte  102,15,219,21,21,52,0,0             // pand          0x3415(%rip),%xmm2        # 6de0 <_sk_callback_sse2+0xd62>
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,3,52,0,0                   // mulps         0x3403(%rip),%xmm2        # 6db0 <_sk_callback_sse2+0xd5a>
+  .byte  15,89,21,27,52,0,0                  // mulps         0x341b(%rip),%xmm2        # 6df0 <_sk_callback_sse2+0xd72>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,10,52,0,0                  // movaps        0x340a(%rip),%xmm3        # 6dc0 <_sk_callback_sse2+0xd6a>
+  .byte  15,40,29,34,52,0,0                  // movaps        0x3422(%rip),%xmm3        # 6e00 <_sk_callback_sse2+0xd82>
   .byte  91                                  // pop           %rbx
   .byte  255,224                             // jmpq          *%rax
 
@@ -38239,12 +38390,12 @@
 _sk_store_565_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  68,15,40,5,10,52,0,0                // movaps        0x340a(%rip),%xmm8        # 6dd0 <_sk_callback_sse2+0xd7a>
+  .byte  68,15,40,5,34,52,0,0                // movaps        0x3422(%rip),%xmm8        # 6e10 <_sk_callback_sse2+0xd92>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
   .byte  102,65,15,114,241,11                // pslld         $0xb,%xmm9
-  .byte  68,15,40,21,255,51,0,0              // movaps        0x33ff(%rip),%xmm10        # 6de0 <_sk_callback_sse2+0xd8a>
+  .byte  68,15,40,21,23,52,0,0               // movaps        0x3417(%rip),%xmm10        # 6e20 <_sk_callback_sse2+0xda2>
   .byte  68,15,89,209                        // mulps         %xmm1,%xmm10
   .byte  102,69,15,91,210                    // cvtps2dq      %xmm10,%xmm10
   .byte  102,65,15,114,242,5                 // pslld         $0x5,%xmm10
@@ -38256,7 +38407,7 @@
   .byte  102,65,15,114,224,16                // psrad         $0x10,%xmm8
   .byte  102,69,15,107,192                   // packssdw      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           3a23 <_sk_store_565_sse2+0x6a>
+  .byte  117,10                              // jne           3a4b <_sk_store_565_sse2+0x6a>
   .byte  242,69,15,17,4,82                   // movsd         %xmm8,(%r10,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -38264,19 +38415,19 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,38                              // je            3a5b <_sk_store_565_sse2+0xa2>
+  .byte  116,38                              // je            3a83 <_sk_store_565_sse2+0xa2>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,18                              // je            3a4d <_sk_store_565_sse2+0x94>
+  .byte  116,18                              // je            3a75 <_sk_store_565_sse2+0x94>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,222                             // jne           3a1f <_sk_store_565_sse2+0x66>
+  .byte  117,222                             // jne           3a47 <_sk_store_565_sse2+0x66>
   .byte  102,65,15,197,192,4                 // pextrw        $0x4,%xmm8,%eax
   .byte  102,65,137,68,82,4                  // mov           %ax,0x4(%r10,%rdx,2)
   .byte  242,69,15,112,192,232               // pshuflw       $0xe8,%xmm8,%xmm8
   .byte  102,69,15,126,4,82                  // movd          %xmm8,(%r10,%rdx,2)
-  .byte  235,196                             // jmp           3a1f <_sk_store_565_sse2+0x66>
+  .byte  235,196                             // jmp           3a47 <_sk_store_565_sse2+0x66>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  102,65,137,4,82                     // mov           %ax,(%r10,%rdx,2)
-  .byte  235,184                             // jmp           3a1f <_sk_store_565_sse2+0x66>
+  .byte  235,184                             // jmp           3a47 <_sk_store_565_sse2+0x66>
 
 HIDDEN _sk_load_4444_sse2
 .globl _sk_load_4444_sse2
@@ -38285,45 +38436,45 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,98                              // jne           3ad3 <_sk_load_4444_sse2+0x6c>
+  .byte  117,98                              // jne           3afb <_sk_load_4444_sse2+0x6c>
   .byte  243,65,15,126,28,82                 // movq          (%r10,%rdx,2),%xmm3
   .byte  102,15,97,216                       // punpcklwd     %xmm0,%xmm3
-  .byte  102,15,111,5,109,51,0,0             // movdqa        0x336d(%rip),%xmm0        # 6df0 <_sk_callback_sse2+0xd9a>
+  .byte  102,15,111,5,133,51,0,0             // movdqa        0x3385(%rip),%xmm0        # 6e30 <_sk_callback_sse2+0xdb2>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,111,51,0,0                  // mulps         0x336f(%rip),%xmm0        # 6e00 <_sk_callback_sse2+0xdaa>
-  .byte  102,15,111,13,119,51,0,0            // movdqa        0x3377(%rip),%xmm1        # 6e10 <_sk_callback_sse2+0xdba>
+  .byte  15,89,5,135,51,0,0                  // mulps         0x3387(%rip),%xmm0        # 6e40 <_sk_callback_sse2+0xdc2>
+  .byte  102,15,111,13,143,51,0,0            // movdqa        0x338f(%rip),%xmm1        # 6e50 <_sk_callback_sse2+0xdd2>
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,121,51,0,0                 // mulps         0x3379(%rip),%xmm1        # 6e20 <_sk_callback_sse2+0xdca>
-  .byte  102,15,111,21,129,51,0,0            // movdqa        0x3381(%rip),%xmm2        # 6e30 <_sk_callback_sse2+0xdda>
+  .byte  15,89,13,145,51,0,0                 // mulps         0x3391(%rip),%xmm1        # 6e60 <_sk_callback_sse2+0xde2>
+  .byte  102,15,111,21,153,51,0,0            // movdqa        0x3399(%rip),%xmm2        # 6e70 <_sk_callback_sse2+0xdf2>
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,131,51,0,0                 // mulps         0x3383(%rip),%xmm2        # 6e40 <_sk_callback_sse2+0xdea>
-  .byte  102,15,219,29,139,51,0,0            // pand          0x338b(%rip),%xmm3        # 6e50 <_sk_callback_sse2+0xdfa>
+  .byte  15,89,21,155,51,0,0                 // mulps         0x339b(%rip),%xmm2        # 6e80 <_sk_callback_sse2+0xe02>
+  .byte  102,15,219,29,163,51,0,0            // pand          0x33a3(%rip),%xmm3        # 6e90 <_sk_callback_sse2+0xe12>
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,145,51,0,0                 // mulps         0x3391(%rip),%xmm3        # 6e60 <_sk_callback_sse2+0xe0a>
+  .byte  15,89,29,169,51,0,0                 // mulps         0x33a9(%rip),%xmm3        # 6ea0 <_sk_callback_sse2+0xe22>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,50                              // je            3b12 <_sk_load_4444_sse2+0xab>
+  .byte  116,50                              // je            3b3a <_sk_load_4444_sse2+0xab>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3aff <_sk_load_4444_sse2+0x98>
+  .byte  116,21                              // je            3b27 <_sk_load_4444_sse2+0x98>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,139                             // jne           3a7b <_sk_load_4444_sse2+0x14>
+  .byte  117,139                             // jne           3aa3 <_sk_load_4444_sse2+0x14>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,112,216,69                   // pshufd        $0x45,%xmm0,%xmm3
   .byte  102,65,15,110,4,82                  // movd          (%r10,%rdx,2),%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
   .byte  242,15,16,216                       // movsd         %xmm0,%xmm3
-  .byte  233,105,255,255,255                 // jmpq          3a7b <_sk_load_4444_sse2+0x14>
+  .byte  233,105,255,255,255                 // jmpq          3aa3 <_sk_load_4444_sse2+0x14>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,216                      // movd          %eax,%xmm3
-  .byte  233,91,255,255,255                  // jmpq          3a7b <_sk_load_4444_sse2+0x14>
+  .byte  233,91,255,255,255                  // jmpq          3aa3 <_sk_load_4444_sse2+0x14>
 
 HIDDEN _sk_load_4444_dst_sse2
 .globl _sk_load_4444_dst_sse2
@@ -38332,45 +38483,45 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,98                              // jne           3b8c <_sk_load_4444_dst_sse2+0x6c>
+  .byte  117,98                              // jne           3bb4 <_sk_load_4444_dst_sse2+0x6c>
   .byte  243,65,15,126,60,82                 // movq          (%r10,%rdx,2),%xmm7
   .byte  102,15,97,248                       // punpcklwd     %xmm0,%xmm7
-  .byte  102,15,111,37,52,51,0,0             // movdqa        0x3334(%rip),%xmm4        # 6e70 <_sk_callback_sse2+0xe1a>
+  .byte  102,15,111,37,76,51,0,0             // movdqa        0x334c(%rip),%xmm4        # 6eb0 <_sk_callback_sse2+0xe32>
   .byte  102,15,219,231                      // pand          %xmm7,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,37,54,51,0,0                  // mulps         0x3336(%rip),%xmm4        # 6e80 <_sk_callback_sse2+0xe2a>
-  .byte  102,15,111,45,62,51,0,0             // movdqa        0x333e(%rip),%xmm5        # 6e90 <_sk_callback_sse2+0xe3a>
+  .byte  15,89,37,78,51,0,0                  // mulps         0x334e(%rip),%xmm4        # 6ec0 <_sk_callback_sse2+0xe42>
+  .byte  102,15,111,45,86,51,0,0             // movdqa        0x3356(%rip),%xmm5        # 6ed0 <_sk_callback_sse2+0xe52>
   .byte  102,15,219,239                      // pand          %xmm7,%xmm5
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
-  .byte  15,89,45,64,51,0,0                  // mulps         0x3340(%rip),%xmm5        # 6ea0 <_sk_callback_sse2+0xe4a>
-  .byte  102,15,111,53,72,51,0,0             // movdqa        0x3348(%rip),%xmm6        # 6eb0 <_sk_callback_sse2+0xe5a>
+  .byte  15,89,45,88,51,0,0                  // mulps         0x3358(%rip),%xmm5        # 6ee0 <_sk_callback_sse2+0xe62>
+  .byte  102,15,111,53,96,51,0,0             // movdqa        0x3360(%rip),%xmm6        # 6ef0 <_sk_callback_sse2+0xe72>
   .byte  102,15,219,247                      // pand          %xmm7,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,53,74,51,0,0                  // mulps         0x334a(%rip),%xmm6        # 6ec0 <_sk_callback_sse2+0xe6a>
-  .byte  102,15,219,61,82,51,0,0             // pand          0x3352(%rip),%xmm7        # 6ed0 <_sk_callback_sse2+0xe7a>
+  .byte  15,89,53,98,51,0,0                  // mulps         0x3362(%rip),%xmm6        # 6f00 <_sk_callback_sse2+0xe82>
+  .byte  102,15,219,61,106,51,0,0            // pand          0x336a(%rip),%xmm7        # 6f10 <_sk_callback_sse2+0xe92>
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
-  .byte  15,89,61,88,51,0,0                  // mulps         0x3358(%rip),%xmm7        # 6ee0 <_sk_callback_sse2+0xe8a>
+  .byte  15,89,61,112,51,0,0                 // mulps         0x3370(%rip),%xmm7        # 6f20 <_sk_callback_sse2+0xea2>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,50                              // je            3bcb <_sk_load_4444_dst_sse2+0xab>
+  .byte  116,50                              // je            3bf3 <_sk_load_4444_dst_sse2+0xab>
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,21                              // je            3bb8 <_sk_load_4444_dst_sse2+0x98>
+  .byte  116,21                              // je            3be0 <_sk_load_4444_dst_sse2+0x98>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,139                             // jne           3b34 <_sk_load_4444_dst_sse2+0x14>
+  .byte  117,139                             // jne           3b5c <_sk_load_4444_dst_sse2+0x14>
   .byte  65,15,183,68,82,4                   // movzwl        0x4(%r10,%rdx,2),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
   .byte  102,65,15,110,36,82                 // movd          (%r10,%rdx,2),%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
   .byte  242,15,16,252                       // movsd         %xmm4,%xmm7
-  .byte  233,105,255,255,255                 // jmpq          3b34 <_sk_load_4444_dst_sse2+0x14>
+  .byte  233,105,255,255,255                 // jmpq          3b5c <_sk_load_4444_dst_sse2+0x14>
   .byte  65,15,183,4,82                      // movzwl        (%r10,%rdx,2),%eax
   .byte  102,15,110,248                      // movd          %eax,%xmm7
-  .byte  233,91,255,255,255                  // jmpq          3b34 <_sk_load_4444_dst_sse2+0x14>
+  .byte  233,91,255,255,255                  // jmpq          3b5c <_sk_load_4444_dst_sse2+0x14>
 
 HIDDEN _sk_gather_4444_sse2
 .globl _sk_gather_4444_sse2
@@ -38405,21 +38556,21 @@
   .byte  102,15,196,216,3                    // pinsrw        $0x3,%eax,%xmm3
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,216                       // punpcklwd     %xmm0,%xmm3
-  .byte  102,15,111,5,145,50,0,0             // movdqa        0x3291(%rip),%xmm0        # 6ef0 <_sk_callback_sse2+0xe9a>
+  .byte  102,15,111,5,169,50,0,0             // movdqa        0x32a9(%rip),%xmm0        # 6f30 <_sk_callback_sse2+0xeb2>
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,5,147,50,0,0                  // mulps         0x3293(%rip),%xmm0        # 6f00 <_sk_callback_sse2+0xeaa>
-  .byte  102,15,111,13,155,50,0,0            // movdqa        0x329b(%rip),%xmm1        # 6f10 <_sk_callback_sse2+0xeba>
+  .byte  15,89,5,171,50,0,0                  // mulps         0x32ab(%rip),%xmm0        # 6f40 <_sk_callback_sse2+0xec2>
+  .byte  102,15,111,13,179,50,0,0            // movdqa        0x32b3(%rip),%xmm1        # 6f50 <_sk_callback_sse2+0xed2>
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,13,157,50,0,0                 // mulps         0x329d(%rip),%xmm1        # 6f20 <_sk_callback_sse2+0xeca>
-  .byte  102,15,111,21,165,50,0,0            // movdqa        0x32a5(%rip),%xmm2        # 6f30 <_sk_callback_sse2+0xeda>
+  .byte  15,89,13,181,50,0,0                 // mulps         0x32b5(%rip),%xmm1        # 6f60 <_sk_callback_sse2+0xee2>
+  .byte  102,15,111,21,189,50,0,0            // movdqa        0x32bd(%rip),%xmm2        # 6f70 <_sk_callback_sse2+0xef2>
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,21,167,50,0,0                 // mulps         0x32a7(%rip),%xmm2        # 6f40 <_sk_callback_sse2+0xeea>
-  .byte  102,15,219,29,175,50,0,0            // pand          0x32af(%rip),%xmm3        # 6f50 <_sk_callback_sse2+0xefa>
+  .byte  15,89,21,191,50,0,0                 // mulps         0x32bf(%rip),%xmm2        # 6f80 <_sk_callback_sse2+0xf02>
+  .byte  102,15,219,29,199,50,0,0            // pand          0x32c7(%rip),%xmm3        # 6f90 <_sk_callback_sse2+0xf12>
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,29,181,50,0,0                 // mulps         0x32b5(%rip),%xmm3        # 6f60 <_sk_callback_sse2+0xf0a>
+  .byte  15,89,29,205,50,0,0                 // mulps         0x32cd(%rip),%xmm3        # 6fa0 <_sk_callback_sse2+0xf22>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  91                                  // pop           %rbx
   .byte  255,224                             // jmpq          *%rax
@@ -38430,7 +38581,7 @@
 _sk_store_4444_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,16                           // mov           (%rax),%r10
-  .byte  68,15,40,5,179,50,0,0               // movaps        0x32b3(%rip),%xmm8        # 6f70 <_sk_callback_sse2+0xf1a>
+  .byte  68,15,40,5,203,50,0,0               // movaps        0x32cb(%rip),%xmm8        # 6fb0 <_sk_callback_sse2+0xf32>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -38452,7 +38603,7 @@
   .byte  102,65,15,114,224,16                // psrad         $0x10,%xmm8
   .byte  102,69,15,107,192                   // packssdw      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           3d2e <_sk_store_4444_sse2+0x7e>
+  .byte  117,10                              // jne           3d56 <_sk_store_4444_sse2+0x7e>
   .byte  242,69,15,17,4,82                   // movsd         %xmm8,(%r10,%rdx,2)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -38460,19 +38611,19 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,38                              // je            3d66 <_sk_store_4444_sse2+0xb6>
+  .byte  116,38                              // je            3d8e <_sk_store_4444_sse2+0xb6>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,18                              // je            3d58 <_sk_store_4444_sse2+0xa8>
+  .byte  116,18                              // je            3d80 <_sk_store_4444_sse2+0xa8>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,222                             // jne           3d2a <_sk_store_4444_sse2+0x7a>
+  .byte  117,222                             // jne           3d52 <_sk_store_4444_sse2+0x7a>
   .byte  102,65,15,197,192,4                 // pextrw        $0x4,%xmm8,%eax
   .byte  102,65,137,68,82,4                  // mov           %ax,0x4(%r10,%rdx,2)
   .byte  242,69,15,112,192,232               // pshuflw       $0xe8,%xmm8,%xmm8
   .byte  102,69,15,126,4,82                  // movd          %xmm8,(%r10,%rdx,2)
-  .byte  235,196                             // jmp           3d2a <_sk_store_4444_sse2+0x7a>
+  .byte  235,196                             // jmp           3d52 <_sk_store_4444_sse2+0x7a>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  102,65,137,4,82                     // mov           %ax,(%r10,%rdx,2)
-  .byte  235,184                             // jmp           3d2a <_sk_store_4444_sse2+0x7a>
+  .byte  235,184                             // jmp           3d52 <_sk_store_4444_sse2+0x7a>
 
 HIDDEN _sk_load_8888_sse2
 .globl _sk_load_8888_sse2
@@ -38481,13 +38632,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,98                              // jne           3dde <_sk_load_8888_sse2+0x6c>
+  .byte  117,98                              // jne           3e06 <_sk_load_8888_sse2+0x6c>
   .byte  243,68,15,111,12,144                // movdqu        (%rax,%rdx,4),%xmm9
-  .byte  102,15,111,21,246,49,0,0            // movdqa        0x31f6(%rip),%xmm2        # 6f80 <_sk_callback_sse2+0xf2a>
+  .byte  102,15,111,21,14,50,0,0             // movdqa        0x320e(%rip),%xmm2        # 6fc0 <_sk_callback_sse2+0xf42>
   .byte  102,65,15,111,193                   // movdqa        %xmm9,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,242,49,0,0               // movaps        0x31f2(%rip),%xmm8        # 6f90 <_sk_callback_sse2+0xf3a>
+  .byte  68,15,40,5,10,50,0,0                // movaps        0x320a(%rip),%xmm8        # 6fd0 <_sk_callback_sse2+0xf52>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -38507,18 +38658,18 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,40                              // je            3e13 <_sk_load_8888_sse2+0xa1>
+  .byte  116,40                              // je            3e3b <_sk_load_8888_sse2+0xa1>
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,18                              // je            3e08 <_sk_load_8888_sse2+0x96>
+  .byte  116,18                              // je            3e30 <_sk_load_8888_sse2+0x96>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,134                             // jne           3d82 <_sk_load_8888_sse2+0x10>
+  .byte  117,134                             // jne           3daa <_sk_load_8888_sse2+0x10>
   .byte  102,15,110,68,144,8                 // movd          0x8(%rax,%rdx,4),%xmm0
   .byte  102,68,15,112,200,69                // pshufd        $0x45,%xmm0,%xmm9
   .byte  102,68,15,18,12,144                 // movlpd        (%rax,%rdx,4),%xmm9
-  .byte  233,111,255,255,255                 // jmpq          3d82 <_sk_load_8888_sse2+0x10>
+  .byte  233,111,255,255,255                 // jmpq          3daa <_sk_load_8888_sse2+0x10>
   .byte  102,68,15,110,12,144                // movd          (%rax,%rdx,4),%xmm9
-  .byte  233,100,255,255,255                 // jmpq          3d82 <_sk_load_8888_sse2+0x10>
+  .byte  233,100,255,255,255                 // jmpq          3daa <_sk_load_8888_sse2+0x10>
 
 HIDDEN _sk_load_8888_dst_sse2
 .globl _sk_load_8888_dst_sse2
@@ -38527,13 +38678,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,98                              // jne           3e8a <_sk_load_8888_dst_sse2+0x6c>
+  .byte  117,98                              // jne           3eb2 <_sk_load_8888_dst_sse2+0x6c>
   .byte  243,68,15,111,12,144                // movdqu        (%rax,%rdx,4),%xmm9
-  .byte  102,15,111,53,106,49,0,0            // movdqa        0x316a(%rip),%xmm6        # 6fa0 <_sk_callback_sse2+0xf4a>
+  .byte  102,15,111,53,130,49,0,0            // movdqa        0x3182(%rip),%xmm6        # 6fe0 <_sk_callback_sse2+0xf62>
   .byte  102,65,15,111,225                   // movdqa        %xmm9,%xmm4
   .byte  102,15,219,230                      // pand          %xmm6,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  68,15,40,5,102,49,0,0               // movaps        0x3166(%rip),%xmm8        # 6fb0 <_sk_callback_sse2+0xf5a>
+  .byte  68,15,40,5,126,49,0,0               // movaps        0x317e(%rip),%xmm8        # 6ff0 <_sk_callback_sse2+0xf72>
   .byte  65,15,89,224                        // mulps         %xmm8,%xmm4
   .byte  102,65,15,111,233                   // movdqa        %xmm9,%xmm5
   .byte  102,15,114,213,8                    // psrld         $0x8,%xmm5
@@ -38553,18 +38704,18 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,40                              // je            3ebf <_sk_load_8888_dst_sse2+0xa1>
+  .byte  116,40                              // je            3ee7 <_sk_load_8888_dst_sse2+0xa1>
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,18                              // je            3eb4 <_sk_load_8888_dst_sse2+0x96>
+  .byte  116,18                              // je            3edc <_sk_load_8888_dst_sse2+0x96>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,134                             // jne           3e2e <_sk_load_8888_dst_sse2+0x10>
+  .byte  117,134                             // jne           3e56 <_sk_load_8888_dst_sse2+0x10>
   .byte  102,15,110,100,144,8                // movd          0x8(%rax,%rdx,4),%xmm4
   .byte  102,68,15,112,204,69                // pshufd        $0x45,%xmm4,%xmm9
   .byte  102,68,15,18,12,144                 // movlpd        (%rax,%rdx,4),%xmm9
-  .byte  233,111,255,255,255                 // jmpq          3e2e <_sk_load_8888_dst_sse2+0x10>
+  .byte  233,111,255,255,255                 // jmpq          3e56 <_sk_load_8888_dst_sse2+0x10>
   .byte  102,68,15,110,12,144                // movd          (%rax,%rdx,4),%xmm9
-  .byte  233,100,255,255,255                 // jmpq          3e2e <_sk_load_8888_dst_sse2+0x10>
+  .byte  233,100,255,255,255                 // jmpq          3e56 <_sk_load_8888_dst_sse2+0x10>
 
 HIDDEN _sk_gather_8888_sse2
 .globl _sk_gather_8888_sse2
@@ -38598,11 +38749,11 @@
   .byte  102,67,15,110,12,145                // movd          (%r9,%r10,4),%xmm1
   .byte  102,68,15,98,201                    // punpckldq     %xmm1,%xmm9
   .byte  102,68,15,98,200                    // punpckldq     %xmm0,%xmm9
-  .byte  102,15,111,21,116,48,0,0            // movdqa        0x3074(%rip),%xmm2        # 6fc0 <_sk_callback_sse2+0xf6a>
+  .byte  102,15,111,21,140,48,0,0            // movdqa        0x308c(%rip),%xmm2        # 7000 <_sk_callback_sse2+0xf82>
   .byte  102,65,15,111,193                   // movdqa        %xmm9,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  68,15,40,5,112,48,0,0               // movaps        0x3070(%rip),%xmm8        # 6fd0 <_sk_callback_sse2+0xf7a>
+  .byte  68,15,40,5,136,48,0,0               // movaps        0x3088(%rip),%xmm8        # 7010 <_sk_callback_sse2+0xf92>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -38627,7 +38778,7 @@
 _sk_store_8888_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,50,48,0,0                // movaps        0x3032(%rip),%xmm8        # 6fe0 <_sk_callback_sse2+0xf8a>
+  .byte  68,15,40,5,74,48,0,0                // movaps        0x304a(%rip),%xmm8        # 7020 <_sk_callback_sse2+0xfa2>
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -38646,24 +38797,24 @@
   .byte  102,69,15,235,193                   // por           %xmm9,%xmm8
   .byte  102,69,15,235,194                   // por           %xmm10,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           400e <_sk_store_8888_sse2+0x6d>
+  .byte  117,10                              // jne           4036 <_sk_store_8888_sse2+0x6d>
   .byte  243,68,15,127,4,144                 // movdqu        %xmm8,(%rax,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,33                              // je            403c <_sk_store_8888_sse2+0x9b>
+  .byte  116,33                              // je            4064 <_sk_store_8888_sse2+0x9b>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,19                              // je            4034 <_sk_store_8888_sse2+0x93>
+  .byte  116,19                              // je            405c <_sk_store_8888_sse2+0x93>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,227                             // jne           400a <_sk_store_8888_sse2+0x69>
+  .byte  117,227                             // jne           4032 <_sk_store_8888_sse2+0x69>
   .byte  102,69,15,112,200,78                // pshufd        $0x4e,%xmm8,%xmm9
   .byte  102,68,15,126,76,144,8              // movd          %xmm9,0x8(%rax,%rdx,4)
   .byte  102,68,15,214,4,144                 // movq          %xmm8,(%rax,%rdx,4)
-  .byte  235,206                             // jmp           400a <_sk_store_8888_sse2+0x69>
+  .byte  235,206                             // jmp           4032 <_sk_store_8888_sse2+0x69>
   .byte  102,68,15,126,4,144                 // movd          %xmm8,(%rax,%rdx,4)
-  .byte  235,198                             // jmp           400a <_sk_store_8888_sse2+0x69>
+  .byte  235,198                             // jmp           4032 <_sk_store_8888_sse2+0x69>
 
 HIDDEN _sk_load_bgra_sse2
 .globl _sk_load_bgra_sse2
@@ -38672,13 +38823,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,98                              // jne           40b0 <_sk_load_bgra_sse2+0x6c>
+  .byte  117,98                              // jne           40d8 <_sk_load_bgra_sse2+0x6c>
   .byte  243,68,15,111,12,144                // movdqu        (%rax,%rdx,4),%xmm9
-  .byte  102,15,111,5,148,47,0,0             // movdqa        0x2f94(%rip),%xmm0        # 6ff0 <_sk_callback_sse2+0xf9a>
+  .byte  102,15,111,5,172,47,0,0             // movdqa        0x2fac(%rip),%xmm0        # 7030 <_sk_callback_sse2+0xfb2>
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,219,200                      // pand          %xmm0,%xmm1
   .byte  15,91,209                           // cvtdq2ps      %xmm1,%xmm2
-  .byte  68,15,40,5,144,47,0,0               // movaps        0x2f90(%rip),%xmm8        # 7000 <_sk_callback_sse2+0xfaa>
+  .byte  68,15,40,5,168,47,0,0               // movaps        0x2fa8(%rip),%xmm8        # 7040 <_sk_callback_sse2+0xfc2>
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -38698,18 +38849,18 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,40                              // je            40e5 <_sk_load_bgra_sse2+0xa1>
+  .byte  116,40                              // je            410d <_sk_load_bgra_sse2+0xa1>
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,18                              // je            40da <_sk_load_bgra_sse2+0x96>
+  .byte  116,18                              // je            4102 <_sk_load_bgra_sse2+0x96>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,134                             // jne           4054 <_sk_load_bgra_sse2+0x10>
+  .byte  117,134                             // jne           407c <_sk_load_bgra_sse2+0x10>
   .byte  102,15,110,68,144,8                 // movd          0x8(%rax,%rdx,4),%xmm0
   .byte  102,68,15,112,200,69                // pshufd        $0x45,%xmm0,%xmm9
   .byte  102,68,15,18,12,144                 // movlpd        (%rax,%rdx,4),%xmm9
-  .byte  233,111,255,255,255                 // jmpq          4054 <_sk_load_bgra_sse2+0x10>
+  .byte  233,111,255,255,255                 // jmpq          407c <_sk_load_bgra_sse2+0x10>
   .byte  102,68,15,110,12,144                // movd          (%rax,%rdx,4),%xmm9
-  .byte  233,100,255,255,255                 // jmpq          4054 <_sk_load_bgra_sse2+0x10>
+  .byte  233,100,255,255,255                 // jmpq          407c <_sk_load_bgra_sse2+0x10>
 
 HIDDEN _sk_load_bgra_dst_sse2
 .globl _sk_load_bgra_dst_sse2
@@ -38718,13 +38869,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,98                              // jne           415c <_sk_load_bgra_dst_sse2+0x6c>
+  .byte  117,98                              // jne           4184 <_sk_load_bgra_dst_sse2+0x6c>
   .byte  243,68,15,111,12,144                // movdqu        (%rax,%rdx,4),%xmm9
-  .byte  102,15,111,37,8,47,0,0              // movdqa        0x2f08(%rip),%xmm4        # 7010 <_sk_callback_sse2+0xfba>
+  .byte  102,15,111,37,32,47,0,0             // movdqa        0x2f20(%rip),%xmm4        # 7050 <_sk_callback_sse2+0xfd2>
   .byte  102,65,15,111,233                   // movdqa        %xmm9,%xmm5
   .byte  102,15,219,236                      // pand          %xmm4,%xmm5
   .byte  15,91,245                           // cvtdq2ps      %xmm5,%xmm6
-  .byte  68,15,40,5,4,47,0,0                 // movaps        0x2f04(%rip),%xmm8        # 7020 <_sk_callback_sse2+0xfca>
+  .byte  68,15,40,5,28,47,0,0                // movaps        0x2f1c(%rip),%xmm8        # 7060 <_sk_callback_sse2+0xfe2>
   .byte  65,15,89,240                        // mulps         %xmm8,%xmm6
   .byte  102,65,15,111,233                   // movdqa        %xmm9,%xmm5
   .byte  102,15,114,213,8                    // psrld         $0x8,%xmm5
@@ -38744,18 +38895,18 @@
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,40                              // je            4191 <_sk_load_bgra_dst_sse2+0xa1>
+  .byte  116,40                              // je            41b9 <_sk_load_bgra_dst_sse2+0xa1>
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,18                              // je            4186 <_sk_load_bgra_dst_sse2+0x96>
+  .byte  116,18                              // je            41ae <_sk_load_bgra_dst_sse2+0x96>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,134                             // jne           4100 <_sk_load_bgra_dst_sse2+0x10>
+  .byte  117,134                             // jne           4128 <_sk_load_bgra_dst_sse2+0x10>
   .byte  102,15,110,100,144,8                // movd          0x8(%rax,%rdx,4),%xmm4
   .byte  102,68,15,112,204,69                // pshufd        $0x45,%xmm4,%xmm9
   .byte  102,68,15,18,12,144                 // movlpd        (%rax,%rdx,4),%xmm9
-  .byte  233,111,255,255,255                 // jmpq          4100 <_sk_load_bgra_dst_sse2+0x10>
+  .byte  233,111,255,255,255                 // jmpq          4128 <_sk_load_bgra_dst_sse2+0x10>
   .byte  102,68,15,110,12,144                // movd          (%rax,%rdx,4),%xmm9
-  .byte  233,100,255,255,255                 // jmpq          4100 <_sk_load_bgra_dst_sse2+0x10>
+  .byte  233,100,255,255,255                 // jmpq          4128 <_sk_load_bgra_dst_sse2+0x10>
 
 HIDDEN _sk_gather_bgra_sse2
 .globl _sk_gather_bgra_sse2
@@ -38789,11 +38940,11 @@
   .byte  102,67,15,110,12,145                // movd          (%r9,%r10,4),%xmm1
   .byte  102,68,15,98,201                    // punpckldq     %xmm1,%xmm9
   .byte  102,68,15,98,200                    // punpckldq     %xmm0,%xmm9
-  .byte  102,15,111,5,18,46,0,0              // movdqa        0x2e12(%rip),%xmm0        # 7030 <_sk_callback_sse2+0xfda>
+  .byte  102,15,111,5,42,46,0,0              // movdqa        0x2e2a(%rip),%xmm0        # 7070 <_sk_callback_sse2+0xff2>
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,219,200                      // pand          %xmm0,%xmm1
   .byte  15,91,209                           // cvtdq2ps      %xmm1,%xmm2
-  .byte  68,15,40,5,14,46,0,0                // movaps        0x2e0e(%rip),%xmm8        # 7040 <_sk_callback_sse2+0xfea>
+  .byte  68,15,40,5,38,46,0,0                // movaps        0x2e26(%rip),%xmm8        # 7080 <_sk_callback_sse2+0x1002>
   .byte  65,15,89,208                        // mulps         %xmm8,%xmm2
   .byte  102,65,15,111,201                   // movdqa        %xmm9,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -38818,7 +38969,7 @@
 _sk_store_bgra_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  68,15,40,5,208,45,0,0               // movaps        0x2dd0(%rip),%xmm8        # 7050 <_sk_callback_sse2+0xffa>
+  .byte  68,15,40,5,232,45,0,0               // movaps        0x2de8(%rip),%xmm8        # 7090 <_sk_callback_sse2+0x1012>
   .byte  68,15,40,202                        // movaps        %xmm2,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  102,69,15,91,201                    // cvtps2dq      %xmm9,%xmm9
@@ -38837,24 +38988,24 @@
   .byte  102,69,15,235,193                   // por           %xmm9,%xmm8
   .byte  102,69,15,235,194                   // por           %xmm10,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           42e0 <_sk_store_bgra_sse2+0x6d>
+  .byte  117,10                              // jne           4308 <_sk_store_bgra_sse2+0x6d>
   .byte  243,68,15,127,4,144                 // movdqu        %xmm8,(%rax,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,3                        // and           $0x3,%r9b
   .byte  65,128,249,1                        // cmp           $0x1,%r9b
-  .byte  116,33                              // je            430e <_sk_store_bgra_sse2+0x9b>
+  .byte  116,33                              // je            4336 <_sk_store_bgra_sse2+0x9b>
   .byte  65,128,249,2                        // cmp           $0x2,%r9b
-  .byte  116,19                              // je            4306 <_sk_store_bgra_sse2+0x93>
+  .byte  116,19                              // je            432e <_sk_store_bgra_sse2+0x93>
   .byte  65,128,249,3                        // cmp           $0x3,%r9b
-  .byte  117,227                             // jne           42dc <_sk_store_bgra_sse2+0x69>
+  .byte  117,227                             // jne           4304 <_sk_store_bgra_sse2+0x69>
   .byte  102,69,15,112,200,78                // pshufd        $0x4e,%xmm8,%xmm9
   .byte  102,68,15,126,76,144,8              // movd          %xmm9,0x8(%rax,%rdx,4)
   .byte  102,68,15,214,4,144                 // movq          %xmm8,(%rax,%rdx,4)
-  .byte  235,206                             // jmp           42dc <_sk_store_bgra_sse2+0x69>
+  .byte  235,206                             // jmp           4304 <_sk_store_bgra_sse2+0x69>
   .byte  102,68,15,126,4,144                 // movd          %xmm8,(%rax,%rdx,4)
-  .byte  235,198                             // jmp           42dc <_sk_store_bgra_sse2+0x69>
+  .byte  235,198                             // jmp           4304 <_sk_store_bgra_sse2+0x69>
 
 HIDDEN _sk_load_f16_sse2
 .globl _sk_load_f16_sse2
@@ -38863,7 +39014,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,96,1,0,0                     // jne           4484 <_sk_load_f16_sse2+0x16e>
+  .byte  15,133,96,1,0,0                     // jne           44ac <_sk_load_f16_sse2+0x16e>
   .byte  102,15,16,4,208                     // movupd        (%rax,%rdx,8),%xmm0
   .byte  102,15,16,76,208,16                 // movupd        0x10(%rax,%rdx,8),%xmm1
   .byte  102,68,15,40,192                    // movapd        %xmm0,%xmm8
@@ -38875,7 +39026,7 @@
   .byte  102,69,15,239,210                   // pxor          %xmm10,%xmm10
   .byte  102,65,15,111,206                   // movdqa        %xmm14,%xmm1
   .byte  102,65,15,97,202                    // punpcklwd     %xmm10,%xmm1
-  .byte  102,68,15,111,13,252,44,0,0         // movdqa        0x2cfc(%rip),%xmm9        # 7060 <_sk_callback_sse2+0x100a>
+  .byte  102,68,15,111,13,20,45,0,0          // movdqa        0x2d14(%rip),%xmm9        # 70a0 <_sk_callback_sse2+0x1022>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,193                   // pand          %xmm9,%xmm0
   .byte  102,15,239,200                      // pxor          %xmm0,%xmm1
@@ -38883,11 +39034,11 @@
   .byte  102,68,15,111,233                   // movdqa        %xmm1,%xmm13
   .byte  102,65,15,114,245,13                // pslld         $0xd,%xmm13
   .byte  102,68,15,235,232                   // por           %xmm0,%xmm13
-  .byte  102,68,15,111,29,225,44,0,0         // movdqa        0x2ce1(%rip),%xmm11        # 7070 <_sk_callback_sse2+0x101a>
+  .byte  102,68,15,111,29,249,44,0,0         // movdqa        0x2cf9(%rip),%xmm11        # 70b0 <_sk_callback_sse2+0x1032>
   .byte  102,69,15,254,235                   // paddd         %xmm11,%xmm13
-  .byte  102,68,15,111,37,227,44,0,0         // movdqa        0x2ce3(%rip),%xmm12        # 7080 <_sk_callback_sse2+0x102a>
+  .byte  102,68,15,111,37,251,44,0,0         // movdqa        0x2cfb(%rip),%xmm12        # 70c0 <_sk_callback_sse2+0x1042>
   .byte  102,65,15,239,204                   // pxor          %xmm12,%xmm1
-  .byte  102,15,111,29,230,44,0,0            // movdqa        0x2ce6(%rip),%xmm3        # 7090 <_sk_callback_sse2+0x103a>
+  .byte  102,15,111,29,254,44,0,0            // movdqa        0x2cfe(%rip),%xmm3        # 70d0 <_sk_callback_sse2+0x1052>
   .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
   .byte  102,15,102,193                      // pcmpgtd       %xmm1,%xmm0
   .byte  102,65,15,223,197                   // pandn         %xmm13,%xmm0
@@ -38935,17 +39086,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,15,16,4,208                     // movsd         (%rax,%rdx,8),%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,17                              // jne           44a0 <_sk_load_f16_sse2+0x18a>
+  .byte  117,17                              // jne           44c8 <_sk_load_f16_sse2+0x18a>
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
   .byte  102,15,20,193                       // unpcklpd      %xmm1,%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
-  .byte  233,143,254,255,255                 // jmpq          432f <_sk_load_f16_sse2+0x19>
+  .byte  233,143,254,255,255                 // jmpq          4357 <_sk_load_f16_sse2+0x19>
   .byte  102,15,22,68,208,8                  // movhpd        0x8(%rax,%rdx,8),%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,123,254,255,255              // jb            432f <_sk_load_f16_sse2+0x19>
+  .byte  15,130,123,254,255,255              // jb            4357 <_sk_load_f16_sse2+0x19>
   .byte  242,15,16,76,208,16                 // movsd         0x10(%rax,%rdx,8),%xmm1
-  .byte  233,112,254,255,255                 // jmpq          432f <_sk_load_f16_sse2+0x19>
+  .byte  233,112,254,255,255                 // jmpq          4357 <_sk_load_f16_sse2+0x19>
 
 HIDDEN _sk_load_f16_dst_sse2
 .globl _sk_load_f16_dst_sse2
@@ -38954,7 +39105,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,96,1,0,0                     // jne           462d <_sk_load_f16_dst_sse2+0x16e>
+  .byte  15,133,96,1,0,0                     // jne           4655 <_sk_load_f16_dst_sse2+0x16e>
   .byte  102,15,16,36,208                    // movupd        (%rax,%rdx,8),%xmm4
   .byte  102,15,16,108,208,16                // movupd        0x10(%rax,%rdx,8),%xmm5
   .byte  102,68,15,40,196                    // movapd        %xmm4,%xmm8
@@ -38966,7 +39117,7 @@
   .byte  102,69,15,239,210                   // pxor          %xmm10,%xmm10
   .byte  102,65,15,111,238                   // movdqa        %xmm14,%xmm5
   .byte  102,65,15,97,234                    // punpcklwd     %xmm10,%xmm5
-  .byte  102,68,15,111,13,147,43,0,0         // movdqa        0x2b93(%rip),%xmm9        # 70a0 <_sk_callback_sse2+0x104a>
+  .byte  102,68,15,111,13,171,43,0,0         // movdqa        0x2bab(%rip),%xmm9        # 70e0 <_sk_callback_sse2+0x1062>
   .byte  102,15,111,229                      // movdqa        %xmm5,%xmm4
   .byte  102,65,15,219,225                   // pand          %xmm9,%xmm4
   .byte  102,15,239,236                      // pxor          %xmm4,%xmm5
@@ -38974,11 +39125,11 @@
   .byte  102,68,15,111,237                   // movdqa        %xmm5,%xmm13
   .byte  102,65,15,114,245,13                // pslld         $0xd,%xmm13
   .byte  102,68,15,235,236                   // por           %xmm4,%xmm13
-  .byte  102,68,15,111,29,120,43,0,0         // movdqa        0x2b78(%rip),%xmm11        # 70b0 <_sk_callback_sse2+0x105a>
+  .byte  102,68,15,111,29,144,43,0,0         // movdqa        0x2b90(%rip),%xmm11        # 70f0 <_sk_callback_sse2+0x1072>
   .byte  102,69,15,254,235                   // paddd         %xmm11,%xmm13
-  .byte  102,68,15,111,37,122,43,0,0         // movdqa        0x2b7a(%rip),%xmm12        # 70c0 <_sk_callback_sse2+0x106a>
+  .byte  102,68,15,111,37,146,43,0,0         // movdqa        0x2b92(%rip),%xmm12        # 7100 <_sk_callback_sse2+0x1082>
   .byte  102,65,15,239,236                   // pxor          %xmm12,%xmm5
-  .byte  102,15,111,61,125,43,0,0            // movdqa        0x2b7d(%rip),%xmm7        # 70d0 <_sk_callback_sse2+0x107a>
+  .byte  102,15,111,61,149,43,0,0            // movdqa        0x2b95(%rip),%xmm7        # 7110 <_sk_callback_sse2+0x1092>
   .byte  102,15,111,231                      // movdqa        %xmm7,%xmm4
   .byte  102,15,102,229                      // pcmpgtd       %xmm5,%xmm4
   .byte  102,65,15,223,229                   // pandn         %xmm13,%xmm4
@@ -39026,17 +39177,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,15,16,36,208                    // movsd         (%rax,%rdx,8),%xmm4
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,17                              // jne           4649 <_sk_load_f16_dst_sse2+0x18a>
+  .byte  117,17                              // jne           4671 <_sk_load_f16_dst_sse2+0x18a>
   .byte  102,15,87,237                       // xorpd         %xmm5,%xmm5
   .byte  102,15,20,229                       // unpcklpd      %xmm5,%xmm4
   .byte  102,15,87,237                       // xorpd         %xmm5,%xmm5
-  .byte  233,143,254,255,255                 // jmpq          44d8 <_sk_load_f16_dst_sse2+0x19>
+  .byte  233,143,254,255,255                 // jmpq          4500 <_sk_load_f16_dst_sse2+0x19>
   .byte  102,15,22,100,208,8                 // movhpd        0x8(%rax,%rdx,8),%xmm4
   .byte  102,15,87,237                       // xorpd         %xmm5,%xmm5
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,123,254,255,255              // jb            44d8 <_sk_load_f16_dst_sse2+0x19>
+  .byte  15,130,123,254,255,255              // jb            4500 <_sk_load_f16_dst_sse2+0x19>
   .byte  242,15,16,108,208,16                // movsd         0x10(%rax,%rdx,8),%xmm5
-  .byte  233,112,254,255,255                 // jmpq          44d8 <_sk_load_f16_dst_sse2+0x19>
+  .byte  233,112,254,255,255                 // jmpq          4500 <_sk_load_f16_dst_sse2+0x19>
 
 HIDDEN _sk_gather_f16_sse2
 .globl _sk_gather_f16_sse2
@@ -39078,7 +39229,7 @@
   .byte  102,69,15,239,210                   // pxor          %xmm10,%xmm10
   .byte  102,65,15,111,206                   // movdqa        %xmm14,%xmm1
   .byte  102,65,15,97,202                    // punpcklwd     %xmm10,%xmm1
-  .byte  102,68,15,111,13,207,41,0,0         // movdqa        0x29cf(%rip),%xmm9        # 70e0 <_sk_callback_sse2+0x108a>
+  .byte  102,68,15,111,13,231,41,0,0         // movdqa        0x29e7(%rip),%xmm9        # 7120 <_sk_callback_sse2+0x10a2>
   .byte  102,15,111,193                      // movdqa        %xmm1,%xmm0
   .byte  102,65,15,219,193                   // pand          %xmm9,%xmm0
   .byte  102,15,239,200                      // pxor          %xmm0,%xmm1
@@ -39086,11 +39237,11 @@
   .byte  102,68,15,111,233                   // movdqa        %xmm1,%xmm13
   .byte  102,65,15,114,245,13                // pslld         $0xd,%xmm13
   .byte  102,68,15,235,232                   // por           %xmm0,%xmm13
-  .byte  102,68,15,111,29,180,41,0,0         // movdqa        0x29b4(%rip),%xmm11        # 70f0 <_sk_callback_sse2+0x109a>
+  .byte  102,68,15,111,29,204,41,0,0         // movdqa        0x29cc(%rip),%xmm11        # 7130 <_sk_callback_sse2+0x10b2>
   .byte  102,69,15,254,235                   // paddd         %xmm11,%xmm13
-  .byte  102,68,15,111,37,182,41,0,0         // movdqa        0x29b6(%rip),%xmm12        # 7100 <_sk_callback_sse2+0x10aa>
+  .byte  102,68,15,111,37,206,41,0,0         // movdqa        0x29ce(%rip),%xmm12        # 7140 <_sk_callback_sse2+0x10c2>
   .byte  102,65,15,239,204                   // pxor          %xmm12,%xmm1
-  .byte  102,15,111,29,185,41,0,0            // movdqa        0x29b9(%rip),%xmm3        # 7110 <_sk_callback_sse2+0x10ba>
+  .byte  102,15,111,29,209,41,0,0            // movdqa        0x29d1(%rip),%xmm3        # 7150 <_sk_callback_sse2+0x10d2>
   .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
   .byte  102,15,102,193                      // pcmpgtd       %xmm1,%xmm0
   .byte  102,65,15,223,197                   // pandn         %xmm13,%xmm0
@@ -39144,17 +39295,17 @@
 _sk_store_f16_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  72,139,0                            // mov           (%rax),%rax
-  .byte  102,68,15,111,21,224,40,0,0         // movdqa        0x28e0(%rip),%xmm10        # 7120 <_sk_callback_sse2+0x10ca>
+  .byte  102,68,15,111,21,248,40,0,0         // movdqa        0x28f8(%rip),%xmm10        # 7160 <_sk_callback_sse2+0x10e2>
   .byte  102,68,15,111,224                   // movdqa        %xmm0,%xmm12
   .byte  102,69,15,219,226                   // pand          %xmm10,%xmm12
   .byte  102,68,15,111,232                   // movdqa        %xmm0,%xmm13
   .byte  102,69,15,239,236                   // pxor          %xmm12,%xmm13
-  .byte  102,68,15,111,13,211,40,0,0         // movdqa        0x28d3(%rip),%xmm9        # 7130 <_sk_callback_sse2+0x10da>
+  .byte  102,68,15,111,13,235,40,0,0         // movdqa        0x28eb(%rip),%xmm9        # 7170 <_sk_callback_sse2+0x10f2>
   .byte  102,65,15,114,212,16                // psrld         $0x10,%xmm12
   .byte  102,69,15,111,193                   // movdqa        %xmm9,%xmm8
   .byte  102,69,15,102,197                   // pcmpgtd       %xmm13,%xmm8
   .byte  102,65,15,114,213,13                // psrld         $0xd,%xmm13
-  .byte  102,68,15,111,29,196,40,0,0         // movdqa        0x28c4(%rip),%xmm11        # 7140 <_sk_callback_sse2+0x10ea>
+  .byte  102,68,15,111,29,220,40,0,0         // movdqa        0x28dc(%rip),%xmm11        # 7180 <_sk_callback_sse2+0x1102>
   .byte  102,69,15,235,227                   // por           %xmm11,%xmm12
   .byte  102,69,15,254,229                   // paddd         %xmm13,%xmm12
   .byte  102,65,15,114,244,16                // pslld         $0x10,%xmm12
@@ -39206,7 +39357,7 @@
   .byte  102,69,15,111,200                   // movdqa        %xmm8,%xmm9
   .byte  102,69,15,98,204                    // punpckldq     %xmm12,%xmm9
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,21                              // jne           499e <_sk_store_f16_sse2+0x16c>
+  .byte  117,21                              // jne           49c6 <_sk_store_f16_sse2+0x16c>
   .byte  68,15,17,12,208                     // movups        %xmm9,(%rax,%rdx,8)
   .byte  102,69,15,106,196                   // punpckhdq     %xmm12,%xmm8
   .byte  243,68,15,127,68,208,16             // movdqu        %xmm8,0x10(%rax,%rdx,8)
@@ -39214,13 +39365,13 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  102,68,15,214,12,208                // movq          %xmm9,(%rax,%rdx,8)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            499a <_sk_store_f16_sse2+0x168>
+  .byte  116,240                             // je            49c2 <_sk_store_f16_sse2+0x168>
   .byte  102,68,15,23,76,208,8               // movhpd        %xmm9,0x8(%rax,%rdx,8)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            499a <_sk_store_f16_sse2+0x168>
+  .byte  114,227                             // jb            49c2 <_sk_store_f16_sse2+0x168>
   .byte  102,69,15,106,196                   // punpckhdq     %xmm12,%xmm8
   .byte  102,68,15,214,68,208,16             // movq          %xmm8,0x10(%rax,%rdx,8)
-  .byte  235,213                             // jmp           499a <_sk_store_f16_sse2+0x168>
+  .byte  235,213                             // jmp           49c2 <_sk_store_f16_sse2+0x168>
 
 HIDDEN _sk_load_u16_be_sse2
 .globl _sk_load_u16_be_sse2
@@ -39230,7 +39381,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,190,0,0,0                    // jne           4a99 <_sk_load_u16_be_sse2+0xd4>
+  .byte  15,133,190,0,0,0                    // jne           4ac1 <_sk_load_u16_be_sse2+0xd4>
   .byte  102,65,15,16,4,65                   // movupd        (%r9,%rax,2),%xmm0
   .byte  102,65,15,16,76,65,16               // movupd        0x10(%r9,%rax,2),%xmm1
   .byte  102,15,40,208                       // movapd        %xmm0,%xmm2
@@ -39247,7 +39398,7 @@
   .byte  102,69,15,239,201                   // pxor          %xmm9,%xmm9
   .byte  102,65,15,97,201                    // punpcklwd     %xmm9,%xmm1
   .byte  15,91,193                           // cvtdq2ps      %xmm1,%xmm0
-  .byte  68,15,40,5,36,39,0,0                // movaps        0x2724(%rip),%xmm8        # 7150 <_sk_callback_sse2+0x10fa>
+  .byte  68,15,40,5,60,39,0,0                // movaps        0x273c(%rip),%xmm8        # 7190 <_sk_callback_sse2+0x1112>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -39275,17 +39426,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  242,65,15,16,4,65                   // movsd         (%r9,%rax,2),%xmm0
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,17                              // jne           4ab6 <_sk_load_u16_be_sse2+0xf1>
+  .byte  117,17                              // jne           4ade <_sk_load_u16_be_sse2+0xf1>
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
   .byte  102,15,20,193                       // unpcklpd      %xmm1,%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
-  .byte  233,50,255,255,255                  // jmpq          49e8 <_sk_load_u16_be_sse2+0x23>
+  .byte  233,50,255,255,255                  // jmpq          4a10 <_sk_load_u16_be_sse2+0x23>
   .byte  102,65,15,22,68,65,8                // movhpd        0x8(%r9,%rax,2),%xmm0
   .byte  102,15,87,201                       // xorpd         %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  15,130,29,255,255,255               // jb            49e8 <_sk_load_u16_be_sse2+0x23>
+  .byte  15,130,29,255,255,255               // jb            4a10 <_sk_load_u16_be_sse2+0x23>
   .byte  242,65,15,16,76,65,16               // movsd         0x10(%r9,%rax,2),%xmm1
-  .byte  233,17,255,255,255                  // jmpq          49e8 <_sk_load_u16_be_sse2+0x23>
+  .byte  233,17,255,255,255                  // jmpq          4a10 <_sk_load_u16_be_sse2+0x23>
 
 HIDDEN _sk_load_rgb_u16_be_sse2
 .globl _sk_load_rgb_u16_be_sse2
@@ -39295,7 +39446,7 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,82                         // lea           (%rdx,%rdx,2),%rax
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,175,0,0,0                    // jne           4b98 <_sk_load_rgb_u16_be_sse2+0xc1>
+  .byte  15,133,175,0,0,0                    // jne           4bc0 <_sk_load_rgb_u16_be_sse2+0xc1>
   .byte  243,65,15,111,20,65                 // movdqu        (%r9,%rax,2),%xmm2
   .byte  243,65,15,111,92,65,8               // movdqu        0x8(%r9,%rax,2),%xmm3
   .byte  102,15,115,219,4                    // psrldq        $0x4,%xmm3
@@ -39316,7 +39467,7 @@
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  102,65,15,97,200                    // punpcklwd     %xmm8,%xmm1
   .byte  15,91,193                           // cvtdq2ps      %xmm1,%xmm0
-  .byte  68,15,40,13,19,38,0,0               // movaps        0x2613(%rip),%xmm9        # 7160 <_sk_callback_sse2+0x110a>
+  .byte  68,15,40,13,43,38,0,0               // movaps        0x262b(%rip),%xmm9        # 71a0 <_sk_callback_sse2+0x1122>
   .byte  65,15,89,193                        // mulps         %xmm9,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -39333,27 +39484,27 @@
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
   .byte  65,15,89,209                        // mulps         %xmm9,%xmm2
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,218,37,0,0                 // movaps        0x25da(%rip),%xmm3        # 7170 <_sk_callback_sse2+0x111a>
+  .byte  15,40,29,242,37,0,0                 // movaps        0x25f2(%rip),%xmm3        # 71b0 <_sk_callback_sse2+0x1132>
   .byte  255,224                             // jmpq          *%rax
   .byte  102,65,15,110,20,65                 // movd          (%r9,%rax,2),%xmm2
   .byte  102,65,15,196,84,65,4,2             // pinsrw        $0x2,0x4(%r9,%rax,2),%xmm2
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,13                              // jne           4bbd <_sk_load_rgb_u16_be_sse2+0xe6>
+  .byte  117,13                              // jne           4be5 <_sk_load_rgb_u16_be_sse2+0xe6>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
-  .byte  233,80,255,255,255                  // jmpq          4b0d <_sk_load_rgb_u16_be_sse2+0x36>
+  .byte  233,80,255,255,255                  // jmpq          4b35 <_sk_load_rgb_u16_be_sse2+0x36>
   .byte  102,65,15,110,68,65,6               // movd          0x6(%r9,%rax,2),%xmm0
   .byte  102,65,15,196,68,65,10,2            // pinsrw        $0x2,0xa(%r9,%rax,2),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,24                              // jb            4bee <_sk_load_rgb_u16_be_sse2+0x117>
+  .byte  114,24                              // jb            4c16 <_sk_load_rgb_u16_be_sse2+0x117>
   .byte  102,65,15,110,92,65,12              // movd          0xc(%r9,%rax,2),%xmm3
   .byte  102,65,15,196,92,65,16,2            // pinsrw        $0x2,0x10(%r9,%rax,2),%xmm3
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  233,31,255,255,255                  // jmpq          4b0d <_sk_load_rgb_u16_be_sse2+0x36>
+  .byte  233,31,255,255,255                  // jmpq          4b35 <_sk_load_rgb_u16_be_sse2+0x36>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
-  .byte  233,22,255,255,255                  // jmpq          4b0d <_sk_load_rgb_u16_be_sse2+0x36>
+  .byte  233,22,255,255,255                  // jmpq          4b35 <_sk_load_rgb_u16_be_sse2+0x36>
 
 HIDDEN _sk_store_u16_be_sse2
 .globl _sk_store_u16_be_sse2
@@ -39362,7 +39513,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  72,141,4,149,0,0,0,0                // lea           0x0(,%rdx,4),%rax
-  .byte  68,15,40,21,116,37,0,0              // movaps        0x2574(%rip),%xmm10        # 7180 <_sk_callback_sse2+0x112a>
+  .byte  68,15,40,21,140,37,0,0              // movaps        0x258c(%rip),%xmm10        # 71c0 <_sk_callback_sse2+0x1142>
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
   .byte  69,15,89,194                        // mulps         %xmm10,%xmm8
   .byte  102,69,15,91,192                    // cvtps2dq      %xmm8,%xmm8
@@ -39407,7 +39558,7 @@
   .byte  102,69,15,111,208                   // movdqa        %xmm8,%xmm10
   .byte  102,69,15,98,209                    // punpckldq     %xmm9,%xmm10
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,21                              // jne           4d06 <_sk_store_u16_be_sse2+0x10f>
+  .byte  117,21                              // jne           4d2e <_sk_store_u16_be_sse2+0x10f>
   .byte  69,15,17,20,65                      // movups        %xmm10,(%r9,%rax,2)
   .byte  102,69,15,106,193                   // punpckhdq     %xmm9,%xmm8
   .byte  243,69,15,127,68,65,16              // movdqu        %xmm8,0x10(%r9,%rax,2)
@@ -39415,13 +39566,13 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  102,69,15,214,20,65                 // movq          %xmm10,(%r9,%rax,2)
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,240                             // je            4d02 <_sk_store_u16_be_sse2+0x10b>
+  .byte  116,240                             // je            4d2a <_sk_store_u16_be_sse2+0x10b>
   .byte  102,69,15,23,84,65,8                // movhpd        %xmm10,0x8(%r9,%rax,2)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,227                             // jb            4d02 <_sk_store_u16_be_sse2+0x10b>
+  .byte  114,227                             // jb            4d2a <_sk_store_u16_be_sse2+0x10b>
   .byte  102,69,15,106,193                   // punpckhdq     %xmm9,%xmm8
   .byte  102,69,15,214,68,65,16              // movq          %xmm8,0x10(%r9,%rax,2)
-  .byte  235,213                             // jmp           4d02 <_sk_store_u16_be_sse2+0x10b>
+  .byte  235,213                             // jmp           4d2a <_sk_store_u16_be_sse2+0x10b>
 
 HIDDEN _sk_load_f32_sse2
 .globl _sk_load_f32_sse2
@@ -39434,7 +39585,7 @@
   .byte  72,193,224,4                        // shl           $0x4,%rax
   .byte  69,15,16,4,2                        // movups        (%r10,%rax,1),%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           4d8d <_sk_load_f32_sse2+0x60>
+  .byte  117,66                              // jne           4db5 <_sk_load_f32_sse2+0x60>
   .byte  67,15,16,68,138,16                  // movups        0x10(%r10,%r9,4),%xmm0
   .byte  67,15,16,92,138,32                  // movups        0x20(%r10,%r9,4),%xmm3
   .byte  71,15,16,76,138,48                  // movups        0x30(%r10,%r9,4),%xmm9
@@ -39454,17 +39605,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  69,15,87,201                        // xorps         %xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,8                               // jne           4d9f <_sk_load_f32_sse2+0x72>
+  .byte  117,8                               // jne           4dc7 <_sk_load_f32_sse2+0x72>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
-  .byte  235,190                             // jmp           4d5d <_sk_load_f32_sse2+0x30>
+  .byte  235,190                             // jmp           4d85 <_sk_load_f32_sse2+0x30>
   .byte  67,15,16,68,138,16                  // movups        0x10(%r10,%r9,4),%xmm0
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,8                               // jb            4db3 <_sk_load_f32_sse2+0x86>
+  .byte  114,8                               // jb            4ddb <_sk_load_f32_sse2+0x86>
   .byte  67,15,16,92,138,32                  // movups        0x20(%r10,%r9,4),%xmm3
-  .byte  235,170                             // jmp           4d5d <_sk_load_f32_sse2+0x30>
+  .byte  235,170                             // jmp           4d85 <_sk_load_f32_sse2+0x30>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
-  .byte  235,165                             // jmp           4d5d <_sk_load_f32_sse2+0x30>
+  .byte  235,165                             // jmp           4d85 <_sk_load_f32_sse2+0x30>
 
 HIDDEN _sk_load_f32_dst_sse2
 .globl _sk_load_f32_dst_sse2
@@ -39477,7 +39628,7 @@
   .byte  72,193,224,4                        // shl           $0x4,%rax
   .byte  69,15,16,4,2                        // movups        (%r10,%rax,1),%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,66                              // jne           4e18 <_sk_load_f32_dst_sse2+0x60>
+  .byte  117,66                              // jne           4e40 <_sk_load_f32_dst_sse2+0x60>
   .byte  67,15,16,100,138,16                 // movups        0x10(%r10,%r9,4),%xmm4
   .byte  67,15,16,124,138,32                 // movups        0x20(%r10,%r9,4),%xmm7
   .byte  71,15,16,76,138,48                  // movups        0x30(%r10,%r9,4),%xmm9
@@ -39497,17 +39648,17 @@
   .byte  255,224                             // jmpq          *%rax
   .byte  69,15,87,201                        // xorps         %xmm9,%xmm9
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  117,8                               // jne           4e2a <_sk_load_f32_dst_sse2+0x72>
+  .byte  117,8                               // jne           4e52 <_sk_load_f32_dst_sse2+0x72>
   .byte  15,87,255                           // xorps         %xmm7,%xmm7
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
-  .byte  235,190                             // jmp           4de8 <_sk_load_f32_dst_sse2+0x30>
+  .byte  235,190                             // jmp           4e10 <_sk_load_f32_dst_sse2+0x30>
   .byte  67,15,16,100,138,16                 // movups        0x10(%r10,%r9,4),%xmm4
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,8                               // jb            4e3e <_sk_load_f32_dst_sse2+0x86>
+  .byte  114,8                               // jb            4e66 <_sk_load_f32_dst_sse2+0x86>
   .byte  67,15,16,124,138,32                 // movups        0x20(%r10,%r9,4),%xmm7
-  .byte  235,170                             // jmp           4de8 <_sk_load_f32_dst_sse2+0x30>
+  .byte  235,170                             // jmp           4e10 <_sk_load_f32_dst_sse2+0x30>
   .byte  15,87,255                           // xorps         %xmm7,%xmm7
-  .byte  235,165                             // jmp           4de8 <_sk_load_f32_dst_sse2+0x30>
+  .byte  235,165                             // jmp           4e10 <_sk_load_f32_dst_sse2+0x30>
 
 HIDDEN _sk_store_f32_sse2
 .globl _sk_store_f32_sse2
@@ -39533,7 +39684,7 @@
   .byte  102,69,15,20,203                    // unpcklpd      %xmm11,%xmm9
   .byte  102,69,15,17,36,2                   // movupd        %xmm12,(%r10,%rax,1)
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,29                              // jne           4eb5 <_sk_store_f32_sse2+0x72>
+  .byte  117,29                              // jne           4edd <_sk_store_f32_sse2+0x72>
   .byte  102,69,15,21,211                    // unpckhpd      %xmm11,%xmm10
   .byte  71,15,17,68,138,16                  // movups        %xmm8,0x10(%r10,%r9,4)
   .byte  102,71,15,17,76,138,32              // movupd        %xmm9,0x20(%r10,%r9,4)
@@ -39541,12 +39692,12 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  73,131,248,1                        // cmp           $0x1,%r8
-  .byte  116,246                             // je            4eb1 <_sk_store_f32_sse2+0x6e>
+  .byte  116,246                             // je            4ed9 <_sk_store_f32_sse2+0x6e>
   .byte  71,15,17,68,138,16                  // movups        %xmm8,0x10(%r10,%r9,4)
   .byte  73,131,248,3                        // cmp           $0x3,%r8
-  .byte  114,234                             // jb            4eb1 <_sk_store_f32_sse2+0x6e>
+  .byte  114,234                             // jb            4ed9 <_sk_store_f32_sse2+0x6e>
   .byte  102,71,15,17,76,138,32              // movupd        %xmm9,0x20(%r10,%r9,4)
-  .byte  235,225                             // jmp           4eb1 <_sk_store_f32_sse2+0x6e>
+  .byte  235,225                             // jmp           4ed9 <_sk_store_f32_sse2+0x6e>
 
 HIDDEN _sk_clamp_x_sse2
 .globl _sk_clamp_x_sse2
@@ -39592,7 +39743,7 @@
   .byte  243,69,15,91,209                    // cvttps2dq     %xmm9,%xmm10
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
   .byte  69,15,194,202,1                     // cmpltps       %xmm10,%xmm9
-  .byte  68,15,84,13,66,34,0,0               // andps         0x2242(%rip),%xmm9        # 7190 <_sk_callback_sse2+0x113a>
+  .byte  68,15,84,13,90,34,0,0               // andps         0x225a(%rip),%xmm9        # 71d0 <_sk_callback_sse2+0x1152>
   .byte  69,15,92,209                        // subps         %xmm9,%xmm10
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
@@ -39615,7 +39766,7 @@
   .byte  243,69,15,91,209                    // cvttps2dq     %xmm9,%xmm10
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
   .byte  69,15,194,202,1                     // cmpltps       %xmm10,%xmm9
-  .byte  68,15,84,13,3,34,0,0                // andps         0x2203(%rip),%xmm9        # 71a0 <_sk_callback_sse2+0x114a>
+  .byte  68,15,84,13,27,34,0,0               // andps         0x221b(%rip),%xmm9        # 71e0 <_sk_callback_sse2+0x1162>
   .byte  69,15,92,209                        // subps         %xmm9,%xmm10
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
   .byte  69,15,89,208                        // mulps         %xmm8,%xmm10
@@ -39638,13 +39789,13 @@
   .byte  65,15,92,192                        // subps         %xmm8,%xmm0
   .byte  243,69,15,88,201                    // addss         %xmm9,%xmm9
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
-  .byte  243,68,15,89,21,115,38,0,0          // mulss         0x2673(%rip),%xmm10        # 7660 <_sk_callback_sse2+0x160a>
+  .byte  243,68,15,89,21,139,38,0,0          // mulss         0x268b(%rip),%xmm10        # 76a0 <_sk_callback_sse2+0x1622>
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  68,15,89,208                        // mulps         %xmm0,%xmm10
   .byte  243,69,15,91,218                    // cvttps2dq     %xmm10,%xmm11
   .byte  69,15,91,219                        // cvtdq2ps      %xmm11,%xmm11
   .byte  69,15,194,211,1                     // cmpltps       %xmm11,%xmm10
-  .byte  68,15,84,21,164,33,0,0              // andps         0x21a4(%rip),%xmm10        # 71b0 <_sk_callback_sse2+0x115a>
+  .byte  68,15,84,21,188,33,0,0              // andps         0x21bc(%rip),%xmm10        # 71f0 <_sk_callback_sse2+0x1172>
   .byte  69,15,87,228                        // xorps         %xmm12,%xmm12
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
   .byte  69,15,89,217                        // mulps         %xmm9,%xmm11
@@ -39670,13 +39821,13 @@
   .byte  65,15,92,200                        // subps         %xmm8,%xmm1
   .byte  243,69,15,88,201                    // addss         %xmm9,%xmm9
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
-  .byte  243,68,15,89,21,253,37,0,0          // mulss         0x25fd(%rip),%xmm10        # 7664 <_sk_callback_sse2+0x160e>
+  .byte  243,68,15,89,21,21,38,0,0           // mulss         0x2615(%rip),%xmm10        # 76a4 <_sk_callback_sse2+0x1626>
   .byte  69,15,198,210,0                     // shufps        $0x0,%xmm10,%xmm10
   .byte  68,15,89,209                        // mulps         %xmm1,%xmm10
   .byte  243,69,15,91,218                    // cvttps2dq     %xmm10,%xmm11
   .byte  69,15,91,219                        // cvtdq2ps      %xmm11,%xmm11
   .byte  69,15,194,211,1                     // cmpltps       %xmm11,%xmm10
-  .byte  68,15,84,21,58,33,0,0               // andps         0x213a(%rip),%xmm10        # 71c0 <_sk_callback_sse2+0x116a>
+  .byte  68,15,84,21,82,33,0,0               // andps         0x2152(%rip),%xmm10        # 7200 <_sk_callback_sse2+0x1182>
   .byte  69,15,87,228                        // xorps         %xmm12,%xmm12
   .byte  69,15,92,218                        // subps         %xmm10,%xmm11
   .byte  69,15,89,217                        // mulps         %xmm9,%xmm11
@@ -39696,7 +39847,7 @@
 _sk_clamp_x_1_sse2:
   .byte  69,15,87,192                        // xorps         %xmm8,%xmm8
   .byte  68,15,95,192                        // maxps         %xmm0,%xmm8
-  .byte  68,15,93,5,12,33,0,0                // minps         0x210c(%rip),%xmm8        # 71d0 <_sk_callback_sse2+0x117a>
+  .byte  68,15,93,5,36,33,0,0                // minps         0x2124(%rip),%xmm8        # 7210 <_sk_callback_sse2+0x1192>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  65,15,40,192                        // movaps        %xmm8,%xmm0
   .byte  255,224                             // jmpq          *%rax
@@ -39709,7 +39860,7 @@
   .byte  69,15,91,192                        // cvtdq2ps      %xmm8,%xmm8
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,194,200,1                     // cmpltps       %xmm8,%xmm9
-  .byte  68,15,84,13,250,32,0,0              // andps         0x20fa(%rip),%xmm9        # 71e0 <_sk_callback_sse2+0x118a>
+  .byte  68,15,84,13,18,33,0,0               // andps         0x2112(%rip),%xmm9        # 7220 <_sk_callback_sse2+0x11a2>
   .byte  69,15,92,193                        // subps         %xmm9,%xmm8
   .byte  65,15,92,192                        // subps         %xmm8,%xmm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -39719,14 +39870,14 @@
 .globl _sk_mirror_x_1_sse2
 FUNCTION(_sk_mirror_x_1_sse2)
 _sk_mirror_x_1_sse2:
-  .byte  68,15,40,5,246,32,0,0               // movaps        0x20f6(%rip),%xmm8        # 71f0 <_sk_callback_sse2+0x119a>
+  .byte  68,15,40,5,14,33,0,0                // movaps        0x210e(%rip),%xmm8        # 7230 <_sk_callback_sse2+0x11b2>
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
-  .byte  68,15,40,13,250,32,0,0              // movaps        0x20fa(%rip),%xmm9        # 7200 <_sk_callback_sse2+0x11aa>
+  .byte  68,15,40,13,18,33,0,0               // movaps        0x2112(%rip),%xmm9        # 7240 <_sk_callback_sse2+0x11c2>
   .byte  68,15,89,200                        // mulps         %xmm0,%xmm9
   .byte  243,69,15,91,209                    // cvttps2dq     %xmm9,%xmm10
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
   .byte  69,15,194,202,1                     // cmpltps       %xmm10,%xmm9
-  .byte  68,15,84,13,240,32,0,0              // andps         0x20f0(%rip),%xmm9        # 7210 <_sk_callback_sse2+0x11ba>
+  .byte  68,15,84,13,8,33,0,0                // andps         0x2108(%rip),%xmm9        # 7250 <_sk_callback_sse2+0x11d2>
   .byte  69,15,87,219                        // xorps         %xmm11,%xmm11
   .byte  69,15,92,209                        // subps         %xmm9,%xmm10
   .byte  69,15,88,210                        // addps         %xmm10,%xmm10
@@ -39742,10 +39893,10 @@
 FUNCTION(_sk_luminance_to_alpha_sse2)
 _sk_luminance_to_alpha_sse2:
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
-  .byte  15,89,5,214,32,0,0                  // mulps         0x20d6(%rip),%xmm0        # 7220 <_sk_callback_sse2+0x11ca>
-  .byte  15,89,13,223,32,0,0                 // mulps         0x20df(%rip),%xmm1        # 7230 <_sk_callback_sse2+0x11da>
+  .byte  15,89,5,238,32,0,0                  // mulps         0x20ee(%rip),%xmm0        # 7260 <_sk_callback_sse2+0x11e2>
+  .byte  15,89,13,247,32,0,0                 // mulps         0x20f7(%rip),%xmm1        # 7270 <_sk_callback_sse2+0x11f2>
   .byte  15,88,200                           // addps         %xmm0,%xmm1
-  .byte  15,89,29,229,32,0,0                 // mulps         0x20e5(%rip),%xmm3        # 7240 <_sk_callback_sse2+0x11ea>
+  .byte  15,89,29,253,32,0,0                 // mulps         0x20fd(%rip),%xmm3        # 7280 <_sk_callback_sse2+0x1202>
   .byte  15,88,217                           // addps         %xmm1,%xmm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
@@ -40057,9 +40208,9 @@
   .byte  72,139,24                           // mov           (%rax),%rbx
   .byte  76,139,112,8                        // mov           0x8(%rax),%r14
   .byte  72,255,203                          // dec           %rbx
-  .byte  120,7                               // js            55fb <_sk_evenly_spaced_gradient_sse2+0x18>
+  .byte  120,7                               // js            5623 <_sk_evenly_spaced_gradient_sse2+0x18>
   .byte  243,72,15,42,203                    // cvtsi2ss      %rbx,%xmm1
-  .byte  235,21                              // jmp           5610 <_sk_evenly_spaced_gradient_sse2+0x2d>
+  .byte  235,21                              // jmp           5638 <_sk_evenly_spaced_gradient_sse2+0x2d>
   .byte  73,137,217                          // mov           %rbx,%r9
   .byte  73,209,233                          // shr           %r9
   .byte  131,227,1                           // and           $0x1,%ebx
@@ -40157,15 +40308,15 @@
 .globl _sk_gauss_a_to_rgba_sse2
 FUNCTION(_sk_gauss_a_to_rgba_sse2)
 _sk_gauss_a_to_rgba_sse2:
-  .byte  15,40,5,180,26,0,0                  // movaps        0x1ab4(%rip),%xmm0        # 7250 <_sk_callback_sse2+0x11fa>
+  .byte  15,40,5,204,26,0,0                  // movaps        0x1acc(%rip),%xmm0        # 7290 <_sk_callback_sse2+0x1212>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,186,26,0,0                  // addps         0x1aba(%rip),%xmm0        # 7260 <_sk_callback_sse2+0x120a>
+  .byte  15,88,5,210,26,0,0                  // addps         0x1ad2(%rip),%xmm0        # 72a0 <_sk_callback_sse2+0x1222>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,192,26,0,0                  // addps         0x1ac0(%rip),%xmm0        # 7270 <_sk_callback_sse2+0x121a>
+  .byte  15,88,5,216,26,0,0                  // addps         0x1ad8(%rip),%xmm0        # 72b0 <_sk_callback_sse2+0x1232>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,198,26,0,0                  // addps         0x1ac6(%rip),%xmm0        # 7280 <_sk_callback_sse2+0x122a>
+  .byte  15,88,5,222,26,0,0                  // addps         0x1ade(%rip),%xmm0        # 72c0 <_sk_callback_sse2+0x1242>
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,5,204,26,0,0                  // addps         0x1acc(%rip),%xmm0        # 7290 <_sk_callback_sse2+0x123a>
+  .byte  15,88,5,228,26,0,0                  // addps         0x1ae4(%rip),%xmm0        # 72d0 <_sk_callback_sse2+0x1252>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
@@ -40183,12 +40334,12 @@
   .byte  76,139,8                            // mov           (%rax),%r9
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  73,131,249,2                        // cmp           $0x2,%r9
-  .byte  114,50                              // jb            5817 <_sk_gradient_sse2+0x46>
+  .byte  114,50                              // jb            583f <_sk_gradient_sse2+0x46>
   .byte  72,139,88,72                        // mov           0x48(%rax),%rbx
   .byte  73,255,201                          // dec           %r9
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  15,40,21,165,26,0,0                 // movaps        0x1aa5(%rip),%xmm2        # 72a0 <_sk_callback_sse2+0x124a>
+  .byte  15,40,21,189,26,0,0                 // movaps        0x1abd(%rip),%xmm2        # 72e0 <_sk_callback_sse2+0x1262>
   .byte  243,15,16,27                        // movss         (%rbx),%xmm3
   .byte  15,198,219,0                        // shufps        $0x0,%xmm3,%xmm3
   .byte  15,194,216,2                        // cmpleps       %xmm0,%xmm3
@@ -40196,7 +40347,7 @@
   .byte  102,15,254,203                      // paddd         %xmm3,%xmm1
   .byte  72,131,195,4                        // add           $0x4,%rbx
   .byte  73,255,201                          // dec           %r9
-  .byte  117,228                             // jne           57fb <_sk_gradient_sse2+0x2a>
+  .byte  117,228                             // jne           5823 <_sk_gradient_sse2+0x2a>
   .byte  102,15,112,209,78                   // pshufd        $0x4e,%xmm1,%xmm2
   .byte  102,73,15,126,211                   // movq          %xmm2,%r11
   .byte  69,137,217                          // mov           %r11d,%r9d
@@ -40335,29 +40486,29 @@
   .byte  69,15,94,220                        // divps         %xmm12,%xmm11
   .byte  69,15,40,227                        // movaps        %xmm11,%xmm12
   .byte  69,15,89,228                        // mulps         %xmm12,%xmm12
-  .byte  68,15,40,45,102,24,0,0              // movaps        0x1866(%rip),%xmm13        # 72b0 <_sk_callback_sse2+0x125a>
+  .byte  68,15,40,45,126,24,0,0              // movaps        0x187e(%rip),%xmm13        # 72f0 <_sk_callback_sse2+0x1272>
   .byte  69,15,89,236                        // mulps         %xmm12,%xmm13
-  .byte  68,15,88,45,106,24,0,0              // addps         0x186a(%rip),%xmm13        # 72c0 <_sk_callback_sse2+0x126a>
+  .byte  68,15,88,45,130,24,0,0              // addps         0x1882(%rip),%xmm13        # 7300 <_sk_callback_sse2+0x1282>
   .byte  69,15,89,236                        // mulps         %xmm12,%xmm13
-  .byte  68,15,88,45,110,24,0,0              // addps         0x186e(%rip),%xmm13        # 72d0 <_sk_callback_sse2+0x127a>
+  .byte  68,15,88,45,134,24,0,0              // addps         0x1886(%rip),%xmm13        # 7310 <_sk_callback_sse2+0x1292>
   .byte  69,15,89,236                        // mulps         %xmm12,%xmm13
-  .byte  68,15,88,45,114,24,0,0              // addps         0x1872(%rip),%xmm13        # 72e0 <_sk_callback_sse2+0x128a>
+  .byte  68,15,88,45,138,24,0,0              // addps         0x188a(%rip),%xmm13        # 7320 <_sk_callback_sse2+0x12a2>
   .byte  69,15,89,235                        // mulps         %xmm11,%xmm13
   .byte  69,15,194,202,1                     // cmpltps       %xmm10,%xmm9
-  .byte  68,15,40,21,113,24,0,0              // movaps        0x1871(%rip),%xmm10        # 72f0 <_sk_callback_sse2+0x129a>
+  .byte  68,15,40,21,137,24,0,0              // movaps        0x1889(%rip),%xmm10        # 7330 <_sk_callback_sse2+0x12b2>
   .byte  69,15,92,213                        // subps         %xmm13,%xmm10
   .byte  69,15,84,209                        // andps         %xmm9,%xmm10
   .byte  69,15,85,205                        // andnps        %xmm13,%xmm9
   .byte  69,15,86,202                        // orps          %xmm10,%xmm9
   .byte  68,15,194,192,1                     // cmpltps       %xmm0,%xmm8
-  .byte  68,15,40,21,100,24,0,0              // movaps        0x1864(%rip),%xmm10        # 7300 <_sk_callback_sse2+0x12aa>
+  .byte  68,15,40,21,124,24,0,0              // movaps        0x187c(%rip),%xmm10        # 7340 <_sk_callback_sse2+0x12c2>
   .byte  69,15,92,209                        // subps         %xmm9,%xmm10
   .byte  69,15,84,208                        // andps         %xmm8,%xmm10
   .byte  69,15,85,193                        // andnps        %xmm9,%xmm8
   .byte  69,15,86,194                        // orps          %xmm10,%xmm8
   .byte  68,15,40,201                        // movaps        %xmm1,%xmm9
   .byte  68,15,194,200,1                     // cmpltps       %xmm0,%xmm9
-  .byte  68,15,40,21,83,24,0,0               // movaps        0x1853(%rip),%xmm10        # 7310 <_sk_callback_sse2+0x12ba>
+  .byte  68,15,40,21,107,24,0,0              // movaps        0x186b(%rip),%xmm10        # 7350 <_sk_callback_sse2+0x12d2>
   .byte  69,15,92,208                        // subps         %xmm8,%xmm10
   .byte  69,15,84,209                        // andps         %xmm9,%xmm10
   .byte  69,15,85,200                        // andnps        %xmm8,%xmm9
@@ -40392,7 +40543,7 @@
   .byte  243,69,15,89,203                    // mulss         %xmm11,%xmm9
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
   .byte  68,15,88,200                        // addps         %xmm0,%xmm9
-  .byte  68,15,89,13,250,23,0,0              // mulps         0x17fa(%rip),%xmm9        # 7320 <_sk_callback_sse2+0x12ca>
+  .byte  68,15,89,13,18,24,0,0               // mulps         0x1812(%rip),%xmm9        # 7360 <_sk_callback_sse2+0x12e2>
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
   .byte  68,15,40,225                        // movaps        %xmm1,%xmm12
   .byte  69,15,89,228                        // mulps         %xmm12,%xmm12
@@ -40400,7 +40551,7 @@
   .byte  243,69,15,89,219                    // mulss         %xmm11,%xmm11
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,92,227                        // subps         %xmm11,%xmm12
-  .byte  68,15,89,21,229,23,0,0              // mulps         0x17e5(%rip),%xmm10        # 7330 <_sk_callback_sse2+0x12da>
+  .byte  68,15,89,21,253,23,0,0              // mulps         0x17fd(%rip),%xmm10        # 7370 <_sk_callback_sse2+0x12f2>
   .byte  69,15,89,212                        // mulps         %xmm12,%xmm10
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
@@ -40409,8 +40560,8 @@
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  65,15,92,193                        // subps         %xmm9,%xmm0
-  .byte  68,15,87,13,205,23,0,0              // xorps         0x17cd(%rip),%xmm9        # 7340 <_sk_callback_sse2+0x12ea>
-  .byte  68,15,89,5,213,23,0,0               // mulps         0x17d5(%rip),%xmm8        # 7350 <_sk_callback_sse2+0x12fa>
+  .byte  68,15,87,13,229,23,0,0              // xorps         0x17e5(%rip),%xmm9        # 7380 <_sk_callback_sse2+0x1302>
+  .byte  68,15,89,5,237,23,0,0               // mulps         0x17ed(%rip),%xmm8        # 7390 <_sk_callback_sse2+0x1312>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  69,15,92,202                        // subps         %xmm10,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
@@ -40431,7 +40582,7 @@
   .byte  243,69,15,89,203                    // mulss         %xmm11,%xmm9
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
   .byte  68,15,88,200                        // addps         %xmm0,%xmm9
-  .byte  68,15,89,13,156,23,0,0              // mulps         0x179c(%rip),%xmm9        # 7360 <_sk_callback_sse2+0x130a>
+  .byte  68,15,89,13,180,23,0,0              // mulps         0x17b4(%rip),%xmm9        # 73a0 <_sk_callback_sse2+0x1322>
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
   .byte  68,15,40,225                        // movaps        %xmm1,%xmm12
   .byte  69,15,89,228                        // mulps         %xmm12,%xmm12
@@ -40439,7 +40590,7 @@
   .byte  243,69,15,89,219                    // mulss         %xmm11,%xmm11
   .byte  69,15,198,219,0                     // shufps        $0x0,%xmm11,%xmm11
   .byte  69,15,92,227                        // subps         %xmm11,%xmm12
-  .byte  68,15,89,21,135,23,0,0              // mulps         0x1787(%rip),%xmm10        # 7370 <_sk_callback_sse2+0x131a>
+  .byte  68,15,89,21,159,23,0,0              // mulps         0x179f(%rip),%xmm10        # 73b0 <_sk_callback_sse2+0x1332>
   .byte  69,15,89,212                        // mulps         %xmm12,%xmm10
   .byte  65,15,40,193                        // movaps        %xmm9,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
@@ -40448,8 +40599,8 @@
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
   .byte  65,15,40,194                        // movaps        %xmm10,%xmm0
   .byte  65,15,92,193                        // subps         %xmm9,%xmm0
-  .byte  68,15,87,13,111,23,0,0              // xorps         0x176f(%rip),%xmm9        # 7380 <_sk_callback_sse2+0x132a>
-  .byte  68,15,89,5,119,23,0,0               // mulps         0x1777(%rip),%xmm8        # 7390 <_sk_callback_sse2+0x133a>
+  .byte  68,15,87,13,135,23,0,0              // xorps         0x1787(%rip),%xmm9        # 73c0 <_sk_callback_sse2+0x1342>
+  .byte  68,15,89,5,143,23,0,0               // mulps         0x178f(%rip),%xmm8        # 73d0 <_sk_callback_sse2+0x1352>
   .byte  65,15,89,192                        // mulps         %xmm8,%xmm0
   .byte  69,15,92,202                        // subps         %xmm10,%xmm9
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
@@ -40467,7 +40618,7 @@
   .byte  243,69,15,89,200                    // mulss         %xmm8,%xmm9
   .byte  69,15,198,201,0                     // shufps        $0x0,%xmm9,%xmm9
   .byte  68,15,88,200                        // addps         %xmm0,%xmm9
-  .byte  68,15,89,13,79,23,0,0               // mulps         0x174f(%rip),%xmm9        # 73a0 <_sk_callback_sse2+0x134a>
+  .byte  68,15,89,13,103,23,0,0              // mulps         0x1767(%rip),%xmm9        # 73e0 <_sk_callback_sse2+0x1362>
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
   .byte  68,15,40,209                        // movaps        %xmm1,%xmm10
   .byte  69,15,89,210                        // mulps         %xmm10,%xmm10
@@ -40475,7 +40626,7 @@
   .byte  243,69,15,89,192                    // mulss         %xmm8,%xmm8
   .byte  69,15,198,192,0                     // shufps        $0x0,%xmm8,%xmm8
   .byte  65,15,92,192                        // subps         %xmm8,%xmm0
-  .byte  15,87,5,59,23,0,0                   // xorps         0x173b(%rip),%xmm0        # 73b0 <_sk_callback_sse2+0x135a>
+  .byte  15,87,5,83,23,0,0                   // xorps         0x1753(%rip),%xmm0        # 73f0 <_sk_callback_sse2+0x1372>
   .byte  65,15,94,193                        // divps         %xmm9,%xmm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -40518,7 +40669,7 @@
 FUNCTION(_sk_save_xy_sse2)
 _sk_save_xy_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,225,22,0,0               // movaps        0x16e1(%rip),%xmm8        # 73c0 <_sk_callback_sse2+0x136a>
+  .byte  68,15,40,5,249,22,0,0               // movaps        0x16f9(%rip),%xmm8        # 7400 <_sk_callback_sse2+0x1382>
   .byte  15,17,0                             // movups        %xmm0,(%rax)
   .byte  68,15,40,200                        // movaps        %xmm0,%xmm9
   .byte  69,15,88,200                        // addps         %xmm8,%xmm9
@@ -40526,7 +40677,7 @@
   .byte  69,15,91,210                        // cvtdq2ps      %xmm10,%xmm10
   .byte  69,15,40,217                        // movaps        %xmm9,%xmm11
   .byte  69,15,194,218,1                     // cmpltps       %xmm10,%xmm11
-  .byte  68,15,40,37,204,22,0,0              // movaps        0x16cc(%rip),%xmm12        # 73d0 <_sk_callback_sse2+0x137a>
+  .byte  68,15,40,37,228,22,0,0              // movaps        0x16e4(%rip),%xmm12        # 7410 <_sk_callback_sse2+0x1392>
   .byte  69,15,84,220                        // andps         %xmm12,%xmm11
   .byte  69,15,92,211                        // subps         %xmm11,%xmm10
   .byte  69,15,92,202                        // subps         %xmm10,%xmm9
@@ -40573,8 +40724,8 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,69,22,0,0                   // addps         0x1645(%rip),%xmm0        # 73e0 <_sk_callback_sse2+0x138a>
-  .byte  68,15,40,13,77,22,0,0               // movaps        0x164d(%rip),%xmm9        # 73f0 <_sk_callback_sse2+0x139a>
+  .byte  15,88,5,93,22,0,0                   // addps         0x165d(%rip),%xmm0        # 7420 <_sk_callback_sse2+0x13a2>
+  .byte  68,15,40,13,101,22,0,0              // movaps        0x1665(%rip),%xmm9        # 7430 <_sk_callback_sse2+0x13b2>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  68,15,17,136,128,0,0,0              // movups        %xmm9,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -40587,7 +40738,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,60,22,0,0                   // addps         0x163c(%rip),%xmm0        # 7400 <_sk_callback_sse2+0x13aa>
+  .byte  15,88,5,84,22,0,0                   // addps         0x1654(%rip),%xmm0        # 7440 <_sk_callback_sse2+0x13c2>
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -40599,8 +40750,8 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,46,22,0,0                  // addps         0x162e(%rip),%xmm1        # 7410 <_sk_callback_sse2+0x13ba>
-  .byte  68,15,40,13,54,22,0,0               // movaps        0x1636(%rip),%xmm9        # 7420 <_sk_callback_sse2+0x13ca>
+  .byte  15,88,13,70,22,0,0                  // addps         0x1646(%rip),%xmm1        # 7450 <_sk_callback_sse2+0x13d2>
+  .byte  68,15,40,13,78,22,0,0               // movaps        0x164e(%rip),%xmm9        # 7460 <_sk_callback_sse2+0x13e2>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  68,15,17,136,160,0,0,0              // movups        %xmm9,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -40613,7 +40764,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,36,22,0,0                  // addps         0x1624(%rip),%xmm1        # 7430 <_sk_callback_sse2+0x13da>
+  .byte  15,88,13,60,22,0,0                  // addps         0x163c(%rip),%xmm1        # 7470 <_sk_callback_sse2+0x13f2>
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -40625,13 +40776,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,23,22,0,0                   // addps         0x1617(%rip),%xmm0        # 7440 <_sk_callback_sse2+0x13ea>
-  .byte  68,15,40,13,31,22,0,0               // movaps        0x161f(%rip),%xmm9        # 7450 <_sk_callback_sse2+0x13fa>
+  .byte  15,88,5,47,22,0,0                   // addps         0x162f(%rip),%xmm0        # 7480 <_sk_callback_sse2+0x1402>
+  .byte  68,15,40,13,55,22,0,0               // movaps        0x1637(%rip),%xmm9        # 7490 <_sk_callback_sse2+0x1412>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  69,15,89,192                        // mulps         %xmm8,%xmm8
-  .byte  68,15,89,13,27,22,0,0               // mulps         0x161b(%rip),%xmm9        # 7460 <_sk_callback_sse2+0x140a>
-  .byte  68,15,88,13,35,22,0,0               // addps         0x1623(%rip),%xmm9        # 7470 <_sk_callback_sse2+0x141a>
+  .byte  68,15,89,13,51,22,0,0               // mulps         0x1633(%rip),%xmm9        # 74a0 <_sk_callback_sse2+0x1422>
+  .byte  68,15,88,13,59,22,0,0               // addps         0x163b(%rip),%xmm9        # 74b0 <_sk_callback_sse2+0x1432>
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  68,15,17,136,128,0,0,0              // movups        %xmm9,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -40644,16 +40795,16 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,18,22,0,0                   // addps         0x1612(%rip),%xmm0        # 7480 <_sk_callback_sse2+0x142a>
-  .byte  68,15,40,13,26,22,0,0               // movaps        0x161a(%rip),%xmm9        # 7490 <_sk_callback_sse2+0x143a>
+  .byte  15,88,5,42,22,0,0                   // addps         0x162a(%rip),%xmm0        # 74c0 <_sk_callback_sse2+0x1442>
+  .byte  68,15,40,13,50,22,0,0               // movaps        0x1632(%rip),%xmm9        # 74d0 <_sk_callback_sse2+0x1452>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
-  .byte  68,15,40,5,30,22,0,0                // movaps        0x161e(%rip),%xmm8        # 74a0 <_sk_callback_sse2+0x144a>
+  .byte  68,15,40,5,54,22,0,0                // movaps        0x1636(%rip),%xmm8        # 74e0 <_sk_callback_sse2+0x1462>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,34,22,0,0                // addps         0x1622(%rip),%xmm8        # 74b0 <_sk_callback_sse2+0x145a>
+  .byte  68,15,88,5,58,22,0,0                // addps         0x163a(%rip),%xmm8        # 74f0 <_sk_callback_sse2+0x1472>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,38,22,0,0                // addps         0x1626(%rip),%xmm8        # 74c0 <_sk_callback_sse2+0x146a>
+  .byte  68,15,88,5,62,22,0,0                // addps         0x163e(%rip),%xmm8        # 7500 <_sk_callback_sse2+0x1482>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,42,22,0,0                // addps         0x162a(%rip),%xmm8        # 74d0 <_sk_callback_sse2+0x147a>
+  .byte  68,15,88,5,66,22,0,0                // addps         0x1642(%rip),%xmm8        # 7510 <_sk_callback_sse2+0x1492>
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -40663,17 +40814,17 @@
 FUNCTION(_sk_bicubic_p1x_sse2)
 _sk_bicubic_p1x_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,36,22,0,0                // movaps        0x1624(%rip),%xmm8        # 74e0 <_sk_callback_sse2+0x148a>
+  .byte  68,15,40,5,60,22,0,0                // movaps        0x163c(%rip),%xmm8        # 7520 <_sk_callback_sse2+0x14a2>
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,72,64                      // movups        0x40(%rax),%xmm9
   .byte  65,15,88,192                        // addps         %xmm8,%xmm0
-  .byte  68,15,40,21,32,22,0,0               // movaps        0x1620(%rip),%xmm10        # 74f0 <_sk_callback_sse2+0x149a>
+  .byte  68,15,40,21,56,22,0,0               // movaps        0x1638(%rip),%xmm10        # 7530 <_sk_callback_sse2+0x14b2>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,36,22,0,0               // addps         0x1624(%rip),%xmm10        # 7500 <_sk_callback_sse2+0x14aa>
+  .byte  68,15,88,21,60,22,0,0               // addps         0x163c(%rip),%xmm10        # 7540 <_sk_callback_sse2+0x14c2>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,32,22,0,0               // addps         0x1620(%rip),%xmm10        # 7510 <_sk_callback_sse2+0x14ba>
+  .byte  68,15,88,21,56,22,0,0               // addps         0x1638(%rip),%xmm10        # 7550 <_sk_callback_sse2+0x14d2>
   .byte  68,15,17,144,128,0,0,0              // movups        %xmm10,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -40685,11 +40836,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,0                             // movups        (%rax),%xmm0
   .byte  68,15,16,64,64                      // movups        0x40(%rax),%xmm8
-  .byte  15,88,5,19,22,0,0                   // addps         0x1613(%rip),%xmm0        # 7520 <_sk_callback_sse2+0x14ca>
+  .byte  15,88,5,43,22,0,0                   // addps         0x162b(%rip),%xmm0        # 7560 <_sk_callback_sse2+0x14e2>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  69,15,89,201                        // mulps         %xmm9,%xmm9
-  .byte  68,15,89,5,19,22,0,0                // mulps         0x1613(%rip),%xmm8        # 7530 <_sk_callback_sse2+0x14da>
-  .byte  68,15,88,5,27,22,0,0                // addps         0x161b(%rip),%xmm8        # 7540 <_sk_callback_sse2+0x14ea>
+  .byte  68,15,89,5,43,22,0,0                // mulps         0x162b(%rip),%xmm8        # 7570 <_sk_callback_sse2+0x14f2>
+  .byte  68,15,88,5,51,22,0,0                // addps         0x1633(%rip),%xmm8        # 7580 <_sk_callback_sse2+0x1502>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  68,15,17,128,128,0,0,0              // movups        %xmm8,0x80(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -40702,13 +40853,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,9,22,0,0                   // addps         0x1609(%rip),%xmm1        # 7550 <_sk_callback_sse2+0x14fa>
-  .byte  68,15,40,13,17,22,0,0               // movaps        0x1611(%rip),%xmm9        # 7560 <_sk_callback_sse2+0x150a>
+  .byte  15,88,13,33,22,0,0                  // addps         0x1621(%rip),%xmm1        # 7590 <_sk_callback_sse2+0x1512>
+  .byte  68,15,40,13,41,22,0,0               // movaps        0x1629(%rip),%xmm9        # 75a0 <_sk_callback_sse2+0x1522>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
   .byte  69,15,40,193                        // movaps        %xmm9,%xmm8
   .byte  69,15,89,192                        // mulps         %xmm8,%xmm8
-  .byte  68,15,89,13,13,22,0,0               // mulps         0x160d(%rip),%xmm9        # 7570 <_sk_callback_sse2+0x151a>
-  .byte  68,15,88,13,21,22,0,0               // addps         0x1615(%rip),%xmm9        # 7580 <_sk_callback_sse2+0x152a>
+  .byte  68,15,89,13,37,22,0,0               // mulps         0x1625(%rip),%xmm9        # 75b0 <_sk_callback_sse2+0x1532>
+  .byte  68,15,88,13,45,22,0,0               // addps         0x162d(%rip),%xmm9        # 75c0 <_sk_callback_sse2+0x1542>
   .byte  69,15,89,200                        // mulps         %xmm8,%xmm9
   .byte  68,15,17,136,160,0,0,0              // movups        %xmm9,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -40721,16 +40872,16 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,3,22,0,0                   // addps         0x1603(%rip),%xmm1        # 7590 <_sk_callback_sse2+0x153a>
-  .byte  68,15,40,13,11,22,0,0               // movaps        0x160b(%rip),%xmm9        # 75a0 <_sk_callback_sse2+0x154a>
+  .byte  15,88,13,27,22,0,0                  // addps         0x161b(%rip),%xmm1        # 75d0 <_sk_callback_sse2+0x1552>
+  .byte  68,15,40,13,35,22,0,0               // movaps        0x1623(%rip),%xmm9        # 75e0 <_sk_callback_sse2+0x1562>
   .byte  69,15,92,200                        // subps         %xmm8,%xmm9
-  .byte  68,15,40,5,15,22,0,0                // movaps        0x160f(%rip),%xmm8        # 75b0 <_sk_callback_sse2+0x155a>
+  .byte  68,15,40,5,39,22,0,0                // movaps        0x1627(%rip),%xmm8        # 75f0 <_sk_callback_sse2+0x1572>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,19,22,0,0                // addps         0x1613(%rip),%xmm8        # 75c0 <_sk_callback_sse2+0x156a>
+  .byte  68,15,88,5,43,22,0,0                // addps         0x162b(%rip),%xmm8        # 7600 <_sk_callback_sse2+0x1582>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,23,22,0,0                // addps         0x1617(%rip),%xmm8        # 75d0 <_sk_callback_sse2+0x157a>
+  .byte  68,15,88,5,47,22,0,0                // addps         0x162f(%rip),%xmm8        # 7610 <_sk_callback_sse2+0x1592>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
-  .byte  68,15,88,5,27,22,0,0                // addps         0x161b(%rip),%xmm8        # 75e0 <_sk_callback_sse2+0x158a>
+  .byte  68,15,88,5,51,22,0,0                // addps         0x1633(%rip),%xmm8        # 7620 <_sk_callback_sse2+0x15a2>
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -40740,17 +40891,17 @@
 FUNCTION(_sk_bicubic_p1y_sse2)
 _sk_bicubic_p1y_sse2:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  68,15,40,5,21,22,0,0                // movaps        0x1615(%rip),%xmm8        # 75f0 <_sk_callback_sse2+0x159a>
+  .byte  68,15,40,5,45,22,0,0                // movaps        0x162d(%rip),%xmm8        # 7630 <_sk_callback_sse2+0x15b2>
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,72,96                      // movups        0x60(%rax),%xmm9
   .byte  65,15,88,200                        // addps         %xmm8,%xmm1
-  .byte  68,15,40,21,16,22,0,0               // movaps        0x1610(%rip),%xmm10        # 7600 <_sk_callback_sse2+0x15aa>
+  .byte  68,15,40,21,40,22,0,0               // movaps        0x1628(%rip),%xmm10        # 7640 <_sk_callback_sse2+0x15c2>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,20,22,0,0               // addps         0x1614(%rip),%xmm10        # 7610 <_sk_callback_sse2+0x15ba>
+  .byte  68,15,88,21,44,22,0,0               // addps         0x162c(%rip),%xmm10        # 7650 <_sk_callback_sse2+0x15d2>
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
   .byte  69,15,88,208                        // addps         %xmm8,%xmm10
   .byte  69,15,89,209                        // mulps         %xmm9,%xmm10
-  .byte  68,15,88,21,16,22,0,0               // addps         0x1610(%rip),%xmm10        # 7620 <_sk_callback_sse2+0x15ca>
+  .byte  68,15,88,21,40,22,0,0               // addps         0x1628(%rip),%xmm10        # 7660 <_sk_callback_sse2+0x15e2>
   .byte  68,15,17,144,160,0,0,0              // movups        %xmm10,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -40762,11 +40913,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,72,32                         // movups        0x20(%rax),%xmm1
   .byte  68,15,16,64,96                      // movups        0x60(%rax),%xmm8
-  .byte  15,88,13,2,22,0,0                   // addps         0x1602(%rip),%xmm1        # 7630 <_sk_callback_sse2+0x15da>
+  .byte  15,88,13,26,22,0,0                  // addps         0x161a(%rip),%xmm1        # 7670 <_sk_callback_sse2+0x15f2>
   .byte  69,15,40,200                        // movaps        %xmm8,%xmm9
   .byte  69,15,89,201                        // mulps         %xmm9,%xmm9
-  .byte  68,15,89,5,2,22,0,0                 // mulps         0x1602(%rip),%xmm8        # 7640 <_sk_callback_sse2+0x15ea>
-  .byte  68,15,88,5,10,22,0,0                // addps         0x160a(%rip),%xmm8        # 7650 <_sk_callback_sse2+0x15fa>
+  .byte  68,15,89,5,26,22,0,0                // mulps         0x161a(%rip),%xmm8        # 7680 <_sk_callback_sse2+0x1602>
+  .byte  68,15,88,5,34,22,0,0                // addps         0x1622(%rip),%xmm8        # 7690 <_sk_callback_sse2+0x1612>
   .byte  69,15,89,193                        // mulps         %xmm9,%xmm8
   .byte  68,15,17,128,160,0,0,0              // movups        %xmm8,0xa0(%rax)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -40991,16 +41142,26 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
+  .byte  63                                  // (bad)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  128,63,0                            // cmpb          $0x0,(%rdi)
+  .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
+  .byte  63                                  // (bad)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  128,63,0                            // cmpb          $0x0,(%rdi)
+  .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
+  .byte  63                                  // (bad)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  128,63,0                            // cmpb          $0x0,(%rdi)
+  .byte  0,128,191,0,0,128                   // add           %al,-0x7fffff41(%rax)
   .byte  191,0,0,128,191                     // mov           $0xbf800000,%edi
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  128,191,0,0,128,191,0               // cmpb          $0x0,-0x40800000(%rdi)
+  .byte  128,191,0,0,224,64,0                // cmpb          $0x0,0x40e00000(%rdi)
   .byte  0,224                               // add           %ah,%al
   .byte  64,0,0                              // add           %al,(%rax)
-  .byte  224,64                              // loopne        6328 <.literal16+0x1d8>
+  .byte  224,64                              // loopne        636c <.literal16+0x1fc>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,64                              // loopne        632c <.literal16+0x1dc>
-  .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,64                              // loopne        6330 <.literal16+0x1e0>
+  .byte  224,64                              // loopne        6370 <.literal16+0x200>
   .byte  154                                 // (bad)
   .byte  153                                 // cltd
   .byte  153                                 // cltd
@@ -41020,13 +41181,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 6351 <.literal16+0x201>
+  .byte  71,225,61                           // rex.RXB       loope 6391 <.literal16+0x221>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 6355 <.literal16+0x205>
+  .byte  71,225,61                           // rex.RXB       loope 6395 <.literal16+0x225>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 6359 <.literal16+0x209>
+  .byte  71,225,61                           // rex.RXB       loope 6399 <.literal16+0x229>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 635d <.literal16+0x20d>
+  .byte  71,225,61                           // rex.RXB       loope 639d <.literal16+0x22d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -41051,13 +41212,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 6391 <.literal16+0x241>
+  .byte  71,225,61                           // rex.RXB       loope 63d1 <.literal16+0x261>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 6395 <.literal16+0x245>
+  .byte  71,225,61                           // rex.RXB       loope 63d5 <.literal16+0x265>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 6399 <.literal16+0x249>
+  .byte  71,225,61                           // rex.RXB       loope 63d9 <.literal16+0x269>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 639d <.literal16+0x24d>
+  .byte  71,225,61                           // rex.RXB       loope 63dd <.literal16+0x26d>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -41082,13 +41243,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 63d1 <.literal16+0x281>
+  .byte  71,225,61                           // rex.RXB       loope 6411 <.literal16+0x2a1>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 63d5 <.literal16+0x285>
+  .byte  71,225,61                           // rex.RXB       loope 6415 <.literal16+0x2a5>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 63d9 <.literal16+0x289>
+  .byte  71,225,61                           // rex.RXB       loope 6419 <.literal16+0x2a9>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 63dd <.literal16+0x28d>
+  .byte  71,225,61                           // rex.RXB       loope 641d <.literal16+0x2ad>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -41113,13 +41274,13 @@
   .byte  10,23                               // or            (%rdi),%dl
   .byte  63                                  // (bad)
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 6411 <.literal16+0x2c1>
+  .byte  71,225,61                           // rex.RXB       loope 6451 <.literal16+0x2e1>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 6415 <.literal16+0x2c5>
+  .byte  71,225,61                           // rex.RXB       loope 6455 <.literal16+0x2e5>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 6419 <.literal16+0x2c9>
+  .byte  71,225,61                           // rex.RXB       loope 6459 <.literal16+0x2e9>
   .byte  174                                 // scas          %es:(%rdi),%al
-  .byte  71,225,61                           // rex.RXB       loope 641d <.literal16+0x2cd>
+  .byte  71,225,61                           // rex.RXB       loope 645d <.literal16+0x2ed>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -41140,11 +41301,11 @@
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,127                    // add           %al,0x7f00003f(%rax)
   .byte  67,0,0                              // rex.XB        add %al,(%r8)
-  .byte  127,67                              // jg            645b <.literal16+0x30b>
+  .byte  127,67                              // jg            649b <.literal16+0x32b>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            645f <.literal16+0x30f>
+  .byte  127,67                              // jg            649f <.literal16+0x32f>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6463 <.literal16+0x313>
+  .byte  127,67                              // jg            64a3 <.literal16+0x333>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -41431,13 +41592,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        66a9 <.literal16+0x559>
+  .byte  224,7                               // loopne        66e9 <.literal16+0x579>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        66ad <.literal16+0x55d>
+  .byte  224,7                               // loopne        66ed <.literal16+0x57d>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        66b1 <.literal16+0x561>
+  .byte  224,7                               // loopne        66f1 <.literal16+0x581>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        66b5 <.literal16+0x565>
+  .byte  224,7                               // loopne        66f5 <.literal16+0x585>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -41502,11 +41663,11 @@
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            678b <.literal16+0x63b>
+  .byte  127,67                              // jg            67cb <.literal16+0x65b>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            678f <.literal16+0x63f>
+  .byte  127,67                              // jg            67cf <.literal16+0x65f>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6793 <.literal16+0x643>
+  .byte  127,67                              // jg            67d3 <.literal16+0x663>
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%rax)
   .byte  128,59,129                          // cmpb          $0x81,(%rbx)
   .byte  128,128,59,129,128,128,59           // addb          $0x3b,-0x7f7f7ec5(%rax)
@@ -41521,16 +41682,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6784 <.literal16+0x634>
+  .byte  127,0                               // jg            67c4 <.literal16+0x654>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6788 <.literal16+0x638>
+  .byte  127,0                               // jg            67c8 <.literal16+0x658>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            678c <.literal16+0x63c>
+  .byte  127,0                               // jg            67cc <.literal16+0x65c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6790 <.literal16+0x640>
+  .byte  127,0                               // jg            67d0 <.literal16+0x660>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -41539,7 +41700,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            6815 <.literal16+0x6c5>
+  .byte  119,115                             // ja            6855 <.literal16+0x6e5>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -41550,7 +41711,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           6779 <.literal16+0x629>
+  .byte  117,191                             // jne           67b9 <.literal16+0x649>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -41562,7 +41723,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a7ba <_sk_callback_sse2+0xffffffffe9a34764>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a7fa <_sk_callback_sse2+0xffffffffe9a3477c>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
@@ -41616,16 +41777,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6854 <.literal16+0x704>
+  .byte  127,0                               // jg            6894 <.literal16+0x724>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6858 <.literal16+0x708>
+  .byte  127,0                               // jg            6898 <.literal16+0x728>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            685c <.literal16+0x70c>
+  .byte  127,0                               // jg            689c <.literal16+0x72c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6860 <.literal16+0x710>
+  .byte  127,0                               // jg            68a0 <.literal16+0x730>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -41634,7 +41795,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            68e5 <.literal16+0x795>
+  .byte  119,115                             // ja            6925 <.literal16+0x7b5>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -41645,7 +41806,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           6849 <.literal16+0x6f9>
+  .byte  117,191                             // jne           6889 <.literal16+0x719>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -41657,7 +41818,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a88a <_sk_callback_sse2+0xffffffffe9a34834>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a8ca <_sk_callback_sse2+0xffffffffe9a3484c>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
@@ -41711,16 +41872,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6924 <.literal16+0x7d4>
+  .byte  127,0                               // jg            6964 <.literal16+0x7f4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6928 <.literal16+0x7d8>
+  .byte  127,0                               // jg            6968 <.literal16+0x7f8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            692c <.literal16+0x7dc>
+  .byte  127,0                               // jg            696c <.literal16+0x7fc>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6930 <.literal16+0x7e0>
+  .byte  127,0                               // jg            6970 <.literal16+0x800>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -41729,7 +41890,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            69b5 <.literal16+0x865>
+  .byte  119,115                             // ja            69f5 <.literal16+0x885>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -41740,7 +41901,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           6919 <.literal16+0x7c9>
+  .byte  117,191                             // jne           6959 <.literal16+0x7e9>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -41752,7 +41913,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a95a <_sk_callback_sse2+0xffffffffe9a34904>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3a99a <_sk_callback_sse2+0xffffffffe9a3491c>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
@@ -41806,16 +41967,16 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            69f4 <.literal16+0x8a4>
+  .byte  127,0                               // jg            6a34 <.literal16+0x8c4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            69f8 <.literal16+0x8a8>
+  .byte  127,0                               // jg            6a38 <.literal16+0x8c8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            69fc <.literal16+0x8ac>
+  .byte  127,0                               // jg            6a3c <.literal16+0x8cc>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            6a00 <.literal16+0x8b0>
+  .byte  127,0                               // jg            6a40 <.literal16+0x8d0>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -41824,7 +41985,7 @@
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
-  .byte  119,115                             // ja            6a85 <.literal16+0x935>
+  .byte  119,115                             // ja            6ac5 <.literal16+0x955>
   .byte  248                                 // clc
   .byte  194,119,115                         // retq          $0x7377
   .byte  248                                 // clc
@@ -41835,7 +41996,7 @@
   .byte  194,117,191                         // retq          $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
-  .byte  117,191                             // jne           69e9 <.literal16+0x899>
+  .byte  117,191                             // jne           6a29 <.literal16+0x8b9>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // (bad)
   .byte  249                                 // stc
@@ -41847,7 +42008,7 @@
   .byte  249                                 // stc
   .byte  68,180,62                           // rex.R         mov $0x3e,%spl
   .byte  163,233,220,63,163,233,220,63,163   // movabs        %eax,0xa33fdce9a33fdce9
-  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3aa2a <_sk_callback_sse2+0xffffffffe9a349d4>
+  .byte  233,220,63,163,233                  // jmpq          ffffffffe9a3aa6a <_sk_callback_sse2+0xffffffffe9a349ec>
   .byte  220,63                              // fdivrl        (%rdi)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
@@ -41897,13 +42058,13 @@
   .byte  200,66,0,0                          // enterq        $0x42,$0x0
   .byte  200,66,0,0                          // enterq        $0x42,$0x0
   .byte  200,66,0,0                          // enterq        $0x42,$0x0
-  .byte  127,67                              // jg            6b07 <.literal16+0x9b7>
+  .byte  127,67                              // jg            6b47 <.literal16+0x9d7>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6b0b <.literal16+0x9bb>
+  .byte  127,67                              // jg            6b4b <.literal16+0x9db>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6b0f <.literal16+0x9bf>
+  .byte  127,67                              // jg            6b4f <.literal16+0x9df>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6b13 <.literal16+0x9c3>
+  .byte  127,67                              // jg            6b53 <.literal16+0x9e3>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,195                               // add           %al,%bl
   .byte  0,0                                 // add           %al,(%rax)
@@ -41950,16 +42111,16 @@
   .byte  128,3,62                            // addb          $0x3e,(%rbx)
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           6b93 <.literal16+0xa43>
+  .byte  118,63                              // jbe           6bd3 <.literal16+0xa63>
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           6b97 <.literal16+0xa47>
+  .byte  118,63                              // jbe           6bd7 <.literal16+0xa67>
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           6b9b <.literal16+0xa4b>
+  .byte  118,63                              // jbe           6bdb <.literal16+0xa6b>
   .byte  31                                  // (bad)
   .byte  215                                 // xlat          %ds:(%rbx)
-  .byte  118,63                              // jbe           6b9f <.literal16+0xa4f>
+  .byte  118,63                              // jbe           6bdf <.literal16+0xa6f>
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%rax)
@@ -41988,11 +42149,11 @@
   .byte  128,59,0                            // cmpb          $0x0,(%rbx)
   .byte  0,127,67                            // add           %bh,0x43(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6c0b <.literal16+0xabb>
+  .byte  127,67                              // jg            6c4b <.literal16+0xadb>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6c0f <.literal16+0xabf>
+  .byte  127,67                              // jg            6c4f <.literal16+0xadf>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            6c13 <.literal16+0xac3>
+  .byte  127,67                              // jg            6c53 <.literal16+0xae3>
   .byte  255,0                               // incl          (%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  255,0                               // incl          (%rax)
@@ -42063,13 +42224,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        6ca9 <.literal16+0xb59>
+  .byte  224,7                               // loopne        6ce9 <.literal16+0xb79>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6cad <.literal16+0xb5d>
+  .byte  224,7                               // loopne        6ced <.literal16+0xb7d>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6cb1 <.literal16+0xb61>
+  .byte  224,7                               // loopne        6cf1 <.literal16+0xb81>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6cb5 <.literal16+0xb65>
+  .byte  224,7                               // loopne        6cf5 <.literal16+0xb85>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -42115,13 +42276,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        6d19 <.literal16+0xbc9>
+  .byte  224,7                               // loopne        6d59 <.literal16+0xbe9>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6d1d <.literal16+0xbcd>
+  .byte  224,7                               // loopne        6d5d <.literal16+0xbed>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6d21 <.literal16+0xbd1>
+  .byte  224,7                               // loopne        6d61 <.literal16+0xbf1>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6d25 <.literal16+0xbd5>
+  .byte  224,7                               // loopne        6d65 <.literal16+0xbf5>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -42167,13 +42328,13 @@
   .byte  132,55                              // test          %dh,(%rdi)
   .byte  8,33                                // or            %ah,(%rcx)
   .byte  132,55                              // test          %dh,(%rdi)
-  .byte  224,7                               // loopne        6d89 <.literal16+0xc39>
+  .byte  224,7                               // loopne        6dc9 <.literal16+0xc59>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6d8d <.literal16+0xc3d>
+  .byte  224,7                               // loopne        6dcd <.literal16+0xc5d>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6d91 <.literal16+0xc41>
+  .byte  224,7                               // loopne        6dd1 <.literal16+0xc61>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  224,7                               // loopne        6d95 <.literal16+0xc45>
+  .byte  224,7                               // loopne        6dd5 <.literal16+0xc65>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  33,8                                // and           %ecx,(%rax)
   .byte  2,58                                // add           (%rdx),%bh
@@ -42211,13 +42372,13 @@
   .byte  65,0,0                              // add           %al,(%r8)
   .byte  248                                 // clc
   .byte  65,0,0                              // add           %al,(%r8)
-  .byte  124,66                              // jl            6e26 <.literal16+0xcd6>
+  .byte  124,66                              // jl            6e66 <.literal16+0xcf6>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  124,66                              // jl            6e2a <.literal16+0xcda>
+  .byte  124,66                              // jl            6e6a <.literal16+0xcfa>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  124,66                              // jl            6e2e <.literal16+0xcde>
+  .byte  124,66                              // jl            6e6e <.literal16+0xcfe>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  124,66                              // jl            6e32 <.literal16+0xce2>
+  .byte  124,66                              // jl            6e72 <.literal16+0xd02>
   .byte  0,240                               // add           %dh,%al
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,240                               // add           %dh,%al
@@ -42351,13 +42512,13 @@
   .byte  136,136,61,137,136,136              // mov           %cl,-0x777776c3(%rax)
   .byte  61,137,136,136,61                   // cmp           $0x3d888889,%eax
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6fb5 <.literal16+0xe65>
+  .byte  112,65                              // jo            6ff5 <.literal16+0xe85>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6fb9 <.literal16+0xe69>
+  .byte  112,65                              // jo            6ff9 <.literal16+0xe89>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6fbd <.literal16+0xe6d>
+  .byte  112,65                              // jo            6ffd <.literal16+0xe8d>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  112,65                              // jo            6fc1 <.literal16+0xe71>
+  .byte  112,65                              // jo            7001 <.literal16+0xe91>
   .byte  255,0                               // incl          (%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  255,0                               // incl          (%rax)
@@ -42388,11 +42549,11 @@
   .byte  128,59,129                          // cmpb          $0x81,(%rbx)
   .byte  128,128,59,0,0,127,67               // addb          $0x43,0x7f00003b(%rax)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            702b <.literal16+0xedb>
+  .byte  127,67                              // jg            706b <.literal16+0xefb>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            702f <.literal16+0xedf>
+  .byte  127,67                              // jg            706f <.literal16+0xeff>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            7033 <.literal16+0xee3>
+  .byte  127,67                              // jg            7073 <.literal16+0xf03>
   .byte  255,0                               // incl          (%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  255,0                               // incl          (%rax)
@@ -42423,11 +42584,11 @@
   .byte  128,59,129                          // cmpb          $0x81,(%rbx)
   .byte  128,128,59,0,0,127,67               // addb          $0x43,0x7f00003b(%rax)
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            709b <.literal16+0xf4b>
+  .byte  127,67                              // jg            70db <.literal16+0xf6b>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            709f <.literal16+0xf4f>
+  .byte  127,67                              // jg            70df <.literal16+0xf6f>
   .byte  0,0                                 // add           %al,(%rax)
-  .byte  127,67                              // jg            70a3 <.literal16+0xf53>
+  .byte  127,67                              // jg            70e3 <.literal16+0xf73>
   .byte  0,128,0,0,0,128                     // add           %al,-0x80000000(%rax)
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,128,0,0,0,128                     // add           %al,-0x80000000(%rax)
@@ -42523,13 +42684,13 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  255                                 // (bad)
-  .byte  127,71                              // jg            71cb <.literal16+0x107b>
+  .byte  127,71                              // jg            720b <.literal16+0x109b>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            71cf <.literal16+0x107f>
+  .byte  127,71                              // jg            720f <.literal16+0x109f>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            71d3 <.literal16+0x1083>
+  .byte  127,71                              // jg            7213 <.literal16+0x10a3>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            71d7 <.literal16+0x1087>
+  .byte  127,71                              // jg            7217 <.literal16+0x10a7>
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,0                            // cmpb          $0x0,(%rdi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%rax)
@@ -42606,10 +42767,10 @@
   .byte  61,152,221,147,61                   // cmp           $0x3d93dd98,%eax
   .byte  152                                 // cwtl
   .byte  221,147,61,45,16,17                 // fstl          0x11102d3d(%rbx)
-  .byte  192,45,16,17,192,45,16              // shrb          $0x10,0x2dc01110(%rip)        # 2dc0836a <_sk_callback_sse2+0x2dc02314>
+  .byte  192,45,16,17,192,45,16              // shrb          $0x10,0x2dc01110(%rip)        # 2dc083aa <_sk_callback_sse2+0x2dc0232c>
   .byte  17,192                              // adc           %eax,%eax
   .byte  45,16,17,192,18                     // sub           $0x12c01110,%eax
-  .byte  120,57                              // js            729c <.literal16+0x114c>
+  .byte  120,57                              // js            72dc <.literal16+0x116c>
   .byte  64,18,120,57                        // adc           0x39(%rax),%dil
   .byte  64,18,120,57                        // adc           0x39(%rax),%dil
   .byte  64,18,120,57                        // adc           0x39(%rax),%dil
@@ -42796,11 +42957,11 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,114                          // cmpb          $0x72,(%rdi)
   .byte  28,199                              // sbb           $0xc7,%al
-  .byte  62,114,28                           // jb,pt         7482 <.literal16+0x1332>
+  .byte  62,114,28                           // jb,pt         74c2 <.literal16+0x1352>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         7486 <.literal16+0x1336>
+  .byte  62,114,28                           // jb,pt         74c6 <.literal16+0x1356>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         748a <.literal16+0x133a>
+  .byte  62,114,28                           // jb,pt         74ca <.literal16+0x135a>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -42844,7 +43005,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d640315 <_sk_callback_sse2+0x3d63a2bf>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d640355 <_sk_callback_sse2+0x3d63a2d7>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -42870,7 +43031,7 @@
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d640355 <_sk_callback_sse2+0x3d63a2ff>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d640395 <_sk_callback_sse2+0x3d63a317>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
@@ -42879,13 +43040,13 @@
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
-  .byte  114,28                              // jb            754e <.literal16+0x13fe>
+  .byte  114,28                              // jb            758e <.literal16+0x141e>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         7552 <.literal16+0x1402>
+  .byte  62,114,28                           // jb,pt         7592 <.literal16+0x1422>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         7556 <.literal16+0x1406>
+  .byte  62,114,28                           // jb,pt         7596 <.literal16+0x1426>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         755a <.literal16+0x140a>
+  .byte  62,114,28                           // jb,pt         759a <.literal16+0x142a>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -42906,11 +43067,11 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  128,63,114                          // cmpb          $0x72,(%rdi)
   .byte  28,199                              // sbb           $0xc7,%al
-  .byte  62,114,28                           // jb,pt         7592 <.literal16+0x1442>
+  .byte  62,114,28                           // jb,pt         75d2 <.literal16+0x1462>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         7596 <.literal16+0x1446>
+  .byte  62,114,28                           // jb,pt         75d6 <.literal16+0x1466>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         759a <.literal16+0x144a>
+  .byte  62,114,28                           // jb,pt         75da <.literal16+0x146a>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -42954,7 +43115,7 @@
   .byte  0,0                                 // add           %al,(%rax)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d640425 <_sk_callback_sse2+0x3d63a3cf>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d640465 <_sk_callback_sse2+0x3d63a3e7>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  0,63                                // add           %bh,(%rdi)
   .byte  0,0                                 // add           %al,(%rax)
@@ -42980,7 +43141,7 @@
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
   .byte  57,142,99,61,57,142                 // cmp           %ecx,-0x71c6c29d(%rsi)
-  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d640465 <_sk_callback_sse2+0x3d63a40f>
+  .byte  99,61,57,142,99,61                  // movslq        0x3d638e39(%rip),%edi        # 3d6404a5 <_sk_callback_sse2+0x3d63a427>
   .byte  57,142,99,61,0,0                    // cmp           %ecx,0x3d63(%rsi)
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
@@ -42989,13 +43150,13 @@
   .byte  192,63,0                            // sarb          $0x0,(%rdi)
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // (bad)
-  .byte  114,28                              // jb            765e <.literal16+0x150e>
+  .byte  114,28                              // jb            769e <.literal16+0x152e>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         7662 <_sk_callback_sse2+0x160c>
+  .byte  62,114,28                           // jb,pt         76a2 <_sk_callback_sse2+0x1624>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         7666 <_sk_callback_sse2+0x1610>
+  .byte  62,114,28                           // jb,pt         76a6 <_sk_callback_sse2+0x1628>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         766a <_sk_callback_sse2+0x1614>
+  .byte  62,114,28                           // jb,pt         76aa <_sk_callback_sse2+0x162c>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%rdi)
   .byte  170                                 // stos          %al,%es:(%rdi)
@@ -43074,12 +43235,12 @@
 _sk_just_return_hsw_lowp:
   .byte  195                                 // retq
 
-HIDDEN _sk_constant_color_hsw_lowp
-.globl _sk_constant_color_hsw_lowp
-FUNCTION(_sk_constant_color_hsw_lowp)
-_sk_constant_color_hsw_lowp:
+HIDDEN _sk_uniform_color_hsw_lowp
+.globl _sk_uniform_color_hsw_lowp
+FUNCTION(_sk_uniform_color_hsw_lowp)
+_sk_uniform_color_hsw_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,121,24,5,237,32,0,0         // vbroadcastss  0x20ed(%rip),%xmm0        # 217c <_sk_xor__hsw_lowp+0x78>
+  .byte  196,226,121,24,5,29,33,0,0          // vbroadcastss  0x211d(%rip),%xmm0        # 21ac <_sk_xor__hsw_lowp+0x78>
   .byte  197,248,88,24                       // vaddps        (%rax),%xmm0,%xmm3
   .byte  196,226,125,121,195                 // vpbroadcastw  %xmm3,%ymm0
   .byte  197,251,112,203,234                 // vpshuflw      $0xea,%xmm3,%xmm1
@@ -43093,12 +43254,34 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
+HIDDEN _sk_black_color_hsw_lowp
+.globl _sk_black_color_hsw_lowp
+FUNCTION(_sk_black_color_hsw_lowp)
+_sk_black_color_hsw_lowp:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  196,226,125,121,29,239,32,0,0       // vpbroadcastw  0x20ef(%rip),%ymm3        # 21c0 <_sk_xor__hsw_lowp+0x8c>
+  .byte  197,252,87,192                      // vxorps        %ymm0,%ymm0,%ymm0
+  .byte  197,244,87,201                      // vxorps        %ymm1,%ymm1,%ymm1
+  .byte  197,236,87,210                      // vxorps        %ymm2,%ymm2,%ymm2
+  .byte  255,224                             // jmpq          *%rax
+
+HIDDEN _sk_white_color_hsw_lowp
+.globl _sk_white_color_hsw_lowp
+FUNCTION(_sk_white_color_hsw_lowp)
+_sk_white_color_hsw_lowp:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  196,226,125,121,5,216,32,0,0        // vpbroadcastw  0x20d8(%rip),%ymm0        # 21c2 <_sk_xor__hsw_lowp+0x8e>
+  .byte  197,253,111,200                     // vmovdqa       %ymm0,%ymm1
+  .byte  197,253,111,208                     // vmovdqa       %ymm0,%ymm2
+  .byte  197,253,111,216                     // vmovdqa       %ymm0,%ymm3
+  .byte  255,224                             // jmpq          *%rax
+
 HIDDEN _sk_set_rgb_hsw_lowp
 .globl _sk_set_rgb_hsw_lowp
 FUNCTION(_sk_set_rgb_hsw_lowp)
 _sk_set_rgb_hsw_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  197,250,16,21,176,32,0,0            // vmovss        0x20b0(%rip),%xmm2        # 2180 <_sk_xor__hsw_lowp+0x7c>
+  .byte  197,250,16,21,174,32,0,0            // vmovss        0x20ae(%rip),%xmm2        # 21b0 <_sk_xor__hsw_lowp+0x7c>
   .byte  197,234,88,0                        // vaddss        (%rax),%xmm2,%xmm0
   .byte  196,193,121,126,193                 // vmovd         %xmm0,%r9d
   .byte  196,193,121,110,193                 // vmovd         %r9d,%xmm0
@@ -43134,19 +43317,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,210,0,0,0                    // jne           20f <_sk_load_8888_hsw_lowp+0xe0>
+  .byte  15,133,210,0,0,0                    // jne           241 <_sk_load_8888_hsw_lowp+0xe0>
   .byte  196,193,126,111,92,147,32           // vmovdqu       0x20(%r11,%rdx,4),%ymm3
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
-  .byte  197,253,111,5,78,32,0,0             // vmovdqa       0x204e(%rip),%ymm0        # 21a0 <_sk_xor__hsw_lowp+0x9c>
+  .byte  197,253,111,5,92,32,0,0             // vmovdqa       0x205c(%rip),%ymm0        # 21e0 <_sk_xor__hsw_lowp+0xac>
   .byte  196,226,61,0,200                    // vpshufb       %ymm0,%ymm8,%ymm1
   .byte  196,227,253,0,201,232               // vpermq        $0xe8,%ymm1,%ymm1
   .byte  196,226,101,0,192                   // vpshufb       %ymm0,%ymm3,%ymm0
   .byte  196,227,253,0,192,232               // vpermq        $0xe8,%ymm0,%ymm0
   .byte  196,227,117,56,192,1                // vinserti128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  197,253,113,240,8                   // vpsllw        $0x8,%ymm0,%ymm0
-  .byte  196,98,125,121,13,68,32,0,0         // vpbroadcastw  0x2044(%rip),%ymm9        # 21c0 <_sk_xor__hsw_lowp+0xbc>
+  .byte  196,98,125,121,13,82,32,0,0         // vpbroadcastw  0x2052(%rip),%ymm9        # 2200 <_sk_xor__hsw_lowp+0xcc>
   .byte  196,193,125,228,193                 // vpmulhuw      %ymm9,%ymm0,%ymm0
-  .byte  197,253,111,13,87,32,0,0            // vmovdqa       0x2057(%rip),%ymm1        # 21e0 <_sk_xor__hsw_lowp+0xdc>
+  .byte  197,253,111,13,101,32,0,0           // vmovdqa       0x2065(%rip),%ymm1        # 2220 <_sk_xor__hsw_lowp+0xec>
   .byte  196,226,61,0,209                    // vpshufb       %ymm1,%ymm8,%ymm2
   .byte  196,227,253,0,210,232               // vpermq        $0xe8,%ymm2,%ymm2
   .byte  196,226,101,0,201                   // vpshufb       %ymm1,%ymm3,%ymm1
@@ -43154,7 +43337,7 @@
   .byte  196,227,109,56,201,1                // vinserti128   $0x1,%xmm1,%ymm2,%ymm1
   .byte  197,245,113,241,8                   // vpsllw        $0x8,%ymm1,%ymm1
   .byte  196,193,117,228,201                 // vpmulhuw      %ymm9,%ymm1,%ymm1
-  .byte  197,253,111,21,73,32,0,0            // vmovdqa       0x2049(%rip),%ymm2        # 2200 <_sk_xor__hsw_lowp+0xfc>
+  .byte  197,253,111,21,87,32,0,0            // vmovdqa       0x2057(%rip),%ymm2        # 2240 <_sk_xor__hsw_lowp+0x10c>
   .byte  196,98,61,0,210                     // vpshufb       %ymm2,%ymm8,%ymm10
   .byte  196,67,253,0,210,232                // vpermq        $0xe8,%ymm10,%ymm10
   .byte  196,226,101,0,210                   // vpshufb       %ymm2,%ymm3,%ymm2
@@ -43162,7 +43345,7 @@
   .byte  196,227,45,56,210,1                 // vinserti128   $0x1,%xmm2,%ymm10,%ymm2
   .byte  197,237,113,242,8                   // vpsllw        $0x8,%ymm2,%ymm2
   .byte  196,193,109,228,209                 // vpmulhuw      %ymm9,%ymm2,%ymm2
-  .byte  197,125,111,21,59,32,0,0            // vmovdqa       0x203b(%rip),%ymm10        # 2220 <_sk_xor__hsw_lowp+0x11c>
+  .byte  197,125,111,21,73,32,0,0            // vmovdqa       0x2049(%rip),%ymm10        # 2260 <_sk_xor__hsw_lowp+0x12c>
   .byte  196,66,61,0,194                     // vpshufb       %ymm10,%ymm8,%ymm8
   .byte  196,67,253,0,192,232                // vpermq        $0xe8,%ymm8,%ymm8
   .byte  196,194,101,0,218                   // vpshufb       %ymm10,%ymm3,%ymm3
@@ -43178,14 +43361,14 @@
   .byte  196,65,61,239,192                   // vpxor         %ymm8,%ymm8,%ymm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  15,135,30,255,255,255               // ja            14a <_sk_load_8888_hsw_lowp+0x1b>
+  .byte  15,135,30,255,255,255               // ja            17c <_sk_load_8888_hsw_lowp+0x1b>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,29,1,0,0                  // lea           0x11d(%rip),%r10        # 354 <_sk_load_8888_hsw_lowp+0x225>
+  .byte  76,141,21,27,1,0,0                  // lea           0x11b(%rip),%r10        # 384 <_sk_load_8888_hsw_lowp+0x223>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,110,4,147                // vmovd         (%r11,%rdx,4),%xmm8
-  .byte  233,255,254,255,255                 // jmpq          14a <_sk_load_8888_hsw_lowp+0x1b>
+  .byte  233,255,254,255,255                 // jmpq          17c <_sk_load_8888_hsw_lowp+0x1b>
   .byte  196,193,121,110,68,147,8            // vmovd         0x8(%r11,%rdx,4),%xmm0
   .byte  196,226,121,89,192                  // vpbroadcastq  %xmm0,%xmm0
   .byte  197,229,239,219                     // vpxor         %ymm3,%ymm3,%ymm3
@@ -43193,7 +43376,7 @@
   .byte  196,194,121,53,4,147                // vpmovzxdq     (%r11,%rdx,4),%xmm0
   .byte  197,249,112,192,232                 // vpshufd       $0xe8,%xmm0,%xmm0
   .byte  196,99,61,2,192,3                   // vpblendd      $0x3,%ymm0,%ymm8,%ymm8
-  .byte  233,211,254,255,255                 // jmpq          14a <_sk_load_8888_hsw_lowp+0x1b>
+  .byte  233,211,254,255,255                 // jmpq          17c <_sk_load_8888_hsw_lowp+0x1b>
   .byte  196,193,121,110,68,147,24           // vmovd         0x18(%r11,%rdx,4),%xmm0
   .byte  196,226,125,89,192                  // vpbroadcastq  %xmm0,%ymm0
   .byte  197,229,239,219                     // vpxor         %ymm3,%ymm3,%ymm3
@@ -43206,7 +43389,7 @@
   .byte  196,99,61,56,192,1                  // vinserti128   $0x1,%xmm0,%ymm8,%ymm8
   .byte  196,193,122,111,4,147               // vmovdqu       (%r11,%rdx,4),%xmm0
   .byte  196,67,125,2,192,240                // vpblendd      $0xf0,%ymm8,%ymm0,%ymm8
-  .byte  233,132,254,255,255                 // jmpq          14a <_sk_load_8888_hsw_lowp+0x1b>
+  .byte  233,132,254,255,255                 // jmpq          17c <_sk_load_8888_hsw_lowp+0x1b>
   .byte  196,193,121,110,68,147,40           // vmovd         0x28(%r11,%rdx,4),%xmm0
   .byte  196,226,121,89,192                  // vpbroadcastq  %xmm0,%xmm0
   .byte  197,245,239,201                     // vpxor         %ymm1,%ymm1,%ymm1
@@ -43215,7 +43398,7 @@
   .byte  196,227,101,2,216,15                // vpblendd      $0xf,%ymm0,%ymm3,%ymm3
   .byte  196,193,121,110,68,147,32           // vmovd         0x20(%r11,%rdx,4),%xmm0
   .byte  196,227,101,2,216,1                 // vpblendd      $0x1,%ymm0,%ymm3,%ymm3
-  .byte  233,72,254,255,255                  // jmpq          144 <_sk_load_8888_hsw_lowp+0x15>
+  .byte  233,72,254,255,255                  // jmpq          176 <_sk_load_8888_hsw_lowp+0x15>
   .byte  196,193,121,110,68,147,56           // vmovd         0x38(%r11,%rdx,4),%xmm0
   .byte  196,226,125,89,192                  // vpbroadcastq  %xmm0,%ymm0
   .byte  197,245,239,201                     // vpxor         %ymm1,%ymm1,%ymm1
@@ -43229,40 +43412,40 @@
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
   .byte  196,193,122,111,68,147,32           // vmovdqu       0x20(%r11,%rdx,4),%xmm0
   .byte  196,227,125,2,219,240               // vpblendd      $0xf0,%ymm3,%ymm0,%ymm3
-  .byte  233,248,253,255,255                 // jmpq          14a <_sk_load_8888_hsw_lowp+0x1b>
-  .byte  102,144                             // xchg          %ax,%ax
-  .byte  236                                 // in            (%dx),%al
+  .byte  233,248,253,255,255                 // jmpq          17c <_sk_load_8888_hsw_lowp+0x1b>
+  .byte  238                                 // out           %al,(%dx)
   .byte  254                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,13,255,255,255,247              // decl          -0x8000001(%rip)        # fffffffff800035c <_sk_xor__hsw_lowp+0xfffffffff7ffe258>
+  .byte  255,15                              // decl          (%rdi)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  255                                 // (bad)
+  .byte  249                                 // stc
   .byte  254                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,97,255                          // jmpq          *-0x1(%rcx)
+  .byte  255,99,255                          // jmpq          *-0x1(%rbx)
   .byte  255                                 // (bad)
-  .byte  255,77,255                          // decl          -0x1(%rbp)
+  .byte  255,79,255                          // decl          -0x1(%rdi)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  57,255                              // cmp           %edi,%edi
+  .byte  59,255                              // cmp           %edi,%edi
   .byte  255                                 // (bad)
-  .byte  255,35                              // jmpq          *(%rbx)
-  .byte  255                                 // (bad)
-  .byte  255                                 // (bad)
-  .byte  255,240                             // push          %rax
+  .byte  255,37,255,255,255,242              // jmpq          *-0xd000001(%rip)        # fffffffff30003a0 <_sk_xor__hsw_lowp+0xfffffffff2ffe26c>
   .byte  253                                 // std
   .byte  255                                 // (bad)
-  .byte  255,150,255,255,255,136             // callq         *-0x77000001(%rsi)
+  .byte  255,152,255,255,255,138             // lcall         *-0x75000001(%rax)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,114,255                         // pushq         -0x1(%rdx)
+  .byte  255,116,255,255                     // pushq         -0x1(%rdi,%rdi,8)
   .byte  255                                 // (bad)
-  .byte  255,230                             // jmpq          *%rsi
+  .byte  232,255,255,255,212                 // callq         ffffffffd50003b4 <_sk_xor__hsw_lowp+0xffffffffd4ffe280>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,210                             // callq         *%rdx
+  .byte  255,192                             // inc           %eax
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255                                 // (bad)
-  .byte  190,255,255,255,168                 // mov           $0xa8ffffff,%esi
+  .byte  255                                 // .byte         0xff
+  .byte  170                                 // stos          %al,%es:(%rdi)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // .byte         0xff
@@ -43274,19 +43457,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,210,0,0,0                    // jne           470 <_sk_load_8888_dst_hsw_lowp+0xe0>
+  .byte  15,133,210,0,0,0                    // jne           4a0 <_sk_load_8888_dst_hsw_lowp+0xe0>
   .byte  196,193,126,111,124,147,32          // vmovdqu       0x20(%r11,%rdx,4),%ymm7
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
-  .byte  197,253,111,37,141,30,0,0           // vmovdqa       0x1e8d(%rip),%ymm4        # 2240 <_sk_xor__hsw_lowp+0x13c>
+  .byte  197,253,111,37,157,30,0,0           // vmovdqa       0x1e9d(%rip),%ymm4        # 2280 <_sk_xor__hsw_lowp+0x14c>
   .byte  196,226,61,0,236                    // vpshufb       %ymm4,%ymm8,%ymm5
   .byte  196,227,253,0,237,232               // vpermq        $0xe8,%ymm5,%ymm5
   .byte  196,226,69,0,228                    // vpshufb       %ymm4,%ymm7,%ymm4
   .byte  196,227,253,0,228,232               // vpermq        $0xe8,%ymm4,%ymm4
   .byte  196,227,85,56,228,1                 // vinserti128   $0x1,%xmm4,%ymm5,%ymm4
   .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
-  .byte  196,98,125,121,13,131,30,0,0        // vpbroadcastw  0x1e83(%rip),%ymm9        # 2260 <_sk_xor__hsw_lowp+0x15c>
+  .byte  196,98,125,121,13,147,30,0,0        // vpbroadcastw  0x1e93(%rip),%ymm9        # 22a0 <_sk_xor__hsw_lowp+0x16c>
   .byte  196,193,93,228,225                  // vpmulhuw      %ymm9,%ymm4,%ymm4
-  .byte  197,253,111,45,150,30,0,0           // vmovdqa       0x1e96(%rip),%ymm5        # 2280 <_sk_xor__hsw_lowp+0x17c>
+  .byte  197,253,111,45,166,30,0,0           // vmovdqa       0x1ea6(%rip),%ymm5        # 22c0 <_sk_xor__hsw_lowp+0x18c>
   .byte  196,226,61,0,245                    // vpshufb       %ymm5,%ymm8,%ymm6
   .byte  196,227,253,0,246,232               // vpermq        $0xe8,%ymm6,%ymm6
   .byte  196,226,69,0,237                    // vpshufb       %ymm5,%ymm7,%ymm5
@@ -43294,7 +43477,7 @@
   .byte  196,227,77,56,237,1                 // vinserti128   $0x1,%xmm5,%ymm6,%ymm5
   .byte  197,213,113,245,8                   // vpsllw        $0x8,%ymm5,%ymm5
   .byte  196,193,85,228,233                  // vpmulhuw      %ymm9,%ymm5,%ymm5
-  .byte  197,253,111,53,136,30,0,0           // vmovdqa       0x1e88(%rip),%ymm6        # 22a0 <_sk_xor__hsw_lowp+0x19c>
+  .byte  197,253,111,53,152,30,0,0           // vmovdqa       0x1e98(%rip),%ymm6        # 22e0 <_sk_xor__hsw_lowp+0x1ac>
   .byte  196,98,61,0,214                     // vpshufb       %ymm6,%ymm8,%ymm10
   .byte  196,67,253,0,210,232                // vpermq        $0xe8,%ymm10,%ymm10
   .byte  196,226,69,0,246                    // vpshufb       %ymm6,%ymm7,%ymm6
@@ -43302,7 +43485,7 @@
   .byte  196,227,45,56,246,1                 // vinserti128   $0x1,%xmm6,%ymm10,%ymm6
   .byte  197,205,113,246,8                   // vpsllw        $0x8,%ymm6,%ymm6
   .byte  196,193,77,228,241                  // vpmulhuw      %ymm9,%ymm6,%ymm6
-  .byte  197,125,111,21,122,30,0,0           // vmovdqa       0x1e7a(%rip),%ymm10        # 22c0 <_sk_xor__hsw_lowp+0x1bc>
+  .byte  197,125,111,21,138,30,0,0           // vmovdqa       0x1e8a(%rip),%ymm10        # 2300 <_sk_xor__hsw_lowp+0x1cc>
   .byte  196,66,61,0,194                     // vpshufb       %ymm10,%ymm8,%ymm8
   .byte  196,67,253,0,192,232                // vpermq        $0xe8,%ymm8,%ymm8
   .byte  196,194,69,0,250                    // vpshufb       %ymm10,%ymm7,%ymm7
@@ -43318,14 +43501,14 @@
   .byte  196,65,61,239,192                   // vpxor         %ymm8,%ymm8,%ymm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  15,135,30,255,255,255               // ja            3ab <_sk_load_8888_dst_hsw_lowp+0x1b>
+  .byte  15,135,30,255,255,255               // ja            3db <_sk_load_8888_dst_hsw_lowp+0x1b>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,28,1,0,0                  // lea           0x11c(%rip),%r10        # 5b4 <_sk_load_8888_dst_hsw_lowp+0x224>
+  .byte  76,141,21,28,1,0,0                  // lea           0x11c(%rip),%r10        # 5e4 <_sk_load_8888_dst_hsw_lowp+0x224>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,110,4,147                // vmovd         (%r11,%rdx,4),%xmm8
-  .byte  233,255,254,255,255                 // jmpq          3ab <_sk_load_8888_dst_hsw_lowp+0x1b>
+  .byte  233,255,254,255,255                 // jmpq          3db <_sk_load_8888_dst_hsw_lowp+0x1b>
   .byte  196,193,121,110,100,147,8           // vmovd         0x8(%r11,%rdx,4),%xmm4
   .byte  196,226,121,89,228                  // vpbroadcastq  %xmm4,%xmm4
   .byte  197,197,239,255                     // vpxor         %ymm7,%ymm7,%ymm7
@@ -43333,7 +43516,7 @@
   .byte  196,194,121,53,36,147               // vpmovzxdq     (%r11,%rdx,4),%xmm4
   .byte  197,249,112,228,232                 // vpshufd       $0xe8,%xmm4,%xmm4
   .byte  196,99,61,2,196,3                   // vpblendd      $0x3,%ymm4,%ymm8,%ymm8
-  .byte  233,211,254,255,255                 // jmpq          3ab <_sk_load_8888_dst_hsw_lowp+0x1b>
+  .byte  233,211,254,255,255                 // jmpq          3db <_sk_load_8888_dst_hsw_lowp+0x1b>
   .byte  196,193,121,110,100,147,24          // vmovd         0x18(%r11,%rdx,4),%xmm4
   .byte  196,226,125,89,228                  // vpbroadcastq  %xmm4,%ymm4
   .byte  197,197,239,255                     // vpxor         %ymm7,%ymm7,%ymm7
@@ -43346,7 +43529,7 @@
   .byte  196,99,61,56,196,1                  // vinserti128   $0x1,%xmm4,%ymm8,%ymm8
   .byte  196,193,122,111,36,147              // vmovdqu       (%r11,%rdx,4),%xmm4
   .byte  196,67,93,2,192,240                 // vpblendd      $0xf0,%ymm8,%ymm4,%ymm8
-  .byte  233,132,254,255,255                 // jmpq          3ab <_sk_load_8888_dst_hsw_lowp+0x1b>
+  .byte  233,132,254,255,255                 // jmpq          3db <_sk_load_8888_dst_hsw_lowp+0x1b>
   .byte  196,193,121,110,100,147,40          // vmovd         0x28(%r11,%rdx,4),%xmm4
   .byte  196,226,121,89,228                  // vpbroadcastq  %xmm4,%xmm4
   .byte  197,213,239,237                     // vpxor         %ymm5,%ymm5,%ymm5
@@ -43355,7 +43538,7 @@
   .byte  196,227,69,2,252,15                 // vpblendd      $0xf,%ymm4,%ymm7,%ymm7
   .byte  196,193,121,110,100,147,32          // vmovd         0x20(%r11,%rdx,4),%xmm4
   .byte  196,227,69,2,252,1                  // vpblendd      $0x1,%ymm4,%ymm7,%ymm7
-  .byte  233,72,254,255,255                  // jmpq          3a5 <_sk_load_8888_dst_hsw_lowp+0x15>
+  .byte  233,72,254,255,255                  // jmpq          3d5 <_sk_load_8888_dst_hsw_lowp+0x15>
   .byte  196,193,121,110,100,147,56          // vmovd         0x38(%r11,%rdx,4),%xmm4
   .byte  196,226,125,89,228                  // vpbroadcastq  %xmm4,%ymm4
   .byte  197,213,239,237                     // vpxor         %ymm5,%ymm5,%ymm5
@@ -43369,7 +43552,7 @@
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
   .byte  196,193,122,111,100,147,32          // vmovdqu       0x20(%r11,%rdx,4),%xmm4
   .byte  196,227,93,2,255,240                // vpblendd      $0xf0,%ymm7,%ymm4,%ymm7
-  .byte  233,248,253,255,255                 // jmpq          3ab <_sk_load_8888_dst_hsw_lowp+0x1b>
+  .byte  233,248,253,255,255                 // jmpq          3db <_sk_load_8888_dst_hsw_lowp+0x1b>
   .byte  144                                 // nop
   .byte  237                                 // in            (%dx),%eax
   .byte  254                                 // (bad)
@@ -43417,7 +43600,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  197,189,113,208,7                   // vpsrlw        $0x7,%ymm0,%ymm8
-  .byte  196,98,125,121,13,221,28,0,0        // vpbroadcastw  0x1cdd(%rip),%ymm9        # 22e0 <_sk_xor__hsw_lowp+0x1dc>
+  .byte  196,98,125,121,13,237,28,0,0        // vpbroadcastw  0x1ced(%rip),%ymm9        # 2320 <_sk_xor__hsw_lowp+0x1ec>
   .byte  196,65,61,234,193                   // vpminsw       %ymm9,%ymm8,%ymm8
   .byte  196,66,125,51,208                   // vpmovzxwd     %xmm8,%ymm10
   .byte  196,67,125,57,192,1                 // vextracti128  $0x1,%ymm8,%xmm8
@@ -43450,7 +43633,7 @@
   .byte  196,65,29,235,198                   // vpor          %ymm14,%ymm12,%ymm8
   .byte  196,65,45,235,192                   // vpor          %ymm8,%ymm10,%ymm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,17                              // jne           6be <_sk_store_8888_hsw_lowp+0xce>
+  .byte  117,17                              // jne           6ee <_sk_store_8888_hsw_lowp+0xce>
   .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
   .byte  196,65,126,127,76,147,32            // vmovdqu       %ymm9,0x20(%r11,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -43459,17 +43642,17 @@
   .byte  65,128,225,15                       // and           $0xf,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,236                             // ja            6ba <_sk_store_8888_hsw_lowp+0xca>
+  .byte  119,236                             // ja            6ea <_sk_store_8888_hsw_lowp+0xca>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,175,0,0,0                 // lea           0xaf(%rip),%r10        # 788 <_sk_store_8888_hsw_lowp+0x198>
+  .byte  76,141,21,175,0,0,0                 // lea           0xaf(%rip),%r10        # 7b8 <_sk_store_8888_hsw_lowp+0x198>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,126,4,147                // vmovd         %xmm8,(%r11,%rdx,4)
-  .byte  235,208                             // jmp           6ba <_sk_store_8888_hsw_lowp+0xca>
+  .byte  235,208                             // jmp           6ea <_sk_store_8888_hsw_lowp+0xca>
   .byte  196,67,121,22,68,147,8,2            // vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,4)
   .byte  196,65,121,214,4,147                // vmovq         %xmm8,(%r11,%rdx,4)
-  .byte  235,192                             // jmp           6ba <_sk_store_8888_hsw_lowp+0xca>
+  .byte  235,192                             // jmp           6ea <_sk_store_8888_hsw_lowp+0xca>
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,67,121,22,76,147,24,2           // vpextrd       $0x2,%xmm9,0x18(%r11,%rdx,4)
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
@@ -43477,12 +43660,12 @@
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,65,121,126,76,147,16            // vmovd         %xmm9,0x10(%r11,%rdx,4)
   .byte  196,65,122,127,4,147                // vmovdqu       %xmm8,(%r11,%rdx,4)
-  .byte  235,143                             // jmp           6ba <_sk_store_8888_hsw_lowp+0xca>
+  .byte  235,143                             // jmp           6ea <_sk_store_8888_hsw_lowp+0xca>
   .byte  196,67,121,22,76,147,40,2           // vpextrd       $0x2,%xmm9,0x28(%r11,%rdx,4)
   .byte  196,67,121,22,76,147,36,1           // vpextrd       $0x1,%xmm9,0x24(%r11,%rdx,4)
   .byte  196,65,121,126,76,147,32            // vmovd         %xmm9,0x20(%r11,%rdx,4)
   .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
-  .byte  233,109,255,255,255                 // jmpq          6ba <_sk_store_8888_hsw_lowp+0xca>
+  .byte  233,109,255,255,255                 // jmpq          6ea <_sk_store_8888_hsw_lowp+0xca>
   .byte  196,67,125,57,202,1                 // vextracti128  $0x1,%ymm9,%xmm10
   .byte  196,67,121,22,84,147,56,2           // vpextrd       $0x2,%xmm10,0x38(%r11,%rdx,4)
   .byte  196,67,125,57,202,1                 // vextracti128  $0x1,%ymm9,%xmm10
@@ -43491,7 +43674,7 @@
   .byte  196,65,121,126,84,147,48            // vmovd         %xmm10,0x30(%r11,%rdx,4)
   .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
   .byte  196,65,122,127,76,147,32            // vmovdqu       %xmm9,0x20(%r11,%rdx,4)
-  .byte  233,50,255,255,255                  // jmpq          6ba <_sk_store_8888_hsw_lowp+0xca>
+  .byte  233,50,255,255,255                  // jmpq          6ea <_sk_store_8888_hsw_lowp+0xca>
   .byte  90                                  // pop           %rdx
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -43534,19 +43717,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,210,0,0,0                    // jne           8a4 <_sk_load_bgra_hsw_lowp+0xe0>
+  .byte  15,133,210,0,0,0                    // jne           8d4 <_sk_load_bgra_hsw_lowp+0xe0>
   .byte  196,193,126,111,92,147,32           // vmovdqu       0x20(%r11,%rdx,4),%ymm3
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
-  .byte  197,253,111,5,25,27,0,0             // vmovdqa       0x1b19(%rip),%ymm0        # 2300 <_sk_xor__hsw_lowp+0x1fc>
+  .byte  197,253,111,5,41,27,0,0             // vmovdqa       0x1b29(%rip),%ymm0        # 2340 <_sk_xor__hsw_lowp+0x20c>
   .byte  196,226,61,0,200                    // vpshufb       %ymm0,%ymm8,%ymm1
   .byte  196,227,253,0,201,232               // vpermq        $0xe8,%ymm1,%ymm1
   .byte  196,226,101,0,192                   // vpshufb       %ymm0,%ymm3,%ymm0
   .byte  196,227,253,0,192,232               // vpermq        $0xe8,%ymm0,%ymm0
   .byte  196,227,117,56,192,1                // vinserti128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  197,253,113,240,8                   // vpsllw        $0x8,%ymm0,%ymm0
-  .byte  196,98,125,121,13,15,27,0,0         // vpbroadcastw  0x1b0f(%rip),%ymm9        # 2320 <_sk_xor__hsw_lowp+0x21c>
+  .byte  196,98,125,121,13,31,27,0,0         // vpbroadcastw  0x1b1f(%rip),%ymm9        # 2360 <_sk_xor__hsw_lowp+0x22c>
   .byte  196,193,125,228,209                 // vpmulhuw      %ymm9,%ymm0,%ymm2
-  .byte  197,253,111,5,34,27,0,0             // vmovdqa       0x1b22(%rip),%ymm0        # 2340 <_sk_xor__hsw_lowp+0x23c>
+  .byte  197,253,111,5,50,27,0,0             // vmovdqa       0x1b32(%rip),%ymm0        # 2380 <_sk_xor__hsw_lowp+0x24c>
   .byte  196,226,61,0,200                    // vpshufb       %ymm0,%ymm8,%ymm1
   .byte  196,227,253,0,201,232               // vpermq        $0xe8,%ymm1,%ymm1
   .byte  196,226,101,0,192                   // vpshufb       %ymm0,%ymm3,%ymm0
@@ -43554,7 +43737,7 @@
   .byte  196,227,117,56,192,1                // vinserti128   $0x1,%xmm0,%ymm1,%ymm0
   .byte  197,253,113,240,8                   // vpsllw        $0x8,%ymm0,%ymm0
   .byte  196,193,125,228,201                 // vpmulhuw      %ymm9,%ymm0,%ymm1
-  .byte  197,253,111,5,20,27,0,0             // vmovdqa       0x1b14(%rip),%ymm0        # 2360 <_sk_xor__hsw_lowp+0x25c>
+  .byte  197,253,111,5,36,27,0,0             // vmovdqa       0x1b24(%rip),%ymm0        # 23a0 <_sk_xor__hsw_lowp+0x26c>
   .byte  196,98,61,0,208                     // vpshufb       %ymm0,%ymm8,%ymm10
   .byte  196,67,253,0,210,232                // vpermq        $0xe8,%ymm10,%ymm10
   .byte  196,226,101,0,192                   // vpshufb       %ymm0,%ymm3,%ymm0
@@ -43562,7 +43745,7 @@
   .byte  196,227,45,56,192,1                 // vinserti128   $0x1,%xmm0,%ymm10,%ymm0
   .byte  197,253,113,240,8                   // vpsllw        $0x8,%ymm0,%ymm0
   .byte  196,193,125,228,193                 // vpmulhuw      %ymm9,%ymm0,%ymm0
-  .byte  197,125,111,21,6,27,0,0             // vmovdqa       0x1b06(%rip),%ymm10        # 2380 <_sk_xor__hsw_lowp+0x27c>
+  .byte  197,125,111,21,22,27,0,0            // vmovdqa       0x1b16(%rip),%ymm10        # 23c0 <_sk_xor__hsw_lowp+0x28c>
   .byte  196,66,61,0,194                     // vpshufb       %ymm10,%ymm8,%ymm8
   .byte  196,67,253,0,192,232                // vpermq        $0xe8,%ymm8,%ymm8
   .byte  196,194,101,0,218                   // vpshufb       %ymm10,%ymm3,%ymm3
@@ -43578,14 +43761,14 @@
   .byte  196,65,61,239,192                   // vpxor         %ymm8,%ymm8,%ymm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  15,135,30,255,255,255               // ja            7df <_sk_load_bgra_hsw_lowp+0x1b>
+  .byte  15,135,30,255,255,255               // ja            80f <_sk_load_bgra_hsw_lowp+0x1b>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,28,1,0,0                  // lea           0x11c(%rip),%r10        # 9e8 <_sk_load_bgra_hsw_lowp+0x224>
+  .byte  76,141,21,28,1,0,0                  // lea           0x11c(%rip),%r10        # a18 <_sk_load_bgra_hsw_lowp+0x224>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,110,4,147                // vmovd         (%r11,%rdx,4),%xmm8
-  .byte  233,255,254,255,255                 // jmpq          7df <_sk_load_bgra_hsw_lowp+0x1b>
+  .byte  233,255,254,255,255                 // jmpq          80f <_sk_load_bgra_hsw_lowp+0x1b>
   .byte  196,193,121,110,68,147,8            // vmovd         0x8(%r11,%rdx,4),%xmm0
   .byte  196,226,121,89,192                  // vpbroadcastq  %xmm0,%xmm0
   .byte  197,229,239,219                     // vpxor         %ymm3,%ymm3,%ymm3
@@ -43593,7 +43776,7 @@
   .byte  196,194,121,53,4,147                // vpmovzxdq     (%r11,%rdx,4),%xmm0
   .byte  197,249,112,192,232                 // vpshufd       $0xe8,%xmm0,%xmm0
   .byte  196,99,61,2,192,3                   // vpblendd      $0x3,%ymm0,%ymm8,%ymm8
-  .byte  233,211,254,255,255                 // jmpq          7df <_sk_load_bgra_hsw_lowp+0x1b>
+  .byte  233,211,254,255,255                 // jmpq          80f <_sk_load_bgra_hsw_lowp+0x1b>
   .byte  196,193,121,110,68,147,24           // vmovd         0x18(%r11,%rdx,4),%xmm0
   .byte  196,226,125,89,192                  // vpbroadcastq  %xmm0,%ymm0
   .byte  197,229,239,219                     // vpxor         %ymm3,%ymm3,%ymm3
@@ -43606,7 +43789,7 @@
   .byte  196,99,61,56,192,1                  // vinserti128   $0x1,%xmm0,%ymm8,%ymm8
   .byte  196,193,122,111,4,147               // vmovdqu       (%r11,%rdx,4),%xmm0
   .byte  196,67,125,2,192,240                // vpblendd      $0xf0,%ymm8,%ymm0,%ymm8
-  .byte  233,132,254,255,255                 // jmpq          7df <_sk_load_bgra_hsw_lowp+0x1b>
+  .byte  233,132,254,255,255                 // jmpq          80f <_sk_load_bgra_hsw_lowp+0x1b>
   .byte  196,193,121,110,68,147,40           // vmovd         0x28(%r11,%rdx,4),%xmm0
   .byte  196,226,121,89,192                  // vpbroadcastq  %xmm0,%xmm0
   .byte  197,245,239,201                     // vpxor         %ymm1,%ymm1,%ymm1
@@ -43615,7 +43798,7 @@
   .byte  196,227,101,2,216,15                // vpblendd      $0xf,%ymm0,%ymm3,%ymm3
   .byte  196,193,121,110,68,147,32           // vmovd         0x20(%r11,%rdx,4),%xmm0
   .byte  196,227,101,2,216,1                 // vpblendd      $0x1,%ymm0,%ymm3,%ymm3
-  .byte  233,72,254,255,255                  // jmpq          7d9 <_sk_load_bgra_hsw_lowp+0x15>
+  .byte  233,72,254,255,255                  // jmpq          809 <_sk_load_bgra_hsw_lowp+0x15>
   .byte  196,193,121,110,68,147,56           // vmovd         0x38(%r11,%rdx,4),%xmm0
   .byte  196,226,125,89,192                  // vpbroadcastq  %xmm0,%ymm0
   .byte  197,245,239,201                     // vpxor         %ymm1,%ymm1,%ymm1
@@ -43629,7 +43812,7 @@
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
   .byte  196,193,122,111,68,147,32           // vmovdqu       0x20(%r11,%rdx,4),%xmm0
   .byte  196,227,125,2,219,240               // vpblendd      $0xf0,%ymm3,%ymm0,%ymm3
-  .byte  233,248,253,255,255                 // jmpq          7df <_sk_load_bgra_hsw_lowp+0x1b>
+  .byte  233,248,253,255,255                 // jmpq          80f <_sk_load_bgra_hsw_lowp+0x1b>
   .byte  144                                 // nop
   .byte  237                                 // in            (%dx),%eax
   .byte  254                                 // (bad)
@@ -43677,19 +43860,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,210,0,0,0                    // jne           b04 <_sk_load_bgra_dst_hsw_lowp+0xe0>
+  .byte  15,133,210,0,0,0                    // jne           b34 <_sk_load_bgra_dst_hsw_lowp+0xe0>
   .byte  196,193,126,111,124,147,32          // vmovdqu       0x20(%r11,%rdx,4),%ymm7
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
-  .byte  197,253,111,37,89,25,0,0            // vmovdqa       0x1959(%rip),%ymm4        # 23a0 <_sk_xor__hsw_lowp+0x29c>
+  .byte  197,253,111,37,105,25,0,0           // vmovdqa       0x1969(%rip),%ymm4        # 23e0 <_sk_xor__hsw_lowp+0x2ac>
   .byte  196,226,61,0,236                    // vpshufb       %ymm4,%ymm8,%ymm5
   .byte  196,227,253,0,237,232               // vpermq        $0xe8,%ymm5,%ymm5
   .byte  196,226,69,0,228                    // vpshufb       %ymm4,%ymm7,%ymm4
   .byte  196,227,253,0,228,232               // vpermq        $0xe8,%ymm4,%ymm4
   .byte  196,227,85,56,228,1                 // vinserti128   $0x1,%xmm4,%ymm5,%ymm4
   .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
-  .byte  196,98,125,121,13,79,25,0,0         // vpbroadcastw  0x194f(%rip),%ymm9        # 23c0 <_sk_xor__hsw_lowp+0x2bc>
+  .byte  196,98,125,121,13,95,25,0,0         // vpbroadcastw  0x195f(%rip),%ymm9        # 2400 <_sk_xor__hsw_lowp+0x2cc>
   .byte  196,193,93,228,241                  // vpmulhuw      %ymm9,%ymm4,%ymm6
-  .byte  197,253,111,37,98,25,0,0            // vmovdqa       0x1962(%rip),%ymm4        # 23e0 <_sk_xor__hsw_lowp+0x2dc>
+  .byte  197,253,111,37,114,25,0,0           // vmovdqa       0x1972(%rip),%ymm4        # 2420 <_sk_xor__hsw_lowp+0x2ec>
   .byte  196,226,61,0,236                    // vpshufb       %ymm4,%ymm8,%ymm5
   .byte  196,227,253,0,237,232               // vpermq        $0xe8,%ymm5,%ymm5
   .byte  196,226,69,0,228                    // vpshufb       %ymm4,%ymm7,%ymm4
@@ -43697,7 +43880,7 @@
   .byte  196,227,85,56,228,1                 // vinserti128   $0x1,%xmm4,%ymm5,%ymm4
   .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
   .byte  196,193,93,228,233                  // vpmulhuw      %ymm9,%ymm4,%ymm5
-  .byte  197,253,111,37,84,25,0,0            // vmovdqa       0x1954(%rip),%ymm4        # 2400 <_sk_xor__hsw_lowp+0x2fc>
+  .byte  197,253,111,37,100,25,0,0           // vmovdqa       0x1964(%rip),%ymm4        # 2440 <_sk_xor__hsw_lowp+0x30c>
   .byte  196,98,61,0,212                     // vpshufb       %ymm4,%ymm8,%ymm10
   .byte  196,67,253,0,210,232                // vpermq        $0xe8,%ymm10,%ymm10
   .byte  196,226,69,0,228                    // vpshufb       %ymm4,%ymm7,%ymm4
@@ -43705,7 +43888,7 @@
   .byte  196,227,45,56,228,1                 // vinserti128   $0x1,%xmm4,%ymm10,%ymm4
   .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
   .byte  196,193,93,228,225                  // vpmulhuw      %ymm9,%ymm4,%ymm4
-  .byte  197,125,111,21,70,25,0,0            // vmovdqa       0x1946(%rip),%ymm10        # 2420 <_sk_xor__hsw_lowp+0x31c>
+  .byte  197,125,111,21,86,25,0,0            // vmovdqa       0x1956(%rip),%ymm10        # 2460 <_sk_xor__hsw_lowp+0x32c>
   .byte  196,66,61,0,194                     // vpshufb       %ymm10,%ymm8,%ymm8
   .byte  196,67,253,0,192,232                // vpermq        $0xe8,%ymm8,%ymm8
   .byte  196,194,69,0,250                    // vpshufb       %ymm10,%ymm7,%ymm7
@@ -43721,14 +43904,14 @@
   .byte  196,65,61,239,192                   // vpxor         %ymm8,%ymm8,%ymm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  15,135,30,255,255,255               // ja            a3f <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  .byte  15,135,30,255,255,255               // ja            a6f <_sk_load_bgra_dst_hsw_lowp+0x1b>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,28,1,0,0                  // lea           0x11c(%rip),%r10        # c48 <_sk_load_bgra_dst_hsw_lowp+0x224>
+  .byte  76,141,21,28,1,0,0                  // lea           0x11c(%rip),%r10        # c78 <_sk_load_bgra_dst_hsw_lowp+0x224>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,110,4,147                // vmovd         (%r11,%rdx,4),%xmm8
-  .byte  233,255,254,255,255                 // jmpq          a3f <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  .byte  233,255,254,255,255                 // jmpq          a6f <_sk_load_bgra_dst_hsw_lowp+0x1b>
   .byte  196,193,121,110,100,147,8           // vmovd         0x8(%r11,%rdx,4),%xmm4
   .byte  196,226,121,89,228                  // vpbroadcastq  %xmm4,%xmm4
   .byte  197,197,239,255                     // vpxor         %ymm7,%ymm7,%ymm7
@@ -43736,7 +43919,7 @@
   .byte  196,194,121,53,36,147               // vpmovzxdq     (%r11,%rdx,4),%xmm4
   .byte  197,249,112,228,232                 // vpshufd       $0xe8,%xmm4,%xmm4
   .byte  196,99,61,2,196,3                   // vpblendd      $0x3,%ymm4,%ymm8,%ymm8
-  .byte  233,211,254,255,255                 // jmpq          a3f <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  .byte  233,211,254,255,255                 // jmpq          a6f <_sk_load_bgra_dst_hsw_lowp+0x1b>
   .byte  196,193,121,110,100,147,24          // vmovd         0x18(%r11,%rdx,4),%xmm4
   .byte  196,226,125,89,228                  // vpbroadcastq  %xmm4,%ymm4
   .byte  197,197,239,255                     // vpxor         %ymm7,%ymm7,%ymm7
@@ -43749,7 +43932,7 @@
   .byte  196,99,61,56,196,1                  // vinserti128   $0x1,%xmm4,%ymm8,%ymm8
   .byte  196,193,122,111,36,147              // vmovdqu       (%r11,%rdx,4),%xmm4
   .byte  196,67,93,2,192,240                 // vpblendd      $0xf0,%ymm8,%ymm4,%ymm8
-  .byte  233,132,254,255,255                 // jmpq          a3f <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  .byte  233,132,254,255,255                 // jmpq          a6f <_sk_load_bgra_dst_hsw_lowp+0x1b>
   .byte  196,193,121,110,100,147,40          // vmovd         0x28(%r11,%rdx,4),%xmm4
   .byte  196,226,121,89,228                  // vpbroadcastq  %xmm4,%xmm4
   .byte  197,213,239,237                     // vpxor         %ymm5,%ymm5,%ymm5
@@ -43758,7 +43941,7 @@
   .byte  196,227,69,2,252,15                 // vpblendd      $0xf,%ymm4,%ymm7,%ymm7
   .byte  196,193,121,110,100,147,32          // vmovd         0x20(%r11,%rdx,4),%xmm4
   .byte  196,227,69,2,252,1                  // vpblendd      $0x1,%ymm4,%ymm7,%ymm7
-  .byte  233,72,254,255,255                  // jmpq          a39 <_sk_load_bgra_dst_hsw_lowp+0x15>
+  .byte  233,72,254,255,255                  // jmpq          a69 <_sk_load_bgra_dst_hsw_lowp+0x15>
   .byte  196,193,121,110,100,147,56          // vmovd         0x38(%r11,%rdx,4),%xmm4
   .byte  196,226,125,89,228                  // vpbroadcastq  %xmm4,%ymm4
   .byte  197,213,239,237                     // vpxor         %ymm5,%ymm5,%ymm5
@@ -43772,7 +43955,7 @@
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
   .byte  196,193,122,111,100,147,32          // vmovdqu       0x20(%r11,%rdx,4),%xmm4
   .byte  196,227,93,2,255,240                // vpblendd      $0xf0,%ymm7,%ymm4,%ymm7
-  .byte  233,248,253,255,255                 // jmpq          a3f <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  .byte  233,248,253,255,255                 // jmpq          a6f <_sk_load_bgra_dst_hsw_lowp+0x1b>
   .byte  144                                 // nop
   .byte  237                                 // in            (%dx),%eax
   .byte  254                                 // (bad)
@@ -43820,7 +44003,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  197,189,113,210,7                   // vpsrlw        $0x7,%ymm2,%ymm8
-  .byte  196,98,125,121,13,169,23,0,0        // vpbroadcastw  0x17a9(%rip),%ymm9        # 2440 <_sk_xor__hsw_lowp+0x33c>
+  .byte  196,98,125,121,13,185,23,0,0        // vpbroadcastw  0x17b9(%rip),%ymm9        # 2480 <_sk_xor__hsw_lowp+0x34c>
   .byte  196,65,61,234,193                   // vpminsw       %ymm9,%ymm8,%ymm8
   .byte  196,66,125,51,208                   // vpmovzxwd     %xmm8,%ymm10
   .byte  196,67,125,57,192,1                 // vextracti128  $0x1,%ymm8,%xmm8
@@ -43853,7 +44036,7 @@
   .byte  196,65,29,235,193                   // vpor          %ymm9,%ymm12,%ymm8
   .byte  196,65,21,235,192                   // vpor          %ymm8,%ymm13,%ymm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,17                              // jne           d52 <_sk_store_bgra_hsw_lowp+0xce>
+  .byte  117,17                              // jne           d82 <_sk_store_bgra_hsw_lowp+0xce>
   .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
   .byte  196,65,126,127,84,147,32            // vmovdqu       %ymm10,0x20(%r11,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -43862,17 +44045,17 @@
   .byte  65,128,225,15                       // and           $0xf,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,236                             // ja            d4e <_sk_store_bgra_hsw_lowp+0xca>
+  .byte  119,236                             // ja            d7e <_sk_store_bgra_hsw_lowp+0xca>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,175,0,0,0                 // lea           0xaf(%rip),%r10        # e1c <_sk_store_bgra_hsw_lowp+0x198>
+  .byte  76,141,21,175,0,0,0                 // lea           0xaf(%rip),%r10        # e4c <_sk_store_bgra_hsw_lowp+0x198>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,126,4,147                // vmovd         %xmm8,(%r11,%rdx,4)
-  .byte  235,208                             // jmp           d4e <_sk_store_bgra_hsw_lowp+0xca>
+  .byte  235,208                             // jmp           d7e <_sk_store_bgra_hsw_lowp+0xca>
   .byte  196,67,121,22,68,147,8,2            // vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,4)
   .byte  196,65,121,214,4,147                // vmovq         %xmm8,(%r11,%rdx,4)
-  .byte  235,192                             // jmp           d4e <_sk_store_bgra_hsw_lowp+0xca>
+  .byte  235,192                             // jmp           d7e <_sk_store_bgra_hsw_lowp+0xca>
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,67,121,22,76,147,24,2           // vpextrd       $0x2,%xmm9,0x18(%r11,%rdx,4)
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
@@ -43880,12 +44063,12 @@
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,65,121,126,76,147,16            // vmovd         %xmm9,0x10(%r11,%rdx,4)
   .byte  196,65,122,127,4,147                // vmovdqu       %xmm8,(%r11,%rdx,4)
-  .byte  235,143                             // jmp           d4e <_sk_store_bgra_hsw_lowp+0xca>
+  .byte  235,143                             // jmp           d7e <_sk_store_bgra_hsw_lowp+0xca>
   .byte  196,67,121,22,84,147,40,2           // vpextrd       $0x2,%xmm10,0x28(%r11,%rdx,4)
   .byte  196,67,121,22,84,147,36,1           // vpextrd       $0x1,%xmm10,0x24(%r11,%rdx,4)
   .byte  196,65,121,126,84,147,32            // vmovd         %xmm10,0x20(%r11,%rdx,4)
   .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
-  .byte  233,109,255,255,255                 // jmpq          d4e <_sk_store_bgra_hsw_lowp+0xca>
+  .byte  233,109,255,255,255                 // jmpq          d7e <_sk_store_bgra_hsw_lowp+0xca>
   .byte  196,67,125,57,209,1                 // vextracti128  $0x1,%ymm10,%xmm9
   .byte  196,67,121,22,76,147,56,2           // vpextrd       $0x2,%xmm9,0x38(%r11,%rdx,4)
   .byte  196,67,125,57,209,1                 // vextracti128  $0x1,%ymm10,%xmm9
@@ -43894,7 +44077,7 @@
   .byte  196,65,121,126,76,147,48            // vmovd         %xmm9,0x30(%r11,%rdx,4)
   .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
   .byte  196,65,122,127,84,147,32            // vmovdqu       %xmm10,0x20(%r11,%rdx,4)
-  .byte  233,50,255,255,255                  // jmpq          d4e <_sk_store_bgra_hsw_lowp+0xca>
+  .byte  233,50,255,255,255                  // jmpq          d7e <_sk_store_bgra_hsw_lowp+0xca>
   .byte  90                                  // pop           %rdx
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -43937,11 +44120,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,45                              // jne           e8f <_sk_load_a8_hsw_lowp+0x37>
+  .byte  117,45                              // jne           ebf <_sk_load_a8_hsw_lowp+0x37>
   .byte  196,193,122,111,4,19                // vmovdqu       (%r11,%rdx,1),%xmm0
   .byte  196,226,125,48,192                  // vpmovzxbw     %xmm0,%ymm0
   .byte  197,253,113,240,8                   // vpsllw        $0x8,%ymm0,%ymm0
-  .byte  196,226,125,121,13,199,21,0,0       // vpbroadcastw  0x15c7(%rip),%ymm1        # 2442 <_sk_xor__hsw_lowp+0x33e>
+  .byte  196,226,125,121,13,215,21,0,0       // vpbroadcastw  0x15d7(%rip),%ymm1        # 2482 <_sk_xor__hsw_lowp+0x34e>
   .byte  197,253,228,217                     // vpmulhuw      %ymm1,%ymm0,%ymm3
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,253,239,192                     // vpxor         %ymm0,%ymm0,%ymm0
@@ -43953,35 +44136,35 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,197                             // ja            e68 <_sk_load_a8_hsw_lowp+0x10>
+  .byte  119,197                             // ja            e98 <_sk_load_a8_hsw_lowp+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,194,0,0,0                 // lea           0xc2(%rip),%r10        # f70 <_sk_load_a8_hsw_lowp+0x118>
+  .byte  76,141,21,194,0,0,0                 // lea           0xc2(%rip),%r10        # fa0 <_sk_load_a8_hsw_lowp+0x118>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  235,166                             // jmp           e68 <_sk_load_a8_hsw_lowp+0x10>
+  .byte  235,166                             // jmp           e98 <_sk_load_a8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,2,2            // vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm0,%xmm0
   .byte  65,15,183,4,19                      // movzwl        (%r11,%rdx,1),%eax
   .byte  197,249,110,200                     // vmovd         %eax,%xmm1
   .byte  196,227,121,14,193,1                // vpblendw      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  235,137                             // jmp           e68 <_sk_load_a8_hsw_lowp+0x10>
+  .byte  235,137                             // jmp           e98 <_sk_load_a8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,6,6            // vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,5,5            // vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,4,4            // vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,193,121,110,12,19               // vmovd         (%r11,%rdx,1),%xmm1
   .byte  196,227,121,2,193,1                 // vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  233,92,255,255,255                  // jmpq          e68 <_sk_load_a8_hsw_lowp+0x10>
+  .byte  233,92,255,255,255                  // jmpq          e98 <_sk_load_a8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,10,10          // vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,9,9            // vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,8,8            // vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,193,122,126,12,19               // vmovq         (%r11,%rdx,1),%xmm1
   .byte  196,227,113,2,192,12                // vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  .byte  233,47,255,255,255                  // jmpq          e68 <_sk_load_a8_hsw_lowp+0x10>
+  .byte  233,47,255,255,255                  // jmpq          e98 <_sk_load_a8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,14,14          // vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,13,13          // vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm0,%xmm0
@@ -43989,7 +44172,7 @@
   .byte  196,193,122,126,12,19               // vmovq         (%r11,%rdx,1),%xmm1
   .byte  196,195,113,34,76,19,8,2            // vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm1,%xmm1
   .byte  196,227,113,2,192,8                 // vpblendd      $0x8,%xmm0,%xmm1,%xmm0
-  .byte  233,250,254,255,255                 // jmpq          e68 <_sk_load_a8_hsw_lowp+0x10>
+  .byte  233,250,254,255,255                 // jmpq          e98 <_sk_load_a8_hsw_lowp+0x10>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  71,255                              // rex.RXB       (bad)
   .byte  255                                 // (bad)
@@ -44001,7 +44184,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  123,255                             // jnp           f85 <_sk_load_a8_hsw_lowp+0x12d>
+  .byte  123,255                             // jnp           fb5 <_sk_load_a8_hsw_lowp+0x12d>
   .byte  255                                 // (bad)
   .byte  255,111,255                         // ljmp          *-0x1(%rdi)
   .byte  255                                 // (bad)
@@ -44033,11 +44216,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,45                              // jne           fe3 <_sk_load_a8_dst_hsw_lowp+0x37>
+  .byte  117,45                              // jne           1013 <_sk_load_a8_dst_hsw_lowp+0x37>
   .byte  196,193,122,111,36,19               // vmovdqu       (%r11,%rdx,1),%xmm4
   .byte  196,226,125,48,228                  // vpmovzxbw     %xmm4,%ymm4
   .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
-  .byte  196,226,125,121,45,117,20,0,0       // vpbroadcastw  0x1475(%rip),%ymm5        # 2444 <_sk_xor__hsw_lowp+0x340>
+  .byte  196,226,125,121,45,133,20,0,0       // vpbroadcastw  0x1485(%rip),%ymm5        # 2484 <_sk_xor__hsw_lowp+0x350>
   .byte  197,221,228,253                     // vpmulhuw      %ymm5,%ymm4,%ymm7
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,221,239,228                     // vpxor         %ymm4,%ymm4,%ymm4
@@ -44049,35 +44232,35 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,197                             // ja            fbc <_sk_load_a8_dst_hsw_lowp+0x10>
+  .byte  119,197                             // ja            fec <_sk_load_a8_dst_hsw_lowp+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,194,0,0,0                 // lea           0xc2(%rip),%r10        # 10c4 <_sk_load_a8_dst_hsw_lowp+0x118>
+  .byte  76,141,21,194,0,0,0                 // lea           0xc2(%rip),%r10        # 10f4 <_sk_load_a8_dst_hsw_lowp+0x118>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  235,166                             // jmp           fbc <_sk_load_a8_dst_hsw_lowp+0x10>
+  .byte  235,166                             // jmp           fec <_sk_load_a8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,2,2            // vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm4,%xmm4
   .byte  65,15,183,4,19                      // movzwl        (%r11,%rdx,1),%eax
   .byte  197,249,110,232                     // vmovd         %eax,%xmm5
   .byte  196,227,89,14,229,1                 // vpblendw      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  235,137                             // jmp           fbc <_sk_load_a8_dst_hsw_lowp+0x10>
+  .byte  235,137                             // jmp           fec <_sk_load_a8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,6,6            // vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,5,5            // vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,4,4            // vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,193,121,110,44,19               // vmovd         (%r11,%rdx,1),%xmm5
   .byte  196,227,89,2,229,1                  // vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  233,92,255,255,255                  // jmpq          fbc <_sk_load_a8_dst_hsw_lowp+0x10>
+  .byte  233,92,255,255,255                  // jmpq          fec <_sk_load_a8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,10,10          // vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,9,9            // vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,8,8            // vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,193,122,126,44,19               // vmovq         (%r11,%rdx,1),%xmm5
   .byte  196,227,81,2,228,12                 // vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  .byte  233,47,255,255,255                  // jmpq          fbc <_sk_load_a8_dst_hsw_lowp+0x10>
+  .byte  233,47,255,255,255                  // jmpq          fec <_sk_load_a8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,14,14          // vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,13,13          // vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm4,%xmm4
@@ -44085,7 +44268,7 @@
   .byte  196,193,122,126,44,19               // vmovq         (%r11,%rdx,1),%xmm5
   .byte  196,195,81,34,108,19,8,2            // vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm5,%xmm5
   .byte  196,227,81,2,228,8                  // vpblendd      $0x8,%xmm4,%xmm5,%xmm4
-  .byte  233,250,254,255,255                 // jmpq          fbc <_sk_load_a8_dst_hsw_lowp+0x10>
+  .byte  233,250,254,255,255                 // jmpq          fec <_sk_load_a8_dst_hsw_lowp+0x10>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  71,255                              // rex.RXB       (bad)
   .byte  255                                 // (bad)
@@ -44097,7 +44280,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  123,255                             // jnp           10d9 <_sk_load_a8_dst_hsw_lowp+0x12d>
+  .byte  123,255                             // jnp           1109 <_sk_load_a8_dst_hsw_lowp+0x12d>
   .byte  255                                 // (bad)
   .byte  255,111,255                         // ljmp          *-0x1(%rdi)
   .byte  255                                 // (bad)
@@ -44132,7 +44315,7 @@
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,65,57,103,193                   // vpackuswb     %xmm9,%xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           1124 <_sk_store_a8_hsw_lowp+0x24>
+  .byte  117,10                              // jne           1154 <_sk_store_a8_hsw_lowp+0x24>
   .byte  196,65,122,127,4,19                 // vmovdqu       %xmm8,(%r11,%rdx,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -44140,32 +44323,32 @@
   .byte  65,128,225,15                       // and           $0xf,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,236                             // ja            1120 <_sk_store_a8_hsw_lowp+0x20>
+  .byte  119,236                             // ja            1150 <_sk_store_a8_hsw_lowp+0x20>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,137,0,0,0                 // lea           0x89(%rip),%r10        # 11c8 <_sk_store_a8_hsw_lowp+0xc8>
+  .byte  76,141,21,137,0,0,0                 // lea           0x89(%rip),%r10        # 11f8 <_sk_store_a8_hsw_lowp+0xc8>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,67,121,20,4,19,0                // vpextrb       $0x0,%xmm8,(%r11,%rdx,1)
-  .byte  235,207                             // jmp           1120 <_sk_store_a8_hsw_lowp+0x20>
+  .byte  235,207                             // jmp           1150 <_sk_store_a8_hsw_lowp+0x20>
   .byte  196,67,121,20,68,19,2,2             // vpextrb       $0x2,%xmm8,0x2(%r11,%rdx,1)
   .byte  196,67,121,21,4,19,0                // vpextrw       $0x0,%xmm8,(%r11,%rdx,1)
-  .byte  235,190                             // jmp           1120 <_sk_store_a8_hsw_lowp+0x20>
+  .byte  235,190                             // jmp           1150 <_sk_store_a8_hsw_lowp+0x20>
   .byte  196,67,121,20,68,19,6,6             // vpextrb       $0x6,%xmm8,0x6(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,5,5             // vpextrb       $0x5,%xmm8,0x5(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,4,4             // vpextrb       $0x4,%xmm8,0x4(%r11,%rdx,1)
   .byte  196,65,121,126,4,19                 // vmovd         %xmm8,(%r11,%rdx,1)
-  .byte  235,158                             // jmp           1120 <_sk_store_a8_hsw_lowp+0x20>
+  .byte  235,158                             // jmp           1150 <_sk_store_a8_hsw_lowp+0x20>
   .byte  196,67,121,20,68,19,10,10           // vpextrb       $0xa,%xmm8,0xa(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,9,9             // vpextrb       $0x9,%xmm8,0x9(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,8,8             // vpextrb       $0x8,%xmm8,0x8(%r11,%rdx,1)
-  .byte  235,32                              // jmp           11bc <_sk_store_a8_hsw_lowp+0xbc>
+  .byte  235,32                              // jmp           11ec <_sk_store_a8_hsw_lowp+0xbc>
   .byte  196,67,121,20,68,19,14,14           // vpextrb       $0xe,%xmm8,0xe(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,13,13           // vpextrb       $0xd,%xmm8,0xd(%r11,%rdx,1)
   .byte  196,67,121,20,68,19,12,12           // vpextrb       $0xc,%xmm8,0xc(%r11,%rdx,1)
   .byte  196,67,121,22,68,19,8,2             // vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,1)
   .byte  196,65,121,214,4,19                 // vmovq         %xmm8,(%r11,%rdx,1)
-  .byte  233,89,255,255,255                  // jmpq          1120 <_sk_store_a8_hsw_lowp+0x20>
+  .byte  233,89,255,255,255                  // jmpq          1150 <_sk_store_a8_hsw_lowp+0x20>
   .byte  144                                 // nop
   .byte  128,255,255                         // cmp           $0xff,%bh
   .byte  255,145,255,255,255,137             // callq         *-0x76000001(%rcx)
@@ -44208,14 +44391,14 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,50                              // jne           1240 <_sk_load_g8_hsw_lowp+0x3c>
+  .byte  117,50                              // jne           1270 <_sk_load_g8_hsw_lowp+0x3c>
   .byte  196,193,122,111,4,19                // vmovdqu       (%r11,%rdx,1),%xmm0
   .byte  196,226,125,48,192                  // vpmovzxbw     %xmm0,%ymm0
   .byte  197,253,113,240,8                   // vpsllw        $0x8,%ymm0,%ymm0
-  .byte  196,226,125,121,13,31,18,0,0        // vpbroadcastw  0x121f(%rip),%ymm1        # 2446 <_sk_xor__hsw_lowp+0x342>
+  .byte  196,226,125,121,13,47,18,0,0        // vpbroadcastw  0x122f(%rip),%ymm1        # 2486 <_sk_xor__hsw_lowp+0x352>
   .byte  197,253,228,193                     // vpmulhuw      %ymm1,%ymm0,%ymm0
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,121,29,18,18,0,0        // vpbroadcastw  0x1212(%rip),%ymm3        # 2448 <_sk_xor__hsw_lowp+0x344>
+  .byte  196,226,125,121,29,34,18,0,0        // vpbroadcastw  0x1222(%rip),%ymm3        # 2488 <_sk_xor__hsw_lowp+0x354>
   .byte  197,253,111,200                     // vmovdqa       %ymm0,%ymm1
   .byte  197,253,111,208                     // vmovdqa       %ymm0,%ymm2
   .byte  255,224                             // jmpq          *%rax
@@ -44224,35 +44407,35 @@
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,192                             // ja            1214 <_sk_load_g8_hsw_lowp+0x10>
+  .byte  119,192                             // ja            1244 <_sk_load_g8_hsw_lowp+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,193,0,0,0                 // lea           0xc1(%rip),%r10        # 1320 <_sk_load_g8_hsw_lowp+0x11c>
+  .byte  76,141,21,193,0,0,0                 // lea           0xc1(%rip),%r10        # 1350 <_sk_load_g8_hsw_lowp+0x11c>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,192                     // vmovd         %eax,%xmm0
-  .byte  235,161                             // jmp           1214 <_sk_load_g8_hsw_lowp+0x10>
+  .byte  235,161                             // jmp           1244 <_sk_load_g8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,2,2            // vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm0,%xmm0
   .byte  65,15,183,4,19                      // movzwl        (%r11,%rdx,1),%eax
   .byte  197,249,110,200                     // vmovd         %eax,%xmm1
   .byte  196,227,121,14,193,1                // vpblendw      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  235,132                             // jmp           1214 <_sk_load_g8_hsw_lowp+0x10>
+  .byte  235,132                             // jmp           1244 <_sk_load_g8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,6,6            // vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,5,5            // vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,4,4            // vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,193,121,110,12,19               // vmovd         (%r11,%rdx,1),%xmm1
   .byte  196,227,121,2,193,1                 // vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  .byte  233,87,255,255,255                  // jmpq          1214 <_sk_load_g8_hsw_lowp+0x10>
+  .byte  233,87,255,255,255                  // jmpq          1244 <_sk_load_g8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,10,10          // vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,9,9            // vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,8,8            // vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,193,122,126,12,19               // vmovq         (%r11,%rdx,1),%xmm1
   .byte  196,227,113,2,192,12                // vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  .byte  233,42,255,255,255                  // jmpq          1214 <_sk_load_g8_hsw_lowp+0x10>
+  .byte  233,42,255,255,255                  // jmpq          1244 <_sk_load_g8_hsw_lowp+0x10>
   .byte  197,249,239,192                     // vpxor         %xmm0,%xmm0,%xmm0
   .byte  196,195,121,32,68,19,14,14          // vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm0,%xmm0
   .byte  196,195,121,32,68,19,13,13          // vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm0,%xmm0
@@ -44260,7 +44443,7 @@
   .byte  196,193,122,126,12,19               // vmovq         (%r11,%rdx,1),%xmm1
   .byte  196,195,113,34,76,19,8,2            // vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm1,%xmm1
   .byte  196,227,113,2,192,8                 // vpblendd      $0x8,%xmm0,%xmm1,%xmm0
-  .byte  233,245,254,255,255                 // jmpq          1214 <_sk_load_g8_hsw_lowp+0x10>
+  .byte  233,245,254,255,255                 // jmpq          1244 <_sk_load_g8_hsw_lowp+0x10>
   .byte  144                                 // nop
   .byte  72,255                              // rex.W         (bad)
   .byte  255                                 // (bad)
@@ -44271,7 +44454,7 @@
   .byte  255,140,255,255,255,132,255         // decl          -0x7b0001(%rdi,%rdi,8)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  124,255                             // jl            1335 <_sk_load_g8_hsw_lowp+0x131>
+  .byte  124,255                             // jl            1365 <_sk_load_g8_hsw_lowp+0x131>
   .byte  255                                 // (bad)
   .byte  255,112,255                         // pushq         -0x1(%rax)
   .byte  255                                 // (bad)
@@ -44303,14 +44486,14 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,50                              // jne           1398 <_sk_load_g8_dst_hsw_lowp+0x3c>
+  .byte  117,50                              // jne           13c8 <_sk_load_g8_dst_hsw_lowp+0x3c>
   .byte  196,193,122,111,36,19               // vmovdqu       (%r11,%rdx,1),%xmm4
   .byte  196,226,125,48,228                  // vpmovzxbw     %xmm4,%ymm4
   .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
-  .byte  196,226,125,121,45,203,16,0,0       // vpbroadcastw  0x10cb(%rip),%ymm5        # 244a <_sk_xor__hsw_lowp+0x346>
+  .byte  196,226,125,121,45,219,16,0,0       // vpbroadcastw  0x10db(%rip),%ymm5        # 248a <_sk_xor__hsw_lowp+0x356>
   .byte  197,221,228,229                     // vpmulhuw      %ymm5,%ymm4,%ymm4
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  196,226,125,121,61,190,16,0,0       // vpbroadcastw  0x10be(%rip),%ymm7        # 244c <_sk_xor__hsw_lowp+0x348>
+  .byte  196,226,125,121,61,206,16,0,0       // vpbroadcastw  0x10ce(%rip),%ymm7        # 248c <_sk_xor__hsw_lowp+0x358>
   .byte  197,253,111,236                     // vmovdqa       %ymm4,%ymm5
   .byte  197,253,111,244                     // vmovdqa       %ymm4,%ymm6
   .byte  255,224                             // jmpq          *%rax
@@ -44319,35 +44502,35 @@
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,192                             // ja            136c <_sk_load_g8_dst_hsw_lowp+0x10>
+  .byte  119,192                             // ja            139c <_sk_load_g8_dst_hsw_lowp+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,193,0,0,0                 // lea           0xc1(%rip),%r10        # 1478 <_sk_load_g8_dst_hsw_lowp+0x11c>
+  .byte  76,141,21,193,0,0,0                 // lea           0xc1(%rip),%r10        # 14a8 <_sk_load_g8_dst_hsw_lowp+0x11c>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,249,110,224                     // vmovd         %eax,%xmm4
-  .byte  235,161                             // jmp           136c <_sk_load_g8_dst_hsw_lowp+0x10>
+  .byte  235,161                             // jmp           139c <_sk_load_g8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,2,2            // vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm4,%xmm4
   .byte  65,15,183,4,19                      // movzwl        (%r11,%rdx,1),%eax
   .byte  197,249,110,232                     // vmovd         %eax,%xmm5
   .byte  196,227,89,14,229,1                 // vpblendw      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  235,132                             // jmp           136c <_sk_load_g8_dst_hsw_lowp+0x10>
+  .byte  235,132                             // jmp           139c <_sk_load_g8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,6,6            // vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,5,5            // vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,4,4            // vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,193,121,110,44,19               // vmovd         (%r11,%rdx,1),%xmm5
   .byte  196,227,89,2,229,1                  // vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  .byte  233,87,255,255,255                  // jmpq          136c <_sk_load_g8_dst_hsw_lowp+0x10>
+  .byte  233,87,255,255,255                  // jmpq          139c <_sk_load_g8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,10,10          // vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,9,9            // vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,8,8            // vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,193,122,126,44,19               // vmovq         (%r11,%rdx,1),%xmm5
   .byte  196,227,81,2,228,12                 // vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  .byte  233,42,255,255,255                  // jmpq          136c <_sk_load_g8_dst_hsw_lowp+0x10>
+  .byte  233,42,255,255,255                  // jmpq          139c <_sk_load_g8_dst_hsw_lowp+0x10>
   .byte  197,217,239,228                     // vpxor         %xmm4,%xmm4,%xmm4
   .byte  196,195,89,32,100,19,14,14          // vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm4,%xmm4
   .byte  196,195,89,32,100,19,13,13          // vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm4,%xmm4
@@ -44355,7 +44538,7 @@
   .byte  196,193,122,126,44,19               // vmovq         (%r11,%rdx,1),%xmm5
   .byte  196,195,81,34,108,19,8,2            // vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm5,%xmm5
   .byte  196,227,81,2,228,8                  // vpblendd      $0x8,%xmm4,%xmm5,%xmm4
-  .byte  233,245,254,255,255                 // jmpq          136c <_sk_load_g8_dst_hsw_lowp+0x10>
+  .byte  233,245,254,255,255                 // jmpq          139c <_sk_load_g8_dst_hsw_lowp+0x10>
   .byte  144                                 // nop
   .byte  72,255                              // rex.W         (bad)
   .byte  255                                 // (bad)
@@ -44366,7 +44549,7 @@
   .byte  255,140,255,255,255,132,255         // decl          -0x7b0001(%rdi,%rdi,8)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  124,255                             // jl            148d <_sk_load_g8_dst_hsw_lowp+0x131>
+  .byte  124,255                             // jl            14bd <_sk_load_g8_dst_hsw_lowp+0x131>
   .byte  255                                 // (bad)
   .byte  255,112,255                         // pushq         -0x1(%rax)
   .byte  255                                 // (bad)
@@ -44398,20 +44581,20 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,220,1,0,0                    // jne           169e <_sk_srcover_rgba_8888_hsw_lowp+0x1ea>
+  .byte  15,133,220,1,0,0                    // jne           16ce <_sk_srcover_rgba_8888_hsw_lowp+0x1ea>
   .byte  196,193,126,111,124,147,32          // vmovdqu       0x20(%r11,%rdx,4),%ymm7
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
-  .byte  197,253,111,37,137,15,0,0           // vmovdqa       0xf89(%rip),%ymm4        # 2460 <_sk_xor__hsw_lowp+0x35c>
+  .byte  197,253,111,37,153,15,0,0           // vmovdqa       0xf99(%rip),%ymm4        # 24a0 <_sk_xor__hsw_lowp+0x36c>
   .byte  196,226,61,0,236                    // vpshufb       %ymm4,%ymm8,%ymm5
   .byte  196,227,253,0,237,232               // vpermq        $0xe8,%ymm5,%ymm5
   .byte  196,226,69,0,228                    // vpshufb       %ymm4,%ymm7,%ymm4
   .byte  196,227,253,0,228,232               // vpermq        $0xe8,%ymm4,%ymm4
   .byte  196,227,85,56,228,1                 // vinserti128   $0x1,%xmm4,%ymm5,%ymm4
-  .byte  196,98,125,121,13,132,15,0,0        // vpbroadcastw  0xf84(%rip),%ymm9        # 2480 <_sk_xor__hsw_lowp+0x37c>
+  .byte  196,98,125,121,13,148,15,0,0        // vpbroadcastw  0xf94(%rip),%ymm9        # 24c0 <_sk_xor__hsw_lowp+0x38c>
   .byte  197,221,113,244,8                   // vpsllw        $0x8,%ymm4,%ymm4
-  .byte  196,98,125,121,21,120,15,0,0        // vpbroadcastw  0xf78(%rip),%ymm10        # 2482 <_sk_xor__hsw_lowp+0x37e>
+  .byte  196,98,125,121,21,136,15,0,0        // vpbroadcastw  0xf88(%rip),%ymm10        # 24c2 <_sk_xor__hsw_lowp+0x38e>
   .byte  196,193,93,228,226                  // vpmulhuw      %ymm10,%ymm4,%ymm4
-  .byte  197,253,111,45,137,15,0,0           // vmovdqa       0xf89(%rip),%ymm5        # 24a0 <_sk_xor__hsw_lowp+0x39c>
+  .byte  197,253,111,45,153,15,0,0           // vmovdqa       0xf99(%rip),%ymm5        # 24e0 <_sk_xor__hsw_lowp+0x3ac>
   .byte  196,226,61,0,245                    // vpshufb       %ymm5,%ymm8,%ymm6
   .byte  196,227,253,0,246,232               // vpermq        $0xe8,%ymm6,%ymm6
   .byte  196,226,69,0,237                    // vpshufb       %ymm5,%ymm7,%ymm5
@@ -44419,7 +44602,7 @@
   .byte  196,227,77,56,237,1                 // vinserti128   $0x1,%xmm5,%ymm6,%ymm5
   .byte  197,213,113,245,8                   // vpsllw        $0x8,%ymm5,%ymm5
   .byte  196,193,85,228,234                  // vpmulhuw      %ymm10,%ymm5,%ymm5
-  .byte  197,253,111,53,123,15,0,0           // vmovdqa       0xf7b(%rip),%ymm6        # 24c0 <_sk_xor__hsw_lowp+0x3bc>
+  .byte  197,253,111,53,139,15,0,0           // vmovdqa       0xf8b(%rip),%ymm6        # 2500 <_sk_xor__hsw_lowp+0x3cc>
   .byte  196,98,61,0,222                     // vpshufb       %ymm6,%ymm8,%ymm11
   .byte  196,67,253,0,219,232                // vpermq        $0xe8,%ymm11,%ymm11
   .byte  196,226,69,0,246                    // vpshufb       %ymm6,%ymm7,%ymm6
@@ -44427,7 +44610,7 @@
   .byte  196,227,37,56,246,1                 // vinserti128   $0x1,%xmm6,%ymm11,%ymm6
   .byte  197,205,113,246,8                   // vpsllw        $0x8,%ymm6,%ymm6
   .byte  196,193,77,228,242                  // vpmulhuw      %ymm10,%ymm6,%ymm6
-  .byte  197,125,111,29,109,15,0,0           // vmovdqa       0xf6d(%rip),%ymm11        # 24e0 <_sk_xor__hsw_lowp+0x3dc>
+  .byte  197,125,111,29,125,15,0,0           // vmovdqa       0xf7d(%rip),%ymm11        # 2520 <_sk_xor__hsw_lowp+0x3ec>
   .byte  196,66,61,0,195                     // vpshufb       %ymm11,%ymm8,%ymm8
   .byte  196,67,253,0,192,232                // vpermq        $0xe8,%ymm8,%ymm8
   .byte  196,194,69,0,251                    // vpshufb       %ymm11,%ymm7,%ymm7
@@ -44435,7 +44618,7 @@
   .byte  196,227,61,56,255,1                 // vinserti128   $0x1,%xmm7,%ymm8,%ymm7
   .byte  197,197,113,247,8                   // vpsllw        $0x8,%ymm7,%ymm7
   .byte  196,193,69,228,250                  // vpmulhuw      %ymm10,%ymm7,%ymm7
-  .byte  196,98,125,121,5,94,15,0,0          // vpbroadcastw  0xf5e(%rip),%ymm8        # 2500 <_sk_xor__hsw_lowp+0x3fc>
+  .byte  196,98,125,121,5,110,15,0,0         // vpbroadcastw  0xf6e(%rip),%ymm8        # 2540 <_sk_xor__hsw_lowp+0x40c>
   .byte  197,61,249,195                      // vpsubw        %ymm3,%ymm8,%ymm8
   .byte  196,66,93,11,208                    // vpmulhrsw     %ymm8,%ymm4,%ymm10
   .byte  196,66,125,29,210                   // vpabsw        %ymm10,%ymm10
@@ -44482,7 +44665,7 @@
   .byte  196,65,13,235,193                   // vpor          %ymm9,%ymm14,%ymm8
   .byte  196,65,37,235,192                   // vpor          %ymm8,%ymm11,%ymm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,77                              // jne           16da <_sk_srcover_rgba_8888_hsw_lowp+0x226>
+  .byte  117,77                              // jne           170a <_sk_srcover_rgba_8888_hsw_lowp+0x226>
   .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
   .byte  196,65,126,127,84,147,32            // vmovdqu       %ymm10,0x20(%r11,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -44493,26 +44676,26 @@
   .byte  196,65,61,239,192                   // vpxor         %ymm8,%ymm8,%ymm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  15,135,20,254,255,255               // ja            14cf <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  .byte  15,135,20,254,255,255               // ja            14ff <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,238,1,0,0                 // lea           0x1ee(%rip),%r10        # 18b4 <_sk_srcover_rgba_8888_hsw_lowp+0x400>
+  .byte  76,141,21,238,1,0,0                 // lea           0x1ee(%rip),%r10        # 18e4 <_sk_srcover_rgba_8888_hsw_lowp+0x400>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,110,4,147                // vmovd         (%r11,%rdx,4),%xmm8
-  .byte  233,245,253,255,255                 // jmpq          14cf <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  .byte  233,245,253,255,255                 // jmpq          14ff <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,15                       // and           $0xf,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,176                             // ja            169a <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  .byte  119,176                             // ja            16ca <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   .byte  65,15,182,193                       // movzbl        %r9b,%eax
-  .byte  76,141,13,251,1,0,0                 // lea           0x1fb(%rip),%r9        # 18f0 <_sk_srcover_rgba_8888_hsw_lowp+0x43c>
+  .byte  76,141,13,251,1,0,0                 // lea           0x1fb(%rip),%r9        # 1920 <_sk_srcover_rgba_8888_hsw_lowp+0x43c>
   .byte  73,99,4,129                         // movslq        (%r9,%rax,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  196,65,121,126,4,147                // vmovd         %xmm8,(%r11,%rdx,4)
-  .byte  235,148                             // jmp           169a <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  .byte  235,148                             // jmp           16ca <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   .byte  196,193,121,110,100,147,8           // vmovd         0x8(%r11,%rdx,4),%xmm4
   .byte  196,226,121,89,228                  // vpbroadcastq  %xmm4,%xmm4
   .byte  197,197,239,255                     // vpxor         %ymm7,%ymm7,%ymm7
@@ -44520,7 +44703,7 @@
   .byte  196,194,121,53,36,147               // vpmovzxdq     (%r11,%rdx,4),%xmm4
   .byte  197,249,112,228,232                 // vpshufd       $0xe8,%xmm4,%xmm4
   .byte  196,99,61,2,196,3                   // vpblendd      $0x3,%ymm4,%ymm8,%ymm8
-  .byte  233,157,253,255,255                 // jmpq          14cf <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  .byte  233,157,253,255,255                 // jmpq          14ff <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   .byte  196,193,121,110,100,147,24          // vmovd         0x18(%r11,%rdx,4),%xmm4
   .byte  196,226,125,89,228                  // vpbroadcastq  %xmm4,%ymm4
   .byte  197,197,239,255                     // vpxor         %ymm7,%ymm7,%ymm7
@@ -44533,7 +44716,7 @@
   .byte  196,99,61,56,196,1                  // vinserti128   $0x1,%xmm4,%ymm8,%ymm8
   .byte  196,193,122,111,36,147              // vmovdqu       (%r11,%rdx,4),%xmm4
   .byte  196,67,93,2,192,240                 // vpblendd      $0xf0,%ymm8,%ymm4,%ymm8
-  .byte  233,78,253,255,255                  // jmpq          14cf <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  .byte  233,78,253,255,255                  // jmpq          14ff <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   .byte  196,193,121,110,100,147,40          // vmovd         0x28(%r11,%rdx,4),%xmm4
   .byte  196,226,121,89,228                  // vpbroadcastq  %xmm4,%xmm4
   .byte  197,213,239,237                     // vpxor         %ymm5,%ymm5,%ymm5
@@ -44542,7 +44725,7 @@
   .byte  196,227,69,2,252,15                 // vpblendd      $0xf,%ymm4,%ymm7,%ymm7
   .byte  196,193,121,110,100,147,32          // vmovd         0x20(%r11,%rdx,4),%xmm4
   .byte  196,227,69,2,252,1                  // vpblendd      $0x1,%ymm4,%ymm7,%ymm7
-  .byte  233,18,253,255,255                  // jmpq          14c9 <_sk_srcover_rgba_8888_hsw_lowp+0x15>
+  .byte  233,18,253,255,255                  // jmpq          14f9 <_sk_srcover_rgba_8888_hsw_lowp+0x15>
   .byte  196,193,121,110,100,147,56          // vmovd         0x38(%r11,%rdx,4),%xmm4
   .byte  196,226,125,89,228                  // vpbroadcastq  %xmm4,%ymm4
   .byte  197,213,239,237                     // vpxor         %ymm5,%ymm5,%ymm5
@@ -44556,10 +44739,10 @@
   .byte  196,65,126,111,4,147                // vmovdqu       (%r11,%rdx,4),%ymm8
   .byte  196,193,122,111,100,147,32          // vmovdqu       0x20(%r11,%rdx,4),%xmm4
   .byte  196,227,93,2,255,240                // vpblendd      $0xf0,%ymm7,%ymm4,%ymm7
-  .byte  233,194,252,255,255                 // jmpq          14cf <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  .byte  233,194,252,255,255                 // jmpq          14ff <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   .byte  196,67,121,22,68,147,8,2            // vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,4)
   .byte  196,65,121,214,4,147                // vmovq         %xmm8,(%r11,%rdx,4)
-  .byte  233,122,254,255,255                 // jmpq          169a <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  .byte  233,122,254,255,255                 // jmpq          16ca <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,67,121,22,76,147,24,2           // vpextrd       $0x2,%xmm9,0x18(%r11,%rdx,4)
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
@@ -44567,12 +44750,12 @@
   .byte  196,67,125,57,193,1                 // vextracti128  $0x1,%ymm8,%xmm9
   .byte  196,65,121,126,76,147,16            // vmovd         %xmm9,0x10(%r11,%rdx,4)
   .byte  196,65,122,127,4,147                // vmovdqu       %xmm8,(%r11,%rdx,4)
-  .byte  233,70,254,255,255                  // jmpq          169a <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  .byte  233,70,254,255,255                  // jmpq          16ca <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   .byte  196,67,121,22,84,147,40,2           // vpextrd       $0x2,%xmm10,0x28(%r11,%rdx,4)
   .byte  196,67,121,22,84,147,36,1           // vpextrd       $0x1,%xmm10,0x24(%r11,%rdx,4)
   .byte  196,65,121,126,84,147,32            // vmovd         %xmm10,0x20(%r11,%rdx,4)
   .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
-  .byte  233,36,254,255,255                  // jmpq          169a <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  .byte  233,36,254,255,255                  // jmpq          16ca <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   .byte  196,67,125,57,209,1                 // vextracti128  $0x1,%ymm10,%xmm9
   .byte  196,67,121,22,76,147,56,2           // vpextrd       $0x2,%xmm9,0x38(%r11,%rdx,4)
   .byte  196,67,125,57,209,1                 // vextracti128  $0x1,%ymm10,%xmm9
@@ -44581,7 +44764,7 @@
   .byte  196,65,121,126,76,147,48            // vmovd         %xmm9,0x30(%r11,%rdx,4)
   .byte  196,65,126,127,4,147                // vmovdqu       %ymm8,(%r11,%rdx,4)
   .byte  196,65,122,127,84,147,32            // vmovdqu       %xmm10,0x20(%r11,%rdx,4)
-  .byte  233,233,253,255,255                 // jmpq          169a <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  .byte  233,233,253,255,255                 // jmpq          16ca <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  27,254                              // sbb           %esi,%edi
   .byte  255                                 // (bad)
@@ -44595,7 +44778,7 @@
   .byte  255                                 // (bad)
   .byte  255,148,254,255,255,126,254         // callq         *-0x1810001(%rsi,%rdi,8)
   .byte  255                                 // (bad)
-  .byte  255,21,252,255,255,241              // callq         *-0xe000004(%rip)        # fffffffff20018d1 <_sk_xor__hsw_lowp+0xfffffffff1fff7cd>
+  .byte  255,21,252,255,255,241              // callq         *-0xe000004(%rip)        # fffffffff2001901 <_sk_xor__hsw_lowp+0xfffffffff1fff7cd>
   .byte  254                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,227                             // jmpq          *%rbx
@@ -44606,7 +44789,7 @@
   .byte  255                                 // (bad)
   .byte  255,65,255                          // incl          -0x1(%rcx)
   .byte  255                                 // (bad)
-  .byte  255,45,255,255,255,25               // ljmp          *0x19ffffff(%rip)        # 1a0018e8 <_sk_xor__hsw_lowp+0x19fff7e4>
+  .byte  255,45,255,255,255,25               // ljmp          *0x19ffffff(%rip)        # 1a001918 <_sk_xor__hsw_lowp+0x19fff7e4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,3                               // incl          (%rbx)
@@ -44615,7 +44798,7 @@
   .byte  255,14                              // decl          (%rsi)
   .byte  254                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  255,37,255,255,255,29               // jmpq          *0x1dffffff(%rip)        # 1e0018f8 <_sk_xor__hsw_lowp+0x1dfff7f4>
+  .byte  255,37,255,255,255,29               // jmpq          *0x1dffffff(%rip)        # 1e001928 <_sk_xor__hsw_lowp+0x1dfff7f4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,89,255                          // lcall         *-0x1(%rcx)
@@ -44628,7 +44811,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  123,255                             // jnp           190d <_sk_srcover_rgba_8888_hsw_lowp+0x459>
+  .byte  123,255                             // jnp           193d <_sk_srcover_rgba_8888_hsw_lowp+0x459>
   .byte  255                                 // (bad)
   .byte  255,116,255,255                     // pushq         -0x1(%rdi,%rdi,8)
   .byte  255,108,255,255                     // ljmp          *-0x1(%rdi,%rdi,8)
@@ -44646,7 +44829,7 @@
 _sk_scale_1_float_hsw_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,122,16,0                        // vmovss        (%rax),%xmm8
-  .byte  197,58,88,5,74,8,0,0                // vaddss        0x84a(%rip),%xmm8,%xmm8        # 2184 <_sk_xor__hsw_lowp+0x80>
+  .byte  197,58,88,5,74,8,0,0                // vaddss        0x84a(%rip),%xmm8,%xmm8        # 21b4 <_sk_xor__hsw_lowp+0x80>
   .byte  197,121,126,192                     // vmovd         %xmm8,%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
   .byte  196,66,125,121,192                  // vpbroadcastw  %xmm8,%ymm8
@@ -44668,11 +44851,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,75                              // jne           19c8 <_sk_scale_u8_hsw_lowp+0x55>
+  .byte  117,75                              // jne           19f8 <_sk_scale_u8_hsw_lowp+0x55>
   .byte  196,65,122,111,4,19                 // vmovdqu       (%r11,%rdx,1),%xmm8
   .byte  196,66,125,48,192                   // vpmovzxbw     %xmm8,%ymm8
   .byte  196,193,61,113,240,8                // vpsllw        $0x8,%ymm8,%ymm8
-  .byte  196,98,125,121,13,107,11,0,0        // vpbroadcastw  0xb6b(%rip),%ymm9        # 2502 <_sk_xor__hsw_lowp+0x3fe>
+  .byte  196,98,125,121,13,123,11,0,0        // vpbroadcastw  0xb7b(%rip),%ymm9        # 2542 <_sk_xor__hsw_lowp+0x40e>
   .byte  196,65,61,228,193                   // vpmulhuw      %ymm9,%ymm8,%ymm8
   .byte  196,194,125,11,192                  // vpmulhrsw     %ymm8,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
@@ -44689,35 +44872,35 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  119,166                             // ja            1983 <_sk_scale_u8_hsw_lowp+0x10>
+  .byte  119,166                             // ja            19b3 <_sk_scale_u8_hsw_lowp+0x10>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,200,0,0,0                 // lea           0xc8(%rip),%r10        # 1ab0 <_sk_scale_u8_hsw_lowp+0x13d>
+  .byte  76,141,21,200,0,0,0                 // lea           0xc8(%rip),%r10        # 1ae0 <_sk_scale_u8_hsw_lowp+0x13d>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  235,135                             // jmp           1983 <_sk_scale_u8_hsw_lowp+0x10>
+  .byte  235,135                             // jmp           19b3 <_sk_scale_u8_hsw_lowp+0x10>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,2,2              // vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm8,%xmm8
   .byte  65,15,183,4,19                      // movzwl        (%r11,%rdx,1),%eax
   .byte  197,121,110,200                     // vmovd         %eax,%xmm9
   .byte  196,67,57,14,193,1                  // vpblendw      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,102,255,255,255                 // jmpq          1983 <_sk_scale_u8_hsw_lowp+0x10>
+  .byte  233,102,255,255,255                 // jmpq          19b3 <_sk_scale_u8_hsw_lowp+0x10>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,6,6              // vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,5,5              // vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,4,4              // vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,65,121,110,12,19                // vmovd         (%r11,%rdx,1),%xmm9
   .byte  196,67,57,2,193,1                   // vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,56,255,255,255                  // jmpq          1983 <_sk_scale_u8_hsw_lowp+0x10>
+  .byte  233,56,255,255,255                  // jmpq          19b3 <_sk_scale_u8_hsw_lowp+0x10>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,10,10            // vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,9,9              // vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,8,8              // vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,65,122,126,12,19                // vmovq         (%r11,%rdx,1),%xmm9
   .byte  196,67,49,2,192,12                  // vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  .byte  233,10,255,255,255                  // jmpq          1983 <_sk_scale_u8_hsw_lowp+0x10>
+  .byte  233,10,255,255,255                  // jmpq          19b3 <_sk_scale_u8_hsw_lowp+0x10>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,14,14            // vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,13,13            // vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm8,%xmm8
@@ -44725,7 +44908,7 @@
   .byte  196,65,122,126,12,19                // vmovq         (%r11,%rdx,1),%xmm9
   .byte  196,67,49,34,76,19,8,2              // vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm9,%xmm9
   .byte  196,67,49,2,192,8                   // vpblendd      $0x8,%xmm8,%xmm9,%xmm8
-  .byte  233,212,254,255,255                 // jmpq          1983 <_sk_scale_u8_hsw_lowp+0x10>
+  .byte  233,212,254,255,255                 // jmpq          19b3 <_sk_scale_u8_hsw_lowp+0x10>
   .byte  144                                 // nop
   .byte  65,255                              // rex.B         (bad)
   .byte  255                                 // (bad)
@@ -44736,7 +44919,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  122,255                             // jp            1ac5 <_sk_scale_u8_hsw_lowp+0x152>
+  .byte  122,255                             // jp            1af5 <_sk_scale_u8_hsw_lowp+0x152>
   .byte  255                                 // (bad)
   .byte  255,109,255                         // ljmp          *-0x1(%rbp)
   .byte  255                                 // (bad)
@@ -44767,13 +44950,13 @@
 _sk_lerp_1_float_hsw_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  197,122,16,0                        // vmovss        (%rax),%xmm8
-  .byte  197,58,88,5,142,6,0,0               // vaddss        0x68e(%rip),%xmm8,%xmm8        # 2188 <_sk_xor__hsw_lowp+0x84>
+  .byte  197,58,88,5,142,6,0,0               // vaddss        0x68e(%rip),%xmm8,%xmm8        # 21b8 <_sk_xor__hsw_lowp+0x84>
   .byte  197,121,126,192                     // vmovd         %xmm8,%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
   .byte  196,66,125,121,192                  // vpbroadcastw  %xmm8,%ymm8
   .byte  196,194,125,11,192                  // vpmulhrsw     %ymm8,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
-  .byte  196,98,125,121,13,234,9,0,0         // vpbroadcastw  0x9ea(%rip),%ymm9        # 2504 <_sk_xor__hsw_lowp+0x400>
+  .byte  196,98,125,121,13,250,9,0,0         // vpbroadcastw  0x9fa(%rip),%ymm9        # 2544 <_sk_xor__hsw_lowp+0x410>
   .byte  196,65,53,249,200                   // vpsubw        %ymm8,%ymm9,%ymm9
   .byte  196,66,93,11,209                    // vpmulhrsw     %ymm9,%ymm4,%ymm10
   .byte  196,66,125,29,210                   // vpabsw        %ymm10,%ymm10
@@ -44803,15 +44986,15 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,145,0,0,0                    // jne           1c18 <_sk_lerp_u8_hsw_lowp+0x9f>
+  .byte  15,133,145,0,0,0                    // jne           1c48 <_sk_lerp_u8_hsw_lowp+0x9f>
   .byte  196,65,122,111,4,19                 // vmovdqu       (%r11,%rdx,1),%xmm8
   .byte  196,66,125,48,192                   // vpmovzxbw     %xmm8,%ymm8
   .byte  196,193,61,113,240,8                // vpsllw        $0x8,%ymm8,%ymm8
-  .byte  196,98,125,121,13,101,9,0,0         // vpbroadcastw  0x965(%rip),%ymm9        # 2506 <_sk_xor__hsw_lowp+0x402>
+  .byte  196,98,125,121,13,117,9,0,0         // vpbroadcastw  0x975(%rip),%ymm9        # 2546 <_sk_xor__hsw_lowp+0x412>
   .byte  196,65,61,228,193                   // vpmulhuw      %ymm9,%ymm8,%ymm8
   .byte  196,194,125,11,192                  // vpmulhrsw     %ymm8,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
-  .byte  196,98,125,121,13,79,9,0,0          // vpbroadcastw  0x94f(%rip),%ymm9        # 2508 <_sk_xor__hsw_lowp+0x404>
+  .byte  196,98,125,121,13,95,9,0,0          // vpbroadcastw  0x95f(%rip),%ymm9        # 2548 <_sk_xor__hsw_lowp+0x414>
   .byte  196,65,53,249,200                   // vpsubw        %ymm8,%ymm9,%ymm9
   .byte  196,66,93,11,209                    // vpmulhrsw     %ymm9,%ymm4,%ymm10
   .byte  196,66,125,29,210                   // vpabsw        %ymm10,%ymm10
@@ -44838,35 +45021,35 @@
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,14                       // cmp           $0xe,%r9b
-  .byte  15,135,92,255,255,255               // ja            1b8d <_sk_lerp_u8_hsw_lowp+0x14>
+  .byte  15,135,92,255,255,255               // ja            1bbd <_sk_lerp_u8_hsw_lowp+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,204,0,0,0                 // lea           0xcc(%rip),%r10        # 1d08 <_sk_lerp_u8_hsw_lowp+0x18f>
+  .byte  76,141,21,204,0,0,0                 // lea           0xcc(%rip),%r10        # 1d38 <_sk_lerp_u8_hsw_lowp+0x18f>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  197,121,110,192                     // vmovd         %eax,%xmm8
-  .byte  233,58,255,255,255                  // jmpq          1b8d <_sk_lerp_u8_hsw_lowp+0x14>
+  .byte  233,58,255,255,255                  // jmpq          1bbd <_sk_lerp_u8_hsw_lowp+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,2,2              // vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm8,%xmm8
   .byte  65,15,183,4,19                      // movzwl        (%r11,%rdx,1),%eax
   .byte  197,121,110,200                     // vmovd         %eax,%xmm9
   .byte  196,67,57,14,193,1                  // vpblendw      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,25,255,255,255                  // jmpq          1b8d <_sk_lerp_u8_hsw_lowp+0x14>
+  .byte  233,25,255,255,255                  // jmpq          1bbd <_sk_lerp_u8_hsw_lowp+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,6,6              // vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,5,5              // vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,4,4              // vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,65,121,110,12,19                // vmovd         (%r11,%rdx,1),%xmm9
   .byte  196,67,57,2,193,1                   // vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  .byte  233,235,254,255,255                 // jmpq          1b8d <_sk_lerp_u8_hsw_lowp+0x14>
+  .byte  233,235,254,255,255                 // jmpq          1bbd <_sk_lerp_u8_hsw_lowp+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,10,10            // vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,9,9              // vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,8,8              // vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,65,122,126,12,19                // vmovq         (%r11,%rdx,1),%xmm9
   .byte  196,67,49,2,192,12                  // vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  .byte  233,189,254,255,255                 // jmpq          1b8d <_sk_lerp_u8_hsw_lowp+0x14>
+  .byte  233,189,254,255,255                 // jmpq          1bbd <_sk_lerp_u8_hsw_lowp+0x14>
   .byte  196,65,57,239,192                   // vpxor         %xmm8,%xmm8,%xmm8
   .byte  196,67,57,32,68,19,14,14            // vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm8,%xmm8
   .byte  196,67,57,32,68,19,13,13            // vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm8,%xmm8
@@ -44874,7 +45057,7 @@
   .byte  196,65,122,126,12,19                // vmovq         (%r11,%rdx,1),%xmm9
   .byte  196,67,49,34,76,19,8,2              // vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm9,%xmm9
   .byte  196,67,49,2,192,8                   // vpblendd      $0x8,%xmm8,%xmm9,%xmm8
-  .byte  233,135,254,255,255                 // jmpq          1b8d <_sk_lerp_u8_hsw_lowp+0x14>
+  .byte  233,135,254,255,255                 // jmpq          1bbd <_sk_lerp_u8_hsw_lowp+0x14>
   .byte  102,144                             // xchg          %ax,%ax
   .byte  61,255,255,255,88                   // cmp           $0x58ffffff,%eax
   .byte  255                                 // (bad)
@@ -44885,7 +45068,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  121,255                             // jns           1d1d <_sk_lerp_u8_hsw_lowp+0x1a4>
+  .byte  121,255                             // jns           1d4d <_sk_lerp_u8_hsw_lowp+0x1a4>
   .byte  255                                 // (bad)
   .byte  255,108,255,255                     // ljmp          *-0x1(%rdi,%rdi,8)
   .byte  255,183,255,255,255,175             // pushq         -0x50000001(%rdi)
@@ -44957,7 +45140,7 @@
 _sk_srcatop_hsw_lowp:
   .byte  196,226,125,11,199                  // vpmulhrsw     %ymm7,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
-  .byte  196,98,125,121,5,103,7,0,0          // vpbroadcastw  0x767(%rip),%ymm8        # 250a <_sk_xor__hsw_lowp+0x406>
+  .byte  196,98,125,121,5,119,7,0,0          // vpbroadcastw  0x777(%rip),%ymm8        # 254a <_sk_xor__hsw_lowp+0x416>
   .byte  197,61,249,195                      // vpsubw        %ymm3,%ymm8,%ymm8
   .byte  196,66,93,11,200                    // vpmulhrsw     %ymm8,%ymm4,%ymm9
   .byte  196,66,125,29,201                   // vpabsw        %ymm9,%ymm9
@@ -44986,7 +45169,7 @@
 _sk_dstatop_hsw_lowp:
   .byte  196,98,93,11,195                    // vpmulhrsw     %ymm3,%ymm4,%ymm8
   .byte  196,66,125,29,192                   // vpabsw        %ymm8,%ymm8
-  .byte  196,98,125,121,13,248,6,0,0         // vpbroadcastw  0x6f8(%rip),%ymm9        # 250c <_sk_xor__hsw_lowp+0x408>
+  .byte  196,98,125,121,13,8,7,0,0           // vpbroadcastw  0x708(%rip),%ymm9        # 254c <_sk_xor__hsw_lowp+0x418>
   .byte  197,53,249,207                      // vpsubw        %ymm7,%ymm9,%ymm9
   .byte  196,194,125,11,193                  // vpmulhrsw     %ymm9,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
@@ -45043,7 +45226,7 @@
 .globl _sk_srcout_hsw_lowp
 FUNCTION(_sk_srcout_hsw_lowp)
 _sk_srcout_hsw_lowp:
-  .byte  196,98,125,121,5,55,6,0,0           // vpbroadcastw  0x637(%rip),%ymm8        # 250e <_sk_xor__hsw_lowp+0x40a>
+  .byte  196,98,125,121,5,71,6,0,0           // vpbroadcastw  0x647(%rip),%ymm8        # 254e <_sk_xor__hsw_lowp+0x41a>
   .byte  197,61,249,199                      // vpsubw        %ymm7,%ymm8,%ymm8
   .byte  196,194,125,11,192                  // vpmulhrsw     %ymm8,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
@@ -45060,7 +45243,7 @@
 .globl _sk_dstout_hsw_lowp
 FUNCTION(_sk_dstout_hsw_lowp)
 _sk_dstout_hsw_lowp:
-  .byte  196,226,125,121,5,0,6,0,0           // vpbroadcastw  0x600(%rip),%ymm0        # 2510 <_sk_xor__hsw_lowp+0x40c>
+  .byte  196,226,125,121,5,16,6,0,0          // vpbroadcastw  0x610(%rip),%ymm0        # 2550 <_sk_xor__hsw_lowp+0x41c>
   .byte  197,253,249,219                     // vpsubw        %ymm3,%ymm0,%ymm3
   .byte  196,226,93,11,195                   // vpmulhrsw     %ymm3,%ymm4,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
@@ -45077,7 +45260,7 @@
 .globl _sk_srcover_hsw_lowp
 FUNCTION(_sk_srcover_hsw_lowp)
 _sk_srcover_hsw_lowp:
-  .byte  196,98,125,121,5,201,5,0,0          // vpbroadcastw  0x5c9(%rip),%ymm8        # 2512 <_sk_xor__hsw_lowp+0x40e>
+  .byte  196,98,125,121,5,217,5,0,0          // vpbroadcastw  0x5d9(%rip),%ymm8        # 2552 <_sk_xor__hsw_lowp+0x41e>
   .byte  197,61,249,195                      // vpsubw        %ymm3,%ymm8,%ymm8
   .byte  196,66,93,11,200                    // vpmulhrsw     %ymm8,%ymm4,%ymm9
   .byte  196,66,125,29,201                   // vpabsw        %ymm9,%ymm9
@@ -45098,7 +45281,7 @@
 .globl _sk_dstover_hsw_lowp
 FUNCTION(_sk_dstover_hsw_lowp)
 _sk_dstover_hsw_lowp:
-  .byte  196,98,125,121,5,130,5,0,0          // vpbroadcastw  0x582(%rip),%ymm8        # 2514 <_sk_xor__hsw_lowp+0x410>
+  .byte  196,98,125,121,5,146,5,0,0          // vpbroadcastw  0x592(%rip),%ymm8        # 2554 <_sk_xor__hsw_lowp+0x420>
   .byte  197,61,249,199                      // vpsubw        %ymm7,%ymm8,%ymm8
   .byte  196,194,125,11,192                  // vpmulhrsw     %ymm8,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
@@ -45134,7 +45317,7 @@
 .globl _sk_multiply_hsw_lowp
 FUNCTION(_sk_multiply_hsw_lowp)
 _sk_multiply_hsw_lowp:
-  .byte  196,98,125,121,5,15,5,0,0           // vpbroadcastw  0x50f(%rip),%ymm8        # 2516 <_sk_xor__hsw_lowp+0x412>
+  .byte  196,98,125,121,5,31,5,0,0           // vpbroadcastw  0x51f(%rip),%ymm8        # 2556 <_sk_xor__hsw_lowp+0x422>
   .byte  197,61,249,207                      // vpsubw        %ymm7,%ymm8,%ymm9
   .byte  196,66,125,11,209                   // vpmulhrsw     %ymm9,%ymm0,%ymm10
   .byte  196,66,125,29,210                   // vpabsw        %ymm10,%ymm10
@@ -45176,7 +45359,7 @@
 .globl _sk_screen_hsw_lowp
 FUNCTION(_sk_screen_hsw_lowp)
 _sk_screen_hsw_lowp:
-  .byte  196,98,125,121,5,96,4,0,0           // vpbroadcastw  0x460(%rip),%ymm8        # 2518 <_sk_xor__hsw_lowp+0x414>
+  .byte  196,98,125,121,5,112,4,0,0          // vpbroadcastw  0x470(%rip),%ymm8        # 2558 <_sk_xor__hsw_lowp+0x424>
   .byte  197,61,249,200                      // vpsubw        %ymm0,%ymm8,%ymm9
   .byte  196,98,53,11,204                    // vpmulhrsw     %ymm4,%ymm9,%ymm9
   .byte  196,66,125,29,201                   // vpabsw        %ymm9,%ymm9
@@ -45200,7 +45383,7 @@
 .globl _sk_xor__hsw_lowp
 FUNCTION(_sk_xor__hsw_lowp)
 _sk_xor__hsw_lowp:
-  .byte  196,98,125,121,5,13,4,0,0           // vpbroadcastw  0x40d(%rip),%ymm8        # 251a <_sk_xor__hsw_lowp+0x416>
+  .byte  196,98,125,121,5,29,4,0,0           // vpbroadcastw  0x41d(%rip),%ymm8        # 255a <_sk_xor__hsw_lowp+0x426>
   .byte  197,61,249,207                      // vpsubw        %ymm7,%ymm8,%ymm9
   .byte  196,194,125,11,193                  // vpmulhrsw     %ymm9,%ymm0,%ymm0
   .byte  196,226,125,29,192                  // vpabsw        %ymm0,%ymm0
@@ -45235,6 +45418,20 @@
   .byte  67                                  // rex.XB
 
 BALIGN32
+  .byte  0,128,0,128,0,0                     // add           %al,0x8000(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
+  .byte  0,0                                 // add           %al,(%rax)
   .byte  0,1                                 // add           %al,(%rcx)
   .byte  4,5                                 // add           $0x5,%al
   .byte  8,9                                 // or            %cl,(%rcx)
@@ -45270,7 +45467,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,17                              // callq         *(%rcx)
-  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3b0d <_sk_xor__hsw_lowp+0x1d1a1a09>
+  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3b4d <_sk_xor__hsw_lowp+0x1d1a1a19>
   .byte  30                                  // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -45361,7 +45558,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,17                              // callq         *(%rcx)
-  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3bad <_sk_xor__hsw_lowp+0x1d1a1aa9>
+  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3bed <_sk_xor__hsw_lowp+0x1d1a1ab9>
   .byte  30                                  // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -45471,7 +45668,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,17                              // callq         *(%rcx)
-  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3c6d <_sk_xor__hsw_lowp+0x1d1a1b69>
+  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3cad <_sk_xor__hsw_lowp+0x1d1a1b79>
   .byte  30                                  // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -45562,7 +45759,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,17                              // callq         *(%rcx)
-  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3d0d <_sk_xor__hsw_lowp+0x1d1a1c09>
+  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3d4d <_sk_xor__hsw_lowp+0x1d1a1c19>
   .byte  30                                  // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -45664,7 +45861,7 @@
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,17                              // callq         *(%rcx)
-  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3dcd <_sk_xor__hsw_lowp+0x1d1a1cc9>
+  .byte  18,21,22,25,26,29                   // adc           0x1d1a1916(%rip),%dl        # 1d1a3e0d <_sk_xor__hsw_lowp+0x1d1a1cd9>
   .byte  30                                  // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -45791,13 +45988,13 @@
 _sk_just_return_ssse3_lowp:
   .byte  195                                 // retq
 
-HIDDEN _sk_constant_color_ssse3_lowp
-.globl _sk_constant_color_ssse3_lowp
-FUNCTION(_sk_constant_color_ssse3_lowp)
-_sk_constant_color_ssse3_lowp:
+HIDDEN _sk_uniform_color_ssse3_lowp
+.globl _sk_uniform_color_ssse3_lowp
+FUNCTION(_sk_uniform_color_ssse3_lowp)
+_sk_uniform_color_ssse3_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  15,16,24                            // movups        (%rax),%xmm3
-  .byte  15,88,29,179,25,0,0                 // addps         0x19b3(%rip),%xmm3        # 1a40 <_sk_xor__ssse3_lowp+0x9f>
+  .byte  15,88,29,227,25,0,0                 // addps         0x19e3(%rip),%xmm3        # 1a70 <_sk_xor__ssse3_lowp+0xa7>
   .byte  242,15,112,195,0                    // pshuflw       $0x0,%xmm3,%xmm0
   .byte  102,15,112,192,80                   // pshufd        $0x50,%xmm0,%xmm0
   .byte  242,15,112,203,170                  // pshuflw       $0xaa,%xmm3,%xmm1
@@ -45809,12 +46006,34 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
 
+HIDDEN _sk_black_color_ssse3_lowp
+.globl _sk_black_color_ssse3_lowp
+FUNCTION(_sk_black_color_ssse3_lowp)
+_sk_black_color_ssse3_lowp:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  15,40,29,190,25,0,0                 // movaps        0x19be(%rip),%xmm3        # 1a80 <_sk_xor__ssse3_lowp+0xb7>
+  .byte  15,87,192                           // xorps         %xmm0,%xmm0
+  .byte  15,87,201                           // xorps         %xmm1,%xmm1
+  .byte  15,87,210                           // xorps         %xmm2,%xmm2
+  .byte  255,224                             // jmpq          *%rax
+
+HIDDEN _sk_white_color_ssse3_lowp
+.globl _sk_white_color_ssse3_lowp
+FUNCTION(_sk_white_color_ssse3_lowp)
+_sk_white_color_ssse3_lowp:
+  .byte  72,173                              // lods          %ds:(%rsi),%rax
+  .byte  15,40,5,186,25,0,0                  // movaps        0x19ba(%rip),%xmm0        # 1a90 <_sk_xor__ssse3_lowp+0xc7>
+  .byte  15,40,200                           // movaps        %xmm0,%xmm1
+  .byte  15,40,208                           // movaps        %xmm0,%xmm2
+  .byte  15,40,216                           // movaps        %xmm0,%xmm3
+  .byte  255,224                             // jmpq          *%rax
+
 HIDDEN _sk_set_rgb_ssse3_lowp
 .globl _sk_set_rgb_ssse3_lowp
 FUNCTION(_sk_set_rgb_ssse3_lowp)
 _sk_set_rgb_ssse3_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  243,15,16,21,173,28,0,0             // movss         0x1cad(%rip),%xmm2        # 1d70 <_sk_xor__ssse3_lowp+0x3cf>
+  .byte  243,15,16,21,213,28,0,0             // movss         0x1cd5(%rip),%xmm2        # 1dc0 <_sk_xor__ssse3_lowp+0x3f7>
   .byte  243,15,16,0                         // movss         (%rax),%xmm0
   .byte  243,15,88,194                       // addss         %xmm2,%xmm0
   .byte  102,65,15,126,193                   // movd          %xmm0,%r9d
@@ -45855,19 +46074,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,191,0,0,0                    // jne           206 <_sk_load_8888_ssse3_lowp+0xcd>
+  .byte  15,133,191,0,0,0                    // jne           22e <_sk_load_8888_ssse3_lowp+0xcd>
   .byte  69,15,16,68,147,16                  // movups        0x10(%r11,%rdx,4),%xmm8
   .byte  102,65,15,16,28,147                 // movupd        (%r11,%rdx,4),%xmm3
-  .byte  102,15,111,13,245,24,0,0            // movdqa        0x18f5(%rip),%xmm1        # 1a50 <_sk_xor__ssse3_lowp+0xaf>
+  .byte  102,15,111,13,29,25,0,0             // movdqa        0x191d(%rip),%xmm1        # 1aa0 <_sk_xor__ssse3_lowp+0xd7>
   .byte  102,15,40,195                       // movapd        %xmm3,%xmm0
   .byte  102,15,56,0,193                     // pshufb        %xmm1,%xmm0
   .byte  102,65,15,111,208                   // movdqa        %xmm8,%xmm2
   .byte  102,15,56,0,209                     // pshufb        %xmm1,%xmm2
   .byte  102,15,108,194                      // punpcklqdq    %xmm2,%xmm0
   .byte  102,15,113,240,8                    // psllw         $0x8,%xmm0
-  .byte  102,68,15,111,13,224,24,0,0         // movdqa        0x18e0(%rip),%xmm9        # 1a60 <_sk_xor__ssse3_lowp+0xbf>
+  .byte  102,68,15,111,13,8,25,0,0           // movdqa        0x1908(%rip),%xmm9        # 1ab0 <_sk_xor__ssse3_lowp+0xe7>
   .byte  102,65,15,228,193                   // pmulhuw       %xmm9,%xmm0
-  .byte  102,68,15,111,21,226,24,0,0         // movdqa        0x18e2(%rip),%xmm10        # 1a70 <_sk_xor__ssse3_lowp+0xcf>
+  .byte  102,68,15,111,21,10,25,0,0          // movdqa        0x190a(%rip),%xmm10        # 1ac0 <_sk_xor__ssse3_lowp+0xf7>
   .byte  102,15,40,203                       // movapd        %xmm3,%xmm1
   .byte  102,65,15,56,0,202                  // pshufb        %xmm10,%xmm1
   .byte  102,65,15,111,208                   // movdqa        %xmm8,%xmm2
@@ -45875,7 +46094,7 @@
   .byte  102,15,108,202                      // punpcklqdq    %xmm2,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
   .byte  102,65,15,228,201                   // pmulhuw       %xmm9,%xmm1
-  .byte  102,68,15,111,21,198,24,0,0         // movdqa        0x18c6(%rip),%xmm10        # 1a80 <_sk_xor__ssse3_lowp+0xdf>
+  .byte  102,68,15,111,21,238,24,0,0         // movdqa        0x18ee(%rip),%xmm10        # 1ad0 <_sk_xor__ssse3_lowp+0x107>
   .byte  102,15,40,211                       // movapd        %xmm3,%xmm2
   .byte  102,65,15,56,0,210                  // pshufb        %xmm10,%xmm2
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
@@ -45883,7 +46102,7 @@
   .byte  102,65,15,108,211                   // punpcklqdq    %xmm11,%xmm2
   .byte  102,15,113,242,8                    // psllw         $0x8,%xmm2
   .byte  102,65,15,228,209                   // pmulhuw       %xmm9,%xmm2
-  .byte  102,68,15,111,21,169,24,0,0         // movdqa        0x18a9(%rip),%xmm10        # 1a90 <_sk_xor__ssse3_lowp+0xef>
+  .byte  102,68,15,111,21,209,24,0,0         // movdqa        0x18d1(%rip),%xmm10        # 1ae0 <_sk_xor__ssse3_lowp+0x117>
   .byte  102,65,15,56,0,218                  // pshufb        %xmm10,%xmm3
   .byte  102,69,15,56,0,194                  // pshufb        %xmm10,%xmm8
   .byte  102,65,15,108,216                   // punpcklqdq    %xmm8,%xmm3
@@ -45897,18 +46116,18 @@
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,48,255,255,255               // ja            153 <_sk_load_8888_ssse3_lowp+0x1a>
+  .byte  15,135,48,255,255,255               // ja            17b <_sk_load_8888_ssse3_lowp+0x1a>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,94,0,0,0                  // lea           0x5e(%rip),%r10        # 28c <_sk_load_8888_ssse3_lowp+0x153>
+  .byte  76,141,21,94,0,0,0                  // lea           0x5e(%rip),%r10        # 2b4 <_sk_load_8888_ssse3_lowp+0x153>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  243,65,15,16,28,147                 // movss         (%r11,%rdx,4),%xmm3
-  .byte  233,17,255,255,255                  // jmpq          153 <_sk_load_8888_ssse3_lowp+0x1a>
+  .byte  233,17,255,255,255                  // jmpq          17b <_sk_load_8888_ssse3_lowp+0x1a>
   .byte  102,65,15,110,68,147,8              // movd          0x8(%r11,%rdx,4),%xmm0
   .byte  102,15,112,216,69                   // pshufd        $0x45,%xmm0,%xmm3
   .byte  102,65,15,18,28,147                 // movlpd        (%r11,%rdx,4),%xmm3
-  .byte  233,250,254,255,255                 // jmpq          153 <_sk_load_8888_ssse3_lowp+0x1a>
+  .byte  233,250,254,255,255                 // jmpq          17b <_sk_load_8888_ssse3_lowp+0x1a>
   .byte  102,65,15,110,68,147,24             // movd          0x18(%r11,%rdx,4),%xmm0
   .byte  102,68,15,112,192,69                // pshufd        $0x45,%xmm0,%xmm8
   .byte  243,65,15,16,68,147,20              // movss         0x14(%r11,%rdx,4),%xmm0
@@ -45917,7 +46136,7 @@
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
   .byte  243,65,15,16,68,147,16              // movss         0x10(%r11,%rdx,4),%xmm0
   .byte  243,68,15,16,192                    // movss         %xmm0,%xmm8
-  .byte  233,193,254,255,255                 // jmpq          14d <_sk_load_8888_ssse3_lowp+0x14>
+  .byte  233,193,254,255,255                 // jmpq          175 <_sk_load_8888_ssse3_lowp+0x14>
   .byte  171                                 // stos          %eax,%es:(%rdi)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -45946,19 +46165,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,191,0,0,0                    // jne           375 <_sk_load_8888_dst_ssse3_lowp+0xcd>
+  .byte  15,133,191,0,0,0                    // jne           39d <_sk_load_8888_dst_ssse3_lowp+0xcd>
   .byte  69,15,16,68,147,16                  // movups        0x10(%r11,%rdx,4),%xmm8
   .byte  102,65,15,16,60,147                 // movupd        (%r11,%rdx,4),%xmm7
-  .byte  102,15,111,45,214,23,0,0            // movdqa        0x17d6(%rip),%xmm5        # 1aa0 <_sk_xor__ssse3_lowp+0xff>
+  .byte  102,15,111,45,254,23,0,0            // movdqa        0x17fe(%rip),%xmm5        # 1af0 <_sk_xor__ssse3_lowp+0x127>
   .byte  102,15,40,231                       // movapd        %xmm7,%xmm4
   .byte  102,15,56,0,229                     // pshufb        %xmm5,%xmm4
   .byte  102,65,15,111,240                   // movdqa        %xmm8,%xmm6
   .byte  102,15,56,0,245                     // pshufb        %xmm5,%xmm6
   .byte  102,15,108,230                      // punpcklqdq    %xmm6,%xmm4
   .byte  102,15,113,244,8                    // psllw         $0x8,%xmm4
-  .byte  102,68,15,111,13,193,23,0,0         // movdqa        0x17c1(%rip),%xmm9        # 1ab0 <_sk_xor__ssse3_lowp+0x10f>
+  .byte  102,68,15,111,13,233,23,0,0         // movdqa        0x17e9(%rip),%xmm9        # 1b00 <_sk_xor__ssse3_lowp+0x137>
   .byte  102,65,15,228,225                   // pmulhuw       %xmm9,%xmm4
-  .byte  102,68,15,111,21,195,23,0,0         // movdqa        0x17c3(%rip),%xmm10        # 1ac0 <_sk_xor__ssse3_lowp+0x11f>
+  .byte  102,68,15,111,21,235,23,0,0         // movdqa        0x17eb(%rip),%xmm10        # 1b10 <_sk_xor__ssse3_lowp+0x147>
   .byte  102,15,40,239                       // movapd        %xmm7,%xmm5
   .byte  102,65,15,56,0,234                  // pshufb        %xmm10,%xmm5
   .byte  102,65,15,111,240                   // movdqa        %xmm8,%xmm6
@@ -45966,7 +46185,7 @@
   .byte  102,15,108,238                      // punpcklqdq    %xmm6,%xmm5
   .byte  102,15,113,245,8                    // psllw         $0x8,%xmm5
   .byte  102,65,15,228,233                   // pmulhuw       %xmm9,%xmm5
-  .byte  102,68,15,111,21,167,23,0,0         // movdqa        0x17a7(%rip),%xmm10        # 1ad0 <_sk_xor__ssse3_lowp+0x12f>
+  .byte  102,68,15,111,21,207,23,0,0         // movdqa        0x17cf(%rip),%xmm10        # 1b20 <_sk_xor__ssse3_lowp+0x157>
   .byte  102,15,40,247                       // movapd        %xmm7,%xmm6
   .byte  102,65,15,56,0,242                  // pshufb        %xmm10,%xmm6
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
@@ -45974,7 +46193,7 @@
   .byte  102,65,15,108,243                   // punpcklqdq    %xmm11,%xmm6
   .byte  102,15,113,246,8                    // psllw         $0x8,%xmm6
   .byte  102,65,15,228,241                   // pmulhuw       %xmm9,%xmm6
-  .byte  102,68,15,111,21,138,23,0,0         // movdqa        0x178a(%rip),%xmm10        # 1ae0 <_sk_xor__ssse3_lowp+0x13f>
+  .byte  102,68,15,111,21,178,23,0,0         // movdqa        0x17b2(%rip),%xmm10        # 1b30 <_sk_xor__ssse3_lowp+0x167>
   .byte  102,65,15,56,0,250                  // pshufb        %xmm10,%xmm7
   .byte  102,69,15,56,0,194                  // pshufb        %xmm10,%xmm8
   .byte  102,65,15,108,248                   // punpcklqdq    %xmm8,%xmm7
@@ -45988,18 +46207,18 @@
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,48,255,255,255               // ja            2c2 <_sk_load_8888_dst_ssse3_lowp+0x1a>
+  .byte  15,135,48,255,255,255               // ja            2ea <_sk_load_8888_dst_ssse3_lowp+0x1a>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,95,0,0,0                  // lea           0x5f(%rip),%r10        # 3fc <_sk_load_8888_dst_ssse3_lowp+0x154>
+  .byte  76,141,21,95,0,0,0                  // lea           0x5f(%rip),%r10        # 424 <_sk_load_8888_dst_ssse3_lowp+0x154>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  243,65,15,16,60,147                 // movss         (%r11,%rdx,4),%xmm7
-  .byte  233,17,255,255,255                  // jmpq          2c2 <_sk_load_8888_dst_ssse3_lowp+0x1a>
+  .byte  233,17,255,255,255                  // jmpq          2ea <_sk_load_8888_dst_ssse3_lowp+0x1a>
   .byte  102,65,15,110,100,147,8             // movd          0x8(%r11,%rdx,4),%xmm4
   .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
   .byte  102,65,15,18,60,147                 // movlpd        (%r11,%rdx,4),%xmm7
-  .byte  233,250,254,255,255                 // jmpq          2c2 <_sk_load_8888_dst_ssse3_lowp+0x1a>
+  .byte  233,250,254,255,255                 // jmpq          2ea <_sk_load_8888_dst_ssse3_lowp+0x1a>
   .byte  102,65,15,110,100,147,24            // movd          0x18(%r11,%rdx,4),%xmm4
   .byte  102,68,15,112,196,69                // pshufd        $0x45,%xmm4,%xmm8
   .byte  243,65,15,16,100,147,20             // movss         0x14(%r11,%rdx,4),%xmm4
@@ -46008,7 +46227,7 @@
   .byte  68,15,40,196                        // movaps        %xmm4,%xmm8
   .byte  243,65,15,16,100,147,16             // movss         0x10(%r11,%rdx,4),%xmm4
   .byte  243,68,15,16,196                    // movss         %xmm4,%xmm8
-  .byte  233,193,254,255,255                 // jmpq          2bc <_sk_load_8888_dst_ssse3_lowp+0x14>
+  .byte  233,193,254,255,255                 // jmpq          2e4 <_sk_load_8888_dst_ssse3_lowp+0x14>
   .byte  144                                 // nop
   .byte  170                                 // stos          %al,%es:(%rdi)
   .byte  255                                 // (bad)
@@ -46039,7 +46258,7 @@
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  102,68,15,111,192                   // movdqa        %xmm0,%xmm8
   .byte  102,65,15,113,208,7                 // psrlw         $0x7,%xmm8
-  .byte  102,68,15,111,21,191,22,0,0         // movdqa        0x16bf(%rip),%xmm10        # 1af0 <_sk_xor__ssse3_lowp+0x14f>
+  .byte  102,68,15,111,21,231,22,0,0         // movdqa        0x16e7(%rip),%xmm10        # 1b40 <_sk_xor__ssse3_lowp+0x177>
   .byte  102,69,15,234,194                   // pminsw        %xmm10,%xmm8
   .byte  102,69,15,239,219                   // pxor          %xmm11,%xmm11
   .byte  102,69,15,111,232                   // movdqa        %xmm8,%xmm13
@@ -46076,7 +46295,7 @@
   .byte  102,69,15,235,198                   // por           %xmm14,%xmm8
   .byte  102,69,15,235,193                   // por           %xmm9,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,17                              // jne           4ff <_sk_store_8888_ssse3_lowp+0xe7>
+  .byte  117,17                              // jne           527 <_sk_store_8888_ssse3_lowp+0xe7>
   .byte  243,69,15,127,4,147                 // movdqu        %xmm8,(%r11,%rdx,4)
   .byte  243,69,15,127,84,147,16             // movdqu        %xmm10,0x10(%r11,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -46085,25 +46304,25 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            4fb <_sk_store_8888_ssse3_lowp+0xe3>
+  .byte  119,236                             // ja            523 <_sk_store_8888_ssse3_lowp+0xe3>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,82,0,0,0                  // lea           0x52(%rip),%r10        # 56c <_sk_store_8888_ssse3_lowp+0x154>
+  .byte  76,141,21,82,0,0,0                  // lea           0x52(%rip),%r10        # 594 <_sk_store_8888_ssse3_lowp+0x154>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  102,69,15,126,4,147                 // movd          %xmm8,(%r11,%rdx,4)
-  .byte  235,208                             // jmp           4fb <_sk_store_8888_ssse3_lowp+0xe3>
+  .byte  235,208                             // jmp           523 <_sk_store_8888_ssse3_lowp+0xe3>
   .byte  102,69,15,112,200,78                // pshufd        $0x4e,%xmm8,%xmm9
   .byte  102,69,15,126,76,147,8              // movd          %xmm9,0x8(%r11,%rdx,4)
   .byte  102,69,15,214,4,147                 // movq          %xmm8,(%r11,%rdx,4)
-  .byte  235,187                             // jmp           4fb <_sk_store_8888_ssse3_lowp+0xe3>
+  .byte  235,187                             // jmp           523 <_sk_store_8888_ssse3_lowp+0xe3>
   .byte  102,69,15,112,202,78                // pshufd        $0x4e,%xmm10,%xmm9
   .byte  102,69,15,126,76,147,24             // movd          %xmm9,0x18(%r11,%rdx,4)
   .byte  102,69,15,112,202,229               // pshufd        $0xe5,%xmm10,%xmm9
   .byte  102,69,15,126,76,147,20             // movd          %xmm9,0x14(%r11,%rdx,4)
   .byte  102,69,15,126,84,147,16             // movd          %xmm10,0x10(%r11,%rdx,4)
   .byte  243,69,15,127,4,147                 // movdqu        %xmm8,(%r11,%rdx,4)
-  .byte  235,146                             // jmp           4fb <_sk_store_8888_ssse3_lowp+0xe3>
+  .byte  235,146                             // jmp           523 <_sk_store_8888_ssse3_lowp+0xe3>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  183,255                             // mov           $0xff,%bh
   .byte  255                                 // (bad)
@@ -46133,19 +46352,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,191,0,0,0                    // jne           655 <_sk_load_bgra_ssse3_lowp+0xcd>
+  .byte  15,133,191,0,0,0                    // jne           67d <_sk_load_bgra_ssse3_lowp+0xcd>
   .byte  69,15,16,68,147,16                  // movups        0x10(%r11,%rdx,4),%xmm8
   .byte  102,65,15,16,28,147                 // movupd        (%r11,%rdx,4),%xmm3
-  .byte  102,15,111,5,86,21,0,0              // movdqa        0x1556(%rip),%xmm0        # 1b00 <_sk_xor__ssse3_lowp+0x15f>
+  .byte  102,15,111,5,126,21,0,0             // movdqa        0x157e(%rip),%xmm0        # 1b50 <_sk_xor__ssse3_lowp+0x187>
   .byte  102,15,40,211                       // movapd        %xmm3,%xmm2
   .byte  102,15,56,0,208                     // pshufb        %xmm0,%xmm2
   .byte  102,65,15,111,200                   // movdqa        %xmm8,%xmm1
   .byte  102,15,56,0,200                     // pshufb        %xmm0,%xmm1
   .byte  102,15,108,209                      // punpcklqdq    %xmm1,%xmm2
   .byte  102,15,113,242,8                    // psllw         $0x8,%xmm2
-  .byte  102,68,15,111,13,65,21,0,0          // movdqa        0x1541(%rip),%xmm9        # 1b10 <_sk_xor__ssse3_lowp+0x16f>
+  .byte  102,68,15,111,13,105,21,0,0         // movdqa        0x1569(%rip),%xmm9        # 1b60 <_sk_xor__ssse3_lowp+0x197>
   .byte  102,65,15,228,209                   // pmulhuw       %xmm9,%xmm2
-  .byte  102,68,15,111,21,67,21,0,0          // movdqa        0x1543(%rip),%xmm10        # 1b20 <_sk_xor__ssse3_lowp+0x17f>
+  .byte  102,68,15,111,21,107,21,0,0         // movdqa        0x156b(%rip),%xmm10        # 1b70 <_sk_xor__ssse3_lowp+0x1a7>
   .byte  102,15,40,203                       // movapd        %xmm3,%xmm1
   .byte  102,65,15,56,0,202                  // pshufb        %xmm10,%xmm1
   .byte  102,65,15,111,192                   // movdqa        %xmm8,%xmm0
@@ -46153,7 +46372,7 @@
   .byte  102,15,108,200                      // punpcklqdq    %xmm0,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
   .byte  102,65,15,228,201                   // pmulhuw       %xmm9,%xmm1
-  .byte  102,68,15,111,21,39,21,0,0          // movdqa        0x1527(%rip),%xmm10        # 1b30 <_sk_xor__ssse3_lowp+0x18f>
+  .byte  102,68,15,111,21,79,21,0,0          // movdqa        0x154f(%rip),%xmm10        # 1b80 <_sk_xor__ssse3_lowp+0x1b7>
   .byte  102,15,40,195                       // movapd        %xmm3,%xmm0
   .byte  102,65,15,56,0,194                  // pshufb        %xmm10,%xmm0
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
@@ -46161,7 +46380,7 @@
   .byte  102,65,15,108,195                   // punpcklqdq    %xmm11,%xmm0
   .byte  102,15,113,240,8                    // psllw         $0x8,%xmm0
   .byte  102,65,15,228,193                   // pmulhuw       %xmm9,%xmm0
-  .byte  102,68,15,111,21,10,21,0,0          // movdqa        0x150a(%rip),%xmm10        # 1b40 <_sk_xor__ssse3_lowp+0x19f>
+  .byte  102,68,15,111,21,50,21,0,0          // movdqa        0x1532(%rip),%xmm10        # 1b90 <_sk_xor__ssse3_lowp+0x1c7>
   .byte  102,65,15,56,0,218                  // pshufb        %xmm10,%xmm3
   .byte  102,69,15,56,0,194                  // pshufb        %xmm10,%xmm8
   .byte  102,65,15,108,216                   // punpcklqdq    %xmm8,%xmm3
@@ -46175,18 +46394,18 @@
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,48,255,255,255               // ja            5a2 <_sk_load_bgra_ssse3_lowp+0x1a>
+  .byte  15,135,48,255,255,255               // ja            5ca <_sk_load_bgra_ssse3_lowp+0x1a>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,95,0,0,0                  // lea           0x5f(%rip),%r10        # 6dc <_sk_load_bgra_ssse3_lowp+0x154>
+  .byte  76,141,21,95,0,0,0                  // lea           0x5f(%rip),%r10        # 704 <_sk_load_bgra_ssse3_lowp+0x154>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  243,65,15,16,28,147                 // movss         (%r11,%rdx,4),%xmm3
-  .byte  233,17,255,255,255                  // jmpq          5a2 <_sk_load_bgra_ssse3_lowp+0x1a>
+  .byte  233,17,255,255,255                  // jmpq          5ca <_sk_load_bgra_ssse3_lowp+0x1a>
   .byte  102,65,15,110,68,147,8              // movd          0x8(%r11,%rdx,4),%xmm0
   .byte  102,15,112,216,69                   // pshufd        $0x45,%xmm0,%xmm3
   .byte  102,65,15,18,28,147                 // movlpd        (%r11,%rdx,4),%xmm3
-  .byte  233,250,254,255,255                 // jmpq          5a2 <_sk_load_bgra_ssse3_lowp+0x1a>
+  .byte  233,250,254,255,255                 // jmpq          5ca <_sk_load_bgra_ssse3_lowp+0x1a>
   .byte  102,65,15,110,68,147,24             // movd          0x18(%r11,%rdx,4),%xmm0
   .byte  102,68,15,112,192,69                // pshufd        $0x45,%xmm0,%xmm8
   .byte  243,65,15,16,68,147,20              // movss         0x14(%r11,%rdx,4),%xmm0
@@ -46195,7 +46414,7 @@
   .byte  68,15,40,192                        // movaps        %xmm0,%xmm8
   .byte  243,65,15,16,68,147,16              // movss         0x10(%r11,%rdx,4),%xmm0
   .byte  243,68,15,16,192                    // movss         %xmm0,%xmm8
-  .byte  233,193,254,255,255                 // jmpq          59c <_sk_load_bgra_ssse3_lowp+0x14>
+  .byte  233,193,254,255,255                 // jmpq          5c4 <_sk_load_bgra_ssse3_lowp+0x14>
   .byte  144                                 // nop
   .byte  170                                 // stos          %al,%es:(%rdi)
   .byte  255                                 // (bad)
@@ -46225,19 +46444,19 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,191,0,0,0                    // jne           7c5 <_sk_load_bgra_dst_ssse3_lowp+0xcd>
+  .byte  15,133,191,0,0,0                    // jne           7ed <_sk_load_bgra_dst_ssse3_lowp+0xcd>
   .byte  69,15,16,68,147,16                  // movups        0x10(%r11,%rdx,4),%xmm8
   .byte  102,65,15,16,60,147                 // movupd        (%r11,%rdx,4),%xmm7
-  .byte  102,15,111,37,54,20,0,0             // movdqa        0x1436(%rip),%xmm4        # 1b50 <_sk_xor__ssse3_lowp+0x1af>
+  .byte  102,15,111,37,94,20,0,0             // movdqa        0x145e(%rip),%xmm4        # 1ba0 <_sk_xor__ssse3_lowp+0x1d7>
   .byte  102,15,40,247                       // movapd        %xmm7,%xmm6
   .byte  102,15,56,0,244                     // pshufb        %xmm4,%xmm6
   .byte  102,65,15,111,232                   // movdqa        %xmm8,%xmm5
   .byte  102,15,56,0,236                     // pshufb        %xmm4,%xmm5
   .byte  102,15,108,245                      // punpcklqdq    %xmm5,%xmm6
   .byte  102,15,113,246,8                    // psllw         $0x8,%xmm6
-  .byte  102,68,15,111,13,33,20,0,0          // movdqa        0x1421(%rip),%xmm9        # 1b60 <_sk_xor__ssse3_lowp+0x1bf>
+  .byte  102,68,15,111,13,73,20,0,0          // movdqa        0x1449(%rip),%xmm9        # 1bb0 <_sk_xor__ssse3_lowp+0x1e7>
   .byte  102,65,15,228,241                   // pmulhuw       %xmm9,%xmm6
-  .byte  102,68,15,111,21,35,20,0,0          // movdqa        0x1423(%rip),%xmm10        # 1b70 <_sk_xor__ssse3_lowp+0x1cf>
+  .byte  102,68,15,111,21,75,20,0,0          // movdqa        0x144b(%rip),%xmm10        # 1bc0 <_sk_xor__ssse3_lowp+0x1f7>
   .byte  102,15,40,239                       // movapd        %xmm7,%xmm5
   .byte  102,65,15,56,0,234                  // pshufb        %xmm10,%xmm5
   .byte  102,65,15,111,224                   // movdqa        %xmm8,%xmm4
@@ -46245,7 +46464,7 @@
   .byte  102,15,108,236                      // punpcklqdq    %xmm4,%xmm5
   .byte  102,15,113,245,8                    // psllw         $0x8,%xmm5
   .byte  102,65,15,228,233                   // pmulhuw       %xmm9,%xmm5
-  .byte  102,68,15,111,21,7,20,0,0           // movdqa        0x1407(%rip),%xmm10        # 1b80 <_sk_xor__ssse3_lowp+0x1df>
+  .byte  102,68,15,111,21,47,20,0,0          // movdqa        0x142f(%rip),%xmm10        # 1bd0 <_sk_xor__ssse3_lowp+0x207>
   .byte  102,15,40,231                       // movapd        %xmm7,%xmm4
   .byte  102,65,15,56,0,226                  // pshufb        %xmm10,%xmm4
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
@@ -46253,7 +46472,7 @@
   .byte  102,65,15,108,227                   // punpcklqdq    %xmm11,%xmm4
   .byte  102,15,113,244,8                    // psllw         $0x8,%xmm4
   .byte  102,65,15,228,225                   // pmulhuw       %xmm9,%xmm4
-  .byte  102,68,15,111,21,234,19,0,0         // movdqa        0x13ea(%rip),%xmm10        # 1b90 <_sk_xor__ssse3_lowp+0x1ef>
+  .byte  102,68,15,111,21,18,20,0,0          // movdqa        0x1412(%rip),%xmm10        # 1be0 <_sk_xor__ssse3_lowp+0x217>
   .byte  102,65,15,56,0,250                  // pshufb        %xmm10,%xmm7
   .byte  102,69,15,56,0,194                  // pshufb        %xmm10,%xmm8
   .byte  102,65,15,108,248                   // punpcklqdq    %xmm8,%xmm7
@@ -46267,18 +46486,18 @@
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,48,255,255,255               // ja            712 <_sk_load_bgra_dst_ssse3_lowp+0x1a>
+  .byte  15,135,48,255,255,255               // ja            73a <_sk_load_bgra_dst_ssse3_lowp+0x1a>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,95,0,0,0                  // lea           0x5f(%rip),%r10        # 84c <_sk_load_bgra_dst_ssse3_lowp+0x154>
+  .byte  76,141,21,95,0,0,0                  // lea           0x5f(%rip),%r10        # 874 <_sk_load_bgra_dst_ssse3_lowp+0x154>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  243,65,15,16,60,147                 // movss         (%r11,%rdx,4),%xmm7
-  .byte  233,17,255,255,255                  // jmpq          712 <_sk_load_bgra_dst_ssse3_lowp+0x1a>
+  .byte  233,17,255,255,255                  // jmpq          73a <_sk_load_bgra_dst_ssse3_lowp+0x1a>
   .byte  102,65,15,110,100,147,8             // movd          0x8(%r11,%rdx,4),%xmm4
   .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
   .byte  102,65,15,18,60,147                 // movlpd        (%r11,%rdx,4),%xmm7
-  .byte  233,250,254,255,255                 // jmpq          712 <_sk_load_bgra_dst_ssse3_lowp+0x1a>
+  .byte  233,250,254,255,255                 // jmpq          73a <_sk_load_bgra_dst_ssse3_lowp+0x1a>
   .byte  102,65,15,110,100,147,24            // movd          0x18(%r11,%rdx,4),%xmm4
   .byte  102,68,15,112,196,69                // pshufd        $0x45,%xmm4,%xmm8
   .byte  243,65,15,16,100,147,20             // movss         0x14(%r11,%rdx,4),%xmm4
@@ -46287,7 +46506,7 @@
   .byte  68,15,40,196                        // movaps        %xmm4,%xmm8
   .byte  243,65,15,16,100,147,16             // movss         0x10(%r11,%rdx,4),%xmm4
   .byte  243,68,15,16,196                    // movss         %xmm4,%xmm8
-  .byte  233,193,254,255,255                 // jmpq          70c <_sk_load_bgra_dst_ssse3_lowp+0x14>
+  .byte  233,193,254,255,255                 // jmpq          734 <_sk_load_bgra_dst_ssse3_lowp+0x14>
   .byte  144                                 // nop
   .byte  170                                 // stos          %al,%es:(%rdi)
   .byte  255                                 // (bad)
@@ -46317,7 +46536,7 @@
   .byte  15,41,124,36,232                    // movaps        %xmm7,-0x18(%rsp)
   .byte  102,68,15,111,210                   // movdqa        %xmm2,%xmm10
   .byte  102,65,15,113,210,7                 // psrlw         $0x7,%xmm10
-  .byte  102,68,15,111,13,31,19,0,0          // movdqa        0x131f(%rip),%xmm9        # 1ba0 <_sk_xor__ssse3_lowp+0x1ff>
+  .byte  102,68,15,111,13,71,19,0,0          // movdqa        0x1347(%rip),%xmm9        # 1bf0 <_sk_xor__ssse3_lowp+0x227>
   .byte  102,69,15,234,209                   // pminsw        %xmm9,%xmm10
   .byte  102,69,15,239,246                   // pxor          %xmm14,%xmm14
   .byte  102,65,15,111,250                   // movdqa        %xmm10,%xmm7
@@ -46356,7 +46575,7 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,22                              // jne           959 <_sk_store_bgra_ssse3_lowp+0xf1>
+  .byte  117,22                              // jne           981 <_sk_store_bgra_ssse3_lowp+0xf1>
   .byte  243,69,15,127,4,147                 // movdqu        %xmm8,(%r11,%rdx,4)
   .byte  243,69,15,127,92,147,16             // movdqu        %xmm11,0x10(%r11,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -46366,25 +46585,25 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,231                             // ja            950 <_sk_store_bgra_ssse3_lowp+0xe8>
+  .byte  119,231                             // ja            978 <_sk_store_bgra_ssse3_lowp+0xe8>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,80,0,0,0                  // lea           0x50(%rip),%r10        # 9c4 <_sk_store_bgra_ssse3_lowp+0x15c>
+  .byte  76,141,21,80,0,0,0                  // lea           0x50(%rip),%r10        # 9ec <_sk_store_bgra_ssse3_lowp+0x15c>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  102,69,15,126,4,147                 // movd          %xmm8,(%r11,%rdx,4)
-  .byte  235,203                             // jmp           950 <_sk_store_bgra_ssse3_lowp+0xe8>
+  .byte  235,203                             // jmp           978 <_sk_store_bgra_ssse3_lowp+0xe8>
   .byte  102,65,15,112,248,78                // pshufd        $0x4e,%xmm8,%xmm7
   .byte  102,65,15,126,124,147,8             // movd          %xmm7,0x8(%r11,%rdx,4)
   .byte  102,69,15,214,4,147                 // movq          %xmm8,(%r11,%rdx,4)
-  .byte  235,182                             // jmp           950 <_sk_store_bgra_ssse3_lowp+0xe8>
+  .byte  235,182                             // jmp           978 <_sk_store_bgra_ssse3_lowp+0xe8>
   .byte  102,65,15,112,251,78                // pshufd        $0x4e,%xmm11,%xmm7
   .byte  102,65,15,126,124,147,24            // movd          %xmm7,0x18(%r11,%rdx,4)
   .byte  102,65,15,112,251,229               // pshufd        $0xe5,%xmm11,%xmm7
   .byte  102,65,15,126,124,147,20            // movd          %xmm7,0x14(%r11,%rdx,4)
   .byte  102,69,15,126,92,147,16             // movd          %xmm11,0x10(%r11,%rdx,4)
   .byte  243,69,15,127,4,147                 // movdqu        %xmm8,(%r11,%rdx,4)
-  .byte  235,141                             // jmp           950 <_sk_store_bgra_ssse3_lowp+0xe8>
+  .byte  235,141                             // jmp           978 <_sk_store_bgra_ssse3_lowp+0xe8>
   .byte  144                                 // nop
   .byte  185,255,255,255,206                 // mov           $0xceffffff,%ecx
   .byte  255                                 // (bad)
@@ -46413,11 +46632,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,37                              // jne           a0f <_sk_load_a8_ssse3_lowp+0x2f>
+  .byte  117,37                              // jne           a37 <_sk_load_a8_ssse3_lowp+0x2f>
   .byte  243,65,15,126,28,19                 // movq          (%r11,%rdx,1),%xmm3
   .byte  102,15,96,216                       // punpcklbw     %xmm0,%xmm3
   .byte  102,15,113,243,8                    // psllw         $0x8,%xmm3
-  .byte  102,15,228,29,175,17,0,0            // pmulhuw       0x11af(%rip),%xmm3        # 1bb0 <_sk_xor__ssse3_lowp+0x20f>
+  .byte  102,15,228,29,215,17,0,0            // pmulhuw       0x11d7(%rip),%xmm3        # 1c00 <_sk_xor__ssse3_lowp+0x237>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  102,15,87,192                       // xorpd         %xmm0,%xmm0
   .byte  15,87,201                           // xorps         %xmm1,%xmm1
@@ -46428,15 +46647,15 @@
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,209                             // ja            9f4 <_sk_load_a8_ssse3_lowp+0x14>
+  .byte  119,209                             // ja            a1c <_sk_load_a8_ssse3_lowp+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,110,0,0,0                 // lea           0x6e(%rip),%r10        # a9c <_sk_load_a8_ssse3_lowp+0xbc>
+  .byte  76,141,21,110,0,0,0                 // lea           0x6e(%rip),%r10        # ac4 <_sk_load_a8_ssse3_lowp+0xbc>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  102,15,110,216                      // movd          %eax,%xmm3
-  .byte  235,178                             // jmp           9f4 <_sk_load_a8_ssse3_lowp+0x14>
+  .byte  235,178                             // jmp           a1c <_sk_load_a8_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,196,216,2                    // pinsrw        $0x2,%eax,%xmm3
@@ -46444,7 +46663,7 @@
   .byte  102,15,110,192                      // movd          %eax,%xmm0
   .byte  102,15,96,192                       // punpcklbw     %xmm0,%xmm0
   .byte  243,15,16,216                       // movss         %xmm0,%xmm3
-  .byte  235,144                             // jmp           9f4 <_sk_load_a8_ssse3_lowp+0x14>
+  .byte  235,144                             // jmp           a1c <_sk_load_a8_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,196,216,6                    // pinsrw        $0x6,%eax,%xmm3
@@ -46455,7 +46674,7 @@
   .byte  102,65,15,110,4,19                  // movd          (%r11,%rdx,1),%xmm0
   .byte  102,15,96,192                       // punpcklbw     %xmm0,%xmm0
   .byte  242,15,16,216                       // movsd         %xmm0,%xmm3
-  .byte  233,88,255,255,255                  // jmpq          9f4 <_sk_load_a8_ssse3_lowp+0x14>
+  .byte  233,88,255,255,255                  // jmpq          a1c <_sk_load_a8_ssse3_lowp+0x14>
   .byte  155                                 // fwait
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -46484,11 +46703,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,37                              // jne           ae7 <_sk_load_a8_dst_ssse3_lowp+0x2f>
+  .byte  117,37                              // jne           b0f <_sk_load_a8_dst_ssse3_lowp+0x2f>
   .byte  243,65,15,126,60,19                 // movq          (%r11,%rdx,1),%xmm7
   .byte  102,15,96,248                       // punpcklbw     %xmm0,%xmm7
   .byte  102,15,113,247,8                    // psllw         $0x8,%xmm7
-  .byte  102,15,228,61,231,16,0,0            // pmulhuw       0x10e7(%rip),%xmm7        # 1bc0 <_sk_xor__ssse3_lowp+0x21f>
+  .byte  102,15,228,61,15,17,0,0             // pmulhuw       0x110f(%rip),%xmm7        # 1c10 <_sk_xor__ssse3_lowp+0x247>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  102,15,87,228                       // xorpd         %xmm4,%xmm4
   .byte  15,87,237                           // xorps         %xmm5,%xmm5
@@ -46499,15 +46718,15 @@
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,209                             // ja            acc <_sk_load_a8_dst_ssse3_lowp+0x14>
+  .byte  119,209                             // ja            af4 <_sk_load_a8_dst_ssse3_lowp+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,110,0,0,0                 // lea           0x6e(%rip),%r10        # b74 <_sk_load_a8_dst_ssse3_lowp+0xbc>
+  .byte  76,141,21,110,0,0,0                 // lea           0x6e(%rip),%r10        # b9c <_sk_load_a8_dst_ssse3_lowp+0xbc>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  102,15,110,248                      // movd          %eax,%xmm7
-  .byte  235,178                             // jmp           acc <_sk_load_a8_dst_ssse3_lowp+0x14>
+  .byte  235,178                             // jmp           af4 <_sk_load_a8_dst_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  102,15,196,248,2                    // pinsrw        $0x2,%eax,%xmm7
@@ -46515,7 +46734,7 @@
   .byte  102,15,110,224                      // movd          %eax,%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  243,15,16,252                       // movss         %xmm4,%xmm7
-  .byte  235,144                             // jmp           acc <_sk_load_a8_dst_ssse3_lowp+0x14>
+  .byte  235,144                             // jmp           af4 <_sk_load_a8_dst_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  102,15,196,248,6                    // pinsrw        $0x6,%eax,%xmm7
@@ -46526,7 +46745,7 @@
   .byte  102,65,15,110,36,19                 // movd          (%r11,%rdx,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  242,15,16,252                       // movsd         %xmm4,%xmm7
-  .byte  233,88,255,255,255                  // jmpq          acc <_sk_load_a8_dst_ssse3_lowp+0x14>
+  .byte  233,88,255,255,255                  // jmpq          af4 <_sk_load_a8_dst_ssse3_lowp+0x14>
   .byte  155                                 // fwait
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
@@ -46558,7 +46777,7 @@
   .byte  102,65,15,113,208,7                 // psrlw         $0x7,%xmm8
   .byte  102,69,15,103,192                   // packuswb      %xmm8,%xmm8
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,10                              // jne           bb4 <_sk_store_a8_ssse3_lowp+0x24>
+  .byte  117,10                              // jne           bdc <_sk_store_a8_ssse3_lowp+0x24>
   .byte  242,69,15,17,4,19                   // movsd         %xmm8,(%r11,%rdx,1)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  255,224                             // jmpq          *%rax
@@ -46566,24 +46785,24 @@
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,236                             // ja            bb0 <_sk_store_a8_ssse3_lowp+0x20>
+  .byte  119,236                             // ja            bd8 <_sk_store_a8_ssse3_lowp+0x20>
   .byte  102,68,15,96,192                    // punpcklbw     %xmm0,%xmm8
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,136,0,0,0                 // lea           0x88(%rip),%r10        # c5c <_sk_store_a8_ssse3_lowp+0xcc>
+  .byte  76,141,21,136,0,0,0                 // lea           0x88(%rip),%r10        # c84 <_sk_store_a8_ssse3_lowp+0xcc>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  102,68,15,127,68,36,168             // movdqa        %xmm8,-0x58(%rsp)
   .byte  138,68,36,168                       // mov           -0x58(%rsp),%al
   .byte  65,136,4,19                         // mov           %al,(%r11,%rdx,1)
-  .byte  235,194                             // jmp           bb0 <_sk_store_a8_ssse3_lowp+0x20>
+  .byte  235,194                             // jmp           bd8 <_sk_store_a8_ssse3_lowp+0x20>
   .byte  102,68,15,127,68,36,184             // movdqa        %xmm8,-0x48(%rsp)
   .byte  138,68,36,188                       // mov           -0x44(%rsp),%al
   .byte  65,136,68,19,2                      // mov           %al,0x2(%r11,%rdx,1)
-  .byte  102,68,15,56,0,5,216,15,0,0         // pshufb        0xfd8(%rip),%xmm8        # 1be0 <_sk_xor__ssse3_lowp+0x23f>
+  .byte  102,68,15,56,0,5,0,16,0,0           // pshufb        0x1000(%rip),%xmm8        # 1c30 <_sk_xor__ssse3_lowp+0x267>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  102,65,137,4,19                     // mov           %ax,(%r11,%rdx,1)
-  .byte  235,156                             // jmp           bb0 <_sk_store_a8_ssse3_lowp+0x20>
+  .byte  235,156                             // jmp           bd8 <_sk_store_a8_ssse3_lowp+0x20>
   .byte  102,68,15,127,68,36,232             // movdqa        %xmm8,-0x18(%rsp)
   .byte  138,68,36,244                       // mov           -0xc(%rsp),%al
   .byte  65,136,68,19,6                      // mov           %al,0x6(%r11,%rdx,1)
@@ -46593,9 +46812,9 @@
   .byte  102,68,15,127,68,36,200             // movdqa        %xmm8,-0x38(%rsp)
   .byte  138,68,36,208                       // mov           -0x30(%rsp),%al
   .byte  65,136,68,19,4                      // mov           %al,0x4(%r11,%rdx,1)
-  .byte  102,68,15,56,0,5,130,15,0,0         // pshufb        0xf82(%rip),%xmm8        # 1bd0 <_sk_xor__ssse3_lowp+0x22f>
+  .byte  102,68,15,56,0,5,170,15,0,0         // pshufb        0xfaa(%rip),%xmm8        # 1c20 <_sk_xor__ssse3_lowp+0x257>
   .byte  102,69,15,126,4,19                  // movd          %xmm8,(%r11,%rdx,1)
-  .byte  233,87,255,255,255                  // jmpq          bb0 <_sk_store_a8_ssse3_lowp+0x20>
+  .byte  233,87,255,255,255                  // jmpq          bd8 <_sk_store_a8_ssse3_lowp+0x20>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  129,255,255,255,162,255             // cmp           $0xffa2ffff,%edi
   .byte  255                                 // (bad)
@@ -46621,13 +46840,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,42                              // jne           cac <_sk_load_g8_ssse3_lowp+0x34>
+  .byte  117,42                              // jne           cd4 <_sk_load_g8_ssse3_lowp+0x34>
   .byte  243,65,15,126,4,19                  // movq          (%r11,%rdx,1),%xmm0
   .byte  102,15,96,192                       // punpcklbw     %xmm0,%xmm0
   .byte  102,15,113,240,8                    // psllw         $0x8,%xmm0
-  .byte  102,15,228,5,87,15,0,0              // pmulhuw       0xf57(%rip),%xmm0        # 1bf0 <_sk_xor__ssse3_lowp+0x24f>
+  .byte  102,15,228,5,127,15,0,0             // pmulhuw       0xf7f(%rip),%xmm0        # 1c40 <_sk_xor__ssse3_lowp+0x277>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,29,94,15,0,0                  // movaps        0xf5e(%rip),%xmm3        # 1c00 <_sk_xor__ssse3_lowp+0x25f>
+  .byte  15,40,29,134,15,0,0                 // movaps        0xf86(%rip),%xmm3        # 1c50 <_sk_xor__ssse3_lowp+0x287>
   .byte  102,15,111,200                      // movdqa        %xmm0,%xmm1
   .byte  102,15,111,208                      // movdqa        %xmm0,%xmm2
   .byte  255,224                             // jmpq          *%rax
@@ -46636,15 +46855,15 @@
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,204                             // ja            c8c <_sk_load_g8_ssse3_lowp+0x14>
+  .byte  119,204                             // ja            cb4 <_sk_load_g8_ssse3_lowp+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,113,0,0,0                 // lea           0x71(%rip),%r10        # d3c <_sk_load_g8_ssse3_lowp+0xc4>
+  .byte  76,141,21,113,0,0,0                 // lea           0x71(%rip),%r10        # d64 <_sk_load_g8_ssse3_lowp+0xc4>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  102,15,110,192                      // movd          %eax,%xmm0
-  .byte  235,173                             // jmp           c8c <_sk_load_g8_ssse3_lowp+0x14>
+  .byte  235,173                             // jmp           cb4 <_sk_load_g8_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,196,192,2                    // pinsrw        $0x2,%eax,%xmm0
@@ -46652,7 +46871,7 @@
   .byte  102,15,110,200                      // movd          %eax,%xmm1
   .byte  102,15,96,200                       // punpcklbw     %xmm0,%xmm1
   .byte  243,15,16,193                       // movss         %xmm1,%xmm0
-  .byte  235,139                             // jmp           c8c <_sk_load_g8_ssse3_lowp+0x14>
+  .byte  235,139                             // jmp           cb4 <_sk_load_g8_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,196,192,6                    // pinsrw        $0x6,%eax,%xmm0
@@ -46663,7 +46882,7 @@
   .byte  102,65,15,110,12,19                 // movd          (%r11,%rdx,1),%xmm1
   .byte  102,15,96,200                       // punpcklbw     %xmm0,%xmm1
   .byte  242,15,16,193                       // movsd         %xmm1,%xmm0
-  .byte  233,83,255,255,255                  // jmpq          c8c <_sk_load_g8_ssse3_lowp+0x14>
+  .byte  233,83,255,255,255                  // jmpq          cb4 <_sk_load_g8_ssse3_lowp+0x14>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  152                                 // cwtl
   .byte  255                                 // (bad)
@@ -46693,13 +46912,13 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,42                              // jne           d8c <_sk_load_g8_dst_ssse3_lowp+0x34>
+  .byte  117,42                              // jne           db4 <_sk_load_g8_dst_ssse3_lowp+0x34>
   .byte  243,65,15,126,36,19                 // movq          (%r11,%rdx,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,113,244,8                    // psllw         $0x8,%xmm4
-  .byte  102,15,228,37,151,14,0,0            // pmulhuw       0xe97(%rip),%xmm4        # 1c10 <_sk_xor__ssse3_lowp+0x26f>
+  .byte  102,15,228,37,191,14,0,0            // pmulhuw       0xebf(%rip),%xmm4        # 1c60 <_sk_xor__ssse3_lowp+0x297>
   .byte  72,173                              // lods          %ds:(%rsi),%rax
-  .byte  15,40,61,158,14,0,0                 // movaps        0xe9e(%rip),%xmm7        # 1c20 <_sk_xor__ssse3_lowp+0x27f>
+  .byte  15,40,61,198,14,0,0                 // movaps        0xec6(%rip),%xmm7        # 1c70 <_sk_xor__ssse3_lowp+0x2a7>
   .byte  102,15,111,236                      // movdqa        %xmm4,%xmm5
   .byte  102,15,111,244                      // movdqa        %xmm4,%xmm6
   .byte  255,224                             // jmpq          *%rax
@@ -46708,15 +46927,15 @@
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,204                             // ja            d6c <_sk_load_g8_dst_ssse3_lowp+0x14>
+  .byte  119,204                             // ja            d94 <_sk_load_g8_dst_ssse3_lowp+0x14>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,113,0,0,0                 // lea           0x71(%rip),%r10        # e1c <_sk_load_g8_dst_ssse3_lowp+0xc4>
+  .byte  76,141,21,113,0,0,0                 // lea           0x71(%rip),%r10        # e44 <_sk_load_g8_dst_ssse3_lowp+0xc4>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  102,15,110,224                      // movd          %eax,%xmm4
-  .byte  235,173                             // jmp           d6c <_sk_load_g8_dst_ssse3_lowp+0x14>
+  .byte  235,173                             // jmp           d94 <_sk_load_g8_dst_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  102,15,196,224,2                    // pinsrw        $0x2,%eax,%xmm4
@@ -46724,7 +46943,7 @@
   .byte  102,15,110,232                      // movd          %eax,%xmm5
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  243,15,16,229                       // movss         %xmm5,%xmm4
-  .byte  235,139                             // jmp           d6c <_sk_load_g8_dst_ssse3_lowp+0x14>
+  .byte  235,139                             // jmp           d94 <_sk_load_g8_dst_ssse3_lowp+0x14>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  102,15,196,224,6                    // pinsrw        $0x6,%eax,%xmm4
@@ -46735,7 +46954,7 @@
   .byte  102,65,15,110,44,19                 // movd          (%r11,%rdx,1),%xmm5
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  233,83,255,255,255                  // jmpq          d6c <_sk_load_g8_dst_ssse3_lowp+0x14>
+  .byte  233,83,255,255,255                  // jmpq          d94 <_sk_load_g8_dst_ssse3_lowp+0x14>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  152                                 // cwtl
   .byte  255                                 // (bad)
@@ -46766,20 +46985,20 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,11,2,0,0                     // jne           1056 <_sk_srcover_rgba_8888_ssse3_lowp+0x21e>
+  .byte  15,133,11,2,0,0                     // jne           107e <_sk_srcover_rgba_8888_ssse3_lowp+0x21e>
   .byte  69,15,16,68,147,16                  // movups        0x10(%r11,%rdx,4),%xmm8
   .byte  102,65,15,16,60,147                 // movupd        (%r11,%rdx,4),%xmm7
-  .byte  102,15,111,45,209,13,0,0            // movdqa        0xdd1(%rip),%xmm5        # 1c30 <_sk_xor__ssse3_lowp+0x28f>
+  .byte  102,15,111,45,249,13,0,0            // movdqa        0xdf9(%rip),%xmm5        # 1c80 <_sk_xor__ssse3_lowp+0x2b7>
   .byte  102,15,40,231                       // movapd        %xmm7,%xmm4
   .byte  102,15,56,0,229                     // pshufb        %xmm5,%xmm4
   .byte  102,65,15,111,240                   // movdqa        %xmm8,%xmm6
   .byte  102,15,56,0,245                     // pshufb        %xmm5,%xmm6
   .byte  102,15,108,230                      // punpcklqdq    %xmm6,%xmm4
-  .byte  102,15,111,13,194,13,0,0            // movdqa        0xdc2(%rip),%xmm1        # 1c40 <_sk_xor__ssse3_lowp+0x29f>
+  .byte  102,15,111,13,234,13,0,0            // movdqa        0xdea(%rip),%xmm1        # 1c90 <_sk_xor__ssse3_lowp+0x2c7>
   .byte  102,15,113,244,8                    // psllw         $0x8,%xmm4
-  .byte  102,68,15,111,13,196,13,0,0         // movdqa        0xdc4(%rip),%xmm9        # 1c50 <_sk_xor__ssse3_lowp+0x2af>
+  .byte  102,68,15,111,13,236,13,0,0         // movdqa        0xdec(%rip),%xmm9        # 1ca0 <_sk_xor__ssse3_lowp+0x2d7>
   .byte  102,65,15,228,225                   // pmulhuw       %xmm9,%xmm4
-  .byte  102,68,15,111,21,198,13,0,0         // movdqa        0xdc6(%rip),%xmm10        # 1c60 <_sk_xor__ssse3_lowp+0x2bf>
+  .byte  102,68,15,111,21,238,13,0,0         // movdqa        0xdee(%rip),%xmm10        # 1cb0 <_sk_xor__ssse3_lowp+0x2e7>
   .byte  102,15,40,239                       // movapd        %xmm7,%xmm5
   .byte  102,65,15,56,0,234                  // pshufb        %xmm10,%xmm5
   .byte  102,65,15,111,240                   // movdqa        %xmm8,%xmm6
@@ -46787,7 +47006,7 @@
   .byte  102,15,108,238                      // punpcklqdq    %xmm6,%xmm5
   .byte  102,15,113,245,8                    // psllw         $0x8,%xmm5
   .byte  102,65,15,228,233                   // pmulhuw       %xmm9,%xmm5
-  .byte  102,68,15,111,21,170,13,0,0         // movdqa        0xdaa(%rip),%xmm10        # 1c70 <_sk_xor__ssse3_lowp+0x2cf>
+  .byte  102,68,15,111,21,210,13,0,0         // movdqa        0xdd2(%rip),%xmm10        # 1cc0 <_sk_xor__ssse3_lowp+0x2f7>
   .byte  102,15,40,247                       // movapd        %xmm7,%xmm6
   .byte  102,65,15,56,0,242                  // pshufb        %xmm10,%xmm6
   .byte  102,69,15,111,216                   // movdqa        %xmm8,%xmm11
@@ -46795,13 +47014,13 @@
   .byte  102,65,15,108,243                   // punpcklqdq    %xmm11,%xmm6
   .byte  102,15,113,246,8                    // psllw         $0x8,%xmm6
   .byte  102,65,15,228,241                   // pmulhuw       %xmm9,%xmm6
-  .byte  102,68,15,111,21,141,13,0,0         // movdqa        0xd8d(%rip),%xmm10        # 1c80 <_sk_xor__ssse3_lowp+0x2df>
+  .byte  102,68,15,111,21,181,13,0,0         // movdqa        0xdb5(%rip),%xmm10        # 1cd0 <_sk_xor__ssse3_lowp+0x307>
   .byte  102,65,15,56,0,250                  // pshufb        %xmm10,%xmm7
   .byte  102,69,15,56,0,194                  // pshufb        %xmm10,%xmm8
   .byte  102,65,15,108,248                   // punpcklqdq    %xmm8,%xmm7
   .byte  102,15,113,247,8                    // psllw         $0x8,%xmm7
   .byte  102,65,15,228,249                   // pmulhuw       %xmm9,%xmm7
-  .byte  102,68,15,111,29,121,13,0,0         // movdqa        0xd79(%rip),%xmm11        # 1c90 <_sk_xor__ssse3_lowp+0x2ef>
+  .byte  102,68,15,111,29,161,13,0,0         // movdqa        0xda1(%rip),%xmm11        # 1ce0 <_sk_xor__ssse3_lowp+0x317>
   .byte  102,68,15,249,219                   // psubw         %xmm3,%xmm11
   .byte  102,68,15,111,196                   // movdqa        %xmm4,%xmm8
   .byte  102,69,15,56,11,195                 // pmulhrsw      %xmm11,%xmm8
@@ -46857,7 +47076,7 @@
   .byte  102,65,15,235,192                   // por           %xmm8,%xmm0
   .byte  102,15,235,194                      // por           %xmm2,%xmm0
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,97                              // jne           1092 <_sk_srcover_rgba_8888_ssse3_lowp+0x25a>
+  .byte  117,97                              // jne           10ba <_sk_srcover_rgba_8888_ssse3_lowp+0x25a>
   .byte  243,65,15,127,4,147                 // movdqu        %xmm0,(%r11,%rdx,4)
   .byte  243,65,15,127,76,147,16             // movdqu        %xmm1,0x10(%r11,%rdx,4)
   .byte  72,173                              // lods          %ds:(%rsi),%rax
@@ -46872,30 +47091,30 @@
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,228,253,255,255              // ja            e57 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
+  .byte  15,135,228,253,255,255              // ja            e7f <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,206,0,0,0                 // lea           0xce(%rip),%r10        # 114c <_sk_srcover_rgba_8888_ssse3_lowp+0x314>
+  .byte  76,141,21,206,0,0,0                 // lea           0xce(%rip),%r10        # 1174 <_sk_srcover_rgba_8888_ssse3_lowp+0x314>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  243,65,15,16,60,147                 // movss         (%r11,%rdx,4),%xmm7
-  .byte  233,197,253,255,255                 // jmpq          e57 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
+  .byte  233,197,253,255,255                 // jmpq          e7f <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
   .byte  69,137,193                          // mov           %r8d,%r9d
   .byte  65,128,225,7                        // and           $0x7,%r9b
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,156                             // ja            103e <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
+  .byte  119,156                             // ja            1066 <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
   .byte  65,15,182,193                       // movzbl        %r9b,%eax
-  .byte  76,141,13,187,0,0,0                 // lea           0xbb(%rip),%r9        # 1168 <_sk_srcover_rgba_8888_ssse3_lowp+0x330>
+  .byte  76,141,13,187,0,0,0                 // lea           0xbb(%rip),%r9        # 1190 <_sk_srcover_rgba_8888_ssse3_lowp+0x330>
   .byte  73,99,4,129                         // movslq        (%r9,%rax,4),%rax
   .byte  76,1,200                            // add           %r9,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  102,65,15,126,4,147                 // movd          %xmm0,(%r11,%rdx,4)
-  .byte  235,128                             // jmp           103e <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
+  .byte  235,128                             // jmp           1066 <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
   .byte  102,65,15,110,100,147,8             // movd          0x8(%r11,%rdx,4),%xmm4
   .byte  102,15,112,252,69                   // pshufd        $0x45,%xmm4,%xmm7
   .byte  102,65,15,18,60,147                 // movlpd        (%r11,%rdx,4),%xmm7
-  .byte  233,130,253,255,255                 // jmpq          e57 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
+  .byte  233,130,253,255,255                 // jmpq          e7f <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
   .byte  102,65,15,110,100,147,24            // movd          0x18(%r11,%rdx,4),%xmm4
   .byte  102,68,15,112,196,69                // pshufd        $0x45,%xmm4,%xmm8
   .byte  243,65,15,16,100,147,20             // movss         0x14(%r11,%rdx,4),%xmm4
@@ -46904,27 +47123,27 @@
   .byte  68,15,40,196                        // movaps        %xmm4,%xmm8
   .byte  243,65,15,16,100,147,16             // movss         0x10(%r11,%rdx,4),%xmm4
   .byte  243,68,15,16,196                    // movss         %xmm4,%xmm8
-  .byte  233,73,253,255,255                  // jmpq          e51 <_sk_srcover_rgba_8888_ssse3_lowp+0x19>
+  .byte  233,73,253,255,255                  // jmpq          e79 <_sk_srcover_rgba_8888_ssse3_lowp+0x19>
   .byte  102,15,112,200,78                   // pshufd        $0x4e,%xmm0,%xmm1
   .byte  102,65,15,126,76,147,8              // movd          %xmm1,0x8(%r11,%rdx,4)
   .byte  102,65,15,214,4,147                 // movq          %xmm0,(%r11,%rdx,4)
-  .byte  233,31,255,255,255                  // jmpq          103e <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
+  .byte  233,31,255,255,255                  // jmpq          1066 <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
   .byte  102,15,112,209,78                   // pshufd        $0x4e,%xmm1,%xmm2
   .byte  102,65,15,126,84,147,24             // movd          %xmm2,0x18(%r11,%rdx,4)
   .byte  102,15,112,209,229                  // pshufd        $0xe5,%xmm1,%xmm2
   .byte  102,65,15,126,84,147,20             // movd          %xmm2,0x14(%r11,%rdx,4)
   .byte  102,65,15,126,76,147,16             // movd          %xmm1,0x10(%r11,%rdx,4)
   .byte  243,65,15,127,4,147                 // movdqu        %xmm0,(%r11,%rdx,4)
-  .byte  233,245,254,255,255                 // jmpq          103e <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
+  .byte  233,245,254,255,255                 // jmpq          1066 <_sk_srcover_rgba_8888_ssse3_lowp+0x206>
   .byte  15,31,0                             // nopl          (%rax)
   .byte  59,255                              // cmp           %edi,%edi
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  126,255                             // jle           1151 <_sk_srcover_rgba_8888_ssse3_lowp+0x319>
+  .byte  126,255                             // jle           1179 <_sk_srcover_rgba_8888_ssse3_lowp+0x319>
   .byte  255                                 // (bad)
   .byte  255,114,255                         // pushq         -0x1(%rdx)
   .byte  255                                 // (bad)
-  .byte  255,5,253,255,255,171               // incl          -0x54000003(%rip)        # ffffffffac00115a <_sk_xor__ssse3_lowp+0xffffffffabfff7b9>
+  .byte  255,5,253,255,255,171               // incl          -0x54000003(%rip)        # ffffffffac001182 <_sk_xor__ssse3_lowp+0xffffffffabfff7b9>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255,150,255,255,255,137             // callq         *-0x76000001(%rsi)
@@ -46954,7 +47173,7 @@
 _sk_scale_1_float_ssse3_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  243,68,15,16,0                      // movss         (%rax),%xmm8
-  .byte  243,68,15,88,5,224,11,0,0           // addss         0xbe0(%rip),%xmm8        # 1d74 <_sk_xor__ssse3_lowp+0x3d3>
+  .byte  243,68,15,88,5,8,12,0,0             // addss         0xc08(%rip),%xmm8        # 1dc4 <_sk_xor__ssse3_lowp+0x3fb>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  242,69,15,112,192,0                 // pshuflw       $0x0,%xmm8,%xmm8
@@ -46977,11 +47196,11 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  117,74                              // jne           122e <_sk_scale_u8_ssse3_lowp+0x54>
+  .byte  117,74                              // jne           1256 <_sk_scale_u8_ssse3_lowp+0x54>
   .byte  243,69,15,126,4,19                  // movq          (%r11,%rdx,1),%xmm8
   .byte  102,68,15,96,192                    // punpcklbw     %xmm0,%xmm8
   .byte  102,65,15,113,240,8                 // psllw         $0x8,%xmm8
-  .byte  102,68,15,228,5,162,10,0,0          // pmulhuw       0xaa2(%rip),%xmm8        # 1ca0 <_sk_xor__ssse3_lowp+0x2ff>
+  .byte  102,68,15,228,5,202,10,0,0          // pmulhuw       0xaca(%rip),%xmm8        # 1cf0 <_sk_xor__ssse3_lowp+0x327>
   .byte  102,65,15,56,11,192                 // pmulhrsw      %xmm8,%xmm0
   .byte  102,15,56,29,192                    // pabsw         %xmm0,%xmm0
   .byte  102,65,15,56,11,200                 // pmulhrsw      %xmm8,%xmm1
@@ -46997,15 +47216,15 @@
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  119,172                             // ja            11ef <_sk_scale_u8_ssse3_lowp+0x15>
+  .byte  119,172                             // ja            1217 <_sk_scale_u8_ssse3_lowp+0x15>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,126,0,0,0                 // lea           0x7e(%rip),%r10        # 12cc <_sk_scale_u8_ssse3_lowp+0xf2>
+  .byte  76,141,21,126,0,0,0                 // lea           0x7e(%rip),%r10        # 12f4 <_sk_scale_u8_ssse3_lowp+0xf2>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
-  .byte  235,140                             // jmp           11ef <_sk_scale_u8_ssse3_lowp+0x15>
+  .byte  235,140                             // jmp           1217 <_sk_scale_u8_ssse3_lowp+0x15>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  102,68,15,196,192,2                 // pinsrw        $0x2,%eax,%xmm8
@@ -47013,7 +47232,7 @@
   .byte  102,68,15,110,200                   // movd          %eax,%xmm9
   .byte  102,68,15,96,200                    // punpcklbw     %xmm0,%xmm9
   .byte  243,69,15,16,193                    // movss         %xmm9,%xmm8
-  .byte  233,98,255,255,255                  // jmpq          11ef <_sk_scale_u8_ssse3_lowp+0x15>
+  .byte  233,98,255,255,255                  // jmpq          1217 <_sk_scale_u8_ssse3_lowp+0x15>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  102,68,15,196,192,6                 // pinsrw        $0x6,%eax,%xmm8
@@ -47024,7 +47243,7 @@
   .byte  102,69,15,110,12,19                 // movd          (%r11,%rdx,1),%xmm9
   .byte  102,68,15,96,200                    // punpcklbw     %xmm0,%xmm9
   .byte  242,69,15,16,193                    // movsd         %xmm9,%xmm8
-  .byte  233,36,255,255,255                  // jmpq          11ef <_sk_scale_u8_ssse3_lowp+0x15>
+  .byte  233,36,255,255,255                  // jmpq          1217 <_sk_scale_u8_ssse3_lowp+0x15>
   .byte  144                                 // nop
   .byte  139,255                             // mov           %edi,%edi
   .byte  255                                 // (bad)
@@ -47052,14 +47271,14 @@
 _sk_lerp_1_float_ssse3_lowp:
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  243,68,15,16,0                      // movss         (%rax),%xmm8
-  .byte  243,68,15,88,5,128,10,0,0           // addss         0xa80(%rip),%xmm8        # 1d78 <_sk_xor__ssse3_lowp+0x3d7>
+  .byte  243,68,15,88,5,168,10,0,0           // addss         0xaa8(%rip),%xmm8        # 1dc8 <_sk_xor__ssse3_lowp+0x3ff>
   .byte  102,68,15,126,192                   // movd          %xmm8,%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
   .byte  242,69,15,112,192,0                 // pshuflw       $0x0,%xmm8,%xmm8
   .byte  102,69,15,112,192,80                // pshufd        $0x50,%xmm8,%xmm8
   .byte  102,65,15,56,11,192                 // pmulhrsw      %xmm8,%xmm0
   .byte  102,68,15,56,29,200                 // pabsw         %xmm0,%xmm9
-  .byte  102,68,15,111,21,141,9,0,0          // movdqa        0x98d(%rip),%xmm10        # 1cb0 <_sk_xor__ssse3_lowp+0x30f>
+  .byte  102,68,15,111,21,181,9,0,0          // movdqa        0x9b5(%rip),%xmm10        # 1d00 <_sk_xor__ssse3_lowp+0x337>
   .byte  102,69,15,249,208                   // psubw         %xmm8,%xmm10
   .byte  102,15,111,196                      // movdqa        %xmm4,%xmm0
   .byte  102,65,15,56,11,194                 // pmulhrsw      %xmm10,%xmm0
@@ -47092,14 +47311,14 @@
   .byte  72,173                              // lods          %ds:(%rsi),%rax
   .byte  76,139,24                           // mov           (%rax),%r11
   .byte  77,133,192                          // test          %r8,%r8
-  .byte  15,133,169,0,0,0                    // jne           1454 <_sk_lerp_u8_ssse3_lowp+0xb7>
+  .byte  15,133,169,0,0,0                    // jne           147c <_sk_lerp_u8_ssse3_lowp+0xb7>
   .byte  243,69,15,126,4,19                  // movq          (%r11,%rdx,1),%xmm8
   .byte  102,68,15,96,192                    // punpcklbw     %xmm0,%xmm8
   .byte  102,65,15,113,240,8                 // psllw         $0x8,%xmm8
-  .byte  102,68,15,228,5,251,8,0,0           // pmulhuw       0x8fb(%rip),%xmm8        # 1cc0 <_sk_xor__ssse3_lowp+0x31f>
+  .byte  102,68,15,228,5,35,9,0,0            // pmulhuw       0x923(%rip),%xmm8        # 1d10 <_sk_xor__ssse3_lowp+0x347>
   .byte  102,65,15,56,11,192                 // pmulhrsw      %xmm8,%xmm0
   .byte  102,68,15,56,29,200                 // pabsw         %xmm0,%xmm9
-  .byte  102,68,15,111,21,246,8,0,0          // movdqa        0x8f6(%rip),%xmm10        # 1cd0 <_sk_xor__ssse3_lowp+0x32f>
+  .byte  102,68,15,111,21,30,9,0,0           // movdqa        0x91e(%rip),%xmm10        # 1d20 <_sk_xor__ssse3_lowp+0x357>
   .byte  102,69,15,249,208                   // psubw         %xmm8,%xmm10
   .byte  102,15,111,196                      // movdqa        %xmm4,%xmm0
   .byte  102,65,15,56,11,194                 // pmulhrsw      %xmm10,%xmm0
@@ -47129,15 +47348,15 @@
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  65,254,201                          // dec           %r9b
   .byte  65,128,249,6                        // cmp           $0x6,%r9b
-  .byte  15,135,73,255,255,255               // ja            13b6 <_sk_lerp_u8_ssse3_lowp+0x19>
+  .byte  15,135,73,255,255,255               // ja            13de <_sk_lerp_u8_ssse3_lowp+0x19>
   .byte  69,15,182,201                       // movzbl        %r9b,%r9d
-  .byte  76,141,21,128,0,0,0                 // lea           0x80(%rip),%r10        # 14f8 <_sk_lerp_u8_ssse3_lowp+0x15b>
+  .byte  76,141,21,128,0,0,0                 // lea           0x80(%rip),%r10        # 1520 <_sk_lerp_u8_ssse3_lowp+0x15b>
   .byte  75,99,4,138                         // movslq        (%r10,%r9,4),%rax
   .byte  76,1,208                            // add           %r10,%rax
   .byte  255,224                             // jmpq          *%rax
   .byte  65,15,182,4,19                      // movzbl        (%r11,%rdx,1),%eax
   .byte  102,68,15,110,192                   // movd          %eax,%xmm8
-  .byte  233,38,255,255,255                  // jmpq          13b6 <_sk_lerp_u8_ssse3_lowp+0x19>
+  .byte  233,38,255,255,255                  // jmpq          13de <_sk_lerp_u8_ssse3_lowp+0x19>
   .byte  65,15,182,68,19,2                   // movzbl        0x2(%r11,%rdx,1),%eax
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  102,68,15,196,192,2                 // pinsrw        $0x2,%eax,%xmm8
@@ -47145,7 +47364,7 @@
   .byte  102,68,15,110,200                   // movd          %eax,%xmm9
   .byte  102,68,15,96,200                    // punpcklbw     %xmm0,%xmm9
   .byte  243,69,15,16,193                    // movss         %xmm9,%xmm8
-  .byte  233,252,254,255,255                 // jmpq          13b6 <_sk_lerp_u8_ssse3_lowp+0x19>
+  .byte  233,252,254,255,255                 // jmpq          13de <_sk_lerp_u8_ssse3_lowp+0x19>
   .byte  65,15,182,68,19,6                   // movzbl        0x6(%r11,%rdx,1),%eax
   .byte  102,69,15,239,192                   // pxor          %xmm8,%xmm8
   .byte  102,68,15,196,192,6                 // pinsrw        $0x6,%eax,%xmm8
@@ -47156,14 +47375,14 @@
   .byte  102,69,15,110,12,19                 // movd          (%r11,%rdx,1),%xmm9
   .byte  102,68,15,96,200                    // punpcklbw     %xmm0,%xmm9
   .byte  242,69,15,16,193                    // movsd         %xmm9,%xmm8
-  .byte  233,190,254,255,255                 // jmpq          13b6 <_sk_lerp_u8_ssse3_lowp+0x19>
+  .byte  233,190,254,255,255                 // jmpq          13de <_sk_lerp_u8_ssse3_lowp+0x19>
   .byte  137,255                             // mov           %edi,%edi
   .byte  255                                 // (bad)
   .byte  255,169,255,255,255,152             // ljmp          *-0x67000001(%rcx)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  235,255                             // jmp           1505 <_sk_lerp_u8_ssse3_lowp+0x168>
+  .byte  235,255                             // jmp           152d <_sk_lerp_u8_ssse3_lowp+0x168>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
   .byte  223,255                             // (bad)
@@ -47225,7 +47444,7 @@
 _sk_srcatop_ssse3_lowp:
   .byte  102,15,56,11,199                    // pmulhrsw      %xmm7,%xmm0
   .byte  102,68,15,56,29,192                 // pabsw         %xmm0,%xmm8
-  .byte  102,68,15,111,13,121,7,0,0          // movdqa        0x779(%rip),%xmm9        # 1ce0 <_sk_xor__ssse3_lowp+0x33f>
+  .byte  102,68,15,111,13,161,7,0,0          // movdqa        0x7a1(%rip),%xmm9        # 1d30 <_sk_xor__ssse3_lowp+0x367>
   .byte  102,68,15,249,203                   // psubw         %xmm3,%xmm9
   .byte  102,15,111,196                      // movdqa        %xmm4,%xmm0
   .byte  102,65,15,56,11,193                 // pmulhrsw      %xmm9,%xmm0
@@ -47258,7 +47477,7 @@
   .byte  102,68,15,111,196                   // movdqa        %xmm4,%xmm8
   .byte  102,68,15,56,11,195                 // pmulhrsw      %xmm3,%xmm8
   .byte  102,69,15,56,29,192                 // pabsw         %xmm8,%xmm8
-  .byte  102,68,15,111,13,248,6,0,0          // movdqa        0x6f8(%rip),%xmm9        # 1cf0 <_sk_xor__ssse3_lowp+0x34f>
+  .byte  102,68,15,111,13,32,7,0,0           // movdqa        0x720(%rip),%xmm9        # 1d40 <_sk_xor__ssse3_lowp+0x377>
   .byte  102,68,15,249,207                   // psubw         %xmm7,%xmm9
   .byte  102,65,15,56,11,193                 // pmulhrsw      %xmm9,%xmm0
   .byte  102,15,56,29,192                    // pabsw         %xmm0,%xmm0
@@ -47321,7 +47540,7 @@
 .globl _sk_srcout_ssse3_lowp
 FUNCTION(_sk_srcout_ssse3_lowp)
 _sk_srcout_ssse3_lowp:
-  .byte  102,68,15,111,5,30,6,0,0            // movdqa        0x61e(%rip),%xmm8        # 1d00 <_sk_xor__ssse3_lowp+0x35f>
+  .byte  102,68,15,111,5,70,6,0,0            // movdqa        0x646(%rip),%xmm8        # 1d50 <_sk_xor__ssse3_lowp+0x387>
   .byte  102,68,15,249,199                   // psubw         %xmm7,%xmm8
   .byte  102,65,15,56,11,192                 // pmulhrsw      %xmm8,%xmm0
   .byte  102,15,56,29,192                    // pabsw         %xmm0,%xmm0
@@ -47338,7 +47557,7 @@
 .globl _sk_dstout_ssse3_lowp
 FUNCTION(_sk_dstout_ssse3_lowp)
 _sk_dstout_ssse3_lowp:
-  .byte  102,68,15,111,5,239,5,0,0           // movdqa        0x5ef(%rip),%xmm8        # 1d10 <_sk_xor__ssse3_lowp+0x36f>
+  .byte  102,68,15,111,5,23,6,0,0            // movdqa        0x617(%rip),%xmm8        # 1d60 <_sk_xor__ssse3_lowp+0x397>
   .byte  102,68,15,249,195                   // psubw         %xmm3,%xmm8
   .byte  102,15,111,196                      // movdqa        %xmm4,%xmm0
   .byte  102,65,15,56,11,192                 // pmulhrsw      %xmm8,%xmm0
@@ -47358,7 +47577,7 @@
 .globl _sk_srcover_ssse3_lowp
 FUNCTION(_sk_srcover_ssse3_lowp)
 _sk_srcover_ssse3_lowp:
-  .byte  102,68,15,111,5,180,5,0,0           // movdqa        0x5b4(%rip),%xmm8        # 1d20 <_sk_xor__ssse3_lowp+0x37f>
+  .byte  102,68,15,111,5,220,5,0,0           // movdqa        0x5dc(%rip),%xmm8        # 1d70 <_sk_xor__ssse3_lowp+0x3a7>
   .byte  102,68,15,249,195                   // psubw         %xmm3,%xmm8
   .byte  102,68,15,111,204                   // movdqa        %xmm4,%xmm9
   .byte  102,69,15,56,11,200                 // pmulhrsw      %xmm8,%xmm9
@@ -47382,7 +47601,7 @@
 .globl _sk_dstover_ssse3_lowp
 FUNCTION(_sk_dstover_ssse3_lowp)
 _sk_dstover_ssse3_lowp:
-  .byte  102,68,15,111,5,95,5,0,0            // movdqa        0x55f(%rip),%xmm8        # 1d30 <_sk_xor__ssse3_lowp+0x38f>
+  .byte  102,68,15,111,5,135,5,0,0           // movdqa        0x587(%rip),%xmm8        # 1d80 <_sk_xor__ssse3_lowp+0x3b7>
   .byte  102,68,15,249,199                   // psubw         %xmm7,%xmm8
   .byte  102,65,15,56,11,192                 // pmulhrsw      %xmm8,%xmm0
   .byte  102,15,56,29,192                    // pabsw         %xmm0,%xmm0
@@ -47418,7 +47637,7 @@
 .globl _sk_multiply_ssse3_lowp
 FUNCTION(_sk_multiply_ssse3_lowp)
 _sk_multiply_ssse3_lowp:
-  .byte  102,68,15,111,5,244,4,0,0           // movdqa        0x4f4(%rip),%xmm8        # 1d40 <_sk_xor__ssse3_lowp+0x39f>
+  .byte  102,68,15,111,5,28,5,0,0            // movdqa        0x51c(%rip),%xmm8        # 1d90 <_sk_xor__ssse3_lowp+0x3c7>
   .byte  102,69,15,111,200                   // movdqa        %xmm8,%xmm9
   .byte  102,68,15,249,207                   // psubw         %xmm7,%xmm9
   .byte  102,68,15,111,208                   // movdqa        %xmm0,%xmm10
@@ -47467,7 +47686,7 @@
 .globl _sk_screen_ssse3_lowp
 FUNCTION(_sk_screen_ssse3_lowp)
 _sk_screen_ssse3_lowp:
-  .byte  102,68,15,111,5,26,4,0,0            // movdqa        0x41a(%rip),%xmm8        # 1d50 <_sk_xor__ssse3_lowp+0x3af>
+  .byte  102,68,15,111,5,66,4,0,0            // movdqa        0x442(%rip),%xmm8        # 1da0 <_sk_xor__ssse3_lowp+0x3d7>
   .byte  102,69,15,111,200                   // movdqa        %xmm8,%xmm9
   .byte  102,68,15,249,200                   // psubw         %xmm0,%xmm9
   .byte  102,68,15,56,11,204                 // pmulhrsw      %xmm4,%xmm9
@@ -47494,7 +47713,7 @@
 .globl _sk_xor__ssse3_lowp
 FUNCTION(_sk_xor__ssse3_lowp)
 _sk_xor__ssse3_lowp:
-  .byte  102,68,15,111,5,182,3,0,0           // movdqa        0x3b6(%rip),%xmm8        # 1d60 <_sk_xor__ssse3_lowp+0x3bf>
+  .byte  102,68,15,111,5,222,3,0,0           // movdqa        0x3de(%rip),%xmm8        # 1db0 <_sk_xor__ssse3_lowp+0x3e7>
   .byte  102,69,15,111,200                   // movdqa        %xmm8,%xmm9
   .byte  102,68,15,249,207                   // psubw         %xmm7,%xmm9
   .byte  102,65,15,56,11,193                 // pmulhrsw      %xmm9,%xmm0
@@ -47529,7 +47748,13 @@
   .byte  128,67,0,0                          // addb          $0x0,0x0(%rbx)
   .byte  128,67,0,0                          // addb          $0x0,0x0(%rbx)
   .byte  128,67,0,0                          // addb          $0x0,0x0(%rbx)
-  .byte  128,67,0,1                          // addb          $0x1,0x0(%rbx)
+  .byte  128,67,0,128                        // addb          $0x80,0x0(%rbx)
+  .byte  0,128,0,128,0,128                   // add           %al,-0x7fff8000(%rax)
+  .byte  0,128,0,128,0,128                   // add           %al,-0x7fff8000(%rax)
+  .byte  0,128,0,128,0,128                   // add           %al,-0x7fff8000(%rax)
+  .byte  0,128,0,128,0,128                   // add           %al,-0x7fff8000(%rax)
+  .byte  0,128,0,128,0,128                   // add           %al,-0x7fff8000(%rax)
+  .byte  0,1                                 // add           %al,(%rcx)
   .byte  4,5                                 // add           $0x5,%al
   .byte  8,9                                 // or            %cl,(%rcx)
   .byte  12,13                               // or            $0xd,%al
@@ -47537,7 +47762,7 @@
   .byte  12,13                               // or            $0xd,%al
   .byte  12,13                               // or            $0xd,%al
   .byte  14                                  // (bad)
-  .byte  15,129,128,129,128,129              // jno           ffffffff81809be5 <_sk_xor__ssse3_lowp+0xffffffff81808244>
+  .byte  15,129,128,129,128,129              // jno           ffffffff81809c35 <_sk_xor__ssse3_lowp+0xffffffff8180826c>
   .byte  128,129,128,129,128,129,128         // addb          $0x80,-0x7e7f7e80(%rcx)
   .byte  129,128,129,128,1,2,5,6,9,10        // addl          $0xa090605,0x2018081(%rax)
   .byte  13,14,9,10,13                       // or            $0xd0a090e,%eax
@@ -47566,7 +47791,7 @@
   .byte  12,13                               // or            $0xd,%al
   .byte  12,13                               // or            $0xd,%al
   .byte  14                                  // (bad)
-  .byte  15,129,128,129,128,129              // jno           ffffffff81809c35 <_sk_xor__ssse3_lowp+0xffffffff81808294>
+  .byte  15,129,128,129,128,129              // jno           ffffffff81809c85 <_sk_xor__ssse3_lowp+0xffffffff818082bc>
   .byte  128,129,128,129,128,129,128         // addb          $0x80,-0x7e7f7e80(%rcx)
   .byte  129,128,129,128,1,2,5,6,9,10        // addl          $0xa090605,0x2018081(%rax)
   .byte  13,14,9,10,13                       // or            $0xd0a090e,%eax
@@ -47606,7 +47831,7 @@
   .byte  12,13                               // or            $0xd,%al
   .byte  12,13                               // or            $0xd,%al
   .byte  14                                  // (bad)
-  .byte  15,129,128,129,128,129              // jno           ffffffff81809c95 <_sk_xor__ssse3_lowp+0xffffffff818082f4>
+  .byte  15,129,128,129,128,129              // jno           ffffffff81809ce5 <_sk_xor__ssse3_lowp+0xffffffff8180831c>
   .byte  128,129,128,129,128,129,128         // addb          $0x80,-0x7e7f7e80(%rcx)
   .byte  129,128,129,128,1,2,5,6,9,10        // addl          $0xa090605,0x2018081(%rax)
   .byte  13,14,9,10,13                       // or            $0xd0a090e,%eax
@@ -47635,7 +47860,7 @@
   .byte  12,13                               // or            $0xd,%al
   .byte  12,13                               // or            $0xd,%al
   .byte  14                                  // (bad)
-  .byte  15,129,128,129,128,129              // jno           ffffffff81809ce5 <_sk_xor__ssse3_lowp+0xffffffff81808344>
+  .byte  15,129,128,129,128,129              // jno           ffffffff81809d35 <_sk_xor__ssse3_lowp+0xffffffff8180836c>
   .byte  128,129,128,129,128,129,128         // addb          $0x80,-0x7e7f7e80(%rcx)
   .byte  129,128,129,128,1,2,5,6,9,10        // addl          $0xa090605,0x2018081(%rax)
   .byte  13,14,9,10,13                       // or            $0xd0a090e,%eax
@@ -47859,7 +48084,7 @@
   .byte  102,15,110,199                      // movd          %edi,%xmm0
   .byte  102,15,112,192,0                    // pshufd        $0x0,%xmm0,%xmm0
   .byte  15,91,200                           // cvtdq2ps      %xmm0,%xmm1
-  .byte  15,40,145,132,144,0,0               // movaps        0x9084(%ecx),%xmm2
+  .byte  15,40,145,116,145,0,0               // movaps        0x9174(%ecx),%xmm2
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  15,16,0                             // movups        (%eax),%xmm0
   .byte  15,88,193                           // addps         %xmm1,%xmm0
@@ -47881,7 +48106,7 @@
   .byte  137,68,36,4                         // mov           %eax,0x4(%esp)
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  137,4,36                            // mov           %eax,(%esp)
-  .byte  15,40,145,148,144,0,0               // movaps        0x9094(%ecx),%xmm2
+  .byte  15,40,145,132,145,0,0               // movaps        0x9184(%ecx),%xmm2
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  255,19                              // call          *(%ebx)
   .byte  131,196,108                         // add           $0x6c,%esp
@@ -47917,15 +48142,15 @@
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  102,15,112,252,0                    // pshufd        $0x0,%xmm4,%xmm7
   .byte  102,15,239,253                      // pxor          %xmm5,%xmm7
-  .byte  102,15,111,182,5,144,0,0            // movdqa        0x9005(%esi),%xmm6
+  .byte  102,15,111,182,245,144,0,0          // movdqa        0x90f5(%esi),%xmm6
   .byte  102,15,111,207                      // movdqa        %xmm7,%xmm1
   .byte  102,15,219,206                      // pand          %xmm6,%xmm1
   .byte  102,15,219,245                      // pand          %xmm5,%xmm6
-  .byte  102,15,111,134,37,144,0,0           // movdqa        0x9025(%esi),%xmm0
+  .byte  102,15,111,134,21,145,0,0           // movdqa        0x9115(%esi),%xmm0
   .byte  102,15,111,231                      // movdqa        %xmm7,%xmm4
   .byte  102,15,219,224                      // pand          %xmm0,%xmm4
   .byte  102,15,219,197                      // pand          %xmm5,%xmm0
-  .byte  102,15,111,158,21,144,0,0           // movdqa        0x9015(%esi),%xmm3
+  .byte  102,15,111,158,5,145,0,0            // movdqa        0x9105(%esi),%xmm3
   .byte  102,15,219,251                      // pand          %xmm3,%xmm7
   .byte  102,15,219,235                      // pand          %xmm3,%xmm5
   .byte  102,15,114,246,4                    // pslld         $0x4,%xmm6
@@ -47941,8 +48166,8 @@
   .byte  102,15,235,224                      // por           %xmm0,%xmm4
   .byte  102,15,235,231                      // por           %xmm7,%xmm4
   .byte  15,91,196                           // cvtdq2ps      %xmm4,%xmm0
-  .byte  15,89,134,53,144,0,0                // mulps         0x9035(%esi),%xmm0
-  .byte  15,88,134,69,144,0,0                // addps         0x9045(%esi),%xmm0
+  .byte  15,89,134,37,145,0,0                // mulps         0x9125(%esi),%xmm0
+  .byte  15,88,134,53,145,0,0                // addps         0x9135(%esi),%xmm0
   .byte  139,55                              // mov           (%edi),%esi
   .byte  243,15,16,14                        // movss         (%esi),%xmm1
   .byte  139,117,24                          // mov           0x18(%ebp),%esi
@@ -47987,10 +48212,10 @@
   .byte  93                                  // pop           %ebp
   .byte  195                                 // ret
 
-HIDDEN _sk_constant_color_sse2
-.globl _sk_constant_color_sse2
-FUNCTION(_sk_constant_color_sse2)
-_sk_constant_color_sse2:
+HIDDEN _sk_uniform_color_sse2
+.globl _sk_uniform_color_sse2
+FUNCTION(_sk_uniform_color_sse2)
+_sk_uniform_color_sse2:
   .byte  85                                  // push          %ebp
   .byte  137,229                             // mov           %esp,%ebp
   .byte  83                                  // push          %ebx
@@ -48033,6 +48258,92 @@
   .byte  93                                  // pop           %ebp
   .byte  195                                 // ret
 
+HIDDEN _sk_black_color_sse2
+.globl _sk_black_color_sse2
+FUNCTION(_sk_black_color_sse2)
+_sk_black_color_sse2:
+  .byte  85                                  // push          %ebp
+  .byte  137,229                             // mov           %esp,%ebp
+  .byte  83                                  // push          %ebx
+  .byte  87                                  // push          %edi
+  .byte  86                                  // push          %esi
+  .byte  131,236,108                         // sub           $0x6c,%esp
+  .byte  232,0,0,0,0                         // call          2e0 <_sk_black_color_sse2+0xe>
+  .byte  89                                  // pop           %ecx
+  .byte  139,85,16                           // mov           0x10(%ebp),%edx
+  .byte  139,117,20                          // mov           0x14(%ebp),%esi
+  .byte  139,125,24                          // mov           0x18(%ebp),%edi
+  .byte  15,40,69,40                         // movaps        0x28(%ebp),%xmm0
+  .byte  15,40,77,56                         // movaps        0x38(%ebp),%xmm1
+  .byte  15,40,85,72                         // movaps        0x48(%ebp),%xmm2
+  .byte  15,40,93,88                         // movaps        0x58(%ebp),%xmm3
+  .byte  139,93,12                           // mov           0xc(%ebp),%ebx
+  .byte  141,67,4                            // lea           0x4(%ebx),%eax
+  .byte  15,41,92,36,80                      // movaps        %xmm3,0x50(%esp)
+  .byte  15,41,84,36,64                      // movaps        %xmm2,0x40(%esp)
+  .byte  15,41,76,36,48                      // movaps        %xmm1,0x30(%esp)
+  .byte  15,41,68,36,32                      // movaps        %xmm0,0x20(%esp)
+  .byte  137,124,36,16                       // mov           %edi,0x10(%esp)
+  .byte  137,116,36,12                       // mov           %esi,0xc(%esp)
+  .byte  137,84,36,8                         // mov           %edx,0x8(%esp)
+  .byte  137,68,36,4                         // mov           %eax,0x4(%esp)
+  .byte  139,69,8                            // mov           0x8(%ebp),%eax
+  .byte  137,4,36                            // mov           %eax,(%esp)
+  .byte  15,40,153,128,143,0,0               // movaps        0x8f80(%ecx),%xmm3
+  .byte  15,87,192                           // xorps         %xmm0,%xmm0
+  .byte  15,87,201                           // xorps         %xmm1,%xmm1
+  .byte  15,87,210                           // xorps         %xmm2,%xmm2
+  .byte  255,19                              // call          *(%ebx)
+  .byte  131,196,108                         // add           $0x6c,%esp
+  .byte  94                                  // pop           %esi
+  .byte  95                                  // pop           %edi
+  .byte  91                                  // pop           %ebx
+  .byte  93                                  // pop           %ebp
+  .byte  195                                 // ret
+
+HIDDEN _sk_white_color_sse2
+.globl _sk_white_color_sse2
+FUNCTION(_sk_white_color_sse2)
+_sk_white_color_sse2:
+  .byte  85                                  // push          %ebp
+  .byte  137,229                             // mov           %esp,%ebp
+  .byte  83                                  // push          %ebx
+  .byte  87                                  // push          %edi
+  .byte  86                                  // push          %esi
+  .byte  131,236,108                         // sub           $0x6c,%esp
+  .byte  232,0,0,0,0                         // call          352 <_sk_white_color_sse2+0xe>
+  .byte  89                                  // pop           %ecx
+  .byte  139,85,16                           // mov           0x10(%ebp),%edx
+  .byte  139,117,20                          // mov           0x14(%ebp),%esi
+  .byte  139,125,24                          // mov           0x18(%ebp),%edi
+  .byte  15,40,69,40                         // movaps        0x28(%ebp),%xmm0
+  .byte  15,40,77,56                         // movaps        0x38(%ebp),%xmm1
+  .byte  15,40,85,72                         // movaps        0x48(%ebp),%xmm2
+  .byte  15,40,93,88                         // movaps        0x58(%ebp),%xmm3
+  .byte  139,93,12                           // mov           0xc(%ebp),%ebx
+  .byte  141,67,4                            // lea           0x4(%ebx),%eax
+  .byte  15,41,92,36,80                      // movaps        %xmm3,0x50(%esp)
+  .byte  15,41,84,36,64                      // movaps        %xmm2,0x40(%esp)
+  .byte  15,41,76,36,48                      // movaps        %xmm1,0x30(%esp)
+  .byte  15,41,68,36,32                      // movaps        %xmm0,0x20(%esp)
+  .byte  137,124,36,16                       // mov           %edi,0x10(%esp)
+  .byte  137,116,36,12                       // mov           %esi,0xc(%esp)
+  .byte  137,84,36,8                         // mov           %edx,0x8(%esp)
+  .byte  137,68,36,4                         // mov           %eax,0x4(%esp)
+  .byte  139,69,8                            // mov           0x8(%ebp),%eax
+  .byte  137,4,36                            // mov           %eax,(%esp)
+  .byte  15,40,129,30,143,0,0                // movaps        0x8f1e(%ecx),%xmm0
+  .byte  15,40,200                           // movaps        %xmm0,%xmm1
+  .byte  15,40,208                           // movaps        %xmm0,%xmm2
+  .byte  15,40,216                           // movaps        %xmm0,%xmm3
+  .byte  255,19                              // call          *(%ebx)
+  .byte  131,196,108                         // add           $0x6c,%esp
+  .byte  94                                  // pop           %esi
+  .byte  95                                  // pop           %edi
+  .byte  91                                  // pop           %ebx
+  .byte  93                                  // pop           %ebp
+  .byte  195                                 // ret
+
 HIDDEN _sk_load_rgba_sse2
 .globl _sk_load_rgba_sse2
 FUNCTION(_sk_load_rgba_sse2)
@@ -48171,11 +48482,11 @@
   .byte  15,40,234                           // movaps        %xmm2,%xmm5
   .byte  15,40,225                           // movaps        %xmm1,%xmm4
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
-  .byte  232,0,0,0,0                         // call          42d <_sk_srcatop_sse2+0x17>
+  .byte  232,0,0,0,0                         // call          511 <_sk_srcatop_sse2+0x17>
   .byte  88                                  // pop           %eax
   .byte  15,40,69,88                         // movaps        0x58(%ebp),%xmm0
   .byte  15,89,208                           // mulps         %xmm0,%xmm2
-  .byte  15,40,136,67,141,0,0                // movaps        0x8d43(%eax),%xmm1
+  .byte  15,40,136,111,141,0,0               // movaps        0x8d6f(%eax),%xmm1
   .byte  15,92,203                           // subps         %xmm3,%xmm1
   .byte  15,40,249                           // movaps        %xmm1,%xmm7
   .byte  15,89,125,40                        // mulps         0x28(%ebp),%xmm7
@@ -48232,11 +48543,11 @@
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
   .byte  15,40,235                           // movaps        %xmm3,%xmm5
-  .byte  232,0,0,0,0                         // call          4d7 <_sk_dstatop_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          5bb <_sk_dstatop_sse2+0x11>
   .byte  88                                  // pop           %eax
   .byte  15,40,245                           // movaps        %xmm5,%xmm6
   .byte  15,89,117,40                        // mulps         0x28(%ebp),%xmm6
-  .byte  15,40,184,169,140,0,0               // movaps        0x8ca9(%eax),%xmm7
+  .byte  15,40,184,213,140,0,0               // movaps        0x8cd5(%eax),%xmm7
   .byte  15,92,125,88                        // subps         0x58(%ebp),%xmm7
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
   .byte  15,88,198                           // addps         %xmm6,%xmm0
@@ -48373,7 +48684,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          64b <_sk_srcout_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          72f <_sk_srcout_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -48382,7 +48693,7 @@
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
   .byte  15,40,109,56                        // movaps        0x38(%ebp),%xmm5
   .byte  15,40,117,88                        // movaps        0x58(%ebp),%xmm6
-  .byte  15,40,184,69,139,0,0                // movaps        0x8b45(%eax),%xmm7
+  .byte  15,40,184,113,139,0,0               // movaps        0x8b71(%eax),%xmm7
   .byte  15,92,254                           // subps         %xmm6,%xmm7
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
   .byte  15,89,207                           // mulps         %xmm7,%xmm1
@@ -48418,13 +48729,13 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          6c3 <_sk_dstout_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          7a7 <_sk_dstout_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
-  .byte  15,40,160,221,138,0,0               // movaps        0x8add(%eax),%xmm4
+  .byte  15,40,160,9,139,0,0                 // movaps        0x8b09(%eax),%xmm4
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  15,40,109,88                        // movaps        0x58(%ebp),%xmm5
   .byte  15,40,117,72                        // movaps        0x48(%ebp),%xmm6
@@ -48471,10 +48782,10 @@
   .byte  15,40,226                           // movaps        %xmm2,%xmm4
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
-  .byte  232,0,0,0,0                         // call          753 <_sk_srcover_sse2+0x17>
+  .byte  232,0,0,0,0                         // call          837 <_sk_srcover_sse2+0x17>
   .byte  88                                  // pop           %eax
   .byte  15,40,109,40                        // movaps        0x28(%ebp),%xmm5
-  .byte  15,40,128,93,138,0,0                // movaps        0x8a5d(%eax),%xmm0
+  .byte  15,40,128,137,138,0,0               // movaps        0x8a89(%eax),%xmm0
   .byte  15,92,195                           // subps         %xmm3,%xmm0
   .byte  15,40,248                           // movaps        %xmm0,%xmm7
   .byte  15,89,253                           // mulps         %xmm5,%xmm7
@@ -48526,13 +48837,13 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          7ea <_sk_dstover_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8ce <_sk_dstover_sse2+0xe>
   .byte  90                                  // pop           %edx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
-  .byte  15,40,162,214,137,0,0               // movaps        0x89d6(%edx),%xmm4
+  .byte  15,40,162,2,138,0,0                 // movaps        0x8a02(%edx),%xmm4
   .byte  139,85,12                           // mov           0xc(%ebp),%edx
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
   .byte  15,40,117,56                        // movaps        0x38(%ebp),%xmm6
@@ -48618,9 +48929,9 @@
   .byte  129,236,140,0,0,0                   // sub           $0x8c,%esp
   .byte  15,41,85,200                        // movaps        %xmm2,-0x38(%ebp)
   .byte  15,40,232                           // movaps        %xmm0,%xmm5
-  .byte  232,0,0,0,0                         // call          8e0 <_sk_multiply_sse2+0x18>
+  .byte  232,0,0,0,0                         // call          9c4 <_sk_multiply_sse2+0x18>
   .byte  88                                  // pop           %eax
-  .byte  15,40,144,240,136,0,0               // movaps        0x88f0(%eax),%xmm2
+  .byte  15,40,144,28,137,0,0                // movaps        0x891c(%eax),%xmm2
   .byte  15,40,250                           // movaps        %xmm2,%xmm7
   .byte  15,92,125,88                        // subps         0x58(%ebp),%xmm7
   .byte  15,40,231                           // movaps        %xmm7,%xmm4
@@ -48794,9 +49105,9 @@
   .byte  86                                  // push          %esi
   .byte  131,236,124                         // sub           $0x7c,%esp
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
-  .byte  232,0,0,0,0                         // call          ac7 <_sk_xor__sse2+0x12>
+  .byte  232,0,0,0,0                         // call          bab <_sk_xor__sse2+0x12>
   .byte  88                                  // pop           %eax
-  .byte  15,40,176,25,135,0,0                // movaps        0x8719(%eax),%xmm6
+  .byte  15,40,176,69,135,0,0                // movaps        0x8745(%eax),%xmm6
   .byte  15,40,254                           // movaps        %xmm6,%xmm7
   .byte  15,92,125,88                        // subps         0x58(%ebp),%xmm7
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
@@ -48880,9 +49191,9 @@
   .byte  15,95,213                           // maxps         %xmm5,%xmm2
   .byte  15,88,227                           // addps         %xmm3,%xmm4
   .byte  15,92,226                           // subps         %xmm2,%xmm4
-  .byte  232,0,0,0,0                         // call          bc1 <_sk_darken_sse2+0x63>
+  .byte  232,0,0,0,0                         // call          ca5 <_sk_darken_sse2+0x63>
   .byte  88                                  // pop           %eax
-  .byte  15,40,144,47,134,0,0                // movaps        0x862f(%eax),%xmm2
+  .byte  15,40,144,91,134,0,0                // movaps        0x865b(%eax),%xmm2
   .byte  15,92,214                           // subps         %xmm6,%xmm2
   .byte  15,40,109,88                        // movaps        0x58(%ebp),%xmm5
   .byte  15,89,213                           // mulps         %xmm5,%xmm2
@@ -48950,9 +49261,9 @@
   .byte  15,93,213                           // minps         %xmm5,%xmm2
   .byte  15,88,227                           // addps         %xmm3,%xmm4
   .byte  15,92,226                           // subps         %xmm2,%xmm4
-  .byte  232,0,0,0,0                         // call          c86 <_sk_lighten_sse2+0x63>
+  .byte  232,0,0,0,0                         // call          d6a <_sk_lighten_sse2+0x63>
   .byte  88                                  // pop           %eax
-  .byte  15,40,144,122,133,0,0               // movaps        0x857a(%eax),%xmm2
+  .byte  15,40,144,166,133,0,0               // movaps        0x85a6(%eax),%xmm2
   .byte  15,92,214                           // subps         %xmm6,%xmm2
   .byte  15,40,109,88                        // movaps        0x58(%ebp),%xmm5
   .byte  15,89,213                           // mulps         %xmm5,%xmm2
@@ -49023,9 +49334,9 @@
   .byte  15,88,227                           // addps         %xmm3,%xmm4
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  15,92,226                           // subps         %xmm2,%xmm4
-  .byte  232,0,0,0,0                         // call          d54 <_sk_difference_sse2+0x6c>
+  .byte  232,0,0,0,0                         // call          e38 <_sk_difference_sse2+0x6c>
   .byte  88                                  // pop           %eax
-  .byte  15,40,144,188,132,0,0               // movaps        0x84bc(%eax),%xmm2
+  .byte  15,40,144,232,132,0,0               // movaps        0x84e8(%eax),%xmm2
   .byte  15,92,214                           // subps         %xmm6,%xmm2
   .byte  15,40,109,88                        // movaps        0x58(%ebp),%xmm5
   .byte  15,89,213                           // mulps         %xmm5,%xmm2
@@ -49068,7 +49379,7 @@
   .byte  131,236,108                         // sub           $0x6c,%esp
   .byte  15,40,225                           // movaps        %xmm1,%xmm4
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
-  .byte  232,0,0,0,0                         // call          dca <_sk_exclusion_sse2+0x14>
+  .byte  232,0,0,0,0                         // call          eae <_sk_exclusion_sse2+0x14>
   .byte  88                                  // pop           %eax
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
   .byte  15,40,117,56                        // movaps        0x38(%ebp),%xmm6
@@ -49087,7 +49398,7 @@
   .byte  15,89,213                           // mulps         %xmm5,%xmm2
   .byte  15,88,210                           // addps         %xmm2,%xmm2
   .byte  15,92,226                           // subps         %xmm2,%xmm4
-  .byte  15,40,144,86,132,0,0                // movaps        0x8456(%eax),%xmm2
+  .byte  15,40,144,130,132,0,0               // movaps        0x8482(%eax),%xmm2
   .byte  15,92,211                           // subps         %xmm3,%xmm2
   .byte  15,40,109,88                        // movaps        0x58(%ebp),%xmm5
   .byte  15,89,213                           // mulps         %xmm5,%xmm2
@@ -49130,7 +49441,7 @@
   .byte  15,41,85,168                        // movaps        %xmm2,-0x58(%ebp)
   .byte  15,41,77,200                        // movaps        %xmm1,-0x38(%ebp)
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
-  .byte  232,0,0,0,0                         // call          e7b <_sk_colorburn_sse2+0x1c>
+  .byte  232,0,0,0,0                         // call          f5f <_sk_colorburn_sse2+0x1c>
   .byte  88                                  // pop           %eax
   .byte  15,40,101,88                        // movaps        0x58(%ebp),%xmm4
   .byte  15,40,196                           // movaps        %xmm4,%xmm0
@@ -49143,7 +49454,7 @@
   .byte  15,40,196                           // movaps        %xmm4,%xmm0
   .byte  15,40,232                           // movaps        %xmm0,%xmm5
   .byte  15,92,238                           // subps         %xmm6,%xmm5
-  .byte  15,40,176,181,131,0,0               // movaps        0x83b5(%eax),%xmm6
+  .byte  15,40,176,225,131,0,0               // movaps        0x83e1(%eax),%xmm6
   .byte  15,40,230                           // movaps        %xmm6,%xmm4
   .byte  15,92,224                           // subps         %xmm0,%xmm4
   .byte  15,40,220                           // movaps        %xmm4,%xmm3
@@ -49275,7 +49586,7 @@
   .byte  15,41,85,168                        // movaps        %xmm2,-0x58(%ebp)
   .byte  15,41,77,184                        // movaps        %xmm1,-0x48(%ebp)
   .byte  15,40,232                           // movaps        %xmm0,%xmm5
-  .byte  232,0,0,0,0                         // call          103d <_sk_colordodge_sse2+0x1f>
+  .byte  232,0,0,0,0                         // call          1121 <_sk_colordodge_sse2+0x1f>
   .byte  88                                  // pop           %eax
   .byte  15,40,69,88                         // movaps        0x58(%ebp),%xmm0
   .byte  15,40,77,40                         // movaps        0x28(%ebp),%xmm1
@@ -49286,7 +49597,7 @@
   .byte  15,94,212                           // divps         %xmm4,%xmm2
   .byte  15,40,224                           // movaps        %xmm0,%xmm4
   .byte  15,93,226                           // minps         %xmm2,%xmm4
-  .byte  15,40,152,3,130,0,0                 // movaps        0x8203(%eax),%xmm3
+  .byte  15,40,152,47,130,0,0                // movaps        0x822f(%eax),%xmm3
   .byte  15,40,211                           // movaps        %xmm3,%xmm2
   .byte  15,92,208                           // subps         %xmm0,%xmm2
   .byte  15,41,85,216                        // movaps        %xmm2,-0x28(%ebp)
@@ -49410,9 +49721,9 @@
   .byte  15,40,250                           // movaps        %xmm2,%xmm7
   .byte  15,40,233                           // movaps        %xmm1,%xmm5
   .byte  15,40,224                           // movaps        %xmm0,%xmm4
-  .byte  232,0,0,0,0                         // call          11df <_sk_hardlight_sse2+0x1a>
+  .byte  232,0,0,0,0                         // call          12c3 <_sk_hardlight_sse2+0x1a>
   .byte  88                                  // pop           %eax
-  .byte  15,40,176,113,128,0,0               // movaps        0x8071(%eax),%xmm6
+  .byte  15,40,176,157,128,0,0               // movaps        0x809d(%eax),%xmm6
   .byte  15,40,206                           // movaps        %xmm6,%xmm1
   .byte  15,92,77,88                         // subps         0x58(%ebp),%xmm1
   .byte  15,41,77,184                        // movaps        %xmm1,-0x48(%ebp)
@@ -49536,10 +49847,10 @@
   .byte  129,236,156,0,0,0                   // sub           $0x9c,%esp
   .byte  15,41,85,184                        // movaps        %xmm2,-0x48(%ebp)
   .byte  15,40,224                           // movaps        %xmm0,%xmm4
-  .byte  232,0,0,0,0                         // call          136a <_sk_overlay_sse2+0x18>
+  .byte  232,0,0,0,0                         // call          144e <_sk_overlay_sse2+0x18>
   .byte  88                                  // pop           %eax
   .byte  15,40,69,88                         // movaps        0x58(%ebp),%xmm0
-  .byte  15,40,144,246,126,0,0               // movaps        0x7ef6(%eax),%xmm2
+  .byte  15,40,144,34,127,0,0                // movaps        0x7f22(%eax),%xmm2
   .byte  15,40,234                           // movaps        %xmm2,%xmm5
   .byte  15,92,232                           // subps         %xmm0,%xmm5
   .byte  15,40,248                           // movaps        %xmm0,%xmm7
@@ -49680,20 +49991,20 @@
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  15,89,210                           // mulps         %xmm2,%xmm2
   .byte  15,88,208                           // addps         %xmm0,%xmm2
-  .byte  232,0,0,0,0                         // call          1539 <_sk_softlight_sse2+0x51>
+  .byte  232,0,0,0,0                         // call          161d <_sk_softlight_sse2+0x51>
   .byte  88                                  // pop           %eax
   .byte  15,40,233                           // movaps        %xmm1,%xmm5
-  .byte  15,40,128,71,125,0,0                // movaps        0x7d47(%eax),%xmm0
+  .byte  15,40,128,115,125,0,0               // movaps        0x7d73(%eax),%xmm0
   .byte  15,41,133,120,255,255,255           // movaps        %xmm0,-0x88(%ebp)
   .byte  15,88,232                           // addps         %xmm0,%xmm5
   .byte  15,89,234                           // mulps         %xmm2,%xmm5
-  .byte  15,40,184,55,125,0,0                // movaps        0x7d37(%eax),%xmm7
+  .byte  15,40,184,99,125,0,0                // movaps        0x7d63(%eax),%xmm7
   .byte  15,41,125,216                       // movaps        %xmm7,-0x28(%ebp)
   .byte  15,92,249                           // subps         %xmm1,%xmm7
   .byte  15,82,209                           // rsqrtps       %xmm1,%xmm2
   .byte  15,83,242                           // rcpps         %xmm2,%xmm6
   .byte  15,92,241                           // subps         %xmm1,%xmm6
-  .byte  15,40,128,87,125,0,0                // movaps        0x7d57(%eax),%xmm0
+  .byte  15,40,128,131,125,0,0               // movaps        0x7d83(%eax),%xmm0
   .byte  15,41,69,168                        // movaps        %xmm0,-0x58(%ebp)
   .byte  15,89,200                           // mulps         %xmm0,%xmm1
   .byte  15,88,205                           // addps         %xmm5,%xmm1
@@ -49899,14 +50210,14 @@
   .byte  15,40,226                           // movaps        %xmm2,%xmm4
   .byte  15,93,231                           // minps         %xmm7,%xmm4
   .byte  15,92,220                           // subps         %xmm4,%xmm3
-  .byte  232,0,0,0,0                         // call          180a <_sk_hue_sse2+0x3f>
+  .byte  232,0,0,0,0                         // call          18ee <_sk_hue_sse2+0x3f>
   .byte  88                                  // pop           %eax
   .byte  15,40,224                           // movaps        %xmm0,%xmm4
   .byte  15,89,230                           // mulps         %xmm6,%xmm4
   .byte  15,41,101,200                       // movaps        %xmm4,-0x38(%ebp)
   .byte  15,40,233                           // movaps        %xmm1,%xmm5
   .byte  15,89,238                           // mulps         %xmm6,%xmm5
-  .byte  15,40,184,198,122,0,0               // movaps        0x7ac6(%eax),%xmm7
+  .byte  15,40,184,242,122,0,0               // movaps        0x7af2(%eax),%xmm7
   .byte  15,41,125,168                       // movaps        %xmm7,-0x58(%ebp)
   .byte  15,92,125,88                        // subps         0x58(%ebp),%xmm7
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
@@ -49936,15 +50247,15 @@
   .byte  15,89,243                           // mulps         %xmm3,%xmm6
   .byte  15,89,235                           // mulps         %xmm3,%xmm5
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,40,152,150,122,0,0               // movaps        0x7a96(%eax),%xmm3
+  .byte  15,40,152,194,122,0,0               // movaps        0x7ac2(%eax),%xmm3
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
   .byte  15,40,77,40                         // movaps        0x28(%ebp),%xmm1
   .byte  15,89,203                           // mulps         %xmm3,%xmm1
-  .byte  15,40,160,166,122,0,0               // movaps        0x7aa6(%eax),%xmm4
+  .byte  15,40,160,210,122,0,0               // movaps        0x7ad2(%eax),%xmm4
   .byte  15,40,125,56                        // movaps        0x38(%ebp),%xmm7
   .byte  15,89,252                           // mulps         %xmm4,%xmm7
   .byte  15,88,249                           // addps         %xmm1,%xmm7
-  .byte  15,40,152,182,122,0,0               // movaps        0x7ab6(%eax),%xmm3
+  .byte  15,40,152,226,122,0,0               // movaps        0x7ae2(%eax),%xmm3
   .byte  15,40,77,72                         // movaps        0x48(%ebp),%xmm1
   .byte  15,89,203                           // mulps         %xmm3,%xmm1
   .byte  15,88,207                           // addps         %xmm7,%xmm1
@@ -50157,17 +50468,17 @@
   .byte  15,89,238                           // mulps         %xmm6,%xmm5
   .byte  15,89,222                           // mulps         %xmm6,%xmm3
   .byte  15,89,254                           // mulps         %xmm6,%xmm7
-  .byte  232,0,0,0,0                         // call          1b58 <_sk_saturation_sse2+0x8e>
+  .byte  232,0,0,0,0                         // call          1c3c <_sk_saturation_sse2+0x8e>
   .byte  88                                  // pop           %eax
-  .byte  15,40,176,136,119,0,0               // movaps        0x7788(%eax),%xmm6
+  .byte  15,40,176,180,119,0,0               // movaps        0x77b4(%eax),%xmm6
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
   .byte  15,89,214                           // mulps         %xmm6,%xmm2
-  .byte  15,40,160,152,119,0,0               // movaps        0x7798(%eax),%xmm4
+  .byte  15,40,160,196,119,0,0               // movaps        0x77c4(%eax),%xmm4
   .byte  15,40,77,56                         // movaps        0x38(%ebp),%xmm1
   .byte  15,89,204                           // mulps         %xmm4,%xmm1
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  15,40,85,72                         // movaps        0x48(%ebp),%xmm2
-  .byte  15,89,144,168,119,0,0               // mulps         0x77a8(%eax),%xmm2
+  .byte  15,89,144,212,119,0,0               // mulps         0x77d4(%eax),%xmm2
   .byte  15,88,209                           // addps         %xmm1,%xmm2
   .byte  15,94,232                           // divps         %xmm0,%xmm5
   .byte  15,94,216                           // divps         %xmm0,%xmm3
@@ -50183,7 +50494,7 @@
   .byte  15,89,252                           // mulps         %xmm4,%xmm7
   .byte  15,88,249                           // addps         %xmm1,%xmm7
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
-  .byte  15,89,136,168,119,0,0               // mulps         0x77a8(%eax),%xmm1
+  .byte  15,89,136,212,119,0,0               // mulps         0x77d4(%eax),%xmm1
   .byte  15,88,207                           // addps         %xmm7,%xmm1
   .byte  15,89,85,216                        // mulps         -0x28(%ebp),%xmm2
   .byte  15,92,209                           // subps         %xmm1,%xmm2
@@ -50203,7 +50514,7 @@
   .byte  15,89,245                           // mulps         %xmm5,%xmm6
   .byte  15,89,227                           // mulps         %xmm3,%xmm4
   .byte  15,88,230                           // addps         %xmm6,%xmm4
-  .byte  15,40,128,168,119,0,0               // movaps        0x77a8(%eax),%xmm0
+  .byte  15,40,128,212,119,0,0               // movaps        0x77d4(%eax),%xmm0
   .byte  15,89,194                           // mulps         %xmm2,%xmm0
   .byte  15,88,196                           // addps         %xmm4,%xmm0
   .byte  15,41,69,136                        // movaps        %xmm0,-0x78(%ebp)
@@ -50226,7 +50537,7 @@
   .byte  15,40,224                           // movaps        %xmm0,%xmm4
   .byte  15,40,69,88                         // movaps        0x58(%ebp),%xmm0
   .byte  15,89,200                           // mulps         %xmm0,%xmm1
-  .byte  15,40,144,184,119,0,0               // movaps        0x77b8(%eax),%xmm2
+  .byte  15,40,144,228,119,0,0               // movaps        0x77e4(%eax),%xmm2
   .byte  15,41,85,152                        // movaps        %xmm2,-0x68(%ebp)
   .byte  15,92,212                           // subps         %xmm4,%xmm2
   .byte  15,41,85,168                        // movaps        %xmm2,-0x58(%ebp)
@@ -50352,19 +50663,19 @@
   .byte  15,41,93,200                        // movaps        %xmm3,-0x38(%ebp)
   .byte  15,41,149,72,255,255,255            // movaps        %xmm2,-0xb8(%ebp)
   .byte  15,40,233                           // movaps        %xmm1,%xmm5
-  .byte  232,0,0,0,0                         // call          1ddf <_sk_color_sse2+0x1f>
+  .byte  232,0,0,0,0                         // call          1ec3 <_sk_color_sse2+0x1f>
   .byte  88                                  // pop           %eax
   .byte  15,40,85,56                         // movaps        0x38(%ebp),%xmm2
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
-  .byte  15,40,152,65,117,0,0                // movaps        0x7541(%eax),%xmm3
+  .byte  15,40,152,109,117,0,0               // movaps        0x756d(%eax),%xmm3
   .byte  15,89,227                           // mulps         %xmm3,%xmm4
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
-  .byte  15,40,176,81,117,0,0                // movaps        0x7551(%eax),%xmm6
+  .byte  15,40,176,125,117,0,0               // movaps        0x757d(%eax),%xmm6
   .byte  15,89,214                           // mulps         %xmm6,%xmm2
   .byte  15,41,117,184                       // movaps        %xmm6,-0x48(%ebp)
   .byte  15,88,212                           // addps         %xmm4,%xmm2
   .byte  15,40,101,72                        // movaps        0x48(%ebp),%xmm4
-  .byte  15,40,184,97,117,0,0                // movaps        0x7561(%eax),%xmm7
+  .byte  15,40,184,141,117,0,0               // movaps        0x758d(%eax),%xmm7
   .byte  15,41,189,56,255,255,255            // movaps        %xmm7,-0xc8(%ebp)
   .byte  15,89,231                           // mulps         %xmm7,%xmm4
   .byte  15,88,226                           // addps         %xmm2,%xmm4
@@ -50379,7 +50690,7 @@
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
   .byte  15,89,214                           // mulps         %xmm6,%xmm2
   .byte  15,88,212                           // addps         %xmm4,%xmm2
-  .byte  15,40,136,113,117,0,0               // movaps        0x7571(%eax),%xmm1
+  .byte  15,40,136,157,117,0,0               // movaps        0x759d(%eax),%xmm1
   .byte  15,41,77,168                        // movaps        %xmm1,-0x58(%ebp)
   .byte  15,40,225                           // movaps        %xmm1,%xmm4
   .byte  15,40,93,88                         // movaps        0x58(%ebp),%xmm3
@@ -50558,19 +50869,19 @@
   .byte  15,40,243                           // movaps        %xmm3,%xmm6
   .byte  15,40,234                           // movaps        %xmm2,%xmm5
   .byte  15,40,216                           // movaps        %xmm0,%xmm3
-  .byte  232,0,0,0,0                         // call          2092 <_sk_luminosity_sse2+0x1a>
+  .byte  232,0,0,0,0                         // call          2176 <_sk_luminosity_sse2+0x1a>
   .byte  88                                  // pop           %eax
-  .byte  15,40,160,206,114,0,0               // movaps        0x72ce(%eax),%xmm4
+  .byte  15,40,160,250,114,0,0               // movaps        0x72fa(%eax),%xmm4
   .byte  15,41,101,216                       // movaps        %xmm4,-0x28(%ebp)
   .byte  15,40,211                           // movaps        %xmm3,%xmm2
   .byte  15,89,212                           // mulps         %xmm4,%xmm2
-  .byte  15,40,128,222,114,0,0               // movaps        0x72de(%eax),%xmm0
+  .byte  15,40,128,10,115,0,0                // movaps        0x730a(%eax),%xmm0
   .byte  15,41,69,200                        // movaps        %xmm0,-0x38(%ebp)
   .byte  15,40,225                           // movaps        %xmm1,%xmm4
   .byte  15,89,224                           // mulps         %xmm0,%xmm4
   .byte  15,88,226                           // addps         %xmm2,%xmm4
   .byte  15,40,85,88                         // movaps        0x58(%ebp),%xmm2
-  .byte  15,40,184,254,114,0,0               // movaps        0x72fe(%eax),%xmm7
+  .byte  15,40,184,42,115,0,0                // movaps        0x732a(%eax),%xmm7
   .byte  15,41,125,152                       // movaps        %xmm7,-0x68(%ebp)
   .byte  15,92,250                           // subps         %xmm2,%xmm7
   .byte  15,89,223                           // mulps         %xmm7,%xmm3
@@ -50580,7 +50891,7 @@
   .byte  15,89,253                           // mulps         %xmm5,%xmm7
   .byte  15,41,189,120,255,255,255           // movaps        %xmm7,-0x88(%ebp)
   .byte  15,40,205                           // movaps        %xmm5,%xmm1
-  .byte  15,40,128,238,114,0,0               // movaps        0x72ee(%eax),%xmm0
+  .byte  15,40,128,26,115,0,0                // movaps        0x731a(%eax),%xmm0
   .byte  15,89,200                           // mulps         %xmm0,%xmm1
   .byte  15,88,204                           // addps         %xmm4,%xmm1
   .byte  15,40,238                           // movaps        %xmm6,%xmm5
@@ -50755,7 +51066,7 @@
   .byte  15,41,85,168                        // movaps        %xmm2,-0x58(%ebp)
   .byte  102,15,127,77,184                   // movdqa        %xmm1,-0x48(%ebp)
   .byte  102,15,127,69,200                   // movdqa        %xmm0,-0x38(%ebp)
-  .byte  232,0,0,0,0                         // call          2326 <_sk_srcover_rgba_8888_sse2+0x1f>
+  .byte  232,0,0,0,0                         // call          240a <_sk_srcover_rgba_8888_sse2+0x1f>
   .byte  95                                  // pop           %edi
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -50763,9 +51074,9 @@
   .byte  139,48                              // mov           (%eax),%esi
   .byte  139,54                              // mov           (%esi),%esi
   .byte  133,210                             // test          %edx,%edx
-  .byte  15,133,40,1,0,0                     // jne           2464 <_sk_srcover_rgba_8888_sse2+0x15d>
+  .byte  15,133,40,1,0,0                     // jne           2548 <_sk_srcover_rgba_8888_sse2+0x15d>
   .byte  243,15,111,12,142                   // movdqu        (%esi,%ecx,4),%xmm1
-  .byte  102,15,111,135,122,112,0,0          // movdqa        0x707a(%edi),%xmm0
+  .byte  102,15,111,135,166,112,0,0          // movdqa        0x70a6(%edi),%xmm0
   .byte  102,15,111,225                      // movdqa        %xmm1,%xmm4
   .byte  102,15,219,224                      // pand          %xmm0,%xmm4
   .byte  102,15,111,249                      // movdqa        %xmm1,%xmm7
@@ -50775,9 +51086,9 @@
   .byte  102,15,114,213,16                   // psrld         $0x10,%xmm5
   .byte  102,15,219,232                      // pand          %xmm0,%xmm5
   .byte  15,91,244                           // cvtdq2ps      %xmm4,%xmm6
-  .byte  15,40,167,138,112,0,0               // movaps        0x708a(%edi),%xmm4
+  .byte  15,40,167,182,112,0,0               // movaps        0x70b6(%edi),%xmm4
   .byte  15,92,227                           // subps         %xmm3,%xmm4
-  .byte  15,40,135,154,112,0,0               // movaps        0x709a(%edi),%xmm0
+  .byte  15,40,135,198,112,0,0               // movaps        0x70c6(%edi),%xmm0
   .byte  15,41,69,216                        // movaps        %xmm0,-0x28(%ebp)
   .byte  15,40,85,200                        // movaps        -0x38(%ebp),%xmm2
   .byte  15,89,208                           // mulps         %xmm0,%xmm2
@@ -50817,7 +51128,7 @@
   .byte  139,93,20                           // mov           0x14(%ebp),%ebx
   .byte  139,125,8                           // mov           0x8(%ebp),%edi
   .byte  133,210                             // test          %edx,%edx
-  .byte  15,133,131,0,0,0                    // jne           2495 <_sk_srcover_rgba_8888_sse2+0x18e>
+  .byte  15,133,131,0,0,0                    // jne           2579 <_sk_srcover_rgba_8888_sse2+0x18e>
   .byte  243,15,127,28,142                   // movdqu        %xmm3,(%esi,%ecx,4)
   .byte  141,112,8                           // lea           0x8(%eax),%esi
   .byte  15,41,84,36,80                      // movaps        %xmm2,0x50(%esp)
@@ -50845,35 +51156,35 @@
   .byte  137,211                             // mov           %edx,%ebx
   .byte  128,227,3                           // and           $0x3,%bl
   .byte  128,251,1                           // cmp           $0x1,%bl
-  .byte  116,94                              // je            24cc <_sk_srcover_rgba_8888_sse2+0x1c5>
+  .byte  116,94                              // je            25b0 <_sk_srcover_rgba_8888_sse2+0x1c5>
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  128,251,2                           // cmp           $0x2,%bl
-  .byte  116,20                              // je            248b <_sk_srcover_rgba_8888_sse2+0x184>
+  .byte  116,20                              // je            256f <_sk_srcover_rgba_8888_sse2+0x184>
   .byte  128,251,3                           // cmp           $0x3,%bl
-  .byte  15,133,193,254,255,255              // jne           2341 <_sk_srcover_rgba_8888_sse2+0x3a>
+  .byte  15,133,193,254,255,255              // jne           2425 <_sk_srcover_rgba_8888_sse2+0x3a>
   .byte  102,15,110,68,142,8                 // movd          0x8(%esi,%ecx,4),%xmm0
   .byte  102,15,112,200,69                   // pshufd        $0x45,%xmm0,%xmm1
   .byte  102,15,18,12,142                    // movlpd        (%esi,%ecx,4),%xmm1
-  .byte  233,172,254,255,255                 // jmp           2341 <_sk_srcover_rgba_8888_sse2+0x3a>
+  .byte  233,172,254,255,255                 // jmp           2425 <_sk_srcover_rgba_8888_sse2+0x3a>
   .byte  137,208                             // mov           %edx,%eax
   .byte  136,69,216                          // mov           %al,-0x28(%ebp)
   .byte  128,101,216,3                       // andb          $0x3,-0x28(%ebp)
   .byte  128,125,216,1                       // cmpb          $0x1,-0x28(%ebp)
-  .byte  116,50                              // je            24d6 <_sk_srcover_rgba_8888_sse2+0x1cf>
+  .byte  116,50                              // je            25ba <_sk_srcover_rgba_8888_sse2+0x1cf>
   .byte  128,125,216,2                       // cmpb          $0x2,-0x28(%ebp)
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
-  .byte  116,21                              // je            24c2 <_sk_srcover_rgba_8888_sse2+0x1bb>
+  .byte  116,21                              // je            25a6 <_sk_srcover_rgba_8888_sse2+0x1bb>
   .byte  128,125,216,3                       // cmpb          $0x3,-0x28(%ebp)
-  .byte  15,133,96,255,255,255               // jne           2417 <_sk_srcover_rgba_8888_sse2+0x110>
+  .byte  15,133,96,255,255,255               // jne           24fb <_sk_srcover_rgba_8888_sse2+0x110>
   .byte  102,15,112,203,78                   // pshufd        $0x4e,%xmm3,%xmm1
   .byte  102,15,126,76,142,8                 // movd          %xmm1,0x8(%esi,%ecx,4)
   .byte  102,15,214,28,142                   // movq          %xmm3,(%esi,%ecx,4)
-  .byte  233,75,255,255,255                  // jmp           2417 <_sk_srcover_rgba_8888_sse2+0x110>
+  .byte  233,75,255,255,255                  // jmp           24fb <_sk_srcover_rgba_8888_sse2+0x110>
   .byte  102,15,110,12,142                   // movd          (%esi,%ecx,4),%xmm1
-  .byte  233,107,254,255,255                 // jmp           2341 <_sk_srcover_rgba_8888_sse2+0x3a>
+  .byte  233,107,254,255,255                 // jmp           2425 <_sk_srcover_rgba_8888_sse2+0x3a>
   .byte  102,15,126,28,142                   // movd          %xmm3,(%esi,%ecx,4)
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
-  .byte  233,52,255,255,255                  // jmp           2417 <_sk_srcover_rgba_8888_sse2+0x110>
+  .byte  233,52,255,255,255                  // jmp           24fb <_sk_srcover_rgba_8888_sse2+0x110>
 
 HIDDEN _sk_clamp_0_sse2
 .globl _sk_clamp_0_sse2
@@ -50927,7 +51238,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          255c <_sk_clamp_1_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          2640 <_sk_clamp_1_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -50936,7 +51247,7 @@
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
   .byte  15,40,109,56                        // movaps        0x38(%ebp),%xmm5
   .byte  15,40,117,72                        // movaps        0x48(%ebp),%xmm6
-  .byte  15,40,184,116,110,0,0               // movaps        0x6e74(%eax),%xmm7
+  .byte  15,40,184,160,110,0,0               // movaps        0x6ea0(%eax),%xmm7
   .byte  15,93,199                           // minps         %xmm7,%xmm0
   .byte  15,93,207                           // minps         %xmm7,%xmm1
   .byte  15,93,215                           // minps         %xmm7,%xmm2
@@ -50971,7 +51282,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          25d1 <_sk_clamp_a_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          26b5 <_sk_clamp_a_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -50981,7 +51292,7 @@
   .byte  15,40,109,56                        // movaps        0x38(%ebp),%xmm5
   .byte  15,40,117,72                        // movaps        0x48(%ebp),%xmm6
   .byte  15,40,125,88                        // movaps        0x58(%ebp),%xmm7
-  .byte  15,93,152,15,110,0,0                // minps         0x6e0f(%eax),%xmm3
+  .byte  15,93,152,59,110,0,0                // minps         0x6e3b(%eax),%xmm3
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  15,93,195                           // minps         %xmm3,%xmm0
   .byte  15,93,203                           // minps         %xmm3,%xmm1
@@ -51014,14 +51325,14 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          2643 <_sk_clamp_a_dst_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          2727 <_sk_clamp_a_dst_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
   .byte  15,40,101,88                        // movaps        0x58(%ebp),%xmm4
-  .byte  15,93,160,173,109,0,0               // minps         0x6dad(%eax),%xmm4
+  .byte  15,93,160,217,109,0,0               // minps         0x6dd9(%eax),%xmm4
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
   .byte  15,40,117,56                        // movaps        0x38(%ebp),%xmm6
@@ -51251,7 +51562,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          28a0 <_sk_unpremul_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          2984 <_sk_unpremul_sse2+0xe>
   .byte  89                                  // pop           %ecx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -51260,7 +51571,7 @@
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
   .byte  15,40,109,56                        // movaps        0x38(%ebp),%xmm5
   .byte  15,87,246                           // xorps         %xmm6,%xmm6
-  .byte  15,40,185,96,107,0,0                // movaps        0x6b60(%ecx),%xmm7
+  .byte  15,40,185,140,107,0,0               // movaps        0x6b8c(%ecx),%xmm7
   .byte  15,94,251                           // divps         %xmm3,%xmm7
   .byte  15,194,243,4                        // cmpneqps      %xmm3,%xmm6
   .byte  15,84,247                           // andps         %xmm7,%xmm6
@@ -51302,23 +51613,23 @@
   .byte  15,40,242                           // movaps        %xmm2,%xmm6
   .byte  15,40,233                           // movaps        %xmm1,%xmm5
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
-  .byte  232,0,0,0,0                         // call          292f <_sk_from_srgb_sse2+0x1e>
+  .byte  232,0,0,0,0                         // call          2a13 <_sk_from_srgb_sse2+0x1e>
   .byte  88                                  // pop           %eax
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
   .byte  15,89,219                           // mulps         %xmm3,%xmm3
-  .byte  15,40,160,241,106,0,0               // movaps        0x6af1(%eax),%xmm4
+  .byte  15,40,160,29,107,0,0                // movaps        0x6b1d(%eax),%xmm4
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
-  .byte  15,40,136,1,107,0,0                 // movaps        0x6b01(%eax),%xmm1
+  .byte  15,40,136,45,107,0,0                // movaps        0x6b2d(%eax),%xmm1
   .byte  15,41,77,200                        // movaps        %xmm1,-0x38(%ebp)
   .byte  15,88,193                           // addps         %xmm1,%xmm0
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,40,152,225,106,0,0               // movaps        0x6ae1(%eax),%xmm3
+  .byte  15,40,152,13,107,0,0                // movaps        0x6b0d(%eax),%xmm3
   .byte  15,40,202                           // movaps        %xmm2,%xmm1
   .byte  15,89,203                           // mulps         %xmm3,%xmm1
-  .byte  15,40,184,17,107,0,0                // movaps        0x6b11(%eax),%xmm7
+  .byte  15,40,184,61,107,0,0                // movaps        0x6b3d(%eax),%xmm7
   .byte  15,41,125,216                       // movaps        %xmm7,-0x28(%ebp)
   .byte  15,88,199                           // addps         %xmm7,%xmm0
-  .byte  15,40,184,33,107,0,0                // movaps        0x6b21(%eax),%xmm7
+  .byte  15,40,184,77,107,0,0                // movaps        0x6b4d(%eax),%xmm7
   .byte  15,194,215,1                        // cmpltps       %xmm7,%xmm2
   .byte  15,84,202                           // andps         %xmm2,%xmm1
   .byte  15,85,208                           // andnps        %xmm0,%xmm2
@@ -51392,24 +51703,24 @@
   .byte  15,41,85,168                        // movaps        %xmm2,-0x58(%ebp)
   .byte  15,41,77,184                        // movaps        %xmm1,-0x48(%ebp)
   .byte  15,41,69,200                        // movaps        %xmm0,-0x38(%ebp)
-  .byte  232,0,0,0,0                         // call          2a52 <_sk_from_srgb_dst_sse2+0x21>
+  .byte  232,0,0,0,0                         // call          2b36 <_sk_from_srgb_dst_sse2+0x21>
   .byte  88                                  // pop           %eax
   .byte  15,40,77,40                         // movaps        0x28(%ebp),%xmm1
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
-  .byte  15,40,168,30,106,0,0                // movaps        0x6a1e(%eax),%xmm5
+  .byte  15,40,168,74,106,0,0                // movaps        0x6a4a(%eax),%xmm5
   .byte  15,40,249                           // movaps        %xmm1,%xmm7
   .byte  15,89,253                           // mulps         %xmm5,%xmm7
-  .byte  15,40,144,46,106,0,0                // movaps        0x6a2e(%eax),%xmm2
+  .byte  15,40,144,90,106,0,0                // movaps        0x6a5a(%eax),%xmm2
   .byte  15,41,85,216                        // movaps        %xmm2,-0x28(%ebp)
   .byte  15,88,250                           // addps         %xmm2,%xmm7
   .byte  15,89,248                           // mulps         %xmm0,%xmm7
-  .byte  15,40,176,14,106,0,0                // movaps        0x6a0e(%eax),%xmm6
+  .byte  15,40,176,58,106,0,0                // movaps        0x6a3a(%eax),%xmm6
   .byte  15,40,225                           // movaps        %xmm1,%xmm4
   .byte  15,89,230                           // mulps         %xmm6,%xmm4
-  .byte  15,40,152,62,106,0,0                // movaps        0x6a3e(%eax),%xmm3
+  .byte  15,40,152,106,106,0,0               // movaps        0x6a6a(%eax),%xmm3
   .byte  15,88,251                           // addps         %xmm3,%xmm7
-  .byte  15,40,144,78,106,0,0                // movaps        0x6a4e(%eax),%xmm2
+  .byte  15,40,144,122,106,0,0               // movaps        0x6a7a(%eax),%xmm2
   .byte  15,194,202,1                        // cmpltps       %xmm2,%xmm1
   .byte  15,84,225                           // andps         %xmm1,%xmm4
   .byte  15,85,207                           // andnps        %xmm7,%xmm1
@@ -51482,28 +51793,28 @@
   .byte  15,40,250                           // movaps        %xmm2,%xmm7
   .byte  15,40,241                           // movaps        %xmm1,%xmm6
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
-  .byte  232,0,0,0,0                         // call          2b72 <_sk_to_srgb_sse2+0x1e>
+  .byte  232,0,0,0,0                         // call          2c56 <_sk_to_srgb_sse2+0x1e>
   .byte  88                                  // pop           %eax
   .byte  15,82,218                           // rsqrtps       %xmm2,%xmm3
-  .byte  15,40,160,78,105,0,0                // movaps        0x694e(%eax),%xmm4
+  .byte  15,40,160,122,105,0,0               // movaps        0x697a(%eax),%xmm4
   .byte  15,40,235                           // movaps        %xmm3,%xmm5
   .byte  15,89,236                           // mulps         %xmm4,%xmm5
-  .byte  15,40,128,94,105,0,0                // movaps        0x695e(%eax),%xmm0
+  .byte  15,40,128,138,105,0,0               // movaps        0x698a(%eax),%xmm0
   .byte  15,41,69,216                        // movaps        %xmm0,-0x28(%ebp)
   .byte  15,88,232                           // addps         %xmm0,%xmm5
   .byte  15,89,235                           // mulps         %xmm3,%xmm5
-  .byte  15,40,128,110,105,0,0               // movaps        0x696e(%eax),%xmm0
+  .byte  15,40,128,154,105,0,0               // movaps        0x699a(%eax),%xmm0
   .byte  15,41,69,184                        // movaps        %xmm0,-0x48(%ebp)
   .byte  15,88,232                           // addps         %xmm0,%xmm5
-  .byte  15,40,128,126,105,0,0               // movaps        0x697e(%eax),%xmm0
+  .byte  15,40,128,170,105,0,0               // movaps        0x69aa(%eax),%xmm0
   .byte  15,41,69,200                        // movaps        %xmm0,-0x38(%ebp)
   .byte  15,88,216                           // addps         %xmm0,%xmm3
   .byte  15,83,195                           // rcpps         %xmm3,%xmm0
   .byte  15,89,197                           // mulps         %xmm5,%xmm0
-  .byte  15,40,168,62,105,0,0                // movaps        0x693e(%eax),%xmm5
+  .byte  15,40,168,106,105,0,0               // movaps        0x696a(%eax),%xmm5
   .byte  15,40,202                           // movaps        %xmm2,%xmm1
   .byte  15,89,205                           // mulps         %xmm5,%xmm1
-  .byte  15,40,152,142,105,0,0               // movaps        0x698e(%eax),%xmm3
+  .byte  15,40,152,186,105,0,0               // movaps        0x69ba(%eax),%xmm3
   .byte  15,194,211,1                        // cmpltps       %xmm3,%xmm2
   .byte  15,84,202                           // andps         %xmm2,%xmm1
   .byte  15,85,208                           // andnps        %xmm0,%xmm2
@@ -51580,7 +51891,7 @@
   .byte  15,41,93,184                        // movaps        %xmm3,-0x48(%ebp)
   .byte  15,40,233                           // movaps        %xmm1,%xmm5
   .byte  15,40,224                           // movaps        %xmm0,%xmm4
-  .byte  232,0,0,0,0                         // call          2cb1 <_sk_rgb_to_hsl_sse2+0x1b>
+  .byte  232,0,0,0,0                         // call          2d95 <_sk_rgb_to_hsl_sse2+0x1b>
   .byte  88                                  // pop           %eax
   .byte  15,40,204                           // movaps        %xmm4,%xmm1
   .byte  15,95,205                           // maxps         %xmm5,%xmm1
@@ -51592,13 +51903,13 @@
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  15,92,199                           // subps         %xmm7,%xmm0
   .byte  15,41,69,200                        // movaps        %xmm0,-0x38(%ebp)
-  .byte  15,40,152,95,104,0,0                // movaps        0x685f(%eax),%xmm3
+  .byte  15,40,152,139,104,0,0               // movaps        0x688b(%eax),%xmm3
   .byte  15,94,216                           // divps         %xmm0,%xmm3
   .byte  15,40,197                           // movaps        %xmm5,%xmm0
   .byte  15,92,194                           // subps         %xmm2,%xmm0
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
   .byte  15,194,234,1                        // cmpltps       %xmm2,%xmm5
-  .byte  15,84,168,111,104,0,0               // andps         0x686f(%eax),%xmm5
+  .byte  15,84,168,155,104,0,0               // andps         0x689b(%eax),%xmm5
   .byte  15,88,232                           // addps         %xmm0,%xmm5
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  15,194,196,0                        // cmpeqps       %xmm4,%xmm0
@@ -51608,9 +51919,9 @@
   .byte  15,92,101,216                       // subps         -0x28(%ebp),%xmm4
   .byte  15,89,211                           // mulps         %xmm3,%xmm2
   .byte  15,89,227                           // mulps         %xmm3,%xmm4
-  .byte  15,40,152,127,104,0,0               // movaps        0x687f(%eax),%xmm3
+  .byte  15,40,152,171,104,0,0               // movaps        0x68ab(%eax),%xmm3
   .byte  15,88,211                           // addps         %xmm3,%xmm2
-  .byte  15,88,160,143,104,0,0               // addps         0x688f(%eax),%xmm4
+  .byte  15,88,160,187,104,0,0               // addps         0x68bb(%eax),%xmm4
   .byte  15,84,214                           // andps         %xmm6,%xmm2
   .byte  15,85,244                           // andnps        %xmm4,%xmm6
   .byte  15,86,242                           // orps          %xmm2,%xmm6
@@ -51625,7 +51936,7 @@
   .byte  15,194,231,4                        // cmpneqps      %xmm7,%xmm4
   .byte  15,92,217                           // subps         %xmm1,%xmm3
   .byte  15,88,207                           // addps         %xmm7,%xmm1
-  .byte  15,40,168,175,104,0,0               // movaps        0x68af(%eax),%xmm5
+  .byte  15,40,168,219,104,0,0               // movaps        0x68db(%eax),%xmm5
   .byte  15,92,223                           // subps         %xmm7,%xmm3
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
   .byte  15,89,213                           // mulps         %xmm5,%xmm2
@@ -51638,7 +51949,7 @@
   .byte  15,40,77,200                        // movaps        -0x38(%ebp),%xmm1
   .byte  15,94,205                           // divps         %xmm5,%xmm1
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
-  .byte  15,89,128,159,104,0,0               // mulps         0x689f(%eax),%xmm0
+  .byte  15,89,128,203,104,0,0               // mulps         0x68cb(%eax),%xmm0
   .byte  15,84,196                           // andps         %xmm4,%xmm0
   .byte  15,84,204                           // andps         %xmm4,%xmm1
   .byte  15,40,101,88                        // movaps        0x58(%ebp),%xmm4
@@ -51674,9 +51985,9 @@
   .byte  129,236,44,1,0,0                    // sub           $0x12c,%esp
   .byte  15,41,157,40,255,255,255            // movaps        %xmm3,-0xd8(%ebp)
   .byte  15,41,69,200                        // movaps        %xmm0,-0x38(%ebp)
-  .byte  232,0,0,0,0                         // call          2de6 <_sk_hsl_to_rgb_sse2+0x1c>
+  .byte  232,0,0,0,0                         // call          2eca <_sk_hsl_to_rgb_sse2+0x1c>
   .byte  88                                  // pop           %eax
-  .byte  15,40,152,138,103,0,0               // movaps        0x678a(%eax),%xmm3
+  .byte  15,40,152,182,103,0,0               // movaps        0x67b6(%eax),%xmm3
   .byte  15,40,227                           // movaps        %xmm3,%xmm4
   .byte  15,40,243                           // movaps        %xmm3,%xmm6
   .byte  15,41,181,72,255,255,255            // movaps        %xmm6,-0xb8(%ebp)
@@ -51690,13 +52001,13 @@
   .byte  15,84,236                           // andps         %xmm4,%xmm5
   .byte  15,85,225                           // andnps        %xmm1,%xmm4
   .byte  15,86,229                           // orps          %xmm5,%xmm4
-  .byte  15,40,136,154,103,0,0               // movaps        0x679a(%eax),%xmm1
+  .byte  15,40,136,198,103,0,0               // movaps        0x67c6(%eax),%xmm1
   .byte  15,88,200                           // addps         %xmm0,%xmm1
   .byte  243,15,91,193                       // cvttps2dq     %xmm1,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  15,40,217                           // movaps        %xmm1,%xmm3
   .byte  15,194,216,1                        // cmpltps       %xmm0,%xmm3
-  .byte  15,40,168,170,103,0,0               // movaps        0x67aa(%eax),%xmm5
+  .byte  15,40,168,214,103,0,0               // movaps        0x67d6(%eax),%xmm5
   .byte  15,41,173,104,255,255,255           // movaps        %xmm5,-0x98(%ebp)
   .byte  15,84,221                           // andps         %xmm5,%xmm3
   .byte  15,92,195                           // subps         %xmm3,%xmm0
@@ -51707,19 +52018,19 @@
   .byte  15,41,101,184                       // movaps        %xmm4,-0x48(%ebp)
   .byte  15,88,237                           // addps         %xmm5,%xmm5
   .byte  15,92,236                           // subps         %xmm4,%xmm5
-  .byte  15,40,144,186,103,0,0               // movaps        0x67ba(%eax),%xmm2
+  .byte  15,40,144,230,103,0,0               // movaps        0x67e6(%eax),%xmm2
   .byte  15,41,85,168                        // movaps        %xmm2,-0x58(%ebp)
   .byte  15,194,209,2                        // cmpleps       %xmm1,%xmm2
   .byte  15,92,229                           // subps         %xmm5,%xmm4
   .byte  15,40,198                           // movaps        %xmm6,%xmm0
   .byte  15,194,193,2                        // cmpleps       %xmm1,%xmm0
-  .byte  15,40,176,234,103,0,0               // movaps        0x67ea(%eax),%xmm6
+  .byte  15,40,176,22,104,0,0                // movaps        0x6816(%eax),%xmm6
   .byte  15,41,181,88,255,255,255            // movaps        %xmm6,-0xa8(%ebp)
   .byte  15,194,241,2                        // cmpleps       %xmm1,%xmm6
-  .byte  15,40,152,202,103,0,0               // movaps        0x67ca(%eax),%xmm3
+  .byte  15,40,152,246,103,0,0               // movaps        0x67f6(%eax),%xmm3
   .byte  15,41,93,152                        // movaps        %xmm3,-0x68(%ebp)
   .byte  15,89,203                           // mulps         %xmm3,%xmm1
-  .byte  15,40,184,218,103,0,0               // movaps        0x67da(%eax),%xmm7
+  .byte  15,40,184,6,104,0,0                 // movaps        0x6806(%eax),%xmm7
   .byte  15,41,125,136                       // movaps        %xmm7,-0x78(%ebp)
   .byte  15,92,249                           // subps         %xmm1,%xmm7
   .byte  15,89,252                           // mulps         %xmm4,%xmm7
@@ -51744,18 +52055,18 @@
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  15,40,202                           // movaps        %xmm2,%xmm1
   .byte  15,194,200,1                        // cmpltps       %xmm0,%xmm1
-  .byte  15,84,136,170,103,0,0               // andps         0x67aa(%eax),%xmm1
+  .byte  15,84,136,214,103,0,0               // andps         0x67d6(%eax),%xmm1
   .byte  15,92,193                           // subps         %xmm1,%xmm0
   .byte  15,40,202                           // movaps        %xmm2,%xmm1
   .byte  15,92,200                           // subps         %xmm0,%xmm1
-  .byte  15,40,128,186,103,0,0               // movaps        0x67ba(%eax),%xmm0
+  .byte  15,40,128,230,103,0,0               // movaps        0x67e6(%eax),%xmm0
   .byte  15,194,193,2                        // cmpleps       %xmm1,%xmm0
-  .byte  15,40,144,138,103,0,0               // movaps        0x678a(%eax),%xmm2
+  .byte  15,40,144,182,103,0,0               // movaps        0x67b6(%eax),%xmm2
   .byte  15,194,209,2                        // cmpleps       %xmm1,%xmm2
-  .byte  15,40,152,234,103,0,0               // movaps        0x67ea(%eax),%xmm3
+  .byte  15,40,152,22,104,0,0                // movaps        0x6816(%eax),%xmm3
   .byte  15,194,217,2                        // cmpleps       %xmm1,%xmm3
-  .byte  15,89,136,202,103,0,0               // mulps         0x67ca(%eax),%xmm1
-  .byte  15,40,176,218,103,0,0               // movaps        0x67da(%eax),%xmm6
+  .byte  15,89,136,246,103,0,0               // mulps         0x67f6(%eax),%xmm1
+  .byte  15,40,176,6,104,0,0                 // movaps        0x6806(%eax),%xmm6
   .byte  15,92,241                           // subps         %xmm1,%xmm6
   .byte  15,89,244                           // mulps         %xmm4,%xmm6
   .byte  15,88,245                           // addps         %xmm5,%xmm6
@@ -51775,7 +52086,7 @@
   .byte  15,40,117,216                       // movaps        -0x28(%ebp),%xmm6
   .byte  15,85,243                           // andnps        %xmm3,%xmm6
   .byte  15,40,85,200                        // movaps        -0x38(%ebp),%xmm2
-  .byte  15,88,144,250,103,0,0               // addps         0x67fa(%eax),%xmm2
+  .byte  15,88,144,38,104,0,0                // addps         0x6826(%eax),%xmm2
   .byte  243,15,91,194                       // cvttps2dq     %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
   .byte  15,40,202                           // movaps        %xmm2,%xmm1
@@ -51899,7 +52210,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          30ec <_sk_scale_u8_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          31d0 <_sk_scale_u8_sse2+0xe>
   .byte  91                                  // pop           %ebx
   .byte  15,40,125,72                        // movaps        0x48(%ebp),%xmm7
   .byte  15,40,117,56                        // movaps        0x38(%ebp),%xmm6
@@ -51911,13 +52222,13 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
-  .byte  117,106                             // jne           3177 <_sk_scale_u8_sse2+0x99>
+  .byte  117,106                             // jne           325b <_sk_scale_u8_sse2+0x99>
   .byte  102,15,110,36,57                    // movd          (%ecx,%edi,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,219,163,4,101,0,0            // pand          0x6504(%ebx),%xmm4
+  .byte  102,15,219,163,48,101,0,0           // pand          0x6530(%ebx),%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,163,20,101,0,0                // mulps         0x6514(%ebx),%xmm4
+  .byte  15,89,163,64,101,0,0                // mulps         0x6540(%ebx),%xmm4
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
   .byte  15,89,204                           // mulps         %xmm4,%xmm1
   .byte  15,89,212                           // mulps         %xmm4,%xmm2
@@ -51945,13 +52256,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,65                              // je            31c5 <_sk_scale_u8_sse2+0xe7>
+  .byte  116,65                              // je            32a9 <_sk_scale_u8_sse2+0xe7>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,23                              // je            31a8 <_sk_scale_u8_sse2+0xca>
+  .byte  116,23                              // je            328c <_sk_scale_u8_sse2+0xca>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,131                             // jne           311a <_sk_scale_u8_sse2+0x3c>
+  .byte  117,131                             // jne           31fe <_sk_scale_u8_sse2+0x3c>
   .byte  15,182,116,57,2                     // movzbl        0x2(%ecx,%edi,1),%esi
   .byte  102,15,110,230                      // movd          %esi,%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -51962,11 +52273,11 @@
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
   .byte  15,40,109,40                        // movaps        0x28(%ebp),%xmm5
-  .byte  233,85,255,255,255                  // jmp           311a <_sk_scale_u8_sse2+0x3c>
+  .byte  233,85,255,255,255                  // jmp           31fe <_sk_scale_u8_sse2+0x3c>
   .byte  15,182,12,57                        // movzbl        (%ecx,%edi,1),%ecx
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,69,255,255,255                  // jmp           311a <_sk_scale_u8_sse2+0x3c>
+  .byte  233,69,255,255,255                  // jmp           31fe <_sk_scale_u8_sse2+0x3c>
 
 HIDDEN _sk_lerp_1_float_sse2
 .globl _sk_lerp_1_float_sse2
@@ -52031,7 +52342,7 @@
   .byte  86                                  // push          %esi
   .byte  131,236,124                         // sub           $0x7c,%esp
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
-  .byte  232,0,0,0,0                         // call          3273 <_sk_lerp_u8_sse2+0x12>
+  .byte  232,0,0,0,0                         // call          3357 <_sk_lerp_u8_sse2+0x12>
   .byte  91                                  // pop           %ebx
   .byte  15,40,109,40                        // movaps        0x28(%ebp),%xmm5
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
@@ -52041,13 +52352,13 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
-  .byte  15,133,143,0,0,0                    // jne           331f <_sk_lerp_u8_sse2+0xbe>
+  .byte  15,133,143,0,0,0                    // jne           3403 <_sk_lerp_u8_sse2+0xbe>
   .byte  102,15,110,36,57                    // movd          (%ecx,%edi,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,219,163,157,99,0,0           // pand          0x639d(%ebx),%xmm4
+  .byte  102,15,219,163,201,99,0,0           // pand          0x63c9(%ebx),%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,163,173,99,0,0                // mulps         0x63ad(%ebx),%xmm4
+  .byte  15,89,163,217,99,0,0                // mulps         0x63d9(%ebx),%xmm4
   .byte  15,92,197                           // subps         %xmm5,%xmm0
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
   .byte  15,40,117,56                        // movaps        0x38(%ebp),%xmm6
@@ -52086,13 +52397,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,69                              // je            3371 <_sk_lerp_u8_sse2+0x110>
+  .byte  116,69                              // je            3455 <_sk_lerp_u8_sse2+0x110>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,27                              // je            3354 <_sk_lerp_u8_sse2+0xf3>
+  .byte  116,27                              // je            3438 <_sk_lerp_u8_sse2+0xf3>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,90,255,255,255               // jne           329d <_sk_lerp_u8_sse2+0x3c>
+  .byte  15,133,90,255,255,255               // jne           3381 <_sk_lerp_u8_sse2+0x3c>
   .byte  15,182,116,57,2                     // movzbl        0x2(%ecx,%edi,1),%esi
   .byte  102,15,110,230                      // movd          %esi,%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -52103,11 +52414,11 @@
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
   .byte  15,40,109,40                        // movaps        0x28(%ebp),%xmm5
-  .byte  233,44,255,255,255                  // jmp           329d <_sk_lerp_u8_sse2+0x3c>
+  .byte  233,44,255,255,255                  // jmp           3381 <_sk_lerp_u8_sse2+0x3c>
   .byte  15,182,12,57                        // movzbl        (%ecx,%edi,1),%ecx
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,28,255,255,255                  // jmp           329d <_sk_lerp_u8_sse2+0x3c>
+  .byte  233,28,255,255,255                  // jmp           3381 <_sk_lerp_u8_sse2+0x3c>
 
 HIDDEN _sk_lerp_565_sse2
 .globl _sk_lerp_565_sse2
@@ -52119,7 +52430,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          338f <_sk_lerp_565_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          3473 <_sk_lerp_565_sse2+0xe>
   .byte  91                                  // pop           %ebx
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -52128,20 +52439,20 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
-  .byte  15,133,212,0,0,0                    // jne           347c <_sk_lerp_565_sse2+0xfb>
+  .byte  15,133,212,0,0,0                    // jne           3560 <_sk_lerp_565_sse2+0xfb>
   .byte  243,15,126,52,121                   // movq          (%ecx,%edi,2),%xmm6
   .byte  102,15,97,240                       // punpcklwd     %xmm0,%xmm6
-  .byte  102,15,111,163,161,98,0,0           // movdqa        0x62a1(%ebx),%xmm4
+  .byte  102,15,111,163,205,98,0,0           // movdqa        0x62cd(%ebx),%xmm4
   .byte  102,15,219,230                      // pand          %xmm6,%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,163,177,98,0,0                // mulps         0x62b1(%ebx),%xmm4
-  .byte  102,15,111,187,193,98,0,0           // movdqa        0x62c1(%ebx),%xmm7
+  .byte  15,89,163,221,98,0,0                // mulps         0x62dd(%ebx),%xmm4
+  .byte  102,15,111,187,237,98,0,0           // movdqa        0x62ed(%ebx),%xmm7
   .byte  102,15,219,254                      // pand          %xmm6,%xmm7
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
-  .byte  15,89,187,209,98,0,0                // mulps         0x62d1(%ebx),%xmm7
-  .byte  102,15,219,179,225,98,0,0           // pand          0x62e1(%ebx),%xmm6
+  .byte  15,89,187,253,98,0,0                // mulps         0x62fd(%ebx),%xmm7
+  .byte  102,15,219,179,13,99,0,0            // pand          0x630d(%ebx),%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,179,241,98,0,0                // mulps         0x62f1(%ebx),%xmm6
+  .byte  15,89,179,29,99,0,0                 // mulps         0x631d(%ebx),%xmm6
   .byte  15,40,109,40                        // movaps        0x28(%ebp),%xmm5
   .byte  15,92,197                           // subps         %xmm5,%xmm0
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
@@ -52189,13 +52500,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,58                              // je            34c3 <_sk_lerp_565_sse2+0x142>
+  .byte  116,58                              // je            35a7 <_sk_lerp_565_sse2+0x142>
   .byte  102,15,239,246                      // pxor          %xmm6,%xmm6
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,27                              // je            34b1 <_sk_lerp_565_sse2+0x130>
+  .byte  116,27                              // je            3595 <_sk_lerp_565_sse2+0x130>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,17,255,255,255               // jne           33b1 <_sk_lerp_565_sse2+0x30>
+  .byte  15,133,17,255,255,255               // jne           3495 <_sk_lerp_565_sse2+0x30>
   .byte  15,183,116,121,4                    // movzwl        0x4(%ecx,%edi,2),%esi
   .byte  102,15,110,230                      // movd          %esi,%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -52203,11 +52514,11 @@
   .byte  102,15,110,36,121                   // movd          (%ecx,%edi,2),%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
   .byte  242,15,16,244                       // movsd         %xmm4,%xmm6
-  .byte  233,238,254,255,255                 // jmp           33b1 <_sk_lerp_565_sse2+0x30>
+  .byte  233,238,254,255,255                 // jmp           3495 <_sk_lerp_565_sse2+0x30>
   .byte  15,183,12,121                       // movzwl        (%ecx,%edi,2),%ecx
   .byte  102,15,110,241                      // movd          %ecx,%xmm6
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,222,254,255,255                 // jmp           33b1 <_sk_lerp_565_sse2+0x30>
+  .byte  233,222,254,255,255                 // jmp           3495 <_sk_lerp_565_sse2+0x30>
 
 HIDDEN _sk_load_tables_sse2
 .globl _sk_load_tables_sse2
@@ -52219,7 +52530,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          34e1 <_sk_load_tables_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          35c5 <_sk_load_tables_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,24                           // mov           0x18(%ebp),%eax
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
@@ -52227,9 +52538,9 @@
   .byte  133,192                             // test          %eax,%eax
   .byte  139,17                              // mov           (%ecx),%edx
   .byte  139,58                              // mov           (%edx),%edi
-  .byte  15,133,75,1,0,0                     // jne           3642 <_sk_load_tables_sse2+0x16f>
+  .byte  15,133,75,1,0,0                     // jne           3726 <_sk_load_tables_sse2+0x16f>
   .byte  243,15,111,28,159                   // movdqu        (%edi,%ebx,4),%xmm3
-  .byte  102,15,111,150,175,97,0,0           // movdqa        0x61af(%esi),%xmm2
+  .byte  102,15,111,150,219,97,0,0           // movdqa        0x61db(%esi),%xmm2
   .byte  102,15,111,195                      // movdqa        %xmm3,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  102,15,112,200,229                  // pshufd        $0xe5,%xmm0,%xmm1
@@ -52285,7 +52596,7 @@
   .byte  15,20,215                           // unpcklps      %xmm7,%xmm2
   .byte  102,15,114,211,24                   // psrld         $0x18,%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,158,191,97,0,0                // mulps         0x61bf(%esi),%xmm3
+  .byte  15,89,158,235,97,0,0                // mulps         0x61eb(%esi),%xmm3
   .byte  139,77,12                           // mov           0xc(%ebp),%ecx
   .byte  137,206                             // mov           %ecx,%esi
   .byte  141,78,8                            // lea           0x8(%esi),%ecx
@@ -52314,18 +52625,18 @@
   .byte  137,193                             // mov           %eax,%ecx
   .byte  128,225,3                           // and           $0x3,%cl
   .byte  128,249,1                           // cmp           $0x1,%cl
-  .byte  116,39                              // je            3673 <_sk_load_tables_sse2+0x1a0>
+  .byte  116,39                              // je            3757 <_sk_load_tables_sse2+0x1a0>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  128,249,2                           // cmp           $0x2,%cl
-  .byte  116,20                              // je            3669 <_sk_load_tables_sse2+0x196>
+  .byte  116,20                              // je            374d <_sk_load_tables_sse2+0x196>
   .byte  128,249,3                           // cmp           $0x3,%cl
-  .byte  15,133,158,254,255,255              // jne           34fc <_sk_load_tables_sse2+0x29>
+  .byte  15,133,158,254,255,255              // jne           35e0 <_sk_load_tables_sse2+0x29>
   .byte  102,15,110,68,159,8                 // movd          0x8(%edi,%ebx,4),%xmm0
   .byte  102,15,112,216,69                   // pshufd        $0x45,%xmm0,%xmm3
   .byte  102,15,18,28,159                    // movlpd        (%edi,%ebx,4),%xmm3
-  .byte  233,137,254,255,255                 // jmp           34fc <_sk_load_tables_sse2+0x29>
+  .byte  233,137,254,255,255                 // jmp           35e0 <_sk_load_tables_sse2+0x29>
   .byte  102,15,110,28,159                   // movd          (%edi,%ebx,4),%xmm3
-  .byte  233,127,254,255,255                 // jmp           34fc <_sk_load_tables_sse2+0x29>
+  .byte  233,127,254,255,255                 // jmp           35e0 <_sk_load_tables_sse2+0x29>
 
 HIDDEN _sk_load_tables_u16_be_sse2
 .globl _sk_load_tables_u16_be_sse2
@@ -52337,7 +52648,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  129,236,140,0,0,0                   // sub           $0x8c,%esp
-  .byte  232,0,0,0,0                         // call          368e <_sk_load_tables_u16_be_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          3772 <_sk_load_tables_u16_be_sse2+0x11>
   .byte  95                                  // pop           %edi
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
@@ -52346,7 +52657,7 @@
   .byte  139,11                              // mov           (%ebx),%ecx
   .byte  141,52,149,0,0,0,0                  // lea           0x0(,%edx,4),%esi
   .byte  186,255,0,255,0                     // mov           $0xff00ff,%edx
-  .byte  15,133,229,1,0,0                    // jne           3894 <_sk_load_tables_u16_be_sse2+0x217>
+  .byte  15,133,229,1,0,0                    // jne           3978 <_sk_load_tables_u16_be_sse2+0x217>
   .byte  102,15,16,4,113                     // movupd        (%ecx,%esi,2),%xmm0
   .byte  243,15,111,76,113,16                // movdqu        0x10(%ecx,%esi,2),%xmm1
   .byte  102,15,40,216                       // movapd        %xmm0,%xmm3
@@ -52443,7 +52754,7 @@
   .byte  243,15,126,93,208                   // movq          -0x30(%ebp),%xmm3
   .byte  102,15,97,223                       // punpcklwd     %xmm7,%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,159,34,96,0,0                 // mulps         0x6022(%edi),%xmm3
+  .byte  15,89,159,78,96,0,0                 // mulps         0x604e(%edi),%xmm3
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  137,193                             // mov           %eax,%ecx
   .byte  141,65,8                            // lea           0x8(%ecx),%eax
@@ -52475,12 +52786,12 @@
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  139,69,24                           // mov           0x18(%ebp),%eax
   .byte  131,248,1                           // cmp           $0x1,%eax
-  .byte  15,132,17,254,255,255               // je            36ba <_sk_load_tables_u16_be_sse2+0x3d>
+  .byte  15,132,17,254,255,255               // je            379e <_sk_load_tables_u16_be_sse2+0x3d>
   .byte  102,15,22,68,113,8                  // movhpd        0x8(%ecx,%esi,2),%xmm0
   .byte  131,248,3                           // cmp           $0x3,%eax
-  .byte  15,130,2,254,255,255                // jb            36ba <_sk_load_tables_u16_be_sse2+0x3d>
+  .byte  15,130,2,254,255,255                // jb            379e <_sk_load_tables_u16_be_sse2+0x3d>
   .byte  243,15,126,76,113,16                // movq          0x10(%ecx,%esi,2),%xmm1
-  .byte  233,247,253,255,255                 // jmp           36ba <_sk_load_tables_u16_be_sse2+0x3d>
+  .byte  233,247,253,255,255                 // jmp           379e <_sk_load_tables_u16_be_sse2+0x3d>
 
 HIDDEN _sk_load_tables_rgb_u16_be_sse2
 .globl _sk_load_tables_rgb_u16_be_sse2
@@ -52492,7 +52803,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,124                         // sub           $0x7c,%esp
-  .byte  232,0,0,0,0                         // call          38d1 <_sk_load_tables_rgb_u16_be_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          39b5 <_sk_load_tables_rgb_u16_be_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  137,69,240                          // mov           %eax,-0x10(%ebp)
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -52502,7 +52813,7 @@
   .byte  139,19                              // mov           (%ebx),%edx
   .byte  141,60,73                           // lea           (%ecx,%ecx,2),%edi
   .byte  190,255,0,255,0                     // mov           $0xff00ff,%esi
-  .byte  15,133,198,1,0,0                    // jne           3ab7 <_sk_load_tables_rgb_u16_be_sse2+0x1f4>
+  .byte  15,133,198,1,0,0                    // jne           3b9b <_sk_load_tables_rgb_u16_be_sse2+0x1f4>
   .byte  243,15,111,12,122                   // movdqu        (%edx,%edi,2),%xmm1
   .byte  243,15,111,92,122,8                 // movdqu        0x8(%edx,%edi,2),%xmm3
   .byte  102,15,115,219,4                    // psrldq        $0x4,%xmm3
@@ -52612,7 +52923,7 @@
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  137,4,36                            // mov           %eax,(%esp)
   .byte  139,69,240                          // mov           -0x10(%ebp),%eax
-  .byte  15,40,152,239,93,0,0                // movaps        0x5def(%eax),%xmm3
+  .byte  15,40,152,27,94,0,0                 // movaps        0x5e1b(%eax),%xmm3
   .byte  15,40,197                           // movaps        %xmm5,%xmm0
   .byte  255,81,4                            // call          *0x4(%ecx)
   .byte  131,196,124                         // add           $0x7c,%esp
@@ -52626,20 +52937,20 @@
   .byte  102,15,239,210                      // pxor          %xmm2,%xmm2
   .byte  139,69,24                           // mov           0x18(%ebp),%eax
   .byte  131,248,1                           // cmp           $0x1,%eax
-  .byte  117,13                              // jne           3adc <_sk_load_tables_rgb_u16_be_sse2+0x219>
+  .byte  117,13                              // jne           3bc0 <_sk_load_tables_rgb_u16_be_sse2+0x219>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
-  .byte  233,55,254,255,255                  // jmp           3913 <_sk_load_tables_rgb_u16_be_sse2+0x50>
+  .byte  233,55,254,255,255                  // jmp           39f7 <_sk_load_tables_rgb_u16_be_sse2+0x50>
   .byte  102,15,110,68,122,6                 // movd          0x6(%edx,%edi,2),%xmm0
   .byte  102,15,196,68,122,10,2              // pinsrw        $0x2,0xa(%edx,%edi,2),%xmm0
   .byte  102,15,239,210                      // pxor          %xmm2,%xmm2
   .byte  131,248,3                           // cmp           $0x3,%eax
-  .byte  114,18                              // jb            3b04 <_sk_load_tables_rgb_u16_be_sse2+0x241>
+  .byte  114,18                              // jb            3be8 <_sk_load_tables_rgb_u16_be_sse2+0x241>
   .byte  102,15,110,92,122,12                // movd          0xc(%edx,%edi,2),%xmm3
   .byte  102,15,196,92,122,16,2              // pinsrw        $0x2,0x10(%edx,%edi,2),%xmm3
-  .byte  233,15,254,255,255                  // jmp           3913 <_sk_load_tables_rgb_u16_be_sse2+0x50>
+  .byte  233,15,254,255,255                  // jmp           39f7 <_sk_load_tables_rgb_u16_be_sse2+0x50>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
-  .byte  233,6,254,255,255                   // jmp           3913 <_sk_load_tables_rgb_u16_be_sse2+0x50>
+  .byte  233,6,254,255,255                   // jmp           39f7 <_sk_load_tables_rgb_u16_be_sse2+0x50>
 
 HIDDEN _sk_byte_tables_sse2
 .globl _sk_byte_tables_sse2
@@ -52651,11 +52962,11 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          3b1b <_sk_byte_tables_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          3bff <_sk_byte_tables_sse2+0xe>
   .byte  90                                  // pop           %edx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  139,8                               // mov           (%eax),%ecx
-  .byte  15,40,170,181,91,0,0                // movaps        0x5bb5(%edx),%xmm5
+  .byte  15,40,170,225,91,0,0                // movaps        0x5be1(%edx),%xmm5
   .byte  15,89,197                           // mulps         %xmm5,%xmm0
   .byte  102,15,91,192                       // cvtps2dq      %xmm0,%xmm0
   .byte  102,15,112,224,78                   // pshufd        $0x4e,%xmm0,%xmm4
@@ -52677,7 +52988,7 @@
   .byte  102,15,196,192,0                    // pinsrw        $0x0,%eax,%xmm0
   .byte  139,65,4                            // mov           0x4(%ecx),%eax
   .byte  102,15,196,195,1                    // pinsrw        $0x1,%ebx,%xmm0
-  .byte  15,40,162,197,91,0,0                // movaps        0x5bc5(%edx),%xmm4
+  .byte  15,40,162,241,91,0,0                // movaps        0x5bf1(%edx),%xmm4
   .byte  15,89,205                           // mulps         %xmm5,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
   .byte  102,15,112,241,78                   // pshufd        $0x4e,%xmm1,%xmm6
@@ -52816,12 +53127,12 @@
   .byte  15,182,60,31                        // movzbl        (%edi,%ebx,1),%edi
   .byte  193,231,8                           // shl           $0x8,%edi
   .byte  9,215                               // or            %edx,%edi
-  .byte  232,0,0,0,0                         // call          3d57 <_sk_byte_tables_rgb_sse2+0x65>
+  .byte  232,0,0,0,0                         // call          3e3b <_sk_byte_tables_rgb_sse2+0x65>
   .byte  90                                  // pop           %edx
   .byte  102,15,196,199,0                    // pinsrw        $0x0,%edi,%xmm0
   .byte  139,121,4                           // mov           0x4(%ecx),%edi
   .byte  102,15,196,198,1                    // pinsrw        $0x1,%esi,%xmm0
-  .byte  15,40,170,153,89,0,0                // movaps        0x5999(%edx),%xmm5
+  .byte  15,40,170,197,89,0,0                // movaps        0x59c5(%edx),%xmm5
   .byte  15,89,204                           // mulps         %xmm4,%xmm1
   .byte  102,15,91,201                       // cvtps2dq      %xmm1,%xmm1
   .byte  102,15,112,241,78                   // pshufd        $0x4e,%xmm1,%xmm6
@@ -53150,7 +53461,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          4160 <_sk_parametric_r_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4244 <_sk_parametric_r_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -53165,15 +53476,15 @@
   .byte  15,88,244                           // addps         %xmm4,%xmm6
   .byte  15,198,237,0                        // shufps        $0x0,%xmm5,%xmm5
   .byte  15,91,230                           // cvtdq2ps      %xmm6,%xmm4
-  .byte  15,89,166,160,85,0,0                // mulps         0x55a0(%esi),%xmm4
-  .byte  15,84,182,176,85,0,0                // andps         0x55b0(%esi),%xmm6
-  .byte  15,86,182,192,85,0,0                // orps          0x55c0(%esi),%xmm6
-  .byte  15,88,166,208,85,0,0                // addps         0x55d0(%esi),%xmm4
-  .byte  15,40,190,224,85,0,0                // movaps        0x55e0(%esi),%xmm7
+  .byte  15,89,166,204,85,0,0                // mulps         0x55cc(%esi),%xmm4
+  .byte  15,84,182,220,85,0,0                // andps         0x55dc(%esi),%xmm6
+  .byte  15,86,182,236,85,0,0                // orps          0x55ec(%esi),%xmm6
+  .byte  15,88,166,252,85,0,0                // addps         0x55fc(%esi),%xmm4
+  .byte  15,40,190,12,86,0,0                 // movaps        0x560c(%esi),%xmm7
   .byte  15,89,254                           // mulps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
-  .byte  15,88,182,240,85,0,0                // addps         0x55f0(%esi),%xmm6
-  .byte  15,40,190,0,86,0,0                  // movaps        0x5600(%esi),%xmm7
+  .byte  15,88,182,28,86,0,0                 // addps         0x561c(%esi),%xmm6
+  .byte  15,40,190,44,86,0,0                 // movaps        0x562c(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
@@ -53181,21 +53492,21 @@
   .byte  15,91,245                           // cvtdq2ps      %xmm5,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,194,254,1                        // cmpltps       %xmm6,%xmm7
-  .byte  15,40,174,16,86,0,0                 // movaps        0x5610(%esi),%xmm5
+  .byte  15,40,174,60,86,0,0                 // movaps        0x563c(%esi),%xmm5
   .byte  15,84,253                           // andps         %xmm5,%xmm7
   .byte  15,92,247                           // subps         %xmm7,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,92,254                           // subps         %xmm6,%xmm7
-  .byte  15,88,166,32,86,0,0                 // addps         0x5620(%esi),%xmm4
-  .byte  15,40,182,48,86,0,0                 // movaps        0x5630(%esi),%xmm6
+  .byte  15,88,166,76,86,0,0                 // addps         0x564c(%esi),%xmm4
+  .byte  15,40,182,92,86,0,0                 // movaps        0x565c(%esi),%xmm6
   .byte  15,89,247                           // mulps         %xmm7,%xmm6
   .byte  15,92,230                           // subps         %xmm6,%xmm4
-  .byte  15,40,182,64,86,0,0                 // movaps        0x5640(%esi),%xmm6
+  .byte  15,40,182,108,86,0,0                // movaps        0x566c(%esi),%xmm6
   .byte  15,92,247                           // subps         %xmm7,%xmm6
-  .byte  15,40,190,80,86,0,0                 // movaps        0x5650(%esi),%xmm7
+  .byte  15,40,190,124,86,0,0                // movaps        0x567c(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,88,252                           // addps         %xmm4,%xmm7
-  .byte  15,89,190,96,86,0,0                 // mulps         0x5660(%esi),%xmm7
+  .byte  15,89,190,140,86,0,0                // mulps         0x568c(%esi),%xmm7
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  243,15,16,103,16                    // movss         0x10(%edi),%xmm4
   .byte  15,198,228,0                        // shufps        $0x0,%xmm4,%xmm4
@@ -53249,7 +53560,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          42c2 <_sk_parametric_g_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          43a6 <_sk_parametric_g_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -53264,15 +53575,15 @@
   .byte  15,88,244                           // addps         %xmm4,%xmm6
   .byte  15,198,237,0                        // shufps        $0x0,%xmm5,%xmm5
   .byte  15,91,230                           // cvtdq2ps      %xmm6,%xmm4
-  .byte  15,89,166,14,85,0,0                 // mulps         0x550e(%esi),%xmm4
-  .byte  15,84,182,30,85,0,0                 // andps         0x551e(%esi),%xmm6
-  .byte  15,86,182,46,85,0,0                 // orps          0x552e(%esi),%xmm6
-  .byte  15,88,166,62,85,0,0                 // addps         0x553e(%esi),%xmm4
-  .byte  15,40,190,78,85,0,0                 // movaps        0x554e(%esi),%xmm7
+  .byte  15,89,166,58,85,0,0                 // mulps         0x553a(%esi),%xmm4
+  .byte  15,84,182,74,85,0,0                 // andps         0x554a(%esi),%xmm6
+  .byte  15,86,182,90,85,0,0                 // orps          0x555a(%esi),%xmm6
+  .byte  15,88,166,106,85,0,0                // addps         0x556a(%esi),%xmm4
+  .byte  15,40,190,122,85,0,0                // movaps        0x557a(%esi),%xmm7
   .byte  15,89,254                           // mulps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
-  .byte  15,88,182,94,85,0,0                 // addps         0x555e(%esi),%xmm6
-  .byte  15,40,190,110,85,0,0                // movaps        0x556e(%esi),%xmm7
+  .byte  15,88,182,138,85,0,0                // addps         0x558a(%esi),%xmm6
+  .byte  15,40,190,154,85,0,0                // movaps        0x559a(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
@@ -53280,21 +53591,21 @@
   .byte  15,91,245                           // cvtdq2ps      %xmm5,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,194,254,1                        // cmpltps       %xmm6,%xmm7
-  .byte  15,40,174,126,85,0,0                // movaps        0x557e(%esi),%xmm5
+  .byte  15,40,174,170,85,0,0                // movaps        0x55aa(%esi),%xmm5
   .byte  15,84,253                           // andps         %xmm5,%xmm7
   .byte  15,92,247                           // subps         %xmm7,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,92,254                           // subps         %xmm6,%xmm7
-  .byte  15,88,166,142,85,0,0                // addps         0x558e(%esi),%xmm4
-  .byte  15,40,182,158,85,0,0                // movaps        0x559e(%esi),%xmm6
+  .byte  15,88,166,186,85,0,0                // addps         0x55ba(%esi),%xmm4
+  .byte  15,40,182,202,85,0,0                // movaps        0x55ca(%esi),%xmm6
   .byte  15,89,247                           // mulps         %xmm7,%xmm6
   .byte  15,92,230                           // subps         %xmm6,%xmm4
-  .byte  15,40,182,174,85,0,0                // movaps        0x55ae(%esi),%xmm6
+  .byte  15,40,182,218,85,0,0                // movaps        0x55da(%esi),%xmm6
   .byte  15,92,247                           // subps         %xmm7,%xmm6
-  .byte  15,40,190,190,85,0,0                // movaps        0x55be(%esi),%xmm7
+  .byte  15,40,190,234,85,0,0                // movaps        0x55ea(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,88,252                           // addps         %xmm4,%xmm7
-  .byte  15,89,190,206,85,0,0                // mulps         0x55ce(%esi),%xmm7
+  .byte  15,89,190,250,85,0,0                // mulps         0x55fa(%esi),%xmm7
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  243,15,16,103,16                    // movss         0x10(%edi),%xmm4
   .byte  15,198,228,0                        // shufps        $0x0,%xmm4,%xmm4
@@ -53348,7 +53659,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          4424 <_sk_parametric_b_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4508 <_sk_parametric_b_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -53363,15 +53674,15 @@
   .byte  15,88,244                           // addps         %xmm4,%xmm6
   .byte  15,198,237,0                        // shufps        $0x0,%xmm5,%xmm5
   .byte  15,91,230                           // cvtdq2ps      %xmm6,%xmm4
-  .byte  15,89,166,124,84,0,0                // mulps         0x547c(%esi),%xmm4
-  .byte  15,84,182,140,84,0,0                // andps         0x548c(%esi),%xmm6
-  .byte  15,86,182,156,84,0,0                // orps          0x549c(%esi),%xmm6
-  .byte  15,88,166,172,84,0,0                // addps         0x54ac(%esi),%xmm4
-  .byte  15,40,190,188,84,0,0                // movaps        0x54bc(%esi),%xmm7
+  .byte  15,89,166,168,84,0,0                // mulps         0x54a8(%esi),%xmm4
+  .byte  15,84,182,184,84,0,0                // andps         0x54b8(%esi),%xmm6
+  .byte  15,86,182,200,84,0,0                // orps          0x54c8(%esi),%xmm6
+  .byte  15,88,166,216,84,0,0                // addps         0x54d8(%esi),%xmm4
+  .byte  15,40,190,232,84,0,0                // movaps        0x54e8(%esi),%xmm7
   .byte  15,89,254                           // mulps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
-  .byte  15,88,182,204,84,0,0                // addps         0x54cc(%esi),%xmm6
-  .byte  15,40,190,220,84,0,0                // movaps        0x54dc(%esi),%xmm7
+  .byte  15,88,182,248,84,0,0                // addps         0x54f8(%esi),%xmm6
+  .byte  15,40,190,8,85,0,0                  // movaps        0x5508(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
@@ -53379,21 +53690,21 @@
   .byte  15,91,245                           // cvtdq2ps      %xmm5,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,194,254,1                        // cmpltps       %xmm6,%xmm7
-  .byte  15,40,174,236,84,0,0                // movaps        0x54ec(%esi),%xmm5
+  .byte  15,40,174,24,85,0,0                 // movaps        0x5518(%esi),%xmm5
   .byte  15,84,253                           // andps         %xmm5,%xmm7
   .byte  15,92,247                           // subps         %xmm7,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,92,254                           // subps         %xmm6,%xmm7
-  .byte  15,88,166,252,84,0,0                // addps         0x54fc(%esi),%xmm4
-  .byte  15,40,182,12,85,0,0                 // movaps        0x550c(%esi),%xmm6
+  .byte  15,88,166,40,85,0,0                 // addps         0x5528(%esi),%xmm4
+  .byte  15,40,182,56,85,0,0                 // movaps        0x5538(%esi),%xmm6
   .byte  15,89,247                           // mulps         %xmm7,%xmm6
   .byte  15,92,230                           // subps         %xmm6,%xmm4
-  .byte  15,40,182,28,85,0,0                 // movaps        0x551c(%esi),%xmm6
+  .byte  15,40,182,72,85,0,0                 // movaps        0x5548(%esi),%xmm6
   .byte  15,92,247                           // subps         %xmm7,%xmm6
-  .byte  15,40,190,44,85,0,0                 // movaps        0x552c(%esi),%xmm7
+  .byte  15,40,190,88,85,0,0                 // movaps        0x5558(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,88,252                           // addps         %xmm4,%xmm7
-  .byte  15,89,190,60,85,0,0                 // mulps         0x553c(%esi),%xmm7
+  .byte  15,89,190,104,85,0,0                // mulps         0x5568(%esi),%xmm7
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  243,15,16,103,16                    // movss         0x10(%edi),%xmm4
   .byte  15,198,228,0                        // shufps        $0x0,%xmm4,%xmm4
@@ -53447,7 +53758,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          4586 <_sk_parametric_a_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          466a <_sk_parametric_a_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -53462,15 +53773,15 @@
   .byte  15,88,244                           // addps         %xmm4,%xmm6
   .byte  15,198,237,0                        // shufps        $0x0,%xmm5,%xmm5
   .byte  15,91,230                           // cvtdq2ps      %xmm6,%xmm4
-  .byte  15,89,166,234,83,0,0                // mulps         0x53ea(%esi),%xmm4
-  .byte  15,84,182,250,83,0,0                // andps         0x53fa(%esi),%xmm6
-  .byte  15,86,182,10,84,0,0                 // orps          0x540a(%esi),%xmm6
-  .byte  15,88,166,26,84,0,0                 // addps         0x541a(%esi),%xmm4
-  .byte  15,40,190,42,84,0,0                 // movaps        0x542a(%esi),%xmm7
+  .byte  15,89,166,22,84,0,0                 // mulps         0x5416(%esi),%xmm4
+  .byte  15,84,182,38,84,0,0                 // andps         0x5426(%esi),%xmm6
+  .byte  15,86,182,54,84,0,0                 // orps          0x5436(%esi),%xmm6
+  .byte  15,88,166,70,84,0,0                 // addps         0x5446(%esi),%xmm4
+  .byte  15,40,190,86,84,0,0                 // movaps        0x5456(%esi),%xmm7
   .byte  15,89,254                           // mulps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
-  .byte  15,88,182,58,84,0,0                 // addps         0x543a(%esi),%xmm6
-  .byte  15,40,190,74,84,0,0                 // movaps        0x544a(%esi),%xmm7
+  .byte  15,88,182,102,84,0,0                // addps         0x5466(%esi),%xmm6
+  .byte  15,40,190,118,84,0,0                // movaps        0x5476(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,92,231                           // subps         %xmm7,%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
@@ -53478,21 +53789,21 @@
   .byte  15,91,245                           // cvtdq2ps      %xmm5,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,194,254,1                        // cmpltps       %xmm6,%xmm7
-  .byte  15,40,174,90,84,0,0                 // movaps        0x545a(%esi),%xmm5
+  .byte  15,40,174,134,84,0,0                // movaps        0x5486(%esi),%xmm5
   .byte  15,84,253                           // andps         %xmm5,%xmm7
   .byte  15,92,247                           // subps         %xmm7,%xmm6
   .byte  15,40,252                           // movaps        %xmm4,%xmm7
   .byte  15,92,254                           // subps         %xmm6,%xmm7
-  .byte  15,88,166,106,84,0,0                // addps         0x546a(%esi),%xmm4
-  .byte  15,40,182,122,84,0,0                // movaps        0x547a(%esi),%xmm6
+  .byte  15,88,166,150,84,0,0                // addps         0x5496(%esi),%xmm4
+  .byte  15,40,182,166,84,0,0                // movaps        0x54a6(%esi),%xmm6
   .byte  15,89,247                           // mulps         %xmm7,%xmm6
   .byte  15,92,230                           // subps         %xmm6,%xmm4
-  .byte  15,40,182,138,84,0,0                // movaps        0x548a(%esi),%xmm6
+  .byte  15,40,182,182,84,0,0                // movaps        0x54b6(%esi),%xmm6
   .byte  15,92,247                           // subps         %xmm7,%xmm6
-  .byte  15,40,190,154,84,0,0                // movaps        0x549a(%esi),%xmm7
+  .byte  15,40,190,198,84,0,0                // movaps        0x54c6(%esi),%xmm7
   .byte  15,94,254                           // divps         %xmm6,%xmm7
   .byte  15,88,252                           // addps         %xmm4,%xmm7
-  .byte  15,89,190,170,84,0,0                // mulps         0x54aa(%esi),%xmm7
+  .byte  15,89,190,214,84,0,0                // mulps         0x54d6(%esi),%xmm7
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  243,15,16,103,16                    // movss         0x10(%edi),%xmm4
   .byte  15,198,228,0                        // shufps        $0x0,%xmm4,%xmm4
@@ -53549,31 +53860,31 @@
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
-  .byte  232,0,0,0,0                         // call          46f2 <_sk_lab_to_xyz_sse2+0x18>
+  .byte  232,0,0,0,0                         // call          47d6 <_sk_lab_to_xyz_sse2+0x18>
   .byte  88                                  // pop           %eax
-  .byte  15,89,144,78,83,0,0                 // mulps         0x534e(%eax),%xmm2
-  .byte  15,40,160,94,83,0,0                 // movaps        0x535e(%eax),%xmm4
+  .byte  15,89,144,122,83,0,0                // mulps         0x537a(%eax),%xmm2
+  .byte  15,40,160,138,83,0,0                // movaps        0x538a(%eax),%xmm4
   .byte  15,89,204                           // mulps         %xmm4,%xmm1
-  .byte  15,40,168,110,83,0,0                // movaps        0x536e(%eax),%xmm5
+  .byte  15,40,168,154,83,0,0                // movaps        0x539a(%eax),%xmm5
   .byte  15,88,205                           // addps         %xmm5,%xmm1
   .byte  15,89,220                           // mulps         %xmm4,%xmm3
   .byte  15,88,221                           // addps         %xmm5,%xmm3
-  .byte  15,88,144,126,83,0,0                // addps         0x537e(%eax),%xmm2
-  .byte  15,89,144,142,83,0,0                // mulps         0x538e(%eax),%xmm2
-  .byte  15,89,136,158,83,0,0                // mulps         0x539e(%eax),%xmm1
+  .byte  15,88,144,170,83,0,0                // addps         0x53aa(%eax),%xmm2
+  .byte  15,89,144,186,83,0,0                // mulps         0x53ba(%eax),%xmm2
+  .byte  15,89,136,202,83,0,0                // mulps         0x53ca(%eax),%xmm1
   .byte  15,88,202                           // addps         %xmm2,%xmm1
-  .byte  15,89,152,174,83,0,0                // mulps         0x53ae(%eax),%xmm3
+  .byte  15,89,152,218,83,0,0                // mulps         0x53da(%eax),%xmm3
   .byte  15,40,234                           // movaps        %xmm2,%xmm5
   .byte  15,92,235                           // subps         %xmm3,%xmm5
   .byte  15,40,193                           // movaps        %xmm1,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
   .byte  15,89,193                           // mulps         %xmm1,%xmm0
-  .byte  15,40,152,190,83,0,0                // movaps        0x53be(%eax),%xmm3
+  .byte  15,40,152,234,83,0,0                // movaps        0x53ea(%eax),%xmm3
   .byte  15,40,227                           // movaps        %xmm3,%xmm4
   .byte  15,194,224,1                        // cmpltps       %xmm0,%xmm4
-  .byte  15,40,176,206,83,0,0                // movaps        0x53ce(%eax),%xmm6
+  .byte  15,40,176,250,83,0,0                // movaps        0x53fa(%eax),%xmm6
   .byte  15,88,206                           // addps         %xmm6,%xmm1
-  .byte  15,40,184,222,83,0,0                // movaps        0x53de(%eax),%xmm7
+  .byte  15,40,184,10,84,0,0                 // movaps        0x540a(%eax),%xmm7
   .byte  15,89,207                           // mulps         %xmm7,%xmm1
   .byte  15,84,196                           // andps         %xmm4,%xmm0
   .byte  15,85,225                           // andnps        %xmm1,%xmm4
@@ -53605,8 +53916,8 @@
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
   .byte  15,86,216                           // orps          %xmm0,%xmm3
   .byte  15,40,69,88                         // movaps        0x58(%ebp),%xmm0
-  .byte  15,89,160,238,83,0,0                // mulps         0x53ee(%eax),%xmm4
-  .byte  15,89,152,254,83,0,0                // mulps         0x53fe(%eax),%xmm3
+  .byte  15,89,160,26,84,0,0                 // mulps         0x541a(%eax),%xmm4
+  .byte  15,89,152,42,84,0,0                 // mulps         0x542a(%eax),%xmm3
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  141,88,4                            // lea           0x4(%eax),%ebx
   .byte  15,41,68,36,80                      // movaps        %xmm0,0x50(%esp)
@@ -53639,7 +53950,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          4821 <_sk_load_a8_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4905 <_sk_load_a8_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  15,40,101,88                        // movaps        0x58(%ebp),%xmm4
   .byte  15,40,85,72                         // movaps        0x48(%ebp),%xmm2
@@ -53652,13 +53963,13 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
-  .byte  117,98                              // jne           48a9 <_sk_load_a8_sse2+0x96>
+  .byte  117,98                              // jne           498d <_sk_load_a8_sse2+0x96>
   .byte  102,15,110,28,25                    // movd          (%ecx,%ebx,1),%xmm3
   .byte  102,15,96,216                       // punpcklbw     %xmm0,%xmm3
   .byte  102,15,97,216                       // punpcklwd     %xmm0,%xmm3
-  .byte  102,15,219,158,223,82,0,0           // pand          0x52df(%esi),%xmm3
+  .byte  102,15,219,158,11,83,0,0            // pand          0x530b(%esi),%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,158,239,82,0,0                // mulps         0x52ef(%esi),%xmm3
+  .byte  15,89,158,27,83,0,0                 // mulps         0x531b(%esi),%xmm3
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
   .byte  15,41,100,36,80                     // movaps        %xmm4,0x50(%esp)
   .byte  15,41,84,36,64                      // movaps        %xmm2,0x40(%esp)
@@ -53683,13 +53994,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,61                              // je            48f3 <_sk_load_a8_sse2+0xe0>
+  .byte  116,61                              // je            49d7 <_sk_load_a8_sse2+0xe0>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,23                              // je            48da <_sk_load_a8_sse2+0xc7>
+  .byte  116,23                              // je            49be <_sk_load_a8_sse2+0xc7>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,139                             // jne           4854 <_sk_load_a8_sse2+0x41>
+  .byte  117,139                             // jne           4938 <_sk_load_a8_sse2+0x41>
   .byte  15,182,124,25,2                     // movzbl        0x2(%ecx,%ebx,1),%edi
   .byte  102,15,110,223                      // movd          %edi,%xmm3
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
@@ -53699,11 +54010,11 @@
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,221                       // movsd         %xmm5,%xmm3
-  .byte  233,97,255,255,255                  // jmp           4854 <_sk_load_a8_sse2+0x41>
+  .byte  233,97,255,255,255                  // jmp           4938 <_sk_load_a8_sse2+0x41>
   .byte  15,182,12,25                        // movzbl        (%ecx,%ebx,1),%ecx
   .byte  102,15,110,217                      // movd          %ecx,%xmm3
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,81,255,255,255                  // jmp           4854 <_sk_load_a8_sse2+0x41>
+  .byte  233,81,255,255,255                  // jmp           4938 <_sk_load_a8_sse2+0x41>
 
 HIDDEN _sk_load_a8_dst_sse2
 .globl _sk_load_a8_dst_sse2
@@ -53715,7 +54026,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          4911 <_sk_load_a8_dst_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          49f5 <_sk_load_a8_dst_sse2+0xe>
   .byte  91                                  // pop           %ebx
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -53724,14 +54035,14 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
-  .byte  117,94                              // jne           4984 <_sk_load_a8_dst_sse2+0x81>
+  .byte  117,94                              // jne           4a68 <_sk_load_a8_dst_sse2+0x81>
   .byte  102,15,110,36,57                    // movd          (%ecx,%edi,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,219,163,15,82,0,0            // pand          0x520f(%ebx),%xmm4
+  .byte  102,15,219,163,59,82,0,0            // pand          0x523b(%ebx),%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
   .byte  102,15,87,237                       // xorpd         %xmm5,%xmm5
-  .byte  15,89,163,31,82,0,0                 // mulps         0x521f(%ebx),%xmm4
+  .byte  15,89,163,75,82,0,0                 // mulps         0x524b(%ebx),%xmm4
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
   .byte  102,15,41,108,36,64                 // movapd        %xmm5,0x40(%esp)
   .byte  102,15,41,108,36,48                 // movapd        %xmm5,0x30(%esp)
@@ -53753,13 +54064,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,61                              // je            49ce <_sk_load_a8_dst_sse2+0xcb>
+  .byte  116,61                              // je            4ab2 <_sk_load_a8_dst_sse2+0xcb>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,23                              // je            49b5 <_sk_load_a8_dst_sse2+0xb2>
+  .byte  116,23                              // je            4a99 <_sk_load_a8_dst_sse2+0xb2>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,143                             // jne           4933 <_sk_load_a8_dst_sse2+0x30>
+  .byte  117,143                             // jne           4a17 <_sk_load_a8_dst_sse2+0x30>
   .byte  15,182,116,57,2                     // movzbl        0x2(%ecx,%edi,1),%esi
   .byte  102,15,110,230                      // movd          %esi,%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -53769,11 +54080,11 @@
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  233,101,255,255,255                 // jmp           4933 <_sk_load_a8_dst_sse2+0x30>
+  .byte  233,101,255,255,255                 // jmp           4a17 <_sk_load_a8_dst_sse2+0x30>
   .byte  15,182,12,57                        // movzbl        (%ecx,%edi,1),%ecx
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,85,255,255,255                  // jmp           4933 <_sk_load_a8_dst_sse2+0x30>
+  .byte  233,85,255,255,255                  // jmp           4a17 <_sk_load_a8_dst_sse2+0x30>
 
 HIDDEN _sk_gather_a8_sse2
 .globl _sk_gather_a8_sse2
@@ -53812,7 +54123,7 @@
   .byte  102,15,126,206                      // movd          %xmm1,%esi
   .byte  15,182,12,10                        // movzbl        (%edx,%ecx,1),%ecx
   .byte  15,182,20,50                        // movzbl        (%edx,%esi,1),%edx
-  .byte  232,0,0,0,0                         // call          4a58 <_sk_gather_a8_sse2+0x7a>
+  .byte  232,0,0,0,0                         // call          4b3c <_sk_gather_a8_sse2+0x7a>
   .byte  94                                  // pop           %esi
   .byte  193,226,8                           // shl           $0x8,%edx
   .byte  9,202                               // or            %ecx,%edx
@@ -53825,7 +54136,7 @@
   .byte  102,15,96,193                       // punpcklbw     %xmm1,%xmm0
   .byte  102,15,97,193                       // punpcklwd     %xmm1,%xmm0
   .byte  15,91,216                           // cvtdq2ps      %xmm0,%xmm3
-  .byte  15,89,158,232,80,0,0                // mulps         0x50e8(%esi),%xmm3
+  .byte  15,89,158,20,81,0,0                 // mulps         0x5114(%esi),%xmm3
   .byte  139,117,24                          // mov           0x18(%ebp),%esi
   .byte  15,40,69,40                         // movaps        0x28(%ebp),%xmm0
   .byte  15,40,77,56                         // movaps        0x38(%ebp),%xmm1
@@ -53862,7 +54173,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  129,236,156,0,0,0                   // sub           $0x9c,%esp
-  .byte  232,0,0,0,0                         // call          4ae9 <_sk_store_a8_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          4bcd <_sk_store_a8_sse2+0x11>
   .byte  89                                  // pop           %ecx
   .byte  15,40,117,88                        // movaps        0x58(%ebp),%xmm6
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
@@ -53871,7 +54182,7 @@
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  139,48                              // mov           (%eax),%esi
   .byte  139,30                              // mov           (%esi),%ebx
-  .byte  15,40,161,103,80,0,0                // movaps        0x5067(%ecx),%xmm4
+  .byte  15,40,161,147,80,0,0                // movaps        0x5093(%ecx),%xmm4
   .byte  15,89,227                           // mulps         %xmm3,%xmm4
   .byte  102,15,91,228                       // cvtps2dq      %xmm4,%xmm4
   .byte  102,15,114,244,16                   // pslld         $0x10,%xmm4
@@ -53882,7 +54193,7 @@
   .byte  133,255                             // test          %edi,%edi
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  15,40,125,40                        // movaps        0x28(%ebp),%xmm7
-  .byte  117,70                              // jne           4b72 <_sk_store_a8_sse2+0x9a>
+  .byte  117,70                              // jne           4c56 <_sk_store_a8_sse2+0x9a>
   .byte  102,15,126,225                      // movd          %xmm4,%ecx
   .byte  137,12,59                           // mov           %ecx,(%ebx,%edi,1)
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
@@ -53909,30 +54220,30 @@
   .byte  137,240                             // mov           %esi,%eax
   .byte  36,3                                // and           $0x3,%al
   .byte  60,1                                // cmp           $0x1,%al
-  .byte  116,69                              // je            4bc7 <_sk_store_a8_sse2+0xef>
+  .byte  116,69                              // je            4cab <_sk_store_a8_sse2+0xef>
   .byte  136,69,243                          // mov           %al,-0xd(%ebp)
   .byte  60,2                                // cmp           $0x2,%al
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
-  .byte  116,21                              // je            4ba1 <_sk_store_a8_sse2+0xc9>
+  .byte  116,21                              // je            4c85 <_sk_store_a8_sse2+0xc9>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,161                             // jne           4b33 <_sk_store_a8_sse2+0x5b>
+  .byte  117,161                             // jne           4c17 <_sk_store_a8_sse2+0x5b>
   .byte  102,15,127,101,200                  // movdqa        %xmm4,-0x38(%ebp)
   .byte  138,85,208                          // mov           -0x30(%ebp),%dl
   .byte  136,84,59,2                         // mov           %dl,0x2(%ebx,%edi,1)
   .byte  139,85,20                           // mov           0x14(%ebp),%edx
   .byte  102,15,112,228,212                  // pshufd        $0xd4,%xmm4,%xmm4
-  .byte  102,15,219,161,119,80,0,0           // pand          0x5077(%ecx),%xmm4
+  .byte  102,15,219,161,163,80,0,0           // pand          0x50a3(%ecx),%xmm4
   .byte  102,15,103,228                      // packuswb      %xmm4,%xmm4
   .byte  102,15,103,228                      // packuswb      %xmm4,%xmm4
   .byte  102,15,103,228                      // packuswb      %xmm4,%xmm4
   .byte  102,15,126,225                      // movd          %xmm4,%ecx
   .byte  102,137,12,59                       // mov           %cx,(%ebx,%edi,1)
-  .byte  233,108,255,255,255                 // jmp           4b33 <_sk_store_a8_sse2+0x5b>
+  .byte  233,108,255,255,255                 // jmp           4c17 <_sk_store_a8_sse2+0x5b>
   .byte  102,15,127,101,216                  // movdqa        %xmm4,-0x28(%ebp)
   .byte  138,77,216                          // mov           -0x28(%ebp),%cl
   .byte  136,12,59                           // mov           %cl,(%ebx,%edi,1)
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
-  .byte  233,89,255,255,255                  // jmp           4b33 <_sk_store_a8_sse2+0x5b>
+  .byte  233,89,255,255,255                  // jmp           4c17 <_sk_store_a8_sse2+0x5b>
 
 HIDDEN _sk_load_g8_sse2
 .globl _sk_load_g8_sse2
@@ -53944,7 +54255,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          4be8 <_sk_load_g8_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4ccc <_sk_load_g8_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  15,40,101,88                        // movaps        0x58(%ebp),%xmm4
   .byte  15,40,93,72                         // movaps        0x48(%ebp),%xmm3
@@ -53957,13 +54268,13 @@
   .byte  139,18                              // mov           (%edx),%edx
   .byte  133,219                             // test          %ebx,%ebx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
-  .byte  117,100                             // jne           4c71 <_sk_load_g8_sse2+0x97>
+  .byte  117,100                             // jne           4d55 <_sk_load_g8_sse2+0x97>
   .byte  102,15,110,4,58                     // movd          (%edx,%edi,1),%xmm0
   .byte  102,15,96,192                       // punpcklbw     %xmm0,%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
-  .byte  102,15,219,128,136,79,0,0           // pand          0x4f88(%eax),%xmm0
+  .byte  102,15,219,128,180,79,0,0           // pand          0x4fb4(%eax),%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,128,152,79,0,0                // mulps         0x4f98(%eax),%xmm0
+  .byte  15,89,128,196,79,0,0                // mulps         0x4fc4(%eax),%xmm0
   .byte  141,81,8                            // lea           0x8(%ecx),%edx
   .byte  15,41,100,36,80                     // movaps        %xmm4,0x50(%esp)
   .byte  15,41,92,36,64                      // movaps        %xmm3,0x40(%esp)
@@ -53975,7 +54286,7 @@
   .byte  137,84,36,4                         // mov           %edx,0x4(%esp)
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
   .byte  137,20,36                           // mov           %edx,(%esp)
-  .byte  15,40,152,168,79,0,0                // movaps        0x4fa8(%eax),%xmm3
+  .byte  15,40,152,212,79,0,0                // movaps        0x4fd4(%eax),%xmm3
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  255,81,4                            // call          *0x4(%ecx)
@@ -53988,13 +54299,13 @@
   .byte  136,93,243                          // mov           %bl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,61                              // je            4cbb <_sk_load_g8_sse2+0xe1>
+  .byte  116,61                              // je            4d9f <_sk_load_g8_sse2+0xe1>
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,93,24                           // mov           0x18(%ebp),%ebx
-  .byte  116,23                              // je            4ca2 <_sk_load_g8_sse2+0xc8>
+  .byte  116,23                              // je            4d86 <_sk_load_g8_sse2+0xc8>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,137                             // jne           4c1a <_sk_load_g8_sse2+0x40>
+  .byte  117,137                             // jne           4cfe <_sk_load_g8_sse2+0x40>
   .byte  15,182,116,58,2                     // movzbl        0x2(%edx,%edi,1),%esi
   .byte  102,15,110,198                      // movd          %esi,%xmm0
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -54004,11 +54315,11 @@
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,197                       // movsd         %xmm5,%xmm0
-  .byte  233,95,255,255,255                  // jmp           4c1a <_sk_load_g8_sse2+0x40>
+  .byte  233,95,255,255,255                  // jmp           4cfe <_sk_load_g8_sse2+0x40>
   .byte  15,182,20,58                        // movzbl        (%edx,%edi,1),%edx
   .byte  102,15,110,194                      // movd          %edx,%xmm0
   .byte  139,93,24                           // mov           0x18(%ebp),%ebx
-  .byte  233,79,255,255,255                  // jmp           4c1a <_sk_load_g8_sse2+0x40>
+  .byte  233,79,255,255,255                  // jmp           4cfe <_sk_load_g8_sse2+0x40>
 
 HIDDEN _sk_load_g8_dst_sse2
 .globl _sk_load_g8_dst_sse2
@@ -54020,7 +54331,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          4cd9 <_sk_load_g8_dst_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4dbd <_sk_load_g8_dst_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
@@ -54029,15 +54340,15 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
-  .byte  117,94                              // jne           4d4c <_sk_load_g8_dst_sse2+0x81>
+  .byte  117,94                              // jne           4e30 <_sk_load_g8_dst_sse2+0x81>
   .byte  102,15,110,36,25                    // movd          (%ecx,%ebx,1),%xmm4
   .byte  102,15,96,224                       // punpcklbw     %xmm0,%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,219,166,199,78,0,0           // pand          0x4ec7(%esi),%xmm4
+  .byte  102,15,219,166,243,78,0,0           // pand          0x4ef3(%esi),%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,166,215,78,0,0                // mulps         0x4ed7(%esi),%xmm4
+  .byte  15,89,166,3,79,0,0                  // mulps         0x4f03(%esi),%xmm4
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
-  .byte  15,40,174,231,78,0,0                // movaps        0x4ee7(%esi),%xmm5
+  .byte  15,40,174,19,79,0,0                 // movaps        0x4f13(%esi),%xmm5
   .byte  15,41,108,36,80                     // movaps        %xmm5,0x50(%esp)
   .byte  137,84,36,16                        // mov           %edx,0x10(%esp)
   .byte  137,124,36,12                       // mov           %edi,0xc(%esp)
@@ -54058,13 +54369,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,61                              // je            4d96 <_sk_load_g8_dst_sse2+0xcb>
+  .byte  116,61                              // je            4e7a <_sk_load_g8_dst_sse2+0xcb>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,23                              // je            4d7d <_sk_load_g8_dst_sse2+0xb2>
+  .byte  116,23                              // je            4e61 <_sk_load_g8_dst_sse2+0xb2>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,143                             // jne           4cfb <_sk_load_g8_dst_sse2+0x30>
+  .byte  117,143                             // jne           4ddf <_sk_load_g8_dst_sse2+0x30>
   .byte  15,182,124,25,2                     // movzbl        0x2(%ecx,%ebx,1),%edi
   .byte  102,15,110,231                      // movd          %edi,%xmm4
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
@@ -54074,11 +54385,11 @@
   .byte  102,15,96,232                       // punpcklbw     %xmm0,%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  233,101,255,255,255                 // jmp           4cfb <_sk_load_g8_dst_sse2+0x30>
+  .byte  233,101,255,255,255                 // jmp           4ddf <_sk_load_g8_dst_sse2+0x30>
   .byte  15,182,12,25                        // movzbl        (%ecx,%ebx,1),%ecx
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,85,255,255,255                  // jmp           4cfb <_sk_load_g8_dst_sse2+0x30>
+  .byte  233,85,255,255,255                  // jmp           4ddf <_sk_load_g8_dst_sse2+0x30>
 
 HIDDEN _sk_gather_g8_sse2
 .globl _sk_gather_g8_sse2
@@ -54117,7 +54428,7 @@
   .byte  102,15,126,206                      // movd          %xmm1,%esi
   .byte  15,182,12,10                        // movzbl        (%edx,%ecx,1),%ecx
   .byte  15,182,20,50                        // movzbl        (%edx,%esi,1),%edx
-  .byte  232,0,0,0,0                         // call          4e20 <_sk_gather_g8_sse2+0x7a>
+  .byte  232,0,0,0,0                         // call          4f04 <_sk_gather_g8_sse2+0x7a>
   .byte  94                                  // pop           %esi
   .byte  193,226,8                           // shl           $0x8,%edx
   .byte  9,202                               // or            %ecx,%edx
@@ -54133,7 +54444,7 @@
   .byte  102,15,96,197                       // punpcklbw     %xmm5,%xmm0
   .byte  102,15,97,197                       // punpcklwd     %xmm5,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,134,176,77,0,0                // mulps         0x4db0(%esi),%xmm0
+  .byte  15,89,134,220,77,0,0                // mulps         0x4ddc(%esi),%xmm0
   .byte  139,93,24                           // mov           0x18(%ebp),%ebx
   .byte  137,193                             // mov           %eax,%ecx
   .byte  141,65,8                            // lea           0x8(%ecx),%eax
@@ -54147,7 +54458,7 @@
   .byte  137,68,36,4                         // mov           %eax,0x4(%esp)
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  137,4,36                            // mov           %eax,(%esp)
-  .byte  15,40,158,192,77,0,0                // movaps        0x4dc0(%esi),%xmm3
+  .byte  15,40,158,236,77,0,0                // movaps        0x4dec(%esi),%xmm3
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
   .byte  15,40,208                           // movaps        %xmm0,%xmm2
   .byte  255,81,4                            // call          *0x4(%ecx)
@@ -54168,7 +54479,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          4eb4 <_sk_gather_i8_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          4f98 <_sk_gather_i8_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  137,69,240                          // mov           %eax,-0x10(%ebp)
   .byte  15,40,125,88                        // movaps        0x58(%ebp),%xmm7
@@ -54176,10 +54487,10 @@
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  139,16                              // mov           (%eax),%edx
   .byte  133,210                             // test          %edx,%edx
-  .byte  116,7                               // je            4ed0 <_sk_gather_i8_sse2+0x2a>
+  .byte  116,7                               // je            4fb4 <_sk_gather_i8_sse2+0x2a>
   .byte  131,192,4                           // add           $0x4,%eax
   .byte  137,209                             // mov           %edx,%ecx
-  .byte  235,6                               // jmp           4ed6 <_sk_gather_i8_sse2+0x30>
+  .byte  235,6                               // jmp           4fba <_sk_gather_i8_sse2+0x30>
   .byte  139,72,4                            // mov           0x4(%eax),%ecx
   .byte  131,192,8                           // add           $0x8,%eax
   .byte  139,49                              // mov           (%ecx),%esi
@@ -54230,11 +54541,11 @@
   .byte  102,15,98,232                       // punpckldq     %xmm0,%xmm5
   .byte  102,15,98,233                       // punpckldq     %xmm1,%xmm5
   .byte  139,77,240                          // mov           -0x10(%ebp),%ecx
-  .byte  102,15,111,145,60,77,0,0            // movdqa        0x4d3c(%ecx),%xmm2
+  .byte  102,15,111,145,104,77,0,0           // movdqa        0x4d68(%ecx),%xmm2
   .byte  102,15,111,197                      // movdqa        %xmm5,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,40,161,76,77,0,0                 // movaps        0x4d4c(%ecx),%xmm4
+  .byte  15,40,161,120,77,0,0                // movaps        0x4d78(%ecx),%xmm4
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
   .byte  102,15,111,205                      // movdqa        %xmm5,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -54283,7 +54594,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          5041 <_sk_load_565_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          5125 <_sk_load_565_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  15,40,117,88                        // movaps        0x58(%ebp),%xmm6
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
@@ -54296,20 +54607,20 @@
   .byte  139,18                              // mov           (%edx),%edx
   .byte  133,219                             // test          %ebx,%ebx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
-  .byte  15,133,134,0,0,0                    // jne           50f0 <_sk_load_565_sse2+0xbd>
+  .byte  15,133,134,0,0,0                    // jne           51d4 <_sk_load_565_sse2+0xbd>
   .byte  243,15,126,20,122                   // movq          (%edx,%edi,2),%xmm2
   .byte  102,15,97,208                       // punpcklwd     %xmm0,%xmm2
-  .byte  102,15,111,128,207,75,0,0           // movdqa        0x4bcf(%eax),%xmm0
+  .byte  102,15,111,128,251,75,0,0           // movdqa        0x4bfb(%eax),%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,128,223,75,0,0                // mulps         0x4bdf(%eax),%xmm0
-  .byte  102,15,111,136,239,75,0,0           // movdqa        0x4bef(%eax),%xmm1
+  .byte  15,89,128,11,76,0,0                 // mulps         0x4c0b(%eax),%xmm0
+  .byte  102,15,111,136,27,76,0,0            // movdqa        0x4c1b(%eax),%xmm1
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,136,255,75,0,0                // mulps         0x4bff(%eax),%xmm1
-  .byte  102,15,219,144,15,76,0,0            // pand          0x4c0f(%eax),%xmm2
+  .byte  15,89,136,43,76,0,0                 // mulps         0x4c2b(%eax),%xmm1
+  .byte  102,15,219,144,59,76,0,0            // pand          0x4c3b(%eax),%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,144,31,76,0,0                 // mulps         0x4c1f(%eax),%xmm2
+  .byte  15,89,144,75,76,0,0                 // mulps         0x4c4b(%eax),%xmm2
   .byte  141,81,8                            // lea           0x8(%ecx),%edx
   .byte  15,41,116,36,80                     // movaps        %xmm6,0x50(%esp)
   .byte  15,41,108,36,64                     // movaps        %xmm5,0x40(%esp)
@@ -54321,7 +54632,7 @@
   .byte  137,84,36,4                         // mov           %edx,0x4(%esp)
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
   .byte  137,20,36                           // mov           %edx,(%esp)
-  .byte  15,40,152,47,76,0,0                 // movaps        0x4c2f(%eax),%xmm3
+  .byte  15,40,152,91,76,0,0                 // movaps        0x4c5b(%eax),%xmm3
   .byte  255,81,4                            // call          *0x4(%ecx)
   .byte  131,196,108                         // add           $0x6c,%esp
   .byte  94                                  // pop           %esi
@@ -54332,13 +54643,13 @@
   .byte  136,93,243                          // mov           %bl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,58                              // je            5137 <_sk_load_565_sse2+0x104>
+  .byte  116,58                              // je            521b <_sk_load_565_sse2+0x104>
   .byte  102,15,239,210                      // pxor          %xmm2,%xmm2
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,93,24                           // mov           0x18(%ebp),%ebx
-  .byte  116,27                              // je            5125 <_sk_load_565_sse2+0xf2>
+  .byte  116,27                              // je            5209 <_sk_load_565_sse2+0xf2>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,95,255,255,255               // jne           5073 <_sk_load_565_sse2+0x40>
+  .byte  15,133,95,255,255,255               // jne           5157 <_sk_load_565_sse2+0x40>
   .byte  15,183,116,122,4                    // movzwl        0x4(%edx,%edi,2),%esi
   .byte  102,15,110,198                      // movd          %esi,%xmm0
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -54346,11 +54657,11 @@
   .byte  102,15,110,4,122                    // movd          (%edx,%edi,2),%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
   .byte  242,15,16,208                       // movsd         %xmm0,%xmm2
-  .byte  233,60,255,255,255                  // jmp           5073 <_sk_load_565_sse2+0x40>
+  .byte  233,60,255,255,255                  // jmp           5157 <_sk_load_565_sse2+0x40>
   .byte  15,183,20,122                       // movzwl        (%edx,%edi,2),%edx
   .byte  102,15,110,210                      // movd          %edx,%xmm2
   .byte  139,93,24                           // mov           0x18(%ebp),%ebx
-  .byte  233,44,255,255,255                  // jmp           5073 <_sk_load_565_sse2+0x40>
+  .byte  233,44,255,255,255                  // jmp           5157 <_sk_load_565_sse2+0x40>
 
 HIDDEN _sk_load_565_dst_sse2
 .globl _sk_load_565_dst_sse2
@@ -54362,7 +54673,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          5155 <_sk_load_565_dst_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          5239 <_sk_load_565_dst_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
@@ -54371,22 +54682,22 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
-  .byte  15,133,134,0,0,0                    // jne           51f4 <_sk_load_565_dst_sse2+0xad>
+  .byte  15,133,134,0,0,0                    // jne           52d8 <_sk_load_565_dst_sse2+0xad>
   .byte  243,15,126,36,89                    // movq          (%ecx,%ebx,2),%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,111,174,43,75,0,0            // movdqa        0x4b2b(%esi),%xmm5
+  .byte  102,15,111,174,87,75,0,0            // movdqa        0x4b57(%esi),%xmm5
   .byte  102,15,219,236                      // pand          %xmm4,%xmm5
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
-  .byte  15,89,174,59,75,0,0                 // mulps         0x4b3b(%esi),%xmm5
-  .byte  102,15,111,182,75,75,0,0            // movdqa        0x4b4b(%esi),%xmm6
+  .byte  15,89,174,103,75,0,0                // mulps         0x4b67(%esi),%xmm5
+  .byte  102,15,111,182,119,75,0,0           // movdqa        0x4b77(%esi),%xmm6
   .byte  102,15,219,244                      // pand          %xmm4,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,182,91,75,0,0                 // mulps         0x4b5b(%esi),%xmm6
-  .byte  102,15,219,166,107,75,0,0           // pand          0x4b6b(%esi),%xmm4
+  .byte  15,89,182,135,75,0,0                // mulps         0x4b87(%esi),%xmm6
+  .byte  102,15,219,166,151,75,0,0           // pand          0x4b97(%esi),%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,166,123,75,0,0                // mulps         0x4b7b(%esi),%xmm4
+  .byte  15,89,166,167,75,0,0                // mulps         0x4ba7(%esi),%xmm4
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
-  .byte  15,40,190,139,75,0,0                // movaps        0x4b8b(%esi),%xmm7
+  .byte  15,40,190,183,75,0,0                // movaps        0x4bb7(%esi),%xmm7
   .byte  15,41,124,36,80                     // movaps        %xmm7,0x50(%esp)
   .byte  137,84,36,16                        // mov           %edx,0x10(%esp)
   .byte  137,124,36,12                       // mov           %edi,0xc(%esp)
@@ -54407,13 +54718,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,58                              // je            523b <_sk_load_565_dst_sse2+0xf4>
+  .byte  116,58                              // je            531f <_sk_load_565_dst_sse2+0xf4>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,27                              // je            5229 <_sk_load_565_dst_sse2+0xe2>
+  .byte  116,27                              // je            530d <_sk_load_565_dst_sse2+0xe2>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,95,255,255,255               // jne           5177 <_sk_load_565_dst_sse2+0x30>
+  .byte  15,133,95,255,255,255               // jne           525b <_sk_load_565_dst_sse2+0x30>
   .byte  15,183,124,89,4                     // movzwl        0x4(%ecx,%ebx,2),%edi
   .byte  102,15,110,231                      // movd          %edi,%xmm4
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
@@ -54421,11 +54732,11 @@
   .byte  102,15,110,44,89                    // movd          (%ecx,%ebx,2),%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  233,60,255,255,255                  // jmp           5177 <_sk_load_565_dst_sse2+0x30>
+  .byte  233,60,255,255,255                  // jmp           525b <_sk_load_565_dst_sse2+0x30>
   .byte  15,183,12,89                        // movzwl        (%ecx,%ebx,2),%ecx
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,44,255,255,255                  // jmp           5177 <_sk_load_565_dst_sse2+0x30>
+  .byte  233,44,255,255,255                  // jmp           525b <_sk_load_565_dst_sse2+0x30>
 
 HIDDEN _sk_gather_565_sse2
 .globl _sk_gather_565_sse2
@@ -54437,7 +54748,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          5259 <_sk_gather_565_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          533d <_sk_gather_565_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,85,12                           // mov           0xc(%ebp),%edx
   .byte  139,50                              // mov           (%edx),%esi
@@ -54474,17 +54785,17 @@
   .byte  15,40,117,88                        // movaps        0x58(%ebp),%xmm6
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,208                       // punpcklwd     %xmm0,%xmm2
-  .byte  102,15,111,128,151,74,0,0           // movdqa        0x4a97(%eax),%xmm0
+  .byte  102,15,111,128,195,74,0,0           // movdqa        0x4ac3(%eax),%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,128,167,74,0,0                // mulps         0x4aa7(%eax),%xmm0
-  .byte  102,15,111,136,183,74,0,0           // movdqa        0x4ab7(%eax),%xmm1
+  .byte  15,89,128,211,74,0,0                // mulps         0x4ad3(%eax),%xmm0
+  .byte  102,15,111,136,227,74,0,0           // movdqa        0x4ae3(%eax),%xmm1
   .byte  102,15,219,202                      // pand          %xmm2,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,136,199,74,0,0                // mulps         0x4ac7(%eax),%xmm1
-  .byte  102,15,219,144,215,74,0,0           // pand          0x4ad7(%eax),%xmm2
+  .byte  15,89,136,243,74,0,0                // mulps         0x4af3(%eax),%xmm1
+  .byte  102,15,219,144,3,75,0,0             // pand          0x4b03(%eax),%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,144,231,74,0,0                // mulps         0x4ae7(%eax),%xmm2
+  .byte  15,89,144,19,75,0,0                 // mulps         0x4b13(%eax),%xmm2
   .byte  139,93,24                           // mov           0x18(%ebp),%ebx
   .byte  141,74,8                            // lea           0x8(%edx),%ecx
   .byte  15,41,116,36,80                     // movaps        %xmm6,0x50(%esp)
@@ -54497,7 +54808,7 @@
   .byte  137,76,36,4                         // mov           %ecx,0x4(%esp)
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  137,12,36                           // mov           %ecx,(%esp)
-  .byte  15,40,152,247,74,0,0                // movaps        0x4af7(%eax),%xmm3
+  .byte  15,40,152,35,75,0,0                 // movaps        0x4b23(%eax),%xmm3
   .byte  255,82,4                            // call          *0x4(%edx)
   .byte  131,196,108                         // add           $0x6c,%esp
   .byte  94                                  // pop           %esi
@@ -54516,14 +54827,14 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          537b <_sk_store_565_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          545f <_sk_store_565_sse2+0xe>
   .byte  88                                  // pop           %eax
-  .byte  15,40,160,229,73,0,0                // movaps        0x49e5(%eax),%xmm4
+  .byte  15,40,160,17,74,0,0                 // movaps        0x4a11(%eax),%xmm4
   .byte  15,40,232                           // movaps        %xmm0,%xmm5
   .byte  15,89,236                           // mulps         %xmm4,%xmm5
   .byte  102,15,91,237                       // cvtps2dq      %xmm5,%xmm5
   .byte  102,15,114,245,11                   // pslld         $0xb,%xmm5
-  .byte  15,40,176,245,73,0,0                // movaps        0x49f5(%eax),%xmm6
+  .byte  15,40,176,33,74,0,0                 // movaps        0x4a21(%eax),%xmm6
   .byte  15,89,241                           // mulps         %xmm1,%xmm6
   .byte  102,15,91,246                       // cvtps2dq      %xmm6,%xmm6
   .byte  102,15,114,246,5                    // pslld         $0x5,%xmm6
@@ -54545,7 +54856,7 @@
   .byte  133,219                             // test          %ebx,%ebx
   .byte  15,40,125,56                        // movaps        0x38(%ebp),%xmm7
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
-  .byte  117,82                              // jne           543c <_sk_store_565_sse2+0xcf>
+  .byte  117,82                              // jne           5520 <_sk_store_565_sse2+0xcf>
   .byte  102,15,126,226                      // movd          %xmm4,%edx
   .byte  102,15,126,238                      // movd          %xmm5,%esi
   .byte  137,20,79                           // mov           %edx,(%edi,%ecx,2)
@@ -54576,20 +54887,20 @@
   .byte  137,218                             // mov           %ebx,%edx
   .byte  128,226,3                           // and           $0x3,%dl
   .byte  128,250,1                           // cmp           $0x1,%dl
-  .byte  116,37                              // je            5474 <_sk_store_565_sse2+0x107>
+  .byte  116,37                              // je            5558 <_sk_store_565_sse2+0x107>
   .byte  128,250,2                           // cmp           $0x2,%dl
-  .byte  116,15                              // je            5463 <_sk_store_565_sse2+0xf6>
+  .byte  116,15                              // je            5547 <_sk_store_565_sse2+0xf6>
   .byte  128,250,3                           // cmp           $0x3,%dl
-  .byte  117,160                             // jne           53f9 <_sk_store_565_sse2+0x8c>
+  .byte  117,160                             // jne           54dd <_sk_store_565_sse2+0x8c>
   .byte  102,15,197,212,4                    // pextrw        $0x4,%xmm4,%edx
   .byte  102,137,84,79,4                     // mov           %dx,0x4(%edi,%ecx,2)
   .byte  102,15,112,228,212                  // pshufd        $0xd4,%xmm4,%xmm4
   .byte  242,15,112,228,232                  // pshuflw       $0xe8,%xmm4,%xmm4
   .byte  102,15,126,36,79                    // movd          %xmm4,(%edi,%ecx,2)
-  .byte  235,133                             // jmp           53f9 <_sk_store_565_sse2+0x8c>
+  .byte  235,133                             // jmp           54dd <_sk_store_565_sse2+0x8c>
   .byte  102,15,126,226                      // movd          %xmm4,%edx
   .byte  102,137,20,79                       // mov           %dx,(%edi,%ecx,2)
-  .byte  233,120,255,255,255                 // jmp           53f9 <_sk_store_565_sse2+0x8c>
+  .byte  233,120,255,255,255                 // jmp           54dd <_sk_store_565_sse2+0x8c>
 
 HIDDEN _sk_load_4444_sse2
 .globl _sk_load_4444_sse2
@@ -54601,7 +54912,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          548f <_sk_load_4444_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          5573 <_sk_load_4444_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  15,40,125,88                        // movaps        0x58(%ebp),%xmm7
   .byte  15,40,117,72                        // movaps        0x48(%ebp),%xmm6
@@ -54614,24 +54925,24 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
-  .byte  15,133,149,0,0,0                    // jne           554d <_sk_load_4444_sse2+0xcc>
+  .byte  15,133,149,0,0,0                    // jne           5631 <_sk_load_4444_sse2+0xcc>
   .byte  243,15,126,28,89                    // movq          (%ecx,%ebx,2),%xmm3
   .byte  102,15,97,216                       // punpcklwd     %xmm0,%xmm3
-  .byte  102,15,111,134,241,72,0,0           // movdqa        0x48f1(%esi),%xmm0
+  .byte  102,15,111,134,29,73,0,0            // movdqa        0x491d(%esi),%xmm0
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,134,1,73,0,0                  // mulps         0x4901(%esi),%xmm0
-  .byte  102,15,111,142,17,73,0,0            // movdqa        0x4911(%esi),%xmm1
+  .byte  15,89,134,45,73,0,0                 // mulps         0x492d(%esi),%xmm0
+  .byte  102,15,111,142,61,73,0,0            // movdqa        0x493d(%esi),%xmm1
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,142,33,73,0,0                 // mulps         0x4921(%esi),%xmm1
-  .byte  102,15,111,150,49,73,0,0            // movdqa        0x4931(%esi),%xmm2
+  .byte  15,89,142,77,73,0,0                 // mulps         0x494d(%esi),%xmm1
+  .byte  102,15,111,150,93,73,0,0            // movdqa        0x495d(%esi),%xmm2
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,150,65,73,0,0                 // mulps         0x4941(%esi),%xmm2
-  .byte  102,15,219,158,81,73,0,0            // pand          0x4951(%esi),%xmm3
+  .byte  15,89,150,109,73,0,0                // mulps         0x496d(%esi),%xmm2
+  .byte  102,15,219,158,125,73,0,0           // pand          0x497d(%esi),%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,158,97,73,0,0                 // mulps         0x4961(%esi),%xmm3
+  .byte  15,89,158,141,73,0,0                // mulps         0x498d(%esi),%xmm3
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
   .byte  15,41,124,36,80                     // movaps        %xmm7,0x50(%esp)
   .byte  15,41,116,36,64                     // movaps        %xmm6,0x40(%esp)
@@ -54653,13 +54964,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,58                              // je            5594 <_sk_load_4444_sse2+0x113>
+  .byte  116,58                              // je            5678 <_sk_load_4444_sse2+0x113>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,27                              // je            5582 <_sk_load_4444_sse2+0x101>
+  .byte  116,27                              // je            5666 <_sk_load_4444_sse2+0x101>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,80,255,255,255               // jne           54c1 <_sk_load_4444_sse2+0x40>
+  .byte  15,133,80,255,255,255               // jne           55a5 <_sk_load_4444_sse2+0x40>
   .byte  15,183,124,89,4                     // movzwl        0x4(%ecx,%ebx,2),%edi
   .byte  102,15,110,199                      // movd          %edi,%xmm0
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
@@ -54667,11 +54978,11 @@
   .byte  102,15,110,4,89                     // movd          (%ecx,%ebx,2),%xmm0
   .byte  102,15,97,192                       // punpcklwd     %xmm0,%xmm0
   .byte  242,15,16,216                       // movsd         %xmm0,%xmm3
-  .byte  233,45,255,255,255                  // jmp           54c1 <_sk_load_4444_sse2+0x40>
+  .byte  233,45,255,255,255                  // jmp           55a5 <_sk_load_4444_sse2+0x40>
   .byte  15,183,12,89                        // movzwl        (%ecx,%ebx,2),%ecx
   .byte  102,15,110,217                      // movd          %ecx,%xmm3
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,29,255,255,255                  // jmp           54c1 <_sk_load_4444_sse2+0x40>
+  .byte  233,29,255,255,255                  // jmp           55a5 <_sk_load_4444_sse2+0x40>
 
 HIDDEN _sk_load_4444_dst_sse2
 .globl _sk_load_4444_dst_sse2
@@ -54683,7 +54994,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          55b2 <_sk_load_4444_dst_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          5696 <_sk_load_4444_dst_sse2+0xe>
   .byte  95                                  // pop           %edi
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -54692,24 +55003,24 @@
   .byte  139,9                               // mov           (%ecx),%ecx
   .byte  133,210                             // test          %edx,%edx
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
-  .byte  15,133,149,0,0,0                    // jne           5660 <_sk_load_4444_dst_sse2+0xbc>
+  .byte  15,133,149,0,0,0                    // jne           5744 <_sk_load_4444_dst_sse2+0xbc>
   .byte  243,15,126,36,89                    // movq          (%ecx,%ebx,2),%xmm4
   .byte  102,15,97,224                       // punpcklwd     %xmm0,%xmm4
-  .byte  102,15,111,175,78,72,0,0            // movdqa        0x484e(%edi),%xmm5
+  .byte  102,15,111,175,122,72,0,0           // movdqa        0x487a(%edi),%xmm5
   .byte  102,15,219,236                      // pand          %xmm4,%xmm5
   .byte  15,91,237                           // cvtdq2ps      %xmm5,%xmm5
-  .byte  15,89,175,94,72,0,0                 // mulps         0x485e(%edi),%xmm5
-  .byte  102,15,111,183,110,72,0,0           // movdqa        0x486e(%edi),%xmm6
+  .byte  15,89,175,138,72,0,0                // mulps         0x488a(%edi),%xmm5
+  .byte  102,15,111,183,154,72,0,0           // movdqa        0x489a(%edi),%xmm6
   .byte  102,15,219,244                      // pand          %xmm4,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,89,183,126,72,0,0                // mulps         0x487e(%edi),%xmm6
-  .byte  102,15,111,191,142,72,0,0           // movdqa        0x488e(%edi),%xmm7
+  .byte  15,89,183,170,72,0,0                // mulps         0x48aa(%edi),%xmm6
+  .byte  102,15,111,191,186,72,0,0           // movdqa        0x48ba(%edi),%xmm7
   .byte  102,15,219,252                      // pand          %xmm4,%xmm7
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
-  .byte  15,89,191,158,72,0,0                // mulps         0x489e(%edi),%xmm7
-  .byte  102,15,219,167,174,72,0,0           // pand          0x48ae(%edi),%xmm4
+  .byte  15,89,191,202,72,0,0                // mulps         0x48ca(%edi),%xmm7
+  .byte  102,15,219,167,218,72,0,0           // pand          0x48da(%edi),%xmm4
   .byte  15,91,228                           // cvtdq2ps      %xmm4,%xmm4
-  .byte  15,89,167,190,72,0,0                // mulps         0x48be(%edi),%xmm4
+  .byte  15,89,167,234,72,0,0                // mulps         0x48ea(%edi),%xmm4
   .byte  141,72,8                            // lea           0x8(%eax),%ecx
   .byte  137,84,36,16                        // mov           %edx,0x10(%esp)
   .byte  137,116,36,12                       // mov           %esi,0xc(%esp)
@@ -54731,13 +55042,13 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,58                              // je            56a7 <_sk_load_4444_dst_sse2+0x103>
+  .byte  116,58                              // je            578b <_sk_load_4444_dst_sse2+0x103>
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,27                              // je            5695 <_sk_load_4444_dst_sse2+0xf1>
+  .byte  116,27                              // je            5779 <_sk_load_4444_dst_sse2+0xf1>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,80,255,255,255               // jne           55d4 <_sk_load_4444_dst_sse2+0x30>
+  .byte  15,133,80,255,255,255               // jne           56b8 <_sk_load_4444_dst_sse2+0x30>
   .byte  15,183,116,89,4                     // movzwl        0x4(%ecx,%ebx,2),%esi
   .byte  102,15,110,230                      // movd          %esi,%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
@@ -54745,11 +55056,11 @@
   .byte  102,15,110,44,89                    // movd          (%ecx,%ebx,2),%xmm5
   .byte  102,15,97,232                       // punpcklwd     %xmm0,%xmm5
   .byte  242,15,16,229                       // movsd         %xmm5,%xmm4
-  .byte  233,45,255,255,255                  // jmp           55d4 <_sk_load_4444_dst_sse2+0x30>
+  .byte  233,45,255,255,255                  // jmp           56b8 <_sk_load_4444_dst_sse2+0x30>
   .byte  15,183,12,89                        // movzwl        (%ecx,%ebx,2),%ecx
   .byte  102,15,110,225                      // movd          %ecx,%xmm4
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,29,255,255,255                  // jmp           55d4 <_sk_load_4444_dst_sse2+0x30>
+  .byte  233,29,255,255,255                  // jmp           56b8 <_sk_load_4444_dst_sse2+0x30>
 
 HIDDEN _sk_gather_4444_sse2
 .globl _sk_gather_4444_sse2
@@ -54761,7 +55072,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          56c5 <_sk_gather_4444_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          57a9 <_sk_gather_4444_sse2+0xe>
   .byte  90                                  // pop           %edx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,12                           // mov           0xc(%ebp),%ecx
@@ -54795,21 +55106,21 @@
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,216                       // punpcklwd     %xmm0,%xmm3
-  .byte  102,15,111,130,187,71,0,0           // movdqa        0x47bb(%edx),%xmm0
+  .byte  102,15,111,130,231,71,0,0           // movdqa        0x47e7(%edx),%xmm0
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,89,130,203,71,0,0                // mulps         0x47cb(%edx),%xmm0
-  .byte  102,15,111,138,219,71,0,0           // movdqa        0x47db(%edx),%xmm1
+  .byte  15,89,130,247,71,0,0                // mulps         0x47f7(%edx),%xmm0
+  .byte  102,15,111,138,7,72,0,0             // movdqa        0x4807(%edx),%xmm1
   .byte  102,15,219,203                      // pand          %xmm3,%xmm1
   .byte  15,91,201                           // cvtdq2ps      %xmm1,%xmm1
-  .byte  15,89,138,235,71,0,0                // mulps         0x47eb(%edx),%xmm1
-  .byte  102,15,111,146,251,71,0,0           // movdqa        0x47fb(%edx),%xmm2
+  .byte  15,89,138,23,72,0,0                 // mulps         0x4817(%edx),%xmm1
+  .byte  102,15,111,146,39,72,0,0            // movdqa        0x4827(%edx),%xmm2
   .byte  102,15,219,211                      // pand          %xmm3,%xmm2
   .byte  15,91,210                           // cvtdq2ps      %xmm2,%xmm2
-  .byte  15,89,146,11,72,0,0                 // mulps         0x480b(%edx),%xmm2
-  .byte  102,15,219,154,27,72,0,0            // pand          0x481b(%edx),%xmm3
+  .byte  15,89,146,55,72,0,0                 // mulps         0x4837(%edx),%xmm2
+  .byte  102,15,219,154,71,72,0,0            // pand          0x4847(%edx),%xmm3
   .byte  15,91,219                           // cvtdq2ps      %xmm3,%xmm3
-  .byte  15,89,154,43,72,0,0                 // mulps         0x482b(%edx),%xmm3
+  .byte  15,89,154,87,72,0,0                 // mulps         0x4857(%edx),%xmm3
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
   .byte  15,40,109,56                        // movaps        0x38(%ebp),%xmm5
@@ -54843,9 +55154,9 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          57f6 <_sk_store_4444_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          58da <_sk_store_4444_sse2+0xe>
   .byte  88                                  // pop           %eax
-  .byte  15,40,160,10,71,0,0                 // movaps        0x470a(%eax),%xmm4
+  .byte  15,40,160,54,71,0,0                 // movaps        0x4736(%eax),%xmm4
   .byte  15,40,232                           // movaps        %xmm0,%xmm5
   .byte  15,89,236                           // mulps         %xmm4,%xmm5
   .byte  102,15,91,237                       // cvtps2dq      %xmm5,%xmm5
@@ -54877,7 +55188,7 @@
   .byte  133,219                             // test          %ebx,%ebx
   .byte  15,40,125,56                        // movaps        0x38(%ebp),%xmm7
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
-  .byte  117,82                              // jne           58c6 <_sk_store_4444_sse2+0xde>
+  .byte  117,82                              // jne           59aa <_sk_store_4444_sse2+0xde>
   .byte  102,15,126,226                      // movd          %xmm4,%edx
   .byte  102,15,126,238                      // movd          %xmm5,%esi
   .byte  137,20,79                           // mov           %edx,(%edi,%ecx,2)
@@ -54908,20 +55219,20 @@
   .byte  137,218                             // mov           %ebx,%edx
   .byte  128,226,3                           // and           $0x3,%dl
   .byte  128,250,1                           // cmp           $0x1,%dl
-  .byte  116,37                              // je            58fe <_sk_store_4444_sse2+0x116>
+  .byte  116,37                              // je            59e2 <_sk_store_4444_sse2+0x116>
   .byte  128,250,2                           // cmp           $0x2,%dl
-  .byte  116,15                              // je            58ed <_sk_store_4444_sse2+0x105>
+  .byte  116,15                              // je            59d1 <_sk_store_4444_sse2+0x105>
   .byte  128,250,3                           // cmp           $0x3,%dl
-  .byte  117,160                             // jne           5883 <_sk_store_4444_sse2+0x9b>
+  .byte  117,160                             // jne           5967 <_sk_store_4444_sse2+0x9b>
   .byte  102,15,197,212,4                    // pextrw        $0x4,%xmm4,%edx
   .byte  102,137,84,79,4                     // mov           %dx,0x4(%edi,%ecx,2)
   .byte  102,15,112,228,212                  // pshufd        $0xd4,%xmm4,%xmm4
   .byte  242,15,112,228,232                  // pshuflw       $0xe8,%xmm4,%xmm4
   .byte  102,15,126,36,79                    // movd          %xmm4,(%edi,%ecx,2)
-  .byte  235,133                             // jmp           5883 <_sk_store_4444_sse2+0x9b>
+  .byte  235,133                             // jmp           5967 <_sk_store_4444_sse2+0x9b>
   .byte  102,15,126,226                      // movd          %xmm4,%edx
   .byte  102,137,20,79                       // mov           %dx,(%edi,%ecx,2)
-  .byte  233,120,255,255,255                 // jmp           5883 <_sk_store_4444_sse2+0x9b>
+  .byte  233,120,255,255,255                 // jmp           5967 <_sk_store_4444_sse2+0x9b>
 
 HIDDEN _sk_load_8888_sse2
 .globl _sk_load_8888_sse2
@@ -54933,7 +55244,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          5919 <_sk_load_8888_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          59fd <_sk_load_8888_sse2+0xe>
   .byte  91                                  // pop           %ebx
   .byte  15,40,125,88                        // movaps        0x58(%ebp),%xmm7
   .byte  15,40,117,72                        // movaps        0x48(%ebp),%xmm6
@@ -54944,13 +55255,13 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  139,117,8                           // mov           0x8(%ebp),%esi
-  .byte  15,133,147,0,0,0                    // jne           59cd <_sk_load_8888_sse2+0xc2>
+  .byte  15,133,147,0,0,0                    // jne           5ab1 <_sk_load_8888_sse2+0xc2>
   .byte  243,15,111,44,185                   // movdqu        (%ecx,%edi,4),%xmm5
-  .byte  102,15,111,147,247,69,0,0           // movdqa        0x45f7(%ebx),%xmm2
+  .byte  102,15,111,147,35,70,0,0            // movdqa        0x4623(%ebx),%xmm2
   .byte  102,15,111,197                      // movdqa        %xmm5,%xmm0
   .byte  102,15,219,194                      // pand          %xmm2,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,40,163,7,70,0,0                  // movaps        0x4607(%ebx),%xmm4
+  .byte  15,40,163,51,70,0,0                 // movaps        0x4633(%ebx),%xmm4
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
   .byte  102,15,111,205                      // movdqa        %xmm5,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -54988,20 +55299,20 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,44                              // je            5a06 <_sk_load_8888_sse2+0xfb>
+  .byte  116,44                              // je            5aea <_sk_load_8888_sse2+0xfb>
   .byte  102,15,239,237                      // pxor          %xmm5,%xmm5
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,21                              // je            59fc <_sk_load_8888_sse2+0xf1>
+  .byte  116,21                              // je            5ae0 <_sk_load_8888_sse2+0xf1>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,78,255,255,255               // jne           593f <_sk_load_8888_sse2+0x34>
+  .byte  15,133,78,255,255,255               // jne           5a23 <_sk_load_8888_sse2+0x34>
   .byte  102,15,110,68,185,8                 // movd          0x8(%ecx,%edi,4),%xmm0
   .byte  102,15,112,232,69                   // pshufd        $0x45,%xmm0,%xmm5
   .byte  102,15,18,44,185                    // movlpd        (%ecx,%edi,4),%xmm5
-  .byte  233,57,255,255,255                  // jmp           593f <_sk_load_8888_sse2+0x34>
+  .byte  233,57,255,255,255                  // jmp           5a23 <_sk_load_8888_sse2+0x34>
   .byte  102,15,110,44,185                   // movd          (%ecx,%edi,4),%xmm5
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,44,255,255,255                  // jmp           593f <_sk_load_8888_sse2+0x34>
+  .byte  233,44,255,255,255                  // jmp           5a23 <_sk_load_8888_sse2+0x34>
 
 HIDDEN _sk_load_8888_dst_sse2
 .globl _sk_load_8888_dst_sse2
@@ -55015,7 +55326,7 @@
   .byte  129,236,140,0,0,0                   // sub           $0x8c,%esp
   .byte  102,15,127,93,200                   // movdqa        %xmm3,-0x38(%ebp)
   .byte  15,41,85,216                        // movaps        %xmm2,-0x28(%ebp)
-  .byte  232,0,0,0,0                         // call          5a2d <_sk_load_8888_dst_sse2+0x1a>
+  .byte  232,0,0,0,0                         // call          5b11 <_sk_load_8888_dst_sse2+0x1a>
   .byte  91                                  // pop           %ebx
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
@@ -55024,13 +55335,13 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  139,117,8                           // mov           0x8(%ebp),%esi
-  .byte  15,133,150,0,0,0                    // jne           5adc <_sk_load_8888_dst_sse2+0xc9>
+  .byte  15,133,150,0,0,0                    // jne           5bc0 <_sk_load_8888_dst_sse2+0xc9>
   .byte  243,15,111,28,185                   // movdqu        (%ecx,%edi,4),%xmm3
-  .byte  102,15,111,147,3,69,0,0             // movdqa        0x4503(%ebx),%xmm2
+  .byte  102,15,111,147,47,69,0,0            // movdqa        0x452f(%ebx),%xmm2
   .byte  102,15,111,243                      // movdqa        %xmm3,%xmm6
   .byte  102,15,219,242                      // pand          %xmm2,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,40,187,19,69,0,0                 // movaps        0x4513(%ebx),%xmm7
+  .byte  15,40,187,63,69,0,0                 // movaps        0x453f(%ebx),%xmm7
   .byte  15,89,247                           // mulps         %xmm7,%xmm6
   .byte  102,15,111,227                      // movdqa        %xmm3,%xmm4
   .byte  102,15,114,212,8                    // psrld         $0x8,%xmm4
@@ -55068,20 +55379,20 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,44                              // je            5b15 <_sk_load_8888_dst_sse2+0x102>
+  .byte  116,44                              // je            5bf9 <_sk_load_8888_dst_sse2+0x102>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,21                              // je            5b0b <_sk_load_8888_dst_sse2+0xf8>
+  .byte  116,21                              // je            5bef <_sk_load_8888_dst_sse2+0xf8>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,75,255,255,255               // jne           5a4b <_sk_load_8888_dst_sse2+0x38>
+  .byte  15,133,75,255,255,255               // jne           5b2f <_sk_load_8888_dst_sse2+0x38>
   .byte  102,15,110,100,185,8                // movd          0x8(%ecx,%edi,4),%xmm4
   .byte  102,15,112,220,69                   // pshufd        $0x45,%xmm4,%xmm3
   .byte  102,15,18,28,185                    // movlpd        (%ecx,%edi,4),%xmm3
-  .byte  233,54,255,255,255                  // jmp           5a4b <_sk_load_8888_dst_sse2+0x38>
+  .byte  233,54,255,255,255                  // jmp           5b2f <_sk_load_8888_dst_sse2+0x38>
   .byte  102,15,110,28,185                   // movd          (%ecx,%edi,4),%xmm3
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,41,255,255,255                  // jmp           5a4b <_sk_load_8888_dst_sse2+0x38>
+  .byte  233,41,255,255,255                  // jmp           5b2f <_sk_load_8888_dst_sse2+0x38>
 
 HIDDEN _sk_gather_8888_sse2
 .globl _sk_gather_8888_sse2
@@ -55093,7 +55404,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          5b30 <_sk_gather_8888_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          5c14 <_sk_gather_8888_sse2+0xe>
   .byte  90                                  // pop           %edx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,12                           // mov           0xc(%ebp),%ecx
@@ -55123,8 +55434,8 @@
   .byte  102,15,110,4,183                    // movd          (%edi,%esi,4),%xmm0
   .byte  139,117,16                          // mov           0x10(%ebp),%esi
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
-  .byte  102,15,111,162,32,68,0,0            // movdqa        0x4420(%edx),%xmm4
-  .byte  15,40,170,48,68,0,0                 // movaps        0x4430(%edx),%xmm5
+  .byte  102,15,111,162,76,68,0,0            // movdqa        0x444c(%edx),%xmm4
+  .byte  15,40,170,92,68,0,0                 // movaps        0x445c(%edx),%xmm5
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
   .byte  15,40,125,56                        // movaps        0x38(%ebp),%xmm7
@@ -55178,9 +55489,9 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          5c55 <_sk_store_8888_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          5d39 <_sk_store_8888_sse2+0xe>
   .byte  88                                  // pop           %eax
-  .byte  15,40,160,27,67,0,0                 // movaps        0x431b(%eax),%xmm4
+  .byte  15,40,160,71,67,0,0                 // movaps        0x4347(%eax),%xmm4
   .byte  15,40,232                           // movaps        %xmm0,%xmm5
   .byte  15,89,236                           // mulps         %xmm4,%xmm5
   .byte  102,15,91,237                       // cvtps2dq      %xmm5,%xmm5
@@ -55209,7 +55520,7 @@
   .byte  133,219                             // test          %ebx,%ebx
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
   .byte  15,40,125,40                        // movaps        0x28(%ebp),%xmm7
-  .byte  117,62                              // jne           5cfe <_sk_store_8888_sse2+0xb7>
+  .byte  117,62                              // jne           5de2 <_sk_store_8888_sse2+0xb7>
   .byte  243,15,127,36,143                   // movdqu        %xmm4,(%edi,%ecx,4)
   .byte  141,120,8                           // lea           0x8(%eax),%edi
   .byte  15,40,101,88                        // movaps        0x58(%ebp),%xmm4
@@ -55233,20 +55544,20 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,37                              // je            5d32 <_sk_store_8888_sse2+0xeb>
+  .byte  116,37                              // je            5e16 <_sk_store_8888_sse2+0xeb>
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
-  .byte  116,21                              // je            5d2b <_sk_store_8888_sse2+0xe4>
+  .byte  116,21                              // je            5e0f <_sk_store_8888_sse2+0xe4>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,169                             // jne           5cc5 <_sk_store_8888_sse2+0x7e>
+  .byte  117,169                             // jne           5da9 <_sk_store_8888_sse2+0x7e>
   .byte  102,15,112,236,78                   // pshufd        $0x4e,%xmm4,%xmm5
   .byte  102,15,126,108,143,8                // movd          %xmm5,0x8(%edi,%ecx,4)
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
   .byte  102,15,214,36,143                   // movq          %xmm4,(%edi,%ecx,4)
-  .byte  235,147                             // jmp           5cc5 <_sk_store_8888_sse2+0x7e>
+  .byte  235,147                             // jmp           5da9 <_sk_store_8888_sse2+0x7e>
   .byte  102,15,126,36,143                   // movd          %xmm4,(%edi,%ecx,4)
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
-  .byte  235,137                             // jmp           5cc5 <_sk_store_8888_sse2+0x7e>
+  .byte  235,137                             // jmp           5da9 <_sk_store_8888_sse2+0x7e>
 
 HIDDEN _sk_load_bgra_sse2
 .globl _sk_load_bgra_sse2
@@ -55258,7 +55569,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          5d4a <_sk_load_bgra_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          5e2e <_sk_load_bgra_sse2+0xe>
   .byte  91                                  // pop           %ebx
   .byte  15,40,125,88                        // movaps        0x58(%ebp),%xmm7
   .byte  15,40,117,72                        // movaps        0x48(%ebp),%xmm6
@@ -55269,13 +55580,13 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  139,117,8                           // mov           0x8(%ebp),%esi
-  .byte  15,133,147,0,0,0                    // jne           5dfe <_sk_load_bgra_sse2+0xc2>
+  .byte  15,133,147,0,0,0                    // jne           5ee2 <_sk_load_bgra_sse2+0xc2>
   .byte  243,15,111,44,185                   // movdqu        (%ecx,%edi,4),%xmm5
-  .byte  102,15,111,131,54,66,0,0            // movdqa        0x4236(%ebx),%xmm0
+  .byte  102,15,111,131,98,66,0,0            // movdqa        0x4262(%ebx),%xmm0
   .byte  102,15,111,205                      // movdqa        %xmm5,%xmm1
   .byte  102,15,219,200                      // pand          %xmm0,%xmm1
   .byte  15,91,209                           // cvtdq2ps      %xmm1,%xmm2
-  .byte  15,40,163,70,66,0,0                 // movaps        0x4246(%ebx),%xmm4
+  .byte  15,40,163,114,66,0,0                // movaps        0x4272(%ebx),%xmm4
   .byte  15,89,212                           // mulps         %xmm4,%xmm2
   .byte  102,15,111,205                      // movdqa        %xmm5,%xmm1
   .byte  102,15,114,209,8                    // psrld         $0x8,%xmm1
@@ -55313,20 +55624,20 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,44                              // je            5e37 <_sk_load_bgra_sse2+0xfb>
+  .byte  116,44                              // je            5f1b <_sk_load_bgra_sse2+0xfb>
   .byte  102,15,239,237                      // pxor          %xmm5,%xmm5
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,21                              // je            5e2d <_sk_load_bgra_sse2+0xf1>
+  .byte  116,21                              // je            5f11 <_sk_load_bgra_sse2+0xf1>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,78,255,255,255               // jne           5d70 <_sk_load_bgra_sse2+0x34>
+  .byte  15,133,78,255,255,255               // jne           5e54 <_sk_load_bgra_sse2+0x34>
   .byte  102,15,110,68,185,8                 // movd          0x8(%ecx,%edi,4),%xmm0
   .byte  102,15,112,232,69                   // pshufd        $0x45,%xmm0,%xmm5
   .byte  102,15,18,44,185                    // movlpd        (%ecx,%edi,4),%xmm5
-  .byte  233,57,255,255,255                  // jmp           5d70 <_sk_load_bgra_sse2+0x34>
+  .byte  233,57,255,255,255                  // jmp           5e54 <_sk_load_bgra_sse2+0x34>
   .byte  102,15,110,44,185                   // movd          (%ecx,%edi,4),%xmm5
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,44,255,255,255                  // jmp           5d70 <_sk_load_bgra_sse2+0x34>
+  .byte  233,44,255,255,255                  // jmp           5e54 <_sk_load_bgra_sse2+0x34>
 
 HIDDEN _sk_load_bgra_dst_sse2
 .globl _sk_load_bgra_dst_sse2
@@ -55340,7 +55651,7 @@
   .byte  129,236,140,0,0,0                   // sub           $0x8c,%esp
   .byte  102,15,127,93,200                   // movdqa        %xmm3,-0x38(%ebp)
   .byte  15,41,85,216                        // movaps        %xmm2,-0x28(%ebp)
-  .byte  232,0,0,0,0                         // call          5e5e <_sk_load_bgra_dst_sse2+0x1a>
+  .byte  232,0,0,0,0                         // call          5f42 <_sk_load_bgra_dst_sse2+0x1a>
   .byte  91                                  // pop           %ebx
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
@@ -55349,13 +55660,13 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  139,117,8                           // mov           0x8(%ebp),%esi
-  .byte  15,133,150,0,0,0                    // jne           5f0d <_sk_load_bgra_dst_sse2+0xc9>
+  .byte  15,133,150,0,0,0                    // jne           5ff1 <_sk_load_bgra_dst_sse2+0xc9>
   .byte  243,15,111,28,185                   // movdqu        (%ecx,%edi,4),%xmm3
-  .byte  102,15,111,147,66,65,0,0            // movdqa        0x4142(%ebx),%xmm2
+  .byte  102,15,111,147,110,65,0,0           // movdqa        0x416e(%ebx),%xmm2
   .byte  102,15,111,243                      // movdqa        %xmm3,%xmm6
   .byte  102,15,219,242                      // pand          %xmm2,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
-  .byte  15,40,187,82,65,0,0                 // movaps        0x4152(%ebx),%xmm7
+  .byte  15,40,187,126,65,0,0                // movaps        0x417e(%ebx),%xmm7
   .byte  15,89,247                           // mulps         %xmm7,%xmm6
   .byte  102,15,111,227                      // movdqa        %xmm3,%xmm4
   .byte  102,15,114,212,8                    // psrld         $0x8,%xmm4
@@ -55393,20 +55704,20 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,44                              // je            5f46 <_sk_load_bgra_dst_sse2+0x102>
+  .byte  116,44                              // je            602a <_sk_load_bgra_dst_sse2+0x102>
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  116,21                              // je            5f3c <_sk_load_bgra_dst_sse2+0xf8>
+  .byte  116,21                              // je            6020 <_sk_load_bgra_dst_sse2+0xf8>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  15,133,75,255,255,255               // jne           5e7c <_sk_load_bgra_dst_sse2+0x38>
+  .byte  15,133,75,255,255,255               // jne           5f60 <_sk_load_bgra_dst_sse2+0x38>
   .byte  102,15,110,100,185,8                // movd          0x8(%ecx,%edi,4),%xmm4
   .byte  102,15,112,220,69                   // pshufd        $0x45,%xmm4,%xmm3
   .byte  102,15,18,28,185                    // movlpd        (%ecx,%edi,4),%xmm3
-  .byte  233,54,255,255,255                  // jmp           5e7c <_sk_load_bgra_dst_sse2+0x38>
+  .byte  233,54,255,255,255                  // jmp           5f60 <_sk_load_bgra_dst_sse2+0x38>
   .byte  102,15,110,28,185                   // movd          (%ecx,%edi,4),%xmm3
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
-  .byte  233,41,255,255,255                  // jmp           5e7c <_sk_load_bgra_dst_sse2+0x38>
+  .byte  233,41,255,255,255                  // jmp           5f60 <_sk_load_bgra_dst_sse2+0x38>
 
 HIDDEN _sk_gather_bgra_sse2
 .globl _sk_gather_bgra_sse2
@@ -55418,7 +55729,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          5f61 <_sk_gather_bgra_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          6045 <_sk_gather_bgra_sse2+0xe>
   .byte  90                                  // pop           %edx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,12                           // mov           0xc(%ebp),%ecx
@@ -55448,8 +55759,8 @@
   .byte  102,15,110,4,183                    // movd          (%edi,%esi,4),%xmm0
   .byte  139,117,16                          // mov           0x10(%ebp),%esi
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
-  .byte  102,15,111,162,95,64,0,0            // movdqa        0x405f(%edx),%xmm4
-  .byte  15,40,170,111,64,0,0                // movaps        0x406f(%edx),%xmm5
+  .byte  102,15,111,162,139,64,0,0           // movdqa        0x408b(%edx),%xmm4
+  .byte  15,40,170,155,64,0,0                // movaps        0x409b(%edx),%xmm5
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
   .byte  15,40,125,56                        // movaps        0x38(%ebp),%xmm7
@@ -55503,9 +55814,9 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          6086 <_sk_store_bgra_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          616a <_sk_store_bgra_sse2+0xe>
   .byte  88                                  // pop           %eax
-  .byte  15,40,160,90,63,0,0                 // movaps        0x3f5a(%eax),%xmm4
+  .byte  15,40,160,134,63,0,0                // movaps        0x3f86(%eax),%xmm4
   .byte  15,40,234                           // movaps        %xmm2,%xmm5
   .byte  15,89,236                           // mulps         %xmm4,%xmm5
   .byte  102,15,91,237                       // cvtps2dq      %xmm5,%xmm5
@@ -55534,7 +55845,7 @@
   .byte  133,219                             // test          %ebx,%ebx
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
   .byte  15,40,125,40                        // movaps        0x28(%ebp),%xmm7
-  .byte  117,62                              // jne           612f <_sk_store_bgra_sse2+0xb7>
+  .byte  117,62                              // jne           6213 <_sk_store_bgra_sse2+0xb7>
   .byte  243,15,127,36,143                   // movdqu        %xmm4,(%edi,%ecx,4)
   .byte  141,120,8                           // lea           0x8(%eax),%edi
   .byte  15,40,101,88                        // movaps        0x58(%ebp),%xmm4
@@ -55558,20 +55869,20 @@
   .byte  136,85,243                          // mov           %dl,-0xd(%ebp)
   .byte  128,101,243,3                       // andb          $0x3,-0xd(%ebp)
   .byte  128,125,243,1                       // cmpb          $0x1,-0xd(%ebp)
-  .byte  116,37                              // je            6163 <_sk_store_bgra_sse2+0xeb>
+  .byte  116,37                              // je            6247 <_sk_store_bgra_sse2+0xeb>
   .byte  128,125,243,2                       // cmpb          $0x2,-0xd(%ebp)
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
-  .byte  116,21                              // je            615c <_sk_store_bgra_sse2+0xe4>
+  .byte  116,21                              // je            6240 <_sk_store_bgra_sse2+0xe4>
   .byte  128,125,243,3                       // cmpb          $0x3,-0xd(%ebp)
-  .byte  117,169                             // jne           60f6 <_sk_store_bgra_sse2+0x7e>
+  .byte  117,169                             // jne           61da <_sk_store_bgra_sse2+0x7e>
   .byte  102,15,112,236,78                   // pshufd        $0x4e,%xmm4,%xmm5
   .byte  102,15,126,108,143,8                // movd          %xmm5,0x8(%edi,%ecx,4)
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
   .byte  102,15,214,36,143                   // movq          %xmm4,(%edi,%ecx,4)
-  .byte  235,147                             // jmp           60f6 <_sk_store_bgra_sse2+0x7e>
+  .byte  235,147                             // jmp           61da <_sk_store_bgra_sse2+0x7e>
   .byte  102,15,126,36,143                   // movd          %xmm4,(%edi,%ecx,4)
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
-  .byte  235,137                             // jmp           60f6 <_sk_store_bgra_sse2+0x7e>
+  .byte  235,137                             // jmp           61da <_sk_store_bgra_sse2+0x7e>
 
 HIDDEN _sk_load_f16_sse2
 .globl _sk_load_f16_sse2
@@ -55583,7 +55894,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  129,236,188,0,0,0                   // sub           $0xbc,%esp
-  .byte  232,0,0,0,0                         // call          617e <_sk_load_f16_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          6262 <_sk_load_f16_sse2+0x11>
   .byte  91                                  // pop           %ebx
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
@@ -55592,7 +55903,7 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  139,117,8                           // mov           0x8(%ebp),%esi
-  .byte  15,133,220,1,0,0                    // jne           6373 <_sk_load_f16_sse2+0x206>
+  .byte  15,133,220,1,0,0                    // jne           6457 <_sk_load_f16_sse2+0x206>
   .byte  102,15,16,4,249                     // movupd        (%ecx,%edi,8),%xmm0
   .byte  243,15,111,76,249,16                // movdqu        0x10(%ecx,%edi,8),%xmm1
   .byte  102,15,40,208                       // movapd        %xmm0,%xmm2
@@ -55620,7 +55931,7 @@
   .byte  102,15,126,69,232                   // movd          %xmm0,-0x18(%ebp)
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,97,243                       // punpcklwd     %xmm3,%xmm6
-  .byte  102,15,111,171,114,62,0,0           // movdqa        0x3e72(%ebx),%xmm5
+  .byte  102,15,111,171,158,62,0,0           // movdqa        0x3e9e(%ebx),%xmm5
   .byte  102,15,111,214                      // movdqa        %xmm6,%xmm2
   .byte  102,15,219,213                      // pand          %xmm5,%xmm2
   .byte  102,15,239,242                      // pxor          %xmm2,%xmm6
@@ -55654,15 +55965,15 @@
   .byte  102,15,111,199                      // movdqa        %xmm7,%xmm0
   .byte  102,15,114,240,13                   // pslld         $0xd,%xmm0
   .byte  102,15,235,197                      // por           %xmm5,%xmm0
-  .byte  102,15,111,155,130,62,0,0           // movdqa        0x3e82(%ebx),%xmm3
+  .byte  102,15,111,155,174,62,0,0           // movdqa        0x3eae(%ebx),%xmm3
   .byte  102,15,254,203                      // paddd         %xmm3,%xmm1
   .byte  102,15,254,211                      // paddd         %xmm3,%xmm2
   .byte  102,15,254,227                      // paddd         %xmm3,%xmm4
   .byte  102,15,254,195                      // paddd         %xmm3,%xmm0
-  .byte  102,15,111,155,146,62,0,0           // movdqa        0x3e92(%ebx),%xmm3
+  .byte  102,15,111,155,190,62,0,0           // movdqa        0x3ebe(%ebx),%xmm3
   .byte  102,15,127,93,184                   // movdqa        %xmm3,-0x48(%ebp)
   .byte  102,15,239,243                      // pxor          %xmm3,%xmm6
-  .byte  102,15,111,155,162,62,0,0           // movdqa        0x3ea2(%ebx),%xmm3
+  .byte  102,15,111,155,206,62,0,0           // movdqa        0x3ece(%ebx),%xmm3
   .byte  102,15,111,235                      // movdqa        %xmm3,%xmm5
   .byte  102,15,102,238                      // pcmpgtd       %xmm6,%xmm5
   .byte  102,15,223,233                      // pandn         %xmm1,%xmm5
@@ -55705,12 +56016,12 @@
   .byte  242,15,16,4,249                     // movsd         (%ecx,%edi,8),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  131,250,1                           // cmp           $0x1,%edx
-  .byte  15,132,29,254,255,255               // je            61a2 <_sk_load_f16_sse2+0x35>
+  .byte  15,132,29,254,255,255               // je            6286 <_sk_load_f16_sse2+0x35>
   .byte  102,15,22,68,249,8                  // movhpd        0x8(%ecx,%edi,8),%xmm0
   .byte  131,250,3                           // cmp           $0x3,%edx
-  .byte  15,130,14,254,255,255               // jb            61a2 <_sk_load_f16_sse2+0x35>
+  .byte  15,130,14,254,255,255               // jb            6286 <_sk_load_f16_sse2+0x35>
   .byte  243,15,126,76,249,16                // movq          0x10(%ecx,%edi,8),%xmm1
-  .byte  233,3,254,255,255                   // jmp           61a2 <_sk_load_f16_sse2+0x35>
+  .byte  233,3,254,255,255                   // jmp           6286 <_sk_load_f16_sse2+0x35>
 
 HIDDEN _sk_load_f16_dst_sse2
 .globl _sk_load_f16_dst_sse2
@@ -55726,7 +56037,7 @@
   .byte  102,15,127,149,104,255,255,255      // movdqa        %xmm2,-0x98(%ebp)
   .byte  15,41,141,120,255,255,255           // movaps        %xmm1,-0x88(%ebp)
   .byte  102,15,127,69,136                   // movdqa        %xmm0,-0x78(%ebp)
-  .byte  232,0,0,0,0                         // call          63cb <_sk_load_f16_dst_sse2+0x2c>
+  .byte  232,0,0,0,0                         // call          64af <_sk_load_f16_dst_sse2+0x2c>
   .byte  91                                  // pop           %ebx
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
@@ -55735,7 +56046,7 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  139,117,8                           // mov           0x8(%ebp),%esi
-  .byte  15,133,233,1,0,0                    // jne           65cd <_sk_load_f16_dst_sse2+0x22e>
+  .byte  15,133,233,1,0,0                    // jne           66b1 <_sk_load_f16_dst_sse2+0x22e>
   .byte  102,15,16,12,249                    // movupd        (%ecx,%edi,8),%xmm1
   .byte  243,15,111,68,249,16                // movdqu        0x10(%ecx,%edi,8),%xmm0
   .byte  102,15,40,217                       // movapd        %xmm1,%xmm3
@@ -55764,7 +56075,7 @@
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  102,15,97,240                       // punpcklwd     %xmm0,%xmm6
   .byte  102,15,239,228                      // pxor          %xmm4,%xmm4
-  .byte  102,15,111,155,101,60,0,0           // movdqa        0x3c65(%ebx),%xmm3
+  .byte  102,15,111,155,145,60,0,0           // movdqa        0x3c91(%ebx),%xmm3
   .byte  102,15,111,198                      // movdqa        %xmm6,%xmm0
   .byte  102,15,219,195                      // pand          %xmm3,%xmm0
   .byte  102,15,239,240                      // pxor          %xmm0,%xmm6
@@ -55798,15 +56109,15 @@
   .byte  102,15,111,209                      // movdqa        %xmm1,%xmm2
   .byte  102,15,114,242,13                   // pslld         $0xd,%xmm2
   .byte  102,15,235,211                      // por           %xmm3,%xmm2
-  .byte  102,15,111,155,117,60,0,0           // movdqa        0x3c75(%ebx),%xmm3
+  .byte  102,15,111,155,161,60,0,0           // movdqa        0x3ca1(%ebx),%xmm3
   .byte  102,15,254,251                      // paddd         %xmm3,%xmm7
   .byte  102,15,254,235                      // paddd         %xmm3,%xmm5
   .byte  102,15,254,227                      // paddd         %xmm3,%xmm4
   .byte  102,15,254,211                      // paddd         %xmm3,%xmm2
-  .byte  102,15,111,131,133,60,0,0           // movdqa        0x3c85(%ebx),%xmm0
+  .byte  102,15,111,131,177,60,0,0           // movdqa        0x3cb1(%ebx),%xmm0
   .byte  102,15,127,69,184                   // movdqa        %xmm0,-0x48(%ebp)
   .byte  102,15,239,240                      // pxor          %xmm0,%xmm6
-  .byte  102,15,111,131,149,60,0,0           // movdqa        0x3c95(%ebx),%xmm0
+  .byte  102,15,111,131,193,60,0,0           // movdqa        0x3cc1(%ebx),%xmm0
   .byte  102,15,111,216                      // movdqa        %xmm0,%xmm3
   .byte  102,15,102,222                      // pcmpgtd       %xmm6,%xmm3
   .byte  102,15,223,223                      // pandn         %xmm7,%xmm3
@@ -55848,12 +56159,12 @@
   .byte  242,15,16,12,249                    // movsd         (%ecx,%edi,8),%xmm1
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
   .byte  131,250,1                           // cmp           $0x1,%edx
-  .byte  15,132,16,254,255,255               // je            63ef <_sk_load_f16_dst_sse2+0x50>
+  .byte  15,132,16,254,255,255               // je            64d3 <_sk_load_f16_dst_sse2+0x50>
   .byte  102,15,22,76,249,8                  // movhpd        0x8(%ecx,%edi,8),%xmm1
   .byte  131,250,3                           // cmp           $0x3,%edx
-  .byte  15,130,1,254,255,255                // jb            63ef <_sk_load_f16_dst_sse2+0x50>
+  .byte  15,130,1,254,255,255                // jb            64d3 <_sk_load_f16_dst_sse2+0x50>
   .byte  243,15,126,68,249,16                // movq          0x10(%ecx,%edi,8),%xmm0
-  .byte  233,246,253,255,255                 // jmp           63ef <_sk_load_f16_dst_sse2+0x50>
+  .byte  233,246,253,255,255                 // jmp           64d3 <_sk_load_f16_dst_sse2+0x50>
 
 HIDDEN _sk_gather_f16_sse2
 .globl _sk_gather_f16_sse2
@@ -55865,7 +56176,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  129,236,204,0,0,0                   // sub           $0xcc,%esp
-  .byte  232,0,0,0,0                         // call          660a <_sk_gather_f16_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          66ee <_sk_gather_f16_sse2+0x11>
   .byte  89                                  // pop           %ecx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  139,48                              // mov           (%eax),%esi
@@ -55928,7 +56239,7 @@
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,111,236                      // movdqa        %xmm4,%xmm5
   .byte  102,15,97,235                       // punpcklwd     %xmm3,%xmm5
-  .byte  102,15,111,161,102,58,0,0           // movdqa        0x3a66(%ecx),%xmm4
+  .byte  102,15,111,161,146,58,0,0           // movdqa        0x3a92(%ecx),%xmm4
   .byte  102,15,111,197                      // movdqa        %xmm5,%xmm0
   .byte  102,15,219,196                      // pand          %xmm4,%xmm0
   .byte  102,15,239,232                      // pxor          %xmm0,%xmm5
@@ -55962,16 +56273,16 @@
   .byte  102,15,111,200                      // movdqa        %xmm0,%xmm1
   .byte  102,15,114,241,13                   // pslld         $0xd,%xmm1
   .byte  102,15,235,204                      // por           %xmm4,%xmm1
-  .byte  102,15,111,153,118,58,0,0           // movdqa        0x3a76(%ecx),%xmm3
+  .byte  102,15,111,153,162,58,0,0           // movdqa        0x3aa2(%ecx),%xmm3
   .byte  102,15,254,235                      // paddd         %xmm3,%xmm5
   .byte  102,15,254,243                      // paddd         %xmm3,%xmm6
   .byte  102,15,254,251                      // paddd         %xmm3,%xmm7
   .byte  102,15,254,203                      // paddd         %xmm3,%xmm1
-  .byte  102,15,111,153,134,58,0,0           // movdqa        0x3a86(%ecx),%xmm3
+  .byte  102,15,111,153,178,58,0,0           // movdqa        0x3ab2(%ecx),%xmm3
   .byte  102,15,127,93,184                   // movdqa        %xmm3,-0x48(%ebp)
   .byte  102,15,111,85,136                   // movdqa        -0x78(%ebp),%xmm2
   .byte  102,15,239,211                      // pxor          %xmm3,%xmm2
-  .byte  102,15,111,153,150,58,0,0           // movdqa        0x3a96(%ecx),%xmm3
+  .byte  102,15,111,153,194,58,0,0           // movdqa        0x3ac2(%ecx),%xmm3
   .byte  102,15,111,227                      // movdqa        %xmm3,%xmm4
   .byte  102,15,102,226                      // pcmpgtd       %xmm2,%xmm4
   .byte  102,15,223,229                      // pandn         %xmm5,%xmm4
@@ -56028,20 +56339,20 @@
   .byte  129,236,188,0,0,0                   // sub           $0xbc,%esp
   .byte  15,41,93,200                        // movaps        %xmm3,-0x38(%ebp)
   .byte  102,15,111,250                      // movdqa        %xmm2,%xmm7
-  .byte  232,0,0,0,0                         // call          68a7 <_sk_store_f16_sse2+0x19>
+  .byte  232,0,0,0,0                         // call          698b <_sk_store_f16_sse2+0x19>
   .byte  88                                  // pop           %eax
-  .byte  102,15,111,176,9,56,0,0             // movdqa        0x3809(%eax),%xmm6
+  .byte  102,15,111,176,53,56,0,0            // movdqa        0x3835(%eax),%xmm6
   .byte  102,15,111,208                      // movdqa        %xmm0,%xmm2
   .byte  102,15,219,214                      // pand          %xmm6,%xmm2
   .byte  102,15,127,69,184                   // movdqa        %xmm0,-0x48(%ebp)
   .byte  102,15,111,232                      // movdqa        %xmm0,%xmm5
   .byte  102,15,239,234                      // pxor          %xmm2,%xmm5
-  .byte  102,15,111,160,25,56,0,0            // movdqa        0x3819(%eax),%xmm4
+  .byte  102,15,111,160,69,56,0,0            // movdqa        0x3845(%eax),%xmm4
   .byte  102,15,114,210,16                   // psrld         $0x10,%xmm2
   .byte  102,15,111,196                      // movdqa        %xmm4,%xmm0
   .byte  102,15,102,197                      // pcmpgtd       %xmm5,%xmm0
   .byte  102,15,114,213,13                   // psrld         $0xd,%xmm5
-  .byte  102,15,111,152,41,56,0,0            // movdqa        0x3829(%eax),%xmm3
+  .byte  102,15,111,152,85,56,0,0            // movdqa        0x3855(%eax),%xmm3
   .byte  102,15,254,211                      // paddd         %xmm3,%xmm2
   .byte  102,15,254,213                      // paddd         %xmm5,%xmm2
   .byte  102,15,114,242,16                   // pslld         $0x10,%xmm2
@@ -56106,7 +56417,7 @@
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
   .byte  102,15,111,200                      // movdqa        %xmm0,%xmm1
   .byte  102,15,98,205                       // punpckldq     %xmm5,%xmm1
-  .byte  117,82                              // jne           6a43 <_sk_store_f16_sse2+0x1b5>
+  .byte  117,82                              // jne           6b27 <_sk_store_f16_sse2+0x1b5>
   .byte  15,17,12,203                        // movups        %xmm1,(%ebx,%ecx,8)
   .byte  102,15,106,197                      // punpckhdq     %xmm5,%xmm0
   .byte  243,15,127,68,203,16                // movdqu        %xmm0,0x10(%ebx,%ecx,8)
@@ -56132,13 +56443,13 @@
   .byte  195                                 // ret
   .byte  102,15,214,12,203                   // movq          %xmm1,(%ebx,%ecx,8)
   .byte  131,255,1                           // cmp           $0x1,%edi
-  .byte  116,178                             // je            69ff <_sk_store_f16_sse2+0x171>
+  .byte  116,178                             // je            6ae3 <_sk_store_f16_sse2+0x171>
   .byte  102,15,23,76,203,8                  // movhpd        %xmm1,0x8(%ebx,%ecx,8)
   .byte  131,255,3                           // cmp           $0x3,%edi
-  .byte  114,167                             // jb            69ff <_sk_store_f16_sse2+0x171>
+  .byte  114,167                             // jb            6ae3 <_sk_store_f16_sse2+0x171>
   .byte  102,15,106,197                      // punpckhdq     %xmm5,%xmm0
   .byte  102,15,214,68,203,16                // movq          %xmm0,0x10(%ebx,%ecx,8)
-  .byte  235,155                             // jmp           69ff <_sk_store_f16_sse2+0x171>
+  .byte  235,155                             // jmp           6ae3 <_sk_store_f16_sse2+0x171>
 
 HIDDEN _sk_load_u16_be_sse2
 .globl _sk_load_u16_be_sse2
@@ -56150,7 +56461,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  129,236,140,0,0,0                   // sub           $0x8c,%esp
-  .byte  232,0,0,0,0                         // call          6a75 <_sk_load_u16_be_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          6b59 <_sk_load_u16_be_sse2+0x11>
   .byte  91                                  // pop           %ebx
   .byte  15,40,125,88                        // movaps        0x58(%ebp),%xmm7
   .byte  139,85,24                           // mov           0x18(%ebp),%edx
@@ -56160,7 +56471,7 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,125,16                          // mov           0x10(%ebp),%edi
   .byte  141,52,189,0,0,0,0                  // lea           0x0(,%edi,4),%esi
-  .byte  15,133,66,1,0,0                     // jne           6bd8 <_sk_load_u16_be_sse2+0x174>
+  .byte  15,133,66,1,0,0                     // jne           6cbc <_sk_load_u16_be_sse2+0x174>
   .byte  102,15,16,4,113                     // movupd        (%ecx,%esi,2),%xmm0
   .byte  243,15,111,76,113,16                // movdqu        0x10(%ecx,%esi,2),%xmm1
   .byte  102,15,40,208                       // movapd        %xmm0,%xmm2
@@ -56181,7 +56492,7 @@
   .byte  102,15,239,219                      // pxor          %xmm3,%xmm3
   .byte  102,15,97,195                       // punpcklwd     %xmm3,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,40,163,107,54,0,0                // movaps        0x366b(%ebx),%xmm4
+  .byte  15,40,163,151,54,0,0                // movaps        0x3697(%ebx),%xmm4
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
   .byte  102,15,111,205                      // movdqa        %xmm5,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -56242,12 +56553,12 @@
   .byte  242,15,16,4,113                     // movsd         (%ecx,%esi,2),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  131,250,1                           // cmp           $0x1,%edx
-  .byte  15,132,183,254,255,255              // je            6aa1 <_sk_load_u16_be_sse2+0x3d>
+  .byte  15,132,183,254,255,255              // je            6b85 <_sk_load_u16_be_sse2+0x3d>
   .byte  102,15,22,68,113,8                  // movhpd        0x8(%ecx,%esi,2),%xmm0
   .byte  131,250,3                           // cmp           $0x3,%edx
-  .byte  15,130,168,254,255,255              // jb            6aa1 <_sk_load_u16_be_sse2+0x3d>
+  .byte  15,130,168,254,255,255              // jb            6b85 <_sk_load_u16_be_sse2+0x3d>
   .byte  243,15,126,76,113,16                // movq          0x10(%ecx,%esi,2),%xmm1
-  .byte  233,157,254,255,255                 // jmp           6aa1 <_sk_load_u16_be_sse2+0x3d>
+  .byte  233,157,254,255,255                 // jmp           6b85 <_sk_load_u16_be_sse2+0x3d>
 
 HIDDEN _sk_load_rgb_u16_be_sse2
 .globl _sk_load_rgb_u16_be_sse2
@@ -56259,7 +56570,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,124                         // sub           $0x7c,%esp
-  .byte  232,0,0,0,0                         // call          6c12 <_sk_load_rgb_u16_be_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          6cf6 <_sk_load_rgb_u16_be_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  15,40,117,88                        // movaps        0x58(%ebp),%xmm6
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
@@ -56270,7 +56581,7 @@
   .byte  133,246                             // test          %esi,%esi
   .byte  139,93,16                           // mov           0x10(%ebp),%ebx
   .byte  141,60,91                           // lea           (%ebx,%ebx,2),%edi
-  .byte  15,133,32,1,0,0                     // jne           6d53 <_sk_load_rgb_u16_be_sse2+0x14f>
+  .byte  15,133,32,1,0,0                     // jne           6e37 <_sk_load_rgb_u16_be_sse2+0x14f>
   .byte  243,15,111,20,122                   // movdqu        (%edx,%edi,2),%xmm2
   .byte  243,15,111,124,122,8                // movdqu        0x8(%edx,%edi,2),%xmm7
   .byte  102,15,115,223,4                    // psrldq        $0x4,%xmm7
@@ -56295,7 +56606,7 @@
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  102,15,97,199                       // punpcklwd     %xmm7,%xmm0
   .byte  15,91,192                           // cvtdq2ps      %xmm0,%xmm0
-  .byte  15,40,160,222,52,0,0                // movaps        0x34de(%eax),%xmm4
+  .byte  15,40,160,10,53,0,0                 // movaps        0x350a(%eax),%xmm4
   .byte  15,89,196                           // mulps         %xmm4,%xmm0
   .byte  102,15,111,203                      // movdqa        %xmm3,%xmm1
   .byte  102,15,113,241,8                    // psllw         $0x8,%xmm1
@@ -56333,7 +56644,7 @@
   .byte  137,84,36,4                         // mov           %edx,0x4(%esp)
   .byte  139,85,8                            // mov           0x8(%ebp),%edx
   .byte  137,20,36                           // mov           %edx,(%esp)
-  .byte  15,40,152,238,52,0,0                // movaps        0x34ee(%eax),%xmm3
+  .byte  15,40,152,26,53,0,0                 // movaps        0x351a(%eax),%xmm3
   .byte  255,81,4                            // call          *0x4(%ecx)
   .byte  131,196,124                         // add           $0x7c,%esp
   .byte  94                                  // pop           %esi
@@ -56345,20 +56656,20 @@
   .byte  102,15,196,84,122,4,2               // pinsrw        $0x2,0x4(%edx,%edi,2),%xmm2
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  131,254,1                           // cmp           $0x1,%esi
-  .byte  117,13                              // jne           6d75 <_sk_load_rgb_u16_be_sse2+0x171>
+  .byte  117,13                              // jne           6e59 <_sk_load_rgb_u16_be_sse2+0x171>
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
   .byte  102,15,239,192                      // pxor          %xmm0,%xmm0
-  .byte  233,224,254,255,255                 // jmp           6c55 <_sk_load_rgb_u16_be_sse2+0x51>
+  .byte  233,224,254,255,255                 // jmp           6d39 <_sk_load_rgb_u16_be_sse2+0x51>
   .byte  102,15,110,68,122,6                 // movd          0x6(%edx,%edi,2),%xmm0
   .byte  102,15,196,68,122,10,2              // pinsrw        $0x2,0xa(%edx,%edi,2),%xmm0
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  131,254,3                           // cmp           $0x3,%esi
-  .byte  114,18                              // jb            6d9d <_sk_load_rgb_u16_be_sse2+0x199>
+  .byte  114,18                              // jb            6e81 <_sk_load_rgb_u16_be_sse2+0x199>
   .byte  102,15,110,124,122,12               // movd          0xc(%edx,%edi,2),%xmm7
   .byte  102,15,196,124,122,16,2             // pinsrw        $0x2,0x10(%edx,%edi,2),%xmm7
-  .byte  233,184,254,255,255                 // jmp           6c55 <_sk_load_rgb_u16_be_sse2+0x51>
+  .byte  233,184,254,255,255                 // jmp           6d39 <_sk_load_rgb_u16_be_sse2+0x51>
   .byte  102,15,239,255                      // pxor          %xmm7,%xmm7
-  .byte  233,175,254,255,255                 // jmp           6c55 <_sk_load_rgb_u16_be_sse2+0x51>
+  .byte  233,175,254,255,255                 // jmp           6d39 <_sk_load_rgb_u16_be_sse2+0x51>
 
 HIDDEN _sk_store_u16_be_sse2
 .globl _sk_store_u16_be_sse2
@@ -56371,9 +56682,9 @@
   .byte  86                                  // push          %esi
   .byte  131,236,124                         // sub           $0x7c,%esp
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
-  .byte  232,0,0,0,0                         // call          6db8 <_sk_store_u16_be_sse2+0x12>
+  .byte  232,0,0,0,0                         // call          6e9c <_sk_store_u16_be_sse2+0x12>
   .byte  88                                  // pop           %eax
-  .byte  15,40,176,88,51,0,0                 // movaps        0x3358(%eax),%xmm6
+  .byte  15,40,176,132,51,0,0                // movaps        0x3384(%eax),%xmm6
   .byte  15,40,224                           // movaps        %xmm0,%xmm4
   .byte  15,89,230                           // mulps         %xmm6,%xmm4
   .byte  102,15,91,228                       // cvtps2dq      %xmm4,%xmm4
@@ -56427,7 +56738,7 @@
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
   .byte  102,15,111,220                      // movdqa        %xmm4,%xmm3
   .byte  102,15,98,221                       // punpckldq     %xmm5,%xmm3
-  .byte  117,82                              // jne           6eeb <_sk_store_u16_be_sse2+0x145>
+  .byte  117,82                              // jne           6fcf <_sk_store_u16_be_sse2+0x145>
   .byte  15,17,28,83                         // movups        %xmm3,(%ebx,%edx,2)
   .byte  102,15,106,229                      // punpckhdq     %xmm5,%xmm4
   .byte  243,15,127,100,83,16                // movdqu        %xmm4,0x10(%ebx,%edx,2)
@@ -56454,13 +56765,13 @@
   .byte  195                                 // ret
   .byte  102,15,214,28,83                    // movq          %xmm3,(%ebx,%edx,2)
   .byte  131,255,1                           // cmp           $0x1,%edi
-  .byte  116,178                             // je            6ea7 <_sk_store_u16_be_sse2+0x101>
+  .byte  116,178                             // je            6f8b <_sk_store_u16_be_sse2+0x101>
   .byte  102,15,23,92,83,8                   // movhpd        %xmm3,0x8(%ebx,%edx,2)
   .byte  131,255,3                           // cmp           $0x3,%edi
-  .byte  114,167                             // jb            6ea7 <_sk_store_u16_be_sse2+0x101>
+  .byte  114,167                             // jb            6f8b <_sk_store_u16_be_sse2+0x101>
   .byte  102,15,106,229                      // punpckhdq     %xmm5,%xmm4
   .byte  102,15,214,100,83,16                // movq          %xmm4,0x10(%ebx,%edx,2)
-  .byte  235,155                             // jmp           6ea7 <_sk_store_u16_be_sse2+0x101>
+  .byte  235,155                             // jmp           6f8b <_sk_store_u16_be_sse2+0x101>
 
 HIDDEN _sk_load_f32_sse2
 .globl _sk_load_f32_sse2
@@ -56485,7 +56796,7 @@
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
   .byte  133,210                             // test          %edx,%edx
   .byte  141,52,141,0,0,0,0                  // lea           0x0(,%ecx,4),%esi
-  .byte  117,117                             // jne           6fb6 <_sk_load_f32_sse2+0xaa>
+  .byte  117,117                             // jne           709a <_sk_load_f32_sse2+0xaa>
   .byte  15,16,84,179,16                     // movups        0x10(%ebx,%esi,4),%xmm2
   .byte  15,16,92,179,32                     // movups        0x20(%ebx,%esi,4),%xmm3
   .byte  15,16,68,179,48                     // movups        0x30(%ebx,%esi,4),%xmm0
@@ -56523,17 +56834,17 @@
   .byte  195                                 // ret
   .byte  15,87,192                           // xorps         %xmm0,%xmm0
   .byte  131,250,1                           // cmp           $0x1,%edx
-  .byte  117,8                               // jne           6fc6 <_sk_load_f32_sse2+0xba>
+  .byte  117,8                               // jne           70aa <_sk_load_f32_sse2+0xba>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,210                           // xorps         %xmm2,%xmm2
-  .byte  235,138                             // jmp           6f50 <_sk_load_f32_sse2+0x44>
+  .byte  235,138                             // jmp           7034 <_sk_load_f32_sse2+0x44>
   .byte  15,16,84,179,16                     // movups        0x10(%ebx,%esi,4),%xmm2
   .byte  131,250,3                           // cmp           $0x3,%edx
-  .byte  114,10                              // jb            6fda <_sk_load_f32_sse2+0xce>
+  .byte  114,10                              // jb            70be <_sk_load_f32_sse2+0xce>
   .byte  15,16,92,179,32                     // movups        0x20(%ebx,%esi,4),%xmm3
-  .byte  233,118,255,255,255                 // jmp           6f50 <_sk_load_f32_sse2+0x44>
+  .byte  233,118,255,255,255                 // jmp           7034 <_sk_load_f32_sse2+0x44>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
-  .byte  233,110,255,255,255                 // jmp           6f50 <_sk_load_f32_sse2+0x44>
+  .byte  233,110,255,255,255                 // jmp           7034 <_sk_load_f32_sse2+0x44>
 
 HIDDEN _sk_load_f32_dst_sse2
 .globl _sk_load_f32_dst_sse2
@@ -56558,7 +56869,7 @@
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
   .byte  133,210                             // test          %edx,%edx
   .byte  141,52,141,0,0,0,0                  // lea           0x0(,%ecx,4),%esi
-  .byte  117,122                             // jne           7094 <_sk_load_f32_dst_sse2+0xb2>
+  .byte  117,122                             // jne           7178 <_sk_load_f32_dst_sse2+0xb2>
   .byte  15,16,124,179,16                    // movups        0x10(%ebx,%esi,4),%xmm7
   .byte  15,16,92,179,32                     // movups        0x20(%ebx,%esi,4),%xmm3
   .byte  15,16,84,179,48                     // movups        0x30(%ebx,%esi,4),%xmm2
@@ -56596,17 +56907,17 @@
   .byte  195                                 // ret
   .byte  15,87,210                           // xorps         %xmm2,%xmm2
   .byte  131,250,1                           // cmp           $0x1,%edx
-  .byte  117,8                               // jne           70a4 <_sk_load_f32_dst_sse2+0xc2>
+  .byte  117,8                               // jne           7188 <_sk_load_f32_dst_sse2+0xc2>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
   .byte  15,87,255                           // xorps         %xmm7,%xmm7
-  .byte  235,133                             // jmp           7029 <_sk_load_f32_dst_sse2+0x47>
+  .byte  235,133                             // jmp           710d <_sk_load_f32_dst_sse2+0x47>
   .byte  15,16,124,179,16                    // movups        0x10(%ebx,%esi,4),%xmm7
   .byte  131,250,3                           // cmp           $0x3,%edx
-  .byte  114,10                              // jb            70b8 <_sk_load_f32_dst_sse2+0xd6>
+  .byte  114,10                              // jb            719c <_sk_load_f32_dst_sse2+0xd6>
   .byte  15,16,92,179,32                     // movups        0x20(%ebx,%esi,4),%xmm3
-  .byte  233,113,255,255,255                 // jmp           7029 <_sk_load_f32_dst_sse2+0x47>
+  .byte  233,113,255,255,255                 // jmp           710d <_sk_load_f32_dst_sse2+0x47>
   .byte  15,87,219                           // xorps         %xmm3,%xmm3
-  .byte  233,105,255,255,255                 // jmp           7029 <_sk_load_f32_dst_sse2+0x47>
+  .byte  233,105,255,255,255                 // jmp           710d <_sk_load_f32_dst_sse2+0x47>
 
 HIDDEN _sk_store_f32_sse2
 .globl _sk_store_f32_sse2
@@ -56643,7 +56954,7 @@
   .byte  133,210                             // test          %edx,%edx
   .byte  139,93,8                            // mov           0x8(%ebp),%ebx
   .byte  141,60,141,0,0,0,0                  // lea           0x0(,%ecx,4),%edi
-  .byte  117,99                              // jne           717d <_sk_store_f32_sse2+0xbd>
+  .byte  117,99                              // jne           7261 <_sk_store_f32_sse2+0xbd>
   .byte  102,15,21,194                       // unpckhpd      %xmm2,%xmm0
   .byte  15,17,100,190,16                    // movups        %xmm4,0x10(%esi,%edi,4)
   .byte  102,15,17,116,190,32                // movupd        %xmm6,0x20(%esi,%edi,4)
@@ -56673,12 +56984,12 @@
   .byte  93                                  // pop           %ebp
   .byte  195                                 // ret
   .byte  131,250,1                           // cmp           $0x1,%edx
-  .byte  116,173                             // je            712f <_sk_store_f32_sse2+0x6f>
+  .byte  116,173                             // je            7213 <_sk_store_f32_sse2+0x6f>
   .byte  15,17,100,190,16                    // movups        %xmm4,0x10(%esi,%edi,4)
   .byte  131,250,3                           // cmp           $0x3,%edx
-  .byte  114,163                             // jb            712f <_sk_store_f32_sse2+0x6f>
+  .byte  114,163                             // jb            7213 <_sk_store_f32_sse2+0x6f>
   .byte  102,15,17,116,190,32                // movupd        %xmm6,0x20(%esi,%edi,4)
-  .byte  235,155                             // jmp           712f <_sk_store_f32_sse2+0x6f>
+  .byte  235,155                             // jmp           7213 <_sk_store_f32_sse2+0x6f>
 
 HIDDEN _sk_clamp_x_sse2
 .globl _sk_clamp_x_sse2
@@ -56782,7 +57093,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          7298 <_sk_repeat_x_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          737c <_sk_repeat_x_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -56796,7 +57107,7 @@
   .byte  243,15,91,245                       // cvttps2dq     %xmm5,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
   .byte  15,194,238,1                        // cmpltps       %xmm6,%xmm5
-  .byte  15,84,174,136,46,0,0                // andps         0x2e88(%esi),%xmm5
+  .byte  15,84,174,180,46,0,0                // andps         0x2eb4(%esi),%xmm5
   .byte  139,117,24                          // mov           0x18(%ebp),%esi
   .byte  15,40,125,40                        // movaps        0x28(%ebp),%xmm7
   .byte  15,92,245                           // subps         %xmm5,%xmm6
@@ -56837,7 +57148,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          7337 <_sk_repeat_y_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          741b <_sk_repeat_y_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -56851,7 +57162,7 @@
   .byte  243,15,91,245                       // cvttps2dq     %xmm5,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
   .byte  15,194,238,1                        // cmpltps       %xmm6,%xmm5
-  .byte  15,84,174,249,45,0,0                // andps         0x2df9(%esi),%xmm5
+  .byte  15,84,174,37,46,0,0                 // andps         0x2e25(%esi),%xmm5
   .byte  139,117,24                          // mov           0x18(%ebp),%esi
   .byte  15,40,125,40                        // movaps        0x28(%ebp),%xmm7
   .byte  15,92,245                           // subps         %xmm5,%xmm6
@@ -56892,7 +57203,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          73d6 <_sk_mirror_x_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          74ba <_sk_mirror_x_sse2+0xe>
   .byte  95                                  // pop           %edi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -56904,13 +57215,13 @@
   .byte  15,40,229                           // movaps        %xmm5,%xmm4
   .byte  15,198,228,0                        // shufps        $0x0,%xmm4,%xmm4
   .byte  15,92,196                           // subps         %xmm4,%xmm0
-  .byte  243,15,89,183,90,50,0,0             // mulss         0x325a(%edi),%xmm6
+  .byte  243,15,89,183,134,50,0,0            // mulss         0x3286(%edi),%xmm6
   .byte  15,198,246,0                        // shufps        $0x0,%xmm6,%xmm6
   .byte  15,89,240                           // mulps         %xmm0,%xmm6
   .byte  243,15,91,254                       // cvttps2dq     %xmm6,%xmm7
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
   .byte  15,194,247,1                        // cmpltps       %xmm7,%xmm6
-  .byte  15,84,183,106,45,0,0                // andps         0x2d6a(%edi),%xmm6
+  .byte  15,84,183,150,45,0,0                // andps         0x2d96(%edi),%xmm6
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
   .byte  15,92,254                           // subps         %xmm6,%xmm7
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
@@ -56956,7 +57267,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          7497 <_sk_mirror_y_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          757b <_sk_mirror_y_sse2+0xe>
   .byte  95                                  // pop           %edi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -56968,13 +57279,13 @@
   .byte  15,40,229                           // movaps        %xmm5,%xmm4
   .byte  15,198,228,0                        // shufps        $0x0,%xmm4,%xmm4
   .byte  15,92,204                           // subps         %xmm4,%xmm1
-  .byte  243,15,89,183,157,49,0,0            // mulss         0x319d(%edi),%xmm6
+  .byte  243,15,89,183,201,49,0,0            // mulss         0x31c9(%edi),%xmm6
   .byte  15,198,246,0                        // shufps        $0x0,%xmm6,%xmm6
   .byte  15,89,241                           // mulps         %xmm1,%xmm6
   .byte  243,15,91,254                       // cvttps2dq     %xmm6,%xmm7
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
   .byte  15,194,247,1                        // cmpltps       %xmm7,%xmm6
-  .byte  15,84,183,185,44,0,0                // andps         0x2cb9(%edi),%xmm6
+  .byte  15,84,183,229,44,0,0                // andps         0x2ce5(%edi),%xmm6
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
   .byte  15,92,254                           // subps         %xmm6,%xmm7
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
@@ -57020,7 +57331,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          7558 <_sk_clamp_x_1_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          763c <_sk_clamp_x_1_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -57032,7 +57343,7 @@
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  15,95,224                           // maxps         %xmm0,%xmm4
   .byte  15,40,69,88                         // movaps        0x58(%ebp),%xmm0
-  .byte  15,93,160,8,44,0,0                  // minps         0x2c08(%eax),%xmm4
+  .byte  15,93,160,52,44,0,0                 // minps         0x2c34(%eax),%xmm4
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  141,88,4                            // lea           0x4(%eax),%ebx
   .byte  15,41,68,36,80                      // movaps        %xmm0,0x50(%esp)
@@ -57063,7 +57374,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          75ca <_sk_repeat_x_1_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          76ae <_sk_repeat_x_1_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -57075,7 +57386,7 @@
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
   .byte  15,40,248                           // movaps        %xmm0,%xmm7
   .byte  15,194,254,1                        // cmpltps       %xmm6,%xmm7
-  .byte  15,84,184,166,43,0,0                // andps         0x2ba6(%eax),%xmm7
+  .byte  15,84,184,210,43,0,0                // andps         0x2bd2(%eax),%xmm7
   .byte  15,92,247                           // subps         %xmm7,%xmm6
   .byte  15,40,125,72                        // movaps        0x48(%ebp),%xmm7
   .byte  15,92,198                           // subps         %xmm6,%xmm0
@@ -57109,21 +57420,21 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          7647 <_sk_mirror_x_1_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          772b <_sk_mirror_x_1_sse2+0xe>
   .byte  95                                  // pop           %edi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
   .byte  139,85,20                           // mov           0x14(%ebp),%edx
   .byte  139,117,24                          // mov           0x18(%ebp),%esi
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
-  .byte  15,40,175,57,43,0,0                 // movaps        0x2b39(%edi),%xmm5
+  .byte  15,40,175,101,43,0,0                // movaps        0x2b65(%edi),%xmm5
   .byte  15,88,197                           // addps         %xmm5,%xmm0
-  .byte  15,40,183,73,43,0,0                 // movaps        0x2b49(%edi),%xmm6
+  .byte  15,40,183,117,43,0,0                // movaps        0x2b75(%edi),%xmm6
   .byte  15,89,240                           // mulps         %xmm0,%xmm6
   .byte  243,15,91,254                       // cvttps2dq     %xmm6,%xmm7
   .byte  15,91,255                           // cvtdq2ps      %xmm7,%xmm7
   .byte  15,194,247,1                        // cmpltps       %xmm7,%xmm6
-  .byte  15,84,183,89,43,0,0                 // andps         0x2b59(%edi),%xmm6
+  .byte  15,84,183,133,43,0,0                // andps         0x2b85(%edi),%xmm6
   .byte  15,92,254                           // subps         %xmm6,%xmm7
   .byte  15,40,117,56                        // movaps        0x38(%ebp),%xmm6
   .byte  15,88,255                           // addps         %xmm7,%xmm7
@@ -57164,7 +57475,7 @@
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
-  .byte  232,0,0,0,0                         // call          76e7 <_sk_luminance_to_alpha_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          77cb <_sk_luminance_to_alpha_sse2+0x11>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -57174,9 +57485,9 @@
   .byte  15,40,101,56                        // movaps        0x38(%ebp),%xmm4
   .byte  15,40,109,72                        // movaps        0x48(%ebp),%xmm5
   .byte  15,40,117,88                        // movaps        0x58(%ebp),%xmm6
-  .byte  15,89,128,201,42,0,0                // mulps         0x2ac9(%eax),%xmm0
-  .byte  15,89,136,217,42,0,0                // mulps         0x2ad9(%eax),%xmm1
-  .byte  15,89,152,233,42,0,0                // mulps         0x2ae9(%eax),%xmm3
+  .byte  15,89,128,245,42,0,0                // mulps         0x2af5(%eax),%xmm0
+  .byte  15,89,136,5,43,0,0                  // mulps         0x2b05(%eax),%xmm1
+  .byte  15,89,152,21,43,0,0                 // mulps         0x2b15(%eax),%xmm3
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  15,88,200                           // addps         %xmm0,%xmm1
   .byte  15,88,217                           // addps         %xmm1,%xmm3
@@ -57720,7 +58031,7 @@
   .byte  86                                  // push          %esi
   .byte  129,236,156,0,0,0                   // sub           $0x9c,%esp
   .byte  15,41,69,184                        // movaps        %xmm0,-0x48(%ebp)
-  .byte  232,0,0,0,0                         // call          7da1 <_sk_evenly_spaced_gradient_sse2+0x15>
+  .byte  232,0,0,0,0                         // call          7e85 <_sk_evenly_spaced_gradient_sse2+0x15>
   .byte  90                                  // pop           %edx
   .byte  139,77,12                           // mov           0xc(%ebp),%ecx
   .byte  141,65,4                            // lea           0x4(%ecx),%eax
@@ -57731,12 +58042,12 @@
   .byte  78                                  // dec           %esi
   .byte  102,15,110,206                      // movd          %esi,%xmm1
   .byte  102,15,112,201,0                    // pshufd        $0x0,%xmm1,%xmm1
-  .byte  102,15,111,146,63,36,0,0            // movdqa        0x243f(%edx),%xmm2
+  .byte  102,15,111,146,107,36,0,0           // movdqa        0x246b(%edx),%xmm2
   .byte  102,15,219,209                      // pand          %xmm1,%xmm2
-  .byte  102,15,235,146,79,36,0,0            // por           0x244f(%edx),%xmm2
+  .byte  102,15,235,146,123,36,0,0           // por           0x247b(%edx),%xmm2
   .byte  102,15,114,209,16                   // psrld         $0x10,%xmm1
-  .byte  102,15,235,138,95,36,0,0            // por           0x245f(%edx),%xmm1
-  .byte  15,88,138,111,36,0,0                // addps         0x246f(%edx),%xmm1
+  .byte  102,15,235,138,139,36,0,0           // por           0x248b(%edx),%xmm1
+  .byte  15,88,138,155,36,0,0                // addps         0x249b(%edx),%xmm1
   .byte  15,88,202                           // addps         %xmm2,%xmm1
   .byte  15,89,200                           // mulps         %xmm0,%xmm1
   .byte  243,15,91,201                       // cvttps2dq     %xmm1,%xmm1
@@ -57859,7 +58170,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          7f98 <_sk_gauss_a_to_rgba_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          807c <_sk_gauss_a_to_rgba_sse2+0xe>
   .byte  90                                  // pop           %edx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -57869,15 +58180,15 @@
   .byte  15,40,85,56                         // movaps        0x38(%ebp),%xmm2
   .byte  15,40,101,72                        // movaps        0x48(%ebp),%xmm4
   .byte  15,40,109,88                        // movaps        0x58(%ebp),%xmm5
-  .byte  15,40,130,136,34,0,0                // movaps        0x2288(%edx),%xmm0
+  .byte  15,40,130,180,34,0,0                // movaps        0x22b4(%edx),%xmm0
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,130,152,34,0,0                // addps         0x2298(%edx),%xmm0
+  .byte  15,88,130,196,34,0,0                // addps         0x22c4(%edx),%xmm0
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,130,168,34,0,0                // addps         0x22a8(%edx),%xmm0
+  .byte  15,88,130,212,34,0,0                // addps         0x22d4(%edx),%xmm0
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,130,184,34,0,0                // addps         0x22b8(%edx),%xmm0
+  .byte  15,88,130,228,34,0,0                // addps         0x22e4(%edx),%xmm0
   .byte  15,89,195                           // mulps         %xmm3,%xmm0
-  .byte  15,88,130,200,34,0,0                // addps         0x22c8(%edx),%xmm0
+  .byte  15,88,130,244,34,0,0                // addps         0x22f4(%edx),%xmm0
   .byte  139,85,12                           // mov           0xc(%ebp),%edx
   .byte  141,90,4                            // lea           0x4(%edx),%ebx
   .byte  15,41,108,36,80                     // movaps        %xmm5,0x50(%esp)
@@ -57910,7 +58221,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  129,236,156,0,0,0                   // sub           $0x9c,%esp
-  .byte  232,0,0,0,0                         // call          8035 <_sk_gradient_sse2+0x11>
+  .byte  232,0,0,0,0                         // call          8119 <_sk_gradient_sse2+0x11>
   .byte  90                                  // pop           %edx
   .byte  139,69,12                           // mov           0xc(%ebp),%eax
   .byte  141,72,4                            // lea           0x4(%eax),%ecx
@@ -57919,12 +58230,12 @@
   .byte  139,7                               // mov           (%edi),%eax
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
   .byte  131,248,2                           // cmp           $0x2,%eax
-  .byte  114,43                              // jb            8077 <_sk_gradient_sse2+0x53>
+  .byte  114,43                              // jb            815b <_sk_gradient_sse2+0x53>
   .byte  139,79,36                           // mov           0x24(%edi),%ecx
   .byte  72                                  // dec           %eax
   .byte  131,193,4                           // add           $0x4,%ecx
   .byte  102,15,239,201                      // pxor          %xmm1,%xmm1
-  .byte  15,40,146,59,34,0,0                 // movaps        0x223b(%edx),%xmm2
+  .byte  15,40,146,103,34,0,0                // movaps        0x2267(%edx),%xmm2
   .byte  243,15,16,25                        // movss         (%ecx),%xmm3
   .byte  15,198,219,0                        // shufps        $0x0,%xmm3,%xmm3
   .byte  15,194,216,2                        // cmpleps       %xmm0,%xmm3
@@ -57932,7 +58243,7 @@
   .byte  102,15,254,203                      // paddd         %xmm3,%xmm1
   .byte  131,193,4                           // add           $0x4,%ecx
   .byte  72                                  // dec           %eax
-  .byte  117,231                             // jne           805e <_sk_gradient_sse2+0x3a>
+  .byte  117,231                             // jne           8142 <_sk_gradient_sse2+0x3a>
   .byte  102,15,126,203                      // movd          %xmm1,%ebx
   .byte  102,15,112,209,229                  // pshufd        $0xe5,%xmm1,%xmm2
   .byte  102,15,126,208                      // movd          %xmm2,%eax
@@ -58121,7 +58432,7 @@
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
   .byte  15,40,200                           // movaps        %xmm0,%xmm1
-  .byte  232,0,0,0,0                         // call          82f5 <_sk_xy_to_unit_angle_sse2+0x1b>
+  .byte  232,0,0,0,0                         // call          83d9 <_sk_xy_to_unit_angle_sse2+0x1b>
   .byte  88                                  // pop           %eax
   .byte  15,87,237                           // xorps         %xmm5,%xmm5
   .byte  15,92,233                           // subps         %xmm1,%xmm5
@@ -58136,35 +58447,35 @@
   .byte  15,94,247                           // divps         %xmm7,%xmm6
   .byte  15,40,254                           // movaps        %xmm6,%xmm7
   .byte  15,89,255                           // mulps         %xmm7,%xmm7
-  .byte  15,40,128,139,31,0,0                // movaps        0x1f8b(%eax),%xmm0
+  .byte  15,40,128,183,31,0,0                // movaps        0x1fb7(%eax),%xmm0
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
-  .byte  15,88,128,155,31,0,0                // addps         0x1f9b(%eax),%xmm0
+  .byte  15,88,128,199,31,0,0                // addps         0x1fc7(%eax),%xmm0
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
-  .byte  15,88,128,171,31,0,0                // addps         0x1fab(%eax),%xmm0
+  .byte  15,88,128,215,31,0,0                // addps         0x1fd7(%eax),%xmm0
   .byte  15,89,199                           // mulps         %xmm7,%xmm0
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
-  .byte  15,88,128,187,31,0,0                // addps         0x1fbb(%eax),%xmm0
+  .byte  15,88,128,231,31,0,0                // addps         0x1fe7(%eax),%xmm0
   .byte  15,89,198                           // mulps         %xmm6,%xmm0
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
   .byte  15,194,236,1                        // cmpltps       %xmm4,%xmm5
-  .byte  15,40,184,203,31,0,0                // movaps        0x1fcb(%eax),%xmm7
+  .byte  15,40,184,247,31,0,0                // movaps        0x1ff7(%eax),%xmm7
   .byte  15,92,248                           // subps         %xmm0,%xmm7
   .byte  15,84,253                           // andps         %xmm5,%xmm7
   .byte  15,85,232                           // andnps        %xmm0,%xmm5
   .byte  15,87,228                           // xorps         %xmm4,%xmm4
   .byte  15,86,239                           // orps          %xmm7,%xmm5
   .byte  15,194,204,1                        // cmpltps       %xmm4,%xmm1
-  .byte  15,40,128,219,31,0,0                // movaps        0x1fdb(%eax),%xmm0
+  .byte  15,40,128,7,32,0,0                  // movaps        0x2007(%eax),%xmm0
   .byte  15,92,197                           // subps         %xmm5,%xmm0
   .byte  15,84,193                           // andps         %xmm1,%xmm0
   .byte  15,85,205                           // andnps        %xmm5,%xmm1
   .byte  15,86,200                           // orps          %xmm0,%xmm1
   .byte  15,40,194                           // movaps        %xmm2,%xmm0
   .byte  15,194,196,1                        // cmpltps       %xmm4,%xmm0
-  .byte  15,40,168,235,31,0,0                // movaps        0x1feb(%eax),%xmm5
+  .byte  15,40,168,23,32,0,0                 // movaps        0x2017(%eax),%xmm5
   .byte  15,92,233                           // subps         %xmm1,%xmm5
   .byte  15,84,232                           // andps         %xmm0,%xmm5
   .byte  15,85,193                           // andnps        %xmm1,%xmm0
@@ -58252,7 +58563,7 @@
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
-  .byte  232,0,0,0,0                         // call          847a <_sk_xy_to_2pt_conical_quadratic_max_sse2+0x18>
+  .byte  232,0,0,0,0                         // call          855e <_sk_xy_to_2pt_conical_quadratic_max_sse2+0x18>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -58271,11 +58582,11 @@
   .byte  243,15,16,79,36                     // movss         0x24(%edi),%xmm1
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
   .byte  15,198,237,0                        // shufps        $0x0,%xmm5,%xmm5
-  .byte  15,89,166,118,30,0,0                // mulps         0x1e76(%esi),%xmm4
+  .byte  15,89,166,162,30,0,0                // mulps         0x1ea2(%esi),%xmm4
   .byte  243,15,89,246                       // mulss         %xmm6,%xmm6
   .byte  15,198,246,0                        // shufps        $0x0,%xmm6,%xmm6
   .byte  15,92,254                           // subps         %xmm6,%xmm7
-  .byte  15,89,174,134,30,0,0                // mulps         0x1e86(%esi),%xmm5
+  .byte  15,89,174,178,30,0,0                // mulps         0x1eb2(%esi),%xmm5
   .byte  15,89,239                           // mulps         %xmm7,%xmm5
   .byte  15,40,196                           // movaps        %xmm4,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
@@ -58284,8 +58595,8 @@
   .byte  15,198,201,0                        // shufps        $0x0,%xmm1,%xmm1
   .byte  15,40,197                           // movaps        %xmm5,%xmm0
   .byte  15,92,196                           // subps         %xmm4,%xmm0
-  .byte  15,87,166,150,30,0,0                // xorps         0x1e96(%esi),%xmm4
-  .byte  15,89,142,166,30,0,0                // mulps         0x1ea6(%esi),%xmm1
+  .byte  15,87,166,194,30,0,0                // xorps         0x1ec2(%esi),%xmm4
+  .byte  15,89,142,210,30,0,0                // mulps         0x1ed2(%esi),%xmm1
   .byte  139,117,24                          // mov           0x18(%ebp),%esi
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
   .byte  15,92,229                           // subps         %xmm5,%xmm4
@@ -58329,7 +58640,7 @@
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
   .byte  15,40,209                           // movaps        %xmm1,%xmm2
-  .byte  232,0,0,0,0                         // call          856e <_sk_xy_to_2pt_conical_quadratic_min_sse2+0x18>
+  .byte  232,0,0,0,0                         // call          8652 <_sk_xy_to_2pt_conical_quadratic_min_sse2+0x18>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -58348,11 +58659,11 @@
   .byte  243,15,16,79,36                     // movss         0x24(%edi),%xmm1
   .byte  139,125,20                          // mov           0x14(%ebp),%edi
   .byte  15,198,237,0                        // shufps        $0x0,%xmm5,%xmm5
-  .byte  15,89,166,194,29,0,0                // mulps         0x1dc2(%esi),%xmm4
+  .byte  15,89,166,238,29,0,0                // mulps         0x1dee(%esi),%xmm4
   .byte  243,15,89,246                       // mulss         %xmm6,%xmm6
   .byte  15,198,246,0                        // shufps        $0x0,%xmm6,%xmm6
   .byte  15,92,254                           // subps         %xmm6,%xmm7
-  .byte  15,89,174,210,29,0,0                // mulps         0x1dd2(%esi),%xmm5
+  .byte  15,89,174,254,29,0,0                // mulps         0x1dfe(%esi),%xmm5
   .byte  15,89,239                           // mulps         %xmm7,%xmm5
   .byte  15,40,196                           // movaps        %xmm4,%xmm0
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
@@ -58361,8 +58672,8 @@
   .byte  15,198,201,0                        // shufps        $0x0,%xmm1,%xmm1
   .byte  15,40,197                           // movaps        %xmm5,%xmm0
   .byte  15,92,196                           // subps         %xmm4,%xmm0
-  .byte  15,87,166,226,29,0,0                // xorps         0x1de2(%esi),%xmm4
-  .byte  15,89,142,242,29,0,0                // mulps         0x1df2(%esi),%xmm1
+  .byte  15,87,166,14,30,0,0                 // xorps         0x1e0e(%esi),%xmm4
+  .byte  15,89,142,30,30,0,0                 // mulps         0x1e1e(%esi),%xmm1
   .byte  139,117,24                          // mov           0x18(%ebp),%esi
   .byte  15,40,117,40                        // movaps        0x28(%ebp),%xmm6
   .byte  15,92,229                           // subps         %xmm5,%xmm4
@@ -58403,7 +58714,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8658 <_sk_xy_to_2pt_conical_linear_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          873c <_sk_xy_to_2pt_conical_linear_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -58415,7 +58726,7 @@
   .byte  243,15,89,236                       // mulss         %xmm4,%xmm5
   .byte  15,198,237,0                        // shufps        $0x0,%xmm5,%xmm5
   .byte  15,88,232                           // addps         %xmm0,%xmm5
-  .byte  15,89,174,24,29,0,0                 // mulps         0x1d18(%esi),%xmm5
+  .byte  15,89,174,68,29,0,0                 // mulps         0x1d44(%esi),%xmm5
   .byte  15,89,192                           // mulps         %xmm0,%xmm0
   .byte  15,40,241                           // movaps        %xmm1,%xmm6
   .byte  15,89,246                           // mulps         %xmm6,%xmm6
@@ -58423,7 +58734,7 @@
   .byte  243,15,89,228                       // mulss         %xmm4,%xmm4
   .byte  15,198,228,0                        // shufps        $0x0,%xmm4,%xmm4
   .byte  15,92,196                           // subps         %xmm4,%xmm0
-  .byte  15,87,134,40,29,0,0                 // xorps         0x1d28(%esi),%xmm0
+  .byte  15,87,134,84,29,0,0                 // xorps         0x1d54(%esi),%xmm0
   .byte  139,117,24                          // mov           0x18(%ebp),%esi
   .byte  15,40,101,40                        // movaps        0x28(%ebp),%xmm4
   .byte  15,40,117,56                        // movaps        0x38(%ebp),%xmm6
@@ -58553,16 +58864,16 @@
   .byte  131,236,124                         // sub           $0x7c,%esp
   .byte  15,41,93,216                        // movaps        %xmm3,-0x28(%ebp)
   .byte  15,40,218                           // movaps        %xmm2,%xmm3
-  .byte  232,0,0,0,0                         // call          87fa <_sk_save_xy_sse2+0x15>
+  .byte  232,0,0,0,0                         // call          88de <_sk_save_xy_sse2+0x15>
   .byte  88                                  // pop           %eax
-  .byte  15,40,160,150,27,0,0                // movaps        0x1b96(%eax),%xmm4
+  .byte  15,40,160,194,27,0,0                // movaps        0x1bc2(%eax),%xmm4
   .byte  15,40,232                           // movaps        %xmm0,%xmm5
   .byte  15,88,236                           // addps         %xmm4,%xmm5
   .byte  243,15,91,245                       // cvttps2dq     %xmm5,%xmm6
   .byte  15,91,246                           // cvtdq2ps      %xmm6,%xmm6
   .byte  15,40,253                           // movaps        %xmm5,%xmm7
   .byte  15,194,254,1                        // cmpltps       %xmm6,%xmm7
-  .byte  15,40,144,166,27,0,0                // movaps        0x1ba6(%eax),%xmm2
+  .byte  15,40,144,210,27,0,0                // movaps        0x1bd2(%eax),%xmm2
   .byte  15,84,250                           // andps         %xmm2,%xmm7
   .byte  15,92,247                           // subps         %xmm7,%xmm6
   .byte  15,92,238                           // subps         %xmm6,%xmm5
@@ -58666,15 +58977,15 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          893f <_sk_bilinear_nx_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8a23 <_sk_bilinear_nx_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,117,12                          // mov           0xc(%ebp),%esi
   .byte  139,62                              // mov           (%esi),%edi
   .byte  15,16,7                             // movups        (%edi),%xmm0
-  .byte  15,88,128,113,26,0,0                // addps         0x1a71(%eax),%xmm0
-  .byte  15,40,160,129,26,0,0                // movaps        0x1a81(%eax),%xmm4
+  .byte  15,88,128,157,26,0,0                // addps         0x1a9d(%eax),%xmm0
+  .byte  15,40,160,173,26,0,0                // movaps        0x1aad(%eax),%xmm4
   .byte  139,69,20                           // mov           0x14(%ebp),%eax
   .byte  15,16,111,64                        // movups        0x40(%edi),%xmm5
   .byte  15,92,229                           // subps         %xmm5,%xmm4
@@ -58712,14 +59023,14 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          89c3 <_sk_bilinear_px_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8aa7 <_sk_bilinear_px_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,117,12                          // mov           0xc(%ebp),%esi
   .byte  139,62                              // mov           (%esi),%edi
   .byte  15,16,7                             // movups        (%edi),%xmm0
-  .byte  15,88,128,13,26,0,0                 // addps         0x1a0d(%eax),%xmm0
+  .byte  15,88,128,57,26,0,0                 // addps         0x1a39(%eax),%xmm0
   .byte  139,69,20                           // mov           0x14(%ebp),%eax
   .byte  15,16,103,64                        // movups        0x40(%edi),%xmm4
   .byte  15,17,167,128,0,0,0                 // movups        %xmm4,0x80(%edi)
@@ -58756,15 +59067,15 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8a3d <_sk_bilinear_ny_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8b21 <_sk_bilinear_ny_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,117,12                          // mov           0xc(%ebp),%esi
   .byte  139,62                              // mov           (%esi),%edi
   .byte  15,16,79,32                         // movups        0x20(%edi),%xmm1
-  .byte  15,88,136,163,25,0,0                // addps         0x19a3(%eax),%xmm1
-  .byte  15,40,160,179,25,0,0                // movaps        0x19b3(%eax),%xmm4
+  .byte  15,88,136,207,25,0,0                // addps         0x19cf(%eax),%xmm1
+  .byte  15,40,160,223,25,0,0                // movaps        0x19df(%eax),%xmm4
   .byte  139,69,20                           // mov           0x14(%ebp),%eax
   .byte  15,16,111,96                        // movups        0x60(%edi),%xmm5
   .byte  15,92,229                           // subps         %xmm5,%xmm4
@@ -58802,14 +59113,14 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8ac2 <_sk_bilinear_py_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8ba6 <_sk_bilinear_py_sse2+0xe>
   .byte  88                                  // pop           %eax
   .byte  139,77,8                            // mov           0x8(%ebp),%ecx
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
   .byte  139,117,12                          // mov           0xc(%ebp),%esi
   .byte  139,62                              // mov           (%esi),%edi
   .byte  15,16,79,32                         // movups        0x20(%edi),%xmm1
-  .byte  15,88,136,62,25,0,0                 // addps         0x193e(%eax),%xmm1
+  .byte  15,88,136,106,25,0,0                // addps         0x196a(%eax),%xmm1
   .byte  139,69,20                           // mov           0x14(%ebp),%eax
   .byte  15,16,103,96                        // movups        0x60(%edi),%xmm4
   .byte  15,17,167,160,0,0,0                 // movups        %xmm4,0xa0(%edi)
@@ -58846,7 +59157,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8b3d <_sk_bicubic_n3x_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8c21 <_sk_bicubic_n3x_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -58854,12 +59165,12 @@
   .byte  139,58                              // mov           (%edx),%edi
   .byte  15,16,7                             // movups        (%edi),%xmm0
   .byte  15,16,103,64                        // movups        0x40(%edi),%xmm4
-  .byte  15,88,134,211,24,0,0                // addps         0x18d3(%esi),%xmm0
-  .byte  15,40,174,227,24,0,0                // movaps        0x18e3(%esi),%xmm5
+  .byte  15,88,134,255,24,0,0                // addps         0x18ff(%esi),%xmm0
+  .byte  15,40,174,15,25,0,0                 // movaps        0x190f(%esi),%xmm5
   .byte  15,92,236                           // subps         %xmm4,%xmm5
   .byte  15,40,229                           // movaps        %xmm5,%xmm4
-  .byte  15,89,174,243,24,0,0                // mulps         0x18f3(%esi),%xmm5
-  .byte  15,88,174,3,25,0,0                  // addps         0x1903(%esi),%xmm5
+  .byte  15,89,174,31,25,0,0                 // mulps         0x191f(%esi),%xmm5
+  .byte  15,88,174,47,25,0,0                 // addps         0x192f(%esi),%xmm5
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  15,89,228                           // mulps         %xmm4,%xmm4
   .byte  15,89,236                           // mulps         %xmm4,%xmm5
@@ -58897,7 +59208,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8bd8 <_sk_bicubic_n1x_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8cbc <_sk_bicubic_n1x_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -58905,16 +59216,16 @@
   .byte  139,58                              // mov           (%edx),%edi
   .byte  15,16,7                             // movups        (%edi),%xmm0
   .byte  15,16,103,64                        // movups        0x40(%edi),%xmm4
-  .byte  15,88,134,120,24,0,0                // addps         0x1878(%esi),%xmm0
-  .byte  15,40,174,136,24,0,0                // movaps        0x1888(%esi),%xmm5
+  .byte  15,88,134,164,24,0,0                // addps         0x18a4(%esi),%xmm0
+  .byte  15,40,174,180,24,0,0                // movaps        0x18b4(%esi),%xmm5
   .byte  15,92,236                           // subps         %xmm4,%xmm5
-  .byte  15,40,166,152,24,0,0                // movaps        0x1898(%esi),%xmm4
+  .byte  15,40,166,196,24,0,0                // movaps        0x18c4(%esi),%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
-  .byte  15,88,166,168,24,0,0                // addps         0x18a8(%esi),%xmm4
+  .byte  15,88,166,212,24,0,0                // addps         0x18d4(%esi),%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
-  .byte  15,88,166,184,24,0,0                // addps         0x18b8(%esi),%xmm4
+  .byte  15,88,166,228,24,0,0                // addps         0x18e4(%esi),%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
-  .byte  15,88,166,200,24,0,0                // addps         0x18c8(%esi),%xmm4
+  .byte  15,88,166,244,24,0,0                // addps         0x18f4(%esi),%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  15,17,167,128,0,0,0                 // movups        %xmm4,0x80(%edi)
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
@@ -58950,21 +59261,21 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8c81 <_sk_bicubic_p1x_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8d65 <_sk_bicubic_p1x_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
   .byte  139,85,12                           // mov           0xc(%ebp),%edx
   .byte  139,58                              // mov           (%edx),%edi
-  .byte  15,40,166,47,24,0,0                 // movaps        0x182f(%esi),%xmm4
+  .byte  15,40,166,91,24,0,0                 // movaps        0x185b(%esi),%xmm4
   .byte  15,16,71,64                         // movups        0x40(%edi),%xmm0
-  .byte  15,40,174,63,24,0,0                 // movaps        0x183f(%esi),%xmm5
+  .byte  15,40,174,107,24,0,0                // movaps        0x186b(%esi),%xmm5
   .byte  15,89,232                           // mulps         %xmm0,%xmm5
-  .byte  15,88,174,79,24,0,0                 // addps         0x184f(%esi),%xmm5
+  .byte  15,88,174,123,24,0,0                // addps         0x187b(%esi),%xmm5
   .byte  15,89,232                           // mulps         %xmm0,%xmm5
   .byte  15,88,236                           // addps         %xmm4,%xmm5
   .byte  15,89,232                           // mulps         %xmm0,%xmm5
-  .byte  15,88,174,95,24,0,0                 // addps         0x185f(%esi),%xmm5
+  .byte  15,88,174,139,24,0,0                // addps         0x188b(%esi),%xmm5
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  15,16,7                             // movups        (%edi),%xmm0
   .byte  15,17,175,128,0,0,0                 // movups        %xmm5,0x80(%edi)
@@ -59002,7 +59313,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8d1f <_sk_bicubic_p3x_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8e03 <_sk_bicubic_p3x_sse2+0xe>
   .byte  89                                  // pop           %ecx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -59010,10 +59321,10 @@
   .byte  139,62                              // mov           (%esi),%edi
   .byte  15,16,7                             // movups        (%edi),%xmm0
   .byte  15,16,103,64                        // movups        0x40(%edi),%xmm4
-  .byte  15,88,129,209,23,0,0                // addps         0x17d1(%ecx),%xmm0
+  .byte  15,88,129,253,23,0,0                // addps         0x17fd(%ecx),%xmm0
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
-  .byte  15,89,161,225,23,0,0                // mulps         0x17e1(%ecx),%xmm4
-  .byte  15,88,161,241,23,0,0                // addps         0x17f1(%ecx),%xmm4
+  .byte  15,89,161,13,24,0,0                 // mulps         0x180d(%ecx),%xmm4
+  .byte  15,88,161,29,24,0,0                 // addps         0x181d(%ecx),%xmm4
   .byte  139,77,20                           // mov           0x14(%ebp),%ecx
   .byte  15,89,237                           // mulps         %xmm5,%xmm5
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
@@ -59051,7 +59362,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8db0 <_sk_bicubic_n3y_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8e94 <_sk_bicubic_n3y_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -59059,12 +59370,12 @@
   .byte  139,58                              // mov           (%edx),%edi
   .byte  15,16,79,32                         // movups        0x20(%edi),%xmm1
   .byte  15,16,103,96                        // movups        0x60(%edi),%xmm4
-  .byte  15,88,142,112,23,0,0                // addps         0x1770(%esi),%xmm1
-  .byte  15,40,174,128,23,0,0                // movaps        0x1780(%esi),%xmm5
+  .byte  15,88,142,156,23,0,0                // addps         0x179c(%esi),%xmm1
+  .byte  15,40,174,172,23,0,0                // movaps        0x17ac(%esi),%xmm5
   .byte  15,92,236                           // subps         %xmm4,%xmm5
   .byte  15,40,229                           // movaps        %xmm5,%xmm4
-  .byte  15,89,174,144,23,0,0                // mulps         0x1790(%esi),%xmm5
-  .byte  15,88,174,160,23,0,0                // addps         0x17a0(%esi),%xmm5
+  .byte  15,89,174,188,23,0,0                // mulps         0x17bc(%esi),%xmm5
+  .byte  15,88,174,204,23,0,0                // addps         0x17cc(%esi),%xmm5
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  15,89,228                           // mulps         %xmm4,%xmm4
   .byte  15,89,236                           // mulps         %xmm4,%xmm5
@@ -59102,7 +59413,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8e4c <_sk_bicubic_n1y_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8f30 <_sk_bicubic_n1y_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
@@ -59110,16 +59421,16 @@
   .byte  139,58                              // mov           (%edx),%edi
   .byte  15,16,79,32                         // movups        0x20(%edi),%xmm1
   .byte  15,16,103,96                        // movups        0x60(%edi),%xmm4
-  .byte  15,88,142,20,23,0,0                 // addps         0x1714(%esi),%xmm1
-  .byte  15,40,174,36,23,0,0                 // movaps        0x1724(%esi),%xmm5
+  .byte  15,88,142,64,23,0,0                 // addps         0x1740(%esi),%xmm1
+  .byte  15,40,174,80,23,0,0                 // movaps        0x1750(%esi),%xmm5
   .byte  15,92,236                           // subps         %xmm4,%xmm5
-  .byte  15,40,166,52,23,0,0                 // movaps        0x1734(%esi),%xmm4
+  .byte  15,40,166,96,23,0,0                 // movaps        0x1760(%esi),%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
-  .byte  15,88,166,68,23,0,0                 // addps         0x1744(%esi),%xmm4
+  .byte  15,88,166,112,23,0,0                // addps         0x1770(%esi),%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
-  .byte  15,88,166,84,23,0,0                 // addps         0x1754(%esi),%xmm4
+  .byte  15,88,166,128,23,0,0                // addps         0x1780(%esi),%xmm4
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
-  .byte  15,88,166,100,23,0,0                // addps         0x1764(%esi),%xmm4
+  .byte  15,88,166,144,23,0,0                // addps         0x1790(%esi),%xmm4
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  15,17,167,160,0,0,0                 // movups        %xmm4,0xa0(%edi)
   .byte  139,125,24                          // mov           0x18(%ebp),%edi
@@ -59155,21 +59466,21 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8ef6 <_sk_bicubic_p1y_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          8fda <_sk_bicubic_p1y_sse2+0xe>
   .byte  94                                  // pop           %esi
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,77,16                           // mov           0x10(%ebp),%ecx
   .byte  139,85,12                           // mov           0xc(%ebp),%edx
   .byte  139,58                              // mov           (%edx),%edi
-  .byte  15,40,166,202,22,0,0                // movaps        0x16ca(%esi),%xmm4
+  .byte  15,40,166,246,22,0,0                // movaps        0x16f6(%esi),%xmm4
   .byte  15,16,79,96                         // movups        0x60(%edi),%xmm1
-  .byte  15,40,174,218,22,0,0                // movaps        0x16da(%esi),%xmm5
+  .byte  15,40,174,6,23,0,0                  // movaps        0x1706(%esi),%xmm5
   .byte  15,89,233                           // mulps         %xmm1,%xmm5
-  .byte  15,88,174,234,22,0,0                // addps         0x16ea(%esi),%xmm5
+  .byte  15,88,174,22,23,0,0                 // addps         0x1716(%esi),%xmm5
   .byte  15,89,233                           // mulps         %xmm1,%xmm5
   .byte  15,88,236                           // addps         %xmm4,%xmm5
   .byte  15,89,233                           // mulps         %xmm1,%xmm5
-  .byte  15,88,174,250,22,0,0                // addps         0x16fa(%esi),%xmm5
+  .byte  15,88,174,38,23,0,0                 // addps         0x1726(%esi),%xmm5
   .byte  139,117,20                          // mov           0x14(%ebp),%esi
   .byte  15,16,79,32                         // movups        0x20(%edi),%xmm1
   .byte  15,17,175,160,0,0,0                 // movups        %xmm5,0xa0(%edi)
@@ -59207,7 +59518,7 @@
   .byte  87                                  // push          %edi
   .byte  86                                  // push          %esi
   .byte  131,236,108                         // sub           $0x6c,%esp
-  .byte  232,0,0,0,0                         // call          8f95 <_sk_bicubic_p3y_sse2+0xe>
+  .byte  232,0,0,0,0                         // call          9079 <_sk_bicubic_p3y_sse2+0xe>
   .byte  89                                  // pop           %ecx
   .byte  139,69,8                            // mov           0x8(%ebp),%eax
   .byte  139,85,16                           // mov           0x10(%ebp),%edx
@@ -59215,10 +59526,10 @@
   .byte  139,62                              // mov           (%esi),%edi
   .byte  15,16,79,32                         // movups        0x20(%edi),%xmm1
   .byte  15,16,103,96                        // movups        0x60(%edi),%xmm4
-  .byte  15,88,137,107,22,0,0                // addps         0x166b(%ecx),%xmm1
+  .byte  15,88,137,151,22,0,0                // addps         0x1697(%ecx),%xmm1
   .byte  15,40,236                           // movaps        %xmm4,%xmm5
-  .byte  15,89,161,123,22,0,0                // mulps         0x167b(%ecx),%xmm4
-  .byte  15,88,161,139,22,0,0                // addps         0x168b(%ecx),%xmm4
+  .byte  15,89,161,167,22,0,0                // mulps         0x16a7(%ecx),%xmm4
+  .byte  15,88,161,183,22,0,0                // addps         0x16b7(%ecx),%xmm4
   .byte  139,77,20                           // mov           0x14(%ebp),%ecx
   .byte  15,89,237                           // mulps         %xmm5,%xmm5
   .byte  15,89,229                           // mulps         %xmm5,%xmm4
@@ -59462,17 +59773,27 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
+  .byte  63                                  // aas
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  128,63,0                            // cmpb          $0x0,(%edi)
+  .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
+  .byte  63                                  // aas
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  128,63,0                            // cmpb          $0x0,(%edi)
+  .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
+  .byte  63                                  // aas
+  .byte  0,0                                 // add           %al,(%eax)
+  .byte  128,63,0                            // cmpb          $0x0,(%edi)
+  .byte  0,128,191,0,0,128                   // add           %al,-0x7fffff41(%eax)
   .byte  191,0,0,128,191                     // mov           $0xbf800000,%edi
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  128,191,0,0,128,191,0               // cmpb          $0x0,-0x40800000(%edi)
+  .byte  128,191,0,0,224,64,0                // cmpb          $0x0,0x40e00000(%edi)
   .byte  0,224                               // add           %ah,%al
   .byte  64                                  // inc           %eax
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,64                              // loopne        92d8 <.literal16+0x1d8>
+  .byte  224,64                              // loopne        93ec <.literal16+0x1fc>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,64                              // loopne        92dc <.literal16+0x1dc>
-  .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,64                              // loopne        92e0 <.literal16+0x1e0>
+  .byte  224,64                              // loopne        93f0 <.literal16+0x200>
   .byte  154,153,153,62,154,153,153          // lcall         $0x9999,$0x9a3e9999
   .byte  62,154,153,153,62,154,153,153       // ds            lcall $0x9999,$0x9a3e9999
   .byte  62,61,10,23,63,61                   // ds            cmp $0x3d3f170a,%eax
@@ -59483,16 +59804,16 @@
   .byte  63                                  // aas
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         9301 <.literal16+0x201>
+  .byte  225,61                              // loope         9411 <.literal16+0x221>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         9305 <.literal16+0x205>
+  .byte  225,61                              // loope         9415 <.literal16+0x225>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         9309 <.literal16+0x209>
+  .byte  225,61                              // loope         9419 <.literal16+0x229>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         930d <.literal16+0x20d>
+  .byte  225,61                              // loope         941d <.literal16+0x22d>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -59509,16 +59830,16 @@
   .byte  63                                  // aas
   .byte  61,10,23,63,174                     // cmp           $0xae3f170a,%eax
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         9341 <.literal16+0x241>
+  .byte  225,61                              // loope         9451 <.literal16+0x261>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         9345 <.literal16+0x245>
+  .byte  225,61                              // loope         9455 <.literal16+0x265>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         9349 <.literal16+0x249>
+  .byte  225,61                              // loope         9459 <.literal16+0x269>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         934d <.literal16+0x24d>
+  .byte  225,61                              // loope         945d <.literal16+0x26d>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -59535,16 +59856,16 @@
   .byte  63                                  // aas
   .byte  61,10,23,63,174                     // cmp           $0xae3f170a,%eax
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         9381 <.literal16+0x281>
+  .byte  225,61                              // loope         9491 <.literal16+0x2a1>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         9385 <.literal16+0x285>
+  .byte  225,61                              // loope         9495 <.literal16+0x2a5>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         9389 <.literal16+0x289>
+  .byte  225,61                              // loope         9499 <.literal16+0x2a9>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         938d <.literal16+0x28d>
+  .byte  225,61                              // loope         949d <.literal16+0x2ad>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -59561,16 +59882,16 @@
   .byte  63                                  // aas
   .byte  61,10,23,63,174                     // cmp           $0xae3f170a,%eax
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         93c1 <.literal16+0x2c1>
+  .byte  225,61                              // loope         94d1 <.literal16+0x2e1>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         93c5 <.literal16+0x2c5>
+  .byte  225,61                              // loope         94d5 <.literal16+0x2e5>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         93c9 <.literal16+0x2c9>
+  .byte  225,61                              // loope         94d9 <.literal16+0x2e9>
   .byte  174                                 // scas          %es:(%edi),%al
   .byte  71                                  // inc           %edi
-  .byte  225,61                              // loope         93cd <.literal16+0x2cd>
+  .byte  225,61                              // loope         94dd <.literal16+0x2ed>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -59592,11 +59913,11 @@
   .byte  0,128,63,0,0,127                    // add           %al,0x7f00003f(%eax)
   .byte  67                                  // inc           %ebx
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            940b <.literal16+0x30b>
+  .byte  127,67                              // jg            951b <.literal16+0x32b>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            940f <.literal16+0x30f>
+  .byte  127,67                              // jg            951f <.literal16+0x32f>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9413 <.literal16+0x313>
+  .byte  127,67                              // jg            9523 <.literal16+0x333>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -59865,13 +60186,13 @@
   .byte  132,55                              // test          %dh,(%edi)
   .byte  8,33                                // or            %ah,(%ecx)
   .byte  132,55                              // test          %dh,(%edi)
-  .byte  224,7                               // loopne        9659 <.literal16+0x559>
+  .byte  224,7                               // loopne        9769 <.literal16+0x579>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        965d <.literal16+0x55d>
+  .byte  224,7                               // loopne        976d <.literal16+0x57d>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        9661 <.literal16+0x561>
+  .byte  224,7                               // loopne        9771 <.literal16+0x581>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        9665 <.literal16+0x565>
+  .byte  224,7                               // loopne        9775 <.literal16+0x585>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  33,8                                // and           %ecx,(%eax)
   .byte  2,58                                // add           (%edx),%bh
@@ -59920,11 +60241,11 @@
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,127,67                            // add           %bh,0x43(%edi)
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            971b <.literal16+0x61b>
+  .byte  127,67                              // jg            982b <.literal16+0x63b>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            971f <.literal16+0x61f>
+  .byte  127,67                              // jg            982f <.literal16+0x63f>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9723 <.literal16+0x623>
+  .byte  127,67                              // jg            9833 <.literal16+0x643>
   .byte  129,128,128,59,129,128,128,59,129,128// addl          $0x80813b80,-0x7f7ec480(%eax)
   .byte  128,59,129                          // cmpb          $0x81,(%ebx)
   .byte  128,128,59,129,128,128,59           // addb          $0x3b,-0x7f7f7ec5(%eax)
@@ -59939,16 +60260,16 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            9714 <.literal16+0x614>
+  .byte  127,0                               // jg            9824 <.literal16+0x634>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            9718 <.literal16+0x618>
+  .byte  127,0                               // jg            9828 <.literal16+0x638>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            971c <.literal16+0x61c>
+  .byte  127,0                               // jg            982c <.literal16+0x63c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            9720 <.literal16+0x620>
+  .byte  127,0                               // jg            9830 <.literal16+0x640>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
@@ -59957,7 +60278,7 @@
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
-  .byte  119,115                             // ja            97a5 <.literal16+0x6a5>
+  .byte  119,115                             // ja            98b5 <.literal16+0x6c5>
   .byte  248                                 // clc
   .byte  194,119,115                         // ret           $0x7377
   .byte  248                                 // clc
@@ -59968,7 +60289,7 @@
   .byte  194,117,191                         // ret           $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
-  .byte  117,191                             // jne           9709 <.literal16+0x609>
+  .byte  117,191                             // jne           9819 <.literal16+0x629>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
   .byte  249                                 // stc
@@ -59984,7 +60305,7 @@
   .byte  68                                  // inc           %esp
   .byte  180,62                              // mov           $0x3e,%ah
   .byte  163,233,220,63,163                  // mov           %eax,0xa33fdce9
-  .byte  233,220,63,163,233                  // jmp           e9a3d746 <_sk_callback_sse2+0xe9a3472d>
+  .byte  233,220,63,163,233                  // jmp           e9a3d856 <_sk_callback_sse2+0xe9a34759>
   .byte  220,63                              // fdivrl        (%edi)
   .byte  163,233,220,63,0                    // mov           %eax,0x3fdce9
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -60039,16 +60360,16 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            97e4 <.literal16+0x6e4>
+  .byte  127,0                               // jg            98f4 <.literal16+0x704>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            97e8 <.literal16+0x6e8>
+  .byte  127,0                               // jg            98f8 <.literal16+0x708>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            97ec <.literal16+0x6ec>
+  .byte  127,0                               // jg            98fc <.literal16+0x70c>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            97f0 <.literal16+0x6f0>
+  .byte  127,0                               // jg            9900 <.literal16+0x710>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
@@ -60057,7 +60378,7 @@
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
-  .byte  119,115                             // ja            9875 <.literal16+0x775>
+  .byte  119,115                             // ja            9985 <.literal16+0x795>
   .byte  248                                 // clc
   .byte  194,119,115                         // ret           $0x7377
   .byte  248                                 // clc
@@ -60068,7 +60389,7 @@
   .byte  194,117,191                         // ret           $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
-  .byte  117,191                             // jne           97d9 <.literal16+0x6d9>
+  .byte  117,191                             // jne           98e9 <.literal16+0x6f9>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
   .byte  249                                 // stc
@@ -60084,7 +60405,7 @@
   .byte  68                                  // inc           %esp
   .byte  180,62                              // mov           $0x3e,%ah
   .byte  163,233,220,63,163                  // mov           %eax,0xa33fdce9
-  .byte  233,220,63,163,233                  // jmp           e9a3d816 <_sk_callback_sse2+0xe9a347fd>
+  .byte  233,220,63,163,233                  // jmp           e9a3d926 <_sk_callback_sse2+0xe9a34829>
   .byte  220,63                              // fdivrl        (%edi)
   .byte  163,233,220,63,0                    // mov           %eax,0x3fdce9
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -60139,16 +60460,16 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            98b4 <.literal16+0x7b4>
+  .byte  127,0                               // jg            99c4 <.literal16+0x7d4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            98b8 <.literal16+0x7b8>
+  .byte  127,0                               // jg            99c8 <.literal16+0x7d8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            98bc <.literal16+0x7bc>
+  .byte  127,0                               // jg            99cc <.literal16+0x7dc>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            98c0 <.literal16+0x7c0>
+  .byte  127,0                               // jg            99d0 <.literal16+0x7e0>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
@@ -60157,7 +60478,7 @@
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
-  .byte  119,115                             // ja            9945 <.literal16+0x845>
+  .byte  119,115                             // ja            9a55 <.literal16+0x865>
   .byte  248                                 // clc
   .byte  194,119,115                         // ret           $0x7377
   .byte  248                                 // clc
@@ -60168,7 +60489,7 @@
   .byte  194,117,191                         // ret           $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
-  .byte  117,191                             // jne           98a9 <.literal16+0x7a9>
+  .byte  117,191                             // jne           99b9 <.literal16+0x7c9>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
   .byte  249                                 // stc
@@ -60184,7 +60505,7 @@
   .byte  68                                  // inc           %esp
   .byte  180,62                              // mov           $0x3e,%ah
   .byte  163,233,220,63,163                  // mov           %eax,0xa33fdce9
-  .byte  233,220,63,163,233                  // jmp           e9a3d8e6 <_sk_callback_sse2+0xe9a348cd>
+  .byte  233,220,63,163,233                  // jmp           e9a3d9f6 <_sk_callback_sse2+0xe9a348f9>
   .byte  220,63                              // fdivrl        (%edi)
   .byte  163,233,220,63,0                    // mov           %eax,0x3fdce9
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -60239,16 +60560,16 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  52,255                              // xor           $0xff,%al
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            9984 <.literal16+0x884>
+  .byte  127,0                               // jg            9a94 <.literal16+0x8a4>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            9988 <.literal16+0x888>
+  .byte  127,0                               // jg            9a98 <.literal16+0x8a8>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            998c <.literal16+0x88c>
+  .byte  127,0                               // jg            9a9c <.literal16+0x8ac>
   .byte  255                                 // (bad)
   .byte  255                                 // (bad)
-  .byte  127,0                               // jg            9990 <.literal16+0x890>
+  .byte  127,0                               // jg            9aa0 <.literal16+0x8b0>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
@@ -60257,7 +60578,7 @@
   .byte  0,63                                // add           %bh,(%edi)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,63                                // add           %bh,(%edi)
-  .byte  119,115                             // ja            9a15 <.literal16+0x915>
+  .byte  119,115                             // ja            9b25 <.literal16+0x935>
   .byte  248                                 // clc
   .byte  194,119,115                         // ret           $0x7377
   .byte  248                                 // clc
@@ -60268,7 +60589,7 @@
   .byte  194,117,191                         // ret           $0xbf75
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
-  .byte  117,191                             // jne           9979 <.literal16+0x879>
+  .byte  117,191                             // jne           9a89 <.literal16+0x899>
   .byte  191,63,117,191,191                  // mov           $0xbfbf753f,%edi
   .byte  63                                  // aas
   .byte  249                                 // stc
@@ -60284,7 +60605,7 @@
   .byte  68                                  // inc           %esp
   .byte  180,62                              // mov           $0x3e,%ah
   .byte  163,233,220,63,163                  // mov           %eax,0xa33fdce9
-  .byte  233,220,63,163,233                  // jmp           e9a3d9b6 <_sk_callback_sse2+0xe9a3499d>
+  .byte  233,220,63,163,233                  // jmp           e9a3dac6 <_sk_callback_sse2+0xe9a349c9>
   .byte  220,63                              // fdivrl        (%edi)
   .byte  163,233,220,63,0                    // mov           %eax,0x3fdce9
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -60335,13 +60656,13 @@
   .byte  200,66,0,0                          // enter         $0x42,$0x0
   .byte  200,66,0,0                          // enter         $0x42,$0x0
   .byte  200,66,0,0                          // enter         $0x42,$0x0
-  .byte  127,67                              // jg            9a97 <.literal16+0x997>
+  .byte  127,67                              // jg            9ba7 <.literal16+0x9b7>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9a9b <.literal16+0x99b>
+  .byte  127,67                              // jg            9bab <.literal16+0x9bb>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9a9f <.literal16+0x99f>
+  .byte  127,67                              // jg            9baf <.literal16+0x9bf>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9aa3 <.literal16+0x9a3>
+  .byte  127,67                              // jg            9bb3 <.literal16+0x9c3>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,195                               // add           %al,%bl
   .byte  0,0                                 // add           %al,(%eax)
@@ -60392,16 +60713,16 @@
   .byte  128,3,62                            // addb          $0x3e,(%ebx)
   .byte  31                                  // pop           %ds
   .byte  215                                 // xlat          %ds:(%ebx)
-  .byte  118,63                              // jbe           9b23 <.literal16+0xa23>
+  .byte  118,63                              // jbe           9c33 <.literal16+0xa43>
   .byte  31                                  // pop           %ds
   .byte  215                                 // xlat          %ds:(%ebx)
-  .byte  118,63                              // jbe           9b27 <.literal16+0xa27>
+  .byte  118,63                              // jbe           9c37 <.literal16+0xa47>
   .byte  31                                  // pop           %ds
   .byte  215                                 // xlat          %ds:(%ebx)
-  .byte  118,63                              // jbe           9b2b <.literal16+0xa2b>
+  .byte  118,63                              // jbe           9c3b <.literal16+0xa4b>
   .byte  31                                  // pop           %ds
   .byte  215                                 // xlat          %ds:(%ebx)
-  .byte  118,63                              // jbe           9b2f <.literal16+0xa2f>
+  .byte  118,63                              // jbe           9c3f <.literal16+0xa4f>
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%eax)
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%eax)
   .byte  246,64,83,63                        // testb         $0x3f,0x53(%eax)
@@ -60430,11 +60751,11 @@
   .byte  128,59,0                            // cmpb          $0x0,(%ebx)
   .byte  0,127,67                            // add           %bh,0x43(%edi)
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9b9b <.literal16+0xa9b>
+  .byte  127,67                              // jg            9cab <.literal16+0xabb>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9b9f <.literal16+0xa9f>
+  .byte  127,67                              // jg            9caf <.literal16+0xabf>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9ba3 <.literal16+0xaa3>
+  .byte  127,67                              // jg            9cb3 <.literal16+0xac3>
   .byte  255,0                               // incl          (%eax)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,0                                 // add           %al,(%eax)
@@ -60505,13 +60826,13 @@
   .byte  132,55                              // test          %dh,(%edi)
   .byte  8,33                                // or            %ah,(%ecx)
   .byte  132,55                              // test          %dh,(%edi)
-  .byte  224,7                               // loopne        9c39 <.literal16+0xb39>
+  .byte  224,7                               // loopne        9d49 <.literal16+0xb59>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        9c3d <.literal16+0xb3d>
+  .byte  224,7                               // loopne        9d4d <.literal16+0xb5d>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        9c41 <.literal16+0xb41>
+  .byte  224,7                               // loopne        9d51 <.literal16+0xb61>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        9c45 <.literal16+0xb45>
+  .byte  224,7                               // loopne        9d55 <.literal16+0xb65>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  33,8                                // and           %ecx,(%eax)
   .byte  2,58                                // add           (%edx),%bh
@@ -60557,13 +60878,13 @@
   .byte  132,55                              // test          %dh,(%edi)
   .byte  8,33                                // or            %ah,(%ecx)
   .byte  132,55                              // test          %dh,(%edi)
-  .byte  224,7                               // loopne        9ca9 <.literal16+0xba9>
+  .byte  224,7                               // loopne        9db9 <.literal16+0xbc9>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        9cad <.literal16+0xbad>
+  .byte  224,7                               // loopne        9dbd <.literal16+0xbcd>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        9cb1 <.literal16+0xbb1>
+  .byte  224,7                               // loopne        9dc1 <.literal16+0xbd1>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        9cb5 <.literal16+0xbb5>
+  .byte  224,7                               // loopne        9dc5 <.literal16+0xbd5>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  33,8                                // and           %ecx,(%eax)
   .byte  2,58                                // add           (%edx),%bh
@@ -60609,13 +60930,13 @@
   .byte  132,55                              // test          %dh,(%edi)
   .byte  8,33                                // or            %ah,(%ecx)
   .byte  132,55                              // test          %dh,(%edi)
-  .byte  224,7                               // loopne        9d19 <.literal16+0xc19>
+  .byte  224,7                               // loopne        9e29 <.literal16+0xc39>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        9d1d <.literal16+0xc1d>
+  .byte  224,7                               // loopne        9e2d <.literal16+0xc3d>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        9d21 <.literal16+0xc21>
+  .byte  224,7                               // loopne        9e31 <.literal16+0xc41>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  224,7                               // loopne        9d25 <.literal16+0xc25>
+  .byte  224,7                               // loopne        9e35 <.literal16+0xc45>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  33,8                                // and           %ecx,(%eax)
   .byte  2,58                                // add           (%edx),%bh
@@ -60657,13 +60978,13 @@
   .byte  248                                 // clc
   .byte  65                                  // inc           %ecx
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  124,66                              // jl            9db6 <.literal16+0xcb6>
+  .byte  124,66                              // jl            9ec6 <.literal16+0xcd6>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  124,66                              // jl            9dba <.literal16+0xcba>
+  .byte  124,66                              // jl            9eca <.literal16+0xcda>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  124,66                              // jl            9dbe <.literal16+0xcbe>
+  .byte  124,66                              // jl            9ece <.literal16+0xcde>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  124,66                              // jl            9dc2 <.literal16+0xcc2>
+  .byte  124,66                              // jl            9ed2 <.literal16+0xce2>
   .byte  0,240                               // add           %dh,%al
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,240                               // add           %dh,%al
@@ -60797,13 +61118,13 @@
   .byte  136,136,61,137,136,136              // mov           %cl,-0x777776c3(%eax)
   .byte  61,137,136,136,61                   // cmp           $0x3d888889,%eax
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  112,65                              // jo            9f45 <.literal16+0xe45>
+  .byte  112,65                              // jo            a055 <.literal16+0xe65>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  112,65                              // jo            9f49 <.literal16+0xe49>
+  .byte  112,65                              // jo            a059 <.literal16+0xe69>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  112,65                              // jo            9f4d <.literal16+0xe4d>
+  .byte  112,65                              // jo            a05d <.literal16+0xe6d>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  112,65                              // jo            9f51 <.literal16+0xe51>
+  .byte  112,65                              // jo            a061 <.literal16+0xe71>
   .byte  255,0                               // incl          (%eax)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  255,0                               // incl          (%eax)
@@ -60834,11 +61155,11 @@
   .byte  128,59,129                          // cmpb          $0x81,(%ebx)
   .byte  128,128,59,0,0,127,67               // addb          $0x43,0x7f00003b(%eax)
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9fbb <.literal16+0xebb>
+  .byte  127,67                              // jg            a0cb <.literal16+0xedb>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9fbf <.literal16+0xebf>
+  .byte  127,67                              // jg            a0cf <.literal16+0xedf>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            9fc3 <.literal16+0xec3>
+  .byte  127,67                              // jg            a0d3 <.literal16+0xee3>
   .byte  255,0                               // incl          (%eax)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  255,0                               // incl          (%eax)
@@ -60869,11 +61190,11 @@
   .byte  128,59,129                          // cmpb          $0x81,(%ebx)
   .byte  128,128,59,0,0,127,67               // addb          $0x43,0x7f00003b(%eax)
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            a02b <.literal16+0xf2b>
+  .byte  127,67                              // jg            a13b <.literal16+0xf4b>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            a02f <.literal16+0xf2f>
+  .byte  127,67                              // jg            a13f <.literal16+0xf4f>
   .byte  0,0                                 // add           %al,(%eax)
-  .byte  127,67                              // jg            a033 <.literal16+0xf33>
+  .byte  127,67                              // jg            a143 <.literal16+0xf53>
   .byte  0,128,0,0,0,128                     // add           %al,-0x80000000(%eax)
   .byte  0,0                                 // add           %al,(%eax)
   .byte  0,128,0,0,0,128                     // add           %al,-0x80000000(%eax)
@@ -60972,13 +61293,13 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  255                                 // (bad)
-  .byte  127,71                              // jg            a15b <.literal16+0x105b>
+  .byte  127,71                              // jg            a26b <.literal16+0x107b>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            a15f <.literal16+0x105f>
+  .byte  127,71                              // jg            a26f <.literal16+0x107f>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            a163 <.literal16+0x1063>
+  .byte  127,71                              // jg            a273 <.literal16+0x1083>
   .byte  0,255                               // add           %bh,%bh
-  .byte  127,71                              // jg            a167 <.literal16+0x1067>
+  .byte  127,71                              // jg            a277 <.literal16+0x1087>
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,0                            // cmpb          $0x0,(%edi)
   .byte  0,128,63,0,0,128                    // add           %al,-0x7fffffc1(%eax)
@@ -61086,7 +61407,7 @@
   .byte  192,45,16,17,192,45,16              // shrb          $0x10,0x2dc01110
   .byte  17,192                              // adc           %eax,%eax
   .byte  45,16,17,192,18                     // sub           $0x12c01110,%eax
-  .byte  120,57                              // js            a26c <.literal16+0x116c>
+  .byte  120,57                              // js            a37c <.literal16+0x118c>
   .byte  64                                  // inc           %eax
   .byte  18,120,57                           // adc           0x39(%eax),%bh
   .byte  64                                  // inc           %eax
@@ -61279,11 +61600,11 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,114                          // cmpb          $0x72,(%edi)
   .byte  28,199                              // sbb           $0xc7,%al
-  .byte  62,114,28                           // jb,pt         a452 <.literal16+0x1352>
+  .byte  62,114,28                           // jb,pt         a562 <.literal16+0x1372>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         a456 <.literal16+0x1356>
+  .byte  62,114,28                           // jb,pt         a566 <.literal16+0x1376>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         a45a <.literal16+0x135a>
+  .byte  62,114,28                           // jb,pt         a56a <.literal16+0x137a>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%edi)
   .byte  170                                 // stos          %al,%es:(%edi)
@@ -61362,13 +61683,13 @@
   .byte  192,63,0                            // sarb          $0x0,(%edi)
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // aas
-  .byte  114,28                              // jb            a51e <.literal16+0x141e>
+  .byte  114,28                              // jb            a62e <.literal16+0x143e>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         a522 <.literal16+0x1422>
+  .byte  62,114,28                           // jb,pt         a632 <.literal16+0x1442>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         a526 <.literal16+0x1426>
+  .byte  62,114,28                           // jb,pt         a636 <.literal16+0x1446>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         a52a <.literal16+0x142a>
+  .byte  62,114,28                           // jb,pt         a63a <.literal16+0x144a>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%edi)
   .byte  170                                 // stos          %al,%es:(%edi)
@@ -61389,11 +61710,11 @@
   .byte  0,0                                 // add           %al,(%eax)
   .byte  128,63,114                          // cmpb          $0x72,(%edi)
   .byte  28,199                              // sbb           $0xc7,%al
-  .byte  62,114,28                           // jb,pt         a562 <.literal16+0x1462>
+  .byte  62,114,28                           // jb,pt         a672 <.literal16+0x1482>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         a566 <.literal16+0x1466>
+  .byte  62,114,28                           // jb,pt         a676 <.literal16+0x1486>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         a56a <.literal16+0x146a>
+  .byte  62,114,28                           // jb,pt         a67a <.literal16+0x148a>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%edi)
   .byte  170                                 // stos          %al,%es:(%edi)
@@ -61472,13 +61793,13 @@
   .byte  192,63,0                            // sarb          $0x0,(%edi)
   .byte  0,192                               // add           %al,%al
   .byte  63                                  // aas
-  .byte  114,28                              // jb            a62e <.literal16+0x152e>
+  .byte  114,28                              // jb            a73e <.literal16+0x154e>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         a632 <_sk_callback_sse2+0x1619>
+  .byte  62,114,28                           // jb,pt         a742 <_sk_callback_sse2+0x1645>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         a636 <_sk_callback_sse2+0x161d>
+  .byte  62,114,28                           // jb,pt         a746 <_sk_callback_sse2+0x1649>
   .byte  199                                 // (bad)
-  .byte  62,114,28                           // jb,pt         a63a <_sk_callback_sse2+0x1621>
+  .byte  62,114,28                           // jb,pt         a74a <_sk_callback_sse2+0x164d>
   .byte  199                                 // (bad)
   .byte  62,171                              // ds            stos %eax,%es:(%edi)
   .byte  170                                 // stos          %al,%es:(%edi)
diff --git a/src/jumper/SkJumper_generated_win.S b/src/jumper/SkJumper_generated_win.S
index d1f9cff..9a8a08b 100644
--- a/src/jumper/SkJumper_generated_win.S
+++ b/src/jumper/SkJumper_generated_win.S
@@ -94,7 +94,7 @@
   DB  197,249,110,194                     ; vmovd         %edx,%xmm0
   DB  196,226,125,88,192                  ; vpbroadcastd  %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,14,87,0,0         ; vbroadcastss  0x570e(%rip),%ymm1        # 5840 <_sk_callback_hsw+0x12c>
+  DB  196,226,125,24,13,66,87,0,0         ; vbroadcastss  0x5742(%rip),%ymm1        # 5874 <_sk_callback_hsw+0x12c>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  197,252,88,7                        ; vaddps        (%rdi),%ymm0,%ymm0
   DB  197,249,110,209                     ; vmovd         %ecx,%xmm2
@@ -102,7 +102,7 @@
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  197,236,88,201                      ; vaddps        %ymm1,%ymm2,%ymm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,21,238,86,0,0        ; vbroadcastss  0x56ee(%rip),%ymm2        # 5844 <_sk_callback_hsw+0x130>
+  DB  196,226,125,24,21,34,87,0,0         ; vbroadcastss  0x5722(%rip),%ymm2        # 5878 <_sk_callback_hsw+0x130>
   DB  197,228,87,219                      ; vxorps        %ymm3,%ymm3,%ymm3
   DB  197,220,87,228                      ; vxorps        %ymm4,%ymm4,%ymm4
   DB  197,212,87,237                      ; vxorps        %ymm5,%ymm5,%ymm5
@@ -119,13 +119,13 @@
   DB  197,121,110,201                     ; vmovd         %ecx,%xmm9
   DB  196,66,125,88,201                   ; vpbroadcastd  %xmm9,%ymm9
   DB  196,65,53,239,200                   ; vpxor         %ymm8,%ymm9,%ymm9
-  DB  196,98,125,88,21,181,86,0,0         ; vpbroadcastd  0x56b5(%rip),%ymm10        # 5848 <_sk_callback_hsw+0x134>
+  DB  196,98,125,88,21,233,86,0,0         ; vpbroadcastd  0x56e9(%rip),%ymm10        # 587c <_sk_callback_hsw+0x134>
   DB  196,65,53,219,218                   ; vpand         %ymm10,%ymm9,%ymm11
   DB  196,193,37,114,243,5                ; vpslld        $0x5,%ymm11,%ymm11
   DB  196,65,61,219,210                   ; vpand         %ymm10,%ymm8,%ymm10
   DB  196,193,45,114,242,4                ; vpslld        $0x4,%ymm10,%ymm10
-  DB  196,98,125,88,37,154,86,0,0         ; vpbroadcastd  0x569a(%rip),%ymm12        # 584c <_sk_callback_hsw+0x138>
-  DB  196,98,125,88,45,149,86,0,0         ; vpbroadcastd  0x5695(%rip),%ymm13        # 5850 <_sk_callback_hsw+0x13c>
+  DB  196,98,125,88,37,206,86,0,0         ; vpbroadcastd  0x56ce(%rip),%ymm12        # 5880 <_sk_callback_hsw+0x138>
+  DB  196,98,125,88,45,201,86,0,0         ; vpbroadcastd  0x56c9(%rip),%ymm13        # 5884 <_sk_callback_hsw+0x13c>
   DB  196,65,53,219,245                   ; vpand         %ymm13,%ymm9,%ymm14
   DB  196,193,13,114,246,2                ; vpslld        $0x2,%ymm14,%ymm14
   DB  196,65,61,219,237                   ; vpand         %ymm13,%ymm8,%ymm13
@@ -140,8 +140,8 @@
   DB  196,65,61,235,194                   ; vpor          %ymm10,%ymm8,%ymm8
   DB  196,65,61,235,193                   ; vpor          %ymm9,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,71,86,0,0          ; vbroadcastss  0x5647(%rip),%ymm9        # 5854 <_sk_callback_hsw+0x140>
-  DB  196,98,125,24,21,66,86,0,0          ; vbroadcastss  0x5642(%rip),%ymm10        # 5858 <_sk_callback_hsw+0x144>
+  DB  196,98,125,24,13,123,86,0,0         ; vbroadcastss  0x567b(%rip),%ymm9        # 5888 <_sk_callback_hsw+0x140>
+  DB  196,98,125,24,21,118,86,0,0         ; vbroadcastss  0x5676(%rip),%ymm10        # 588c <_sk_callback_hsw+0x144>
   DB  196,66,61,184,209                   ; vfmadd231ps   %ymm9,%ymm8,%ymm10
   DB  196,98,125,24,0                     ; vbroadcastss  (%rax),%ymm8
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
@@ -158,8 +158,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
-PUBLIC _sk_constant_color_hsw
-_sk_constant_color_hsw LABEL PROC
+PUBLIC _sk_uniform_color_hsw
+_sk_uniform_color_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  196,226,125,24,0                    ; vbroadcastss  (%rax),%ymm0
   DB  196,226,125,24,72,4                 ; vbroadcastss  0x4(%rax),%ymm1
@@ -168,6 +168,24 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
+PUBLIC _sk_black_color_hsw
+_sk_black_color_hsw LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  196,226,125,24,29,22,86,0,0         ; vbroadcastss  0x5616(%rip),%ymm3        # 5890 <_sk_callback_hsw+0x148>
+  DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
+  DB  197,244,87,201                      ; vxorps        %ymm1,%ymm1,%ymm1
+  DB  197,236,87,210                      ; vxorps        %ymm2,%ymm2,%ymm2
+  DB  255,224                             ; jmpq          *%rax
+
+PUBLIC _sk_white_color_hsw
+_sk_white_color_hsw LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  196,226,125,24,5,1,86,0,0           ; vbroadcastss  0x5601(%rip),%ymm0        # 5894 <_sk_callback_hsw+0x14c>
+  DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
+  DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
+  DB  197,252,40,216                      ; vmovaps       %ymm0,%ymm3
+  DB  255,224                             ; jmpq          *%rax
+
 PUBLIC _sk_load_rgba_hsw
 _sk_load_rgba_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -200,7 +218,7 @@
 PUBLIC _sk_srcatop_hsw
 _sk_srcatop_hsw LABEL PROC
   DB  197,252,89,199                      ; vmulps        %ymm7,%ymm0,%ymm0
-  DB  196,98,125,24,5,154,85,0,0          ; vbroadcastss  0x559a(%rip),%ymm8        # 585c <_sk_callback_hsw+0x148>
+  DB  196,98,125,24,5,164,85,0,0          ; vbroadcastss  0x55a4(%rip),%ymm8        # 5898 <_sk_callback_hsw+0x150>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,226,61,184,196                  ; vfmadd231ps   %ymm4,%ymm8,%ymm0
   DB  197,244,89,207                      ; vmulps        %ymm7,%ymm1,%ymm1
@@ -214,7 +232,7 @@
 
 PUBLIC _sk_dstatop_hsw
 _sk_dstatop_hsw LABEL PROC
-  DB  196,98,125,24,5,109,85,0,0          ; vbroadcastss  0x556d(%rip),%ymm8        # 5860 <_sk_callback_hsw+0x14c>
+  DB  196,98,125,24,5,119,85,0,0          ; vbroadcastss  0x5577(%rip),%ymm8        # 589c <_sk_callback_hsw+0x154>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  196,226,101,184,196                 ; vfmadd231ps   %ymm4,%ymm3,%ymm0
@@ -247,7 +265,7 @@
 
 PUBLIC _sk_srcout_hsw
 _sk_srcout_hsw LABEL PROC
-  DB  196,98,125,24,5,20,85,0,0           ; vbroadcastss  0x5514(%rip),%ymm8        # 5864 <_sk_callback_hsw+0x150>
+  DB  196,98,125,24,5,30,85,0,0           ; vbroadcastss  0x551e(%rip),%ymm8        # 58a0 <_sk_callback_hsw+0x158>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
@@ -258,7 +276,7 @@
 
 PUBLIC _sk_dstout_hsw
 _sk_dstout_hsw LABEL PROC
-  DB  196,226,125,24,5,247,84,0,0         ; vbroadcastss  0x54f7(%rip),%ymm0        # 5868 <_sk_callback_hsw+0x154>
+  DB  196,226,125,24,5,1,85,0,0           ; vbroadcastss  0x5501(%rip),%ymm0        # 58a4 <_sk_callback_hsw+0x15c>
   DB  197,252,92,219                      ; vsubps        %ymm3,%ymm0,%ymm3
   DB  197,228,89,196                      ; vmulps        %ymm4,%ymm3,%ymm0
   DB  197,228,89,205                      ; vmulps        %ymm5,%ymm3,%ymm1
@@ -269,7 +287,7 @@
 
 PUBLIC _sk_srcover_hsw
 _sk_srcover_hsw LABEL PROC
-  DB  196,98,125,24,5,218,84,0,0          ; vbroadcastss  0x54da(%rip),%ymm8        # 586c <_sk_callback_hsw+0x158>
+  DB  196,98,125,24,5,228,84,0,0          ; vbroadcastss  0x54e4(%rip),%ymm8        # 58a8 <_sk_callback_hsw+0x160>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,93,184,192                  ; vfmadd231ps   %ymm8,%ymm4,%ymm0
   DB  196,194,85,184,200                  ; vfmadd231ps   %ymm8,%ymm5,%ymm1
@@ -280,7 +298,7 @@
 
 PUBLIC _sk_dstover_hsw
 _sk_dstover_hsw LABEL PROC
-  DB  196,98,125,24,5,185,84,0,0          ; vbroadcastss  0x54b9(%rip),%ymm8        # 5870 <_sk_callback_hsw+0x15c>
+  DB  196,98,125,24,5,195,84,0,0          ; vbroadcastss  0x54c3(%rip),%ymm8        # 58ac <_sk_callback_hsw+0x164>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  196,226,61,168,196                  ; vfmadd213ps   %ymm4,%ymm8,%ymm0
   DB  196,226,61,168,205                  ; vfmadd213ps   %ymm5,%ymm8,%ymm1
@@ -300,7 +318,7 @@
 
 PUBLIC _sk_multiply_hsw
 _sk_multiply_hsw LABEL PROC
-  DB  196,98,125,24,5,132,84,0,0          ; vbroadcastss  0x5484(%rip),%ymm8        # 5874 <_sk_callback_hsw+0x160>
+  DB  196,98,125,24,5,142,84,0,0          ; vbroadcastss  0x548e(%rip),%ymm8        # 58b0 <_sk_callback_hsw+0x168>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,52,89,208                       ; vmulps        %ymm0,%ymm9,%ymm10
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -342,7 +360,7 @@
 
 PUBLIC _sk_xor__hsw
 _sk_xor__hsw LABEL PROC
-  DB  196,98,125,24,5,255,83,0,0          ; vbroadcastss  0x53ff(%rip),%ymm8        # 5878 <_sk_callback_hsw+0x164>
+  DB  196,98,125,24,5,9,84,0,0            ; vbroadcastss  0x5409(%rip),%ymm8        # 58b4 <_sk_callback_hsw+0x16c>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,180,89,192                      ; vmulps        %ymm0,%ymm9,%ymm0
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -374,7 +392,7 @@
   DB  197,100,89,206                      ; vmulps        %ymm6,%ymm3,%ymm9
   DB  196,193,108,95,209                  ; vmaxps        %ymm9,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,135,83,0,0          ; vbroadcastss  0x5387(%rip),%ymm8        # 587c <_sk_callback_hsw+0x168>
+  DB  196,98,125,24,5,145,83,0,0          ; vbroadcastss  0x5391(%rip),%ymm8        # 58b8 <_sk_callback_hsw+0x170>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,69,184,216                  ; vfmadd231ps   %ymm8,%ymm7,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -397,7 +415,7 @@
   DB  197,100,89,206                      ; vmulps        %ymm6,%ymm3,%ymm9
   DB  196,193,108,93,209                  ; vminps        %ymm9,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,54,83,0,0           ; vbroadcastss  0x5336(%rip),%ymm8        # 5880 <_sk_callback_hsw+0x16c>
+  DB  196,98,125,24,5,64,83,0,0           ; vbroadcastss  0x5340(%rip),%ymm8        # 58bc <_sk_callback_hsw+0x174>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,69,184,216                  ; vfmadd231ps   %ymm8,%ymm7,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -423,7 +441,7 @@
   DB  196,193,108,93,209                  ; vminps        %ymm9,%ymm2,%ymm2
   DB  197,236,88,210                      ; vaddps        %ymm2,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,217,82,0,0          ; vbroadcastss  0x52d9(%rip),%ymm8        # 5884 <_sk_callback_hsw+0x170>
+  DB  196,98,125,24,5,227,82,0,0          ; vbroadcastss  0x52e3(%rip),%ymm8        # 58c0 <_sk_callback_hsw+0x178>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,69,184,216                  ; vfmadd231ps   %ymm8,%ymm7,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -443,7 +461,7 @@
   DB  197,236,89,214                      ; vmulps        %ymm6,%ymm2,%ymm2
   DB  197,236,88,210                      ; vaddps        %ymm2,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,151,82,0,0          ; vbroadcastss  0x5297(%rip),%ymm8        # 5888 <_sk_callback_hsw+0x174>
+  DB  196,98,125,24,5,161,82,0,0          ; vbroadcastss  0x52a1(%rip),%ymm8        # 58c4 <_sk_callback_hsw+0x17c>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  196,194,69,184,216                  ; vfmadd231ps   %ymm8,%ymm7,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -451,7 +469,7 @@
 
 PUBLIC _sk_colorburn_hsw
 _sk_colorburn_hsw LABEL PROC
-  DB  196,98,125,24,5,133,82,0,0          ; vbroadcastss  0x5285(%rip),%ymm8        # 588c <_sk_callback_hsw+0x178>
+  DB  196,98,125,24,5,143,82,0,0          ; vbroadcastss  0x528f(%rip),%ymm8        # 58c8 <_sk_callback_hsw+0x180>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,52,89,216                       ; vmulps        %ymm0,%ymm9,%ymm11
   DB  196,65,44,87,210                    ; vxorps        %ymm10,%ymm10,%ymm10
@@ -507,7 +525,7 @@
 PUBLIC _sk_colordodge_hsw
 _sk_colordodge_hsw LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
-  DB  196,98,125,24,13,144,81,0,0         ; vbroadcastss  0x5190(%rip),%ymm9        # 5890 <_sk_callback_hsw+0x17c>
+  DB  196,98,125,24,13,154,81,0,0         ; vbroadcastss  0x519a(%rip),%ymm9        # 58cc <_sk_callback_hsw+0x184>
   DB  197,52,92,215                       ; vsubps        %ymm7,%ymm9,%ymm10
   DB  197,44,89,216                       ; vmulps        %ymm0,%ymm10,%ymm11
   DB  197,52,92,203                       ; vsubps        %ymm3,%ymm9,%ymm9
@@ -558,7 +576,7 @@
 
 PUBLIC _sk_hardlight_hsw
 _sk_hardlight_hsw LABEL PROC
-  DB  196,98,125,24,5,177,80,0,0          ; vbroadcastss  0x50b1(%rip),%ymm8        # 5894 <_sk_callback_hsw+0x180>
+  DB  196,98,125,24,5,187,80,0,0          ; vbroadcastss  0x50bb(%rip),%ymm8        # 58d0 <_sk_callback_hsw+0x188>
   DB  197,60,92,215                       ; vsubps        %ymm7,%ymm8,%ymm10
   DB  197,44,89,216                       ; vmulps        %ymm0,%ymm10,%ymm11
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -607,7 +625,7 @@
 
 PUBLIC _sk_overlay_hsw
 _sk_overlay_hsw LABEL PROC
-  DB  196,98,125,24,5,233,79,0,0          ; vbroadcastss  0x4fe9(%rip),%ymm8        # 5898 <_sk_callback_hsw+0x184>
+  DB  196,98,125,24,5,243,79,0,0          ; vbroadcastss  0x4ff3(%rip),%ymm8        # 58d4 <_sk_callback_hsw+0x18c>
   DB  197,60,92,215                       ; vsubps        %ymm7,%ymm8,%ymm10
   DB  197,44,89,216                       ; vmulps        %ymm0,%ymm10,%ymm11
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -667,10 +685,10 @@
   DB  196,65,20,88,197                    ; vaddps        %ymm13,%ymm13,%ymm8
   DB  196,65,60,88,192                    ; vaddps        %ymm8,%ymm8,%ymm8
   DB  196,66,61,168,192                   ; vfmadd213ps   %ymm8,%ymm8,%ymm8
-  DB  196,98,125,24,29,240,78,0,0         ; vbroadcastss  0x4ef0(%rip),%ymm11        # 58a0 <_sk_callback_hsw+0x18c>
+  DB  196,98,125,24,29,250,78,0,0         ; vbroadcastss  0x4efa(%rip),%ymm11        # 58dc <_sk_callback_hsw+0x194>
   DB  196,65,20,88,227                    ; vaddps        %ymm11,%ymm13,%ymm12
   DB  196,65,28,89,192                    ; vmulps        %ymm8,%ymm12,%ymm8
-  DB  196,98,125,24,37,225,78,0,0         ; vbroadcastss  0x4ee1(%rip),%ymm12        # 58a4 <_sk_callback_hsw+0x190>
+  DB  196,98,125,24,37,235,78,0,0         ; vbroadcastss  0x4eeb(%rip),%ymm12        # 58e0 <_sk_callback_hsw+0x198>
   DB  196,66,21,184,196                   ; vfmadd231ps   %ymm12,%ymm13,%ymm8
   DB  196,65,124,82,245                   ; vrsqrtps      %ymm13,%ymm14
   DB  196,65,124,83,246                   ; vrcpps        %ymm14,%ymm14
@@ -680,7 +698,7 @@
   DB  197,4,194,255,2                     ; vcmpleps      %ymm7,%ymm15,%ymm15
   DB  196,67,13,74,240,240                ; vblendvps     %ymm15,%ymm8,%ymm14,%ymm14
   DB  197,116,88,249                      ; vaddps        %ymm1,%ymm1,%ymm15
-  DB  196,98,125,24,5,164,78,0,0          ; vbroadcastss  0x4ea4(%rip),%ymm8        # 589c <_sk_callback_hsw+0x188>
+  DB  196,98,125,24,5,174,78,0,0          ; vbroadcastss  0x4eae(%rip),%ymm8        # 58d8 <_sk_callback_hsw+0x190>
   DB  196,65,60,92,237                    ; vsubps        %ymm13,%ymm8,%ymm13
   DB  197,132,92,195                      ; vsubps        %ymm3,%ymm15,%ymm0
   DB  196,98,125,168,235                  ; vfmadd213ps   %ymm3,%ymm0,%ymm13
@@ -793,11 +811,11 @@
   DB  196,65,28,89,210                    ; vmulps        %ymm10,%ymm12,%ymm10
   DB  196,65,44,94,214                    ; vdivps        %ymm14,%ymm10,%ymm10
   DB  196,67,45,74,224,240                ; vblendvps     %ymm15,%ymm8,%ymm10,%ymm12
-  DB  196,98,125,24,53,163,76,0,0         ; vbroadcastss  0x4ca3(%rip),%ymm14        # 58a8 <_sk_callback_hsw+0x194>
-  DB  196,98,125,24,61,158,76,0,0         ; vbroadcastss  0x4c9e(%rip),%ymm15        # 58ac <_sk_callback_hsw+0x198>
+  DB  196,98,125,24,53,173,76,0,0         ; vbroadcastss  0x4cad(%rip),%ymm14        # 58e4 <_sk_callback_hsw+0x19c>
+  DB  196,98,125,24,61,168,76,0,0         ; vbroadcastss  0x4ca8(%rip),%ymm15        # 58e8 <_sk_callback_hsw+0x1a0>
   DB  196,65,84,89,239                    ; vmulps        %ymm15,%ymm5,%ymm13
   DB  196,66,93,184,238                   ; vfmadd231ps   %ymm14,%ymm4,%ymm13
-  DB  196,226,125,24,5,143,76,0,0         ; vbroadcastss  0x4c8f(%rip),%ymm0        # 58b0 <_sk_callback_hsw+0x19c>
+  DB  196,226,125,24,5,153,76,0,0         ; vbroadcastss  0x4c99(%rip),%ymm0        # 58ec <_sk_callback_hsw+0x1a4>
   DB  196,98,77,184,232                   ; vfmadd231ps   %ymm0,%ymm6,%ymm13
   DB  196,65,116,89,215                   ; vmulps        %ymm15,%ymm1,%ymm10
   DB  196,66,53,184,214                   ; vfmadd231ps   %ymm14,%ymm9,%ymm10
@@ -852,7 +870,7 @@
   DB  196,193,124,95,192                  ; vmaxps        %ymm8,%ymm0,%ymm0
   DB  196,65,36,95,200                    ; vmaxps        %ymm8,%ymm11,%ymm9
   DB  196,65,116,95,192                   ; vmaxps        %ymm8,%ymm1,%ymm8
-  DB  196,226,125,24,13,124,75,0,0        ; vbroadcastss  0x4b7c(%rip),%ymm1        # 58b4 <_sk_callback_hsw+0x1a0>
+  DB  196,226,125,24,13,134,75,0,0        ; vbroadcastss  0x4b86(%rip),%ymm1        # 58f0 <_sk_callback_hsw+0x1a8>
   DB  197,116,92,215                      ; vsubps        %ymm7,%ymm1,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,116,92,219                      ; vsubps        %ymm3,%ymm1,%ymm11
@@ -906,11 +924,11 @@
   DB  196,65,28,89,210                    ; vmulps        %ymm10,%ymm12,%ymm10
   DB  196,65,44,94,214                    ; vdivps        %ymm14,%ymm10,%ymm10
   DB  196,67,45,74,224,240                ; vblendvps     %ymm15,%ymm8,%ymm10,%ymm12
-  DB  196,98,125,24,53,141,74,0,0         ; vbroadcastss  0x4a8d(%rip),%ymm14        # 58b8 <_sk_callback_hsw+0x1a4>
-  DB  196,98,125,24,61,136,74,0,0         ; vbroadcastss  0x4a88(%rip),%ymm15        # 58bc <_sk_callback_hsw+0x1a8>
+  DB  196,98,125,24,53,151,74,0,0         ; vbroadcastss  0x4a97(%rip),%ymm14        # 58f4 <_sk_callback_hsw+0x1ac>
+  DB  196,98,125,24,61,146,74,0,0         ; vbroadcastss  0x4a92(%rip),%ymm15        # 58f8 <_sk_callback_hsw+0x1b0>
   DB  196,65,84,89,239                    ; vmulps        %ymm15,%ymm5,%ymm13
   DB  196,66,93,184,238                   ; vfmadd231ps   %ymm14,%ymm4,%ymm13
-  DB  196,226,125,24,5,121,74,0,0         ; vbroadcastss  0x4a79(%rip),%ymm0        # 58c0 <_sk_callback_hsw+0x1ac>
+  DB  196,226,125,24,5,131,74,0,0         ; vbroadcastss  0x4a83(%rip),%ymm0        # 58fc <_sk_callback_hsw+0x1b4>
   DB  196,98,77,184,232                   ; vfmadd231ps   %ymm0,%ymm6,%ymm13
   DB  196,65,116,89,215                   ; vmulps        %ymm15,%ymm1,%ymm10
   DB  196,66,53,184,214                   ; vfmadd231ps   %ymm14,%ymm9,%ymm10
@@ -965,7 +983,7 @@
   DB  196,193,124,95,192                  ; vmaxps        %ymm8,%ymm0,%ymm0
   DB  196,65,36,95,200                    ; vmaxps        %ymm8,%ymm11,%ymm9
   DB  196,65,116,95,192                   ; vmaxps        %ymm8,%ymm1,%ymm8
-  DB  196,226,125,24,13,102,73,0,0        ; vbroadcastss  0x4966(%rip),%ymm1        # 58c4 <_sk_callback_hsw+0x1b0>
+  DB  196,226,125,24,13,112,73,0,0        ; vbroadcastss  0x4970(%rip),%ymm1        # 5900 <_sk_callback_hsw+0x1b8>
   DB  197,116,92,215                      ; vsubps        %ymm7,%ymm1,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,116,92,219                      ; vsubps        %ymm3,%ymm1,%ymm11
@@ -993,11 +1011,11 @@
   DB  197,108,89,199                      ; vmulps        %ymm7,%ymm2,%ymm8
   DB  197,116,89,215                      ; vmulps        %ymm7,%ymm1,%ymm10
   DB  197,52,89,223                       ; vmulps        %ymm7,%ymm9,%ymm11
-  DB  196,98,125,24,45,249,72,0,0         ; vbroadcastss  0x48f9(%rip),%ymm13        # 58c8 <_sk_callback_hsw+0x1b4>
-  DB  196,98,125,24,53,244,72,0,0         ; vbroadcastss  0x48f4(%rip),%ymm14        # 58cc <_sk_callback_hsw+0x1b8>
+  DB  196,98,125,24,45,3,73,0,0           ; vbroadcastss  0x4903(%rip),%ymm13        # 5904 <_sk_callback_hsw+0x1bc>
+  DB  196,98,125,24,53,254,72,0,0         ; vbroadcastss  0x48fe(%rip),%ymm14        # 5908 <_sk_callback_hsw+0x1c0>
   DB  196,65,84,89,230                    ; vmulps        %ymm14,%ymm5,%ymm12
   DB  196,66,93,184,229                   ; vfmadd231ps   %ymm13,%ymm4,%ymm12
-  DB  196,98,125,24,61,229,72,0,0         ; vbroadcastss  0x48e5(%rip),%ymm15        # 58d0 <_sk_callback_hsw+0x1bc>
+  DB  196,98,125,24,61,239,72,0,0         ; vbroadcastss  0x48ef(%rip),%ymm15        # 590c <_sk_callback_hsw+0x1c4>
   DB  196,66,77,184,231                   ; vfmadd231ps   %ymm15,%ymm6,%ymm12
   DB  196,65,44,89,206                    ; vmulps        %ymm14,%ymm10,%ymm9
   DB  196,66,61,184,205                   ; vfmadd231ps   %ymm13,%ymm8,%ymm9
@@ -1053,7 +1071,7 @@
   DB  196,193,116,95,206                  ; vmaxps        %ymm14,%ymm1,%ymm1
   DB  196,65,44,95,198                    ; vmaxps        %ymm14,%ymm10,%ymm8
   DB  196,65,124,95,206                   ; vmaxps        %ymm14,%ymm0,%ymm9
-  DB  196,226,125,24,5,199,71,0,0         ; vbroadcastss  0x47c7(%rip),%ymm0        # 58d4 <_sk_callback_hsw+0x1c0>
+  DB  196,226,125,24,5,209,71,0,0         ; vbroadcastss  0x47d1(%rip),%ymm0        # 5910 <_sk_callback_hsw+0x1c8>
   DB  197,124,92,215                      ; vsubps        %ymm7,%ymm0,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,124,92,219                      ; vsubps        %ymm3,%ymm0,%ymm11
@@ -1081,11 +1099,11 @@
   DB  197,100,89,196                      ; vmulps        %ymm4,%ymm3,%ymm8
   DB  197,100,89,213                      ; vmulps        %ymm5,%ymm3,%ymm10
   DB  197,100,89,222                      ; vmulps        %ymm6,%ymm3,%ymm11
-  DB  196,98,125,24,45,90,71,0,0          ; vbroadcastss  0x475a(%rip),%ymm13        # 58d8 <_sk_callback_hsw+0x1c4>
-  DB  196,98,125,24,53,85,71,0,0          ; vbroadcastss  0x4755(%rip),%ymm14        # 58dc <_sk_callback_hsw+0x1c8>
+  DB  196,98,125,24,45,100,71,0,0         ; vbroadcastss  0x4764(%rip),%ymm13        # 5914 <_sk_callback_hsw+0x1cc>
+  DB  196,98,125,24,53,95,71,0,0          ; vbroadcastss  0x475f(%rip),%ymm14        # 5918 <_sk_callback_hsw+0x1d0>
   DB  196,65,116,89,230                   ; vmulps        %ymm14,%ymm1,%ymm12
   DB  196,66,109,184,229                  ; vfmadd231ps   %ymm13,%ymm2,%ymm12
-  DB  196,98,125,24,61,70,71,0,0          ; vbroadcastss  0x4746(%rip),%ymm15        # 58e0 <_sk_callback_hsw+0x1cc>
+  DB  196,98,125,24,61,80,71,0,0          ; vbroadcastss  0x4750(%rip),%ymm15        # 591c <_sk_callback_hsw+0x1d4>
   DB  196,66,53,184,231                   ; vfmadd231ps   %ymm15,%ymm9,%ymm12
   DB  196,65,44,89,206                    ; vmulps        %ymm14,%ymm10,%ymm9
   DB  196,66,61,184,205                   ; vfmadd231ps   %ymm13,%ymm8,%ymm9
@@ -1141,7 +1159,7 @@
   DB  196,193,116,95,206                  ; vmaxps        %ymm14,%ymm1,%ymm1
   DB  196,65,44,95,198                    ; vmaxps        %ymm14,%ymm10,%ymm8
   DB  196,65,124,95,206                   ; vmaxps        %ymm14,%ymm0,%ymm9
-  DB  196,226,125,24,5,40,70,0,0          ; vbroadcastss  0x4628(%rip),%ymm0        # 58e4 <_sk_callback_hsw+0x1d0>
+  DB  196,226,125,24,5,50,70,0,0          ; vbroadcastss  0x4632(%rip),%ymm0        # 5920 <_sk_callback_hsw+0x1d8>
   DB  197,124,92,215                      ; vsubps        %ymm7,%ymm0,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,124,92,219                      ; vsubps        %ymm3,%ymm0,%ymm11
@@ -1166,19 +1184,19 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,180,0,0,0                    ; jne           13ce <_sk_srcover_rgba_8888_hsw+0xcd>
+  DB  15,133,180,0,0,0                    ; jne           1400 <_sk_srcover_rgba_8888_hsw+0xcd>
   DB  196,193,124,16,58                   ; vmovups       (%r10),%ymm7
-  DB  197,196,84,37,217,73,0,0            ; vandps        0x49d9(%rip),%ymm7,%ymm4        # 5d00 <_sk_callback_hsw+0x5ec>
+  DB  197,196,84,37,231,73,0,0            ; vandps        0x49e7(%rip),%ymm7,%ymm4        # 5d40 <_sk_callback_hsw+0x5f8>
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,69,0,45,236,73,0,0          ; vpshufb       0x49ec(%rip),%ymm7,%ymm5        # 5d20 <_sk_callback_hsw+0x60c>
+  DB  196,226,69,0,45,250,73,0,0          ; vpshufb       0x49fa(%rip),%ymm7,%ymm5        # 5d60 <_sk_callback_hsw+0x618>
   DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
-  DB  196,226,69,0,53,255,73,0,0          ; vpshufb       0x49ff(%rip),%ymm7,%ymm6        # 5d40 <_sk_callback_hsw+0x62c>
+  DB  196,226,69,0,53,13,74,0,0           ; vpshufb       0x4a0d(%rip),%ymm7,%ymm6        # 5d80 <_sk_callback_hsw+0x638>
   DB  197,252,91,246                      ; vcvtdq2ps     %ymm6,%ymm6
   DB  197,197,114,215,24                  ; vpsrld        $0x18,%ymm7,%ymm7
   DB  197,252,91,255                      ; vcvtdq2ps     %ymm7,%ymm7
-  DB  196,98,125,24,5,145,69,0,0          ; vbroadcastss  0x4591(%rip),%ymm8        # 58e8 <_sk_callback_hsw+0x1d4>
+  DB  196,98,125,24,5,155,69,0,0          ; vbroadcastss  0x459b(%rip),%ymm8        # 5924 <_sk_callback_hsw+0x1dc>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
-  DB  196,98,125,24,13,136,69,0,0         ; vbroadcastss  0x4588(%rip),%ymm9        # 58ec <_sk_callback_hsw+0x1d8>
+  DB  196,98,125,24,13,146,69,0,0         ; vbroadcastss  0x4592(%rip),%ymm9        # 5928 <_sk_callback_hsw+0x1e0>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  196,194,93,184,192                  ; vfmadd231ps   %ymm8,%ymm4,%ymm0
   DB  196,193,116,89,201                  ; vmulps        %ymm9,%ymm1,%ymm1
@@ -1198,7 +1216,7 @@
   DB  196,65,53,235,202                   ; vpor          %ymm10,%ymm9,%ymm9
   DB  196,65,61,235,193                   ; vpor          %ymm9,%ymm8,%ymm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,53                              ; jne           13f7 <_sk_srcover_rgba_8888_hsw+0xf6>
+  DB  117,53                              ; jne           1429 <_sk_srcover_rgba_8888_hsw+0xf6>
   DB  196,65,124,17,2                     ; vmovups       %ymm8,(%r10)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,201                          ; mov           %r9,%rcx
@@ -1211,7 +1229,7 @@
   DB  196,225,249,110,224                 ; vmovq         %rax,%xmm4
   DB  196,226,125,33,228                  ; vpmovsxbd     %xmm4,%ymm4
   DB  196,194,93,44,58                    ; vmaskmovps    (%r10),%ymm4,%ymm7
-  DB  233,40,255,255,255                  ; jmpq          131f <_sk_srcover_rgba_8888_hsw+0x1e>
+  DB  233,40,255,255,255                  ; jmpq          1351 <_sk_srcover_rgba_8888_hsw+0x1e>
   DB  185,8,0,0,0                         ; mov           $0x8,%ecx
   DB  68,41,193                           ; sub           %r8d,%ecx
   DB  192,225,3                           ; shl           $0x3,%cl
@@ -1220,7 +1238,7 @@
   DB  196,97,249,110,200                  ; vmovq         %rax,%xmm9
   DB  196,66,125,33,201                   ; vpmovsxbd     %xmm9,%ymm9
   DB  196,66,53,46,2                      ; vmaskmovps    %ymm8,%ymm9,(%r10)
-  DB  235,170                             ; jmp           13c7 <_sk_srcover_rgba_8888_hsw+0xc6>
+  DB  235,170                             ; jmp           13f9 <_sk_srcover_rgba_8888_hsw+0xc6>
 
 PUBLIC _sk_clamp_0_hsw
 _sk_clamp_0_hsw LABEL PROC
@@ -1234,7 +1252,7 @@
 
 PUBLIC _sk_clamp_1_hsw
 _sk_clamp_1_hsw LABEL PROC
-  DB  196,98,125,24,5,173,68,0,0          ; vbroadcastss  0x44ad(%rip),%ymm8        # 58f0 <_sk_callback_hsw+0x1dc>
+  DB  196,98,125,24,5,183,68,0,0          ; vbroadcastss  0x44b7(%rip),%ymm8        # 592c <_sk_callback_hsw+0x1e4>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  196,193,116,93,200                  ; vminps        %ymm8,%ymm1,%ymm1
   DB  196,193,108,93,208                  ; vminps        %ymm8,%ymm2,%ymm2
@@ -1244,7 +1262,7 @@
 
 PUBLIC _sk_clamp_a_hsw
 _sk_clamp_a_hsw LABEL PROC
-  DB  196,98,125,24,5,144,68,0,0          ; vbroadcastss  0x4490(%rip),%ymm8        # 58f4 <_sk_callback_hsw+0x1e0>
+  DB  196,98,125,24,5,154,68,0,0          ; vbroadcastss  0x449a(%rip),%ymm8        # 5930 <_sk_callback_hsw+0x1e8>
   DB  196,193,100,93,216                  ; vminps        %ymm8,%ymm3,%ymm3
   DB  197,252,93,195                      ; vminps        %ymm3,%ymm0,%ymm0
   DB  197,244,93,203                      ; vminps        %ymm3,%ymm1,%ymm1
@@ -1254,7 +1272,7 @@
 
 PUBLIC _sk_clamp_a_dst_hsw
 _sk_clamp_a_dst_hsw LABEL PROC
-  DB  196,98,125,24,5,118,68,0,0          ; vbroadcastss  0x4476(%rip),%ymm8        # 58f8 <_sk_callback_hsw+0x1e4>
+  DB  196,98,125,24,5,128,68,0,0          ; vbroadcastss  0x4480(%rip),%ymm8        # 5934 <_sk_callback_hsw+0x1ec>
   DB  196,193,68,93,248                   ; vminps        %ymm8,%ymm7,%ymm7
   DB  197,220,93,231                      ; vminps        %ymm7,%ymm4,%ymm4
   DB  197,212,93,239                      ; vminps        %ymm7,%ymm5,%ymm5
@@ -1309,7 +1327,7 @@
 _sk_unpremul_hsw LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,65,100,194,200,0                ; vcmpeqps      %ymm8,%ymm3,%ymm9
-  DB  196,98,125,24,21,242,67,0,0         ; vbroadcastss  0x43f2(%rip),%ymm10        # 58fc <_sk_callback_hsw+0x1e8>
+  DB  196,98,125,24,21,252,67,0,0         ; vbroadcastss  0x43fc(%rip),%ymm10        # 5938 <_sk_callback_hsw+0x1f0>
   DB  197,44,94,211                       ; vdivps        %ymm3,%ymm10,%ymm10
   DB  196,67,45,74,192,144                ; vblendvps     %ymm9,%ymm8,%ymm10,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
@@ -1320,16 +1338,16 @@
 
 PUBLIC _sk_from_srgb_hsw
 _sk_from_srgb_hsw LABEL PROC
-  DB  196,98,125,24,5,211,67,0,0          ; vbroadcastss  0x43d3(%rip),%ymm8        # 5900 <_sk_callback_hsw+0x1ec>
+  DB  196,98,125,24,5,221,67,0,0          ; vbroadcastss  0x43dd(%rip),%ymm8        # 593c <_sk_callback_hsw+0x1f4>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  197,124,89,208                      ; vmulps        %ymm0,%ymm0,%ymm10
-  DB  196,98,125,24,29,197,67,0,0         ; vbroadcastss  0x43c5(%rip),%ymm11        # 5904 <_sk_callback_hsw+0x1f0>
-  DB  196,98,125,24,37,192,67,0,0         ; vbroadcastss  0x43c0(%rip),%ymm12        # 5908 <_sk_callback_hsw+0x1f4>
+  DB  196,98,125,24,29,207,67,0,0         ; vbroadcastss  0x43cf(%rip),%ymm11        # 5940 <_sk_callback_hsw+0x1f8>
+  DB  196,98,125,24,37,202,67,0,0         ; vbroadcastss  0x43ca(%rip),%ymm12        # 5944 <_sk_callback_hsw+0x1fc>
   DB  196,65,124,40,236                   ; vmovaps       %ymm12,%ymm13
   DB  196,66,125,168,235                  ; vfmadd213ps   %ymm11,%ymm0,%ymm13
-  DB  196,98,125,24,53,177,67,0,0         ; vbroadcastss  0x43b1(%rip),%ymm14        # 590c <_sk_callback_hsw+0x1f8>
+  DB  196,98,125,24,53,187,67,0,0         ; vbroadcastss  0x43bb(%rip),%ymm14        # 5948 <_sk_callback_hsw+0x200>
   DB  196,66,45,168,238                   ; vfmadd213ps   %ymm14,%ymm10,%ymm13
-  DB  196,98,125,24,21,167,67,0,0         ; vbroadcastss  0x43a7(%rip),%ymm10        # 5910 <_sk_callback_hsw+0x1fc>
+  DB  196,98,125,24,21,177,67,0,0         ; vbroadcastss  0x43b1(%rip),%ymm10        # 594c <_sk_callback_hsw+0x204>
   DB  196,193,124,194,194,1               ; vcmpltps      %ymm10,%ymm0,%ymm0
   DB  196,195,21,74,193,0                 ; vblendvps     %ymm0,%ymm9,%ymm13,%ymm0
   DB  196,65,116,89,200                   ; vmulps        %ymm8,%ymm1,%ymm9
@@ -1350,16 +1368,16 @@
 
 PUBLIC _sk_from_srgb_dst_hsw
 _sk_from_srgb_dst_hsw LABEL PROC
-  DB  196,98,125,24,5,79,67,0,0           ; vbroadcastss  0x434f(%rip),%ymm8        # 5914 <_sk_callback_hsw+0x200>
+  DB  196,98,125,24,5,89,67,0,0           ; vbroadcastss  0x4359(%rip),%ymm8        # 5950 <_sk_callback_hsw+0x208>
   DB  196,65,92,89,200                    ; vmulps        %ymm8,%ymm4,%ymm9
   DB  197,92,89,212                       ; vmulps        %ymm4,%ymm4,%ymm10
-  DB  196,98,125,24,29,65,67,0,0          ; vbroadcastss  0x4341(%rip),%ymm11        # 5918 <_sk_callback_hsw+0x204>
-  DB  196,98,125,24,37,60,67,0,0          ; vbroadcastss  0x433c(%rip),%ymm12        # 591c <_sk_callback_hsw+0x208>
+  DB  196,98,125,24,29,75,67,0,0          ; vbroadcastss  0x434b(%rip),%ymm11        # 5954 <_sk_callback_hsw+0x20c>
+  DB  196,98,125,24,37,70,67,0,0          ; vbroadcastss  0x4346(%rip),%ymm12        # 5958 <_sk_callback_hsw+0x210>
   DB  196,65,124,40,236                   ; vmovaps       %ymm12,%ymm13
   DB  196,66,93,168,235                   ; vfmadd213ps   %ymm11,%ymm4,%ymm13
-  DB  196,98,125,24,53,45,67,0,0          ; vbroadcastss  0x432d(%rip),%ymm14        # 5920 <_sk_callback_hsw+0x20c>
+  DB  196,98,125,24,53,55,67,0,0          ; vbroadcastss  0x4337(%rip),%ymm14        # 595c <_sk_callback_hsw+0x214>
   DB  196,66,45,168,238                   ; vfmadd213ps   %ymm14,%ymm10,%ymm13
-  DB  196,98,125,24,21,35,67,0,0          ; vbroadcastss  0x4323(%rip),%ymm10        # 5924 <_sk_callback_hsw+0x210>
+  DB  196,98,125,24,21,45,67,0,0          ; vbroadcastss  0x432d(%rip),%ymm10        # 5960 <_sk_callback_hsw+0x218>
   DB  196,193,92,194,226,1                ; vcmpltps      %ymm10,%ymm4,%ymm4
   DB  196,195,21,74,225,64                ; vblendvps     %ymm4,%ymm9,%ymm13,%ymm4
   DB  196,65,84,89,200                    ; vmulps        %ymm8,%ymm5,%ymm9
@@ -1381,19 +1399,19 @@
 PUBLIC _sk_to_srgb_hsw
 _sk_to_srgb_hsw LABEL PROC
   DB  197,124,82,200                      ; vrsqrtps      %ymm0,%ymm9
-  DB  196,98,125,24,5,199,66,0,0          ; vbroadcastss  0x42c7(%rip),%ymm8        # 5928 <_sk_callback_hsw+0x214>
+  DB  196,98,125,24,5,209,66,0,0          ; vbroadcastss  0x42d1(%rip),%ymm8        # 5964 <_sk_callback_hsw+0x21c>
   DB  196,65,124,89,208                   ; vmulps        %ymm8,%ymm0,%ymm10
-  DB  196,98,125,24,29,189,66,0,0         ; vbroadcastss  0x42bd(%rip),%ymm11        # 592c <_sk_callback_hsw+0x218>
-  DB  196,98,125,24,37,184,66,0,0         ; vbroadcastss  0x42b8(%rip),%ymm12        # 5930 <_sk_callback_hsw+0x21c>
+  DB  196,98,125,24,29,199,66,0,0         ; vbroadcastss  0x42c7(%rip),%ymm11        # 5968 <_sk_callback_hsw+0x220>
+  DB  196,98,125,24,37,194,66,0,0         ; vbroadcastss  0x42c2(%rip),%ymm12        # 596c <_sk_callback_hsw+0x224>
   DB  196,65,124,40,236                   ; vmovaps       %ymm12,%ymm13
   DB  196,66,53,168,235                   ; vfmadd213ps   %ymm11,%ymm9,%ymm13
-  DB  196,98,125,24,53,169,66,0,0         ; vbroadcastss  0x42a9(%rip),%ymm14        # 5934 <_sk_callback_hsw+0x220>
+  DB  196,98,125,24,53,179,66,0,0         ; vbroadcastss  0x42b3(%rip),%ymm14        # 5970 <_sk_callback_hsw+0x228>
   DB  196,66,53,168,238                   ; vfmadd213ps   %ymm14,%ymm9,%ymm13
-  DB  196,98,125,24,61,159,66,0,0         ; vbroadcastss  0x429f(%rip),%ymm15        # 5938 <_sk_callback_hsw+0x224>
+  DB  196,98,125,24,61,169,66,0,0         ; vbroadcastss  0x42a9(%rip),%ymm15        # 5974 <_sk_callback_hsw+0x22c>
   DB  196,65,52,88,207                    ; vaddps        %ymm15,%ymm9,%ymm9
   DB  196,65,124,83,201                   ; vrcpps        %ymm9,%ymm9
   DB  196,65,20,89,201                    ; vmulps        %ymm9,%ymm13,%ymm9
-  DB  196,98,125,24,45,139,66,0,0         ; vbroadcastss  0x428b(%rip),%ymm13        # 593c <_sk_callback_hsw+0x228>
+  DB  196,98,125,24,45,149,66,0,0         ; vbroadcastss  0x4295(%rip),%ymm13        # 5978 <_sk_callback_hsw+0x230>
   DB  196,193,124,194,197,1               ; vcmpltps      %ymm13,%ymm0,%ymm0
   DB  196,195,53,74,194,0                 ; vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   DB  197,124,82,201                      ; vrsqrtps      %ymm1,%ymm9
@@ -1425,26 +1443,26 @@
   DB  197,124,93,201                      ; vminps        %ymm1,%ymm0,%ymm9
   DB  197,52,93,202                       ; vminps        %ymm2,%ymm9,%ymm9
   DB  196,65,60,92,209                    ; vsubps        %ymm9,%ymm8,%ymm10
-  DB  196,98,125,24,29,0,66,0,0           ; vbroadcastss  0x4200(%rip),%ymm11        # 5940 <_sk_callback_hsw+0x22c>
+  DB  196,98,125,24,29,10,66,0,0          ; vbroadcastss  0x420a(%rip),%ymm11        # 597c <_sk_callback_hsw+0x234>
   DB  196,65,36,94,218                    ; vdivps        %ymm10,%ymm11,%ymm11
   DB  197,116,92,226                      ; vsubps        %ymm2,%ymm1,%ymm12
   DB  197,116,194,234,1                   ; vcmpltps      %ymm2,%ymm1,%ymm13
-  DB  196,98,125,24,53,237,65,0,0         ; vbroadcastss  0x41ed(%rip),%ymm14        # 5944 <_sk_callback_hsw+0x230>
+  DB  196,98,125,24,53,247,65,0,0         ; vbroadcastss  0x41f7(%rip),%ymm14        # 5980 <_sk_callback_hsw+0x238>
   DB  196,65,4,87,255                     ; vxorps        %ymm15,%ymm15,%ymm15
   DB  196,67,5,74,238,208                 ; vblendvps     %ymm13,%ymm14,%ymm15,%ymm13
   DB  196,66,37,168,229                   ; vfmadd213ps   %ymm13,%ymm11,%ymm12
   DB  197,236,92,208                      ; vsubps        %ymm0,%ymm2,%ymm2
   DB  197,124,92,233                      ; vsubps        %ymm1,%ymm0,%ymm13
-  DB  196,98,125,24,53,212,65,0,0         ; vbroadcastss  0x41d4(%rip),%ymm14        # 594c <_sk_callback_hsw+0x238>
+  DB  196,98,125,24,53,222,65,0,0         ; vbroadcastss  0x41de(%rip),%ymm14        # 5988 <_sk_callback_hsw+0x240>
   DB  196,66,37,168,238                   ; vfmadd213ps   %ymm14,%ymm11,%ymm13
-  DB  196,98,125,24,53,194,65,0,0         ; vbroadcastss  0x41c2(%rip),%ymm14        # 5948 <_sk_callback_hsw+0x234>
+  DB  196,98,125,24,53,204,65,0,0         ; vbroadcastss  0x41cc(%rip),%ymm14        # 5984 <_sk_callback_hsw+0x23c>
   DB  196,194,37,168,214                  ; vfmadd213ps   %ymm14,%ymm11,%ymm2
   DB  197,188,194,201,0                   ; vcmpeqps      %ymm1,%ymm8,%ymm1
   DB  196,227,21,74,202,16                ; vblendvps     %ymm1,%ymm2,%ymm13,%ymm1
   DB  197,188,194,192,0                   ; vcmpeqps      %ymm0,%ymm8,%ymm0
   DB  196,195,117,74,196,0                ; vblendvps     %ymm0,%ymm12,%ymm1,%ymm0
   DB  196,193,60,88,201                   ; vaddps        %ymm9,%ymm8,%ymm1
-  DB  196,98,125,24,29,165,65,0,0         ; vbroadcastss  0x41a5(%rip),%ymm11        # 5954 <_sk_callback_hsw+0x240>
+  DB  196,98,125,24,29,175,65,0,0         ; vbroadcastss  0x41af(%rip),%ymm11        # 5990 <_sk_callback_hsw+0x248>
   DB  196,193,116,89,211                  ; vmulps        %ymm11,%ymm1,%ymm2
   DB  197,36,194,218,1                    ; vcmpltps      %ymm2,%ymm11,%ymm11
   DB  196,65,12,92,224                    ; vsubps        %ymm8,%ymm14,%ymm12
@@ -1454,7 +1472,7 @@
   DB  197,172,94,201                      ; vdivps        %ymm1,%ymm10,%ymm1
   DB  196,195,125,74,199,128              ; vblendvps     %ymm8,%ymm15,%ymm0,%ymm0
   DB  196,195,117,74,207,128              ; vblendvps     %ymm8,%ymm15,%ymm1,%ymm1
-  DB  196,98,125,24,5,104,65,0,0          ; vbroadcastss  0x4168(%rip),%ymm8        # 5950 <_sk_callback_hsw+0x23c>
+  DB  196,98,125,24,5,114,65,0,0          ; vbroadcastss  0x4172(%rip),%ymm8        # 598c <_sk_callback_hsw+0x244>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -1469,30 +1487,30 @@
   DB  197,252,17,28,36                    ; vmovups       %ymm3,(%rsp)
   DB  197,252,40,233                      ; vmovaps       %ymm1,%ymm5
   DB  197,252,40,224                      ; vmovaps       %ymm0,%ymm4
-  DB  196,98,125,24,5,47,65,0,0           ; vbroadcastss  0x412f(%rip),%ymm8        # 5958 <_sk_callback_hsw+0x244>
+  DB  196,98,125,24,5,57,65,0,0           ; vbroadcastss  0x4139(%rip),%ymm8        # 5994 <_sk_callback_hsw+0x24c>
   DB  197,60,194,202,2                    ; vcmpleps      %ymm2,%ymm8,%ymm9
   DB  197,84,89,210                       ; vmulps        %ymm2,%ymm5,%ymm10
   DB  196,65,84,92,218                    ; vsubps        %ymm10,%ymm5,%ymm11
   DB  196,67,45,74,203,144                ; vblendvps     %ymm9,%ymm11,%ymm10,%ymm9
   DB  197,52,88,210                       ; vaddps        %ymm2,%ymm9,%ymm10
-  DB  196,98,125,24,13,18,65,0,0          ; vbroadcastss  0x4112(%rip),%ymm9        # 595c <_sk_callback_hsw+0x248>
+  DB  196,98,125,24,13,28,65,0,0          ; vbroadcastss  0x411c(%rip),%ymm9        # 5998 <_sk_callback_hsw+0x250>
   DB  196,66,109,170,202                  ; vfmsub213ps   %ymm10,%ymm2,%ymm9
-  DB  196,98,125,24,29,8,65,0,0           ; vbroadcastss  0x4108(%rip),%ymm11        # 5960 <_sk_callback_hsw+0x24c>
+  DB  196,98,125,24,29,18,65,0,0          ; vbroadcastss  0x4112(%rip),%ymm11        # 599c <_sk_callback_hsw+0x254>
   DB  196,65,92,88,219                    ; vaddps        %ymm11,%ymm4,%ymm11
   DB  196,67,125,8,227,1                  ; vroundps      $0x1,%ymm11,%ymm12
   DB  196,65,36,92,252                    ; vsubps        %ymm12,%ymm11,%ymm15
   DB  196,65,44,92,217                    ; vsubps        %ymm9,%ymm10,%ymm11
-  DB  196,98,125,24,45,242,64,0,0         ; vbroadcastss  0x40f2(%rip),%ymm13        # 5968 <_sk_callback_hsw+0x254>
+  DB  196,98,125,24,45,252,64,0,0         ; vbroadcastss  0x40fc(%rip),%ymm13        # 59a4 <_sk_callback_hsw+0x25c>
   DB  196,193,4,89,197                    ; vmulps        %ymm13,%ymm15,%ymm0
-  DB  196,98,125,24,53,232,64,0,0         ; vbroadcastss  0x40e8(%rip),%ymm14        # 596c <_sk_callback_hsw+0x258>
+  DB  196,98,125,24,53,242,64,0,0         ; vbroadcastss  0x40f2(%rip),%ymm14        # 59a8 <_sk_callback_hsw+0x260>
   DB  197,12,92,224                       ; vsubps        %ymm0,%ymm14,%ymm12
   DB  196,66,37,168,225                   ; vfmadd213ps   %ymm9,%ymm11,%ymm12
-  DB  196,226,125,24,29,206,64,0,0        ; vbroadcastss  0x40ce(%rip),%ymm3        # 5964 <_sk_callback_hsw+0x250>
+  DB  196,226,125,24,29,216,64,0,0        ; vbroadcastss  0x40d8(%rip),%ymm3        # 59a0 <_sk_callback_hsw+0x258>
   DB  196,193,100,194,255,2               ; vcmpleps      %ymm15,%ymm3,%ymm7
   DB  196,195,29,74,249,112               ; vblendvps     %ymm7,%ymm9,%ymm12,%ymm7
   DB  196,65,60,194,231,2                 ; vcmpleps      %ymm15,%ymm8,%ymm12
   DB  196,227,45,74,255,192               ; vblendvps     %ymm12,%ymm7,%ymm10,%ymm7
-  DB  196,98,125,24,37,185,64,0,0         ; vbroadcastss  0x40b9(%rip),%ymm12        # 5970 <_sk_callback_hsw+0x25c>
+  DB  196,98,125,24,37,195,64,0,0         ; vbroadcastss  0x40c3(%rip),%ymm12        # 59ac <_sk_callback_hsw+0x264>
   DB  196,65,28,194,255,2                 ; vcmpleps      %ymm15,%ymm12,%ymm15
   DB  196,194,37,168,193                  ; vfmadd213ps   %ymm9,%ymm11,%ymm0
   DB  196,99,125,74,255,240               ; vblendvps     %ymm15,%ymm7,%ymm0,%ymm15
@@ -1508,7 +1526,7 @@
   DB  197,156,194,192,2                   ; vcmpleps      %ymm0,%ymm12,%ymm0
   DB  196,194,37,168,249                  ; vfmadd213ps   %ymm9,%ymm11,%ymm7
   DB  196,227,69,74,201,0                 ; vblendvps     %ymm0,%ymm1,%ymm7,%ymm1
-  DB  196,226,125,24,5,101,64,0,0         ; vbroadcastss  0x4065(%rip),%ymm0        # 5974 <_sk_callback_hsw+0x260>
+  DB  196,226,125,24,5,111,64,0,0         ; vbroadcastss  0x406f(%rip),%ymm0        # 59b0 <_sk_callback_hsw+0x268>
   DB  197,220,88,192                      ; vaddps        %ymm0,%ymm4,%ymm0
   DB  196,227,125,8,224,1                 ; vroundps      $0x1,%ymm0,%ymm4
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
@@ -1552,12 +1570,12 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,58                              ; jne           19f6 <_sk_scale_u8_hsw+0x44>
+  DB  117,58                              ; jne           1a28 <_sk_scale_u8_hsw+0x44>
   DB  196,66,121,48,4,19                  ; vpmovzxbw     (%r11,%rdx,1),%xmm8
-  DB  197,57,219,5,150,70,0,0             ; vpand         0x4696(%rip),%xmm8,%xmm8        # 6060 <_sk_callback_hsw+0x94c>
+  DB  197,57,219,5,164,70,0,0             ; vpand         0x46a4(%rip),%xmm8,%xmm8        # 60a0 <_sk_callback_hsw+0x958>
   DB  196,66,125,51,192                   ; vpmovzxwd     %xmm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,155,63,0,0         ; vbroadcastss  0x3f9b(%rip),%ymm9        # 5978 <_sk_callback_hsw+0x264>
+  DB  196,98,125,24,13,165,63,0,0         ; vbroadcastss  0x3fa5(%rip),%ymm9        # 59b4 <_sk_callback_hsw+0x26c>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
@@ -1570,15 +1588,15 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,183                             ; ja            19c2 <_sk_scale_u8_hsw+0x10>
+  DB  119,183                             ; ja            19f4 <_sk_scale_u8_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,122,0,0,0                 ; lea           0x7a(%rip),%r10        # 1a90 <_sk_scale_u8_hsw+0xde>
+  DB  76,141,21,124,0,0,0                 ; lea           0x7c(%rip),%r10        # 1ac4 <_sk_scale_u8_hsw+0xe0>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  235,152                             ; jmp           19c2 <_sk_scale_u8_hsw+0x10>
+  DB  235,152                             ; jmp           19f4 <_sk_scale_u8_hsw+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,2                    ; vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -1586,7 +1604,7 @@
   DB  197,121,110,200                     ; vmovd         %eax,%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,57,2,193,1                   ; vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,111,255,255,255                 ; jmpq          19c2 <_sk_scale_u8_hsw+0x10>
+  DB  233,111,255,255,255                 ; jmpq          19f4 <_sk_scale_u8_hsw+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,6                    ; vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -1597,22 +1615,24 @@
   DB  196,65,121,110,12,19                ; vmovd         (%r11,%rdx,1),%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,49,2,192,12                  ; vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  DB  233,51,255,255,255                  ; jmpq          19c2 <_sk_scale_u8_hsw+0x10>
-  DB  144                                 ; nop
-  DB  143                                 ; (bad)
+  DB  233,51,255,255,255                  ; jmpq          19f4 <_sk_scale_u8_hsw+0x10>
+  DB  15,31,0                             ; nopl          (%rax)
+  DB  141                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,170,255,255,255,154             ; ljmp          *-0x65000001(%rdx)
+  DB  255,168,255,255,255,152             ; ljmp          *-0x67000001(%rax)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,231                             ; jmpq          *%rdi
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  233,255,255,255,222                 ; jmpq          ffffffffdf001aa0 <_sk_callback_hsw+0xffffffffdeffc38c>
+  DB  220,255                             ; fdivr         %st,%st(7)
+  DB  255                                 ; (bad)
+  DB  255,209                             ; callq         *%rcx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,211                             ; callq         *%rbx
-  DB  255                                 ; (bad)
-  DB  255                                 ; (bad)
-  DB  255,195                             ; inc           %ebx
+  DB  255,193                             ; inc           %ecx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; .byte         0xff
@@ -1637,12 +1657,12 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,78                              ; jne           1b33 <_sk_lerp_u8_hsw+0x58>
+  DB  117,78                              ; jne           1b67 <_sk_lerp_u8_hsw+0x58>
   DB  196,66,121,48,4,19                  ; vpmovzxbw     (%r11,%rdx,1),%xmm8
-  DB  197,57,219,5,125,69,0,0             ; vpand         0x457d(%rip),%xmm8,%xmm8        # 6070 <_sk_callback_hsw+0x95c>
+  DB  197,57,219,5,137,69,0,0             ; vpand         0x4589(%rip),%xmm8,%xmm8        # 60b0 <_sk_callback_hsw+0x968>
   DB  196,66,125,51,192                   ; vpmovzxwd     %xmm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,118,62,0,0         ; vbroadcastss  0x3e76(%rip),%ymm9        # 597c <_sk_callback_hsw+0x268>
+  DB  196,98,125,24,13,126,62,0,0         ; vbroadcastss  0x3e7e(%rip),%ymm9        # 59b8 <_sk_callback_hsw+0x270>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
   DB  196,226,61,168,196                  ; vfmadd213ps   %ymm4,%ymm8,%ymm0
@@ -1659,15 +1679,15 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,163                             ; ja            1aeb <_sk_lerp_u8_hsw+0x10>
+  DB  119,163                             ; ja            1b1f <_sk_lerp_u8_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,121,0,0,0                 ; lea           0x79(%rip),%r10        # 1bcc <_sk_lerp_u8_hsw+0xf1>
+  DB  76,141,21,121,0,0,0                 ; lea           0x79(%rip),%r10        # 1c00 <_sk_lerp_u8_hsw+0xf1>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  235,132                             ; jmp           1aeb <_sk_lerp_u8_hsw+0x10>
+  DB  235,132                             ; jmp           1b1f <_sk_lerp_u8_hsw+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,2                    ; vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -1675,7 +1695,7 @@
   DB  197,121,110,200                     ; vmovd         %eax,%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,57,2,193,1                   ; vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,91,255,255,255                  ; jmpq          1aeb <_sk_lerp_u8_hsw+0x10>
+  DB  233,91,255,255,255                  ; jmpq          1b1f <_sk_lerp_u8_hsw+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,6                    ; vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -1686,7 +1706,7 @@
   DB  196,65,121,110,12,19                ; vmovd         (%r11,%rdx,1),%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,49,2,192,12                  ; vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  DB  233,31,255,255,255                  ; jmpq          1aeb <_sk_lerp_u8_hsw+0x10>
+  DB  233,31,255,255,255                  ; jmpq          1b1f <_sk_lerp_u8_hsw+0x10>
   DB  144                                 ; nop
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -1713,23 +1733,23 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,169,0,0,0                    ; jne           1c9f <_sk_lerp_565_hsw+0xb7>
+  DB  15,133,169,0,0,0                    ; jne           1cd3 <_sk_lerp_565_hsw+0xb7>
   DB  196,65,122,111,4,83                 ; vmovdqu       (%r11,%rdx,2),%xmm8
   DB  196,66,125,51,192                   ; vpmovzxwd     %xmm8,%ymm8
-  DB  196,98,125,88,13,118,61,0,0         ; vpbroadcastd  0x3d76(%rip),%ymm9        # 5980 <_sk_callback_hsw+0x26c>
+  DB  196,98,125,88,13,126,61,0,0         ; vpbroadcastd  0x3d7e(%rip),%ymm9        # 59bc <_sk_callback_hsw+0x274>
   DB  196,65,61,219,201                   ; vpand         %ymm9,%ymm8,%ymm9
   DB  196,65,124,91,201                   ; vcvtdq2ps     %ymm9,%ymm9
-  DB  196,98,125,24,21,103,61,0,0         ; vbroadcastss  0x3d67(%rip),%ymm10        # 5984 <_sk_callback_hsw+0x270>
+  DB  196,98,125,24,21,111,61,0,0         ; vbroadcastss  0x3d6f(%rip),%ymm10        # 59c0 <_sk_callback_hsw+0x278>
   DB  196,65,52,89,202                    ; vmulps        %ymm10,%ymm9,%ymm9
-  DB  196,98,125,88,21,93,61,0,0          ; vpbroadcastd  0x3d5d(%rip),%ymm10        # 5988 <_sk_callback_hsw+0x274>
+  DB  196,98,125,88,21,101,61,0,0         ; vpbroadcastd  0x3d65(%rip),%ymm10        # 59c4 <_sk_callback_hsw+0x27c>
   DB  196,65,61,219,210                   ; vpand         %ymm10,%ymm8,%ymm10
   DB  196,65,124,91,210                   ; vcvtdq2ps     %ymm10,%ymm10
-  DB  196,98,125,24,29,78,61,0,0          ; vbroadcastss  0x3d4e(%rip),%ymm11        # 598c <_sk_callback_hsw+0x278>
+  DB  196,98,125,24,29,86,61,0,0          ; vbroadcastss  0x3d56(%rip),%ymm11        # 59c8 <_sk_callback_hsw+0x280>
   DB  196,65,44,89,211                    ; vmulps        %ymm11,%ymm10,%ymm10
-  DB  196,98,125,88,29,68,61,0,0          ; vpbroadcastd  0x3d44(%rip),%ymm11        # 5990 <_sk_callback_hsw+0x27c>
+  DB  196,98,125,88,29,76,61,0,0          ; vpbroadcastd  0x3d4c(%rip),%ymm11        # 59cc <_sk_callback_hsw+0x284>
   DB  196,65,61,219,195                   ; vpand         %ymm11,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,29,53,61,0,0          ; vbroadcastss  0x3d35(%rip),%ymm11        # 5994 <_sk_callback_hsw+0x280>
+  DB  196,98,125,24,29,61,61,0,0          ; vbroadcastss  0x3d3d(%rip),%ymm11        # 59d0 <_sk_callback_hsw+0x288>
   DB  196,65,60,89,195                    ; vmulps        %ymm11,%ymm8,%ymm8
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
   DB  196,226,53,168,196                  ; vfmadd213ps   %ymm4,%ymm9,%ymm0
@@ -1750,27 +1770,27 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,68,255,255,255               ; ja            1bfc <_sk_lerp_565_hsw+0x14>
+  DB  15,135,68,255,255,255               ; ja            1c30 <_sk_lerp_565_hsw+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,101,0,0,0                 ; lea           0x65(%rip),%r10        # 1d28 <_sk_lerp_565_hsw+0x140>
+  DB  76,141,21,101,0,0,0                 ; lea           0x65(%rip),%r10        # 1d5c <_sk_lerp_565_hsw+0x140>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  233,34,255,255,255                  ; jmpq          1bfc <_sk_lerp_565_hsw+0x14>
+  DB  233,34,255,255,255                  ; jmpq          1c30 <_sk_lerp_565_hsw+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,65,57,196,68,83,4,2             ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,121,110,12,83                ; vmovd         (%r11,%rdx,2),%xmm9
   DB  196,67,57,2,193,1                   ; vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,4,255,255,255                   ; jmpq          1bfc <_sk_lerp_565_hsw+0x14>
+  DB  233,4,255,255,255                   ; jmpq          1c30 <_sk_lerp_565_hsw+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,65,57,196,68,83,12,6            ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,57,196,68,83,10,5            ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,57,196,68,83,8,4             ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,122,126,12,83                ; vmovq         (%r11,%rdx,2),%xmm9
   DB  196,67,49,2,192,12                  ; vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  DB  233,214,254,255,255                 ; jmpq          1bfc <_sk_lerp_565_hsw+0x14>
+  DB  233,214,254,255,255                 ; jmpq          1c30 <_sk_lerp_565_hsw+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  164                                 ; movsb         %ds:(%rsi),%es:(%rdi)
   DB  255                                 ; (bad)
@@ -1801,23 +1821,23 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,105                             ; jne           1dc2 <_sk_load_tables_hsw+0x7e>
+  DB  117,105                             ; jne           1df6 <_sk_load_tables_hsw+0x7e>
   DB  196,193,124,16,26                   ; vmovups       (%r10),%ymm3
-  DB  197,228,84,13,250,63,0,0            ; vandps        0x3ffa(%rip),%ymm3,%ymm1        # 5d60 <_sk_callback_hsw+0x64c>
+  DB  197,228,84,13,6,64,0,0              ; vandps        0x4006(%rip),%ymm3,%ymm1        # 5da0 <_sk_callback_hsw+0x658>
   DB  196,65,61,118,192                   ; vpcmpeqd      %ymm8,%ymm8,%ymm8
   DB  72,139,72,8                         ; mov           0x8(%rax),%rcx
   DB  76,139,80,16                        ; mov           0x10(%rax),%r10
   DB  197,237,118,210                     ; vpcmpeqd      %ymm2,%ymm2,%ymm2
   DB  196,226,109,146,4,137               ; vgatherdps    %ymm2,(%rcx,%ymm1,4),%ymm0
-  DB  196,226,101,0,21,250,63,0,0         ; vpshufb       0x3ffa(%rip),%ymm3,%ymm2        # 5d80 <_sk_callback_hsw+0x66c>
+  DB  196,226,101,0,21,6,64,0,0           ; vpshufb       0x4006(%rip),%ymm3,%ymm2        # 5dc0 <_sk_callback_hsw+0x678>
   DB  196,65,53,118,201                   ; vpcmpeqd      %ymm9,%ymm9,%ymm9
   DB  196,194,53,146,12,146               ; vgatherdps    %ymm9,(%r10,%ymm2,4),%ymm1
   DB  72,139,64,24                        ; mov           0x18(%rax),%rax
-  DB  196,98,101,0,13,2,64,0,0            ; vpshufb       0x4002(%rip),%ymm3,%ymm9        # 5da0 <_sk_callback_hsw+0x68c>
+  DB  196,98,101,0,13,14,64,0,0           ; vpshufb       0x400e(%rip),%ymm3,%ymm9        # 5de0 <_sk_callback_hsw+0x698>
   DB  196,162,61,146,20,136               ; vgatherdps    %ymm8,(%rax,%ymm9,4),%ymm2
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,226,59,0,0          ; vbroadcastss  0x3be2(%rip),%ymm8        # 5998 <_sk_callback_hsw+0x284>
+  DB  196,98,125,24,5,234,59,0,0          ; vbroadcastss  0x3bea(%rip),%ymm8        # 59d4 <_sk_callback_hsw+0x28c>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,201                          ; mov           %r9,%rcx
@@ -1830,7 +1850,7 @@
   DB  196,193,249,110,195                 ; vmovq         %r11,%xmm0
   DB  196,226,125,33,192                  ; vpmovsxbd     %xmm0,%ymm0
   DB  196,194,125,44,26                   ; vmaskmovps    (%r10),%ymm0,%ymm3
-  DB  233,115,255,255,255                 ; jmpq          1d5e <_sk_load_tables_hsw+0x1a>
+  DB  233,115,255,255,255                 ; jmpq          1d92 <_sk_load_tables_hsw+0x1a>
 
 PUBLIC _sk_load_tables_u16_be_hsw
 _sk_load_tables_u16_be_hsw LABEL PROC
@@ -1838,7 +1858,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,201,0,0,0                    ; jne           1eca <_sk_load_tables_u16_be_hsw+0xdf>
+  DB  15,133,201,0,0,0                    ; jne           1efe <_sk_load_tables_u16_be_hsw+0xdf>
   DB  196,1,121,16,4,81                   ; vmovupd       (%r9,%r10,2),%xmm8
   DB  196,129,121,16,84,81,16             ; vmovupd       0x10(%r9,%r10,2),%xmm2
   DB  196,129,121,16,92,81,32             ; vmovupd       0x20(%r9,%r10,2),%xmm3
@@ -1854,7 +1874,7 @@
   DB  197,185,108,200                     ; vpunpcklqdq   %xmm0,%xmm8,%xmm1
   DB  197,185,109,208                     ; vpunpckhqdq   %xmm0,%xmm8,%xmm2
   DB  197,49,108,195                      ; vpunpcklqdq   %xmm3,%xmm9,%xmm8
-  DB  197,121,111,21,46,66,0,0            ; vmovdqa       0x422e(%rip),%xmm10        # 6080 <_sk_callback_hsw+0x96c>
+  DB  197,121,111,21,58,66,0,0            ; vmovdqa       0x423a(%rip),%xmm10        # 60c0 <_sk_callback_hsw+0x978>
   DB  196,193,113,219,194                 ; vpand         %xmm10,%xmm1,%xmm0
   DB  196,226,125,51,200                  ; vpmovzxwd     %xmm0,%ymm1
   DB  196,65,37,118,219                   ; vpcmpeqd      %ymm11,%ymm11,%ymm11
@@ -1876,36 +1896,36 @@
   DB  197,185,235,219                     ; vpor          %xmm3,%xmm8,%xmm3
   DB  196,226,125,51,219                  ; vpmovzxwd     %xmm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,219,58,0,0          ; vbroadcastss  0x3adb(%rip),%ymm8        # 599c <_sk_callback_hsw+0x288>
+  DB  196,98,125,24,5,227,58,0,0          ; vbroadcastss  0x3ae3(%rip),%ymm8        # 59d8 <_sk_callback_hsw+0x290>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,1,123,16,4,81                   ; vmovsd        (%r9,%r10,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,85                              ; je            1f30 <_sk_load_tables_u16_be_hsw+0x145>
+  DB  116,85                              ; je            1f64 <_sk_load_tables_u16_be_hsw+0x145>
   DB  196,1,57,22,68,81,8                 ; vmovhpd       0x8(%r9,%r10,2),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,72                              ; jb            1f30 <_sk_load_tables_u16_be_hsw+0x145>
+  DB  114,72                              ; jb            1f64 <_sk_load_tables_u16_be_hsw+0x145>
   DB  196,129,123,16,84,81,16             ; vmovsd        0x10(%r9,%r10,2),%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,72                              ; je            1f3d <_sk_load_tables_u16_be_hsw+0x152>
+  DB  116,72                              ; je            1f71 <_sk_load_tables_u16_be_hsw+0x152>
   DB  196,129,105,22,84,81,24             ; vmovhpd       0x18(%r9,%r10,2),%xmm2,%xmm2
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,59                              ; jb            1f3d <_sk_load_tables_u16_be_hsw+0x152>
+  DB  114,59                              ; jb            1f71 <_sk_load_tables_u16_be_hsw+0x152>
   DB  196,129,123,16,92,81,32             ; vmovsd        0x20(%r9,%r10,2),%xmm3
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,9,255,255,255                ; je            1e1c <_sk_load_tables_u16_be_hsw+0x31>
+  DB  15,132,9,255,255,255                ; je            1e50 <_sk_load_tables_u16_be_hsw+0x31>
   DB  196,129,97,22,92,81,40              ; vmovhpd       0x28(%r9,%r10,2),%xmm3,%xmm3
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,248,254,255,255              ; jb            1e1c <_sk_load_tables_u16_be_hsw+0x31>
+  DB  15,130,248,254,255,255              ; jb            1e50 <_sk_load_tables_u16_be_hsw+0x31>
   DB  196,1,122,126,76,81,48              ; vmovq         0x30(%r9,%r10,2),%xmm9
-  DB  233,236,254,255,255                 ; jmpq          1e1c <_sk_load_tables_u16_be_hsw+0x31>
+  DB  233,236,254,255,255                 ; jmpq          1e50 <_sk_load_tables_u16_be_hsw+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,223,254,255,255                 ; jmpq          1e1c <_sk_load_tables_u16_be_hsw+0x31>
+  DB  233,223,254,255,255                 ; jmpq          1e50 <_sk_load_tables_u16_be_hsw+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,214,254,255,255                 ; jmpq          1e1c <_sk_load_tables_u16_be_hsw+0x31>
+  DB  233,214,254,255,255                 ; jmpq          1e50 <_sk_load_tables_u16_be_hsw+0x31>
 
 PUBLIC _sk_load_tables_rgb_u16_be_hsw
 _sk_load_tables_rgb_u16_be_hsw LABEL PROC
@@ -1913,7 +1933,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,82                        ; lea           (%rdx,%rdx,2),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,193,0,0,0                    ; jne           2019 <_sk_load_tables_rgb_u16_be_hsw+0xd3>
+  DB  15,133,193,0,0,0                    ; jne           204d <_sk_load_tables_rgb_u16_be_hsw+0xd3>
   DB  196,129,122,111,4,81                ; vmovdqu       (%r9,%r10,2),%xmm0
   DB  196,129,122,111,84,81,12            ; vmovdqu       0xc(%r9,%r10,2),%xmm2
   DB  196,129,122,111,76,81,24            ; vmovdqu       0x18(%r9,%r10,2),%xmm1
@@ -1934,7 +1954,7 @@
   DB  197,185,108,218                     ; vpunpcklqdq   %xmm2,%xmm8,%xmm3
   DB  197,185,109,210                     ; vpunpckhqdq   %xmm2,%xmm8,%xmm2
   DB  197,121,108,193                     ; vpunpcklqdq   %xmm1,%xmm0,%xmm8
-  DB  197,121,111,13,206,64,0,0           ; vmovdqa       0x40ce(%rip),%xmm9        # 6090 <_sk_callback_hsw+0x97c>
+  DB  197,121,111,13,218,64,0,0           ; vmovdqa       0x40da(%rip),%xmm9        # 60d0 <_sk_callback_hsw+0x988>
   DB  196,193,97,219,193                  ; vpand         %xmm9,%xmm3,%xmm0
   DB  196,226,125,51,200                  ; vpmovzxwd     %xmm0,%ymm1
   DB  197,229,118,219                     ; vpcmpeqd      %ymm3,%ymm3,%ymm3
@@ -1951,46 +1971,46 @@
   DB  196,98,125,51,194                   ; vpmovzxwd     %xmm2,%ymm8
   DB  196,162,101,146,20,128              ; vgatherdps    %ymm3,(%rax,%ymm8,4),%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,137,57,0,0        ; vbroadcastss  0x3989(%rip),%ymm3        # 59a0 <_sk_callback_hsw+0x28c>
+  DB  196,226,125,24,29,145,57,0,0        ; vbroadcastss  0x3991(%rip),%ymm3        # 59dc <_sk_callback_hsw+0x294>
   DB  255,224                             ; jmpq          *%rax
   DB  196,129,121,110,4,81                ; vmovd         (%r9,%r10,2),%xmm0
   DB  196,129,121,196,68,81,4,2           ; vpinsrw       $0x2,0x4(%r9,%r10,2),%xmm0,%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,5                               ; jne           2032 <_sk_load_tables_rgb_u16_be_hsw+0xec>
-  DB  233,90,255,255,255                  ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  117,5                               ; jne           2066 <_sk_load_tables_rgb_u16_be_hsw+0xec>
+  DB  233,90,255,255,255                  ; jmpq          1fc0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   DB  196,129,121,110,76,81,6             ; vmovd         0x6(%r9,%r10,2),%xmm1
   DB  196,1,113,196,68,81,10,2            ; vpinsrw       $0x2,0xa(%r9,%r10,2),%xmm1,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,26                              ; jb            2061 <_sk_load_tables_rgb_u16_be_hsw+0x11b>
+  DB  114,26                              ; jb            2095 <_sk_load_tables_rgb_u16_be_hsw+0x11b>
   DB  196,129,121,110,76,81,12            ; vmovd         0xc(%r9,%r10,2),%xmm1
   DB  196,129,113,196,84,81,16,2          ; vpinsrw       $0x2,0x10(%r9,%r10,2),%xmm1,%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  117,10                              ; jne           2066 <_sk_load_tables_rgb_u16_be_hsw+0x120>
-  DB  233,43,255,255,255                  ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  DB  233,38,255,255,255                  ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  117,10                              ; jne           209a <_sk_load_tables_rgb_u16_be_hsw+0x120>
+  DB  233,43,255,255,255                  ; jmpq          1fc0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  233,38,255,255,255                  ; jmpq          1fc0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   DB  196,129,121,110,76,81,18            ; vmovd         0x12(%r9,%r10,2),%xmm1
   DB  196,1,113,196,76,81,22,2            ; vpinsrw       $0x2,0x16(%r9,%r10,2),%xmm1,%xmm9
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,26                              ; jb            2095 <_sk_load_tables_rgb_u16_be_hsw+0x14f>
+  DB  114,26                              ; jb            20c9 <_sk_load_tables_rgb_u16_be_hsw+0x14f>
   DB  196,129,121,110,76,81,24            ; vmovd         0x18(%r9,%r10,2),%xmm1
   DB  196,129,113,196,76,81,28,2          ; vpinsrw       $0x2,0x1c(%r9,%r10,2),%xmm1,%xmm1
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  117,10                              ; jne           209a <_sk_load_tables_rgb_u16_be_hsw+0x154>
-  DB  233,247,254,255,255                 ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  DB  233,242,254,255,255                 ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  117,10                              ; jne           20ce <_sk_load_tables_rgb_u16_be_hsw+0x154>
+  DB  233,247,254,255,255                 ; jmpq          1fc0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  233,242,254,255,255                 ; jmpq          1fc0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
   DB  196,129,121,110,92,81,30            ; vmovd         0x1e(%r9,%r10,2),%xmm3
   DB  196,1,97,196,92,81,34,2             ; vpinsrw       $0x2,0x22(%r9,%r10,2),%xmm3,%xmm11
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,20                              ; jb            20c3 <_sk_load_tables_rgb_u16_be_hsw+0x17d>
+  DB  114,20                              ; jb            20f7 <_sk_load_tables_rgb_u16_be_hsw+0x17d>
   DB  196,129,121,110,92,81,36            ; vmovd         0x24(%r9,%r10,2),%xmm3
   DB  196,129,97,196,92,81,40,2           ; vpinsrw       $0x2,0x28(%r9,%r10,2),%xmm3,%xmm3
-  DB  233,201,254,255,255                 ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
-  DB  233,196,254,255,255                 ; jmpq          1f8c <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  233,201,254,255,255                 ; jmpq          1fc0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
+  DB  233,196,254,255,255                 ; jmpq          1fc0 <_sk_load_tables_rgb_u16_be_hsw+0x46>
 
 PUBLIC _sk_byte_tables_hsw
 _sk_byte_tables_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,209,56,0,0          ; vbroadcastss  0x38d1(%rip),%ymm8        # 59a4 <_sk_callback_hsw+0x290>
+  DB  196,98,125,24,5,217,56,0,0          ; vbroadcastss  0x38d9(%rip),%ymm8        # 59e0 <_sk_callback_hsw+0x298>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  197,125,91,200                      ; vcvtps2dq     %ymm0,%ymm9
   DB  196,65,249,126,201                  ; vmovq         %xmm9,%r9
@@ -2112,7 +2132,7 @@
   DB  67,15,182,4,26                      ; movzbl        (%r10,%r11,1),%eax
   DB  196,194,125,49,193                  ; vpmovzxbd     %xmm9,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,118,54,0,0          ; vbroadcastss  0x3676(%rip),%ymm8        # 59a8 <_sk_callback_hsw+0x294>
+  DB  196,98,125,24,5,126,54,0,0          ; vbroadcastss  0x367e(%rip),%ymm8        # 59e4 <_sk_callback_hsw+0x29c>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  196,226,125,49,201                  ; vpmovzxbd     %xmm1,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
@@ -2226,7 +2246,7 @@
   DB  67,15,182,4,26                      ; movzbl        (%r10,%r11,1),%eax
   DB  196,194,125,49,193                  ; vpmovzxbd     %xmm9,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,98,52,0,0           ; vbroadcastss  0x3462(%rip),%ymm8        # 59ac <_sk_callback_hsw+0x298>
+  DB  196,98,125,24,5,106,52,0,0          ; vbroadcastss  0x346a(%rip),%ymm8        # 59e8 <_sk_callback_hsw+0x2a0>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  196,226,125,49,201                  ; vpmovzxbd     %xmm1,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
@@ -2315,33 +2335,33 @@
   DB  196,66,125,168,211                  ; vfmadd213ps   %ymm11,%ymm0,%ymm10
   DB  196,226,125,24,0                    ; vbroadcastss  (%rax),%ymm0
   DB  196,65,124,91,218                   ; vcvtdq2ps     %ymm10,%ymm11
-  DB  196,98,125,24,37,60,51,0,0          ; vbroadcastss  0x333c(%rip),%ymm12        # 59b0 <_sk_callback_hsw+0x29c>
-  DB  196,98,125,24,45,55,51,0,0          ; vbroadcastss  0x3337(%rip),%ymm13        # 59b4 <_sk_callback_hsw+0x2a0>
+  DB  196,98,125,24,37,68,51,0,0          ; vbroadcastss  0x3344(%rip),%ymm12        # 59ec <_sk_callback_hsw+0x2a4>
+  DB  196,98,125,24,45,63,51,0,0          ; vbroadcastss  0x333f(%rip),%ymm13        # 59f0 <_sk_callback_hsw+0x2a8>
   DB  196,65,44,84,213                    ; vandps        %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,45,51,0,0          ; vbroadcastss  0x332d(%rip),%ymm13        # 59b8 <_sk_callback_hsw+0x2a4>
+  DB  196,98,125,24,45,53,51,0,0          ; vbroadcastss  0x3335(%rip),%ymm13        # 59f4 <_sk_callback_hsw+0x2ac>
   DB  196,65,44,86,213                    ; vorps         %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,35,51,0,0          ; vbroadcastss  0x3323(%rip),%ymm13        # 59bc <_sk_callback_hsw+0x2a8>
+  DB  196,98,125,24,45,43,51,0,0          ; vbroadcastss  0x332b(%rip),%ymm13        # 59f8 <_sk_callback_hsw+0x2b0>
   DB  196,66,37,184,236                   ; vfmadd231ps   %ymm12,%ymm11,%ymm13
-  DB  196,98,125,24,29,25,51,0,0          ; vbroadcastss  0x3319(%rip),%ymm11        # 59c0 <_sk_callback_hsw+0x2ac>
+  DB  196,98,125,24,29,33,51,0,0          ; vbroadcastss  0x3321(%rip),%ymm11        # 59fc <_sk_callback_hsw+0x2b4>
   DB  196,66,45,172,221                   ; vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  DB  196,98,125,24,37,15,51,0,0          ; vbroadcastss  0x330f(%rip),%ymm12        # 59c4 <_sk_callback_hsw+0x2b0>
+  DB  196,98,125,24,37,23,51,0,0          ; vbroadcastss  0x3317(%rip),%ymm12        # 5a00 <_sk_callback_hsw+0x2b8>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,5,51,0,0           ; vbroadcastss  0x3305(%rip),%ymm12        # 59c8 <_sk_callback_hsw+0x2b4>
+  DB  196,98,125,24,37,13,51,0,0          ; vbroadcastss  0x330d(%rip),%ymm12        # 5a04 <_sk_callback_hsw+0x2bc>
   DB  196,65,28,94,210                    ; vdivps        %ymm10,%ymm12,%ymm10
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  196,99,125,8,208,1                  ; vroundps      $0x1,%ymm0,%ymm10
   DB  196,65,124,92,210                   ; vsubps        %ymm10,%ymm0,%ymm10
-  DB  196,98,125,24,29,230,50,0,0         ; vbroadcastss  0x32e6(%rip),%ymm11        # 59cc <_sk_callback_hsw+0x2b8>
+  DB  196,98,125,24,29,238,50,0,0         ; vbroadcastss  0x32ee(%rip),%ymm11        # 5a08 <_sk_callback_hsw+0x2c0>
   DB  196,193,124,88,195                  ; vaddps        %ymm11,%ymm0,%ymm0
-  DB  196,98,125,24,29,220,50,0,0         ; vbroadcastss  0x32dc(%rip),%ymm11        # 59d0 <_sk_callback_hsw+0x2bc>
+  DB  196,98,125,24,29,228,50,0,0         ; vbroadcastss  0x32e4(%rip),%ymm11        # 5a0c <_sk_callback_hsw+0x2c4>
   DB  196,98,45,172,216                   ; vfnmadd213ps  %ymm0,%ymm10,%ymm11
-  DB  196,226,125,24,5,210,50,0,0         ; vbroadcastss  0x32d2(%rip),%ymm0        # 59d4 <_sk_callback_hsw+0x2c0>
+  DB  196,226,125,24,5,218,50,0,0         ; vbroadcastss  0x32da(%rip),%ymm0        # 5a10 <_sk_callback_hsw+0x2c8>
   DB  196,193,124,92,194                  ; vsubps        %ymm10,%ymm0,%ymm0
-  DB  196,98,125,24,21,200,50,0,0         ; vbroadcastss  0x32c8(%rip),%ymm10        # 59d8 <_sk_callback_hsw+0x2c4>
+  DB  196,98,125,24,21,208,50,0,0         ; vbroadcastss  0x32d0(%rip),%ymm10        # 5a14 <_sk_callback_hsw+0x2cc>
   DB  197,172,94,192                      ; vdivps        %ymm0,%ymm10,%ymm0
   DB  197,164,88,192                      ; vaddps        %ymm0,%ymm11,%ymm0
-  DB  196,98,125,24,21,187,50,0,0         ; vbroadcastss  0x32bb(%rip),%ymm10        # 59dc <_sk_callback_hsw+0x2c8>
+  DB  196,98,125,24,21,195,50,0,0         ; vbroadcastss  0x32c3(%rip),%ymm10        # 5a18 <_sk_callback_hsw+0x2d0>
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  197,253,91,192                      ; vcvtps2dq     %ymm0,%ymm0
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -2349,7 +2369,7 @@
   DB  196,195,125,74,193,128              ; vblendvps     %ymm8,%ymm9,%ymm0,%ymm0
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,124,95,192                  ; vmaxps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,146,50,0,0          ; vbroadcastss  0x3292(%rip),%ymm8        # 59e0 <_sk_callback_hsw+0x2cc>
+  DB  196,98,125,24,5,154,50,0,0          ; vbroadcastss  0x329a(%rip),%ymm8        # 5a1c <_sk_callback_hsw+0x2d4>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2367,33 +2387,33 @@
   DB  196,66,117,168,211                  ; vfmadd213ps   %ymm11,%ymm1,%ymm10
   DB  196,226,125,24,8                    ; vbroadcastss  (%rax),%ymm1
   DB  196,65,124,91,218                   ; vcvtdq2ps     %ymm10,%ymm11
-  DB  196,98,125,24,37,74,50,0,0          ; vbroadcastss  0x324a(%rip),%ymm12        # 59e4 <_sk_callback_hsw+0x2d0>
-  DB  196,98,125,24,45,69,50,0,0          ; vbroadcastss  0x3245(%rip),%ymm13        # 59e8 <_sk_callback_hsw+0x2d4>
+  DB  196,98,125,24,37,82,50,0,0          ; vbroadcastss  0x3252(%rip),%ymm12        # 5a20 <_sk_callback_hsw+0x2d8>
+  DB  196,98,125,24,45,77,50,0,0          ; vbroadcastss  0x324d(%rip),%ymm13        # 5a24 <_sk_callback_hsw+0x2dc>
   DB  196,65,44,84,213                    ; vandps        %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,59,50,0,0          ; vbroadcastss  0x323b(%rip),%ymm13        # 59ec <_sk_callback_hsw+0x2d8>
+  DB  196,98,125,24,45,67,50,0,0          ; vbroadcastss  0x3243(%rip),%ymm13        # 5a28 <_sk_callback_hsw+0x2e0>
   DB  196,65,44,86,213                    ; vorps         %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,49,50,0,0          ; vbroadcastss  0x3231(%rip),%ymm13        # 59f0 <_sk_callback_hsw+0x2dc>
+  DB  196,98,125,24,45,57,50,0,0          ; vbroadcastss  0x3239(%rip),%ymm13        # 5a2c <_sk_callback_hsw+0x2e4>
   DB  196,66,37,184,236                   ; vfmadd231ps   %ymm12,%ymm11,%ymm13
-  DB  196,98,125,24,29,39,50,0,0          ; vbroadcastss  0x3227(%rip),%ymm11        # 59f4 <_sk_callback_hsw+0x2e0>
+  DB  196,98,125,24,29,47,50,0,0          ; vbroadcastss  0x322f(%rip),%ymm11        # 5a30 <_sk_callback_hsw+0x2e8>
   DB  196,66,45,172,221                   ; vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  DB  196,98,125,24,37,29,50,0,0          ; vbroadcastss  0x321d(%rip),%ymm12        # 59f8 <_sk_callback_hsw+0x2e4>
+  DB  196,98,125,24,37,37,50,0,0          ; vbroadcastss  0x3225(%rip),%ymm12        # 5a34 <_sk_callback_hsw+0x2ec>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,19,50,0,0          ; vbroadcastss  0x3213(%rip),%ymm12        # 59fc <_sk_callback_hsw+0x2e8>
+  DB  196,98,125,24,37,27,50,0,0          ; vbroadcastss  0x321b(%rip),%ymm12        # 5a38 <_sk_callback_hsw+0x2f0>
   DB  196,65,28,94,210                    ; vdivps        %ymm10,%ymm12,%ymm10
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
   DB  196,193,116,89,202                  ; vmulps        %ymm10,%ymm1,%ymm1
   DB  196,99,125,8,209,1                  ; vroundps      $0x1,%ymm1,%ymm10
   DB  196,65,116,92,210                   ; vsubps        %ymm10,%ymm1,%ymm10
-  DB  196,98,125,24,29,244,49,0,0         ; vbroadcastss  0x31f4(%rip),%ymm11        # 5a00 <_sk_callback_hsw+0x2ec>
+  DB  196,98,125,24,29,252,49,0,0         ; vbroadcastss  0x31fc(%rip),%ymm11        # 5a3c <_sk_callback_hsw+0x2f4>
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,234,49,0,0         ; vbroadcastss  0x31ea(%rip),%ymm11        # 5a04 <_sk_callback_hsw+0x2f0>
+  DB  196,98,125,24,29,242,49,0,0         ; vbroadcastss  0x31f2(%rip),%ymm11        # 5a40 <_sk_callback_hsw+0x2f8>
   DB  196,98,45,172,217                   ; vfnmadd213ps  %ymm1,%ymm10,%ymm11
-  DB  196,226,125,24,13,224,49,0,0        ; vbroadcastss  0x31e0(%rip),%ymm1        # 5a08 <_sk_callback_hsw+0x2f4>
+  DB  196,226,125,24,13,232,49,0,0        ; vbroadcastss  0x31e8(%rip),%ymm1        # 5a44 <_sk_callback_hsw+0x2fc>
   DB  196,193,116,92,202                  ; vsubps        %ymm10,%ymm1,%ymm1
-  DB  196,98,125,24,21,214,49,0,0         ; vbroadcastss  0x31d6(%rip),%ymm10        # 5a0c <_sk_callback_hsw+0x2f8>
+  DB  196,98,125,24,21,222,49,0,0         ; vbroadcastss  0x31de(%rip),%ymm10        # 5a48 <_sk_callback_hsw+0x300>
   DB  197,172,94,201                      ; vdivps        %ymm1,%ymm10,%ymm1
   DB  197,164,88,201                      ; vaddps        %ymm1,%ymm11,%ymm1
-  DB  196,98,125,24,21,201,49,0,0         ; vbroadcastss  0x31c9(%rip),%ymm10        # 5a10 <_sk_callback_hsw+0x2fc>
+  DB  196,98,125,24,21,209,49,0,0         ; vbroadcastss  0x31d1(%rip),%ymm10        # 5a4c <_sk_callback_hsw+0x304>
   DB  196,193,116,89,202                  ; vmulps        %ymm10,%ymm1,%ymm1
   DB  197,253,91,201                      ; vcvtps2dq     %ymm1,%ymm1
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -2401,7 +2421,7 @@
   DB  196,195,117,74,201,128              ; vblendvps     %ymm8,%ymm9,%ymm1,%ymm1
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,116,95,200                  ; vmaxps        %ymm8,%ymm1,%ymm1
-  DB  196,98,125,24,5,160,49,0,0          ; vbroadcastss  0x31a0(%rip),%ymm8        # 5a14 <_sk_callback_hsw+0x300>
+  DB  196,98,125,24,5,168,49,0,0          ; vbroadcastss  0x31a8(%rip),%ymm8        # 5a50 <_sk_callback_hsw+0x308>
   DB  196,193,116,93,200                  ; vminps        %ymm8,%ymm1,%ymm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2419,33 +2439,33 @@
   DB  196,66,109,168,211                  ; vfmadd213ps   %ymm11,%ymm2,%ymm10
   DB  196,226,125,24,16                   ; vbroadcastss  (%rax),%ymm2
   DB  196,65,124,91,218                   ; vcvtdq2ps     %ymm10,%ymm11
-  DB  196,98,125,24,37,88,49,0,0          ; vbroadcastss  0x3158(%rip),%ymm12        # 5a18 <_sk_callback_hsw+0x304>
-  DB  196,98,125,24,45,83,49,0,0          ; vbroadcastss  0x3153(%rip),%ymm13        # 5a1c <_sk_callback_hsw+0x308>
+  DB  196,98,125,24,37,96,49,0,0          ; vbroadcastss  0x3160(%rip),%ymm12        # 5a54 <_sk_callback_hsw+0x30c>
+  DB  196,98,125,24,45,91,49,0,0          ; vbroadcastss  0x315b(%rip),%ymm13        # 5a58 <_sk_callback_hsw+0x310>
   DB  196,65,44,84,213                    ; vandps        %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,73,49,0,0          ; vbroadcastss  0x3149(%rip),%ymm13        # 5a20 <_sk_callback_hsw+0x30c>
+  DB  196,98,125,24,45,81,49,0,0          ; vbroadcastss  0x3151(%rip),%ymm13        # 5a5c <_sk_callback_hsw+0x314>
   DB  196,65,44,86,213                    ; vorps         %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,63,49,0,0          ; vbroadcastss  0x313f(%rip),%ymm13        # 5a24 <_sk_callback_hsw+0x310>
+  DB  196,98,125,24,45,71,49,0,0          ; vbroadcastss  0x3147(%rip),%ymm13        # 5a60 <_sk_callback_hsw+0x318>
   DB  196,66,37,184,236                   ; vfmadd231ps   %ymm12,%ymm11,%ymm13
-  DB  196,98,125,24,29,53,49,0,0          ; vbroadcastss  0x3135(%rip),%ymm11        # 5a28 <_sk_callback_hsw+0x314>
+  DB  196,98,125,24,29,61,49,0,0          ; vbroadcastss  0x313d(%rip),%ymm11        # 5a64 <_sk_callback_hsw+0x31c>
   DB  196,66,45,172,221                   ; vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  DB  196,98,125,24,37,43,49,0,0          ; vbroadcastss  0x312b(%rip),%ymm12        # 5a2c <_sk_callback_hsw+0x318>
+  DB  196,98,125,24,37,51,49,0,0          ; vbroadcastss  0x3133(%rip),%ymm12        # 5a68 <_sk_callback_hsw+0x320>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,33,49,0,0          ; vbroadcastss  0x3121(%rip),%ymm12        # 5a30 <_sk_callback_hsw+0x31c>
+  DB  196,98,125,24,37,41,49,0,0          ; vbroadcastss  0x3129(%rip),%ymm12        # 5a6c <_sk_callback_hsw+0x324>
   DB  196,65,28,94,210                    ; vdivps        %ymm10,%ymm12,%ymm10
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
   DB  196,193,108,89,210                  ; vmulps        %ymm10,%ymm2,%ymm2
   DB  196,99,125,8,210,1                  ; vroundps      $0x1,%ymm2,%ymm10
   DB  196,65,108,92,210                   ; vsubps        %ymm10,%ymm2,%ymm10
-  DB  196,98,125,24,29,2,49,0,0           ; vbroadcastss  0x3102(%rip),%ymm11        # 5a34 <_sk_callback_hsw+0x320>
+  DB  196,98,125,24,29,10,49,0,0          ; vbroadcastss  0x310a(%rip),%ymm11        # 5a70 <_sk_callback_hsw+0x328>
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
-  DB  196,98,125,24,29,248,48,0,0         ; vbroadcastss  0x30f8(%rip),%ymm11        # 5a38 <_sk_callback_hsw+0x324>
+  DB  196,98,125,24,29,0,49,0,0           ; vbroadcastss  0x3100(%rip),%ymm11        # 5a74 <_sk_callback_hsw+0x32c>
   DB  196,98,45,172,218                   ; vfnmadd213ps  %ymm2,%ymm10,%ymm11
-  DB  196,226,125,24,21,238,48,0,0        ; vbroadcastss  0x30ee(%rip),%ymm2        # 5a3c <_sk_callback_hsw+0x328>
+  DB  196,226,125,24,21,246,48,0,0        ; vbroadcastss  0x30f6(%rip),%ymm2        # 5a78 <_sk_callback_hsw+0x330>
   DB  196,193,108,92,210                  ; vsubps        %ymm10,%ymm2,%ymm2
-  DB  196,98,125,24,21,228,48,0,0         ; vbroadcastss  0x30e4(%rip),%ymm10        # 5a40 <_sk_callback_hsw+0x32c>
+  DB  196,98,125,24,21,236,48,0,0         ; vbroadcastss  0x30ec(%rip),%ymm10        # 5a7c <_sk_callback_hsw+0x334>
   DB  197,172,94,210                      ; vdivps        %ymm2,%ymm10,%ymm2
   DB  197,164,88,210                      ; vaddps        %ymm2,%ymm11,%ymm2
-  DB  196,98,125,24,21,215,48,0,0         ; vbroadcastss  0x30d7(%rip),%ymm10        # 5a44 <_sk_callback_hsw+0x330>
+  DB  196,98,125,24,21,223,48,0,0         ; vbroadcastss  0x30df(%rip),%ymm10        # 5a80 <_sk_callback_hsw+0x338>
   DB  196,193,108,89,210                  ; vmulps        %ymm10,%ymm2,%ymm2
   DB  197,253,91,210                      ; vcvtps2dq     %ymm2,%ymm2
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -2453,7 +2473,7 @@
   DB  196,195,109,74,209,128              ; vblendvps     %ymm8,%ymm9,%ymm2,%ymm2
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,108,95,208                  ; vmaxps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,174,48,0,0          ; vbroadcastss  0x30ae(%rip),%ymm8        # 5a48 <_sk_callback_hsw+0x334>
+  DB  196,98,125,24,5,182,48,0,0          ; vbroadcastss  0x30b6(%rip),%ymm8        # 5a84 <_sk_callback_hsw+0x33c>
   DB  196,193,108,93,208                  ; vminps        %ymm8,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2471,33 +2491,33 @@
   DB  196,66,101,168,211                  ; vfmadd213ps   %ymm11,%ymm3,%ymm10
   DB  196,226,125,24,24                   ; vbroadcastss  (%rax),%ymm3
   DB  196,65,124,91,218                   ; vcvtdq2ps     %ymm10,%ymm11
-  DB  196,98,125,24,37,102,48,0,0         ; vbroadcastss  0x3066(%rip),%ymm12        # 5a4c <_sk_callback_hsw+0x338>
-  DB  196,98,125,24,45,97,48,0,0          ; vbroadcastss  0x3061(%rip),%ymm13        # 5a50 <_sk_callback_hsw+0x33c>
+  DB  196,98,125,24,37,110,48,0,0         ; vbroadcastss  0x306e(%rip),%ymm12        # 5a88 <_sk_callback_hsw+0x340>
+  DB  196,98,125,24,45,105,48,0,0         ; vbroadcastss  0x3069(%rip),%ymm13        # 5a8c <_sk_callback_hsw+0x344>
   DB  196,65,44,84,213                    ; vandps        %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,87,48,0,0          ; vbroadcastss  0x3057(%rip),%ymm13        # 5a54 <_sk_callback_hsw+0x340>
+  DB  196,98,125,24,45,95,48,0,0          ; vbroadcastss  0x305f(%rip),%ymm13        # 5a90 <_sk_callback_hsw+0x348>
   DB  196,65,44,86,213                    ; vorps         %ymm13,%ymm10,%ymm10
-  DB  196,98,125,24,45,77,48,0,0          ; vbroadcastss  0x304d(%rip),%ymm13        # 5a58 <_sk_callback_hsw+0x344>
+  DB  196,98,125,24,45,85,48,0,0          ; vbroadcastss  0x3055(%rip),%ymm13        # 5a94 <_sk_callback_hsw+0x34c>
   DB  196,66,37,184,236                   ; vfmadd231ps   %ymm12,%ymm11,%ymm13
-  DB  196,98,125,24,29,67,48,0,0          ; vbroadcastss  0x3043(%rip),%ymm11        # 5a5c <_sk_callback_hsw+0x348>
+  DB  196,98,125,24,29,75,48,0,0          ; vbroadcastss  0x304b(%rip),%ymm11        # 5a98 <_sk_callback_hsw+0x350>
   DB  196,66,45,172,221                   ; vfnmadd213ps  %ymm13,%ymm10,%ymm11
-  DB  196,98,125,24,37,57,48,0,0          ; vbroadcastss  0x3039(%rip),%ymm12        # 5a60 <_sk_callback_hsw+0x34c>
+  DB  196,98,125,24,37,65,48,0,0          ; vbroadcastss  0x3041(%rip),%ymm12        # 5a9c <_sk_callback_hsw+0x354>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,47,48,0,0          ; vbroadcastss  0x302f(%rip),%ymm12        # 5a64 <_sk_callback_hsw+0x350>
+  DB  196,98,125,24,37,55,48,0,0          ; vbroadcastss  0x3037(%rip),%ymm12        # 5aa0 <_sk_callback_hsw+0x358>
   DB  196,65,28,94,210                    ; vdivps        %ymm10,%ymm12,%ymm10
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
   DB  196,193,100,89,218                  ; vmulps        %ymm10,%ymm3,%ymm3
   DB  196,99,125,8,211,1                  ; vroundps      $0x1,%ymm3,%ymm10
   DB  196,65,100,92,210                   ; vsubps        %ymm10,%ymm3,%ymm10
-  DB  196,98,125,24,29,16,48,0,0          ; vbroadcastss  0x3010(%rip),%ymm11        # 5a68 <_sk_callback_hsw+0x354>
+  DB  196,98,125,24,29,24,48,0,0          ; vbroadcastss  0x3018(%rip),%ymm11        # 5aa4 <_sk_callback_hsw+0x35c>
   DB  196,193,100,88,219                  ; vaddps        %ymm11,%ymm3,%ymm3
-  DB  196,98,125,24,29,6,48,0,0           ; vbroadcastss  0x3006(%rip),%ymm11        # 5a6c <_sk_callback_hsw+0x358>
+  DB  196,98,125,24,29,14,48,0,0          ; vbroadcastss  0x300e(%rip),%ymm11        # 5aa8 <_sk_callback_hsw+0x360>
   DB  196,98,45,172,219                   ; vfnmadd213ps  %ymm3,%ymm10,%ymm11
-  DB  196,226,125,24,29,252,47,0,0        ; vbroadcastss  0x2ffc(%rip),%ymm3        # 5a70 <_sk_callback_hsw+0x35c>
+  DB  196,226,125,24,29,4,48,0,0          ; vbroadcastss  0x3004(%rip),%ymm3        # 5aac <_sk_callback_hsw+0x364>
   DB  196,193,100,92,218                  ; vsubps        %ymm10,%ymm3,%ymm3
-  DB  196,98,125,24,21,242,47,0,0         ; vbroadcastss  0x2ff2(%rip),%ymm10        # 5a74 <_sk_callback_hsw+0x360>
+  DB  196,98,125,24,21,250,47,0,0         ; vbroadcastss  0x2ffa(%rip),%ymm10        # 5ab0 <_sk_callback_hsw+0x368>
   DB  197,172,94,219                      ; vdivps        %ymm3,%ymm10,%ymm3
   DB  197,164,88,219                      ; vaddps        %ymm3,%ymm11,%ymm3
-  DB  196,98,125,24,21,229,47,0,0         ; vbroadcastss  0x2fe5(%rip),%ymm10        # 5a78 <_sk_callback_hsw+0x364>
+  DB  196,98,125,24,21,237,47,0,0         ; vbroadcastss  0x2fed(%rip),%ymm10        # 5ab4 <_sk_callback_hsw+0x36c>
   DB  196,193,100,89,218                  ; vmulps        %ymm10,%ymm3,%ymm3
   DB  197,253,91,219                      ; vcvtps2dq     %ymm3,%ymm3
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -2505,33 +2525,33 @@
   DB  196,195,101,74,217,128              ; vblendvps     %ymm8,%ymm9,%ymm3,%ymm3
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,100,95,216                  ; vmaxps        %ymm8,%ymm3,%ymm3
-  DB  196,98,125,24,5,188,47,0,0          ; vbroadcastss  0x2fbc(%rip),%ymm8        # 5a7c <_sk_callback_hsw+0x368>
+  DB  196,98,125,24,5,196,47,0,0          ; vbroadcastss  0x2fc4(%rip),%ymm8        # 5ab8 <_sk_callback_hsw+0x370>
   DB  196,193,100,93,216                  ; vminps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_lab_to_xyz_hsw
 _sk_lab_to_xyz_hsw LABEL PROC
-  DB  196,98,125,24,5,174,47,0,0          ; vbroadcastss  0x2fae(%rip),%ymm8        # 5a80 <_sk_callback_hsw+0x36c>
-  DB  196,98,125,24,13,169,47,0,0         ; vbroadcastss  0x2fa9(%rip),%ymm9        # 5a84 <_sk_callback_hsw+0x370>
-  DB  196,98,125,24,21,164,47,0,0         ; vbroadcastss  0x2fa4(%rip),%ymm10        # 5a88 <_sk_callback_hsw+0x374>
+  DB  196,98,125,24,5,182,47,0,0          ; vbroadcastss  0x2fb6(%rip),%ymm8        # 5abc <_sk_callback_hsw+0x374>
+  DB  196,98,125,24,13,177,47,0,0         ; vbroadcastss  0x2fb1(%rip),%ymm9        # 5ac0 <_sk_callback_hsw+0x378>
+  DB  196,98,125,24,21,172,47,0,0         ; vbroadcastss  0x2fac(%rip),%ymm10        # 5ac4 <_sk_callback_hsw+0x37c>
   DB  196,194,53,168,202                  ; vfmadd213ps   %ymm10,%ymm9,%ymm1
   DB  196,194,53,168,210                  ; vfmadd213ps   %ymm10,%ymm9,%ymm2
-  DB  196,98,125,24,13,149,47,0,0         ; vbroadcastss  0x2f95(%rip),%ymm9        # 5a8c <_sk_callback_hsw+0x378>
+  DB  196,98,125,24,13,157,47,0,0         ; vbroadcastss  0x2f9d(%rip),%ymm9        # 5ac8 <_sk_callback_hsw+0x380>
   DB  196,66,125,184,200                  ; vfmadd231ps   %ymm8,%ymm0,%ymm9
-  DB  196,226,125,24,5,139,47,0,0         ; vbroadcastss  0x2f8b(%rip),%ymm0        # 5a90 <_sk_callback_hsw+0x37c>
+  DB  196,226,125,24,5,147,47,0,0         ; vbroadcastss  0x2f93(%rip),%ymm0        # 5acc <_sk_callback_hsw+0x384>
   DB  197,180,89,192                      ; vmulps        %ymm0,%ymm9,%ymm0
-  DB  196,98,125,24,5,130,47,0,0          ; vbroadcastss  0x2f82(%rip),%ymm8        # 5a94 <_sk_callback_hsw+0x380>
+  DB  196,98,125,24,5,138,47,0,0          ; vbroadcastss  0x2f8a(%rip),%ymm8        # 5ad0 <_sk_callback_hsw+0x388>
   DB  196,98,117,168,192                  ; vfmadd213ps   %ymm0,%ymm1,%ymm8
-  DB  196,98,125,24,13,120,47,0,0         ; vbroadcastss  0x2f78(%rip),%ymm9        # 5a98 <_sk_callback_hsw+0x384>
+  DB  196,98,125,24,13,128,47,0,0         ; vbroadcastss  0x2f80(%rip),%ymm9        # 5ad4 <_sk_callback_hsw+0x38c>
   DB  196,98,109,172,200                  ; vfnmadd213ps  %ymm0,%ymm2,%ymm9
   DB  196,193,60,89,200                   ; vmulps        %ymm8,%ymm8,%ymm1
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
-  DB  196,226,125,24,21,101,47,0,0        ; vbroadcastss  0x2f65(%rip),%ymm2        # 5a9c <_sk_callback_hsw+0x388>
+  DB  196,226,125,24,21,109,47,0,0        ; vbroadcastss  0x2f6d(%rip),%ymm2        # 5ad8 <_sk_callback_hsw+0x390>
   DB  197,108,194,209,1                   ; vcmpltps      %ymm1,%ymm2,%ymm10
-  DB  196,98,125,24,29,91,47,0,0          ; vbroadcastss  0x2f5b(%rip),%ymm11        # 5aa0 <_sk_callback_hsw+0x38c>
+  DB  196,98,125,24,29,99,47,0,0          ; vbroadcastss  0x2f63(%rip),%ymm11        # 5adc <_sk_callback_hsw+0x394>
   DB  196,65,60,88,195                    ; vaddps        %ymm11,%ymm8,%ymm8
-  DB  196,98,125,24,37,81,47,0,0          ; vbroadcastss  0x2f51(%rip),%ymm12        # 5aa4 <_sk_callback_hsw+0x390>
+  DB  196,98,125,24,37,89,47,0,0          ; vbroadcastss  0x2f59(%rip),%ymm12        # 5ae0 <_sk_callback_hsw+0x398>
   DB  196,65,60,89,196                    ; vmulps        %ymm12,%ymm8,%ymm8
   DB  196,99,61,74,193,160                ; vblendvps     %ymm10,%ymm1,%ymm8,%ymm8
   DB  197,252,89,200                      ; vmulps        %ymm0,%ymm0,%ymm1
@@ -2546,9 +2566,9 @@
   DB  196,65,52,88,203                    ; vaddps        %ymm11,%ymm9,%ymm9
   DB  196,65,52,89,204                    ; vmulps        %ymm12,%ymm9,%ymm9
   DB  196,227,53,74,208,32                ; vblendvps     %ymm2,%ymm0,%ymm9,%ymm2
-  DB  196,226,125,24,5,6,47,0,0           ; vbroadcastss  0x2f06(%rip),%ymm0        # 5aa8 <_sk_callback_hsw+0x394>
+  DB  196,226,125,24,5,14,47,0,0          ; vbroadcastss  0x2f0e(%rip),%ymm0        # 5ae4 <_sk_callback_hsw+0x39c>
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
-  DB  196,98,125,24,5,253,46,0,0          ; vbroadcastss  0x2efd(%rip),%ymm8        # 5aac <_sk_callback_hsw+0x398>
+  DB  196,98,125,24,5,5,47,0,0            ; vbroadcastss  0x2f05(%rip),%ymm8        # 5ae8 <_sk_callback_hsw+0x3a0>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2558,12 +2578,12 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,52                              ; jne           2bf6 <_sk_load_a8_hsw+0x3e>
+  DB  117,52                              ; jne           2c2a <_sk_load_a8_hsw+0x3e>
   DB  196,194,121,48,4,19                 ; vpmovzxbw     (%r11,%rdx,1),%xmm0
-  DB  197,249,219,5,208,52,0,0            ; vpand         0x34d0(%rip),%xmm0,%xmm0        # 60a0 <_sk_callback_hsw+0x98c>
+  DB  197,249,219,5,220,52,0,0            ; vpand         0x34dc(%rip),%xmm0,%xmm0        # 60e0 <_sk_callback_hsw+0x998>
   DB  196,226,125,51,192                  ; vpmovzxwd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,206,46,0,0        ; vbroadcastss  0x2ece(%rip),%ymm1        # 5ab0 <_sk_callback_hsw+0x39c>
+  DB  196,226,125,24,13,214,46,0,0        ; vbroadcastss  0x2ed6(%rip),%ymm1        # 5aec <_sk_callback_hsw+0x3a4>
   DB  197,252,89,217                      ; vmulps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -2575,15 +2595,15 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,190                             ; ja            2bc8 <_sk_load_a8_hsw+0x10>
+  DB  119,190                             ; ja            2bfc <_sk_load_a8_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,119,0,0,0                 ; lea           0x77(%rip),%r10        # 2c8c <_sk_load_a8_hsw+0xd4>
+  DB  76,141,21,119,0,0,0                 ; lea           0x77(%rip),%r10        # 2cc0 <_sk_load_a8_hsw+0xd4>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  235,159                             ; jmp           2bc8 <_sk_load_a8_hsw+0x10>
+  DB  235,159                             ; jmp           2bfc <_sk_load_a8_hsw+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,2                   ; vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -2591,7 +2611,7 @@
   DB  197,249,110,200                     ; vmovd         %eax,%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,121,2,193,1                 ; vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  DB  233,119,255,255,255                 ; jmpq          2bc8 <_sk_load_a8_hsw+0x10>
+  DB  233,119,255,255,255                 ; jmpq          2bfc <_sk_load_a8_hsw+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,6                   ; vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -2602,7 +2622,7 @@
   DB  196,193,121,110,12,19               ; vmovd         (%r11,%rdx,1),%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,113,2,192,12                ; vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  DB  233,60,255,255,255                  ; jmpq          2bc8 <_sk_load_a8_hsw+0x10>
+  DB  233,60,255,255,255                  ; jmpq          2bfc <_sk_load_a8_hsw+0x10>
   DB  146                                 ; xchg          %eax,%edx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -2628,12 +2648,12 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,52                              ; jne           2ce6 <_sk_load_a8_dst_hsw+0x3e>
+  DB  117,52                              ; jne           2d1a <_sk_load_a8_dst_hsw+0x3e>
   DB  196,194,121,48,36,19                ; vpmovzxbw     (%r11,%rdx,1),%xmm4
-  DB  197,217,219,37,240,51,0,0           ; vpand         0x33f0(%rip),%xmm4,%xmm4        # 60b0 <_sk_callback_hsw+0x99c>
+  DB  197,217,219,37,252,51,0,0           ; vpand         0x33fc(%rip),%xmm4,%xmm4        # 60f0 <_sk_callback_hsw+0x9a8>
   DB  196,226,125,51,228                  ; vpmovzxwd     %xmm4,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,226,45,0,0        ; vbroadcastss  0x2de2(%rip),%ymm5        # 5ab4 <_sk_callback_hsw+0x3a0>
+  DB  196,226,125,24,45,234,45,0,0        ; vbroadcastss  0x2dea(%rip),%ymm5        # 5af0 <_sk_callback_hsw+0x3a8>
   DB  197,220,89,253                      ; vmulps        %ymm5,%ymm4,%ymm7
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,220,87,228                      ; vxorps        %ymm4,%ymm4,%ymm4
@@ -2645,15 +2665,15 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,190                             ; ja            2cb8 <_sk_load_a8_dst_hsw+0x10>
+  DB  119,190                             ; ja            2cec <_sk_load_a8_dst_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,119,0,0,0                 ; lea           0x77(%rip),%r10        # 2d7c <_sk_load_a8_dst_hsw+0xd4>
+  DB  76,141,21,119,0,0,0                 ; lea           0x77(%rip),%r10        # 2db0 <_sk_load_a8_dst_hsw+0xd4>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  235,159                             ; jmp           2cb8 <_sk_load_a8_dst_hsw+0x10>
+  DB  235,159                             ; jmp           2cec <_sk_load_a8_dst_hsw+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,2                   ; vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -2661,7 +2681,7 @@
   DB  197,249,110,232                     ; vmovd         %eax,%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,89,2,229,1                  ; vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  DB  233,119,255,255,255                 ; jmpq          2cb8 <_sk_load_a8_dst_hsw+0x10>
+  DB  233,119,255,255,255                 ; jmpq          2cec <_sk_load_a8_dst_hsw+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,6                   ; vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -2672,7 +2692,7 @@
   DB  196,193,121,110,44,19               ; vmovd         (%r11,%rdx,1),%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,81,2,228,12                 ; vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  DB  233,60,255,255,255                  ; jmpq          2cb8 <_sk_load_a8_dst_hsw+0x10>
+  DB  233,60,255,255,255                  ; jmpq          2cec <_sk_load_a8_dst_hsw+0x10>
   DB  146                                 ; xchg          %eax,%edx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -2731,7 +2751,7 @@
   DB  196,227,121,32,192,7                ; vpinsrb       $0x7,%eax,%xmm0,%xmm0
   DB  196,226,125,49,192                  ; vpmovzxbd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,106,44,0,0        ; vbroadcastss  0x2c6a(%rip),%ymm1        # 5ab8 <_sk_callback_hsw+0x3a4>
+  DB  196,226,125,24,13,114,44,0,0        ; vbroadcastss  0x2c72(%rip),%ymm1        # 5af4 <_sk_callback_hsw+0x3ac>
   DB  197,252,89,217                      ; vmulps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -2743,14 +2763,14 @@
 _sk_store_a8_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
-  DB  196,98,125,24,5,76,44,0,0           ; vbroadcastss  0x2c4c(%rip),%ymm8        # 5abc <_sk_callback_hsw+0x3a8>
+  DB  196,98,125,24,5,84,44,0,0           ; vbroadcastss  0x2c54(%rip),%ymm8        # 5af8 <_sk_callback_hsw+0x3b0>
   DB  196,65,100,89,192                   ; vmulps        %ymm8,%ymm3,%ymm8
   DB  196,65,125,91,192                   ; vcvtps2dq     %ymm8,%ymm8
   DB  196,67,125,25,193,1                 ; vextractf128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  196,65,57,103,192                   ; vpackuswb     %xmm8,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           2e99 <_sk_store_a8_hsw+0x37>
+  DB  117,10                              ; jne           2ecd <_sk_store_a8_hsw+0x37>
   DB  196,65,123,17,4,19                  ; vmovsd        %xmm8,(%r11,%rdx,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -2758,25 +2778,25 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,236                             ; ja            2e95 <_sk_store_a8_hsw+0x33>
+  DB  119,236                             ; ja            2ec9 <_sk_store_a8_hsw+0x33>
   DB  196,66,121,48,192                   ; vpmovzxbw     %xmm8,%xmm8
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,87,0,0,0                  ; lea           0x57(%rip),%r10        # 2f10 <_sk_store_a8_hsw+0xae>
+  DB  76,141,21,87,0,0,0                  ; lea           0x57(%rip),%r10        # 2f44 <_sk_store_a8_hsw+0xae>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,20,4,19,0                ; vpextrb       $0x0,%xmm8,(%r11,%rdx,1)
-  DB  235,202                             ; jmp           2e95 <_sk_store_a8_hsw+0x33>
+  DB  235,202                             ; jmp           2ec9 <_sk_store_a8_hsw+0x33>
   DB  196,67,121,20,68,19,2,4             ; vpextrb       $0x4,%xmm8,0x2(%r11,%rdx,1)
-  DB  196,98,57,0,5,228,49,0,0            ; vpshufb       0x31e4(%rip),%xmm8,%xmm8        # 60c0 <_sk_callback_hsw+0x9ac>
+  DB  196,98,57,0,5,240,49,0,0            ; vpshufb       0x31f0(%rip),%xmm8,%xmm8        # 6100 <_sk_callback_hsw+0x9b8>
   DB  196,67,121,21,4,19,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,1)
-  DB  235,176                             ; jmp           2e95 <_sk_store_a8_hsw+0x33>
+  DB  235,176                             ; jmp           2ec9 <_sk_store_a8_hsw+0x33>
   DB  196,67,121,20,68,19,6,12            ; vpextrb       $0xc,%xmm8,0x6(%r11,%rdx,1)
   DB  196,67,121,20,68,19,5,10            ; vpextrb       $0xa,%xmm8,0x5(%r11,%rdx,1)
   DB  196,67,121,20,68,19,4,8             ; vpextrb       $0x8,%xmm8,0x4(%r11,%rdx,1)
-  DB  196,98,57,0,5,202,49,0,0            ; vpshufb       0x31ca(%rip),%xmm8,%xmm8        # 60d0 <_sk_callback_hsw+0x9bc>
+  DB  196,98,57,0,5,214,49,0,0            ; vpshufb       0x31d6(%rip),%xmm8,%xmm8        # 6110 <_sk_callback_hsw+0x9c8>
   DB  196,65,121,126,4,19                 ; vmovd         %xmm8,(%r11,%rdx,1)
-  DB  235,135                             ; jmp           2e95 <_sk_store_a8_hsw+0x33>
+  DB  235,135                             ; jmp           2ec9 <_sk_store_a8_hsw+0x33>
   DB  102,144                             ; xchg          %ax,%ax
   DB  178,255                             ; mov           $0xff,%dl
   DB  255                                 ; (bad)
@@ -2803,15 +2823,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,57                              ; jne           2f6f <_sk_load_g8_hsw+0x43>
+  DB  117,57                              ; jne           2fa3 <_sk_load_g8_hsw+0x43>
   DB  196,194,121,48,4,19                 ; vpmovzxbw     (%r11,%rdx,1),%xmm0
-  DB  197,249,219,5,156,49,0,0            ; vpand         0x319c(%rip),%xmm0,%xmm0        # 60e0 <_sk_callback_hsw+0x9cc>
+  DB  197,249,219,5,168,49,0,0            ; vpand         0x31a8(%rip),%xmm0,%xmm0        # 6120 <_sk_callback_hsw+0x9d8>
   DB  196,226,125,51,192                  ; vpmovzxwd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,106,43,0,0        ; vbroadcastss  0x2b6a(%rip),%ymm1        # 5ac0 <_sk_callback_hsw+0x3ac>
+  DB  196,226,125,24,13,114,43,0,0        ; vbroadcastss  0x2b72(%rip),%ymm1        # 5afc <_sk_callback_hsw+0x3b4>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,95,43,0,0         ; vbroadcastss  0x2b5f(%rip),%ymm3        # 5ac4 <_sk_callback_hsw+0x3b0>
+  DB  196,226,125,24,29,103,43,0,0        ; vbroadcastss  0x2b67(%rip),%ymm3        # 5b00 <_sk_callback_hsw+0x3b8>
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
   DB  255,224                             ; jmpq          *%rax
@@ -2820,15 +2840,15 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,185                             ; ja            2f3c <_sk_load_g8_hsw+0x10>
+  DB  119,185                             ; ja            2f70 <_sk_load_g8_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,122,0,0,0                 ; lea           0x7a(%rip),%r10        # 3008 <_sk_load_g8_hsw+0xdc>
+  DB  76,141,21,122,0,0,0                 ; lea           0x7a(%rip),%r10        # 303c <_sk_load_g8_hsw+0xdc>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  235,154                             ; jmp           2f3c <_sk_load_g8_hsw+0x10>
+  DB  235,154                             ; jmp           2f70 <_sk_load_g8_hsw+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,2                   ; vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -2836,7 +2856,7 @@
   DB  197,249,110,200                     ; vmovd         %eax,%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,121,2,193,1                 ; vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  DB  233,114,255,255,255                 ; jmpq          2f3c <_sk_load_g8_hsw+0x10>
+  DB  233,114,255,255,255                 ; jmpq          2f70 <_sk_load_g8_hsw+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,6                   ; vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -2847,7 +2867,7 @@
   DB  196,193,121,110,12,19               ; vmovd         (%r11,%rdx,1),%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,113,2,192,12                ; vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  DB  233,55,255,255,255                  ; jmpq          2f3c <_sk_load_g8_hsw+0x10>
+  DB  233,55,255,255,255                  ; jmpq          2f70 <_sk_load_g8_hsw+0x10>
   DB  15,31,0                             ; nopl          (%rax)
   DB  143                                 ; (bad)
   DB  255                                 ; (bad)
@@ -2874,15 +2894,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,57                              ; jne           3067 <_sk_load_g8_dst_hsw+0x43>
+  DB  117,57                              ; jne           309b <_sk_load_g8_dst_hsw+0x43>
   DB  196,194,121,48,36,19                ; vpmovzxbw     (%r11,%rdx,1),%xmm4
-  DB  197,217,219,37,180,48,0,0           ; vpand         0x30b4(%rip),%xmm4,%xmm4        # 60f0 <_sk_callback_hsw+0x9dc>
+  DB  197,217,219,37,192,48,0,0           ; vpand         0x30c0(%rip),%xmm4,%xmm4        # 6130 <_sk_callback_hsw+0x9e8>
   DB  196,226,125,51,228                  ; vpmovzxwd     %xmm4,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,122,42,0,0        ; vbroadcastss  0x2a7a(%rip),%ymm5        # 5ac8 <_sk_callback_hsw+0x3b4>
+  DB  196,226,125,24,45,130,42,0,0        ; vbroadcastss  0x2a82(%rip),%ymm5        # 5b04 <_sk_callback_hsw+0x3bc>
   DB  197,220,89,229                      ; vmulps        %ymm5,%ymm4,%ymm4
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,61,111,42,0,0        ; vbroadcastss  0x2a6f(%rip),%ymm7        # 5acc <_sk_callback_hsw+0x3b8>
+  DB  196,226,125,24,61,119,42,0,0        ; vbroadcastss  0x2a77(%rip),%ymm7        # 5b08 <_sk_callback_hsw+0x3c0>
   DB  197,252,40,236                      ; vmovaps       %ymm4,%ymm5
   DB  197,252,40,244                      ; vmovaps       %ymm4,%ymm6
   DB  255,224                             ; jmpq          *%rax
@@ -2891,15 +2911,15 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,185                             ; ja            3034 <_sk_load_g8_dst_hsw+0x10>
+  DB  119,185                             ; ja            3068 <_sk_load_g8_dst_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,122,0,0,0                 ; lea           0x7a(%rip),%r10        # 3100 <_sk_load_g8_dst_hsw+0xdc>
+  DB  76,141,21,122,0,0,0                 ; lea           0x7a(%rip),%r10        # 3134 <_sk_load_g8_dst_hsw+0xdc>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  235,154                             ; jmp           3034 <_sk_load_g8_dst_hsw+0x10>
+  DB  235,154                             ; jmp           3068 <_sk_load_g8_dst_hsw+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,2                   ; vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -2907,7 +2927,7 @@
   DB  197,249,110,232                     ; vmovd         %eax,%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,89,2,229,1                  ; vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  DB  233,114,255,255,255                 ; jmpq          3034 <_sk_load_g8_dst_hsw+0x10>
+  DB  233,114,255,255,255                 ; jmpq          3068 <_sk_load_g8_dst_hsw+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,6                   ; vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -2918,7 +2938,7 @@
   DB  196,193,121,110,44,19               ; vmovd         (%r11,%rdx,1),%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,81,2,228,12                 ; vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  DB  233,55,255,255,255                  ; jmpq          3034 <_sk_load_g8_dst_hsw+0x10>
+  DB  233,55,255,255,255                  ; jmpq          3068 <_sk_load_g8_dst_hsw+0x10>
   DB  15,31,0                             ; nopl          (%rax)
   DB  143                                 ; (bad)
   DB  255                                 ; (bad)
@@ -2978,10 +2998,10 @@
   DB  196,227,121,32,192,7                ; vpinsrb       $0x7,%eax,%xmm0,%xmm0
   DB  196,226,125,49,192                  ; vpmovzxbd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,254,40,0,0        ; vbroadcastss  0x28fe(%rip),%ymm1        # 5ad0 <_sk_callback_hsw+0x3bc>
+  DB  196,226,125,24,13,6,41,0,0          ; vbroadcastss  0x2906(%rip),%ymm1        # 5b0c <_sk_callback_hsw+0x3c4>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,243,40,0,0        ; vbroadcastss  0x28f3(%rip),%ymm3        # 5ad4 <_sk_callback_hsw+0x3c0>
+  DB  196,226,125,24,29,251,40,0,0        ; vbroadcastss  0x28fb(%rip),%ymm3        # 5b10 <_sk_callback_hsw+0x3c8>
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
   DB  255,224                             ; jmpq          *%rax
@@ -2991,9 +3011,9 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,137,193                          ; mov           %rax,%r9
   DB  77,133,201                          ; test          %r9,%r9
-  DB  116,5                               ; je            31fa <_sk_gather_i8_hsw+0xf>
+  DB  116,5                               ; je            322e <_sk_gather_i8_hsw+0xf>
   DB  76,137,200                          ; mov           %r9,%rax
-  DB  235,2                               ; jmp           31fc <_sk_gather_i8_hsw+0x11>
+  DB  235,2                               ; jmp           3230 <_sk_gather_i8_hsw+0x11>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  83                                  ; push          %rbx
   DB  76,139,16                           ; mov           (%rax),%r10
@@ -3027,14 +3047,14 @@
   DB  73,139,65,8                         ; mov           0x8(%r9),%rax
   DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
   DB  196,226,117,144,28,128              ; vpgatherdd    %ymm1,(%rax,%ymm0,4),%ymm3
-  DB  197,229,219,5,31,43,0,0             ; vpand         0x2b1f(%rip),%ymm3,%ymm0        # 5dc0 <_sk_callback_hsw+0x6ac>
+  DB  197,229,219,5,43,43,0,0             ; vpand         0x2b2b(%rip),%ymm3,%ymm0        # 5e00 <_sk_callback_hsw+0x6b8>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,42,40,0,0           ; vbroadcastss  0x282a(%rip),%ymm8        # 5ad8 <_sk_callback_hsw+0x3c4>
+  DB  196,98,125,24,5,50,40,0,0           ; vbroadcastss  0x2832(%rip),%ymm8        # 5b14 <_sk_callback_hsw+0x3cc>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,226,101,0,13,36,43,0,0          ; vpshufb       0x2b24(%rip),%ymm3,%ymm1        # 5de0 <_sk_callback_hsw+0x6cc>
+  DB  196,226,101,0,13,48,43,0,0          ; vpshufb       0x2b30(%rip),%ymm3,%ymm1        # 5e20 <_sk_callback_hsw+0x6d8>
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
-  DB  196,226,101,0,21,50,43,0,0          ; vpshufb       0x2b32(%rip),%ymm3,%ymm2        # 5e00 <_sk_callback_hsw+0x6ec>
+  DB  196,226,101,0,21,62,43,0,0          ; vpshufb       0x2b3e(%rip),%ymm3,%ymm2        # 5e40 <_sk_callback_hsw+0x6f8>
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
@@ -3049,53 +3069,53 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,114                             ; jne           3366 <_sk_load_565_hsw+0x7c>
+  DB  117,114                             ; jne           339a <_sk_load_565_hsw+0x7c>
   DB  196,193,122,111,4,83                ; vmovdqu       (%r11,%rdx,2),%xmm0
   DB  196,226,125,51,208                  ; vpmovzxwd     %xmm0,%ymm2
-  DB  196,226,125,88,5,212,39,0,0         ; vpbroadcastd  0x27d4(%rip),%ymm0        # 5adc <_sk_callback_hsw+0x3c8>
+  DB  196,226,125,88,5,220,39,0,0         ; vpbroadcastd  0x27dc(%rip),%ymm0        # 5b18 <_sk_callback_hsw+0x3d0>
   DB  197,237,219,192                     ; vpand         %ymm0,%ymm2,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,199,39,0,0        ; vbroadcastss  0x27c7(%rip),%ymm1        # 5ae0 <_sk_callback_hsw+0x3cc>
+  DB  196,226,125,24,13,207,39,0,0        ; vbroadcastss  0x27cf(%rip),%ymm1        # 5b1c <_sk_callback_hsw+0x3d4>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,88,13,190,39,0,0        ; vpbroadcastd  0x27be(%rip),%ymm1        # 5ae4 <_sk_callback_hsw+0x3d0>
+  DB  196,226,125,88,13,198,39,0,0        ; vpbroadcastd  0x27c6(%rip),%ymm1        # 5b20 <_sk_callback_hsw+0x3d8>
   DB  197,237,219,201                     ; vpand         %ymm1,%ymm2,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,29,177,39,0,0        ; vbroadcastss  0x27b1(%rip),%ymm3        # 5ae8 <_sk_callback_hsw+0x3d4>
+  DB  196,226,125,24,29,185,39,0,0        ; vbroadcastss  0x27b9(%rip),%ymm3        # 5b24 <_sk_callback_hsw+0x3dc>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
-  DB  196,226,125,88,29,168,39,0,0        ; vpbroadcastd  0x27a8(%rip),%ymm3        # 5aec <_sk_callback_hsw+0x3d8>
+  DB  196,226,125,88,29,176,39,0,0        ; vpbroadcastd  0x27b0(%rip),%ymm3        # 5b28 <_sk_callback_hsw+0x3e0>
   DB  197,237,219,211                     ; vpand         %ymm3,%ymm2,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,226,125,24,29,155,39,0,0        ; vbroadcastss  0x279b(%rip),%ymm3        # 5af0 <_sk_callback_hsw+0x3dc>
+  DB  196,226,125,24,29,163,39,0,0        ; vbroadcastss  0x27a3(%rip),%ymm3        # 5b2c <_sk_callback_hsw+0x3e4>
   DB  197,236,89,211                      ; vmulps        %ymm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,144,39,0,0        ; vbroadcastss  0x2790(%rip),%ymm3        # 5af4 <_sk_callback_hsw+0x3e0>
+  DB  196,226,125,24,29,152,39,0,0        ; vbroadcastss  0x2798(%rip),%ymm3        # 5b30 <_sk_callback_hsw+0x3e8>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,128                             ; ja            32fa <_sk_load_565_hsw+0x10>
+  DB  119,128                             ; ja            332e <_sk_load_565_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 33e8 <_sk_load_565_hsw+0xfe>
+  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 341c <_sk_load_565_hsw+0xfe>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  233,94,255,255,255                  ; jmpq          32fa <_sk_load_565_hsw+0x10>
+  DB  233,94,255,255,255                  ; jmpq          332e <_sk_load_565_hsw+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,110,12,83               ; vmovd         (%r11,%rdx,2),%xmm1
   DB  196,227,121,2,193,1                 ; vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  DB  233,65,255,255,255                  ; jmpq          32fa <_sk_load_565_hsw+0x10>
+  DB  233,65,255,255,255                  ; jmpq          332e <_sk_load_565_hsw+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,122,126,12,83               ; vmovq         (%r11,%rdx,2),%xmm1
   DB  196,227,113,2,192,12                ; vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  DB  233,20,255,255,255                  ; jmpq          32fa <_sk_load_565_hsw+0x10>
+  DB  233,20,255,255,255                  ; jmpq          332e <_sk_load_565_hsw+0x10>
   DB  102,144                             ; xchg          %ax,%ax
   DB  166                                 ; cmpsb         %es:(%rdi),%ds:(%rsi)
   DB  255                                 ; (bad)
@@ -3121,53 +3141,53 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,114                             ; jne           3480 <_sk_load_565_dst_hsw+0x7c>
+  DB  117,114                             ; jne           34b4 <_sk_load_565_dst_hsw+0x7c>
   DB  196,193,122,111,36,83               ; vmovdqu       (%r11,%rdx,2),%xmm4
   DB  196,226,125,51,244                  ; vpmovzxwd     %xmm4,%ymm6
-  DB  196,226,125,88,37,214,38,0,0        ; vpbroadcastd  0x26d6(%rip),%ymm4        # 5af8 <_sk_callback_hsw+0x3e4>
+  DB  196,226,125,88,37,222,38,0,0        ; vpbroadcastd  0x26de(%rip),%ymm4        # 5b34 <_sk_callback_hsw+0x3ec>
   DB  197,205,219,228                     ; vpand         %ymm4,%ymm6,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,201,38,0,0        ; vbroadcastss  0x26c9(%rip),%ymm5        # 5afc <_sk_callback_hsw+0x3e8>
+  DB  196,226,125,24,45,209,38,0,0        ; vbroadcastss  0x26d1(%rip),%ymm5        # 5b38 <_sk_callback_hsw+0x3f0>
   DB  197,220,89,229                      ; vmulps        %ymm5,%ymm4,%ymm4
-  DB  196,226,125,88,45,192,38,0,0        ; vpbroadcastd  0x26c0(%rip),%ymm5        # 5b00 <_sk_callback_hsw+0x3ec>
+  DB  196,226,125,88,45,200,38,0,0        ; vpbroadcastd  0x26c8(%rip),%ymm5        # 5b3c <_sk_callback_hsw+0x3f4>
   DB  197,205,219,237                     ; vpand         %ymm5,%ymm6,%ymm5
   DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
-  DB  196,226,125,24,61,179,38,0,0        ; vbroadcastss  0x26b3(%rip),%ymm7        # 5b04 <_sk_callback_hsw+0x3f0>
+  DB  196,226,125,24,61,187,38,0,0        ; vbroadcastss  0x26bb(%rip),%ymm7        # 5b40 <_sk_callback_hsw+0x3f8>
   DB  197,212,89,239                      ; vmulps        %ymm7,%ymm5,%ymm5
-  DB  196,226,125,88,61,170,38,0,0        ; vpbroadcastd  0x26aa(%rip),%ymm7        # 5b08 <_sk_callback_hsw+0x3f4>
+  DB  196,226,125,88,61,178,38,0,0        ; vpbroadcastd  0x26b2(%rip),%ymm7        # 5b44 <_sk_callback_hsw+0x3fc>
   DB  197,205,219,247                     ; vpand         %ymm7,%ymm6,%ymm6
   DB  197,252,91,246                      ; vcvtdq2ps     %ymm6,%ymm6
-  DB  196,226,125,24,61,157,38,0,0        ; vbroadcastss  0x269d(%rip),%ymm7        # 5b0c <_sk_callback_hsw+0x3f8>
+  DB  196,226,125,24,61,165,38,0,0        ; vbroadcastss  0x26a5(%rip),%ymm7        # 5b48 <_sk_callback_hsw+0x400>
   DB  197,204,89,247                      ; vmulps        %ymm7,%ymm6,%ymm6
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,61,146,38,0,0        ; vbroadcastss  0x2692(%rip),%ymm7        # 5b10 <_sk_callback_hsw+0x3fc>
+  DB  196,226,125,24,61,154,38,0,0        ; vbroadcastss  0x269a(%rip),%ymm7        # 5b4c <_sk_callback_hsw+0x404>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,128                             ; ja            3414 <_sk_load_565_dst_hsw+0x10>
+  DB  119,128                             ; ja            3448 <_sk_load_565_dst_hsw+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,97,0,0,0                  ; lea           0x61(%rip),%r10        # 3500 <_sk_load_565_dst_hsw+0xfc>
+  DB  76,141,21,97,0,0,0                  ; lea           0x61(%rip),%r10        # 3534 <_sk_load_565_dst_hsw+0xfc>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  233,94,255,255,255                  ; jmpq          3414 <_sk_load_565_dst_hsw+0x10>
+  DB  233,94,255,255,255                  ; jmpq          3448 <_sk_load_565_dst_hsw+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,121,110,44,83               ; vmovd         (%r11,%rdx,2),%xmm5
   DB  196,227,89,2,229,1                  ; vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  DB  233,65,255,255,255                  ; jmpq          3414 <_sk_load_565_dst_hsw+0x10>
+  DB  233,65,255,255,255                  ; jmpq          3448 <_sk_load_565_dst_hsw+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,122,126,44,83               ; vmovq         (%r11,%rdx,2),%xmm5
   DB  196,227,81,2,228,12                 ; vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  DB  233,20,255,255,255                  ; jmpq          3414 <_sk_load_565_dst_hsw+0x10>
+  DB  233,20,255,255,255                  ; jmpq          3448 <_sk_load_565_dst_hsw+0x10>
   DB  168,255                             ; test          $0xff,%al
   DB  255                                 ; (bad)
   DB  255,194                             ; inc           %edx
@@ -3226,34 +3246,34 @@
   DB  67,15,183,4,89                      ; movzwl        (%r9,%r11,2),%eax
   DB  197,249,196,192,7                   ; vpinsrw       $0x7,%eax,%xmm0,%xmm0
   DB  196,226,125,51,208                  ; vpmovzxwd     %xmm0,%ymm2
-  DB  196,226,125,88,5,71,37,0,0          ; vpbroadcastd  0x2547(%rip),%ymm0        # 5b14 <_sk_callback_hsw+0x400>
+  DB  196,226,125,88,5,79,37,0,0          ; vpbroadcastd  0x254f(%rip),%ymm0        # 5b50 <_sk_callback_hsw+0x408>
   DB  197,237,219,192                     ; vpand         %ymm0,%ymm2,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,58,37,0,0         ; vbroadcastss  0x253a(%rip),%ymm1        # 5b18 <_sk_callback_hsw+0x404>
+  DB  196,226,125,24,13,66,37,0,0         ; vbroadcastss  0x2542(%rip),%ymm1        # 5b54 <_sk_callback_hsw+0x40c>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,88,13,49,37,0,0         ; vpbroadcastd  0x2531(%rip),%ymm1        # 5b1c <_sk_callback_hsw+0x408>
+  DB  196,226,125,88,13,57,37,0,0         ; vpbroadcastd  0x2539(%rip),%ymm1        # 5b58 <_sk_callback_hsw+0x410>
   DB  197,237,219,201                     ; vpand         %ymm1,%ymm2,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,29,36,37,0,0         ; vbroadcastss  0x2524(%rip),%ymm3        # 5b20 <_sk_callback_hsw+0x40c>
+  DB  196,226,125,24,29,44,37,0,0         ; vbroadcastss  0x252c(%rip),%ymm3        # 5b5c <_sk_callback_hsw+0x414>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
-  DB  196,226,125,88,29,27,37,0,0         ; vpbroadcastd  0x251b(%rip),%ymm3        # 5b24 <_sk_callback_hsw+0x410>
+  DB  196,226,125,88,29,35,37,0,0         ; vpbroadcastd  0x2523(%rip),%ymm3        # 5b60 <_sk_callback_hsw+0x418>
   DB  197,237,219,211                     ; vpand         %ymm3,%ymm2,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,226,125,24,29,14,37,0,0         ; vbroadcastss  0x250e(%rip),%ymm3        # 5b28 <_sk_callback_hsw+0x414>
+  DB  196,226,125,24,29,22,37,0,0         ; vbroadcastss  0x2516(%rip),%ymm3        # 5b64 <_sk_callback_hsw+0x41c>
   DB  197,236,89,211                      ; vmulps        %ymm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,3,37,0,0          ; vbroadcastss  0x2503(%rip),%ymm3        # 5b2c <_sk_callback_hsw+0x418>
+  DB  196,226,125,24,29,11,37,0,0         ; vbroadcastss  0x250b(%rip),%ymm3        # 5b68 <_sk_callback_hsw+0x420>
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_store_565_hsw
 _sk_store_565_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
-  DB  196,98,125,24,5,247,36,0,0          ; vbroadcastss  0x24f7(%rip),%ymm8        # 5b30 <_sk_callback_hsw+0x41c>
+  DB  196,98,125,24,5,255,36,0,0          ; vbroadcastss  0x24ff(%rip),%ymm8        # 5b6c <_sk_callback_hsw+0x424>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,193,53,114,241,11               ; vpslld        $0xb,%ymm9,%ymm9
-  DB  196,98,125,24,21,226,36,0,0         ; vbroadcastss  0x24e2(%rip),%ymm10        # 5b34 <_sk_callback_hsw+0x420>
+  DB  196,98,125,24,21,234,36,0,0         ; vbroadcastss  0x24ea(%rip),%ymm10        # 5b70 <_sk_callback_hsw+0x428>
   DB  196,65,116,89,210                   ; vmulps        %ymm10,%ymm1,%ymm10
   DB  196,65,125,91,210                   ; vcvtps2dq     %ymm10,%ymm10
   DB  196,193,45,114,242,5                ; vpslld        $0x5,%ymm10,%ymm10
@@ -3264,7 +3284,7 @@
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           3690 <_sk_store_565_hsw+0x65>
+  DB  117,10                              ; jne           36c4 <_sk_store_565_hsw+0x65>
   DB  196,65,122,127,4,83                 ; vmovdqu       %xmm8,(%r11,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -3272,22 +3292,22 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,236                             ; ja            368c <_sk_store_565_hsw+0x61>
+  DB  119,236                             ; ja            36c0 <_sk_store_565_hsw+0x61>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,69,0,0,0                  ; lea           0x45(%rip),%r10        # 36f0 <_sk_store_565_hsw+0xc5>
+  DB  76,141,21,69,0,0,0                  ; lea           0x45(%rip),%r10        # 3724 <_sk_store_565_hsw+0xc5>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,21,4,83,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  DB  235,207                             ; jmp           368c <_sk_store_565_hsw+0x61>
+  DB  235,207                             ; jmp           36c0 <_sk_store_565_hsw+0x61>
   DB  196,67,121,21,68,83,4,2             ; vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   DB  196,65,121,126,4,83                 ; vmovd         %xmm8,(%r11,%rdx,2)
-  DB  235,191                             ; jmp           368c <_sk_store_565_hsw+0x61>
+  DB  235,191                             ; jmp           36c0 <_sk_store_565_hsw+0x61>
   DB  196,67,121,21,68,83,12,6            ; vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   DB  196,67,121,21,68,83,10,5            ; vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   DB  196,67,121,21,68,83,8,4             ; vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   DB  196,65,121,214,4,83                 ; vmovq         %xmm8,(%r11,%rdx,2)
-  DB  235,159                             ; jmp           368c <_sk_store_565_hsw+0x61>
+  DB  235,159                             ; jmp           36c0 <_sk_store_565_hsw+0x61>
   DB  15,31,0                             ; nopl          (%rax)
   DB  196                                 ; (bad)
   DB  255                                 ; (bad)
@@ -3318,28 +3338,28 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,138,0,0,0                    ; jne           37a4 <_sk_load_4444_hsw+0x98>
+  DB  15,133,138,0,0,0                    ; jne           37d8 <_sk_load_4444_hsw+0x98>
   DB  196,193,122,111,4,83                ; vmovdqu       (%r11,%rdx,2),%xmm0
   DB  196,226,125,51,216                  ; vpmovzxwd     %xmm0,%ymm3
-  DB  196,226,125,88,5,10,36,0,0          ; vpbroadcastd  0x240a(%rip),%ymm0        # 5b38 <_sk_callback_hsw+0x424>
+  DB  196,226,125,88,5,18,36,0,0          ; vpbroadcastd  0x2412(%rip),%ymm0        # 5b74 <_sk_callback_hsw+0x42c>
   DB  197,229,219,192                     ; vpand         %ymm0,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,253,35,0,0        ; vbroadcastss  0x23fd(%rip),%ymm1        # 5b3c <_sk_callback_hsw+0x428>
+  DB  196,226,125,24,13,5,36,0,0          ; vbroadcastss  0x2405(%rip),%ymm1        # 5b78 <_sk_callback_hsw+0x430>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,88,13,244,35,0,0        ; vpbroadcastd  0x23f4(%rip),%ymm1        # 5b40 <_sk_callback_hsw+0x42c>
+  DB  196,226,125,88,13,252,35,0,0        ; vpbroadcastd  0x23fc(%rip),%ymm1        # 5b7c <_sk_callback_hsw+0x434>
   DB  197,229,219,201                     ; vpand         %ymm1,%ymm3,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,21,231,35,0,0        ; vbroadcastss  0x23e7(%rip),%ymm2        # 5b44 <_sk_callback_hsw+0x430>
+  DB  196,226,125,24,21,239,35,0,0        ; vbroadcastss  0x23ef(%rip),%ymm2        # 5b80 <_sk_callback_hsw+0x438>
   DB  197,244,89,202                      ; vmulps        %ymm2,%ymm1,%ymm1
-  DB  196,226,125,88,21,222,35,0,0        ; vpbroadcastd  0x23de(%rip),%ymm2        # 5b48 <_sk_callback_hsw+0x434>
+  DB  196,226,125,88,21,230,35,0,0        ; vpbroadcastd  0x23e6(%rip),%ymm2        # 5b84 <_sk_callback_hsw+0x43c>
   DB  197,229,219,210                     ; vpand         %ymm2,%ymm3,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,98,125,24,5,209,35,0,0          ; vbroadcastss  0x23d1(%rip),%ymm8        # 5b4c <_sk_callback_hsw+0x438>
+  DB  196,98,125,24,5,217,35,0,0          ; vbroadcastss  0x23d9(%rip),%ymm8        # 5b88 <_sk_callback_hsw+0x440>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,88,5,199,35,0,0          ; vpbroadcastd  0x23c7(%rip),%ymm8        # 5b50 <_sk_callback_hsw+0x43c>
+  DB  196,98,125,88,5,207,35,0,0          ; vpbroadcastd  0x23cf(%rip),%ymm8        # 5b8c <_sk_callback_hsw+0x444>
   DB  196,193,101,219,216                 ; vpand         %ymm8,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,185,35,0,0          ; vbroadcastss  0x23b9(%rip),%ymm8        # 5b54 <_sk_callback_hsw+0x440>
+  DB  196,98,125,24,5,193,35,0,0          ; vbroadcastss  0x23c1(%rip),%ymm8        # 5b90 <_sk_callback_hsw+0x448>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -3348,27 +3368,27 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,100,255,255,255              ; ja            3720 <_sk_load_4444_hsw+0x14>
+  DB  15,135,100,255,255,255              ; ja            3754 <_sk_load_4444_hsw+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,97,0,0,0                  ; lea           0x61(%rip),%r10        # 3828 <_sk_load_4444_hsw+0x11c>
+  DB  76,141,21,97,0,0,0                  ; lea           0x61(%rip),%r10        # 385c <_sk_load_4444_hsw+0x11c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  233,66,255,255,255                  ; jmpq          3720 <_sk_load_4444_hsw+0x14>
+  DB  233,66,255,255,255                  ; jmpq          3754 <_sk_load_4444_hsw+0x14>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,110,12,83               ; vmovd         (%r11,%rdx,2),%xmm1
   DB  196,227,121,2,193,1                 ; vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  DB  233,37,255,255,255                  ; jmpq          3720 <_sk_load_4444_hsw+0x14>
+  DB  233,37,255,255,255                  ; jmpq          3754 <_sk_load_4444_hsw+0x14>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,122,126,12,83               ; vmovq         (%r11,%rdx,2),%xmm1
   DB  196,227,113,2,192,12                ; vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  DB  233,248,254,255,255                 ; jmpq          3720 <_sk_load_4444_hsw+0x14>
+  DB  233,248,254,255,255                 ; jmpq          3754 <_sk_load_4444_hsw+0x14>
   DB  168,255                             ; test          $0xff,%al
   DB  255                                 ; (bad)
   DB  255,194                             ; inc           %edx
@@ -3393,28 +3413,28 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,138,0,0,0                    ; jne           38dc <_sk_load_4444_dst_hsw+0x98>
+  DB  15,133,138,0,0,0                    ; jne           3910 <_sk_load_4444_dst_hsw+0x98>
   DB  196,193,122,111,36,83               ; vmovdqu       (%r11,%rdx,2),%xmm4
   DB  196,226,125,51,252                  ; vpmovzxwd     %xmm4,%ymm7
-  DB  196,226,125,88,37,242,34,0,0        ; vpbroadcastd  0x22f2(%rip),%ymm4        # 5b58 <_sk_callback_hsw+0x444>
+  DB  196,226,125,88,37,250,34,0,0        ; vpbroadcastd  0x22fa(%rip),%ymm4        # 5b94 <_sk_callback_hsw+0x44c>
   DB  197,197,219,228                     ; vpand         %ymm4,%ymm7,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,229,34,0,0        ; vbroadcastss  0x22e5(%rip),%ymm5        # 5b5c <_sk_callback_hsw+0x448>
+  DB  196,226,125,24,45,237,34,0,0        ; vbroadcastss  0x22ed(%rip),%ymm5        # 5b98 <_sk_callback_hsw+0x450>
   DB  197,220,89,229                      ; vmulps        %ymm5,%ymm4,%ymm4
-  DB  196,226,125,88,45,220,34,0,0        ; vpbroadcastd  0x22dc(%rip),%ymm5        # 5b60 <_sk_callback_hsw+0x44c>
+  DB  196,226,125,88,45,228,34,0,0        ; vpbroadcastd  0x22e4(%rip),%ymm5        # 5b9c <_sk_callback_hsw+0x454>
   DB  197,197,219,237                     ; vpand         %ymm5,%ymm7,%ymm5
   DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
-  DB  196,226,125,24,53,207,34,0,0        ; vbroadcastss  0x22cf(%rip),%ymm6        # 5b64 <_sk_callback_hsw+0x450>
+  DB  196,226,125,24,53,215,34,0,0        ; vbroadcastss  0x22d7(%rip),%ymm6        # 5ba0 <_sk_callback_hsw+0x458>
   DB  197,212,89,238                      ; vmulps        %ymm6,%ymm5,%ymm5
-  DB  196,226,125,88,53,198,34,0,0        ; vpbroadcastd  0x22c6(%rip),%ymm6        # 5b68 <_sk_callback_hsw+0x454>
+  DB  196,226,125,88,53,206,34,0,0        ; vpbroadcastd  0x22ce(%rip),%ymm6        # 5ba4 <_sk_callback_hsw+0x45c>
   DB  197,197,219,246                     ; vpand         %ymm6,%ymm7,%ymm6
   DB  197,252,91,246                      ; vcvtdq2ps     %ymm6,%ymm6
-  DB  196,98,125,24,5,185,34,0,0          ; vbroadcastss  0x22b9(%rip),%ymm8        # 5b6c <_sk_callback_hsw+0x458>
+  DB  196,98,125,24,5,193,34,0,0          ; vbroadcastss  0x22c1(%rip),%ymm8        # 5ba8 <_sk_callback_hsw+0x460>
   DB  196,193,76,89,240                   ; vmulps        %ymm8,%ymm6,%ymm6
-  DB  196,98,125,88,5,175,34,0,0          ; vpbroadcastd  0x22af(%rip),%ymm8        # 5b70 <_sk_callback_hsw+0x45c>
+  DB  196,98,125,88,5,183,34,0,0          ; vpbroadcastd  0x22b7(%rip),%ymm8        # 5bac <_sk_callback_hsw+0x464>
   DB  196,193,69,219,248                  ; vpand         %ymm8,%ymm7,%ymm7
   DB  197,252,91,255                      ; vcvtdq2ps     %ymm7,%ymm7
-  DB  196,98,125,24,5,161,34,0,0          ; vbroadcastss  0x22a1(%rip),%ymm8        # 5b74 <_sk_callback_hsw+0x460>
+  DB  196,98,125,24,5,169,34,0,0          ; vbroadcastss  0x22a9(%rip),%ymm8        # 5bb0 <_sk_callback_hsw+0x468>
   DB  196,193,68,89,248                   ; vmulps        %ymm8,%ymm7,%ymm7
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -3423,27 +3443,27 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,100,255,255,255              ; ja            3858 <_sk_load_4444_dst_hsw+0x14>
+  DB  15,135,100,255,255,255              ; ja            388c <_sk_load_4444_dst_hsw+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,97,0,0,0                  ; lea           0x61(%rip),%r10        # 3960 <_sk_load_4444_dst_hsw+0x11c>
+  DB  76,141,21,97,0,0,0                  ; lea           0x61(%rip),%r10        # 3994 <_sk_load_4444_dst_hsw+0x11c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  233,66,255,255,255                  ; jmpq          3858 <_sk_load_4444_dst_hsw+0x14>
+  DB  233,66,255,255,255                  ; jmpq          388c <_sk_load_4444_dst_hsw+0x14>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,121,110,44,83               ; vmovd         (%r11,%rdx,2),%xmm5
   DB  196,227,89,2,229,1                  ; vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  DB  233,37,255,255,255                  ; jmpq          3858 <_sk_load_4444_dst_hsw+0x14>
+  DB  233,37,255,255,255                  ; jmpq          388c <_sk_load_4444_dst_hsw+0x14>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,122,126,44,83               ; vmovq         (%r11,%rdx,2),%xmm5
   DB  196,227,81,2,228,12                 ; vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  DB  233,248,254,255,255                 ; jmpq          3858 <_sk_load_4444_dst_hsw+0x14>
+  DB  233,248,254,255,255                 ; jmpq          388c <_sk_load_4444_dst_hsw+0x14>
   DB  168,255                             ; test          $0xff,%al
   DB  255                                 ; (bad)
   DB  255,194                             ; inc           %edx
@@ -3502,25 +3522,25 @@
   DB  67,15,183,4,89                      ; movzwl        (%r9,%r11,2),%eax
   DB  197,249,196,192,7                   ; vpinsrw       $0x7,%eax,%xmm0,%xmm0
   DB  196,226,125,51,216                  ; vpmovzxwd     %xmm0,%ymm3
-  DB  196,226,125,88,5,75,33,0,0          ; vpbroadcastd  0x214b(%rip),%ymm0        # 5b78 <_sk_callback_hsw+0x464>
+  DB  196,226,125,88,5,83,33,0,0          ; vpbroadcastd  0x2153(%rip),%ymm0        # 5bb4 <_sk_callback_hsw+0x46c>
   DB  197,229,219,192                     ; vpand         %ymm0,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,62,33,0,0         ; vbroadcastss  0x213e(%rip),%ymm1        # 5b7c <_sk_callback_hsw+0x468>
+  DB  196,226,125,24,13,70,33,0,0         ; vbroadcastss  0x2146(%rip),%ymm1        # 5bb8 <_sk_callback_hsw+0x470>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,88,13,53,33,0,0         ; vpbroadcastd  0x2135(%rip),%ymm1        # 5b80 <_sk_callback_hsw+0x46c>
+  DB  196,226,125,88,13,61,33,0,0         ; vpbroadcastd  0x213d(%rip),%ymm1        # 5bbc <_sk_callback_hsw+0x474>
   DB  197,229,219,201                     ; vpand         %ymm1,%ymm3,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,21,40,33,0,0         ; vbroadcastss  0x2128(%rip),%ymm2        # 5b84 <_sk_callback_hsw+0x470>
+  DB  196,226,125,24,21,48,33,0,0         ; vbroadcastss  0x2130(%rip),%ymm2        # 5bc0 <_sk_callback_hsw+0x478>
   DB  197,244,89,202                      ; vmulps        %ymm2,%ymm1,%ymm1
-  DB  196,226,125,88,21,31,33,0,0         ; vpbroadcastd  0x211f(%rip),%ymm2        # 5b88 <_sk_callback_hsw+0x474>
+  DB  196,226,125,88,21,39,33,0,0         ; vpbroadcastd  0x2127(%rip),%ymm2        # 5bc4 <_sk_callback_hsw+0x47c>
   DB  197,229,219,210                     ; vpand         %ymm2,%ymm3,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,98,125,24,5,18,33,0,0           ; vbroadcastss  0x2112(%rip),%ymm8        # 5b8c <_sk_callback_hsw+0x478>
+  DB  196,98,125,24,5,26,33,0,0           ; vbroadcastss  0x211a(%rip),%ymm8        # 5bc8 <_sk_callback_hsw+0x480>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,88,5,8,33,0,0            ; vpbroadcastd  0x2108(%rip),%ymm8        # 5b90 <_sk_callback_hsw+0x47c>
+  DB  196,98,125,88,5,16,33,0,0           ; vpbroadcastd  0x2110(%rip),%ymm8        # 5bcc <_sk_callback_hsw+0x484>
   DB  196,193,101,219,216                 ; vpand         %ymm8,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,250,32,0,0          ; vbroadcastss  0x20fa(%rip),%ymm8        # 5b94 <_sk_callback_hsw+0x480>
+  DB  196,98,125,24,5,2,33,0,0            ; vbroadcastss  0x2102(%rip),%ymm8        # 5bd0 <_sk_callback_hsw+0x488>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -3529,7 +3549,7 @@
 _sk_store_4444_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
-  DB  196,98,125,24,5,231,32,0,0          ; vbroadcastss  0x20e7(%rip),%ymm8        # 5b98 <_sk_callback_hsw+0x484>
+  DB  196,98,125,24,5,239,32,0,0          ; vbroadcastss  0x20ef(%rip),%ymm8        # 5bd4 <_sk_callback_hsw+0x48c>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,193,53,114,241,12               ; vpslld        $0xc,%ymm9,%ymm9
@@ -3547,7 +3567,7 @@
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           3b14 <_sk_store_4444_hsw+0x71>
+  DB  117,10                              ; jne           3b48 <_sk_store_4444_hsw+0x71>
   DB  196,65,122,127,4,83                 ; vmovdqu       %xmm8,(%r11,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -3555,22 +3575,22 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,236                             ; ja            3b10 <_sk_store_4444_hsw+0x6d>
+  DB  119,236                             ; ja            3b44 <_sk_store_4444_hsw+0x6d>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,69,0,0,0                  ; lea           0x45(%rip),%r10        # 3b74 <_sk_store_4444_hsw+0xd1>
+  DB  76,141,21,69,0,0,0                  ; lea           0x45(%rip),%r10        # 3ba8 <_sk_store_4444_hsw+0xd1>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,21,4,83,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  DB  235,207                             ; jmp           3b10 <_sk_store_4444_hsw+0x6d>
+  DB  235,207                             ; jmp           3b44 <_sk_store_4444_hsw+0x6d>
   DB  196,67,121,21,68,83,4,2             ; vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   DB  196,65,121,126,4,83                 ; vmovd         %xmm8,(%r11,%rdx,2)
-  DB  235,191                             ; jmp           3b10 <_sk_store_4444_hsw+0x6d>
+  DB  235,191                             ; jmp           3b44 <_sk_store_4444_hsw+0x6d>
   DB  196,67,121,21,68,83,12,6            ; vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   DB  196,67,121,21,68,83,10,5            ; vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   DB  196,67,121,21,68,83,8,4             ; vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   DB  196,65,121,214,4,83                 ; vmovq         %xmm8,(%r11,%rdx,2)
-  DB  235,159                             ; jmp           3b10 <_sk_store_4444_hsw+0x6d>
+  DB  235,159                             ; jmp           3b44 <_sk_store_4444_hsw+0x6d>
   DB  15,31,0                             ; nopl          (%rax)
   DB  196                                 ; (bad)
   DB  255                                 ; (bad)
@@ -3603,16 +3623,16 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,88                              ; jne           3bfd <_sk_load_8888_hsw+0x6d>
+  DB  117,88                              ; jne           3c31 <_sk_load_8888_hsw+0x6d>
   DB  196,193,124,16,26                   ; vmovups       (%r10),%ymm3
-  DB  197,228,84,5,110,34,0,0             ; vandps        0x226e(%rip),%ymm3,%ymm0        # 5e20 <_sk_callback_hsw+0x70c>
+  DB  197,228,84,5,122,34,0,0             ; vandps        0x227a(%rip),%ymm3,%ymm0        # 5e60 <_sk_callback_hsw+0x718>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,221,31,0,0          ; vbroadcastss  0x1fdd(%rip),%ymm8        # 5b9c <_sk_callback_hsw+0x488>
+  DB  196,98,125,24,5,229,31,0,0          ; vbroadcastss  0x1fe5(%rip),%ymm8        # 5bd8 <_sk_callback_hsw+0x490>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,226,101,0,13,115,34,0,0         ; vpshufb       0x2273(%rip),%ymm3,%ymm1        # 5e40 <_sk_callback_hsw+0x72c>
+  DB  196,226,101,0,13,127,34,0,0         ; vpshufb       0x227f(%rip),%ymm3,%ymm1        # 5e80 <_sk_callback_hsw+0x738>
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
-  DB  196,226,101,0,21,129,34,0,0         ; vpshufb       0x2281(%rip),%ymm3,%ymm2        # 5e60 <_sk_callback_hsw+0x74c>
+  DB  196,226,101,0,21,141,34,0,0         ; vpshufb       0x228d(%rip),%ymm3,%ymm2        # 5ea0 <_sk_callback_hsw+0x758>
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
@@ -3629,7 +3649,7 @@
   DB  196,225,249,110,192                 ; vmovq         %rax,%xmm0
   DB  196,226,125,33,192                  ; vpmovsxbd     %xmm0,%ymm0
   DB  196,194,125,44,26                   ; vmaskmovps    (%r10),%ymm0,%ymm3
-  DB  235,135                             ; jmp           3baa <_sk_load_8888_hsw+0x1a>
+  DB  235,135                             ; jmp           3bde <_sk_load_8888_hsw+0x1a>
 
 PUBLIC _sk_load_8888_dst_hsw
 _sk_load_8888_dst_hsw LABEL PROC
@@ -3638,16 +3658,16 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,88                              ; jne           3c90 <_sk_load_8888_dst_hsw+0x6d>
+  DB  117,88                              ; jne           3cc4 <_sk_load_8888_dst_hsw+0x6d>
   DB  196,193,124,16,58                   ; vmovups       (%r10),%ymm7
-  DB  197,196,84,37,59,34,0,0             ; vandps        0x223b(%rip),%ymm7,%ymm4        # 5e80 <_sk_callback_hsw+0x76c>
+  DB  197,196,84,37,71,34,0,0             ; vandps        0x2247(%rip),%ymm7,%ymm4        # 5ec0 <_sk_callback_hsw+0x778>
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,98,125,24,5,78,31,0,0           ; vbroadcastss  0x1f4e(%rip),%ymm8        # 5ba0 <_sk_callback_hsw+0x48c>
+  DB  196,98,125,24,5,86,31,0,0           ; vbroadcastss  0x1f56(%rip),%ymm8        # 5bdc <_sk_callback_hsw+0x494>
   DB  196,193,92,89,224                   ; vmulps        %ymm8,%ymm4,%ymm4
-  DB  196,226,69,0,45,64,34,0,0           ; vpshufb       0x2240(%rip),%ymm7,%ymm5        # 5ea0 <_sk_callback_hsw+0x78c>
+  DB  196,226,69,0,45,76,34,0,0           ; vpshufb       0x224c(%rip),%ymm7,%ymm5        # 5ee0 <_sk_callback_hsw+0x798>
   DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
   DB  196,193,84,89,232                   ; vmulps        %ymm8,%ymm5,%ymm5
-  DB  196,226,69,0,53,78,34,0,0           ; vpshufb       0x224e(%rip),%ymm7,%ymm6        # 5ec0 <_sk_callback_hsw+0x7ac>
+  DB  196,226,69,0,53,90,34,0,0           ; vpshufb       0x225a(%rip),%ymm7,%ymm6        # 5f00 <_sk_callback_hsw+0x7b8>
   DB  197,252,91,246                      ; vcvtdq2ps     %ymm6,%ymm6
   DB  196,193,76,89,240                   ; vmulps        %ymm8,%ymm6,%ymm6
   DB  197,197,114,215,24                  ; vpsrld        $0x18,%ymm7,%ymm7
@@ -3664,7 +3684,7 @@
   DB  196,225,249,110,224                 ; vmovq         %rax,%xmm4
   DB  196,226,125,33,228                  ; vpmovsxbd     %xmm4,%ymm4
   DB  196,194,93,44,58                    ; vmaskmovps    (%r10),%ymm4,%ymm7
-  DB  235,135                             ; jmp           3c3d <_sk_load_8888_dst_hsw+0x1a>
+  DB  235,135                             ; jmp           3c71 <_sk_load_8888_dst_hsw+0x1a>
 
 PUBLIC _sk_gather_8888_hsw
 _sk_gather_8888_hsw LABEL PROC
@@ -3677,14 +3697,14 @@
   DB  197,245,254,192                     ; vpaddd        %ymm0,%ymm1,%ymm0
   DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
   DB  196,194,117,144,28,129              ; vpgatherdd    %ymm1,(%r9,%ymm0,4),%ymm3
-  DB  197,229,219,5,252,33,0,0            ; vpand         0x21fc(%rip),%ymm3,%ymm0        # 5ee0 <_sk_callback_hsw+0x7cc>
+  DB  197,229,219,5,8,34,0,0              ; vpand         0x2208(%rip),%ymm3,%ymm0        # 5f20 <_sk_callback_hsw+0x7d8>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,179,30,0,0          ; vbroadcastss  0x1eb3(%rip),%ymm8        # 5ba4 <_sk_callback_hsw+0x490>
+  DB  196,98,125,24,5,187,30,0,0          ; vbroadcastss  0x1ebb(%rip),%ymm8        # 5be0 <_sk_callback_hsw+0x498>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,226,101,0,13,1,34,0,0           ; vpshufb       0x2201(%rip),%ymm3,%ymm1        # 5f00 <_sk_callback_hsw+0x7ec>
+  DB  196,226,101,0,13,13,34,0,0          ; vpshufb       0x220d(%rip),%ymm3,%ymm1        # 5f40 <_sk_callback_hsw+0x7f8>
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
-  DB  196,226,101,0,21,15,34,0,0          ; vpshufb       0x220f(%rip),%ymm3,%ymm2        # 5f20 <_sk_callback_hsw+0x80c>
+  DB  196,226,101,0,21,27,34,0,0          ; vpshufb       0x221b(%rip),%ymm3,%ymm2        # 5f60 <_sk_callback_hsw+0x818>
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
@@ -3699,7 +3719,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
-  DB  196,98,125,24,5,99,30,0,0           ; vbroadcastss  0x1e63(%rip),%ymm8        # 5ba8 <_sk_callback_hsw+0x494>
+  DB  196,98,125,24,5,107,30,0,0          ; vbroadcastss  0x1e6b(%rip),%ymm8        # 5be4 <_sk_callback_hsw+0x49c>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,65,116,89,208                   ; vmulps        %ymm8,%ymm1,%ymm10
@@ -3715,7 +3735,7 @@
   DB  196,65,45,235,192                   ; vpor          %ymm8,%ymm10,%ymm8
   DB  196,65,53,235,192                   ; vpor          %ymm8,%ymm9,%ymm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,12                              ; jne           3d9f <_sk_store_8888_hsw+0x73>
+  DB  117,12                              ; jne           3dd3 <_sk_store_8888_hsw+0x73>
   DB  196,65,124,17,2                     ; vmovups       %ymm8,(%r10)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,201                          ; mov           %r9,%rcx
@@ -3728,7 +3748,7 @@
   DB  196,97,249,110,200                  ; vmovq         %rax,%xmm9
   DB  196,66,125,33,201                   ; vpmovsxbd     %xmm9,%ymm9
   DB  196,66,53,46,2                      ; vmaskmovps    %ymm8,%ymm9,(%r10)
-  DB  235,211                             ; jmp           3d98 <_sk_store_8888_hsw+0x6c>
+  DB  235,211                             ; jmp           3dcc <_sk_store_8888_hsw+0x6c>
 
 PUBLIC _sk_load_bgra_hsw
 _sk_load_bgra_hsw LABEL PROC
@@ -3737,16 +3757,16 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,88                              ; jne           3e32 <_sk_load_bgra_hsw+0x6d>
+  DB  117,88                              ; jne           3e66 <_sk_load_bgra_hsw+0x6d>
   DB  196,193,124,16,26                   ; vmovups       (%r10),%ymm3
-  DB  197,228,84,5,89,33,0,0              ; vandps        0x2159(%rip),%ymm3,%ymm0        # 5f40 <_sk_callback_hsw+0x82c>
+  DB  197,228,84,5,101,33,0,0             ; vandps        0x2165(%rip),%ymm3,%ymm0        # 5f80 <_sk_callback_hsw+0x838>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,184,29,0,0          ; vbroadcastss  0x1db8(%rip),%ymm8        # 5bac <_sk_callback_hsw+0x498>
+  DB  196,98,125,24,5,192,29,0,0          ; vbroadcastss  0x1dc0(%rip),%ymm8        # 5be8 <_sk_callback_hsw+0x4a0>
   DB  196,193,124,89,208                  ; vmulps        %ymm8,%ymm0,%ymm2
-  DB  196,226,101,0,5,94,33,0,0           ; vpshufb       0x215e(%rip),%ymm3,%ymm0        # 5f60 <_sk_callback_hsw+0x84c>
+  DB  196,226,101,0,5,106,33,0,0          ; vpshufb       0x216a(%rip),%ymm3,%ymm0        # 5fa0 <_sk_callback_hsw+0x858>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
   DB  196,193,124,89,200                  ; vmulps        %ymm8,%ymm0,%ymm1
-  DB  196,226,101,0,5,108,33,0,0          ; vpshufb       0x216c(%rip),%ymm3,%ymm0        # 5f80 <_sk_callback_hsw+0x86c>
+  DB  196,226,101,0,5,120,33,0,0          ; vpshufb       0x2178(%rip),%ymm3,%ymm0        # 5fc0 <_sk_callback_hsw+0x878>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
@@ -3763,7 +3783,7 @@
   DB  196,225,249,110,192                 ; vmovq         %rax,%xmm0
   DB  196,226,125,33,192                  ; vpmovsxbd     %xmm0,%ymm0
   DB  196,194,125,44,26                   ; vmaskmovps    (%r10),%ymm0,%ymm3
-  DB  235,135                             ; jmp           3ddf <_sk_load_bgra_hsw+0x1a>
+  DB  235,135                             ; jmp           3e13 <_sk_load_bgra_hsw+0x1a>
 
 PUBLIC _sk_load_bgra_dst_hsw
 _sk_load_bgra_dst_hsw LABEL PROC
@@ -3772,16 +3792,16 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,88                              ; jne           3ec5 <_sk_load_bgra_dst_hsw+0x6d>
+  DB  117,88                              ; jne           3ef9 <_sk_load_bgra_dst_hsw+0x6d>
   DB  196,193,124,16,58                   ; vmovups       (%r10),%ymm7
-  DB  197,196,84,37,38,33,0,0             ; vandps        0x2126(%rip),%ymm7,%ymm4        # 5fa0 <_sk_callback_hsw+0x88c>
+  DB  197,196,84,37,50,33,0,0             ; vandps        0x2132(%rip),%ymm7,%ymm4        # 5fe0 <_sk_callback_hsw+0x898>
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,98,125,24,5,41,29,0,0           ; vbroadcastss  0x1d29(%rip),%ymm8        # 5bb0 <_sk_callback_hsw+0x49c>
+  DB  196,98,125,24,5,49,29,0,0           ; vbroadcastss  0x1d31(%rip),%ymm8        # 5bec <_sk_callback_hsw+0x4a4>
   DB  196,193,92,89,240                   ; vmulps        %ymm8,%ymm4,%ymm6
-  DB  196,226,69,0,37,43,33,0,0           ; vpshufb       0x212b(%rip),%ymm7,%ymm4        # 5fc0 <_sk_callback_hsw+0x8ac>
+  DB  196,226,69,0,37,55,33,0,0           ; vpshufb       0x2137(%rip),%ymm7,%ymm4        # 6000 <_sk_callback_hsw+0x8b8>
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
   DB  196,193,92,89,232                   ; vmulps        %ymm8,%ymm4,%ymm5
-  DB  196,226,69,0,37,57,33,0,0           ; vpshufb       0x2139(%rip),%ymm7,%ymm4        # 5fe0 <_sk_callback_hsw+0x8cc>
+  DB  196,226,69,0,37,69,33,0,0           ; vpshufb       0x2145(%rip),%ymm7,%ymm4        # 6020 <_sk_callback_hsw+0x8d8>
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
   DB  196,193,92,89,224                   ; vmulps        %ymm8,%ymm4,%ymm4
   DB  197,197,114,215,24                  ; vpsrld        $0x18,%ymm7,%ymm7
@@ -3798,7 +3818,7 @@
   DB  196,225,249,110,224                 ; vmovq         %rax,%xmm4
   DB  196,226,125,33,228                  ; vpmovsxbd     %xmm4,%ymm4
   DB  196,194,93,44,58                    ; vmaskmovps    (%r10),%ymm4,%ymm7
-  DB  235,135                             ; jmp           3e72 <_sk_load_bgra_dst_hsw+0x1a>
+  DB  235,135                             ; jmp           3ea6 <_sk_load_bgra_dst_hsw+0x1a>
 
 PUBLIC _sk_gather_bgra_hsw
 _sk_gather_bgra_hsw LABEL PROC
@@ -3811,14 +3831,14 @@
   DB  197,245,254,192                     ; vpaddd        %ymm0,%ymm1,%ymm0
   DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
   DB  196,194,117,144,28,129              ; vpgatherdd    %ymm1,(%r9,%ymm0,4),%ymm3
-  DB  197,229,219,5,231,32,0,0            ; vpand         0x20e7(%rip),%ymm3,%ymm0        # 6000 <_sk_callback_hsw+0x8ec>
+  DB  197,229,219,5,243,32,0,0            ; vpand         0x20f3(%rip),%ymm3,%ymm0        # 6040 <_sk_callback_hsw+0x8f8>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,142,28,0,0          ; vbroadcastss  0x1c8e(%rip),%ymm8        # 5bb4 <_sk_callback_hsw+0x4a0>
+  DB  196,98,125,24,5,150,28,0,0          ; vbroadcastss  0x1c96(%rip),%ymm8        # 5bf0 <_sk_callback_hsw+0x4a8>
   DB  196,193,124,89,208                  ; vmulps        %ymm8,%ymm0,%ymm2
-  DB  196,226,101,0,5,236,32,0,0          ; vpshufb       0x20ec(%rip),%ymm3,%ymm0        # 6020 <_sk_callback_hsw+0x90c>
+  DB  196,226,101,0,5,248,32,0,0          ; vpshufb       0x20f8(%rip),%ymm3,%ymm0        # 6060 <_sk_callback_hsw+0x918>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
   DB  196,193,124,89,200                  ; vmulps        %ymm8,%ymm0,%ymm1
-  DB  196,226,101,0,5,250,32,0,0          ; vpshufb       0x20fa(%rip),%ymm3,%ymm0        # 6040 <_sk_callback_hsw+0x92c>
+  DB  196,226,101,0,5,6,33,0,0            ; vpshufb       0x2106(%rip),%ymm3,%ymm0        # 6080 <_sk_callback_hsw+0x938>
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  197,229,114,211,24                  ; vpsrld        $0x18,%ymm3,%ymm3
@@ -3833,7 +3853,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
-  DB  196,98,125,24,5,62,28,0,0           ; vbroadcastss  0x1c3e(%rip),%ymm8        # 5bb8 <_sk_callback_hsw+0x4a4>
+  DB  196,98,125,24,5,70,28,0,0           ; vbroadcastss  0x1c46(%rip),%ymm8        # 5bf4 <_sk_callback_hsw+0x4ac>
   DB  196,65,108,89,200                   ; vmulps        %ymm8,%ymm2,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,65,116,89,208                   ; vmulps        %ymm8,%ymm1,%ymm10
@@ -3849,7 +3869,7 @@
   DB  196,65,45,235,192                   ; vpor          %ymm8,%ymm10,%ymm8
   DB  196,65,53,235,192                   ; vpor          %ymm8,%ymm9,%ymm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,12                              ; jne           3fd4 <_sk_store_bgra_hsw+0x73>
+  DB  117,12                              ; jne           4008 <_sk_store_bgra_hsw+0x73>
   DB  196,65,124,17,2                     ; vmovups       %ymm8,(%r10)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,201                          ; mov           %r9,%rcx
@@ -3862,14 +3882,14 @@
   DB  196,97,249,110,200                  ; vmovq         %rax,%xmm9
   DB  196,66,125,33,201                   ; vpmovsxbd     %xmm9,%ymm9
   DB  196,66,53,46,2                      ; vmaskmovps    %ymm8,%ymm9,(%r10)
-  DB  235,211                             ; jmp           3fcd <_sk_store_bgra_hsw+0x6c>
+  DB  235,211                             ; jmp           4001 <_sk_store_bgra_hsw+0x6c>
 
 PUBLIC _sk_load_f16_hsw
 _sk_load_f16_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,97                              ; jne           4065 <_sk_load_f16_hsw+0x6b>
+  DB  117,97                              ; jne           4099 <_sk_load_f16_hsw+0x6b>
   DB  197,121,16,4,208                    ; vmovupd       (%rax,%rdx,8),%xmm8
   DB  197,249,16,84,208,16                ; vmovupd       0x10(%rax,%rdx,8),%xmm2
   DB  197,249,16,92,208,32                ; vmovupd       0x20(%rax,%rdx,8),%xmm3
@@ -3895,36 +3915,36 @@
   DB  197,123,16,4,208                    ; vmovsd        (%rax,%rdx,8),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,79                              ; je            40c4 <_sk_load_f16_hsw+0xca>
+  DB  116,79                              ; je            40f8 <_sk_load_f16_hsw+0xca>
   DB  197,57,22,68,208,8                  ; vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,67                              ; jb            40c4 <_sk_load_f16_hsw+0xca>
+  DB  114,67                              ; jb            40f8 <_sk_load_f16_hsw+0xca>
   DB  197,251,16,84,208,16                ; vmovsd        0x10(%rax,%rdx,8),%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,68                              ; je            40d1 <_sk_load_f16_hsw+0xd7>
+  DB  116,68                              ; je            4105 <_sk_load_f16_hsw+0xd7>
   DB  197,233,22,84,208,24                ; vmovhpd       0x18(%rax,%rdx,8),%xmm2,%xmm2
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,56                              ; jb            40d1 <_sk_load_f16_hsw+0xd7>
+  DB  114,56                              ; jb            4105 <_sk_load_f16_hsw+0xd7>
   DB  197,251,16,92,208,32                ; vmovsd        0x20(%rax,%rdx,8),%xmm3
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,114,255,255,255              ; je            401b <_sk_load_f16_hsw+0x21>
+  DB  15,132,114,255,255,255              ; je            404f <_sk_load_f16_hsw+0x21>
   DB  197,225,22,92,208,40                ; vmovhpd       0x28(%rax,%rdx,8),%xmm3,%xmm3
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,98,255,255,255               ; jb            401b <_sk_load_f16_hsw+0x21>
+  DB  15,130,98,255,255,255               ; jb            404f <_sk_load_f16_hsw+0x21>
   DB  197,122,126,76,208,48               ; vmovq         0x30(%rax,%rdx,8),%xmm9
-  DB  233,87,255,255,255                  ; jmpq          401b <_sk_load_f16_hsw+0x21>
+  DB  233,87,255,255,255                  ; jmpq          404f <_sk_load_f16_hsw+0x21>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,74,255,255,255                  ; jmpq          401b <_sk_load_f16_hsw+0x21>
+  DB  233,74,255,255,255                  ; jmpq          404f <_sk_load_f16_hsw+0x21>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,65,255,255,255                  ; jmpq          401b <_sk_load_f16_hsw+0x21>
+  DB  233,65,255,255,255                  ; jmpq          404f <_sk_load_f16_hsw+0x21>
 
 PUBLIC _sk_load_f16_dst_hsw
 _sk_load_f16_dst_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,97                              ; jne           4145 <_sk_load_f16_dst_hsw+0x6b>
+  DB  117,97                              ; jne           4179 <_sk_load_f16_dst_hsw+0x6b>
   DB  197,121,16,4,208                    ; vmovupd       (%rax,%rdx,8),%xmm8
   DB  197,249,16,116,208,16               ; vmovupd       0x10(%rax,%rdx,8),%xmm6
   DB  197,249,16,124,208,32               ; vmovupd       0x20(%rax,%rdx,8),%xmm7
@@ -3950,29 +3970,29 @@
   DB  197,123,16,4,208                    ; vmovsd        (%rax,%rdx,8),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,79                              ; je            41a4 <_sk_load_f16_dst_hsw+0xca>
+  DB  116,79                              ; je            41d8 <_sk_load_f16_dst_hsw+0xca>
   DB  197,57,22,68,208,8                  ; vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,67                              ; jb            41a4 <_sk_load_f16_dst_hsw+0xca>
+  DB  114,67                              ; jb            41d8 <_sk_load_f16_dst_hsw+0xca>
   DB  197,251,16,116,208,16               ; vmovsd        0x10(%rax,%rdx,8),%xmm6
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,68                              ; je            41b1 <_sk_load_f16_dst_hsw+0xd7>
+  DB  116,68                              ; je            41e5 <_sk_load_f16_dst_hsw+0xd7>
   DB  197,201,22,116,208,24               ; vmovhpd       0x18(%rax,%rdx,8),%xmm6,%xmm6
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,56                              ; jb            41b1 <_sk_load_f16_dst_hsw+0xd7>
+  DB  114,56                              ; jb            41e5 <_sk_load_f16_dst_hsw+0xd7>
   DB  197,251,16,124,208,32               ; vmovsd        0x20(%rax,%rdx,8),%xmm7
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,114,255,255,255              ; je            40fb <_sk_load_f16_dst_hsw+0x21>
+  DB  15,132,114,255,255,255              ; je            412f <_sk_load_f16_dst_hsw+0x21>
   DB  197,193,22,124,208,40               ; vmovhpd       0x28(%rax,%rdx,8),%xmm7,%xmm7
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,98,255,255,255               ; jb            40fb <_sk_load_f16_dst_hsw+0x21>
+  DB  15,130,98,255,255,255               ; jb            412f <_sk_load_f16_dst_hsw+0x21>
   DB  197,122,126,76,208,48               ; vmovq         0x30(%rax,%rdx,8),%xmm9
-  DB  233,87,255,255,255                  ; jmpq          40fb <_sk_load_f16_dst_hsw+0x21>
+  DB  233,87,255,255,255                  ; jmpq          412f <_sk_load_f16_dst_hsw+0x21>
   DB  197,193,87,255                      ; vxorpd        %xmm7,%xmm7,%xmm7
   DB  197,201,87,246                      ; vxorpd        %xmm6,%xmm6,%xmm6
-  DB  233,74,255,255,255                  ; jmpq          40fb <_sk_load_f16_dst_hsw+0x21>
+  DB  233,74,255,255,255                  ; jmpq          412f <_sk_load_f16_dst_hsw+0x21>
   DB  197,193,87,255                      ; vxorpd        %xmm7,%xmm7,%xmm7
-  DB  233,65,255,255,255                  ; jmpq          40fb <_sk_load_f16_dst_hsw+0x21>
+  DB  233,65,255,255,255                  ; jmpq          412f <_sk_load_f16_dst_hsw+0x21>
 
 PUBLIC _sk_gather_f16_hsw
 _sk_gather_f16_hsw LABEL PROC
@@ -4026,7 +4046,7 @@
   DB  196,65,57,98,205                    ; vpunpckldq    %xmm13,%xmm8,%xmm9
   DB  196,65,57,106,197                   ; vpunpckhdq    %xmm13,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,27                              ; jne           42a9 <_sk_store_f16_hsw+0x65>
+  DB  117,27                              ; jne           42dd <_sk_store_f16_hsw+0x65>
   DB  197,120,17,28,208                   ; vmovups       %xmm11,(%rax,%rdx,8)
   DB  197,120,17,84,208,16                ; vmovups       %xmm10,0x10(%rax,%rdx,8)
   DB  197,120,17,76,208,32                ; vmovups       %xmm9,0x20(%rax,%rdx,8)
@@ -4035,22 +4055,22 @@
   DB  255,224                             ; jmpq          *%rax
   DB  197,121,214,28,208                  ; vmovq         %xmm11,(%rax,%rdx,8)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,241                             ; je            42a5 <_sk_store_f16_hsw+0x61>
+  DB  116,241                             ; je            42d9 <_sk_store_f16_hsw+0x61>
   DB  197,121,23,92,208,8                 ; vmovhpd       %xmm11,0x8(%rax,%rdx,8)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,229                             ; jb            42a5 <_sk_store_f16_hsw+0x61>
+  DB  114,229                             ; jb            42d9 <_sk_store_f16_hsw+0x61>
   DB  197,121,214,84,208,16               ; vmovq         %xmm10,0x10(%rax,%rdx,8)
-  DB  116,221                             ; je            42a5 <_sk_store_f16_hsw+0x61>
+  DB  116,221                             ; je            42d9 <_sk_store_f16_hsw+0x61>
   DB  197,121,23,84,208,24                ; vmovhpd       %xmm10,0x18(%rax,%rdx,8)
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,209                             ; jb            42a5 <_sk_store_f16_hsw+0x61>
+  DB  114,209                             ; jb            42d9 <_sk_store_f16_hsw+0x61>
   DB  197,121,214,76,208,32               ; vmovq         %xmm9,0x20(%rax,%rdx,8)
-  DB  116,201                             ; je            42a5 <_sk_store_f16_hsw+0x61>
+  DB  116,201                             ; je            42d9 <_sk_store_f16_hsw+0x61>
   DB  197,121,23,76,208,40                ; vmovhpd       %xmm9,0x28(%rax,%rdx,8)
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,189                             ; jb            42a5 <_sk_store_f16_hsw+0x61>
+  DB  114,189                             ; jb            42d9 <_sk_store_f16_hsw+0x61>
   DB  197,121,214,68,208,48               ; vmovq         %xmm8,0x30(%rax,%rdx,8)
-  DB  235,181                             ; jmp           42a5 <_sk_store_f16_hsw+0x61>
+  DB  235,181                             ; jmp           42d9 <_sk_store_f16_hsw+0x61>
 
 PUBLIC _sk_load_u16_be_hsw
 _sk_load_u16_be_hsw LABEL PROC
@@ -4058,7 +4078,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,204,0,0,0                    ; jne           43d2 <_sk_load_u16_be_hsw+0xe2>
+  DB  15,133,204,0,0,0                    ; jne           4406 <_sk_load_u16_be_hsw+0xe2>
   DB  196,65,121,16,4,65                  ; vmovupd       (%r9,%rax,2),%xmm8
   DB  196,193,121,16,84,65,16             ; vmovupd       0x10(%r9,%rax,2),%xmm2
   DB  196,193,121,16,92,65,32             ; vmovupd       0x20(%r9,%rax,2),%xmm3
@@ -4077,7 +4097,7 @@
   DB  197,241,235,192                     ; vpor          %xmm0,%xmm1,%xmm0
   DB  196,226,125,51,192                  ; vpmovzxwd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,21,85,24,0,0          ; vbroadcastss  0x1855(%rip),%ymm10        # 5bbc <_sk_callback_hsw+0x4a8>
+  DB  196,98,125,24,21,93,24,0,0          ; vbroadcastss  0x185d(%rip),%ymm10        # 5bf8 <_sk_callback_hsw+0x4b0>
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  197,185,109,202                     ; vpunpckhqdq   %xmm2,%xmm8,%xmm1
   DB  197,233,113,241,8                   ; vpsllw        $0x8,%xmm1,%xmm2
@@ -4105,29 +4125,29 @@
   DB  196,65,123,16,4,65                  ; vmovsd        (%r9,%rax,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,85                              ; je            4438 <_sk_load_u16_be_hsw+0x148>
+  DB  116,85                              ; je            446c <_sk_load_u16_be_hsw+0x148>
   DB  196,65,57,22,68,65,8                ; vmovhpd       0x8(%r9,%rax,2),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,72                              ; jb            4438 <_sk_load_u16_be_hsw+0x148>
+  DB  114,72                              ; jb            446c <_sk_load_u16_be_hsw+0x148>
   DB  196,193,123,16,84,65,16             ; vmovsd        0x10(%r9,%rax,2),%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,72                              ; je            4445 <_sk_load_u16_be_hsw+0x155>
+  DB  116,72                              ; je            4479 <_sk_load_u16_be_hsw+0x155>
   DB  196,193,105,22,84,65,24             ; vmovhpd       0x18(%r9,%rax,2),%xmm2,%xmm2
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,59                              ; jb            4445 <_sk_load_u16_be_hsw+0x155>
+  DB  114,59                              ; jb            4479 <_sk_load_u16_be_hsw+0x155>
   DB  196,193,123,16,92,65,32             ; vmovsd        0x20(%r9,%rax,2),%xmm3
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,6,255,255,255                ; je            4321 <_sk_load_u16_be_hsw+0x31>
+  DB  15,132,6,255,255,255                ; je            4355 <_sk_load_u16_be_hsw+0x31>
   DB  196,193,97,22,92,65,40              ; vmovhpd       0x28(%r9,%rax,2),%xmm3,%xmm3
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,245,254,255,255              ; jb            4321 <_sk_load_u16_be_hsw+0x31>
+  DB  15,130,245,254,255,255              ; jb            4355 <_sk_load_u16_be_hsw+0x31>
   DB  196,65,122,126,76,65,48             ; vmovq         0x30(%r9,%rax,2),%xmm9
-  DB  233,233,254,255,255                 ; jmpq          4321 <_sk_load_u16_be_hsw+0x31>
+  DB  233,233,254,255,255                 ; jmpq          4355 <_sk_load_u16_be_hsw+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,220,254,255,255                 ; jmpq          4321 <_sk_load_u16_be_hsw+0x31>
+  DB  233,220,254,255,255                 ; jmpq          4355 <_sk_load_u16_be_hsw+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,211,254,255,255                 ; jmpq          4321 <_sk_load_u16_be_hsw+0x31>
+  DB  233,211,254,255,255                 ; jmpq          4355 <_sk_load_u16_be_hsw+0x31>
 
 PUBLIC _sk_load_rgb_u16_be_hsw
 _sk_load_rgb_u16_be_hsw LABEL PROC
@@ -4135,7 +4155,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,82                         ; lea           (%rdx,%rdx,2),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,204,0,0,0                    ; jne           452c <_sk_load_rgb_u16_be_hsw+0xde>
+  DB  15,133,204,0,0,0                    ; jne           4560 <_sk_load_rgb_u16_be_hsw+0xde>
   DB  196,193,122,111,4,65                ; vmovdqu       (%r9,%rax,2),%xmm0
   DB  196,193,122,111,84,65,12            ; vmovdqu       0xc(%r9,%rax,2),%xmm2
   DB  196,193,122,111,76,65,24            ; vmovdqu       0x18(%r9,%rax,2),%xmm1
@@ -4159,7 +4179,7 @@
   DB  197,241,235,192                     ; vpor          %xmm0,%xmm1,%xmm0
   DB  196,226,125,51,192                  ; vpmovzxwd     %xmm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,21,230,22,0,0         ; vbroadcastss  0x16e6(%rip),%ymm10        # 5bc0 <_sk_callback_hsw+0x4ac>
+  DB  196,98,125,24,21,238,22,0,0         ; vbroadcastss  0x16ee(%rip),%ymm10        # 5bfc <_sk_callback_hsw+0x4b4>
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  197,185,109,202                     ; vpunpckhqdq   %xmm2,%xmm8,%xmm1
   DB  197,233,113,241,8                   ; vpsllw        $0x8,%xmm1,%xmm2
@@ -4176,48 +4196,48 @@
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,210                  ; vmulps        %ymm10,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,154,22,0,0        ; vbroadcastss  0x169a(%rip),%ymm3        # 5bc4 <_sk_callback_hsw+0x4b0>
+  DB  196,226,125,24,29,162,22,0,0        ; vbroadcastss  0x16a2(%rip),%ymm3        # 5c00 <_sk_callback_hsw+0x4b8>
   DB  255,224                             ; jmpq          *%rax
   DB  196,193,121,110,4,65                ; vmovd         (%r9,%rax,2),%xmm0
   DB  196,193,121,196,68,65,4,2           ; vpinsrw       $0x2,0x4(%r9,%rax,2),%xmm0,%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,5                               ; jne           4545 <_sk_load_rgb_u16_be_hsw+0xf7>
-  DB  233,79,255,255,255                  ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  117,5                               ; jne           4579 <_sk_load_rgb_u16_be_hsw+0xf7>
+  DB  233,79,255,255,255                  ; jmpq          44c8 <_sk_load_rgb_u16_be_hsw+0x46>
   DB  196,193,121,110,76,65,6             ; vmovd         0x6(%r9,%rax,2),%xmm1
   DB  196,65,113,196,68,65,10,2           ; vpinsrw       $0x2,0xa(%r9,%rax,2),%xmm1,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,26                              ; jb            4574 <_sk_load_rgb_u16_be_hsw+0x126>
+  DB  114,26                              ; jb            45a8 <_sk_load_rgb_u16_be_hsw+0x126>
   DB  196,193,121,110,76,65,12            ; vmovd         0xc(%r9,%rax,2),%xmm1
   DB  196,193,113,196,84,65,16,2          ; vpinsrw       $0x2,0x10(%r9,%rax,2),%xmm1,%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  117,10                              ; jne           4579 <_sk_load_rgb_u16_be_hsw+0x12b>
-  DB  233,32,255,255,255                  ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
-  DB  233,27,255,255,255                  ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  117,10                              ; jne           45ad <_sk_load_rgb_u16_be_hsw+0x12b>
+  DB  233,32,255,255,255                  ; jmpq          44c8 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  233,27,255,255,255                  ; jmpq          44c8 <_sk_load_rgb_u16_be_hsw+0x46>
   DB  196,193,121,110,76,65,18            ; vmovd         0x12(%r9,%rax,2),%xmm1
   DB  196,65,113,196,76,65,22,2           ; vpinsrw       $0x2,0x16(%r9,%rax,2),%xmm1,%xmm9
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,26                              ; jb            45a8 <_sk_load_rgb_u16_be_hsw+0x15a>
+  DB  114,26                              ; jb            45dc <_sk_load_rgb_u16_be_hsw+0x15a>
   DB  196,193,121,110,76,65,24            ; vmovd         0x18(%r9,%rax,2),%xmm1
   DB  196,193,113,196,76,65,28,2          ; vpinsrw       $0x2,0x1c(%r9,%rax,2),%xmm1,%xmm1
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  117,10                              ; jne           45ad <_sk_load_rgb_u16_be_hsw+0x15f>
-  DB  233,236,254,255,255                 ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
-  DB  233,231,254,255,255                 ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  117,10                              ; jne           45e1 <_sk_load_rgb_u16_be_hsw+0x15f>
+  DB  233,236,254,255,255                 ; jmpq          44c8 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  233,231,254,255,255                 ; jmpq          44c8 <_sk_load_rgb_u16_be_hsw+0x46>
   DB  196,193,121,110,92,65,30            ; vmovd         0x1e(%r9,%rax,2),%xmm3
   DB  196,65,97,196,92,65,34,2            ; vpinsrw       $0x2,0x22(%r9,%rax,2),%xmm3,%xmm11
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,20                              ; jb            45d6 <_sk_load_rgb_u16_be_hsw+0x188>
+  DB  114,20                              ; jb            460a <_sk_load_rgb_u16_be_hsw+0x188>
   DB  196,193,121,110,92,65,36            ; vmovd         0x24(%r9,%rax,2),%xmm3
   DB  196,193,97,196,92,65,40,2           ; vpinsrw       $0x2,0x28(%r9,%rax,2),%xmm3,%xmm3
-  DB  233,190,254,255,255                 ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
-  DB  233,185,254,255,255                 ; jmpq          4494 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  233,190,254,255,255                 ; jmpq          44c8 <_sk_load_rgb_u16_be_hsw+0x46>
+  DB  233,185,254,255,255                 ; jmpq          44c8 <_sk_load_rgb_u16_be_hsw+0x46>
 
 PUBLIC _sk_store_u16_be_hsw
 _sk_store_u16_be_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
-  DB  196,98,125,24,5,215,21,0,0          ; vbroadcastss  0x15d7(%rip),%ymm8        # 5bc8 <_sk_callback_hsw+0x4b4>
+  DB  196,98,125,24,5,223,21,0,0          ; vbroadcastss  0x15df(%rip),%ymm8        # 5c04 <_sk_callback_hsw+0x4bc>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,67,125,25,202,1                 ; vextractf128  $0x1,%ymm9,%xmm10
@@ -4255,7 +4275,7 @@
   DB  196,65,17,98,200                    ; vpunpckldq    %xmm8,%xmm13,%xmm9
   DB  196,65,17,106,192                   ; vpunpckhdq    %xmm8,%xmm13,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,31                              ; jne           46d5 <_sk_store_u16_be_hsw+0xfa>
+  DB  117,31                              ; jne           4709 <_sk_store_u16_be_hsw+0xfa>
   DB  196,65,120,17,28,65                 ; vmovups       %xmm11,(%r9,%rax,2)
   DB  196,65,120,17,84,65,16              ; vmovups       %xmm10,0x10(%r9,%rax,2)
   DB  196,65,120,17,76,65,32              ; vmovups       %xmm9,0x20(%r9,%rax,2)
@@ -4264,31 +4284,31 @@
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,214,28,65                ; vmovq         %xmm11,(%r9,%rax,2)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            46d1 <_sk_store_u16_be_hsw+0xf6>
+  DB  116,240                             ; je            4705 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,23,92,65,8               ; vmovhpd       %xmm11,0x8(%r9,%rax,2)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            46d1 <_sk_store_u16_be_hsw+0xf6>
+  DB  114,227                             ; jb            4705 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,214,84,65,16             ; vmovq         %xmm10,0x10(%r9,%rax,2)
-  DB  116,218                             ; je            46d1 <_sk_store_u16_be_hsw+0xf6>
+  DB  116,218                             ; je            4705 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,23,84,65,24              ; vmovhpd       %xmm10,0x18(%r9,%rax,2)
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,205                             ; jb            46d1 <_sk_store_u16_be_hsw+0xf6>
+  DB  114,205                             ; jb            4705 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,214,76,65,32             ; vmovq         %xmm9,0x20(%r9,%rax,2)
-  DB  116,196                             ; je            46d1 <_sk_store_u16_be_hsw+0xf6>
+  DB  116,196                             ; je            4705 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,23,76,65,40              ; vmovhpd       %xmm9,0x28(%r9,%rax,2)
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,183                             ; jb            46d1 <_sk_store_u16_be_hsw+0xf6>
+  DB  114,183                             ; jb            4705 <_sk_store_u16_be_hsw+0xf6>
   DB  196,65,121,214,68,65,48             ; vmovq         %xmm8,0x30(%r9,%rax,2)
-  DB  235,174                             ; jmp           46d1 <_sk_store_u16_be_hsw+0xf6>
+  DB  235,174                             ; jmp           4705 <_sk_store_u16_be_hsw+0xf6>
 
 PUBLIC _sk_load_f32_hsw
 _sk_load_f32_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  119,110                             ; ja            4799 <_sk_load_f32_hsw+0x76>
+  DB  119,110                             ; ja            47cd <_sk_load_f32_hsw+0x76>
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
-  DB  76,141,29,135,0,0,0                 ; lea           0x87(%rip),%r11        # 47c4 <_sk_load_f32_hsw+0xa1>
+  DB  76,141,29,135,0,0,0                 ; lea           0x87(%rip),%r11        # 47f8 <_sk_load_f32_hsw+0xa1>
   DB  75,99,4,131                         ; movslq        (%r11,%r8,4),%rax
   DB  76,1,216                            ; add           %r11,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -4337,10 +4357,10 @@
 _sk_load_f32_dst_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  119,110                             ; ja            485a <_sk_load_f32_dst_hsw+0x76>
+  DB  119,110                             ; ja            488e <_sk_load_f32_dst_hsw+0x76>
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
-  DB  76,141,29,134,0,0,0                 ; lea           0x86(%rip),%r11        # 4884 <_sk_load_f32_dst_hsw+0xa0>
+  DB  76,141,29,134,0,0,0                 ; lea           0x86(%rip),%r11        # 48b8 <_sk_load_f32_dst_hsw+0xa0>
   DB  75,99,4,131                         ; movslq        (%r11,%r8,4),%rax
   DB  76,1,216                            ; add           %r11,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -4397,7 +4417,7 @@
   DB  196,65,37,20,196                    ; vunpcklpd     %ymm12,%ymm11,%ymm8
   DB  196,65,37,21,220                    ; vunpckhpd     %ymm12,%ymm11,%ymm11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,55                              ; jne           4911 <_sk_store_f32_hsw+0x6d>
+  DB  117,55                              ; jne           4945 <_sk_store_f32_hsw+0x6d>
   DB  196,67,45,24,225,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm12
   DB  196,67,61,24,235,1                  ; vinsertf128   $0x1,%xmm11,%ymm8,%ymm13
   DB  196,67,45,6,201,49                  ; vperm2f128    $0x31,%ymm9,%ymm10,%ymm9
@@ -4410,22 +4430,22 @@
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,17,20,129                ; vmovupd       %xmm10,(%r9,%rax,4)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            490d <_sk_store_f32_hsw+0x69>
+  DB  116,240                             ; je            4941 <_sk_store_f32_hsw+0x69>
   DB  196,65,121,17,76,129,16             ; vmovupd       %xmm9,0x10(%r9,%rax,4)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            490d <_sk_store_f32_hsw+0x69>
+  DB  114,227                             ; jb            4941 <_sk_store_f32_hsw+0x69>
   DB  196,65,121,17,68,129,32             ; vmovupd       %xmm8,0x20(%r9,%rax,4)
-  DB  116,218                             ; je            490d <_sk_store_f32_hsw+0x69>
+  DB  116,218                             ; je            4941 <_sk_store_f32_hsw+0x69>
   DB  196,65,121,17,92,129,48             ; vmovupd       %xmm11,0x30(%r9,%rax,4)
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,205                             ; jb            490d <_sk_store_f32_hsw+0x69>
+  DB  114,205                             ; jb            4941 <_sk_store_f32_hsw+0x69>
   DB  196,67,125,25,84,129,64,1           ; vextractf128  $0x1,%ymm10,0x40(%r9,%rax,4)
-  DB  116,195                             ; je            490d <_sk_store_f32_hsw+0x69>
+  DB  116,195                             ; je            4941 <_sk_store_f32_hsw+0x69>
   DB  196,67,125,25,76,129,80,1           ; vextractf128  $0x1,%ymm9,0x50(%r9,%rax,4)
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,181                             ; jb            490d <_sk_store_f32_hsw+0x69>
+  DB  114,181                             ; jb            4941 <_sk_store_f32_hsw+0x69>
   DB  196,67,125,25,68,129,96,1           ; vextractf128  $0x1,%ymm8,0x60(%r9,%rax,4)
-  DB  235,171                             ; jmp           490d <_sk_store_f32_hsw+0x69>
+  DB  235,171                             ; jmp           4941 <_sk_store_f32_hsw+0x69>
 
 PUBLIC _sk_clamp_x_hsw
 _sk_clamp_x_hsw LABEL PROC
@@ -4488,7 +4508,7 @@
   DB  196,65,124,92,218                   ; vsubps        %ymm10,%ymm0,%ymm11
   DB  196,193,58,88,192                   ; vaddss        %xmm8,%xmm8,%xmm0
   DB  196,98,125,24,192                   ; vbroadcastss  %xmm0,%ymm8
-  DB  197,178,89,5,165,17,0,0             ; vmulss        0x11a5(%rip),%xmm9,%xmm0        # 5bcc <_sk_callback_hsw+0x4b8>
+  DB  197,178,89,5,173,17,0,0             ; vmulss        0x11ad(%rip),%xmm9,%xmm0        # 5c08 <_sk_callback_hsw+0x4c0>
   DB  196,226,125,24,192                  ; vbroadcastss  %xmm0,%ymm0
   DB  197,164,89,192                      ; vmulps        %ymm0,%ymm11,%ymm0
   DB  196,227,125,8,192,1                 ; vroundps      $0x1,%ymm0,%ymm0
@@ -4512,7 +4532,7 @@
   DB  196,65,116,92,218                   ; vsubps        %ymm10,%ymm1,%ymm11
   DB  196,193,58,88,200                   ; vaddss        %xmm8,%xmm8,%xmm1
   DB  196,98,125,24,193                   ; vbroadcastss  %xmm1,%ymm8
-  DB  197,178,89,13,73,17,0,0             ; vmulss        0x1149(%rip),%xmm9,%xmm1        # 5bd0 <_sk_callback_hsw+0x4bc>
+  DB  197,178,89,13,81,17,0,0             ; vmulss        0x1151(%rip),%xmm9,%xmm1        # 5c0c <_sk_callback_hsw+0x4c4>
   DB  196,226,125,24,201                  ; vbroadcastss  %xmm1,%ymm1
   DB  197,164,89,201                      ; vmulps        %ymm1,%ymm11,%ymm1
   DB  196,227,125,8,201,1                 ; vroundps      $0x1,%ymm1,%ymm1
@@ -4531,7 +4551,7 @@
 _sk_clamp_x_1_hsw LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  197,188,95,192                      ; vmaxps        %ymm0,%ymm8,%ymm0
-  DB  196,98,125,24,5,2,17,0,0            ; vbroadcastss  0x1102(%rip),%ymm8        # 5bd4 <_sk_callback_hsw+0x4c0>
+  DB  196,98,125,24,5,10,17,0,0           ; vbroadcastss  0x110a(%rip),%ymm8        # 5c10 <_sk_callback_hsw+0x4c8>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -4545,9 +4565,9 @@
 
 PUBLIC _sk_mirror_x_1_hsw
 _sk_mirror_x_1_hsw LABEL PROC
-  DB  196,98,125,24,5,229,16,0,0          ; vbroadcastss  0x10e5(%rip),%ymm8        # 5bd8 <_sk_callback_hsw+0x4c4>
+  DB  196,98,125,24,5,237,16,0,0          ; vbroadcastss  0x10ed(%rip),%ymm8        # 5c14 <_sk_callback_hsw+0x4cc>
   DB  196,193,124,88,192                  ; vaddps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,13,219,16,0,0         ; vbroadcastss  0x10db(%rip),%ymm9        # 5bdc <_sk_callback_hsw+0x4c8>
+  DB  196,98,125,24,13,227,16,0,0         ; vbroadcastss  0x10e3(%rip),%ymm9        # 5c18 <_sk_callback_hsw+0x4d0>
   DB  196,65,124,89,201                   ; vmulps        %ymm9,%ymm0,%ymm9
   DB  196,67,125,8,201,1                  ; vroundps      $0x1,%ymm9,%ymm9
   DB  196,65,52,88,201                    ; vaddps        %ymm9,%ymm9,%ymm9
@@ -4561,11 +4581,11 @@
 
 PUBLIC _sk_luminance_to_alpha_hsw
 _sk_luminance_to_alpha_hsw LABEL PROC
-  DB  196,226,125,24,29,171,16,0,0        ; vbroadcastss  0x10ab(%rip),%ymm3        # 5be0 <_sk_callback_hsw+0x4cc>
-  DB  196,98,125,24,5,166,16,0,0          ; vbroadcastss  0x10a6(%rip),%ymm8        # 5be4 <_sk_callback_hsw+0x4d0>
+  DB  196,226,125,24,29,179,16,0,0        ; vbroadcastss  0x10b3(%rip),%ymm3        # 5c1c <_sk_callback_hsw+0x4d4>
+  DB  196,98,125,24,5,174,16,0,0          ; vbroadcastss  0x10ae(%rip),%ymm8        # 5c20 <_sk_callback_hsw+0x4d8>
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
   DB  196,226,125,184,203                 ; vfmadd231ps   %ymm3,%ymm0,%ymm1
-  DB  196,226,125,24,29,151,16,0,0        ; vbroadcastss  0x1097(%rip),%ymm3        # 5be8 <_sk_callback_hsw+0x4d4>
+  DB  196,226,125,24,29,159,16,0,0        ; vbroadcastss  0x109f(%rip),%ymm3        # 5c24 <_sk_callback_hsw+0x4dc>
   DB  196,226,109,168,217                 ; vfmadd213ps   %ymm1,%ymm2,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -4749,9 +4769,9 @@
   DB  76,139,72,8                         ; mov           0x8(%rax),%r9
   DB  77,137,211                          ; mov           %r10,%r11
   DB  73,255,203                          ; dec           %r11
-  DB  120,7                               ; js            4e4a <_sk_evenly_spaced_gradient_hsw+0x19>
+  DB  120,7                               ; js            4e7e <_sk_evenly_spaced_gradient_hsw+0x19>
   DB  196,193,242,42,203                  ; vcvtsi2ss     %r11,%xmm1,%xmm1
-  DB  235,22                              ; jmp           4e60 <_sk_evenly_spaced_gradient_hsw+0x2f>
+  DB  235,22                              ; jmp           4e94 <_sk_evenly_spaced_gradient_hsw+0x2f>
   DB  76,137,219                          ; mov           %r11,%rbx
   DB  72,209,235                          ; shr           %rbx
   DB  65,131,227,1                        ; and           $0x1,%r11d
@@ -4762,7 +4782,7 @@
   DB  197,244,89,200                      ; vmulps        %ymm0,%ymm1,%ymm1
   DB  197,126,91,217                      ; vcvttps2dq    %ymm1,%ymm11
   DB  73,131,250,8                        ; cmp           $0x8,%r10
-  DB  119,70                              ; ja            4eb9 <_sk_evenly_spaced_gradient_hsw+0x88>
+  DB  119,70                              ; ja            4eed <_sk_evenly_spaced_gradient_hsw+0x88>
   DB  196,66,37,22,1                      ; vpermps       (%r9),%ymm11,%ymm8
   DB  72,139,88,40                        ; mov           0x28(%rax),%rbx
   DB  196,98,37,22,11                     ; vpermps       (%rbx),%ymm11,%ymm9
@@ -4778,7 +4798,7 @@
   DB  196,226,37,22,27                    ; vpermps       (%rbx),%ymm11,%ymm3
   DB  72,139,64,64                        ; mov           0x40(%rax),%rax
   DB  196,98,37,22,40                     ; vpermps       (%rax),%ymm11,%ymm13
-  DB  235,110                             ; jmp           4f27 <_sk_evenly_spaced_gradient_hsw+0xf6>
+  DB  235,110                             ; jmp           4f5b <_sk_evenly_spaced_gradient_hsw+0xf6>
   DB  196,65,13,118,246                   ; vpcmpeqd      %ymm14,%ymm14,%ymm14
   DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
   DB  196,2,117,146,4,153                 ; vgatherdps    %ymm1,(%r9,%ymm11,4),%ymm8
@@ -4813,14 +4833,14 @@
 
 PUBLIC _sk_gauss_a_to_rgba_hsw
 _sk_gauss_a_to_rgba_hsw LABEL PROC
-  DB  196,226,125,24,5,159,12,0,0         ; vbroadcastss  0xc9f(%rip),%ymm0        # 5bec <_sk_callback_hsw+0x4d8>
-  DB  196,226,125,24,13,154,12,0,0        ; vbroadcastss  0xc9a(%rip),%ymm1        # 5bf0 <_sk_callback_hsw+0x4dc>
+  DB  196,226,125,24,5,167,12,0,0         ; vbroadcastss  0xca7(%rip),%ymm0        # 5c28 <_sk_callback_hsw+0x4e0>
+  DB  196,226,125,24,13,162,12,0,0        ; vbroadcastss  0xca2(%rip),%ymm1        # 5c2c <_sk_callback_hsw+0x4e4>
   DB  196,226,101,168,200                 ; vfmadd213ps   %ymm0,%ymm3,%ymm1
-  DB  196,226,125,24,5,144,12,0,0         ; vbroadcastss  0xc90(%rip),%ymm0        # 5bf4 <_sk_callback_hsw+0x4e0>
+  DB  196,226,125,24,5,152,12,0,0         ; vbroadcastss  0xc98(%rip),%ymm0        # 5c30 <_sk_callback_hsw+0x4e8>
   DB  196,226,101,184,193                 ; vfmadd231ps   %ymm1,%ymm3,%ymm0
-  DB  196,226,125,24,13,134,12,0,0        ; vbroadcastss  0xc86(%rip),%ymm1        # 5bf8 <_sk_callback_hsw+0x4e4>
+  DB  196,226,125,24,13,142,12,0,0        ; vbroadcastss  0xc8e(%rip),%ymm1        # 5c34 <_sk_callback_hsw+0x4ec>
   DB  196,226,101,184,200                 ; vfmadd231ps   %ymm0,%ymm3,%ymm1
-  DB  196,226,125,24,5,124,12,0,0         ; vbroadcastss  0xc7c(%rip),%ymm0        # 5bfc <_sk_callback_hsw+0x4e8>
+  DB  196,226,125,24,5,132,12,0,0         ; vbroadcastss  0xc84(%rip),%ymm0        # 5c38 <_sk_callback_hsw+0x4f0>
   DB  196,226,101,184,193                 ; vfmadd231ps   %ymm1,%ymm3,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
@@ -4833,11 +4853,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  73,131,249,1                        ; cmp           $0x1,%r9
-  DB  15,134,180,0,0,0                    ; jbe           5058 <_sk_gradient_hsw+0xc3>
+  DB  15,134,180,0,0,0                    ; jbe           508c <_sk_gradient_hsw+0xc3>
   DB  76,139,80,72                        ; mov           0x48(%rax),%r10
   DB  197,244,87,201                      ; vxorps        %ymm1,%ymm1,%ymm1
   DB  65,187,1,0,0,0                      ; mov           $0x1,%r11d
-  DB  196,226,125,24,21,69,12,0,0         ; vbroadcastss  0xc45(%rip),%ymm2        # 5c00 <_sk_callback_hsw+0x4ec>
+  DB  196,226,125,24,21,77,12,0,0         ; vbroadcastss  0xc4d(%rip),%ymm2        # 5c3c <_sk_callback_hsw+0x4f4>
   DB  196,65,53,239,201                   ; vpxor         %ymm9,%ymm9,%ymm9
   DB  196,130,125,24,28,154               ; vbroadcastss  (%r10,%r11,4),%ymm3
   DB  197,228,194,216,2                   ; vcmpleps      %ymm0,%ymm3,%ymm3
@@ -4845,10 +4865,10 @@
   DB  196,65,101,254,201                  ; vpaddd        %ymm9,%ymm3,%ymm9
   DB  73,255,195                          ; inc           %r11
   DB  77,57,217                           ; cmp           %r11,%r9
-  DB  117,226                             ; jne           4fc0 <_sk_gradient_hsw+0x2b>
+  DB  117,226                             ; jne           4ff4 <_sk_gradient_hsw+0x2b>
   DB  76,139,80,8                         ; mov           0x8(%rax),%r10
   DB  73,131,249,8                        ; cmp           $0x8,%r9
-  DB  118,121                             ; jbe           5061 <_sk_gradient_hsw+0xcc>
+  DB  118,121                             ; jbe           5095 <_sk_gradient_hsw+0xcc>
   DB  196,65,13,118,246                   ; vpcmpeqd      %ymm14,%ymm14,%ymm14
   DB  197,245,118,201                     ; vpcmpeqd      %ymm1,%ymm1,%ymm1
   DB  196,2,117,146,4,138                 ; vgatherdps    %ymm1,(%r10,%ymm9,4),%ymm8
@@ -4872,7 +4892,7 @@
   DB  196,130,21,146,28,137               ; vgatherdps    %ymm13,(%r9,%ymm9,4),%ymm3
   DB  72,139,64,64                        ; mov           0x40(%rax),%rax
   DB  196,34,13,146,44,136                ; vgatherdps    %ymm14,(%rax,%ymm9,4),%ymm13
-  DB  235,77                              ; jmp           50a5 <_sk_gradient_hsw+0x110>
+  DB  235,77                              ; jmp           50d9 <_sk_gradient_hsw+0x110>
   DB  76,139,80,8                         ; mov           0x8(%rax),%r10
   DB  196,65,52,87,201                    ; vxorps        %ymm9,%ymm9,%ymm9
   DB  196,66,53,22,2                      ; vpermps       (%r10),%ymm9,%ymm8
@@ -4928,24 +4948,24 @@
   DB  196,65,52,95,226                    ; vmaxps        %ymm10,%ymm9,%ymm12
   DB  196,65,36,94,220                    ; vdivps        %ymm12,%ymm11,%ymm11
   DB  196,65,36,89,227                    ; vmulps        %ymm11,%ymm11,%ymm12
-  DB  196,98,125,24,45,196,10,0,0         ; vbroadcastss  0xac4(%rip),%ymm13        # 5c04 <_sk_callback_hsw+0x4f0>
-  DB  196,98,125,24,53,191,10,0,0         ; vbroadcastss  0xabf(%rip),%ymm14        # 5c08 <_sk_callback_hsw+0x4f4>
+  DB  196,98,125,24,45,204,10,0,0         ; vbroadcastss  0xacc(%rip),%ymm13        # 5c40 <_sk_callback_hsw+0x4f8>
+  DB  196,98,125,24,53,199,10,0,0         ; vbroadcastss  0xac7(%rip),%ymm14        # 5c44 <_sk_callback_hsw+0x4fc>
   DB  196,66,29,184,245                   ; vfmadd231ps   %ymm13,%ymm12,%ymm14
-  DB  196,98,125,24,45,181,10,0,0         ; vbroadcastss  0xab5(%rip),%ymm13        # 5c0c <_sk_callback_hsw+0x4f8>
+  DB  196,98,125,24,45,189,10,0,0         ; vbroadcastss  0xabd(%rip),%ymm13        # 5c48 <_sk_callback_hsw+0x500>
   DB  196,66,29,184,238                   ; vfmadd231ps   %ymm14,%ymm12,%ymm13
-  DB  196,98,125,24,53,171,10,0,0         ; vbroadcastss  0xaab(%rip),%ymm14        # 5c10 <_sk_callback_hsw+0x4fc>
+  DB  196,98,125,24,53,179,10,0,0         ; vbroadcastss  0xab3(%rip),%ymm14        # 5c4c <_sk_callback_hsw+0x504>
   DB  196,66,29,184,245                   ; vfmadd231ps   %ymm13,%ymm12,%ymm14
   DB  196,65,36,89,222                    ; vmulps        %ymm14,%ymm11,%ymm11
   DB  196,65,52,194,202,1                 ; vcmpltps      %ymm10,%ymm9,%ymm9
-  DB  196,98,125,24,21,150,10,0,0         ; vbroadcastss  0xa96(%rip),%ymm10        # 5c14 <_sk_callback_hsw+0x500>
+  DB  196,98,125,24,21,158,10,0,0         ; vbroadcastss  0xa9e(%rip),%ymm10        # 5c50 <_sk_callback_hsw+0x508>
   DB  196,65,44,92,211                    ; vsubps        %ymm11,%ymm10,%ymm10
   DB  196,67,37,74,202,144                ; vblendvps     %ymm9,%ymm10,%ymm11,%ymm9
   DB  196,193,124,194,192,1               ; vcmpltps      %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,21,128,10,0,0         ; vbroadcastss  0xa80(%rip),%ymm10        # 5c18 <_sk_callback_hsw+0x504>
+  DB  196,98,125,24,21,136,10,0,0         ; vbroadcastss  0xa88(%rip),%ymm10        # 5c54 <_sk_callback_hsw+0x50c>
   DB  196,65,44,92,209                    ; vsubps        %ymm9,%ymm10,%ymm10
   DB  196,195,53,74,194,0                 ; vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   DB  196,65,116,194,200,1                ; vcmpltps      %ymm8,%ymm1,%ymm9
-  DB  196,98,125,24,21,106,10,0,0         ; vbroadcastss  0xa6a(%rip),%ymm10        # 5c1c <_sk_callback_hsw+0x508>
+  DB  196,98,125,24,21,114,10,0,0         ; vbroadcastss  0xa72(%rip),%ymm10        # 5c58 <_sk_callback_hsw+0x510>
   DB  197,44,92,208                       ; vsubps        %ymm0,%ymm10,%ymm10
   DB  196,195,125,74,194,144              ; vblendvps     %ymm9,%ymm10,%ymm0,%ymm0
   DB  196,65,124,194,200,3                ; vcmpunordps   %ymm8,%ymm0,%ymm9
@@ -4969,23 +4989,23 @@
   DB  197,50,89,80,44                     ; vmulss        0x2c(%rax),%xmm9,%xmm10
   DB  196,66,125,24,210                   ; vbroadcastss  %xmm10,%ymm10
   DB  197,44,88,208                       ; vaddps        %ymm0,%ymm10,%ymm10
-  DB  196,98,125,24,29,30,10,0,0          ; vbroadcastss  0xa1e(%rip),%ymm11        # 5c20 <_sk_callback_hsw+0x50c>
+  DB  196,98,125,24,29,38,10,0,0          ; vbroadcastss  0xa26(%rip),%ymm11        # 5c5c <_sk_callback_hsw+0x514>
   DB  196,65,44,89,211                    ; vmulps        %ymm11,%ymm10,%ymm10
   DB  197,116,89,217                      ; vmulps        %ymm1,%ymm1,%ymm11
   DB  196,98,125,184,216                  ; vfmadd231ps   %ymm0,%ymm0,%ymm11
   DB  196,193,50,89,193                   ; vmulss        %xmm9,%xmm9,%xmm0
   DB  196,226,125,24,192                  ; vbroadcastss  %xmm0,%ymm0
   DB  197,164,92,192                      ; vsubps        %ymm0,%ymm11,%ymm0
-  DB  196,98,125,24,13,253,9,0,0          ; vbroadcastss  0x9fd(%rip),%ymm9        # 5c24 <_sk_callback_hsw+0x510>
+  DB  196,98,125,24,13,5,10,0,0           ; vbroadcastss  0xa05(%rip),%ymm9        # 5c60 <_sk_callback_hsw+0x518>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  196,194,45,184,194                  ; vfmadd231ps   %ymm10,%ymm10,%ymm0
   DB  197,252,81,192                      ; vsqrtps       %ymm0,%ymm0
   DB  196,98,125,24,64,36                 ; vbroadcastss  0x24(%rax),%ymm8
-  DB  196,98,125,24,13,224,9,0,0          ; vbroadcastss  0x9e0(%rip),%ymm9        # 5c28 <_sk_callback_hsw+0x514>
+  DB  196,98,125,24,13,232,9,0,0          ; vbroadcastss  0x9e8(%rip),%ymm9        # 5c64 <_sk_callback_hsw+0x51c>
   DB  196,65,44,87,201                    ; vxorps        %ymm9,%ymm10,%ymm9
   DB  196,65,124,92,210                   ; vsubps        %ymm10,%ymm0,%ymm10
-  DB  196,98,125,24,29,209,9,0,0          ; vbroadcastss  0x9d1(%rip),%ymm11        # 5c2c <_sk_callback_hsw+0x518>
+  DB  196,98,125,24,29,217,9,0,0          ; vbroadcastss  0x9d9(%rip),%ymm11        # 5c68 <_sk_callback_hsw+0x520>
   DB  196,65,60,89,195                    ; vmulps        %ymm11,%ymm8,%ymm8
   DB  196,65,44,89,208                    ; vmulps        %ymm8,%ymm10,%ymm10
   DB  197,180,92,192                      ; vsubps        %ymm0,%ymm9,%ymm0
@@ -5002,23 +5022,23 @@
   DB  197,50,89,80,44                     ; vmulss        0x2c(%rax),%xmm9,%xmm10
   DB  196,66,125,24,210                   ; vbroadcastss  %xmm10,%ymm10
   DB  197,44,88,208                       ; vaddps        %ymm0,%ymm10,%ymm10
-  DB  196,98,125,24,29,150,9,0,0          ; vbroadcastss  0x996(%rip),%ymm11        # 5c30 <_sk_callback_hsw+0x51c>
+  DB  196,98,125,24,29,158,9,0,0          ; vbroadcastss  0x99e(%rip),%ymm11        # 5c6c <_sk_callback_hsw+0x524>
   DB  196,65,44,89,211                    ; vmulps        %ymm11,%ymm10,%ymm10
   DB  197,116,89,217                      ; vmulps        %ymm1,%ymm1,%ymm11
   DB  196,98,125,184,216                  ; vfmadd231ps   %ymm0,%ymm0,%ymm11
   DB  196,193,50,89,193                   ; vmulss        %xmm9,%xmm9,%xmm0
   DB  196,226,125,24,192                  ; vbroadcastss  %xmm0,%ymm0
   DB  197,164,92,192                      ; vsubps        %ymm0,%ymm11,%ymm0
-  DB  196,98,125,24,13,117,9,0,0          ; vbroadcastss  0x975(%rip),%ymm9        # 5c34 <_sk_callback_hsw+0x520>
+  DB  196,98,125,24,13,125,9,0,0          ; vbroadcastss  0x97d(%rip),%ymm9        # 5c70 <_sk_callback_hsw+0x528>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  196,194,45,184,194                  ; vfmadd231ps   %ymm10,%ymm10,%ymm0
   DB  197,252,81,192                      ; vsqrtps       %ymm0,%ymm0
   DB  196,98,125,24,64,36                 ; vbroadcastss  0x24(%rax),%ymm8
-  DB  196,98,125,24,13,88,9,0,0           ; vbroadcastss  0x958(%rip),%ymm9        # 5c38 <_sk_callback_hsw+0x524>
+  DB  196,98,125,24,13,96,9,0,0           ; vbroadcastss  0x960(%rip),%ymm9        # 5c74 <_sk_callback_hsw+0x52c>
   DB  196,65,44,87,201                    ; vxorps        %ymm9,%ymm10,%ymm9
   DB  196,65,124,92,210                   ; vsubps        %ymm10,%ymm0,%ymm10
-  DB  196,98,125,24,29,73,9,0,0           ; vbroadcastss  0x949(%rip),%ymm11        # 5c3c <_sk_callback_hsw+0x528>
+  DB  196,98,125,24,29,81,9,0,0           ; vbroadcastss  0x951(%rip),%ymm11        # 5c78 <_sk_callback_hsw+0x530>
   DB  196,65,60,89,195                    ; vmulps        %ymm11,%ymm8,%ymm8
   DB  196,65,44,89,208                    ; vmulps        %ymm8,%ymm10,%ymm10
   DB  197,180,92,192                      ; vsubps        %ymm0,%ymm9,%ymm0
@@ -5034,14 +5054,14 @@
   DB  197,58,89,72,44                     ; vmulss        0x2c(%rax),%xmm8,%xmm9
   DB  196,66,125,24,201                   ; vbroadcastss  %xmm9,%ymm9
   DB  197,52,88,200                       ; vaddps        %ymm0,%ymm9,%ymm9
-  DB  196,98,125,24,21,20,9,0,0           ; vbroadcastss  0x914(%rip),%ymm10        # 5c40 <_sk_callback_hsw+0x52c>
+  DB  196,98,125,24,21,28,9,0,0           ; vbroadcastss  0x91c(%rip),%ymm10        # 5c7c <_sk_callback_hsw+0x534>
   DB  196,65,52,89,202                    ; vmulps        %ymm10,%ymm9,%ymm9
   DB  197,116,89,209                      ; vmulps        %ymm1,%ymm1,%ymm10
   DB  196,98,125,184,208                  ; vfmadd231ps   %ymm0,%ymm0,%ymm10
   DB  196,193,58,89,192                   ; vmulss        %xmm8,%xmm8,%xmm0
   DB  196,226,125,24,192                  ; vbroadcastss  %xmm0,%ymm0
   DB  197,172,92,192                      ; vsubps        %ymm0,%ymm10,%ymm0
-  DB  196,98,125,24,5,243,8,0,0           ; vbroadcastss  0x8f3(%rip),%ymm8        # 5c44 <_sk_callback_hsw+0x530>
+  DB  196,98,125,24,5,251,8,0,0           ; vbroadcastss  0x8fb(%rip),%ymm8        # 5c80 <_sk_callback_hsw+0x538>
   DB  196,193,124,87,192                  ; vxorps        %ymm8,%ymm0,%ymm0
   DB  196,193,124,94,193                  ; vdivps        %ymm9,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -5075,7 +5095,7 @@
 PUBLIC _sk_save_xy_hsw
 _sk_save_xy_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,147,8,0,0           ; vbroadcastss  0x893(%rip),%ymm8        # 5c48 <_sk_callback_hsw+0x534>
+  DB  196,98,125,24,5,155,8,0,0           ; vbroadcastss  0x89b(%rip),%ymm8        # 5c84 <_sk_callback_hsw+0x53c>
   DB  196,65,124,88,200                   ; vaddps        %ymm8,%ymm0,%ymm9
   DB  196,67,125,8,209,1                  ; vroundps      $0x1,%ymm9,%ymm10
   DB  196,65,52,92,202                    ; vsubps        %ymm10,%ymm9,%ymm9
@@ -5105,9 +5125,9 @@
 PUBLIC _sk_bilinear_nx_hsw
 _sk_bilinear_nx_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,39,8,0,0           ; vbroadcastss  0x827(%rip),%ymm0        # 5c4c <_sk_callback_hsw+0x538>
+  DB  196,226,125,24,5,47,8,0,0           ; vbroadcastss  0x82f(%rip),%ymm0        # 5c88 <_sk_callback_hsw+0x540>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,30,8,0,0            ; vbroadcastss  0x81e(%rip),%ymm8        # 5c50 <_sk_callback_hsw+0x53c>
+  DB  196,98,125,24,5,38,8,0,0            ; vbroadcastss  0x826(%rip),%ymm8        # 5c8c <_sk_callback_hsw+0x544>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -5116,7 +5136,7 @@
 PUBLIC _sk_bilinear_px_hsw
 _sk_bilinear_px_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,6,8,0,0            ; vbroadcastss  0x806(%rip),%ymm0        # 5c54 <_sk_callback_hsw+0x540>
+  DB  196,226,125,24,5,14,8,0,0           ; vbroadcastss  0x80e(%rip),%ymm0        # 5c90 <_sk_callback_hsw+0x548>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
   DB  197,124,16,64,64                    ; vmovups       0x40(%rax),%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -5126,9 +5146,9 @@
 PUBLIC _sk_bilinear_ny_hsw
 _sk_bilinear_ny_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,234,7,0,0         ; vbroadcastss  0x7ea(%rip),%ymm1        # 5c58 <_sk_callback_hsw+0x544>
+  DB  196,226,125,24,13,242,7,0,0         ; vbroadcastss  0x7f2(%rip),%ymm1        # 5c94 <_sk_callback_hsw+0x54c>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,224,7,0,0           ; vbroadcastss  0x7e0(%rip),%ymm8        # 5c5c <_sk_callback_hsw+0x548>
+  DB  196,98,125,24,5,232,7,0,0           ; vbroadcastss  0x7e8(%rip),%ymm8        # 5c98 <_sk_callback_hsw+0x550>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -5137,7 +5157,7 @@
 PUBLIC _sk_bilinear_py_hsw
 _sk_bilinear_py_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,200,7,0,0         ; vbroadcastss  0x7c8(%rip),%ymm1        # 5c60 <_sk_callback_hsw+0x54c>
+  DB  196,226,125,24,13,208,7,0,0         ; vbroadcastss  0x7d0(%rip),%ymm1        # 5c9c <_sk_callback_hsw+0x554>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
   DB  197,124,16,64,96                    ; vmovups       0x60(%rax),%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -5147,13 +5167,13 @@
 PUBLIC _sk_bicubic_n3x_hsw
 _sk_bicubic_n3x_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,171,7,0,0          ; vbroadcastss  0x7ab(%rip),%ymm0        # 5c64 <_sk_callback_hsw+0x550>
+  DB  196,226,125,24,5,179,7,0,0          ; vbroadcastss  0x7b3(%rip),%ymm0        # 5ca0 <_sk_callback_hsw+0x558>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,162,7,0,0           ; vbroadcastss  0x7a2(%rip),%ymm8        # 5c68 <_sk_callback_hsw+0x554>
+  DB  196,98,125,24,5,170,7,0,0           ; vbroadcastss  0x7aa(%rip),%ymm8        # 5ca4 <_sk_callback_hsw+0x55c>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,147,7,0,0          ; vbroadcastss  0x793(%rip),%ymm10        # 5c6c <_sk_callback_hsw+0x558>
-  DB  196,98,125,24,29,142,7,0,0          ; vbroadcastss  0x78e(%rip),%ymm11        # 5c70 <_sk_callback_hsw+0x55c>
+  DB  196,98,125,24,21,155,7,0,0          ; vbroadcastss  0x79b(%rip),%ymm10        # 5ca8 <_sk_callback_hsw+0x560>
+  DB  196,98,125,24,29,150,7,0,0          ; vbroadcastss  0x796(%rip),%ymm11        # 5cac <_sk_callback_hsw+0x564>
   DB  196,66,61,168,218                   ; vfmadd213ps   %ymm10,%ymm8,%ymm11
   DB  196,65,36,89,193                    ; vmulps        %ymm9,%ymm11,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -5163,16 +5183,16 @@
 PUBLIC _sk_bicubic_n1x_hsw
 _sk_bicubic_n1x_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,113,7,0,0          ; vbroadcastss  0x771(%rip),%ymm0        # 5c74 <_sk_callback_hsw+0x560>
+  DB  196,226,125,24,5,121,7,0,0          ; vbroadcastss  0x779(%rip),%ymm0        # 5cb0 <_sk_callback_hsw+0x568>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,104,7,0,0           ; vbroadcastss  0x768(%rip),%ymm8        # 5c78 <_sk_callback_hsw+0x564>
+  DB  196,98,125,24,5,112,7,0,0           ; vbroadcastss  0x770(%rip),%ymm8        # 5cb4 <_sk_callback_hsw+0x56c>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
-  DB  196,98,125,24,13,94,7,0,0           ; vbroadcastss  0x75e(%rip),%ymm9        # 5c7c <_sk_callback_hsw+0x568>
-  DB  196,98,125,24,21,89,7,0,0           ; vbroadcastss  0x759(%rip),%ymm10        # 5c80 <_sk_callback_hsw+0x56c>
+  DB  196,98,125,24,13,102,7,0,0          ; vbroadcastss  0x766(%rip),%ymm9        # 5cb8 <_sk_callback_hsw+0x570>
+  DB  196,98,125,24,21,97,7,0,0           ; vbroadcastss  0x761(%rip),%ymm10        # 5cbc <_sk_callback_hsw+0x574>
   DB  196,66,61,168,209                   ; vfmadd213ps   %ymm9,%ymm8,%ymm10
-  DB  196,98,125,24,13,79,7,0,0           ; vbroadcastss  0x74f(%rip),%ymm9        # 5c84 <_sk_callback_hsw+0x570>
+  DB  196,98,125,24,13,87,7,0,0           ; vbroadcastss  0x757(%rip),%ymm9        # 5cc0 <_sk_callback_hsw+0x578>
   DB  196,66,61,184,202                   ; vfmadd231ps   %ymm10,%ymm8,%ymm9
-  DB  196,98,125,24,21,69,7,0,0           ; vbroadcastss  0x745(%rip),%ymm10        # 5c88 <_sk_callback_hsw+0x574>
+  DB  196,98,125,24,21,77,7,0,0           ; vbroadcastss  0x74d(%rip),%ymm10        # 5cc4 <_sk_callback_hsw+0x57c>
   DB  196,66,61,184,209                   ; vfmadd231ps   %ymm9,%ymm8,%ymm10
   DB  197,124,17,144,128,0,0,0            ; vmovups       %ymm10,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -5181,14 +5201,14 @@
 PUBLIC _sk_bicubic_p1x_hsw
 _sk_bicubic_p1x_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,45,7,0,0            ; vbroadcastss  0x72d(%rip),%ymm8        # 5c8c <_sk_callback_hsw+0x578>
+  DB  196,98,125,24,5,53,7,0,0            ; vbroadcastss  0x735(%rip),%ymm8        # 5cc8 <_sk_callback_hsw+0x580>
   DB  197,188,88,0                        ; vaddps        (%rax),%ymm8,%ymm0
   DB  197,124,16,72,64                    ; vmovups       0x40(%rax),%ymm9
-  DB  196,98,125,24,21,31,7,0,0           ; vbroadcastss  0x71f(%rip),%ymm10        # 5c90 <_sk_callback_hsw+0x57c>
-  DB  196,98,125,24,29,26,7,0,0           ; vbroadcastss  0x71a(%rip),%ymm11        # 5c94 <_sk_callback_hsw+0x580>
+  DB  196,98,125,24,21,39,7,0,0           ; vbroadcastss  0x727(%rip),%ymm10        # 5ccc <_sk_callback_hsw+0x584>
+  DB  196,98,125,24,29,34,7,0,0           ; vbroadcastss  0x722(%rip),%ymm11        # 5cd0 <_sk_callback_hsw+0x588>
   DB  196,66,53,168,218                   ; vfmadd213ps   %ymm10,%ymm9,%ymm11
   DB  196,66,53,168,216                   ; vfmadd213ps   %ymm8,%ymm9,%ymm11
-  DB  196,98,125,24,5,11,7,0,0            ; vbroadcastss  0x70b(%rip),%ymm8        # 5c98 <_sk_callback_hsw+0x584>
+  DB  196,98,125,24,5,19,7,0,0            ; vbroadcastss  0x713(%rip),%ymm8        # 5cd4 <_sk_callback_hsw+0x58c>
   DB  196,66,53,184,195                   ; vfmadd231ps   %ymm11,%ymm9,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -5197,12 +5217,12 @@
 PUBLIC _sk_bicubic_p3x_hsw
 _sk_bicubic_p3x_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,243,6,0,0          ; vbroadcastss  0x6f3(%rip),%ymm0        # 5c9c <_sk_callback_hsw+0x588>
+  DB  196,226,125,24,5,251,6,0,0          ; vbroadcastss  0x6fb(%rip),%ymm0        # 5cd8 <_sk_callback_hsw+0x590>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
   DB  197,124,16,64,64                    ; vmovups       0x40(%rax),%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,224,6,0,0          ; vbroadcastss  0x6e0(%rip),%ymm10        # 5ca0 <_sk_callback_hsw+0x58c>
-  DB  196,98,125,24,29,219,6,0,0          ; vbroadcastss  0x6db(%rip),%ymm11        # 5ca4 <_sk_callback_hsw+0x590>
+  DB  196,98,125,24,21,232,6,0,0          ; vbroadcastss  0x6e8(%rip),%ymm10        # 5cdc <_sk_callback_hsw+0x594>
+  DB  196,98,125,24,29,227,6,0,0          ; vbroadcastss  0x6e3(%rip),%ymm11        # 5ce0 <_sk_callback_hsw+0x598>
   DB  196,66,61,168,218                   ; vfmadd213ps   %ymm10,%ymm8,%ymm11
   DB  196,65,52,89,195                    ; vmulps        %ymm11,%ymm9,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -5212,13 +5232,13 @@
 PUBLIC _sk_bicubic_n3y_hsw
 _sk_bicubic_n3y_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,190,6,0,0         ; vbroadcastss  0x6be(%rip),%ymm1        # 5ca8 <_sk_callback_hsw+0x594>
+  DB  196,226,125,24,13,198,6,0,0         ; vbroadcastss  0x6c6(%rip),%ymm1        # 5ce4 <_sk_callback_hsw+0x59c>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,180,6,0,0           ; vbroadcastss  0x6b4(%rip),%ymm8        # 5cac <_sk_callback_hsw+0x598>
+  DB  196,98,125,24,5,188,6,0,0           ; vbroadcastss  0x6bc(%rip),%ymm8        # 5ce8 <_sk_callback_hsw+0x5a0>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,165,6,0,0          ; vbroadcastss  0x6a5(%rip),%ymm10        # 5cb0 <_sk_callback_hsw+0x59c>
-  DB  196,98,125,24,29,160,6,0,0          ; vbroadcastss  0x6a0(%rip),%ymm11        # 5cb4 <_sk_callback_hsw+0x5a0>
+  DB  196,98,125,24,21,173,6,0,0          ; vbroadcastss  0x6ad(%rip),%ymm10        # 5cec <_sk_callback_hsw+0x5a4>
+  DB  196,98,125,24,29,168,6,0,0          ; vbroadcastss  0x6a8(%rip),%ymm11        # 5cf0 <_sk_callback_hsw+0x5a8>
   DB  196,66,61,168,218                   ; vfmadd213ps   %ymm10,%ymm8,%ymm11
   DB  196,65,36,89,193                    ; vmulps        %ymm9,%ymm11,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -5228,16 +5248,16 @@
 PUBLIC _sk_bicubic_n1y_hsw
 _sk_bicubic_n1y_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,131,6,0,0         ; vbroadcastss  0x683(%rip),%ymm1        # 5cb8 <_sk_callback_hsw+0x5a4>
+  DB  196,226,125,24,13,139,6,0,0         ; vbroadcastss  0x68b(%rip),%ymm1        # 5cf4 <_sk_callback_hsw+0x5ac>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,121,6,0,0           ; vbroadcastss  0x679(%rip),%ymm8        # 5cbc <_sk_callback_hsw+0x5a8>
+  DB  196,98,125,24,5,129,6,0,0           ; vbroadcastss  0x681(%rip),%ymm8        # 5cf8 <_sk_callback_hsw+0x5b0>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
-  DB  196,98,125,24,13,111,6,0,0          ; vbroadcastss  0x66f(%rip),%ymm9        # 5cc0 <_sk_callback_hsw+0x5ac>
-  DB  196,98,125,24,21,106,6,0,0          ; vbroadcastss  0x66a(%rip),%ymm10        # 5cc4 <_sk_callback_hsw+0x5b0>
+  DB  196,98,125,24,13,119,6,0,0          ; vbroadcastss  0x677(%rip),%ymm9        # 5cfc <_sk_callback_hsw+0x5b4>
+  DB  196,98,125,24,21,114,6,0,0          ; vbroadcastss  0x672(%rip),%ymm10        # 5d00 <_sk_callback_hsw+0x5b8>
   DB  196,66,61,168,209                   ; vfmadd213ps   %ymm9,%ymm8,%ymm10
-  DB  196,98,125,24,13,96,6,0,0           ; vbroadcastss  0x660(%rip),%ymm9        # 5cc8 <_sk_callback_hsw+0x5b4>
+  DB  196,98,125,24,13,104,6,0,0          ; vbroadcastss  0x668(%rip),%ymm9        # 5d04 <_sk_callback_hsw+0x5bc>
   DB  196,66,61,184,202                   ; vfmadd231ps   %ymm10,%ymm8,%ymm9
-  DB  196,98,125,24,21,86,6,0,0           ; vbroadcastss  0x656(%rip),%ymm10        # 5ccc <_sk_callback_hsw+0x5b8>
+  DB  196,98,125,24,21,94,6,0,0           ; vbroadcastss  0x65e(%rip),%ymm10        # 5d08 <_sk_callback_hsw+0x5c0>
   DB  196,66,61,184,209                   ; vfmadd231ps   %ymm9,%ymm8,%ymm10
   DB  197,124,17,144,160,0,0,0            ; vmovups       %ymm10,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -5246,14 +5266,14 @@
 PUBLIC _sk_bicubic_p1y_hsw
 _sk_bicubic_p1y_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,62,6,0,0            ; vbroadcastss  0x63e(%rip),%ymm8        # 5cd0 <_sk_callback_hsw+0x5bc>
+  DB  196,98,125,24,5,70,6,0,0            ; vbroadcastss  0x646(%rip),%ymm8        # 5d0c <_sk_callback_hsw+0x5c4>
   DB  197,188,88,72,32                    ; vaddps        0x20(%rax),%ymm8,%ymm1
   DB  197,124,16,72,96                    ; vmovups       0x60(%rax),%ymm9
-  DB  196,98,125,24,21,47,6,0,0           ; vbroadcastss  0x62f(%rip),%ymm10        # 5cd4 <_sk_callback_hsw+0x5c0>
-  DB  196,98,125,24,29,42,6,0,0           ; vbroadcastss  0x62a(%rip),%ymm11        # 5cd8 <_sk_callback_hsw+0x5c4>
+  DB  196,98,125,24,21,55,6,0,0           ; vbroadcastss  0x637(%rip),%ymm10        # 5d10 <_sk_callback_hsw+0x5c8>
+  DB  196,98,125,24,29,50,6,0,0           ; vbroadcastss  0x632(%rip),%ymm11        # 5d14 <_sk_callback_hsw+0x5cc>
   DB  196,66,53,168,218                   ; vfmadd213ps   %ymm10,%ymm9,%ymm11
   DB  196,66,53,168,216                   ; vfmadd213ps   %ymm8,%ymm9,%ymm11
-  DB  196,98,125,24,5,27,6,0,0            ; vbroadcastss  0x61b(%rip),%ymm8        # 5cdc <_sk_callback_hsw+0x5c8>
+  DB  196,98,125,24,5,35,6,0,0            ; vbroadcastss  0x623(%rip),%ymm8        # 5d18 <_sk_callback_hsw+0x5d0>
   DB  196,66,53,184,195                   ; vfmadd231ps   %ymm11,%ymm9,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -5262,12 +5282,12 @@
 PUBLIC _sk_bicubic_p3y_hsw
 _sk_bicubic_p3y_hsw LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,3,6,0,0           ; vbroadcastss  0x603(%rip),%ymm1        # 5ce0 <_sk_callback_hsw+0x5cc>
+  DB  196,226,125,24,13,11,6,0,0          ; vbroadcastss  0x60b(%rip),%ymm1        # 5d1c <_sk_callback_hsw+0x5d4>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
   DB  197,124,16,64,96                    ; vmovups       0x60(%rax),%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,239,5,0,0          ; vbroadcastss  0x5ef(%rip),%ymm10        # 5ce4 <_sk_callback_hsw+0x5d0>
-  DB  196,98,125,24,29,234,5,0,0          ; vbroadcastss  0x5ea(%rip),%ymm11        # 5ce8 <_sk_callback_hsw+0x5d4>
+  DB  196,98,125,24,21,247,5,0,0          ; vbroadcastss  0x5f7(%rip),%ymm10        # 5d20 <_sk_callback_hsw+0x5d8>
+  DB  196,98,125,24,29,242,5,0,0          ; vbroadcastss  0x5f2(%rip),%ymm11        # 5d24 <_sk_callback_hsw+0x5dc>
   DB  196,66,61,168,218                   ; vfmadd213ps   %ymm10,%ymm8,%ymm11
   DB  196,65,52,89,195                    ; vmulps        %ymm11,%ymm9,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -5384,30 +5404,32 @@
   DB  63                                  ; (bad)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
-  DB  0,128,191,0,0,224                   ; add           %al,-0x1fffff41(%rax)
-  DB  64,154                              ; rex           (bad)
+  DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
+  DB  63                                  ; (bad)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  128,191,0,0,224,64,154              ; cmpb          $0x9a,0x40e00000(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 58f1 <.literal4+0xb1>
+  DB  71,225,61                           ; rex.RXB       loope 592d <.literal4+0xb9>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 5901 <.literal4+0xc1>
+  DB  71,225,61                           ; rex.RXB       loope 593d <.literal4+0xc9>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 5911 <.literal4+0xd1>
+  DB  71,225,61                           ; rex.RXB       loope 594d <.literal4+0xd9>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 5921 <.literal4+0xe1>
+  DB  71,225,61                           ; rex.RXB       loope 595d <.literal4+0xe9>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,127                    ; add           %al,0x7f00003f(%rax)
@@ -5469,7 +5491,7 @@
   DB  190,129,128,128,59                  ; mov           $0x3b808081,%esi
   DB  129,128,128,59,0,248,0,0,8,33       ; addl          $0x21080000,-0x7ffc480(%rax)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        5991 <.literal4+0x151>
+  DB  224,7                               ; loopne        59cd <.literal4+0x159>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -5485,10 +5507,10 @@
   DB  129,128,128,59,129,128,128,59,0,0   ; addl          $0x3b80,-0x7f7ec480(%rax)
   DB  0,52,255                            ; add           %dh,(%rdi,%rdi,8)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            59b8 <.literal4+0x178>
+  DB  127,0                               ; jg            59f4 <.literal4+0x180>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            5a31 <.literal4+0x1f1>
+  DB  119,115                             ; ja            5a6d <.literal4+0x1f9>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -5502,10 +5524,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            59ec <.literal4+0x1ac>
+  DB  127,0                               ; jg            5a28 <.literal4+0x1b4>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            5a65 <.literal4+0x225>
+  DB  119,115                             ; ja            5aa1 <.literal4+0x22d>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -5519,10 +5541,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5a20 <.literal4+0x1e0>
+  DB  127,0                               ; jg            5a5c <.literal4+0x1e8>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            5a99 <.literal4+0x259>
+  DB  119,115                             ; ja            5ad5 <.literal4+0x261>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -5536,10 +5558,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            5a54 <.literal4+0x214>
+  DB  127,0                               ; jg            5a90 <.literal4+0x21c>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            5acd <.literal4+0x28d>
+  DB  119,115                             ; ja            5b09 <.literal4+0x295>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -5552,7 +5574,7 @@
   DB  0,75,0                              ; add           %cl,0x0(%rbx)
   DB  0,128,63,0,0,200                    ; add           %al,-0x37ffffc1(%rax)
   DB  66,0,0                              ; rex.X         add %al,(%rax)
-  DB  127,67                              ; jg            5acb <.literal4+0x28b>
+  DB  127,67                              ; jg            5b07 <.literal4+0x293>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,195                               ; add           %al,%bl
   DB  0,0                                 ; add           %al,(%rax)
@@ -5564,7 +5586,7 @@
   DB  190,80,128,3,62                     ; mov           $0x3e038050,%esi
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           5aeb <.literal4+0x2ab>
+  DB  118,63                              ; jbe           5b27 <.literal4+0x2b3>
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
@@ -5579,7 +5601,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        5aed <.literal4+0x2ad>
+  DB  224,7                               ; loopne        5b29 <.literal4+0x2b5>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -5591,7 +5613,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        5b09 <.literal4+0x2c9>
+  DB  224,7                               ; loopne        5b45 <.literal4+0x2d1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -5603,7 +5625,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        5b25 <.literal4+0x2e5>
+  DB  224,7                               ; loopne        5b61 <.literal4+0x2ed>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -5614,7 +5636,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  248                                 ; clc
   DB  65,0,0                              ; add           %al,(%r8)
-  DB  124,66                              ; jl            5b7a <.literal4+0x33a>
+  DB  124,66                              ; jl            5bb6 <.literal4+0x342>
   DB  0,240                               ; add           %dh,%al
   DB  0,0                                 ; add           %al,(%rax)
   DB  137,136,136,55,0,15                 ; mov           %ecx,0xf003788(%rax)
@@ -5640,7 +5662,7 @@
   DB  137,136,136,59,15,0                 ; mov           %ecx,0xf3b88(%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  137,136,136,61,0,0                  ; mov           %ecx,0x3d88(%rax)
-  DB  112,65                              ; jo            5bdd <.literal4+0x39d>
+  DB  112,65                              ; jo            5c19 <.literal4+0x3a5>
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
@@ -5654,7 +5676,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  255                                 ; (bad)
-  DB  127,71                              ; jg            5c13 <.literal4+0x3d3>
+  DB  127,71                              ; jg            5c4f <.literal4+0x3db>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -5781,16 +5803,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005d28 <_sk_callback_hsw+0xa000614>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005d68 <_sk_callback_hsw+0xa000620>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005d30 <_sk_callback_hsw+0x1200061c>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005d70 <_sk_callback_hsw+0x12000628>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005d38 <_sk_callback_hsw+0x1a000624>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005d78 <_sk_callback_hsw+0x1a000630>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005d40 <_sk_callback_hsw+0x300062c>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005d80 <_sk_callback_hsw+0x3000638>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -5833,16 +5855,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005d88 <_sk_callback_hsw+0xa000674>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005dc8 <_sk_callback_hsw+0xa000680>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005d90 <_sk_callback_hsw+0x1200067c>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005dd0 <_sk_callback_hsw+0x12000688>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005d98 <_sk_callback_hsw+0x1a000684>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005dd8 <_sk_callback_hsw+0x1a000690>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005da0 <_sk_callback_hsw+0x300068c>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005de0 <_sk_callback_hsw+0x3000698>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -5885,16 +5907,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005de8 <_sk_callback_hsw+0xa0006d4>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005e28 <_sk_callback_hsw+0xa0006e0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005df0 <_sk_callback_hsw+0x120006dc>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005e30 <_sk_callback_hsw+0x120006e8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005df8 <_sk_callback_hsw+0x1a0006e4>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005e38 <_sk_callback_hsw+0x1a0006f0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005e00 <_sk_callback_hsw+0x30006ec>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005e40 <_sk_callback_hsw+0x30006f8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -5937,16 +5959,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005e48 <_sk_callback_hsw+0xa000734>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005e88 <_sk_callback_hsw+0xa000740>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005e50 <_sk_callback_hsw+0x1200073c>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005e90 <_sk_callback_hsw+0x12000748>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005e58 <_sk_callback_hsw+0x1a000744>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005e98 <_sk_callback_hsw+0x1a000750>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005e60 <_sk_callback_hsw+0x300074c>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005ea0 <_sk_callback_hsw+0x3000758>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -5989,16 +6011,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005ea8 <_sk_callback_hsw+0xa000794>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005ee8 <_sk_callback_hsw+0xa0007a0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005eb0 <_sk_callback_hsw+0x1200079c>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005ef0 <_sk_callback_hsw+0x120007a8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005eb8 <_sk_callback_hsw+0x1a0007a4>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005ef8 <_sk_callback_hsw+0x1a0007b0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005ec0 <_sk_callback_hsw+0x30007ac>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005f00 <_sk_callback_hsw+0x30007b8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -6041,16 +6063,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005f08 <_sk_callback_hsw+0xa0007f4>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005f48 <_sk_callback_hsw+0xa000800>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005f10 <_sk_callback_hsw+0x120007fc>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005f50 <_sk_callback_hsw+0x12000808>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005f18 <_sk_callback_hsw+0x1a000804>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005f58 <_sk_callback_hsw+0x1a000810>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005f20 <_sk_callback_hsw+0x300080c>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005f60 <_sk_callback_hsw+0x3000818>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -6093,16 +6115,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005f68 <_sk_callback_hsw+0xa000854>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005fa8 <_sk_callback_hsw+0xa000860>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005f70 <_sk_callback_hsw+0x1200085c>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005fb0 <_sk_callback_hsw+0x12000868>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005f78 <_sk_callback_hsw+0x1a000864>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005fb8 <_sk_callback_hsw+0x1a000870>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005f80 <_sk_callback_hsw+0x300086c>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005fc0 <_sk_callback_hsw+0x3000878>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -6145,16 +6167,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005fc8 <_sk_callback_hsw+0xa0008b4>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a006008 <_sk_callback_hsw+0xa0008c0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12005fd0 <_sk_callback_hsw+0x120008bc>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12006010 <_sk_callback_hsw+0x120008c8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a005fd8 <_sk_callback_hsw+0x1a0008c4>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a006018 <_sk_callback_hsw+0x1a0008d0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3005fe0 <_sk_callback_hsw+0x30008cc>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3006020 <_sk_callback_hsw+0x30008d8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -6197,16 +6219,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a006028 <_sk_callback_hsw+0xa000914>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a006068 <_sk_callback_hsw+0xa000920>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12006030 <_sk_callback_hsw+0x1200091c>
+  DB  255,13,255,255,255,17               ; decl          0x11ffffff(%rip)        # 12006070 <_sk_callback_hsw+0x12000928>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a006038 <_sk_callback_hsw+0x1a000924>
+  DB  255,21,255,255,255,25               ; callq         *0x19ffffff(%rip)        # 1a006078 <_sk_callback_hsw+0x1a000930>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3006040 <_sk_callback_hsw+0x300092c>
+  DB  255,29,255,255,255,2                ; lcall         *0x2ffffff(%rip)        # 3006080 <_sk_callback_hsw+0x3000938>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -6400,7 +6422,7 @@
   DB  197,249,112,192,0                   ; vpshufd       $0x0,%xmm0,%xmm0
   DB  196,227,125,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,116,120,0,0       ; vbroadcastss  0x7874(%rip),%ymm1        # 79ac <_sk_callback_avx+0x12c>
+  DB  196,226,125,24,13,168,120,0,0       ; vbroadcastss  0x78a8(%rip),%ymm1        # 79e0 <_sk_callback_avx+0x12c>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  197,252,88,7                        ; vaddps        (%rdi),%ymm0,%ymm0
   DB  197,249,110,209                     ; vmovd         %ecx,%xmm2
@@ -6409,7 +6431,7 @@
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  197,236,88,201                      ; vaddps        %ymm1,%ymm2,%ymm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,21,78,120,0,0        ; vbroadcastss  0x784e(%rip),%ymm2        # 79b0 <_sk_callback_avx+0x130>
+  DB  196,226,125,24,21,130,120,0,0       ; vbroadcastss  0x7882(%rip),%ymm2        # 79e4 <_sk_callback_avx+0x130>
   DB  197,228,87,219                      ; vxorps        %ymm3,%ymm3,%ymm3
   DB  197,220,87,228                      ; vxorps        %ymm4,%ymm4,%ymm4
   DB  197,212,87,237                      ; vxorps        %ymm5,%ymm5,%ymm5
@@ -6431,7 +6453,7 @@
   DB  196,65,121,112,201,0                ; vpshufd       $0x0,%xmm9,%xmm9
   DB  196,67,53,24,201,1                  ; vinsertf128   $0x1,%xmm9,%ymm9,%ymm9
   DB  196,65,52,87,208                    ; vxorps        %ymm8,%ymm9,%ymm10
-  DB  196,98,125,24,29,247,119,0,0        ; vbroadcastss  0x77f7(%rip),%ymm11        # 79b4 <_sk_callback_avx+0x134>
+  DB  196,98,125,24,29,43,120,0,0         ; vbroadcastss  0x782b(%rip),%ymm11        # 79e8 <_sk_callback_avx+0x134>
   DB  196,65,44,84,203                    ; vandps        %ymm11,%ymm10,%ymm9
   DB  196,193,25,114,241,5                ; vpslld        $0x5,%xmm9,%xmm12
   DB  196,67,125,25,201,1                 ; vextractf128  $0x1,%ymm9,%xmm9
@@ -6442,8 +6464,8 @@
   DB  196,67,125,25,219,1                 ; vextractf128  $0x1,%ymm11,%xmm11
   DB  196,193,33,114,243,4                ; vpslld        $0x4,%xmm11,%xmm11
   DB  196,67,29,24,219,1                  ; vinsertf128   $0x1,%xmm11,%ymm12,%ymm11
-  DB  196,98,125,24,37,184,119,0,0        ; vbroadcastss  0x77b8(%rip),%ymm12        # 79b8 <_sk_callback_avx+0x138>
-  DB  196,98,125,24,45,179,119,0,0        ; vbroadcastss  0x77b3(%rip),%ymm13        # 79bc <_sk_callback_avx+0x13c>
+  DB  196,98,125,24,37,236,119,0,0        ; vbroadcastss  0x77ec(%rip),%ymm12        # 79ec <_sk_callback_avx+0x138>
+  DB  196,98,125,24,45,231,119,0,0        ; vbroadcastss  0x77e7(%rip),%ymm13        # 79f0 <_sk_callback_avx+0x13c>
   DB  196,65,44,84,245                    ; vandps        %ymm13,%ymm10,%ymm14
   DB  196,193,1,114,246,2                 ; vpslld        $0x2,%xmm14,%xmm15
   DB  196,67,125,25,246,1                 ; vextractf128  $0x1,%ymm14,%xmm14
@@ -6470,9 +6492,9 @@
   DB  196,65,60,86,193                    ; vorps         %ymm9,%ymm8,%ymm8
   DB  196,65,60,86,194                    ; vorps         %ymm10,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,30,119,0,0         ; vbroadcastss  0x771e(%rip),%ymm9        # 79c0 <_sk_callback_avx+0x140>
+  DB  196,98,125,24,13,82,119,0,0         ; vbroadcastss  0x7752(%rip),%ymm9        # 79f4 <_sk_callback_avx+0x140>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
-  DB  196,98,125,24,13,20,119,0,0         ; vbroadcastss  0x7714(%rip),%ymm9        # 79c4 <_sk_callback_avx+0x144>
+  DB  196,98,125,24,13,72,119,0,0         ; vbroadcastss  0x7748(%rip),%ymm9        # 79f8 <_sk_callback_avx+0x144>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  196,98,125,24,8                     ; vbroadcastss  (%rax),%ymm9
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
@@ -6489,8 +6511,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
-PUBLIC _sk_constant_color_avx
-_sk_constant_color_avx LABEL PROC
+PUBLIC _sk_uniform_color_avx
+_sk_uniform_color_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  196,226,125,24,0                    ; vbroadcastss  (%rax),%ymm0
   DB  196,226,125,24,72,4                 ; vbroadcastss  0x4(%rax),%ymm1
@@ -6499,6 +6521,24 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
+PUBLIC _sk_black_color_avx
+_sk_black_color_avx LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  196,226,125,24,29,232,118,0,0       ; vbroadcastss  0x76e8(%rip),%ymm3        # 79fc <_sk_callback_avx+0x148>
+  DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
+  DB  197,244,87,201                      ; vxorps        %ymm1,%ymm1,%ymm1
+  DB  197,236,87,210                      ; vxorps        %ymm2,%ymm2,%ymm2
+  DB  255,224                             ; jmpq          *%rax
+
+PUBLIC _sk_white_color_avx
+_sk_white_color_avx LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  196,226,125,24,5,211,118,0,0        ; vbroadcastss  0x76d3(%rip),%ymm0        # 7a00 <_sk_callback_avx+0x14c>
+  DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
+  DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
+  DB  197,252,40,216                      ; vmovaps       %ymm0,%ymm3
+  DB  255,224                             ; jmpq          *%rax
+
 PUBLIC _sk_load_rgba_avx
 _sk_load_rgba_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -6531,7 +6571,7 @@
 PUBLIC _sk_srcatop_avx
 _sk_srcatop_avx LABEL PROC
   DB  197,252,89,199                      ; vmulps        %ymm7,%ymm0,%ymm0
-  DB  196,98,125,24,5,108,118,0,0         ; vbroadcastss  0x766c(%rip),%ymm8        # 79c8 <_sk_callback_avx+0x148>
+  DB  196,98,125,24,5,118,118,0,0         ; vbroadcastss  0x7676(%rip),%ymm8        # 7a04 <_sk_callback_avx+0x150>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,204                       ; vmulps        %ymm4,%ymm8,%ymm9
   DB  197,180,88,192                      ; vaddps        %ymm0,%ymm9,%ymm0
@@ -6550,7 +6590,7 @@
 PUBLIC _sk_dstatop_avx
 _sk_dstatop_avx LABEL PROC
   DB  197,100,89,196                      ; vmulps        %ymm4,%ymm3,%ymm8
-  DB  196,98,125,24,13,46,118,0,0         ; vbroadcastss  0x762e(%rip),%ymm9        # 79cc <_sk_callback_avx+0x14c>
+  DB  196,98,125,24,13,56,118,0,0         ; vbroadcastss  0x7638(%rip),%ymm9        # 7a08 <_sk_callback_avx+0x154>
   DB  197,52,92,207                       ; vsubps        %ymm7,%ymm9,%ymm9
   DB  197,180,89,192                      ; vmulps        %ymm0,%ymm9,%ymm0
   DB  197,188,88,192                      ; vaddps        %ymm0,%ymm8,%ymm0
@@ -6586,7 +6626,7 @@
 
 PUBLIC _sk_srcout_avx
 _sk_srcout_avx LABEL PROC
-  DB  196,98,125,24,5,205,117,0,0         ; vbroadcastss  0x75cd(%rip),%ymm8        # 79d0 <_sk_callback_avx+0x150>
+  DB  196,98,125,24,5,215,117,0,0         ; vbroadcastss  0x75d7(%rip),%ymm8        # 7a0c <_sk_callback_avx+0x158>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
@@ -6597,7 +6637,7 @@
 
 PUBLIC _sk_dstout_avx
 _sk_dstout_avx LABEL PROC
-  DB  196,226,125,24,5,176,117,0,0        ; vbroadcastss  0x75b0(%rip),%ymm0        # 79d4 <_sk_callback_avx+0x154>
+  DB  196,226,125,24,5,186,117,0,0        ; vbroadcastss  0x75ba(%rip),%ymm0        # 7a10 <_sk_callback_avx+0x15c>
   DB  197,252,92,219                      ; vsubps        %ymm3,%ymm0,%ymm3
   DB  197,228,89,196                      ; vmulps        %ymm4,%ymm3,%ymm0
   DB  197,228,89,205                      ; vmulps        %ymm5,%ymm3,%ymm1
@@ -6608,7 +6648,7 @@
 
 PUBLIC _sk_srcover_avx
 _sk_srcover_avx LABEL PROC
-  DB  196,98,125,24,5,147,117,0,0         ; vbroadcastss  0x7593(%rip),%ymm8        # 79d8 <_sk_callback_avx+0x158>
+  DB  196,98,125,24,5,157,117,0,0         ; vbroadcastss  0x759d(%rip),%ymm8        # 7a14 <_sk_callback_avx+0x160>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,204                       ; vmulps        %ymm4,%ymm8,%ymm9
   DB  197,180,88,192                      ; vaddps        %ymm0,%ymm9,%ymm0
@@ -6623,7 +6663,7 @@
 
 PUBLIC _sk_dstover_avx
 _sk_dstover_avx LABEL PROC
-  DB  196,98,125,24,5,102,117,0,0         ; vbroadcastss  0x7566(%rip),%ymm8        # 79dc <_sk_callback_avx+0x15c>
+  DB  196,98,125,24,5,112,117,0,0         ; vbroadcastss  0x7570(%rip),%ymm8        # 7a18 <_sk_callback_avx+0x164>
   DB  197,60,92,199                       ; vsubps        %ymm7,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,252,88,196                      ; vaddps        %ymm4,%ymm0,%ymm0
@@ -6647,7 +6687,7 @@
 
 PUBLIC _sk_multiply_avx
 _sk_multiply_avx LABEL PROC
-  DB  196,98,125,24,5,37,117,0,0          ; vbroadcastss  0x7525(%rip),%ymm8        # 79e0 <_sk_callback_avx+0x160>
+  DB  196,98,125,24,5,47,117,0,0          ; vbroadcastss  0x752f(%rip),%ymm8        # 7a1c <_sk_callback_avx+0x168>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,52,89,208                       ; vmulps        %ymm0,%ymm9,%ymm10
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -6701,7 +6741,7 @@
 
 PUBLIC _sk_xor__avx
 _sk_xor__avx LABEL PROC
-  DB  196,98,125,24,5,116,116,0,0         ; vbroadcastss  0x7474(%rip),%ymm8        # 79e4 <_sk_callback_avx+0x164>
+  DB  196,98,125,24,5,126,116,0,0         ; vbroadcastss  0x747e(%rip),%ymm8        # 7a20 <_sk_callback_avx+0x16c>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,180,89,192                      ; vmulps        %ymm0,%ymm9,%ymm0
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -6736,7 +6776,7 @@
   DB  197,100,89,206                      ; vmulps        %ymm6,%ymm3,%ymm9
   DB  196,193,108,95,209                  ; vmaxps        %ymm9,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,244,115,0,0         ; vbroadcastss  0x73f4(%rip),%ymm8        # 79e8 <_sk_callback_avx+0x168>
+  DB  196,98,125,24,5,254,115,0,0         ; vbroadcastss  0x73fe(%rip),%ymm8        # 7a24 <_sk_callback_avx+0x170>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,199                       ; vmulps        %ymm7,%ymm8,%ymm8
   DB  197,188,88,219                      ; vaddps        %ymm3,%ymm8,%ymm3
@@ -6760,7 +6800,7 @@
   DB  197,100,89,206                      ; vmulps        %ymm6,%ymm3,%ymm9
   DB  196,193,108,93,209                  ; vminps        %ymm9,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,160,115,0,0         ; vbroadcastss  0x73a0(%rip),%ymm8        # 79ec <_sk_callback_avx+0x16c>
+  DB  196,98,125,24,5,170,115,0,0         ; vbroadcastss  0x73aa(%rip),%ymm8        # 7a28 <_sk_callback_avx+0x174>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,199                       ; vmulps        %ymm7,%ymm8,%ymm8
   DB  197,188,88,219                      ; vaddps        %ymm3,%ymm8,%ymm3
@@ -6787,7 +6827,7 @@
   DB  196,193,108,93,209                  ; vminps        %ymm9,%ymm2,%ymm2
   DB  197,236,88,210                      ; vaddps        %ymm2,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,64,115,0,0          ; vbroadcastss  0x7340(%rip),%ymm8        # 79f0 <_sk_callback_avx+0x170>
+  DB  196,98,125,24,5,74,115,0,0          ; vbroadcastss  0x734a(%rip),%ymm8        # 7a2c <_sk_callback_avx+0x178>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,199                       ; vmulps        %ymm7,%ymm8,%ymm8
   DB  197,188,88,219                      ; vaddps        %ymm3,%ymm8,%ymm3
@@ -6808,7 +6848,7 @@
   DB  197,236,89,214                      ; vmulps        %ymm6,%ymm2,%ymm2
   DB  197,236,88,210                      ; vaddps        %ymm2,%ymm2,%ymm2
   DB  197,188,92,210                      ; vsubps        %ymm2,%ymm8,%ymm2
-  DB  196,98,125,24,5,251,114,0,0         ; vbroadcastss  0x72fb(%rip),%ymm8        # 79f4 <_sk_callback_avx+0x174>
+  DB  196,98,125,24,5,5,115,0,0           ; vbroadcastss  0x7305(%rip),%ymm8        # 7a30 <_sk_callback_avx+0x17c>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
   DB  197,60,89,199                       ; vmulps        %ymm7,%ymm8,%ymm8
   DB  197,188,88,219                      ; vaddps        %ymm3,%ymm8,%ymm3
@@ -6817,7 +6857,7 @@
 
 PUBLIC _sk_colorburn_avx
 _sk_colorburn_avx LABEL PROC
-  DB  196,98,125,24,5,230,114,0,0         ; vbroadcastss  0x72e6(%rip),%ymm8        # 79f8 <_sk_callback_avx+0x178>
+  DB  196,98,125,24,5,240,114,0,0         ; vbroadcastss  0x72f0(%rip),%ymm8        # 7a34 <_sk_callback_avx+0x180>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,52,89,216                       ; vmulps        %ymm0,%ymm9,%ymm11
   DB  196,65,44,87,210                    ; vxorps        %ymm10,%ymm10,%ymm10
@@ -6877,7 +6917,7 @@
 PUBLIC _sk_colordodge_avx
 _sk_colordodge_avx LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
-  DB  196,98,125,24,13,226,113,0,0        ; vbroadcastss  0x71e2(%rip),%ymm9        # 79fc <_sk_callback_avx+0x17c>
+  DB  196,98,125,24,13,236,113,0,0        ; vbroadcastss  0x71ec(%rip),%ymm9        # 7a38 <_sk_callback_avx+0x184>
   DB  197,52,92,215                       ; vsubps        %ymm7,%ymm9,%ymm10
   DB  197,44,89,216                       ; vmulps        %ymm0,%ymm10,%ymm11
   DB  197,52,92,203                       ; vsubps        %ymm3,%ymm9,%ymm9
@@ -6932,7 +6972,7 @@
 
 PUBLIC _sk_hardlight_avx
 _sk_hardlight_avx LABEL PROC
-  DB  196,98,125,24,5,244,112,0,0         ; vbroadcastss  0x70f4(%rip),%ymm8        # 7a00 <_sk_callback_avx+0x180>
+  DB  196,98,125,24,5,254,112,0,0         ; vbroadcastss  0x70fe(%rip),%ymm8        # 7a3c <_sk_callback_avx+0x188>
   DB  197,60,92,215                       ; vsubps        %ymm7,%ymm8,%ymm10
   DB  197,44,89,200                       ; vmulps        %ymm0,%ymm10,%ymm9
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -6985,7 +7025,7 @@
 
 PUBLIC _sk_overlay_avx
 _sk_overlay_avx LABEL PROC
-  DB  196,98,125,24,5,29,112,0,0          ; vbroadcastss  0x701d(%rip),%ymm8        # 7a04 <_sk_callback_avx+0x184>
+  DB  196,98,125,24,5,39,112,0,0          ; vbroadcastss  0x7027(%rip),%ymm8        # 7a40 <_sk_callback_avx+0x18c>
   DB  197,60,92,215                       ; vsubps        %ymm7,%ymm8,%ymm10
   DB  197,44,89,200                       ; vmulps        %ymm0,%ymm10,%ymm9
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -7050,10 +7090,10 @@
   DB  196,65,60,88,192                    ; vaddps        %ymm8,%ymm8,%ymm8
   DB  196,65,60,89,216                    ; vmulps        %ymm8,%ymm8,%ymm11
   DB  196,65,60,88,195                    ; vaddps        %ymm11,%ymm8,%ymm8
-  DB  196,98,125,24,29,16,111,0,0         ; vbroadcastss  0x6f10(%rip),%ymm11        # 7a0c <_sk_callback_avx+0x18c>
+  DB  196,98,125,24,29,26,111,0,0         ; vbroadcastss  0x6f1a(%rip),%ymm11        # 7a48 <_sk_callback_avx+0x194>
   DB  196,65,28,88,235                    ; vaddps        %ymm11,%ymm12,%ymm13
   DB  196,65,20,89,192                    ; vmulps        %ymm8,%ymm13,%ymm8
-  DB  196,98,125,24,45,1,111,0,0          ; vbroadcastss  0x6f01(%rip),%ymm13        # 7a10 <_sk_callback_avx+0x190>
+  DB  196,98,125,24,45,11,111,0,0         ; vbroadcastss  0x6f0b(%rip),%ymm13        # 7a4c <_sk_callback_avx+0x198>
   DB  196,65,28,89,245                    ; vmulps        %ymm13,%ymm12,%ymm14
   DB  196,65,12,88,192                    ; vaddps        %ymm8,%ymm14,%ymm8
   DB  196,65,124,82,244                   ; vrsqrtps      %ymm12,%ymm14
@@ -7064,7 +7104,7 @@
   DB  197,4,194,255,2                     ; vcmpleps      %ymm7,%ymm15,%ymm15
   DB  196,67,13,74,240,240                ; vblendvps     %ymm15,%ymm8,%ymm14,%ymm14
   DB  197,116,88,249                      ; vaddps        %ymm1,%ymm1,%ymm15
-  DB  196,98,125,24,5,191,110,0,0         ; vbroadcastss  0x6ebf(%rip),%ymm8        # 7a08 <_sk_callback_avx+0x188>
+  DB  196,98,125,24,5,201,110,0,0         ; vbroadcastss  0x6ec9(%rip),%ymm8        # 7a44 <_sk_callback_avx+0x190>
   DB  196,65,60,92,228                    ; vsubps        %ymm12,%ymm8,%ymm12
   DB  197,132,92,195                      ; vsubps        %ymm3,%ymm15,%ymm0
   DB  196,65,124,89,228                   ; vmulps        %ymm12,%ymm0,%ymm12
@@ -7191,12 +7231,12 @@
   DB  196,65,28,89,219                    ; vmulps        %ymm11,%ymm12,%ymm11
   DB  196,65,36,94,222                    ; vdivps        %ymm14,%ymm11,%ymm11
   DB  196,67,37,74,224,240                ; vblendvps     %ymm15,%ymm8,%ymm11,%ymm12
-  DB  196,98,125,24,53,137,108,0,0        ; vbroadcastss  0x6c89(%rip),%ymm14        # 7a14 <_sk_callback_avx+0x194>
+  DB  196,98,125,24,53,147,108,0,0        ; vbroadcastss  0x6c93(%rip),%ymm14        # 7a50 <_sk_callback_avx+0x19c>
   DB  196,65,92,89,222                    ; vmulps        %ymm14,%ymm4,%ymm11
-  DB  196,98,125,24,61,127,108,0,0        ; vbroadcastss  0x6c7f(%rip),%ymm15        # 7a18 <_sk_callback_avx+0x198>
+  DB  196,98,125,24,61,137,108,0,0        ; vbroadcastss  0x6c89(%rip),%ymm15        # 7a54 <_sk_callback_avx+0x1a0>
   DB  196,65,84,89,239                    ; vmulps        %ymm15,%ymm5,%ymm13
   DB  196,65,36,88,221                    ; vaddps        %ymm13,%ymm11,%ymm11
-  DB  196,226,125,24,5,112,108,0,0        ; vbroadcastss  0x6c70(%rip),%ymm0        # 7a1c <_sk_callback_avx+0x19c>
+  DB  196,226,125,24,5,122,108,0,0        ; vbroadcastss  0x6c7a(%rip),%ymm0        # 7a58 <_sk_callback_avx+0x1a4>
   DB  197,76,89,232                       ; vmulps        %ymm0,%ymm6,%ymm13
   DB  196,65,36,88,221                    ; vaddps        %ymm13,%ymm11,%ymm11
   DB  196,65,52,89,238                    ; vmulps        %ymm14,%ymm9,%ymm13
@@ -7257,7 +7297,7 @@
   DB  196,65,36,95,208                    ; vmaxps        %ymm8,%ymm11,%ymm10
   DB  196,195,109,74,209,240              ; vblendvps     %ymm15,%ymm9,%ymm2,%ymm2
   DB  196,193,108,95,208                  ; vmaxps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,73,107,0,0          ; vbroadcastss  0x6b49(%rip),%ymm8        # 7a20 <_sk_callback_avx+0x1a0>
+  DB  196,98,125,24,5,83,107,0,0          ; vbroadcastss  0x6b53(%rip),%ymm8        # 7a5c <_sk_callback_avx+0x1a8>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,180,89,201                      ; vmulps        %ymm1,%ymm9,%ymm1
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -7314,12 +7354,12 @@
   DB  196,65,28,89,219                    ; vmulps        %ymm11,%ymm12,%ymm11
   DB  196,65,36,94,222                    ; vdivps        %ymm14,%ymm11,%ymm11
   DB  196,67,37,74,224,240                ; vblendvps     %ymm15,%ymm8,%ymm11,%ymm12
-  DB  196,98,125,24,53,81,106,0,0         ; vbroadcastss  0x6a51(%rip),%ymm14        # 7a24 <_sk_callback_avx+0x1a4>
+  DB  196,98,125,24,53,91,106,0,0         ; vbroadcastss  0x6a5b(%rip),%ymm14        # 7a60 <_sk_callback_avx+0x1ac>
   DB  196,65,92,89,222                    ; vmulps        %ymm14,%ymm4,%ymm11
-  DB  196,98,125,24,61,71,106,0,0         ; vbroadcastss  0x6a47(%rip),%ymm15        # 7a28 <_sk_callback_avx+0x1a8>
+  DB  196,98,125,24,61,81,106,0,0         ; vbroadcastss  0x6a51(%rip),%ymm15        # 7a64 <_sk_callback_avx+0x1b0>
   DB  196,65,84,89,239                    ; vmulps        %ymm15,%ymm5,%ymm13
   DB  196,65,36,88,221                    ; vaddps        %ymm13,%ymm11,%ymm11
-  DB  196,226,125,24,5,56,106,0,0         ; vbroadcastss  0x6a38(%rip),%ymm0        # 7a2c <_sk_callback_avx+0x1ac>
+  DB  196,226,125,24,5,66,106,0,0         ; vbroadcastss  0x6a42(%rip),%ymm0        # 7a68 <_sk_callback_avx+0x1b4>
   DB  197,76,89,232                       ; vmulps        %ymm0,%ymm6,%ymm13
   DB  196,65,36,88,221                    ; vaddps        %ymm13,%ymm11,%ymm11
   DB  196,65,52,89,238                    ; vmulps        %ymm14,%ymm9,%ymm13
@@ -7380,7 +7420,7 @@
   DB  196,65,36,95,208                    ; vmaxps        %ymm8,%ymm11,%ymm10
   DB  196,195,109,74,209,240              ; vblendvps     %ymm15,%ymm9,%ymm2,%ymm2
   DB  196,193,108,95,208                  ; vmaxps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,17,105,0,0          ; vbroadcastss  0x6911(%rip),%ymm8        # 7a30 <_sk_callback_avx+0x1b0>
+  DB  196,98,125,24,5,27,105,0,0          ; vbroadcastss  0x691b(%rip),%ymm8        # 7a6c <_sk_callback_avx+0x1b8>
   DB  197,60,92,207                       ; vsubps        %ymm7,%ymm8,%ymm9
   DB  197,180,89,201                      ; vmulps        %ymm1,%ymm9,%ymm1
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
@@ -7409,12 +7449,12 @@
   DB  197,252,17,68,36,32                 ; vmovups       %ymm0,0x20(%rsp)
   DB  197,124,89,199                      ; vmulps        %ymm7,%ymm0,%ymm8
   DB  197,116,89,207                      ; vmulps        %ymm7,%ymm1,%ymm9
-  DB  196,98,125,24,45,161,104,0,0        ; vbroadcastss  0x68a1(%rip),%ymm13        # 7a34 <_sk_callback_avx+0x1b4>
+  DB  196,98,125,24,45,171,104,0,0        ; vbroadcastss  0x68ab(%rip),%ymm13        # 7a70 <_sk_callback_avx+0x1bc>
   DB  196,65,92,89,213                    ; vmulps        %ymm13,%ymm4,%ymm10
-  DB  196,98,125,24,53,151,104,0,0        ; vbroadcastss  0x6897(%rip),%ymm14        # 7a38 <_sk_callback_avx+0x1b8>
+  DB  196,98,125,24,53,161,104,0,0        ; vbroadcastss  0x68a1(%rip),%ymm14        # 7a74 <_sk_callback_avx+0x1c0>
   DB  196,65,84,89,222                    ; vmulps        %ymm14,%ymm5,%ymm11
   DB  196,65,44,88,211                    ; vaddps        %ymm11,%ymm10,%ymm10
-  DB  196,98,125,24,61,136,104,0,0        ; vbroadcastss  0x6888(%rip),%ymm15        # 7a3c <_sk_callback_avx+0x1bc>
+  DB  196,98,125,24,61,146,104,0,0        ; vbroadcastss  0x6892(%rip),%ymm15        # 7a78 <_sk_callback_avx+0x1c4>
   DB  196,65,76,89,223                    ; vmulps        %ymm15,%ymm6,%ymm11
   DB  196,193,44,88,195                   ; vaddps        %ymm11,%ymm10,%ymm0
   DB  196,65,60,89,221                    ; vmulps        %ymm13,%ymm8,%ymm11
@@ -7477,7 +7517,7 @@
   DB  196,65,44,95,207                    ; vmaxps        %ymm15,%ymm10,%ymm9
   DB  196,195,37,74,192,0                 ; vblendvps     %ymm0,%ymm8,%ymm11,%ymm0
   DB  196,65,124,95,199                   ; vmaxps        %ymm15,%ymm0,%ymm8
-  DB  196,226,125,24,5,79,103,0,0         ; vbroadcastss  0x674f(%rip),%ymm0        # 7a40 <_sk_callback_avx+0x1c0>
+  DB  196,226,125,24,5,89,103,0,0         ; vbroadcastss  0x6759(%rip),%ymm0        # 7a7c <_sk_callback_avx+0x1c8>
   DB  197,124,92,215                      ; vsubps        %ymm7,%ymm0,%ymm10
   DB  197,172,89,84,36,32                 ; vmulps        0x20(%rsp),%ymm10,%ymm2
   DB  197,124,92,219                      ; vsubps        %ymm3,%ymm0,%ymm11
@@ -7507,12 +7547,12 @@
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
   DB  197,100,89,196                      ; vmulps        %ymm4,%ymm3,%ymm8
   DB  197,100,89,205                      ; vmulps        %ymm5,%ymm3,%ymm9
-  DB  196,98,125,24,45,219,102,0,0        ; vbroadcastss  0x66db(%rip),%ymm13        # 7a44 <_sk_callback_avx+0x1c4>
+  DB  196,98,125,24,45,229,102,0,0        ; vbroadcastss  0x66e5(%rip),%ymm13        # 7a80 <_sk_callback_avx+0x1cc>
   DB  196,65,108,89,213                   ; vmulps        %ymm13,%ymm2,%ymm10
-  DB  196,98,125,24,53,209,102,0,0        ; vbroadcastss  0x66d1(%rip),%ymm14        # 7a48 <_sk_callback_avx+0x1c8>
+  DB  196,98,125,24,53,219,102,0,0        ; vbroadcastss  0x66db(%rip),%ymm14        # 7a84 <_sk_callback_avx+0x1d0>
   DB  196,65,116,89,222                   ; vmulps        %ymm14,%ymm1,%ymm11
   DB  196,65,44,88,211                    ; vaddps        %ymm11,%ymm10,%ymm10
-  DB  196,98,125,24,61,194,102,0,0        ; vbroadcastss  0x66c2(%rip),%ymm15        # 7a4c <_sk_callback_avx+0x1cc>
+  DB  196,98,125,24,61,204,102,0,0        ; vbroadcastss  0x66cc(%rip),%ymm15        # 7a88 <_sk_callback_avx+0x1d4>
   DB  196,65,28,89,223                    ; vmulps        %ymm15,%ymm12,%ymm11
   DB  196,193,44,88,195                   ; vaddps        %ymm11,%ymm10,%ymm0
   DB  196,65,60,89,221                    ; vmulps        %ymm13,%ymm8,%ymm11
@@ -7575,7 +7615,7 @@
   DB  196,65,44,95,207                    ; vmaxps        %ymm15,%ymm10,%ymm9
   DB  196,195,37,74,192,0                 ; vblendvps     %ymm0,%ymm8,%ymm11,%ymm0
   DB  196,65,124,95,199                   ; vmaxps        %ymm15,%ymm0,%ymm8
-  DB  196,226,125,24,5,137,101,0,0        ; vbroadcastss  0x6589(%rip),%ymm0        # 7a50 <_sk_callback_avx+0x1d0>
+  DB  196,226,125,24,5,147,101,0,0        ; vbroadcastss  0x6593(%rip),%ymm0        # 7a8c <_sk_callback_avx+0x1d8>
   DB  197,124,92,215                      ; vsubps        %ymm7,%ymm0,%ymm10
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  197,124,92,219                      ; vsubps        %ymm3,%ymm0,%ymm11
@@ -7604,9 +7644,9 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,47,1,0,0                     ; jne           1661 <_sk_srcover_rgba_8888_avx+0x14c>
+  DB  15,133,47,1,0,0                     ; jne           1693 <_sk_srcover_rgba_8888_avx+0x14c>
   DB  196,193,124,16,58                   ; vmovups       (%r10),%ymm7
-  DB  197,124,40,13,1,107,0,0             ; vmovaps       0x6b01(%rip),%ymm9        # 8040 <_sk_callback_avx+0x7c0>
+  DB  197,124,40,13,15,107,0,0            ; vmovaps       0x6b0f(%rip),%ymm9        # 8080 <_sk_callback_avx+0x7cc>
   DB  196,193,68,84,225                   ; vandps        %ymm9,%ymm7,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
   DB  197,209,114,215,8                   ; vpsrld        $0x8,%xmm7,%xmm5
@@ -7624,9 +7664,9 @@
   DB  196,193,65,114,208,24               ; vpsrld        $0x18,%xmm8,%xmm7
   DB  196,227,53,24,255,1                 ; vinsertf128   $0x1,%xmm7,%ymm9,%ymm7
   DB  197,252,91,255                      ; vcvtdq2ps     %ymm7,%ymm7
-  DB  196,98,125,24,5,180,100,0,0         ; vbroadcastss  0x64b4(%rip),%ymm8        # 7a54 <_sk_callback_avx+0x1d4>
+  DB  196,98,125,24,5,190,100,0,0         ; vbroadcastss  0x64be(%rip),%ymm8        # 7a90 <_sk_callback_avx+0x1dc>
   DB  197,60,92,195                       ; vsubps        %ymm3,%ymm8,%ymm8
-  DB  196,98,125,24,13,171,100,0,0        ; vbroadcastss  0x64ab(%rip),%ymm9        # 7a58 <_sk_callback_avx+0x1d8>
+  DB  196,98,125,24,13,181,100,0,0        ; vbroadcastss  0x64b5(%rip),%ymm9        # 7a94 <_sk_callback_avx+0x1e0>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  197,60,89,212                       ; vmulps        %ymm4,%ymm8,%ymm10
   DB  196,193,124,88,194                  ; vaddps        %ymm10,%ymm0,%ymm0
@@ -7659,7 +7699,7 @@
   DB  196,65,53,86,202                    ; vorpd         %ymm10,%ymm9,%ymm9
   DB  196,65,61,86,193                    ; vorpd         %ymm9,%ymm8,%ymm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,91                              ; jne           16ac <_sk_srcover_rgba_8888_avx+0x197>
+  DB  117,91                              ; jne           16de <_sk_srcover_rgba_8888_avx+0x197>
   DB  196,65,124,17,2                     ; vmovups       %ymm8,(%r10)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,201                          ; mov           %r9,%rcx
@@ -7672,13 +7712,13 @@
   DB  72,211,232                          ; shr           %cl,%rax
   DB  196,225,249,110,224                 ; vmovq         %rax,%xmm4
   DB  196,226,121,48,228                  ; vpmovzxbw     %xmm4,%xmm4
-  DB  196,226,89,0,45,7,104,0,0           ; vpshufb       0x6807(%rip),%xmm4,%xmm5        # 7e90 <_sk_callback_avx+0x610>
+  DB  196,226,89,0,45,21,104,0,0          ; vpshufb       0x6815(%rip),%xmm4,%xmm5        # 7ed0 <_sk_callback_avx+0x61c>
   DB  196,226,121,33,237                  ; vpmovsxbd     %xmm5,%xmm5
-  DB  196,226,89,0,37,9,104,0,0           ; vpshufb       0x6809(%rip),%xmm4,%xmm4        # 7ea0 <_sk_callback_avx+0x620>
+  DB  196,226,89,0,37,23,104,0,0          ; vpshufb       0x6817(%rip),%xmm4,%xmm4        # 7ee0 <_sk_callback_avx+0x62c>
   DB  196,226,121,33,228                  ; vpmovsxbd     %xmm4,%xmm4
   DB  196,227,85,24,228,1                 ; vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
   DB  196,194,93,44,58                    ; vmaskmovps    (%r10),%ymm4,%ymm7
-  DB  233,139,254,255,255                 ; jmpq          1537 <_sk_srcover_rgba_8888_avx+0x22>
+  DB  233,139,254,255,255                 ; jmpq          1569 <_sk_srcover_rgba_8888_avx+0x22>
   DB  185,8,0,0,0                         ; mov           $0x8,%ecx
   DB  68,41,193                           ; sub           %r8d,%ecx
   DB  192,225,3                           ; shl           $0x3,%cl
@@ -7686,13 +7726,13 @@
   DB  72,211,232                          ; shr           %cl,%rax
   DB  196,97,249,110,200                  ; vmovq         %rax,%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
-  DB  196,98,49,0,21,188,103,0,0          ; vpshufb       0x67bc(%rip),%xmm9,%xmm10        # 7e90 <_sk_callback_avx+0x610>
+  DB  196,98,49,0,21,202,103,0,0          ; vpshufb       0x67ca(%rip),%xmm9,%xmm10        # 7ed0 <_sk_callback_avx+0x61c>
   DB  196,66,121,33,210                   ; vpmovsxbd     %xmm10,%xmm10
-  DB  196,98,49,0,13,190,103,0,0          ; vpshufb       0x67be(%rip),%xmm9,%xmm9        # 7ea0 <_sk_callback_avx+0x620>
+  DB  196,98,49,0,13,204,103,0,0          ; vpshufb       0x67cc(%rip),%xmm9,%xmm9        # 7ee0 <_sk_callback_avx+0x62c>
   DB  196,66,121,33,201                   ; vpmovsxbd     %xmm9,%xmm9
   DB  196,67,45,24,201,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
   DB  196,66,53,46,2                      ; vmaskmovps    %ymm8,%ymm9,(%r10)
-  DB  233,95,255,255,255                  ; jmpq          1656 <_sk_srcover_rgba_8888_avx+0x141>
+  DB  233,95,255,255,255                  ; jmpq          1688 <_sk_srcover_rgba_8888_avx+0x141>
 
 PUBLIC _sk_clamp_0_avx
 _sk_clamp_0_avx LABEL PROC
@@ -7706,7 +7746,7 @@
 
 PUBLIC _sk_clamp_1_avx
 _sk_clamp_1_avx LABEL PROC
-  DB  196,98,125,24,5,63,99,0,0           ; vbroadcastss  0x633f(%rip),%ymm8        # 7a5c <_sk_callback_avx+0x1dc>
+  DB  196,98,125,24,5,73,99,0,0           ; vbroadcastss  0x6349(%rip),%ymm8        # 7a98 <_sk_callback_avx+0x1e4>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  196,193,116,93,200                  ; vminps        %ymm8,%ymm1,%ymm1
   DB  196,193,108,93,208                  ; vminps        %ymm8,%ymm2,%ymm2
@@ -7716,7 +7756,7 @@
 
 PUBLIC _sk_clamp_a_avx
 _sk_clamp_a_avx LABEL PROC
-  DB  196,98,125,24,5,34,99,0,0           ; vbroadcastss  0x6322(%rip),%ymm8        # 7a60 <_sk_callback_avx+0x1e0>
+  DB  196,98,125,24,5,44,99,0,0           ; vbroadcastss  0x632c(%rip),%ymm8        # 7a9c <_sk_callback_avx+0x1e8>
   DB  196,193,100,93,216                  ; vminps        %ymm8,%ymm3,%ymm3
   DB  197,252,93,195                      ; vminps        %ymm3,%ymm0,%ymm0
   DB  197,244,93,203                      ; vminps        %ymm3,%ymm1,%ymm1
@@ -7726,7 +7766,7 @@
 
 PUBLIC _sk_clamp_a_dst_avx
 _sk_clamp_a_dst_avx LABEL PROC
-  DB  196,98,125,24,5,8,99,0,0            ; vbroadcastss  0x6308(%rip),%ymm8        # 7a64 <_sk_callback_avx+0x1e4>
+  DB  196,98,125,24,5,18,99,0,0           ; vbroadcastss  0x6312(%rip),%ymm8        # 7aa0 <_sk_callback_avx+0x1ec>
   DB  196,193,68,93,248                   ; vminps        %ymm8,%ymm7,%ymm7
   DB  197,220,93,231                      ; vminps        %ymm7,%ymm4,%ymm4
   DB  197,212,93,239                      ; vminps        %ymm7,%ymm5,%ymm5
@@ -7781,7 +7821,7 @@
 _sk_unpremul_avx LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,65,100,194,200,0                ; vcmpeqps      %ymm8,%ymm3,%ymm9
-  DB  196,98,125,24,21,132,98,0,0         ; vbroadcastss  0x6284(%rip),%ymm10        # 7a68 <_sk_callback_avx+0x1e8>
+  DB  196,98,125,24,21,142,98,0,0         ; vbroadcastss  0x628e(%rip),%ymm10        # 7aa4 <_sk_callback_avx+0x1f0>
   DB  197,44,94,211                       ; vdivps        %ymm3,%ymm10,%ymm10
   DB  196,67,45,74,192,144                ; vblendvps     %ymm9,%ymm8,%ymm10,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
@@ -7792,17 +7832,17 @@
 
 PUBLIC _sk_from_srgb_avx
 _sk_from_srgb_avx LABEL PROC
-  DB  196,98,125,24,5,101,98,0,0          ; vbroadcastss  0x6265(%rip),%ymm8        # 7a6c <_sk_callback_avx+0x1ec>
+  DB  196,98,125,24,5,111,98,0,0          ; vbroadcastss  0x626f(%rip),%ymm8        # 7aa8 <_sk_callback_avx+0x1f4>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  197,124,89,208                      ; vmulps        %ymm0,%ymm0,%ymm10
-  DB  196,98,125,24,29,87,98,0,0          ; vbroadcastss  0x6257(%rip),%ymm11        # 7a70 <_sk_callback_avx+0x1f0>
+  DB  196,98,125,24,29,97,98,0,0          ; vbroadcastss  0x6261(%rip),%ymm11        # 7aac <_sk_callback_avx+0x1f8>
   DB  196,65,124,89,227                   ; vmulps        %ymm11,%ymm0,%ymm12
-  DB  196,98,125,24,45,77,98,0,0          ; vbroadcastss  0x624d(%rip),%ymm13        # 7a74 <_sk_callback_avx+0x1f4>
+  DB  196,98,125,24,45,87,98,0,0          ; vbroadcastss  0x6257(%rip),%ymm13        # 7ab0 <_sk_callback_avx+0x1fc>
   DB  196,65,28,88,229                    ; vaddps        %ymm13,%ymm12,%ymm12
   DB  196,65,44,89,212                    ; vmulps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,62,98,0,0          ; vbroadcastss  0x623e(%rip),%ymm12        # 7a78 <_sk_callback_avx+0x1f8>
+  DB  196,98,125,24,37,72,98,0,0          ; vbroadcastss  0x6248(%rip),%ymm12        # 7ab4 <_sk_callback_avx+0x200>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,53,52,98,0,0          ; vbroadcastss  0x6234(%rip),%ymm14        # 7a7c <_sk_callback_avx+0x1fc>
+  DB  196,98,125,24,53,62,98,0,0          ; vbroadcastss  0x623e(%rip),%ymm14        # 7ab8 <_sk_callback_avx+0x204>
   DB  196,193,124,194,198,1               ; vcmpltps      %ymm14,%ymm0,%ymm0
   DB  196,195,45,74,193,0                 ; vblendvps     %ymm0,%ymm9,%ymm10,%ymm0
   DB  196,65,116,89,200                   ; vmulps        %ymm8,%ymm1,%ymm9
@@ -7826,17 +7866,17 @@
 
 PUBLIC _sk_from_srgb_dst_avx
 _sk_from_srgb_dst_avx LABEL PROC
-  DB  196,98,125,24,5,205,97,0,0          ; vbroadcastss  0x61cd(%rip),%ymm8        # 7a80 <_sk_callback_avx+0x200>
+  DB  196,98,125,24,5,215,97,0,0          ; vbroadcastss  0x61d7(%rip),%ymm8        # 7abc <_sk_callback_avx+0x208>
   DB  196,65,92,89,200                    ; vmulps        %ymm8,%ymm4,%ymm9
   DB  197,92,89,212                       ; vmulps        %ymm4,%ymm4,%ymm10
-  DB  196,98,125,24,29,191,97,0,0         ; vbroadcastss  0x61bf(%rip),%ymm11        # 7a84 <_sk_callback_avx+0x204>
+  DB  196,98,125,24,29,201,97,0,0         ; vbroadcastss  0x61c9(%rip),%ymm11        # 7ac0 <_sk_callback_avx+0x20c>
   DB  196,65,92,89,227                    ; vmulps        %ymm11,%ymm4,%ymm12
-  DB  196,98,125,24,45,181,97,0,0         ; vbroadcastss  0x61b5(%rip),%ymm13        # 7a88 <_sk_callback_avx+0x208>
+  DB  196,98,125,24,45,191,97,0,0         ; vbroadcastss  0x61bf(%rip),%ymm13        # 7ac4 <_sk_callback_avx+0x210>
   DB  196,65,28,88,229                    ; vaddps        %ymm13,%ymm12,%ymm12
   DB  196,65,44,89,212                    ; vmulps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,37,166,97,0,0         ; vbroadcastss  0x61a6(%rip),%ymm12        # 7a8c <_sk_callback_avx+0x20c>
+  DB  196,98,125,24,37,176,97,0,0         ; vbroadcastss  0x61b0(%rip),%ymm12        # 7ac8 <_sk_callback_avx+0x214>
   DB  196,65,44,88,212                    ; vaddps        %ymm12,%ymm10,%ymm10
-  DB  196,98,125,24,53,156,97,0,0         ; vbroadcastss  0x619c(%rip),%ymm14        # 7a90 <_sk_callback_avx+0x210>
+  DB  196,98,125,24,53,166,97,0,0         ; vbroadcastss  0x61a6(%rip),%ymm14        # 7acc <_sk_callback_avx+0x218>
   DB  196,193,92,194,230,1                ; vcmpltps      %ymm14,%ymm4,%ymm4
   DB  196,195,45,74,225,64                ; vblendvps     %ymm4,%ymm9,%ymm10,%ymm4
   DB  196,65,84,89,200                    ; vmulps        %ymm8,%ymm5,%ymm9
@@ -7861,20 +7901,20 @@
 PUBLIC _sk_to_srgb_avx
 _sk_to_srgb_avx LABEL PROC
   DB  197,124,82,200                      ; vrsqrtps      %ymm0,%ymm9
-  DB  196,98,125,24,5,49,97,0,0           ; vbroadcastss  0x6131(%rip),%ymm8        # 7a94 <_sk_callback_avx+0x214>
+  DB  196,98,125,24,5,59,97,0,0           ; vbroadcastss  0x613b(%rip),%ymm8        # 7ad0 <_sk_callback_avx+0x21c>
   DB  196,65,124,89,208                   ; vmulps        %ymm8,%ymm0,%ymm10
-  DB  196,98,125,24,29,39,97,0,0          ; vbroadcastss  0x6127(%rip),%ymm11        # 7a98 <_sk_callback_avx+0x218>
+  DB  196,98,125,24,29,49,97,0,0          ; vbroadcastss  0x6131(%rip),%ymm11        # 7ad4 <_sk_callback_avx+0x220>
   DB  196,65,52,89,227                    ; vmulps        %ymm11,%ymm9,%ymm12
-  DB  196,98,125,24,45,29,97,0,0          ; vbroadcastss  0x611d(%rip),%ymm13        # 7a9c <_sk_callback_avx+0x21c>
+  DB  196,98,125,24,45,39,97,0,0          ; vbroadcastss  0x6127(%rip),%ymm13        # 7ad8 <_sk_callback_avx+0x224>
   DB  196,65,28,88,229                    ; vaddps        %ymm13,%ymm12,%ymm12
   DB  196,65,52,89,228                    ; vmulps        %ymm12,%ymm9,%ymm12
-  DB  196,98,125,24,53,14,97,0,0          ; vbroadcastss  0x610e(%rip),%ymm14        # 7aa0 <_sk_callback_avx+0x220>
+  DB  196,98,125,24,53,24,97,0,0          ; vbroadcastss  0x6118(%rip),%ymm14        # 7adc <_sk_callback_avx+0x228>
   DB  196,65,28,88,230                    ; vaddps        %ymm14,%ymm12,%ymm12
-  DB  196,98,125,24,61,4,97,0,0           ; vbroadcastss  0x6104(%rip),%ymm15        # 7aa4 <_sk_callback_avx+0x224>
+  DB  196,98,125,24,61,14,97,0,0          ; vbroadcastss  0x610e(%rip),%ymm15        # 7ae0 <_sk_callback_avx+0x22c>
   DB  196,65,52,88,207                    ; vaddps        %ymm15,%ymm9,%ymm9
   DB  196,65,124,83,201                   ; vrcpps        %ymm9,%ymm9
   DB  196,65,52,89,204                    ; vmulps        %ymm12,%ymm9,%ymm9
-  DB  196,98,125,24,37,240,96,0,0         ; vbroadcastss  0x60f0(%rip),%ymm12        # 7aa8 <_sk_callback_avx+0x228>
+  DB  196,98,125,24,37,250,96,0,0         ; vbroadcastss  0x60fa(%rip),%ymm12        # 7ae4 <_sk_callback_avx+0x230>
   DB  196,193,124,194,196,1               ; vcmpltps      %ymm12,%ymm0,%ymm0
   DB  196,195,53,74,194,0                 ; vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   DB  197,124,82,201                      ; vrsqrtps      %ymm1,%ymm9
@@ -7909,7 +7949,7 @@
   DB  197,124,93,201                      ; vminps        %ymm1,%ymm0,%ymm9
   DB  197,52,93,202                       ; vminps        %ymm2,%ymm9,%ymm9
   DB  196,65,60,92,209                    ; vsubps        %ymm9,%ymm8,%ymm10
-  DB  196,98,125,24,29,86,96,0,0          ; vbroadcastss  0x6056(%rip),%ymm11        # 7aac <_sk_callback_avx+0x22c>
+  DB  196,98,125,24,29,96,96,0,0          ; vbroadcastss  0x6060(%rip),%ymm11        # 7ae8 <_sk_callback_avx+0x234>
   DB  196,65,36,94,218                    ; vdivps        %ymm10,%ymm11,%ymm11
   DB  197,116,92,226                      ; vsubps        %ymm2,%ymm1,%ymm12
   DB  196,65,28,89,227                    ; vmulps        %ymm11,%ymm12,%ymm12
@@ -7919,19 +7959,19 @@
   DB  196,193,108,89,211                  ; vmulps        %ymm11,%ymm2,%ymm2
   DB  197,252,92,201                      ; vsubps        %ymm1,%ymm0,%ymm1
   DB  196,193,116,89,203                  ; vmulps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,47,96,0,0          ; vbroadcastss  0x602f(%rip),%ymm11        # 7ab8 <_sk_callback_avx+0x238>
+  DB  196,98,125,24,29,57,96,0,0          ; vbroadcastss  0x6039(%rip),%ymm11        # 7af4 <_sk_callback_avx+0x240>
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,29,96,0,0          ; vbroadcastss  0x601d(%rip),%ymm11        # 7ab4 <_sk_callback_avx+0x234>
+  DB  196,98,125,24,29,39,96,0,0          ; vbroadcastss  0x6027(%rip),%ymm11        # 7af0 <_sk_callback_avx+0x23c>
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
   DB  196,227,117,74,202,224              ; vblendvps     %ymm14,%ymm2,%ymm1,%ymm1
-  DB  196,226,125,24,21,5,96,0,0          ; vbroadcastss  0x6005(%rip),%ymm2        # 7ab0 <_sk_callback_avx+0x230>
+  DB  196,226,125,24,21,15,96,0,0         ; vbroadcastss  0x600f(%rip),%ymm2        # 7aec <_sk_callback_avx+0x238>
   DB  196,65,12,87,246                    ; vxorps        %ymm14,%ymm14,%ymm14
   DB  196,227,13,74,210,208               ; vblendvps     %ymm13,%ymm2,%ymm14,%ymm2
   DB  197,188,194,192,0                   ; vcmpeqps      %ymm0,%ymm8,%ymm0
   DB  196,193,108,88,212                  ; vaddps        %ymm12,%ymm2,%ymm2
   DB  196,227,117,74,194,0                ; vblendvps     %ymm0,%ymm2,%ymm1,%ymm0
   DB  196,193,60,88,201                   ; vaddps        %ymm9,%ymm8,%ymm1
-  DB  196,98,125,24,37,236,95,0,0         ; vbroadcastss  0x5fec(%rip),%ymm12        # 7ac0 <_sk_callback_avx+0x240>
+  DB  196,98,125,24,37,246,95,0,0         ; vbroadcastss  0x5ff6(%rip),%ymm12        # 7afc <_sk_callback_avx+0x248>
   DB  196,193,116,89,212                  ; vmulps        %ymm12,%ymm1,%ymm2
   DB  197,28,194,226,1                    ; vcmpltps      %ymm2,%ymm12,%ymm12
   DB  196,65,36,92,216                    ; vsubps        %ymm8,%ymm11,%ymm11
@@ -7941,7 +7981,7 @@
   DB  197,172,94,201                      ; vdivps        %ymm1,%ymm10,%ymm1
   DB  196,195,125,74,198,128              ; vblendvps     %ymm8,%ymm14,%ymm0,%ymm0
   DB  196,195,117,74,206,128              ; vblendvps     %ymm8,%ymm14,%ymm1,%ymm1
-  DB  196,98,125,24,5,175,95,0,0          ; vbroadcastss  0x5faf(%rip),%ymm8        # 7abc <_sk_callback_avx+0x23c>
+  DB  196,98,125,24,5,185,95,0,0          ; vbroadcastss  0x5fb9(%rip),%ymm8        # 7af8 <_sk_callback_avx+0x244>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -7956,7 +7996,7 @@
   DB  197,252,17,28,36                    ; vmovups       %ymm3,(%rsp)
   DB  197,252,40,225                      ; vmovaps       %ymm1,%ymm4
   DB  197,252,40,216                      ; vmovaps       %ymm0,%ymm3
-  DB  196,98,125,24,5,118,95,0,0          ; vbroadcastss  0x5f76(%rip),%ymm8        # 7ac4 <_sk_callback_avx+0x244>
+  DB  196,98,125,24,5,128,95,0,0          ; vbroadcastss  0x5f80(%rip),%ymm8        # 7b00 <_sk_callback_avx+0x24c>
   DB  197,60,194,202,2                    ; vcmpleps      %ymm2,%ymm8,%ymm9
   DB  197,92,89,210                       ; vmulps        %ymm2,%ymm4,%ymm10
   DB  196,65,92,92,218                    ; vsubps        %ymm10,%ymm4,%ymm11
@@ -7964,23 +8004,23 @@
   DB  197,52,88,210                       ; vaddps        %ymm2,%ymm9,%ymm10
   DB  197,108,88,202                      ; vaddps        %ymm2,%ymm2,%ymm9
   DB  196,65,52,92,202                    ; vsubps        %ymm10,%ymm9,%ymm9
-  DB  196,98,125,24,29,80,95,0,0          ; vbroadcastss  0x5f50(%rip),%ymm11        # 7ac8 <_sk_callback_avx+0x248>
+  DB  196,98,125,24,29,90,95,0,0          ; vbroadcastss  0x5f5a(%rip),%ymm11        # 7b04 <_sk_callback_avx+0x250>
   DB  196,65,100,88,219                   ; vaddps        %ymm11,%ymm3,%ymm11
   DB  196,67,125,8,227,1                  ; vroundps      $0x1,%ymm11,%ymm12
   DB  196,65,36,92,252                    ; vsubps        %ymm12,%ymm11,%ymm15
   DB  196,65,44,92,217                    ; vsubps        %ymm9,%ymm10,%ymm11
-  DB  196,98,125,24,37,58,95,0,0          ; vbroadcastss  0x5f3a(%rip),%ymm12        # 7ad0 <_sk_callback_avx+0x250>
+  DB  196,98,125,24,37,68,95,0,0          ; vbroadcastss  0x5f44(%rip),%ymm12        # 7b0c <_sk_callback_avx+0x258>
   DB  196,193,4,89,196                    ; vmulps        %ymm12,%ymm15,%ymm0
-  DB  196,98,125,24,45,48,95,0,0          ; vbroadcastss  0x5f30(%rip),%ymm13        # 7ad4 <_sk_callback_avx+0x254>
+  DB  196,98,125,24,45,58,95,0,0          ; vbroadcastss  0x5f3a(%rip),%ymm13        # 7b10 <_sk_callback_avx+0x25c>
   DB  197,20,92,240                       ; vsubps        %ymm0,%ymm13,%ymm14
   DB  196,65,36,89,246                    ; vmulps        %ymm14,%ymm11,%ymm14
   DB  196,65,52,88,246                    ; vaddps        %ymm14,%ymm9,%ymm14
-  DB  196,226,125,24,13,17,95,0,0         ; vbroadcastss  0x5f11(%rip),%ymm1        # 7acc <_sk_callback_avx+0x24c>
+  DB  196,226,125,24,13,27,95,0,0         ; vbroadcastss  0x5f1b(%rip),%ymm1        # 7b08 <_sk_callback_avx+0x254>
   DB  196,193,116,194,255,2               ; vcmpleps      %ymm15,%ymm1,%ymm7
   DB  196,195,13,74,249,112               ; vblendvps     %ymm7,%ymm9,%ymm14,%ymm7
   DB  196,65,60,194,247,2                 ; vcmpleps      %ymm15,%ymm8,%ymm14
   DB  196,227,45,74,255,224               ; vblendvps     %ymm14,%ymm7,%ymm10,%ymm7
-  DB  196,98,125,24,53,252,94,0,0         ; vbroadcastss  0x5efc(%rip),%ymm14        # 7ad8 <_sk_callback_avx+0x258>
+  DB  196,98,125,24,53,6,95,0,0           ; vbroadcastss  0x5f06(%rip),%ymm14        # 7b14 <_sk_callback_avx+0x260>
   DB  196,65,12,194,255,2                 ; vcmpleps      %ymm15,%ymm14,%ymm15
   DB  196,193,124,89,195                  ; vmulps        %ymm11,%ymm0,%ymm0
   DB  197,180,88,192                      ; vaddps        %ymm0,%ymm9,%ymm0
@@ -7999,7 +8039,7 @@
   DB  197,164,89,247                      ; vmulps        %ymm7,%ymm11,%ymm6
   DB  197,180,88,246                      ; vaddps        %ymm6,%ymm9,%ymm6
   DB  196,227,77,74,237,0                 ; vblendvps     %ymm0,%ymm5,%ymm6,%ymm5
-  DB  196,226,125,24,5,158,94,0,0         ; vbroadcastss  0x5e9e(%rip),%ymm0        # 7adc <_sk_callback_avx+0x25c>
+  DB  196,226,125,24,5,168,94,0,0         ; vbroadcastss  0x5ea8(%rip),%ymm0        # 7b18 <_sk_callback_avx+0x264>
   DB  197,228,88,192                      ; vaddps        %ymm0,%ymm3,%ymm0
   DB  196,227,125,8,216,1                 ; vroundps      $0x1,%ymm0,%ymm3
   DB  197,252,92,195                      ; vsubps        %ymm3,%ymm0,%ymm0
@@ -8045,15 +8085,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,74                              ; jne           1d3b <_sk_scale_u8_avx+0x54>
+  DB  117,74                              ; jne           1d6d <_sk_scale_u8_avx+0x54>
   DB  196,66,121,48,4,19                  ; vpmovzxbw     (%r11,%rdx,1),%xmm8
-  DB  197,57,219,5,177,97,0,0             ; vpand         0x61b1(%rip),%xmm8,%xmm8        # 7eb0 <_sk_callback_avx+0x630>
+  DB  197,57,219,5,191,97,0,0             ; vpand         0x61bf(%rip),%xmm8,%xmm8        # 7ef0 <_sk_callback_avx+0x63c>
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  196,65,57,105,201                   ; vpunpckhwd    %xmm9,%xmm8,%xmm9
   DB  196,66,121,51,192                   ; vpmovzxwd     %xmm8,%xmm8
   DB  196,67,61,24,193,1                  ; vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,190,93,0,0         ; vbroadcastss  0x5dbe(%rip),%ymm9        # 7ae0 <_sk_callback_avx+0x260>
+  DB  196,98,125,24,13,200,93,0,0         ; vbroadcastss  0x5dc8(%rip),%ymm9        # 7b1c <_sk_callback_avx+0x268>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  197,188,89,201                      ; vmulps        %ymm1,%ymm8,%ymm1
@@ -8066,15 +8106,15 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,167                             ; ja            1cf7 <_sk_scale_u8_avx+0x10>
+  DB  119,167                             ; ja            1d29 <_sk_scale_u8_avx+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,121,0,0,0                 ; lea           0x79(%rip),%r10        # 1dd4 <_sk_scale_u8_avx+0xed>
+  DB  76,141,21,123,0,0,0                 ; lea           0x7b(%rip),%r10        # 1e08 <_sk_scale_u8_avx+0xef>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  235,136                             ; jmp           1cf7 <_sk_scale_u8_avx+0x10>
+  DB  235,136                             ; jmp           1d29 <_sk_scale_u8_avx+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,2                    ; vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -8082,7 +8122,7 @@
   DB  197,121,110,200                     ; vmovd         %eax,%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,57,14,193,3                  ; vpblendw      $0x3,%xmm9,%xmm8,%xmm8
-  DB  233,95,255,255,255                  ; jmpq          1cf7 <_sk_scale_u8_avx+0x10>
+  DB  233,95,255,255,255                  ; jmpq          1d29 <_sk_scale_u8_avx+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,6                    ; vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -8093,24 +8133,21 @@
   DB  196,65,121,110,12,19                ; vmovd         (%r11,%rdx,1),%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,49,14,192,240                ; vpblendw      $0xf0,%xmm8,%xmm9,%xmm8
-  DB  233,35,255,255,255                  ; jmpq          1cf7 <_sk_scale_u8_avx+0x10>
-  DB  144                                 ; nop
+  DB  233,35,255,255,255                  ; jmpq          1d29 <_sk_scale_u8_avx+0x10>
+  DB  102,144                             ; xchg          %ax,%ax
+  DB  142,255                             ; mov           %edi,%?
   DB  255                                 ; (bad)
-  DB  255                                 ; (bad)
-  DB  255,171,255,255,255,155             ; ljmp          *-0x64000001(%rbx)
+  DB  255,169,255,255,255,153             ; ljmp          *-0x66000001(%rcx)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  234                                 ; (bad)
+  DB  232,255,255,255,221                 ; callq         ffffffffde001e18 <_sk_callback_avx+0xffffffffddffa564>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255                                 ; (bad)
-  DB  223,255                             ; (bad)
-  DB  255                                 ; (bad)
-  DB  255,212                             ; callq         *%rsp
+  DB  255,210                             ; callq         *%rdx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,196                             ; inc           %esp
+  DB  255,194                             ; inc           %edx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; .byte         0xff
@@ -8139,15 +8176,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,110                             ; jne           1ea7 <_sk_lerp_u8_avx+0x78>
+  DB  117,110                             ; jne           1edb <_sk_lerp_u8_avx+0x78>
   DB  196,66,121,48,4,19                  ; vpmovzxbw     (%r11,%rdx,1),%xmm8
-  DB  197,57,219,5,121,96,0,0             ; vpand         0x6079(%rip),%xmm8,%xmm8        # 7ec0 <_sk_callback_avx+0x640>
+  DB  197,57,219,5,133,96,0,0             ; vpand         0x6085(%rip),%xmm8,%xmm8        # 7f00 <_sk_callback_avx+0x64c>
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  196,65,57,105,201                   ; vpunpckhwd    %xmm9,%xmm8,%xmm9
   DB  196,66,121,51,192                   ; vpmovzxwd     %xmm8,%xmm8
   DB  196,67,61,24,193,1                  ; vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,13,122,92,0,0         ; vbroadcastss  0x5c7a(%rip),%ymm9        # 7ae4 <_sk_callback_avx+0x264>
+  DB  196,98,125,24,13,130,92,0,0         ; vbroadcastss  0x5c82(%rip),%ymm9        # 7b20 <_sk_callback_avx+0x26c>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
@@ -8168,15 +8205,15 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,131                             ; ja            1e3f <_sk_lerp_u8_avx+0x10>
+  DB  119,131                             ; ja            1e73 <_sk_lerp_u8_avx+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,125,0,0,0                 ; lea           0x7d(%rip),%r10        # 1f44 <_sk_lerp_u8_avx+0x115>
+  DB  76,141,21,125,0,0,0                 ; lea           0x7d(%rip),%r10        # 1f78 <_sk_lerp_u8_avx+0x115>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  233,97,255,255,255                  ; jmpq          1e3f <_sk_lerp_u8_avx+0x10>
+  DB  233,97,255,255,255                  ; jmpq          1e73 <_sk_lerp_u8_avx+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,2                    ; vpinsrw       $0x2,%eax,%xmm8,%xmm8
@@ -8184,7 +8221,7 @@
   DB  197,121,110,200                     ; vmovd         %eax,%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,57,14,193,3                  ; vpblendw      $0x3,%xmm9,%xmm8,%xmm8
-  DB  233,56,255,255,255                  ; jmpq          1e3f <_sk_lerp_u8_avx+0x10>
+  DB  233,56,255,255,255                  ; jmpq          1e73 <_sk_lerp_u8_avx+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  197,57,196,192,6                    ; vpinsrw       $0x6,%eax,%xmm8,%xmm8
@@ -8195,7 +8232,7 @@
   DB  196,65,121,110,12,19                ; vmovd         (%r11,%rdx,1),%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
   DB  196,67,49,14,192,240                ; vpblendw      $0xf0,%xmm8,%xmm9,%xmm8
-  DB  233,252,254,255,255                 ; jmpq          1e3f <_sk_lerp_u8_avx+0x10>
+  DB  233,252,254,255,255                 ; jmpq          1e73 <_sk_lerp_u8_avx+0x10>
   DB  144                                 ; nop
   DB  140,255                             ; mov           %?,%edi
   DB  255                                 ; (bad)
@@ -8203,7 +8240,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  233,255,255,255,222                 ; jmpq          ffffffffdf001f54 <_sk_callback_avx+0xffffffffdeffa6d4>
+  DB  233,255,255,255,222                 ; jmpq          ffffffffdf001f88 <_sk_callback_avx+0xffffffffdeffa6d4>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,211                             ; callq         *%rbx
@@ -8219,26 +8256,26 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,208,0,0,0                    ; jne           203e <_sk_lerp_565_avx+0xde>
+  DB  15,133,208,0,0,0                    ; jne           2072 <_sk_lerp_565_avx+0xde>
   DB  196,65,122,111,4,83                 ; vmovdqu       (%r11,%rdx,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  196,65,57,105,201                   ; vpunpckhwd    %xmm9,%xmm8,%xmm9
   DB  196,66,121,51,192                   ; vpmovzxwd     %xmm8,%xmm8
   DB  196,67,61,24,193,1                  ; vinsertf128   $0x1,%xmm9,%ymm8,%ymm8
-  DB  196,98,125,24,13,86,91,0,0          ; vbroadcastss  0x5b56(%rip),%ymm9        # 7ae8 <_sk_callback_avx+0x268>
+  DB  196,98,125,24,13,94,91,0,0          ; vbroadcastss  0x5b5e(%rip),%ymm9        # 7b24 <_sk_callback_avx+0x270>
   DB  196,65,60,84,201                    ; vandps        %ymm9,%ymm8,%ymm9
   DB  196,65,124,91,201                   ; vcvtdq2ps     %ymm9,%ymm9
-  DB  196,98,125,24,21,71,91,0,0          ; vbroadcastss  0x5b47(%rip),%ymm10        # 7aec <_sk_callback_avx+0x26c>
+  DB  196,98,125,24,21,79,91,0,0          ; vbroadcastss  0x5b4f(%rip),%ymm10        # 7b28 <_sk_callback_avx+0x274>
   DB  196,65,52,89,202                    ; vmulps        %ymm10,%ymm9,%ymm9
-  DB  196,98,125,24,21,61,91,0,0          ; vbroadcastss  0x5b3d(%rip),%ymm10        # 7af0 <_sk_callback_avx+0x270>
+  DB  196,98,125,24,21,69,91,0,0          ; vbroadcastss  0x5b45(%rip),%ymm10        # 7b2c <_sk_callback_avx+0x278>
   DB  196,65,60,84,210                    ; vandps        %ymm10,%ymm8,%ymm10
   DB  196,65,124,91,210                   ; vcvtdq2ps     %ymm10,%ymm10
-  DB  196,98,125,24,29,46,91,0,0          ; vbroadcastss  0x5b2e(%rip),%ymm11        # 7af4 <_sk_callback_avx+0x274>
+  DB  196,98,125,24,29,54,91,0,0          ; vbroadcastss  0x5b36(%rip),%ymm11        # 7b30 <_sk_callback_avx+0x27c>
   DB  196,65,44,89,211                    ; vmulps        %ymm11,%ymm10,%ymm10
-  DB  196,98,125,24,29,36,91,0,0          ; vbroadcastss  0x5b24(%rip),%ymm11        # 7af8 <_sk_callback_avx+0x278>
+  DB  196,98,125,24,29,44,91,0,0          ; vbroadcastss  0x5b2c(%rip),%ymm11        # 7b34 <_sk_callback_avx+0x280>
   DB  196,65,60,84,195                    ; vandps        %ymm11,%ymm8,%ymm8
   DB  196,65,124,91,192                   ; vcvtdq2ps     %ymm8,%ymm8
-  DB  196,98,125,24,29,21,91,0,0          ; vbroadcastss  0x5b15(%rip),%ymm11        # 7afc <_sk_callback_avx+0x27c>
+  DB  196,98,125,24,29,29,91,0,0          ; vbroadcastss  0x5b1d(%rip),%ymm11        # 7b38 <_sk_callback_avx+0x284>
   DB  196,65,60,89,195                    ; vmulps        %ymm11,%ymm8,%ymm8
   DB  197,252,92,196                      ; vsubps        %ymm4,%ymm0,%ymm0
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
@@ -8265,27 +8302,27 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,29,255,255,255               ; ja            1f74 <_sk_lerp_565_avx+0x14>
+  DB  15,135,29,255,255,255               ; ja            1fa8 <_sk_lerp_565_avx+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,102,0,0,0                 ; lea           0x66(%rip),%r10        # 20c8 <_sk_lerp_565_avx+0x168>
+  DB  76,141,21,102,0,0,0                 ; lea           0x66(%rip),%r10        # 20fc <_sk_lerp_565_avx+0x168>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  233,251,254,255,255                 ; jmpq          1f74 <_sk_lerp_565_avx+0x14>
+  DB  233,251,254,255,255                 ; jmpq          1fa8 <_sk_lerp_565_avx+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,65,57,196,68,83,4,2             ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,121,110,12,83                ; vmovd         (%r11,%rdx,2),%xmm9
   DB  196,67,57,14,193,3                  ; vpblendw      $0x3,%xmm9,%xmm8,%xmm8
-  DB  233,221,254,255,255                 ; jmpq          1f74 <_sk_lerp_565_avx+0x14>
+  DB  233,221,254,255,255                 ; jmpq          1fa8 <_sk_lerp_565_avx+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,65,57,196,68,83,12,6            ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,57,196,68,83,10,5            ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,57,196,68,83,8,4             ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm8,%xmm8
   DB  196,65,122,126,12,83                ; vmovq         (%r11,%rdx,2),%xmm9
   DB  196,67,49,14,192,240                ; vpblendw      $0xf0,%xmm8,%xmm9,%xmm8
-  DB  233,175,254,255,255                 ; jmpq          1f74 <_sk_lerp_565_avx+0x14>
+  DB  233,175,254,255,255                 ; jmpq          1fa8 <_sk_lerp_565_avx+0x14>
   DB  15,31,0                             ; nopl          (%rax)
   DB  163,255,255,255,190,255,255,255,177 ; movabs        %eax,0xb1ffffffbeffffff
   DB  255                                 ; (bad)
@@ -8315,9 +8352,9 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,251,1,0,0                    ; jne           2302 <_sk_load_tables_avx+0x21e>
+  DB  15,133,251,1,0,0                    ; jne           2336 <_sk_load_tables_avx+0x21e>
   DB  196,65,124,16,18                    ; vmovups       (%r10),%ymm10
-  DB  197,124,40,13,76,95,0,0             ; vmovaps       0x5f4c(%rip),%ymm9        # 8060 <_sk_callback_avx+0x7e0>
+  DB  197,124,40,13,88,95,0,0             ; vmovaps       0x5f58(%rip),%ymm9        # 80a0 <_sk_callback_avx+0x7ec>
   DB  196,193,44,84,201                   ; vandps        %ymm9,%ymm10,%ymm1
   DB  196,227,125,25,200,1                ; vextractf128  $0x1,%ymm1,%xmm0
   DB  196,193,249,126,195                 ; vmovq         %xmm0,%r11
@@ -8409,7 +8446,7 @@
   DB  196,193,65,114,208,24               ; vpsrld        $0x18,%xmm8,%xmm7
   DB  196,227,101,24,223,1                ; vinsertf128   $0x1,%xmm7,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,226,125,24,61,19,88,0,0         ; vbroadcastss  0x5813(%rip),%ymm7        # 7b00 <_sk_callback_avx+0x280>
+  DB  196,226,125,24,61,27,88,0,0         ; vbroadcastss  0x581b(%rip),%ymm7        # 7b3c <_sk_callback_avx+0x288>
   DB  197,228,89,223                      ; vmulps        %ymm7,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,201                          ; mov           %r9,%rcx
@@ -8424,13 +8461,13 @@
   DB  73,211,235                          ; shr           %cl,%r11
   DB  196,193,249,110,195                 ; vmovq         %r11,%xmm0
   DB  196,226,121,48,192                  ; vpmovzxbw     %xmm0,%xmm0
-  DB  196,226,121,0,13,166,91,0,0         ; vpshufb       0x5ba6(%rip),%xmm0,%xmm1        # 7ed0 <_sk_callback_avx+0x650>
+  DB  196,226,121,0,13,178,91,0,0         ; vpshufb       0x5bb2(%rip),%xmm0,%xmm1        # 7f10 <_sk_callback_avx+0x65c>
   DB  196,226,121,33,201                  ; vpmovsxbd     %xmm1,%xmm1
-  DB  196,226,121,0,5,168,91,0,0          ; vpshufb       0x5ba8(%rip),%xmm0,%xmm0        # 7ee0 <_sk_callback_avx+0x660>
+  DB  196,226,121,0,5,180,91,0,0          ; vpshufb       0x5bb4(%rip),%xmm0,%xmm0        # 7f20 <_sk_callback_avx+0x66c>
   DB  196,226,121,33,192                  ; vpmovsxbd     %xmm0,%xmm0
   DB  196,227,117,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   DB  196,66,125,44,18                    ; vmaskmovps    (%r10),%ymm0,%ymm10
-  DB  233,191,253,255,255                 ; jmpq          210c <_sk_load_tables_avx+0x28>
+  DB  233,191,253,255,255                 ; jmpq          2140 <_sk_load_tables_avx+0x28>
 
 PUBLIC _sk_load_tables_u16_be_avx
 _sk_load_tables_u16_be_avx LABEL PROC
@@ -8440,7 +8477,7 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  77,133,192                          ; test          %r8,%r8
   DB  197,252,17,60,36                    ; vmovups       %ymm7,(%rsp)
-  DB  15,133,87,2,0,0                     ; jne           25c3 <_sk_load_tables_u16_be_avx+0x276>
+  DB  15,133,87,2,0,0                     ; jne           25f7 <_sk_load_tables_u16_be_avx+0x276>
   DB  196,1,121,16,4,81                   ; vmovupd       (%r9,%r10,2),%xmm8
   DB  196,129,121,16,84,81,16             ; vmovupd       0x10(%r9,%r10,2),%xmm2
   DB  196,129,121,16,92,81,32             ; vmovupd       0x20(%r9,%r10,2),%xmm3
@@ -8455,7 +8492,7 @@
   DB  197,113,105,219                     ; vpunpckhwd    %xmm3,%xmm1,%xmm11
   DB  197,177,108,200                     ; vpunpcklqdq   %xmm0,%xmm9,%xmm1
   DB  197,49,109,224                      ; vpunpckhqdq   %xmm0,%xmm9,%xmm12
-  DB  197,121,111,21,55,91,0,0            ; vmovdqa       0x5b37(%rip),%xmm10        # 7ef0 <_sk_callback_avx+0x670>
+  DB  197,121,111,21,67,91,0,0            ; vmovdqa       0x5b43(%rip),%xmm10        # 7f30 <_sk_callback_avx+0x67c>
   DB  196,193,113,219,202                 ; vpand         %xmm10,%xmm1,%xmm1
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  196,193,113,105,209                 ; vpunpckhwd    %xmm9,%xmm1,%xmm2
@@ -8553,7 +8590,7 @@
   DB  196,226,121,51,219                  ; vpmovzxwd     %xmm3,%xmm3
   DB  196,227,101,24,223,1                ; vinsertf128   $0x1,%xmm7,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,226,125,24,61,82,85,0,0         ; vbroadcastss  0x5552(%rip),%ymm7        # 7b04 <_sk_callback_avx+0x284>
+  DB  196,226,125,24,61,90,85,0,0         ; vbroadcastss  0x555a(%rip),%ymm7        # 7b40 <_sk_callback_avx+0x28c>
   DB  197,228,89,223                      ; vmulps        %ymm7,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,16,60,36                    ; vmovups       (%rsp),%ymm7
@@ -8562,29 +8599,29 @@
   DB  196,1,123,16,4,81                   ; vmovsd        (%r9,%r10,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,85                              ; je            2629 <_sk_load_tables_u16_be_avx+0x2dc>
+  DB  116,85                              ; je            265d <_sk_load_tables_u16_be_avx+0x2dc>
   DB  196,1,57,22,68,81,8                 ; vmovhpd       0x8(%r9,%r10,2),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,72                              ; jb            2629 <_sk_load_tables_u16_be_avx+0x2dc>
+  DB  114,72                              ; jb            265d <_sk_load_tables_u16_be_avx+0x2dc>
   DB  196,129,123,16,84,81,16             ; vmovsd        0x10(%r9,%r10,2),%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,72                              ; je            2636 <_sk_load_tables_u16_be_avx+0x2e9>
+  DB  116,72                              ; je            266a <_sk_load_tables_u16_be_avx+0x2e9>
   DB  196,129,105,22,84,81,24             ; vmovhpd       0x18(%r9,%r10,2),%xmm2,%xmm2
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,59                              ; jb            2636 <_sk_load_tables_u16_be_avx+0x2e9>
+  DB  114,59                              ; jb            266a <_sk_load_tables_u16_be_avx+0x2e9>
   DB  196,129,123,16,92,81,32             ; vmovsd        0x20(%r9,%r10,2),%xmm3
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,123,253,255,255              ; je            2387 <_sk_load_tables_u16_be_avx+0x3a>
+  DB  15,132,123,253,255,255              ; je            23bb <_sk_load_tables_u16_be_avx+0x3a>
   DB  196,129,97,22,92,81,40              ; vmovhpd       0x28(%r9,%r10,2),%xmm3,%xmm3
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,106,253,255,255              ; jb            2387 <_sk_load_tables_u16_be_avx+0x3a>
+  DB  15,130,106,253,255,255              ; jb            23bb <_sk_load_tables_u16_be_avx+0x3a>
   DB  196,1,122,126,76,81,48              ; vmovq         0x30(%r9,%r10,2),%xmm9
-  DB  233,94,253,255,255                  ; jmpq          2387 <_sk_load_tables_u16_be_avx+0x3a>
+  DB  233,94,253,255,255                  ; jmpq          23bb <_sk_load_tables_u16_be_avx+0x3a>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,81,253,255,255                  ; jmpq          2387 <_sk_load_tables_u16_be_avx+0x3a>
+  DB  233,81,253,255,255                  ; jmpq          23bb <_sk_load_tables_u16_be_avx+0x3a>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,72,253,255,255                  ; jmpq          2387 <_sk_load_tables_u16_be_avx+0x3a>
+  DB  233,72,253,255,255                  ; jmpq          23bb <_sk_load_tables_u16_be_avx+0x3a>
 
 PUBLIC _sk_load_tables_rgb_u16_be_avx
 _sk_load_tables_rgb_u16_be_avx LABEL PROC
@@ -8595,7 +8632,7 @@
   DB  77,133,192                          ; test          %r8,%r8
   DB  197,252,17,124,36,32                ; vmovups       %ymm7,0x20(%rsp)
   DB  197,252,17,52,36                    ; vmovups       %ymm6,(%rsp)
-  DB  15,133,74,2,0,0                     ; jne           28aa <_sk_load_tables_rgb_u16_be_avx+0x26b>
+  DB  15,133,74,2,0,0                     ; jne           28de <_sk_load_tables_rgb_u16_be_avx+0x26b>
   DB  196,129,122,111,4,81                ; vmovdqu       (%r9,%r10,2),%xmm0
   DB  196,129,122,111,84,81,12            ; vmovdqu       0xc(%r9,%r10,2),%xmm2
   DB  196,129,122,111,76,81,24            ; vmovdqu       0x18(%r9,%r10,2),%xmm1
@@ -8616,7 +8653,7 @@
   DB  197,185,108,218                     ; vpunpcklqdq   %xmm2,%xmm8,%xmm3
   DB  197,57,109,218                      ; vpunpckhqdq   %xmm2,%xmm8,%xmm11
   DB  197,121,108,193                     ; vpunpcklqdq   %xmm1,%xmm0,%xmm8
-  DB  197,121,111,13,54,88,0,0            ; vmovdqa       0x5836(%rip),%xmm9        # 7f00 <_sk_callback_avx+0x680>
+  DB  197,121,111,13,66,88,0,0            ; vmovdqa       0x5842(%rip),%xmm9        # 7f40 <_sk_callback_avx+0x68c>
   DB  196,193,97,219,193                  ; vpand         %xmm9,%xmm3,%xmm0
   DB  196,65,41,239,210                   ; vpxor         %xmm10,%xmm10,%xmm10
   DB  196,193,121,105,202                 ; vpunpckhwd    %xmm10,%xmm0,%xmm1
@@ -8706,7 +8743,7 @@
   DB  196,195,105,33,211,48               ; vinsertps     $0x30,%xmm11,%xmm2,%xmm2
   DB  196,227,109,24,211,1                ; vinsertf128   $0x1,%xmm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,111,82,0,0        ; vbroadcastss  0x526f(%rip),%ymm3        # 7b08 <_sk_callback_avx+0x288>
+  DB  196,226,125,24,29,119,82,0,0        ; vbroadcastss  0x5277(%rip),%ymm3        # 7b44 <_sk_callback_avx+0x290>
   DB  197,252,16,52,36                    ; vmovups       (%rsp),%ymm6
   DB  197,252,16,124,36,32                ; vmovups       0x20(%rsp),%ymm7
   DB  72,131,196,88                       ; add           $0x58,%rsp
@@ -8714,41 +8751,41 @@
   DB  196,129,121,110,4,81                ; vmovd         (%r9,%r10,2),%xmm0
   DB  196,129,121,196,68,81,4,2           ; vpinsrw       $0x2,0x4(%r9,%r10,2),%xmm0,%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,5                               ; jne           28c3 <_sk_load_tables_rgb_u16_be_avx+0x284>
-  DB  233,209,253,255,255                 ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  117,5                               ; jne           28f7 <_sk_load_tables_rgb_u16_be_avx+0x284>
+  DB  233,209,253,255,255                 ; jmpq          26c8 <_sk_load_tables_rgb_u16_be_avx+0x55>
   DB  196,129,121,110,76,81,6             ; vmovd         0x6(%r9,%r10,2),%xmm1
   DB  196,1,113,196,68,81,10,2            ; vpinsrw       $0x2,0xa(%r9,%r10,2),%xmm1,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,26                              ; jb            28f2 <_sk_load_tables_rgb_u16_be_avx+0x2b3>
+  DB  114,26                              ; jb            2926 <_sk_load_tables_rgb_u16_be_avx+0x2b3>
   DB  196,129,121,110,76,81,12            ; vmovd         0xc(%r9,%r10,2),%xmm1
   DB  196,129,113,196,84,81,16,2          ; vpinsrw       $0x2,0x10(%r9,%r10,2),%xmm1,%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  117,10                              ; jne           28f7 <_sk_load_tables_rgb_u16_be_avx+0x2b8>
-  DB  233,162,253,255,255                 ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
-  DB  233,157,253,255,255                 ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  117,10                              ; jne           292b <_sk_load_tables_rgb_u16_be_avx+0x2b8>
+  DB  233,162,253,255,255                 ; jmpq          26c8 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  233,157,253,255,255                 ; jmpq          26c8 <_sk_load_tables_rgb_u16_be_avx+0x55>
   DB  196,129,121,110,76,81,18            ; vmovd         0x12(%r9,%r10,2),%xmm1
   DB  196,1,113,196,76,81,22,2            ; vpinsrw       $0x2,0x16(%r9,%r10,2),%xmm1,%xmm9
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,26                              ; jb            2926 <_sk_load_tables_rgb_u16_be_avx+0x2e7>
+  DB  114,26                              ; jb            295a <_sk_load_tables_rgb_u16_be_avx+0x2e7>
   DB  196,129,121,110,76,81,24            ; vmovd         0x18(%r9,%r10,2),%xmm1
   DB  196,129,113,196,76,81,28,2          ; vpinsrw       $0x2,0x1c(%r9,%r10,2),%xmm1,%xmm1
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  117,10                              ; jne           292b <_sk_load_tables_rgb_u16_be_avx+0x2ec>
-  DB  233,110,253,255,255                 ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
-  DB  233,105,253,255,255                 ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  117,10                              ; jne           295f <_sk_load_tables_rgb_u16_be_avx+0x2ec>
+  DB  233,110,253,255,255                 ; jmpq          26c8 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  233,105,253,255,255                 ; jmpq          26c8 <_sk_load_tables_rgb_u16_be_avx+0x55>
   DB  196,129,121,110,92,81,30            ; vmovd         0x1e(%r9,%r10,2),%xmm3
   DB  196,1,97,196,92,81,34,2             ; vpinsrw       $0x2,0x22(%r9,%r10,2),%xmm3,%xmm11
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,20                              ; jb            2954 <_sk_load_tables_rgb_u16_be_avx+0x315>
+  DB  114,20                              ; jb            2988 <_sk_load_tables_rgb_u16_be_avx+0x315>
   DB  196,129,121,110,92,81,36            ; vmovd         0x24(%r9,%r10,2),%xmm3
   DB  196,129,97,196,92,81,40,2           ; vpinsrw       $0x2,0x28(%r9,%r10,2),%xmm3,%xmm3
-  DB  233,64,253,255,255                  ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
-  DB  233,59,253,255,255                  ; jmpq          2694 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  233,64,253,255,255                  ; jmpq          26c8 <_sk_load_tables_rgb_u16_be_avx+0x55>
+  DB  233,59,253,255,255                  ; jmpq          26c8 <_sk_load_tables_rgb_u16_be_avx+0x55>
 
 PUBLIC _sk_byte_tables_avx
 _sk_byte_tables_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,168,81,0,0          ; vbroadcastss  0x51a8(%rip),%ymm8        # 7b0c <_sk_callback_avx+0x28c>
+  DB  196,98,125,24,5,176,81,0,0          ; vbroadcastss  0x51b0(%rip),%ymm8        # 7b48 <_sk_callback_avx+0x294>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  197,125,91,200                      ; vcvtps2dq     %ymm0,%ymm9
   DB  196,65,249,126,201                  ; vmovq         %xmm9,%r9
@@ -8867,7 +8904,7 @@
   DB  196,194,121,49,204                  ; vpmovzxbd     %xmm12,%xmm1
   DB  196,194,121,49,213                  ; vpmovzxbd     %xmm13,%xmm2
   DB  196,227,117,24,202,1                ; vinsertf128   $0x1,%xmm2,%ymm1,%ymm1
-  DB  196,98,125,24,13,82,79,0,0          ; vbroadcastss  0x4f52(%rip),%ymm9        # 7b10 <_sk_callback_avx+0x290>
+  DB  196,98,125,24,13,90,79,0,0          ; vbroadcastss  0x4f5a(%rip),%ymm9        # 7b4c <_sk_callback_avx+0x298>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
   DB  196,193,116,89,201                  ; vmulps        %ymm9,%ymm1,%ymm1
@@ -8981,7 +9018,7 @@
   DB  196,194,121,49,203                  ; vpmovzxbd     %xmm11,%xmm1
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,13,51,77,0,0          ; vbroadcastss  0x4d33(%rip),%ymm9        # 7b14 <_sk_callback_avx+0x294>
+  DB  196,98,125,24,13,59,77,0,0          ; vbroadcastss  0x4d3b(%rip),%ymm9        # 7b50 <_sk_callback_avx+0x29c>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  196,194,121,49,202                  ; vpmovzxbd     %xmm10,%xmm1
   DB  196,194,121,49,212                  ; vpmovzxbd     %xmm12,%xmm2
@@ -9176,36 +9213,36 @@
   DB  196,193,124,88,195                  ; vaddps        %ymm11,%ymm0,%ymm0
   DB  196,98,125,24,16                    ; vbroadcastss  (%rax),%ymm10
   DB  197,124,91,216                      ; vcvtdq2ps     %ymm0,%ymm11
-  DB  196,98,125,24,37,224,73,0,0         ; vbroadcastss  0x49e0(%rip),%ymm12        # 7b18 <_sk_callback_avx+0x298>
+  DB  196,98,125,24,37,232,73,0,0         ; vbroadcastss  0x49e8(%rip),%ymm12        # 7b54 <_sk_callback_avx+0x2a0>
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,214,73,0,0         ; vbroadcastss  0x49d6(%rip),%ymm12        # 7b1c <_sk_callback_avx+0x29c>
+  DB  196,98,125,24,37,222,73,0,0         ; vbroadcastss  0x49de(%rip),%ymm12        # 7b58 <_sk_callback_avx+0x2a4>
   DB  196,193,124,84,196                  ; vandps        %ymm12,%ymm0,%ymm0
-  DB  196,98,125,24,37,204,73,0,0         ; vbroadcastss  0x49cc(%rip),%ymm12        # 7b20 <_sk_callback_avx+0x2a0>
+  DB  196,98,125,24,37,212,73,0,0         ; vbroadcastss  0x49d4(%rip),%ymm12        # 7b5c <_sk_callback_avx+0x2a8>
   DB  196,193,124,86,196                  ; vorps         %ymm12,%ymm0,%ymm0
-  DB  196,98,125,24,37,194,73,0,0         ; vbroadcastss  0x49c2(%rip),%ymm12        # 7b24 <_sk_callback_avx+0x2a4>
+  DB  196,98,125,24,37,202,73,0,0         ; vbroadcastss  0x49ca(%rip),%ymm12        # 7b60 <_sk_callback_avx+0x2ac>
   DB  196,65,36,88,220                    ; vaddps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,184,73,0,0         ; vbroadcastss  0x49b8(%rip),%ymm12        # 7b28 <_sk_callback_avx+0x2a8>
+  DB  196,98,125,24,37,192,73,0,0         ; vbroadcastss  0x49c0(%rip),%ymm12        # 7b64 <_sk_callback_avx+0x2b0>
   DB  196,65,124,89,228                   ; vmulps        %ymm12,%ymm0,%ymm12
   DB  196,65,36,92,220                    ; vsubps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,169,73,0,0         ; vbroadcastss  0x49a9(%rip),%ymm12        # 7b2c <_sk_callback_avx+0x2ac>
+  DB  196,98,125,24,37,177,73,0,0         ; vbroadcastss  0x49b1(%rip),%ymm12        # 7b68 <_sk_callback_avx+0x2b4>
   DB  196,193,124,88,196                  ; vaddps        %ymm12,%ymm0,%ymm0
-  DB  196,98,125,24,37,159,73,0,0         ; vbroadcastss  0x499f(%rip),%ymm12        # 7b30 <_sk_callback_avx+0x2b0>
+  DB  196,98,125,24,37,167,73,0,0         ; vbroadcastss  0x49a7(%rip),%ymm12        # 7b6c <_sk_callback_avx+0x2b8>
   DB  197,156,94,192                      ; vdivps        %ymm0,%ymm12,%ymm0
   DB  197,164,92,192                      ; vsubps        %ymm0,%ymm11,%ymm0
   DB  197,172,89,192                      ; vmulps        %ymm0,%ymm10,%ymm0
   DB  196,99,125,8,208,1                  ; vroundps      $0x1,%ymm0,%ymm10
   DB  196,65,124,92,210                   ; vsubps        %ymm10,%ymm0,%ymm10
-  DB  196,98,125,24,29,131,73,0,0         ; vbroadcastss  0x4983(%rip),%ymm11        # 7b34 <_sk_callback_avx+0x2b4>
+  DB  196,98,125,24,29,139,73,0,0         ; vbroadcastss  0x498b(%rip),%ymm11        # 7b70 <_sk_callback_avx+0x2bc>
   DB  196,193,124,88,195                  ; vaddps        %ymm11,%ymm0,%ymm0
-  DB  196,98,125,24,29,121,73,0,0         ; vbroadcastss  0x4979(%rip),%ymm11        # 7b38 <_sk_callback_avx+0x2b8>
+  DB  196,98,125,24,29,129,73,0,0         ; vbroadcastss  0x4981(%rip),%ymm11        # 7b74 <_sk_callback_avx+0x2c0>
   DB  196,65,44,89,219                    ; vmulps        %ymm11,%ymm10,%ymm11
   DB  196,193,124,92,195                  ; vsubps        %ymm11,%ymm0,%ymm0
-  DB  196,98,125,24,29,106,73,0,0         ; vbroadcastss  0x496a(%rip),%ymm11        # 7b3c <_sk_callback_avx+0x2bc>
+  DB  196,98,125,24,29,114,73,0,0         ; vbroadcastss  0x4972(%rip),%ymm11        # 7b78 <_sk_callback_avx+0x2c4>
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
-  DB  196,98,125,24,29,96,73,0,0          ; vbroadcastss  0x4960(%rip),%ymm11        # 7b40 <_sk_callback_avx+0x2c0>
+  DB  196,98,125,24,29,104,73,0,0         ; vbroadcastss  0x4968(%rip),%ymm11        # 7b7c <_sk_callback_avx+0x2c8>
   DB  196,65,36,94,210                    ; vdivps        %ymm10,%ymm11,%ymm10
   DB  196,193,124,88,194                  ; vaddps        %ymm10,%ymm0,%ymm0
-  DB  196,98,125,24,21,81,73,0,0          ; vbroadcastss  0x4951(%rip),%ymm10        # 7b44 <_sk_callback_avx+0x2c4>
+  DB  196,98,125,24,21,89,73,0,0          ; vbroadcastss  0x4959(%rip),%ymm10        # 7b80 <_sk_callback_avx+0x2cc>
   DB  196,193,124,89,194                  ; vmulps        %ymm10,%ymm0,%ymm0
   DB  197,253,91,192                      ; vcvtps2dq     %ymm0,%ymm0
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -9213,7 +9250,7 @@
   DB  196,195,125,74,193,128              ; vblendvps     %ymm8,%ymm9,%ymm0,%ymm0
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,124,95,192                  ; vmaxps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,40,73,0,0           ; vbroadcastss  0x4928(%rip),%ymm8        # 7b48 <_sk_callback_avx+0x2c8>
+  DB  196,98,125,24,5,48,73,0,0           ; vbroadcastss  0x4930(%rip),%ymm8        # 7b84 <_sk_callback_avx+0x2d0>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -9233,36 +9270,36 @@
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
   DB  196,98,125,24,16                    ; vbroadcastss  (%rax),%ymm10
   DB  197,124,91,217                      ; vcvtdq2ps     %ymm1,%ymm11
-  DB  196,98,125,24,37,217,72,0,0         ; vbroadcastss  0x48d9(%rip),%ymm12        # 7b4c <_sk_callback_avx+0x2cc>
+  DB  196,98,125,24,37,225,72,0,0         ; vbroadcastss  0x48e1(%rip),%ymm12        # 7b88 <_sk_callback_avx+0x2d4>
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,207,72,0,0         ; vbroadcastss  0x48cf(%rip),%ymm12        # 7b50 <_sk_callback_avx+0x2d0>
+  DB  196,98,125,24,37,215,72,0,0         ; vbroadcastss  0x48d7(%rip),%ymm12        # 7b8c <_sk_callback_avx+0x2d8>
   DB  196,193,116,84,204                  ; vandps        %ymm12,%ymm1,%ymm1
-  DB  196,98,125,24,37,197,72,0,0         ; vbroadcastss  0x48c5(%rip),%ymm12        # 7b54 <_sk_callback_avx+0x2d4>
+  DB  196,98,125,24,37,205,72,0,0         ; vbroadcastss  0x48cd(%rip),%ymm12        # 7b90 <_sk_callback_avx+0x2dc>
   DB  196,193,116,86,204                  ; vorps         %ymm12,%ymm1,%ymm1
-  DB  196,98,125,24,37,187,72,0,0         ; vbroadcastss  0x48bb(%rip),%ymm12        # 7b58 <_sk_callback_avx+0x2d8>
+  DB  196,98,125,24,37,195,72,0,0         ; vbroadcastss  0x48c3(%rip),%ymm12        # 7b94 <_sk_callback_avx+0x2e0>
   DB  196,65,36,88,220                    ; vaddps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,177,72,0,0         ; vbroadcastss  0x48b1(%rip),%ymm12        # 7b5c <_sk_callback_avx+0x2dc>
+  DB  196,98,125,24,37,185,72,0,0         ; vbroadcastss  0x48b9(%rip),%ymm12        # 7b98 <_sk_callback_avx+0x2e4>
   DB  196,65,116,89,228                   ; vmulps        %ymm12,%ymm1,%ymm12
   DB  196,65,36,92,220                    ; vsubps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,162,72,0,0         ; vbroadcastss  0x48a2(%rip),%ymm12        # 7b60 <_sk_callback_avx+0x2e0>
+  DB  196,98,125,24,37,170,72,0,0         ; vbroadcastss  0x48aa(%rip),%ymm12        # 7b9c <_sk_callback_avx+0x2e8>
   DB  196,193,116,88,204                  ; vaddps        %ymm12,%ymm1,%ymm1
-  DB  196,98,125,24,37,152,72,0,0         ; vbroadcastss  0x4898(%rip),%ymm12        # 7b64 <_sk_callback_avx+0x2e4>
+  DB  196,98,125,24,37,160,72,0,0         ; vbroadcastss  0x48a0(%rip),%ymm12        # 7ba0 <_sk_callback_avx+0x2ec>
   DB  197,156,94,201                      ; vdivps        %ymm1,%ymm12,%ymm1
   DB  197,164,92,201                      ; vsubps        %ymm1,%ymm11,%ymm1
   DB  197,172,89,201                      ; vmulps        %ymm1,%ymm10,%ymm1
   DB  196,99,125,8,209,1                  ; vroundps      $0x1,%ymm1,%ymm10
   DB  196,65,116,92,210                   ; vsubps        %ymm10,%ymm1,%ymm10
-  DB  196,98,125,24,29,124,72,0,0         ; vbroadcastss  0x487c(%rip),%ymm11        # 7b68 <_sk_callback_avx+0x2e8>
+  DB  196,98,125,24,29,132,72,0,0         ; vbroadcastss  0x4884(%rip),%ymm11        # 7ba4 <_sk_callback_avx+0x2f0>
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,114,72,0,0         ; vbroadcastss  0x4872(%rip),%ymm11        # 7b6c <_sk_callback_avx+0x2ec>
+  DB  196,98,125,24,29,122,72,0,0         ; vbroadcastss  0x487a(%rip),%ymm11        # 7ba8 <_sk_callback_avx+0x2f4>
   DB  196,65,44,89,219                    ; vmulps        %ymm11,%ymm10,%ymm11
   DB  196,193,116,92,203                  ; vsubps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,29,99,72,0,0          ; vbroadcastss  0x4863(%rip),%ymm11        # 7b70 <_sk_callback_avx+0x2f0>
+  DB  196,98,125,24,29,107,72,0,0         ; vbroadcastss  0x486b(%rip),%ymm11        # 7bac <_sk_callback_avx+0x2f8>
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
-  DB  196,98,125,24,29,89,72,0,0          ; vbroadcastss  0x4859(%rip),%ymm11        # 7b74 <_sk_callback_avx+0x2f4>
+  DB  196,98,125,24,29,97,72,0,0          ; vbroadcastss  0x4861(%rip),%ymm11        # 7bb0 <_sk_callback_avx+0x2fc>
   DB  196,65,36,94,210                    ; vdivps        %ymm10,%ymm11,%ymm10
   DB  196,193,116,88,202                  ; vaddps        %ymm10,%ymm1,%ymm1
-  DB  196,98,125,24,21,74,72,0,0          ; vbroadcastss  0x484a(%rip),%ymm10        # 7b78 <_sk_callback_avx+0x2f8>
+  DB  196,98,125,24,21,82,72,0,0          ; vbroadcastss  0x4852(%rip),%ymm10        # 7bb4 <_sk_callback_avx+0x300>
   DB  196,193,116,89,202                  ; vmulps        %ymm10,%ymm1,%ymm1
   DB  197,253,91,201                      ; vcvtps2dq     %ymm1,%ymm1
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -9270,7 +9307,7 @@
   DB  196,195,117,74,201,128              ; vblendvps     %ymm8,%ymm9,%ymm1,%ymm1
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,116,95,200                  ; vmaxps        %ymm8,%ymm1,%ymm1
-  DB  196,98,125,24,5,33,72,0,0           ; vbroadcastss  0x4821(%rip),%ymm8        # 7b7c <_sk_callback_avx+0x2fc>
+  DB  196,98,125,24,5,41,72,0,0           ; vbroadcastss  0x4829(%rip),%ymm8        # 7bb8 <_sk_callback_avx+0x304>
   DB  196,193,116,93,200                  ; vminps        %ymm8,%ymm1,%ymm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -9290,36 +9327,36 @@
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
   DB  196,98,125,24,16                    ; vbroadcastss  (%rax),%ymm10
   DB  197,124,91,218                      ; vcvtdq2ps     %ymm2,%ymm11
-  DB  196,98,125,24,37,210,71,0,0         ; vbroadcastss  0x47d2(%rip),%ymm12        # 7b80 <_sk_callback_avx+0x300>
+  DB  196,98,125,24,37,218,71,0,0         ; vbroadcastss  0x47da(%rip),%ymm12        # 7bbc <_sk_callback_avx+0x308>
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,200,71,0,0         ; vbroadcastss  0x47c8(%rip),%ymm12        # 7b84 <_sk_callback_avx+0x304>
+  DB  196,98,125,24,37,208,71,0,0         ; vbroadcastss  0x47d0(%rip),%ymm12        # 7bc0 <_sk_callback_avx+0x30c>
   DB  196,193,108,84,212                  ; vandps        %ymm12,%ymm2,%ymm2
-  DB  196,98,125,24,37,190,71,0,0         ; vbroadcastss  0x47be(%rip),%ymm12        # 7b88 <_sk_callback_avx+0x308>
+  DB  196,98,125,24,37,198,71,0,0         ; vbroadcastss  0x47c6(%rip),%ymm12        # 7bc4 <_sk_callback_avx+0x310>
   DB  196,193,108,86,212                  ; vorps         %ymm12,%ymm2,%ymm2
-  DB  196,98,125,24,37,180,71,0,0         ; vbroadcastss  0x47b4(%rip),%ymm12        # 7b8c <_sk_callback_avx+0x30c>
+  DB  196,98,125,24,37,188,71,0,0         ; vbroadcastss  0x47bc(%rip),%ymm12        # 7bc8 <_sk_callback_avx+0x314>
   DB  196,65,36,88,220                    ; vaddps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,170,71,0,0         ; vbroadcastss  0x47aa(%rip),%ymm12        # 7b90 <_sk_callback_avx+0x310>
+  DB  196,98,125,24,37,178,71,0,0         ; vbroadcastss  0x47b2(%rip),%ymm12        # 7bcc <_sk_callback_avx+0x318>
   DB  196,65,108,89,228                   ; vmulps        %ymm12,%ymm2,%ymm12
   DB  196,65,36,92,220                    ; vsubps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,155,71,0,0         ; vbroadcastss  0x479b(%rip),%ymm12        # 7b94 <_sk_callback_avx+0x314>
+  DB  196,98,125,24,37,163,71,0,0         ; vbroadcastss  0x47a3(%rip),%ymm12        # 7bd0 <_sk_callback_avx+0x31c>
   DB  196,193,108,88,212                  ; vaddps        %ymm12,%ymm2,%ymm2
-  DB  196,98,125,24,37,145,71,0,0         ; vbroadcastss  0x4791(%rip),%ymm12        # 7b98 <_sk_callback_avx+0x318>
+  DB  196,98,125,24,37,153,71,0,0         ; vbroadcastss  0x4799(%rip),%ymm12        # 7bd4 <_sk_callback_avx+0x320>
   DB  197,156,94,210                      ; vdivps        %ymm2,%ymm12,%ymm2
   DB  197,164,92,210                      ; vsubps        %ymm2,%ymm11,%ymm2
   DB  197,172,89,210                      ; vmulps        %ymm2,%ymm10,%ymm2
   DB  196,99,125,8,210,1                  ; vroundps      $0x1,%ymm2,%ymm10
   DB  196,65,108,92,210                   ; vsubps        %ymm10,%ymm2,%ymm10
-  DB  196,98,125,24,29,117,71,0,0         ; vbroadcastss  0x4775(%rip),%ymm11        # 7b9c <_sk_callback_avx+0x31c>
+  DB  196,98,125,24,29,125,71,0,0         ; vbroadcastss  0x477d(%rip),%ymm11        # 7bd8 <_sk_callback_avx+0x324>
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
-  DB  196,98,125,24,29,107,71,0,0         ; vbroadcastss  0x476b(%rip),%ymm11        # 7ba0 <_sk_callback_avx+0x320>
+  DB  196,98,125,24,29,115,71,0,0         ; vbroadcastss  0x4773(%rip),%ymm11        # 7bdc <_sk_callback_avx+0x328>
   DB  196,65,44,89,219                    ; vmulps        %ymm11,%ymm10,%ymm11
   DB  196,193,108,92,211                  ; vsubps        %ymm11,%ymm2,%ymm2
-  DB  196,98,125,24,29,92,71,0,0          ; vbroadcastss  0x475c(%rip),%ymm11        # 7ba4 <_sk_callback_avx+0x324>
+  DB  196,98,125,24,29,100,71,0,0         ; vbroadcastss  0x4764(%rip),%ymm11        # 7be0 <_sk_callback_avx+0x32c>
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
-  DB  196,98,125,24,29,82,71,0,0          ; vbroadcastss  0x4752(%rip),%ymm11        # 7ba8 <_sk_callback_avx+0x328>
+  DB  196,98,125,24,29,90,71,0,0          ; vbroadcastss  0x475a(%rip),%ymm11        # 7be4 <_sk_callback_avx+0x330>
   DB  196,65,36,94,210                    ; vdivps        %ymm10,%ymm11,%ymm10
   DB  196,193,108,88,210                  ; vaddps        %ymm10,%ymm2,%ymm2
-  DB  196,98,125,24,21,67,71,0,0          ; vbroadcastss  0x4743(%rip),%ymm10        # 7bac <_sk_callback_avx+0x32c>
+  DB  196,98,125,24,21,75,71,0,0          ; vbroadcastss  0x474b(%rip),%ymm10        # 7be8 <_sk_callback_avx+0x334>
   DB  196,193,108,89,210                  ; vmulps        %ymm10,%ymm2,%ymm2
   DB  197,253,91,210                      ; vcvtps2dq     %ymm2,%ymm2
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -9327,7 +9364,7 @@
   DB  196,195,109,74,209,128              ; vblendvps     %ymm8,%ymm9,%ymm2,%ymm2
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,108,95,208                  ; vmaxps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,26,71,0,0           ; vbroadcastss  0x471a(%rip),%ymm8        # 7bb0 <_sk_callback_avx+0x330>
+  DB  196,98,125,24,5,34,71,0,0           ; vbroadcastss  0x4722(%rip),%ymm8        # 7bec <_sk_callback_avx+0x338>
   DB  196,193,108,93,208                  ; vminps        %ymm8,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -9347,36 +9384,36 @@
   DB  196,193,100,88,219                  ; vaddps        %ymm11,%ymm3,%ymm3
   DB  196,98,125,24,16                    ; vbroadcastss  (%rax),%ymm10
   DB  197,124,91,219                      ; vcvtdq2ps     %ymm3,%ymm11
-  DB  196,98,125,24,37,203,70,0,0         ; vbroadcastss  0x46cb(%rip),%ymm12        # 7bb4 <_sk_callback_avx+0x334>
+  DB  196,98,125,24,37,211,70,0,0         ; vbroadcastss  0x46d3(%rip),%ymm12        # 7bf0 <_sk_callback_avx+0x33c>
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,193,70,0,0         ; vbroadcastss  0x46c1(%rip),%ymm12        # 7bb8 <_sk_callback_avx+0x338>
+  DB  196,98,125,24,37,201,70,0,0         ; vbroadcastss  0x46c9(%rip),%ymm12        # 7bf4 <_sk_callback_avx+0x340>
   DB  196,193,100,84,220                  ; vandps        %ymm12,%ymm3,%ymm3
-  DB  196,98,125,24,37,183,70,0,0         ; vbroadcastss  0x46b7(%rip),%ymm12        # 7bbc <_sk_callback_avx+0x33c>
+  DB  196,98,125,24,37,191,70,0,0         ; vbroadcastss  0x46bf(%rip),%ymm12        # 7bf8 <_sk_callback_avx+0x344>
   DB  196,193,100,86,220                  ; vorps         %ymm12,%ymm3,%ymm3
-  DB  196,98,125,24,37,173,70,0,0         ; vbroadcastss  0x46ad(%rip),%ymm12        # 7bc0 <_sk_callback_avx+0x340>
+  DB  196,98,125,24,37,181,70,0,0         ; vbroadcastss  0x46b5(%rip),%ymm12        # 7bfc <_sk_callback_avx+0x348>
   DB  196,65,36,88,220                    ; vaddps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,163,70,0,0         ; vbroadcastss  0x46a3(%rip),%ymm12        # 7bc4 <_sk_callback_avx+0x344>
+  DB  196,98,125,24,37,171,70,0,0         ; vbroadcastss  0x46ab(%rip),%ymm12        # 7c00 <_sk_callback_avx+0x34c>
   DB  196,65,100,89,228                   ; vmulps        %ymm12,%ymm3,%ymm12
   DB  196,65,36,92,220                    ; vsubps        %ymm12,%ymm11,%ymm11
-  DB  196,98,125,24,37,148,70,0,0         ; vbroadcastss  0x4694(%rip),%ymm12        # 7bc8 <_sk_callback_avx+0x348>
+  DB  196,98,125,24,37,156,70,0,0         ; vbroadcastss  0x469c(%rip),%ymm12        # 7c04 <_sk_callback_avx+0x350>
   DB  196,193,100,88,220                  ; vaddps        %ymm12,%ymm3,%ymm3
-  DB  196,98,125,24,37,138,70,0,0         ; vbroadcastss  0x468a(%rip),%ymm12        # 7bcc <_sk_callback_avx+0x34c>
+  DB  196,98,125,24,37,146,70,0,0         ; vbroadcastss  0x4692(%rip),%ymm12        # 7c08 <_sk_callback_avx+0x354>
   DB  197,156,94,219                      ; vdivps        %ymm3,%ymm12,%ymm3
   DB  197,164,92,219                      ; vsubps        %ymm3,%ymm11,%ymm3
   DB  197,172,89,219                      ; vmulps        %ymm3,%ymm10,%ymm3
   DB  196,99,125,8,211,1                  ; vroundps      $0x1,%ymm3,%ymm10
   DB  196,65,100,92,210                   ; vsubps        %ymm10,%ymm3,%ymm10
-  DB  196,98,125,24,29,110,70,0,0         ; vbroadcastss  0x466e(%rip),%ymm11        # 7bd0 <_sk_callback_avx+0x350>
+  DB  196,98,125,24,29,118,70,0,0         ; vbroadcastss  0x4676(%rip),%ymm11        # 7c0c <_sk_callback_avx+0x358>
   DB  196,193,100,88,219                  ; vaddps        %ymm11,%ymm3,%ymm3
-  DB  196,98,125,24,29,100,70,0,0         ; vbroadcastss  0x4664(%rip),%ymm11        # 7bd4 <_sk_callback_avx+0x354>
+  DB  196,98,125,24,29,108,70,0,0         ; vbroadcastss  0x466c(%rip),%ymm11        # 7c10 <_sk_callback_avx+0x35c>
   DB  196,65,44,89,219                    ; vmulps        %ymm11,%ymm10,%ymm11
   DB  196,193,100,92,219                  ; vsubps        %ymm11,%ymm3,%ymm3
-  DB  196,98,125,24,29,85,70,0,0          ; vbroadcastss  0x4655(%rip),%ymm11        # 7bd8 <_sk_callback_avx+0x358>
+  DB  196,98,125,24,29,93,70,0,0          ; vbroadcastss  0x465d(%rip),%ymm11        # 7c14 <_sk_callback_avx+0x360>
   DB  196,65,36,92,210                    ; vsubps        %ymm10,%ymm11,%ymm10
-  DB  196,98,125,24,29,75,70,0,0          ; vbroadcastss  0x464b(%rip),%ymm11        # 7bdc <_sk_callback_avx+0x35c>
+  DB  196,98,125,24,29,83,70,0,0          ; vbroadcastss  0x4653(%rip),%ymm11        # 7c18 <_sk_callback_avx+0x364>
   DB  196,65,36,94,210                    ; vdivps        %ymm10,%ymm11,%ymm10
   DB  196,193,100,88,218                  ; vaddps        %ymm10,%ymm3,%ymm3
-  DB  196,98,125,24,21,60,70,0,0          ; vbroadcastss  0x463c(%rip),%ymm10        # 7be0 <_sk_callback_avx+0x360>
+  DB  196,98,125,24,21,68,70,0,0          ; vbroadcastss  0x4644(%rip),%ymm10        # 7c1c <_sk_callback_avx+0x368>
   DB  196,193,100,89,218                  ; vmulps        %ymm10,%ymm3,%ymm3
   DB  197,253,91,219                      ; vcvtps2dq     %ymm3,%ymm3
   DB  196,98,125,24,80,20                 ; vbroadcastss  0x14(%rax),%ymm10
@@ -9384,38 +9421,38 @@
   DB  196,195,101,74,217,128              ; vblendvps     %ymm8,%ymm9,%ymm3,%ymm3
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  196,193,100,95,216                  ; vmaxps        %ymm8,%ymm3,%ymm3
-  DB  196,98,125,24,5,19,70,0,0           ; vbroadcastss  0x4613(%rip),%ymm8        # 7be4 <_sk_callback_avx+0x364>
+  DB  196,98,125,24,5,27,70,0,0           ; vbroadcastss  0x461b(%rip),%ymm8        # 7c20 <_sk_callback_avx+0x36c>
   DB  196,193,100,93,216                  ; vminps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_lab_to_xyz_avx
 _sk_lab_to_xyz_avx LABEL PROC
-  DB  196,98,125,24,5,5,70,0,0            ; vbroadcastss  0x4605(%rip),%ymm8        # 7be8 <_sk_callback_avx+0x368>
+  DB  196,98,125,24,5,13,70,0,0           ; vbroadcastss  0x460d(%rip),%ymm8        # 7c24 <_sk_callback_avx+0x370>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,251,69,0,0          ; vbroadcastss  0x45fb(%rip),%ymm8        # 7bec <_sk_callback_avx+0x36c>
+  DB  196,98,125,24,5,3,70,0,0            ; vbroadcastss  0x4603(%rip),%ymm8        # 7c28 <_sk_callback_avx+0x374>
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
-  DB  196,98,125,24,13,241,69,0,0         ; vbroadcastss  0x45f1(%rip),%ymm9        # 7bf0 <_sk_callback_avx+0x370>
+  DB  196,98,125,24,13,249,69,0,0         ; vbroadcastss  0x45f9(%rip),%ymm9        # 7c2c <_sk_callback_avx+0x378>
   DB  196,193,116,88,201                  ; vaddps        %ymm9,%ymm1,%ymm1
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  196,193,108,88,209                  ; vaddps        %ymm9,%ymm2,%ymm2
-  DB  196,98,125,24,5,221,69,0,0          ; vbroadcastss  0x45dd(%rip),%ymm8        # 7bf4 <_sk_callback_avx+0x374>
+  DB  196,98,125,24,5,229,69,0,0          ; vbroadcastss  0x45e5(%rip),%ymm8        # 7c30 <_sk_callback_avx+0x37c>
   DB  196,193,124,88,192                  ; vaddps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,211,69,0,0          ; vbroadcastss  0x45d3(%rip),%ymm8        # 7bf8 <_sk_callback_avx+0x378>
+  DB  196,98,125,24,5,219,69,0,0          ; vbroadcastss  0x45db(%rip),%ymm8        # 7c34 <_sk_callback_avx+0x380>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,5,201,69,0,0          ; vbroadcastss  0x45c9(%rip),%ymm8        # 7bfc <_sk_callback_avx+0x37c>
+  DB  196,98,125,24,5,209,69,0,0          ; vbroadcastss  0x45d1(%rip),%ymm8        # 7c38 <_sk_callback_avx+0x384>
   DB  196,193,116,89,200                  ; vmulps        %ymm8,%ymm1,%ymm1
   DB  197,252,88,201                      ; vaddps        %ymm1,%ymm0,%ymm1
-  DB  196,98,125,24,5,187,69,0,0          ; vbroadcastss  0x45bb(%rip),%ymm8        # 7c00 <_sk_callback_avx+0x380>
+  DB  196,98,125,24,5,195,69,0,0          ; vbroadcastss  0x45c3(%rip),%ymm8        # 7c3c <_sk_callback_avx+0x388>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  197,252,92,210                      ; vsubps        %ymm2,%ymm0,%ymm2
   DB  197,116,89,193                      ; vmulps        %ymm1,%ymm1,%ymm8
   DB  196,65,116,89,192                   ; vmulps        %ymm8,%ymm1,%ymm8
-  DB  196,98,125,24,13,164,69,0,0         ; vbroadcastss  0x45a4(%rip),%ymm9        # 7c04 <_sk_callback_avx+0x384>
+  DB  196,98,125,24,13,172,69,0,0         ; vbroadcastss  0x45ac(%rip),%ymm9        # 7c40 <_sk_callback_avx+0x38c>
   DB  196,65,52,194,208,1                 ; vcmpltps      %ymm8,%ymm9,%ymm10
-  DB  196,98,125,24,29,153,69,0,0         ; vbroadcastss  0x4599(%rip),%ymm11        # 7c08 <_sk_callback_avx+0x388>
+  DB  196,98,125,24,29,161,69,0,0         ; vbroadcastss  0x45a1(%rip),%ymm11        # 7c44 <_sk_callback_avx+0x390>
   DB  196,193,116,88,203                  ; vaddps        %ymm11,%ymm1,%ymm1
-  DB  196,98,125,24,37,143,69,0,0         ; vbroadcastss  0x458f(%rip),%ymm12        # 7c0c <_sk_callback_avx+0x38c>
+  DB  196,98,125,24,37,151,69,0,0         ; vbroadcastss  0x4597(%rip),%ymm12        # 7c48 <_sk_callback_avx+0x394>
   DB  196,193,116,89,204                  ; vmulps        %ymm12,%ymm1,%ymm1
   DB  196,67,117,74,192,160               ; vblendvps     %ymm10,%ymm8,%ymm1,%ymm8
   DB  197,252,89,200                      ; vmulps        %ymm0,%ymm0,%ymm1
@@ -9430,9 +9467,9 @@
   DB  196,193,108,88,211                  ; vaddps        %ymm11,%ymm2,%ymm2
   DB  196,193,108,89,212                  ; vmulps        %ymm12,%ymm2,%ymm2
   DB  196,227,109,74,208,144              ; vblendvps     %ymm9,%ymm0,%ymm2,%ymm2
-  DB  196,226,125,24,5,69,69,0,0          ; vbroadcastss  0x4545(%rip),%ymm0        # 7c10 <_sk_callback_avx+0x390>
+  DB  196,226,125,24,5,77,69,0,0          ; vbroadcastss  0x454d(%rip),%ymm0        # 7c4c <_sk_callback_avx+0x398>
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
-  DB  196,98,125,24,5,60,69,0,0           ; vbroadcastss  0x453c(%rip),%ymm8        # 7c14 <_sk_callback_avx+0x394>
+  DB  196,98,125,24,5,68,69,0,0           ; vbroadcastss  0x4544(%rip),%ymm8        # 7c50 <_sk_callback_avx+0x39c>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -9442,15 +9479,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,66                              ; jne           372d <_sk_load_a8_avx+0x4c>
+  DB  117,66                              ; jne           3761 <_sk_load_a8_avx+0x4c>
   DB  196,194,121,48,4,19                 ; vpmovzxbw     (%r11,%rdx,1),%xmm0
-  DB  197,249,219,5,23,72,0,0             ; vpand         0x4817(%rip),%xmm0,%xmm0        # 7f10 <_sk_callback_avx+0x690>
+  DB  197,249,219,5,35,72,0,0             ; vpand         0x4823(%rip),%xmm0,%xmm0        # 7f50 <_sk_callback_avx+0x69c>
   DB  197,241,239,201                     ; vpxor         %xmm1,%xmm1,%xmm1
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,255,68,0,0        ; vbroadcastss  0x44ff(%rip),%ymm1        # 7c18 <_sk_callback_avx+0x398>
+  DB  196,226,125,24,13,7,69,0,0          ; vbroadcastss  0x4507(%rip),%ymm1        # 7c54 <_sk_callback_avx+0x3a0>
   DB  197,252,89,217                      ; vmulps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -9462,15 +9499,15 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,176                             ; ja            36f1 <_sk_load_a8_avx+0x10>
+  DB  119,176                             ; ja            3725 <_sk_load_a8_avx+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,120,0,0,0                 ; lea           0x78(%rip),%r10        # 37c4 <_sk_load_a8_avx+0xe3>
+  DB  76,141,21,120,0,0,0                 ; lea           0x78(%rip),%r10        # 37f8 <_sk_load_a8_avx+0xe3>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  235,145                             ; jmp           36f1 <_sk_load_a8_avx+0x10>
+  DB  235,145                             ; jmp           3725 <_sk_load_a8_avx+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,2                   ; vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -9478,7 +9515,7 @@
   DB  197,249,110,200                     ; vmovd         %eax,%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,121,14,193,3                ; vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  DB  233,105,255,255,255                 ; jmpq          36f1 <_sk_load_a8_avx+0x10>
+  DB  233,105,255,255,255                 ; jmpq          3725 <_sk_load_a8_avx+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,6                   ; vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -9489,7 +9526,7 @@
   DB  196,193,121,110,12,19               ; vmovd         (%r11,%rdx,1),%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,113,14,192,240              ; vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  DB  233,46,255,255,255                  ; jmpq          36f1 <_sk_load_a8_avx+0x10>
+  DB  233,46,255,255,255                  ; jmpq          3725 <_sk_load_a8_avx+0x10>
   DB  144                                 ; nop
   DB  145                                 ; xchg          %eax,%ecx
   DB  255                                 ; (bad)
@@ -9498,7 +9535,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  233,255,255,255,222                 ; jmpq          ffffffffdf0037d4 <_sk_callback_avx+0xffffffffdeffbf54>
+  DB  233,255,255,255,222                 ; jmpq          ffffffffdf003808 <_sk_callback_avx+0xffffffffdeffbf54>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,211                             ; callq         *%rbx
@@ -9514,15 +9551,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,66                              ; jne           382c <_sk_load_a8_dst_avx+0x4c>
+  DB  117,66                              ; jne           3860 <_sk_load_a8_dst_avx+0x4c>
   DB  196,194,121,48,36,19                ; vpmovzxbw     (%r11,%rdx,1),%xmm4
-  DB  197,217,219,37,40,71,0,0            ; vpand         0x4728(%rip),%xmm4,%xmm4        # 7f20 <_sk_callback_avx+0x6a0>
+  DB  197,217,219,37,52,71,0,0            ; vpand         0x4734(%rip),%xmm4,%xmm4        # 7f60 <_sk_callback_avx+0x6ac>
   DB  197,209,239,237                     ; vpxor         %xmm5,%xmm5,%xmm5
   DB  197,217,105,237                     ; vpunpckhwd    %xmm5,%xmm4,%xmm5
   DB  196,226,121,51,228                  ; vpmovzxwd     %xmm4,%xmm4
   DB  196,227,93,24,229,1                 ; vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,4,68,0,0          ; vbroadcastss  0x4404(%rip),%ymm5        # 7c1c <_sk_callback_avx+0x39c>
+  DB  196,226,125,24,45,12,68,0,0         ; vbroadcastss  0x440c(%rip),%ymm5        # 7c58 <_sk_callback_avx+0x3a4>
   DB  197,220,89,253                      ; vmulps        %ymm5,%ymm4,%ymm7
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,220,87,228                      ; vxorps        %ymm4,%ymm4,%ymm4
@@ -9534,15 +9571,15 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,176                             ; ja            37f0 <_sk_load_a8_dst_avx+0x10>
+  DB  119,176                             ; ja            3824 <_sk_load_a8_dst_avx+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,121,0,0,0                 ; lea           0x79(%rip),%r10        # 38c4 <_sk_load_a8_dst_avx+0xe4>
+  DB  76,141,21,121,0,0,0                 ; lea           0x79(%rip),%r10        # 38f8 <_sk_load_a8_dst_avx+0xe4>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  235,145                             ; jmp           37f0 <_sk_load_a8_dst_avx+0x10>
+  DB  235,145                             ; jmp           3824 <_sk_load_a8_dst_avx+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,2                   ; vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -9550,7 +9587,7 @@
   DB  197,249,110,232                     ; vmovd         %eax,%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,89,14,229,3                 ; vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  DB  233,105,255,255,255                 ; jmpq          37f0 <_sk_load_a8_dst_avx+0x10>
+  DB  233,105,255,255,255                 ; jmpq          3824 <_sk_load_a8_dst_avx+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,6                   ; vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -9561,7 +9598,7 @@
   DB  196,193,121,110,44,19               ; vmovd         (%r11,%rdx,1),%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,81,14,228,240               ; vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  DB  233,46,255,255,255                  ; jmpq          37f0 <_sk_load_a8_dst_avx+0x10>
+  DB  233,46,255,255,255                  ; jmpq          3824 <_sk_load_a8_dst_avx+0x10>
   DB  102,144                             ; xchg          %ax,%ax
   DB  144                                 ; nop
   DB  255                                 ; (bad)
@@ -9570,7 +9607,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  232,255,255,255,221                 ; callq         ffffffffde0038d4 <_sk_callback_avx+0xffffffffddffc054>
+  DB  232,255,255,255,221                 ; callq         ffffffffde003908 <_sk_callback_avx+0xffffffffddffc054>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,210                             ; callq         *%rdx
@@ -9623,7 +9660,7 @@
   DB  196,226,121,49,192                  ; vpmovzxbd     %xmm0,%xmm0
   DB  196,227,117,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,116,66,0,0        ; vbroadcastss  0x4274(%rip),%ymm1        # 7c20 <_sk_callback_avx+0x3a0>
+  DB  196,226,125,24,13,124,66,0,0        ; vbroadcastss  0x427c(%rip),%ymm1        # 7c5c <_sk_callback_avx+0x3a8>
   DB  197,252,89,217                      ; vmulps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
@@ -9635,14 +9672,14 @@
 _sk_store_a8_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
-  DB  196,98,125,24,5,86,66,0,0           ; vbroadcastss  0x4256(%rip),%ymm8        # 7c24 <_sk_callback_avx+0x3a4>
+  DB  196,98,125,24,5,94,66,0,0           ; vbroadcastss  0x425e(%rip),%ymm8        # 7c60 <_sk_callback_avx+0x3ac>
   DB  196,65,100,89,192                   ; vmulps        %ymm8,%ymm3,%ymm8
   DB  196,65,125,91,192                   ; vcvtps2dq     %ymm8,%ymm8
   DB  196,67,125,25,193,1                 ; vextractf128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  196,65,57,103,192                   ; vpackuswb     %xmm8,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           39f7 <_sk_store_a8_avx+0x37>
+  DB  117,10                              ; jne           3a2b <_sk_store_a8_avx+0x37>
   DB  196,65,123,17,4,19                  ; vmovsd        %xmm8,(%r11,%rdx,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -9650,25 +9687,25 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,236                             ; ja            39f3 <_sk_store_a8_avx+0x33>
+  DB  119,236                             ; ja            3a27 <_sk_store_a8_avx+0x33>
   DB  196,66,121,48,192                   ; vpmovzxbw     %xmm8,%xmm8
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,85,0,0,0                  ; lea           0x55(%rip),%r10        # 3a6c <_sk_store_a8_avx+0xac>
+  DB  76,141,21,85,0,0,0                  ; lea           0x55(%rip),%r10        # 3aa0 <_sk_store_a8_avx+0xac>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,20,4,19,0                ; vpextrb       $0x0,%xmm8,(%r11,%rdx,1)
-  DB  235,202                             ; jmp           39f3 <_sk_store_a8_avx+0x33>
+  DB  235,202                             ; jmp           3a27 <_sk_store_a8_avx+0x33>
   DB  196,67,121,20,68,19,2,4             ; vpextrb       $0x4,%xmm8,0x2(%r11,%rdx,1)
-  DB  196,98,57,0,5,246,68,0,0            ; vpshufb       0x44f6(%rip),%xmm8,%xmm8        # 7f30 <_sk_callback_avx+0x6b0>
+  DB  196,98,57,0,5,2,69,0,0              ; vpshufb       0x4502(%rip),%xmm8,%xmm8        # 7f70 <_sk_callback_avx+0x6bc>
   DB  196,67,121,21,4,19,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,1)
-  DB  235,176                             ; jmp           39f3 <_sk_store_a8_avx+0x33>
+  DB  235,176                             ; jmp           3a27 <_sk_store_a8_avx+0x33>
   DB  196,67,121,20,68,19,6,12            ; vpextrb       $0xc,%xmm8,0x6(%r11,%rdx,1)
   DB  196,67,121,20,68,19,5,10            ; vpextrb       $0xa,%xmm8,0x5(%r11,%rdx,1)
   DB  196,67,121,20,68,19,4,8             ; vpextrb       $0x8,%xmm8,0x4(%r11,%rdx,1)
-  DB  196,98,57,0,5,220,68,0,0            ; vpshufb       0x44dc(%rip),%xmm8,%xmm8        # 7f40 <_sk_callback_avx+0x6c0>
+  DB  196,98,57,0,5,232,68,0,0            ; vpshufb       0x44e8(%rip),%xmm8,%xmm8        # 7f80 <_sk_callback_avx+0x6cc>
   DB  196,65,121,126,4,19                 ; vmovd         %xmm8,(%r11,%rdx,1)
-  DB  235,135                             ; jmp           39f3 <_sk_store_a8_avx+0x33>
+  DB  235,135                             ; jmp           3a27 <_sk_store_a8_avx+0x33>
   DB  180,255                             ; mov           $0xff,%ah
   DB  255                                 ; (bad)
   DB  255,197                             ; inc           %ebp
@@ -9694,18 +9731,18 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,71                              ; jne           3ad9 <_sk_load_g8_avx+0x51>
+  DB  117,71                              ; jne           3b0d <_sk_load_g8_avx+0x51>
   DB  196,194,121,48,4,19                 ; vpmovzxbw     (%r11,%rdx,1),%xmm0
-  DB  197,249,219,5,176,68,0,0            ; vpand         0x44b0(%rip),%xmm0,%xmm0        # 7f50 <_sk_callback_avx+0x6d0>
+  DB  197,249,219,5,188,68,0,0            ; vpand         0x44bc(%rip),%xmm0,%xmm0        # 7f90 <_sk_callback_avx+0x6dc>
   DB  197,241,239,201                     ; vpxor         %xmm1,%xmm1,%xmm1
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,104,65,0,0        ; vbroadcastss  0x4168(%rip),%ymm1        # 7c28 <_sk_callback_avx+0x3a8>
+  DB  196,226,125,24,13,112,65,0,0        ; vbroadcastss  0x4170(%rip),%ymm1        # 7c64 <_sk_callback_avx+0x3b0>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,93,65,0,0         ; vbroadcastss  0x415d(%rip),%ymm3        # 7c2c <_sk_callback_avx+0x3ac>
+  DB  196,226,125,24,29,101,65,0,0        ; vbroadcastss  0x4165(%rip),%ymm3        # 7c68 <_sk_callback_avx+0x3b4>
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
   DB  255,224                             ; jmpq          *%rax
@@ -9714,15 +9751,15 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,171                             ; ja            3a98 <_sk_load_g8_avx+0x10>
+  DB  119,171                             ; ja            3acc <_sk_load_g8_avx+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,120,0,0,0                 ; lea           0x78(%rip),%r10        # 3b70 <_sk_load_g8_avx+0xe8>
+  DB  76,141,21,120,0,0,0                 ; lea           0x78(%rip),%r10        # 3ba4 <_sk_load_g8_avx+0xe8>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  235,140                             ; jmp           3a98 <_sk_load_g8_avx+0x10>
+  DB  235,140                             ; jmp           3acc <_sk_load_g8_avx+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,2                   ; vpinsrw       $0x2,%eax,%xmm0,%xmm0
@@ -9730,7 +9767,7 @@
   DB  197,249,110,200                     ; vmovd         %eax,%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,121,14,193,3                ; vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  DB  233,100,255,255,255                 ; jmpq          3a98 <_sk_load_g8_avx+0x10>
+  DB  233,100,255,255,255                 ; jmpq          3acc <_sk_load_g8_avx+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  197,249,196,192,6                   ; vpinsrw       $0x6,%eax,%xmm0,%xmm0
@@ -9741,7 +9778,7 @@
   DB  196,193,121,110,12,19               ; vmovd         (%r11,%rdx,1),%xmm1
   DB  196,226,121,48,201                  ; vpmovzxbw     %xmm1,%xmm1
   DB  196,227,113,14,192,240              ; vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  DB  233,41,255,255,255                  ; jmpq          3a98 <_sk_load_g8_avx+0x10>
+  DB  233,41,255,255,255                  ; jmpq          3acc <_sk_load_g8_avx+0x10>
   DB  144                                 ; nop
   DB  145                                 ; xchg          %eax,%ecx
   DB  255                                 ; (bad)
@@ -9750,7 +9787,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  233,255,255,255,222                 ; jmpq          ffffffffdf003b80 <_sk_callback_avx+0xffffffffdeffc300>
+  DB  233,255,255,255,222                 ; jmpq          ffffffffdf003bb4 <_sk_callback_avx+0xffffffffdeffc300>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,211                             ; callq         *%rbx
@@ -9766,18 +9803,18 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,71                              ; jne           3bdd <_sk_load_g8_dst_avx+0x51>
+  DB  117,71                              ; jne           3c11 <_sk_load_g8_dst_avx+0x51>
   DB  196,194,121,48,36,19                ; vpmovzxbw     (%r11,%rdx,1),%xmm4
-  DB  197,217,219,37,188,67,0,0           ; vpand         0x43bc(%rip),%xmm4,%xmm4        # 7f60 <_sk_callback_avx+0x6e0>
+  DB  197,217,219,37,200,67,0,0           ; vpand         0x43c8(%rip),%xmm4,%xmm4        # 7fa0 <_sk_callback_avx+0x6ec>
   DB  197,209,239,237                     ; vpxor         %xmm5,%xmm5,%xmm5
   DB  197,217,105,237                     ; vpunpckhwd    %xmm5,%xmm4,%xmm5
   DB  196,226,121,51,228                  ; vpmovzxwd     %xmm4,%xmm4
   DB  196,227,93,24,229,1                 ; vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,108,64,0,0        ; vbroadcastss  0x406c(%rip),%ymm5        # 7c30 <_sk_callback_avx+0x3b0>
+  DB  196,226,125,24,45,116,64,0,0        ; vbroadcastss  0x4074(%rip),%ymm5        # 7c6c <_sk_callback_avx+0x3b8>
   DB  197,220,89,229                      ; vmulps        %ymm5,%ymm4,%ymm4
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,61,97,64,0,0         ; vbroadcastss  0x4061(%rip),%ymm7        # 7c34 <_sk_callback_avx+0x3b4>
+  DB  196,226,125,24,61,105,64,0,0        ; vbroadcastss  0x4069(%rip),%ymm7        # 7c70 <_sk_callback_avx+0x3bc>
   DB  197,252,40,236                      ; vmovaps       %ymm4,%ymm5
   DB  197,252,40,244                      ; vmovaps       %ymm4,%ymm6
   DB  255,224                             ; jmpq          *%rax
@@ -9786,15 +9823,15 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,171                             ; ja            3b9c <_sk_load_g8_dst_avx+0x10>
+  DB  119,171                             ; ja            3bd0 <_sk_load_g8_dst_avx+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,120,0,0,0                 ; lea           0x78(%rip),%r10        # 3c74 <_sk_load_g8_dst_avx+0xe8>
+  DB  76,141,21,120,0,0,0                 ; lea           0x78(%rip),%r10        # 3ca8 <_sk_load_g8_dst_avx+0xe8>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  235,140                             ; jmp           3b9c <_sk_load_g8_dst_avx+0x10>
+  DB  235,140                             ; jmp           3bd0 <_sk_load_g8_dst_avx+0x10>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,2                   ; vpinsrw       $0x2,%eax,%xmm4,%xmm4
@@ -9802,7 +9839,7 @@
   DB  197,249,110,232                     ; vmovd         %eax,%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,89,14,229,3                 ; vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  DB  233,100,255,255,255                 ; jmpq          3b9c <_sk_load_g8_dst_avx+0x10>
+  DB  233,100,255,255,255                 ; jmpq          3bd0 <_sk_load_g8_dst_avx+0x10>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  197,217,196,224,6                   ; vpinsrw       $0x6,%eax,%xmm4,%xmm4
@@ -9813,7 +9850,7 @@
   DB  196,193,121,110,44,19               ; vmovd         (%r11,%rdx,1),%xmm5
   DB  196,226,121,48,237                  ; vpmovzxbw     %xmm5,%xmm5
   DB  196,227,81,14,228,240               ; vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  DB  233,41,255,255,255                  ; jmpq          3b9c <_sk_load_g8_dst_avx+0x10>
+  DB  233,41,255,255,255                  ; jmpq          3bd0 <_sk_load_g8_dst_avx+0x10>
   DB  144                                 ; nop
   DB  145                                 ; xchg          %eax,%ecx
   DB  255                                 ; (bad)
@@ -9822,7 +9859,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  233,255,255,255,222                 ; jmpq          ffffffffdf003c84 <_sk_callback_avx+0xffffffffdeffc404>
+  DB  233,255,255,255,222                 ; jmpq          ffffffffdf003cb8 <_sk_callback_avx+0xffffffffdeffc404>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,211                             ; callq         *%rbx
@@ -9875,10 +9912,10 @@
   DB  196,226,121,49,192                  ; vpmovzxbd     %xmm0,%xmm0
   DB  196,227,117,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,220,62,0,0        ; vbroadcastss  0x3edc(%rip),%ymm1        # 7c38 <_sk_callback_avx+0x3b8>
+  DB  196,226,125,24,13,228,62,0,0        ; vbroadcastss  0x3ee4(%rip),%ymm1        # 7c74 <_sk_callback_avx+0x3c0>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,209,62,0,0        ; vbroadcastss  0x3ed1(%rip),%ymm3        # 7c3c <_sk_callback_avx+0x3bc>
+  DB  196,226,125,24,29,217,62,0,0        ; vbroadcastss  0x3ed9(%rip),%ymm3        # 7c78 <_sk_callback_avx+0x3c4>
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
   DB  197,252,40,208                      ; vmovaps       %ymm0,%ymm2
   DB  255,224                             ; jmpq          *%rax
@@ -9888,9 +9925,9 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,137,193                          ; mov           %rax,%r9
   DB  77,133,201                          ; test          %r9,%r9
-  DB  116,5                               ; je            3d84 <_sk_gather_i8_avx+0xf>
+  DB  116,5                               ; je            3db8 <_sk_gather_i8_avx+0xf>
   DB  76,137,200                          ; mov           %r9,%rax
-  DB  235,2                               ; jmp           3d86 <_sk_gather_i8_avx+0x11>
+  DB  235,2                               ; jmp           3dba <_sk_gather_i8_avx+0x11>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  83                                  ; push          %rbx
   DB  76,139,16                           ; mov           (%rax),%r10
@@ -9948,10 +9985,10 @@
   DB  72,193,235,30                       ; shr           $0x1e,%rbx
   DB  196,195,121,34,28,27,3              ; vpinsrd       $0x3,(%r11,%rbx,1),%xmm0,%xmm3
   DB  196,227,61,24,195,1                 ; vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  DB  197,124,40,21,220,65,0,0            ; vmovaps       0x41dc(%rip),%ymm10        # 8080 <_sk_callback_avx+0x800>
+  DB  197,124,40,21,232,65,0,0            ; vmovaps       0x41e8(%rip),%ymm10        # 80c0 <_sk_callback_avx+0x80c>
   DB  196,193,124,84,194                  ; vandps        %ymm10,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,13,138,61,0,0         ; vbroadcastss  0x3d8a(%rip),%ymm9        # 7c40 <_sk_callback_avx+0x3c0>
+  DB  196,98,125,24,13,146,61,0,0         ; vbroadcastss  0x3d92(%rip),%ymm9        # 7c7c <_sk_callback_avx+0x3c8>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  196,193,113,114,208,8               ; vpsrld        $0x8,%xmm8,%xmm1
   DB  197,233,114,211,8                   ; vpsrld        $0x8,%xmm3,%xmm2
@@ -9979,56 +10016,56 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,128,0,0,0                    ; jne           3fa6 <_sk_load_565_avx+0x8e>
+  DB  15,133,128,0,0,0                    ; jne           3fda <_sk_load_565_avx+0x8e>
   DB  196,193,122,111,4,83                ; vmovdqu       (%r11,%rdx,2),%xmm0
   DB  197,241,239,201                     ; vpxor         %xmm1,%xmm1,%xmm1
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,209,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm2
-  DB  196,226,125,24,5,252,60,0,0         ; vbroadcastss  0x3cfc(%rip),%ymm0        # 7c44 <_sk_callback_avx+0x3c4>
+  DB  196,226,125,24,5,4,61,0,0           ; vbroadcastss  0x3d04(%rip),%ymm0        # 7c80 <_sk_callback_avx+0x3cc>
   DB  197,236,84,192                      ; vandps        %ymm0,%ymm2,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,239,60,0,0        ; vbroadcastss  0x3cef(%rip),%ymm1        # 7c48 <_sk_callback_avx+0x3c8>
+  DB  196,226,125,24,13,247,60,0,0        ; vbroadcastss  0x3cf7(%rip),%ymm1        # 7c84 <_sk_callback_avx+0x3d0>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,230,60,0,0        ; vbroadcastss  0x3ce6(%rip),%ymm1        # 7c4c <_sk_callback_avx+0x3cc>
+  DB  196,226,125,24,13,238,60,0,0        ; vbroadcastss  0x3cee(%rip),%ymm1        # 7c88 <_sk_callback_avx+0x3d4>
   DB  197,236,84,201                      ; vandps        %ymm1,%ymm2,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,29,217,60,0,0        ; vbroadcastss  0x3cd9(%rip),%ymm3        # 7c50 <_sk_callback_avx+0x3d0>
+  DB  196,226,125,24,29,225,60,0,0        ; vbroadcastss  0x3ce1(%rip),%ymm3        # 7c8c <_sk_callback_avx+0x3d8>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
-  DB  196,226,125,24,29,208,60,0,0        ; vbroadcastss  0x3cd0(%rip),%ymm3        # 7c54 <_sk_callback_avx+0x3d4>
+  DB  196,226,125,24,29,216,60,0,0        ; vbroadcastss  0x3cd8(%rip),%ymm3        # 7c90 <_sk_callback_avx+0x3dc>
   DB  197,236,84,211                      ; vandps        %ymm3,%ymm2,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,226,125,24,29,195,60,0,0        ; vbroadcastss  0x3cc3(%rip),%ymm3        # 7c58 <_sk_callback_avx+0x3d8>
+  DB  196,226,125,24,29,203,60,0,0        ; vbroadcastss  0x3ccb(%rip),%ymm3        # 7c94 <_sk_callback_avx+0x3e0>
   DB  197,236,89,211                      ; vmulps        %ymm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,184,60,0,0        ; vbroadcastss  0x3cb8(%rip),%ymm3        # 7c5c <_sk_callback_avx+0x3dc>
+  DB  196,226,125,24,29,192,60,0,0        ; vbroadcastss  0x3cc0(%rip),%ymm3        # 7c98 <_sk_callback_avx+0x3e4>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,110,255,255,255              ; ja            3f2c <_sk_load_565_avx+0x14>
+  DB  15,135,110,255,255,255              ; ja            3f60 <_sk_load_565_avx+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 402c <_sk_load_565_avx+0x114>
+  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 4060 <_sk_load_565_avx+0x114>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  233,76,255,255,255                  ; jmpq          3f2c <_sk_load_565_avx+0x14>
+  DB  233,76,255,255,255                  ; jmpq          3f60 <_sk_load_565_avx+0x14>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,110,12,83               ; vmovd         (%r11,%rdx,2),%xmm1
   DB  196,227,121,14,193,3                ; vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  DB  233,47,255,255,255                  ; jmpq          3f2c <_sk_load_565_avx+0x14>
+  DB  233,47,255,255,255                  ; jmpq          3f60 <_sk_load_565_avx+0x14>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,122,126,12,83               ; vmovq         (%r11,%rdx,2),%xmm1
   DB  196,227,113,14,192,240              ; vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  DB  233,2,255,255,255                   ; jmpq          3f2c <_sk_load_565_avx+0x14>
+  DB  233,2,255,255,255                   ; jmpq          3f60 <_sk_load_565_avx+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  166                                 ; cmpsb         %es:(%rdi),%ds:(%rsi)
   DB  255                                 ; (bad)
@@ -10054,56 +10091,56 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,128,0,0,0                    ; jne           40d6 <_sk_load_565_dst_avx+0x8e>
+  DB  15,133,128,0,0,0                    ; jne           410a <_sk_load_565_dst_avx+0x8e>
   DB  196,193,122,111,36,83               ; vmovdqu       (%r11,%rdx,2),%xmm4
   DB  197,209,239,237                     ; vpxor         %xmm5,%xmm5,%xmm5
   DB  197,217,105,237                     ; vpunpckhwd    %xmm5,%xmm4,%xmm5
   DB  196,226,121,51,228                  ; vpmovzxwd     %xmm4,%xmm4
   DB  196,227,93,24,245,1                 ; vinsertf128   $0x1,%xmm5,%ymm4,%ymm6
-  DB  196,226,125,24,37,232,59,0,0        ; vbroadcastss  0x3be8(%rip),%ymm4        # 7c60 <_sk_callback_avx+0x3e0>
+  DB  196,226,125,24,37,240,59,0,0        ; vbroadcastss  0x3bf0(%rip),%ymm4        # 7c9c <_sk_callback_avx+0x3e8>
   DB  197,204,84,228                      ; vandps        %ymm4,%ymm6,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,219,59,0,0        ; vbroadcastss  0x3bdb(%rip),%ymm5        # 7c64 <_sk_callback_avx+0x3e4>
+  DB  196,226,125,24,45,227,59,0,0        ; vbroadcastss  0x3be3(%rip),%ymm5        # 7ca0 <_sk_callback_avx+0x3ec>
   DB  197,220,89,229                      ; vmulps        %ymm5,%ymm4,%ymm4
-  DB  196,226,125,24,45,210,59,0,0        ; vbroadcastss  0x3bd2(%rip),%ymm5        # 7c68 <_sk_callback_avx+0x3e8>
+  DB  196,226,125,24,45,218,59,0,0        ; vbroadcastss  0x3bda(%rip),%ymm5        # 7ca4 <_sk_callback_avx+0x3f0>
   DB  197,204,84,237                      ; vandps        %ymm5,%ymm6,%ymm5
   DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
-  DB  196,226,125,24,61,197,59,0,0        ; vbroadcastss  0x3bc5(%rip),%ymm7        # 7c6c <_sk_callback_avx+0x3ec>
+  DB  196,226,125,24,61,205,59,0,0        ; vbroadcastss  0x3bcd(%rip),%ymm7        # 7ca8 <_sk_callback_avx+0x3f4>
   DB  197,212,89,239                      ; vmulps        %ymm7,%ymm5,%ymm5
-  DB  196,226,125,24,61,188,59,0,0        ; vbroadcastss  0x3bbc(%rip),%ymm7        # 7c70 <_sk_callback_avx+0x3f0>
+  DB  196,226,125,24,61,196,59,0,0        ; vbroadcastss  0x3bc4(%rip),%ymm7        # 7cac <_sk_callback_avx+0x3f8>
   DB  197,204,84,247                      ; vandps        %ymm7,%ymm6,%ymm6
   DB  197,252,91,246                      ; vcvtdq2ps     %ymm6,%ymm6
-  DB  196,226,125,24,61,175,59,0,0        ; vbroadcastss  0x3baf(%rip),%ymm7        # 7c74 <_sk_callback_avx+0x3f4>
+  DB  196,226,125,24,61,183,59,0,0        ; vbroadcastss  0x3bb7(%rip),%ymm7        # 7cb0 <_sk_callback_avx+0x3fc>
   DB  197,204,89,247                      ; vmulps        %ymm7,%ymm6,%ymm6
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,61,164,59,0,0        ; vbroadcastss  0x3ba4(%rip),%ymm7        # 7c78 <_sk_callback_avx+0x3f8>
+  DB  196,226,125,24,61,172,59,0,0        ; vbroadcastss  0x3bac(%rip),%ymm7        # 7cb4 <_sk_callback_avx+0x400>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,110,255,255,255              ; ja            405c <_sk_load_565_dst_avx+0x14>
+  DB  15,135,110,255,255,255              ; ja            4090 <_sk_load_565_dst_avx+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 415c <_sk_load_565_dst_avx+0x114>
+  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 4190 <_sk_load_565_dst_avx+0x114>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  233,76,255,255,255                  ; jmpq          405c <_sk_load_565_dst_avx+0x14>
+  DB  233,76,255,255,255                  ; jmpq          4090 <_sk_load_565_dst_avx+0x14>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,121,110,44,83               ; vmovd         (%r11,%rdx,2),%xmm5
   DB  196,227,89,14,229,3                 ; vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  DB  233,47,255,255,255                  ; jmpq          405c <_sk_load_565_dst_avx+0x14>
+  DB  233,47,255,255,255                  ; jmpq          4090 <_sk_load_565_dst_avx+0x14>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,122,126,44,83               ; vmovq         (%r11,%rdx,2),%xmm5
   DB  196,227,81,14,228,240               ; vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  DB  233,2,255,255,255                   ; jmpq          405c <_sk_load_565_dst_avx+0x14>
+  DB  233,2,255,255,255                   ; jmpq          4090 <_sk_load_565_dst_avx+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  166                                 ; cmpsb         %es:(%rdi),%ds:(%rsi)
   DB  255                                 ; (bad)
@@ -10170,37 +10207,37 @@
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,209,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm2
-  DB  196,226,125,24,5,50,58,0,0          ; vbroadcastss  0x3a32(%rip),%ymm0        # 7c7c <_sk_callback_avx+0x3fc>
+  DB  196,226,125,24,5,58,58,0,0          ; vbroadcastss  0x3a3a(%rip),%ymm0        # 7cb8 <_sk_callback_avx+0x404>
   DB  197,236,84,192                      ; vandps        %ymm0,%ymm2,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,37,58,0,0         ; vbroadcastss  0x3a25(%rip),%ymm1        # 7c80 <_sk_callback_avx+0x400>
+  DB  196,226,125,24,13,45,58,0,0         ; vbroadcastss  0x3a2d(%rip),%ymm1        # 7cbc <_sk_callback_avx+0x408>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,28,58,0,0         ; vbroadcastss  0x3a1c(%rip),%ymm1        # 7c84 <_sk_callback_avx+0x404>
+  DB  196,226,125,24,13,36,58,0,0         ; vbroadcastss  0x3a24(%rip),%ymm1        # 7cc0 <_sk_callback_avx+0x40c>
   DB  197,236,84,201                      ; vandps        %ymm1,%ymm2,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,29,15,58,0,0         ; vbroadcastss  0x3a0f(%rip),%ymm3        # 7c88 <_sk_callback_avx+0x408>
+  DB  196,226,125,24,29,23,58,0,0         ; vbroadcastss  0x3a17(%rip),%ymm3        # 7cc4 <_sk_callback_avx+0x410>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
-  DB  196,226,125,24,29,6,58,0,0          ; vbroadcastss  0x3a06(%rip),%ymm3        # 7c8c <_sk_callback_avx+0x40c>
+  DB  196,226,125,24,29,14,58,0,0         ; vbroadcastss  0x3a0e(%rip),%ymm3        # 7cc8 <_sk_callback_avx+0x414>
   DB  197,236,84,211                      ; vandps        %ymm3,%ymm2,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,226,125,24,29,249,57,0,0        ; vbroadcastss  0x39f9(%rip),%ymm3        # 7c90 <_sk_callback_avx+0x410>
+  DB  196,226,125,24,29,1,58,0,0          ; vbroadcastss  0x3a01(%rip),%ymm3        # 7ccc <_sk_callback_avx+0x418>
   DB  197,236,89,211                      ; vmulps        %ymm3,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,238,57,0,0        ; vbroadcastss  0x39ee(%rip),%ymm3        # 7c94 <_sk_callback_avx+0x414>
+  DB  196,226,125,24,29,246,57,0,0        ; vbroadcastss  0x39f6(%rip),%ymm3        # 7cd0 <_sk_callback_avx+0x41c>
   DB  255,224                             ; jmpq          *%rax
 
 PUBLIC _sk_store_565_avx
 _sk_store_565_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
-  DB  196,98,125,24,5,226,57,0,0          ; vbroadcastss  0x39e2(%rip),%ymm8        # 7c98 <_sk_callback_avx+0x418>
+  DB  196,98,125,24,5,234,57,0,0          ; vbroadcastss  0x39ea(%rip),%ymm8        # 7cd4 <_sk_callback_avx+0x420>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,193,41,114,241,11               ; vpslld        $0xb,%xmm9,%xmm10
   DB  196,67,125,25,201,1                 ; vextractf128  $0x1,%ymm9,%xmm9
   DB  196,193,49,114,241,11               ; vpslld        $0xb,%xmm9,%xmm9
   DB  196,67,45,24,201,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
-  DB  196,98,125,24,21,187,57,0,0         ; vbroadcastss  0x39bb(%rip),%ymm10        # 7c9c <_sk_callback_avx+0x41c>
+  DB  196,98,125,24,21,195,57,0,0         ; vbroadcastss  0x39c3(%rip),%ymm10        # 7cd8 <_sk_callback_avx+0x424>
   DB  196,65,116,89,210                   ; vmulps        %ymm10,%ymm1,%ymm10
   DB  196,65,125,91,210                   ; vcvtps2dq     %ymm10,%ymm10
   DB  196,193,33,114,242,5                ; vpslld        $0x5,%xmm10,%xmm11
@@ -10214,7 +10251,7 @@
   DB  196,67,125,25,193,1                 ; vextractf128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           4331 <_sk_store_565_avx+0x89>
+  DB  117,10                              ; jne           4365 <_sk_store_565_avx+0x89>
   DB  196,65,122,127,4,83                 ; vmovdqu       %xmm8,(%r11,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -10222,22 +10259,22 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,236                             ; ja            432d <_sk_store_565_avx+0x85>
+  DB  119,236                             ; ja            4361 <_sk_store_565_avx+0x85>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,68,0,0,0                  ; lea           0x44(%rip),%r10        # 4390 <_sk_store_565_avx+0xe8>
+  DB  76,141,21,68,0,0,0                  ; lea           0x44(%rip),%r10        # 43c4 <_sk_store_565_avx+0xe8>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,21,4,83,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  DB  235,207                             ; jmp           432d <_sk_store_565_avx+0x85>
+  DB  235,207                             ; jmp           4361 <_sk_store_565_avx+0x85>
   DB  196,67,121,21,68,83,4,2             ; vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   DB  196,65,121,126,4,83                 ; vmovd         %xmm8,(%r11,%rdx,2)
-  DB  235,191                             ; jmp           432d <_sk_store_565_avx+0x85>
+  DB  235,191                             ; jmp           4361 <_sk_store_565_avx+0x85>
   DB  196,67,121,21,68,83,12,6            ; vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   DB  196,67,121,21,68,83,10,5            ; vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   DB  196,67,121,21,68,83,8,4             ; vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   DB  196,65,121,214,4,83                 ; vmovq         %xmm8,(%r11,%rdx,2)
-  DB  235,159                             ; jmp           432d <_sk_store_565_avx+0x85>
+  DB  235,159                             ; jmp           4361 <_sk_store_565_avx+0x85>
   DB  102,144                             ; xchg          %ax,%ax
   DB  197,255,255                         ; (bad)
   DB  255,214                             ; callq         *%rsi
@@ -10266,31 +10303,31 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,152,0,0,0                    ; jne           4452 <_sk_load_4444_avx+0xa6>
+  DB  15,133,152,0,0,0                    ; jne           4486 <_sk_load_4444_avx+0xa6>
   DB  196,193,122,111,4,83                ; vmovdqu       (%r11,%rdx,2),%xmm0
   DB  197,241,239,201                     ; vpxor         %xmm1,%xmm1,%xmm1
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,217,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm3
-  DB  196,226,125,24,5,196,56,0,0         ; vbroadcastss  0x38c4(%rip),%ymm0        # 7ca0 <_sk_callback_avx+0x420>
+  DB  196,226,125,24,5,204,56,0,0         ; vbroadcastss  0x38cc(%rip),%ymm0        # 7cdc <_sk_callback_avx+0x428>
   DB  197,228,84,192                      ; vandps        %ymm0,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,183,56,0,0        ; vbroadcastss  0x38b7(%rip),%ymm1        # 7ca4 <_sk_callback_avx+0x424>
+  DB  196,226,125,24,13,191,56,0,0        ; vbroadcastss  0x38bf(%rip),%ymm1        # 7ce0 <_sk_callback_avx+0x42c>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,174,56,0,0        ; vbroadcastss  0x38ae(%rip),%ymm1        # 7ca8 <_sk_callback_avx+0x428>
+  DB  196,226,125,24,13,182,56,0,0        ; vbroadcastss  0x38b6(%rip),%ymm1        # 7ce4 <_sk_callback_avx+0x430>
   DB  197,228,84,201                      ; vandps        %ymm1,%ymm3,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,21,161,56,0,0        ; vbroadcastss  0x38a1(%rip),%ymm2        # 7cac <_sk_callback_avx+0x42c>
+  DB  196,226,125,24,21,169,56,0,0        ; vbroadcastss  0x38a9(%rip),%ymm2        # 7ce8 <_sk_callback_avx+0x434>
   DB  197,244,89,202                      ; vmulps        %ymm2,%ymm1,%ymm1
-  DB  196,226,125,24,21,152,56,0,0        ; vbroadcastss  0x3898(%rip),%ymm2        # 7cb0 <_sk_callback_avx+0x430>
+  DB  196,226,125,24,21,160,56,0,0        ; vbroadcastss  0x38a0(%rip),%ymm2        # 7cec <_sk_callback_avx+0x438>
   DB  197,228,84,210                      ; vandps        %ymm2,%ymm3,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,98,125,24,5,139,56,0,0          ; vbroadcastss  0x388b(%rip),%ymm8        # 7cb4 <_sk_callback_avx+0x434>
+  DB  196,98,125,24,5,147,56,0,0          ; vbroadcastss  0x3893(%rip),%ymm8        # 7cf0 <_sk_callback_avx+0x43c>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,129,56,0,0          ; vbroadcastss  0x3881(%rip),%ymm8        # 7cb8 <_sk_callback_avx+0x438>
+  DB  196,98,125,24,5,137,56,0,0          ; vbroadcastss  0x3889(%rip),%ymm8        # 7cf4 <_sk_callback_avx+0x440>
   DB  196,193,100,84,216                  ; vandps        %ymm8,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,115,56,0,0          ; vbroadcastss  0x3873(%rip),%ymm8        # 7cbc <_sk_callback_avx+0x43c>
+  DB  196,98,125,24,5,123,56,0,0          ; vbroadcastss  0x387b(%rip),%ymm8        # 7cf8 <_sk_callback_avx+0x444>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -10299,27 +10336,27 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,86,255,255,255               ; ja            43c0 <_sk_load_4444_avx+0x14>
+  DB  15,135,86,255,255,255               ; ja            43f4 <_sk_load_4444_avx+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 44d8 <_sk_load_4444_avx+0x12c>
+  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 450c <_sk_load_4444_avx+0x12c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  233,52,255,255,255                  ; jmpq          43c0 <_sk_load_4444_avx+0x14>
+  DB  233,52,255,255,255                  ; jmpq          43f4 <_sk_load_4444_avx+0x14>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,110,12,83               ; vmovd         (%r11,%rdx,2),%xmm1
   DB  196,227,121,14,193,3                ; vpblendw      $0x3,%xmm1,%xmm0,%xmm0
-  DB  233,23,255,255,255                  ; jmpq          43c0 <_sk_load_4444_avx+0x14>
+  DB  233,23,255,255,255                  ; jmpq          43f4 <_sk_load_4444_avx+0x14>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,193,121,196,68,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,121,196,68,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm0,%xmm0
   DB  196,193,122,126,12,83               ; vmovq         (%r11,%rdx,2),%xmm1
   DB  196,227,113,14,192,240              ; vpblendw      $0xf0,%xmm0,%xmm1,%xmm0
-  DB  233,234,254,255,255                 ; jmpq          43c0 <_sk_load_4444_avx+0x14>
+  DB  233,234,254,255,255                 ; jmpq          43f4 <_sk_load_4444_avx+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  166                                 ; cmpsb         %es:(%rdi),%ds:(%rsi)
   DB  255                                 ; (bad)
@@ -10345,31 +10382,31 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,152,0,0,0                    ; jne           459a <_sk_load_4444_dst_avx+0xa6>
+  DB  15,133,152,0,0,0                    ; jne           45ce <_sk_load_4444_dst_avx+0xa6>
   DB  196,193,122,111,36,83               ; vmovdqu       (%r11,%rdx,2),%xmm4
   DB  197,209,239,237                     ; vpxor         %xmm5,%xmm5,%xmm5
   DB  197,217,105,237                     ; vpunpckhwd    %xmm5,%xmm4,%xmm5
   DB  196,226,121,51,228                  ; vpmovzxwd     %xmm4,%xmm4
   DB  196,227,93,24,253,1                 ; vinsertf128   $0x1,%xmm5,%ymm4,%ymm7
-  DB  196,226,125,24,37,156,55,0,0        ; vbroadcastss  0x379c(%rip),%ymm4        # 7cc0 <_sk_callback_avx+0x440>
+  DB  196,226,125,24,37,164,55,0,0        ; vbroadcastss  0x37a4(%rip),%ymm4        # 7cfc <_sk_callback_avx+0x448>
   DB  197,196,84,228                      ; vandps        %ymm4,%ymm7,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,226,125,24,45,143,55,0,0        ; vbroadcastss  0x378f(%rip),%ymm5        # 7cc4 <_sk_callback_avx+0x444>
+  DB  196,226,125,24,45,151,55,0,0        ; vbroadcastss  0x3797(%rip),%ymm5        # 7d00 <_sk_callback_avx+0x44c>
   DB  197,220,89,229                      ; vmulps        %ymm5,%ymm4,%ymm4
-  DB  196,226,125,24,45,134,55,0,0        ; vbroadcastss  0x3786(%rip),%ymm5        # 7cc8 <_sk_callback_avx+0x448>
+  DB  196,226,125,24,45,142,55,0,0        ; vbroadcastss  0x378e(%rip),%ymm5        # 7d04 <_sk_callback_avx+0x450>
   DB  197,196,84,237                      ; vandps        %ymm5,%ymm7,%ymm5
   DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
-  DB  196,226,125,24,53,121,55,0,0        ; vbroadcastss  0x3779(%rip),%ymm6        # 7ccc <_sk_callback_avx+0x44c>
+  DB  196,226,125,24,53,129,55,0,0        ; vbroadcastss  0x3781(%rip),%ymm6        # 7d08 <_sk_callback_avx+0x454>
   DB  197,212,89,238                      ; vmulps        %ymm6,%ymm5,%ymm5
-  DB  196,226,125,24,53,112,55,0,0        ; vbroadcastss  0x3770(%rip),%ymm6        # 7cd0 <_sk_callback_avx+0x450>
+  DB  196,226,125,24,53,120,55,0,0        ; vbroadcastss  0x3778(%rip),%ymm6        # 7d0c <_sk_callback_avx+0x458>
   DB  197,196,84,246                      ; vandps        %ymm6,%ymm7,%ymm6
   DB  197,252,91,246                      ; vcvtdq2ps     %ymm6,%ymm6
-  DB  196,98,125,24,5,99,55,0,0           ; vbroadcastss  0x3763(%rip),%ymm8        # 7cd4 <_sk_callback_avx+0x454>
+  DB  196,98,125,24,5,107,55,0,0          ; vbroadcastss  0x376b(%rip),%ymm8        # 7d10 <_sk_callback_avx+0x45c>
   DB  196,193,76,89,240                   ; vmulps        %ymm8,%ymm6,%ymm6
-  DB  196,98,125,24,5,89,55,0,0           ; vbroadcastss  0x3759(%rip),%ymm8        # 7cd8 <_sk_callback_avx+0x458>
+  DB  196,98,125,24,5,97,55,0,0           ; vbroadcastss  0x3761(%rip),%ymm8        # 7d14 <_sk_callback_avx+0x460>
   DB  196,193,68,84,248                   ; vandps        %ymm8,%ymm7,%ymm7
   DB  197,252,91,255                      ; vcvtdq2ps     %ymm7,%ymm7
-  DB  196,98,125,24,5,75,55,0,0           ; vbroadcastss  0x374b(%rip),%ymm8        # 7cdc <_sk_callback_avx+0x45c>
+  DB  196,98,125,24,5,83,55,0,0           ; vbroadcastss  0x3753(%rip),%ymm8        # 7d18 <_sk_callback_avx+0x464>
   DB  196,193,68,89,248                   ; vmulps        %ymm8,%ymm7,%ymm7
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -10378,27 +10415,27 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,86,255,255,255               ; ja            4508 <_sk_load_4444_dst_avx+0x14>
+  DB  15,135,86,255,255,255               ; ja            453c <_sk_load_4444_dst_avx+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 4620 <_sk_load_4444_dst_avx+0x12c>
+  DB  76,141,21,99,0,0,0                  ; lea           0x63(%rip),%r10        # 4654 <_sk_load_4444_dst_avx+0x12c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,183,4,83                      ; movzwl        (%r11,%rdx,2),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  233,52,255,255,255                  ; jmpq          4508 <_sk_load_4444_dst_avx+0x14>
+  DB  233,52,255,255,255                  ; jmpq          453c <_sk_load_4444_dst_avx+0x14>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,4,2           ; vpinsrw       $0x2,0x4(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,121,110,44,83               ; vmovd         (%r11,%rdx,2),%xmm5
   DB  196,227,89,14,229,3                 ; vpblendw      $0x3,%xmm5,%xmm4,%xmm4
-  DB  233,23,255,255,255                  ; jmpq          4508 <_sk_load_4444_dst_avx+0x14>
+  DB  233,23,255,255,255                  ; jmpq          453c <_sk_load_4444_dst_avx+0x14>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,193,89,196,100,83,12,6          ; vpinsrw       $0x6,0xc(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,10,5          ; vpinsrw       $0x5,0xa(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,89,196,100,83,8,4           ; vpinsrw       $0x4,0x8(%r11,%rdx,2),%xmm4,%xmm4
   DB  196,193,122,126,44,83               ; vmovq         (%r11,%rdx,2),%xmm5
   DB  196,227,81,14,228,240               ; vpblendw      $0xf0,%xmm4,%xmm5,%xmm4
-  DB  233,234,254,255,255                 ; jmpq          4508 <_sk_load_4444_dst_avx+0x14>
+  DB  233,234,254,255,255                 ; jmpq          453c <_sk_load_4444_dst_avx+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  166                                 ; cmpsb         %es:(%rdi),%ds:(%rsi)
   DB  255                                 ; (bad)
@@ -10465,25 +10502,25 @@
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,217,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm3
-  DB  196,226,125,24,5,210,53,0,0         ; vbroadcastss  0x35d2(%rip),%ymm0        # 7ce0 <_sk_callback_avx+0x460>
+  DB  196,226,125,24,5,218,53,0,0         ; vbroadcastss  0x35da(%rip),%ymm0        # 7d1c <_sk_callback_avx+0x468>
   DB  197,228,84,192                      ; vandps        %ymm0,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,226,125,24,13,197,53,0,0        ; vbroadcastss  0x35c5(%rip),%ymm1        # 7ce4 <_sk_callback_avx+0x464>
+  DB  196,226,125,24,13,205,53,0,0        ; vbroadcastss  0x35cd(%rip),%ymm1        # 7d20 <_sk_callback_avx+0x46c>
   DB  197,252,89,193                      ; vmulps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,188,53,0,0        ; vbroadcastss  0x35bc(%rip),%ymm1        # 7ce8 <_sk_callback_avx+0x468>
+  DB  196,226,125,24,13,196,53,0,0        ; vbroadcastss  0x35c4(%rip),%ymm1        # 7d24 <_sk_callback_avx+0x470>
   DB  197,228,84,201                      ; vandps        %ymm1,%ymm3,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,226,125,24,21,175,53,0,0        ; vbroadcastss  0x35af(%rip),%ymm2        # 7cec <_sk_callback_avx+0x46c>
+  DB  196,226,125,24,21,183,53,0,0        ; vbroadcastss  0x35b7(%rip),%ymm2        # 7d28 <_sk_callback_avx+0x474>
   DB  197,244,89,202                      ; vmulps        %ymm2,%ymm1,%ymm1
-  DB  196,226,125,24,21,166,53,0,0        ; vbroadcastss  0x35a6(%rip),%ymm2        # 7cf0 <_sk_callback_avx+0x470>
+  DB  196,226,125,24,21,174,53,0,0        ; vbroadcastss  0x35ae(%rip),%ymm2        # 7d2c <_sk_callback_avx+0x478>
   DB  197,228,84,210                      ; vandps        %ymm2,%ymm3,%ymm2
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
-  DB  196,98,125,24,5,153,53,0,0          ; vbroadcastss  0x3599(%rip),%ymm8        # 7cf4 <_sk_callback_avx+0x474>
+  DB  196,98,125,24,5,161,53,0,0          ; vbroadcastss  0x35a1(%rip),%ymm8        # 7d30 <_sk_callback_avx+0x47c>
   DB  196,193,108,89,208                  ; vmulps        %ymm8,%ymm2,%ymm2
-  DB  196,98,125,24,5,143,53,0,0          ; vbroadcastss  0x358f(%rip),%ymm8        # 7cf8 <_sk_callback_avx+0x478>
+  DB  196,98,125,24,5,151,53,0,0          ; vbroadcastss  0x3597(%rip),%ymm8        # 7d34 <_sk_callback_avx+0x480>
   DB  196,193,100,84,216                  ; vandps        %ymm8,%ymm3,%ymm3
   DB  197,252,91,219                      ; vcvtdq2ps     %ymm3,%ymm3
-  DB  196,98,125,24,5,129,53,0,0          ; vbroadcastss  0x3581(%rip),%ymm8        # 7cfc <_sk_callback_avx+0x47c>
+  DB  196,98,125,24,5,137,53,0,0          ; vbroadcastss  0x3589(%rip),%ymm8        # 7d38 <_sk_callback_avx+0x484>
   DB  196,193,100,89,216                  ; vmulps        %ymm8,%ymm3,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -10492,7 +10529,7 @@
 _sk_store_4444_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
-  DB  196,98,125,24,5,110,53,0,0          ; vbroadcastss  0x356e(%rip),%ymm8        # 7d00 <_sk_callback_avx+0x480>
+  DB  196,98,125,24,5,118,53,0,0          ; vbroadcastss  0x3576(%rip),%ymm8        # 7d3c <_sk_callback_avx+0x488>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,193,41,114,241,12               ; vpslld        $0xc,%xmm9,%xmm10
@@ -10519,7 +10556,7 @@
   DB  196,67,125,25,193,1                 ; vextractf128  $0x1,%ymm8,%xmm9
   DB  196,66,57,43,193                    ; vpackusdw     %xmm9,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           482b <_sk_store_4444_avx+0xa7>
+  DB  117,10                              ; jne           485f <_sk_store_4444_avx+0xa7>
   DB  196,65,122,127,4,83                 ; vmovdqu       %xmm8,(%r11,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -10527,22 +10564,22 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,236                             ; ja            4827 <_sk_store_4444_avx+0xa3>
+  DB  119,236                             ; ja            485b <_sk_store_4444_avx+0xa3>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,66,0,0,0                  ; lea           0x42(%rip),%r10        # 4888 <_sk_store_4444_avx+0x104>
+  DB  76,141,21,66,0,0,0                  ; lea           0x42(%rip),%r10        # 48bc <_sk_store_4444_avx+0x104>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,21,4,83,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,2)
-  DB  235,207                             ; jmp           4827 <_sk_store_4444_avx+0xa3>
+  DB  235,207                             ; jmp           485b <_sk_store_4444_avx+0xa3>
   DB  196,67,121,21,68,83,4,2             ; vpextrw       $0x2,%xmm8,0x4(%r11,%rdx,2)
   DB  196,65,121,126,4,83                 ; vmovd         %xmm8,(%r11,%rdx,2)
-  DB  235,191                             ; jmp           4827 <_sk_store_4444_avx+0xa3>
+  DB  235,191                             ; jmp           485b <_sk_store_4444_avx+0xa3>
   DB  196,67,121,21,68,83,12,6            ; vpextrw       $0x6,%xmm8,0xc(%r11,%rdx,2)
   DB  196,67,121,21,68,83,10,5            ; vpextrw       $0x5,%xmm8,0xa(%r11,%rdx,2)
   DB  196,67,121,21,68,83,8,4             ; vpextrw       $0x4,%xmm8,0x8(%r11,%rdx,2)
   DB  196,65,121,214,4,83                 ; vmovq         %xmm8,(%r11,%rdx,2)
-  DB  235,159                             ; jmp           4827 <_sk_store_4444_avx+0xa3>
+  DB  235,159                             ; jmp           485b <_sk_store_4444_avx+0xa3>
   DB  199                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -10560,7 +10597,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  232,255,255,255,224                 ; callq         ffffffffe10048a0 <_sk_callback_avx+0xffffffffe0ffd020>
+  DB  232,255,255,255,224                 ; callq         ffffffffe10048d4 <_sk_callback_avx+0xffffffffe0ffd020>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; .byte         0xff
@@ -10573,12 +10610,12 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,139,0,0,0                    ; jne           4949 <_sk_load_8888_avx+0xa5>
+  DB  15,133,139,0,0,0                    ; jne           497d <_sk_load_8888_avx+0xa5>
   DB  196,193,124,16,26                   ; vmovups       (%r10),%ymm3
-  DB  197,124,40,21,213,55,0,0            ; vmovaps       0x37d5(%rip),%ymm10        # 80a0 <_sk_callback_avx+0x820>
+  DB  197,124,40,21,225,55,0,0            ; vmovaps       0x37e1(%rip),%ymm10        # 80e0 <_sk_callback_avx+0x82c>
   DB  196,193,100,84,194                  ; vandps        %ymm10,%ymm3,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,5,39,52,0,0           ; vbroadcastss  0x3427(%rip),%ymm8        # 7d04 <_sk_callback_avx+0x484>
+  DB  196,98,125,24,5,47,52,0,0           ; vbroadcastss  0x342f(%rip),%ymm8        # 7d40 <_sk_callback_avx+0x48c>
   DB  196,193,124,89,192                  ; vmulps        %ymm8,%ymm0,%ymm0
   DB  197,241,114,211,8                   ; vpsrld        $0x8,%xmm3,%xmm1
   DB  196,195,125,25,217,1                ; vextractf128  $0x1,%ymm3,%xmm9
@@ -10609,13 +10646,13 @@
   DB  72,211,232                          ; shr           %cl,%rax
   DB  196,225,249,110,192                 ; vmovq         %rax,%xmm0
   DB  196,226,121,48,192                  ; vpmovzxbw     %xmm0,%xmm0
-  DB  196,226,121,0,13,255,53,0,0         ; vpshufb       0x35ff(%rip),%xmm0,%xmm1        # 7f70 <_sk_callback_avx+0x6f0>
+  DB  196,226,121,0,13,11,54,0,0          ; vpshufb       0x360b(%rip),%xmm0,%xmm1        # 7fb0 <_sk_callback_avx+0x6fc>
   DB  196,226,121,33,201                  ; vpmovsxbd     %xmm1,%xmm1
-  DB  196,226,121,0,5,1,54,0,0            ; vpshufb       0x3601(%rip),%xmm0,%xmm0        # 7f80 <_sk_callback_avx+0x700>
+  DB  196,226,121,0,5,13,54,0,0           ; vpshufb       0x360d(%rip),%xmm0,%xmm0        # 7fc0 <_sk_callback_avx+0x70c>
   DB  196,226,121,33,192                  ; vpmovsxbd     %xmm0,%xmm0
   DB  196,227,117,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   DB  196,194,125,44,26                   ; vmaskmovps    (%r10),%ymm0,%ymm3
-  DB  233,47,255,255,255                  ; jmpq          48c3 <_sk_load_8888_avx+0x1f>
+  DB  233,47,255,255,255                  ; jmpq          48f7 <_sk_load_8888_avx+0x1f>
 
 PUBLIC _sk_load_8888_dst_avx
 _sk_load_8888_dst_avx LABEL PROC
@@ -10625,12 +10662,12 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,139,0,0,0                    ; jne           4a39 <_sk_load_8888_dst_avx+0xa5>
+  DB  15,133,139,0,0,0                    ; jne           4a6d <_sk_load_8888_dst_avx+0xa5>
   DB  196,193,124,16,58                   ; vmovups       (%r10),%ymm7
-  DB  197,124,40,21,5,55,0,0              ; vmovaps       0x3705(%rip),%ymm10        # 80c0 <_sk_callback_avx+0x840>
+  DB  197,124,40,21,17,55,0,0             ; vmovaps       0x3711(%rip),%ymm10        # 8100 <_sk_callback_avx+0x84c>
   DB  196,193,68,84,226                   ; vandps        %ymm10,%ymm7,%ymm4
   DB  197,252,91,228                      ; vcvtdq2ps     %ymm4,%ymm4
-  DB  196,98,125,24,5,59,51,0,0           ; vbroadcastss  0x333b(%rip),%ymm8        # 7d08 <_sk_callback_avx+0x488>
+  DB  196,98,125,24,5,67,51,0,0           ; vbroadcastss  0x3343(%rip),%ymm8        # 7d44 <_sk_callback_avx+0x490>
   DB  196,193,92,89,224                   ; vmulps        %ymm8,%ymm4,%ymm4
   DB  197,209,114,215,8                   ; vpsrld        $0x8,%xmm7,%xmm5
   DB  196,195,125,25,249,1                ; vextractf128  $0x1,%ymm7,%xmm9
@@ -10661,13 +10698,13 @@
   DB  72,211,232                          ; shr           %cl,%rax
   DB  196,225,249,110,224                 ; vmovq         %rax,%xmm4
   DB  196,226,121,48,228                  ; vpmovzxbw     %xmm4,%xmm4
-  DB  196,226,89,0,45,47,53,0,0           ; vpshufb       0x352f(%rip),%xmm4,%xmm5        # 7f90 <_sk_callback_avx+0x710>
+  DB  196,226,89,0,45,59,53,0,0           ; vpshufb       0x353b(%rip),%xmm4,%xmm5        # 7fd0 <_sk_callback_avx+0x71c>
   DB  196,226,121,33,237                  ; vpmovsxbd     %xmm5,%xmm5
-  DB  196,226,89,0,37,49,53,0,0           ; vpshufb       0x3531(%rip),%xmm4,%xmm4        # 7fa0 <_sk_callback_avx+0x720>
+  DB  196,226,89,0,37,61,53,0,0           ; vpshufb       0x353d(%rip),%xmm4,%xmm4        # 7fe0 <_sk_callback_avx+0x72c>
   DB  196,226,121,33,228                  ; vpmovsxbd     %xmm4,%xmm4
   DB  196,227,85,24,228,1                 ; vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
   DB  196,194,93,44,58                    ; vmaskmovps    (%r10),%ymm4,%ymm7
-  DB  233,47,255,255,255                  ; jmpq          49b3 <_sk_load_8888_dst_avx+0x1f>
+  DB  233,47,255,255,255                  ; jmpq          49e7 <_sk_load_8888_dst_avx+0x1f>
 
 PUBLIC _sk_gather_8888_avx
 _sk_gather_8888_avx LABEL PROC
@@ -10704,10 +10741,10 @@
   DB  73,193,234,32                       ; shr           $0x20,%r10
   DB  196,131,121,34,28,145,3             ; vpinsrd       $0x3,(%r9,%r10,4),%xmm0,%xmm3
   DB  196,227,61,24,195,1                 ; vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  DB  197,124,40,21,177,53,0,0            ; vmovaps       0x35b1(%rip),%ymm10        # 80e0 <_sk_callback_avx+0x860>
+  DB  197,124,40,21,189,53,0,0            ; vmovaps       0x35bd(%rip),%ymm10        # 8120 <_sk_callback_avx+0x86c>
   DB  196,193,124,84,194                  ; vandps        %ymm10,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,13,203,49,0,0         ; vbroadcastss  0x31cb(%rip),%ymm9        # 7d0c <_sk_callback_avx+0x48c>
+  DB  196,98,125,24,13,211,49,0,0         ; vbroadcastss  0x31d3(%rip),%ymm9        # 7d48 <_sk_callback_avx+0x494>
   DB  196,193,124,89,193                  ; vmulps        %ymm9,%ymm0,%ymm0
   DB  196,193,113,114,208,8               ; vpsrld        $0x8,%xmm8,%xmm1
   DB  197,233,114,211,8                   ; vpsrld        $0x8,%xmm3,%xmm2
@@ -10736,7 +10773,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
-  DB  196,98,125,24,5,84,49,0,0           ; vbroadcastss  0x3154(%rip),%ymm8        # 7d10 <_sk_callback_avx+0x490>
+  DB  196,98,125,24,5,92,49,0,0           ; vbroadcastss  0x315c(%rip),%ymm8        # 7d4c <_sk_callback_avx+0x498>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,65,116,89,208                   ; vmulps        %ymm8,%ymm1,%ymm10
@@ -10761,7 +10798,7 @@
   DB  196,65,45,86,192                    ; vorpd         %ymm8,%ymm10,%ymm8
   DB  196,65,53,86,192                    ; vorpd         %ymm8,%ymm9,%ymm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,14                              ; jne           4c4e <_sk_store_8888_avx+0xac>
+  DB  117,14                              ; jne           4c82 <_sk_store_8888_avx+0xac>
   DB  196,65,124,17,2                     ; vmovups       %ymm8,(%r10)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,201                          ; mov           %r9,%rcx
@@ -10774,13 +10811,13 @@
   DB  72,211,232                          ; shr           %cl,%rax
   DB  196,97,249,110,200                  ; vmovq         %rax,%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
-  DB  196,98,49,0,21,58,51,0,0            ; vpshufb       0x333a(%rip),%xmm9,%xmm10        # 7fb0 <_sk_callback_avx+0x730>
+  DB  196,98,49,0,21,70,51,0,0            ; vpshufb       0x3346(%rip),%xmm9,%xmm10        # 7ff0 <_sk_callback_avx+0x73c>
   DB  196,66,121,33,210                   ; vpmovsxbd     %xmm10,%xmm10
-  DB  196,98,49,0,13,60,51,0,0            ; vpshufb       0x333c(%rip),%xmm9,%xmm9        # 7fc0 <_sk_callback_avx+0x740>
+  DB  196,98,49,0,13,72,51,0,0            ; vpshufb       0x3348(%rip),%xmm9,%xmm9        # 8000 <_sk_callback_avx+0x74c>
   DB  196,66,121,33,201                   ; vpmovsxbd     %xmm9,%xmm9
   DB  196,67,45,24,201,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
   DB  196,66,53,46,2                      ; vmaskmovps    %ymm8,%ymm9,(%r10)
-  DB  235,175                             ; jmp           4c45 <_sk_store_8888_avx+0xa3>
+  DB  235,175                             ; jmp           4c79 <_sk_store_8888_avx+0xa3>
 
 PUBLIC _sk_load_bgra_avx
 _sk_load_bgra_avx LABEL PROC
@@ -10790,12 +10827,12 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,139,0,0,0                    ; jne           4d3b <_sk_load_bgra_avx+0xa5>
+  DB  15,133,139,0,0,0                    ; jne           4d6f <_sk_load_bgra_avx+0xa5>
   DB  196,193,124,16,26                   ; vmovups       (%r10),%ymm3
-  DB  197,124,40,21,67,52,0,0             ; vmovaps       0x3443(%rip),%ymm10        # 8100 <_sk_callback_avx+0x880>
+  DB  197,124,40,21,79,52,0,0             ; vmovaps       0x344f(%rip),%ymm10        # 8140 <_sk_callback_avx+0x88c>
   DB  196,193,100,84,202                  ; vandps        %ymm10,%ymm3,%ymm1
   DB  197,252,91,201                      ; vcvtdq2ps     %ymm1,%ymm1
-  DB  196,98,125,24,5,69,48,0,0           ; vbroadcastss  0x3045(%rip),%ymm8        # 7d14 <_sk_callback_avx+0x494>
+  DB  196,98,125,24,5,77,48,0,0           ; vbroadcastss  0x304d(%rip),%ymm8        # 7d50 <_sk_callback_avx+0x49c>
   DB  196,193,116,89,208                  ; vmulps        %ymm8,%ymm1,%ymm2
   DB  197,241,114,211,8                   ; vpsrld        $0x8,%xmm3,%xmm1
   DB  196,195,125,25,217,1                ; vextractf128  $0x1,%ymm3,%xmm9
@@ -10826,13 +10863,13 @@
   DB  72,211,232                          ; shr           %cl,%rax
   DB  196,225,249,110,192                 ; vmovq         %rax,%xmm0
   DB  196,226,121,48,192                  ; vpmovzxbw     %xmm0,%xmm0
-  DB  196,226,121,0,13,109,50,0,0         ; vpshufb       0x326d(%rip),%xmm0,%xmm1        # 7fd0 <_sk_callback_avx+0x750>
+  DB  196,226,121,0,13,121,50,0,0         ; vpshufb       0x3279(%rip),%xmm0,%xmm1        # 8010 <_sk_callback_avx+0x75c>
   DB  196,226,121,33,201                  ; vpmovsxbd     %xmm1,%xmm1
-  DB  196,226,121,0,5,111,50,0,0          ; vpshufb       0x326f(%rip),%xmm0,%xmm0        # 7fe0 <_sk_callback_avx+0x760>
+  DB  196,226,121,0,5,123,50,0,0          ; vpshufb       0x327b(%rip),%xmm0,%xmm0        # 8020 <_sk_callback_avx+0x76c>
   DB  196,226,121,33,192                  ; vpmovsxbd     %xmm0,%xmm0
   DB  196,227,117,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm1,%ymm0
   DB  196,194,125,44,26                   ; vmaskmovps    (%r10),%ymm0,%ymm3
-  DB  233,47,255,255,255                  ; jmpq          4cb5 <_sk_load_bgra_avx+0x1f>
+  DB  233,47,255,255,255                  ; jmpq          4ce9 <_sk_load_bgra_avx+0x1f>
 
 PUBLIC _sk_load_bgra_dst_avx
 _sk_load_bgra_dst_avx LABEL PROC
@@ -10842,12 +10879,12 @@
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,139,0,0,0                    ; jne           4e2b <_sk_load_bgra_dst_avx+0xa5>
+  DB  15,133,139,0,0,0                    ; jne           4e5f <_sk_load_bgra_dst_avx+0xa5>
   DB  196,193,124,16,58                   ; vmovups       (%r10),%ymm7
-  DB  197,124,40,21,115,51,0,0            ; vmovaps       0x3373(%rip),%ymm10        # 8120 <_sk_callback_avx+0x8a0>
+  DB  197,124,40,21,127,51,0,0            ; vmovaps       0x337f(%rip),%ymm10        # 8160 <_sk_callback_avx+0x8ac>
   DB  196,193,68,84,234                   ; vandps        %ymm10,%ymm7,%ymm5
   DB  197,252,91,237                      ; vcvtdq2ps     %ymm5,%ymm5
-  DB  196,98,125,24,5,89,47,0,0           ; vbroadcastss  0x2f59(%rip),%ymm8        # 7d18 <_sk_callback_avx+0x498>
+  DB  196,98,125,24,5,97,47,0,0           ; vbroadcastss  0x2f61(%rip),%ymm8        # 7d54 <_sk_callback_avx+0x4a0>
   DB  196,193,84,89,240                   ; vmulps        %ymm8,%ymm5,%ymm6
   DB  197,209,114,215,8                   ; vpsrld        $0x8,%xmm7,%xmm5
   DB  196,195,125,25,249,1                ; vextractf128  $0x1,%ymm7,%xmm9
@@ -10878,13 +10915,13 @@
   DB  72,211,232                          ; shr           %cl,%rax
   DB  196,225,249,110,224                 ; vmovq         %rax,%xmm4
   DB  196,226,121,48,228                  ; vpmovzxbw     %xmm4,%xmm4
-  DB  196,226,89,0,45,157,49,0,0          ; vpshufb       0x319d(%rip),%xmm4,%xmm5        # 7ff0 <_sk_callback_avx+0x770>
+  DB  196,226,89,0,45,169,49,0,0          ; vpshufb       0x31a9(%rip),%xmm4,%xmm5        # 8030 <_sk_callback_avx+0x77c>
   DB  196,226,121,33,237                  ; vpmovsxbd     %xmm5,%xmm5
-  DB  196,226,89,0,37,159,49,0,0          ; vpshufb       0x319f(%rip),%xmm4,%xmm4        # 8000 <_sk_callback_avx+0x780>
+  DB  196,226,89,0,37,171,49,0,0          ; vpshufb       0x31ab(%rip),%xmm4,%xmm4        # 8040 <_sk_callback_avx+0x78c>
   DB  196,226,121,33,228                  ; vpmovsxbd     %xmm4,%xmm4
   DB  196,227,85,24,228,1                 ; vinsertf128   $0x1,%xmm4,%ymm5,%ymm4
   DB  196,194,93,44,58                    ; vmaskmovps    (%r10),%ymm4,%ymm7
-  DB  233,47,255,255,255                  ; jmpq          4da5 <_sk_load_bgra_dst_avx+0x1f>
+  DB  233,47,255,255,255                  ; jmpq          4dd9 <_sk_load_bgra_dst_avx+0x1f>
 
 PUBLIC _sk_gather_bgra_avx
 _sk_gather_bgra_avx LABEL PROC
@@ -10921,10 +10958,10 @@
   DB  73,193,234,32                       ; shr           $0x20,%r10
   DB  196,131,121,34,28,145,3             ; vpinsrd       $0x3,(%r9,%r10,4),%xmm0,%xmm3
   DB  196,227,61,24,195,1                 ; vinsertf128   $0x1,%xmm3,%ymm8,%ymm0
-  DB  197,124,40,13,31,50,0,0             ; vmovaps       0x321f(%rip),%ymm9        # 8140 <_sk_callback_avx+0x8c0>
+  DB  197,124,40,13,43,50,0,0             ; vmovaps       0x322b(%rip),%ymm9        # 8180 <_sk_callback_avx+0x8cc>
   DB  196,193,124,84,193                  ; vandps        %ymm9,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,21,233,45,0,0         ; vbroadcastss  0x2de9(%rip),%ymm10        # 7d1c <_sk_callback_avx+0x49c>
+  DB  196,98,125,24,21,241,45,0,0         ; vbroadcastss  0x2df1(%rip),%ymm10        # 7d58 <_sk_callback_avx+0x4a4>
   DB  196,193,124,89,210                  ; vmulps        %ymm10,%ymm0,%ymm2
   DB  196,193,121,114,208,8               ; vpsrld        $0x8,%xmm8,%xmm0
   DB  197,241,114,211,8                   ; vpsrld        $0x8,%xmm3,%xmm1
@@ -10953,7 +10990,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  76,3,16                             ; add           (%rax),%r10
-  DB  196,98,125,24,5,114,45,0,0          ; vbroadcastss  0x2d72(%rip),%ymm8        # 7d20 <_sk_callback_avx+0x4a0>
+  DB  196,98,125,24,5,122,45,0,0          ; vbroadcastss  0x2d7a(%rip),%ymm8        # 7d5c <_sk_callback_avx+0x4a8>
   DB  196,65,108,89,200                   ; vmulps        %ymm8,%ymm2,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,65,116,89,208                   ; vmulps        %ymm8,%ymm1,%ymm10
@@ -10978,7 +11015,7 @@
   DB  196,65,45,86,192                    ; vorpd         %ymm8,%ymm10,%ymm8
   DB  196,65,53,86,192                    ; vorpd         %ymm8,%ymm9,%ymm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,14                              ; jne           5040 <_sk_store_bgra_avx+0xac>
+  DB  117,14                              ; jne           5074 <_sk_store_bgra_avx+0xac>
   DB  196,65,124,17,2                     ; vmovups       %ymm8,(%r10)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,137,201                          ; mov           %r9,%rcx
@@ -10991,13 +11028,13 @@
   DB  72,211,232                          ; shr           %cl,%rax
   DB  196,97,249,110,200                  ; vmovq         %rax,%xmm9
   DB  196,66,121,48,201                   ; vpmovzxbw     %xmm9,%xmm9
-  DB  196,98,49,0,21,168,47,0,0           ; vpshufb       0x2fa8(%rip),%xmm9,%xmm10        # 8010 <_sk_callback_avx+0x790>
+  DB  196,98,49,0,21,180,47,0,0           ; vpshufb       0x2fb4(%rip),%xmm9,%xmm10        # 8050 <_sk_callback_avx+0x79c>
   DB  196,66,121,33,210                   ; vpmovsxbd     %xmm10,%xmm10
-  DB  196,98,49,0,13,170,47,0,0           ; vpshufb       0x2faa(%rip),%xmm9,%xmm9        # 8020 <_sk_callback_avx+0x7a0>
+  DB  196,98,49,0,13,182,47,0,0           ; vpshufb       0x2fb6(%rip),%xmm9,%xmm9        # 8060 <_sk_callback_avx+0x7ac>
   DB  196,66,121,33,201                   ; vpmovsxbd     %xmm9,%xmm9
   DB  196,67,45,24,201,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm9
   DB  196,66,53,46,2                      ; vmaskmovps    %ymm8,%ymm9,(%r10)
-  DB  235,175                             ; jmp           5037 <_sk_store_bgra_avx+0xa3>
+  DB  235,175                             ; jmp           506b <_sk_store_bgra_avx+0xa3>
 
 PUBLIC _sk_load_f16_avx
 _sk_load_f16_avx LABEL PROC
@@ -11009,7 +11046,7 @@
   DB  197,252,17,116,36,64                ; vmovups       %ymm6,0x40(%rsp)
   DB  197,252,17,108,36,32                ; vmovups       %ymm5,0x20(%rsp)
   DB  197,254,127,36,36                   ; vmovdqu       %ymm4,(%rsp)
-  DB  15,133,143,2,0,0                    ; jne           5343 <_sk_load_f16_avx+0x2bb>
+  DB  15,133,143,2,0,0                    ; jne           5377 <_sk_load_f16_avx+0x2bb>
   DB  197,121,16,4,208                    ; vmovupd       (%rax,%rdx,8),%xmm8
   DB  197,249,16,84,208,16                ; vmovupd       0x10(%rax,%rdx,8),%xmm2
   DB  197,249,16,76,208,32                ; vmovupd       0x20(%rax,%rdx,8),%xmm1
@@ -11027,13 +11064,13 @@
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
-  DB  196,98,125,24,37,23,44,0,0          ; vbroadcastss  0x2c17(%rip),%ymm12        # 7d24 <_sk_callback_avx+0x4a4>
+  DB  196,98,125,24,37,31,44,0,0          ; vbroadcastss  0x2c1f(%rip),%ymm12        # 7d60 <_sk_callback_avx+0x4ac>
   DB  196,193,124,84,204                  ; vandps        %ymm12,%ymm0,%ymm1
   DB  197,252,87,193                      ; vxorps        %ymm1,%ymm0,%ymm0
   DB  196,195,125,25,198,1                ; vextractf128  $0x1,%ymm0,%xmm14
-  DB  196,98,121,24,29,3,44,0,0           ; vbroadcastss  0x2c03(%rip),%xmm11        # 7d28 <_sk_callback_avx+0x4a8>
+  DB  196,98,121,24,29,11,44,0,0          ; vbroadcastss  0x2c0b(%rip),%xmm11        # 7d64 <_sk_callback_avx+0x4b0>
   DB  196,193,8,87,219                    ; vxorps        %xmm11,%xmm14,%xmm3
-  DB  196,98,121,24,45,249,43,0,0         ; vbroadcastss  0x2bf9(%rip),%xmm13        # 7d2c <_sk_callback_avx+0x4ac>
+  DB  196,98,121,24,45,1,44,0,0           ; vbroadcastss  0x2c01(%rip),%xmm13        # 7d68 <_sk_callback_avx+0x4b4>
   DB  197,145,102,219                     ; vpcmpgtd      %xmm3,%xmm13,%xmm3
   DB  196,65,120,87,211                   ; vxorps        %xmm11,%xmm0,%xmm10
   DB  196,65,17,102,210                   ; vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -11047,7 +11084,7 @@
   DB  196,227,125,24,195,1                ; vinsertf128   $0x1,%xmm3,%ymm0,%ymm0
   DB  197,252,86,193                      ; vorps         %ymm1,%ymm0,%ymm0
   DB  196,227,125,25,193,1                ; vextractf128  $0x1,%ymm0,%xmm1
-  DB  196,226,121,24,29,175,43,0,0        ; vbroadcastss  0x2baf(%rip),%xmm3        # 7d30 <_sk_callback_avx+0x4b0>
+  DB  196,226,121,24,29,183,43,0,0        ; vbroadcastss  0x2bb7(%rip),%xmm3        # 7d6c <_sk_callback_avx+0x4b8>
   DB  197,241,254,203                     ; vpaddd        %xmm3,%xmm1,%xmm1
   DB  197,249,254,195                     ; vpaddd        %xmm3,%xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
@@ -11140,29 +11177,29 @@
   DB  197,123,16,4,208                    ; vmovsd        (%rax,%rdx,8),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,79                              ; je            53a2 <_sk_load_f16_avx+0x31a>
+  DB  116,79                              ; je            53d6 <_sk_load_f16_avx+0x31a>
   DB  197,57,22,68,208,8                  ; vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,67                              ; jb            53a2 <_sk_load_f16_avx+0x31a>
+  DB  114,67                              ; jb            53d6 <_sk_load_f16_avx+0x31a>
   DB  197,251,16,84,208,16                ; vmovsd        0x10(%rax,%rdx,8),%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,68                              ; je            53af <_sk_load_f16_avx+0x327>
+  DB  116,68                              ; je            53e3 <_sk_load_f16_avx+0x327>
   DB  197,233,22,84,208,24                ; vmovhpd       0x18(%rax,%rdx,8),%xmm2,%xmm2
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,56                              ; jb            53af <_sk_load_f16_avx+0x327>
+  DB  114,56                              ; jb            53e3 <_sk_load_f16_avx+0x327>
   DB  197,251,16,76,208,32                ; vmovsd        0x20(%rax,%rdx,8),%xmm1
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,68,253,255,255               ; je            50cb <_sk_load_f16_avx+0x43>
+  DB  15,132,68,253,255,255               ; je            50ff <_sk_load_f16_avx+0x43>
   DB  197,241,22,76,208,40                ; vmovhpd       0x28(%rax,%rdx,8),%xmm1,%xmm1
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,52,253,255,255               ; jb            50cb <_sk_load_f16_avx+0x43>
+  DB  15,130,52,253,255,255               ; jb            50ff <_sk_load_f16_avx+0x43>
   DB  197,122,126,76,208,48               ; vmovq         0x30(%rax,%rdx,8),%xmm9
-  DB  233,41,253,255,255                  ; jmpq          50cb <_sk_load_f16_avx+0x43>
+  DB  233,41,253,255,255                  ; jmpq          50ff <_sk_load_f16_avx+0x43>
   DB  197,241,87,201                      ; vxorpd        %xmm1,%xmm1,%xmm1
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,28,253,255,255                  ; jmpq          50cb <_sk_load_f16_avx+0x43>
+  DB  233,28,253,255,255                  ; jmpq          50ff <_sk_load_f16_avx+0x43>
   DB  197,241,87,201                      ; vxorpd        %xmm1,%xmm1,%xmm1
-  DB  233,19,253,255,255                  ; jmpq          50cb <_sk_load_f16_avx+0x43>
+  DB  233,19,253,255,255                  ; jmpq          50ff <_sk_load_f16_avx+0x43>
 
 PUBLIC _sk_load_f16_dst_avx
 _sk_load_f16_dst_avx LABEL PROC
@@ -11174,7 +11211,7 @@
   DB  197,252,17,84,36,64                 ; vmovups       %ymm2,0x40(%rsp)
   DB  197,252,17,76,36,32                 ; vmovups       %ymm1,0x20(%rsp)
   DB  197,254,127,4,36                    ; vmovdqu       %ymm0,(%rsp)
-  DB  15,133,143,2,0,0                    ; jne           5673 <_sk_load_f16_dst_avx+0x2bb>
+  DB  15,133,143,2,0,0                    ; jne           56a7 <_sk_load_f16_dst_avx+0x2bb>
   DB  197,121,16,4,208                    ; vmovupd       (%rax,%rdx,8),%xmm8
   DB  197,249,16,116,208,16               ; vmovupd       0x10(%rax,%rdx,8),%xmm6
   DB  197,249,16,108,208,32               ; vmovupd       0x20(%rax,%rdx,8),%xmm5
@@ -11192,13 +11229,13 @@
   DB  197,217,105,232                     ; vpunpckhwd    %xmm0,%xmm4,%xmm5
   DB  196,226,121,51,228                  ; vpmovzxwd     %xmm4,%xmm4
   DB  196,227,93,24,229,1                 ; vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
-  DB  196,98,125,24,37,247,40,0,0         ; vbroadcastss  0x28f7(%rip),%ymm12        # 7d34 <_sk_callback_avx+0x4b4>
+  DB  196,98,125,24,37,255,40,0,0         ; vbroadcastss  0x28ff(%rip),%ymm12        # 7d70 <_sk_callback_avx+0x4bc>
   DB  196,193,92,84,236                   ; vandps        %ymm12,%ymm4,%ymm5
   DB  197,220,87,229                      ; vxorps        %ymm5,%ymm4,%ymm4
   DB  196,195,125,25,230,1                ; vextractf128  $0x1,%ymm4,%xmm14
-  DB  196,98,121,24,29,227,40,0,0         ; vbroadcastss  0x28e3(%rip),%xmm11        # 7d38 <_sk_callback_avx+0x4b8>
+  DB  196,98,121,24,29,235,40,0,0         ; vbroadcastss  0x28eb(%rip),%xmm11        # 7d74 <_sk_callback_avx+0x4c0>
   DB  196,193,8,87,251                    ; vxorps        %xmm11,%xmm14,%xmm7
-  DB  196,98,121,24,45,217,40,0,0         ; vbroadcastss  0x28d9(%rip),%xmm13        # 7d3c <_sk_callback_avx+0x4bc>
+  DB  196,98,121,24,45,225,40,0,0         ; vbroadcastss  0x28e1(%rip),%xmm13        # 7d78 <_sk_callback_avx+0x4c4>
   DB  197,145,102,255                     ; vpcmpgtd      %xmm7,%xmm13,%xmm7
   DB  196,65,88,87,211                    ; vxorps        %xmm11,%xmm4,%xmm10
   DB  196,65,17,102,210                   ; vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -11212,7 +11249,7 @@
   DB  196,227,93,24,231,1                 ; vinsertf128   $0x1,%xmm7,%ymm4,%ymm4
   DB  197,220,86,229                      ; vorps         %ymm5,%ymm4,%ymm4
   DB  196,227,125,25,229,1                ; vextractf128  $0x1,%ymm4,%xmm5
-  DB  196,226,121,24,61,143,40,0,0        ; vbroadcastss  0x288f(%rip),%xmm7        # 7d40 <_sk_callback_avx+0x4c0>
+  DB  196,226,121,24,61,151,40,0,0        ; vbroadcastss  0x2897(%rip),%xmm7        # 7d7c <_sk_callback_avx+0x4c8>
   DB  197,209,254,239                     ; vpaddd        %xmm7,%xmm5,%xmm5
   DB  197,217,254,231                     ; vpaddd        %xmm7,%xmm4,%xmm4
   DB  196,227,93,24,229,1                 ; vinsertf128   $0x1,%xmm5,%ymm4,%ymm4
@@ -11305,29 +11342,29 @@
   DB  197,123,16,4,208                    ; vmovsd        (%rax,%rdx,8),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,79                              ; je            56d2 <_sk_load_f16_dst_avx+0x31a>
+  DB  116,79                              ; je            5706 <_sk_load_f16_dst_avx+0x31a>
   DB  197,57,22,68,208,8                  ; vmovhpd       0x8(%rax,%rdx,8),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,67                              ; jb            56d2 <_sk_load_f16_dst_avx+0x31a>
+  DB  114,67                              ; jb            5706 <_sk_load_f16_dst_avx+0x31a>
   DB  197,251,16,116,208,16               ; vmovsd        0x10(%rax,%rdx,8),%xmm6
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,68                              ; je            56df <_sk_load_f16_dst_avx+0x327>
+  DB  116,68                              ; je            5713 <_sk_load_f16_dst_avx+0x327>
   DB  197,201,22,116,208,24               ; vmovhpd       0x18(%rax,%rdx,8),%xmm6,%xmm6
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,56                              ; jb            56df <_sk_load_f16_dst_avx+0x327>
+  DB  114,56                              ; jb            5713 <_sk_load_f16_dst_avx+0x327>
   DB  197,251,16,108,208,32               ; vmovsd        0x20(%rax,%rdx,8),%xmm5
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,68,253,255,255               ; je            53fb <_sk_load_f16_dst_avx+0x43>
+  DB  15,132,68,253,255,255               ; je            542f <_sk_load_f16_dst_avx+0x43>
   DB  197,209,22,108,208,40               ; vmovhpd       0x28(%rax,%rdx,8),%xmm5,%xmm5
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,52,253,255,255               ; jb            53fb <_sk_load_f16_dst_avx+0x43>
+  DB  15,130,52,253,255,255               ; jb            542f <_sk_load_f16_dst_avx+0x43>
   DB  197,122,126,76,208,48               ; vmovq         0x30(%rax,%rdx,8),%xmm9
-  DB  233,41,253,255,255                  ; jmpq          53fb <_sk_load_f16_dst_avx+0x43>
+  DB  233,41,253,255,255                  ; jmpq          542f <_sk_load_f16_dst_avx+0x43>
   DB  197,209,87,237                      ; vxorpd        %xmm5,%xmm5,%xmm5
   DB  197,201,87,246                      ; vxorpd        %xmm6,%xmm6,%xmm6
-  DB  233,28,253,255,255                  ; jmpq          53fb <_sk_load_f16_dst_avx+0x43>
+  DB  233,28,253,255,255                  ; jmpq          542f <_sk_load_f16_dst_avx+0x43>
   DB  197,209,87,237                      ; vxorpd        %xmm5,%xmm5,%xmm5
-  DB  233,19,253,255,255                  ; jmpq          53fb <_sk_load_f16_dst_avx+0x43>
+  DB  233,19,253,255,255                  ; jmpq          542f <_sk_load_f16_dst_avx+0x43>
 
 PUBLIC _sk_gather_f16_avx
 _sk_gather_f16_avx LABEL PROC
@@ -11386,13 +11423,13 @@
   DB  197,249,105,201                     ; vpunpckhwd    %xmm1,%xmm0,%xmm1
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
-  DB  196,98,125,24,37,80,37,0,0          ; vbroadcastss  0x2550(%rip),%ymm12        # 7d44 <_sk_callback_avx+0x4c4>
+  DB  196,98,125,24,37,88,37,0,0          ; vbroadcastss  0x2558(%rip),%ymm12        # 7d80 <_sk_callback_avx+0x4cc>
   DB  196,193,124,84,204                  ; vandps        %ymm12,%ymm0,%ymm1
   DB  197,252,87,193                      ; vxorps        %ymm1,%ymm0,%ymm0
   DB  196,195,125,25,198,1                ; vextractf128  $0x1,%ymm0,%xmm14
-  DB  196,98,121,24,29,60,37,0,0          ; vbroadcastss  0x253c(%rip),%xmm11        # 7d48 <_sk_callback_avx+0x4c8>
+  DB  196,98,121,24,29,68,37,0,0          ; vbroadcastss  0x2544(%rip),%xmm11        # 7d84 <_sk_callback_avx+0x4d0>
   DB  196,193,8,87,219                    ; vxorps        %xmm11,%xmm14,%xmm3
-  DB  196,98,121,24,45,50,37,0,0          ; vbroadcastss  0x2532(%rip),%xmm13        # 7d4c <_sk_callback_avx+0x4cc>
+  DB  196,98,121,24,45,58,37,0,0          ; vbroadcastss  0x253a(%rip),%xmm13        # 7d88 <_sk_callback_avx+0x4d4>
   DB  197,145,102,219                     ; vpcmpgtd      %xmm3,%xmm13,%xmm3
   DB  196,65,120,87,211                   ; vxorps        %xmm11,%xmm0,%xmm10
   DB  196,65,17,102,210                   ; vpcmpgtd      %xmm10,%xmm13,%xmm10
@@ -11406,7 +11443,7 @@
   DB  196,227,125,24,195,1                ; vinsertf128   $0x1,%xmm3,%ymm0,%ymm0
   DB  197,252,86,193                      ; vorps         %ymm1,%ymm0,%ymm0
   DB  196,227,125,25,193,1                ; vextractf128  $0x1,%ymm0,%xmm1
-  DB  196,226,121,24,29,232,36,0,0        ; vbroadcastss  0x24e8(%rip),%xmm3        # 7d50 <_sk_callback_avx+0x4d0>
+  DB  196,226,121,24,29,240,36,0,0        ; vbroadcastss  0x24f0(%rip),%xmm3        # 7d8c <_sk_callback_avx+0x4d8>
   DB  197,241,254,203                     ; vpaddd        %xmm3,%xmm1,%xmm1
   DB  197,249,254,195                     ; vpaddd        %xmm3,%xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
@@ -11504,12 +11541,12 @@
   DB  197,252,17,180,36,128,0,0,0         ; vmovups       %ymm6,0x80(%rsp)
   DB  197,252,17,108,36,96                ; vmovups       %ymm5,0x60(%rsp)
   DB  197,252,17,100,36,64                ; vmovups       %ymm4,0x40(%rsp)
-  DB  196,98,125,24,13,252,34,0,0         ; vbroadcastss  0x22fc(%rip),%ymm9        # 7d54 <_sk_callback_avx+0x4d4>
+  DB  196,98,125,24,13,4,35,0,0           ; vbroadcastss  0x2304(%rip),%ymm9        # 7d90 <_sk_callback_avx+0x4dc>
   DB  196,65,124,84,209                   ; vandps        %ymm9,%ymm0,%ymm10
   DB  197,252,17,4,36                     ; vmovups       %ymm0,(%rsp)
   DB  196,65,124,87,218                   ; vxorps        %ymm10,%ymm0,%ymm11
   DB  196,67,125,25,220,1                 ; vextractf128  $0x1,%ymm11,%xmm12
-  DB  196,98,121,24,5,226,34,0,0          ; vbroadcastss  0x22e2(%rip),%xmm8        # 7d58 <_sk_callback_avx+0x4d8>
+  DB  196,98,121,24,5,234,34,0,0          ; vbroadcastss  0x22ea(%rip),%xmm8        # 7d94 <_sk_callback_avx+0x4e0>
   DB  196,65,57,102,236                   ; vpcmpgtd      %xmm12,%xmm8,%xmm13
   DB  196,65,57,102,243                   ; vpcmpgtd      %xmm11,%xmm8,%xmm14
   DB  196,67,13,24,237,1                  ; vinsertf128   $0x1,%xmm13,%ymm14,%ymm13
@@ -11519,7 +11556,7 @@
   DB  196,67,13,24,242,1                  ; vinsertf128   $0x1,%xmm10,%ymm14,%ymm14
   DB  196,193,33,114,211,13               ; vpsrld        $0xd,%xmm11,%xmm11
   DB  196,193,25,114,212,13               ; vpsrld        $0xd,%xmm12,%xmm12
-  DB  196,98,125,24,21,169,34,0,0         ; vbroadcastss  0x22a9(%rip),%ymm10        # 7d5c <_sk_callback_avx+0x4dc>
+  DB  196,98,125,24,21,177,34,0,0         ; vbroadcastss  0x22b1(%rip),%ymm10        # 7d98 <_sk_callback_avx+0x4e4>
   DB  196,65,12,86,242                    ; vorps         %ymm10,%ymm14,%ymm14
   DB  196,67,125,25,247,1                 ; vextractf128  $0x1,%ymm14,%xmm15
   DB  196,65,1,254,228                    ; vpaddd        %xmm12,%xmm15,%xmm12
@@ -11601,7 +11638,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,75                              ; jne           5c9a <_sk_store_f16_avx+0x270>
+  DB  117,75                              ; jne           5cce <_sk_store_f16_avx+0x270>
   DB  197,120,17,28,208                   ; vmovups       %xmm11,(%rax,%rdx,8)
   DB  197,120,17,84,208,16                ; vmovups       %xmm10,0x10(%rax,%rdx,8)
   DB  197,120,17,76,208,32                ; vmovups       %xmm9,0x20(%rax,%rdx,8)
@@ -11617,22 +11654,22 @@
   DB  255,224                             ; jmpq          *%rax
   DB  197,121,214,28,208                  ; vmovq         %xmm11,(%rax,%rdx,8)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,193                             ; je            5c66 <_sk_store_f16_avx+0x23c>
+  DB  116,193                             ; je            5c9a <_sk_store_f16_avx+0x23c>
   DB  197,121,23,92,208,8                 ; vmovhpd       %xmm11,0x8(%rax,%rdx,8)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,181                             ; jb            5c66 <_sk_store_f16_avx+0x23c>
+  DB  114,181                             ; jb            5c9a <_sk_store_f16_avx+0x23c>
   DB  197,121,214,84,208,16               ; vmovq         %xmm10,0x10(%rax,%rdx,8)
-  DB  116,173                             ; je            5c66 <_sk_store_f16_avx+0x23c>
+  DB  116,173                             ; je            5c9a <_sk_store_f16_avx+0x23c>
   DB  197,121,23,84,208,24                ; vmovhpd       %xmm10,0x18(%rax,%rdx,8)
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,161                             ; jb            5c66 <_sk_store_f16_avx+0x23c>
+  DB  114,161                             ; jb            5c9a <_sk_store_f16_avx+0x23c>
   DB  197,121,214,76,208,32               ; vmovq         %xmm9,0x20(%rax,%rdx,8)
-  DB  116,153                             ; je            5c66 <_sk_store_f16_avx+0x23c>
+  DB  116,153                             ; je            5c9a <_sk_store_f16_avx+0x23c>
   DB  197,121,23,76,208,40                ; vmovhpd       %xmm9,0x28(%rax,%rdx,8)
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,141                             ; jb            5c66 <_sk_store_f16_avx+0x23c>
+  DB  114,141                             ; jb            5c9a <_sk_store_f16_avx+0x23c>
   DB  197,121,214,68,208,48               ; vmovq         %xmm8,0x30(%rax,%rdx,8)
-  DB  235,133                             ; jmp           5c66 <_sk_store_f16_avx+0x23c>
+  DB  235,133                             ; jmp           5c9a <_sk_store_f16_avx+0x23c>
 
 PUBLIC _sk_load_u16_be_avx
 _sk_load_u16_be_avx LABEL PROC
@@ -11640,7 +11677,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,253,0,0,0                    ; jne           5df4 <_sk_load_u16_be_avx+0x113>
+  DB  15,133,253,0,0,0                    ; jne           5e28 <_sk_load_u16_be_avx+0x113>
   DB  196,65,121,16,4,65                  ; vmovupd       (%r9,%rax,2),%xmm8
   DB  196,193,121,16,84,65,16             ; vmovupd       0x10(%r9,%rax,2),%xmm2
   DB  196,193,121,16,92,65,32             ; vmovupd       0x20(%r9,%rax,2),%xmm3
@@ -11662,7 +11699,7 @@
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,29,248,31,0,0         ; vbroadcastss  0x1ff8(%rip),%ymm11        # 7d60 <_sk_callback_avx+0x4e0>
+  DB  196,98,125,24,29,0,32,0,0           ; vbroadcastss  0x2000(%rip),%ymm11        # 7d9c <_sk_callback_avx+0x4e8>
   DB  196,193,124,89,195                  ; vmulps        %ymm11,%ymm0,%ymm0
   DB  197,177,109,202                     ; vpunpckhqdq   %xmm2,%xmm9,%xmm1
   DB  197,233,113,241,8                   ; vpsllw        $0x8,%xmm1,%xmm2
@@ -11696,29 +11733,29 @@
   DB  196,65,123,16,4,65                  ; vmovsd        (%r9,%rax,2),%xmm8
   DB  196,65,49,239,201                   ; vpxor         %xmm9,%xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,85                              ; je            5e5a <_sk_load_u16_be_avx+0x179>
+  DB  116,85                              ; je            5e8e <_sk_load_u16_be_avx+0x179>
   DB  196,65,57,22,68,65,8                ; vmovhpd       0x8(%r9,%rax,2),%xmm8,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,72                              ; jb            5e5a <_sk_load_u16_be_avx+0x179>
+  DB  114,72                              ; jb            5e8e <_sk_load_u16_be_avx+0x179>
   DB  196,193,123,16,84,65,16             ; vmovsd        0x10(%r9,%rax,2),%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  116,72                              ; je            5e67 <_sk_load_u16_be_avx+0x186>
+  DB  116,72                              ; je            5e9b <_sk_load_u16_be_avx+0x186>
   DB  196,193,105,22,84,65,24             ; vmovhpd       0x18(%r9,%rax,2),%xmm2,%xmm2
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,59                              ; jb            5e67 <_sk_load_u16_be_avx+0x186>
+  DB  114,59                              ; jb            5e9b <_sk_load_u16_be_avx+0x186>
   DB  196,193,123,16,92,65,32             ; vmovsd        0x20(%r9,%rax,2),%xmm3
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  15,132,213,254,255,255              ; je            5d12 <_sk_load_u16_be_avx+0x31>
+  DB  15,132,213,254,255,255              ; je            5d46 <_sk_load_u16_be_avx+0x31>
   DB  196,193,97,22,92,65,40              ; vmovhpd       0x28(%r9,%rax,2),%xmm3,%xmm3
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  15,130,196,254,255,255              ; jb            5d12 <_sk_load_u16_be_avx+0x31>
+  DB  15,130,196,254,255,255              ; jb            5d46 <_sk_load_u16_be_avx+0x31>
   DB  196,65,122,126,76,65,48             ; vmovq         0x30(%r9,%rax,2),%xmm9
-  DB  233,184,254,255,255                 ; jmpq          5d12 <_sk_load_u16_be_avx+0x31>
+  DB  233,184,254,255,255                 ; jmpq          5d46 <_sk_load_u16_be_avx+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
   DB  197,233,87,210                      ; vxorpd        %xmm2,%xmm2,%xmm2
-  DB  233,171,254,255,255                 ; jmpq          5d12 <_sk_load_u16_be_avx+0x31>
+  DB  233,171,254,255,255                 ; jmpq          5d46 <_sk_load_u16_be_avx+0x31>
   DB  197,225,87,219                      ; vxorpd        %xmm3,%xmm3,%xmm3
-  DB  233,162,254,255,255                 ; jmpq          5d12 <_sk_load_u16_be_avx+0x31>
+  DB  233,162,254,255,255                 ; jmpq          5d46 <_sk_load_u16_be_avx+0x31>
 
 PUBLIC _sk_load_rgb_u16_be_avx
 _sk_load_rgb_u16_be_avx LABEL PROC
@@ -11726,7 +11763,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,82                         ; lea           (%rdx,%rdx,2),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,243,0,0,0                    ; jne           5f75 <_sk_load_rgb_u16_be_avx+0x105>
+  DB  15,133,243,0,0,0                    ; jne           5fa9 <_sk_load_rgb_u16_be_avx+0x105>
   DB  196,193,122,111,4,65                ; vmovdqu       (%r9,%rax,2),%xmm0
   DB  196,193,122,111,84,65,12            ; vmovdqu       0xc(%r9,%rax,2),%xmm2
   DB  196,193,122,111,76,65,24            ; vmovdqu       0x18(%r9,%rax,2),%xmm1
@@ -11753,7 +11790,7 @@
   DB  196,226,121,51,192                  ; vpmovzxwd     %xmm0,%xmm0
   DB  196,227,125,24,193,1                ; vinsertf128   $0x1,%xmm1,%ymm0,%ymm0
   DB  197,252,91,192                      ; vcvtdq2ps     %ymm0,%ymm0
-  DB  196,98,125,24,29,88,30,0,0          ; vbroadcastss  0x1e58(%rip),%ymm11        # 7d64 <_sk_callback_avx+0x4e4>
+  DB  196,98,125,24,29,96,30,0,0          ; vbroadcastss  0x1e60(%rip),%ymm11        # 7da0 <_sk_callback_avx+0x4ec>
   DB  196,193,124,89,195                  ; vmulps        %ymm11,%ymm0,%ymm0
   DB  197,185,109,202                     ; vpunpckhqdq   %xmm2,%xmm8,%xmm1
   DB  197,233,113,241,8                   ; vpsllw        $0x8,%xmm1,%xmm2
@@ -11774,48 +11811,48 @@
   DB  197,252,91,210                      ; vcvtdq2ps     %ymm2,%ymm2
   DB  196,193,108,89,211                  ; vmulps        %ymm11,%ymm2,%ymm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,29,245,29,0,0        ; vbroadcastss  0x1df5(%rip),%ymm3        # 7d68 <_sk_callback_avx+0x4e8>
+  DB  196,226,125,24,29,253,29,0,0        ; vbroadcastss  0x1dfd(%rip),%ymm3        # 7da4 <_sk_callback_avx+0x4f0>
   DB  255,224                             ; jmpq          *%rax
   DB  196,193,121,110,4,65                ; vmovd         (%r9,%rax,2),%xmm0
   DB  196,193,121,196,68,65,4,2           ; vpinsrw       $0x2,0x4(%r9,%rax,2),%xmm0,%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,5                               ; jne           5f8e <_sk_load_rgb_u16_be_avx+0x11e>
-  DB  233,40,255,255,255                  ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  117,5                               ; jne           5fc2 <_sk_load_rgb_u16_be_avx+0x11e>
+  DB  233,40,255,255,255                  ; jmpq          5eea <_sk_load_rgb_u16_be_avx+0x46>
   DB  196,193,121,110,76,65,6             ; vmovd         0x6(%r9,%rax,2),%xmm1
   DB  196,65,113,196,68,65,10,2           ; vpinsrw       $0x2,0xa(%r9,%rax,2),%xmm1,%xmm8
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,26                              ; jb            5fbd <_sk_load_rgb_u16_be_avx+0x14d>
+  DB  114,26                              ; jb            5ff1 <_sk_load_rgb_u16_be_avx+0x14d>
   DB  196,193,121,110,76,65,12            ; vmovd         0xc(%r9,%rax,2),%xmm1
   DB  196,193,113,196,84,65,16,2          ; vpinsrw       $0x2,0x10(%r9,%rax,2),%xmm1,%xmm2
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  117,10                              ; jne           5fc2 <_sk_load_rgb_u16_be_avx+0x152>
-  DB  233,249,254,255,255                 ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
-  DB  233,244,254,255,255                 ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  117,10                              ; jne           5ff6 <_sk_load_rgb_u16_be_avx+0x152>
+  DB  233,249,254,255,255                 ; jmpq          5eea <_sk_load_rgb_u16_be_avx+0x46>
+  DB  233,244,254,255,255                 ; jmpq          5eea <_sk_load_rgb_u16_be_avx+0x46>
   DB  196,193,121,110,76,65,18            ; vmovd         0x12(%r9,%rax,2),%xmm1
   DB  196,65,113,196,76,65,22,2           ; vpinsrw       $0x2,0x16(%r9,%rax,2),%xmm1,%xmm9
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,26                              ; jb            5ff1 <_sk_load_rgb_u16_be_avx+0x181>
+  DB  114,26                              ; jb            6025 <_sk_load_rgb_u16_be_avx+0x181>
   DB  196,193,121,110,76,65,24            ; vmovd         0x18(%r9,%rax,2),%xmm1
   DB  196,193,113,196,76,65,28,2          ; vpinsrw       $0x2,0x1c(%r9,%rax,2),%xmm1,%xmm1
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  117,10                              ; jne           5ff6 <_sk_load_rgb_u16_be_avx+0x186>
-  DB  233,197,254,255,255                 ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
-  DB  233,192,254,255,255                 ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  117,10                              ; jne           602a <_sk_load_rgb_u16_be_avx+0x186>
+  DB  233,197,254,255,255                 ; jmpq          5eea <_sk_load_rgb_u16_be_avx+0x46>
+  DB  233,192,254,255,255                 ; jmpq          5eea <_sk_load_rgb_u16_be_avx+0x46>
   DB  196,193,121,110,92,65,30            ; vmovd         0x1e(%r9,%rax,2),%xmm3
   DB  196,65,97,196,92,65,34,2            ; vpinsrw       $0x2,0x22(%r9,%rax,2),%xmm3,%xmm11
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,20                              ; jb            601f <_sk_load_rgb_u16_be_avx+0x1af>
+  DB  114,20                              ; jb            6053 <_sk_load_rgb_u16_be_avx+0x1af>
   DB  196,193,121,110,92,65,36            ; vmovd         0x24(%r9,%rax,2),%xmm3
   DB  196,193,97,196,92,65,40,2           ; vpinsrw       $0x2,0x28(%r9,%rax,2),%xmm3,%xmm3
-  DB  233,151,254,255,255                 ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
-  DB  233,146,254,255,255                 ; jmpq          5eb6 <_sk_load_rgb_u16_be_avx+0x46>
+  DB  233,151,254,255,255                 ; jmpq          5eea <_sk_load_rgb_u16_be_avx+0x46>
+  DB  233,146,254,255,255                 ; jmpq          5eea <_sk_load_rgb_u16_be_avx+0x46>
 
 PUBLIC _sk_store_u16_be_avx
 _sk_store_u16_be_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
-  DB  196,98,125,24,5,50,29,0,0           ; vbroadcastss  0x1d32(%rip),%ymm8        # 7d6c <_sk_callback_avx+0x4ec>
+  DB  196,98,125,24,5,58,29,0,0           ; vbroadcastss  0x1d3a(%rip),%ymm8        # 7da8 <_sk_callback_avx+0x4f4>
   DB  196,65,124,89,200                   ; vmulps        %ymm8,%ymm0,%ymm9
   DB  196,65,125,91,201                   ; vcvtps2dq     %ymm9,%ymm9
   DB  196,67,125,25,202,1                 ; vextractf128  $0x1,%ymm9,%xmm10
@@ -11853,7 +11890,7 @@
   DB  196,65,17,98,200                    ; vpunpckldq    %xmm8,%xmm13,%xmm9
   DB  196,65,17,106,192                   ; vpunpckhdq    %xmm8,%xmm13,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,31                              ; jne           611e <_sk_store_u16_be_avx+0xfa>
+  DB  117,31                              ; jne           6152 <_sk_store_u16_be_avx+0xfa>
   DB  196,65,120,17,28,65                 ; vmovups       %xmm11,(%r9,%rax,2)
   DB  196,65,120,17,84,65,16              ; vmovups       %xmm10,0x10(%r9,%rax,2)
   DB  196,65,120,17,76,65,32              ; vmovups       %xmm9,0x20(%r9,%rax,2)
@@ -11862,31 +11899,31 @@
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,214,28,65                ; vmovq         %xmm11,(%r9,%rax,2)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            611a <_sk_store_u16_be_avx+0xf6>
+  DB  116,240                             ; je            614e <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,23,92,65,8               ; vmovhpd       %xmm11,0x8(%r9,%rax,2)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            611a <_sk_store_u16_be_avx+0xf6>
+  DB  114,227                             ; jb            614e <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,214,84,65,16             ; vmovq         %xmm10,0x10(%r9,%rax,2)
-  DB  116,218                             ; je            611a <_sk_store_u16_be_avx+0xf6>
+  DB  116,218                             ; je            614e <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,23,84,65,24              ; vmovhpd       %xmm10,0x18(%r9,%rax,2)
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,205                             ; jb            611a <_sk_store_u16_be_avx+0xf6>
+  DB  114,205                             ; jb            614e <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,214,76,65,32             ; vmovq         %xmm9,0x20(%r9,%rax,2)
-  DB  116,196                             ; je            611a <_sk_store_u16_be_avx+0xf6>
+  DB  116,196                             ; je            614e <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,23,76,65,40              ; vmovhpd       %xmm9,0x28(%r9,%rax,2)
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,183                             ; jb            611a <_sk_store_u16_be_avx+0xf6>
+  DB  114,183                             ; jb            614e <_sk_store_u16_be_avx+0xf6>
   DB  196,65,121,214,68,65,48             ; vmovq         %xmm8,0x30(%r9,%rax,2)
-  DB  235,174                             ; jmp           611a <_sk_store_u16_be_avx+0xf6>
+  DB  235,174                             ; jmp           614e <_sk_store_u16_be_avx+0xf6>
 
 PUBLIC _sk_load_f32_avx
 _sk_load_f32_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  119,110                             ; ja            61e2 <_sk_load_f32_avx+0x76>
+  DB  119,110                             ; ja            6216 <_sk_load_f32_avx+0x76>
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
-  DB  76,141,29,134,0,0,0                 ; lea           0x86(%rip),%r11        # 620c <_sk_load_f32_avx+0xa0>
+  DB  76,141,29,134,0,0,0                 ; lea           0x86(%rip),%r11        # 6240 <_sk_load_f32_avx+0xa0>
   DB  75,99,4,131                         ; movslq        (%r11,%r8,4),%rax
   DB  76,1,216                            ; add           %r11,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -11933,10 +11970,10 @@
 _sk_load_f32_dst_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  119,110                             ; ja            62a2 <_sk_load_f32_dst_avx+0x76>
+  DB  119,110                             ; ja            62d6 <_sk_load_f32_dst_avx+0x76>
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
-  DB  76,141,29,134,0,0,0                 ; lea           0x86(%rip),%r11        # 62cc <_sk_load_f32_dst_avx+0xa0>
+  DB  76,141,29,134,0,0,0                 ; lea           0x86(%rip),%r11        # 6300 <_sk_load_f32_dst_avx+0xa0>
   DB  75,99,4,131                         ; movslq        (%r11,%r8,4),%rax
   DB  76,1,216                            ; add           %r11,%rax
   DB  255,224                             ; jmpq          *%rax
@@ -11993,7 +12030,7 @@
   DB  196,65,37,20,196                    ; vunpcklpd     %ymm12,%ymm11,%ymm8
   DB  196,65,37,21,220                    ; vunpckhpd     %ymm12,%ymm11,%ymm11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,55                              ; jne           6359 <_sk_store_f32_avx+0x6d>
+  DB  117,55                              ; jne           638d <_sk_store_f32_avx+0x6d>
   DB  196,67,45,24,225,1                  ; vinsertf128   $0x1,%xmm9,%ymm10,%ymm12
   DB  196,67,61,24,235,1                  ; vinsertf128   $0x1,%xmm11,%ymm8,%ymm13
   DB  196,67,45,6,201,49                  ; vperm2f128    $0x31,%ymm9,%ymm10,%ymm9
@@ -12006,22 +12043,22 @@
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,17,20,129                ; vmovupd       %xmm10,(%r9,%rax,4)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            6355 <_sk_store_f32_avx+0x69>
+  DB  116,240                             ; je            6389 <_sk_store_f32_avx+0x69>
   DB  196,65,121,17,76,129,16             ; vmovupd       %xmm9,0x10(%r9,%rax,4)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            6355 <_sk_store_f32_avx+0x69>
+  DB  114,227                             ; jb            6389 <_sk_store_f32_avx+0x69>
   DB  196,65,121,17,68,129,32             ; vmovupd       %xmm8,0x20(%r9,%rax,4)
-  DB  116,218                             ; je            6355 <_sk_store_f32_avx+0x69>
+  DB  116,218                             ; je            6389 <_sk_store_f32_avx+0x69>
   DB  196,65,121,17,92,129,48             ; vmovupd       %xmm11,0x30(%r9,%rax,4)
   DB  73,131,248,5                        ; cmp           $0x5,%r8
-  DB  114,205                             ; jb            6355 <_sk_store_f32_avx+0x69>
+  DB  114,205                             ; jb            6389 <_sk_store_f32_avx+0x69>
   DB  196,67,125,25,84,129,64,1           ; vextractf128  $0x1,%ymm10,0x40(%r9,%rax,4)
-  DB  116,195                             ; je            6355 <_sk_store_f32_avx+0x69>
+  DB  116,195                             ; je            6389 <_sk_store_f32_avx+0x69>
   DB  196,67,125,25,76,129,80,1           ; vextractf128  $0x1,%ymm9,0x50(%r9,%rax,4)
   DB  73,131,248,7                        ; cmp           $0x7,%r8
-  DB  114,181                             ; jb            6355 <_sk_store_f32_avx+0x69>
+  DB  114,181                             ; jb            6389 <_sk_store_f32_avx+0x69>
   DB  196,67,125,25,68,129,96,1           ; vextractf128  $0x1,%ymm8,0x60(%r9,%rax,4)
-  DB  235,171                             ; jmp           6355 <_sk_store_f32_avx+0x69>
+  DB  235,171                             ; jmp           6389 <_sk_store_f32_avx+0x69>
 
 PUBLIC _sk_clamp_x_avx
 _sk_clamp_x_avx LABEL PROC
@@ -12100,7 +12137,7 @@
   DB  196,193,58,88,192                   ; vaddss        %xmm8,%xmm8,%xmm0
   DB  196,227,121,4,192,0                 ; vpermilps     $0x0,%xmm0,%xmm0
   DB  196,99,125,24,192,1                 ; vinsertf128   $0x1,%xmm0,%ymm0,%ymm8
-  DB  197,178,89,5,163,24,0,0             ; vmulss        0x18a3(%rip),%xmm9,%xmm0        # 7d70 <_sk_callback_avx+0x4f0>
+  DB  197,178,89,5,171,24,0,0             ; vmulss        0x18ab(%rip),%xmm9,%xmm0        # 7dac <_sk_callback_avx+0x4f8>
   DB  196,227,121,4,192,0                 ; vpermilps     $0x0,%xmm0,%xmm0
   DB  196,227,125,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   DB  197,164,89,192                      ; vmulps        %ymm0,%ymm11,%ymm0
@@ -12131,7 +12168,7 @@
   DB  196,193,58,88,200                   ; vaddss        %xmm8,%xmm8,%xmm1
   DB  196,227,121,4,201,0                 ; vpermilps     $0x0,%xmm1,%xmm1
   DB  196,99,117,24,193,1                 ; vinsertf128   $0x1,%xmm1,%ymm1,%ymm8
-  DB  197,178,89,13,30,24,0,0             ; vmulss        0x181e(%rip),%xmm9,%xmm1        # 7d74 <_sk_callback_avx+0x4f4>
+  DB  197,178,89,13,38,24,0,0             ; vmulss        0x1826(%rip),%xmm9,%xmm1        # 7db0 <_sk_callback_avx+0x4fc>
   DB  196,227,121,4,201,0                 ; vpermilps     $0x0,%xmm1,%xmm1
   DB  196,227,117,24,201,1                ; vinsertf128   $0x1,%xmm1,%ymm1,%ymm1
   DB  197,164,89,201                      ; vmulps        %ymm1,%ymm11,%ymm1
@@ -12155,7 +12192,7 @@
 _sk_clamp_x_1_avx LABEL PROC
   DB  196,65,60,87,192                    ; vxorps        %ymm8,%ymm8,%ymm8
   DB  197,188,95,192                      ; vmaxps        %ymm0,%ymm8,%ymm0
-  DB  196,98,125,24,5,188,23,0,0          ; vbroadcastss  0x17bc(%rip),%ymm8        # 7d78 <_sk_callback_avx+0x4f8>
+  DB  196,98,125,24,5,196,23,0,0          ; vbroadcastss  0x17c4(%rip),%ymm8        # 7db4 <_sk_callback_avx+0x500>
   DB  196,193,124,93,192                  ; vminps        %ymm8,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -12169,9 +12206,9 @@
 
 PUBLIC _sk_mirror_x_1_avx
 _sk_mirror_x_1_avx LABEL PROC
-  DB  196,98,125,24,5,159,23,0,0          ; vbroadcastss  0x179f(%rip),%ymm8        # 7d7c <_sk_callback_avx+0x4fc>
+  DB  196,98,125,24,5,167,23,0,0          ; vbroadcastss  0x17a7(%rip),%ymm8        # 7db8 <_sk_callback_avx+0x504>
   DB  196,193,124,88,192                  ; vaddps        %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,13,149,23,0,0         ; vbroadcastss  0x1795(%rip),%ymm9        # 7d80 <_sk_callback_avx+0x500>
+  DB  196,98,125,24,13,157,23,0,0         ; vbroadcastss  0x179d(%rip),%ymm9        # 7dbc <_sk_callback_avx+0x508>
   DB  196,65,124,89,201                   ; vmulps        %ymm9,%ymm0,%ymm9
   DB  196,67,125,8,201,1                  ; vroundps      $0x1,%ymm9,%ymm9
   DB  196,65,52,88,201                    ; vaddps        %ymm9,%ymm9,%ymm9
@@ -12185,12 +12222,12 @@
 
 PUBLIC _sk_luminance_to_alpha_avx
 _sk_luminance_to_alpha_avx LABEL PROC
-  DB  196,226,125,24,29,101,23,0,0        ; vbroadcastss  0x1765(%rip),%ymm3        # 7d84 <_sk_callback_avx+0x504>
+  DB  196,226,125,24,29,109,23,0,0        ; vbroadcastss  0x176d(%rip),%ymm3        # 7dc0 <_sk_callback_avx+0x50c>
   DB  197,252,89,195                      ; vmulps        %ymm3,%ymm0,%ymm0
-  DB  196,226,125,24,29,92,23,0,0         ; vbroadcastss  0x175c(%rip),%ymm3        # 7d88 <_sk_callback_avx+0x508>
+  DB  196,226,125,24,29,100,23,0,0        ; vbroadcastss  0x1764(%rip),%ymm3        # 7dc4 <_sk_callback_avx+0x510>
   DB  197,244,89,203                      ; vmulps        %ymm3,%ymm1,%ymm1
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
-  DB  196,226,125,24,13,79,23,0,0         ; vbroadcastss  0x174f(%rip),%ymm1        # 7d8c <_sk_callback_avx+0x50c>
+  DB  196,226,125,24,13,87,23,0,0         ; vbroadcastss  0x1757(%rip),%ymm1        # 7dc8 <_sk_callback_avx+0x514>
   DB  197,236,89,201                      ; vmulps        %ymm1,%ymm2,%ymm1
   DB  197,252,88,217                      ; vaddps        %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -12423,9 +12460,9 @@
   DB  72,139,24                           ; mov           (%rax),%rbx
   DB  72,139,104,8                        ; mov           0x8(%rax),%rbp
   DB  72,255,203                          ; dec           %rbx
-  DB  120,7                               ; js            69e4 <_sk_evenly_spaced_gradient_avx+0x28>
+  DB  120,7                               ; js            6a18 <_sk_evenly_spaced_gradient_avx+0x28>
   DB  196,225,242,42,203                  ; vcvtsi2ss     %rbx,%xmm1,%xmm1
-  DB  235,21                              ; jmp           69f9 <_sk_evenly_spaced_gradient_avx+0x3d>
+  DB  235,21                              ; jmp           6a2d <_sk_evenly_spaced_gradient_avx+0x3d>
   DB  73,137,217                          ; mov           %rbx,%r9
   DB  73,209,233                          ; shr           %r9
   DB  131,227,1                           ; and           $0x1,%ebx
@@ -12582,18 +12619,18 @@
 
 PUBLIC _sk_gauss_a_to_rgba_avx
 _sk_gauss_a_to_rgba_avx LABEL PROC
-  DB  196,226,125,24,5,48,16,0,0          ; vbroadcastss  0x1030(%rip),%ymm0        # 7d90 <_sk_callback_avx+0x510>
+  DB  196,226,125,24,5,56,16,0,0          ; vbroadcastss  0x1038(%rip),%ymm0        # 7dcc <_sk_callback_avx+0x518>
   DB  197,228,89,192                      ; vmulps        %ymm0,%ymm3,%ymm0
-  DB  196,226,125,24,13,39,16,0,0         ; vbroadcastss  0x1027(%rip),%ymm1        # 7d94 <_sk_callback_avx+0x514>
+  DB  196,226,125,24,13,47,16,0,0         ; vbroadcastss  0x102f(%rip),%ymm1        # 7dd0 <_sk_callback_avx+0x51c>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  197,252,89,195                      ; vmulps        %ymm3,%ymm0,%ymm0
-  DB  196,226,125,24,13,26,16,0,0         ; vbroadcastss  0x101a(%rip),%ymm1        # 7d98 <_sk_callback_avx+0x518>
+  DB  196,226,125,24,13,34,16,0,0         ; vbroadcastss  0x1022(%rip),%ymm1        # 7dd4 <_sk_callback_avx+0x520>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  197,252,89,195                      ; vmulps        %ymm3,%ymm0,%ymm0
-  DB  196,226,125,24,13,13,16,0,0         ; vbroadcastss  0x100d(%rip),%ymm1        # 7d9c <_sk_callback_avx+0x51c>
+  DB  196,226,125,24,13,21,16,0,0         ; vbroadcastss  0x1015(%rip),%ymm1        # 7dd8 <_sk_callback_avx+0x524>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  197,252,89,195                      ; vmulps        %ymm3,%ymm0,%ymm0
-  DB  196,226,125,24,13,0,16,0,0          ; vbroadcastss  0x1000(%rip),%ymm1        # 7da0 <_sk_callback_avx+0x520>
+  DB  196,226,125,24,13,8,16,0,0          ; vbroadcastss  0x1008(%rip),%ymm1        # 7ddc <_sk_callback_avx+0x528>
   DB  197,252,88,193                      ; vaddps        %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,252,40,200                      ; vmovaps       %ymm0,%ymm1
@@ -12615,12 +12652,12 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  197,244,87,201                      ; vxorps        %ymm1,%ymm1,%ymm1
   DB  73,131,249,2                        ; cmp           $0x2,%r9
-  DB  114,80                              ; jb            6e26 <_sk_gradient_avx+0x72>
+  DB  114,80                              ; jb            6e5a <_sk_gradient_avx+0x72>
   DB  72,139,88,72                        ; mov           0x48(%rax),%rbx
   DB  73,255,201                          ; dec           %r9
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  196,65,52,87,201                    ; vxorps        %ymm9,%ymm9,%ymm9
-  DB  196,98,125,24,21,181,15,0,0         ; vbroadcastss  0xfb5(%rip),%ymm10        # 7da4 <_sk_callback_avx+0x524>
+  DB  196,98,125,24,21,189,15,0,0         ; vbroadcastss  0xfbd(%rip),%ymm10        # 7de0 <_sk_callback_avx+0x52c>
   DB  197,244,87,201                      ; vxorps        %ymm1,%ymm1,%ymm1
   DB  196,98,125,24,3                     ; vbroadcastss  (%rbx),%ymm8
   DB  197,60,194,192,2                    ; vcmpleps      %ymm0,%ymm8,%ymm8
@@ -12632,7 +12669,7 @@
   DB  196,227,117,24,202,1                ; vinsertf128   $0x1,%xmm2,%ymm1,%ymm1
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  73,255,201                          ; dec           %r9
-  DB  117,205                             ; jne           6df3 <_sk_gradient_avx+0x3f>
+  DB  117,205                             ; jne           6e27 <_sk_gradient_avx+0x3f>
   DB  196,195,249,22,201,1                ; vpextrq       $0x1,%xmm1,%r9
   DB  69,137,202                          ; mov           %r9d,%r10d
   DB  73,193,233,32                       ; shr           $0x20,%r9
@@ -12812,27 +12849,27 @@
   DB  196,65,52,95,226                    ; vmaxps        %ymm10,%ymm9,%ymm12
   DB  196,65,36,94,220                    ; vdivps        %ymm12,%ymm11,%ymm11
   DB  196,65,36,89,227                    ; vmulps        %ymm11,%ymm11,%ymm12
-  DB  196,98,125,24,45,168,11,0,0         ; vbroadcastss  0xba8(%rip),%ymm13        # 7da8 <_sk_callback_avx+0x528>
+  DB  196,98,125,24,45,176,11,0,0         ; vbroadcastss  0xbb0(%rip),%ymm13        # 7de4 <_sk_callback_avx+0x530>
   DB  196,65,28,89,237                    ; vmulps        %ymm13,%ymm12,%ymm13
-  DB  196,98,125,24,53,158,11,0,0         ; vbroadcastss  0xb9e(%rip),%ymm14        # 7dac <_sk_callback_avx+0x52c>
+  DB  196,98,125,24,53,166,11,0,0         ; vbroadcastss  0xba6(%rip),%ymm14        # 7de8 <_sk_callback_avx+0x534>
   DB  196,65,20,88,238                    ; vaddps        %ymm14,%ymm13,%ymm13
   DB  196,65,28,89,237                    ; vmulps        %ymm13,%ymm12,%ymm13
-  DB  196,98,125,24,53,143,11,0,0         ; vbroadcastss  0xb8f(%rip),%ymm14        # 7db0 <_sk_callback_avx+0x530>
+  DB  196,98,125,24,53,151,11,0,0         ; vbroadcastss  0xb97(%rip),%ymm14        # 7dec <_sk_callback_avx+0x538>
   DB  196,65,20,88,238                    ; vaddps        %ymm14,%ymm13,%ymm13
   DB  196,65,28,89,229                    ; vmulps        %ymm13,%ymm12,%ymm12
-  DB  196,98,125,24,45,128,11,0,0         ; vbroadcastss  0xb80(%rip),%ymm13        # 7db4 <_sk_callback_avx+0x534>
+  DB  196,98,125,24,45,136,11,0,0         ; vbroadcastss  0xb88(%rip),%ymm13        # 7df0 <_sk_callback_avx+0x53c>
   DB  196,65,28,88,229                    ; vaddps        %ymm13,%ymm12,%ymm12
   DB  196,65,36,89,220                    ; vmulps        %ymm12,%ymm11,%ymm11
   DB  196,65,52,194,202,1                 ; vcmpltps      %ymm10,%ymm9,%ymm9
-  DB  196,98,125,24,21,107,11,0,0         ; vbroadcastss  0xb6b(%rip),%ymm10        # 7db8 <_sk_callback_avx+0x538>
+  DB  196,98,125,24,21,115,11,0,0         ; vbroadcastss  0xb73(%rip),%ymm10        # 7df4 <_sk_callback_avx+0x540>
   DB  196,65,44,92,211                    ; vsubps        %ymm11,%ymm10,%ymm10
   DB  196,67,37,74,202,144                ; vblendvps     %ymm9,%ymm10,%ymm11,%ymm9
   DB  196,193,124,194,192,1               ; vcmpltps      %ymm8,%ymm0,%ymm0
-  DB  196,98,125,24,21,85,11,0,0          ; vbroadcastss  0xb55(%rip),%ymm10        # 7dbc <_sk_callback_avx+0x53c>
+  DB  196,98,125,24,21,93,11,0,0          ; vbroadcastss  0xb5d(%rip),%ymm10        # 7df8 <_sk_callback_avx+0x544>
   DB  196,65,44,92,209                    ; vsubps        %ymm9,%ymm10,%ymm10
   DB  196,195,53,74,194,0                 ; vblendvps     %ymm0,%ymm10,%ymm9,%ymm0
   DB  196,65,116,194,200,1                ; vcmpltps      %ymm8,%ymm1,%ymm9
-  DB  196,98,125,24,21,63,11,0,0          ; vbroadcastss  0xb3f(%rip),%ymm10        # 7dc0 <_sk_callback_avx+0x540>
+  DB  196,98,125,24,21,71,11,0,0          ; vbroadcastss  0xb47(%rip),%ymm10        # 7dfc <_sk_callback_avx+0x548>
   DB  197,44,92,208                       ; vsubps        %ymm0,%ymm10,%ymm10
   DB  196,195,125,74,194,144              ; vblendvps     %ymm9,%ymm10,%ymm0,%ymm0
   DB  196,65,124,194,200,3                ; vcmpunordps   %ymm8,%ymm0,%ymm9
@@ -12858,7 +12895,7 @@
   DB  196,67,121,4,210,0                  ; vpermilps     $0x0,%xmm10,%xmm10
   DB  196,67,45,24,210,1                  ; vinsertf128   $0x1,%xmm10,%ymm10,%ymm10
   DB  197,44,88,208                       ; vaddps        %ymm0,%ymm10,%ymm10
-  DB  196,98,125,24,29,233,10,0,0         ; vbroadcastss  0xae9(%rip),%ymm11        # 7dc4 <_sk_callback_avx+0x544>
+  DB  196,98,125,24,29,241,10,0,0         ; vbroadcastss  0xaf1(%rip),%ymm11        # 7e00 <_sk_callback_avx+0x54c>
   DB  196,65,44,89,211                    ; vmulps        %ymm11,%ymm10,%ymm10
   DB  197,252,89,192                      ; vmulps        %ymm0,%ymm0,%ymm0
   DB  197,116,89,217                      ; vmulps        %ymm1,%ymm1,%ymm11
@@ -12867,17 +12904,17 @@
   DB  196,227,121,4,192,0                 ; vpermilps     $0x0,%xmm0,%xmm0
   DB  196,227,125,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   DB  197,164,92,192                      ; vsubps        %ymm0,%ymm11,%ymm0
-  DB  196,98,125,24,13,189,10,0,0         ; vbroadcastss  0xabd(%rip),%ymm9        # 7dc8 <_sk_callback_avx+0x548>
+  DB  196,98,125,24,13,197,10,0,0         ; vbroadcastss  0xac5(%rip),%ymm9        # 7e04 <_sk_callback_avx+0x550>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  196,65,44,89,194                    ; vmulps        %ymm10,%ymm10,%ymm8
   DB  196,193,124,88,192                  ; vaddps        %ymm8,%ymm0,%ymm0
   DB  197,252,81,192                      ; vsqrtps       %ymm0,%ymm0
   DB  196,98,125,24,64,36                 ; vbroadcastss  0x24(%rax),%ymm8
-  DB  196,98,125,24,13,155,10,0,0         ; vbroadcastss  0xa9b(%rip),%ymm9        # 7dcc <_sk_callback_avx+0x54c>
+  DB  196,98,125,24,13,163,10,0,0         ; vbroadcastss  0xaa3(%rip),%ymm9        # 7e08 <_sk_callback_avx+0x554>
   DB  196,65,44,87,201                    ; vxorps        %ymm9,%ymm10,%ymm9
   DB  196,65,124,92,210                   ; vsubps        %ymm10,%ymm0,%ymm10
-  DB  196,98,125,24,29,140,10,0,0         ; vbroadcastss  0xa8c(%rip),%ymm11        # 7dd0 <_sk_callback_avx+0x550>
+  DB  196,98,125,24,29,148,10,0,0         ; vbroadcastss  0xa94(%rip),%ymm11        # 7e0c <_sk_callback_avx+0x558>
   DB  196,65,60,89,195                    ; vmulps        %ymm11,%ymm8,%ymm8
   DB  196,65,60,89,210                    ; vmulps        %ymm10,%ymm8,%ymm10
   DB  197,180,92,192                      ; vsubps        %ymm0,%ymm9,%ymm0
@@ -12895,7 +12932,7 @@
   DB  196,67,121,4,210,0                  ; vpermilps     $0x0,%xmm10,%xmm10
   DB  196,67,45,24,210,1                  ; vinsertf128   $0x1,%xmm10,%ymm10,%ymm10
   DB  197,44,88,208                       ; vaddps        %ymm0,%ymm10,%ymm10
-  DB  196,98,125,24,29,75,10,0,0          ; vbroadcastss  0xa4b(%rip),%ymm11        # 7dd4 <_sk_callback_avx+0x554>
+  DB  196,98,125,24,29,83,10,0,0          ; vbroadcastss  0xa53(%rip),%ymm11        # 7e10 <_sk_callback_avx+0x55c>
   DB  196,65,44,89,211                    ; vmulps        %ymm11,%ymm10,%ymm10
   DB  197,252,89,192                      ; vmulps        %ymm0,%ymm0,%ymm0
   DB  197,116,89,217                      ; vmulps        %ymm1,%ymm1,%ymm11
@@ -12904,17 +12941,17 @@
   DB  196,227,121,4,192,0                 ; vpermilps     $0x0,%xmm0,%xmm0
   DB  196,227,125,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   DB  197,164,92,192                      ; vsubps        %ymm0,%ymm11,%ymm0
-  DB  196,98,125,24,13,31,10,0,0          ; vbroadcastss  0xa1f(%rip),%ymm9        # 7dd8 <_sk_callback_avx+0x558>
+  DB  196,98,125,24,13,39,10,0,0          ; vbroadcastss  0xa27(%rip),%ymm9        # 7e14 <_sk_callback_avx+0x560>
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
   DB  197,188,89,192                      ; vmulps        %ymm0,%ymm8,%ymm0
   DB  196,65,44,89,194                    ; vmulps        %ymm10,%ymm10,%ymm8
   DB  196,193,124,88,192                  ; vaddps        %ymm8,%ymm0,%ymm0
   DB  197,252,81,192                      ; vsqrtps       %ymm0,%ymm0
   DB  196,98,125,24,64,36                 ; vbroadcastss  0x24(%rax),%ymm8
-  DB  196,98,125,24,13,253,9,0,0          ; vbroadcastss  0x9fd(%rip),%ymm9        # 7ddc <_sk_callback_avx+0x55c>
+  DB  196,98,125,24,13,5,10,0,0           ; vbroadcastss  0xa05(%rip),%ymm9        # 7e18 <_sk_callback_avx+0x564>
   DB  196,65,44,87,201                    ; vxorps        %ymm9,%ymm10,%ymm9
   DB  196,65,124,92,210                   ; vsubps        %ymm10,%ymm0,%ymm10
-  DB  196,98,125,24,29,238,9,0,0          ; vbroadcastss  0x9ee(%rip),%ymm11        # 7de0 <_sk_callback_avx+0x560>
+  DB  196,98,125,24,29,246,9,0,0          ; vbroadcastss  0x9f6(%rip),%ymm11        # 7e1c <_sk_callback_avx+0x568>
   DB  196,65,60,89,195                    ; vmulps        %ymm11,%ymm8,%ymm8
   DB  196,65,60,89,210                    ; vmulps        %ymm10,%ymm8,%ymm10
   DB  197,180,92,192                      ; vsubps        %ymm0,%ymm9,%ymm0
@@ -12931,7 +12968,7 @@
   DB  196,67,121,4,201,0                  ; vpermilps     $0x0,%xmm9,%xmm9
   DB  196,67,53,24,201,1                  ; vinsertf128   $0x1,%xmm9,%ymm9,%ymm9
   DB  197,52,88,200                       ; vaddps        %ymm0,%ymm9,%ymm9
-  DB  196,98,125,24,21,179,9,0,0          ; vbroadcastss  0x9b3(%rip),%ymm10        # 7de4 <_sk_callback_avx+0x564>
+  DB  196,98,125,24,21,187,9,0,0          ; vbroadcastss  0x9bb(%rip),%ymm10        # 7e20 <_sk_callback_avx+0x56c>
   DB  196,65,52,89,202                    ; vmulps        %ymm10,%ymm9,%ymm9
   DB  197,252,89,192                      ; vmulps        %ymm0,%ymm0,%ymm0
   DB  197,116,89,209                      ; vmulps        %ymm1,%ymm1,%ymm10
@@ -12940,7 +12977,7 @@
   DB  196,227,121,4,192,0                 ; vpermilps     $0x0,%xmm0,%xmm0
   DB  196,227,125,24,192,1                ; vinsertf128   $0x1,%xmm0,%ymm0,%ymm0
   DB  197,172,92,192                      ; vsubps        %ymm0,%ymm10,%ymm0
-  DB  196,98,125,24,5,135,9,0,0           ; vbroadcastss  0x987(%rip),%ymm8        # 7de8 <_sk_callback_avx+0x568>
+  DB  196,98,125,24,5,143,9,0,0           ; vbroadcastss  0x98f(%rip),%ymm8        # 7e24 <_sk_callback_avx+0x570>
   DB  196,193,124,87,192                  ; vxorps        %ymm8,%ymm0,%ymm0
   DB  196,193,124,94,193                  ; vdivps        %ymm9,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -12975,7 +13012,7 @@
 PUBLIC _sk_save_xy_avx
 _sk_save_xy_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,35,9,0,0            ; vbroadcastss  0x923(%rip),%ymm8        # 7dec <_sk_callback_avx+0x56c>
+  DB  196,98,125,24,5,43,9,0,0            ; vbroadcastss  0x92b(%rip),%ymm8        # 7e28 <_sk_callback_avx+0x574>
   DB  196,65,124,88,200                   ; vaddps        %ymm8,%ymm0,%ymm9
   DB  196,67,125,8,209,1                  ; vroundps      $0x1,%ymm9,%ymm10
   DB  196,65,52,92,202                    ; vsubps        %ymm10,%ymm9,%ymm9
@@ -13008,9 +13045,9 @@
 PUBLIC _sk_bilinear_nx_avx
 _sk_bilinear_nx_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,175,8,0,0          ; vbroadcastss  0x8af(%rip),%ymm0        # 7df0 <_sk_callback_avx+0x570>
+  DB  196,226,125,24,5,183,8,0,0          ; vbroadcastss  0x8b7(%rip),%ymm0        # 7e2c <_sk_callback_avx+0x578>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,166,8,0,0           ; vbroadcastss  0x8a6(%rip),%ymm8        # 7df4 <_sk_callback_avx+0x574>
+  DB  196,98,125,24,5,174,8,0,0           ; vbroadcastss  0x8ae(%rip),%ymm8        # 7e30 <_sk_callback_avx+0x57c>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -13019,7 +13056,7 @@
 PUBLIC _sk_bilinear_px_avx
 _sk_bilinear_px_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,142,8,0,0          ; vbroadcastss  0x88e(%rip),%ymm0        # 7df8 <_sk_callback_avx+0x578>
+  DB  196,226,125,24,5,150,8,0,0          ; vbroadcastss  0x896(%rip),%ymm0        # 7e34 <_sk_callback_avx+0x580>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
   DB  197,124,16,64,64                    ; vmovups       0x40(%rax),%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -13029,9 +13066,9 @@
 PUBLIC _sk_bilinear_ny_avx
 _sk_bilinear_ny_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,114,8,0,0         ; vbroadcastss  0x872(%rip),%ymm1        # 7dfc <_sk_callback_avx+0x57c>
+  DB  196,226,125,24,13,122,8,0,0         ; vbroadcastss  0x87a(%rip),%ymm1        # 7e38 <_sk_callback_avx+0x584>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,104,8,0,0           ; vbroadcastss  0x868(%rip),%ymm8        # 7e00 <_sk_callback_avx+0x580>
+  DB  196,98,125,24,5,112,8,0,0           ; vbroadcastss  0x870(%rip),%ymm8        # 7e3c <_sk_callback_avx+0x588>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -13040,7 +13077,7 @@
 PUBLIC _sk_bilinear_py_avx
 _sk_bilinear_py_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,80,8,0,0          ; vbroadcastss  0x850(%rip),%ymm1        # 7e04 <_sk_callback_avx+0x584>
+  DB  196,226,125,24,13,88,8,0,0          ; vbroadcastss  0x858(%rip),%ymm1        # 7e40 <_sk_callback_avx+0x58c>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
   DB  197,124,16,64,96                    ; vmovups       0x60(%rax),%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -13050,14 +13087,14 @@
 PUBLIC _sk_bicubic_n3x_avx
 _sk_bicubic_n3x_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,51,8,0,0           ; vbroadcastss  0x833(%rip),%ymm0        # 7e08 <_sk_callback_avx+0x588>
+  DB  196,226,125,24,5,59,8,0,0           ; vbroadcastss  0x83b(%rip),%ymm0        # 7e44 <_sk_callback_avx+0x590>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,42,8,0,0            ; vbroadcastss  0x82a(%rip),%ymm8        # 7e0c <_sk_callback_avx+0x58c>
+  DB  196,98,125,24,5,50,8,0,0            ; vbroadcastss  0x832(%rip),%ymm8        # 7e48 <_sk_callback_avx+0x594>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,27,8,0,0           ; vbroadcastss  0x81b(%rip),%ymm10        # 7e10 <_sk_callback_avx+0x590>
+  DB  196,98,125,24,21,35,8,0,0           ; vbroadcastss  0x823(%rip),%ymm10        # 7e4c <_sk_callback_avx+0x598>
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
-  DB  196,98,125,24,21,17,8,0,0           ; vbroadcastss  0x811(%rip),%ymm10        # 7e14 <_sk_callback_avx+0x594>
+  DB  196,98,125,24,21,25,8,0,0           ; vbroadcastss  0x819(%rip),%ymm10        # 7e50 <_sk_callback_avx+0x59c>
   DB  196,65,60,88,194                    ; vaddps        %ymm10,%ymm8,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -13067,19 +13104,19 @@
 PUBLIC _sk_bicubic_n1x_avx
 _sk_bicubic_n1x_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,244,7,0,0          ; vbroadcastss  0x7f4(%rip),%ymm0        # 7e18 <_sk_callback_avx+0x598>
+  DB  196,226,125,24,5,252,7,0,0          ; vbroadcastss  0x7fc(%rip),%ymm0        # 7e54 <_sk_callback_avx+0x5a0>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
-  DB  196,98,125,24,5,235,7,0,0           ; vbroadcastss  0x7eb(%rip),%ymm8        # 7e1c <_sk_callback_avx+0x59c>
+  DB  196,98,125,24,5,243,7,0,0           ; vbroadcastss  0x7f3(%rip),%ymm8        # 7e58 <_sk_callback_avx+0x5a4>
   DB  197,60,92,64,64                     ; vsubps        0x40(%rax),%ymm8,%ymm8
-  DB  196,98,125,24,13,225,7,0,0          ; vbroadcastss  0x7e1(%rip),%ymm9        # 7e20 <_sk_callback_avx+0x5a0>
+  DB  196,98,125,24,13,233,7,0,0          ; vbroadcastss  0x7e9(%rip),%ymm9        # 7e5c <_sk_callback_avx+0x5a8>
   DB  196,65,60,89,201                    ; vmulps        %ymm9,%ymm8,%ymm9
-  DB  196,98,125,24,21,215,7,0,0          ; vbroadcastss  0x7d7(%rip),%ymm10        # 7e24 <_sk_callback_avx+0x5a4>
+  DB  196,98,125,24,21,223,7,0,0          ; vbroadcastss  0x7df(%rip),%ymm10        # 7e60 <_sk_callback_avx+0x5ac>
   DB  196,65,52,88,202                    ; vaddps        %ymm10,%ymm9,%ymm9
   DB  196,65,60,89,201                    ; vmulps        %ymm9,%ymm8,%ymm9
-  DB  196,98,125,24,21,200,7,0,0          ; vbroadcastss  0x7c8(%rip),%ymm10        # 7e28 <_sk_callback_avx+0x5a8>
+  DB  196,98,125,24,21,208,7,0,0          ; vbroadcastss  0x7d0(%rip),%ymm10        # 7e64 <_sk_callback_avx+0x5b0>
   DB  196,65,52,88,202                    ; vaddps        %ymm10,%ymm9,%ymm9
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
-  DB  196,98,125,24,13,185,7,0,0          ; vbroadcastss  0x7b9(%rip),%ymm9        # 7e2c <_sk_callback_avx+0x5ac>
+  DB  196,98,125,24,13,193,7,0,0          ; vbroadcastss  0x7c1(%rip),%ymm9        # 7e68 <_sk_callback_avx+0x5b4>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -13088,17 +13125,17 @@
 PUBLIC _sk_bicubic_p1x_avx
 _sk_bicubic_p1x_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,161,7,0,0           ; vbroadcastss  0x7a1(%rip),%ymm8        # 7e30 <_sk_callback_avx+0x5b0>
+  DB  196,98,125,24,5,169,7,0,0           ; vbroadcastss  0x7a9(%rip),%ymm8        # 7e6c <_sk_callback_avx+0x5b8>
   DB  197,188,88,0                        ; vaddps        (%rax),%ymm8,%ymm0
   DB  197,124,16,72,64                    ; vmovups       0x40(%rax),%ymm9
-  DB  196,98,125,24,21,147,7,0,0          ; vbroadcastss  0x793(%rip),%ymm10        # 7e34 <_sk_callback_avx+0x5b4>
+  DB  196,98,125,24,21,155,7,0,0          ; vbroadcastss  0x79b(%rip),%ymm10        # 7e70 <_sk_callback_avx+0x5bc>
   DB  196,65,52,89,210                    ; vmulps        %ymm10,%ymm9,%ymm10
-  DB  196,98,125,24,29,137,7,0,0          ; vbroadcastss  0x789(%rip),%ymm11        # 7e38 <_sk_callback_avx+0x5b8>
+  DB  196,98,125,24,29,145,7,0,0          ; vbroadcastss  0x791(%rip),%ymm11        # 7e74 <_sk_callback_avx+0x5c0>
   DB  196,65,44,88,211                    ; vaddps        %ymm11,%ymm10,%ymm10
   DB  196,65,52,89,210                    ; vmulps        %ymm10,%ymm9,%ymm10
   DB  196,65,44,88,192                    ; vaddps        %ymm8,%ymm10,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
-  DB  196,98,125,24,13,112,7,0,0          ; vbroadcastss  0x770(%rip),%ymm9        # 7e3c <_sk_callback_avx+0x5bc>
+  DB  196,98,125,24,13,120,7,0,0          ; vbroadcastss  0x778(%rip),%ymm9        # 7e78 <_sk_callback_avx+0x5c4>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -13107,13 +13144,13 @@
 PUBLIC _sk_bicubic_p3x_avx
 _sk_bicubic_p3x_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,5,88,7,0,0           ; vbroadcastss  0x758(%rip),%ymm0        # 7e40 <_sk_callback_avx+0x5c0>
+  DB  196,226,125,24,5,96,7,0,0           ; vbroadcastss  0x760(%rip),%ymm0        # 7e7c <_sk_callback_avx+0x5c8>
   DB  197,252,88,0                        ; vaddps        (%rax),%ymm0,%ymm0
   DB  197,124,16,64,64                    ; vmovups       0x40(%rax),%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,69,7,0,0           ; vbroadcastss  0x745(%rip),%ymm10        # 7e44 <_sk_callback_avx+0x5c4>
+  DB  196,98,125,24,21,77,7,0,0           ; vbroadcastss  0x74d(%rip),%ymm10        # 7e80 <_sk_callback_avx+0x5cc>
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
-  DB  196,98,125,24,21,59,7,0,0           ; vbroadcastss  0x73b(%rip),%ymm10        # 7e48 <_sk_callback_avx+0x5c8>
+  DB  196,98,125,24,21,67,7,0,0           ; vbroadcastss  0x743(%rip),%ymm10        # 7e84 <_sk_callback_avx+0x5d0>
   DB  196,65,60,88,194                    ; vaddps        %ymm10,%ymm8,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
   DB  197,124,17,128,128,0,0,0            ; vmovups       %ymm8,0x80(%rax)
@@ -13123,14 +13160,14 @@
 PUBLIC _sk_bicubic_n3y_avx
 _sk_bicubic_n3y_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,30,7,0,0          ; vbroadcastss  0x71e(%rip),%ymm1        # 7e4c <_sk_callback_avx+0x5cc>
+  DB  196,226,125,24,13,38,7,0,0          ; vbroadcastss  0x726(%rip),%ymm1        # 7e88 <_sk_callback_avx+0x5d4>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,20,7,0,0            ; vbroadcastss  0x714(%rip),%ymm8        # 7e50 <_sk_callback_avx+0x5d0>
+  DB  196,98,125,24,5,28,7,0,0            ; vbroadcastss  0x71c(%rip),%ymm8        # 7e8c <_sk_callback_avx+0x5d8>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,5,7,0,0            ; vbroadcastss  0x705(%rip),%ymm10        # 7e54 <_sk_callback_avx+0x5d4>
+  DB  196,98,125,24,21,13,7,0,0           ; vbroadcastss  0x70d(%rip),%ymm10        # 7e90 <_sk_callback_avx+0x5dc>
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
-  DB  196,98,125,24,21,251,6,0,0          ; vbroadcastss  0x6fb(%rip),%ymm10        # 7e58 <_sk_callback_avx+0x5d8>
+  DB  196,98,125,24,21,3,7,0,0            ; vbroadcastss  0x703(%rip),%ymm10        # 7e94 <_sk_callback_avx+0x5e0>
   DB  196,65,60,88,194                    ; vaddps        %ymm10,%ymm8,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -13140,19 +13177,19 @@
 PUBLIC _sk_bicubic_n1y_avx
 _sk_bicubic_n1y_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,222,6,0,0         ; vbroadcastss  0x6de(%rip),%ymm1        # 7e5c <_sk_callback_avx+0x5dc>
+  DB  196,226,125,24,13,230,6,0,0         ; vbroadcastss  0x6e6(%rip),%ymm1        # 7e98 <_sk_callback_avx+0x5e4>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
-  DB  196,98,125,24,5,212,6,0,0           ; vbroadcastss  0x6d4(%rip),%ymm8        # 7e60 <_sk_callback_avx+0x5e0>
+  DB  196,98,125,24,5,220,6,0,0           ; vbroadcastss  0x6dc(%rip),%ymm8        # 7e9c <_sk_callback_avx+0x5e8>
   DB  197,60,92,64,96                     ; vsubps        0x60(%rax),%ymm8,%ymm8
-  DB  196,98,125,24,13,202,6,0,0          ; vbroadcastss  0x6ca(%rip),%ymm9        # 7e64 <_sk_callback_avx+0x5e4>
+  DB  196,98,125,24,13,210,6,0,0          ; vbroadcastss  0x6d2(%rip),%ymm9        # 7ea0 <_sk_callback_avx+0x5ec>
   DB  196,65,60,89,201                    ; vmulps        %ymm9,%ymm8,%ymm9
-  DB  196,98,125,24,21,192,6,0,0          ; vbroadcastss  0x6c0(%rip),%ymm10        # 7e68 <_sk_callback_avx+0x5e8>
+  DB  196,98,125,24,21,200,6,0,0          ; vbroadcastss  0x6c8(%rip),%ymm10        # 7ea4 <_sk_callback_avx+0x5f0>
   DB  196,65,52,88,202                    ; vaddps        %ymm10,%ymm9,%ymm9
   DB  196,65,60,89,201                    ; vmulps        %ymm9,%ymm8,%ymm9
-  DB  196,98,125,24,21,177,6,0,0          ; vbroadcastss  0x6b1(%rip),%ymm10        # 7e6c <_sk_callback_avx+0x5ec>
+  DB  196,98,125,24,21,185,6,0,0          ; vbroadcastss  0x6b9(%rip),%ymm10        # 7ea8 <_sk_callback_avx+0x5f4>
   DB  196,65,52,88,202                    ; vaddps        %ymm10,%ymm9,%ymm9
   DB  196,65,60,89,193                    ; vmulps        %ymm9,%ymm8,%ymm8
-  DB  196,98,125,24,13,162,6,0,0          ; vbroadcastss  0x6a2(%rip),%ymm9        # 7e70 <_sk_callback_avx+0x5f0>
+  DB  196,98,125,24,13,170,6,0,0          ; vbroadcastss  0x6aa(%rip),%ymm9        # 7eac <_sk_callback_avx+0x5f8>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -13161,17 +13198,17 @@
 PUBLIC _sk_bicubic_p1y_avx
 _sk_bicubic_p1y_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,98,125,24,5,138,6,0,0           ; vbroadcastss  0x68a(%rip),%ymm8        # 7e74 <_sk_callback_avx+0x5f4>
+  DB  196,98,125,24,5,146,6,0,0           ; vbroadcastss  0x692(%rip),%ymm8        # 7eb0 <_sk_callback_avx+0x5fc>
   DB  197,188,88,72,32                    ; vaddps        0x20(%rax),%ymm8,%ymm1
   DB  197,124,16,72,96                    ; vmovups       0x60(%rax),%ymm9
-  DB  196,98,125,24,21,123,6,0,0          ; vbroadcastss  0x67b(%rip),%ymm10        # 7e78 <_sk_callback_avx+0x5f8>
+  DB  196,98,125,24,21,131,6,0,0          ; vbroadcastss  0x683(%rip),%ymm10        # 7eb4 <_sk_callback_avx+0x600>
   DB  196,65,52,89,210                    ; vmulps        %ymm10,%ymm9,%ymm10
-  DB  196,98,125,24,29,113,6,0,0          ; vbroadcastss  0x671(%rip),%ymm11        # 7e7c <_sk_callback_avx+0x5fc>
+  DB  196,98,125,24,29,121,6,0,0          ; vbroadcastss  0x679(%rip),%ymm11        # 7eb8 <_sk_callback_avx+0x604>
   DB  196,65,44,88,211                    ; vaddps        %ymm11,%ymm10,%ymm10
   DB  196,65,52,89,210                    ; vmulps        %ymm10,%ymm9,%ymm10
   DB  196,65,44,88,192                    ; vaddps        %ymm8,%ymm10,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
-  DB  196,98,125,24,13,88,6,0,0           ; vbroadcastss  0x658(%rip),%ymm9        # 7e80 <_sk_callback_avx+0x600>
+  DB  196,98,125,24,13,96,6,0,0           ; vbroadcastss  0x660(%rip),%ymm9        # 7ebc <_sk_callback_avx+0x608>
   DB  196,65,60,88,193                    ; vaddps        %ymm9,%ymm8,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -13180,13 +13217,13 @@
 PUBLIC _sk_bicubic_p3y_avx
 _sk_bicubic_p3y_avx LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,24,13,64,6,0,0          ; vbroadcastss  0x640(%rip),%ymm1        # 7e84 <_sk_callback_avx+0x604>
+  DB  196,226,125,24,13,72,6,0,0          ; vbroadcastss  0x648(%rip),%ymm1        # 7ec0 <_sk_callback_avx+0x60c>
   DB  197,244,88,72,32                    ; vaddps        0x20(%rax),%ymm1,%ymm1
   DB  197,124,16,64,96                    ; vmovups       0x60(%rax),%ymm8
   DB  196,65,60,89,200                    ; vmulps        %ymm8,%ymm8,%ymm9
-  DB  196,98,125,24,21,44,6,0,0           ; vbroadcastss  0x62c(%rip),%ymm10        # 7e88 <_sk_callback_avx+0x608>
+  DB  196,98,125,24,21,52,6,0,0           ; vbroadcastss  0x634(%rip),%ymm10        # 7ec4 <_sk_callback_avx+0x610>
   DB  196,65,60,89,194                    ; vmulps        %ymm10,%ymm8,%ymm8
-  DB  196,98,125,24,21,34,6,0,0           ; vbroadcastss  0x622(%rip),%ymm10        # 7e8c <_sk_callback_avx+0x60c>
+  DB  196,98,125,24,21,42,6,0,0           ; vbroadcastss  0x62a(%rip),%ymm10        # 7ec8 <_sk_callback_avx+0x614>
   DB  196,65,60,88,194                    ; vaddps        %ymm10,%ymm8,%ymm8
   DB  196,65,52,89,192                    ; vmulps        %ymm8,%ymm9,%ymm8
   DB  197,124,17,128,160,0,0,0            ; vmovups       %ymm8,0xa0(%rax)
@@ -13303,30 +13340,32 @@
   DB  63                                  ; (bad)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
-  DB  0,128,191,0,0,224                   ; add           %al,-0x1fffff41(%rax)
-  DB  64,154                              ; rex           (bad)
+  DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
+  DB  63                                  ; (bad)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  128,191,0,0,224,64,154              ; cmpb          $0x9a,0x40e00000(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 7a5d <.literal4+0xb1>
+  DB  71,225,61                           ; rex.RXB       loope 7a99 <.literal4+0xb9>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 7a6d <.literal4+0xc1>
+  DB  71,225,61                           ; rex.RXB       loope 7aa9 <.literal4+0xc9>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 7a7d <.literal4+0xd1>
+  DB  71,225,61                           ; rex.RXB       loope 7ab9 <.literal4+0xd9>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,154                          ; cmpb          $0x9a,(%rdi)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
   DB  62,61,10,23,63,174                  ; ds            cmp $0xae3f170a,%eax
-  DB  71,225,61                           ; rex.RXB       loope 7a8d <.literal4+0xe1>
+  DB  71,225,61                           ; rex.RXB       loope 7ac9 <.literal4+0xe9>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,127                    ; add           %al,0x7f00003f(%rax)
@@ -13390,7 +13429,7 @@
   DB  190,129,128,128,59                  ; mov           $0x3b808081,%esi
   DB  129,128,128,59,0,248,0,0,8,33       ; addl          $0x21080000,-0x7ffc480(%rax)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        7af9 <.literal4+0x14d>
+  DB  224,7                               ; loopne        7b35 <.literal4+0x155>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -13406,10 +13445,10 @@
   DB  129,128,128,59,129,128,128,59,0,0   ; addl          $0x3b80,-0x7f7ec480(%rax)
   DB  0,52,255                            ; add           %dh,(%rdi,%rdi,8)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            7b20 <.literal4+0x174>
+  DB  127,0                               ; jg            7b5c <.literal4+0x17c>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            7b99 <.literal4+0x1ed>
+  DB  119,115                             ; ja            7bd5 <.literal4+0x1f5>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -13423,10 +13462,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            7b54 <.literal4+0x1a8>
+  DB  127,0                               ; jg            7b90 <.literal4+0x1b0>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            7bcd <.literal4+0x221>
+  DB  119,115                             ; ja            7c09 <.literal4+0x229>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -13440,10 +13479,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            7b88 <.literal4+0x1dc>
+  DB  127,0                               ; jg            7bc4 <.literal4+0x1e4>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            7c01 <.literal4+0x255>
+  DB  119,115                             ; ja            7c3d <.literal4+0x25d>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -13457,10 +13496,10 @@
   DB  0,128,63,0,0,0                      ; add           %al,0x3f(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            7bbc <.literal4+0x210>
+  DB  127,0                               ; jg            7bf8 <.literal4+0x218>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            7c35 <.literal4+0x289>
+  DB  119,115                             ; ja            7c71 <.literal4+0x291>
   DB  248                                 ; clc
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,249,68,180                   ; mov           $0xb444f93f,%edi
@@ -13473,7 +13512,7 @@
   DB  0,75,0                              ; add           %cl,0x0(%rbx)
   DB  0,128,63,0,0,200                    ; add           %al,-0x37ffffc1(%rax)
   DB  66,0,0                              ; rex.X         add %al,(%rax)
-  DB  127,67                              ; jg            7c33 <.literal4+0x287>
+  DB  127,67                              ; jg            7c6f <.literal4+0x28f>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,195                               ; add           %al,%bl
   DB  0,0                                 ; add           %al,(%rax)
@@ -13485,7 +13524,7 @@
   DB  190,80,128,3,62                     ; mov           $0x3e038050,%esi
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           7c53 <.literal4+0x2a7>
+  DB  118,63                              ; jbe           7c8f <.literal4+0x2af>
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
@@ -13500,7 +13539,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        7c55 <.literal4+0x2a9>
+  DB  224,7                               ; loopne        7c91 <.literal4+0x2b1>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -13512,7 +13551,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        7c71 <.literal4+0x2c5>
+  DB  224,7                               ; loopne        7cad <.literal4+0x2cd>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -13524,7 +13563,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        7c8d <.literal4+0x2e1>
+  DB  224,7                               ; loopne        7cc9 <.literal4+0x2e9>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -13535,7 +13574,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  248                                 ; clc
   DB  65,0,0                              ; add           %al,(%r8)
-  DB  124,66                              ; jl            7ce2 <.literal4+0x336>
+  DB  124,66                              ; jl            7d1e <.literal4+0x33e>
   DB  0,240                               ; add           %dh,%al
   DB  0,0                                 ; add           %al,(%rax)
   DB  137,136,136,55,0,15                 ; mov           %ecx,0xf003788(%rax)
@@ -13561,7 +13600,7 @@
   DB  137,136,136,59,15,0                 ; mov           %ecx,0xf3b88(%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  137,136,136,61,0,0                  ; mov           %ecx,0x3d88(%rax)
-  DB  112,65                              ; jo            7d45 <.literal4+0x399>
+  DB  112,65                              ; jo            7d81 <.literal4+0x3a1>
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
@@ -13587,7 +13626,7 @@
   DB  0,128,55,0,0,128                    ; add           %al,-0x7fffffc9(%rax)
   DB  63                                  ; (bad)
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            7db7 <.literal4+0x40b>
+  DB  127,71                              ; jg            7df3 <.literal4+0x413>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -14142,7 +14181,7 @@
   DB  102,15,110,194                      ; movd          %edx,%xmm0
   DB  102,15,112,192,0                    ; pshufd        $0x0,%xmm0,%xmm0
   DB  15,91,200                           ; cvtdq2ps      %xmm0,%xmm1
-  DB  15,40,21,152,91,0,0                 ; movaps        0x5b98(%rip),%xmm2        # 5cc0 <_sk_callback_sse41+0xd8>
+  DB  15,40,21,184,91,0,0                 ; movaps        0x5bb8(%rip),%xmm2        # 5ce0 <_sk_callback_sse41+0xd0>
   DB  15,88,202                           ; addps         %xmm2,%xmm1
   DB  15,16,7                             ; movups        (%rdi),%xmm0
   DB  15,88,193                           ; addps         %xmm1,%xmm0
@@ -14151,7 +14190,7 @@
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  15,88,202                           ; addps         %xmm2,%xmm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,21,135,91,0,0                 ; movaps        0x5b87(%rip),%xmm2        # 5cd0 <_sk_callback_sse41+0xe8>
+  DB  15,40,21,167,91,0,0                 ; movaps        0x5ba7(%rip),%xmm2        # 5cf0 <_sk_callback_sse41+0xe0>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
   DB  15,87,237                           ; xorps         %xmm5,%xmm5
@@ -14169,14 +14208,14 @@
   DB  102,68,15,110,193                   ; movd          %ecx,%xmm8
   DB  102,69,15,112,192,0                 ; pshufd        $0x0,%xmm8,%xmm8
   DB  102,69,15,239,193                   ; pxor          %xmm9,%xmm8
-  DB  102,68,15,111,21,85,91,0,0          ; movdqa        0x5b55(%rip),%xmm10        # 5ce0 <_sk_callback_sse41+0xf8>
+  DB  102,68,15,111,21,117,91,0,0         ; movdqa        0x5b75(%rip),%xmm10        # 5d00 <_sk_callback_sse41+0xf0>
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
   DB  102,69,15,219,218                   ; pand          %xmm10,%xmm11
   DB  102,65,15,114,243,5                 ; pslld         $0x5,%xmm11
   DB  102,69,15,219,209                   ; pand          %xmm9,%xmm10
   DB  102,65,15,114,242,4                 ; pslld         $0x4,%xmm10
-  DB  102,68,15,111,37,65,91,0,0          ; movdqa        0x5b41(%rip),%xmm12        # 5cf0 <_sk_callback_sse41+0x108>
-  DB  102,68,15,111,45,72,91,0,0          ; movdqa        0x5b48(%rip),%xmm13        # 5d00 <_sk_callback_sse41+0x118>
+  DB  102,68,15,111,37,97,91,0,0          ; movdqa        0x5b61(%rip),%xmm12        # 5d10 <_sk_callback_sse41+0x100>
+  DB  102,68,15,111,45,104,91,0,0         ; movdqa        0x5b68(%rip),%xmm13        # 5d20 <_sk_callback_sse41+0x110>
   DB  102,69,15,111,240                   ; movdqa        %xmm8,%xmm14
   DB  102,69,15,219,245                   ; pand          %xmm13,%xmm14
   DB  102,65,15,114,246,2                 ; pslld         $0x2,%xmm14
@@ -14192,8 +14231,8 @@
   DB  102,69,15,235,245                   ; por           %xmm13,%xmm14
   DB  102,69,15,235,240                   ; por           %xmm8,%xmm14
   DB  69,15,91,198                        ; cvtdq2ps      %xmm14,%xmm8
-  DB  68,15,89,5,3,91,0,0                 ; mulps         0x5b03(%rip),%xmm8        # 5d10 <_sk_callback_sse41+0x128>
-  DB  68,15,88,5,11,91,0,0                ; addps         0x5b0b(%rip),%xmm8        # 5d20 <_sk_callback_sse41+0x138>
+  DB  68,15,89,5,35,91,0,0                ; mulps         0x5b23(%rip),%xmm8        # 5d30 <_sk_callback_sse41+0x120>
+  DB  68,15,88,5,43,91,0,0                ; addps         0x5b2b(%rip),%xmm8        # 5d40 <_sk_callback_sse41+0x130>
   DB  243,68,15,16,16                     ; movss         (%rax),%xmm10
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
@@ -14214,8 +14253,8 @@
   DB  65,15,40,201                        ; movaps        %xmm9,%xmm1
   DB  255,224                             ; jmpq          *%rax
 
-PUBLIC _sk_constant_color_sse41
-_sk_constant_color_sse41 LABEL PROC
+PUBLIC _sk_uniform_color_sse41
+_sk_uniform_color_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  243,15,16,0                         ; movss         (%rax),%xmm0
   DB  243,15,16,72,4                      ; movss         0x4(%rax),%xmm1
@@ -14228,6 +14267,24 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
+PUBLIC _sk_black_color_sse41
+_sk_black_color_sse41 LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  15,40,29,193,90,0,0                 ; movaps        0x5ac1(%rip),%xmm3        # 5d50 <_sk_callback_sse41+0x140>
+  DB  15,87,192                           ; xorps         %xmm0,%xmm0
+  DB  15,87,201                           ; xorps         %xmm1,%xmm1
+  DB  15,87,210                           ; xorps         %xmm2,%xmm2
+  DB  255,224                             ; jmpq          *%rax
+
+PUBLIC _sk_white_color_sse41
+_sk_white_color_sse41 LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  15,40,5,189,90,0,0                  ; movaps        0x5abd(%rip),%xmm0        # 5d60 <_sk_callback_sse41+0x150>
+  DB  15,40,200                           ; movaps        %xmm0,%xmm1
+  DB  15,40,208                           ; movaps        %xmm0,%xmm2
+  DB  15,40,216                           ; movaps        %xmm0,%xmm3
+  DB  255,224                             ; jmpq          *%rax
+
 PUBLIC _sk_load_rgba_sse41
 _sk_load_rgba_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -14260,7 +14317,7 @@
 PUBLIC _sk_srcatop_sse41
 _sk_srcatop_sse41 LABEL PROC
   DB  15,89,199                           ; mulps         %xmm7,%xmm0
-  DB  68,15,40,5,101,90,0,0               ; movaps        0x5a65(%rip),%xmm8        # 5d30 <_sk_callback_sse41+0x148>
+  DB  68,15,40,5,125,90,0,0               ; movaps        0x5a7d(%rip),%xmm8        # 5d70 <_sk_callback_sse41+0x160>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -14283,7 +14340,7 @@
 _sk_dstatop_sse41 LABEL PROC
   DB  68,15,40,195                        ; movaps        %xmm3,%xmm8
   DB  68,15,89,196                        ; mulps         %xmm4,%xmm8
-  DB  68,15,40,13,40,90,0,0               ; movaps        0x5a28(%rip),%xmm9        # 5d40 <_sk_callback_sse41+0x158>
+  DB  68,15,40,13,64,90,0,0               ; movaps        0x5a40(%rip),%xmm9        # 5d80 <_sk_callback_sse41+0x170>
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
@@ -14324,7 +14381,7 @@
 
 PUBLIC _sk_srcout_sse41
 _sk_srcout_sse41 LABEL PROC
-  DB  68,15,40,5,204,89,0,0               ; movaps        0x59cc(%rip),%xmm8        # 5d50 <_sk_callback_sse41+0x168>
+  DB  68,15,40,5,228,89,0,0               ; movaps        0x59e4(%rip),%xmm8        # 5d90 <_sk_callback_sse41+0x180>
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
@@ -14335,7 +14392,7 @@
 
 PUBLIC _sk_dstout_sse41
 _sk_dstout_sse41 LABEL PROC
-  DB  68,15,40,5,188,89,0,0               ; movaps        0x59bc(%rip),%xmm8        # 5d60 <_sk_callback_sse41+0x178>
+  DB  68,15,40,5,212,89,0,0               ; movaps        0x59d4(%rip),%xmm8        # 5da0 <_sk_callback_sse41+0x190>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  15,89,196                           ; mulps         %xmm4,%xmm0
@@ -14350,7 +14407,7 @@
 
 PUBLIC _sk_srcover_sse41
 _sk_srcover_sse41 LABEL PROC
-  DB  68,15,40,5,159,89,0,0               ; movaps        0x599f(%rip),%xmm8        # 5d70 <_sk_callback_sse41+0x188>
+  DB  68,15,40,5,183,89,0,0               ; movaps        0x59b7(%rip),%xmm8        # 5db0 <_sk_callback_sse41+0x1a0>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -14368,7 +14425,7 @@
 
 PUBLIC _sk_dstover_sse41
 _sk_dstover_sse41 LABEL PROC
-  DB  68,15,40,5,115,89,0,0               ; movaps        0x5973(%rip),%xmm8        # 5d80 <_sk_callback_sse41+0x198>
+  DB  68,15,40,5,139,89,0,0               ; movaps        0x598b(%rip),%xmm8        # 5dc0 <_sk_callback_sse41+0x1b0>
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -14392,7 +14449,7 @@
 
 PUBLIC _sk_multiply_sse41
 _sk_multiply_sse41 LABEL PROC
-  DB  68,15,40,5,71,89,0,0                ; movaps        0x5947(%rip),%xmm8        # 5d90 <_sk_callback_sse41+0x1a8>
+  DB  68,15,40,5,95,89,0,0                ; movaps        0x595f(%rip),%xmm8        # 5dd0 <_sk_callback_sse41+0x1c0>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
@@ -14461,7 +14518,7 @@
 PUBLIC _sk_xor__sse41
 _sk_xor__sse41 LABEL PROC
   DB  68,15,40,195                        ; movaps        %xmm3,%xmm8
-  DB  15,40,29,124,88,0,0                 ; movaps        0x587c(%rip),%xmm3        # 5da0 <_sk_callback_sse41+0x1b8>
+  DB  15,40,29,148,88,0,0                 ; movaps        0x5894(%rip),%xmm3        # 5de0 <_sk_callback_sse41+0x1d0>
   DB  68,15,40,203                        ; movaps        %xmm3,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
@@ -14507,7 +14564,7 @@
   DB  68,15,89,206                        ; mulps         %xmm6,%xmm9
   DB  65,15,95,209                        ; maxps         %xmm9,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,231,87,0,0                 ; movaps        0x57e7(%rip),%xmm2        # 5db0 <_sk_callback_sse41+0x1c8>
+  DB  15,40,21,255,87,0,0                 ; movaps        0x57ff(%rip),%xmm2        # 5df0 <_sk_callback_sse41+0x1e0>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -14539,7 +14596,7 @@
   DB  68,15,89,206                        ; mulps         %xmm6,%xmm9
   DB  65,15,93,209                        ; minps         %xmm9,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,140,87,0,0                 ; movaps        0x578c(%rip),%xmm2        # 5dc0 <_sk_callback_sse41+0x1d8>
+  DB  15,40,21,164,87,0,0                 ; movaps        0x57a4(%rip),%xmm2        # 5e00 <_sk_callback_sse41+0x1f0>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -14574,7 +14631,7 @@
   DB  65,15,93,209                        ; minps         %xmm9,%xmm2
   DB  15,88,210                           ; addps         %xmm2,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,38,87,0,0                  ; movaps        0x5726(%rip),%xmm2        # 5dd0 <_sk_callback_sse41+0x1e8>
+  DB  15,40,21,62,87,0,0                  ; movaps        0x573e(%rip),%xmm2        # 5e10 <_sk_callback_sse41+0x200>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -14600,7 +14657,7 @@
   DB  15,89,214                           ; mulps         %xmm6,%xmm2
   DB  15,88,210                           ; addps         %xmm2,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,230,86,0,0                 ; movaps        0x56e6(%rip),%xmm2        # 5de0 <_sk_callback_sse41+0x1f8>
+  DB  15,40,21,254,86,0,0                 ; movaps        0x56fe(%rip),%xmm2        # 5e20 <_sk_callback_sse41+0x210>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -14611,7 +14668,7 @@
 PUBLIC _sk_colorburn_sse41
 _sk_colorburn_sse41 LABEL PROC
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,40,21,217,86,0,0              ; movaps        0x56d9(%rip),%xmm10        # 5df0 <_sk_callback_sse41+0x208>
+  DB  68,15,40,21,241,86,0,0              ; movaps        0x56f1(%rip),%xmm10        # 5e30 <_sk_callback_sse41+0x220>
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
   DB  68,15,92,223                        ; subps         %xmm7,%xmm11
   DB  69,15,40,203                        ; movaps        %xmm11,%xmm9
@@ -14691,7 +14748,7 @@
 PUBLIC _sk_colordodge_sse41
 _sk_colordodge_sse41 LABEL PROC
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,40,21,183,85,0,0              ; movaps        0x55b7(%rip),%xmm10        # 5e00 <_sk_callback_sse41+0x218>
+  DB  68,15,40,21,207,85,0,0              ; movaps        0x55cf(%rip),%xmm10        # 5e40 <_sk_callback_sse41+0x230>
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
   DB  68,15,92,223                        ; subps         %xmm7,%xmm11
   DB  69,15,40,227                        ; movaps        %xmm11,%xmm12
@@ -14772,7 +14829,7 @@
   DB  15,40,244                           ; movaps        %xmm4,%xmm6
   DB  15,40,227                           ; movaps        %xmm3,%xmm4
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
-  DB  68,15,40,21,141,84,0,0              ; movaps        0x548d(%rip),%xmm10        # 5e10 <_sk_callback_sse41+0x228>
+  DB  68,15,40,21,165,84,0,0              ; movaps        0x54a5(%rip),%xmm10        # 5e50 <_sk_callback_sse41+0x240>
   DB  65,15,40,234                        ; movaps        %xmm10,%xmm5
   DB  15,92,239                           ; subps         %xmm7,%xmm5
   DB  15,40,197                           ; movaps        %xmm5,%xmm0
@@ -14854,7 +14911,7 @@
 _sk_overlay_sse41 LABEL PROC
   DB  68,15,40,201                        ; movaps        %xmm1,%xmm9
   DB  68,15,40,240                        ; movaps        %xmm0,%xmm14
-  DB  68,15,40,21,111,83,0,0              ; movaps        0x536f(%rip),%xmm10        # 5e20 <_sk_callback_sse41+0x238>
+  DB  68,15,40,21,135,83,0,0              ; movaps        0x5387(%rip),%xmm10        # 5e60 <_sk_callback_sse41+0x250>
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
   DB  68,15,92,223                        ; subps         %xmm7,%xmm11
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
@@ -14938,7 +14995,7 @@
   DB  15,40,198                           ; movaps        %xmm6,%xmm0
   DB  15,94,199                           ; divps         %xmm7,%xmm0
   DB  65,15,84,193                        ; andps         %xmm9,%xmm0
-  DB  15,40,13,66,82,0,0                  ; movaps        0x5242(%rip),%xmm1        # 5e30 <_sk_callback_sse41+0x248>
+  DB  15,40,13,90,82,0,0                  ; movaps        0x525a(%rip),%xmm1        # 5e70 <_sk_callback_sse41+0x260>
   DB  68,15,40,209                        ; movaps        %xmm1,%xmm10
   DB  68,15,92,208                        ; subps         %xmm0,%xmm10
   DB  68,15,40,240                        ; movaps        %xmm0,%xmm14
@@ -14951,10 +15008,10 @@
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  15,89,210                           ; mulps         %xmm2,%xmm2
   DB  15,88,208                           ; addps         %xmm0,%xmm2
-  DB  68,15,40,45,32,82,0,0               ; movaps        0x5220(%rip),%xmm13        # 5e40 <_sk_callback_sse41+0x258>
+  DB  68,15,40,45,56,82,0,0               ; movaps        0x5238(%rip),%xmm13        # 5e80 <_sk_callback_sse41+0x270>
   DB  69,15,88,245                        ; addps         %xmm13,%xmm14
   DB  68,15,89,242                        ; mulps         %xmm2,%xmm14
-  DB  68,15,40,37,32,82,0,0               ; movaps        0x5220(%rip),%xmm12        # 5e50 <_sk_callback_sse41+0x268>
+  DB  68,15,40,37,56,82,0,0               ; movaps        0x5238(%rip),%xmm12        # 5e90 <_sk_callback_sse41+0x280>
   DB  69,15,89,252                        ; mulps         %xmm12,%xmm15
   DB  69,15,88,254                        ; addps         %xmm14,%xmm15
   DB  15,40,198                           ; movaps        %xmm6,%xmm0
@@ -15140,12 +15197,12 @@
   DB  68,15,84,208                        ; andps         %xmm0,%xmm10
   DB  15,84,200                           ; andps         %xmm0,%xmm1
   DB  68,15,84,232                        ; andps         %xmm0,%xmm13
-  DB  15,40,5,134,79,0,0                  ; movaps        0x4f86(%rip),%xmm0        # 5e60 <_sk_callback_sse41+0x278>
+  DB  15,40,5,158,79,0,0                  ; movaps        0x4f9e(%rip),%xmm0        # 5ea0 <_sk_callback_sse41+0x290>
   DB  68,15,89,224                        ; mulps         %xmm0,%xmm12
-  DB  15,40,21,139,79,0,0                 ; movaps        0x4f8b(%rip),%xmm2        # 5e70 <_sk_callback_sse41+0x288>
+  DB  15,40,21,163,79,0,0                 ; movaps        0x4fa3(%rip),%xmm2        # 5eb0 <_sk_callback_sse41+0x2a0>
   DB  15,89,250                           ; mulps         %xmm2,%xmm7
   DB  65,15,88,252                        ; addps         %xmm12,%xmm7
-  DB  68,15,40,53,140,79,0,0              ; movaps        0x4f8c(%rip),%xmm14        # 5e80 <_sk_callback_sse41+0x298>
+  DB  68,15,40,53,164,79,0,0              ; movaps        0x4fa4(%rip),%xmm14        # 5ec0 <_sk_callback_sse41+0x2b0>
   DB  68,15,40,252                        ; movaps        %xmm4,%xmm15
   DB  69,15,89,254                        ; mulps         %xmm14,%xmm15
   DB  68,15,88,255                        ; addps         %xmm7,%xmm15
@@ -15228,7 +15285,7 @@
   DB  65,15,88,214                        ; addps         %xmm14,%xmm2
   DB  15,40,196                           ; movaps        %xmm4,%xmm0
   DB  102,15,56,20,202                    ; blendvps      %xmm0,%xmm2,%xmm1
-  DB  68,15,40,13,81,78,0,0               ; movaps        0x4e51(%rip),%xmm9        # 5e90 <_sk_callback_sse41+0x2a8>
+  DB  68,15,40,13,105,78,0,0              ; movaps        0x4e69(%rip),%xmm9        # 5ed0 <_sk_callback_sse41+0x2c0>
   DB  65,15,40,225                        ; movaps        %xmm9,%xmm4
   DB  15,92,229                           ; subps         %xmm5,%xmm4
   DB  15,40,68,36,48                      ; movaps        0x30(%rsp),%xmm0
@@ -15322,14 +15379,14 @@
   DB  68,15,84,215                        ; andps         %xmm7,%xmm10
   DB  68,15,84,223                        ; andps         %xmm7,%xmm11
   DB  68,15,84,199                        ; andps         %xmm7,%xmm8
-  DB  15,40,21,4,77,0,0                   ; movaps        0x4d04(%rip),%xmm2        # 5ea0 <_sk_callback_sse41+0x2b8>
+  DB  15,40,21,28,77,0,0                  ; movaps        0x4d1c(%rip),%xmm2        # 5ee0 <_sk_callback_sse41+0x2d0>
   DB  15,40,221                           ; movaps        %xmm5,%xmm3
   DB  15,89,218                           ; mulps         %xmm2,%xmm3
-  DB  15,40,13,7,77,0,0                   ; movaps        0x4d07(%rip),%xmm1        # 5eb0 <_sk_callback_sse41+0x2c8>
+  DB  15,40,13,31,77,0,0                  ; movaps        0x4d1f(%rip),%xmm1        # 5ef0 <_sk_callback_sse41+0x2e0>
   DB  15,40,254                           ; movaps        %xmm6,%xmm7
   DB  15,89,249                           ; mulps         %xmm1,%xmm7
   DB  15,88,251                           ; addps         %xmm3,%xmm7
-  DB  68,15,40,45,6,77,0,0                ; movaps        0x4d06(%rip),%xmm13        # 5ec0 <_sk_callback_sse41+0x2d8>
+  DB  68,15,40,45,30,77,0,0               ; movaps        0x4d1e(%rip),%xmm13        # 5f00 <_sk_callback_sse41+0x2f0>
   DB  69,15,89,245                        ; mulps         %xmm13,%xmm14
   DB  68,15,88,247                        ; addps         %xmm7,%xmm14
   DB  65,15,40,218                        ; movaps        %xmm10,%xmm3
@@ -15410,7 +15467,7 @@
   DB  65,15,88,253                        ; addps         %xmm13,%xmm7
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  102,68,15,56,20,223                 ; blendvps      %xmm0,%xmm7,%xmm11
-  DB  68,15,40,13,204,75,0,0              ; movaps        0x4bcc(%rip),%xmm9        # 5ed0 <_sk_callback_sse41+0x2e8>
+  DB  68,15,40,13,228,75,0,0              ; movaps        0x4be4(%rip),%xmm9        # 5f10 <_sk_callback_sse41+0x300>
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  68,15,92,204                        ; subps         %xmm4,%xmm9
   DB  15,40,60,36                         ; movaps        (%rsp),%xmm7
@@ -15465,14 +15522,14 @@
   DB  15,40,231                           ; movaps        %xmm7,%xmm4
   DB  68,15,89,244                        ; mulps         %xmm4,%xmm14
   DB  15,89,204                           ; mulps         %xmm4,%xmm1
-  DB  68,15,40,13,17,75,0,0               ; movaps        0x4b11(%rip),%xmm9        # 5ee0 <_sk_callback_sse41+0x2f8>
+  DB  68,15,40,13,41,75,0,0               ; movaps        0x4b29(%rip),%xmm9        # 5f20 <_sk_callback_sse41+0x310>
   DB  65,15,40,250                        ; movaps        %xmm10,%xmm7
   DB  65,15,89,249                        ; mulps         %xmm9,%xmm7
-  DB  68,15,40,21,17,75,0,0               ; movaps        0x4b11(%rip),%xmm10        # 5ef0 <_sk_callback_sse41+0x308>
+  DB  68,15,40,21,41,75,0,0               ; movaps        0x4b29(%rip),%xmm10        # 5f30 <_sk_callback_sse41+0x320>
   DB  65,15,40,219                        ; movaps        %xmm11,%xmm3
   DB  65,15,89,218                        ; mulps         %xmm10,%xmm3
   DB  15,88,223                           ; addps         %xmm7,%xmm3
-  DB  68,15,40,29,14,75,0,0               ; movaps        0x4b0e(%rip),%xmm11        # 5f00 <_sk_callback_sse41+0x318>
+  DB  68,15,40,29,38,75,0,0               ; movaps        0x4b26(%rip),%xmm11        # 5f40 <_sk_callback_sse41+0x330>
   DB  69,15,40,236                        ; movaps        %xmm12,%xmm13
   DB  69,15,89,235                        ; mulps         %xmm11,%xmm13
   DB  68,15,88,235                        ; addps         %xmm3,%xmm13
@@ -15557,7 +15614,7 @@
   DB  65,15,88,251                        ; addps         %xmm11,%xmm7
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  102,15,56,20,207                    ; blendvps      %xmm0,%xmm7,%xmm1
-  DB  68,15,40,13,202,73,0,0              ; movaps        0x49ca(%rip),%xmm9        # 5f10 <_sk_callback_sse41+0x328>
+  DB  68,15,40,13,226,73,0,0              ; movaps        0x49e2(%rip),%xmm9        # 5f50 <_sk_callback_sse41+0x340>
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  68,15,89,192                        ; mulps         %xmm0,%xmm8
@@ -15609,13 +15666,13 @@
   DB  69,15,89,216                        ; mulps         %xmm8,%xmm11
   DB  68,15,40,203                        ; movaps        %xmm3,%xmm9
   DB  68,15,89,205                        ; mulps         %xmm5,%xmm9
-  DB  68,15,40,5,28,73,0,0                ; movaps        0x491c(%rip),%xmm8        # 5f20 <_sk_callback_sse41+0x338>
+  DB  68,15,40,5,52,73,0,0                ; movaps        0x4934(%rip),%xmm8        # 5f60 <_sk_callback_sse41+0x350>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
-  DB  68,15,40,21,32,73,0,0               ; movaps        0x4920(%rip),%xmm10        # 5f30 <_sk_callback_sse41+0x348>
+  DB  68,15,40,21,56,73,0,0               ; movaps        0x4938(%rip),%xmm10        # 5f70 <_sk_callback_sse41+0x360>
   DB  15,40,233                           ; movaps        %xmm1,%xmm5
   DB  65,15,89,234                        ; mulps         %xmm10,%xmm5
   DB  15,88,232                           ; addps         %xmm0,%xmm5
-  DB  68,15,40,37,30,73,0,0               ; movaps        0x491e(%rip),%xmm12        # 5f40 <_sk_callback_sse41+0x358>
+  DB  68,15,40,37,54,73,0,0               ; movaps        0x4936(%rip),%xmm12        # 5f80 <_sk_callback_sse41+0x370>
   DB  68,15,40,242                        ; movaps        %xmm2,%xmm14
   DB  69,15,89,244                        ; mulps         %xmm12,%xmm14
   DB  68,15,88,245                        ; addps         %xmm5,%xmm14
@@ -15700,7 +15757,7 @@
   DB  65,15,88,244                        ; addps         %xmm12,%xmm6
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
   DB  102,68,15,56,20,206                 ; blendvps      %xmm0,%xmm6,%xmm9
-  DB  15,40,5,212,71,0,0                  ; movaps        0x47d4(%rip),%xmm0        # 5f50 <_sk_callback_sse41+0x368>
+  DB  15,40,5,236,71,0,0                  ; movaps        0x47ec(%rip),%xmm0        # 5f90 <_sk_callback_sse41+0x380>
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  15,92,215                           ; subps         %xmm7,%xmm2
   DB  15,89,226                           ; mulps         %xmm2,%xmm4
@@ -15739,23 +15796,23 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,217,0,0,0                    ; jne           18d3 <_sk_srcover_rgba_8888_sse41+0xe7>
+  DB  15,133,217,0,0,0                    ; jne           18fb <_sk_srcover_rgba_8888_sse41+0xe7>
   DB  243,15,111,60,144                   ; movdqu        (%rax,%rdx,4),%xmm7
   DB  77,133,192                          ; test          %r8,%r8
-  DB  102,15,111,37,86,71,0,0             ; movdqa        0x4756(%rip),%xmm4        # 5f60 <_sk_callback_sse41+0x378>
+  DB  102,15,111,37,110,71,0,0            ; movdqa        0x476e(%rip),%xmm4        # 5fa0 <_sk_callback_sse41+0x390>
   DB  102,15,219,231                      ; pand          %xmm7,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
   DB  102,15,111,239                      ; movdqa        %xmm7,%xmm5
-  DB  102,15,56,0,45,82,71,0,0            ; pshufb        0x4752(%rip),%xmm5        # 5f70 <_sk_callback_sse41+0x388>
+  DB  102,15,56,0,45,106,71,0,0           ; pshufb        0x476a(%rip),%xmm5        # 5fb0 <_sk_callback_sse41+0x3a0>
   DB  15,91,237                           ; cvtdq2ps      %xmm5,%xmm5
   DB  102,15,111,247                      ; movdqa        %xmm7,%xmm6
-  DB  102,15,56,0,53,82,71,0,0            ; pshufb        0x4752(%rip),%xmm6        # 5f80 <_sk_callback_sse41+0x398>
+  DB  102,15,56,0,53,106,71,0,0           ; pshufb        0x476a(%rip),%xmm6        # 5fc0 <_sk_callback_sse41+0x3b0>
   DB  15,91,246                           ; cvtdq2ps      %xmm6,%xmm6
   DB  102,15,114,215,24                   ; psrld         $0x18,%xmm7
   DB  15,91,255                           ; cvtdq2ps      %xmm7,%xmm7
-  DB  68,15,40,5,79,71,0,0                ; movaps        0x474f(%rip),%xmm8        # 5f90 <_sk_callback_sse41+0x3a8>
+  DB  68,15,40,5,103,71,0,0               ; movaps        0x4767(%rip),%xmm8        # 5fd0 <_sk_callback_sse41+0x3c0>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
-  DB  68,15,40,37,83,71,0,0               ; movaps        0x4753(%rip),%xmm12        # 5fa0 <_sk_callback_sse41+0x3b8>
+  DB  68,15,40,37,107,71,0,0              ; movaps        0x476b(%rip),%xmm12        # 5fe0 <_sk_callback_sse41+0x3d0>
   DB  65,15,89,196                        ; mulps         %xmm12,%xmm0
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -15781,7 +15838,7 @@
   DB  102,15,114,240,24                   ; pslld         $0x18,%xmm0
   DB  102,15,235,194                      ; por           %xmm2,%xmm0
   DB  102,15,235,193                      ; por           %xmm1,%xmm0
-  DB  117,85                              ; jne           190f <_sk_srcover_rgba_8888_sse41+0x123>
+  DB  117,85                              ; jne           1937 <_sk_srcover_rgba_8888_sse41+0x123>
   DB  243,15,127,4,144                    ; movdqu        %xmm0,(%rax,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
@@ -15792,32 +15849,32 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,87                              ; je            1937 <_sk_srcover_rgba_8888_sse41+0x14b>
+  DB  116,87                              ; je            195f <_sk_srcover_rgba_8888_sse41+0x14b>
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            18ff <_sk_srcover_rgba_8888_sse41+0x113>
+  DB  116,21                              ; je            1927 <_sk_srcover_rgba_8888_sse41+0x113>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  15,133,11,255,255,255               ; jne           17ff <_sk_srcover_rgba_8888_sse41+0x13>
+  DB  15,133,11,255,255,255               ; jne           1827 <_sk_srcover_rgba_8888_sse41+0x13>
   DB  102,15,110,100,144,8                ; movd          0x8(%rax,%rdx,4),%xmm4
   DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
   DB  243,15,126,36,144                   ; movq          (%rax,%rdx,4),%xmm4
   DB  102,15,58,14,252,15                 ; pblendw       $0xf,%xmm4,%xmm7
-  DB  233,240,254,255,255                 ; jmpq          17ff <_sk_srcover_rgba_8888_sse41+0x13>
+  DB  233,240,254,255,255                 ; jmpq          1827 <_sk_srcover_rgba_8888_sse41+0x13>
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,37                              ; je            1941 <_sk_srcover_rgba_8888_sse41+0x155>
+  DB  116,37                              ; je            1969 <_sk_srcover_rgba_8888_sse41+0x155>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,14                              ; je            1930 <_sk_srcover_rgba_8888_sse41+0x144>
+  DB  116,14                              ; je            1958 <_sk_srcover_rgba_8888_sse41+0x144>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,151                             ; jne           18bf <_sk_srcover_rgba_8888_sse41+0xd3>
+  DB  117,151                             ; jne           18e7 <_sk_srcover_rgba_8888_sse41+0xd3>
   DB  102,15,58,22,68,144,8,2             ; pextrd        $0x2,%xmm0,0x8(%rax,%rdx,4)
   DB  102,15,214,4,144                    ; movq          %xmm0,(%rax,%rdx,4)
-  DB  235,136                             ; jmp           18bf <_sk_srcover_rgba_8888_sse41+0xd3>
+  DB  235,136                             ; jmp           18e7 <_sk_srcover_rgba_8888_sse41+0xd3>
   DB  102,15,110,60,144                   ; movd          (%rax,%rdx,4),%xmm7
-  DB  233,190,254,255,255                 ; jmpq          17ff <_sk_srcover_rgba_8888_sse41+0x13>
+  DB  233,190,254,255,255                 ; jmpq          1827 <_sk_srcover_rgba_8888_sse41+0x13>
   DB  102,15,126,4,144                    ; movd          %xmm0,(%rax,%rdx,4)
-  DB  233,116,255,255,255                 ; jmpq          18bf <_sk_srcover_rgba_8888_sse41+0xd3>
+  DB  233,116,255,255,255                 ; jmpq          18e7 <_sk_srcover_rgba_8888_sse41+0xd3>
 
 PUBLIC _sk_clamp_0_sse41
 _sk_clamp_0_sse41 LABEL PROC
@@ -15831,7 +15888,7 @@
 
 PUBLIC _sk_clamp_1_sse41
 _sk_clamp_1_sse41 LABEL PROC
-  DB  68,15,40,5,69,70,0,0                ; movaps        0x4645(%rip),%xmm8        # 5fb0 <_sk_callback_sse41+0x3c8>
+  DB  68,15,40,5,93,70,0,0                ; movaps        0x465d(%rip),%xmm8        # 5ff0 <_sk_callback_sse41+0x3e0>
   DB  65,15,93,192                        ; minps         %xmm8,%xmm0
   DB  65,15,93,200                        ; minps         %xmm8,%xmm1
   DB  65,15,93,208                        ; minps         %xmm8,%xmm2
@@ -15841,7 +15898,7 @@
 
 PUBLIC _sk_clamp_a_sse41
 _sk_clamp_a_sse41 LABEL PROC
-  DB  15,93,29,58,70,0,0                  ; minps         0x463a(%rip),%xmm3        # 5fc0 <_sk_callback_sse41+0x3d8>
+  DB  15,93,29,82,70,0,0                  ; minps         0x4652(%rip),%xmm3        # 6000 <_sk_callback_sse41+0x3f0>
   DB  15,93,195                           ; minps         %xmm3,%xmm0
   DB  15,93,203                           ; minps         %xmm3,%xmm1
   DB  15,93,211                           ; minps         %xmm3,%xmm2
@@ -15850,7 +15907,7 @@
 
 PUBLIC _sk_clamp_a_dst_sse41
 _sk_clamp_a_dst_sse41 LABEL PROC
-  DB  15,93,61,54,70,0,0                  ; minps         0x4636(%rip),%xmm7        # 5fd0 <_sk_callback_sse41+0x3e8>
+  DB  15,93,61,78,70,0,0                  ; minps         0x464e(%rip),%xmm7        # 6010 <_sk_callback_sse41+0x400>
   DB  15,93,231                           ; minps         %xmm7,%xmm4
   DB  15,93,239                           ; minps         %xmm7,%xmm5
   DB  15,93,247                           ; minps         %xmm7,%xmm6
@@ -15906,7 +15963,7 @@
 PUBLIC _sk_unpremul_sse41
 _sk_unpremul_sse41 LABEL PROC
   DB  69,15,87,192                        ; xorps         %xmm8,%xmm8
-  DB  68,15,40,13,209,69,0,0              ; movaps        0x45d1(%rip),%xmm9        # 5fe0 <_sk_callback_sse41+0x3f8>
+  DB  68,15,40,13,233,69,0,0              ; movaps        0x45e9(%rip),%xmm9        # 6020 <_sk_callback_sse41+0x410>
   DB  68,15,94,203                        ; divps         %xmm3,%xmm9
   DB  68,15,194,195,4                     ; cmpneqps      %xmm3,%xmm8
   DB  69,15,84,193                        ; andps         %xmm9,%xmm8
@@ -15918,20 +15975,20 @@
 
 PUBLIC _sk_from_srgb_sse41
 _sk_from_srgb_sse41 LABEL PROC
-  DB  68,15,40,29,188,69,0,0              ; movaps        0x45bc(%rip),%xmm11        # 5ff0 <_sk_callback_sse41+0x408>
+  DB  68,15,40,29,212,69,0,0              ; movaps        0x45d4(%rip),%xmm11        # 6030 <_sk_callback_sse41+0x420>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
   DB  68,15,40,208                        ; movaps        %xmm0,%xmm10
   DB  69,15,89,210                        ; mulps         %xmm10,%xmm10
-  DB  68,15,40,37,180,69,0,0              ; movaps        0x45b4(%rip),%xmm12        # 6000 <_sk_callback_sse41+0x418>
+  DB  68,15,40,37,204,69,0,0              ; movaps        0x45cc(%rip),%xmm12        # 6040 <_sk_callback_sse41+0x430>
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
   DB  69,15,89,196                        ; mulps         %xmm12,%xmm8
-  DB  68,15,40,45,180,69,0,0              ; movaps        0x45b4(%rip),%xmm13        # 6010 <_sk_callback_sse41+0x428>
+  DB  68,15,40,45,204,69,0,0              ; movaps        0x45cc(%rip),%xmm13        # 6050 <_sk_callback_sse41+0x440>
   DB  69,15,88,197                        ; addps         %xmm13,%xmm8
   DB  69,15,89,194                        ; mulps         %xmm10,%xmm8
-  DB  68,15,40,53,180,69,0,0              ; movaps        0x45b4(%rip),%xmm14        # 6020 <_sk_callback_sse41+0x438>
+  DB  68,15,40,53,204,69,0,0              ; movaps        0x45cc(%rip),%xmm14        # 6060 <_sk_callback_sse41+0x450>
   DB  69,15,88,198                        ; addps         %xmm14,%xmm8
-  DB  68,15,40,61,184,69,0,0              ; movaps        0x45b8(%rip),%xmm15        # 6030 <_sk_callback_sse41+0x448>
+  DB  68,15,40,61,208,69,0,0              ; movaps        0x45d0(%rip),%xmm15        # 6070 <_sk_callback_sse41+0x460>
   DB  65,15,194,199,1                     ; cmpltps       %xmm15,%xmm0
   DB  102,69,15,56,20,193                 ; blendvps      %xmm0,%xmm9,%xmm8
   DB  68,15,40,209                        ; movaps        %xmm1,%xmm10
@@ -15966,19 +16023,19 @@
 _sk_from_srgb_dst_sse41 LABEL PROC
   DB  68,15,40,204                        ; movaps        %xmm4,%xmm9
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,40,29,67,69,0,0               ; movaps        0x4543(%rip),%xmm11        # 6040 <_sk_callback_sse41+0x458>
+  DB  68,15,40,29,91,69,0,0               ; movaps        0x455b(%rip),%xmm11        # 6080 <_sk_callback_sse41+0x470>
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
   DB  69,15,89,211                        ; mulps         %xmm11,%xmm10
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
-  DB  68,15,40,37,60,69,0,0               ; movaps        0x453c(%rip),%xmm12        # 6050 <_sk_callback_sse41+0x468>
+  DB  68,15,40,37,84,69,0,0               ; movaps        0x4554(%rip),%xmm12        # 6090 <_sk_callback_sse41+0x480>
   DB  65,15,89,228                        ; mulps         %xmm12,%xmm4
-  DB  68,15,40,45,64,69,0,0               ; movaps        0x4540(%rip),%xmm13        # 6060 <_sk_callback_sse41+0x478>
+  DB  68,15,40,45,88,69,0,0               ; movaps        0x4558(%rip),%xmm13        # 60a0 <_sk_callback_sse41+0x490>
   DB  65,15,88,229                        ; addps         %xmm13,%xmm4
   DB  15,89,224                           ; mulps         %xmm0,%xmm4
-  DB  68,15,40,53,65,69,0,0               ; movaps        0x4541(%rip),%xmm14        # 6070 <_sk_callback_sse41+0x488>
+  DB  68,15,40,53,89,69,0,0               ; movaps        0x4559(%rip),%xmm14        # 60b0 <_sk_callback_sse41+0x4a0>
   DB  65,15,88,230                        ; addps         %xmm14,%xmm4
-  DB  68,15,40,61,69,69,0,0               ; movaps        0x4545(%rip),%xmm15        # 6080 <_sk_callback_sse41+0x498>
+  DB  68,15,40,61,93,69,0,0               ; movaps        0x455d(%rip),%xmm15        # 60c0 <_sk_callback_sse41+0x4b0>
   DB  69,15,194,207,1                     ; cmpltps       %xmm15,%xmm9
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  102,65,15,56,20,226                 ; blendvps      %xmm0,%xmm10,%xmm4
@@ -16021,22 +16078,22 @@
   DB  15,40,218                           ; movaps        %xmm2,%xmm3
   DB  15,40,209                           ; movaps        %xmm1,%xmm2
   DB  68,15,82,192                        ; rsqrtps       %xmm0,%xmm8
-  DB  68,15,40,29,182,68,0,0              ; movaps        0x44b6(%rip),%xmm11        # 6090 <_sk_callback_sse41+0x4a8>
+  DB  68,15,40,29,206,68,0,0              ; movaps        0x44ce(%rip),%xmm11        # 60d0 <_sk_callback_sse41+0x4c0>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
-  DB  68,15,40,37,182,68,0,0              ; movaps        0x44b6(%rip),%xmm12        # 60a0 <_sk_callback_sse41+0x4b8>
+  DB  68,15,40,37,206,68,0,0              ; movaps        0x44ce(%rip),%xmm12        # 60e0 <_sk_callback_sse41+0x4d0>
   DB  69,15,40,248                        ; movaps        %xmm8,%xmm15
   DB  69,15,89,252                        ; mulps         %xmm12,%xmm15
-  DB  68,15,40,21,182,68,0,0              ; movaps        0x44b6(%rip),%xmm10        # 60b0 <_sk_callback_sse41+0x4c8>
+  DB  68,15,40,21,206,68,0,0              ; movaps        0x44ce(%rip),%xmm10        # 60f0 <_sk_callback_sse41+0x4e0>
   DB  69,15,88,250                        ; addps         %xmm10,%xmm15
   DB  69,15,89,248                        ; mulps         %xmm8,%xmm15
-  DB  68,15,40,45,182,68,0,0              ; movaps        0x44b6(%rip),%xmm13        # 60c0 <_sk_callback_sse41+0x4d8>
+  DB  68,15,40,45,206,68,0,0              ; movaps        0x44ce(%rip),%xmm13        # 6100 <_sk_callback_sse41+0x4f0>
   DB  69,15,88,253                        ; addps         %xmm13,%xmm15
-  DB  68,15,40,53,186,68,0,0              ; movaps        0x44ba(%rip),%xmm14        # 60d0 <_sk_callback_sse41+0x4e8>
+  DB  68,15,40,53,210,68,0,0              ; movaps        0x44d2(%rip),%xmm14        # 6110 <_sk_callback_sse41+0x500>
   DB  69,15,88,198                        ; addps         %xmm14,%xmm8
   DB  69,15,83,192                        ; rcpps         %xmm8,%xmm8
   DB  69,15,89,199                        ; mulps         %xmm15,%xmm8
-  DB  68,15,40,61,182,68,0,0              ; movaps        0x44b6(%rip),%xmm15        # 60e0 <_sk_callback_sse41+0x4f8>
+  DB  68,15,40,61,206,68,0,0              ; movaps        0x44ce(%rip),%xmm15        # 6120 <_sk_callback_sse41+0x510>
   DB  65,15,194,199,1                     ; cmpltps       %xmm15,%xmm0
   DB  102,69,15,56,20,193                 ; blendvps      %xmm0,%xmm9,%xmm8
   DB  68,15,82,202                        ; rsqrtps       %xmm2,%xmm9
@@ -16088,7 +16145,7 @@
   DB  68,15,93,226                        ; minps         %xmm2,%xmm12
   DB  65,15,40,203                        ; movaps        %xmm11,%xmm1
   DB  65,15,92,204                        ; subps         %xmm12,%xmm1
-  DB  68,15,40,53,0,68,0,0                ; movaps        0x4400(%rip),%xmm14        # 60f0 <_sk_callback_sse41+0x508>
+  DB  68,15,40,53,24,68,0,0               ; movaps        0x4418(%rip),%xmm14        # 6130 <_sk_callback_sse41+0x520>
   DB  68,15,94,241                        ; divps         %xmm1,%xmm14
   DB  69,15,40,211                        ; movaps        %xmm11,%xmm10
   DB  69,15,194,208,0                     ; cmpeqps       %xmm8,%xmm10
@@ -16097,27 +16154,27 @@
   DB  65,15,89,198                        ; mulps         %xmm14,%xmm0
   DB  69,15,40,249                        ; movaps        %xmm9,%xmm15
   DB  68,15,194,250,1                     ; cmpltps       %xmm2,%xmm15
-  DB  68,15,84,61,231,67,0,0              ; andps         0x43e7(%rip),%xmm15        # 6100 <_sk_callback_sse41+0x518>
+  DB  68,15,84,61,255,67,0,0              ; andps         0x43ff(%rip),%xmm15        # 6140 <_sk_callback_sse41+0x530>
   DB  68,15,88,248                        ; addps         %xmm0,%xmm15
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
   DB  65,15,194,193,0                     ; cmpeqps       %xmm9,%xmm0
   DB  65,15,92,208                        ; subps         %xmm8,%xmm2
   DB  65,15,89,214                        ; mulps         %xmm14,%xmm2
-  DB  68,15,40,45,218,67,0,0              ; movaps        0x43da(%rip),%xmm13        # 6110 <_sk_callback_sse41+0x528>
+  DB  68,15,40,45,242,67,0,0              ; movaps        0x43f2(%rip),%xmm13        # 6150 <_sk_callback_sse41+0x540>
   DB  65,15,88,213                        ; addps         %xmm13,%xmm2
   DB  69,15,92,193                        ; subps         %xmm9,%xmm8
   DB  69,15,89,198                        ; mulps         %xmm14,%xmm8
-  DB  68,15,88,5,214,67,0,0               ; addps         0x43d6(%rip),%xmm8        # 6120 <_sk_callback_sse41+0x538>
+  DB  68,15,88,5,238,67,0,0               ; addps         0x43ee(%rip),%xmm8        # 6160 <_sk_callback_sse41+0x550>
   DB  102,68,15,56,20,194                 ; blendvps      %xmm0,%xmm2,%xmm8
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  102,69,15,56,20,199                 ; blendvps      %xmm0,%xmm15,%xmm8
-  DB  68,15,89,5,206,67,0,0               ; mulps         0x43ce(%rip),%xmm8        # 6130 <_sk_callback_sse41+0x548>
+  DB  68,15,89,5,230,67,0,0               ; mulps         0x43e6(%rip),%xmm8        # 6170 <_sk_callback_sse41+0x560>
   DB  69,15,40,203                        ; movaps        %xmm11,%xmm9
   DB  69,15,194,204,4                     ; cmpneqps      %xmm12,%xmm9
   DB  69,15,84,193                        ; andps         %xmm9,%xmm8
   DB  69,15,92,235                        ; subps         %xmm11,%xmm13
   DB  69,15,88,220                        ; addps         %xmm12,%xmm11
-  DB  15,40,5,194,67,0,0                  ; movaps        0x43c2(%rip),%xmm0        # 6140 <_sk_callback_sse41+0x558>
+  DB  15,40,5,218,67,0,0                  ; movaps        0x43da(%rip),%xmm0        # 6180 <_sk_callback_sse41+0x570>
   DB  65,15,40,211                        ; movaps        %xmm11,%xmm2
   DB  15,89,208                           ; mulps         %xmm0,%xmm2
   DB  15,194,194,1                        ; cmpltps       %xmm2,%xmm0
@@ -16138,7 +16195,7 @@
   DB  15,41,100,36,32                     ; movaps        %xmm4,0x20(%rsp)
   DB  15,41,92,36,16                      ; movaps        %xmm3,0x10(%rsp)
   DB  68,15,40,208                        ; movaps        %xmm0,%xmm10
-  DB  68,15,40,13,132,67,0,0              ; movaps        0x4384(%rip),%xmm9        # 6150 <_sk_callback_sse41+0x568>
+  DB  68,15,40,13,156,67,0,0              ; movaps        0x439c(%rip),%xmm9        # 6190 <_sk_callback_sse41+0x580>
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  15,194,194,2                        ; cmpleps       %xmm2,%xmm0
   DB  15,40,217                           ; movaps        %xmm1,%xmm3
@@ -16151,19 +16208,19 @@
   DB  15,41,20,36                         ; movaps        %xmm2,(%rsp)
   DB  69,15,88,192                        ; addps         %xmm8,%xmm8
   DB  68,15,92,197                        ; subps         %xmm5,%xmm8
-  DB  68,15,40,53,96,67,0,0               ; movaps        0x4360(%rip),%xmm14        # 6160 <_sk_callback_sse41+0x578>
+  DB  68,15,40,53,120,67,0,0              ; movaps        0x4378(%rip),%xmm14        # 61a0 <_sk_callback_sse41+0x590>
   DB  69,15,88,242                        ; addps         %xmm10,%xmm14
   DB  102,65,15,58,8,198,1                ; roundps       $0x1,%xmm14,%xmm0
   DB  68,15,92,240                        ; subps         %xmm0,%xmm14
-  DB  68,15,40,29,89,67,0,0               ; movaps        0x4359(%rip),%xmm11        # 6170 <_sk_callback_sse41+0x588>
+  DB  68,15,40,29,113,67,0,0              ; movaps        0x4371(%rip),%xmm11        # 61b0 <_sk_callback_sse41+0x5a0>
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
   DB  65,15,194,198,2                     ; cmpleps       %xmm14,%xmm0
   DB  15,40,245                           ; movaps        %xmm5,%xmm6
   DB  65,15,92,240                        ; subps         %xmm8,%xmm6
-  DB  15,40,61,82,67,0,0                  ; movaps        0x4352(%rip),%xmm7        # 6180 <_sk_callback_sse41+0x598>
+  DB  15,40,61,106,67,0,0                 ; movaps        0x436a(%rip),%xmm7        # 61c0 <_sk_callback_sse41+0x5b0>
   DB  69,15,40,238                        ; movaps        %xmm14,%xmm13
   DB  68,15,89,239                        ; mulps         %xmm7,%xmm13
-  DB  15,40,29,83,67,0,0                  ; movaps        0x4353(%rip),%xmm3        # 6190 <_sk_callback_sse41+0x5a8>
+  DB  15,40,29,107,67,0,0                 ; movaps        0x436b(%rip),%xmm3        # 61d0 <_sk_callback_sse41+0x5c0>
   DB  68,15,40,227                        ; movaps        %xmm3,%xmm12
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  68,15,89,230                        ; mulps         %xmm6,%xmm12
@@ -16173,7 +16230,7 @@
   DB  65,15,194,198,2                     ; cmpleps       %xmm14,%xmm0
   DB  68,15,40,253                        ; movaps        %xmm5,%xmm15
   DB  102,69,15,56,20,252                 ; blendvps      %xmm0,%xmm12,%xmm15
-  DB  68,15,40,37,50,67,0,0               ; movaps        0x4332(%rip),%xmm12        # 61a0 <_sk_callback_sse41+0x5b8>
+  DB  68,15,40,37,74,67,0,0               ; movaps        0x434a(%rip),%xmm12        # 61e0 <_sk_callback_sse41+0x5d0>
   DB  65,15,40,196                        ; movaps        %xmm12,%xmm0
   DB  65,15,194,198,2                     ; cmpleps       %xmm14,%xmm0
   DB  68,15,89,238                        ; mulps         %xmm6,%xmm13
@@ -16207,7 +16264,7 @@
   DB  65,15,40,198                        ; movaps        %xmm14,%xmm0
   DB  15,40,20,36                         ; movaps        (%rsp),%xmm2
   DB  102,15,56,20,202                    ; blendvps      %xmm0,%xmm2,%xmm1
-  DB  68,15,88,21,171,66,0,0              ; addps         0x42ab(%rip),%xmm10        # 61b0 <_sk_callback_sse41+0x5c8>
+  DB  68,15,88,21,195,66,0,0              ; addps         0x42c3(%rip),%xmm10        # 61f0 <_sk_callback_sse41+0x5e0>
   DB  102,65,15,58,8,194,1                ; roundps       $0x1,%xmm10,%xmm0
   DB  68,15,92,208                        ; subps         %xmm0,%xmm10
   DB  69,15,194,218,2                     ; cmpleps       %xmm10,%xmm11
@@ -16255,11 +16312,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,52                              ; jne           1fe2 <_sk_scale_u8_sse41+0x3e>
+  DB  117,52                              ; jne           200a <_sk_scale_u8_sse41+0x3e>
   DB  102,69,15,56,49,4,18                ; pmovzxbd      (%r10,%rdx,1),%xmm8
-  DB  102,68,15,219,5,2,66,0,0            ; pand          0x4202(%rip),%xmm8        # 61c0 <_sk_callback_sse41+0x5d8>
+  DB  102,68,15,219,5,26,66,0,0           ; pand          0x421a(%rip),%xmm8        # 6200 <_sk_callback_sse41+0x5f0>
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,6,66,0,0                 ; mulps         0x4206(%rip),%xmm8        # 61d0 <_sk_callback_sse41+0x5e8>
+  DB  68,15,89,5,30,66,0,0                ; mulps         0x421e(%rip),%xmm8        # 6210 <_sk_callback_sse41+0x600>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
@@ -16270,12 +16327,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,59                              ; je            202a <_sk_scale_u8_sse41+0x86>
+  DB  116,59                              ; je            2052 <_sk_scale_u8_sse41+0x86>
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,23                              ; je            2011 <_sk_scale_u8_sse41+0x6d>
+  DB  116,23                              ; je            2039 <_sk_scale_u8_sse41+0x6d>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,181                             ; jne           1fb5 <_sk_scale_u8_sse41+0x11>
+  DB  117,181                             ; jne           1fdd <_sk_scale_u8_sse41+0x11>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  102,69,15,112,192,69                ; pshufd        $0x45,%xmm8,%xmm8
@@ -16283,10 +16340,10 @@
   DB  102,68,15,110,200                   ; movd          %eax,%xmm9
   DB  102,69,15,56,49,201                 ; pmovzxbd      %xmm9,%xmm9
   DB  102,69,15,58,14,193,15              ; pblendw       $0xf,%xmm9,%xmm8
-  DB  235,139                             ; jmp           1fb5 <_sk_scale_u8_sse41+0x11>
+  DB  235,139                             ; jmp           1fdd <_sk_scale_u8_sse41+0x11>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
-  DB  233,124,255,255,255                 ; jmpq          1fb5 <_sk_scale_u8_sse41+0x11>
+  DB  233,124,255,255,255                 ; jmpq          1fdd <_sk_scale_u8_sse41+0x11>
 
 PUBLIC _sk_lerp_1_float_sse41
 _sk_lerp_1_float_sse41 LABEL PROC
@@ -16313,11 +16370,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,72                              ; jne           20c3 <_sk_lerp_u8_sse41+0x52>
+  DB  117,72                              ; jne           20eb <_sk_lerp_u8_sse41+0x52>
   DB  102,69,15,56,49,4,18                ; pmovzxbd      (%r10,%rdx,1),%xmm8
-  DB  102,68,15,219,5,85,65,0,0           ; pand          0x4155(%rip),%xmm8        # 61e0 <_sk_callback_sse41+0x5f8>
+  DB  102,68,15,219,5,109,65,0,0          ; pand          0x416d(%rip),%xmm8        # 6220 <_sk_callback_sse41+0x610>
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,89,65,0,0                ; mulps         0x4159(%rip),%xmm8        # 61f0 <_sk_callback_sse41+0x608>
+  DB  68,15,89,5,113,65,0,0               ; mulps         0x4171(%rip),%xmm8        # 6230 <_sk_callback_sse41+0x620>
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -16335,12 +16392,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,62                              ; je            210e <_sk_lerp_u8_sse41+0x9d>
+  DB  116,62                              ; je            2136 <_sk_lerp_u8_sse41+0x9d>
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,23                              ; je            20f2 <_sk_lerp_u8_sse41+0x81>
+  DB  116,23                              ; je            211a <_sk_lerp_u8_sse41+0x81>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,161                             ; jne           2082 <_sk_lerp_u8_sse41+0x11>
+  DB  117,161                             ; jne           20aa <_sk_lerp_u8_sse41+0x11>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  102,69,15,112,192,69                ; pshufd        $0x45,%xmm8,%xmm8
@@ -16348,29 +16405,29 @@
   DB  102,68,15,110,200                   ; movd          %eax,%xmm9
   DB  102,69,15,56,49,201                 ; pmovzxbd      %xmm9,%xmm9
   DB  102,69,15,58,14,193,15              ; pblendw       $0xf,%xmm9,%xmm8
-  DB  233,116,255,255,255                 ; jmpq          2082 <_sk_lerp_u8_sse41+0x11>
+  DB  233,116,255,255,255                 ; jmpq          20aa <_sk_lerp_u8_sse41+0x11>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
-  DB  233,101,255,255,255                 ; jmpq          2082 <_sk_lerp_u8_sse41+0x11>
+  DB  233,101,255,255,255                 ; jmpq          20aa <_sk_lerp_u8_sse41+0x11>
 
 PUBLIC _sk_lerp_565_sse41
 _sk_lerp_565_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,152,0,0,0                    ; jne           21c3 <_sk_lerp_565_sse41+0xa6>
+  DB  15,133,152,0,0,0                    ; jne           21eb <_sk_lerp_565_sse41+0xa6>
   DB  102,69,15,56,51,20,82               ; pmovzxwd      (%r10,%rdx,2),%xmm10
-  DB  102,68,15,111,5,197,64,0,0          ; movdqa        0x40c5(%rip),%xmm8        # 6200 <_sk_callback_sse41+0x618>
+  DB  102,68,15,111,5,221,64,0,0          ; movdqa        0x40dd(%rip),%xmm8        # 6240 <_sk_callback_sse41+0x630>
   DB  102,69,15,219,194                   ; pand          %xmm10,%xmm8
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,196,64,0,0               ; mulps         0x40c4(%rip),%xmm8        # 6210 <_sk_callback_sse41+0x628>
-  DB  102,68,15,111,13,203,64,0,0         ; movdqa        0x40cb(%rip),%xmm9        # 6220 <_sk_callback_sse41+0x638>
+  DB  68,15,89,5,220,64,0,0               ; mulps         0x40dc(%rip),%xmm8        # 6250 <_sk_callback_sse41+0x640>
+  DB  102,68,15,111,13,227,64,0,0         ; movdqa        0x40e3(%rip),%xmm9        # 6260 <_sk_callback_sse41+0x650>
   DB  102,69,15,219,202                   ; pand          %xmm10,%xmm9
   DB  69,15,91,201                        ; cvtdq2ps      %xmm9,%xmm9
-  DB  68,15,89,13,202,64,0,0              ; mulps         0x40ca(%rip),%xmm9        # 6230 <_sk_callback_sse41+0x648>
-  DB  102,68,15,219,21,209,64,0,0         ; pand          0x40d1(%rip),%xmm10        # 6240 <_sk_callback_sse41+0x658>
+  DB  68,15,89,13,226,64,0,0              ; mulps         0x40e2(%rip),%xmm9        # 6270 <_sk_callback_sse41+0x660>
+  DB  102,68,15,219,21,233,64,0,0         ; pand          0x40e9(%rip),%xmm10        # 6280 <_sk_callback_sse41+0x670>
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
-  DB  68,15,89,21,213,64,0,0              ; mulps         0x40d5(%rip),%xmm10        # 6250 <_sk_callback_sse41+0x668>
+  DB  68,15,89,21,237,64,0,0              ; mulps         0x40ed(%rip),%xmm10        # 6290 <_sk_callback_sse41+0x680>
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -16395,34 +16452,34 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,62                              ; je            220e <_sk_lerp_565_sse41+0xf1>
+  DB  116,62                              ; je            2236 <_sk_lerp_565_sse41+0xf1>
   DB  102,69,15,239,210                   ; pxor          %xmm10,%xmm10
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,27                              ; je            21f6 <_sk_lerp_565_sse41+0xd9>
+  DB  116,27                              ; je            221e <_sk_lerp_565_sse41+0xd9>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  15,133,77,255,255,255               ; jne           2132 <_sk_lerp_565_sse41+0x15>
+  DB  15,133,77,255,255,255               ; jne           215a <_sk_lerp_565_sse41+0x15>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  102,69,15,112,208,69                ; pshufd        $0x45,%xmm8,%xmm10
   DB  102,69,15,110,4,82                  ; movd          (%r10,%rdx,2),%xmm8
   DB  102,69,15,56,51,192                 ; pmovzxwd      %xmm8,%xmm8
   DB  102,69,15,58,14,208,15              ; pblendw       $0xf,%xmm8,%xmm10
-  DB  233,36,255,255,255                  ; jmpq          2132 <_sk_lerp_565_sse41+0x15>
+  DB  233,36,255,255,255                  ; jmpq          215a <_sk_lerp_565_sse41+0x15>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,68,15,110,208                   ; movd          %eax,%xmm10
-  DB  233,21,255,255,255                  ; jmpq          2132 <_sk_lerp_565_sse41+0x15>
+  DB  233,21,255,255,255                  ; jmpq          215a <_sk_lerp_565_sse41+0x15>
 
 PUBLIC _sk_load_tables_sse41
 _sk_load_tables_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,24,1,0,0                     ; jne           2343 <_sk_load_tables_sse41+0x126>
+  DB  15,133,24,1,0,0                     ; jne           236b <_sk_load_tables_sse41+0x126>
   DB  243,69,15,111,4,145                 ; movdqu        (%r9,%rdx,4),%xmm8
   DB  65,87                               ; push          %r15
   DB  65,86                               ; push          %r14
   DB  83                                  ; push          %rbx
-  DB  102,15,111,5,34,64,0,0              ; movdqa        0x4022(%rip),%xmm0        # 6260 <_sk_callback_sse41+0x678>
+  DB  102,15,111,5,58,64,0,0              ; movdqa        0x403a(%rip),%xmm0        # 62a0 <_sk_callback_sse41+0x690>
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,73,15,58,22,193,1               ; pextrq        $0x1,%xmm0,%r9
   DB  102,73,15,126,194                   ; movq          %xmm0,%r10
@@ -16437,7 +16494,7 @@
   DB  102,66,15,58,33,4,179,32            ; insertps      $0x20,(%rbx,%r14,4),%xmm0
   DB  102,66,15,58,33,4,11,48             ; insertps      $0x30,(%rbx,%r9,1),%xmm0
   DB  102,65,15,111,200                   ; movdqa        %xmm8,%xmm1
-  DB  102,15,56,0,13,221,63,0,0           ; pshufb        0x3fdd(%rip),%xmm1        # 6270 <_sk_callback_sse41+0x688>
+  DB  102,15,56,0,13,245,63,0,0           ; pshufb        0x3ff5(%rip),%xmm1        # 62b0 <_sk_callback_sse41+0x6a0>
   DB  102,73,15,58,22,201,1               ; pextrq        $0x1,%xmm1,%r9
   DB  102,72,15,126,203                   ; movq          %xmm1,%rbx
   DB  68,15,182,211                       ; movzbl        %bl,%r10d
@@ -16452,7 +16509,7 @@
   DB  102,15,58,33,202,48                 ; insertps      $0x30,%xmm2,%xmm1
   DB  76,139,72,24                        ; mov           0x18(%rax),%r9
   DB  102,65,15,111,208                   ; movdqa        %xmm8,%xmm2
-  DB  102,15,56,0,21,153,63,0,0           ; pshufb        0x3f99(%rip),%xmm2        # 6280 <_sk_callback_sse41+0x698>
+  DB  102,15,56,0,21,177,63,0,0           ; pshufb        0x3fb1(%rip),%xmm2        # 62c0 <_sk_callback_sse41+0x6b0>
   DB  102,72,15,58,22,211,1               ; pextrq        $0x1,%xmm2,%rbx
   DB  102,72,15,126,208                   ; movq          %xmm2,%rax
   DB  68,15,182,208                       ; movzbl        %al,%r10d
@@ -16467,7 +16524,7 @@
   DB  102,15,58,33,211,48                 ; insertps      $0x30,%xmm3,%xmm2
   DB  102,65,15,114,208,24                ; psrld         $0x18,%xmm8
   DB  65,15,91,216                        ; cvtdq2ps      %xmm8,%xmm3
-  DB  15,89,29,86,63,0,0                  ; mulps         0x3f56(%rip),%xmm3        # 6290 <_sk_callback_sse41+0x6a8>
+  DB  15,89,29,110,63,0,0                 ; mulps         0x3f6e(%rip),%xmm3        # 62d0 <_sk_callback_sse41+0x6c0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
   DB  65,94                               ; pop           %r14
@@ -16476,19 +16533,19 @@
   DB  69,137,194                          ; mov           %r8d,%r10d
   DB  65,128,226,3                        ; and           $0x3,%r10b
   DB  65,128,250,1                        ; cmp           $0x1,%r10b
-  DB  116,52                              ; je            2384 <_sk_load_tables_sse41+0x167>
+  DB  116,52                              ; je            23ac <_sk_load_tables_sse41+0x167>
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,128,250,2                        ; cmp           $0x2,%r10b
-  DB  116,23                              ; je            2372 <_sk_load_tables_sse41+0x155>
+  DB  116,23                              ; je            239a <_sk_load_tables_sse41+0x155>
   DB  65,128,250,3                        ; cmp           $0x3,%r10b
-  DB  15,133,204,254,255,255              ; jne           2231 <_sk_load_tables_sse41+0x14>
+  DB  15,133,204,254,255,255              ; jne           2259 <_sk_load_tables_sse41+0x14>
   DB  102,65,15,110,68,145,8              ; movd          0x8(%r9,%rdx,4),%xmm0
   DB  102,68,15,112,192,69                ; pshufd        $0x45,%xmm0,%xmm8
   DB  243,65,15,126,4,145                 ; movq          (%r9,%rdx,4),%xmm0
   DB  102,68,15,58,14,192,15              ; pblendw       $0xf,%xmm0,%xmm8
-  DB  233,173,254,255,255                 ; jmpq          2231 <_sk_load_tables_sse41+0x14>
+  DB  233,173,254,255,255                 ; jmpq          2259 <_sk_load_tables_sse41+0x14>
   DB  102,69,15,110,4,145                 ; movd          (%r9,%rdx,4),%xmm8
-  DB  233,162,254,255,255                 ; jmpq          2231 <_sk_load_tables_sse41+0x14>
+  DB  233,162,254,255,255                 ; jmpq          2259 <_sk_load_tables_sse41+0x14>
 
 PUBLIC _sk_load_tables_u16_be_sse41
 _sk_load_tables_u16_be_sse41 LABEL PROC
@@ -16496,7 +16553,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,99,1,0,0                     ; jne           2508 <_sk_load_tables_u16_be_sse41+0x179>
+  DB  15,133,99,1,0,0                     ; jne           2530 <_sk_load_tables_u16_be_sse41+0x179>
   DB  102,67,15,16,4,81                   ; movupd        (%r9,%r10,2),%xmm0
   DB  243,67,15,111,76,81,16              ; movdqu        0x10(%r9,%r10,2),%xmm1
   DB  65,87                               ; push          %r15
@@ -16508,7 +16565,7 @@
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,97,200                       ; punpcklwd     %xmm0,%xmm1
   DB  102,68,15,105,200                   ; punpckhwd     %xmm0,%xmm9
-  DB  102,68,15,111,5,196,62,0,0          ; movdqa        0x3ec4(%rip),%xmm8        # 62a0 <_sk_callback_sse41+0x6b8>
+  DB  102,68,15,111,5,220,62,0,0          ; movdqa        0x3edc(%rip),%xmm8        # 62e0 <_sk_callback_sse41+0x6d0>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,15,56,51,192                    ; pmovzxwd      %xmm0,%xmm0
@@ -16526,7 +16583,7 @@
   DB  102,15,58,33,194,32                 ; insertps      $0x20,%xmm2,%xmm0
   DB  243,66,15,16,20,11                  ; movss         (%rbx,%r9,1),%xmm2
   DB  102,15,58,33,194,48                 ; insertps      $0x30,%xmm2,%xmm0
-  DB  102,15,56,0,13,115,62,0,0           ; pshufb        0x3e73(%rip),%xmm1        # 62b0 <_sk_callback_sse41+0x6c8>
+  DB  102,15,56,0,13,139,62,0,0           ; pshufb        0x3e8b(%rip),%xmm1        # 62f0 <_sk_callback_sse41+0x6e0>
   DB  102,15,56,51,201                    ; pmovzxwd      %xmm1,%xmm1
   DB  102,73,15,58,22,201,1               ; pextrq        $0x1,%xmm1,%r9
   DB  102,72,15,126,203                   ; movq          %xmm1,%rbx
@@ -16562,7 +16619,7 @@
   DB  102,65,15,235,216                   ; por           %xmm8,%xmm3
   DB  102,15,56,51,219                    ; pmovzxwd      %xmm3,%xmm3
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,193,61,0,0                 ; mulps         0x3dc1(%rip),%xmm3        # 62c0 <_sk_callback_sse41+0x6d8>
+  DB  15,89,29,217,61,0,0                 ; mulps         0x3dd9(%rip),%xmm3        # 6300 <_sk_callback_sse41+0x6f0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
   DB  65,94                               ; pop           %r14
@@ -16570,16 +16627,16 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,67,15,16,4,81                   ; movsd         (%r9,%r10,2),%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,13                              ; jne           2521 <_sk_load_tables_u16_be_sse41+0x192>
+  DB  117,13                              ; jne           2549 <_sk_load_tables_u16_be_sse41+0x192>
   DB  243,15,126,192                      ; movq          %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,145,254,255,255                 ; jmpq          23b2 <_sk_load_tables_u16_be_sse41+0x23>
+  DB  233,145,254,255,255                 ; jmpq          23da <_sk_load_tables_u16_be_sse41+0x23>
   DB  102,67,15,22,68,81,8                ; movhpd        0x8(%r9,%r10,2),%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,124,254,255,255              ; jb            23b2 <_sk_load_tables_u16_be_sse41+0x23>
+  DB  15,130,124,254,255,255              ; jb            23da <_sk_load_tables_u16_be_sse41+0x23>
   DB  243,67,15,126,76,81,16              ; movq          0x10(%r9,%r10,2),%xmm1
-  DB  233,112,254,255,255                 ; jmpq          23b2 <_sk_load_tables_u16_be_sse41+0x23>
+  DB  233,112,254,255,255                 ; jmpq          23da <_sk_load_tables_u16_be_sse41+0x23>
 
 PUBLIC _sk_load_tables_rgb_u16_be_sse41
 _sk_load_tables_rgb_u16_be_sse41 LABEL PROC
@@ -16587,7 +16644,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,82                        ; lea           (%rdx,%rdx,2),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,83,1,0,0                     ; jne           26a7 <_sk_load_tables_rgb_u16_be_sse41+0x165>
+  DB  15,133,83,1,0,0                     ; jne           26cf <_sk_load_tables_rgb_u16_be_sse41+0x165>
   DB  243,67,15,111,20,81                 ; movdqu        (%r9,%r10,2),%xmm2
   DB  243,67,15,111,76,81,8               ; movdqu        0x8(%r9,%r10,2),%xmm1
   DB  102,15,115,217,4                    ; psrldq        $0x4,%xmm1
@@ -16602,7 +16659,7 @@
   DB  102,68,15,97,200                    ; punpcklwd     %xmm0,%xmm9
   DB  102,15,111,202                      ; movdqa        %xmm2,%xmm1
   DB  102,65,15,97,201                    ; punpcklwd     %xmm9,%xmm1
-  DB  102,68,15,111,5,54,61,0,0           ; movdqa        0x3d36(%rip),%xmm8        # 62d0 <_sk_callback_sse41+0x6e8>
+  DB  102,68,15,111,5,78,61,0,0           ; movdqa        0x3d4e(%rip),%xmm8        # 6310 <_sk_callback_sse41+0x700>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,15,56,51,192                    ; pmovzxwd      %xmm0,%xmm0
@@ -16620,7 +16677,7 @@
   DB  102,15,58,33,195,32                 ; insertps      $0x20,%xmm3,%xmm0
   DB  243,66,15,16,28,11                  ; movss         (%rbx,%r9,1),%xmm3
   DB  102,15,58,33,195,48                 ; insertps      $0x30,%xmm3,%xmm0
-  DB  102,15,56,0,13,229,60,0,0           ; pshufb        0x3ce5(%rip),%xmm1        # 62e0 <_sk_callback_sse41+0x6f8>
+  DB  102,15,56,0,13,253,60,0,0           ; pshufb        0x3cfd(%rip),%xmm1        # 6320 <_sk_callback_sse41+0x710>
   DB  102,15,56,51,201                    ; pmovzxwd      %xmm1,%xmm1
   DB  102,73,15,58,22,201,1               ; pextrq        $0x1,%xmm1,%r9
   DB  102,72,15,126,203                   ; movq          %xmm1,%rbx
@@ -16651,7 +16708,7 @@
   DB  243,65,15,16,28,25                  ; movss         (%r9,%rbx,1),%xmm3
   DB  102,15,58,33,211,48                 ; insertps      $0x30,%xmm3,%xmm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,80,60,0,0                  ; movaps        0x3c50(%rip),%xmm3        # 62f0 <_sk_callback_sse41+0x708>
+  DB  15,40,29,104,60,0,0                 ; movaps        0x3c68(%rip),%xmm3        # 6330 <_sk_callback_sse41+0x720>
   DB  91                                  ; pop           %rbx
   DB  65,94                               ; pop           %r14
   DB  65,95                               ; pop           %r15
@@ -16660,21 +16717,21 @@
   DB  102,67,15,196,84,81,4,2             ; pinsrw        $0x2,0x4(%r9,%r10,2),%xmm2
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,14                              ; jne           26cd <_sk_load_tables_rgb_u16_be_sse41+0x18b>
+  DB  117,14                              ; jne           26f5 <_sk_load_tables_rgb_u16_be_sse41+0x18b>
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
-  DB  233,173,254,255,255                 ; jmpq          257a <_sk_load_tables_rgb_u16_be_sse41+0x38>
+  DB  233,173,254,255,255                 ; jmpq          25a2 <_sk_load_tables_rgb_u16_be_sse41+0x38>
   DB  102,71,15,110,76,81,6               ; movd          0x6(%r9,%r10,2),%xmm9
   DB  102,71,15,196,76,81,10,2            ; pinsrw        $0x2,0xa(%r9,%r10,2),%xmm9
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,24                              ; jb            26fe <_sk_load_tables_rgb_u16_be_sse41+0x1bc>
+  DB  114,24                              ; jb            2726 <_sk_load_tables_rgb_u16_be_sse41+0x1bc>
   DB  102,67,15,110,76,81,12              ; movd          0xc(%r9,%r10,2),%xmm1
   DB  102,67,15,196,76,81,16,2            ; pinsrw        $0x2,0x10(%r9,%r10,2),%xmm1
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
-  DB  233,124,254,255,255                 ; jmpq          257a <_sk_load_tables_rgb_u16_be_sse41+0x38>
+  DB  233,124,254,255,255                 ; jmpq          25a2 <_sk_load_tables_rgb_u16_be_sse41+0x38>
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,115,254,255,255                 ; jmpq          257a <_sk_load_tables_rgb_u16_be_sse41+0x38>
+  DB  233,115,254,255,255                 ; jmpq          25a2 <_sk_load_tables_rgb_u16_be_sse41+0x38>
 
 PUBLIC _sk_byte_tables_sse41
 _sk_byte_tables_sse41 LABEL PROC
@@ -16683,7 +16740,7 @@
   DB  65,84                               ; push          %r12
   DB  83                                  ; push          %rbx
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,232,59,0,0               ; movaps        0x3be8(%rip),%xmm8        # 6300 <_sk_callback_sse41+0x718>
+  DB  68,15,40,5,0,60,0,0                 ; movaps        0x3c00(%rip),%xmm8        # 6340 <_sk_callback_sse41+0x730>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,91,192                       ; cvtps2dq      %xmm0,%xmm0
   DB  102,73,15,58,22,193,1               ; pextrq        $0x1,%xmm0,%r9
@@ -16702,7 +16759,7 @@
   DB  102,15,58,32,195,3                  ; pinsrb        $0x3,%ebx,%xmm0
   DB  102,15,56,49,192                    ; pmovzxbd      %xmm0,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,13,153,59,0,0              ; movaps        0x3b99(%rip),%xmm9        # 6310 <_sk_callback_sse41+0x728>
+  DB  68,15,40,13,177,59,0,0              ; movaps        0x3bb1(%rip),%xmm9        # 6350 <_sk_callback_sse41+0x740>
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,91,201                       ; cvtps2dq      %xmm1,%xmm1
@@ -16796,7 +16853,7 @@
   DB  102,15,58,32,195,3                  ; pinsrb        $0x3,%ebx,%xmm0
   DB  102,15,56,49,192                    ; pmovzxbd      %xmm0,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,13,17,58,0,0               ; movaps        0x3a11(%rip),%xmm9        # 6320 <_sk_callback_sse41+0x738>
+  DB  68,15,40,13,41,58,0,0               ; movaps        0x3a29(%rip),%xmm9        # 6360 <_sk_callback_sse41+0x750>
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,91,201                       ; cvtps2dq      %xmm1,%xmm1
@@ -16973,31 +17030,31 @@
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,194                        ; cvtdq2ps      %xmm10,%xmm8
-  DB  68,15,89,5,89,55,0,0                ; mulps         0x3759(%rip),%xmm8        # 6330 <_sk_callback_sse41+0x748>
-  DB  68,15,84,21,97,55,0,0               ; andps         0x3761(%rip),%xmm10        # 6340 <_sk_callback_sse41+0x758>
-  DB  68,15,86,21,105,55,0,0              ; orps          0x3769(%rip),%xmm10        # 6350 <_sk_callback_sse41+0x768>
-  DB  68,15,88,5,113,55,0,0               ; addps         0x3771(%rip),%xmm8        # 6360 <_sk_callback_sse41+0x778>
-  DB  68,15,40,37,121,55,0,0              ; movaps        0x3779(%rip),%xmm12        # 6370 <_sk_callback_sse41+0x788>
+  DB  68,15,89,5,113,55,0,0               ; mulps         0x3771(%rip),%xmm8        # 6370 <_sk_callback_sse41+0x760>
+  DB  68,15,84,21,121,55,0,0              ; andps         0x3779(%rip),%xmm10        # 6380 <_sk_callback_sse41+0x770>
+  DB  68,15,86,21,129,55,0,0              ; orps          0x3781(%rip),%xmm10        # 6390 <_sk_callback_sse41+0x780>
+  DB  68,15,88,5,137,55,0,0               ; addps         0x3789(%rip),%xmm8        # 63a0 <_sk_callback_sse41+0x790>
+  DB  68,15,40,37,145,55,0,0              ; movaps        0x3791(%rip),%xmm12        # 63b0 <_sk_callback_sse41+0x7a0>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,196                        ; subps         %xmm12,%xmm8
-  DB  68,15,88,21,121,55,0,0              ; addps         0x3779(%rip),%xmm10        # 6380 <_sk_callback_sse41+0x798>
-  DB  68,15,40,37,129,55,0,0              ; movaps        0x3781(%rip),%xmm12        # 6390 <_sk_callback_sse41+0x7a8>
+  DB  68,15,88,21,145,55,0,0              ; addps         0x3791(%rip),%xmm10        # 63c0 <_sk_callback_sse41+0x7b0>
+  DB  68,15,40,37,153,55,0,0              ; movaps        0x3799(%rip),%xmm12        # 63d0 <_sk_callback_sse41+0x7c0>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,196                        ; subps         %xmm12,%xmm8
   DB  69,15,89,195                        ; mulps         %xmm11,%xmm8
   DB  102,69,15,58,8,208,1                ; roundps       $0x1,%xmm8,%xmm10
   DB  69,15,40,216                        ; movaps        %xmm8,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  68,15,88,5,110,55,0,0               ; addps         0x376e(%rip),%xmm8        # 63a0 <_sk_callback_sse41+0x7b8>
-  DB  68,15,40,21,118,55,0,0              ; movaps        0x3776(%rip),%xmm10        # 63b0 <_sk_callback_sse41+0x7c8>
+  DB  68,15,88,5,134,55,0,0               ; addps         0x3786(%rip),%xmm8        # 63e0 <_sk_callback_sse41+0x7d0>
+  DB  68,15,40,21,142,55,0,0              ; movaps        0x378e(%rip),%xmm10        # 63f0 <_sk_callback_sse41+0x7e0>
   DB  69,15,89,211                        ; mulps         %xmm11,%xmm10
   DB  69,15,92,194                        ; subps         %xmm10,%xmm8
-  DB  68,15,40,21,118,55,0,0              ; movaps        0x3776(%rip),%xmm10        # 63c0 <_sk_callback_sse41+0x7d8>
+  DB  68,15,40,21,142,55,0,0              ; movaps        0x378e(%rip),%xmm10        # 6400 <_sk_callback_sse41+0x7f0>
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
-  DB  68,15,40,29,122,55,0,0              ; movaps        0x377a(%rip),%xmm11        # 63d0 <_sk_callback_sse41+0x7e8>
+  DB  68,15,40,29,146,55,0,0              ; movaps        0x3792(%rip),%xmm11        # 6410 <_sk_callback_sse41+0x800>
   DB  69,15,94,218                        ; divps         %xmm10,%xmm11
   DB  69,15,88,216                        ; addps         %xmm8,%xmm11
-  DB  68,15,89,29,122,55,0,0              ; mulps         0x377a(%rip),%xmm11        # 63e0 <_sk_callback_sse41+0x7f8>
+  DB  68,15,89,29,146,55,0,0              ; mulps         0x3792(%rip),%xmm11        # 6420 <_sk_callback_sse41+0x810>
   DB  102,69,15,91,211                    ; cvtps2dq      %xmm11,%xmm10
   DB  243,68,15,16,64,20                  ; movss         0x14(%rax),%xmm8
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
@@ -17005,7 +17062,7 @@
   DB  102,69,15,56,20,193                 ; blendvps      %xmm0,%xmm9,%xmm8
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  68,15,95,192                        ; maxps         %xmm0,%xmm8
-  DB  68,15,93,5,97,55,0,0                ; minps         0x3761(%rip),%xmm8        # 63f0 <_sk_callback_sse41+0x808>
+  DB  68,15,93,5,121,55,0,0               ; minps         0x3779(%rip),%xmm8        # 6430 <_sk_callback_sse41+0x820>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -17033,31 +17090,31 @@
   DB  68,15,88,217                        ; addps         %xmm1,%xmm11
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,91,227                        ; cvtdq2ps      %xmm11,%xmm12
-  DB  68,15,89,37,2,55,0,0                ; mulps         0x3702(%rip),%xmm12        # 6400 <_sk_callback_sse41+0x818>
-  DB  68,15,84,29,10,55,0,0               ; andps         0x370a(%rip),%xmm11        # 6410 <_sk_callback_sse41+0x828>
-  DB  68,15,86,29,18,55,0,0               ; orps          0x3712(%rip),%xmm11        # 6420 <_sk_callback_sse41+0x838>
-  DB  68,15,88,37,26,55,0,0               ; addps         0x371a(%rip),%xmm12        # 6430 <_sk_callback_sse41+0x848>
-  DB  15,40,13,35,55,0,0                  ; movaps        0x3723(%rip),%xmm1        # 6440 <_sk_callback_sse41+0x858>
+  DB  68,15,89,37,26,55,0,0               ; mulps         0x371a(%rip),%xmm12        # 6440 <_sk_callback_sse41+0x830>
+  DB  68,15,84,29,34,55,0,0               ; andps         0x3722(%rip),%xmm11        # 6450 <_sk_callback_sse41+0x840>
+  DB  68,15,86,29,42,55,0,0               ; orps          0x372a(%rip),%xmm11        # 6460 <_sk_callback_sse41+0x850>
+  DB  68,15,88,37,50,55,0,0               ; addps         0x3732(%rip),%xmm12        # 6470 <_sk_callback_sse41+0x860>
+  DB  15,40,13,59,55,0,0                  ; movaps        0x373b(%rip),%xmm1        # 6480 <_sk_callback_sse41+0x870>
   DB  65,15,89,203                        ; mulps         %xmm11,%xmm1
   DB  68,15,92,225                        ; subps         %xmm1,%xmm12
-  DB  68,15,88,29,35,55,0,0               ; addps         0x3723(%rip),%xmm11        # 6450 <_sk_callback_sse41+0x868>
-  DB  15,40,13,44,55,0,0                  ; movaps        0x372c(%rip),%xmm1        # 6460 <_sk_callback_sse41+0x878>
+  DB  68,15,88,29,59,55,0,0               ; addps         0x373b(%rip),%xmm11        # 6490 <_sk_callback_sse41+0x880>
+  DB  15,40,13,68,55,0,0                  ; movaps        0x3744(%rip),%xmm1        # 64a0 <_sk_callback_sse41+0x890>
   DB  65,15,94,203                        ; divps         %xmm11,%xmm1
   DB  68,15,92,225                        ; subps         %xmm1,%xmm12
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  102,69,15,58,8,212,1                ; roundps       $0x1,%xmm12,%xmm10
   DB  69,15,40,220                        ; movaps        %xmm12,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  68,15,88,37,25,55,0,0               ; addps         0x3719(%rip),%xmm12        # 6470 <_sk_callback_sse41+0x888>
-  DB  15,40,13,34,55,0,0                  ; movaps        0x3722(%rip),%xmm1        # 6480 <_sk_callback_sse41+0x898>
+  DB  68,15,88,37,49,55,0,0               ; addps         0x3731(%rip),%xmm12        # 64b0 <_sk_callback_sse41+0x8a0>
+  DB  15,40,13,58,55,0,0                  ; movaps        0x373a(%rip),%xmm1        # 64c0 <_sk_callback_sse41+0x8b0>
   DB  65,15,89,203                        ; mulps         %xmm11,%xmm1
   DB  68,15,92,225                        ; subps         %xmm1,%xmm12
-  DB  68,15,40,21,34,55,0,0               ; movaps        0x3722(%rip),%xmm10        # 6490 <_sk_callback_sse41+0x8a8>
+  DB  68,15,40,21,58,55,0,0               ; movaps        0x373a(%rip),%xmm10        # 64d0 <_sk_callback_sse41+0x8c0>
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
-  DB  15,40,13,39,55,0,0                  ; movaps        0x3727(%rip),%xmm1        # 64a0 <_sk_callback_sse41+0x8b8>
+  DB  15,40,13,63,55,0,0                  ; movaps        0x373f(%rip),%xmm1        # 64e0 <_sk_callback_sse41+0x8d0>
   DB  65,15,94,202                        ; divps         %xmm10,%xmm1
   DB  65,15,88,204                        ; addps         %xmm12,%xmm1
-  DB  15,89,13,40,55,0,0                  ; mulps         0x3728(%rip),%xmm1        # 64b0 <_sk_callback_sse41+0x8c8>
+  DB  15,89,13,64,55,0,0                  ; mulps         0x3740(%rip),%xmm1        # 64f0 <_sk_callback_sse41+0x8e0>
   DB  102,68,15,91,209                    ; cvtps2dq      %xmm1,%xmm10
   DB  243,15,16,72,20                     ; movss         0x14(%rax),%xmm1
   DB  15,198,201,0                        ; shufps        $0x0,%xmm1,%xmm1
@@ -17065,7 +17122,7 @@
   DB  102,65,15,56,20,201                 ; blendvps      %xmm0,%xmm9,%xmm1
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  15,95,200                           ; maxps         %xmm0,%xmm1
-  DB  15,93,13,19,55,0,0                  ; minps         0x3713(%rip),%xmm1        # 64c0 <_sk_callback_sse41+0x8d8>
+  DB  15,93,13,43,55,0,0                  ; minps         0x372b(%rip),%xmm1        # 6500 <_sk_callback_sse41+0x8f0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -17093,31 +17150,31 @@
   DB  68,15,88,218                        ; addps         %xmm2,%xmm11
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,91,227                        ; cvtdq2ps      %xmm11,%xmm12
-  DB  68,15,89,37,180,54,0,0              ; mulps         0x36b4(%rip),%xmm12        # 64d0 <_sk_callback_sse41+0x8e8>
-  DB  68,15,84,29,188,54,0,0              ; andps         0x36bc(%rip),%xmm11        # 64e0 <_sk_callback_sse41+0x8f8>
-  DB  68,15,86,29,196,54,0,0              ; orps          0x36c4(%rip),%xmm11        # 64f0 <_sk_callback_sse41+0x908>
-  DB  68,15,88,37,204,54,0,0              ; addps         0x36cc(%rip),%xmm12        # 6500 <_sk_callback_sse41+0x918>
-  DB  15,40,21,213,54,0,0                 ; movaps        0x36d5(%rip),%xmm2        # 6510 <_sk_callback_sse41+0x928>
+  DB  68,15,89,37,204,54,0,0              ; mulps         0x36cc(%rip),%xmm12        # 6510 <_sk_callback_sse41+0x900>
+  DB  68,15,84,29,212,54,0,0              ; andps         0x36d4(%rip),%xmm11        # 6520 <_sk_callback_sse41+0x910>
+  DB  68,15,86,29,220,54,0,0              ; orps          0x36dc(%rip),%xmm11        # 6530 <_sk_callback_sse41+0x920>
+  DB  68,15,88,37,228,54,0,0              ; addps         0x36e4(%rip),%xmm12        # 6540 <_sk_callback_sse41+0x930>
+  DB  15,40,21,237,54,0,0                 ; movaps        0x36ed(%rip),%xmm2        # 6550 <_sk_callback_sse41+0x940>
   DB  65,15,89,211                        ; mulps         %xmm11,%xmm2
   DB  68,15,92,226                        ; subps         %xmm2,%xmm12
-  DB  68,15,88,29,213,54,0,0              ; addps         0x36d5(%rip),%xmm11        # 6520 <_sk_callback_sse41+0x938>
-  DB  15,40,21,222,54,0,0                 ; movaps        0x36de(%rip),%xmm2        # 6530 <_sk_callback_sse41+0x948>
+  DB  68,15,88,29,237,54,0,0              ; addps         0x36ed(%rip),%xmm11        # 6560 <_sk_callback_sse41+0x950>
+  DB  15,40,21,246,54,0,0                 ; movaps        0x36f6(%rip),%xmm2        # 6570 <_sk_callback_sse41+0x960>
   DB  65,15,94,211                        ; divps         %xmm11,%xmm2
   DB  68,15,92,226                        ; subps         %xmm2,%xmm12
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  102,69,15,58,8,212,1                ; roundps       $0x1,%xmm12,%xmm10
   DB  69,15,40,220                        ; movaps        %xmm12,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  68,15,88,37,203,54,0,0              ; addps         0x36cb(%rip),%xmm12        # 6540 <_sk_callback_sse41+0x958>
-  DB  15,40,21,212,54,0,0                 ; movaps        0x36d4(%rip),%xmm2        # 6550 <_sk_callback_sse41+0x968>
+  DB  68,15,88,37,227,54,0,0              ; addps         0x36e3(%rip),%xmm12        # 6580 <_sk_callback_sse41+0x970>
+  DB  15,40,21,236,54,0,0                 ; movaps        0x36ec(%rip),%xmm2        # 6590 <_sk_callback_sse41+0x980>
   DB  65,15,89,211                        ; mulps         %xmm11,%xmm2
   DB  68,15,92,226                        ; subps         %xmm2,%xmm12
-  DB  68,15,40,21,212,54,0,0              ; movaps        0x36d4(%rip),%xmm10        # 6560 <_sk_callback_sse41+0x978>
+  DB  68,15,40,21,236,54,0,0              ; movaps        0x36ec(%rip),%xmm10        # 65a0 <_sk_callback_sse41+0x990>
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
-  DB  15,40,21,217,54,0,0                 ; movaps        0x36d9(%rip),%xmm2        # 6570 <_sk_callback_sse41+0x988>
+  DB  15,40,21,241,54,0,0                 ; movaps        0x36f1(%rip),%xmm2        # 65b0 <_sk_callback_sse41+0x9a0>
   DB  65,15,94,210                        ; divps         %xmm10,%xmm2
   DB  65,15,88,212                        ; addps         %xmm12,%xmm2
-  DB  15,89,21,218,54,0,0                 ; mulps         0x36da(%rip),%xmm2        # 6580 <_sk_callback_sse41+0x998>
+  DB  15,89,21,242,54,0,0                 ; mulps         0x36f2(%rip),%xmm2        # 65c0 <_sk_callback_sse41+0x9b0>
   DB  102,68,15,91,210                    ; cvtps2dq      %xmm2,%xmm10
   DB  243,15,16,80,20                     ; movss         0x14(%rax),%xmm2
   DB  15,198,210,0                        ; shufps        $0x0,%xmm2,%xmm2
@@ -17125,7 +17182,7 @@
   DB  102,65,15,56,20,209                 ; blendvps      %xmm0,%xmm9,%xmm2
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  15,95,208                           ; maxps         %xmm0,%xmm2
-  DB  15,93,21,197,54,0,0                 ; minps         0x36c5(%rip),%xmm2        # 6590 <_sk_callback_sse41+0x9a8>
+  DB  15,93,21,221,54,0,0                 ; minps         0x36dd(%rip),%xmm2        # 65d0 <_sk_callback_sse41+0x9c0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -17153,31 +17210,31 @@
   DB  68,15,88,219                        ; addps         %xmm3,%xmm11
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,91,227                        ; cvtdq2ps      %xmm11,%xmm12
-  DB  68,15,89,37,102,54,0,0              ; mulps         0x3666(%rip),%xmm12        # 65a0 <_sk_callback_sse41+0x9b8>
-  DB  68,15,84,29,110,54,0,0              ; andps         0x366e(%rip),%xmm11        # 65b0 <_sk_callback_sse41+0x9c8>
-  DB  68,15,86,29,118,54,0,0              ; orps          0x3676(%rip),%xmm11        # 65c0 <_sk_callback_sse41+0x9d8>
-  DB  68,15,88,37,126,54,0,0              ; addps         0x367e(%rip),%xmm12        # 65d0 <_sk_callback_sse41+0x9e8>
-  DB  15,40,29,135,54,0,0                 ; movaps        0x3687(%rip),%xmm3        # 65e0 <_sk_callback_sse41+0x9f8>
+  DB  68,15,89,37,126,54,0,0              ; mulps         0x367e(%rip),%xmm12        # 65e0 <_sk_callback_sse41+0x9d0>
+  DB  68,15,84,29,134,54,0,0              ; andps         0x3686(%rip),%xmm11        # 65f0 <_sk_callback_sse41+0x9e0>
+  DB  68,15,86,29,142,54,0,0              ; orps          0x368e(%rip),%xmm11        # 6600 <_sk_callback_sse41+0x9f0>
+  DB  68,15,88,37,150,54,0,0              ; addps         0x3696(%rip),%xmm12        # 6610 <_sk_callback_sse41+0xa00>
+  DB  15,40,29,159,54,0,0                 ; movaps        0x369f(%rip),%xmm3        # 6620 <_sk_callback_sse41+0xa10>
   DB  65,15,89,219                        ; mulps         %xmm11,%xmm3
   DB  68,15,92,227                        ; subps         %xmm3,%xmm12
-  DB  68,15,88,29,135,54,0,0              ; addps         0x3687(%rip),%xmm11        # 65f0 <_sk_callback_sse41+0xa08>
-  DB  15,40,29,144,54,0,0                 ; movaps        0x3690(%rip),%xmm3        # 6600 <_sk_callback_sse41+0xa18>
+  DB  68,15,88,29,159,54,0,0              ; addps         0x369f(%rip),%xmm11        # 6630 <_sk_callback_sse41+0xa20>
+  DB  15,40,29,168,54,0,0                 ; movaps        0x36a8(%rip),%xmm3        # 6640 <_sk_callback_sse41+0xa30>
   DB  65,15,94,219                        ; divps         %xmm11,%xmm3
   DB  68,15,92,227                        ; subps         %xmm3,%xmm12
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  102,69,15,58,8,212,1                ; roundps       $0x1,%xmm12,%xmm10
   DB  69,15,40,220                        ; movaps        %xmm12,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  68,15,88,37,125,54,0,0              ; addps         0x367d(%rip),%xmm12        # 6610 <_sk_callback_sse41+0xa28>
-  DB  15,40,29,134,54,0,0                 ; movaps        0x3686(%rip),%xmm3        # 6620 <_sk_callback_sse41+0xa38>
+  DB  68,15,88,37,149,54,0,0              ; addps         0x3695(%rip),%xmm12        # 6650 <_sk_callback_sse41+0xa40>
+  DB  15,40,29,158,54,0,0                 ; movaps        0x369e(%rip),%xmm3        # 6660 <_sk_callback_sse41+0xa50>
   DB  65,15,89,219                        ; mulps         %xmm11,%xmm3
   DB  68,15,92,227                        ; subps         %xmm3,%xmm12
-  DB  68,15,40,21,134,54,0,0              ; movaps        0x3686(%rip),%xmm10        # 6630 <_sk_callback_sse41+0xa48>
+  DB  68,15,40,21,158,54,0,0              ; movaps        0x369e(%rip),%xmm10        # 6670 <_sk_callback_sse41+0xa60>
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
-  DB  15,40,29,139,54,0,0                 ; movaps        0x368b(%rip),%xmm3        # 6640 <_sk_callback_sse41+0xa58>
+  DB  15,40,29,163,54,0,0                 ; movaps        0x36a3(%rip),%xmm3        # 6680 <_sk_callback_sse41+0xa70>
   DB  65,15,94,218                        ; divps         %xmm10,%xmm3
   DB  65,15,88,220                        ; addps         %xmm12,%xmm3
-  DB  15,89,29,140,54,0,0                 ; mulps         0x368c(%rip),%xmm3        # 6650 <_sk_callback_sse41+0xa68>
+  DB  15,89,29,164,54,0,0                 ; mulps         0x36a4(%rip),%xmm3        # 6690 <_sk_callback_sse41+0xa80>
   DB  102,68,15,91,211                    ; cvtps2dq      %xmm3,%xmm10
   DB  243,15,16,88,20                     ; movss         0x14(%rax),%xmm3
   DB  15,198,219,0                        ; shufps        $0x0,%xmm3,%xmm3
@@ -17185,7 +17242,7 @@
   DB  102,65,15,56,20,217                 ; blendvps      %xmm0,%xmm9,%xmm3
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  15,95,216                           ; maxps         %xmm0,%xmm3
-  DB  15,93,29,119,54,0,0                 ; minps         0x3677(%rip),%xmm3        # 6660 <_sk_callback_sse41+0xa78>
+  DB  15,93,29,143,54,0,0                 ; minps         0x368f(%rip),%xmm3        # 66a0 <_sk_callback_sse41+0xa90>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -17193,29 +17250,29 @@
 PUBLIC _sk_lab_to_xyz_sse41
 _sk_lab_to_xyz_sse41 LABEL PROC
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,89,5,115,54,0,0               ; mulps         0x3673(%rip),%xmm8        # 6670 <_sk_callback_sse41+0xa88>
-  DB  68,15,40,13,123,54,0,0              ; movaps        0x367b(%rip),%xmm9        # 6680 <_sk_callback_sse41+0xa98>
+  DB  68,15,89,5,139,54,0,0               ; mulps         0x368b(%rip),%xmm8        # 66b0 <_sk_callback_sse41+0xaa0>
+  DB  68,15,40,13,147,54,0,0              ; movaps        0x3693(%rip),%xmm9        # 66c0 <_sk_callback_sse41+0xab0>
   DB  65,15,89,201                        ; mulps         %xmm9,%xmm1
-  DB  15,40,5,128,54,0,0                  ; movaps        0x3680(%rip),%xmm0        # 6690 <_sk_callback_sse41+0xaa8>
+  DB  15,40,5,152,54,0,0                  ; movaps        0x3698(%rip),%xmm0        # 66d0 <_sk_callback_sse41+0xac0>
   DB  15,88,200                           ; addps         %xmm0,%xmm1
   DB  65,15,89,209                        ; mulps         %xmm9,%xmm2
   DB  15,88,208                           ; addps         %xmm0,%xmm2
-  DB  68,15,88,5,126,54,0,0               ; addps         0x367e(%rip),%xmm8        # 66a0 <_sk_callback_sse41+0xab8>
-  DB  68,15,89,5,134,54,0,0               ; mulps         0x3686(%rip),%xmm8        # 66b0 <_sk_callback_sse41+0xac8>
-  DB  15,89,13,143,54,0,0                 ; mulps         0x368f(%rip),%xmm1        # 66c0 <_sk_callback_sse41+0xad8>
+  DB  68,15,88,5,150,54,0,0               ; addps         0x3696(%rip),%xmm8        # 66e0 <_sk_callback_sse41+0xad0>
+  DB  68,15,89,5,158,54,0,0               ; mulps         0x369e(%rip),%xmm8        # 66f0 <_sk_callback_sse41+0xae0>
+  DB  15,89,13,167,54,0,0                 ; mulps         0x36a7(%rip),%xmm1        # 6700 <_sk_callback_sse41+0xaf0>
   DB  65,15,88,200                        ; addps         %xmm8,%xmm1
-  DB  15,89,21,148,54,0,0                 ; mulps         0x3694(%rip),%xmm2        # 66d0 <_sk_callback_sse41+0xae8>
+  DB  15,89,21,172,54,0,0                 ; mulps         0x36ac(%rip),%xmm2        # 6710 <_sk_callback_sse41+0xb00>
   DB  69,15,40,208                        ; movaps        %xmm8,%xmm10
   DB  68,15,92,210                        ; subps         %xmm2,%xmm10
   DB  68,15,40,217                        ; movaps        %xmm1,%xmm11
   DB  69,15,89,219                        ; mulps         %xmm11,%xmm11
   DB  68,15,89,217                        ; mulps         %xmm1,%xmm11
-  DB  68,15,40,13,136,54,0,0              ; movaps        0x3688(%rip),%xmm9        # 66e0 <_sk_callback_sse41+0xaf8>
+  DB  68,15,40,13,160,54,0,0              ; movaps        0x36a0(%rip),%xmm9        # 6720 <_sk_callback_sse41+0xb10>
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  65,15,194,195,1                     ; cmpltps       %xmm11,%xmm0
-  DB  15,40,21,136,54,0,0                 ; movaps        0x3688(%rip),%xmm2        # 66f0 <_sk_callback_sse41+0xb08>
+  DB  15,40,21,160,54,0,0                 ; movaps        0x36a0(%rip),%xmm2        # 6730 <_sk_callback_sse41+0xb20>
   DB  15,88,202                           ; addps         %xmm2,%xmm1
-  DB  68,15,40,37,141,54,0,0              ; movaps        0x368d(%rip),%xmm12        # 6700 <_sk_callback_sse41+0xb18>
+  DB  68,15,40,37,165,54,0,0              ; movaps        0x36a5(%rip),%xmm12        # 6740 <_sk_callback_sse41+0xb30>
   DB  65,15,89,204                        ; mulps         %xmm12,%xmm1
   DB  102,65,15,56,20,203                 ; blendvps      %xmm0,%xmm11,%xmm1
   DB  69,15,40,216                        ; movaps        %xmm8,%xmm11
@@ -17234,8 +17291,8 @@
   DB  65,15,89,212                        ; mulps         %xmm12,%xmm2
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  102,65,15,56,20,211                 ; blendvps      %xmm0,%xmm11,%xmm2
-  DB  15,89,13,70,54,0,0                  ; mulps         0x3646(%rip),%xmm1        # 6710 <_sk_callback_sse41+0xb28>
-  DB  15,89,21,79,54,0,0                  ; mulps         0x364f(%rip),%xmm2        # 6720 <_sk_callback_sse41+0xb38>
+  DB  15,89,13,94,54,0,0                  ; mulps         0x365e(%rip),%xmm1        # 6750 <_sk_callback_sse41+0xb40>
+  DB  15,89,21,103,54,0,0                 ; mulps         0x3667(%rip),%xmm2        # 6760 <_sk_callback_sse41+0xb50>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,40,193                           ; movaps        %xmm1,%xmm0
   DB  65,15,40,200                        ; movaps        %xmm8,%xmm1
@@ -17246,11 +17303,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,39                              ; jne           310d <_sk_load_a8_sse41+0x31>
+  DB  117,39                              ; jne           3135 <_sk_load_a8_sse41+0x31>
   DB  102,65,15,56,49,4,18                ; pmovzxbd      (%r10,%rdx,1),%xmm0
-  DB  102,15,219,5,59,54,0,0              ; pand          0x363b(%rip),%xmm0        # 6730 <_sk_callback_sse41+0xb48>
+  DB  102,15,219,5,83,54,0,0              ; pand          0x3653(%rip),%xmm0        # 6770 <_sk_callback_sse41+0xb60>
   DB  15,91,216                           ; cvtdq2ps      %xmm0,%xmm3
-  DB  15,89,29,65,54,0,0                  ; mulps         0x3641(%rip),%xmm3        # 6740 <_sk_callback_sse41+0xb58>
+  DB  15,89,29,89,54,0,0                  ; mulps         0x3659(%rip),%xmm3        # 6780 <_sk_callback_sse41+0xb70>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
@@ -17259,12 +17316,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            314f <_sk_load_a8_sse41+0x73>
+  DB  116,53                              ; je            3177 <_sk_load_a8_sse41+0x73>
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3139 <_sk_load_a8_sse41+0x5d>
+  DB  116,21                              ; je            3161 <_sk_load_a8_sse41+0x5d>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,195                             ; jne           30ed <_sk_load_a8_sse41+0x11>
+  DB  117,195                             ; jne           3115 <_sk_load_a8_sse41+0x11>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,192,69                   ; pshufd        $0x45,%xmm0,%xmm0
@@ -17272,21 +17329,21 @@
   DB  102,15,110,200                      ; movd          %eax,%xmm1
   DB  102,15,56,49,201                    ; pmovzxbd      %xmm1,%xmm1
   DB  102,15,58,14,193,15                 ; pblendw       $0xf,%xmm1,%xmm0
-  DB  235,158                             ; jmp           30ed <_sk_load_a8_sse41+0x11>
+  DB  235,158                             ; jmp           3115 <_sk_load_a8_sse41+0x11>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
-  DB  235,147                             ; jmp           30ed <_sk_load_a8_sse41+0x11>
+  DB  235,147                             ; jmp           3115 <_sk_load_a8_sse41+0x11>
 
 PUBLIC _sk_load_a8_dst_sse41
 _sk_load_a8_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,39                              ; jne           318b <_sk_load_a8_dst_sse41+0x31>
+  DB  117,39                              ; jne           31b3 <_sk_load_a8_dst_sse41+0x31>
   DB  102,65,15,56,49,36,18               ; pmovzxbd      (%r10,%rdx,1),%xmm4
-  DB  102,15,219,37,221,53,0,0            ; pand          0x35dd(%rip),%xmm4        # 6750 <_sk_callback_sse41+0xb68>
+  DB  102,15,219,37,245,53,0,0            ; pand          0x35f5(%rip),%xmm4        # 6790 <_sk_callback_sse41+0xb80>
   DB  15,91,252                           ; cvtdq2ps      %xmm4,%xmm7
-  DB  15,89,61,227,53,0,0                 ; mulps         0x35e3(%rip),%xmm7        # 6760 <_sk_callback_sse41+0xb78>
+  DB  15,89,61,251,53,0,0                 ; mulps         0x35fb(%rip),%xmm7        # 67a0 <_sk_callback_sse41+0xb90>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
   DB  102,15,239,237                      ; pxor          %xmm5,%xmm5
@@ -17295,12 +17352,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            31cd <_sk_load_a8_dst_sse41+0x73>
+  DB  116,53                              ; je            31f5 <_sk_load_a8_dst_sse41+0x73>
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            31b7 <_sk_load_a8_dst_sse41+0x5d>
+  DB  116,21                              ; je            31df <_sk_load_a8_dst_sse41+0x5d>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,195                             ; jne           316b <_sk_load_a8_dst_sse41+0x11>
+  DB  117,195                             ; jne           3193 <_sk_load_a8_dst_sse41+0x11>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,228,69                   ; pshufd        $0x45,%xmm4,%xmm4
@@ -17308,10 +17365,10 @@
   DB  102,15,110,232                      ; movd          %eax,%xmm5
   DB  102,15,56,49,237                    ; pmovzxbd      %xmm5,%xmm5
   DB  102,15,58,14,229,15                 ; pblendw       $0xf,%xmm5,%xmm4
-  DB  235,158                             ; jmp           316b <_sk_load_a8_dst_sse41+0x11>
+  DB  235,158                             ; jmp           3193 <_sk_load_a8_dst_sse41+0x11>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
-  DB  235,147                             ; jmp           316b <_sk_load_a8_dst_sse41+0x11>
+  DB  235,147                             ; jmp           3193 <_sk_load_a8_dst_sse41+0x11>
 
 PUBLIC _sk_gather_a8_sse41
 _sk_gather_a8_sse41 LABEL PROC
@@ -17338,7 +17395,7 @@
   DB  102,15,58,32,192,3                  ; pinsrb        $0x3,%eax,%xmm0
   DB  102,15,56,49,192                    ; pmovzxbd      %xmm0,%xmm0
   DB  15,91,216                           ; cvtdq2ps      %xmm0,%xmm3
-  DB  15,89,29,40,53,0,0                  ; mulps         0x3528(%rip),%xmm3        # 6770 <_sk_callback_sse41+0xb88>
+  DB  15,89,29,64,53,0,0                  ; mulps         0x3540(%rip),%xmm3        # 67b0 <_sk_callback_sse41+0xba0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
@@ -17351,13 +17408,13 @@
   DB  72,131,236,4                        ; sub           $0x4,%rsp
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  68,15,40,5,23,53,0,0                ; movaps        0x3517(%rip),%xmm8        # 6780 <_sk_callback_sse41+0xb98>
+  DB  68,15,40,5,47,53,0,0                ; movaps        0x352f(%rip),%xmm8        # 67c0 <_sk_callback_sse41+0xbb0>
   DB  68,15,89,195                        ; mulps         %xmm3,%xmm8
   DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
   DB  102,69,15,56,43,192                 ; packusdw      %xmm8,%xmm8
   DB  102,69,15,103,192                   ; packuswb      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,17                              ; jne           3293 <_sk_store_a8_sse41+0x3b>
+  DB  117,17                              ; jne           32bb <_sk_store_a8_sse41+0x3b>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  65,137,4,18                         ; mov           %eax,(%r10,%rdx,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -17367,42 +17424,42 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,41                              ; je            32cf <_sk_store_a8_sse41+0x77>
+  DB  116,41                              ; je            32f7 <_sk_store_a8_sse41+0x77>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,15                              ; je            32bb <_sk_store_a8_sse41+0x63>
+  DB  116,15                              ; je            32e3 <_sk_store_a8_sse41+0x63>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,217                             ; jne           328b <_sk_store_a8_sse41+0x33>
+  DB  117,217                             ; jne           32b3 <_sk_store_a8_sse41+0x33>
   DB  102,69,15,58,20,68,18,2,8           ; pextrb        $0x8,%xmm8,0x2(%r10,%rdx,1)
-  DB  102,68,15,56,0,5,203,52,0,0         ; pshufb        0x34cb(%rip),%xmm8        # 6790 <_sk_callback_sse41+0xba8>
+  DB  102,68,15,56,0,5,227,52,0,0         ; pshufb        0x34e3(%rip),%xmm8        # 67d0 <_sk_callback_sse41+0xbc0>
   DB  102,69,15,58,21,4,18,0              ; pextrw        $0x0,%xmm8,(%r10,%rdx,1)
-  DB  235,188                             ; jmp           328b <_sk_store_a8_sse41+0x33>
+  DB  235,188                             ; jmp           32b3 <_sk_store_a8_sse41+0x33>
   DB  102,69,15,58,20,4,18,0              ; pextrb        $0x0,%xmm8,(%r10,%rdx,1)
-  DB  235,178                             ; jmp           328b <_sk_store_a8_sse41+0x33>
+  DB  235,178                             ; jmp           32b3 <_sk_store_a8_sse41+0x33>
 
 PUBLIC _sk_load_g8_sse41
 _sk_load_g8_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,42                              ; jne           330d <_sk_load_g8_sse41+0x34>
+  DB  117,42                              ; jne           3335 <_sk_load_g8_sse41+0x34>
   DB  102,65,15,56,49,4,18                ; pmovzxbd      (%r10,%rdx,1),%xmm0
-  DB  102,15,219,5,174,52,0,0             ; pand          0x34ae(%rip),%xmm0        # 67a0 <_sk_callback_sse41+0xbb8>
+  DB  102,15,219,5,198,52,0,0             ; pand          0x34c6(%rip),%xmm0        # 67e0 <_sk_callback_sse41+0xbd0>
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,180,52,0,0                  ; mulps         0x34b4(%rip),%xmm0        # 67b0 <_sk_callback_sse41+0xbc8>
+  DB  15,89,5,204,52,0,0                  ; mulps         0x34cc(%rip),%xmm0        # 67f0 <_sk_callback_sse41+0xbe0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,187,52,0,0                 ; movaps        0x34bb(%rip),%xmm3        # 67c0 <_sk_callback_sse41+0xbd8>
+  DB  15,40,29,211,52,0,0                 ; movaps        0x34d3(%rip),%xmm3        # 6800 <_sk_callback_sse41+0xbf0>
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            334f <_sk_load_g8_sse41+0x76>
+  DB  116,53                              ; je            3377 <_sk_load_g8_sse41+0x76>
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3339 <_sk_load_g8_sse41+0x60>
+  DB  116,21                              ; je            3361 <_sk_load_g8_sse41+0x60>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,192                             ; jne           32ea <_sk_load_g8_sse41+0x11>
+  DB  117,192                             ; jne           3312 <_sk_load_g8_sse41+0x11>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,192,69                   ; pshufd        $0x45,%xmm0,%xmm0
@@ -17410,35 +17467,35 @@
   DB  102,15,110,200                      ; movd          %eax,%xmm1
   DB  102,15,56,49,201                    ; pmovzxbd      %xmm1,%xmm1
   DB  102,15,58,14,193,15                 ; pblendw       $0xf,%xmm1,%xmm0
-  DB  235,155                             ; jmp           32ea <_sk_load_g8_sse41+0x11>
+  DB  235,155                             ; jmp           3312 <_sk_load_g8_sse41+0x11>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
-  DB  235,144                             ; jmp           32ea <_sk_load_g8_sse41+0x11>
+  DB  235,144                             ; jmp           3312 <_sk_load_g8_sse41+0x11>
 
 PUBLIC _sk_load_g8_dst_sse41
 _sk_load_g8_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,42                              ; jne           338e <_sk_load_g8_dst_sse41+0x34>
+  DB  117,42                              ; jne           33b6 <_sk_load_g8_dst_sse41+0x34>
   DB  102,65,15,56,49,36,18               ; pmovzxbd      (%r10,%rdx,1),%xmm4
-  DB  102,15,219,37,93,52,0,0             ; pand          0x345d(%rip),%xmm4        # 67d0 <_sk_callback_sse41+0xbe8>
+  DB  102,15,219,37,117,52,0,0            ; pand          0x3475(%rip),%xmm4        # 6810 <_sk_callback_sse41+0xc00>
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  15,89,37,99,52,0,0                  ; mulps         0x3463(%rip),%xmm4        # 67e0 <_sk_callback_sse41+0xbf8>
+  DB  15,89,37,123,52,0,0                 ; mulps         0x347b(%rip),%xmm4        # 6820 <_sk_callback_sse41+0xc10>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,61,106,52,0,0                 ; movaps        0x346a(%rip),%xmm7        # 67f0 <_sk_callback_sse41+0xc08>
+  DB  15,40,61,130,52,0,0                 ; movaps        0x3482(%rip),%xmm7        # 6830 <_sk_callback_sse41+0xc20>
   DB  15,40,236                           ; movaps        %xmm4,%xmm5
   DB  15,40,244                           ; movaps        %xmm4,%xmm6
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            33d0 <_sk_load_g8_dst_sse41+0x76>
+  DB  116,53                              ; je            33f8 <_sk_load_g8_dst_sse41+0x76>
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            33ba <_sk_load_g8_dst_sse41+0x60>
+  DB  116,21                              ; je            33e2 <_sk_load_g8_dst_sse41+0x60>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,192                             ; jne           336b <_sk_load_g8_dst_sse41+0x11>
+  DB  117,192                             ; jne           3393 <_sk_load_g8_dst_sse41+0x11>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,228,69                   ; pshufd        $0x45,%xmm4,%xmm4
@@ -17446,10 +17503,10 @@
   DB  102,15,110,232                      ; movd          %eax,%xmm5
   DB  102,15,56,49,237                    ; pmovzxbd      %xmm5,%xmm5
   DB  102,15,58,14,229,15                 ; pblendw       $0xf,%xmm5,%xmm4
-  DB  235,155                             ; jmp           336b <_sk_load_g8_dst_sse41+0x11>
+  DB  235,155                             ; jmp           3393 <_sk_load_g8_dst_sse41+0x11>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
-  DB  235,144                             ; jmp           336b <_sk_load_g8_dst_sse41+0x11>
+  DB  235,144                             ; jmp           3393 <_sk_load_g8_dst_sse41+0x11>
 
 PUBLIC _sk_gather_g8_sse41
 _sk_gather_g8_sse41 LABEL PROC
@@ -17476,9 +17533,9 @@
   DB  102,15,58,32,192,3                  ; pinsrb        $0x3,%eax,%xmm0
   DB  102,15,56,49,192                    ; pmovzxbd      %xmm0,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,181,51,0,0                  ; mulps         0x33b5(%rip),%xmm0        # 6800 <_sk_callback_sse41+0xc18>
+  DB  15,89,5,205,51,0,0                  ; mulps         0x33cd(%rip),%xmm0        # 6840 <_sk_callback_sse41+0xc30>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,188,51,0,0                 ; movaps        0x33bc(%rip),%xmm3        # 6810 <_sk_callback_sse41+0xc28>
+  DB  15,40,29,212,51,0,0                 ; movaps        0x33d4(%rip),%xmm3        # 6850 <_sk_callback_sse41+0xc40>
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  91                                  ; pop           %rbx
@@ -17489,9 +17546,9 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,137,193                          ; mov           %rax,%r9
   DB  77,133,201                          ; test          %r9,%r9
-  DB  116,5                               ; je            346c <_sk_gather_i8_sse41+0xf>
+  DB  116,5                               ; je            3494 <_sk_gather_i8_sse41+0xf>
   DB  76,137,200                          ; mov           %r9,%rax
-  DB  235,2                               ; jmp           346e <_sk_gather_i8_sse41+0x11>
+  DB  235,2                               ; jmp           3496 <_sk_gather_i8_sse41+0x11>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,86                               ; push          %r14
   DB  83                                  ; push          %rbx
@@ -17524,17 +17581,17 @@
   DB  102,15,58,34,28,24,1                ; pinsrd        $0x1,(%rax,%rbx,1),%xmm3
   DB  102,66,15,58,34,28,152,2            ; pinsrd        $0x2,(%rax,%r11,4),%xmm3
   DB  102,66,15,58,34,28,16,3             ; pinsrd        $0x3,(%rax,%r10,1),%xmm3
-  DB  102,15,111,5,15,51,0,0              ; movdqa        0x330f(%rip),%xmm0        # 6820 <_sk_callback_sse41+0xc38>
+  DB  102,15,111,5,39,51,0,0              ; movdqa        0x3327(%rip),%xmm0        # 6860 <_sk_callback_sse41+0xc50>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,16,51,0,0                ; movaps        0x3310(%rip),%xmm8        # 6830 <_sk_callback_sse41+0xc48>
+  DB  68,15,40,5,40,51,0,0                ; movaps        0x3328(%rip),%xmm8        # 6870 <_sk_callback_sse41+0xc60>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
-  DB  102,15,56,0,13,15,51,0,0            ; pshufb        0x330f(%rip),%xmm1        # 6840 <_sk_callback_sse41+0xc58>
+  DB  102,15,56,0,13,39,51,0,0            ; pshufb        0x3327(%rip),%xmm1        # 6880 <_sk_callback_sse41+0xc70>
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,111,211                      ; movdqa        %xmm3,%xmm2
-  DB  102,15,56,0,21,11,51,0,0            ; pshufb        0x330b(%rip),%xmm2        # 6850 <_sk_callback_sse41+0xc68>
+  DB  102,15,56,0,21,35,51,0,0            ; pshufb        0x3323(%rip),%xmm2        # 6890 <_sk_callback_sse41+0xc80>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  102,15,114,211,24                   ; psrld         $0x18,%xmm3
@@ -17550,82 +17607,82 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,80                              ; jne           35b9 <_sk_load_565_sse41+0x5a>
+  DB  117,80                              ; jne           35e1 <_sk_load_565_sse41+0x5a>
   DB  102,65,15,56,51,20,82               ; pmovzxwd      (%r10,%rdx,2),%xmm2
-  DB  102,15,111,5,232,50,0,0             ; movdqa        0x32e8(%rip),%xmm0        # 6860 <_sk_callback_sse41+0xc78>
+  DB  102,15,111,5,0,51,0,0               ; movdqa        0x3300(%rip),%xmm0        # 68a0 <_sk_callback_sse41+0xc90>
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,234,50,0,0                  ; mulps         0x32ea(%rip),%xmm0        # 6870 <_sk_callback_sse41+0xc88>
-  DB  102,15,111,13,242,50,0,0            ; movdqa        0x32f2(%rip),%xmm1        # 6880 <_sk_callback_sse41+0xc98>
+  DB  15,89,5,2,51,0,0                    ; mulps         0x3302(%rip),%xmm0        # 68b0 <_sk_callback_sse41+0xca0>
+  DB  102,15,111,13,10,51,0,0             ; movdqa        0x330a(%rip),%xmm1        # 68c0 <_sk_callback_sse41+0xcb0>
   DB  102,15,219,202                      ; pand          %xmm2,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,244,50,0,0                 ; mulps         0x32f4(%rip),%xmm1        # 6890 <_sk_callback_sse41+0xca8>
-  DB  102,15,219,21,252,50,0,0            ; pand          0x32fc(%rip),%xmm2        # 68a0 <_sk_callback_sse41+0xcb8>
+  DB  15,89,13,12,51,0,0                  ; mulps         0x330c(%rip),%xmm1        # 68d0 <_sk_callback_sse41+0xcc0>
+  DB  102,15,219,21,20,51,0,0             ; pand          0x3314(%rip),%xmm2        # 68e0 <_sk_callback_sse41+0xcd0>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,2,51,0,0                   ; mulps         0x3302(%rip),%xmm2        # 68b0 <_sk_callback_sse41+0xcc8>
+  DB  15,89,21,26,51,0,0                  ; mulps         0x331a(%rip),%xmm2        # 68f0 <_sk_callback_sse41+0xce0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,9,51,0,0                   ; movaps        0x3309(%rip),%xmm3        # 68c0 <_sk_callback_sse41+0xcd8>
+  DB  15,40,29,33,51,0,0                  ; movaps        0x3321(%rip),%xmm3        # 6900 <_sk_callback_sse41+0xcf0>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            35fb <_sk_load_565_sse41+0x9c>
+  DB  116,53                              ; je            3623 <_sk_load_565_sse41+0x9c>
   DB  102,15,239,210                      ; pxor          %xmm2,%xmm2
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            35e5 <_sk_load_565_sse41+0x86>
+  DB  116,21                              ; je            360d <_sk_load_565_sse41+0x86>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,154                             ; jne           3570 <_sk_load_565_sse41+0x11>
+  DB  117,154                             ; jne           3598 <_sk_load_565_sse41+0x11>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,208,69                   ; pshufd        $0x45,%xmm0,%xmm2
   DB  102,65,15,110,4,82                  ; movd          (%r10,%rdx,2),%xmm0
   DB  102,15,56,51,192                    ; pmovzxwd      %xmm0,%xmm0
   DB  102,15,58,14,208,15                 ; pblendw       $0xf,%xmm0,%xmm2
-  DB  233,117,255,255,255                 ; jmpq          3570 <_sk_load_565_sse41+0x11>
+  DB  233,117,255,255,255                 ; jmpq          3598 <_sk_load_565_sse41+0x11>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,208                      ; movd          %eax,%xmm2
-  DB  233,103,255,255,255                 ; jmpq          3570 <_sk_load_565_sse41+0x11>
+  DB  233,103,255,255,255                 ; jmpq          3598 <_sk_load_565_sse41+0x11>
 
 PUBLIC _sk_load_565_dst_sse41
 _sk_load_565_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,80                              ; jne           3663 <_sk_load_565_dst_sse41+0x5a>
+  DB  117,80                              ; jne           368b <_sk_load_565_dst_sse41+0x5a>
   DB  102,65,15,56,51,52,82               ; pmovzxwd      (%r10,%rdx,2),%xmm6
-  DB  102,15,111,37,174,50,0,0            ; movdqa        0x32ae(%rip),%xmm4        # 68d0 <_sk_callback_sse41+0xce8>
+  DB  102,15,111,37,198,50,0,0            ; movdqa        0x32c6(%rip),%xmm4        # 6910 <_sk_callback_sse41+0xd00>
   DB  102,15,219,230                      ; pand          %xmm6,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  15,89,37,176,50,0,0                 ; mulps         0x32b0(%rip),%xmm4        # 68e0 <_sk_callback_sse41+0xcf8>
-  DB  102,15,111,45,184,50,0,0            ; movdqa        0x32b8(%rip),%xmm5        # 68f0 <_sk_callback_sse41+0xd08>
+  DB  15,89,37,200,50,0,0                 ; mulps         0x32c8(%rip),%xmm4        # 6920 <_sk_callback_sse41+0xd10>
+  DB  102,15,111,45,208,50,0,0            ; movdqa        0x32d0(%rip),%xmm5        # 6930 <_sk_callback_sse41+0xd20>
   DB  102,15,219,238                      ; pand          %xmm6,%xmm5
   DB  15,91,237                           ; cvtdq2ps      %xmm5,%xmm5
-  DB  15,89,45,186,50,0,0                 ; mulps         0x32ba(%rip),%xmm5        # 6900 <_sk_callback_sse41+0xd18>
-  DB  102,15,219,53,194,50,0,0            ; pand          0x32c2(%rip),%xmm6        # 6910 <_sk_callback_sse41+0xd28>
+  DB  15,89,45,210,50,0,0                 ; mulps         0x32d2(%rip),%xmm5        # 6940 <_sk_callback_sse41+0xd30>
+  DB  102,15,219,53,218,50,0,0            ; pand          0x32da(%rip),%xmm6        # 6950 <_sk_callback_sse41+0xd40>
   DB  15,91,246                           ; cvtdq2ps      %xmm6,%xmm6
-  DB  15,89,53,200,50,0,0                 ; mulps         0x32c8(%rip),%xmm6        # 6920 <_sk_callback_sse41+0xd38>
+  DB  15,89,53,224,50,0,0                 ; mulps         0x32e0(%rip),%xmm6        # 6960 <_sk_callback_sse41+0xd50>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,61,207,50,0,0                 ; movaps        0x32cf(%rip),%xmm7        # 6930 <_sk_callback_sse41+0xd48>
+  DB  15,40,61,231,50,0,0                 ; movaps        0x32e7(%rip),%xmm7        # 6970 <_sk_callback_sse41+0xd60>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            36a5 <_sk_load_565_dst_sse41+0x9c>
+  DB  116,53                              ; je            36cd <_sk_load_565_dst_sse41+0x9c>
   DB  102,15,239,246                      ; pxor          %xmm6,%xmm6
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            368f <_sk_load_565_dst_sse41+0x86>
+  DB  116,21                              ; je            36b7 <_sk_load_565_dst_sse41+0x86>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,154                             ; jne           361a <_sk_load_565_dst_sse41+0x11>
+  DB  117,154                             ; jne           3642 <_sk_load_565_dst_sse41+0x11>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,244,69                   ; pshufd        $0x45,%xmm4,%xmm6
   DB  102,65,15,110,36,82                 ; movd          (%r10,%rdx,2),%xmm4
   DB  102,15,56,51,228                    ; pmovzxwd      %xmm4,%xmm4
   DB  102,15,58,14,244,15                 ; pblendw       $0xf,%xmm4,%xmm6
-  DB  233,117,255,255,255                 ; jmpq          361a <_sk_load_565_dst_sse41+0x11>
+  DB  233,117,255,255,255                 ; jmpq          3642 <_sk_load_565_dst_sse41+0x11>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,240                      ; movd          %eax,%xmm6
-  DB  233,103,255,255,255                 ; jmpq          361a <_sk_load_565_dst_sse41+0x11>
+  DB  233,103,255,255,255                 ; jmpq          3642 <_sk_load_565_dst_sse41+0x11>
 
 PUBLIC _sk_gather_565_sse41
 _sk_gather_565_sse41 LABEL PROC
@@ -17651,19 +17708,19 @@
   DB  65,15,183,4,65                      ; movzwl        (%r9,%rax,2),%eax
   DB  102,15,196,192,3                    ; pinsrw        $0x3,%eax,%xmm0
   DB  102,15,56,51,208                    ; pmovzxwd      %xmm0,%xmm2
-  DB  102,15,111,5,35,50,0,0              ; movdqa        0x3223(%rip),%xmm0        # 6940 <_sk_callback_sse41+0xd58>
+  DB  102,15,111,5,59,50,0,0              ; movdqa        0x323b(%rip),%xmm0        # 6980 <_sk_callback_sse41+0xd70>
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,37,50,0,0                   ; mulps         0x3225(%rip),%xmm0        # 6950 <_sk_callback_sse41+0xd68>
-  DB  102,15,111,13,45,50,0,0             ; movdqa        0x322d(%rip),%xmm1        # 6960 <_sk_callback_sse41+0xd78>
+  DB  15,89,5,61,50,0,0                   ; mulps         0x323d(%rip),%xmm0        # 6990 <_sk_callback_sse41+0xd80>
+  DB  102,15,111,13,69,50,0,0             ; movdqa        0x3245(%rip),%xmm1        # 69a0 <_sk_callback_sse41+0xd90>
   DB  102,15,219,202                      ; pand          %xmm2,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,47,50,0,0                  ; mulps         0x322f(%rip),%xmm1        # 6970 <_sk_callback_sse41+0xd88>
-  DB  102,15,219,21,55,50,0,0             ; pand          0x3237(%rip),%xmm2        # 6980 <_sk_callback_sse41+0xd98>
+  DB  15,89,13,71,50,0,0                  ; mulps         0x3247(%rip),%xmm1        # 69b0 <_sk_callback_sse41+0xda0>
+  DB  102,15,219,21,79,50,0,0             ; pand          0x324f(%rip),%xmm2        # 69c0 <_sk_callback_sse41+0xdb0>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,61,50,0,0                  ; mulps         0x323d(%rip),%xmm2        # 6990 <_sk_callback_sse41+0xda8>
+  DB  15,89,21,85,50,0,0                  ; mulps         0x3255(%rip),%xmm2        # 69d0 <_sk_callback_sse41+0xdc0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,68,50,0,0                  ; movaps        0x3244(%rip),%xmm3        # 69a0 <_sk_callback_sse41+0xdb8>
+  DB  15,40,29,92,50,0,0                  ; movaps        0x325c(%rip),%xmm3        # 69e0 <_sk_callback_sse41+0xdd0>
   DB  91                                  ; pop           %rbx
   DB  255,224                             ; jmpq          *%rax
 
@@ -17671,12 +17728,12 @@
 _sk_store_565_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,68,50,0,0                ; movaps        0x3244(%rip),%xmm8        # 69b0 <_sk_callback_sse41+0xdc8>
+  DB  68,15,40,5,92,50,0,0                ; movaps        0x325c(%rip),%xmm8        # 69f0 <_sk_callback_sse41+0xde0>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
   DB  102,65,15,114,241,11                ; pslld         $0xb,%xmm9
-  DB  68,15,40,21,57,50,0,0               ; movaps        0x3239(%rip),%xmm10        # 69c0 <_sk_callback_sse41+0xdd8>
+  DB  68,15,40,21,81,50,0,0               ; movaps        0x3251(%rip),%xmm10        # 6a00 <_sk_callback_sse41+0xdf0>
   DB  68,15,89,209                        ; mulps         %xmm1,%xmm10
   DB  102,69,15,91,210                    ; cvtps2dq      %xmm10,%xmm10
   DB  102,65,15,114,242,5                 ; pslld         $0x5,%xmm10
@@ -17686,7 +17743,7 @@
   DB  102,69,15,86,194                    ; orpd          %xmm10,%xmm8
   DB  102,69,15,56,43,192                 ; packusdw      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           37be <_sk_store_565_sse41+0x5f>
+  DB  117,10                              ; jne           37e6 <_sk_store_565_sse41+0x5f>
   DB  242,68,15,17,4,80                   ; movsd         %xmm8,(%rax,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -17694,105 +17751,105 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,35                              ; je            37f4 <_sk_store_565_sse41+0x95>
+  DB  116,35                              ; je            381c <_sk_store_565_sse41+0x95>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,15                              ; je            37e6 <_sk_store_565_sse41+0x87>
+  DB  116,15                              ; je            380e <_sk_store_565_sse41+0x87>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,221                             ; jne           37ba <_sk_store_565_sse41+0x5b>
+  DB  117,221                             ; jne           37e2 <_sk_store_565_sse41+0x5b>
   DB  102,68,15,58,21,68,80,4,4           ; pextrw        $0x4,%xmm8,0x4(%rax,%rdx,2)
   DB  242,69,15,112,192,232               ; pshuflw       $0xe8,%xmm8,%xmm8
   DB  102,68,15,126,4,80                  ; movd          %xmm8,(%rax,%rdx,2)
-  DB  235,198                             ; jmp           37ba <_sk_store_565_sse41+0x5b>
+  DB  235,198                             ; jmp           37e2 <_sk_store_565_sse41+0x5b>
   DB  102,68,15,58,21,4,80,0              ; pextrw        $0x0,%xmm8,(%rax,%rdx,2)
-  DB  235,188                             ; jmp           37ba <_sk_store_565_sse41+0x5b>
+  DB  235,188                             ; jmp           37e2 <_sk_store_565_sse41+0x5b>
 
 PUBLIC _sk_load_4444_sse41
 _sk_load_4444_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,95                              ; jne           3867 <_sk_load_4444_sse41+0x69>
+  DB  117,95                              ; jne           388f <_sk_load_4444_sse41+0x69>
   DB  102,65,15,56,51,28,82               ; pmovzxwd      (%r10,%rdx,2),%xmm3
-  DB  102,15,111,5,185,49,0,0             ; movdqa        0x31b9(%rip),%xmm0        # 69d0 <_sk_callback_sse41+0xde8>
+  DB  102,15,111,5,209,49,0,0             ; movdqa        0x31d1(%rip),%xmm0        # 6a10 <_sk_callback_sse41+0xe00>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,187,49,0,0                  ; mulps         0x31bb(%rip),%xmm0        # 69e0 <_sk_callback_sse41+0xdf8>
-  DB  102,15,111,13,195,49,0,0            ; movdqa        0x31c3(%rip),%xmm1        # 69f0 <_sk_callback_sse41+0xe08>
+  DB  15,89,5,211,49,0,0                  ; mulps         0x31d3(%rip),%xmm0        # 6a20 <_sk_callback_sse41+0xe10>
+  DB  102,15,111,13,219,49,0,0            ; movdqa        0x31db(%rip),%xmm1        # 6a30 <_sk_callback_sse41+0xe20>
   DB  102,15,219,203                      ; pand          %xmm3,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,197,49,0,0                 ; mulps         0x31c5(%rip),%xmm1        # 6a00 <_sk_callback_sse41+0xe18>
-  DB  102,15,111,21,205,49,0,0            ; movdqa        0x31cd(%rip),%xmm2        # 6a10 <_sk_callback_sse41+0xe28>
+  DB  15,89,13,221,49,0,0                 ; mulps         0x31dd(%rip),%xmm1        # 6a40 <_sk_callback_sse41+0xe30>
+  DB  102,15,111,21,229,49,0,0            ; movdqa        0x31e5(%rip),%xmm2        # 6a50 <_sk_callback_sse41+0xe40>
   DB  102,15,219,211                      ; pand          %xmm3,%xmm2
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,207,49,0,0                 ; mulps         0x31cf(%rip),%xmm2        # 6a20 <_sk_callback_sse41+0xe38>
-  DB  102,15,219,29,215,49,0,0            ; pand          0x31d7(%rip),%xmm3        # 6a30 <_sk_callback_sse41+0xe48>
+  DB  15,89,21,231,49,0,0                 ; mulps         0x31e7(%rip),%xmm2        # 6a60 <_sk_callback_sse41+0xe50>
+  DB  102,15,219,29,239,49,0,0            ; pand          0x31ef(%rip),%xmm3        # 6a70 <_sk_callback_sse41+0xe60>
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,221,49,0,0                 ; mulps         0x31dd(%rip),%xmm3        # 6a40 <_sk_callback_sse41+0xe58>
+  DB  15,89,29,245,49,0,0                 ; mulps         0x31f5(%rip),%xmm3        # 6a80 <_sk_callback_sse41+0xe70>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            38a9 <_sk_load_4444_sse41+0xab>
+  DB  116,53                              ; je            38d1 <_sk_load_4444_sse41+0xab>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3893 <_sk_load_4444_sse41+0x95>
+  DB  116,21                              ; je            38bb <_sk_load_4444_sse41+0x95>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,139                             ; jne           380f <_sk_load_4444_sse41+0x11>
+  DB  117,139                             ; jne           3837 <_sk_load_4444_sse41+0x11>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,216,69                   ; pshufd        $0x45,%xmm0,%xmm3
   DB  102,65,15,110,4,82                  ; movd          (%r10,%rdx,2),%xmm0
   DB  102,15,56,51,192                    ; pmovzxwd      %xmm0,%xmm0
   DB  102,15,58,14,216,15                 ; pblendw       $0xf,%xmm0,%xmm3
-  DB  233,102,255,255,255                 ; jmpq          380f <_sk_load_4444_sse41+0x11>
+  DB  233,102,255,255,255                 ; jmpq          3837 <_sk_load_4444_sse41+0x11>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,216                      ; movd          %eax,%xmm3
-  DB  233,88,255,255,255                  ; jmpq          380f <_sk_load_4444_sse41+0x11>
+  DB  233,88,255,255,255                  ; jmpq          3837 <_sk_load_4444_sse41+0x11>
 
 PUBLIC _sk_load_4444_dst_sse41
 _sk_load_4444_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,95                              ; jne           3920 <_sk_load_4444_dst_sse41+0x69>
+  DB  117,95                              ; jne           3948 <_sk_load_4444_dst_sse41+0x69>
   DB  102,65,15,56,51,60,82               ; pmovzxwd      (%r10,%rdx,2),%xmm7
-  DB  102,15,111,37,128,49,0,0            ; movdqa        0x3180(%rip),%xmm4        # 6a50 <_sk_callback_sse41+0xe68>
+  DB  102,15,111,37,152,49,0,0            ; movdqa        0x3198(%rip),%xmm4        # 6a90 <_sk_callback_sse41+0xe80>
   DB  102,15,219,231                      ; pand          %xmm7,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  15,89,37,130,49,0,0                 ; mulps         0x3182(%rip),%xmm4        # 6a60 <_sk_callback_sse41+0xe78>
-  DB  102,15,111,45,138,49,0,0            ; movdqa        0x318a(%rip),%xmm5        # 6a70 <_sk_callback_sse41+0xe88>
+  DB  15,89,37,154,49,0,0                 ; mulps         0x319a(%rip),%xmm4        # 6aa0 <_sk_callback_sse41+0xe90>
+  DB  102,15,111,45,162,49,0,0            ; movdqa        0x31a2(%rip),%xmm5        # 6ab0 <_sk_callback_sse41+0xea0>
   DB  102,15,219,239                      ; pand          %xmm7,%xmm5
   DB  15,91,237                           ; cvtdq2ps      %xmm5,%xmm5
-  DB  15,89,45,140,49,0,0                 ; mulps         0x318c(%rip),%xmm5        # 6a80 <_sk_callback_sse41+0xe98>
-  DB  102,15,111,53,148,49,0,0            ; movdqa        0x3194(%rip),%xmm6        # 6a90 <_sk_callback_sse41+0xea8>
+  DB  15,89,45,164,49,0,0                 ; mulps         0x31a4(%rip),%xmm5        # 6ac0 <_sk_callback_sse41+0xeb0>
+  DB  102,15,111,53,172,49,0,0            ; movdqa        0x31ac(%rip),%xmm6        # 6ad0 <_sk_callback_sse41+0xec0>
   DB  102,15,219,247                      ; pand          %xmm7,%xmm6
   DB  15,91,246                           ; cvtdq2ps      %xmm6,%xmm6
-  DB  15,89,53,150,49,0,0                 ; mulps         0x3196(%rip),%xmm6        # 6aa0 <_sk_callback_sse41+0xeb8>
-  DB  102,15,219,61,158,49,0,0            ; pand          0x319e(%rip),%xmm7        # 6ab0 <_sk_callback_sse41+0xec8>
+  DB  15,89,53,174,49,0,0                 ; mulps         0x31ae(%rip),%xmm6        # 6ae0 <_sk_callback_sse41+0xed0>
+  DB  102,15,219,61,182,49,0,0            ; pand          0x31b6(%rip),%xmm7        # 6af0 <_sk_callback_sse41+0xee0>
   DB  15,91,255                           ; cvtdq2ps      %xmm7,%xmm7
-  DB  15,89,61,164,49,0,0                 ; mulps         0x31a4(%rip),%xmm7        # 6ac0 <_sk_callback_sse41+0xed8>
+  DB  15,89,61,188,49,0,0                 ; mulps         0x31bc(%rip),%xmm7        # 6b00 <_sk_callback_sse41+0xef0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,53                              ; je            3962 <_sk_load_4444_dst_sse41+0xab>
+  DB  116,53                              ; je            398a <_sk_load_4444_dst_sse41+0xab>
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            394c <_sk_load_4444_dst_sse41+0x95>
+  DB  116,21                              ; je            3974 <_sk_load_4444_dst_sse41+0x95>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,139                             ; jne           38c8 <_sk_load_4444_dst_sse41+0x11>
+  DB  117,139                             ; jne           38f0 <_sk_load_4444_dst_sse41+0x11>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
   DB  102,65,15,110,36,82                 ; movd          (%r10,%rdx,2),%xmm4
   DB  102,15,56,51,228                    ; pmovzxwd      %xmm4,%xmm4
   DB  102,15,58,14,252,15                 ; pblendw       $0xf,%xmm4,%xmm7
-  DB  233,102,255,255,255                 ; jmpq          38c8 <_sk_load_4444_dst_sse41+0x11>
+  DB  233,102,255,255,255                 ; jmpq          38f0 <_sk_load_4444_dst_sse41+0x11>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,248                      ; movd          %eax,%xmm7
-  DB  233,88,255,255,255                  ; jmpq          38c8 <_sk_load_4444_dst_sse41+0x11>
+  DB  233,88,255,255,255                  ; jmpq          38f0 <_sk_load_4444_dst_sse41+0x11>
 
 PUBLIC _sk_gather_4444_sse41
 _sk_gather_4444_sse41 LABEL PROC
@@ -17818,21 +17875,21 @@
   DB  65,15,183,4,65                      ; movzwl        (%r9,%rax,2),%eax
   DB  102,15,196,192,3                    ; pinsrw        $0x3,%eax,%xmm0
   DB  102,15,56,51,216                    ; pmovzxwd      %xmm0,%xmm3
-  DB  102,15,111,5,246,48,0,0             ; movdqa        0x30f6(%rip),%xmm0        # 6ad0 <_sk_callback_sse41+0xee8>
+  DB  102,15,111,5,14,49,0,0              ; movdqa        0x310e(%rip),%xmm0        # 6b10 <_sk_callback_sse41+0xf00>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,248,48,0,0                  ; mulps         0x30f8(%rip),%xmm0        # 6ae0 <_sk_callback_sse41+0xef8>
-  DB  102,15,111,13,0,49,0,0              ; movdqa        0x3100(%rip),%xmm1        # 6af0 <_sk_callback_sse41+0xf08>
+  DB  15,89,5,16,49,0,0                   ; mulps         0x3110(%rip),%xmm0        # 6b20 <_sk_callback_sse41+0xf10>
+  DB  102,15,111,13,24,49,0,0             ; movdqa        0x3118(%rip),%xmm1        # 6b30 <_sk_callback_sse41+0xf20>
   DB  102,15,219,203                      ; pand          %xmm3,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,2,49,0,0                   ; mulps         0x3102(%rip),%xmm1        # 6b00 <_sk_callback_sse41+0xf18>
-  DB  102,15,111,21,10,49,0,0             ; movdqa        0x310a(%rip),%xmm2        # 6b10 <_sk_callback_sse41+0xf28>
+  DB  15,89,13,26,49,0,0                  ; mulps         0x311a(%rip),%xmm1        # 6b40 <_sk_callback_sse41+0xf30>
+  DB  102,15,111,21,34,49,0,0             ; movdqa        0x3122(%rip),%xmm2        # 6b50 <_sk_callback_sse41+0xf40>
   DB  102,15,219,211                      ; pand          %xmm3,%xmm2
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,12,49,0,0                  ; mulps         0x310c(%rip),%xmm2        # 6b20 <_sk_callback_sse41+0xf38>
-  DB  102,15,219,29,20,49,0,0             ; pand          0x3114(%rip),%xmm3        # 6b30 <_sk_callback_sse41+0xf48>
+  DB  15,89,21,36,49,0,0                  ; mulps         0x3124(%rip),%xmm2        # 6b60 <_sk_callback_sse41+0xf50>
+  DB  102,15,219,29,44,49,0,0             ; pand          0x312c(%rip),%xmm3        # 6b70 <_sk_callback_sse41+0xf60>
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,26,49,0,0                  ; mulps         0x311a(%rip),%xmm3        # 6b40 <_sk_callback_sse41+0xf58>
+  DB  15,89,29,50,49,0,0                  ; mulps         0x3132(%rip),%xmm3        # 6b80 <_sk_callback_sse41+0xf70>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
   DB  255,224                             ; jmpq          *%rax
@@ -17841,7 +17898,7 @@
 _sk_store_4444_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,24,49,0,0                ; movaps        0x3118(%rip),%xmm8        # 6b50 <_sk_callback_sse41+0xf68>
+  DB  68,15,40,5,48,49,0,0                ; movaps        0x3130(%rip),%xmm8        # 6b90 <_sk_callback_sse41+0xf80>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -17861,7 +17918,7 @@
   DB  102,69,15,86,194                    ; orpd          %xmm10,%xmm8
   DB  102,69,15,56,43,192                 ; packusdw      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           3a9e <_sk_store_4444_sse41+0x73>
+  DB  117,10                              ; jne           3ac6 <_sk_store_4444_sse41+0x73>
   DB  242,68,15,17,4,80                   ; movsd         %xmm8,(%rax,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -17869,36 +17926,36 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,35                              ; je            3ad4 <_sk_store_4444_sse41+0xa9>
+  DB  116,35                              ; je            3afc <_sk_store_4444_sse41+0xa9>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,15                              ; je            3ac6 <_sk_store_4444_sse41+0x9b>
+  DB  116,15                              ; je            3aee <_sk_store_4444_sse41+0x9b>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,221                             ; jne           3a9a <_sk_store_4444_sse41+0x6f>
+  DB  117,221                             ; jne           3ac2 <_sk_store_4444_sse41+0x6f>
   DB  102,68,15,58,21,68,80,4,4           ; pextrw        $0x4,%xmm8,0x4(%rax,%rdx,2)
   DB  242,69,15,112,192,232               ; pshuflw       $0xe8,%xmm8,%xmm8
   DB  102,68,15,126,4,80                  ; movd          %xmm8,(%rax,%rdx,2)
-  DB  235,198                             ; jmp           3a9a <_sk_store_4444_sse41+0x6f>
+  DB  235,198                             ; jmp           3ac2 <_sk_store_4444_sse41+0x6f>
   DB  102,68,15,58,21,4,80,0              ; pextrw        $0x0,%xmm8,(%rax,%rdx,2)
-  DB  235,188                             ; jmp           3a9a <_sk_store_4444_sse41+0x6f>
+  DB  235,188                             ; jmp           3ac2 <_sk_store_4444_sse41+0x6f>
 
 PUBLIC _sk_load_8888_sse41
 _sk_load_8888_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,88                              ; jne           3b40 <_sk_load_8888_sse41+0x62>
+  DB  117,88                              ; jne           3b68 <_sk_load_8888_sse41+0x62>
   DB  243,15,111,28,144                   ; movdqu        (%rax,%rdx,4),%xmm3
-  DB  102,15,111,5,107,48,0,0             ; movdqa        0x306b(%rip),%xmm0        # 6b60 <_sk_callback_sse41+0xf78>
+  DB  102,15,111,5,131,48,0,0             ; movdqa        0x3083(%rip),%xmm0        # 6ba0 <_sk_callback_sse41+0xf90>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,108,48,0,0               ; movaps        0x306c(%rip),%xmm8        # 6b70 <_sk_callback_sse41+0xf88>
+  DB  68,15,40,5,132,48,0,0               ; movaps        0x3084(%rip),%xmm8        # 6bb0 <_sk_callback_sse41+0xfa0>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
-  DB  102,15,56,0,13,107,48,0,0           ; pshufb        0x306b(%rip),%xmm1        # 6b80 <_sk_callback_sse41+0xf98>
+  DB  102,15,56,0,13,131,48,0,0           ; pshufb        0x3083(%rip),%xmm1        # 6bc0 <_sk_callback_sse41+0xfb0>
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,111,211                      ; movdqa        %xmm3,%xmm2
-  DB  102,15,56,0,21,103,48,0,0           ; pshufb        0x3067(%rip),%xmm2        # 6b90 <_sk_callback_sse41+0xfa8>
+  DB  102,15,56,0,21,127,48,0,0           ; pshufb        0x307f(%rip),%xmm2        # 6bd0 <_sk_callback_sse41+0xfc0>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  102,15,114,211,24                   ; psrld         $0x18,%xmm3
@@ -17909,38 +17966,38 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,43                              ; je            3b78 <_sk_load_8888_sse41+0x9a>
+  DB  116,43                              ; je            3ba0 <_sk_load_8888_sse41+0x9a>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,17                              ; je            3b68 <_sk_load_8888_sse41+0x8a>
+  DB  116,17                              ; je            3b90 <_sk_load_8888_sse41+0x8a>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,144                             ; jne           3aed <_sk_load_8888_sse41+0xf>
+  DB  117,144                             ; jne           3b15 <_sk_load_8888_sse41+0xf>
   DB  102,15,110,68,144,8                 ; movd          0x8(%rax,%rdx,4),%xmm0
   DB  102,15,112,216,69                   ; pshufd        $0x45,%xmm0,%xmm3
   DB  243,15,126,4,144                    ; movq          (%rax,%rdx,4),%xmm0
   DB  102,15,58,14,216,15                 ; pblendw       $0xf,%xmm0,%xmm3
-  DB  233,117,255,255,255                 ; jmpq          3aed <_sk_load_8888_sse41+0xf>
+  DB  233,117,255,255,255                 ; jmpq          3b15 <_sk_load_8888_sse41+0xf>
   DB  102,15,110,28,144                   ; movd          (%rax,%rdx,4),%xmm3
-  DB  233,107,255,255,255                 ; jmpq          3aed <_sk_load_8888_sse41+0xf>
+  DB  233,107,255,255,255                 ; jmpq          3b15 <_sk_load_8888_sse41+0xf>
 
 PUBLIC _sk_load_8888_dst_sse41
 _sk_load_8888_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,88                              ; jne           3be4 <_sk_load_8888_dst_sse41+0x62>
+  DB  117,88                              ; jne           3c0c <_sk_load_8888_dst_sse41+0x62>
   DB  243,15,111,60,144                   ; movdqu        (%rax,%rdx,4),%xmm7
-  DB  102,15,111,37,7,48,0,0              ; movdqa        0x3007(%rip),%xmm4        # 6ba0 <_sk_callback_sse41+0xfb8>
+  DB  102,15,111,37,31,48,0,0             ; movdqa        0x301f(%rip),%xmm4        # 6be0 <_sk_callback_sse41+0xfd0>
   DB  102,15,219,231                      ; pand          %xmm7,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  68,15,40,5,8,48,0,0                 ; movaps        0x3008(%rip),%xmm8        # 6bb0 <_sk_callback_sse41+0xfc8>
+  DB  68,15,40,5,32,48,0,0                ; movaps        0x3020(%rip),%xmm8        # 6bf0 <_sk_callback_sse41+0xfe0>
   DB  65,15,89,224                        ; mulps         %xmm8,%xmm4
   DB  102,15,111,239                      ; movdqa        %xmm7,%xmm5
-  DB  102,15,56,0,45,7,48,0,0             ; pshufb        0x3007(%rip),%xmm5        # 6bc0 <_sk_callback_sse41+0xfd8>
+  DB  102,15,56,0,45,31,48,0,0            ; pshufb        0x301f(%rip),%xmm5        # 6c00 <_sk_callback_sse41+0xff0>
   DB  15,91,237                           ; cvtdq2ps      %xmm5,%xmm5
   DB  65,15,89,232                        ; mulps         %xmm8,%xmm5
   DB  102,15,111,247                      ; movdqa        %xmm7,%xmm6
-  DB  102,15,56,0,53,3,48,0,0             ; pshufb        0x3003(%rip),%xmm6        # 6bd0 <_sk_callback_sse41+0xfe8>
+  DB  102,15,56,0,53,27,48,0,0            ; pshufb        0x301b(%rip),%xmm6        # 6c10 <_sk_callback_sse41+0x1000>
   DB  15,91,246                           ; cvtdq2ps      %xmm6,%xmm6
   DB  65,15,89,240                        ; mulps         %xmm8,%xmm6
   DB  102,15,114,215,24                   ; psrld         $0x18,%xmm7
@@ -17951,19 +18008,19 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,43                              ; je            3c1c <_sk_load_8888_dst_sse41+0x9a>
+  DB  116,43                              ; je            3c44 <_sk_load_8888_dst_sse41+0x9a>
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,17                              ; je            3c0c <_sk_load_8888_dst_sse41+0x8a>
+  DB  116,17                              ; je            3c34 <_sk_load_8888_dst_sse41+0x8a>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,144                             ; jne           3b91 <_sk_load_8888_dst_sse41+0xf>
+  DB  117,144                             ; jne           3bb9 <_sk_load_8888_dst_sse41+0xf>
   DB  102,15,110,100,144,8                ; movd          0x8(%rax,%rdx,4),%xmm4
   DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
   DB  243,15,126,36,144                   ; movq          (%rax,%rdx,4),%xmm4
   DB  102,15,58,14,252,15                 ; pblendw       $0xf,%xmm4,%xmm7
-  DB  233,117,255,255,255                 ; jmpq          3b91 <_sk_load_8888_dst_sse41+0xf>
+  DB  233,117,255,255,255                 ; jmpq          3bb9 <_sk_load_8888_dst_sse41+0xf>
   DB  102,15,110,60,144                   ; movd          (%rax,%rdx,4),%xmm7
-  DB  233,107,255,255,255                 ; jmpq          3b91 <_sk_load_8888_dst_sse41+0xf>
+  DB  233,107,255,255,255                 ; jmpq          3bb9 <_sk_load_8888_dst_sse41+0xf>
 
 PUBLIC _sk_gather_8888_sse41
 _sk_gather_8888_sse41 LABEL PROC
@@ -17986,17 +18043,17 @@
   DB  102,65,15,58,34,28,129,1            ; pinsrd        $0x1,(%r9,%rax,4),%xmm3
   DB  102,65,15,58,34,28,153,2            ; pinsrd        $0x2,(%r9,%rbx,4),%xmm3
   DB  102,67,15,58,34,28,153,3            ; pinsrd        $0x3,(%r9,%r11,4),%xmm3
-  DB  102,15,111,5,89,47,0,0              ; movdqa        0x2f59(%rip),%xmm0        # 6be0 <_sk_callback_sse41+0xff8>
+  DB  102,15,111,5,113,47,0,0             ; movdqa        0x2f71(%rip),%xmm0        # 6c20 <_sk_callback_sse41+0x1010>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,90,47,0,0                ; movaps        0x2f5a(%rip),%xmm8        # 6bf0 <_sk_callback_sse41+0x1008>
+  DB  68,15,40,5,114,47,0,0               ; movaps        0x2f72(%rip),%xmm8        # 6c30 <_sk_callback_sse41+0x1020>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
-  DB  102,15,56,0,13,89,47,0,0            ; pshufb        0x2f59(%rip),%xmm1        # 6c00 <_sk_callback_sse41+0x1018>
+  DB  102,15,56,0,13,113,47,0,0           ; pshufb        0x2f71(%rip),%xmm1        # 6c40 <_sk_callback_sse41+0x1030>
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,111,211                      ; movdqa        %xmm3,%xmm2
-  DB  102,15,56,0,21,85,47,0,0            ; pshufb        0x2f55(%rip),%xmm2        # 6c10 <_sk_callback_sse41+0x1028>
+  DB  102,15,56,0,21,109,47,0,0           ; pshufb        0x2f6d(%rip),%xmm2        # 6c50 <_sk_callback_sse41+0x1040>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  102,15,114,211,24                   ; psrld         $0x18,%xmm3
@@ -18010,7 +18067,7 @@
 _sk_store_8888_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,64,47,0,0                ; movaps        0x2f40(%rip),%xmm8        # 6c20 <_sk_callback_sse41+0x1038>
+  DB  68,15,40,5,88,47,0,0                ; movaps        0x2f58(%rip),%xmm8        # 6c60 <_sk_callback_sse41+0x1050>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -18029,42 +18086,42 @@
   DB  102,69,15,235,193                   ; por           %xmm9,%xmm8
   DB  102,69,15,235,194                   ; por           %xmm10,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           3d40 <_sk_store_8888_sse41+0x6d>
+  DB  117,10                              ; jne           3d68 <_sk_store_8888_sse41+0x6d>
   DB  243,68,15,127,4,144                 ; movdqu        %xmm8,(%rax,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,29                              ; je            3d6a <_sk_store_8888_sse41+0x97>
+  DB  116,29                              ; je            3d92 <_sk_store_8888_sse41+0x97>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,15                              ; je            3d62 <_sk_store_8888_sse41+0x8f>
+  DB  116,15                              ; je            3d8a <_sk_store_8888_sse41+0x8f>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,227                             ; jne           3d3c <_sk_store_8888_sse41+0x69>
+  DB  117,227                             ; jne           3d64 <_sk_store_8888_sse41+0x69>
   DB  102,68,15,58,22,68,144,8,2          ; pextrd        $0x2,%xmm8,0x8(%rax,%rdx,4)
   DB  102,68,15,214,4,144                 ; movq          %xmm8,(%rax,%rdx,4)
-  DB  235,210                             ; jmp           3d3c <_sk_store_8888_sse41+0x69>
+  DB  235,210                             ; jmp           3d64 <_sk_store_8888_sse41+0x69>
   DB  102,68,15,126,4,144                 ; movd          %xmm8,(%rax,%rdx,4)
-  DB  235,202                             ; jmp           3d3c <_sk_store_8888_sse41+0x69>
+  DB  235,202                             ; jmp           3d64 <_sk_store_8888_sse41+0x69>
 
 PUBLIC _sk_load_bgra_sse41
 _sk_load_bgra_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,88                              ; jne           3dd4 <_sk_load_bgra_sse41+0x62>
+  DB  117,88                              ; jne           3dfc <_sk_load_bgra_sse41+0x62>
   DB  243,15,111,28,144                   ; movdqu        (%rax,%rdx,4),%xmm3
-  DB  102,15,111,5,167,46,0,0             ; movdqa        0x2ea7(%rip),%xmm0        # 6c30 <_sk_callback_sse41+0x1048>
+  DB  102,15,111,5,191,46,0,0             ; movdqa        0x2ebf(%rip),%xmm0        # 6c70 <_sk_callback_sse41+0x1060>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,208                           ; cvtdq2ps      %xmm0,%xmm2
-  DB  68,15,40,5,168,46,0,0               ; movaps        0x2ea8(%rip),%xmm8        # 6c40 <_sk_callback_sse41+0x1058>
+  DB  68,15,40,5,192,46,0,0               ; movaps        0x2ec0(%rip),%xmm8        # 6c80 <_sk_callback_sse41+0x1070>
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
-  DB  102,15,56,0,5,167,46,0,0            ; pshufb        0x2ea7(%rip),%xmm0        # 6c50 <_sk_callback_sse41+0x1068>
+  DB  102,15,56,0,5,191,46,0,0            ; pshufb        0x2ebf(%rip),%xmm0        # 6c90 <_sk_callback_sse41+0x1080>
   DB  15,91,200                           ; cvtdq2ps      %xmm0,%xmm1
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
-  DB  102,15,56,0,5,163,46,0,0            ; pshufb        0x2ea3(%rip),%xmm0        # 6c60 <_sk_callback_sse41+0x1078>
+  DB  102,15,56,0,5,187,46,0,0            ; pshufb        0x2ebb(%rip),%xmm0        # 6ca0 <_sk_callback_sse41+0x1090>
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,114,211,24                   ; psrld         $0x18,%xmm3
@@ -18075,38 +18132,38 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,43                              ; je            3e0c <_sk_load_bgra_sse41+0x9a>
+  DB  116,43                              ; je            3e34 <_sk_load_bgra_sse41+0x9a>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,17                              ; je            3dfc <_sk_load_bgra_sse41+0x8a>
+  DB  116,17                              ; je            3e24 <_sk_load_bgra_sse41+0x8a>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,144                             ; jne           3d81 <_sk_load_bgra_sse41+0xf>
+  DB  117,144                             ; jne           3da9 <_sk_load_bgra_sse41+0xf>
   DB  102,15,110,68,144,8                 ; movd          0x8(%rax,%rdx,4),%xmm0
   DB  102,15,112,216,69                   ; pshufd        $0x45,%xmm0,%xmm3
   DB  243,15,126,4,144                    ; movq          (%rax,%rdx,4),%xmm0
   DB  102,15,58,14,216,15                 ; pblendw       $0xf,%xmm0,%xmm3
-  DB  233,117,255,255,255                 ; jmpq          3d81 <_sk_load_bgra_sse41+0xf>
+  DB  233,117,255,255,255                 ; jmpq          3da9 <_sk_load_bgra_sse41+0xf>
   DB  102,15,110,28,144                   ; movd          (%rax,%rdx,4),%xmm3
-  DB  233,107,255,255,255                 ; jmpq          3d81 <_sk_load_bgra_sse41+0xf>
+  DB  233,107,255,255,255                 ; jmpq          3da9 <_sk_load_bgra_sse41+0xf>
 
 PUBLIC _sk_load_bgra_dst_sse41
 _sk_load_bgra_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,88                              ; jne           3e78 <_sk_load_bgra_dst_sse41+0x62>
+  DB  117,88                              ; jne           3ea0 <_sk_load_bgra_dst_sse41+0x62>
   DB  243,15,111,60,144                   ; movdqu        (%rax,%rdx,4),%xmm7
-  DB  102,15,111,37,67,46,0,0             ; movdqa        0x2e43(%rip),%xmm4        # 6c70 <_sk_callback_sse41+0x1088>
+  DB  102,15,111,37,91,46,0,0             ; movdqa        0x2e5b(%rip),%xmm4        # 6cb0 <_sk_callback_sse41+0x10a0>
   DB  102,15,219,231                      ; pand          %xmm7,%xmm4
   DB  15,91,244                           ; cvtdq2ps      %xmm4,%xmm6
-  DB  68,15,40,5,68,46,0,0                ; movaps        0x2e44(%rip),%xmm8        # 6c80 <_sk_callback_sse41+0x1098>
+  DB  68,15,40,5,92,46,0,0                ; movaps        0x2e5c(%rip),%xmm8        # 6cc0 <_sk_callback_sse41+0x10b0>
   DB  65,15,89,240                        ; mulps         %xmm8,%xmm6
   DB  102,15,111,231                      ; movdqa        %xmm7,%xmm4
-  DB  102,15,56,0,37,67,46,0,0            ; pshufb        0x2e43(%rip),%xmm4        # 6c90 <_sk_callback_sse41+0x10a8>
+  DB  102,15,56,0,37,91,46,0,0            ; pshufb        0x2e5b(%rip),%xmm4        # 6cd0 <_sk_callback_sse41+0x10c0>
   DB  15,91,236                           ; cvtdq2ps      %xmm4,%xmm5
   DB  65,15,89,232                        ; mulps         %xmm8,%xmm5
   DB  102,15,111,231                      ; movdqa        %xmm7,%xmm4
-  DB  102,15,56,0,37,63,46,0,0            ; pshufb        0x2e3f(%rip),%xmm4        # 6ca0 <_sk_callback_sse41+0x10b8>
+  DB  102,15,56,0,37,87,46,0,0            ; pshufb        0x2e57(%rip),%xmm4        # 6ce0 <_sk_callback_sse41+0x10d0>
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
   DB  65,15,89,224                        ; mulps         %xmm8,%xmm4
   DB  102,15,114,215,24                   ; psrld         $0x18,%xmm7
@@ -18117,19 +18174,19 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,43                              ; je            3eb0 <_sk_load_bgra_dst_sse41+0x9a>
+  DB  116,43                              ; je            3ed8 <_sk_load_bgra_dst_sse41+0x9a>
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,17                              ; je            3ea0 <_sk_load_bgra_dst_sse41+0x8a>
+  DB  116,17                              ; je            3ec8 <_sk_load_bgra_dst_sse41+0x8a>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,144                             ; jne           3e25 <_sk_load_bgra_dst_sse41+0xf>
+  DB  117,144                             ; jne           3e4d <_sk_load_bgra_dst_sse41+0xf>
   DB  102,15,110,100,144,8                ; movd          0x8(%rax,%rdx,4),%xmm4
   DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
   DB  243,15,126,36,144                   ; movq          (%rax,%rdx,4),%xmm4
   DB  102,15,58,14,252,15                 ; pblendw       $0xf,%xmm4,%xmm7
-  DB  233,117,255,255,255                 ; jmpq          3e25 <_sk_load_bgra_dst_sse41+0xf>
+  DB  233,117,255,255,255                 ; jmpq          3e4d <_sk_load_bgra_dst_sse41+0xf>
   DB  102,15,110,60,144                   ; movd          (%rax,%rdx,4),%xmm7
-  DB  233,107,255,255,255                 ; jmpq          3e25 <_sk_load_bgra_dst_sse41+0xf>
+  DB  233,107,255,255,255                 ; jmpq          3e4d <_sk_load_bgra_dst_sse41+0xf>
 
 PUBLIC _sk_gather_bgra_sse41
 _sk_gather_bgra_sse41 LABEL PROC
@@ -18152,17 +18209,17 @@
   DB  102,65,15,58,34,28,129,1            ; pinsrd        $0x1,(%r9,%rax,4),%xmm3
   DB  102,65,15,58,34,28,153,2            ; pinsrd        $0x2,(%r9,%rbx,4),%xmm3
   DB  102,67,15,58,34,28,153,3            ; pinsrd        $0x3,(%r9,%r11,4),%xmm3
-  DB  102,15,111,5,149,45,0,0             ; movdqa        0x2d95(%rip),%xmm0        # 6cb0 <_sk_callback_sse41+0x10c8>
+  DB  102,15,111,5,173,45,0,0             ; movdqa        0x2dad(%rip),%xmm0        # 6cf0 <_sk_callback_sse41+0x10e0>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,208                           ; cvtdq2ps      %xmm0,%xmm2
-  DB  68,15,40,5,150,45,0,0               ; movaps        0x2d96(%rip),%xmm8        # 6cc0 <_sk_callback_sse41+0x10d8>
+  DB  68,15,40,5,174,45,0,0               ; movaps        0x2dae(%rip),%xmm8        # 6d00 <_sk_callback_sse41+0x10f0>
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
-  DB  102,15,56,0,5,149,45,0,0            ; pshufb        0x2d95(%rip),%xmm0        # 6cd0 <_sk_callback_sse41+0x10e8>
+  DB  102,15,56,0,5,173,45,0,0            ; pshufb        0x2dad(%rip),%xmm0        # 6d10 <_sk_callback_sse41+0x1100>
   DB  15,91,200                           ; cvtdq2ps      %xmm0,%xmm1
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
-  DB  102,15,56,0,5,145,45,0,0            ; pshufb        0x2d91(%rip),%xmm0        # 6ce0 <_sk_callback_sse41+0x10f8>
+  DB  102,15,56,0,5,169,45,0,0            ; pshufb        0x2da9(%rip),%xmm0        # 6d20 <_sk_callback_sse41+0x1110>
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,114,211,24                   ; psrld         $0x18,%xmm3
@@ -18176,7 +18233,7 @@
 _sk_store_bgra_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,124,45,0,0               ; movaps        0x2d7c(%rip),%xmm8        # 6cf0 <_sk_callback_sse41+0x1108>
+  DB  68,15,40,5,148,45,0,0               ; movaps        0x2d94(%rip),%xmm8        # 6d30 <_sk_callback_sse41+0x1120>
   DB  68,15,40,202                        ; movaps        %xmm2,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -18195,30 +18252,30 @@
   DB  102,69,15,235,193                   ; por           %xmm9,%xmm8
   DB  102,69,15,235,194                   ; por           %xmm10,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           3fd4 <_sk_store_bgra_sse41+0x6d>
+  DB  117,10                              ; jne           3ffc <_sk_store_bgra_sse41+0x6d>
   DB  243,68,15,127,4,144                 ; movdqu        %xmm8,(%rax,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,29                              ; je            3ffe <_sk_store_bgra_sse41+0x97>
+  DB  116,29                              ; je            4026 <_sk_store_bgra_sse41+0x97>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,15                              ; je            3ff6 <_sk_store_bgra_sse41+0x8f>
+  DB  116,15                              ; je            401e <_sk_store_bgra_sse41+0x8f>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,227                             ; jne           3fd0 <_sk_store_bgra_sse41+0x69>
+  DB  117,227                             ; jne           3ff8 <_sk_store_bgra_sse41+0x69>
   DB  102,68,15,58,22,68,144,8,2          ; pextrd        $0x2,%xmm8,0x8(%rax,%rdx,4)
   DB  102,68,15,214,4,144                 ; movq          %xmm8,(%rax,%rdx,4)
-  DB  235,210                             ; jmp           3fd0 <_sk_store_bgra_sse41+0x69>
+  DB  235,210                             ; jmp           3ff8 <_sk_store_bgra_sse41+0x69>
   DB  102,68,15,126,4,144                 ; movd          %xmm8,(%rax,%rdx,4)
-  DB  235,202                             ; jmp           3fd0 <_sk_store_bgra_sse41+0x69>
+  DB  235,202                             ; jmp           3ff8 <_sk_store_bgra_sse41+0x69>
 
 PUBLIC _sk_load_f16_sse41
 _sk_load_f16_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,60,1,0,0                     ; jne           4150 <_sk_load_f16_sse41+0x14a>
+  DB  15,133,60,1,0,0                     ; jne           4178 <_sk_load_f16_sse41+0x14a>
   DB  102,15,16,4,208                     ; movupd        (%rax,%rdx,8),%xmm0
   DB  243,15,111,76,208,16                ; movdqu        0x10(%rax,%rdx,8),%xmm1
   DB  102,68,15,40,200                    ; movapd        %xmm0,%xmm9
@@ -18228,18 +18285,18 @@
   DB  102,68,15,97,216                    ; punpcklwd     %xmm0,%xmm11
   DB  102,68,15,105,200                   ; punpckhwd     %xmm0,%xmm9
   DB  102,65,15,56,51,203                 ; pmovzxwd      %xmm11,%xmm1
-  DB  102,68,15,111,5,181,44,0,0          ; movdqa        0x2cb5(%rip),%xmm8        # 6d00 <_sk_callback_sse41+0x1118>
+  DB  102,68,15,111,5,205,44,0,0          ; movdqa        0x2ccd(%rip),%xmm8        # 6d40 <_sk_callback_sse41+0x1130>
   DB  102,15,111,209                      ; movdqa        %xmm1,%xmm2
   DB  102,65,15,219,208                   ; pand          %xmm8,%xmm2
   DB  102,15,239,202                      ; pxor          %xmm2,%xmm1
-  DB  102,15,111,29,176,44,0,0            ; movdqa        0x2cb0(%rip),%xmm3        # 6d10 <_sk_callback_sse41+0x1128>
+  DB  102,15,111,29,200,44,0,0            ; movdqa        0x2cc8(%rip),%xmm3        # 6d50 <_sk_callback_sse41+0x1140>
   DB  102,15,114,242,16                   ; pslld         $0x10,%xmm2
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,15,56,63,195                    ; pmaxud        %xmm3,%xmm0
   DB  102,15,118,193                      ; pcmpeqd       %xmm1,%xmm0
   DB  102,15,114,241,13                   ; pslld         $0xd,%xmm1
   DB  102,15,235,202                      ; por           %xmm2,%xmm1
-  DB  102,68,15,111,21,156,44,0,0         ; movdqa        0x2c9c(%rip),%xmm10        # 6d20 <_sk_callback_sse41+0x1138>
+  DB  102,68,15,111,21,180,44,0,0         ; movdqa        0x2cb4(%rip),%xmm10        # 6d60 <_sk_callback_sse41+0x1150>
   DB  102,65,15,254,202                   ; paddd         %xmm10,%xmm1
   DB  102,15,219,193                      ; pand          %xmm1,%xmm0
   DB  102,65,15,115,219,8                 ; psrldq        $0x8,%xmm11
@@ -18282,23 +18339,23 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,15,16,4,208                     ; movsd         (%rax,%rdx,8),%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,13                              ; jne           4168 <_sk_load_f16_sse41+0x162>
+  DB  117,13                              ; jne           4190 <_sk_load_f16_sse41+0x162>
   DB  243,15,126,192                      ; movq          %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,183,254,255,255                 ; jmpq          401f <_sk_load_f16_sse41+0x19>
+  DB  233,183,254,255,255                 ; jmpq          4047 <_sk_load_f16_sse41+0x19>
   DB  102,15,22,68,208,8                  ; movhpd        0x8(%rax,%rdx,8),%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,163,254,255,255              ; jb            401f <_sk_load_f16_sse41+0x19>
+  DB  15,130,163,254,255,255              ; jb            4047 <_sk_load_f16_sse41+0x19>
   DB  243,15,126,76,208,16                ; movq          0x10(%rax,%rdx,8),%xmm1
-  DB  233,152,254,255,255                 ; jmpq          401f <_sk_load_f16_sse41+0x19>
+  DB  233,152,254,255,255                 ; jmpq          4047 <_sk_load_f16_sse41+0x19>
 
 PUBLIC _sk_load_f16_dst_sse41
 _sk_load_f16_dst_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,60,1,0,0                     ; jne           42d1 <_sk_load_f16_dst_sse41+0x14a>
+  DB  15,133,60,1,0,0                     ; jne           42f9 <_sk_load_f16_dst_sse41+0x14a>
   DB  102,15,16,36,208                    ; movupd        (%rax,%rdx,8),%xmm4
   DB  243,15,111,108,208,16               ; movdqu        0x10(%rax,%rdx,8),%xmm5
   DB  102,68,15,40,204                    ; movapd        %xmm4,%xmm9
@@ -18308,18 +18365,18 @@
   DB  102,68,15,97,220                    ; punpcklwd     %xmm4,%xmm11
   DB  102,68,15,105,204                   ; punpckhwd     %xmm4,%xmm9
   DB  102,65,15,56,51,235                 ; pmovzxwd      %xmm11,%xmm5
-  DB  102,68,15,111,5,100,43,0,0          ; movdqa        0x2b64(%rip),%xmm8        # 6d30 <_sk_callback_sse41+0x1148>
+  DB  102,68,15,111,5,124,43,0,0          ; movdqa        0x2b7c(%rip),%xmm8        # 6d70 <_sk_callback_sse41+0x1160>
   DB  102,15,111,245                      ; movdqa        %xmm5,%xmm6
   DB  102,65,15,219,240                   ; pand          %xmm8,%xmm6
   DB  102,15,239,238                      ; pxor          %xmm6,%xmm5
-  DB  102,15,111,61,95,43,0,0             ; movdqa        0x2b5f(%rip),%xmm7        # 6d40 <_sk_callback_sse41+0x1158>
+  DB  102,15,111,61,119,43,0,0            ; movdqa        0x2b77(%rip),%xmm7        # 6d80 <_sk_callback_sse41+0x1170>
   DB  102,15,114,246,16                   ; pslld         $0x10,%xmm6
   DB  102,15,111,229                      ; movdqa        %xmm5,%xmm4
   DB  102,15,56,63,231                    ; pmaxud        %xmm7,%xmm4
   DB  102,15,118,229                      ; pcmpeqd       %xmm5,%xmm4
   DB  102,15,114,245,13                   ; pslld         $0xd,%xmm5
   DB  102,15,235,238                      ; por           %xmm6,%xmm5
-  DB  102,68,15,111,21,75,43,0,0          ; movdqa        0x2b4b(%rip),%xmm10        # 6d50 <_sk_callback_sse41+0x1168>
+  DB  102,68,15,111,21,99,43,0,0          ; movdqa        0x2b63(%rip),%xmm10        # 6d90 <_sk_callback_sse41+0x1180>
   DB  102,65,15,254,234                   ; paddd         %xmm10,%xmm5
   DB  102,15,219,229                      ; pand          %xmm5,%xmm4
   DB  102,65,15,115,219,8                 ; psrldq        $0x8,%xmm11
@@ -18362,16 +18419,16 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,15,16,36,208                    ; movsd         (%rax,%rdx,8),%xmm4
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,13                              ; jne           42e9 <_sk_load_f16_dst_sse41+0x162>
+  DB  117,13                              ; jne           4311 <_sk_load_f16_dst_sse41+0x162>
   DB  243,15,126,228                      ; movq          %xmm4,%xmm4
   DB  102,15,239,237                      ; pxor          %xmm5,%xmm5
-  DB  233,183,254,255,255                 ; jmpq          41a0 <_sk_load_f16_dst_sse41+0x19>
+  DB  233,183,254,255,255                 ; jmpq          41c8 <_sk_load_f16_dst_sse41+0x19>
   DB  102,15,22,100,208,8                 ; movhpd        0x8(%rax,%rdx,8),%xmm4
   DB  102,15,239,237                      ; pxor          %xmm5,%xmm5
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,163,254,255,255              ; jb            41a0 <_sk_load_f16_dst_sse41+0x19>
+  DB  15,130,163,254,255,255              ; jb            41c8 <_sk_load_f16_dst_sse41+0x19>
   DB  243,15,126,108,208,16               ; movq          0x10(%rax,%rdx,8),%xmm5
-  DB  233,152,254,255,255                 ; jmpq          41a0 <_sk_load_f16_dst_sse41+0x19>
+  DB  233,152,254,255,255                 ; jmpq          41c8 <_sk_load_f16_dst_sse41+0x19>
 
 PUBLIC _sk_gather_f16_sse41
 _sk_gather_f16_sse41 LABEL PROC
@@ -18403,18 +18460,18 @@
   DB  102,68,15,97,218                    ; punpcklwd     %xmm2,%xmm11
   DB  102,68,15,105,202                   ; punpckhwd     %xmm2,%xmm9
   DB  102,65,15,56,51,203                 ; pmovzxwd      %xmm11,%xmm1
-  DB  102,68,15,111,5,209,41,0,0          ; movdqa        0x29d1(%rip),%xmm8        # 6d60 <_sk_callback_sse41+0x1178>
+  DB  102,68,15,111,5,233,41,0,0          ; movdqa        0x29e9(%rip),%xmm8        # 6da0 <_sk_callback_sse41+0x1190>
   DB  102,15,111,209                      ; movdqa        %xmm1,%xmm2
   DB  102,65,15,219,208                   ; pand          %xmm8,%xmm2
   DB  102,15,239,202                      ; pxor          %xmm2,%xmm1
-  DB  102,15,111,29,204,41,0,0            ; movdqa        0x29cc(%rip),%xmm3        # 6d70 <_sk_callback_sse41+0x1188>
+  DB  102,15,111,29,228,41,0,0            ; movdqa        0x29e4(%rip),%xmm3        # 6db0 <_sk_callback_sse41+0x11a0>
   DB  102,15,114,242,16                   ; pslld         $0x10,%xmm2
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,15,56,63,195                    ; pmaxud        %xmm3,%xmm0
   DB  102,15,118,193                      ; pcmpeqd       %xmm1,%xmm0
   DB  102,15,114,241,13                   ; pslld         $0xd,%xmm1
   DB  102,15,235,202                      ; por           %xmm2,%xmm1
-  DB  102,68,15,111,21,184,41,0,0         ; movdqa        0x29b8(%rip),%xmm10        # 6d80 <_sk_callback_sse41+0x1198>
+  DB  102,68,15,111,21,208,41,0,0         ; movdqa        0x29d0(%rip),%xmm10        # 6dc0 <_sk_callback_sse41+0x11b0>
   DB  102,65,15,254,202                   ; paddd         %xmm10,%xmm1
   DB  102,15,219,193                      ; pand          %xmm1,%xmm0
   DB  102,65,15,115,219,8                 ; psrldq        $0x8,%xmm11
@@ -18461,17 +18518,17 @@
 _sk_store_f16_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  102,68,15,111,21,237,40,0,0         ; movdqa        0x28ed(%rip),%xmm10        # 6d90 <_sk_callback_sse41+0x11a8>
+  DB  102,68,15,111,21,5,41,0,0           ; movdqa        0x2905(%rip),%xmm10        # 6dd0 <_sk_callback_sse41+0x11c0>
   DB  102,68,15,111,216                   ; movdqa        %xmm0,%xmm11
   DB  102,69,15,219,218                   ; pand          %xmm10,%xmm11
   DB  102,68,15,111,232                   ; movdqa        %xmm0,%xmm13
   DB  102,69,15,239,235                   ; pxor          %xmm11,%xmm13
-  DB  102,68,15,111,13,224,40,0,0         ; movdqa        0x28e0(%rip),%xmm9        # 6da0 <_sk_callback_sse41+0x11b8>
+  DB  102,68,15,111,13,248,40,0,0         ; movdqa        0x28f8(%rip),%xmm9        # 6de0 <_sk_callback_sse41+0x11d0>
   DB  102,65,15,114,211,16                ; psrld         $0x10,%xmm11
   DB  102,69,15,111,193                   ; movdqa        %xmm9,%xmm8
   DB  102,69,15,102,197                   ; pcmpgtd       %xmm13,%xmm8
   DB  102,65,15,114,213,13                ; psrld         $0xd,%xmm13
-  DB  102,68,15,111,37,209,40,0,0         ; movdqa        0x28d1(%rip),%xmm12        # 6db0 <_sk_callback_sse41+0x11c8>
+  DB  102,68,15,111,37,233,40,0,0         ; movdqa        0x28e9(%rip),%xmm12        # 6df0 <_sk_callback_sse41+0x11e0>
   DB  102,69,15,235,220                   ; por           %xmm12,%xmm11
   DB  102,69,15,254,221                   ; paddd         %xmm13,%xmm11
   DB  102,69,15,223,195                   ; pandn         %xmm11,%xmm8
@@ -18515,7 +18572,7 @@
   DB  102,69,15,111,200                   ; movdqa        %xmm8,%xmm9
   DB  102,69,15,98,203                    ; punpckldq     %xmm11,%xmm9
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,21                              ; jne           45d5 <_sk_store_f16_sse41+0x140>
+  DB  117,21                              ; jne           45fd <_sk_store_f16_sse41+0x140>
   DB  68,15,17,12,208                     ; movups        %xmm9,(%rax,%rdx,8)
   DB  102,69,15,106,195                   ; punpckhdq     %xmm11,%xmm8
   DB  243,68,15,127,68,208,16             ; movdqu        %xmm8,0x10(%rax,%rdx,8)
@@ -18523,13 +18580,13 @@
   DB  255,224                             ; jmpq          *%rax
   DB  102,68,15,214,12,208                ; movq          %xmm9,(%rax,%rdx,8)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            45d1 <_sk_store_f16_sse41+0x13c>
+  DB  116,240                             ; je            45f9 <_sk_store_f16_sse41+0x13c>
   DB  102,68,15,23,76,208,8               ; movhpd        %xmm9,0x8(%rax,%rdx,8)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            45d1 <_sk_store_f16_sse41+0x13c>
+  DB  114,227                             ; jb            45f9 <_sk_store_f16_sse41+0x13c>
   DB  102,69,15,106,195                   ; punpckhdq     %xmm11,%xmm8
   DB  102,68,15,214,68,208,16             ; movq          %xmm8,0x10(%rax,%rdx,8)
-  DB  235,213                             ; jmp           45d1 <_sk_store_f16_sse41+0x13c>
+  DB  235,213                             ; jmp           45f9 <_sk_store_f16_sse41+0x13c>
 
 PUBLIC _sk_load_u16_be_sse41
 _sk_load_u16_be_sse41 LABEL PROC
@@ -18537,7 +18594,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,185,0,0,0                    ; jne           46cb <_sk_load_u16_be_sse41+0xcf>
+  DB  15,133,185,0,0,0                    ; jne           46f3 <_sk_load_u16_be_sse41+0xcf>
   DB  102,65,15,16,4,65                   ; movupd        (%r9,%rax,2),%xmm0
   DB  243,65,15,111,76,65,16              ; movdqu        0x10(%r9,%rax,2),%xmm1
   DB  102,15,40,208                       ; movapd        %xmm0,%xmm2
@@ -18553,7 +18610,7 @@
   DB  102,15,235,200                      ; por           %xmm0,%xmm1
   DB  102,15,56,51,193                    ; pmovzxwd      %xmm1,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,98,39,0,0                ; movaps        0x2762(%rip),%xmm8        # 6dc0 <_sk_callback_sse41+0x11d8>
+  DB  68,15,40,5,122,39,0,0               ; movaps        0x277a(%rip),%xmm8        # 6e00 <_sk_callback_sse41+0x11f0>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
@@ -18581,16 +18638,16 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,65,15,16,4,65                   ; movsd         (%r9,%rax,2),%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,13                              ; jne           46e4 <_sk_load_u16_be_sse41+0xe8>
+  DB  117,13                              ; jne           470c <_sk_load_u16_be_sse41+0xe8>
   DB  243,15,126,192                      ; movq          %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,59,255,255,255                  ; jmpq          461f <_sk_load_u16_be_sse41+0x23>
+  DB  233,59,255,255,255                  ; jmpq          4647 <_sk_load_u16_be_sse41+0x23>
   DB  102,65,15,22,68,65,8                ; movhpd        0x8(%r9,%rax,2),%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,38,255,255,255               ; jb            461f <_sk_load_u16_be_sse41+0x23>
+  DB  15,130,38,255,255,255               ; jb            4647 <_sk_load_u16_be_sse41+0x23>
   DB  243,65,15,126,76,65,16              ; movq          0x10(%r9,%rax,2),%xmm1
-  DB  233,26,255,255,255                  ; jmpq          461f <_sk_load_u16_be_sse41+0x23>
+  DB  233,26,255,255,255                  ; jmpq          4647 <_sk_load_u16_be_sse41+0x23>
 
 PUBLIC _sk_load_rgb_u16_be_sse41
 _sk_load_rgb_u16_be_sse41 LABEL PROC
@@ -18598,7 +18655,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,82                         ; lea           (%rdx,%rdx,2),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,170,0,0,0                    ; jne           47c1 <_sk_load_rgb_u16_be_sse41+0xbc>
+  DB  15,133,170,0,0,0                    ; jne           47e9 <_sk_load_rgb_u16_be_sse41+0xbc>
   DB  243,65,15,111,20,65                 ; movdqu        (%r9,%rax,2),%xmm2
   DB  243,65,15,111,92,65,8               ; movdqu        0x8(%r9,%rax,2),%xmm3
   DB  102,15,115,219,4                    ; psrldq        $0x4,%xmm3
@@ -18618,7 +18675,7 @@
   DB  102,15,235,200                      ; por           %xmm0,%xmm1
   DB  102,15,56,51,193                    ; pmovzxwd      %xmm1,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,90,38,0,0                ; movaps        0x265a(%rip),%xmm8        # 6dd0 <_sk_callback_sse41+0x11e8>
+  DB  68,15,40,5,114,38,0,0               ; movaps        0x2672(%rip),%xmm8        # 6e10 <_sk_callback_sse41+0x1200>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
@@ -18635,34 +18692,34 @@
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,33,38,0,0                  ; movaps        0x2621(%rip),%xmm3        # 6de0 <_sk_callback_sse41+0x11f8>
+  DB  15,40,29,57,38,0,0                  ; movaps        0x2639(%rip),%xmm3        # 6e20 <_sk_callback_sse41+0x1210>
   DB  255,224                             ; jmpq          *%rax
   DB  102,65,15,110,20,65                 ; movd          (%r9,%rax,2),%xmm2
   DB  102,65,15,196,84,65,4,2             ; pinsrw        $0x2,0x4(%r9,%rax,2),%xmm2
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,13                              ; jne           47e6 <_sk_load_rgb_u16_be_sse41+0xe1>
+  DB  117,13                              ; jne           480e <_sk_load_rgb_u16_be_sse41+0xe1>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
-  DB  233,85,255,255,255                  ; jmpq          473b <_sk_load_rgb_u16_be_sse41+0x36>
+  DB  233,85,255,255,255                  ; jmpq          4763 <_sk_load_rgb_u16_be_sse41+0x36>
   DB  102,65,15,110,68,65,6               ; movd          0x6(%r9,%rax,2),%xmm0
   DB  102,65,15,196,68,65,10,2            ; pinsrw        $0x2,0xa(%r9,%rax,2),%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,24                              ; jb            4817 <_sk_load_rgb_u16_be_sse41+0x112>
+  DB  114,24                              ; jb            483f <_sk_load_rgb_u16_be_sse41+0x112>
   DB  102,65,15,110,92,65,12              ; movd          0xc(%r9,%rax,2),%xmm3
   DB  102,65,15,196,92,65,16,2            ; pinsrw        $0x2,0x10(%r9,%rax,2),%xmm3
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,36,255,255,255                  ; jmpq          473b <_sk_load_rgb_u16_be_sse41+0x36>
+  DB  233,36,255,255,255                  ; jmpq          4763 <_sk_load_rgb_u16_be_sse41+0x36>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
-  DB  233,27,255,255,255                  ; jmpq          473b <_sk_load_rgb_u16_be_sse41+0x36>
+  DB  233,27,255,255,255                  ; jmpq          4763 <_sk_load_rgb_u16_be_sse41+0x36>
 
 PUBLIC _sk_store_u16_be_sse41
 _sk_store_u16_be_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
-  DB  68,15,40,21,187,37,0,0              ; movaps        0x25bb(%rip),%xmm10        # 6df0 <_sk_callback_sse41+0x1208>
+  DB  68,15,40,21,211,37,0,0              ; movaps        0x25d3(%rip),%xmm10        # 6e30 <_sk_callback_sse41+0x1220>
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
   DB  69,15,89,194                        ; mulps         %xmm10,%xmm8
   DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
@@ -18699,7 +18756,7 @@
   DB  102,69,15,111,208                   ; movdqa        %xmm8,%xmm10
   DB  102,69,15,98,209                    ; punpckldq     %xmm9,%xmm10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,21                              ; jne           4903 <_sk_store_u16_be_sse41+0xe3>
+  DB  117,21                              ; jne           492b <_sk_store_u16_be_sse41+0xe3>
   DB  69,15,17,20,65                      ; movups        %xmm10,(%r9,%rax,2)
   DB  102,69,15,106,193                   ; punpckhdq     %xmm9,%xmm8
   DB  243,69,15,127,68,65,16              ; movdqu        %xmm8,0x10(%r9,%rax,2)
@@ -18707,13 +18764,13 @@
   DB  255,224                             ; jmpq          *%rax
   DB  102,69,15,214,20,65                 ; movq          %xmm10,(%r9,%rax,2)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            48ff <_sk_store_u16_be_sse41+0xdf>
+  DB  116,240                             ; je            4927 <_sk_store_u16_be_sse41+0xdf>
   DB  102,69,15,23,84,65,8                ; movhpd        %xmm10,0x8(%r9,%rax,2)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            48ff <_sk_store_u16_be_sse41+0xdf>
+  DB  114,227                             ; jb            4927 <_sk_store_u16_be_sse41+0xdf>
   DB  102,69,15,106,193                   ; punpckhdq     %xmm9,%xmm8
   DB  102,69,15,214,68,65,16              ; movq          %xmm8,0x10(%r9,%rax,2)
-  DB  235,213                             ; jmp           48ff <_sk_store_u16_be_sse41+0xdf>
+  DB  235,213                             ; jmp           4927 <_sk_store_u16_be_sse41+0xdf>
 
 PUBLIC _sk_load_f32_sse41
 _sk_load_f32_sse41 LABEL PROC
@@ -18724,7 +18781,7 @@
   DB  72,193,224,4                        ; shl           $0x4,%rax
   DB  69,15,16,4,2                        ; movups        (%r10,%rax,1),%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,66                              ; jne           498a <_sk_load_f32_sse41+0x60>
+  DB  117,66                              ; jne           49b2 <_sk_load_f32_sse41+0x60>
   DB  67,15,16,68,138,16                  ; movups        0x10(%r10,%r9,4),%xmm0
   DB  67,15,16,92,138,32                  ; movups        0x20(%r10,%r9,4),%xmm3
   DB  71,15,16,76,138,48                  ; movups        0x30(%r10,%r9,4),%xmm9
@@ -18744,17 +18801,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  69,15,87,201                        ; xorps         %xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,8                               ; jne           499c <_sk_load_f32_sse41+0x72>
+  DB  117,8                               ; jne           49c4 <_sk_load_f32_sse41+0x72>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
-  DB  235,190                             ; jmp           495a <_sk_load_f32_sse41+0x30>
+  DB  235,190                             ; jmp           4982 <_sk_load_f32_sse41+0x30>
   DB  67,15,16,68,138,16                  ; movups        0x10(%r10,%r9,4),%xmm0
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,8                               ; jb            49b0 <_sk_load_f32_sse41+0x86>
+  DB  114,8                               ; jb            49d8 <_sk_load_f32_sse41+0x86>
   DB  67,15,16,92,138,32                  ; movups        0x20(%r10,%r9,4),%xmm3
-  DB  235,170                             ; jmp           495a <_sk_load_f32_sse41+0x30>
+  DB  235,170                             ; jmp           4982 <_sk_load_f32_sse41+0x30>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
-  DB  235,165                             ; jmp           495a <_sk_load_f32_sse41+0x30>
+  DB  235,165                             ; jmp           4982 <_sk_load_f32_sse41+0x30>
 
 PUBLIC _sk_load_f32_dst_sse41
 _sk_load_f32_dst_sse41 LABEL PROC
@@ -18765,7 +18822,7 @@
   DB  72,193,224,4                        ; shl           $0x4,%rax
   DB  69,15,16,4,2                        ; movups        (%r10,%rax,1),%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,66                              ; jne           4a15 <_sk_load_f32_dst_sse41+0x60>
+  DB  117,66                              ; jne           4a3d <_sk_load_f32_dst_sse41+0x60>
   DB  67,15,16,100,138,16                 ; movups        0x10(%r10,%r9,4),%xmm4
   DB  67,15,16,124,138,32                 ; movups        0x20(%r10,%r9,4),%xmm7
   DB  71,15,16,76,138,48                  ; movups        0x30(%r10,%r9,4),%xmm9
@@ -18785,17 +18842,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  69,15,87,201                        ; xorps         %xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,8                               ; jne           4a27 <_sk_load_f32_dst_sse41+0x72>
+  DB  117,8                               ; jne           4a4f <_sk_load_f32_dst_sse41+0x72>
   DB  15,87,255                           ; xorps         %xmm7,%xmm7
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
-  DB  235,190                             ; jmp           49e5 <_sk_load_f32_dst_sse41+0x30>
+  DB  235,190                             ; jmp           4a0d <_sk_load_f32_dst_sse41+0x30>
   DB  67,15,16,100,138,16                 ; movups        0x10(%r10,%r9,4),%xmm4
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,8                               ; jb            4a3b <_sk_load_f32_dst_sse41+0x86>
+  DB  114,8                               ; jb            4a63 <_sk_load_f32_dst_sse41+0x86>
   DB  67,15,16,124,138,32                 ; movups        0x20(%r10,%r9,4),%xmm7
-  DB  235,170                             ; jmp           49e5 <_sk_load_f32_dst_sse41+0x30>
+  DB  235,170                             ; jmp           4a0d <_sk_load_f32_dst_sse41+0x30>
   DB  15,87,255                           ; xorps         %xmm7,%xmm7
-  DB  235,165                             ; jmp           49e5 <_sk_load_f32_dst_sse41+0x30>
+  DB  235,165                             ; jmp           4a0d <_sk_load_f32_dst_sse41+0x30>
 
 PUBLIC _sk_store_f32_sse41
 _sk_store_f32_sse41 LABEL PROC
@@ -18819,7 +18876,7 @@
   DB  102,69,15,20,203                    ; unpcklpd      %xmm11,%xmm9
   DB  102,69,15,17,36,2                   ; movupd        %xmm12,(%r10,%rax,1)
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,29                              ; jne           4ab2 <_sk_store_f32_sse41+0x72>
+  DB  117,29                              ; jne           4ada <_sk_store_f32_sse41+0x72>
   DB  102,69,15,21,211                    ; unpckhpd      %xmm11,%xmm10
   DB  71,15,17,68,138,16                  ; movups        %xmm8,0x10(%r10,%r9,4)
   DB  102,71,15,17,76,138,32              ; movupd        %xmm9,0x20(%r10,%r9,4)
@@ -18827,12 +18884,12 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,246                             ; je            4aae <_sk_store_f32_sse41+0x6e>
+  DB  116,246                             ; je            4ad6 <_sk_store_f32_sse41+0x6e>
   DB  71,15,17,68,138,16                  ; movups        %xmm8,0x10(%r10,%r9,4)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,234                             ; jb            4aae <_sk_store_f32_sse41+0x6e>
+  DB  114,234                             ; jb            4ad6 <_sk_store_f32_sse41+0x6e>
   DB  102,71,15,17,76,138,32              ; movupd        %xmm9,0x20(%r10,%r9,4)
-  DB  235,225                             ; jmp           4aae <_sk_store_f32_sse41+0x6e>
+  DB  235,225                             ; jmp           4ad6 <_sk_store_f32_sse41+0x6e>
 
 PUBLIC _sk_clamp_x_sse41
 _sk_clamp_x_sse41 LABEL PROC
@@ -18906,7 +18963,7 @@
   DB  65,15,92,194                        ; subps         %xmm10,%xmm0
   DB  243,69,15,88,192                    ; addss         %xmm8,%xmm8
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
-  DB  243,68,15,89,13,156,38,0,0          ; mulss         0x269c(%rip),%xmm9        # 7260 <_sk_callback_sse41+0x1678>
+  DB  243,68,15,89,13,180,38,0,0          ; mulss         0x26b4(%rip),%xmm9        # 72a0 <_sk_callback_sse41+0x1690>
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
   DB  68,15,89,200                        ; mulps         %xmm0,%xmm9
   DB  102,69,15,58,8,201,1                ; roundps       $0x1,%xmm9,%xmm9
@@ -18932,7 +18989,7 @@
   DB  65,15,92,202                        ; subps         %xmm10,%xmm1
   DB  243,69,15,88,192                    ; addss         %xmm8,%xmm8
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
-  DB  243,68,15,89,13,57,38,0,0           ; mulss         0x2639(%rip),%xmm9        # 7264 <_sk_callback_sse41+0x167c>
+  DB  243,68,15,89,13,81,38,0,0           ; mulss         0x2651(%rip),%xmm9        # 72a4 <_sk_callback_sse41+0x1694>
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
   DB  68,15,89,201                        ; mulps         %xmm1,%xmm9
   DB  102,69,15,58,8,201,1                ; roundps       $0x1,%xmm9,%xmm9
@@ -18952,7 +19009,7 @@
 _sk_clamp_x_1_sse41 LABEL PROC
   DB  69,15,87,192                        ; xorps         %xmm8,%xmm8
   DB  68,15,95,192                        ; maxps         %xmm0,%xmm8
-  DB  68,15,93,5,139,33,0,0               ; minps         0x218b(%rip),%xmm8        # 6e00 <_sk_callback_sse41+0x1218>
+  DB  68,15,93,5,163,33,0,0               ; minps         0x21a3(%rip),%xmm8        # 6e40 <_sk_callback_sse41+0x1230>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -18966,9 +19023,9 @@
 
 PUBLIC _sk_mirror_x_1_sse41
 _sk_mirror_x_1_sse41 LABEL PROC
-  DB  68,15,40,5,124,33,0,0               ; movaps        0x217c(%rip),%xmm8        # 6e10 <_sk_callback_sse41+0x1228>
+  DB  68,15,40,5,148,33,0,0               ; movaps        0x2194(%rip),%xmm8        # 6e50 <_sk_callback_sse41+0x1240>
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
-  DB  68,15,40,13,128,33,0,0              ; movaps        0x2180(%rip),%xmm9        # 6e20 <_sk_callback_sse41+0x1238>
+  DB  68,15,40,13,152,33,0,0              ; movaps        0x2198(%rip),%xmm9        # 6e60 <_sk_callback_sse41+0x1250>
   DB  68,15,89,200                        ; mulps         %xmm0,%xmm9
   DB  102,69,15,58,8,201,1                ; roundps       $0x1,%xmm9,%xmm9
   DB  69,15,88,201                        ; addps         %xmm9,%xmm9
@@ -18983,10 +19040,10 @@
 PUBLIC _sk_luminance_to_alpha_sse41
 _sk_luminance_to_alpha_sse41 LABEL PROC
   DB  15,40,218                           ; movaps        %xmm2,%xmm3
-  DB  15,89,5,95,33,0,0                   ; mulps         0x215f(%rip),%xmm0        # 6e30 <_sk_callback_sse41+0x1248>
-  DB  15,89,13,104,33,0,0                 ; mulps         0x2168(%rip),%xmm1        # 6e40 <_sk_callback_sse41+0x1258>
+  DB  15,89,5,119,33,0,0                  ; mulps         0x2177(%rip),%xmm0        # 6e70 <_sk_callback_sse41+0x1260>
+  DB  15,89,13,128,33,0,0                 ; mulps         0x2180(%rip),%xmm1        # 6e80 <_sk_callback_sse41+0x1270>
   DB  15,88,200                           ; addps         %xmm0,%xmm1
-  DB  15,89,29,110,33,0,0                 ; mulps         0x216e(%rip),%xmm3        # 6e50 <_sk_callback_sse41+0x1268>
+  DB  15,89,29,134,33,0,0                 ; mulps         0x2186(%rip),%xmm3        # 6e90 <_sk_callback_sse41+0x1280>
   DB  15,88,217                           ; addps         %xmm1,%xmm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
@@ -19283,9 +19340,9 @@
   DB  72,139,24                           ; mov           (%rax),%rbx
   DB  76,139,112,8                        ; mov           0x8(%rax),%r14
   DB  72,255,203                          ; dec           %rbx
-  DB  120,7                               ; js            5184 <_sk_evenly_spaced_gradient_sse41+0x1a>
+  DB  120,7                               ; js            51ac <_sk_evenly_spaced_gradient_sse41+0x1a>
   DB  243,72,15,42,203                    ; cvtsi2ss      %rbx,%xmm1
-  DB  235,21                              ; jmp           5199 <_sk_evenly_spaced_gradient_sse41+0x2f>
+  DB  235,21                              ; jmp           51c1 <_sk_evenly_spaced_gradient_sse41+0x2f>
   DB  73,137,217                          ; mov           %rbx,%r9
   DB  73,209,233                          ; shr           %r9
   DB  131,227,1                           ; and           $0x1,%ebx
@@ -19373,15 +19430,15 @@
 
 PUBLIC _sk_gauss_a_to_rgba_sse41
 _sk_gauss_a_to_rgba_sse41 LABEL PROC
-  DB  15,40,5,25,27,0,0                   ; movaps        0x1b19(%rip),%xmm0        # 6e60 <_sk_callback_sse41+0x1278>
+  DB  15,40,5,49,27,0,0                   ; movaps        0x1b31(%rip),%xmm0        # 6ea0 <_sk_callback_sse41+0x1290>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,31,27,0,0                   ; addps         0x1b1f(%rip),%xmm0        # 6e70 <_sk_callback_sse41+0x1288>
+  DB  15,88,5,55,27,0,0                   ; addps         0x1b37(%rip),%xmm0        # 6eb0 <_sk_callback_sse41+0x12a0>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,37,27,0,0                   ; addps         0x1b25(%rip),%xmm0        # 6e80 <_sk_callback_sse41+0x1298>
+  DB  15,88,5,61,27,0,0                   ; addps         0x1b3d(%rip),%xmm0        # 6ec0 <_sk_callback_sse41+0x12b0>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,43,27,0,0                   ; addps         0x1b2b(%rip),%xmm0        # 6e90 <_sk_callback_sse41+0x12a8>
+  DB  15,88,5,67,27,0,0                   ; addps         0x1b43(%rip),%xmm0        # 6ed0 <_sk_callback_sse41+0x12c0>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,49,27,0,0                   ; addps         0x1b31(%rip),%xmm0        # 6ea0 <_sk_callback_sse41+0x12b8>
+  DB  15,88,5,73,27,0,0                   ; addps         0x1b49(%rip),%xmm0        # 6ee0 <_sk_callback_sse41+0x12d0>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
@@ -19397,12 +19454,12 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,249,2                        ; cmp           $0x2,%r9
-  DB  114,50                              ; jb            53c2 <_sk_gradient_sse41+0x46>
+  DB  114,50                              ; jb            53ea <_sk_gradient_sse41+0x46>
   DB  72,139,88,72                        ; mov           0x48(%rax),%rbx
   DB  73,255,201                          ; dec           %r9
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  15,40,21,10,27,0,0                  ; movaps        0x1b0a(%rip),%xmm2        # 6eb0 <_sk_callback_sse41+0x12c8>
+  DB  15,40,21,34,27,0,0                  ; movaps        0x1b22(%rip),%xmm2        # 6ef0 <_sk_callback_sse41+0x12e0>
   DB  243,15,16,27                        ; movss         (%rbx),%xmm3
   DB  15,198,219,0                        ; shufps        $0x0,%xmm3,%xmm3
   DB  15,194,216,2                        ; cmpleps       %xmm0,%xmm3
@@ -19410,7 +19467,7 @@
   DB  102,15,254,203                      ; paddd         %xmm3,%xmm1
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  73,255,201                          ; dec           %r9
-  DB  117,228                             ; jne           53a6 <_sk_gradient_sse41+0x2a>
+  DB  117,228                             ; jne           53ce <_sk_gradient_sse41+0x2a>
   DB  102,73,15,58,22,201,1               ; pextrq        $0x1,%xmm1,%r9
   DB  69,137,202                          ; mov           %r9d,%r10d
   DB  73,193,233,32                       ; shr           $0x20,%r9
@@ -19536,26 +19593,26 @@
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,40,236                        ; movaps        %xmm12,%xmm13
   DB  69,15,89,237                        ; mulps         %xmm13,%xmm13
-  DB  68,15,40,21,171,24,0,0              ; movaps        0x18ab(%rip),%xmm10        # 6ec0 <_sk_callback_sse41+0x12d8>
+  DB  68,15,40,21,195,24,0,0              ; movaps        0x18c3(%rip),%xmm10        # 6f00 <_sk_callback_sse41+0x12f0>
   DB  69,15,89,213                        ; mulps         %xmm13,%xmm10
-  DB  68,15,88,21,175,24,0,0              ; addps         0x18af(%rip),%xmm10        # 6ed0 <_sk_callback_sse41+0x12e8>
+  DB  68,15,88,21,199,24,0,0              ; addps         0x18c7(%rip),%xmm10        # 6f10 <_sk_callback_sse41+0x1300>
   DB  69,15,89,213                        ; mulps         %xmm13,%xmm10
-  DB  68,15,88,21,179,24,0,0              ; addps         0x18b3(%rip),%xmm10        # 6ee0 <_sk_callback_sse41+0x12f8>
+  DB  68,15,88,21,203,24,0,0              ; addps         0x18cb(%rip),%xmm10        # 6f20 <_sk_callback_sse41+0x1310>
   DB  69,15,89,213                        ; mulps         %xmm13,%xmm10
-  DB  68,15,88,21,183,24,0,0              ; addps         0x18b7(%rip),%xmm10        # 6ef0 <_sk_callback_sse41+0x1308>
+  DB  68,15,88,21,207,24,0,0              ; addps         0x18cf(%rip),%xmm10        # 6f30 <_sk_callback_sse41+0x1320>
   DB  69,15,89,212                        ; mulps         %xmm12,%xmm10
   DB  65,15,194,195,1                     ; cmpltps       %xmm11,%xmm0
-  DB  68,15,40,29,182,24,0,0              ; movaps        0x18b6(%rip),%xmm11        # 6f00 <_sk_callback_sse41+0x1318>
+  DB  68,15,40,29,206,24,0,0              ; movaps        0x18ce(%rip),%xmm11        # 6f40 <_sk_callback_sse41+0x1330>
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
   DB  102,69,15,56,20,211                 ; blendvps      %xmm0,%xmm11,%xmm10
   DB  69,15,194,200,1                     ; cmpltps       %xmm8,%xmm9
-  DB  68,15,40,29,175,24,0,0              ; movaps        0x18af(%rip),%xmm11        # 6f10 <_sk_callback_sse41+0x1328>
+  DB  68,15,40,29,199,24,0,0              ; movaps        0x18c7(%rip),%xmm11        # 6f50 <_sk_callback_sse41+0x1340>
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  102,69,15,56,20,211                 ; blendvps      %xmm0,%xmm11,%xmm10
   DB  15,40,193                           ; movaps        %xmm1,%xmm0
   DB  65,15,194,192,1                     ; cmpltps       %xmm8,%xmm0
-  DB  68,15,40,13,161,24,0,0              ; movaps        0x18a1(%rip),%xmm9        # 6f20 <_sk_callback_sse41+0x1338>
+  DB  68,15,40,13,185,24,0,0              ; movaps        0x18b9(%rip),%xmm9        # 6f60 <_sk_callback_sse41+0x1350>
   DB  69,15,92,202                        ; subps         %xmm10,%xmm9
   DB  102,69,15,56,20,209                 ; blendvps      %xmm0,%xmm9,%xmm10
   DB  69,15,194,194,7                     ; cmpordps      %xmm10,%xmm8
@@ -19585,7 +19642,7 @@
   DB  243,69,15,89,203                    ; mulss         %xmm11,%xmm9
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
   DB  68,15,88,200                        ; addps         %xmm0,%xmm9
-  DB  68,15,89,13,74,24,0,0               ; mulps         0x184a(%rip),%xmm9        # 6f30 <_sk_callback_sse41+0x1348>
+  DB  68,15,89,13,98,24,0,0               ; mulps         0x1862(%rip),%xmm9        # 6f70 <_sk_callback_sse41+0x1360>
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
   DB  68,15,40,225                        ; movaps        %xmm1,%xmm12
   DB  69,15,89,228                        ; mulps         %xmm12,%xmm12
@@ -19593,7 +19650,7 @@
   DB  243,69,15,89,219                    ; mulss         %xmm11,%xmm11
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,92,227                        ; subps         %xmm11,%xmm12
-  DB  68,15,89,21,53,24,0,0               ; mulps         0x1835(%rip),%xmm10        # 6f40 <_sk_callback_sse41+0x1358>
+  DB  68,15,89,21,77,24,0,0               ; mulps         0x184d(%rip),%xmm10        # 6f80 <_sk_callback_sse41+0x1370>
   DB  69,15,89,212                        ; mulps         %xmm12,%xmm10
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
@@ -19602,8 +19659,8 @@
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  65,15,92,193                        ; subps         %xmm9,%xmm0
-  DB  68,15,87,13,29,24,0,0               ; xorps         0x181d(%rip),%xmm9        # 6f50 <_sk_callback_sse41+0x1368>
-  DB  68,15,89,5,37,24,0,0                ; mulps         0x1825(%rip),%xmm8        # 6f60 <_sk_callback_sse41+0x1378>
+  DB  68,15,87,13,53,24,0,0               ; xorps         0x1835(%rip),%xmm9        # 6f90 <_sk_callback_sse41+0x1380>
+  DB  68,15,89,5,61,24,0,0                ; mulps         0x183d(%rip),%xmm8        # 6fa0 <_sk_callback_sse41+0x1390>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  69,15,92,202                        ; subps         %xmm10,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
@@ -19622,7 +19679,7 @@
   DB  243,69,15,89,203                    ; mulss         %xmm11,%xmm9
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
   DB  68,15,88,200                        ; addps         %xmm0,%xmm9
-  DB  68,15,89,13,236,23,0,0              ; mulps         0x17ec(%rip),%xmm9        # 6f70 <_sk_callback_sse41+0x1388>
+  DB  68,15,89,13,4,24,0,0                ; mulps         0x1804(%rip),%xmm9        # 6fb0 <_sk_callback_sse41+0x13a0>
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
   DB  68,15,40,225                        ; movaps        %xmm1,%xmm12
   DB  69,15,89,228                        ; mulps         %xmm12,%xmm12
@@ -19630,7 +19687,7 @@
   DB  243,69,15,89,219                    ; mulss         %xmm11,%xmm11
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,92,227                        ; subps         %xmm11,%xmm12
-  DB  68,15,89,21,215,23,0,0              ; mulps         0x17d7(%rip),%xmm10        # 6f80 <_sk_callback_sse41+0x1398>
+  DB  68,15,89,21,239,23,0,0              ; mulps         0x17ef(%rip),%xmm10        # 6fc0 <_sk_callback_sse41+0x13b0>
   DB  69,15,89,212                        ; mulps         %xmm12,%xmm10
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
@@ -19639,8 +19696,8 @@
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  65,15,92,193                        ; subps         %xmm9,%xmm0
-  DB  68,15,87,13,191,23,0,0              ; xorps         0x17bf(%rip),%xmm9        # 6f90 <_sk_callback_sse41+0x13a8>
-  DB  68,15,89,5,199,23,0,0               ; mulps         0x17c7(%rip),%xmm8        # 6fa0 <_sk_callback_sse41+0x13b8>
+  DB  68,15,87,13,215,23,0,0              ; xorps         0x17d7(%rip),%xmm9        # 6fd0 <_sk_callback_sse41+0x13c0>
+  DB  68,15,89,5,223,23,0,0               ; mulps         0x17df(%rip),%xmm8        # 6fe0 <_sk_callback_sse41+0x13d0>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  69,15,92,202                        ; subps         %xmm10,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
@@ -19656,7 +19713,7 @@
   DB  243,69,15,89,200                    ; mulss         %xmm8,%xmm9
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
   DB  68,15,88,200                        ; addps         %xmm0,%xmm9
-  DB  68,15,89,13,159,23,0,0              ; mulps         0x179f(%rip),%xmm9        # 6fb0 <_sk_callback_sse41+0x13c8>
+  DB  68,15,89,13,183,23,0,0              ; mulps         0x17b7(%rip),%xmm9        # 6ff0 <_sk_callback_sse41+0x13e0>
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
   DB  68,15,40,209                        ; movaps        %xmm1,%xmm10
   DB  69,15,89,210                        ; mulps         %xmm10,%xmm10
@@ -19664,7 +19721,7 @@
   DB  243,69,15,89,192                    ; mulss         %xmm8,%xmm8
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
   DB  65,15,92,192                        ; subps         %xmm8,%xmm0
-  DB  15,87,5,139,23,0,0                  ; xorps         0x178b(%rip),%xmm0        # 6fc0 <_sk_callback_sse41+0x13d8>
+  DB  15,87,5,163,23,0,0                  ; xorps         0x17a3(%rip),%xmm0        # 7000 <_sk_callback_sse41+0x13f0>
   DB  65,15,94,193                        ; divps         %xmm9,%xmm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -19701,7 +19758,7 @@
 PUBLIC _sk_save_xy_sse41
 _sk_save_xy_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,49,23,0,0                ; movaps        0x1731(%rip),%xmm8        # 6fd0 <_sk_callback_sse41+0x13e8>
+  DB  68,15,40,5,73,23,0,0                ; movaps        0x1749(%rip),%xmm8        # 7010 <_sk_callback_sse41+0x1400>
   DB  15,17,0                             ; movups        %xmm0,(%rax)
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,88,200                        ; addps         %xmm8,%xmm9
@@ -19741,8 +19798,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,179,22,0,0                  ; addps         0x16b3(%rip),%xmm0        # 6fe0 <_sk_callback_sse41+0x13f8>
-  DB  68,15,40,13,187,22,0,0              ; movaps        0x16bb(%rip),%xmm9        # 6ff0 <_sk_callback_sse41+0x1408>
+  DB  15,88,5,203,22,0,0                  ; addps         0x16cb(%rip),%xmm0        # 7020 <_sk_callback_sse41+0x1410>
+  DB  68,15,40,13,211,22,0,0              ; movaps        0x16d3(%rip),%xmm9        # 7030 <_sk_callback_sse41+0x1420>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  68,15,17,136,128,0,0,0              ; movups        %xmm9,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -19753,7 +19810,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,170,22,0,0                  ; addps         0x16aa(%rip),%xmm0        # 7000 <_sk_callback_sse41+0x1418>
+  DB  15,88,5,194,22,0,0                  ; addps         0x16c2(%rip),%xmm0        # 7040 <_sk_callback_sse41+0x1430>
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -19763,8 +19820,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,156,22,0,0                 ; addps         0x169c(%rip),%xmm1        # 7010 <_sk_callback_sse41+0x1428>
-  DB  68,15,40,13,164,22,0,0              ; movaps        0x16a4(%rip),%xmm9        # 7020 <_sk_callback_sse41+0x1438>
+  DB  15,88,13,180,22,0,0                 ; addps         0x16b4(%rip),%xmm1        # 7050 <_sk_callback_sse41+0x1440>
+  DB  68,15,40,13,188,22,0,0              ; movaps        0x16bc(%rip),%xmm9        # 7060 <_sk_callback_sse41+0x1450>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  68,15,17,136,160,0,0,0              ; movups        %xmm9,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -19775,7 +19832,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,146,22,0,0                 ; addps         0x1692(%rip),%xmm1        # 7030 <_sk_callback_sse41+0x1448>
+  DB  15,88,13,170,22,0,0                 ; addps         0x16aa(%rip),%xmm1        # 7070 <_sk_callback_sse41+0x1460>
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -19785,13 +19842,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,133,22,0,0                  ; addps         0x1685(%rip),%xmm0        # 7040 <_sk_callback_sse41+0x1458>
-  DB  68,15,40,13,141,22,0,0              ; movaps        0x168d(%rip),%xmm9        # 7050 <_sk_callback_sse41+0x1468>
+  DB  15,88,5,157,22,0,0                  ; addps         0x169d(%rip),%xmm0        # 7080 <_sk_callback_sse41+0x1470>
+  DB  68,15,40,13,165,22,0,0              ; movaps        0x16a5(%rip),%xmm9        # 7090 <_sk_callback_sse41+0x1480>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  69,15,89,192                        ; mulps         %xmm8,%xmm8
-  DB  68,15,89,13,137,22,0,0              ; mulps         0x1689(%rip),%xmm9        # 7060 <_sk_callback_sse41+0x1478>
-  DB  68,15,88,13,145,22,0,0              ; addps         0x1691(%rip),%xmm9        # 7070 <_sk_callback_sse41+0x1488>
+  DB  68,15,89,13,161,22,0,0              ; mulps         0x16a1(%rip),%xmm9        # 70a0 <_sk_callback_sse41+0x1490>
+  DB  68,15,88,13,169,22,0,0              ; addps         0x16a9(%rip),%xmm9        # 70b0 <_sk_callback_sse41+0x14a0>
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  68,15,17,136,128,0,0,0              ; movups        %xmm9,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -19802,16 +19859,16 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,128,22,0,0                  ; addps         0x1680(%rip),%xmm0        # 7080 <_sk_callback_sse41+0x1498>
-  DB  68,15,40,13,136,22,0,0              ; movaps        0x1688(%rip),%xmm9        # 7090 <_sk_callback_sse41+0x14a8>
+  DB  15,88,5,152,22,0,0                  ; addps         0x1698(%rip),%xmm0        # 70c0 <_sk_callback_sse41+0x14b0>
+  DB  68,15,40,13,160,22,0,0              ; movaps        0x16a0(%rip),%xmm9        # 70d0 <_sk_callback_sse41+0x14c0>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
-  DB  68,15,40,5,140,22,0,0               ; movaps        0x168c(%rip),%xmm8        # 70a0 <_sk_callback_sse41+0x14b8>
+  DB  68,15,40,5,164,22,0,0               ; movaps        0x16a4(%rip),%xmm8        # 70e0 <_sk_callback_sse41+0x14d0>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,144,22,0,0               ; addps         0x1690(%rip),%xmm8        # 70b0 <_sk_callback_sse41+0x14c8>
+  DB  68,15,88,5,168,22,0,0               ; addps         0x16a8(%rip),%xmm8        # 70f0 <_sk_callback_sse41+0x14e0>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,148,22,0,0               ; addps         0x1694(%rip),%xmm8        # 70c0 <_sk_callback_sse41+0x14d8>
+  DB  68,15,88,5,172,22,0,0               ; addps         0x16ac(%rip),%xmm8        # 7100 <_sk_callback_sse41+0x14f0>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,152,22,0,0               ; addps         0x1698(%rip),%xmm8        # 70d0 <_sk_callback_sse41+0x14e8>
+  DB  68,15,88,5,176,22,0,0               ; addps         0x16b0(%rip),%xmm8        # 7110 <_sk_callback_sse41+0x1500>
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -19819,17 +19876,17 @@
 PUBLIC _sk_bicubic_p1x_sse41
 _sk_bicubic_p1x_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,146,22,0,0               ; movaps        0x1692(%rip),%xmm8        # 70e0 <_sk_callback_sse41+0x14f8>
+  DB  68,15,40,5,170,22,0,0               ; movaps        0x16aa(%rip),%xmm8        # 7120 <_sk_callback_sse41+0x1510>
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,72,64                      ; movups        0x40(%rax),%xmm9
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
-  DB  68,15,40,21,142,22,0,0              ; movaps        0x168e(%rip),%xmm10        # 70f0 <_sk_callback_sse41+0x1508>
+  DB  68,15,40,21,166,22,0,0              ; movaps        0x16a6(%rip),%xmm10        # 7130 <_sk_callback_sse41+0x1520>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,146,22,0,0              ; addps         0x1692(%rip),%xmm10        # 7100 <_sk_callback_sse41+0x1518>
+  DB  68,15,88,21,170,22,0,0              ; addps         0x16aa(%rip),%xmm10        # 7140 <_sk_callback_sse41+0x1530>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,142,22,0,0              ; addps         0x168e(%rip),%xmm10        # 7110 <_sk_callback_sse41+0x1528>
+  DB  68,15,88,21,166,22,0,0              ; addps         0x16a6(%rip),%xmm10        # 7150 <_sk_callback_sse41+0x1540>
   DB  68,15,17,144,128,0,0,0              ; movups        %xmm10,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -19839,11 +19896,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,129,22,0,0                  ; addps         0x1681(%rip),%xmm0        # 7120 <_sk_callback_sse41+0x1538>
+  DB  15,88,5,153,22,0,0                  ; addps         0x1699(%rip),%xmm0        # 7160 <_sk_callback_sse41+0x1550>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  69,15,89,201                        ; mulps         %xmm9,%xmm9
-  DB  68,15,89,5,129,22,0,0               ; mulps         0x1681(%rip),%xmm8        # 7130 <_sk_callback_sse41+0x1548>
-  DB  68,15,88,5,137,22,0,0               ; addps         0x1689(%rip),%xmm8        # 7140 <_sk_callback_sse41+0x1558>
+  DB  68,15,89,5,153,22,0,0               ; mulps         0x1699(%rip),%xmm8        # 7170 <_sk_callback_sse41+0x1560>
+  DB  68,15,88,5,161,22,0,0               ; addps         0x16a1(%rip),%xmm8        # 7180 <_sk_callback_sse41+0x1570>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -19854,13 +19911,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,119,22,0,0                 ; addps         0x1677(%rip),%xmm1        # 7150 <_sk_callback_sse41+0x1568>
-  DB  68,15,40,13,127,22,0,0              ; movaps        0x167f(%rip),%xmm9        # 7160 <_sk_callback_sse41+0x1578>
+  DB  15,88,13,143,22,0,0                 ; addps         0x168f(%rip),%xmm1        # 7190 <_sk_callback_sse41+0x1580>
+  DB  68,15,40,13,151,22,0,0              ; movaps        0x1697(%rip),%xmm9        # 71a0 <_sk_callback_sse41+0x1590>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  69,15,89,192                        ; mulps         %xmm8,%xmm8
-  DB  68,15,89,13,123,22,0,0              ; mulps         0x167b(%rip),%xmm9        # 7170 <_sk_callback_sse41+0x1588>
-  DB  68,15,88,13,131,22,0,0              ; addps         0x1683(%rip),%xmm9        # 7180 <_sk_callback_sse41+0x1598>
+  DB  68,15,89,13,147,22,0,0              ; mulps         0x1693(%rip),%xmm9        # 71b0 <_sk_callback_sse41+0x15a0>
+  DB  68,15,88,13,155,22,0,0              ; addps         0x169b(%rip),%xmm9        # 71c0 <_sk_callback_sse41+0x15b0>
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  68,15,17,136,160,0,0,0              ; movups        %xmm9,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -19871,16 +19928,16 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,113,22,0,0                 ; addps         0x1671(%rip),%xmm1        # 7190 <_sk_callback_sse41+0x15a8>
-  DB  68,15,40,13,121,22,0,0              ; movaps        0x1679(%rip),%xmm9        # 71a0 <_sk_callback_sse41+0x15b8>
+  DB  15,88,13,137,22,0,0                 ; addps         0x1689(%rip),%xmm1        # 71d0 <_sk_callback_sse41+0x15c0>
+  DB  68,15,40,13,145,22,0,0              ; movaps        0x1691(%rip),%xmm9        # 71e0 <_sk_callback_sse41+0x15d0>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
-  DB  68,15,40,5,125,22,0,0               ; movaps        0x167d(%rip),%xmm8        # 71b0 <_sk_callback_sse41+0x15c8>
+  DB  68,15,40,5,149,22,0,0               ; movaps        0x1695(%rip),%xmm8        # 71f0 <_sk_callback_sse41+0x15e0>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,129,22,0,0               ; addps         0x1681(%rip),%xmm8        # 71c0 <_sk_callback_sse41+0x15d8>
+  DB  68,15,88,5,153,22,0,0               ; addps         0x1699(%rip),%xmm8        # 7200 <_sk_callback_sse41+0x15f0>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,133,22,0,0               ; addps         0x1685(%rip),%xmm8        # 71d0 <_sk_callback_sse41+0x15e8>
+  DB  68,15,88,5,157,22,0,0               ; addps         0x169d(%rip),%xmm8        # 7210 <_sk_callback_sse41+0x1600>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,137,22,0,0               ; addps         0x1689(%rip),%xmm8        # 71e0 <_sk_callback_sse41+0x15f8>
+  DB  68,15,88,5,161,22,0,0               ; addps         0x16a1(%rip),%xmm8        # 7220 <_sk_callback_sse41+0x1610>
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -19888,17 +19945,17 @@
 PUBLIC _sk_bicubic_p1y_sse41
 _sk_bicubic_p1y_sse41 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,131,22,0,0               ; movaps        0x1683(%rip),%xmm8        # 71f0 <_sk_callback_sse41+0x1608>
+  DB  68,15,40,5,155,22,0,0               ; movaps        0x169b(%rip),%xmm8        # 7230 <_sk_callback_sse41+0x1620>
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,72,96                      ; movups        0x60(%rax),%xmm9
   DB  65,15,88,200                        ; addps         %xmm8,%xmm1
-  DB  68,15,40,21,126,22,0,0              ; movaps        0x167e(%rip),%xmm10        # 7200 <_sk_callback_sse41+0x1618>
+  DB  68,15,40,21,150,22,0,0              ; movaps        0x1696(%rip),%xmm10        # 7240 <_sk_callback_sse41+0x1630>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,130,22,0,0              ; addps         0x1682(%rip),%xmm10        # 7210 <_sk_callback_sse41+0x1628>
+  DB  68,15,88,21,154,22,0,0              ; addps         0x169a(%rip),%xmm10        # 7250 <_sk_callback_sse41+0x1640>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,126,22,0,0              ; addps         0x167e(%rip),%xmm10        # 7220 <_sk_callback_sse41+0x1638>
+  DB  68,15,88,21,150,22,0,0              ; addps         0x1696(%rip),%xmm10        # 7260 <_sk_callback_sse41+0x1650>
   DB  68,15,17,144,160,0,0,0              ; movups        %xmm10,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -19908,11 +19965,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,112,22,0,0                 ; addps         0x1670(%rip),%xmm1        # 7230 <_sk_callback_sse41+0x1648>
+  DB  15,88,13,136,22,0,0                 ; addps         0x1688(%rip),%xmm1        # 7270 <_sk_callback_sse41+0x1660>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  69,15,89,201                        ; mulps         %xmm9,%xmm9
-  DB  68,15,89,5,112,22,0,0               ; mulps         0x1670(%rip),%xmm8        # 7240 <_sk_callback_sse41+0x1658>
-  DB  68,15,88,5,120,22,0,0               ; addps         0x1678(%rip),%xmm8        # 7250 <_sk_callback_sse41+0x1668>
+  DB  68,15,89,5,136,22,0,0               ; mulps         0x1688(%rip),%xmm8        # 7280 <_sk_callback_sse41+0x1670>
+  DB  68,15,88,5,144,22,0,0               ; addps         0x1690(%rip),%xmm8        # 7290 <_sk_callback_sse41+0x1680>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -20125,16 +20182,26 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
+  DB  63                                  ; (bad)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  128,63,0                            ; cmpb          $0x0,(%rdi)
+  DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
+  DB  63                                  ; (bad)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  128,63,0                            ; cmpb          $0x0,(%rdi)
+  DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
+  DB  63                                  ; (bad)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  128,63,0                            ; cmpb          $0x0,(%rdi)
+  DB  0,128,191,0,0,128                   ; add           %al,-0x7fffff41(%rax)
   DB  191,0,0,128,191                     ; mov           $0xbf800000,%edi
   DB  0,0                                 ; add           %al,(%rax)
-  DB  128,191,0,0,128,191,0               ; cmpb          $0x0,-0x40800000(%rdi)
+  DB  128,191,0,0,224,64,0                ; cmpb          $0x0,0x40e00000(%rdi)
   DB  0,224                               ; add           %ah,%al
   DB  64,0,0                              ; add           %al,(%rax)
-  DB  224,64                              ; loopne        5e98 <.literal16+0x1d8>
+  DB  224,64                              ; loopne        5edc <.literal16+0x1fc>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,64                              ; loopne        5e9c <.literal16+0x1dc>
-  DB  0,0                                 ; add           %al,(%rax)
-  DB  224,64                              ; loopne        5ea0 <.literal16+0x1e0>
+  DB  224,64                              ; loopne        5ee0 <.literal16+0x200>
   DB  154                                 ; (bad)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
@@ -20154,13 +20221,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5ec1 <.literal16+0x201>
+  DB  71,225,61                           ; rex.RXB       loope 5f01 <.literal16+0x221>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5ec5 <.literal16+0x205>
+  DB  71,225,61                           ; rex.RXB       loope 5f05 <.literal16+0x225>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5ec9 <.literal16+0x209>
+  DB  71,225,61                           ; rex.RXB       loope 5f09 <.literal16+0x229>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5ecd <.literal16+0x20d>
+  DB  71,225,61                           ; rex.RXB       loope 5f0d <.literal16+0x22d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -20185,13 +20252,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f01 <.literal16+0x241>
+  DB  71,225,61                           ; rex.RXB       loope 5f41 <.literal16+0x261>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f05 <.literal16+0x245>
+  DB  71,225,61                           ; rex.RXB       loope 5f45 <.literal16+0x265>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f09 <.literal16+0x249>
+  DB  71,225,61                           ; rex.RXB       loope 5f49 <.literal16+0x269>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f0d <.literal16+0x24d>
+  DB  71,225,61                           ; rex.RXB       loope 5f4d <.literal16+0x26d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -20216,13 +20283,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f41 <.literal16+0x281>
+  DB  71,225,61                           ; rex.RXB       loope 5f81 <.literal16+0x2a1>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f45 <.literal16+0x285>
+  DB  71,225,61                           ; rex.RXB       loope 5f85 <.literal16+0x2a5>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f49 <.literal16+0x289>
+  DB  71,225,61                           ; rex.RXB       loope 5f89 <.literal16+0x2a9>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f4d <.literal16+0x28d>
+  DB  71,225,61                           ; rex.RXB       loope 5f8d <.literal16+0x2ad>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -20247,13 +20314,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f81 <.literal16+0x2c1>
+  DB  71,225,61                           ; rex.RXB       loope 5fc1 <.literal16+0x2e1>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f85 <.literal16+0x2c5>
+  DB  71,225,61                           ; rex.RXB       loope 5fc5 <.literal16+0x2e5>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f89 <.literal16+0x2c9>
+  DB  71,225,61                           ; rex.RXB       loope 5fc9 <.literal16+0x2e9>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 5f8d <.literal16+0x2cd>
+  DB  71,225,61                           ; rex.RXB       loope 5fcd <.literal16+0x2ed>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -20270,10 +20337,10 @@
   DB  0,1                                 ; add           %al,(%rcx)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005f78 <_sk_callback_sse41+0xa000390>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a005fb8 <_sk_callback_sse41+0xa0003a8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3005f80 <_sk_callback_sse41+0x3000398>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3005fc0 <_sk_callback_sse41+0x30003b0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -20292,11 +20359,11 @@
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,127                    ; add           %al,0x7f00003f(%rax)
   DB  67,0,0                              ; rex.XB        add %al,(%r8)
-  DB  127,67                              ; jg            5feb <.literal16+0x32b>
+  DB  127,67                              ; jg            602b <.literal16+0x34b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            5fef <.literal16+0x32f>
+  DB  127,67                              ; jg            602f <.literal16+0x34f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            5ff3 <.literal16+0x333>
+  DB  127,67                              ; jg            6033 <.literal16+0x353>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -20578,13 +20645,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6229 <.literal16+0x569>
+  DB  224,7                               ; loopne        6269 <.literal16+0x589>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        622d <.literal16+0x56d>
+  DB  224,7                               ; loopne        626d <.literal16+0x58d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6231 <.literal16+0x571>
+  DB  224,7                               ; loopne        6271 <.literal16+0x591>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6235 <.literal16+0x575>
+  DB  224,7                               ; loopne        6275 <.literal16+0x595>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -20618,10 +20685,10 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  1,255                               ; add           %edi,%edi
   DB  255                                 ; (bad)
-  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a006278 <_sk_callback_sse41+0xa000690>
+  DB  255,5,255,255,255,9                 ; incl          0x9ffffff(%rip)        # a0062b8 <_sk_callback_sse41+0xa0006a8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006280 <_sk_callback_sse41+0x3000698>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 30062c0 <_sk_callback_sse41+0x30006b0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -20676,11 +20743,11 @@
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            634b <.literal16+0x68b>
+  DB  127,67                              ; jg            638b <.literal16+0x6ab>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            634f <.literal16+0x68f>
+  DB  127,67                              ; jg            638f <.literal16+0x6af>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6353 <.literal16+0x693>
+  DB  127,67                              ; jg            6393 <.literal16+0x6b3>
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,129                          ; cmpb          $0x81,(%rbx)
   DB  128,128,59,129,128,128,59           ; addb          $0x3b,-0x7f7f7ec5(%rax)
@@ -20695,16 +20762,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6344 <.literal16+0x684>
+  DB  127,0                               ; jg            6384 <.literal16+0x6a4>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6348 <.literal16+0x688>
+  DB  127,0                               ; jg            6388 <.literal16+0x6a8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            634c <.literal16+0x68c>
+  DB  127,0                               ; jg            638c <.literal16+0x6ac>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6350 <.literal16+0x690>
+  DB  127,0                               ; jg            6390 <.literal16+0x6b0>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -20713,7 +20780,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            63d5 <.literal16+0x715>
+  DB  119,115                             ; ja            6415 <.literal16+0x735>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -20724,7 +20791,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           6339 <.literal16+0x679>
+  DB  117,191                             ; jne           6379 <.literal16+0x699>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -20736,7 +20803,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a37a <_sk_callback_sse41+0xffffffffe9a34792>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a3ba <_sk_callback_sse41+0xffffffffe9a347aa>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  81                                  ; push          %rcx
   DB  140,242                             ; mov           %?,%edx
@@ -20791,16 +20858,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6414 <.literal16+0x754>
+  DB  127,0                               ; jg            6454 <.literal16+0x774>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6418 <.literal16+0x758>
+  DB  127,0                               ; jg            6458 <.literal16+0x778>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            641c <.literal16+0x75c>
+  DB  127,0                               ; jg            645c <.literal16+0x77c>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6420 <.literal16+0x760>
+  DB  127,0                               ; jg            6460 <.literal16+0x780>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -20809,7 +20876,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            64a5 <.literal16+0x7e5>
+  DB  119,115                             ; ja            64e5 <.literal16+0x805>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -20820,7 +20887,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           6409 <.literal16+0x749>
+  DB  117,191                             ; jne           6449 <.literal16+0x769>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -20832,7 +20899,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a44a <_sk_callback_sse41+0xffffffffe9a34862>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a48a <_sk_callback_sse41+0xffffffffe9a3487a>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  81                                  ; push          %rcx
   DB  140,242                             ; mov           %?,%edx
@@ -20887,16 +20954,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            64e4 <.literal16+0x824>
+  DB  127,0                               ; jg            6524 <.literal16+0x844>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            64e8 <.literal16+0x828>
+  DB  127,0                               ; jg            6528 <.literal16+0x848>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            64ec <.literal16+0x82c>
+  DB  127,0                               ; jg            652c <.literal16+0x84c>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            64f0 <.literal16+0x830>
+  DB  127,0                               ; jg            6530 <.literal16+0x850>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -20905,7 +20972,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            6575 <.literal16+0x8b5>
+  DB  119,115                             ; ja            65b5 <.literal16+0x8d5>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -20916,7 +20983,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           64d9 <.literal16+0x819>
+  DB  117,191                             ; jne           6519 <.literal16+0x839>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -20928,7 +20995,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a51a <_sk_callback_sse41+0xffffffffe9a34932>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a55a <_sk_callback_sse41+0xffffffffe9a3494a>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  81                                  ; push          %rcx
   DB  140,242                             ; mov           %?,%edx
@@ -20983,16 +21050,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            65b4 <.literal16+0x8f4>
+  DB  127,0                               ; jg            65f4 <.literal16+0x914>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            65b8 <.literal16+0x8f8>
+  DB  127,0                               ; jg            65f8 <.literal16+0x918>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            65bc <.literal16+0x8fc>
+  DB  127,0                               ; jg            65fc <.literal16+0x91c>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            65c0 <.literal16+0x900>
+  DB  127,0                               ; jg            6600 <.literal16+0x920>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -21001,7 +21068,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            6645 <.literal16+0x985>
+  DB  119,115                             ; ja            6685 <.literal16+0x9a5>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -21012,7 +21079,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           65a9 <.literal16+0x8e9>
+  DB  117,191                             ; jne           65e9 <.literal16+0x909>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -21024,7 +21091,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a5ea <_sk_callback_sse41+0xffffffffe9a34a02>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a62a <_sk_callback_sse41+0xffffffffe9a34a1a>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  81                                  ; push          %rcx
   DB  140,242                             ; mov           %?,%edx
@@ -21075,13 +21142,13 @@
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
-  DB  127,67                              ; jg            66c7 <.literal16+0xa07>
+  DB  127,67                              ; jg            6707 <.literal16+0xa27>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            66cb <.literal16+0xa0b>
+  DB  127,67                              ; jg            670b <.literal16+0xa2b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            66cf <.literal16+0xa0f>
+  DB  127,67                              ; jg            670f <.literal16+0xa2f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            66d3 <.literal16+0xa13>
+  DB  127,67                              ; jg            6713 <.literal16+0xa33>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,195                               ; add           %al,%bl
   DB  0,0                                 ; add           %al,(%rax)
@@ -21128,16 +21195,16 @@
   DB  128,3,62                            ; addb          $0x3e,(%rbx)
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           6753 <.literal16+0xa93>
+  DB  118,63                              ; jbe           6793 <.literal16+0xab3>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           6757 <.literal16+0xa97>
+  DB  118,63                              ; jbe           6797 <.literal16+0xab7>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           675b <.literal16+0xa9b>
+  DB  118,63                              ; jbe           679b <.literal16+0xabb>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           675f <.literal16+0xa9f>
+  DB  118,63                              ; jbe           679f <.literal16+0xabf>
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
@@ -21166,11 +21233,11 @@
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            67cb <.literal16+0xb0b>
+  DB  127,67                              ; jg            680b <.literal16+0xb2b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            67cf <.literal16+0xb0f>
+  DB  127,67                              ; jg            680f <.literal16+0xb2f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            67d3 <.literal16+0xb13>
+  DB  127,67                              ; jg            6813 <.literal16+0xb33>
   DB  0,4,0                               ; add           %al,(%rax,%rax,1)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,0                                 ; add           %al,(%rax)
@@ -21228,7 +21295,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006850 <_sk_callback_sse41+0x3000c68>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006890 <_sk_callback_sse41+0x3000c80>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -21257,13 +21324,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6889 <.literal16+0xbc9>
+  DB  224,7                               ; loopne        68c9 <.literal16+0xbe9>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        688d <.literal16+0xbcd>
+  DB  224,7                               ; loopne        68cd <.literal16+0xbed>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6891 <.literal16+0xbd1>
+  DB  224,7                               ; loopne        68d1 <.literal16+0xbf1>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6895 <.literal16+0xbd5>
+  DB  224,7                               ; loopne        68d5 <.literal16+0xbf5>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -21309,13 +21376,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        68f9 <.literal16+0xc39>
+  DB  224,7                               ; loopne        6939 <.literal16+0xc59>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        68fd <.literal16+0xc3d>
+  DB  224,7                               ; loopne        693d <.literal16+0xc5d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6901 <.literal16+0xc41>
+  DB  224,7                               ; loopne        6941 <.literal16+0xc61>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6905 <.literal16+0xc45>
+  DB  224,7                               ; loopne        6945 <.literal16+0xc65>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -21361,13 +21428,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6969 <.literal16+0xca9>
+  DB  224,7                               ; loopne        69a9 <.literal16+0xcc9>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        696d <.literal16+0xcad>
+  DB  224,7                               ; loopne        69ad <.literal16+0xccd>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6971 <.literal16+0xcb1>
+  DB  224,7                               ; loopne        69b1 <.literal16+0xcd1>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6975 <.literal16+0xcb5>
+  DB  224,7                               ; loopne        69b5 <.literal16+0xcd5>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -21405,13 +21472,13 @@
   DB  65,0,0                              ; add           %al,(%r8)
   DB  248                                 ; clc
   DB  65,0,0                              ; add           %al,(%r8)
-  DB  124,66                              ; jl            6a06 <.literal16+0xd46>
+  DB  124,66                              ; jl            6a46 <.literal16+0xd66>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            6a0a <.literal16+0xd4a>
+  DB  124,66                              ; jl            6a4a <.literal16+0xd6a>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            6a0e <.literal16+0xd4e>
+  DB  124,66                              ; jl            6a4e <.literal16+0xd6e>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            6a12 <.literal16+0xd52>
+  DB  124,66                              ; jl            6a52 <.literal16+0xd72>
   DB  0,240                               ; add           %dh,%al
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,240                               ; add           %dh,%al
@@ -21545,13 +21612,13 @@
   DB  136,136,61,137,136,136              ; mov           %cl,-0x777776c3(%rax)
   DB  61,137,136,136,61                   ; cmp           $0x3d888889,%eax
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            6b95 <.literal16+0xed5>
+  DB  112,65                              ; jo            6bd5 <.literal16+0xef5>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            6b99 <.literal16+0xed9>
+  DB  112,65                              ; jo            6bd9 <.literal16+0xef9>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            6b9d <.literal16+0xedd>
+  DB  112,65                              ; jo            6bdd <.literal16+0xefd>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            6ba1 <.literal16+0xee1>
+  DB  112,65                              ; jo            6be1 <.literal16+0xf01>
   DB  255,0                               ; incl          (%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  255,0                               ; incl          (%rax)
@@ -21566,7 +21633,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006b90 <_sk_callback_sse41+0x3000fa8>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006bd0 <_sk_callback_sse41+0x3000fc0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -21593,7 +21660,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006bd0 <_sk_callback_sse41+0x3000fe8>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006c10 <_sk_callback_sse41+0x3001000>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -21620,7 +21687,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006c10 <_sk_callback_sse41+0x3001028>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006c50 <_sk_callback_sse41+0x3001040>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -21635,11 +21702,11 @@
   DB  255,0                               ; incl          (%rax)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6c6b <.literal16+0xfab>
+  DB  127,67                              ; jg            6cab <.literal16+0xfcb>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6c6f <.literal16+0xfaf>
+  DB  127,67                              ; jg            6caf <.literal16+0xfcf>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6c73 <.literal16+0xfb3>
+  DB  127,67                              ; jg            6cb3 <.literal16+0xfd3>
   DB  255,0                               ; incl          (%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  255,0                               ; incl          (%rax)
@@ -21654,7 +21721,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006c60 <_sk_callback_sse41+0x3001078>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006ca0 <_sk_callback_sse41+0x3001090>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -21681,7 +21748,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006ca0 <_sk_callback_sse41+0x30010b8>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006ce0 <_sk_callback_sse41+0x30010d0>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -21708,7 +21775,7 @@
   DB  5,255,255,255,9                     ; add           $0x9ffffff,%eax
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006ce0 <_sk_callback_sse41+0x30010f8>
+  DB  255,13,255,255,255,2                ; decl          0x2ffffff(%rip)        # 3006d20 <_sk_callback_sse41+0x3001110>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,6                               ; incl          (%rsi)
@@ -21723,11 +21790,11 @@
   DB  255,0                               ; incl          (%rax)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6d3b <.literal16+0x107b>
+  DB  127,67                              ; jg            6d7b <.literal16+0x109b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6d3f <.literal16+0x107f>
+  DB  127,67                              ; jg            6d7f <.literal16+0x109f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6d43 <.literal16+0x1083>
+  DB  127,67                              ; jg            6d83 <.literal16+0x10a3>
   DB  0,128,0,0,0,128                     ; add           %al,-0x80000000(%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,128,0,0,0,128                     ; add           %al,-0x80000000(%rax)
@@ -21822,13 +21889,13 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  255                                 ; (bad)
-  DB  127,71                              ; jg            6e3b <.literal16+0x117b>
+  DB  127,71                              ; jg            6e7b <.literal16+0x119b>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            6e3f <.literal16+0x117f>
+  DB  127,71                              ; jg            6e7f <.literal16+0x119f>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            6e43 <.literal16+0x1183>
+  DB  127,71                              ; jg            6e83 <.literal16+0x11a3>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            6e47 <.literal16+0x1187>
+  DB  127,71                              ; jg            6e87 <.literal16+0x11a7>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -21874,10 +21941,10 @@
   DB  61,152,221,147,61                   ; cmp           $0x3d93dd98,%eax
   DB  152                                 ; cwtl
   DB  221,147,61,45,16,17                 ; fstl          0x11102d3d(%rbx)
-  DB  192,45,16,17,192,45,16              ; shrb          $0x10,0x2dc01110(%rip)        # 2dc07f7a <_sk_callback_sse41+0x2dc02392>
+  DB  192,45,16,17,192,45,16              ; shrb          $0x10,0x2dc01110(%rip)        # 2dc07fba <_sk_callback_sse41+0x2dc023aa>
   DB  17,192                              ; adc           %eax,%eax
   DB  45,16,17,192,18                     ; sub           $0x12c01110,%eax
-  DB  120,57                              ; js            6eac <.literal16+0x11ec>
+  DB  120,57                              ; js            6eec <.literal16+0x120c>
   DB  64,18,120,57                        ; adc           0x39(%rax),%dil
   DB  64,18,120,57                        ; adc           0x39(%rax),%dil
   DB  64,18,120,57                        ; adc           0x39(%rax),%dil
@@ -22058,11 +22125,11 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,114                          ; cmpb          $0x72,(%rdi)
   DB  28,199                              ; sbb           $0xc7,%al
-  DB  62,114,28                           ; jb,pt         7082 <.literal16+0x13c2>
+  DB  62,114,28                           ; jb,pt         70c2 <.literal16+0x13e2>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         7086 <.literal16+0x13c6>
+  DB  62,114,28                           ; jb,pt         70c6 <.literal16+0x13e6>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         708a <.literal16+0x13ca>
+  DB  62,114,28                           ; jb,pt         70ca <.literal16+0x13ea>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -22106,7 +22173,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63ff15 <_sk_callback_sse41+0x3d63a32d>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63ff55 <_sk_callback_sse41+0x3d63a345>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -22132,7 +22199,7 @@
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63ff55 <_sk_callback_sse41+0x3d63a36d>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d63ff95 <_sk_callback_sse41+0x3d63a385>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
@@ -22141,13 +22208,13 @@
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
-  DB  114,28                              ; jb            714e <.literal16+0x148e>
+  DB  114,28                              ; jb            718e <.literal16+0x14ae>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         7152 <.literal16+0x1492>
+  DB  62,114,28                           ; jb,pt         7192 <.literal16+0x14b2>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         7156 <.literal16+0x1496>
+  DB  62,114,28                           ; jb,pt         7196 <.literal16+0x14b6>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         715a <.literal16+0x149a>
+  DB  62,114,28                           ; jb,pt         719a <.literal16+0x14ba>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -22168,11 +22235,11 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,114                          ; cmpb          $0x72,(%rdi)
   DB  28,199                              ; sbb           $0xc7,%al
-  DB  62,114,28                           ; jb,pt         7192 <.literal16+0x14d2>
+  DB  62,114,28                           ; jb,pt         71d2 <.literal16+0x14f2>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         7196 <.literal16+0x14d6>
+  DB  62,114,28                           ; jb,pt         71d6 <.literal16+0x14f6>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         719a <.literal16+0x14da>
+  DB  62,114,28                           ; jb,pt         71da <.literal16+0x14fa>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -22216,7 +22283,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d640025 <_sk_callback_sse41+0x3d63a43d>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d640065 <_sk_callback_sse41+0x3d63a455>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -22242,7 +22309,7 @@
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d640065 <_sk_callback_sse41+0x3d63a47d>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d6400a5 <_sk_callback_sse41+0x3d63a495>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
@@ -22251,13 +22318,13 @@
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
-  DB  114,28                              ; jb            725e <.literal16+0x159e>
+  DB  114,28                              ; jb            729e <.literal16+0x15be>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         7262 <_sk_callback_sse41+0x167a>
+  DB  62,114,28                           ; jb,pt         72a2 <_sk_callback_sse41+0x1692>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         7266 <_sk_callback_sse41+0x167e>
+  DB  62,114,28                           ; jb,pt         72a6 <_sk_callback_sse41+0x1696>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         726a <_sk_callback_sse41+0x1682>
+  DB  62,114,28                           ; jb,pt         72aa <_sk_callback_sse41+0x169a>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -22358,7 +22425,7 @@
   DB  102,15,110,194                      ; movd          %edx,%xmm0
   DB  102,15,112,192,0                    ; pshufd        $0x0,%xmm0,%xmm0
   DB  15,91,200                           ; cvtdq2ps      %xmm0,%xmm1
-  DB  15,40,21,184,96,0,0                 ; movaps        0x60b8(%rip),%xmm2        # 61e0 <_sk_callback_sse2+0xd5>
+  DB  15,40,21,216,96,0,0                 ; movaps        0x60d8(%rip),%xmm2        # 6200 <_sk_callback_sse2+0xcd>
   DB  15,88,202                           ; addps         %xmm2,%xmm1
   DB  15,16,7                             ; movups        (%rdi),%xmm0
   DB  15,88,193                           ; addps         %xmm1,%xmm0
@@ -22367,7 +22434,7 @@
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  15,88,202                           ; addps         %xmm2,%xmm1
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,21,167,96,0,0                 ; movaps        0x60a7(%rip),%xmm2        # 61f0 <_sk_callback_sse2+0xe5>
+  DB  15,40,21,199,96,0,0                 ; movaps        0x60c7(%rip),%xmm2        # 6210 <_sk_callback_sse2+0xdd>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
   DB  15,87,237                           ; xorps         %xmm5,%xmm5
@@ -22385,14 +22452,14 @@
   DB  102,68,15,110,193                   ; movd          %ecx,%xmm8
   DB  102,69,15,112,192,0                 ; pshufd        $0x0,%xmm8,%xmm8
   DB  102,69,15,239,193                   ; pxor          %xmm9,%xmm8
-  DB  102,68,15,111,21,117,96,0,0         ; movdqa        0x6075(%rip),%xmm10        # 6200 <_sk_callback_sse2+0xf5>
+  DB  102,68,15,111,21,149,96,0,0         ; movdqa        0x6095(%rip),%xmm10        # 6220 <_sk_callback_sse2+0xed>
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
   DB  102,69,15,219,218                   ; pand          %xmm10,%xmm11
   DB  102,65,15,114,243,5                 ; pslld         $0x5,%xmm11
   DB  102,69,15,219,209                   ; pand          %xmm9,%xmm10
   DB  102,65,15,114,242,4                 ; pslld         $0x4,%xmm10
-  DB  102,68,15,111,37,97,96,0,0          ; movdqa        0x6061(%rip),%xmm12        # 6210 <_sk_callback_sse2+0x105>
-  DB  102,68,15,111,45,104,96,0,0         ; movdqa        0x6068(%rip),%xmm13        # 6220 <_sk_callback_sse2+0x115>
+  DB  102,68,15,111,37,129,96,0,0         ; movdqa        0x6081(%rip),%xmm12        # 6230 <_sk_callback_sse2+0xfd>
+  DB  102,68,15,111,45,136,96,0,0         ; movdqa        0x6088(%rip),%xmm13        # 6240 <_sk_callback_sse2+0x10d>
   DB  102,69,15,111,240                   ; movdqa        %xmm8,%xmm14
   DB  102,69,15,219,245                   ; pand          %xmm13,%xmm14
   DB  102,65,15,114,246,2                 ; pslld         $0x2,%xmm14
@@ -22408,8 +22475,8 @@
   DB  102,69,15,235,245                   ; por           %xmm13,%xmm14
   DB  102,69,15,235,240                   ; por           %xmm8,%xmm14
   DB  69,15,91,198                        ; cvtdq2ps      %xmm14,%xmm8
-  DB  68,15,89,5,35,96,0,0                ; mulps         0x6023(%rip),%xmm8        # 6230 <_sk_callback_sse2+0x125>
-  DB  68,15,88,5,43,96,0,0                ; addps         0x602b(%rip),%xmm8        # 6240 <_sk_callback_sse2+0x135>
+  DB  68,15,89,5,67,96,0,0                ; mulps         0x6043(%rip),%xmm8        # 6250 <_sk_callback_sse2+0x11d>
+  DB  68,15,88,5,75,96,0,0                ; addps         0x604b(%rip),%xmm8        # 6260 <_sk_callback_sse2+0x12d>
   DB  243,68,15,16,16                     ; movss         (%rax),%xmm10
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
@@ -22430,8 +22497,8 @@
   DB  65,15,40,201                        ; movaps        %xmm9,%xmm1
   DB  255,224                             ; jmpq          *%rax
 
-PUBLIC _sk_constant_color_sse2
-_sk_constant_color_sse2 LABEL PROC
+PUBLIC _sk_uniform_color_sse2
+_sk_uniform_color_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  243,15,16,0                         ; movss         (%rax),%xmm0
   DB  243,15,16,72,4                      ; movss         0x4(%rax),%xmm1
@@ -22444,6 +22511,24 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
+PUBLIC _sk_black_color_sse2
+_sk_black_color_sse2 LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  15,40,29,225,95,0,0                 ; movaps        0x5fe1(%rip),%xmm3        # 6270 <_sk_callback_sse2+0x13d>
+  DB  15,87,192                           ; xorps         %xmm0,%xmm0
+  DB  15,87,201                           ; xorps         %xmm1,%xmm1
+  DB  15,87,210                           ; xorps         %xmm2,%xmm2
+  DB  255,224                             ; jmpq          *%rax
+
+PUBLIC _sk_white_color_sse2
+_sk_white_color_sse2 LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  15,40,5,221,95,0,0                  ; movaps        0x5fdd(%rip),%xmm0        # 6280 <_sk_callback_sse2+0x14d>
+  DB  15,40,200                           ; movaps        %xmm0,%xmm1
+  DB  15,40,208                           ; movaps        %xmm0,%xmm2
+  DB  15,40,216                           ; movaps        %xmm0,%xmm3
+  DB  255,224                             ; jmpq          *%rax
+
 PUBLIC _sk_load_rgba_sse2
 _sk_load_rgba_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -22476,7 +22561,7 @@
 PUBLIC _sk_srcatop_sse2
 _sk_srcatop_sse2 LABEL PROC
   DB  15,89,199                           ; mulps         %xmm7,%xmm0
-  DB  68,15,40,5,133,95,0,0               ; movaps        0x5f85(%rip),%xmm8        # 6250 <_sk_callback_sse2+0x145>
+  DB  68,15,40,5,157,95,0,0               ; movaps        0x5f9d(%rip),%xmm8        # 6290 <_sk_callback_sse2+0x15d>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -22499,7 +22584,7 @@
 _sk_dstatop_sse2 LABEL PROC
   DB  68,15,40,195                        ; movaps        %xmm3,%xmm8
   DB  68,15,89,196                        ; mulps         %xmm4,%xmm8
-  DB  68,15,40,13,72,95,0,0               ; movaps        0x5f48(%rip),%xmm9        # 6260 <_sk_callback_sse2+0x155>
+  DB  68,15,40,13,96,95,0,0               ; movaps        0x5f60(%rip),%xmm9        # 62a0 <_sk_callback_sse2+0x16d>
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
@@ -22540,7 +22625,7 @@
 
 PUBLIC _sk_srcout_sse2
 _sk_srcout_sse2 LABEL PROC
-  DB  68,15,40,5,236,94,0,0               ; movaps        0x5eec(%rip),%xmm8        # 6270 <_sk_callback_sse2+0x165>
+  DB  68,15,40,5,4,95,0,0                 ; movaps        0x5f04(%rip),%xmm8        # 62b0 <_sk_callback_sse2+0x17d>
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
@@ -22551,7 +22636,7 @@
 
 PUBLIC _sk_dstout_sse2
 _sk_dstout_sse2 LABEL PROC
-  DB  68,15,40,5,220,94,0,0               ; movaps        0x5edc(%rip),%xmm8        # 6280 <_sk_callback_sse2+0x175>
+  DB  68,15,40,5,244,94,0,0               ; movaps        0x5ef4(%rip),%xmm8        # 62c0 <_sk_callback_sse2+0x18d>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  15,89,196                           ; mulps         %xmm4,%xmm0
@@ -22566,7 +22651,7 @@
 
 PUBLIC _sk_srcover_sse2
 _sk_srcover_sse2 LABEL PROC
-  DB  68,15,40,5,191,94,0,0               ; movaps        0x5ebf(%rip),%xmm8        # 6290 <_sk_callback_sse2+0x185>
+  DB  68,15,40,5,215,94,0,0               ; movaps        0x5ed7(%rip),%xmm8        # 62d0 <_sk_callback_sse2+0x19d>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -22584,7 +22669,7 @@
 
 PUBLIC _sk_dstover_sse2
 _sk_dstover_sse2 LABEL PROC
-  DB  68,15,40,5,147,94,0,0               ; movaps        0x5e93(%rip),%xmm8        # 62a0 <_sk_callback_sse2+0x195>
+  DB  68,15,40,5,171,94,0,0               ; movaps        0x5eab(%rip),%xmm8        # 62e0 <_sk_callback_sse2+0x1ad>
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -22608,7 +22693,7 @@
 
 PUBLIC _sk_multiply_sse2
 _sk_multiply_sse2 LABEL PROC
-  DB  68,15,40,5,103,94,0,0               ; movaps        0x5e67(%rip),%xmm8        # 62b0 <_sk_callback_sse2+0x1a5>
+  DB  68,15,40,5,127,94,0,0               ; movaps        0x5e7f(%rip),%xmm8        # 62f0 <_sk_callback_sse2+0x1bd>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
@@ -22677,7 +22762,7 @@
 PUBLIC _sk_xor__sse2
 _sk_xor__sse2 LABEL PROC
   DB  68,15,40,195                        ; movaps        %xmm3,%xmm8
-  DB  15,40,29,156,93,0,0                 ; movaps        0x5d9c(%rip),%xmm3        # 62c0 <_sk_callback_sse2+0x1b5>
+  DB  15,40,29,180,93,0,0                 ; movaps        0x5db4(%rip),%xmm3        # 6300 <_sk_callback_sse2+0x1cd>
   DB  68,15,40,203                        ; movaps        %xmm3,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
@@ -22723,7 +22808,7 @@
   DB  68,15,89,206                        ; mulps         %xmm6,%xmm9
   DB  65,15,95,209                        ; maxps         %xmm9,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,7,93,0,0                   ; movaps        0x5d07(%rip),%xmm2        # 62d0 <_sk_callback_sse2+0x1c5>
+  DB  15,40,21,31,93,0,0                  ; movaps        0x5d1f(%rip),%xmm2        # 6310 <_sk_callback_sse2+0x1dd>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -22755,7 +22840,7 @@
   DB  68,15,89,206                        ; mulps         %xmm6,%xmm9
   DB  65,15,93,209                        ; minps         %xmm9,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,172,92,0,0                 ; movaps        0x5cac(%rip),%xmm2        # 62e0 <_sk_callback_sse2+0x1d5>
+  DB  15,40,21,196,92,0,0                 ; movaps        0x5cc4(%rip),%xmm2        # 6320 <_sk_callback_sse2+0x1ed>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -22790,7 +22875,7 @@
   DB  65,15,93,209                        ; minps         %xmm9,%xmm2
   DB  15,88,210                           ; addps         %xmm2,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,70,92,0,0                  ; movaps        0x5c46(%rip),%xmm2        # 62f0 <_sk_callback_sse2+0x1e5>
+  DB  15,40,21,94,92,0,0                  ; movaps        0x5c5e(%rip),%xmm2        # 6330 <_sk_callback_sse2+0x1fd>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -22816,7 +22901,7 @@
   DB  15,89,214                           ; mulps         %xmm6,%xmm2
   DB  15,88,210                           ; addps         %xmm2,%xmm2
   DB  68,15,92,194                        ; subps         %xmm2,%xmm8
-  DB  15,40,21,6,92,0,0                   ; movaps        0x5c06(%rip),%xmm2        # 6300 <_sk_callback_sse2+0x1f5>
+  DB  15,40,21,30,92,0,0                  ; movaps        0x5c1e(%rip),%xmm2        # 6340 <_sk_callback_sse2+0x20d>
   DB  15,92,211                           ; subps         %xmm3,%xmm2
   DB  15,89,215                           ; mulps         %xmm7,%xmm2
   DB  15,88,218                           ; addps         %xmm2,%xmm3
@@ -22827,7 +22912,7 @@
 PUBLIC _sk_colorburn_sse2
 _sk_colorburn_sse2 LABEL PROC
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
-  DB  68,15,40,21,249,91,0,0              ; movaps        0x5bf9(%rip),%xmm10        # 6310 <_sk_callback_sse2+0x205>
+  DB  68,15,40,21,17,92,0,0               ; movaps        0x5c11(%rip),%xmm10        # 6350 <_sk_callback_sse2+0x21d>
   DB  69,15,40,202                        ; movaps        %xmm10,%xmm9
   DB  68,15,92,207                        ; subps         %xmm7,%xmm9
   DB  69,15,40,217                        ; movaps        %xmm9,%xmm11
@@ -22919,7 +23004,7 @@
 PUBLIC _sk_colordodge_sse2
 _sk_colordodge_sse2 LABEL PROC
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
-  DB  68,15,40,21,175,90,0,0              ; movaps        0x5aaf(%rip),%xmm10        # 6320 <_sk_callback_sse2+0x215>
+  DB  68,15,40,21,199,90,0,0              ; movaps        0x5ac7(%rip),%xmm10        # 6360 <_sk_callback_sse2+0x22d>
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
   DB  68,15,92,223                        ; subps         %xmm7,%xmm11
   DB  69,15,40,227                        ; movaps        %xmm11,%xmm12
@@ -23012,7 +23097,7 @@
   DB  15,41,52,36                         ; movaps        %xmm6,(%rsp)
   DB  15,40,245                           ; movaps        %xmm5,%xmm6
   DB  15,40,236                           ; movaps        %xmm4,%xmm5
-  DB  68,15,40,29,97,89,0,0               ; movaps        0x5961(%rip),%xmm11        # 6330 <_sk_callback_sse2+0x225>
+  DB  68,15,40,29,121,89,0,0              ; movaps        0x5979(%rip),%xmm11        # 6370 <_sk_callback_sse2+0x23d>
   DB  69,15,40,211                        ; movaps        %xmm11,%xmm10
   DB  68,15,92,215                        ; subps         %xmm7,%xmm10
   DB  69,15,40,194                        ; movaps        %xmm10,%xmm8
@@ -23099,7 +23184,7 @@
 _sk_overlay_sse2 LABEL PROC
   DB  68,15,40,193                        ; movaps        %xmm1,%xmm8
   DB  68,15,40,232                        ; movaps        %xmm0,%xmm13
-  DB  68,15,40,13,44,88,0,0               ; movaps        0x582c(%rip),%xmm9        # 6340 <_sk_callback_sse2+0x235>
+  DB  68,15,40,13,68,88,0,0               ; movaps        0x5844(%rip),%xmm9        # 6380 <_sk_callback_sse2+0x24d>
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
   DB  68,15,92,215                        ; subps         %xmm7,%xmm10
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
@@ -23189,7 +23274,7 @@
   DB  68,15,40,213                        ; movaps        %xmm5,%xmm10
   DB  68,15,94,215                        ; divps         %xmm7,%xmm10
   DB  69,15,84,212                        ; andps         %xmm12,%xmm10
-  DB  68,15,40,13,230,86,0,0              ; movaps        0x56e6(%rip),%xmm9        # 6350 <_sk_callback_sse2+0x245>
+  DB  68,15,40,13,254,86,0,0              ; movaps        0x56fe(%rip),%xmm9        # 6390 <_sk_callback_sse2+0x25d>
   DB  69,15,40,249                        ; movaps        %xmm9,%xmm15
   DB  69,15,92,250                        ; subps         %xmm10,%xmm15
   DB  69,15,40,218                        ; movaps        %xmm10,%xmm11
@@ -23202,10 +23287,10 @@
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
   DB  65,15,88,194                        ; addps         %xmm10,%xmm0
-  DB  68,15,40,53,192,86,0,0              ; movaps        0x56c0(%rip),%xmm14        # 6360 <_sk_callback_sse2+0x255>
+  DB  68,15,40,53,216,86,0,0              ; movaps        0x56d8(%rip),%xmm14        # 63a0 <_sk_callback_sse2+0x26d>
   DB  69,15,88,222                        ; addps         %xmm14,%xmm11
   DB  68,15,89,216                        ; mulps         %xmm0,%xmm11
-  DB  68,15,40,21,192,86,0,0              ; movaps        0x56c0(%rip),%xmm10        # 6370 <_sk_callback_sse2+0x265>
+  DB  68,15,40,21,216,86,0,0              ; movaps        0x56d8(%rip),%xmm10        # 63b0 <_sk_callback_sse2+0x27d>
   DB  69,15,89,234                        ; mulps         %xmm10,%xmm13
   DB  69,15,88,235                        ; addps         %xmm11,%xmm13
   DB  15,88,228                           ; addps         %xmm4,%xmm4
@@ -23350,7 +23435,7 @@
   DB  68,15,40,209                        ; movaps        %xmm1,%xmm10
   DB  68,15,40,225                        ; movaps        %xmm1,%xmm12
   DB  68,15,89,211                        ; mulps         %xmm3,%xmm10
-  DB  68,15,40,5,252,84,0,0               ; movaps        0x54fc(%rip),%xmm8        # 63b0 <_sk_callback_sse2+0x2a5>
+  DB  68,15,40,5,20,85,0,0                ; movaps        0x5514(%rip),%xmm8        # 63f0 <_sk_callback_sse2+0x2bd>
   DB  69,15,40,216                        ; movaps        %xmm8,%xmm11
   DB  15,40,207                           ; movaps        %xmm7,%xmm1
   DB  68,15,92,217                        ; subps         %xmm1,%xmm11
@@ -23398,12 +23483,12 @@
   DB  69,15,84,206                        ; andps         %xmm14,%xmm9
   DB  69,15,84,214                        ; andps         %xmm14,%xmm10
   DB  65,15,84,214                        ; andps         %xmm14,%xmm2
-  DB  68,15,40,61,9,84,0,0                ; movaps        0x5409(%rip),%xmm15        # 6380 <_sk_callback_sse2+0x275>
+  DB  68,15,40,61,33,84,0,0               ; movaps        0x5421(%rip),%xmm15        # 63c0 <_sk_callback_sse2+0x28d>
   DB  65,15,89,231                        ; mulps         %xmm15,%xmm4
-  DB  15,40,5,14,84,0,0                   ; movaps        0x540e(%rip),%xmm0        # 6390 <_sk_callback_sse2+0x285>
+  DB  15,40,5,38,84,0,0                   ; movaps        0x5426(%rip),%xmm0        # 63d0 <_sk_callback_sse2+0x29d>
   DB  15,89,240                           ; mulps         %xmm0,%xmm6
   DB  15,88,244                           ; addps         %xmm4,%xmm6
-  DB  68,15,40,53,16,84,0,0               ; movaps        0x5410(%rip),%xmm14        # 63a0 <_sk_callback_sse2+0x295>
+  DB  68,15,40,53,40,84,0,0               ; movaps        0x5428(%rip),%xmm14        # 63e0 <_sk_callback_sse2+0x2ad>
   DB  68,15,40,239                        ; movaps        %xmm7,%xmm13
   DB  69,15,89,238                        ; mulps         %xmm14,%xmm13
   DB  68,15,88,238                        ; addps         %xmm6,%xmm13
@@ -23581,14 +23666,14 @@
   DB  68,15,84,211                        ; andps         %xmm3,%xmm10
   DB  68,15,84,203                        ; andps         %xmm3,%xmm9
   DB  15,84,195                           ; andps         %xmm3,%xmm0
-  DB  68,15,40,5,157,81,0,0               ; movaps        0x519d(%rip),%xmm8        # 63c0 <_sk_callback_sse2+0x2b5>
+  DB  68,15,40,5,181,81,0,0               ; movaps        0x51b5(%rip),%xmm8        # 6400 <_sk_callback_sse2+0x2cd>
   DB  15,40,214                           ; movaps        %xmm6,%xmm2
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
-  DB  15,40,13,159,81,0,0                 ; movaps        0x519f(%rip),%xmm1        # 63d0 <_sk_callback_sse2+0x2c5>
+  DB  15,40,13,183,81,0,0                 ; movaps        0x51b7(%rip),%xmm1        # 6410 <_sk_callback_sse2+0x2dd>
   DB  15,40,221                           ; movaps        %xmm5,%xmm3
   DB  15,89,217                           ; mulps         %xmm1,%xmm3
   DB  15,88,218                           ; addps         %xmm2,%xmm3
-  DB  68,15,40,37,158,81,0,0              ; movaps        0x519e(%rip),%xmm12        # 63e0 <_sk_callback_sse2+0x2d5>
+  DB  68,15,40,37,182,81,0,0              ; movaps        0x51b6(%rip),%xmm12        # 6420 <_sk_callback_sse2+0x2ed>
   DB  69,15,89,236                        ; mulps         %xmm12,%xmm13
   DB  68,15,88,235                        ; addps         %xmm3,%xmm13
   DB  65,15,40,210                        ; movaps        %xmm10,%xmm2
@@ -23633,7 +23718,7 @@
   DB  15,40,223                           ; movaps        %xmm7,%xmm3
   DB  15,40,236                           ; movaps        %xmm4,%xmm5
   DB  15,89,221                           ; mulps         %xmm5,%xmm3
-  DB  68,15,40,5,3,81,0,0                 ; movaps        0x5103(%rip),%xmm8        # 63f0 <_sk_callback_sse2+0x2e5>
+  DB  68,15,40,5,27,81,0,0                ; movaps        0x511b(%rip),%xmm8        # 6430 <_sk_callback_sse2+0x2fd>
   DB  65,15,40,224                        ; movaps        %xmm8,%xmm4
   DB  68,15,92,199                        ; subps         %xmm7,%xmm8
   DB  15,88,253                           ; addps         %xmm5,%xmm7
@@ -23734,14 +23819,14 @@
   DB  68,15,40,213                        ; movaps        %xmm5,%xmm10
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
   DB  65,15,40,208                        ; movaps        %xmm8,%xmm2
-  DB  68,15,40,45,155,79,0,0              ; movaps        0x4f9b(%rip),%xmm13        # 6400 <_sk_callback_sse2+0x2f5>
+  DB  68,15,40,45,179,79,0,0              ; movaps        0x4fb3(%rip),%xmm13        # 6440 <_sk_callback_sse2+0x30d>
   DB  68,15,40,198                        ; movaps        %xmm6,%xmm8
   DB  69,15,89,197                        ; mulps         %xmm13,%xmm8
-  DB  68,15,40,53,155,79,0,0              ; movaps        0x4f9b(%rip),%xmm14        # 6410 <_sk_callback_sse2+0x305>
+  DB  68,15,40,53,179,79,0,0              ; movaps        0x4fb3(%rip),%xmm14        # 6450 <_sk_callback_sse2+0x31d>
   DB  65,15,40,195                        ; movaps        %xmm11,%xmm0
   DB  65,15,89,198                        ; mulps         %xmm14,%xmm0
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
-  DB  68,15,40,29,151,79,0,0              ; movaps        0x4f97(%rip),%xmm11        # 6420 <_sk_callback_sse2+0x315>
+  DB  68,15,40,29,175,79,0,0              ; movaps        0x4faf(%rip),%xmm11        # 6460 <_sk_callback_sse2+0x32d>
   DB  69,15,89,227                        ; mulps         %xmm11,%xmm12
   DB  68,15,88,224                        ; addps         %xmm0,%xmm12
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
@@ -23749,7 +23834,7 @@
   DB  69,15,40,250                        ; movaps        %xmm10,%xmm15
   DB  69,15,89,254                        ; mulps         %xmm14,%xmm15
   DB  68,15,88,248                        ; addps         %xmm0,%xmm15
-  DB  68,15,40,5,131,79,0,0               ; movaps        0x4f83(%rip),%xmm8        # 6430 <_sk_callback_sse2+0x325>
+  DB  68,15,40,5,155,79,0,0               ; movaps        0x4f9b(%rip),%xmm8        # 6470 <_sk_callback_sse2+0x33d>
   DB  65,15,40,224                        ; movaps        %xmm8,%xmm4
   DB  15,92,226                           ; subps         %xmm2,%xmm4
   DB  15,89,252                           ; mulps         %xmm4,%xmm7
@@ -23885,15 +23970,15 @@
   DB  68,15,40,205                        ; movaps        %xmm5,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
   DB  15,89,222                           ; mulps         %xmm6,%xmm3
-  DB  68,15,40,37,149,77,0,0              ; movaps        0x4d95(%rip),%xmm12        # 6440 <_sk_callback_sse2+0x335>
+  DB  68,15,40,37,173,77,0,0              ; movaps        0x4dad(%rip),%xmm12        # 6480 <_sk_callback_sse2+0x34d>
   DB  68,15,40,199                        ; movaps        %xmm7,%xmm8
   DB  69,15,89,196                        ; mulps         %xmm12,%xmm8
-  DB  68,15,40,45,149,77,0,0              ; movaps        0x4d95(%rip),%xmm13        # 6450 <_sk_callback_sse2+0x345>
+  DB  68,15,40,45,173,77,0,0              ; movaps        0x4dad(%rip),%xmm13        # 6490 <_sk_callback_sse2+0x35d>
   DB  68,15,40,241                        ; movaps        %xmm1,%xmm14
   DB  69,15,89,245                        ; mulps         %xmm13,%xmm14
   DB  69,15,88,240                        ; addps         %xmm8,%xmm14
-  DB  68,15,40,29,145,77,0,0              ; movaps        0x4d91(%rip),%xmm11        # 6460 <_sk_callback_sse2+0x355>
-  DB  68,15,40,5,153,77,0,0               ; movaps        0x4d99(%rip),%xmm8        # 6470 <_sk_callback_sse2+0x365>
+  DB  68,15,40,29,169,77,0,0              ; movaps        0x4da9(%rip),%xmm11        # 64a0 <_sk_callback_sse2+0x36d>
+  DB  68,15,40,5,177,77,0,0               ; movaps        0x4db1(%rip),%xmm8        # 64b0 <_sk_callback_sse2+0x37d>
   DB  69,15,40,248                        ; movaps        %xmm8,%xmm15
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  68,15,92,248                        ; subps         %xmm0,%xmm15
@@ -24028,10 +24113,10 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,227,0,0,0                    ; jne           19b1 <_sk_srcover_rgba_8888_sse2+0xf1>
+  DB  15,133,227,0,0,0                    ; jne           19d9 <_sk_srcover_rgba_8888_sse2+0xf1>
   DB  243,68,15,111,4,144                 ; movdqu        (%rax,%rdx,4),%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  102,15,111,53,161,75,0,0            ; movdqa        0x4ba1(%rip),%xmm6        # 6480 <_sk_callback_sse2+0x375>
+  DB  102,15,111,53,185,75,0,0            ; movdqa        0x4bb9(%rip),%xmm6        # 64c0 <_sk_callback_sse2+0x38d>
   DB  102,65,15,111,224                   ; movdqa        %xmm8,%xmm4
   DB  102,15,219,230                      ; pand          %xmm6,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
@@ -24045,9 +24130,9 @@
   DB  15,91,247                           ; cvtdq2ps      %xmm7,%xmm6
   DB  102,65,15,114,208,24                ; psrld         $0x18,%xmm8
   DB  65,15,91,248                        ; cvtdq2ps      %xmm8,%xmm7
-  DB  68,15,40,5,113,75,0,0               ; movaps        0x4b71(%rip),%xmm8        # 6490 <_sk_callback_sse2+0x385>
+  DB  68,15,40,5,137,75,0,0               ; movaps        0x4b89(%rip),%xmm8        # 64d0 <_sk_callback_sse2+0x39d>
   DB  68,15,92,195                        ; subps         %xmm3,%xmm8
-  DB  68,15,40,37,117,75,0,0              ; movaps        0x4b75(%rip),%xmm12        # 64a0 <_sk_callback_sse2+0x395>
+  DB  68,15,40,37,141,75,0,0              ; movaps        0x4b8d(%rip),%xmm12        # 64e0 <_sk_callback_sse2+0x3ad>
   DB  65,15,89,196                        ; mulps         %xmm12,%xmm0
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  68,15,89,204                        ; mulps         %xmm4,%xmm9
@@ -24073,7 +24158,7 @@
   DB  102,15,114,240,24                   ; pslld         $0x18,%xmm0
   DB  102,15,235,194                      ; por           %xmm2,%xmm0
   DB  102,15,235,193                      ; por           %xmm1,%xmm0
-  DB  117,82                              ; jne           19ea <_sk_srcover_rgba_8888_sse2+0x12a>
+  DB  117,82                              ; jne           1a12 <_sk_srcover_rgba_8888_sse2+0x12a>
   DB  243,15,127,4,144                    ; movdqu        %xmm0,(%rax,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
@@ -24084,32 +24169,32 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,87                              ; je            1a15 <_sk_srcover_rgba_8888_sse2+0x155>
+  DB  116,87                              ; je            1a3d <_sk_srcover_rgba_8888_sse2+0x155>
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,22                              ; je            19df <_sk_srcover_rgba_8888_sse2+0x11f>
+  DB  116,22                              ; je            1a07 <_sk_srcover_rgba_8888_sse2+0x11f>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  15,133,1,255,255,255                ; jne           18d4 <_sk_srcover_rgba_8888_sse2+0x14>
+  DB  15,133,1,255,255,255                ; jne           18fc <_sk_srcover_rgba_8888_sse2+0x14>
   DB  102,15,110,100,144,8                ; movd          0x8(%rax,%rdx,4),%xmm4
   DB  102,68,15,112,196,69                ; pshufd        $0x45,%xmm4,%xmm8
   DB  102,68,15,18,4,144                  ; movlpd        (%rax,%rdx,4),%xmm8
-  DB  233,234,254,255,255                 ; jmpq          18d4 <_sk_srcover_rgba_8888_sse2+0x14>
+  DB  233,234,254,255,255                 ; jmpq          18fc <_sk_srcover_rgba_8888_sse2+0x14>
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,41                              ; je            1a20 <_sk_srcover_rgba_8888_sse2+0x160>
+  DB  116,41                              ; je            1a48 <_sk_srcover_rgba_8888_sse2+0x160>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,17                              ; je            1a0e <_sk_srcover_rgba_8888_sse2+0x14e>
+  DB  116,17                              ; je            1a36 <_sk_srcover_rgba_8888_sse2+0x14e>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,154                             ; jne           199d <_sk_srcover_rgba_8888_sse2+0xdd>
+  DB  117,154                             ; jne           19c5 <_sk_srcover_rgba_8888_sse2+0xdd>
   DB  102,15,112,200,78                   ; pshufd        $0x4e,%xmm0,%xmm1
   DB  102,15,126,76,144,8                 ; movd          %xmm1,0x8(%rax,%rdx,4)
   DB  102,15,214,4,144                    ; movq          %xmm0,(%rax,%rdx,4)
-  DB  235,136                             ; jmp           199d <_sk_srcover_rgba_8888_sse2+0xdd>
+  DB  235,136                             ; jmp           19c5 <_sk_srcover_rgba_8888_sse2+0xdd>
   DB  102,68,15,110,4,144                 ; movd          (%rax,%rdx,4),%xmm8
-  DB  233,180,254,255,255                 ; jmpq          18d4 <_sk_srcover_rgba_8888_sse2+0x14>
+  DB  233,180,254,255,255                 ; jmpq          18fc <_sk_srcover_rgba_8888_sse2+0x14>
   DB  102,15,126,4,144                    ; movd          %xmm0,(%rax,%rdx,4)
-  DB  233,115,255,255,255                 ; jmpq          199d <_sk_srcover_rgba_8888_sse2+0xdd>
+  DB  233,115,255,255,255                 ; jmpq          19c5 <_sk_srcover_rgba_8888_sse2+0xdd>
 
 PUBLIC _sk_clamp_0_sse2
 _sk_clamp_0_sse2 LABEL PROC
@@ -24123,7 +24208,7 @@
 
 PUBLIC _sk_clamp_1_sse2
 _sk_clamp_1_sse2 LABEL PROC
-  DB  68,15,40,5,102,74,0,0               ; movaps        0x4a66(%rip),%xmm8        # 64b0 <_sk_callback_sse2+0x3a5>
+  DB  68,15,40,5,126,74,0,0               ; movaps        0x4a7e(%rip),%xmm8        # 64f0 <_sk_callback_sse2+0x3bd>
   DB  65,15,93,192                        ; minps         %xmm8,%xmm0
   DB  65,15,93,200                        ; minps         %xmm8,%xmm1
   DB  65,15,93,208                        ; minps         %xmm8,%xmm2
@@ -24133,7 +24218,7 @@
 
 PUBLIC _sk_clamp_a_sse2
 _sk_clamp_a_sse2 LABEL PROC
-  DB  15,93,29,91,74,0,0                  ; minps         0x4a5b(%rip),%xmm3        # 64c0 <_sk_callback_sse2+0x3b5>
+  DB  15,93,29,115,74,0,0                 ; minps         0x4a73(%rip),%xmm3        # 6500 <_sk_callback_sse2+0x3cd>
   DB  15,93,195                           ; minps         %xmm3,%xmm0
   DB  15,93,203                           ; minps         %xmm3,%xmm1
   DB  15,93,211                           ; minps         %xmm3,%xmm2
@@ -24142,7 +24227,7 @@
 
 PUBLIC _sk_clamp_a_dst_sse2
 _sk_clamp_a_dst_sse2 LABEL PROC
-  DB  15,93,61,87,74,0,0                  ; minps         0x4a57(%rip),%xmm7        # 64d0 <_sk_callback_sse2+0x3c5>
+  DB  15,93,61,111,74,0,0                 ; minps         0x4a6f(%rip),%xmm7        # 6510 <_sk_callback_sse2+0x3dd>
   DB  15,93,231                           ; minps         %xmm7,%xmm4
   DB  15,93,239                           ; minps         %xmm7,%xmm5
   DB  15,93,247                           ; minps         %xmm7,%xmm6
@@ -24198,7 +24283,7 @@
 PUBLIC _sk_unpremul_sse2
 _sk_unpremul_sse2 LABEL PROC
   DB  69,15,87,192                        ; xorps         %xmm8,%xmm8
-  DB  68,15,40,13,242,73,0,0              ; movaps        0x49f2(%rip),%xmm9        # 64e0 <_sk_callback_sse2+0x3d5>
+  DB  68,15,40,13,10,74,0,0               ; movaps        0x4a0a(%rip),%xmm9        # 6520 <_sk_callback_sse2+0x3ed>
   DB  68,15,94,203                        ; divps         %xmm3,%xmm9
   DB  68,15,194,195,4                     ; cmpneqps      %xmm3,%xmm8
   DB  69,15,84,193                        ; andps         %xmm9,%xmm8
@@ -24210,20 +24295,20 @@
 
 PUBLIC _sk_from_srgb_sse2
 _sk_from_srgb_sse2 LABEL PROC
-  DB  68,15,40,5,221,73,0,0               ; movaps        0x49dd(%rip),%xmm8        # 64f0 <_sk_callback_sse2+0x3e5>
+  DB  68,15,40,5,245,73,0,0               ; movaps        0x49f5(%rip),%xmm8        # 6530 <_sk_callback_sse2+0x3fd>
   DB  68,15,40,232                        ; movaps        %xmm0,%xmm13
   DB  69,15,89,232                        ; mulps         %xmm8,%xmm13
   DB  68,15,40,216                        ; movaps        %xmm0,%xmm11
   DB  69,15,89,219                        ; mulps         %xmm11,%xmm11
-  DB  68,15,40,13,213,73,0,0              ; movaps        0x49d5(%rip),%xmm9        # 6500 <_sk_callback_sse2+0x3f5>
+  DB  68,15,40,13,237,73,0,0              ; movaps        0x49ed(%rip),%xmm9        # 6540 <_sk_callback_sse2+0x40d>
   DB  68,15,40,240                        ; movaps        %xmm0,%xmm14
   DB  69,15,89,241                        ; mulps         %xmm9,%xmm14
-  DB  68,15,40,21,213,73,0,0              ; movaps        0x49d5(%rip),%xmm10        # 6510 <_sk_callback_sse2+0x405>
+  DB  68,15,40,21,237,73,0,0              ; movaps        0x49ed(%rip),%xmm10        # 6550 <_sk_callback_sse2+0x41d>
   DB  69,15,88,242                        ; addps         %xmm10,%xmm14
   DB  69,15,89,243                        ; mulps         %xmm11,%xmm14
-  DB  68,15,40,29,213,73,0,0              ; movaps        0x49d5(%rip),%xmm11        # 6520 <_sk_callback_sse2+0x415>
+  DB  68,15,40,29,237,73,0,0              ; movaps        0x49ed(%rip),%xmm11        # 6560 <_sk_callback_sse2+0x42d>
   DB  69,15,88,243                        ; addps         %xmm11,%xmm14
-  DB  68,15,40,37,217,73,0,0              ; movaps        0x49d9(%rip),%xmm12        # 6530 <_sk_callback_sse2+0x425>
+  DB  68,15,40,37,241,73,0,0              ; movaps        0x49f1(%rip),%xmm12        # 6570 <_sk_callback_sse2+0x43d>
   DB  65,15,194,196,1                     ; cmpltps       %xmm12,%xmm0
   DB  68,15,84,232                        ; andps         %xmm0,%xmm13
   DB  65,15,85,198                        ; andnps        %xmm14,%xmm0
@@ -24257,20 +24342,20 @@
 
 PUBLIC _sk_from_srgb_dst_sse2
 _sk_from_srgb_dst_sse2 LABEL PROC
-  DB  68,15,40,5,106,73,0,0               ; movaps        0x496a(%rip),%xmm8        # 6540 <_sk_callback_sse2+0x435>
+  DB  68,15,40,5,130,73,0,0               ; movaps        0x4982(%rip),%xmm8        # 6580 <_sk_callback_sse2+0x44d>
   DB  68,15,40,236                        ; movaps        %xmm4,%xmm13
   DB  69,15,89,232                        ; mulps         %xmm8,%xmm13
   DB  68,15,40,220                        ; movaps        %xmm4,%xmm11
   DB  69,15,89,219                        ; mulps         %xmm11,%xmm11
-  DB  68,15,40,13,98,73,0,0               ; movaps        0x4962(%rip),%xmm9        # 6550 <_sk_callback_sse2+0x445>
+  DB  68,15,40,13,122,73,0,0              ; movaps        0x497a(%rip),%xmm9        # 6590 <_sk_callback_sse2+0x45d>
   DB  68,15,40,244                        ; movaps        %xmm4,%xmm14
   DB  69,15,89,241                        ; mulps         %xmm9,%xmm14
-  DB  68,15,40,21,98,73,0,0               ; movaps        0x4962(%rip),%xmm10        # 6560 <_sk_callback_sse2+0x455>
+  DB  68,15,40,21,122,73,0,0              ; movaps        0x497a(%rip),%xmm10        # 65a0 <_sk_callback_sse2+0x46d>
   DB  69,15,88,242                        ; addps         %xmm10,%xmm14
   DB  69,15,89,243                        ; mulps         %xmm11,%xmm14
-  DB  68,15,40,29,98,73,0,0               ; movaps        0x4962(%rip),%xmm11        # 6570 <_sk_callback_sse2+0x465>
+  DB  68,15,40,29,122,73,0,0              ; movaps        0x497a(%rip),%xmm11        # 65b0 <_sk_callback_sse2+0x47d>
   DB  69,15,88,243                        ; addps         %xmm11,%xmm14
-  DB  68,15,40,37,102,73,0,0              ; movaps        0x4966(%rip),%xmm12        # 6580 <_sk_callback_sse2+0x475>
+  DB  68,15,40,37,126,73,0,0              ; movaps        0x497e(%rip),%xmm12        # 65c0 <_sk_callback_sse2+0x48d>
   DB  65,15,194,228,1                     ; cmpltps       %xmm12,%xmm4
   DB  68,15,84,236                        ; andps         %xmm4,%xmm13
   DB  65,15,85,230                        ; andnps        %xmm14,%xmm4
@@ -24305,22 +24390,22 @@
 PUBLIC _sk_to_srgb_sse2
 _sk_to_srgb_sse2 LABEL PROC
   DB  68,15,82,232                        ; rsqrtps       %xmm0,%xmm13
-  DB  68,15,40,5,243,72,0,0               ; movaps        0x48f3(%rip),%xmm8        # 6590 <_sk_callback_sse2+0x485>
+  DB  68,15,40,5,11,73,0,0                ; movaps        0x490b(%rip),%xmm8        # 65d0 <_sk_callback_sse2+0x49d>
   DB  68,15,40,240                        ; movaps        %xmm0,%xmm14
   DB  69,15,89,240                        ; mulps         %xmm8,%xmm14
-  DB  68,15,40,13,243,72,0,0              ; movaps        0x48f3(%rip),%xmm9        # 65a0 <_sk_callback_sse2+0x495>
+  DB  68,15,40,13,11,73,0,0               ; movaps        0x490b(%rip),%xmm9        # 65e0 <_sk_callback_sse2+0x4ad>
   DB  69,15,40,253                        ; movaps        %xmm13,%xmm15
   DB  69,15,89,249                        ; mulps         %xmm9,%xmm15
-  DB  68,15,40,21,243,72,0,0              ; movaps        0x48f3(%rip),%xmm10        # 65b0 <_sk_callback_sse2+0x4a5>
+  DB  68,15,40,21,11,73,0,0               ; movaps        0x490b(%rip),%xmm10        # 65f0 <_sk_callback_sse2+0x4bd>
   DB  69,15,88,250                        ; addps         %xmm10,%xmm15
   DB  69,15,89,253                        ; mulps         %xmm13,%xmm15
-  DB  68,15,40,29,243,72,0,0              ; movaps        0x48f3(%rip),%xmm11        # 65c0 <_sk_callback_sse2+0x4b5>
+  DB  68,15,40,29,11,73,0,0               ; movaps        0x490b(%rip),%xmm11        # 6600 <_sk_callback_sse2+0x4cd>
   DB  69,15,88,251                        ; addps         %xmm11,%xmm15
-  DB  68,15,40,37,247,72,0,0              ; movaps        0x48f7(%rip),%xmm12        # 65d0 <_sk_callback_sse2+0x4c5>
+  DB  68,15,40,37,15,73,0,0               ; movaps        0x490f(%rip),%xmm12        # 6610 <_sk_callback_sse2+0x4dd>
   DB  69,15,88,236                        ; addps         %xmm12,%xmm13
   DB  69,15,83,237                        ; rcpps         %xmm13,%xmm13
   DB  69,15,89,239                        ; mulps         %xmm15,%xmm13
-  DB  68,15,40,61,243,72,0,0              ; movaps        0x48f3(%rip),%xmm15        # 65e0 <_sk_callback_sse2+0x4d5>
+  DB  68,15,40,61,11,73,0,0               ; movaps        0x490b(%rip),%xmm15        # 6620 <_sk_callback_sse2+0x4ed>
   DB  65,15,194,199,1                     ; cmpltps       %xmm15,%xmm0
   DB  68,15,84,240                        ; andps         %xmm0,%xmm14
   DB  65,15,85,197                        ; andnps        %xmm13,%xmm0
@@ -24368,7 +24453,7 @@
   DB  68,15,93,218                        ; minps         %xmm2,%xmm11
   DB  65,15,40,202                        ; movaps        %xmm10,%xmm1
   DB  65,15,92,203                        ; subps         %xmm11,%xmm1
-  DB  68,15,40,45,76,72,0,0               ; movaps        0x484c(%rip),%xmm13        # 65f0 <_sk_callback_sse2+0x4e5>
+  DB  68,15,40,45,100,72,0,0              ; movaps        0x4864(%rip),%xmm13        # 6630 <_sk_callback_sse2+0x4fd>
   DB  68,15,94,233                        ; divps         %xmm1,%xmm13
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  65,15,194,192,0                     ; cmpeqps       %xmm8,%xmm0
@@ -24377,30 +24462,30 @@
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,40,241                        ; movaps        %xmm9,%xmm14
   DB  68,15,194,242,1                     ; cmpltps       %xmm2,%xmm14
-  DB  68,15,84,53,50,72,0,0               ; andps         0x4832(%rip),%xmm14        # 6600 <_sk_callback_sse2+0x4f5>
+  DB  68,15,84,53,74,72,0,0               ; andps         0x484a(%rip),%xmm14        # 6640 <_sk_callback_sse2+0x50d>
   DB  69,15,88,244                        ; addps         %xmm12,%xmm14
   DB  69,15,40,250                        ; movaps        %xmm10,%xmm15
   DB  69,15,194,249,0                     ; cmpeqps       %xmm9,%xmm15
   DB  65,15,92,208                        ; subps         %xmm8,%xmm2
   DB  65,15,89,213                        ; mulps         %xmm13,%xmm2
-  DB  68,15,40,37,37,72,0,0               ; movaps        0x4825(%rip),%xmm12        # 6610 <_sk_callback_sse2+0x505>
+  DB  68,15,40,37,61,72,0,0               ; movaps        0x483d(%rip),%xmm12        # 6650 <_sk_callback_sse2+0x51d>
   DB  65,15,88,212                        ; addps         %xmm12,%xmm2
   DB  69,15,92,193                        ; subps         %xmm9,%xmm8
   DB  69,15,89,197                        ; mulps         %xmm13,%xmm8
-  DB  68,15,88,5,33,72,0,0                ; addps         0x4821(%rip),%xmm8        # 6620 <_sk_callback_sse2+0x515>
+  DB  68,15,88,5,57,72,0,0                ; addps         0x4839(%rip),%xmm8        # 6660 <_sk_callback_sse2+0x52d>
   DB  65,15,84,215                        ; andps         %xmm15,%xmm2
   DB  69,15,85,248                        ; andnps        %xmm8,%xmm15
   DB  68,15,86,250                        ; orps          %xmm2,%xmm15
   DB  68,15,84,240                        ; andps         %xmm0,%xmm14
   DB  65,15,85,199                        ; andnps        %xmm15,%xmm0
   DB  65,15,86,198                        ; orps          %xmm14,%xmm0
-  DB  15,89,5,18,72,0,0                   ; mulps         0x4812(%rip),%xmm0        # 6630 <_sk_callback_sse2+0x525>
+  DB  15,89,5,42,72,0,0                   ; mulps         0x482a(%rip),%xmm0        # 6670 <_sk_callback_sse2+0x53d>
   DB  69,15,40,194                        ; movaps        %xmm10,%xmm8
   DB  69,15,194,195,4                     ; cmpneqps      %xmm11,%xmm8
   DB  65,15,84,192                        ; andps         %xmm8,%xmm0
   DB  69,15,92,226                        ; subps         %xmm10,%xmm12
   DB  69,15,88,211                        ; addps         %xmm11,%xmm10
-  DB  68,15,40,13,5,72,0,0                ; movaps        0x4805(%rip),%xmm9        # 6640 <_sk_callback_sse2+0x535>
+  DB  68,15,40,13,29,72,0,0               ; movaps        0x481d(%rip),%xmm9        # 6680 <_sk_callback_sse2+0x54d>
   DB  65,15,40,210                        ; movaps        %xmm10,%xmm2
   DB  65,15,89,209                        ; mulps         %xmm9,%xmm2
   DB  68,15,194,202,1                     ; cmpltps       %xmm2,%xmm9
@@ -24423,7 +24508,7 @@
   DB  15,41,92,36,32                      ; movaps        %xmm3,0x20(%rsp)
   DB  68,15,40,218                        ; movaps        %xmm2,%xmm11
   DB  15,40,240                           ; movaps        %xmm0,%xmm6
-  DB  68,15,40,13,192,71,0,0              ; movaps        0x47c0(%rip),%xmm9        # 6650 <_sk_callback_sse2+0x545>
+  DB  68,15,40,13,216,71,0,0              ; movaps        0x47d8(%rip),%xmm9        # 6690 <_sk_callback_sse2+0x55d>
   DB  69,15,40,209                        ; movaps        %xmm9,%xmm10
   DB  69,15,194,211,2                     ; cmpleps       %xmm11,%xmm10
   DB  15,40,193                           ; movaps        %xmm1,%xmm0
@@ -24440,28 +24525,28 @@
   DB  69,15,88,211                        ; addps         %xmm11,%xmm10
   DB  69,15,88,219                        ; addps         %xmm11,%xmm11
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
-  DB  15,40,5,138,71,0,0                  ; movaps        0x478a(%rip),%xmm0        # 6660 <_sk_callback_sse2+0x555>
+  DB  15,40,5,162,71,0,0                  ; movaps        0x47a2(%rip),%xmm0        # 66a0 <_sk_callback_sse2+0x56d>
   DB  15,88,198                           ; addps         %xmm6,%xmm0
   DB  243,15,91,200                       ; cvttps2dq     %xmm0,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
   DB  15,40,216                           ; movaps        %xmm0,%xmm3
   DB  15,194,217,1                        ; cmpltps       %xmm1,%xmm3
-  DB  15,84,29,130,71,0,0                 ; andps         0x4782(%rip),%xmm3        # 6670 <_sk_callback_sse2+0x565>
+  DB  15,84,29,154,71,0,0                 ; andps         0x479a(%rip),%xmm3        # 66b0 <_sk_callback_sse2+0x57d>
   DB  15,92,203                           ; subps         %xmm3,%xmm1
   DB  15,92,193                           ; subps         %xmm1,%xmm0
-  DB  68,15,40,45,132,71,0,0              ; movaps        0x4784(%rip),%xmm13        # 6680 <_sk_callback_sse2+0x575>
+  DB  68,15,40,45,156,71,0,0              ; movaps        0x479c(%rip),%xmm13        # 66c0 <_sk_callback_sse2+0x58d>
   DB  69,15,40,197                        ; movaps        %xmm13,%xmm8
   DB  68,15,194,192,2                     ; cmpleps       %xmm0,%xmm8
   DB  69,15,40,242                        ; movaps        %xmm10,%xmm14
   DB  69,15,92,243                        ; subps         %xmm11,%xmm14
   DB  65,15,40,217                        ; movaps        %xmm9,%xmm3
   DB  15,194,216,2                        ; cmpleps       %xmm0,%xmm3
-  DB  15,40,21,148,71,0,0                 ; movaps        0x4794(%rip),%xmm2        # 66b0 <_sk_callback_sse2+0x5a5>
+  DB  15,40,21,172,71,0,0                 ; movaps        0x47ac(%rip),%xmm2        # 66f0 <_sk_callback_sse2+0x5bd>
   DB  68,15,40,250                        ; movaps        %xmm2,%xmm15
   DB  68,15,194,248,2                     ; cmpleps       %xmm0,%xmm15
-  DB  15,40,13,100,71,0,0                 ; movaps        0x4764(%rip),%xmm1        # 6690 <_sk_callback_sse2+0x585>
+  DB  15,40,13,124,71,0,0                 ; movaps        0x477c(%rip),%xmm1        # 66d0 <_sk_callback_sse2+0x59d>
   DB  15,89,193                           ; mulps         %xmm1,%xmm0
-  DB  15,40,45,106,71,0,0                 ; movaps        0x476a(%rip),%xmm5        # 66a0 <_sk_callback_sse2+0x595>
+  DB  15,40,45,130,71,0,0                 ; movaps        0x4782(%rip),%xmm5        # 66e0 <_sk_callback_sse2+0x5ad>
   DB  15,40,229                           ; movaps        %xmm5,%xmm4
   DB  15,92,224                           ; subps         %xmm0,%xmm4
   DB  65,15,89,230                        ; mulps         %xmm14,%xmm4
@@ -24484,7 +24569,7 @@
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
   DB  15,40,222                           ; movaps        %xmm6,%xmm3
   DB  15,194,216,1                        ; cmpltps       %xmm0,%xmm3
-  DB  15,84,29,223,70,0,0                 ; andps         0x46df(%rip),%xmm3        # 6670 <_sk_callback_sse2+0x565>
+  DB  15,84,29,247,70,0,0                 ; andps         0x46f7(%rip),%xmm3        # 66b0 <_sk_callback_sse2+0x57d>
   DB  15,92,195                           ; subps         %xmm3,%xmm0
   DB  68,15,40,230                        ; movaps        %xmm6,%xmm12
   DB  68,15,92,224                        ; subps         %xmm0,%xmm12
@@ -24514,12 +24599,12 @@
   DB  15,40,60,36                         ; movaps        (%rsp),%xmm7
   DB  15,40,231                           ; movaps        %xmm7,%xmm4
   DB  15,85,227                           ; andnps        %xmm3,%xmm4
-  DB  15,88,53,184,70,0,0                 ; addps         0x46b8(%rip),%xmm6        # 66c0 <_sk_callback_sse2+0x5b5>
+  DB  15,88,53,208,70,0,0                 ; addps         0x46d0(%rip),%xmm6        # 6700 <_sk_callback_sse2+0x5cd>
   DB  243,15,91,198                       ; cvttps2dq     %xmm6,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
   DB  15,40,222                           ; movaps        %xmm6,%xmm3
   DB  15,194,216,1                        ; cmpltps       %xmm0,%xmm3
-  DB  15,84,29,83,70,0,0                  ; andps         0x4653(%rip),%xmm3        # 6670 <_sk_callback_sse2+0x565>
+  DB  15,84,29,107,70,0,0                 ; andps         0x466b(%rip),%xmm3        # 66b0 <_sk_callback_sse2+0x57d>
   DB  15,92,195                           ; subps         %xmm3,%xmm0
   DB  15,92,240                           ; subps         %xmm0,%xmm6
   DB  15,89,206                           ; mulps         %xmm6,%xmm1
@@ -24576,13 +24661,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,61                              ; jne           2114 <_sk_scale_u8_sse2+0x47>
+  DB  117,61                              ; jne           213c <_sk_scale_u8_sse2+0x47>
   DB  102,69,15,110,4,18                  ; movd          (%r10,%rdx,1),%xmm8
   DB  102,68,15,96,192                    ; punpcklbw     %xmm0,%xmm8
   DB  102,68,15,97,192                    ; punpcklwd     %xmm0,%xmm8
-  DB  102,68,15,219,5,224,69,0,0          ; pand          0x45e0(%rip),%xmm8        # 66d0 <_sk_callback_sse2+0x5c5>
+  DB  102,68,15,219,5,248,69,0,0          ; pand          0x45f8(%rip),%xmm8        # 6710 <_sk_callback_sse2+0x5dd>
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,228,69,0,0               ; mulps         0x45e4(%rip),%xmm8        # 66e0 <_sk_callback_sse2+0x5d5>
+  DB  68,15,89,5,252,69,0,0               ; mulps         0x45fc(%rip),%xmm8        # 6720 <_sk_callback_sse2+0x5ed>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
@@ -24593,12 +24678,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,61                              ; je            215e <_sk_scale_u8_sse2+0x91>
+  DB  116,61                              ; je            2186 <_sk_scale_u8_sse2+0x91>
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,23                              ; je            2143 <_sk_scale_u8_sse2+0x76>
+  DB  116,23                              ; je            216b <_sk_scale_u8_sse2+0x76>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,181                             ; jne           20e7 <_sk_scale_u8_sse2+0x1a>
+  DB  117,181                             ; jne           210f <_sk_scale_u8_sse2+0x1a>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  102,69,15,112,192,69                ; pshufd        $0x45,%xmm8,%xmm8
@@ -24607,10 +24692,10 @@
   DB  102,68,15,96,200                    ; punpcklbw     %xmm0,%xmm9
   DB  102,68,15,97,200                    ; punpcklwd     %xmm0,%xmm9
   DB  242,69,15,16,193                    ; movsd         %xmm9,%xmm8
-  DB  235,137                             ; jmp           20e7 <_sk_scale_u8_sse2+0x1a>
+  DB  235,137                             ; jmp           210f <_sk_scale_u8_sse2+0x1a>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
-  DB  233,122,255,255,255                 ; jmpq          20e7 <_sk_scale_u8_sse2+0x1a>
+  DB  233,122,255,255,255                 ; jmpq          210f <_sk_scale_u8_sse2+0x1a>
 
 PUBLIC _sk_lerp_1_float_sse2
 _sk_lerp_1_float_sse2 LABEL PROC
@@ -24637,13 +24722,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,81                              ; jne           2200 <_sk_lerp_u8_sse2+0x5b>
+  DB  117,81                              ; jne           2228 <_sk_lerp_u8_sse2+0x5b>
   DB  102,69,15,110,4,18                  ; movd          (%r10,%rdx,1),%xmm8
   DB  102,68,15,96,192                    ; punpcklbw     %xmm0,%xmm8
   DB  102,68,15,97,192                    ; punpcklwd     %xmm0,%xmm8
-  DB  102,68,15,219,5,40,69,0,0           ; pand          0x4528(%rip),%xmm8        # 66f0 <_sk_callback_sse2+0x5e5>
+  DB  102,68,15,219,5,64,69,0,0           ; pand          0x4540(%rip),%xmm8        # 6730 <_sk_callback_sse2+0x5fd>
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,44,69,0,0                ; mulps         0x452c(%rip),%xmm8        # 6700 <_sk_callback_sse2+0x5f5>
+  DB  68,15,89,5,68,69,0,0                ; mulps         0x4544(%rip),%xmm8        # 6740 <_sk_callback_sse2+0x60d>
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -24661,12 +24746,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,64                              ; je            224d <_sk_lerp_u8_sse2+0xa8>
+  DB  116,64                              ; je            2275 <_sk_lerp_u8_sse2+0xa8>
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,23                              ; je            222f <_sk_lerp_u8_sse2+0x8a>
+  DB  116,23                              ; je            2257 <_sk_lerp_u8_sse2+0x8a>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,161                             ; jne           21bf <_sk_lerp_u8_sse2+0x1a>
+  DB  117,161                             ; jne           21e7 <_sk_lerp_u8_sse2+0x1a>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  102,69,15,112,192,69                ; pshufd        $0x45,%xmm8,%xmm8
@@ -24675,30 +24760,30 @@
   DB  102,68,15,96,200                    ; punpcklbw     %xmm0,%xmm9
   DB  102,68,15,97,200                    ; punpcklwd     %xmm0,%xmm9
   DB  242,69,15,16,193                    ; movsd         %xmm9,%xmm8
-  DB  233,114,255,255,255                 ; jmpq          21bf <_sk_lerp_u8_sse2+0x1a>
+  DB  233,114,255,255,255                 ; jmpq          21e7 <_sk_lerp_u8_sse2+0x1a>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
-  DB  233,99,255,255,255                  ; jmpq          21bf <_sk_lerp_u8_sse2+0x1a>
+  DB  233,99,255,255,255                  ; jmpq          21e7 <_sk_lerp_u8_sse2+0x1a>
 
 PUBLIC _sk_lerp_565_sse2
 _sk_lerp_565_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,156,0,0,0                    ; jne           2306 <_sk_lerp_565_sse2+0xaa>
+  DB  15,133,156,0,0,0                    ; jne           232e <_sk_lerp_565_sse2+0xaa>
   DB  243,69,15,126,12,82                 ; movq          (%r10,%rdx,2),%xmm9
   DB  102,68,15,97,200                    ; punpcklwd     %xmm0,%xmm9
-  DB  102,68,15,111,5,146,68,0,0          ; movdqa        0x4492(%rip),%xmm8        # 6710 <_sk_callback_sse2+0x605>
+  DB  102,68,15,111,5,170,68,0,0          ; movdqa        0x44aa(%rip),%xmm8        # 6750 <_sk_callback_sse2+0x61d>
   DB  102,69,15,219,193                   ; pand          %xmm9,%xmm8
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
-  DB  68,15,89,5,145,68,0,0               ; mulps         0x4491(%rip),%xmm8        # 6720 <_sk_callback_sse2+0x615>
-  DB  102,68,15,111,21,152,68,0,0         ; movdqa        0x4498(%rip),%xmm10        # 6730 <_sk_callback_sse2+0x625>
+  DB  68,15,89,5,169,68,0,0               ; mulps         0x44a9(%rip),%xmm8        # 6760 <_sk_callback_sse2+0x62d>
+  DB  102,68,15,111,21,176,68,0,0         ; movdqa        0x44b0(%rip),%xmm10        # 6770 <_sk_callback_sse2+0x63d>
   DB  102,69,15,219,209                   ; pand          %xmm9,%xmm10
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
-  DB  68,15,89,21,151,68,0,0              ; mulps         0x4497(%rip),%xmm10        # 6740 <_sk_callback_sse2+0x635>
-  DB  102,68,15,219,13,158,68,0,0         ; pand          0x449e(%rip),%xmm9        # 6750 <_sk_callback_sse2+0x645>
+  DB  68,15,89,21,175,68,0,0              ; mulps         0x44af(%rip),%xmm10        # 6780 <_sk_callback_sse2+0x64d>
+  DB  102,68,15,219,13,182,68,0,0         ; pand          0x44b6(%rip),%xmm9        # 6790 <_sk_callback_sse2+0x65d>
   DB  69,15,91,201                        ; cvtdq2ps      %xmm9,%xmm9
-  DB  68,15,89,13,162,68,0,0              ; mulps         0x44a2(%rip),%xmm9        # 6760 <_sk_callback_sse2+0x655>
+  DB  68,15,89,13,186,68,0,0              ; mulps         0x44ba(%rip),%xmm9        # 67a0 <_sk_callback_sse2+0x66d>
   DB  15,92,196                           ; subps         %xmm4,%xmm0
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  15,88,196                           ; addps         %xmm4,%xmm0
@@ -24723,34 +24808,34 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,59                              ; je            234e <_sk_lerp_565_sse2+0xf2>
+  DB  116,59                              ; je            2376 <_sk_lerp_565_sse2+0xf2>
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,27                              ; je            2339 <_sk_lerp_565_sse2+0xdd>
+  DB  116,27                              ; je            2361 <_sk_lerp_565_sse2+0xdd>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  15,133,77,255,255,255               ; jne           2275 <_sk_lerp_565_sse2+0x19>
+  DB  15,133,77,255,255,255               ; jne           229d <_sk_lerp_565_sse2+0x19>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  102,69,15,112,200,69                ; pshufd        $0x45,%xmm8,%xmm9
   DB  102,69,15,110,4,82                  ; movd          (%r10,%rdx,2),%xmm8
   DB  102,68,15,97,192                    ; punpcklwd     %xmm0,%xmm8
   DB  242,69,15,16,200                    ; movsd         %xmm8,%xmm9
-  DB  233,39,255,255,255                  ; jmpq          2275 <_sk_lerp_565_sse2+0x19>
+  DB  233,39,255,255,255                  ; jmpq          229d <_sk_lerp_565_sse2+0x19>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,68,15,110,200                   ; movd          %eax,%xmm9
-  DB  233,24,255,255,255                  ; jmpq          2275 <_sk_lerp_565_sse2+0x19>
+  DB  233,24,255,255,255                  ; jmpq          229d <_sk_lerp_565_sse2+0x19>
 
 PUBLIC _sk_load_tables_sse2
 _sk_load_tables_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,36,1,0,0                     ; jne           248f <_sk_load_tables_sse2+0x132>
+  DB  15,133,36,1,0,0                     ; jne           24b7 <_sk_load_tables_sse2+0x132>
   DB  243,69,15,111,12,145                ; movdqu        (%r9,%rdx,4),%xmm9
   DB  65,87                               ; push          %r15
   DB  65,86                               ; push          %r14
   DB  83                                  ; push          %rbx
-  DB  102,68,15,111,5,241,67,0,0          ; movdqa        0x43f1(%rip),%xmm8        # 6770 <_sk_callback_sse2+0x665>
+  DB  102,68,15,111,5,9,68,0,0            ; movdqa        0x4409(%rip),%xmm8        # 67b0 <_sk_callback_sse2+0x67d>
   DB  102,65,15,111,193                   ; movdqa        %xmm9,%xmm0
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,15,112,200,78                   ; pshufd        $0x4e,%xmm0,%xmm1
@@ -24806,7 +24891,7 @@
   DB  65,15,20,208                        ; unpcklps      %xmm8,%xmm2
   DB  102,65,15,114,209,24                ; psrld         $0x18,%xmm9
   DB  65,15,91,217                        ; cvtdq2ps      %xmm9,%xmm3
-  DB  15,89,29,250,66,0,0                 ; mulps         0x42fa(%rip),%xmm3        # 6780 <_sk_callback_sse2+0x675>
+  DB  15,89,29,18,67,0,0                  ; mulps         0x4312(%rip),%xmm3        # 67c0 <_sk_callback_sse2+0x68d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
   DB  65,94                               ; pop           %r14
@@ -24815,18 +24900,18 @@
   DB  69,137,194                          ; mov           %r8d,%r10d
   DB  65,128,226,3                        ; and           $0x3,%r10b
   DB  65,128,250,1                        ; cmp           $0x1,%r10b
-  DB  116,45                              ; je            24c9 <_sk_load_tables_sse2+0x16c>
+  DB  116,45                              ; je            24f1 <_sk_load_tables_sse2+0x16c>
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
   DB  65,128,250,2                        ; cmp           $0x2,%r10b
-  DB  116,23                              ; je            24be <_sk_load_tables_sse2+0x161>
+  DB  116,23                              ; je            24e6 <_sk_load_tables_sse2+0x161>
   DB  65,128,250,3                        ; cmp           $0x3,%r10b
-  DB  15,133,192,254,255,255              ; jne           2371 <_sk_load_tables_sse2+0x14>
+  DB  15,133,192,254,255,255              ; jne           2399 <_sk_load_tables_sse2+0x14>
   DB  102,65,15,110,68,145,8              ; movd          0x8(%r9,%rdx,4),%xmm0
   DB  102,68,15,112,200,69                ; pshufd        $0x45,%xmm0,%xmm9
   DB  102,69,15,18,12,145                 ; movlpd        (%r9,%rdx,4),%xmm9
-  DB  233,168,254,255,255                 ; jmpq          2371 <_sk_load_tables_sse2+0x14>
+  DB  233,168,254,255,255                 ; jmpq          2399 <_sk_load_tables_sse2+0x14>
   DB  102,69,15,110,12,145                ; movd          (%r9,%rdx,4),%xmm9
-  DB  233,157,254,255,255                 ; jmpq          2371 <_sk_load_tables_sse2+0x14>
+  DB  233,157,254,255,255                 ; jmpq          2399 <_sk_load_tables_sse2+0x14>
 
 PUBLIC _sk_load_tables_u16_be_sse2
 _sk_load_tables_u16_be_sse2 LABEL PROC
@@ -24834,7 +24919,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,149,0,0,0,0               ; lea           0x0(,%rdx,4),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,101,1,0,0                    ; jne           264f <_sk_load_tables_u16_be_sse2+0x17b>
+  DB  15,133,101,1,0,0                    ; jne           2677 <_sk_load_tables_u16_be_sse2+0x17b>
   DB  102,67,15,16,4,81                   ; movupd        (%r9,%r10,2),%xmm0
   DB  102,67,15,16,76,81,16               ; movupd        0x10(%r9,%r10,2),%xmm1
   DB  65,87                               ; push          %r15
@@ -24846,7 +24931,7 @@
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,97,200                       ; punpcklwd     %xmm0,%xmm1
   DB  102,68,15,105,200                   ; punpckhwd     %xmm0,%xmm9
-  DB  102,68,15,111,21,111,66,0,0         ; movdqa        0x426f(%rip),%xmm10        # 6790 <_sk_callback_sse2+0x685>
+  DB  102,68,15,111,21,135,66,0,0         ; movdqa        0x4287(%rip),%xmm10        # 67d0 <_sk_callback_sse2+0x69d>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,194                   ; pand          %xmm10,%xmm0
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
@@ -24908,7 +24993,7 @@
   DB  102,65,15,235,217                   ; por           %xmm9,%xmm3
   DB  102,65,15,97,216                    ; punpcklwd     %xmm8,%xmm3
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,90,65,0,0                  ; mulps         0x415a(%rip),%xmm3        # 67a0 <_sk_callback_sse2+0x695>
+  DB  15,89,29,114,65,0,0                 ; mulps         0x4172(%rip),%xmm3        # 67e0 <_sk_callback_sse2+0x6ad>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
   DB  65,94                               ; pop           %r14
@@ -24916,17 +25001,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,67,15,16,4,81                   ; movsd         (%r9,%r10,2),%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,17                              ; jne           266c <_sk_load_tables_u16_be_sse2+0x198>
+  DB  117,17                              ; jne           2694 <_sk_load_tables_u16_be_sse2+0x198>
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
   DB  102,15,20,193                       ; unpcklpd      %xmm1,%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
-  DB  233,139,254,255,255                 ; jmpq          24f7 <_sk_load_tables_u16_be_sse2+0x23>
+  DB  233,139,254,255,255                 ; jmpq          251f <_sk_load_tables_u16_be_sse2+0x23>
   DB  102,67,15,22,68,81,8                ; movhpd        0x8(%r9,%r10,2),%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,118,254,255,255              ; jb            24f7 <_sk_load_tables_u16_be_sse2+0x23>
+  DB  15,130,118,254,255,255              ; jb            251f <_sk_load_tables_u16_be_sse2+0x23>
   DB  242,67,15,16,76,81,16               ; movsd         0x10(%r9,%r10,2),%xmm1
-  DB  233,106,254,255,255                 ; jmpq          24f7 <_sk_load_tables_u16_be_sse2+0x23>
+  DB  233,106,254,255,255                 ; jmpq          251f <_sk_load_tables_u16_be_sse2+0x23>
 
 PUBLIC _sk_load_tables_rgb_u16_be_sse2
 _sk_load_tables_rgb_u16_be_sse2 LABEL PROC
@@ -24934,7 +25019,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  76,141,20,82                        ; lea           (%rdx,%rdx,2),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,84,1,0,0                     ; jne           27f3 <_sk_load_tables_rgb_u16_be_sse2+0x166>
+  DB  15,133,84,1,0,0                     ; jne           281b <_sk_load_tables_rgb_u16_be_sse2+0x166>
   DB  243,71,15,111,28,81                 ; movdqu        (%r9,%r10,2),%xmm11
   DB  243,67,15,111,76,81,8               ; movdqu        0x8(%r9,%r10,2),%xmm1
   DB  102,15,115,217,4                    ; psrldq        $0x4,%xmm1
@@ -24949,7 +25034,7 @@
   DB  102,68,15,97,208                    ; punpcklwd     %xmm0,%xmm10
   DB  102,65,15,111,195                   ; movdqa        %xmm11,%xmm0
   DB  102,65,15,97,194                    ; punpcklwd     %xmm10,%xmm0
-  DB  102,68,15,111,5,201,64,0,0          ; movdqa        0x40c9(%rip),%xmm8        # 67b0 <_sk_callback_sse2+0x6a5>
+  DB  102,68,15,111,5,225,64,0,0          ; movdqa        0x40e1(%rip),%xmm8        # 67f0 <_sk_callback_sse2+0x6bd>
   DB  102,15,112,200,78                   ; pshufd        $0x4e,%xmm0,%xmm1
   DB  102,65,15,219,192                   ; pand          %xmm8,%xmm0
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
@@ -25005,7 +25090,7 @@
   DB  15,20,211                           ; unpcklps      %xmm3,%xmm2
   DB  65,15,20,208                        ; unpcklps      %xmm8,%xmm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,212,63,0,0                 ; movaps        0x3fd4(%rip),%xmm3        # 67c0 <_sk_callback_sse2+0x6b5>
+  DB  15,40,29,236,63,0,0                 ; movaps        0x3fec(%rip),%xmm3        # 6800 <_sk_callback_sse2+0x6cd>
   DB  91                                  ; pop           %rbx
   DB  65,94                               ; pop           %r14
   DB  65,95                               ; pop           %r15
@@ -25014,21 +25099,21 @@
   DB  102,71,15,196,92,81,4,2             ; pinsrw        $0x2,0x4(%r9,%r10,2),%xmm11
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,14                              ; jne           2819 <_sk_load_tables_rgb_u16_be_sse2+0x18c>
+  DB  117,14                              ; jne           2841 <_sk_load_tables_rgb_u16_be_sse2+0x18c>
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  102,69,15,239,210                   ; pxor          %xmm10,%xmm10
-  DB  233,172,254,255,255                 ; jmpq          26c5 <_sk_load_tables_rgb_u16_be_sse2+0x38>
+  DB  233,172,254,255,255                 ; jmpq          26ed <_sk_load_tables_rgb_u16_be_sse2+0x38>
   DB  102,71,15,110,84,81,6               ; movd          0x6(%r9,%r10,2),%xmm10
   DB  102,71,15,196,84,81,10,2            ; pinsrw        $0x2,0xa(%r9,%r10,2),%xmm10
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,24                              ; jb            284a <_sk_load_tables_rgb_u16_be_sse2+0x1bd>
+  DB  114,24                              ; jb            2872 <_sk_load_tables_rgb_u16_be_sse2+0x1bd>
   DB  102,67,15,110,76,81,12              ; movd          0xc(%r9,%r10,2),%xmm1
   DB  102,67,15,196,76,81,16,2            ; pinsrw        $0x2,0x10(%r9,%r10,2),%xmm1
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
-  DB  233,123,254,255,255                 ; jmpq          26c5 <_sk_load_tables_rgb_u16_be_sse2+0x38>
+  DB  233,123,254,255,255                 ; jmpq          26ed <_sk_load_tables_rgb_u16_be_sse2+0x38>
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,114,254,255,255                 ; jmpq          26c5 <_sk_load_tables_rgb_u16_be_sse2+0x38>
+  DB  233,114,254,255,255                 ; jmpq          26ed <_sk_load_tables_rgb_u16_be_sse2+0x38>
 
 PUBLIC _sk_byte_tables_sse2
 _sk_byte_tables_sse2 LABEL PROC
@@ -25037,7 +25122,7 @@
   DB  65,86                               ; push          %r14
   DB  83                                  ; push          %rbx
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,109,63,0,0               ; movaps        0x3f6d(%rip),%xmm8        # 67d0 <_sk_callback_sse2+0x6c5>
+  DB  68,15,40,5,133,63,0,0               ; movaps        0x3f85(%rip),%xmm8        # 6810 <_sk_callback_sse2+0x6dd>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,91,192                       ; cvtps2dq      %xmm0,%xmm0
   DB  102,73,15,126,193                   ; movq          %xmm0,%r9
@@ -25065,7 +25150,7 @@
   DB  102,65,15,96,193                    ; punpcklbw     %xmm9,%xmm0
   DB  102,65,15,97,193                    ; punpcklwd     %xmm9,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,21,7,63,0,0                ; movaps        0x3f07(%rip),%xmm10        # 67e0 <_sk_callback_sse2+0x6d5>
+  DB  68,15,40,21,31,63,0,0               ; movaps        0x3f1f(%rip),%xmm10        # 6820 <_sk_callback_sse2+0x6ed>
   DB  65,15,89,194                        ; mulps         %xmm10,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,91,201                       ; cvtps2dq      %xmm1,%xmm1
@@ -25184,7 +25269,7 @@
   DB  102,65,15,96,193                    ; punpcklbw     %xmm9,%xmm0
   DB  102,65,15,97,193                    ; punpcklwd     %xmm9,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,21,79,61,0,0               ; movaps        0x3d4f(%rip),%xmm10        # 67f0 <_sk_callback_sse2+0x6e5>
+  DB  68,15,40,21,103,61,0,0              ; movaps        0x3d67(%rip),%xmm10        # 6830 <_sk_callback_sse2+0x6fd>
   DB  65,15,89,194                        ; mulps         %xmm10,%xmm0
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
   DB  102,15,91,201                       ; cvtps2dq      %xmm1,%xmm1
@@ -25381,15 +25466,15 @@
   DB  69,15,88,209                        ; addps         %xmm9,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,202                        ; cvtdq2ps      %xmm10,%xmm9
-  DB  68,15,89,13,131,58,0,0              ; mulps         0x3a83(%rip),%xmm9        # 6800 <_sk_callback_sse2+0x6f5>
-  DB  68,15,84,21,139,58,0,0              ; andps         0x3a8b(%rip),%xmm10        # 6810 <_sk_callback_sse2+0x705>
-  DB  68,15,86,21,147,58,0,0              ; orps          0x3a93(%rip),%xmm10        # 6820 <_sk_callback_sse2+0x715>
-  DB  68,15,88,13,155,58,0,0              ; addps         0x3a9b(%rip),%xmm9        # 6830 <_sk_callback_sse2+0x725>
-  DB  68,15,40,37,163,58,0,0              ; movaps        0x3aa3(%rip),%xmm12        # 6840 <_sk_callback_sse2+0x735>
+  DB  68,15,89,13,155,58,0,0              ; mulps         0x3a9b(%rip),%xmm9        # 6840 <_sk_callback_sse2+0x70d>
+  DB  68,15,84,21,163,58,0,0              ; andps         0x3aa3(%rip),%xmm10        # 6850 <_sk_callback_sse2+0x71d>
+  DB  68,15,86,21,171,58,0,0              ; orps          0x3aab(%rip),%xmm10        # 6860 <_sk_callback_sse2+0x72d>
+  DB  68,15,88,13,179,58,0,0              ; addps         0x3ab3(%rip),%xmm9        # 6870 <_sk_callback_sse2+0x73d>
+  DB  68,15,40,37,187,58,0,0              ; movaps        0x3abb(%rip),%xmm12        # 6880 <_sk_callback_sse2+0x74d>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,88,21,163,58,0,0              ; addps         0x3aa3(%rip),%xmm10        # 6850 <_sk_callback_sse2+0x745>
-  DB  68,15,40,37,171,58,0,0              ; movaps        0x3aab(%rip),%xmm12        # 6860 <_sk_callback_sse2+0x755>
+  DB  68,15,88,21,187,58,0,0              ; addps         0x3abb(%rip),%xmm10        # 6890 <_sk_callback_sse2+0x75d>
+  DB  68,15,40,37,195,58,0,0              ; movaps        0x3ac3(%rip),%xmm12        # 68a0 <_sk_callback_sse2+0x76d>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
@@ -25397,22 +25482,22 @@
   DB  69,15,91,226                        ; cvtdq2ps      %xmm10,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,194,236,1                     ; cmpltps       %xmm12,%xmm13
-  DB  68,15,40,21,149,58,0,0              ; movaps        0x3a95(%rip),%xmm10        # 6870 <_sk_callback_sse2+0x765>
+  DB  68,15,40,21,173,58,0,0              ; movaps        0x3aad(%rip),%xmm10        # 68b0 <_sk_callback_sse2+0x77d>
   DB  69,15,84,234                        ; andps         %xmm10,%xmm13
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,92,236                        ; subps         %xmm12,%xmm13
-  DB  68,15,88,13,137,58,0,0              ; addps         0x3a89(%rip),%xmm9        # 6880 <_sk_callback_sse2+0x775>
-  DB  68,15,40,37,145,58,0,0              ; movaps        0x3a91(%rip),%xmm12        # 6890 <_sk_callback_sse2+0x785>
+  DB  68,15,88,13,161,58,0,0              ; addps         0x3aa1(%rip),%xmm9        # 68c0 <_sk_callback_sse2+0x78d>
+  DB  68,15,40,37,169,58,0,0              ; movaps        0x3aa9(%rip),%xmm12        # 68d0 <_sk_callback_sse2+0x79d>
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,40,37,145,58,0,0              ; movaps        0x3a91(%rip),%xmm12        # 68a0 <_sk_callback_sse2+0x795>
+  DB  68,15,40,37,169,58,0,0              ; movaps        0x3aa9(%rip),%xmm12        # 68e0 <_sk_callback_sse2+0x7ad>
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
-  DB  68,15,40,45,149,58,0,0              ; movaps        0x3a95(%rip),%xmm13        # 68b0 <_sk_callback_sse2+0x7a5>
+  DB  68,15,40,45,173,58,0,0              ; movaps        0x3aad(%rip),%xmm13        # 68f0 <_sk_callback_sse2+0x7bd>
   DB  69,15,94,236                        ; divps         %xmm12,%xmm13
   DB  69,15,88,233                        ; addps         %xmm9,%xmm13
-  DB  68,15,89,45,149,58,0,0              ; mulps         0x3a95(%rip),%xmm13        # 68c0 <_sk_callback_sse2+0x7b5>
+  DB  68,15,89,45,173,58,0,0              ; mulps         0x3aad(%rip),%xmm13        # 6900 <_sk_callback_sse2+0x7cd>
   DB  102,69,15,91,205                    ; cvtps2dq      %xmm13,%xmm9
   DB  243,68,15,16,96,20                  ; movss         0x14(%rax),%xmm12
   DB  69,15,198,228,0                     ; shufps        $0x0,%xmm12,%xmm12
@@ -25446,15 +25531,15 @@
   DB  69,15,88,209                        ; addps         %xmm9,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,202                        ; cvtdq2ps      %xmm10,%xmm9
-  DB  68,15,89,13,21,58,0,0               ; mulps         0x3a15(%rip),%xmm9        # 68d0 <_sk_callback_sse2+0x7c5>
-  DB  68,15,84,21,29,58,0,0               ; andps         0x3a1d(%rip),%xmm10        # 68e0 <_sk_callback_sse2+0x7d5>
-  DB  68,15,86,21,37,58,0,0               ; orps          0x3a25(%rip),%xmm10        # 68f0 <_sk_callback_sse2+0x7e5>
-  DB  68,15,88,13,45,58,0,0               ; addps         0x3a2d(%rip),%xmm9        # 6900 <_sk_callback_sse2+0x7f5>
-  DB  68,15,40,37,53,58,0,0               ; movaps        0x3a35(%rip),%xmm12        # 6910 <_sk_callback_sse2+0x805>
+  DB  68,15,89,13,45,58,0,0               ; mulps         0x3a2d(%rip),%xmm9        # 6910 <_sk_callback_sse2+0x7dd>
+  DB  68,15,84,21,53,58,0,0               ; andps         0x3a35(%rip),%xmm10        # 6920 <_sk_callback_sse2+0x7ed>
+  DB  68,15,86,21,61,58,0,0               ; orps          0x3a3d(%rip),%xmm10        # 6930 <_sk_callback_sse2+0x7fd>
+  DB  68,15,88,13,69,58,0,0               ; addps         0x3a45(%rip),%xmm9        # 6940 <_sk_callback_sse2+0x80d>
+  DB  68,15,40,37,77,58,0,0               ; movaps        0x3a4d(%rip),%xmm12        # 6950 <_sk_callback_sse2+0x81d>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,88,21,53,58,0,0               ; addps         0x3a35(%rip),%xmm10        # 6920 <_sk_callback_sse2+0x815>
-  DB  68,15,40,37,61,58,0,0               ; movaps        0x3a3d(%rip),%xmm12        # 6930 <_sk_callback_sse2+0x825>
+  DB  68,15,88,21,77,58,0,0               ; addps         0x3a4d(%rip),%xmm10        # 6960 <_sk_callback_sse2+0x82d>
+  DB  68,15,40,37,85,58,0,0               ; movaps        0x3a55(%rip),%xmm12        # 6970 <_sk_callback_sse2+0x83d>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
@@ -25462,22 +25547,22 @@
   DB  69,15,91,226                        ; cvtdq2ps      %xmm10,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,194,236,1                     ; cmpltps       %xmm12,%xmm13
-  DB  68,15,40,21,39,58,0,0               ; movaps        0x3a27(%rip),%xmm10        # 6940 <_sk_callback_sse2+0x835>
+  DB  68,15,40,21,63,58,0,0               ; movaps        0x3a3f(%rip),%xmm10        # 6980 <_sk_callback_sse2+0x84d>
   DB  69,15,84,234                        ; andps         %xmm10,%xmm13
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,92,236                        ; subps         %xmm12,%xmm13
-  DB  68,15,88,13,27,58,0,0               ; addps         0x3a1b(%rip),%xmm9        # 6950 <_sk_callback_sse2+0x845>
-  DB  68,15,40,37,35,58,0,0               ; movaps        0x3a23(%rip),%xmm12        # 6960 <_sk_callback_sse2+0x855>
+  DB  68,15,88,13,51,58,0,0               ; addps         0x3a33(%rip),%xmm9        # 6990 <_sk_callback_sse2+0x85d>
+  DB  68,15,40,37,59,58,0,0               ; movaps        0x3a3b(%rip),%xmm12        # 69a0 <_sk_callback_sse2+0x86d>
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,40,37,35,58,0,0               ; movaps        0x3a23(%rip),%xmm12        # 6970 <_sk_callback_sse2+0x865>
+  DB  68,15,40,37,59,58,0,0               ; movaps        0x3a3b(%rip),%xmm12        # 69b0 <_sk_callback_sse2+0x87d>
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
-  DB  68,15,40,45,39,58,0,0               ; movaps        0x3a27(%rip),%xmm13        # 6980 <_sk_callback_sse2+0x875>
+  DB  68,15,40,45,63,58,0,0               ; movaps        0x3a3f(%rip),%xmm13        # 69c0 <_sk_callback_sse2+0x88d>
   DB  69,15,94,236                        ; divps         %xmm12,%xmm13
   DB  69,15,88,233                        ; addps         %xmm9,%xmm13
-  DB  68,15,89,45,39,58,0,0               ; mulps         0x3a27(%rip),%xmm13        # 6990 <_sk_callback_sse2+0x885>
+  DB  68,15,89,45,63,58,0,0               ; mulps         0x3a3f(%rip),%xmm13        # 69d0 <_sk_callback_sse2+0x89d>
   DB  102,69,15,91,205                    ; cvtps2dq      %xmm13,%xmm9
   DB  243,68,15,16,96,20                  ; movss         0x14(%rax),%xmm12
   DB  69,15,198,228,0                     ; shufps        $0x0,%xmm12,%xmm12
@@ -25511,15 +25596,15 @@
   DB  69,15,88,209                        ; addps         %xmm9,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,202                        ; cvtdq2ps      %xmm10,%xmm9
-  DB  68,15,89,13,167,57,0,0              ; mulps         0x39a7(%rip),%xmm9        # 69a0 <_sk_callback_sse2+0x895>
-  DB  68,15,84,21,175,57,0,0              ; andps         0x39af(%rip),%xmm10        # 69b0 <_sk_callback_sse2+0x8a5>
-  DB  68,15,86,21,183,57,0,0              ; orps          0x39b7(%rip),%xmm10        # 69c0 <_sk_callback_sse2+0x8b5>
-  DB  68,15,88,13,191,57,0,0              ; addps         0x39bf(%rip),%xmm9        # 69d0 <_sk_callback_sse2+0x8c5>
-  DB  68,15,40,37,199,57,0,0              ; movaps        0x39c7(%rip),%xmm12        # 69e0 <_sk_callback_sse2+0x8d5>
+  DB  68,15,89,13,191,57,0,0              ; mulps         0x39bf(%rip),%xmm9        # 69e0 <_sk_callback_sse2+0x8ad>
+  DB  68,15,84,21,199,57,0,0              ; andps         0x39c7(%rip),%xmm10        # 69f0 <_sk_callback_sse2+0x8bd>
+  DB  68,15,86,21,207,57,0,0              ; orps          0x39cf(%rip),%xmm10        # 6a00 <_sk_callback_sse2+0x8cd>
+  DB  68,15,88,13,215,57,0,0              ; addps         0x39d7(%rip),%xmm9        # 6a10 <_sk_callback_sse2+0x8dd>
+  DB  68,15,40,37,223,57,0,0              ; movaps        0x39df(%rip),%xmm12        # 6a20 <_sk_callback_sse2+0x8ed>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,88,21,199,57,0,0              ; addps         0x39c7(%rip),%xmm10        # 69f0 <_sk_callback_sse2+0x8e5>
-  DB  68,15,40,37,207,57,0,0              ; movaps        0x39cf(%rip),%xmm12        # 6a00 <_sk_callback_sse2+0x8f5>
+  DB  68,15,88,21,223,57,0,0              ; addps         0x39df(%rip),%xmm10        # 6a30 <_sk_callback_sse2+0x8fd>
+  DB  68,15,40,37,231,57,0,0              ; movaps        0x39e7(%rip),%xmm12        # 6a40 <_sk_callback_sse2+0x90d>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
@@ -25527,22 +25612,22 @@
   DB  69,15,91,226                        ; cvtdq2ps      %xmm10,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,194,236,1                     ; cmpltps       %xmm12,%xmm13
-  DB  68,15,40,21,185,57,0,0              ; movaps        0x39b9(%rip),%xmm10        # 6a10 <_sk_callback_sse2+0x905>
+  DB  68,15,40,21,209,57,0,0              ; movaps        0x39d1(%rip),%xmm10        # 6a50 <_sk_callback_sse2+0x91d>
   DB  69,15,84,234                        ; andps         %xmm10,%xmm13
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,92,236                        ; subps         %xmm12,%xmm13
-  DB  68,15,88,13,173,57,0,0              ; addps         0x39ad(%rip),%xmm9        # 6a20 <_sk_callback_sse2+0x915>
-  DB  68,15,40,37,181,57,0,0              ; movaps        0x39b5(%rip),%xmm12        # 6a30 <_sk_callback_sse2+0x925>
+  DB  68,15,88,13,197,57,0,0              ; addps         0x39c5(%rip),%xmm9        # 6a60 <_sk_callback_sse2+0x92d>
+  DB  68,15,40,37,205,57,0,0              ; movaps        0x39cd(%rip),%xmm12        # 6a70 <_sk_callback_sse2+0x93d>
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,40,37,181,57,0,0              ; movaps        0x39b5(%rip),%xmm12        # 6a40 <_sk_callback_sse2+0x935>
+  DB  68,15,40,37,205,57,0,0              ; movaps        0x39cd(%rip),%xmm12        # 6a80 <_sk_callback_sse2+0x94d>
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
-  DB  68,15,40,45,185,57,0,0              ; movaps        0x39b9(%rip),%xmm13        # 6a50 <_sk_callback_sse2+0x945>
+  DB  68,15,40,45,209,57,0,0              ; movaps        0x39d1(%rip),%xmm13        # 6a90 <_sk_callback_sse2+0x95d>
   DB  69,15,94,236                        ; divps         %xmm12,%xmm13
   DB  69,15,88,233                        ; addps         %xmm9,%xmm13
-  DB  68,15,89,45,185,57,0,0              ; mulps         0x39b9(%rip),%xmm13        # 6a60 <_sk_callback_sse2+0x955>
+  DB  68,15,89,45,209,57,0,0              ; mulps         0x39d1(%rip),%xmm13        # 6aa0 <_sk_callback_sse2+0x96d>
   DB  102,69,15,91,205                    ; cvtps2dq      %xmm13,%xmm9
   DB  243,68,15,16,96,20                  ; movss         0x14(%rax),%xmm12
   DB  69,15,198,228,0                     ; shufps        $0x0,%xmm12,%xmm12
@@ -25576,15 +25661,15 @@
   DB  69,15,88,209                        ; addps         %xmm9,%xmm10
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,91,202                        ; cvtdq2ps      %xmm10,%xmm9
-  DB  68,15,89,13,57,57,0,0               ; mulps         0x3939(%rip),%xmm9        # 6a70 <_sk_callback_sse2+0x965>
-  DB  68,15,84,21,65,57,0,0               ; andps         0x3941(%rip),%xmm10        # 6a80 <_sk_callback_sse2+0x975>
-  DB  68,15,86,21,73,57,0,0               ; orps          0x3949(%rip),%xmm10        # 6a90 <_sk_callback_sse2+0x985>
-  DB  68,15,88,13,81,57,0,0               ; addps         0x3951(%rip),%xmm9        # 6aa0 <_sk_callback_sse2+0x995>
-  DB  68,15,40,37,89,57,0,0               ; movaps        0x3959(%rip),%xmm12        # 6ab0 <_sk_callback_sse2+0x9a5>
+  DB  68,15,89,13,81,57,0,0               ; mulps         0x3951(%rip),%xmm9        # 6ab0 <_sk_callback_sse2+0x97d>
+  DB  68,15,84,21,89,57,0,0               ; andps         0x3959(%rip),%xmm10        # 6ac0 <_sk_callback_sse2+0x98d>
+  DB  68,15,86,21,97,57,0,0               ; orps          0x3961(%rip),%xmm10        # 6ad0 <_sk_callback_sse2+0x99d>
+  DB  68,15,88,13,105,57,0,0              ; addps         0x3969(%rip),%xmm9        # 6ae0 <_sk_callback_sse2+0x9ad>
+  DB  68,15,40,37,113,57,0,0              ; movaps        0x3971(%rip),%xmm12        # 6af0 <_sk_callback_sse2+0x9bd>
   DB  69,15,89,226                        ; mulps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,88,21,89,57,0,0               ; addps         0x3959(%rip),%xmm10        # 6ac0 <_sk_callback_sse2+0x9b5>
-  DB  68,15,40,37,97,57,0,0               ; movaps        0x3961(%rip),%xmm12        # 6ad0 <_sk_callback_sse2+0x9c5>
+  DB  68,15,88,21,113,57,0,0              ; addps         0x3971(%rip),%xmm10        # 6b00 <_sk_callback_sse2+0x9cd>
+  DB  68,15,40,37,121,57,0,0              ; movaps        0x3979(%rip),%xmm12        # 6b10 <_sk_callback_sse2+0x9dd>
   DB  69,15,94,226                        ; divps         %xmm10,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
   DB  69,15,89,203                        ; mulps         %xmm11,%xmm9
@@ -25592,22 +25677,22 @@
   DB  69,15,91,226                        ; cvtdq2ps      %xmm10,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,194,236,1                     ; cmpltps       %xmm12,%xmm13
-  DB  68,15,40,21,75,57,0,0               ; movaps        0x394b(%rip),%xmm10        # 6ae0 <_sk_callback_sse2+0x9d5>
+  DB  68,15,40,21,99,57,0,0               ; movaps        0x3963(%rip),%xmm10        # 6b20 <_sk_callback_sse2+0x9ed>
   DB  69,15,84,234                        ; andps         %xmm10,%xmm13
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
   DB  69,15,40,233                        ; movaps        %xmm9,%xmm13
   DB  69,15,92,236                        ; subps         %xmm12,%xmm13
-  DB  68,15,88,13,63,57,0,0               ; addps         0x393f(%rip),%xmm9        # 6af0 <_sk_callback_sse2+0x9e5>
-  DB  68,15,40,37,71,57,0,0               ; movaps        0x3947(%rip),%xmm12        # 6b00 <_sk_callback_sse2+0x9f5>
+  DB  68,15,88,13,87,57,0,0               ; addps         0x3957(%rip),%xmm9        # 6b30 <_sk_callback_sse2+0x9fd>
+  DB  68,15,40,37,95,57,0,0               ; movaps        0x395f(%rip),%xmm12        # 6b40 <_sk_callback_sse2+0xa0d>
   DB  69,15,89,229                        ; mulps         %xmm13,%xmm12
   DB  69,15,92,204                        ; subps         %xmm12,%xmm9
-  DB  68,15,40,37,71,57,0,0               ; movaps        0x3947(%rip),%xmm12        # 6b10 <_sk_callback_sse2+0xa05>
+  DB  68,15,40,37,95,57,0,0               ; movaps        0x395f(%rip),%xmm12        # 6b50 <_sk_callback_sse2+0xa1d>
   DB  69,15,92,229                        ; subps         %xmm13,%xmm12
-  DB  68,15,40,45,75,57,0,0               ; movaps        0x394b(%rip),%xmm13        # 6b20 <_sk_callback_sse2+0xa15>
+  DB  68,15,40,45,99,57,0,0               ; movaps        0x3963(%rip),%xmm13        # 6b60 <_sk_callback_sse2+0xa2d>
   DB  69,15,94,236                        ; divps         %xmm12,%xmm13
   DB  69,15,88,233                        ; addps         %xmm9,%xmm13
-  DB  68,15,89,45,75,57,0,0               ; mulps         0x394b(%rip),%xmm13        # 6b30 <_sk_callback_sse2+0xa25>
+  DB  68,15,89,45,99,57,0,0               ; mulps         0x3963(%rip),%xmm13        # 6b70 <_sk_callback_sse2+0xa3d>
   DB  102,69,15,91,205                    ; cvtps2dq      %xmm13,%xmm9
   DB  243,68,15,16,96,20                  ; movss         0x14(%rax),%xmm12
   DB  69,15,198,228,0                     ; shufps        $0x0,%xmm12,%xmm12
@@ -25622,29 +25707,29 @@
 
 PUBLIC _sk_lab_to_xyz_sse2
 _sk_lab_to_xyz_sse2 LABEL PROC
-  DB  15,89,5,40,57,0,0                   ; mulps         0x3928(%rip),%xmm0        # 6b40 <_sk_callback_sse2+0xa35>
-  DB  68,15,40,5,48,57,0,0                ; movaps        0x3930(%rip),%xmm8        # 6b50 <_sk_callback_sse2+0xa45>
+  DB  15,89,5,64,57,0,0                   ; mulps         0x3940(%rip),%xmm0        # 6b80 <_sk_callback_sse2+0xa4d>
+  DB  68,15,40,5,72,57,0,0                ; movaps        0x3948(%rip),%xmm8        # 6b90 <_sk_callback_sse2+0xa5d>
   DB  65,15,89,200                        ; mulps         %xmm8,%xmm1
-  DB  68,15,40,13,52,57,0,0               ; movaps        0x3934(%rip),%xmm9        # 6b60 <_sk_callback_sse2+0xa55>
+  DB  68,15,40,13,76,57,0,0               ; movaps        0x394c(%rip),%xmm9        # 6ba0 <_sk_callback_sse2+0xa6d>
   DB  65,15,88,201                        ; addps         %xmm9,%xmm1
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  65,15,88,209                        ; addps         %xmm9,%xmm2
-  DB  15,88,5,49,57,0,0                   ; addps         0x3931(%rip),%xmm0        # 6b70 <_sk_callback_sse2+0xa65>
-  DB  15,89,5,58,57,0,0                   ; mulps         0x393a(%rip),%xmm0        # 6b80 <_sk_callback_sse2+0xa75>
-  DB  15,89,13,67,57,0,0                  ; mulps         0x3943(%rip),%xmm1        # 6b90 <_sk_callback_sse2+0xa85>
+  DB  15,88,5,73,57,0,0                   ; addps         0x3949(%rip),%xmm0        # 6bb0 <_sk_callback_sse2+0xa7d>
+  DB  15,89,5,82,57,0,0                   ; mulps         0x3952(%rip),%xmm0        # 6bc0 <_sk_callback_sse2+0xa8d>
+  DB  15,89,13,91,57,0,0                  ; mulps         0x395b(%rip),%xmm1        # 6bd0 <_sk_callback_sse2+0xa9d>
   DB  15,88,200                           ; addps         %xmm0,%xmm1
-  DB  15,89,21,73,57,0,0                  ; mulps         0x3949(%rip),%xmm2        # 6ba0 <_sk_callback_sse2+0xa95>
+  DB  15,89,21,97,57,0,0                  ; mulps         0x3961(%rip),%xmm2        # 6be0 <_sk_callback_sse2+0xaad>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  68,15,92,202                        ; subps         %xmm2,%xmm9
   DB  68,15,40,225                        ; movaps        %xmm1,%xmm12
   DB  69,15,89,228                        ; mulps         %xmm12,%xmm12
   DB  68,15,89,225                        ; mulps         %xmm1,%xmm12
-  DB  15,40,21,62,57,0,0                  ; movaps        0x393e(%rip),%xmm2        # 6bb0 <_sk_callback_sse2+0xaa5>
+  DB  15,40,21,86,57,0,0                  ; movaps        0x3956(%rip),%xmm2        # 6bf0 <_sk_callback_sse2+0xabd>
   DB  68,15,40,194                        ; movaps        %xmm2,%xmm8
   DB  69,15,194,196,1                     ; cmpltps       %xmm12,%xmm8
-  DB  68,15,40,21,61,57,0,0               ; movaps        0x393d(%rip),%xmm10        # 6bc0 <_sk_callback_sse2+0xab5>
+  DB  68,15,40,21,85,57,0,0               ; movaps        0x3955(%rip),%xmm10        # 6c00 <_sk_callback_sse2+0xacd>
   DB  65,15,88,202                        ; addps         %xmm10,%xmm1
-  DB  68,15,40,29,65,57,0,0               ; movaps        0x3941(%rip),%xmm11        # 6bd0 <_sk_callback_sse2+0xac5>
+  DB  68,15,40,29,89,57,0,0               ; movaps        0x3959(%rip),%xmm11        # 6c10 <_sk_callback_sse2+0xadd>
   DB  65,15,89,203                        ; mulps         %xmm11,%xmm1
   DB  69,15,84,224                        ; andps         %xmm8,%xmm12
   DB  68,15,85,193                        ; andnps        %xmm1,%xmm8
@@ -25668,8 +25753,8 @@
   DB  15,84,194                           ; andps         %xmm2,%xmm0
   DB  65,15,85,209                        ; andnps        %xmm9,%xmm2
   DB  15,86,208                           ; orps          %xmm0,%xmm2
-  DB  68,15,89,5,241,56,0,0               ; mulps         0x38f1(%rip),%xmm8        # 6be0 <_sk_callback_sse2+0xad5>
-  DB  15,89,21,250,56,0,0                 ; mulps         0x38fa(%rip),%xmm2        # 6bf0 <_sk_callback_sse2+0xae5>
+  DB  68,15,89,5,9,57,0,0                 ; mulps         0x3909(%rip),%xmm8        # 6c20 <_sk_callback_sse2+0xaed>
+  DB  15,89,21,18,57,0,0                  ; mulps         0x3912(%rip),%xmm2        # 6c30 <_sk_callback_sse2+0xafd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -25679,13 +25764,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,46                              ; jne           3336 <_sk_load_a8_sse2+0x38>
+  DB  117,46                              ; jne           335e <_sk_load_a8_sse2+0x38>
   DB  102,65,15,110,4,18                  ; movd          (%r10,%rdx,1),%xmm0
   DB  102,15,96,192                       ; punpcklbw     %xmm0,%xmm0
   DB  102,15,97,192                       ; punpcklwd     %xmm0,%xmm0
-  DB  102,15,219,5,226,56,0,0             ; pand          0x38e2(%rip),%xmm0        # 6c00 <_sk_callback_sse2+0xaf5>
+  DB  102,15,219,5,250,56,0,0             ; pand          0x38fa(%rip),%xmm0        # 6c40 <_sk_callback_sse2+0xb0d>
   DB  15,91,216                           ; cvtdq2ps      %xmm0,%xmm3
-  DB  15,89,29,232,56,0,0                 ; mulps         0x38e8(%rip),%xmm3        # 6c10 <_sk_callback_sse2+0xb05>
+  DB  15,89,29,0,57,0,0                   ; mulps         0x3900(%rip),%xmm3        # 6c50 <_sk_callback_sse2+0xb1d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
@@ -25694,12 +25779,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,54                              ; je            3379 <_sk_load_a8_sse2+0x7b>
+  DB  116,54                              ; je            33a1 <_sk_load_a8_sse2+0x7b>
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3362 <_sk_load_a8_sse2+0x64>
+  DB  116,21                              ; je            338a <_sk_load_a8_sse2+0x64>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,195                             ; jne           3316 <_sk_load_a8_sse2+0x18>
+  DB  117,195                             ; jne           333e <_sk_load_a8_sse2+0x18>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,192,69                   ; pshufd        $0x45,%xmm0,%xmm0
@@ -25708,23 +25793,23 @@
   DB  102,15,96,200                       ; punpcklbw     %xmm0,%xmm1
   DB  102,15,97,200                       ; punpcklwd     %xmm0,%xmm1
   DB  242,15,16,193                       ; movsd         %xmm1,%xmm0
-  DB  235,157                             ; jmp           3316 <_sk_load_a8_sse2+0x18>
+  DB  235,157                             ; jmp           333e <_sk_load_a8_sse2+0x18>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
-  DB  235,146                             ; jmp           3316 <_sk_load_a8_sse2+0x18>
+  DB  235,146                             ; jmp           333e <_sk_load_a8_sse2+0x18>
 
 PUBLIC _sk_load_a8_dst_sse2
 _sk_load_a8_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,46                              ; jne           33bc <_sk_load_a8_dst_sse2+0x38>
+  DB  117,46                              ; jne           33e4 <_sk_load_a8_dst_sse2+0x38>
   DB  102,65,15,110,36,18                 ; movd          (%r10,%rdx,1),%xmm4
   DB  102,15,96,224                       ; punpcklbw     %xmm0,%xmm4
   DB  102,15,97,224                       ; punpcklwd     %xmm0,%xmm4
-  DB  102,15,219,37,124,56,0,0            ; pand          0x387c(%rip),%xmm4        # 6c20 <_sk_callback_sse2+0xb15>
+  DB  102,15,219,37,148,56,0,0            ; pand          0x3894(%rip),%xmm4        # 6c60 <_sk_callback_sse2+0xb2d>
   DB  15,91,252                           ; cvtdq2ps      %xmm4,%xmm7
-  DB  15,89,61,130,56,0,0                 ; mulps         0x3882(%rip),%xmm7        # 6c30 <_sk_callback_sse2+0xb25>
+  DB  15,89,61,154,56,0,0                 ; mulps         0x389a(%rip),%xmm7        # 6c70 <_sk_callback_sse2+0xb3d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
   DB  102,15,87,237                       ; xorpd         %xmm5,%xmm5
@@ -25733,12 +25818,12 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,54                              ; je            33ff <_sk_load_a8_dst_sse2+0x7b>
+  DB  116,54                              ; je            3427 <_sk_load_a8_dst_sse2+0x7b>
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            33e8 <_sk_load_a8_dst_sse2+0x64>
+  DB  116,21                              ; je            3410 <_sk_load_a8_dst_sse2+0x64>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,195                             ; jne           339c <_sk_load_a8_dst_sse2+0x18>
+  DB  117,195                             ; jne           33c4 <_sk_load_a8_dst_sse2+0x18>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,228,69                   ; pshufd        $0x45,%xmm4,%xmm4
@@ -25747,10 +25832,10 @@
   DB  102,15,96,232                       ; punpcklbw     %xmm0,%xmm5
   DB  102,15,97,232                       ; punpcklwd     %xmm0,%xmm5
   DB  242,15,16,229                       ; movsd         %xmm5,%xmm4
-  DB  235,157                             ; jmp           339c <_sk_load_a8_dst_sse2+0x18>
+  DB  235,157                             ; jmp           33c4 <_sk_load_a8_dst_sse2+0x18>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
-  DB  235,146                             ; jmp           339c <_sk_load_a8_dst_sse2+0x18>
+  DB  235,146                             ; jmp           33c4 <_sk_load_a8_dst_sse2+0x18>
 
 PUBLIC _sk_gather_a8_sse2
 _sk_gather_a8_sse2 LABEL PROC
@@ -25790,7 +25875,7 @@
   DB  102,15,96,193                       ; punpcklbw     %xmm1,%xmm0
   DB  102,15,97,193                       ; punpcklwd     %xmm1,%xmm0
   DB  15,91,216                           ; cvtdq2ps      %xmm0,%xmm3
-  DB  15,89,29,163,55,0,0                 ; mulps         0x37a3(%rip),%xmm3        # 6c40 <_sk_callback_sse2+0xb35>
+  DB  15,89,29,187,55,0,0                 ; mulps         0x37bb(%rip),%xmm3        # 6c80 <_sk_callback_sse2+0xb4d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
@@ -25804,7 +25889,7 @@
   DB  72,131,236,40                       ; sub           $0x28,%rsp
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  68,15,40,5,145,55,0,0               ; movaps        0x3791(%rip),%xmm8        # 6c50 <_sk_callback_sse2+0xb45>
+  DB  68,15,40,5,169,55,0,0               ; movaps        0x37a9(%rip),%xmm8        # 6c90 <_sk_callback_sse2+0xb5d>
   DB  68,15,89,195                        ; mulps         %xmm3,%xmm8
   DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
   DB  102,65,15,114,240,16                ; pslld         $0x10,%xmm8
@@ -25812,7 +25897,7 @@
   DB  102,69,15,107,192                   ; packssdw      %xmm8,%xmm8
   DB  102,69,15,103,192                   ; packuswb      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,17                              ; jne           34f4 <_sk_store_a8_sse2+0x46>
+  DB  117,17                              ; jne           351c <_sk_store_a8_sse2+0x46>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  65,137,4,18                         ; mov           %eax,(%r10,%rdx,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -25823,51 +25908,51 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,59                              ; je            3546 <_sk_store_a8_sse2+0x98>
+  DB  116,59                              ; je            356e <_sk_store_a8_sse2+0x98>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,22                              ; je            3527 <_sk_store_a8_sse2+0x79>
+  DB  116,22                              ; je            354f <_sk_store_a8_sse2+0x79>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,213                             ; jne           34ec <_sk_store_a8_sse2+0x3e>
+  DB  117,213                             ; jne           3514 <_sk_store_a8_sse2+0x3e>
   DB  102,68,15,127,68,36,16              ; movdqa        %xmm8,0x10(%rsp)
   DB  138,68,36,24                        ; mov           0x18(%rsp),%al
   DB  65,136,68,18,2                      ; mov           %al,0x2(%r10,%rdx,1)
-  DB  102,68,15,219,5,48,55,0,0           ; pand          0x3730(%rip),%xmm8        # 6c60 <_sk_callback_sse2+0xb55>
+  DB  102,68,15,219,5,72,55,0,0           ; pand          0x3748(%rip),%xmm8        # 6ca0 <_sk_callback_sse2+0xb6d>
   DB  102,69,15,103,192                   ; packuswb      %xmm8,%xmm8
   DB  102,69,15,103,192                   ; packuswb      %xmm8,%xmm8
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  102,65,137,4,18                     ; mov           %ax,(%r10,%rdx,1)
-  DB  235,166                             ; jmp           34ec <_sk_store_a8_sse2+0x3e>
+  DB  235,166                             ; jmp           3514 <_sk_store_a8_sse2+0x3e>
   DB  102,68,15,127,4,36                  ; movdqa        %xmm8,(%rsp)
   DB  138,4,36                            ; mov           (%rsp),%al
   DB  65,136,4,18                         ; mov           %al,(%r10,%rdx,1)
-  DB  235,151                             ; jmp           34ec <_sk_store_a8_sse2+0x3e>
+  DB  235,151                             ; jmp           3514 <_sk_store_a8_sse2+0x3e>
 
 PUBLIC _sk_load_g8_sse2
 _sk_load_g8_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,49                              ; jne           3590 <_sk_load_g8_sse2+0x3b>
+  DB  117,49                              ; jne           35b8 <_sk_load_g8_sse2+0x3b>
   DB  102,65,15,110,4,18                  ; movd          (%r10,%rdx,1),%xmm0
   DB  102,15,96,192                       ; punpcklbw     %xmm0,%xmm0
   DB  102,15,97,192                       ; punpcklwd     %xmm0,%xmm0
-  DB  102,15,219,5,251,54,0,0             ; pand          0x36fb(%rip),%xmm0        # 6c70 <_sk_callback_sse2+0xb65>
+  DB  102,15,219,5,19,55,0,0              ; pand          0x3713(%rip),%xmm0        # 6cb0 <_sk_callback_sse2+0xb7d>
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,1,55,0,0                    ; mulps         0x3701(%rip),%xmm0        # 6c80 <_sk_callback_sse2+0xb75>
+  DB  15,89,5,25,55,0,0                   ; mulps         0x3719(%rip),%xmm0        # 6cc0 <_sk_callback_sse2+0xb8d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,8,55,0,0                   ; movaps        0x3708(%rip),%xmm3        # 6c90 <_sk_callback_sse2+0xb85>
+  DB  15,40,29,32,55,0,0                  ; movaps        0x3720(%rip),%xmm3        # 6cd0 <_sk_callback_sse2+0xb9d>
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,54                              ; je            35d3 <_sk_load_g8_sse2+0x7e>
+  DB  116,54                              ; je            35fb <_sk_load_g8_sse2+0x7e>
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            35bc <_sk_load_g8_sse2+0x67>
+  DB  116,21                              ; je            35e4 <_sk_load_g8_sse2+0x67>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,192                             ; jne           356d <_sk_load_g8_sse2+0x18>
+  DB  117,192                             ; jne           3595 <_sk_load_g8_sse2+0x18>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,192,69                   ; pshufd        $0x45,%xmm0,%xmm0
@@ -25876,37 +25961,37 @@
   DB  102,15,96,200                       ; punpcklbw     %xmm0,%xmm1
   DB  102,15,97,200                       ; punpcklwd     %xmm0,%xmm1
   DB  242,15,16,193                       ; movsd         %xmm1,%xmm0
-  DB  235,154                             ; jmp           356d <_sk_load_g8_sse2+0x18>
+  DB  235,154                             ; jmp           3595 <_sk_load_g8_sse2+0x18>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
-  DB  235,143                             ; jmp           356d <_sk_load_g8_sse2+0x18>
+  DB  235,143                             ; jmp           3595 <_sk_load_g8_sse2+0x18>
 
 PUBLIC _sk_load_g8_dst_sse2
 _sk_load_g8_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,49                              ; jne           3619 <_sk_load_g8_dst_sse2+0x3b>
+  DB  117,49                              ; jne           3641 <_sk_load_g8_dst_sse2+0x3b>
   DB  102,65,15,110,36,18                 ; movd          (%r10,%rdx,1),%xmm4
   DB  102,15,96,224                       ; punpcklbw     %xmm0,%xmm4
   DB  102,15,97,224                       ; punpcklwd     %xmm0,%xmm4
-  DB  102,15,219,37,162,54,0,0            ; pand          0x36a2(%rip),%xmm4        # 6ca0 <_sk_callback_sse2+0xb95>
+  DB  102,15,219,37,186,54,0,0            ; pand          0x36ba(%rip),%xmm4        # 6ce0 <_sk_callback_sse2+0xbad>
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  15,89,37,168,54,0,0                 ; mulps         0x36a8(%rip),%xmm4        # 6cb0 <_sk_callback_sse2+0xba5>
+  DB  15,89,37,192,54,0,0                 ; mulps         0x36c0(%rip),%xmm4        # 6cf0 <_sk_callback_sse2+0xbbd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,61,175,54,0,0                 ; movaps        0x36af(%rip),%xmm7        # 6cc0 <_sk_callback_sse2+0xbb5>
+  DB  15,40,61,199,54,0,0                 ; movaps        0x36c7(%rip),%xmm7        # 6d00 <_sk_callback_sse2+0xbcd>
   DB  15,40,236                           ; movaps        %xmm4,%xmm5
   DB  15,40,244                           ; movaps        %xmm4,%xmm6
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,54                              ; je            365c <_sk_load_g8_dst_sse2+0x7e>
+  DB  116,54                              ; je            3684 <_sk_load_g8_dst_sse2+0x7e>
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3645 <_sk_load_g8_dst_sse2+0x67>
+  DB  116,21                              ; je            366d <_sk_load_g8_dst_sse2+0x67>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,192                             ; jne           35f6 <_sk_load_g8_dst_sse2+0x18>
+  DB  117,192                             ; jne           361e <_sk_load_g8_dst_sse2+0x18>
   DB  65,15,182,68,18,2                   ; movzbl        0x2(%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,228,69                   ; pshufd        $0x45,%xmm4,%xmm4
@@ -25915,10 +26000,10 @@
   DB  102,15,96,232                       ; punpcklbw     %xmm0,%xmm5
   DB  102,15,97,232                       ; punpcklwd     %xmm0,%xmm5
   DB  242,15,16,229                       ; movsd         %xmm5,%xmm4
-  DB  235,154                             ; jmp           35f6 <_sk_load_g8_dst_sse2+0x18>
+  DB  235,154                             ; jmp           361e <_sk_load_g8_dst_sse2+0x18>
   DB  65,15,182,4,18                      ; movzbl        (%r10,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
-  DB  235,143                             ; jmp           35f6 <_sk_load_g8_dst_sse2+0x18>
+  DB  235,143                             ; jmp           361e <_sk_load_g8_dst_sse2+0x18>
 
 PUBLIC _sk_gather_g8_sse2
 _sk_gather_g8_sse2 LABEL PROC
@@ -25958,9 +26043,9 @@
   DB  102,15,96,193                       ; punpcklbw     %xmm1,%xmm0
   DB  102,15,97,193                       ; punpcklwd     %xmm1,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,214,53,0,0                  ; mulps         0x35d6(%rip),%xmm0        # 6cd0 <_sk_callback_sse2+0xbc5>
+  DB  15,89,5,238,53,0,0                  ; mulps         0x35ee(%rip),%xmm0        # 6d10 <_sk_callback_sse2+0xbdd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,221,53,0,0                 ; movaps        0x35dd(%rip),%xmm3        # 6ce0 <_sk_callback_sse2+0xbd5>
+  DB  15,40,29,245,53,0,0                 ; movaps        0x35f5(%rip),%xmm3        # 6d20 <_sk_callback_sse2+0xbed>
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
   DB  91                                  ; pop           %rbx
@@ -25972,9 +26057,9 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  73,137,193                          ; mov           %rax,%r9
   DB  77,133,201                          ; test          %r9,%r9
-  DB  116,5                               ; je            371c <_sk_gather_i8_sse2+0xf>
+  DB  116,5                               ; je            3744 <_sk_gather_i8_sse2+0xf>
   DB  76,137,200                          ; mov           %r9,%rax
-  DB  235,2                               ; jmp           371e <_sk_gather_i8_sse2+0x11>
+  DB  235,2                               ; jmp           3746 <_sk_gather_i8_sse2+0x11>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  85                                  ; push          %rbp
   DB  65,86                               ; push          %r14
@@ -26026,11 +26111,11 @@
   DB  102,66,15,110,76,149,0              ; movd          0x0(%rbp,%r10,4),%xmm1
   DB  102,68,15,98,201                    ; punpckldq     %xmm1,%xmm9
   DB  102,68,15,98,200                    ; punpckldq     %xmm0,%xmm9
-  DB  102,15,111,21,246,52,0,0            ; movdqa        0x34f6(%rip),%xmm2        # 6cf0 <_sk_callback_sse2+0xbe5>
+  DB  102,15,111,21,14,53,0,0             ; movdqa        0x350e(%rip),%xmm2        # 6d30 <_sk_callback_sse2+0xbfd>
   DB  102,65,15,111,193                   ; movdqa        %xmm9,%xmm0
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,242,52,0,0               ; movaps        0x34f2(%rip),%xmm8        # 6d00 <_sk_callback_sse2+0xbf5>
+  DB  68,15,40,5,10,53,0,0                ; movaps        0x350a(%rip),%xmm8        # 6d40 <_sk_callback_sse2+0xc0d>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,114,209,8                    ; psrld         $0x8,%xmm1
@@ -26056,84 +26141,84 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,83                              ; jne           38af <_sk_load_565_sse2+0x5d>
+  DB  117,83                              ; jne           38d7 <_sk_load_565_sse2+0x5d>
   DB  243,65,15,126,20,82                 ; movq          (%r10,%rdx,2),%xmm2
   DB  102,15,97,208                       ; punpcklwd     %xmm0,%xmm2
-  DB  102,15,111,5,162,52,0,0             ; movdqa        0x34a2(%rip),%xmm0        # 6d10 <_sk_callback_sse2+0xc05>
+  DB  102,15,111,5,186,52,0,0             ; movdqa        0x34ba(%rip),%xmm0        # 6d50 <_sk_callback_sse2+0xc1d>
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,164,52,0,0                  ; mulps         0x34a4(%rip),%xmm0        # 6d20 <_sk_callback_sse2+0xc15>
-  DB  102,15,111,13,172,52,0,0            ; movdqa        0x34ac(%rip),%xmm1        # 6d30 <_sk_callback_sse2+0xc25>
+  DB  15,89,5,188,52,0,0                  ; mulps         0x34bc(%rip),%xmm0        # 6d60 <_sk_callback_sse2+0xc2d>
+  DB  102,15,111,13,196,52,0,0            ; movdqa        0x34c4(%rip),%xmm1        # 6d70 <_sk_callback_sse2+0xc3d>
   DB  102,15,219,202                      ; pand          %xmm2,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,174,52,0,0                 ; mulps         0x34ae(%rip),%xmm1        # 6d40 <_sk_callback_sse2+0xc35>
-  DB  102,15,219,21,182,52,0,0            ; pand          0x34b6(%rip),%xmm2        # 6d50 <_sk_callback_sse2+0xc45>
+  DB  15,89,13,198,52,0,0                 ; mulps         0x34c6(%rip),%xmm1        # 6d80 <_sk_callback_sse2+0xc4d>
+  DB  102,15,219,21,206,52,0,0            ; pand          0x34ce(%rip),%xmm2        # 6d90 <_sk_callback_sse2+0xc5d>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,188,52,0,0                 ; mulps         0x34bc(%rip),%xmm2        # 6d60 <_sk_callback_sse2+0xc55>
+  DB  15,89,21,212,52,0,0                 ; mulps         0x34d4(%rip),%xmm2        # 6da0 <_sk_callback_sse2+0xc6d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,195,52,0,0                 ; movaps        0x34c3(%rip),%xmm3        # 6d70 <_sk_callback_sse2+0xc65>
+  DB  15,40,29,219,52,0,0                 ; movaps        0x34db(%rip),%xmm3        # 6db0 <_sk_callback_sse2+0xc7d>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,50                              ; je            38ee <_sk_load_565_sse2+0x9c>
+  DB  116,50                              ; je            3916 <_sk_load_565_sse2+0x9c>
   DB  102,15,239,210                      ; pxor          %xmm2,%xmm2
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            38db <_sk_load_565_sse2+0x89>
+  DB  116,21                              ; je            3903 <_sk_load_565_sse2+0x89>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,154                             ; jne           3866 <_sk_load_565_sse2+0x14>
+  DB  117,154                             ; jne           388e <_sk_load_565_sse2+0x14>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,208,69                   ; pshufd        $0x45,%xmm0,%xmm2
   DB  102,65,15,110,4,82                  ; movd          (%r10,%rdx,2),%xmm0
   DB  102,15,97,192                       ; punpcklwd     %xmm0,%xmm0
   DB  242,15,16,208                       ; movsd         %xmm0,%xmm2
-  DB  233,120,255,255,255                 ; jmpq          3866 <_sk_load_565_sse2+0x14>
+  DB  233,120,255,255,255                 ; jmpq          388e <_sk_load_565_sse2+0x14>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,208                      ; movd          %eax,%xmm2
-  DB  233,106,255,255,255                 ; jmpq          3866 <_sk_load_565_sse2+0x14>
+  DB  233,106,255,255,255                 ; jmpq          388e <_sk_load_565_sse2+0x14>
 
 PUBLIC _sk_load_565_dst_sse2
 _sk_load_565_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,83                              ; jne           3959 <_sk_load_565_dst_sse2+0x5d>
+  DB  117,83                              ; jne           3981 <_sk_load_565_dst_sse2+0x5d>
   DB  243,65,15,126,52,82                 ; movq          (%r10,%rdx,2),%xmm6
   DB  102,15,97,240                       ; punpcklwd     %xmm0,%xmm6
-  DB  102,15,111,37,104,52,0,0            ; movdqa        0x3468(%rip),%xmm4        # 6d80 <_sk_callback_sse2+0xc75>
+  DB  102,15,111,37,128,52,0,0            ; movdqa        0x3480(%rip),%xmm4        # 6dc0 <_sk_callback_sse2+0xc8d>
   DB  102,15,219,230                      ; pand          %xmm6,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  15,89,37,106,52,0,0                 ; mulps         0x346a(%rip),%xmm4        # 6d90 <_sk_callback_sse2+0xc85>
-  DB  102,15,111,45,114,52,0,0            ; movdqa        0x3472(%rip),%xmm5        # 6da0 <_sk_callback_sse2+0xc95>
+  DB  15,89,37,130,52,0,0                 ; mulps         0x3482(%rip),%xmm4        # 6dd0 <_sk_callback_sse2+0xc9d>
+  DB  102,15,111,45,138,52,0,0            ; movdqa        0x348a(%rip),%xmm5        # 6de0 <_sk_callback_sse2+0xcad>
   DB  102,15,219,238                      ; pand          %xmm6,%xmm5
   DB  15,91,237                           ; cvtdq2ps      %xmm5,%xmm5
-  DB  15,89,45,116,52,0,0                 ; mulps         0x3474(%rip),%xmm5        # 6db0 <_sk_callback_sse2+0xca5>
-  DB  102,15,219,53,124,52,0,0            ; pand          0x347c(%rip),%xmm6        # 6dc0 <_sk_callback_sse2+0xcb5>
+  DB  15,89,45,140,52,0,0                 ; mulps         0x348c(%rip),%xmm5        # 6df0 <_sk_callback_sse2+0xcbd>
+  DB  102,15,219,53,148,52,0,0            ; pand          0x3494(%rip),%xmm6        # 6e00 <_sk_callback_sse2+0xccd>
   DB  15,91,246                           ; cvtdq2ps      %xmm6,%xmm6
-  DB  15,89,53,130,52,0,0                 ; mulps         0x3482(%rip),%xmm6        # 6dd0 <_sk_callback_sse2+0xcc5>
+  DB  15,89,53,154,52,0,0                 ; mulps         0x349a(%rip),%xmm6        # 6e10 <_sk_callback_sse2+0xcdd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,61,137,52,0,0                 ; movaps        0x3489(%rip),%xmm7        # 6de0 <_sk_callback_sse2+0xcd5>
+  DB  15,40,61,161,52,0,0                 ; movaps        0x34a1(%rip),%xmm7        # 6e20 <_sk_callback_sse2+0xced>
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,50                              ; je            3998 <_sk_load_565_dst_sse2+0x9c>
+  DB  116,50                              ; je            39c0 <_sk_load_565_dst_sse2+0x9c>
   DB  102,15,239,246                      ; pxor          %xmm6,%xmm6
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3985 <_sk_load_565_dst_sse2+0x89>
+  DB  116,21                              ; je            39ad <_sk_load_565_dst_sse2+0x89>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,154                             ; jne           3910 <_sk_load_565_dst_sse2+0x14>
+  DB  117,154                             ; jne           3938 <_sk_load_565_dst_sse2+0x14>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,244,69                   ; pshufd        $0x45,%xmm4,%xmm6
   DB  102,65,15,110,36,82                 ; movd          (%r10,%rdx,2),%xmm4
   DB  102,15,97,224                       ; punpcklwd     %xmm0,%xmm4
   DB  242,15,16,244                       ; movsd         %xmm4,%xmm6
-  DB  233,120,255,255,255                 ; jmpq          3910 <_sk_load_565_dst_sse2+0x14>
+  DB  233,120,255,255,255                 ; jmpq          3938 <_sk_load_565_dst_sse2+0x14>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,240                      ; movd          %eax,%xmm6
-  DB  233,106,255,255,255                 ; jmpq          3910 <_sk_load_565_dst_sse2+0x14>
+  DB  233,106,255,255,255                 ; jmpq          3938 <_sk_load_565_dst_sse2+0x14>
 
 PUBLIC _sk_gather_565_sse2
 _sk_gather_565_sse2 LABEL PROC
@@ -26166,19 +26251,19 @@
   DB  102,15,196,208,3                    ; pinsrw        $0x3,%eax,%xmm2
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  102,15,97,208                       ; punpcklwd     %xmm0,%xmm2
-  DB  102,15,111,5,196,51,0,0             ; movdqa        0x33c4(%rip),%xmm0        # 6df0 <_sk_callback_sse2+0xce5>
+  DB  102,15,111,5,220,51,0,0             ; movdqa        0x33dc(%rip),%xmm0        # 6e30 <_sk_callback_sse2+0xcfd>
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,198,51,0,0                  ; mulps         0x33c6(%rip),%xmm0        # 6e00 <_sk_callback_sse2+0xcf5>
-  DB  102,15,111,13,206,51,0,0            ; movdqa        0x33ce(%rip),%xmm1        # 6e10 <_sk_callback_sse2+0xd05>
+  DB  15,89,5,222,51,0,0                  ; mulps         0x33de(%rip),%xmm0        # 6e40 <_sk_callback_sse2+0xd0d>
+  DB  102,15,111,13,230,51,0,0            ; movdqa        0x33e6(%rip),%xmm1        # 6e50 <_sk_callback_sse2+0xd1d>
   DB  102,15,219,202                      ; pand          %xmm2,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,208,51,0,0                 ; mulps         0x33d0(%rip),%xmm1        # 6e20 <_sk_callback_sse2+0xd15>
-  DB  102,15,219,21,216,51,0,0            ; pand          0x33d8(%rip),%xmm2        # 6e30 <_sk_callback_sse2+0xd25>
+  DB  15,89,13,232,51,0,0                 ; mulps         0x33e8(%rip),%xmm1        # 6e60 <_sk_callback_sse2+0xd2d>
+  DB  102,15,219,21,240,51,0,0            ; pand          0x33f0(%rip),%xmm2        # 6e70 <_sk_callback_sse2+0xd3d>
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,222,51,0,0                 ; mulps         0x33de(%rip),%xmm2        # 6e40 <_sk_callback_sse2+0xd35>
+  DB  15,89,21,246,51,0,0                 ; mulps         0x33f6(%rip),%xmm2        # 6e80 <_sk_callback_sse2+0xd4d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,229,51,0,0                 ; movaps        0x33e5(%rip),%xmm3        # 6e50 <_sk_callback_sse2+0xd45>
+  DB  15,40,29,253,51,0,0                 ; movaps        0x33fd(%rip),%xmm3        # 6e90 <_sk_callback_sse2+0xd5d>
   DB  91                                  ; pop           %rbx
   DB  255,224                             ; jmpq          *%rax
 
@@ -26186,12 +26271,12 @@
 _sk_store_565_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  68,15,40,5,229,51,0,0               ; movaps        0x33e5(%rip),%xmm8        # 6e60 <_sk_callback_sse2+0xd55>
+  DB  68,15,40,5,253,51,0,0               ; movaps        0x33fd(%rip),%xmm8        # 6ea0 <_sk_callback_sse2+0xd6d>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
   DB  102,65,15,114,241,11                ; pslld         $0xb,%xmm9
-  DB  68,15,40,21,218,51,0,0              ; movaps        0x33da(%rip),%xmm10        # 6e70 <_sk_callback_sse2+0xd65>
+  DB  68,15,40,21,242,51,0,0              ; movaps        0x33f2(%rip),%xmm10        # 6eb0 <_sk_callback_sse2+0xd7d>
   DB  68,15,89,209                        ; mulps         %xmm1,%xmm10
   DB  102,69,15,91,210                    ; cvtps2dq      %xmm10,%xmm10
   DB  102,65,15,114,242,5                 ; pslld         $0x5,%xmm10
@@ -26203,7 +26288,7 @@
   DB  102,65,15,114,224,16                ; psrad         $0x10,%xmm8
   DB  102,69,15,107,192                   ; packssdw      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           3ad8 <_sk_store_565_sse2+0x6a>
+  DB  117,10                              ; jne           3b00 <_sk_store_565_sse2+0x6a>
   DB  242,69,15,17,4,82                   ; movsd         %xmm8,(%r10,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -26211,109 +26296,109 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,38                              ; je            3b10 <_sk_store_565_sse2+0xa2>
+  DB  116,38                              ; je            3b38 <_sk_store_565_sse2+0xa2>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,18                              ; je            3b02 <_sk_store_565_sse2+0x94>
+  DB  116,18                              ; je            3b2a <_sk_store_565_sse2+0x94>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,222                             ; jne           3ad4 <_sk_store_565_sse2+0x66>
+  DB  117,222                             ; jne           3afc <_sk_store_565_sse2+0x66>
   DB  102,65,15,197,192,4                 ; pextrw        $0x4,%xmm8,%eax
   DB  102,65,137,68,82,4                  ; mov           %ax,0x4(%r10,%rdx,2)
   DB  242,69,15,112,192,232               ; pshuflw       $0xe8,%xmm8,%xmm8
   DB  102,69,15,126,4,82                  ; movd          %xmm8,(%r10,%rdx,2)
-  DB  235,196                             ; jmp           3ad4 <_sk_store_565_sse2+0x66>
+  DB  235,196                             ; jmp           3afc <_sk_store_565_sse2+0x66>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  102,65,137,4,82                     ; mov           %ax,(%r10,%rdx,2)
-  DB  235,184                             ; jmp           3ad4 <_sk_store_565_sse2+0x66>
+  DB  235,184                             ; jmp           3afc <_sk_store_565_sse2+0x66>
 
 PUBLIC _sk_load_4444_sse2
 _sk_load_4444_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,98                              ; jne           3b88 <_sk_load_4444_sse2+0x6c>
+  DB  117,98                              ; jne           3bb0 <_sk_load_4444_sse2+0x6c>
   DB  243,65,15,126,28,82                 ; movq          (%r10,%rdx,2),%xmm3
   DB  102,15,97,216                       ; punpcklwd     %xmm0,%xmm3
-  DB  102,15,111,5,72,51,0,0              ; movdqa        0x3348(%rip),%xmm0        # 6e80 <_sk_callback_sse2+0xd75>
+  DB  102,15,111,5,96,51,0,0              ; movdqa        0x3360(%rip),%xmm0        # 6ec0 <_sk_callback_sse2+0xd8d>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,74,51,0,0                   ; mulps         0x334a(%rip),%xmm0        # 6e90 <_sk_callback_sse2+0xd85>
-  DB  102,15,111,13,82,51,0,0             ; movdqa        0x3352(%rip),%xmm1        # 6ea0 <_sk_callback_sse2+0xd95>
+  DB  15,89,5,98,51,0,0                   ; mulps         0x3362(%rip),%xmm0        # 6ed0 <_sk_callback_sse2+0xd9d>
+  DB  102,15,111,13,106,51,0,0            ; movdqa        0x336a(%rip),%xmm1        # 6ee0 <_sk_callback_sse2+0xdad>
   DB  102,15,219,203                      ; pand          %xmm3,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,84,51,0,0                  ; mulps         0x3354(%rip),%xmm1        # 6eb0 <_sk_callback_sse2+0xda5>
-  DB  102,15,111,21,92,51,0,0             ; movdqa        0x335c(%rip),%xmm2        # 6ec0 <_sk_callback_sse2+0xdb5>
+  DB  15,89,13,108,51,0,0                 ; mulps         0x336c(%rip),%xmm1        # 6ef0 <_sk_callback_sse2+0xdbd>
+  DB  102,15,111,21,116,51,0,0            ; movdqa        0x3374(%rip),%xmm2        # 6f00 <_sk_callback_sse2+0xdcd>
   DB  102,15,219,211                      ; pand          %xmm3,%xmm2
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,94,51,0,0                  ; mulps         0x335e(%rip),%xmm2        # 6ed0 <_sk_callback_sse2+0xdc5>
-  DB  102,15,219,29,102,51,0,0            ; pand          0x3366(%rip),%xmm3        # 6ee0 <_sk_callback_sse2+0xdd5>
+  DB  15,89,21,118,51,0,0                 ; mulps         0x3376(%rip),%xmm2        # 6f10 <_sk_callback_sse2+0xddd>
+  DB  102,15,219,29,126,51,0,0            ; pand          0x337e(%rip),%xmm3        # 6f20 <_sk_callback_sse2+0xded>
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,108,51,0,0                 ; mulps         0x336c(%rip),%xmm3        # 6ef0 <_sk_callback_sse2+0xde5>
+  DB  15,89,29,132,51,0,0                 ; mulps         0x3384(%rip),%xmm3        # 6f30 <_sk_callback_sse2+0xdfd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,50                              ; je            3bc7 <_sk_load_4444_sse2+0xab>
+  DB  116,50                              ; je            3bef <_sk_load_4444_sse2+0xab>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3bb4 <_sk_load_4444_sse2+0x98>
+  DB  116,21                              ; je            3bdc <_sk_load_4444_sse2+0x98>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,139                             ; jne           3b30 <_sk_load_4444_sse2+0x14>
+  DB  117,139                             ; jne           3b58 <_sk_load_4444_sse2+0x14>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,112,216,69                   ; pshufd        $0x45,%xmm0,%xmm3
   DB  102,65,15,110,4,82                  ; movd          (%r10,%rdx,2),%xmm0
   DB  102,15,97,192                       ; punpcklwd     %xmm0,%xmm0
   DB  242,15,16,216                       ; movsd         %xmm0,%xmm3
-  DB  233,105,255,255,255                 ; jmpq          3b30 <_sk_load_4444_sse2+0x14>
+  DB  233,105,255,255,255                 ; jmpq          3b58 <_sk_load_4444_sse2+0x14>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,216                      ; movd          %eax,%xmm3
-  DB  233,91,255,255,255                  ; jmpq          3b30 <_sk_load_4444_sse2+0x14>
+  DB  233,91,255,255,255                  ; jmpq          3b58 <_sk_load_4444_sse2+0x14>
 
 PUBLIC _sk_load_4444_dst_sse2
 _sk_load_4444_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,98                              ; jne           3c41 <_sk_load_4444_dst_sse2+0x6c>
+  DB  117,98                              ; jne           3c69 <_sk_load_4444_dst_sse2+0x6c>
   DB  243,65,15,126,60,82                 ; movq          (%r10,%rdx,2),%xmm7
   DB  102,15,97,248                       ; punpcklwd     %xmm0,%xmm7
-  DB  102,15,111,37,15,51,0,0             ; movdqa        0x330f(%rip),%xmm4        # 6f00 <_sk_callback_sse2+0xdf5>
+  DB  102,15,111,37,39,51,0,0             ; movdqa        0x3327(%rip),%xmm4        # 6f40 <_sk_callback_sse2+0xe0d>
   DB  102,15,219,231                      ; pand          %xmm7,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  15,89,37,17,51,0,0                  ; mulps         0x3311(%rip),%xmm4        # 6f10 <_sk_callback_sse2+0xe05>
-  DB  102,15,111,45,25,51,0,0             ; movdqa        0x3319(%rip),%xmm5        # 6f20 <_sk_callback_sse2+0xe15>
+  DB  15,89,37,41,51,0,0                  ; mulps         0x3329(%rip),%xmm4        # 6f50 <_sk_callback_sse2+0xe1d>
+  DB  102,15,111,45,49,51,0,0             ; movdqa        0x3331(%rip),%xmm5        # 6f60 <_sk_callback_sse2+0xe2d>
   DB  102,15,219,239                      ; pand          %xmm7,%xmm5
   DB  15,91,237                           ; cvtdq2ps      %xmm5,%xmm5
-  DB  15,89,45,27,51,0,0                  ; mulps         0x331b(%rip),%xmm5        # 6f30 <_sk_callback_sse2+0xe25>
-  DB  102,15,111,53,35,51,0,0             ; movdqa        0x3323(%rip),%xmm6        # 6f40 <_sk_callback_sse2+0xe35>
+  DB  15,89,45,51,51,0,0                  ; mulps         0x3333(%rip),%xmm5        # 6f70 <_sk_callback_sse2+0xe3d>
+  DB  102,15,111,53,59,51,0,0             ; movdqa        0x333b(%rip),%xmm6        # 6f80 <_sk_callback_sse2+0xe4d>
   DB  102,15,219,247                      ; pand          %xmm7,%xmm6
   DB  15,91,246                           ; cvtdq2ps      %xmm6,%xmm6
-  DB  15,89,53,37,51,0,0                  ; mulps         0x3325(%rip),%xmm6        # 6f50 <_sk_callback_sse2+0xe45>
-  DB  102,15,219,61,45,51,0,0             ; pand          0x332d(%rip),%xmm7        # 6f60 <_sk_callback_sse2+0xe55>
+  DB  15,89,53,61,51,0,0                  ; mulps         0x333d(%rip),%xmm6        # 6f90 <_sk_callback_sse2+0xe5d>
+  DB  102,15,219,61,69,51,0,0             ; pand          0x3345(%rip),%xmm7        # 6fa0 <_sk_callback_sse2+0xe6d>
   DB  15,91,255                           ; cvtdq2ps      %xmm7,%xmm7
-  DB  15,89,61,51,51,0,0                  ; mulps         0x3333(%rip),%xmm7        # 6f70 <_sk_callback_sse2+0xe65>
+  DB  15,89,61,75,51,0,0                  ; mulps         0x334b(%rip),%xmm7        # 6fb0 <_sk_callback_sse2+0xe7d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,50                              ; je            3c80 <_sk_load_4444_dst_sse2+0xab>
+  DB  116,50                              ; je            3ca8 <_sk_load_4444_dst_sse2+0xab>
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,21                              ; je            3c6d <_sk_load_4444_dst_sse2+0x98>
+  DB  116,21                              ; je            3c95 <_sk_load_4444_dst_sse2+0x98>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,139                             ; jne           3be9 <_sk_load_4444_dst_sse2+0x14>
+  DB  117,139                             ; jne           3c11 <_sk_load_4444_dst_sse2+0x14>
   DB  65,15,183,68,82,4                   ; movzwl        0x4(%r10,%rdx,2),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
   DB  102,65,15,110,36,82                 ; movd          (%r10,%rdx,2),%xmm4
   DB  102,15,97,224                       ; punpcklwd     %xmm0,%xmm4
   DB  242,15,16,252                       ; movsd         %xmm4,%xmm7
-  DB  233,105,255,255,255                 ; jmpq          3be9 <_sk_load_4444_dst_sse2+0x14>
+  DB  233,105,255,255,255                 ; jmpq          3c11 <_sk_load_4444_dst_sse2+0x14>
   DB  65,15,183,4,82                      ; movzwl        (%r10,%rdx,2),%eax
   DB  102,15,110,248                      ; movd          %eax,%xmm7
-  DB  233,91,255,255,255                  ; jmpq          3be9 <_sk_load_4444_dst_sse2+0x14>
+  DB  233,91,255,255,255                  ; jmpq          3c11 <_sk_load_4444_dst_sse2+0x14>
 
 PUBLIC _sk_gather_4444_sse2
 _sk_gather_4444_sse2 LABEL PROC
@@ -26346,21 +26431,21 @@
   DB  102,15,196,216,3                    ; pinsrw        $0x3,%eax,%xmm3
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  102,15,97,216                       ; punpcklwd     %xmm0,%xmm3
-  DB  102,15,111,5,108,50,0,0             ; movdqa        0x326c(%rip),%xmm0        # 6f80 <_sk_callback_sse2+0xe75>
+  DB  102,15,111,5,132,50,0,0             ; movdqa        0x3284(%rip),%xmm0        # 6fc0 <_sk_callback_sse2+0xe8d>
   DB  102,15,219,195                      ; pand          %xmm3,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  15,89,5,110,50,0,0                  ; mulps         0x326e(%rip),%xmm0        # 6f90 <_sk_callback_sse2+0xe85>
-  DB  102,15,111,13,118,50,0,0            ; movdqa        0x3276(%rip),%xmm1        # 6fa0 <_sk_callback_sse2+0xe95>
+  DB  15,89,5,134,50,0,0                  ; mulps         0x3286(%rip),%xmm0        # 6fd0 <_sk_callback_sse2+0xe9d>
+  DB  102,15,111,13,142,50,0,0            ; movdqa        0x328e(%rip),%xmm1        # 6fe0 <_sk_callback_sse2+0xead>
   DB  102,15,219,203                      ; pand          %xmm3,%xmm1
   DB  15,91,201                           ; cvtdq2ps      %xmm1,%xmm1
-  DB  15,89,13,120,50,0,0                 ; mulps         0x3278(%rip),%xmm1        # 6fb0 <_sk_callback_sse2+0xea5>
-  DB  102,15,111,21,128,50,0,0            ; movdqa        0x3280(%rip),%xmm2        # 6fc0 <_sk_callback_sse2+0xeb5>
+  DB  15,89,13,144,50,0,0                 ; mulps         0x3290(%rip),%xmm1        # 6ff0 <_sk_callback_sse2+0xebd>
+  DB  102,15,111,21,152,50,0,0            ; movdqa        0x3298(%rip),%xmm2        # 7000 <_sk_callback_sse2+0xecd>
   DB  102,15,219,211                      ; pand          %xmm3,%xmm2
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
-  DB  15,89,21,130,50,0,0                 ; mulps         0x3282(%rip),%xmm2        # 6fd0 <_sk_callback_sse2+0xec5>
-  DB  102,15,219,29,138,50,0,0            ; pand          0x328a(%rip),%xmm3        # 6fe0 <_sk_callback_sse2+0xed5>
+  DB  15,89,21,154,50,0,0                 ; mulps         0x329a(%rip),%xmm2        # 7010 <_sk_callback_sse2+0xedd>
+  DB  102,15,219,29,162,50,0,0            ; pand          0x32a2(%rip),%xmm3        # 7020 <_sk_callback_sse2+0xeed>
   DB  15,91,219                           ; cvtdq2ps      %xmm3,%xmm3
-  DB  15,89,29,144,50,0,0                 ; mulps         0x3290(%rip),%xmm3        # 6ff0 <_sk_callback_sse2+0xee5>
+  DB  15,89,29,168,50,0,0                 ; mulps         0x32a8(%rip),%xmm3        # 7030 <_sk_callback_sse2+0xefd>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  91                                  ; pop           %rbx
   DB  255,224                             ; jmpq          *%rax
@@ -26369,7 +26454,7 @@
 _sk_store_4444_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,16                           ; mov           (%rax),%r10
-  DB  68,15,40,5,142,50,0,0               ; movaps        0x328e(%rip),%xmm8        # 7000 <_sk_callback_sse2+0xef5>
+  DB  68,15,40,5,166,50,0,0               ; movaps        0x32a6(%rip),%xmm8        # 7040 <_sk_callback_sse2+0xf0d>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -26391,7 +26476,7 @@
   DB  102,65,15,114,224,16                ; psrad         $0x10,%xmm8
   DB  102,69,15,107,192                   ; packssdw      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           3de3 <_sk_store_4444_sse2+0x7e>
+  DB  117,10                              ; jne           3e0b <_sk_store_4444_sse2+0x7e>
   DB  242,69,15,17,4,82                   ; movsd         %xmm8,(%r10,%rdx,2)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -26399,32 +26484,32 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,38                              ; je            3e1b <_sk_store_4444_sse2+0xb6>
+  DB  116,38                              ; je            3e43 <_sk_store_4444_sse2+0xb6>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,18                              ; je            3e0d <_sk_store_4444_sse2+0xa8>
+  DB  116,18                              ; je            3e35 <_sk_store_4444_sse2+0xa8>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,222                             ; jne           3ddf <_sk_store_4444_sse2+0x7a>
+  DB  117,222                             ; jne           3e07 <_sk_store_4444_sse2+0x7a>
   DB  102,65,15,197,192,4                 ; pextrw        $0x4,%xmm8,%eax
   DB  102,65,137,68,82,4                  ; mov           %ax,0x4(%r10,%rdx,2)
   DB  242,69,15,112,192,232               ; pshuflw       $0xe8,%xmm8,%xmm8
   DB  102,69,15,126,4,82                  ; movd          %xmm8,(%r10,%rdx,2)
-  DB  235,196                             ; jmp           3ddf <_sk_store_4444_sse2+0x7a>
+  DB  235,196                             ; jmp           3e07 <_sk_store_4444_sse2+0x7a>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  102,65,137,4,82                     ; mov           %ax,(%r10,%rdx,2)
-  DB  235,184                             ; jmp           3ddf <_sk_store_4444_sse2+0x7a>
+  DB  235,184                             ; jmp           3e07 <_sk_store_4444_sse2+0x7a>
 
 PUBLIC _sk_load_8888_sse2
 _sk_load_8888_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,98                              ; jne           3e93 <_sk_load_8888_sse2+0x6c>
+  DB  117,98                              ; jne           3ebb <_sk_load_8888_sse2+0x6c>
   DB  243,68,15,111,12,144                ; movdqu        (%rax,%rdx,4),%xmm9
-  DB  102,15,111,21,209,49,0,0            ; movdqa        0x31d1(%rip),%xmm2        # 7010 <_sk_callback_sse2+0xf05>
+  DB  102,15,111,21,233,49,0,0            ; movdqa        0x31e9(%rip),%xmm2        # 7050 <_sk_callback_sse2+0xf1d>
   DB  102,65,15,111,193                   ; movdqa        %xmm9,%xmm0
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,205,49,0,0               ; movaps        0x31cd(%rip),%xmm8        # 7020 <_sk_callback_sse2+0xf15>
+  DB  68,15,40,5,229,49,0,0               ; movaps        0x31e5(%rip),%xmm8        # 7060 <_sk_callback_sse2+0xf2d>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,114,209,8                    ; psrld         $0x8,%xmm1
@@ -26444,31 +26529,31 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,40                              ; je            3ec8 <_sk_load_8888_sse2+0xa1>
+  DB  116,40                              ; je            3ef0 <_sk_load_8888_sse2+0xa1>
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,18                              ; je            3ebd <_sk_load_8888_sse2+0x96>
+  DB  116,18                              ; je            3ee5 <_sk_load_8888_sse2+0x96>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,134                             ; jne           3e37 <_sk_load_8888_sse2+0x10>
+  DB  117,134                             ; jne           3e5f <_sk_load_8888_sse2+0x10>
   DB  102,15,110,68,144,8                 ; movd          0x8(%rax,%rdx,4),%xmm0
   DB  102,68,15,112,200,69                ; pshufd        $0x45,%xmm0,%xmm9
   DB  102,68,15,18,12,144                 ; movlpd        (%rax,%rdx,4),%xmm9
-  DB  233,111,255,255,255                 ; jmpq          3e37 <_sk_load_8888_sse2+0x10>
+  DB  233,111,255,255,255                 ; jmpq          3e5f <_sk_load_8888_sse2+0x10>
   DB  102,68,15,110,12,144                ; movd          (%rax,%rdx,4),%xmm9
-  DB  233,100,255,255,255                 ; jmpq          3e37 <_sk_load_8888_sse2+0x10>
+  DB  233,100,255,255,255                 ; jmpq          3e5f <_sk_load_8888_sse2+0x10>
 
 PUBLIC _sk_load_8888_dst_sse2
 _sk_load_8888_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,98                              ; jne           3f3f <_sk_load_8888_dst_sse2+0x6c>
+  DB  117,98                              ; jne           3f67 <_sk_load_8888_dst_sse2+0x6c>
   DB  243,68,15,111,12,144                ; movdqu        (%rax,%rdx,4),%xmm9
-  DB  102,15,111,53,69,49,0,0             ; movdqa        0x3145(%rip),%xmm6        # 7030 <_sk_callback_sse2+0xf25>
+  DB  102,15,111,53,93,49,0,0             ; movdqa        0x315d(%rip),%xmm6        # 7070 <_sk_callback_sse2+0xf3d>
   DB  102,65,15,111,225                   ; movdqa        %xmm9,%xmm4
   DB  102,15,219,230                      ; pand          %xmm6,%xmm4
   DB  15,91,228                           ; cvtdq2ps      %xmm4,%xmm4
-  DB  68,15,40,5,65,49,0,0                ; movaps        0x3141(%rip),%xmm8        # 7040 <_sk_callback_sse2+0xf35>
+  DB  68,15,40,5,89,49,0,0                ; movaps        0x3159(%rip),%xmm8        # 7080 <_sk_callback_sse2+0xf4d>
   DB  65,15,89,224                        ; mulps         %xmm8,%xmm4
   DB  102,65,15,111,233                   ; movdqa        %xmm9,%xmm5
   DB  102,15,114,213,8                    ; psrld         $0x8,%xmm5
@@ -26488,18 +26573,18 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,40                              ; je            3f74 <_sk_load_8888_dst_sse2+0xa1>
+  DB  116,40                              ; je            3f9c <_sk_load_8888_dst_sse2+0xa1>
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,18                              ; je            3f69 <_sk_load_8888_dst_sse2+0x96>
+  DB  116,18                              ; je            3f91 <_sk_load_8888_dst_sse2+0x96>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,134                             ; jne           3ee3 <_sk_load_8888_dst_sse2+0x10>
+  DB  117,134                             ; jne           3f0b <_sk_load_8888_dst_sse2+0x10>
   DB  102,15,110,100,144,8                ; movd          0x8(%rax,%rdx,4),%xmm4
   DB  102,68,15,112,204,69                ; pshufd        $0x45,%xmm4,%xmm9
   DB  102,68,15,18,12,144                 ; movlpd        (%rax,%rdx,4),%xmm9
-  DB  233,111,255,255,255                 ; jmpq          3ee3 <_sk_load_8888_dst_sse2+0x10>
+  DB  233,111,255,255,255                 ; jmpq          3f0b <_sk_load_8888_dst_sse2+0x10>
   DB  102,68,15,110,12,144                ; movd          (%rax,%rdx,4),%xmm9
-  DB  233,100,255,255,255                 ; jmpq          3ee3 <_sk_load_8888_dst_sse2+0x10>
+  DB  233,100,255,255,255                 ; jmpq          3f0b <_sk_load_8888_dst_sse2+0x10>
 
 PUBLIC _sk_gather_8888_sse2
 _sk_gather_8888_sse2 LABEL PROC
@@ -26531,11 +26616,11 @@
   DB  102,67,15,110,12,145                ; movd          (%r9,%r10,4),%xmm1
   DB  102,68,15,98,201                    ; punpckldq     %xmm1,%xmm9
   DB  102,68,15,98,200                    ; punpckldq     %xmm0,%xmm9
-  DB  102,15,111,21,79,48,0,0             ; movdqa        0x304f(%rip),%xmm2        # 7050 <_sk_callback_sse2+0xf45>
+  DB  102,15,111,21,103,48,0,0            ; movdqa        0x3067(%rip),%xmm2        # 7090 <_sk_callback_sse2+0xf5d>
   DB  102,65,15,111,193                   ; movdqa        %xmm9,%xmm0
   DB  102,15,219,194                      ; pand          %xmm2,%xmm0
   DB  15,91,192                           ; cvtdq2ps      %xmm0,%xmm0
-  DB  68,15,40,5,75,48,0,0                ; movaps        0x304b(%rip),%xmm8        # 7060 <_sk_callback_sse2+0xf55>
+  DB  68,15,40,5,99,48,0,0                ; movaps        0x3063(%rip),%xmm8        # 70a0 <_sk_callback_sse2+0xf6d>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,114,209,8                    ; psrld         $0x8,%xmm1
@@ -26558,7 +26643,7 @@
 _sk_store_8888_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,13,48,0,0                ; movaps        0x300d(%rip),%xmm8        # 7070 <_sk_callback_sse2+0xf65>
+  DB  68,15,40,5,37,48,0,0                ; movaps        0x3025(%rip),%xmm8        # 70b0 <_sk_callback_sse2+0xf7d>
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -26577,37 +26662,37 @@
   DB  102,69,15,235,193                   ; por           %xmm9,%xmm8
   DB  102,69,15,235,194                   ; por           %xmm10,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           40c3 <_sk_store_8888_sse2+0x6d>
+  DB  117,10                              ; jne           40eb <_sk_store_8888_sse2+0x6d>
   DB  243,68,15,127,4,144                 ; movdqu        %xmm8,(%rax,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,33                              ; je            40f1 <_sk_store_8888_sse2+0x9b>
+  DB  116,33                              ; je            4119 <_sk_store_8888_sse2+0x9b>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,19                              ; je            40e9 <_sk_store_8888_sse2+0x93>
+  DB  116,19                              ; je            4111 <_sk_store_8888_sse2+0x93>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,227                             ; jne           40bf <_sk_store_8888_sse2+0x69>
+  DB  117,227                             ; jne           40e7 <_sk_store_8888_sse2+0x69>
   DB  102,69,15,112,200,78                ; pshufd        $0x4e,%xmm8,%xmm9
   DB  102,68,15,126,76,144,8              ; movd          %xmm9,0x8(%rax,%rdx,4)
   DB  102,68,15,214,4,144                 ; movq          %xmm8,(%rax,%rdx,4)
-  DB  235,206                             ; jmp           40bf <_sk_store_8888_sse2+0x69>
+  DB  235,206                             ; jmp           40e7 <_sk_store_8888_sse2+0x69>
   DB  102,68,15,126,4,144                 ; movd          %xmm8,(%rax,%rdx,4)
-  DB  235,198                             ; jmp           40bf <_sk_store_8888_sse2+0x69>
+  DB  235,198                             ; jmp           40e7 <_sk_store_8888_sse2+0x69>
 
 PUBLIC _sk_load_bgra_sse2
 _sk_load_bgra_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,98                              ; jne           4165 <_sk_load_bgra_sse2+0x6c>
+  DB  117,98                              ; jne           418d <_sk_load_bgra_sse2+0x6c>
   DB  243,68,15,111,12,144                ; movdqu        (%rax,%rdx,4),%xmm9
-  DB  102,15,111,5,111,47,0,0             ; movdqa        0x2f6f(%rip),%xmm0        # 7080 <_sk_callback_sse2+0xf75>
+  DB  102,15,111,5,135,47,0,0             ; movdqa        0x2f87(%rip),%xmm0        # 70c0 <_sk_callback_sse2+0xf8d>
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,219,200                      ; pand          %xmm0,%xmm1
   DB  15,91,209                           ; cvtdq2ps      %xmm1,%xmm2
-  DB  68,15,40,5,107,47,0,0               ; movaps        0x2f6b(%rip),%xmm8        # 7090 <_sk_callback_sse2+0xf85>
+  DB  68,15,40,5,131,47,0,0               ; movaps        0x2f83(%rip),%xmm8        # 70d0 <_sk_callback_sse2+0xf9d>
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,114,209,8                    ; psrld         $0x8,%xmm1
@@ -26627,31 +26712,31 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,40                              ; je            419a <_sk_load_bgra_sse2+0xa1>
+  DB  116,40                              ; je            41c2 <_sk_load_bgra_sse2+0xa1>
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,18                              ; je            418f <_sk_load_bgra_sse2+0x96>
+  DB  116,18                              ; je            41b7 <_sk_load_bgra_sse2+0x96>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,134                             ; jne           4109 <_sk_load_bgra_sse2+0x10>
+  DB  117,134                             ; jne           4131 <_sk_load_bgra_sse2+0x10>
   DB  102,15,110,68,144,8                 ; movd          0x8(%rax,%rdx,4),%xmm0
   DB  102,68,15,112,200,69                ; pshufd        $0x45,%xmm0,%xmm9
   DB  102,68,15,18,12,144                 ; movlpd        (%rax,%rdx,4),%xmm9
-  DB  233,111,255,255,255                 ; jmpq          4109 <_sk_load_bgra_sse2+0x10>
+  DB  233,111,255,255,255                 ; jmpq          4131 <_sk_load_bgra_sse2+0x10>
   DB  102,68,15,110,12,144                ; movd          (%rax,%rdx,4),%xmm9
-  DB  233,100,255,255,255                 ; jmpq          4109 <_sk_load_bgra_sse2+0x10>
+  DB  233,100,255,255,255                 ; jmpq          4131 <_sk_load_bgra_sse2+0x10>
 
 PUBLIC _sk_load_bgra_dst_sse2
 _sk_load_bgra_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,98                              ; jne           4211 <_sk_load_bgra_dst_sse2+0x6c>
+  DB  117,98                              ; jne           4239 <_sk_load_bgra_dst_sse2+0x6c>
   DB  243,68,15,111,12,144                ; movdqu        (%rax,%rdx,4),%xmm9
-  DB  102,15,111,37,227,46,0,0            ; movdqa        0x2ee3(%rip),%xmm4        # 70a0 <_sk_callback_sse2+0xf95>
+  DB  102,15,111,37,251,46,0,0            ; movdqa        0x2efb(%rip),%xmm4        # 70e0 <_sk_callback_sse2+0xfad>
   DB  102,65,15,111,233                   ; movdqa        %xmm9,%xmm5
   DB  102,15,219,236                      ; pand          %xmm4,%xmm5
   DB  15,91,245                           ; cvtdq2ps      %xmm5,%xmm6
-  DB  68,15,40,5,223,46,0,0               ; movaps        0x2edf(%rip),%xmm8        # 70b0 <_sk_callback_sse2+0xfa5>
+  DB  68,15,40,5,247,46,0,0               ; movaps        0x2ef7(%rip),%xmm8        # 70f0 <_sk_callback_sse2+0xfbd>
   DB  65,15,89,240                        ; mulps         %xmm8,%xmm6
   DB  102,65,15,111,233                   ; movdqa        %xmm9,%xmm5
   DB  102,15,114,213,8                    ; psrld         $0x8,%xmm5
@@ -26671,18 +26756,18 @@
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,40                              ; je            4246 <_sk_load_bgra_dst_sse2+0xa1>
+  DB  116,40                              ; je            426e <_sk_load_bgra_dst_sse2+0xa1>
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,18                              ; je            423b <_sk_load_bgra_dst_sse2+0x96>
+  DB  116,18                              ; je            4263 <_sk_load_bgra_dst_sse2+0x96>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,134                             ; jne           41b5 <_sk_load_bgra_dst_sse2+0x10>
+  DB  117,134                             ; jne           41dd <_sk_load_bgra_dst_sse2+0x10>
   DB  102,15,110,100,144,8                ; movd          0x8(%rax,%rdx,4),%xmm4
   DB  102,68,15,112,204,69                ; pshufd        $0x45,%xmm4,%xmm9
   DB  102,68,15,18,12,144                 ; movlpd        (%rax,%rdx,4),%xmm9
-  DB  233,111,255,255,255                 ; jmpq          41b5 <_sk_load_bgra_dst_sse2+0x10>
+  DB  233,111,255,255,255                 ; jmpq          41dd <_sk_load_bgra_dst_sse2+0x10>
   DB  102,68,15,110,12,144                ; movd          (%rax,%rdx,4),%xmm9
-  DB  233,100,255,255,255                 ; jmpq          41b5 <_sk_load_bgra_dst_sse2+0x10>
+  DB  233,100,255,255,255                 ; jmpq          41dd <_sk_load_bgra_dst_sse2+0x10>
 
 PUBLIC _sk_gather_bgra_sse2
 _sk_gather_bgra_sse2 LABEL PROC
@@ -26714,11 +26799,11 @@
   DB  102,67,15,110,12,145                ; movd          (%r9,%r10,4),%xmm1
   DB  102,68,15,98,201                    ; punpckldq     %xmm1,%xmm9
   DB  102,68,15,98,200                    ; punpckldq     %xmm0,%xmm9
-  DB  102,15,111,5,237,45,0,0             ; movdqa        0x2ded(%rip),%xmm0        # 70c0 <_sk_callback_sse2+0xfb5>
+  DB  102,15,111,5,5,46,0,0               ; movdqa        0x2e05(%rip),%xmm0        # 7100 <_sk_callback_sse2+0xfcd>
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,219,200                      ; pand          %xmm0,%xmm1
   DB  15,91,209                           ; cvtdq2ps      %xmm1,%xmm2
-  DB  68,15,40,5,233,45,0,0               ; movaps        0x2de9(%rip),%xmm8        # 70d0 <_sk_callback_sse2+0xfc5>
+  DB  68,15,40,5,1,46,0,0                 ; movaps        0x2e01(%rip),%xmm8        # 7110 <_sk_callback_sse2+0xfdd>
   DB  65,15,89,208                        ; mulps         %xmm8,%xmm2
   DB  102,65,15,111,201                   ; movdqa        %xmm9,%xmm1
   DB  102,15,114,209,8                    ; psrld         $0x8,%xmm1
@@ -26741,7 +26826,7 @@
 _sk_store_bgra_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  68,15,40,5,171,45,0,0               ; movaps        0x2dab(%rip),%xmm8        # 70e0 <_sk_callback_sse2+0xfd5>
+  DB  68,15,40,5,195,45,0,0               ; movaps        0x2dc3(%rip),%xmm8        # 7120 <_sk_callback_sse2+0xfed>
   DB  68,15,40,202                        ; movaps        %xmm2,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  102,69,15,91,201                    ; cvtps2dq      %xmm9,%xmm9
@@ -26760,31 +26845,31 @@
   DB  102,69,15,235,193                   ; por           %xmm9,%xmm8
   DB  102,69,15,235,194                   ; por           %xmm10,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           4395 <_sk_store_bgra_sse2+0x6d>
+  DB  117,10                              ; jne           43bd <_sk_store_bgra_sse2+0x6d>
   DB  243,68,15,127,4,144                 ; movdqu        %xmm8,(%rax,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,3                        ; and           $0x3,%r9b
   DB  65,128,249,1                        ; cmp           $0x1,%r9b
-  DB  116,33                              ; je            43c3 <_sk_store_bgra_sse2+0x9b>
+  DB  116,33                              ; je            43eb <_sk_store_bgra_sse2+0x9b>
   DB  65,128,249,2                        ; cmp           $0x2,%r9b
-  DB  116,19                              ; je            43bb <_sk_store_bgra_sse2+0x93>
+  DB  116,19                              ; je            43e3 <_sk_store_bgra_sse2+0x93>
   DB  65,128,249,3                        ; cmp           $0x3,%r9b
-  DB  117,227                             ; jne           4391 <_sk_store_bgra_sse2+0x69>
+  DB  117,227                             ; jne           43b9 <_sk_store_bgra_sse2+0x69>
   DB  102,69,15,112,200,78                ; pshufd        $0x4e,%xmm8,%xmm9
   DB  102,68,15,126,76,144,8              ; movd          %xmm9,0x8(%rax,%rdx,4)
   DB  102,68,15,214,4,144                 ; movq          %xmm8,(%rax,%rdx,4)
-  DB  235,206                             ; jmp           4391 <_sk_store_bgra_sse2+0x69>
+  DB  235,206                             ; jmp           43b9 <_sk_store_bgra_sse2+0x69>
   DB  102,68,15,126,4,144                 ; movd          %xmm8,(%rax,%rdx,4)
-  DB  235,198                             ; jmp           4391 <_sk_store_bgra_sse2+0x69>
+  DB  235,198                             ; jmp           43b9 <_sk_store_bgra_sse2+0x69>
 
 PUBLIC _sk_load_f16_sse2
 _sk_load_f16_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,96,1,0,0                     ; jne           4539 <_sk_load_f16_sse2+0x16e>
+  DB  15,133,96,1,0,0                     ; jne           4561 <_sk_load_f16_sse2+0x16e>
   DB  102,15,16,4,208                     ; movupd        (%rax,%rdx,8),%xmm0
   DB  102,15,16,76,208,16                 ; movupd        0x10(%rax,%rdx,8),%xmm1
   DB  102,68,15,40,192                    ; movapd        %xmm0,%xmm8
@@ -26796,7 +26881,7 @@
   DB  102,69,15,239,210                   ; pxor          %xmm10,%xmm10
   DB  102,65,15,111,206                   ; movdqa        %xmm14,%xmm1
   DB  102,65,15,97,202                    ; punpcklwd     %xmm10,%xmm1
-  DB  102,68,15,111,13,215,44,0,0         ; movdqa        0x2cd7(%rip),%xmm9        # 70f0 <_sk_callback_sse2+0xfe5>
+  DB  102,68,15,111,13,239,44,0,0         ; movdqa        0x2cef(%rip),%xmm9        # 7130 <_sk_callback_sse2+0xffd>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,193                   ; pand          %xmm9,%xmm0
   DB  102,15,239,200                      ; pxor          %xmm0,%xmm1
@@ -26804,11 +26889,11 @@
   DB  102,68,15,111,233                   ; movdqa        %xmm1,%xmm13
   DB  102,65,15,114,245,13                ; pslld         $0xd,%xmm13
   DB  102,68,15,235,232                   ; por           %xmm0,%xmm13
-  DB  102,68,15,111,29,188,44,0,0         ; movdqa        0x2cbc(%rip),%xmm11        # 7100 <_sk_callback_sse2+0xff5>
+  DB  102,68,15,111,29,212,44,0,0         ; movdqa        0x2cd4(%rip),%xmm11        # 7140 <_sk_callback_sse2+0x100d>
   DB  102,69,15,254,235                   ; paddd         %xmm11,%xmm13
-  DB  102,68,15,111,37,190,44,0,0         ; movdqa        0x2cbe(%rip),%xmm12        # 7110 <_sk_callback_sse2+0x1005>
+  DB  102,68,15,111,37,214,44,0,0         ; movdqa        0x2cd6(%rip),%xmm12        # 7150 <_sk_callback_sse2+0x101d>
   DB  102,65,15,239,204                   ; pxor          %xmm12,%xmm1
-  DB  102,15,111,29,193,44,0,0            ; movdqa        0x2cc1(%rip),%xmm3        # 7120 <_sk_callback_sse2+0x1015>
+  DB  102,15,111,29,217,44,0,0            ; movdqa        0x2cd9(%rip),%xmm3        # 7160 <_sk_callback_sse2+0x102d>
   DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
   DB  102,15,102,193                      ; pcmpgtd       %xmm1,%xmm0
   DB  102,65,15,223,197                   ; pandn         %xmm13,%xmm0
@@ -26856,24 +26941,24 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,15,16,4,208                     ; movsd         (%rax,%rdx,8),%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,17                              ; jne           4555 <_sk_load_f16_sse2+0x18a>
+  DB  117,17                              ; jne           457d <_sk_load_f16_sse2+0x18a>
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
   DB  102,15,20,193                       ; unpcklpd      %xmm1,%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
-  DB  233,143,254,255,255                 ; jmpq          43e4 <_sk_load_f16_sse2+0x19>
+  DB  233,143,254,255,255                 ; jmpq          440c <_sk_load_f16_sse2+0x19>
   DB  102,15,22,68,208,8                  ; movhpd        0x8(%rax,%rdx,8),%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,123,254,255,255              ; jb            43e4 <_sk_load_f16_sse2+0x19>
+  DB  15,130,123,254,255,255              ; jb            440c <_sk_load_f16_sse2+0x19>
   DB  242,15,16,76,208,16                 ; movsd         0x10(%rax,%rdx,8),%xmm1
-  DB  233,112,254,255,255                 ; jmpq          43e4 <_sk_load_f16_sse2+0x19>
+  DB  233,112,254,255,255                 ; jmpq          440c <_sk_load_f16_sse2+0x19>
 
 PUBLIC _sk_load_f16_dst_sse2
 _sk_load_f16_dst_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,96,1,0,0                     ; jne           46e2 <_sk_load_f16_dst_sse2+0x16e>
+  DB  15,133,96,1,0,0                     ; jne           470a <_sk_load_f16_dst_sse2+0x16e>
   DB  102,15,16,36,208                    ; movupd        (%rax,%rdx,8),%xmm4
   DB  102,15,16,108,208,16                ; movupd        0x10(%rax,%rdx,8),%xmm5
   DB  102,68,15,40,196                    ; movapd        %xmm4,%xmm8
@@ -26885,7 +26970,7 @@
   DB  102,69,15,239,210                   ; pxor          %xmm10,%xmm10
   DB  102,65,15,111,238                   ; movdqa        %xmm14,%xmm5
   DB  102,65,15,97,234                    ; punpcklwd     %xmm10,%xmm5
-  DB  102,68,15,111,13,110,43,0,0         ; movdqa        0x2b6e(%rip),%xmm9        # 7130 <_sk_callback_sse2+0x1025>
+  DB  102,68,15,111,13,134,43,0,0         ; movdqa        0x2b86(%rip),%xmm9        # 7170 <_sk_callback_sse2+0x103d>
   DB  102,15,111,229                      ; movdqa        %xmm5,%xmm4
   DB  102,65,15,219,225                   ; pand          %xmm9,%xmm4
   DB  102,15,239,236                      ; pxor          %xmm4,%xmm5
@@ -26893,11 +26978,11 @@
   DB  102,68,15,111,237                   ; movdqa        %xmm5,%xmm13
   DB  102,65,15,114,245,13                ; pslld         $0xd,%xmm13
   DB  102,68,15,235,236                   ; por           %xmm4,%xmm13
-  DB  102,68,15,111,29,83,43,0,0          ; movdqa        0x2b53(%rip),%xmm11        # 7140 <_sk_callback_sse2+0x1035>
+  DB  102,68,15,111,29,107,43,0,0         ; movdqa        0x2b6b(%rip),%xmm11        # 7180 <_sk_callback_sse2+0x104d>
   DB  102,69,15,254,235                   ; paddd         %xmm11,%xmm13
-  DB  102,68,15,111,37,85,43,0,0          ; movdqa        0x2b55(%rip),%xmm12        # 7150 <_sk_callback_sse2+0x1045>
+  DB  102,68,15,111,37,109,43,0,0         ; movdqa        0x2b6d(%rip),%xmm12        # 7190 <_sk_callback_sse2+0x105d>
   DB  102,65,15,239,236                   ; pxor          %xmm12,%xmm5
-  DB  102,15,111,61,88,43,0,0             ; movdqa        0x2b58(%rip),%xmm7        # 7160 <_sk_callback_sse2+0x1055>
+  DB  102,15,111,61,112,43,0,0            ; movdqa        0x2b70(%rip),%xmm7        # 71a0 <_sk_callback_sse2+0x106d>
   DB  102,15,111,231                      ; movdqa        %xmm7,%xmm4
   DB  102,15,102,229                      ; pcmpgtd       %xmm5,%xmm4
   DB  102,65,15,223,229                   ; pandn         %xmm13,%xmm4
@@ -26945,17 +27030,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,15,16,36,208                    ; movsd         (%rax,%rdx,8),%xmm4
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,17                              ; jne           46fe <_sk_load_f16_dst_sse2+0x18a>
+  DB  117,17                              ; jne           4726 <_sk_load_f16_dst_sse2+0x18a>
   DB  102,15,87,237                       ; xorpd         %xmm5,%xmm5
   DB  102,15,20,229                       ; unpcklpd      %xmm5,%xmm4
   DB  102,15,87,237                       ; xorpd         %xmm5,%xmm5
-  DB  233,143,254,255,255                 ; jmpq          458d <_sk_load_f16_dst_sse2+0x19>
+  DB  233,143,254,255,255                 ; jmpq          45b5 <_sk_load_f16_dst_sse2+0x19>
   DB  102,15,22,100,208,8                 ; movhpd        0x8(%rax,%rdx,8),%xmm4
   DB  102,15,87,237                       ; xorpd         %xmm5,%xmm5
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,123,254,255,255              ; jb            458d <_sk_load_f16_dst_sse2+0x19>
+  DB  15,130,123,254,255,255              ; jb            45b5 <_sk_load_f16_dst_sse2+0x19>
   DB  242,15,16,108,208,16                ; movsd         0x10(%rax,%rdx,8),%xmm5
-  DB  233,112,254,255,255                 ; jmpq          458d <_sk_load_f16_dst_sse2+0x19>
+  DB  233,112,254,255,255                 ; jmpq          45b5 <_sk_load_f16_dst_sse2+0x19>
 
 PUBLIC _sk_gather_f16_sse2
 _sk_gather_f16_sse2 LABEL PROC
@@ -26995,7 +27080,7 @@
   DB  102,69,15,239,210                   ; pxor          %xmm10,%xmm10
   DB  102,65,15,111,206                   ; movdqa        %xmm14,%xmm1
   DB  102,65,15,97,202                    ; punpcklwd     %xmm10,%xmm1
-  DB  102,68,15,111,13,170,41,0,0         ; movdqa        0x29aa(%rip),%xmm9        # 7170 <_sk_callback_sse2+0x1065>
+  DB  102,68,15,111,13,194,41,0,0         ; movdqa        0x29c2(%rip),%xmm9        # 71b0 <_sk_callback_sse2+0x107d>
   DB  102,15,111,193                      ; movdqa        %xmm1,%xmm0
   DB  102,65,15,219,193                   ; pand          %xmm9,%xmm0
   DB  102,15,239,200                      ; pxor          %xmm0,%xmm1
@@ -27003,11 +27088,11 @@
   DB  102,68,15,111,233                   ; movdqa        %xmm1,%xmm13
   DB  102,65,15,114,245,13                ; pslld         $0xd,%xmm13
   DB  102,68,15,235,232                   ; por           %xmm0,%xmm13
-  DB  102,68,15,111,29,143,41,0,0         ; movdqa        0x298f(%rip),%xmm11        # 7180 <_sk_callback_sse2+0x1075>
+  DB  102,68,15,111,29,167,41,0,0         ; movdqa        0x29a7(%rip),%xmm11        # 71c0 <_sk_callback_sse2+0x108d>
   DB  102,69,15,254,235                   ; paddd         %xmm11,%xmm13
-  DB  102,68,15,111,37,145,41,0,0         ; movdqa        0x2991(%rip),%xmm12        # 7190 <_sk_callback_sse2+0x1085>
+  DB  102,68,15,111,37,169,41,0,0         ; movdqa        0x29a9(%rip),%xmm12        # 71d0 <_sk_callback_sse2+0x109d>
   DB  102,65,15,239,204                   ; pxor          %xmm12,%xmm1
-  DB  102,15,111,29,148,41,0,0            ; movdqa        0x2994(%rip),%xmm3        # 71a0 <_sk_callback_sse2+0x1095>
+  DB  102,15,111,29,172,41,0,0            ; movdqa        0x29ac(%rip),%xmm3        # 71e0 <_sk_callback_sse2+0x10ad>
   DB  102,15,111,195                      ; movdqa        %xmm3,%xmm0
   DB  102,15,102,193                      ; pcmpgtd       %xmm1,%xmm0
   DB  102,65,15,223,197                   ; pandn         %xmm13,%xmm0
@@ -27059,17 +27144,17 @@
 _sk_store_f16_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,139,0                            ; mov           (%rax),%rax
-  DB  102,68,15,111,21,187,40,0,0         ; movdqa        0x28bb(%rip),%xmm10        # 71b0 <_sk_callback_sse2+0x10a5>
+  DB  102,68,15,111,21,211,40,0,0         ; movdqa        0x28d3(%rip),%xmm10        # 71f0 <_sk_callback_sse2+0x10bd>
   DB  102,68,15,111,224                   ; movdqa        %xmm0,%xmm12
   DB  102,69,15,219,226                   ; pand          %xmm10,%xmm12
   DB  102,68,15,111,232                   ; movdqa        %xmm0,%xmm13
   DB  102,69,15,239,236                   ; pxor          %xmm12,%xmm13
-  DB  102,68,15,111,13,174,40,0,0         ; movdqa        0x28ae(%rip),%xmm9        # 71c0 <_sk_callback_sse2+0x10b5>
+  DB  102,68,15,111,13,198,40,0,0         ; movdqa        0x28c6(%rip),%xmm9        # 7200 <_sk_callback_sse2+0x10cd>
   DB  102,65,15,114,212,16                ; psrld         $0x10,%xmm12
   DB  102,69,15,111,193                   ; movdqa        %xmm9,%xmm8
   DB  102,69,15,102,197                   ; pcmpgtd       %xmm13,%xmm8
   DB  102,65,15,114,213,13                ; psrld         $0xd,%xmm13
-  DB  102,68,15,111,29,159,40,0,0         ; movdqa        0x289f(%rip),%xmm11        # 71d0 <_sk_callback_sse2+0x10c5>
+  DB  102,68,15,111,29,183,40,0,0         ; movdqa        0x28b7(%rip),%xmm11        # 7210 <_sk_callback_sse2+0x10dd>
   DB  102,69,15,235,227                   ; por           %xmm11,%xmm12
   DB  102,69,15,254,229                   ; paddd         %xmm13,%xmm12
   DB  102,65,15,114,244,16                ; pslld         $0x10,%xmm12
@@ -27121,7 +27206,7 @@
   DB  102,69,15,111,200                   ; movdqa        %xmm8,%xmm9
   DB  102,69,15,98,204                    ; punpckldq     %xmm12,%xmm9
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,21                              ; jne           4a53 <_sk_store_f16_sse2+0x16c>
+  DB  117,21                              ; jne           4a7b <_sk_store_f16_sse2+0x16c>
   DB  68,15,17,12,208                     ; movups        %xmm9,(%rax,%rdx,8)
   DB  102,69,15,106,196                   ; punpckhdq     %xmm12,%xmm8
   DB  243,68,15,127,68,208,16             ; movdqu        %xmm8,0x10(%rax,%rdx,8)
@@ -27129,13 +27214,13 @@
   DB  255,224                             ; jmpq          *%rax
   DB  102,68,15,214,12,208                ; movq          %xmm9,(%rax,%rdx,8)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            4a4f <_sk_store_f16_sse2+0x168>
+  DB  116,240                             ; je            4a77 <_sk_store_f16_sse2+0x168>
   DB  102,68,15,23,76,208,8               ; movhpd        %xmm9,0x8(%rax,%rdx,8)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            4a4f <_sk_store_f16_sse2+0x168>
+  DB  114,227                             ; jb            4a77 <_sk_store_f16_sse2+0x168>
   DB  102,69,15,106,196                   ; punpckhdq     %xmm12,%xmm8
   DB  102,68,15,214,68,208,16             ; movq          %xmm8,0x10(%rax,%rdx,8)
-  DB  235,213                             ; jmp           4a4f <_sk_store_f16_sse2+0x168>
+  DB  235,213                             ; jmp           4a77 <_sk_store_f16_sse2+0x168>
 
 PUBLIC _sk_load_u16_be_sse2
 _sk_load_u16_be_sse2 LABEL PROC
@@ -27143,7 +27228,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,190,0,0,0                    ; jne           4b4e <_sk_load_u16_be_sse2+0xd4>
+  DB  15,133,190,0,0,0                    ; jne           4b76 <_sk_load_u16_be_sse2+0xd4>
   DB  102,65,15,16,4,65                   ; movupd        (%r9,%rax,2),%xmm0
   DB  102,65,15,16,76,65,16               ; movupd        0x10(%r9,%rax,2),%xmm1
   DB  102,15,40,208                       ; movapd        %xmm0,%xmm2
@@ -27160,7 +27245,7 @@
   DB  102,69,15,239,201                   ; pxor          %xmm9,%xmm9
   DB  102,65,15,97,201                    ; punpcklwd     %xmm9,%xmm1
   DB  15,91,193                           ; cvtdq2ps      %xmm1,%xmm0
-  DB  68,15,40,5,255,38,0,0               ; movaps        0x26ff(%rip),%xmm8        # 71e0 <_sk_callback_sse2+0x10d5>
+  DB  68,15,40,5,23,39,0,0                ; movaps        0x2717(%rip),%xmm8        # 7220 <_sk_callback_sse2+0x10ed>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
@@ -27188,17 +27273,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  242,65,15,16,4,65                   ; movsd         (%r9,%rax,2),%xmm0
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,17                              ; jne           4b6b <_sk_load_u16_be_sse2+0xf1>
+  DB  117,17                              ; jne           4b93 <_sk_load_u16_be_sse2+0xf1>
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
   DB  102,15,20,193                       ; unpcklpd      %xmm1,%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
-  DB  233,50,255,255,255                  ; jmpq          4a9d <_sk_load_u16_be_sse2+0x23>
+  DB  233,50,255,255,255                  ; jmpq          4ac5 <_sk_load_u16_be_sse2+0x23>
   DB  102,65,15,22,68,65,8                ; movhpd        0x8(%r9,%rax,2),%xmm0
   DB  102,15,87,201                       ; xorpd         %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  15,130,29,255,255,255               ; jb            4a9d <_sk_load_u16_be_sse2+0x23>
+  DB  15,130,29,255,255,255               ; jb            4ac5 <_sk_load_u16_be_sse2+0x23>
   DB  242,65,15,16,76,65,16               ; movsd         0x10(%r9,%rax,2),%xmm1
-  DB  233,17,255,255,255                  ; jmpq          4a9d <_sk_load_u16_be_sse2+0x23>
+  DB  233,17,255,255,255                  ; jmpq          4ac5 <_sk_load_u16_be_sse2+0x23>
 
 PUBLIC _sk_load_rgb_u16_be_sse2
 _sk_load_rgb_u16_be_sse2 LABEL PROC
@@ -27206,7 +27291,7 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,82                         ; lea           (%rdx,%rdx,2),%rax
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,175,0,0,0                    ; jne           4c4d <_sk_load_rgb_u16_be_sse2+0xc1>
+  DB  15,133,175,0,0,0                    ; jne           4c75 <_sk_load_rgb_u16_be_sse2+0xc1>
   DB  243,65,15,111,20,65                 ; movdqu        (%r9,%rax,2),%xmm2
   DB  243,65,15,111,92,65,8               ; movdqu        0x8(%r9,%rax,2),%xmm3
   DB  102,15,115,219,4                    ; psrldq        $0x4,%xmm3
@@ -27227,7 +27312,7 @@
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  102,65,15,97,200                    ; punpcklwd     %xmm8,%xmm1
   DB  15,91,193                           ; cvtdq2ps      %xmm1,%xmm0
-  DB  68,15,40,13,238,37,0,0              ; movaps        0x25ee(%rip),%xmm9        # 71f0 <_sk_callback_sse2+0x10e5>
+  DB  68,15,40,13,6,38,0,0                ; movaps        0x2606(%rip),%xmm9        # 7230 <_sk_callback_sse2+0x10fd>
   DB  65,15,89,193                        ; mulps         %xmm9,%xmm0
   DB  102,15,111,203                      ; movdqa        %xmm3,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
@@ -27244,34 +27329,34 @@
   DB  15,91,210                           ; cvtdq2ps      %xmm2,%xmm2
   DB  65,15,89,209                        ; mulps         %xmm9,%xmm2
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,181,37,0,0                 ; movaps        0x25b5(%rip),%xmm3        # 7200 <_sk_callback_sse2+0x10f5>
+  DB  15,40,29,205,37,0,0                 ; movaps        0x25cd(%rip),%xmm3        # 7240 <_sk_callback_sse2+0x110d>
   DB  255,224                             ; jmpq          *%rax
   DB  102,65,15,110,20,65                 ; movd          (%r9,%rax,2),%xmm2
   DB  102,65,15,196,84,65,4,2             ; pinsrw        $0x2,0x4(%r9,%rax,2),%xmm2
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,13                              ; jne           4c72 <_sk_load_rgb_u16_be_sse2+0xe6>
+  DB  117,13                              ; jne           4c9a <_sk_load_rgb_u16_be_sse2+0xe6>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
-  DB  233,80,255,255,255                  ; jmpq          4bc2 <_sk_load_rgb_u16_be_sse2+0x36>
+  DB  233,80,255,255,255                  ; jmpq          4bea <_sk_load_rgb_u16_be_sse2+0x36>
   DB  102,65,15,110,68,65,6               ; movd          0x6(%r9,%rax,2),%xmm0
   DB  102,65,15,196,68,65,10,2            ; pinsrw        $0x2,0xa(%r9,%rax,2),%xmm0
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,24                              ; jb            4ca3 <_sk_load_rgb_u16_be_sse2+0x117>
+  DB  114,24                              ; jb            4ccb <_sk_load_rgb_u16_be_sse2+0x117>
   DB  102,65,15,110,92,65,12              ; movd          0xc(%r9,%rax,2),%xmm3
   DB  102,65,15,196,92,65,16,2            ; pinsrw        $0x2,0x10(%r9,%rax,2),%xmm3
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  233,31,255,255,255                  ; jmpq          4bc2 <_sk_load_rgb_u16_be_sse2+0x36>
+  DB  233,31,255,255,255                  ; jmpq          4bea <_sk_load_rgb_u16_be_sse2+0x36>
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
-  DB  233,22,255,255,255                  ; jmpq          4bc2 <_sk_load_rgb_u16_be_sse2+0x36>
+  DB  233,22,255,255,255                  ; jmpq          4bea <_sk_load_rgb_u16_be_sse2+0x36>
 
 PUBLIC _sk_store_u16_be_sse2
 _sk_store_u16_be_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  72,141,4,149,0,0,0,0                ; lea           0x0(,%rdx,4),%rax
-  DB  68,15,40,21,79,37,0,0               ; movaps        0x254f(%rip),%xmm10        # 7210 <_sk_callback_sse2+0x1105>
+  DB  68,15,40,21,103,37,0,0              ; movaps        0x2567(%rip),%xmm10        # 7250 <_sk_callback_sse2+0x111d>
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
   DB  69,15,89,194                        ; mulps         %xmm10,%xmm8
   DB  102,69,15,91,192                    ; cvtps2dq      %xmm8,%xmm8
@@ -27316,7 +27401,7 @@
   DB  102,69,15,111,208                   ; movdqa        %xmm8,%xmm10
   DB  102,69,15,98,209                    ; punpckldq     %xmm9,%xmm10
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,21                              ; jne           4dbb <_sk_store_u16_be_sse2+0x10f>
+  DB  117,21                              ; jne           4de3 <_sk_store_u16_be_sse2+0x10f>
   DB  69,15,17,20,65                      ; movups        %xmm10,(%r9,%rax,2)
   DB  102,69,15,106,193                   ; punpckhdq     %xmm9,%xmm8
   DB  243,69,15,127,68,65,16              ; movdqu        %xmm8,0x10(%r9,%rax,2)
@@ -27324,13 +27409,13 @@
   DB  255,224                             ; jmpq          *%rax
   DB  102,69,15,214,20,65                 ; movq          %xmm10,(%r9,%rax,2)
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,240                             ; je            4db7 <_sk_store_u16_be_sse2+0x10b>
+  DB  116,240                             ; je            4ddf <_sk_store_u16_be_sse2+0x10b>
   DB  102,69,15,23,84,65,8                ; movhpd        %xmm10,0x8(%r9,%rax,2)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,227                             ; jb            4db7 <_sk_store_u16_be_sse2+0x10b>
+  DB  114,227                             ; jb            4ddf <_sk_store_u16_be_sse2+0x10b>
   DB  102,69,15,106,193                   ; punpckhdq     %xmm9,%xmm8
   DB  102,69,15,214,68,65,16              ; movq          %xmm8,0x10(%r9,%rax,2)
-  DB  235,213                             ; jmp           4db7 <_sk_store_u16_be_sse2+0x10b>
+  DB  235,213                             ; jmp           4ddf <_sk_store_u16_be_sse2+0x10b>
 
 PUBLIC _sk_load_f32_sse2
 _sk_load_f32_sse2 LABEL PROC
@@ -27341,7 +27426,7 @@
   DB  72,193,224,4                        ; shl           $0x4,%rax
   DB  69,15,16,4,2                        ; movups        (%r10,%rax,1),%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,66                              ; jne           4e42 <_sk_load_f32_sse2+0x60>
+  DB  117,66                              ; jne           4e6a <_sk_load_f32_sse2+0x60>
   DB  67,15,16,68,138,16                  ; movups        0x10(%r10,%r9,4),%xmm0
   DB  67,15,16,92,138,32                  ; movups        0x20(%r10,%r9,4),%xmm3
   DB  71,15,16,76,138,48                  ; movups        0x30(%r10,%r9,4),%xmm9
@@ -27361,17 +27446,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  69,15,87,201                        ; xorps         %xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,8                               ; jne           4e54 <_sk_load_f32_sse2+0x72>
+  DB  117,8                               ; jne           4e7c <_sk_load_f32_sse2+0x72>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
-  DB  235,190                             ; jmp           4e12 <_sk_load_f32_sse2+0x30>
+  DB  235,190                             ; jmp           4e3a <_sk_load_f32_sse2+0x30>
   DB  67,15,16,68,138,16                  ; movups        0x10(%r10,%r9,4),%xmm0
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,8                               ; jb            4e68 <_sk_load_f32_sse2+0x86>
+  DB  114,8                               ; jb            4e90 <_sk_load_f32_sse2+0x86>
   DB  67,15,16,92,138,32                  ; movups        0x20(%r10,%r9,4),%xmm3
-  DB  235,170                             ; jmp           4e12 <_sk_load_f32_sse2+0x30>
+  DB  235,170                             ; jmp           4e3a <_sk_load_f32_sse2+0x30>
   DB  15,87,219                           ; xorps         %xmm3,%xmm3
-  DB  235,165                             ; jmp           4e12 <_sk_load_f32_sse2+0x30>
+  DB  235,165                             ; jmp           4e3a <_sk_load_f32_sse2+0x30>
 
 PUBLIC _sk_load_f32_dst_sse2
 _sk_load_f32_dst_sse2 LABEL PROC
@@ -27382,7 +27467,7 @@
   DB  72,193,224,4                        ; shl           $0x4,%rax
   DB  69,15,16,4,2                        ; movups        (%r10,%rax,1),%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,66                              ; jne           4ecd <_sk_load_f32_dst_sse2+0x60>
+  DB  117,66                              ; jne           4ef5 <_sk_load_f32_dst_sse2+0x60>
   DB  67,15,16,100,138,16                 ; movups        0x10(%r10,%r9,4),%xmm4
   DB  67,15,16,124,138,32                 ; movups        0x20(%r10,%r9,4),%xmm7
   DB  71,15,16,76,138,48                  ; movups        0x30(%r10,%r9,4),%xmm9
@@ -27402,17 +27487,17 @@
   DB  255,224                             ; jmpq          *%rax
   DB  69,15,87,201                        ; xorps         %xmm9,%xmm9
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  117,8                               ; jne           4edf <_sk_load_f32_dst_sse2+0x72>
+  DB  117,8                               ; jne           4f07 <_sk_load_f32_dst_sse2+0x72>
   DB  15,87,255                           ; xorps         %xmm7,%xmm7
   DB  15,87,228                           ; xorps         %xmm4,%xmm4
-  DB  235,190                             ; jmp           4e9d <_sk_load_f32_dst_sse2+0x30>
+  DB  235,190                             ; jmp           4ec5 <_sk_load_f32_dst_sse2+0x30>
   DB  67,15,16,100,138,16                 ; movups        0x10(%r10,%r9,4),%xmm4
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,8                               ; jb            4ef3 <_sk_load_f32_dst_sse2+0x86>
+  DB  114,8                               ; jb            4f1b <_sk_load_f32_dst_sse2+0x86>
   DB  67,15,16,124,138,32                 ; movups        0x20(%r10,%r9,4),%xmm7
-  DB  235,170                             ; jmp           4e9d <_sk_load_f32_dst_sse2+0x30>
+  DB  235,170                             ; jmp           4ec5 <_sk_load_f32_dst_sse2+0x30>
   DB  15,87,255                           ; xorps         %xmm7,%xmm7
-  DB  235,165                             ; jmp           4e9d <_sk_load_f32_dst_sse2+0x30>
+  DB  235,165                             ; jmp           4ec5 <_sk_load_f32_dst_sse2+0x30>
 
 PUBLIC _sk_store_f32_sse2
 _sk_store_f32_sse2 LABEL PROC
@@ -27436,7 +27521,7 @@
   DB  102,69,15,20,203                    ; unpcklpd      %xmm11,%xmm9
   DB  102,69,15,17,36,2                   ; movupd        %xmm12,(%r10,%rax,1)
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,29                              ; jne           4f6a <_sk_store_f32_sse2+0x72>
+  DB  117,29                              ; jne           4f92 <_sk_store_f32_sse2+0x72>
   DB  102,69,15,21,211                    ; unpckhpd      %xmm11,%xmm10
   DB  71,15,17,68,138,16                  ; movups        %xmm8,0x10(%r10,%r9,4)
   DB  102,71,15,17,76,138,32              ; movupd        %xmm9,0x20(%r10,%r9,4)
@@ -27444,12 +27529,12 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
   DB  73,131,248,1                        ; cmp           $0x1,%r8
-  DB  116,246                             ; je            4f66 <_sk_store_f32_sse2+0x6e>
+  DB  116,246                             ; je            4f8e <_sk_store_f32_sse2+0x6e>
   DB  71,15,17,68,138,16                  ; movups        %xmm8,0x10(%r10,%r9,4)
   DB  73,131,248,3                        ; cmp           $0x3,%r8
-  DB  114,234                             ; jb            4f66 <_sk_store_f32_sse2+0x6e>
+  DB  114,234                             ; jb            4f8e <_sk_store_f32_sse2+0x6e>
   DB  102,71,15,17,76,138,32              ; movupd        %xmm9,0x20(%r10,%r9,4)
-  DB  235,225                             ; jmp           4f66 <_sk_store_f32_sse2+0x6e>
+  DB  235,225                             ; jmp           4f8e <_sk_store_f32_sse2+0x6e>
 
 PUBLIC _sk_clamp_x_sse2
 _sk_clamp_x_sse2 LABEL PROC
@@ -27489,7 +27574,7 @@
   DB  243,69,15,91,209                    ; cvttps2dq     %xmm9,%xmm10
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
   DB  69,15,194,202,1                     ; cmpltps       %xmm10,%xmm9
-  DB  68,15,84,13,29,34,0,0               ; andps         0x221d(%rip),%xmm9        # 7220 <_sk_callback_sse2+0x1115>
+  DB  68,15,84,13,53,34,0,0               ; andps         0x2235(%rip),%xmm9        # 7260 <_sk_callback_sse2+0x112d>
   DB  69,15,92,209                        ; subps         %xmm9,%xmm10
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
@@ -27510,7 +27595,7 @@
   DB  243,69,15,91,209                    ; cvttps2dq     %xmm9,%xmm10
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
   DB  69,15,194,202,1                     ; cmpltps       %xmm10,%xmm9
-  DB  68,15,84,13,222,33,0,0              ; andps         0x21de(%rip),%xmm9        # 7230 <_sk_callback_sse2+0x1125>
+  DB  68,15,84,13,246,33,0,0              ; andps         0x21f6(%rip),%xmm9        # 7270 <_sk_callback_sse2+0x113d>
   DB  69,15,92,209                        ; subps         %xmm9,%xmm10
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
   DB  69,15,89,208                        ; mulps         %xmm8,%xmm10
@@ -27531,13 +27616,13 @@
   DB  65,15,92,192                        ; subps         %xmm8,%xmm0
   DB  243,69,15,88,201                    ; addss         %xmm9,%xmm9
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
-  DB  243,68,15,89,21,78,38,0,0           ; mulss         0x264e(%rip),%xmm10        # 76f0 <_sk_callback_sse2+0x15e5>
+  DB  243,68,15,89,21,102,38,0,0          ; mulss         0x2666(%rip),%xmm10        # 7730 <_sk_callback_sse2+0x15fd>
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  68,15,89,208                        ; mulps         %xmm0,%xmm10
   DB  243,69,15,91,218                    ; cvttps2dq     %xmm10,%xmm11
   DB  69,15,91,219                        ; cvtdq2ps      %xmm11,%xmm11
   DB  69,15,194,211,1                     ; cmpltps       %xmm11,%xmm10
-  DB  68,15,84,21,127,33,0,0              ; andps         0x217f(%rip),%xmm10        # 7240 <_sk_callback_sse2+0x1135>
+  DB  68,15,84,21,151,33,0,0              ; andps         0x2197(%rip),%xmm10        # 7280 <_sk_callback_sse2+0x114d>
   DB  69,15,87,228                        ; xorps         %xmm12,%xmm12
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
   DB  69,15,89,217                        ; mulps         %xmm9,%xmm11
@@ -27561,13 +27646,13 @@
   DB  65,15,92,200                        ; subps         %xmm8,%xmm1
   DB  243,69,15,88,201                    ; addss         %xmm9,%xmm9
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
-  DB  243,68,15,89,21,216,37,0,0          ; mulss         0x25d8(%rip),%xmm10        # 76f4 <_sk_callback_sse2+0x15e9>
+  DB  243,68,15,89,21,240,37,0,0          ; mulss         0x25f0(%rip),%xmm10        # 7734 <_sk_callback_sse2+0x1601>
   DB  69,15,198,210,0                     ; shufps        $0x0,%xmm10,%xmm10
   DB  68,15,89,209                        ; mulps         %xmm1,%xmm10
   DB  243,69,15,91,218                    ; cvttps2dq     %xmm10,%xmm11
   DB  69,15,91,219                        ; cvtdq2ps      %xmm11,%xmm11
   DB  69,15,194,211,1                     ; cmpltps       %xmm11,%xmm10
-  DB  68,15,84,21,21,33,0,0               ; andps         0x2115(%rip),%xmm10        # 7250 <_sk_callback_sse2+0x1145>
+  DB  68,15,84,21,45,33,0,0               ; andps         0x212d(%rip),%xmm10        # 7290 <_sk_callback_sse2+0x115d>
   DB  69,15,87,228                        ; xorps         %xmm12,%xmm12
   DB  69,15,92,218                        ; subps         %xmm10,%xmm11
   DB  69,15,89,217                        ; mulps         %xmm9,%xmm11
@@ -27585,7 +27670,7 @@
 _sk_clamp_x_1_sse2 LABEL PROC
   DB  69,15,87,192                        ; xorps         %xmm8,%xmm8
   DB  68,15,95,192                        ; maxps         %xmm0,%xmm8
-  DB  68,15,93,5,231,32,0,0               ; minps         0x20e7(%rip),%xmm8        # 7260 <_sk_callback_sse2+0x1155>
+  DB  68,15,93,5,255,32,0,0               ; minps         0x20ff(%rip),%xmm8        # 72a0 <_sk_callback_sse2+0x116d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  65,15,40,192                        ; movaps        %xmm8,%xmm0
   DB  255,224                             ; jmpq          *%rax
@@ -27596,7 +27681,7 @@
   DB  69,15,91,192                        ; cvtdq2ps      %xmm8,%xmm8
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,194,200,1                     ; cmpltps       %xmm8,%xmm9
-  DB  68,15,84,13,213,32,0,0              ; andps         0x20d5(%rip),%xmm9        # 7270 <_sk_callback_sse2+0x1165>
+  DB  68,15,84,13,237,32,0,0              ; andps         0x20ed(%rip),%xmm9        # 72b0 <_sk_callback_sse2+0x117d>
   DB  69,15,92,193                        ; subps         %xmm9,%xmm8
   DB  65,15,92,192                        ; subps         %xmm8,%xmm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -27604,14 +27689,14 @@
 
 PUBLIC _sk_mirror_x_1_sse2
 _sk_mirror_x_1_sse2 LABEL PROC
-  DB  68,15,40,5,209,32,0,0               ; movaps        0x20d1(%rip),%xmm8        # 7280 <_sk_callback_sse2+0x1175>
+  DB  68,15,40,5,233,32,0,0               ; movaps        0x20e9(%rip),%xmm8        # 72c0 <_sk_callback_sse2+0x118d>
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
-  DB  68,15,40,13,213,32,0,0              ; movaps        0x20d5(%rip),%xmm9        # 7290 <_sk_callback_sse2+0x1185>
+  DB  68,15,40,13,237,32,0,0              ; movaps        0x20ed(%rip),%xmm9        # 72d0 <_sk_callback_sse2+0x119d>
   DB  68,15,89,200                        ; mulps         %xmm0,%xmm9
   DB  243,69,15,91,209                    ; cvttps2dq     %xmm9,%xmm10
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
   DB  69,15,194,202,1                     ; cmpltps       %xmm10,%xmm9
-  DB  68,15,84,13,203,32,0,0              ; andps         0x20cb(%rip),%xmm9        # 72a0 <_sk_callback_sse2+0x1195>
+  DB  68,15,84,13,227,32,0,0              ; andps         0x20e3(%rip),%xmm9        # 72e0 <_sk_callback_sse2+0x11ad>
   DB  69,15,87,219                        ; xorps         %xmm11,%xmm11
   DB  69,15,92,209                        ; subps         %xmm9,%xmm10
   DB  69,15,88,210                        ; addps         %xmm10,%xmm10
@@ -27625,10 +27710,10 @@
 PUBLIC _sk_luminance_to_alpha_sse2
 _sk_luminance_to_alpha_sse2 LABEL PROC
   DB  15,40,218                           ; movaps        %xmm2,%xmm3
-  DB  15,89,5,177,32,0,0                  ; mulps         0x20b1(%rip),%xmm0        # 72b0 <_sk_callback_sse2+0x11a5>
-  DB  15,89,13,186,32,0,0                 ; mulps         0x20ba(%rip),%xmm1        # 72c0 <_sk_callback_sse2+0x11b5>
+  DB  15,89,5,201,32,0,0                  ; mulps         0x20c9(%rip),%xmm0        # 72f0 <_sk_callback_sse2+0x11bd>
+  DB  15,89,13,210,32,0,0                 ; mulps         0x20d2(%rip),%xmm1        # 7300 <_sk_callback_sse2+0x11cd>
   DB  15,88,200                           ; addps         %xmm0,%xmm1
-  DB  15,89,29,192,32,0,0                 ; mulps         0x20c0(%rip),%xmm3        # 72d0 <_sk_callback_sse2+0x11c5>
+  DB  15,89,29,216,32,0,0                 ; mulps         0x20d8(%rip),%xmm3        # 7310 <_sk_callback_sse2+0x11dd>
   DB  15,88,217                           ; addps         %xmm1,%xmm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,87,192                           ; xorps         %xmm0,%xmm0
@@ -27924,9 +28009,9 @@
   DB  72,139,24                           ; mov           (%rax),%rbx
   DB  76,139,112,8                        ; mov           0x8(%rax),%r14
   DB  72,255,203                          ; dec           %rbx
-  DB  120,7                               ; js            56b0 <_sk_evenly_spaced_gradient_sse2+0x18>
+  DB  120,7                               ; js            56d8 <_sk_evenly_spaced_gradient_sse2+0x18>
   DB  243,72,15,42,203                    ; cvtsi2ss      %rbx,%xmm1
-  DB  235,21                              ; jmp           56c5 <_sk_evenly_spaced_gradient_sse2+0x2d>
+  DB  235,21                              ; jmp           56ed <_sk_evenly_spaced_gradient_sse2+0x2d>
   DB  73,137,217                          ; mov           %rbx,%r9
   DB  73,209,233                          ; shr           %r9
   DB  131,227,1                           ; and           $0x1,%ebx
@@ -28022,15 +28107,15 @@
 
 PUBLIC _sk_gauss_a_to_rgba_sse2
 _sk_gauss_a_to_rgba_sse2 LABEL PROC
-  DB  15,40,5,143,26,0,0                  ; movaps        0x1a8f(%rip),%xmm0        # 72e0 <_sk_callback_sse2+0x11d5>
+  DB  15,40,5,167,26,0,0                  ; movaps        0x1aa7(%rip),%xmm0        # 7320 <_sk_callback_sse2+0x11ed>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,149,26,0,0                  ; addps         0x1a95(%rip),%xmm0        # 72f0 <_sk_callback_sse2+0x11e5>
+  DB  15,88,5,173,26,0,0                  ; addps         0x1aad(%rip),%xmm0        # 7330 <_sk_callback_sse2+0x11fd>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,155,26,0,0                  ; addps         0x1a9b(%rip),%xmm0        # 7300 <_sk_callback_sse2+0x11f5>
+  DB  15,88,5,179,26,0,0                  ; addps         0x1ab3(%rip),%xmm0        # 7340 <_sk_callback_sse2+0x120d>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,161,26,0,0                  ; addps         0x1aa1(%rip),%xmm0        # 7310 <_sk_callback_sse2+0x1205>
+  DB  15,88,5,185,26,0,0                  ; addps         0x1ab9(%rip),%xmm0        # 7350 <_sk_callback_sse2+0x121d>
   DB  15,89,195                           ; mulps         %xmm3,%xmm0
-  DB  15,88,5,167,26,0,0                  ; addps         0x1aa7(%rip),%xmm0        # 7320 <_sk_callback_sse2+0x1215>
+  DB  15,88,5,191,26,0,0                  ; addps         0x1abf(%rip),%xmm0        # 7360 <_sk_callback_sse2+0x122d>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,40,200                           ; movaps        %xmm0,%xmm1
   DB  15,40,208                           ; movaps        %xmm0,%xmm2
@@ -28046,12 +28131,12 @@
   DB  76,139,8                            ; mov           (%rax),%r9
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
   DB  73,131,249,2                        ; cmp           $0x2,%r9
-  DB  114,50                              ; jb            58cc <_sk_gradient_sse2+0x46>
+  DB  114,50                              ; jb            58f4 <_sk_gradient_sse2+0x46>
   DB  72,139,88,72                        ; mov           0x48(%rax),%rbx
   DB  73,255,201                          ; dec           %r9
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  102,15,239,201                      ; pxor          %xmm1,%xmm1
-  DB  15,40,21,128,26,0,0                 ; movaps        0x1a80(%rip),%xmm2        # 7330 <_sk_callback_sse2+0x1225>
+  DB  15,40,21,152,26,0,0                 ; movaps        0x1a98(%rip),%xmm2        # 7370 <_sk_callback_sse2+0x123d>
   DB  243,15,16,27                        ; movss         (%rbx),%xmm3
   DB  15,198,219,0                        ; shufps        $0x0,%xmm3,%xmm3
   DB  15,194,216,2                        ; cmpleps       %xmm0,%xmm3
@@ -28059,7 +28144,7 @@
   DB  102,15,254,203                      ; paddd         %xmm3,%xmm1
   DB  72,131,195,4                        ; add           $0x4,%rbx
   DB  73,255,201                          ; dec           %r9
-  DB  117,228                             ; jne           58b0 <_sk_gradient_sse2+0x2a>
+  DB  117,228                             ; jne           58d8 <_sk_gradient_sse2+0x2a>
   DB  102,15,112,209,78                   ; pshufd        $0x4e,%xmm1,%xmm2
   DB  102,73,15,126,211                   ; movq          %xmm2,%r11
   DB  69,137,217                          ; mov           %r11d,%r9d
@@ -28194,29 +28279,29 @@
   DB  69,15,94,220                        ; divps         %xmm12,%xmm11
   DB  69,15,40,227                        ; movaps        %xmm11,%xmm12
   DB  69,15,89,228                        ; mulps         %xmm12,%xmm12
-  DB  68,15,40,45,65,24,0,0               ; movaps        0x1841(%rip),%xmm13        # 7340 <_sk_callback_sse2+0x1235>
+  DB  68,15,40,45,89,24,0,0               ; movaps        0x1859(%rip),%xmm13        # 7380 <_sk_callback_sse2+0x124d>
   DB  69,15,89,236                        ; mulps         %xmm12,%xmm13
-  DB  68,15,88,45,69,24,0,0               ; addps         0x1845(%rip),%xmm13        # 7350 <_sk_callback_sse2+0x1245>
+  DB  68,15,88,45,93,24,0,0               ; addps         0x185d(%rip),%xmm13        # 7390 <_sk_callback_sse2+0x125d>
   DB  69,15,89,236                        ; mulps         %xmm12,%xmm13
-  DB  68,15,88,45,73,24,0,0               ; addps         0x1849(%rip),%xmm13        # 7360 <_sk_callback_sse2+0x1255>
+  DB  68,15,88,45,97,24,0,0               ; addps         0x1861(%rip),%xmm13        # 73a0 <_sk_callback_sse2+0x126d>
   DB  69,15,89,236                        ; mulps         %xmm12,%xmm13
-  DB  68,15,88,45,77,24,0,0               ; addps         0x184d(%rip),%xmm13        # 7370 <_sk_callback_sse2+0x1265>
+  DB  68,15,88,45,101,24,0,0              ; addps         0x1865(%rip),%xmm13        # 73b0 <_sk_callback_sse2+0x127d>
   DB  69,15,89,235                        ; mulps         %xmm11,%xmm13
   DB  69,15,194,202,1                     ; cmpltps       %xmm10,%xmm9
-  DB  68,15,40,21,76,24,0,0               ; movaps        0x184c(%rip),%xmm10        # 7380 <_sk_callback_sse2+0x1275>
+  DB  68,15,40,21,100,24,0,0              ; movaps        0x1864(%rip),%xmm10        # 73c0 <_sk_callback_sse2+0x128d>
   DB  69,15,92,213                        ; subps         %xmm13,%xmm10
   DB  69,15,84,209                        ; andps         %xmm9,%xmm10
   DB  69,15,85,205                        ; andnps        %xmm13,%xmm9
   DB  69,15,86,202                        ; orps          %xmm10,%xmm9
   DB  68,15,194,192,1                     ; cmpltps       %xmm0,%xmm8
-  DB  68,15,40,21,63,24,0,0               ; movaps        0x183f(%rip),%xmm10        # 7390 <_sk_callback_sse2+0x1285>
+  DB  68,15,40,21,87,24,0,0               ; movaps        0x1857(%rip),%xmm10        # 73d0 <_sk_callback_sse2+0x129d>
   DB  69,15,92,209                        ; subps         %xmm9,%xmm10
   DB  69,15,84,208                        ; andps         %xmm8,%xmm10
   DB  69,15,85,193                        ; andnps        %xmm9,%xmm8
   DB  69,15,86,194                        ; orps          %xmm10,%xmm8
   DB  68,15,40,201                        ; movaps        %xmm1,%xmm9
   DB  68,15,194,200,1                     ; cmpltps       %xmm0,%xmm9
-  DB  68,15,40,21,46,24,0,0               ; movaps        0x182e(%rip),%xmm10        # 73a0 <_sk_callback_sse2+0x1295>
+  DB  68,15,40,21,70,24,0,0               ; movaps        0x1846(%rip),%xmm10        # 73e0 <_sk_callback_sse2+0x12ad>
   DB  69,15,92,208                        ; subps         %xmm8,%xmm10
   DB  69,15,84,209                        ; andps         %xmm9,%xmm10
   DB  69,15,85,200                        ; andnps        %xmm8,%xmm9
@@ -28247,7 +28332,7 @@
   DB  243,69,15,89,203                    ; mulss         %xmm11,%xmm9
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
   DB  68,15,88,200                        ; addps         %xmm0,%xmm9
-  DB  68,15,89,13,213,23,0,0              ; mulps         0x17d5(%rip),%xmm9        # 73b0 <_sk_callback_sse2+0x12a5>
+  DB  68,15,89,13,237,23,0,0              ; mulps         0x17ed(%rip),%xmm9        # 73f0 <_sk_callback_sse2+0x12bd>
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
   DB  68,15,40,225                        ; movaps        %xmm1,%xmm12
   DB  69,15,89,228                        ; mulps         %xmm12,%xmm12
@@ -28255,7 +28340,7 @@
   DB  243,69,15,89,219                    ; mulss         %xmm11,%xmm11
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,92,227                        ; subps         %xmm11,%xmm12
-  DB  68,15,89,21,192,23,0,0              ; mulps         0x17c0(%rip),%xmm10        # 73c0 <_sk_callback_sse2+0x12b5>
+  DB  68,15,89,21,216,23,0,0              ; mulps         0x17d8(%rip),%xmm10        # 7400 <_sk_callback_sse2+0x12cd>
   DB  69,15,89,212                        ; mulps         %xmm12,%xmm10
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
@@ -28264,8 +28349,8 @@
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  65,15,92,193                        ; subps         %xmm9,%xmm0
-  DB  68,15,87,13,168,23,0,0              ; xorps         0x17a8(%rip),%xmm9        # 73d0 <_sk_callback_sse2+0x12c5>
-  DB  68,15,89,5,176,23,0,0               ; mulps         0x17b0(%rip),%xmm8        # 73e0 <_sk_callback_sse2+0x12d5>
+  DB  68,15,87,13,192,23,0,0              ; xorps         0x17c0(%rip),%xmm9        # 7410 <_sk_callback_sse2+0x12dd>
+  DB  68,15,89,5,200,23,0,0               ; mulps         0x17c8(%rip),%xmm8        # 7420 <_sk_callback_sse2+0x12ed>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  69,15,92,202                        ; subps         %xmm10,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
@@ -28284,7 +28369,7 @@
   DB  243,69,15,89,203                    ; mulss         %xmm11,%xmm9
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
   DB  68,15,88,200                        ; addps         %xmm0,%xmm9
-  DB  68,15,89,13,119,23,0,0              ; mulps         0x1777(%rip),%xmm9        # 73f0 <_sk_callback_sse2+0x12e5>
+  DB  68,15,89,13,143,23,0,0              ; mulps         0x178f(%rip),%xmm9        # 7430 <_sk_callback_sse2+0x12fd>
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
   DB  68,15,40,225                        ; movaps        %xmm1,%xmm12
   DB  69,15,89,228                        ; mulps         %xmm12,%xmm12
@@ -28292,7 +28377,7 @@
   DB  243,69,15,89,219                    ; mulss         %xmm11,%xmm11
   DB  69,15,198,219,0                     ; shufps        $0x0,%xmm11,%xmm11
   DB  69,15,92,227                        ; subps         %xmm11,%xmm12
-  DB  68,15,89,21,98,23,0,0               ; mulps         0x1762(%rip),%xmm10        # 7400 <_sk_callback_sse2+0x12f5>
+  DB  68,15,89,21,122,23,0,0              ; mulps         0x177a(%rip),%xmm10        # 7440 <_sk_callback_sse2+0x130d>
   DB  69,15,89,212                        ; mulps         %xmm12,%xmm10
   DB  65,15,40,193                        ; movaps        %xmm9,%xmm0
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
@@ -28301,8 +28386,8 @@
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
   DB  65,15,40,194                        ; movaps        %xmm10,%xmm0
   DB  65,15,92,193                        ; subps         %xmm9,%xmm0
-  DB  68,15,87,13,74,23,0,0               ; xorps         0x174a(%rip),%xmm9        # 7410 <_sk_callback_sse2+0x1305>
-  DB  68,15,89,5,82,23,0,0                ; mulps         0x1752(%rip),%xmm8        # 7420 <_sk_callback_sse2+0x1315>
+  DB  68,15,87,13,98,23,0,0               ; xorps         0x1762(%rip),%xmm9        # 7450 <_sk_callback_sse2+0x131d>
+  DB  68,15,89,5,106,23,0,0               ; mulps         0x176a(%rip),%xmm8        # 7460 <_sk_callback_sse2+0x132d>
   DB  65,15,89,192                        ; mulps         %xmm8,%xmm0
   DB  69,15,92,202                        ; subps         %xmm10,%xmm9
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
@@ -28318,7 +28403,7 @@
   DB  243,69,15,89,200                    ; mulss         %xmm8,%xmm9
   DB  69,15,198,201,0                     ; shufps        $0x0,%xmm9,%xmm9
   DB  68,15,88,200                        ; addps         %xmm0,%xmm9
-  DB  68,15,89,13,42,23,0,0               ; mulps         0x172a(%rip),%xmm9        # 7430 <_sk_callback_sse2+0x1325>
+  DB  68,15,89,13,66,23,0,0               ; mulps         0x1742(%rip),%xmm9        # 7470 <_sk_callback_sse2+0x133d>
   DB  15,89,192                           ; mulps         %xmm0,%xmm0
   DB  68,15,40,209                        ; movaps        %xmm1,%xmm10
   DB  69,15,89,210                        ; mulps         %xmm10,%xmm10
@@ -28326,7 +28411,7 @@
   DB  243,69,15,89,192                    ; mulss         %xmm8,%xmm8
   DB  69,15,198,192,0                     ; shufps        $0x0,%xmm8,%xmm8
   DB  65,15,92,192                        ; subps         %xmm8,%xmm0
-  DB  15,87,5,22,23,0,0                   ; xorps         0x1716(%rip),%xmm0        # 7440 <_sk_callback_sse2+0x1335>
+  DB  15,87,5,46,23,0,0                   ; xorps         0x172e(%rip),%xmm0        # 7480 <_sk_callback_sse2+0x134d>
   DB  65,15,94,193                        ; divps         %xmm9,%xmm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -28363,7 +28448,7 @@
 PUBLIC _sk_save_xy_sse2
 _sk_save_xy_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,188,22,0,0               ; movaps        0x16bc(%rip),%xmm8        # 7450 <_sk_callback_sse2+0x1345>
+  DB  68,15,40,5,212,22,0,0               ; movaps        0x16d4(%rip),%xmm8        # 7490 <_sk_callback_sse2+0x135d>
   DB  15,17,0                             ; movups        %xmm0,(%rax)
   DB  68,15,40,200                        ; movaps        %xmm0,%xmm9
   DB  69,15,88,200                        ; addps         %xmm8,%xmm9
@@ -28371,7 +28456,7 @@
   DB  69,15,91,210                        ; cvtdq2ps      %xmm10,%xmm10
   DB  69,15,40,217                        ; movaps        %xmm9,%xmm11
   DB  69,15,194,218,1                     ; cmpltps       %xmm10,%xmm11
-  DB  68,15,40,37,167,22,0,0              ; movaps        0x16a7(%rip),%xmm12        # 7460 <_sk_callback_sse2+0x1355>
+  DB  68,15,40,37,191,22,0,0              ; movaps        0x16bf(%rip),%xmm12        # 74a0 <_sk_callback_sse2+0x136d>
   DB  69,15,84,220                        ; andps         %xmm12,%xmm11
   DB  69,15,92,211                        ; subps         %xmm11,%xmm10
   DB  69,15,92,202                        ; subps         %xmm10,%xmm9
@@ -28414,8 +28499,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,32,22,0,0                   ; addps         0x1620(%rip),%xmm0        # 7470 <_sk_callback_sse2+0x1365>
-  DB  68,15,40,13,40,22,0,0               ; movaps        0x1628(%rip),%xmm9        # 7480 <_sk_callback_sse2+0x1375>
+  DB  15,88,5,56,22,0,0                   ; addps         0x1638(%rip),%xmm0        # 74b0 <_sk_callback_sse2+0x137d>
+  DB  68,15,40,13,64,22,0,0               ; movaps        0x1640(%rip),%xmm9        # 74c0 <_sk_callback_sse2+0x138d>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  68,15,17,136,128,0,0,0              ; movups        %xmm9,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -28426,7 +28511,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,23,22,0,0                   ; addps         0x1617(%rip),%xmm0        # 7490 <_sk_callback_sse2+0x1385>
+  DB  15,88,5,47,22,0,0                   ; addps         0x162f(%rip),%xmm0        # 74d0 <_sk_callback_sse2+0x139d>
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -28436,8 +28521,8 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,9,22,0,0                   ; addps         0x1609(%rip),%xmm1        # 74a0 <_sk_callback_sse2+0x1395>
-  DB  68,15,40,13,17,22,0,0               ; movaps        0x1611(%rip),%xmm9        # 74b0 <_sk_callback_sse2+0x13a5>
+  DB  15,88,13,33,22,0,0                  ; addps         0x1621(%rip),%xmm1        # 74e0 <_sk_callback_sse2+0x13ad>
+  DB  68,15,40,13,41,22,0,0               ; movaps        0x1629(%rip),%xmm9        # 74f0 <_sk_callback_sse2+0x13bd>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  68,15,17,136,160,0,0,0              ; movups        %xmm9,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -28448,7 +28533,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,255,21,0,0                 ; addps         0x15ff(%rip),%xmm1        # 74c0 <_sk_callback_sse2+0x13b5>
+  DB  15,88,13,23,22,0,0                  ; addps         0x1617(%rip),%xmm1        # 7500 <_sk_callback_sse2+0x13cd>
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -28458,13 +28543,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,242,21,0,0                  ; addps         0x15f2(%rip),%xmm0        # 74d0 <_sk_callback_sse2+0x13c5>
-  DB  68,15,40,13,250,21,0,0              ; movaps        0x15fa(%rip),%xmm9        # 74e0 <_sk_callback_sse2+0x13d5>
+  DB  15,88,5,10,22,0,0                   ; addps         0x160a(%rip),%xmm0        # 7510 <_sk_callback_sse2+0x13dd>
+  DB  68,15,40,13,18,22,0,0               ; movaps        0x1612(%rip),%xmm9        # 7520 <_sk_callback_sse2+0x13ed>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  69,15,89,192                        ; mulps         %xmm8,%xmm8
-  DB  68,15,89,13,246,21,0,0              ; mulps         0x15f6(%rip),%xmm9        # 74f0 <_sk_callback_sse2+0x13e5>
-  DB  68,15,88,13,254,21,0,0              ; addps         0x15fe(%rip),%xmm9        # 7500 <_sk_callback_sse2+0x13f5>
+  DB  68,15,89,13,14,22,0,0               ; mulps         0x160e(%rip),%xmm9        # 7530 <_sk_callback_sse2+0x13fd>
+  DB  68,15,88,13,22,22,0,0               ; addps         0x1616(%rip),%xmm9        # 7540 <_sk_callback_sse2+0x140d>
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  68,15,17,136,128,0,0,0              ; movups        %xmm9,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -28475,16 +28560,16 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,237,21,0,0                  ; addps         0x15ed(%rip),%xmm0        # 7510 <_sk_callback_sse2+0x1405>
-  DB  68,15,40,13,245,21,0,0              ; movaps        0x15f5(%rip),%xmm9        # 7520 <_sk_callback_sse2+0x1415>
+  DB  15,88,5,5,22,0,0                    ; addps         0x1605(%rip),%xmm0        # 7550 <_sk_callback_sse2+0x141d>
+  DB  68,15,40,13,13,22,0,0               ; movaps        0x160d(%rip),%xmm9        # 7560 <_sk_callback_sse2+0x142d>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
-  DB  68,15,40,5,249,21,0,0               ; movaps        0x15f9(%rip),%xmm8        # 7530 <_sk_callback_sse2+0x1425>
+  DB  68,15,40,5,17,22,0,0                ; movaps        0x1611(%rip),%xmm8        # 7570 <_sk_callback_sse2+0x143d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,253,21,0,0               ; addps         0x15fd(%rip),%xmm8        # 7540 <_sk_callback_sse2+0x1435>
+  DB  68,15,88,5,21,22,0,0                ; addps         0x1615(%rip),%xmm8        # 7580 <_sk_callback_sse2+0x144d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,1,22,0,0                 ; addps         0x1601(%rip),%xmm8        # 7550 <_sk_callback_sse2+0x1445>
+  DB  68,15,88,5,25,22,0,0                ; addps         0x1619(%rip),%xmm8        # 7590 <_sk_callback_sse2+0x145d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,5,22,0,0                 ; addps         0x1605(%rip),%xmm8        # 7560 <_sk_callback_sse2+0x1455>
+  DB  68,15,88,5,29,22,0,0                ; addps         0x161d(%rip),%xmm8        # 75a0 <_sk_callback_sse2+0x146d>
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -28492,17 +28577,17 @@
 PUBLIC _sk_bicubic_p1x_sse2
 _sk_bicubic_p1x_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,255,21,0,0               ; movaps        0x15ff(%rip),%xmm8        # 7570 <_sk_callback_sse2+0x1465>
+  DB  68,15,40,5,23,22,0,0                ; movaps        0x1617(%rip),%xmm8        # 75b0 <_sk_callback_sse2+0x147d>
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,72,64                      ; movups        0x40(%rax),%xmm9
   DB  65,15,88,192                        ; addps         %xmm8,%xmm0
-  DB  68,15,40,21,251,21,0,0              ; movaps        0x15fb(%rip),%xmm10        # 7580 <_sk_callback_sse2+0x1475>
+  DB  68,15,40,21,19,22,0,0               ; movaps        0x1613(%rip),%xmm10        # 75c0 <_sk_callback_sse2+0x148d>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,255,21,0,0              ; addps         0x15ff(%rip),%xmm10        # 7590 <_sk_callback_sse2+0x1485>
+  DB  68,15,88,21,23,22,0,0               ; addps         0x1617(%rip),%xmm10        # 75d0 <_sk_callback_sse2+0x149d>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,251,21,0,0              ; addps         0x15fb(%rip),%xmm10        # 75a0 <_sk_callback_sse2+0x1495>
+  DB  68,15,88,21,19,22,0,0               ; addps         0x1613(%rip),%xmm10        # 75e0 <_sk_callback_sse2+0x14ad>
   DB  68,15,17,144,128,0,0,0              ; movups        %xmm10,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -28512,11 +28597,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,0                             ; movups        (%rax),%xmm0
   DB  68,15,16,64,64                      ; movups        0x40(%rax),%xmm8
-  DB  15,88,5,238,21,0,0                  ; addps         0x15ee(%rip),%xmm0        # 75b0 <_sk_callback_sse2+0x14a5>
+  DB  15,88,5,6,22,0,0                    ; addps         0x1606(%rip),%xmm0        # 75f0 <_sk_callback_sse2+0x14bd>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  69,15,89,201                        ; mulps         %xmm9,%xmm9
-  DB  68,15,89,5,238,21,0,0               ; mulps         0x15ee(%rip),%xmm8        # 75c0 <_sk_callback_sse2+0x14b5>
-  DB  68,15,88,5,246,21,0,0               ; addps         0x15f6(%rip),%xmm8        # 75d0 <_sk_callback_sse2+0x14c5>
+  DB  68,15,89,5,6,22,0,0                 ; mulps         0x1606(%rip),%xmm8        # 7600 <_sk_callback_sse2+0x14cd>
+  DB  68,15,88,5,14,22,0,0                ; addps         0x160e(%rip),%xmm8        # 7610 <_sk_callback_sse2+0x14dd>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  68,15,17,128,128,0,0,0              ; movups        %xmm8,0x80(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -28527,13 +28612,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,228,21,0,0                 ; addps         0x15e4(%rip),%xmm1        # 75e0 <_sk_callback_sse2+0x14d5>
-  DB  68,15,40,13,236,21,0,0              ; movaps        0x15ec(%rip),%xmm9        # 75f0 <_sk_callback_sse2+0x14e5>
+  DB  15,88,13,252,21,0,0                 ; addps         0x15fc(%rip),%xmm1        # 7620 <_sk_callback_sse2+0x14ed>
+  DB  68,15,40,13,4,22,0,0                ; movaps        0x1604(%rip),%xmm9        # 7630 <_sk_callback_sse2+0x14fd>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
   DB  69,15,40,193                        ; movaps        %xmm9,%xmm8
   DB  69,15,89,192                        ; mulps         %xmm8,%xmm8
-  DB  68,15,89,13,232,21,0,0              ; mulps         0x15e8(%rip),%xmm9        # 7600 <_sk_callback_sse2+0x14f5>
-  DB  68,15,88,13,240,21,0,0              ; addps         0x15f0(%rip),%xmm9        # 7610 <_sk_callback_sse2+0x1505>
+  DB  68,15,89,13,0,22,0,0                ; mulps         0x1600(%rip),%xmm9        # 7640 <_sk_callback_sse2+0x150d>
+  DB  68,15,88,13,8,22,0,0                ; addps         0x1608(%rip),%xmm9        # 7650 <_sk_callback_sse2+0x151d>
   DB  69,15,89,200                        ; mulps         %xmm8,%xmm9
   DB  68,15,17,136,160,0,0,0              ; movups        %xmm9,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -28544,16 +28629,16 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,222,21,0,0                 ; addps         0x15de(%rip),%xmm1        # 7620 <_sk_callback_sse2+0x1515>
-  DB  68,15,40,13,230,21,0,0              ; movaps        0x15e6(%rip),%xmm9        # 7630 <_sk_callback_sse2+0x1525>
+  DB  15,88,13,246,21,0,0                 ; addps         0x15f6(%rip),%xmm1        # 7660 <_sk_callback_sse2+0x152d>
+  DB  68,15,40,13,254,21,0,0              ; movaps        0x15fe(%rip),%xmm9        # 7670 <_sk_callback_sse2+0x153d>
   DB  69,15,92,200                        ; subps         %xmm8,%xmm9
-  DB  68,15,40,5,234,21,0,0               ; movaps        0x15ea(%rip),%xmm8        # 7640 <_sk_callback_sse2+0x1535>
+  DB  68,15,40,5,2,22,0,0                 ; movaps        0x1602(%rip),%xmm8        # 7680 <_sk_callback_sse2+0x154d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,238,21,0,0               ; addps         0x15ee(%rip),%xmm8        # 7650 <_sk_callback_sse2+0x1545>
+  DB  68,15,88,5,6,22,0,0                 ; addps         0x1606(%rip),%xmm8        # 7690 <_sk_callback_sse2+0x155d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,242,21,0,0               ; addps         0x15f2(%rip),%xmm8        # 7660 <_sk_callback_sse2+0x1555>
+  DB  68,15,88,5,10,22,0,0                ; addps         0x160a(%rip),%xmm8        # 76a0 <_sk_callback_sse2+0x156d>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
-  DB  68,15,88,5,246,21,0,0               ; addps         0x15f6(%rip),%xmm8        # 7670 <_sk_callback_sse2+0x1565>
+  DB  68,15,88,5,14,22,0,0                ; addps         0x160e(%rip),%xmm8        # 76b0 <_sk_callback_sse2+0x157d>
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -28561,17 +28646,17 @@
 PUBLIC _sk_bicubic_p1y_sse2
 _sk_bicubic_p1y_sse2 LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  68,15,40,5,240,21,0,0               ; movaps        0x15f0(%rip),%xmm8        # 7680 <_sk_callback_sse2+0x1575>
+  DB  68,15,40,5,8,22,0,0                 ; movaps        0x1608(%rip),%xmm8        # 76c0 <_sk_callback_sse2+0x158d>
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,72,96                      ; movups        0x60(%rax),%xmm9
   DB  65,15,88,200                        ; addps         %xmm8,%xmm1
-  DB  68,15,40,21,235,21,0,0              ; movaps        0x15eb(%rip),%xmm10        # 7690 <_sk_callback_sse2+0x1585>
+  DB  68,15,40,21,3,22,0,0                ; movaps        0x1603(%rip),%xmm10        # 76d0 <_sk_callback_sse2+0x159d>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,239,21,0,0              ; addps         0x15ef(%rip),%xmm10        # 76a0 <_sk_callback_sse2+0x1595>
+  DB  68,15,88,21,7,22,0,0                ; addps         0x1607(%rip),%xmm10        # 76e0 <_sk_callback_sse2+0x15ad>
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
   DB  69,15,88,208                        ; addps         %xmm8,%xmm10
   DB  69,15,89,209                        ; mulps         %xmm9,%xmm10
-  DB  68,15,88,21,235,21,0,0              ; addps         0x15eb(%rip),%xmm10        # 76b0 <_sk_callback_sse2+0x15a5>
+  DB  68,15,88,21,3,22,0,0                ; addps         0x1603(%rip),%xmm10        # 76f0 <_sk_callback_sse2+0x15bd>
   DB  68,15,17,144,160,0,0,0              ; movups        %xmm10,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -28581,11 +28666,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,72,32                         ; movups        0x20(%rax),%xmm1
   DB  68,15,16,64,96                      ; movups        0x60(%rax),%xmm8
-  DB  15,88,13,221,21,0,0                 ; addps         0x15dd(%rip),%xmm1        # 76c0 <_sk_callback_sse2+0x15b5>
+  DB  15,88,13,245,21,0,0                 ; addps         0x15f5(%rip),%xmm1        # 7700 <_sk_callback_sse2+0x15cd>
   DB  69,15,40,200                        ; movaps        %xmm8,%xmm9
   DB  69,15,89,201                        ; mulps         %xmm9,%xmm9
-  DB  68,15,89,5,221,21,0,0               ; mulps         0x15dd(%rip),%xmm8        # 76d0 <_sk_callback_sse2+0x15c5>
-  DB  68,15,88,5,229,21,0,0               ; addps         0x15e5(%rip),%xmm8        # 76e0 <_sk_callback_sse2+0x15d5>
+  DB  68,15,89,5,245,21,0,0               ; mulps         0x15f5(%rip),%xmm8        # 7710 <_sk_callback_sse2+0x15dd>
+  DB  68,15,88,5,253,21,0,0               ; addps         0x15fd(%rip),%xmm8        # 7720 <_sk_callback_sse2+0x15ed>
   DB  69,15,89,193                        ; mulps         %xmm9,%xmm8
   DB  68,15,17,128,160,0,0,0              ; movups        %xmm8,0xa0(%rax)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -28798,16 +28883,26 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
+  DB  63                                  ; (bad)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  128,63,0                            ; cmpb          $0x0,(%rdi)
+  DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
+  DB  63                                  ; (bad)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  128,63,0                            ; cmpb          $0x0,(%rdi)
+  DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
+  DB  63                                  ; (bad)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  128,63,0                            ; cmpb          $0x0,(%rdi)
+  DB  0,128,191,0,0,128                   ; add           %al,-0x7fffff41(%rax)
   DB  191,0,0,128,191                     ; mov           $0xbf800000,%edi
   DB  0,0                                 ; add           %al,(%rax)
-  DB  128,191,0,0,128,191,0               ; cmpb          $0x0,-0x40800000(%rdi)
+  DB  128,191,0,0,224,64,0                ; cmpb          $0x0,0x40e00000(%rdi)
   DB  0,224                               ; add           %ah,%al
   DB  64,0,0                              ; add           %al,(%rax)
-  DB  224,64                              ; loopne        63b8 <.literal16+0x1d8>
+  DB  224,64                              ; loopne        63fc <.literal16+0x1fc>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,64                              ; loopne        63bc <.literal16+0x1dc>
-  DB  0,0                                 ; add           %al,(%rax)
-  DB  224,64                              ; loopne        63c0 <.literal16+0x1e0>
+  DB  224,64                              ; loopne        6400 <.literal16+0x200>
   DB  154                                 ; (bad)
   DB  153                                 ; cltd
   DB  153                                 ; cltd
@@ -28827,13 +28922,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 63e1 <.literal16+0x201>
+  DB  71,225,61                           ; rex.RXB       loope 6421 <.literal16+0x221>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 63e5 <.literal16+0x205>
+  DB  71,225,61                           ; rex.RXB       loope 6425 <.literal16+0x225>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 63e9 <.literal16+0x209>
+  DB  71,225,61                           ; rex.RXB       loope 6429 <.literal16+0x229>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 63ed <.literal16+0x20d>
+  DB  71,225,61                           ; rex.RXB       loope 642d <.literal16+0x22d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -28858,13 +28953,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 6421 <.literal16+0x241>
+  DB  71,225,61                           ; rex.RXB       loope 6461 <.literal16+0x261>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 6425 <.literal16+0x245>
+  DB  71,225,61                           ; rex.RXB       loope 6465 <.literal16+0x265>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 6429 <.literal16+0x249>
+  DB  71,225,61                           ; rex.RXB       loope 6469 <.literal16+0x269>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 642d <.literal16+0x24d>
+  DB  71,225,61                           ; rex.RXB       loope 646d <.literal16+0x26d>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -28889,13 +28984,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 6461 <.literal16+0x281>
+  DB  71,225,61                           ; rex.RXB       loope 64a1 <.literal16+0x2a1>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 6465 <.literal16+0x285>
+  DB  71,225,61                           ; rex.RXB       loope 64a5 <.literal16+0x2a5>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 6469 <.literal16+0x289>
+  DB  71,225,61                           ; rex.RXB       loope 64a9 <.literal16+0x2a9>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 646d <.literal16+0x28d>
+  DB  71,225,61                           ; rex.RXB       loope 64ad <.literal16+0x2ad>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -28920,13 +29015,13 @@
   DB  10,23                               ; or            (%rdi),%dl
   DB  63                                  ; (bad)
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 64a1 <.literal16+0x2c1>
+  DB  71,225,61                           ; rex.RXB       loope 64e1 <.literal16+0x2e1>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 64a5 <.literal16+0x2c5>
+  DB  71,225,61                           ; rex.RXB       loope 64e5 <.literal16+0x2e5>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 64a9 <.literal16+0x2c9>
+  DB  71,225,61                           ; rex.RXB       loope 64e9 <.literal16+0x2e9>
   DB  174                                 ; scas          %es:(%rdi),%al
-  DB  71,225,61                           ; rex.RXB       loope 64ad <.literal16+0x2cd>
+  DB  71,225,61                           ; rex.RXB       loope 64ed <.literal16+0x2ed>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -28947,11 +29042,11 @@
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,127                    ; add           %al,0x7f00003f(%rax)
   DB  67,0,0                              ; rex.XB        add %al,(%r8)
-  DB  127,67                              ; jg            64eb <.literal16+0x30b>
+  DB  127,67                              ; jg            652b <.literal16+0x32b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            64ef <.literal16+0x30f>
+  DB  127,67                              ; jg            652f <.literal16+0x32f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            64f3 <.literal16+0x313>
+  DB  127,67                              ; jg            6533 <.literal16+0x333>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -29238,13 +29333,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6739 <.literal16+0x559>
+  DB  224,7                               ; loopne        6779 <.literal16+0x579>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        673d <.literal16+0x55d>
+  DB  224,7                               ; loopne        677d <.literal16+0x57d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6741 <.literal16+0x561>
+  DB  224,7                               ; loopne        6781 <.literal16+0x581>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6745 <.literal16+0x565>
+  DB  224,7                               ; loopne        6785 <.literal16+0x585>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -29309,11 +29404,11 @@
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            681b <.literal16+0x63b>
+  DB  127,67                              ; jg            685b <.literal16+0x65b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            681f <.literal16+0x63f>
+  DB  127,67                              ; jg            685f <.literal16+0x65f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6823 <.literal16+0x643>
+  DB  127,67                              ; jg            6863 <.literal16+0x663>
   DB  129,128,128,59,129,128,128,59,129,128; addl          $0x80813b80,-0x7f7ec480(%rax)
   DB  128,59,129                          ; cmpb          $0x81,(%rbx)
   DB  128,128,59,129,128,128,59           ; addb          $0x3b,-0x7f7f7ec5(%rax)
@@ -29328,16 +29423,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6814 <.literal16+0x634>
+  DB  127,0                               ; jg            6854 <.literal16+0x654>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6818 <.literal16+0x638>
+  DB  127,0                               ; jg            6858 <.literal16+0x658>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            681c <.literal16+0x63c>
+  DB  127,0                               ; jg            685c <.literal16+0x65c>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6820 <.literal16+0x640>
+  DB  127,0                               ; jg            6860 <.literal16+0x660>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -29346,7 +29441,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            68a5 <.literal16+0x6c5>
+  DB  119,115                             ; ja            68e5 <.literal16+0x6e5>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -29357,7 +29452,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           6809 <.literal16+0x629>
+  DB  117,191                             ; jne           6849 <.literal16+0x649>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -29369,7 +29464,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a84a <_sk_callback_sse2+0xffffffffe9a3473f>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a88a <_sk_callback_sse2+0xffffffffe9a34757>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
@@ -29423,16 +29518,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            68e4 <.literal16+0x704>
+  DB  127,0                               ; jg            6924 <.literal16+0x724>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            68e8 <.literal16+0x708>
+  DB  127,0                               ; jg            6928 <.literal16+0x728>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            68ec <.literal16+0x70c>
+  DB  127,0                               ; jg            692c <.literal16+0x72c>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            68f0 <.literal16+0x710>
+  DB  127,0                               ; jg            6930 <.literal16+0x730>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -29441,7 +29536,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            6975 <.literal16+0x795>
+  DB  119,115                             ; ja            69b5 <.literal16+0x7b5>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -29452,7 +29547,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           68d9 <.literal16+0x6f9>
+  DB  117,191                             ; jne           6919 <.literal16+0x719>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -29464,7 +29559,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a91a <_sk_callback_sse2+0xffffffffe9a3480f>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a95a <_sk_callback_sse2+0xffffffffe9a34827>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
@@ -29518,16 +29613,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            69b4 <.literal16+0x7d4>
+  DB  127,0                               ; jg            69f4 <.literal16+0x7f4>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            69b8 <.literal16+0x7d8>
+  DB  127,0                               ; jg            69f8 <.literal16+0x7f8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            69bc <.literal16+0x7dc>
+  DB  127,0                               ; jg            69fc <.literal16+0x7fc>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            69c0 <.literal16+0x7e0>
+  DB  127,0                               ; jg            6a00 <.literal16+0x800>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -29536,7 +29631,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            6a45 <.literal16+0x865>
+  DB  119,115                             ; ja            6a85 <.literal16+0x885>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -29547,7 +29642,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           69a9 <.literal16+0x7c9>
+  DB  117,191                             ; jne           69e9 <.literal16+0x7e9>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -29559,7 +29654,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3a9ea <_sk_callback_sse2+0xffffffffe9a348df>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3aa2a <_sk_callback_sse2+0xffffffffe9a348f7>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
@@ -29613,16 +29708,16 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  52,255                              ; xor           $0xff,%al
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6a84 <.literal16+0x8a4>
+  DB  127,0                               ; jg            6ac4 <.literal16+0x8c4>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6a88 <.literal16+0x8a8>
+  DB  127,0                               ; jg            6ac8 <.literal16+0x8c8>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6a8c <.literal16+0x8ac>
+  DB  127,0                               ; jg            6acc <.literal16+0x8cc>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,0                               ; jg            6a90 <.literal16+0x8b0>
+  DB  127,0                               ; jg            6ad0 <.literal16+0x8d0>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -29631,7 +29726,7 @@
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
-  DB  119,115                             ; ja            6b15 <.literal16+0x935>
+  DB  119,115                             ; ja            6b55 <.literal16+0x955>
   DB  248                                 ; clc
   DB  194,119,115                         ; retq          $0x7377
   DB  248                                 ; clc
@@ -29642,7 +29737,7 @@
   DB  194,117,191                         ; retq          $0xbf75
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
-  DB  117,191                             ; jne           6a79 <.literal16+0x899>
+  DB  117,191                             ; jne           6ab9 <.literal16+0x8b9>
   DB  191,63,117,191,191                  ; mov           $0xbfbf753f,%edi
   DB  63                                  ; (bad)
   DB  249                                 ; stc
@@ -29654,7 +29749,7 @@
   DB  249                                 ; stc
   DB  68,180,62                           ; rex.R         mov $0x3e,%spl
   DB  163,233,220,63,163,233,220,63,163   ; movabs        %eax,0xa33fdce9a33fdce9
-  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3aaba <_sk_callback_sse2+0xffffffffe9a349af>
+  DB  233,220,63,163,233                  ; jmpq          ffffffffe9a3aafa <_sk_callback_sse2+0xffffffffe9a349c7>
   DB  220,63                              ; fdivrl        (%rdi)
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
@@ -29704,13 +29799,13 @@
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
   DB  200,66,0,0                          ; enterq        $0x42,$0x0
-  DB  127,67                              ; jg            6b97 <.literal16+0x9b7>
+  DB  127,67                              ; jg            6bd7 <.literal16+0x9d7>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6b9b <.literal16+0x9bb>
+  DB  127,67                              ; jg            6bdb <.literal16+0x9db>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6b9f <.literal16+0x9bf>
+  DB  127,67                              ; jg            6bdf <.literal16+0x9df>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6ba3 <.literal16+0x9c3>
+  DB  127,67                              ; jg            6be3 <.literal16+0x9e3>
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,195                               ; add           %al,%bl
   DB  0,0                                 ; add           %al,(%rax)
@@ -29757,16 +29852,16 @@
   DB  128,3,62                            ; addb          $0x3e,(%rbx)
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           6c23 <.literal16+0xa43>
+  DB  118,63                              ; jbe           6c63 <.literal16+0xa63>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           6c27 <.literal16+0xa47>
+  DB  118,63                              ; jbe           6c67 <.literal16+0xa67>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           6c2b <.literal16+0xa4b>
+  DB  118,63                              ; jbe           6c6b <.literal16+0xa6b>
   DB  31                                  ; (bad)
   DB  215                                 ; xlat          %ds:(%rbx)
-  DB  118,63                              ; jbe           6c2f <.literal16+0xa4f>
+  DB  118,63                              ; jbe           6c6f <.literal16+0xa6f>
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
   DB  246,64,83,63                        ; testb         $0x3f,0x53(%rax)
@@ -29795,11 +29890,11 @@
   DB  128,59,0                            ; cmpb          $0x0,(%rbx)
   DB  0,127,67                            ; add           %bh,0x43(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6c9b <.literal16+0xabb>
+  DB  127,67                              ; jg            6cdb <.literal16+0xadb>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6c9f <.literal16+0xabf>
+  DB  127,67                              ; jg            6cdf <.literal16+0xadf>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            6ca3 <.literal16+0xac3>
+  DB  127,67                              ; jg            6ce3 <.literal16+0xae3>
   DB  255,0                               ; incl          (%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  255,0                               ; incl          (%rax)
@@ -29870,13 +29965,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6d39 <.literal16+0xb59>
+  DB  224,7                               ; loopne        6d79 <.literal16+0xb79>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6d3d <.literal16+0xb5d>
+  DB  224,7                               ; loopne        6d7d <.literal16+0xb7d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6d41 <.literal16+0xb61>
+  DB  224,7                               ; loopne        6d81 <.literal16+0xb81>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6d45 <.literal16+0xb65>
+  DB  224,7                               ; loopne        6d85 <.literal16+0xb85>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -29922,13 +30017,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6da9 <.literal16+0xbc9>
+  DB  224,7                               ; loopne        6de9 <.literal16+0xbe9>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6dad <.literal16+0xbcd>
+  DB  224,7                               ; loopne        6ded <.literal16+0xbed>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6db1 <.literal16+0xbd1>
+  DB  224,7                               ; loopne        6df1 <.literal16+0xbf1>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6db5 <.literal16+0xbd5>
+  DB  224,7                               ; loopne        6df5 <.literal16+0xbf5>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -29974,13 +30069,13 @@
   DB  132,55                              ; test          %dh,(%rdi)
   DB  8,33                                ; or            %ah,(%rcx)
   DB  132,55                              ; test          %dh,(%rdi)
-  DB  224,7                               ; loopne        6e19 <.literal16+0xc39>
+  DB  224,7                               ; loopne        6e59 <.literal16+0xc59>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6e1d <.literal16+0xc3d>
+  DB  224,7                               ; loopne        6e5d <.literal16+0xc5d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6e21 <.literal16+0xc41>
+  DB  224,7                               ; loopne        6e61 <.literal16+0xc61>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  224,7                               ; loopne        6e25 <.literal16+0xc45>
+  DB  224,7                               ; loopne        6e65 <.literal16+0xc65>
   DB  0,0                                 ; add           %al,(%rax)
   DB  33,8                                ; and           %ecx,(%rax)
   DB  2,58                                ; add           (%rdx),%bh
@@ -30018,13 +30113,13 @@
   DB  65,0,0                              ; add           %al,(%r8)
   DB  248                                 ; clc
   DB  65,0,0                              ; add           %al,(%r8)
-  DB  124,66                              ; jl            6eb6 <.literal16+0xcd6>
+  DB  124,66                              ; jl            6ef6 <.literal16+0xcf6>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            6eba <.literal16+0xcda>
+  DB  124,66                              ; jl            6efa <.literal16+0xcfa>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            6ebe <.literal16+0xcde>
+  DB  124,66                              ; jl            6efe <.literal16+0xcfe>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  124,66                              ; jl            6ec2 <.literal16+0xce2>
+  DB  124,66                              ; jl            6f02 <.literal16+0xd02>
   DB  0,240                               ; add           %dh,%al
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,240                               ; add           %dh,%al
@@ -30158,13 +30253,13 @@
   DB  136,136,61,137,136,136              ; mov           %cl,-0x777776c3(%rax)
   DB  61,137,136,136,61                   ; cmp           $0x3d888889,%eax
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            7045 <.literal16+0xe65>
+  DB  112,65                              ; jo            7085 <.literal16+0xe85>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            7049 <.literal16+0xe69>
+  DB  112,65                              ; jo            7089 <.literal16+0xe89>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            704d <.literal16+0xe6d>
+  DB  112,65                              ; jo            708d <.literal16+0xe8d>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  112,65                              ; jo            7051 <.literal16+0xe71>
+  DB  112,65                              ; jo            7091 <.literal16+0xe91>
   DB  255,0                               ; incl          (%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  255,0                               ; incl          (%rax)
@@ -30195,11 +30290,11 @@
   DB  128,59,129                          ; cmpb          $0x81,(%rbx)
   DB  128,128,59,0,0,127,67               ; addb          $0x43,0x7f00003b(%rax)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            70bb <.literal16+0xedb>
+  DB  127,67                              ; jg            70fb <.literal16+0xefb>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            70bf <.literal16+0xedf>
+  DB  127,67                              ; jg            70ff <.literal16+0xeff>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            70c3 <.literal16+0xee3>
+  DB  127,67                              ; jg            7103 <.literal16+0xf03>
   DB  255,0                               ; incl          (%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  255,0                               ; incl          (%rax)
@@ -30230,11 +30325,11 @@
   DB  128,59,129                          ; cmpb          $0x81,(%rbx)
   DB  128,128,59,0,0,127,67               ; addb          $0x43,0x7f00003b(%rax)
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            712b <.literal16+0xf4b>
+  DB  127,67                              ; jg            716b <.literal16+0xf6b>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            712f <.literal16+0xf4f>
+  DB  127,67                              ; jg            716f <.literal16+0xf6f>
   DB  0,0                                 ; add           %al,(%rax)
-  DB  127,67                              ; jg            7133 <.literal16+0xf53>
+  DB  127,67                              ; jg            7173 <.literal16+0xf73>
   DB  0,128,0,0,0,128                     ; add           %al,-0x80000000(%rax)
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,128,0,0,0,128                     ; add           %al,-0x80000000(%rax)
@@ -30330,13 +30425,13 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  255                                 ; (bad)
-  DB  127,71                              ; jg            725b <.literal16+0x107b>
+  DB  127,71                              ; jg            729b <.literal16+0x109b>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            725f <.literal16+0x107f>
+  DB  127,71                              ; jg            729f <.literal16+0x109f>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            7263 <.literal16+0x1083>
+  DB  127,71                              ; jg            72a3 <.literal16+0x10a3>
   DB  0,255                               ; add           %bh,%bh
-  DB  127,71                              ; jg            7267 <.literal16+0x1087>
+  DB  127,71                              ; jg            72a7 <.literal16+0x10a7>
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,0                            ; cmpb          $0x0,(%rdi)
   DB  0,128,63,0,0,128                    ; add           %al,-0x7fffffc1(%rax)
@@ -30413,10 +30508,10 @@
   DB  61,152,221,147,61                   ; cmp           $0x3d93dd98,%eax
   DB  152                                 ; cwtl
   DB  221,147,61,45,16,17                 ; fstl          0x11102d3d(%rbx)
-  DB  192,45,16,17,192,45,16              ; shrb          $0x10,0x2dc01110(%rip)        # 2dc083fa <_sk_callback_sse2+0x2dc022ef>
+  DB  192,45,16,17,192,45,16              ; shrb          $0x10,0x2dc01110(%rip)        # 2dc0843a <_sk_callback_sse2+0x2dc02307>
   DB  17,192                              ; adc           %eax,%eax
   DB  45,16,17,192,18                     ; sub           $0x12c01110,%eax
-  DB  120,57                              ; js            732c <.literal16+0x114c>
+  DB  120,57                              ; js            736c <.literal16+0x116c>
   DB  64,18,120,57                        ; adc           0x39(%rax),%dil
   DB  64,18,120,57                        ; adc           0x39(%rax),%dil
   DB  64,18,120,57                        ; adc           0x39(%rax),%dil
@@ -30603,11 +30698,11 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,114                          ; cmpb          $0x72,(%rdi)
   DB  28,199                              ; sbb           $0xc7,%al
-  DB  62,114,28                           ; jb,pt         7512 <.literal16+0x1332>
+  DB  62,114,28                           ; jb,pt         7552 <.literal16+0x1352>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         7516 <.literal16+0x1336>
+  DB  62,114,28                           ; jb,pt         7556 <.literal16+0x1356>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         751a <.literal16+0x133a>
+  DB  62,114,28                           ; jb,pt         755a <.literal16+0x135a>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -30651,7 +30746,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d6403a5 <_sk_callback_sse2+0x3d63a29a>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d6403e5 <_sk_callback_sse2+0x3d63a2b2>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -30677,7 +30772,7 @@
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d6403e5 <_sk_callback_sse2+0x3d63a2da>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d640425 <_sk_callback_sse2+0x3d63a2f2>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
@@ -30686,13 +30781,13 @@
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
-  DB  114,28                              ; jb            75de <.literal16+0x13fe>
+  DB  114,28                              ; jb            761e <.literal16+0x141e>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         75e2 <.literal16+0x1402>
+  DB  62,114,28                           ; jb,pt         7622 <.literal16+0x1422>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         75e6 <.literal16+0x1406>
+  DB  62,114,28                           ; jb,pt         7626 <.literal16+0x1426>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         75ea <.literal16+0x140a>
+  DB  62,114,28                           ; jb,pt         762a <.literal16+0x142a>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -30713,11 +30808,11 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  128,63,114                          ; cmpb          $0x72,(%rdi)
   DB  28,199                              ; sbb           $0xc7,%al
-  DB  62,114,28                           ; jb,pt         7622 <.literal16+0x1442>
+  DB  62,114,28                           ; jb,pt         7662 <.literal16+0x1462>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         7626 <.literal16+0x1446>
+  DB  62,114,28                           ; jb,pt         7666 <.literal16+0x1466>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         762a <.literal16+0x144a>
+  DB  62,114,28                           ; jb,pt         766a <.literal16+0x146a>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -30761,7 +30856,7 @@
   DB  0,0                                 ; add           %al,(%rax)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d6404b5 <_sk_callback_sse2+0x3d63a3aa>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d6404f5 <_sk_callback_sse2+0x3d63a3c2>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  0,63                                ; add           %bh,(%rdi)
   DB  0,0                                 ; add           %al,(%rax)
@@ -30787,7 +30882,7 @@
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
   DB  57,142,99,61,57,142                 ; cmp           %ecx,-0x71c6c29d(%rsi)
-  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d6404f5 <_sk_callback_sse2+0x3d63a3ea>
+  DB  99,61,57,142,99,61                  ; movslq        0x3d638e39(%rip),%edi        # 3d640535 <_sk_callback_sse2+0x3d63a402>
   DB  57,142,99,61,0,0                    ; cmp           %ecx,0x3d63(%rsi)
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
@@ -30796,13 +30891,13 @@
   DB  192,63,0                            ; sarb          $0x0,(%rdi)
   DB  0,192                               ; add           %al,%al
   DB  63                                  ; (bad)
-  DB  114,28                              ; jb            76ee <.literal16+0x150e>
+  DB  114,28                              ; jb            772e <.literal16+0x152e>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         76f2 <_sk_callback_sse2+0x15e7>
+  DB  62,114,28                           ; jb,pt         7732 <_sk_callback_sse2+0x15ff>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         76f6 <_sk_callback_sse2+0x15eb>
+  DB  62,114,28                           ; jb,pt         7736 <_sk_callback_sse2+0x1603>
   DB  199                                 ; (bad)
-  DB  62,114,28                           ; jb,pt         76fa <_sk_callback_sse2+0x15ef>
+  DB  62,114,28                           ; jb,pt         773a <_sk_callback_sse2+0x1607>
   DB  199                                 ; (bad)
   DB  62,171                              ; ds            stos %eax,%es:(%rdi)
   DB  170                                 ; stos          %al,%es:(%rdi)
@@ -30904,10 +30999,10 @@
 _sk_just_return_hsw_lowp LABEL PROC
   DB  195                                 ; retq
 
-PUBLIC _sk_constant_color_hsw_lowp
-_sk_constant_color_hsw_lowp LABEL PROC
+PUBLIC _sk_uniform_color_hsw_lowp
+_sk_uniform_color_hsw_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,121,24,5,238,32,0,0         ; vbroadcastss  0x20ee(%rip),%xmm0        # 2224 <_sk_xor__hsw_lowp+0x78>
+  DB  196,226,121,24,5,30,33,0,0          ; vbroadcastss  0x211e(%rip),%xmm0        # 2254 <_sk_xor__hsw_lowp+0x78>
   DB  197,248,88,24                       ; vaddps        (%rax),%xmm0,%xmm3
   DB  196,226,125,121,195                 ; vpbroadcastw  %xmm3,%ymm0
   DB  197,251,112,203,234                 ; vpshuflw      $0xea,%xmm3,%xmm1
@@ -30921,10 +31016,28 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
+PUBLIC _sk_black_color_hsw_lowp
+_sk_black_color_hsw_lowp LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  196,226,125,121,29,8,33,0,0         ; vpbroadcastw  0x2108(%rip),%ymm3        # 2280 <_sk_xor__hsw_lowp+0xa4>
+  DB  197,252,87,192                      ; vxorps        %ymm0,%ymm0,%ymm0
+  DB  197,244,87,201                      ; vxorps        %ymm1,%ymm1,%ymm1
+  DB  197,236,87,210                      ; vxorps        %ymm2,%ymm2,%ymm2
+  DB  255,224                             ; jmpq          *%rax
+
+PUBLIC _sk_white_color_hsw_lowp
+_sk_white_color_hsw_lowp LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  196,226,125,121,5,241,32,0,0        ; vpbroadcastw  0x20f1(%rip),%ymm0        # 2282 <_sk_xor__hsw_lowp+0xa6>
+  DB  197,253,111,200                     ; vmovdqa       %ymm0,%ymm1
+  DB  197,253,111,208                     ; vmovdqa       %ymm0,%ymm2
+  DB  197,253,111,216                     ; vmovdqa       %ymm0,%ymm3
+  DB  255,224                             ; jmpq          *%rax
+
 PUBLIC _sk_set_rgb_hsw_lowp
 _sk_set_rgb_hsw_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  197,250,16,21,177,32,0,0            ; vmovss        0x20b1(%rip),%xmm2        # 2228 <_sk_xor__hsw_lowp+0x7c>
+  DB  197,250,16,21,175,32,0,0            ; vmovss        0x20af(%rip),%xmm2        # 2258 <_sk_xor__hsw_lowp+0x7c>
   DB  197,234,88,0                        ; vaddss        (%rax),%xmm2,%xmm0
   DB  196,193,121,126,193                 ; vmovd         %xmm0,%r9d
   DB  196,193,121,110,193                 ; vmovd         %r9d,%xmm0
@@ -30956,19 +31069,19 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,210,0,0,0                    ; jne           2b6 <_sk_load_8888_hsw_lowp+0xe0>
+  DB  15,133,210,0,0,0                    ; jne           2e8 <_sk_load_8888_hsw_lowp+0xe0>
   DB  196,193,126,111,92,147,32           ; vmovdqu       0x20(%r11,%rdx,4),%ymm3
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
-  DB  197,253,111,5,71,32,0,0             ; vmovdqa       0x2047(%rip),%ymm0        # 2240 <_sk_xor__hsw_lowp+0x94>
+  DB  197,253,111,5,117,32,0,0            ; vmovdqa       0x2075(%rip),%ymm0        # 22a0 <_sk_xor__hsw_lowp+0xc4>
   DB  196,226,61,0,200                    ; vpshufb       %ymm0,%ymm8,%ymm1
   DB  196,227,253,0,201,232               ; vpermq        $0xe8,%ymm1,%ymm1
   DB  196,226,101,0,192                   ; vpshufb       %ymm0,%ymm3,%ymm0
   DB  196,227,253,0,192,232               ; vpermq        $0xe8,%ymm0,%ymm0
   DB  196,227,117,56,192,1                ; vinserti128   $0x1,%xmm0,%ymm1,%ymm0
   DB  197,253,113,240,8                   ; vpsllw        $0x8,%ymm0,%ymm0
-  DB  196,98,125,121,13,61,32,0,0         ; vpbroadcastw  0x203d(%rip),%ymm9        # 2260 <_sk_xor__hsw_lowp+0xb4>
+  DB  196,98,125,121,13,107,32,0,0        ; vpbroadcastw  0x206b(%rip),%ymm9        # 22c0 <_sk_xor__hsw_lowp+0xe4>
   DB  196,193,125,228,193                 ; vpmulhuw      %ymm9,%ymm0,%ymm0
-  DB  197,253,111,13,80,32,0,0            ; vmovdqa       0x2050(%rip),%ymm1        # 2280 <_sk_xor__hsw_lowp+0xd4>
+  DB  197,253,111,13,126,32,0,0           ; vmovdqa       0x207e(%rip),%ymm1        # 22e0 <_sk_xor__hsw_lowp+0x104>
   DB  196,226,61,0,209                    ; vpshufb       %ymm1,%ymm8,%ymm2
   DB  196,227,253,0,210,232               ; vpermq        $0xe8,%ymm2,%ymm2
   DB  196,226,101,0,201                   ; vpshufb       %ymm1,%ymm3,%ymm1
@@ -30976,7 +31089,7 @@
   DB  196,227,109,56,201,1                ; vinserti128   $0x1,%xmm1,%ymm2,%ymm1
   DB  197,245,113,241,8                   ; vpsllw        $0x8,%ymm1,%ymm1
   DB  196,193,117,228,201                 ; vpmulhuw      %ymm9,%ymm1,%ymm1
-  DB  197,253,111,21,66,32,0,0            ; vmovdqa       0x2042(%rip),%ymm2        # 22a0 <_sk_xor__hsw_lowp+0xf4>
+  DB  197,253,111,21,112,32,0,0           ; vmovdqa       0x2070(%rip),%ymm2        # 2300 <_sk_xor__hsw_lowp+0x124>
   DB  196,98,61,0,210                     ; vpshufb       %ymm2,%ymm8,%ymm10
   DB  196,67,253,0,210,232                ; vpermq        $0xe8,%ymm10,%ymm10
   DB  196,226,101,0,210                   ; vpshufb       %ymm2,%ymm3,%ymm2
@@ -30984,7 +31097,7 @@
   DB  196,227,45,56,210,1                 ; vinserti128   $0x1,%xmm2,%ymm10,%ymm2
   DB  197,237,113,242,8                   ; vpsllw        $0x8,%ymm2,%ymm2
   DB  196,193,109,228,209                 ; vpmulhuw      %ymm9,%ymm2,%ymm2
-  DB  197,125,111,21,52,32,0,0            ; vmovdqa       0x2034(%rip),%ymm10        # 22c0 <_sk_xor__hsw_lowp+0x114>
+  DB  197,125,111,21,98,32,0,0            ; vmovdqa       0x2062(%rip),%ymm10        # 2320 <_sk_xor__hsw_lowp+0x144>
   DB  196,66,61,0,194                     ; vpshufb       %ymm10,%ymm8,%ymm8
   DB  196,67,253,0,192,232                ; vpermq        $0xe8,%ymm8,%ymm8
   DB  196,194,101,0,218                   ; vpshufb       %ymm10,%ymm3,%ymm3
@@ -31000,14 +31113,14 @@
   DB  196,65,61,239,192                   ; vpxor         %ymm8,%ymm8,%ymm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  15,135,30,255,255,255               ; ja            1f1 <_sk_load_8888_hsw_lowp+0x1b>
+  DB  15,135,30,255,255,255               ; ja            223 <_sk_load_8888_hsw_lowp+0x1b>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,30,1,0,0                  ; lea           0x11e(%rip),%r10        # 3fc <_sk_load_8888_hsw_lowp+0x226>
+  DB  76,141,21,28,1,0,0                  ; lea           0x11c(%rip),%r10        # 42c <_sk_load_8888_hsw_lowp+0x224>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,110,4,147                ; vmovd         (%r11,%rdx,4),%xmm8
-  DB  233,255,254,255,255                 ; jmpq          1f1 <_sk_load_8888_hsw_lowp+0x1b>
+  DB  233,255,254,255,255                 ; jmpq          223 <_sk_load_8888_hsw_lowp+0x1b>
   DB  196,193,121,110,68,147,8            ; vmovd         0x8(%r11,%rdx,4),%xmm0
   DB  196,226,121,89,192                  ; vpbroadcastq  %xmm0,%xmm0
   DB  197,229,239,219                     ; vpxor         %ymm3,%ymm3,%ymm3
@@ -31015,7 +31128,7 @@
   DB  196,194,121,53,4,147                ; vpmovzxdq     (%r11,%rdx,4),%xmm0
   DB  197,249,112,192,232                 ; vpshufd       $0xe8,%xmm0,%xmm0
   DB  196,99,61,2,192,3                   ; vpblendd      $0x3,%ymm0,%ymm8,%ymm8
-  DB  233,211,254,255,255                 ; jmpq          1f1 <_sk_load_8888_hsw_lowp+0x1b>
+  DB  233,211,254,255,255                 ; jmpq          223 <_sk_load_8888_hsw_lowp+0x1b>
   DB  196,193,121,110,68,147,24           ; vmovd         0x18(%r11,%rdx,4),%xmm0
   DB  196,226,125,89,192                  ; vpbroadcastq  %xmm0,%ymm0
   DB  197,229,239,219                     ; vpxor         %ymm3,%ymm3,%ymm3
@@ -31028,7 +31141,7 @@
   DB  196,99,61,56,192,1                  ; vinserti128   $0x1,%xmm0,%ymm8,%ymm8
   DB  196,193,122,111,4,147               ; vmovdqu       (%r11,%rdx,4),%xmm0
   DB  196,67,125,2,192,240                ; vpblendd      $0xf0,%ymm8,%ymm0,%ymm8
-  DB  233,132,254,255,255                 ; jmpq          1f1 <_sk_load_8888_hsw_lowp+0x1b>
+  DB  233,132,254,255,255                 ; jmpq          223 <_sk_load_8888_hsw_lowp+0x1b>
   DB  196,193,121,110,68,147,40           ; vmovd         0x28(%r11,%rdx,4),%xmm0
   DB  196,226,121,89,192                  ; vpbroadcastq  %xmm0,%xmm0
   DB  197,245,239,201                     ; vpxor         %ymm1,%ymm1,%ymm1
@@ -31037,7 +31150,7 @@
   DB  196,227,101,2,216,15                ; vpblendd      $0xf,%ymm0,%ymm3,%ymm3
   DB  196,193,121,110,68,147,32           ; vmovd         0x20(%r11,%rdx,4),%xmm0
   DB  196,227,101,2,216,1                 ; vpblendd      $0x1,%ymm0,%ymm3,%ymm3
-  DB  233,72,254,255,255                  ; jmpq          1eb <_sk_load_8888_hsw_lowp+0x15>
+  DB  233,72,254,255,255                  ; jmpq          21d <_sk_load_8888_hsw_lowp+0x15>
   DB  196,193,121,110,68,147,56           ; vmovd         0x38(%r11,%rdx,4),%xmm0
   DB  196,226,125,89,192                  ; vpbroadcastq  %xmm0,%ymm0
   DB  197,245,239,201                     ; vpxor         %ymm1,%ymm1,%ymm1
@@ -31051,41 +31164,43 @@
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
   DB  196,193,122,111,68,147,32           ; vmovdqu       0x20(%r11,%rdx,4),%xmm0
   DB  196,227,125,2,219,240               ; vpblendd      $0xf0,%ymm3,%ymm0,%ymm3
-  DB  233,248,253,255,255                 ; jmpq          1f1 <_sk_load_8888_hsw_lowp+0x1b>
-  DB  15,31,0                             ; nopl          (%rax)
-  DB  235,254                             ; jmp           3fc <_sk_load_8888_hsw_lowp+0x226>
-  DB  255                                 ; (bad)
-  DB  255,12,255                          ; decl          (%rdi,%rdi,8)
-  DB  255                                 ; (bad)
-  DB  255,246                             ; push          %rsi
+  DB  233,248,253,255,255                 ; jmpq          223 <_sk_load_8888_hsw_lowp+0x1b>
+  DB  144                                 ; nop
+  DB  237                                 ; in            (%dx),%eax
   DB  254                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,96,255                          ; jmpq          *-0x1(%rax)
-  DB  255                                 ; (bad)
-  DB  255,76,255,255                      ; decl          -0x1(%rdi,%rdi,8)
-  DB  255                                 ; (bad)
-  DB  56,255                              ; cmp           %bh,%bh
-  DB  255                                 ; (bad)
-  DB  255,34                              ; jmpq          *(%rdx)
+  DB  255,14                              ; decl          (%rsi)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  239                                 ; out           %eax,(%dx)
+  DB  248                                 ; clc
+  DB  254                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  255,98,255                          ; jmpq          *-0x1(%rdx)
+  DB  255                                 ; (bad)
+  DB  255,78,255                          ; decl          -0x1(%rsi)
+  DB  255                                 ; (bad)
+  DB  255                                 ; (bad)
+  DB  58,255                              ; cmp           %bh,%bh
+  DB  255                                 ; (bad)
+  DB  255,36,255                          ; jmpq          *(%rdi,%rdi,8)
+  DB  255                                 ; (bad)
+  DB  255,241                             ; push          %rcx
   DB  253                                 ; std
   DB  255                                 ; (bad)
-  DB  255,149,255,255,255,135             ; callq         *-0x78000001(%rbp)
+  DB  255,151,255,255,255,137             ; callq         *-0x76000001(%rdi)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,113,255                         ; pushq         -0x1(%rcx)
+  DB  255,115,255                         ; pushq         -0x1(%rbx)
   DB  255                                 ; (bad)
-  DB  255,229                             ; jmpq          *%rbp
+  DB  255,231                             ; jmpq          *%rdi
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,209                             ; callq         *%rcx
+  DB  255,211                             ; callq         *%rbx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  189,255,255,255,167                 ; mov           $0xa7ffffff,%ebp
+  DB  191,255,255,255,169                 ; mov           $0xa9ffffff,%edi
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; .byte         0xff
@@ -31095,19 +31210,19 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,210,0,0,0                    ; jne           518 <_sk_load_8888_dst_hsw_lowp+0xe0>
+  DB  15,133,210,0,0,0                    ; jne           548 <_sk_load_8888_dst_hsw_lowp+0xe0>
   DB  196,193,126,111,124,147,32          ; vmovdqu       0x20(%r11,%rdx,4),%ymm7
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
-  DB  197,253,111,37,133,30,0,0           ; vmovdqa       0x1e85(%rip),%ymm4        # 22e0 <_sk_xor__hsw_lowp+0x134>
+  DB  197,253,111,37,181,30,0,0           ; vmovdqa       0x1eb5(%rip),%ymm4        # 2340 <_sk_xor__hsw_lowp+0x164>
   DB  196,226,61,0,236                    ; vpshufb       %ymm4,%ymm8,%ymm5
   DB  196,227,253,0,237,232               ; vpermq        $0xe8,%ymm5,%ymm5
   DB  196,226,69,0,228                    ; vpshufb       %ymm4,%ymm7,%ymm4
   DB  196,227,253,0,228,232               ; vpermq        $0xe8,%ymm4,%ymm4
   DB  196,227,85,56,228,1                 ; vinserti128   $0x1,%xmm4,%ymm5,%ymm4
   DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
-  DB  196,98,125,121,13,123,30,0,0        ; vpbroadcastw  0x1e7b(%rip),%ymm9        # 2300 <_sk_xor__hsw_lowp+0x154>
+  DB  196,98,125,121,13,171,30,0,0        ; vpbroadcastw  0x1eab(%rip),%ymm9        # 2360 <_sk_xor__hsw_lowp+0x184>
   DB  196,193,93,228,225                  ; vpmulhuw      %ymm9,%ymm4,%ymm4
-  DB  197,253,111,45,142,30,0,0           ; vmovdqa       0x1e8e(%rip),%ymm5        # 2320 <_sk_xor__hsw_lowp+0x174>
+  DB  197,253,111,45,190,30,0,0           ; vmovdqa       0x1ebe(%rip),%ymm5        # 2380 <_sk_xor__hsw_lowp+0x1a4>
   DB  196,226,61,0,245                    ; vpshufb       %ymm5,%ymm8,%ymm6
   DB  196,227,253,0,246,232               ; vpermq        $0xe8,%ymm6,%ymm6
   DB  196,226,69,0,237                    ; vpshufb       %ymm5,%ymm7,%ymm5
@@ -31115,7 +31230,7 @@
   DB  196,227,77,56,237,1                 ; vinserti128   $0x1,%xmm5,%ymm6,%ymm5
   DB  197,213,113,245,8                   ; vpsllw        $0x8,%ymm5,%ymm5
   DB  196,193,85,228,233                  ; vpmulhuw      %ymm9,%ymm5,%ymm5
-  DB  197,253,111,53,128,30,0,0           ; vmovdqa       0x1e80(%rip),%ymm6        # 2340 <_sk_xor__hsw_lowp+0x194>
+  DB  197,253,111,53,176,30,0,0           ; vmovdqa       0x1eb0(%rip),%ymm6        # 23a0 <_sk_xor__hsw_lowp+0x1c4>
   DB  196,98,61,0,214                     ; vpshufb       %ymm6,%ymm8,%ymm10
   DB  196,67,253,0,210,232                ; vpermq        $0xe8,%ymm10,%ymm10
   DB  196,226,69,0,246                    ; vpshufb       %ymm6,%ymm7,%ymm6
@@ -31123,7 +31238,7 @@
   DB  196,227,45,56,246,1                 ; vinserti128   $0x1,%xmm6,%ymm10,%ymm6
   DB  197,205,113,246,8                   ; vpsllw        $0x8,%ymm6,%ymm6
   DB  196,193,77,228,241                  ; vpmulhuw      %ymm9,%ymm6,%ymm6
-  DB  197,125,111,21,114,30,0,0           ; vmovdqa       0x1e72(%rip),%ymm10        # 2360 <_sk_xor__hsw_lowp+0x1b4>
+  DB  197,125,111,21,162,30,0,0           ; vmovdqa       0x1ea2(%rip),%ymm10        # 23c0 <_sk_xor__hsw_lowp+0x1e4>
   DB  196,66,61,0,194                     ; vpshufb       %ymm10,%ymm8,%ymm8
   DB  196,67,253,0,192,232                ; vpermq        $0xe8,%ymm8,%ymm8
   DB  196,194,69,0,250                    ; vpshufb       %ymm10,%ymm7,%ymm7
@@ -31139,14 +31254,14 @@
   DB  196,65,61,239,192                   ; vpxor         %ymm8,%ymm8,%ymm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  15,135,30,255,255,255               ; ja            453 <_sk_load_8888_dst_hsw_lowp+0x1b>
+  DB  15,135,30,255,255,255               ; ja            483 <_sk_load_8888_dst_hsw_lowp+0x1b>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,28,1,0,0                  ; lea           0x11c(%rip),%r10        # 65c <_sk_load_8888_dst_hsw_lowp+0x224>
+  DB  76,141,21,28,1,0,0                  ; lea           0x11c(%rip),%r10        # 68c <_sk_load_8888_dst_hsw_lowp+0x224>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,110,4,147                ; vmovd         (%r11,%rdx,4),%xmm8
-  DB  233,255,254,255,255                 ; jmpq          453 <_sk_load_8888_dst_hsw_lowp+0x1b>
+  DB  233,255,254,255,255                 ; jmpq          483 <_sk_load_8888_dst_hsw_lowp+0x1b>
   DB  196,193,121,110,100,147,8           ; vmovd         0x8(%r11,%rdx,4),%xmm4
   DB  196,226,121,89,228                  ; vpbroadcastq  %xmm4,%xmm4
   DB  197,197,239,255                     ; vpxor         %ymm7,%ymm7,%ymm7
@@ -31154,7 +31269,7 @@
   DB  196,194,121,53,36,147               ; vpmovzxdq     (%r11,%rdx,4),%xmm4
   DB  197,249,112,228,232                 ; vpshufd       $0xe8,%xmm4,%xmm4
   DB  196,99,61,2,196,3                   ; vpblendd      $0x3,%ymm4,%ymm8,%ymm8
-  DB  233,211,254,255,255                 ; jmpq          453 <_sk_load_8888_dst_hsw_lowp+0x1b>
+  DB  233,211,254,255,255                 ; jmpq          483 <_sk_load_8888_dst_hsw_lowp+0x1b>
   DB  196,193,121,110,100,147,24          ; vmovd         0x18(%r11,%rdx,4),%xmm4
   DB  196,226,125,89,228                  ; vpbroadcastq  %xmm4,%ymm4
   DB  197,197,239,255                     ; vpxor         %ymm7,%ymm7,%ymm7
@@ -31167,7 +31282,7 @@
   DB  196,99,61,56,196,1                  ; vinserti128   $0x1,%xmm4,%ymm8,%ymm8
   DB  196,193,122,111,36,147              ; vmovdqu       (%r11,%rdx,4),%xmm4
   DB  196,67,93,2,192,240                 ; vpblendd      $0xf0,%ymm8,%ymm4,%ymm8
-  DB  233,132,254,255,255                 ; jmpq          453 <_sk_load_8888_dst_hsw_lowp+0x1b>
+  DB  233,132,254,255,255                 ; jmpq          483 <_sk_load_8888_dst_hsw_lowp+0x1b>
   DB  196,193,121,110,100,147,40          ; vmovd         0x28(%r11,%rdx,4),%xmm4
   DB  196,226,121,89,228                  ; vpbroadcastq  %xmm4,%xmm4
   DB  197,213,239,237                     ; vpxor         %ymm5,%ymm5,%ymm5
@@ -31176,7 +31291,7 @@
   DB  196,227,69,2,252,15                 ; vpblendd      $0xf,%ymm4,%ymm7,%ymm7
   DB  196,193,121,110,100,147,32          ; vmovd         0x20(%r11,%rdx,4),%xmm4
   DB  196,227,69,2,252,1                  ; vpblendd      $0x1,%ymm4,%ymm7,%ymm7
-  DB  233,72,254,255,255                  ; jmpq          44d <_sk_load_8888_dst_hsw_lowp+0x15>
+  DB  233,72,254,255,255                  ; jmpq          47d <_sk_load_8888_dst_hsw_lowp+0x15>
   DB  196,193,121,110,100,147,56          ; vmovd         0x38(%r11,%rdx,4),%xmm4
   DB  196,226,125,89,228                  ; vpbroadcastq  %xmm4,%ymm4
   DB  197,213,239,237                     ; vpxor         %ymm5,%ymm5,%ymm5
@@ -31190,7 +31305,7 @@
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
   DB  196,193,122,111,100,147,32          ; vmovdqu       0x20(%r11,%rdx,4),%xmm4
   DB  196,227,93,2,255,240                ; vpblendd      $0xf0,%ymm7,%ymm4,%ymm7
-  DB  233,248,253,255,255                 ; jmpq          453 <_sk_load_8888_dst_hsw_lowp+0x1b>
+  DB  233,248,253,255,255                 ; jmpq          483 <_sk_load_8888_dst_hsw_lowp+0x1b>
   DB  144                                 ; nop
   DB  237                                 ; in            (%dx),%eax
   DB  254                                 ; (bad)
@@ -31236,7 +31351,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  197,189,113,208,7                   ; vpsrlw        $0x7,%ymm0,%ymm8
-  DB  196,98,125,121,13,213,28,0,0        ; vpbroadcastw  0x1cd5(%rip),%ymm9        # 2380 <_sk_xor__hsw_lowp+0x1d4>
+  DB  196,98,125,121,13,5,29,0,0          ; vpbroadcastw  0x1d05(%rip),%ymm9        # 23e0 <_sk_xor__hsw_lowp+0x204>
   DB  196,65,61,234,193                   ; vpminsw       %ymm9,%ymm8,%ymm8
   DB  196,66,125,51,208                   ; vpmovzxwd     %xmm8,%ymm10
   DB  196,67,125,57,192,1                 ; vextracti128  $0x1,%ymm8,%xmm8
@@ -31269,7 +31384,7 @@
   DB  196,65,29,235,198                   ; vpor          %ymm14,%ymm12,%ymm8
   DB  196,65,45,235,192                   ; vpor          %ymm8,%ymm10,%ymm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,17                              ; jne           766 <_sk_store_8888_hsw_lowp+0xce>
+  DB  117,17                              ; jne           796 <_sk_store_8888_hsw_lowp+0xce>
   DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
   DB  196,65,126,127,76,147,32            ; vmovdqu       %ymm9,0x20(%r11,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -31278,17 +31393,17 @@
   DB  65,128,225,15                       ; and           $0xf,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,236                             ; ja            762 <_sk_store_8888_hsw_lowp+0xca>
+  DB  119,236                             ; ja            792 <_sk_store_8888_hsw_lowp+0xca>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,175,0,0,0                 ; lea           0xaf(%rip),%r10        # 830 <_sk_store_8888_hsw_lowp+0x198>
+  DB  76,141,21,175,0,0,0                 ; lea           0xaf(%rip),%r10        # 860 <_sk_store_8888_hsw_lowp+0x198>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,126,4,147                ; vmovd         %xmm8,(%r11,%rdx,4)
-  DB  235,208                             ; jmp           762 <_sk_store_8888_hsw_lowp+0xca>
+  DB  235,208                             ; jmp           792 <_sk_store_8888_hsw_lowp+0xca>
   DB  196,67,121,22,68,147,8,2            ; vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,4)
   DB  196,65,121,214,4,147                ; vmovq         %xmm8,(%r11,%rdx,4)
-  DB  235,192                             ; jmp           762 <_sk_store_8888_hsw_lowp+0xca>
+  DB  235,192                             ; jmp           792 <_sk_store_8888_hsw_lowp+0xca>
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,67,121,22,76,147,24,2           ; vpextrd       $0x2,%xmm9,0x18(%r11,%rdx,4)
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
@@ -31296,12 +31411,12 @@
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,65,121,126,76,147,16            ; vmovd         %xmm9,0x10(%r11,%rdx,4)
   DB  196,65,122,127,4,147                ; vmovdqu       %xmm8,(%r11,%rdx,4)
-  DB  235,143                             ; jmp           762 <_sk_store_8888_hsw_lowp+0xca>
+  DB  235,143                             ; jmp           792 <_sk_store_8888_hsw_lowp+0xca>
   DB  196,67,121,22,76,147,40,2           ; vpextrd       $0x2,%xmm9,0x28(%r11,%rdx,4)
   DB  196,67,121,22,76,147,36,1           ; vpextrd       $0x1,%xmm9,0x24(%r11,%rdx,4)
   DB  196,65,121,126,76,147,32            ; vmovd         %xmm9,0x20(%r11,%rdx,4)
   DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
-  DB  233,109,255,255,255                 ; jmpq          762 <_sk_store_8888_hsw_lowp+0xca>
+  DB  233,109,255,255,255                 ; jmpq          792 <_sk_store_8888_hsw_lowp+0xca>
   DB  196,67,125,57,202,1                 ; vextracti128  $0x1,%ymm9,%xmm10
   DB  196,67,121,22,84,147,56,2           ; vpextrd       $0x2,%xmm10,0x38(%r11,%rdx,4)
   DB  196,67,125,57,202,1                 ; vextracti128  $0x1,%ymm9,%xmm10
@@ -31310,7 +31425,7 @@
   DB  196,65,121,126,84,147,48            ; vmovd         %xmm10,0x30(%r11,%rdx,4)
   DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
   DB  196,65,122,127,76,147,32            ; vmovdqu       %xmm9,0x20(%r11,%rdx,4)
-  DB  233,50,255,255,255                  ; jmpq          762 <_sk_store_8888_hsw_lowp+0xca>
+  DB  233,50,255,255,255                  ; jmpq          792 <_sk_store_8888_hsw_lowp+0xca>
   DB  90                                  ; pop           %rdx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -31351,19 +31466,19 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,210,0,0,0                    ; jne           94c <_sk_load_bgra_hsw_lowp+0xe0>
+  DB  15,133,210,0,0,0                    ; jne           97c <_sk_load_bgra_hsw_lowp+0xe0>
   DB  196,193,126,111,92,147,32           ; vmovdqu       0x20(%r11,%rdx,4),%ymm3
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
-  DB  197,253,111,5,17,27,0,0             ; vmovdqa       0x1b11(%rip),%ymm0        # 23a0 <_sk_xor__hsw_lowp+0x1f4>
+  DB  197,253,111,5,65,27,0,0             ; vmovdqa       0x1b41(%rip),%ymm0        # 2400 <_sk_xor__hsw_lowp+0x224>
   DB  196,226,61,0,200                    ; vpshufb       %ymm0,%ymm8,%ymm1
   DB  196,227,253,0,201,232               ; vpermq        $0xe8,%ymm1,%ymm1
   DB  196,226,101,0,192                   ; vpshufb       %ymm0,%ymm3,%ymm0
   DB  196,227,253,0,192,232               ; vpermq        $0xe8,%ymm0,%ymm0
   DB  196,227,117,56,192,1                ; vinserti128   $0x1,%xmm0,%ymm1,%ymm0
   DB  197,253,113,240,8                   ; vpsllw        $0x8,%ymm0,%ymm0
-  DB  196,98,125,121,13,7,27,0,0          ; vpbroadcastw  0x1b07(%rip),%ymm9        # 23c0 <_sk_xor__hsw_lowp+0x214>
+  DB  196,98,125,121,13,55,27,0,0         ; vpbroadcastw  0x1b37(%rip),%ymm9        # 2420 <_sk_xor__hsw_lowp+0x244>
   DB  196,193,125,228,209                 ; vpmulhuw      %ymm9,%ymm0,%ymm2
-  DB  197,253,111,5,26,27,0,0             ; vmovdqa       0x1b1a(%rip),%ymm0        # 23e0 <_sk_xor__hsw_lowp+0x234>
+  DB  197,253,111,5,74,27,0,0             ; vmovdqa       0x1b4a(%rip),%ymm0        # 2440 <_sk_xor__hsw_lowp+0x264>
   DB  196,226,61,0,200                    ; vpshufb       %ymm0,%ymm8,%ymm1
   DB  196,227,253,0,201,232               ; vpermq        $0xe8,%ymm1,%ymm1
   DB  196,226,101,0,192                   ; vpshufb       %ymm0,%ymm3,%ymm0
@@ -31371,7 +31486,7 @@
   DB  196,227,117,56,192,1                ; vinserti128   $0x1,%xmm0,%ymm1,%ymm0
   DB  197,253,113,240,8                   ; vpsllw        $0x8,%ymm0,%ymm0
   DB  196,193,125,228,201                 ; vpmulhuw      %ymm9,%ymm0,%ymm1
-  DB  197,253,111,5,12,27,0,0             ; vmovdqa       0x1b0c(%rip),%ymm0        # 2400 <_sk_xor__hsw_lowp+0x254>
+  DB  197,253,111,5,60,27,0,0             ; vmovdqa       0x1b3c(%rip),%ymm0        # 2460 <_sk_xor__hsw_lowp+0x284>
   DB  196,98,61,0,208                     ; vpshufb       %ymm0,%ymm8,%ymm10
   DB  196,67,253,0,210,232                ; vpermq        $0xe8,%ymm10,%ymm10
   DB  196,226,101,0,192                   ; vpshufb       %ymm0,%ymm3,%ymm0
@@ -31379,7 +31494,7 @@
   DB  196,227,45,56,192,1                 ; vinserti128   $0x1,%xmm0,%ymm10,%ymm0
   DB  197,253,113,240,8                   ; vpsllw        $0x8,%ymm0,%ymm0
   DB  196,193,125,228,193                 ; vpmulhuw      %ymm9,%ymm0,%ymm0
-  DB  197,125,111,21,254,26,0,0           ; vmovdqa       0x1afe(%rip),%ymm10        # 2420 <_sk_xor__hsw_lowp+0x274>
+  DB  197,125,111,21,46,27,0,0            ; vmovdqa       0x1b2e(%rip),%ymm10        # 2480 <_sk_xor__hsw_lowp+0x2a4>
   DB  196,66,61,0,194                     ; vpshufb       %ymm10,%ymm8,%ymm8
   DB  196,67,253,0,192,232                ; vpermq        $0xe8,%ymm8,%ymm8
   DB  196,194,101,0,218                   ; vpshufb       %ymm10,%ymm3,%ymm3
@@ -31395,14 +31510,14 @@
   DB  196,65,61,239,192                   ; vpxor         %ymm8,%ymm8,%ymm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  15,135,30,255,255,255               ; ja            887 <_sk_load_bgra_hsw_lowp+0x1b>
+  DB  15,135,30,255,255,255               ; ja            8b7 <_sk_load_bgra_hsw_lowp+0x1b>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,28,1,0,0                  ; lea           0x11c(%rip),%r10        # a90 <_sk_load_bgra_hsw_lowp+0x224>
+  DB  76,141,21,28,1,0,0                  ; lea           0x11c(%rip),%r10        # ac0 <_sk_load_bgra_hsw_lowp+0x224>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,110,4,147                ; vmovd         (%r11,%rdx,4),%xmm8
-  DB  233,255,254,255,255                 ; jmpq          887 <_sk_load_bgra_hsw_lowp+0x1b>
+  DB  233,255,254,255,255                 ; jmpq          8b7 <_sk_load_bgra_hsw_lowp+0x1b>
   DB  196,193,121,110,68,147,8            ; vmovd         0x8(%r11,%rdx,4),%xmm0
   DB  196,226,121,89,192                  ; vpbroadcastq  %xmm0,%xmm0
   DB  197,229,239,219                     ; vpxor         %ymm3,%ymm3,%ymm3
@@ -31410,7 +31525,7 @@
   DB  196,194,121,53,4,147                ; vpmovzxdq     (%r11,%rdx,4),%xmm0
   DB  197,249,112,192,232                 ; vpshufd       $0xe8,%xmm0,%xmm0
   DB  196,99,61,2,192,3                   ; vpblendd      $0x3,%ymm0,%ymm8,%ymm8
-  DB  233,211,254,255,255                 ; jmpq          887 <_sk_load_bgra_hsw_lowp+0x1b>
+  DB  233,211,254,255,255                 ; jmpq          8b7 <_sk_load_bgra_hsw_lowp+0x1b>
   DB  196,193,121,110,68,147,24           ; vmovd         0x18(%r11,%rdx,4),%xmm0
   DB  196,226,125,89,192                  ; vpbroadcastq  %xmm0,%ymm0
   DB  197,229,239,219                     ; vpxor         %ymm3,%ymm3,%ymm3
@@ -31423,7 +31538,7 @@
   DB  196,99,61,56,192,1                  ; vinserti128   $0x1,%xmm0,%ymm8,%ymm8
   DB  196,193,122,111,4,147               ; vmovdqu       (%r11,%rdx,4),%xmm0
   DB  196,67,125,2,192,240                ; vpblendd      $0xf0,%ymm8,%ymm0,%ymm8
-  DB  233,132,254,255,255                 ; jmpq          887 <_sk_load_bgra_hsw_lowp+0x1b>
+  DB  233,132,254,255,255                 ; jmpq          8b7 <_sk_load_bgra_hsw_lowp+0x1b>
   DB  196,193,121,110,68,147,40           ; vmovd         0x28(%r11,%rdx,4),%xmm0
   DB  196,226,121,89,192                  ; vpbroadcastq  %xmm0,%xmm0
   DB  197,245,239,201                     ; vpxor         %ymm1,%ymm1,%ymm1
@@ -31432,7 +31547,7 @@
   DB  196,227,101,2,216,15                ; vpblendd      $0xf,%ymm0,%ymm3,%ymm3
   DB  196,193,121,110,68,147,32           ; vmovd         0x20(%r11,%rdx,4),%xmm0
   DB  196,227,101,2,216,1                 ; vpblendd      $0x1,%ymm0,%ymm3,%ymm3
-  DB  233,72,254,255,255                  ; jmpq          881 <_sk_load_bgra_hsw_lowp+0x15>
+  DB  233,72,254,255,255                  ; jmpq          8b1 <_sk_load_bgra_hsw_lowp+0x15>
   DB  196,193,121,110,68,147,56           ; vmovd         0x38(%r11,%rdx,4),%xmm0
   DB  196,226,125,89,192                  ; vpbroadcastq  %xmm0,%ymm0
   DB  197,245,239,201                     ; vpxor         %ymm1,%ymm1,%ymm1
@@ -31446,7 +31561,7 @@
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
   DB  196,193,122,111,68,147,32           ; vmovdqu       0x20(%r11,%rdx,4),%xmm0
   DB  196,227,125,2,219,240               ; vpblendd      $0xf0,%ymm3,%ymm0,%ymm3
-  DB  233,248,253,255,255                 ; jmpq          887 <_sk_load_bgra_hsw_lowp+0x1b>
+  DB  233,248,253,255,255                 ; jmpq          8b7 <_sk_load_bgra_hsw_lowp+0x1b>
   DB  144                                 ; nop
   DB  237                                 ; in            (%dx),%eax
   DB  254                                 ; (bad)
@@ -31492,19 +31607,19 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,210,0,0,0                    ; jne           bac <_sk_load_bgra_dst_hsw_lowp+0xe0>
+  DB  15,133,210,0,0,0                    ; jne           bdc <_sk_load_bgra_dst_hsw_lowp+0xe0>
   DB  196,193,126,111,124,147,32          ; vmovdqu       0x20(%r11,%rdx,4),%ymm7
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
-  DB  197,253,111,37,81,25,0,0            ; vmovdqa       0x1951(%rip),%ymm4        # 2440 <_sk_xor__hsw_lowp+0x294>
+  DB  197,253,111,37,129,25,0,0           ; vmovdqa       0x1981(%rip),%ymm4        # 24a0 <_sk_xor__hsw_lowp+0x2c4>
   DB  196,226,61,0,236                    ; vpshufb       %ymm4,%ymm8,%ymm5
   DB  196,227,253,0,237,232               ; vpermq        $0xe8,%ymm5,%ymm5
   DB  196,226,69,0,228                    ; vpshufb       %ymm4,%ymm7,%ymm4
   DB  196,227,253,0,228,232               ; vpermq        $0xe8,%ymm4,%ymm4
   DB  196,227,85,56,228,1                 ; vinserti128   $0x1,%xmm4,%ymm5,%ymm4
   DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
-  DB  196,98,125,121,13,71,25,0,0         ; vpbroadcastw  0x1947(%rip),%ymm9        # 2460 <_sk_xor__hsw_lowp+0x2b4>
+  DB  196,98,125,121,13,119,25,0,0        ; vpbroadcastw  0x1977(%rip),%ymm9        # 24c0 <_sk_xor__hsw_lowp+0x2e4>
   DB  196,193,93,228,241                  ; vpmulhuw      %ymm9,%ymm4,%ymm6
-  DB  197,253,111,37,90,25,0,0            ; vmovdqa       0x195a(%rip),%ymm4        # 2480 <_sk_xor__hsw_lowp+0x2d4>
+  DB  197,253,111,37,138,25,0,0           ; vmovdqa       0x198a(%rip),%ymm4        # 24e0 <_sk_xor__hsw_lowp+0x304>
   DB  196,226,61,0,236                    ; vpshufb       %ymm4,%ymm8,%ymm5
   DB  196,227,253,0,237,232               ; vpermq        $0xe8,%ymm5,%ymm5
   DB  196,226,69,0,228                    ; vpshufb       %ymm4,%ymm7,%ymm4
@@ -31512,7 +31627,7 @@
   DB  196,227,85,56,228,1                 ; vinserti128   $0x1,%xmm4,%ymm5,%ymm4
   DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
   DB  196,193,93,228,233                  ; vpmulhuw      %ymm9,%ymm4,%ymm5
-  DB  197,253,111,37,76,25,0,0            ; vmovdqa       0x194c(%rip),%ymm4        # 24a0 <_sk_xor__hsw_lowp+0x2f4>
+  DB  197,253,111,37,124,25,0,0           ; vmovdqa       0x197c(%rip),%ymm4        # 2500 <_sk_xor__hsw_lowp+0x324>
   DB  196,98,61,0,212                     ; vpshufb       %ymm4,%ymm8,%ymm10
   DB  196,67,253,0,210,232                ; vpermq        $0xe8,%ymm10,%ymm10
   DB  196,226,69,0,228                    ; vpshufb       %ymm4,%ymm7,%ymm4
@@ -31520,7 +31635,7 @@
   DB  196,227,45,56,228,1                 ; vinserti128   $0x1,%xmm4,%ymm10,%ymm4
   DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
   DB  196,193,93,228,225                  ; vpmulhuw      %ymm9,%ymm4,%ymm4
-  DB  197,125,111,21,62,25,0,0            ; vmovdqa       0x193e(%rip),%ymm10        # 24c0 <_sk_xor__hsw_lowp+0x314>
+  DB  197,125,111,21,110,25,0,0           ; vmovdqa       0x196e(%rip),%ymm10        # 2520 <_sk_xor__hsw_lowp+0x344>
   DB  196,66,61,0,194                     ; vpshufb       %ymm10,%ymm8,%ymm8
   DB  196,67,253,0,192,232                ; vpermq        $0xe8,%ymm8,%ymm8
   DB  196,194,69,0,250                    ; vpshufb       %ymm10,%ymm7,%ymm7
@@ -31536,14 +31651,14 @@
   DB  196,65,61,239,192                   ; vpxor         %ymm8,%ymm8,%ymm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  15,135,30,255,255,255               ; ja            ae7 <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  DB  15,135,30,255,255,255               ; ja            b17 <_sk_load_bgra_dst_hsw_lowp+0x1b>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,28,1,0,0                  ; lea           0x11c(%rip),%r10        # cf0 <_sk_load_bgra_dst_hsw_lowp+0x224>
+  DB  76,141,21,28,1,0,0                  ; lea           0x11c(%rip),%r10        # d20 <_sk_load_bgra_dst_hsw_lowp+0x224>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,110,4,147                ; vmovd         (%r11,%rdx,4),%xmm8
-  DB  233,255,254,255,255                 ; jmpq          ae7 <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  DB  233,255,254,255,255                 ; jmpq          b17 <_sk_load_bgra_dst_hsw_lowp+0x1b>
   DB  196,193,121,110,100,147,8           ; vmovd         0x8(%r11,%rdx,4),%xmm4
   DB  196,226,121,89,228                  ; vpbroadcastq  %xmm4,%xmm4
   DB  197,197,239,255                     ; vpxor         %ymm7,%ymm7,%ymm7
@@ -31551,7 +31666,7 @@
   DB  196,194,121,53,36,147               ; vpmovzxdq     (%r11,%rdx,4),%xmm4
   DB  197,249,112,228,232                 ; vpshufd       $0xe8,%xmm4,%xmm4
   DB  196,99,61,2,196,3                   ; vpblendd      $0x3,%ymm4,%ymm8,%ymm8
-  DB  233,211,254,255,255                 ; jmpq          ae7 <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  DB  233,211,254,255,255                 ; jmpq          b17 <_sk_load_bgra_dst_hsw_lowp+0x1b>
   DB  196,193,121,110,100,147,24          ; vmovd         0x18(%r11,%rdx,4),%xmm4
   DB  196,226,125,89,228                  ; vpbroadcastq  %xmm4,%ymm4
   DB  197,197,239,255                     ; vpxor         %ymm7,%ymm7,%ymm7
@@ -31564,7 +31679,7 @@
   DB  196,99,61,56,196,1                  ; vinserti128   $0x1,%xmm4,%ymm8,%ymm8
   DB  196,193,122,111,36,147              ; vmovdqu       (%r11,%rdx,4),%xmm4
   DB  196,67,93,2,192,240                 ; vpblendd      $0xf0,%ymm8,%ymm4,%ymm8
-  DB  233,132,254,255,255                 ; jmpq          ae7 <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  DB  233,132,254,255,255                 ; jmpq          b17 <_sk_load_bgra_dst_hsw_lowp+0x1b>
   DB  196,193,121,110,100,147,40          ; vmovd         0x28(%r11,%rdx,4),%xmm4
   DB  196,226,121,89,228                  ; vpbroadcastq  %xmm4,%xmm4
   DB  197,213,239,237                     ; vpxor         %ymm5,%ymm5,%ymm5
@@ -31573,7 +31688,7 @@
   DB  196,227,69,2,252,15                 ; vpblendd      $0xf,%ymm4,%ymm7,%ymm7
   DB  196,193,121,110,100,147,32          ; vmovd         0x20(%r11,%rdx,4),%xmm4
   DB  196,227,69,2,252,1                  ; vpblendd      $0x1,%ymm4,%ymm7,%ymm7
-  DB  233,72,254,255,255                  ; jmpq          ae1 <_sk_load_bgra_dst_hsw_lowp+0x15>
+  DB  233,72,254,255,255                  ; jmpq          b11 <_sk_load_bgra_dst_hsw_lowp+0x15>
   DB  196,193,121,110,100,147,56          ; vmovd         0x38(%r11,%rdx,4),%xmm4
   DB  196,226,125,89,228                  ; vpbroadcastq  %xmm4,%ymm4
   DB  197,213,239,237                     ; vpxor         %ymm5,%ymm5,%ymm5
@@ -31587,7 +31702,7 @@
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
   DB  196,193,122,111,100,147,32          ; vmovdqu       0x20(%r11,%rdx,4),%xmm4
   DB  196,227,93,2,255,240                ; vpblendd      $0xf0,%ymm7,%ymm4,%ymm7
-  DB  233,248,253,255,255                 ; jmpq          ae7 <_sk_load_bgra_dst_hsw_lowp+0x1b>
+  DB  233,248,253,255,255                 ; jmpq          b17 <_sk_load_bgra_dst_hsw_lowp+0x1b>
   DB  144                                 ; nop
   DB  237                                 ; in            (%dx),%eax
   DB  254                                 ; (bad)
@@ -31633,7 +31748,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  197,189,113,210,7                   ; vpsrlw        $0x7,%ymm2,%ymm8
-  DB  196,98,125,121,13,161,23,0,0        ; vpbroadcastw  0x17a1(%rip),%ymm9        # 24e0 <_sk_xor__hsw_lowp+0x334>
+  DB  196,98,125,121,13,209,23,0,0        ; vpbroadcastw  0x17d1(%rip),%ymm9        # 2540 <_sk_xor__hsw_lowp+0x364>
   DB  196,65,61,234,193                   ; vpminsw       %ymm9,%ymm8,%ymm8
   DB  196,66,125,51,208                   ; vpmovzxwd     %xmm8,%ymm10
   DB  196,67,125,57,192,1                 ; vextracti128  $0x1,%ymm8,%xmm8
@@ -31666,7 +31781,7 @@
   DB  196,65,29,235,193                   ; vpor          %ymm9,%ymm12,%ymm8
   DB  196,65,21,235,192                   ; vpor          %ymm8,%ymm13,%ymm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,17                              ; jne           dfa <_sk_store_bgra_hsw_lowp+0xce>
+  DB  117,17                              ; jne           e2a <_sk_store_bgra_hsw_lowp+0xce>
   DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
   DB  196,65,126,127,84,147,32            ; vmovdqu       %ymm10,0x20(%r11,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -31675,17 +31790,17 @@
   DB  65,128,225,15                       ; and           $0xf,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,236                             ; ja            df6 <_sk_store_bgra_hsw_lowp+0xca>
+  DB  119,236                             ; ja            e26 <_sk_store_bgra_hsw_lowp+0xca>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,175,0,0,0                 ; lea           0xaf(%rip),%r10        # ec4 <_sk_store_bgra_hsw_lowp+0x198>
+  DB  76,141,21,175,0,0,0                 ; lea           0xaf(%rip),%r10        # ef4 <_sk_store_bgra_hsw_lowp+0x198>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,126,4,147                ; vmovd         %xmm8,(%r11,%rdx,4)
-  DB  235,208                             ; jmp           df6 <_sk_store_bgra_hsw_lowp+0xca>
+  DB  235,208                             ; jmp           e26 <_sk_store_bgra_hsw_lowp+0xca>
   DB  196,67,121,22,68,147,8,2            ; vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,4)
   DB  196,65,121,214,4,147                ; vmovq         %xmm8,(%r11,%rdx,4)
-  DB  235,192                             ; jmp           df6 <_sk_store_bgra_hsw_lowp+0xca>
+  DB  235,192                             ; jmp           e26 <_sk_store_bgra_hsw_lowp+0xca>
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,67,121,22,76,147,24,2           ; vpextrd       $0x2,%xmm9,0x18(%r11,%rdx,4)
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
@@ -31693,12 +31808,12 @@
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,65,121,126,76,147,16            ; vmovd         %xmm9,0x10(%r11,%rdx,4)
   DB  196,65,122,127,4,147                ; vmovdqu       %xmm8,(%r11,%rdx,4)
-  DB  235,143                             ; jmp           df6 <_sk_store_bgra_hsw_lowp+0xca>
+  DB  235,143                             ; jmp           e26 <_sk_store_bgra_hsw_lowp+0xca>
   DB  196,67,121,22,84,147,40,2           ; vpextrd       $0x2,%xmm10,0x28(%r11,%rdx,4)
   DB  196,67,121,22,84,147,36,1           ; vpextrd       $0x1,%xmm10,0x24(%r11,%rdx,4)
   DB  196,65,121,126,84,147,32            ; vmovd         %xmm10,0x20(%r11,%rdx,4)
   DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
-  DB  233,109,255,255,255                 ; jmpq          df6 <_sk_store_bgra_hsw_lowp+0xca>
+  DB  233,109,255,255,255                 ; jmpq          e26 <_sk_store_bgra_hsw_lowp+0xca>
   DB  196,67,125,57,209,1                 ; vextracti128  $0x1,%ymm10,%xmm9
   DB  196,67,121,22,76,147,56,2           ; vpextrd       $0x2,%xmm9,0x38(%r11,%rdx,4)
   DB  196,67,125,57,209,1                 ; vextracti128  $0x1,%ymm10,%xmm9
@@ -31707,7 +31822,7 @@
   DB  196,65,121,126,76,147,48            ; vmovd         %xmm9,0x30(%r11,%rdx,4)
   DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
   DB  196,65,122,127,84,147,32            ; vmovdqu       %xmm10,0x20(%r11,%rdx,4)
-  DB  233,50,255,255,255                  ; jmpq          df6 <_sk_store_bgra_hsw_lowp+0xca>
+  DB  233,50,255,255,255                  ; jmpq          e26 <_sk_store_bgra_hsw_lowp+0xca>
   DB  90                                  ; pop           %rdx
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -31748,11 +31863,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,45                              ; jne           f37 <_sk_load_a8_hsw_lowp+0x37>
+  DB  117,45                              ; jne           f67 <_sk_load_a8_hsw_lowp+0x37>
   DB  196,193,122,111,4,19                ; vmovdqu       (%r11,%rdx,1),%xmm0
   DB  196,226,125,48,192                  ; vpmovzxbw     %xmm0,%ymm0
   DB  197,253,113,240,8                   ; vpsllw        $0x8,%ymm0,%ymm0
-  DB  196,226,125,121,13,191,21,0,0       ; vpbroadcastw  0x15bf(%rip),%ymm1        # 24e2 <_sk_xor__hsw_lowp+0x336>
+  DB  196,226,125,121,13,239,21,0,0       ; vpbroadcastw  0x15ef(%rip),%ymm1        # 2542 <_sk_xor__hsw_lowp+0x366>
   DB  197,253,228,217                     ; vpmulhuw      %ymm1,%ymm0,%ymm3
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,253,239,192                     ; vpxor         %ymm0,%ymm0,%ymm0
@@ -31764,35 +31879,35 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,197                             ; ja            f10 <_sk_load_a8_hsw_lowp+0x10>
+  DB  119,197                             ; ja            f40 <_sk_load_a8_hsw_lowp+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,194,0,0,0                 ; lea           0xc2(%rip),%r10        # 1018 <_sk_load_a8_hsw_lowp+0x118>
+  DB  76,141,21,194,0,0,0                 ; lea           0xc2(%rip),%r10        # 1048 <_sk_load_a8_hsw_lowp+0x118>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  235,166                             ; jmp           f10 <_sk_load_a8_hsw_lowp+0x10>
+  DB  235,166                             ; jmp           f40 <_sk_load_a8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,2,2            ; vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm0,%xmm0
   DB  65,15,183,4,19                      ; movzwl        (%r11,%rdx,1),%eax
   DB  197,249,110,200                     ; vmovd         %eax,%xmm1
   DB  196,227,121,14,193,1                ; vpblendw      $0x1,%xmm1,%xmm0,%xmm0
-  DB  235,137                             ; jmp           f10 <_sk_load_a8_hsw_lowp+0x10>
+  DB  235,137                             ; jmp           f40 <_sk_load_a8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,6,6            ; vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,5,5            ; vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,4,4            ; vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,193,121,110,12,19               ; vmovd         (%r11,%rdx,1),%xmm1
   DB  196,227,121,2,193,1                 ; vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  DB  233,92,255,255,255                  ; jmpq          f10 <_sk_load_a8_hsw_lowp+0x10>
+  DB  233,92,255,255,255                  ; jmpq          f40 <_sk_load_a8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,10,10          ; vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,9,9            ; vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,8,8            ; vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,193,122,126,12,19               ; vmovq         (%r11,%rdx,1),%xmm1
   DB  196,227,113,2,192,12                ; vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  DB  233,47,255,255,255                  ; jmpq          f10 <_sk_load_a8_hsw_lowp+0x10>
+  DB  233,47,255,255,255                  ; jmpq          f40 <_sk_load_a8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,14,14          ; vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,13,13          ; vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm0,%xmm0
@@ -31800,7 +31915,7 @@
   DB  196,193,122,126,12,19               ; vmovq         (%r11,%rdx,1),%xmm1
   DB  196,195,113,34,76,19,8,2            ; vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm1,%xmm1
   DB  196,227,113,2,192,8                 ; vpblendd      $0x8,%xmm0,%xmm1,%xmm0
-  DB  233,250,254,255,255                 ; jmpq          f10 <_sk_load_a8_hsw_lowp+0x10>
+  DB  233,250,254,255,255                 ; jmpq          f40 <_sk_load_a8_hsw_lowp+0x10>
   DB  102,144                             ; xchg          %ax,%ax
   DB  71,255                              ; rex.RXB       (bad)
   DB  255                                 ; (bad)
@@ -31812,7 +31927,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  123,255                             ; jnp           102d <_sk_load_a8_hsw_lowp+0x12d>
+  DB  123,255                             ; jnp           105d <_sk_load_a8_hsw_lowp+0x12d>
   DB  255                                 ; (bad)
   DB  255,111,255                         ; ljmp          *-0x1(%rdi)
   DB  255                                 ; (bad)
@@ -31842,11 +31957,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,45                              ; jne           108b <_sk_load_a8_dst_hsw_lowp+0x37>
+  DB  117,45                              ; jne           10bb <_sk_load_a8_dst_hsw_lowp+0x37>
   DB  196,193,122,111,36,19               ; vmovdqu       (%r11,%rdx,1),%xmm4
   DB  196,226,125,48,228                  ; vpmovzxbw     %xmm4,%ymm4
   DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
-  DB  196,226,125,121,45,109,20,0,0       ; vpbroadcastw  0x146d(%rip),%ymm5        # 24e4 <_sk_xor__hsw_lowp+0x338>
+  DB  196,226,125,121,45,157,20,0,0       ; vpbroadcastw  0x149d(%rip),%ymm5        # 2544 <_sk_xor__hsw_lowp+0x368>
   DB  197,221,228,253                     ; vpmulhuw      %ymm5,%ymm4,%ymm7
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,221,239,228                     ; vpxor         %ymm4,%ymm4,%ymm4
@@ -31858,35 +31973,35 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,197                             ; ja            1064 <_sk_load_a8_dst_hsw_lowp+0x10>
+  DB  119,197                             ; ja            1094 <_sk_load_a8_dst_hsw_lowp+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,194,0,0,0                 ; lea           0xc2(%rip),%r10        # 116c <_sk_load_a8_dst_hsw_lowp+0x118>
+  DB  76,141,21,194,0,0,0                 ; lea           0xc2(%rip),%r10        # 119c <_sk_load_a8_dst_hsw_lowp+0x118>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  235,166                             ; jmp           1064 <_sk_load_a8_dst_hsw_lowp+0x10>
+  DB  235,166                             ; jmp           1094 <_sk_load_a8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,2,2            ; vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm4,%xmm4
   DB  65,15,183,4,19                      ; movzwl        (%r11,%rdx,1),%eax
   DB  197,249,110,232                     ; vmovd         %eax,%xmm5
   DB  196,227,89,14,229,1                 ; vpblendw      $0x1,%xmm5,%xmm4,%xmm4
-  DB  235,137                             ; jmp           1064 <_sk_load_a8_dst_hsw_lowp+0x10>
+  DB  235,137                             ; jmp           1094 <_sk_load_a8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,6,6            ; vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,5,5            ; vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,4,4            ; vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,193,121,110,44,19               ; vmovd         (%r11,%rdx,1),%xmm5
   DB  196,227,89,2,229,1                  ; vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  DB  233,92,255,255,255                  ; jmpq          1064 <_sk_load_a8_dst_hsw_lowp+0x10>
+  DB  233,92,255,255,255                  ; jmpq          1094 <_sk_load_a8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,10,10          ; vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,9,9            ; vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,8,8            ; vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,193,122,126,44,19               ; vmovq         (%r11,%rdx,1),%xmm5
   DB  196,227,81,2,228,12                 ; vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  DB  233,47,255,255,255                  ; jmpq          1064 <_sk_load_a8_dst_hsw_lowp+0x10>
+  DB  233,47,255,255,255                  ; jmpq          1094 <_sk_load_a8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,14,14          ; vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,13,13          ; vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm4,%xmm4
@@ -31894,7 +32009,7 @@
   DB  196,193,122,126,44,19               ; vmovq         (%r11,%rdx,1),%xmm5
   DB  196,195,81,34,108,19,8,2            ; vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm5,%xmm5
   DB  196,227,81,2,228,8                  ; vpblendd      $0x8,%xmm4,%xmm5,%xmm4
-  DB  233,250,254,255,255                 ; jmpq          1064 <_sk_load_a8_dst_hsw_lowp+0x10>
+  DB  233,250,254,255,255                 ; jmpq          1094 <_sk_load_a8_dst_hsw_lowp+0x10>
   DB  102,144                             ; xchg          %ax,%ax
   DB  71,255                              ; rex.RXB       (bad)
   DB  255                                 ; (bad)
@@ -31906,7 +32021,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  123,255                             ; jnp           1181 <_sk_load_a8_dst_hsw_lowp+0x12d>
+  DB  123,255                             ; jnp           11b1 <_sk_load_a8_dst_hsw_lowp+0x12d>
   DB  255                                 ; (bad)
   DB  255,111,255                         ; ljmp          *-0x1(%rdi)
   DB  255                                 ; (bad)
@@ -31939,7 +32054,7 @@
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,65,57,103,193                   ; vpackuswb     %xmm9,%xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,10                              ; jne           11cc <_sk_store_a8_hsw_lowp+0x24>
+  DB  117,10                              ; jne           11fc <_sk_store_a8_hsw_lowp+0x24>
   DB  196,65,122,127,4,19                 ; vmovdqu       %xmm8,(%r11,%rdx,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
@@ -31947,32 +32062,32 @@
   DB  65,128,225,15                       ; and           $0xf,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,236                             ; ja            11c8 <_sk_store_a8_hsw_lowp+0x20>
+  DB  119,236                             ; ja            11f8 <_sk_store_a8_hsw_lowp+0x20>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,137,0,0,0                 ; lea           0x89(%rip),%r10        # 1270 <_sk_store_a8_hsw_lowp+0xc8>
+  DB  76,141,21,137,0,0,0                 ; lea           0x89(%rip),%r10        # 12a0 <_sk_store_a8_hsw_lowp+0xc8>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,67,121,20,4,19,0                ; vpextrb       $0x0,%xmm8,(%r11,%rdx,1)
-  DB  235,207                             ; jmp           11c8 <_sk_store_a8_hsw_lowp+0x20>
+  DB  235,207                             ; jmp           11f8 <_sk_store_a8_hsw_lowp+0x20>
   DB  196,67,121,20,68,19,2,2             ; vpextrb       $0x2,%xmm8,0x2(%r11,%rdx,1)
   DB  196,67,121,21,4,19,0                ; vpextrw       $0x0,%xmm8,(%r11,%rdx,1)
-  DB  235,190                             ; jmp           11c8 <_sk_store_a8_hsw_lowp+0x20>
+  DB  235,190                             ; jmp           11f8 <_sk_store_a8_hsw_lowp+0x20>
   DB  196,67,121,20,68,19,6,6             ; vpextrb       $0x6,%xmm8,0x6(%r11,%rdx,1)
   DB  196,67,121,20,68,19,5,5             ; vpextrb       $0x5,%xmm8,0x5(%r11,%rdx,1)
   DB  196,67,121,20,68,19,4,4             ; vpextrb       $0x4,%xmm8,0x4(%r11,%rdx,1)
   DB  196,65,121,126,4,19                 ; vmovd         %xmm8,(%r11,%rdx,1)
-  DB  235,158                             ; jmp           11c8 <_sk_store_a8_hsw_lowp+0x20>
+  DB  235,158                             ; jmp           11f8 <_sk_store_a8_hsw_lowp+0x20>
   DB  196,67,121,20,68,19,10,10           ; vpextrb       $0xa,%xmm8,0xa(%r11,%rdx,1)
   DB  196,67,121,20,68,19,9,9             ; vpextrb       $0x9,%xmm8,0x9(%r11,%rdx,1)
   DB  196,67,121,20,68,19,8,8             ; vpextrb       $0x8,%xmm8,0x8(%r11,%rdx,1)
-  DB  235,32                              ; jmp           1264 <_sk_store_a8_hsw_lowp+0xbc>
+  DB  235,32                              ; jmp           1294 <_sk_store_a8_hsw_lowp+0xbc>
   DB  196,67,121,20,68,19,14,14           ; vpextrb       $0xe,%xmm8,0xe(%r11,%rdx,1)
   DB  196,67,121,20,68,19,13,13           ; vpextrb       $0xd,%xmm8,0xd(%r11,%rdx,1)
   DB  196,67,121,20,68,19,12,12           ; vpextrb       $0xc,%xmm8,0xc(%r11,%rdx,1)
   DB  196,67,121,22,68,19,8,2             ; vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,1)
   DB  196,65,121,214,4,19                 ; vmovq         %xmm8,(%r11,%rdx,1)
-  DB  233,89,255,255,255                  ; jmpq          11c8 <_sk_store_a8_hsw_lowp+0x20>
+  DB  233,89,255,255,255                  ; jmpq          11f8 <_sk_store_a8_hsw_lowp+0x20>
   DB  144                                 ; nop
   DB  128,255,255                         ; cmp           $0xff,%bh
   DB  255,145,255,255,255,137             ; callq         *-0x76000001(%rcx)
@@ -32013,14 +32128,14 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,50                              ; jne           12e8 <_sk_load_g8_hsw_lowp+0x3c>
+  DB  117,50                              ; jne           1318 <_sk_load_g8_hsw_lowp+0x3c>
   DB  196,193,122,111,4,19                ; vmovdqu       (%r11,%rdx,1),%xmm0
   DB  196,226,125,48,192                  ; vpmovzxbw     %xmm0,%ymm0
   DB  197,253,113,240,8                   ; vpsllw        $0x8,%ymm0,%ymm0
-  DB  196,226,125,121,13,23,18,0,0        ; vpbroadcastw  0x1217(%rip),%ymm1        # 24e6 <_sk_xor__hsw_lowp+0x33a>
+  DB  196,226,125,121,13,71,18,0,0        ; vpbroadcastw  0x1247(%rip),%ymm1        # 2546 <_sk_xor__hsw_lowp+0x36a>
   DB  197,253,228,193                     ; vpmulhuw      %ymm1,%ymm0,%ymm0
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,121,29,10,18,0,0        ; vpbroadcastw  0x120a(%rip),%ymm3        # 24e8 <_sk_xor__hsw_lowp+0x33c>
+  DB  196,226,125,121,29,58,18,0,0        ; vpbroadcastw  0x123a(%rip),%ymm3        # 2548 <_sk_xor__hsw_lowp+0x36c>
   DB  197,253,111,200                     ; vmovdqa       %ymm0,%ymm1
   DB  197,253,111,208                     ; vmovdqa       %ymm0,%ymm2
   DB  255,224                             ; jmpq          *%rax
@@ -32029,35 +32144,35 @@
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,192                             ; ja            12bc <_sk_load_g8_hsw_lowp+0x10>
+  DB  119,192                             ; ja            12ec <_sk_load_g8_hsw_lowp+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,193,0,0,0                 ; lea           0xc1(%rip),%r10        # 13c8 <_sk_load_g8_hsw_lowp+0x11c>
+  DB  76,141,21,193,0,0,0                 ; lea           0xc1(%rip),%r10        # 13f8 <_sk_load_g8_hsw_lowp+0x11c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,192                     ; vmovd         %eax,%xmm0
-  DB  235,161                             ; jmp           12bc <_sk_load_g8_hsw_lowp+0x10>
+  DB  235,161                             ; jmp           12ec <_sk_load_g8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,2,2            ; vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm0,%xmm0
   DB  65,15,183,4,19                      ; movzwl        (%r11,%rdx,1),%eax
   DB  197,249,110,200                     ; vmovd         %eax,%xmm1
   DB  196,227,121,14,193,1                ; vpblendw      $0x1,%xmm1,%xmm0,%xmm0
-  DB  235,132                             ; jmp           12bc <_sk_load_g8_hsw_lowp+0x10>
+  DB  235,132                             ; jmp           12ec <_sk_load_g8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,6,6            ; vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,5,5            ; vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,4,4            ; vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,193,121,110,12,19               ; vmovd         (%r11,%rdx,1),%xmm1
   DB  196,227,121,2,193,1                 ; vpblendd      $0x1,%xmm1,%xmm0,%xmm0
-  DB  233,87,255,255,255                  ; jmpq          12bc <_sk_load_g8_hsw_lowp+0x10>
+  DB  233,87,255,255,255                  ; jmpq          12ec <_sk_load_g8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,10,10          ; vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,9,9            ; vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,8,8            ; vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,193,122,126,12,19               ; vmovq         (%r11,%rdx,1),%xmm1
   DB  196,227,113,2,192,12                ; vpblendd      $0xc,%xmm0,%xmm1,%xmm0
-  DB  233,42,255,255,255                  ; jmpq          12bc <_sk_load_g8_hsw_lowp+0x10>
+  DB  233,42,255,255,255                  ; jmpq          12ec <_sk_load_g8_hsw_lowp+0x10>
   DB  197,249,239,192                     ; vpxor         %xmm0,%xmm0,%xmm0
   DB  196,195,121,32,68,19,14,14          ; vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm0,%xmm0
   DB  196,195,121,32,68,19,13,13          ; vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm0,%xmm0
@@ -32065,7 +32180,7 @@
   DB  196,193,122,126,12,19               ; vmovq         (%r11,%rdx,1),%xmm1
   DB  196,195,113,34,76,19,8,2            ; vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm1,%xmm1
   DB  196,227,113,2,192,8                 ; vpblendd      $0x8,%xmm0,%xmm1,%xmm0
-  DB  233,245,254,255,255                 ; jmpq          12bc <_sk_load_g8_hsw_lowp+0x10>
+  DB  233,245,254,255,255                 ; jmpq          12ec <_sk_load_g8_hsw_lowp+0x10>
   DB  144                                 ; nop
   DB  72,255                              ; rex.W         (bad)
   DB  255                                 ; (bad)
@@ -32076,7 +32191,7 @@
   DB  255,140,255,255,255,132,255         ; decl          -0x7b0001(%rdi,%rdi,8)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  124,255                             ; jl            13dd <_sk_load_g8_hsw_lowp+0x131>
+  DB  124,255                             ; jl            140d <_sk_load_g8_hsw_lowp+0x131>
   DB  255                                 ; (bad)
   DB  255,112,255                         ; pushq         -0x1(%rax)
   DB  255                                 ; (bad)
@@ -32106,14 +32221,14 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,50                              ; jne           1440 <_sk_load_g8_dst_hsw_lowp+0x3c>
+  DB  117,50                              ; jne           1470 <_sk_load_g8_dst_hsw_lowp+0x3c>
   DB  196,193,122,111,36,19               ; vmovdqu       (%r11,%rdx,1),%xmm4
   DB  196,226,125,48,228                  ; vpmovzxbw     %xmm4,%ymm4
   DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
-  DB  196,226,125,121,45,195,16,0,0       ; vpbroadcastw  0x10c3(%rip),%ymm5        # 24ea <_sk_xor__hsw_lowp+0x33e>
+  DB  196,226,125,121,45,243,16,0,0       ; vpbroadcastw  0x10f3(%rip),%ymm5        # 254a <_sk_xor__hsw_lowp+0x36e>
   DB  197,221,228,229                     ; vpmulhuw      %ymm5,%ymm4,%ymm4
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  196,226,125,121,61,182,16,0,0       ; vpbroadcastw  0x10b6(%rip),%ymm7        # 24ec <_sk_xor__hsw_lowp+0x340>
+  DB  196,226,125,121,61,230,16,0,0       ; vpbroadcastw  0x10e6(%rip),%ymm7        # 254c <_sk_xor__hsw_lowp+0x370>
   DB  197,253,111,236                     ; vmovdqa       %ymm4,%ymm5
   DB  197,253,111,244                     ; vmovdqa       %ymm4,%ymm6
   DB  255,224                             ; jmpq          *%rax
@@ -32122,35 +32237,35 @@
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,192                             ; ja            1414 <_sk_load_g8_dst_hsw_lowp+0x10>
+  DB  119,192                             ; ja            1444 <_sk_load_g8_dst_hsw_lowp+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,193,0,0,0                 ; lea           0xc1(%rip),%r10        # 1520 <_sk_load_g8_dst_hsw_lowp+0x11c>
+  DB  76,141,21,193,0,0,0                 ; lea           0xc1(%rip),%r10        # 1550 <_sk_load_g8_dst_hsw_lowp+0x11c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,249,110,224                     ; vmovd         %eax,%xmm4
-  DB  235,161                             ; jmp           1414 <_sk_load_g8_dst_hsw_lowp+0x10>
+  DB  235,161                             ; jmp           1444 <_sk_load_g8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,2,2            ; vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm4,%xmm4
   DB  65,15,183,4,19                      ; movzwl        (%r11,%rdx,1),%eax
   DB  197,249,110,232                     ; vmovd         %eax,%xmm5
   DB  196,227,89,14,229,1                 ; vpblendw      $0x1,%xmm5,%xmm4,%xmm4
-  DB  235,132                             ; jmp           1414 <_sk_load_g8_dst_hsw_lowp+0x10>
+  DB  235,132                             ; jmp           1444 <_sk_load_g8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,6,6            ; vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,5,5            ; vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,4,4            ; vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,193,121,110,44,19               ; vmovd         (%r11,%rdx,1),%xmm5
   DB  196,227,89,2,229,1                  ; vpblendd      $0x1,%xmm5,%xmm4,%xmm4
-  DB  233,87,255,255,255                  ; jmpq          1414 <_sk_load_g8_dst_hsw_lowp+0x10>
+  DB  233,87,255,255,255                  ; jmpq          1444 <_sk_load_g8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,10,10          ; vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,9,9            ; vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,8,8            ; vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,193,122,126,44,19               ; vmovq         (%r11,%rdx,1),%xmm5
   DB  196,227,81,2,228,12                 ; vpblendd      $0xc,%xmm4,%xmm5,%xmm4
-  DB  233,42,255,255,255                  ; jmpq          1414 <_sk_load_g8_dst_hsw_lowp+0x10>
+  DB  233,42,255,255,255                  ; jmpq          1444 <_sk_load_g8_dst_hsw_lowp+0x10>
   DB  197,217,239,228                     ; vpxor         %xmm4,%xmm4,%xmm4
   DB  196,195,89,32,100,19,14,14          ; vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm4,%xmm4
   DB  196,195,89,32,100,19,13,13          ; vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm4,%xmm4
@@ -32158,7 +32273,7 @@
   DB  196,193,122,126,44,19               ; vmovq         (%r11,%rdx,1),%xmm5
   DB  196,195,81,34,108,19,8,2            ; vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm5,%xmm5
   DB  196,227,81,2,228,8                  ; vpblendd      $0x8,%xmm4,%xmm5,%xmm4
-  DB  233,245,254,255,255                 ; jmpq          1414 <_sk_load_g8_dst_hsw_lowp+0x10>
+  DB  233,245,254,255,255                 ; jmpq          1444 <_sk_load_g8_dst_hsw_lowp+0x10>
   DB  144                                 ; nop
   DB  72,255                              ; rex.W         (bad)
   DB  255                                 ; (bad)
@@ -32169,7 +32284,7 @@
   DB  255,140,255,255,255,132,255         ; decl          -0x7b0001(%rdi,%rdi,8)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  124,255                             ; jl            1535 <_sk_load_g8_dst_hsw_lowp+0x131>
+  DB  124,255                             ; jl            1565 <_sk_load_g8_dst_hsw_lowp+0x131>
   DB  255                                 ; (bad)
   DB  255,112,255                         ; pushq         -0x1(%rax)
   DB  255                                 ; (bad)
@@ -32199,20 +32314,20 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,220,1,0,0                    ; jne           1746 <_sk_srcover_rgba_8888_hsw_lowp+0x1ea>
+  DB  15,133,220,1,0,0                    ; jne           1776 <_sk_srcover_rgba_8888_hsw_lowp+0x1ea>
   DB  196,193,126,111,124,147,32          ; vmovdqu       0x20(%r11,%rdx,4),%ymm7
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
-  DB  197,253,111,37,129,15,0,0           ; vmovdqa       0xf81(%rip),%ymm4        # 2500 <_sk_xor__hsw_lowp+0x354>
+  DB  197,253,111,37,177,15,0,0           ; vmovdqa       0xfb1(%rip),%ymm4        # 2560 <_sk_xor__hsw_lowp+0x384>
   DB  196,226,61,0,236                    ; vpshufb       %ymm4,%ymm8,%ymm5
   DB  196,227,253,0,237,232               ; vpermq        $0xe8,%ymm5,%ymm5
   DB  196,226,69,0,228                    ; vpshufb       %ymm4,%ymm7,%ymm4
   DB  196,227,253,0,228,232               ; vpermq        $0xe8,%ymm4,%ymm4
   DB  196,227,85,56,228,1                 ; vinserti128   $0x1,%xmm4,%ymm5,%ymm4
-  DB  196,98,125,121,13,124,15,0,0        ; vpbroadcastw  0xf7c(%rip),%ymm9        # 2520 <_sk_xor__hsw_lowp+0x374>
+  DB  196,98,125,121,13,172,15,0,0        ; vpbroadcastw  0xfac(%rip),%ymm9        # 2580 <_sk_xor__hsw_lowp+0x3a4>
   DB  197,221,113,244,8                   ; vpsllw        $0x8,%ymm4,%ymm4
-  DB  196,98,125,121,21,112,15,0,0        ; vpbroadcastw  0xf70(%rip),%ymm10        # 2522 <_sk_xor__hsw_lowp+0x376>
+  DB  196,98,125,121,21,160,15,0,0        ; vpbroadcastw  0xfa0(%rip),%ymm10        # 2582 <_sk_xor__hsw_lowp+0x3a6>
   DB  196,193,93,228,226                  ; vpmulhuw      %ymm10,%ymm4,%ymm4
-  DB  197,253,111,45,129,15,0,0           ; vmovdqa       0xf81(%rip),%ymm5        # 2540 <_sk_xor__hsw_lowp+0x394>
+  DB  197,253,111,45,177,15,0,0           ; vmovdqa       0xfb1(%rip),%ymm5        # 25a0 <_sk_xor__hsw_lowp+0x3c4>
   DB  196,226,61,0,245                    ; vpshufb       %ymm5,%ymm8,%ymm6
   DB  196,227,253,0,246,232               ; vpermq        $0xe8,%ymm6,%ymm6
   DB  196,226,69,0,237                    ; vpshufb       %ymm5,%ymm7,%ymm5
@@ -32220,7 +32335,7 @@
   DB  196,227,77,56,237,1                 ; vinserti128   $0x1,%xmm5,%ymm6,%ymm5
   DB  197,213,113,245,8                   ; vpsllw        $0x8,%ymm5,%ymm5
   DB  196,193,85,228,234                  ; vpmulhuw      %ymm10,%ymm5,%ymm5
-  DB  197,253,111,53,115,15,0,0           ; vmovdqa       0xf73(%rip),%ymm6        # 2560 <_sk_xor__hsw_lowp+0x3b4>
+  DB  197,253,111,53,163,15,0,0           ; vmovdqa       0xfa3(%rip),%ymm6        # 25c0 <_sk_xor__hsw_lowp+0x3e4>
   DB  196,98,61,0,222                     ; vpshufb       %ymm6,%ymm8,%ymm11
   DB  196,67,253,0,219,232                ; vpermq        $0xe8,%ymm11,%ymm11
   DB  196,226,69,0,246                    ; vpshufb       %ymm6,%ymm7,%ymm6
@@ -32228,7 +32343,7 @@
   DB  196,227,37,56,246,1                 ; vinserti128   $0x1,%xmm6,%ymm11,%ymm6
   DB  197,205,113,246,8                   ; vpsllw        $0x8,%ymm6,%ymm6
   DB  196,193,77,228,242                  ; vpmulhuw      %ymm10,%ymm6,%ymm6
-  DB  197,125,111,29,101,15,0,0           ; vmovdqa       0xf65(%rip),%ymm11        # 2580 <_sk_xor__hsw_lowp+0x3d4>
+  DB  197,125,111,29,149,15,0,0           ; vmovdqa       0xf95(%rip),%ymm11        # 25e0 <_sk_xor__hsw_lowp+0x404>
   DB  196,66,61,0,195                     ; vpshufb       %ymm11,%ymm8,%ymm8
   DB  196,67,253,0,192,232                ; vpermq        $0xe8,%ymm8,%ymm8
   DB  196,194,69,0,251                    ; vpshufb       %ymm11,%ymm7,%ymm7
@@ -32236,7 +32351,7 @@
   DB  196,227,61,56,255,1                 ; vinserti128   $0x1,%xmm7,%ymm8,%ymm7
   DB  197,197,113,247,8                   ; vpsllw        $0x8,%ymm7,%ymm7
   DB  196,193,69,228,250                  ; vpmulhuw      %ymm10,%ymm7,%ymm7
-  DB  196,98,125,121,5,86,15,0,0          ; vpbroadcastw  0xf56(%rip),%ymm8        # 25a0 <_sk_xor__hsw_lowp+0x3f4>
+  DB  196,98,125,121,5,134,15,0,0         ; vpbroadcastw  0xf86(%rip),%ymm8        # 2600 <_sk_xor__hsw_lowp+0x424>
   DB  197,61,249,195                      ; vpsubw        %ymm3,%ymm8,%ymm8
   DB  196,66,93,11,208                    ; vpmulhrsw     %ymm8,%ymm4,%ymm10
   DB  196,66,125,29,210                   ; vpabsw        %ymm10,%ymm10
@@ -32283,7 +32398,7 @@
   DB  196,65,13,235,193                   ; vpor          %ymm9,%ymm14,%ymm8
   DB  196,65,37,235,192                   ; vpor          %ymm8,%ymm11,%ymm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,77                              ; jne           1782 <_sk_srcover_rgba_8888_hsw_lowp+0x226>
+  DB  117,77                              ; jne           17b2 <_sk_srcover_rgba_8888_hsw_lowp+0x226>
   DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
   DB  196,65,126,127,84,147,32            ; vmovdqu       %ymm10,0x20(%r11,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -32294,26 +32409,26 @@
   DB  196,65,61,239,192                   ; vpxor         %ymm8,%ymm8,%ymm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  15,135,20,254,255,255               ; ja            1577 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  DB  15,135,20,254,255,255               ; ja            15a7 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,238,1,0,0                 ; lea           0x1ee(%rip),%r10        # 195c <_sk_srcover_rgba_8888_hsw_lowp+0x400>
+  DB  76,141,21,238,1,0,0                 ; lea           0x1ee(%rip),%r10        # 198c <_sk_srcover_rgba_8888_hsw_lowp+0x400>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,110,4,147                ; vmovd         (%r11,%rdx,4),%xmm8
-  DB  233,245,253,255,255                 ; jmpq          1577 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  DB  233,245,253,255,255                 ; jmpq          15a7 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,15                       ; and           $0xf,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,176                             ; ja            1742 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  DB  119,176                             ; ja            1772 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   DB  65,15,182,193                       ; movzbl        %r9b,%eax
-  DB  76,141,13,251,1,0,0                 ; lea           0x1fb(%rip),%r9        # 1998 <_sk_srcover_rgba_8888_hsw_lowp+0x43c>
+  DB  76,141,13,251,1,0,0                 ; lea           0x1fb(%rip),%r9        # 19c8 <_sk_srcover_rgba_8888_hsw_lowp+0x43c>
   DB  73,99,4,129                         ; movslq        (%r9,%rax,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  196,65,121,126,4,147                ; vmovd         %xmm8,(%r11,%rdx,4)
-  DB  235,148                             ; jmp           1742 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  DB  235,148                             ; jmp           1772 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   DB  196,193,121,110,100,147,8           ; vmovd         0x8(%r11,%rdx,4),%xmm4
   DB  196,226,121,89,228                  ; vpbroadcastq  %xmm4,%xmm4
   DB  197,197,239,255                     ; vpxor         %ymm7,%ymm7,%ymm7
@@ -32321,7 +32436,7 @@
   DB  196,194,121,53,36,147               ; vpmovzxdq     (%r11,%rdx,4),%xmm4
   DB  197,249,112,228,232                 ; vpshufd       $0xe8,%xmm4,%xmm4
   DB  196,99,61,2,196,3                   ; vpblendd      $0x3,%ymm4,%ymm8,%ymm8
-  DB  233,157,253,255,255                 ; jmpq          1577 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  DB  233,157,253,255,255                 ; jmpq          15a7 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   DB  196,193,121,110,100,147,24          ; vmovd         0x18(%r11,%rdx,4),%xmm4
   DB  196,226,125,89,228                  ; vpbroadcastq  %xmm4,%ymm4
   DB  197,197,239,255                     ; vpxor         %ymm7,%ymm7,%ymm7
@@ -32334,7 +32449,7 @@
   DB  196,99,61,56,196,1                  ; vinserti128   $0x1,%xmm4,%ymm8,%ymm8
   DB  196,193,122,111,36,147              ; vmovdqu       (%r11,%rdx,4),%xmm4
   DB  196,67,93,2,192,240                 ; vpblendd      $0xf0,%ymm8,%ymm4,%ymm8
-  DB  233,78,253,255,255                  ; jmpq          1577 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  DB  233,78,253,255,255                  ; jmpq          15a7 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   DB  196,193,121,110,100,147,40          ; vmovd         0x28(%r11,%rdx,4),%xmm4
   DB  196,226,121,89,228                  ; vpbroadcastq  %xmm4,%xmm4
   DB  197,213,239,237                     ; vpxor         %ymm5,%ymm5,%ymm5
@@ -32343,7 +32458,7 @@
   DB  196,227,69,2,252,15                 ; vpblendd      $0xf,%ymm4,%ymm7,%ymm7
   DB  196,193,121,110,100,147,32          ; vmovd         0x20(%r11,%rdx,4),%xmm4
   DB  196,227,69,2,252,1                  ; vpblendd      $0x1,%ymm4,%ymm7,%ymm7
-  DB  233,18,253,255,255                  ; jmpq          1571 <_sk_srcover_rgba_8888_hsw_lowp+0x15>
+  DB  233,18,253,255,255                  ; jmpq          15a1 <_sk_srcover_rgba_8888_hsw_lowp+0x15>
   DB  196,193,121,110,100,147,56          ; vmovd         0x38(%r11,%rdx,4),%xmm4
   DB  196,226,125,89,228                  ; vpbroadcastq  %xmm4,%ymm4
   DB  197,213,239,237                     ; vpxor         %ymm5,%ymm5,%ymm5
@@ -32357,10 +32472,10 @@
   DB  196,65,126,111,4,147                ; vmovdqu       (%r11,%rdx,4),%ymm8
   DB  196,193,122,111,100,147,32          ; vmovdqu       0x20(%r11,%rdx,4),%xmm4
   DB  196,227,93,2,255,240                ; vpblendd      $0xf0,%ymm7,%ymm4,%ymm7
-  DB  233,194,252,255,255                 ; jmpq          1577 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
+  DB  233,194,252,255,255                 ; jmpq          15a7 <_sk_srcover_rgba_8888_hsw_lowp+0x1b>
   DB  196,67,121,22,68,147,8,2            ; vpextrd       $0x2,%xmm8,0x8(%r11,%rdx,4)
   DB  196,65,121,214,4,147                ; vmovq         %xmm8,(%r11,%rdx,4)
-  DB  233,122,254,255,255                 ; jmpq          1742 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  DB  233,122,254,255,255                 ; jmpq          1772 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,67,121,22,76,147,24,2           ; vpextrd       $0x2,%xmm9,0x18(%r11,%rdx,4)
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
@@ -32368,12 +32483,12 @@
   DB  196,67,125,57,193,1                 ; vextracti128  $0x1,%ymm8,%xmm9
   DB  196,65,121,126,76,147,16            ; vmovd         %xmm9,0x10(%r11,%rdx,4)
   DB  196,65,122,127,4,147                ; vmovdqu       %xmm8,(%r11,%rdx,4)
-  DB  233,70,254,255,255                  ; jmpq          1742 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  DB  233,70,254,255,255                  ; jmpq          1772 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   DB  196,67,121,22,84,147,40,2           ; vpextrd       $0x2,%xmm10,0x28(%r11,%rdx,4)
   DB  196,67,121,22,84,147,36,1           ; vpextrd       $0x1,%xmm10,0x24(%r11,%rdx,4)
   DB  196,65,121,126,84,147,32            ; vmovd         %xmm10,0x20(%r11,%rdx,4)
   DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
-  DB  233,36,254,255,255                  ; jmpq          1742 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  DB  233,36,254,255,255                  ; jmpq          1772 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   DB  196,67,125,57,209,1                 ; vextracti128  $0x1,%ymm10,%xmm9
   DB  196,67,121,22,76,147,56,2           ; vpextrd       $0x2,%xmm9,0x38(%r11,%rdx,4)
   DB  196,67,125,57,209,1                 ; vextracti128  $0x1,%ymm10,%xmm9
@@ -32382,7 +32497,7 @@
   DB  196,65,121,126,76,147,48            ; vmovd         %xmm9,0x30(%r11,%rdx,4)
   DB  196,65,126,127,4,147                ; vmovdqu       %ymm8,(%r11,%rdx,4)
   DB  196,65,122,127,84,147,32            ; vmovdqu       %xmm10,0x20(%r11,%rdx,4)
-  DB  233,233,253,255,255                 ; jmpq          1742 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
+  DB  233,233,253,255,255                 ; jmpq          1772 <_sk_srcover_rgba_8888_hsw_lowp+0x1e6>
   DB  15,31,0                             ; nopl          (%rax)
   DB  27,254                              ; sbb           %esi,%edi
   DB  255                                 ; (bad)
@@ -32396,7 +32511,7 @@
   DB  255                                 ; (bad)
   DB  255,148,254,255,255,126,254         ; callq         *-0x1810001(%rsi,%rdi,8)
   DB  255                                 ; (bad)
-  DB  255,21,252,255,255,241              ; callq         *-0xe000004(%rip)        # fffffffff2001979 <_sk_xor__hsw_lowp+0xfffffffff1fff7cd>
+  DB  255,21,252,255,255,241              ; callq         *-0xe000004(%rip)        # fffffffff20019a9 <_sk_xor__hsw_lowp+0xfffffffff1fff7cd>
   DB  254                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,227                             ; jmpq          *%rbx
@@ -32407,7 +32522,7 @@
   DB  255                                 ; (bad)
   DB  255,65,255                          ; incl          -0x1(%rcx)
   DB  255                                 ; (bad)
-  DB  255,45,255,255,255,25               ; ljmp          *0x19ffffff(%rip)        # 1a001990 <_sk_xor__hsw_lowp+0x19fff7e4>
+  DB  255,45,255,255,255,25               ; ljmp          *0x19ffffff(%rip)        # 1a0019c0 <_sk_xor__hsw_lowp+0x19fff7e4>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,3                               ; incl          (%rbx)
@@ -32416,7 +32531,7 @@
   DB  255,14                              ; decl          (%rsi)
   DB  254                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  255,37,255,255,255,29               ; jmpq          *0x1dffffff(%rip)        # 1e0019a0 <_sk_xor__hsw_lowp+0x1dfff7f4>
+  DB  255,37,255,255,255,29               ; jmpq          *0x1dffffff(%rip)        # 1e0019d0 <_sk_xor__hsw_lowp+0x1dfff7f4>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,89,255                          ; lcall         *-0x1(%rcx)
@@ -32429,7 +32544,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  123,255                             ; jnp           19b5 <_sk_srcover_rgba_8888_hsw_lowp+0x459>
+  DB  123,255                             ; jnp           19e5 <_sk_srcover_rgba_8888_hsw_lowp+0x459>
   DB  255                                 ; (bad)
   DB  255,116,255,255                     ; pushq         -0x1(%rdi,%rdi,8)
   DB  255,108,255,255                     ; ljmp          *-0x1(%rdi,%rdi,8)
@@ -32445,7 +32560,7 @@
 _sk_scale_1_float_hsw_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,122,16,0                        ; vmovss        (%rax),%xmm8
-  DB  197,58,88,5,74,8,0,0                ; vaddss        0x84a(%rip),%xmm8,%xmm8        # 222c <_sk_xor__hsw_lowp+0x80>
+  DB  197,58,88,5,74,8,0,0                ; vaddss        0x84a(%rip),%xmm8,%xmm8        # 225c <_sk_xor__hsw_lowp+0x80>
   DB  197,121,126,192                     ; vmovd         %xmm8,%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
   DB  196,66,125,121,192                  ; vpbroadcastw  %xmm8,%ymm8
@@ -32465,11 +32580,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,75                              ; jne           1a70 <_sk_scale_u8_hsw_lowp+0x55>
+  DB  117,75                              ; jne           1aa0 <_sk_scale_u8_hsw_lowp+0x55>
   DB  196,65,122,111,4,19                 ; vmovdqu       (%r11,%rdx,1),%xmm8
   DB  196,66,125,48,192                   ; vpmovzxbw     %xmm8,%ymm8
   DB  196,193,61,113,240,8                ; vpsllw        $0x8,%ymm8,%ymm8
-  DB  196,98,125,121,13,99,11,0,0         ; vpbroadcastw  0xb63(%rip),%ymm9        # 25a2 <_sk_xor__hsw_lowp+0x3f6>
+  DB  196,98,125,121,13,147,11,0,0        ; vpbroadcastw  0xb93(%rip),%ymm9        # 2602 <_sk_xor__hsw_lowp+0x426>
   DB  196,65,61,228,193                   ; vpmulhuw      %ymm9,%ymm8,%ymm8
   DB  196,194,125,11,192                  ; vpmulhrsw     %ymm8,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
@@ -32486,35 +32601,35 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  119,166                             ; ja            1a2b <_sk_scale_u8_hsw_lowp+0x10>
+  DB  119,166                             ; ja            1a5b <_sk_scale_u8_hsw_lowp+0x10>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,200,0,0,0                 ; lea           0xc8(%rip),%r10        # 1b58 <_sk_scale_u8_hsw_lowp+0x13d>
+  DB  76,141,21,200,0,0,0                 ; lea           0xc8(%rip),%r10        # 1b88 <_sk_scale_u8_hsw_lowp+0x13d>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  235,135                             ; jmp           1a2b <_sk_scale_u8_hsw_lowp+0x10>
+  DB  235,135                             ; jmp           1a5b <_sk_scale_u8_hsw_lowp+0x10>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,2,2              ; vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm8,%xmm8
   DB  65,15,183,4,19                      ; movzwl        (%r11,%rdx,1),%eax
   DB  197,121,110,200                     ; vmovd         %eax,%xmm9
   DB  196,67,57,14,193,1                  ; vpblendw      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,102,255,255,255                 ; jmpq          1a2b <_sk_scale_u8_hsw_lowp+0x10>
+  DB  233,102,255,255,255                 ; jmpq          1a5b <_sk_scale_u8_hsw_lowp+0x10>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,6,6              ; vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,5,5              ; vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,4,4              ; vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,65,121,110,12,19                ; vmovd         (%r11,%rdx,1),%xmm9
   DB  196,67,57,2,193,1                   ; vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,56,255,255,255                  ; jmpq          1a2b <_sk_scale_u8_hsw_lowp+0x10>
+  DB  233,56,255,255,255                  ; jmpq          1a5b <_sk_scale_u8_hsw_lowp+0x10>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,10,10            ; vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,9,9              ; vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,8,8              ; vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,65,122,126,12,19                ; vmovq         (%r11,%rdx,1),%xmm9
   DB  196,67,49,2,192,12                  ; vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  DB  233,10,255,255,255                  ; jmpq          1a2b <_sk_scale_u8_hsw_lowp+0x10>
+  DB  233,10,255,255,255                  ; jmpq          1a5b <_sk_scale_u8_hsw_lowp+0x10>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,14,14            ; vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,13,13            ; vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm8,%xmm8
@@ -32522,7 +32637,7 @@
   DB  196,65,122,126,12,19                ; vmovq         (%r11,%rdx,1),%xmm9
   DB  196,67,49,34,76,19,8,2              ; vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm9,%xmm9
   DB  196,67,49,2,192,8                   ; vpblendd      $0x8,%xmm8,%xmm9,%xmm8
-  DB  233,212,254,255,255                 ; jmpq          1a2b <_sk_scale_u8_hsw_lowp+0x10>
+  DB  233,212,254,255,255                 ; jmpq          1a5b <_sk_scale_u8_hsw_lowp+0x10>
   DB  144                                 ; nop
   DB  65,255                              ; rex.B         (bad)
   DB  255                                 ; (bad)
@@ -32533,7 +32648,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  122,255                             ; jp            1b6d <_sk_scale_u8_hsw_lowp+0x152>
+  DB  122,255                             ; jp            1b9d <_sk_scale_u8_hsw_lowp+0x152>
   DB  255                                 ; (bad)
   DB  255,109,255                         ; ljmp          *-0x1(%rbp)
   DB  255                                 ; (bad)
@@ -32562,13 +32677,13 @@
 _sk_lerp_1_float_hsw_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  197,122,16,0                        ; vmovss        (%rax),%xmm8
-  DB  197,58,88,5,142,6,0,0               ; vaddss        0x68e(%rip),%xmm8,%xmm8        # 2230 <_sk_xor__hsw_lowp+0x84>
+  DB  197,58,88,5,142,6,0,0               ; vaddss        0x68e(%rip),%xmm8,%xmm8        # 2260 <_sk_xor__hsw_lowp+0x84>
   DB  197,121,126,192                     ; vmovd         %xmm8,%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
   DB  196,66,125,121,192                  ; vpbroadcastw  %xmm8,%ymm8
   DB  196,194,125,11,192                  ; vpmulhrsw     %ymm8,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
-  DB  196,98,125,121,13,226,9,0,0         ; vpbroadcastw  0x9e2(%rip),%ymm9        # 25a4 <_sk_xor__hsw_lowp+0x3f8>
+  DB  196,98,125,121,13,18,10,0,0         ; vpbroadcastw  0xa12(%rip),%ymm9        # 2604 <_sk_xor__hsw_lowp+0x428>
   DB  196,65,53,249,200                   ; vpsubw        %ymm8,%ymm9,%ymm9
   DB  196,66,93,11,209                    ; vpmulhrsw     %ymm9,%ymm4,%ymm10
   DB  196,66,125,29,210                   ; vpabsw        %ymm10,%ymm10
@@ -32596,15 +32711,15 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,145,0,0,0                    ; jne           1cc0 <_sk_lerp_u8_hsw_lowp+0x9f>
+  DB  15,133,145,0,0,0                    ; jne           1cf0 <_sk_lerp_u8_hsw_lowp+0x9f>
   DB  196,65,122,111,4,19                 ; vmovdqu       (%r11,%rdx,1),%xmm8
   DB  196,66,125,48,192                   ; vpmovzxbw     %xmm8,%ymm8
   DB  196,193,61,113,240,8                ; vpsllw        $0x8,%ymm8,%ymm8
-  DB  196,98,125,121,13,93,9,0,0          ; vpbroadcastw  0x95d(%rip),%ymm9        # 25a6 <_sk_xor__hsw_lowp+0x3fa>
+  DB  196,98,125,121,13,141,9,0,0         ; vpbroadcastw  0x98d(%rip),%ymm9        # 2606 <_sk_xor__hsw_lowp+0x42a>
   DB  196,65,61,228,193                   ; vpmulhuw      %ymm9,%ymm8,%ymm8
   DB  196,194,125,11,192                  ; vpmulhrsw     %ymm8,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
-  DB  196,98,125,121,13,71,9,0,0          ; vpbroadcastw  0x947(%rip),%ymm9        # 25a8 <_sk_xor__hsw_lowp+0x3fc>
+  DB  196,98,125,121,13,119,9,0,0         ; vpbroadcastw  0x977(%rip),%ymm9        # 2608 <_sk_xor__hsw_lowp+0x42c>
   DB  196,65,53,249,200                   ; vpsubw        %ymm8,%ymm9,%ymm9
   DB  196,66,93,11,209                    ; vpmulhrsw     %ymm9,%ymm4,%ymm10
   DB  196,66,125,29,210                   ; vpabsw        %ymm10,%ymm10
@@ -32631,35 +32746,35 @@
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,14                       ; cmp           $0xe,%r9b
-  DB  15,135,92,255,255,255               ; ja            1c35 <_sk_lerp_u8_hsw_lowp+0x14>
+  DB  15,135,92,255,255,255               ; ja            1c65 <_sk_lerp_u8_hsw_lowp+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,204,0,0,0                 ; lea           0xcc(%rip),%r10        # 1db0 <_sk_lerp_u8_hsw_lowp+0x18f>
+  DB  76,141,21,204,0,0,0                 ; lea           0xcc(%rip),%r10        # 1de0 <_sk_lerp_u8_hsw_lowp+0x18f>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  197,121,110,192                     ; vmovd         %eax,%xmm8
-  DB  233,58,255,255,255                  ; jmpq          1c35 <_sk_lerp_u8_hsw_lowp+0x14>
+  DB  233,58,255,255,255                  ; jmpq          1c65 <_sk_lerp_u8_hsw_lowp+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,2,2              ; vpinsrb       $0x2,0x2(%r11,%rdx,1),%xmm8,%xmm8
   DB  65,15,183,4,19                      ; movzwl        (%r11,%rdx,1),%eax
   DB  197,121,110,200                     ; vmovd         %eax,%xmm9
   DB  196,67,57,14,193,1                  ; vpblendw      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,25,255,255,255                  ; jmpq          1c35 <_sk_lerp_u8_hsw_lowp+0x14>
+  DB  233,25,255,255,255                  ; jmpq          1c65 <_sk_lerp_u8_hsw_lowp+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,6,6              ; vpinsrb       $0x6,0x6(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,5,5              ; vpinsrb       $0x5,0x5(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,4,4              ; vpinsrb       $0x4,0x4(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,65,121,110,12,19                ; vmovd         (%r11,%rdx,1),%xmm9
   DB  196,67,57,2,193,1                   ; vpblendd      $0x1,%xmm9,%xmm8,%xmm8
-  DB  233,235,254,255,255                 ; jmpq          1c35 <_sk_lerp_u8_hsw_lowp+0x14>
+  DB  233,235,254,255,255                 ; jmpq          1c65 <_sk_lerp_u8_hsw_lowp+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,10,10            ; vpinsrb       $0xa,0xa(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,9,9              ; vpinsrb       $0x9,0x9(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,8,8              ; vpinsrb       $0x8,0x8(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,65,122,126,12,19                ; vmovq         (%r11,%rdx,1),%xmm9
   DB  196,67,49,2,192,12                  ; vpblendd      $0xc,%xmm8,%xmm9,%xmm8
-  DB  233,189,254,255,255                 ; jmpq          1c35 <_sk_lerp_u8_hsw_lowp+0x14>
+  DB  233,189,254,255,255                 ; jmpq          1c65 <_sk_lerp_u8_hsw_lowp+0x14>
   DB  196,65,57,239,192                   ; vpxor         %xmm8,%xmm8,%xmm8
   DB  196,67,57,32,68,19,14,14            ; vpinsrb       $0xe,0xe(%r11,%rdx,1),%xmm8,%xmm8
   DB  196,67,57,32,68,19,13,13            ; vpinsrb       $0xd,0xd(%r11,%rdx,1),%xmm8,%xmm8
@@ -32667,7 +32782,7 @@
   DB  196,65,122,126,12,19                ; vmovq         (%r11,%rdx,1),%xmm9
   DB  196,67,49,34,76,19,8,2              ; vpinsrd       $0x2,0x8(%r11,%rdx,1),%xmm9,%xmm9
   DB  196,67,49,2,192,8                   ; vpblendd      $0x8,%xmm8,%xmm9,%xmm8
-  DB  233,135,254,255,255                 ; jmpq          1c35 <_sk_lerp_u8_hsw_lowp+0x14>
+  DB  233,135,254,255,255                 ; jmpq          1c65 <_sk_lerp_u8_hsw_lowp+0x14>
   DB  102,144                             ; xchg          %ax,%ax
   DB  61,255,255,255,88                   ; cmp           $0x58ffffff,%eax
   DB  255                                 ; (bad)
@@ -32678,7 +32793,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  121,255                             ; jns           1dc5 <_sk_lerp_u8_hsw_lowp+0x1a4>
+  DB  121,255                             ; jns           1df5 <_sk_lerp_u8_hsw_lowp+0x1a4>
   DB  255                                 ; (bad)
   DB  255,108,255,255                     ; ljmp          *-0x1(%rdi,%rdi,8)
   DB  255,183,255,255,255,175             ; pushq         -0x50000001(%rdi)
@@ -32740,7 +32855,7 @@
 _sk_srcatop_hsw_lowp LABEL PROC
   DB  196,226,125,11,199                  ; vpmulhrsw     %ymm7,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
-  DB  196,98,125,121,5,95,7,0,0           ; vpbroadcastw  0x75f(%rip),%ymm8        # 25aa <_sk_xor__hsw_lowp+0x3fe>
+  DB  196,98,125,121,5,143,7,0,0          ; vpbroadcastw  0x78f(%rip),%ymm8        # 260a <_sk_xor__hsw_lowp+0x42e>
   DB  197,61,249,195                      ; vpsubw        %ymm3,%ymm8,%ymm8
   DB  196,66,93,11,200                    ; vpmulhrsw     %ymm8,%ymm4,%ymm9
   DB  196,66,125,29,201                   ; vpabsw        %ymm9,%ymm9
@@ -32767,7 +32882,7 @@
 _sk_dstatop_hsw_lowp LABEL PROC
   DB  196,98,93,11,195                    ; vpmulhrsw     %ymm3,%ymm4,%ymm8
   DB  196,66,125,29,192                   ; vpabsw        %ymm8,%ymm8
-  DB  196,98,125,121,13,240,6,0,0         ; vpbroadcastw  0x6f0(%rip),%ymm9        # 25ac <_sk_xor__hsw_lowp+0x400>
+  DB  196,98,125,121,13,32,7,0,0          ; vpbroadcastw  0x720(%rip),%ymm9        # 260c <_sk_xor__hsw_lowp+0x430>
   DB  197,53,249,207                      ; vpsubw        %ymm7,%ymm9,%ymm9
   DB  196,194,125,11,193                  ; vpmulhrsw     %ymm9,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
@@ -32818,7 +32933,7 @@
 
 PUBLIC _sk_srcout_hsw_lowp
 _sk_srcout_hsw_lowp LABEL PROC
-  DB  196,98,125,121,5,47,6,0,0           ; vpbroadcastw  0x62f(%rip),%ymm8        # 25ae <_sk_xor__hsw_lowp+0x402>
+  DB  196,98,125,121,5,95,6,0,0           ; vpbroadcastw  0x65f(%rip),%ymm8        # 260e <_sk_xor__hsw_lowp+0x432>
   DB  197,61,249,199                      ; vpsubw        %ymm7,%ymm8,%ymm8
   DB  196,194,125,11,192                  ; vpmulhrsw     %ymm8,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
@@ -32833,7 +32948,7 @@
 
 PUBLIC _sk_dstout_hsw_lowp
 _sk_dstout_hsw_lowp LABEL PROC
-  DB  196,226,125,121,5,248,5,0,0         ; vpbroadcastw  0x5f8(%rip),%ymm0        # 25b0 <_sk_xor__hsw_lowp+0x404>
+  DB  196,226,125,121,5,40,6,0,0          ; vpbroadcastw  0x628(%rip),%ymm0        # 2610 <_sk_xor__hsw_lowp+0x434>
   DB  197,253,249,219                     ; vpsubw        %ymm3,%ymm0,%ymm3
   DB  196,226,93,11,195                   ; vpmulhrsw     %ymm3,%ymm4,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
@@ -32848,7 +32963,7 @@
 
 PUBLIC _sk_srcover_hsw_lowp
 _sk_srcover_hsw_lowp LABEL PROC
-  DB  196,98,125,121,5,193,5,0,0          ; vpbroadcastw  0x5c1(%rip),%ymm8        # 25b2 <_sk_xor__hsw_lowp+0x406>
+  DB  196,98,125,121,5,241,5,0,0          ; vpbroadcastw  0x5f1(%rip),%ymm8        # 2612 <_sk_xor__hsw_lowp+0x436>
   DB  197,61,249,195                      ; vpsubw        %ymm3,%ymm8,%ymm8
   DB  196,66,93,11,200                    ; vpmulhrsw     %ymm8,%ymm4,%ymm9
   DB  196,66,125,29,201                   ; vpabsw        %ymm9,%ymm9
@@ -32867,7 +32982,7 @@
 
 PUBLIC _sk_dstover_hsw_lowp
 _sk_dstover_hsw_lowp LABEL PROC
-  DB  196,98,125,121,5,122,5,0,0          ; vpbroadcastw  0x57a(%rip),%ymm8        # 25b4 <_sk_xor__hsw_lowp+0x408>
+  DB  196,98,125,121,5,170,5,0,0          ; vpbroadcastw  0x5aa(%rip),%ymm8        # 2614 <_sk_xor__hsw_lowp+0x438>
   DB  197,61,249,199                      ; vpsubw        %ymm7,%ymm8,%ymm8
   DB  196,194,125,11,192                  ; vpmulhrsw     %ymm8,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
@@ -32899,7 +33014,7 @@
 
 PUBLIC _sk_multiply_hsw_lowp
 _sk_multiply_hsw_lowp LABEL PROC
-  DB  196,98,125,121,5,7,5,0,0            ; vpbroadcastw  0x507(%rip),%ymm8        # 25b6 <_sk_xor__hsw_lowp+0x40a>
+  DB  196,98,125,121,5,55,5,0,0           ; vpbroadcastw  0x537(%rip),%ymm8        # 2616 <_sk_xor__hsw_lowp+0x43a>
   DB  197,61,249,207                      ; vpsubw        %ymm7,%ymm8,%ymm9
   DB  196,66,125,11,209                   ; vpmulhrsw     %ymm9,%ymm0,%ymm10
   DB  196,66,125,29,210                   ; vpabsw        %ymm10,%ymm10
@@ -32939,7 +33054,7 @@
 
 PUBLIC _sk_screen_hsw_lowp
 _sk_screen_hsw_lowp LABEL PROC
-  DB  196,98,125,121,5,88,4,0,0           ; vpbroadcastw  0x458(%rip),%ymm8        # 25b8 <_sk_xor__hsw_lowp+0x40c>
+  DB  196,98,125,121,5,136,4,0,0          ; vpbroadcastw  0x488(%rip),%ymm8        # 2618 <_sk_xor__hsw_lowp+0x43c>
   DB  197,61,249,200                      ; vpsubw        %ymm0,%ymm8,%ymm9
   DB  196,98,53,11,204                    ; vpmulhrsw     %ymm4,%ymm9,%ymm9
   DB  196,66,125,29,201                   ; vpabsw        %ymm9,%ymm9
@@ -32961,7 +33076,7 @@
 
 PUBLIC _sk_xor__hsw_lowp
 _sk_xor__hsw_lowp LABEL PROC
-  DB  196,98,125,121,5,5,4,0,0            ; vpbroadcastw  0x405(%rip),%ymm8        # 25ba <_sk_xor__hsw_lowp+0x40e>
+  DB  196,98,125,121,5,53,4,0,0           ; vpbroadcastw  0x435(%rip),%ymm8        # 261a <_sk_xor__hsw_lowp+0x43e>
   DB  197,61,249,207                      ; vpsubw        %ymm7,%ymm8,%ymm9
   DB  196,194,125,11,193                  ; vpmulhrsw     %ymm9,%ymm0,%ymm0
   DB  196,226,125,29,192                  ; vpabsw        %ymm0,%ymm0
@@ -32996,6 +33111,20 @@
   DB  67                                  ; rex.XB
 
 ALIGN 32
+  DB  0,128,0,128,0,0                     ; add           %al,0x8000(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
+  DB  0,0                                 ; add           %al,(%rax)
   DB  0,1                                 ; add           %al,(%rcx)
   DB  4,5                                 ; add           $0x5,%al
   DB  8,9                                 ; or            %cl,(%rcx)
@@ -33031,7 +33160,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,17                              ; callq         *(%rcx)
-  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3bad <_sk_xor__hsw_lowp+0x1d1a1a01>
+  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3c0d <_sk_xor__hsw_lowp+0x1d1a1a31>
   DB  30                                  ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -33122,7 +33251,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,17                              ; callq         *(%rcx)
-  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3c4d <_sk_xor__hsw_lowp+0x1d1a1aa1>
+  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3cad <_sk_xor__hsw_lowp+0x1d1a1ad1>
   DB  30                                  ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -33232,7 +33361,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,17                              ; callq         *(%rcx)
-  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3d0d <_sk_xor__hsw_lowp+0x1d1a1b61>
+  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3d6d <_sk_xor__hsw_lowp+0x1d1a1b91>
   DB  30                                  ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -33323,7 +33452,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,17                              ; callq         *(%rcx)
-  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3dad <_sk_xor__hsw_lowp+0x1d1a1c01>
+  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3e0d <_sk_xor__hsw_lowp+0x1d1a1c31>
   DB  30                                  ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -33425,7 +33554,7 @@
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255,17                              ; callq         *(%rcx)
-  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3e6d <_sk_xor__hsw_lowp+0x1d1a1cc1>
+  DB  18,21,22,25,26,29                   ; adc           0x1d1a1916(%rip),%dl        # 1d1a3ecd <_sk_xor__hsw_lowp+0x1d1a1cf1>
   DB  30                                  ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -33575,11 +33704,11 @@
 _sk_just_return_ssse3_lowp LABEL PROC
   DB  195                                 ; retq
 
-PUBLIC _sk_constant_color_ssse3_lowp
-_sk_constant_color_ssse3_lowp LABEL PROC
+PUBLIC _sk_uniform_color_ssse3_lowp
+_sk_uniform_color_ssse3_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  15,16,24                            ; movups        (%rax),%xmm3
-  DB  15,88,29,208,25,0,0                 ; addps         0x19d0(%rip),%xmm3        # 1b00 <_sk_xor__ssse3_lowp+0xa7>
+  DB  15,88,29,240,25,0,0                 ; addps         0x19f0(%rip),%xmm3        # 1b20 <_sk_xor__ssse3_lowp+0x9f>
   DB  242,15,112,195,0                    ; pshuflw       $0x0,%xmm3,%xmm0
   DB  102,15,112,192,80                   ; pshufd        $0x50,%xmm0,%xmm0
   DB  242,15,112,203,170                  ; pshuflw       $0xaa,%xmm3,%xmm1
@@ -33591,10 +33720,28 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  255,224                             ; jmpq          *%rax
 
+PUBLIC _sk_black_color_ssse3_lowp
+_sk_black_color_ssse3_lowp LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  15,40,29,203,25,0,0                 ; movaps        0x19cb(%rip),%xmm3        # 1b30 <_sk_xor__ssse3_lowp+0xaf>
+  DB  15,87,192                           ; xorps         %xmm0,%xmm0
+  DB  15,87,201                           ; xorps         %xmm1,%xmm1
+  DB  15,87,210                           ; xorps         %xmm2,%xmm2
+  DB  255,224                             ; jmpq          *%rax
+
+PUBLIC _sk_white_color_ssse3_lowp
+_sk_white_color_ssse3_lowp LABEL PROC
+  DB  72,173                              ; lods          %ds:(%rsi),%rax
+  DB  15,40,5,199,25,0,0                  ; movaps        0x19c7(%rip),%xmm0        # 1b40 <_sk_xor__ssse3_lowp+0xbf>
+  DB  15,40,200                           ; movaps        %xmm0,%xmm1
+  DB  15,40,208                           ; movaps        %xmm0,%xmm2
+  DB  15,40,216                           ; movaps        %xmm0,%xmm3
+  DB  255,224                             ; jmpq          *%rax
+
 PUBLIC _sk_set_rgb_ssse3_lowp
 _sk_set_rgb_ssse3_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  243,15,16,21,202,28,0,0             ; movss         0x1cca(%rip),%xmm2        # 1e30 <_sk_xor__ssse3_lowp+0x3d7>
+  DB  243,15,16,21,226,28,0,0             ; movss         0x1ce2(%rip),%xmm2        # 1e70 <_sk_xor__ssse3_lowp+0x3ef>
   DB  243,15,16,0                         ; movss         (%rax),%xmm0
   DB  243,15,88,194                       ; addss         %xmm2,%xmm0
   DB  102,65,15,126,193                   ; movd          %xmm0,%r9d
@@ -33631,19 +33778,19 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,191,0,0,0                    ; jne           2a9 <_sk_load_8888_ssse3_lowp+0xcd>
+  DB  15,133,191,0,0,0                    ; jne           2d1 <_sk_load_8888_ssse3_lowp+0xcd>
   DB  69,15,16,68,147,16                  ; movups        0x10(%r11,%rdx,4),%xmm8
   DB  102,65,15,16,28,147                 ; movupd        (%r11,%rdx,4),%xmm3
-  DB  102,15,111,13,18,25,0,0             ; movdqa        0x1912(%rip),%xmm1        # 1b10 <_sk_xor__ssse3_lowp+0xb7>
+  DB  102,15,111,13,42,25,0,0             ; movdqa        0x192a(%rip),%xmm1        # 1b50 <_sk_xor__ssse3_lowp+0xcf>
   DB  102,15,40,195                       ; movapd        %xmm3,%xmm0
   DB  102,15,56,0,193                     ; pshufb        %xmm1,%xmm0
   DB  102,65,15,111,208                   ; movdqa        %xmm8,%xmm2
   DB  102,15,56,0,209                     ; pshufb        %xmm1,%xmm2
   DB  102,15,108,194                      ; punpcklqdq    %xmm2,%xmm0
   DB  102,15,113,240,8                    ; psllw         $0x8,%xmm0
-  DB  102,68,15,111,13,253,24,0,0         ; movdqa        0x18fd(%rip),%xmm9        # 1b20 <_sk_xor__ssse3_lowp+0xc7>
+  DB  102,68,15,111,13,21,25,0,0          ; movdqa        0x1915(%rip),%xmm9        # 1b60 <_sk_xor__ssse3_lowp+0xdf>
   DB  102,65,15,228,193                   ; pmulhuw       %xmm9,%xmm0
-  DB  102,68,15,111,21,255,24,0,0         ; movdqa        0x18ff(%rip),%xmm10        # 1b30 <_sk_xor__ssse3_lowp+0xd7>
+  DB  102,68,15,111,21,23,25,0,0          ; movdqa        0x1917(%rip),%xmm10        # 1b70 <_sk_xor__ssse3_lowp+0xef>
   DB  102,15,40,203                       ; movapd        %xmm3,%xmm1
   DB  102,65,15,56,0,202                  ; pshufb        %xmm10,%xmm1
   DB  102,65,15,111,208                   ; movdqa        %xmm8,%xmm2
@@ -33651,7 +33798,7 @@
   DB  102,15,108,202                      ; punpcklqdq    %xmm2,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
   DB  102,65,15,228,201                   ; pmulhuw       %xmm9,%xmm1
-  DB  102,68,15,111,21,227,24,0,0         ; movdqa        0x18e3(%rip),%xmm10        # 1b40 <_sk_xor__ssse3_lowp+0xe7>
+  DB  102,68,15,111,21,251,24,0,0         ; movdqa        0x18fb(%rip),%xmm10        # 1b80 <_sk_xor__ssse3_lowp+0xff>
   DB  102,15,40,211                       ; movapd        %xmm3,%xmm2
   DB  102,65,15,56,0,210                  ; pshufb        %xmm10,%xmm2
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
@@ -33659,7 +33806,7 @@
   DB  102,65,15,108,211                   ; punpcklqdq    %xmm11,%xmm2
   DB  102,15,113,242,8                    ; psllw         $0x8,%xmm2
   DB  102,65,15,228,209                   ; pmulhuw       %xmm9,%xmm2
-  DB  102,68,15,111,21,198,24,0,0         ; movdqa        0x18c6(%rip),%xmm10        # 1b50 <_sk_xor__ssse3_lowp+0xf7>
+  DB  102,68,15,111,21,222,24,0,0         ; movdqa        0x18de(%rip),%xmm10        # 1b90 <_sk_xor__ssse3_lowp+0x10f>
   DB  102,65,15,56,0,218                  ; pshufb        %xmm10,%xmm3
   DB  102,69,15,56,0,194                  ; pshufb        %xmm10,%xmm8
   DB  102,65,15,108,216                   ; punpcklqdq    %xmm8,%xmm3
@@ -33673,18 +33820,18 @@
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,48,255,255,255               ; ja            1f6 <_sk_load_8888_ssse3_lowp+0x1a>
+  DB  15,135,48,255,255,255               ; ja            21e <_sk_load_8888_ssse3_lowp+0x1a>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,95,0,0,0                  ; lea           0x5f(%rip),%r10        # 330 <_sk_load_8888_ssse3_lowp+0x154>
+  DB  76,141,21,95,0,0,0                  ; lea           0x5f(%rip),%r10        # 358 <_sk_load_8888_ssse3_lowp+0x154>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  243,65,15,16,28,147                 ; movss         (%r11,%rdx,4),%xmm3
-  DB  233,17,255,255,255                  ; jmpq          1f6 <_sk_load_8888_ssse3_lowp+0x1a>
+  DB  233,17,255,255,255                  ; jmpq          21e <_sk_load_8888_ssse3_lowp+0x1a>
   DB  102,65,15,110,68,147,8              ; movd          0x8(%r11,%rdx,4),%xmm0
   DB  102,15,112,216,69                   ; pshufd        $0x45,%xmm0,%xmm3
   DB  102,65,15,18,28,147                 ; movlpd        (%r11,%rdx,4),%xmm3
-  DB  233,250,254,255,255                 ; jmpq          1f6 <_sk_load_8888_ssse3_lowp+0x1a>
+  DB  233,250,254,255,255                 ; jmpq          21e <_sk_load_8888_ssse3_lowp+0x1a>
   DB  102,65,15,110,68,147,24             ; movd          0x18(%r11,%rdx,4),%xmm0
   DB  102,68,15,112,192,69                ; pshufd        $0x45,%xmm0,%xmm8
   DB  243,65,15,16,68,147,20              ; movss         0x14(%r11,%rdx,4),%xmm0
@@ -33693,7 +33840,7 @@
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
   DB  243,65,15,16,68,147,16              ; movss         0x10(%r11,%rdx,4),%xmm0
   DB  243,68,15,16,192                    ; movss         %xmm0,%xmm8
-  DB  233,193,254,255,255                 ; jmpq          1f0 <_sk_load_8888_ssse3_lowp+0x14>
+  DB  233,193,254,255,255                 ; jmpq          218 <_sk_load_8888_ssse3_lowp+0x14>
   DB  144                                 ; nop
   DB  170                                 ; stos          %al,%es:(%rdi)
   DB  255                                 ; (bad)
@@ -33721,19 +33868,19 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,191,0,0,0                    ; jne           419 <_sk_load_8888_dst_ssse3_lowp+0xcd>
+  DB  15,133,191,0,0,0                    ; jne           441 <_sk_load_8888_dst_ssse3_lowp+0xcd>
   DB  69,15,16,68,147,16                  ; movups        0x10(%r11,%rdx,4),%xmm8
   DB  102,65,15,16,60,147                 ; movupd        (%r11,%rdx,4),%xmm7
-  DB  102,15,111,45,242,23,0,0            ; movdqa        0x17f2(%rip),%xmm5        # 1b60 <_sk_xor__ssse3_lowp+0x107>
+  DB  102,15,111,45,10,24,0,0             ; movdqa        0x180a(%rip),%xmm5        # 1ba0 <_sk_xor__ssse3_lowp+0x11f>
   DB  102,15,40,231                       ; movapd        %xmm7,%xmm4
   DB  102,15,56,0,229                     ; pshufb        %xmm5,%xmm4
   DB  102,65,15,111,240                   ; movdqa        %xmm8,%xmm6
   DB  102,15,56,0,245                     ; pshufb        %xmm5,%xmm6
   DB  102,15,108,230                      ; punpcklqdq    %xmm6,%xmm4
   DB  102,15,113,244,8                    ; psllw         $0x8,%xmm4
-  DB  102,68,15,111,13,221,23,0,0         ; movdqa        0x17dd(%rip),%xmm9        # 1b70 <_sk_xor__ssse3_lowp+0x117>
+  DB  102,68,15,111,13,245,23,0,0         ; movdqa        0x17f5(%rip),%xmm9        # 1bb0 <_sk_xor__ssse3_lowp+0x12f>
   DB  102,65,15,228,225                   ; pmulhuw       %xmm9,%xmm4
-  DB  102,68,15,111,21,223,23,0,0         ; movdqa        0x17df(%rip),%xmm10        # 1b80 <_sk_xor__ssse3_lowp+0x127>
+  DB  102,68,15,111,21,247,23,0,0         ; movdqa        0x17f7(%rip),%xmm10        # 1bc0 <_sk_xor__ssse3_lowp+0x13f>
   DB  102,15,40,239                       ; movapd        %xmm7,%xmm5
   DB  102,65,15,56,0,234                  ; pshufb        %xmm10,%xmm5
   DB  102,65,15,111,240                   ; movdqa        %xmm8,%xmm6
@@ -33741,7 +33888,7 @@
   DB  102,15,108,238                      ; punpcklqdq    %xmm6,%xmm5
   DB  102,15,113,245,8                    ; psllw         $0x8,%xmm5
   DB  102,65,15,228,233                   ; pmulhuw       %xmm9,%xmm5
-  DB  102,68,15,111,21,195,23,0,0         ; movdqa        0x17c3(%rip),%xmm10        # 1b90 <_sk_xor__ssse3_lowp+0x137>
+  DB  102,68,15,111,21,219,23,0,0         ; movdqa        0x17db(%rip),%xmm10        # 1bd0 <_sk_xor__ssse3_lowp+0x14f>
   DB  102,15,40,247                       ; movapd        %xmm7,%xmm6
   DB  102,65,15,56,0,242                  ; pshufb        %xmm10,%xmm6
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
@@ -33749,7 +33896,7 @@
   DB  102,65,15,108,243                   ; punpcklqdq    %xmm11,%xmm6
   DB  102,15,113,246,8                    ; psllw         $0x8,%xmm6
   DB  102,65,15,228,241                   ; pmulhuw       %xmm9,%xmm6
-  DB  102,68,15,111,21,166,23,0,0         ; movdqa        0x17a6(%rip),%xmm10        # 1ba0 <_sk_xor__ssse3_lowp+0x147>
+  DB  102,68,15,111,21,190,23,0,0         ; movdqa        0x17be(%rip),%xmm10        # 1be0 <_sk_xor__ssse3_lowp+0x15f>
   DB  102,65,15,56,0,250                  ; pshufb        %xmm10,%xmm7
   DB  102,69,15,56,0,194                  ; pshufb        %xmm10,%xmm8
   DB  102,65,15,108,248                   ; punpcklqdq    %xmm8,%xmm7
@@ -33763,18 +33910,18 @@
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,48,255,255,255               ; ja            366 <_sk_load_8888_dst_ssse3_lowp+0x1a>
+  DB  15,135,48,255,255,255               ; ja            38e <_sk_load_8888_dst_ssse3_lowp+0x1a>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,95,0,0,0                  ; lea           0x5f(%rip),%r10        # 4a0 <_sk_load_8888_dst_ssse3_lowp+0x154>
+  DB  76,141,21,95,0,0,0                  ; lea           0x5f(%rip),%r10        # 4c8 <_sk_load_8888_dst_ssse3_lowp+0x154>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  243,65,15,16,60,147                 ; movss         (%r11,%rdx,4),%xmm7
-  DB  233,17,255,255,255                  ; jmpq          366 <_sk_load_8888_dst_ssse3_lowp+0x1a>
+  DB  233,17,255,255,255                  ; jmpq          38e <_sk_load_8888_dst_ssse3_lowp+0x1a>
   DB  102,65,15,110,100,147,8             ; movd          0x8(%r11,%rdx,4),%xmm4
   DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
   DB  102,65,15,18,60,147                 ; movlpd        (%r11,%rdx,4),%xmm7
-  DB  233,250,254,255,255                 ; jmpq          366 <_sk_load_8888_dst_ssse3_lowp+0x1a>
+  DB  233,250,254,255,255                 ; jmpq          38e <_sk_load_8888_dst_ssse3_lowp+0x1a>
   DB  102,65,15,110,100,147,24            ; movd          0x18(%r11,%rdx,4),%xmm4
   DB  102,68,15,112,196,69                ; pshufd        $0x45,%xmm4,%xmm8
   DB  243,65,15,16,100,147,20             ; movss         0x14(%r11,%rdx,4),%xmm4
@@ -33783,7 +33930,7 @@
   DB  68,15,40,196                        ; movaps        %xmm4,%xmm8
   DB  243,65,15,16,100,147,16             ; movss         0x10(%r11,%rdx,4),%xmm4
   DB  243,68,15,16,196                    ; movss         %xmm4,%xmm8
-  DB  233,193,254,255,255                 ; jmpq          360 <_sk_load_8888_dst_ssse3_lowp+0x14>
+  DB  233,193,254,255,255                 ; jmpq          388 <_sk_load_8888_dst_ssse3_lowp+0x14>
   DB  144                                 ; nop
   DB  170                                 ; stos          %al,%es:(%rdi)
   DB  255                                 ; (bad)
@@ -33812,7 +33959,7 @@
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  102,68,15,111,192                   ; movdqa        %xmm0,%xmm8
   DB  102,65,15,113,208,7                 ; psrlw         $0x7,%xmm8
-  DB  102,68,15,111,21,219,22,0,0         ; movdqa        0x16db(%rip),%xmm10        # 1bb0 <_sk_xor__ssse3_lowp+0x157>
+  DB  102,68,15,111,21,243,22,0,0         ; movdqa        0x16f3(%rip),%xmm10        # 1bf0 <_sk_xor__ssse3_lowp+0x16f>
   DB  102,69,15,234,194                   ; pminsw        %xmm10,%xmm8
   DB  102,69,15,239,219                   ; pxor          %xmm11,%xmm11
   DB  102,69,15,111,232                   ; movdqa        %xmm8,%xmm13
@@ -33849,7 +33996,7 @@
   DB  102,69,15,235,198                   ; por           %xmm14,%xmm8
   DB  102,69,15,235,193                   ; por           %xmm9,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,17                              ; jne           5a3 <_sk_store_8888_ssse3_lowp+0xe7>
+  DB  117,17                              ; jne           5cb <_sk_store_8888_ssse3_lowp+0xe7>
   DB  243,69,15,127,4,147                 ; movdqu        %xmm8,(%r11,%rdx,4)
   DB  243,69,15,127,84,147,16             ; movdqu        %xmm10,0x10(%r11,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -33858,25 +34005,25 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,236                             ; ja            59f <_sk_store_8888_ssse3_lowp+0xe3>
+  DB  119,236                             ; ja            5c7 <_sk_store_8888_ssse3_lowp+0xe3>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,82,0,0,0                  ; lea           0x52(%rip),%r10        # 610 <_sk_store_8888_ssse3_lowp+0x154>
+  DB  76,141,21,82,0,0,0                  ; lea           0x52(%rip),%r10        # 638 <_sk_store_8888_ssse3_lowp+0x154>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  102,69,15,126,4,147                 ; movd          %xmm8,(%r11,%rdx,4)
-  DB  235,208                             ; jmp           59f <_sk_store_8888_ssse3_lowp+0xe3>
+  DB  235,208                             ; jmp           5c7 <_sk_store_8888_ssse3_lowp+0xe3>
   DB  102,69,15,112,200,78                ; pshufd        $0x4e,%xmm8,%xmm9
   DB  102,69,15,126,76,147,8              ; movd          %xmm9,0x8(%r11,%rdx,4)
   DB  102,69,15,214,4,147                 ; movq          %xmm8,(%r11,%rdx,4)
-  DB  235,187                             ; jmp           59f <_sk_store_8888_ssse3_lowp+0xe3>
+  DB  235,187                             ; jmp           5c7 <_sk_store_8888_ssse3_lowp+0xe3>
   DB  102,69,15,112,202,78                ; pshufd        $0x4e,%xmm10,%xmm9
   DB  102,69,15,126,76,147,24             ; movd          %xmm9,0x18(%r11,%rdx,4)
   DB  102,69,15,112,202,229               ; pshufd        $0xe5,%xmm10,%xmm9
   DB  102,69,15,126,76,147,20             ; movd          %xmm9,0x14(%r11,%rdx,4)
   DB  102,69,15,126,84,147,16             ; movd          %xmm10,0x10(%r11,%rdx,4)
   DB  243,69,15,127,4,147                 ; movdqu        %xmm8,(%r11,%rdx,4)
-  DB  235,146                             ; jmp           59f <_sk_store_8888_ssse3_lowp+0xe3>
+  DB  235,146                             ; jmp           5c7 <_sk_store_8888_ssse3_lowp+0xe3>
   DB  15,31,0                             ; nopl          (%rax)
   DB  183,255                             ; mov           $0xff,%bh
   DB  255                                 ; (bad)
@@ -33904,19 +34051,19 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,191,0,0,0                    ; jne           6f9 <_sk_load_bgra_ssse3_lowp+0xcd>
+  DB  15,133,191,0,0,0                    ; jne           721 <_sk_load_bgra_ssse3_lowp+0xcd>
   DB  69,15,16,68,147,16                  ; movups        0x10(%r11,%rdx,4),%xmm8
   DB  102,65,15,16,28,147                 ; movupd        (%r11,%rdx,4),%xmm3
-  DB  102,15,111,5,114,21,0,0             ; movdqa        0x1572(%rip),%xmm0        # 1bc0 <_sk_xor__ssse3_lowp+0x167>
+  DB  102,15,111,5,138,21,0,0             ; movdqa        0x158a(%rip),%xmm0        # 1c00 <_sk_xor__ssse3_lowp+0x17f>
   DB  102,15,40,211                       ; movapd        %xmm3,%xmm2
   DB  102,15,56,0,208                     ; pshufb        %xmm0,%xmm2
   DB  102,65,15,111,200                   ; movdqa        %xmm8,%xmm1
   DB  102,15,56,0,200                     ; pshufb        %xmm0,%xmm1
   DB  102,15,108,209                      ; punpcklqdq    %xmm1,%xmm2
   DB  102,15,113,242,8                    ; psllw         $0x8,%xmm2
-  DB  102,68,15,111,13,93,21,0,0          ; movdqa        0x155d(%rip),%xmm9        # 1bd0 <_sk_xor__ssse3_lowp+0x177>
+  DB  102,68,15,111,13,117,21,0,0         ; movdqa        0x1575(%rip),%xmm9        # 1c10 <_sk_xor__ssse3_lowp+0x18f>
   DB  102,65,15,228,209                   ; pmulhuw       %xmm9,%xmm2
-  DB  102,68,15,111,21,95,21,0,0          ; movdqa        0x155f(%rip),%xmm10        # 1be0 <_sk_xor__ssse3_lowp+0x187>
+  DB  102,68,15,111,21,119,21,0,0         ; movdqa        0x1577(%rip),%xmm10        # 1c20 <_sk_xor__ssse3_lowp+0x19f>
   DB  102,15,40,203                       ; movapd        %xmm3,%xmm1
   DB  102,65,15,56,0,202                  ; pshufb        %xmm10,%xmm1
   DB  102,65,15,111,192                   ; movdqa        %xmm8,%xmm0
@@ -33924,7 +34071,7 @@
   DB  102,15,108,200                      ; punpcklqdq    %xmm0,%xmm1
   DB  102,15,113,241,8                    ; psllw         $0x8,%xmm1
   DB  102,65,15,228,201                   ; pmulhuw       %xmm9,%xmm1
-  DB  102,68,15,111,21,67,21,0,0          ; movdqa        0x1543(%rip),%xmm10        # 1bf0 <_sk_xor__ssse3_lowp+0x197>
+  DB  102,68,15,111,21,91,21,0,0          ; movdqa        0x155b(%rip),%xmm10        # 1c30 <_sk_xor__ssse3_lowp+0x1af>
   DB  102,15,40,195                       ; movapd        %xmm3,%xmm0
   DB  102,65,15,56,0,194                  ; pshufb        %xmm10,%xmm0
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
@@ -33932,7 +34079,7 @@
   DB  102,65,15,108,195                   ; punpcklqdq    %xmm11,%xmm0
   DB  102,15,113,240,8                    ; psllw         $0x8,%xmm0
   DB  102,65,15,228,193                   ; pmulhuw       %xmm9,%xmm0
-  DB  102,68,15,111,21,38,21,0,0          ; movdqa        0x1526(%rip),%xmm10        # 1c00 <_sk_xor__ssse3_lowp+0x1a7>
+  DB  102,68,15,111,21,62,21,0,0          ; movdqa        0x153e(%rip),%xmm10        # 1c40 <_sk_xor__ssse3_lowp+0x1bf>
   DB  102,65,15,56,0,218                  ; pshufb        %xmm10,%xmm3
   DB  102,69,15,56,0,194                  ; pshufb        %xmm10,%xmm8
   DB  102,65,15,108,216                   ; punpcklqdq    %xmm8,%xmm3
@@ -33946,18 +34093,18 @@
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,48,255,255,255               ; ja            646 <_sk_load_bgra_ssse3_lowp+0x1a>
+  DB  15,135,48,255,255,255               ; ja            66e <_sk_load_bgra_ssse3_lowp+0x1a>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,95,0,0,0                  ; lea           0x5f(%rip),%r10        # 780 <_sk_load_bgra_ssse3_lowp+0x154>
+  DB  76,141,21,95,0,0,0                  ; lea           0x5f(%rip),%r10        # 7a8 <_sk_load_bgra_ssse3_lowp+0x154>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  243,65,15,16,28,147                 ; movss         (%r11,%rdx,4),%xmm3
-  DB  233,17,255,255,255                  ; jmpq          646 <_sk_load_bgra_ssse3_lowp+0x1a>
+  DB  233,17,255,255,255                  ; jmpq          66e <_sk_load_bgra_ssse3_lowp+0x1a>
   DB  102,65,15,110,68,147,8              ; movd          0x8(%r11,%rdx,4),%xmm0
   DB  102,15,112,216,69                   ; pshufd        $0x45,%xmm0,%xmm3
   DB  102,65,15,18,28,147                 ; movlpd        (%r11,%rdx,4),%xmm3
-  DB  233,250,254,255,255                 ; jmpq          646 <_sk_load_bgra_ssse3_lowp+0x1a>
+  DB  233,250,254,255,255                 ; jmpq          66e <_sk_load_bgra_ssse3_lowp+0x1a>
   DB  102,65,15,110,68,147,24             ; movd          0x18(%r11,%rdx,4),%xmm0
   DB  102,68,15,112,192,69                ; pshufd        $0x45,%xmm0,%xmm8
   DB  243,65,15,16,68,147,20              ; movss         0x14(%r11,%rdx,4),%xmm0
@@ -33966,7 +34113,7 @@
   DB  68,15,40,192                        ; movaps        %xmm0,%xmm8
   DB  243,65,15,16,68,147,16              ; movss         0x10(%r11,%rdx,4),%xmm0
   DB  243,68,15,16,192                    ; movss         %xmm0,%xmm8
-  DB  233,193,254,255,255                 ; jmpq          640 <_sk_load_bgra_ssse3_lowp+0x14>
+  DB  233,193,254,255,255                 ; jmpq          668 <_sk_load_bgra_ssse3_lowp+0x14>
   DB  144                                 ; nop
   DB  170                                 ; stos          %al,%es:(%rdi)
   DB  255                                 ; (bad)
@@ -33994,19 +34141,19 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,191,0,0,0                    ; jne           869 <_sk_load_bgra_dst_ssse3_lowp+0xcd>
+  DB  15,133,191,0,0,0                    ; jne           891 <_sk_load_bgra_dst_ssse3_lowp+0xcd>
   DB  69,15,16,68,147,16                  ; movups        0x10(%r11,%rdx,4),%xmm8
   DB  102,65,15,16,60,147                 ; movupd        (%r11,%rdx,4),%xmm7
-  DB  102,15,111,37,82,20,0,0             ; movdqa        0x1452(%rip),%xmm4        # 1c10 <_sk_xor__ssse3_lowp+0x1b7>
+  DB  102,15,111,37,106,20,0,0            ; movdqa        0x146a(%rip),%xmm4        # 1c50 <_sk_xor__ssse3_lowp+0x1cf>
   DB  102,15,40,247                       ; movapd        %xmm7,%xmm6
   DB  102,15,56,0,244                     ; pshufb        %xmm4,%xmm6
   DB  102,65,15,111,232                   ; movdqa        %xmm8,%xmm5
   DB  102,15,56,0,236                     ; pshufb        %xmm4,%xmm5
   DB  102,15,108,245                      ; punpcklqdq    %xmm5,%xmm6
   DB  102,15,113,246,8                    ; psllw         $0x8,%xmm6
-  DB  102,68,15,111,13,61,20,0,0          ; movdqa        0x143d(%rip),%xmm9        # 1c20 <_sk_xor__ssse3_lowp+0x1c7>
+  DB  102,68,15,111,13,85,20,0,0          ; movdqa        0x1455(%rip),%xmm9        # 1c60 <_sk_xor__ssse3_lowp+0x1df>
   DB  102,65,15,228,241                   ; pmulhuw       %xmm9,%xmm6
-  DB  102,68,15,111,21,63,20,0,0          ; movdqa        0x143f(%rip),%xmm10        # 1c30 <_sk_xor__ssse3_lowp+0x1d7>
+  DB  102,68,15,111,21,87,20,0,0          ; movdqa        0x1457(%rip),%xmm10        # 1c70 <_sk_xor__ssse3_lowp+0x1ef>
   DB  102,15,40,239                       ; movapd        %xmm7,%xmm5
   DB  102,65,15,56,0,234                  ; pshufb        %xmm10,%xmm5
   DB  102,65,15,111,224                   ; movdqa        %xmm8,%xmm4
@@ -34014,7 +34161,7 @@
   DB  102,15,108,236                      ; punpcklqdq    %xmm4,%xmm5
   DB  102,15,113,245,8                    ; psllw         $0x8,%xmm5
   DB  102,65,15,228,233                   ; pmulhuw       %xmm9,%xmm5
-  DB  102,68,15,111,21,35,20,0,0          ; movdqa        0x1423(%rip),%xmm10        # 1c40 <_sk_xor__ssse3_lowp+0x1e7>
+  DB  102,68,15,111,21,59,20,0,0          ; movdqa        0x143b(%rip),%xmm10        # 1c80 <_sk_xor__ssse3_lowp+0x1ff>
   DB  102,15,40,231                       ; movapd        %xmm7,%xmm4
   DB  102,65,15,56,0,226                  ; pshufb        %xmm10,%xmm4
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
@@ -34022,7 +34169,7 @@
   DB  102,65,15,108,227                   ; punpcklqdq    %xmm11,%xmm4
   DB  102,15,113,244,8                    ; psllw         $0x8,%xmm4
   DB  102,65,15,228,225                   ; pmulhuw       %xmm9,%xmm4
-  DB  102,68,15,111,21,6,20,0,0           ; movdqa        0x1406(%rip),%xmm10        # 1c50 <_sk_xor__ssse3_lowp+0x1f7>
+  DB  102,68,15,111,21,30,20,0,0          ; movdqa        0x141e(%rip),%xmm10        # 1c90 <_sk_xor__ssse3_lowp+0x20f>
   DB  102,65,15,56,0,250                  ; pshufb        %xmm10,%xmm7
   DB  102,69,15,56,0,194                  ; pshufb        %xmm10,%xmm8
   DB  102,65,15,108,248                   ; punpcklqdq    %xmm8,%xmm7
@@ -34036,18 +34183,18 @@
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,48,255,255,255               ; ja            7b6 <_sk_load_bgra_dst_ssse3_lowp+0x1a>
+  DB  15,135,48,255,255,255               ; ja            7de <_sk_load_bgra_dst_ssse3_lowp+0x1a>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,95,0,0,0                  ; lea           0x5f(%rip),%r10        # 8f0 <_sk_load_bgra_dst_ssse3_lowp+0x154>
+  DB  76,141,21,95,0,0,0                  ; lea           0x5f(%rip),%r10        # 918 <_sk_load_bgra_dst_ssse3_lowp+0x154>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  243,65,15,16,60,147                 ; movss         (%r11,%rdx,4),%xmm7
-  DB  233,17,255,255,255                  ; jmpq          7b6 <_sk_load_bgra_dst_ssse3_lowp+0x1a>
+  DB  233,17,255,255,255                  ; jmpq          7de <_sk_load_bgra_dst_ssse3_lowp+0x1a>
   DB  102,65,15,110,100,147,8             ; movd          0x8(%r11,%rdx,4),%xmm4
   DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
   DB  102,65,15,18,60,147                 ; movlpd        (%r11,%rdx,4),%xmm7
-  DB  233,250,254,255,255                 ; jmpq          7b6 <_sk_load_bgra_dst_ssse3_lowp+0x1a>
+  DB  233,250,254,255,255                 ; jmpq          7de <_sk_load_bgra_dst_ssse3_lowp+0x1a>
   DB  102,65,15,110,100,147,24            ; movd          0x18(%r11,%rdx,4),%xmm4
   DB  102,68,15,112,196,69                ; pshufd        $0x45,%xmm4,%xmm8
   DB  243,65,15,16,100,147,20             ; movss         0x14(%r11,%rdx,4),%xmm4
@@ -34056,7 +34203,7 @@
   DB  68,15,40,196                        ; movaps        %xmm4,%xmm8
   DB  243,65,15,16,100,147,16             ; movss         0x10(%r11,%rdx,4),%xmm4
   DB  243,68,15,16,196                    ; movss         %xmm4,%xmm8
-  DB  233,193,254,255,255                 ; jmpq          7b0 <_sk_load_bgra_dst_ssse3_lowp+0x14>
+  DB  233,193,254,255,255                 ; jmpq          7d8 <_sk_load_bgra_dst_ssse3_lowp+0x14>
   DB  144                                 ; nop
   DB  170                                 ; stos          %al,%es:(%rdi)
   DB  255                                 ; (bad)
@@ -34085,7 +34232,7 @@
   DB  15,41,60,36                         ; movaps        %xmm7,(%rsp)
   DB  102,68,15,111,210                   ; movdqa        %xmm2,%xmm10
   DB  102,65,15,113,210,7                 ; psrlw         $0x7,%xmm10
-  DB  102,68,15,111,13,56,19,0,0          ; movdqa        0x1338(%rip),%xmm9        # 1c60 <_sk_xor__ssse3_lowp+0x207>
+  DB  102,68,15,111,13,80,19,0,0          ; movdqa        0x1350(%rip),%xmm9        # 1ca0 <_sk_xor__ssse3_lowp+0x21f>
   DB  102,69,15,234,209                   ; pminsw        %xmm9,%xmm10
   DB  102,69,15,239,246                   ; pxor          %xmm14,%xmm14
   DB  102,65,15,111,250                   ; movdqa        %xmm10,%xmm7
@@ -34124,7 +34271,7 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,25                              ; jne           a03 <_sk_store_bgra_ssse3_lowp+0xf7>
+  DB  117,25                              ; jne           a2b <_sk_store_bgra_ssse3_lowp+0xf7>
   DB  243,69,15,127,4,147                 ; movdqu        %xmm8,(%r11,%rdx,4)
   DB  243,69,15,127,92,147,16             ; movdqu        %xmm11,0x10(%r11,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -34135,25 +34282,25 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,228                             ; ja            9f7 <_sk_store_bgra_ssse3_lowp+0xeb>
+  DB  119,228                             ; ja            a1f <_sk_store_bgra_ssse3_lowp+0xeb>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,82,0,0,0                  ; lea           0x52(%rip),%r10        # a70 <_sk_store_bgra_ssse3_lowp+0x164>
+  DB  76,141,21,82,0,0,0                  ; lea           0x52(%rip),%r10        # a98 <_sk_store_bgra_ssse3_lowp+0x164>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  102,69,15,126,4,147                 ; movd          %xmm8,(%r11,%rdx,4)
-  DB  235,200                             ; jmp           9f7 <_sk_store_bgra_ssse3_lowp+0xeb>
+  DB  235,200                             ; jmp           a1f <_sk_store_bgra_ssse3_lowp+0xeb>
   DB  102,65,15,112,248,78                ; pshufd        $0x4e,%xmm8,%xmm7
   DB  102,65,15,126,124,147,8             ; movd          %xmm7,0x8(%r11,%rdx,4)
   DB  102,69,15,214,4,147                 ; movq          %xmm8,(%r11,%rdx,4)
-  DB  235,179                             ; jmp           9f7 <_sk_store_bgra_ssse3_lowp+0xeb>
+  DB  235,179                             ; jmp           a1f <_sk_store_bgra_ssse3_lowp+0xeb>
   DB  102,65,15,112,251,78                ; pshufd        $0x4e,%xmm11,%xmm7
   DB  102,65,15,126,124,147,24            ; movd          %xmm7,0x18(%r11,%rdx,4)
   DB  102,65,15,112,251,229               ; pshufd        $0xe5,%xmm11,%xmm7
   DB  102,65,15,126,124,147,20            ; movd          %xmm7,0x14(%r11,%rdx,4)
   DB  102,69,15,126,92,147,16             ; movd          %xmm11,0x10(%r11,%rdx,4)
   DB  243,69,15,127,4,147                 ; movdqu        %xmm8,(%r11,%rdx,4)
-  DB  235,138                             ; jmp           9f7 <_sk_store_bgra_ssse3_lowp+0xeb>
+  DB  235,138                             ; jmp           a1f <_sk_store_bgra_ssse3_lowp+0xeb>
   DB  15,31,0                             ; nopl          (%rax)
   DB  183,255                             ; mov           $0xff,%bh
   DB  255                                 ; (bad)
@@ -34181,11 +34328,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,37                              ; jne           abb <_sk_load_a8_ssse3_lowp+0x2f>
+  DB  117,37                              ; jne           ae3 <_sk_load_a8_ssse3_lowp+0x2f>
   DB  243,65,15,126,28,19                 ; movq          (%r11,%rdx,1),%xmm3
   DB  102,15,96,216                       ; punpcklbw     %xmm0,%xmm3
   DB  102,15,113,243,8                    ; psllw         $0x8,%xmm3
-  DB  102,15,228,29,195,17,0,0            ; pmulhuw       0x11c3(%rip),%xmm3        # 1c70 <_sk_xor__ssse3_lowp+0x217>
+  DB  102,15,228,29,219,17,0,0            ; pmulhuw       0x11db(%rip),%xmm3        # 1cb0 <_sk_xor__ssse3_lowp+0x22f>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  102,15,87,192                       ; xorpd         %xmm0,%xmm0
   DB  15,87,201                           ; xorps         %xmm1,%xmm1
@@ -34196,15 +34343,15 @@
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,209                             ; ja            aa0 <_sk_load_a8_ssse3_lowp+0x14>
+  DB  119,209                             ; ja            ac8 <_sk_load_a8_ssse3_lowp+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,110,0,0,0                 ; lea           0x6e(%rip),%r10        # b48 <_sk_load_a8_ssse3_lowp+0xbc>
+  DB  76,141,21,110,0,0,0                 ; lea           0x6e(%rip),%r10        # b70 <_sk_load_a8_ssse3_lowp+0xbc>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  102,15,110,216                      ; movd          %eax,%xmm3
-  DB  235,178                             ; jmp           aa0 <_sk_load_a8_ssse3_lowp+0x14>
+  DB  235,178                             ; jmp           ac8 <_sk_load_a8_ssse3_lowp+0x14>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  102,15,196,216,2                    ; pinsrw        $0x2,%eax,%xmm3
@@ -34212,7 +34359,7 @@
   DB  102,15,110,192                      ; movd          %eax,%xmm0
   DB  102,15,96,192                       ; punpcklbw     %xmm0,%xmm0
   DB  243,15,16,216                       ; movss         %xmm0,%xmm3
-  DB  235,144                             ; jmp           aa0 <_sk_load_a8_ssse3_lowp+0x14>
+  DB  235,144                             ; jmp           ac8 <_sk_load_a8_ssse3_lowp+0x14>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  102,15,239,219                      ; pxor          %xmm3,%xmm3
   DB  102,15,196,216,6                    ; pinsrw        $0x6,%eax,%xmm3
@@ -34223,7 +34370,7 @@
   DB  102,65,15,110,4,19                  ; movd          (%r11,%rdx,1),%xmm0
   DB  102,15,96,192                       ; punpcklbw     %xmm0,%xmm0
   DB  242,15,16,216                       ; movsd         %xmm0,%xmm3
-  DB  233,88,255,255,255                  ; jmpq          aa0 <_sk_load_a8_ssse3_lowp+0x14>
+  DB  233,88,255,255,255                  ; jmpq          ac8 <_sk_load_a8_ssse3_lowp+0x14>
   DB  155                                 ; fwait
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -34250,11 +34397,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,37                              ; jne           b93 <_sk_load_a8_dst_ssse3_lowp+0x2f>
+  DB  117,37                              ; jne           bbb <_sk_load_a8_dst_ssse3_lowp+0x2f>
   DB  243,65,15,126,60,19                 ; movq          (%r11,%rdx,1),%xmm7
   DB  102,15,96,248                       ; punpcklbw     %xmm0,%xmm7
   DB  102,15,113,247,8                    ; psllw         $0x8,%xmm7
-  DB  102,15,228,61,251,16,0,0            ; pmulhuw       0x10fb(%rip),%xmm7        # 1c80 <_sk_xor__ssse3_lowp+0x227>
+  DB  102,15,228,61,19,17,0,0             ; pmulhuw       0x1113(%rip),%xmm7        # 1cc0 <_sk_xor__ssse3_lowp+0x23f>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  102,15,87,228                       ; xorpd         %xmm4,%xmm4
   DB  15,87,237                           ; xorps         %xmm5,%xmm5
@@ -34265,15 +34412,15 @@
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,209                             ; ja            b78 <_sk_load_a8_dst_ssse3_lowp+0x14>
+  DB  119,209                             ; ja            ba0 <_sk_load_a8_dst_ssse3_lowp+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,110,0,0,0                 ; lea           0x6e(%rip),%r10        # c20 <_sk_load_a8_dst_ssse3_lowp+0xbc>
+  DB  76,141,21,110,0,0,0                 ; lea           0x6e(%rip),%r10        # c48 <_sk_load_a8_dst_ssse3_lowp+0xbc>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  102,15,110,248                      ; movd          %eax,%xmm7
-  DB  235,178                             ; jmp           b78 <_sk_load_a8_dst_ssse3_lowp+0x14>
+  DB  235,178                             ; jmp           ba0 <_sk_load_a8_dst_ssse3_lowp+0x14>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  102,15,196,248,2                    ; pinsrw        $0x2,%eax,%xmm7
@@ -34281,7 +34428,7 @@
   DB  102,15,110,224                      ; movd          %eax,%xmm4
   DB  102,15,96,224                       ; punpcklbw     %xmm0,%xmm4
   DB  243,15,16,252                       ; movss         %xmm4,%xmm7
-  DB  235,144                             ; jmp           b78 <_sk_load_a8_dst_ssse3_lowp+0x14>
+  DB  235,144                             ; jmp           ba0 <_sk_load_a8_dst_ssse3_lowp+0x14>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  102,15,196,248,6                    ; pinsrw        $0x6,%eax,%xmm7
@@ -34292,7 +34439,7 @@
   DB  102,65,15,110,36,19                 ; movd          (%r11,%rdx,1),%xmm4
   DB  102,15,96,224                       ; punpcklbw     %xmm0,%xmm4
   DB  242,15,16,252                       ; movsd         %xmm4,%xmm7
-  DB  233,88,255,255,255                  ; jmpq          b78 <_sk_load_a8_dst_ssse3_lowp+0x14>
+  DB  233,88,255,255,255                  ; jmpq          ba0 <_sk_load_a8_dst_ssse3_lowp+0x14>
   DB  155                                 ; fwait
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
@@ -34323,7 +34470,7 @@
   DB  102,65,15,113,208,7                 ; psrlw         $0x7,%xmm8
   DB  102,69,15,103,192                   ; packuswb      %xmm8,%xmm8
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,14                              ; jne           c68 <_sk_store_a8_ssse3_lowp+0x2c>
+  DB  117,14                              ; jne           c90 <_sk_store_a8_ssse3_lowp+0x2c>
   DB  242,69,15,17,4,19                   ; movsd         %xmm8,(%r11,%rdx,1)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  72,131,196,88                       ; add           $0x58,%rsp
@@ -34332,24 +34479,24 @@
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,232                             ; ja            c60 <_sk_store_a8_ssse3_lowp+0x24>
+  DB  119,232                             ; ja            c88 <_sk_store_a8_ssse3_lowp+0x24>
   DB  102,68,15,96,192                    ; punpcklbw     %xmm0,%xmm8
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,132,0,0,0                 ; lea           0x84(%rip),%r10        # d0c <_sk_store_a8_ssse3_lowp+0xd0>
+  DB  76,141,21,132,0,0,0                 ; lea           0x84(%rip),%r10        # d34 <_sk_store_a8_ssse3_lowp+0xd0>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  102,68,15,127,4,36                  ; movdqa        %xmm8,(%rsp)
   DB  138,4,36                            ; mov           (%rsp),%al
   DB  65,136,4,19                         ; mov           %al,(%r11,%rdx,1)
-  DB  235,192                             ; jmp           c60 <_sk_store_a8_ssse3_lowp+0x24>
+  DB  235,192                             ; jmp           c88 <_sk_store_a8_ssse3_lowp+0x24>
   DB  102,68,15,127,68,36,16              ; movdqa        %xmm8,0x10(%rsp)
   DB  138,68,36,20                        ; mov           0x14(%rsp),%al
   DB  65,136,68,19,2                      ; mov           %al,0x2(%r11,%rdx,1)
-  DB  102,68,15,56,0,5,230,15,0,0         ; pshufb        0xfe6(%rip),%xmm8        # 1ca0 <_sk_xor__ssse3_lowp+0x247>
+  DB  102,68,15,56,0,5,254,15,0,0         ; pshufb        0xffe(%rip),%xmm8        # 1ce0 <_sk_xor__ssse3_lowp+0x25f>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  102,65,137,4,19                     ; mov           %ax,(%r11,%rdx,1)
-  DB  235,154                             ; jmp           c60 <_sk_store_a8_ssse3_lowp+0x24>
+  DB  235,154                             ; jmp           c88 <_sk_store_a8_ssse3_lowp+0x24>
   DB  102,68,15,127,68,36,64              ; movdqa        %xmm8,0x40(%rsp)
   DB  138,68,36,76                        ; mov           0x4c(%rsp),%al
   DB  65,136,68,19,6                      ; mov           %al,0x6(%r11,%rdx,1)
@@ -34359,9 +34506,9 @@
   DB  102,68,15,127,68,36,32              ; movdqa        %xmm8,0x20(%rsp)
   DB  138,68,36,40                        ; mov           0x28(%rsp),%al
   DB  65,136,68,19,4                      ; mov           %al,0x4(%r11,%rdx,1)
-  DB  102,68,15,56,0,5,144,15,0,0         ; pshufb        0xf90(%rip),%xmm8        # 1c90 <_sk_xor__ssse3_lowp+0x237>
+  DB  102,68,15,56,0,5,168,15,0,0         ; pshufb        0xfa8(%rip),%xmm8        # 1cd0 <_sk_xor__ssse3_lowp+0x24f>
   DB  102,69,15,126,4,19                  ; movd          %xmm8,(%r11,%rdx,1)
-  DB  233,85,255,255,255                  ; jmpq          c60 <_sk_store_a8_ssse3_lowp+0x24>
+  DB  233,85,255,255,255                  ; jmpq          c88 <_sk_store_a8_ssse3_lowp+0x24>
   DB  144                                 ; nop
   DB  133,255                             ; test          %edi,%edi
   DB  255                                 ; (bad)
@@ -34388,13 +34535,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,42                              ; jne           d5c <_sk_load_g8_ssse3_lowp+0x34>
+  DB  117,42                              ; jne           d84 <_sk_load_g8_ssse3_lowp+0x34>
   DB  243,65,15,126,4,19                  ; movq          (%r11,%rdx,1),%xmm0
   DB  102,15,96,192                       ; punpcklbw     %xmm0,%xmm0
   DB  102,15,113,240,8                    ; psllw         $0x8,%xmm0
-  DB  102,15,228,5,103,15,0,0             ; pmulhuw       0xf67(%rip),%xmm0        # 1cb0 <_sk_xor__ssse3_lowp+0x257>
+  DB  102,15,228,5,127,15,0,0             ; pmulhuw       0xf7f(%rip),%xmm0        # 1cf0 <_sk_xor__ssse3_lowp+0x26f>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,29,110,15,0,0                 ; movaps        0xf6e(%rip),%xmm3        # 1cc0 <_sk_xor__ssse3_lowp+0x267>
+  DB  15,40,29,134,15,0,0                 ; movaps        0xf86(%rip),%xmm3        # 1d00 <_sk_xor__ssse3_lowp+0x27f>
   DB  102,15,111,200                      ; movdqa        %xmm0,%xmm1
   DB  102,15,111,208                      ; movdqa        %xmm0,%xmm2
   DB  255,224                             ; jmpq          *%rax
@@ -34403,15 +34550,15 @@
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,204                             ; ja            d3c <_sk_load_g8_ssse3_lowp+0x14>
+  DB  119,204                             ; ja            d64 <_sk_load_g8_ssse3_lowp+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,113,0,0,0                 ; lea           0x71(%rip),%r10        # dec <_sk_load_g8_ssse3_lowp+0xc4>
+  DB  76,141,21,113,0,0,0                 ; lea           0x71(%rip),%r10        # e14 <_sk_load_g8_ssse3_lowp+0xc4>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  102,15,110,192                      ; movd          %eax,%xmm0
-  DB  235,173                             ; jmp           d3c <_sk_load_g8_ssse3_lowp+0x14>
+  DB  235,173                             ; jmp           d64 <_sk_load_g8_ssse3_lowp+0x14>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  102,15,196,192,2                    ; pinsrw        $0x2,%eax,%xmm0
@@ -34419,7 +34566,7 @@
   DB  102,15,110,200                      ; movd          %eax,%xmm1
   DB  102,15,96,200                       ; punpcklbw     %xmm0,%xmm1
   DB  243,15,16,193                       ; movss         %xmm1,%xmm0
-  DB  235,139                             ; jmp           d3c <_sk_load_g8_ssse3_lowp+0x14>
+  DB  235,139                             ; jmp           d64 <_sk_load_g8_ssse3_lowp+0x14>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  102,15,239,192                      ; pxor          %xmm0,%xmm0
   DB  102,15,196,192,6                    ; pinsrw        $0x6,%eax,%xmm0
@@ -34430,7 +34577,7 @@
   DB  102,65,15,110,12,19                 ; movd          (%r11,%rdx,1),%xmm1
   DB  102,15,96,200                       ; punpcklbw     %xmm0,%xmm1
   DB  242,15,16,193                       ; movsd         %xmm1,%xmm0
-  DB  233,83,255,255,255                  ; jmpq          d3c <_sk_load_g8_ssse3_lowp+0x14>
+  DB  233,83,255,255,255                  ; jmpq          d64 <_sk_load_g8_ssse3_lowp+0x14>
   DB  15,31,0                             ; nopl          (%rax)
   DB  152                                 ; cwtl
   DB  255                                 ; (bad)
@@ -34458,13 +34605,13 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,42                              ; jne           e3c <_sk_load_g8_dst_ssse3_lowp+0x34>
+  DB  117,42                              ; jne           e64 <_sk_load_g8_dst_ssse3_lowp+0x34>
   DB  243,65,15,126,36,19                 ; movq          (%r11,%rdx,1),%xmm4
   DB  102,15,96,224                       ; punpcklbw     %xmm0,%xmm4
   DB  102,15,113,244,8                    ; psllw         $0x8,%xmm4
-  DB  102,15,228,37,167,14,0,0            ; pmulhuw       0xea7(%rip),%xmm4        # 1cd0 <_sk_xor__ssse3_lowp+0x277>
+  DB  102,15,228,37,191,14,0,0            ; pmulhuw       0xebf(%rip),%xmm4        # 1d10 <_sk_xor__ssse3_lowp+0x28f>
   DB  72,173                              ; lods          %ds:(%rsi),%rax
-  DB  15,40,61,174,14,0,0                 ; movaps        0xeae(%rip),%xmm7        # 1ce0 <_sk_xor__ssse3_lowp+0x287>
+  DB  15,40,61,198,14,0,0                 ; movaps        0xec6(%rip),%xmm7        # 1d20 <_sk_xor__ssse3_lowp+0x29f>
   DB  102,15,111,236                      ; movdqa        %xmm4,%xmm5
   DB  102,15,111,244                      ; movdqa        %xmm4,%xmm6
   DB  255,224                             ; jmpq          *%rax
@@ -34473,15 +34620,15 @@
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,204                             ; ja            e1c <_sk_load_g8_dst_ssse3_lowp+0x14>
+  DB  119,204                             ; ja            e44 <_sk_load_g8_dst_ssse3_lowp+0x14>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,113,0,0,0                 ; lea           0x71(%rip),%r10        # ecc <_sk_load_g8_dst_ssse3_lowp+0xc4>
+  DB  76,141,21,113,0,0,0                 ; lea           0x71(%rip),%r10        # ef4 <_sk_load_g8_dst_ssse3_lowp+0xc4>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  102,15,110,224                      ; movd          %eax,%xmm4
-  DB  235,173                             ; jmp           e1c <_sk_load_g8_dst_ssse3_lowp+0x14>
+  DB  235,173                             ; jmp           e44 <_sk_load_g8_dst_ssse3_lowp+0x14>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  102,15,196,224,2                    ; pinsrw        $0x2,%eax,%xmm4
@@ -34489,7 +34636,7 @@
   DB  102,15,110,232                      ; movd          %eax,%xmm5
   DB  102,15,96,232                       ; punpcklbw     %xmm0,%xmm5
   DB  243,15,16,229                       ; movss         %xmm5,%xmm4
-  DB  235,139                             ; jmp           e1c <_sk_load_g8_dst_ssse3_lowp+0x14>
+  DB  235,139                             ; jmp           e44 <_sk_load_g8_dst_ssse3_lowp+0x14>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  102,15,239,228                      ; pxor          %xmm4,%xmm4
   DB  102,15,196,224,6                    ; pinsrw        $0x6,%eax,%xmm4
@@ -34500,7 +34647,7 @@
   DB  102,65,15,110,44,19                 ; movd          (%r11,%rdx,1),%xmm5
   DB  102,15,96,232                       ; punpcklbw     %xmm0,%xmm5
   DB  242,15,16,229                       ; movsd         %xmm5,%xmm4
-  DB  233,83,255,255,255                  ; jmpq          e1c <_sk_load_g8_dst_ssse3_lowp+0x14>
+  DB  233,83,255,255,255                  ; jmpq          e44 <_sk_load_g8_dst_ssse3_lowp+0x14>
   DB  15,31,0                             ; nopl          (%rax)
   DB  152                                 ; cwtl
   DB  255                                 ; (bad)
@@ -34529,21 +34676,21 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,17,2,0,0                     ; jne           110c <_sk_srcover_rgba_8888_ssse3_lowp+0x224>
+  DB  15,133,17,2,0,0                     ; jne           1134 <_sk_srcover_rgba_8888_ssse3_lowp+0x224>
   DB  69,15,16,68,147,16                  ; movups        0x10(%r11,%rdx,4),%xmm8
   DB  102,65,15,16,60,147                 ; movupd        (%r11,%rdx,4),%xmm7
   DB  72,131,236,24                       ; sub           $0x18,%rsp
-  DB  102,15,111,45,221,13,0,0            ; movdqa        0xddd(%rip),%xmm5        # 1cf0 <_sk_xor__ssse3_lowp+0x297>
+  DB  102,15,111,45,245,13,0,0            ; movdqa        0xdf5(%rip),%xmm5        # 1d30 <_sk_xor__ssse3_lowp+0x2af>
   DB  102,15,40,231                       ; movapd        %xmm7,%xmm4
   DB  102,15,56,0,229                     ; pshufb        %xmm5,%xmm4
   DB  102,65,15,111,240                   ; movdqa        %xmm8,%xmm6
   DB  102,15,56,0,245                     ; pshufb        %xmm5,%xmm6
   DB  102,15,108,230                      ; punpcklqdq    %xmm6,%xmm4
-  DB  102,15,111,13,206,13,0,0            ; movdqa        0xdce(%rip),%xmm1        # 1d00 <_sk_xor__ssse3_lowp+0x2a7>
+  DB  102,15,111,13,230,13,0,0            ; movdqa        0xde6(%rip),%xmm1        # 1d40 <_sk_xor__ssse3_lowp+0x2bf>
   DB  102,15,113,244,8                    ; psllw         $0x8,%xmm4
-  DB  102,68,15,111,13,208,13,0,0         ; movdqa        0xdd0(%rip),%xmm9        # 1d10 <_sk_xor__ssse3_lowp+0x2b7>
+  DB  102,68,15,111,13,232,13,0,0         ; movdqa        0xde8(%rip),%xmm9        # 1d50 <_sk_xor__ssse3_lowp+0x2cf>
   DB  102,65,15,228,225                   ; pmulhuw       %xmm9,%xmm4
-  DB  102,68,15,111,21,210,13,0,0         ; movdqa        0xdd2(%rip),%xmm10        # 1d20 <_sk_xor__ssse3_lowp+0x2c7>
+  DB  102,68,15,111,21,234,13,0,0         ; movdqa        0xdea(%rip),%xmm10        # 1d60 <_sk_xor__ssse3_lowp+0x2df>
   DB  102,15,40,239                       ; movapd        %xmm7,%xmm5
   DB  102,65,15,56,0,234                  ; pshufb        %xmm10,%xmm5
   DB  102,65,15,111,240                   ; movdqa        %xmm8,%xmm6
@@ -34551,7 +34698,7 @@
   DB  102,15,108,238                      ; punpcklqdq    %xmm6,%xmm5
   DB  102,15,113,245,8                    ; psllw         $0x8,%xmm5
   DB  102,65,15,228,233                   ; pmulhuw       %xmm9,%xmm5
-  DB  102,68,15,111,21,182,13,0,0         ; movdqa        0xdb6(%rip),%xmm10        # 1d30 <_sk_xor__ssse3_lowp+0x2d7>
+  DB  102,68,15,111,21,206,13,0,0         ; movdqa        0xdce(%rip),%xmm10        # 1d70 <_sk_xor__ssse3_lowp+0x2ef>
   DB  102,15,40,247                       ; movapd        %xmm7,%xmm6
   DB  102,65,15,56,0,242                  ; pshufb        %xmm10,%xmm6
   DB  102,69,15,111,216                   ; movdqa        %xmm8,%xmm11
@@ -34559,13 +34706,13 @@
   DB  102,65,15,108,243                   ; punpcklqdq    %xmm11,%xmm6
   DB  102,15,113,246,8                    ; psllw         $0x8,%xmm6
   DB  102,65,15,228,241                   ; pmulhuw       %xmm9,%xmm6
-  DB  102,68,15,111,21,153,13,0,0         ; movdqa        0xd99(%rip),%xmm10        # 1d40 <_sk_xor__ssse3_lowp+0x2e7>
+  DB  102,68,15,111,21,177,13,0,0         ; movdqa        0xdb1(%rip),%xmm10        # 1d80 <_sk_xor__ssse3_lowp+0x2ff>
   DB  102,65,15,56,0,250                  ; pshufb        %xmm10,%xmm7
   DB  102,69,15,56,0,194                  ; pshufb        %xmm10,%xmm8
   DB  102,65,15,108,248                   ; punpcklqdq    %xmm8,%xmm7
   DB  102,15,113,247,8                    ; psllw         $0x8,%xmm7
   DB  102,65,15,228,249                   ; pmulhuw       %xmm9,%xmm7
-  DB  102,68,15,111,29,133,13,0,0         ; movdqa        0xd85(%rip),%xmm11        # 1d50 <_sk_xor__ssse3_lowp+0x2f7>
+  DB  102,68,15,111,29,157,13,0,0         ; movdqa        0xd9d(%rip),%xmm11        # 1d90 <_sk_xor__ssse3_lowp+0x30f>
   DB  102,68,15,249,219                   ; psubw         %xmm3,%xmm11
   DB  102,68,15,111,196                   ; movdqa        %xmm4,%xmm8
   DB  102,69,15,56,11,195                 ; pmulhrsw      %xmm11,%xmm8
@@ -34621,7 +34768,7 @@
   DB  102,65,15,235,192                   ; por           %xmm8,%xmm0
   DB  102,15,235,194                      ; por           %xmm2,%xmm0
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,100                             ; jne           1148 <_sk_srcover_rgba_8888_ssse3_lowp+0x260>
+  DB  117,100                             ; jne           1170 <_sk_srcover_rgba_8888_ssse3_lowp+0x260>
   DB  243,65,15,127,4,147                 ; movdqu        %xmm0,(%r11,%rdx,4)
   DB  243,65,15,127,76,147,16             ; movdqu        %xmm1,0x10(%r11,%rdx,4)
   DB  72,173                              ; lods          %ds:(%rsi),%rax
@@ -34637,30 +34784,30 @@
   DB  102,15,239,255                      ; pxor          %xmm7,%xmm7
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,222,253,255,255              ; ja            f07 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
+  DB  15,135,222,253,255,255              ; ja            f2f <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,208,0,0,0                 ; lea           0xd0(%rip),%r10        # 1204 <_sk_srcover_rgba_8888_ssse3_lowp+0x31c>
+  DB  76,141,21,208,0,0,0                 ; lea           0xd0(%rip),%r10        # 122c <_sk_srcover_rgba_8888_ssse3_lowp+0x31c>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  243,65,15,16,60,147                 ; movss         (%r11,%rdx,4),%xmm7
-  DB  233,191,253,255,255                 ; jmpq          f07 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
+  DB  233,191,253,255,255                 ; jmpq          f2f <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
   DB  69,137,193                          ; mov           %r8d,%r9d
   DB  65,128,225,7                        ; and           $0x7,%r9b
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,153                             ; ja            10f1 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
+  DB  119,153                             ; ja            1119 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
   DB  65,15,182,193                       ; movzbl        %r9b,%eax
-  DB  76,141,13,189,0,0,0                 ; lea           0xbd(%rip),%r9        # 1220 <_sk_srcover_rgba_8888_ssse3_lowp+0x338>
+  DB  76,141,13,189,0,0,0                 ; lea           0xbd(%rip),%r9        # 1248 <_sk_srcover_rgba_8888_ssse3_lowp+0x338>
   DB  73,99,4,129                         ; movslq        (%r9,%rax,4),%rax
   DB  76,1,200                            ; add           %r9,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  102,65,15,126,4,147                 ; movd          %xmm0,(%r11,%rdx,4)
-  DB  233,122,255,255,255                 ; jmpq          10f1 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
+  DB  233,122,255,255,255                 ; jmpq          1119 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
   DB  102,65,15,110,100,147,8             ; movd          0x8(%r11,%rdx,4),%xmm4
   DB  102,15,112,252,69                   ; pshufd        $0x45,%xmm4,%xmm7
   DB  102,65,15,18,60,147                 ; movlpd        (%r11,%rdx,4),%xmm7
-  DB  233,121,253,255,255                 ; jmpq          f07 <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
+  DB  233,121,253,255,255                 ; jmpq          f2f <_sk_srcover_rgba_8888_ssse3_lowp+0x1f>
   DB  102,65,15,110,100,147,24            ; movd          0x18(%r11,%rdx,4),%xmm4
   DB  102,68,15,112,196,69                ; pshufd        $0x45,%xmm4,%xmm8
   DB  243,65,15,16,100,147,20             ; movss         0x14(%r11,%rdx,4),%xmm4
@@ -34669,23 +34816,23 @@
   DB  68,15,40,196                        ; movaps        %xmm4,%xmm8
   DB  243,65,15,16,100,147,16             ; movss         0x10(%r11,%rdx,4),%xmm4
   DB  243,68,15,16,196                    ; movss         %xmm4,%xmm8
-  DB  233,64,253,255,255                  ; jmpq          f01 <_sk_srcover_rgba_8888_ssse3_lowp+0x19>
+  DB  233,64,253,255,255                  ; jmpq          f29 <_sk_srcover_rgba_8888_ssse3_lowp+0x19>
   DB  102,15,112,200,78                   ; pshufd        $0x4e,%xmm0,%xmm1
   DB  102,65,15,126,76,147,8              ; movd          %xmm1,0x8(%r11,%rdx,4)
   DB  102,65,15,214,4,147                 ; movq          %xmm0,(%r11,%rdx,4)
-  DB  233,25,255,255,255                  ; jmpq          10f1 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
+  DB  233,25,255,255,255                  ; jmpq          1119 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
   DB  102,15,112,209,78                   ; pshufd        $0x4e,%xmm1,%xmm2
   DB  102,65,15,126,84,147,24             ; movd          %xmm2,0x18(%r11,%rdx,4)
   DB  102,15,112,209,229                  ; pshufd        $0xe5,%xmm1,%xmm2
   DB  102,65,15,126,84,147,20             ; movd          %xmm2,0x14(%r11,%rdx,4)
   DB  102,65,15,126,76,147,16             ; movd          %xmm1,0x10(%r11,%rdx,4)
   DB  243,65,15,127,4,147                 ; movdqu        %xmm0,(%r11,%rdx,4)
-  DB  233,239,254,255,255                 ; jmpq          10f1 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
+  DB  233,239,254,255,255                 ; jmpq          1119 <_sk_srcover_rgba_8888_ssse3_lowp+0x209>
   DB  102,144                             ; xchg          %ax,%ax
   DB  57,255                              ; cmp           %edi,%edi
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  127,255                             ; jg            1209 <_sk_srcover_rgba_8888_ssse3_lowp+0x321>
+  DB  127,255                             ; jg            1231 <_sk_srcover_rgba_8888_ssse3_lowp+0x321>
   DB  255                                 ; (bad)
   DB  255,115,255                         ; pushq         -0x1(%rbx)
   DB  255                                 ; (bad)
@@ -34720,7 +34867,7 @@
 _sk_scale_1_float_ssse3_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  243,68,15,16,0                      ; movss         (%rax),%xmm8
-  DB  243,68,15,88,5,232,11,0,0           ; addss         0xbe8(%rip),%xmm8        # 1e34 <_sk_xor__ssse3_lowp+0x3db>
+  DB  243,68,15,88,5,0,12,0,0             ; addss         0xc00(%rip),%xmm8        # 1e74 <_sk_xor__ssse3_lowp+0x3f3>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  242,69,15,112,192,0                 ; pshuflw       $0x0,%xmm8,%xmm8
@@ -34741,11 +34888,11 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  117,74                              ; jne           12e6 <_sk_scale_u8_ssse3_lowp+0x54>
+  DB  117,74                              ; jne           130e <_sk_scale_u8_ssse3_lowp+0x54>
   DB  243,69,15,126,4,19                  ; movq          (%r11,%rdx,1),%xmm8
   DB  102,68,15,96,192                    ; punpcklbw     %xmm0,%xmm8
   DB  102,65,15,113,240,8                 ; psllw         $0x8,%xmm8
-  DB  102,68,15,228,5,170,10,0,0          ; pmulhuw       0xaaa(%rip),%xmm8        # 1d60 <_sk_xor__ssse3_lowp+0x307>
+  DB  102,68,15,228,5,194,10,0,0          ; pmulhuw       0xac2(%rip),%xmm8        # 1da0 <_sk_xor__ssse3_lowp+0x31f>
   DB  102,65,15,56,11,192                 ; pmulhrsw      %xmm8,%xmm0
   DB  102,15,56,29,192                    ; pabsw         %xmm0,%xmm0
   DB  102,65,15,56,11,200                 ; pmulhrsw      %xmm8,%xmm1
@@ -34761,15 +34908,15 @@
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  119,172                             ; ja            12a7 <_sk_scale_u8_ssse3_lowp+0x15>
+  DB  119,172                             ; ja            12cf <_sk_scale_u8_ssse3_lowp+0x15>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,126,0,0,0                 ; lea           0x7e(%rip),%r10        # 1384 <_sk_scale_u8_ssse3_lowp+0xf2>
+  DB  76,141,21,126,0,0,0                 ; lea           0x7e(%rip),%r10        # 13ac <_sk_scale_u8_ssse3_lowp+0xf2>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
-  DB  235,140                             ; jmp           12a7 <_sk_scale_u8_ssse3_lowp+0x15>
+  DB  235,140                             ; jmp           12cf <_sk_scale_u8_ssse3_lowp+0x15>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  102,68,15,196,192,2                 ; pinsrw        $0x2,%eax,%xmm8
@@ -34777,7 +34924,7 @@
   DB  102,68,15,110,200                   ; movd          %eax,%xmm9
   DB  102,68,15,96,200                    ; punpcklbw     %xmm0,%xmm9
   DB  243,69,15,16,193                    ; movss         %xmm9,%xmm8
-  DB  233,98,255,255,255                  ; jmpq          12a7 <_sk_scale_u8_ssse3_lowp+0x15>
+  DB  233,98,255,255,255                  ; jmpq          12cf <_sk_scale_u8_ssse3_lowp+0x15>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  102,68,15,196,192,6                 ; pinsrw        $0x6,%eax,%xmm8
@@ -34788,7 +34935,7 @@
   DB  102,69,15,110,12,19                 ; movd          (%r11,%rdx,1),%xmm9
   DB  102,68,15,96,200                    ; punpcklbw     %xmm0,%xmm9
   DB  242,69,15,16,193                    ; movsd         %xmm9,%xmm8
-  DB  233,36,255,255,255                  ; jmpq          12a7 <_sk_scale_u8_ssse3_lowp+0x15>
+  DB  233,36,255,255,255                  ; jmpq          12cf <_sk_scale_u8_ssse3_lowp+0x15>
   DB  144                                 ; nop
   DB  139,255                             ; mov           %edi,%edi
   DB  255                                 ; (bad)
@@ -34814,14 +34961,14 @@
 _sk_lerp_1_float_ssse3_lowp LABEL PROC
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  243,68,15,16,0                      ; movss         (%rax),%xmm8
-  DB  243,68,15,88,5,136,10,0,0           ; addss         0xa88(%rip),%xmm8        # 1e38 <_sk_xor__ssse3_lowp+0x3df>
+  DB  243,68,15,88,5,160,10,0,0           ; addss         0xaa0(%rip),%xmm8        # 1e78 <_sk_xor__ssse3_lowp+0x3f7>
   DB  102,68,15,126,192                   ; movd          %xmm8,%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
   DB  242,69,15,112,192,0                 ; pshuflw       $0x0,%xmm8,%xmm8
   DB  102,69,15,112,192,80                ; pshufd        $0x50,%xmm8,%xmm8
   DB  102,65,15,56,11,192                 ; pmulhrsw      %xmm8,%xmm0
   DB  102,68,15,56,29,200                 ; pabsw         %xmm0,%xmm9
-  DB  102,68,15,111,21,149,9,0,0          ; movdqa        0x995(%rip),%xmm10        # 1d70 <_sk_xor__ssse3_lowp+0x317>
+  DB  102,68,15,111,21,173,9,0,0          ; movdqa        0x9ad(%rip),%xmm10        # 1db0 <_sk_xor__ssse3_lowp+0x32f>
   DB  102,69,15,249,208                   ; psubw         %xmm8,%xmm10
   DB  102,15,111,196                      ; movdqa        %xmm4,%xmm0
   DB  102,65,15,56,11,194                 ; pmulhrsw      %xmm10,%xmm0
@@ -34852,14 +34999,14 @@
   DB  72,173                              ; lods          %ds:(%rsi),%rax
   DB  76,139,24                           ; mov           (%rax),%r11
   DB  77,133,192                          ; test          %r8,%r8
-  DB  15,133,169,0,0,0                    ; jne           150c <_sk_lerp_u8_ssse3_lowp+0xb7>
+  DB  15,133,169,0,0,0                    ; jne           1534 <_sk_lerp_u8_ssse3_lowp+0xb7>
   DB  243,69,15,126,4,19                  ; movq          (%r11,%rdx,1),%xmm8
   DB  102,68,15,96,192                    ; punpcklbw     %xmm0,%xmm8
   DB  102,65,15,113,240,8                 ; psllw         $0x8,%xmm8
-  DB  102,68,15,228,5,3,9,0,0             ; pmulhuw       0x903(%rip),%xmm8        # 1d80 <_sk_xor__ssse3_lowp+0x327>
+  DB  102,68,15,228,5,27,9,0,0            ; pmulhuw       0x91b(%rip),%xmm8        # 1dc0 <_sk_xor__ssse3_lowp+0x33f>
   DB  102,65,15,56,11,192                 ; pmulhrsw      %xmm8,%xmm0
   DB  102,68,15,56,29,200                 ; pabsw         %xmm0,%xmm9
-  DB  102,68,15,111,21,254,8,0,0          ; movdqa        0x8fe(%rip),%xmm10        # 1d90 <_sk_xor__ssse3_lowp+0x337>
+  DB  102,68,15,111,21,22,9,0,0           ; movdqa        0x916(%rip),%xmm10        # 1dd0 <_sk_xor__ssse3_lowp+0x34f>
   DB  102,69,15,249,208                   ; psubw         %xmm8,%xmm10
   DB  102,15,111,196                      ; movdqa        %xmm4,%xmm0
   DB  102,65,15,56,11,194                 ; pmulhrsw      %xmm10,%xmm0
@@ -34889,15 +35036,15 @@
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  65,254,201                          ; dec           %r9b
   DB  65,128,249,6                        ; cmp           $0x6,%r9b
-  DB  15,135,73,255,255,255               ; ja            146e <_sk_lerp_u8_ssse3_lowp+0x19>
+  DB  15,135,73,255,255,255               ; ja            1496 <_sk_lerp_u8_ssse3_lowp+0x19>
   DB  69,15,182,201                       ; movzbl        %r9b,%r9d
-  DB  76,141,21,128,0,0,0                 ; lea           0x80(%rip),%r10        # 15b0 <_sk_lerp_u8_ssse3_lowp+0x15b>
+  DB  76,141,21,128,0,0,0                 ; lea           0x80(%rip),%r10        # 15d8 <_sk_lerp_u8_ssse3_lowp+0x15b>
   DB  75,99,4,138                         ; movslq        (%r10,%r9,4),%rax
   DB  76,1,208                            ; add           %r10,%rax
   DB  255,224                             ; jmpq          *%rax
   DB  65,15,182,4,19                      ; movzbl        (%r11,%rdx,1),%eax
   DB  102,68,15,110,192                   ; movd          %eax,%xmm8
-  DB  233,38,255,255,255                  ; jmpq          146e <_sk_lerp_u8_ssse3_lowp+0x19>
+  DB  233,38,255,255,255                  ; jmpq          1496 <_sk_lerp_u8_ssse3_lowp+0x19>
   DB  65,15,182,68,19,2                   ; movzbl        0x2(%r11,%rdx,1),%eax
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  102,68,15,196,192,2                 ; pinsrw        $0x2,%eax,%xmm8
@@ -34905,7 +35052,7 @@
   DB  102,68,15,110,200                   ; movd          %eax,%xmm9
   DB  102,68,15,96,200                    ; punpcklbw     %xmm0,%xmm9
   DB  243,69,15,16,193                    ; movss         %xmm9,%xmm8
-  DB  233,252,254,255,255                 ; jmpq          146e <_sk_lerp_u8_ssse3_lowp+0x19>
+  DB  233,252,254,255,255                 ; jmpq          1496 <_sk_lerp_u8_ssse3_lowp+0x19>
   DB  65,15,182,68,19,6                   ; movzbl        0x6(%r11,%rdx,1),%eax
   DB  102,69,15,239,192                   ; pxor          %xmm8,%xmm8
   DB  102,68,15,196,192,6                 ; pinsrw        $0x6,%eax,%xmm8
@@ -34916,14 +35063,14 @@
   DB  102,69,15,110,12,19                 ; movd          (%r11,%rdx,1),%xmm9
   DB  102,68,15,96,200                    ; punpcklbw     %xmm0,%xmm9
   DB  242,69,15,16,193                    ; movsd         %xmm9,%xmm8
-  DB  233,190,254,255,255                 ; jmpq          146e <_sk_lerp_u8_ssse3_lowp+0x19>
+  DB  233,190,254,255,255                 ; jmpq          1496 <_sk_lerp_u8_ssse3_lowp+0x19>
   DB  137,255                             ; mov           %edi,%edi
   DB  255                                 ; (bad)
   DB  255,169,255,255,255,152             ; ljmp          *-0x67000001(%rcx)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
-  DB  235,255                             ; jmp           15bd <_sk_lerp_u8_ssse3_lowp+0x168>
+  DB  235,255                             ; jmp           15e5 <_sk_lerp_u8_ssse3_lowp+0x168>
   DB  255                                 ; (bad)
   DB  255                                 ; (bad)
   DB  223,255                             ; (bad)
@@ -34975,7 +35122,7 @@
 _sk_srcatop_ssse3_lowp LABEL PROC
   DB  102,15,56,11,199                    ; pmulhrsw      %xmm7,%xmm0
   DB  102,68,15,56,29,192                 ; pabsw         %xmm0,%xmm8
-  DB  102,68,15,111,13,129,7,0,0          ; movdqa        0x781(%rip),%xmm9        # 1da0 <_sk_xor__ssse3_lowp+0x347>
+  DB  102,68,15,111,13,153,7,0,0          ; movdqa        0x799(%rip),%xmm9        # 1de0 <_sk_xor__ssse3_lowp+0x35f>
   DB  102,68,15,249,203                   ; psubw         %xmm3,%xmm9
   DB  102,15,111,196                      ; movdqa        %xmm4,%xmm0
   DB  102,65,15,56,11,193                 ; pmulhrsw      %xmm9,%xmm0
@@ -35006,7 +35153,7 @@
   DB  102,68,15,111,196                   ; movdqa        %xmm4,%xmm8
   DB  102,68,15,56,11,195                 ; pmulhrsw      %xmm3,%xmm8
   DB  102,69,15,56,29,192                 ; pabsw         %xmm8,%xmm8
-  DB  102,68,15,111,13,0,7,0,0            ; movdqa        0x700(%rip),%xmm9        # 1db0 <_sk_xor__ssse3_lowp+0x357>
+  DB  102,68,15,111,13,24,7,0,0           ; movdqa        0x718(%rip),%xmm9        # 1df0 <_sk_xor__ssse3_lowp+0x36f>
   DB  102,68,15,249,207                   ; psubw         %xmm7,%xmm9
   DB  102,65,15,56,11,193                 ; pmulhrsw      %xmm9,%xmm0
   DB  102,15,56,29,192                    ; pabsw         %xmm0,%xmm0
@@ -35063,7 +35210,7 @@
 
 PUBLIC _sk_srcout_ssse3_lowp
 _sk_srcout_ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,38,6,0,0            ; movdqa        0x626(%rip),%xmm8        # 1dc0 <_sk_xor__ssse3_lowp+0x367>
+  DB  102,68,15,111,5,62,6,0,0            ; movdqa        0x63e(%rip),%xmm8        # 1e00 <_sk_xor__ssse3_lowp+0x37f>
   DB  102,68,15,249,199                   ; psubw         %xmm7,%xmm8
   DB  102,65,15,56,11,192                 ; pmulhrsw      %xmm8,%xmm0
   DB  102,15,56,29,192                    ; pabsw         %xmm0,%xmm0
@@ -35078,7 +35225,7 @@
 
 PUBLIC _sk_dstout_ssse3_lowp
 _sk_dstout_ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,247,5,0,0           ; movdqa        0x5f7(%rip),%xmm8        # 1dd0 <_sk_xor__ssse3_lowp+0x377>
+  DB  102,68,15,111,5,15,6,0,0            ; movdqa        0x60f(%rip),%xmm8        # 1e10 <_sk_xor__ssse3_lowp+0x38f>
   DB  102,68,15,249,195                   ; psubw         %xmm3,%xmm8
   DB  102,15,111,196                      ; movdqa        %xmm4,%xmm0
   DB  102,65,15,56,11,192                 ; pmulhrsw      %xmm8,%xmm0
@@ -35096,7 +35243,7 @@
 
 PUBLIC _sk_srcover_ssse3_lowp
 _sk_srcover_ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,188,5,0,0           ; movdqa        0x5bc(%rip),%xmm8        # 1de0 <_sk_xor__ssse3_lowp+0x387>
+  DB  102,68,15,111,5,212,5,0,0           ; movdqa        0x5d4(%rip),%xmm8        # 1e20 <_sk_xor__ssse3_lowp+0x39f>
   DB  102,68,15,249,195                   ; psubw         %xmm3,%xmm8
   DB  102,68,15,111,204                   ; movdqa        %xmm4,%xmm9
   DB  102,69,15,56,11,200                 ; pmulhrsw      %xmm8,%xmm9
@@ -35118,7 +35265,7 @@
 
 PUBLIC _sk_dstover_ssse3_lowp
 _sk_dstover_ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,103,5,0,0           ; movdqa        0x567(%rip),%xmm8        # 1df0 <_sk_xor__ssse3_lowp+0x397>
+  DB  102,68,15,111,5,127,5,0,0           ; movdqa        0x57f(%rip),%xmm8        # 1e30 <_sk_xor__ssse3_lowp+0x3af>
   DB  102,68,15,249,199                   ; psubw         %xmm7,%xmm8
   DB  102,65,15,56,11,192                 ; pmulhrsw      %xmm8,%xmm0
   DB  102,15,56,29,192                    ; pabsw         %xmm0,%xmm0
@@ -35150,7 +35297,7 @@
 
 PUBLIC _sk_multiply_ssse3_lowp
 _sk_multiply_ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,252,4,0,0           ; movdqa        0x4fc(%rip),%xmm8        # 1e00 <_sk_xor__ssse3_lowp+0x3a7>
+  DB  102,68,15,111,5,20,5,0,0            ; movdqa        0x514(%rip),%xmm8        # 1e40 <_sk_xor__ssse3_lowp+0x3bf>
   DB  102,69,15,111,200                   ; movdqa        %xmm8,%xmm9
   DB  102,68,15,249,207                   ; psubw         %xmm7,%xmm9
   DB  102,68,15,111,208                   ; movdqa        %xmm0,%xmm10
@@ -35197,7 +35344,7 @@
 
 PUBLIC _sk_screen_ssse3_lowp
 _sk_screen_ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,34,4,0,0            ; movdqa        0x422(%rip),%xmm8        # 1e10 <_sk_xor__ssse3_lowp+0x3b7>
+  DB  102,68,15,111,5,58,4,0,0            ; movdqa        0x43a(%rip),%xmm8        # 1e50 <_sk_xor__ssse3_lowp+0x3cf>
   DB  102,69,15,111,200                   ; movdqa        %xmm8,%xmm9
   DB  102,68,15,249,200                   ; psubw         %xmm0,%xmm9
   DB  102,68,15,56,11,204                 ; pmulhrsw      %xmm4,%xmm9
@@ -35222,7 +35369,7 @@
 
 PUBLIC _sk_xor__ssse3_lowp
 _sk_xor__ssse3_lowp LABEL PROC
-  DB  102,68,15,111,5,190,3,0,0           ; movdqa        0x3be(%rip),%xmm8        # 1e20 <_sk_xor__ssse3_lowp+0x3c7>
+  DB  102,68,15,111,5,214,3,0,0           ; movdqa        0x3d6(%rip),%xmm8        # 1e60 <_sk_xor__ssse3_lowp+0x3df>
   DB  102,69,15,111,200                   ; movdqa        %xmm8,%xmm9
   DB  102,68,15,249,207                   ; psubw         %xmm7,%xmm9
   DB  102,65,15,56,11,193                 ; pmulhrsw      %xmm9,%xmm0
@@ -35257,7 +35404,13 @@
   DB  128,67,0,0                          ; addb          $0x0,0x0(%rbx)
   DB  128,67,0,0                          ; addb          $0x0,0x0(%rbx)
   DB  128,67,0,0                          ; addb          $0x0,0x0(%rbx)
-  DB  128,67,0,1                          ; addb          $0x1,0x0(%rbx)
+  DB  128,67,0,128                        ; addb          $0x80,0x0(%rbx)
+  DB  0,128,0,128,0,128                   ; add           %al,-0x7fff8000(%rax)
+  DB  0,128,0,128,0,128                   ; add           %al,-0x7fff8000(%rax)
+  DB  0,128,0,128,0,128                   ; add           %al,-0x7fff8000(%rax)
+  DB  0,128,0,128,0,128                   ; add           %al,-0x7fff8000(%rax)
+  DB  0,128,0,128,0,128                   ; add           %al,-0x7fff8000(%rax)
+  DB  0,1                                 ; add           %al,(%rcx)
   DB  4,5                                 ; add           $0x5,%al
   DB  8,9                                 ; or            %cl,(%rcx)
   DB  12,13                               ; or            $0xd,%al
@@ -35265,7 +35418,7 @@
   DB  12,13                               ; or            $0xd,%al
   DB  12,13                               ; or            $0xd,%al
   DB  14                                  ; (bad)
-  DB  15,129,128,129,128,129              ; jno           ffffffff81809ca5 <_sk_xor__ssse3_lowp+0xffffffff8180824c>
+  DB  15,129,128,129,128,129              ; jno           ffffffff81809ce5 <_sk_xor__ssse3_lowp+0xffffffff81808264>
   DB  128,129,128,129,128,129,128         ; addb          $0x80,-0x7e7f7e80(%rcx)
   DB  129,128,129,128,1,2,5,6,9,10        ; addl          $0xa090605,0x2018081(%rax)
   DB  13,14,9,10,13                       ; or            $0xd0a090e,%eax
@@ -35294,7 +35447,7 @@
   DB  12,13                               ; or            $0xd,%al
   DB  12,13                               ; or            $0xd,%al
   DB  14                                  ; (bad)
-  DB  15,129,128,129,128,129              ; jno           ffffffff81809cf5 <_sk_xor__ssse3_lowp+0xffffffff8180829c>
+  DB  15,129,128,129,128,129              ; jno           ffffffff81809d35 <_sk_xor__ssse3_lowp+0xffffffff818082b4>
   DB  128,129,128,129,128,129,128         ; addb          $0x80,-0x7e7f7e80(%rcx)
   DB  129,128,129,128,1,2,5,6,9,10        ; addl          $0xa090605,0x2018081(%rax)
   DB  13,14,9,10,13                       ; or            $0xd0a090e,%eax
@@ -35334,7 +35487,7 @@
   DB  12,13                               ; or            $0xd,%al
   DB  12,13                               ; or            $0xd,%al
   DB  14                                  ; (bad)
-  DB  15,129,128,129,128,129              ; jno           ffffffff81809d55 <_sk_xor__ssse3_lowp+0xffffffff818082fc>
+  DB  15,129,128,129,128,129              ; jno           ffffffff81809d95 <_sk_xor__ssse3_lowp+0xffffffff81808314>
   DB  128,129,128,129,128,129,128         ; addb          $0x80,-0x7e7f7e80(%rcx)
   DB  129,128,129,128,1,2,5,6,9,10        ; addl          $0xa090605,0x2018081(%rax)
   DB  13,14,9,10,13                       ; or            $0xd0a090e,%eax
@@ -35363,7 +35516,7 @@
   DB  12,13                               ; or            $0xd,%al
   DB  12,13                               ; or            $0xd,%al
   DB  14                                  ; (bad)
-  DB  15,129,128,129,128,129              ; jno           ffffffff81809da5 <_sk_xor__ssse3_lowp+0xffffffff8180834c>
+  DB  15,129,128,129,128,129              ; jno           ffffffff81809de5 <_sk_xor__ssse3_lowp+0xffffffff81808364>
   DB  128,129,128,129,128,129,128         ; addb          $0x80,-0x7e7f7e80(%rcx)
   DB  129,128,129,128,1,2,5,6,9,10        ; addl          $0xa090605,0x2018081(%rax)
   DB  13,14,9,10,13                       ; or            $0xd0a090e,%eax
diff --git a/src/jumper/SkJumper_stages.cpp b/src/jumper/SkJumper_stages.cpp
index 5f05648..a200adf 100644
--- a/src/jumper/SkJumper_stages.cpp
+++ b/src/jumper/SkJumper_stages.cpp
@@ -243,7 +243,7 @@
 }
 
 // load 4 floats from memory, and splat them into r,g,b,a
-STAGE(constant_color) {
+STAGE(uniform_color) {
     auto rgba = (const float*)ctx;
     r = rgba[0];
     g = rgba[1];
@@ -251,6 +251,16 @@
     a = rgba[3];
 }
 
+// splats opaque-black into r,g,b,a
+STAGE(black_color) {
+    r = g = b = 0.0f;
+    a = 1.0f;
+}
+
+STAGE(white_color) {
+    r = g = b = a = 1.0f;
+}
+
 // load registers r,g,b,a from context (mirrors store_rgba)
 STAGE(load_rgba) {
     auto ptr = (const float*)ctx;
diff --git a/src/jumper/SkJumper_stages_lowp.cpp b/src/jumper/SkJumper_stages_lowp.cpp
index b07cd3a..fabc68d 100644
--- a/src/jumper/SkJumper_stages_lowp.cpp
+++ b/src/jumper/SkJumper_stages_lowp.cpp
@@ -211,7 +211,7 @@
 
 // Stages!
 
-STAGE(constant_color) {
+STAGE(uniform_color) {
     // We're converting to fixed point, which lets us play some IEEE representation tricks,
     // replacing a naive *32768 and float->int conversion with a simple float add.
     using F32x4 = float    __attribute__((ext_vector_type(4)));
@@ -223,6 +223,15 @@
     a = (U16)bits[6];
 }
 
+STAGE(black_color) {
+    r = g = b = 0.0f;
+    a = 1.0f;
+}
+
+STAGE(white_color) {
+    r = g = b = a = 1.0f;
+}
+
 STAGE(set_rgb) {
     auto rgb = (const float*)ctx;
     r = rgb[0];
diff --git a/src/shaders/SkColorShader.cpp b/src/shaders/SkColorShader.cpp
index 7b6d0a9..6f5dc14 100644
--- a/src/shaders/SkColorShader.cpp
+++ b/src/shaders/SkColorShader.cpp
@@ -257,8 +257,7 @@
                                    const SkMatrix&,
                                    const SkPaint&,
                                    const SkMatrix*) const {
-    auto color = scratch->make<SkPM4f>(SkPM4f_from_SkColor(fColor, dst));
-    p->append(SkRasterPipeline::constant_color, color);
+    p->append_uniform_color(scratch, SkPM4f_from_SkColor(fColor, dst));
     return true;
 }
 
@@ -268,7 +267,6 @@
                                     const SkMatrix&,
                                     const SkPaint&,
                                     const SkMatrix*) const {
-    auto color = scratch->make<SkPM4f>(to_colorspace(fColor4, fColorSpace.get(), dst).premul());
-    p->append(SkRasterPipeline::constant_color, color);
+    p->append_uniform_color(scratch, to_colorspace(fColor4, fColorSpace.get(), dst).premul());
     return true;
 }
diff --git a/tests/SRGBTest.cpp b/tests/SRGBTest.cpp
index 4a519ca..fc02f7d 100644
--- a/tests/SRGBTest.cpp
+++ b/tests/SRGBTest.cpp
@@ -70,7 +70,7 @@
     void* dst = &color;
 
     SkRasterPipeline_<256> p;
-    p.append(SkRasterPipeline::constant_color, &color);
+    p.append(SkRasterPipeline::uniform_color, &color);
     p.append(SkRasterPipeline::to_srgb);
     p.append(SkRasterPipeline::store_f32, &dst);
     p.run(0,0,4);