# Project Euler 798
# Card Stacking Game: C(n, s) mod 1e9+7 with n = s = 10^7.
# Pure Flow port of the native C solver.
extern {
function calloc(n: i64, size: i64) -> ptr<void>
function free(p: ptr<void>) -> void
function memset(p: ptr<void>, c: i32, n: i64) -> ptr<void>
}
const MOD: i64 = 1000000007
function mod_pow(a: i64, e: i64) -> i64 {
let mut r: i64 = 1
let mut b: i64 = a % MOD
if b < 0 { b = b + MOD }
let mut exp: i64 = e
while exp > 0 {
if exp % 2 == 1 {
r = r * b % MOD
}
b = b * b % MOD
exp = exp / 2
}
return r
}
# Global factorials and inverse factorials
let mut fact: ptr<i64> = null
let mut inv_fact: ptr<i64> = null
function build_factorials(N: i32) -> void {
fact = calloc((N + 1) as i64, 8)
inv_fact = calloc((N + 1) as i64, 8)
fact[0] = 1
fact[1] = 1
let mut i: i32 = 2
while i <= N {
fact[i] = fact[i - 1] * (i as i64) % MOD
i = i + 1
}
inv_fact[N] = mod_pow(fact[N], MOD - 2)
i = N
while i >= 1 {
inv_fact[i - 1] = inv_fact[i] * (i as i64) % MOD
i = i - 1
}
}
function nCk(n: i32, k: i32) -> i64 {
if k < 0 || k > n { return 0 }
return fact[n] * inv_fact[k] % MOD * inv_fact[n - k] % MOD
}
# Walsh-Hadamard Transform (XOR) in place
function fwht_xor(a: ptr<i64>, n: i32) -> void {
let mut h: i32 = 1
while h < n {
let step: i32 = h << 1
let mut i: i32 = 0
while i < n {
let mut j: i32 = i
while j < i + h {
let x: i64 = a[j]
let y: i64 = a[j + h]
let mut u: i64 = x + y
if u >= MOD { u = u - MOD }
let mut v: i64 = 0
if x >= y {
v = x - y
} else {
v = x + MOD - y
}
a[j] = u
a[j + h] = v
j = j + 1
}
i = i + step
}
h = step
}
}
# Q(X,k) = X*C(X+k+1,k+1) - (k+1)*C(X+k+1,k+2)
function Q_of(X: i32, k: i32) -> i64 {
let n1: i32 = X + k + 1
let c1: i64 = nCk(n1, k + 1)
let c2: i64 = nCk(n1, k + 2)
let mut val: i64 = (X as i64) * c1 - ((k + 1) as i64) * c2
val = val % MOD
if val < 0 { val = val + MOD }
return val
}
# Build single-suit Grundy distribution, padded to length L
function build_single_suit(a: ptr<i64>, n: i32, L: i32) -> void {
memset(a, 0, (L as i64) * 8)
if n <= 0 { return }
if n == 1 {
a[0] = 2
return
}
build_factorials(n)
let pow2_n2: i64 = mod_pow(2, (n - 2) as i64)
let a0: i64 = (pow2_n2 + 2) % MOD
let a1: i64 = (pow2_n2 + (n - 2) as i64) % MOD
a[0] = a0
if n > 1 { a[1] = a1 }
if n > 2 {
let pow2_n3: i64 = mod_pow(2, (n - 3) as i64)
a[2] = (pow2_n3 + (n - 3) as i64) % MOD
}
let inv4: i64 = mod_pow(4, MOD - 2)
# Odd Grundy values: g = 2k+3, starting at (X0=n-4, k=0)
let X0a: i32 = n - 4
if 3 < n && X0a >= 0 {
let mut k: i32 = 0
let mut X: i32 = X0a
let mut F: i64 = (mod_pow(2, (X + 1) as i64) + MOD - 1) % MOD
while true {
let g: i32 = 2 * k + 3
if g >= n || X < 0 { break }
a[g] = (F + Q_of(X, k)) % MOD
if X < 2 { break }
let c_xk_1: i64 = nCk(X + k - 1, k)
let c_xk: i64 = nCk(X + k, k)
let mut tmp: i64 = F - 2 * c_xk_1 - c_xk
tmp = tmp % MOD
if tmp < 0 { tmp = tmp + MOD }
tmp = tmp * inv4 % MOD
let c_next: i64 = nCk(X + k - 1, k + 1)
F = (2 * tmp - c_next) % MOD
if F < 0 { F = F + MOD }
k = k + 1
X = X - 2
}
}
# Even Grundy values: g = 2k+4, starting at (X0=n-5, k=0)
let X0b: i32 = n - 5
if 4 < n && X0b >= 0 {
let mut k: i32 = 0
let mut X: i32 = X0b
let mut F: i64 = (mod_pow(2, (X + 1) as i64) + MOD - 1) % MOD
while true {
let g: i32 = 2 * k + 4
if g >= n || X < 0 { break }
a[g] = (F + Q_of(X, k)) % MOD
if X < 2 { break }
let c_xk_1: i64 = nCk(X + k - 1, k)
let c_xk: i64 = nCk(X + k, k)
let mut tmp: i64 = F - 2 * c_xk_1 - c_xk
tmp = tmp % MOD
if tmp < 0 { tmp = tmp + MOD }
tmp = tmp * inv4 % MOD
let c_next: i64 = nCk(X + k - 1, k + 1)
F = (2 * tmp - c_next) % MOD
if F < 0 { F = F + MOD }
k = k + 1
X = X - 2
}
}
}
function main() -> i32 {
let n: i32 = 10000000
let s: i32 = 10000000
if n == 0 {
printf("1\n")
return 0
}
# L = next power of 2 >= n
let mut L: i32 = 1
while L < n {
L = L << 1
}
let f: ptr<i64> = calloc(L as i64, 8)
build_single_suit(f, n, L)
# Free factorials to save memory
free(fact)
free(inv_fact)
fwht_xor(f, L)
# Pointwise exponentiation and sum
let mut total: i64 = 0
let mut i: i32 = 0
while i < L {
total = total + mod_pow(f[i], s as i64)
if i % 8192 == 0 {
total = total % MOD
}
i = i + 1
}
total = total % MOD
let inv_L: i64 = mod_pow(L as i64, MOD - 2)
let result: i64 = total * inv_L % MOD
free(f)
printf("%lld\n", result)
return 0
}
Generated C
#include <stdint.h>
#include <stdbool.h>
#include <stdio.h>
#include <stdlib.h>
#include <string.h>
/* Flow runtime helpers */
typedef struct flow_temp_node { struct flow_temp_node* next; } flow_temp_node;
static flow_temp_node* flow_temp_head = NULL;
static int flow_temp_atexit_set = 0;
__attribute__((unused)) static void flow_temp_free_all(void) {
while (flow_temp_head) {
flow_temp_node* n = flow_temp_head;
flow_temp_head = n->next;
free(n);
}
}
__attribute__((unused)) static void* flow_temp_alloc(size_t nbytes) {
flow_temp_node* node = (flow_temp_node*)malloc(sizeof(flow_temp_node) + nbytes);
if (!node) return NULL;
node->next = flow_temp_head;
flow_temp_head = node;
if (!flow_temp_atexit_set) {
flow_temp_atexit_set = 1;
atexit(flow_temp_free_all);
}
return (void*)(node + 1);
}
#ifndef FLOW_DIAG
#define FLOW_DIAG(msg) fprintf(stderr, "%s", (msg))
#endif
#ifndef FLOW_LOG
#define FLOW_LOG(fmt, ...) printf(fmt, __VA_ARGS__)
#endif
#ifndef FLOW_LOG_EMPTY
#define FLOW_LOG_EMPTY(fmt) printf(fmt)
#endif
static char* flow_strcat(const char* a, const char* b) {
size_t la = strlen(a ? a : ""), lb = strlen(b ? b : "");
char* r = (char*)flow_temp_alloc(la + lb + 1);
if (!r) return NULL;
if (la) memcpy(r, a, la);
if (lb) memcpy(r + la, b, lb);
r[la + lb] = '\0';
return r;
}
#define __flow_in_arr(arr, val) __extension__ ({ \
int _found = 0; \
size_t _n = sizeof(arr)/sizeof((arr)[0]); \
for (size_t _i = 0; _i < _n; _i++) { \
if ((arr)[_i] == (val)) { _found = 1; break; } \
} _found; })
/* Unified fault handler (MISRA #279) — override with -DFLOW_FAULT_HANDLER=fn */
#ifndef FLOW_FAULT_HANDLER
__attribute__((unused)) static inline void flow_fault_handler(const char* msg) {
fprintf(stderr, "flow: %s\n", msg ? msg : "fault");
abort();
#if defined(__GNUC__) || defined(__clang__)
__builtin_unreachable();
#endif
}
#else
#define flow_fault_handler FLOW_FAULT_HANDLER
#endif
#define flow_div_by_zero_handler() flow_fault_handler("division by zero")
#define flow_shift_ub_handler() flow_fault_handler("invalid shift (amount out of range or left-shift of negative)")
#ifndef FLOW_CHECKED_DIV
#define FLOW_CHECKED_DIV(L, R) (((R) != 0) ? ((L) / (R)) : (flow_div_by_zero_handler(), (L) * 0))
#endif
#ifndef FLOW_CHECKED_MOD
#define FLOW_CHECKED_MOD(L, R) (((R) != 0) ? ((L) % (R)) : (flow_div_by_zero_handler(), (L) * 0))
#endif
#ifndef FLOW_CHECKED_SHL
#define FLOW_CHECKED_SHL(L, R) ((((R) >= 0) && ((unsigned long long)(R) < (sizeof(L) * 8ull)) && ((L) >= 0)) ? ((L) << (R)) : (flow_shift_ub_handler(), (L) * 0))
#endif
#ifndef FLOW_CHECKED_SHR
#define FLOW_CHECKED_SHR(L, R) ((((R) >= 0) && ((unsigned long long)(R) < (sizeof(L) * 8ull))) ? ((L) >> (R)) : (flow_shift_ub_handler(), (L) * 0))
#endif
#include <math.h>
void* _ui_state = NULL;
static inline float i32_to_f32(int32_t v) { return (float)v; }
/* Host stub for @gpu kernels (device codegen replaces this). */
static inline int32_t gpu_thread_id(void) { return 0; }
int64_t mod_pow_i64_i64(int64_t a, int64_t e);
void build_factorials_i32(int32_t N);
int64_t nCk_i32_i32(int32_t n, int32_t k);
void fwht_xor_ptr_i64_i32(int64_t* a, int32_t n);
int64_t Q_of_i32_i32(int32_t X, int32_t k);
void build_single_suit_ptr_i64_i32_i32(int64_t* a, int32_t n, int32_t L);
int32_t main(void);
static const int64_t MOD = 1000000007;
/* Module statics */
static int64_t* fact = NULL;
static int64_t* inv_fact = NULL;
int64_t mod_pow_i64_i64(int64_t a, int64_t e) {
int64_t r = 1;
int64_t b = FLOW_CHECKED_MOD((a), (MOD));
if (b < 0) {
b = (b + MOD);
}
int64_t exp = e;
while (exp > 0) {
if (FLOW_CHECKED_MOD((exp), (2)) == 1) {
r = FLOW_CHECKED_MOD(((r * b)), (MOD));
}
b = FLOW_CHECKED_MOD(((b * b)), (MOD));
exp = FLOW_CHECKED_DIV((exp), (2));
}
return r;
}
void build_factorials_i32(int32_t N) {
fact = calloc(((int64_t)((N + 1))), 8);
inv_fact = calloc(((int64_t)((N + 1))), 8);
fact[0] = 1;
fact[1] = 1;
int32_t i = 2;
while (i <= N) {
fact[i] = FLOW_CHECKED_MOD(((fact[(i - 1)] * ((int64_t)(i)))), (MOD));
i = (i + 1);
}
inv_fact[N] = mod_pow_i64_i64(fact[N], (MOD - 2));
i = N;
while (i >= 1) {
inv_fact[(i - 1)] = FLOW_CHECKED_MOD(((inv_fact[i] * ((int64_t)(i)))), (MOD));
i = (i - 1);
}
}
int64_t nCk_i32_i32(int32_t n, int32_t k) {
if ((k < 0 || k > n)) {
return 0;
}
return FLOW_CHECKED_MOD(((FLOW_CHECKED_MOD(((fact[n] * inv_fact[k])), (MOD)) * inv_fact[(n - k)])), (MOD));
}
void fwht_xor_ptr_i64_i32(int64_t* a, int32_t n) {
int32_t h = 1;
while (h < n) {
int32_t step = FLOW_CHECKED_SHL((h), (1));
int32_t i = 0;
while (i < n) {
int32_t j = i;
while (j < (i + h)) {
int64_t x = a[j];
int64_t y = a[(j + h)];
int64_t u = (x + y);
if (u >= MOD) {
u = (u - MOD);
}
int64_t v = 0;
if (x >= y) {
v = (x - y);
} else {
v = ((x + MOD) - y);
}
a[j] = u;
a[(j + h)] = v;
j = (j + 1);
}
i = (i + step);
}
h = step;
}
}
int64_t Q_of_i32_i32(int32_t X, int32_t k) {
int32_t n1 = ((X + k) + 1);
int64_t c1 = nCk_i32_i32(n1, (k + 1));
int64_t c2 = nCk_i32_i32(n1, (k + 2));
int64_t val = ((((int64_t)(X)) * c1) - (((int64_t)((k + 1))) * c2));
val = FLOW_CHECKED_MOD((val), (MOD));
if (val < 0) {
val = (val + MOD);
}
return val;
}
void build_single_suit_ptr_i64_i32_i32(int64_t* a, int32_t n, int32_t L) {
memset(a, 0, (((int64_t)(L)) * 8));
if (n <= 0) {
return;
}
if (n == 1) {
a[0] = 2;
return;
}
build_factorials_i32(n);
int64_t pow2_n2 = mod_pow_i64_i64(2, ((int64_t)((n - 2))));
int64_t a0 = FLOW_CHECKED_MOD(((pow2_n2 + 2)), (MOD));
int64_t a1 = FLOW_CHECKED_MOD(((pow2_n2 + ((int64_t)((n - 2))))), (MOD));
a[0] = a0;
if (n > 1) {
a[1] = a1;
}
if (n > 2) {
int64_t pow2_n3 = mod_pow_i64_i64(2, ((int64_t)((n - 3))));
a[2] = FLOW_CHECKED_MOD(((pow2_n3 + ((int64_t)((n - 3))))), (MOD));
}
int64_t inv4 = mod_pow_i64_i64(4, (MOD - 2));
int32_t X0a = (n - 4);
if ((3 < n && X0a >= 0)) {
int32_t k = 0;
int32_t X = X0a;
int64_t F = FLOW_CHECKED_MOD((((mod_pow_i64_i64(2, ((int64_t)((X + 1)))) + MOD) - 1)), (MOD));
while (1) {
int32_t g = ((2 * k) + 3);
if ((g >= n || X < 0)) {
break;
}
a[g] = FLOW_CHECKED_MOD(((F + Q_of_i32_i32(X, k))), (MOD));
if (X < 2) {
break;
}
int64_t c_xk_1 = nCk_i32_i32(((X + k) - 1), k);
int64_t c_xk = nCk_i32_i32((X + k), k);
int64_t tmp = ((F - (2 * c_xk_1)) - c_xk);
tmp = FLOW_CHECKED_MOD((tmp), (MOD));
if (tmp < 0) {
tmp = (tmp + MOD);
}
tmp = FLOW_CHECKED_MOD(((tmp * inv4)), (MOD));
int64_t c_next = nCk_i32_i32(((X + k) - 1), (k + 1));
F = FLOW_CHECKED_MOD((((2 * tmp) - c_next)), (MOD));
if (F < 0) {
F = (F + MOD);
}
k = (k + 1);
X = (X - 2);
}
}
int32_t X0b = (n - 5);
if ((4 < n && X0b >= 0)) {
int32_t k = 0;
int32_t X = X0b;
int64_t F = FLOW_CHECKED_MOD((((mod_pow_i64_i64(2, ((int64_t)((X + 1)))) + MOD) - 1)), (MOD));
while (1) {
int32_t g = ((2 * k) + 4);
if ((g >= n || X < 0)) {
break;
}
a[g] = FLOW_CHECKED_MOD(((F + Q_of_i32_i32(X, k))), (MOD));
if (X < 2) {
break;
}
int64_t c_xk_1 = nCk_i32_i32(((X + k) - 1), k);
int64_t c_xk = nCk_i32_i32((X + k), k);
int64_t tmp = ((F - (2 * c_xk_1)) - c_xk);
tmp = FLOW_CHECKED_MOD((tmp), (MOD));
if (tmp < 0) {
tmp = (tmp + MOD);
}
tmp = FLOW_CHECKED_MOD(((tmp * inv4)), (MOD));
int64_t c_next = nCk_i32_i32(((X + k) - 1), (k + 1));
F = FLOW_CHECKED_MOD((((2 * tmp) - c_next)), (MOD));
if (F < 0) {
F = (F + MOD);
}
k = (k + 1);
X = (X - 2);
}
}
}
int32_t main(void) {
int32_t n = 10000000;
int32_t s = 10000000;
if (n == 0) {
printf("1\n");
return 0;
}
int32_t L = 1;
while (L < n) {
L = FLOW_CHECKED_SHL((L), (1));
}
int64_t* f = (int64_t*)(calloc(((int64_t)(L)), 8));
build_single_suit_ptr_i64_i32_i32(f, n, L);
free(fact);
free(inv_fact);
fwht_xor_ptr_i64_i32(f, L);
int64_t total = 0;
int32_t i = 0;
while (i < L) {
total = (total + mod_pow_i64_i64(f[i], ((int64_t)(s))));
if (FLOW_CHECKED_MOD((i), (8192)) == 0) {
total = FLOW_CHECKED_MOD((total), (MOD));
}
i = (i + 1);
}
total = FLOW_CHECKED_MOD((total), (MOD));
int64_t inv_L = mod_pow_i64_i64(((int64_t)(L)), (MOD - 2));
int64_t result = FLOW_CHECKED_MOD(((total * inv_L)), (MOD));
free(f);
printf("%lld\n", result);
return 0;
}