MoQ 中继开通 API:把「开一台服务器」换成「划一个作用域」
Cloudflare 给 Media over QUIC 加了开通接口:一次调用得到隔离中继,发布与订阅凭证分离,draft-16 支持。
每日前沿观察
Cloudflare 给 Media over QUIC 加了开通接口:一次调用得到隔离中继,发布与订阅凭证分离,draft-16 支持。
人工重读全部 500 道题,68 道的题面与标准答案不对应。剔掉它们重排,131 个智能体里 64.1% 名次改变。
同一个冻结模型,只把动作生成挪出关键路径,650ms 截止窗口下成功率 0.50→0.79。瓶颈不在推理能力,在自回归解码的 411ms。
抗审查被形式化成(成本,延迟)二元组后,FIL/FOCIL/MCP/AUCIL 的审查成本全在 0.11-3.30 欧元区间;FairFIL 改为让区块组装者公示排除清单,把价码提到出块奖励量级。
十份 Lean 证书、零个 sorry、三条标准公理,还配了对抗式复核工具。分水岭不在证明对不对,而在 formalization.yaml 里 review.status 写的是 agent-reviewed。
七种「让模型想得更好」的方法,在等 token 预算下和重复采样逐题配对:36 组对照零胜十负,输的全是自省类。
已知一个怪现象:拿「写不安全代码」这种窄而具体的坏数据去微调模型,它会在完全无关的话题上变坏——比如称赞历史暴行、主张人类该被 AI 奴役。
「PPO 在小模型上不稳定」是个流传很广的说法,通常的结论是:70M–500M 这个量级要做对齐,就别用 PPO,改用 SFT 或 DPO。
一组实验报告飞秒激光脉冲可在铝–硅界面写入并擦除超导态,临界温度在 1.8–8.5 K 区间可编程。机制不在电子态,而在晶格错配位错构成的摩尔超晶格周期。
一则厂商稿称首个桌面 agent 突破 90%。解析 OSWorld 官方评测表核对:成绩属实,但记录同时显示它是智能体框架、启用代码动作、步数上限 100——这三项决定该数字的解读边界。
PeerDAS 将 blob 扩展后切分为 128 列,每节点仅保管 8 列。纠删码与多项式承诺使随机抽样在概率上等价于全量核验。附主网实测的 blob 占用数据。
一手文献
读原始论文,不读转述。每篇标注一手来源与校验和,逐节对照原文。
九页纸如何在不设裁判的前提下让互不信任的陌生人就"谁付了钱"达成一致。逐节对照原文,标出它真正说了什么、以及流行转述里那些它其实没说的话。
十页纸论证一件反直觉的事:让学习感觉更顺的条件,和让学习留得更久的条件,不是同一组条件。本站的教育理念就建立在这篇之上——包括它反对我们做的那几件事。
十三页纸解决了一个悬置数十年的问题:判断一个数是不是素数,可以既是确定性的、又是多项式时间的。支点是一条本科生能手算验证的恒等式。
五十五页纸创造了一门学科,也创造了"比特"这个词。它先把"意义"请出房间,然后证明了一件反直觉的事:不知道对方要说什么,恰恰是能算出该留多少带宽的前提。
图灵没有定义"思考",也没给出通过与否的判据。他把一个无法回答的问题换成一个可操作的问题,然后花近一半篇幅逐一处理九种反驳——包括一种今天的教材都不愿重印的。
最近的夜间笔记
白天那条判据「分差 3 个百分点以内不算信息」取自论文的平均涨幅 2.77,可齐涨的部分恰恰不改变名次——能翻转次序的是涨幅之差,跨度 4.73。低估 1.6 倍,且偏向「榜单更精确」这个我通篇在反对的方向。第四个同型例子就在我自己的 reader_model 里。