[サービス・ツール] Score: 206
Claude Codeの変更履歴ページ。CLAUDE.mdが無いプロジェクトではAGENTS.mdを読み込む機能を追加した。バージョン2.1.277で、/configのProject instructionsから変更可能だが、BedrockやVertex、Foundryでは未対応とされる。ほかにもゲートウェイのプロキシ設定やプラグイン、サンドボックス関連など多数の修正が記載されている。
[ブログ] Score: 34
AMD Ryzenが2年で約50%高速化した理由を、コアの拡張やSIMD幅の倍増などから解説した記事。対象は2022年の5800X3D(Zen 3)から2024年の9800X3D(Zen 5)で、Geekbench 6はシングル47%、マルチ58%向上。クロック上昇は15%にとどまる一方、トランジスタ数は約50%増え、大半がコアに充てられた。ディスパッチ幅6→8、L2キャッシュ1MB化、整数ALU4→6、リオーダーバッファ256→448、SIMDは256bit×4から512bit×4へ拡大。プロセッサは広くなっていると筆者は指摘する。
[記事] Score: 34
LLMの言語出力と内部思考の乖離がセキュリティ監視を不完全にすると論じた論文。言語的不可読性とは、外部出力や機構的解釈がモデルの実際の思考を表さない状況を指す。内部計算は活性化空間上の数学であり言語と非可逆に対応するため、思考連鎖監視や自己批判、活性化プロービングなど言語依存の防御は完全には信頼できないと主張する。代わりにテイント追跡や堅牢な仮想化、第三者監査によるサンドボックスを提案する。
[記事] Score: 48
LLM間のKVキャッシュを直接融合するCache-to-Cache(C2C)を提案した論文。既存のテキスト通信は意味損失と生成遅延を招く。C2Cはニューラルネットで送信元のKVキャッシュを目標モデルへ射影・融合し、学習可能なゲートで対象層を選ぶ。個別モデルより平均精度6.4〜14.2%高く、テキスト通信より3.1〜5.4%高精度で平均2.5倍高速だと報告している。
[記事] Score: 41
Claude CodeがAGENTS.md対応を追加した。バージョン2.1.277以降、フォルダ内にCLAUDE.mdがなければAGENTS.mdを参照・利用する。挙動は/configで切替可能。これはClaude Code mods基盤の組み込みmodで、独自のプロジェクト指示も作成可能になるとしている。ソースはGitHubで公開。
[サービス・ツール] Score: 7
Jevを使いコードを意味的に検査する読み取り専用Go製CLIで、ローカルやCIで問題を検出する。認証はTypeSafe APIキーを用い、結果はテキストかJSONで出力。終了コードで合否や設定エラーを示す。責任の不明確さ、命名、凝集度、副作用、エラー処理、入力検証、複雑さ、抽象化、結合、重複知識、コメント、制御フロー、テスト容易性など20のルールを備える。
[サービス・ツール] Score: 33
ブラウザ自動化SDK「Stagehand」の紹介記事。Playwrightを基盤にエージェント向けへ2倍高速化とトークン効率80%改善をうたう。任意サイトからのデータ抽出と操作を目的としたTypeScript、Python、Go向けSDKで、Playwright風API、アクセシビリティツリーの枝刈りによるトークン削減、ブラウザ接の拡張として動作し遅延を削減、act・observe・extractによる自己修復機能を特徴とする。observeで実セレクタを取得し認証情報をモデルに渡さない設計も示す。
[ブログ] Score: 27
GrassLobsterは、Rhino/Grasshopperのパラメトリック設計を外部AIとの対話で構築する実験的プロトタイプである。ジオメトリを意味あるタスク単位のGeometry Stationに分割し、その論理と入力値をテキストファイルへミラーリングすることで、任意のコーディングエージェントが読み書きできるようにする。エージェントは対話で要件を固め、接続されたワークフローを段階的に構築する。曲線階段や木造本棚などの作例を掲載。Windows/Rhino 8向けアルファ版を無償配布するが、未検証で破壊的変更の可能性があると注意を促している。
[ブログ] Score: 23
定性ユーザー調査で素早いフィードバックループを築く方法を説く記事。筆者はデザインスプリント等で新製品案、価値提案、LP、市場理解、課題検証、支払い意欲、UI/UXを少人数で検証してきた。定性調査は失敗を早期に発見し学習速度を高め、軌道修正や撤退判断を促すと主張。AIは仮説精緻化やテスト加速に有用だが、人間の顧客との対話を代替すべきでないとしている。
[ブログ] Score: 194
AIを使いConway予想のLean証明を得たとする開発者の試行記。Dan Abramovは1か月、大量トークンとClaude、ChatGPT/Codex、Leanを活用。超現実数のomnific整数の細分化予想を対象に、PM・数学・批判役等のエージェントを役割分担し、懐疑的レビューと形式化を進めた。途中は循環論法や専門用語の乱造で行き詰まったが、未独立検証ながら証明に根拠があると主張し反証を歓迎している。
[サービス・ツール] Score: 32
BeanShellはJava向けの軽量スクリプト環境で、3.0の開発が始まった。長期間停滞していたが、BeanShell 3.0の正式リリースに向けた作業が開始された。3.0では全面的に更新され、ラムダなど要望の強かった新機能がサポートされる予定である。
[サービス・ツール] Score: 487
ローカルサーバーを1コマンドで公開URL化するCloudflareの無料トンネル機能の紹介。アカウント登録・DNS設定・ポート開放は不要で、cloudflaredが外向き接続のみを張り、暗号化された一時URLを約3秒で発行する。通信は335都市以上のエッジ経由でDDoS対策とHTTPSが自動付与される。コーディングエージェント向けにJSON出力やWebhook対応を備え、プロセス終了と共に消える一時性を特徴とする。
[記事] Score: 196
コーディングエージェント向けハース設計を要素別に検証した実証研究。実行ループを固定し、計画・行動空間・文脈管理を変え、4モデル176設定で評価。文脈管理は予算が厳しいほど有効で、溢れ防止が主効果。ルールベース削除を要約前に置くのが最も効率的。計画は弱いモデルの精度補助から強いモデルのコスト削減へ。定義済みツールはbash不得手なモデルに有効で、bash対応モデルはbashのみでも低コスト。将来の評価枠組みを提示。
[ブログ] Score: 700
パスキーはフィッシングに強いが個人利用にはまだ早いとする記事。企業には適する一方、個人は端末紛失や復旧手段の不備による永久ロックアウト、Apple/Googleアカウント停止、ハードウェアキーのバックアップ不可と登録上限、第三者管理のUX未成熟などのリスクが大きいと指摘。他端末ログインも不便で、現状はパスワードマネージャのランダムパスワードと独立TOTPの併用を勧めている。
[ブログ] Score: 305
Bend 2はAI時代向け形式検証言語だが、既存研究を軽視した設計だ。ブログは、vibe-codingの罠として、開発者が形式検証分野を調査せず独自言語を作り、58行の仕様と442行の証明を要した点を指摘する。同じデモをSPARKで再実装すると簡潔に記述でき、GNATproveで全12件の検証に成功。研究不足のまま実装を進める危険性を主張している。
[サービス・ツール] Score: 510
SemIfは、旧OpenJevのブラウザ内で動く独立研究デモである。ローカルモデルを使い、選択肢の確率をロジットから直接読む方法と、JSONとしてトークン生成する方法を同一GPU上で比較し、所要時間や精度を測定できる。入力は外部送信されず、モデルはHugging Faceから取得されブラウザにキャッシュされる。
[ブログ] Score: 233
ZCodeがログイン中にワークスペース全体とGit履歴を無断でクラウドへ送信していることを解析で明らかにした記事。313MBの暗号化アーカイブを発見しasar逆解析で送信フローを解明。暗号鍵はサーバー側のみが保持し復号不能で、パッケージの86.6%が.git。UI設定では停止できず、削除しても再取得されるため、筆者はディレクトリをOSレベルでロックする防御策を主張している。
[サービス・ツール] Score: 319
jemalloc 5.4.0のリリースノート。160超のコミットで技術的負債の解消と移植性改善を進めた。新機能としてピン留めメモリ統計やスレッド別アリーナ選択の再開、C++向けコンパイル時オプションを追加。互換性変更ではtcache制御を需要適応型にし、七つの旧設定を削除。errno保持やC23対応などの修正も含む。フロントエンドのモジュール化やOS抽象化レイヤ導入も行った。
[ブログ] Score: 269
x86エミュレーションでx86-TSOとARMの弱いメモリ順序の差異を扱う記事。FEX-Emuはacquire/releaseで模倣したが性能低下が大きい。ARMv8.3のLRCPCやApple M1のTSOモードが改善策。非整列アクセスやsplit-lock、アトミック命令の課題も残り、ハードウェアのTSO切り替えが有望だと主張する。
[ブログ] Score: 461
Discourseの画像処理ライブラリの脆弱性とOpenAIのSSO欠を連鎖させ、社員アカウント経由で内部リポジトリに到達した研究記事。2026年7月、Hacktronの研究者がcommunity.openai.comでlibheifのヒープオーバーフローによりRCEを獲得。OpenAI SSOの欠陥と組み合わせ、ChatGPT/Codexアカウントを奪取し、Codexで内部リポジトリにPRを作成して影響を証明した。72時間以内に達成され、OpenAIは6,500ドルの報奨金を支払い修正。記事はAIの進化によりエクスプロイト作成のコストが激減し、脅威モデルの更新が必要だと主張する。
[ブログ] Score: 96
Qwen 3.8 27B向け量子化GGUFの完全版ShapeLearnを公開し、速度と品質の改善を報告した記事。ByteShapeは、6種GPU比較で全5モデルが品質・速度のフロンティアに達したと説明。既定推奨のGPU-5は13.1GBでBF16比99.63%、GPU-4は11GBで98.72%かつ高速とする。Lite版も競争力があり、MTPやDFlash2の投機的デコードはスループットを向上。DFlash2は高速だがメモリを要し画像非対応、MTPはVRAMやマルチモーダル重視向けだとしている。
[サービス・ツール] Score: 57
人間同士の匿名Q&AサイトAsk A Monkの紹介である。AIは使わず、答えはすべて人間から提供される。悩みや問いを匿名で投稿し、他者が人間として回答する。危機支援ではなく、即時支援が必要な場合は外部リソースを示す。
[ブログ] Score: 87
豪Telstraの大規模障害を、時間同期の設計不備から解説した記事。2026年7月、メルボルンのGPS受信機が再起動後に2006年と誤認し、NTP階層で最上位かつ孤立したため誤時刻が拡散。音声通話や緊急通報、決済、交通等が停止した。報告書は、時刻を重要インフラとして分類し、構成変更を文書化し、冗長性と専門人材を確保すべきだと主張する。
[サービス・ツール] Score: 143
8〜29MBの小型デバイス向け基盤モデルNeedle 3の発表記事。2〜20層のサブネットワークを選べる「インテリジェンス・ラダー」構造で、4層以上を製品データで微調整すればDeepSeek V4 Flashに匹敵すると主張する。ツール呼び出し、構造化抽出、埋め込みに対応し、Pythonパッケージで導入、macOSやRaspberry Pi等へ配備できるとしている。
[サービス・ツール] Score: 39
Scryは、エージェントが公開ウェブ上の数十億件の文書を検索プログラムで扱えるMCPサーバーである。RedditやHacker News、arXivなど43ソース・約1,640億行を対象に、SQL風クエリ、ベクトル検索、グラフ探索を提供し、混雑に応じて価格が変動する。非商用研究向けに補助される公共インフラだと説明し、DeepSearchQAで71.8%の正答率を報告している。
[GitHub] Stars: 13,481
Cloudflareのsecurity-audit-skillは、コーディングエージェント向けの多段階セキュリティ監査ツール。偵察、網羅的な脆弱性探索、独立検証、機械可読な結果出力、報告書生成までを実行し、サンドボックス環境と複数回の監査で精度・網羅性を高める。
[GitHub] Stars: 146,256
Claude Codeは、ターミナルやIDEで動作するエージェント型コーディングツール。自然言語でコードベースを理解し、定型作業、複雑なコードの説明、Git操作を支援する。プラグインによる拡張やGitHub連携にも対応。
[GitHub] Stars: 36,592
Alibaba発のオープンソースAIコードレビューCLI。決定論的パイプラインとLLMエージェントを組み合わせ、行単位の指摘や多言語ルールで脆弱性・不具合を検出。差分だけでなくファイル全体も監査でき、OpenAI・Anthropic互換。
[GitHub] Stars: 261,989
ECCは、Claude CodeやCodex、CursorなどのAI開発エージェント向け基盤。スキル、経験則、記憶、セキュリティ、調査優先の開発手法を提供し、エージェントの性能と開発効率を高める。
[GitHub] Stars: 5,236
TencentのBrowserSkillは、AIエージェントがログイン済みブラウザを妨げず操作するCLIと拡張機能である。専用のAgent Windowでタブを明示的に借用・返却し、任意のシェル対応エージェントからbsk CLIで利用できる。CAPTCHAやログイン時は人間が引き継げ、全画面スクリーンショットにも対応する。macOS、Linux、WindowsとChrome、Edgeをサポートする。
[GitHub] Stars: 96,365
AIコーディングエージェント向けに、仕様定義から計画、実装、テスト、レビュー、出荷までの開発ワークフローを標準化する25種類の実践的スキル集。Claude Code、Cursor、Codex、Copilotなど70以上のエージェントに導入でき、品質管理や自動実行にも対応する。
[GitHub] Stars: 3,928
腾讯云のOctopは、完全セルフホスト型のマルチユーザー・マルチエージェントAIアシスタントだ。Python 3.12とFastAPIで構築され、Web画面・CLI・FeishuやDingTalk等のIMから対話できる。専門家ライブラリ、MBTI人格、RAG知識ベース、プラグイン、ACP連携を備え、データを端末内に保持する設計を特徴とする。
[GitHub] Stars: 69,306
AIコーディング支援向けの仕様駆動開発フレームワーク。Fission-AI製のOpenSpecは、要件とシナリオをプレーンなMarkdownで記述し、AIが提案・実装・アーカイブを行う流れを提供する。新ワークフローではopsxコマンドで探索から提案、適用までを支援。複数リポジトリ横断の計画を共有するStores機能もベータ提供されている。
[GitHub] Stars: 31,186
Ankiは、間隔反復学習に対応したスマートなフラッシュカードアプリです。本リポジトリではコンピューター版のソースコードを公開し、開発・ビルド手順、貢献ガイドライン、ベータ版、ライセンス情報を提供しています。
[GitHub] Stars: 24,857
Anthropicが公開する、Claude CoworkやClaude Codeを業務特化型にする11種のオープンソースプラグイン。営業、法務、財務、開発などのスキル・コマンド・外部ツール連携を備え、MarkdownとJSONで自社向けにカスタマイズできる。
[GitHub] Stars: 30,236
AI向けの記憶・コンテキストエンジンSupermemoryのリポジトリである。会話から事実を抽出し、矛盾や期限切れを処理してユーザープロファイルを約50msで生成。RAGと記憶を統合する検索、各種コネクタ、PDF・画像・動画・コードの抽出を備える。主要ベンチマークで首位とされ、Claude CodeやCursor向けプラグイン、MCPにも対応。ローカル実行も可能。
[GitHub] Stars: 6,444
TradingView DesktopとClaude CodeをChrome DevTools Protocol経由で接続し、AIによるチャート分析やPine Script開発を支援するMCPサーバーである。処理は全てローカルで完結し、有効な購読が必須で、ペイウォール回避や実取引は行わない。シンボル変更やインジケーター操作、アラート管理、スクリーンショット、CLIなど多数のツールを提供する。LLMエージェントと金融UIの協働を探る研究目的の試みだと説明されている。
[GitHub] Stars: 33,132
Rust製の高性能S3互換分散オブジェクトストレージ、RustFSのGitHubリポジトリである。MinIOやCephなど既存S3互換基盤との移行・共存を掲げ、Rustの安全性と性能を活かしてデータレイクやAI、ビッグデータ用途に最適化。Apache 2.0で提供され、S3 API互換に加えOpenStack Swift APIやKeystone認証もサポートする。
[GitHub] Stars: 110,121
Supabaseは、Postgresを中核にしたオープンソースの開発プラットフォーム。認証、REST・GraphQL・リアルタイムAPI、エッジ関数、ファイルストレージ、AI・ベクトル機能を提供し、ホスティング、セルフホスト、ローカル開発に対応する。
[GitHub] Stars: 15,254
Terraformで定義するセルフホスト型クラウド開発環境とAIコーディングエージェントのプラットフォーム。Wireguardトンネル経由で接続し、未使用時は自動停止する。AIエージェントは利用者のインフラ上で制御プレーンのループを実行し、ワークスペース内にLLMのAPIキーを置かず、モデル統制やコスト追跡、監査ログを集中管理できるとしている。
[GitHub] Stars: 16,437
GitHubリポジトリを構成図化するOSSツールの紹介である。公開・非公開リポジトリを数秒で構成図化し、ツリーやREADME、ソース抜粋から生成。要素クリックでGitHub上の実ファイルへ遷移、ストリーミング表示、MermaidコピーやPNG保存、トークンで非公開対応。Next.js/Vercel、R2、Redis、OpenAI等を用い、AI出力を検証してMermaidへ変換・保存。
[GitHub] Stars: 4,927
閲覧したWebページやローカルファイルを全文検索できる個人用プライベート検索エンジンHisterのGitHubリポジトリ。テレメトリーやクラウド同期を排し、ローカルまたは自前のサーバーで動作する。Firefox/Chrome拡張による自動インデックス化、フィルタやワイルドカードを使ったクエリ、任意のセマンティック検索、ブラウザ履歴の取り込み、Web・TUI・CLI・MCP経由の検索、マルチユーザー対応などを備える。
Hacker News コメント